字
字节笔记本
2026年9月12日
VoiceMem:给语音 agent 装上双脑记忆的开源基础设施
API中转
¥120
本文介绍 xzf-thu 开源的 VoiceMem(1.3 千 stars,Apache-2.0)——为语音 agent 打造的"通用记忆"基础设施。它给语音模型补上最后一块组件:一个「流式双脑」架构的记忆系统,让语音助手真正越用越懂你——记得你说的事实(理性),也记得你的情绪和人格(感性)。作者承诺永久全部开源。
项目简介
VoiceMem 是清华系团队 8 月密集开源的一套成果:记忆系统本体、配套模型系列(能直接读懂 VoiceMem 记忆的微调模型)、工具包,以及 40 万条规模的 ChatMem-400K 数据集,一周内全部放出。语音 agent 的记忆此前基本沿用文本 agent 方案,VoiceMem 是第一个为"声音"特性专门设计的:写入时跑 ASR、声纹、场景、情绪感知、Embedding 全链路抽取。
流式双脑架构
- 左脑(理性):直接管理事实信息,在 Top-3 检索限制下保持 Mem0 满载性能
- 右脑(感性):用长短期情绪归因管理"情商",含交叉节点,与左脑信息联合维护
- 低延迟:压缩信息、分层存储、流式查询(0–300ms 投机预取,人还没说完记忆已经查好了)
- 单轮查询仅约 300 token;架构全解耦,连底层记忆引擎都可替换
快速开始
bash
git clone https://github.com/xzf-thu/VoiceMem.git
cd VoiceMem
pip install voicemem # 含 ASR/声纹/场景/情绪/本地 embedding 全套
hf download zhifeixie/VoiceMem_Default_Models_Env --local-dir ./models离线记忆引擎三行上手:
python
from voicemem import VoiceMem
vm = VoiceMem(mode="normal", openai_key="api_xxx", top_k=5)
vm.warmup()
vm.ingest(audio="assets/input.wav") # "我是素食主义者,对坚果过敏。"
result = vm.search("我的饮食禁忌是什么?")也支持纯文本入库(leftbrain_only 模式)和流式接口(可视为持续处理音频的 VAD)。
适用场景
- 语音助手/陪伴类产品:需要长期记住用户偏好、情绪、人格的服务
- 老人陪护、儿童教育等高频语音交互场景
- 多模态 agent 研究者:双脑架构与 ChatMem-400K 数据集本身即是研究素材
注意事项
- v0.0.2 早期版本,接口可能变动
- 模型下载与 ASR/情绪组件有额外算力开销,嵌入式设备需评估
- 情绪与人格记忆涉及隐私,产品化时注意用户知情与数据边界
项目链接
- GitHub 仓库:https://github.com/xzf-thu/VoiceMem
- 数据集与模型:HuggingFace 搜索 VoiceMem / ChatMem-400K
分享: