ByteNoteByteNote
VoiceMem:给语音 agent 装上双脑记忆的开源基础设施

字节笔记本

2026年9月12日

VoiceMem:给语音 agent 装上双脑记忆的开源基础设施

API中转
¥120

本文介绍 xzf-thu 开源的 VoiceMem(1.3 千 stars,Apache-2.0)——为语音 agent 打造的"通用记忆"基础设施。它给语音模型补上最后一块组件:一个「流式双脑」架构的记忆系统,让语音助手真正越用越懂你——记得你说的事实(理性),也记得你的情绪和人格(感性)。作者承诺永久全部开源。

项目简介

VoiceMem 是清华系团队 8 月密集开源的一套成果:记忆系统本体、配套模型系列(能直接读懂 VoiceMem 记忆的微调模型)、工具包,以及 40 万条规模的 ChatMem-400K 数据集,一周内全部放出。语音 agent 的记忆此前基本沿用文本 agent 方案,VoiceMem 是第一个为"声音"特性专门设计的:写入时跑 ASR、声纹、场景、情绪感知、Embedding 全链路抽取。

流式双脑架构

  • 左脑(理性):直接管理事实信息,在 Top-3 检索限制下保持 Mem0 满载性能
  • 右脑(感性):用长短期情绪归因管理"情商",含交叉节点,与左脑信息联合维护
  • 低延迟:压缩信息、分层存储、流式查询(0–300ms 投机预取,人还没说完记忆已经查好了)
  • 单轮查询仅约 300 token;架构全解耦,连底层记忆引擎都可替换

快速开始

bash
git clone https://github.com/xzf-thu/VoiceMem.git
cd VoiceMem
pip install voicemem          # 含 ASR/声纹/场景/情绪/本地 embedding 全套
hf download zhifeixie/VoiceMem_Default_Models_Env --local-dir ./models

离线记忆引擎三行上手:

python
from voicemem import VoiceMem
vm = VoiceMem(mode="normal", openai_key="api_xxx", top_k=5)
vm.warmup()
vm.ingest(audio="assets/input.wav")        # "我是素食主义者,对坚果过敏。"
result = vm.search("我的饮食禁忌是什么?")

也支持纯文本入库(leftbrain_only 模式)和流式接口(可视为持续处理音频的 VAD)。

适用场景

  • 语音助手/陪伴类产品:需要长期记住用户偏好、情绪、人格的服务
  • 老人陪护、儿童教育等高频语音交互场景
  • 多模态 agent 研究者:双脑架构与 ChatMem-400K 数据集本身即是研究素材

注意事项

  • v0.0.2 早期版本,接口可能变动
  • 模型下载与 ASR/情绪组件有额外算力开销,嵌入式设备需评估
  • 情绪与人格记忆涉及隐私,产品化时注意用户知情与数据边界

项目链接

分享: