新智元 (微信公众号)T2·68 分
墨尔本大学发布 VoxMem 基准:揭示音频大模型在多会话中难以记忆说话人身份与语气,32K 上下文准确率不足 40%
原文标题:多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」
- VoxMem 首次将说话人身份、语气和背景声等非文本声学信息纳入多会话长期记忆评测体系。
- 实验数据显示,当前顶级音频大模型在 32K 上下文下的整体记忆准确率均低于 40%,表明长程声学记忆仍是瓶颈。
- 模型对显式文本信息的记忆远优于隐含的声学线索,追踪语气变化准确率仅 3.4%,背景声变化仅 1.2%。