Today for AI
返回热点榜
llm热度 9.3°

AI 聚簇研判事件 · 2026/10/9

墨尔本大学发布 VoxMem 基准:揭示音频大模型在多会话中难以记忆说话人身份与语气,32K 上下文准确率不足 40%

1 篇报道存证1 家独立信源交叉印证持续跟踪至 2026/10/9 11:55:00
全景综述与最新动态
1 家信源交叉印证

墨尔本大学与新南威尔士大学联合推出多会话语音记忆基准 VoxMem,旨在解决现有评测忽略声学特征(如说话人、语气)及单段对话局限的问题。该基准包含约 177 小时语音数据,通过“声学证据×记忆操作”二维分类法覆盖 15 种组合。对 15 个主流音频大模型的测试显示,在 32K token 历史长度下无一整体准确率超过 40%,且追踪语气和背景声变化的平均准确率极低(分别为 3.4% 和 1.2%),凸显当前模型在非文本声学信息长期记忆上的严重短板。

最新动向/墨尔本大学与新南威尔士大学联合推出多会话语音记忆基准 VoxMem,旨在解决现有评测忽略声学特征(如说话人、语气)及单段对话局限的问题。该基准包含约 177 小时语音数据,通过“声学证据×记忆操作”二维分类法覆盖 15 种组合。对 15 个主流音频大模型的测试显示,在 32K token 历史长度下无一整体准确率超过 40%,且追踪语气和背景声变化的平均准确率极低(分别为 3.4% 和 1.2%),凸显当前模型在非文本声学信息长期记忆上的严重短板。

热度曲线逐小时热度走势

2 个完整观测小时
连续完整观测不足 3 个小时,暂不绘制趋势曲线。

TIMELINE报道时间线

共 1 篇 · 最新优先
  1. 新智元 (微信公众号)T2·68 分

    墨尔本大学发布 VoxMem 基准:揭示音频大模型在多会话中难以记忆说话人身份与语气,32K 上下文准确率不足 40%

    原文标题:多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」

    • VoxMem 首次将说话人身份、语气和背景声等非文本声学信息纳入多会话长期记忆评测体系。
    • 实验数据显示,当前顶级音频大模型在 32K 上下文下的整体记忆准确率均低于 40%,表明长程声学记忆仍是瓶颈。
    • 模型对显式文本信息的记忆远优于隐含的声学线索,追踪语气变化准确率仅 3.4%,背景声变化仅 1.2%。
墨尔本大学发布 VoxMem 基准:揭示音频大模型在多会话中难以记忆说话人身份与语气,32K 上下文准确率不足 40% | AI 聚簇事件研判 | Today for AI