墨尔本大学推出VoxMem基准:32K上下文下15个语音AI模型全员不及格

当语音AI被拉进一场横跨几十轮、持续数小时的真实对话,它能否准确判断「这句话是谁说的、用什么语气、背景里有什么声音」?墨尔本大学与新南威尔士大学联合团队认为现有评测根本回答不了这个问题,于是端出了专门戳这块软肋的基准VoxMem。

旧基准的两道硬伤

联合团队先点破了现有评测体系的两大问题:一是只盯着转写出来的文字内容,把声音里藏着的身份信息、情绪线索、环境声一股脑丢掉;二是没法把「历史有多长」这个变量单独剥离出来看——模型表现差,到底是记性差还是被长度拖垮的,谁也说不清。

二维分类法:只拧「长度」这一颗旋钮

VoxMem的打法是建一套「声学证据 × 记忆操作」的二维分类法,把考察维度正交拆开,覆盖15种组合。所有题目在8K到64K的不同历史长度下保持原样不动——等于只拧「对话长度」这一颗旋钮,其余全锁死,让记忆效果的变化能干净地归因到长度本身。这套基准个体量不小:共3196个评测实例、34743个语音会话,合计约177小时音频。

实测结果打脸:全员不及格

对15个主流音频大模型的实测结果相当打脸。在32K上下文长度下,所有模型的整体准确率均未越过40%。这一结果揭示了当前语音AI在长程对话追踪能力上的系统性短板。

相关阅读:ElevenLabs 3亿美元员工要约收购:220亿美元估值,语音AI年营收破5亿美元