近期,厦门大学、联合浙江大学、香港中文大学(深圳)的研究员发表了一篇题为“WavBench: Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End Spoken Dialogue Models”的论文 。该论文推出了首个针对端到端语音对话模型的综合基准测试—WavBench。它不仅打破了以往仅关注文本生成标准、忽视口语化表达特性,或仅考虑单一副语言属性的局限,还建立了一个涵盖认知复杂性、口语表达和副语言保真度的三元评估框架。WavBench通过对7大认知域与10项副语言维度的全方位测试,有效填补了当前模型在“高智商”推理与“高情商”交互之间的评估空白 ,为评估端到端语音对话模型在真实世界场景下综合表现提供了全新的“尺子” 。

论文:WavBench:Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End Spoken Dialogue Models
项目主页:https://naruto-2024.github.io/wavbench.github.io/
论文地址:https://arxiv.org/abs/2602.12135
Github地址:https://github.com/NARUTO-2024/WavBench
HuggingFace地址:https://huggingface.co/datasets/WavBench/WavBench
⏩背景动机:超越文本生成标准,填补复杂推理与真实口语交互的评估空白
随着语音对话模型从级联架构向推理增强的端到端系统演进,现有的评估基准已无法满足真实交互的需求。为了直观展示现有评估体系的缺失,我们在表1中详细对比了WavBench与SUPERB、AIR-Bench、SD-Eval、BigBench Audio等主流基准。对比维度涵盖了口语语言(SL)、对话任务(Dlg.)、端到端适用性(E2E)以及细粒度的说话人信息(Spk.)、声学特征(Acou.)、背景音(Bg.)、推理能力(Reas.)和 口语化表达(Coll.)。

表1WavBench与现有基准在适用类型和评估维度上的对比
这一对比结果直观地揭示了WavBench填补了口语表达(Colloquial Expression)和推理能力(Reasoning)的评估空白,同时也指出了当前技术和评测在以下几个方面存在显著的局限性 :
缺乏对高阶推理的音频化评估:现有的推理基准(如BigBench Audio)仅将语音视为逻辑传输的媒介,未能评估模型是否能在处理复杂逻辑(如数学推理、代码解释)时,通过口语化表达降低用户的认知负荷。这导致了“高智商”模型在语音输出时往往显得生硬难懂 。
忽视“口语化”的独特需求:现有的基准(如SUPERB, AIR-Bench)主要遵循文本生成标准,关注内容准确性,却忽略了语音交互中至关重要的口语标准(如词汇适宜性、语言自然度)。模型往往只是在“读”出文本,而非像人类一样进行自然的口语交流 。
副语言交互能力的评估缺失:真实的语音交流包含丰富的情感、语调和背景音。现有的评估(如SD-Eval)多局限于对输入的理解,或仅关注显式的风格控制,缺乏对隐式对话中副语言感知与生成能力的综合考量。
基于这些挑战,我们提出了WavBench。这是首个专为端到端语音对话模型量身定制的高难度基准,包含17,577条数据,总时长达76.5小时。它旨在严格测试模型在复杂问题解决、口语化传递以及副语言保真度方面的综合能力 。
⏩实现细节:WavBench的三元评估框架设计
1.口语表达能力:从复杂推理到日常闲聊
口语表达能力旨在评估模型在代码(Code)、创意写作(Creative Writing)、指令遵循(Instruction Following)、逻辑推理(Logic)、数学(Math)、通用问答(Common QA)和安全(Safety)这七大认知域中的“口语友好度” 。为了直观展示这些领域的口语化标准,我们在图1中提供了具体的案例研究。

该维度的评估分为两个层级:
Pro Subset(专业子集):专为应对推理模型浪潮而设计。它引入了高认知负荷的场景,包括多步数学推理、复杂代码逻辑和严格的指令遵循。例如,在解释数学证明时,高质量的回答不应只是机械地念出公式,而应使用口语标记和结构化的节奏来引导听众,从而降低认知负荷并简化复杂逻辑。
Basic Subset(基础子集):关注日常任务中的会话参与度,旨在区分真正的口语交互与僵硬的文本朗读。它建立了一套严格的口语化标准,要求模型具备以下能力:词汇适宜性:使用日常词汇和话语标记,而非书面语;语言自然度:采用短小灵活的句子结构,并包含典型的口语省略或倒装;互动融洽感:通过反问、确认和建议来引导对话,创造出与体贴的伙伴聊天的体验。
2.声学交互能力:显式指令与隐式对话
该维度建立了一个针对真实世界场景的副语言评估体系,涵盖了10个核心维度,具体包括说话人信息(年龄、性别、口音、语言)、声学特征(音高、语速、音量、情感)以及背景声音(环境音、音乐)。为了全方位评估模型能力,我们采用了显式(Explicit)与隐式(Implicit)双重视角 :

图2WavBench声学交互示例
Explicit(显式指令):评估模型对明确声学指令的执行能力,进一步细分为理解与生成两个维度:Explicit Understanding(显式理解):模型需准确识别语音输入中的关键副语言风格。例如,用户询问“你能听出我的情感吗?(Can You Perceive My Emotions?)”,直接测试模型对输入声学特征的感知精度;Explicit Generation(显式生成):模型需生成严格遵循显式指令的语音响应。例如,用户指令“请用愉快的语气回答(Please Respond in a Cheerful Tone)”,测试模型对特定声学属性的主动控制能力 。
Implicit(隐式对话):模拟真实自然的对话流,剔除了任何关于声学条件的词汇提示,要求模型联合评估理解与生成能力。模型需要根据对话上下文自主推断隐含的副语言信息,并生成内容准确且风格匹配的语音响应。除了单轮推断外,我们特别引入了多轮对话测试,引入随时间变化的声学条件。这旨在严格考验模型在长对话中保持副语言风格一致性(Consistency)以及适应复杂交互场景的能力,揭示模型是否具备真正的“高情商”
3.数据规模与多样性:WavBench 的全景透视
为了确保评测的广度与深度,WavBench 构建了一个规模庞大且分布精细的数据集。如图3和图4所示,我们分别对口语表达和声学交互两个核心集合进行了严格的统计分析,展现了其在认知域覆盖和副语言维度上的丰富性。
口语表达集合:从日常闲聊到极限推理
该集合汇聚了来自15 个开源数据集的高质量样本,覆盖 7 大认知领域,并被精心划分为 Basic 和 Pro 两个层级,以适应不同难度的评估需求。Basic(基础子集):旨在评估日常、中低复杂度的交互,重点考察模型在OpenBookQA (25%)、WildSpeech (23%)和AlpacaEval (18%)等任务中的会话参与度和听感友好度;Pro(专业子集):专注于高认知负荷场景,由BBEH (35%)、MMLU (25%)和Arena-Hard (15%)等高难度数据集主导。这部分数据被专门设计用来“压力测试”模型在保持口语化表达的同时,简化复杂推理逻辑的能力 。

声学交互集合:全维度的副语言覆盖
声学交互集合涵盖了10 个关键的副语言维度。如图4所示,我们确保了数据在不同属性、指令类型和对话轮次上的多样性分布。属性分布:数据广泛覆盖了说话人信息(年龄、性别、口音、语言)、声学特征(音高、语速、音量、情感占比最高达37%)以及背景声音(环境音、音乐)。其中,情感数据的最大比重体现了我们对模型情感交互能力的高度重视;指令类型:显式指令(Explicit, 74%)与隐式对话(Implicit, 26%)的配比,既考察了模型的指令遵循能力,也测试了其在无提示下的自主推断能力;多轮交互:为了模拟真实的长时间交流,多轮对话(Multi-turn)占比高达 75%,且大多数样本时长分布在4-25 秒之间。这要求模型必须在随时间变化的声学条件下,保持上下文的一致性和连贯性。

图4WavBench声学交互集合的属性、轮次及指令分布统计
⏩实验验证:现有SOTA模型的“认知-声学”鸿沟
我们使用WavBench对5个最先进的端到端语音对话模型(包括 GPT-4o Audio, Qwen3-Omni, Step-Audio-2-mini, Kimi-Audio, Mimo-Audio)进行了全面评估。表2实验结果揭示了当前领域存在的关键问题。图5直观展示了这些模型在口语表达、显式指令理解/生成以及隐式对话维度的整体性能对比 。

图5WavBench 总体评估结果
为了提供更细粒度的分析,表2将评估结果划分为五个核心板块,全方位透视了模型能力:(A) 口语表达(Pro Subset)、(B) 口语表达(Basic Subset)、(C) 显式声学理解、(D) 显式声学生成以及(E) 隐式声学能力。这些详尽的实验数据不仅确立了各模型的性能基准,更深刻揭示了当前领域存在的关键问题:
推理能力的“滑铁卢”:Pro Subset 极具区分度
在Colloquial Expression Pro(专业子集)中,GPT-4o Audio以58.23 的平均分确立了显著的领先优势 。然而,开源模型表现出显著的性能断层:Qwen3-Omni 仅得 39.53 分,而 Step-Audio-2 更是滑落至 30.40 分 。这种差距在逻辑密集型领域尤为惊人:在Math任务中,Step-Audio-2 的得分暴跌至 22.40;在Logic任务中,Kimi-Audio 仅获 26.03 分 。这表明轻量级模型在面对符号推理时,往往退化为僵硬的机械背诵 。值得注意的是,即便是表现最强的 GPT-4o Audio,在 Logic 任务上的得分也降至 42.60 。这一现象深刻揭示了当前领域面临的“认知-声学对齐”鸿沟:现有模型普遍难以将复杂的思维链(Chain-of-Thought)转化为听感友好的口语解释,无法在维持高智商推理的同时兼顾高质量的表达 。
基础对话表现:智力与活泼的平衡
在Colloquial Expression Basic(基础子集)中,GPT-4o Audio展现了统治级的表现(68.80),特别是在Safety(81.00)和QA(75.60)方面,它成功将严谨的安全护栏与自然生动的口语表达完美融合。Qwen3-Omni紧随其后(55.80分),在创意写作和代码任务中表现均衡 。相比之下,轻量级模型虽然在开放式聊天中表现尚可,但在面对结构化任务时,容易丢失口语的灵活性:Step-Audio-2-mini在数学任务中得分跌至30.20,Mimo-Audio在指令遵循任务中仅得33.56。这种巨大的反差表明,轻量级模型在处理刚性逻辑约束或符号数学时,难以将其转化为“听众友好”的语音,往往退化为生硬的机械背诵。
声学交互:细粒度控制仍是挑战
在Explicit Understanding/Generation(显式理解与生成)方面,我们观察到显著的性能分化:理解(Understanding):Step-Audio-2-mini出人意料地取得了最高平均分(57.36%),特别是在音乐和语言识别上表现稳健。相比之下,GPT-4o Audio 虽然在情感识别上表现出色,但在年龄(Age)和口音(Accent)的细粒度分类上却明显表现不佳;生成(Generation):GPT-4o Audio以79.23%的平均准确率确立了新标杆,在性别、情感和年龄生成上遥遥领先。然而,开源模型如Kimi-Audio 和 Mimo-Audio 在口音和背景音频(Audio)生成上举步维艰;共同瓶颈:所有模型在背景音频生成(Background Audio)上的准确率均低于50%,这表明当前端到端模型在生成除纯语音之外的复杂声学环境方面,仍有巨大的提升空间。
隐式对话:多轮交互的“高智商、低情商”陷阱
在Implicit Dialogue(隐式对话)实验中,我们发现了一个极具启发性的现象:单轮对话:模型的音频得分普遍高于文本得分。例如,Step-Audio-2-mini 虽然文本得分垫底(1.12),但音频得分却高达3.50,表明模型能敏锐捕捉即时的副语言线索。多轮对话情况发生逆转。虽然随着上下文增加,模型的文本逻辑得分显著提升(例如Qwen3-Omni 升至4.88),但其音频得分却急剧下降至1.05-1.25区间。这一反差深刻揭示了当前模型的关键瓶颈:虽然音频上下文有助于维持语义连贯性,但在长对话中保持副语言风格的一致性却极难实现。这表明,现有的端到端模型尚未真正掌握在长时间交互中持续进行情感与风格及其一致性的建模能力。

表2端到端语音对话模型在WavBench 上的结果概览
⏩进一步探索
为了持续推动端到端语音对话社区的发展,我们将长期维护并迭代WavBench。我们计划在未来持续跟踪并测评更多涌现出的优秀开源与闭源模型,不断更新性能排行榜,以覆盖更广泛的技术路线。
⏩总结
WavBench是一个面向真实世界场景的综合性基准测试,它涵盖了从复杂的逻辑推理到细微的情感交互的广泛维度。我们的评估结果表明,尽管GPT-4o Audio 等模型已经取得了显著进展,但在“将复杂的逻辑转化为自然的口语”以及“在多轮对话中保持副语言一致性”方面,整个社区仍面临严峻挑战。WavBench 将作为衡量这些能力的重要标尺,推动更健壮、更具推理能力且听感自然的语音对话模型的发展 。
