Interspeech2026 | MSU-Bench:多说话人对话理解评测基准
近年来,音频语言模型(Audio Language Model, ALMs)推动语音理解从传统单任务系统走向统一的音频到文本生成范式。在这一框架下,说话人验证、语音识别、说话人识别与时间戳标注等任务都可以被重新组织为可交互、可解释的生成式任…
17 0 0
近年来,音频语言模型(Audio Language Model, ALMs)推动语音理解从传统单任务系统走向统一的音频到文本生成范式。在这一框架下,说话人验证、语音识别、说话人识别与时间戳标注等任务都可以被重新组织为可交互、可解释的生成式任…