以下文章来源 微软亚洲研究院 微软亚洲研究院推出了一个面向文本生成音视频任务的多粒度、细粒度、任务驱动评测基准AVGen-近日,微软亚洲研究院推出了一个面向文本生成音视频任务的多粒度、细粒度、任务驱动评测基准AVGen-Bench。它关注的…
声浪
以下文章来源SV4Good Al Lab 大型音频语言模型(Large Audio–Language Models, LALMs)正在成为下一代语音交互、音频理解、实时对话系统的核心底座。然而最近的研究指出,音频输入比文本更容易诱发模型生成…
当前语音对话与听觉处理领域蓬勃发展,学术界与工业界不断涌现创新的技术与产品,为了更好地推动经验交流与前瞻研讨,由中国计算机学会(CCF)语音对话与听觉专委会发起的第三届CCF语音对话与听觉处理前沿进展研讨会(RASDAP2026,Recen…
近年来,大语言模型在复杂推理、代码生成以及智能体等方向不断突破,一个更接近真实世界的问题也逐渐浮出水面:模型是否真的能够从复杂上下文中学习? 现实中的许多任务,其关键知识并不存在于模型预训练记忆里,而是隐藏在冗长、专业且此前从未见过的专业文…
本期分享杭州电子科技大学和上海交通大学近期被IEEE Transactions on Audio, Speech and Language Processing接收的语音增强方面的工作,论文链接、代码链接见文末。 SelfSE:Self-S…
以下文章来源丨模型之声 标题:《WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Mod…
今天,阶跃正式发布新一代实时语音大模型StepAudio 2.5 Realtime! 我们希望创造更有“活人感”的 AI 聊天搭子:有温度、有灵魂、有态度。为此重点聚焦三大能力突破: 顶级副语言能力:实现真人级深度感知,精准听懂对话里的弦外…
来源|机器之心 AI 正在悄悄改变人与电脑的交互方式,而下一个被重塑的,可能就是每天发生几百次的「输入」这个动作。 语音输入并非新概念。从早期的 Siri、Google Assistant,到近几年 Whisper、Otter.ai 等工具…
