声浪
让 AI 生成一段踩着音乐跳舞的视频,今天看起来已经不算难事。Sora 2、Veo 3 这些模型给出的画面光鲜、配乐悦耳,第一眼几乎挑不出毛病。可只要你把音量调大,盯着舞者的手脚看上十几秒,往往会冒出一种说不清的别扭:动作明明在动,却和鼓点…
随着大语言模型在文本、视觉等模态上的快速发展,“推理能力”已经成为衡量多模态模型智能水平的重要指标。通过 Chain-of-Thought(CoT)等技术,模型能够将复杂问题拆解为中间推理步骤,从而提升复杂任务上的表现。然而,相较于文本推理…
本期分享由国防科技大学、西安邮电大学、北京声学研究所联合编撰的英文学术专著 General Audio Signal Processing with Deep Learning,全书由 Springer 出版社正式出版。 本书以深度学习赋能…
来源丨小米公司 近日,国际语音通信协会(ISCA)正式公布 2026 年 ISCA Fellow 名单,Daniel Povey 凭借其在语音识别声学建模、序列训练创新方法、开源语音工具 Kaldi 以及对全球语音通信领域的深远贡献成功入选…
来源丨阿里语音AI 阿里团队的最新研究STAR-VAE已被机器学习顶级会议ICML 2026接收。这项工作聚焦音频生成中一个长期被忽视、却决定效果上限的底层环节——音频 VAE(连续 tokenizer),并提出了一种通用且即插即用的正则化…
近日,浙江大学团队提出的论文SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness被ACL 2026 Ma…
今天,和大家分享阿里语音交互模型 Fun-Realtime-AudioChat 的全面升级(现已更名为 Qwen-Audio-3.0-Realtime),为大家带来这套完备的实时语音交互对话方案。 亮点速看 1. 根据语境动态调整语气与情感…
