上海交通大学 X-LANCE 实验室与小米联合发布的 Dasheng AudioGen,不再独立建模语音、音乐、音效生成任务,而是让 AI 像“声音导演”一样理解真实世界音频中多种声音的复杂关系,并端到端生成自然、协调的混合音频场景。 在线…
声浪
来源丨清华大学自然语言处理与社会人文计算实验室 昨日,清华大学自然语言处理与社会人文计算实验室与面壁智能、OpenBMB 开源社区正式发布并开源最新一代端侧文本基座大模型——MiniCPM5-1B。 MiniCPM5-1B 再次刷新模型的智…
近年来,以Suno、Mureka、YuE、ACE-Step 等为代表的音乐生成模型迅速演进,其输入条件已经从单一的文本描述,扩展为文本、歌词与参考音频任意组合的多模态指令。然而,用来判断「单条生成结果到底好不好」的评测手段,却相对滞后:传统…
# 博士招生公告 ## 🎓 全额资助联合培养博士|AI × 语音 × 心理健康 **墨尔本大学(澳大利亚)× 伯明翰大学(英国)** --- ## 项目简介 墨尔本大学与伯明翰大学 联合招募 **全额资助博士研究生**一名,研究方向聚焦于…
它听得懂情绪、辨得出身份、甚至能模仿你说话——但你敢信任它吗? “你今天看起来有点累。”当你对手机说出这句话,它不仅能听懂字面意思,还能从你的语速、语调、呼吸节奏中判断——你是真的疲惫,还是在强撑?这不是科幻。这是大型音频语言模型正在实现的…
本期分享国防科技大学近期被IEEE Transactions on Audio, Speech and Language Processing接收的音频表示质量评估方面的工作。 Unifying Variables in Neural Sc…
录取信息:ICML 2026 论文标题:SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations 作者:Xiaoyu Yang, Yifan Y…
来源丨paperweekly 问题可能不在语言能力本身,而在那些更难被建模的东西:语气、情绪、停顿、潜台词,以及人与人交流时微妙的“社交感”。而最近,一篇来自南京大学与小米的论文,开始系统地评测这些副语言能力。 论文标题:SpeechPar…
