声学智能的前沿探索与青年力量

当语音技术不再只是“听清楚、说出来”,当声音开始与大模型、多模态智能、医疗健康、脑科学、低资源语言深度交叉,我们正在进入一个更加丰富的声学智能时代。

从低码率语音编解码、语音增强与合成,到音频推理、副语言表达与障碍语音识别;从音乐脑机接口、认知健康智能诊断,到多模态小语种语料建设与低资源语言技术——声音正在成为机器感知、理解、生成与交互的重要媒介。

NCMMSC 2026青年论坛(Young Researchers Forum)汇聚来自高校、科研院所与产业界的青年学者和技术专家,围绕语音、音频、音乐、语言智能、健康与认知等前沿交叉方向,分享最新研究进展、关键技术挑战与应用探索。论坛目前设置10个报告主题,覆盖从基础语音技术到多模态智能和交叉科学的广泛方向。


10场前沿报告,多维研究视角。

让我们提前认识本届青年论坛的报告嘉宾与研究主题!


01、艾杨-中国科学技术大学:低码率神经网络语音编解码方法研究

当码率降到250 bps,如何依然重建高质量语音?

神经网络语音编解码正在低码率语音压缩、实时通信和端侧语音存储中展现重要价值,但如何在极低码率下兼顾语音质量与传输效率,仍是一个关键挑战。

报告将从整体编解码框架设计与量化策略优化两个方面展开,介绍超低码率神经语音编解码器FMelCodec,以及面向流式通信的 VoCodec和面向残差向量量化的AKDQ,探索低码率、高质量语音重建的新路径。其中FMelCodec通过单码本离散编码、条件流匹配谱精炼和声码器重构,在250 bps条件下实现高质量语音重建。

嘉宾简介:艾杨,中国科学技术大学语音及语言信息处理国家工程研究中心副研究员,主要研究语音编码、语音增强、语音合成和音频质量评价等。已发表论文70余篇,其中第一作者/通讯作者论文近60篇;主持国家自然科学基金、安徽省自然科学基金等项目。2024年入选“小米青年学者”,获 Interspeech 2024 Discrete Speech Challenge 声码器赛道冠军等。


02、薛浏蒙-南京大学:面向自然人机交互的语音副语言能力评测:从指令跟随到非语言发声

机器已经越来越“会说话”,但它真的“会表达”了吗?

真实的人类交流从来不只是“把文字读出来”。音色、语气、情感、口音、说话风格,以及笑声、哭声、叹气、咳嗽、呼吸等非语言发声,都在传递文本之外的信息。

报告将介绍MINT-Bench如何从多语言指令跟随角度评估TTS模型对音色、情感、口音、场景化表达和组合控制等指令的响应能力,以及NVV-SuperBench如何构建中英双语45类非语言发声体系,并进一步讨论如何通过开放数据、统一任务和可复现协议,让机器语音的“表达能力”真正变得可比较、可评测。

嘉宾简介:薛浏蒙,南京大学智能科学与技术学院准聘助理教授,主要研究智能语音,语音、音乐与音频理解与生成,以及情感语音生成和交互等。博士毕业于西北工业大学,曾在京东AI Lab、腾讯AI Lab、微软开展研究,并先后在香港中文大学(深圳)、香港科技大学从事博士后研究;参与 Llasa、Spark-TTS、YuE、AudioX 等语音、音乐与音频生成大模型研究。


03、潘怡霖-大连海事大学:基于医患对话的老年认知健康智能诊断方法研究

一段自然对话,能否成为认知健康的“数字号”?

阿尔茨海默病等神经退行性疾病引发的早期认知衰退,会在患者自发言语中呈现特异性的语音与语言表征。

报告以老年认知健康自动化诊断为核心,围绕病理语音特征提取、语音与文本跨模态融合建模等问题,介绍基于患者自然话语的端到端智能诊断技术体系,探索语音信号处理与智慧医疗交叉的新可能。

嘉宾简介:潘怡霖,大连海事大学人工智能学院讲师、硕士生导师,同济大学老龄语言与看护中心兼职研究员,博士毕业于英国谢菲尔德大学。主要研究病理语音检测、多模态情感分析与智能语音对话等,在 INTERSPEECH、ICASSP、IEEE TASLP 等会议和期刊发表论文十余篇。


04、李楠-天津师范大学:融入听觉感知机理的语音增强方法研究

复杂噪声环境中,人耳为什么能捕捉目标语音?机器能否“像人一样听”?

报告从人类听觉系统感知和处理含噪语音的过程出发,介绍融入听觉编码、听觉掩蔽、上下文感知、耳蜗频率选择和基音感知机制的语音增强方法,探讨如何将生理听觉机制转化为可学习的计算模型,以及生物启发方法在智能终端、语音通信和助听设备中的应用前景。

嘉宾简介:李楠,天津师范大学计算机与信息工程学院讲师,天津大学工学博士,曾赴日本北陆先端科学技术大学院大学攻读双学位,并赴新加坡国立大学联合培养。主要研究语音增强、语音端点检测、远场语音识别、语音去混响及听觉感知计算,重点关注听觉机理启发的低复杂度语音处理方法。


05、王潇蔓-上海人工智能实验室:万卷·丝路”多模态小语种语料库的创新与实践

大模型走向全球,首先要跨越的,可能不是模型规模,而是语言数据鸿沟。

面向“一带一路”、东盟、金砖等国家语言互通需求,报告将介绍“万卷·丝路”多模态小语种语料库的建设思路、关键技术与实践成果。

从高质量音视频、文本等多模态多语言数据,到“国别专家 + 智能处理 + 小语种专家”协同闭环,再到企业出海等实际应用场景,报告将呈现工业级高质量小语种语料建设的实践路径。

嘉宾简介:王潇蔓,上海人工智能实验室数据平台中心高级工程师,长期从事多语种、多模态语料资源建设与数据治理工作,曾参与多项语料相关国家标准及团队标准编写,主要研究多模态语料库建设、低资源语言数据构建、智能数据处理与高质量标注体系等。


06、夏菁-中国科学院深圳先进技术研究院:音乐物理特性对多巴胺系统神经夹带效应量化表征的机制研究

为什么音乐能够影响我们的情绪?

节奏、调式、振幅包络等音乐物理特性,与大脑深部奖赏回路之间究竟存在怎样的联系?

报告将音乐信息处理与脑机接口、认知神经科学、情感计算和数字疗法连接起来,利用颅内脑电(SEEG)考察音乐物理特性与深部神经动力学之间的关系,并进一步介绍融合神经质量模型与数据驱动学习的 Surrogate Brain 架构,探索仅依赖头皮EEG推断深部奖赏状态的可能。

嘉宾简介:夏菁,中国科学院深圳先进技术研究院助理研究员、华南师范大学博士研究生,曾赴德国波鸿鲁尔大学联合培养。长期聚焦视听通道认知与音乐治疗情绪障碍研究,致力于开发基于电生理信号的脑疾病智能诊断系统,相关成果发表于 Cell Reports、NeuroImage、Cortex、ICASSP、IEEE EMBC 等。


07、谢旭荣-中国科学院软件研究所:结合语音基础模型的障碍语音识别建模方法

当ASR越来越强,它能否真正“听懂”每一个人?

面对构音障碍、认知障碍等特殊人群,现有语音识别仍面临声学分布失配、数据稀缺和说话人高度异质性等挑战。

报告将围绕预训练语音基础模型向障碍语音场景迁移的问题,介绍模型融合、离散Token表征、半监督学习与自适应建模等方法,探讨如何让语音技术更好地服务障碍用户,并支持神经认知功能障碍的早期诊断。

嘉宾简介:谢旭荣,中国科学院软件研究所人机交互技术与智能信息处理实验室副研究员,香港中文大学博士。主要研究障碍语音处理、自适应技术、语音和语言建模、神经语音解码等,已发表期刊及会议论文60余篇,相关工作曾获 ICASSP 2019最佳学生论文奖。


08、郑达、王翰坤、李波含-小红书 × 上海交通大学:迈向更稳定的全连续自回归语音合成

从离散Token走向连续表征,下一代语音生成模型还可以怎么做?

报告将分享小红书 dots 团队近期围绕全连续自回归语音合成展开的系列探索:

dots.tts:全连续端到端自回归TTS基础模型 → HoliTok:兼顾信号重建、可学习性与语义信息的统一连续语音表征 → dots.tts.edit:支持文本、情感、韵律、停顿及组合编辑的统一细粒度语音编辑模型

从表征 → 生成 → 编辑,系统呈现全连续自回归语音生成的一条技术路线。官网显示 dots.tts 为2B参数模型,HoliTok将48 kHz语音编码为25 Hz、128维连续表征。

嘉宾简介:

郑达,硕士毕业于上海交通大学,曾搭建大规模中文语音识别系统 yitu-asr,目前在小红书 dots 语音团队开展文本、多模态模型及全双工语音方向研究。

王翰坤,上海交通大学 X-LANCE 博士生,目前在小红书 dots 语音团队实习,主要研究语音表征与合成。

李波含,上海交通大学博士生,目前在小红书 dots 语音团队实习,主要研究语音合成与理解。


09、刘李-香港科技大学(广州):音频推理与拟人情感化语音生成技术进展

当大模型从语言推理走向音频推理,机器能否真正理解声音背后的逻辑?

报告将系统介绍团队从音频认知推理到拟人情感化语音生成的系列探索:

Audio-DeepThinker——大型音频语言模型的结构化推理

PhyAVBench——面向物理常识的音视频生成评测

EmoSteer-TTS——无需训练的激活级细粒度情感语音操控

AudioGenie——贯通文本、图像、视频与语音、音效、音乐、歌曲的统一多智能体协作框架

从音频逻辑推理到情感智能生成,探索下一代具身智能、多模态交互与物理世界模拟所需要的声音能力。

嘉宾简介:刘李,香港科技大学(广州)副研究员、博士生导师,博士毕业于法国格勒诺布尔阿尔卑斯大学 GIPSA-lab,曾任加拿大 Ryerson University 博士后研究员。主要研究语音处理、音视频理解与生成及可信人工智能,以第一作者或通讯作者发表相关论文75篇,包括 TPAMI、TASLP、NeurIPS 等期刊和会议。


10、拉巴顿珠-西藏大学:融合语言学先验知识的低资源藏语语音合成优化方法研究

在大模型迈向多语言、多模态的今天,如何让低资源语言不掉队?

藏语语音合成面临语言复杂、基础数据与计算资源稀缺等挑战。

报告以藏语卫藏方言为主要研究对象,围绕语言学知识深度挖掘与端到端声学建模两条主线,从藏语语音结构、复杂文本特征、韵律结构预测到声学建模,探讨语言学先验如何帮助低资源语音合成突破数据与建模瓶颈。

嘉宾简介:拉巴顿珠,西藏大学信息科学技术学院副教授、博士生导师,主要研究藏语智能信息处理与人工智能,长期从事计算机应用与藏文信息处理教学科研工作,主持国家自然科学基金青年项目、教育部人文社会科学研究项目等多项科研和人才项目。


十个报告,看见声学智能的更多可能

把这10场报告放在一起,我们看到的并不是10个彼此孤立的研究问题,而是一幅正在快速展开的声学智能前沿图景。官网10个主题实际覆盖了语音编解码、副语言评测、智慧医疗、听觉感知、多模态小语种数据、音乐与神经科学、障碍语音、连续语音生成、音频推理以及低资源语言技术。

更高效:低码率神经语音编解码

更自然:副语言表达、连续自回归语音合成与情感生成

更智能:音频推理、语音基础模型与多模态智能

更懂人:听觉感知、认知健康、障碍语音与音乐脑机接口

更多元:多模态小语种语料与低资源藏语语音技术

从声音的编码与感知,到理解、生成与推理;从大模型与多模态智能,到医疗健康、脑科学和低资源语言——声学智能正在不断突破传统语音技术的边界。

NCMMSC 2026青年论坛期待以多元的青年研究力量,为这些正在发生的变化提供一个开放交流与思想碰撞的平台。


相聚横琴,聆听青年声音

📅 会议时间:2026年11月5—8日

📍 会议地点:珠海横琴 · 天沐琴台国际会展中心

🎙️ NCMMSC 2026青年论坛

具体论坛时间及议程安排请关注大会后续通知。

NCMMSC 2026青年论坛详情:https://www.ncmmsc.org.cn/qnlt/


语音 × 语言 × 多模态

迈向智能交互新范式

从更高效地传输声音,到更自然地生成声音;

从让机器“听见”,到让机器理解、推理与表达;

从服务大众,到关注障碍人群与低资源语言;

从声学信号,到大脑与认知。

青年力量,正在拓展声学智能的边界。

11月,珠海横琴。

欢迎关注 NCMMSC 2026青年论坛,

让我们一起聆听青年声音,共探声学智能新未来!

NCMMSC 2026会议注册已经开放,敬请及时完成会议注册,并提前做好住宿及行程安排。

NCMMSC 2026官方网站:https://www.ncmmsc.org.cn/