第二十届全国人机语音通讯学术会议将于2025年10月16日至19日在江苏镇江举办,为便于大家交流学习,在大会开始前将开启特殊议题直播宣讲,本次直播旨在通过邀请 10 个特殊议题的组织者分别介绍和讲解各自主题内容,向相关领域的研究人员、学生及企业从业者分享前沿学术动态与研究亮点。

大会官网:http://www.ncmmsc.org.cn/

时间:9月25日(周四)18:00 ~ 19:00

形式:线上

议程:

时间内容
18:00-18:05开场,大会介绍
18:05-18:55十大特殊议题宣讲
18:55-19:00Q&A

观看方式:(预约,参与直播)👇

NCMMSC2025-VtaD挑战赛以语音信号中携带的话者音色信息为对象,关注音色的可解释性,为此构建音色属性检测(Voice Timbre Attribute Detection,VtaD)任务。该任务旨在辨认两句语音中的话者在音色属性上是否存在特定的强弱差异,其中,音色属性指听者通过听觉感知系统,借助语言对话者音色感知进行的描述,如明亮、粗糙、圆润等。本挑战赛由中国科学技术大学和香港理工大学共同发起,以促进对语音中话者音色属性的研究,进而推动相关领域的发展。

本挑战赛的详细信息请参看:https://vtad2025-challenge.github.io/

视觉语音识别,也称唇语识别,是一项通过口唇动作来推断发音内容的技术。该技术在公共安全、助老助残、视频验真等领域具有重要应用。当前,唇语识别的研究方兴未艾,虽然在独立词、短语等识别上取得了长足进展,但在大词表连续识别方面仍面临巨大挑战。为推动这一研究方向的发展,清华大学联合北京邮电大学、海天瑞声和语音之家举办第三届中文连续视觉语音识别挑战赛 (Chinese Continuous Visual Speech Recognition Challenge, CNVSRC 2025)。本次赛事以CN-CVS中文视觉语音识别数据库为基础数据,评估在录音室朗读 (Reading) 和网络演讲 (Speech) 两类场景下的LVCVSR系统的性能。这是该竞赛系列的第三次组织。相较于CNVSRC 2023和CNVSRC 2024,CNVSRC 2025提供了更强大的基线系统和更多开源数据(总计1500小时),并增设了唇语到语音转换 (Visual to Speech, VTS)赛道。

本挑战赛详情请参考赛题官网:https://cnceleb.org/competition

CCF先进音频技术竞赛由中国计算机学会(CCF)主办、CCF语音对话与听觉专委会承办、语音之家协办、华为终端有限公司独家合作。大赛旨在推动国内高等院校及科研院所在音频技术领域的专业人才培养,支持学生科技创新,选拔优秀人才。本届赛事分为两个挑战赛道,均提供了高质量赛事数据和基线系统。第一是语音修复赛题旨在鼓励参赛者探索和实现面向真实世界复杂链路的下一代语音修复算法,以显著提升语音信号的质量、可懂度和听感自然度;第二是通用音频分离赛题旨从混杂声音信号中分离出不同声源的独立信号。本届赛事共吸引142支队伍参与两个赛题的角逐,初赛后共有11支代表队晋级两个赛题的决赛。晋级决赛的各参赛队从模型架构、算法创新、数据处理、参数量优化等多个角度,详细阐述了其技术方案的设计思路与实现过程。最终结合答辩评分、各支队伍提交语音的听感评估得分与初赛得分,评选出了两个赛题的一、二、三等奖获奖团队。

本议题拟组织两个赛题的等奖团队分别以报告形式介绍赛事方案,促进关于语音修复和音频分离技术的研究和交流。

更多信息请访问赛事官网:https://ccf-aatc.org.cn/

议题以“AI语音赋能生命健康”为主题,期望达到以下目的:(1)推动生命健康领域的AI技术转化:聚焦人工智能在医疗咨询、健康监测、紧急响应等场景中的无障碍沟通技术创新,开发可解释、可信赖的交互系统,助力慢性病管理、老龄化护理及突发公共卫生事件应对;(2)突破关键场景技术瓶颈:针对医疗场景中的多模态感知(如手语、眼动、脑机接口)、低资源环境下的小样本学习、隐私敏感数据安全交互等挑战,探索大模型轻量化、联邦学习与边缘计算的前沿解决方案;(3)构建跨学科协作生态:搭建医学、计算机科学、认知科学的多领域对话平台,促进临床需求与AI技术的高效对接,推动从实验室到病房的快速转化;(4)伦理与普惠性保障:制定AI健康交互的伦理准则,确保技术覆盖城乡差异群体,避免算法偏见导致的健康不平等。

该特殊议题的设立具有以下重要意义:(1)技术创新价值:发展基于联邦学习的分布式健康监测系统,实现隐私保护下的个性化健康预警(如癫痫发作预测、抑郁症情绪识别);(2)社会健康价值:提升弱势群体(听障、语障、认知障碍患者)的医疗可及性,据WHO统计,全球超15亿人因沟通障碍无法获得充分医疗服务。通过AI辅助诊断与远程康复指导,降低基层医疗资源压力,推动“健康中国2030”战略落地;(3)伦理与产业价值:建立医疗AI交互的透明性标准(如可解释性可视化、用户可控数据共享),响应《生成式人工智能服务管理暂行办法》要求。孵化医疗机器人、智能辅具等新兴产业,预计至2030年全球市场规模将超3000亿美元(Grand View Research数据)。

随着语音信号处理和情感计算技术的不断突破,语音已不仅仅是交流的媒介,更成为感知人类情绪与心理状态的重要窗口。语音中所蕴含的情感线索为精神健康状态的识别与干预提供了新思路,尤其在抑郁、焦虑、自闭症谱系障碍等精神心理问题的辅助诊断和智能干预中展现出巨大潜力。该议题聚焦情感语音合成技术与情感建模在精神健康场景中的前沿进展,旨在推动多模态信号分析、情绪识别、人机交互与临床应用之间的交叉融合。

本议题将邀请国内外该领域的专家学者,共同探讨语音信号在精神健康评估中的新范式,重点关注可解释性建模、小样本学习、多模态融合、跨文化情感表达、以及面向实际应用的系统集成等关键问题。我们期望通过本专题促进语音与心理健康研究的深度结合,推动情感智能技术在医疗、教育与社会关怀等场景中的落地转化,为建设具有温度的人机交互系统奠定基础。

据WHO统计,全球约7%人口存在言语障碍,其中涉及了听障、腭裂、自闭等常见的病理因素。另外,随着人口老年化的加剧,老年性听力损失也会导致言语交流障碍。本议题将组织语言学领域的专家和研究人员,从跨学科的角度,分享其对我国言语障碍人群汉语普通话语音感知和产出的研究。

从语言学的角度设计实验,探究言语障碍人群对音段和超音段的听辨能力,并分析其语音产出的声学特征,发掘不同类型病征的言语障碍人群语音感知和产出的模式,既能为语言康复训练提出意见和建议,又可以为计算机识别言语障碍人群的特殊语音提供基础数据,助力言语障碍人群融入智能社会。

半监督智能语音与语言技术,将半监督学习和智能语音语言技术进行有机结合,近年来备受关注并在快速发展中,在语音识别、语音生成、语音翻译、自然语言处理、人机对话系统等智能语音与语言技术领域发挥关键作用,具有广泛的应用前景。随着生成式人工智能(AIGC)的发展,半监督学习还在更复杂的任务中发挥重要作用,如音视频生成、虚拟主播、智能推荐等。

本次研讨会的目的是邀请来自学术界和工业界的研究人员,共同探讨半监督智能语音与语言技术的最新研究成果、未来发展方向和应用场景,促进学术界和产业界的合作,推动半监督智能语音与语言技术的研究和应用,为推动人工智能技术的发展做出贡献。

复杂声音场景下往往存在多个声源重叠、噪声种类繁多、声源位置不定等情况。这些特性要求声音增强和分离技术不仅要具备处理不同类型、动态变化的背景噪声的能力,还需要在复杂的声音源重叠与非语音噪声中提取出有用的目标声音信号。现有声音增强与分离技术往往假设只有一个主要声源、或者假设背景噪声是已知且静态的,无法适应复杂声音场景下的应用需求。此外,声音增强与分离技术,特别是基于深度学习的方法,往往依赖大量标注的训练数据。然而,复杂声音场景的多样性和不可预测性使得训练一个能够适应不同场景和噪声的高质量模型非常困难。对于不同的环境和噪声类型,现有模型的泛化能力可能不足,导致在实际应用中效果不佳。

本议题拟以约稿的形式,邀请该领域专家学者,分享复杂场景下的通用声音增强与分离技术的新进展。征稿内容主要包括:

  1. 基于多模态的声音定位与增强;
  2. 生成式语音增强;
  3. 多通道语音增强;
  4. 通用语音分离;
  5. 面向通用声音增强与分离任务的仿真与实采数据集构建

期望通过本专题促进通用声音增强与分离技术的研究,以提升系统的鲁棒性和适应性,并能够推动各类应用领域的发展,为更智能的语音交互、环境感知系统提供支撑。

OASIS·开源音频语音处理分论坛(Open-source Audio & Speech Intelligence Summit)将从以下方面展开:

  1. 技术前沿:邀请学界、业界聚焦语音理解与生成、音频生成与理解、音乐理解与生成等前沿领域进行主旨报告。
  2. 产业赋能:邀请产业界专家介绍开源社区平台在具体应用场景中的落地案例,分享工业级大规模数据构建与模型训练经验。
  3. 开源社区建设:邀请国内知名开源社区K2, WeNet以及Qwen语音技术社区运营团队分享社区概况与维护经验。

论坛将以主旨报告+圆桌论坛的形式进行,共同探讨大模型时代学界、业界开源社区建设的机遇、挑战与发展方向。

随着人工智能技术的蓬勃发展,语音与音频技术作为人机交互的核心入口,正深刻改变着人类社会的沟通方式与生活形态。本论坛将搭建语音、音频技术领域开源生态的交流平台,以技术交流为纽带,以开源创新为引擎,连接学术界、产业界,助力实现"技术创新驱动产业升级,开源协同赋能社会发展"的战略目标。

本议题旨在围绕近年来在多模态语音交互、个性化感知以及复杂场景下语音信号处理等方向的研究进展,集中展示本单位的最新研究成果。具体内容涵盖:

  1. 面向嘈杂环境的多声源音视频导航:针对现有视听导航多聚焦单声源场景的局限,构建了大规模多声源数据集 BeDAViN,并提出含声音事件描述器和多尺度场景记忆 Transformer的ENMuS3导航框架;(发表于AAAI2025)
  2. 神经辐射场在音频信号表征中的应用:基于Coordinate-MLP 的隐式神经表示在音频信号中应用不足的问题,构建了首个音频信号表示的Coordinate-MLPs 基准,提出 Fourier-ASR 框架,利用周期性和强非线性表示音频信号,并引入频率自适应学习策略优化高低频信号拟合;(发表于AAAI2025)
  3. 基于用户听觉偏好的个性化音频渲染方法:该研究针对个性化头相关传递函数(HRTF)建模中传统方法测量繁琐、现有数据驱动方法受限于数据集不一致性的问题,提出跨数据集个性化 HRTF 估计框架,通过方向感知自动编码器将稀疏测量的 HRTF 编码为统一潜在表示以支持跨数据集训练,并利用对比解耦策略分离数据集特定特征;
  4. 基于多模态语义线索的对话情绪原因抽取:针对现有方法未明确建模多模态对话中情绪和原因上下文语境的局限,提出了通过多模态异构图融合多尺度语义线索的情绪原因抽取方法,同时构建了首个多模态、多场景的对话情绪原因分析数据集MECAD。(发表于ACL Findings2025)
  5. 房间冲激响应的深度学习逆卷积与盲估计:旨在通过带混响语音提取房间冲激响应,以提供一种全新的低成本房间冲激响应测量方案

该议题设置的核心目的,是推动语音通讯领域在“多模态理解”“个性化建模”及“实际场景应用”三大方向的深度融合,为人机语音交互系统的智能化与普适性发展提供新的思路与技术支撑,也为学术界与产业界搭建更具前瞻性的交流平台。

全国人机语音通讯学术会议是国内语音领域广大专家、学者和科研工作者交流最新研究成果,促进该领域研究和开发工作不断进步的重要舞台。该系列会议自1990年开创以来已成功召开了十九届。2025年第二十届全国人机语音通讯学术会议(National Conference on Man-Machine Speech Communication,NCMMSC2025)将于2025年10月16~19日在江苏镇江明都大饭店举行。本次会议由中国中文信息学会(CIPS)和中国计算机学会(CCF)联合主办,由中国中文信息学会语音信息专委会、中国计算机学会语音对话与听觉专委会、江苏大学以及镇江市计算机学会联合承办,会议同时为中国中文信息学会语音信息专委会和中国计算机学会语音对话与听觉专委会的学术年会。

更多信息请见网站:http://www.ncmmsc.org.cn/

本次大会邀请了IEEE Fellow 小米集团首席语音科学家 Daniel Povey教授、上海交通大学俞凯教授、清华大学刘知远教授、教育部语言文字应用研究所李慧专家、贵阳市教育信息中心江涛书记、以及重庆市公安局渝中区分局蔡小龙局长莅临NCMMSC2025并作大会主旨报告。此外,还将举行教程报告、青年学者论坛、学生论坛、工业论坛。除主会外,还将组织科普教育活动、基金申请经验交流、产品和技术展示活动以及多个特殊议题。

一、注册费标准(单位:元),9月28日前注册享受优惠。

参会者身份8.20至9.28(含)前注册9.28 后注册
CIPS/CCF专业会员2000元/人2400元/人
CIPS/CCF学生会员900元/人1100元/人
非会员(专业)2500元/人3000元/人
非会员(学生)1200元/人1400元/人


二、注册费说明

1)注册费用包括:

  • 录用论文收录到大会程序手册;
  • 大会程序手册(纸质版)1份;
  • 可以参加大会报告、分组报告、教程报告等所有大会议程与活动;
  • 三天的会期午餐和晚餐。

2)注册费收取以交费日为准,例如9月26日已报名,9月29日交费,则将按照9月29日的注册费标准收取费用。

3)对于非CIPS/CCF会员人员,先注册成为CIPS/CCF会员后再报名缴费,可享受更多会员权益,节省注册费用。加入CIPS会员请登陆网站https://www.cipsc.org.cn/Register.aspx;加入CCF会员请登陆官网https://www.ccf.org.cn/(申请入会时请选择“语音对话与听觉专委”)。

4)CIPS/CCF 会员(含学生会员)注册时请准确填写手机号码和姓名,CCF会员需在注册页面备注会员号码才可享受会员优惠。

5)一个注册只能覆盖一篇论文,确保每篇文章都能被覆盖且有演讲人到会场进行报告和交流。


三、注册方式

1)注册链接https://www.cipsc.org.cn/Learn/index.aspx?itemid=5053(早鸟票已开放), 按照网页提示完成注册和缴费。

2)扫描二维码按照提示完成注册和缴费。

3)缴费方式支持支付宝在线支付以及银行转账汇款两种方式。(详见上述注册链接网页)


四、缴费说明

1)发票开具:完成缴费后可在线申请开具发票,自行下载即可。

2)退费说明:此次会议注册费的退费规定参照CIPS相关规定执行,具体如下:

  • 由于CIPS的原因需要退款的,全额退款;
  • 会前7天退全款,7天内不退款;
  • 在办理退款前已开具发票的电子发票,则由CIPS作废。


五、联系我们

注册缴费问题请联系会务组邮箱:ncmmsc2025@163.com