ICASSP 2026 | 南京大学音频声学实验室(NJU-AALab)10篇论文展示+2项赛事冠军
以下文章来自:南京大学音频声学实验室(NJU-AALab) ICASSP(International Conference on Acoustics, Speech, and Signal Processing)是由IEEE信号处理学会主办…
18 0 0
以下文章来自:南京大学音频声学实验室(NJU-AALab) ICASSP(International Conference on Acoustics, Speech, and Signal Processing)是由IEEE信号处理学会主办…
当前,大音频语言模型(LALM)在端到端说话人日志与识别任务中展现出优异性能。但受大规模对话语料稀缺、缺少显式说话人表征优化机制限制,模型的说话人区分能力仍存在短板。现有提升大音频语言模型说话人精度的主流方法,无论是引入额外编码器、设计注册…
来源丨千问大模型 今天,阿里通义升级实时语音识别大模型Fun-ASR-Realtime——一款首字延迟控制在百毫秒级别、识别准确率接近离线模型的流式语音识别模型,支持16种方言和30种语言。 阿里云百炼: Fun-ASR-Realtime:…
分享武汉大学电子信息学院智能音频与语音感知实验室在Interspeech 2026中稿的13篇论文,论文涵盖语音增强、声源定位、声音事件检测、音频表征、音频大模型等多个研究方向。 ⏩一、多通道语音增强与鲁棒波束形成 Joint Learni…
👋 各位语音技术爱好者们,大家好! 2026年过半,语音之家陪伴大家走过了一段充实的学习之旅。从线上公开课到论文解读,从技术沙龙到行业分享,我们一起探索了语音技术的方方面面。 为了方便大家回顾学习、查漏补缺,我们把这期间的所有活动资源做了…