ICASSP 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2024 录用论文的作者进行报告交流。
ICASSP 2024 论文预讲会邀请到西工大音频语音与语言处理研究组在3月20日和3月21日分别做两期专场分享,本文介绍第二场相关内容,欢迎大家预约观看。
实验室概况
西北工业大学音频语音与语言处理研究组(ASLP@NPU)依托于空天地海一体化大数据应用技术国家工程实验室和陕西省语音与图像信息处理重点实验室。研究组成立于1995年,经过近20多年的快速发展,已形成了人机语音交互、语音与音频信号处理、音视频多模态信息处理、多媒体内容分析、机器学习等主要研究方向。研究组与比利时、英国、美国、新加坡等多所高校与研究机构建立了长期合作关系,同时,实验室与工业界联系密切,目前已经与华为、腾讯、微软、阿里巴巴、小米、网易、字节跳动、美团、爱奇艺、网易、出门问问等行业头部企业与初创公司开展了广泛深入的科研合作,众多研究成果已经在实际产品中获得应用,获得华为技术合作奖、美团科研合作奖等。实验室在领域顶级期刊和会议上发表学术论文300余篇,在多个重要会议上获得多篇优秀论文奖,参加多个国际国内技术评测获得第一名,取得了丰硕的研究成果。实验室入选2019《互联网周刊》十大顶尖高校人工智能实验室。

第十三期
西工大音频语音与语言处理研究组(二)【专场】
时间:3月21日(周四)19:00 ~ 20:40
形式:线上
议程:每位嘉宾分享25分钟(含5分钟QA)

嘉宾&主题

嘉宾简介:刘铭帅,西北工业大学音频语音与语言处理研究组二年级研究生,主要研究方向为单通道语音增强,目标说话人提取,音质修复。已在领域内重要会议以第一作者身份发表论文2篇,获得“声华杯”声学技术大赛语音增强赛道冠军、ICASSP 2024语音信号改善挑战赛(SSI Challenge)赛道二亚军。
分享主题:RaD-Net: A Repairing And Denoising Network For Speech Signal Improvement
摘要:在ICASSP 2024 SSI 挑战赛中,我们扩展了上届竞赛使用的基于语音恢复和降噪的两阶段网络框架,提出RaD-Net模型,用于消除通信系统中语音信号面临的各种失真。具体来说,首先将恢复网络替换为TEA-PSE中的Com-Net。其次,在训练阶段引入了多分辨率判别器和多子带判别器。最后使用三阶段训练策略来优化模型。为了满足不同赛道实时率的要求,我们提交了两个不同参数量的RaD-Net模型。根据官方结果,所提交的系统在赛道一中获得第二名,在赛道二获得第三名的优异成绩。
嘉宾简介:张子晗,西北工业大学音频语音与语言处理研究组二年级研究生,主要研究方向为语音增强、回声消除、丢包补偿。在ICASSP、Interspeech、ASRU等语音顶级会议发表一作论文4篇,获得ICASSP 2023 AEC Challenge亚军,CHiME 7挑战赛赛道二冠军,ICASSP 2024 PLC Challenge冠军。
分享主题:BS-PLCNet: Band-Split Packet Loss Concealment Network With Multi-Task Learning Framework And Multi-Discriminators摘要:丢包是网络电话(VoIP)系统中不可避免的常见问题。为解决这一问题,我们提出了一种频带分解的丢包隐藏网络(BS-PLCNet)。具体来说,我们将全带信号分为宽频带(0-8kHz)和高频带(8-24kHz)。宽带信号由门控卷积递归网络(GCRN)处理,而高频带信号则由简单的 GRU 网络处理。为确保高质量的语音和对语音识别(ASR)的兼容性,我们使用了多任务学习(MTL)框架,包括基频(f0)预测、语言感知,同时多判别器策略也被用于网络训练中。所提出的方法在 ICASSP 2024 PLC 挑战赛中获得并列第一名的优异成绩。
嘉宾简介:穆秉甡,西北工业大学音频语音与语言处理研究组二年级博士生,研究方向为语音识别,包括多通道语音识别、视听语音识别、口音语音识别等,在ICASSP、INTERSPEECH等语音会议发表一作及合作论文五篇。
分享主题:Automatic Channel Selection And Spatial Feature Integration For Multi-Channel Speech Recognition Across Various Array Topologies摘要:自语音识别(ASR)取得了显著的进展,但在现实远场多录音设备多阵列拓扑结构的场景中仍然面临挑战。CHiME-7远场ASR任务的目标是设计一个能够泛化多录音设备多阵列拓扑结构,并在现实环境中提供可靠识别性能的统一系统。为了完成这一目标,我们提出了一个ASR方案,该方案在各种阵列拓扑结构上表现出色。首先,我们提出了两个基于注意力机制的自动通道选择模块,用于为每个语句从多个录音设备中选择最有利的多通道信号的子集。此外,我们引入了跨通道空间特征,以增强多帧跨通道注意力的有效性,帮助ASR系统提高空间信息感知能力。最后,我们提出了一个受U-Net架构启发的多层卷积融合模块,将多通道输出集成为单通道输出。在CHiME-7数据集上的实验结果表明,我们提出的ASR方案相对于基线ASR在评估集上的DA-WER实现了40.1%的相对降低。
嘉宾简介:王子谦,西北工业大学音频语音与语言处理研究组一年级研究生,主要研究方向为单/多通道语音增强/分离。在ICASSP、INTERSPEECH、ASRU语音顶会发表一作及合作论文4篇。
分享主题:SELM: Speech Enhancement Using Discrete Tokens And Language Models摘要:语言模型(LM)近期在各种语音生成任务中发挥出卓越的性能,展现了其在语义上下文建模方面的强大能力。鉴于语音生成和语音增强之间的内在相似性,利用语义信息可能对语音增强任务具有潜在优势。为此,我们提出了SELM,一种语音增强的新范式,通过集成离散表征来利用语言模型。SELM包括三个阶段:编码、建模和解码。我们使用预训练的自监督学习(SSL)模型和K-Means聚类将连续的波形信号转换为离散表征。在此之后,语言模型建模隐藏在离散表征中的全面上下文信息。最后,通过将聚类中心簇的坐标应用于HiFi-GAN还原得到增强后语音。实验结果表明,SELM在客观指标上与当下最先进模型取得了可比性能,同时在主观听感上取得了更好的效果。
参与方式
直播将通过语音之家微信视频号进行直播

讨论群

扫码添加语音小管家,进入语音之家讨论群
ICASSP 2024 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。

为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。
联系人邮箱
bd@speechhome.com
联系人微信
