ICASSP 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2024 录用论文的作者进行报告交流。
ICASSP 2024 论文预讲会第七期邀请到西交利物浦大学做本次会议的专场分享,欢迎大家观看。

第七期
西交利物浦大学【专场】
时间:3月13日(周三)19:00 ~ 20:00
形式:线上
议程:每位嘉宾分享30分钟(含5分钟QA)

嘉宾&主题
嘉宾简介:蔡毅强,西交利物浦大学智能工程学院人工智能系一年级博士生,主要研究方向为声学场景识别、算法压缩和领域泛化。曾获得DCASE 2023数据挑战赛第二名,相关工作发表于ICASSP音频领域会议。分享主题:TF-SepNet: An Efficient 1D Kernel Design in CNNs for Low-Complexity Acoustic Scene Classification
摘要:近期的研究聚焦于利用卷积神经网络(CNNs)开发高效的声景分类系统(ASC),这些系统通常由连续的卷积核组成。本文突出了在ASC任务中使用分离的卷积核作为更强大和高效的设计方法的好处。受音频信号的时频特性启发,我们提出了基于CNN的时频分离网络(TF-SepNet)架构,该架构将特征沿着时间和频率维度分离成两个部分进行处理,然后通过通道合并后直接传送到分类器。TF-SepNet不使用传统的二维(2D)卷积核,而是采用一维(1D)卷积核来降低计算成本。实验使用了TAU Urban Acoustic Scene 2022 Mobile开发数据集进行验证。结果显示,TF-SepNet优于使用连续核的类似最新技术。进一步的研究表明,分离的卷积核能够带来更大的有效感受野(ERF),使模型能够捕获到更多的时频特征。

嘉宾简介:谭奕舟,曾任西交利物浦大学智能工程学院人工智能系研究助理,主要研究方向为声学场景识别和声学事件检测。相关工作发表于TASLP和Interspeech上。分享主题:Acoustic Scene Classification across Cities and Devices via Feature Disentanglement摘要:声学场景分类(ASC)是一项根据环境声信号对场景进行分类的任务。从不同城市和设备收集的音频通常在特征分布上表现出偏差,这可能会对ASC性能产生负面影响。已有的工作往往至考虑跨设备对ASC系统的影响,而忽视了跨城市问题对系统的潜在危害。本文将音频采集的城市和设备作为两种类型的数据域,试图对城市和设备的音频特征进行解耦,以消除不同数据的特征偏差。并提出了一种基于双对齐的通用ASC系统框架。该框架既对齐了跨领域的决策边界,也对齐每个领域整体特征分布的边界。该系统框架还进一步提出了四种分类器,旨在寻找如何实现多维域(城市,设备)下的最佳特征解耦方案,包括条件分类器(CC)、多任务学习分类器(MTLC)、投影多任务分类器(PMTC)和联合多任务分类器(JMTC)。同时我们进一步设计了三个实验来评估双对齐框架:1) 跨城市;2)跨设备;3)既跨城市又跨设备。结果表明,在所有情况下,我们的方案相比已有模型,分别提高了1.8%,19.8%和9.0 %的正确率。比较表明,更好的特征解耦可以有效提高ASC系统在涉及多设备多城市等复杂场景下的鲁棒性。
参与方式
直播将通过语音之家微信视频号进行直播

扫码添加语音小管家,进入语音之家讨论群
ICASSP 2024 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。

为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。
联系人邮箱
bd@speechhome.com
联系人微信
