ICASSP 2025 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2025 录用论文的作者进行报告交流。

ICASSP 2025 论文预讲会邀请到南开大学人类语言技术实验室在3月17日和3月18日分别做两期专场分享,本文介绍第二场相关内容,欢迎大家预约观看。

实验室概况

南开大学人类语言技术实验室依托于南开大学、数据与智能系统安全教育部重点实验室DISSec和天津市媒体计算工程中心TMCC。在南开大学杰出人才引进项目的有力支持下,建立了一支以秦勇教授为核心,定位于高水平创新型研究的团队。该团队目前有教授2人、高级研究员1人、硕博士生20人。团队聚焦于智能交互技术、智能音频分析技术、自动语音质量评测技术、语音及相关多模态基础模型评测技术等。团队目前承担科技部科技创新2030新一代人工智能重大项目;国基金面上项目;南开-联想、南开-零犀、南开-马上消费校企合作项目;南开大学交叉研究中心项目等。

第九期:南开大学人类语言技术实验室(二)【专场】

时间:3月18日(周二)19:00 ~ 20:30

形式:线上

议程:每位嘉宾分享30分钟(含5分钟QA)

嘉宾&主题

嘉宾简介:王雪琛,南开大学人类语言技术实验室三年级硕士生,研究方向为语音情感识别、多模态情感识别。曾在INTERSPEECH,ICASSP上发表多篇论文。

分享主题:Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment

摘要:多模态情感识别在智能客服、心理健康监测、虚拟助手、智能教育等领域展现了巨大的应用潜力,并逐渐成为人机交互和情感计算领域的研究热点。然而,如何高效地实现模态对齐,解决模态间的不一致性,仍然是多模态情感识别面临的主要挑战。现有研究大多局限于单一粒度层面的对齐,未能充分挖掘多粒度情感特征的协同作用,从而限制了模型对情感信息的全面感知能力。本文提出了一种基于多粒度跨模态对齐的情感识别增强方法,该方法通过分布级别、token级别和实例级别的对齐模块,通过融合多个粒度对齐策略的优势,实现了对情感信息的多层次感知与建模,显著提升了多模态情感识别的性能。

嘉宾简介:贾宇航,南开大学人类语言技术实验室一年级硕士生,研究方向为语音编辑、音频编辑、多模态语音识别。

分享主题 :AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework

摘要: 基于扩散模型的文本到音频(TTA)生成已取得显著进展,使得高质量、多样化且符合指令要求的音频合成成为可能。然而,除了生成之外,音频编辑同样至关重要,但相比之下却受到较少关注。音频编辑面临两个核心挑战:精准执行编辑 和 保持未编辑部分的完整性。尽管基于扩散模型反演的编辑技术在图像处理领域已取得一定成果,但在音频编辑中的应用仍然有限。本文提出了 AudioEditor,一个基于预训练扩散 TTA 模型的 Training-free 音频编辑框架。AudioEditor利用了DDIM Inversion技术,并结合了 Null-text Inversion 和 EOT-suppression 等图像编辑领域的先进方法,使模型在执行编辑意图的同时,最大程度地保留原始音频特征。全面的客观与主观实验验证了AudioEditor在音频编辑任务上的有效性。

嘉宾简介:刘成,南开大学人类语言技术实验室二年级硕士生,研究方向为音频音乐生成、语音质量评估。

分享主题:MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation

摘要:从文本描述生成音乐的技术取得了快速发展。然而,评估文本到音乐 (Text-to-Music, TTM) 系统仍然是一项重大挑战,主要是因为难以用现有的客观和主观评估方法平衡性能和成本。在本文中,我们提出了一个与人类感知程度对齐的 TTM 自动评估任务。为了解决音乐评估的专业要求和文本与音乐之间关系的复杂性所带来的 TTM 评估挑战,我们收集了第一个生成式音乐评估数据集 MusicEval。该数据集包含 31 个先进且广泛使用的模型响应 384 个文本提示生成的 2,748 个音乐片段,以及来自 14 位音乐专家的 13,740 个评分。此外,我们在此数据集上设计了一个基于 CLAP 的自动评估系统,我们的实验结果验证了所提任务的可行性,为 TTM 评估的未来发展提供了有价值的参考。数据集将在 https://www.aishelltech.com/AISHELL_7A 获得。

参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看

👇👇👇

预讲会征集

ICASSP 2025 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。

为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2025 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。

预讲会报名方式

联系人邮箱:bd@speechhome.com

联系人微信