今日论文合集:cs.SD语音9篇,eess.AS音频处理7篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


cs.SD语音


【1】Probabilistic Multilabel Graphical Modelling of Motif Transformations in Symbolic Music
标题:象征音乐中主题转换的概率多标签图形建模
链接:https://arxiv.org/abs/2603.26478

作者:Ron Taieb, Yoel Greenberg, Barak Sober
备注:23 pages (21 pages main text), 2 figures. Submitted to Journal of New Music Research (Special Issue on Computational and Cognitive Musicology)
摘要:
摘要:


【2】CA-TCN: A Causal-Anticausal Temporal Convolutional Network for Direct Auditory Attention Decoding
标题:CA-TCN:一种用于直接听觉注意力解码的CASEARCH-反高斯时间卷积网络
链接:https://arxiv.org/abs/2603.26394

作者:Iñigo García-Ugarte, Rubén Eguinoa, Ricardo San Martín, Daniel Paternain, Carmen Vidaurre
摘要:
摘要:


【3】LLaDA-TTS: Unifying Speech Synthesis and Zero-Shot Editing via Masked Diffusion Modeling
标题:LLaDA-TTC:通过掩蔽扩散建模统一语音合成和Zero-Shot编辑
链接:https://arxiv.org/abs/2603.26364

作者:Xiaoyu Fan, Huizhi Xie, Wei Zou, Yunzhang Chen
备注:11 pages, 6 figures, 2 tables
摘要:
摘要:


【4】Cinematic Audio Source Separation Using Visual Cues
标题:使用视觉线索的电影音频源分离
链接:https://arxiv.org/abs/2603.26113

作者:Kang Zhang, Suyeon Lee, Arda Senocak, Joon Son Chung
备注:CVPR 2026. Project page: this https URL
摘要:
摘要:


【5】A Human-Inspired Decoupled Architecture for Efficient Audio Representation Learning
标题:用于高效音频表示学习的以人为本的去耦合架构
链接:https://arxiv.org/abs/2603.26098

作者:Harunori Kawano, Takeshi Sasaki
摘要:
摘要:


【6】Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods
标题:解锁强监督:通用音频预训练方法的以数据为中心的研究
链接:https://arxiv.org/abs/2603.25767

作者:Xuanru Zhou, Yiwen Shao, Wei-Cheng Tseng, Dong Yu
备注:Accepted to CVPR 2026
摘要:
摘要:


【7】Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition
标题:关系图驱动的差异去噪和扩散注意融合用于多模式对话情感识别
链接:https://arxiv.org/abs/2603.25752

作者:Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li
备注:19 pages
摘要:
摘要:


【8】Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
标题:侍酒师:用于双环语音语言模型的可扩展开放多轮音频预处理
链接:https://arxiv.org/abs/2603.25750

作者:Kyudan Jung, Jihwan Kim, Soyoon Kim, Jeongoon Kim, Jaegul Choo, Cheonbok Park
备注:34 pages, 7 figures, 11 tables
摘要:
摘要:


【9】A Power-Weighted Noncentral Complex Gaussian Distribution
标题:功率加权非中心复高斯分布
链接:https://arxiv.org/abs/2603.26344

作者:Toru Nakashika
摘要:
摘要:


eess.AS音频处理


【1】UPV_RIR_DB: A Structured Room Impulse Response Database with Hierarchical Metadata and Acoustic Indicators
标题:UPV_RIR_DB:具有分层元数据和声学指标的结构化房间脉冲响应数据库
链接:https://arxiv.org/abs/2603.25947

作者:Jesús García-Gamborino (1), Laura Fuster (1), Daniel de la Prida (2), Luis A. Azpicueta-Ruiz (3), Gema Piñero (1) ((1) ITEAM, Universitat Politècnica de València, (2) Grupo de Investigación en Acústica Arquitectónica, Universidad Politécnica de Madrid, (3) Dep. Teoría de la Señal y Comunicaciones, Universidad Carlos III de Madrid)
备注:RIR Database available at ZENODO
摘要:
摘要:


【2】A Power-Weighted Noncentral Complex Gaussian Distribution
标题:功率加权非中心复高斯分布
链接:https://arxiv.org/abs/2603.26344

作者:Toru Nakashika
摘要:
摘要:


【3】Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
标题:提炼对话:基于LLM的ASB的对话音频上下文的抽象压缩
链接:https://arxiv.org/abs/2603.26246

作者:Shashi Kumar, Esaú Villatoro-Tello, Sergio Burdisso, Kadri Hacioglu, Thibault Bañeras-Roux, Hasindri Watawana, Dairazalia Sanchez-Cortes, Srikanth Madikeri, Petr Motlicek, Andreas Stolcke
备注:11 pages
摘要:
摘要:


【4】Cinematic Audio Source Separation Using Visual Cues
标题:使用视觉线索的电影音频源分离
链接:https://arxiv.org/abs/2603.26113

作者:Kang Zhang, Suyeon Lee, Arda Senocak, Joon Son Chung
备注:CVPR 2026. Project page: this https URL
摘要:
摘要:


【5】Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods
标题:解锁强监督:通用音频预训练方法的以数据为中心的研究
链接:https://arxiv.org/abs/2603.25767

作者:Xuanru Zhou, Yiwen Shao, Wei-Cheng Tseng, Dong Yu
备注:Accepted to CVPR 2026
摘要:
摘要:


【6】Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition
标题:关系图驱动的差异去噪和扩散注意融合用于多模式对话情感识别
链接:https://arxiv.org/abs/2603.25752

作者:Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li
备注:19 pages
摘要:
摘要:


【7】Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
标题:侍酒师:用于双环语音语言模型的可扩展开放多轮音频预处理
链接:https://arxiv.org/abs/2603.25750

作者:Kyudan Jung, Jihwan Kim, Soyoon Kim, Jeongoon Kim, Jaegul Choo, Cheonbok Park
备注:34 pages, 7 figures, 11 tables
摘要:
摘要:


机器翻译由腾讯交互翻译提供,仅供参考