微信公众号:arXiv_Daily
cs.SD语音
【1】Probabilistic Multilabel Graphical Modelling of Motif Transformations in Symbolic Music
标题:象征音乐中主题转换的概率多标签图形建模
链接:https://arxiv.org/abs/2603.26478
备注:23 pages (21 pages main text), 2 figures. Submitted to Journal of New Music Research (Special Issue on Computational and Cognitive Musicology)
摘要:
摘要:
【2】CA-TCN: A Causal-Anticausal Temporal Convolutional Network for Direct Auditory Attention Decoding
标题:CA-TCN:一种用于直接听觉注意力解码的CASEARCH-反高斯时间卷积网络
链接:https://arxiv.org/abs/2603.26394
摘要:
摘要:
【3】LLaDA-TTS: Unifying Speech Synthesis and Zero-Shot Editing via Masked Diffusion Modeling
标题:LLaDA-TTC:通过掩蔽扩散建模统一语音合成和Zero-Shot编辑
链接:https://arxiv.org/abs/2603.26364
备注:11 pages, 6 figures, 2 tables
摘要:
摘要:
【4】Cinematic Audio Source Separation Using Visual Cues
标题:使用视觉线索的电影音频源分离
链接:https://arxiv.org/abs/2603.26113
备注:CVPR 2026. Project page: this https URL
摘要:
摘要:
【5】A Human-Inspired Decoupled Architecture for Efficient Audio Representation Learning
标题:用于高效音频表示学习的以人为本的去耦合架构
链接:https://arxiv.org/abs/2603.26098
摘要:
摘要:
【6】Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods
标题:解锁强监督:通用音频预训练方法的以数据为中心的研究
链接:https://arxiv.org/abs/2603.25767
备注:Accepted to CVPR 2026
摘要:
摘要:
【7】Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition
标题:关系图驱动的差异去噪和扩散注意融合用于多模式对话情感识别
链接:https://arxiv.org/abs/2603.25752
备注:19 pages
摘要:
摘要:
【8】Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
标题:侍酒师:用于双环语音语言模型的可扩展开放多轮音频预处理
链接:https://arxiv.org/abs/2603.25750
备注:34 pages, 7 figures, 11 tables
摘要:
摘要:
【9】A Power-Weighted Noncentral Complex Gaussian Distribution
标题:功率加权非中心复高斯分布
链接:https://arxiv.org/abs/2603.26344
摘要:
摘要:
【1】UPV_RIR_DB: A Structured Room Impulse Response Database with Hierarchical Metadata and Acoustic Indicators
标题:UPV_RIR_DB:具有分层元数据和声学指标的结构化房间脉冲响应数据库
链接:https://arxiv.org/abs/2603.25947
备注:RIR Database available at ZENODO
摘要:
摘要:
【2】A Power-Weighted Noncentral Complex Gaussian Distribution
标题:功率加权非中心复高斯分布
链接:https://arxiv.org/abs/2603.26344
摘要:
摘要:
【3】Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
标题:提炼对话:基于LLM的ASB的对话音频上下文的抽象压缩
链接:https://arxiv.org/abs/2603.26246
备注:11 pages
摘要:
摘要:
【4】Cinematic Audio Source Separation Using Visual Cues
标题:使用视觉线索的电影音频源分离
链接:https://arxiv.org/abs/2603.26113
备注:CVPR 2026. Project page: this https URL
摘要:
摘要:
【5】Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods
标题:解锁强监督:通用音频预训练方法的以数据为中心的研究
链接:https://arxiv.org/abs/2603.25767
备注:Accepted to CVPR 2026
摘要:
摘要:
【6】Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition
标题:关系图驱动的差异去噪和扩散注意融合用于多模式对话情感识别
链接:https://arxiv.org/abs/2603.25752
备注:19 pages
摘要:
摘要:
【7】Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
标题:侍酒师:用于双环语音语言模型的可扩展开放多轮音频预处理
链接:https://arxiv.org/abs/2603.25750
备注:34 pages, 7 figures, 11 tables
摘要:
摘要:
机器翻译由腾讯交互翻译提供,仅供参考
