今日论文合集:CS.SD语音与音频 | 共 11 篇。
本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily
[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准
1. Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer
为文本-音频-视频模型添加带单个零初始化层的语音克隆功能
AI 总结:本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。
链接:https://arxiv.org/abs/2608.15690
机构:Kandinsky Lab(坎丁斯基实验室)
作者:Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov


2. What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models
什么构成了好的层?评估音乐基础模型的逐层固有属性
AI 总结:该研究分析12个音乐基础模型的逐层固有属性,发现现有指标无法通用追踪所有音乐任务的层质量,提出音高转置等变度指标,该指标可有效用于层选择,性能优于可训练多层融合方法,尤其在数据有限场景
链接:https://arxiv.org/abs/2608.14819
作者:Angelos-Nikolaos Kanatas, Yuexuan Kong, Pablo Alonso-Jiménez, Xavier Serra, Dmitry Bogdanov

3. ARENA: Automated Red-Teaming for Large Audio Language Models
ARENA:大型音频语言模型的自动化红队测试
AI 总结:本文提出ARENA闭环框架,基于2000个文本-音频数据集训练控制器,在520个AdvBench目标上对多个LALMs实现高FDR/PSR,验证了其在音频红队测试中的有效性。
链接:https://arxiv.org/abs/2608.15578
作者:Jiaming He, Zhicong Huang, Tian Jin, Zhen Sun, Cheng Hong, Yi Yu, Wenbo Jiang, Xudong Jiang

4. INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval
INSPIRE:指令感知语音检索基准
AI 总结:研究针对现有语音检索系统无法适配多样用户意图的问题,构建首个指令感知语音检索基准INSPIRE,评估四类检索范式,发现当前无方法能稳健处理所有检索意图,凸显统一架构的必要性。
链接:https://arxiv.org/abs/2608.16203
机构:National Taiwan University(台湾大学); NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(台湾大学人工智能卓越研究中心)
作者:Chen-An Li, Hung-yi Lee

5. Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization
听、推理与分段:使大型音频语言模型(LALMs)与编辑判断对齐以实现媒体章节化
AI 总结:该研究针对LALMs在实际媒体章节化部署的不足,提出基于GRPO与CoT的AudioChaps框架,构建三类数据集,使AudioChaps-R1的平均F1较SOTA提升49个百分点,实现非结构化听觉流到结构化媒体的可靠转换。
链接:https://arxiv.org/abs/2608.16539
机构:University of Surrey(萨里大学)
作者:Tony Alex, Wish Suharitdamrong, Sara Atito, Armin Mustafa, Muhammad Awais, Philip J. B. Jackson, Jiankang Deng, Ismail Elezi

6. ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning
ACE-Cap:面向长段落细粒度音频字幕生成的智能体协同演化主动证据获取方法
AI 总结:ACE-Cap将长段落细粒度音频字幕生成转化为自适应主动证据获取过程,通过作曲器与指令模型协同演化及LOOP-GRPO算法优化,解决了传统模型被动生成的缺陷。
链接:https://arxiv.org/abs/2608.16162
机构:Kling Team(Kling团队)
作者:Fengji Ma, Yan Rong, Xu Li, Xuenan Xu, Chen Zhang, Li Liu

7. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization
AudioTQ:一种基于随机哈达玛旋转与劳埃德-麦克斯韦量化的无数据感知6位CPU音频编解码器
AI 总结:本文提出AudioTQ,一种基于随机哈达玛旋转与劳埃德-麦克斯韦量化的6位CPU时域音频编解码器,无需硬件加速即可实现实时执行,可将音频文件大小缩减74.4%,SQNR约30 dB。
链接:https://arxiv.org/abs/2608.15369
作者:Sahil Gangurde

8. How Fragile Is Your Watermark? Training-Free Structural Removal of Neural Audio Watermarks
你的水印有多脆弱?无需训练的神经音频水印结构化去除
AI 总结:该研究提出无需训练的结构化探针方法,可区分神经音频水印的脆弱性,匹配域攻击能去除部分水印,且探针可识别水印方案,准确率达84%。
链接:https://arxiv.org/abs/2608.16566
机构:Indian Institute of Technology Madras(马德拉斯印度理工学院)
作者:Likhith Kumara

9. Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task
将AI生成音乐与编辑音频区分作为难负样本鲁棒性任务
AI 总结:本研究将区分AI生成音乐与编辑音频作为难负样本鲁棒性任务,构建YouTube数据集训练PaSST检测器,视频级平衡准确率0.811,片段级AI生成F1为0.836、编辑为0.720,揭示两者频谱线索的重叠性。
链接:https://arxiv.org/abs/2608.14916
作者:Alexandru-Stefan Morosanu, Valerian Cecan, Stefan-Daniel Achirei, Laura Erhan

10. Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift
严重声学偏移下的原型修正迭代自监督流形去噪
AI 总结:针对严重声学噪声下音频-文本基础模型的失效问题,提出无训练无数据源的TTA框架PRISM,在UrbanSound8K数据集上取得显著性能提升,还解决了复音陷阱问题。
链接:https://arxiv.org/abs/2608.15037
机构:Indian Institute of Science Education and Research(印度科学教育与研究学院); Vellore Institute of Technology(韦洛尔理工大学)
作者:Ashish Anand Shukla, Rini Smita Thakur, Aryan Das, Vinod K. Kurmi

11. SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning
SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成
AI 总结:SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。
链接:https://arxiv.org/abs/2608.16220
机构:Kuaishou Technology(快手科技)
作者:Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xu