今日论文合集:CS.SD语音与音频 共 18 篇,本文展示前 8 篇

本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily

[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准


快速导航

1. 语音识别与关键词检测 1 篇

2. 说话人识别、验证与分离 1 篇

3. 语音翻译与语音语言模型 3 篇

4. 数据集、基准与评测 1 篇

5. 安全、隐私与深度伪造音频 1 篇

6. 其他/综合语音音频 1 篇


1. 语音识别与关键词检测 | 1 篇

1. Where Does the Audio Jailbreak Live? A Controlled Frequency-Depth Audit of AdvWave-P on Qwen2-Audio

音频越狱存在于何处?对Qwen2-Audio上AdvWave-P的受控频率-解码器深度审计

AI 总结:本研究审计Qwen2-Audio上AdvWave-P音频越狱的频率与解码器深度声明,发现频率排名依赖分区方式,且音频跨度发散性与频段必要性相关,但非因果定位。

链接:https://arxiv.org/abs/2610.07005

机构:New York University Abu Dhabi(纽约大学阿布扎比分校); New York University(纽约大学)

作者:Boyuan Chen, Minseok Kim, Sohaila Abdulsattar, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique


2. 说话人识别、验证与分离 | 1 篇

2. Neural Representations, Natural Connections: What Transfers From Human Speech Foundation Models to Animal Vocalizations?

神经表征,自然连接:从人类语音基础模型到动物叫声迁移了什么?

AI 总结:本研究评估15个冻结编码器在动物叫声识别上的跨物种迁移,发现语音预训练在部分任务中优于动物预训练,且迁移效果强烈依赖层深度。

链接:https://arxiv.org/abs/2610.07107

机构:Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大大学埃尔朗根-纽伦堡); OTH Amberg-Weiden(安贝格-魏登应用科学大学); Bar Ilan University(巴伊兰大学)

作者:Tomás Arias-Vergara, Christopher Hauer, Héloïse Brotier, Elmar Nöth, Andreas Maier, Lee Koren


3. 语音翻译与语音语言模型 | 3 篇

3. Extending Music Annotation Schemas: Zero-Shot Prediction or Few-Shot Adaptation?

扩展音乐标注模式:零样本预测还是少样本适应?

AI 总结:针对音乐标注模式扩展问题,提出基于MGPHot数据集的基准,对比零样本预测与监督适应,发现监督适应在较小预算下更优,冻结表示复用为适度预算下最有效方案。

链接:https://arxiv.org/abs/2610.06920

机构:Queen Mary University of London(伦敦玛丽女王大学)

作者:Christos Plachouras, Emmanouil Benetos, Johan Pauwels


4. AdaLoop: Adaptive-Depth Latent Reasoning for Audio Language Models

AdaLoop:音频语言模型的自适应深度潜在推理

AI 总结:AdaLoop通过轻量级循环模块自适应决定音频-问题对的推理深度,以不到3%的参数增加在多个模型和基准上将平均准确率提升2.9至3.8个百分点。

链接:https://arxiv.org/abs/2610.06949

机构:Seoul National University(首尔大学); Shanghai Jiao Tong University(上海交通大学)

作者:Lee Seung-woo, Bowen Qi


5. SkillFormer: Skill-Decomposed Adaptation for Audio Language Models

SkillFormer:音频语言模型的技能分解适配

AI 总结:针对音频语言模型多技能联合训练中的干扰问题,提出SkillFormer,通过技能特定低秩适配器与学习路由器实现技能分解与动态组合,以不到4%的额外参数在三个基准上将平均准确率提升2.5至4.1个百分点。

链接:https://arxiv.org/abs/2610.07533

机构:Pusan National University(釜山国立大学); Shanghai Jiao Tong University(上海交通大学); Hanyang University(汉阳大学)

作者:Lee Seung-woo, Bowen Qi, Kim Min-jun, Jang Won-young


4. 数据集、基准与评测 | 1 篇

6. ImpactMat: Continuous Material Estimation for Inverse Impact Sound Rendering

ImpactMat:用于逆冲击声音渲染的连续材料估计

AI 总结:针对固定材料预设限制冲击声音渲染的问题,提出ImpactMat数据集和基准,并设计前馈模型从录音预测材料参数,实现连续材料估计与真实录音重渲染。

链接:https://arxiv.org/abs/2610.07061

机构:Korea Advanced Institute of Science and Technology(韩国科学技术院); Chung-Ang University(中央大学)

作者:Hyebin Cho, Bumsoo Kim, Joon son Chung


5. 安全、隐私与深度伪造音频 | 1 篇

7. Exposing and Mitigating Neural Codec Vulnerabilities in Audio Deepfake Detection

暴露并缓解音频深度伪造检测中的神经编解码器漏洞

AI 总结:本研究揭示神经编解码器压缩使现有音频深度伪造检测器性能大幅下降,提出PCL-NET方法,通过成对一致性学习微调XLS-R,将平均EER从28.67%降至12.77%,并构建了Audio Neural Codec-Spoof数据集。

链接:https://arxiv.org/abs/2610.07216

机构:University of Michigan-Flint(密歇根大学弗林特分校)

作者:Abdullah, Awais Khan, Khalid Mahmood Malik


6. 其他/综合语音音频 | 1 篇

8. Adapting a Latent Audio Diffusion Model to Historical Guqin Recordings: A Listening-Driven Case Study

将潜在音频扩散模型适配至历史古琴录音:一项以聆听为导向的案例研究

AI 总结:本研究通过微调潜在音频扩散模型适配器,并辅以专家盲听评估,成功将模型适配至历史古琴录音,实现了高质量的古琴风格音乐续奏与场景生成。

链接:https://arxiv.org/abs/2610.07486

机构:KTH Royal Institute of Technology(瑞典皇家理工学院)

作者:Huanchen Cai

受公众号正文长度限制,本文展示前 8 篇,当天共更新 18 篇。完整列表请访问 arXivDaily。