今日论文合集:CS.SD语音与音频 | 共 39 篇


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准

快速导航

1. 语音识别与关键词检测 2 篇

2. 语音合成与声音生成 8 篇

3. 说话人识别、验证与分离 3 篇

4. 语音增强、降噪与音频修复 2 篇

5. 音频事件检测与场景理解 3 篇

6. 音乐信息检索与音乐生成 3 篇

7. 低资源、多语言与方言语音 1 篇

8. 数据集、基准与评测 4 篇

9. 安全、隐私与深度伪造音频 6 篇

10. 其他/综合语音音频 7 篇

1. 语音识别与关键词检测 | 2 篇

1. Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

在线预测编码用于双模式自监督语音模型

AI 总结:提出在线预测编码(OPC)和双模式层归一化,通过多步未来预测正则化寄存器,缩小流式与非流式语音识别的性能差距。

链接:https://arxiv.org/abs/2606.21268

机构:LY Corporation; Carnegie Mellon University(卡内基梅隆大学)

作者:Keita Goto, Takashi Maekaku, Jin Sakuma, Jinchuan Tian, Yusuke Shinohara, Shinji Watanabe

2. From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection

从文本度量到模型内部:Whisper ASR幻觉检测研究

AI 总结:研究Whisper大模型在真实语音数据上的幻觉检测,通过文本、LLM和内部解码器状态三种方法,发现无参考文本时探测解码器表示性能最强,融合文本与内部状态的元分类器效果最佳。

链接:https://arxiv.org/abs/2606.23060

机构:Signal Processing Group, Institute of Electronics, AGH University of Krakow, Poland(信号处理组,电子学研究所,AGH克拉科夫大学,波兰)

作者:Jan Jasiński, Mateusz Barański, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

2. 语音合成与声音生成 | 8 篇

3. Imitation Learning for Elder-Facing Speech Synthesis

面向老年人的模仿学习语音合成

AI 总结:提出模仿学习框架,结合两阶段在线策略奖励学习改进GRPO,从专家演示中学习TTS模型,以解决老年人偏好数据获取困难的问题,在客观和主观指标上优于基线。

链接:https://arxiv.org/abs/2606.21053

机构:The Chinese University of Hong Kong(香港中文大学); Tencent Hunyuan(腾讯混元)

作者:Dongrui Han, Weidong Chen, Jiawen Kang, Mingyu Cui, Helen Meng, Xixin Wu

4. SDP-Codec: A Speaker-Decoupled Speech Codec with Pitch Injection for Low-Bitrate Coding and Zero-Shot Voice Conversion

SDP-Codec:一种带有音高注入的说话人解耦语音编解码器,用于低比特率编码和零样本语音转换

AI 总结:提出SDP-Codec,通过单阶段优化从预训练自监督编码器中提取局部令牌并注入归一化F0,实现说话人解耦,在低比特率下达到竞争性重构和强零样本语音转换,且说话人泄露最少。

链接:https://arxiv.org/abs/2606.21157

机构:Graduate School of Culture Technology, KAIST(韩国科学技术院文化技术研究生院)

作者:Hounsu Kim, Juhan Nam

5. DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

DisSpeech: 面向ASR增强的低资源可控普通话口吃语音合成

AI 总结:提出基于离散语音令牌的框架DisSpeech,通过显式口吃事件标签控制不同不流畅模式,结合非自回归掩码生成Transformer和韵律感知声学重建,在少于50小时数据下实现高质量可控口吃语音合成,有效提升ASR性能。

链接:https://arxiv.org/abs/2606.21457

机构:TMCC, College of Computer Science, Nankai University, Tianjin, China(天津南开大学计算机科学与技术学院TMCC)

作者:Yao Lu

6. Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead

基于有限前瞻的流式T5文本到语音合成

AI 总结:提出S5-TTS,一种基于T5的流式变体,通过编码器-解码器语言模型和单调对齐学习实现逐词增量语音合成,并引入前瞻因果掩码和交错多源蒸馏以在低延迟下保持质量。

链接:https://arxiv.org/abs/2606.21882

机构:NVIDIAChina(英伟达中国); NVIDIAUSA(英伟达美国)

作者:Muyang Du, Jason Roche, Junjie Lai

7. AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation

AugCodec:通过数据增强的低比特率解耦神经语音编解码器

AI 总结:提出AugCodec,利用数据增强将语音分解为语义、说话人和韵律三种令牌,在12.5Hz低比特率下实现优于现有方法的重建质量和解耦性能。

链接:https://arxiv.org/abs/2606.21893

机构:Amazon, USA(亚马逊(美国))

作者:Dongmei Wang, Xiaohang Sun, Yang Liu, Fanjie Kong, Abhishek Yanamandra, Abhinav Jain, Daniel Tompkins, Woohyun Kang, Najmeh Sadoughi, Sunil Hadap, Xiang Hao, Zhu Liu, Caren Chen

8. ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

ISCSLP 2026 CoT-TTS挑战赛:面向上下文感知文本转语音的思维链推理

AI 总结:针对现有可控TTS系统难以自动推断复杂对话场景中说话方式的问题,提出CoT-TTS挑战赛,要求系统从上下文推断说话方式并生成语音,包含文本和音频两个赛道,采用思维链推理和语音波形输出。

链接:https://arxiv.org/abs/2606.21933

机构:The Hong Kong University of Science and Technology(香港科技大学); China Mobile(中国移动); Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd., China Mobile(九天人工智能技术(北京)有限公司,中国移动); China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院); Nanjing University(南京大学)

作者:Wei Xue, Junlan Feng, Shilei Zhang, Yue Wang, Ruosong Yang, Bei Liu, Liumeng Xue, Sitong Cheng, Jiahao Pan, Weizhen Bian, Boyi Kang, Bin Long

9. Physics-Informed Neural Operator for Speech Production Analysis

物理信息神经算子用于语音产生分析

AI 总结:提出首个基于物理信息神经算子的语音产生分析方法,直接学习一维波动方程,无需预计算监督数据,实现高效GPU并行模拟。

链接:https://arxiv.org/abs/2606.22364

机构:Department of Mechanical Engineering, Nagaoka University of Technology(长冈技术科学大学机械工程系); Schulich School of Music, McGill University(麦吉尔大学舒立克音乐学院); Department of Electrical and Computer Engineering, University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系)

作者:Kazuya Yokota, Xinmeng Luan, Debasish Ray Mohapatra, Gary Scavone, Sidney Fels

10. Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS

合成Lombard效应:TTS中语音清晰度和发声努力的多级控制

AI 总结:提出基于流匹配的TTS模型,利用发声努力和发音伪标签实现连续解耦控制及词级强调,模拟Lombard效应,提升嘈杂环境下的语音清晰度。

链接:https://arxiv.org/abs/2606.23176

机构:Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院); Carnegie Mellon University (CMU)(卡内基梅隆大学); KIT Campus Transfer (KCT)(KIT校园转移中心)

作者:Seymanur Akti, Alexander Waibel

3. 说话人识别、验证与分离 | 3 篇

11. LISE : Listenable Interpretable Speaker Embeddings

LISE: 可听可解释的说话人嵌入

AI 总结:提出LISE框架,将预训练说话人嵌入分解为少量可解释分量,在保持说话人验证性能的同时,通过听辨实验证明其可解释性。

链接:https://arxiv.org/abs/2606.21305

机构:University of Southampton(南安普顿大学); The Hong Kong Polytechnic University(香港理工大学); University of Edinburgh(爱丁堡大学)

作者:Xiaoliang Wu, Chongxin Gan, Ke Liu, Peter Bell, Jennifer Williams

12. Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

面向开放集说话人属性预测的关键词附加大语言模型嵌入

AI 总结:提出利用大语言模型嵌入进行开放集说话人属性预测,通过关键词附加策略和top-k负损失,在LibriTTS-P上超越闭集基准并泛化到未见同义词。

链接:https://arxiv.org/abs/2606.21979

机构:Department of Intelligence and Information, Seoul National University(首尔大学情报信息学系); Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能跨学科项目); Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

作者:Byoungjun So, Jaejun Lee, Kyogu Lee

13. Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification

Kiwano:一个尖端的开源说话人验证工具包

AI 总结:本文介绍Kiwano,一个基于PyTorch的轻量级可扩展开源工具包,提供标准化流程、预训练模型和多种架构集成,旨在降低门槛并标准化评估,推动说话人验证研究与开发。

链接:https://arxiv.org/abs/2606.22369

机构:Avignon University(阿维尼翁大学)

作者:Mickael Rouvier, Pierre Michel Bousquet

4. 语音增强、降噪与音频修复 | 2 篇

14. Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement

基于DNN的语音增强中用于音素重建的时频加权损失

AI 总结:提出一种时频加权框架,通过调制SDR目标以强调高语音-噪声竞争和瞬态线索,改善音素重建,尤其提高辅音识别准确率。

链接:https://arxiv.org/abs/2606.21635

机构:CNRS(法国国家科学研究中心); Inria(法国国家信息与自动化研究所); LORIA(洛林计算机科学及其应用实验室)

作者:Nasser-Eddine Monir, Paul Magron, Romain Serizel

15. Improving Engine Sound Analysis in Hot-Test Environments via a RAB-U-Net (Residual Attention Block U-Net) Noise Removal Method

通过RAB-U-Net(残差注意力块U-Net)降噪方法改进热试环境中的发动机声音分析

AI 总结:提出一种基于残差注意力块增强U-Net的深度学习降噪方法,用于生产线上发动机热试时的背景噪声去除,显著提升发动机声音分析准确度。

链接:https://arxiv.org/abs/2606.21887

机构:K. N. Toosi University of Technology(K. N. 图西科技大学)

作者:Raheleh Mohseni, Mahdi Alyari

5. 音频事件检测与场景理解 | 3 篇

16. CoughPhase-CLR: Designing an acoustics-informed foundation model for coughing sound classification

CoughPhase-CLR:面向咳嗽声音分类的声学信息基础模型设计

AI 总结:提出自监督学习框架CoughPhase-CLR,利用咳嗽的生理相位构建正样本对进行表征学习,在COVID-19检测、COPD状态分类等下游任务中优于标准随机裁剪方法。

链接:https://arxiv.org/abs/2606.21411

机构:Chair of Health Informatics at the TUM University Hospital(慕尼黑工业大学大学医院健康信息学教席); Munich Center for Machine Learning(慕尼黑机器学习中心); Munich Data Science Institute(慕尼黑数据科学研究所); University Hospital Augsburg at the University of Augsburg(奥格斯堡大学奥格斯堡大学医院); Medical Faculty, Ludwig Maximilians University of Munich(慕尼黑路德维希-马克西米利安大学医学院); Group on Language, Audio, & Music at Imperial College London(帝国理工学院语言、音频与音乐组); Technical University of Munich(慕尼黑工业大学)

作者:Marius Moldovan, Anton Batliner, Thomas M. Berghaus, Björn W. Schuller, Andreas Triantafyllopoulos

17. InstructFX2FX: A Multi-turn Text-to-Preset Demo for Iterative Audio Effect Refinement

InstructFX2FX: 用于迭代音频效果优化的多轮文本到预设演示

AI 总结:提出InstructFX2FX,一种多轮文本引导的音频效果优化演示,结合语言模型和CLAP引导优化,实现迭代效果调整,相比纯LLM重提示基线将平均MMD降低约24%。

链接:https://arxiv.org/abs/2606.22005

机构:Center for New Music and Audio Technologies (CNMAT)(新音乐与音频技术中心)

作者:Song-Ze Yu, Milan Liessens Dujardin, Yuxuan Cai, Wantong Zhang

18. An Analysis of Untrained Deep Reservoir Networks for Audio Surveillance

面向音频监控的未训练深度储备池网络分析

AI 总结:本文研究基于储备池计算的未训练循环模型,通过不同深度的双向回声状态网络进行紧急声音事件检测,在MIVIA数据集上评估深度、识别性能和计算效率的权衡,表明深度变体在噪声下更鲁棒,浅层变体在边缘设备上效率更优。

链接:https://arxiv.org/abs/2606.22218

机构:Department of Computer Science University of Pisa Pisa, Italy (ORCID: 0009-0002-6500-9578); Department of Computer Science University of Pisa Pisa, Italy (ORCID: 0000-0001-8504-1503)

作者:Corrado Baccheschi, Patrizio Dazzi

6. 音乐信息检索与音乐生成 | 3 篇

19. LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU

LK Jam:使用角色感知GRU的实时人机交互音乐生成系统的系统架构与实现

AI 总结:提出LK_Jam系统,基于轻量级GRU和高性能音频主机架构,通过多维稀疏事件流和角色感知编码实现低延迟双向人机交互音乐生成,采用三阶段渐进训练策略提升交互质量。

链接:https://arxiv.org/abs/2606.21018

机构:Shenyang Conservatory of Music(沈阳音乐学院)

作者:Yakun Liu, Zhiyu Jin, Dong Liu, Hai Luan

20. Improving Text-to-Music Generation with Human Preference Rewards

利用人类偏好奖励改进文本到音乐生成

AI 总结:提出结合人类偏好奖励(TuneJury)的文本到音乐生成方法,通过训练时奖励条件化、专家迭代、偏好微调等五项工程决策,在ATTM挑战中提升FAD-CLAP和CLAP分数。

链接:https://arxiv.org/abs/2606.21670

机构:Georgia Tech(佐治亚理工学院); KAIST(韩国科学技术院); Peking University(北京大学); Queen Mary University of London(伦敦玛丽女王大学); Carnegie Mellon University(卡内基梅隆大学)

作者:Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Chris Donahue

21. Libretto: Giving LLM Agents a Sense of Musical Structure

Libretto:赋予LLM智能体音乐结构感

AI 总结:提出Libretto框架,通过LLM原生语法(显式起始槽、声部、小节组织)和基于语料库的统计评估(节奏、和声、旋律等),实现符号音乐的生成、诊断与迭代自修正,将符号音乐转化为可测量、可编辑的对象。

链接:https://arxiv.org/abs/2606.22708

机构:University of California, Berkeley(加州大学伯克利分校)

作者:Yichen Xu

7. 低资源、多语言与方言语音 | 1 篇

22. Cross-lingual Retrieval-Augmented Classification for Dysarthria Severity Assessment

跨语言检索增强分类用于构音障碍严重程度评估

AI 总结:提出跨语言检索增强分类(CRAC)方法,通过对齐-检索-融合流程利用另一种语言的语音数据,在说话人无关的三分类任务中,韩语和意大利语数据集上分别达到87.3%和86.7%的平衡准确率,比单语基线提升8.4和20.0个百分点。

链接:https://arxiv.org/abs/2606.22910

机构:Department of Artificial Intelligence, Sogang University, South Korea(韩国西江大学人工智能系)

作者:Taeyoung Jeong, Insung Lee, Du-Seong Chang, Myoung-Wan Koo

8. 数据集、基准与评测 | 4 篇

23. AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?

AI 总结:提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。

链接:https://arxiv.org/abs/2606.21147

作者:Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee

24. ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

ATCCaps: 一个面向空中交通管制识别的呼号感知语音数据集

AI 总结:本文提出ATCCaps,一个基于真实无线电通话构建的呼号感知语音数据集,包含202.94小时音频和17万条话语,通过结合置信度感知的转录解析、ADS-B呼号元数据、规则过滤和LLM辅助字幕生成,支持ASR评估、呼号匹配和音频-文本检索。

链接:https://arxiv.org/abs/2606.22399

机构:East China University of Science and Technology(华东理工大学)

作者:Dongdong Li, Jianwei Song, Jianwei Wang, Zhe Wang

25. Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

高效扩展音频模型:计算约束与优化行为的联合研究

AI 总结:针对ASR和SER任务,提出统一框架分析模型大小、输入长度和表示分辨率三个计算维度,在固定预算下优化资源分配,发现非线性缩放行为并确定最优操作点。

链接:https://arxiv.org/abs/2606.22790

机构:University of Maryland(马里兰大学)

作者:Vyom Agarwal, Mokshda Gangrade, Siddharth Pal, Jerry Wu

26. HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems

HALAS:现代ASR系统幻觉的人工标注数据集

AI 总结:提出HALAS,首个针对真实语音中ASR系统幻觉的人工标注数据集,揭示跨模型词汇重叠及低WER下的幻觉现象,并建立首个非人工基准。

链接:https://arxiv.org/abs/2606.23048

机构:Signal Processing Group, Institute of Electronics, AGH University of Krakow, Poland(信号处理组,电子学院,AGH克拉科夫大学,波兰)

作者:Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

9. 安全、隐私与深度伪造音频 | 6 篇

27. Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks

利用神经音频编解码器潜变量进行对抗性音频攻击

AI 总结:提出在神经音频编解码器连续潜空间中生成对抗性扰动的方法,实现单次前向传播、低延迟(<7ms)的高成功率(99%)目标攻击。

链接:https://arxiv.org/abs/2606.20893

机构:Dept. of Computer Science and Engineering, University of North Texas(北德克萨斯大学计算机科学与工程系)

作者:Sameek Bhattacharya, Bharath Krishnamurthy, Ajita Rattani

28. Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning

通过TTS生成投毒对语音情感识别的后门攻击

AI 总结:首次系统研究基于投毒的后门攻击对语音情感识别的影响,利用TTS生成音频嵌入隐蔽低能量声学触发器,实现高成功率攻击并揭示自监督表示的脆弱性。

链接:https://arxiv.org/abs/2606.21052

作者:Yongbin Huang, Xihao Xie, Jia Zhang

29. LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

LambdaMark: 面向鲁棒性和放射性的语义音频水印

AI 总结:提出LambdaMark,首个通用放射性水印方案,通过将多比特水印嵌入语义音频潜在表示实现鲁棒性和放射性,实验证明在常见失真和去除攻击下表现优异。

链接:https://arxiv.org/abs/2606.21365

机构:University of Toronto, Canada(多伦多大学,加拿大)

作者:Kexin Li, Xiao Hu, Ilya Grishchenko, David Lie

30. When EER Hides Deployment Failure: Auditing Threshold Transfer and Unlabeled Score Calibration for Speech Deepfake Detectors

当EER掩盖部署失败:语音深度伪造检测器的阈值迁移与无标签分数校准审计

AI 总结:本文审计了语音深度伪造检测器在部署时因阈值迁移导致的性能下降,发现等错误率(EER)无法反映实际错误,并证明常见无标签校准方法无法改善EER,建议同时报告迁移阈值下的半总错误率(HTER)。

链接:https://arxiv.org/abs/2606.21584

机构:Xidian University(西安电子科技大学)

作者:Jingwen Zhou, Mingzhe Wang

31. Learning to Evade: Adaptive Attacks on Audio Watermarking

学习规避:针对音频水印的自适应攻击

AI 总结:提出自适应音频水印攻击方法AWM,通过两阶段优化和分布参数估计,在保持高成功率的同时绕过检测器,检测率低于10%。

链接:https://arxiv.org/abs/2606.22310

机构:University of Missouri-Kansas City(密苏里大学堪萨斯城分校); University of Hawaii at Manoa(夏威夷大学马诺阿分校); University of South Florida(南佛罗里达大学); Michigan State University(密歇根州立大学); University of Miami(迈阿密大学)

作者:Weikang Ding, Hanqing Guo, Rui Duan, Guangjing Wang, Yuanda Wang, Mingzhe Chen, Qiben Yan

32. The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection

水印捷径:来源标记如何破坏音频深度伪造检测

AI 总结:发现合成语音水印导致检测器依赖“水印=>伪造”捷径,引发泛化下降、去除水印逃逸和真实语音被误判为伪造三种故障,实验表明水印训练检测器错误率从16%升至75%,但双类水印重训练可消除捷径。

链接:https://arxiv.org/abs/2606.23335

机构:German Federal Ministry of Education and Research(德国联邦教育与研究部)

作者:Nicolas M. Müller, Pascal Debus

10. 其他/综合语音音频 | 7 篇

33. A Generalized Formalism of Auto-Regressive Decoding for Speech Processing

语音处理中自回归解码的广义形式化描述

AI 总结:针对语音处理中自回归解码策略缺乏统一框架的问题,提出广义理论形式化,明确分类标准并简化基准设计,支持聚焦搜索策略的消融研究。

链接:https://arxiv.org/abs/2606.20714

机构:Knowledge Technology, Department of Informatics, University of Hamburg, Germany(德国汉堡大学信息学系知识技术实验室)

作者:Julia Gachot, Philipp Allgeuer, Marie S. Bauer, Stefan Wermter

34. An implicitization-based solution to the minimal 4s/6r ToA problem using Cayley--Menger determinants

基于Cayley-Menger行列式的极小4s/6r ToA问题的隐式化解法

AI 总结:提出一种利用Cayley-Menger行列式和隐式化技术的高效代数求解器,解决4发6收的到达时间自定位问题,数值精度比现有方法高约三个数量级,速度提升1.3倍。

链接:https://arxiv.org/abs/2606.20840

机构:South Ural State University(南乌拉尔国立大学)

作者:Evgeniy Martyushev

35. Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

Bagpiper-Edit: 基于丰富描述的零样本开放式音频编辑

AI 总结:提出Bagpiper-Edit,通过将音频编辑转化为丰富描述重写任务,实现零样本、自由形式的开放式音频编辑,无需配对训练数据,在语音、音乐和声音上均表现良好。

链接:https://arxiv.org/abs/2606.21227

机构:Auditory Cognition and Computational Acoustics Lab, Shanghai Jiao Tong University(上海交通大学听觉认知与计算声学实验室); Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

作者:Xun Gong, Jinchuan Tian, Haoran Wang, William Chen, Shinji Watanabe, Yanmin Qian

36. Sea-Scan: High-Accuracy, ML-based Dark Vessel Detection and Localisation via Weakly Supervised DAS Monitoring

Sea-Scan: 基于弱监督DAS监测的高精度ML黑暗船只检测与定位

AI 总结:提出一种基于弱监督学习的ML船只检测与定位系统,利用不完美AIS标签训练,在1.98%误触发率下达到97.8%检测率,成功识别未标记数据中的黑暗船只事件。

链接:https://arxiv.org/abs/2606.21326

机构:School of Computer Science and Statistics, IRIS Research Group, ADAPT Research Centre, Trinity College Dublin(都柏林圣三一大学计算机科学与统计学院、IRIS研究组、ADAPT研究中心); School of Engineering, ADAPT Research Centre, Trinity College Dublin(都柏林圣三一大学工程学院、ADAPT研究中心)

作者:Tian Tian, Agastya Raj, Lara Flanagan, John Kennedy, Marco Ruffini

37. Direct Raw Audio Signal Processing via Reservoir Computing: An Investigation into &#x27;Feature-Free&#x27; Architectures

通过储层计算进行直接原始音频信号处理:对“无特征”架构的研究

AI 总结:本文评估储层计算作为音频处理的自主“无特征”框架,通过直接分类原始声学信号,消除手工特征提取,并比较浅层、序列和并行深度储层架构,发现并行方法在低复杂度下性能最优。

链接:https://arxiv.org/abs/2606.21335

机构:School of PET, University of York(约克大学PET学院); Department of Computer Science, University of York(约克大学计算机科学系)

作者:Rinku Sebastian, Simon O Keefe, Martin A Trefzer

38. Gradient-Based Learning of Parametric Engine Sound Representations for Real-Time Resynthesis and Tuning on Embedded Systems

基于梯度的参数化引擎声音表示学习用于嵌入式系统的实时重合成与调谐

AI 总结:提出一种基于神经网络和梯度优化的引擎声音建模方法,通过分析-合成学习紧凑参数表示,实现高保真重合成并兼容现有汽车音频框架,在嵌入式平台上验证可行性。

链接:https://arxiv.org/abs/2606.21521

机构:Impulse Audio Lab GmbH(脉冲音频实验室有限公司)

作者:Robin Doerfler, Matthieu Kuntz, Clemens Zimmer

39. What Do Neural Networks Learn for TDOA Estimation? A Cross-Architecture Probing Study

神经网络在TDOA估计中学到了什么?跨架构探针研究

AI 总结:通过探针分析三种神经网络架构,发现网络学习到跨功率计算和幅度感知频率加权,而非PHAT白化,且去除PHAT可提升加性噪声下的性能。

链接:https://arxiv.org/abs/2606.22020

机构:Department of Systems and Control Engineering, Institute of Science Tokyo(系统与控制工程系,东京科学大学)

作者:Yaozhong Kang, Jiang Wang, Runwu Shi, Takeshi Ashizawa, Benjamin Yen, Kazuhiro Nakadai