今日论文合集:cs.SD语音42篇,eess.AS音频处理44篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


cs.SD语音


【1】FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
标题:FocalCodec-Stream:通过因果蒸馏流传输低比特率语音编码
链接:https://arxiv.org/abs/2509.16195

备注:5 pages, 1 figure
摘要:神经音频编解码器是现代生成音频管道的基本组成部分。虽然最近的编解码器实现了强大的低比特率重建,并为下游任务提供了强大的表示,但大多数编解码器都是不可流式传输的,限制了它们在实时应用中的使用。我们提出了FocalCodec流,一种混合编解码器的基础上,焦点调制,语音压缩成一个单一的二进制码本在0.55 - 0.80 kbps的理论延迟为80毫秒。我们的方法结合了多阶段的因果蒸馏WavLM有针对性的架构改进,包括一个轻量级的精炼模块,提高质量下的延迟约束。实验表明,FocalCodec-Stream在相当的比特率下优于现有的流式编解码器,同时保留语义和声学信息。结果是在重建质量、下游任务性能、延迟和效率之间的有利权衡。代码和检查点将在https://github.com/lucadellalib/focalcodec上发布。


【2】Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
标题:Fed-PISA:通过个性化身份风格适应进行联合语音克隆
链接:https://arxiv.org/abs/2509.16010

摘要:文语转换(TTS)中的语音克隆旨在利用目标说话人的有限数据从文本中生成富有表达力和个性化的语音。联邦学习(FL)为这项任务提供了一个协作和隐私保护的框架,但现有的方法遭受高通信成本,往往抑制风格的异质性,导致个性化不足。为了解决这些问题,我们提出了Fed-PISA,它代表联合个性化身份风格适应。为了最大限度地降低通信成本,Fed-PISA引入了一种解纠缠的低秩自适应(LoRA)机制:说话者的音色通过私有ID-LoRA保留在本地,而只向服务器传输轻量级风格-LoRA,从而最大限度地减少参数交换。为了利用异质性,我们的聚合方法,灵感来自协同过滤,介绍了创建自定义模型,为每个客户端从风格相似的同行学习。实验表明,Fed-PISA提高了风格的表现力,自然度和说话人相似性,以最小的通信成本优于标准的联邦基线。


【3】EmoHeal: An End-to-End System for Personalized Therapeutic Music Retrieval from Fine-grained Emotions
标题:DeliverHeal:一个从细粒度情绪中进行个性化治疗音乐检索的端到端系统
链接:https://arxiv.org/abs/2509.15986

备注:5 pages, 5 figures. Submitted to the 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2026)
摘要:现有的数字心理健康工具往往忽视了日常挑战背后的微妙情绪状态。例如,全球有超过15亿人受到睡前焦虑的影响,但目前的方法基本上仍然是静态的,“一刀切”,无法适应个人需求。在这项工作中,我们提出了一个端到端的系统,提供个性化的,三阶段的支持性叙述。Escherheal通过微调的XLM-RoBERTa模型从用户文本中检测27种细粒度的情绪,通过基于音乐治疗原理(GEMS,iso-principle)的知识图将它们映射到音乐参数。SeaHeal使用CLAMP 3模型检索视听内容,以引导用户从当前状态转向更平静的状态(“匹配-引导-目标”)。一项受试者内研究(N=40)显示了显著的支持效果,参与者报告了显著的情绪改善(M=4.12,p<0.001)和高感知情绪识别准确性(M=4.05,p<0.001)。感知准确性和治疗结果之间的强相关性(r=0.72,p<0.001)验证了我们的细粒度方法。这些发现确立了理论驱动的、情感感知的数字健康工具的可行性,并为音乐治疗原则的实施提供了可扩展的人工智能蓝图。


【4】Compose Yourself: Average-Velocity Flow Matching for One-Step Speech Enhancement
标题:整理自己:平均速度流匹配用于一步语音增强
链接:https://arxiv.org/abs/2509.15952

备注:5 pages, 2 figures, submitted to ICASSP 2026
摘要:扩散和流匹配(FM)模型在语音增强(SE)中取得了显著的进展,但它们依赖于多步生成,计算量大,容易受到离散化误差的影响。一步生成建模,特别是MeanFlow的最新进展,通过平均速度场重新制定动态提供了一个有前途的替代方案。在这项工作中,我们提出了COSE,一个一步FM框架定制SE。为了解决MeanFlow中Jacobian向量积(JVP)计算的高训练开销,我们引入了速度合成恒等式来有效地计算平均速度,消除了昂贵的计算,同时保持理论一致性并实现有竞争力的增强质量。在标准基准测试上进行的大量实验表明,COSE的采样速度提高了5倍,训练成本降低了40%,而所有这些都不会影响语音质量。代码可在https://github.com/ICDM-UESTC/COSE上获得。


【5】Reverse Engineering of Music Mixing Graphs with Differentiable Processors and Iterative Pruning
标题:具有可区分处理器和迭代修剪的音乐混音图的反向工程
链接:https://arxiv.org/abs/2509.15948

备注:JAES, extension of arxiv.org/abs/2408.03204 and arxiv.org/abs/2406.01049
摘要:音乐混音的逆向工程旨在揭示如何处理和组合干燥的源信号以产生最终混音。我们扩展了以前的作品,以反映混合和搜索的音频处理器的图形的组成性质。首先,我们构建一个混音控制台,将所有可用的处理器应用于每个音轨和子组。对于可微处理器实现,我们使用梯度下降优化其参数。然后,我们重复删除可忽略不计的处理器并微调剩余处理器的过程。通过这种方式,可以保留完整混音控制台的质量,同时去除大约三分之二的处理器。所提出的方法不仅可以用于分析单个音乐混音,而且可以用于收集可用于下游任务的大规模图形数据,例如,自动混合特别是对于后一个目的,搜索的有效执行是至关重要的。为此,我们提出了一种高效的批处理方法,并行计算多个处理器。我们还利用处理器的“干/湿”参数来加速搜索。大量的定量和定性分析进行评估所提出的方法的性能,行为和计算成本。


【6】Differentiable Acoustic Radiance Transfer
标题:差异声辐射传输
链接:https://arxiv.org/abs/2509.15946

摘要:几何声学是室内声学建模的一种有效方法,它由正则的时变渲染方程控制。声辐射传递(ART)通过离散化求解方程,模拟具有柔性材料特性的表面贴片之间的时间和方向相关的能量交换。我们介绍DART,一个微分和有效的实现ART,使基于梯度的材料性能优化。我们评估DART的声场学习任务,其目的是预测新的源-接收器设置的能量响应的一个简单的变体。实验结果表明,DART具有良好的性能,例如,与现有的信号处理和神经网络基线相比,在稀疏测量场景下具有更好的泛化能力,同时保持简单,完全可解释的系统。


【7】DISPATCH: Distilling Selective Patches for Speech Enhancement
标题:DISPATCH:提取语音增强的选择性补丁
链接:https://arxiv.org/abs/2509.15922

备注:submitted to ICASSP 2026
摘要:在语音增强中,知识蒸馏(KD)通过将高容量的教师的知识转移到紧凑的学生来压缩模型。然而,传统的KD方法训练学生完全模仿教师的输出,这迫使学生模仿教师表现不佳的区域,并将蒸馏应用于学生已经表现良好的区域,这仅产生边际收益。我们提出了蒸馏选择性补丁(DISPatch),语音增强的KD框架,适用于蒸馏损失的频谱图补丁,教师优于学生,由知识差距分数确定。这种方法引导优化对学生的改进最显着的潜力,同时最大限度地减少教师可能提供不可靠的指导区域的影响。此外,我们介绍了多尺度选择性补丁(MSSP),频率依赖的方法,使用不同的补丁大小在低和高频段占频谱异质性。我们将DISPatch纳入传统的KD方法,并观察到一致的收益紧凑的学生。此外,将DISPatch和MSSP集成到最先进的频率相关KD方法中,可显著提高所有指标的性能。


【8】From Independence to Interaction: Speaker-Aware Simulation of Multi-Speaker Conversational Timing
标题:从独立到交互:说话人感知的多说话人会话计时仿真
链接:https://arxiv.org/abs/2509.15808

备注:Submitted to ICASSP 2026
摘要:我们提出了一种说话人感知的方法来模拟多说话人的对话,捕捉时间的一致性和现实的话轮转换动态。以前的工作通常模型聚合会话统计下的独立性假设跨扬声器和轮。相比之下,我们的方法使用特定于扬声器的偏差分布,执行扬声器内的时间一致性,而马尔可夫链管理轮流和固定的房间脉冲响应保留空间现实主义。我们还统一暂停和重叠成一个单一的间隙分布,建模与核密度估计平滑的连续性。使用内在指标-全局间隙统计,连续间隙之间的相关性,基于Copula的高阶依赖关系,话轮转换熵和间隙生存函数-对Switchboard的评估表明,说话人感知模拟比基线方法更好地与真实的会话模式保持一致,捕获细粒度的时间依赖关系和现实的说话人交替,同时揭示了在建模长距离会话结构方面的挑战。


【9】CompSpoof: A Dataset and Joint Learning Framework for Component-Level Audio Anti-spoofing Countermeasures
标题:CompSpoof:用于学生级音频反欺骗对策的数据集和联合学习框架
链接:https://arxiv.org/abs/2509.15804

摘要:伪造级音频欺骗(Comp-Spoof)针对一种新形式的音频操纵,其中只有特定的信号成分(如语音或环境声音)被伪造或替代,而其他成分保持真实。现有的反欺骗数据集和方法将话语或片段视为完全真实的或完全欺骗的,并且因此不能准确地检测组件级欺骗。为了解决这个问题,我们构建了一个新的数据集CompSpoof,它涵盖了真实和欺骗语音以及环境声音的多种组合。我们进一步提出了一个分离增强的联合学习框架,该框架将音频组件分开,并将反欺骗模型应用于每个组件。采用联合学习,保留与检测相关的信息。大量的实验表明,我们的方法优于基线,突出了单独的组件的必要性和每个组件分别检测欺骗的重要性。数据集和代码可在https://github.com/XuepingZhang/CompSpoof上获得。


【10】EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
标题:CLARQ:通过语音感知Q-former和大型语言模型进行语音情感识别
链接:https://arxiv.org/abs/2509.15775

备注:5 pages, 2 figures
摘要:语音情感识别(SER)的性能受到单模态系统中情感信息不足和多模态系统中特征对齐困难的限制。近年来,多模态大语言模型(MLLM)在SER方面取得了一定的进展,但在复杂情感推理中仍存在幻觉和误分类问题。为了解决这些问题,我们提出了一个基于MLLM的框架,称为MALIQ,它生成的查询嵌入,融合多模态信息,通过MALQ-Former,并使用多目标情感学习(MAL),以实现协同优化。该框架还提供了一个软提示注入策略,注入多模态表示到LLM。这种端到端架构在IEMOCAP和MELD数据集上实现了最先进的性能,为SER提供了一种新的多模态融合范例。


【11】SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
标题:SONAR:自蒸馏连续预训练域自适应音频表示
链接:https://arxiv.org/abs/2509.15703

备注:Submitted to ICASSP 2026
摘要:像AudioSet这样的大规模数据集上的自监督学习(SSL)已经成为音频表示学习的主导范式。虽然新的、未标记的音频的不断涌入为丰富这些静态表示提供了机会,但一种天真的方法是使用所有可用的数据从头开始重新训练模型。然而,这种方法在计算上是禁止的,并且丢弃了嵌入在先前训练的模型权重中的有价值的知识。为了解决这种效率低下的问题,我们提出了SONAR(Self-distilled concontinual pre-training for domain adaptive Audio Representation),这是一种基于BEAT的连续预训练框架。SONAR有效地适应新的领域,同时通过解决三个关键挑战来减轻灾难性遗忘:对新数据和先前数据实施联合采样策略,应用正则化来平衡特异性和通用性,以及动态扩展新声学模式的标记器码本。在四个不同的领域的实验表明,我们的方法实现了高适应性和强大的抵抗遗忘。


【12】Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
标题:微调大型多模式模型用于自动发音评估
链接:https://arxiv.org/abs/2509.15701

备注:submitted to ICASSP2026
摘要:自动发音评估(APA)是计算机辅助语言学习(CALL)的关键,需要在多个粒度和方面进行评估。大型多模态模型(LLM)为APA提供了新的机会,但其在细粒度评估中的有效性仍然不确定。这项工作研究微调LC30 APA使用Speechocean762数据集和私人语料库。微调显著优于zero-shot设置,并在单粒度任务上实现了与公共和商业系统相比具有竞争力的结果。该模型在单词和句子级别上表现良好,而音素级别的评估仍然具有挑战性。我们还观察到,皮尔逊相关系数(PCC)达到0.9,而斯皮尔曼的等级相关系数(SCC)保持在0.6左右,这表明SCC更好地反映了顺序一致性。这些研究结果突出了APA的承诺和限制,并指出未来的工作细粒度建模和排名感知评估。


【13】Direct Simultaneous Translation Activation for Large Audio-Language Models
标题:大型音频语言模型的直接同传激活
链接:https://arxiv.org/abs/2509.15692

摘要:同步语音到文本翻译(Simul-S2 TT)旨在实时将语音翻译成目标文本,在接收源语音输入的同时输出翻译,而不是等待整个话语被说出。Simul-S2 TT研究经常修改模型架构以实现读写策略。然而,随着大型音频语言模型(LALM)的兴起,一个关键的挑战是如何直接激活基础模型中的Simul-S2 TT功能,而无需额外的架构更改。在本文中,我们介绍了同步自动翻译(SimulSA),这是一种利用LALM固有的能力,通过随机截断语音和构建部分对齐翻译来获得同步数据的策略。通过将它们整合到离线SFT数据中,SimulSA有效地弥合了预训练期间的离线翻译和推理期间的同步翻译之间的分布差距。实验结果表明,与完全离线的SFT数据相比,仅增加约{\bf 1\%}的同时数据可以显著激活LALM的Simul-S2 TT能力,而无需修改模型架构或解码策略。


【14】Mamba-2 audio captioning: design space exploration and analysis
标题:Mamba-2音频字幕:设计空间探索与分析
链接:https://arxiv.org/abs/2509.15680

备注:Submitted to the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026). Under review
摘要:我们提出了一个音频字幕模型的Mamba-2大型语言模型的骨干,这是一个国家的最先进的(SOTA)的状态空间模型(SSM)。我们系统地探索设计空间:LLM大小,LoRA等级和连接器设计,利用Mamba-2相对于序列长度的线性时间复杂度。在基准测试中,与在相同数据集上训练的大型语言模型相比,我们的模型实现了强大的字幕性能,尽管使用了更少的参数。我们首次深入分析了LLM参数的数量、音频编码器微调策略、音频特征多样性以及不同的特征缩减或扩展技术如何影响性能。


【15】VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion
标题:VOX-KRIKRI:通过持续融合统一语音和语言
链接:https://arxiv.org/abs/2509.15667

摘要:我们提出了一个多模态融合框架,该框架将预训练的基于解码器的大型语言模型(LLM)和声学编码器-解码器架构(如Whisper)连接起来,旨在构建支持语音的LLM。而不是直接使用音频嵌入,我们探索一个中间的音频调节的文本空间作为一个更有效的对齐机制。我们的方法完全在连续文本表示空间中运行,通过跨模态注意力将Whisper的隐藏解码器状态与LLM的隐藏解码器状态融合,并支持离线和流模式。我们介绍\textit{VoxKrikri},第一个希腊语音LLM,并通过分析表明,我们的方法有效地调整表示跨模态。这些结果突出了连续空间融合作为多语言和低资源语音LLM的一条有前途的道路,同时实现了希腊语自动语音识别的最新结果,在基准测试中提供了平均$\sim20\%$的相对改进。


【16】TISDiSS: A Training-Time and Inference-Time Scalable Framework for Discriminative Source Separation
标题:TISDiSS:一个训练时和推理时可扩展的判别源分离框架
链接:https://arxiv.org/abs/2509.15666

备注:submitted to ICASSP 2026
摘要:源分离是语音、音乐和音频处理中的一项基本任务,它还为训练生成模型提供了更清晰、更大的数据。然而,在实践中提高分离性能往往取决于越来越大的网络,从而增加了培训和部署成本。受生成式建模的推理时间缩放的最新进展的启发,我们提出了训练时间和推理时间可缩放的鉴别源分离(TISDiSS),这是一个统一的框架,集成了早期分裂多丢失监督,共享参数设计和动态推理重复。TISDiSS通过调整推理深度而无需重新训练额外的模型,从而实现灵活的速度-性能权衡。我们进一步提供了对架构和训练选择的系统分析,并表明具有更多推理重复的训练可以提高浅推理性能,从而有利于低延迟应用程序。在标准语音分离基准测试上的实验表明,TISDiSS具有最先进的性能,参数数量减少,建立了自适应源分离的可扩展和实用的框架。


【17】Jamendo-QA: A Large-Scale Music Question Answering Dataset
标题:Jamendo-QA:一个大规模的音乐问题分类数据集
链接:https://arxiv.org/abs/2509.15662

备注:4 pages, 8 figures. Submitted to ICASSP 2026
摘要:我们介绍了Jamendo-QA,一个用于音乐问题分类(Music-QA)的大规模数据集。该数据集基于Jamendo平台的免费许可曲目构建,并使用Qwen-Omni模型自动注释。Jamendo-QA提供与音乐音频对齐的问答对和字幕,支持监督训练和zero-shot评估。我们的资源旨在填补音乐特定QA数据集的空白,并促进音乐理解,检索和生成应用的进一步研究。除了规模之外,Jamendo-QA还涵盖了各种流派、乐器和元数据属性,允许在各种音乐环境中进行强大的模型基准测试。我们还提供详细的数据集统计数据,并强调潜在的偏见,如流派和性别失衡,以指导公平的评估。我们将Jamendo-QA定位为一个可扩展且公开可用的基准,可以促进未来在音乐理解,多模态建模和面向音乐的QA系统的公平评估方面的研究。
摘要:We introduce Jamendo-QA, a large-scale dataset for Music Question Answering (Music-QA). The dataset is built on freely licensed tracks from the Jamendo platform and is automatically annotated using the Qwen-Omni model. Jamendo-QA provides question-answer pairs and captions aligned with music audio, enabling both supervised training and zero-shot evaluation. Our resource aims to fill the gap of music-specific QA datasets and foster further research in music understanding, retrieval, and generative applications. In addition to its scale, Jamendo-QA covers a diverse range of genres, instruments, and metadata attributes, allowing robust model benchmarking across varied musical contexts. We also provide detailed dataset statistics and highlight potential biases such as genre and gender imbalance to guide fair evaluation. We position Jamendo-QA as a scalable and publicly available benchmark that can facilitate future research in music understanding, multimodal modeling, and fair evaluation of music-oriented QA systems.


【18】SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
标题:SightSound-R1:从视觉到音频语言模型的跨模式推理提炼
链接:https://arxiv.org/abs/2509.15661

摘要:虽然大型音频语言模型(LALM)已经展示了最先进的音频理解能力,但它们在复杂音景中的推理能力仍然落后于大型视觉语言模型(LVLM)。与视觉领域相比,一个瓶颈是缺乏大规模的思想链音频数据来教授LALM逐步推理。为了规避这种数据和模态差距,我们提出了SightSound-R1,这是一个跨模态的蒸馏框架,可以在同一个视听问答(AVQA)数据集上将高级推理从较强的LVLM教师转移到较弱的LALM学生。SightSound-R1由三个核心步骤组成:(i)测试时间缩放,以生成LVLM教师的音频集中的思想链(CoT),(ii)音频接地验证,以过滤幻觉,以及(iii)带有监督微调(SFT)的蒸馏管道,然后是LALM学生的组相对策略优化(GRPO)。结果表明,SightSound-R1在域内AVQA测试集以及看不见的听觉场景和问题中都提高了LALM推理性能,优于预训练和仅标签提取的基线。因此,我们得出结论,视觉推理可以有效地转移到音频模型和规模与丰富的视听数据。


【19】EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
标题:EMO-RL:基于描述规则的强化学习增强型音频语言模型,用于广义语音情感识别
链接:https://arxiv.org/abs/2509.15654

备注:Accpeted by the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)
摘要:虽然大型音频语言模型(LALM)在听觉理解方面表现出色,但它们在情感计算场景中的性能,特别是在情感识别,推理和微妙的情感区分方面,仍然不是最佳的。强化学习(RL)的最新进展在提高LALM的推理能力方面显示出了希望。然而,两个关键挑战阻碍了RL技术直接应用于语音情感识别(SER)任务:(1)由模糊的情感边界引起的收敛不稳定性和(2)当使用相对小的模型(例如,7 B参数架构)。为了克服这些限制,我们引入了EMO-RL,这是一种新的框架,它将强化学习与两个关键创新结合在一起:情感相似性加权奖励(ESWR)和显式结构化推理(ESR)。基于预先训练的LALM,我们的方法采用了具有情感约束的组相关策略优化。综合实验表明,我们的EMO-RL训练策略可以显着提高LALM的情感推理能力,在MELD和IEMOCAP数据集上都取得了最先进的结果,跨数据集实验证明了泛化的强大优势。


【20】The Singing Voice Conversion Challenge 2025: From Singer Identity Conversion To Singing Style Conversion
标题:2025年歌声转换挑战:从歌手身份转换到演唱风格转换
链接:https://arxiv.org/abs/2509.15629

摘要:我们介绍了歌唱声音转换挑战赛的最新成果,这是一项旨在在受控环境中比较和理解不同声音转换系统的科学活动。相比于以往的迭代,只专注于转换歌手身份,今年我们还专注于转换歌手的演唱风格。为了创造一个可控的环境和全面的评估,我们开发了一个新的挑战数据库,引入了两个任务,开源基线,并进行了大规模的众包听力测试和客观评估。挑战运行了两个月,我们总共评估了26个不同的系统。大规模众包听力测试的结果显示,顶级系统的歌手身份得分与地面真实样本相当。然而,建模的演唱风格,从而实现高自然度仍然是一个挑战,在这项任务中,主要是由于在呼吸,滑音,颤音演唱风格的动态信息建模的困难。


【21】LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
标题:LibriTTS-VI:公共数据库和有效语音印象控制的新方法
链接:https://arxiv.org/abs/2509.15626

备注:Submitted to ICASSP 2026
摘要:对语音印象的细粒度控制(例如,使声音更明亮或更平静)是创建更可控的文本到语音的关键前沿。然而,这一新兴领域面临着两个关键挑战。第一个是印象泄漏的问题,其中合成的语音不期望地受到说话者的参考音频的影响,而不是单独指定的目标印象,第二个是缺乏公共的注释语料库。为了减少印象泄漏,我们提出了两种方法:1)一种训练策略,分别使用说话人身份的话语和同一说话人的另一个话语作为目标印象,以及2)一种新的无参考模型,仅从目标印象中生成说话人嵌入,实现了提高对泄漏的鲁棒性和方便的无参考生成的好处。客观和主观评价表明,可控性的显着改善。我们最好的方法减少了11维语音印象向量的均方误差从0.61到0.41客观和从1.15到0.92主观,同时保持高保真度。为了促进可重复的研究,我们引入了LibriTTS-VI,这是第一个以LibriTTS-R语料库为基础,以明确的注释标准发布的公共语音印象数据集。


【22】The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
标题:一切中的节奏:带屏蔽语言建模的音频录制鼓生成
链接:https://arxiv.org/abs/2509.15625

备注:ISMIR 2025
摘要:音乐家和非音乐家都使用有节奏的声音手势,如敲击和beatboxing,来表达鼓的模式。虽然这些手势有效地传达了音乐理念,但将这些理念实现为完整的鼓录音可能非常耗时,可能会破坏许多创意工作流程。为了弥合这一差距,我们提出了TRIA(节奏在任何东西),一个蒙面的Transformer模型映射节奏的声音姿态,高保真鼓录音。给定期望的节奏模式的音频提示和表示架子鼓音色的第二提示,TRIA产生以期望的音色演奏期望的节奏(具有适当的精心制作)的架子鼓的音频。主观和客观评估表明,在不到10小时的公开可用的鼓数据上训练的TRIA模型可以以zero-shot的方式在广泛的音色范围内生成高质量、忠实的声音姿态实现。


【23】De-crackling Virtual Analog Controls with Asymptotically Stable Recurrent Neural Networks
标题:利用渐进稳定的回归神经网络消除虚拟模拟控制
链接:https://arxiv.org/abs/2509.15622

摘要:递归神经网络用于虚拟模拟建模应用,以数字方式复制模拟硬件音频处理器的声音。硬件设备的控制可以用作这些网络的调节输入。一个常见的方法,这些模型引入控制条件是直接静态级联的控制与输入音频样本,我们显示产生音频文物随时间变化的条件下。在这里,我们推导出常用的递归神经网络的渐近稳定变量的约束条件,并证明递归神经网络的渐近稳定性可以消除零输入和时变条件下的模型输出的音频伪影。此外,我们的研究结果提出了一种可能的通用解决方案,以减轻其他音频神经网络架构(如卷积和状态空间模型)中的条件诱导伪影。


【24】Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
标题:鸡尾酒会中的思考:目标说话人自动语音识别的思想链和强化学习
链接:https://arxiv.org/abs/2509.15612

备注:submitted to ICASSP 2026
摘要:目标说话人自动语音识别(TS-ASR)旨在从鸡尾酒会场景中的多个说话人混合语音中转录指定目标说话人的语音。大型音频语言模型(LALM)的最新进展已经为TS-ASR带来了一些新的见解。然而,LALM架构中的TS-ASR任务仍有很大的优化空间。虽然思想链(CoT)和强化学习(RL)在某些语音任务中已被证明是有效的,但TS-ASR要求模型深入理解语音信号,区分不同的说话者,并处理重叠的话语,特别适合推理指导的方法。因此,我们提出了一个新的框架,将CoT和RL训练到TS-ASR的性能提高。构造了一个新的TS-ASR CoT数据集,首先在规则数据上训练TS-ASR模型,然后在CoT数据上进行微调。最后,使用选定的数据使用RL进一步训练模型,以增强广义推理能力。实验结果表明,通过CoT和RL训练,TS-ASR的性能得到了显着改善,与以前的TS-ASR在可比数据集上的工作相比,建立了最先进的性能。


【25】Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
标题:基于块的高分辨率有限量化语音预训练
链接:https://arxiv.org/abs/2509.15579

摘要:近十年来,随着语音技术的飞速发展,低延迟语音人机通信变得越来越必要。语音技术进步背后的主要因素之一是自我监督学习。大多数自监督学习算法都是基于完整的话语假设而设计的,如果存在部分话语,则必须做出妥协,这在流媒体应用中很常见。在这项工作中,我们提出了一个基于块的自监督学习(Chunk SSL)算法作为流媒体和离线语音预训练的统一解决方案。利用掩蔽预测损失来优化组块SSL,并且鼓励声学编码器在相同组块和先前组块中的未掩蔽帧的帮助下恢复那些掩蔽语音帧的索引。提出了一种复制和附加数据增强方法,以进行有效的基于块的预训练。Chunk SSL利用有限标量量化(FSQ)模块来离散化输入语音特征,我们的研究显示了高分辨率FSQ码本,即,词汇量高达几百万的码本有利于将知识从预训练任务转移到下游任务。在预训练期间采用组掩蔽预测损失以减轻由大码本引入的高存储器和计算成本。所提出的方法在两个语音到文本的任务,即,语音识别和语音翻译。在\textsc{Librispeech}和\textsc{Must-C}数据集上的实验结果表明,该方法在流媒体和离线模式下都能获得非常有竞争力的语音转文本任务结果。


【26】Contrastive Learning with Spectrum Information Augmentation in Abnormal Sound Detection
标题:异常声音检测中频谱信息增强的对比学习
链接:https://arxiv.org/abs/2509.15570

备注:Accepted CVIPPR 2024 April Xiamen China
摘要:孤立点暴露方法是解决无监督异常声音检测问题的一种有效方法。该方法的核心是如何使模型学习正态数据的分布空间。基于生物感知和数据分析,发现异常音频和噪声通常具有较高的频率。因此,我们提出了一种数据增强方法的高频信息的对比学习。这使得模型能够更加关注音频的低频信息,这代表了机器的正常操作模式。我们在DCASE 2020任务2上评估了所提出的方法。结果表明,我们的方法优于该数据集上使用的其他对比学习方法。我们还评估了我们的方法在DCASE 2022任务2数据集上的通用性。


【27】Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
标题:超越视频到SFX:具有环境意识的语音的视频到音频合成
链接:https://arxiv.org/abs/2509.15492

摘要:生成逼真的、上下文感知的音频在诸如视频游戏开发的现实世界应用中是重要的。虽然现有的视频到音频(V2 A)方法主要集中在Foley声音生成上,但是它们难以产生可理解的语音。同时,当前的环境语音合成方法仍然是文本驱动的,并且不能在时间上与动态视频内容对齐。在本文中,我们提出了超越视频到SFX(BVS),一种方法来生成同步音频与环境感知的可理解的语音给定的视频。我们介绍了一个两阶段的建模方法:(1)第一阶段是一个视频引导的音频语义(V2 AS)模型,预测统一的音频语义令牌的语音线索的条件下;(2)第二阶段是一个视频条件的语义到声学(VS 2A)模型,细化语义令牌到详细的声学令牌。实验证明了BVS在视频到上下文感知语音合成和沉浸式音频背景转换等场景中的有效性,消融研究进一步验证了我们的设计。我们的演示可以在~\href{https://xinleiniu.github.io/BVS-demo/}{BVS-Demo}上找到。


【28】A Novel Semantic Compression Approach for Ultra-low Bandwidth Voice Communication
标题:一种新颖的超低带宽语音通信语义压缩方法
链接:https://arxiv.org/abs/2509.15462

备注:5 pages, 2 figures. This work has been submitted to the IEEE for possible publication
摘要:虽然为压缩设计的现有语音音频编解码器利用有限形式的时间冗余并允许多尺度表示,但它们倾向于以相同的方式表示音频的所有特征。相比之下,为文本到语音和语音传输任务设计的生成语音模型最近被证明在将音频信号分解为基本不同特征的高级语义表示方面是有效的。在本文中,我们利用这种表示在一种新的语义通信方法,以实现较低的比特率,而不牺牲感知质量或适用于特定的下游任务。当以2- 4倍的低比特率编码时,我们的技术在转录,情感分析和说话者验证方面与现有的音频编解码器相匹配或优于现有的音频编解码器-特别是在感知质量和说话者验证方面超过Encodec,同时使用高达4倍的低比特率。


【29】Impact of Phonetics on Speaker Identity in Adversarial Voice Attack
标题:对抗性语音攻击中语音对说话者身份的影响
链接:https://arxiv.org/abs/2509.15437

备注:Additional figures for extended visualization: this https URL
摘要:语音中的对抗性扰动通过引入细微的波形修改对自动语音识别(ASR)和说话人验证构成严重威胁,这些波形修改对人类来说仍然是不可察觉的,但可以显著改变系统输出。虽然对端到端ASR模型的有针对性的攻击已经得到了广泛的研究,但这些扰动的语音基础及其对说话者身份的影响仍然没有得到充分的研究。在这项工作中,我们分析了语音水平的对抗音频,并表明扰动利用系统的混乱,如元音集中和辅音替换。这些失真不仅误导了转录,而且降低了语音线索说话人验证的关键,导致身份漂移。使用DeepSpeech作为我们的ASR目标,我们生成有针对性的对抗性示例,并评估它们对真实和冒名顶替样本中说话人嵌入的影响。16个语音不同的目标短语的结果表明,对抗性音频会导致转录错误和身份漂移,这突出了语音感知防御的必要性,以确保ASR和说话人识别系统的鲁棒性。


【30】BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition
标题:BiPQ:用于自我监督语音识别的双层自标记随机量化
链接:https://arxiv.org/abs/2509.15430

备注:5 pages including reference
摘要:语音是一个丰富的信号,标记的音频文本对是昂贵的,使得自监督学习对于可扩展的表示学习至关重要。语音SSL的一个核心挑战是生成既有信息又有效率的伪标签:强标签,如HuBERT中使用的标签,提高了下游性能,但依赖于外部编码器和多级管道,而BEST-RQ等高效方法则以较弱的标签为代价实现了简单性。我们提出了BiRQ,一个双层SSL框架,它结合了BEST-RQ的效率和HuBERT风格标签增强的改进优势。关键思想是重用模型本身的一部分作为伪标签生成器:中间表示由随机投影量化器离散化以产生增强的标签,而锚定标签直接从原始输入稳定训练并防止崩溃。训练被制定为一个有效的一阶双层优化问题,使用可微Gumbel-softmax选择端到端解决。这种设计消除了对外部标签编码器的需求,降低了内存成本,并以端到端的方式实现了迭代标签细化。BiRQ始终优于BEST-RQ,同时保持低复杂度和计算效率。我们在各种数据集上验证了我们的方法,包括960小时的LibriSpeech,150小时的AMI会议和5,000小时的YODAS,证明了与BEST-RQ相比的一致收益。


【31】Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech data
标题:探索有限语音数据下用于口语理解的大型音频语言模型的微调
链接:https://arxiv.org/abs/2509.15389

备注:4 pages (excluding references), 2 figures, submitted to ICASSP 2026
摘要:大型音频语言模型(LALM)已成为语音相关任务的强大工具,但仍有待进一步研究,尤其是在语音数据有限的情况下。为了弥合这一差距,我们系统地研究了不同的微调方案,包括纯文本,直接混合和课程学习如何影响口语理解(SLU),重点放在文本标签对丰富而配对语音标签数据有限的情况下。结果表明,LALM已经实现了竞争力的性能与纯文本微调,突出了他们强大的泛化能力。即使添加少量的语音数据(2-5%)也会产生实质性的进一步收益,课程学习在稀缺数据下特别有效。在跨语言二语习得中,将源语言语音数据与目标语言文本相结合,并以最少的目标语言语音数据实现有效的自适应。总体而言,这项研究提供了实际的见解LALM微调现实的数据约束下。


【32】Speech Language Models for Under-Represented Languages: Insights from Wolof
标题:代表性不足语言的语音语言模型:沃洛夫的见解
链接:https://arxiv.org/abs/2509.15362

摘要:我们介绍了我们为沃洛夫语(Wolof)训练语音语言模型的旅程,沃洛夫语是西非一种代表性不足的语言,并分享了关键见解。我们首先强调收集大规模,自发,高质量语音数据的重要性,并表明在此数据集上继续预训练HuBERT在ASR上的表现优于基础模型和以非洲为中心的模型。然后,我们将此语音编码器集成到一个沃洛夫LLM训练这种语言的第一个语音LLM,扩展其功能的任务,如语音翻译。此外,我们探索训练语音LLM在转录或翻译之前执行多步思想链。我们的结果表明,语音LLM不仅提高了语音识别,但也表现出良好的语音翻译。模型和代码将公开共享。


【33】Emotion-Aware Speech Generation with Character-Specific Voices for Comics
标题:具有漫画特定语音的语音感知语音生成
链接:https://arxiv.org/abs/2509.15253

摘要:本文提出了一个端到端的管道生成字符特定的,情感感知的语音漫画。该系统将完整的漫画卷作为输入,并根据每个角色的对话和情绪状态生成语音。图像处理模块执行字符检测、文本识别和情感强度识别。大型语言模型通过将视觉信息与不断变化的情节上下文相结合来执行对话归因和情感分析。语音是通过一个文本到语音的模型与不同的声音配置文件,适合每个字符和情感合成。这项工作实现了漫画的自动画外音生成,为互动和沉浸式漫画阅读体验迈出了一步。


【34】VoXtream: Full-Stream Text-to-Speech with Extremely Low Latency
标题:VoXtream:延迟极低的全速文本转语音
链接:https://arxiv.org/abs/2509.15969

备注:5 pages, 1 figure, submitted to IEEE ICASSP 2026
摘要:我们提出了VoXtream,一个完全自回归,zero-shot流文本到语音(TTS)系统的实时使用,从第一个字开始说话。VoXtream使用单调对齐方案和不延迟起始的动态前瞻,直接将传入音素映射到音频标记。VoXtream围绕一个增量音素转换器Transformer、一个预测语义和持续时间令牌的时间转换器Transformer以及一个产生声学令牌的深度转换器Transformer构建,据我们所知,VoXtream在公开可用的流媒体TTS中实现了最低的初始延迟:GPU上为102 ms。尽管是在中等规模的9k小时语料库上训练的,但它在几个指标上匹配或超过了更大的基线,同时在输出和全流设置中提供了有竞争力的质量。演示和代码可在https://herimor.github.io/voxtream上获得。


【35】A Steered Response Power Method for Sound Source Localization With Generic Acoustic Models
标题:基于通用声学模型的定向响应功率方法
链接:https://arxiv.org/abs/2509.15702

备注:Accepted for publication in IEEE Transactions on Audio, Speech and Language Processing
摘要:操纵响应功率法是麦克风阵列声源定位中最常用的方法之一。它通常基于简化的声学假设,例如麦克风阵列远场中的全向声源、自由场传播和空间不相关噪声。然而,在现实中,有许多声学场景违反了这样的假设。本文提出了一种推广的传统SRP方法,允许应用通用的声学模型与任意麦克风星座定位。例如,这些模型可以考虑分布式麦克风中的电平差异、源和接收器的方向性或声学遮蔽效应。此外,测量的声学传递函数也可以应用为声学模型。我们表明,传统的SRP的延迟和总和波束成形是不是最佳的定位与通用的声学模型。为此,我们提出了一个广义的SRP波束形成标准,考虑通用的声学模型和空间相关的噪声,并得出一个最佳的SRP波束形成器。此外,我们提出并分析了适当的频率加权。与传统的SRP不同,所提出的方法可以联合利用麦克风信号之间的观测电平和时间差来推断源位置。三个不同的麦克风设置与语音在各种噪声条件下的现实模拟表明,所提出的方法可以显着降低平均定位误差相比,传统的SRP,特别是,减少超过60%,可以存档在嘈杂的条件下。


【36】Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
标题:用于音素识别的实时MRI关节语时间动力学的可解释建模
链接:https://arxiv.org/abs/2509.15689

摘要:实时磁共振成像(rtMRI)可视化声道的行动,提供了一个全面的窗口到语音清晰度。然而,它的信号是高维和噪声,阻碍解释。我们调查紧凑的时空发音动态表示从正中矢状位声道rtMRI视频的音素识别。我们比较了三种特征类型:(1)原始视频,(2)光流,和(3)六个语言相关的兴趣区域(ROI)的咬合架运动。我们评估在每个表示上独立训练的模型,以及多特征组合。结果表明,多特征模型始终优于单特征基线,通过结合ROI和原始视频获得的最低音素错误率(PER)为0.34。时间保真度实验表明,依赖于细粒度的发音动力学,而ROI消融研究揭示了舌头和嘴唇的强大贡献。我们的研究结果强调了rtMRI衍生功能如何提供准确性和可解释性,并建立了在语音处理中利用发音数据的策略。


【37】Blind Source Separation of Radar Signals in Time Domain Using Deep Learning
标题:使用深度学习进行雷达信号的时间域盲源分离
链接:https://arxiv.org/abs/2509.15603

备注:None
摘要:在有争议的环境中识别和进一步分析雷达辐射源需要探测和分离输入信号。如果它们来自相同的方向和相似的频率,那么对它们进行解交织仍然具有挑战性。随着发射器能力的提高,克服这种限制的解决方案变得越来越重要。我们建议将这个问题视为时域中的盲源分离,并应用监督训练的神经网络从接收到的混合信号中提取潜在信号。这使我们能够处理来自雷达和通信发射器的高度重叠和连续波(CW)信号。我们利用音频源分离领域的进步,并扩展了当前最先进的模型,其目标是对任意射频(RF)信号进行去交织。结果表明,我们的方法是能够分离两个未知波形在一个给定的频带与一个单一的通道接收机。


【38】MAGENTA: Magnitude and Geometry-ENhanced Training Approach for Robust Long-Tailed Sound Event Localization and Detection
标题:MAGENTA:幅度和几何增强的训练方法,用于稳健的长尾声音事件定位和检测
链接:https://arxiv.org/abs/2509.15599

备注:This work has been submitted to IEEE ICASSP 2026 for possible publication
摘要:基于深度学习的声音事件定位和检测(SELD)系统在现实世界的长尾数据集上会显着下降。标准回归损失使学习偏向于频繁的类,导致罕见事件被系统地低估。为了应对这一挑战,我们引入了MAGENTA(幅度和几何增强训练方法),这是一个统一的损失函数,可以在物理上可解释的向量空间中抵消这种偏差。MAGENTA将回归误差几何地分解为径向和角度分量,从而实现有针对性的、稀有感知的惩罚和强化的方向建模。从经验上看,MAGENTA大幅提高了不平衡现实世界数据的SELD性能,为一类新的几何感知SELD目标提供了原则基础。代码可在:https://github.com/itsjunwei/MAGENTA_ICASSP


【39】AFT: An Exemplar-Free Class Incremental Learning Method for Environmental Sound Classification
标题:AFT:一种用于环境声音分类的无示例类增量学习方法
链接:https://arxiv.org/abs/2509.15523

备注:Submitted to ICASSP 2026
摘要:由于声音携带丰富的信息,环境声音分类(ESC)是许多应用的关键,如珍稀野生动物检测。然而,我们的世界不断变化,要求ESC模型定期适应新的声音。这里的主要挑战是灾难性的遗忘,即模型在学习新声音时失去识别旧声音的能力。许多方法使用基于重放的持续学习来解决这个问题。这在数据隐私问题等场景中可能不切实际。无范例方法是常用的,但可能会扭曲旧的功能,导致更差的性能。为了克服这些限制,我们提出了一种声学特征变换(AFT)技术,该技术将旧类的时间特征对齐到新空间,包括选择性压缩的特征空间。AFT减轻了对旧知识的遗忘,而不保留过去的数据。我们在两个数据集上进行了实验,显示出与基线模型相比的一致改进,准确率提高了3.7%至3.9%。


【40】State-of-the-Art Dysarthric Speech Recognition with MetaICL for on-the-fly Personalization
标题:使用MetaICL进行最先进的合成障碍语音识别,以实现实时个性化
链接:https://arxiv.org/abs/2509.15516

摘要:个性化自动语音识别(ASR)的构音障碍的语音是至关重要的,但具有挑战性的,由于个人用户适配器的训练和存储。我们提出了一种针对单个模型的混合元训练方法,通过上下文学习(ICL)在zero-shot和Few-Shot动态个性化方面表现出色。该模型在最先进的子集上测量单词错误率(WER),在Euphonia上实现了13.9%的WER,超过了说话者独立基线(17.5% WER),并与用户特定的个性化模型相媲美。在SAP测试1中,其5.3%的WER显著优于甚至个性化适配器的8%。我们还展示了示例策展的重要性,其中Oracle文本相似性方法显示5个策展示例可以实现与19个随机选择的示例相似的性能,突出了未来效率提高的关键领域。最后,我们进行数据消融来衡量这种方法的数据效率。这项工作提出了一个实用的,可扩展的和个性化的解决方案。


【41】Breathing and Semantic Pause Detection and Exertion-Level Classification in Post-Exercise Speech
标题:运动后语音中的呼吸和语义状态检测和状态级别分类
链接:https://arxiv.org/abs/2509.15473

备注:6 pages, 3rd ACM International Workshop on Intelligent Acoustic Systems and Applications (IASA 25)
摘要:运动后言语包含丰富的生理和语言线索,通常以语义停顿、呼吸停顿和呼吸-语义组合停顿为标志。检测这些事件能够评估恢复率、肺功能和与运动相关的异常。然而,现有的工作识别和区分不同类型的停顿在这方面是有限的。在这项工作中,建立在最近发布的同步音频和呼吸信号的数据集,我们提供了系统的暂停类型的注释。使用这些注释,我们系统地在深度学习模型(GRU,1D CNN-LSTM,AlexNet,VGG 16),声学特征(MFCC,MFB)和分层Wav 2 Vec 2表示中进行探索性呼吸和语义暂停检测以及运动水平分类。我们评估三个设置-单一功能,功能融合,和两个阶段的检测分类级联下的分类和回归公式。结果表明,每种类型的检测准确率高达89$\%$的语义,55$\%$的呼吸,86$\%$的组合停顿,和73 $\ %$的整体,而努力水平分类达到90.5$\%$的准确率,优于以前的工作。


【42】Pre-training Autoencoder for Acoustic Event Classification via Blinky
标题:通过Blinky预训练自动编码器用于声学事件分类
链接:https://arxiv.org/abs/2509.15261

备注:Accepted to APSIPA ASC 2025. 6 pages, 1 figures
摘要:在采用Blinkies的声学事件分类(AEC)框架中,音频信号被转换为LED光发射,随后由单个摄像机捕获。然而,30 fps的光传输通道仅传送正常音频带宽的约0.2%,并且对噪声非常敏感。我们提出了一种新颖的声光转换方法,该方法利用预训练的自动编码器(AE)的编码器从记录的音频中提取紧凑的、有区别的特征。为了预训练AE,我们采用了一种噪声鲁棒学习策略,在训练过程中将人工噪声注入编码器的潜在表示中,从而增强了模型对信道噪声的鲁棒性。编码器架构专为Raspberry Pi 4等当代边缘设备的内存占用量而设计。在ESC-50数据集上进行的模拟实验中,在严格的15 Hz带宽约束下,所提出的方法比传统的声光转换方法获得了更高的宏F1分数。


eess.AS音频处理


【1】Are Multimodal Foundation Models All That Is Needed for Emofake Detection?
标题:多峰基础模型就是收件箱造假检测所需的全部吗?
链接:https://arxiv.org/abs/2509.16193

备注:Accepted to APSIPA-ASC 2025
摘要:在这项工作中,我们研究了多模态基础模型(MFMs)的音频假检测(EFD),并假设它们将优于音频基础模型(AFMs)。MFM由于其跨模态预训练,从多个模态中学习情感模式,而AFM仅依赖于音频。因此,MFM可以更好地识别操纵音频中不自然的情绪变化和不一致性,使它们更有效地区分真实的情感表达和虚假的情感表达。为了验证我们的假设,我们进行了全面的比较分析,国家的最先进的(SOTA)的MFMs(例如,WavLM)旁边的AFM(例如,Bind)。我们的实验证实,对于EFD,MFM优于AFM。除了个人的基础模型(FM)的性能,我们探讨FM融合,在相关的研究领域,如合成语音检测和语音情感识别的研究结果的动机。为此,我们提出了SCAR,一个新的框架,有效的融合。SCAR引入了一种嵌套的交叉注意机制,在该机制中,来自FM的表示在两个阶段顺序地交互以改进信息交换。此外,自我注意力细化模块通过加强重要的交叉FM线索同时抑制噪声来进一步增强特征表示。通过SCAR与协同融合的FM,我们实现SOTA性能,超越了独立的FM和传统的融合方法和EFD以前的工作。


【2】Rethinking Cross-Corpus Speech Emotion Recognition Benchmarking: Are Paralinguistic Pre-Trained Representations Sufficient?
标题:重新思考跨数据库言语情感识别基准:副语言预训练的表达足够吗?
链接:https://arxiv.org/abs/2509.16182

备注:Accepted to APSIPA-ASC 2025
摘要:最近评估跨语料库语音情感识别(SER)的预训练模型(PTM)的基准忽略了PTM预训练的双语言语音处理(PSP),引起了对其可靠性的担忧,因为SER本质上是一个双语言任务。我们假设,PSP为重点的PTM将执行更好的跨语料库SER设置。为了测试这一点,我们分析国家的最先进的PTM表示,包括双语言,单语,多语言和说话人识别。我们的研究结果证实,TRILLsson(一种非语言的PTM)优于其他人,加强需要考虑PSP为重点的PTM在跨语料库SER基准。这项研究提高了基准可信度,并指导PTM评估可靠的跨语料库SER。


【3】Interpreting the Role of Visemes in Audio-Visual Speech Recognition
标题:解释视素在视听语音识别中的作用
链接:https://arxiv.org/abs/2509.16023

备注:Accepted into Automatic Speech Recognition and Understanding- ASRU 2025
摘要:视听语音识别(AVSR)模型在性能方面已经超过了纯音频模型。然而,AVSR系统的可解释性,特别是视觉模态的作用,仍然是探索不足。在本文中,我们采用几种可解释性技术来研究如何在AV-HuBERT一个国家的最先进的AVSR模型的视位编码。首先,我们使用t分布随机邻域嵌入(t-SNE)来可视化学习的特征,揭示由视觉线索驱动的自然聚类,并通过音频的存在进一步细化。然后,我们采用探测,以显示音频如何有助于细化特征表示,特别是视觉上模糊或代表不足的视位。我们的研究结果揭示了AVSR模式之间的相互作用,并可能指出利用视觉信息来提高AVSR性能的新策略。


【4】VoXtream: Full-Stream Text-to-Speech with Extremely Low Latency
标题:VoXtream:延迟极低的全速文本转语音
链接:https://arxiv.org/abs/2509.15969

备注:5 pages, 1 figure, submitted to IEEE ICASSP 2026
摘要:我们提出了VoXtream,一个完全自回归,zero-shot流文本到语音(TTS)系统的实时使用,从第一个字开始说话。VoXtream使用单调对齐方案和不延迟起始的动态前瞻,直接将传入音素映射到音频标记。VoXtream围绕一个增量音素转换器Transformer、一个预测语义和持续时间令牌的时间转换器Transformer以及一个产生声学令牌的深度转换器Transformer构建,据我们所知,VoXtream在公开可用的流媒体TTS中实现了最低的初始延迟:GPU上为102 ms。尽管是在中等规模的9k小时语料库上训练的,但它在几个指标上匹配或超过了更大的基线,同时在输出和全流设置中提供了有竞争力的质量。演示和代码可在https://herimor.github.io/voxtream上获得。


【5】Sound Separation and Classification with Object and Semantic Guidance
标题:宾语和语义引导下的语音分离与分类
链接:https://arxiv.org/abs/2509.15899

备注:5 pages, 4 figures, submitted to ICASSP 2026
摘要:空间语义分割任务的重点是从多通道信号中分离和分类声音对象。为了实现两个不同的目标,常规方法微调与分离模型级联的大型分类模型,并注入分类标签作为下一迭代步骤的分离线索。然而,这种集成并不理想,因为在较小的数据集上进行微调会失去大型分类模型的多样性,来自源分离模型的特征与预训练分类器的输入不同,并且注入的独热类别标签缺乏语义深度,通常会导致错误传播。为了解决这些问题,我们提出了一种双路径分类器(DPC)架构,该架构将来自源分离模型的对象特征与从预训练分类模型中获得的语义表示相结合,而无需进行微调。我们还介绍了一个语义线索编码器(SCE),丰富了注入线索的语义深度。我们的系统在DCASE 2025 task 4评估集上实现了最先进的11.19 dB CA-SDRi和增强的语义保真度,超过了11.00 dB的顶级性能。这些结果突出了分离器派生的功能和丰富的语义线索集成的有效性。


【6】Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS
标题:深度配音:具有文本到音色和上下文感知指令TTS的端到端自动有声读物系统
链接:https://arxiv.org/abs/2509.15845

备注:Submitted to ICASSP this http URL 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, including reprinting/republishing, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work. DOI will be added upon IEEE Xplore publication
摘要:多参与者有声读物制作的流水线主要包括三个阶段:脚本分析、人物声音音色选择和语音合成。其中,脚本分析可以使用NLP模型以高精度自动化,而角色语音音色选择仍然依赖于手动工作。语音合成使用手动配音或文本到语音(TTS)。虽然TTS提高了效率,但它在情感表达、语调控制和上下文场景适应方面很困难。为了应对这些挑战,我们提出了DeepDubbing,这是一个用于多参与者有声读物制作的端到端自动化系统。该系统包括两个主要组成部分:一个文本到音色(TTT)模型和上下文感知指令TTS(CA指令TTS)模型。TTT模型根据文本描述生成特定于角色的音色嵌入。CA-Instruct-TTS模型通过分析上下文对话并结合细粒度的情感指令来合成表达性语音。该系统能够自动生成多参与者的有声读物,具有音色匹配的人物声音和情感表达的叙述,为有声读物制作提供了一种新颖的解决方案。


【7】A Steered Response Power Method for Sound Source Localization With Generic Acoustic Models
标题:基于通用声学模型的定向响应功率方法
链接:https://arxiv.org/abs/2509.15702

备注:Accepted for publication in IEEE Transactions on Audio, Speech and Language Processing
摘要:操纵响应功率法是麦克风阵列声源定位中最常用的方法之一。它通常基于简化的声学假设,例如麦克风阵列远场中的全向声源、自由场传播和空间不相关噪声。然而,在现实中,有许多声学场景违反了这样的假设。本文提出了一种推广的传统SRP方法,允许应用通用的声学模型与任意麦克风星座定位。例如,这些模型可以考虑分布式麦克风中的电平差异、源和接收器的方向性或声学遮蔽效应。此外,测量的声学传递函数也可以应用为声学模型。我们表明,传统的SRP的延迟和总和波束成形是不是最佳的定位与通用的声学模型。为此,我们提出了一个广义的SRP波束形成标准,考虑通用的声学模型和空间相关的噪声,并得出一个最佳的SRP波束形成器。此外,我们提出并分析了适当的频率加权。与传统的SRP不同,所提出的方法可以联合利用麦克风信号之间的观测电平和时间差来推断源位置。三个不同的麦克风设置与语音在各种噪声条件下的现实模拟表明,所提出的方法可以显着降低平均定位误差相比,传统的SRP,特别是,减少超过60%,可以存档在嘈杂的条件下。


【8】Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
标题:用于音素识别的实时MRI关节语时间动力学的可解释建模
链接:https://arxiv.org/abs/2509.15689

摘要:实时磁共振成像(rtMRI)可视化声道的行动,提供了一个全面的窗口到语音清晰度。然而,它的信号是高维和噪声,阻碍解释。我们调查紧凑的时空发音动态表示从正中矢状位声道rtMRI视频的音素识别。我们比较了三种特征类型:(1)原始视频,(2)光流,和(3)六个语言相关的兴趣区域(ROI)的咬合架运动。我们评估在每个表示上独立训练的模型,以及多特征组合。结果表明,多特征模型始终优于单特征基线,通过结合ROI和原始视频获得的最低音素错误率(PER)为0.34。时间保真度实验表明,依赖于细粒度的发音动力学,而ROI消融研究揭示了舌头和嘴唇的强大贡献。我们的研究结果强调了rtMRI衍生功能如何提供准确性和可解释性,并建立了在语音处理中利用发音数据的策略。


【9】Rec-RIR: Monaural Blind Room Impulse Response Identification via DNN-based Reverberant Speech Reconstruction in STFT Domain
标题:Rec-RIR:通过STFT域中基于DNN的回响语音重建进行单耳盲室脉冲响应识别
链接:https://arxiv.org/abs/2509.15628

备注:Submitted to ICASSP 2026
摘要:房间脉冲响应(RIR)表征了声音在封闭空间中的完整传播过程。本文提出了一种用于单声道RIR盲辨识的Rec-RIR。Rec-RIR基于卷积传递函数(CTF)近似,在短时傅里叶变换(STFT)域中模拟窄带滤波器组内的混响效果。具体来说,我们提出了一种具有交叉带和窄带块的深度神经网络(DNN)来估计CTF滤波器。DNN通过重建无噪声混响语音频谱来训练。这个目标可以实现稳定和直接的监督训练。随后,采用伪侵入式测量过程,通过模拟常见的侵入式RIR测量过程来将CTF滤波器估计转换为时域RIR。实验结果表明,Rec-RIR实现国家的最先进的(SOTA)性能在RIR识别和声学参数估计。开放源代码可在https://github.com/Audio-WestlakeU/Rec-RIR上获得。


【10】Blind Source Separation of Radar Signals in Time Domain Using Deep Learning
标题:使用深度学习进行雷达信号的时间域盲源分离
链接:https://arxiv.org/abs/2509.15603

备注:None
摘要:在有争议的环境中识别和进一步分析雷达辐射源需要探测和分离输入信号。如果它们来自相同的方向和相似的频率,那么对它们进行解交织仍然具有挑战性。随着发射器能力的提高,克服这种限制的解决方案变得越来越重要。我们建议将这个问题视为时域中的盲源分离,并应用监督训练的神经网络从接收到的混合信号中提取潜在信号。这使我们能够处理来自雷达和通信发射器的高度重叠和连续波(CW)信号。我们利用音频源分离领域的进步,并扩展了当前最先进的模型,其目标是对任意射频(RF)信号进行去交织。结果表明,我们的方法是能够分离两个未知波形在一个给定的频带与一个单一的通道接收机。


【11】MAGENTA: Magnitude and Geometry-ENhanced Training Approach for Robust Long-Tailed Sound Event Localization and Detection
标题:MAGENTA:幅度和几何增强的训练方法,用于稳健的长尾声音事件定位和检测
链接:https://arxiv.org/abs/2509.15599

备注:This work has been submitted to IEEE ICASSP 2026 for possible publication
摘要:基于深度学习的声音事件定位和检测(SELD)系统在现实世界的长尾数据集上会显着下降。标准回归损失使学习偏向于频繁的类,导致罕见事件被系统地低估。为了应对这一挑战,我们引入了MAGENTA(幅度和几何增强训练方法),这是一个统一的损失函数,可以在物理上可解释的向量空间中抵消这种偏差。MAGENTA将回归误差几何地分解为径向和角度分量,从而实现有针对性的、稀有感知的惩罚和强化的方向建模。从经验上讲,MAGENTA大大提高了SELD在不平衡的真实世界数据上的性能,为一类新的几何感知SELD目标提供了原则基础。代码可在:https://github.com/itsjunwei/MAGENTA_ICASSP


【12】AFT: An Exemplar-Free Class Incremental Learning Method for Environmental Sound Classification
标题:AFT:一种用于环境声音分类的无示例类增量学习方法
链接:https://arxiv.org/abs/2509.15523

备注:Submitted to ICASSP 2026
摘要:由于声音携带丰富的信息,环境声音分类(ESC)是许多应用的关键,如珍稀野生动物检测。然而,我们的世界不断变化,要求ESC模型定期适应新的声音。这里的主要挑战是灾难性的遗忘,即模型在学习新声音时失去识别旧声音的能力。许多方法使用基于重放的持续学习来解决这个问题。这在数据隐私问题等场景中可能不切实际。无范例方法是常用的,但可能会扭曲旧的功能,导致更差的性能。为了克服这些限制,我们提出了一种声学特征变换(AFT)技术,该技术将旧类的时间特征对齐到新空间,包括选择性压缩的特征空间。AFT减轻了对旧知识的遗忘,而不保留过去的数据。我们在两个数据集上进行了实验,显示出与基线模型相比的一致改进,准确率提高了3.7%至3.9%。


【13】State-of-the-Art Dysarthric Speech Recognition with MetaICL for on-the-fly Personalization
标题:使用MetaICL进行最先进的合成障碍语音识别,以实现实时个性化
链接:https://arxiv.org/abs/2509.15516

摘要:个性化自动语音识别(ASR)的构音障碍的语音是至关重要的,但具有挑战性的,由于个人用户适配器的训练和存储。我们提出了一种针对单个模型的混合元训练方法,通过上下文学习(ICL)在zero-shot和Few-Shot动态个性化方面表现出色。该模型在最先进的子集上测量单词错误率(WER),在Euphonia上实现了13.9%的WER,超过了说话者独立基线(17.5% WER),并与用户特定的个性化模型相媲美。在SAP测试1中,其5.3%的WER显著优于甚至个性化适配器的8%。我们还展示了示例策展的重要性,其中Oracle文本相似性方法显示5个策展示例可以实现与19个随机选择的示例相似的性能,突出了未来效率提高的关键领域。最后,我们进行数据消融来衡量这种方法的数据效率。这项工作提出了一个实用的,可扩展的和个性化的解决方案。


【14】Breathing and Semantic Pause Detection and Exertion-Level Classification in Post-Exercise Speech
标题:运动后语音中的呼吸和语义状态检测和状态级别分类
链接:https://arxiv.org/abs/2509.15473

备注:6 pages, 3rd ACM International Workshop on Intelligent Acoustic Systems and Applications (IASA 25)
摘要:运动后言语包含丰富的生理和语言线索,通常以语义停顿、呼吸停顿和呼吸-语义组合停顿为标志。检测这些事件能够评估恢复率、肺功能和与运动相关的异常。然而,现有的工作识别和区分不同类型的停顿在这方面是有限的。在这项工作中,建立在最近发布的同步音频和呼吸信号的数据集,我们提供了系统的暂停类型的注释。使用这些注释,我们系统地在深度学习模型(GRU,1D CNN-LSTM,AlexNet,VGG 16),声学特征(MFCC,MFB)和分层Wav 2 Vec 2表示中进行探索性呼吸和语义暂停检测以及运动水平分类。我们评估三个设置-单一功能,功能融合,和两个阶段的检测分类级联下的分类和回归公式。结果表明,每种类型的检测准确率高达89$\%$的语义,55$\%$的呼吸,86$\%$的组合停顿,和73 $\ %$的整体,而努力水平分类达到90.5$\%$的准确率,优于以前的工作。


【15】Pre-training Autoencoder for Acoustic Event Classification via Blinky
标题:通过Blinky预训练自动编码器用于声学事件分类
链接:https://arxiv.org/abs/2509.15261

备注:Accepted to APSIPA ASC 2025. 6 pages, 1 figures
摘要:在采用Blinkies的声学事件分类(AEC)框架中,音频信号被转换为LED光发射,随后由单个摄像机捕获。然而,30 fps的光传输信道仅传送正常音频带宽的约0.2%,并且对噪声高度敏感。我们提出了一种新颖的声光转换方法,该方法利用预训练的自动编码器(AE)的编码器从记录的音频中提取紧凑的、有区别的特征。为了预训练AE,我们采用了一种噪声鲁棒学习策略,在训练过程中将人工噪声注入编码器的潜在表示中,从而增强了模型对信道噪声的鲁棒性。编码器架构专为Raspberry Pi 4等当代边缘设备的内存占用量而设计。在ESC-50数据集上进行的模拟实验中,在严格的15 Hz带宽约束下,所提出的方法比传统的声光转换方法获得了更高的宏F1分数。


【16】Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
标题:Fed-PISA:通过个性化身份风格适应进行联合语音克隆
链接:https://arxiv.org/abs/2509.16010

摘要:文语转换(TTS)中的语音克隆旨在利用目标说话人的有限数据从文本中生成富有表达力和个性化的语音。联邦学习(FL)为这项任务提供了一个协作和隐私保护的框架,但现有的方法遭受高通信成本,往往抑制风格的异质性,导致个性化不足。为了解决这些问题,我们提出了Fed-PISA,它代表联合个性化身份风格适应。为了最大限度地降低通信成本,Fed-PISA引入了一种解纠缠的低秩自适应(LoRA)机制:说话者的音色通过私有ID-LoRA保留在本地,而只向服务器传输轻量级风格-LoRA,从而最大限度地减少参数交换。为了利用异质性,我们的聚合方法,灵感来自协同过滤,介绍了创建自定义模型,为每个客户端从风格相似的同行学习。实验表明,Fed-PISA提高了风格的表现力,自然度和说话人相似性,以最小的通信成本优于标准的联邦基线。


【17】Reverse Engineering of Music Mixing Graphs with Differentiable Processors and Iterative Pruning
标题:具有可区分处理器和迭代修剪的音乐混音图的反向工程
链接:https://arxiv.org/abs/2509.15948

备注:JAES, extension of arxiv.org/abs/2408.03204 and arxiv.org/abs/2406.01049
摘要:音乐混音的逆向工程旨在揭示如何处理和组合干燥的源信号以产生最终混音。我们扩展了以前的作品,以反映混合和搜索的音频处理器的图形的组成性质。首先,我们构建一个混音控制台,将所有可用的处理器应用于每个音轨和子组。对于可微处理器实现,我们使用梯度下降优化其参数。然后,我们重复删除可忽略不计的处理器并微调剩余处理器的过程。通过这种方式,可以保留完整混音控制台的质量,同时去除大约三分之二的处理器。所提出的方法不仅可以用于分析单个音乐混音,而且可以用于收集可用于下游任务的大规模图形数据,例如,自动混合特别是对于后一个目的,搜索的有效执行是至关重要的。为此,我们提出了一种高效的批处理方法,并行计算多个处理器。我们还利用处理器的“干/湿”参数来加速搜索。大量的定量和定性分析进行评估所提出的方法的性能,行为和计算成本。


【18】Differentiable Acoustic Radiance Transfer
标题:差异声辐射传输
链接:https://arxiv.org/abs/2509.15946

摘要:几何声学是室内声学建模的一种有效方法,它由正则的时变渲染方程控制。声辐射传递(ART)通过离散化求解方程,模拟具有柔性材料特性的表面贴片之间的时间和方向相关的能量交换。我们介绍DART,一个微分和有效的实现ART,使基于梯度的材料性能优化。我们评估DART的声场学习任务,其目的是预测新的源-接收器设置的能量响应的一个简单的变体。实验结果表明,DART具有良好的性能,例如,与现有的信号处理和神经网络基线相比,在稀疏测量场景下具有更好的泛化能力,同时保持简单,完全可解释的系统。


【19】From Independence to Interaction: Speaker-Aware Simulation of Multi-Speaker Conversational Timing
标题:从独立到交互:说话人感知的多说话人会话计时仿真
链接:https://arxiv.org/abs/2509.15808

备注:Submitted to ICASSP 2026
摘要:我们提出了一种说话人感知的方法来模拟多说话人的对话,捕捉时间的一致性和现实的话轮转换动态。以前的工作通常模型聚合会话统计下的独立性假设跨扬声器和轮。相比之下,我们的方法使用特定于扬声器的偏差分布,执行扬声器内的时间一致性,而马尔可夫链管理轮流和固定的房间脉冲响应保留空间现实主义。我们还统一暂停和重叠成一个单一的间隙分布,建模与核密度估计平滑的连续性。使用内在指标-全局间隙统计,连续间隙之间的相关性,基于Copula的高阶依赖关系,话轮转换熵和间隙生存函数-对Switchboard的评估表明,说话人感知模拟比基线方法更好地与真实的会话模式保持一致,捕获细粒度的时间依赖关系和现实的说话人交替,同时揭示了在建模长距离会话结构方面的挑战。


【20】SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
标题:SONAR:自蒸馏连续预训练域自适应音频表示
链接:https://arxiv.org/abs/2509.15703

备注:Submitted to ICASSP 2026
摘要:像AudioSet这样的大规模数据集上的自监督学习(SSL)已经成为音频表示学习的主导范式。虽然新的、未标记的音频的不断涌入为丰富这些静态表示提供了机会,但一种天真的方法是使用所有可用的数据从头开始重新训练模型。然而,这种方法在计算上是禁止的,并且丢弃了嵌入在先前训练的模型权重中的有价值的知识。为了解决这种效率低下的问题,我们提出了SONAR(Self-distilled concontinual pre-training for domain adaptive Audio Representation),这是一种基于BEAT的连续预训练框架。SONAR有效地适应新的领域,同时通过解决三个关键挑战来减轻灾难性遗忘:对新数据和先前数据实施联合采样策略,应用正则化来平衡特异性和通用性,以及动态扩展新声学模式的标记器码本。在四个不同的领域的实验表明,我们的方法实现了高适应性和强大的抵抗遗忘。


【21】Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
标题:微调大型多模式模型用于自动发音评估
链接:https://arxiv.org/abs/2509.15701

备注:submitted to ICASSP2026
摘要:自动发音评估(APA)是计算机辅助语言学习(CALL)的关键,需要在多个粒度和方面进行评估。大型多模态模型(LLM)为APA提供了新的机会,但其在细粒度评估中的有效性仍然不确定。这项工作研究微调LC30 APA使用Speechocean762数据集和私人语料库。微调显著优于zero-shot设置,并在单粒度任务上实现了与公共和商业系统相比具有竞争力的结果。该模型在单词和句子级别上表现良好,而音素级别的评估仍然具有挑战性。我们还观察到,皮尔逊相关系数(PCC)达到0.9,而斯皮尔曼的等级相关系数(SCC)保持在0.6左右,这表明SCC更好地反映了顺序一致性。这些研究结果突出了APA的承诺和限制,并指出未来的工作细粒度建模和排名感知评估。


【22】Direct Simultaneous Translation Activation for Large Audio-Language Models
标题:大型音频语言模型的直接同传激活
链接:https://arxiv.org/abs/2509.15692

摘要:同步语音到文本翻译(Simul-S2 TT)旨在实时将语音翻译成目标文本,在接收源语音输入的同时输出翻译,而不是等待整个话语被说出。Simul-S2 TT研究经常修改模型架构以实现读写策略。然而,随着大型音频语言模型(LALM)的兴起,一个关键的挑战是如何直接激活基础模型中的Simul-S2 TT功能,而无需额外的架构更改。在本文中,我们介绍了同步自动翻译(SimulSA),这是一种利用LALM固有的能力,通过随机截断语音和构建部分对齐翻译来获得同步数据的策略。通过将它们整合到离线SFT数据中,SimulSA有效地弥合了预训练期间的离线翻译和推理期间的同步翻译之间的分布差距。实验结果表明,与完全离线的SFT数据相比,仅增加约{\bf 1\%}的同时数据可以显著激活LALM的Simul-S2 TT能力,而无需修改模型架构或解码策略。


【23】Mamba-2 audio captioning: design space exploration and analysis
标题:Mamba-2音频字幕:设计空间探索与分析
链接:https://arxiv.org/abs/2509.15680

备注:Submitted to the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026). Under review
摘要:我们提出了一个音频字幕模型的Mamba-2大型语言模型的骨干,这是一个国家的最先进的(SOTA)的状态空间模型(SSM)。我们系统地探索设计空间:LLM大小,LoRA等级和连接器设计,利用Mamba-2相对于序列长度的线性时间复杂度。在基准测试中,与在相同数据集上训练的大型语言模型相比,我们的模型实现了强大的字幕性能,尽管使用了更少的参数。我们首次深入分析了LLM参数的数量、音频编码器微调策略、音频特征多样性以及不同的特征缩减或扩展技术如何影响性能。


【24】VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion
标题:VOX-KRIKRI:通过持续融合统一语音和语言
链接:https://arxiv.org/abs/2509.15667

摘要:我们提出了一个多模态融合框架,该框架将预训练的基于解码器的大型语言模型(LLM)和声学编码器-解码器架构(如Whisper)连接起来,旨在构建支持语音的LLM。而不是直接使用音频嵌入,我们探索一个中间的音频调节的文本空间作为一个更有效的对齐机制。我们的方法完全在连续文本表示空间中运行,通过跨模态注意力将Whisper的隐藏解码器状态与LLM的隐藏解码器状态融合,并支持离线和流模式。我们介绍\textit{VoxKrikri},第一个希腊语音LLM,并通过分析表明,我们的方法有效地调整表示跨模态。这些结果突出了连续空间融合作为多语言和低资源语音LLM的一条有前途的道路,同时实现了希腊语自动语音识别的最新结果,在基准测试中提供了平均$\sim20\%$的相对改进。


【25】TISDiSS: A Training-Time and Inference-Time Scalable Framework for Discriminative Source Separation
标题:TISDiSS:一个训练时和推理时可扩展的判别源分离框架
链接:https://arxiv.org/abs/2509.15666

备注:submitted to ICASSP 2026
摘要:源分离是语音、音乐和音频处理中的一项基本任务,它还为训练生成模型提供了更清晰、更大的数据。然而,在实践中提高分离性能往往取决于越来越大的网络,从而增加了培训和部署成本。受生成式建模的推理时间缩放的最新进展的启发,我们提出了训练时间和推理时间可缩放的鉴别源分离(TISDiSS),这是一个统一的框架,集成了早期分裂多丢失监督,共享参数设计和动态推理重复。TISDiSS通过调整推理深度而无需重新训练额外的模型,从而实现灵活的速度-性能权衡。我们进一步提供了对架构和训练选择的系统分析,并表明具有更多推理重复的训练可以提高浅推理性能,从而有利于低延迟应用程序。在标准语音分离基准测试上的实验表明,TISDiSS具有最先进的性能,参数数量减少,建立了自适应源分离的可扩展和实用的框架。


【26】Jamendo-QA: A Large-Scale Music Question Answering Dataset
标题:Jamendo-QA:一个大规模的音乐问题分类数据集
链接:https://arxiv.org/abs/2509.15662

备注:4 pages, 8 figures. Submitted to ICASSP 2026
摘要:我们介绍了Jamendo-QA,一个用于音乐问题分类(Music-QA)的大规模数据集。该数据集基于Jamendo平台的免费许可曲目构建,并使用Qwen-Omni模型自动注释。Jamendo-QA提供与音乐音频对齐的问答对和字幕,支持监督训练和zero-shot评估。我们的资源旨在填补特定音乐QA数据集的空白,并促进音乐理解、检索和生成应用程序的进一步研究。除了规模之外,Jamendo-QA还涵盖了各种流派、乐器和元数据属性,允许在各种音乐环境中进行强大的模型基准测试。我们还提供详细的数据集统计数据,并强调潜在的偏见,如流派和性别失衡,以指导公平的评估。我们将Jamendo-QA定位为一个可扩展且公开可用的基准,可以促进未来在音乐理解,多模态建模和面向音乐的QA系统的公平评估方面的研究。


【27】SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
标题:SightSound-R1:从视觉到音频语言模型的跨模式推理提炼
链接:https://arxiv.org/abs/2509.15661

摘要:虽然大型音频语言模型(LALM)已经展示了最先进的音频理解能力,但它们在复杂音景中的推理能力仍然落后于大型视觉语言模型(LVLM)。与视觉领域相比,一个瓶颈是缺乏大规模的思想链音频数据来教授LALM逐步推理。为了规避这种数据和模态差距,我们提出了SightSound-R1,这是一个跨模态的蒸馏框架,可以在同一个视听问答(AVQA)数据集上将高级推理从较强的LVLM教师转移到较弱的LALM学生。SightSound-R1由三个核心步骤组成:(i)测试时间缩放,以生成LVLM教师的音频集中的思想链(CoT),(ii)音频接地验证,以过滤幻觉,以及(iii)带有监督微调(SFT)的蒸馏管道,然后是LALM学生的组相对策略优化(GRPO)。结果表明,SightSound-R1在域内AVQA测试集以及看不见的听觉场景和问题中都提高了LALM推理性能,优于预训练和仅标签提取的基线。因此,我们得出结论,视觉推理可以有效地转移到音频模型和规模与丰富的视听数据。


【28】Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations
标题:分层最小对探测揭示语音表示中的上下文语法概念层次结构
链接:https://arxiv.org/abs/2509.15655

备注:EMNLP 2025 Main Conference (Oral)
摘要:基于转换器的语音语言模型(SLM)显著提高了神经语音识别和理解。虽然现有的研究已经研究了SLMs编码浅层声学和语音特征的程度,但SLMs编码细微的句法和概念特征的程度仍不清楚。通过与大型语言模型的语言能力评估进行比较,本研究首次系统地评估了自监督学习(S3M),自动语音识别(ASR),语音压缩(编解码器)以及听觉大型语言模型(AudioLLM)编码器的SLM中上下文句法和语义特征的存在。通过对71个不同语言水平的任务进行最小配对设计和诊断特征分析,我们的逐层和时间分辨分析发现:1)所有语音编码的语法特征比概念特征更鲁棒。


【29】EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
标题:EMO-RL:基于描述规则的强化学习增强型音频语言模型,用于广义语音情感识别
链接:https://arxiv.org/abs/2509.15654

备注:Accpeted by the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)
摘要:虽然大型音频语言模型(LALM)在听觉理解方面表现出色,但它们在情感计算场景中的性能,特别是在情感识别,推理和微妙的情感区分方面,仍然不是最佳的。强化学习(RL)的最新进展在提高LALM的推理能力方面显示出了希望。然而,两个关键挑战阻碍了RL技术直接应用于语音情感识别(SER)任务:(1)由模糊的情感边界引起的收敛不稳定性和(2)当使用相对小的模型(例如,7 B参数架构)。为了克服这些限制,我们引入了EMO-RL,这是一种新的框架,它将强化学习与两个关键创新结合在一起:情感相似性加权奖励(ESWR)和显式结构化推理(ESR)。基于预先训练的LALM,我们的方法采用了具有情感约束的组相关策略优化。综合实验表明,我们的EMO-RL训练策略可以显着提高LALM的情感推理能力,在MELD和IEMOCAP数据集上都取得了最先进的结果,跨数据集实验证明了泛化的强大优势。


【30】The Singing Voice Conversion Challenge 2025: From Singer Identity Conversion To Singing Style Conversion
标题:2025年歌声转换挑战:从歌手身份转换到演唱风格转换
链接:https://arxiv.org/abs/2509.15629

摘要:我们介绍了歌唱声音转换挑战赛的最新成果,这是一项旨在在受控环境中比较和理解不同声音转换系统的科学活动。相比于以往的迭代,只专注于转换歌手身份,今年我们还专注于转换歌手的演唱风格。为了创造一个可控的环境和全面的评估,我们开发了一个新的挑战数据库,引入了两个任务,开源基线,并进行了大规模的众包听力测试和客观评估。挑战运行了两个月,我们总共评估了26个不同的系统。大规模众包听力测试的结果显示,顶级系统的歌手身份得分与地面真实样本相当。然而,建模的演唱风格,从而实现高自然度仍然是一个挑战,在这项任务中,主要是由于在呼吸,滑音,颤音演唱风格的动态信息建模的困难。


【31】LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
标题:LibriTTS-VI:公共数据库和有效语音印象控制的新方法
链接:https://arxiv.org/abs/2509.15626

备注:Submitted to ICASSP 2026
摘要:对语音印象的细粒度控制(例如,使声音更明亮或更平静)是创建更可控的文本到语音的关键前沿。然而,这一新兴领域面临着两个关键挑战。第一个是印象泄漏的问题,其中合成的语音不期望地受到说话者的参考音频的影响,而不是单独指定的目标印象,第二个是缺乏公共的注释语料库。为了减少印象泄漏,我们提出了两种方法:1)一种训练策略,分别使用说话人身份的话语和同一说话人的另一个话语作为目标印象,以及2)一种新的无参考模型,仅从目标印象中生成说话人嵌入,实现了提高对泄漏的鲁棒性和方便的无参考生成的好处。客观和主观评价表明,可控性的显着改善。我们最好的方法减少了11维语音印象向量的均方误差从0.61到0.41客观和从1.15到0.92主观,同时保持高保真度。为了促进可重复的研究,我们引入了LibriTTS-VI,这是第一个以LibriTTS-R语料库为基础,以明确的注释标准发布的公共语音印象数据集。


【32】The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
标题:一切中的节奏:带屏蔽语言建模的音频录制鼓生成
链接:https://arxiv.org/abs/2509.15625

备注:ISMIR 2025
摘要:音乐家和非音乐家都使用有节奏的声音手势,如敲击和beatboxing,来表达鼓的模式。虽然这些手势有效地传达了音乐理念,但将这些理念实现为完整的鼓录音可能非常耗时,可能会破坏许多创意工作流程。为了弥合这一差距,我们提出了TRIA(节奏在任何东西),一个蒙面的Transformer模型映射节奏的声音姿态,高保真鼓录音。给定期望的节奏模式的音频提示和表示架子鼓音色的第二提示,TRIA产生以期望的音色演奏期望的节奏(具有适当的精心制作)的架子鼓的音频。主观和客观评估表明,在不到10小时的公开可用的鼓数据上训练的TRIA模型可以以zero-shot的方式在广泛的音色范围内生成高质量、忠实的声音姿态实现。


【33】De-crackling Virtual Analog Controls with Asymptotically Stable Recurrent Neural Networks
标题:利用渐进稳定的回归神经网络消除虚拟模拟控制
链接:https://arxiv.org/abs/2509.15622

摘要:递归神经网络用于虚拟模拟建模应用,以数字方式复制模拟硬件音频处理器的声音。硬件设备的控制可以用作这些网络的调节输入。一个常见的方法,这些模型引入控制条件是直接静态级联的控制与输入音频样本,我们显示产生音频文物随时间变化的条件下。在这里,我们推导出常用的递归神经网络的渐近稳定变量的约束条件,并证明递归神经网络的渐近稳定性可以消除零输入和时变条件下的模型输出的音频伪影。此外,我们的研究结果提出了一种可能的通用解决方案,以减轻其他音频神经网络架构(如卷积和状态空间模型)中的条件诱导伪影。


【34】Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
标题:鸡尾酒会中的思考:目标说话人自动语音识别的思想链和强化学习
链接:https://arxiv.org/abs/2509.15612

备注:submitted to ICASSP 2026
摘要:目标说话人自动语音识别(TS-ASR)旨在从鸡尾酒会场景中的多个说话人混合语音中转录指定目标说话人的语音。大型音频语言模型(LALM)的最新进展已经为TS-ASR带来了一些新的见解。然而,LALM架构中的TS-ASR任务仍有很大的优化空间。虽然思想链(CoT)和强化学习(RL)在某些语音任务中已被证明是有效的,但TS-ASR要求模型深入理解语音信号,区分不同的说话者,并处理重叠的话语,特别适合推理指导的方法。因此,我们提出了一个新的框架,将CoT和RL训练到TS-ASR的性能提高。构造了一个新的TS-ASR CoT数据集,首先在规则数据上训练TS-ASR模型,然后在CoT数据上进行微调。最后,使用选定的数据使用RL进一步训练模型,以增强广义推理能力。实验结果表明,通过CoT和RL训练,TS-ASR的性能得到了显着改善,与以前的TS-ASR在可比数据集上的工作相比,建立了最先进的性能。


【35】Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
标题:基于块的高分辨率有限量化语音预训练
链接:https://arxiv.org/abs/2509.15579

摘要:近十年来,随着语音技术的飞速发展,低延迟语音人机通信变得越来越必要。语音技术进步背后的主要因素之一是自我监督学习。大多数自监督学习算法都是基于完整的话语假设而设计的,如果存在部分话语,则必须做出妥协,这在流媒体应用中很常见。在这项工作中,我们提出了一个基于块的自监督学习(Chunk SSL)算法作为流媒体和离线语音预训练的统一解决方案。利用掩蔽预测损失来优化组块SSL,并且鼓励声学编码器在相同组块和先前组块中的未掩蔽帧的帮助下恢复那些掩蔽语音帧的索引。提出了一种复制和附加数据增强方法,以进行有效的基于块的预训练。Chunk SSL利用有限标量量化(FSQ)模块来离散化输入语音特征,并且我们的研究显示了高分辨率FSQ码本,即,词汇量高达几百万的码本有利于将知识从预训练任务转移到下游任务。在预训练期间采用组掩蔽预测损失以减轻由大码本引入的高存储器和计算成本。所提出的方法在两个语音到文本的任务,即,语音识别和语音翻译。在\textsc{Librispeech}和\textsc{Must-C}数据集上的实验结果表明,该方法在流媒体和离线模式下都能获得非常有竞争力的语音转文本任务结果。
摘要:Low latency speech human-machine communication is becoming increasingly necessary as speech technology advances quickly in the last decade. One of the primary factors behind the advancement of speech technology is self-supervised learning. Most self-supervised learning algorithms are designed with full utterance assumption and compromises have to made if partial utterances are presented, which are common in the streaming applications. In this work, we propose a chunk based self-supervised learning (Chunk SSL) algorithm as an unified solution for both streaming and offline speech pre-training. Chunk SSL is optimized with the masked prediction loss and an acoustic encoder is encouraged to restore indices of those masked speech frames with help from unmasked frames in the same chunk and preceding chunks. A copy and append data augmentation approach is proposed to conduct efficient chunk based pre-training. Chunk SSL utilizes a finite scalar quantization (FSQ) module to discretize input speech features and our study shows a high resolution FSQ codebook, i.e., a codebook with vocabulary size up to a few millions, is beneficial to transfer knowledge from the pre-training task to the downstream tasks. A group masked prediction loss is employed during pre-training to alleviate the high memory and computation cost introduced by the large codebook. The proposed approach is examined in two speech to text tasks, i.e., speech recognition and speech translation. Experimental results on the \textsc{Librispeech} and \textsc{Must-C} datasets show that the proposed method could achieve very competitive results for speech to text tasks at both streaming and offline modes.


【36】Contrastive Learning with Spectrum Information Augmentation in Abnormal Sound Detection
标题:异常声音检测中频谱信息增强的对比学习
链接:https://arxiv.org/abs/2509.15570

备注:Accepted CVIPPR 2024 April Xiamen China
摘要:孤立点暴露方法是解决无监督异常声音检测问题的一种有效方法。该方法的核心是如何使模型学习正态数据的分布空间。基于生物感知和数据分析,发现异常音频和噪声通常具有较高的频率。因此,我们提出了一种数据增强方法的高频信息的对比学习。这使得模型能够更加关注音频的低频信息,这代表了机器的正常操作模式。我们在DCASE 2020任务2上评估了所提出的方法。结果表明,我们的方法优于该数据集上使用的其他对比学习方法。我们还评估了我们的方法在DCASE 2022任务2数据集上的通用性。


【37】Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
标题:超越视频到SFX:具有环境意识的语音的视频到音频合成
链接:https://arxiv.org/abs/2509.15492

摘要:生成逼真的、上下文感知的音频在诸如视频游戏开发的现实世界应用中是重要的。虽然现有的视频到音频(V2 A)方法主要集中在Foley声音生成上,但是它们难以产生可理解的语音。同时,当前的环境语音合成方法仍然是文本驱动的,并且不能在时间上与动态视频内容对齐。在本文中,我们提出了超越视频到SFX(BVS),一种方法来生成同步音频与环境感知的可理解的语音给定的视频。我们介绍了一个两阶段的建模方法:(1)第一阶段是一个视频引导的音频语义(V2 AS)模型,预测统一的音频语义令牌的语音线索的条件下;(2)第二阶段是一个视频条件的语义到声学(VS 2A)模型,细化语义令牌到详细的声学令牌。实验证明了BVS在视频到上下文感知语音合成和沉浸式音频背景转换等场景中的有效性,消融研究进一步验证了我们的设计。我们的演示可以在~\href{https://xinleiniu.github.io/BVS-demo/}{BVS-Demo}上找到。


【38】A Novel Semantic Compression Approach for Ultra-low Bandwidth Voice Communication
标题:一种新颖的超低带宽语音通信语义压缩方法
链接:https://arxiv.org/abs/2509.15462

备注:5 pages, 2 figures. This work has been submitted to the IEEE for possible publication
摘要:虽然为压缩设计的现有语音音频编解码器利用有限形式的时间冗余并允许多尺度表示,但它们倾向于以相同的方式表示音频的所有特征。相比之下,为文本到语音和语音传输任务设计的生成语音模型最近被证明在将音频信号分解为基本不同特征的高级语义表示方面是有效的。在本文中,我们利用这种表示在一种新的语义通信方法,以实现较低的比特率,而不牺牲感知质量或适用于特定的下游任务。当以2- 4倍的低比特率编码时,我们的技术在转录,情感分析和说话者验证方面与现有的音频编解码器相匹配或优于现有的音频编解码器-特别是在感知质量和说话者验证方面超过Encodec,同时使用高达4倍的低比特率。


【39】Impact of Phonetics on Speaker Identity in Adversarial Voice Attack
标题:对抗性语音攻击中语音对说话者身份的影响
链接:https://arxiv.org/abs/2509.15437

备注:Additional figures for extended visualization: this https URL
摘要:语音中的对抗性扰动通过引入细微的波形修改对自动语音识别(ASR)和说话人验证构成严重威胁,这些波形修改对人类来说仍然是不可察觉的,但可以显著改变系统输出。虽然对端到端ASR模型的有针对性的攻击已经得到了广泛的研究,但这些扰动的语音基础及其对说话者身份的影响仍然没有得到充分的研究。在这项工作中,我们分析了语音水平的对抗音频,并表明扰动利用系统的混乱,如元音集中和辅音替换。这些失真不仅误导了转录,而且降低了语音线索说话人验证的关键,导致身份漂移。使用DeepSpeech作为我们的ASR目标,我们生成有针对性的对抗性示例,并评估它们对真实和冒名顶替样本中说话人嵌入的影响。16个语音不同的目标短语的结果表明,对抗性音频会导致转录错误和身份漂移,这突出了语音感知防御的必要性,以确保ASR和说话人识别系统的鲁棒性。


【40】BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition
标题:BiPQ:用于自我监督语音识别的双层自标记随机量化
链接:https://arxiv.org/abs/2509.15430

备注:5 pages including reference
摘要:语音是一个丰富的信号,标记的音频文本对是昂贵的,使得自监督学习对于可扩展的表示学习至关重要。语音SSL的一个核心挑战是生成既有信息又有效率的伪标签:强标签,如HuBERT中使用的标签,提高了下游性能,但依赖于外部编码器和多级管道,而BEST-RQ等高效方法则以较弱的标签为代价实现了简单性。我们提出了BiRQ,一个双层SSL框架,它结合了BEST-RQ的效率和HuBERT风格标签增强的改进优势。关键思想是重用模型本身的一部分作为伪标签生成器:中间表示由随机投影量化器离散化以产生增强的标签,而锚定标签直接从原始输入稳定训练并防止崩溃。训练被制定为一个有效的一阶双层优化问题,使用可微Gumbel-softmax选择端到端解决。这种设计消除了对外部标签编码器的需求,降低了内存成本,并以端到端的方式实现了迭代标签细化。BiRQ始终优于BEST-RQ,同时保持低复杂度和计算效率。我们在各种数据集上验证了我们的方法,包括960小时的LibriSpeech,150小时的AMI会议和5,000小时的YODAS,证明了与BEST-RQ相比的一致收益。


【41】Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech data
标题:探索有限语音数据下用于口语理解的大型音频语言模型的微调
链接:https://arxiv.org/abs/2509.15389

备注:4 pages (excluding references), 2 figures, submitted to ICASSP 2026
摘要:大型音频语言模型(LALM)已成为语音相关任务的强大工具,但仍有待进一步研究,尤其是在语音数据有限的情况下。为了弥合这一差距,我们系统地研究了不同的微调方案,包括纯文本,直接混合和课程学习如何影响口语理解(SLU),重点放在文本标签对丰富而配对语音标签数据有限的情况下。结果表明,LALM已经实现了竞争力的性能与纯文本微调,突出了他们强大的泛化能力。即使添加少量的语音数据(2-5%)也会产生实质性的进一步收益,课程学习在稀缺数据下特别有效。在跨语言二语习得中,将源语言语音数据与目标语言文本相结合,并以最少的目标语言语音数据实现有效的自适应。总体而言,这项研究提供了实际的见解LALM微调现实的数据约束下。


【42】Speech Language Models for Under-Represented Languages: Insights from Wolof
标题:代表性不足语言的语音语言模型:沃洛夫的见解
链接:https://arxiv.org/abs/2509.15362

摘要:我们介绍了我们为沃洛夫语(Wolof)训练语音语言模型的旅程,沃洛夫语是西非一种代表性不足的语言,并分享了关键见解。我们首先强调收集大规模,自发,高质量语音数据的重要性,并表明在此数据集上继续预训练HuBERT在ASR上的表现优于基础模型和以非洲为中心的模型。然后,我们将此语音编码器集成到一个沃洛夫LLM训练这种语言的第一个语音LLM,扩展其功能的任务,如语音翻译。此外,我们探索训练语音LLM在转录或翻译之前执行多步思想链。我们的结果表明,语音LLM不仅提高了语音识别,但也表现出良好的语音翻译。模型和代码将公开共享。


【43】Emotion-Aware Speech Generation with Character-Specific Voices for Comics
标题:具有漫画特定语音的语音感知语音生成
链接:https://arxiv.org/abs/2509.15253

摘要:本文提出了一个端到端的管道生成字符特定的,情感感知的语音漫画。该系统将完整的漫画卷作为输入,并根据每个角色的对话和情绪状态生成语音。图像处理模块执行字符检测、文本识别和情感强度识别。大型语言模型通过将视觉信息与不断变化的情节上下文相结合来执行对话归因和情感分析。语音是通过一个文本到语音的模型与不同的声音配置文件,适合每个字符和情感合成。这项工作实现了漫画的自动画外音生成,为互动和沉浸式漫画阅读体验迈出了一步。


【44】Comprehensive Evaluation of CNN-Based Audio Tagging Models on Resource-Constrained Devices
标题:资源受限设备上基于CNN的音频标记模型的综合评估
链接:https://arxiv.org/abs/2509.14049

作者:u-Haro, Ruben Ribes-Serrano, Javier Naranjo-Alcazar, Marta Garcia-Ballesteros, Pedro Zuccarello
备注:Accepted at Computing Conference 2026, London, UK
摘要:卷积神经网络(CNN)在音频标记任务中表现出卓越的性能。然而,在资源受限的设备(如Raspberry Pi)上部署这些模型会带来与计算效率和热管理相关的挑战。在本文中,对Raspberry Pi上用于音频标记的多卷积神经网络(CNN)架构进行了全面评估,包括来自预训练音频神经网络(PANN)框架的所有1D和2D模型,适用于音频分类的基于ConvNeXT的模型,以及MobileNetV3架构。此外,两个PANN衍生的网络,CNN9和CNN13,最近提出的,也进行了评估。为了提高跨不同硬件平台的部署效率和可移植性,所有模型都转换为开放神经网络交换(ONNX)格式。与以前专注于单个模型的工作不同,我们的分析涵盖了更广泛的架构,并涉及连续24小时的推理会话来评估性能稳定性。我们的实验表明,通过适当的模型选择和优化,可以保持一致的推理延迟,并在较长的时间内有效地管理热行为。这些发现为在现实世界的边缘计算场景中部署音频标记模型提供了有价值的见解。


机器翻译由腾讯交互翻译提供,仅供参考