微信公众号:arXiv_Daily
cs.SD语音
【1】Cross-Attention is Half Explanation in Speech-to-Text Models
标题:交叉注意只是语音到文本模型中的一半解释
链接:https://arxiv.org/abs/2509.18010
【2】WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
标题:WenetSpeech-Chuan:一个具有丰富注释的大型四川方言语音库
链接:https://arxiv.org/abs/2509.18004
摘要:方言的大规模开源数据的稀缺严重阻碍了语音技术的进步,对于广泛使用的四川方言来说,这一挑战尤为严峻。为了解决这一关键差距,我们介绍了WenetSpeech-Chuan,这是一个10,000小时的,使用我们的小说Chuan-Pipeline构建的注释丰富的语料库,这是一个完整的方言语音数据处理框架。为了便于严格的评估和证明语料库的有效性,我们还发布了高质量的ASR和TTS基准测试,WenetSpeech-Chuan-Eval,手动验证transmittance。实验表明,在WenetSpeech-Chuan上训练的模型在开源系统中达到了最先进的性能,并展示了与商业服务相当的结果。作为最大的四川方言开源语料库,文音语音不仅降低了方言语音处理研究的门槛,而且在促进人工智能公平和减轻语音技术偏见方面发挥了至关重要的作用。语料库、基准、模型和收据都可以在我们的项目页面上公开获得。
【3】Does Audio Matter for Modern Video-LLMs and Their Benchmarks?
标题:音频对现代视频法学硕士及其基准很重要吗?
链接:https://arxiv.org/abs/2509.17901
摘要:现代多模态大型语言模型通常声称“视频理解”,但大多数评估使用静音视频或简单地丢弃音频。我们提出了一个直接的问题:音频对当代视频LLM和认证它们的基准有多大影响?我们审计了广泛使用的套件,并观察到许多项目甚至可以从单个帧中解决,从而使音频在很大程度上冗余。在LLaVA-OneVision架构的基础上,我们附加了一个语音/音频编码器(例如,Whisper)并分析音频何时起作用,同时使用基于Mamba的轻量级状态空间令牌压缩器解决音频令牌爆炸问题。我们发现,音频在最近的视频基准测试中获得的收益最小,但对策划的音频敏感子集具有决定性作用。为了实现可靠的评估,我们发布了AVQA-Hard和Music-AVQA-Hard,我们的模型和代码。我们的研究结果表明,当前的学术实践与现实世界的期望之间存在越来越大的差距,并为可扩展的视听视频LLM提供了实用的工具。我们将在https://github.com/naver-ai/LLaVA-AV-SSM上完全开源我们的工作。
【4】Brainprint-Modulated Target Speaker Extraction
标题:脑纹调制目标说话人提取
链接:https://arxiv.org/abs/2509.17883
摘要:在神经操纵的目标说话人提取(TSE)中实现稳健和个性化的性能仍然是下一代助听器的重大挑战。这主要是由于两个因素:EEG信号跨会话的固有非平稳性,以及限制广义模型功效的高受试者间变异性。为了解决这些问题,我们提出了脑纹调制的目标说话人提取(BM-TSE),个性化和高保真提取的新框架。BM-TSE首先采用具有自适应谱增益(ASG)模块的时空EEG编码器来提取对非平稳性有弹性的稳定特征。我们的框架的核心是一个个性化的调制机制,其中一个统一的脑图嵌入学习主题识别(SID)和听觉注意解码(AAD)任务的联合监督下。这个学习的脑图,编码静态用户特征和动态注意力状态,积极地改进音频分离过程,动态地为每个用户定制输出。对公开的KUL和Cocktail Party数据集的评估表明,BM-TSE实现了最先进的性能,显著优于现有方法。我们的代码可在https://github.com/rosshan-orz/BM-TSE上公开访问。
【5】Convolutional Neural Network Optimization for Beehive Classification Using Bioacoustic Signals
标题:利用生物声学信号进行蜂巢分类的卷积神经网络优化
链接:https://arxiv.org/abs/2509.17800
【6】AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
标题:AuditoryBench++:语言模型可以在没有听力的情况下理解听觉知识吗?
链接:https://arxiv.org/abs/2509.17641
摘要:即使没有直接听到声音,人类也可以毫不费力地推理听觉特性,如音高,响度或声源关联,利用听觉常识。相比之下,语言模型往往缺乏这种能力,限制了它们在多模态交互中的有效性。作为解决这一差距的第一步,我们提出了AuditoryBench++,这是一个用于在纯文本环境中评估听觉知识和推理的全面基准。该基准测试包括从基本的听觉比较到基于上下文的推理的任务,从而能够对模型如何处理和集成听觉概念进行细粒度分析。此外,我们引入了AIR-CoT,一种新的听觉想象推理方法,通过特殊标记和知识注入的跨度检测,在推理过程中产生和整合听觉信息。最近LLM和多模态LLM的广泛实验表明,AIR-CoT通常优于现成的模型和那些增强了听觉知识的模型。该项目的网页可在https://auditorybenchpp.github.io上查阅。
【7】Audio Super-Resolution with Latent Bridge Models
标题:基于潜桥模型的音频超分辨率
链接:https://arxiv.org/abs/2509.17609
摘要:音频超分辨率(SR),即,将低分辨率(LR)波形上采样到高分辨率(HR)版本,最近已经利用扩散和桥接模型进行了探索,而先前的方法由于其先前的无信息生成而经常遭受次优上采样质量。为了实现高质量的音频超分辨率,我们提出了一种具有潜在桥模型(LBM)的新系统,在该系统中,我们将音频波形压缩到连续的潜在空间中,并设计LBM以实现自然匹配LR到HR上采样过程的潜在到潜在生成过程,从而充分利用LR波形中包含的指导性先验信息。尽管HR样本的可用性有限,但为了进一步增强训练结果,我们引入了频率感知的LBM,其中先验和目标频率作为模型输入,使LBM能够在训练阶段显式学习任意到任意的上采样过程。此外,我们设计了级联LBM,并提出了两个先前的增强策略,其中我们首次尝试解锁超过48 kHz的音频上采样,并授权无缝级联SR过程,为音频后期制作提供更高的灵活性。在VCTK、ESC-50、Song-Describer基准数据集和两个内部测试集上评估的综合实验结果表明,我们在语音、音频和音乐信号中实现了任意到48 kHz SR的最先进的客观和感知质量,并创下了任意到192kHz音频SR的第一个记录。https://AudioLBM.github.io/
【8】Attention-based Mixture of Experts for Robust Speech Deepfake Detection
标题:基于注意力的专家混合用于鲁棒的语音深度伪造检测
链接:https://arxiv.org/abs/2509.17585
摘要:人工智能生成的语音越来越多地用于日常生活中,为虚拟助手、辅助工具和其他应用程序提供动力。但是,它也被用于恶意目的,如模仿,错误信息和生物识别欺骗。随着语音深度伪造变得几乎无法与真实的人类语音区分开来,对鲁棒的检测方法和有效的对策的需求变得非常迫切。在本文中,我们介绍了ISPL在IH&MMSec 2025上提交的SAFE挑战,我们的系统在所有任务中排名第一。我们的解决方案引入了一种基于混合专家架构的音频deepfake检测新方法。所提出的系统利用多个国家的最先进的检测器,通过基于注意力的门控网络,动态加权每个专家的输入语音信号的基础上,结合他们的输出。在这种设计中,每个专家通过学习通过归纳偏差捕获相同输入的不同互补方面,从而对共享训练数据形成专业化的理解。实验结果表明,我们的方法优于现有的方法在多个数据集。我们进一步评估和分析我们的系统在安全挑战的性能。
【9】Virtual Consistency for Audio Editing
标题:音频编辑的虚拟一致性
链接:https://arxiv.org/abs/2509.17219
【10】STAR: Speech-to-Audio Generation via Representation Learning
标题:STAR:通过表示学习生成语音到音频
链接:https://arxiv.org/abs/2509.17164
【11】FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
标题:FakeSound 2:可解释和可概括的Deepfake声音检测的基准
链接:https://arxiv.org/abs/2509.17162
【12】RISE: Adaptive music playback for Realtime Intensity Synchronization with Exercise
标题:RISE:自适应音乐播放,实现与锻炼的实时强度同步
链接:https://arxiv.org/abs/2509.17112
摘要:我们提出了一个系统,以适应用户的音乐,以他们的锻炼对齐高能量的音乐片段与激烈的锻炼间隔。在运动时听音乐可以提高动力和表现。然而,音乐的结构可能与用户的自然休息和工作阶段不同,导致用户在等待激励部分时休息的时间比需要的时间长,或者如果部分结束得太快,则在工作中失去动力。为了解决这个问题,我们的系统,称为RISE,自动估计音乐中的激烈片段,并使用基于组件的音乐重排技术来动态扩展和缩短用户歌曲的不同片段,以适应正在进行的锻炼。我们的系统将休息和工作持续时间作为输入来指导适应。目前,这是通过预定义的计划或在锻炼期间手动输入来确定的。我们评估了12名参与者的RISE,并将我们的系统与实验室中锻炼时的非适应性音乐基线进行了比较。参与者发现,我们的重新安排保持了强度估计的准确性,许多人回忆起强度调整帮助他们完成锻炼的时刻。
【13】SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions
标题:SVeritas:不同条件下稳健说话人验证的基准
链接:https://arxiv.org/abs/2509.17091
摘要:说话人验证(SV)模型越来越多地集成到安全、个性化和访问控制系统中,但它们对许多现实挑战的鲁棒性仍然没有得到充分的基准测试。这些包括各种自然和恶意创建的条件,导致信号降级或注册和测试数据之间的不匹配,从而影响性能。现有的基准只评估这些条件的子集,完全忽略了其他条件。我们介绍了SVeritas,一个全面的扬声器验证任务基准套件,评估SV系统的压力源,如录音持续时间,自发性,内容,噪声,麦克风距离,混响,通道不匹配,音频带宽,编解码器,扬声器年龄,以及对欺骗和对抗性攻击的敏感性。虽然确实存在几个基准,每个基准都涵盖了其中的一些问题,但SVeritas是第一个全面的评估,不仅包括所有这些问题,而且还包括其他几个全新的,但仍然重要的,以前没有基准的现实生活条件。我们使用SVeritas来评估几个最先进的SV模型,并观察到,虽然一些架构在常见的失真下保持稳定性,但在涉及跨语言试验,年龄不匹配和编解码器引起的压缩的情况下,它们的性能会大幅下降。将我们的分析扩展到人口统计学亚组,我们进一步确定了年龄组,性别和语言背景之间的鲁棒性差异。通过在真实和合成压力条件下对评估进行标准化,SVeritas能够精确诊断模型的弱点,并为推进公平可靠的说话人验证系统奠定基础。
【14】Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
标题:Sidon:快速稳健的开源多语言语音恢复,用于大规模数据集清理
链接:https://arxiv.org/abs/2509.17052
摘要:大规模的文本到语音(TTS)系统受到缺乏干净的多语言录音的限制。Sidon是一种快速的开源语音恢复模型,它可以将嘈杂的野外语音转换为工作室质量的语音,并扩展到数十种语言。Sidon由两种型号组成:w2 v-BERT 2.0微调特征预测器,从嘈杂的语音中清除特征,声码器经过训练,从清除的特征中合成恢复的语音。Sidon实现了与Miipher相当的恢复性能:Google的内部语音恢复模型,旨在为语音合成进行数据集清理。Sidon的计算效率也很高,在单个GPU上的运行速度比实时快3,390倍。我们进一步表明,训练TTS模型使用西顿清洗自动语音识别语料库提高了合成语音的质量在zero-shot设置。发布代码和模型,以促进研究社区的可重复数据集清理。
【15】VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
标题:VA Inpaint:具有LLM驱动模块的Zero-Shot视频-音频修复框架
链接:https://arxiv.org/abs/2509.17022
【16】Bridging the gap between training and inference in LM-based TTS models
标题:弥合基于LM的TTC模型中训练和推理之间的差距
链接:https://arxiv.org/abs/2509.17021
摘要:文本到语音(TTS)的最新进展表明,基于语言模型(LM)的系统提供了有竞争力的性能相比,传统的方法。然而,在训练中,TTS模型使用地面实况(GT)标记作为前缀来预测下一个标记,而在推理中这些标记不可用,这是训练和推理之间的差距,经常被忽视。在这项研究中,我们提出了一个基于LM-TTS系统的混合训练方案,以减轻曝光偏差。我们的核心思想是采用一种混合训练范式,将教师强迫与自由运行相结合,从而将自我生成的令牌引入训练过程。这使得训练模式与推理更加一致,减少了训练-推理差距。此外,我们在训练过程中加入了EOS预测机制,以检测不正确的序列终止并自适应地控制自由运行过程。实验结果提供了一个全面的评价曝光偏差的影响LM为基础的TTS,并证明我们的方法有效地缩小了训练推理的差距,从而提高合成的长格式语音的质量。
【17】MBCodec:Thorough disentangle for high-fidelity audio compression
标题:MBCodec:彻底理清高保真音频压缩
链接:https://arxiv.org/abs/2509.17006
摘要:文本到语音(TTS)中的高保真神经音频编解码器旨在将语音信号压缩为离散表示以进行忠实重建。然而,先前的方法在有效地解开令牌内的声学和语义信息方面面临挑战,导致合成语音中缺乏细粒度的细节。在这项研究中,我们提出了MBCodec,一种新的多码本音频编解码器的基础上残差矢量量化(RVQ),学习分层结构的表示。MBCodec利用来自原始信号的自监督语义标记化和音频子带特征来构建功能上分离的潜在空间。为了鼓励跨编解码器嵌入空间的各个层的全面学习,我们引入自适应丢弃深度来跨层差分训练码本,并且在训练期间采用多通道伪正交镜像滤波器(PQMF)。通过彻底解耦语义和声学特征,我们的方法不仅实现了近乎无损的语音重建,而且还实现了24 kHz音频的170倍压缩,导致低比特率仅为2.2 kbps。实验性评价证实,在所有评价中,该方案的业绩始终大大优于基线。
【18】Advancing Speech Understanding in Speech-Aware Language Models with GRPO
标题:使用GRPO推进语音感知语言模型中的语音理解
链接:https://arxiv.org/abs/2509.16990
【19】Leveraging Multiple Speech Enhancers for Non-Intrusive Intelligibility Prediction for Hearing-Impaired Listeners
标题:利用多个语音增强器对听力受损的听众进行非侵入性可理解度预测
链接:https://arxiv.org/abs/2509.16979
【20】Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
标题:通过多模式LLM的思维链差异-共性推理进行可解释音频编辑评估
链接:https://arxiv.org/abs/2509.16975
【21】AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
标题:AudioGenie-Reasoner:一个用于从粗到细音频深度推理的免训练多代理框架
链接:https://arxiv.org/abs/2509.16971
【22】Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
标题:多通道音频对齐的交叉注意和置信加权
链接:https://arxiv.org/abs/2509.16926
摘要:多通道音频对齐是生物声学监测、空间音频系统和声学定位中的关键要求。然而,现有的方法往往难以解决非线性时钟漂移,缺乏量化不确定性的机制。传统的方法,如互相关和动态时间弯曲假设简单的漂移模式,并提供没有可靠性措施。与此同时,最近的深度学习模型通常将对齐视为二进制分类任务,忽略了通道间的依赖性和不确定性估计。我们介绍了一种方法,结合交叉注意机制与信任加权评分,以提高多通道音频同步。我们扩展了BEAT编码器与交叉注意层,以模拟通道之间的时间关系。我们还开发了一个置信加权评分函数,使用完整的预测分布,而不是二进制阈值。我们的方法在BioDCASE 2025任务1挑战中获得了第一名,测试数据集的MSE平均值为0.30,而深度学习基线为0.58。在单个数据集上,我们在ARU数据上实现了0.14 MSE(减少77%),在斑胸草雀数据上实现了0.45 MSE(减少18%)。该框架支持概率时间对齐,超越点估计。虽然在生物声学背景下进行了验证,但该方法适用于更广泛的多通道音频任务,其中对准置信度至关重要。代码可在:https://github.com/Ragib-Amin-Nihal/BEATsCA上获得
【23】Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
标题:视听导航的音频引导动态模式融合和立体感知注意力
链接:https://arxiv.org/abs/2509.16924
摘要:在视听导航(AVN)任务中,一个具体的代理必须自主定位声源在未知的和复杂的3D环境的基础上的视听信号。现有的方法往往依赖于静态模态融合策略,忽略了嵌入在立体声音频的空间线索,导致性能下降,在混乱或闭塞的场景。为了解决这些问题,我们提出了一个端到端的基于强化学习的AVN框架,该框架具有两个关键创新:(1)\textbf{S}立体感知\textbf{A}注意力\textbf{M}感知(\textbf{SAM}),它学习并利用左右音频通道之间的空间差异来增强方向性声音感知;以及(2)\textbf{A}udio-\textbf{G}uided \textbf{D}听觉\textbf{F}感知模块(\textbf{AGDF}),其基于音频线索动态地调整视觉和听觉特征之间的融合比率,从而提高对环境变化的鲁棒性。在两个真实的3D场景数据集上进行了大量的实验,证明了我们的方法在导航成功率和路径效率方面显着优于现有的方法。值得注意的是,与性能最佳的基线相比,我们的模型在仅音频条件下实现了超过40%的改进。这些结果突出了从立体声通道明确建模空间线索和执行深度多模态融合以实现鲁棒和高效的视听导航的重要性。
【24】PGSTalker: Real-Time Audio-Driven Talking Head Generation via 3D Gaussian Splatting with Pixel-Aware Density Control
标题:PGSTalker:通过3D高斯飞溅和Pixel-Aware密度控制生成实时音频驱动的说话头
链接:https://arxiv.org/abs/2509.16922
摘要:音频驱动的说话头部生成对于虚拟现实、数字化身和电影制作中的应用至关重要。虽然基于NeRF的方法能够实现高保真重建,但它们存在渲染效率低和次优视听同步的问题。本文提出了一种基于3DGS(3D Gaussian Splatting)的实时音频驱动的说话头合成框架PGSTalker。为了提高渲染性能,我们提出了一个像素感知的密度控制策略,自适应地分配点密度,增强动态面部区域的细节,同时减少其他地方的冗余。此外,我们引入了一个轻量级的多模态门控融合模块,有效地融合音频和空间特征,从而提高高斯变形预测的准确性。在公共数据集上进行的大量实验表明,PGSTalker在渲染质量、唇同步精度和推理速度方面优于现有的基于NeRF和3DGS的方法。我们的方法具有很强的泛化能力和实际部署的潜力。
【25】Difficulty-Aware Score Generation for Piano Sight-Reading
标题:钢琴视读的难度感知乐谱生成
链接:https://arxiv.org/abs/2509.16913
【26】Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology
标题:鼓声打击乐声音转换及其评价方法
链接:https://arxiv.org/abs/2509.16862
摘要:本文定义了鼓到人声打击(VP)的声音转换的新任务。VP通过人类发声来模仿打击乐器,并经常在当代无伴奏合唱音乐中使用。它表现出与语音和歌唱不同的声学特性(例如,非周期性、噪声瞬变和语言结构的缺失),使得传统的语音或歌唱合成方法不适用。因此,我们制定VP合成作为一个从鼓的声音音色转移问题,利用他们的节奏和音色的对应。为了支持这一提法,我们定义了成功转换的三个要求:节奏的保真度,音色的一致性,和自然的VP。我们还提出了相应的主观评价标准。我们实现了两个基线转换方法,使用神经音频合成器,实时音频变分自动编码器(RAVE),有和没有矢量量化(VQ)。主观实验表明,这两种方法产生合理的VP输出,与基于VQ的RAVE模型产生更一致的转换。
【27】The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology
标题:声音的声音:言语病理学语言模型的微调和综合评估
链接:https://arxiv.org/abs/2509.16765
摘要:根据美国国立卫生研究院的数据,超过340万儿童患有需要临床干预的言语障碍。言语语言病理学家的人数大约是受影响儿童人数的20倍,这突出表明儿童护理方面存在重大差距,迫切需要技术支持,以提高言语语言病理学家的工作效率。最先进的多模态语言模型(MLM)显示出支持SLP的前景,但它们的使用仍然未被充分探索,主要是由于对它们在高风险临床环境中的性能的了解有限。为了解决这一差距,我们与领域专家合作,开发了一个语音语言病理学中MLMs真实用例的分类。在此分类的基础上,我们引入了第一个全面的基准,用于评估五个核心用例中的MLM,每个用例包含1,000个手动注释的数据点。该基准测试包括各种设置下的鲁棒性和灵敏度测试,包括背景噪音、说话者性别和口音。我们对15个最先进的多层模型的评估表明,没有一个模型在所有任务中始终优于其他模型。值得注意的是,我们发现了系统性的差异,模型在男性说话者身上表现更好,并观察到思维链提示可以降低具有大标签空间和窄决策边界的分类任务的性能。此外,我们研究了对特定领域数据进行微调的MLMs,与基础模型相比,改进了30%以上。这些发现突出了当前MLMs在语音语言病理学应用中的潜力和局限性,强调了进一步研究和有针对性的开发的必要性。
【28】Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
标题:非典型语音识别的独特建模与规范建模:结构障碍案例研究
链接:https://arxiv.org/abs/2509.16718
摘要:最先进的自动语音识别(ASR)模型,如Whisper,在非典型语音上表现不佳,例如由构音障碍患者产生的语音。过去的作品,非典型语音大多研究完全个性化(或特质)的模型,但建模策略,既可以概括和处理特质可以更有效地捕捉非典型语音。为了研究这一点,我们比较了四种策略:(a)在典型语音上训练的$\textit{normal}$模型(无个性化),(b)完全个性化的$\textit{idiosyncratic}$模型,(c)在其他构音障碍说话者上训练的$\textit{dysarthric-normal}$模型,和(d)$\textit{dysarthric-idiosyncratic}$模型,通过在适应个人语音之前首先建模规范模式来组合策略。在本案例研究中,我们发现构音障碍-特质模型的性能优于特质方法,同时需要不到一半的个性化数据(128个训练大小的WER为36.43,256个为36.99)。此外,我们发现单独调整语音编码器(与LM解码器相反)产生了最好的结果,平均将字错误率从71%降低到32%。我们的研究结果强调了利用规范(跨扬声器)和特质(扬声器特定)模式来改善代表性不足的语音人群的ASR的价值。
【29】Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
标题:Speech-to-See:端到端语音驱动的开放集对象检测
链接:https://arxiv.org/abs/2509.16670
【30】On the de-duplication of the Lakh MIDI dataset
标题:关于Lakh Buttons数据集的重复数据消除
链接:https://arxiv.org/abs/2509.16662
摘要:大规模数据集对于训练一个通用的深度学习模型至关重要。大多数这样的数据集是通过从各种互联网资源中抓取来收集的,不可避免地会引入重复的数据。在符号音乐领域,这些重复通常来自多个用户的安排和简单编辑后的元数据更改。然而,尽管存在一些关键问题,例如随机分割期间数据泄漏导致的不可靠的训练评估,但数据集重复在MIR社区中尚未得到广泛解决。本研究调查的数据集重复的问题,在符号音乐领域的最大的公开来源之一,Lakh的数据集(LMD)。为了找到和评估重复数据的最佳检索方法,我们采用了LMD的Clean Rounds子集作为基准测试集,其中相同歌曲的不同版本被分组在一起。我们首先评估了基于规则的方法和以前的符号音乐检索模型的重复数据删除,并研究了基于对比学习的BERT模型与各种增强,以找到重复的文件。因此,我们提出了三种不同版本的LMD过滤列表,在178,561个文件中,在最保守的设置中过滤出至少38,134个样本。
【31】AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
标题:DCASE 2025的AISTA实验室系统Task6:基于语音的音频检索
链接:https://arxiv.org/abs/2509.16649
摘要:本报告介绍了AISTAT团队对DCASE 2025任务6中基于语言的音频检索任务的提交。我们提出的系统采用双编码器架构,其中音频和文本模态分别编码,并使用对比学习对齐它们的表示。从前一年挑战的方法学中汲取灵感,我们实施了一种蒸馏方法,并利用大型语言模型(LLM)进行有效的数据增强技术,包括反向翻译和LLM混合。此外,我们还结合了聚类来引入辅助分类任务,以便进一步进行微调。在Clotho开发测试中,我们最好的单个系统达到了46.62的mAP@16,而四个系统的集合达到了48.83的mAP@16。
【32】Barwise Section Boundary Detection in Symbolic Music Using Convolutional Neural Networks
标题:利用卷积神经网络进行符号音乐中的巴氏段边界检测
链接:https://arxiv.org/abs/2509.16566
【33】Etude: Piano Cover Generation with a Three-Stage Approach -- Extract, strucTUralize, and DEcode
标题:练习曲:三阶段方法的钢琴翻唱--提取、结构化和解码
链接:https://arxiv.org/abs/2509.16522
【34】LenslessMic: Audio Encryption and Authentication via Lensless Computational Imaging
标题:LenslessMic:通过Lensless计算成像进行音频加密和认证
链接:https://arxiv.org/abs/2509.16418
摘要:随着社会对数字数据共享的日益依赖,敏感信息的保护变得至关重要。加密是保护隐私的方法之一;然而,它在音频领域的实现主要依赖于信号处理或嵌入硬件的软件方法。在本文中,我们介绍了LenslessMic,一种基于硬件的混合光学加密方法,利用无透镜摄像头作为适用于多种类型音频的物理安全层。我们表明,LenslessMic能够实现(1)强大的录音认证和(2)加密强度,可以与256位数字标准的搜索空间相媲美,同时保持高质量的信号和最小的内容信息丢失。该方法通过低成本的Raspberry Pi原型进行了验证,并与数据集一起开源,以促进该领域的研究。
【35】Comparator Loss: An Ordinal Contrastive Loss to Derive a Severity Score for Speech-based Health Monitoring
标题:比较者损失:推导基于言语的健康监测严重性评分的有序对比损失
链接:https://arxiv.org/abs/2509.17661
摘要:监测神经退行性疾病的进展在治疗计划和未来药物治疗的评估中具有重要的应用。鉴于目前最先进的语音健康监测技术主要集中在对患者与健康对照进行分类,或预测现实世界的健康指标,我们在这里提出了一种新的疾病进展指标:严重程度评分。这个分数来自一个经过训练的模型,以最小化我们所说的比较器损失。比较器损失确保评分遵循排序关系,该排序关系可以基于诊断、临床注释评分或简单地记录的时间顺序。除了提供比简单的离散分类更详细的情况外,拟议的基于比较损失的系统有可能纳入来自不同健康指标的信息,这对于充分利用小型健康相关数据集至关重要。我们评估了我们提出的模型,基于它们肯定跟踪运动神经元疾病(MND)患者进展的能力,它们的输出与临床注释(如ALSFRS-R)的相关性,以及它们区分MND受试者和健康对照的能力。
【36】SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription
标题:SongPrep:全歌曲结构解析和歌词转录的预处理框架和端到端模型
链接:https://arxiv.org/abs/2509.17404
【37】RADE for Land Mobile Radio: A Neural Codec for Transmission of Speech over Baseband FM Radio Channels
标题:用于陆地移动广播的RADE:用于通过基带FM无线电频道传输语音的神经编解码器
链接:https://arxiv.org/abs/2509.17286
摘要:在20世纪90年代,陆地移动无线电(LMR)系统从模拟调频(FM)发展到标准化的数字系统。数字和模拟FM系统现在共存于各种服务中,并表现出类似的语音质量。许多数字无线电的架构保留了传统模拟无线电的模拟FM调制器和解调器,但由多级数字脉冲训练而不是模拟语音信号驱动。我们表示这种架构基带FM(BBFM)。在本文中,我们描述了一种现代机器学习方法,该方法使用自动编码器通过BBFM信道发送高质量的8 kHz带宽语音。的语音质量被证明是优于模拟FM在模拟LMR信道中存在的衰落,和商品UHF无线电系统运行的演示
【38】BeepBank-500: A Synthetic Earcon Mini-Corpus for UI Sound Research and Psychoacoustics Research
标题:BeepBank-500:用于UI声音研究和心理声学研究的合成Earcon迷你数据库
链接:https://arxiv.org/abs/2509.17277
摘要:我们介绍BeepBank-500,一个紧凑的,完全合成的耳标/警报数据集(300-500个剪辑),旨在进行人机交互和音频机器学习的快速,正确的实验。每个片段都是从控制波形族(正弦、方波、三角波、FM)、基频、持续时间、幅度包络、幅度调制(AM)和轻量级Schroeder风格混响的参数配方生成的。我们使用三种混响设置:干燥,两个合成房间表示为“小”(“小”)和“中等”(“中等”)。我们发布了单声道48 kHz WAV音频(16位),丰富的元数据表(信号/频谱特征)和微小的可重现基线,用于(i)波形族分类和(ii)单音f0回归。语料库的目标任务,如耳标分类,音色分析和发病检测,明确规定的许可和限制。音频通过CC 0 -1.0专用于公共领域;代码在MIT下。Data DOI:https://doi.org/10.5281/zenodo.17172015.代码:https://github.com/mandip42/earcons-mini-500。
【39】Reference-aware SFM layers for intrusive intelligibility prediction
标题:用于侵入式可懂度预测的参考感知SFM层
链接:https://arxiv.org/abs/2509.17270
摘要:利用显式参考信号的侵入式语音可懂度预测器现在很普遍,但它们并没有始终超过非侵入式系统。我们认为,一个主要原因是有限的开发语音基础模型(SFM)。这项工作通过将参考条件与多层SFM表示相结合来重新审视侵入式预测。我们最终的系统在开发集上达到RMSE 22.36,在评估集上达到24.98,在CPC 3上排名第一。这些研究结果为构建基于SFM的侵入式可懂度预测器提供了实际指导。
【40】DeepASA: An Object-Oriented One-for-All Network for Auditory Scene Analysis
标题:DeepASA:一个面向对象的一对多听觉场景分析网络
链接:https://arxiv.org/abs/2509.17247
摘要:我们提出了DeepASA,这是一种用于听觉场景分析的一对多模型,它在统一的框架内执行多输入多输出(MIMO)源分离,去混响,声音事件检测(SED),音频分类和到达方向估计(DoAE)。DeepASA专为复杂的听觉场景而设计,其中多个通常相似的声源在时间上重叠并在空间上动态移动。为了实现跨任务的鲁棒性和一致性推理,我们引入了面向对象的处理(OOP)策略。这种方法将不同的听觉特征封装到以对象为中心的表示中,并通过推理链(CoI)机制对其进行细化。该流水线包括基于动态时间内核的特征提取器、基于变换器的聚合器和产生每个对象特征的对象分离器。这些特性输入到多个特定于任务的解码器中。我们以对象为中心的表示自然地解决了传统跟踪处理中固有的参数关联模糊性。但是,早期的对象分离可能会导致下游ASA任务失败。为了解决这个问题,我们在推理链中实现了时间相干匹配(TCM),使用估计的听觉参数实现了对象特征的多任务融合和迭代细化。我们在代表性的空间音频基准数据集上评估了DeepASA,包括ASA 2,MC-FUSS和STARSS 23。实验结果表明,我们的模型在所有评估任务中都达到了最先进的性能,证明了它在不同空间听觉场景下的源分离和听觉参数估计的有效性。
【41】DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
标题:DroFiT:一种轻量级的频段融合频率关注实时无人机语音增强
链接:https://arxiv.org/abs/2509.16945
【42】Automotive Sound Quality for EVs: Psychoacoustic Metrics with Reproducible AI/ML Baselines
标题:电动汽车的汽车音质:具有可再现AI/ML基线的心理声学测试
链接:https://arxiv.org/abs/2509.16901
【43】Feature Selection via Graph Topology Inference for Soundscape Emotion Recognition
标题:基于图布局推理的声景情感识别特征选择
链接:https://arxiv.org/abs/2509.16760
【44】Reverse Attention for Lightweight Speech Enhancement on Edge Devices
标题:边缘设备上轻量级语音增强的反向注意力
链接:https://arxiv.org/abs/2509.16705
【45】Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
标题:用于ASB和审议处理的音频调节扩散LLM
链接:https://arxiv.org/abs/2509.16622
【46】An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
标题:用于基于扩散的音频生成的基于Octave的多分辨率CQT架构
链接:https://arxiv.org/abs/2509.16603
摘要:本文介绍了MR-CQTdiff,一种新的神经网络架构的扩散为基础的音频生成,利用多分辨率常数$Q$变换(C$Q$T)。所提出的架构采用了一个高效的,可逆的CQT框架,调整的倍频程倍频程的基础上的时间-频率分辨率。该设计解决了低频时的低时间分辨率问题,从而实现了更灵活和更具表现力的音频生成。我们使用Fr\'echet音频距离(FAD)度量在各种架构和两个数据集上进行评估。实验结果表明,MR-CQTdiff实现了最先进的音频质量,优于竞争对手的架构。
【47】TF-CorrNet: Leveraging Spatial Correlation for Continuous Speech Separation
标题:TF-CorrNet:利用空间相关性实现连续语音分离
链接:https://arxiv.org/abs/2509.16481
摘要:通常,多通道源分离利用了与时频域中的幅度信息级联的麦克风间相位差(IPD),或者沿通道轴堆叠的实部和虚部。然而,声源的空间信息基本上包含在麦克风之间的差异中,特别是在它们之间的相关性中,而每个麦克风的功率也提供了关于源频谱的有价值的信息,这就是为什么幅度也包括在内。因此,我们提出了一个网络,直接利用相位变换(PHAT)-β的相关输入来估计分离滤波器。此外,建议TF-CorrNet处理的功能交替跨越时间和频率轴作为一个双路径战略的空间信息。此外,我们增加了一个频谱模块来模拟源相关的直接时间-频率模式,以改善语音分离。实验结果表明,所提出的TF-CorrNet有效地分离语音的声音,表现出高性能与低计算成本的LibriCSS数据集。
【48】Harmonic Summation-Based Robust Pitch Estimation in Noisy and Reverberant Environments
标题:有噪和回响环境下基于调和的鲁棒音调估计
链接:https://arxiv.org/abs/2509.16480
【49】Similarity-Guided Diffusion for Long-Gap Music Inpainting
标题:相似性引导的长间隙音乐修复扩散
链接:https://arxiv.org/abs/2509.16342
摘要:音乐修复旨在重建受损录音的缺失片段。虽然基于扩散的生成模型改善了中等长度间隙的重建,但它们通常难以在多秒间隙上保持音乐的可重复性。我们介绍了相似性指导的扩散后验采样(SimDPS),一种混合方法,结合了基于扩散的推理与相似性搜索。候选片段首先从语料库检索的上下文相似性的基础上,然后纳入一个修改后的可能性,引导扩散过程的上下文一致的重建。主观评价钢琴音乐修复与2秒的差距表明,所提出的SimDPS方法相比,无指导的扩散,增强了感知的可扩展性和经常优于相似性搜索时,只有适度相似的候选人。这些结果表明,混合相似性方法的扩散为基础的音频增强与长间隙的潜力。
【50】Investigating Polyglot Speech Foundation Models for Learning Collective Emotion from Crowds
标题:研究多语言言语基金会模型以学习人群的集体情感
链接:https://arxiv.org/abs/2509.16329
摘要:本文研究了用于人群情感识别的多语言语音基础模型。我们假设,在不同的语言,口音和语音模式上预先训练的多语言SFM特别擅长于导航人群环境中嘈杂和复杂的声学环境,从而为CER提供了显着的优势。为了证实这一点,我们进行了全面的分析,比较多语种,单语,说话人识别SFM通过广泛的实验在不同的音频持续时间(1秒,500毫秒,250毫秒)的基准CER数据集。结果一致证明了多语言SFM的优越性,在所有音频长度上都优于同行,即使在极短的输入时间内也表现出色。这些研究结果铺平了道路,适应可持续森林管理办法,建立新的基准CER。
【1】Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
标题:Nord-Parl-TTC:来自议会演讲的芬兰和瑞典TTC数据集
链接:https://arxiv.org/abs/2509.17988
【2】Benchmarking Humans and Machines on Complex Multilingual Speech Understanding Tasks
标题:在复杂的多语言语音理解任务上对人类和机器进行基准测试
链接:https://arxiv.org/abs/2509.17965
摘要:听觉注意力和选择性锁相是人类在复杂声学场景和鸡尾酒会环境中理解语音的核心,但对多语言受试者的这些能力仍然知之甚少。虽然近年来自然语音的机器理解取得了进展,但对重叠和混合通道语音的理解仍然存在问题。我们提出了一个系统的范式,用于研究人类和机器在多语言环境中的语音问答任务,具有干净和混合通道的语音。对于人类听众来说,对目标说话者的选择性注意在他们的母语(L1)中比在他们的第二语言(L2)中明显更好。对于机器听力,基于语音的大型语言模型(LLM)在干净的单扬声器条件下匹配或超过人类表现,但在双扬声器环境中通常难以选择性地参加。这些结果揭示了一个关键的分歧:人类依赖于在母语中更精简的注意力线索,而LLM默认为超过人类技能的并行信息提取。
【3】GAN-Based Multi-Microphone Spatial Target Speaker Extraction
标题:基于GAN的多麦克风空间目标说话人提取
链接:https://arxiv.org/abs/2509.17741
【4】Comparator Loss: An Ordinal Contrastive Loss to Derive a Severity Score for Speech-based Health Monitoring
标题:比较者损失:推导基于言语的健康监测严重性评分的有序对比损失
链接:https://arxiv.org/abs/2509.17661
摘要:监测神经退行性疾病的进展在治疗计划和未来药物治疗的评估中具有重要的应用。鉴于目前最先进的语音健康监测技术主要集中在对患者与健康对照进行分类,或预测现实世界的健康指标,我们在这里提出了一种新的疾病进展指标:严重程度评分。这个分数来自一个经过训练的模型,以最小化我们所说的比较器损失。比较器损失确保评分遵循排序关系,该排序关系可以基于诊断、临床注释评分或简单地记录的时间顺序。除了提供比简单的离散分类更详细的情况外,拟议的基于比较损失的系统有可能纳入来自不同健康指标的信息,这对于充分利用小型健康相关数据集至关重要。我们评估了我们提出的模型,基于它们肯定跟踪运动神经元疾病(MND)患者进展的能力,它们的输出与临床注释(如ALSFRS-R)的相关性,以及它们区分MND受试者和健康对照的能力。
【5】Audiobook-CC: Controllable Long-context Speech Generation for Multicast Audiobook
标题:Audiobook-CC:多播Audiobook-CC:可控制的长上下文语音生成
链接:https://arxiv.org/abs/2509.17516
【6】FUN-SSL: Full-band Layer Followed by U-Net with Narrow-band Layers for Multiple Moving Sound Source Localization
标题:FUN-SSL:全频段层后加上U-Net,具有窄频段层,用于多个移动声音源定位
链接:https://arxiv.org/abs/2509.17490
摘要:沿时间和频谱维度的双路径处理已被证明在各种语音处理应用中是有效的。虽然利用双路径处理的声源定位(SSL)模型(如FN-SSL和IPDnet)在定位多个移动源方面表现出令人印象深刻的性能,但它们需要大量的计算。在本文中,我们提出了一种SSL的架构,它引入了一个U-网进行窄带处理,在多个分辨率,以减少计算复杂度。所提出的模型将IPDnet中的全窄网络块替换为FUN块,该全窄网络块由一个全带LSTM层组成,该全带LSTM层沿着频谱维度,然后是一个窄带LSTM层,该窄带LSTM层沿着时间维度,该FUN块由一个全带层组成,然后是一个具有多个尺度窄带层的U-网络。在每个U-Net内的跳过连接之上,我们还引入了FUN块之间的跳过连接以丰富信息。实验结果表明,所提出的FUN-SSL优于以前提出的方法,计算复杂度远低于IPDnet。
【7】Neural acoustic multipole splatting for room impulse response synthesis
标题:神经声学多极飞溅用于房间脉冲响应合成
链接:https://arxiv.org/abs/2509.17410
摘要:任意接收器位置的房间脉冲响应(RIR)预测对于空间音频渲染等实际应用至关重要。我们提出了神经声学多极子溅射(NAMS),它通过学习神经声学多极子的位置并使用神经网络预测其发射信号和方向性来合成在看不见的接收器位置处的RIR。通过多极的组合表示声场提供了足够的灵活性来表达复杂的声学场景,同时遵守诸如亥姆霍兹方程之类的物理约束。我们还引入了一种修剪策略,该策略从神经声学多极的密集飞溅开始,并在训练过程中逐步消除多余的多极。在真实数据集和合成数据集上进行的实验表明,该方法在大多数指标上都优于以前的方法,同时保持快速推理。烧蚀研究表明,多极溅射修剪实现更好的性能比只有20%的极点的模型。
【8】SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription
标题:SongPrep:全歌曲结构解析和歌词转录的预处理框架和端到端模型
链接:https://arxiv.org/abs/2509.17404
【9】Improving Active Learning for Melody Estimation by Disentangling Uncertainties
标题:通过理清不确定性来改善旋律估计的主动学习
链接:https://arxiv.org/abs/2509.17375
摘要:估计基频或旋律是音乐信息检索(MIR)的核心任务。各种研究探索了信号处理,机器学习和基于深度学习的方法,最近的重点是利用主动学习设置中的不确定性进行旋律估计。然而,这些方法没有调查不同的不确定性的相对有效性。在这项工作中,我们遵循一个框架,解开任意性和认知的不确定性,以指导主动学习旋律估计。在源数据集上进行训练,我们的模型仅使用少量标记样本就能适应新的领域。实验结果表明,认知不确定性是更可靠的领域适应减少标记工作相比,任意的不确定性。
【10】RADE for Land Mobile Radio: A Neural Codec for Transmission of Speech over Baseband FM Radio Channels
标题:用于陆地移动广播的RADE:用于通过基带FM无线电频道传输语音的神经编解码器
链接:https://arxiv.org/abs/2509.17286
摘要:在20世纪90年代,陆地移动无线电(LMR)系统从模拟调频(FM)发展到标准化的数字系统。数字和模拟FM系统现在共存于各种服务中,并表现出类似的语音质量。许多数字无线电的架构保留了传统模拟无线电的模拟FM调制器和解调器,但由多级数字脉冲训练而不是模拟语音信号驱动。我们表示这种架构基带FM(BBFM)。在本文中,我们描述了一种现代机器学习方法,该方法使用自动编码器通过BBFM信道发送高质量的8 kHz带宽语音。的语音质量被证明是优于模拟FM在模拟LMR信道中存在的衰落,和商品UHF无线电系统运行的演示。
【11】BeepBank-500: A Synthetic Earcon Mini-Corpus for UI Sound Research and Psychoacoustics Research
标题:BeepBank-500:用于UI声音研究和心理声学研究的合成Earcon迷你数据库
链接:https://arxiv.org/abs/2509.17277
摘要:我们介绍BeepBank-500,一个紧凑的,完全合成的耳标/警报数据集(300-500个剪辑),旨在进行人机交互和音频机器学习的快速,正确的实验。每个片段都是从控制波形族(正弦、方波、三角波、FM)、基频、持续时间、幅度包络、幅度调制(AM)和轻量级Schroeder风格混响的参数配方生成的。我们使用三种混响设置:干燥,两个合成房间表示为“小”(“小”)和“中等”(“中等”)。我们发布了单声道48 kHz WAV音频(16位),丰富的元数据表(信号/频谱特征)和微小的可重现基线,用于(i)波形族分类和(ii)单音f0回归。语料库的目标任务,如耳标分类,音色分析和发病检测,明确规定的许可和限制。音频通过CC 0 -1.0专用于公共领域;代码在MIT下。Data DOI:https://doi.org/10.5281/zenodo.17172015.代码:https://github.com/mandip42/earcons-mini-500。
【12】Reference-aware SFM layers for intrusive intelligibility prediction
标题:用于侵入式可懂度预测的参考感知SFM层
链接:https://arxiv.org/abs/2509.17270
摘要:利用显式参考信号的侵入式语音可懂度预测器现在很普遍,但它们并没有始终超过非侵入式系统。我们认为,一个主要原因是有限的开发语音基础模型(SFM)。这项工作通过将参考条件与多层SFM表示相结合来重新审视侵入式预测。我们最终的系统在开发集上达到RMSE 22.36,在评估集上达到24.98,在CPC 3上排名第一。这些研究结果为构建基于SFM的侵入式可懂度预测器提供了实际指导。
【13】DeepASA: An Object-Oriented One-for-All Network for Auditory Scene Analysis
标题:DeepASA:一个面向对象的一对多听觉场景分析网络
链接:https://arxiv.org/abs/2509.17247
摘要:我们提出了DeepASA,这是一种用于听觉场景分析的一对多模型,它在统一的框架内执行多输入多输出(MIMO)源分离,去混响,声音事件检测(SED),音频分类和到达方向估计(DoAE)。DeepASA专为复杂的听觉场景而设计,其中多个通常相似的声源在时间上重叠并在空间上动态移动。为了实现跨任务的鲁棒性和一致性推理,我们引入了面向对象的处理(OOP)策略。这种方法将不同的听觉特征封装到以对象为中心的表示中,并通过推理链(CoI)机制对其进行细化。该流水线包括基于动态时间内核的特征提取器、基于变换器的聚合器和产生每个对象特征的对象分离器。这些特性输入到多个特定于任务的解码器中。我们以对象为中心的表示自然解决了传统跟踪处理中固有的参数关联模糊性。但是,早期的对象分离可能会导致下游ASA任务失败。为了解决这个问题,我们在推理链中实现了时间相干匹配(TCM),使用估计的听觉参数实现了对象特征的多任务融合和迭代细化。我们在代表性的空间音频基准数据集上评估了DeepASA,包括ASA 2,MC-FUSS和STARSS 23。实验结果表明,我们的模型在所有评估任务中都达到了最先进的性能,证明了它在不同空间听觉场景下的源分离和听觉参数估计的有效性。
【14】MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion With Increased Controllability via Multiple Guidances
标题:MaskVCT:用于Zero-Shot语音转换的掩蔽语音编解码器Transformer,通过多种引导提高可控制性
链接:https://arxiv.org/abs/2509.17143
【15】Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
标题:专注的AV-FusionNet:混合注意力的视听质量预测
链接:https://arxiv.org/abs/2509.16994
摘要:我们引入了一种新的基于深度学习的视听质量(AVQ)预测模型,该模型利用了最先进的单峰预测器的内部特征。与依赖于简单融合策略的先前方法不同,我们的模型采用混合表示,将学习的生成机器学习(GML)音频特征与手工制作的视频多方法评估融合(VMAF)视频特征相结合。注意力机制捕捉跨模态交互和模态内关系,产生上下文感知的质量表示。模态相关性估计器量化每个内容的每个模态的贡献,潜在地实现自适应比特率分配。实验表明,AVQ预测的准确性和鲁棒性在不同的内容类型。
【16】DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
标题:DroFiT:一种轻量级的频段融合频率关注实时无人机语音增强
链接:https://arxiv.org/abs/2509.16945
【17】Automotive Sound Quality for EVs: Psychoacoustic Metrics with Reproducible AI/ML Baselines
标题:电动汽车的汽车音质:具有可再现AI/ML基线的心理声学测试
链接:https://arxiv.org/abs/2509.16901
【18】Feature Selection via Graph Topology Inference for Soundscape Emotion Recognition
标题:基于图布局推理的声景情感识别特征选择
链接:https://arxiv.org/abs/2509.16760
【19】QASTAnet: A DNN-based Quality Metric for Spatial Audio
标题:QASTAnet:基于DNN的空间音频质量指标
链接:https://arxiv.org/abs/2509.16715
【20】Reverse Attention for Lightweight Speech Enhancement on Edge Devices
标题:边缘设备上轻量级语音增强的反向注意力
链接:https://arxiv.org/abs/2509.16705
【21】Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
标题:用于ASB和审议处理的音频调节扩散LLM
链接:https://arxiv.org/abs/2509.16622
【22】An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
标题:用于基于扩散的音频生成的基于Octave的多分辨率CQT架构
链接:https://arxiv.org/abs/2509.16603
摘要:本文介绍了MR-CQTdiff,一种新的神经网络架构的扩散为基础的音频生成,利用多分辨率常数$Q$变换(C$Q$T)。所提出的架构采用了一个高效的,可逆的CQT框架,调整的倍频程倍频程的基础上的时间-频率分辨率。该设计解决了低频时的低时间分辨率问题,从而实现了更灵活和更具表现力的音频生成。我们使用Fr\'echet音频距离(FAD)度量在各种架构和两个数据集上进行评估。实验结果表明,MR-CQTdiff实现了最先进的音频质量,优于竞争对手的架构。
【23】TF-CorrNet: Leveraging Spatial Correlation for Continuous Speech Separation
标题:TF-CorrNet:利用空间相关性实现连续语音分离
链接:https://arxiv.org/abs/2509.16481
摘要:通常,多通道源分离利用了与时频域中的幅度信息级联的麦克风间相位差(IPD),或者沿通道轴堆叠的实部和虚部。然而,声源的空间信息基本上包含在麦克风之间的差异中,特别是在它们之间的相关性中,而每个麦克风的功率也提供了关于源频谱的有价值的信息,这就是为什么幅度也包括在内。因此,我们提出了一个网络,直接利用相位变换(PHAT)-β的相关输入来估计分离滤波器。此外,建议TF-CorrNet处理的功能交替跨越时间和频率轴作为一个双路径战略的空间信息。此外,我们增加了一个频谱模块来模拟源相关的直接时间-频率模式,以改善语音分离。实验结果表明,所提出的TF-CorrNet有效地分离语音的声音,表现出高性能与低计算成本的LibriCSS数据集。
【24】Harmonic Summation-Based Robust Pitch Estimation in Noisy and Reverberant Environments
标题:有噪和回响环境下基于调和的鲁棒音调估计
链接:https://arxiv.org/abs/2509.16480
【25】Sound field estimation with moving microphones using kernel ridge regression
标题:使用核岭回归估计移动麦克风的电场
链接:https://arxiv.org/abs/2509.16358
【26】Similarity-Guided Diffusion for Long-Gap Music Inpainting
标题:相似性引导的长间隙音乐修复扩散
链接:https://arxiv.org/abs/2509.16342
摘要:音乐修复旨在重建受损录音的缺失片段。虽然基于扩散的生成模型改善了中等长度间隙的重建,但它们通常难以在多秒间隙上保持音乐的可重复性。我们介绍了相似性指导的扩散后验采样(SimDPS),一种混合方法,结合了基于扩散的推理与相似性搜索。候选片段首先从语料库检索的上下文相似性的基础上,然后纳入一个修改后的可能性,引导扩散过程的上下文一致的重建。主观评价钢琴音乐修复与2秒的差距表明,所提出的SimDPS方法相比,无指导的扩散,增强了感知的可扩展性和经常优于相似性搜索时,只有适度相似的候选人。这些结果表明,混合相似性方法的扩散为基础的音频增强与长间隙的潜力。
【27】Investigating Polyglot Speech Foundation Models for Learning Collective Emotion from Crowds
标题:研究多语言言语基金会模型以学习人群的集体情感
链接:https://arxiv.org/abs/2509.16329
摘要:本文研究了用于人群情感识别的多语言语音基础模型。我们假设,在不同的语言,口音和语音模式上预先训练的多语言SFM特别擅长于导航人群环境中嘈杂和复杂的声学环境,从而为CER提供了显着的优势。为了证实这一点,我们进行了全面的分析,比较多语种,单语,说话人识别SFM通过广泛的实验在不同的音频持续时间(1秒,500毫秒,250毫秒)的基准CER数据集。结果一致证明了多语言SFM的优越性,在所有音频长度上都优于同行,即使在极短的输入时间内也表现出色。这些研究结果铺平了道路,适应可持续森林管理办法,建立新的基准CER。
【28】Qwen3-Omni Technical Report
标题:Qwen 3-Omni技术报告
链接:https://arxiv.org/abs/2509.17765
摘要:我们提出了Qwen 3-Omni,一个单一的多模态模型,第一次在文本,图像,音频和视频中保持最先进的性能,而没有任何相对于单模态模型的退化。Qwen 3-Omni与Qwen系列中相同尺寸的单模态型号的性能相匹配,尤其在音频任务方面表现出色。在36个音频和视听基准测试中,Qwen 3-Omni在32个基准测试中实现了开源SOTA,在22个基准测试中实现了整体SOTA,表现优于Gemini-2.5-Pro、Seed-ASR和GPT-4 o-Transcribe等强大的闭源模型。Qwen 3-Omni采用Thinker-Talker MoE架构,统一了文本、图像、音频和视频的感知和生成,生成流畅的文本和自然的实时语音。它支持119种语言的文本交互,19种语言的语音理解和10种语言的语音生成。为了减少流合成中的第一包延迟,Talker使用多码本方案自回归预测离散语音编解码器。利用这些码本的代表能力,我们用轻量级的因果ConvNet取代了计算密集型的逐块扩散,从而从第一个编解码器帧开始进行流式传输。在冷启动设置中,Qwen 3-Omni实现了234 ms的理论端到端第一个数据包延迟。为了进一步加强多模态推理,我们引入了一个思维模型,该模型可以明确地对来自任何模态的输入进行推理。由于研究界目前缺乏通用的音频字幕模型,我们对Qwen 3-Omni-30 B-A3 B进行了微调,以获得Qwen 3-Omni-30 B-A3 B-Captioner,它可以为任意音频输入生成详细的低幻觉字幕。Qwen 3-Omni-30 B-A3 B、Qwen 3-Omni-30 B-A3 B-Thinking和Qwen 3-Omni-30 B-A3 B-Captioner在Apache 2.0许可下公开发布。
【29】Enhancing the NAO: Extending Capabilities of Legacy Robots for Long-Term Research
标题:增强NAO:扩展传统机器人的长期研究能力
链接:https://arxiv.org/abs/2509.17760
【30】Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models
标题:利用视听数据缩小自我监督语音模型中的多语言差距
链接:https://arxiv.org/abs/2509.17523
摘要:自监督学习(SSL)在语音表征学习方面取得了重大进展。像wav2vec 2.0和HuBERT这样的模型已经在语音识别等任务中取得了最先进的成果,特别是在单语环境中。然而,多语言SSL模型往往在每种语言上表现不佳,特别是在语言较少的多语言场景中,如双语设置。在这项工作中,我们研究了一种新的方法来减少这种性能差距,通过引入有限的视觉接地双语语音SSL模型。我们的研究结果表明,视觉接地有利于单语和双语模型,特别是后者的收益显着,减少多语言性能差距的zero-shot语音歧视从31.5%的纯音频模型的8.04%接地。
【31】STAR: Speech-to-Audio Generation via Representation Learning
标题:STAR:通过表示学习生成语音到音频
链接:https://arxiv.org/abs/2509.17164
【32】FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
标题:FakeSound 2:可解释和可概括的Deepfake声音检测的基准
链接:https://arxiv.org/abs/2509.17162
【33】Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
标题:Sidon:快速稳健的开源多语言语音恢复,用于大规模数据集清理
链接:https://arxiv.org/abs/2509.17052
摘要:大规模的文本到语音(TTS)系统受到缺乏干净的多语言录音的限制。Sidon是一种快速的开源语音恢复模型,它可以将嘈杂的野外语音转换为工作室质量的语音,并扩展到数十种语言。Sidon由两种型号组成:w2 v-BERT 2.0微调特征预测器,从嘈杂的语音中清除特征,声码器经过训练,从清除的特征中合成恢复的语音。Sidon实现了与Miipher相当的恢复性能:Google的内部语音恢复模型,旨在为语音合成进行数据集清理。Sidon的计算效率也很高,在单个GPU上的运行速度比实时快3,390倍。我们进一步表明,训练TTS模型使用西顿清洗自动语音识别语料库提高了合成语音的质量在zero-shot设置。发布代码和模型,以促进研究社区的可重复数据集清理。
【34】VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
标题:VA Inpaint:具有LLM驱动模块的Zero-Shot视频-音频修复框架
链接:https://arxiv.org/abs/2509.17022
【35】Bridging the gap between training and inference in LM-based TTS models
标题:弥合基于LM的TTC模型中训练和推理之间的差距
链接:https://arxiv.org/abs/2509.17021
摘要:文本到语音(TTS)的最新进展表明,基于语言模型(LM)的系统提供了有竞争力的性能相比,传统的方法。然而,在训练中,TTS模型使用地面实况(GT)标记作为前缀来预测下一个标记,而在推理中这些标记不可用,这是训练和推理之间的差距,经常被忽视。在这项研究中,我们提出了一个基于LM-TTS系统的混合训练方案,以减轻曝光偏差。我们的核心思想是采用一种混合训练范式,将教师强迫与自由运行相结合,从而将自我生成的令牌引入训练过程。这使得训练模式与推理更加一致,减少了训练-推理差距。此外,我们在训练过程中加入了EOS预测机制,以检测不正确的序列终止并自适应地控制自由运行过程。实验结果全面评估了暴露偏差对基于LM的TTS的影响,并证明我们的方法有效缩小了训练-推理差距,从而提高了合成长形式语音的质量。
【36】MBCodec:Thorough disentangle for high-fidelity audio compression
标题:MBCodec:彻底理清高保真音频压缩
链接:https://arxiv.org/abs/2509.17006
摘要:文本到语音(TTS)中的高保真神经音频编解码器旨在将语音信号压缩为离散表示以进行忠实重建。然而,先前的方法在有效地解开令牌内的声学和语义信息方面面临挑战,导致合成语音中缺乏细粒度的细节。在这项研究中,我们提出了MBCodec,一种新的多码本音频编解码器的基础上残差矢量量化(RVQ),学习分层结构的表示。MBCodec利用来自原始信号的自监督语义标记化和音频子带特征来构建功能上分离的潜在空间。为了鼓励跨编解码器嵌入空间的各个层的全面学习,我们引入自适应丢弃深度来跨层差分训练码本,并且在训练期间采用多通道伪正交镜像滤波器(PQMF)。通过彻底解耦语义和声学特征,我们的方法不仅实现了近乎无损的语音重建,而且还能够对24 kHz音频进行出色的170倍压缩,从而实现仅2.2 kbps的低比特率。实验性评价证实,在所有评价中,该方案的业绩始终大大优于基线。
【37】Advancing Speech Understanding in Speech-Aware Language Models with GRPO
标题:使用GRPO推进语音感知语言模型中的语音理解
链接:https://arxiv.org/abs/2509.16990
【38】Leveraging Multiple Speech Enhancers for Non-Intrusive Intelligibility Prediction for Hearing-Impaired Listeners
标题:利用多个语音增强器对听力受损的听众进行非侵入性可理解度预测
链接:https://arxiv.org/abs/2509.16979
【39】Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
标题:通过多模式LLM的思维链差异-共性推理进行可解释音频编辑评估
链接:https://arxiv.org/abs/2509.16975
【40】AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
标题:AudioGenie-Reasoner:一个用于从粗到细音频深度推理的免训练多代理框架
链接:https://arxiv.org/abs/2509.16971
【41】Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
标题:多通道音频对齐的交叉注意和置信加权
链接:https://arxiv.org/abs/2509.16926
摘要:多通道音频对齐是生物声学监测、空间音频系统和声学定位的关键要求。然而,现有的方法往往难以解决非线性时钟漂移,缺乏量化不确定性的机制。传统的方法,如互相关和动态时间弯曲假设简单的漂移模式,并提供没有可靠性措施。与此同时,最近的深度学习模型通常将对齐视为二进制分类任务,忽略了通道间的依赖性和不确定性估计。我们介绍了一种方法,结合交叉注意机制与信任加权评分,以提高多通道音频同步。我们扩展了BEAT编码器与交叉注意层,以模拟通道之间的时间关系。我们还开发了一个置信加权评分函数,使用完整的预测分布,而不是二进制阈值。我们的方法在BioDCASE 2025任务1挑战中获得了第一名,测试数据集的MSE平均值为0.30,而深度学习基线为0.58。在单个数据集上,我们在ARU数据上实现了0.14 MSE(减少77%),在斑胸草雀数据上实现了0.45 MSE(减少18%)。该框架支持概率时间对齐,超越点估计。虽然在生物声学背景下进行了验证,但该方法适用于更广泛的多通道音频任务,其中对准置信度至关重要。代码可在:https://github.com/Ragib-Amin-Nihal/BEATsCA上获得
【42】Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology
标题:鼓声打击乐声音转换及其评价方法
链接:https://arxiv.org/abs/2509.16862
摘要:本文定义了鼓到人声打击(VP)的声音转换的新任务。VP通过人类发声来模仿打击乐器,并经常在当代无伴奏合唱音乐中使用。它表现出与语音和歌唱不同的声学特性(例如,非周期性、噪声瞬变和语言结构的缺失),使得传统的语音或歌唱合成方法不适用。因此,我们制定VP合成作为一个从鼓的声音音色转移问题,利用他们的节奏和音色的对应。为了支持这一提法,我们定义了成功转换的三个要求:节奏的保真度,音色的一致性,和自然的VP。我们还提出了相应的主观评价标准。我们实现了两个基线转换方法,使用神经音频合成器,实时音频变分自动编码器(RAVE),有和没有矢量量化(VQ)。主观实验表明,这两种方法产生合理的VP输出,与基于VQ的RAVE模型产生更一致的转换。
【43】The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology
标题:声音的声音:言语病理学语言模型的微调和综合评估
链接:https://arxiv.org/abs/2509.16765
摘要:根据美国国立卫生研究院的数据,超过340万儿童患有需要临床干预的言语障碍。言语语言病理学家的人数大约是受影响儿童人数的20倍,这突出表明儿童护理方面存在重大差距,迫切需要技术支持,以提高言语语言病理学家的工作效率。最先进的多模态语言模型(MLM)显示出支持SLP的前景,但它们的使用仍然未被充分探索,主要是由于对它们在高风险临床环境中的性能的了解有限。为了解决这一差距,我们与领域专家合作,开发了一个语音语言病理学中MLMs真实用例的分类。在此分类的基础上,我们引入了第一个全面的基准,用于评估五个核心用例中的MLM,每个用例包含1,000个手动注释的数据点。该基准测试包括各种设置下的鲁棒性和灵敏度测试,包括背景噪声,说话者性别和口音。我们对15个最先进的多层模型的评估表明,没有一个模型在所有任务中始终优于其他模型。值得注意的是,我们发现了系统性的差异,模型在男性说话者身上表现更好,并观察到思维链提示可以降低具有大标签空间和窄决策边界的分类任务的性能。此外,我们研究了对特定领域数据进行微调的MLMs,与基础模型相比,改进了30%以上。这些发现突出了当前MLMs在语音语言病理学应用中的潜力和局限性,强调了进一步研究和有针对性的开发的必要性。
【44】Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
标题:非典型语音识别的独特建模与规范建模:结构障碍案例研究
链接:https://arxiv.org/abs/2509.16718
摘要:最先进的自动语音识别(ASR)模型,如Whisper,在非典型语音上表现不佳,例如由构音障碍患者产生的语音。过去的作品,非典型语音大多研究完全个性化(或特质)的模型,但建模策略,既可以概括和处理特质可以更有效地捕捉非典型语音。为了研究这一点,我们比较了四种策略:(a)在典型语音上训练的$\textit{normal}$模型(无个性化),(b)完全个性化的$\textit{idiosyncratic}$模型,(c)在其他构音障碍说话者上训练的$\textit{dysarthric-normal}$模型,和(d)$\textit{dysarthric-idiosyncratic}$模型,通过在适应个人语音之前首先建模规范模式来组合策略。在本案例研究中,我们发现构音障碍-特质模型的性能优于特质方法,同时需要不到一半的个性化数据(128个训练大小的WER为36.43,256个为36.99)。此外,我们发现单独调整语音编码器(与LM解码器相反)产生了最好的结果,平均将字错误率从71%降低到32%。我们的研究结果强调了利用规范(跨扬声器)和特质(扬声器特定)模式来改善代表性不足的语音人群的ASR的价值。
【45】Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
标题:Speech-to-See:端到端语音驱动的开放集对象检测
链接:https://arxiv.org/abs/2509.16670
【46】On the de-duplication of the Lakh MIDI dataset
标题:关于Lakh Buttons数据集的重复数据消除
链接:https://arxiv.org/abs/2509.16662
摘要:大规模数据集对于训练一个通用的深度学习模型至关重要。大多数这样的数据集是通过从各种互联网资源中抓取来收集的,不可避免地会引入重复的数据。在符号音乐领域,这些重复通常来自多个用户的安排和简单编辑后的元数据更改。然而,尽管存在一些关键问题,例如随机分割期间数据泄漏导致的不可靠的训练评估,但数据集重复在MIR社区中尚未得到广泛解决。本研究调查的数据集重复的问题,在符号音乐领域的最大的公开来源之一,Lakh的数据集(LMD)。为了找到和评估重复数据的最佳检索方法,我们采用了LMD的Clean Rounds子集作为基准测试集,其中相同歌曲的不同版本被分组在一起。我们首先评估了基于规则的方法和以前的符号音乐检索模型的重复数据删除,并研究了基于对比学习的BERT模型与各种增强,以找到重复的文件。因此,我们提出了三种不同版本的LMD过滤列表,在178,561个文件中,在最保守的设置中过滤出至少38,134个样本。
【47】AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
标题:DCASE 2025的AISTA实验室系统Task6:基于语音的音频检索
链接:https://arxiv.org/abs/2509.16649
摘要:本报告介绍了AISTAT团队对DCASE 2025任务6中基于语言的音频检索任务的提交。我们提出的系统采用双编码器架构,其中音频和文本模态分别编码,并使用对比学习对齐它们的表示。从前一年挑战的方法学中汲取灵感,我们实施了一种蒸馏方法,并利用大型语言模型(LLM)进行有效的数据增强技术,包括反向翻译和LLM混合。此外,我们还结合了聚类来引入辅助分类任务,以便进一步进行微调。在Clotho开发测试中,我们最好的单个系统的mAP@16达到了46.62,而四个系统的集合达到了48.83的mAP@16。
【48】Barwise Section Boundary Detection in Symbolic Music Using Convolutional Neural Networks
标题:利用卷积神经网络进行符号音乐中的巴氏段边界检测
链接:https://arxiv.org/abs/2509.16566
【49】Etude: Piano Cover Generation with a Three-Stage Approach -- Extract, strucTUralize, and DEcode
标题:练习曲:三阶段方法的钢琴翻唱--提取、结构化和解码
链接:https://arxiv.org/abs/2509.16522
【50】LenslessMic: Audio Encryption and Authentication via Lensless Computational Imaging
标题:LenslessMic:通过Lensless计算成像进行音频加密和认证
链接:https://arxiv.org/abs/2509.16418
摘要:随着社会对数字数据共享的日益依赖,敏感信息的保护变得至关重要。加密是保护隐私的方法之一;然而,它在音频领域的实现主要依赖于信号处理或嵌入硬件的软件方法。在本文中,我们介绍了LenslessMic,一种基于硬件的混合光学加密方法,利用无透镜摄像头作为适用于多种类型音频的物理安全层。我们表明,LenslessMic能够实现(1)强大的录音认证和(2)加密强度,可以与256位数字标准的搜索空间相媲美,同时保持高质量的信号和最小的内容信息丢失。该方法通过低成本的Raspberry Pi原型进行了验证,并与数据集一起开源,以促进该领域的研究。
机器翻译由腾讯交互翻译提供,仅供参考
