微信公众号:arXiv_Daily
cs.SD语音
标题:作为声元音动态变化来源的发音策略
链接:https://arxiv.org/abs/2605.23416
【2】AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ
标题:AffectCodec:基于块对角残差FSQ的语音编码算法链接:https://arxiv.org/abs/2605.23373
【3】MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
标题:MixFake:在多样化的现实世界混合音频中进行基准测试和增强音频Deepfake检测链接:https://arxiv.org/abs/2605.23201
备注:Accepted by ICME2026
【4】Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
标题:Canary和WavLM的帧对齐融合用于助听器处理语音的非侵入性可理解度预测链接:https://arxiv.org/abs/2605.23619
备注:7 pages, 2 figures
【5】Word-Level Modeling with Alignment-Aware Acoustic Fusion for Text-Assisted Intelligibility Prediction in Listeners with Hearing Loss
标题:具有对齐感知声学融合的词级建模用于听力损失听众的文本辅助可理解度预测链接:https://arxiv.org/abs/2605.23604
备注:7 pages, 2 figures
【6】Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound Classifier
标题:声音分类器综合特征的时间检测能力评估链接:https://arxiv.org/abs/2605.23293
备注:5 pages, 3 figures
【7】UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
标题:UniSOM:一种用于基于推理的细粒度评估的统一语音奖励模型链接:https://arxiv.org/abs/2605.23261
备注:Accepted by ACL 2026(Main)
标题:自然但易于检测:通过EMA和双重评分提示选择的稳健野外TTC--提交WildSpoof 2026年TTC曲目
链接:https://arxiv.org/abs/2605.23859
【2】Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
标题:Canary和WavLM的帧对齐融合用于助听器处理语音的非侵入性可理解度预测链接:https://arxiv.org/abs/2605.23619
备注:7 pages, 2 figures
【3】Word-Level Modeling with Alignment-Aware Acoustic Fusion for Text-Assisted Intelligibility Prediction in Listeners with Hearing Loss
标题:具有对齐感知声学融合的词级建模用于听力损失听众的文本辅助可理解度预测链接:https://arxiv.org/abs/2605.23604
备注:7 pages, 2 figures
【4】A study on weakly-supervised training approaches for phoneme-level pronunciation scoring
标题:音素级发音评分弱监督训练方法研究链接:https://arxiv.org/abs/2605.23593
【5】StepAudio 2.5 Technical Report
标题:StepAudio 2.5技术报告链接:https://arxiv.org/abs/2605.23463
【6】Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound Classifier
标题:声音分类器综合特征的时间检测能力评估链接:https://arxiv.org/abs/2605.23293
备注:5 pages, 3 figures
【7】UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
标题:UniSOM:一种用于基于推理的细粒度评估的统一语音奖励模型链接:https://arxiv.org/abs/2605.23261
备注:Accepted by ACL 2026(Main)
机器翻译由腾讯交互翻译提供,仅供参考
