微信公众号:arXiv_Daily
cs.SD语音
【1】Proceedings of The third international workshop on eXplainable AI for the Arts (XAIxArts)
标题:第三届eXplainable AI for the Arts(XAIxArts)国际研讨会会议录
链接:https://arxiv.org/abs/2511.10482
备注:Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts)
【2】VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction
标题:VocalNet-M2:通过集成的多码本令牌化和多令牌预测推进低延迟口语建模
链接:https://arxiv.org/abs/2511.10232
【3】Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard
标题:对多模式LLM的语音音频合成攻击及其使用SALMONN-Guard的缓解
链接:https://arxiv.org/abs/2511.10222
【4】FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features
标题:FabasedVC:通过文本模式融合和音素级SSL功能增强语音转换
链接:https://arxiv.org/abs/2511.10112
备注:Accepted by ACMMM-Asia 2025
【5】Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
标题:Audio-VLA:将接触式音频感知添加到机器人操纵的视觉-语言-动作模型中
链接:https://arxiv.org/abs/2511.09958
【6】HI-TransPA: Hearing Impairments Translation Personal Assistant
标题:HI-TransPA:听力障碍翻译私人助理
链接:https://arxiv.org/abs/2511.09915
【7】Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
标题:叛逆:音频推理模型的噪音稳健推理训练
链接:https://arxiv.org/abs/2511.09682
【8】Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
标题:音乐中的视频回响:视频到音乐生成的语义、时间和节奏对齐
链接:https://arxiv.org/abs/2511.09585
【9】WaveRoll: JavaScript Library for Comparative MIDI Piano-Roll Visualization
标题:WaveRoll:用于比较铅笔钢琴滚动可视化的JavaScript库
链接:https://arxiv.org/abs/2511.09562
备注:Late-breaking/demo (LBD) at ISMIR 2025. this https URL
【10】Investigation of Feature Selection and Pooling Methods for Environmental Sound Classification
标题:环境声分类的特征选择和合并方法研究
链接:https://arxiv.org/abs/2511.09802
备注:6 pages, 7 figures (including subfigures)
【1】Direction-of-Arrival and Noise Covariance Matrix joint estimation for beamforming
标题:到达方向和噪音协方差矩阵联合估计用于射束
链接:https://arxiv.org/abs/2511.10639
【2】Music Flamingo: Scaling Music Understanding in Audio Language Models
标题:音乐火烈鸟:在音频语言模型中扩展音乐理解
链接:https://arxiv.org/abs/2511.10289
备注:Project Page: this https URL
【3】A Study of Binaural Deep Beamforming With Interpretable Beampatterns Guided by Time-Varying RTF
标题:时变RTI引导的可解释束模式的双耳深射束形成研究
链接:https://arxiv.org/abs/2511.10168
备注:5 pages, 6 figures
【4】Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
标题:基于流匹配的Zero-ShotTTC中说话人相似性的时间层自适应对齐
链接:https://arxiv.org/abs/2511.09995
备注:Submitted to ICASSP 2026
【5】MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
标题:MTR-DuplexBench:全面评估高保真语音语言模型的多轮对话
链接:https://arxiv.org/abs/2511.10262
备注:Work in progress
机器翻译由腾讯交互翻译提供,仅供参考
