从开源VibeVoice-ASR看语音模型的设计、数据、幻觉和未来
最近,微软开源了VibeVoice-ASR,我也第一时间进行了体验。首先,对微软团队开源这个模型表示感谢。尽管在测试过程中发现了一些问题,但任何开源工作都值得尊重。作为开源工作,我们没有任何理由要求太多,这些问题也都是可以解决的,况且微调代…
20 0 0
最近,微软开源了VibeVoice-ASR,我也第一时间进行了体验。首先,对微软团队开源这个模型表示感谢。尽管在测试过程中发现了一些问题,但任何开源工作都值得尊重。作为开源工作,我们没有任何理由要求太多,这些问题也都是可以解决的,况且微调代…
近日,IEEE 国际声学、语音与信号处理会议(ICASSP 2026)公布了论文录用结果。本期分享语音及语言信息处理国家工程研究中心智能语音信息处理团队中稿的18篇论文,论文方向涵盖语音识别、语音合成、话者识别、语音增强、情感识别、声音事件…
近日,IEEE 国际声学、语音与信号处理会议(ICASSP 2026)公布了论文录用结果。本期分享小米中稿的7篇论文。 1、ACAVCAPS: ENABLING LARGE-SCALE
标题:Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception…
论文题目:Pronunciation-Lexicon Free Training for Phoneme-based Crosslingual ASR via Joint Stochastic Approximation 作者:赛尔达尔·玉…