TagSpeech:端到端搞定多说话人ASR与分离,还能精准定位时间
标题:TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding 链接:https://arxiv.org/pdf…
24 0 0
标题:TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding 链接:https://arxiv.org/pdf…
无论是语音产品的用户,比如经常使用语音输入法、语音转文字或语音聊天功能,还是开发者,都会面临一个问题:各家语音识别 API 都声称自己的识别准确率达到了 98% 以上,可为什么实际用起来感觉识别错误还是很多?“做了这么久,老板的名字都识别不…
NVIDIA(英伟达)最近开源了最新的Nemotron Speech ASR模型。这是一款专攻低延迟、实时流式场景的语音识别模型。 做 AI 语音开发的朋友都知道,ASR(语音转文字)一直是实时交互中那块难啃的骨头。尤其是 Streamin…
标题:Index-ASR Technical Report 链接:https://arxiv.org/pdf/2601.00890 发表日期:2026年1月6号 作者单位:Artificial Intelligence Platform D…