作为一个具有强大鲁棒性的大规模端到端多语言语音识别模型,Whisper在很多低资源和分布外的场景下,不需要经过任何微调就可以表现出不错的识别性能,然而Whisper使用了Transformer架构,编码器-解码器的结构限制了它在流式语音识别…
声浪
Interspeech2024 | Simul-Whisper:基于注意力和截断检测的流式Whisper
9 0 0
GPT-4o级开源语音交互系统发布,交互延迟仅0.5秒
来自 Hugging Face 的 Vaibhav Srivastav 最近在推特上发布了一条令人振奋的突破:Speech to Speech语音交互系统,可以极大地提升了人与机器之间的沟通效率与体验。 GitHub 链接:https://…
15 0 0
弱监督音素预训练模型助力少数民族语言语音识别
论文地址:https://arxiv.org/abs/2407.13292 开源代码:https://github.com/thu-spmi/CAT/tree/master/egs/IuMien 摘 要 主流的自动语音识别(ASR,auto…
9 0 0
作业帮 | 招聘语音合成算法leader、语音合成算法工程师、语音识别算法工程师(北京/上海)
作业帮 作业帮成立于 2015 年,作为“数字教育的开拓者”,以“科技为人、成就非凡”为使命,致力于用科技手段助力教育普惠。作业帮始终坚持“教育+科技”双引擎战略,在学习工具产品、智能硬件、智能图书等业务领域深入布局。 作业帮是“国家高新技…
24 0 0
