Xiaomi-CocktailASR-1:小米开源目标说话人语音识别模型
转载25 days ago
Xiaomi-CocktailASR-1:小米开源目标说话人语音识别模型

在多人同时说话的场景里,语音识别一直面临一个特殊问题:系统能够听见很多声音,却很难判断其中哪一句属于指定的人。 会议录音、多人通话、车载语音、家庭环境中的语音控制,都存在类似情况。传统方案通常需要先进行语音分离,再把分离后的目标声音交给 A…

25 1 0
sherpa-onnx:AI 语音界的瑞士军刀
原创a year ago
sherpa-onnx:AI 语音界的瑞士军刀

语音开源模型这么多,你还在为如何部署烦恼吗?各种模型环境各式各样,你还在为安装环境晕头转向吗?老板说隐私很重要,要出一个离线的demo,你还在犹豫不知如何下手吗?语音那么多任务,又是vad,又是说话人,还得做识别合成,你还在为组合方案费尽心…

35 0 0
《语音识别:原理与应用》第3版出版
转载a year ago
《语音识别:原理与应用》第3版出版

2025年4月,《语音识别:原理与应用》第3版出版,在京东、当当等平台均有销售。本书由洪青阳与李琳编著,第1版和第2版先后于2020年6月和2023年2月出版,内容涵盖声学特征提取、隐马尔科夫模型(HMM)、语言模型、加权有限状态转换器(W…

30 0 0
ASR 大模型 GPU 推理方案来啦!
转载2 years ago
ASR 大模型 GPU 推理方案来啦!

相较于社区流行的 Faster Whisper 方案,NVIDIA TensorRT-LLM 能有效将推理速度提升 50% 以上; 仅用一张 A10 GPU,Whisper Turbo[1] 的中文微调模型每秒钟可以处理 500 秒的音频;…

37 0 0
语音实战之 Dart 和 Flutter
原创2 years ago
语音实战之 Dart 和 Flutter

1. 简介 新一代Kaldi部署框架sherpa-onnx[1]支持的编程语言API大家庭中, 最近增加了一个新成员Dart[2],使得支持的编程语言达到了 10 种。 支持了Dart, 意味着大家可以在Dart中使用sherpa-onnx…

15 0 0