大模型算法工程师-语音感知
1.负责语音感知相关算法的实现和相关业务落地,包括语音唤醒,语音识别,声纹识别,语种识别,语音翻译,音频事件检测等。
2.负责多模态感知算法的研发和落地,包括视觉端点检测,唇语识别,音视觉语音识别。
3.负责自监督、无监督预训练算法研发,语音大模型预训练、语音模型与LLM结合等方向的研发。
1.音频、机器学习、语音、自然语言处理、机器视觉等相关专业硕士(AI,EE,CS,NLP)以上学历。
2.熟悉传统机器学习基础理论,熟练掌握Kaldi, TensorFlow, Pytorch等社区开源工具中的一种及以上,熟练C/C++,Python,Shell编程语言,对数据结构和算法设计有深刻理解,参加过ACM等编程比赛的优先。
3.有以下研究经验优先:
语音识别端到端声学建模(LAS, transformer/conformer,rnn-transcuder)、语言模型建模如NNLM、语音翻译。
语音无监督预训练(wav2vec,hubert,wavLM等)、文本预训练神经网络语言模型(Bert,XLNet,GPT,LLM等)预训练+精调。
模型裁剪压缩轻量化。
说话人识别与确认、音频事件检测与分类、说话人日志。
语音分离与增强、语音端点检测、关键词检出、音视觉语音识别/意图分类/说话人识别。
4. 学习能力强,逻辑思维清晰,具有自我驱动力,有创造力,有较强的文献阅读能力,快速实现或设计音频相关算法,在相关国际会议或主流期刊上发表论文者优先(ICASSP,Interspeech,ASRU,CVPR、ICCV)。
投递网址:https://li.auto/uDHb5AB
地址:北京

