招聘岗位

大模型算法工程师-语音感知

职位描述

1.负责语音感知相关算法的实现和相关业务落地,包括语音唤醒,语音识别,声纹识别,语种识别,语音翻译,音频事件检测等。

2.负责多模态感知算法的研发和落地,包括视觉端点检测,唇语识别,音视觉语音识别。

3.负责自监督、无监督预训练算法研发,语音大模型预训练、语音模型与LLM结合等方向的研发。

岗位要求

1.音频、机器学习、语音、自然语言处理、机器视觉等相关专业硕士(AI,EE,CS,NLP)以上学历。

2.熟悉传统机器学习基础理论,熟练掌握Kaldi, TensorFlow, Pytorch等社区开源工具中的一种及以上,熟练C/C++,Python,Shell编程语言,对数据结构和算法设计有深刻理解,参加过ACM等编程比赛的优先。

3.有以下研究经验优先:

  • 语音识别端到端声学建模(LAS, transformer/conformer,rnn-transcuder)、语言模型建模如NNLM、语音翻译。

  • 语音无监督预训练(wav2vec,hubert,wavLM等)、文本预训练神经网络语言模型(Bert,XLNet,GPT,LLM等)预训练+精调。

  • 模型裁剪压缩轻量化。

  • 说话人识别与确认、音频事件检测与分类、说话人日志。

  • 语音分离与增强、语音端点检测、关键词检出、音视觉语音识别/意图分类/说话人识别。

4. 学习能力强,逻辑思维清晰,具有自我驱动力,有创造力,有较强的文献阅读能力,快速实现或设计音频相关算法,在相关国际会议或主流期刊上发表论文者优先(ICASSP,Interspeech,ASRU,CVPR、ICCV)。

简历投递

投递网址:https://li.auto/uDHb5AB

地址:北京