鱼亮科技成立于2017年,专注于打造全球领先的边缘智能语音交互解决方案,其融合了弱场景的前端AI耳朵感官,离端本地化的语音语言AI模型为终端用户提供弱网、无网络、高噪声场景极致的AI交互体验。

公司云集了业内顶尖的技术专家和经验丰富的产业化团队,核心成员来自于中科院计算所、清华大学、南京大学、科大讯飞、云知声、百度等科研院所及行业头部企业。

招聘简章:多模态语音增强(AVSE)算法工程师

职位类别:研发/ 人工智能 / 信号处理

目标人群:应届本科/硕士,或具有1-2年相关工作经验的初级研发人员

工作地点:[合肥]

岗位职责:

1. 算法研发与优化:研究并开发基于唇形识别的多模态语音增强(AVSE)及目标说话人提取算法,利用视觉线索(如唇部运动和面部表情)提升系统在“鸡尾酒会”环境下的鲁棒性。

2. 跨模态融合方案设计:设计高效的多模态特征融合架构,研究包括通道拼接、跨模态注意力机制及特征同步技术,以解决音视频流异步及信息冗余问题。

3. 实时性与因果性建模:针对嵌入式/移动端部署需求,进行因果建模,确保算法仅依赖当前及过去帧,满足超低延迟(目标延迟< 40ms)的实时处理标准。

4. 模型轻量化与移植:应用权重剪枝、量化及知识蒸馏等技术优化模型复杂度,使其能够顺畅移植至CPU 或嵌入式 DSP/加速单元。

5. 性能评估与验证:在LRS2、LRS3、GRID 或 VoxCeleb2 等主流多模态数据集上进行验证,并使用 PESQ、STOI、SI-SDR 及词错误率(WER)等指标评估算法表现。

任职要求:

1. 教育背景:计算机、电子工程、通信、声学或数学相关专业硕士及以上学历。

2. 深度学习功底:精通PyTorch开发,熟悉常见的神经网络架构,如CNN、LSTM/GRU、Transformer 及 Conformer。具备较强的算法实现能力,能复现前沿学术论文(如RAVEN, AV-CrossNet 等)。

3. 语音与图像处理基础:掌握短时傅里叶变换(STFT/iSTFT)、时频域掩码估计(Masking)或复数谱映射技术。熟悉计算机视觉预处理流程,包括人脸检测、唇部感兴趣区域(ROI)提取及关键点对齐(如使用OpenCV, MediaPipe 或 face-alignment)。

4. 工程意识:深刻理解实时系统对算法复杂度的限制,关注模型参数量(Params)与实时因子(RTF)。

加分项:

1. 竞赛经验:在AVSE Challenge、MISP Challenge 或 ICASSP DNS Challenge 等多模态/语音竞赛中取得优异成绩者优先。

2. 硬件落地经验:有算法成功部署至嵌入式设备(如ARM, DSP, Jetson)或移动端实时通话场景经验者优先。

3. 前沿探索:熟悉扩散模型(Diffusion Models)、生成对抗网络(GAN)或空间音频(Spatial Audio)处理技术者优先。

4. 论文发表:在ICASSP、Interspeech、CVPR 或 AAAI 等国际顶级会议发表过相关论文者。


简历请投以下邮箱:

khliao@bothlent.com

1203329865@qq.com

公司官网:www.bothlent.com