【职位描述】

1.参与研发前沿的机器人大模型 (vision language action model). 包括但不限于机器人动作表征,多模态表征,vla大模型架构设计和训练等

2.跟进并调研国内外前沿的vla大模型技术,协助团队完成相关算法的设计、实现与优化;

3.协助完成数据处理、模型训练、效果评估等实验工作,并产出高质量的实验报告与技术文档;

4.积极参与团队讨论,配合工程同事推动算法落地;

5.参与开源项目、技术论文撰写、专利申请等工作,持续打造业界的技术口碑及影响力。


【任职要求】

1.计算机、人工智能、电子信息、计算机工程等相关专业硕士及以上学历(博士优先);

2.具备良好的编程能力,熟练使用 Python,熟悉 PyTorch 等主流深度学习框架,熟练使用 Linux 开发环境;

3.具备良好的英文文献阅读能力,能够主动学习和跟进前沿技术动态;

4.熟悉深度学习、信号处理等相关理论知识,具备大模型,语音识别/合成,视觉编码等相关项目或研究经验者优先;熟悉以下任一领域者优先:特征提取和表征算法(如VQ、RVQ); 生成式模型 (Diffusion/Flow Matching); 多模态LLM架构 ((如 LLaMA、Qwen 等开源模型); 熟悉大模型预训练/微调/后训练等训练策略

5.有顶会/期刊论文者优先,方向不限,如 ACL/ACMMM/ICASSP/INTERSPEECH/CVPR/ECCV/ICCV/NeurIPS/ICLR/ICML/TASLP/TMM/PAMI 等,在重要算法比赛中取得过优秀名次的候选人优先;

6.对技术前沿有浓厚兴趣,善于利用各类技术解决复杂实际问题,强烈的自驱力,良好沟通表达及的团队协作能力优先。

7.要求实习至少 6 个月以上,可长期实习者优先。


【工作地点】

北京海淀区中关村清华科技园


【联系人与联系方式】 

Felicia

微信以及电话:13728606007