职位描述
1. 设计与开发评测方案: 围绕大语言模型和多模态大模型的各项能力,设计科学、公正、全面的评测(Benchmark)方案和对应的数据集。
2. 搭建评测平台: 参与或负责自动化评测系统的开发、部署和维护,提升模型迭代和评测效率。
3. 执行与分析: 对主流的开源及闭源大模型进行系统性评测,并对自研模型进行深度分析,撰写评测报告,为模型的优化方向提供数据支持。
4. 追踪前沿动态: 持续关注业界最新的大模型评测方法、基准和技术,并将其应用到实际工作中。
职位要求
1. 教育背景: 计算机科学、人工智能、机器学习、数学或相关专业的本科及以上学历。
2. 编程能力: 熟练掌握 Python、PyTorch。
3. 技术理解: 对大语言模型(LLM)有基本的认识,了解其工作原理和主要应用场景。
4. 逻辑分析: 具备优秀的数据分析能力和逻辑思维,能够从评测结果中发现问题并提出见解。
5. 加分项(非必需):
ꔷ 有大模型使用、微调或评测相关经验者优先。
ꔷ 有数据科学、NLP 项目或相关研究经验者优先。
ꔷ 熟悉常用的模型评测数据集者优先。有良好英文文献阅读能力者优先。
最低学历要求:硕士
工作地:北京/杭州/上海
联系方式:guyanmei.gym@antgroup.com
