音频扩散生成模型算法工程师
职位描述

负责扩散生成模型的基础模块复现、训练、算法优化和推理加速等,协助团队搭建完整的音乐生成系统。

岗位要求

1、有过训练扩散生成模型(Diffusion Models)经验,优先选做过音频方向的扩散生成模型的,包括但不限于DDPM, Score-based SDE, LDM, EDM, Consistency Models等。

2、有搭建TTS模型的经验,如Tacotron系列, Fast Speech系列, Natural Speech系列等。

3、(必备条件)在PyTorch上复现和优化新模型的能力。

4、(必备条件)对扩散生成模型的不同建模和生成算法有深刻的认知,了解技术演变史和最新Diffusion模型的训练方法。

5、(加分条件)作为论文一作上发过跟TTS或音频Diffusion相关的论文。

语音识别算法工程师
职位描述

1、负责语音识别数据pipeline构建,包括但不限于数据收集、清洗、整理等。

2、负责语音识别各模块的效果优化,包括但不限于声学模型、语言模型、端到端模型、VAD,反正则化等。

3、负责其他语音技术的探索及优化,包括但不限于说话人识别和分割、语种识别、声音事件检测、语音增强、语音降噪、3A音频算法、空间音频、关键词唤醒等技术研发。

4、关注语音相关领域前沿进展技术,探索语音识别相关技术在音乐AIGC场景的落地。

岗位要求

1、人工智能、机器学习、信号处理或计算机科学等相关专业研究生以上学历,基础扎实。

2、熟悉自监督学习SSL技术,有hubert, w2v-bert, BEST-RQ等模型的训练和调优经验。

3、熟悉shell&python&C++,有较强的算法实现能力。

4、熟悉主流的语音识别模型算法,如RNN-T、conformer、CTC。

5、熟悉WFST相关算法理论,可以熟练使用相关工具搭建HCLG / TLG。

6、熟悉kaldi / K2 / wenet / espnet / whisper / FunASR 中至少两种工具。

7、有相关项目或实习经验,包含但不限于大规模ASR / 流式 / 热词 / 模型蒸馏。

8、学习研究能力强,能够独立阅读英文文献,对解决具有挑战性的问题充满激情。

加分项

1、来自985 / 211院校或知名实验室。

2、有成功落地ASR相关项目的经历。

3、在顶会发表相关高质量论文。

4、相关领域比赛获得较好成绩。

5、对相关开源项目有突出贡献。

6、有优化加速经验。

AI infra推理加速算法工程师
职位描述

1、设计与研发业界领先的智能音频-算法框架,聚焦于音乐生成、音效生成、歌声合成等算法方案的一体化研发框架。

2、对模型训练进行极致的端到端效率优化,包括但不限于:训练加速、资源利用率提升、分布式超大规模模型训练支持以及模型结构优化等。

3、与上下游算法、推理引擎紧密合作,优化整个模型生产链路的研发效率,包括但不限于:与算法工程师密切配合共建开发者生态、提升框架易用性,对接深度学习平台和推理引擎等。

岗位要求

1、熟悉 Python、C、C++ 中至少一门编程语言,熟悉常用数据结构以及基础算法,对有挑战的工作富有热情。

2、熟悉计算机体系结构和操作系统,对分布式系统有一定了解,了解一定的设计模式。

3、至少熟悉一个主流开源深度学习框架(Tensorflow/Pytorch/Paddle/Spark ML等),了解框架原理或者熟悉源码、有开源项目贡献经验更佳。

4、有很强的分析问题和解决问题的能力,有强烈的责任心。

加分项

1、了解大规模分布式机器学习、并行训练,或者了解 OpenMPI 等高性能分布式计算框架,Hadoop/Spark 等分布式数据处理框架。

2、有Speech/CV/NLP/RL等方向开源算法框架类似pytorch_lightning/wenet等项目贡献、源码改定等经验,或者有高质量的开源github项目。

3、有音频生成、歌声合成/语音合成、语音识别、自然语言处理算法,或者有深度学习领域的模型加速、工程落地经验。

AIGC数据专家
职位描述

1、负责音、视频AI数据的全生命周期建设,达到业务领先水平,包含但不限于十亿级数据的存储、打标、可视化、筛选、校验等能力,以及相关处理流程的自动化和敏捷开发。

2、探索数据生成、智能处理、智能标注等领域,为音频和视频AIGC生成更多高质量的训练数据。

3、保证数据服务的可扩展性和稳定性。

岗位要求

1、熟悉视频、音频模型的训练流程,对相关数据需求和数据质量有比较深入的理解。

2、有一定的前瞻能力,能跳出边界和固定框架思考问题最优解。

3、具备较好的系统设计能力和比较高的开发能力,熟悉 Go/Python/SQL 等语言,能够快速搭建数据处理流程。

4、了解常用的通信、存储和大数据工具,如Kafka、Redis、 Mongo、Hive、Spark 等,并具备足够的应用能力。

AI音乐算法评测专家
职位描述

1、负责基于深度学习的AI音乐生成、MIR、SSL等算法方向的评测,确保音乐质量达最佳效果;制定对应的评测规则、评测方法和效果评估体系。

2、负责深度学习类音乐评测模型开发和音乐指标的工程建设。

3、能构建基于AI音乐生成的自动化评测技术,规划并搭建智能自动化评测工具或平台,保证评测时效性及准确性,提高评测置信度。

岗位要求

1、计算机、通信、人工智能专业,研究生及以上学历。

2、有1年以上AI生成算法评测经验。

3、有音频生成、音频理解、MIR等相关算法研究经历优先;有音乐背景优先。

4、编程基础扎实,至少熟悉Python / C++ / Java中一种。

5、逻辑清晰、思维敏捷,善于分析与总结,优秀的快速学习及抗压能力。

语音识别算法工程师
职位描述

负责面向音乐的视频自动生成算法的研发工作,探索并应用GPT、Diffusion等模型配合音乐内容生成高质量的创意视频作品。

工作职责

1、针对面向音乐的视频自动生成任务,设计和构建多模态模型。

2、跟进并落地最新视觉相关的Diffusion算法。

3、模型训练和推理的加速(压缩、蒸馏、量化、微调等)。

任职资格:

1、计算机相关专业,硕士研究生及以上学历。

2、扎实的数据结构和算法基础,熟练使用 C/C++ 或 Python。

3、在Diffusion Model、GAN、VAE、图像及视频生成/编辑、多模态内容理解等至少一个领域有开发经验的。

4、有良好的英文读写能力和扎实的数学基础,发表过高水平论文的优先。

5、责任心强,积极主动,有良好的沟通能力和团队合作能力。

简历投递

邮箱主题:姓名 + 申请职位 + 语音之家推荐

邮箱:lin.tian@kunlun-inc.com

地址:北京明阳国际中心B座,西总布胡同46号(东单地铁站B东北口步行380米)