未来生活实验室是阿里集团旗下的核心AI研发与产品化部门。我们深耕多模态大模型领域,致力于打破交互边界,重新定义数字生活的未来。通过聚焦多模态技术研究,我们持续挑战智能上限,实现视觉、听觉与语言的高维度融合;同时,我们积极探索并定义新一代多模态体验界面,坚持以产品化为核心,让AI真正触手可及。


AI创新事业部-音频算法专家/高级专家

职位描述:

1、研发前沿的音频大模型 (Audio-LLM),实现语音识别 (ASR)、语音合成 (TTS) 与音频理解的端到端融合。

2、优化多语种、情感化及高表现力的语音生成,提升在复杂环境(噪声、多人交谈)下的语义提取鲁棒性。

3、设计并优化多模态音乐生成模型,涵盖风格、韵律、和声、节奏等多维度生成任务。

4、探索音频 Tokenizer 优化,实现音频与 LLM 符号空间的对齐。

职位要求:

1、熟悉主流音频架构(如 Whisper, VITS, AudioLM, Vall-E,CosyVoice);

2、精通音频信号处理及神经编解码器(Neural Codec);

3、有全双工、超低延迟流式语音交互系统(Real-time Interactive Voice)的落地经验者优先。

简历投递:dongwang.wdx@taobao.com


AI创新事业部-多模态算法专家/高级专家(理解与生成)

职位描述:

1. 多模态理解:负责图文/视频/音频理解相关的算法研发,提升模型对复杂多模态场景的语义分析和推理能力。

2. 多模态生成:开发基于 Diffusion Model 或 Autoregressive 架构的生成算法(如 Text-to-Image, Text-to-Video),优化生成的质量、多样性与可控性。

3. 统一架构:设计并研发多模态大模型理解和生成的统一架构,通过高效Transformer结构、位置编码优化等,实现对图像、视频、文本的深度语义理解与高保真内容生成。

职位要求:

1. 自然语言处理、机器学习、数据挖掘、人工智能等相关专业的硕士生/博士生;

2. 熟练掌握Tensorflow、Pytorch等深度学习框架,扎实的编程基础,具备独立的算法实现能力;

3. 有LLM实操经验,参与过大模型预训练,SFT,RLHF等项目;有垂域基座模型项目经验者优先,参与过大模型结合搜广推项目者优先;

4. 良好的逻辑分析能力和数理基础,对算法原理及应用有较深入的理解,在人工智能相关的各类国际顶级会议/期刊中发表过论文者优先。


AI创新事业部-音乐生成算法

职位描述:

1. 负责音乐生成大模型算法研发,攻克文本生成音乐、音乐编辑、音色克隆等核心技术;

2. 研发音乐理解大模型,搭建高精度、细粒度音乐内容描述体系;

3. 搭建完善的音乐训练数据集,支撑模型迭代优化;

4. 落地音乐生成大模型至核心业务,保障技术实用化;

5. 跟进行业前沿,维持团队音乐生成技术领先性。

职位要求:

1. 硕士及以上学历,1年以上音频/音乐生成大模型研发经验(T2M、T2A、语音大模型等均可);

2. 精通音频生成大模型核心算法,有LALM、DiT、Flow-Matching等框架训练调优实操经验;

3. 熟悉音频表征技术,掌握hubert、Best-RQ等自监督表征开发;精通高音质音频解码方案,对音乐音质感知敏锐、标准高;

4. 有音乐/音频理解模型开发经验,熟悉主流多模态音频大模型;

5. 编程能力扎实,熟练Python/C++及主流大模型训练框架;科研能力强,能跟进前沿,有顶会(ICASSP、interspeech等)论文发表者优先;

6. 对音乐有深度兴趣和认知,掌握基础乐理者优先。