来源丨新智元、AI音频时代
谷歌在 7.5 亿月活的 Gemini 中上线了 AI 音乐生成功能,输入一句话或一张照片,几秒就能得到一首带人声和歌词的完整歌曲。背后是 DeepMind 最新的 Lyria 3 模型,训练数据超 200 万首曲目。
对 Suno 等 AI 音乐创业公司而言,竞争从此不再只是比模型,更是要比入口。

谷歌在 Gemini App 中上线了 AI 音乐生成功能。


用户输入一段文字描述,或者上传一张照片,几秒钟内就能得到一首 30 秒的完整歌曲,带人声、带歌词、带 AI 生成的封面。纯器乐当然也是支持的。
驱动这个功能的是 DeepMind 最新的音乐生成模型 Lyria 3。


Lyria 3 是什么?

Lyria 3 是 Google DeepMind 研发的最新一代音乐生成模型。DeepMind 近年来持续推动 AI 技术在多个前沿领域的发展,包括多模态生成和内容水印技术(如 SynthID)。此次推出的 Lyria 3,则专注于音乐创作能力的提升。

生成内容通常包括:

  • 一段 30 秒音乐音轨

  • 基于提示自动创作的歌词

  • 使用 Nano Banana 图像生成工具制作的封面艺术


整个过程无需用户具备专业作曲或制作能力,系统会自动完成旋律、编曲和歌词创作。


功能特点与改进

从 2023 年发布初代 Lyria 算起,这已经是谷歌在音乐生成领域的第三代模型,相比前代,Lyria 3 有几个明显的进步:

  • 支持自动生成完整歌词,无需用户自行编写

  • 提供更强的风格、声线与节奏控制能力

  • 生成更复杂、更接近真实制作水准的音频效果

用户可以通过“文本生成音乐”的方式进行创作,例如描述怀旧情绪、特定音乐流派或个人记忆;也可以上传照片或视频,让系统生成契合画面氛围的配乐。平台还提供模板,便于用户在现有示例基础上进行修改与再创作。

目前生成的音乐长度为 30 秒,更适合短视频、社交媒体配乐或轻量化创意表达,而非完整专辑级制作。


与 YouTube 的整合

Lyria 技术此前已应用于 YouTube 的 Dream Track 实验项目,为 Shorts 创作者提供短背景音乐。Google 表示,Dream Track 也将升级至 Lyria 3 模型,以提升音质与可定制性。不过,公司尚未公布是否会支持超过 30 秒的更长音轨生成。



版权与内容验证机制

AI 音乐生成领域的版权纠纷从未停歇。2024 年夏天,环球音乐、索尼音乐和华纳音乐联手对 AI 音乐初创公司 Suno 和 Udio 提起了总金额达 5 亿美元的版权侵权诉讼。

到 2025 年底,Suno 与华纳达成和解并获得授权,Udio 也分别与环球和华纳签署了协议。整个行业正在从对抗走向合作,但紧张关系远未消散。

在这个背景下,谷歌的措辞格外谨慎。


官方公告强调 Lyria 3 的设计目标是「原创表达,而非模仿现有艺术家」。如果用户在提示词中提到某位具体艺术家的名字,Gemini 只会将其作为宽泛的创作灵感,生成风格或情绪相似的作品,而非模仿该艺术家的声音。

谷歌还表示在训练过程中「非常注意版权和合作伙伴协议」,并设置了过滤器来比对输出内容与已有作品。在内容标识层面,所有通过 Gemini 生成的音乐都会嵌入 SynthID 水印。

更值得关注的是,Gemini 现在还新增了音频鉴别功能——用户可以上传一段音频文件,询问它是否由谷歌AI 生成,Gemini 会检测 SynthID 标记并结合自身推理给出判断。

这是继图片和视频鉴别之后,SynthID 覆盖的第三种媒体类型。


语言支持与使用条件

Lyria 3 在上线时支持多种语言,包括英语、德语、西班牙语、法语、印地语、日语、韩语和葡萄牙语,未来计划扩展更多语言支持。Google AI Plus、Pro 和 Ultra 订阅用户将享有更高使用额度。

目前,该功能对符合年龄要求的 Gemini 用户开放,并可通过网页端访问 gemini.google.com 使用。