谷歌Gemini 3.1 Pro增加音乐生成功能
转载8 months ago
谷歌Gemini 3.1 Pro增加音乐生成功能

来源丨新智元、AI音频时代 谷歌在 7.5 亿月活的 Gemini 中上线了 AI 音乐生成功能,输入一句话或一张照片,几秒就能得到一首带人声和歌词的完整歌曲。背后是 DeepMind 最新的 Lyria 3 模型,训练数据超 200 万首…

16 0 0
从“黑盒”到“透明”:Interspeech 2026音频推理挑战赛结果公布与方案分享
原创8 months ago
从“黑盒”到“透明”:Interspeech 2026音频推理挑战赛结果公布与方案分享

从多人对话中的语调起伏与逻辑重心,到环境音背后隐藏的空间几何与物体运动轨迹,再到复杂音乐中演奏技法与艺术情感的深层关联,音频理解不应止于结果的预测。为了透明评估音频模型的推理过程质量,避免通过语言偏见、训练数据偏见或错误的方法“猜中”答案,…

25 0 0