Google 在 Gemini、API 和 Vids 中全面推出 Lyria 3.5 音乐 AI

新闻摘要
Google 已开始向 Gemini 应用和 Gemini API 推送其最新的 AI 音乐生成模型 Lyria 3.5,这是该公司音频生成技术迄今为止覆盖范围最广的一次发布。此次推送于 2026 年 9 月 4 日(太平洋时间)宣布,将该模型从 2026 年 7 月 29 日在 Google Flow Music 中的首次亮相进一步拓展,如今面向全球更广泛的普通用户、艺术家和开发者开放。
Lyria 3.5 带来了什么
Google 将 Lyria 3.5 描述为迄今为止音质最佳的音乐生成模型。该公司表示,与早期版本相比,新模型能呈现更具表现力的人声演绎、更丰富的乐器编排以及更高的整体音频保真度。输出内容为 44.1 kHz 立体声音频,音质水平可与标准商业音乐发行相媲美;同时,该模型旨在生成结构完整的歌曲,可包含多个主歌、副歌和桥段,而非短小重复的循环片段。
音轨长度可调节,根据提示词的不同,生成时长从约一分钟到三分钟左右不等,为用户在不同使用场景下提供灵活性,无论是简短的广告配乐还是更完整的歌曲都能胜任。
可用平台
此次扩展推送同时覆盖了多款 Google 产品:
- Gemini 应用——在网页端和移动端均可使用,向 Gemini 的全球用户群开放该功能
- Gemini API——开发者可通过 Google AI Studio 获取,从而将该模型集成到第三方应用和工作流中
- Google Flow Music——面向艺术家和音乐人的创作工具,Lyria 于七月在此首次上线
- Google Vids——Workspace 中的视频创作工具,允许用户直接将 AI 生成的配乐添加到视频项目中
Google 表示,该功能正在面向全球所有 Gemini 用户逐步推出,而非仅限于特定地区或订阅层级。
创作控制与应用场景
Lyria 3.5 为用户提供了多种方式来塑造所生成的音乐。用户可以选择或描述音乐风格,并在人声或纯乐器输出之间切换。该模型还支持图像生成音乐功能,用户可以上传一张图片,系统会根据其氛围或内容创作一段配乐。
在歌词方面,用户既可以自行撰写,也可以要求模型围绕特定主题或题材生成歌词。Google 还针对背景音乐、生日歌曲、定制广告配乐和铃声等常见场景内置了模板快捷方式,旨在让没有音乐背景的用户也能轻松上手。
在开发者方面,Gemini API 文档列出了一个名为 Lyria 3 Clip 的配套选项,用于生成固定的 30 秒音频片段,与可生成更长、更可定制音轨的主模型 Lyria 3.5 并存。请求可以以文本提示词的形式发送,也可以是结合文本与最多十张图片的多模态输入,生成的文件可返回 MP3 或 WAV 格式。
安全性与内容溯源
与 Google 的其他生成式媒体模型一样,Lyria 3.5 生成的每一段音轨都直接在音频中嵌入了不可闻的 SynthID 水印。这使得日后可以验证音频片段的来源,帮助听众、平台和版权方区分 AI 生成的音乐与人类录制的音轨,且不会影响音频的听感。
Google 还会对提交给该模型的所有提示词进行安全过滤。根据 Gemini API 文档,试图模仿特定歌手声音或复制受版权保护内容的请求会在生成前被拦截。该 API 设计为单轮生成,即用户通过一条提示词生成完整音轨,而不是在多轮交互中逐步修改片段;Google 还指出,即使两次使用相同的提示词,各次调用的结果也可能存在差异。
行业背景
此次发布顺应了整个 AI 行业的一个大趋势:将生成式音频工具从实验性或仅限邀请的预览版,推向主流的全面可用产品。通过同时在消费级聊天应用、专业创作工作室、生产力工具和开发者 API 中提供 Lyria 3.5,Google 正将音乐生成定位为一项横跨个人休闲使用、专业内容创作和第三方软件集成的功能,而非一款独立的新奇产品。
相关报道指出,从七月在 Flow Music 中的预览版到九月的扩展发布,体现了相当快速的迭代节奏。Google 表示,在两次发布间隔的一个多月里,人声表现力和编排复杂度都取得了可衡量的提升。