谷歌把 Lyria 3.5 AI 音乐放进 Gemini 应用和开发者 API
DeepMind 的 44.1 kHz 模型现已成为 Gemini 中的默认项,每条生成音轨都带 SynthID 水印

9 月 4 日,谷歌把 Lyria 3.5 —— 它当前的旗舰 AI 音乐生成模型 —— 开放给了全世界每一位 Gemini 用户,以及任何已持有 Gemini API 密钥的软件开发者。同一个模型早在 7 月 29 日就已悄悄上线专业创作者平台 Google Flow Music,并在那里度过了五周、基本无法被普通受众触及的日子。9 月 4 日这次推送不是一次模型升级,而是一次分发事件;这个区别很重要:一项此前大多数制作人得主动去找才能用上的音乐生成能力,如今成了全球使用最广的 AI 聊天机器人里的默认选项,并且接在开发者早已用于 Gemini 文本和代码的同一套 API 界面之后。
分阶段推送暴露了谷歌的产品策略
这次官宣被包装成一次单一的产品发布,但公开记录讲的是一个更有层次的故事。Lyria 3.5 最早于 7 月 29 日出现在 Google Flow Music,当时谷歌描述了相对 3 月发布的 Lyria 3 Pro 模型在音乐性、歌词、人声和创作控制上的改进。Gemini API 更新日志在 9 月 3 日、也就是面向消费者官宣的前一天,把 Lyria 3.5 列为公开预览。9 月 4 日那篇文章把该模型描述为「现已可用」,却没有提及此前的 Flow Music 发布 —— 这个表述选择让大多数报道把这次官宣当成了一个新模型,而不是一次访问范围的扩大。
这种分阶段的做法反映出一套刻意的产品策略。谷歌先用规模较小的 Flow Music 活跃创作者群体验证 Lyria 3.5 —— 这批人对 AI 音乐工具的投入程度,已经足以让他们主动去找一个专业平台 —— 然后才把同一个模型同时向完整的 Gemini 用户群和开发者社区开放。结果是,Lyria 3.5 进入它最大的部署窗口时,身后至少已有六周的真实使用。
延伸阅读:谷歌把语音转文字并入 Gemini API,Transcribe 进入公开预览
Lyria 这套技术栈究竟是怎么生成音乐的
Lyria 3.5 不是单个模型。在 Flow Music 和 Gemini 应用里驱动它的底层架构是一个多模型栈:Lyria 本身负责音频生成,Gemini 提供解读用户创作提示词的自然语言理解能力,而当涉及更广的 Flow Music 生态时,Veo 负责视觉部分。这种分工之所以重要,是因为它意味着 Gemini 推理能力的改进 —— 这些改进独立于 Lyria 的更新发生 —— 即便音频模型本身没变,也能改善音乐生成的提示词解读。
音频输出为 44.1 kHz 立体声,与专业录音标准一致。据谷歌的开发者文档,通过 Gemini API 访问该模型的开发者可以在两个模型变体之间选择:lyria-3.5,生成带主歌、副歌和过渡段、最长三分钟的完整作品;以及 lyria-3-clip-preview,它始终产出为循环和音频预览设计的 30 秒片段。两者都接受文本提示词,并且 —— 这是独有的 —— 接受图片。用户可以在文本描述之外提供最多十张图片,Lyria 3.5 会依据视觉内容的启发来作曲。
把这一代与更早的 AI 音乐系统区分开的,是对歌曲结构的感知。早期做法把音频生成当成一个逐 token 续写的问题 —— 模型产出声音,却不知道自己此刻处在前奏、主歌还是过渡段,结果做出来的是加长的循环而不是作品。Lyria 3.5 被训练成把歌曲理解为有结构的整体,其中不同段落承担不同的叙事与情绪功能。开发者现在可以在提示词里给出显式的段落标签 —— 标注 Verse、Chorus、Bridge —— 并加入基于时间戳的触发点,指定某件乐器或某个事件应该在何时进入音轨。模型会自动调整人声风格与发音,以匹配提示词所用的语言。在生成音频之前,系统会先把提示词隐含的音乐结构推演一遍;谷歌称这让输出具有更强的结构连贯性。
SynthID 已成为行业的来源标准
Lyria 3.5 生成的每一个音频文件都带 SynthID 水印。SynthID 的机制值得细看,因为这项技术早已长出了「谷歌某个产品功能」的原始边界。
SynthID 利用心理声学掩蔽,在生成时把一段密码学签名直接嵌入音频波形。心理声学掩蔽指的是某些声音在另一些声音存在时会变得听不见的现象 —— SynthID 利用这一点,把信号放在人耳最不敏感的频段,以及那些较响的音频天然会掩盖较弱信号的片段里。结果是一个在结构上就属于音频本身的水印,而不是一个可以摘掉的元数据标签。有记录的测试显示,这个签名能挺过 MP3 压缩 —— 包括会剥掉常规元数据的激进 128 kbps 编码 —— 也能挺过变速和变调处理,甚至能挺过「用实体音箱放出来、再用新的麦克风重录一遍」。
SynthID 的采用曲线急剧加速。2026 年 5 月,OpenAI 把 SynthID 用进了 ChatGPT 生成的图片,NVIDIA 也宣布将其集成进自家的 Cosmos 世界模型。这是竞争对手在采用一个源自谷歌的标准 —— 在 AI 领域,除非技术需求极其迫切,否则很少发生这种事 —— 而此处的需求确实迫切,因为流媒体平台已经实施了强制的 AI 内容披露政策,需要自动检测基础设施来支撑。Spotify 的 AI Credits 披露框架于 2026 年 4 月 16 日上线;TIDAL 的 AI 标注政策于 2026 年 7 月 15 日生效;Deezer 部署了一套它声称准确率达 99.8% 的 AI 检测系统。SynthID 正是这些系统得以可靠、自动识别出 Lyria 生成音频的机制。Suno 和 Udio 都没有采用 SynthID。
对于那些打算把 Lyria 生成的音乐通过流媒体平台分发、或嵌入欧洲商业产品的创作者来说 —— 欧盟《AI 法案》针对 AI 生成内容的透明度要求已于 2026 年 8 月生效 —— SynthID 的来源链条就不是附带项,它就是合规机制本身。
Lyria 3.5 与 Suno、Udio、ElevenLabs 相比如何
AI 音乐生成器之间的音质对比争议不小、变化也快,但当下的格局结构相对清晰。
按现有基准衡量,Suno 最新的几款模型占据质量领先位置。Suno 在 2025 年末发布 v5 模型时,公司自己的内部 ELO 基准给出的分数是 1293 —— 高于此前的 Suno 版本,并且按该公司的评估,在音频保真度、音乐结构和人声真实感上高于所有竞品。此后 Suno 发布了 v5.5(2026 年 3 月 26 日)作为当前稳定版。Suno 的人声表现力 —— 捕捉气声、颤音、呼吸感和情绪细微差别 —— 仍是 Lyria 3.5 明确瞄准的能力,它在表现力和发音上的改进正是冲着这一点去的。Suno 公布的数据是:截至 2026 年 2 月有 200 万付费订阅者、3 亿美元年度经常性收入;截至 2026 年 6 月,D 轮估值 54 亿美元;发布以来总用户超过 1 亿。尽管商业势头如此,Suno 并未推出官方的公开自助 API;想要程序化访问的开发者只能依赖第三方封装,价格约为每次生成 0.05 到 0.11 美元。
Udio 占据的是另一块地盘。它由前谷歌 DeepMind 研究者创办,在电子乐、嘻哈和流行乐上尤其口碑不错 —— 这些流派最看重节奏精度和制作的干净利落 —— 在管弦乐生成上也是如此,社区评测者一致认为它的输出在纵深感和空间感上高于竞品。Udio 还提供分轨(stem separation),让制作人拿到单独的乐器音轨去做后续处理。
在商业授权这一侧,ElevenLabs Music 是对开发者最友好的替代品。它的 Music API 是该领域中程序化集成最成熟的,并附带明确的商用权利。代价是成本:ElevenLabs 每分钟生成音频收费约 0.30 美元,折算下来一首两到三分钟的曲子约合 0.60 到 0.90 美元 —— 明显高于通过谷歌 Gemini API 可获得的价格结构,后者是与已有的开发者访问打包在一起,而不是按次生成单独计价。
谷歌所处的结构性位置很特别。在音质上,按现有基准衡量 Lyria 3.5 落后于 Suno 的模型线,在 Udio 擅长的那些流派里也不及 Udio 的社区口碑。但在分发上,谷歌没有对手。Gemini 的用户基数触及的是一个让任何音乐垂直平台都相形见绌的大众受众;API 对任何已有谷歌账号的开发者开放。谷歌的授权数据说法加上 SynthID 水印,让它在这个领域拥有最干净的商业姿态。9 月 4 日这次推送,正是谷歌的分发优势从理论变成现实的时刻。
有记录的限制与商业部署上的注意事项
Lyria 3.5 的开发者文档明确写出了几条商业买家必须计入的约束。生成是单轮过程:在当前 API 版本里,无法对已生成的片段做迭代式编辑。如果第一次结果不到位,工作流是改提示词重新生成,而不是修改输出。所有提示词都会经过安全过滤;要求特定具名艺人嗓音的请求,或提交受版权保护歌词要求直接复现的请求,会被模型拦下。即便提示词完全相同,不同调用的结果也会有差异 —— 这对任何需要确定性或一致性输出的工作流都有影响。
训练数据问题仍是商业部署面前最要紧的不确定性。谷歌把 Lyria 3.5 描述为在授权内容上训练 —— 即 YouTube 和谷歌依据其服务条款、合作协议及适用法律有权使用的材料。这是公司自述,未经独立审计。与此同时,一批独立音乐人和词曲作者于 2026 年 3 月提起了版权诉讼,指控谷歌未经授权、使用取自 YouTube 的约 4400 万条音频片段(合计约 28 万小时受版权保护的录音)来训练 Lyria 3 —— 也就是 Lyria 3.5 的直接前身。谷歌于 2026 年 6 月提交动议请求驳回,主张 YouTube 的服务条款构成对这一使用的有效许可。此案仍在进行中。基于 Lyria 3.5 输出构建商业产品的开发者,应在上线前对照谷歌公布的商业授权条款核实自己的具体用例,而不是依赖「授权数据」这个笼统说法。
在一个被法律风险重塑的市场里,Lyria 的位置
围绕 AI 音乐的版权诉讼,比多数通用 AI 版权纠纷推进得更远,而其结果直接关系到任何一个要选 AI 音乐平台的人。
美国唱片业协会于 2024 年 6 月代表各大厂牌原告,对 Suno 和 Udio 提起版权诉讼。环球音乐集团于 2025 年 10 月与 Udio 达成和解;华纳音乐集团于 2025 年 11 月与 Suno 达成和解。但索尼音乐娱乐与两家都未和解,其案件仍在全面进行中。2026 年 7 月,404 Media 报道、并由 TechCrunch 和 Music Business Worldwide 独立确认的一份对被黑 Suno 源代码的分析显示,该公司曾用一个代理工具从 YouTube Music、Deezer 等流媒体服务上抓取音频作为训练数据。Suno 主张,在开放互联网上可获取的音乐上训练,依适用法律属于受保护的合理使用;但已被证实的抓流证据造成了实质性的声誉与法律风险敞口,至今未了。
这样的诉讼格局,为商业音乐部署制造了不对称风险。对一个在广告中使用 AI 音乐的品牌、一个为影视同步授权音轨的创作者,或一家把背景音乐生成嵌进产品的企业来说 —— 训练数据的身份及其法律来源不是一个抽象问题。谷歌的 SynthID 水印和它的授权数据定位,让 Lyria 3.5 成为该领域头部工具中风险较低的那一个,尽管独立音乐人的诉讼给这个定位留下了残余的不确定性。ElevenLabs Music 提供的法律姿态与之相当,API 更成熟,但每次生成的成本显著更高。
竞争层面的问题是:这份结构性的安全优势,是否足以扭转那些已经围绕 Suno 的质量领先或 Udio 的流派专长成形的工作流。对新部署而言 —— 尤其是企业应用,以及任何触及流媒体平台分发的场景 —— Lyria 3.5 进入公开 API,开辟出一条 9 月 4 日之前并不存在的可行路径。而对已经有 Suno 或 Udio 工作流的制作人来说,这笔账更取决于迁移摩擦,谷歌的音质需要补上剩下的差距,才能带来有意义的切换。
九月这次推送对开发者改变了什么
9 月 4 日官宣中被报道得最少的一面,是它对开发者具体意味着什么。Lyria 3.5 现在可以通过开发者早已持有、用于文本、代码和推理任务的同一把 Gemini API 密钥访问。不需要另建音乐 API 账号,不需要另排等待名单,也不需要建立新的计费关系。一个在做视频制作工具、游戏、交互式应用或播客平台的开发者,可以通过自己已经在用的同一套 API 界面接入音乐生成 —— 这是一条单次会话就能打通的集成路径,而 ElevenLabs 和第三方 Suno 封装都复制不了。
与竞品的价格对比很显著。市场上最成熟的商业音频 API ElevenLabs Music,每分钟生成音频收费约 0.30 美元 —— 也就是说一首两到三分钟的曲子约合 0.60 到 0.90 美元。至截稿时仍没有自家官方公开 API 的 Suno,其第三方 API 封装每次生成收费 0.05 到 0.11 美元。通过 Gemini API 使用的 Lyria 3.5 则按标准 Gemini API 用量档位定价,而不是按曲收费,这让单位成本取决于开发者已有的套餐和使用量。对那些本来就在谷歌云和 Gemini API 生态里的组织来说,加上音乐生成的边际成本,可能远低于改用一个专门的音乐 API。这种把音乐与文本、推理打包而不是单独定价的经济结构,是任何一家独立音乐 AI 公司都复制不了的差异化策略。
目前,Gemini API 音乐生成文档处于公开预览状态,这意味着其商业条款和生产可用性保证尚未定稿。Google AI Studio 提供了一个提示词测试环境,开发者可以先在其中打磨音乐生成提示词,再去写 API 集成代码 —— 同样的提示词几乎无需返工就能迁到生产 API。正在评估把 Lyria 3.5 用于生产部署的组织,应把当下视为一个评估窗口而非「可直接上生产的发布」,对照谷歌公布的授权条款核实具体用例,并留意该模型何时退出公开预览状态。
另外,9 月 4 日这次推送恰好与谷歌把语音转文字能力通过进入公开预览的 Transcribe 功能收拢到 Gemini API 之下同时发生。这条平行线索指向一套更大的策略:谷歌正在系统性地把按模态划分的 AI 能力 —— 文本生成、图像生成、视频生成、音乐生成,如今再加上语音转写 —— 全部导入统一的 Gemini API 界面。对开发者来说,这降低了集成开销,也造出了单一依赖。对那些做了独立音频和音乐 API 的竞争者来说,这抬高了迁移到它们平台的切换成本,因为留在 Lyria 意味着不必再做额外的集成工作。
衡量 Lyria 3.5 的分发优势能否转化为开发者采用,要看未来几个月里基于 Gemini API 的独立工具冒出得有多快,以及谷歌所描述的音质改进是否足以满足生产要求。Suno 已成形的工作流和模型线给了它续航力;Udio 在特定流派上的强项给了它在自己地盘上的保护。谷歌这次九月推送新增的,是一个授权数据、带 SynthID 水印、单一 API 的可行选项,而它的价位让评估几乎没有摩擦 —— 早在下一代模型到来之前,这本身就是市场的一次结构性位移。