做一支 60 秒短影音,

画面可能半小时就剪好了。

结果最后卡住的却是:

背景音乐。

免费音乐库翻了半天。

喜欢的歌不一定能商用。

适合情绪的曲子,

长度又不对。

自己不会作曲,

找音乐人又不一定适合每一支小视频。

Google 现在把:

Lyria 3.5

直接放进 Gemini。

这让「替一个具体内容做一首刚好合用的音乐」,

开始变成一般人也能直接测试的工作。

Lyria 3.5 是什么?

Lyria 是 Google DeepMind 的:

AI 音乐生成模型。

你不是请它:

分析一首歌。

而是直接描述:

你想要什么音乐。

例如:

「做一首 60 秒的轻快 Instrumental,温暖、自然、有手作感,以木吉他和轻打击乐为主,前 10 秒简单,后面逐渐增加节奏。」

Lyria 会真的:

产生一段音乐。

新版:

Lyria 3.5

把这件事情做得更完整。

Google 9 月 4 日宣布,

Lyria 3.5 现在已经进入:

Gemini App。

Gemini API。

Google Flow Music。

甚至:

Google Vids。

这次更新最直接的变化:你可以选「我要哪一种歌」

在 Gemini 里,

现在可以直接指定:

Genre。

曲风。

例如:

Lo-fi。

Pop。

Jazz。

Funk。

Electronic。

Acoustic。

也可以指定:

Vocal。

有人唱。

或者:

Instrumental。

纯音乐。

还能使用范本,

快速从:

背景音乐。

生日曲。

品牌 Jingle。

其他常见用途

开始。

对没有音乐制作背景的人来说,

这比:

要你自己描述一堆音乐理论

容易很多。

第二个真正实用的新能力:长度可以跟着工作决定

以前 AI Music 很常出现一个问题。

你要做:

45 秒视频。

AI 给你:

30 秒。

或者:

生成一首完整歌,

但真正能用的只有中间一小段。

Lyria 3.5 已经可以让你在 Prompt 里:

控制曲目长度。

Google DeepMind 目前展示的 Lyria 3.5,

最长可以做到:

约 3 分钟。

所以你可以按照真正的用途设计。

例如:

15~30 秒:

品牌片头。

60 秒:

Reels/Shorts 配乐。

90 秒:

产品介绍。

2~3 分钟:

完整教学片、活动视频或歌曲。

这件事情对内容创作者非常实际。

因为你不是:

先做一首歌,

再想怎么硬塞进视频。

而可以反过来:

先知道视频需要多久,再叫 AI 做差不多长的音乐。

第三个有趣功能:照片也可以变成音乐提示

Lyria 不只理解:

文字。

你也可以上传:

照片。

Gemini Help 甚至说明,

在 Gemini 里还可以使用:

照片或视频

提供 Context。

例如你有一张:

夕阳海边的照片。

你可以要求:

「根据这张照片的气氛,做一首 70 秒纯音乐。前半段安静,以木吉他和柔和 Pad 为主;最后 20 秒逐渐明亮,但不要变成激昂广告歌。」

这和:

单纯输入「做一首舒服的音乐」

差很多。

因为:

你的视觉素材

本身开始成为:

Music Brief。

这对做短影音的人特别方便

假设你已经剪好一支:

咖啡店 Reels。

有:

磨豆。

冲煮。

蒸气。

端杯。

客人坐下来。

以前接下来要去:

搜索音乐。

现在可以把:

代表性的画面

交给 Lyria,

再告诉它:

这支视频:

45 秒。

不要 Vocal。

前面安静。

20 秒开始增加节奏。

结尾留一个干净收尾。

等于:

让音乐配合视频。

不是:

让视频被迫配合现成音乐。

它甚至可以生成完整 Vocal

Lyria 3.5 不只是:

Background Music Generator。

Google 表示新版提升了:

Vocal Quality。

Lyrics。

Musical Arrangement。

也可以生成具有:

Verse。

Chorus。

Bridge

结构的完整歌曲。

如果你真的要做:

品牌歌曲。

活动歌曲。

生日歌。

内容企划中的完整 Music Track,

就可以进一步指定:

男声或女声。

音域。

声音质感。

乐器。

Tempo。

Dynamics。

歌词主题。

但对一般小公司,我反而建议先从 Instrumental 开始

原因很简单。

如果只是:

产品视频。

教学视频。

Podcast 开头。

活动回顾。

店内品牌短片。

你真正需要的是:

音乐帮画面加情绪。

不是:

让观众开始听歌词。

Instrumental 通常比较容易:

和旁白共存。

不抢字幕。

不会因歌词意思和品牌内容冲突。

也比较容易快速判断:

能不能用。

所以第一次测,

不用一开始就叫 AI:

替公司写一首完整品牌主题曲。

先做:

30~60 秒 Instrumental。

比较实际。

Prompt 不需要很专业,但至少写五件事

Google DeepMind 的 Prompt Guide 建议,

你可以从:

Genre。

Tempo。

Instruments。

Dynamics。

Vocals

这些元素控制结果。

如果是一般人,

可以再简化成五个问题。

第一:拿来做什么?

例如:

60 秒手作商品视频。

第二:什么情绪?

温暖。

安静。

高级。

活泼。

怀旧。

第三:要不要人声?

Vocal。

或 Instrumental。

第四:想听到什么乐器?

木吉他。

钢琴。

弦乐。

电子鼓。

Bass。

第五:多长?

例如:

60 秒。

一个实际 Prompt 可以长这样

例如你要做:

陶艺工作室商品视频。

可以说:

「为一支 60 秒的手作陶器品牌视频创作 Instrumental Background Music。温暖、自然、安静但不要悲伤,以木吉他、柔和钢琴和非常轻的打击乐为主。前 10 秒保持简单,20 秒后增加一些节奏,最后 5 秒自然收尾。不要人声,不要太戏剧化。」

就已经足够开始。

第一次结果不喜欢,

再改:

Tempo。

乐器。

情绪。

节奏密度。

不过这里有一个很重要的限制:API 目前不是对话式修歌工具

Google 的 Gemini API 文档目前明确写:

Lyria 3.5 的 Music Generation:

仍然是:

Single-turn。

也就是:

生成一次。

结果不喜欢,

再做一次新的生成。

目前不是那种:

「把刚才第 35 秒的鼓拿掉。」

「其他全部保留,只把最后 Chorus 改柔和。」

然后对同一份音频连续精修的:

Multi-turn Editing。

所以不要把它想成:

完整 DAW。

或者:

专业音乐后制软件。

它比较像:

AI 帮你快速生出 Music Draft。

同一个 Prompt 再跑一次,也不一定得到完全同一首

Google 也提醒:

结果具有:

Variation。

即使使用相同 Prompt,

不同生成也可能:

不同。

这其实有好有坏。

好处是:

你可以很快试很多方向。

问题是:

如果某一个版本真的很喜欢,

不要以为:

「等一下再生成一次就好了。」

直接把:

喜欢的版本

保存下来。

Gemini 里完成后可以直接下载

Google Gemini Help 目前说明,

生成完成后可以:

下载。

分享。

发布到社区。

其中可以下载:

MP3 音频。

或者:

带有封面图的 MP4。

所以如果你只是需要:

剪视频用的音乐,

拿:

MP3

会最直接。

再放进:

你原本使用的剪辑软件。

Google Vids 也已经接上 Lyria 3.5

这和昨天 SasaDaily 做的 Google Vids 系列刚好接得起来。

昨天我们谈的是:

把 Docs、PDF、Word

变成:

Summary Video。

视频有了。

现在 Lyria 3.5 又进:

Google Vids。

代表 Google 正逐渐把:

文档。

脚本。

旁白。

画面。

音乐

全部串进:

同一套内容制作流程。

以前每一项可能要:

不同工具。

现在 AI 正在把制作链:

慢慢接起来。

对一人公司来说,最实际的使用情境反而很普通

例如你每星期要做:

3 支 Reels。

以前每一支都要:

找背景音乐。

听。

比。

确认长度。

再剪。

如果 Lyria 可以:

先根据你的视频主题

产生三种:

60 秒 Instrumental,

你只需要:

选。

这就是很典型的:

AI 把时间还给人。

它没有替你决定:

品牌应该长什么样。

只是把:

反复找素材

的时间缩短。

第二个使用情境:Podcast 或 YouTube 固定片头

很多小型内容品牌一直没有:

自己的 Opening Music。

因为觉得:

又不是大型媒体,

何必特别找人制作?

Lyria 3.5 可以先让你测:

10 秒。

15 秒。

30 秒。

做出:

一段固定 Opening。

如果之后品牌真的变大,

再决定:

要不要由专业音乐人重新制作。

AI 最适合的角色是:

先让你从「没有」走到第一版。

第三个使用情境:活动与演示文稿

例如:

公司尾牙。

学校成果视频。

婚礼回顾。

产品发表。

社区活动。

照片都已经有了。

视频也剪好了。

但音乐一直:

不太对。

你甚至可以直接把:

活动主视觉

交给 Lyria,

要求它:

根据颜色、

气氛、

内容

生成一段:

符合活动感觉的音乐。

这种:

Image → Music

会是很有趣的新工作方式。

第四个使用情境:先做 Jingle Prototype

如果你是一家:

小店。

电商品牌。

YouTube Channel。

Podcast。

想要一段:

每次出现就让人想到你的声音,

可以先用 Lyria 做:

Prototype。

例如:

5 秒音乐开场。

15 秒品牌段落。

30 秒完整版本。

先测:

哪个方向比较像你的品牌。

但这里一定要再加一句:

Prototype 好用,不等于商标与音乐权利问题全部自动解决。

如果要长期作为:

正式品牌资产。

大规模广告。

商业授权。

仍然值得再确认:

平台当时适用的 Terms。

以及:

你所在地的著作权与商标使用规则。

不要直接要求「做得像某位歌手」

这一点 Google 自己已经做限制。

Gemini API 文档目前说明,

Safety Filter 会拦截:

要求特定 Artist Voice

以及:

生成受著作权保护 Lyrics

等请求。

这个方向很合理。

你真正应该描述的是:

音乐特征。

不要只说:

「帮我做成某某歌手。」

改成:

「低沉男声、Soulful、节奏缓慢、干净木吉他、温暖模拟音色。」

这反而更能让你创建:

自己的声音方向。

这也是 AI 音乐最值得学的一件事

不要 Prompt:

「像谁?」

开始 Prompt:

「我要什么特征?」

Genre 是什么?

Tempo 多快?

情绪怎么变?

哪些 Instruments?

Vocal 怎么唱?

哪一段要安静?

哪一段要增加能量?

这种写法不只比较安全。

也让你真正开始:

掌握自己的 Creative Direction。

Google 也替生成音乐加入 SynthID

Google DeepMind 表示,

Lyria 生成的音乐都会加入:

SynthID。

这是一种:

人耳听不出来的 Digital Watermark。

用途是:

协助辨识内容是否由 AI 生成或编辑。

所以下载的音乐不是:

「完全没有任何 AI 标记。」

而是在音频里包含:

不可感知的 SynthID。

这是现在 Google AI 生成媒体整体的:

Provenance

方向之一。

那是不是有 SynthID 就代表所有版权问题都解决?

不是。

SynthID 回答的是:

这是不是 AI 生成内容?

它没有自动回答:

你是否可以在任何国家、

任何平台、

任何商业情境

无限制使用。

这两件事要分开。

AI Watermark:

是来源识别。

Commercial Rights:

是使用权利。

不要混成同一件事。

也不要因为 AI 生成,就完全不听成品

一首音乐不像:

一段文字。

你不能只扫两眼。

真正要检查的是:

整首播一次。

尤其是:

Vocal。

Lyrics。

结尾。

有没有奇怪声音。

有没有突然跑出不想要的情绪。

如果放在视频里,

还要再看:

旁白会不会被抢掉。

音乐高潮是不是出现在:

错的画面。

最简单的验收方法:先别问「好不好听」

先问:

「有没有完成这支内容的工作?」

例如:

这是一支 45 秒的商品 Reel。

你真正需要的可能是:

前 5 秒抓注意力。

中间不要抢旁白。

30 秒以后稍微增加情绪。

最后干净收尾。

那即使另一首歌:

单独听更漂亮,

只要:

不能配视频,

它就不是:

比较好的答案。

AI Tool 最终还是要回到:

工作。

如果今天第一次使用,我建议只做一个 60 秒 Instrumental

不要一次玩:

完整歌曲。

歌词。

人声。

Jingle。

Podcast。

广告。

全部一起。

找一支你已经有的:

短视频。

先确认:

视频长度。

然后给 Lyria:

用途。

情绪。

乐器。

长度。

不要 Vocal。

生成几个版本。

放回视频里试。

你很快就会知道:

它到底能不能:

真的替你省下找配乐的时间。

一个非常简单的第一次测试

例如:

视频:

60 秒。

主题:

手作商品。

Prompt:

温暖。

自然。

Instrumental。

木吉他+钢琴+轻打击。

前面慢。

中段增加节奏。

最后自然结束。

不要人声。

然后:

生成。

下载 MP3。

丢进原本视频。

完整看一次。

只问:

「这首音乐有没有让视频更完整?」

有:

留下。

没有:

换另一个方向。

不要因为:

是 AI 做的

就硬用。

Lyria 3.5 和一般「AI 帮我推荐音乐」最大的差别

推荐音乐是在:

已存在的曲库里找。

Lyria 则是在:

按照这次任务产生新的音乐。

这代表未来内容制作的一个很大转变。

以前:

先有素材。

你去找:

最接近的。

现在:

你先有需求。

AI 再做:

符合需求的第一版。

图片如此。

视频如此。

现在:

音乐也正在走同一条路。

但这并不代表专业音乐人没有价值

刚好相反。

AI 最擅长的是:

快速产生方向。

Prototype。

背景素材。

低成本尝试。

但真正需要:

品牌声音识别。

完整编曲。

精确混音。

大型广告。

长期 Music Identity。

演唱情感。

创作故事

时,

专业音乐人的价值反而会集中在:

选择、审美、表达与最终品质。

就像 AI Image 出现后,

真正好的 Visual Direction

没有变得不重要。

Lyria 3.5 今天真正值得看的,不是「AI 终于会写歌」

AI 早就能生成音乐。

真正的新变化是:

它开始进入:

一般人的既有工作入口。

Gemini。

Google Vids。

Flow Music。

Google AI Studio。

API。

也就是:

从一个有趣的 Music Demo,

逐渐变成:

Content Workflow 里的一个正式组件。

你做视频缺音乐。

直接做。

你有照片想配气氛。

直接做。

你需要一段特定长度背景音。

直接做。

这才是:

今天真正实用的地方。

最后记住一个使用原则

不要先问:

「Lyria 能做出多厉害的歌?」

先问:

「我现在有哪一段内容,每次都浪费时间找音乐?」

可能是:

Reels。

YouTube。

Podcast。

活动视频。

商品视频。

演示文稿。

如果你已经有一个:

真实工作,

Lyria 3.5 才有机会从:

好玩的 AI

变成:

真正省时间的工具。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

今日 AI 工具|2026/07/21:Google Vids,把文档与演示文稿变成视频初稿,适合教学、提案与工作说明

AI 几秒钟就能模仿一种风格,但创作者可能花了十年才走到这里