今天你有一支:

60 秒视频。

画面都剪好了。

接着打开 Lyria 3.5,

输入:

「帮我做一首 60 秒、温暖、有质感的 Instrumental。」

AI 真的做出来了。

曲风:

没问题。

乐器:

也很好听。

但真正放进视频以后,

你却发现:

完全不搭。

开场才刚出现产品,

音乐已经很满。

真正重要的画面出现时,

音乐反而没有变化。

视频准备结束了,

歌曲却像:

还要再唱两分钟。

问题不是:

AI 不会作曲。

而是:

你只告诉它:

这首歌长什么样。

却没有告诉它:

这首歌在视频里要怎么走。

今天只学一个方法。

做视频配乐以前,

先把时间线切成:

开场。

主体。

收尾。

再替三段各写一句:

能量怎么变。

为什么这招对 Lyria 3.5 特别有用?

Google DeepMind 的 Lyria Prompt Guide 本来就把:

Dynamics

列为控制音乐的重要元素之一。

Dynamics 可以理解成:

音乐的能量、

强弱、

密度

怎么随时间变化。

例如:

先用安静钢琴。

慢慢加入节奏。

进入更强的副歌。

最后再安静下来。

也就是:

不要只描述:

「我要什么曲风。」

还可以描述:

「音乐中间要怎么变。」

这刚好非常适合:

视频配乐。

第一步|先不要碰音乐,先看视频

假设你有一支:

60 秒商品视频。

先不要问:

要 Lo-fi?

Jazz?

还是 Acoustic?

只看:

画面本身。

例如:

0~10 秒:

产品第一次出现。

10~50 秒:

制作过程、细节、使用画面。

50~60 秒:

完成品、Logo 区域、结尾。

你已经自然得到三段。

开场。

主体。

收尾。

注意:

这不是要你每支视频都一定切:

10/40/10。

真正重点是:

先找视频自己的三个阶段。

第二步|只替每一段写「能量」

不要先写音乐理论。

先用白话。

开场:

简单。

主体:

逐渐增加。

收尾:

干净收住。

这样就够了。

或者另一支视频可能是:

开场:

立刻有力。

主体:

维持节奏。

收尾:

突然停干净。

也可以。

你现在做的不是:

作曲。

而是在决定:

观众每个阶段应该感受到什么。

第三步|再把音乐特征补进去

假设是一支:

手作食品视频。

你希望:

温暖。

自然。

有一点节奏。

不要抢旁白。

就可以先定:

Genre:

Acoustic/Light Folk。

Instrument:

木吉他。

柔和钢琴。

轻打击。

Vocal:

不要。

这时才把:

音乐风格

和:

三段能量

接在一起。

Prompt 就会从一句模糊要求

原本:

「做一首 60 秒温暖的背景音乐。」

变成:

「为一支约 60 秒的手作食品视频创作 Instrumental Background Music。整体温暖、自然,以木吉他、柔和钢琴和轻打击乐为主。开场保持简单、乐器少;主体逐渐加入节奏和音乐层次;接近结尾时逐步降低能量,最后干净自然收住。不要人声,不要太戏剧化。」

这个 Prompt 没有:

专业和弦。

复杂乐理。

Mixing 术语。

但它已经比:

「帮我做一首好听的音乐」

有用很多。

为什么?

因为它回答了两个不同问题。

第一个:

音乐是什么风格?

第二个:

音乐怎么陪着画面移动?

真正的视频配乐,

第二个往往比第一个更重要。

开场的工作不是「先把最好听的地方全部丢出来」

很多 AI 生成音乐一开始就:

很满。

鼓。

Bass。

Pad。

旋律。

全部一起来。

单独听可能很好。

但放到视频里,

会发生一个问题。

画面:

还没有创建。

产品:

才刚出现。

音乐却已经:

100 分。

后面就没有地方可以成长。

所以如果视频需要:

逐渐创建情绪,

Prompt 可以明确写:

Opening should be sparse and restrained.

白话就是:

开场:

乐器少一点。

节奏少一点。

留空间。

尤其视频前面有旁白时更重要

假设第一句旁白是:

「你每天是不是花很多时间整理同一份数据?」

如果音乐一开始:

鼓很大。

旋律很满。

Vocal 又在唱,

观众耳朵要同时处理:

旁白。

音乐。

画面。

字幕。

结果反而:

更累。

所以开场可以要求:

简单。

不要人声。

降低 Instrument Density。

把位置留给:

内容。

主体才开始增加

当视频进入:

真正示范。

工作过程。

产品细节。

前后对照。

音乐才开始:

增加节奏。

增加 Layer。

稍微提升 Energy。

这会让观众产生:

事情正在往前走。

的感觉。

这就是 Dynamics 真正实用的地方。

不是:

让音乐变华丽。

而是:

替视频创建:

进度感。

例如一支咖啡视频

前 8 秒:

店门。

咖啡豆。

杯子。

可以:

安静。

8~45 秒:

磨豆。

冲水。

蒸气。

倒奶。

拉花。

这时:

Rhythm Gradually Builds。

45~60 秒:

完成。

端上桌。

最后定格。

音乐:

开始减少。

最后:

Clean Ending。

这样即使没有任何歌词,

观众也会感觉到:

故事:

开始。

进行。

完成。

第三段「收尾」特别容易被忘记

很多人做 AI 配乐,

只告诉 AI:

前面想要什么。

中间想要什么。

但没有说:

最后怎么停。

结果视频已经:

准备 End Card。

音乐却:

还在增加。

或者:

突然被剪断。

这会让整支视频出现一种:

「不是结束,只是文件没了」

的感觉。

所以 Prompt 最后加一句:

最后自然收住。

最后降低能量。

最后留下干净 Ending。

非常有用。

如果你做的是 15 秒广告,三段一样存在

不要因为视频很短,

就觉得:

没有结构。

例如:

前 3 秒:

Hook。

3~12 秒:

产品。

12~15 秒:

CTA。

可以写成:

开场:

立刻有节奏。

主体:

保持推进。

结尾:

快速收束,

留一个明确结束点。

三段不需要:

一样长。

只需要:

功能不同。

如果是 3 分钟视频呢?

一样。

例如:

0~20 秒:

开场。

20 秒~2 分 30 秒:

主体。

最后 30 秒:

收尾。

或者主体里,

你还可以再描述:

先平。

再渐强。

再降下来。

Google DeepMind 本来就鼓励用户在 Prompt 里描述:

音乐不同 Section

如何改变 Dynamics。

所以如果你会做:

更长内容,

还可以再细分。

但今天不用学那么多。

先把:

三段

做好。

一个很重要的限制:不要把秒数当成剪辑软件的绝对指令

这一点一定要分清楚。

Lyria 3.5 可以透过 Prompt:

影响曲目长度。

Google API 文档也明确表示:

完整模型生成的是数分钟歌曲,

实际长度会受到 Prompt 影响。

但这不代表:

你写:

「第 10.000 秒一定进鼓。」

它就像 DAW Automation 一样:

精确到那一格。

Lyria 是:

生成模型。

不是:

时间轴剪辑软件。

所以今天的方法叫:

能量线。

不是:

精密 Cue Sheet。

如果你真的需要某一秒一定发生某个音乐点

例如:

广告第 8 秒一定爆点。

第 23 秒一定停止。

那比较稳定的方法仍然可能是:

先让 Lyria 生成:

接近需要的音乐。

再进:

真正剪辑软件

调整。

裁切。

Fade。

对点。

AI 先帮你:

做音乐原料。

剪辑软件最后:

把秒数锁准。

不要要求一个工具:

一次完成所有工作。

所以第一次测,不要写太多段

很容易看到 Lyria 支持:

Genre。

Tempo。

Dynamics。

Instrument。

Vocal。

就开始 Prompt:

第 0~3 秒这样。

3~7 秒这样。

7~11 秒又换。

最后写:

20 行。

不一定比较好。

第一次:

只做三段。

开场。

主体。

收尾。

先看 AI 能不能:

抓到大的能量方向。

如果结果不对,先只改一件事

例如第一版:

主体太平。

不要整段 Prompt 全部重写。

先改:

「主体要更明显逐步增加节奏和乐器层次。」

再生成。

第二版:

收尾还是太突然。

再改:

「最后几秒逐步减少乐器并自然收尾。」

一次只调:

一个问题。

你会比较知道:

到底哪一句 Prompt

真的有影响。

这点很重要,因为目前 Lyria API 仍是 Single-turn

Google 目前的 API 文档明确说明,

Lyria 3.5 音乐生成属于:

Single-turn Process。

也就是:

现在还不是你生成一首歌后,

可以持续和同一首歌聊天:

「只改 35 秒那里。」

「其他全部完全不动。」

「鼓小声一点。」

这种完整 Multi-turn Audio Editing。

如果第一版不合,

通常是:

修改 Prompt,

重新生成一个新版本。

所以 Prompt 一开始有:

清楚结构

会更重要。

而且相同 Prompt 重新生成,也可能不一样

Google 同样提醒:

即使 Prompt 相同,

不同生成结果:

也可能有 Variation。

所以你今天如果得到:

一个主体节奏非常刚好的版本,

先保存。

不要想:

「这个 Prompt 已经对了,晚点再生一模一样的。」

生成式音乐不是:

固定搜索结果。

这也代表比较好的测试方式是一次比较 2~3 个版本

不要只生成一次,

立刻开始怀疑:

Prompt 写错。

同样的大方向可以:

跑几个版本。

然后问:

哪一个:

开场最干净?

哪一个:

主体最有推进?

哪一个:

结尾最好剪?

你是在:

选 Music Draft。

不是:

要求第一次就得到 Master。

如果视频有旁白,再加一个小提醒

主体可以增加能量,

但不要因此:

抢掉 Voiceover。

Prompt 可以补:

「Keep the arrangement supportive under spoken narration。」

也就是:

配乐提供情绪,

但不要让主要旋律或乐器:

一直和人声打架。

特别是:

教学。

访谈。

产品介绍。

旁白才是:

主角。

如果视频没有旁白,音乐可以承担更多叙事

例如:

旅行。

料理。

手作。

时尚。

产品美感片。

这种视频音乐可以:

更明显。

开场:

创建气氛。

主体:

推进。

高潮:

拉高。

收尾:

释放。

因为没有 Voiceover

需要避让。

所以同样三段方法,

会依:

视频有没有 Spoken Content

改变。

今天的方法也适合照片转音乐

Lyria 可以利用:

图片

作为生成 Context。

假设你有一张:

夕阳海边照片。

照片可以先帮 AI 理解:

情绪。

地点。

氛围。

但你还是可以再加:

「前段安静,中段逐渐增加温暖的节奏,最后回到简单钢琴收尾。」

照片负责:

Mood。

三段能量线负责:

Movement。

两个一起用,

比单纯说:

「根据这张图生成音乐」

更可控。

这其实也是所有生成式 AI 很重要的一个方法

很多人下 Prompt,

只描述:

结果长什么样。

但真正好用的 Prompt,

常常还会描述:

结果怎么变化。

例如写文章:

前面先解释问题。

中间讲方法。

最后给行动。

做视频:

先 Hook。

再示范。

最后 CTA。

做音乐也是:

先创建。

再推进。

最后收束。

AI 并没有改变:

内容结构的重要性。

只是帮你:

更快把结构变成成品。

今天不要学太多,只记三格

下一次你要用 Lyria 做视频配乐,

先不要写:

「做一首好听的歌。」

先拿纸写:

开场:____

主体:____

收尾:____

例如:

开场:

简单、安静。

主体:

逐渐增加节奏。

收尾:

降低能量、干净结束。

再把:

Genre。

乐器。

是否人声。

总长度

补上去。

这已经是一个:

非常完整的第一版 Prompt。

第一次实测,可以只花一分钟

拿一支:

已经剪好的短视频。

播放一次。

不要听原配乐。

只问:

第一段:

观众刚进来时需要什么感觉?

中间:

画面开始动起来时,

音乐要不要增加?

最后:

要怎么让观众知道:

事情完成了?

把三个答案:

写进 Prompt。

再交给 Lyria。

你就不是:

请 AI 随机做一首:

「差不多符合主题的音乐。」

而是在告诉它:

这首音乐在你的内容里,到底负责什么工作。

最后记住一句话

视频配乐真正需要配的,

不是:

视频的「主题」。

而是:

视频的「时间」。

同样是一支:

咖啡视频。

可以温暖。

可以高级。

可以轻快。

但如果音乐的:

起。

承。

转。

和画面完全错开,

再漂亮的曲风也只是一首:

独立很好听的歌。

不是:

好配乐。

所以用 Lyria 3.5 时,

先不要急着追求:

最厉害的 Prompt。

先把最简单的三件事说清楚:

开场怎么进。

主体怎么长。

最后怎么停。

AI 才比较有机会真的:

跟着视频工作。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

今日 AI 工具|2026/07/21:Google Vids,把文档与演示文稿变成视频初稿,适合教学、提案与工作说明

AI 几秒钟就能模仿一种风格,但创作者可能花了十年才走到这里