今天你有一支:
60 秒视频。
画面都剪好了。
接着打开 Lyria 3.5,
输入:
「帮我做一首 60 秒、温暖、有质感的 Instrumental。」
AI 真的做出来了。
曲风:
没问题。
乐器:
也很好听。
但真正放进视频以后,
你却发现:
完全不搭。
开场才刚出现产品,
音乐已经很满。
真正重要的画面出现时,
音乐反而没有变化。
视频准备结束了,
歌曲却像:
还要再唱两分钟。
问题不是:
AI 不会作曲。
而是:
你只告诉它:
这首歌长什么样。
却没有告诉它:
这首歌在视频里要怎么走。
今天只学一个方法。
做视频配乐以前,
先把时间线切成:
开场。
主体。
收尾。
再替三段各写一句:
能量怎么变。
为什么这招对 Lyria 3.5 特别有用?
Google DeepMind 的 Lyria Prompt Guide 本来就把:
Dynamics
列为控制音乐的重要元素之一。
Dynamics 可以理解成:
音乐的能量、
强弱、
密度
怎么随时间变化。
例如:
先用安静钢琴。
慢慢加入节奏。
进入更强的副歌。
最后再安静下来。
也就是:
不要只描述:
「我要什么曲风。」
还可以描述:
「音乐中间要怎么变。」
这刚好非常适合:
视频配乐。
第一步|先不要碰音乐,先看视频
假设你有一支:
60 秒商品视频。
先不要问:
要 Lo-fi?
Jazz?
还是 Acoustic?
只看:
画面本身。
例如:
0~10 秒:
产品第一次出现。
10~50 秒:
制作过程、细节、使用画面。
50~60 秒:
完成品、Logo 区域、结尾。
你已经自然得到三段。
开场。
主体。
收尾。
注意:
这不是要你每支视频都一定切:
10/40/10。
真正重点是:
先找视频自己的三个阶段。
第二步|只替每一段写「能量」
不要先写音乐理论。
先用白话。
开场:
简单。
主体:
逐渐增加。
收尾:
干净收住。
这样就够了。
或者另一支视频可能是:
开场:
立刻有力。
主体:
维持节奏。
收尾:
突然停干净。
也可以。
你现在做的不是:
作曲。
而是在决定:
观众每个阶段应该感受到什么。
第三步|再把音乐特征补进去
假设是一支:
手作食品视频。
你希望:
温暖。
自然。
有一点节奏。
不要抢旁白。
就可以先定:
Genre:
Acoustic/Light Folk。
Instrument:
木吉他。
柔和钢琴。
轻打击。
Vocal:
不要。
这时才把:
音乐风格
和:
三段能量
接在一起。
Prompt 就会从一句模糊要求
原本:
「做一首 60 秒温暖的背景音乐。」
变成:
「为一支约 60 秒的手作食品视频创作 Instrumental Background Music。整体温暖、自然,以木吉他、柔和钢琴和轻打击乐为主。开场保持简单、乐器少;主体逐渐加入节奏和音乐层次;接近结尾时逐步降低能量,最后干净自然收住。不要人声,不要太戏剧化。」
这个 Prompt 没有:
专业和弦。
复杂乐理。
Mixing 术语。
但它已经比:
「帮我做一首好听的音乐」
有用很多。
为什么?
因为它回答了两个不同问题。
第一个:
音乐是什么风格?
第二个:
音乐怎么陪着画面移动?
真正的视频配乐,
第二个往往比第一个更重要。
开场的工作不是「先把最好听的地方全部丢出来」
很多 AI 生成音乐一开始就:
很满。
鼓。
Bass。
Pad。
旋律。
全部一起来。
单独听可能很好。
但放到视频里,
会发生一个问题。
画面:
还没有创建。
产品:
才刚出现。
音乐却已经:
100 分。
后面就没有地方可以成长。
所以如果视频需要:
逐渐创建情绪,
Prompt 可以明确写:
Opening should be sparse and restrained.
白话就是:
开场:
乐器少一点。
节奏少一点。
留空间。
尤其视频前面有旁白时更重要
假设第一句旁白是:
「你每天是不是花很多时间整理同一份数据?」
如果音乐一开始:
鼓很大。
旋律很满。
Vocal 又在唱,
观众耳朵要同时处理:
旁白。
音乐。
画面。
字幕。
结果反而:
更累。
所以开场可以要求:
简单。
不要人声。
降低 Instrument Density。
把位置留给:
内容。
主体才开始增加
当视频进入:
真正示范。
工作过程。
产品细节。
前后对照。
音乐才开始:
增加节奏。
增加 Layer。
稍微提升 Energy。
这会让观众产生:
事情正在往前走。
的感觉。
这就是 Dynamics 真正实用的地方。
不是:
让音乐变华丽。
而是:
替视频创建:
进度感。
例如一支咖啡视频
前 8 秒:
店门。
咖啡豆。
杯子。
可以:
安静。
8~45 秒:
磨豆。
冲水。
蒸气。
倒奶。
拉花。
这时:
Rhythm Gradually Builds。
45~60 秒:
完成。
端上桌。
最后定格。
音乐:
开始减少。
最后:
Clean Ending。
这样即使没有任何歌词,
观众也会感觉到:
故事:
开始。
进行。
完成。
第三段「收尾」特别容易被忘记
很多人做 AI 配乐,
只告诉 AI:
前面想要什么。
中间想要什么。
但没有说:
最后怎么停。
结果视频已经:
准备 End Card。
音乐却:
还在增加。
或者:
突然被剪断。
这会让整支视频出现一种:
「不是结束,只是文件没了」
的感觉。
所以 Prompt 最后加一句:
最后自然收住。
最后降低能量。
最后留下干净 Ending。
非常有用。
如果你做的是 15 秒广告,三段一样存在
不要因为视频很短,
就觉得:
没有结构。
例如:
前 3 秒:
Hook。
3~12 秒:
产品。
12~15 秒:
CTA。
可以写成:
开场:
立刻有节奏。
主体:
保持推进。
结尾:
快速收束,
留一个明确结束点。
三段不需要:
一样长。
只需要:
功能不同。
如果是 3 分钟视频呢?
一样。
例如:
0~20 秒:
开场。
20 秒~2 分 30 秒:
主体。
最后 30 秒:
收尾。
或者主体里,
你还可以再描述:
先平。
再渐强。
再降下来。
Google DeepMind 本来就鼓励用户在 Prompt 里描述:
音乐不同 Section
如何改变 Dynamics。
所以如果你会做:
更长内容,
还可以再细分。
但今天不用学那么多。
先把:
三段
做好。
一个很重要的限制:不要把秒数当成剪辑软件的绝对指令
这一点一定要分清楚。
Lyria 3.5 可以透过 Prompt:
影响曲目长度。
Google API 文档也明确表示:
完整模型生成的是数分钟歌曲,
实际长度会受到 Prompt 影响。
但这不代表:
你写:
「第 10.000 秒一定进鼓。」
它就像 DAW Automation 一样:
精确到那一格。
Lyria 是:
生成模型。
不是:
时间轴剪辑软件。
所以今天的方法叫:
能量线。
不是:
精密 Cue Sheet。
如果你真的需要某一秒一定发生某个音乐点
例如:
广告第 8 秒一定爆点。
第 23 秒一定停止。
那比较稳定的方法仍然可能是:
先让 Lyria 生成:
接近需要的音乐。
再进:
真正剪辑软件
调整。
裁切。
Fade。
对点。
AI 先帮你:
做音乐原料。
剪辑软件最后:
把秒数锁准。
不要要求一个工具:
一次完成所有工作。
所以第一次测,不要写太多段
很容易看到 Lyria 支持:
Genre。
Tempo。
Dynamics。
Instrument。
Vocal。
就开始 Prompt:
第 0~3 秒这样。
3~7 秒这样。
7~11 秒又换。
最后写:
20 行。
不一定比较好。
第一次:
只做三段。
开场。
主体。
收尾。
先看 AI 能不能:
抓到大的能量方向。
如果结果不对,先只改一件事
例如第一版:
主体太平。
不要整段 Prompt 全部重写。
先改:
「主体要更明显逐步增加节奏和乐器层次。」
再生成。
第二版:
收尾还是太突然。
再改:
「最后几秒逐步减少乐器并自然收尾。」
一次只调:
一个问题。
你会比较知道:
到底哪一句 Prompt
真的有影响。
这点很重要,因为目前 Lyria API 仍是 Single-turn
Google 目前的 API 文档明确说明,
Lyria 3.5 音乐生成属于:
Single-turn Process。
也就是:
现在还不是你生成一首歌后,
可以持续和同一首歌聊天:
「只改 35 秒那里。」
「其他全部完全不动。」
「鼓小声一点。」
这种完整 Multi-turn Audio Editing。
如果第一版不合,
通常是:
修改 Prompt,
重新生成一个新版本。
所以 Prompt 一开始有:
清楚结构
会更重要。
而且相同 Prompt 重新生成,也可能不一样
Google 同样提醒:
即使 Prompt 相同,
不同生成结果:
也可能有 Variation。
所以你今天如果得到:
一个主体节奏非常刚好的版本,
先保存。
不要想:
「这个 Prompt 已经对了,晚点再生一模一样的。」
生成式音乐不是:
固定搜索结果。
这也代表比较好的测试方式是一次比较 2~3 个版本
不要只生成一次,
立刻开始怀疑:
Prompt 写错。
同样的大方向可以:
跑几个版本。
然后问:
哪一个:
开场最干净?
哪一个:
主体最有推进?
哪一个:
结尾最好剪?
你是在:
选 Music Draft。
不是:
要求第一次就得到 Master。
如果视频有旁白,再加一个小提醒
主体可以增加能量,
但不要因此:
抢掉 Voiceover。
Prompt 可以补:
「Keep the arrangement supportive under spoken narration。」
也就是:
配乐提供情绪,
但不要让主要旋律或乐器:
一直和人声打架。
特别是:
教学。
访谈。
产品介绍。
旁白才是:
主角。
如果视频没有旁白,音乐可以承担更多叙事
例如:
旅行。
料理。
手作。
时尚。
产品美感片。
这种视频音乐可以:
更明显。
开场:
创建气氛。
主体:
推进。
高潮:
拉高。
收尾:
释放。
因为没有 Voiceover
需要避让。
所以同样三段方法,
会依:
视频有没有 Spoken Content
改变。
今天的方法也适合照片转音乐
Lyria 可以利用:
图片
作为生成 Context。
假设你有一张:
夕阳海边照片。
照片可以先帮 AI 理解:
情绪。
地点。
氛围。
但你还是可以再加:
「前段安静,中段逐渐增加温暖的节奏,最后回到简单钢琴收尾。」
照片负责:
Mood。
三段能量线负责:
Movement。
两个一起用,
比单纯说:
「根据这张图生成音乐」
更可控。
这其实也是所有生成式 AI 很重要的一个方法
很多人下 Prompt,
只描述:
结果长什么样。
但真正好用的 Prompt,
常常还会描述:
结果怎么变化。
例如写文章:
前面先解释问题。
中间讲方法。
最后给行动。
做视频:
先 Hook。
再示范。
最后 CTA。
做音乐也是:
先创建。
再推进。
最后收束。
AI 并没有改变:
内容结构的重要性。
只是帮你:
更快把结构变成成品。
今天不要学太多,只记三格
下一次你要用 Lyria 做视频配乐,
先不要写:
「做一首好听的歌。」
先拿纸写:
开场:____
主体:____
收尾:____
例如:
开场:
简单、安静。
主体:
逐渐增加节奏。
收尾:
降低能量、干净结束。
再把:
Genre。
乐器。
是否人声。
总长度
补上去。
这已经是一个:
非常完整的第一版 Prompt。
第一次实测,可以只花一分钟
拿一支:
已经剪好的短视频。
播放一次。
不要听原配乐。
只问:
第一段:
观众刚进来时需要什么感觉?
中间:
画面开始动起来时,
音乐要不要增加?
最后:
要怎么让观众知道:
事情完成了?
把三个答案:
写进 Prompt。
再交给 Lyria。
你就不是:
请 AI 随机做一首:
「差不多符合主题的音乐。」
而是在告诉它:
这首音乐在你的内容里,到底负责什么工作。
最后记住一句话
视频配乐真正需要配的,
不是:
视频的「主题」。
而是:
视频的「时间」。
同样是一支:
咖啡视频。
可以温暖。
可以高级。
可以轻快。
但如果音乐的:
起。
承。
转。
收
和画面完全错开,
再漂亮的曲风也只是一首:
独立很好听的歌。
不是:
好配乐。
所以用 Lyria 3.5 时,
先不要急着追求:
最厉害的 Prompt。
先把最简单的三件事说清楚:
开场怎么进。
主体怎么长。
最后怎么停。
AI 才比较有机会真的:
跟着视频工作。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。