今天你有一支:
60 秒影片。
畫面都剪好了。
接著打開 Lyria 3.5,
輸入:
「幫我做一首 60 秒、溫暖、有質感的 Instrumental。」
AI 真的做出來了。
曲風:
沒問題。
樂器:
也很好聽。
但真正放進影片以後,
你卻發現:
完全不搭。
開場才剛出現產品,
音樂已經很滿。
真正重要的畫面出現時,
音樂反而沒有變化。
影片準備結束了,
歌曲卻像:
還要再唱兩分鐘。
問題不是:
AI 不會作曲。
而是:
你只告訴它:
這首歌長什麼樣。
卻沒有告訴它:
這首歌在影片裡要怎麼走。
今天只學一個方法。
做影片配樂以前,
先把時間線切成:
開場。
主體。
收尾。
再替三段各寫一句:
能量怎麼變。
為什麼這招對 Lyria 3.5 特別有用?
Google DeepMind 的 Lyria Prompt Guide 本來就把:
Dynamics
列為控制音樂的重要元素之一。
Dynamics 可以理解成:
音樂的能量、
強弱、
密度
怎麼隨時間變化。
例如:
先用安靜鋼琴。
慢慢加入節奏。
進入更強的副歌。
最後再安靜下來。
也就是:
不要只描述:
「我要什麼曲風。」
還可以描述:
「音樂中間要怎麼變。」
這剛好非常適合:
影片配樂。
第一步|先不要碰音樂,先看影片
假設你有一支:
60 秒商品影片。
先不要問:
要 Lo-fi?
Jazz?
還是 Acoustic?
只看:
畫面本身。
例如:
0~10 秒:
產品第一次出現。
10~50 秒:
製作過程、細節、使用畫面。
50~60 秒:
完成品、Logo 區域、結尾。
你已經自然得到三段。
開場。
主體。
收尾。
注意:
這不是要你每支影片都一定切:
10/40/10。
真正重點是:
先找影片自己的三個階段。
第二步|只替每一段寫「能量」
不要先寫音樂理論。
先用白話。
開場:
簡單。
主體:
逐漸增加。
收尾:
乾淨收住。
這樣就夠了。
或者另一支影片可能是:
開場:
立刻有力。
主體:
維持節奏。
收尾:
突然停乾淨。
也可以。
你現在做的不是:
作曲。
而是在決定:
觀眾每個階段應該感受到什麼。
第三步|再把音樂特徵補進去
假設是一支:
手作食品影片。
你希望:
溫暖。
自然。
有一點節奏。
不要搶旁白。
就可以先定:
Genre:
Acoustic/Light Folk。
Instrument:
木吉他。
柔和鋼琴。
輕打擊。
Vocal:
不要。
這時才把:
音樂風格
和:
三段能量
接在一起。
Prompt 就會從一句模糊要求
原本:
「做一首 60 秒溫暖的背景音樂。」
變成:
「為一支約 60 秒的手作食品影片創作 Instrumental Background Music。整體溫暖、自然,以木吉他、柔和鋼琴和輕打擊樂為主。開場保持簡單、樂器少;主體逐漸加入節奏和音樂層次;接近結尾時逐步降低能量,最後乾淨自然收住。不要人聲,不要太戲劇化。」
這個 Prompt 沒有:
專業和弦。
複雜樂理。
Mixing 術語。
但它已經比:
「幫我做一首好聽的音樂」
有用很多。
為什麼?
因為它回答了兩個不同問題。
第一個:
音樂是什麼風格?
第二個:
音樂怎麼陪著畫面移動?
真正的影片配樂,
第二個往往比第一個更重要。
開場的工作不是「先把最好聽的地方全部丟出來」
很多 AI 生成音樂一開始就:
很滿。
鼓。
Bass。
Pad。
旋律。
全部一起來。
單獨聽可能很好。
但放到影片裡,
會發生一個問題。
畫面:
還沒有建立。
產品:
才剛出現。
音樂卻已經:
100 分。
後面就沒有地方可以成長。
所以如果影片需要:
逐漸建立情緒,
Prompt 可以明確寫:
Opening should be sparse and restrained.
白話就是:
開場:
樂器少一點。
節奏少一點。
留空間。
尤其影片前面有旁白時更重要
假設第一句旁白是:
「你每天是不是花很多時間整理同一份資料?」
如果音樂一開始:
鼓很大。
旋律很滿。
Vocal 又在唱,
觀眾耳朵要同時處理:
旁白。
音樂。
畫面。
字幕。
結果反而:
更累。
所以開場可以要求:
簡單。
不要人聲。
降低 Instrument Density。
把位置留給:
內容。
主體才開始增加
當影片進入:
真正示範。
工作過程。
產品細節。
前後對照。
音樂才開始:
增加節奏。
增加 Layer。
稍微提升 Energy。
這會讓觀眾產生:
事情正在往前走。
的感覺。
這就是 Dynamics 真正實用的地方。
不是:
讓音樂變華麗。
而是:
替影片建立:
進度感。
例如一支咖啡影片
前 8 秒:
店門。
咖啡豆。
杯子。
可以:
安靜。
8~45 秒:
磨豆。
沖水。
蒸氣。
倒奶。
拉花。
這時:
Rhythm Gradually Builds。
45~60 秒:
完成。
端上桌。
最後定格。
音樂:
開始減少。
最後:
Clean Ending。
這樣即使沒有任何歌詞,
觀眾也會感覺到:
故事:
開始。
進行。
完成。
第三段「收尾」特別容易被忘記
很多人做 AI 配樂,
只告訴 AI:
前面想要什麼。
中間想要什麼。
但沒有說:
最後怎麼停。
結果影片已經:
準備 End Card。
音樂卻:
還在增加。
或者:
突然被剪斷。
這會讓整支影片出現一種:
「不是結束,只是檔案沒了」
的感覺。
所以 Prompt 最後加一句:
最後自然收住。
最後降低能量。
最後留下乾淨 Ending。
非常有用。
如果你做的是 15 秒廣告,三段一樣存在
不要因為影片很短,
就覺得:
沒有結構。
例如:
前 3 秒:
Hook。
3~12 秒:
產品。
12~15 秒:
CTA。
可以寫成:
開場:
立刻有節奏。
主體:
保持推進。
結尾:
快速收束,
留一個明確結束點。
三段不需要:
一樣長。
只需要:
功能不同。
如果是 3 分鐘影片呢?
一樣。
例如:
0~20 秒:
開場。
20 秒~2 分 30 秒:
主體。
最後 30 秒:
收尾。
或者主體裡,
你還可以再描述:
先平。
再漸強。
再降下來。
Google DeepMind 本來就鼓勵使用者在 Prompt 裡描述:
音樂不同 Section
如何改變 Dynamics。
所以如果你會做:
更長內容,
還可以再細分。
但今天不用學那麼多。
先把:
三段
做好。
一個很重要的限制:不要把秒數當成剪輯軟體的絕對指令
這一點一定要分清楚。
Lyria 3.5 可以透過 Prompt:
影響曲目長度。
Google API 文件也明確表示:
完整模型生成的是數分鐘歌曲,
實際長度會受到 Prompt 影響。
但這不代表:
你寫:
「第 10.000 秒一定進鼓。」
它就像 DAW Automation 一樣:
精確到那一格。
Lyria 是:
生成模型。
不是:
時間軸剪輯軟體。
所以今天的方法叫:
能量線。
不是:
精密 Cue Sheet。
如果你真的需要某一秒一定發生某個音樂點
例如:
廣告第 8 秒一定爆點。
第 23 秒一定停止。
那比較穩定的方法仍然可能是:
先讓 Lyria 生成:
接近需要的音樂。
再進:
真正剪輯軟體
調整。
裁切。
Fade。
對點。
AI 先幫你:
做音樂原料。
剪輯軟體最後:
把秒數鎖準。
不要要求一個工具:
一次完成所有工作。
所以第一次測,不要寫太多段
很容易看到 Lyria 支援:
Genre。
Tempo。
Dynamics。
Instrument。
Vocal。
就開始 Prompt:
第 0~3 秒這樣。
3~7 秒這樣。
7~11 秒又換。
最後寫:
20 行。
不一定比較好。
第一次:
只做三段。
開場。
主體。
收尾。
先看 AI 能不能:
抓到大的能量方向。
如果結果不對,先只改一件事
例如第一版:
主體太平。
不要整段 Prompt 全部重寫。
先改:
「主體要更明顯逐步增加節奏和樂器層次。」
再生成。
第二版:
收尾還是太突然。
再改:
「最後幾秒逐步減少樂器並自然收尾。」
一次只調:
一個問題。
你會比較知道:
到底哪一句 Prompt
真的有影響。
這點很重要,因為目前 Lyria API 仍是 Single-turn
Google 目前的 API 文件明確說明,
Lyria 3.5 音樂生成屬於:
Single-turn Process。
也就是:
現在還不是你生成一首歌後,
可以持續和同一首歌聊天:
「只改 35 秒那裡。」
「其他全部完全不動。」
「鼓小聲一點。」
這種完整 Multi-turn Audio Editing。
如果第一版不合,
通常是:
修改 Prompt,
重新生成一個新版本。
所以 Prompt 一開始有:
清楚結構
會更重要。
而且相同 Prompt 重新生成,也可能不一樣
Google 同樣提醒:
即使 Prompt 相同,
不同生成結果:
也可能有 Variation。
所以你今天如果得到:
一個主體節奏非常剛好的版本,
先保存。
不要想:
「這個 Prompt 已經對了,晚點再生一模一樣的。」
生成式音樂不是:
固定搜尋結果。
這也代表比較好的測試方式是一次比較 2~3 個版本
不要只生成一次,
立刻開始懷疑:
Prompt 寫錯。
同樣的大方向可以:
跑幾個版本。
然後問:
哪一個:
開場最乾淨?
哪一個:
主體最有推進?
哪一個:
結尾最好剪?
你是在:
選 Music Draft。
不是:
要求第一次就得到 Master。
如果影片有旁白,再加一個小提醒
主體可以增加能量,
但不要因此:
搶掉 Voiceover。
Prompt 可以補:
「Keep the arrangement supportive under spoken narration。」
也就是:
配樂提供情緒,
但不要讓主要旋律或樂器:
一直和人聲打架。
特別是:
教學。
訪談。
產品介紹。
旁白才是:
主角。
如果影片沒有旁白,音樂可以承擔更多敘事
例如:
旅行。
料理。
手作。
時尚。
產品美感片。
這種影片音樂可以:
更明顯。
開場:
建立氣氛。
主體:
推進。
高潮:
拉高。
收尾:
釋放。
因為沒有 Voiceover
需要避讓。
所以同樣三段方法,
會依:
影片有沒有 Spoken Content
改變。
今天的方法也適合照片轉音樂
Lyria 可以利用:
圖片
作為生成 Context。
假設你有一張:
夕陽海邊照片。
照片可以先幫 AI 理解:
情緒。
地點。
氛圍。
但你還是可以再加:
「前段安靜,中段逐漸增加溫暖的節奏,最後回到簡單鋼琴收尾。」
照片負責:
Mood。
三段能量線負責:
Movement。
兩個一起用,
比單純說:
「根據這張圖生成音樂」
更可控。
這其實也是所有生成式 AI 很重要的一個方法
很多人下 Prompt,
只描述:
結果長什麼樣。
但真正好用的 Prompt,
常常還會描述:
結果怎麼變化。
例如寫文章:
前面先解釋問題。
中間講方法。
最後給行動。
做影片:
先 Hook。
再示範。
最後 CTA。
做音樂也是:
先建立。
再推進。
最後收束。
AI 並沒有改變:
內容結構的重要性。
只是幫你:
更快把結構變成成品。
今天不要學太多,只記三格
下一次你要用 Lyria 做影片配樂,
先不要寫:
「做一首好聽的歌。」
先拿紙寫:
開場:____
主體:____
收尾:____
例如:
開場:
簡單、安靜。
主體:
逐漸增加節奏。
收尾:
降低能量、乾淨結束。
再把:
Genre。
樂器。
是否人聲。
總長度
補上去。
這已經是一個:
非常完整的第一版 Prompt。
第一次實測,可以只花一分鐘
拿一支:
已經剪好的短影片。
播放一次。
不要聽原配樂。
只問:
第一段:
觀眾剛進來時需要什麼感覺?
中間:
畫面開始動起來時,
音樂要不要增加?
最後:
要怎麼讓觀眾知道:
事情完成了?
把三個答案:
寫進 Prompt。
再交給 Lyria。
你就不是:
請 AI 隨機做一首:
「差不多符合主題的音樂。」
而是在告訴它:
這首音樂在你的內容裡,到底負責什麼工作。
最後記住一句話
影片配樂真正需要配的,
不是:
影片的「主題」。
而是:
影片的「時間」。
同樣是一支:
咖啡影片。
可以溫暖。
可以高級。
可以輕快。
但如果音樂的:
起。
承。
轉。
收
和畫面完全錯開,
再漂亮的曲風也只是一首:
獨立很好聽的歌。
不是:
好配樂。
所以用 Lyria 3.5 時,
先不要急著追求:
最厲害的 Prompt。
先把最簡單的三件事說清楚:
開場怎麼進。
主體怎麼長。
最後怎麼停。
AI 才比較有機會真的:
跟著影片工作。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。