今天你有一支:

60 秒影片。

畫面都剪好了。

接著打開 Lyria 3.5,

輸入:

「幫我做一首 60 秒、溫暖、有質感的 Instrumental。」

AI 真的做出來了。

曲風:

沒問題。

樂器:

也很好聽。

但真正放進影片以後,

你卻發現:

完全不搭。

開場才剛出現產品,

音樂已經很滿。

真正重要的畫面出現時,

音樂反而沒有變化。

影片準備結束了,

歌曲卻像:

還要再唱兩分鐘。

問題不是:

AI 不會作曲。

而是:

你只告訴它:

這首歌長什麼樣。

卻沒有告訴它:

這首歌在影片裡要怎麼走。

今天只學一個方法。

做影片配樂以前,

先把時間線切成:

開場。

主體。

收尾。

再替三段各寫一句:

能量怎麼變。

為什麼這招對 Lyria 3.5 特別有用?

Google DeepMind 的 Lyria Prompt Guide 本來就把:

Dynamics

列為控制音樂的重要元素之一。

Dynamics 可以理解成:

音樂的能量、

強弱、

密度

怎麼隨時間變化。

例如:

先用安靜鋼琴。

慢慢加入節奏。

進入更強的副歌。

最後再安靜下來。

也就是:

不要只描述:

「我要什麼曲風。」

還可以描述:

「音樂中間要怎麼變。」

這剛好非常適合:

影片配樂。

第一步|先不要碰音樂,先看影片

假設你有一支:

60 秒商品影片。

先不要問:

要 Lo-fi?

Jazz?

還是 Acoustic?

只看:

畫面本身。

例如:

0~10 秒:

產品第一次出現。

10~50 秒:

製作過程、細節、使用畫面。

50~60 秒:

完成品、Logo 區域、結尾。

你已經自然得到三段。

開場。

主體。

收尾。

注意:

這不是要你每支影片都一定切:

10/40/10。

真正重點是:

先找影片自己的三個階段。

第二步|只替每一段寫「能量」

不要先寫音樂理論。

先用白話。

開場:

簡單。

主體:

逐漸增加。

收尾:

乾淨收住。

這樣就夠了。

或者另一支影片可能是:

開場:

立刻有力。

主體:

維持節奏。

收尾:

突然停乾淨。

也可以。

你現在做的不是:

作曲。

而是在決定:

觀眾每個階段應該感受到什麼。

第三步|再把音樂特徵補進去

假設是一支:

手作食品影片。

你希望:

溫暖。

自然。

有一點節奏。

不要搶旁白。

就可以先定:

Genre:

Acoustic/Light Folk。

Instrument:

木吉他。

柔和鋼琴。

輕打擊。

Vocal:

不要。

這時才把:

音樂風格

和:

三段能量

接在一起。

Prompt 就會從一句模糊要求

原本:

「做一首 60 秒溫暖的背景音樂。」

變成:

「為一支約 60 秒的手作食品影片創作 Instrumental Background Music。整體溫暖、自然,以木吉他、柔和鋼琴和輕打擊樂為主。開場保持簡單、樂器少;主體逐漸加入節奏和音樂層次;接近結尾時逐步降低能量,最後乾淨自然收住。不要人聲,不要太戲劇化。」

這個 Prompt 沒有:

專業和弦。

複雜樂理。

Mixing 術語。

但它已經比:

「幫我做一首好聽的音樂」

有用很多。

為什麼?

因為它回答了兩個不同問題。

第一個:

音樂是什麼風格?

第二個:

音樂怎麼陪著畫面移動?

真正的影片配樂,

第二個往往比第一個更重要。

開場的工作不是「先把最好聽的地方全部丟出來」

很多 AI 生成音樂一開始就:

很滿。

鼓。

Bass。

Pad。

旋律。

全部一起來。

單獨聽可能很好。

但放到影片裡,

會發生一個問題。

畫面:

還沒有建立。

產品:

才剛出現。

音樂卻已經:

100 分。

後面就沒有地方可以成長。

所以如果影片需要:

逐漸建立情緒,

Prompt 可以明確寫:

Opening should be sparse and restrained.

白話就是:

開場:

樂器少一點。

節奏少一點。

留空間。

尤其影片前面有旁白時更重要

假設第一句旁白是:

「你每天是不是花很多時間整理同一份資料?」

如果音樂一開始:

鼓很大。

旋律很滿。

Vocal 又在唱,

觀眾耳朵要同時處理:

旁白。

音樂。

畫面。

字幕。

結果反而:

更累。

所以開場可以要求:

簡單。

不要人聲。

降低 Instrument Density。

把位置留給:

內容。

主體才開始增加

當影片進入:

真正示範。

工作過程。

產品細節。

前後對照。

音樂才開始:

增加節奏。

增加 Layer。

稍微提升 Energy。

這會讓觀眾產生:

事情正在往前走。

的感覺。

這就是 Dynamics 真正實用的地方。

不是:

讓音樂變華麗。

而是:

替影片建立:

進度感。

例如一支咖啡影片

前 8 秒:

店門。

咖啡豆。

杯子。

可以:

安靜。

8~45 秒:

磨豆。

沖水。

蒸氣。

倒奶。

拉花。

這時:

Rhythm Gradually Builds。

45~60 秒:

完成。

端上桌。

最後定格。

音樂:

開始減少。

最後:

Clean Ending。

這樣即使沒有任何歌詞,

觀眾也會感覺到:

故事:

開始。

進行。

完成。

第三段「收尾」特別容易被忘記

很多人做 AI 配樂,

只告訴 AI:

前面想要什麼。

中間想要什麼。

但沒有說:

最後怎麼停。

結果影片已經:

準備 End Card。

音樂卻:

還在增加。

或者:

突然被剪斷。

這會讓整支影片出現一種:

「不是結束,只是檔案沒了」

的感覺。

所以 Prompt 最後加一句:

最後自然收住。

最後降低能量。

最後留下乾淨 Ending。

非常有用。

如果你做的是 15 秒廣告,三段一樣存在

不要因為影片很短,

就覺得:

沒有結構。

例如:

前 3 秒:

Hook。

3~12 秒:

產品。

12~15 秒:

CTA。

可以寫成:

開場:

立刻有節奏。

主體:

保持推進。

結尾:

快速收束,

留一個明確結束點。

三段不需要:

一樣長。

只需要:

功能不同。

如果是 3 分鐘影片呢?

一樣。

例如:

0~20 秒:

開場。

20 秒~2 分 30 秒:

主體。

最後 30 秒:

收尾。

或者主體裡,

你還可以再描述:

先平。

再漸強。

再降下來。

Google DeepMind 本來就鼓勵使用者在 Prompt 裡描述:

音樂不同 Section

如何改變 Dynamics。

所以如果你會做:

更長內容,

還可以再細分。

但今天不用學那麼多。

先把:

三段

做好。

一個很重要的限制:不要把秒數當成剪輯軟體的絕對指令

這一點一定要分清楚。

Lyria 3.5 可以透過 Prompt:

影響曲目長度。

Google API 文件也明確表示:

完整模型生成的是數分鐘歌曲,

實際長度會受到 Prompt 影響。

但這不代表:

你寫:

「第 10.000 秒一定進鼓。」

它就像 DAW Automation 一樣:

精確到那一格。

Lyria 是:

生成模型。

不是:

時間軸剪輯軟體。

所以今天的方法叫:

能量線。

不是:

精密 Cue Sheet。

如果你真的需要某一秒一定發生某個音樂點

例如:

廣告第 8 秒一定爆點。

第 23 秒一定停止。

那比較穩定的方法仍然可能是:

先讓 Lyria 生成:

接近需要的音樂。

再進:

真正剪輯軟體

調整。

裁切。

Fade。

對點。

AI 先幫你:

做音樂原料。

剪輯軟體最後:

把秒數鎖準。

不要要求一個工具:

一次完成所有工作。

所以第一次測,不要寫太多段

很容易看到 Lyria 支援:

Genre。

Tempo。

Dynamics。

Instrument。

Vocal。

就開始 Prompt:

第 0~3 秒這樣。

3~7 秒這樣。

7~11 秒又換。

最後寫:

20 行。

不一定比較好。

第一次:

只做三段。

開場。

主體。

收尾。

先看 AI 能不能:

抓到大的能量方向。

如果結果不對,先只改一件事

例如第一版:

主體太平。

不要整段 Prompt 全部重寫。

先改:

「主體要更明顯逐步增加節奏和樂器層次。」

再生成。

第二版:

收尾還是太突然。

再改:

「最後幾秒逐步減少樂器並自然收尾。」

一次只調:

一個問題。

你會比較知道:

到底哪一句 Prompt

真的有影響。

這點很重要,因為目前 Lyria API 仍是 Single-turn

Google 目前的 API 文件明確說明,

Lyria 3.5 音樂生成屬於:

Single-turn Process。

也就是:

現在還不是你生成一首歌後,

可以持續和同一首歌聊天:

「只改 35 秒那裡。」

「其他全部完全不動。」

「鼓小聲一點。」

這種完整 Multi-turn Audio Editing。

如果第一版不合,

通常是:

修改 Prompt,

重新生成一個新版本。

所以 Prompt 一開始有:

清楚結構

會更重要。

而且相同 Prompt 重新生成,也可能不一樣

Google 同樣提醒:

即使 Prompt 相同,

不同生成結果:

也可能有 Variation。

所以你今天如果得到:

一個主體節奏非常剛好的版本,

先保存。

不要想:

「這個 Prompt 已經對了,晚點再生一模一樣的。」

生成式音樂不是:

固定搜尋結果。

這也代表比較好的測試方式是一次比較 2~3 個版本

不要只生成一次,

立刻開始懷疑:

Prompt 寫錯。

同樣的大方向可以:

跑幾個版本。

然後問:

哪一個:

開場最乾淨?

哪一個:

主體最有推進?

哪一個:

結尾最好剪?

你是在:

選 Music Draft。

不是:

要求第一次就得到 Master。

如果影片有旁白,再加一個小提醒

主體可以增加能量,

但不要因此:

搶掉 Voiceover。

Prompt 可以補:

「Keep the arrangement supportive under spoken narration。」

也就是:

配樂提供情緒,

但不要讓主要旋律或樂器:

一直和人聲打架。

特別是:

教學。

訪談。

產品介紹。

旁白才是:

主角。

如果影片沒有旁白,音樂可以承擔更多敘事

例如:

旅行。

料理。

手作。

時尚。

產品美感片。

這種影片音樂可以:

更明顯。

開場:

建立氣氛。

主體:

推進。

高潮:

拉高。

收尾:

釋放。

因為沒有 Voiceover

需要避讓。

所以同樣三段方法,

會依:

影片有沒有 Spoken Content

改變。

今天的方法也適合照片轉音樂

Lyria 可以利用:

圖片

作為生成 Context。

假設你有一張:

夕陽海邊照片。

照片可以先幫 AI 理解:

情緒。

地點。

氛圍。

但你還是可以再加:

「前段安靜,中段逐漸增加溫暖的節奏,最後回到簡單鋼琴收尾。」

照片負責:

Mood。

三段能量線負責:

Movement。

兩個一起用,

比單純說:

「根據這張圖生成音樂」

更可控。

這其實也是所有生成式 AI 很重要的一個方法

很多人下 Prompt,

只描述:

結果長什麼樣。

但真正好用的 Prompt,

常常還會描述:

結果怎麼變化。

例如寫文章:

前面先解釋問題。

中間講方法。

最後給行動。

做影片:

先 Hook。

再示範。

最後 CTA。

做音樂也是:

先建立。

再推進。

最後收束。

AI 並沒有改變:

內容結構的重要性。

只是幫你:

更快把結構變成成品。

今天不要學太多,只記三格

下一次你要用 Lyria 做影片配樂,

先不要寫:

「做一首好聽的歌。」

先拿紙寫:

開場:____

主體:____

收尾:____

例如:

開場:

簡單、安靜。

主體:

逐漸增加節奏。

收尾:

降低能量、乾淨結束。

再把:

Genre。

樂器。

是否人聲。

總長度

補上去。

這已經是一個:

非常完整的第一版 Prompt。

第一次實測,可以只花一分鐘

拿一支:

已經剪好的短影片。

播放一次。

不要聽原配樂。

只問:

第一段:

觀眾剛進來時需要什麼感覺?

中間:

畫面開始動起來時,

音樂要不要增加?

最後:

要怎麼讓觀眾知道:

事情完成了?

把三個答案:

寫進 Prompt。

再交給 Lyria。

你就不是:

請 AI 隨機做一首:

「差不多符合主題的音樂。」

而是在告訴它:

這首音樂在你的內容裡,到底負責什麼工作。

最後記住一句話

影片配樂真正需要配的,

不是:

影片的「主題」。

而是:

影片的「時間」。

同樣是一支:

咖啡影片。

可以溫暖。

可以高級。

可以輕快。

但如果音樂的:

起。

承。

轉。

和畫面完全錯開,

再漂亮的曲風也只是一首:

獨立很好聽的歌。

不是:

好配樂。

所以用 Lyria 3.5 時,

先不要急著追求:

最厲害的 Prompt。

先把最簡單的三件事說清楚:

開場怎麼進。

主體怎麼長。

最後怎麼停。

AI 才比較有機會真的:

跟著影片工作。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

今日 AI 工具|2026/07/21:Google Vids,把文件與簡報變成影片初稿,適合教學、提案與工作說明

AI 幾秒鐘就能模仿一種風格,但創作者可能花了十年才走到這裡