「这是一个 SasaDaily 假设商业案例。」

一家只有 4 个人的手作食品品牌,

每星期固定要做:

新品 Reels。

制作过程短片。

节庆商品视频。

客人开箱素材。

真正最麻烦的工作,

有时候不是:

拍。

也不是:

剪。

而是视频做到最后,

有人突然说:

「音乐呢?」

接着一个人开始:

翻音乐库。

试这首。

换那首。

裁成 45 秒。

发现高潮太早。

再换。

结果原本 30 分钟能完成的视频,

最后又多花:

20~30 分钟

只是在找:

一首「差不多适合」的背景音乐。

这就是这家公司想先改善的地方。

它没有先想「AI 能不能帮我们写歌」

团队先问的是:

「哪一段工作一直重复?」

答案很明确:

每支视频都要重新:

找音乐。

试音乐。

裁音乐。

确认节奏合不合。

所以 Lyria 3.5 在这家公司里,

不是:

作曲家。

也不是:

品牌总监。

它比较像:

Music Draft Generator。

配乐第一版产生器。

第一步|品牌先自己决定「我们听起来像什么」

团队没有一打开 Gemini 就说:

「帮我做一首好听的歌。」

而是先写一张:

Brand Music Card。

只放几个原则。

例如:

整体:

温暖。

自然。

有手作感。

常用:

木吉他。

柔和钢琴。

轻打击。

一般商品视频:

优先 Instrumental。

避免:

过度戏剧化。

避免:

太强烈 EDM。

不模仿:

特定歌手或乐团。

这一步很重要。

因为如果每支视频都让 AI:

自己决定品牌声音,

今天可能是:

Jazz。

明天变:

Heavy Rock。

后天又变:

Synthwave。

每一支都可能:

单独很好听,

但放在一起完全不像:

同一个品牌。

AI 可以生成很多方向,但品牌一致性仍然要由人决定

Google DeepMind 的 Lyria 3.5

可以控制:

Genre。

Tempo。

Instruments。

Dynamics。

Vocal Style。

甚至可以根据:

图片

生成符合气氛的音乐。

能力愈多,

反而愈需要:

先缩小范围。

这家公司不是问:

「Lyria 会什么?」

而是问:

「我们允许它在哪个范围里变化?」

这就是品牌使用 AI

和一般玩 AI

最大的差别之一。

第二步|每支视频先把时间线切成三段

例如今天要做一支:

60 秒新品视频。

画面已经完成。

0~10 秒:

产品第一次出现。

10~50 秒:

制作。

细节。

切开。

包装。

50~60 秒:

成品。

购买信息画面。

团队不需要:

懂作曲。

只要先决定:

三段能量。

开场:简单。

主体:逐渐增加。

收尾:干净降低。

这就是今天一分钟教学的:

三段能量线。

第三步|把商品照片也当成 Music Brief

Lyria 3.5 可以接受:

图片

作为生成 Context。

所以团队已经拍完:

新品照片,

不用另外从零描述:

「这个产品看起来是什么感觉。」

可以直接用:

代表性 Product Photo

当一部分参考。

再补文字:

温暖。

手作。

自然。

Instrumental。

约 60 秒。

木吉他。

轻钢琴。

开场简单。

主体增加节奏。

最后自然收尾。

照片提供:

Mood。

文字提供:

Direction。

时间线提供:

Movement。

这比单纯说「帮我的商品做音乐」清楚很多

因为「食品视频」本身可以有:

非常多种音乐。

高级 Fine Dining。

可爱甜点。

街头美食。

家庭料理。

健康食品。

节庆礼盒。

全部都可能:

完全不同。

AI 不知道:

你品牌到底是哪一种。

所以最好的做法不是:

期待 AI 猜对。

而是:

先把品牌选择告诉它。

第四步|一次做 2~3 个 Draft,不要求第一首就是 Final

Lyria 的生成结果本身具有:

Variation。

即使 Prompt 相同,

每次也不一定完全一样。

这家公司因此不把流程设计成:

Generate。

直接使用。

而是:

Generate A。

Generate B。

Generate C。

然后只问:

哪一首:

最符合视频?

选曲时也不先问「哪一首最好听」

因为:

最好听

和:

最适合这支视频

不是一回事。

例如 A:

单独听很漂亮。

但开场音乐太满。

B:

旋律比较简单,

却刚好不会压住:

商品声音。

旁白。

字幕。

这家公司选:

B。

因为音乐在这里的工作是:

服务内容。

不是抢走内容。

第五步|视频有旁白时,音乐更退后

例如品牌老板在视频里说:

「这批果酱用了三种当季水果。」

这时音乐就不需要:

很复杂。

团队在 Prompt 加:

Instrumental。

Supportive under spoken narration。

不要:

抢 Voiceover。

如果视频完全没有旁白,

只是:

制作画面。

食物特写。

切割。

包装。

那音乐就可以:

承担更多情绪。

同样是 Lyria,

角色不一样。

第六步|Lyria 做 Draft,剪辑软件才负责精确对秒

这家公司不要求 Lyria:

第 7.3 秒一定进鼓。

第 31.8 秒一定换段。

第 58 秒准时最后一下。

因为生成音乐不是:

DAW Automation。

团队只要求:

大的能量方向正确。

例如:

开场低。

中间增加。

最后收掉。

真的需要:

商品切开瞬间

刚好对 Beat,

最后还是回到:

剪辑软件。

裁。

移。

Fade。

对点。

这样比较实际。

AI 负责先把「素材」做出来,人负责最后的 Editing Decision

这也是这个工作流很重要的边界。

Lyria 不是:

一键完成整个 Content Production。

它只是让团队不用每一次都:

从巨大的音乐库

开始找。

以前:

视频

找现成音乐

一直试

裁长度

勉强配合。

现在:

视频

先定能量线

Lyria 产生 Draft

选最适合版本

剪辑软件精确对点。

工作顺序变了。

第七步|正式品牌 Jingle 不直接沿用一般 Reel 流程

某一天老板突然觉得:

其中一个 Lyria Draft 很好听。

就说:

「那这首以后当我们品牌主题曲。」

团队不会:

直接答应。

因为:

一般社区 Background Music

和:

正式 Brand Asset

不是同一个风险等级。

正式品牌音乐可能会:

用很多年。

投广告。

做活动。

跨平台。

甚至希望:

具有排他性。

这时就需要:

另外处理。

SynthID 也不能替公司完成这个判断

Google 会替 Lyria 生成音频加入:

SynthID。

它可以协助辨识:

内容是否由 Google AI

生成或编辑。

但就像今天快问快答谈的:

SynthID 主要处理:

来源。

不是:

著作权证书。

也不是:

无限制商用许可证。

所以团队把音乐用途分成两种。

第一类|日常 Content Draft

例如:

一般商品 Reel。

内部提案。

未公开 Prototype。

这类工作主要目标是:

快。

方向对。

降低找音乐时间。

第二类|正式 Brand Asset

例如:

品牌 Jingle。

大额广告。

长期 Opening Music。

商业发行。

大型 Campaign。

这时就多做:

Rights Review。

保存:

Prompt。

版本。

人工修改。

原始素材。

自己的 Lyrics。

自己录制的声音。

编曲变更。

Project File。

必要时再做:

专业法律与音乐权利确认。

公司不是因为害怕著作权,就完全不用 AI Music

那又走到另一个极端。

真正成熟的做法是:

让使用强度决定审核强度。

一支:

只用几天的社区草稿。

和一首:

要使用十年的品牌主题曲,

本来就不需要:

完全相同的流程。

AI 让产生音乐变得很快。

公司真正要补的是:

用途分级。

第八步|不要 Prompt「做成某个歌手的风格」

团队的 Brand Music Card

甚至直接写:

不使用特定 Artist 作为 Prompt。

因为 Google 的 Lyria Safety Filter

本来就会处理:

特定 Artist Voice。

受著作权保护 Lyrics

等部分请求。

更好的方法是:

不要写:

「像某某歌手。」

而是直接描述:

慢速。

温暖。

Acoustic。

柔和 Female Vocal。

干净 Guitar。

轻 Percussion。

这样得到的是:

你需要的:

Music Characteristics。

不是:

模仿某个人的身份。

第九步|每个月留下「表现最好的三种音乐方向」

这家公司没有让 Lyria:

每天完全重新猜。

例如一个月后,

团队发现:

三种风格最常用。

A:

木吉他+钢琴。

适合新品。

B:

Light Funk+Bass。

适合制作过程。

C:

柔和 Ambient。

适合品牌故事。

那下个月开始,

就不用再从:

全世界所有 Genre

重新探索。

直接从:

A/B/C

开始。

AI 工作流会愈做:

愈快。

这才叫把 AI 变成 Workflow,而不是每天重新聊天

如果每次都:

重新想 Prompt。

重新试曲风。

重新讨论品牌感。

Lyria 虽然很快,

团队仍然会浪费时间。

真正成熟以后,

公司应该累积:

Brand Music Card。

常用 Prompt。

适合不同视频的 Energy Template。

被选中的 Version。

这些东西会慢慢变成:

公司的:

AI Creative SOP。

用一组假设数字算看看

「SasaDaily 假设数字。」

假设这家公司:

每周制作:

5 支短影音。

一个月用:

4 周

计算。

就是:

20 支视频。

以前每一支视频在:

找音乐。

试音乐。

裁长度

上面,

平均花:

25 分钟。

20 × 25 分钟。

等于:

500 分钟。

也就是:

约 8.3 小时。

改用 Lyria 3.5 之后

「SasaDaily 假设数字。」

假设团队已经创建:

Brand Music Card。

三种常用音乐方向。

三段 Energy Template。

每支视频平均:

8 分钟

就可以完成:

产生 Draft。

比较。

选定。

20 × 8 分钟:

160 分钟。

约:

2.7 小时。

一个月理论差额:

约:

5.7 小时。

换成内部时间成本

「SasaDaily 假设数字。」

假设负责内容的人,

内部时间成本:

每小时新台币 650 元。

5.7 小时 × 650 元。

约:

新台币 3,700 元。

但这不是:

「导入 Lyria 每月直接多赚 3,700 元。」

真正发生的是:

大约 5.7 小时

可以重新使用。

例如:

多拍一支视频。

做商品页。

回客户。

改善包装。

分析 Content Performance。

这才叫:

Time Value。

这家公司不追「一个月生成几首歌」

那是:

工具使用量。

不是:

商业成果。

真正应该追的是:

第一:

平均每支视频找配乐花多久?

如果没有下降,

AI 没有省到时间。

第二:

生成后真正被采用的比例。

如果生成 10 首只用 1 首,

Prompt 或 Brand Music Card

可能有问题。

第三:

每支视频修改音乐的次数。

如果一直重做,

表示 Energy Direction

没有先说清楚。

第四:

品牌一致性。

连续看 10 支视频,

会不会像:

10 家不同公司?

第五:

正式 Brand Asset 有没有另外做 Rights Review?

不要让:

日常快速流程

偷偷变成:

高风险正式使用。

甚至不用一开始计算流量有没有增加

因为这个 Workflow

第一阶段解决的问题不是:

保证:

观看数增加。

它解决的是:

制作成本。

如果以前:

一天只能完成两支。

现在同样时间:

可以完成三支,

这已经是:

Operational Improvement。

至于哪一种音乐真的让:

观看时间。

完成率。

转换

更好,

那是:

下一阶段测试。

不要把两个问题混在一起。

AI 配乐甚至可以变成 A/B Creative Variable

例如同一支商品视频,

画面完全相同。

只改:

Music Mood。

A:

温暖 Acoustic。

B:

比较有节奏的 Light Funk。

分别测:

观看完成率。

停留。

分享。

这时 AI Music

不只帮你省:

制作时间。

还可以让原本制作成本太高的:

Creative Test

变得比较容易。

但还是要注意:

一次最好只改:

一个变量。

不然画面。

文字。

音乐。

CTA

全部一起变,

最后根本不知道:

哪一个造成差异。

对一人公司也是一样

没有 4 人团队也没关系。

假设你自己:

拍。

剪。

发。

Lyria 反而更实际。

因为对一人公司来说,

最大的成本常常不是:

软件月费。

而是:

自己的时间。

一支视频找配乐省:

15 分钟。

看起来很少。

一个月 20 支,

就是:

5 小时。

这就是 AI Tool

最容易被忽略的价值。

不是:

一次替你做掉一个超大项目。

而是:

每天少掉一小段:

重复工作。

但不要因为生成变快,就制造更多没人需要的内容

AI 最大的另一个陷阱是:

Production Cost 下降后,

大家开始:

一直生。

以前一星期做:

5 支。

现在觉得 AI 很快,

就硬做:

25 支。

最后:

没有策略。

没有人看。

团队反而更累。

所以这家公司仍然先决定:

本周需要:

哪些 Content。

Lyria 只是:

降低其中的 Music Production Cost。

不是:

替公司决定:

应该发多少内容。

真正的 ROI 不是「AI 生得比人快」

而是:

原本不值得花大量时间做的工作,

现在能不能:

用更低成本完成。

小品牌通常没有:

Music Supervisor。

专职 Composer。

Audio Editor。

但又需要:

一直做社区视频。

Lyria 3.5 刚好填的是:

Professional Music Production 和「随便找一首免费音乐」中间那一段。

先做出:

符合这次任务的 Draft。

让人再挑。

那专业音乐人是不是就没有生意了?

这个案例反而不是这样。

如果品牌未来真的要:

做大型 Campaign。

创建 Sonic Branding。

制作正式 Jingle。

录真正人声。

做长期 Music Identity。

这家公司反而可能:

更清楚自己要什么。

因为前面已经用 AI:

快速测过:

很多方向。

最后交给专业音乐人时,

可以直接说:

我们发现:

这种节奏。

这种乐器。

这种 Energy Curve

最符合品牌。

AI 把:

探索成本

降低。

专业工作集中在:

真正值得花钱的地方。

这就是这间 4 人公司的完整流程

每周内容计划

拍摄视频

剪出大致长度

选一张代表照片

套 Brand Music Card

写:

开场/主体/收尾

能量线

Lyria 3.5

产生 2~3 个 Draft

人选:

最符合品牌与视频的一版

剪辑软件精确对 Beat

完整播放一次

一般社区素材:

依当下使用规则发布

正式广告/Jingle/长期品牌音乐:

另外 Rights Review

保存:

Prompt、Version、人工修改纪录

AI 没有接管品牌

真正被 AI 接手的只有:

「先帮我做几个可以试的音乐版本。」

品牌仍然决定:

我们是谁。

听起来应该像什么。

这支视频需要什么情绪。

哪一首才适合。

什么东西可以正式对外。

哪一种用途需要更完整权利确认。

这种分工,

比:

「AI 帮我全部做完」

更容易长期使用。

Lyria 3.5 对小型品牌最大的价值不是「省掉音乐人」

而是:

很多日常短影音,

原本根本不值得:

每一支都请专业 Composer。

所以团队只剩:

音乐库

和:

随便挑

两种选择。

现在多了一个中间选项:

先让 AI 做符合任务的 Music Draft。

高频。

低风险。

需要快速。

的内容,

AI 先做。

真正高价值、

要长期使用、

涉及品牌资产

的音乐,

再把:

更多人类创作、

专业制作、

权利确认

加进去。

这就是 AI 工作流程真正成熟的样子

不是:

所有工作都交 AI。

而是:

先把一件工作拆开。

这家公司真正拆成:

品牌方向:

人。

视频需求:

人。

第一版配乐:

AI。

音乐选择:

人。

精确剪辑:

人+工具。

权利判断:

人。

最后发布:

人批准。

AI 只进到:

最适合它的那一步。

最后看一次这个案例真正省掉什么

不是:

「从今天开始不需要音乐。」

而是:

以前每支视频都要重新:

从几千首现成音乐里

找一首差不多的。

现在先说:

视频多长。

什么情绪。

什么品牌声音。

开场怎么进。

中间怎么长。

最后怎么停。

AI 直接做:

几个可比较版本。

人把时间留给:

真正需要判断的地方。

这就是:

AI 把时间还给人。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

今日 AI 工具|2026/07/21:Google Vids,把文档与演示文稿变成视频初稿,适合教学、提案与工作说明

AI 几秒钟就能模仿一种风格,但创作者可能花了十年才走到这里