做一支 60 秒短影音,
画面可能半小时就剪好了。
结果最后卡住的却是:
背景音乐。
免费音乐库翻了半天。
喜欢的歌不一定能商用。
适合情绪的曲子,
长度又不对。
自己不会作曲,
找音乐人又不一定适合每一支小视频。
Google 现在把:
Lyria 3.5
直接放进 Gemini。
这让「替一个具体内容做一首刚好合用的音乐」,
开始变成一般人也能直接测试的工作。
Lyria 3.5 是什么?
Lyria 是 Google DeepMind 的:
AI 音乐生成模型。
你不是请它:
分析一首歌。
而是直接描述:
你想要什么音乐。
例如:
「做一首 60 秒的轻快 Instrumental,温暖、自然、有手作感,以木吉他和轻打击乐为主,前 10 秒简单,后面逐渐增加节奏。」
Lyria 会真的:
产生一段音乐。
新版:
Lyria 3.5
把这件事情做得更完整。
Google 9 月 4 日宣布,
Lyria 3.5 现在已经进入:
Gemini App。
Gemini API。
Google Flow Music。
甚至:
Google Vids。
这次更新最直接的变化:你可以选「我要哪一种歌」
在 Gemini 里,
现在可以直接指定:
Genre。
曲风。
例如:
Lo-fi。
Pop。
Jazz。
Funk。
Electronic。
Acoustic。
也可以指定:
Vocal。
有人唱。
或者:
Instrumental。
纯音乐。
还能使用范本,
快速从:
背景音乐。
生日曲。
品牌 Jingle。
其他常见用途
开始。
对没有音乐制作背景的人来说,
这比:
要你自己描述一堆音乐理论
容易很多。
第二个真正实用的新能力:长度可以跟着工作决定
以前 AI Music 很常出现一个问题。
你要做:
45 秒视频。
AI 给你:
30 秒。
或者:
生成一首完整歌,
但真正能用的只有中间一小段。
Lyria 3.5 已经可以让你在 Prompt 里:
控制曲目长度。
Google DeepMind 目前展示的 Lyria 3.5,
最长可以做到:
约 3 分钟。
所以你可以按照真正的用途设计。
例如:
15~30 秒:
品牌片头。
60 秒:
Reels/Shorts 配乐。
90 秒:
产品介绍。
2~3 分钟:
完整教学片、活动视频或歌曲。
这件事情对内容创作者非常实际。
因为你不是:
先做一首歌,
再想怎么硬塞进视频。
而可以反过来:
先知道视频需要多久,再叫 AI 做差不多长的音乐。
第三个有趣功能:照片也可以变成音乐提示
Lyria 不只理解:
文字。
你也可以上传:
照片。
Gemini Help 甚至说明,
在 Gemini 里还可以使用:
照片或视频
提供 Context。
例如你有一张:
夕阳海边的照片。
你可以要求:
「根据这张照片的气氛,做一首 70 秒纯音乐。前半段安静,以木吉他和柔和 Pad 为主;最后 20 秒逐渐明亮,但不要变成激昂广告歌。」
这和:
单纯输入「做一首舒服的音乐」
差很多。
因为:
你的视觉素材
本身开始成为:
Music Brief。
这对做短影音的人特别方便
假设你已经剪好一支:
咖啡店 Reels。
有:
磨豆。
冲煮。
蒸气。
端杯。
客人坐下来。
以前接下来要去:
搜索音乐。
现在可以把:
代表性的画面
交给 Lyria,
再告诉它:
这支视频:
45 秒。
不要 Vocal。
前面安静。
20 秒开始增加节奏。
结尾留一个干净收尾。
等于:
让音乐配合视频。
不是:
让视频被迫配合现成音乐。
它甚至可以生成完整 Vocal
Lyria 3.5 不只是:
Background Music Generator。
Google 表示新版提升了:
Vocal Quality。
Lyrics。
Musical Arrangement。
也可以生成具有:
Verse。
Chorus。
Bridge
结构的完整歌曲。
如果你真的要做:
品牌歌曲。
活动歌曲。
生日歌。
内容企划中的完整 Music Track,
就可以进一步指定:
男声或女声。
音域。
声音质感。
乐器。
Tempo。
Dynamics。
歌词主题。
但对一般小公司,我反而建议先从 Instrumental 开始
原因很简单。
如果只是:
产品视频。
教学视频。
Podcast 开头。
活动回顾。
店内品牌短片。
你真正需要的是:
音乐帮画面加情绪。
不是:
让观众开始听歌词。
Instrumental 通常比较容易:
和旁白共存。
不抢字幕。
不会因歌词意思和品牌内容冲突。
也比较容易快速判断:
能不能用。
所以第一次测,
不用一开始就叫 AI:
替公司写一首完整品牌主题曲。
先做:
30~60 秒 Instrumental。
比较实际。
Prompt 不需要很专业,但至少写五件事
Google DeepMind 的 Prompt Guide 建议,
你可以从:
Genre。
Tempo。
Instruments。
Dynamics。
Vocals
这些元素控制结果。
如果是一般人,
可以再简化成五个问题。
第一:拿来做什么?
例如:
60 秒手作商品视频。
第二:什么情绪?
温暖。
安静。
高级。
活泼。
怀旧。
第三:要不要人声?
Vocal。
或 Instrumental。
第四:想听到什么乐器?
木吉他。
钢琴。
弦乐。
电子鼓。
Bass。
第五:多长?
例如:
60 秒。
一个实际 Prompt 可以长这样
例如你要做:
陶艺工作室商品视频。
可以说:
「为一支 60 秒的手作陶器品牌视频创作 Instrumental Background Music。温暖、自然、安静但不要悲伤,以木吉他、柔和钢琴和非常轻的打击乐为主。前 10 秒保持简单,20 秒后增加一些节奏,最后 5 秒自然收尾。不要人声,不要太戏剧化。」
就已经足够开始。
第一次结果不喜欢,
再改:
Tempo。
乐器。
情绪。
节奏密度。
不过这里有一个很重要的限制:API 目前不是对话式修歌工具
Google 的 Gemini API 文档目前明确写:
Lyria 3.5 的 Music Generation:
仍然是:
Single-turn。
也就是:
生成一次。
结果不喜欢,
再做一次新的生成。
目前不是那种:
「把刚才第 35 秒的鼓拿掉。」
「其他全部保留,只把最后 Chorus 改柔和。」
然后对同一份音频连续精修的:
Multi-turn Editing。
所以不要把它想成:
完整 DAW。
或者:
专业音乐后制软件。
它比较像:
AI 帮你快速生出 Music Draft。
同一个 Prompt 再跑一次,也不一定得到完全同一首
Google 也提醒:
结果具有:
Variation。
即使使用相同 Prompt,
不同生成也可能:
不同。
这其实有好有坏。
好处是:
你可以很快试很多方向。
问题是:
如果某一个版本真的很喜欢,
不要以为:
「等一下再生成一次就好了。」
直接把:
喜欢的版本
保存下来。
Gemini 里完成后可以直接下载
Google Gemini Help 目前说明,
生成完成后可以:
下载。
分享。
发布到社区。
其中可以下载:
MP3 音频。
或者:
带有封面图的 MP4。
所以如果你只是需要:
剪视频用的音乐,
拿:
MP3
会最直接。
再放进:
你原本使用的剪辑软件。
Google Vids 也已经接上 Lyria 3.5
这和昨天 SasaDaily 做的 Google Vids 系列刚好接得起来。
昨天我们谈的是:
把 Docs、PDF、Word
变成:
Summary Video。
视频有了。
现在 Lyria 3.5 又进:
Google Vids。
代表 Google 正逐渐把:
文档。
脚本。
旁白。
画面。
音乐
全部串进:
同一套内容制作流程。
以前每一项可能要:
不同工具。
现在 AI 正在把制作链:
慢慢接起来。
对一人公司来说,最实际的使用情境反而很普通
例如你每星期要做:
3 支 Reels。
以前每一支都要:
找背景音乐。
听。
比。
确认长度。
再剪。
如果 Lyria 可以:
先根据你的视频主题
产生三种:
60 秒 Instrumental,
你只需要:
选。
这就是很典型的:
AI 把时间还给人。
它没有替你决定:
品牌应该长什么样。
只是把:
反复找素材
的时间缩短。
第二个使用情境:Podcast 或 YouTube 固定片头
很多小型内容品牌一直没有:
自己的 Opening Music。
因为觉得:
又不是大型媒体,
何必特别找人制作?
Lyria 3.5 可以先让你测:
10 秒。
15 秒。
30 秒。
做出:
一段固定 Opening。
如果之后品牌真的变大,
再决定:
要不要由专业音乐人重新制作。
AI 最适合的角色是:
先让你从「没有」走到第一版。
第三个使用情境:活动与演示文稿
例如:
公司尾牙。
学校成果视频。
婚礼回顾。
产品发表。
社区活动。
照片都已经有了。
视频也剪好了。
但音乐一直:
不太对。
你甚至可以直接把:
活动主视觉
交给 Lyria,
要求它:
根据颜色、
气氛、
内容
生成一段:
符合活动感觉的音乐。
这种:
Image → Music
会是很有趣的新工作方式。
第四个使用情境:先做 Jingle Prototype
如果你是一家:
小店。
电商品牌。
YouTube Channel。
Podcast。
想要一段:
每次出现就让人想到你的声音,
可以先用 Lyria 做:
Prototype。
例如:
5 秒音乐开场。
15 秒品牌段落。
30 秒完整版本。
先测:
哪个方向比较像你的品牌。
但这里一定要再加一句:
Prototype 好用,不等于商标与音乐权利问题全部自动解决。
如果要长期作为:
正式品牌资产。
大规模广告。
商业授权。
仍然值得再确认:
平台当时适用的 Terms。
以及:
你所在地的著作权与商标使用规则。
不要直接要求「做得像某位歌手」
这一点 Google 自己已经做限制。
Gemini API 文档目前说明,
Safety Filter 会拦截:
要求特定 Artist Voice
以及:
生成受著作权保护 Lyrics
等请求。
这个方向很合理。
你真正应该描述的是:
音乐特征。
不要只说:
「帮我做成某某歌手。」
改成:
「低沉男声、Soulful、节奏缓慢、干净木吉他、温暖模拟音色。」
这反而更能让你创建:
自己的声音方向。
这也是 AI 音乐最值得学的一件事
不要 Prompt:
「像谁?」
开始 Prompt:
「我要什么特征?」
Genre 是什么?
Tempo 多快?
情绪怎么变?
哪些 Instruments?
Vocal 怎么唱?
哪一段要安静?
哪一段要增加能量?
这种写法不只比较安全。
也让你真正开始:
掌握自己的 Creative Direction。
Google 也替生成音乐加入 SynthID
Google DeepMind 表示,
Lyria 生成的音乐都会加入:
SynthID。
这是一种:
人耳听不出来的 Digital Watermark。
用途是:
协助辨识内容是否由 AI 生成或编辑。
所以下载的音乐不是:
「完全没有任何 AI 标记。」
而是在音频里包含:
不可感知的 SynthID。
这是现在 Google AI 生成媒体整体的:
Provenance
方向之一。
那是不是有 SynthID 就代表所有版权问题都解决?
不是。
SynthID 回答的是:
这是不是 AI 生成内容?
它没有自动回答:
你是否可以在任何国家、
任何平台、
任何商业情境
无限制使用。
这两件事要分开。
AI Watermark:
是来源识别。
Commercial Rights:
是使用权利。
不要混成同一件事。
也不要因为 AI 生成,就完全不听成品
一首音乐不像:
一段文字。
你不能只扫两眼。
真正要检查的是:
整首播一次。
尤其是:
Vocal。
Lyrics。
结尾。
有没有奇怪声音。
有没有突然跑出不想要的情绪。
如果放在视频里,
还要再看:
旁白会不会被抢掉。
音乐高潮是不是出现在:
错的画面。
最简单的验收方法:先别问「好不好听」
先问:
「有没有完成这支内容的工作?」
例如:
这是一支 45 秒的商品 Reel。
你真正需要的可能是:
前 5 秒抓注意力。
中间不要抢旁白。
30 秒以后稍微增加情绪。
最后干净收尾。
那即使另一首歌:
单独听更漂亮,
只要:
不能配视频,
它就不是:
比较好的答案。
AI Tool 最终还是要回到:
工作。
如果今天第一次使用,我建议只做一个 60 秒 Instrumental
不要一次玩:
完整歌曲。
歌词。
人声。
Jingle。
Podcast。
广告。
全部一起。
找一支你已经有的:
短视频。
先确认:
视频长度。
然后给 Lyria:
用途。
情绪。
乐器。
长度。
不要 Vocal。
生成几个版本。
放回视频里试。
你很快就会知道:
它到底能不能:
真的替你省下找配乐的时间。
一个非常简单的第一次测试
例如:
视频:
60 秒。
主题:
手作商品。
Prompt:
温暖。
自然。
Instrumental。
木吉他+钢琴+轻打击。
前面慢。
中段增加节奏。
最后自然结束。
不要人声。
然后:
生成。
↓
下载 MP3。
↓
丢进原本视频。
↓
完整看一次。
↓
只问:
「这首音乐有没有让视频更完整?」
有:
留下。
没有:
换另一个方向。
不要因为:
是 AI 做的
就硬用。
Lyria 3.5 和一般「AI 帮我推荐音乐」最大的差别
推荐音乐是在:
已存在的曲库里找。
Lyria 则是在:
按照这次任务产生新的音乐。
这代表未来内容制作的一个很大转变。
以前:
先有素材。
你去找:
最接近的。
现在:
你先有需求。
AI 再做:
符合需求的第一版。
图片如此。
视频如此。
现在:
音乐也正在走同一条路。
但这并不代表专业音乐人没有价值
刚好相反。
AI 最擅长的是:
快速产生方向。
Prototype。
背景素材。
低成本尝试。
但真正需要:
品牌声音识别。
完整编曲。
精确混音。
大型广告。
长期 Music Identity。
演唱情感。
创作故事
时,
专业音乐人的价值反而会集中在:
选择、审美、表达与最终品质。
就像 AI Image 出现后,
真正好的 Visual Direction
没有变得不重要。
Lyria 3.5 今天真正值得看的,不是「AI 终于会写歌」
AI 早就能生成音乐。
真正的新变化是:
它开始进入:
一般人的既有工作入口。
Gemini。
Google Vids。
Flow Music。
Google AI Studio。
API。
也就是:
从一个有趣的 Music Demo,
逐渐变成:
Content Workflow 里的一个正式组件。
你做视频缺音乐。
直接做。
你有照片想配气氛。
直接做。
你需要一段特定长度背景音。
直接做。
这才是:
今天真正实用的地方。
最后记住一个使用原则
不要先问:
「Lyria 能做出多厉害的歌?」
先问:
「我现在有哪一段内容,每次都浪费时间找音乐?」
可能是:
Reels。
YouTube。
Podcast。
活动视频。
商品视频。
演示文稿。
如果你已经有一个:
真实工作,
Lyria 3.5 才有机会从:
好玩的 AI
变成:
真正省时间的工具。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。