以前讲:
AI Voice Agent,
画面通常很简单。
你对着:
电话。
App。
智能音箱
说话。
AI 回你:
一个声音。
现在 Google 想再往前一步。
不只:
让 AI 说话。
而是:
让你看到一个正在和你说话的 AI。
Google 9 月 24 日正式推出:
Gemini 3.8 Live with Live Avatar。
它把:
实时语音。
实时视觉理解。
虚拟人物。
后端 Agent Workflow
放进:
同一个实时对话体验。
最适合的场景不是:
「帮我写一篇文章。」
而是:
需要人一直交互的工作。
例如:
客服。
旅馆柜台。
展场导览。
教育。
产品咨询。
远程协助。
先搞懂:Live Avatar 不是普通 AI 生视频
这点很重要。
一般 AI Avatar 工具:
可能是你先输入:
一段 Script。
再等 AI:
生成一段视频。
Gemini 3.8 Live with Live Avatar
不是这种工作方式。
它比较像:
实时 Video Call。
你说一句。
Avatar:
实时理解。
实时回答。
嘴型跟着:
AI 产生的声音。
表情也跟着:
Conversation
动态改变。
不是:
先把整段视频做完
再播放。
Google 把它创建在 Gemini 3.8 Live 上
Gemini 3.8 Live
本来就是:
Real-time Conversational Model。
和一般:
文字 Prompt
最大的不同是:
它直接做:
Speech-to-Speech。
也就是:
你说话。
AI 不一定先完整转成文字、
再产文字、
再交给另一套 TTS。
Google 把:
听。
理解。
回答。
说话
放进:
同一个 Live Model。
这也是为什么:
它比较适合:
Continuous Conversation。
Live Avatar 再多加一层「视觉存在」
Google 现在把:
Video Avatar
同步加入。
官方表示:
Live Avatar 可以根据生成语音:
同步:
Lip-sync。
Facial Expression。
Conversation Response。
所以用户不只是:
听到一个 Voice Bot。
而是:
看到一个:
正在对自己说话的数字角色。
而且支持 97 种语言
这是它最适合:
跨国客服
的一个地方。
Google 表示:
Gemini 3.8 Live with Live Avatar
可以:
理解和说:
97 种语言。
而且可以:
Automatic Language Detection。
甚至:
对话中切换语言。
Avatar 的:
嘴型。
表情
仍会跟着改。
所以假设:
饭店柜台。
第一个客人说:
英文。
第二个:
日文。
第三个:
西班牙文。
理论上:
不需要替每种语言
另外做一套:
预录 Avatar Video。
同一套 Live Agent
可以:
动态切换。
这和传统多语客服成本差很多
以前做:
Digital Human。
如果有:
10 种语言。
常常意味着:
10 套:
语音。
Script。
Recording。
Avatar Content。
更新一次内容:
可能全部重做。
Live Avatar 的方向是:
内容在对话当下生成。
所以企业真正维护的是:
Knowledge。
Rules。
Backend Tools。
Permissions。
不是:
几千支预录像片。
它不只「听」,也能看
这点比 Avatar 外表:
更实用。
Gemini 3.8 Live
支持:
Live Visual Understanding。
也就是可以同时理解:
Camera Feed。
Screen Share。
Audio。
所以用户可以:
边说。
边给 AI 看东西。
例如饭店旅客可以直接把画面给它看
假设客人说:
「我订房数据里是不是含早餐?」
然后:
把手机画面
对着 Camera。
理想 Workflow 可以是:
Avatar:
先理解:
用户正在看的画面。
再搭配:
后端订房数据。
回答:
目前能确认的内容。
如果牵涉:
改房型。
退款。
加价。
付款。
再进:
人工或 Approval Step。
这比:
叫客人把:
订单编号。
姓名。
方案。
日期
全部念一遍,
自然很多。
远程技术支持也可能很适合
例如:
客户不知道:
Router 哪一颗灯有问题。
以前:
客服:
「你看左边第三颗灯。」
客户:
「哪一颗?」
客服:
「不是那个。」
如果 AI 可以:
直接看:
Camera Feed,
用户可以:
把镜头对着设备。
AI:
根据画面
一步一步说:
下一步要看哪里。
注意:
这只是:
适合 Live Visual Understanding
的一种使用情境。
不是说:
Gemini 已经内置每一家 Router
的维修数据。
企业仍然要:
接自己的:
Knowledge Base。
Product Data。
Service Workflow。
Screen Share 更适合软件客服
例如:
客户说:
「我找不到 Export。」
与其:
一来一往描述:
左上角。
右上角。
Settings。
Menu。
如果 Agent:
可以看到:
用户分享的画面,
它就能:
根据:
目前 UI State
直接指导。
这会比:
只听文字描述
少很多:
Context Loss。
真正有趣的其实不是 Avatar,而是「边聊边做」
Google Cloud 对 Gemini 3.8 Live
特别强调:
实时对话期间,
Agent 可以搭配:
Backend Tools。
API。
其他企业系统
完成工作。
而对话:
不用因此完全停下来。
这件事非常关键。
因为传统 Voice Bot:
很容易变成:
客人说一句。
停。
系统查数据。
停。
再回答。
非常不像真人。
Google 想做的是:
例如:
「我帮你查一下。」
Agent:
背景处理。
同时还能:
维持对话 Context。
这才是真正的「Live Agent」
不是:
一个动画人物
在嘴巴动。
而是:
它背后可以:
理解。
查数据。
使用工具。
处理 Workflow。
Avatar:
只是:
把这些能力
变成:
更像面对面交互的入口。
哪些场景最可能先有价值?
第一:Customer Service
适合:
高频。
重复。
但又需要:
语音交互
的问题。
例如:
订单查找。
产品说明。
基本故障排除。
政策解说。
第二:Hospitality/Tourism
饭店。
机场服务。
旅游信息。
展馆。
Visitor Center。
这些地方:
天然就有:
多语需求。
而且很多问题:
重复性很高。
第三:Education
例如:
Virtual Tutor。
学生:
可以用语音问。
甚至:
把画面、
作业、
示意图
给 Agent 看。
Agent:
再实时回应。
但涉及:
评分。
重要教育判断。
仍然要另外设计:
Human Review。
第四:Retail
例如:
店内 Kiosk。
顾客可以:
拿商品给镜头看。
问:
差异。
规格。
用途。
库存。
如果再连:
企业正式商品数据,
就能:
减少:
人工重新查找。
但:
价格。
促销。
库存
仍然应该以:
正式 Backend Data
为准。
不能让模型:
自己猜。
第五:Remote Assistance
特别适合:
「我不知道怎么描述我看到的东西。」
例如:
设备。
软件画面。
产品组装。
操作步骤。
让 Agent:
看到同一个画面,
通常比:
人一直用文字解释
容易很多。
但现在一定要知道:这不是一般 Gemini App 的新按钮
今天如果看到:
Live Avatar
就立刻打开:
Gemini App
找:
「Avatar Mode。」
很可能:
找不到。
因为 Google 现在正式公布的是:
Gemini Enterprise。
以及:
API。
它的主要对象是:
Developer。
Enterprise。
要拿来:
创建自己的:
Customer Service。
Tutor。
Concierge。
Kiosk。
Agent Experience。
不是:
一般消费者今天换一个头像
就能直接视频聊天。
Gemini 3.8 Live 已经是 GA
这一点也要和:
Demo
分清楚。
Google Cloud 已经把:
Gemini 3.8 Live with Live Avatar
列为:
Generally Available。
也就是:
可以拿来:
Production。
不是只有:
Private Research Demo。
目前提供:
US。
EU
Multi-region Endpoint。
支持:
Pay-as-you-go。
也支持:
Provisioned Throughput。
但 Custom Avatar 还没有完全开放
Google 有提供:
Preset Avatar。
也就是:
预先准备好的虚拟人物。
如果企业想做:
自己的品牌角色。
或者:
用一张高品质 Reference Image
创建:
具有指定外观的 Avatar,
目前:
Custom Avatar Creation
仍然需要:
Enterprise Allowlist。
所以不能写成:
「今天所有人都能上传一张照片,立刻做成 Gemini Live Avatar。」
还不是。
而且「可以保留人物外观」会立刻碰到身份问题
Avatar 一旦可以:
从 Reference Image
创建,
最大的风险就是:
假冒真人。
Deepfake。
品牌冒用。
Google 表示:
Live Avatar
针对:
Identity
加入安全设计。
所有 AI 生成的:
Audio。
Video
也会加入:
SynthID。
SynthID
是:
不可见的 AI Watermark。
目的是让:
生成内容
未来更容易被:
辨识。
但 SynthID 不等于「不会被滥用」
这一点和我们以前谈:
AI Image/Video
一样。
Watermark:
是:
Provenance Signal。
不是:
Permission。
不是:
肖像权授权。
也不是:
企业可以随便用任何人的脸。
真正做 Custom Avatar
仍然要确认:
人物授权。
品牌授权。
使用范围。
告知。
数据保存政策。
如果是客服,还要再加一条:不能让 Avatar 外表提高错误可信度
这可能是:
Live Avatar
很容易被忽略的问题。
纯文字 AI:
讲错。
人还比较容易:
怀疑。
一个:
看着你。
点头。
表情自然。
声音流畅。
嘴型同步
的 Avatar:
如果讲错,
反而可能:
更容易让人相信。
所以:
「看起来比较像真人」
不等于:
「答案比较准。」
企业真正要管的:
仍然是:
Grounding。
Knowledge。
Permissions。
Escalation。
客服最重要的不是「像不像真人」
真正 KPI
应该看:
问题有没有解决?
回答正不正确?
第一次解决率多少?
多少必须:
转真人?
高风险 Action
有没有:
正确停下?
客户最后:
有没有少花时间?
如果 Avatar:
做得非常逼真,
但:
一直答错库存。
那只是:
一个很漂亮的错误界面。
导入时最适合先做「低风险+高频」
例如:
营业时间。
基本服务介绍。
场馆方向。
产品操作步骤。
预约流程说明。
订单状态。
这些:
有正式数据。
容易验证。
重复性高。
先测:
Live Agent
到底能不能:
比传统 Voice Bot
更自然地完成。
不要第一天就让它处理:
付款。
退款。
取消订单。
正式合约。
医疗判断。
重大财务决策。
敏感个资修改。
原因不是:
AI Avatar 特别危险。
而是:
这些 Action
本来就应该:
有更强 Approval。
可以先设三层工作
第一层:回答
查:
正式 Knowledge Base。
回答问题。
第二层:准备
帮忙:
填数据。
整理需求。
准备 Action。
第三层:运行
退款。
付款。
取消。
改订单。
正式送出。
第一层:
可以自动化多一点。
越往第三层:
越需要:
Human Approval。
这才是:
企业 Agent
比较合理的设计。
Google 也把 Live Avatar 做成 24 FPS 实时视频
Developer Guide
目前描述:
Gemini 3.8 Live
可直接生成:
同步的:
24 FPS Live Avatar Video。
搭配:
24 kHz Audio。
内核目标是:
Continuous Conversation。
也就是:
不要让 Avatar:
像早期 Digital Human
一样:
说一句。
停。
画面卡一下。
再换下一句。
真正要接近的是:
自然:
插话。
停顿。
转换话题。
继续 Context。
它还会听语气
Gemini 3.8 Live
加入:
Affective Dialogue。
模型可以从:
Prosody。
语气。
停顿。
Speech Inflection
判断:
用户目前的:
情绪与说话状态。
再调整:
Voice Tone。
Conversation Rhythm。
例如:
客人已经很急,
AI 不应该还:
慢慢讲五段背景。
不过:
这仍然是:
模型判断。
不能把它当成:
真正的心理分析。
另外有 Proactive Audio
Google 也加入:
Background Audio Filtering。
模型会尽量区分:
真正对它说的话
和:
旁边的背景声。
这对:
大厅。
展场。
商店。
机场
非常重要。
因为真实环境:
不会像 Demo Room
那么安静。
成本也不能只看「一个 Avatar 多少钱一个月」
这是:
API/Enterprise Tool。
Google Cloud 的计价方式
不是:
固定一个:
「Avatar Pro 每月 20 美元。」
而是:
依:
Text Input。
Image/Video Input。
Audio Input。
Text Output。
Audio Output。
Avatar Video Output
分开计量。
另外也有:
Pay-as-you-go。
Provisioned Throughput。
所以真正做企业项目时,
应该算:
Cost per Completed Conversation。
不是:
只看模型单价。
例如客服真正应该计算:
每次交互:
平均几分钟?
输入多少 Audio?
有没有 Camera Feed?
Avatar Video 开多久?
后端 Tool Call 几次?
最后:
多少问题真的解决?
如果:
一通 AI Avatar 客服
成本比真人便宜,
但:
50% 还是转真人,
就要:
把两边成本
一起算。
所以 Live Avatar 最适合的第一个 Pilot
不要先做:
「取代全部客服。」
先选:
一个:
很窄的问题。
例如:
饭店:
Check-in/设施/早餐说明。
展馆:
动线与展品基本信息。
零售:
产品规格与门市查找。
SaaS:
帐号设置与常见操作。
跑:
100~500 次真实交互。
看:
回答正确率。
平均处理时间。
转真人率。
客户满意度。
每次解决成本。
再决定:
要不要扩大。
Live Avatar 真正重要的地方,不是「AI 终于有一张脸」
AI Avatar:
早就不是新概念。
真正新的是:
以前:
Avatar
是一个:
Presentation Layer。
背后常常只是:
预录 Script。
现在:
Avatar
开始直接长在:
Real-time Agent
上面。
它能:
听。
看。
回答。
维持 Context。
搭配 Backend Workflow。
再透过:
一个视觉角色
和人持续交互。
这才是:
今天最值得注意的地方。
也因此,人机交互会多出一个新问题
以前:
网站 Chatbot
只要让用户知道:
「这是 AI。」
相对简单。
未来一个:
表情自然。
嘴型同步。
声音有情绪。
长得像真人
的数字客服,
企业更需要:
清楚告知:
这不是人类。
哪些信息:
会被收集。
Camera:
有没有开。
Screen:
分享了什么。
对话:
会不会保存。
哪些 Action:
可以自动做。
哪些:
会转真人。
AI 越像真人,
透明度反而越不能降低。
台湾用户今天应该怎么看这个工具?
如果你只是:
一般 Gemini 用户,
今天不用急着找:
Live Avatar 按钮。
它现在不是:
一个大众版滤镜功能。
如果你是:
企业。
开发者。
做:
客服。
教育。
导览。
交互式产品。
真正值得研究的是:
原本只有 Voice/Chat 的流程,有没有哪一步因为「AI 可以看见+有视觉角色」而真的变更好?
如果没有,
根本不用:
硬加 Avatar。
因为画面本身不是 ROI
一个客服问题:
纯 Voice
30 秒解决。
加 Avatar
仍然:
30 秒。
而客户:
也不在意看到脸。
那 Avatar:
可能只是:
增加成本。
但如果场景需要:
创建信任。
示范操作。
看用户画面。
跨语言服务。
长时间交互。
那:
视觉存在
才可能真的:
改变体验。
最后记住一句话
Gemini 3.8 Live with Live Avatar
真正的进步,
不是:
「AI 终于会做一张会动的脸。」
而是:
「实时 Agent 开始同时能听、能看、能说,还能用一个持续存在的视觉角色和人完成工作。」
但越像真人,
越需要把:
身份。
数据。
权限。
转真人条件
讲清楚。
所以今天最值得测的,
不是:
Avatar 到底多逼真。
而是:
它有没有真的让一段原本卡住的人机交互,变得更快、更清楚,而且仍然知道什么时候该把决定权交回给人。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
今日 AI 工具|2026/08/27:Gemini Live 新版,直接用语音整理 Gmail、听 Daily Brief,还能把多步骤工作交给 Spark
今日 AI 工具|2026/07/28:OpenAI Presence,把客服 AI 从回答问题升级成能查数据、完成核准操作与转交真人