以前講:

AI Voice Agent,

畫面通常很簡單。

你對著:

電話。

App。

智慧音箱

說話。

AI 回你:

一個聲音。

現在 Google 想再往前一步。

不只:

讓 AI 說話。

而是:

讓你看到一個正在和你說話的 AI。

Google 9 月 24 日正式推出:

Gemini 3.8 Live with Live Avatar。

它把:

即時語音。

即時視覺理解。

虛擬人物。

後端 Agent Workflow

放進:

同一個即時對話體驗。

最適合的場景不是:

「幫我寫一篇文章。」

而是:

需要人一直互動的工作。

例如:

客服。

旅館櫃台。

展場導覽。

教育。

產品諮詢。

遠端協助。

先搞懂:Live Avatar 不是普通 AI 生影片

這點很重要。

一般 AI Avatar 工具:

可能是你先輸入:

一段 Script。

再等 AI:

生成一段影片。

Gemini 3.8 Live with Live Avatar

不是這種工作方式。

它比較像:

即時 Video Call。

你說一句。

Avatar:

即時理解。

即時回答。

嘴型跟著:

AI 產生的聲音。

表情也跟著:

Conversation

動態改變。

不是:

先把整段影片做完

再播放。

Google 把它建立在 Gemini 3.8 Live 上

Gemini 3.8 Live

本來就是:

Real-time Conversational Model。

和一般:

文字 Prompt

最大的不同是:

它直接做:

Speech-to-Speech。

也就是:

你說話。

AI 不一定先完整轉成文字、

再產文字、

再交給另一套 TTS。

Google 把:

聽。

理解。

回答。

說話

放進:

同一個 Live Model。

這也是為什麼:

它比較適合:

Continuous Conversation。

Live Avatar 再多加一層「視覺存在」

Google 現在把:

Video Avatar

同步加入。

官方表示:

Live Avatar 可以根據生成語音:

同步:

Lip-sync。

Facial Expression。

Conversation Response。

所以使用者不只是:

聽到一個 Voice Bot。

而是:

看到一個:

正在對自己說話的數位角色。

而且支援 97 種語言

這是它最適合:

跨國客服

的一個地方。

Google 表示:

Gemini 3.8 Live with Live Avatar

可以:

理解和說:

97 種語言。

而且可以:

Automatic Language Detection。

甚至:

對話中切換語言。

Avatar 的:

嘴型。

表情

仍會跟著改。

所以假設:

飯店櫃台。

第一個客人說:

英文。

第二個:

日文。

第三個:

西班牙文。

理論上:

不需要替每種語言

另外做一套:

預錄 Avatar Video。

同一套 Live Agent

可以:

動態切換。

這和傳統多語客服成本差很多

以前做:

Digital Human。

如果有:

10 種語言。

常常意味著:

10 套:

語音。

Script。

Recording。

Avatar Content。

更新一次內容:

可能全部重做。

Live Avatar 的方向是:

內容在對話當下生成。

所以企業真正維護的是:

Knowledge。

Rules。

Backend Tools。

Permissions。

不是:

幾千支預錄影片。

它不只「聽」,也能看

這點比 Avatar 外表:

更實用。

Gemini 3.8 Live

支援:

Live Visual Understanding。

也就是可以同時理解:

Camera Feed。

Screen Share。

Audio。

所以使用者可以:

邊說。

邊給 AI 看東西。

例如飯店旅客可以直接把畫面給它看

假設客人說:

「我訂房資料裡是不是含早餐?」

然後:

把手機畫面

對著 Camera。

理想 Workflow 可以是:

Avatar:

先理解:

使用者正在看的畫面。

再搭配:

後端訂房資料。

回答:

目前能確認的內容。

如果牽涉:

改房型。

退款。

加價。

付款。

再進:

人工或 Approval Step。

這比:

叫客人把:

訂單編號。

姓名。

方案。

日期

全部念一遍,

自然很多。

遠端技術支援也可能很適合

例如:

客戶不知道:

Router 哪一顆燈有問題。

以前:

客服:

「你看左邊第三顆燈。」

客戶:

「哪一顆?」

客服:

「不是那個。」

如果 AI 可以:

直接看:

Camera Feed,

使用者可以:

把鏡頭對著設備。

AI:

根據畫面

一步一步說:

下一步要看哪裡。

注意:

這只是:

適合 Live Visual Understanding

的一種使用情境。

不是說:

Gemini 已經內建每一家 Router

的維修資料。

企業仍然要:

接自己的:

Knowledge Base。

Product Data。

Service Workflow。

Screen Share 更適合軟體客服

例如:

客戶說:

「我找不到 Export。」

與其:

一來一往描述:

左上角。

右上角。

Settings。

Menu。

如果 Agent:

可以看到:

使用者分享的畫面,

它就能:

根據:

目前 UI State

直接指導。

這會比:

只聽文字描述

少很多:

Context Loss。

真正有趣的其實不是 Avatar,而是「邊聊邊做」

Google Cloud 對 Gemini 3.8 Live

特別強調:

即時對話期間,

Agent 可以搭配:

Backend Tools。

API。

其他企業系統

完成工作。

而對話:

不用因此完全停下來。

這件事非常關鍵。

因為傳統 Voice Bot:

很容易變成:

客人說一句。

停。

系統查資料。

停。

再回答。

非常不像真人。

Google 想做的是:

例如:

「我幫你查一下。」

Agent:

背景處理。

同時還能:

維持對話 Context。

這才是真正的「Live Agent」

不是:

一個動畫人物

在嘴巴動。

而是:

它背後可以:

理解。

查資料。

使用工具。

處理 Workflow。

Avatar:

只是:

把這些能力

變成:

更像面對面互動的入口。

哪些場景最可能先有價值?

第一:Customer Service

適合:

高頻。

重複。

但又需要:

語音互動

的問題。

例如:

訂單查詢。

產品說明。

基本故障排除。

政策解說。

第二:Hospitality/Tourism

飯店。

機場服務。

旅遊資訊。

展館。

Visitor Center。

這些地方:

天然就有:

多語需求。

而且很多問題:

重複性很高。

第三:Education

例如:

Virtual Tutor。

學生:

可以用語音問。

甚至:

把畫面、

作業、

示意圖

給 Agent 看。

Agent:

再即時回應。

但涉及:

評分。

重要教育判斷。

仍然要另外設計:

Human Review。

第四:Retail

例如:

店內 Kiosk。

顧客可以:

拿商品給鏡頭看。

問:

差異。

規格。

用途。

庫存。

如果再連:

企業正式商品資料,

就能:

減少:

人工重新查詢。

但:

價格。

促銷。

庫存

仍然應該以:

正式 Backend Data

為準。

不能讓模型:

自己猜。

第五:Remote Assistance

特別適合:

「我不知道怎麼描述我看到的東西。」

例如:

設備。

軟體畫面。

產品組裝。

操作步驟。

讓 Agent:

看到同一個畫面,

通常比:

人一直用文字解釋

容易很多。

但現在一定要知道:這不是一般 Gemini App 的新按鈕

今天如果看到:

Live Avatar

就立刻打開:

Gemini App

找:

「Avatar Mode。」

很可能:

找不到。

因為 Google 現在正式公布的是:

Gemini Enterprise。

以及:

API。

它的主要對象是:

Developer。

Enterprise。

要拿來:

建立自己的:

Customer Service。

Tutor。

Concierge。

Kiosk。

Agent Experience。

不是:

一般消費者今天換一個頭像

就能直接視訊聊天。

Gemini 3.8 Live 已經是 GA

這一點也要和:

Demo

分清楚。

Google Cloud 已經把:

Gemini 3.8 Live with Live Avatar

列為:

Generally Available。

也就是:

可以拿來:

Production。

不是只有:

Private Research Demo。

目前提供:

US。

EU

Multi-region Endpoint。

支援:

Pay-as-you-go。

也支援:

Provisioned Throughput。

但 Custom Avatar 還沒有完全開放

Google 有提供:

Preset Avatar。

也就是:

預先準備好的虛擬人物。

如果企業想做:

自己的品牌角色。

或者:

用一張高品質 Reference Image

建立:

具有指定外觀的 Avatar,

目前:

Custom Avatar Creation

仍然需要:

Enterprise Allowlist。

所以不能寫成:

「今天所有人都能上傳一張照片,立刻做成 Gemini Live Avatar。」

還不是。

而且「可以保留人物外觀」會立刻碰到身份問題

Avatar 一旦可以:

從 Reference Image

建立,

最大的風險就是:

假冒真人。

Deepfake。

品牌冒用。

Google 表示:

Live Avatar

針對:

Identity

加入安全設計。

所有 AI 生成的:

Audio。

Video

也會加入:

SynthID。

SynthID

是:

不可見的 AI Watermark。

目的是讓:

生成內容

未來更容易被:

辨識。

但 SynthID 不等於「不會被濫用」

這一點和我們以前談:

AI Image/Video

一樣。

Watermark:

是:

Provenance Signal。

不是:

Permission。

不是:

肖像權授權。

也不是:

企業可以隨便用任何人的臉。

真正做 Custom Avatar

仍然要確認:

人物授權。

品牌授權。

使用範圍。

告知。

資料保存政策。

如果是客服,還要再加一條:不能讓 Avatar 外表提高錯誤可信度

這可能是:

Live Avatar

很容易被忽略的問題。

純文字 AI:

講錯。

人還比較容易:

懷疑。

一個:

看著你。

點頭。

表情自然。

聲音流暢。

嘴型同步

的 Avatar:

如果講錯,

反而可能:

更容易讓人相信。

所以:

「看起來比較像真人」

不等於:

「答案比較準。」

企業真正要管的:

仍然是:

Grounding。

Knowledge。

Permissions。

Escalation。

客服最重要的不是「像不像真人」

真正 KPI

應該看:

問題有沒有解決?

回答正不正確?

第一次解決率多少?

多少必須:

轉真人?

高風險 Action

有沒有:

正確停下?

客戶最後:

有沒有少花時間?

如果 Avatar:

做得非常逼真,

但:

一直答錯庫存。

那只是:

一個很漂亮的錯誤介面。

導入時最適合先做「低風險+高頻」

例如:

營業時間。

基本服務介紹。

場館方向。

產品操作步驟。

預約流程說明。

訂單狀態。

這些:

有正式資料。

容易驗證。

重複性高。

先測:

Live Agent

到底能不能:

比傳統 Voice Bot

更自然地完成。

不要第一天就讓它處理:

付款。

退款。

取消訂單。

正式合約。

醫療判斷。

重大財務決策。

敏感個資修改。

原因不是:

AI Avatar 特別危險。

而是:

這些 Action

本來就應該:

有更強 Approval。

可以先設三層工作

第一層:回答

查:

正式 Knowledge Base。

回答問題。

第二層:準備

幫忙:

填資料。

整理需求。

準備 Action。

第三層:執行

退款。

付款。

取消。

改訂單。

正式送出。

第一層:

可以自動化多一點。

越往第三層:

越需要:

Human Approval。

這才是:

企業 Agent

比較合理的設計。

Google 也把 Live Avatar 做成 24 FPS 即時影片

Developer Guide

目前描述:

Gemini 3.8 Live

可直接生成:

同步的:

24 FPS Live Avatar Video。

搭配:

24 kHz Audio。

核心目標是:

Continuous Conversation。

也就是:

不要讓 Avatar:

像早期 Digital Human

一樣:

說一句。

停。

畫面卡一下。

再換下一句。

真正要接近的是:

自然:

插話。

停頓。

轉換話題。

繼續 Context。

它還會聽語氣

Gemini 3.8 Live

加入:

Affective Dialogue。

模型可以從:

Prosody。

語氣。

停頓。

Speech Inflection

判斷:

使用者目前的:

情緒與說話狀態。

再調整:

Voice Tone。

Conversation Rhythm。

例如:

客人已經很急,

AI 不應該還:

慢慢講五段背景。

不過:

這仍然是:

模型判斷。

不能把它當成:

真正的心理分析。

另外有 Proactive Audio

Google 也加入:

Background Audio Filtering。

模型會盡量區分:

真正對它說的話

和:

旁邊的背景聲。

這對:

大廳。

展場。

商店。

機場

非常重要。

因為真實環境:

不會像 Demo Room

那麼安靜。

成本也不能只看「一個 Avatar 多少錢一個月」

這是:

API/Enterprise Tool。

Google Cloud 的計價方式

不是:

固定一個:

「Avatar Pro 每月 20 美元。」

而是:

依:

Text Input。

Image/Video Input。

Audio Input。

Text Output。

Audio Output。

Avatar Video Output

分開計量。

另外也有:

Pay-as-you-go。

Provisioned Throughput。

所以真正做企業專案時,

應該算:

Cost per Completed Conversation。

不是:

只看模型單價。

例如客服真正應該計算:

每次互動:

平均幾分鐘?

輸入多少 Audio?

有沒有 Camera Feed?

Avatar Video 開多久?

後端 Tool Call 幾次?

最後:

多少問題真的解決?

如果:

一通 AI Avatar 客服

成本比真人便宜,

但:

50% 還是轉真人,

就要:

把兩邊成本

一起算。

所以 Live Avatar 最適合的第一個 Pilot

不要先做:

「取代全部客服。」

先選:

一個:

很窄的問題。

例如:

飯店:

Check-in/設施/早餐說明。

展館:

動線與展品基本資訊。

零售:

產品規格與門市查詢。

SaaS:

帳號設定與常見操作。

跑:

100~500 次真實互動。

看:

回答正確率。

平均處理時間。

轉真人率。

客戶滿意度。

每次解決成本。

再決定:

要不要擴大。

Live Avatar 真正重要的地方,不是「AI 終於有一張臉」

AI Avatar:

早就不是新概念。

真正新的是:

以前:

Avatar

是一個:

Presentation Layer。

背後常常只是:

預錄 Script。

現在:

Avatar

開始直接長在:

Real-time Agent

上面。

它能:

聽。

看。

回答。

維持 Context。

搭配 Backend Workflow。

再透過:

一個視覺角色

和人持續互動。

這才是:

今天最值得注意的地方。

也因此,人機互動會多出一個新問題

以前:

網站 Chatbot

只要讓使用者知道:

「這是 AI。」

相對簡單。

未來一個:

表情自然。

嘴型同步。

聲音有情緒。

長得像真人

的數位客服,

企業更需要:

清楚告知:

這不是人類。

哪些資訊:

會被收集。

Camera:

有沒有開。

Screen:

分享了什麼。

對話:

會不會保存。

哪些 Action:

可以自動做。

哪些:

會轉真人。

AI 越像真人,

透明度反而越不能降低。

台灣使用者今天應該怎麼看這個工具?

如果你只是:

一般 Gemini 使用者,

今天不用急著找:

Live Avatar 按鈕。

它現在不是:

一個大眾版濾鏡功能。

如果你是:

企業。

開發者。

做:

客服。

教育。

導覽。

互動式產品。

真正值得研究的是:

原本只有 Voice/Chat 的流程,有沒有哪一步因為「AI 可以看見+有視覺角色」而真的變更好?

如果沒有,

根本不用:

硬加 Avatar。

因為畫面本身不是 ROI

一個客服問題:

純 Voice

30 秒解決。

加 Avatar

仍然:

30 秒。

而客戶:

也不在意看到臉。

那 Avatar:

可能只是:

增加成本。

但如果場景需要:

建立信任。

示範操作。

看使用者畫面。

跨語言服務。

長時間互動。

那:

視覺存在

才可能真的:

改變體驗。

最後記住一句話

Gemini 3.8 Live with Live Avatar

真正的進步,

不是:

「AI 終於會做一張會動的臉。」

而是:

「即時 Agent 開始同時能聽、能看、能說,還能用一個持續存在的視覺角色和人完成工作。」

但越像真人,

越需要把:

身份。

資料。

權限。

轉真人條件

講清楚。

所以今天最值得測的,

不是:

Avatar 到底多逼真。

而是:

它有沒有真的讓一段原本卡住的人機互動,變得更快、更清楚,而且仍然知道什麼時候該把決定權交回給人。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

今日 AI 工具|2026/08/27:Gemini Live 新版,直接用語音整理 Gmail、聽 Daily Brief,還能把多步驟工作交給 Spark

今日 AI 工具|2026/07/28:OpenAI Presence,把客服 AI 從回答問題升級成能查資料、完成核准操作與轉交真人