今天早報提到 Airbnb 一個很值得企業注意的數字:
每筆訂單的客服成本,比去年同期下降約 16%。
這比「我們公司今年用了幾百萬次 AI」更有意義。
因為真正的問題不是:
AI 用了多少?
而是:
每完成一件真正有價值的工作,到底花多少錢?
如果你已經開始用 OpenAI、Anthropic、Google 或其他模型 API 建立網站功能、客服 Agent、自動化流程,今天這個工具就很值得認識。
它叫做:
Langfuse。
Langfuse 是什麼?
先不要被「LLM Observability」這種工程術語嚇到。
用最白話的方式理解:
Langfuse 就像替你的 AI 工作流程裝一台行車記錄器,加上一張成本表。
當使用者對你的 AI 說一句話後,背後可能發生:
- 呼叫一次模型。
- 搜尋資料庫。
- 再呼叫第二次模型。
- 使用工具。
- Agent 重試。
- 最後才產生答案。
使用者只看到最後一段文字。
Langfuse 則可以把中間的執行過程記錄成 Trace。
你可以回頭看:
- 用了哪個模型。
- 輸入多少 Token。
- 輸出多少 Token。
- 這一次花多少錢。
- 花多少時間。
- 中間經過哪些步驟。
- 結果最後好不好。
這就是它最核心的價值。
為什麼一般 API 帳單不夠?
假設月底看到模型 API 帳單:
800 美元。
你知道公司花了 800 美元。
但你可能完全不知道:
- 客服用了多少?
- 內容生成用了多少?
- 研究 Agent 用了多少?
- 哪一個功能最慢?
- 哪一個 Agent 一直重試?
- 哪些昂貴回答最後根本沒有被使用?
只有總帳單,很難管理。
真正需要的是把成本重新接回「工作」。
Langfuse 可以把成本拆到一次工作
Langfuse 可以記錄模型的使用量與成本。
最基本可以看到:
- Input 使用量。
- Output 使用量。
- 模型成本。
遇到支援更多計價方式的模型,也可以區分:
- 快取 Token。
- 音訊 Token。
- 圖片 Token。
如果模型供應商回傳實際 Usage,Langfuse 可以直接記錄。
如果沒有,它也能依模型設定推算成本。
這代表月底不只看到:
「OpenAI 花了多少錢。」
還可以開始問:
「退款客服這個功能到底花了多少?」
最好用的一個觀念:替每種工作取名字
Langfuse 的 Trace 可以加入名稱與 Tag。
例如你的公司有四種 AI 工作:
- 客服 FAQ。
- 訂單問題。
- 退款資料整理。
- 商品文案。
不要全部記成:
AI Request。
而是替它們分開。
月底你才能知道:
- 哪一種工作跑最多次。
- 哪一種最花錢。
- 哪一種速度最慢。
- 哪一種最常失敗。
這比單純看 Token 數量實用很多。
還可以看「為什麼這一次突然很貴」
假設平常一個客服問題成本只有幾分錢。
某一天突然有一筆高出十倍。
總帳單只會告訴你:
錢花掉了。
Trace 卻可以幫你往裡面看。
可能發現:
- 讀了一份非常長的文件。
- Agent 搜尋五次。
- 工具連續失敗。
- 模型重試三次。
- 先用了一個不必要的高階模型。
這時問題就從:
「AI 怎麼愈來愈貴?」
變成:
「原來是這一步一直燒錢。」
Langfuse 不只看錢,也看速度
一個 Agent 花 0.05 美元完成工作,看起來很便宜。
但如果客戶每次都要等 45 秒,也不一定適合正式客服。
Langfuse 可以把 Latency,也就是執行時間,和成本一起觀察。
而且 Metrics 可以依:
- 功能。
- 使用者。
- Session。
- 模型。
- Prompt 版本。
分開看。
這時就可以開始回答一個很實際的問題:
新版 Prompt 到底變好了,還是只變長、變慢、變貴?
例如換模型以前,可以直接比較
假設原本客服使用高階模型。
你想換成比較便宜的模型。
不要只比較 API 價格表。
可以讓兩個版本跑同一批工作,再比較:
- 平均成本。
- 平均延遲。
- 錯誤率。
- 使用者滿意度。
如果便宜模型成本降低 60%,但人工重新處理增加一倍,最後可能並沒有比較便宜。
所以真正該比較的是:
成本和品質一起看。
品質怎麼放進 Langfuse?
這也是它和單純 API Usage Dashboard 很不同的地方。
Langfuse 可以替 Trace 加上 Score。
品質訊號可以來自:
- 使用者按讚或倒讚。
- 星級評分。
- 人工審查。
- 程式規則。
- 另一個模型進行評分。
例如客服回答後,客戶按「有幫助」。
這個回饋可以和剛才那一次 Trace 連在一起。
接下來就不只知道:
這次花 0.03 美元。
還知道:
這個成果最後有沒有幫到使用者。
這才開始接近「每個可用成果成本」
假設一天產生 1,000 次 AI 回答。
總成本 30 美元。
直接計算:
每次平均 0.03 美元。
看起來非常便宜。
但如果只有 500 次真正解決使用者問題呢?
真正值得追蹤的可能變成:
每個有效成果成本。
也就是:
總模型成本除以真正可接受的成果數量。
這是 SasaDaily 建議企業建立的商業指標,不是 Langfuse 官方固定 KPI。
但 Langfuse 可以提供計算這個指標需要的底層資料:
- 成本。
- 使用量。
- Trace。
- 品質 Score。
它適合 Agent 嗎?
很適合。
因為 Agent 最容易出現的問題就是:
表面上一件工作,背後其實跑很多步。
例如:
幫我回答這個客戶的退款問題。
Agent 可能:
- 先讀客服問題。
- 搜尋訂單。
- 查退款政策。
- 讀會員狀態。
- 重新判斷。
- 生成回覆。
Langfuse 可以把這些步驟放進同一個 Trace。
如果第五步突然失敗,就比較容易找到問題。
這也是 Observability 真正有價值的地方。
不是只有系統掛掉才看紀錄。
而是了解 Agent 到底是怎麼完成工作的。
哪些模型與工具可以接?
Langfuse 官方目前提供大量整合方式。
包括常見的:
- OpenAI。
- LangChain 與 LangGraph。
- Google ADK。
- OpenAI Agents。
- Claude Agent SDK。
- CrewAI。
- LiteLLM。
- n8n。
- Vercel AI SDK。
也可以透過 Python、JavaScript、OpenTelemetry 或 API 自己整合。
所以它不是只能監控某一家模型。
不過它不是給一般 ChatGPT 聊天帳號看的
這一點一定要說清楚。
如果你只是每月訂閱 ChatGPT Plus,平常打開 ChatGPT 聊天:
Langfuse 不會自動幫你分析 ChatGPT Plus 月費花在哪裡。
它主要是給:
- 自己開發 AI App 的人。
- 使用模型 API 的團隊。
- 建立 AI Agent 的公司。
- 使用 AI framework 的工程團隊。
- 需要觀察正式 AI 工作流的人。
也就是 AI 已經開始進入「系統」之後,它才真正有價值。
會寫程式才能用嗎?
通常需要一定技術能力。
最常見的方式,是把 Langfuse SDK、OpenTelemetry 或現成整合加到你的 AI 應用裡。
如果原本已經使用 OpenAI SDK、LangChain、n8n 等工具,官方也提供對應整合。
所以它不像 ChatGPT 一樣:
註冊後立刻聊天。
比較像:
先裝進你的 AI 工作流程,之後再從儀表板看實際運行情況。
完全沒有技術背景的一般使用者,不必因為今天介紹它就立刻安裝。
最適合誰?
第一,小型 AI SaaS。
已經透過 API 提供 AI 功能,需要知道不同功能成本。
第二,有客服 Agent 的公司。
想知道每一類客服到底花多少、哪些問題常需要重試。
第三,使用 n8n 或 Agent Workflow 的團隊。
流程愈長,愈需要知道是哪一步出問題。
第四,正在換模型的團隊。
想比較成本、延遲與品質,而不是只看 Benchmark。
第五,開始被財務部門問 AI ROI 的企業。
至少先把底層 AI 成本分到各個功能與工作。
免費嗎?
Langfuse Cloud 目前有免費 Hobby 方案。
截至 2026 年 8 月 10 日,官方方案包含:
- 每月 50,000 Units。
- 30 天資料存取。
- 2 名使用者。
- 平台主要功能,但有使用限制。
不需要信用卡即可開始。
如果要進入正式環境,Cloud Core 方案目前從每月 29 美元起,並包含更高使用量與較長資料存取時間。
另外,Langfuse 本身也是開源專案。
官方提供 Self-hosted 版本,可以自行部署。
「50,000 Units」不是 50,000 次 AI 回答
這也是價格頁最容易看錯的地方。
Langfuse 的 Unit 是平台自己的計量單位。
不能直接理解成:
免費可以問 AI 五萬次。
Langfuse 收的是觀測平台本身的使用量。
你的 OpenAI、Anthropic、Google 或其他模型 API 費用,仍然另外向模型供應商支付。
兩張帳單是不同的。
Self-hosted 就完全沒有成本嗎?
Langfuse 的開源版本可以免費自架。
但「軟體免費」不代表整個系統零成本。
自己部署仍需要:
- 伺服器。
- 儲存空間。
- 資料庫。
- 備份。
- 維護。
- 工程時間。
所以小團隊不一定因為可以 Self-host 就應該第一天自己架。
可以先從 Cloud Hobby 了解工作方式。
最重要的第一個設定:不要一開始追蹤所有東西
如果公司已經有十個 Agent,第一次導入 Langfuse 不必一次全接。
先挑一個最常使用的流程。
例如:
客服 FAQ。
先記四件事情:
- 每次成本。
- 執行時間。
- 是否成功完成。
- 使用者是否接受答案。
跑一週。
這時你就會開始看到:
哪種問題特別貴。
哪種問題特別慢。
哪種回答便宜但一直被拒絕。
這些才是真正可以改善的地方。
不要第一天就做一百張 Dashboard
Observability 工具也很容易變成另一種形式的資料收藏。
公司可能開始追蹤:
- Token。
- Latency。
- Trace。
- Session。
- 模型。
- 版本。
- 數十個 Score。
最後大家每天看漂亮圖表。
卻沒有人因此做任何決定。
所以真正實用的方法是:
每一個指標都要對應一個可能的動作。
例如:
成本過高 → 檢查 Prompt 或換模型。
速度過慢 → 找出最慢步驟。
品質太差 → 重新設計資料或 Prompt。
幾乎沒人使用 → 考慮停止這項功能。
Langfuse 不能直接告訴你 ROI
這點非常重要。
Langfuse 可以告訴你:
- AI 花多少錢。
- 用了多少次。
- 跑多久。
- 得到什麼評分。
但它不知道:
- 客服人員原本一件工作花幾分鐘。
- 這個回答有沒有避免退貨。
- 客戶最後有沒有成交。
- 員工省下的時間拿去做什麼。
- 這項 AI 功能替公司增加多少收入。
這些資料仍然要由企業自己提供。
所以最成熟的使用方式不是:
Langfuse = ROI 工具。
而是:
Langfuse 提供 AI 成本與品質證據,再和真正的商業成果接起來。
一個最簡單的 AI 成本表
如果今天導入客服 AI,可以先建立五個指標:
- 每件客服 AI 成本。
- 平均完成時間。
- 直接解決比例。
- 轉真人比例。
- 人工重新處理比例。
然後再和以前比較:
沒有 AI 時,一百件客服需要多少人工時間?
有 AI 後,需要多少?
這時才開始接近 Airbnb 今天公布的那種指標。
可以直接使用的 Langfuse 指標規劃 Prompt
你是我的 AI 工作流程觀測與成本設計顧問。 我要監控的 AI 工作是: [說明工作] 目前使用的模型與工具: [模型、API、Agent、n8n 等] 這項工作的真正商業目標: [例如減少客服時間、提高完成率、降低每件工作成本] 請不要替我設計一大堆沒有用途的 Dashboard。 請先建立最小可用的 Langfuse 追蹤方案。 一、Trace 名稱 替不同工作設計清楚名稱,讓我知道每筆成本屬於哪一種工作。 二、成本 我要追蹤哪些模型使用量與成本? 三、速度 哪些步驟應記錄 Latency? 四、品質 請設計 1 到 3 個最重要 Score。 優先使用真正可以判斷成果是否可用的指標。 五、失敗 哪些情況應該另外加 Tag,方便之後找出異常案例? 六、商業成果 列出 Langfuse 本身無法知道、但我必須從公司系統另外取得的資料。 例如: 人工處理時間、 成交、 退款、 人工修改、 客戶問題是否真正解決。 最後替我設計一張最小 KPI 清單,只保留 5 個指標。 每一個指標都必須回答: 看到它變差時,我下一步要做什麼? 不要把 Token 使用量、AI 呼叫次數或 Dashboard 數量直接當成 ROI。
資料隱私要特別注意
Langfuse 的價值來自記錄 AI 工作過程。
但這也代表 Trace 可能包含:
- Prompt。
- 模型輸出。
- 工具執行資料。
- 工作流程內容。
所以不能為了 Observability,反而把不必要的敏感資料全部送進記錄系統。
Langfuse 官方提供資料 Masking 方法。
例如可以在資料送出應用程式以前,先把敏感內容遮蔽。
如果有:
- 客戶姓名。
- Email。
- 電話。
- 身份資料。
- 醫療資訊。
- 付款資訊。
就應該先重新確認:
這些資料真的有必要被記錄嗎?
最安全的 Trace,不是記得最多。
而是:
記得足夠除錯與衡量,又沒有多收不必要的敏感資料。
今天最重要的判斷
當 AI 還只是自己聊天時,月底看到一張訂閱帳單可能就夠了。
但當 AI 開始:
- 服務客戶。
- 操作 Agent。
- 接進網站。
- 自動跑工作流。
- 每天呼叫數千次 API。
只看總帳單就已經不夠。
你需要知道:
哪個功能在花錢?
哪一步最慢?
哪個 Prompt 改完反而更貴?
哪個便宜模型其實一直產生不能用的答案?
Langfuse 真正有價值的地方,就是把這些東西重新連起來。
但最後仍然要記住:
成本低,不代表有價值。
真正完整的答案還要再加上一個問題:
這次 AI 工作最後有沒有產生真正可以使用的成果?
當成本、速度、品質與商業結果開始放在同一張圖上,AI ROI 才不再只是感覺。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。