今天早報提到 Airbnb 一個很值得企業注意的數字:

每筆訂單的客服成本,比去年同期下降約 16%。

這比「我們公司今年用了幾百萬次 AI」更有意義。

因為真正的問題不是:

AI 用了多少?

而是:

每完成一件真正有價值的工作,到底花多少錢?

如果你已經開始用 OpenAI、Anthropic、Google 或其他模型 API 建立網站功能、客服 Agent、自動化流程,今天這個工具就很值得認識。

它叫做:

Langfuse。

Langfuse 是什麼?

先不要被「LLM Observability」這種工程術語嚇到。

用最白話的方式理解:

Langfuse 就像替你的 AI 工作流程裝一台行車記錄器,加上一張成本表。

當使用者對你的 AI 說一句話後,背後可能發生:

  • 呼叫一次模型。
  • 搜尋資料庫。
  • 再呼叫第二次模型。
  • 使用工具。
  • Agent 重試。
  • 最後才產生答案。

使用者只看到最後一段文字。

Langfuse 則可以把中間的執行過程記錄成 Trace。

你可以回頭看:

  • 用了哪個模型。
  • 輸入多少 Token。
  • 輸出多少 Token。
  • 這一次花多少錢。
  • 花多少時間。
  • 中間經過哪些步驟。
  • 結果最後好不好。

這就是它最核心的價值。

為什麼一般 API 帳單不夠?

假設月底看到模型 API 帳單:

800 美元。

你知道公司花了 800 美元。

但你可能完全不知道:

  • 客服用了多少?
  • 內容生成用了多少?
  • 研究 Agent 用了多少?
  • 哪一個功能最慢?
  • 哪一個 Agent 一直重試?
  • 哪些昂貴回答最後根本沒有被使用?

只有總帳單,很難管理。

真正需要的是把成本重新接回「工作」。

Langfuse 可以把成本拆到一次工作

Langfuse 可以記錄模型的使用量與成本。

最基本可以看到:

  • Input 使用量。
  • Output 使用量。
  • 模型成本。

遇到支援更多計價方式的模型,也可以區分:

  • 快取 Token。
  • 音訊 Token。
  • 圖片 Token。

如果模型供應商回傳實際 Usage,Langfuse 可以直接記錄。

如果沒有,它也能依模型設定推算成本。

這代表月底不只看到:

「OpenAI 花了多少錢。」

還可以開始問:

「退款客服這個功能到底花了多少?」

最好用的一個觀念:替每種工作取名字

Langfuse 的 Trace 可以加入名稱與 Tag。

例如你的公司有四種 AI 工作:

  • 客服 FAQ。
  • 訂單問題。
  • 退款資料整理。
  • 商品文案。

不要全部記成:

AI Request。

而是替它們分開。

月底你才能知道:

  • 哪一種工作跑最多次。
  • 哪一種最花錢。
  • 哪一種速度最慢。
  • 哪一種最常失敗。

這比單純看 Token 數量實用很多。

還可以看「為什麼這一次突然很貴」

假設平常一個客服問題成本只有幾分錢。

某一天突然有一筆高出十倍。

總帳單只會告訴你:

錢花掉了。

Trace 卻可以幫你往裡面看。

可能發現:

  • 讀了一份非常長的文件。
  • Agent 搜尋五次。
  • 工具連續失敗。
  • 模型重試三次。
  • 先用了一個不必要的高階模型。

這時問題就從:

「AI 怎麼愈來愈貴?」

變成:

「原來是這一步一直燒錢。」

Langfuse 不只看錢,也看速度

一個 Agent 花 0.05 美元完成工作,看起來很便宜。

但如果客戶每次都要等 45 秒,也不一定適合正式客服。

Langfuse 可以把 Latency,也就是執行時間,和成本一起觀察。

而且 Metrics 可以依:

  • 功能。
  • 使用者。
  • Session。
  • 模型。
  • Prompt 版本。

分開看。

這時就可以開始回答一個很實際的問題:

新版 Prompt 到底變好了,還是只變長、變慢、變貴?

例如換模型以前,可以直接比較

假設原本客服使用高階模型。

你想換成比較便宜的模型。

不要只比較 API 價格表。

可以讓兩個版本跑同一批工作,再比較:

  • 平均成本。
  • 平均延遲。
  • 錯誤率。
  • 使用者滿意度。

如果便宜模型成本降低 60%,但人工重新處理增加一倍,最後可能並沒有比較便宜。

所以真正該比較的是:

成本和品質一起看。

品質怎麼放進 Langfuse?

這也是它和單純 API Usage Dashboard 很不同的地方。

Langfuse 可以替 Trace 加上 Score。

品質訊號可以來自:

  • 使用者按讚或倒讚。
  • 星級評分。
  • 人工審查。
  • 程式規則。
  • 另一個模型進行評分。

例如客服回答後,客戶按「有幫助」。

這個回饋可以和剛才那一次 Trace 連在一起。

接下來就不只知道:

這次花 0.03 美元。

還知道:

這個成果最後有沒有幫到使用者。

這才開始接近「每個可用成果成本」

假設一天產生 1,000 次 AI 回答。

總成本 30 美元。

直接計算:

每次平均 0.03 美元。

看起來非常便宜。

但如果只有 500 次真正解決使用者問題呢?

真正值得追蹤的可能變成:

每個有效成果成本。

也就是:

總模型成本除以真正可接受的成果數量。

這是 SasaDaily 建議企業建立的商業指標,不是 Langfuse 官方固定 KPI。

但 Langfuse 可以提供計算這個指標需要的底層資料:

  • 成本。
  • 使用量。
  • Trace。
  • 品質 Score。

它適合 Agent 嗎?

很適合。

因為 Agent 最容易出現的問題就是:

表面上一件工作,背後其實跑很多步。

例如:

幫我回答這個客戶的退款問題。

Agent 可能:

  • 先讀客服問題。
  • 搜尋訂單。
  • 查退款政策。
  • 讀會員狀態。
  • 重新判斷。
  • 生成回覆。

Langfuse 可以把這些步驟放進同一個 Trace。

如果第五步突然失敗,就比較容易找到問題。

這也是 Observability 真正有價值的地方。

不是只有系統掛掉才看紀錄。

而是了解 Agent 到底是怎麼完成工作的。

哪些模型與工具可以接?

Langfuse 官方目前提供大量整合方式。

包括常見的:

  • OpenAI。
  • LangChain 與 LangGraph。
  • Google ADK。
  • OpenAI Agents。
  • Claude Agent SDK。
  • CrewAI。
  • LiteLLM。
  • n8n。
  • Vercel AI SDK。

也可以透過 Python、JavaScript、OpenTelemetry 或 API 自己整合。

所以它不是只能監控某一家模型。

不過它不是給一般 ChatGPT 聊天帳號看的

這一點一定要說清楚。

如果你只是每月訂閱 ChatGPT Plus,平常打開 ChatGPT 聊天:

Langfuse 不會自動幫你分析 ChatGPT Plus 月費花在哪裡。

它主要是給:

  • 自己開發 AI App 的人。
  • 使用模型 API 的團隊。
  • 建立 AI Agent 的公司。
  • 使用 AI framework 的工程團隊。
  • 需要觀察正式 AI 工作流的人。

也就是 AI 已經開始進入「系統」之後,它才真正有價值。

會寫程式才能用嗎?

通常需要一定技術能力。

最常見的方式,是把 Langfuse SDK、OpenTelemetry 或現成整合加到你的 AI 應用裡。

如果原本已經使用 OpenAI SDK、LangChain、n8n 等工具,官方也提供對應整合。

所以它不像 ChatGPT 一樣:

註冊後立刻聊天。

比較像:

先裝進你的 AI 工作流程,之後再從儀表板看實際運行情況。

完全沒有技術背景的一般使用者,不必因為今天介紹它就立刻安裝。

最適合誰?

第一,小型 AI SaaS。

已經透過 API 提供 AI 功能,需要知道不同功能成本。

第二,有客服 Agent 的公司。

想知道每一類客服到底花多少、哪些問題常需要重試。

第三,使用 n8n 或 Agent Workflow 的團隊。

流程愈長,愈需要知道是哪一步出問題。

第四,正在換模型的團隊。

想比較成本、延遲與品質,而不是只看 Benchmark。

第五,開始被財務部門問 AI ROI 的企業。

至少先把底層 AI 成本分到各個功能與工作。

免費嗎?

Langfuse Cloud 目前有免費 Hobby 方案。

截至 2026 年 8 月 10 日,官方方案包含:

  • 每月 50,000 Units。
  • 30 天資料存取。
  • 2 名使用者。
  • 平台主要功能,但有使用限制。

不需要信用卡即可開始。

如果要進入正式環境,Cloud Core 方案目前從每月 29 美元起,並包含更高使用量與較長資料存取時間。

另外,Langfuse 本身也是開源專案。

官方提供 Self-hosted 版本,可以自行部署。

「50,000 Units」不是 50,000 次 AI 回答

這也是價格頁最容易看錯的地方。

Langfuse 的 Unit 是平台自己的計量單位。

不能直接理解成:

免費可以問 AI 五萬次。

Langfuse 收的是觀測平台本身的使用量。

你的 OpenAI、Anthropic、Google 或其他模型 API 費用,仍然另外向模型供應商支付。

兩張帳單是不同的。

Self-hosted 就完全沒有成本嗎?

Langfuse 的開源版本可以免費自架。

但「軟體免費」不代表整個系統零成本。

自己部署仍需要:

  • 伺服器。
  • 儲存空間。
  • 資料庫。
  • 備份。
  • 維護。
  • 工程時間。

所以小團隊不一定因為可以 Self-host 就應該第一天自己架。

可以先從 Cloud Hobby 了解工作方式。

最重要的第一個設定:不要一開始追蹤所有東西

如果公司已經有十個 Agent,第一次導入 Langfuse 不必一次全接。

先挑一個最常使用的流程。

例如:

客服 FAQ。

先記四件事情:

  • 每次成本。
  • 執行時間。
  • 是否成功完成。
  • 使用者是否接受答案。

跑一週。

這時你就會開始看到:

哪種問題特別貴。

哪種問題特別慢。

哪種回答便宜但一直被拒絕。

這些才是真正可以改善的地方。

不要第一天就做一百張 Dashboard

Observability 工具也很容易變成另一種形式的資料收藏。

公司可能開始追蹤:

  • Token。
  • Latency。
  • Trace。
  • Session。
  • 模型。
  • 版本。
  • 數十個 Score。

最後大家每天看漂亮圖表。

卻沒有人因此做任何決定。

所以真正實用的方法是:

每一個指標都要對應一個可能的動作。

例如:

成本過高 → 檢查 Prompt 或換模型。

速度過慢 → 找出最慢步驟。

品質太差 → 重新設計資料或 Prompt。

幾乎沒人使用 → 考慮停止這項功能。

Langfuse 不能直接告訴你 ROI

這點非常重要。

Langfuse 可以告訴你:

  • AI 花多少錢。
  • 用了多少次。
  • 跑多久。
  • 得到什麼評分。

但它不知道:

  • 客服人員原本一件工作花幾分鐘。
  • 這個回答有沒有避免退貨。
  • 客戶最後有沒有成交。
  • 員工省下的時間拿去做什麼。
  • 這項 AI 功能替公司增加多少收入。

這些資料仍然要由企業自己提供。

所以最成熟的使用方式不是:

Langfuse = ROI 工具。

而是:

Langfuse 提供 AI 成本與品質證據,再和真正的商業成果接起來。

一個最簡單的 AI 成本表

如果今天導入客服 AI,可以先建立五個指標:

  • 每件客服 AI 成本。
  • 平均完成時間。
  • 直接解決比例。
  • 轉真人比例。
  • 人工重新處理比例。

然後再和以前比較:

沒有 AI 時,一百件客服需要多少人工時間?

有 AI 後,需要多少?

這時才開始接近 Airbnb 今天公布的那種指標。

可以直接使用的 Langfuse 指標規劃 Prompt

你是我的 AI 工作流程觀測與成本設計顧問。 我要監控的 AI 工作是: [說明工作] 目前使用的模型與工具: [模型、API、Agent、n8n 等] 這項工作的真正商業目標: [例如減少客服時間、提高完成率、降低每件工作成本] 請不要替我設計一大堆沒有用途的 Dashboard。 請先建立最小可用的 Langfuse 追蹤方案。 一、Trace 名稱 替不同工作設計清楚名稱,讓我知道每筆成本屬於哪一種工作。 二、成本 我要追蹤哪些模型使用量與成本? 三、速度 哪些步驟應記錄 Latency? 四、品質 請設計 1 到 3 個最重要 Score。 優先使用真正可以判斷成果是否可用的指標。 五、失敗 哪些情況應該另外加 Tag,方便之後找出異常案例? 六、商業成果 列出 Langfuse 本身無法知道、但我必須從公司系統另外取得的資料。 例如: 人工處理時間、 成交、 退款、 人工修改、 客戶問題是否真正解決。 最後替我設計一張最小 KPI 清單,只保留 5 個指標。 每一個指標都必須回答: 看到它變差時,我下一步要做什麼? 不要把 Token 使用量、AI 呼叫次數或 Dashboard 數量直接當成 ROI。

資料隱私要特別注意

Langfuse 的價值來自記錄 AI 工作過程。

但這也代表 Trace 可能包含:

  • Prompt。
  • 模型輸出。
  • 工具執行資料。
  • 工作流程內容。

所以不能為了 Observability,反而把不必要的敏感資料全部送進記錄系統。

Langfuse 官方提供資料 Masking 方法。

例如可以在資料送出應用程式以前,先把敏感內容遮蔽。

如果有:

  • 客戶姓名。
  • Email。
  • 電話。
  • 身份資料。
  • 醫療資訊。
  • 付款資訊。

就應該先重新確認:

這些資料真的有必要被記錄嗎?

最安全的 Trace,不是記得最多。

而是:

記得足夠除錯與衡量,又沒有多收不必要的敏感資料。

今天最重要的判斷

當 AI 還只是自己聊天時,月底看到一張訂閱帳單可能就夠了。

但當 AI 開始:

  • 服務客戶。
  • 操作 Agent。
  • 接進網站。
  • 自動跑工作流。
  • 每天呼叫數千次 API。

只看總帳單就已經不夠。

你需要知道:

哪個功能在花錢?

哪一步最慢?

哪個 Prompt 改完反而更貴?

哪個便宜模型其實一直產生不能用的答案?

Langfuse 真正有價值的地方,就是把這些東西重新連起來。

但最後仍然要記住:

成本低,不代表有價值。

真正完整的答案還要再加上一個問題:

這次 AI 工作最後有沒有產生真正可以使用的成果?

當成本、速度、品質與商業結果開始放在同一張圖上,AI ROI 才不再只是感覺。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀