不一定。

昨天我們開始替每一筆 AI 工作留下三種結果:

  • 可直接用。
  • 需人工修改。
  • 失敗。

假設一個月後,你發現:

92% 的 AI 成果都可以直接使用。

看起來非常漂亮。

但這仍然不能直接回答:

這個 AI 到底值不值得繼續花錢?

因為「品質很好」和「商業回報很好」,是兩個不同問題。

可直接用比例到底告訴你什麼?

它主要回答:

AI 產生的成果,有多少不需要人重新修改就能進入下一步?

例如一個 AI 客服系統一個月處理 1,000 件工作。

  • 900 件直接使用。
  • 80 件需要修改。
  • 20 件失敗。

那麼「可直接用比例」就是 90%。

這是一個很有價值的品質指標。

代表模型、Prompt、資料與工作流程目前可能相當穩定。

但它沒有告訴你:

  • 這 1,000 件工作原本值多少時間。
  • 模型總共花多少錢。
  • 80 件修改花多少人工。
  • 20 件失敗造成多少重做。
  • 這個 AI 最後替公司增加多少收入或避免多少成本。

所以它只回答了一半。

第一種情況:品質很好,但工作本來就很小

假設 AI 幫員工替每份文件重新命名。

一個月完成 2,000 次。

98% 都正確。

非常漂亮。

但原本人工重新命名一份文件只需要 10 秒。

2,000 次大約只是 5 小時 30 分鐘左右的工作。

如果為了完成這項自動化,需要:

  • 模型 API。
  • 自動化平台。
  • 工程維護。
  • 錯誤監控。

那麼即使 98% 可直接使用,也不代表這項工作一定值得自動化。

真正要比較的是:

省下來的價值,有沒有大於維持這套 AI 的全部成本。

第二種情況:可用比例比較低,反而可能更有價值

換一個例子。

AI 幫顧問閱讀長篇客戶資料,產生第一次研究摘要。

一個月只做 100 件。

其中:

  • 75 件可以直接進入下一步。
  • 20 件需要修改。
  • 5 件失敗。

可直接用比例只有 75%。

看起來遠低於剛才的 98%。

但假設原本每件需要人工閱讀 40 分鐘。

現在平均只需要 15 分鐘檢查。

每件平均節省 25 分鐘。

100 件就是約 41 小時 40 分鐘。

這時,即使「可直接用比例」比較低,整體商業價值仍可能高很多。

所以不能只拿:

98% 對 75%。

然後宣布第一個 AI 比較值得。

真正的問題是:每一份成果值多少?

這也是 AI ROI 最容易漏掉的地方。

不同工作的一次「成功」,價值可能完全不同。

例如:

  • 生成一個 Email 標題。
  • 整理一份 50 頁研究報告。
  • 回答一個客服常見問題。
  • 找出一筆錯誤帳務。
  • 準備一份正式提案初稿。

不能全部算成:

AI 成功一次。

更有意義的是問:

如果沒有 AI,人原本需要花多少時間或成本完成這件事?

第三種情況:直接可用很多,但根本沒有人需要

還有一個更容易忽略的問題。

假設公司建立一個 AI 報告系統。

每週自動產生 50 份報告。

其中 48 份品質都很好。

可直接用比例高達 96%。

但月底一查才發現:

真正有人打開的只有 6 份。

那麼問題根本不在模型品質。

而是:

公司正在自動化一件沒有人真正需要的工作。

這也是為什麼 Langfuse 可以讓你看品質、成本與使用量,但商業價值仍需要企業自己定義。

所以「有人使用」也要一起看

一項 AI 工作至少可以拆成四層。

第一層:有沒有成功執行?

系統有沒有正常完成。

第二層:成果能不能用?

可直接用、需修改、還是失敗。

第三層:成果有沒有人真的使用?

不是生成完就算。

第四層:使用之後有沒有產生價值?

例如:

  • 省時間。
  • 減少錯誤。
  • 多完成工作。
  • 增加收入。
  • 避免成本。

走到第四層,才比較接近 ROI。

另一個陷阱:人工修改時間太容易被藏掉

昨天我們特別把「需人工修改」獨立出來,就是因為這個成本最常消失。

假設:

模型 A 每次 API 成本 0.03 美元。

模型 B 每次只要 0.01 美元。

B 看起來便宜三分之二。

但如果:

模型 A 平均只需 30 秒人工確認。

模型 B 平均需要 4 分鐘修改。

那麼模型成本只是整張帳單的一小部分。

真正的成本應該包含:

  • 模型。
  • 平台。
  • 人工修改。
  • 失敗重做。
  • 維護。

所以「便宜模型」不一定代表「便宜工作」。

錯一次的代價,也不能只看平均

假設某個 AI 有 99% 可直接用。

只失敗 1%。

如果那 1% 只是:

商品文案少了一句話。

可能影響有限。

但如果那 1% 是:

  • 錯誤退款。
  • 寄錯客戶資料。
  • 錯誤報價。
  • 錯誤醫療建議。
  • 錯誤法律期限。

那麼單看 99% 成功率可能非常危險。

所以高風險工作還要另外看:

失敗一次會造成多大後果?

可直接用比例高,至少代表什麼?

它仍然是一個很有用的訊號。

通常可以表示:

  • 工作定義可能已經比較清楚。
  • Prompt 比較穩定。
  • 資料品質可能比較好。
  • 模型適合這項任務。
  • 人工修改需求比較少。

所以不要丟掉這個指標。

只是不要把它直接改名叫:

ROI。

最簡單的做法:品質旁邊再加兩個數字

如果團隊還小,不需要先做複雜財務模型。

除了:

可直接用/需修改/失敗。

再多記兩個東西。

第一:人工時間。

這次工作最後還花多少分鐘?

第二:工作價值。

這份成果最後有沒有真的被使用?

第一階段甚至可以只記:

  • 已使用。
  • 未使用。

這樣資料已經比只有模型帳單完整很多。

例如一百件客服工作

月底可以得到:

  • AI 成本:多少。
  • 可直接用:多少件。
  • 需人工修改:多少件。
  • 失敗:多少件。
  • 人工總共花多少時間。
  • 真正解決客戶問題:多少件。

這時才開始能回答:

AI 到底有沒有把客服工作變便宜。

Langfuse 可以幫到哪裡?

Langfuse 官方的 Metrics 可以同時觀察:

  • Quality。
  • Cost。
  • Latency。
  • Volume。

也可以依:

  • 模型。
  • 功能。
  • Prompt 版本。
  • 使用者。
  • Session。

拆開比較。

Score 則可以保存人工、使用者、程式或模型產生的品質評估。

所以我們昨天建立的:

可直接用。

需人工修改。

失敗。

可以成為其中一項品質資料。

但 Langfuse 不會自動知道:

你的員工時薪是多少。

這次客服有沒有避免退款。

這份提案有沒有成交。

省下的時間最後拿去做什麼。

這些仍然要從自己的公司資料補進來。

那 ROI 到底怎麼想最簡單?

不一定要第一天就做完整財務模型。

可以先用一個非常白話的問題:

我們為了這項 AI 總共付出了什麼,最後換回了什麼?

付出的:

  • AI API。
  • 軟體月費。
  • 人工檢查。
  • 修改時間。
  • 失敗重做。
  • 維護成本。

換回來的:

  • 省下時間。
  • 多完成工作。
  • 減少錯誤。
  • 增加收入。
  • 避免支出。

先把兩邊列完整,比急著算一個漂亮百分比更重要。

省下一小時,就等於賺到一小時薪水嗎?

也不一定。

假設 AI 讓員工每天省下一小時。

公司並沒有因此立刻少付一小時薪水。

真正的價值取決於:

那一小時最後去了哪裡?

可能拿去:

  • 多服務客戶。
  • 準備更多提案。
  • 減少加班。
  • 檢查品質。
  • 學習新能力。

如果省下的時間最後只是多開了一個空白時段,也不能全部假裝成已經進入銀行帳戶的現金。

這就是為什麼 ROI 不能只從 Langfuse 裡看

Langfuse 非常適合回答:

「AI 系統本身發生什麼?」

例如:

  • 花多少。
  • 跑多久。
  • 品質多少。
  • 哪個版本比較好。

企業自己的 ERP、CRM、客服或工作紀錄則回答:

「公司的生意發生什麼?」

例如:

  • 人工工時。
  • 成交。
  • 退貨。
  • 客服解決率。
  • 收入。

兩邊接起來,才是完整答案。

如果可用率很高,卻沒有 ROI,先檢查四件事

第一,工作本身價值太低。

自動化的是本來只花幾秒鐘的小工作。

第二,使用量太少。

工具很好,但一個月只用五次。

第三,隱藏成本太高。

人工檢查、維護與系統費用吃掉節省。

第四,成果沒有真正被使用。

AI 生產很多東西,但沒有改變最後工作。

反過來,可用率還不高就一定應該停嗎?

也不一定。

如果這項工作本身:

  • 非常耗時。
  • 出現頻率高。
  • AI 已經能大幅縮短第一階段工作。
  • 人工修改成本仍低於原本全部人工完成。

那麼它可能值得繼續改善。

這就是「改善」和「停止」要分開的原因。

不是所有還需要人工的 AI 都沒有價值。

可以直接使用的 AI ROI 檢查 Prompt

我要判斷一項 AI 工作是否值得繼續投入。 目前資料包括: AI 執行次數: [填寫] 可直接用比例: [填寫] 需人工修改比例: [填寫] 失敗比例: [填寫] 每月模型與平台成本: [填寫] 原本每件人工時間: [填寫] 使用 AI 後平均人工時間: [填寫] 每月真正被使用的成果數: [填寫] 請不要因為「可直接用比例很高」就直接判定 ROI 良好。 請依序檢查: 一、品質 可直接用比例是否足夠穩定? 二、隱藏人工 修改與失敗重做總共花多少時間? 三、使用 AI 產出的成果到底有多少真正進入正式工作? 四、價值 這項工作原本的人力、錯誤或等待成本是多少? 五、風險 一次失敗的最大可能損失是什麼? 不要只看平均成功率。 六、總成本 除了模型以外,還有哪些軟體、維護、人工與失敗成本? 最後把這項 AI 工作分類成: 保留: 目前已有清楚價值。 改善: 已有價值,但某個成本或品質問題仍需要處理。 停止: 目前產生的價值不足以支持成本。 如果資料不足,列出缺少的數字,不要自行宣稱 ROI 為正。

最容易做錯的一個公式

有些團隊會直接算:

AI 成功 90%。

所以 AI 帶來 90% 效率。

這是錯的。

成功率是品質指標。

效率還要看時間。

ROI 還要看成本與價值。

三個概念不能混在一起。

今天最重要的答案

「可直接用比例很高」是一個好消息。

它表示 AI 可能已經具有相當穩定的工作品質。

但要判斷值不值得繼續花錢,還要再問:

  • 原本這件工作有多貴?
  • AI 總成本是多少?
  • 人還要修改多久?
  • 成果有沒有人真正使用?
  • 省下來的時間變成什麼?
  • 失敗一次的代價有多大?

所以看到 95% 可用率時,不要立刻宣布:

「AI 導入成功。」

更好的下一個問題是:

「很好,那這 95% 最後替我們換回了什麼?」

品質是開始。

價值才是結果。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀