不一定。
昨天我們開始替每一筆 AI 工作留下三種結果:
- 可直接用。
- 需人工修改。
- 失敗。
假設一個月後,你發現:
92% 的 AI 成果都可以直接使用。
看起來非常漂亮。
但這仍然不能直接回答:
這個 AI 到底值不值得繼續花錢?
因為「品質很好」和「商業回報很好」,是兩個不同問題。
可直接用比例到底告訴你什麼?
它主要回答:
AI 產生的成果,有多少不需要人重新修改就能進入下一步?
例如一個 AI 客服系統一個月處理 1,000 件工作。
- 900 件直接使用。
- 80 件需要修改。
- 20 件失敗。
那麼「可直接用比例」就是 90%。
這是一個很有價值的品質指標。
代表模型、Prompt、資料與工作流程目前可能相當穩定。
但它沒有告訴你:
- 這 1,000 件工作原本值多少時間。
- 模型總共花多少錢。
- 80 件修改花多少人工。
- 20 件失敗造成多少重做。
- 這個 AI 最後替公司增加多少收入或避免多少成本。
所以它只回答了一半。
第一種情況:品質很好,但工作本來就很小
假設 AI 幫員工替每份文件重新命名。
一個月完成 2,000 次。
98% 都正確。
非常漂亮。
但原本人工重新命名一份文件只需要 10 秒。
2,000 次大約只是 5 小時 30 分鐘左右的工作。
如果為了完成這項自動化,需要:
- 模型 API。
- 自動化平台。
- 工程維護。
- 錯誤監控。
那麼即使 98% 可直接使用,也不代表這項工作一定值得自動化。
真正要比較的是:
省下來的價值,有沒有大於維持這套 AI 的全部成本。
第二種情況:可用比例比較低,反而可能更有價值
換一個例子。
AI 幫顧問閱讀長篇客戶資料,產生第一次研究摘要。
一個月只做 100 件。
其中:
- 75 件可以直接進入下一步。
- 20 件需要修改。
- 5 件失敗。
可直接用比例只有 75%。
看起來遠低於剛才的 98%。
但假設原本每件需要人工閱讀 40 分鐘。
現在平均只需要 15 分鐘檢查。
每件平均節省 25 分鐘。
100 件就是約 41 小時 40 分鐘。
這時,即使「可直接用比例」比較低,整體商業價值仍可能高很多。
所以不能只拿:
98% 對 75%。
然後宣布第一個 AI 比較值得。
真正的問題是:每一份成果值多少?
這也是 AI ROI 最容易漏掉的地方。
不同工作的一次「成功」,價值可能完全不同。
例如:
- 生成一個 Email 標題。
- 整理一份 50 頁研究報告。
- 回答一個客服常見問題。
- 找出一筆錯誤帳務。
- 準備一份正式提案初稿。
不能全部算成:
AI 成功一次。
更有意義的是問:
如果沒有 AI,人原本需要花多少時間或成本完成這件事?
第三種情況:直接可用很多,但根本沒有人需要
還有一個更容易忽略的問題。
假設公司建立一個 AI 報告系統。
每週自動產生 50 份報告。
其中 48 份品質都很好。
可直接用比例高達 96%。
但月底一查才發現:
真正有人打開的只有 6 份。
那麼問題根本不在模型品質。
而是:
公司正在自動化一件沒有人真正需要的工作。
這也是為什麼 Langfuse 可以讓你看品質、成本與使用量,但商業價值仍需要企業自己定義。
所以「有人使用」也要一起看
一項 AI 工作至少可以拆成四層。
第一層:有沒有成功執行?
系統有沒有正常完成。
第二層:成果能不能用?
可直接用、需修改、還是失敗。
第三層:成果有沒有人真的使用?
不是生成完就算。
第四層:使用之後有沒有產生價值?
例如:
- 省時間。
- 減少錯誤。
- 多完成工作。
- 增加收入。
- 避免成本。
走到第四層,才比較接近 ROI。
另一個陷阱:人工修改時間太容易被藏掉
昨天我們特別把「需人工修改」獨立出來,就是因為這個成本最常消失。
假設:
模型 A 每次 API 成本 0.03 美元。
模型 B 每次只要 0.01 美元。
B 看起來便宜三分之二。
但如果:
模型 A 平均只需 30 秒人工確認。
模型 B 平均需要 4 分鐘修改。
那麼模型成本只是整張帳單的一小部分。
真正的成本應該包含:
- 模型。
- 平台。
- 人工修改。
- 失敗重做。
- 維護。
所以「便宜模型」不一定代表「便宜工作」。
錯一次的代價,也不能只看平均
假設某個 AI 有 99% 可直接用。
只失敗 1%。
如果那 1% 只是:
商品文案少了一句話。
可能影響有限。
但如果那 1% 是:
- 錯誤退款。
- 寄錯客戶資料。
- 錯誤報價。
- 錯誤醫療建議。
- 錯誤法律期限。
那麼單看 99% 成功率可能非常危險。
所以高風險工作還要另外看:
失敗一次會造成多大後果?
可直接用比例高,至少代表什麼?
它仍然是一個很有用的訊號。
通常可以表示:
- 工作定義可能已經比較清楚。
- Prompt 比較穩定。
- 資料品質可能比較好。
- 模型適合這項任務。
- 人工修改需求比較少。
所以不要丟掉這個指標。
只是不要把它直接改名叫:
ROI。
最簡單的做法:品質旁邊再加兩個數字
如果團隊還小,不需要先做複雜財務模型。
除了:
可直接用/需修改/失敗。
再多記兩個東西。
第一:人工時間。
這次工作最後還花多少分鐘?
第二:工作價值。
這份成果最後有沒有真的被使用?
第一階段甚至可以只記:
- 已使用。
- 未使用。
這樣資料已經比只有模型帳單完整很多。
例如一百件客服工作
月底可以得到:
- AI 成本:多少。
- 可直接用:多少件。
- 需人工修改:多少件。
- 失敗:多少件。
- 人工總共花多少時間。
- 真正解決客戶問題:多少件。
這時才開始能回答:
AI 到底有沒有把客服工作變便宜。
Langfuse 可以幫到哪裡?
Langfuse 官方的 Metrics 可以同時觀察:
- Quality。
- Cost。
- Latency。
- Volume。
也可以依:
- 模型。
- 功能。
- Prompt 版本。
- 使用者。
- Session。
拆開比較。
Score 則可以保存人工、使用者、程式或模型產生的品質評估。
所以我們昨天建立的:
可直接用。
需人工修改。
失敗。
可以成為其中一項品質資料。
但 Langfuse 不會自動知道:
你的員工時薪是多少。
這次客服有沒有避免退款。
這份提案有沒有成交。
省下的時間最後拿去做什麼。
這些仍然要從自己的公司資料補進來。
那 ROI 到底怎麼想最簡單?
不一定要第一天就做完整財務模型。
可以先用一個非常白話的問題:
我們為了這項 AI 總共付出了什麼,最後換回了什麼?
付出的:
- AI API。
- 軟體月費。
- 人工檢查。
- 修改時間。
- 失敗重做。
- 維護成本。
換回來的:
- 省下時間。
- 多完成工作。
- 減少錯誤。
- 增加收入。
- 避免支出。
先把兩邊列完整,比急著算一個漂亮百分比更重要。
省下一小時,就等於賺到一小時薪水嗎?
也不一定。
假設 AI 讓員工每天省下一小時。
公司並沒有因此立刻少付一小時薪水。
真正的價值取決於:
那一小時最後去了哪裡?
可能拿去:
- 多服務客戶。
- 準備更多提案。
- 減少加班。
- 檢查品質。
- 學習新能力。
如果省下的時間最後只是多開了一個空白時段,也不能全部假裝成已經進入銀行帳戶的現金。
這就是為什麼 ROI 不能只從 Langfuse 裡看
Langfuse 非常適合回答:
「AI 系統本身發生什麼?」
例如:
- 花多少。
- 跑多久。
- 品質多少。
- 哪個版本比較好。
企業自己的 ERP、CRM、客服或工作紀錄則回答:
「公司的生意發生什麼?」
例如:
- 人工工時。
- 成交。
- 退貨。
- 客服解決率。
- 收入。
兩邊接起來,才是完整答案。
如果可用率很高,卻沒有 ROI,先檢查四件事
第一,工作本身價值太低。
自動化的是本來只花幾秒鐘的小工作。
第二,使用量太少。
工具很好,但一個月只用五次。
第三,隱藏成本太高。
人工檢查、維護與系統費用吃掉節省。
第四,成果沒有真正被使用。
AI 生產很多東西,但沒有改變最後工作。
反過來,可用率還不高就一定應該停嗎?
也不一定。
如果這項工作本身:
- 非常耗時。
- 出現頻率高。
- AI 已經能大幅縮短第一階段工作。
- 人工修改成本仍低於原本全部人工完成。
那麼它可能值得繼續改善。
這就是「改善」和「停止」要分開的原因。
不是所有還需要人工的 AI 都沒有價值。
可以直接使用的 AI ROI 檢查 Prompt
我要判斷一項 AI 工作是否值得繼續投入。 目前資料包括: AI 執行次數: [填寫] 可直接用比例: [填寫] 需人工修改比例: [填寫] 失敗比例: [填寫] 每月模型與平台成本: [填寫] 原本每件人工時間: [填寫] 使用 AI 後平均人工時間: [填寫] 每月真正被使用的成果數: [填寫] 請不要因為「可直接用比例很高」就直接判定 ROI 良好。 請依序檢查: 一、品質 可直接用比例是否足夠穩定? 二、隱藏人工 修改與失敗重做總共花多少時間? 三、使用 AI 產出的成果到底有多少真正進入正式工作? 四、價值 這項工作原本的人力、錯誤或等待成本是多少? 五、風險 一次失敗的最大可能損失是什麼? 不要只看平均成功率。 六、總成本 除了模型以外,還有哪些軟體、維護、人工與失敗成本? 最後把這項 AI 工作分類成: 保留: 目前已有清楚價值。 改善: 已有價值,但某個成本或品質問題仍需要處理。 停止: 目前產生的價值不足以支持成本。 如果資料不足,列出缺少的數字,不要自行宣稱 ROI 為正。
最容易做錯的一個公式
有些團隊會直接算:
AI 成功 90%。
所以 AI 帶來 90% 效率。
這是錯的。
成功率是品質指標。
效率還要看時間。
ROI 還要看成本與價值。
三個概念不能混在一起。
今天最重要的答案
「可直接用比例很高」是一個好消息。
它表示 AI 可能已經具有相當穩定的工作品質。
但要判斷值不值得繼續花錢,還要再問:
- 原本這件工作有多貴?
- AI 總成本是多少?
- 人還要修改多久?
- 成果有沒有人真正使用?
- 省下來的時間變成什麼?
- 失敗一次的代價有多大?
所以看到 95% 可用率時,不要立刻宣布:
「AI 導入成功。」
更好的下一個問題是:
「很好,那這 95% 最後替我們換回了什麼?」
品質是開始。
價值才是結果。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。