看到一款 AI 模型比原本使用的模型便宜十倍,很多人的第一個反應是:

那我是不是應該立刻全部換過去?

但模型單價比較低,不代表完成工作的總成本一定比較低。

新模型可能:

  • 第一次就產生可用成果。
  • 需要重新下指令兩次。
  • 漏掉重要欄位。
  • 格式正確,但內容判斷錯誤。
  • 最後需要人工逐筆修改。

今天只學一個方法:

更換模型前,先用同一組二十個真實案例,比較模型費用、正確率與人工修改時間。

為什麼不能只看 API 價格?

API 價格通常依照模型讀取與產生的 Token 數量計算。

但企業真正付出的成本還包括:

  • 員工準備資料的時間。
  • 模型產生錯誤後的重試。
  • 人工檢查與修改。
  • 格式錯誤造成的流程中斷。
  • 錯誤內容進入正式系統後的返工。

例如:

  • 模型 A 處理二十個案例只花新台幣 10 元,但人工修改需要九十分鐘。
  • 模型 B 花新台幣 80 元,但人工修改只需要十分鐘。

如果員工每小時完整成本是新台幣 500 元:

  • 模型 A 的人工修改成本約為新台幣 750 元。
  • 模型 B 的人工修改成本約為新台幣 83 元。

加上模型費用後,原本看起來較便宜的模型,總成本反而更高。

真正要比較的不是「一次呼叫多少錢」,而是「完成一份可以交付的成果總共花多少錢」。

第一步:挑出二十個真正代表工作的案例

不要只用一句簡單問題測試新模型。

應該從平常真正會交給 AI 的工作中,挑出二十個案例。

例如電商團隊要測試商品資料整理,可以選擇:

  • 五筆資料完整的商品。
  • 五筆缺少規格的商品。
  • 五筆名稱相近、容易混淆的商品。
  • 五筆包含多種尺寸或價格的商品。

客服團隊則可以選擇:

  • 一般商品詢問。
  • 配送進度問題。
  • 退款要求。
  • 情緒激動的客訴。
  • 需要轉交真人的高風險案件。

這二十個案例不必非常多。

重點是要涵蓋:

  • 一般情況。
  • 資料缺漏。
  • 容易判斷錯誤的情況。
  • 真正會影響工作結果的例外。

如果只挑最簡單的案例,任何模型看起來都可能表現很好。

第二步:先準備正確答案與檢查標準

在測試模型前,先決定什麼叫做正確。

例如商品分類工作可以檢查:

  • 分類是否正確。
  • 品牌與規格是否保留。
  • 缺少資料是否標示待確認。
  • 是否自行虛構功能。
  • 輸出欄位是否完整。

文件摘要可以檢查:

  • 重要數字是否正確。
  • 日期是否保留。
  • 限制條件是否被省略。
  • 結論是否超出原文。
  • 是否附上原始位置。

先建立標準,是為了避免測試完成後只用「感覺這個回答比較好」判斷。

可以把每個案例分成:

  • 正確:不需修改,可以直接進入下一步。
  • 可修正:主要內容正確,但需要少量修改。
  • 不可用:重要內容錯誤、漏掉關鍵條件或需要重做。

第三步:兩個模型使用完全相同的資料與指令

測試時,不要對新模型使用一份簡單 Prompt,對舊模型使用已經修改很多次的完整 Prompt。

兩邊應該使用:

  • 相同的二十個案例。
  • 相同的系統規則。
  • 相同的使用者指令。
  • 相同的輸出格式。
  • 相同的檢查標準。

例如:

請依照指定分類規則處理這筆商品資料。只能使用原始資料中存在的內容,缺少資訊標示「待確認」,不得自行補充功能、價格或庫存。請輸出商品類別、產品名稱、規格、缺少資訊及需要人工確認的地方。

如果其中一個模型能使用更多背景資料、工具或不同的思考設定,也要記錄下來。

否則最後比較的可能不是模型,而是兩套不同的工作條件。

第四步:每個案例記錄四個數字

測試時,不需要建立複雜的分析系統。

先記錄四項就夠了:

  • 模型費用:這次輸入與輸出的實際費用。
  • 結果等級:正確、可修正或不可用。
  • 重試次數:為了得到可用結果重新執行幾次。
  • 修改時間:人工花多少分鐘修成可使用成果。

例如:

  • 案例 1:正確,沒有重試,修改零分鐘。
  • 案例 2:可修正,沒有重試,修改三分鐘。
  • 案例 3:不可用,重試一次,最後修改八分鐘。

二十個案例完成後,就能看出:

  • 哪個模型第一次成功的比例較高。
  • 哪個模型比較常需要重試。
  • 哪個模型最常在特殊案例出錯。
  • 便宜的模型是否增加人工工作。

第五步:計算「每份可用成果」的總成本

可以使用一個簡單公式:

總成本=模型費用+人工修改成本+重試成本+錯誤返工成本。

人工修改成本可以這樣計算:

人工修改成本=修改分鐘數 ÷ 60 × 每小時人力成本。

假設二十個案例的結果如下:

模型 A:

  • 模型費用:新台幣 12 元。
  • 正確:十二筆。
  • 可修正:六筆。
  • 不可用:兩筆。
  • 人工修改:六十分鐘。

模型 B:

  • 模型費用:新台幣 90 元。
  • 正確:十八筆。
  • 可修正:兩筆。
  • 不可用:零筆。
  • 人工修改:十五分鐘。

如果每小時人力成本為新台幣 500 元:

  • 模型 A 的模型加人工成本約為新台幣 512 元。
  • 模型 B 的模型加人工成本約為新台幣 215 元。

模型 B 的 API 單價比較高,完成同一批可用成果的總成本卻比較低。

反過來,如果兩個模型的正確率與修改時間接近,模型 A 才可能真的更省錢。

第六步:不要只看平均正確率

模型二十題答對十八題,看起來有百分之九十正確率。

但還要確認答錯的是哪兩題。

如果錯誤出現在:

  • 一般文字分類。
  • 不重要的語氣差異。
  • 容易人工修正的格式。

影響可能不大。

但如果錯誤出現在:

  • 退款案件。
  • 價格與數量。
  • 個人資料。
  • 合約期限。
  • 安全風險分類。

即使整體正確率相同,也不適合直接進入自動化流程。

模型值不值得使用,不只看它錯幾次,也要看它錯在什麼地方,以及錯誤發生後會造成什麼影響。

可以直接使用這段測試 Prompt

請協助我測試這組二十個真實工作案例。所有案例必須使用相同規則與輸出格式。只能根據原始資料作答,缺少資訊標示「待確認」,不得自行補充。每個案例完成後,請另外標示「已確認內容、可能不確定內容、需要人工檢查內容」。不要因為前一個案例的答案修改後續規則,也不得跳過無法判斷的項目。

一分鐘實際操作

  • 第一步:從真正工作中挑出二十個代表案例。
  • 第二步:先寫下每題的正確答案與檢查標準。
  • 第三步:用相同資料與 Prompt 測試兩個模型。
  • 第四步:記錄費用、正確率、重試與修改分鐘數。
  • 第五步:計算每份可用成果的總成本。
  • 第六步:只把低風險且穩定通過的工作交給新模型。

二十題應該怎麼分配?

可以使用簡單的四組配置:

  • 五題一般案例:最常發生、資料完整的工作。
  • 五題缺漏案例:日期、數量或欄位不完整。
  • 五題容易混淆案例:名稱接近、條件相似或版本不同。
  • 五題高風險案例:涉及金額、個資、正式承諾或轉真人。

這能避免測試只反映模型處理正常情況的能力。

可以用模型自己評分嗎?

可以讓 AI 協助初步比較,但不能只依賴模型替自己打分數。

模型可能:

  • 沒有發現自己的內容錯誤。
  • 偏好文字較完整的答案。
  • 忽略業務規則。
  • 把格式正確誤認為內容正確。

比較可靠的做法是:

  • 先建立人工確認的標準答案。
  • 用程式或規則檢查固定欄位。
  • 由了解工作的人抽查內容。
  • 再讓另一個模型協助找出可能差異。

AI 可以協助評分,但真正的判斷標準必須來自你的工作需求。

測試時要使用真實客戶資料嗎?

不一定,也不建議在第一次測試時直接使用敏感原始資料。

可以使用:

  • 已去除姓名與電話的歷史案例。
  • 保留工作結構的模擬資料。
  • 正式資料的測試副本。
  • 已公開的文件。

即使只是測試,也要先移除:

  • 身分證字號。
  • 帳號密碼。
  • 付款資料。
  • 未公開合約。
  • 不必要的客戶個資。

測試模型能力,不需要同時測試公司能否承受資料外洩。

測試結果很好,就可以全部自動化嗎?

不可以只靠二十題測試就全面放手。

二十題測試適合用來判斷:

  • 是否值得進行下一階段測試。
  • 哪些工作類型較適合新模型。
  • 常見錯誤出現在哪裡。
  • 大致的總成本差異。

正式導入時還要:

  • 先處理少量真實案件。
  • 保留人工核准。
  • 追蹤錯誤與重試。
  • 設定使用量與費用上限。
  • 定期重新測試模型更新後的表現。

模型更新、Prompt 改變或資料類型變化後,原本的測試結果也可能失效。

哪些工作適合先換成低成本模型?

  • 大量固定格式分類。
  • 商品欄位整理。
  • 客服訊息初步分流。
  • 文件格式轉換。
  • 能以規則檢查的摘要。
  • 不會直接對外執行的初稿。

這些工作通常具有:

  • 數量大。
  • 規則明確。
  • 容易檢查。
  • 錯誤可以修正。

哪些工作不能只因為測試成本低就換模型?

  • 付款與退款核准。
  • 正式合約內容。
  • 醫療與法律判斷。
  • 員工錄取與解雇。
  • 網站正式部署。
  • 對客戶作出價格、庫存與交期承諾。

這些工作即使模型測試表現很好,也需要最低權限、人工確認與完整紀錄。

今天只記住一句話

看到模型價格降低,不要立即把所有工作搬過去。

先拿二十個真實案例,用相同資料、指令與標準比較:

  • 模型花多少錢。
  • 第一次有多少結果可以直接使用。
  • 需要重試幾次。
  • 人工修改花多少時間。
  • 錯誤出現在什麼工作。

便宜模型真正值得使用的條件,不是 API 單價最低,而是完成同一份可用成果後,模型費用、人工修改與錯誤成本加起來仍然比較低。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀