看到一款 AI 模型比原本使用的模型便宜十倍,很多人的第一個反應是:
那我是不是應該立刻全部換過去?
但模型單價比較低,不代表完成工作的總成本一定比較低。
新模型可能:
- 第一次就產生可用成果。
- 需要重新下指令兩次。
- 漏掉重要欄位。
- 格式正確,但內容判斷錯誤。
- 最後需要人工逐筆修改。
今天只學一個方法:
更換模型前,先用同一組二十個真實案例,比較模型費用、正確率與人工修改時間。
為什麼不能只看 API 價格?
API 價格通常依照模型讀取與產生的 Token 數量計算。
但企業真正付出的成本還包括:
- 員工準備資料的時間。
- 模型產生錯誤後的重試。
- 人工檢查與修改。
- 格式錯誤造成的流程中斷。
- 錯誤內容進入正式系統後的返工。
例如:
- 模型 A 處理二十個案例只花新台幣 10 元,但人工修改需要九十分鐘。
- 模型 B 花新台幣 80 元,但人工修改只需要十分鐘。
如果員工每小時完整成本是新台幣 500 元:
- 模型 A 的人工修改成本約為新台幣 750 元。
- 模型 B 的人工修改成本約為新台幣 83 元。
加上模型費用後,原本看起來較便宜的模型,總成本反而更高。
真正要比較的不是「一次呼叫多少錢」,而是「完成一份可以交付的成果總共花多少錢」。
第一步:挑出二十個真正代表工作的案例
不要只用一句簡單問題測試新模型。
應該從平常真正會交給 AI 的工作中,挑出二十個案例。
例如電商團隊要測試商品資料整理,可以選擇:
- 五筆資料完整的商品。
- 五筆缺少規格的商品。
- 五筆名稱相近、容易混淆的商品。
- 五筆包含多種尺寸或價格的商品。
客服團隊則可以選擇:
- 一般商品詢問。
- 配送進度問題。
- 退款要求。
- 情緒激動的客訴。
- 需要轉交真人的高風險案件。
這二十個案例不必非常多。
重點是要涵蓋:
- 一般情況。
- 資料缺漏。
- 容易判斷錯誤的情況。
- 真正會影響工作結果的例外。
如果只挑最簡單的案例,任何模型看起來都可能表現很好。
第二步:先準備正確答案與檢查標準
在測試模型前,先決定什麼叫做正確。
例如商品分類工作可以檢查:
- 分類是否正確。
- 品牌與規格是否保留。
- 缺少資料是否標示待確認。
- 是否自行虛構功能。
- 輸出欄位是否完整。
文件摘要可以檢查:
- 重要數字是否正確。
- 日期是否保留。
- 限制條件是否被省略。
- 結論是否超出原文。
- 是否附上原始位置。
先建立標準,是為了避免測試完成後只用「感覺這個回答比較好」判斷。
可以把每個案例分成:
- 正確:不需修改,可以直接進入下一步。
- 可修正:主要內容正確,但需要少量修改。
- 不可用:重要內容錯誤、漏掉關鍵條件或需要重做。
第三步:兩個模型使用完全相同的資料與指令
測試時,不要對新模型使用一份簡單 Prompt,對舊模型使用已經修改很多次的完整 Prompt。
兩邊應該使用:
- 相同的二十個案例。
- 相同的系統規則。
- 相同的使用者指令。
- 相同的輸出格式。
- 相同的檢查標準。
例如:
請依照指定分類規則處理這筆商品資料。只能使用原始資料中存在的內容,缺少資訊標示「待確認」,不得自行補充功能、價格或庫存。請輸出商品類別、產品名稱、規格、缺少資訊及需要人工確認的地方。
如果其中一個模型能使用更多背景資料、工具或不同的思考設定,也要記錄下來。
否則最後比較的可能不是模型,而是兩套不同的工作條件。
第四步:每個案例記錄四個數字
測試時,不需要建立複雜的分析系統。
先記錄四項就夠了:
- 模型費用:這次輸入與輸出的實際費用。
- 結果等級:正確、可修正或不可用。
- 重試次數:為了得到可用結果重新執行幾次。
- 修改時間:人工花多少分鐘修成可使用成果。
例如:
- 案例 1:正確,沒有重試,修改零分鐘。
- 案例 2:可修正,沒有重試,修改三分鐘。
- 案例 3:不可用,重試一次,最後修改八分鐘。
二十個案例完成後,就能看出:
- 哪個模型第一次成功的比例較高。
- 哪個模型比較常需要重試。
- 哪個模型最常在特殊案例出錯。
- 便宜的模型是否增加人工工作。
第五步:計算「每份可用成果」的總成本
可以使用一個簡單公式:
總成本=模型費用+人工修改成本+重試成本+錯誤返工成本。
人工修改成本可以這樣計算:
人工修改成本=修改分鐘數 ÷ 60 × 每小時人力成本。
假設二十個案例的結果如下:
模型 A:
- 模型費用:新台幣 12 元。
- 正確:十二筆。
- 可修正:六筆。
- 不可用:兩筆。
- 人工修改:六十分鐘。
模型 B:
- 模型費用:新台幣 90 元。
- 正確:十八筆。
- 可修正:兩筆。
- 不可用:零筆。
- 人工修改:十五分鐘。
如果每小時人力成本為新台幣 500 元:
- 模型 A 的模型加人工成本約為新台幣 512 元。
- 模型 B 的模型加人工成本約為新台幣 215 元。
模型 B 的 API 單價比較高,完成同一批可用成果的總成本卻比較低。
反過來,如果兩個模型的正確率與修改時間接近,模型 A 才可能真的更省錢。
第六步:不要只看平均正確率
模型二十題答對十八題,看起來有百分之九十正確率。
但還要確認答錯的是哪兩題。
如果錯誤出現在:
- 一般文字分類。
- 不重要的語氣差異。
- 容易人工修正的格式。
影響可能不大。
但如果錯誤出現在:
- 退款案件。
- 價格與數量。
- 個人資料。
- 合約期限。
- 安全風險分類。
即使整體正確率相同,也不適合直接進入自動化流程。
模型值不值得使用,不只看它錯幾次,也要看它錯在什麼地方,以及錯誤發生後會造成什麼影響。
可以直接使用這段測試 Prompt
請協助我測試這組二十個真實工作案例。所有案例必須使用相同規則與輸出格式。只能根據原始資料作答,缺少資訊標示「待確認」,不得自行補充。每個案例完成後,請另外標示「已確認內容、可能不確定內容、需要人工檢查內容」。不要因為前一個案例的答案修改後續規則,也不得跳過無法判斷的項目。
一分鐘實際操作
- 第一步:從真正工作中挑出二十個代表案例。
- 第二步:先寫下每題的正確答案與檢查標準。
- 第三步:用相同資料與 Prompt 測試兩個模型。
- 第四步:記錄費用、正確率、重試與修改分鐘數。
- 第五步:計算每份可用成果的總成本。
- 第六步:只把低風險且穩定通過的工作交給新模型。
二十題應該怎麼分配?
可以使用簡單的四組配置:
- 五題一般案例:最常發生、資料完整的工作。
- 五題缺漏案例:日期、數量或欄位不完整。
- 五題容易混淆案例:名稱接近、條件相似或版本不同。
- 五題高風險案例:涉及金額、個資、正式承諾或轉真人。
這能避免測試只反映模型處理正常情況的能力。
可以用模型自己評分嗎?
可以讓 AI 協助初步比較,但不能只依賴模型替自己打分數。
模型可能:
- 沒有發現自己的內容錯誤。
- 偏好文字較完整的答案。
- 忽略業務規則。
- 把格式正確誤認為內容正確。
比較可靠的做法是:
- 先建立人工確認的標準答案。
- 用程式或規則檢查固定欄位。
- 由了解工作的人抽查內容。
- 再讓另一個模型協助找出可能差異。
AI 可以協助評分,但真正的判斷標準必須來自你的工作需求。
測試時要使用真實客戶資料嗎?
不一定,也不建議在第一次測試時直接使用敏感原始資料。
可以使用:
- 已去除姓名與電話的歷史案例。
- 保留工作結構的模擬資料。
- 正式資料的測試副本。
- 已公開的文件。
即使只是測試,也要先移除:
- 身分證字號。
- 帳號密碼。
- 付款資料。
- 未公開合約。
- 不必要的客戶個資。
測試模型能力,不需要同時測試公司能否承受資料外洩。
測試結果很好,就可以全部自動化嗎?
不可以只靠二十題測試就全面放手。
二十題測試適合用來判斷:
- 是否值得進行下一階段測試。
- 哪些工作類型較適合新模型。
- 常見錯誤出現在哪裡。
- 大致的總成本差異。
正式導入時還要:
- 先處理少量真實案件。
- 保留人工核准。
- 追蹤錯誤與重試。
- 設定使用量與費用上限。
- 定期重新測試模型更新後的表現。
模型更新、Prompt 改變或資料類型變化後,原本的測試結果也可能失效。
哪些工作適合先換成低成本模型?
- 大量固定格式分類。
- 商品欄位整理。
- 客服訊息初步分流。
- 文件格式轉換。
- 能以規則檢查的摘要。
- 不會直接對外執行的初稿。
這些工作通常具有:
- 數量大。
- 規則明確。
- 容易檢查。
- 錯誤可以修正。
哪些工作不能只因為測試成本低就換模型?
- 付款與退款核准。
- 正式合約內容。
- 醫療與法律判斷。
- 員工錄取與解雇。
- 網站正式部署。
- 對客戶作出價格、庫存與交期承諾。
這些工作即使模型測試表現很好,也需要最低權限、人工確認與完整紀錄。
今天只記住一句話
看到模型價格降低,不要立即把所有工作搬過去。
先拿二十個真實案例,用相同資料、指令與標準比較:
- 模型花多少錢。
- 第一次有多少結果可以直接使用。
- 需要重試幾次。
- 人工修改花多少時間。
- 錯誤出現在什麼工作。
便宜模型真正值得使用的條件,不是 API 單價最低,而是完成同一份可用成果後,模型費用、人工修改與錯誤成本加起來仍然比較低。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。