使用 AI 處理工作時,最常遇到的問題,不一定是它完全不會做。
更常見的情況是:AI 能提出正確方向,卻在任務進行到一半時停下來,留下剩餘步驟讓使用者自己完成。
例如你請 AI 修正網站問題,它可能找出可能出錯的程式,卻沒有建立測試、完成修改並重新確認結果。
Claude Sonnet 5 想改善的,就是這種「知道怎麼做,卻沒有真正把工作做完」的落差。
Claude Sonnet 5 是什麼?
Claude Sonnet 5 是 Anthropic 推出的新一代 Sonnet 級模型。
Sonnet 系列的定位,通常介於速度、能力與使用成本之間,適合大量日常工作,不必每次都使用價格較高的 Opus 級模型。
Claude Sonnet 5 可以:
- 理解較複雜的工作要求。
- 先建立執行計畫。
- 使用瀏覽器、終端機及其他已授權工具。
- 持續完成多個相互連接的步驟。
- 撰寫、測試與修正程式。
- 搜尋資料並整理知識工作成果。
- 在完成前主動檢查部分輸出。
它不是一套獨立的新應用程式,而是目前 Claude、Claude Code、Claude Platform 與相關工作環境可以選用的模型。
Claude Sonnet 5 的重點不是回答得更長,而是讓中等成本的模型也能把規劃、執行、檢查連成一段完整工作。
它和 Claude Opus 5 有什麼不同?
Opus 系列通常適合能力要求最高、執行時間較長,或需要更深度判斷的工作。
Sonnet 5 則更偏向日常大量使用。
可以簡單理解為:
- Sonnet 5:適合日常程式修改、資料搜尋、文件處理與多步驟自動化。
- Opus 級模型:適合高難度研究、複雜系統設計及需要更強判斷的任務。
Anthropic 表示,Sonnet 5 在部分高努力程度的代理工作中,可以接近 Claude Opus 4.8 的能力,但價格較低。
不過,這不代表 Sonnet 5 在所有任務上都能取代 Opus。
當工作涉及重大商業決策、高風險資安、長篇專業研究或很難重新修正的操作時,仍應依任務選擇模型,並增加人工審查。
第一個實用場景:讓它把程式問題處理到可以測試
一般 AI 協助修改程式時,可能只提供一段建議程式碼。
Sonnet 5 更適合被要求完成一段較完整的處理流程:
- 閱讀錯誤訊息。
- 搜尋相關程式檔案。
- 找出可能的根本原因。
- 先建立能重現問題的測試。
- 修改程式。
- 重新執行測試。
- 說明修改了什麼。
例如可以輸入:
請先重現這個錯誤,再找出根本原因。修改前建立測試,修改後重新執行相關測試。不要直接變更正式環境,也不要修改與本問題無關的檔案。完成後列出修改檔案、測試結果與仍需人工確認的風險。
這類指令比單純要求「幫我修好」更安全。
它可以直接修改正式網站嗎?
只有在取得工具與權限後,模型才可能執行實際操作。
但即使技術上做得到,也不建議一開始就讓它直接改正式網站。
比較安全的流程是:
- 先在本機或測試環境重現問題。
- 限制可修改的檔案範圍。
- 完成自動測試與人工查看。
- 建立可復原的備份。
- 由人批准後才部署。
模型能力變強,不能取代備份、測試與部署規則。
能把程式修改完成,和有權把修改送進正式系統,是兩件不同的事。
第二個實用場景:完成多步驟資料研究
Sonnet 5 可以先建立研究計畫,再使用瀏覽器或其他資料工具執行。
例如你想比較三套 AI 工具,不必只要求它列出功能。
可以要求它:
- 先定義比較條件。
- 查詢官方產品資訊。
- 分開記錄價格、方案與限制。
- 標示不同資料的更新日期。
- 整理成比較表。
- 列出仍無法確認的項目。
可以使用:
請比較這三項工具,但先列出比較標準與預計使用的來源。價格、支援平台、方案與功能只能採用官方資料。遇到未公布或資料不一致時請標示,不能自行補齊。完成後提供適用情境、限制與需要我再次確認的項目。
這能減少 AI 為了交出完整表格,而把沒有查到的資訊自行補成答案。
第三個實用場景:讓日常自動化不再做到一半
企業自動化通常不是只有一個動作。
例如處理一筆新的客戶詢問,可能要:
- 讀取表單內容。
- 確認必要資料是否完整。
- 查找客戶過往紀錄。
- 建立案件摘要。
- 準備回覆草稿。
- 把待辦交給正確負責人。
- 等待人工批准後寄出。
較早的模型可能完成前幾步後停止,或在不同工具之間遺失任務背景。
Anthropic 將 Sonnet 5 的改進重點放在持續執行與工具使用,讓模型比較能沿著原定計畫完成後續工作。
但企業仍需要清楚設定:
- 哪些資料可以讀取。
- 哪些動作可以直接完成。
- 哪些操作必須等待人工批准。
- 發生什麼情況要立即停止。
第四個實用場景:處理舊系統與複雜專案
新程式通常有較清楚的結構與文件。
真正困難的,往往是已經運作多年的舊專案。
這類專案可能存在:
- 不同年代留下的程式寫法。
- 缺少文件的功能。
- 相互影響的舊模組。
- 不完整的測試。
- 修改一處、另一處跟著出錯的問題。
Sonnet 5 可以協助探索專案、追蹤錯誤來源及修改多個相互關聯的部分。
使用時仍應限制:
- 不要一次大範圍重寫整個專案。
- 先找出受影響檔案與依賴關係。
- 每一批修改都要能單獨測試。
- 不要刪除看不懂但仍在使用的舊程式。
- 保留回復修改的方法。
第五個實用場景:大量處理文件與知識工作
除了程式工作,Sonnet 5 也適合處理:
- 多份文件比較。
- 研究資料整理。
- 合約條款初步分類。
- 會議資料與待辦整合。
- 報告與簡報初稿。
- 跨資料來源的內容檢查。
例如準備一份提案時,可以要求它先閱讀客戶需求、公司資料與過往提案,再建立本次內容。
但要禁止它把不同客戶的條件混在一起。
可以輸入:
請只使用本次提供的客戶需求與已核准公司資料建立提案。過往提案只能參考結構,不得沿用其他客戶的價格、日期、姓名或承諾。完成後列出每項重要資訊的來源,沒有正式依據的內容標示待確認。
Claude 免費版也能使用嗎?
可以。
Anthropic 表示,Claude Sonnet 5 已成為 Claude 免費版與 Pro 版的預設模型。
Max、Team 與 Enterprise 使用者也能使用,並可在 Claude Code 與 Claude Platform 中選擇。
不過,免費版可以使用模型,不代表擁有無限制用量或所有企業功能。
實際能執行多長的任務、使用多少工具及處理多少資料,仍可能受到帳號方案、使用額度與管理員設定影響。
API 價格是多少?
Anthropic 公布的限時價格為:
- 每百萬輸入 Token 2 美元。
- 每百萬輸出 Token 10 美元。
這項價格預計維持至 2026 年 8 月 31 日。
之後標準價格將調整為:
- 每百萬輸入 Token 3 美元。
- 每百萬輸出 Token 15 美元。
開發者還要注意,Sonnet 5 使用更新後的 Tokenizer,相同文字可能比上一代計算出更多 Token。
因此,不能只比較表面單價。
真正要計算的是,一項任務完成到可接受成果,總共需要多少輸入、輸出、重試與人工修改。
什麼是努力程度?
Sonnet 5 可以依照任務調整推理與執行的努力程度。
較低的努力程度適合:
- 簡單摘要。
- 格式整理。
- 短文改寫。
- 一般資料查詢。
較高的努力程度適合:
- 複雜程式錯誤。
- 跨多個工具的工作。
- 長時間資料研究。
- 需要反覆檢查的專業任務。
努力程度提高,通常也會使用更多 Token 與時間。
最好的做法不是所有任務都開到最高,而是依照工作的難度與風險調整。
它會主動檢查自己的成果嗎?
Anthropic 的早期測試回饋顯示,Sonnet 5 在部分任務中會主動建立測試、檢查修改或持續完成剩餘步驟。
這是一項實用改進,但不能把模型的自我檢查當成獨立驗證。
原因包括:
- 模型可能使用相同的錯誤假設檢查自己。
- 測試可能沒有涵蓋真正的例外情況。
- 資料來源本身可能已經過期。
- 程式通過測試,不代表符合商業需求。
模型自我檢查適合當成第一層品質控制,正式成果仍要由人確認。
安全性有什麼改進?
Anthropic 表示,Sonnet 5 相較 Sonnet 4.6:
- 更能拒絕惡意要求。
- 較能抵抗提示注入攻擊。
- 出現幻覺與迎合使用者的比例較低。
- 整體不理想行為比例較低。
不過,官方評估也顯示,它在部分不理想行為測試中,仍不如能力更高的 Opus 4.8 與 Claude Mythos Preview。
因此,「比上一代安全」不能被理解成「已經不會出錯或越權」。
安全評估代表模型在測試中的風險較低,不代表企業可以取消權限限制、監控與人工批准。
它適合用來做資安工作嗎?
Sonnet 5 可以處理部分一般、合法的資安工作。
例如:
- 整理弱點報告。
- 檢查安全設定。
- 分析一般程式問題。
- 協助撰寫防禦性測試。
Anthropic 表示,Sonnet 5 並未特別針對高階資安能力訓練,在危險攻擊能力的評估中,明顯低於目前的 Opus 級模型。
系統仍會啟用即時資安防護,偵測及阻擋危險用途。
企業不能因為模型能使用終端機,就直接讓它接觸正式網路、密碼或高權限帳號。
哪些工作適合先用 Sonnet 5?
- 網站錯誤調查與測試環境修正。
- 多份公開資料的比較研究。
- 內部文件與會議資料整理。
- 低風險工作流程自動化。
- 重複性的程式修改與測試。
- 需要控制成本的大量 AI 任務。
哪些工作不應直接完全交給它?
- 未備份的正式網站修改。
- 未經核准的付款與交易。
- 正式合約、法律或醫療決定。
- 直接寄送大量外部訊息。
- 刪除無法復原的重要資料。
- 使用最高權限操作公司系統。
- 沒有獨立驗證的高風險資安任務。
第一次使用,可以從這段 Prompt 開始
請先不要直接執行。請把這項工作分成「目標、使用資料、預計步驟、會使用的工具、人工確認點、完成標準」六個部分。標示哪些步驟可以安全執行,哪些涉及正式資料、外部訊息、帳號權限或不可逆操作,必須等待我批准。計畫確認後再逐步執行;每完成一個階段,先回報結果與異常,不得自行擴大權限或工作範圍。
這段指令能讓 Sonnet 5 的代理能力,建立在較清楚的工作邊界內。
怎麼判斷 Sonnet 5 是否比原本流程更有效?
不要只看它完成多少次對話。
可以比較:
- 一項工作從開始到完成需要多久。
- 中途停止、需要人工接手的次數。
- 成果需要修改多少次。
- 每個可接受成果的實際 Token 成本。
- 錯誤與復原次數是否下降。
- 模型是否遵守資料與權限範圍。
較低模型價格只有在成果真的能使用時,才會轉變成實際節省。
今天最重要的判斷
Claude Sonnet 5 的價值,不是讓所有人改用另一個聊天模型。
更重要的改變是,中等成本的模型也開始具備較完整的代理能力:
- 先規劃。
- 使用工具。
- 持續執行。
- 檢查成果。
- 完成多步驟工作。
這讓個人與企業不必每次都使用最昂貴的模型,也能處理更多真實工作。
但能力提高後,權限、測試、監控與人工批准反而更重要。
Claude Sonnet 5 最適合的定位,不是完全取代工作者,而是成為能把日常任務往前推到接近完成,再由人負責最後判斷與正式交付的執行型助手。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。