使用 AI 處理工作時,最常遇到的問題,不一定是它完全不會做。

更常見的情況是:AI 能提出正確方向,卻在任務進行到一半時停下來,留下剩餘步驟讓使用者自己完成。

例如你請 AI 修正網站問題,它可能找出可能出錯的程式,卻沒有建立測試、完成修改並重新確認結果。

Claude Sonnet 5 想改善的,就是這種「知道怎麼做,卻沒有真正把工作做完」的落差。

Claude Sonnet 5 是什麼?

Claude Sonnet 5 是 Anthropic 推出的新一代 Sonnet 級模型。

Sonnet 系列的定位,通常介於速度、能力與使用成本之間,適合大量日常工作,不必每次都使用價格較高的 Opus 級模型。

Claude Sonnet 5 可以:

  • 理解較複雜的工作要求。
  • 先建立執行計畫。
  • 使用瀏覽器、終端機及其他已授權工具。
  • 持續完成多個相互連接的步驟。
  • 撰寫、測試與修正程式。
  • 搜尋資料並整理知識工作成果。
  • 在完成前主動檢查部分輸出。

它不是一套獨立的新應用程式,而是目前 Claude、Claude Code、Claude Platform 與相關工作環境可以選用的模型。

Claude Sonnet 5 的重點不是回答得更長,而是讓中等成本的模型也能把規劃、執行、檢查連成一段完整工作。

它和 Claude Opus 5 有什麼不同?

Opus 系列通常適合能力要求最高、執行時間較長,或需要更深度判斷的工作。

Sonnet 5 則更偏向日常大量使用。

可以簡單理解為:

  • Sonnet 5:適合日常程式修改、資料搜尋、文件處理與多步驟自動化。
  • Opus 級模型:適合高難度研究、複雜系統設計及需要更強判斷的任務。

Anthropic 表示,Sonnet 5 在部分高努力程度的代理工作中,可以接近 Claude Opus 4.8 的能力,但價格較低。

不過,這不代表 Sonnet 5 在所有任務上都能取代 Opus。

當工作涉及重大商業決策、高風險資安、長篇專業研究或很難重新修正的操作時,仍應依任務選擇模型,並增加人工審查。

第一個實用場景:讓它把程式問題處理到可以測試

一般 AI 協助修改程式時,可能只提供一段建議程式碼。

Sonnet 5 更適合被要求完成一段較完整的處理流程:

  • 閱讀錯誤訊息。
  • 搜尋相關程式檔案。
  • 找出可能的根本原因。
  • 先建立能重現問題的測試。
  • 修改程式。
  • 重新執行測試。
  • 說明修改了什麼。

例如可以輸入:

請先重現這個錯誤,再找出根本原因。修改前建立測試,修改後重新執行相關測試。不要直接變更正式環境,也不要修改與本問題無關的檔案。完成後列出修改檔案、測試結果與仍需人工確認的風險。

這類指令比單純要求「幫我修好」更安全。

它可以直接修改正式網站嗎?

只有在取得工具與權限後,模型才可能執行實際操作。

但即使技術上做得到,也不建議一開始就讓它直接改正式網站。

比較安全的流程是:

  • 先在本機或測試環境重現問題。
  • 限制可修改的檔案範圍。
  • 完成自動測試與人工查看。
  • 建立可復原的備份。
  • 由人批准後才部署。

模型能力變強,不能取代備份、測試與部署規則。

能把程式修改完成,和有權把修改送進正式系統,是兩件不同的事。

第二個實用場景:完成多步驟資料研究

Sonnet 5 可以先建立研究計畫,再使用瀏覽器或其他資料工具執行。

例如你想比較三套 AI 工具,不必只要求它列出功能。

可以要求它:

  • 先定義比較條件。
  • 查詢官方產品資訊。
  • 分開記錄價格、方案與限制。
  • 標示不同資料的更新日期。
  • 整理成比較表。
  • 列出仍無法確認的項目。

可以使用:

請比較這三項工具,但先列出比較標準與預計使用的來源。價格、支援平台、方案與功能只能採用官方資料。遇到未公布或資料不一致時請標示,不能自行補齊。完成後提供適用情境、限制與需要我再次確認的項目。

這能減少 AI 為了交出完整表格,而把沒有查到的資訊自行補成答案。

第三個實用場景:讓日常自動化不再做到一半

企業自動化通常不是只有一個動作。

例如處理一筆新的客戶詢問,可能要:

  • 讀取表單內容。
  • 確認必要資料是否完整。
  • 查找客戶過往紀錄。
  • 建立案件摘要。
  • 準備回覆草稿。
  • 把待辦交給正確負責人。
  • 等待人工批准後寄出。

較早的模型可能完成前幾步後停止,或在不同工具之間遺失任務背景。

Anthropic 將 Sonnet 5 的改進重點放在持續執行與工具使用,讓模型比較能沿著原定計畫完成後續工作。

但企業仍需要清楚設定:

  • 哪些資料可以讀取。
  • 哪些動作可以直接完成。
  • 哪些操作必須等待人工批准。
  • 發生什麼情況要立即停止。

第四個實用場景:處理舊系統與複雜專案

新程式通常有較清楚的結構與文件。

真正困難的,往往是已經運作多年的舊專案。

這類專案可能存在:

  • 不同年代留下的程式寫法。
  • 缺少文件的功能。
  • 相互影響的舊模組。
  • 不完整的測試。
  • 修改一處、另一處跟著出錯的問題。

Sonnet 5 可以協助探索專案、追蹤錯誤來源及修改多個相互關聯的部分。

使用時仍應限制:

  • 不要一次大範圍重寫整個專案。
  • 先找出受影響檔案與依賴關係。
  • 每一批修改都要能單獨測試。
  • 不要刪除看不懂但仍在使用的舊程式。
  • 保留回復修改的方法。

第五個實用場景:大量處理文件與知識工作

除了程式工作,Sonnet 5 也適合處理:

  • 多份文件比較。
  • 研究資料整理。
  • 合約條款初步分類。
  • 會議資料與待辦整合。
  • 報告與簡報初稿。
  • 跨資料來源的內容檢查。

例如準備一份提案時,可以要求它先閱讀客戶需求、公司資料與過往提案,再建立本次內容。

但要禁止它把不同客戶的條件混在一起。

可以輸入:

請只使用本次提供的客戶需求與已核准公司資料建立提案。過往提案只能參考結構,不得沿用其他客戶的價格、日期、姓名或承諾。完成後列出每項重要資訊的來源,沒有正式依據的內容標示待確認。

Claude 免費版也能使用嗎?

可以。

Anthropic 表示,Claude Sonnet 5 已成為 Claude 免費版與 Pro 版的預設模型。

Max、Team 與 Enterprise 使用者也能使用,並可在 Claude Code 與 Claude Platform 中選擇。

不過,免費版可以使用模型,不代表擁有無限制用量或所有企業功能。

實際能執行多長的任務、使用多少工具及處理多少資料,仍可能受到帳號方案、使用額度與管理員設定影響。

API 價格是多少?

Anthropic 公布的限時價格為:

  • 每百萬輸入 Token 2 美元。
  • 每百萬輸出 Token 10 美元。

這項價格預計維持至 2026 年 8 月 31 日。

之後標準價格將調整為:

  • 每百萬輸入 Token 3 美元。
  • 每百萬輸出 Token 15 美元。

開發者還要注意,Sonnet 5 使用更新後的 Tokenizer,相同文字可能比上一代計算出更多 Token。

因此,不能只比較表面單價。

真正要計算的是,一項任務完成到可接受成果,總共需要多少輸入、輸出、重試與人工修改。

什麼是努力程度?

Sonnet 5 可以依照任務調整推理與執行的努力程度。

較低的努力程度適合:

  • 簡單摘要。
  • 格式整理。
  • 短文改寫。
  • 一般資料查詢。

較高的努力程度適合:

  • 複雜程式錯誤。
  • 跨多個工具的工作。
  • 長時間資料研究。
  • 需要反覆檢查的專業任務。

努力程度提高,通常也會使用更多 Token 與時間。

最好的做法不是所有任務都開到最高,而是依照工作的難度與風險調整。

它會主動檢查自己的成果嗎?

Anthropic 的早期測試回饋顯示,Sonnet 5 在部分任務中會主動建立測試、檢查修改或持續完成剩餘步驟。

這是一項實用改進,但不能把模型的自我檢查當成獨立驗證。

原因包括:

  • 模型可能使用相同的錯誤假設檢查自己。
  • 測試可能沒有涵蓋真正的例外情況。
  • 資料來源本身可能已經過期。
  • 程式通過測試,不代表符合商業需求。

模型自我檢查適合當成第一層品質控制,正式成果仍要由人確認。

安全性有什麼改進?

Anthropic 表示,Sonnet 5 相較 Sonnet 4.6:

  • 更能拒絕惡意要求。
  • 較能抵抗提示注入攻擊。
  • 出現幻覺與迎合使用者的比例較低。
  • 整體不理想行為比例較低。

不過,官方評估也顯示,它在部分不理想行為測試中,仍不如能力更高的 Opus 4.8 與 Claude Mythos Preview。

因此,「比上一代安全」不能被理解成「已經不會出錯或越權」。

安全評估代表模型在測試中的風險較低,不代表企業可以取消權限限制、監控與人工批准。

它適合用來做資安工作嗎?

Sonnet 5 可以處理部分一般、合法的資安工作。

例如:

  • 整理弱點報告。
  • 檢查安全設定。
  • 分析一般程式問題。
  • 協助撰寫防禦性測試。

Anthropic 表示,Sonnet 5 並未特別針對高階資安能力訓練,在危險攻擊能力的評估中,明顯低於目前的 Opus 級模型。

系統仍會啟用即時資安防護,偵測及阻擋危險用途。

企業不能因為模型能使用終端機,就直接讓它接觸正式網路、密碼或高權限帳號。

哪些工作適合先用 Sonnet 5?

  • 網站錯誤調查與測試環境修正。
  • 多份公開資料的比較研究。
  • 內部文件與會議資料整理。
  • 低風險工作流程自動化。
  • 重複性的程式修改與測試。
  • 需要控制成本的大量 AI 任務。

哪些工作不應直接完全交給它?

  • 未備份的正式網站修改。
  • 未經核准的付款與交易。
  • 正式合約、法律或醫療決定。
  • 直接寄送大量外部訊息。
  • 刪除無法復原的重要資料。
  • 使用最高權限操作公司系統。
  • 沒有獨立驗證的高風險資安任務。

第一次使用,可以從這段 Prompt 開始

請先不要直接執行。請把這項工作分成「目標、使用資料、預計步驟、會使用的工具、人工確認點、完成標準」六個部分。標示哪些步驟可以安全執行,哪些涉及正式資料、外部訊息、帳號權限或不可逆操作,必須等待我批准。計畫確認後再逐步執行;每完成一個階段,先回報結果與異常,不得自行擴大權限或工作範圍。

這段指令能讓 Sonnet 5 的代理能力,建立在較清楚的工作邊界內。

怎麼判斷 Sonnet 5 是否比原本流程更有效?

不要只看它完成多少次對話。

可以比較:

  • 一項工作從開始到完成需要多久。
  • 中途停止、需要人工接手的次數。
  • 成果需要修改多少次。
  • 每個可接受成果的實際 Token 成本。
  • 錯誤與復原次數是否下降。
  • 模型是否遵守資料與權限範圍。

較低模型價格只有在成果真的能使用時,才會轉變成實際節省。

今天最重要的判斷

Claude Sonnet 5 的價值,不是讓所有人改用另一個聊天模型。

更重要的改變是,中等成本的模型也開始具備較完整的代理能力:

  • 先規劃。
  • 使用工具。
  • 持續執行。
  • 檢查成果。
  • 完成多步驟工作。

這讓個人與企業不必每次都使用最昂貴的模型,也能處理更多真實工作。

但能力提高後,權限、測試、監控與人工批准反而更重要。

Claude Sonnet 5 最適合的定位,不是完全取代工作者,而是成為能把日常任務往前推到接近完成,再由人負責最後判斷與正式交付的執行型助手。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀