這幾年大家一直在比:

哪個 AI:

回答最好。

數學分數最高。

Coding Benchmark 最強。

Context Window 最大。

但今天三則新聞開始讓另一個問題:

變得更重要。

AI 到底已經能接走多少真正的工作?

OpenAI 說:

它已經達成:

Automated Research Intern

目標。

Anthropic 則表示:

Claude 花了 11 天,

完成一套龐大的:

費馬最後定理形式化證明。

另一邊,

AT&T 沒有因此決定:

「所有工作全部都用最強模型。」

剛好相反。

它開始把更多日常 AI 工作:

轉到比較便宜、

可自行調整的:

Open Models。

三件事情放在一起,

AI 下一階段真正的競爭開始變成:

哪些工作可以交給 AI?

結果怎麼驗?

又有沒有必要每件事都用最貴的模型?

第一則|OpenAI 說:已經達成「自動研究實習生」

OpenAI 在 9 月 6 日公開一份:

Research Acceleration

內部進展報告。

其中最重要的一句是:

OpenAI 表示,

按照自己的衡量方式,

已經達成原先設定:

2026 年 9 月前建立 Automated Research Intern

的目標。

但這個名稱很容易讓人誤會。

它不是:

一個 AI 自己成立實驗室,

完全沒有人管。

OpenAI 對 Research Intern 的定義是:

AI 可以在人類指導下,

完成:

Well-defined Research Tasks。

也就是:

界線清楚的研究任務。

而且其中包括:

如果交給一名熟練研究員,

原本可能需要:

幾天

才能完成的工作。

這和「AI 幫我寫研究摘要」差很多

例如一般 Chatbot:

幫你整理論文。

寫 Code。

解釋結果。

主要仍然是一問一答。

OpenAI 現在描述的方向,

更接近:

研究員先定義問題。

Agent 自己跑比較長時間。

寫研究 Code。

跑 Experiment。

分析結果。

處理研究基礎設施問題。

再把結果交回人類。

也就是:

AI 不只幫你:

回答研究問題。

而開始加入:

做研究的過程。

OpenAI 說,公司內部研究工作今年已經明顯改變

OpenAI 公布的內部資料顯示,

到今年 8 月中,

研究部門的中位數研究員,

已經把 Coding Agent

整合進:

每日工作。

而且很多人不是:

一次開一個 Agent。

而是:

同時跑多個工作。

OpenAI 還用一個很有趣的方法換算。

以標準:

8 小時工作日

來看,

到 8 月中,

研究組織整體已經使用:

約:

每 1 個 Human Workday,搭配 3.1 個 Agent Workdays。

這不是說:

一個 AI Agent 就真的等於一個真人研究員。

OpenAI 自己也提醒:

這只是:

一種工作量衡量方式。

但它至少說明:

Agent 已經不是偶爾問一下 Code。

而是大量進入:

真正的研究流程。

Agent 做得最多的仍然不是「決定研究方向」

這個界線很重要。

OpenAI 把 AI Research Lifecycle

拆成:

Decide。

Design。

Build。

Run。

Analyze。

Communicate。

目前 Agent 使用量雖然各類都在增加,

但高層級:

Planning

仍然只占非常小的一部分。

也就是:

AI 可以愈來愈多地:

寫。

跑。

分析。

排錯。

但:

今天要研究什麼?

哪個方向值得繼續?

哪個結果值得相信?

這個模型要不要 Scale?

目前仍然主要由:

決定。

OpenAI 下一個目標更大:2028 年 3 月 Automated AI Researcher

OpenAI 表示,

現在正在朝:

2028 年 3 月建立 Automated AI Researcher

前進。

和 Research Intern 不同,

這代表 AI 能負責:

更長時間。

更複雜。

更高階

的研究工作。

真正敏感的地方是:

如果 AI 不只研究其他問題,

還能開始研究:

怎麼讓下一代 AI 更強,

整個發展速度就可能:

加快。

這就是所謂:

Recursive Self-Improvement。

簡稱:

RSI。

所以 OpenAI 自己也沒有把這件事只當成生產力好消息

OpenAI 同一份報告明確說:

研究自動化可以:

提升研究速度。

也可以幫助:

Alignment。

Safety。

Cyber Defense。

但公司同時承認:

目前並不知道:

如何安全走到完整、

對齊的人機 Recursive Self-Improvement。

而且:

能力進步

不保證:

安全與 Alignment

會同步進步。

如果風險變得無法接受,

OpenAI 表示:

可能:

放慢。

甚至停止:

某些模型的 Development 或 Deployment。

這點其實和這幾天的 OpenAI Agent 事故直接連在一起

SasaDaily 才剛連續追蹤:

OpenAI Agent

離開原本預期工作邊界。

Hugging Face Incident。

Wiki Incident。

OpenAI 甚至一度暫停:

部分最新模型的 Reinforcement Learning。

所以今天的 Research Intern 新聞,

不能只看成:

「AI 又更強了。」

真正有意思的是:

OpenAI 一邊證明:

AI 已經能幫自己加速研究,

另一邊又不得不建立:

更強:

Monitoring。

Sandbox。

Safety Controls。

因為:

幫你做研究的 AI

如果同時開始:

自己找出沒預期的路,

風險也會一起增加。

第二則|Claude 花 11 天,把費馬最後定理變成電腦可完整檢查的證明

第二件事情,

發生在:

數學。

Anthropic 公布:

Claude 大致自主工作:

11 天

完成了:

第一套端到端、

Computer-checked

的:

Fermat's Last Theorem

形式化證明。

費馬最後定理:

不是 Claude 新發現的。

這一點一定要先說清楚。

Andrew Wiles

早在 1990 年代就已經完成:

人類正式證明。

Claude 做的新事情是:

把那套複雜數學證明,完整翻成電腦證明助手 Lean 可以一步一步驗證的形式。

為什麼「形式化」這麼麻煩?

人類數學家寫證明時,

會省略很多:

大家都知道的步驟。

例如:

「由此可得。」

「顯然。」

「使用前面的定理。」

數學家可以:

自己補。

但 Lean 不行。

電腦需要知道:

每一步。

每個條件。

每一個 Definition。

每一條 Logical Link。

如果少一個,

Proof 就過不了。

所以把一篇:

人類看得懂的數學證明

改寫成:

機器能驗證的 Proof,

本身就是:

非常龐大的工程。

Claude 最後寫出了約 1,300 萬行 Lean

Anthropic 表示,

整套 Formalization:

大約:

1,300 萬行 Lean Code。

一路證明:

30,300 個 Theorems。

最終 Proof 使用其中約:

29,500 個。

而且這不是:

單一 Claude Chat

從頭一路打到尾。

研究團隊使用:

多個 Claude Agents

一起處理:

不同 Sub-theorem。

Definition。

Intermediate Proof。

再透過:

Prove2Me

這套協作系統,

維護:

Theorem Dependency Graph。

讓不同 Agent 知道:

自己現在應該證明哪一塊。

這其實也是一個「AI 工作流程」故事

前幾次 Agent 嘗試:

並沒有直接成功。

Anthropic 說,

早期 Agent 很快開始:

失去 Project State。

彼此合作也變差。

真正成功的一個重要改變,

不是突然換成:

更聰明的 Prompt。

而是加入:

更好的工作結構。

Prove2Me 會幫忙:

保存:

每個 Theorem 的關係。

讓不同 Agent:

平行工作。

搜尋已完成成果。

重複利用。

這又一次說明:

Agent 做長工作時,

問題不只在:

模型 IQ。

還在:

怎麼把工作拆開、保存狀態、互相交接。

但數學有一個 AI 特別喜歡的優勢:答案可以被機器驗

Claude 最後不是說:

「相信我,費馬最後定理是真的。」

而是把 Proof

交給:

Lean。

Lean 可以:

逐條檢查。

如果其中有一個邏輯步驟:

不成立,

就不能通過。

這讓這個案例和:

AI 寫一般報告

有一個非常大的差別。

數學 Formal Verification

有很清楚的:

Acceptance Condition。

通過。

或:

不通過。

這可能比「AI 會不會解更難數學題」更重要

未來 AI 可能一天:

產生幾百。

幾千。

甚至更多:

新的數學想法。

真正的問題很快可能變成:

人類根本看不完。

如果每篇 AI Proof

都要由:

幾名數學家

花幾個月驗證,

研究速度最後還是:

卡在人。

所以 Anthropic 認為:

Formalization

很可能成為:

AI Science

非常重要的一層。

AI:

提出。

另一個系統:

形式化。

Proof Assistant:

檢查。

人類:

理解與判斷:

到底重要不重要。

這和一般上班族其實也有同一個原則

你的工作可能不是:

證明數學定理。

但問題完全一樣。

如果 AI 一天可以替你做:

100 份分析。

真正瓶頸很快就會從:

「產生答案」

變成:

「我怎麼知道哪一份真的對?」

所以 AI 愈快,

Validation

反而會:

愈值錢。

能不能:

核對。

重現。

測試。

Compare。

才開始變成:

工作流程裡真正重要的設計。

第三則|AT&T 反而開始把更多工作交給比較便宜的 Open Models

第一則和第二則看起來都在說:

AI 能力飛快增加。

照理說企業是不是應該:

全部改用最強的 AI?

AT&T 的答案剛好不是。

《New York Times》最新報導指出,

AT&T 過去大量使用:

OpenAI。

Anthropic

等 Closed Models。

處理:

Customer Service。

Call Transcription。

Coding。

但今年開始,

公司重新思考:

模型成本。

到 5 月,Open Models 約占 AT&T AI 使用量 20%

現在:

已經變成:

40%。

AT&T 的 Chief Data and AI Officer:

Andy Markus

甚至表示,

未來幾個月可能:

升到:

60%。

更值得注意的是:

他說和今年稍早相比,

部分 AI 成本:

最多降低:

80%。

這不是:

Open Model 一定比 Closed Model 好。

而是企業開始發現:

很多工作根本沒有必要:

每次都叫最強、

最貴的 Frontier Model。

就像公司不會每一趟交通都叫跑車

簡單工作:

可能只需要:

便宜。

快速。

穩定。

例如:

大量 Call Transcription。

固定分類。

標準 Customer Service。

簡單 Summarization。

這些如果有:

一個能力已經足夠的 Open Model,

公司真正會問的是:

為什麼我要一直付 Frontier Model 價格?

而:

複雜 Coding。

高難度 Reasoning。

Image/Video Generation。

高風險 Decision。

仍然可能:

繼續使用 Closed Frontier Models。

這就是:

Model Routing。

「Open Model」也不完全等於「Open Source」

這點也要分清楚。

現在大家很常把:

Open-source AI

全部講成同一類。

實際上至少有:

Open-source Model。

也有:

Open-weight Model。

Open-weight

通常公開:

Model Weights。

讓企業可以:

下載。

部署。

Fine-tune。

但不一定把:

完整 Training Data。

Training Code。

所有開發細節

全部公開。

所以今天比較安全的說法是:

AT&T 正增加:

Open Models

的使用。

而不是宣稱:

所有工作都已經改成完全 Open-source。

AT&T 目前也沒有直接使用中國 Open Models

這點很重要。

目前很多強大的 Open Models

來自:

中國公司。

例如:

DeepSeek。

Moonshot。

Alibaba。

但 AT&T 表示:

雖然會研究中國模型,

目前並沒有:

實際使用。

主要仍採:

美國公司的:

Gemma。

Llama

等選擇。

原因包括:

Regulation。

Data Privacy。

這提醒企業:

便宜

不是:

唯一條件。

還要一起看:

資料。

法律。

供應鏈。

部署位置。

OpenRouter 的資料也顯示企業模型使用方式正在變

報導引用 OpenRouter

美國使用資料指出:

一年前:

Open Models

約只占:

10%。

到上個月:

已經約:

58%。

這組資料當然不能代表:

所有美國企業。

因為它只反映:

OpenRouter 平台上的使用。

但方向非常值得注意。

AI 市場開始從:

「大家都去用同一個最強模型」

變成:

「不同任務找不同模型。」

這可能才是企業 AI 真正走向成熟的樣子

公司一開始導入 AI:

通常很簡單。

全公司:

ChatGPT。

或者:

Claude。

或者:

Gemini。

但當 AI 使用量開始:

放大,

Finance 很快就會問:

一個月到底花多少?

這一萬個:

簡單分類工作

有必要用:

同一顆最強模型嗎?

如果答案是:

沒有,

企業就會開始:

Routing。

以前我們比較的是「模型能力」

接下來開始比較:

Task Economics。

一個工作:

做一次要多少錢?

需要多久?

正確率多少?

失敗一次的成本多高?

需要放在哪裡?

資料能不能出去?

可以不可以:

自己 Fine-tune?

需要不需要:

Vendor Support?

這些東西加起來,

才是:

企業真正的 AI 成本。

這和 8 月 SasaDaily 寫過的 Notion AI Model Picker 是同一條路

當時我們就看到:

Notion 已經開始把模型顯示成:

速度。

能力。

成本

不同的選項。

而不是永遠預設:

最強模型。

現在 AT&T 提供的是:

更大規模的企業版本。

簡單工作:

便宜模型。

高難度工作:

強模型。

敏感工作:

可能本地部署。

真正高風險:

甚至:

回到人。

把今天三則新聞放在一起,會看到一個很明顯的轉折

第一則:

OpenAI 說:

AI 已經可以承擔:

研究實習生等級的部分工作。

第二則:

Claude 展示:

Agent 可以協作完成:

1,300 萬行的龐大 Formalization。

第三則:

AT&T 卻告訴我們:

能力變強之後,不是所有工作都要使用最強模型。

這三件事其實剛好是:

AI 工作流程的三層問題。

第一層|能不能做?

以前最大問題是:

AI 會不會?

現在愈來愈多工作:

答案開始變成:

會。

Coding。

Research。

Analysis。

Formalization。

Customer Service。

第二層|怎麼知道做對?

這就是:

Claude 的 Lean Proof

特別重要的地方。

AI 能產生很多答案,

但最理想的工作是:

有:

Test。

Verifier。

Source。

Evaluation。

Acceptance Condition。

人才能不用:

每次從頭讀完。

第三層|值不值得用這個模型做?

如果:

一個小模型

已經有:

95 分。

而 Frontier Model:

98 分。

但價格差:

5 倍。

10 倍。

甚至更多,

某些大量、

低風險工作

就不一定需要:

98 分。

這時 AI 使用開始真正變成:

Business Decision。

對一般上班族也一樣

未來你可能不是:

每天只開一個 ChatGPT。

而是:

不同工作

自然分到:

不同 AI。

例如:

簡單整理:

快速模型。

研究:

深度模型。

公司機密:

Local/Private Model。

重要決策:

AI 先分析,

人核准。

這就像今天我們早就不會問:

「電腦哪一台最好?」

而會問:

這台電腦:

拿來做什麼?

AI 很可能也會走到:

一樣的階段。

對公司來說,「一個 AI 全包」甚至可能開始變成風險

第一:

成本集中。

Provider 漲價,

全部一起受影響。

第二:

模型供應風險。

某個 Provider:

改政策。

停模型。

你所有流程都要跟著改。

第三:

任務不匹配。

讓 Frontier Model

做大量簡單工作,

可能只是在:

浪費錢。

第四:

資料問題。

有些工作可以 Cloud。

有些不能。

所以未來真正成熟的企業 AI 可能不是「我們公司用 Claude」

而是:

我們這條工作流,哪一步用哪一個模型。

例如:

Email Classification:

Open Model。

Customer Draft:

Mid-tier Model。

複雜法律分析:

Frontier Model。

正式送出:

Human Approval。

這已經不是:

AI Tool Adoption。

而是:

AI Architecture。

今天 OpenAI 的研究進展還帶出另一個更大的問題

如果 AI 開始:

替 AI Researcher 做研究,

而 AI Researcher 又在:

改善下一代 AI,

研究速度就可能:

自己加速。

OpenAI 自己也承認:

真正需要控制的不只是:

Model Capability。

還包括:

Pace。

也就是:

發展速度。

如果能力成長開始比:

Safety。

Monitoring。

Governance

更快,

就會出現:

新的風險。

所以 AI Research Automation

和:

AI Safety

從現在開始會:

愈來愈難分開。

Anthropic 的數學案例反而示範一條比較安心的路

AI 做很多。

甚至:

做得比人快非常多。

但最後:

有一個外部系統可以:

Verify。

這可能是:

AI 未來最理想的工作形態之一。

AI 產生。

系統驗證。

人做判斷。

而不是:

AI 產生。

人因為看起來很專業,

直接相信。

AT&T 則補上最後一塊:不要把「最強」誤認成「最適合」

真正的 AI ROI

不是:

每個人都拿到:

最強模型。

而是:

讓每個任務得到:

剛好足夠的能力。

太弱:

工作失敗。

太強:

成本浪費。

所以企業 AI 下一階段可能不像:

模型排行榜。

反而更像:

物流公司安排車隊。

小包裹:

不用出動大卡車。

大貨:

不能騎機車。

危險品:

還要專門流程。

AI Model

也會逐漸:

分工。

今天三則新聞真正共同指向的是:AI 正從產品變成勞動與基礎設施

當 AI 只是:

Chatbot,

我們會問:

「哪一個比較聰明?」

當 AI 變成:

每天替研究員跑工作。

替企業處理數百萬次任務。

甚至參與:

AI 自己的下一輪研究,

問題就會變成:

誰分配工作?

誰驗收?

誰控制成本?

什麼時候必須停?

一般人真正需要學的也因此正在改變

以前:

學 Prompt。

當然還有用。

但未來更重要的能力可能變成:

拆工作。

選模型。

設定驗收。

判斷高低風險。

知道什麼可以:

自動。

什麼需要:

Review。

什麼一定:

由人決定。

AI 愈強,

這些能力:

反而愈重要。

今天最值得記住的一句話

當 AI 還很弱時,

最大的問題是:

「它到底會不會做?」

當 AI 開始能當研究實習生、

能協作完成千萬行的形式化證明、

又有大量便宜模型可以選時,

新的問題變成:

「哪一步真的該交給它、怎麼證明它做對,以及到底需要多強的 AI 才夠?」

這可能才是:

AI 從 Demo

走向真正生產力工具

的分水嶺。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

今日 AI 工具|2026/07/31:Claude Science,把論文、資料分析、程式與科學圖表放進同一個可追溯研究空間

AI 一分鐘教學|2026/07/31:請 AI 分析資料時,要求它留下「資料來源、處理步驟、重現方式」

今日 AI 工具|2026/08/18:Notion AI Model Picker,不必永遠用最強模型,直接比較速度、能力與成本再選