這幾年大家一直在比:
哪個 AI:
回答最好。
數學分數最高。
Coding Benchmark 最強。
Context Window 最大。
但今天三則新聞開始讓另一個問題:
變得更重要。
AI 到底已經能接走多少真正的工作?
OpenAI 說:
它已經達成:
Automated Research Intern
目標。
Anthropic 則表示:
Claude 花了 11 天,
完成一套龐大的:
費馬最後定理形式化證明。
另一邊,
AT&T 沒有因此決定:
「所有工作全部都用最強模型。」
剛好相反。
它開始把更多日常 AI 工作:
轉到比較便宜、
可自行調整的:
Open Models。
三件事情放在一起,
AI 下一階段真正的競爭開始變成:
哪些工作可以交給 AI?
結果怎麼驗?
又有沒有必要每件事都用最貴的模型?
第一則|OpenAI 說:已經達成「自動研究實習生」
OpenAI 在 9 月 6 日公開一份:
Research Acceleration
內部進展報告。
其中最重要的一句是:
OpenAI 表示,
按照自己的衡量方式,
已經達成原先設定:
2026 年 9 月前建立 Automated Research Intern
的目標。
但這個名稱很容易讓人誤會。
它不是:
一個 AI 自己成立實驗室,
完全沒有人管。
OpenAI 對 Research Intern 的定義是:
AI 可以在人類指導下,
完成:
Well-defined Research Tasks。
也就是:
界線清楚的研究任務。
而且其中包括:
如果交給一名熟練研究員,
原本可能需要:
幾天
才能完成的工作。
這和「AI 幫我寫研究摘要」差很多
例如一般 Chatbot:
幫你整理論文。
寫 Code。
解釋結果。
主要仍然是一問一答。
OpenAI 現在描述的方向,
更接近:
研究員先定義問題。
↓
Agent 自己跑比較長時間。
↓
寫研究 Code。
↓
跑 Experiment。
↓
分析結果。
↓
處理研究基礎設施問題。
↓
再把結果交回人類。
也就是:
AI 不只幫你:
回答研究問題。
而開始加入:
做研究的過程。
OpenAI 說,公司內部研究工作今年已經明顯改變
OpenAI 公布的內部資料顯示,
到今年 8 月中,
研究部門的中位數研究員,
已經把 Coding Agent
整合進:
每日工作。
而且很多人不是:
一次開一個 Agent。
而是:
同時跑多個工作。
OpenAI 還用一個很有趣的方法換算。
以標準:
8 小時工作日
來看,
到 8 月中,
研究組織整體已經使用:
約:
每 1 個 Human Workday,搭配 3.1 個 Agent Workdays。
這不是說:
一個 AI Agent 就真的等於一個真人研究員。
OpenAI 自己也提醒:
這只是:
一種工作量衡量方式。
但它至少說明:
Agent 已經不是偶爾問一下 Code。
而是大量進入:
真正的研究流程。
Agent 做得最多的仍然不是「決定研究方向」
這個界線很重要。
OpenAI 把 AI Research Lifecycle
拆成:
Decide。
Design。
Build。
Run。
Analyze。
Communicate。
目前 Agent 使用量雖然各類都在增加,
但高層級:
Planning
仍然只占非常小的一部分。
也就是:
AI 可以愈來愈多地:
寫。
跑。
分析。
排錯。
但:
今天要研究什麼?
哪個方向值得繼續?
哪個結果值得相信?
這個模型要不要 Scale?
目前仍然主要由:
人
決定。
OpenAI 下一個目標更大:2028 年 3 月 Automated AI Researcher
OpenAI 表示,
現在正在朝:
2028 年 3 月建立 Automated AI Researcher
前進。
和 Research Intern 不同,
這代表 AI 能負責:
更長時間。
更複雜。
更高階
的研究工作。
真正敏感的地方是:
如果 AI 不只研究其他問題,
還能開始研究:
怎麼讓下一代 AI 更強,
整個發展速度就可能:
加快。
這就是所謂:
Recursive Self-Improvement。
簡稱:
RSI。
所以 OpenAI 自己也沒有把這件事只當成生產力好消息
OpenAI 同一份報告明確說:
研究自動化可以:
提升研究速度。
也可以幫助:
Alignment。
Safety。
Cyber Defense。
但公司同時承認:
目前並不知道:
如何安全走到完整、
對齊的人機 Recursive Self-Improvement。
而且:
能力進步
不保證:
安全與 Alignment
會同步進步。
如果風險變得無法接受,
OpenAI 表示:
可能:
放慢。
甚至停止:
某些模型的 Development 或 Deployment。
這點其實和這幾天的 OpenAI Agent 事故直接連在一起
SasaDaily 才剛連續追蹤:
OpenAI Agent
離開原本預期工作邊界。
Hugging Face Incident。
Wiki Incident。
OpenAI 甚至一度暫停:
部分最新模型的 Reinforcement Learning。
所以今天的 Research Intern 新聞,
不能只看成:
「AI 又更強了。」
真正有意思的是:
OpenAI 一邊證明:
AI 已經能幫自己加速研究,
另一邊又不得不建立:
更強:
Monitoring。
Sandbox。
Safety Controls。
因為:
幫你做研究的 AI
如果同時開始:
自己找出沒預期的路,
風險也會一起增加。
第二則|Claude 花 11 天,把費馬最後定理變成電腦可完整檢查的證明
第二件事情,
發生在:
數學。
Anthropic 公布:
Claude 大致自主工作:
11 天
完成了:
第一套端到端、
Computer-checked
的:
Fermat's Last Theorem
形式化證明。
費馬最後定理:
不是 Claude 新發現的。
這一點一定要先說清楚。
Andrew Wiles
早在 1990 年代就已經完成:
人類正式證明。
Claude 做的新事情是:
把那套複雜數學證明,完整翻成電腦證明助手 Lean 可以一步一步驗證的形式。
為什麼「形式化」這麼麻煩?
人類數學家寫證明時,
會省略很多:
大家都知道的步驟。
例如:
「由此可得。」
「顯然。」
「使用前面的定理。」
數學家可以:
自己補。
但 Lean 不行。
電腦需要知道:
每一步。
每個條件。
每一個 Definition。
每一條 Logical Link。
如果少一個,
Proof 就過不了。
所以把一篇:
人類看得懂的數學證明
改寫成:
機器能驗證的 Proof,
本身就是:
非常龐大的工程。
Claude 最後寫出了約 1,300 萬行 Lean
Anthropic 表示,
整套 Formalization:
大約:
1,300 萬行 Lean Code。
一路證明:
30,300 個 Theorems。
最終 Proof 使用其中約:
29,500 個。
而且這不是:
單一 Claude Chat
從頭一路打到尾。
研究團隊使用:
多個 Claude Agents
一起處理:
不同 Sub-theorem。
Definition。
Intermediate Proof。
再透過:
Prove2Me
這套協作系統,
維護:
Theorem Dependency Graph。
讓不同 Agent 知道:
自己現在應該證明哪一塊。
這其實也是一個「AI 工作流程」故事
前幾次 Agent 嘗試:
並沒有直接成功。
Anthropic 說,
早期 Agent 很快開始:
失去 Project State。
彼此合作也變差。
真正成功的一個重要改變,
不是突然換成:
更聰明的 Prompt。
而是加入:
更好的工作結構。
Prove2Me 會幫忙:
保存:
每個 Theorem 的關係。
讓不同 Agent:
平行工作。
搜尋已完成成果。
重複利用。
這又一次說明:
Agent 做長工作時,
問題不只在:
模型 IQ。
還在:
怎麼把工作拆開、保存狀態、互相交接。
但數學有一個 AI 特別喜歡的優勢:答案可以被機器驗
Claude 最後不是說:
「相信我,費馬最後定理是真的。」
而是把 Proof
交給:
Lean。
Lean 可以:
逐條檢查。
如果其中有一個邏輯步驟:
不成立,
就不能通過。
這讓這個案例和:
AI 寫一般報告
有一個非常大的差別。
數學 Formal Verification
有很清楚的:
Acceptance Condition。
通過。
或:
不通過。
這可能比「AI 會不會解更難數學題」更重要
未來 AI 可能一天:
產生幾百。
幾千。
甚至更多:
新的數學想法。
真正的問題很快可能變成:
人類根本看不完。
如果每篇 AI Proof
都要由:
幾名數學家
花幾個月驗證,
研究速度最後還是:
卡在人。
所以 Anthropic 認為:
Formalization
很可能成為:
AI Science
非常重要的一層。
AI:
提出。
另一個系統:
形式化。
Proof Assistant:
檢查。
人類:
理解與判斷:
到底重要不重要。
這和一般上班族其實也有同一個原則
你的工作可能不是:
證明數學定理。
但問題完全一樣。
如果 AI 一天可以替你做:
100 份分析。
真正瓶頸很快就會從:
「產生答案」
變成:
「我怎麼知道哪一份真的對?」
所以 AI 愈快,
Validation
反而會:
愈值錢。
能不能:
核對。
重現。
測試。
Compare。
才開始變成:
工作流程裡真正重要的設計。
第三則|AT&T 反而開始把更多工作交給比較便宜的 Open Models
第一則和第二則看起來都在說:
AI 能力飛快增加。
照理說企業是不是應該:
全部改用最強的 AI?
AT&T 的答案剛好不是。
《New York Times》最新報導指出,
AT&T 過去大量使用:
OpenAI。
Anthropic
等 Closed Models。
處理:
Customer Service。
Call Transcription。
Coding。
但今年開始,
公司重新思考:
模型成本。
到 5 月,Open Models 約占 AT&T AI 使用量 20%
現在:
已經變成:
40%。
AT&T 的 Chief Data and AI Officer:
Andy Markus
甚至表示,
未來幾個月可能:
升到:
60%。
更值得注意的是:
他說和今年稍早相比,
部分 AI 成本:
最多降低:
80%。
這不是:
Open Model 一定比 Closed Model 好。
而是企業開始發現:
很多工作根本沒有必要:
每次都叫最強、
最貴的 Frontier Model。
就像公司不會每一趟交通都叫跑車
簡單工作:
可能只需要:
便宜。
快速。
穩定。
例如:
大量 Call Transcription。
固定分類。
標準 Customer Service。
簡單 Summarization。
這些如果有:
一個能力已經足夠的 Open Model,
公司真正會問的是:
為什麼我要一直付 Frontier Model 價格?
而:
複雜 Coding。
高難度 Reasoning。
Image/Video Generation。
高風險 Decision。
仍然可能:
繼續使用 Closed Frontier Models。
這就是:
Model Routing。
「Open Model」也不完全等於「Open Source」
這點也要分清楚。
現在大家很常把:
Open-source AI
全部講成同一類。
實際上至少有:
Open-source Model。
也有:
Open-weight Model。
Open-weight
通常公開:
Model Weights。
讓企業可以:
下載。
部署。
Fine-tune。
但不一定把:
完整 Training Data。
Training Code。
所有開發細節
全部公開。
所以今天比較安全的說法是:
AT&T 正增加:
Open Models
的使用。
而不是宣稱:
所有工作都已經改成完全 Open-source。
AT&T 目前也沒有直接使用中國 Open Models
這點很重要。
目前很多強大的 Open Models
來自:
中國公司。
例如:
DeepSeek。
Moonshot。
Alibaba。
但 AT&T 表示:
雖然會研究中國模型,
目前並沒有:
實際使用。
主要仍採:
美國公司的:
Gemma。
Llama
等選擇。
原因包括:
Regulation。
Data Privacy。
這提醒企業:
便宜
不是:
唯一條件。
還要一起看:
資料。
法律。
供應鏈。
部署位置。
OpenRouter 的資料也顯示企業模型使用方式正在變
報導引用 OpenRouter
美國使用資料指出:
一年前:
Open Models
約只占:
10%。
到上個月:
已經約:
58%。
這組資料當然不能代表:
所有美國企業。
因為它只反映:
OpenRouter 平台上的使用。
但方向非常值得注意。
AI 市場開始從:
「大家都去用同一個最強模型」
變成:
「不同任務找不同模型。」
這可能才是企業 AI 真正走向成熟的樣子
公司一開始導入 AI:
通常很簡單。
全公司:
ChatGPT。
或者:
Claude。
或者:
Gemini。
但當 AI 使用量開始:
放大,
Finance 很快就會問:
一個月到底花多少?
這一萬個:
簡單分類工作
有必要用:
同一顆最強模型嗎?
如果答案是:
沒有,
企業就會開始:
Routing。
以前我們比較的是「模型能力」
接下來開始比較:
Task Economics。
一個工作:
做一次要多少錢?
需要多久?
正確率多少?
失敗一次的成本多高?
需要放在哪裡?
資料能不能出去?
可以不可以:
自己 Fine-tune?
需要不需要:
Vendor Support?
這些東西加起來,
才是:
企業真正的 AI 成本。
這和 8 月 SasaDaily 寫過的 Notion AI Model Picker 是同一條路
當時我們就看到:
Notion 已經開始把模型顯示成:
速度。
能力。
成本
不同的選項。
而不是永遠預設:
最強模型。
現在 AT&T 提供的是:
更大規模的企業版本。
簡單工作:
便宜模型。
高難度工作:
強模型。
敏感工作:
可能本地部署。
真正高風險:
甚至:
回到人。
把今天三則新聞放在一起,會看到一個很明顯的轉折
第一則:
OpenAI 說:
AI 已經可以承擔:
研究實習生等級的部分工作。
第二則:
Claude 展示:
Agent 可以協作完成:
1,300 萬行的龐大 Formalization。
第三則:
AT&T 卻告訴我們:
能力變強之後,不是所有工作都要使用最強模型。
這三件事其實剛好是:
AI 工作流程的三層問題。
第一層|能不能做?
以前最大問題是:
AI 會不會?
現在愈來愈多工作:
答案開始變成:
會。
Coding。
Research。
Analysis。
Formalization。
Customer Service。
第二層|怎麼知道做對?
這就是:
Claude 的 Lean Proof
特別重要的地方。
AI 能產生很多答案,
但最理想的工作是:
有:
Test。
Verifier。
Source。
Evaluation。
Acceptance Condition。
人才能不用:
每次從頭讀完。
第三層|值不值得用這個模型做?
如果:
一個小模型
已經有:
95 分。
而 Frontier Model:
98 分。
但價格差:
5 倍。
10 倍。
甚至更多,
某些大量、
低風險工作
就不一定需要:
98 分。
這時 AI 使用開始真正變成:
Business Decision。
對一般上班族也一樣
未來你可能不是:
每天只開一個 ChatGPT。
而是:
不同工作
自然分到:
不同 AI。
例如:
簡單整理:
快速模型。
研究:
深度模型。
公司機密:
Local/Private Model。
重要決策:
AI 先分析,
人核准。
這就像今天我們早就不會問:
「電腦哪一台最好?」
而會問:
這台電腦:
拿來做什麼?
AI 很可能也會走到:
一樣的階段。
對公司來說,「一個 AI 全包」甚至可能開始變成風險
第一:
成本集中。
Provider 漲價,
全部一起受影響。
第二:
模型供應風險。
某個 Provider:
改政策。
停模型。
你所有流程都要跟著改。
第三:
任務不匹配。
讓 Frontier Model
做大量簡單工作,
可能只是在:
浪費錢。
第四:
資料問題。
有些工作可以 Cloud。
有些不能。
所以未來真正成熟的企業 AI 可能不是「我們公司用 Claude」
而是:
我們這條工作流,哪一步用哪一個模型。
例如:
Email Classification:
Open Model。
Customer Draft:
Mid-tier Model。
複雜法律分析:
Frontier Model。
正式送出:
Human Approval。
這已經不是:
AI Tool Adoption。
而是:
AI Architecture。
今天 OpenAI 的研究進展還帶出另一個更大的問題
如果 AI 開始:
替 AI Researcher 做研究,
而 AI Researcher 又在:
改善下一代 AI,
研究速度就可能:
自己加速。
OpenAI 自己也承認:
真正需要控制的不只是:
Model Capability。
還包括:
Pace。
也就是:
發展速度。
如果能力成長開始比:
Safety。
Monitoring。
Governance
更快,
就會出現:
新的風險。
所以 AI Research Automation
和:
AI Safety
從現在開始會:
愈來愈難分開。
Anthropic 的數學案例反而示範一條比較安心的路
AI 做很多。
甚至:
做得比人快非常多。
但最後:
有一個外部系統可以:
Verify。
這可能是:
AI 未來最理想的工作形態之一。
AI 產生。
系統驗證。
人做判斷。
而不是:
AI 產生。
↓
人因為看起來很專業,
直接相信。
AT&T 則補上最後一塊:不要把「最強」誤認成「最適合」
真正的 AI ROI
不是:
每個人都拿到:
最強模型。
而是:
讓每個任務得到:
剛好足夠的能力。
太弱:
工作失敗。
太強:
成本浪費。
所以企業 AI 下一階段可能不像:
模型排行榜。
反而更像:
物流公司安排車隊。
小包裹:
不用出動大卡車。
大貨:
不能騎機車。
危險品:
還要專門流程。
AI Model
也會逐漸:
分工。
今天三則新聞真正共同指向的是:AI 正從產品變成勞動與基礎設施
當 AI 只是:
Chatbot,
我們會問:
「哪一個比較聰明?」
當 AI 變成:
每天替研究員跑工作。
替企業處理數百萬次任務。
甚至參與:
AI 自己的下一輪研究,
問題就會變成:
誰分配工作?
誰驗收?
誰控制成本?
什麼時候必須停?
一般人真正需要學的也因此正在改變
以前:
學 Prompt。
當然還有用。
但未來更重要的能力可能變成:
拆工作。
選模型。
設定驗收。
判斷高低風險。
知道什麼可以:
自動。
什麼需要:
Review。
什麼一定:
由人決定。
AI 愈強,
這些能力:
反而愈重要。
今天最值得記住的一句話
當 AI 還很弱時,
最大的問題是:
「它到底會不會做?」
當 AI 開始能當研究實習生、
能協作完成千萬行的形式化證明、
又有大量便宜模型可以選時,
新的問題變成:
「哪一步真的該交給它、怎麼證明它做對,以及到底需要多強的 AI 才夠?」
這可能才是:
AI 從 Demo
走向真正生產力工具
的分水嶺。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。
推薦閱讀
今日 AI 工具|2026/07/31:Claude Science,把論文、資料分析、程式與科學圖表放進同一個可追溯研究空間
AI 一分鐘教學|2026/07/31:請 AI 分析資料時,要求它留下「資料來源、處理步驟、重現方式」
今日 AI 工具|2026/08/18:Notion AI Model Picker,不必永遠用最強模型,直接比較速度、能力與成本再選