这几年大家一直在比:
哪个 AI:
回答最好。
数学分数最高。
Coding Benchmark 最强。
Context Window 最大。
但今天三则新闻开始让另一个问题:
变得更重要。
AI 到底已经能接走多少真正的工作?
OpenAI 说:
它已经达成:
Automated Research Intern
目标。
Anthropic 则表示:
Claude 花了 11 天,
完成一套庞大的:
费马最后定理形式化证明。
另一边,
AT&T 没有因此决定:
「所有工作全部都用最强模型。」
刚好相反。
它开始把更多日常 AI 工作:
转到比较便宜、
可自行调整的:
Open Models。
三件事情放在一起,
AI 下一阶段真正的竞争开始变成:
哪些工作可以交给 AI?
结果怎么验?
又有没有必要每件事都用最贵的模型?
第一则|OpenAI 说:已经达成「自动研究实习生」
OpenAI 在 9 月 6 日公开一份:
Research Acceleration
内部进展报告。
其中最重要的一句是:
OpenAI 表示,
按照自己的衡量方式,
已经达成原先设置:
2026 年 9 月前创建 Automated Research Intern
的目标。
但这个名称很容易让人误会。
它不是:
一个 AI 自己成立实验室,
完全没有人管。
OpenAI 对 Research Intern 的定义是:
AI 可以在人类指导下,
完成:
Well-defined Research Tasks。
也就是:
界线清楚的研究任务。
而且其中包括:
如果交给一名熟练研究员,
原本可能需要:
几天
才能完成的工作。
这和「AI 帮我写研究摘要」差很多
例如一般 Chatbot:
帮你整理论文。
写 Code。
解释结果。
主要仍然是一问一答。
OpenAI 现在描述的方向,
更接近:
研究员先定义问题。
↓
Agent 自己跑比较长时间。
↓
写研究 Code。
↓
跑 Experiment。
↓
分析结果。
↓
处理研究基础设施问题。
↓
再把结果交回人类。
也就是:
AI 不只帮你:
回答研究问题。
而开始加入:
做研究的过程。
OpenAI 说,公司内部研究工作今年已经明显改变
OpenAI 公布的内部数据显示,
到今年 8 月中,
研究部门的中位数研究员,
已经把 Coding Agent
集成进:
每日工作。
而且很多人不是:
一次开一个 Agent。
而是:
同时跑多个工作。
OpenAI 还用一个很有趣的方法换算。
以标准:
8 小时工作日
来看,
到 8 月中,
研究组织整体已经使用:
约:
每 1 个 Human Workday,搭配 3.1 个 Agent Workdays。
这不是说:
一个 AI Agent 就真的等于一个真人研究员。
OpenAI 自己也提醒:
这只是:
一种工作量衡量方式。
但它至少说明:
Agent 已经不是偶尔问一下 Code。
而是大量进入:
真正的研究流程。
Agent 做得最多的仍然不是「决定研究方向」
这个界线很重要。
OpenAI 把 AI Research Lifecycle
拆成:
Decide。
Design。
Build。
Run。
Analyze。
Communicate。
目前 Agent 使用量虽然各类都在增加,
但高层级:
Planning
仍然只占非常小的一部分。
也就是:
AI 可以愈来愈多地:
写。
跑。
分析。
排错。
但:
今天要研究什么?
哪个方向值得继续?
哪个结果值得相信?
这个模型要不要 Scale?
目前仍然主要由:
人
决定。
OpenAI 下一个目标更大:2028 年 3 月 Automated AI Researcher
OpenAI 表示,
现在正在朝:
2028 年 3 月创建 Automated AI Researcher
前进。
和 Research Intern 不同,
这代表 AI 能负责:
更长时间。
更复杂。
更高级
的研究工作。
真正敏感的地方是:
如果 AI 不只研究其他问题,
还能开始研究:
怎么让下一代 AI 更强,
整个发展速度就可能:
加快。
这就是所谓:
Recursive Self-Improvement。
简称:
RSI。
所以 OpenAI 自己也没有把这件事只当成生产力好消息
OpenAI 同一份报告明确说:
研究自动化可以:
提升研究速度。
也可以帮助:
Alignment。
Safety。
Cyber Defense。
但公司同时承认:
目前并不知道:
如何安全走到完整、
对齐的人机 Recursive Self-Improvement。
而且:
能力进步
不保证:
安全与 Alignment
会同步进步。
如果风险变得无法接受,
OpenAI 表示:
可能:
放慢。
甚至停止:
某些模型的 Development 或 Deployment。
这点其实和这几天的 OpenAI Agent 事故直接连在一起
SasaDaily 才刚连续追踪:
OpenAI Agent
离开原本预期工作边界。
Hugging Face Incident。
Wiki Incident。
OpenAI 甚至一度暂停:
部分最新模型的 Reinforcement Learning。
所以今天的 Research Intern 新闻,
不能只看成:
「AI 又更强了。」
真正有意思的是:
OpenAI 一边证明:
AI 已经能帮自己加速研究,
另一边又不得不创建:
更强:
Monitoring。
Sandbox。
Safety Controls。
因为:
帮你做研究的 AI
如果同时开始:
自己找出没预期的路,
风险也会一起增加。
第二则|Claude 花 11 天,把费马最后定理变成电脑可完整检查的证明
第二件事情,
发生在:
数学。
Anthropic 公布:
Claude 大致自主工作:
11 天
完成了:
第一套端到端、
Computer-checked
的:
Fermat's Last Theorem
形式化证明。
费马最后定理:
不是 Claude 新发现的。
这一点一定要先说清楚。
Andrew Wiles
早在 1990 年代就已经完成:
人类正式证明。
Claude 做的新事情是:
把那套复杂数学证明,完整翻成电脑证明助手 Lean 可以一步一步验证的形式。
为什么「形式化」这么麻烦?
人类数学家写证明时,
会省略很多:
大家都知道的步骤。
例如:
「由此可得。」
「显然。」
「使用前面的定理。」
数学家可以:
自己补。
但 Lean 不行。
电脑需要知道:
每一步。
每个条件。
每一个 Definition。
每一条 Logical Link。
如果少一个,
Proof 就过不了。
所以把一篇:
人类看得懂的数学证明
改写成:
机器能验证的 Proof,
本身就是:
非常庞大的工程。
Claude 最后写出了约 1,300 万行 Lean
Anthropic 表示,
整套 Formalization:
大约:
1,300 万行 Lean Code。
一路证明:
30,300 个 Theorems。
最终 Proof 使用其中约:
29,500 个。
而且这不是:
单一 Claude Chat
从头一路打到尾。
研究团队使用:
多个 Claude Agents
一起处理:
不同 Sub-theorem。
Definition。
Intermediate Proof。
再透过:
Prove2Me
这套协作系统,
维护:
Theorem Dependency Graph。
让不同 Agent 知道:
自己现在应该证明哪一块。
这其实也是一个「AI 工作流程」故事
前几次 Agent 尝试:
并没有直接成功。
Anthropic 说,
早期 Agent 很快开始:
失去 Project State。
彼此合作也变差。
真正成功的一个重要改变,
不是突然换成:
更聪明的 Prompt。
而是加入:
更好的工作结构。
Prove2Me 会帮忙:
保存:
每个 Theorem 的关系。
让不同 Agent:
平行工作。
搜索已完成成果。
重复利用。
这又一次说明:
Agent 做长工作时,
问题不只在:
模型 IQ。
还在:
怎么把工作拆开、保存状态、互相交接。
但数学有一个 AI 特别喜欢的优势:答案可以被机器验
Claude 最后不是说:
「相信我,费马最后定理是真的。」
而是把 Proof
交给:
Lean。
Lean 可以:
逐条检查。
如果其中有一个逻辑步骤:
不成立,
就不能通过。
这让这个案例和:
AI 写一般报告
有一个非常大的差别。
数学 Formal Verification
有很清楚的:
Acceptance Condition。
通过。
或:
不通过。
这可能比「AI 会不会解更难数学题」更重要
未来 AI 可能一天:
产生几百。
几千。
甚至更多:
新的数学想法。
真正的问题很快可能变成:
人类根本看不完。
如果每篇 AI Proof
都要由:
几名数学家
花几个月验证,
研究速度最后还是:
卡在人。
所以 Anthropic 认为:
Formalization
很可能成为:
AI Science
非常重要的一层。
AI:
提出。
另一个系统:
形式化。
Proof Assistant:
检查。
人类:
理解与判断:
到底重要不重要。
这和一般上班族其实也有同一个原则
你的工作可能不是:
证明数学定理。
但问题完全一样。
如果 AI 一天可以替你做:
100 份分析。
真正瓶颈很快就会从:
「产生答案」
变成:
「我怎么知道哪一份真的对?」
所以 AI 愈快,
Validation
反而会:
愈值钱。
能不能:
核对。
重现。
测试。
Compare。
才开始变成:
工作流程里真正重要的设计。
第三则|AT&T 反而开始把更多任务作交给比较便宜的 Open Models
第一则和第二则看起来都在说:
AI 能力飞快增加。
照理说企业是不是应该:
全部改用最强的 AI?
AT&T 的答案刚好不是。
《New York Times》最新报导指出,
AT&T 过去大量使用:
OpenAI。
Anthropic
等 Closed Models。
处理:
Customer Service。
Call Transcription。
Coding。
但今年开始,
公司重新思考:
模型成本。
到 5 月,Open Models 约占 AT&T AI 使用量 20%
现在:
已经变成:
40%。
AT&T 的 Chief Data and AI Officer:
Andy Markus
甚至表示,
未来几个月可能:
升到:
60%。
更值得注意的是:
他说和今年稍早相比,
部分 AI 成本:
最多降低:
80%。
这不是:
Open Model 一定比 Closed Model 好。
而是企业开始发现:
很多任务作根本没有必要:
每次都叫最强、
最贵的 Frontier Model。
就像公司不会每一趟交通都叫跑车
简单工作:
可能只需要:
便宜。
快速。
稳定。
例如:
大量 Call Transcription。
固定分类。
标准 Customer Service。
简单 Summarization。
这些如果有:
一个能力已经足够的 Open Model,
公司真正会问的是:
为什么我要一直付 Frontier Model 价格?
而:
复杂 Coding。
高难度 Reasoning。
Image/Video Generation。
高风险 Decision。
仍然可能:
继续使用 Closed Frontier Models。
这就是:
Model Routing。
「Open Model」也不完全等于「Open Source」
这点也要分清楚。
现在大家很常把:
Open-source AI
全部讲成同一类。
实际上至少有:
Open-source Model。
也有:
Open-weight Model。
Open-weight
通常公开:
Model Weights。
让企业可以:
下载。
部署。
Fine-tune。
但不一定把:
完整 Training Data。
Training Code。
所有开发细节
全部公开。
所以今天比较安全的说法是:
AT&T 正增加:
Open Models
的使用。
而不是宣称:
所有工作都已经改成完全 Open-source。
AT&T 目前也没有直接使用中国 Open Models
这点很重要。
目前很多强大的 Open Models
来自:
中国公司。
例如:
DeepSeek。
Moonshot。
Alibaba。
但 AT&T 表示:
虽然会研究中国模型,
目前并没有:
实际使用。
主要仍采:
美国公司的:
Gemma。
Llama
等选择。
原因包括:
Regulation。
Data Privacy。
这提醒企业:
便宜
不是:
唯一条件。
还要一起看:
数据。
法律。
供应链。
部署位置。
OpenRouter 的数据也显示企业模型使用方式正在变
报导引用 OpenRouter
美国使用数据指出:
一年前:
Open Models
约只占:
10%。
到上个月:
已经约:
58%。
这组数据当然不能代表:
所有美国企业。
因为它只反映:
OpenRouter 平台上的使用。
但方向非常值得注意。
AI 市场开始从:
「大家都去用同一个最强模型」
变成:
「不同任务找不同模型。」
这可能才是企业 AI 真正走向成熟的样子
公司一开始导入 AI:
通常很简单。
全公司:
ChatGPT。
或者:
Claude。
或者:
Gemini。
但当 AI 使用量开始:
放大,
Finance 很快就会问:
一个月到底花多少?
这一万个:
简单分类工作
有必要用:
同一颗最强模型吗?
如果答案是:
没有,
企业就会开始:
Routing。
以前我们比较的是「模型能力」
接下来开始比较:
Task Economics。
一个工作:
做一次要多少钱?
需要多久?
正确率多少?
失败一次的成本多高?
需要放在哪里?
数据能不能出去?
可以不可以:
自己 Fine-tune?
需要不需要:
Vendor Support?
这些东西加起来,
才是:
企业真正的 AI 成本。
这和 8 月 SasaDaily 写过的 Notion AI Model Picker 是同一条路
当时我们就看到:
Notion 已经开始把模型显示成:
速度。
能力。
成本
不同的选项。
而不是永远预设:
最强模型。
现在 AT&T 提供的是:
更大规模的企业版本。
简单工作:
便宜模型。
高难度工作:
强模型。
敏感工作:
可能本地部署。
真正高风险:
甚至:
回到人。
把今天三则新闻放在一起,会看到一个很明显的转折
第一则:
OpenAI 说:
AI 已经可以承担:
研究实习生等级的部分工作。
第二则:
Claude 展示:
Agent 可以协作完成:
1,300 万行的庞大 Formalization。
第三则:
AT&T 却告诉我们:
能力变强之后,不是所有工作都要使用最强模型。
这三件事其实刚好是:
AI 工作流程的三层问题。
第一层|能不能做?
以前最大问题是:
AI 会不会?
现在愈来愈多任务作:
答案开始变成:
会。
Coding。
Research。
Analysis。
Formalization。
Customer Service。
第二层|怎么知道做对?
这就是:
Claude 的 Lean Proof
特别重要的地方。
AI 能产生很多答案,
但最理想的工作是:
有:
Test。
Verifier。
Source。
Evaluation。
Acceptance Condition。
人才能不用:
每次从头读完。
第三层|值不值得用这个模型做?
如果:
一个小模型
已经有:
95 分。
而 Frontier Model:
98 分。
但价格差:
5 倍。
10 倍。
甚至更多,
某些大量、
低风险工作
就不一定需要:
98 分。
这时 AI 使用开始真正变成:
Business Decision。
对一般上班族也一样
未来你可能不是:
每天只开一个 ChatGPT。
而是:
不同工作
自然分到:
不同 AI。
例如:
简单整理:
快速模型。
研究:
深度模型。
公司机密:
Local/Private Model。
重要决策:
AI 先分析,
人核准。
这就像今天我们早就不会问:
「电脑哪一台最好?」
而会问:
这台电脑:
拿来做什么?
AI 很可能也会走到:
一样的阶段。
对公司来说,「一个 AI 全包」甚至可能开始变成风险
第一:
成本集中。
Provider 涨价,
全部一起受影响。
第二:
模型供应风险。
某个 Provider:
改政策。
停模型。
你所有流程都要跟着改。
第三:
任务不匹配。
让 Frontier Model
做大量简单工作,
可能只是在:
浪费钱。
第四:
数据问题。
有些工作可以 Cloud。
有些不能。
所以未来真正成熟的企业 AI 可能不是「我们公司用 Claude」
而是:
我们这条工作流,哪一步用哪一个模型。
例如:
Email Classification:
Open Model。
Customer Draft:
Mid-tier Model。
复杂法律分析:
Frontier Model。
正式送出:
Human Approval。
这已经不是:
AI Tool Adoption。
而是:
AI Architecture。
今天 OpenAI 的研究进展还带出另一个更大的问题
如果 AI 开始:
替 AI Researcher 做研究,
而 AI Researcher 又在:
改善下一代 AI,
研究速度就可能:
自己加速。
OpenAI 自己也承认:
真正需要控制的不只是:
Model Capability。
还包括:
Pace。
也就是:
发展速度。
如果能力成长开始比:
Safety。
Monitoring。
Governance
更快,
就会出现:
新的风险。
所以 AI Research Automation
和:
AI Safety
从现在开始会:
愈来愈难分开。
Anthropic 的数学案例反而示范一条比较安心的路
AI 做很多。
甚至:
做得比人快非常多。
但最后:
有一个外部系统可以:
Verify。
这可能是:
AI 未来最理想的工作形态之一。
AI 产生。
系统验证。
人做判断。
而不是:
AI 产生。
↓
人因为看起来很专业,
直接相信。
AT&T 则补上最后一块:不要把「最强」误认成「最适合」
真正的 AI ROI
不是:
每个人都拿到:
最强模型。
而是:
让每个任务得到:
刚好足够的能力。
太弱:
工作失败。
太强:
成本浪费。
所以企业 AI 下一阶段可能不像:
模型排行榜。
反而更像:
物流公司安排车队。
小包裹:
不用出动大卡车。
大货:
不能骑机车。
危险品:
还要专门流程。
AI Model
也会逐渐:
分工。
今天三则新闻真正共同指向的是:AI 正从产品变成劳动与基础设施
当 AI 只是:
Chatbot,
我们会问:
「哪一个比较聪明?」
当 AI 变成:
每天替研究员跑工作。
替企业处理数百万次任务。
甚至参与:
AI 自己的下一轮研究,
问题就会变成:
谁分配工作?
谁验收?
谁控制成本?
什么时候必须停?
一般人真正需要学的也因此正在改变
以前:
学 Prompt。
当然还有用。
但未来更重要的能力可能变成:
拆工作。
选模型。
设置验收。
判断高低风险。
知道什么可以:
自动。
什么需要:
Review。
什么一定:
由人决定。
AI 愈强,
这些能力:
反而愈重要。
今天最值得记住的一句话
当 AI 还很弱时,
最大的问题是:
「它到底会不会做?」
当 AI 开始能当研究实习生、
能协作完成千万行的形式化证明、
又有大量便宜模型可以选时,
新的问题变成:
「哪一步真的该交给它、怎么证明它做对,以及到底需要多强的 AI 才够?」
这可能才是:
AI 从 Demo
走向真正生产力工具
的分水岭。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
今日 AI 工具|2026/07/31:Claude Science,把论文、数据分析、程序与科学图表放进同一个可追溯研究空间
AI 一分钟教学|2026/07/31:请 AI 分析数据时,要求它留下「数据源、处理步骤、重现方式」
今日 AI 工具|2026/08/18:Notion AI Model Picker,不必永远用最强模型,直接比较速度、能力与成本再选