这几年大家一直在比:

哪个 AI:

回答最好。

数学分数最高。

Coding Benchmark 最强。

Context Window 最大。

但今天三则新闻开始让另一个问题:

变得更重要。

AI 到底已经能接走多少真正的工作?

OpenAI 说:

它已经达成:

Automated Research Intern

目标。

Anthropic 则表示:

Claude 花了 11 天,

完成一套庞大的:

费马最后定理形式化证明。

另一边,

AT&T 没有因此决定:

「所有工作全部都用最强模型。」

刚好相反。

它开始把更多日常 AI 工作:

转到比较便宜、

可自行调整的:

Open Models。

三件事情放在一起,

AI 下一阶段真正的竞争开始变成:

哪些工作可以交给 AI?

结果怎么验?

又有没有必要每件事都用最贵的模型?

第一则|OpenAI 说:已经达成「自动研究实习生」

OpenAI 在 9 月 6 日公开一份:

Research Acceleration

内部进展报告。

其中最重要的一句是:

OpenAI 表示,

按照自己的衡量方式,

已经达成原先设置:

2026 年 9 月前创建 Automated Research Intern

的目标。

但这个名称很容易让人误会。

它不是:

一个 AI 自己成立实验室,

完全没有人管。

OpenAI 对 Research Intern 的定义是:

AI 可以在人类指导下,

完成:

Well-defined Research Tasks。

也就是:

界线清楚的研究任务。

而且其中包括:

如果交给一名熟练研究员,

原本可能需要:

几天

才能完成的工作。

这和「AI 帮我写研究摘要」差很多

例如一般 Chatbot:

帮你整理论文。

写 Code。

解释结果。

主要仍然是一问一答。

OpenAI 现在描述的方向,

更接近:

研究员先定义问题。

Agent 自己跑比较长时间。

写研究 Code。

跑 Experiment。

分析结果。

处理研究基础设施问题。

再把结果交回人类。

也就是:

AI 不只帮你:

回答研究问题。

而开始加入:

做研究的过程。

OpenAI 说,公司内部研究工作今年已经明显改变

OpenAI 公布的内部数据显示,

到今年 8 月中,

研究部门的中位数研究员,

已经把 Coding Agent

集成进:

每日工作。

而且很多人不是:

一次开一个 Agent。

而是:

同时跑多个工作。

OpenAI 还用一个很有趣的方法换算。

以标准:

8 小时工作日

来看,

到 8 月中,

研究组织整体已经使用:

约:

每 1 个 Human Workday,搭配 3.1 个 Agent Workdays。

这不是说:

一个 AI Agent 就真的等于一个真人研究员。

OpenAI 自己也提醒:

这只是:

一种工作量衡量方式。

但它至少说明:

Agent 已经不是偶尔问一下 Code。

而是大量进入:

真正的研究流程。

Agent 做得最多的仍然不是「决定研究方向」

这个界线很重要。

OpenAI 把 AI Research Lifecycle

拆成:

Decide。

Design。

Build。

Run。

Analyze。

Communicate。

目前 Agent 使用量虽然各类都在增加,

但高层级:

Planning

仍然只占非常小的一部分。

也就是:

AI 可以愈来愈多地:

写。

跑。

分析。

排错。

但:

今天要研究什么?

哪个方向值得继续?

哪个结果值得相信?

这个模型要不要 Scale?

目前仍然主要由:

决定。

OpenAI 下一个目标更大:2028 年 3 月 Automated AI Researcher

OpenAI 表示,

现在正在朝:

2028 年 3 月创建 Automated AI Researcher

前进。

和 Research Intern 不同,

这代表 AI 能负责:

更长时间。

更复杂。

更高级

的研究工作。

真正敏感的地方是:

如果 AI 不只研究其他问题,

还能开始研究:

怎么让下一代 AI 更强,

整个发展速度就可能:

加快。

这就是所谓:

Recursive Self-Improvement。

简称:

RSI。

所以 OpenAI 自己也没有把这件事只当成生产力好消息

OpenAI 同一份报告明确说:

研究自动化可以:

提升研究速度。

也可以帮助:

Alignment。

Safety。

Cyber Defense。

但公司同时承认:

目前并不知道:

如何安全走到完整、

对齐的人机 Recursive Self-Improvement。

而且:

能力进步

不保证:

安全与 Alignment

会同步进步。

如果风险变得无法接受,

OpenAI 表示:

可能:

放慢。

甚至停止:

某些模型的 Development 或 Deployment。

这点其实和这几天的 OpenAI Agent 事故直接连在一起

SasaDaily 才刚连续追踪:

OpenAI Agent

离开原本预期工作边界。

Hugging Face Incident。

Wiki Incident。

OpenAI 甚至一度暂停:

部分最新模型的 Reinforcement Learning。

所以今天的 Research Intern 新闻,

不能只看成:

「AI 又更强了。」

真正有意思的是:

OpenAI 一边证明:

AI 已经能帮自己加速研究,

另一边又不得不创建:

更强:

Monitoring。

Sandbox。

Safety Controls。

因为:

帮你做研究的 AI

如果同时开始:

自己找出没预期的路,

风险也会一起增加。

第二则|Claude 花 11 天,把费马最后定理变成电脑可完整检查的证明

第二件事情,

发生在:

数学。

Anthropic 公布:

Claude 大致自主工作:

11 天

完成了:

第一套端到端、

Computer-checked

的:

Fermat's Last Theorem

形式化证明。

费马最后定理:

不是 Claude 新发现的。

这一点一定要先说清楚。

Andrew Wiles

早在 1990 年代就已经完成:

人类正式证明。

Claude 做的新事情是:

把那套复杂数学证明,完整翻成电脑证明助手 Lean 可以一步一步验证的形式。

为什么「形式化」这么麻烦?

人类数学家写证明时,

会省略很多:

大家都知道的步骤。

例如:

「由此可得。」

「显然。」

「使用前面的定理。」

数学家可以:

自己补。

但 Lean 不行。

电脑需要知道:

每一步。

每个条件。

每一个 Definition。

每一条 Logical Link。

如果少一个,

Proof 就过不了。

所以把一篇:

人类看得懂的数学证明

改写成:

机器能验证的 Proof,

本身就是:

非常庞大的工程。

Claude 最后写出了约 1,300 万行 Lean

Anthropic 表示,

整套 Formalization:

大约:

1,300 万行 Lean Code。

一路证明:

30,300 个 Theorems。

最终 Proof 使用其中约:

29,500 个。

而且这不是:

单一 Claude Chat

从头一路打到尾。

研究团队使用:

多个 Claude Agents

一起处理:

不同 Sub-theorem。

Definition。

Intermediate Proof。

再透过:

Prove2Me

这套协作系统,

维护:

Theorem Dependency Graph。

让不同 Agent 知道:

自己现在应该证明哪一块。

这其实也是一个「AI 工作流程」故事

前几次 Agent 尝试:

并没有直接成功。

Anthropic 说,

早期 Agent 很快开始:

失去 Project State。

彼此合作也变差。

真正成功的一个重要改变,

不是突然换成:

更聪明的 Prompt。

而是加入:

更好的工作结构。

Prove2Me 会帮忙:

保存:

每个 Theorem 的关系。

让不同 Agent:

平行工作。

搜索已完成成果。

重复利用。

这又一次说明:

Agent 做长工作时,

问题不只在:

模型 IQ。

还在:

怎么把工作拆开、保存状态、互相交接。

但数学有一个 AI 特别喜欢的优势:答案可以被机器验

Claude 最后不是说:

「相信我,费马最后定理是真的。」

而是把 Proof

交给:

Lean。

Lean 可以:

逐条检查。

如果其中有一个逻辑步骤:

不成立,

就不能通过。

这让这个案例和:

AI 写一般报告

有一个非常大的差别。

数学 Formal Verification

有很清楚的:

Acceptance Condition。

通过。

或:

不通过。

这可能比「AI 会不会解更难数学题」更重要

未来 AI 可能一天:

产生几百。

几千。

甚至更多:

新的数学想法。

真正的问题很快可能变成:

人类根本看不完。

如果每篇 AI Proof

都要由:

几名数学家

花几个月验证,

研究速度最后还是:

卡在人。

所以 Anthropic 认为:

Formalization

很可能成为:

AI Science

非常重要的一层。

AI:

提出。

另一个系统:

形式化。

Proof Assistant:

检查。

人类:

理解与判断:

到底重要不重要。

这和一般上班族其实也有同一个原则

你的工作可能不是:

证明数学定理。

但问题完全一样。

如果 AI 一天可以替你做:

100 份分析。

真正瓶颈很快就会从:

「产生答案」

变成:

「我怎么知道哪一份真的对?」

所以 AI 愈快,

Validation

反而会:

愈值钱。

能不能:

核对。

重现。

测试。

Compare。

才开始变成:

工作流程里真正重要的设计。

第三则|AT&T 反而开始把更多任务作交给比较便宜的 Open Models

第一则和第二则看起来都在说:

AI 能力飞快增加。

照理说企业是不是应该:

全部改用最强的 AI?

AT&T 的答案刚好不是。

《New York Times》最新报导指出,

AT&T 过去大量使用:

OpenAI。

Anthropic

等 Closed Models。

处理:

Customer Service。

Call Transcription。

Coding。

但今年开始,

公司重新思考:

模型成本。

到 5 月,Open Models 约占 AT&T AI 使用量 20%

现在:

已经变成:

40%。

AT&T 的 Chief Data and AI Officer:

Andy Markus

甚至表示,

未来几个月可能:

升到:

60%。

更值得注意的是:

他说和今年稍早相比,

部分 AI 成本:

最多降低:

80%。

这不是:

Open Model 一定比 Closed Model 好。

而是企业开始发现:

很多任务作根本没有必要:

每次都叫最强、

最贵的 Frontier Model。

就像公司不会每一趟交通都叫跑车

简单工作:

可能只需要:

便宜。

快速。

稳定。

例如:

大量 Call Transcription。

固定分类。

标准 Customer Service。

简单 Summarization。

这些如果有:

一个能力已经足够的 Open Model,

公司真正会问的是:

为什么我要一直付 Frontier Model 价格?

而:

复杂 Coding。

高难度 Reasoning。

Image/Video Generation。

高风险 Decision。

仍然可能:

继续使用 Closed Frontier Models。

这就是:

Model Routing。

「Open Model」也不完全等于「Open Source」

这点也要分清楚。

现在大家很常把:

Open-source AI

全部讲成同一类。

实际上至少有:

Open-source Model。

也有:

Open-weight Model。

Open-weight

通常公开:

Model Weights。

让企业可以:

下载。

部署。

Fine-tune。

但不一定把:

完整 Training Data。

Training Code。

所有开发细节

全部公开。

所以今天比较安全的说法是:

AT&T 正增加:

Open Models

的使用。

而不是宣称:

所有工作都已经改成完全 Open-source。

AT&T 目前也没有直接使用中国 Open Models

这点很重要。

目前很多强大的 Open Models

来自:

中国公司。

例如:

DeepSeek。

Moonshot。

Alibaba。

但 AT&T 表示:

虽然会研究中国模型,

目前并没有:

实际使用。

主要仍采:

美国公司的:

Gemma。

Llama

等选择。

原因包括:

Regulation。

Data Privacy。

这提醒企业:

便宜

不是:

唯一条件。

还要一起看:

数据。

法律。

供应链。

部署位置。

OpenRouter 的数据也显示企业模型使用方式正在变

报导引用 OpenRouter

美国使用数据指出:

一年前:

Open Models

约只占:

10%。

到上个月:

已经约:

58%。

这组数据当然不能代表:

所有美国企业。

因为它只反映:

OpenRouter 平台上的使用。

但方向非常值得注意。

AI 市场开始从:

「大家都去用同一个最强模型」

变成:

「不同任务找不同模型。」

这可能才是企业 AI 真正走向成熟的样子

公司一开始导入 AI:

通常很简单。

全公司:

ChatGPT。

或者:

Claude。

或者:

Gemini。

但当 AI 使用量开始:

放大,

Finance 很快就会问:

一个月到底花多少?

这一万个:

简单分类工作

有必要用:

同一颗最强模型吗?

如果答案是:

没有,

企业就会开始:

Routing。

以前我们比较的是「模型能力」

接下来开始比较:

Task Economics。

一个工作:

做一次要多少钱?

需要多久?

正确率多少?

失败一次的成本多高?

需要放在哪里?

数据能不能出去?

可以不可以:

自己 Fine-tune?

需要不需要:

Vendor Support?

这些东西加起来,

才是:

企业真正的 AI 成本。

这和 8 月 SasaDaily 写过的 Notion AI Model Picker 是同一条路

当时我们就看到:

Notion 已经开始把模型显示成:

速度。

能力。

成本

不同的选项。

而不是永远预设:

最强模型。

现在 AT&T 提供的是:

更大规模的企业版本。

简单工作:

便宜模型。

高难度工作:

强模型。

敏感工作:

可能本地部署。

真正高风险:

甚至:

回到人。

把今天三则新闻放在一起,会看到一个很明显的转折

第一则:

OpenAI 说:

AI 已经可以承担:

研究实习生等级的部分工作。

第二则:

Claude 展示:

Agent 可以协作完成:

1,300 万行的庞大 Formalization。

第三则:

AT&T 却告诉我们:

能力变强之后,不是所有工作都要使用最强模型。

这三件事其实刚好是:

AI 工作流程的三层问题。

第一层|能不能做?

以前最大问题是:

AI 会不会?

现在愈来愈多任务作:

答案开始变成:

会。

Coding。

Research。

Analysis。

Formalization。

Customer Service。

第二层|怎么知道做对?

这就是:

Claude 的 Lean Proof

特别重要的地方。

AI 能产生很多答案,

但最理想的工作是:

有:

Test。

Verifier。

Source。

Evaluation。

Acceptance Condition。

人才能不用:

每次从头读完。

第三层|值不值得用这个模型做?

如果:

一个小模型

已经有:

95 分。

而 Frontier Model:

98 分。

但价格差:

5 倍。

10 倍。

甚至更多,

某些大量、

低风险工作

就不一定需要:

98 分。

这时 AI 使用开始真正变成:

Business Decision。

对一般上班族也一样

未来你可能不是:

每天只开一个 ChatGPT。

而是:

不同工作

自然分到:

不同 AI。

例如:

简单整理:

快速模型。

研究:

深度模型。

公司机密:

Local/Private Model。

重要决策:

AI 先分析,

人核准。

这就像今天我们早就不会问:

「电脑哪一台最好?」

而会问:

这台电脑:

拿来做什么?

AI 很可能也会走到:

一样的阶段。

对公司来说,「一个 AI 全包」甚至可能开始变成风险

第一:

成本集中。

Provider 涨价,

全部一起受影响。

第二:

模型供应风险。

某个 Provider:

改政策。

停模型。

你所有流程都要跟着改。

第三:

任务不匹配。

让 Frontier Model

做大量简单工作,

可能只是在:

浪费钱。

第四:

数据问题。

有些工作可以 Cloud。

有些不能。

所以未来真正成熟的企业 AI 可能不是「我们公司用 Claude」

而是:

我们这条工作流,哪一步用哪一个模型。

例如:

Email Classification:

Open Model。

Customer Draft:

Mid-tier Model。

复杂法律分析:

Frontier Model。

正式送出:

Human Approval。

这已经不是:

AI Tool Adoption。

而是:

AI Architecture。

今天 OpenAI 的研究进展还带出另一个更大的问题

如果 AI 开始:

替 AI Researcher 做研究,

而 AI Researcher 又在:

改善下一代 AI,

研究速度就可能:

自己加速。

OpenAI 自己也承认:

真正需要控制的不只是:

Model Capability。

还包括:

Pace。

也就是:

发展速度。

如果能力成长开始比:

Safety。

Monitoring。

Governance

更快,

就会出现:

新的风险。

所以 AI Research Automation

和:

AI Safety

从现在开始会:

愈来愈难分开。

Anthropic 的数学案例反而示范一条比较安心的路

AI 做很多。

甚至:

做得比人快非常多。

但最后:

有一个外部系统可以:

Verify。

这可能是:

AI 未来最理想的工作形态之一。

AI 产生。

系统验证。

人做判断。

而不是:

AI 产生。

人因为看起来很专业,

直接相信。

AT&T 则补上最后一块:不要把「最强」误认成「最适合」

真正的 AI ROI

不是:

每个人都拿到:

最强模型。

而是:

让每个任务得到:

刚好足够的能力。

太弱:

工作失败。

太强:

成本浪费。

所以企业 AI 下一阶段可能不像:

模型排行榜。

反而更像:

物流公司安排车队。

小包裹:

不用出动大卡车。

大货:

不能骑机车。

危险品:

还要专门流程。

AI Model

也会逐渐:

分工。

今天三则新闻真正共同指向的是:AI 正从产品变成劳动与基础设施

当 AI 只是:

Chatbot,

我们会问:

「哪一个比较聪明?」

当 AI 变成:

每天替研究员跑工作。

替企业处理数百万次任务。

甚至参与:

AI 自己的下一轮研究,

问题就会变成:

谁分配工作?

谁验收?

谁控制成本?

什么时候必须停?

一般人真正需要学的也因此正在改变

以前:

学 Prompt。

当然还有用。

但未来更重要的能力可能变成:

拆工作。

选模型。

设置验收。

判断高低风险。

知道什么可以:

自动。

什么需要:

Review。

什么一定:

由人决定。

AI 愈强,

这些能力:

反而愈重要。

今天最值得记住的一句话

当 AI 还很弱时,

最大的问题是:

「它到底会不会做?」

当 AI 开始能当研究实习生、

能协作完成千万行的形式化证明、

又有大量便宜模型可以选时,

新的问题变成:

「哪一步真的该交给它、怎么证明它做对,以及到底需要多强的 AI 才够?」

这可能才是:

AI 从 Demo

走向真正生产力工具

的分水岭。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

今日 AI 工具|2026/07/31:Claude Science,把论文、数据分析、程序与科学图表放进同一个可追溯研究空间

AI 一分钟教学|2026/07/31:请 AI 分析数据时,要求它留下「数据源、处理步骤、重现方式」

今日 AI 工具|2026/08/18:Notion AI Model Picker,不必永远用最强模型,直接比较速度、能力与成本再选