企业导入 AI,常常会卡在一个很现实的地方:
AI 很聪明。
但公司每天真正使用的系统:
根本没有 AI 可以接。
可能是一套十年前买的 CRM。
一个只能用浏览器登录的 ERP。
一堆 Excel。
内部后台。
旧网站。
甚至只有:
按钮。
字段。
下拉菜单。
没有 API。
没有 Connector。
也没有人想花半年:
重新开发整套系统。
GPT-6 Astra 最新真正值得看的地方,就在这里。
OpenAI 把它推进:
ChatGPT Work。
Codex。
以及:
API。
而 Astra 最重要的新能力之一,是:
直接使用人原本就在使用的电脑软件。
这次重点不是「Astra 会回答更难的问题」
GPT-6 Astra 当然在:
Reasoning。
Coding。
Science。
Cybersecurity。
等很多 Benchmark 上变强。
但如果今天是「今日 AI 工具」:
真正值得一般工作者看的不是:
分数又提高多少。
而是:
它开始更能真的替你操作工作。
例如:
打开网站。
找数据。
填字段。
更新 CRM。
整理 Calendar。
操作 Spreadsheet。
产生演示文稿。
在文档编辑器里修改格式。
测试网站。
甚至安装与测试软件。
这和:
「AI 告诉你下一步该按哪里」
是完全不同的工作方式。
最关键的新点:没有 API,也可能做
企业软件过去要让 AI 真正运行工作:
通常要先想办法接 API。
例如:
CRM API。
ERP API。
Calendar API。
Database API。
如果没有正式界面:
AI 最后还是只能:
告诉人怎么操作。
OpenAI 对 Astra 的新定位则是:
它可以直接透过:
Computer Use
使用人每天操作的软件。
也就是:
看屏幕。
理解界面。
操作按钮。
输入数据。
切换页面。
即使那套应用:
根本没有特别替 AI 准备 API。
例如一家小公司的旧 CRM
假设你的公司有一套:
十年前建的客户管理系统。
每天员工都要:
登录网站。
搜索客户。
打开 Profile。
找到电话栏。
修改数据。
按 Save。
这套系统没有:
MCP。
没有:
Modern API。
也没有:
AI Integration。
过去如果你想自动化:
可能要请工程师:
研究内部接口。
写 Script。
维护 Integration。
现在 Astra 的方向变成:
先直接操作现有界面。
就像:
一个新员工坐到电脑前。
学会:
这个按钮怎么按。
这就是 Computer Use 真正可能改变企业 AI 的地方
很多公司的问题:
从来不是没有 AI。
而是:
AI 和真正工作的地方:
隔着一堵墙。
公司数据在:
Excel。
旧 ERP。
Browser App。
Desktop Software。
内部工具。
供应商网站。
AI 在:
Chat Window。
所以用户还是要:
问 AI。
拷贝结果。
切到 ERP。
粘贴。
再切回 AI。
再问。
再切到 Excel。
再贴一次。
如果 AI 真正能操作这些软件:
中间大量:
Copy/Paste/Switch App
才有可能真的被拿掉。
OpenAI 展示的工作已经不只是 Demo 小游戏
官方列出的 Astra Computer Use 例子包括:
填写在线表格。
更新 CRM Customer Records。
整理 Calendar。
Online Research。
把 Summary 写进 Email 或 Document Editor。
分析 Scientific Data。
产生 Plot。
创建网站。
跑 Frontend QA。
安装与测试 Software。
根据屏幕画面排除问题。
还包含:
Spreadsheet。
Power BI。
Legal Document Formatting。
设计工作。
这些都是:
真正有人每天在做的事。
Spreadsheet 是一个很好的例子
假设你是:
财务分析师。
以前工作可能是:
打开数据。
整理字段。
创建公式。
做 Pivot。
调格式。
画 Chart。
最后才开始:
解读数字。
AI 如果只是告诉你:
「建议创建 Pivot Table。」
其实没有帮你省掉多少操作。
Astra 的 Computer Use 则是想把:
创建。
整理。
格式化。
实际操作。
一起做掉。
最后人真正花时间在:
这些数字代表什么?
OpenAI 甚至拿 Excel 比赛测 Computer Use
官方展示 Astra 运行:
Financial Modeling World Cup 类型的 Excel 工作。
OpenAI 表示:
在相关 Computer Use Demo 中:
Astra 完成工作大约可以比该比赛的人类冠军:
快四倍。
这当然不能直接翻译成:
「Astra 做任何 Excel 都比人快四倍。」
那只是一个特定测试情境。
但它至少说明:
Computer Use 已经不是:
慢慢点鼠标的实验功能。
OpenAI 正把它当:
正式专业工作能力。
Astra 也开始直接做演示文稿,而不只是写演示文稿大纲
以前让 AI 做演示文稿:
最常得到的是:
第一页写什么。
第二页写什么。
第三页写什么。
最后:
还是自己开 PowerPoint。
OpenAI 这次特别强调:
Astra 更能遵循:
Company Voice。
Template。
Design Standard。
官方展示它只拿到几页既有 Presentation Template:
就能依照原本 Tone 与 Layout:
继续完成新的 Deck。
真正差别是:
从:
帮我想演示文稿内容。
走向:
帮我做成符合公司格式的演示文稿。
Figma 也变成可以操作的工作环境
OpenAI 公布的早期合作回馈中:
Figma 表示:
Astra 可以理解设计方向。
并直接在 Figma 里:
操作较复杂的 Design。
但人仍控制:
Creative Direction。
这种分工很重要。
因为 AI 不一定需要:
决定品牌该长什么样。
它可以先处理:
大量运行。
调整。
搬移。
格式。
制作。
把人的时间留给:
到底要设计成什么。
Coding 更明显:它不只写 Code,还会操作环境
Astra 也被放进:
Codex。
所以 Coding Workflow 不只是:
生成一段 Code。
它可以:
查看 Repository。
修改程序。
使用 Terminal。
安装 Software。
运行 Test。
操作浏览器。
跑 Frontend QA。
看到错误后:
再回 Code 修正。
也就是:
Code → Run → 看画面 → Test → 修正
开始变成一个连续工作循环。
OpenAI 自己就拿 Astra 找到内部 Codex 的 Performance 问题
OpenAI 公布一个内部例子:
工程团队利用 Astra:
找到测试环境中一个 Memory Allocation Bottleneck。
调整 Allocator 后:
官方表示:
Turn Latency 降低约 25 倍。
代价是:
Peak Memory Use 约增加 30%。
这个例子值得看的不是:
每家公司都能立刻提升 25 倍。
而是:
Astra 不只写:
「可能有 Memory 问题。」
它可以一起进入:
真正的 Debug Workflow。
Computer Use 最大的问题也很明显:它真的能按东西
AI 如果只回答问题:
答错:
你可能只是看到一个错误答案。
Computer Use Agent 答错:
它可能真的:
按错。
填错。
上传错。
删错。
分享错。
所以能力变强:
安全要求也必须一起提高。
OpenAI 这次特别把企业控制一起推出
企业管理员可以限制 Astra:
哪些网站可以使用。
哪些 Desktop Application 可以使用。
Upload/Download 怎么控制。
Browsing History 如何管理。
这是一个很重要的方向。
因为成熟的企业 Agent:
不应该是:
「整台电脑全部交给 AI。」
更合理的是:
「你只可以在这几个地方工作。」
例如行政人员的 Astra
你可以想像:
允许它操作:
CRM。
Calendar。
公司内部 Knowledge Base。
禁止:
Payroll。
Banking。
Production Admin。
Personal Email。
这就接近:
真的员工权限管理。
新人加入公司:
也不会因为他是员工:
就直接拿到所有系统 Administrator。
AI Agent:
也不应例外。
高风险动作还可以要求 Confirmation
ChatGPT Work 与 Codex 也提供:
Confirmation Policies。
意思是:
某些 Consequential Action 运行以前:
一定要停下来。
等人批准。
例如:
对外寄送。
删除数据。
分享 Dashboard。
或公司自己定义的其他高风险操作。
这和我们过去一直强调的:
停止条件
其实完全一样。
AI 愈能自己操作:
「做到哪里一定停」
就愈重要。
还有 Automated Review
OpenAI 也表示:
系统可以对可能:
不安全。
未授权。
的 Tool Call:
进行自动 Review。
可以把它理解成:
不是只靠运行 Agent 自己判断:
「我可不可以做?」
旁边还有另一层机制:
检查这次 Action。
这和最近我们做 Qodo 时谈到的:
Independent Review。
有一个很类似的安全思路。
做事的 Agent。
和:
检查这件事可不可以做。
最好不要永远是完全相同的一层。
OpenAI 说意外结果大幅下降,但不能理解成「不会出错」
OpenAI 在自己的 Computer Use Safety Benchmark 中:
测试一些很实际的企业风险。
例如:
暴露 Confidential Information。
把 Dashboard 分享太广。
删除数据。
官方表示:
Astra 产生 Unintended Outcome:
比 GPT-5.6 Sol 少 89%。
这是明显进步。
但:
少 89%
不等于:
零风险。
而且这是:
OpenAI 自己的 Internal Benchmark。
所以合理的理解应该是:
Computer Use 正在变得更可靠。
不是:
现在可以把所有系统权限全部放开。
Computer Use 最好的导入方法可能不是「全部交给它」
例如一家小公司:
每天有:
20 种重复工作。
不要第一天就说:
「全部帮我处理。」
先选:
一个。
例如:
把已经人工批准的客户数据更新到 CRM。
限制:
只能操作 CRM。
只能修改指定字段。
不能删除 Customer。
不能寄 Email。
遇到找不到 Customer:
停。
数据冲突:
停。
完成后:
产生 Change Summary。
人确认。
这样才能知道:
真正失败点在哪里。
等一个流程稳定,再增加第二个 App
例如下一阶段:
CRM 更新完。
再允许:
Calendar。
帮客户创建:
Follow-up Reminder。
但仍然不允许:
直接寄正式客户信。
这种:
逐步扩权
才比较像真的企业部署。
OpenAI 自己对新 Enterprise Control 的描述也是:
先从 Limited Configuration 开始。
再慢慢扩大 Access。
那 Astra 和 ChatGPT Work 到底什么关系?
可以简单理解成:
ChatGPT Work 是工作环境。
Astra 是现在里面能力最强的一颗工作引擎。
ChatGPT Work 原本就能:
研究。
读文档。
连接工具。
制作文档与成果。
Astra 加进去后:
最大的强化之一就是:
Computer Use。
也就是遇到:
没有 API。
没有 Connector。
但人可以操作的系统:
AI 也开始有机会直接工作。
所以今天不是重新介绍:
ChatGPT Work 是什么。
而是:
Work 能做的事情,因为 Astra 的操作能力往前推了一大段。
那 Codex 呢?
Codex 的重点仍然是:
Software Engineering。
但当 Astra 同时具备:
更强 Coding。
Computer Use。
Browsing。
Software Testing。
它就可以把:
写 Code。
操作环境。
测试。
看结果。
重新修正。
串得更完整。
OpenAI 也同步改善 Codex Harness。
官方在 Mind2Web Computer Use 测试中表示:
新的 Astra+Codex 组合:
完成相关工作大约是目前 GPT-5.6 Sol Experience 的:
1.9 倍快。
一样要注意:
这是 Benchmark。
不是任何 Coding 工作都一定快 1.9 倍。
API 价格也不是便宜模型路线
OpenAI 目前公布:
GPT-6 Astra API:
起价为每百万 Input Token:
10 美元。
Output:
50 美元。
所以 Astra 的定位很明显:
不是:
「所有简单工作全部丢给它。」
而是:
比较复杂、价值比较高、能省掉大量人工操作的工作。
如果只是:
改一句文案。
摘要一封信。
不一定需要:
最强模型。
真正该算的是 Cost per Task
这也是企业使用 AI 开始变成熟的一个地方。
不要只看:
Token Price。
假设便宜模型:
一个任务跑五次。
一直改。
一直重试。
最后:
花 20 分钟。
较贵模型:
一次完成。
5 分钟。
那么真正应比较的是:
完成一件工作的总成本。
而不是:
一百万 Token 便宜几美元。
OpenAI 这次自己也一直强调:
Astra 减少:
Retries。
Steps。
Token。
因此要看:
Useful Work per Dollar。
但最强模型也不能跳过验收
假设 Astra:
自己打开 CRM。
更新数据。
创建 Calendar。
做出 PPT。
最后显示:
Completed。
不能因此直接理解成:
所有内容都正确。
还是要看:
数据是不是最新。
修改范围对不对。
有没有改到不该改的字段。
演示文稿数字有没有来源。
Calendar 时区正不正确。
尤其只要牵涉:
钱。
权限。
正式承诺。
Production。
删除。
外部发送。
人类 Gate:
还是应该留着。
Astra 的 Cyber 能力也让「最小权限」更加重要
GPT-6 Astra 同时是 OpenAI 第一个达到:
Critical Cybersecurity Capability
门槛的模型。
这代表:
它不只比较会:
一般 Coding。
在适当工具与环境下:
也具备非常强的漏洞发现能力。
OpenAI 因此对目前广泛推出的 Astra:
限制更高级的攻击性 Cyber Task。
例如:
针对 Vulnerability 创建某些 Proof-of-Concept Exploit:
会受到限制。
这再次提醒:
能力越强:
不能只想:
「它能做多少?」
还要想:
「它到底需要多少权限?」
新的 Enterprise Plugins 也一起出现
OpenAI 这次还同步公布新的:
ChatGPT Desktop Enterprise Plugins。
首波包含:
Oracle Analytics。
Power BI。
Navan。
Avalara。
这代表另一条路也没有消失。
最好的企业 AI:
可能同时有:
正式 Plugin/Connector。
以及:
Computer Use。
有 API:
优先使用结构化方式。
没有 API:
再透过界面操作。
这比所有事情都靠:
AI 点鼠标。
更合理。
所以 Computer Use 不是要取代 API
这一点很重要。
API 的好处是:
数据结构清楚。
速度快。
错误容易追踪。
权限容易限制。
大量操作更稳定。
Computer Use 的价值则是:
补 API 到不了的最后一哩。
例如:
老系统。
小供应商网站。
只有 Browser UI 的后台。
临时网站。
人类每天要手动操作的软件。
这些地方:
才可能是 Astra 最大的价值。
对一般上班族最实际的想像
以前你可以问 ChatGPT:
「帮我整理这份数据。」
接下来可能变成:
「读这份已批准名单,把 CRM 里相同客户的联系数据更新;不确定的不要改,最后列出修改清单给我确认。」
以前:
「帮我规划会议。」
接下来:
「根据这三人的 Calendar 找两个共同时段,先不要送 Invitation,把候选时间整理给我。」
以前:
「帮我看这网站有没有问题。」
接下来:
「打开测试站,走一次注册流程,检查手机版主要功能,把异常截屏并整理成 QA Report,不要碰 Production。」
这才是 Computer Use:
真正容易理解的使用方式。
今天如果第一次拿到 Astra,不要先测最危险的事
不用:
付款。
不用:
删数据。
不用:
改 Production。
先挑:
看得到结果、做错可以还原、范围很小
的工作。
例如:
整理 Spreadsheet。
做 Draft Deck。
测试 Staging Website。
查数据。
制作 Internal Report。
当你知道它:
在哪里很稳。
哪里会卡。
哪里会猜。
再慢慢扩大。
GPT-6 Astra 真正的新意,不只是「模型又更强」
我们已经看过很多:
更大的模型。
更高 Benchmark。
更长 Context。
但如果企业真正使用 AI:
最后仍然要一个人:
把答案 Copy。
打开旧系统。
再 Paste。
那 AI 还没有真正进到:
工作本身。
Astra 现在想跨过的:
就是这一步。
从知道该做什么。
变成:
能在原本的软件里把事情做掉。
而且不要求:
每家公司先把二十年旧系统全部重写。
这可能才是:
Computer Use 最有商业价值的地方。
但它同时也把另一个问题放大:
AI 原本只能:
建议。
现在可以:
行动。
那么:
允许它去哪里?
允许它改什么?
哪一步一定停?
就不能等出事以后再想。
真正成熟的 AI Agent:
不是拥有整台电脑。
而是:
只拿到完成这一件工作真正需要的权限。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
今日 AI 工具|2026/07/29:ChatGPT Work,连接文档与工作工具,把研究、整理、制作到更新变成一段完整流程
AI 一分钟教学|2026/07/29:把复杂工作交给 AI 前,先请它列出「数据、步骤、确认点」
今日 AI 工具|2026/08/03:Claude Cowork 电脑操作,让 AI 开文件、点网页、操作桌面,但高风险动作要先关掉权限