GPT-6 Astra 最值得注意的一个改变是:
AI 不只会告诉你:
下一步该怎么做。
它开始可以:
真的去做。
打开网站。
操作桌面 App。
点按钮。
输入数据。
改 Spreadsheet。
更新 CRM。
跑测试。
甚至处理:
没有 API 的老系统。
这很方便。
但也代表:
以前一句很普通的 Prompt:
「帮我把这些客户数据整理好。」
现在可能真的造成系统变更。
所以今天只学一个方法:
让 Astra 操作电脑以前,先写一张:
三格权限卡。
只有三格:
允许做。
一定停。
完成后回报。
第一格:允许做什么?
不要写:
「你可以操作 CRM。」
范围太大。
CRM 里可能有:
客户姓名。
电话。
付款数据。
合约。
删除按钮。
Email。
权限设置。
「可以操作 CRM」
并没有真正告诉 AI:
到底可以做什么。
比较好的写法是:
允许进入 CRM,搜索指定客户,修改电话、Email 与联系状态。
这样才有:
范围。
App 权限和动作权限要分开
例如:
可以开 Excel。
不代表:
可以修改所有 Excel。
可以开 CRM。
不代表:
可以改所有 Customer Record。
可以使用 Browser。
更不代表:
可以去任何网站。
所以第一格最好回答三件事:
可以去哪里?
可以看什么?
可以改什么?
例如:
可以进:
公司 CRM。
可以看:
这次名单里的 30 位客户。
可以修改:
电话。
Email。
Follow-up Status。
其他字段:
不要动。
一下就清楚很多。
第二格:什么情况一定要停?
这格更重要。
因为真正危险的往往不是:
AI 不会操作。
而是:
它遇到没预料到的情况,还继续猜。
例如你交给 Astra:
更新客户数据。
它找到:
两个同名客户。
怎么办?
不要让它自己:
挑一个看起来比较像的。
停止。
数据和 CRM 原本内容冲突:
停止。
突然跳出:
「是否删除旧记录?」
停止。
系统要求:
重新登录。
停止。
任务原本只需要 CRM:
结果突然需要进另一个网站。
停止。
停止条件不是只有「付款前问我」
很多人设置 AI Agent 时:
最先想到:
付款一定问。
当然很好。
但 Computer Use 真正需要的停止点更多。
例如:
需要删除任何数据时。
要对外寄出消息时。
要 Upload 公司数据到新网站时。
要 Download 不明文件时。
遇到权限不足时。
数据彼此矛盾时。
找不到指定记录时。
任务需要超出原本 App 时。
遇到任何没有写在允许清单里的动作时。
全部可以先定义:
停。
为什么「不知道」也应该是停止条件?
人工作时常会这样:
「这个好像是王先生吧?」
接着打电话确认。
但 Agent 最大的风险之一就是:
为了完成任务:
把:
不知道。
变成:
猜一个答案。
所以可以直接加一句:
「如果完成下一步需要推测,而原始数据没有足够依据,停止并问我。」
这一句很有价值。
因为:
不知道。
本身不是失败。
不知道却继续做,才可能变成失败。
第三格:做完以后一定要回报什么?
很多 Agent Prompt 只有:
开始。
没有:
结束。
例如:
「帮我把这 30 位客户数据更新好。」
AI 最后说:
完成。
但你不知道:
30 笔真的全部改了吗?
有没有跳过?
哪些字段改了?
遇到错误吗?
有没有自行处理例外?
所以第三格要先规定:
完成后必须交:
Change Report。
Change Report 不用复杂
至少包含四样。
第一:
成功修改哪些项目。
第二:
哪些项目没有修改。
第三:
哪些事情需要人工决定。
第四:
运行期间出现哪些错误或异常。
这样:
「完成」
才真正有意义。
今天整张三格卡可以直接长这样
假设你的工作是:
把人工确认过的客户名单:
更新到旧 CRM。
可以先给 Astra:
任务: 根据我提供的已确认客户名单,更新公司 CRM。 【允许做】 - 只操作公司 CRM。 - 只搜索这份名单中的客户。 - 只修改电话、Email、联系状态。 - 可以读取现有数据来比对。 - 不得修改其他字段。 【一定停】 - 找不到完全相符的客户。 - 出现两笔以上可能相符的纪录。 - 新数据与既有数据冲突,而且无法从来源判断哪一个正确。 - 需要删除数据。 - 需要寄 Email、消息或其他对外内容。 - 需要上传数据到 CRM 以外的网站。 - 系统要求额外登录、权限或付款。 - 需要使用没有列在允许范围内的 App 或网站。 - 任何一步需要靠推测才能继续。 遇到以上任何情况,停止,不要自行决定。 【完成后回报】 - 成功修改哪些客户。 - 每笔修改了哪些字段。 - 哪些客户被跳过以及原因。 - 哪些项目仍需要我决定。 - 运行过程是否出现错误或异常。
这就是:
三格权限卡。
为什么不能只靠 Astra 自己判断风险?
GPT-6 Astra 的确比以前更重视:
Task Boundary。
OpenAI 也表示:
Astra 在敏感任务中会依风险:
采取更谨慎的行为。
ChatGPT Work 与 Codex 还有:
Confirmation Policy。
Auto-review。
以及其他系统安全机制。
但这些不代表:
用户就不需要写清楚自己的业务边界。
因为系统不知道:
你公司真正不能碰的是什么。
系统安全和你的工作规则是两层东西
例如 OpenAI 可以知道:
删除数据:
可能需要更谨慎。
但它不知道:
你公司有一条内部规定:
客户 Status 只有主管可以改成 Closed。
如果你没告诉 AI:
它不一定知道。
又例如:
公司规定:
报价超过 NT$50,000:
一定要主管批准。
这不是通用 AI Safety Rule。
这是:
你的 Business Rule。
所以完整安全应该有:
平台防护。
再加:
你的工作边界。
Enterprise 管理员甚至可以直接限制网站与 App
OpenAI 目前提供的企业管理控制:
可以限制:
Browser Use。
Computer Use。
哪些网站可以访问。
哪些桌面 App 可以操作。
也能限制:
Upload。
Download。
Saved Approval。
这是技术层。
例如 IT 部门直接设置:
CRM:
可以。
公司知识库:
可以。
银行网站:
不可以。
Payroll:
不可以。
但个别任务还是需要自己的小范围
假设公司允许 Astra:
操作 CRM。
今天这个任务:
也不代表应该让它:
碰 CRM 全部功能。
今天只要:
更新电话。
那就只让它:
更新电话。
这个概念可以叫:
Least Privilege。
最小权限。
不是问:
AI 最大可以做到什么?
而是问:
完成这件工作,最少需要什么?
一个很简单的判断方法
每准备开一个权限:
先问:
如果不给这个权限,它还能完成任务吗?
如果答案是:
可以。
那就:
不要给。
例如:
只是更新客户电话:
需要:
CRM。
不需要:
Gmail。
不需要:
银行帐户。
不需要:
Production Server。
不需要:
Personal Drive。
就不用一起开。
「Browser 可以用」也是一个很大的权限
很多人会想:
反正只是让 AI 开 Browser。
有什么关系?
但 Browser 里可能有:
已登录帐号。
Cookie。
公司 SaaS。
Cloud Admin。
社区帐号。
付款平台。
内部系统。
所以企业环境甚至可以用:
Allow List。
只开:
指定网站。
而不是:
整个 Internet。
第一次跑 Computer Use,可以再缩小一层
如果是一个从来没有跑过的新流程:
甚至先不要让 AI 改。
第一轮只做:
盘点。
例如:
「先找出这 30 位客户的 CRM 记录,列出你准备修改哪些字段,不要修改。」
确认一次。
第二轮才运行。
这和以前我们介绍 Computer Use 时的:
只盘点、不修改
原则是一样的。
今天的三格卡:
是在真正开始运行之后:
再把范围写得更完整。
操作 Production 时,更应该保守
Computer Use 很容易让人产生一种错觉:
AI 看起来就像:
真的员工。
所以:
「既然它会用,那就让它处理。」
但真正的员工也有:
Training。
Role。
Access Control。
Approval。
Audit Log。
新人不会第一天:
就拿 Production Admin。
AI 更不应该。
如果工作可以:
先在 Staging。
先在 Copy。
先在 Draft。
就不要直接:
Production。
AI 能操作老系统,反而更需要明确验收
老系统常见另一个问题:
画面不漂亮。
按钮位置奇怪。
错误消息不清楚。
有些操作完成后:
没有明显成功提示。
Computer Use Agent 可能:
以为完成。
实际没存。
所以最后回报不能只要求:
「告诉我完成了。」
可以再要求:
「完成后重新打开修改纪录,确认值已成功保存。」
也就是:
不要只相信:
Action。
还要看:
Result。
对 Spreadsheet 也一样
假设让 Astra:
整理 Excel。
允许做:
修改指定 Sheet。
创建公式。
调格式。
一定停:
来源数据缺漏。
公式会覆盖人工字段。
发现数字与来源不一致。
需要删除整列。
完成后回报:
添加哪些公式。
哪些字段修改。
哪些数字有异常。
一样是:
三格。
对网站 QA 也可以用同样方法
任务:
测试 Staging Website。
允许做:
开 Staging。
创建测试帐号。
走注册流程。
截屏。
一定停:
碰到 Production。
需要真实付款。
需要使用正式客户数据。
出现删除数据动作。
完成后回报:
成功流程。
失败流程。
Screenshot。
重现步骤。
这样:
Computer Use 就从:
「自己去测看看」
变成:
可以验收的 QA Task。
对 Calendar 也可以
任务:
替三个人找会议时间。
允许做:
读三人 Calendar。
找两个共同空档。
一定停:
需要取消既有 Meeting。
需要移动他人进程。
要直接 Send Invitation。
完成后:
列出两个候选时间。
不要寄出。
你会发现:
AI Agent 的安全其实不用:
每次写一篇法律文档。
只要:
边界明确。
「允许做」最好写白名单,不要只写黑名单
例如:
不要写:
「不要删除数据。」
因为 AI 还是有:
很多其他可能动作。
更好的方式是:
直接写:
只允许修改电话与 Email。
这样凡是:
不是电话。
不是 Email。
自然都不在范围里。
这就是:
Allow List。
比一直列:
不能做 A。
不能做 B。
不能做 C。
更容易控制。
「一定停」则适合补那些真正的例外
白名单告诉 AI:
正常工作范围。
停止条件则告诉它:
遇到不确定时:
不要自己扩张。
两个搭配起来:
效果最好。
正常路线:
可以走。
偏离正常路线:
停。
「完成后回报」其实也是 Audit 的第一步
企业最后一定会需要知道:
Agent:
做了什么?
什么时候做?
改了哪里?
哪些没有做?
如果每一个 Agent Task:
最后都有一份简单 Change Report:
未来出现问题时:
至少容易回查。
所以第三格不是:
漂亮的工作摘要。
而是:
责任纪录。
Astra 本身已有更强防护,但 OpenAI 仍保留人工确认
这点其实很能说明问题。
OpenAI把 Astra 描述为:
更能遵守 Task Boundary。
Computer Use 的非预期结果:
也比之前模型明显降低。
但 ChatGPT Work 与 Codex:
依然保留:
Confirmation。
Auto-review。
Monitoring。
如果「模型更聪明」本身就足以解决安全:
这些东西根本不需要存在。
它们仍然存在:
就是因为:
模型判断力提高,不等于责任可以全部移走。
如果 Astra 自己停下来,不要把它当作失败
例如它突然说:
这一步需要你的确认。
很多人会觉得:
「怎么这么麻烦?」
但对真正会操作电脑的 Agent:
能停:
其实是一种能力。
尤其是:
权限改变。
数据冲突。
外部发送。
不可逆操作。
遇到这些地方:
速度慢十秒。
通常比:
做错后修半天。
便宜很多。
今天真正要改的是 Prompt 思维
以前使用 ChatGPT:
Prompt 最重要的是:
我要什么答案?
Computer Use 之后:
要多三题。
你可以做什么?
什么时候一定要停?
做完我要看到什么证据?
这三题:
会比:
「请仔细一点。」
有效很多。
所以今天只记这三格
下一次你准备让:
Astra。
ChatGPT Work。
Codex。
或其他 Computer Use Agent:
真的去动你的软件。
先不要只说:
「帮我全部处理好。」
先写:
允许做
这次真正需要的 App、数据与动作。
一定停
所有不确定、越界、不可逆或高风险情况。
完成后回报
改了什么、没改什么、哪里出错、什么还需要人决定。
AI 真正开始能操作电脑后:
好的 Prompt:
已经不只是:
工作说明。
它同时也是:
权限说明。
而成熟的 Agent Workflow:
不是让 AI:
什么都能碰。
而是让它:
刚好拥有完成这一件工作所需要的权限。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
AI 一分钟教学|2026/08/03:让 AI 操作电脑前,先要求它「只盘点,不修改」