不能保证。
昨天我们学了一个很实用的写法:
叫 Copilot 创建:
Word。
Excel。
PowerPoint
以前,
先写:
「数据里没有的日期、金额、数字、承诺或结论,不要自行补。」
这句话:
很值得写。
但不要把它理解成:
只要写了这一句,AI 从此绝对不会补错东西。
它做不到这种保证。
因为 Prompt 是工作指令,不是硬性数据锁
你告诉 Copilot:
「不要自行补。」
等于告诉一位助理:
「这份报告只能用桌上这些数据。」
正常情况下,
它会尽量照做。
但 AI 仍然需要:
阅读。
摘要。
分类。
推理。
重新组织。
决定:
哪些东西重要。
哪些东西相关。
哪些句子应该合并。
所以最后仍可能:
出现错误。
Microsoft 自己也没有说 Copilot 产出的东西一定正确
Microsoft 对 Word、Excel、PowerPoint Agents
的官方提醒非常直接:
产生文件以后,
分享以前要先检查准确性。
Microsoft 对一般 Copilot Output
甚至另外做了一套:
Validation。
因为一份内容:
看起来很完整。
文字很顺。
格式很漂亮。
并不代表:
它已经可以直接使用。
「没有乱编一个新数字」只是第一层
很多人想到 Hallucination,
会以为只有这种:
原始数据没有:
100 万元。
AI 却突然写:
100 万元。
当然这算问题。
但实际工作里,
更常见的错误:
没有这么明显。
第一种:原文有数据,但 AI 理解错
例如原始文档写:
「预算上限 50 万元。」
Copilot 最后整理成:
「项目预算为 50 万元。」
两句只差一点点。
但意思完全不同。
一个是:
最多不能超过。
另一个变成:
已经确定要花。
AI 没有凭空发明:
50 万。
但它仍然:
改变了事实。
第二种:把「可能」写成「确定」
例如会议纪录:
「客户可能把活动改到星期五。」
演示文稿最后变成:
「活动将于星期五举行。」
日期:
本来就出现在数据里。
所以你很难一眼发现:
它不是乱补。
但真正错的是:
确定程度被改掉。
这在工作文档里:
非常危险。
第三种:两份都是真的数据,被 AI 拼成一个错答案
例如:
旧版 Proposal:
活动时间 14:00。
新版 Email:
活动时间改成 15:00。
两个来源:
都是真的。
如果 Copilot:
没有判断出版本先后,
可能在演示文稿写:
14:00。
甚至:
不同页面出现两个时间。
这不是:
AI 自己编数据。
而是:
选错来源。
第四种:数据没有写清楚,AI 自己完成语意
原始数据:
「供应商尚未确认。」
AI 为了让 Project Summary
读起来更完整,
可能整理成:
「供应商预计明天确认。」
它可能认为这只是:
合理补充。
但对公司来说:
这已经是:
一个新的事实。
所以:
「不要补」
真正要防的不只是:
乱生数字。
还包括:
把推论写成事实。
第五种:它可能省略一个真正重要的限制
例如原始数据:
「方案 A 预估每月可省 10 小时,但只适用数据格式固定的客户。」
PowerPoint 为了缩短文字,
最后只留下:
「方案 A 每月可省 10 小时。」
它没有:
增加错误信息。
但它把:
限制条件删掉。
结果仍然会:
误导。
Microsoft 的 Validation Guidance
也特别提醒:
Copilot Output
可能:
遗漏会改变判断的重要 Context。
所以:
错误不一定来自:
多写。
有时来自:
少写。
第六种:Excel 看起来最像「一定对」,其实一样可能出错
Excel 特别容易让人放心。
因为:
有公式。
有 Chart。
有百分比。
有合计。
看起来不像:
AI 在写作文。
但 Microsoft 自己也提醒:
Copilot 在 Excel
可能:
误解信息。
产生不准确结果。
Formula。
Insight。
Table
都要:
检查。
例如:
AI 没有乱补原始收入。
但它可能:
公式抓错 Range。
漏掉一列。
把百分比:
分母用错。
最后 Chart:
仍然非常漂亮。
所以「数据没有就不要补」到底有没有用?
有。
而且值得继续用。
因为它把:
Evidence Boundary
说得比:
「帮我做完整一点」
清楚很多。
它是在告诉模型:
完整性不要优先于真实性。
这是一条很好的:
行为规则。
只是不能把:
比较不容易出错
理解成:
保证不会出错。
那要怎么补第二层?
最简单的方式:
AI 做完后,
不要再问:
「你确定吗?」
因为它很可能回答:
「确定。」
这没有增加多少验证价值。
改问:
「把文档中的日期、金额、数字、正式承诺与主要结论逐项列出,并指出每一项来自哪份原始数据;找不到来源的标成未确认。」
这才是在做:
Source Check。
Microsoft 现在也直接建议做 Source Check
Microsoft 的 Copilot Validation 指南
建议用户检查:
产出的 Claim
是不是:
真的反映原始数据。
重要叙述:
能不能追溯到:
可靠来源。
Copilot 是否:
混合不同信息。
夸大确定性。
或用:
Assumption
填补缺口。
这和我们今天的问题:
完全一样。
如果找不到来源,就先当成「未确认」
不要因为:
AI 写得很像真的
就替它找理由。
例如:
「这应该是它分析出来的吧。」
如果这份文档是:
内部脑力激荡,
可以保留,
但标成:
推论。
如果它是:
对外 Proposal。
正式报告。
报价。
财务表。
客户承诺。
那:
来源找不到
就不应该写成:
已确认事实。
可以把昨天四行再加上一个「第五步」
昨天是:
成品。
对象。
必留。
不能补。
今天补上:
来源核对。
流程就变成:
产生前
成品:
我要什么?
对象:
谁要看?
必留:
什么不能被删?
不能补:
哪些信息不能猜?
产生后
来源核对:
重要 Claim 到底从哪里来?
这样才形成:
完整循环。
不用整篇每一句都查来源
这也没有必要。
真正要查的是:
会造成后果的信息。
例如:
人名。
日期。
Deadline。
价格。
数量。
百分比。
公式。
正式结论。
法律要求。
客户要求。
外部承诺。
以及:
任何会影响:
决策
的句子。
一般语句:
「本项目希望提升效率。」
未必值得花时间逐字确认。
但:
「预计降低 30% 成本。」
就一定要问:
30% 从哪里来?
可以直接用「高风险信息」做 QA
例如 AI 做完 PowerPoint,
先只检查:
所有数字。
所有日期。
所有带:
一定。
已确认。
已决定。
将会。
保证。
预计节省
等语意的句子。
这些地方:
最容易把:
推测
变成:
事实。
Word 则要特别看结论是不是超出原文
例如原始访谈:
三个人说:
「导入流程有点复杂。」
Copilot 最后写:
「员工普遍反对新系统。」
这就超过:
原始 Evidence。
它可能没有:
编造任何一句访谈。
但:
结论太大。
所以 Word Report
一定要检查:
结论强度
有没有超过:
原始数据。
PowerPoint 特别要看「浓缩后有没有改意思」
演示文稿页面空间有限。
AI 很容易:
把一大段:
条件式叙述
压缩成:
一句很有力的标题。
这对 Presentation:
很好看。
但对事实:
可能很危险。
例如:
原文:
「如果 Q4 需求维持目前速度,且新设备如期交付,产能可能提升约 15%。」
标题变成:
「Q4 产能提升 15%」
所有字:
都来自原始 Context。
但结论:
已经被改写。
Excel 则看「数字来源+公式」
如果 Copilot 创建:
一张 Summary。
你至少要确认:
原始 Rows:
有没有漏。
公式:
Range 对不对。
空白:
有没有被当 0。
百分比:
分母对不对。
Chart:
是不是选错 Series。
因为 Excel AI
最危险的地方就是:
错误也可能长得非常专业。
只让 Copilot 自己检查自己够不够?
也不够。
它可以:
帮忙找:
Mismatch。
Assumption。
Missing Context。
这非常有用。
但 Microsoft 自己也明确说:
Copilot 可以帮你:
Validate Output,
却不能替自己的正确性做最终认证。
真正重要的数据:
仍然要回:
Original Source。
这就是:
AI Review
和:
Human Verification
的差别。
AI 可以当第二个 Reviewer,但不能当自己的公证人
你可以要求:
「指出哪些叙述没有直接 Evidence。」
「列出所有 Assumption。」
「比对原始数据和演示文稿是否一致。」
「找出数字、日期与名字的差异。」
这些都值得做。
但如果它说:
「全部正确。」
不能因此:
自动结案。
高风险数据:
仍然要:
人确认。
那这样用 AI 不是很麻烦吗?
不一定。
真正要比较的是:
以前你从:
空白页
开始做整份文档。
现在:
AI 先做 80%。
你花:
10 分钟
查:
高风险 20%。
如果最后总时间:
还是下降,
就有价值。
问题不是:
AI 需要检查
就代表没有用。
而是:
不要把:
First Draft 很快
错认成:
Final Output 已经好了。
最容易犯的错,就是看到一份漂亮文件后降低警戒
纯文字 Chat:
写错一个数字,
你可能马上怀疑。
但一份:
排好版的 Word。
有 Chart 的 Excel。
漂亮的 PowerPoint。
会让人有一种:
「这已经做完了。」
的心理。
其实:
Format 完成
和:
Evidence 完成
是两件事。
所以今天答案可以浓缩成一句公式
「不要自行补」
=
比较清楚的:
Prompt Boundary。
但:
不等于:
Accuracy Guarantee。
真正可靠的流程是:
先限制。
↓
再生成。
↓
查重要 Claim。
↓
回原始来源。
↓
人确认。
和 9 月 12 日的 Plaud 问题其实是同一个核心
当时我们问:
Plaud Agent
做出的 PPTX
已经 Grounded in Conversation,
是不是就能:
直接寄给客户?
答案也是:
不能直接推论。
有 Context
不代表:
AI 归纳零错误。
今天则再往前一步:
即使你已经明确告诉 Copilot:
「不要补。」
也只是:
增加一层限制。
不是:
消除所有错误。
8 月 9 日多文档问题也是一样
AI 可以把:
三份文档
整理得非常漂亮。
但如果:
三份来源本来就:
互相矛盾,
AI 整理完成
并不代表:
矛盾消失。
它甚至可能:
替你选了一个版本。
所以 AI 文档 Workflow
最后都会回到同一个问题:
你知不知道哪个来源才是真的?
最后记住这个判断
如果 Copilot 写了一句:
你原本没有印象的:
数字。
日期。
承诺。
结论。
不要先问:
「它是不是乱编?」
先问:
「我能不能回到来源找到它?」
找到:
再确认 Context 有没有被改变。
找不到:
先标:
未确认。
这比单纯相信:
「我 Prompt 已经写不要补了」
安全得多。
因为好的 AI Workflow
不是:
设计一个永远不会犯错的 Prompt。
而是:
就算 AI 犯错,你也有一个很快能把错误抓出来的方法。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
AI 快问快答|2026/09/12:Plaud Agent 做出的 PPTX 已经引用会议 Context,就可以直接寄给客户吗?