不能保证。

昨天我们学了一个很实用的写法:

叫 Copilot 创建:

Word。

Excel。

PowerPoint

以前,

先写:

「数据里没有的日期、金额、数字、承诺或结论,不要自行补。」

这句话:

很值得写。

但不要把它理解成:

只要写了这一句,AI 从此绝对不会补错东西。

它做不到这种保证。

因为 Prompt 是工作指令,不是硬性数据锁

你告诉 Copilot:

「不要自行补。」

等于告诉一位助理:

「这份报告只能用桌上这些数据。」

正常情况下,

它会尽量照做。

但 AI 仍然需要:

阅读。

摘要。

分类。

推理。

重新组织。

决定:

哪些东西重要。

哪些东西相关。

哪些句子应该合并。

所以最后仍可能:

出现错误。

Microsoft 自己也没有说 Copilot 产出的东西一定正确

Microsoft 对 Word、Excel、PowerPoint Agents

的官方提醒非常直接:

产生文件以后,

分享以前要先检查准确性。

Microsoft 对一般 Copilot Output

甚至另外做了一套:

Validation。

因为一份内容:

看起来很完整。

文字很顺。

格式很漂亮。

并不代表:

它已经可以直接使用。

「没有乱编一个新数字」只是第一层

很多人想到 Hallucination,

会以为只有这种:

原始数据没有:

100 万元。

AI 却突然写:

100 万元。

当然这算问题。

但实际工作里,

更常见的错误:

没有这么明显。

第一种:原文有数据,但 AI 理解错

例如原始文档写:

「预算上限 50 万元。」

Copilot 最后整理成:

「项目预算为 50 万元。」

两句只差一点点。

但意思完全不同。

一个是:

最多不能超过。

另一个变成:

已经确定要花。

AI 没有凭空发明:

50 万。

但它仍然:

改变了事实。

第二种:把「可能」写成「确定」

例如会议纪录:

「客户可能把活动改到星期五。」

演示文稿最后变成:

「活动将于星期五举行。」

日期:

本来就出现在数据里。

所以你很难一眼发现:

它不是乱补。

但真正错的是:

确定程度被改掉。

这在工作文档里:

非常危险。

第三种:两份都是真的数据,被 AI 拼成一个错答案

例如:

旧版 Proposal:

活动时间 14:00。

新版 Email:

活动时间改成 15:00。

两个来源:

都是真的。

如果 Copilot:

没有判断出版本先后,

可能在演示文稿写:

14:00。

甚至:

不同页面出现两个时间。

这不是:

AI 自己编数据。

而是:

选错来源。

第四种:数据没有写清楚,AI 自己完成语意

原始数据:

「供应商尚未确认。」

AI 为了让 Project Summary

读起来更完整,

可能整理成:

「供应商预计明天确认。」

它可能认为这只是:

合理补充。

但对公司来说:

这已经是:

一个新的事实。

所以:

「不要补」

真正要防的不只是:

乱生数字。

还包括:

把推论写成事实。

第五种:它可能省略一个真正重要的限制

例如原始数据:

「方案 A 预估每月可省 10 小时,但只适用数据格式固定的客户。」

PowerPoint 为了缩短文字,

最后只留下:

「方案 A 每月可省 10 小时。」

它没有:

增加错误信息。

但它把:

限制条件删掉。

结果仍然会:

误导。

Microsoft 的 Validation Guidance

也特别提醒:

Copilot Output

可能:

遗漏会改变判断的重要 Context。

所以:

错误不一定来自:

多写。

有时来自:

少写。

第六种:Excel 看起来最像「一定对」,其实一样可能出错

Excel 特别容易让人放心。

因为:

有公式。

有 Chart。

有百分比。

有合计。

看起来不像:

AI 在写作文。

但 Microsoft 自己也提醒:

Copilot 在 Excel

可能:

误解信息。

产生不准确结果。

Formula。

Insight。

Table

都要:

检查。

例如:

AI 没有乱补原始收入。

但它可能:

公式抓错 Range。

漏掉一列。

把百分比:

分母用错。

最后 Chart:

仍然非常漂亮。

所以「数据没有就不要补」到底有没有用?

有。

而且值得继续用。

因为它把:

Evidence Boundary

说得比:

「帮我做完整一点」

清楚很多。

它是在告诉模型:

完整性不要优先于真实性。

这是一条很好的:

行为规则。

只是不能把:

比较不容易出错

理解成:

保证不会出错。

那要怎么补第二层?

最简单的方式:

AI 做完后,

不要再问:

「你确定吗?」

因为它很可能回答:

「确定。」

这没有增加多少验证价值。

改问:

「把文档中的日期、金额、数字、正式承诺与主要结论逐项列出,并指出每一项来自哪份原始数据;找不到来源的标成未确认。」

这才是在做:

Source Check。

Microsoft 现在也直接建议做 Source Check

Microsoft 的 Copilot Validation 指南

建议用户检查:

产出的 Claim

是不是:

真的反映原始数据。

重要叙述:

能不能追溯到:

可靠来源。

Copilot 是否:

混合不同信息。

夸大确定性。

或用:

Assumption

填补缺口。

这和我们今天的问题:

完全一样。

如果找不到来源,就先当成「未确认」

不要因为:

AI 写得很像真的

就替它找理由。

例如:

「这应该是它分析出来的吧。」

如果这份文档是:

内部脑力激荡,

可以保留,

但标成:

推论。

如果它是:

对外 Proposal。

正式报告。

报价。

财务表。

客户承诺。

那:

来源找不到

就不应该写成:

已确认事实。

可以把昨天四行再加上一个「第五步」

昨天是:

成品。

对象。

必留。

不能补。

今天补上:

来源核对。

流程就变成:

产生前

成品:

我要什么?

对象:

谁要看?

必留:

什么不能被删?

不能补:

哪些信息不能猜?

产生后

来源核对:

重要 Claim 到底从哪里来?

这样才形成:

完整循环。

不用整篇每一句都查来源

这也没有必要。

真正要查的是:

会造成后果的信息。

例如:

人名。

日期。

Deadline。

价格。

数量。

百分比。

公式。

正式结论。

法律要求。

客户要求。

外部承诺。

以及:

任何会影响:

决策

的句子。

一般语句:

「本项目希望提升效率。」

未必值得花时间逐字确认。

但:

「预计降低 30% 成本。」

就一定要问:

30% 从哪里来?

可以直接用「高风险信息」做 QA

例如 AI 做完 PowerPoint,

先只检查:

所有数字。

所有日期。

所有带:

一定。

已确认。

已决定。

将会。

保证。

预计节省

等语意的句子。

这些地方:

最容易把:

推测

变成:

事实。

Word 则要特别看结论是不是超出原文

例如原始访谈:

三个人说:

「导入流程有点复杂。」

Copilot 最后写:

「员工普遍反对新系统。」

这就超过:

原始 Evidence。

它可能没有:

编造任何一句访谈。

但:

结论太大。

所以 Word Report

一定要检查:

结论强度

有没有超过:

原始数据。

PowerPoint 特别要看「浓缩后有没有改意思」

演示文稿页面空间有限。

AI 很容易:

把一大段:

条件式叙述

压缩成:

一句很有力的标题。

这对 Presentation:

很好看。

但对事实:

可能很危险。

例如:

原文:

「如果 Q4 需求维持目前速度,且新设备如期交付,产能可能提升约 15%。」

标题变成:

「Q4 产能提升 15%」

所有字:

都来自原始 Context。

但结论:

已经被改写。

Excel 则看「数字来源+公式」

如果 Copilot 创建:

一张 Summary。

你至少要确认:

原始 Rows:

有没有漏。

公式:

Range 对不对。

空白:

有没有被当 0。

百分比:

分母对不对。

Chart:

是不是选错 Series。

因为 Excel AI

最危险的地方就是:

错误也可能长得非常专业。

只让 Copilot 自己检查自己够不够?

也不够。

它可以:

帮忙找:

Mismatch。

Assumption。

Missing Context。

这非常有用。

但 Microsoft 自己也明确说:

Copilot 可以帮你:

Validate Output,

却不能替自己的正确性做最终认证。

真正重要的数据:

仍然要回:

Original Source。

这就是:

AI Review

和:

Human Verification

的差别。

AI 可以当第二个 Reviewer,但不能当自己的公证人

你可以要求:

「指出哪些叙述没有直接 Evidence。」

「列出所有 Assumption。」

「比对原始数据和演示文稿是否一致。」

「找出数字、日期与名字的差异。」

这些都值得做。

但如果它说:

「全部正确。」

不能因此:

自动结案。

高风险数据:

仍然要:

人确认。

那这样用 AI 不是很麻烦吗?

不一定。

真正要比较的是:

以前你从:

空白页

开始做整份文档。

现在:

AI 先做 80%。

你花:

10 分钟

查:

高风险 20%。

如果最后总时间:

还是下降,

就有价值。

问题不是:

AI 需要检查

就代表没有用。

而是:

不要把:

First Draft 很快

错认成:

Final Output 已经好了。

最容易犯的错,就是看到一份漂亮文件后降低警戒

纯文字 Chat:

写错一个数字,

你可能马上怀疑。

但一份:

排好版的 Word。

有 Chart 的 Excel。

漂亮的 PowerPoint。

会让人有一种:

「这已经做完了。」

的心理。

其实:

Format 完成

和:

Evidence 完成

是两件事。

所以今天答案可以浓缩成一句公式

「不要自行补」

=

比较清楚的:

Prompt Boundary。

但:

不等于:

Accuracy Guarantee。

真正可靠的流程是:

先限制。

↓

再生成。

↓

查重要 Claim。

↓

回原始来源。

↓

人确认。

和 9 月 12 日的 Plaud 问题其实是同一个核心

当时我们问:

Plaud Agent

做出的 PPTX

已经 Grounded in Conversation,

是不是就能:

直接寄给客户?

答案也是:

不能直接推论。

有 Context

不代表:

AI 归纳零错误。

今天则再往前一步:

即使你已经明确告诉 Copilot:

「不要补。」

也只是:

增加一层限制。

不是:

消除所有错误。

8 月 9 日多文档问题也是一样

AI 可以把:

三份文档

整理得非常漂亮。

但如果:

三份来源本来就:

互相矛盾,

AI 整理完成

并不代表:

矛盾消失。

它甚至可能:

替你选了一个版本。

所以 AI 文档 Workflow

最后都会回到同一个问题:

你知不知道哪个来源才是真的?

最后记住这个判断

如果 Copilot 写了一句:

你原本没有印象的:

数字。

日期。

承诺。

结论。

不要先问:

「它是不是乱编?」

先问:

「我能不能回到来源找到它?」

找到:

再确认 Context 有没有被改变。

找不到:

先标:

未确认。

这比单纯相信:

「我 Prompt 已经写不要补了」

安全得多。

因为好的 AI Workflow

不是:

设计一个永远不会犯错的 Prompt。

而是:

就算 AI 犯错,你也有一个很快能把错误抓出来的方法。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

AI 快问快答|2026/09/12:Plaud Agent 做出的 PPTX 已经引用会议 Context,就可以直接寄给客户吗?

AI 快问快答|2026/08/09:AI 已经把多份文档整理好,就代表数据彼此一致、可以直接下结论吗?

AI 快问快答|AI 产生的内容可以直接拿来用吗?先知道这 3 件事