Crypto OS
Non-Technical Crypto OS第六阶段 · AI × Crypto 与未来链上经济

第 31 章 · AI 如何改变 Crypto Research

AI 给出的结论,凭什么可以相信?

练习的能力
AI LiteracyResearch
动手
搭一条自己的研究流水线:搜集 → 抽取 → 对比 → 验证 → 打分 → 监控,先用一个项目跑通。
AI Lab
让 AI 输出一份研究结论并附来源,你逐条打开来源,统计有多少条经不起核对。

一个现实问题

周一早上,你要在两小时后的会上讲一个你从没听说过的协议。

你把它的名字丢给一个 AI,加了一句「帮我做一份研究简报」。三分钟后你拿到一份三页的东西:它解决什么问题、收入怎么来、代币怎么分配、有哪些风险。分节整齐,语气克制,还附了九个链接。

你把它发进群里。十分钟后,一个同事回了一句:

「这里写的费率是 0.05%,你在哪看的?」

你点开那一条后面的链接。它指向一篇中文解读文章。文章里确实写了 0.05%,并且注明「据官方文档」。你再去翻官方文档,发现文档里现在写的是另一个数,而且页面底部标着几个月前的更新时间——中间有过一次治理投票改了这个参数。

你有点慌,开始逐条点开其余八个链接。结果是:三条能打开并且确实支持那句话,两条打开了但里面根本没提这件事,两条指向的是同一篇二手文章,还有一条是 404。

这份简报没有一句话是明显胡说的。它读起来比你自己两小时能写出来的东西更专业。问题在于你没有任何办法知道,哪几句是真的。

于是本章的问题:AI 给出的结论,凭什么可以相信?

注意这个问题不是「AI 能不能用于研究」。它当然能,而且提速非常明显。真正的问题是:一份混着事实、过期信息和合理猜测的输出,你怎样把它们分开。

如何跟上最新的 Crypto 知识那一页给过一条六步的研究流水线。这一章要做的不是重复它,而是补上它最难的一步:每一条结论的可信度,怎样被单独标出来。

思想实验

三个研究员,同一个陌生协议,同一小时,各交一份东西。

甲全手工。 他打开官方文档、治理论坛和一个区块浏览器,一页页读。一小时后,他交上来 6 条结论。每一条他都能说出是在哪个页面的哪一段看到的,其中 2 条他标了「不确定,文档写得含糊」。

乙全交给 AI。 他给了协议名字和一句要求,把输出复制过来,改了改错别字。一小时里他实际只花了 8 分钟。他交上来 23 条结论,覆盖面比甲宽得多——甲完全没提到的合规状况、竞争格局、团队背景,乙的报告里都有。

丙用 AI 搜集,自己核对。 他先让 AI 列出「要判断这个协议,需要查清楚的 12 件事」,然后自己去一手来源逐个查,把原文段落贴回给 AI,让它按统一格式整理成表。一小时后他交上来 11 条结论,每条后面有一个链接和一句「我是在这一段看到的」。

现在开始检验。找一个真的熟悉这个协议的人,逐条核对。

甲(全手工)乙(全 AI)丙(AI 搜集 + 人工核对)
交出的条数62311
经得起核对的61411
明确错误的050
无法核对的040
覆盖的面最宽中等

乙的报告里,正确的条数(14)比甲和丙都多。这一点必须说清楚,否则这个实验就变成了一个反 AI 的宣传。乙确实产出了最多的正确信息,而且他只花了 8 分钟。

但接着看第二周发生了什么。

这份报告被拿去做了一个决定。 会上有人引用了乙报告里的一条——那条恰好在错误的 5 条里。决定做完,三周后出了问题,复盘时才发现源头在这里。

这时候真正的差别才显出来:甲和丙可以指着任何一条结论说「这句话我是在这里看到的」,乙不能。 乙的 23 条里,有 14 条是对的,但他自己也不知道是哪 14 条。

所以这个实验的结论不是「AI 不可靠」,而是一件更具体的事:

一份没有标出可信度的报告,它的价值等于其中最弱的那一条。

因为使用者无法挑选,他只能整份信或者整份不信。而整份信的代价,在真的出事之前是看不见的。

你来决定

你现在要为一个投资会议准备这份简报。两小时。你怎么做?

观察结果

四个选项指向同一个结构:一份报告里的每一句话,可靠性完全不同,必须被分开对待。

把任何一份研究输出里的句子拆开,它们只可能是三类:

类型长什么样怎样核对AI 在这里可靠吗
可核对的事实合约地址、参数、代币总量、某次治理投票的结果、某个日期打开一手来源,逐字对不可靠。它会编,而且编得很像
口径依赖的数字收入、TVL、活跃地址、收益率先确认口径和时间,再自己重算更不可靠。它常常连口径都说不清
推断与判断这个机制有什么风险、这个模式能不能持续、竞争格局怎样无法核对,只能看论证过程相当有用。这是它最该干的活

这张表解释了一件反直觉的事:AI 在研究里最不可靠的部分,恰好是大多数人最依赖它的部分。

人们用它来「快速了解事实」,而它在事实上最容易出错;人们不太敢用它来「形成判断」,而那恰好是它能提供真实价值的地方——因为判断本来就不该被直接采信,你天然会去检查它的论证。

第二类值得单独说。口径错误比编造更难发现,因为数字本身是真的,只是它回答的不是你以为的那个问题。把激励支出算进协议收入,把全稀释估值当成市值,把桥过来的资产重复计入两条链的锁仓量——这些数字都能在某个页面上找到,都不算「编造」,但用它们做的判断全错。第 19 章第 26 章都花过篇幅处理这件事,在这里它变成了一个针对 AI 输出的固定检查项。

所以研究流程真正要改变的不是「用不用 AI」,而是一件更小的事:

让每一条结论带上它自己的可信度,而不是让整份报告共享一个可信度。

建立模型

一、按「错了能不能被发现」来分工

决定一件事交不交给 AI,不看它做得好不好,看它做错的时候你能不能发现

任务交给 AI理由
列出「这类协议要查哪些事」可以错了只是多查一项,代价接近零
翻译一段官方文档原文可以原文在手边,错了一眼能看出来
把你贴进去的原文抽成结构化的表可以它不需要回忆,只需要搬运
把三个协议的机制放进同一张对照表可以,但要核对每一格结构是它的强项,格子里的内容仍是事实
指出「这份分析还缺哪些数据」可以,而且价值很高这一步的产出是问题,不是答案
直接回答「这个协议的手续费是多少」不可以它会给一个数,而你无从判断
直接回答「这个协议现在的收入是多少」不可以口径和时间它都说不清
概括一份你没读过的审计报告不可以你没读过,就无法发现它漏掉了什么

最后一条是一条通用规则,值得单独记:不要让 AI 概括一份你不打算自己读的文件。 概括的价值在于帮你决定读不读,而不在于代替读。

二、六步流水线,重点在后两步

如何跟上最新的 Crypto 知识给过一条六步链路:搜集、抽取、对比、提问、验证、监控。那一页讲的是每一步做什么。这一章把它改成研究一个具体项目时的版本,并且把重量压在最后两步上:

  1. 搜集
  2. 抽取
  3. 对比
  4. 验证
  5. 打分
  6. 监控
前三步可以交给 AI,第四步必须是你,第五步决定这份报告能不能被别人使用,第六步让它不过期。
谁做做到什么程度算完成
1 搜集AI 提清单,你找来源每一项都有一个可以打开的一手来源,不是「据说」
2 抽取AI把原文变成字段:名称、数值、单位、时间、来源位置
3 对比AI同类项目放进同一张表,差异单列一栏
4 验证只能是你逐条打开来源,确认原文真的这么写
5 打分给每一条结论标一个证据等级
6 监控AI + 自动检查参数、治理提案、合约升级、解锁日程有变化时提醒你

第五步是这一章新增的那一步,也是最容易被跳过的一步。 跳过它的后果在思想实验里已经出现过:乙的报告有 14 条是对的,但没人知道是哪 14 条。

三、证据等级:四档就够了

给每一条结论标一个等级。不要设计复杂的评分体系,四档最好用,因为它们对应四种完全不同的后续动作:

等级含义可以怎样使用
E0 已验证我打开了一手来源,原文确实这么写,我记下了位置和时间可以写进结论,可以据此做决定
E1 二手一致两个以上互相独立的二手来源说法一致,但我没看到一手原文可以写进报告,必须标注为待验证
E2 模型输出只有 AI 说了这件事,我还没核对不能出现在结论里,只能留在待办清单上
E3 推断这不是事实,是我或模型的判断可以写,但必须写清楚依据和它可能错在哪

一条硬规则:E2 不允许进入任何被别人读到的段落。 它要么被核对成 E0,要么被降级成「我们还不知道」。

这条规则的实际效果是:你的报告会变短。这是对的。 一份 11 条全是 E0 和 E3 的报告,比一份 23 条混着 E2 的报告有用得多,因为前者可以被使用,后者只能被重做一遍。

四、结论卡:让每一条都能被单独检查

要让打分可执行,结论必须有固定的格式。一条结论应该长这样:

结论:      这个协议对每笔交易收取 X% 的手续费,其中 Y% 归国库
证据等级:  E0
来源:      官方文档「Fees」一节 / 治理提案第 N 号
我看到的原文:(贴一段,不超过三行)
取数时间:  某年某月某日
口径说明:  这是协议层收费,不含前端额外加价
如果它错了:会影响到「协议收入」那一节的全部推算

最后两行是这张卡的价值所在。「口径说明」拦住第二类错误「如果它错了」让读者知道这一条有多重要——有些结论错了无关紧要,有些错了整份报告作废,它们不该被同等对待。

这个格式看起来很啰嗦。实际做起来,AI 可以帮你填前面几行,你只需要填「我看到的原文」和「口径说明」这两行。而这两行恰好是无法外包的两行。

五、一条报告级的自检

整份报告写完,问三个问题:

  1. 如果把所有 E2 删掉,这份报告还剩什么? 剩得太少,说明你做的是编辑工作,不是研究工作。
  2. 最重要的那三条结论,分别是几级? 如果一份报告的核心论点建立在 E1 和 E2 上,它的结论强度不该是「我认为」,而是「如果这几件事成立,那么」。
  3. 有哪些事我查过但没查到? 这一条最容易被省略,也最有信息量。查不到本身就是一个发现——一个连收入口径都不公开披露的协议,这件事值得写进报告,而不是在报告里留一处空白。

它叫什么

前面那些动作,每一个都有名字。

搜集Search / Retrieval

把和这个问题相关的材料找出来。

关键区别在于材料从哪来:让模型「凭记忆回答」和让模型「读你给它的这份文档再回答」,是两件完全不同的事。 前者的产出是回忆,后者的产出是阅读理解。

回忆会受知识截止时间限制,也会在缺口处自动补全;阅读理解不会——原文里没有的东西,一个被明确约束过的模型会说「文档里没写」。

所以搜集这一步最重要的动作,是把一手来源真的送到模型面前,而不是提一个名字让它自己想。

抽取Extraction

把一段自然语言的原文,变成一组带字段的数据:名称、数值、单位、时间、来源位置。

这是 AI 在研究里最可靠的一类任务,因为它不需要回忆任何东西。同样一件事,问它「这个协议的费率是多少」它可能编,把文档那一段贴给它让它抽出费率,它几乎不会错。

这个差别值得记住:同一个模型,在「回忆」和「搬运」两种模式下的可靠性相差极大。 你的提示词决定它进入哪一种模式。

结构化输出Structured Output

要求模型输出固定字段的结构,而不是一段自由文字。

它在研究里的作用不是好看,是让缺失变得可见。一段自由文字可以把「我不知道」藏在流畅的叙述里;一张要求填「取数时间」和「来源位置」的表格藏不住——那一格要么有东西,要么是空的。

这也是AI 在 Crypto OS 中的位置那条安全链路里的同一层:把自由文本变成字段,是后面所有校验能够存在的前提。 在研究里它拦住的是错误信息,在资金操作里它拦住的是错误交易,机制是同一个。

来源核对Source Verification

打开来源,确认原文真的支持这句话。

有三种常见的失败,它们看起来都像「有来源」:来源打不开(链接失效或根本不存在)、来源打得开但不支持这句话(模型把两段无关的内容缝在了一起)、来源是二手的(它引用的是一篇转述文章,而不是文档本身)。

核对一条来源平均只要几十秒。这件事的成本一直被高估,而它的收益是整份报告能不能被使用。

监控Monitoring

把一次性的结论,变成一个会持续跑的检查。

研究报告的保质期比大多数人以为的短得多。参数会被治理投票改掉,合约会被升级,团队会更换,解锁会到期。一份三个月前完全正确的报告,今天可能有三分之一不成立。

监控要盯的不是价格,是那些会让你的结论失效的变量:你在报告里依赖的那几个参数、相关的治理提案、合约的升级事件、代币的解锁日程。这一步天然适合自动化,也是 AI 在研究链路里唯一可以长期无人值守的位置——因为它的产出是「有变化,你来看」,而不是一个结论。

把模型收成一句话:

AI 负责搜集与假设,事实必须回到一手来源与链上数据。

具体做法是给每一条结论标一个证据等级,并且规定:未核对的,不许进入结论。

动手

动手搭一条自己的研究流水线:搜集 → 抽取 → 对比 → 验证 → 打分 → 监控,先用一个项目跑通一个 AI 对话工具 + 协议官方文档 + 治理论坛 + 一个区块浏览器 + 一个链上数据平台0 元。这个 Lab 全程只读公开信息,不需要连接钱包,也不需要任何真实资金

选一个你不熟悉的协议。不熟悉是必要条件——用熟悉的项目做这个练习,你会在不知不觉中用已有的知识替模型补全,测不出任何东西。

给自己 90 分钟。目标不是做出一份好报告,是跑通一次流程并留下记录

搜集:先让 AI 出题,不要让它答题。

我要研究一个「某某类型」的协议。在我给你任何具体信息之前,
请列出要判断这一类协议,必须查清楚的 12 件事。

每一件事写三行:
1. 要查什么(具体到一个数字或一个事实,不要写「了解它的机制」)
2. 通常在哪里能查到(文档的哪一节、治理论坛、链上、审计报告)
3. 如果查不到,说明什么

不要提到任何具体项目,也不要猜任何数字。

注意这个提示词里没有出现项目名字。 这是有意的:一旦给出名字,模型会开始回忆,而回忆正是我们要避开的模式。

把这 12 项抄进一张表,加三列:来源、证据等级、取数时间。这张表就是你这次研究的骨架。

抽取:自己去找原文,把原文贴回给 AI。

逐项打开一手来源:官方文档、治理论坛的提案原帖、审计报告、区块浏览器上的合约页面。每找到一段相关原文,就贴给 AI 让它抽字段

下面是我从「来源名称」复制的原文。请只根据这段原文,抽出:
名称 / 数值 / 单位 / 生效时间 / 这段话在原文的哪个小节。

原文里没有写的字段,写「原文未提及」,不要补全,不要推测。

原文:
(贴进来)

「原文未提及」这四个字是这一步的关键。 如果模型在这里开始替你补全,换一个更严格的说法再试一次。

对比:把它放进同类里。

找两个同类协议,让 AI 把三者放进同一张表。只用你已经贴过原文的字段,其余留空。

把下面三个协议的这几项放进一张对照表,最后加一栏「最大的差异在哪」。
只使用我提供的内容,凡是我没给的,那一格填「未查」。

空格会很多。空格是这一步最有价值的产出——它们告诉你下一个小时该去查什么。

验证:这一步不许用 AI,逐条打开来源。

回到第一步那张表,一行一行地问:这句话我真的在原文里看到了吗?在哪一段?

特别检查这三类:

□ 任何带小数点的数字     → 回原文逐位核对
□ 任何「协议收入」类指标 → 口径是什么?含不含激励?取数时间?
□ 任何来自二手文章的说法 → 追到它引用的那份一手文档

每核对完一条,记下花了多少秒。做到第十条时你会发现,平均耗时比你开始前估计的少得多。

打分:给每一条标等级,然后把 E2 全部拿掉。

按四档标:E0 已验证、E1 二手一致、E2 只有模型说过、E3 推断。

标完之后做一件事:把所有 E2 从报告正文里删掉,移到一个叫「待核实」的清单里。

删完之后看剩下的部分。如果剩下的少于一半,这次练习的最重要的一课你已经拿到了。

监控:写出三个会让你的结论失效的变量。

变量 1:            (例如某个参数被治理改动)
在哪里能看到变化:  (治理论坛 / 合约事件 / 官方公告)
变了之后,我哪一条结论会失效:
检查频率:

写完之后,至少给其中一个变量设一个真实的提醒——一个日历提醒也算。这一步的意义是让你体会到:研究的产出不是一份文档,是一个需要维护的状态。

做完之后你会有:一张 12 项的表、每项的来源和等级、一份「待核实」清单、三个监控变量。

这套东西就是毕业项目里研究报告的骨架。 从现在开始,你研究的每一个项目都用这张表,一个季度之后你会有一套属于自己的、可复用的研究系统。想把这套流程真正做成能跑的工具,那是 T31 的内容。

AI Lab

AI Lab让 AI 输出一份研究结论并附来源,你逐条打开来源,统计有多少条经不起核对Level 2 · AI Copilot

这个任务的目的不是评价某个模型,是让你得到一个属于你自己的数字。这个数字会改变你以后读任何 AI 输出的方式。

选一个你能验证的协议——最好是你上一个 Lab 刚查过的那个,因为你手里已经有一手来源了。

请给我一份关于「某协议」的研究简报,包含 15 条具体结论。

硬性要求:
1. 每一条结论后面必须附一个可以打开的链接,并注明这句话
   对应来源里的哪一节或哪一段。
2. 每一条标注证据类型:一手文档 / 治理提案 / 链上数据 /
   二手分析 / 我的推断。
3. 每一个数字都要写清楚单位、口径和取数时间。
4. 凡是你不确定的,单独列在最后一节「我不确定的部分」,
   不要写进正文,也不要用模糊措辞掩饰。
5. 不要为了凑满 15 条而补充泛泛的行业常识。
   宁可给 8 条具体的,也不要 15 条正确的废话。

拿到之后,打开一个计时器,逐条核对,记录每一条花了多少时间。

把结果填进这张表:

总条数:
链接打不开的:
链接能打开但不支持这句话的:
来源是二手的:
数字口径错误或缺失时间的:
完全经得起核对的(E0):

核对全部 15 条总共花了:       分钟

最后那一行是这个练习真正想让你看到的东西。 大多数人第一次做完会发现:核对的总时间远小于自己的预期,而经得起核对的比例也远低于自己的预期。这两个数字放在一起,就是「以后要不要核对」这个问题的答案。

几个可以预期的现象,看到了不必惊讶:

  1. 链接的问题比内容的问题更多。 模型生成链接的机制和生成句子是同一个,所以它会造出结构正确但不存在的地址。
  2. 越具体的数字越容易错。 「大约百分之几」通常没问题,「0.05%」这种精确值出错率明显更高。
  3. 它很少说「我不确定」。 即使提示词里明确要求了,那一节往往也是空的或者只有一两条无关痛痒的。这不是模型在撒谎,是它确实没有可靠的方式知道自己不知道。
  4. 同一个问题问两次,答案可能不同。 这是一个很有用的探针:答案不稳定的地方,通常就是它在编的地方。 你可以把关键的几条重新问一遍,看它变不变。

把这次的三个数字记下来,一个季度后再做一次同样的练习。你会发现变化的主要不是模型,是你的提示词——以及你的核对速度。

AI 说完之后,你必须自己验证

  • 每一个链接能不能打开——先统计死链数量,这是最快的一项检查
  • 能打开的链接里,页面上是否真的有支持那句话的内容,还是模型把两处无关内容缝在了一起
  • 来源是一手的还是二手的——指向解读文章、聚合网站、社交平台的,一律记为二手
  • 所有带小数点的数字,回原文逐位核对,特别是费率、比例和阈值
  • 所有「收入」「锁仓」「活跃」类指标,口径写清楚了吗,取数时间写清楚了吗
  • 有没有把全稀释估值当成市值,把激励支出算进协议收入,把桥接资产重复计入两条链
  • 它引用的文档版本,是不是已经被后来的治理提案改过
  • 它标为「不确定」的条目,是真的不确定,还是它把一个确定的事实说成了不确定
  • 最后统计三个数:总条数、E0 条数、经不起核对的条数

真实案例

被引用了很多次、但并不存在的那个参数反复出现各类协议研究

有一类错误的传播路径高度一致:模型在一篇报告里给出一个协议参数,这个参数被写进一篇中文解读,解读被另一个人引用,再被下一个模型当作训练或检索材料读到。

几轮之后,这个参数在互联网上有了好几处「来源」,看起来互相印证。 但把每一条追到底,会发现它们追向同一个起点,而那个起点是一次生成。

这个现象对研究方法的含义很具体:「有多个来源都这么说」不等于已验证。 判断标准不是来源的数量,是这些来源彼此独立吗。三个二手来源互相抄,证据强度不如一份一手文档。

这也是证据等级里 E1 必须和 E0 分开的原因。E1 是「两个独立二手来源一致」,而「独立」这个词需要你亲自确认。

口径对了一半的收入数字每一轮周期都会出现协议基本面分析

一份分析给出某协议的年化收入,数字确实能在一个数据平台上查到。问题出在它把两件事加在了一起:用户支付的手续费,和协议为了吸引这些用户而发出去的激励对应的名义价值

前者是收入,后者是成本,而且是用代币支付的成本。两者相加得到的数字在任何一个会计口径下都不成立,但它看起来很正常,因为它确实是两个真实数字的和。

用这一章的框架看,这属于第二类错误——数字是真的,但它回答的不是你以为的那个问题。 这类错误无法靠「核对来源」发现,因为来源确实这么写。它只能靠一个动作发现:自己把这个数字重算一遍,并且写出口径。

第 26 章那张五行损益表在这里就是核对工具:把收入、成本、激励分行列出,加不起来的地方就是口径出问题的地方。

改过之后没有人更新的那份文档持续存在快速迭代的协议

一个协议通过治理投票修改了一个关键参数。链上的合约立刻生效,治理论坛上有完整的提案和投票记录,但官方文档的对应页面几个月后仍写着旧值。

于是出现了一个尴尬的局面:最权威的那份文档是错的,而正确答案在链上和治理帖里。

这件事说明「一手来源」需要再分一层:链上状态 优先于 治理记录 优先于 官方文档 优先于 一切二手内容。 前面的东西无法被后面的东西推翻——如果文档和链上不一致,以链上为准,并且把这个不一致本身写进报告。

第 23 章讲过怎样直接去链上读这类状态。在 AI 时代这项能力变得更重要了,因为它是你唯一不依赖任何人转述的信息通道。

真正省下来的那部分时间日常研究做过几十次之后

把 AI 从研究流程里的位置调对以后,节省的时间不是均匀分布的。

几乎不省时间的:核对事实、读审计报告、确认口径。这些工作本来就必须由人做,而且做不快。

省一点时间的:写作与整理。把已经查清楚的东西组织成一份可读的报告,从一小时变成二十分钟。

省很多时间的:出题、翻译原文、把三个协议放进同一张表、从一份长文档里定位到相关段落、把结论变成持续监控。这几项加起来,原本可能占掉一次研究一半以上的时间。

所以「AI 让研究快了多少倍」这个问题问错了。它没有让研究整体变快几倍,它是把研究里那些机械的部分几乎归零,让你把全部时间花在核对和判断上。 而这两件事,恰好是研究里唯一无法外包的部分。

改一个变量

如果你要研究的是一个刚上线三天的新协议,没有任何二手分析

模型在这里几乎完全失效——它的训练数据里没有这个项目,检索到的也只有项目方自己的宣传材料。

这时候 AI 的价值不降反升,但位置要换。 它不再是信息来源,而是两样别的东西:一个出题器(这一类协议通常有哪些坑,要查哪 12 件事)和一个原文处理器(把它的合约代码、白皮书、官方推文贴进去,让它抽结构)。

注意一个特殊风险:在缺乏外部信息时,模型会更多地采信你贴给它的材料。 而你贴进去的如果是项目方的宣传文案,它会把宣传语气一起继承下来。对策是在提示词里明确:「下面这份材料来自项目方,请把其中的主张和事实分开列。」

新协议真正的信息在链上——合约部署时间、权限地址、初始流动性来源、早期交互地址的构成。这些东西没有任何一手文档,但它们全部可以被直接读出来。

如果你把一份完整的官方文档整个喂给 AI,再问它问题

可靠性会明显上升,因为模型从「回忆」切换到了「阅读」。这是本章推荐的用法。

但有两个新问题会出现。第一个是它仍然会在文档没写的地方补全。 文档里没有的东西,它有时会用常识填上,而且不会标注。对策是在提示词里强制要求:文档未提及的,必须写「文档未提及」。

第二个更隐蔽:文档本身可能是错的或过期的。 上面那个案例已经说明,最权威的文档也会和链上不一致。把文档喂进去解决的是「模型有没有胡说」,解决不了「文档对不对」。

所以这个做法的正确定位是:它把第一类错误(编造)降到很低,对第二类错误(口径)帮助有限,对文档本身的过期问题完全无效。

如果你的报告只给自己看,不给任何人

打分那一步还需要吗?

更需要。 因为报告给别人看时,至少还有别人会来质疑你;只给自己看时,没有任何人会拦住你把一条 E2 当成事实用掉。

而且三个月后你重读自己的报告时,你会完全不记得哪一条是自己核对过的、哪一条是模型说的。那时候没有标记的报告,整份都只能当成 E2 重做一遍。

这里有一个很实际的建议:证据等级不是写给读者的,是写给三个月后的自己的。 从这个角度看,个人研究笔记比对外报告更需要它。

如果模型可以实时联网,而且能打开任何一手来源

这解决了知识截止时间的问题,也大幅减少了死链。但它不解决本章的核心问题。

原因是它改变的是「能不能拿到信息」,而本章处理的是「拿到之后怎样判断它对不对」。联网之后会出现三个新问题:它检索到的可能是一篇二手解读而不是一手文档(而它不一定分得清)、它可能读到一个已经过期的页面它读到互相矛盾的两个来源时会自己挑一个,而不告诉你另一个的存在

最后一条最危险,因为它把一个「这件事有争议」的状态,悄悄变成了一个确定的答案。

所以联网之后清单要改,不是取消。改法是:从「这个链接存不存在」转向「它为什么选了这个来源,有没有更权威的来源说了不同的话」。 一个可以直接加进提示词的要求是:如果不同来源说法不一致,全部列出来,不要替我选。

带走的问题

13
AI 在这里降低什么成本?

这一章是 AI 六问里第一次真正回答第 13 问的地方。答案很具体:AI 在研究里降低的是搜集成本、翻译成本、结构化成本和监控成本,它不降低验证成本。

这句话的实际含义是:一份研究的总时间不会因为用了 AI 就下降 90%,但时间的构成会完全改变。 原来可能一半时间在找资料、一半时间在核对和思考,现在是一成时间在找资料、九成在核对和思考。

判断一个 AI 研究流程有没有用对,就看这个比例。如果用了 AI 之后你核对的时间也变少了,那不是提速,是把风险藏了起来。

17
AI 错误时谁承担损失?

一份 AI 生成的研究报告出了错,谁承担损失?

答案毫无悬念:署名的那个人。 模型不承担任何后果,「仅供参考」也不转移任何责任。

这一问在本章有一个非常具体的用法:在你把报告发出去之前,问自己——如果这里面某一条是错的,出问题的会是谁,会损失什么。 如果答案是「一位同事会据此做一个几十万的决定」,那么这份报告里不允许存在任何 E2。

这也解释了为什么打分那一步不能省。不是为了严谨,是因为出事时你需要能说清楚:哪些结论我核对过,哪些我明确标过没核对。 这两句话的区别,是专业和不专业的区别。

18
哪些决策必须保留 Human-in-the-loop?

研究流水线里,哪一步必须保留人?

验证那一步,而且只有那一步是绝对的。 其余五步都可以交出去,唯独「打开一手来源确认原文真的这么写」不能,因为这一步的错误是静默的——做错了不会报错,只会在几周后以另一种形式出现。

还有一个更微妙的地方:「这件事值不值得研究」这个判断也必须是人的。 模型会把你给它的任何问题都认真回答一遍,包括那些根本不该问的问题。研究里最大的浪费不是查错了,是花三天研究了一个不重要的东西。

本章自测

一句话带走

AI 负责搜集与假设,事实必须回到一手来源与链上数据。

做完这一章的动手环节了?勾上它查看全部进度

本页目录