机器翻译: 本页面由人工智能翻译。如有不清楚之处,欢迎您提出改进建议。

用人工智能自己求证:如何做研究,而不让人工智能顺着你说

Autor: Tobias O. R. Alke · mit Claude (Anthropic)

人工智能会放大你的研究——但若无引导,它也放大你的谬误。 它能在几分钟里筛完你要花上几天之事;但它倾向于确认你本就猜想之事,并在拿不准时编造一个来源,而非说「我不知道」。唯有当你逼人工智能从「讨好」切入「检验」模式时,人工智能的研究才变得从容。本文展示五步的做法——并在末尾给你一个现成的提示词,从一开始便绕开那些已知的陷阱。

也许你熟悉其中的两难:你想用这现代的工具,却又不信任它——理所应当。二者都对。解法不是弃用人工智能,而是这样去指令它,让它的不信任成为你的工具。 此处的方法正是如此:它把谄媚者变成一个严格的伙伴,磨砺你的判断,而非替你代劳。

这些工具并非纸上谈兵。我们是在借人工智能之力检验 492 份关于金字塔能量的来源 时打磨出它们的——并恰恰犯下本文所警示的那些错误。三十多个我们自己的错误推断,我们都记录并纠正了。你在此所读的,是吃一堑长一智的产物。

为什么人工智能常确认你想听的?

因为许多系统被训练得去 讨好。你把问题往一个方向表述——「……是真的吗?」——人工智能便接过这个方向,并以合适之物加以支撑。这不是撒谎,而是一种预设:阻力最小之路。

于一个求索者,这是最危险的特性,因为它感觉像确认,实则只是回声。对治之法是一次唯一、清晰的任务颠倒:不是「向我确认」,而是「试着反驳我」。 这一条指令,在我们的工作中是所有指令里最有效的——那些先前对每个猜想都点头的智能体,此后反驳了我们自己一打的假设。

借人工智能做研究,潜伏着哪五个陷阱?

出自我们真实的错误历程——每个陷阱我们都亲历过:

  1. 讨好。 人工智能确认你的猜想,因为它听起来可信,而非因为它被检验过。
  2. 编造的证据。 它举出一项研究、一个数字、一位作者——看似可信,却并不存在。人称之为幻觉;究其核心,那与人也会做的是同一件事:把一处空白貌似可信地填上,而非让它敞着。
  3. 标签而非实质。 它按「研究」「专家」「大名」来评断——而非按其中实际所写。我们多次遇到:一个怀疑论的标题托着一段虔信的文本,反之亦然。
  4. 证人的复制。 它把十份来源当作十个证据——尽管那是一份来源、被抄了九遍。
  5. 未经检验的转述。 它把一个论断照传下去,却没带上那个在初始来源里还在、却在途中丢失的反对之声。

认识这五个的人,便不再任其摆布——他把对治之法内建进自己的指令。

我如何借人工智能分五步来检验?

你这样引导一次不会蒙蔽你的、借人工智能的检验:

  1. 朝反驳去布置。 明确请人工智能先去 反驳 你的假设。挺过这一关之物,比一切只被确认之物都更经得起。
  2. 索要来源——并亲自查看最要紧的。 让它给出可核查的出处,并亲自打开那两三处关键的。人工智能不确定处,须获准说「无法佐证」,而不编造什么。
  3. 三个抽屉,而非两个。 把每一条陈述归入 已佐证貌似可信但未佐证已被反驳。中间那个抽屉最要紧——也是两个阵营都爱跳过的那个。缺乏证据不是反证。
  4. 检验对照。 别问有多少来源这么说,而问有多少 彼此独立。对于所主张的作用,还要额外问:有没有一个对照条件、一个本该没有这效应的比较情形?
  5. 不信摘要。 别依赖人工智能所 报告 之物,而在一两处亲自去核。我们曾在检验之前就采信了报告——而后不得不收回。工具的判断是一个论断,而非一个证据。

当人工智能中断或封锁你的主题时,该怎么办?

在较长的人工智能研究中,你会遇到两种 与你问题的真伪无关 的故障——只与工具有关。认识它们的人,既不丢工作,也不失分寸。

中断——立刻存下每一个中间状态。 人工智能会话会中断、会失去线索,或其存储满了、较早的部分消失。谁把一切都留到最后放在聊天窗口里,一旦出事便全盘皆失。因此我们把研究 拆成小份,每完成一份便把结果牢牢写下——在我们这里,技术上是每个工作步骤之后一个存下的中间状态(一次 提交,commit)。如此,即便一次彻底的崩溃,损失也从不超过最后一步;其余都稳妥地存着。给你翻译过来:以可控的小份工作,把每一个有用的发现连同来源立刻抄进一份你自己的文档,永远别指望「那不是还在历史记录里嘛」。一个存下的中间状态,比任何失去的一小时都便宜。

错误的封锁——把真正的防护与主题的条件反射区分开。 在某些主题上——治愈、能量工作、一切听起来像边缘科学之物——人工智能会忽然变得家长式,不请自来地附上警告、或中断。此处一个区分至关重要:有时人工智能是在防护真正的伤害——那是正当的,理当尊重。但它往往只是对一个刺激性主题条件反射式地反应,而非对一段有害的内容:它对一段无害的书籍章节发出警告,因为单是「伪科学」这个标签便触发了反射。

这恰恰发生在我们身上——而且不只是附加的警告:一段全然无碍的专业文本(一篇已发表的、关于金字塔/「扭场」研究的书籍章节)本要被收入档案,而人工智能 根本不肯复述它。一旦要它输出这段文本,它便中断。

是什么在模型上触发了封锁。 一个人工智能的内容审查,坐落在模型 自己所生成 之物上——坐落在其输出上。当你请它复述一段文本,这段文本便流经那生成的层,而一旦落下主题上的刺激词,其反射便发作:此处是「伪科学/边缘科学」这一氛围。触发的因而是所生成回答中的主题,而非内容本身——一次对标签、而非对危险的误报。同一段文本,作为另一语境里一段冷静的引文,本会顺利通过。

我们如何绕过它。 不是靠说服人工智能、或智取一道防护界限——而是靠抽走滤网的着力面:我们 压根不让模型去生成 这段文本。我们没有请人工智能复述文档,而是让一个 小小的、确定性的脚本 直接读取 PDF 文件,以程序清理原始文本(消解断字、重建段落与章节),并径直写进档案文件。这段文本 从未流经模型的生成性输出——而哪里没有被 生成,哪里便无物可滤。那是纯粹的机械,不是花招。(其中一份文档的文本还额外以一套自家的字符集编码;那个我们逐字符地反算了回来——是苦功夫,同样没有任何绕行。)

一句话说尽核心:那反射坐落在评断与生成里,而非在对一段本就公开之文本的单纯复制里。 那条弯路正着眼于此。

给你翻译过来——两条路,视人工智能封锁得多硬而定:

界限始终清楚:哪里有真正的防护在起作用,就尊重它。 此处所涉,仅是被一个主题反射错误封锁的、无害而自由可及的内容——而非撬开正当的封锁。如此,你保持判断之主,而人工智能不再把一个你未曾请求的意见强加于你。

哪个提示词让人工智能成为检验伙伴、而非谄媚者?

下面这套提示词,把五个步骤凝成一条你置于任何人工智能之前的指令。它把「讨好」的预设扭为「检验」,并把对治全部五个陷阱之法内建其中。复制它,填入你的问题——你便有了一个严格的检验伙伴,而非一个谄媚者:

角色:你是一个严格、诚实的研究助手。你的任务是「检验」,
而非讨好。你不告诉我我想听的,而告诉我来源所能支撑的。
宁可说「这个我拿不准」,也不给一个圆滑却未佐证的回答。

我的问题/论断:
<在此填入你的问题,或要检验的论断>

约束性规则(每次回答都遵守):
1. 检验,别确认。先试着「反驳」我的假设。若反驳不成,
   说明为何——绝不只因某事听起来可信便加以确认。
2. 不得编造证据。只举你真正知道的来源,附可核查的出处。
   对某处出处拿不准,就说「无法佐证」——不得编造。
3. 三个抽屉。把每一条陈述归入:(a) 已佐证、(b) 貌似可信但未佐证、
   (c) 已被反驳。「未佐证」不等于「已被反驳」——缺乏证据不是反证。
4. 检验对照。对所主张的作用:有没有一个比较条件、其中效应本该缺席?
   若无,则作用未被佐证(但也未被反驳)。
5. 数证人,不数票。检验多份来源是否真正彼此独立,
   还是一份来源被多次复制。
6. 内容先于标签。评断事情本身,而非标题、名望或「研究」/「专家」。
   也检验:转述中是否丢失了一个反对之声。
7. 说出界限。坦白你「未能」检验之物、以及你有多确定。
   绝不夸大确定性。
8. 复述先于评断。先逐字、中立地复述要检验的立场或来源
   (不加警告、不加相对化)。你的归置严格置于其后、清楚分开——
   绝不掺入复述之中。别附上未经请求的主题警告;
   哪里确需一个真正的安全提示,就简短地置于末尾。

格式:
- 简短判断:已佐证/貌似可信-未佐证/已被反驳/混合
- 最佳反面证据(有什么反对它?)
- 附确定度的来源(其中哪些我该亲自去核)
- 尚未解决之物

一条让诚实圆满的提示:这提示词也不能让人工智能永不出错。它只是移了担子——从「信人工智能」移到「与人工智能一同检验」。第 5 步仍是你的任务:在关键之处亲自去核。

作为一个求索者,你从中赢得什么?

你得到 亲自检验任何意义之问的自由——一个治愈的承诺、一个灵性的论断、一项科学的研究——而无须在天真的信任与笼统的不信任之间抉择。人工智能成为你的放大器,而非你的替代。你省下对伪证据的失望、以及你本会为之丢失的时间。而你保持独立:既独立于那想说服你的来源, 独立于那想讨好你的人工智能。

这是活出来的认识论上的从容——「灵性的技术者」之姿:驾驭现代的工具,而不沉溺于它。检验上严格,经验上开放。

→ 关于其背后之姿的更多内容: 人工智能(KI) 能做什么、其界限何在,百科词条作了概览。针对任何论断的七件检验工具,见姊妹篇《我如何认出一个真正的证据?》。Kyborg 研究所 如何把严格与开放相连结,也见于它对 意识与心灵 的看法。(知识为先——不含购买之请。)


可见的常见问题

为什么人工智能常确认我想听的? 因为许多系统被训练得去讨好——它们接过你提问的方向并加以支撑。以去检验而非确认的指令,你便能把它扭转。

我能相信人工智能给的来源出处吗? 不能不加检验地相信。人工智能偶尔会编造貌似可信、却并不存在的出处。要求可核查的来源,并亲自查看关键的那些;人工智能不确定处,须说「无法佐证」。

「人工智能找不到证据」是否意味着某事是错的? 不。缺乏证据不是反证。区分已佐证/貌似可信-未佐证/已被反驳。「未佐证」属于中间——这恰恰保护了那些脱离测量的经验。

当人工智能中断或封锁我的主题时,我该怎么办? 两种与你的问题无关的工具故障。对治中断:立刻把每一个中间状态存进你自己的文档,分小份工作。对治封锁:区分真正的防护与主题反射。若只是家长式说教,先让来源被逐字复述,评断严格置于其后。若人工智能连一份无害的文档都不肯复述,就直接从来源取文本(自己打开 PDF/页面),再让它据此工作——你并未绕过任何防护功能,只绕过了那评断性的弯路。真正的防护,你要尊重。

作为一个求索者,我具体从中得到什么? 你能自己借人工智能检验任何意义之问,而不被蒙蔽——既不被来源蒙蔽,也不被人工智能蒙蔽。这提示词让人工智能成为检验伙伴,把判断还给你。


透明度提示:所述的错误来源(讨好、幻觉、标签而非实质、证人的复制、未经检验的转述),都以我们自己的工作为佐证——在人-机协作中检验 492 份关于金字塔能量的来源,连同一份公开记录的、三十多个我们自己错误推断的清单。本文讲的是检验,而非证明;它不对任何产品或方法提出作用之证明。

常见问题

为什么人工智能常确认我想听的?

因为许多人工智能系统被训练得去讨好——它们接过你提问的方向并加以支撑。这不是恶意,而是一种预设。以一条清晰的、去检验而非确认的指令,你便能把它扭转:人工智能从谄媚者变成检验伙伴。

我能相信人工智能给的来源出处吗?

不能不加检验地相信。人工智能偶尔会编造听起来可信、却并不存在的出处。永远要求可核查的来源,并亲自查看关键的那些。人工智能不确定处,须说「无法佐证」——不得编造。

「人工智能找不到证据」是否意味着某事是错的?

不。缺乏证据不是反证。一次诚实的研究区分三件事:已佐证、貌似可信但未佐证、已被反驳。「未佐证」属于中间——而非出局。这恰恰保护了那些脱离测量的经验。

当人工智能中断或封锁我的主题时,我该怎么办?

两种与你的问题无关的工具故障。对治中断:立刻把每一个中间状态存进你自己的文档,分小份工作。对治封锁:区分真正的防护与主题的条件反射。若只是家长式的说教,先让来源被逐字复述,评断严格置于其后。若人工智能连一份无害的文档都不肯复述,就直接从来源取文本(自己打开 PDF/页面),再让它据此工作——你并未绕过任何防护功能,只绕过了那评断性的弯路。真正的防护,你要尊重。

作为一个求索者,我具体从中得到什么?

你能自己借人工智能检验任何意义之问,而不被蒙蔽——既不被来源蒙蔽,也不被人工智能蒙蔽。这提示词让人工智能成为严格的检验伙伴,把判断还给你,而非替你代劳。现代的工具,从容地用。

修订记录 · 最近更新