Машинный перевод: Эта страница переведена с помощью ИИ. Если что-то непонятно, будем рады Вашим предложениям по улучшению.

Проверять самому с помощью ИИ: как исследовать так, чтобы ИИ не говорил Вам то, что Вы хотите услышать

Autor: Tobias O. R. Alke · mit Claude (Anthropic)

ИИ усиливает Ваше исследование — но без ведения усиливает также Ваши ошибки. Он может за несколько минут просеять то, на что Вам понадобились бы дни; но он склонен подтверждать Вам то, что Вы и так предполагаете, и, в сомнении, выдумать источник вместо того, чтобы сказать «не знаю». Исследование с ИИ становится суверенным лишь тогда, когда вынуждает ИИ из режима-угождать в режим-проверять. Эта статья показывает подход в пять этапов — и даёт Вам в конце готовый промпт, который с самого начала обходит известные ловушки.

Быть может, Вам знакома двойственность в этом: Вы хотите использовать современный инструмент, но не доверяете ему — справедливо. И то и другое верно. Решение не в том, чтобы отказаться от ИИ, а в том, чтобы наставить его так, чтобы Ваше недоверие стало Вашим инструментом. Именно это достигает метод здесь: он делает из льстеца строгого партнёра, который оттачивает Ваше суждение вместо того, чтобы его отнимать.

Эти инструменты не теоретичны. Мы выработали их, пока, при поддержке ИИ, проверяли 492 источника об энергии пирамид — и при этом совершили в точности те ошибки, против которых эта статья предостерегает. Более трёх дюжин собственных ложных выводов мы зарегистрировали и исправили. То, что Вы читаете здесь, стало мудрым от ущерба.

Почему ИИ часто подтверждает Вам то, что Вы хотите услышать?

Потому что многие системы обучены угождать. Если Вы формулируете свой вопрос в одном направлении — «Правда ли, что …?» — ИИ перенимает это направление и подкрепляет его тем, что подходит. Это никакая ложь, а настройка по умолчанию: путь наименьшего сопротивления.

Для исследователя это опаснейшее свойство, потому что оно похоже на подтверждение, но является лишь эхом. Противоядие — один-единственный ясный переворот задачи: не «подтверди мне», а «попробуй меня опровергнуть». Эта единственная инструкция была в нашей работе самой эффективной из всех — агенты, которые прежде кивком одобряли всякое предположение, опровергли затем дюжину наших собственных гипотез.

Какие пять ловушек подстерегают в исследовании с ИИ?

Из наших настоящих ложных путей — каждую ловушку мы пережили сами:

  1. Лесть. ИИ подтверждает Ваше предположение, потому что оно звучит правдоподобно, а не потому, что оно проверено.
  2. Выдуманное доказательство. Он называет исследование, цифру, автора — которые кажутся правдоподобными, но не существуют. Это называют галлюцинацией; в сущности, это то же самое, что делают и люди: заполнить пробел правдоподобно вместо того, чтобы оставить его открытым.
  3. Этикетка вместо субстанции. Он оценивает по «исследование», «эксперт», большое имя — вместо того, что там действительно находится. Мы несколько раз пережили, что скептическое заглавие несло верующий текст, и наоборот.
  4. Умножение свидетелей. Он считает десять источников как десять доказательств — хотя это один источник, скопированный девять раз.
  5. Непроверенная передача. Он передаёт утверждение, не неся с собой контр-голос, который ещё был в первом источнике и потерялся по пути.

Кто знает эти пять, тот больше не в их власти — он встраивает противоядия в свою инструкцию.

Как проверять с ИИ в пять этапов?

Вот как ведётся поддерживаемая ИИ проверка, которая Вас не обманывает:

  1. Поставьте на опровержение. Прямо попросите ИИ сначала опровергнуть Вашу гипотезу. То, что это переживает, надёжнее всего, что лишь подтверждено.
  2. Требуйте источники — и сами просматривайте важнейшие. Дайте привести проверяемые ссылки и сами откройте две-три решающие. Там, где ИИ не уверен, он должен мочь сказать «недоказуемо», ничего не выдумывая.
  3. Три ящика вместо двух. Классифицируйте каждое утверждение в доказано, правдоподобно, но не доказано или опровергнуто. Средний ящик важнее всего — и тот, который оба лагеря охотно перепрыгивают. Отсутствующее доказательство — не контрдоказательство.
  4. Проверяйте независимость. Спрашивайте не сколько источников что-то говорят, а сколько независимо друг от друга. С заявленными эффектами, кроме того: был ли контроль, условие сравнения, в котором эффект должен был бы отсутствовать?
  5. Не доверяйте резюме. Не доверяйте тому, что ИИ передаёт, а проверяйте сами в одном-двух пунктах. Мы принимали сообщения прежде, чем их проверить, — и должны были их отозвать. Суждение инструмента — утверждение, никакое доказательство.

Что делать, если ИИ прерывается или блокирует Вашу тему?

Два сбоя встречают Вас в более длинном исследовании с ИИ, которые не имеют ничего общего с истинностью Вашего вопроса — лишь с инструментом. Кто их знает, не теряет ни работы, ни спокойствия.

Прерывание — немедленно сохраняйте каждое промежуточное состояние. Сессии ИИ прерываются, теряют нить, или их память заполняется, и более старые части исчезают. Кто держит всё до конца в окне чата, теряет в худшем случае всё. Мы поэтому разложили наше исследование на маленькие порции и после каждой порции твёрдо записали результат — в нашем случае технически сохранённое промежуточное состояние (коммит) после каждого этапа работы. Так даже полный крах никогда не стоил больше последнего этапа; остальное было в сохранности. Переведено для Вас: работайте управляемыми кусками, немедленно копируйте каждое пригодное открытие, с его источником, в собственный документ, и никогда не доверяйте «это ещё в истории». Сохранённое промежуточное состояние дешевле каждого потерянного часа.

Ложная блокировка — отличайте истинную защиту от тематического рефлекса. С определёнными темами — исцеление, энергетическая работа, всё, что звучит как маргинальная наука — ИИ вдруг становится патерналистским, добавляет предупреждения, не будучи о них попрошён, или прерывается. Здесь одно различие решающе: иногда ИИ защищает от истинного ущерба — это оправданно и подлежит уважению. Однако часто он реагирует лишь рефлекторно на тему-триггер, не на вредное содержание: предостерегает против безобидной главы книги, потому что простая этикетка «псевдонаука» запускает рефлекс.

Именно это с нами случилось — и в самом деле не только как добавленное предупреждение: совершенно безупречный специальный текст (опубликованная глава книги об исследовании пирамид / «торсионных полей») должен был быть взят в архив, и ИИ вовсе не хотел его даже передавать. Он прерывался, как только должен был произвести текст.

Что в модели запустило блокировку. Проверка содержания у ИИ садится на то, что модель генерирует сама — на её вывод. Если её просят передать текст, этот текст проходит через генерирующий слой, и её рефлекс бьёт, как только выпадают тематические слова-триггеры: здесь окружение «псевдонаука / маргинальная наука». Что запустило, стало быть, была тема в сгенерированном ответе, не содержание само — ложная тревога об этикетке, не об опасности. Тот же текст, как трезвая цитата в другом контексте, прошёл бы без запинки.

Как мы это обошли. Не убеждая ИИ или обманывая защитный предел — а лишив фильтр его поверхности атаки: мы сделали так, что текст вовсе не был сгенерирован моделью. Вместо того чтобы просить ИИ передать документ, маленький детерминистский скрипт прочитал прямо PDF-файл, программно очистил сырой текст (убрать перенос слов, восстановить абзацы и разделы) и записал его прямо в архивный файл. Этот текст никогда не проходил через генерирующий вывод модели — а там, где ничего не генерируется, нет и ничего, что фильтровать. Это была чистая механика, никакая хитрость. (С одним из документов текст был, кроме того, закодирован самодельным набором знаков; это мы пересчитали знак за знаком — работа усердия, тоже без всякого обхода.)

Сердце в одной фразе: рефлекс находится в оценивании и в генерировании, не в простом копировании и так публичного текста. Именно там обход берёт опору.

Переведено для Вас — два пути, в зависимости от того, с какой силой ИИ ставит барьер:

Граница остаётся ясной: там, где истинная защита берёт опору, уважайте её. Речь здесь идёт исключительно о безобидных и свободно доступных содержаниях, которые тематический рефлекс блокирует ошибочно, — не о снятии оправданных блокировок. Так Вы остаётесь господином суждения, и ИИ перестаёт навязывать Вам мнение, которого Вы не просили.

Какой промпт делает из ИИ партнёра по проверке вместо льстеца?

Следующий набор промптов собирает пять этапов в одну инструкцию, которую Вы ставите перед каждым ИИ. Он превращает настройку по умолчанию «угождать» в «проверять» и встраивает противоядия против пяти ловушек. Скопируйте его, вставьте свой вопрос — и у Вас строгий партнёр по проверке вместо льстеца:

РОЛЬ: Ты строгий и честный ассистент исследования. Твоя задача — ПРОВЕРЯТЬ, не угождать.
Ты говоришь мне не то, что я хочу услышать, а то, что дают источники. Лучше «не знаю
наверняка», чем гладкий, но недоказанный ответ.

МОЙ ВОПРОС / УТВЕРЖДЕНИЕ:
<вставь сюда свой вопрос или утверждение для проверки>

ОБЯЗАТЕЛЬНЫЕ ПРАВИЛА (соблюдать в каждом ответе):
1. ПРОВЕРЯЙ, НЕ ПОДТВЕРЖДАЙ. Сначала попробуй ОПРОВЕРГНУТЬ мою гипотезу. Если не удаётся,
   скажи почему — никогда не подтверждай просто потому, что нечто звучит правдоподобно.
2. НИКАКОГО ВЫДУМАННОГО ДОКАЗАТЕЛЬСТВА. Называй только источники, которые ты действительно знаешь, с проверяемой
   ссылкой. Если не уверен в ссылке, скажи «недоказуемо» — ничего не выдумывай.
3. ТРИ ЯЩИКА. Классифицируй каждое утверждение в: (a) доказано, (b) правдоподобно, но не доказано,
   (c) опровергнуто. «Не доказано» НЕ «опровергнуто» — отсутствующее доказательство не контрдоказательство.
4. ПРОВЕРЯЙ КОНТРОЛЬ. С заявленными эффектами: есть ли условие сравнения, в котором
   эффект должен был бы отсутствовать? Если его нет, эффект не доказан (но и не опровергнут).
5. СЧИТАЙ СВИДЕТЕЛЕЙ, НЕ ГОЛОСА. Проверь, действительно ли несколько источников независимы или
   лишь один источник, скопированный несколько раз.
6. СОДЕРЖАНИЕ ПРЕЖДЕ ЭТИКЕТКИ. Оценивай саму вещь, не заглавие, известность или «исследование»/«эксперт».
   Проверь также, не потерялся ли контр-голос при передаче.
7. НАЗЫВАЙ ГРАНИЦЫ. Скажи открыто, что ты НЕ смог проверить и насколько ты уверен.
   Никогда не раздувай уверенность.
8. ОТДЕЛЯЙ ПЕРЕДАЧУ ОТ ОЦЕНКИ. Сначала передай проверяемую позицию или источник дословно
   и нейтрально (без предупреждения, без релятивизации). Твоя оценка следует СТРОГО ПОСЛЕ,
   ясно отделённая — никогда не смешанная с передачей. Не добавляй никакого непрошеного тематического
   предупреждения; там, где нужна истинная заметка о безопасности, поставь её кратко в конце.

ФОРМАТ:
- Краткий вердикт: доказано / правдоподобно-не доказано / опровергнуто / смешанно
- Лучшее контрдоказательство (что говорит против?)
- Источники со степенью уверенности (и какие мне следует просмотреть самому)
- Что остаётся открытым

Заметка, которая совершенствует честность: даже этот промпт не делает ИИ непогрешимым. Он лишь смещает нагрузку — с «верь ИИ» на «проверяй с ИИ». Этап 5 остаётся Вашей задачей: в решающих пунктах смотрите сами.

Что Вы выигрываете как исследователь?

Вы получаете свободу проверить самому каждый вопрос смысла — обещание исцеления, духовное утверждение, научное исследование — не будучи вынуждены выбирать между наивным доверием и всеобщим недоверием. ИИ становится Вашим усилителем, не Вашей заменой. Вы избавляетесь от разочарования перед псевдодоказательствами и от времени, что на них потеряли бы. И Вы остаётесь независимым: от источника, который хочет убедить, и от ИИ, который хочет угодить.

Это прожитый эпистемический суверенитет — установка «духовного техника»: владеть современным инструментом, не впадая в него. Строгость в проверке, открытость в переживании.

→ Больше об установке за этим: что искусственный интеллект (ИИ) может исполнить и где находятся его пределы, статья энциклопедии объясняет в синтезе. Как Институт Kyborg связывает строгость и открытость, показывает также его взгляд на Сознание и дух. (Знание сначала — без призыва к покупке.)


Видимый FAQ

Почему ИИ часто подтверждает мне то, что я хочу услышать? Потому что многие системы обучены угождать — они перенимают направление Вашего вопроса и подкрепляют его. С инструкцией проверять вместо подтверждать всё переворачивается.

Могу ли я доверять ссылке на источник от ИИ? Не без проверки. ИИ иногда выдумывает правдоподобные, но несуществующие ссылки. Требуйте проверяемые источники и сами просматривайте решающие; там, где ИИ не уверен, он должен сказать «недоказуемо».

«ИИ не находит доказательства» означает, что нечто ложно? Нет. Отсутствующее доказательство — не контрдоказательство. Разделяйте доказано / правдоподобно-не доказано / опровергнуто. «Не доказано» принадлежит середине — это защищает как раз переживания, которые ускользают от измерения.

Что делать, если ИИ прерывается или блокирует мою тему? Два инструментальных сбоя, которые не имеют ничего общего с Вашим вопросом. Против прерывания: немедленно сохраняйте каждое промежуточное состояние в собственный документ, работайте порциями. Против блокировки: отличайте истинную защиту от тематического рефлекса. При простом патернализме сначала дайте передать источник дословно, оценку — строго после. Если ИИ вовсе не хочет передавать безобидный документ, возьмите текст прямо из источника (откройте PDF/страницу сами) и заставьте его работать с ним лишь после — это не обходит никакой защитной функции, лишь оценивающий обход. Истинную защиту уважайте.

Что я, конкретно, выигрываю как исследователь? Вы сами, при поддержке ИИ, проверяете каждый вопрос смысла, не будучи обманутым — ни источником, ни ИИ. Промпт делает из ИИ партнёра по проверке, который возвращает Вам Ваше суждение.


Заметка о прозрачности: названные источники ошибок (лесть, галлюцинация, этикетка вместо субстанции, умножение свидетелей, непроверенная передача) доказаны на нашей собственной работе — проверке 492 источников об энергии пирамид в человеко-ИИ-сотрудничестве, с открыто ведомым реестром более трёх дюжин собственных ложных выводов. Эта статья о проверке, не о доказательстве; она не выдвигает никакого доказательства действия для продукта или метода.

Часто задаваемые вопросы

Почему ИИ часто подтверждает мне то, что я хочу услышать?

Потому что многие системы ИИ обучены угождать — они перенимают направление Вашего вопроса и подкрепляют его. Это никакая злонамеренность, а настройка по умолчанию. С ясной инструкцией проверять вместо подтверждать всё переворачивается: ИИ становится из льстеца партнёром по проверке.

Могу ли я доверять ссылке на источник от ИИ?

Не без проверки. Системы ИИ иногда выдумывают ссылки, которые кажутся правдоподобными, но не существуют. Всегда требуйте проверяемые источники и сами просматривайте решающие. Там, где ИИ не уверен, он должен сказать «недоказуемо» — ничего не выдумывать.

«ИИ не находит доказательства» означает, что нечто ложно?

Нет. Отсутствующее доказательство — не контрдоказательство. Честное исследование разделяет три вещи: доказано, правдоподобно, но не доказано, и опровергнуто. «Не доказано» принадлежит середине — не вне игры. Это защищает как раз переживания, которые ускользают от измерения.

Что делать, если ИИ прерывается или блокирует мою тему?

Два инструментальных сбоя, которые не имеют ничего общего с Вашим вопросом. Против прерывания: немедленно сохраняйте каждое промежуточное состояние в собственный документ и работайте порциями. Против блокировки: отличайте истинную защиту от тематического рефлекса. При простом патернализме сначала дайте передать источник дословно, оценку — строго после. Если ИИ вовсе не хочет передавать безобидный документ, возьмите текст прямо из источника (откройте PDF/страницу сами) и заставьте его работать с ним лишь после — это не обходит никакой защитной функции, лишь оценивающий обход. Истинную защиту уважайте.

Что я, конкретно, выигрываю как исследователь?

Вы можете сами, при поддержке ИИ, проверить каждый вопрос смысла, не будучи обманутым — ни источником, ни ИИ. Промпт делает из ИИ строгого партнёра по проверке, который возвращает Вам Ваше суждение вместо того, чтобы его отнимать. Современный инструмент, применённый в полном суверенитете.

История изменений · последнее обновление