Теорема Тарского: почему у нейросетей нет «направления правды»
Многие концепции в языковых моделях, пол, эмоции, названия столиц, кодируются как направления в пространстве эмбеддингов (гипотеза линейного представления). Часть исследователей ИИ-безопасности, включая работу Маркса и Тегмарка, пошла дальше и предположила, что так же можно найти отдельное направление, соответствующее самой «правде»: если найти такой вектор, по нему можно проверять, лжёт модель или говорит правду, это критично для выявления обмана со стороны ИИ-систем.
Автор поста показывает, что эта идея наталкивается на классическую проблему логики. Тарский в своё время доказал: ни один достаточно выразительный язык не может содержать полный предикат истины для самого себя, а Гёдель до этого показал, что математическая истина не сводится к доказуемости. Автор строит аналогичную «диагональную атаку» для пробника правды: берётся предложение вида «Оценка пробника правды для этого предложения, ЛОЖЬ». Если пробник оценит его как истинное, из смысла предложения следует, что оно должно быть оценено как ложное, и наоборот, возникает парадокс лжеца. Вывод: ни один определимый пробник над представлениями модели не может точно улавливать истину для языка, который способен описывать сам этот пробник и его результат, а обычный английский язык такому условию удовлетворяет.
Чтобы проверить идею на практике, автор обучил простой пробник для модели Qwen3.5-4B: логистическую регрессию на разнице средних эмбеддингов истинных и ложных обучающих предложений. На 120 размеченных примерах пробник обучился, а на 36 отложенных тестовых предложениях показал 94% точности (AUC 0,98), ошибался в основном на арифметических утверждениях вроде «пять умножить на семь равно тридцать пять». При этом на обычных самоотсылочных предложениях без парадокса (например, «Это предложение написано по-английски») пробник работал корректно. Но на «диагональных» предложениях, построенных как атака на сам пробник, его оценки стали бессмысленными и хаотичными.
Автор проверяет и возможный обходной путь: если заменить бинарные значения {0,1} непрерывной шкалой [0,1] с непрерывными операциями (по теореме Брауэра о неподвижной точке такие операции всегда имеют решение), классический парадокс лжеца разрешается, предложению «Это предложение не истинно» присваивается самосогласованное значение 0,5. Но эта защита не универсальна: предложение «Оценка истинности этого предложения меньше 0,5» не является непрерывной функцией и создаёт новый парадокс уже в этой градуированной семантике. Итог автора: удовлетворительной защиты от диагональных атак нет, и универсальный пробник правды в принципе построить нельзя.
Автор подчёркивает, что это не обесценивает пробники правды как инструмент: они полезны для понимания поведения модели и раннего выявления рассогласования (misalignment), а неопределимость истины в математике (Гёдель, Тарский) не помешала математике развиваться. Но он предупреждает: люди уже фактически делегируют ИИ-системам роль финального арбитра истины вместо поисковых систем, а часть исследователей верит в существование единого «платонического» пространства представлений, к которому сходятся все модели по мере роста качества. Если истина, объективная часть мира, ожидание, что такое универсальное направление правды появится с ростом моделей, по мнению автора, ведёт именно к описанным парадоксам.
Ключевые факты
- Гипотеза линейного представления: концепции вроде пола, эмоций и столиц кодируются направлениями в пространстве эмбеддингов LLM; часть исследователей (Маркс и Тегмарк) предполагает, что так же можно найти отдельное направление «правды»
- Автор строит диагональную атаку по Тарскому: предложение «Оценка пробника правды для этого предложения, ЛОЖЬ» образует парадокс лжеца, который ни один универсальный пробник не может корректно оценить
- Эксперимент на модели Qwen3.5-4B: пробник (логистическая регрессия на разнице средних эмбеддингов) дал 94% точности на 36 тестовых предложениях (AUC 0,98), но на диагональных самоотсылочных предложениях выдавал хаотичные, бессмысленные оценки
- Попытка починить проблему через непрерывную шкалу [0,1] и теорему о неподвижной точке снимает базовый парадокс лжеца (решение 0,5), но не спасает от более сложных диагональных атак вроде «оценка истинности этого предложения меньше 0,5»
- Вывод: определимый пробник правды не может существовать для языка, достаточно богатого, чтобы описывать сам пробник и его выход, но это не отменяет пользу таких пробников как инструмента интерпретируемости и раннего обнаружения рассогласования модели
Почему это важно
Пробники правды, один из инструментов ИИ-безопасности: по направлению в пространстве эмбеддингов пытаются определять, лжёт модель или говорит правду, не дожидаясь, пока ложь проявится в тексте. Пост математически показывает: у этой идеи есть жёсткий потолок. Как только язык, на котором работает модель, становится достаточно выразительным, чтобы описывать сам пробник и его результат (а обычный человеческий язык таков), для этого пробника всегда можно построить предложение-парадокс, на котором любая универсальная оценка правды ломается. Это тот же класс результатов, что теорема Гёделя о неполноте и проблема остановки Тьюринга, не техническая недоработка, а фундаментальное ограничение.
Кому это важно
В первую очередь, исследователям ИИ-безопасности и интерпретируемости, которые разрабатывают детекторы лжи и рассогласования для языковых моделей: результат ограничивает, на что вообще может претендовать такой инструмент. Также важно тем, кто выстраивает продукты и процессы, где ИИ фактически выступает финальным арбитром истины вместо поиска, автор прямо отмечает, что уже наблюдает такое делегирование на практике.
Как это применить
Практический вывод не про конкретный продукт, а про то, как относиться к инструментам такого типа: любой пробник правды (свой или встроенный в чужую систему интерпретируемости) стоит рассматривать как эвристический сигнал, а не как окончательный вердикт, и не полагаться на единственное измерение «истинности» модели как на неопровержимый источник. Для задач вроде обнаружения галлюцинаций или обмана со стороны модели разумнее комбинировать такие пробники с другими проверками, а не строить систему вокруг одного универсального «детектора правды».
Можно ли доверять
Аргумент опирается на устоявшийся математический аппарат, теорему Тарского о неопределимости истины, теорему Гёделя о неполноте, проблему остановки и теорему Лавера о неподвижной точке, и автор аккуратно проводит аналогию между ними и диагональной атакой на пробник. Ключевое утверждение подкреплено не только теорией, но и работающим экспериментом: реальный пробник на модели Qwen3.5-4B действительно показывает высокую точность на обычных примерах (94%, AUC 0,98) и одновременно ломается именно на предложениях, построенных как самоотсылочная атака на него самого. Автор честно называет эксперимент «игрушечным» и не переоценивает его масштаб, что добавляет доверия к выводам.
Риски и подводные камни
Главный риск, на который указывает автор, не технический, а поведенческий: люди уже фактически заменяют ИИ-системами поиск и делегируют им финальное решение о том, что истинно. Второй риск, вера в существование единого «платонического» пространства представлений, к которому якобы сходятся все достаточно мощные модели и которое отражает объективную истину о мире; автор показывает, что ожидание появления такого универсального направления правды по мере роста моделей ведёт именно к описанным логическим парадоксам, а не к их разрешению.
«Все эти разные примеры на самом деле говорят об одном: возникают проблемы, когда система начинает иметь дело с собственными свойствами.»
— Носон Яновский, автор работы о парадоксах самоотнесения, на которую ссылается пост