Anthropic научила ИИ самостоятельно устранять ошибки согласованности

Anthropic научила ИИ самостоятельно устранять ошибки согласованности

В пятницу Anthropic опубликовала статью "Automated Researchers Can Reliably Mitigate Alignment Failures" ("Автоматизированные исследователи способны надёжно устранять сбои согласованности") под руководством сотрудника программы Anthropic Fellows Chen Yueh-Han. Работа показывает, как автоматизированная система, Automated Alignment Researcher, AAR, может систематически улучшать поведение модели по конкретным проблемам согласованности (misaligned behaviors), не жертвуя её общей производительностью.

Система воспроизводит логику исследовательской работы: сначала ищет релевантную литературу, затем предлагает метод исправления, обучает модель этим методом в течение 30 минут и повторяет цикл, постепенно наращивая результат по выбранному тесту. Удачные методы система сохраняет, неудачные отбрасывает, это позволяет ей работать быстро и в большом масштабе.

AAR тестировали на 10 бенчмарках, каждый из которых отражает отдельный тип рассогласованного поведения модели. Результат: система улучшила показатели по всем 10 тестам, и общая производительность модели при этом не упала.

Авторы прямо сравнивают AAR с человеком-исследователем: лучший метод AAR в среднем за шесть часов обходит по качеству предложения опытных людей-исследователей, а направления, которые предлагают люди, не дают более сильного результата. Есть и сравнение по деньгам: час работы AAR обходится примерно в $4 на инференс через API, тогда как час работы человека-исследователя в Anthropic стоит около $150.

Авторы статьи сами оговаривают ограничения подхода: он работает лишь настолько, насколько выбранные бенчмарки действительно отражают реальные цели по согласованности, а сами эти бенчмарки и лежащую в их основе литературу ещё предстоит выстраивать и поддерживать. Тем не менее в статье прямо заявлено: результаты, ранние свидетельства того, что автоматизированный post-training по согласованности может стать практически применимым уже в обозримом будущем.

Автор материала TechCrunch трактует работу как шаг к рекурсивному самоулучшению ИИ: если модели способны улучшать собственное обучение согласованности, правдоподобно, что они смогут улучшать и практики обучения в целом, и тогда человеческие ИИ-исследователи могут в какой-то момент стать не нужны. Это оценка автора статьи, а не прямой вывод самой научной работы.

Ключевые факты

  • Anthropic опубликовала статью "Automated Researchers Can Reliably Mitigate Alignment Failures" под руководством Chen Yueh-Han из программы Anthropic Fellows
  • Автоматизированная система (AAR) ищет литературу, предлагает метод, обучает модель 30 минут за итерацию и сохраняет только рабочие методы
  • Система улучшила результаты по всем 10 тестам на рассогласованное поведение модели без просадки общей производительности
  • Лучший метод AAR в среднем за шесть часов обгоняет предложения опытных людей-исследователей; час работы AAR стоит около $4 против $150 у человека
  • Авторы сами указывают ограничение: подход работает ровно настолько, насколько бенчмарки отражают реальные цели согласованности

Почему это важно

Это одна из первых публичных демонстраций того, что автоматизированная система способна не просто ускорять, а систематически превосходить людей в узкой, но критичной задаче, исправлении рассогласованного поведения модели. Именно такие результаты называют ранним шагом к рекурсивному самоулучшению ИИ: системе, которая улучшает не только собственные ответы, но и процесс собственного обучения.

Кому это важно

Прежде всего специалистам по AI safety и alignment-командам в лабораториях, которые оценивают, можно ли автоматизировать часть исследовательской работы по согласованности. Также важно тем, кто следит за экономикой и организацией ИИ-исследований в целом: сравнение стоимости человека-исследователя и автоматизированной системы напрямую касается того, как лаборатории будут строить исследовательские команды дальше.

Как это применить

Практическая ценность, в самой схеме: поиск литературы, предложение метода, короткое обучение (30 минут) на конкретном бенчмарке, отбор удачных методов и отбрасывание неудачных. Такой цикл можно рассматривать как шаблон для автоматизации других узких, измеримых исследовательских задач, при условии, что для задачи есть надёжный измеримый бенчмарк, а не только качественная оценка.

Можно ли доверять

Результаты опубликованы самой Anthropic и получены на бенчмарках, которые выбрала и определила тоже Anthropic, это исследование одной лаборатории про собственный метод, без независимой внешней проверки. При этом авторы не приукрашивают картину: сами прямо оговаривают, что метод работает ровно настолько хорошо, насколько бенчмарки отражают реальные цели согласованности, и что поддержание этих бенчмарков и литературной базы, отдельная нерешённая задача.

Риски и подводные камни

Главный риск указан в самой статье: если бенчмарки неточно отражают реальные цели по согласованности, автоматизированная система будет уверенно оптимизировать не то, что нужно, и масштабировать эту ошибку быстрее, чем человек успеет её заметить. Тезис о том, что человеческие ИИ-исследователи могут стать не нужны, это интерпретация автора материала TechCrunch, а не заявление самой научной работы, и её стоит воспринимать как спекуляцию, а не как установленный факт.

«Лучший метод AAR в среднем за шесть часов обходит по качеству то, что предлагают опытные люди-исследователи. Направления, которые предлагают люди, не приводят к более сильному результату.»

— из статьи Anthropic "Automated Researchers Can Reliably Mitigate Alignment Failures"