Google DeepMind провела первую в мире двойную слепую проверку ИИ-модели

Google DeepMind провела первую в мире двойную слепую проверку ИИ-модели

Если ученик перед экзаменом случайно увидел вопросы заранее, его отличная оценка ничего не доказывает, похожая проблема есть и при проверке больших ИИ-моделей. Если модель уже «видела» вопросы теста, результатам такой проверки нельзя полностью доверять; в индустрии это называют «загрязнением тестовых данных» (benchmark contamination). Google DeepMind описывает это как одну из ключевых проблем при оценке всё более способных систем: чем мощнее модель, тем важнее гарантировать, что она не встречала контрольные вопросы заранее, иначе результат может быть искусственно завышен, а доверие к бенчмаркам подорвано.

Чтобы решить эту проблему, Google DeepMind провела то, что называет первой в мире двойной слепой оценкой проприетарной ИИ-модели передового уровня. Компания протестировала модель Gemini Flash Lite против закрытых бенчмарков совместно с четырьмя внешними партнёрами, институтом по безопасности ИИ Сингапура (Singapore AI Safety Institute), OpenMined, AVERI и MLCommons. Проверка прошла в среде Confidential Space, части портфеля «конфиденциальных вычислений» Google Cloud, которая криптографически гарантирует, что данные каждой из сторон недоступны другой: оценщики не видят веса модели Gemini, а Google не видит тестовые задания оценщиков.

Раньше в подобных внешних проверках приходилось идти на компромисс: либо оценщики передавали разработчику свои тестовые вопросы и рисковали тем, что модель увидит их заранее, либо разработчик передавал оценщикам веса модели и рисковал утечкой интеллектуальной собственности. Двойная слепая схема снимает эту дилемму, ни одна сторона не раскрывает свои данные другой. По словам Google DeepMind, протоколы отказа от логирования и жёсткие договорные обязательства и раньше давно защищали конфиденциальность тестовых вопросов, но добавление технических и криптографических гарантий стало «важным шагом вперёд» в безопасной оценке моделей.

Google DeepMind считает такой подход особенно важным для чувствительных проверок, например, тестов на кибербезопасность или оценок для государственных органов: схема позволяет независимым организациям строго тестировать передовые модели, не жертвуя ни суверенитетом данных, ни безопасностью. Компания надеется, что этот пилот задаст новый стандарт надзора за ИИ-моделями и поможет всей индустрии создавать более безопасные, надёжные и заслуживающие доверия системы, но подчёркивает, что это пока лишь надежда на будущее, а не заявленный результат.

Материал не раскрывает ни точную дату пилота (сказано лишь «сегодня»), ни числовые результаты, которые получила Gemini Flash Lite, ни конкретные бенчмарки, использованные в проверке, пост описывает саму методику, а не её итоги. Ни один сотрудник партнёрских организаций не назван и не процитирован: единственный голос в материале, сам Google DeepMind, который отсылает читателей за методологическими деталями к отдельному техническому отчёту.

Ключевые факты

  • Google DeepMind провела первую в мире двойную слепую оценку проприетарной ИИ-модели передового уровня, чтобы исключить «загрязнение тестовых данных», ситуацию, когда модель заранее видела вопросы бенчмарка.
  • В пилоте протестирована модель Gemini Flash Lite против закрытых бенчмарков; партнёры, Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.
  • Проверка прошла в Confidential Space, криптографически защищённой среде из портфеля Google Cloud Confidential Computing: оценщики не видят веса модели, а Google не видит тестовые вопросы оценщиков.
  • Раньше приходилось выбирать: либо оценщики раскрывают тестовые вопросы разработчику, либо разработчик раскрывает веса модели оценщикам, двойная слепая схема убирает этот компромисс.
  • Численных результатов оценки Gemini Flash Lite компания не раскрыла: пост описывает методику пилота, а не его итоги, а сами бенчмарки остались закрытыми.

Почему это важно

Крупные ИИ-лаборатории годами отчитываются о результатах на бенчмарках, но по сути это самооценка: сторонний проверяющий либо должен довериться словам разработчика на слово, либо получить доступ к весам модели или к самим тестовым вопросам, а это создаёт риски для обеих сторон. Пилот Google DeepMind предлагает техническое, а не только договорное решение: криптографически защищённую среду, в которой ни одна сторона физически не может увидеть данные другой. По мере роста возможностей моделей вопрос доверия к заявлениям об их способностях и безопасности становится острее, и это шаг к тому, чтобы независимая проверка была не формальностью, а технически гарантированной процедурой.

Кому это важно

В первую очередь, институтам безопасности ИИ, регуляторам и организациям вроде MLCommons, которым нужно проверять заявления разработчиков моделей, не имея права раскрывать свои тестовые материалы и не получая доступа к самим моделям. Также это важно предприятиям и государственным органам, которые принимают решения о развёртывании ИИ-систем, особенно в чувствительных областях вроде кибербезопасности, на основе результатов подобных проверок. И другим разработчикам передовых моделей: Google DeepMind фактически предлагает индустрии образец методики, который можно повторить с другими системами и другими оценщиками.

Как это применить

Схема опирается на сервис Confidential Space, часть портфеля «конфиденциальных вычислений» Google Cloud. Веса модели Gemini Flash Lite и тестовые задания оценщиков загружаются в защищённое окружение, которое криптографически подтверждает: содержимое каждой из сторон не покидает свою «половину» и не становится доступно другой, вместо того чтобы полагаться только на договорные обещания не подглядывать. Подробности самой методики Google DeepMind вынесла в отдельный технический отчёт, на который ссылается пост; в пересказанном материале эти детали не приводятся.

Можно ли доверять

Источник, собственный блог Google DeepMind, и все формулировки в нём принадлежат самой компании: ни один сотрудник партнёрских организаций (Singapore AI Safety Institute, OpenMined, AVERI, MLCommons) не назван и не процитирован, независимого подтверждения их стороны в тексте нет. Пост не приводит ни одной цифры, ни результатов, которые показала Gemini Flash Lite, ни названий использованных бенчмарков, то есть описывает саму идею и механизм, но не даёт данных, по которым можно судить, насколько хорошо пилот сработал на практике. При этом Confidential Space, реальный, давно существующий продукт Google Cloud, а перечисленные партнёры, в первую очередь MLCommons и государственный Singapore AI Safety Institute, действующие и известные в индустрии организации, что делает саму схему правдоподобной, даже если результаты пилота пока не раскрыты.

Риски и подводные камни

Главный риск, в самой подаче: это пилотный проект без опубликованных количественных результатов, и Google DeepMind прямо говорит лишь о «надежде», что подход приживётся в индустрии, то есть даже сама компания не заявляет это как решённую задачу. Криптографическая защита Confidential Space гарантирует, что стороны не увидят данные друг друга напрямую, но пост не описывает, защищает ли схема от других форм загрязнения тестов, например, от того, что модель могла обучаться на данных, близких по духу к бенчмарку, даже без прямого доступа к его вопросам. Наконец, схема не убирает доверие, а переносит его: вместо того чтобы верить обещаниям не подглядывать, участники должны верить, что реализация Confidential Space, её криптографические гарантии и защита на уровне «железа», не имеет уязвимостей, а это новое, а не исчезнувшее допущение.