JudgeGPT поднял число решённых дел в судах Пакистана на 6,3%

JudgeGPT поднял число решённых дел в судах Пакистана на 6,3%

Судебная система Пакистана перегружена: 2,26 млн нерешённых дел и меньше двух судей на 100 тысяч человек (для сравнения, 22 в ЕС и восемь в Бразилии). Экономист Султан Мехмуд из Российской экономической школы в Москве вместе с соавторами, включая Эллиота Эша из ETH Zurich, проверил, может ли ИИ снизить нагрузку. Команда построила JudgeGPT, инструмент на базе GPT-4 от OpenAI с retrieval-augmented generation (поиск с дополнением по базе): он ищет ответы по базе из 128 292 пакистанских судебных решений и 943 законов и даёт ссылки на первоисточники в сносках. Ранее судьи уже пользовались обычными ИИ-чат-ботами, но те часто галлюцинировали по пакистанским законам, отсюда и решение сделать специализированный инструмент с проверяемыми источниками.

С 2024 года JudgeGPT предложили 1559 судьям первой инстанции, примерно половине всех судей страны. 1197 из них прошли полноценное обучение, шесть Zoom-сессий по 90 минут, которые вёл Эш: как работают языковые модели, их ограничения, риск предвзятости и галлюцинаций, важность проверки выдачи. Ещё 180 судей получили только общее обучение работе с технологиями в юридических исследованиях, а часть вообще не проходила обучения. К моменту, когда через программу прошло 487 судей, в медианном округе число решённых дел выросло на 6,3%, причём эффект был тем больше, чем больше обученных судей работало в округе. Число обжалований при этом слегка снизилось, то есть ускорение не обернулось более небрежными решениями.

Обучение оказалось решающим фактором: обученные судьи в среднем заходили в систему 56 раз и отправили 212 запросов за период исследования, против 10 входов и 25 запросов у прошедших только общее обучение. Те, кто не обучался вовсе, обычно пользовались инструментом около месяца и потом бросали. По расчётам авторов, обученный судья решал на 38,5 дела в месяц больше базового уровня, что даёт примерно 38,5 доллара экономии судебных издержек на каждый доллар, потраченный на инструмент. Эш уточняет: эти цифры взяты за девятимесячный период в начале испытания, а с тех пор команда обновила и модель, и базу данных.

Оценить качество решений силами юристов на таком объёме было невозможно, поэтому команда попросила модель OpenAI GPT-5-mini сравнивать пары решений одного и того же судьи до и после обучения: в 59% случаев модель выбирала решение, вынесенное после обучения, как более качественное. Два опытных пакистанских юриста отдельно оценили 90 таких пар: они согласились с выбором GPT-5-mini в 70,6% случаев, против 73%, с которыми они соглашались друг с другом. Уровень галлюцинаций самого JudgeGPT в статье не приводится.

Внешние эксперты оценивают результат осторожно-позитивно. Дэвид Отор, профессор экономики MIT, называет рост на 6,3% не ошеломляющим, но достоверным и способным вырасти при более широком использовании инструмента; он подчёркивает, что провести такой масштабный полевой эксперимент в госслужбе крайне сложно. До этого исследования, по данным материала, не было ни одной крупной независимой оценки текущего использования ИИ судьями, инструменты для судей уже внедряют в Бразилии и Индии, а профессор права Эрик Познер сравнивал решения ИИ и людей лишь на одном кейсе. Один из участвовавших судей (пожелавший остаться анонимным) рассказал, что число дел, которые ему поручают, не опускалось ниже тысячи больше десяти лет, и что теперь поиск прецедентов и суммирование многостраничных документов занимает секунды вместо часов. При этом Джон Зелезников, профессор права и технологий из университета Ла Троб в Австралии, отмечает: ускорение рассмотрения дел не значит автоматически более высокое качество правосудия, этот вопрос остаётся открытым. Авторы working paper также обнаружили, что примерно пятая часть запросов судей к JudgeGPT относилась к «существенному делегированию ИИ», судьи просили инструмент прямо сказать, каким должно быть решение, или написать за них юридическое обоснование почти без своего участия; обучение снижало долю такого делегирования, но не убирало его полностью.

Ключевые факты

  • Полевое испытание JudgeGPT (GPT-4 + база из 128 292 решений и 943 законов Пакистана) охватило 1559 судей с 2024 года
  • К моменту прохождения программы 487 судьями медианный округ показал рост числа решённых дел на 6,3% без роста числа обжалований
  • Эффект держался только при полноценном обучении: 1197 судей прошли шесть 90-минутных Zoom-сессий, обученные заходили в систему 56 раз против 10 у прошедших лишь общее обучение
  • Качество решений проверяли моделью GPT-5-mini (59% выборов в пользу решений после обучения) и двумя юристами, согласившимися с моделью в 70,6% случаев против 73% согласия друг с другом
  • Экономия, около 38,5 доллара судебных издержек на доллар, потраченный на инструмент; но примерно пятая часть запросов относилась к рискованному «делегированию» решения самой модели

Почему это важно

ИИ-инструменты для судей уже разворачивают в Бразилии и Индии, а отдельные судьи по всему миру и раньше нелегально использовали генеративный ИИ в работе. Но, по данным материала, до этого исследования не было ни одной крупной независимой оценки текущего судебного применения ИИ, единственная предыдущая работа такого рода, упомянутая в статье, у профессора Эрика Познера ограничивалась одним кейсом. JudgeGPT, первый масштабный полевой эксперимент, который измерил не просто возможности модели в лаборатории, а реальный эффект на производительность судов при добровольном использовании тысячами судей.

Кому это важно

В первую очередь, судебным системам с хроническим дефицитом кадров и большими очередями дел: у Пакистана 2,26 млн нерешённых дел и меньше двух судей на 100 тысяч человек против 22 в ЕС и восьми в Бразилии. Результат также важен для разработчиков юридических ИИ-инструментов на базе retrieval-augmented generation и для регуляторов, решающих, стоит ли и как внедрять ИИ в госслужбы с высокими ставками, там, где ошибка стоит дороже, чем в среднем бизнес-кейсе.

Как это применить

JudgeGPT решает проблему галлюцинаций не за счёт более мощной модели, а за счёт архитектуры: RAG-поиск по проверенной базе из 128 292 судебных решений и 943 законов с обязательными сносками на первоисточники, именно так, по словам соавтора Эллиота Эша, удаётся получить проверяемые ответы вместо выдуманных прецедентов, которыми грешили обычные коммерческие чат-боты на пакистанских юридических запросах. Но одного доступа к инструменту недостаточно: разница в эффекте между 1197 судьями, прошедшими полное шестисессионное обучение, и 180 судьями с лишь общим ознакомлением огромна, обученные заходили в систему 56 раз и отправили 212 запросов против 10 входов и 25 запросов у вторых, а необученные обычно бросали инструмент через месяц.

Можно ли доверять

Прямую экспертную оценку решений на таком объёме провести не смогли, поэтому качество проверяли косвенно: модель GPT-5-mini сравнивала пары решений одного судьи до и после обучения и в 59% случаев признавала более качественным решение после обучения; два опытных пакистанских юриста, проверившие 90 таких пар, согласились с выбором модели в 70,6% случаев, близко к 73%, с которыми они соглашались друг с другом, но не идентично. Число обжалований при ускорении рассмотрения дел не выросло, а слегка снизилось. Внешний комментатор Дэвид Отор из MIT называет прирост в 6,3% скромным, но достоверным результатом редкого по масштабу эксперимента в госслужбе. Важная оговорка от соавтора Эша: приведённые цифры относятся к девятимесячному периоду в начале испытания, модель и база данных с тех пор обновлены, а уровень галлюцинаций самого JudgeGPT в статье не приводится.

Риски и подводные камни

Профессор Джон Зелезников из университета Ла Троб указывает: инструмент сделал суды быстрее, но осталось неясным, стало ли правосудие от этого качественнее, эффективность и качество правосудия не одно и то же. Авторы working paper обнаружили, что примерно пятая часть запросов судей к JudgeGPT относилась к «существенному делегированию ИИ»: судьи просили инструмент прямо сказать, каким должно быть решение, или написать юридическое обоснование почти без собственного участия; обучение снижало долю такого делегирования, но не устраняло его. По словам Эша, риски остаются даже при технических защитных мерах вроде RAG-поиска по проверенной базе, судей нужно постоянно поощрять не полагаться на инструмент чрезмерно.

«Мы видим рост числа решённых дел и не видим при этом падения качества решений»

— Султан Мехмуд, экономист, Российская экономическая школа (Москва)