ИИ-помощник JudgeGPT на GPT-4 поднял производительность судов Пакистана на 6,3%

Исследователи из ETH Zurich, Imperial College London и New Economic School провели крупный полевой эксперимент в судебной системе Пакистана, чтобы проверить, повышает ли ИИ производительность государственных институтов. Ситуация в стране острая: менее двух судей на 100 тысяч жителей против 22 в ЕС и 30 в Англии и Уэльсе; на конец 2024 года не рассмотрено 2,26 млн дел, 82% из них - в судах первой инстанции; судьи работают на минимальной технике без вспомогательного персонала, и до эксперимента лишь около 25% из них хоть раз пользовались языковой моделью вроде ChatGPT.
В рандомизированном контролируемом исследовании участвовал 1559 судей из 118 судов - примерно половина всего судейского корпуса первой инстанции Пакистана. Их разделили на три группы. Первая получила доступ к JudgeGPT и целевое обучение: шесть лекций по 90 минут за три недели, после заседаний, которые вёл профессор ETH Эллиотт Эш. Судей учили, для каких задач инструмент подходит, где он ошибается и как проверять его ответы. Вторая группа получила тот же доступ к ИИ, но только общий семинар про технологии и право без предметного обучения. Контрольная группа посетила тот же общий семинар, но не получила доступа к JudgeGPT.
JudgeGPT - ИИ-ассистент на базе GPT-4 от OpenAI, разработанный специально для судов первой инстанции Пакистана. Он использует технологию генерации с опорой на поиск по базе документов (retrieval augmented generation, RAG): по запросу судьи система ищет по базе из 129 235 документов - 128 292 судебных решения и 943 закона Пакистана, - выбирает десять наиболее релевантных фрагментов и формирует ответ со ссылками на источники.
Один лишь доступ к ИИ почти ничего не дал. Судьи с целевым обучением пользовались JudgeGPT в четыре раза чаще, чем судьи из группы с общим семинаром: за 40 недель у обученных судей набралось в среднем почти 60 входов в систему и более 200 запросов, а у судей без обучения - около 20 входов и меньше 50 запросов. В округах, где было больше обученных судей, рассматривали больше дел: при умеренном уровне использования ИИ это дало около 1848 дополнительных дел в год на округ - рост на 6,3%. Даже округа из нижней четверти по вовлечённости всё равно разобрали примерно на 616 дел больше.
Качество решений не пострадало, а по некоторым признакам даже выросло. Доля апелляций на 1000 рассмотренных дел немного снизилась, при этом рабочие часы судей и баланс между работой и личной жизнью не изменились. Исследователи оценили экономию в $38,50 на каждый вложенный доллар - расчёт основан на том, во сколько обошёлся бы найм дополнительных судей для такого же объёма работы; даже по консервативной оценке отдача составляет не менее $10 на доллар. Проверка около 4000 судебных решений показала больше текста, помеченного как сгенерированный ИИ (что ожидаемо), но читаемость, длина текста и число юридических аргументов не изменились. Отдельная проверка качества с помощью языковой модели, подтверждённая двумя пакистанскими юристами, показала небольшое улучшение: решения обученных судей получали более высокую оценку в 59% попарных сравнений против 42% в контрольной группе. Признаков роста гендерной или религиозной предвзятости в формулировках решений исследователи не нашли.
Анализ обезличенных логов переписки примерно 1500 судей показал, что чаще всего ИИ использовали для юридического поиска, редактирования и генерации текста: около 60% запросов касались законов, процедур или юридических понятий. Обученные судьи чаще применяли JudgeGPT для редактирования и резюмирования текста - задач, где языковые модели надёжнее, - и реже задавали общие юридические вопросы, где выше риск галлюцинаций. Лишь около пятой части запросов относилась к тому, что исследователи называют «содержательным делегированием»: когда судья просит JudgeGPT самостоятельно оценить дело или составить обоснование решения. Обучение делало судей более склонными принимать решение самим и использовать ИИ только для оформления уже готового обоснования.
Авторы подчёркивают: результаты не говорят в пользу замены судей искусственным интеллектом. Эксперимент показывает, что ИИ способен повысить производительность госсектора, но только вместе с обучением, которое направляет пользователей к правильным задачам - без него большая часть эффекта исчезает. Исследователи также отмечают, что достигнутый прирост производительности, вероятно, нижняя граница, а не потолок: JudgeGPT работал на GPT-4, модели предыдущего поколения без «рассуждающего» режима, тогда как современные рассуждающие модели пишут лучше, реже галлюцинируют и надёжнее справляются со сложными задачами.
Ключевые факты
- Рандомизированный эксперимент охватил 1559 судей из 118 судов - около половины судейского корпуса первой инстанции Пакистана; сравнивались доступ к ИИ без обучения и доступ с целевым обучением
- JudgeGPT - RAG-ассистент на GPT-4 с базой из 129 235 документов (128 292 судебных решения и 943 закона), выдаёт ответ со ссылками на 10 наиболее релевантных фрагментов
- Целевое обучение (6 лекций по 90 минут за 3 недели) подняло использование ИИ в 4 раза; в округах с обученными судьями разобрали на 1848 дел в год больше (+6,3%), в нижнем квартиле - на 616 дел больше
- Экономия оценена в $38,50 на вложенный доллар (консервативно - не менее $10); качество решений не упало, доля апелляций слегка снизилась, роста гендерной или религиозной предвзятости не выявлено
- Обучение сместило использование ИИ к безопасным задачам - редактированию и резюмированию; «содержательное делегирование» (когда ИИ сам оценивает дело или пишет обоснование) составило лишь около пятой части запросов
Почему это важно
Заявления о том, что ИИ повышает продуктивность госсектора, чаще всего опираются на отдельные кейсы, а не на строгие данные. Это исследование - крупный рандомизированный полевой эксперимент, а не наблюдение постфактум: он охватил около половины всех судей первой инстанции Пакистана и дал одно из первых надёжных причинно-следственных доказательств того, что связка «ИИ плюс обучение» измеримо ускоряет работу перегруженной судебной системы. Масштаб проблемы велик: на конец 2024 года в Пакистане не рассмотрено 2,26 млн дел, судей катастрофически не хватает (менее двух на 100 тысяч жителей против 22 в ЕС и 30 в Англии и Уэльсе), а вспомогательного персонала у них почти нет.
Кому это важно
В первую очередь - правительствам и судебным системам стран с большими завалами нерассмотренных дел и нехваткой судей, где Пакистан - показательный, но не уникальный пример. Результаты важны для чиновников, решающих, стоит ли финансировать ИИ-инструменты для судов, а также для разработчиков юридических RAG-систем, ориентированных на государственный сектор развивающихся стран.
Как это применить
Ключевой практический вывод - сам по себе доступ к ИИ почти бесполезен, работает только доступ вместе со структурированным обучением. Формула, которая сработала в эксперименте: шесть занятий по 90 минут за три недели, которые вёл профильный эксперт после рабочего дня, с разбором того, какие задачи инструменту стоит поручать (юридический поиск, редактирование, резюмирование текста), где он ошибается и как проверять его ответы. Без такого обучения судьи почти не пользовались системой - около 20 входов и менее 50 запросов за 40 недель против почти 60 входов и более 200 запросов у обученных судей.
Можно ли доверять
Методологически исследование сильное: рандомизированный контролируемый эксперимент на 118 судах и почти половине судейского корпуса Пакистана, с независимой проверкой качества решений через анализ языковой моделью, подтверждённой двумя пакистанскими юристами на выборке около 4000 решений. Доля апелляций не выросла, а слегка снизилась; признаков усиления предвзятости по полу или религии не найдено. При этом стоит учитывать: это одно академическое исследование в одной стране, на модели GPT-4 предыдущего поколения, а не серия независимых повторений, поэтому насколько результаты переносятся на другие правовые системы и более новые модели - пока не проверено.
Риски и подводные камни
Главный риск - иллюзия, что достаточно закупить лицензии на ИИ-инструмент: без сопутствующего обучения основная часть выгоды исчезает. Около пятой части запросов относилась к «содержательному делегированию», когда судья фактически просил ИИ самостоятельно оценить дело или составить обоснование решения - это самый рискованный сценарий использования языковой модели в юридическом контексте, где цена галлюцинации особенно высока. Кроме того, результаты специфичны для правовой системы Пакистана и модели GPT-4 предыдущего поколения, поэтому напрямую переносить их на другие страны и на более новые рассуждающие модели без дополнительной проверки не стоит.