Основатель HumanLayer: ИИ-агенты ломают качество кода со временем

Основатель HumanLayer: ИИ-агенты ломают качество кода со временем

В 2026 году индустрия ИИ-кодинга массово продвигает идею «фабрики ПО без ревью» (lights-off software factory): агенты сами пишут, тестируют и выкатывают код, а человек его вообще не читает. Термин ввёл Дэн Шапиро; свою версию такой фабрики показывала StrongDM (о ней писал блогер Саймон Уиллисон), в OpenAI аналогичный проект называется Symphony (о нём в феврале и апреле рассказывал Райан Лопополо), и, по наблюдению автора поста, Декса, основателя стартапа HumanLayer, в этом году почти каждая компания норовит рассказать, что её агентная фабрика пишет порядка 75% кода. Декс сразу предупреждает о своей необъективности: HumanLayer как раз продаёт инструменты для связки человека и агентов.

При этом накапливаются тревожные сигналы. Отчёт Faros AI фиксирует: с тех пор как компании массово перешли на ИИ-инструменты кодинга, качество ревью пул-реквестов резко просело, комментариев к пул-реквестам стало больше, они стали длиннее, заметно выросла доля пул-реквестов, которые вливают вообще без ревью, а число инцидентов и багов на разработчика тоже выросло. Автор оговаривается, что это «сигнал корреляции, а не дымящийся пистолет», но по его ощущениям это совпадает с тем, что он видит вживую. На AI Engineer Europe его знакомый по имени Марио публично просил индустрию притормозить: компании, у которых в принципе не должно быть простоев из-за качества кода, простаивают именно из-за ошибок кодовых агентов. Разработчик Мэтт Покок сформулировал это так: «кодовые базы разваливаются быстрее, чем когда-либо прежде». Сам HumanLayer прошёл через это на собственном опыте: в июле 2025 года компания полностью перешла на режим без ревью человека, фоновые агенты сами писали и вливали код. Примерно к третьему серьёзному провалу, случившемуся уже в ноябре, стало ясно, что дешевле переписать всё с нуля: сооснователь компании две недели вручную, в обычном VS Code (без Cursor), восстанавливал архитектурные паттерны.

Центральный тезис поста: популярное объяснение «если у тебя не получается, это твой skill issue, просто нужно больше токенов и лучше настроить обвязку агента», неверное. Никакая инженерия обвязки (harness engineering: песочницы, оркестрация, линтеры, боты для «состязательного ревью») не решает того, что, по мнению автора, является проблемой самого обучения моделей, он ссылается на методику RLVR (reinforcement learning with verifiable rewards, обучение с подкреплением на проверяемых наградах) и на то, как устроены бенчмарки. Разница, которую видит автор: с прошлого лета модели заметно подтянулись в решении разовых задач и в «вайб-кодинге» новых небольших проектов, но почти не продвинулись в другом, умении поддерживать и улучшать качество уже существующей кодовой базы со временем. Это тот самый эффект «дробовика» Мартина Фаулера (правишь одно место, ломается другое), и, как отмечает автор, строгого бенчмарка, который измерял бы именно способность модели поддерживать качество кода на длинной дистанции, попросту не существует.

Отдельная часть поста, история термина: «software factory» восходит к натовской конференции 1968 года, той же, что подарила термин «software engineering». До-агентная фабрика ПО, это цепочка «придумали → задача в трекере → человек написал → пул-реквест и ревью → деплой → мониторинг → обратная связь пользователей → снова в трекер»; агенты изначально ускорили только один шаг («написал»), из-за чего ревью стало новым узким местом, отсюда мода на агентное ревью, агентное тестирование, а затем и на автоматическую маршрутизацию инцидентов и обратной связи прямо в очередь агенту. «Фабрика без ревью», это точка, где из цепочки убирают последнего человека. Дальше автор обещает разобрать техническую механику через призму RLVR и методологии бенчмарков и перейти к тому, что он называет «первым по-настоящему успешным кодовым агентом», Claude Code, а также дать практические советы, как всё же двигаться быстро, не поджигая кодовую базу.

Ключевые факты

  • HumanLayer, стартап автора поста Декса, сам полностью перешёл на режим без ревью человека в июле 2025 года, и уже примерно к третьему серьёзному провалу, случившемуся в ноябре, было решено переписать кодовую базу с нуля: сооснователь две недели вручную восстанавливал архитектуру в обычном VS Code, без Cursor.
  • Отчёт Faros AI: с тех пор как компании массово перешли на ИИ-инструменты кодинга, качество ревью пул-реквестов резко упало, растёт доля пул-реквестов без единого ревью, выросло число инцидентов и багов на разработчика; сам автор называет эти данные «сигналом корреляции», а не строгим доказательством.
  • Разработчик Мэтт Покок: «кодовые базы разваливаются быстрее, чем когда-либо прежде»; на AI Engineer Europe знакомый автора по имени Марио публично просил индустрию притормозить из-за аварий по вине кодовых агентов.
  • Модели заметно подтянулись в решении разовых задач и «вайб-кодинге» новых проектов, но почти не продвинулись в поддержании качества уже существующей кодовой базы, по мнению автора, это проблема самого обучения моделей (метод RLVR, методология бенчмарков), а не нехватки инструментов вокруг агента.
  • Термин «software factory» восходит к натовской конференции 1968 года, подарившей миру и термин «software engineering»; агенты пока ускоряют только написание кода, а ревью и поддержание качества остаются узким местом всей цепочки.

Почему это важно

В 2026 году индустрия ИИ-кодинга активно продвигает идею «фабрики ПО без ревью» (lights-off software factory): агенты сами пишут, тестируют и выкатывают код, а человек его вообще не читает. Свою версию такой фабрики показывала StrongDM, в OpenAI аналогичный проект называется Symphony, и, по наблюдению автора поста, в этом году почти любая компания норовит рассказать, что её агентная фабрика пишет порядка 75% кода. Одновременно копятся тревожные сигналы: отчёт Faros AI фиксирует резкий рост багов и инцидентов после перехода на ИИ-кодинг, разработчик Мэтт Покок публично говорит, что кодовые базы разваливаются быстрее, чем когда-либо, а сам автор, основатель стартапа HumanLayer, провёл свою компанию через режим полностью без ревью человека и в итоге переписал продукт с нуля. Вопрос не абстрактный: команды прямо сейчас решают, убирать ли человека из ревью кода, и от этого решения зависит, не начнёт ли их кодовая база буксовать уже через несколько месяцев, по наблюдению автора, агентные кодовые базы обычно спотыкаются примерно на отметке в 3, 6 месяцев чистой агентной разработки.

Кому это важно

Технические руководители и CTO, решающие, насколько активно убирать человеческое ревью кода из пайплайна. Разработчики, которым говорят, что их плохие результаты с агентами, это личный «skill issue», требующий просто расходовать больше токенов и сильнее довериться агенту. Команды, которые уже несколько месяцев ведут в основном агентно написанную кодовую базу и начинают замечать, что она стала хрупкой и плохо поддающейся изменениям, тот самый случай «агентного brownfield» на горизонте 3, 6 месяцев, который описывает автор. Разработчики инструментов вокруг кодовых агентов (обвязка, оркестрация, агентное ревью), им напоминают, что чисто инструментальные меры не решают задачу, если корень проблемы в том, как обучены сами модели.

Как это применить

Прямых рецептов в доступной части поста немного, но логика вырисовывается чёткая. Не убирайте ревью человека полностью: и данные Faros AI, и собственный опыт HumanLayer говорят, что это путь к деградации кода. Разделяйте сценарии: для разовых задач и «вайб-кодинга» новых небольших проектов агенту вполне можно доверять почти без присмотра, а для развития существующей продакшн-кодовой базы человеку по-прежнему нужно читать код и следить за архитектурой. Не путайте инвестиции в обвязку агента, песочницы, оркестрацию, линтеры, ботов для «состязательного ревью», с решением проблемы: это полезные, но недостаточные меры, если, как утверждает автор, дело в самом обучении моделей. И закладывайте на агентно написанную кодовую базу горизонт в 3, 6 месяцев, после которого, по наблюдению автора, работа с ней обычно замедляется, лучше пересмотреть процессы заранее, чем после первого серьёзного инцидента.

Можно ли доверять

Автор, не нейтральный наблюдатель и сам это признаёт в начале текста: он руководит HumanLayer, компанией, которая продаёт инструменты для связки человека и агентов, то есть прямо заинтересован в тезисе «одного ИИ недостаточно». Центральный кейс поста, не абстракция, а личный опыт его же компании (несколько месяцев фабрики без ревью, закончившиеся переписыванием продукта с нуля), это сильное, но единичное наблюдение. Единственные количественные данные, отчёт Faros AI о падении качества ревью и росте инцидентов; сам автор прямо называет их «сигналом корреляции, а не дымящимся пистолетом» и советует относиться к подобной статистике настороженно. Остальная аргументация опирается на цитаты и выступления известных в индустрии людей (Саймон Уиллисон, Мэтт Покок), а не на контролируемое исследование. При этом на Hacker News пост уже собрал заметное обсуждение (273 балла и 197 комментариев на момент сбора), то есть тезисы проходят проверку боем в инженерном сообществе.

Риски и подводные камни

Легко перепутать корреляцию (данные Faros AI) с доказанной причинно-следственной связью, сам автор честно предупреждает об этом. Легко списать любой провал агента на «skill issue» (мол, просто плохо промптите или плохо настроили обвязку) и не заметить структурный предел моделей, о котором говорит автор. Легко соблазниться историями об успешных «фабриках без ревью» вроде StrongDM, хотя, по признанию самого автора, публичных подробностей о результатах этого эксперимента почти нет. И легко чрезмерно полагаться на бенчмарки при выборе модели для агентного кодинга: по тезису поста, даже новые «фронтирные» бенчмарки не измеряют способность модели поддерживать качество кода на длинной дистанции.

«У моделей есть изъян: они не умеют поддерживать и улучшать качество кодовой базы со временем, по крайней мере, без изрядной доли человеческого участия.»

— Декс, основатель HumanLayer