Карпати: Opus 5 написал 5500 строк кода для 3D-сцены «Властелина колец»

Карпати: Opus 5 написал 5500 строк кода для 3D-сцены «Властелина колец»

Известный ИИ-исследователь Карпати решил обновить свой знаменитый тест «нарисуй пеликана на велосипеде», который используют для сравнения возможностей разных моделей. Вместо простого SVG-рисунка он дал модели Opus 5 первый абзац текста «Властелина колец», бюджет в 1 млн токенов (это около 10 долларов) и попросил сделать 3D-визуализацию сцены на JavaScript-библиотеке three.js. Opus 5 работал над задачей около двух часов и написал 5500 строк кода, который процедурно, то есть программно, без готовых 3D-моделей, воссоздал сцену из книги: расставил и анимировал полигональные объекты в трёхмерном пространстве. Результат Карпати описывает как «немного корявый, но забавный»; исходники он выложил в открытый доступ, сцену можно посмотреть и поиграть с ней прямо в браузере на karpathy.ai/lotr-movie/, а также форкнуть код.

Карпати считает такие задачи показательными по двум причинам. Во-первых, ни один человек в здравом уме не стал бы тратить время на настолько кастомную и трудоёмкую работу вручную, а у языковой модели есть, по его словам, «всё терпение и выносливость мира», и для неё такая работа практически бесплатна. Он видит в этом начало нового направления: генерацию гиперкастомных интерактивных миров по запросу, куда можно «подселить» игрока, например, зрителем или одним из персонажей сюжета «Властелина колец», что-то вроде эфемерной GTA на любую тему, создаваемой на лету.

Во-вторых, эксперимент обнажил слабое место современных LLM: модели плохо умеют проверять результат своей же работы в игровых и визуальных средах. У Opus 5 нет возможности естественно и эффективно воспринимать видео или играть в собственную сцену в реальном времени, вместо этого модели пришлось медленно и мучительно делать скриншоты в разные моменты работы, чтобы понять, что получилось. Из-за этого она несколько раз ошибалась, что и объясняет итоговую «корявость» сцены. Карпати называет мультимодальность и способность действовать в игровых средах примером «сырых» возможностей, которых моделям пока сильно не хватает.

Ключевые факты

  • Карпати дал Opus 5 первый абзац «Властелина колец», бюджет 1 млн токенов (~$10) и попросил сделать 3D-визуализацию на three.js
  • Модель работала около двух часов и написала 5500 строк кода, процедурно воссоздав сцену: расставила и анимировала полигональные объекты
  • Результат выложен в открытый доступ, сцену можно посмотреть и поиграть в браузере на karpathy.ai/lotr-movie/, код можно форкнуть
  • Карпати видит в этом расширение теста «пеликан на велосипеде» и путь к генерации гиперкастомных интерактивных миров по запросу
  • Ключевая слабость: модель не может нативно смотреть видео или играть в свою же сцену, пришлось вручную делать скриншоты, из-за чего появились ошибки

Почему это важно

Это расширение знаменитого теста Карпати «нарисуй пеликана на велосипеде», которым сравнивают возможности моделей: вместо простого SVG-рисунка, процедурная генерация целой 3D-сцены с сотнями решений о расстановке и анимации объектов. Эксперимент показывает, что LLM способна на протяжении двух часов удерживать сложную многошаговую задачу и написать связный код на 5500 строк без вмешательства человека.

Кому это важно

Разработчикам игр и интерактивных миров, которые присматриваются к процедурной генерации контента моделями; исследователям, которые изучают пределы агентных возможностей LLM в написании длинного кода; всем, кто следит за подобными неформальными бенчмарками способностей моделей на реальных задачах.

Как это применить

Карпати предлагает направление на будущее: генерировать гиперкастомные интерактивные миры по запросу, например, сцену из книги или фильма, куда можно поместить игрока зрителем или персонажем сюжета, что-то вроде эфемерной GTA на любую тему, создаваемой на лету и почти бесплатно. Сам код и сцена уже выложены в открытый доступ на karpathy.ai/lotr-movie/, где результат можно посмотреть и поиграть в браузере, а исходники, форкнуть.

Можно ли доверять

Источник, собственный твит Карпати, известного ИИ-исследователя (экс-Tesla, экс-OpenAI), с прямой ссылкой на играбельное демо и исходный код, так что результат можно проверить самостоятельно. При этом это неформальный личный эксперимент, а не научная работа или официальный бенчмарк с методологией.

Риски и подводные камни

Главный вывод эксперимента, не про успех, а про слабость: модель не может естественно и эффективно воспринимать видео или играть в собственной 3D-сцене, чтобы проверить, что у неё вообще получилось. Opus 5 пришлось медленно и мучительно делать скриншоты в разные моменты работы, и несколько раз это приводило к ошибкам, отсюда «корявость» итоговой сцены. Карпати называет это примером всё ещё слабых «сырых» мультимодальных и игровых способностей моделей.

«Никто в здравом уме никогда не стал бы тратить время на написание чего-то настолько кастомного, но у языковых моделей есть всё терпение и выносливость мира.»

— Карпати