Import AI 474: разум как платоновский паттерн, TPU Google в космосе и GLM-5.3 для инфраструктуры Zhipu

Import AI 474, выпуск рассылки об исследованиях в области ИИ. В нём разобраны четыре сюжета.
Первый, статья учёного Майкла Левина «Ingressing Minds: Causal, Non-Physical Patterns In-Form Natural, Synthetic, and Hybrid Embodiments» (журнал MDPI). Левин предлагает считать, что отношение между разумом и мозгом, то же, что между математическими паттернами и морфогенетическими результатами, которыми они управляют: «разум относится к телу так же, как математика к физике». Тела (живые, инженерные или гибридные) он описывает как интерфейсы, через которые в физический мир «входит» огромная многоуровневая иерархия паттернов. В «платоновском» пространстве, по Левину, лежат и малоагентные формы вроде фактов о целых числах и геометрических фигурах, и всё более агентные паттерны, часть которых мы называем «видами разума». Автор рассылки отмечает, что убедительных решающих экспериментов в поддержку гипотезы нет, но есть странные явления: ксеноботы (биороботы из клеток лягушки), антроботы (из клеток трахеи человека; вне организма они принимают необычные формы и, например, способны самостоятельно восстанавливать повреждённые нейроны), а также опыты с алгоритмом сортировки. Алгоритм возмущали, в том числе «фиксируя» отдельные ячейки, и он обходил их; в более сложном варианте каждое число запускало свой тип сортировки, и семейства алгоритмов в ходе работы группировались в «пространстве чисел». Левин делает вывод, что и машины, и живые организмы выходят за рамки заданной реализации, потому что оба лишь «указатели/интерфейсы» к паттернам. Автор рассылки добавляет, что возможно и человеческий, и разные типы ИИ-разумов, соседние формы в таком пространстве, а мозг и дата-центры, разные физические системы, на которые падает их «тень».
Второй сюжет, текст Перри Донга (исследователь Стэнфорда) и Челси Финн (профессор Стэнфорда, сооснователь робототехнической компании Physical Intelligence) «Towards Universal Post-Training for Robotics». Для языковых моделей решающим стал общий рецепт дообучения из четырёх шагов: сильная предобученная модель; определение сред и награды (например, моделей предпочтений); RL-оптимизация относительно референсной модели; контроль патологий вроде взлома награды (reward hacking). По словам авторов, робототехника находится почти там же, где были языковые модели: предобучение масштабировалось отлично, не хватает второй половины, обучения на собственном опыте, причём надёжность должна быть ещё выше. Нужен алгоритм дообучения передовых робототехнических моделей, устойчивый на моделях с миллиардами параметров и достаточно экономный по опыту для реального железа, а также стандартные практики: единое определение успеха, способ сброса сцены между попытками, способ дать обратную связь человеком и превратить её в обучение. Свой алгоритм EXPO(-FT) авторы называют ранним и пока малоиспользуемым; он многократно улучшает действия передовой модели с помощью RL и небольших правок от лёгкой политики, а затем встраивает это улучшение в саму модель.
Третий, обновление Google по проекту Suncatcher, анонсированному в прошлом году: компания хочет разместить вычисления в космосе и со временем обучать там ИИ. Google вместе с партнёром Planet готовится отправить часть чипов на рейсе SpaceX Transporter-18 (rideshare, попутный запуск). Чипы проверяли на перегрузки при запуске и на радиацию: по словам Google, TPU Trillium «хорошо держатся» и выдерживают суммарную поглощённую дозу, большую, чем получат за пятилетнюю космическую миссию. Сейчас Google работает над охлаждением в космосе, автор рассылки считает это вероятной проблемой, поскольку чипы сильно греются, а отводить тепло в вакууме очень трудно. Сам автор рассылки считает весьма вероятным, что человечество очень быстро перенесёт на орбиту большой объём вычислений.
Четвёртый, пост китайской компании Zhipu AI, создателя GLM-5.3, одной из самых сильных открытых моделей, о том, как она использовала собственные модели для работы над инфраструктурой при запуске быстрой и дешёвой версии GLM-5.3 Flash. Описан контур оптимизации из инженеров, Infra Agent (инфраструктурного агента) и экспериментальной среды: инженеры задавали цели и границы системы, агент занимался анализом, гипотезами и правками кода, среда давала многоуровневую, своевременную и проверяемую обратную связь. Значительная часть работы выполнена агентом на базе GLM-5.3. По словам Zhipu, от первичной адаптации модели до готовности к промышленной эксплуатации GLM-5.3-Flash дошла менее чем за две недели, а сквозная пропускная способность выросла втрое относительно исходного уровня. Одним из советов Zhipu для таких систем названо требование, чтобы обратная связь была достаточно локальной: привязанной к конкретным параметрам запуска движка, правкам кода, ядрам, входным условиям, потокам, интервалам выполнения или путям кода, чтобы агент сужал область поиска проблемы. Остальные советы в доступной части текста не приведены.
Ключевые факты
- Майкл Левин предлагает считать разум паттерном из «платоновского пространства», а тела, живые, инженерные и гибридные, интерфейсами для него: «разум относится к телу так же, как математика к физике»; решающих экспериментов нет, есть лишь странные явления (ксеноботы, антроботы, возмущённые алгоритмы сортировки).
- Перри Донг и Челси Финн из Стэнфорда считают, что робототехнике нужен универсальный рецепт дообучения, как у языковых моделей (четыре шага), и представляют ранний алгоритм EXPO(-FT).
- Google вместе с Planet готовится отправить часть чипов в космос на рейсе SpaceX Transporter-18; TPU Trillium, по словам Google, выдерживают радиацию пятилетней миссии, над охлаждением в космосе компания ещё работает.
- Zhipu AI сообщила, что агент на базе GLM-5.3 выполнил значительную часть работы по запуску GLM-5.3 Flash: менее двух недель от адаптации до готовности к эксплуатации и втрое выросшая сквозная пропускная способность относительно исходного уровня.
Почему это важно
Выпуск собирает четыре разных линии, которые сходятся в вопросе о том, куда движется ИИ. Левин предлагает необычную рамку для разговора о природе разума, в том числе машинного, и автор рассылки видит в ней ключ к вопросам философии и согласования целей ИИ. Донг и Финн ставят диагноз робототехнике: предобучение уже масштабировалось, а стандартного рецепта дообучения на собственном опыте ещё нет. Google и Zhipu показывают практические шаги: вычисления выходят на орбиту, а ИИ-лаборатории ускоряют собственную работу с помощью создаваемых моделей. Zhipu подаёт это как сокращение срока запуска GLM-5.3 Flash до менее чем двух недель.
Кому это важно
Исследователям философии разума и биологии, как необычная гипотеза с описанными примерами. Робототехникам и командам, дообучающим модели на реальном железе, формулировка того, чего не хватает в отрасли. Тем, кто следит за ИИ-инфраструктурой и энергетикой вычислений, проект Suncatcher. Инженерам, строящим агентные системы для разработки и оптимизации, описание контура «инженеры, агент, экспериментальная среда» и совет про локальную обратную связь от Zhipu.
Как это применить
Прямых инструкций в выпуске немного. Из текста Zhipu можно взять принцип: распределить роли так, чтобы люди задавали цели и границы, агент вёл анализ, гипотезы и правки кода, а среда возвращала многоуровневую, своевременную и проверяемую обратную связь. Обратная связь должна быть локальной, привязанной к параметрам запуска, правкам кода, ядрам, входным условиям, потокам, интервалам выполнения или путям кода, чтобы агент сужал область проблемы. Для робототехники Донг и Финн перечисляют, что стоит стандартизировать: определение успеха, сброс сцены между попытками, способ обратной связи от человека. Остальные части, идеи для размышления, а не готовые рецепты.
Можно ли доверять
Это обзорная рассылка: пересказ чужих материалов с комментариями автора, имя которого в доступном тексте не указано. Оценки вроде «весьма вероятно, что вычисления быстро переедут на орбиту», мнение автора рассылки. Цифры Zhipu (менее двух недель, утроение пропускной способности) приведены из её собственного поста, без абсолютных значений пропускной способности и без независимой проверки. Формулировка «внешний контур рекурсивного самоулучшения» в подзаголовке, оценка рассылки: в цитируемом тексте Zhipu речь идёт об инженерах, агенте и экспериментальной среде, а не об автономном самоулучшении. Гипотеза Левина, по признанию самого автора рассылки, не подкреплена решающими экспериментами. Фрагмент про Zhipu в доступном тексте оборван, часть советов не видна.
Риски и подводные камни
Идея платоновского пространства паттернов остаётся философской гипотезой: примеры из опытов с клетками и алгоритмами сортировки пока лишь «странные явления», а не доказательства. Алгоритм EXPO(-FT), по словам авторов, ранний и пока мало используется, так что рано считать его кандидатом в универсальный рецепт. В космическом проекте Google охлаждение названо вероятной трудностью, а результатов этой работы в тексте нет; не названы ни дата запуска Transporter-18, ни число отправляемых TPU. Утроение пропускной способности у Zhipu измерено относительно исходной версии, а не относительно других систем, так что сравнивать его с чужими результатами нельзя.
«Разум относится к телу так же, как математика к физике.»
— Майкл Левин, статья «Ingressing Minds: Causal, Non-Physical Patterns In-Form Natural, Synthetic, and Hybrid Embodiments»