Пять стартапов ищут замену трансформерам в основе ИИ-моделей

Пять стартапов ищут замену трансформерам в основе ИИ-моделей

В 2017 году исследователи Google опубликовали статью «Attention Is All You Need», описавшую архитектуру трансформера. Девять лет спустя на трансформерах работают все крупные языковые модели рынка. Но их ключевой механизм, плотное внимание (dense attention), которое сравнивает каждое слово текста с каждым другим, плохо масштабируется: документ в 10 000 слов может потребовать от трансформера около 50 миллионов операций умножения. Именно поэтому LLM потребляют так много энергии: по словам президента OpenAI Грега Брокмана, в этом году компания потратит на вычисления $50 млрд, а Международное энергетическое агентство прогнозирует, что суммарное потребление электроэнергии дата-центрами удвоится к 2030 году. Трансформеры также плохо справляются с удержанием больших объёмов контекста, а именно это требуется моделям-рассуждателям, которые ведут «черновик» рассуждений (chain of thought), и агентам, обрабатывающим вывод других моделей. MIT Technology Review собрал пять стартапов, которые предлагают разные способы обойти это ограничение.

Subquadratic (Майами) во главе с сооснователем и CEO Джастином Дэнджелом называет трансформеры «одним из важнейших изобретений в истории computer science». Компания утверждает, что создала первый механизм разреженного внимания (sparse attention), модель SubQ, который не уступает ведущим LLM на ряде задач, включая поиск и написание кода. В отличие от плотного внимания, разреженное считает не все пары слов, а только часть. По словам компании, на модель уже записались тысячи желающих, и её планируют сделать широко доступной в ближайшее время; часть индустрии относится к заявлению скептически.

Manifest AI (Сан-Франциско) во главе с сооснователем и техническим директором Карлесом Желадой идёт другим путём: вместо изменения механизма внимания компания заменяет его целиком техникой power retention. Модель хранит не всю историю контекста, а скользящее резюме самого важного, отбрасывая менее релевантную информацию по мере поступления новой (в отличие от разреженного внимания, которое всё же удерживает общую картину всего увиденного). Manifest AI утверждает, что довела старую идею retention до уровня, при котором она впервые способна конкурировать с трансформерными LLM, и что трансформерную модель можно превратить в power-retention-модель с минимальным дообучением: так открытая модель StarCoder превратилась в PowerCoder. Компания также выпустила модель Brumby, которая, по её заявлению, соперничает с некоторыми версиями Qwen от Alibaba. По словам Желады, у технологии много применений, от анализа многочасовых видео до агентов, способных неделями работать над одной задачей.

Liquid AI, спин-офф MIT из Кембриджа (Массачусетс) во главе с сооснователем и CEO Рамином Хасани, не отказывается от трансформеров полностью, а сочетает их с собственной технологией, «жидкими» нейросетями (liquid neural networks), получая то, что компания называет LFM (liquid foundation models). Такие сети, развитие свёрточных сетей, вдохновлённое устройством мозга червя; их ключевое отличие в том, что модель может подстраивать поведение под новую информацию уже после обучения, чего трансформеры не умеют. Модели Liquid AI заметно меньше и экономичнее большинства LLM: компания делает их для автопроизводителей, включая Mercedes, для работы на маломощных чипах внутри машин, а последние версии запускаются даже на Raspberry Pi, компьютере за $50. Модели бесплатны для организаций с годовой выручкой ниже $10 млн и уже скачаны почти 34 млн раз. Новые гибридные LFM на 20% состоят из трансформеров и на 80%, из «жидких» сетей; по соотношению производительности они соответствуют моделям вчетверо крупнее, включая версии Qwen от Alibaba и Gemma от Google. Пропорцию 20/80 подобрала отдельная ИИ-система самой Liquid AI, которая перебирает разные комбинации типов сетей и ищет баланс между качеством и эффективностью. Хасани сравнивает это с мозгом человека: «Ваш мозг, это система AGI, и она работает при мощности 20 ватт. Как это возможно? Мы можем быть гораздо изобретательнее».

Inception (Пало-Альто) во главе с сооснователем и CEO Стефано Эрмоном, который также работает исследователем в Стэнфорде, использует диффузию, технологию, знакомую по генерации изображений и видео. Диффузионные модели учатся превращать случайный «шум» в осмысленный результат, обрабатывая сразу весь массив данных, а не один элемент за другим; Inception перенесла этот принцип на текст, обучая модели превращать случайный набор слов в связные предложения, трансформеры при этом по-прежнему используются для кодирования смысла, но работают эффективнее, потому что предсказывают сразу много токенов. В 2024 году Эрмон с двумя коллегами по Стэнфорду вывел математику, позволившую диффузионным моделям работать с текстом, и построил модель, которая по качеству сравнялась с GPT-2 (моделью OpenAI 2019 года), но работала в 10 раз быстрее, на этой основе и возникла компания. Последняя модель Inception, Mercury 2, по заявлению компании, не уступает некоторым моделям GPT-4 (OpenAI, 2023 год), но снова работает в 10 раз быстрее. Google тоже экспериментирует с диффузией и построил прототип Diffusion Gemma, но Эрмона это не тревожит: по его словам, это лишь подтверждает правоту подхода.

Pathway (Пало-Альто), самый радикальный из перечисленных стартапов: он пытается освободить LLM от привязки к языку как таковому. Компания построила модель Dragon Hatchling, названную в честь драконов из романа Терри Пратчетта «Цвет волшебства», которые материализуются, если о них достаточно долго думать. Главный результат модели на сегодня, тест на бенчмарке из более чем 250 000 очень сложных судоку: Dragon Hatchling решила больше 97% головоломок, тогда как несколько ведущих LLM от крупных лабораторий не решили ни одной.

Ключевые факты

  • Subquadratic (Майами) утверждает, что создала первый механизм разреженного внимания (SubQ), не уступающий ведущим LLM в поиске и коде; на модель записались тысячи желающих, но часть индустрии относится к заявлению скептически.
  • Manifest AI (Сан-Франциско) заменяет внимание техникой power retention, скользящим резюме контекста вместо полной истории; на её основе созданы PowerCoder (из открытой StarCoder) и Brumby, которая, по заявлению компании, соперничает с некоторыми версиями Qwen от Alibaba.
  • Liquid AI, спин-офф MIT, сочетает трансформеры с «жидкими» нейросетями: гибридные модели LFM на 20% состоят из трансформеров и на 80%, из liquid-сетей, по качеству соответствуют моделям вчетверо крупнее (версии Qwen и Gemma), скачаны почти 34 млн раз и бесплатны для организаций с выручкой ниже $10 млн в год.
  • Inception (Пало-Альто) генерирует текст диффузией, целыми блоками сразу, а не по слову; модель Mercury 2, по заявлению компании, не уступает некоторым моделям GPT-4 от OpenAI, но работает в 10 раз быстрее.
  • Pathway построила модель Dragon Hatchling, которая решила более 97% из свыше 250 000 очень сложных судоку в бенчмарке, тогда как несколько ведущих LLM от крупных лабораторий не решили ни одной.

Почему это важно

Плотное внимание, механизм, на котором работают все современные трансформеры, требует сравнивать каждое слово текста с каждым другим, и вычислительная нагрузка растёт вместе с длиной текста: документ в 10 000 слов может потребовать около 50 млн операций умножения. Это одна из причин, по которой LLM потребляют столько энергии: OpenAI, по словам президента компании Грега Брокмана, потратит на вычисления $50 млрд в этом году, а IEA прогнозирует удвоение потребления электроэнергии дата-центрами к 2030 году. Одновременно трансформеры плохо держат большие объёмы контекста, а модели-рассуждатели и ИИ-агенты требуют именно этого. Поэтому индустрия ищет архитектуру, которая унаследует сильные стороны трансформера, но снимет эти ограничения.

Кому это важно

Прежде всего, компаниям, которые платят за вычисления: чем дешевле и быстрее модель обрабатывает текст, тем ниже счёт за инфраструктуру. Разработчикам, которые строят агентов и системы с длинным контекстом (обработка целых кодовых баз, многочасовых видео, длинных цепочек рассуждений), упирается именно в ограничения трансформеров. Компаниям с жёсткими ограничениями по железу, как автопроизводители, для которых Liquid AI делает компактные модели, работающие на маломощных чипах внутри машины или даже на Raspberry Pi.

Как это применить

Часть технологий уже доступна на практике. Модели Liquid AI бесплатны для организаций с годовой выручкой ниже $10 млн и запускаются на дешёвом железе вроде Raspberry Pi за $50. Manifest AI показала путь миграции: открытую модель StarCoder превратили в PowerCoder на технологии power retention с минимальным дообучением, а не с нуля. У Subquadratic пока можно только записаться в лист ожидания на модель SubQ, компания говорит о скором широком релизе, но конкретной даты источник не называет. Inception и Pathway (Mercury 2 и Dragon Hatchling) на данный момент, это заявленные результаты компаний, а не открытые продукты с понятными условиями доступа.

Можно ли доверять

Все ключевые цифры в материале, заявления самих компаний в интервью MIT Technology Review, а не независимо проверенные результаты: издание прямо отмечает, что заявление Subquadratic о превосходстве разреженного внимания вызывает скепсис у части индустрии, но не называет, кто именно и на основании чего сомневается. Источник не приводит ни независимой проверки заявленных бенчмарков, ни дат основания стартапов, ни сумм их финансирования, судить о зрелости и устойчивости этих компаний по одному материалу нельзя.

Риски и подводные камни

Сам материал признаёт: часть из этих стартапов, скорее всего, не выживет, у них меньше ресурсов и опыта, чем у лидеров рынка, хотя и меньше терять. Заявленные результаты (превосходство SubQ, соперничество Brumby с Qwen, скорость Mercury 2 относительно GPT-4) пока не подкреплены независимыми тестами и приведены со слов самих компаний. Экосистема трансформеров складывалась девять лет, вокруг неё построена вся современная инфраструктура и инструментарий, и новой архитектуре придётся конкурировать не только качеством, но и с этим накопленным преимуществом.

«В конечном счёте всё будет измеряться одной величиной, интеллектом на доллар.»

— Стефано Эрмон, сооснователь и CEO Inception