Исследователи представили HyperQ: квантовые схемы усилили языковую модель-диффузию

Исследователи представили HyperQ: квантовые схемы усилили языковую модель-диффузию

Исследователи предложили метод HyperQ, способ дообучать языковую модель, добавляя в неё квантовые вычислительные блоки вместо изменения самой модели. Языковые модели можно адаптировать под задачу, меняя вычисления, которые применяются к отдельным токенам; один из способов это сделать, квантовые схемы, но выполнение широких схем внутри большой модели требует много вычислительных ресурсов. HyperQ решает эту проблему, добавляя в каждый блок трансформера токен-обусловленную квантовую остаточную ветвь: модуль, который считывает скрытое состояние токена, определяет координаты его квантовой схемы, выполняет эту схему и добавляет измеренные значения обратно через остаточное соединение. Базовая модель при этом остаётся замороженной (её веса не меняются), обучаются только добавленные ветви. Внутри каждой ветви лёгкая гиперсеть (гиперсеть схем) генерирует для каждого токена углы поворота, силы связи и оси измерения в общей разреженной структуре схемы. Ключевая деталь: нужные ожидаемые значения имеют точное классическое выражение, стоимость вычисления которого растёт линейно с числом кубитов, то есть сами вычисления производятся классически, без выполнения на реальном квантовом компьютере, но это и позволило обучить схемы от 16 до 64 кубитов внутри базовой модели на 1,1 миллиарда параметров. На наборе тестовых задач увеличение ширины схемы с 16 до 64 кубитов подняло средний балл с 47,65 до 54,30. При 64 кубитах HyperQ превзошёл немодифицированную базовую модель на 4,71 балла и её аналог, дообученный методом LoRA (адаптация с низким рангом), на 3,67 балла. При этом HyperQ дообучался всего на 20 000 пар «запрос-ответ», тогда как классические базовые методы (в том числе LoRA-вариант), на 200 000 пар, то есть в десять раз больше. Авторы делают вывод, что генерация квантовой схемы, обусловленная токеном, практически реализуемый архитектурный подход к языковым моделям, дополненным квантовыми вычислениями.

Ключевые факты

  • HyperQ добавляет к замороженной диффузионной языковой модели токен-обусловленные квантовые остаточные ветви, управляемые лёгкой гиперсетью схем; обучаются только эти ветви, базовая модель не меняется
  • Ожидаемые значения квантовых схем считаются по точному классическому выражению с линейной по числу кубитов стоимостью, это позволяет обучать схемы от 16 до 64 кубитов внутри модели на 1,1 млрд параметров без реального квантового оборудования
  • Увеличение ширины схемы с 16 до 64 кубитов подняло средний балл на бенчмарках с 47,65 до 54,30
  • При 64 кубитах HyperQ превосходит немодифицированную базовую модель на 4,71 балла и вариант с LoRA-дообучением, на 3,67 балла
  • HyperQ дообучен на 20 000 парах «запрос-ответ» против 200 000 у классических базовых методов, в десять раз меньше данных при лучшем результате

Почему это важно

Работа предлагает конкретный и относительно дешёвый способ скрестить квантовые вычисления с языковыми моделями: вместо того чтобы перестраивать саму модель или гонять по-настоящему широкие квантовые схемы (что вычислительно накладно), HyperQ пристраивает к замороженной модели небольшие квантовые остаточные ветви, а параметры для них на лету генерирует гиперсеть. Это делает эксперимент с квантовыми схемами внутри модели на миллиард с лишним параметров технически осуществимым, а не только теоретическим.

Кому это важно

В первую очередь, исследователям на стыке квантовых вычислений и обработки языка, а также разработчикам методов эффективного дообучения языковых моделей: HyperQ в статье прямо сравнивается с LoRA как альтернативный способ адаптации модели с минимальным изменением параметров и минимальным объёмом обучающих данных.

Как это применить

Метод устроен как надстройка: берётся уже обученная (замороженная) диффузионная языковая модель, в каждый блок трансформера встраивается квантовая остаточная ветвь с гиперсетью, генерирующей параметры схемы под конкретный токен, и дообучаются только эти добавленные ветви. По данным статьи, для этого нужно на порядок меньше размеченных пар «запрос-ответ» (20 000 против 200 000 у классических методов дообучения), при этом качество на тестовых задачах растёт вместе с шириной схемы (числом кубитов).

Можно ли доверять

Это исследовательская статья, выложенная на HuggingFace Papers; результаты получены на одной базовой модели размером 1,1 миллиарда параметров, а сами вычисления квантовых схем производятся не на реальном квантовом оборудовании, а через точное классическое выражение, то есть речь идёт о моделировании квантовых эффектов классическими средствами, а не о запуске на квантовом компьютере. В тексте не названы ни конкретные бенчмарки, по которым считался средний балл, ни протокол их оценки, ни авторы и организации за пределами имени в карточке публикации, это ограничивает возможность независимо оценить масштаб результата.

Риски и подводные камни

Главное ограничение, отсутствие названия конкретных тестовых задач и деталей протокола оценки, из-за чего цифры 47,65, 54,30 и выигрыш в 4,71/3,67 балла нельзя сопоставить с другими работами напрямую. Метод проверен только на одной модели среднего размера (1,1 млрд параметров); неясно, сохранится ли выигрыш и экономия данных при масштабировании на более крупные модели. Наконец, поскольку квантовая часть выполняется через классическое приближение, а не на реальном квантовом железе, работа демонстрирует архитектурную идею, а не практический выигрыш от использования настоящих квантовых вычислений.