NCP-ArchPreview сравнялась с OLMo-3-7B, потратив всего 51% токенов

Авторы представляют NCP-ArchPreview, языковую модель, которая наряду с привычным предсказанием следующего токена (next-token prediction, NTP) обучается предсказывать ещё и следующий «концепт» (Next Concept Prediction, NCP), дискретную единицу, которая охватывает сразу несколько токенов. Словарь концептов строится прямо из скрытых представлений (hidden states) самой модели методом квантования векторов (product quantization); отдельный «модуль концептов» (Concept Module) учится предсказывать будущие концепты, а предсказанные концепты возвращаются на уровень токенов и направляют дальнейшую генерацию текста. NTP и NCP при этом обучаются совместно и сквозным образом, одной и той же моделью.
Архитектуру масштабировали до 8,9 млрд параметров и обучили на 5,73 трлн токенов из датасета Dolma-3, по словам авторов, это крупнейшая на сегодняшний день демонстрация латентной языковой модели.
Главный результат, по эффективности использования токенов: потратив всего 51,3% от общего числа своих обучающих токенов, NCP-ArchPreview выходит на то же итоговое значение функции потерь на предобучении, которого модель OLMo-3-7B достигает только по завершении полного цикла обучения. Когда NCP-ArchPreview тоже проходит предобучение полностью, она обгоняет OLMo-3-7B на 2,45 балла по усреднённому показателю на прикладных тестах (downstream macro-average), включая отдельный прирост в 5,99 балла на математическом тесте GSM8K, это крупнейший из названных вкладов в общий результат; абсолютных баллов ни одной из двух моделей источник не приводит, только эту разницу. По словам авторов, контролируемые эксперименты показывают, что прирост складывается из двух источников, самой латентной архитектуры и обучающей цели NCP, а не из какого-то одного из них. Отдельно авторы сообщают: используя лишь 85% стандартного объёма вычислений, NCP-ArchPreview приближается к значению потерь модели-ориентира того же размера (8,9 млрд параметров, но без NCP), не сказано, что доходит до него полностью. Источник не поясняет, относительно чего именно считаются эти 51,3% и 85%, то есть какой именно объём токенов или вычислений принят за 100%.
По словам авторов, латентное пространство модели остаётся полезным и после окончания предобучения, для двух вещей. Во-первых, для адаптации под новый домен достаточно дообучить только модуль векторного квантования (VQ) размером 17 млн параметров, не трогая всю остальную сеть, это даёт лёгкий интерфейс адаптации. Во-вторых, если добавить представления концептов в черновую модель (drafter) DFlash2, которая используется для ускорения генерации методом спекулятивного декодирования, средняя длина принятых токенов, ключевая метрика именно этого метода, растёт на 4,17%; источник отдельно уточняет, что дополнительная вычислительная нагрузка при этом есть, но она незначительна, то есть не равна нулю.
Ключевые факты
- NCP-ArchPreview, латентная языковая модель на 8,9 млрд параметров, обученная на 5,73 трлн токенов датасета Dolma-3; по словам авторов, это крупнейшая на сегодня демонстрация такой архитектуры.
- Помимо предсказания следующего токена (NTP) модель обучается предсказывать следующий «концепт» (NCP), единицу, охватывающую сразу несколько токенов; словарь концептов строится квантованием (product quantization) собственных скрытых представлений модели, а отдельный модуль концептов (Concept Module) предсказывает будущие концепты и возвращает их на уровень токенов.
- Потратив всего 51,3% своих обучающих токенов, модель выходит на то же итоговое значение потерь предобучения, которого OLMo-3-7B достигает лишь после полного цикла обучения; источник не поясняет, от какой базы считаются эти 51,3%.
- После полного предобучения NCP-ArchPreview обгоняет OLMo-3-7B на 2,45 балла в среднем по прикладным тестам, включая 5,99 балла на GSM8K (абсолютных баллов источник не приводит); используя 85% стандартных вычислений, она лишь приближается к потерям параметрически выровненного базового варианта без NCP.
- После обучения дообучение всего 17-миллионного модуля векторного квантования даёт лёгкий способ адаптации под новый домен, а добавление представлений концептов в черновую модель (drafter) DFlash2 повышает среднюю длину принятых токенов при спекулятивном декодировании на 4,17% при небольшой, но не нулевой, дополнительной нагрузке.
Почему это важно
Почти все крупные языковые модели сегодня предобучаются одним и тем же способом, предсказанием следующего токена. NCP-ArchPreview проверяет альтернативу сразу в большом масштабе, 8,9 млрд параметров, 5,73 трлн токенов, по словам авторов, крупнейшая на сегодня демонстрация латентной языковой модели: добавить вторую, более крупную единицу предсказания, «концепт», охватывающий сразу несколько токенов, и обучать обе цели совместно. Эффект не абстрактный: чтобы выйти на то же итоговое значение потерь предобучения, которого достигает OLMo-3-7B, модели требуется только 51,3% токенов, а после полного цикла обучения она обгоняет OLMo-3-7B на прикладных тестах на 2,45 балла в среднем и на 5,99 балла на GSM8K. По словам авторов, контролируемые эксперименты показывают, что прирост дают одновременно и латентная архитектура, и цель NCP, а не что-то одно из двух, то есть результат не сводится к побочному эффекту масштаба или удачных гиперпараметров.
Кому это важно
В первую очередь, исследовательским командам, которые проектируют архитектуры и цели предобучения для больших языковых моделей и считают каждый процент экономии токенов и вычислений: результат напрямую отвечает на вопрос «можно ли обучить модель того же качества дешевле». Во вторую очередь, инженерам, которые адаптируют готовые предобученные модели под новый домен: авторы показывают, что для этого можно дообучить не всю сеть, а только 17-миллионный модуль векторного квантования. В третью очередь, тем, кто ускоряет инференс методом спекулятивного декодирования: рост средней длины принятых токенов на 4,17% при добавлении концептуальных представлений в черновую модель (drafter), конкретный, измеримый способ ускорить генерацию почти бесплатно. Массового пользователя LLM-продуктов материал не касается напрямую: это исследовательский технический отчёт, а не анонс продукта или релиз весов модели.
Как это применить
Использовать саму модель NCP-ArchPreview сегодня не получится: источник не сообщает ни о дате релиза, ни о публикации кода, ни о доступности весов модели, это отчёт об архитектуре и экспериментах, а не готовый к использованию релиз. Из работы можно перенести две идеи. Первая, для доменной адаптации предобученной модели с похожей латентной архитектурой не обязательно дообучать всю сеть: авторы дообучают только модуль векторного квантования (17 млн параметров) и получают рабочий интерфейс адаптации. Вторая, для ускорения инференса методом спекулятивного декодирования можно попробовать добавить в черновую модель (drafter) представления концептов из основной модели: в эксперименте с DFlash2 это подняло среднюю длину принятых токенов на 4,17% при небольшой, но не нулевой, дополнительной вычислительной нагрузке.
Можно ли доверять
Источник, аннотация технического отчёта на странице Hugging Face Papers; номер (2609.10715) имеет формат, характерный для идентификаторов arXiv, то есть это, по всей видимости, препринт без независимого рецензирования на момент публикации. На странице отчёта в поле «автор» указано «NCP Team»; сама аннотация при этом не называет ни одного человека и ни одной организации, стоящей за работой, оценить репутацию и опыт команды по тексту нельзя. Ключевые цифры, 51,3% токенов, 2,45 и 5,99 балла прироста, 85% вычислений, 4,17%, это самоотчёт авторов: источник не приводит абсолютных баллов OLMo-3-7B или NCP-ArchPreview ни по одному из тестов, только разницу, и не поясняет, относительно чего считаются проценты токенов и вычислений. На странице отчёта, 91 голос и всего 1 комментарий, то есть независимого обсуждения результатов пока почти не было. В плюс работе, то, что часть выводов подкреплена контролируемыми экспериментами (авторы отдельно проверяют вклад архитектуры и вклад цели NCP), а не только одним финальным числом.
Риски и подводные камни
Главный риск для интерпретации цифр, непрозрачность базы: 51,3% токенов и 85% вычислений посчитаны от величины, которую источник не называет, поэтому нельзя проверить, идёт ли сравнение с OLMo-3-7B и с параметрически выровненным базовым вариантом на действительно равных условиях. Формулировка про 85% вычислений, «приближается», а не «достигает»: модель подходит близко к потерям базового варианта без NCP, но не сказано, что выходит на то же значение. Абсолютных баллов на прикладных тестах и на GSM8K источник не даёт ни для одной из моделей, только разницу в 2,45 и 5,99 балла, поэтому по одному этому отчёту нельзя понять, о сильных или о посредственных по абсолютному уровню моделях вообще идёт речь. Заявка «крупнейшая демонстрация латентной языковой модели» не подкреплена прямым сравнением с другими латентными языковыми моделями, источник сравнивает NCP-ArchPreview только с OLMo-3-7B (обычной, не латентной моделью) и с собственным параметрически выровненным базовым вариантом, а не с прежними попытками построить латентную языковую модель. И последнее: сами авторы называют модель ArchPreview, «превью» архитектуры, а не финальной версией, и это стоит держать в уме при переносе результатов на будущие, вероятно изменённые варианты.