BITCOS снизил стоимость хранения тернарных LLM ниже 1,585 бита

Тернарные большие языковые модели хранят каждый вес как одно из трёх значений: -1, 0 или +1. Стоимость такого веса принято сравнивать с информационно-теоретическим ориентиром log2(3) ≈ 1,585 бита. Но формат, который реально используют для развёртывания, упаковка пяти тернарных весов в один байт («five-trit packing»), из-за округления до степени двойки в размерах групп даёт не 1,585, а 1,625 бита на вес. Этот формат исходит из того, что все три символа равновероятны.

Авторы статьи, поданной на arXiv 14 сентября 2026 года, измерили реальное распределение весов в 29 тернарных LLM и обнаружили, что нули составляют до 51,5% всех весов, то есть предположение о равной вероятности не соответствует действительности. На этом основании они предложили BITCOS: адаптивный к распределению формат хранения, состоящий из плотной битовой карты «есть вес / нет веса» плюс сжатого вектора знаков для ненулевых значений. Стоимость такого хранения, 2 − z бита на вес, где z, доля нулей в весах конкретной модели.

На 26 из 29 протестированных моделей BITCOS хранит веса компактнее, чем упаковка пяти тритов, а на самой разреженной модели опускается до 1,485 бита на вес, ниже теоретического ориентира в 1,585 бита, рассчитанного для равновероятных символов. Авторы также подготовили оптимизированные процедуры распаковки для наборов инструкций AVX-512 и AVX2, а также для GPU на архитектуре Intel Xe2. В сравнении с современными промышленными реализациями тернарного умножения матрицы на вектор реальный выигрыш от нового формата при типичной для реальных моделей разреженности достигает 1,28 раза.

Сквозные замеры инференса LLM провели на пяти разных платформах, клиентских и серверных процессорах, а также встроенных и дискретных GPU Xe2. Пропускная способность генерации токенов выросла до 1,18 раза на процессорах и до 1,27 раза на GPU. В карточке подачи на arXiv значится Эвангелос Георганас как автор, от чьего имени отправлена статья; полный список соавторов на видимой странице не приведён.

Ключевые факты

  • Тернарные LLM хранят веса как -1/0/+1; теоретический ориентир стоимости, 1,585 бита на вес (log2 3), но реально используемая упаковка пяти тритов в байт из-за округления даёт 1,625 бита и предполагает равновероятность всех трёх символов
  • Измерение 29 тернарных моделей показало, что нули составляют до 51,5% всех весов, предположение о равновероятности не выполняется
  • Новый формат BITCOS (битовая карта присутствия + сжатый вектор знаков) стоит 2 − z бита на вес, где z, доля нулей; он компактнее упаковки пяти тритов на 26 из 29 моделей и доходит до 1,485 бита на самой разреженной
  • Оптимизированная распаковка для AVX-512, AVX2 и GPU Intel Xe2 даёт до 1,28 раза выигрыша в скорости тернарного умножения матрицы на вектор против промышленных SOTA-ядер
  • На сквозном инференсе на 5 платформах пропускная способность генерации выросла до 1,18 раза на процессорах и до 1,27 раза на GPU

Почему это важно

Способ упаковки весов тернарных моделей до сих пор считался почти решённым: раз символов три, стоимость веса привязывали к log2(3) ≈ 1,585 бита, а на практике мирились с 1,625 бита из-за упаковки пяти тритов в байт. Работа показывает, что сам ориентир был неверным допущением, реальные модели далеко не равновероятны по символам, среди весов до 51,5% нулей. Учтя это, авторы опускают стоимость хранения ниже теоретического предела, рассчитанного для равновероятных символов, на самой разреженной из проверенных моделей до 1,485 бита на вес.

Кому это важно

Тем, кто обучает и разворачивает тернарные (1-битные/1,58-битные) модели вроде BitNet-подобных архитектур, и инженерам, которые пишут инференс-движки для процессоров и GPU: формат хранения весов напрямую определяет объём памяти и скорость матричных операций при инференсе.

Как это применить

BITCOS, прямая замена упаковки пяти тритов: вместо фиксированной схемы кодирования он хранит битовую карту, где есть ненулевой вес, и отдельно сжатый вектор знаков для этих весов; итоговая стоимость 2 − z бита на вес автоматически подстраивается под разреженность конкретной модели. Авторы приложили готовые оптимизированные процедуры распаковки под инструкции AVX-512, AVX2 и GPU на Intel Xe2, так что выигрыш, до 1,28 раза на ядрах тернарного умножения матрицы на вектор и до 1,18, 1,27 раза на сквозном инференсе, достижим без переобучения модели, только заменой формата хранения весов.

Можно ли доверять

Источник, препринт на arXiv, поданный 14 сентября 2026 года; рецензирования и публикации в издании/на конференции пока нет, полный список авторов на видимой странице не указан (значится только Эвангелос Георганас как автор, от чьего имени отправлена статья). Заявленные цифры проверены не на одной модели, а на 29 реальных тернарных LLM, и сквозной эффект замерен на пяти разных аппаратных платформах, это шире типичного лабораторного бенчмарка на одной конфигурации.

Риски и подводные камни

Выигрыш получен не на всех моделях: BITCOS компактнее упаковки пяти тритов на 26 из 29 моделей, то есть на трёх моделях (видимо, с низкой долей нулей) выгоды нет, накладные расходы битовой карты присутствия окупаются только при достаточной разреженности весов. Итоговый эффект, величина «до», зависящая от конкретной доли нулей в конкретной модели, а не гарантированный результат. Абсолютных цифр по памяти в мегабайтах или по времени в секундах источник не приводит, только относительные показатели в битах на вес и множители ускорения.