Наивный Байес не уступает LLM в классификации текста с разметкой

Исследователи сравнили классический алгоритм Complement Naive Bayes (наивный Байес) с LLM в режиме zero-shot и few-shot на задачах классификации текста. В бенчмарке участвовали модели четырёх семейств с разбросом масштаба в 37 раз, от 27 млрд параметров до модели-эксперта на 1 трлн параметров (mixture-of-experts).

Без размеченных данных (zero-shot) LLM действительно сильнее: на задаче определения тональности отзывов Amazon Polarity точность LLM, 98,0% против 88,2% у наивного Байеса. Но авторы отмечают, что это преимущество может быть искажено утечкой данных в обучающую выборку модели (contamination): на другой, менее подверженной такой утечке задаче определения тональности наивный Байес обошёл ту же LLM в zero-shot-режиме, 81,7% против 73,0%.

Как только размеченные данные становятся доступны, картина меняется. На датасете тематической классификации новостей AG News наивный Байес достигает точности 89,1%, статистически неотличимо от zero-shot LLM на 27 млрд параметров (89,0%) и выше, чем у топовой модели на 397 млрд параметров (84,8%). Дообученная (fine-tuned) модель DistilBERT показывает точность 90,6%, но её пропускная способность при этом намного ниже, чем у наивного Байеса даже при обработке по одному примеру за раз.

По скорости разрыв ещё заметнее: по замерам авторов, батчевый инференс небольших LLM на GPU в 40, 486 раз медленнее инференса наивного Байеса на обычном CPU (множитель сильно зависит от конкретного процессора), а энергии на один обработанный пример наивный Байес тратит примерно на два порядка величины меньше.

Вывод авторов: для инженеров с ограниченными вычислительными ресурсами, у которых есть размеченные данные для классификации текста, наивный Байес остаётся оптимальным выбором. При этом граница выбора зависит от задачи: для тематической классификации наивный Байес догоняет LLM по точности примерно при 10 тысячах размеченных примеров, а вот в задачах определения тональности без разметки LLM выигрывает при любом протестированном объёме данных. Авторы также выпустили Helm-оператор для Kubernetes, который автоматизирует выбор между наивным Байесом и LLM по настраиваемым порогам на основе метрик Prometheus.

Ключевые факты

  • На датасете AG News (с разметкой) наивный Байес даёт 89,1% точности, на уровне zero-shot LLM на 27 млрд параметров (89,0%) и выше топовой модели на 397 млрд параметров (84,8%)
  • Без разметки (zero-shot) LLM обычно сильнее (98,0% против 88,2% на Amazon Polarity), но на задаче с меньшей утечкой данных наивный Байес обошёл LLM, 81,7% против 73,0%
  • Батчевый инференс небольших LLM на GPU в 40, 486 раз медленнее инференса наивного Байеса на CPU, энергии на пример уходит примерно на два порядка меньше
  • На AG News дообученный DistilBERT даёт точность выше остальных (90,6%), но заметно уступает наивному Байесу в пропускной способности
  • Наивный Байес догоняет LLM по точности примерно при 10 тысячах размеченных примеров для тематической классификации; авторы выпустили Helm-оператор для Kubernetes, автоматизирующий выбор модели

Почему это важно

Работа отвечает на вопрос, который в эпоху LLM звучит регулярно: стоит ли списывать классические алгоритмы вроде наивного Байеса. Прямое измерение точности, скорости и энергопотребления на одинаковых задачах показывает, что при наличии размеченных данных простой и дешёвый метод сопоставим по качеству с моделями на порядки большего размера, вопреки распространённому нарративу о безусловном превосходстве LLM.

Кому это важно

Прежде всего инженерам и исследователям, которые строят пайплайны классификации текста в условиях ограниченных вычислительных ресурсов (HPC-практикам, как их называют авторы), там, где важны и стоимость инференса, и энергопотребление, а не только точность модели.

Как это применить

Если задача, классификация с уже размеченными данными (от примерно 10 тысяч примеров и больше для тематической классификации), наивный Байес на CPU даёт сравнимую точность при кратно меньших затратах на инференс. Если размеченных данных нет и задача близка к определению тональности, эффективнее выбор в пользу zero-shot LLM. Авторы предлагают Helm-оператор для Kubernetes, который делает этот выбор автоматически по настраиваемым порогам и метрикам Prometheus.

Можно ли доверять

Текст даёт конкретную методологию и числа, сравнение на нескольких датасетах, диапазон масштабов моделей, отдельные замеры пропускной способности и энергии. При этом в доступном тексте не указаны имена авторов, их институциональная принадлежность, площадка публикации и статус рецензирования, материал стоит воспринимать как препринт, а не как рецензированную публикацию.

Риски и подводные камни

Авторы прямо указывают, что часть преимущества LLM в zero-shot-режиме может объясняться утечкой тестовых данных в обучающую выборку модели (contamination), а не реальным превосходством в понимании задачи. Вывод в пользу наивного Байеса справедлив не универсально, а только там, где размеченные данные уже есть и задача, классификация по темам; для определения тональности без разметки авторы фиксируют обратную картину. Указанный разброс в скорости инференса (40, 486 раз) сильно зависит от конкретного процессора, поэтому конкретную цифру для своего оборудования стоит проверять отдельно.