Наивный Байес не уступает LLM в классификации текста с разметкой
Исследователи сравнили классический алгоритм Complement Naive Bayes (наивный Байес) с LLM в режиме zero-shot и few-shot на задачах классификации текста. В бенчмарке участвовали модели четырёх семейств с разбросом масштаба в 37 раз, от 27 млрд параметров до модели-эксперта на 1 трлн параметров (mixture-of-experts).
Без размеченных данных (zero-shot) LLM действительно сильнее: на задаче определения тональности отзывов Amazon Polarity точность LLM, 98,0% против 88,2% у наивного Байеса. Но авторы отмечают, что это преимущество может быть искажено утечкой данных в обучающую выборку модели (contamination): на другой, менее подверженной такой утечке задаче определения тональности наивный Байес обошёл ту же LLM в zero-shot-режиме, 81,7% против 73,0%.
Как только размеченные данные становятся доступны, картина меняется. На датасете тематической классификации новостей AG News наивный Байес достигает точности 89,1%, статистически неотличимо от zero-shot LLM на 27 млрд параметров (89,0%) и выше, чем у топовой модели на 397 млрд параметров (84,8%). Дообученная (fine-tuned) модель DistilBERT показывает точность 90,6%, но её пропускная способность при этом намного ниже, чем у наивного Байеса даже при обработке по одному примеру за раз.
По скорости разрыв ещё заметнее: по замерам авторов, батчевый инференс небольших LLM на GPU в 40, 486 раз медленнее инференса наивного Байеса на обычном CPU (множитель сильно зависит от конкретного процессора), а энергии на один обработанный пример наивный Байес тратит примерно на два порядка величины меньше.
Вывод авторов: для инженеров с ограниченными вычислительными ресурсами, у которых есть размеченные данные для классификации текста, наивный Байес остаётся оптимальным выбором. При этом граница выбора зависит от задачи: для тематической классификации наивный Байес догоняет LLM по точности примерно при 10 тысячах размеченных примеров, а вот в задачах определения тональности без разметки LLM выигрывает при любом протестированном объёме данных. Авторы также выпустили Helm-оператор для Kubernetes, который автоматизирует выбор между наивным Байесом и LLM по настраиваемым порогам на основе метрик Prometheus.
Ключевые факты
- На датасете AG News (с разметкой) наивный Байес даёт 89,1% точности, на уровне zero-shot LLM на 27 млрд параметров (89,0%) и выше топовой модели на 397 млрд параметров (84,8%)
- Без разметки (zero-shot) LLM обычно сильнее (98,0% против 88,2% на Amazon Polarity), но на задаче с меньшей утечкой данных наивный Байес обошёл LLM, 81,7% против 73,0%
- Батчевый инференс небольших LLM на GPU в 40, 486 раз медленнее инференса наивного Байеса на CPU, энергии на пример уходит примерно на два порядка меньше
- На AG News дообученный DistilBERT даёт точность выше остальных (90,6%), но заметно уступает наивному Байесу в пропускной способности
- Наивный Байес догоняет LLM по точности примерно при 10 тысячах размеченных примеров для тематической классификации; авторы выпустили Helm-оператор для Kubernetes, автоматизирующий выбор модели
Почему это важно
Работа отвечает на вопрос, который в эпоху LLM звучит регулярно: стоит ли списывать классические алгоритмы вроде наивного Байеса. Прямое измерение точности, скорости и энергопотребления на одинаковых задачах показывает, что при наличии размеченных данных простой и дешёвый метод сопоставим по качеству с моделями на порядки большего размера, вопреки распространённому нарративу о безусловном превосходстве LLM.
Кому это важно
Прежде всего инженерам и исследователям, которые строят пайплайны классификации текста в условиях ограниченных вычислительных ресурсов (HPC-практикам, как их называют авторы), там, где важны и стоимость инференса, и энергопотребление, а не только точность модели.
Как это применить
Если задача, классификация с уже размеченными данными (от примерно 10 тысяч примеров и больше для тематической классификации), наивный Байес на CPU даёт сравнимую точность при кратно меньших затратах на инференс. Если размеченных данных нет и задача близка к определению тональности, эффективнее выбор в пользу zero-shot LLM. Авторы предлагают Helm-оператор для Kubernetes, который делает этот выбор автоматически по настраиваемым порогам и метрикам Prometheus.
Можно ли доверять
Текст даёт конкретную методологию и числа, сравнение на нескольких датасетах, диапазон масштабов моделей, отдельные замеры пропускной способности и энергии. При этом в доступном тексте не указаны имена авторов, их институциональная принадлежность, площадка публикации и статус рецензирования, материал стоит воспринимать как препринт, а не как рецензированную публикацию.
Риски и подводные камни
Авторы прямо указывают, что часть преимущества LLM в zero-shot-режиме может объясняться утечкой тестовых данных в обучающую выборку модели (contamination), а не реальным превосходством в понимании задачи. Вывод в пользу наивного Байеса справедлив не универсально, а только там, где размеченные данные уже есть и задача, классификация по темам; для определения тональности без разметки авторы фиксируют обратную картину. Указанный разброс в скорости инференса (40, 486 раз) сильно зависит от конкретного процессора, поэтому конкретную цифру для своего оборудования стоит проверять отдельно.