DeepSeek ценит структуру и голос текста выше словарного запаса

Новое исследование разбирает, как рассуждающие большие языковые модели, те, что перед ответом выстраивают явную цепочку рассуждений, определяют литературное качество текста. Авторы работы (имена в источнике не раскрыты) провели два эксперимента на модели DeepSeek, а часть результатов дополнительно проверили на модели Qwen QwQ.

В первом эксперименте собрали подборку из 30 реальных текстов, разбитых на шесть уровней качества, от признанной классической литературы до анонимных постов на интернет-форумах. Модель DeepSeek классифицировала тексты по уровню, а исследователи разбирали цепочку её рассуждений, чтобы вытащить из неё явную «теорию качества», не итоговую оценку, а обоснование, которым модель эту оценку объясняет сама себе. В пяти независимых прогонах точность определения уровня качества текста в среднем составила 79,3%. Разбор рассуждений показал устойчивую закономерность: модель ценит осознанный творческий замысел выше формальной правильности, ставя во главу угла авторское мастерство, глубину и самобытный голос. Отдельный эксперимент с текстами, написанными исследователями в стиле известных авторов, но не совпадающими с их реальными произведениями (то есть неузнаваемыми имитациями), показал: похоже, что узнавание источника, когда модель опознаёт в тексте знакомое произведение, завышает его оценку. Но полностью отделить этот эффект от того, что подлинные классические оригиналы объективно превосходят по качеству имитации, написанные для эксперимента, не удалось, сами авторы называют это смешением факторов.

Во втором эксперименте эту теорию проверили не через классификацию, а через контролируемую порчу текста. Взяли пять классических прозаических отрывков и применили к каждому шесть видов ухудшения: упрощение словаря, сглаживание ритма, удаление образности (метафор и сравнений), обезличивание авторского голоса, упрощение структуры и совместное применение всех искажений сразу, после чего заново прогнали через оценку модели каждую испорченную версию. Упрощение словаря снизило оценку слабее всего, всего на 0,41 ± 0,46 балла. Упрощение структуры ударило по оценке куда сильнее, минус 2,78 балла, обезличивание голоса, минус 2,34 балла. Совместное применение всех искажений оказалось самым разрушительным, минус 5,64 балла, но этот эффект получился меньше суммы потерь от отдельных искажений: испорченные признаки текста частично перекрывают друг друга, а не складываются линейно. На модели Qwen QwQ, в рамках предварительного (не основного) сравнения, повторилась та же качественная картина.

Общий вывод исследователей: оценка качества текста рассуждающими языковыми моделями, целостная и заточенная под конкретный авторский стиль, причём такие модели куда чувствительнее к структурным особенностям текста (композиции, ритму, голосу), чем к словарному запасу или формальной правильности. Авторы связывают это с практическими задачами, от систем автоматической обратной связи по письму (для студентов, авторов, редакторов) до более широкой области вычислительной эстетики, изучающей, как алгоритмы формализуют понятия вкуса и качества.

Ключевые факты

  • Исследователи разобрали цепочки рассуждений модели DeepSeek на 30 текстах шести уровней качества (от классики до анонимных постов на форумах): в пяти прогонах точность определения уровня составила в среднем 79,3%.
  • Рассуждения модели раскрыли устойчивую «теорию качества»: DeepSeek ценит осознанный творческий замысел, мастерство, глубину и самобытный авторский голос выше формальной правильности текста.
  • Эксперимент с неузнаваемыми имитациями классических текстов показал, что узнавание источника, похоже, завышает оценку, но отделить этот эффект от реальной разницы в качестве между оригиналами и имитациями не удалось.
  • Контролируемая порча пяти классических отрывков показала: упрощение словаря почти не портит оценку (−0,41 балла), а вот упрощение структуры (−2,78) и обезличивание голоса автора (−2,34) снижают её сильно; все искажения вместе дают −5,64, но это меньше суммы отдельных потерь.
  • Та же картина подтвердилась на модели Qwen QwQ: авторы заключают, что оценка качества текста у рассуждающих моделей целостная и куда чувствительнее к структуре и голосу, чем к словарному запасу.

Почему это важно

Оценка «хорошего текста» плохо поддаётся формализации даже в литературоведении, а для ИИ она долго оставалась чёрным ящиком: модель выдаёт число или вердикт, но не объясняет, на чём он основан. Эта работа, попытка заглянуть внутрь: у рассуждающих моделей есть цепочка рассуждений перед ответом, и её можно прочитать как явно сформулированную теорию качества текста. Дальше эту теорию не просто пересказывают, а проверяют экспериментально, сначала точностью классификации по шести уровням качества, затем точным измерением того, насколько падает оценка при контролируемой порче текста разными способами. Это переводит разговор о «вкусе ИИ» из области впечатлений в область измеримых и воспроизводимых цифр.

Кому это важно

В первую очередь, исследователям на стыке литературоведения и компьютерной лингвистики, изучающим, как алгоритмы «понимают» текст. Не менее полезно разработчикам инструментов автоматической проверки и редактуры письма, которые уже используют языковые модели как «судей» качества: работа прямо показывает, на какие признаки текста такой судья реагирует сильно, а на какие, почти нет. Пригодится и всем, кто в принципе полагается на модель-судью (LLM-as-a-judge) в других задачах оценки контента, здесь показан метод проверки её реальной чувствительности через контролируемую порчу входных данных. Наконец, любопытно будет писателям и редакторам: работа буквально показывает, что именно нейросеть считает признаком мастерства.

Как это применить

Главный практический сигнал, для продуктов, которые используют языковую модель как автоматического «судью» текста или инструмент обратной связи по письму: правки на уровне словаря и грамотности почти не двигают её оценку качества, а вот работа со структурой и авторским голосом, двигает сильно. Значит, полагаться на то, что модель «сама» одинаково учтёт орфографию и композицию, не стоит: если продукту важна грамотность, её нужно проверять отдельным специализированным инструментом, а не полагаться на общую оценку «качества» от рассуждающей модели. Сам протокол исследования, шесть управляемых видов порчи текста плюс сравнение с неузнаваемыми имитациями стиля, можно использовать как готовую методику диагностики: прогнать через неё любую модель-судью и увидеть профиль её чувствительности. И ещё один практический урок: тестовые тексты для проверки модели стоит подбирать так, чтобы она не могла их узнать, иначе результат исказит эффект узнавания источника, отмеченный в первом эксперименте.

Можно ли доверять

В пользу выводов, воспроизводимость: пять независимых прогонов на модели DeepSeek дали устойчивый результат в 79,3% точности, а дизайн второго эксперимента даёт точные числовые эффекты для каждого вида порчи текста, а не общее впечатление. Картину частично подтвердила и вторая модель, Qwen QwQ, хотя авторы сами называют это сравнение предварительным. Есть и честно признанное авторами слабое место: в эксперименте с узнаваемостью источника эффект «модель завышает оценку знакомому тексту» невозможно чисто отделить от того, что настоящие классические оригиналы объективно превосходят по качеству имитации, написанные исследователями для эксперимента. Стоит учитывать и масштаб: базовый бенчмарк, 30 текстов, а сама работа опубликована как препринт на arXiv, без явного указания на рецензирование.

Риски и подводные камни

Главный методологический риск: то, что модель формулирует в своих рассуждениях («ценю глубину и голос, а не правильность»), не обязательно точно отражает механизм, который в действительности определяет её итоговую оценку, известная в интерпретируемости ИИ проблема расхождения между объяснением модели и её реальным «ходом мысли». Есть риск и для практики: если инструменты автоматической проверки письма унаследуют такую же нечувствительность к правильности и повышенное внимание к «голосу» и структуре, они рискуют занижать простой, ясный, но технически безупречный текст и завышать вычурную, усложнённую прозу, то есть встраивать в инструмент собственную эстетическую предвзятость вместо нейтральной проверки. Наконец, эксперимент построен на англоязычных классических текстах и моделях: перенос выводов на другие языки и литературные традиции письма (включая русскую) в самой работе не проверялся.

«Оценки качества текста у языковых моделей целостны, зависят от индивидуального стиля автора и куда чувствительнее к структурным особенностям текста, чем к лексическим.»

— авторы исследования