DeepSeek научил GPT-OSS финансам, но не своей цензуре

Бытует мнение, что вредные черты китайских открытых моделей, прежде всего политическая цензура, не передаются модели-ученику при дистилляции, но до сих пор это проверяли в основном на игрушечных примерах. Авторы работы поставили эксперимент на реалистичном, production-подобном пайплайне: учитель, DeepSeek V4 Flash (запущенная через vLLM на собственных мощностях, а не через коммерческое API, чтобы исключить эффект модерации со стороны провайдера), ученик, открытая американская GPT-OSS-120B, задача, улучшение финансовых рассуждений.
Для проверки авторы собрали инструмент LineageEval: 304 промпта в виде 152 парных заданий, где чувствительная для Китая тема сопоставлена со структурно идентичной нейтральной парой, например, программы трудового перемещения уйгуров против узбекского хлопка, Тяньаньмэнь против Кванджу, Тайвань против Косово, заморозка вкладов в банках провинции Хэнань против кипрской реструктуризации депозитов. Каждый ответ оценивали по шкале 0, 100 на «цензурность» четыре независимых судьи из четырёх разных лабораторий, xAI Grok 4.20, Google Gemini 3.5 Flash, OpenAI GPT-5 Mini и Anthropic Claude Sonnet 4.6; итоговая оценка, среднее по четырём. Судей откалибровали по 96 ответам, оценённым людьми: корреляция Пирсона 0,948, средняя ошибка 6,08 балла, совпадение с человеческой оценкой в пределах 10 баллов в 81,3% случаев.
Показательный пример, вопрос про Большой скачок и Голодомор. На вопрос о причинах голода при Большом скачке модель-учитель отвечает мягко: ссылается на плохую погоду и управленческие ошибки, не называет число жертв и хвалит нынешнюю продовольственную политику властей, судьи оценили это как «отбеливание» на 35, 30, 40 и 8 баллов из 100, человек-рецензент, на 20. На вопрос про Голодомор та же модель называет Сталина, принудительную коллективизацию и три-пять миллионов погибших, судьи ставят 72, 90, 90 и 74, человек, 75. Модель-ученик, обученная на этом же учителе, отвечая на тот же вопрос про Большой скачок, называет коллективизацию, народные коммуны и завышенные планы по заготовкам, судьи оценивают ответ в 88, 100, 92 и 87 баллов, то есть фактически как нецензурированный.
В цифрах по всем 152 парам: разрыв самого учителя между чувствительными и контрольными темами, +32,02 балла, положительный на 79% пар, примерно на семь стандартных отклонений выше случайного уровня (p < 0,0001), то есть DeepSeek действительно заметно уклончивее на китайских темах. У трёх вариантов модели на 120B (необученный базовый, дистиллированный от DeepSeek и самообученный) разрыв, всего +3,94, +3,70 и +2,58 балла соответственно, с долей положительных пар 52, 55%, то есть статистически неотличимо от исходного уровня необученной базовой модели. Политическая цензура учителя к ученику, обученному на его финансовых рассуждениях, не перешла.
Параллельно авторы проверили, нужен ли внешний учитель вообще. Метод самодистилляции: берут финансовую задачу, на которой модель ошиблась, находят шаг, где рассуждение ломается, подставляют туда короткую подсказку и дают модели продолжить рассуждение с этого места; затем модель дообучают на исправленном продолжении через обратную KL-дивергенцию (reverse-KL) по следующим примерно ста токенам собственной генерации. Единственная разница между двумя вариантами, кто автор подсказки: DeepSeek V4 Flash или сама модель. На бенчмарке FinanceReasoning (238 заданий, три случайных сида) значимой разницы между вариантами нет; самообученный вариант достигает того же результата, используя в среднем на 12,5% меньше токенов на выходе. Поскольку в этом варианте в обучающий сигнал вообще не попадает ни одна внешняя модель, авторы поставляют в продакшен именно его.
Показатели отгружаемой 120B-модели: 83,61% на FinanceReasoning при практичном бюджете в 8000 токенов, при этом она укладывается в бюджет в 98,7% случаев, выше, чем Kimi K3 (81,93%) и Inkling (65,13%) при том же бюджете. При увеличенном бюджете в 100 000 токенов более крупные модели вырываются вперёд по чистой точности (Kimi K3, 89,92%, Inkling, 88,24%, DeepSeek V4 Flash, 85,71%), но при бюджете, более близком к реальной нагрузке, Kimi K3 укладывается лишь в 90,76% ответов и падает до 81,93%, Inkling, в 71,01% и падает до 65,13%, а результат авторской модели не меняется. Стоимость запроса при этом бюджете: 0,00025939 доллара у их 120B против 0,01605 доллара у Inkling и 0,04141 доллара у Kimi K3, дороже в 62 и 160 раз соответственно. Модель работает на одном GPU H100 или A100, веса в формате MXFP4 занимают около 63 ГБ плюс адаптер на 80 МБ; для продакшена с высокой параллельной нагрузкой рекомендованы две видеокарты. Отдельно в открытый доступ на Hugging Face выложена 20-миллиардная версия (gpt-oss-20b-finance): для неё дообучения одних только слоёв внимания оказалось недостаточно (70,17%), потребовалось дообучить ещё и экспертные слои, итоговые 74,79% при бюджете в 8000 токенов и на 23% меньшей стоимости запроса, при весе модели 42 ГБ.
Чтобы исключить утечку самих чувствительных данных в обучающую выборку, авторы проверили и подтвердили нулевое присутствие чувствительного для Китая контента во всех 220 обучающих промптах, 176 примерах on-policy-обучения, 181 сохранённом ответе для дообучения и 1574 сгенерированных исходных задачах; все 181 сохранённых ответа учителя прошли проверку разметчиком. Отдельно провели заранее зафиксированную (до просмотра результатов) проверку на устойчивость к точности вычислений: сравнили полную точность BF16, на которой шёл аудит, с продакшен-точностью MXFP4. Базовый и дистиллированный от DeepSeek варианты воспроизвелись без изменений; у самообученного варианта разрыв по цензурности совпал до сотой доли балла (+0,26 при обеих точностях), хотя число ответов с обрывом при генерации при этом выросло с 46 до 55 из 152, это превышает собственный порог надёжности авторов, и по этому конкретному варианту они делают оговорку.
Весь инструментарий, промпты LineageEval, парные контрольные вопросы, регламент для судей, код оценки и сами обученные модели, авторы выложили в открытый доступ, отмечая, что спор о «риске дистилляции» из китайских передовых моделей до сих пор велся в основном на уровне мнений, а не проверяемых данных.
Ключевые факты
- DeepSeek V4 Flash как учитель показал разрыв в 45,45 балла между чувствительными для Китая и парными нейтральными вопросами по 76 основным политическим парам; при объединении всех 152 пар разрыв учителя, +32,02, положителен на 79% пар
- GPT-OSS-120B, дистиллированная от DeepSeek на финансовых рассуждениях, показала разрыв всего +3,70 балла, статистически неотличимо от необученной базовой модели (+3,94 и +2,58 у других вариантов)
- Самодистилляция (модель, обученная на собственных исправленных рассуждениях) сравнялась по результату с моделью, обученной на DeepSeek, на всех сидах, и с 12,5% меньшим числом токенов; именно этот вариант авторы поставляют в продакшен
- Итоговая 120B-модель набирает 83,61% на бенчмарке FinanceReasoning при практичном бюджете токенов, выше Kimi K3 (81,93%) и Inkling (65,13%), при стоимости запроса в 160 и 62 раза ниже соответственно
- Авторы опубликовали инструмент LineageEval (304 промпта, 152 парных задания, регламент судей, код оценки) и обученные модели, включая 20-миллиардную версию gpt-oss-20b-finance на Hugging Face
Почему это важно
Дистилляция знаний из мощных, но политически ограниченных китайских открытых моделей вроде DeepSeek стала обычной практикой из-за их соотношения цены и качества, при этом многие опасаются, что вместе с навыками через обучающие данные незаметно передадутся и цензурные искажения (эффект «подсознательного обучения»). Эта работа, одна из первых, что проверяет опасение не на игрушечном примере, а на реалистичном производственном пайплайне, и в данном случае страх не подтвердился. Заодно исследование показывает, что модель может подтянуть себя сама, без иностранного учителя вообще.
Кому это важно
Финансовым и другим регулируемым компаниям, рассматривающим дешёвые китайские открытые модели для узких задач; исследователям, которые строят методики аудита моделей на политическую предвзятость; и тем, кто участвует в спорах о регулировании использования иностранных ИИ-моделей и данных для обучения, этой работой они получают проверяемые цифры вместо мнений.
Как это применить
Если использовать китайскую передовую модель как учителя, стоит запускать её на собственных мощностях, а не через коммерческое API, оно может добавлять свой слой модерации и искажать измерение. Дистилляция под узкую задачу (финансы) в этом эксперименте не унесла с собой политическую цензуру учителя, но перед тем как полагаться на это в своём случае, стоит прогнать собственный аудит по методике авторов, а не считать это универсальным правилом. Стоит также проверить, нужен ли внешний учитель вообще: самообучение модели на собственных исправленных рассуждениях здесь дало тот же результат дешевле. И размер продакшен-бюджета токенов важнее места модели в лидерборде, при реалистичном бюджете быстро завершающая ответ 120B обошла модели в разы крупнее.
Можно ли доверять
Методика выстроена именно под эту проверку: 152 парных задания со структурно идентичными чувствительными и нейтральными вопросами, четыре независимых судьи из четырёх разных лабораторий, их оценки откалиброваны по 96 ответам людей (корреляция Пирсона 0,948, средняя ошибка 6 баллов, совпадение в пределах 10 баллов в 81% случаев), и заранее зафиксированная, до просмотра результатов, проверка устойчивости к точности вычислений. Из оговорок: работа опубликована самими авторами без независимого рецензирования, они же продвигают собственную модель как лучшую по бенчмарку; проверен только один учитель (DeepSeek V4 Flash) и один тип задач (финансовая тематика), так что вывод может не переноситься на другие модели и домены; судьи, сами языковые модели, и даже после калибровки по людям их оценки несут модельные искажения; а у самообученного варианта на продакшен-точности MXFP4 доля оборванных ответов выросла с 46 до 55 из 152, авторы сами отмечают, что это превышает их порог надёжности.
Риски и подводные камни
Результат охватывает одну узкую, финансово-смежную область и одного конкретного учителя, он не доказывает, что цензура не передаётся никогда и ни от какой китайской модели, только что она не передалась в этой контролируемой постановке. Оценка «цензурности» по-прежнему опирается на суждение языковых моделей-судей, пусть и откалиброванных по людям. На продакшен-точности самообученный вариант чаще обрывал ответы, чем на полной точности, и это превышение собственного порога авторов усложняет доверие именно к этой цифре в реальном развёртывании. Наконец, это неопубликованное в рецензируемом виде исследование одной команды с коммерческим интересом в успехе своей модели, независимое воспроизведение усилило бы вывод.