Xiaomi выпустила MiMo-V2.6, лидера среди открытых моделей, но Anthropic обвинила её в нелегальной дистилляции Claude

Xiaomi выпустила линейку моделей MiMo-V2.6, флагманскую MiMo-V2.6-Pro и более компактную MiMo-V2.6-Flash. По данным Xiaomi, MiMo-V2.6-Pro набрала 46 баллов по индексу интеллекта (Intelligence Index) от аналитической компании Artificial Analysis, это делает её сильнейшей из доступных открыто моделей, опережающей конкурентов вроде Kimi K3 и Qwen. При этом цена держится низкой: $0,435 за миллион входных токенов и $0,87 за миллион выходных, а по расчётам Artificial Analysis одна тестовая задача обходится примерно в $0,13, по совокупности качества и цены модель попадает на границу Парето (оптимальное соотношение результата и затрат). MiMo-V2.6-Pro построена по архитектуре «смесь экспертов» (mixture-of-experts): из 1,02 трлн параметров на каждый запрос активируется лишь 42 млрд.
Скачок в качестве Xiaomi объясняет резко расширенным обучением с подкреплением (reinforcement learning, RL), тренировкой через пробу, обратную связь и вознаграждение. Масштабирование шло по трём направлениям: больше данных на шаг обучения, более разнообразные задачи-окружения и больше вычислений на проверку решений. Сам цикл обучения занял, по словам Xiaomi, меньше шести дней и обошёлся примерно в $2,62 млн для Pro и $0,85 млн для Flash. На тесте по написанию кода DeepSWE оценка Pro выросла с 58,4 до 72,6 балла, а Flash, с 48,8 до 65,7. Чтобы обучение оставалось стабильным при таком масштабе, компания зафиксировала внутренний механизм распределения модели и добавила несколько уровней защиты от «взлома вознаграждения» (reward hacking), приёмов, которыми модель обманывает систему оценки, не решая задачу по существу.
Вместе с моделями Xiaomi выпускает особо быстрый вариант Pro-UltraSpeed, с выходной скоростью до 20 раз выше обычной. Также компания открыла весь инструментарий для RL-обучения: технический отчёт, полный фреймворк обучения, уменьшенную модель для дальнейшего дообучения и около 7000 готовых обучающих задач с автоматическими проверяющими программами, по разработке ПО, кибербезопасности, офисной работе и веб-дизайну, плюс около 1000 задач по написанию музыки. Часть задач по коду взята из реальных запросов на слияние (pull request) сотрудников компании и пользовательских запросов, часть описаний сгенерирована языковой моделью; задачи по кибербезопасности опираются на OSS-Fuzz, коллекцию из десятков тысяч реальных уязвимостей ПО, а офисные окружения воссозданы синтетически.
Демонстративная открытость Xiaomi резко контрастирует с обвинениями, которые двумя неделями ранее выдвинула Anthropic. В своём отчёте по анализу угроз компания изучила случаи злоупотребления моделью Claude, обнаруженные с декабря 2025 по август 2026 года, и назвала семь китайских лабораторий, связанных с кампаниями против Claude: Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax и SenseTime. По данным Anthropic, суммарно эти лаборатории сгенерировали около 190 млн обменов сообщениями, чтобы извлечь возможности Claude для обучения собственных моделей, Anthropic называет эту технику нелегальной дистилляцией.
Xiaomi в отчёте фигурирует отдельно: в случае с внутренним обозначением GTG-16008 Anthropic отследила более 400 000 обменов за 20 дней в марте и апреле 2026 года, в ходе которых Xiaomi пропускала пользовательские переписки и сессии по написанию кода из собственных моделей MiMo через сервисы OpenClaw и OpenCode в Claude, с целью обогатить данные для обучения будущих моделей. Сам отчёт Anthropic почти не документирует, откуда взялись более ранние обучающие и «учительские» данные для внутренней дистилляции моделей-учителей Xiaomi. Иными словами, по версии отчёта, Xiaomi записывала переписки пользователей со своими моделями MiMo, а затем пропускала их через Claude, чтобы извлечь обучающие данные, те самые, что, по утверждению отчёта, и вывели новую модель в лидеры рейтинга открытых моделей.
Ключевые факты
- MiMo-V2.6-Pro набрала 46 баллов по Intelligence Index от Artificial Analysis и обошла Kimi K3 и Qwen среди открытых моделей при цене $0,435/$0,87 за млн входных/выходных токенов ($0,13 за тестовую задачу).
- Модель построена на архитектуре mixture-of-experts (1,02 трлн параметров, 42 млрд активных на запрос); обучение заняло меньше 6 дней и стоило $2,62 млн (Pro) и $0,85 млн (Flash).
- Xiaomi открыла RL-инструментарий: технический отчёт, фреймворк обучения, уменьшенную модель для дообучения и около 7000 обучающих задач с автопроверкой (плюс 1000 задач по музыке).
- Anthropic в отчёте по угрозам назвала семь китайских лабораторий, включая Xiaomi, которые суммарно сгенерировали около 190 млн обменов, чтобы извлечь возможности Claude для обучения своих моделей.
- По делу GTG-16008 Anthropic отследила у Xiaomi более 400 000 обменов через Claude за 20 дней в марте-апреле 2026 года; по версии отчёта, именно эти данные помогли достичь нынешних результатов MiMo.
Почему это важно
Открытая модель, обгоняющая закрытые и открытые аналоги по цене и качеству, при этом обученная менее чем за неделю и за $2,62 млн, а не за сотни миллионов, как у крупных лабораторий, меняет расклад рынка открытых моделей: подход воспроизводим, потому что Xiaomi открыла и инструментарий, и обучающие задачи. Одновременно история показывает обратную сторону такой гонки: по обвинению Anthropic, часть скачка в качестве у Xiaomi держится на данных, полученных из Claude в обход условий использования.
Кому это важно
Разработчикам, выбирающим недорогую открытую модель для продакшена: MiMo-V2.6-Pro даёт конкурентные результаты по низкой цене за токен, а вариант Pro-UltraSpeed, там, где важна скорость генерации. Исследователям в области RL, открытые техотчёт, фреймворк и около 7000 задач с автопроверкой снижают порог входа для повторения подобных экспериментов. Компаниям, работающим с Claude через API, история напоминает, что условия использования моделей могут прямо запрещать перегонку их вывода в обучение конкурирующих продуктов.
Как это применить
MiMo-V2.6-Pro и MiMo-V2.6-Flash доступны как открытые модели по названным ценам за токен; Pro-UltraSpeed подходит задачам, где критична скорость вывода (до 20 раз быстрее). Открытые технический отчёт, RL-фреймворк, уменьшенная модель для дообучения и набор задач с автопроверкой позволяют воспроизвести или адаптировать методику расширенного RL-обучения Xiaomi на собственных данных.
Можно ли доверять
Оценка производительности (Intelligence Index, стоимость задачи) сделана независимой Artificial Analysis, а не только заявлена самой Xiaomi, что повышает доверие к цифрам качества и цены. Обвинения же Anthropic пока не уравновешены ответом Xiaomi, в материале позиция компании не приведена, а сам отчёт Anthropic, по признанию издания, почти не документирует происхождение более ранних обучающих данных Xiaomi, то есть часть картины остаётся закрытой.
Риски и подводные камни
Для Xiaomi, репутационный и потенциально юридический риск: Anthropic называет практику «нелегальной дистилляцией» и напрямую связывает её с моделью, которая теперь возглавляет рейтинг открытых моделей. Для рынка открытых моделей в целом, вопрос доверия к бенчмаркам: если часть тренировочных данных получена обходом условий использования модели-конкурента, лидерство в рейтинге отражает не только собственные наработки лаборатории.