DeepSeek выпустила V4-Flash-0731: лучшее соотношение цены и интеллекта

DeepSeek выпустила V4-Flash-0731: лучшее соотношение цены и интеллекта

DeepSeek выпустила DeepSeek-V4-Flash-0731, новую модель в своём семействе V4, описанную как модель с существенно улучшенными агентными возможностями. У модели 304 миллиарда параметров, вес файла на Hugging Face, 167 ГБ.

Агрегатор оценок Artificial Analysis ставит DeepSeek-V4-Flash-0731 выше MiniMax M3, модели с 428 миллиардами параметров, то есть заметно более крупной. Автор обзора (разработчик Саймон Уиллисон) отмечает, что модель выступает намного сильнее своего размера, а по цене, $0,14 за миллион входных токенов и $0,27 за миллион выходных, она, по его оценке, может быть сейчас лучшей моделью по соотношению цены и интеллекта на рынке. На графике Intelligence Index vs. Cost per Intelligence Index Task от Artificial Analysis модель выглядит выигрышно именно по этому балансу.

Автор также поделился личным тестом, своим фирменным заданием «нарисуй пеликана на велосипеде». На стандартном уровне рассуждений (через OpenRouter) результат его разочаровал. Когда он поднял уровень рассуждений до high (командой llm -m openrouter/deepseek/deepseek-v4-flash-0731 -t pelican -o reasoning_effort high), результат оказался значительно лучше.

Ключевые факты

  • DeepSeek выпустила DeepSeek-V4-Flash-0731, новую модель семейства V4 с усиленными агентными возможностями
  • У модели 304 млрд параметров, вес файла на Hugging Face, 167 ГБ
  • Artificial Analysis ставит её выше MiniMax M3, модели с 428 млрд параметров
  • Цена, $0,14 за миллион входных токенов и $0,27 за миллион выходных; по оценке автора обзора, это может быть лучшее соотношение цены и интеллекта на рынке
  • На стандартном уровне рассуждений результат теста разочаровал автора, но при максимальном уровне (reasoning effort high) заметно улучшился

Почему это важно

Модель поменьше обгоняет по качеству более крупную MiniMax M3, это продолжает тренд, где китайские лаборатории (в частности DeepSeek) выпускают модели с сильным соотношением цены и качества, а не только гонятся за размером. Акцент релиза на «агентных» возможностях отражает общий сдвиг индустрии в сторону моделей, рассчитанных на автономное выполнение многошаговых задач, а не только на диалог.

Кому это важно

Разработчикам, которые строят ИИ-агентов и приложения на базе LLM и ищут баланс между качеством и стоимостью запросов; пользователям OpenRouter и Hugging Face, где модель уже доступна; тем, кто следит за конкуренцией между китайскими и западными лабораториями на рынке больших языковых моделей.

Как это применить

Модель доступна на Hugging Face (167 ГБ) и через OpenRouter под именем deepseek/deepseek-v4-flash-0731. Автор обзора показывает, что стандартный уровень рассуждений может давать посредственный результат, для более качественного ответа стоит явно повышать уровень рассуждений (reasoning effort) до high, как в его примере с CLI-утилитой llm.

Можно ли доверять

Источник, блог разработчика Саймона Уиллисона, который сам протестировал модель и сослался на данные независимого агрегатора оценок Artificial Analysis, а сама новость пришла через Hacker News. При этом в тексте нет ни точной даты релиза, ни расшифровки того, что конкретно стоит за «существенно улучшенными агентными возможностями», ни официального анонса или прайс-листа DeepSeek, не уточняется, относятся ли приведённые цены к прямому API DeepSeek или к тарифам OpenRouter.

Риски и подводные камни

Ответы на стандартном уровне рассуждений могут быть заметно слабее, чем при повышенном, а более высокий уровень рассуждений обычно означает больше токенов и, соответственно, выше стоимость и задержку ответа. Заявленные цены не привязаны явно к источнику (DeepSeek или OpenRouter), контекстное окно, архитектура и числовые бенчмарки в тексте не приводятся, есть только сам факт места в рейтинге Artificial Analysis.

«С существенно улучшенными агентными возможностями»

— из описания релиза DeepSeek-V4-Flash-0731