DeepSeek выпустила V4-Flash-Vision-Exp: почти догоняет Opus 4.8 в агентных тестах

Китайская компания DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp, экспериментальную мультимодальную версию модели V4-Flash, которая добавляет понимание изображений к её текстовым возможностям. По словам DeepSeek, модель сохраняет уровень базовой V4-Flash в рассуждениях и знаниях о мире, а на внутренних агентных бенчмарках компании вариант с поддержкой зрения почти сравнялся по результатам с Opus 4.8 от Anthropic; конкретных числовых оценок DeepSeek не публикует.
Модель нацелена на агентные сценарии: она рассчитана на работу с разными агентными фреймворками и совмещает понимание изображений с использованием инструментов. На практике это означает, что модель умеет описывать изображения, извлекать текст со скриншотов и разбирать диаграммы. Она поддерживает форматы JPEG, PNG, GIF и WebP, причём формат файла определяется по фактическому содержимому, а не по имени файла или заявленному MIME-типу, так указано в документации API. Модель работает через Chat Completions и Responses API от OpenAI, а также через Messages API от Anthropic. Одновременно DeepSeek выпустила версию 0.1.1 своего фреймворка Harness, которая поддерживает новую модель «из коробки».
Отправить изображение модели можно тремя способами: встроить его напрямую в кодировке Base64, указать публично доступную ссылку (до 32 МиБ) или воспользоваться новым бесплатным Files API, он позволяет загрузить файл один раз и затем ссылаться на него по идентификатору в разных запросах, лимит размера файла, 64 МиБ. Есть необязательное поле «detail», которое уменьшает изображение до 512×512 пикселей, экономя токены там, где мелкие детали не нужны. Перед обработкой модель автоматически приводит изображения примерно к 800×800 пикселям с учётом соотношения сторон. Независимо от исходного разрешения каждое изображение обходится максимум в 384 токена. Цены совпадают с тарифами V4-Flash, конкретных цифр в долларах источник не приводит.
В один запрос можно включить до 600 изображений. Максимальная длина стороны изображения, 8192 пикселя, но при 15 и более изображениях в одном запросе она снижается до 4096 пикселей. Изображения допускаются только в пользовательских сообщениях.
Ключевые факты
- DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp, экспериментальную мультимодальную версию V4-Flash с пониманием изображений при сохранении текстовых возможностей базовой модели.
- На внутренних агентных бенчмарках компании модель почти сравнялась по результатам с Opus 4.8 от Anthropic; точных числовых оценок DeepSeek не раскрывает.
- Модель совместима с Chat Completions и Responses API от OpenAI и с Messages API от Anthropic; одновременно вышла версия 0.1.1 фреймворка Harness с поддержкой новой модели «из коробки».
- Изображение обходится максимум в 384 токена независимо от исходного разрешения; лимит, 600 изображений на запрос, загрузка файлов до 64 МиБ через бесплатный Files API.
- Максимальная сторона изображения, 8192 пикселя, но при 15 и более изображениях в запросе лимит падает до 4096 пикселей.
Почему это важно
DeepSeek продолжает быстро выпускать новые модели и утверждает, что по агентным задачам с обработкой изображений почти достигла уровня Opus 4.8, одной из топовых моделей Anthropic. Это укладывается в общий тренд: китайские лаборатории всё активнее заявляют о паритете с ведущими западными моделями именно в агентных сценариях, где сочетаются работа с инструментами и визуальное понимание.
Кому это важно
Разработчикам, которые строят агентов и инструменты с обработкой изображений, скриншотов интерфейсов, диаграмм, документов, и ищут более дешёвую альтернативу моделям уровня Opus. Также важно конкурентам DeepSeek, которым приходится сверяться с новыми заявлениями о паритете по качеству.
Как это применить
Модель доступна через Chat Completions и Responses API OpenAI, а также через Messages API Anthropic, то есть встраивается в существующие интеграции без смены протокола. Изображения можно передавать через Base64, публичные ссылки (до 32 МиБ) или бесплатный Files API (до 64 МиБ, с переиспользованием по ID). Поле «detail» позволяет заранее снизить разрешение до 512×512 и сэкономить токены, при цене не выше 384 токенов за изображение независимо от разрешения. Для пакетной обработки важно помнить про лимит в 600 изображений на запрос и про снижение максимальной стороны с 8192 до 4096 пикселей при 15 и более изображениях. Цены идут по тарифам V4-Flash. Фреймворк Harness версии 0.1.1 уже поддерживает модель без доработок.
Можно ли доверять
Сравнение с Opus 4.8 основано исключительно на внутренних бенчмарках самой DeepSeek, компания не приводит ни названия тестов, ни конкретных числовых результатов, только формулировку «почти сравнялась». Независимой проверки этих цифр источник не содержит, так что к заявлению о паритете стоит относиться как к маркетинговой оценке компании, а не как к подтверждённому факту.
Риски и подводные камни
Главный риск, самооценка: лаборатории обычно выбирают для публикации те бенчмарки, где выглядят выгоднее всего, а без независимой верификации итоговое качество модели на реальных задачах может отличаться от заявленного. Источник также не указывает ни дату релиза модели, ни то, открыты ли её веса, доступ описан только через перечисленные API.