DeepSeek добавила зрение в V4 Flash: экспериментальная модель уже доступна через API
DeepSeek открыла доступ к DeepSeek-V4-Flash-Vision-Exp — экспериментальной версии V4 Flash, которая понимает изображения вместе с текстом. В документации компании сказано, что модель можно использовать для описания фотографий, чтения текста на скриншотах и разбора графиков. Релиз появился в журнале изменений API 21 августа.
Это не новая отдельная платформа. Разработчику достаточно указать имя модели deepseek-v4-flash-vision-exp в API DeepSeek. Запросы остаются в знакомом формате Chat Completions, совместимом с OpenAI; изображения также можно передавать через Responses API. Базовый адрес API менять не требуется.
Что меняется для разработчиков
Изображение можно передать тремя способами: как закодированный файл внутри запроса, по публичной ссылке или через ранее загруженный Files API. Поддерживаются JPEG, PNG, GIF и WebP. Компания ограничивает внешний файл 32 МБ, а тело запроса с вложениями — 48 МБ; за один запрос можно передать до 600 изображений.
Практический сценарий — агент, который не только получает текстовую задачу, но и может проверить макет, извлечь данные из чека, сравнить скриншот с ожидаемым результатом или объяснить график. Раньше для такого шага нужно было либо подключать отдельную vision-модель, либо писать собственную обработку изображений.
DeepSeek утверждает, что в чисто текстовых задачах новинка сопоставима с обычной V4 Flash, а в тестах агентных задач с визуальным вводом заметно сильнее. Эти результаты опубликованы самой компанией: независимой оценки релиза пока нет. Поэтому модель стоит воспринимать как новый доступный API-инструмент, а не как доказанный заменитель более дорогих мультимодальных систем.
Почему это важно сейчас
V4 Flash уже использовали как недорогую основу для кода и агентов. Добавление зрения расширяет тип задач, которые можно собрать вокруг одного вызова API: от проверки интерфейсов до обработки документов. Но статус Exp важен: перед переносом критичных процессов в production командам придётся проверить качество на собственных изображениях, ошибки распознавания и фактическую стоимость запросов.













