DeepSeek представила экспериментальную модель компьютерного зрения, близкую по внутренним тестам к Anthropic Opus 4.8
Ключевые выводы
- •21 августа 2026 года DeepSeek анонсировала DeepSeek-V4-Flash-Vision-Exp, впервые добавив обработку изображений и скриншотов в семейство моделей V4 Flash.
- •Экспериментальная модель сохраняет текстовые, логические, агентные возможности и общие знания DeepSeek-V4-Flash и доступна разработчикам через API DeepSeek.
- •Внутренние оценки самой DeepSeek показали производительность, сопоставимую с Anthropic Opus 4.8 в мультимодальных агентных тестах, однако для подтверждения этих заявлений всё ещё требуются независимые бенчмарки.
- •Релиз состоялся на фоне эскалации конкуренции в сфере ИИ между Китаем и США, включая внимание американских властей к китайским разработчикам и национальный план Китая по инвестициям в ИИ до 2030 года.
- •По сообщениям, Anthropic готовится к возможному IPO, документы на которое могут быть поданы уже в этом месяце; к подготовке, как сообщается, привлечены Morgan Stanley, Goldman Sachs и JPMorgan.

Китайская компания DeepSeek представила экспериментальную мультимодальную модель искусственного интеллекта, способную обрабатывать изображения и скриншоты, расширив тем самым семейство моделей V4 на фоне продолжающегося обострения конкуренции между ведущими мировыми разработчиками ИИ — как в Китае, так и в США.
Релиз, анонсированный 21 августа 2026 года, впервые добавляет визуальную обработку в линейку V4, при этом существующая текстовая система сохраняется, а не заменяется. Ввод изображений стал стандартной возможностью передовых моделей OpenAI, Google и Anthropic, и это дополнение выводит новейшее семейство моделей DeepSeek на соответствие этому базовому уровню.
DeepSeek добавляет возможности компьютерного зрения в V4 Flash
DeepSeek анонсировала DeepSeek-V4-Flash-Vision-Exp — экспериментальную модель, добавляющую визуальную обработку на платформу V4 Flash. Пользователи могут загружать изображения и скриншоты, а затем просить модель проанализировать их содержимое или выполнить задачи на основе увиденного.
Компания сообщила, что новая модель сохраняет текстовые возможности DeepSeek-V4-Flash, включая логическое мышление, агентные задачи и общие знания. DeepSeek охарактеризовала релиз как мультимодальное расширение своего нового семейства моделей, а не замену существующей текстовой системы.
«Эта экспериментальная мультимодальная модель не уступает DeepSeek-V4-Flash по текстовым возможностям, включая агентов, логическое мышление и знание окружающего мира», — заявила DeepSeek.
Модель доступна через интерфейс прикладного программирования (API) DeepSeek, что позволяет разработчикам добавлять функции работы с изображениями — например, анализ загруженных скриншотов — в собственные продукты и сервисы, а также создавать визуальные ИИ-приложения на основе платформы.
Новость о релизе опубликовал в X Уолтер Блумберг (@DeItaone):
DEEPSEEK CHALLENGES ANTHROPIC WITH NEW AI MODEL
DeepSeek has unveiled an experimental multimodal AI model capable of analyzing images, screenshots and text while performing autonomous tasks.
Called DeepSeek-V4-Flash-Vision-Exp, the model reportedly approaches Anthropic's Opus…
— Walter Bloomberg (@DeItaone) August 21, 2026
DeepSeek сравнивает модель с Anthropic Opus 4.8
По данным DeepSeek, внутренние оценки показали, что новая модель демонстрирует результаты, сопоставимые с Anthropic Opus 4.8, в мультимодальных агентных тестах. Эти тесты оценивают, как ИИ-системы справляются с задачами, требующими как визуального ввода, так и минимального участия человека. Такое сравнение напрямую противопоставляет экспериментальную модель одной из старших систем Anthropic.
Anthropic делает акцент на агентных возможностях во всей линейке Claude, включая функцию управления компьютером, представленную в конце 2024 года, которая позволяет модели интерпретировать содержимое экрана и выполнять задачи внутри приложений — что пересекается с задачами на основе скриншотов, для выполнения которых создана новая модель DeepSeek.
Однако заявления DeepSeek основаны на собственных тестах компании, и для сравнения производительности при различных нагрузках потребуются более широкие независимые бенчмарки.
DeepSeek уже разрабатывала модели компьютерного зрения и обработки языка в рамках семейства DeepSeek-VL — более ранней линейки моделей, объединяющих понимание изображений с обработкой языка. Новый релиз переносит аналогичные визуальные функции в более новую линейку V4, расширяя спектр задач, которые способна решать платформа. Компания — ИИ-лаборатория при поддержке китайского квантового хедж-фонда High-Flyer — впервые привлекла глобальное внимание в январе 2025 года, когда её модель рассуждений R1 показала результаты, конкурентоспособные с ведущими американскими системами, при затратах, составлявших лишь малую долю от заявленных расходов на их обучение.
Конкуренция в сфере ИИ усиливается между Китаем и США
Релиз вышел на фоне продолжающегося расширения разработок моделей китайскими ИИ-компаниями в области текста, зрения и агентных возможностей. Китай также принял национальный план до 2030 года, предусматривающий увеличение инвестиций в ИИ-чипы, крупные вычислительные системы, мультимодальные модели, автономных агентов и технологии блокчейна.
Китайские разработчики также сталкиваются с усиливающимся вниманием со стороны американских властей в связи с конкуренцией в области передового ИИ. Недавние дискуссии затрагивали вопросы интеллектуальной собственности, методов обучения моделей и доступа к высокопроизводительному вычислительному оборудованию, необходимому для обучения больших моделей.
Между тем, по сообщениям, Anthropic готовится к возможному первичному публичному размещению акций (IPO). Компания может подать документы уже в этом месяце; по имеющимся данным, к подготовке привлечены Morgan Stanley, Goldman Sachs и JPMorgan.
Потенциальный листинг привлёк внимание после того, как SpaceX провела IPO, собрав около 86,2 млрд долларов с учётом дополнительного размещения акций. Сравнения двух компаний остаются предположительными, поскольку Anthropic пока не объявила окончательные условия размещения и подтверждённую оценку стоимости.
Новая модель DeepSeek выходит на эту конкурентную арену в тот момент, когда разработчики в Китае и США продолжают расширять мультимодальные ИИ-системы — модели, объединяющие текст, изображения и автономное выполнение задач — как для потребительского, так и для корпоративного применения.