DeepSeek presenta un modelo de visión experimental que, según pruebas internas, se acerca al Opus 4.8 de Anthropic
Puntos clave
- •DeepSeek anunció DeepSeek-V4-Flash-Vision-Exp el 21 de agosto de 2026, incorporando por primera vez el procesamiento de imágenes y capturas de pantalla a su familia de modelos V4 Flash.
- •El modelo experimental conserva las capacidades de texto, razonamiento, tareas de agente y conocimiento general de DeepSeek-V4-Flash y está disponible para los desarrolladores a través de la API de DeepSeek.
- •Las evaluaciones internas de la propia DeepSeek mostraron un rendimiento similar al del Opus 4.8 de Anthropic en pruebas de agentes multimodales, aunque aún se necesitan evaluaciones comparativas de terceros para verificar estas afirmaciones.
- •El lanzamiento se produce en medio de la creciente competencia en IA entre China y Estados Unidos, que incluye el escrutinio de EE. UU. hacia los desarrolladores chinos y el plan nacional de inversión en IA de China hasta 2030.
- •Según informes, Anthropic se prepara para una posible oferta pública inicial que podría presentarse ya este mes, y se dice que Morgan Stanley, Goldman Sachs y JPMorgan participan en los preparativos.

DeepSeek, de China, ha presentado un modelo experimental de inteligencia artificial multimodal capaz de procesar imágenes y capturas de pantalla, ampliando su familia de modelos V4 mientras la competencia entre los principales desarrolladores de inteligencia artificial del mundo —tanto en China como en Estados Unidos— sigue intensificándose.
El lanzamiento, anunciado el 21 de agosto de 2026, incorpora por primera vez el procesamiento visual a la línea V4, mientras que el sistema de texto existente se mantiene en lugar de ser reemplazado. La entrada de imágenes se ha convertido en una capacidad estándar en los modelos de vanguardia de OpenAI, Google y Anthropic, y esta incorporación coloca a la familia de modelos más reciente de DeepSeek en línea con ese punto de referencia.
DeepSeek añade capacidades de visión a V4 Flash
DeepSeek anunció DeepSeek-V4-Flash-Vision-Exp, un modelo experimental que añade procesamiento visual a su plataforma V4 Flash. Los usuarios pueden subir imágenes y capturas de pantalla y luego pedirle al modelo que analice el contenido o realice tareas basándose en lo que ve.
La empresa señaló que el nuevo modelo mantiene las capacidades de texto de DeepSeek-V4-Flash, incluidos el razonamiento, las tareas de agente y el conocimiento general. DeepSeek describió el lanzamiento como una extensión multimodal de su familia de modelos más reciente y no como un reemplazo de su sistema de texto existente.
"Este modelo multimodal experimental iguala a DeepSeek-V4-Flash en capacidades de texto, incluidos los agentes, el razonamiento y el conocimiento del mundo", afirmó DeepSeek.
El modelo está disponible a través de la interfaz de programación de aplicaciones (API) de DeepSeek, lo que permite a los desarrolladores añadir funciones basadas en imágenes —como el análisis de capturas de pantalla subidas— a sus propios productos y servicios, así como construir aplicaciones de IA visual sobre la plataforma.
La noticia del lanzamiento fue compartida en X por Walter Bloomberg (@DeItaone):
DEEPSEEK CHALLENGES ANTHROPIC WITH NEW AI MODEL
DeepSeek has unveiled an experimental multimodal AI model capable of analyzing images, screenshots and text while performing autonomous tasks.
Called DeepSeek-V4-Flash-Vision-Exp, the model reportedly approaches Anthropic's Opus…
— Walter Bloomberg (@DeItaone) August 21, 2026
DeepSeek compara su modelo con el Opus 4.8 de Anthropic
DeepSeek indicó que sus evaluaciones internas mostraron que su nuevo modelo alcanza niveles similares a los del Opus 4.8 de Anthropic en pruebas de agentes multimodales. Estas pruebas miden cómo los sistemas de IA manejan tareas que requieren tanto información visual como una guía humana limitada. La comparación enfrenta directamente al modelo experimental con uno de los sistemas de gama más alta de Anthropic.
Anthropic ha hecho hincapié en las capacidades de agente en toda su línea Claude, incluida una función de uso de computadora introducida a finales de 2024 que permite al modelo interpretar lo que aparece en pantalla y realizar tareas dentro de las aplicaciones, lo que se superpone con las tareas basadas en capturas de pantalla para las que está diseñado el nuevo modelo de DeepSeek.
Sin embargo, las afirmaciones de DeepSeek se basan en sus propias pruebas, y serán necesarias evaluaciones comparativas de terceros más amplias para comparar el rendimiento en diferentes cargas de trabajo.
DeepSeek ya ha desarrollado modelos de visión y lenguaje a través de su familia DeepSeek-VL, una línea anterior de modelos que combinan la comprensión de imágenes con el procesamiento del lenguaje. El último lanzamiento incorpora funciones visuales similares a la más reciente línea V4, ampliando la gama de tareas que la plataforma puede manejar. La empresa, un laboratorio de IA respaldado por el fondo de cobertura cuantitativo chino High-Flyer, atrajo por primera vez la atención mundial en enero de 2025, cuando su modelo de razonamiento R1 logró resultados competitivos frente a los principales sistemas de EE. UU. con una fracción de los costos de entrenamiento reportados.
La competencia en IA crece entre China y Estados Unidos
El lanzamiento se produce mientras las empresas chinas de IA continúan expandiendo el desarrollo de modelos en capacidades de texto, visión y agentes. China también ha presentado un plan nacional hasta 2030 que contempla una mayor inversión en chips de IA, grandes sistemas de cómputo, modelos multimodales, agentes autónomos y tecnología blockchain.
Los desarrolladores chinos también enfrentan un escrutinio creciente por parte de funcionarios de EE. UU. por la competencia en IA avanzada. El debate reciente ha incluido preocupaciones sobre la propiedad intelectual, los métodos de entrenamiento de modelos y el acceso al hardware de cómputo de gama alta necesario para entrenar modelos grandes.
Mientras tanto, según informes, Anthropic se prepara para una posible oferta pública inicial. La empresa podría presentar la solicitud ya este mes, y se dice que Morgan Stanley, Goldman Sachs y JPMorgan participan en los preparativos.
La posible cotización ha llamado la atención después de que SpaceX completara una OPV que recaudó unos 86.2 mil millones de dólares, incluida su sobreasignación. Las comparaciones entre ambas empresas siguen siendo especulativas porque Anthropic no ha anunciado los términos definitivos de la oferta ni una valoración confirmada.
El nuevo modelo de DeepSeek llega a ese entorno competitivo mientras los desarrolladores de China y Estados Unidos continúan expandiendo los sistemas de IA multimodal —modelos que combinan texto, imágenes y ejecución autónoma de tareas— tanto para el uso de consumo como para el empresarial.