DeepSeek presenta un modello sperimentale per la visione, citando test interni vicini a Opus 4.8 di Anthropic
Punti chiave
- •DeepSeek ha annunciato DeepSeek-V4-Flash-Vision-Exp il 21 agosto 2026, aggiungendo per la prima volta l'elaborazione di immagini e screenshot alla famiglia di modelli V4 Flash.
- •Il modello sperimentale conserva le capacità testuali, di ragionamento, agentiche e di conoscenza generale di DeepSeek-V4-Flash ed è disponibile per gli sviluppatori tramite l'API di DeepSeek.
- •Le valutazioni interne di DeepSeek hanno mostrato prestazioni simili a quelle di Opus 4.8 di Anthropic nei test su agenti multimodali, ma sono ancora necessari benchmark di terze parti per verificare le affermazioni.
- •Il lancio avviene in un contesto di crescente competizione sull'IA tra Cina e Stati Uniti, che include il controllo statunitense sugli sviluppatori cinesi e il piano nazionale cinese di investimenti nell'IA fino al 2030.
- •Secondo quanto riportato, Anthropic starebbe preparando una possibile offerta pubblica iniziale che potrebbe essere presentata già questo mese, con Morgan Stanley, Goldman Sachs e JPMorgan coinvolte nei preparativi.

La cinese DeepSeek ha presentato un modello di intelligenza artificiale multimodale sperimentale in grado di elaborare immagini e screenshot, ampliando la propria famiglia di modelli V4 mentre la competizione tra i principali sviluppatori di intelligenza artificiale al mondo — in Cina come negli Stati Uniti — continua ad accentuarsi.
Il rilascio, annunciato il 21 agosto 2026, aggiunge per la prima volta l'elaborazione visiva alla linea V4, mentre il sistema testuale esistente resta al suo posto anziché essere sostituito. L'input di immagini è diventato una capacità standard nei modelli di frontiera di OpenAI, Google e Anthropic, e questa aggiunta porta la più recente famiglia di modelli di DeepSeek in linea con tale baseline.
DeepSeek aggiunge capacità visive a V4 Flash
DeepSeek ha annunciato DeepSeek-V4-Flash-Vision-Exp, un modello sperimentale che aggiunge l'elaborazione visiva alla piattaforma V4 Flash. Gli utenti possono caricare immagini e screenshot e chiedere al modello di analizzarne il contenuto o di completare attività basandosi su ciò che vede.
L'azienda ha dichiarato che il nuovo modello mantiene le capacità testuali di DeepSeek-V4-Flash, tra cui ragionamento, attività agentiche e conoscenza generale. DeepSeek ha descritto il rilascio come un'estensione multimodale della propria famiglia di modelli più recente, e non come una sostituzione del sistema testuale esistente.
«Questo modello multimodale sperimentale eguaglia DeepSeek-V4-Flash nelle capacità testuali — incluse le capacità degli agenti, il ragionamento e la conoscenza del mondo», ha dichiarato DeepSeek.
Il modello è disponibile tramite l'interfaccia di programmazione delle applicazioni (API) di DeepSeek, che consente agli sviluppatori di aggiungere funzioni basate sulle immagini — come l'analisi degli screenshot caricati — ai propri prodotti e servizi e di costruire sulla piattaforma applicazioni di IA visiva.
La notizia del rilascio è stata condivisa su X da Walter Bloomberg (@DeItaone):
DEEPSEEK CHALLENGES ANTHROPIC WITH NEW AI MODEL
DeepSeek has unveiled an experimental multimodal AI model capable of analyzing images, screenshots and text while performing autonomous tasks.
Called DeepSeek-V4-Flash-Vision-Exp, the model reportedly approaches Anthropic's Opus…
— Walter Bloomberg (@DeItaone) August 21, 2026
DeepSeek confronta il modello con Opus 4.8 di Anthropic
DeepSeek ha dichiarato che le valutazioni interne hanno mostrato il nuovo modello a livelli simili a quelli di Opus 4.8 di Anthropic nei test su agenti multimodali. Questi test misurano come i sistemi di IA gestiscono attività che richiedono sia input visivi sia una limitata guida umana. Il confronto mette il modello sperimentale direttamente di fronte a uno dei sistemi di fascia più alta di Anthropic.
Anthropic ha posto l'accento sulle capacità agentiche lungo la propria linea Claude, inclusa una funzione di utilizzo del computer introdotta alla fine del 2024 che consente al modello di interpretare ciò che appare su uno schermo e di svolgere attività all'interno delle applicazioni — un ambito che si sovrappone alle attività basate sugli screenshot per le quali è costruito il nuovo modello di DeepSeek.
Tuttavia, le affermazioni di DeepSeek si basano su test condotti dall'azienda stessa e saranno necessari benchmark di terze parti più ampi per confrontare le prestazioni su carichi di lavoro diversi.
DeepSeek ha già sviluppato modelli vision-language attraverso la famiglia DeepSeek-VL, una linea precedente di modelli che combinano la comprensione delle immagini con l'elaborazione del linguaggio. L'ultimo rilascio porta funzioni visive simili nella più recente linea V4, ampliando la gamma di attività che la piattaforma può gestire. L'azienda, un laboratorio di IA sostenuto dall'hedge fund quantitativo cinese High-Flyer, ha attirato per la prima volta l'attenzione globale nel gennaio 2025, quando il suo modello di ragionamento R1 ha ottenuto risultati competitivi rispetto ai principali sistemi statunitensi con una frazione dei costi di addestramento dichiarati.
La competizione sull'IA cresce tra Cina e Stati Uniti
Il lancio avviene mentre le aziende cinesi di IA continuano ad ampliare lo sviluppo di modelli su testo, visione e capacità agentiche. La Cina ha inoltre introdotto un piano nazionale fino al 2030 che prevede maggiori investimenti in chip per l'IA, sistemi di calcolo di grandi dimensioni, modelli multimodali, agenti autonomi e tecnologia blockchain.
Gli sviluppatori cinesi sono inoltre oggetto di un controllo crescente da parte delle autorità statunitensi sulla competizione nell'IA avanzata. Il dibattito recente ha incluso preoccupazioni relative alla proprietà intellettuale, ai metodi di addestramento dei modelli e all'accesso all'hardware di calcolo di fascia alta necessario per addestrare modelli di grandi dimensioni.
Nel frattempo, Anthropic starebbe preparando una possibile offerta pubblica iniziale. L'azienda potrebbe presentare la domanda già questo mese, con Morgan Stanley, Goldman Sachs e JPMorgan indicate come coinvolte nei preparativi.
Il potenziale listino ha attirato l'attenzione dopo che SpaceX ha completato un IPO che ha raccolto circa 86,2 miliardi di dollari, overallotment incluso. I confronti tra le due aziende restano di natura speculativa perché Anthropic non ha annunciato le condizioni definitive dell'offerta né una valutazione confermata.
Il nuovo modello di DeepSeek entra in questo ambiente competitivo mentre gli sviluppatori in Cina e negli Stati Uniti continuano ad ampliare i sistemi di IA multimodale — modelli che combinano testo, immagini ed esecuzione autonoma di attività — sia per l'uso consumer sia per quello aziendale.