NotizieCryptoTether Data Rende Open Source VisionPsy-Nano, un Modello Vision-Language On-Device da 460 Milioni di Parametri

Tether Data Rende Open Source VisionPsy-Nano, un Modello Vision-Language On-Device da 460 Milioni di Parametri

Autore: CoinTrust·

Punti chiave

  • Tether Data ha rilasciato VisionPsy-Nano, un modello vision-language da 460 milioni di parametri che elabora immagini e testo interamente su dispositivi edge senza trasmettere dati a server remoti.
  • Il modello ha ottenuto un punteggio benchmark di 62,3, classificandosi al primo posto tra i modelli vision-language valutati con meno di 500 milioni di parametri e superando i concorrenti in 16 dei 17 benchmark.
  • Tether Data ha introdotto una variante Flash che ha mantenuto circa il 99% della qualità del modello standard, generando i primi token di output fino a 36 volte più velocemente rispetto ai modelli compatti selezionati sull'iPhone 15.
  • Entrambe le versioni del modello sono rilasciate con licenza Apache 2.0, consentendo l'uso privo di royalty sia per applicazioni di ricerca che commerciali.
  • Il rilascio open source rappresenta l'espansione strategica di Tether oltre il suo business di stablecoin USDT verso un'infrastruttura AI decentralizzata costruita per l'implementazione su dispositivi locali.
Tether Data Rende Open Source VisionPsy-Nano, un Modello Vision-Language On-Device da 460 Milioni di Parametri

Tether Data ha reso open source VisionPsy-Nano, un modello vision-language da 460 milioni di parametri progettato per funzionare direttamente su smartphone, laptop e altri dispositivi edge senza richiedere connettività cloud continua. Il rilascio segna la continua espansione di Tether oltre il suo core business di stablecoin—USDT è la più grande stablecoin per capitalizzazione di mercato—verso un'infrastruttura AI open source.

Il modello è stato sviluppato da QVAC, l'iniziativa di ricerca sull'intelligenza artificiale di Tether Data, che si concentra sulla costruzione di sistemi AI aperti, decentralizzati e adattivi. Il rilascio riflette uno sforzo industriale più ampio per spostare le capacità multimodali avanzate dai data center centralizzati ai dispositivi controllati direttamente dagli utenti. Apple, Google e altri hanno investito in modo simile nell'elaborazione AI on-device, che può ridurre la latenza, abbassare i costi del server e mantenere i dati dell'utente a livello locale piuttosto che trasmetterli a server remoti.

VisionPsy-Nano è progettato per elaborare e interpretare sia informazioni visive che testuali. Le sue capacità includono l'analisi dei documenti, il riconoscimento ottico dei caratteri (OCR), la comprensione della scena, il ragionamento visivo e il seguito delle istruzioni. Tether Data ha affermato che il modello offre capacità vision-language avanzate su dispositivi mobili e edge mentre opera interamente senza elaborazione basata su cloud, il che significa che le immagini e il testo elaborati dal modello non lasciano mai il dispositivo.

Prestazioni Benchmark

Secondo i risultati di valutazione pubblicati da Tether Data, VisionPsy-Nano ha ottenuto il punteggio normalizzato complessivo più alto tra i modelli vision-language valutati con meno di 500 milioni di parametri. Il modello ha registrato un punteggio di 62,3, classificandosi al primo posto nella categoria sotto i 500 milioni di parametri per qualità e prestazioni complessive.

L'azienda ha riferito che VisionPsy-Nano ha performato favorevolmente rispetto ai sistemi compatti concorrenti su 16 dei 17 benchmark. Questi includevano modelli di Liquid AI e Hugging Face, così come il modello base utilizzato nello sviluppo di VisionPsy-Nano.

Due Versioni Affrontano i Requisiti di Accuratezza e Velocità

Tether Data ha rilasciato due versioni del modello per supportare diversi requisiti di implementazione.

La versione VisionPsy-Nano-460M è ottimizzata per l'accuratezza ed è destinata a fornire prestazioni elevate nelle valutazioni vision-language standard per la sua scala di parametri.

La seconda versione, VisionPsy-Nano-460M-Flash, è progettata per ridurre i tempi di risposta per le applicazioni mobili del mondo reale. L'azienda ha dichiarato che il modello Flash ha mantenuto circa il 99% della qualità complessiva della versione completa ottenendo un punteggio normalizzato di 61,4. Tether Data ha attribuito parte del miglioramento della velocità all'uso di meno token visivi.

In test condotti su dispositivi tra cui Google Pixel 9, Samsung Galaxy S23, Samsung Galaxy S25 Ultra e Apple iPhone 15, la versione Flash ha generato il suo primo token di output circa 19-23 volte più velocemente rispetto a modelli compatti selezionati su diversi dispositivi Android. L'azienda ha riferito che il vantaggio di velocità ha raggiunto fino a 36 volte sull'iPhone 15. Ha inoltre dichiarato che il modello ha mantenuto una latenza inferiore rispetto a diversi sistemi concorrenti testati sui dispositivi selezionati.

Ampie Capacità Multimodali

Nonostante le dimensioni relativamente piccole, VisionPsy-Nano si è classificato al primo posto in quattro principali categorie di capacità nella valutazione dell'azienda.

Nella comprensione dei documenti e nel riconoscimento ottico dei caratteri, il modello è stato progettato per identificare testo e informazioni strutturali da immagini complesse, inclusi report finanziari, diagrammi di flusso e infografiche. Le sue capacità di percezione visiva includono l'analisi della scena e il riconoscimento del layout spaziale. L'azienda ha riferito che il modello ha superato il sistema successivo migliore nella sua categoria di dimensioni di un margine relativo del 4,6% in quell'area.

Tether Data Open-Sources VisionPsy-Nano: Best-in-Class ~460M On-Device Vision-Language Model Leading Industry Benchmarks Learn more: — Tether (@tether) July 29, 2026

VisionPsy-Nano ha inoltre dimostrato solide prestazioni di ragionamento visivo e conoscenza, superando altri modelli nella categoria di circa 500 milioni di parametri di un margine relativo del 7,4%. L'azienda ha inoltre riferito che il modello ha performato fortemente nei test di seguimento delle istruzioni e affidabilità. Su valutazioni selezionate, ha superato i risultati di modelli grandi da 1,6 a 2,3 volte la sua dimensione.

Tether AI just released VisionPsy, a best-in-class state-of-the-art vision language model optimized for edge devices (phones, laptops, …) with the highest overall score in its class/weight — Paolo Ardoino (@paoloardoino) July 29, 2026

Tether Data ha affermato che i risultati benchmark del modello hanno dimostrato che i sistemi AI compatti potrebbero competere con modelli sostanzialmente più grandi rimanendo adatti per il deployment diretto sui dispositivi consumer.

Rilascio Open Source e Opzioni di Implementazione

Entrambe le versioni sono state rilasciate con pesi del modello aperti sotto la licenza Apache 2.0, una delle licenze open source permissive più utilizzate, che consente sia l'uso per la ricerca che commerciale senza obblighi di royalty. L'azienda ha detto che i modelli sono destinati a supportare la ricerca, l'istruzione e un accesso più ampio per gli sviluppatori.

Gli sviluppatori possono utilizzare i modelli attraverso tre opzioni di deployment. L'inferenza a precisione completa è disponibile tramite Hugging Face Transformers, mentre le versioni GGUF quantizzate possono essere implementate su dispositivi mobili tramite llama.cpp. È disponibile anche un'opzione orientata alla produzione che utilizza vLLM per l'inferenza su server ad alta velocità.

Tether Data ha anche rilasciato configurazioni di valutazione e framework di test basati sul protocollo VLMEvalKit per supportare la riproducibilità.

Paolo Ardoino, Amministratore Delegato di Tether, ha dichiarato che i risultati hanno dimostrato che un'AI efficiente e implementata localmente potrebbe fornire prestazioni di alta qualità senza dipendere interamente dai data center centralizzati. Ha indicato che rendere la tecnologia liberamente disponibile potrebbe dare agli sviluppatori un maggiore accesso ad strumenti AI privati che operano su dispositivi già di proprietà degli utenti.