Tether Data rend open-source VisionPsy-Nano, un modèle de vision-langage sur appareil de 460 millions de paramètres
Points clés
- •Tether Data a publié VisionPsy-Nano, un modèle de vision-langage de 460 millions de paramètres qui traite les images et les textes entièrement sur des appareils périphériques sans transmettre de données à des serveurs distants.
- •Le modèle a obtenu un score de référence de 62.3, se classant premier parmi les modèles de vision-langage évalués avec moins de 500 millions de paramètres et surpassant les concurrents sur 16 des 17 benchmarks.
- •Tether Data a introduit une variante Flash qui a conservé environ 99 % de la qualité du modèle standard tout en générant les premiers jetons de sortie jusqu'à 36 fois plus rapidement que certains modèles compacts sur l'iPhone 15.
- •Les deux versions du modèle sont publiées sous la licence Apache 2.0, permettant une utilisation sans redevance pour la recherche et les applications commerciales.
- •La publication open-source représente l'expansion stratégique de Tether au-delà de son activité de stablecoin USDT vers une infrastructure d'IA décentralisée conçue pour le déploiement local sur les appareils.

Tether Data a rendu open-source VisionPsy-Nano, un modèle de vision-langage de 460 millions de paramètres conçu pour fonctionner directement sur les smartphones, les ordinateurs portables et autres appareils périphériques sans nécessiter de connectivité cloud continue. Cette publication marque l'expansion continue de Tether au-delà de son activité principale de stablecoin — l'USDT est le plus grand stablecoin par capitalisation boursière — vers une infrastructure IA ouverte.
Le modèle a été développé par QVAC, l'initiative de recherche en intelligence artificielle de Tether Data, qui se concentre sur la création de systèmes d'IA ouverts, décentralisés et adaptatifs. Cette publication reflète un effort plus large de l'industrie pour déplacer les capacités multimodales avancées des centres de données centralisés vers des appareils contrôlés directement par les utilisateurs. Apple, Google et d'autres ont investi de manière similaire dans le traitement de l'IA sur l'appareil, ce qui peut réduire la latence, abaisser les coûts des serveurs et garder les données des utilisateurs localement plutôt que de les transmettre à des serveurs distants.
VisionPsy-Nano est conçu pour traiter et interpréter à la fois des informations visuelles et textuelles. Ses capacités incluent l'analyse de documents, la reconnaissance optique de caractères (OCR), la compréhension de scène, le raisonnement visuel et le suivi d'instructions. Tether Data a déclaré que le modèle offre des capacités avancées de vision-langage sur les appareils mobiles et périphériques tout en fonctionnant entièrement sans traitement basé sur le cloud, ce qui signifie que les images et les textes traités par le modèle ne quittent jamais l'appareil.
Performances de référence
Selon les résultats d'évaluation publiés par Tether Data, VisionPsy-Nano a obtenu le score normalisé global le plus élevé parmi les modèles de vision-langage évalués comptant moins de 500 millions de paramètres. Le modèle a enregistré un score de 62.3, se classant premier dans la catégorie des moins de 500 millions de paramètres pour la qualité et les performances globales.
L'entreprise a rapporté que VisionPsy-Nano a obtenu des résultats favorables par rapport aux systèmes compacts concurrents sur 16 des 17 benchmarks. Cela inclut des modèles de Liquid AI et de Hugging Face, ainsi que le modèle de base utilisé dans le développement de VisionPsy-Nano.
Deux versions pour répondre aux exigences de précision et de vitesse
Tether Data a publié deux versions du modèle pour répondre à différentes exigences de déploiement.
La version VisionPsy-Nano-460M est optimisée pour la précision et est destinée à fournir de solides performances dans les évaluations standard de vision-langage à son échelle de paramètres.
La deuxième version, VisionPsy-Nano-460M-Flash, est conçue pour réduire les temps de réponse des applications mobiles réelles. L'entreprise a déclaré que le modèle Flash a conservé environ 99 % de la qualité globale de la version complète tout en atteignant un score normalisé de 61.4. Tether Data a attribué une partie de l'amélioration de la vitesse à l'utilisation de moins de jetons visuels.
Lors de tests effectués sur des appareils, notamment le Google Pixel 9, le Samsung Galaxy S23, le Samsung Galaxy S25 Ultra et l'Apple iPhone 15, la version Flash aurait généré son premier jeton de sortie environ 19 à 23 fois plus rapidement que certains modèles compacts sur plusieurs appareils Android. L'entreprise a rapporté que l'avantage de vitesse atteignait jusqu'à 36 fois sur l'iPhone 15. Elle a également déclaré que le modèle maintenait une latence inférieure à celle de plusieurs systèmes concurrents testés sur les appareils sélectionnés.
De larges capacités multimodales
Malgré sa taille relativement petite, VisionPsy-Nano s'est classé premier dans quatre grandes catégories de capacités dans l'évaluation de l'entreprise.
Dans la compréhension de documents et la reconnaissance optique de caractères, le modèle a été conçu pour identifier les textes et les informations structurelles à partir d'images complexes, y compris les rapports financiers, les organigrammes et les infographies. Ses capacités de perception visuelle incluent l'analyse de scène et la reconnaissance de la disposition spatiale. L'entreprise a rapporté que le modèle a dépassé le prochain meilleur système de sa catégorie de taille par une marge relative de 4.6 % dans ce domaine.
Tether Data Open-Sources VisionPsy-Nano: Best-in-Class ~460M On-Device Vision-Language Model Leading Industry Benchmarks Learn more: — Tether (@tether) July 29, 2026
VisionPsy-Nano a également démontré de solides performances en matière de raisonnement visuel et de connaissances, surpassant les autres modèles de la catégorie d'environ 500 millions de paramètres par une marge relative de 7.4 %. L'entreprise a en outre rapporté que le modèle a performé fortement dans les tests de suivi d'instructions et de fiabilité. Lors de certaines évaluations, il a dépassé les résultats de modèles mesurant de 1.6 à 2.3 fois sa taille.
Tether AI just released VisionPsy, a best-in-class state-of-the-art vision language model optimized for edge devices (phones, laptops, …) with the highest overall score in its class/weight — Paolo Ardoino (@paoloardoino) July 29, 2026
Tether Data a déclaré que les résultats de référence du modèle montraient que les systèmes d'IA compacts pouvaient rivaliser avec des modèles nettement plus vastes tout en restant adaptés au déploiement direct sur les appareils grand public.
Version open-source et options de déploiement
Les deux versions ont été publiées avec des poids de modèle ouverts sous la licence Apache 2.0, l'une des licences open-source permissives les plus utilisées, qui autorise la recherche et l'utilisation commerciale sans obligations de redevances. L'entreprise a déclaré que les modèles sont destinés à soutenir la recherche, l'éducation et un accès plus large pour les développeurs.
Les développeurs peuvent utiliser les modèles via trois options de déploiement. L'inférence en pleine précision est disponible via Hugging Face Transformers, tandis que les versions GGUF quantifiées peuvent être déployées sur des appareils mobiles via llama.cpp. Une option orientée production utilisant vLLM est également disponible pour une inférence serveur à haut débit.
Tether Data a également publié des configurations d'évaluation et des cadres de test basés sur le protocole VLMEvalKit pour soutenir la reproductibilité.
Paolo Ardoino, directeur général de Tether, a déclaré que les résultats démontraient qu'une IA efficace et déployée localement pouvait fournir des performances de haute qualité sans dépendre entièrement de centres de données centralisés. Il a indiqué que le fait de rendre la technologie ouvertement disponible pourrait donner aux développeurs un meilleur accès à des outils d'IA privés fonctionnant sur des appareils déjà possédés par les utilisateurs.