Tether Data libera como código abierto VisionPsy-Nano, un modelo de visión-lenguaje de 460M de parámetros para dispositivos
Puntos clave
- •Tether Data ha publicado VisionPsy-Nano, un modelo de visión-lenguaje de 460 millones de parámetros que procesa imágenes y texto completamente en dispositivos periféricos sin transmitir datos a servidores remotos.
- •El modelo obtuvo una puntuación de benchmark de 62.3, ocupando el primer lugar entre los modelos de visión-lenguaje evaluados con menos de 500 millones de parámetros y superando a competidores en 16 de 17 benchmarks.
- •Tether Data introdujo una variante Flash que conservó aproximadamente el 99% de la calidad del modelo estándar mientras generaba los primeros tokens de salida hasta 36 veces más rápido que modelos compactos seleccionados en el iPhone 15.
- •Ambas versiones del modelo se publican bajo la licencia Apache 2.0, permitiendo su uso sin regalías tanto para aplicaciones de investigación como comerciales.
- •La liberación de código abierto representa la expansión estratégica de Tether más allá de su negocio de stablecoin USDT hacia una infraestructura de IA descentralizada diseñada para implementación local en dispositivos.

Tether Data ha liberado como código abierto VisionPsy-Nano, un modelo de visión-lenguaje de 460 millones de parámetros diseñado para ejecutarse directamente en teléfonos inteligentes, laptops y otros dispositivos periféricos sin requerir conectividad continua a la nube. El lanzamiento marca la continua expansión de Tether más allá de su negocio central de stablecoins —USDT es la stablecoin más grande por capitalización de mercado— hacia la infraestructura de IA abierta.
El modelo fue desarrollado por QVAC, la iniciativa de investigación en inteligencia artificial de Tether Data, que se centra en la construcción de sistemas de IA abiertos, descentralizados y adaptables. El lanzamiento refleja un esfuerzo más amplio de la industria por trasladar capacidades multimodales avanzadas desde centros de datos centralizados a dispositivos controlados directamente por los usuarios. Apple, Google y otros han invertido de manera similar en el procesamiento de IA en el dispositivo, lo que puede reducir la latencia, disminuir los costos de servidores y mantener los datos del usuario de forma local en lugar de transmitirlos a servidores remotos.
VisionPsy-Nano está diseñado para procesar e interpretar tanto información visual como textual. Sus capacidades incluyen análisis de documentos, reconocimiento óptico de caracteres (OCR), comprensión de escenas, razonamiento visual y seguimiento de instrucciones. Tether Data afirmó que el modelo ofrece capacidades avanzadas de visión-lenguaje en dispositivos móviles y periféricos mientras funciona completamente sin procesamiento basado en la nube, lo que significa que las imágenes y el texto procesados por el modelo nunca salen del dispositivo.
Rendimiento en benchmarks
Según los resultados de evaluación publicados por Tether Data, VisionPsy-Nano obtuvo la puntuación normalizada general más alta entre los modelos de visión-lenguaje evaluados con menos de 500 millones de parámetros. El modelo registró una puntuación de 62.3, ocupando el primer lugar en la categoría de menos de 500 millones de parámetros en calidad y rendimiento generales.
La empresa informó que VisionPsy-Nano tuvo un desempeño favorable frente a sistemas compactos competidores en 16 de 17 benchmarks. Estos incluyeron modelos de Liquid AI y Hugging Face, así como el modelo base utilizado en el desarrollo de VisionPsy-Nano.
Dos versiones para precisión y velocidad
Tether Data lanzó dos versiones del modelo para satisfacer diferentes requisitos de implementación.
La versión VisionPsy-Nano-460M está optimizada para precisión y está diseñada para ofrecer un rendimiento sólido en las evaluaciones estándar de visión-lenguaje en su escala de parámetros.
La segunda versión, VisionPsy-Nano-460M-Flash, está diseñada para reducir los tiempos de respuesta en aplicaciones móviles del mundo real. La empresa indicó que el modelo Flash conservó aproximadamente el 99% de la calidad general de la versión completa, logrando una puntuación normalizada de 61.4. Tether Data atribuyó parte de la mejora de velocidad al uso de menos tokens visuales.
En pruebas realizadas en dispositivos que incluyen Google Pixel 9, Samsung Galaxy S23, Samsung Galaxy S25 Ultra y Apple iPhone 15, la versión Flash supuestamente generó su primer token de salida aproximadamente de 19 a 23 veces más rápido que modelos compactos seleccionados en varios dispositivos Android. La empresa informó que la ventaja de velocidad alcanzó hasta 36 veces en el iPhone 15. También indicó que el modelo mantuvo una latencia menor que varios sistemas competidores probados en los dispositivos seleccionados.
Amplias capacidades multimodales
A pesar de su tamaño relativamente pequeño, VisionPsy-Nano ocupó el primer lugar en cuatro categorías principales de capacidad en la evaluación de la empresa.
En comprensión de documentos y reconocimiento óptico de caracteres, el modelo fue diseñado para identificar texto e información estructural a partir de imágenes complejas, incluidos informes financieros, diagramas de flujo e infografías. Sus capacidades de percepción visual incluyen análisis de escenas y reconocimiento de distribución espacial. La empresa informó que el modelo superó al siguiente mejor sistema en su categoría de tamaño por un margen relativo de 4.6% en esa área.
Tether Data Open-Sources VisionPsy-Nano: Best-in-Class ~460M On-Device Vision-Language Model Leading Industry Benchmarks Learn more: — Tether (@tether) July 29, 2026
VisionPsy-Nano también demostró un fuerte rendimiento en razonamiento visual y conocimiento, superando a otros modelos en la categoría de aproximadamente 500 millones de parámetros por un margen relativo de 7.4%. La empresa además informó que el modelo tuvo un desempeño destacado en pruebas de seguimiento de instrucciones y confiabilidad. En evaluaciones seleccionadas, superó los resultados de modelos de 1.6 a 2.3 veces su tamaño.
Tether AI just released VisionPsy, a best-in-class state-of-the-art vision language model optimized for edge devices (phones, laptops, …) with the highest overall score in its class/weight — Paolo Ardoino (@paoloardoino) July 29, 2026
Tether Data señaló que los resultados de benchmark del modelo demostraron que los sistemas de IA compactos pueden competir con modelos sustancialmente más grandes y seguir siendo adecuados para su implementación directa en dispositivos de consumo.
Liberación de código abierto y opciones de implementación
Ambas versiones se han publicado con pesos de modelo abiertos bajo la licencia Apache 2.0, una de las licencias de código abierto permisivas más utilizadas, que permite tanto el uso en investigación como comercial sin obligaciones de regalías. La empresa señaló que los modelos están destinados a respaldar la investigación, la educación y un acceso más amplio para desarrolladores.
Los desarrolladores pueden utilizar los modelos mediante tres opciones de implementación. La inferencia de precisión completa está disponible a través de Hugging Face Transformers, mientras que las versiones GGUF cuantizadas se pueden implementar en dispositivos móviles a través de llama.cpp. También está disponible una opción orientada a producción mediante vLLM para inferencia de servidor de alto rendimiento.
Tether Data también ha publicado configuraciones de evaluación y frameworks de prueba basados en el protocolo VLMEvalKit para garantizar la reproducibilidad.
Paolo Ardoino, director ejecutivo de Tether, afirmó que los resultados demostraron que la IA eficiente implementada localmente puede ofrecer un rendimiento de alta calidad sin depender completamente de centros de datos centralizados. Indicó que poner la tecnología a disposición de forma abierta podría brindar a los desarrolladores un mayor acceso a herramientas de IA privadas que funcionan en dispositivos que los usuarios ya poseen.