Tether Data открывает исходный код VisionPsy-Nano — визуально-языковой модели на 460 млн параметров для запуска на устройствах
Ключевые выводы
- •Tether Data выпустила VisionPsy-Nano — визуально-языковую модель на 460 миллионов параметров, которая обрабатывает изображения и текст полностью на периферийных устройствах, не передавая данные на удаленные серверы.
- •Модель достигла балла 62,3 на бенчмарках, заняв первое место среди оцененных визуально-языковых моделей с числом параметров менее 500 миллионов и превзойдя конкурентов на 16 из 17 бенчмарков.
- •Tether Data представила Flash-вариант, сохранивший около 99% качества стандартной модели, при этом генерируя первый токен вывода до 36 раз быстрее выбранных компактных моделей на iPhone 15.
- •Обе версии модели выпущены под лицензией Apache 2.0, что позволяет использовать их без выплаты роялти как в исследовательских, так и в коммерческих целях.
- •Релиз с открытым исходным кодом представляет собой стратегическое расширение Tether за пределы бизнеса стейблкоина USDT в сторону децентрализованной ИИ-инфраструктуры, созданной для локального развертывания на устройствах.

Tether Data открыла исходный код VisionPsy-Nano — визуально-языковой модели на 460 миллионов параметров, спроектированной для работы непосредственно на смартфонах, ноутбуках и других периферийных устройствах без необходимости постоянного подключения к облаку. Релиз знаменует собой продолжение расширения Tether за пределы ее основного бизнеса стейблкоинов — USDT является крупнейшим по рыночной капитализации стейблкоином — в сторону открытой ИИ-инфраструктуры.
Модель была разработана QVAC, исследовательской инициативой в области искусственного интеллекта подразделения Tether Data, которая сосредоточена на создании открытых, децентрализованных и адаптивных ИИ-систем. Релиз отражает более широкую отраслевую тенденцию к переносу передовых мультимодальных возможностей из централизованных дата-центров на устройства, управляемые непосредственно пользователями. Apple, Google и другие компании также инвестируют в обработку ИИ на устройствах, что позволяет снизить задержку, уменьшить серверные расходы и хранить данные пользователя локально, не передавая их на удаленные серверы.
VisionPsy-Nano предназначена для обработки и интерпретации как визуальной, так и текстовой информации. Ее возможности включают анализ документов, оптическое распознавание символов (OCR), понимание сцен, визуальное мышление и выполнение инструкций. Tether Data заявила, что модель обеспечивает передовые визуально-языковые возможности на мобильных и периферийных устройствах, работая полностью без облачной обработки, что означает, что изображения и текст, обрабатываемые моделью, никогда не покидают устройство.
Производительность на бенчмарках
Согласно опубликованным Tether Data результатам оценки, VisionPsy-Nano достигла наивысшего общего нормализованного балла среди оцененных визуально-языковых моделей с числом параметров менее 500 миллионов. Модель набрала 62,3 балла, заняв первое место в категории до 500 миллионов параметров по общему качеству и производительности.
Компания сообщила, что VisionPsy-Nano показала хорошие результаты в сравнении с конкурирующими компактными системами на 16 из 17 бенчмарков. Среди них были модели от Liquid AI и Hugging Face, а также базовая модель, использованная при разработке VisionPsy-Nano.
Две версии для разных требований к точности и скорости
Tether Data выпустила две версии модели для поддержки различных сценариев развертывания.
Версия VisionPsy-Nano-460M оптимизирована для точности и предназначена для обеспечения высокой производительности в стандартных визуально-языковых тестах в своем диапазоне параметров.
Вторая версия, VisionPsy-Nano-460M-Flash, разработана для сокращения времени отклика в реальных мобильных приложениях. Компания сообщила, что Flash-модель сохранила около 99% общего качества полной версии, достигнув нормализованного балла 61,4. Tether Data объяснила часть улучшения скорости использованием меньшего числа визуальных токенов.
В тестах, проведенных на устройствах, включая Google Pixel 9, Samsung Galaxy S23, Samsung Galaxy S25 Ultra и Apple iPhone 15, Flash-версия, как сообщается, генерировала первый токен вывода примерно в 19–23 раза быстрее, чем выбранные компактные модели, на нескольких Android-устройствах. Компания сообщила, что преимущество в скорости достигало 36-кратного значения на iPhone 15. Также было заявлено, что модель сохраняла более низкую задержку по сравнению с несколькими конкурирующими системами, протестированными на выбранных устройствах.
Широкие мультимодальные возможности
Несмотря на относительно небольшой размер, VisionPsy-Nano заняла первое место в четырех основных категориях возможностей по результатам оценки компании.
В области понимания документов и оптического распознавания символов модель разработана для извлечения текста и структурной информации из сложных изображений, включая финансовые отчеты, блок-схемы и инфографику. Ее возможности визуального восприятия включают анализ сцен и распознавание пространственного расположения. Компания сообщила, что модель превзошла следующую лучшую систему в своей размерной категории с относительным отрывом 4,6% в этой области.
Tether Data Open-Sources VisionPsy-Nano: Best-in-Class ~460M On-Device Vision-Language Model Leading Industry Benchmarks Learn more: — Tether (@tether) July 29, 2026
VisionPsy-Nano также продемонстрировала высокие результаты визуального мышления и работы с знаниями, превзойдя другие модели в категории около 500 миллионов параметров с относительным отрывом 7,4%. Компания дополнительно сообщила, что модель показала сильные результаты в тестах на выполнение инструкций и надежность. В отдельных оценках она превзошла результаты моделей, превышающих ее по размеру в 1,6–2,3 раза.
Tether AI just released VisionPsy, a best-in-class state-of-the-art vision language model optimized for edge devices (phones, laptops, …) with the highest overall score in its class/weight — Paolo Ardoino (@paoloardoino) July 29, 2026
Tether Data заявила, что результаты бенчмарков модели показывают: компактные ИИ-системы могут конкурировать с существенно более крупными моделями, оставаясь при этом пригодными для прямого развертывания на потребительских устройствах.
Релиз с открытым исходным кодом и варианты развертывания
Обе версии выпущены с открытыми весами модели под лицензией Apache 2.0 — одной из наиболее широко используемых разрешительных лицензий открытого исходного кода, которая допускает как исследовательское, так и коммерческое использование без выплаты роялти. Компания сообщила, что модели предназначены для поддержки исследований, образования и более широкого доступа разработчиков.
Разработчики могут использовать модели через три варианта развертывания. Инференс с полной точностью доступен через Hugging Face Transformers, в то время как квантованные GGUF-версии могут быть развернуты на мобильных устройствах через llama.cpp. Также доступен вариант для production-окружения на базе vLLM для серверного инференса с высокой пропускной способностью.
Tether Data также выпустила конфигурации оценки и тестовые фреймворки на основе протокола VLMEvalKit для обеспечения воспроизводимости результатов.
Паоло Ардоино (Paolo Ardoino), главный исполнительный директор Tether, заявил, что результаты демонстрируют: эффективный локально развернутый ИИ способен обеспечивать высококачественную производительность без полной зависимости от централизованных дата-центров. Он указал, что открытое предоставление этой технологии может дать разработчикам более широкий доступ к приватным ИИ-инструментам, работающим на устройствах, которыми пользователи уже владеют.