НовостиКриптовалютыTether Data открывает исходный код VisionPsy-Nano — визуально-языковой модели на 460 млн параметров для запуска на устройствах

Tether Data открывает исходный код VisionPsy-Nano — визуально-языковой модели на 460 млн параметров для запуска на устройствах

Автор: CoinTrust·

Ключевые выводы

  • Tether Data выпустила VisionPsy-Nano — визуально-языковую модель на 460 миллионов параметров, которая обрабатывает изображения и текст полностью на периферийных устройствах, не передавая данные на удаленные серверы.
  • Модель достигла балла 62,3 на бенчмарках, заняв первое место среди оцененных визуально-языковых моделей с числом параметров менее 500 миллионов и превзойдя конкурентов на 16 из 17 бенчмарков.
  • Tether Data представила Flash-вариант, сохранивший около 99% качества стандартной модели, при этом генерируя первый токен вывода до 36 раз быстрее выбранных компактных моделей на iPhone 15.
  • Обе версии модели выпущены под лицензией Apache 2.0, что позволяет использовать их без выплаты роялти как в исследовательских, так и в коммерческих целях.
  • Релиз с открытым исходным кодом представляет собой стратегическое расширение Tether за пределы бизнеса стейблкоина USDT в сторону децентрализованной ИИ-инфраструктуры, созданной для локального развертывания на устройствах.
Tether Data открывает исходный код VisionPsy-Nano — визуально-языковой модели на 460 млн параметров для запуска на устройствах

Tether Data открыла исходный код VisionPsy-Nano — визуально-языковой модели на 460 миллионов параметров, спроектированной для работы непосредственно на смартфонах, ноутбуках и других периферийных устройствах без необходимости постоянного подключения к облаку. Релиз знаменует собой продолжение расширения Tether за пределы ее основного бизнеса стейблкоинов — USDT является крупнейшим по рыночной капитализации стейблкоином — в сторону открытой ИИ-инфраструктуры.

Модель была разработана QVAC, исследовательской инициативой в области искусственного интеллекта подразделения Tether Data, которая сосредоточена на создании открытых, децентрализованных и адаптивных ИИ-систем. Релиз отражает более широкую отраслевую тенденцию к переносу передовых мультимодальных возможностей из централизованных дата-центров на устройства, управляемые непосредственно пользователями. Apple, Google и другие компании также инвестируют в обработку ИИ на устройствах, что позволяет снизить задержку, уменьшить серверные расходы и хранить данные пользователя локально, не передавая их на удаленные серверы.

VisionPsy-Nano предназначена для обработки и интерпретации как визуальной, так и текстовой информации. Ее возможности включают анализ документов, оптическое распознавание символов (OCR), понимание сцен, визуальное мышление и выполнение инструкций. Tether Data заявила, что модель обеспечивает передовые визуально-языковые возможности на мобильных и периферийных устройствах, работая полностью без облачной обработки, что означает, что изображения и текст, обрабатываемые моделью, никогда не покидают устройство.

Производительность на бенчмарках

Согласно опубликованным Tether Data результатам оценки, VisionPsy-Nano достигла наивысшего общего нормализованного балла среди оцененных визуально-языковых моделей с числом параметров менее 500 миллионов. Модель набрала 62,3 балла, заняв первое место в категории до 500 миллионов параметров по общему качеству и производительности.

Компания сообщила, что VisionPsy-Nano показала хорошие результаты в сравнении с конкурирующими компактными системами на 16 из 17 бенчмарков. Среди них были модели от Liquid AI и Hugging Face, а также базовая модель, использованная при разработке VisionPsy-Nano.

Две версии для разных требований к точности и скорости

Tether Data выпустила две версии модели для поддержки различных сценариев развертывания.

Версия VisionPsy-Nano-460M оптимизирована для точности и предназначена для обеспечения высокой производительности в стандартных визуально-языковых тестах в своем диапазоне параметров.

Вторая версия, VisionPsy-Nano-460M-Flash, разработана для сокращения времени отклика в реальных мобильных приложениях. Компания сообщила, что Flash-модель сохранила около 99% общего качества полной версии, достигнув нормализованного балла 61,4. Tether Data объяснила часть улучшения скорости использованием меньшего числа визуальных токенов.

В тестах, проведенных на устройствах, включая Google Pixel 9, Samsung Galaxy S23, Samsung Galaxy S25 Ultra и Apple iPhone 15, Flash-версия, как сообщается, генерировала первый токен вывода примерно в 19–23 раза быстрее, чем выбранные компактные модели, на нескольких Android-устройствах. Компания сообщила, что преимущество в скорости достигало 36-кратного значения на iPhone 15. Также было заявлено, что модель сохраняла более низкую задержку по сравнению с несколькими конкурирующими системами, протестированными на выбранных устройствах.

Широкие мультимодальные возможности

Несмотря на относительно небольшой размер, VisionPsy-Nano заняла первое место в четырех основных категориях возможностей по результатам оценки компании.

В области понимания документов и оптического распознавания символов модель разработана для извлечения текста и структурной информации из сложных изображений, включая финансовые отчеты, блок-схемы и инфографику. Ее возможности визуального восприятия включают анализ сцен и распознавание пространственного расположения. Компания сообщила, что модель превзошла следующую лучшую систему в своей размерной категории с относительным отрывом 4,6% в этой области.

Tether Data Open-Sources VisionPsy-Nano: Best-in-Class ~460M On-Device Vision-Language Model Leading Industry Benchmarks Learn more: — Tether (@tether) July 29, 2026

VisionPsy-Nano также продемонстрировала высокие результаты визуального мышления и работы с знаниями, превзойдя другие модели в категории около 500 миллионов параметров с относительным отрывом 7,4%. Компания дополнительно сообщила, что модель показала сильные результаты в тестах на выполнение инструкций и надежность. В отдельных оценках она превзошла результаты моделей, превышающих ее по размеру в 1,6–2,3 раза.

Tether AI just released VisionPsy, a best-in-class state-of-the-art vision language model optimized for edge devices (phones, laptops, …) with the highest overall score in its class/weight — Paolo Ardoino (@paoloardoino) July 29, 2026

Tether Data заявила, что результаты бенчмарков модели показывают: компактные ИИ-системы могут конкурировать с существенно более крупными моделями, оставаясь при этом пригодными для прямого развертывания на потребительских устройствах.

Релиз с открытым исходным кодом и варианты развертывания

Обе версии выпущены с открытыми весами модели под лицензией Apache 2.0 — одной из наиболее широко используемых разрешительных лицензий открытого исходного кода, которая допускает как исследовательское, так и коммерческое использование без выплаты роялти. Компания сообщила, что модели предназначены для поддержки исследований, образования и более широкого доступа разработчиков.

Разработчики могут использовать модели через три варианта развертывания. Инференс с полной точностью доступен через Hugging Face Transformers, в то время как квантованные GGUF-версии могут быть развернуты на мобильных устройствах через llama.cpp. Также доступен вариант для production-окружения на базе vLLM для серверного инференса с высокой пропускной способностью.

Tether Data также выпустила конфигурации оценки и тестовые фреймворки на основе протокола VLMEvalKit для обеспечения воспроизводимости результатов.

Паоло Ардоино (Paolo Ardoino), главный исполнительный директор Tether, заявил, что результаты демонстрируют: эффективный локально развернутый ИИ способен обеспечивать высококачественную производительность без полной зависимости от централизованных дата-центров. Он указал, что открытое предоставление этой технологии может дать разработчикам более широкий доступ к приватным ИИ-инструментам, работающим на устройствах, которыми пользователи уже владеют.