新聞加密貨幣Tether Data 開源 VisionPsy-Nano,4.6 億參數端側視覺語言模型

Tether Data 開源 VisionPsy-Nano,4.6 億參數端側視覺語言模型

作者: CoinTrust·

重點速覽

  • Tether Data 發布了 VisionPsy-Nano,這是一款 4.6 億參數的視覺語言模型,能夠完全在邊緣裝置上處理圖像和文字,無需將資料傳輸至遠端伺服器。
  • 該模型取得 62.3 分的基準測試分數,在參數少於 5 億的受測視覺語言模型中排名第一,並在 17 項基準測試中的 16 項超越競爭對手。
  • Tether Data 推出的 Flash 變體版本保留了標準模型約 99% 的品質,同時在 iPhone 15 上生成首個輸出 token 的速度比部分緊湊型模型快達 36 倍。
  • 兩個模型版本均以 Apache 2.0 授權發布,允許研究和商業應用免權利金使用。
  • 此次開源發布代表 Tether 在其 USDT 穩定幣業務之外,策略性地擴展至為本地裝置部署而構建的去中心化 AI 基礎設施。
Tether Data 開源 VisionPsy-Nano,4.6 億參數端側視覺語言模型

Tether Data 已開源 VisionPsy-Nano,這是一款 4.6 億參數的視覺語言模型,專為直接在智慧型手機、筆記型電腦和其他邊緣裝置上運行而設計,無需持續的雲端連線。此次發布標誌著 Tether 持續從其核心穩定幣業務——USDT 為市值最大的穩定幣——擴展至開放式 AI 基礎設施。

該模型由 QVAC 開發,QVAC 是 Tether Data 的人工智慧研究計畫,專注於構建開放、去中心化和自適應的 AI 系統。此次發布反映了業界將先進多模態能力從集中式資料中心轉移至由使用者直接控制的裝置上的更廣泛趨勢。Apple、Google 等公司也同樣投入了端側 AI 處理技術,這可以降低延遲、減少伺服器成本,並將使用者資料保留在本地,而非傳輸至遠端伺服器。

VisionPsy-Nano 能夠處理和解讀視覺與文字資訊。其功能包括文件分析、光學字元辨識(OCR)、場景理解、視覺推理和指令遵循。Tether Data 表示,該模型在行動裝置和邊緣裝置上提供先進的視覺語言能力,同時完全不需要雲端處理,這意味著模型處理的圖像和文字不會離開裝置。

基準測試表現

根據 Tether Data 發布的評測結果,VisionPsy-Nano 在參數少於 5 億的受測視覺語言模型中取得了最高的整體標準化分數。該模型獲得 62.3 分,在 5 億參數以下類別的整體品質和效能中排名第一。

該公司報告稱,VisionPsy-Nano 在 17 項基準測試中的 16 項中表現優於其他競爭的緊湊型系統。這些測試涵蓋了來自 Liquid AI 和 Hugging Face 的模型,以及用於 VisionPsy-Nano 開發的基礎模型。

兩個版本兼顧精確度與速度需求

Tether Data 發布了兩個版本的模型,以支援不同的部署需求。

VisionPsy-Nano-460M 版本針對精確度進行最佳化,旨在在其參數規模的標準視覺語言評測中提供強勁的效能。

第二個版本 VisionPsy-Nano-460M-Flash 則專為縮短真實行動應用場景的回應時間而設計。該公司表示,Flash 版本保留了完整版本約 99% 的整體品質,同時取得了 61.4 的標準化分數。Tether Data 將部分速度提升歸因於使用了更少的視覺 token。

在包括 Google Pixel 9、Samsung Galaxy S23、Samsung Galaxy S25 Ultra 和 Apple iPhone 15 等裝置上進行的測試中,據報導 Flash 版本在多款 Android 裝置上生成第一個輸出 token 的速度比部分緊湊型模型快約 19 至 23 倍。該公司報告稱,在 iPhone 15 上速度優勢最高達到 36 倍。該公司還表示,在所選裝置上進行的測試中,該模型維持了比多個競爭系統更低的延遲。

廣泛的多模態能力

儘管體積相對較小,VisionPsy-Nano 在該公司的評測中於四個主要能力類別排名第一。

在文件理解和光學字元辨識方面,該模型能夠從複雜圖像中識別文字和結構資訊,包括財務報告、流程圖和資訊圖表。其視覺感知能力包括場景分析和空間布局識別。該公司報告稱,該模型在該領域以 4.6% 的相對幅度超越了同尺寸類別中的次佳系統。

Tether Data Open-Sources VisionPsy-Nano: Best-in-Class ~460M On-Device Vision-Language Model Leading Industry Benchmarks Learn more: — Tether (@tether) July 29, 2026

VisionPsy-Nano 在視覺推理和知識效能方面也展現了強勁的表現,以 7.4% 的相對幅度超越了約 5 億參數類別中的其他模型。該公司進一步報告稱,該模型在指令遵循和可靠性測試中表現優異。在部分評測中,其結果超越了參數為其 1.6 至 2.3 倍的模型。

Tether AI just released VisionPsy, a best-in-class state-of-the-art vision language model optimized for edge devices (phones, laptops, …) with the highest overall score in its class/weight — Paolo Ardoino (@paoloardoino) July 29, 2026

Tether Data 表示,該模型的基準測試結果顯示,緊湊型 AI 系統能夠與體積大得多的模型競爭,同時仍適合直接部署在消費級裝置上。

開源發布與部署選項

兩個版本均以 Apache 2.0 授權(最廣泛使用的寬鬆開源授權之一,允許研究和商業用途且無需支付權利金)發布開放模型權重。該公司表示,這些模型旨在支援研究、教育和更廣泛的開發者使用。

開發者可透過三種部署選項使用這些模型。全精度推論可透過 Hugging Face Transformers 使用,而量化 GGUF 版本可透過 llama.cpp 部署在行動裝置上。使用 vLLM 的生產導向選項也可用於高吞吐量伺服器推論。

Tether Data 還發布了基於 VLMEvalKit 協定的評測配置和測試框架,以支援可重現性。

Tether 執行長 Paolo Ardoino 表示,這些結果證明了高效、本地部署的 AI 能夠在不完全依賴集中式資料中心的情況下提供高品質效能。他指出,將該技術開放提供,可讓開發者更便利地取得在使用者已有裝置上運作的私有 AI 工具。