Tether Data开源VisionPsy-Nano:4.6亿参数端侧视觉语言模型
要点速览
- •Tether Data发布了VisionPsy-Nano,一款4.6亿参数的视觉语言模型,完全在边缘设备上处理图像和文本,无需将数据传输至远程服务器。
- •该模型基准测试得分为62.3,在参评的5亿参数以下视觉语言模型中排名第一,在17项基准测试中的16项上优于竞争对手。
- •Tether Data推出了Flash变体,保留了标准版约99%的质量,在iPhone 15上生成首个输出token的速度比选定的紧凑模型快最多36倍。
- •两个模型版本均在Apache 2.0许可证下发布,允许研究用途和商业应用免版税使用。
- •此次开源发布代表了Tether从USDT稳定币业务向面向本地设备部署的去中心化AI基础设施的战略性扩展。

Tether Data已开源VisionPsy-Nano,这是一款4.6亿参数的视觉语言模型,专为直接在智能手机、笔记本电脑和其他边缘设备上运行而设计,无需持续的云连接。此次发布标志着Tether继续从其核心稳定币业务——USDT是按市值计算最大的稳定币——向开源AI基础设施领域扩展。
该模型由QVAC——Tether Data的人工智能研究计划——开发,专注于构建开放、去中心化和自适应的AI系统。此次发布反映了行业内更广泛的趋势,即将先进的多模态能力从集中式数据中心转移到由用户直接控制的设备上。Apple、Google等公司同样投资了端侧AI处理技术,该技术可以降低延迟、减少服务器成本,并将用户数据保留在本地,而非传输至远程服务器。
VisionPsy-Nano旨在处理和解读视觉与文本信息。其功能包括文档分析、光学字符识别(OCR)、场景理解、视觉推理和指令跟随。Tether Data表示,该模型在移动和边缘设备上提供先进的视觉语言能力,同时完全无需基于云的处理器,这意味着模型处理的图像和文本不会离开设备。
基准测试表现
根据Tether Data公布的评估结果,VisionPsy-Nano在所有参评的5亿参数以下的视觉语言模型中获得了最高的综合归一化得分。该模型得分为62.3分,在5亿参数以下类别中综合质量和性能排名第一。
该公司报告称,VisionPsy-Nano在17项基准测试中的16项上表现优于其他竞争性紧凑系统,包括来自Liquid AI和Hugging Face的模型,以及VisionPsy-Nano开发中使用的基座模型。
两个版本满足精度与速度需求
Tether Data发布了两个版本的模型,以支持不同的部署需求。
VisionPsy-Nano-460M版本针对精度进行优化,旨在在其参数规模上提供强大的标准视觉语言评估性能。
第二个版本VisionPsy-Nano-460M-Flash专为实际移动应用中减少响应时间而设计。该公司表示,Flash版本保留了完整版约99%的综合质量,同时归一化得分为61.4。Tether Data将部分速度提升归因于使用了更少的视觉token。
在包括Google Pixel 9、Samsung Galaxy S23、Samsung Galaxy S25 Ultra和Apple iPhone 15在内的设备上进行的测试中,据报道Flash版本在多款Android设备上生成首个输出token的速度比选定的紧凑模型快约19到23倍。该公司报告称,在iPhone 15上速度优势最高可达36倍。该公司还表示,在所选设备上测试的多个竞争系统中,该模型保持了更低的延迟。
广泛的多模态能力
尽管体量相对较小,VisionPsy-Nano在公司评估的四大能力类别中均排名第一。
在文档理解和光学字符识别方面,该模型旨在从复杂图像中识别文本和结构信息,包括财务报告、流程图和信息图表。其视觉感知能力包括场景分析和空间布局识别。该公司报告称,在该领域,该模型在其体量类别中超过了次优系统,相对优势为4.6%。
Tether Data Open-Sources VisionPsy-Nano: Best-in-Class ~460M On-Device Vision-Language Model Leading Industry Benchmarks Learn more: — Tether (@tether) July 29, 2026
VisionPsy-Nano还展现了强大的视觉推理和知识表现,在大约5亿参数类别中以7.4%的相对优势超越了其他模型。该公司进一步报告称,该模型在指令跟随和可靠性测试中表现出色。在部分评估中,其成绩超过了体量为其1.6到2.3倍的模型。
Tether AI just released VisionPsy, a best-in-class state-of-the-art vision language model optimized for edge devices (phones, laptops, …) with the highest overall score in its class/weight — Paolo Ardoino (@paoloardoino) July 29, 2026
Tether Data表示,该模型的基准测试结果表明,紧凑型AI系统可以在保持适合直接部署于消费设备的同时,与规模大得多的模型竞争。
开源发布与部署选项
两个版本均以Apache 2.0许可证发布开放模型权重,这是使用最广泛的开源许可证之一,允许研究用途和商业用途而无需支付版税。该公司表示,这些模型旨在支持研究、教育和更广泛的开发者访问。
开发者可通过三种部署选项使用这些模型。全精度推理可通过Hugging Face Transformers使用,量化GGUF版本可通过llama.cpp部署在移动设备上。基于vLLM的面向生产的选项也可用于高吞吐量服务器推理。
Tether Data还发布了基于VLMEvalKit协议的评估配置和测试框架,以支持结果的可复现性。
Tether首席执行官Paolo Ardoino表示,结果表明高效的本地部署AI可以在不完全依赖集中式数据中心的情况下提供高质量性能。他指出,将该技术开放使用可以让开发者更便捷地获取在用户已有设备上运行的私有AI工具。