Tether 发布了用于设备端视觉 AI 的 4.6 亿参数 VisionPsy-Nano 模型

QVAC 发布了 Apache 2.0 权重、手机基准测试和推理代码,但其主要得分仍基于内部评估。

By · Published

Primary source: QVAC on X

Why it matters

Tether is using QVAC to expand from stablecoins into edge AI infrastructure. A capable 460M-parameter VLM could lower cloud inference costs and keep sensitive images on users' devices, provided independent testing confirms QVAC's results.

Tether releases 460M-parameter VisionPsy-Nano models for on-device vision AI

Tether Data 的 QVAC 研究小组于 7 月 29 日发布了两个 4.6 亿参数的视觉-语言模型,为需要在不将图像发送到云服务的情况下解释图像的应用向开发者提供了开放权重和移动端推理代码。QVAC 在 一条 X 帖子中宣布了 VisionPsy-Nano,并将模型合集以 Apache 2.0 许可证发布。(huggingface.co)

https://x.com/qvac/status/2082439175891284476?s=46

poster=/api/storage/public-objects/tweet-videos/tether-qvac-visionpsy-nano-on-device-vision-models-poster-9db3123f.jpg|来自 @qvac 在 X 的视频

该发布延伸了 Tether CEO Paolo Ardoino 的推动,旨在将该稳定币发行方转变为对等计算基础设施的构建者。Ardoino 于 2014 年加入 Bitfinex,2017 年成为 Tether 的 首席技术官 并于 2023 年 12 月接任 CEO。Tether 在 2025 年 5 月推出 QVAC 时,他直白地总结了该策略:“If you need an API key to use your AI, it isn't truly yours.”(如果你需要 API 密钥来使用你的 AI,它就不是真正属于你的。)(tether.io)

技术文章署名一个由 10 人组成的研究小组,其中包括 Khurram Azeem HashmiMathias Buus,文章介绍了两个变体。VisionPsy-Nano-460M 优先考虑质量,而 VisionPsy-Nano-460M-Flash 则通过减少每张图像处理的视觉标记数量来降低延迟和内存使用。(huggingface.co)

更小的视觉管线

VisionPsy-Nano 基于 nanoVLM 架构,将 SigLIP2 图像编码器与 3.6 亿参数的 SmolLM2 语言主干和一个轻量级连接器配对。两个变体都支持 8,192 个标记的上下文,并且围绕每次请求处理一张图像进行设计。质量模型可为 512x512 图像生成 1,088 个视觉标记;Flash 则通过保留图像的原始尺度而不是在平铺前放大图像,将相同分辨率下的视觉标记减少到 64 个。(huggingface.co)

QVAC 在 Pixel 9、Galaxy S23、Galaxy S25 Ultra 和 iPhone 15 上使用四比特 GGUF 构建测量了 Flash。在这些测试中,Flash 在常见运行时环境下生成首个输出标记的速度比 nanoVLM-460M 和 SmolVLM2-500M 快 11.9 倍到 25.1 倍。与各手机使用其最快测试后端时相比,它生成首个标记的速度也比 Liquid AI 的 LFM2.5-VL-450M 快 1.3 倍到 2.4 倍,比 Qwen3.5-0.8B 快 2.3 倍到 3.5 倍。这些是 QVAC 的测量结果,而非独立复现的结果。(huggingface.co)

开发者可以通过 Transformers 加载全精度检查点,使用 vLLM 进行服务器端推理,或通过 llama.cpp 部署量化的 GGUF 版本。QVAC 还发布了一个包含三种路径推理脚本的 GitHub 仓库。更广泛的 QVAC SDK 使用 JavaScript 和 TypeScript 接口,支持在 Linux、macOS、Windows、Android 和 iOS 上的本地 AI。(github.com)

基准领先伴随注意事项

QVAC 报告 VisionPsy-Nano-460M 的标准化综合得分为 62.3,领先于 LFM2.5-VL-450M 的 59.6、nanoVLM-460M-8k 的 54.9 和 SmolVLM2-500M 的 52.5。QVAC 表示,在大约 5 亿参数的这组模型中,VisionPsy-Nano 在 17 项基准中有 15 项全面取胜,并在第 16 项表现良好。它在文档理解与 OCR、视觉感知、推理与知识以及指令遵循与可靠性这些分组得分中领先。(huggingface.co)

这些比较是在内部使用单一 VLMEvalKit 测试框架运行的。QVAC 使用 Qwen3.6-27B 来评判开放式答案,这种方法旨在避免因格式差异(例如“12%”与“12 percent”)而对回答进行惩罚。发布时,VisionPsy 模型支持的变更和额外的基于评判的评分仍以开放的拉取请求形式存在于 VLMEvalKit 中,尚未收到维护者的审核。QVAC 发布了其配置,使研究人员可以通过应用这些补丁来复现该设置。(github.com)

参数级别的比较也有明确边界。更大的模型在 17 项基准的原始平均分上仍然获胜:Qwen3.5-0.8B 得分 66.1,InternVL3.5-1B 得分 65.9,而 VisionPsy-Nano 为 62.3。VisionPsy-Nano 在三项完整基准上击败了这些更大模型,涵盖科学问题、视觉指令遵循和抗幻觉能力。(huggingface.co)

Tether 的本地 AI 切入点

QVAC 的目标包括相机问答、收据、表单、图表、示意图、场景文本和轻量级视觉指令。较小的参数规模带来了硬性限制:QVAC 建议进行领域特定的微调,主要支持英语,并警告模型可能产生幻觉、计数错误或在处理密集文档和多步数学时表现欠佳。QVAC 表示不应将 VisionPsy-Nano 用于安全关键的自动化决策。(huggingface.co)

Tether 首次在 2025 年 5 月宣布 QVAC,并于同年 10 月在卢加诺的 Plan B 论坛公开发布。开发者 SDK 随后于 2026 年 4 月推出。VisionPsy-Nano 为这种本地优先的论点提供了一个开发者可以检视和部署的模型,而不是依赖第三方模型 API 的另一个层。其采用情况将取决于独立评估是否确认 QVAC 的基准领先,以及延迟优势在完整移动应用中是否保持,因为图像捕获、预处理和设备特定集成会在模型推理之外增加开销。(qvac.tether.io)

Reader comments

Conversation for this story loads after sign-in.