8月12日,Liquid AI 在 Hugging Face 发布 LFM2.5-VL-3B。这是一款面向本地设备运行的视觉语言模型,官方将其定位为可处理文档、屏幕和目标定位任务,并支持工具调用的模型。

Liquid AI 表示,LFM2.5-VL-3B 相较此前版本重点加强四项能力:对屏幕和界面的理解、基于自然语言查询的目标定位、多图输入处理,以及纯文本和图文场景下的函数调用。模型在约 3GB 内存中运行,并支持屏幕理解、目标定位、多图输入与函数调用。

从模型构成看,该版本使用 SigLIP2 视觉编码器,并沿用 LFM2.5-2.6B 文本模型的预训练骨干。发布方称,训练中扩大了视觉数据规模,并通过扩展词表增强对非拉丁文字的支持。

在部署方面,官方列出 llama.cpp、MLX、vLLM、SGLang 与 ONNX 等推理生态支持,并给出其在不同硬件上的测试数据。此类性能数值来自发布方测试,实际速度会随设备、量化方案、输入长度和并发条件变化。

端侧视觉语言模型的价值,在于减少部分图像和界面理解任务对云端调用的依赖。对开发者来说,模型体积、隐私边界、工具协议兼容性与真实工作负载下的稳定性,仍是落地时需要共同评估的因素。

来源:Liquid AI 于2026年8月12日在 Hugging Face 发布的模型公告。本文为中文编译与整理。