人工智能 来源:MarkTechPost 整理:feaOS 2026-08-14 03:30:53

Liquid AI发布LFM2.5-VL-3B:一款读屏、定位物体和调用工具的视觉语言模型

昨日,Liquid AI发布了名为LFM2.5-VL-3B的视觉语言模型。这款拥有31亿参数量的模型专为在设备上的部署而设计,在移动、网页和桌面屏幕上读取数字屏幕,并能将物体定位到坐标上,解析文档和图表,并根据文本或图像输入调用工具。Liquid AI报告称该模型在28个视觉基准测试中的平均得分为69.4分,与InternVL-3.5-4B持平,比Qwen3.5-4B低0.7分。由于是非推理型的,它能直接回答问题并保持较低延迟,在Apple M5 Max上占用约3GB内存,并以每秒228个令牌的速度解码。该模型支持原生、GGUF、ONNX和MLX四种格式,第一天就可在llama.cpp、MLX、vLLM、SGLang和ONNX等运行时环境中使用。它适用于消费电子、汽车、工业与机器人技术、金融服务、医疗保健以及电子商务等行业,并可用于QA和RPA供应商自动化GUI。LFM2.5-VL-3B在屏幕理解和UI理解方面表现出色,平均得分为80.7分,在桌面(78.7)、移动设备(81.2)和网页(82.2)上均表现优异。此外,该模型新增了功能调用能力,ToolSandbox从26.4提高到59.5,BFCL v4从20.5提升至32.5。

ENTRY_ID: NEWS-12791 READ_MODE: SHORT_SIGNAL