一、引言:3B 参数跑进手机
当行业目光聚焦于数百亿参数的云端大模型时,LiquidAI 悄然发布了一款"小"模型——LFM2.5-VL-3B 轻量化视觉语言模型。它仅 3B 参数规模,却可直接在手机端本地运行,实现屏幕内容实时读取与自主操作。在国产开源密集发力的 8 月,这款端侧视觉模型与智谱 GLM-5.3、DeepSeek Harness、小红书 dots3-notepreview 形成鲜明对照:前者向上堆参数、后者向下沉终端,共同勾勒出 AI 能力"云端+端侧"双轨并行的全景。
LFM2.5-VL-3B 的意义,不在于参数规模,而在于它把"看懂屏幕、操作手机"的能力,从云端 API 搬到了设备本地。
二、手机本地读屏操作:技术内核
传统手机自动化方案,要么依赖云端大模型识别截图再下发指令,要么依赖系统级无障碍接口的硬编码脚本。前者有延迟与隐私顾虑,后者泛化能力差、换一个 App 就失效。LFM2.5-VL-3B 走的是第三条路:在端侧完成视觉理解到动作生成的闭环。
模型针对移动端场景深度优化,具备三项核心能力:
- 界面元素识别:理解屏幕上的按钮、输入框、列表、弹窗等 UI 组件及其语义,而非仅做像素级检测。
- 文字提取:从屏幕中准确抽取文本信息,支撑表单填写、内容核对等任务。
- 点击滑动操作模拟:将理解结果转化为具体的点击、滑动、输入动作,在应用内自主完成任务。
关键在于"无需云端传输即可完成应用内自动化任务"。这意味着整条链路——感知、决策、执行——都在手机本地完成,既消除了网络往返带来的延迟,也避免了屏幕内容离开设备。对用户体验而言,是更快的响应;对用户权益而言,是更强的隐私保护。
三、端侧智能体落地:从概念到日常
LFM2.5-VL-3B 最值得关注的,是它让"手机智能体"从演示视频走向真实可用。过去,手机智能体多依赖云端多模态大模型,受限于网络、成本与功耗,难以常态化运行。一个 3B 模型能在端侧稳定驱动屏幕操作,意味着智能体可以常驻设备、随叫随到。
这种落地形态对智能体生态有三重价值。其一,降低运行成本:端侧推理无需按调用次数付费,长任务、高频任务的经济性显著优于云端方案。其二,提升可靠性:不依赖网络连通,地铁、飞机、弱网环境下仍能工作。其三,释放新交互:用户可以用自然语言下达"帮我订明天去北京的高铁票""把这张图发到家庭群"等指令,由本地智能体跨应用完成,而非在多个 App 间手动跳转。
这与同日发布的 DeepSeek Harness(云端 Agent 编排框架)、小红书 dots3-notepreview(280B 长程 Agent 底座)形成互补:云端负责复杂规划与长程推理,端侧负责实时感知与轻量执行,大小模型协同构成完整的智能体分层架构。
四、隐私与自动化测试:两个被低估的场景
素材特别点出,端侧视觉模型为"手机智能体、无障碍辅助、自动化测试"提供底层能力。其中后两者常被忽视,却极具价值。
隐私维度:屏幕内容往往包含聊天记录、支付信息、健康数据等高度敏感内容。端侧处理意味着这些数据不必上传至任何服务器,从根本上规避了云端方案的数据泄露与合规风险。在金融、医疗、政务等强监管场景,本地化是智能体能否被采用的前提条件,LFM2.5-VL-3B 的端侧属性恰好契合这一刚性需求。
自动化测试维度:移动应用的 UI 测试长期依赖人工或脆弱的脚本。一个能"看懂屏幕、自主操作"的视觉模型,可以像真人一样遍历应用、发现渲染异常与交互缺陷,且每次运行都在本地、可复现、零数据外泄。对 App 厂商而言,这意味着更低成本的回归测试与更高的发布质量;对无障碍辅助而言,视障用户可借助本地智能体完成读屏导航、界面操作,且无需担心隐私内容经第三方服务中转。
这两个场景的共同特征是:对延迟、隐私、可控性要求极高,恰恰是云端方案难以兼顾、而端侧小模型天然擅长的地带。
五、结语:AI 交互向终端本地下沉
LFM2.5-VL-3B 的发布,是"AI 交互从云端向终端本地深度下沉"的又一注脚。3B 参数虽小,却撬动了手机这一人类最亲密计算设备的智能潜能——让设备真正"看见"自己的屏幕,并替用户行动。
在云端大模型军备竞赛之外,端侧轻量化模型正成为另一条 equally 重要的战线。当 280B 的 dots3-notepreview 在云端思考长程任务,3B 的 LFM2.5-VL-3B 在掌心执行即时操作,AI 能力的全栈布局才算真正完整。对开发者与用户而言,一个更私密、更即时、更无处不在的端侧智能时代,已经拉开序幕。
*本文仅代表作者个人观点(仅供参考)* 来源:创客OPC原创整理