2.6B小模型凭何让AI Agent走进手机?LFM2.5的品牌设备端智能体新范式
原文: Deploy local agents everywhere with LFM2.5-2.6B
LiquidAI推出2.6B模型LFM2.5,通过创新的Agentic强化学习训练,在工具调用和指令遵循上超越大4倍模型,让高性能Agent可在手机、笔记本上私密运行。
- 在多个Agent基准上,2.6B的LFM2.5击败8B+模型,尤其在指令跟随和工具使用方面表现突出
- 独创Agentic强化学习:直接在真实Agent框架(如OpenClaw)内进行多轮RL训练,让模型学会在复杂环境中协同多个工具
- 推理速度极快,在 Apple M5 Max 上达220 tok/s,CPU上113 tok/s,内存占用低于2.5GB
- 端侧部署意味零云推理成本、数据完全本地化,为隐私敏感场景和边缘计算打开新可能
当人们还在为大模型的惊人能力支付昂贵的云计算账单时,一个反直觉的趋势正在浮现:把AI Agent装进口袋。LiquidAI刚发布的LFM2.5-2.6B,用2.6B参数量证明:你不需要一个大模型才能拥有一个能干的本地Agent。它在工具调用、多步推理和指令遵循上的表现,不仅超越了参数大4倍的Gemma系列,甚至经常和9.7B的Qwen平起平坐。
起因:为什么现在需要本地Agent? 过去一年,AI Agent成为共识,但主流方案几乎都依赖云端大模型。这带来三个痛点:隐私数据必须上传、延迟无法忽略、规模化成本线性增长。有没有可能让Agent跑在用户的手机、笔记本甚至物联网设备上?小模型往往是瓶颈,但LFM2.5的出现试图打破这个局面。
拆解:一个小模型如何被“教”成Agent? LFM2.5的秘密不在架构,而在后训练。团队设计了一套四阶段流程,特别是最后一步“Agentic强化学习”与众不同。
常规模型后训练主要靠SFT和偏好对齐,但要做Agent,模型必须学会规划、调用外部工具并根据环境反馈调整行为。LFM2.5的做法是:先做两轮重Agent数据的SFT,让模型掌握工具使用、网页搜索等基本动作;然后为数学、代码、工具使用等不同领域分别训练专家教师模型;接着通过多领域在线蒸馏,把多个教师的知识融合进一个2.6B学生模型。最关键的是Agentic RL:他们直接把学生模型放进真实的Agent运行框架(如OpenClaw、Hermes Agent),在沙盒里跑多轮任务,由RL框架根据任务完成度、工具调用正确性等给出奖励,然后更新模型。
这个流程的巧妙之处在于,它没有凭空设计训练任务,而是把现成的Agent标准测试环境直接当作训练场。模型在“考试环境”中学习,自然就更擅长考试。而且通过“Harness Proxy”捕获token级轨迹,能够彻底重构和验证RL样本,确保了训练的可靠性。
趋势洞察:小模型的“Agent化”专精之路 这件事揭示了一个深层趋势:大模型强于通用,但小模型可以通过垂直训练成为特定领域的利器。Agent能力不是参数量的线性函数,而更多取决于训练数据和目标函数的对齐。过去我们总认为“智能”必然伴随大计算,但LFM2.5告诉我们,如果明确任务边界是工具调用和多步协作,2.6B参数已经绰绰有余。这很可能会推动一波“本地优先Agent”的浪潮,让开发者不再把隐私和成本作为妥协。
实用价值:对你的应用意味着什么? 如果你正在开发需要工具调用、信息检索、表单填写等步骤的智能助手,而用户又对数据隐私敏感,LFM2.5提供了一个几乎免费的本地方案。它的推理速度意味着可以做到实时响应,即使在没有网络的设备上也能正常工作。想象一下:智能相册整理、本地文件自动化、隐私敏感的日程管理,这些以前要么功能受限要么必须联网的应用,现在都可以离线高效完成。
反常识:你以为大模型是Agent的前提,其实不然 许多人默认“Agent = 大模型 + 工具”,但LFM2.5用成绩单反驳了这一点。在BFCLv4工具调用基准上它只略低于9.7B Qwen,而在多个指令遵循测试上直接登顶。这说明,对于结构化的工具使用场景,模型大小并不是决定性因素,训练策略才是。你可能根本不需要为一个本地的客服机器人部署7B甚至更大的模型,2.6B就够用,还能省下大笔推理成本。
分析由 BitByAI 生成 · 阅读原文