9月8日,面壁智能在官方渠道宣布,正式开源新一代端侧智能体模型MiniCPM5-2B。这款参数规模仅20亿的模型,却在智能体综合评测Agentic Index上拿下20分,位列AA榜4B以下模型第一名,多项成绩甚至超过参数规模数倍于己的对手。面壁智能方面表示,MiniCPM5-2B专注服务智能体场景,可在手机、个人电脑等消费级设备上本地运行,配合开源协议向开发者开放权重与工具链,希望把人人都能跑的智能体从愿景变成现实。
智能体评测与常规大模型评测最大的不同,在于它考察的不是会不会答,而是能不能干活。Agentic Index会模拟真实任务环境,让模型自主完成信息检索、工具调用、多步规划与结果修正,任何一个环节掉链子都会拉低总分。MiniCPM5-2B能在这一严苛标准下拿到20分并登顶4B以下榜单,说明它的小体格里装进了超出体量的执行能力,尤其是在函数调用成功率与任务完成率两项关键指标上表现突出。
面壁智能将成绩归功于训练策略的转变。团队不再把智能体能力当作对话能力的附属品,而是围绕执行重构了数据配比,在预训练与微调阶段引入大量真实工具使用轨迹、浏览器操作记录与多模态交互样本,让模型从底层学会把用户意图拆解成可执行的步骤序列。评测机构的分析师指出,这一成绩的含金量在于它是在端侧推理条件下取得的,若计入云端推理的同等测试,小参数模型的性价比优势会更加明显。
与云端大模型追求无所不知不同,端侧智能体模型更像贴身管家,它不需要掌握全世界的知识,但必须反应快、够听话、能调工具、守隐私。MiniCPM5-2B在架构上采用了自研的深度压缩方案,在保持20亿参数总量的同时,让推理速度与内存占用达到手机可承受的范围,实测在主流旗舰手机上可达到流畅的对话与工具调用体验。
能力覆盖上,这款模型支持文本、图像等多模态输入,具备网页浏览、应用内操作、日程管理、信息查询等智能体常用技能,并针对中文环境做了大量优化。更重要的是本地化推理带来的隐私优势,用户的通讯录、相册、健康数据等敏感信息无需上传云端即可完成处理,这在医疗、金融、办公等对数据安全敏感的行业场景中尤为关键,也成为端侧智能体区别于云端助手最硬核的卖点。
发布即开源是面壁智能一贯的节奏,MiniCPM5-2B的权重、推理代码、量化版本与微调工具同步上线开源社区,开发者可自由用于商业项目。为了让更多非技术用户尝鲜,团队还提供了在线体验入口,用户在浏览器里就能感受这款端侧模型的智能体能力,无需购买高端设备,大幅降低了认知门槛。面壁智能透露,发布后数小时内模型下载量便迅速攀升,社区开发者已围绕个人助理、文档处理、智能客服等方向展开二次开发。
产业合作层面,面壁智能同步宣布与多家芯片厂商和终端厂商达成适配合作,覆盖主流移动平台以及国产算力芯片,确保模型在不同硬件上都能获得稳定表现。业内观察人士认为,端侧智能体的价值不只在于单个模型,更在于它带动了从芯片设计、操作系统调度到应用生态的连锁升级,谁能率先把端侧智能体做成用户离不开的日常工具,谁就掌握了下一代终端体验的入口。
放眼全球,端侧小模型的竞赛早已开打。海外阵营有持续迭代的端侧模型系列,苹果也在通过自研芯片悄悄强化端侧AI能力,多家厂商则坚持开源路线推动小尺寸模型落地。面壁智能此次把MiniCPM5-2B推上4B以下智能体能力榜首,证明国产模型在端侧这一细分赛道上不仅没有掉队,反而在评测维度上占据了领先位置,这对国内AI产业而言是一剂强心针。
不过也有技术专家提醒,榜单领先只是第一步。端侧模型要真正走进千家万户,还要过三关:一是不同品牌设备碎片化适配关,二是长时间运行下的发热与续航关,三是与系统级权限、应用生态深度融合的体验关。面壁智能选择把模型和工具链全部开源,正是希望借助社区力量加速突破,用生态的广度弥补单一厂商资源的有限性。
对于普通用户来说,跑分榜单上的数字远不如一次流畅的体验有说服力。可以预见,未来一年端侧智能体将沿着两条路线加速进化:一条是能力路线,模型在规划、推理与多模态理解上继续逼近云端水平;另一条是场景路线,AI助理将深度绑定日历、地图、支付等高频应用,从你问我答升级为主动办事。MiniCPM5-2B的发布,为这两条路线都提供了新的可能性底座。
面壁智能的愿景里有一个清晰的终局,让智能体像操作系统一样成为终端的基础能力,用户不需要理解模型与算力,只需要说出需求就能得到结果。这一天能否到来,取决于模型能力的持续突破,更取决于开发者是否愿意在开源生态里投入真金白银。随着MiniCPM5-2B这类标杆模型不断涌现,端侧AI的实用化进程正在明显提速,属于个人智能终端的时代或许比想象中来得更快。