大模型之间的较量,正在从拼参数、拼速度,转向拼谁能在真实工作流里把任务交付得又快又好。8月4日,第三方中文大模型评测体系SuperCLUE-XClaw发布最新一期龙虾产品测评榜单,在十款参评的国产智能体产品中,百度文心助手综合排名第一,五个测评维度得分全部超过90分,其中记忆能力获得满分100分。所谓龙虾产品,指的是具备自主任务执行能力的AI智能体产品,这个略显戏谑的名字背后,是国产智能体赛道从会聊天到能干活的关键一跃。
评测结果公布前一周,文心助手的任务Agent还以Orion Mission Mode参加了PinchBench v2评测,以94.6%的综合成功率和94.4%的平均得分位列第一。连续在两项独立评测中拔得头筹,让百度这员老将重新回到了国产AI产品的聚光灯下,也把行业对智能体的评判标准推向了一个新阶段。
此次SuperCLUE-XClaw评测覆盖代码开发、内容创作、数据处理、记忆能力和研究分析五个维度,题目均设置了具体任务和明确的交付要求,考验的不是模型能不能生成漂亮话,而是能不能把一件事从头到尾做完。最终结果显示,文心助手代码开发得分90.28分,内容创作99.44分,数据处理以98.86分位列第一,研究分析96.44分,记忆能力拿到100分。
拆解来看,内容创作和数据处理的高分说明文心助手在结构化输出方面表现稳定,能够按照指定格式产出可用的内容成果;记忆能力满分则指向其长期记忆机制的有效性,智能体在跨轮次对话中能够记住用户的偏好和历史上下文,避免反复询问相同信息,这在真实办公场景中直接影响使用体验。代码开发90分出头,说明其在编程任务上达到可用水平,但距离顶尖代码模型仍有提升空间。
值得注意的是,这五道题的难度并不低。评测方特意设置了需要搜索、推理、工具调用和多步操作的复合型任务,模拟真实工作流中的复杂需求。文心助手能够在所有维度稳定保持在90分以上,证明其背后"搜索加模型加工具"的组织方式已经具备一定成熟度,而非单纯依靠某一项能力的单项优势。
把这份成绩单放在国产智能体的坐标系里看,更能读出分量。同期参评的九款产品中,不乏来自头部大厂的明星助手,各家在单一维度上各有所长,但能在五个维度同时保持90分以上高位的并不多见。SuperCLUE方面介绍,本次评测的题目设计刻意提高了交付标准,要求智能体不仅给出答案,还要按指定格式输出完整成果,任何一步中断都记为失败,这让最终的综合排名含金量更高,也反映出国产智能体在端到端任务执行上的整体进步。
文心助手的成绩,折射出整个AI行业的评价体系正在发生位移。过去两年,模型厂商最常强调的能力是参数更大、推理更快、对话更像人;而2026年的变化明显发生在产品端,厂商竞争的焦点不再只是模型本身,还包括AI能进入多少真实工作流程、最终交付什么结果。OpenAI将Codex带入ChatGPT,让用户从对话直接进入代码修改和项目执行;Anthropic持续扩展Claude Code的任务执行入口;阿里千问、字节豆包也在向研究、办公和开发等具体场景延伸。
当AI能够接住一项完整任务,评价标准也随之改变。一份财务报告、一次数据分析或一段代码开发,都要求系统理解目标、拆解步骤、调用工具,并按照指定格式交付结果。正是基于这样的行业变化,PinchBench、SuperCLUE-XClaw等以任务完成率为核心指标的评测体系迅速走红,成为衡量智能体真实能力的新标尺。
对百度而言,文心助手的评测成绩还有另一层意义:它证明百度在大模型之外,把搜索、知识图谱和工具调用组织成了一套可用的任务执行体系。文心助手基于文心大模型和百度搜索生态构建,在需要实时信息的研究分析类任务中具备天然优势,这种搜索加模型的组合,正是其在多步任务中保持高成功率的底层原因。
榜单成绩固然亮眼,但国产智能体面临的真正考验在榜单之外。评测任务再复杂,也是预设好的封闭环境;真实办公场景中的任务千变万化,涉及企业内部系统、私有数据、多人协作,智能体能否在这些环境中稳定交付,才是商业化的关键。文心助手目前的能力覆盖内容创作、数据分析、研究和代码运维等多步骤任务,但距离成为企业级生产力工具,还有很长一段路要走。
行业观察人士指出,智能体产品正在从单点工具走向系统级平台,竞争维度从模型能力扩展到记忆管理、工具生态、任务编排和安全性。SuperCLUE等评测体系的价值在于提供了可量化的参照,但最终检验标准仍是真实用户在工作中的留存率和完成率。文心助手能否把评测高分转化为实际用户增长,取决于其产品打磨和生态建设的速度。
从行业趋势看,智能体的评测标准本身也在快速进化。早期的问答式评测已经无法反映真实能力,以任务完成率、端到端交付质量为核心的新评测体系正在成为主流,这反过来倒逼产品团队把资源投向工具调用、记忆管理和长任务稳定性等硬功夫。文心助手在两次独立评测中的表现,既是对过去积累的验证,也为其下一步的产品迭代划定了重点方向,如何在真实办公环境中把高分转化为口碑,是比榜单排名更艰巨的挑战。
可以预见,随着更多国产智能体产品在任务完成率评测中展开角逐,行业对AI能力的认知会越来越务实:模型好不好,最终要看能不能把活干完。