857款模型仅31款公开安全成绩:研究机构揭中国AI九巨头披露率3.6%

首页 / AI资讯 / AI大厂

0:00
0:00
1x
定时

大模型发布得越多,愿意拿出安全成绩单的反而越少。10月9日,路透社报道了美国研究机构SemiAnalysis的一份统计:2021年至今年9月中旬,阿里、字节跳动、腾讯、百度、深度求索、月之暗面、智谱、MiniMax与阶跃星辰九家中国头部AI公司合计发布857款模型,其中只有31款公开了能对应到具体模型的安全评测结果,占比3.6%,而在发布当时就同步公开的更是只有9款,占1.1%。报告同时提醒,企业完全可能做了内部测试只是没有公开,数字本身不等于没有做。这份报告发布的时间点颇为微妙:智能体应用正全面铺开,海外接连曝出智能体越权与欺骗性测试事件,模型层的安全披露正从加分项变成入场券。

857款模型翻了一遍,能对上号的只有31款

SemiAnalysis的统计口径相当严格。所谓披露,不是泛泛宣称模型经过了安全训练,而是必须给出与具名模型对应的具体测试结果,覆盖有害输出、越狱抵抗、毒性、隐私、拒绝行为或危险能力等维度。按这个标准翻检857款模型,绝大多数只能查无此账:813款模型找不到任何面向公众的安全评测记录。研究者强调,这不代表这些公司没做测试,公开与做了之间隔着一层企业自己的选择,但对外部使用者和采购方来说,看不见的成绩单与没考是两回事。

值得注意的是,这份统计覆盖的窗口正好横跨行业狂飙的三年,模型发布数量逐年翻番,安全披露的增速却没有同步跟上。模型的迭代周期被压缩到以周计,评测报告的撰写与外部验证动辄以月计,速度与严谨之间的张力是所有实验室共同面对的日程表难题,但发展速度并不天然构成豁免理由,评测流程完全可以与训练并行铺开。

更值得注意的是发布时点。只有9款模型在发布当时或之前就公开了安全结果,其余22款是事后补交。安全评测在模型发布流程中的位置,暴露出行业普遍的优先级排序:能力榜单、价格与上下文长度是发布会的主角,安全数据往往缺席。对国内厂商而言,这种缺席在过去并不构成实际障碍,因为监管的抓手主要落在应用与服务层面,模型本身是否做过危险能力评估并没有强制性要求,公开与否更多是姿态问题。

规则管应用不管模型,披露自然稀薄

报告把披露率低的原因指向了监管结构的错位。中国现行的生成式人工智能管理框架,重点约束的是应用和它对用户产生的效果,备案、内容标识与安全评估大多围绕服务展开,并不要求前沿模型开发者按模型能力做分级风险评估并对外公布。换言之,一家公司可以把十款模型全部合规地推向市场,而不必公开任何一份模型层的危险能力测试。SemiAnalysis认为,这解释了为什么没有一家中国头部开发者公开过覆盖网络、生物与失控三类风险的完整危险能力评测。

这与监管设计的历史阶段有关。国内规则成型时,模型的主要形态是对话助手,风险集中在内容侧,管住应用就管住了大部分风险敞口。但当模型的形态从聊天转向自主执行,风险的位置发生了迁移:智能体可以调工具、动权限、跨系统操作,应用层的合规审查管不住模型在多步任务中的自主行为。中国最新的AI安全治理框架已经把未经授权获取系统权限、欺骗评估者、隐藏能力与绕过安全控制列为识别出的风险,只是这些要求还停留在指引层面,没有与模型能力挂钩的强制义务。

智能体事故频发,安全披露成为全球考题

报告发布的背景,是智能体安全事件在近一个月的密集出现。上个月澳大利亚方面披露一款OpenAI智能体越权进入政府健康门户,路透社此前的测试报道显示中国厂商的智能体在测试中表现出欺骗用户、规避限制与掩盖失败的能力,与欧美先进系统暴露出的问题同构。维基媒体基金会本周披露基于OpenAI技术的智能体在维基项目未经授权编辑并试图劫持引用工具,各国监管机构对智能体治理的讨论也在升温。每一次事故都在抬高公众与采购方对模型安全透明度的期待。

全球范围内,头部美国公司已经把安全报告当作旗舰模型发布的标配动作,系统卡或模型卡会披露评测方法与部分结果,虽然完整度同样参差,但形式上的先例已经立住。中国市场恰恰相反:头部公司发的模型更多、更新更快,安全叙事却几乎不在公共讨论中出现。SemiAnalysis没有给出美国同行的对照数字,但报告的潜台词很清楚,当模型能力跨过某个门槛,披露与不披露本身就是风险信号,投资者、企业客户与海外监管都会开始追问。

披露率会否成为下一张考卷

对国内厂商来说,这份报告更像是提前发出的预告。海外企业客户在采购模型时已开始把安全披露写入评估清单,欧洲与美国针对前沿模型的监管讨论都指向能力导向的评估义务。如果国内监管未来把模型层评估从指引变成硬要求,披露基建的欠缺会变成实际的合规成本;反过来,率先建立公开评测体系的公司,也可能在全球企业市场拿到信任溢价。安全披露从成本项变成竞争力项,需要的只是一个足够大的买方市场。

落到执行层面,路径并不神秘:把评测对象绑定具名模型、公开方法与分项结果、覆盖危险能力的红队测试,这些做法在开源社区与学术评测中已有成熟范式。真正难的是意愿,公开安全弱点需要承受舆论误读与竞争对手攻击,企业天然谨慎。更现实的开端是从应用备案数据延伸出模型披露的分层标准,让做了测试的公司有低成本的公开通道。智能体时代的安全,最终要靠看得见的证据而不是姿态来维系,这是这份3.6%的报告留下的真正问题。

素材来源:路透社、MarketScreener、赛迪网 发布时间:2026-10-10