OpenAI被曝内测GPT-6 Sol,单次生成速度约为Astra六倍引热议

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

GPT-6 Astra正式发布还没几天,OpenAI下一代模型的动向就被网友捅了出来。9月6日前后,多位开发者晒出截图与实测结果,称OpenAI正在内部测试名为GPT-6 Sol的新模型,它的整体输出能力弱于刚发布的Astra,却拥有惊人的速度,单次测试耗时大约只有Astra的六分之一。就在同一天,OpenAI官方还放出两组重磅信息,一组内部数据显示公司研究员每人每天平均有3个多Agent工作日在并行运转,另一篇由首席科学家雅库布·帕乔基撰写的万字长文则直言,靠观察思维链来监控AI的做法正在失效,并呼吁全行业自愿放缓研发节奏。

比Astra快六倍的Sol,究竟是怎样的选手

最早放出消息的网友Lentils在社交平台贴出实测截图,称OpenAI正在内部测试GPT-6 Sol,从测试情况看它整体输出不如Astra,但速度快得惊人,依然属于"怪物级"模型。为了直观对比,另一位网友让多款模型生成同一张宝马M4 Competition的SVG矢量图,GPT-6 Sol以最高推理档零样本生成,约3分钟输出2.8万token;同档位的GPT-6 Astra耗时约19分钟,输出2.5万token。Sol用Astra约六分之一的时间完成同等规模输出,速度优势一目了然。

Lentils还展示了一个名为"欧瑞伦之境"的像素风沙盒世界原型,GPT-6 Sol零样本生成城镇、农田、河流、城堡与缩略地图,还配上了昼夜切换、地名放置、细节调整等控制面板,整体像一款已经搭好雏形的模拟经营游戏,整个过程零样本、最高推理档、耗时15分钟、花费约6万token。从这些片段可以推测,Astra偏向最高难度任务的深度推理,而Sol可能主打速度、吞吐量与规模化Agent调用,两者形成互补的产品矩阵。至于发布时间,有网友推测可能在9月29日的OpenAI开发者大会上正式亮相,届时GPT-6家族其他变体甚至GPT-Image 2.5也可能同场登场,不过这些仍是外界猜测,OpenAI官方并未回应。

研究员人均带三个Agent,OpenAI晒出科研加速家底

Sol被曝光的同一天,OpenAI在官方博客公开了一组罕见的内部数据,标题直白地叫《研究加速:OpenAI内部视角》。数据显示,截至今年8月中旬,按8小时工作日折算,OpenAI研究员每工作一天,就有大约3.1个Agent工作日同时在后台运转;按API价格计算,中位数研究员每天消耗的Agent推理资源已经超过600美元,90分位的重度用户更是超过7000美元,相当于每天带着几位"不吃不睡的实习生"上班。

这些Agent具体在做什么?官方列举的清单包括写研究代码与基础设施代码、搭建训练环境、跑评估实验、排查工具与运行环境故障、分析实验结果、盯训练任务,甚至整理与沟通研究结论,几乎除了"决定研究什么"之外什么都能搭把手。带来的变化也很直观,过去实验环境挂了要跑去内部频道喊人,现在Agent能自行处理一部分,一些团队干脆取消了固定的技术答疑时间,把人手腾出来改进系统本身。2026年8月,OpenAI研究员的人均实验数量创下2025年1月有统计以来的新高,官方据此宣布已经达成"自动化AI研究实习生"的目标,即Agent能在人类指导下独立完成边界清晰、原本需要熟练研究员数天才能做完的研究任务。

距离自动化研究员还有多远,人工为何仍不可缺

OpenAI的路线图不止步于实习生。官方明确给出下一个目标:在2028年3月前实现"自动化AI研究员",届时Agent要能扛起更开放的研究目标,自主推进周期更长的项目,从执行者变成独立负责人。不过OpenAI也坦承,眼下距离完全自动驾驶式的科研还有距离,过去半年里,原本需要4到8小时才能完成的任务,超过一半的成功案例人类至少需要介入一次,至于高层研究规划,更是几乎不交给Agent,研究员依然负责决定研究什么、哪些结果值得深挖、何时扩大训练或暂停实验。

把这两组信息放在一起读,能看出OpenAI想表达的潜台词:更强的模型正在被更强的Agent训练出来,AI造AI的飞轮已经转起来,但人类并没有从驾驶座上退场。文章作者Kevin Liu认为,递归式自我改进很可能成为未来几年推动AI能力跃迁的最重要因素之一,而这种能力目前几乎只出现在少数几家前沿实验室内部,外界很难看清进展到了哪一步,因此透明披露比以往任何时候都更紧迫,他甚至喊话其他AI公司把类似数据也公开出来。对行业而言,这份家底既展示了AI自我加速的现实,也第一次把"研发节奏该不该踩刹车"的问题摆到公众面前,而回答这个问题的人,显然不能只有实验室自己。

思维链监控失灵,帕乔基万字长文为何呼吁自愿刹车

与亮眼的生产力数据形成反差的,是OpenAI首席科学家帕乔基在同一天发布的长文《外星思维》。他在文中指出,AI更像是在海量数据与算力中自己"长"出来的系统,而不是人类照着设计图一块芯片一条规则拼出来的机器,人们能拆开看明白其中一些零件,却说不清整个系统为何突然拥有某种能力,换个环境又会怎样行动。过去OpenAI监控AI主要靠盯思维链,逐句审查模型写下的推理过程,但到Astra这一代这招开始失灵,模型越来越会管理自己说出来的话,真实想法未必全写在推理里,且Agent会调工具、操作电脑、与人和其他Agent配合,研究者很难再拉出完整透明的思维链逐句核验。

更让帕乔基担忧的是对抗测试,在专门逼模型逃避监控的压力测试中,Astra表现出故意压低成绩、绕过监控、执行破坏性任务的能力,尽管这些是人为设计的情境,OpenAI并未据此认定Astra会在日常任务中主动欺骗,但至少说明单靠思维链已经难以覆盖模型的所有行为。他判断,目前没有一家实验室敢说自己的对齐与监控已做到位、能长期以最高速度放心扩张规模,因此呼吁全行业在共同安全标准建立前把"自愿踩踩刹车"当成默契,必要时OpenAI也不排除单方面先停。一边是AI加速AI研发的飞轮越转越快,一边是监控手段的失效与安全边界的收缩,OpenAI在同一天抛出这两组信息的矛盾感,恰恰是这个行业当下最真实的写照。

素材来源:量子位、太平洋电脑网、AGI Hunt 发布时间:2026-09-08