9月21日,马斯克旗下SpaceXAI发布新一代大模型Grok 4.7。官方把它称为公司目前面向编程与知识工作最强的模型:基础模型规模比上一代Grok 4.6更大,强化学习训练周期更长,训练素材侧重那些需要数小时才能完成的多步实务任务,并原生适配其多智能体框架Grok Bot。模型同步登陆Grok API、Grok Build与Cursor,也接入第三方编程工具、模型路由服务与云平台。定价维持在每百万输入词元2美元、输出词元6美元,与上一代一致。
这次升级最核心的变化不在单轮问答,而在持续工作能力。官方给出的参数规模约为2.1万亿,属于稀疏混合专家架构,上下文窗口保持50万词元,知识截止到2026年5月。训练数据的特殊之处在于,它补充了SpaceX的内部工程记录,包括星链卫星遥测与制造日志,官方认为这部分数据能强化自主编程与工程推理表现。
训练方式也围绕时长做文章。上一代更侧重短提示的单轮任务,这一代把强化学习的权重向需要数小时的多步任务倾斜,同时强化模型在输出前的自我检查能力。官方演示里,用Grok 4.7与Grok 4.6分别生成一款开放世界城市游戏,新版在角色多边形与背景细节上的提升相当直观。
专业场景是另一个着力点。在面向律师、护士与金融分析师等职业实务的GDPval与AA Briefcase两项基准上,Grok 4.7的得分较前代进步,官方称综合表现已经看齐行业前沿模型。它还推出一个高速版本,输出速率翻倍,价格同步翻倍,只在Cursor与Grok Build两个渠道出售。
分歧出现在第三方评测上。SpaceXAI自己给出的数据是:CursorBench 4.0从40.4%升到46.3%,DeepSWE从65.2%升到71.0%,EEBench从53.0%升到64.0%,Terminal-Bench 4.0从20.3%升到38.0%。按这组数字,Grok 4.7在长周期编程任务上已经能与更贵的旗舰模型同场竞争。
但Artificial Analysis的独立测量给出了另一幅画面。在其智能指数上,Grok 4.7得46分,处在当前前沿阵营的中段,而Claude Fable 5.1与GPT-6 Astra同为53分。在最能体现自主终端与编程能力的Terminal-Bench 4.0上,独立测量把Grok 4.7放在约26%,明显落后于GPT-6 Astra的约60%与Claude Fable 5.1的约55%,甚至略低于DeepSeek V4.1 Flash的约27%。
这种落差并不罕见,厂商自测与第三方复现之间常有系统性偏差。更值得关注的是评测口径:官方表格把Grok 4.7的最高推理档与对手的最高档对比,而独立机构在固定档位下复测。对采购方来说,两套数字同时看,比只看一套更接近真实。
定价表上看,Grok 4.7与上一代完全一致,输入2美元、缓存输入0.5美元、输出6美元,都低于GPT-5.6 Sol与Claude Fable 5.1的标价。这也是马斯克在社交平台上强调的卖点:智能、速度与低成本的组合。
问题在于词元消耗。Artificial Analysis发现,Grok 4.7在最高推理档完成一个代表性任务时输出约8.1万词元,而Grok 4.6约3.6万,GPT-6 Astra约2.7万。也就是说,它比上一代多消耗约125%,比GPT-6 Astra多消耗约196%。把用量折进去之后,Grok 4.7在该档位的实际单任务成本约为3.74美元,反而高于GPT-5.6 Sol的1.99美元,尽管后者的标价更贵。
这揭示了一个正在被行业重新认识的定价规律:标价只描述单位成本,真实成本等于单位价格乘以完成任务所需的用量。当模型被放进需要持续迭代的智能体循环里,用量差异会被放大很多倍,这也是为什么越来越多企业在选型时开始看每任务成本而不是每百万词元价格。
安全侧这次同步做了更新。SpaceXAI称Grok 4.7配备了全新的防护体系,在拒绝不当提问与抵御越狱攻击上达到内部测试的最高水准。在面向高风险网络安全任务的HackerBench v0.3中,仅有3.3%的高风险双重用途提示能通过模型,同时官方称对合规安全研究工作的误拦截被压到较低水平。在LatchBio生物安全基准上它取得62.4%,公司已向部分网络安全研究伙伴开放邀请访问,用于红队建设与防御研究。
渠道方面,Grok 4.7已上线Cursor与Grok Build,并通过Grok API对接第三方编程工具、模型路由与云平台。在OpenRouter上,它的输入与输出报价分别为每百万词元1.6美元与4.8美元,属于平台侧的折算价。按官方路线,参数规模更大的Grok 5预计在年底前后推出,将接入更多SpaceX内部工程数据,并计划采用约6万亿参数的混合专家架构与150万词元上下文。
把这次发布放进九月的整体节奏里看,长任务正在成为新一轮竞争的主轴。从Anthropic的Opus 5.5到OpenAI的GPT-6 Sol与Luna,各家都在把多小时自主工作作为核心卖点。当能力差距被压缩到几个百分点,评测方法、词元效率与单任务成本,正在取代单纯的跑分,成为下一阶段更难被复制的差异点。