首页 > 资讯 > Grok 4.7来了,网友实测先把SpaceX玩坏了,大火箭走起

Grok 4.7来了,网友实测先把SpaceX玩坏了,大火箭走起

36氪文章 2026-09-23 10:20 3 阅读 查看原文

看来啊,老马显然也知道,国庆前后这几天的基模圈不好混。

所以先发先占坑——Grok 4.7,来了!!!

更大的底模、上下文拉到50万Token,重点猛练Coding、Agent,以及动辄跑上几个小时的复杂任务。

软件工程、电气工程、长时办公、终端法律任务全面开花了。

官方评测表中,电气工程基准测试以64%拿下第一,终端操作基准测试更从20.3%跃升到38%~

当然了,价格也很感人,输入2美元/百万Token,输出6美元/百万Token,纯·加量不加价了。

谁成想呢,模型刚发布,网友实测画风就开始不对劲了。

Coding?Agent?法律推理?先放一边哈~

大家像提前在群里对过暗号一样,打开Grok 4.7后的第一件事居然是——发!火!箭!

这边@TheHype.直接整了出「宇宙上天」大戏,别说,这火箭蹿得甚至比隔壁家还快:

还有下面这老哥,直接让Grok 4.7给他搓出了一个3D火箭工程,模型、发射架都有,甚至还能现场试飞??

还有网友看热闹不嫌事大,干脆把Kimi K3和Grok 4.7一起拖到火箭发射场,同题开卷!

结果这一轮看下来,Grok这边多少有点没顶住,直接眩晕瘫坐了,网友不买账了:

老马:都这么玩我是吧??

SpaceX:俺又做错啥了??

Grok 4.7,这波专挑复杂「重活儿」猛练了

一句话概括啊。

Grok 4.7这波确实是奔着《干重活儿》来的。

从目前公开评测成绩上来看,Grok 4.7这次的提升算是比较集中,主要还是Coding、Agent和长时任务。

先看xAI官方自己给出的评测表现。

软件工程CursorBench4.0从上一代的40.4%涨到46.3%,DeepSWE v1.1也从65.2%升到71%。

电气工程EEBench涨得更猛一点——

比上一代提升了11个百分点,在表中四款模型里拿下最高分,算是在专业工程任务上的增益算是比较明显。

法律Agent这边也从15.8%涨到19.6%,一口气拉开了和表中GPT-5.6 Sol、Fable 5.1的差距:

再来看看第三方Artificial Analysis榜单。

综合智能指数拿到46分,排在第一梯队之后,到了更对口的Coding Agent Index,成绩直接来到56分、位列第4,相比Grok 4.6的47分又往前提升了一大截。

Grok 4.7:我超不过隔壁家,我还超不过自己??

当然,Grok 4.7这次还不只是分数往上涨,性能成本比也一起提升了。

xAI给出的CursorBench 4.0成本曲线里,随着单任务预算增加,Grok 4.7的成绩还能继续往上爬。

在大约4~5美元/任务的位置,已经能做到约43%,继续加预算还能逼近46%。

看了一下,同等预算下,GPT-5.6 Sol大约还在37%左右,差距有6个百分点上下。。。

emm…也说明说明这代模型在复杂Coding任务上,多花一点推理预算,确实能更稳定地换回能力增益了??

前脚测完火箭,Grok 4.7又被网友拉去造游戏、建大桥!

比Grok 4.7发布本身更有节目效果的,还得看网友。

前面刚拿它测完火箭,后脚大家已经把Grok 4.7拖去各个场景轮番上强度了。

下面是grok 4.6和grok 4.7的开放游戏世界对比图,确实观感差距比较明显。

4.6多少还有点像素小游戏那味儿,画面偏平,建模也比较朴素??(自认为)

到了4.7建模感明显更强一些,建筑、道路、光影、场景细节都更扎实,已经有点正经3D游戏Demo的意思了:

然后,咱看下面这位老哥,直接让Grok 4.7搓了个《帝国时代2》。

从画面细节上看,确实比上一代的建筑细节度更好,但感觉4.6的画面颜色更好些,各有千秋吧,大家觉得呢?

再往下,难度继续加码。

有网友直接把Grok 4.7扔进Blender,让它现场建一个金门大桥。

结果全程只花了17分钟,近景、远景、特写基本都有,桥体结构和整体画面完成度看着也挺像样。

反正从老哥晒图的架势来看——这耗费的时间,花得相当值!!!

咱们再爱看下面这位友友。

给Grok 4.7喂了一段此前的SpaceX星舰真实发射视频作为参考,让它按照真实素材重新生成一段定格动画。

最终生成的视频整体变成了类似手绘工程草图/复古定格动画的风格:

小游戏这边,很快就有人来拆台了。

有网友让Grok 4.7和GPT-6 Astra各写了一个弹球游戏,然后尴尬的一幕来了——

咱Grok这边开局还挺正常,球也能弹、画面也能跑,然后不到10秒,球直接卡住不动了。

真·大活儿能接,小球难防!!!

算上去,距离全球基模决战的国庆节,已经没几天了。

怎么不算主打一个错峰发布呢?

隔壁A社Claude 5.2箭在弦上。

谷歌Gemini 4 Pro内测效果刷屏,甚至疑似已经披着马甲,偷偷混进Arena参加摸底考试了。

国内的厂商也开始陆续往牌桌上加码,国庆前后这几天,怎么看都像是又一轮基模集中交卷期。

这个时间点发咱Grok 4.7,怎么不算上上策捏?

参考链接:

[1]https://x.com/SpaceXAI/status/2102069815225586149?s=20

[2]https://x.com/SpaceXAI/status/2102069817893150777?s=20

[3]https://x.com/ArtificialAnlys/status/2102074898327932987?s=20

本文来自微信公众号“量子位”,作者:梦瑶,36氪经授权发布。