Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起
7930点击    2026-09-23 10:47

看来啊,老马显然也知道,国庆前后这几天的基模圈不好混。


所以先发先占坑——Grok 4.7,来了!!!


更大的底模、上下文拉到50万Token,重点猛练Coding、Agent,以及动辄跑上几个小时的复杂任务。


软件工程、电气工程、长时办公、终端法律任务全面开花了。


官方评测表中,电气工程基准测试以64%拿下第一,终端操作基准测试更从20.3%跃升到38%~


当然了,价格也很感人,输入2美元/百万Token,输出6美元/百万Token,纯·加量不加价了。


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


谁成想呢,模型刚发布,网友实测画风就开始不对劲了。


Coding?Agent?法律推理?先放一边哈~


大家像提前在群里对过暗号一样,打开Grok 4.7后的第一件事居然是——发!火!箭!


这边@TheHype.直接整了出「宇宙上天」大戏,别说,这火箭蹿得甚至比隔壁家还快:


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


还有下面这老哥,直接让Grok 4.7给他搓出了一个3D火箭工程,模型、发射架都有,甚至还能现场试飞??


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


还有网友看热闹不嫌事大,干脆把Kimi K3和Grok 4.7一起拖到火箭发射场,同题开卷!


结果这一轮看下来,Grok这边多少有点没顶住,直接眩晕瘫坐了,网友不买账了:


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


老马:都这么玩我是吧??


SpaceX:俺又做错啥了??


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


Grok 4.7,这波专挑复杂「重活儿」猛练了


一句话概括啊。


Grok 4.7这波确实是奔着《干重活儿》来的。


从目前公开评测成绩上来看,Grok 4.7这次的提升算是比较集中,主要还是Coding、Agent和长时任务。


先看xAI官方自己给出的评测表现。


软件工程CursorBench 4.0从上一代的40.4%涨到46.3%,DeepSWE v1.1也从65.2%升到71%。


电气工程EEBench涨得更猛一点——


比上一代提升了11个百分点,在表中四款模型里拿下最高分,算是在专业工程任务上的增益算是比较明显。


法律Agent这边也从15.8%涨到19.6%,一口气拉开了和表中GPT-5.6 Sol、Fable 5.1的差距:


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


再来看看第三方Artificial Analysis榜单。


综合智能指数拿到46分,排在第一梯队之后,到了更对口的Coding Agent Index,成绩直接来到56分、位列第4,相比Grok 4.6的47分又往前提升了一大截。


Grok 4.7:我超不过隔壁家,我还超不过自己??


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


当然,Grok 4.7这次还不只是分数往上涨,性能成本比也一起提升了。


xAI给出的CursorBench 4.0成本曲线里,随着单任务预算增加,Grok 4.7的成绩还能继续往上爬。


在大约4~5美元/任务的位置,已经能做到约43%,继续加预算还能逼近46%。


看了一下,同等预算下,GPT-5.6 Sol大约还在37%左右,差距有6个百分点上下。。。


emm…也说明说明这代模型在复杂Coding任务上,多花一点推理预算,确实能更稳定地换回能力增益了??


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


前脚测完火箭,Grok 4.7又被网友拉去造游戏、建大桥!


比Grok 4.7发布本身更有节目效果的,还得看网友。


前面刚拿它测完火箭,后脚大家已经把Grok 4.7拖去各个场景轮番上强度了。


下面是grok 4.6和grok 4.7的开放游戏世界对比图,确实观感差距比较明显。


4.6多少还有点像素小游戏那味儿,画面偏平,建模也比较朴素??(自认为)


到了4.7建模感明显更强一些,建筑、道路、光影、场景细节都更扎实,已经有点正经3D游戏Demo的意思了:


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


然后,咱看下面这位老哥,直接让Grok 4.7搓了个《帝国时代2》。


从画面细节上看,确实比上一代的建筑细节度更好,但感觉4.6的画面颜色更好些,各有千秋吧,大家觉得呢?


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


再往下,难度继续加码。


有网友直接把Grok 4.7扔进Blender,让它现场建一个金门大桥。


结果全程只花了17分钟,近景、远景、特写基本都有,桥体结构和整体画面完成度看着也挺像样。


反正从老哥晒图的架势来看——这耗费的时间,花得相当值!!!


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


咱们再爱看下面这位友友。


给Grok 4.7喂了一段此前的SpaceX星舰真实发射视频作为参考,让它按照真实素材重新生成一段定格动画。


最终生成的视频整体变成了类似手绘工程草图/复古定格动画的风格


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


小游戏这边,很快就有人来拆台了。


有网友让Grok 4.7和GPT-6 Astra各写了一个弹球游戏,然后尴尬的一幕来了——


咱Grok这边开局还挺正常,球也能弹、画面也能跑,然后不到10秒,球直接卡住不动了。


真·大活儿能接,小球难防!!!


Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起


算上去,距离全球基模决战的国庆节,已经没几天了。


怎么不算主打一个错峰发布呢?


隔壁A社Claude 5.2箭在弦上。


谷歌Gemini 4 Pro内测效果刷屏,甚至疑似已经披着马甲,偷偷混进Arena参加摸底考试了。


国内的厂商也开始陆续往牌桌上加码,国庆前后这几天,怎么看都像是又一轮基模集中交卷期。


这个时间点发咱Grok 4.7,怎么不算上上策捏?


参考链接:

[1]https://x.com/SpaceXAI/status/2102069815225586149?s=20

[2]https://x.com/SpaceXAI/status/2102069817893150777?s=20

[3]https://x.com/ArtificialAnlys/status/2102074898327932987?s=20


文章来自于"量子位",作者 "梦瑶"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md