全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。
7183点击    2026-09-05 10:52

9 月 5 日凌晨 3 点,Codex 突然更新了。


我也立刻更新,打开 GPT-6,开始实测。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


那先测什么?


肯定是最近推特上很火的一键生成三维场景。


这两天看了不少演示:给 AI 一张建筑照片,过一会儿,它就能交出一个可以旋转、缩放、进去逛的页面。


看别人的视频是一回事,自己随手找张图,能不能得到同样的结果,又是另一回事。


所以我找了一张白宫的照片,直接丢了进去。


后面又测了秦始皇骑北极熊的 SVG 动画,看了朋友用一句话做出的马里奥赛车游戏,最后还拿一个昨天写过的帖子,试了试它模仿孙宇晨小作文的能力。


这几个案例放在一起,挺能说明我这一晚的感受:


GPT-6 让我意外的地方,是一个很短的要求发过去,它能把多少没交代的细节一起做出来。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


白宫这项,我的需求很简单:根据这张照片,做一个可以自由浏览的三维建筑页面。


没有给建筑图纸,没有补其他角度,也没有告诉它该用什么技术。


22 分钟后,它交出了一个能打开操作的页面。白宫主体、前面的喷泉、花坛、草坪和周围的树都在,页面上也做好了建筑名称、视角切换和控制按钮。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


我先拖动鼠标,绕着建筑转了一圈,又拉近看了一下。


到这里,已经能理解为什么这类视频最近会火:


原本平面照片里的东西,突然有了可以绕过去看的空间。


然后我点了自由漫游。


我靠,居然还能用 WASD 走路??


你可以自己往建筑前面走,靠近柱子和门窗,也可以换个位置看庭院。


这里的区别,在你按下键盘的时候就能感觉出来。


看一张渲染图时,角度已经被选好了;进入场景以后,你可以决定自己站在哪里、往哪边看。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


再往下点,还有日光调节。


拖动滑块,场景里的光线和阴影会跟着变化。


我确实要求了自由浏览,但没有逐条要求漫游怎么做、视角怎么切、光线怎么调。


这些东西,是它在实现需求的过程中自己补上的。


做完这一步,我觉得单说它能生成三维模型,已经有点说窄了。


我拿到的是一个围绕建筑搭好的浏览体验,模型只是其中一部分。


那些看起来不起眼的按钮,决定了这个东西打开以后,到底有什么可玩。


当然,一张正面照片没有提供建筑背面的信息,没拍到的部分只能近似补全,不能当成精确的建筑复原。


过程中也有一次访问报错,我把问题发回去,它切到本地预览后才正常打开。


但这些都没有改变最终的结果:我拿着一张照片,得到了一个可以自己走进去看的场景。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


接下来测 SVG,也就是用代码画矢量图,再让里面的东西动起来。


以前这类测试的保留节目是鹈鹕骑自行车。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


但这道题出现得实在太多,我也会怀疑,模型是不是已经见过类似训练材料,甚至对这道题有了过拟合。


再画好一只鹈鹕,对我的参考价值已经没那么大。


所以这次换成社区也在玩的秦始皇骑北极熊,再加一个逛长城。


这当然也算不上严格排除了训练污染,就是换道题,看看它处理几个不太搭的元素会是什么样。


我发过去的原话是:你帮我用 SVG 画一个秦始皇骑着北极熊逛长城,要能动。


界面显示,它做了 8 分 34 秒。


出来的画面叫「北境巡游」,秦始皇骑在北极熊背上,脚下是城墙,后面有层叠的山、延伸的长城和一轮红日,旁边还配了标题、印章和旗帜。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


熊会迈步,秦始皇会跟着步伐起伏,披风也在动。


整张画里,人物、坐骑和背景能放在一起看,动作也有配合。


我当时的评价是,这是我见过最好的 SVG 之一。


这里面让我觉得好玩的,是我只交代了几个对象,它却自己给这些对象找了一种画法。


配色、构图、远近关系、标题,都要作选择。


秦始皇骑北极熊本来就很离谱,但画面做出来以后,居然有点像那么回事。


它也没有把「要能动」理解成让整幅画平移一下。


熊走路,骑在上面的人就得有相应的起伏,披风也要跟着动。


这个要求只有三个字,真正落实到画面里,会变成好几个相互关联的问题。这次,它把这些关系处理得不错。


做完这两项,再看朋友@路灯同学创业笔记发来的赛车游戏,我的第一反应是:


任天堂死了。


玩笑归玩笑,视频确实值得看。


据朋友说,他也是用一句话,让 GPT-6 做了一个马里奥风格的赛车游戏。


我刚才也单独聊过这个案例,这里把视频放上来。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


打开以后,先是一个完整的比赛入口。


可以选马里奥、路易吉、碧姬、耀西这些角色,旁边是三维赛道,蘑菇、城堡、树和起跑线都做好了。


页面还列了竞速赛、道具赛两个选项,录屏里实际玩的是竞速赛。


进入比赛,左上角显示名次、圈数和时间,右上角有赛道小地图,下面是车速和漂移蓄力条。


其他车手会一起跑,排名随着比赛变化,镜头跟着车走。


漂移可以蓄力,攒够以后能用氮气加速,界面上还有对应的提示。


GPT-6甚至做了自动油门的开关。


打开以后,就可以把注意力放在转向和漂移上。


我看这个视频的时候,最在意的就是这些细节。


一个赛车游戏,画出车和赛道以后,还得让人知道怎么开始、怎么操作、自己排第几、什么时候能加速。


这些部分放在一起,才有了实际玩一局的感觉。


白宫补了自由漫游和日光,赛车补了比赛界面和驾驶辅助。


两个例子连起来看,很容易明白我为什么会觉得这轮体验好:需求里的那个名词,开始能带出一整套相关的功能。


它离一款经过长期打磨的商业游戏还有距离,手感、关卡和耐玩程度也不能靠一段录屏判断。


但从一句话出发,已经能拿到这种程度的原型,足够让很多人愿意先动手试一次。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


最后,我还测了一下写作。


这项对我更直接。


我每天都要写东西,一个模型会不会写,读上几段,通常就能感觉出来。


有些文章单看每句话都没问题,连起来却很空。


开头给你铺一堆背景,中间换着说法重复,最后再强行讲一个时代已经到来。


所以这次我拿了一个具体的素材。


昨天我写过推特上的一个老哥 Josh Cohenzadeh:看到 GPT-6 Astra 的表现以后,他发帖说要搬去怀俄明州,尽量远离 AI。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


帖子里还有一串带着技术圈笑话的生活计划,最后说要在那里劈柴,等算力耗尽。


我把这件事交给 GPT-6,让它模仿孙宇晨那类小作文的风格,写一篇文章。


出来的标题是《他去怀俄明州,等算力耗尽》,第一句只有:十五分钟以后,他订了机票。


接下来从这个人的反应写起,写到选房子的条件、柴火炉、水井和纸质地图,慢慢把那个有点荒诞的决定展开。


全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。


我觉得它写得好的地方,可以直接看这一段。


写到他想找牙医、木匠等人组建社区,并把这些本事叫作 AGI 前技能时,文章接了一句:


仿佛一个时代还没结束,已经有人开始给里面的东西贴标签,准备保存下来。


前面有具体的人和职业,这句话才接得住。


它把那个玩笑里有点复杂的情绪写出来了,又没有停下来解释一大段技术焦虑。


结尾也一样。


前面已经写过柴火炉,最后回到他要劈柴、等算力耗尽的说法,文章收在这里:


至于算力什么时候耗尽,没有人能给他一个准信。


柴倒是可以先准备起来。


这两句我很喜欢。


关于未来的大问题还悬在那里,但文章回到了一个人眼下能做的事。


开头的机票,中间的纸质地图和柴火炉,最后的劈柴,是能一路读下来的。


对我来说,这比单纯模仿几个口头禅难得多。


写作要判断哪里值得展开,哪个细节可以留下,什么地方已经说够了。


尤其是结尾,很多 AI 写到这里就开始舍不得停,好像不把意义再解释三遍,前面的文章就白写了。


这次的收尾,我觉得相当好。


这一晚看下来,三维场景、SVG、赛车和写作,其实给了我一个相近的感受:


我交代一个目标以后,它已经能替我处理相当一部分中间的选择。


白宫要怎么逛,赛车要怎么开始,动画里哪些东西应该一起动,文章里哪个细节应该放到最后。


这些都曾经需要人在做的过程中一项项决定。现在,模型交回来的第一版里,已经带着它自己的处理。


几次体验当然不能证明所有任务都到了这个水平。


它改变了我对尝试成本的判断。


以前一个想法冒出来,想到要学工具、找素材、搭环境,可能就先放下了。


现在可以先交给它做,等结果出来,再判断这个想法值不值得继续。


当第一版越来越容易做出来,选择什么值得做、判断哪里做得不好,就会占据更多精力。 ㅤ


这对写作者、产品经理和想做点东西的普通人,都很具体。


我们能更早拿着作品讨论,也能更便宜地发现自己原来的想法不成立。


这会改变很多讨论发生的时间。


以前,你得先把一个想法解释得足够清楚,说服自己或者别人投入时间,才有机会看到结果。


现在,一些原本要等到做出来才知道的问题,可以更早得到回答:这个视角合不合适,操作顺不顺手,这个故事到底有没有意思。


拿做内容来说,文章里要解释一个场景,以前可能到一张配图就结束了。


如果这种完成度能够稳定复现,我就可以考虑把它做成一个读者能进去看的页面,或者一个能亲手操作的小演示。


一个人能使用的表达方式,会跟着制作成本的下降一起增加。


很多原本觉得不值得专门做的东西,可能就会因此被做出来。


所以这一晚之后,我对 GPT-6 最直接的期待是:


下次想到一个东西,可以少在脑子里空转一会儿,先让它做出来看看。


毕竟,一张白宫的照片,我已经真的走进去逛过了。


感谢您的观看🥹


我是Max,一个在AI方向持续探索的小学生。


我会持续更新一些AI方向最新最快的产品,技术,思考


文章来自于微信公众号 “01Founder”,作者 “01Founder”

AI转型,免费服务,就找AITNT