3D 生成的基本单位,正在从「物体」变成「场景」。
9 月 1 日,影眸 Hyper3D 发布世界生成模型 WorldGen。用户上传一张场景图片,两三分钟内,就能得到一个由多个独立物体组成的 3D 场景。
听上去,这只是把过去图生 3D 的生成范围扩展了一个层级。但在此之前,即使模型能把一张会议室照片转成完整的 3D 模型,桌椅、电脑和水杯也往往都和背景整体「黏」在一起,结果更像一件只能观看的「立体布景」。
而 WorldGen 会分别生成画面里的主要物体,再放回对应的位置。桌子、椅子和水杯各自独立,可以单独挑出来编辑或替换。它们也具备质量、摩擦系数等基础物理属性,能够在真实的物理引擎中被推动、拿起和交互。

这项能力源自影眸 Hyper3D 在 2025 年发表的 场景级生成研究 CAST。CAST 获得了国际图形学顶会 SIGGRAPH 2025 最佳论文,同期获此荣誉的商业公司,全球只有谷歌、Meta 和影眸 Hyper3D。此后,团队又用了一年多时间推进后续模型、算法与工程系统的演进,才把论文里的场景生成能力做成产品。
技术演示之外,WorldGen 已经开始进入真实生产流程。生成后的资产可以直接进入 Blender、Unity、PlayCanvas、团结引擎、Unreal Engine 等 DCC 与实时引擎环境,无缝衔接用户的既有工作流。不仅被很多创作者结合 Seedance2.5 等视频模型用于商业宣传片等影视制作,还被用于空间展示与 XR 内容创作。影眸 Hyper3D 也正与地瓜机器人、谋先飞合作,探索 WorldGen 在机器人仿真领域的应用。
在和 FounderPark 的对话中,影眸 Hyper3D 创始人兼 CEO 吴迪、联合创始人兼 CTO 张启煊进一步谈到了 WorldGen 的技术路线、商业化方向,以及 3D 生成接下来可能走向哪里。
在 Hyper3D 打开 WorldGen 的界面,第一步很简单,上传一张场景图片。它可以是任何一个真实空间的照片,比如一间办公室,也可以是一张想象中的开放世界概念图。
系统会自动识别图片里的主要物体,一键生成整个场景。用户也可以手动框选,指定哪些物体需要被生成。每选中一个物体,两三秒后就会出现一个初步的 3D 预览。一键完成包含十几个、二十个物体的场景,大约需要两三分钟。

但对于真正可用的场景级生成来说,把图片里的所有物体分别变成 3D,只是起点。场景级生成更难的部分,是让模型理解物体之间的物理关系。
一张图片里,桌上放着一瓶水。人可以凭常识判断,是桌子支撑水瓶,而不是水瓶托着桌子。但图片本身没有直接写出这种关系,也不会告诉模型水瓶的质量、摩擦系数、重心和碰撞体。遇到遮挡、透视畸变和信息缺失,模型还要补全看不见的几何结构。
WorldGen 会在后台建立物体关系图,识别接触、支撑、悬挂等关系,预测物体在同一空间里的位置、尺度和朝向,再进行基础的物理校正,减少穿模、悬浮和不合理堆叠。开启 SimReady 后,系统还会估计质量、摩擦系数、恢复系数和碰撞体等属性。由此得到的场景不只保留视觉外观,也具备进入游戏或机器人仿真的基础条件。
背后的技术可以追溯到影眸 Hyper3D 团队在 2025 年发表的研究 CAST(《CAST:基于单张 RGB 图像的组件对齐式 3D 场景重建》),探索如何从单张图像出发,构造由多个独立、完整、可交互物体组成,且在物理关系上合理的 3D 场景。该项研究成果斩获当年国际图形学顶会 SIGGRAPH 最佳论文。

按照影眸 Hyper3D 团队的说法,这些物理属性更接近人看到一件物品时的直觉判断,属于「猜测的估计值」,暂时不能作为精密的工业测量结果,但已经足以支撑基础的物理仿真需求。比如两根柱子叠在一起,抽走下面一根,上面的柱子会随之倒塌。抽屉里的东西被打翻,会滚落到地面,而不是悬在空中。
现阶段,WorldGen 主要擅长生成刚体,搭出一个能继续运行和修改的空间骨架。生成的水龙头直接拧动,衣服自然褶皱这些关节化资产、柔性体和动态交互,会是技术路线图上的下一步。
为了兼顾可用性和视觉完整性,影眸 Hyper3D 选择 Mesh 与 3D Gaussian Splatting(高斯)的混合表达。
场景中需要移动、编辑和交互的主要物体,用 Mesh 生成。它有实体结构,可以附加物理属性,也更容易进入主流 3D 管线。天空、远景和不需要交互的背景,则由 3D Gaussian Splatting 补全,保留更多环境信息和沉浸感。
需要「用」的部分交给 Mesh,需要「看」的部分交给高斯。只用 Mesh,背景容易显得空。全部使用高斯,画面可以很完整,但物体缺少实体结构,很难用于物理仿真。

WorldGen 没有默认场景里的每件物体都以最高精度生成。基于 Hyper3D Rodin Gen-2.5 的 thinking effort 架构,模型最快可以用 4 秒生成一个资产,用户也可以根据自身需求花 40 秒或 80 秒补充更多表面细节。用户可以先用低时延模式看整体结构,再挑出关键物体继续 Refine。
这让场景生成不再是一次成本固定的「抽卡」。一个远处的花瓶和一个需要特写的主角道具,可以被分配不同的生成时间和精度。可控性不只意味着结果能不能改,也意味着用户可以决定时间和算力花在哪里。
很明显,当场景中的物体可以拆开、修改并进入后续工具,WorldGen 的目标,不仅仅是帮用户省下做几个 3D 模型的功夫,还有更大的目标。
一次生成十几个物体,最直接的价值当然是节省时间。但影眸 Hyper3D 认为,场景级生成带来的更大变化,并不只是让不同生成模型和生产工具多了一层连接,而是让 3D 场景成为整个内容生产流程的共同底座。
影视制作就是一个直观的例子。
今天的视频模型已经能生成质量极高的单个镜头,但在多镜头叙事中,一致性仍然是个难题。镜头切换后,飞船的结构可能发生变化,房间里的道具也可能出现在另一个位置。如果导演想把画面左侧盘子里的苹果移到右侧,纯视频生成很难稳定实现。而在 3D 场景中,这只是一次简单的移动操作。
WorldGen 提供的工作流,是先建立一个空间结构稳定、资产彼此独立的 3D 场景。创作者可以在其中调整镜头、构图、角色和道具,确定空间关系后,再把画面交给视频生成模型,补充人物表现、材质、光影和整体风格。
这更像一张「3D 导演台」。场景本身不必直接达到最终成片的视觉质量,但需要准确保存这个世界里有什么、物体放在哪里、镜头如何运动。3D 负责保存世界状态和提供控制,视频模型负责最终的视觉表现。

已经有创作者将 WorldGen 与 Seedance 2.5 结合,为一家新加坡音乐学院制作宣传片。先用 WorldGen 确定空间结构、镜头关系和可控白模,再由视频模型补充材质、光影与动态效果,最终成片被用于商业项目。
这套工作流也适用于传统扫描难以覆盖的场景。扫描的前提是现实中已经存在一个环境,并且完成了布景。科幻场景、概念空间等无法实拍的环境,则可以由 WorldGen 根据图片或创意描述直接生成。现实中存在的空间可以扫描,不存在的空间可以生成,两者都能先形成一个可控的 3D 基底,再接入后续的视频制作流程。
目前,WorldGen 已经与一些短剧和影视项目展开合作,相关作品仍在制作中。对多镜头叙事、广告、概念短片和影视预演而言,WorldGen 的价值在于先把容易变化的世界固定下来,再交给视频模型完成画面。

为了给影视制作带来更多创作可能性,WorldGen 配备 AI Render 模块,涵盖 AI 渲染和自由运镜等功能,让同一场景随心切换多元视觉风格,大幅提升产品概念演示、空间导览等影视内容的制作效率与视觉品质。

影视之外,同一套场景生成能力还可以进入游戏开发、XR 等领域。
过去,小的游戏团队搭建一个关卡,需要分别制作或购买资产,再由专业人员完成摆放、材质调整和性能优化。WorldGen 可以先把场景搭出来,其中的每个 Mesh 资产仍能独立导出,无缝接入 Blender、Unity、PlayCanvas、团结引擎、Unreal Engine 等主流工具进行后续的二次创作。

今年 7 月,影眸 Hyper3D 与 Unity 中国宣布合作,尝试打通 3D 生成与实时游戏应用之间的工程链路。对于小团队来说,这意味着不必先配置完整的美术工种,也能快速验证一个关卡或更复杂的世界设定。
随着 3D 生成进入游戏中,它还可能成为一种新的 UGC 机制。玩家可以在游戏中直接生成和修改 3D 内容,过去受限于预算、团队配置和资产商店的创意,也因此有了被实现的可能。
类似的场景还可以进入 XR 和空间计算。用户戴上 Apple Vision Pro 等设备后,可以进入由单张图片生成的三维空间,从不同位置观察场景,替换物体、调整陈列和修改布局。这套能力也可以延伸到室内设计、沉浸式教育和空间展示,让一张只能观看的参考图变成可以进入、编辑和交互的空间。

这些应用看起来相距甚远,底层诉求却相同。它们都需要一个可以拆解、编辑、运行,并且能够进入既有工具链的 3D 场景。3D 生成的竞争,也开始由「第一眼像不像」走向「生成一个物体之后还能做什么」。
如果说影视、游戏、XR 和空间计算需要的是一个可以控制、编辑和生产的空间内容。到了具身智能,对场景中物理准确度的要求又上了一个台阶。
具身仿真需要的场景不能只是看起来像真的,具身智能要在其中运动、抓取和碰撞,每个物体都需要有几何结构、碰撞体和基础物理属性。过去,一个仿真场景往往需要人工建模和搭建,制作周期长,也很难覆盖大量复杂布局和长尾物体。
作为 NVIDIA Inception 成员,影眸 Hyper3D 长期深度融入 NVIDIA 全球仿真生态。Hyper3D Rodin 此前借助 NVIDIA Omniverse 与 Isaac Lab 上线了 Sim-Ready 功能,让生成的 3D 资产自带物理属性,还推出了 Isaac Sim 官方插件。
Hyper3D WorldGen 则让这种协同走向纵深,过去是「一个资产进 Isaac Sim」,如今是「整个场景进 Isaac Sim」。从生成到仿真验证,影眸 Hyper3D 和 NVIDIA Isaac Sim 生态之间已形成完整通路,覆盖具身智能仿真数据的关键环节。

今年 7 月,影眸 Hyper3D 与地瓜机器人、谋先飞联合发布「具身智能可训练仿真闭环联合解决方案」。这套方案把 WorldGen 放在真实影像与机器人训练之间。
首先,WorldGen 从一张真实场景照片中识别并还原可交互的 3D 场景,并生成具备仿真导入能力的三维资产。用户还可以调整布局、替换物体,快速构造同一任务下的不同环境。

随后,谋先飞基于自研物理引擎 MotrixSim,将这些资产接入仿真环境,使机器人在其中运动、抓取和交互,获得物理与传感器反馈。同一场景可以复制多份并行运行,以支撑更大规模的训练。

地瓜机器人提供算力底座和开发工具链,把场景生成、仿真运行、数据采集、模型训练和策略验证连接起来。
在这套分工里,WorldGen 负责生成可用的场景资产,仿真引擎负责让它们运行,机器人平台则承接后续训练。
生成式 3D 还能补充真实数据难以覆盖的部分。现实中不可能购买 10 万种杯子逐一采集,也不适合让机器人进入火灾、抢险等危险现场反复训练。在仿真环境中,同一类物体可以扩展出大量几何和外观变体,极端环境也可以安全复现。
仿真数据的价值,一部分在规模,另一部分在现实无法提供的变化。但这不意味着仿真数据会完全取代真实数据,两者更可能长期混合使用,具体比例取决于任务和训练路线。影眸 Hyper3D 参与的研究 cuNRTO 获得了 2026 年 RSS 最佳论文提名,关注的也是生成资产、仿真训练与真实部署之间的 Sim-to-Real 问题。
Q:做完单物体生成后,为什么下一步是场景?
张启煊:做完单物体级 3D 生成大模型 Hyper3D Rodin 后,我们的技术路线向两个方向发展。
一个方向向内,一个完整资产能不能拆成具有结构关系的部件,对应我们在 Hyper3D Rodin Gen-2 中上线的 BANG 递归分件。另一个方向向外,一个资产能不能变成多个资产,共同构成一个空间,对应 CAST 和今天的 WorldGen。
场景生成对 3D 基座模型提出了更高要求。模型不仅要生成物体,还要理解物体之间的物理关系。比如盘子支撑着水果,水果和盘子又必须彼此独立。开启物理交互后,系统还要了解物体的质量、摩擦等属性。
吴迪:物体最终总要进入环境。它会成为游戏关卡中的素材、影视中的道具、机器人的仿真对象,或者室内设计中的空间元素。场景并不是为了追逐概念,而是单物体生成进入实际使用的必经环节。
Q:CAST 在 2025 年已经获得 SIGGRAPH 最佳论文,为什么还需要一年多才能做成产品?
张启煊:场景生成是一个多模块的复杂系统。假设每个模块的成功率都是 95%,五个模块串联起来,整体成功率就会明显下降。CAST 在框架上解决了大部分问题,但当时有冗余模块,独立模块之间的错误也会累积,一度无法产品化。这一年,我们做了很多工程和底层架构改造,减少模块、提高各个环节的稳定性,最后才认为它跨过了产品化门槛。
吴迪: 从论文到产品,并不是把代码包装上线。模型持续迭代了一年多,才让 CAST 描绘的方向具备稳定、可用的产品形态。
Q:你们把 WorldGen 叫「3D 世界生成模型」,它算「世界模型」吗?
张启煊:我们对世界生成模型的定义很直接,通过一段 Prompt 或一张图像,把其中描绘的场景还原出来。
传统 3D 生成关注单个物品,里面没有太多物理关系。场景里则存在复杂的物理关系。比如桌上放着一瓶水,为什么是水放在桌上,而不是桌子放在水上?模型要把这种底层逻辑还原出来,这也是 CAST 关心的问题。
我们内部最初争论最多的,是应该叫「场景生成」还是「世界生成」。最后选择 WorldGen,是因为它也能生成开放式场景,更接近一个世界。从广义上说,它可以成为真正的「世界模型」的重要组成部分。世界模型需要某种载体承载世界的外观和属性,我们选择的载体是 3D。
吴迪:我们没有把自己定义成「世界模型公司」。「世界模型」现在很难准确定义,我们是学术出身,对这个词有天然的敬畏,认为还需要更高阶的能力,才能被称为「世界模型」。
一类团队做的是 Action Model,也就是机器人大脑。另一类做环境和场景生成,下面又有 3D 路线和视频路线。大家都在从不同方向接近自己心目中的世界模型。最终由哪条路径实现,或者会不会由几条路线 Hybrid(混合),现在没有明确结论。
Q:具身智能会成为 WorldGen 最主要的应用方向吗?
张启煊:具身是重要应用方向,但不是唯一方向。现在 3D 资产的主要商业应用仍然在游戏、影视、3D 打印等领域。具身团队对可交互资产和仿真数据的需求确实在增长,我们现阶段更多提供基础资产与生成能力。
WorldGen 严格来说不是为具身行业专门开发的,它是一个通用产品。场景生成是游戏、XR、室内设计、视频生成和机器人仿真的共同诉求。我们不会因为发布 WorldGen,就把自己定义为具身智能公司,我们仍然是一家 3D 生成公司。
Q:WorldGen 接下来会优先押注哪个行业,游戏、影视、具身还是 XR?接下来的产品路线图是什么?
张启煊:我们的判断是,这些行业存在很大的共性,WorldGen 正是不同客户需求的交集。
场景生成一直是多个行业的客户都明确提出的共同需求,同时,我们对 3D 技术路径的判断也一直包含向内和向外两个方向。WorldGen 是沿着向外路线,目前能够触达的一个里程碑。
我们有多条产品线在并行推进。接下来会先补充动态能力,包括动画生成、自动绑定等工具链。现在 WorldGen 生成的场景已经具备碰撞关系,但还不能真正运动,下一步就是让这些资产和场景动起来。
再往后,我们需要一个 Agent System 或统一的调度层,把已经完成的生成、编辑、分件、场景和动画能力串联起来,降低专业工具的使用门槛。
长期来看,我们希望用户可以用一张图直接生成一个动态、遵循物理规律并且能够交互的场景。这件事可能不会特别远,基本都在我们的能力辐射范围内。
文章来自于微信公众号 “Founder Park”,作者 “Founder Park”
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0