过去一年,用AI生成一段可以环视的3D场景,已经不算新鲜事。但生成出来的场景,能像游戏关卡一样编辑、能直接放进影视流程、还能用来训练机器人——这完全是另一个层面的问题。
9月1日,影眸Hyper3D正式发布世界生成模型Hyper3D WorldGen,瞄准的就是这个目标:让3D生成从“造单个东西”走向“组织一个世界”。
用户只需要上传一张场景照片,WorldGen就能自动识别里面的主要物体并生成3D资产。想指定某个物体也没问题,手动框选一下就行。背后的自研CAST架构会重构物体之间的物理关系——位置、尺度、朝向、谁支撑谁——最终输出一个由多个独立3D资产构成的完整场景。

场景里的每个物体,都可以单独移动、替换、编辑。 这点跟市面上那些只能看不能动的3D照片完全不同。
技术上有个挺有意思的设计。WorldGen用了网格+3D高斯泼溅的混合表达:主要物体以独立网格资产形式生成,方便编辑和交互;墙面、远景、背景这些不需要参与交互的部分,用3D高斯泼溅保留更完整的视觉信息。这样一来,既保证了场景可用性,画面也不拉胯。
生成速度也做了分层处理。依托Rodin Gen-2.5的“思考深度”架构,场景中的每个资产都可以按需分配生成精度:关键物体可以继续修改细化,获得更精细的几何与表面细节;远处或非关键的普通物体可以快速生成,最快4秒即可生成可用的3D资产。
WorldGen到底能干什么? 三个方向已经在落地了。
第一个是具身智能仿真训练。今年7月,影眸联合地瓜机器人、谋先飞发布了“具身智能可训练仿真闭环”方案。用一张真实照片生成可交互的3D场景,调整布局和物体状态,就能构造同一任务下的多种环境变体。光照、障碍物、物体状态都能快速调整,训练好的策略可以直接迁移到实体机器人上。影眸参与的相关研究工作cuNRTO也获得了2026年具身智能国际顶会RSS最佳论文提名。
第二个是影视制作。WorldGen跟Seedance 2.5等视频生成模型已经形成了组合工作流——先用WorldGen搭一个可控的3D白模场景,确定镜头、构图、物体位置,再交给视频模型补充材质、光影和人物细节。创作者就像用3D导演台一样调度空间,解决了视频生成中多镜头一致性的老大难问题。目前这个工作流已经进入实际影视项目。

影眸科技创始人兼CEO吴迪在Unity中国(团结引擎)发布会上展示 WorldGen效果
第三个是游戏和空间计算。生成的独立资产可以直接导入Blender、Unity、Unreal Engine等软件继续编辑。今年7月,影眸已经跟Unity中国(团结引擎)宣布合作,打通3D生成到实时游戏的工程闭环。影眸科技创始人兼CEO吴迪在Unity中国(团结引擎)发布会上展示 WorldGen效果XR与空间计算从一张图片进入一个三维空间WorldGen生成的包含独立资产、明确物理关系与完整空间布局的3D场景,可进一步与Apple Vision Pro等XR设备结合,为用户提供更具临场感、可交互的沉浸式体验。
文/广州日报新花城记者:陈庆辉
广州日报新花城编辑:李光曼


















































