Atlas by World Labs
World Labs 推出的 Atlas 是一款专为空间智能设计的全能世界模型,能够通过文本、图像和视频等多模态输入,生成、重建并模拟 3D 环境。
World Labs 推出的 Atlas 是一款专为空间智能设计的全能世界模型,能够通过文本、图像和视频等多模态输入,生成、重建并模拟 3D 环境。
产品用途与官方定位
Atlas 是由 World Labs 开发的多模态自回归扩散 Transformer 模型。它旨在理解世界的表现、行为和演变,使用户能够生成一致的 3D 内容并模拟真实世界环境。
该模型通过将输入锚定在 3D 空间中来整合空间上下文,从而实现精确的摄像机控制和新视角的合成。其设计旨在随训练计算量的增加而扩展,为创意、机器人和模拟工作流提供高保真输出。
有官方来源支持的使用场景
通过重建物理空间并生成传感器数据(如 RGB 和深度),实现“从现实到模拟”的工作流,用于训练和测试机器人的导航与操作。
允许创作者从多个角度重新构图视频、冻结时间,并利用精确的摄像机路径生成一致的长篇视频内容。
Atlas 与标准的 LLM 和视频模型架构不同,采用了多模态自回归扩散 Transformer。这种设计将空间控制视为核心组件,通过显式的摄像机位姿和 3D 位置来限定所有输入和输出。
用自己的素材和工作流完成验证
核对了哪些信息以及核对时间
基于已核对产品资料的回答
Atlas 是一款多模态模型,原生支持文本、图像、视频、3D 深度图和摄像机位姿,从而形成一个共享的空间上下文。
不需要,Atlas 可以仅凭一张到几十张普通的图像重建现实世界的空间,从而消除了对密集采集设备的需求。
Atlas 将精确的摄像机几何结构作为原生输入类型,允许用户指定确切的摄像机位置和角度,而不是依赖模糊的文本指令。
可以,该模型可以输出显式的 3D 表示,包括点云和 3D 高斯泼溅,这些资产非常适合机器人、游戏和设计工作流。
是的,Atlas 支持“从现实到模拟”的工作流,通过重建环境并生成机器人传感器在导航或操作过程中会观察到的 RGB 和深度数据。