Odyssey 3 favicon

Odyssey 3

Odyssey 3 是一款自回归扩散 Transformer 世界模型,旨在模拟实时物理动力学并为各类自主系统提供支持,能够基于视觉历史与动作输入实现交互式环境生成。

图像生成器从视觉观测中预测物体运动、交互行为与物理动力学过程通过单一模型检查点生成多传感器摄像机观测数据提供用于训练和评估面向目标的人工智能智能体的模拟环境作为机器人与车辆控制策略的视觉表征骨干网络
Odyssey 3 product interface screenshot
预计月访问量
1.9万
数据月份:
收录于 AIToolly

Odyssey 3 是什么?产品概览

产品用途与官方定位

Odyssey 3 是一款基于自回归扩散 Transformer 构建的基础世界模型,能够模拟物体、动力学以及物理交互在时间和空间维度上的演变过程。

该模型基于视频观测、游戏操作输入以及模拟刚体物理数据进行训练,可提供交互式环境生成器,并为机器人与具身实体 AI 策略奠定视觉表征基础。

Odyssey 3 可以用来做什么?

有官方来源支持的使用场景

人形机器人控制

官方将其展示为客户实际应用案例,Flexion 基于 Odyssey 3 构建的人形机器人控制策略在环境与光照发生变化时仍能保持任务执行。

自动驾驶车辆策略训练

开发人员通过冻结的模型骨干网络对 Odyssey 3 进行适配,以预测闭环驾驶演示中的路径导航路标点。

机械臂操作

开发人员利用机器人演示数据训练操作控制策略,用于执行具体任务并在出现偏差时展现重新抓取等恢复行为。

模型架构与实时蒸馏

Odyssey 3 作为多步视频扩散 Transformer 运行,它融合了具备时间分辨率的提示词与动作输入,以此生成未来的视觉状态表现。

通过因果掩码与教师强制机制,该系统以先前的视觉历史为条件进行自回归预测,同时借助对抗与分布匹配蒸馏流程大幅减少推理步数,从而实现低延迟的实时响应。

  • 基于带有标注的网络视频、记录有操作输入的游戏画面以及模拟刚体交互数据进行训练
  • Odyssey-3 的视频输出分辨率为 832x480,而 Odyssey-3 Pro 则支持 1280x720 分辨率
  • 支持通过第一人称、第三人称以及解耦摄像机视角进行交互探索

选择 Odyssey 3 前需要测试什么

用自己的素材和工作流完成验证

  • 确认 832x480 或 1280x720 的输出分辨率是否能够满足下游评估流程对视觉保真度的具体要求。
  • 核实针对目标机器训练硬件专用解码器时所需的成对观测与动作数据规模。
  • 根据流体动力学、光学、固体力学或热力学等特定专业领域的技术规范核验模型预测效果。

Odyssey 3 来源与核对时间

核对了哪些信息以及核对时间

最后核对

Odyssey 3 常见问题

基于已核对产品资料的回答

什么是 Odyssey 3?

Odyssey 3 是一款自回归扩散 Transformer 世界模型,能够持续预测物体运动、环境变化以及随时间推移的物理动力学过程。

文档中记录了 Odyssey 3 的哪些分辨率?

技术文档显示,标准版 Odyssey 3 生成 832x480 分辨率的画面,而 Odyssey 3 Pro 版本的运行分辨率为 1280x720。

Odyssey 3 如何适配到实际物理机器?

开发人员可以通过在成对的观测和动作数据上训练专用动作解码器或控制策略,将该基础模型适配到特定的机器人或车辆平台。

模拟预览支持哪些摄像机视角?

该模拟预览在环境生成期间支持第一人称导航、第三人称导航以及独立的摄像机机位自由调整与观察。

构建 Odyssey 3 使用了哪些训练数据?

该模型基于带有标注的互联网视频、与键盘及鼠标输入对齐的游戏录像,以及带有文本描述的刚体物理模拟数据进行训练。

继续查看同一分类中近期收录的其他工具。