Odyssey 3
Odyssey 3 是一款自回归扩散 Transformer 世界模型,旨在模拟实时物理动力学并为各类自主系统提供支持,能够基于视觉历史与动作输入实现交互式环境生成。
Odyssey 3 是一款自回归扩散 Transformer 世界模型,旨在模拟实时物理动力学并为各类自主系统提供支持,能够基于视觉历史与动作输入实现交互式环境生成。
产品用途与官方定位
Odyssey 3 是一款基于自回归扩散 Transformer 构建的基础世界模型,能够模拟物体、动力学以及物理交互在时间和空间维度上的演变过程。
该模型基于视频观测、游戏操作输入以及模拟刚体物理数据进行训练,可提供交互式环境生成器,并为机器人与具身实体 AI 策略奠定视觉表征基础。
有官方来源支持的使用场景
官方将其展示为客户实际应用案例,Flexion 基于 Odyssey 3 构建的人形机器人控制策略在环境与光照发生变化时仍能保持任务执行。
开发人员通过冻结的模型骨干网络对 Odyssey 3 进行适配,以预测闭环驾驶演示中的路径导航路标点。
开发人员利用机器人演示数据训练操作控制策略,用于执行具体任务并在出现偏差时展现重新抓取等恢复行为。
Odyssey 3 作为多步视频扩散 Transformer 运行,它融合了具备时间分辨率的提示词与动作输入,以此生成未来的视觉状态表现。
通过因果掩码与教师强制机制,该系统以先前的视觉历史为条件进行自回归预测,同时借助对抗与分布匹配蒸馏流程大幅减少推理步数,从而实现低延迟的实时响应。
用自己的素材和工作流完成验证
核对了哪些信息以及核对时间
基于已核对产品资料的回答
Odyssey 3 是一款自回归扩散 Transformer 世界模型,能够持续预测物体运动、环境变化以及随时间推移的物理动力学过程。
技术文档显示,标准版 Odyssey 3 生成 832x480 分辨率的画面,而 Odyssey 3 Pro 版本的运行分辨率为 1280x720。
开发人员可以通过在成对的观测和动作数据上训练专用动作解码器或控制策略,将该基础模型适配到特定的机器人或车辆平台。
该模拟预览在环境生成期间支持第一人称导航、第三人称导航以及独立的摄像机机位自由调整与观察。
该模型基于带有标注的互联网视频、与键盘及鼠标输入对齐的游戏录像,以及带有文本描述的刚体物理模拟数据进行训练。