Atlas by World Labs
World LabsによるAtlasは、空間知能のために設計されたオムニ・ワールドモデルであり、テキスト、画像、ビデオなどのマルチモーダルな入力から3D環境の生成、再構成、シミュレーションを行うことができます。
World LabsによるAtlasは、空間知能のために設計されたオムニ・ワールドモデルであり、テキスト、画像、ビデオなどのマルチモーダルな入力から3D環境の生成、再構成、シミュレーションを行うことができます。
製品の機能と公式な位置づけ
AtlasはWorld Labsが開発したマルチモーダル自己回帰拡散トランスフォーマーであり、世界の見た目、挙動、進化を理解するように設計されています。これにより、ユーザーは一貫した3Dコンテンツの生成や現実世界の環境のシミュレーションが可能になります。
このモデルは、入力を3D空間に接地させることで空間的コンテキストを統合し、精密なカメラ制御と新しい視点の合成を可能にします。トレーニング計算量の増加に合わせてスケールするように設計されており、クリエイティブ、ロボティクス、シミュレーションのワークフローに高忠実な出力を提供することを目指しています。
公式情報で確認できる活用例
物理空間を再構成し、RGBや深度などのセンサーデータを生成することで、ロボットのナビゲーションや操作のトレーニングおよびテストを行うReal-to-Simワークフローを可能にします。
クリエイターが複数の角度からビデオをリフレームしたり、時間を止めたり、精密なカメラパスを使用して一貫した長尺ビデオコンテンツを生成したりすることを可能にします。
Atlasは、マルチモーダル自己回帰拡散トランスフォーマーを利用することで、標準的なLLMやビデオモデルのアーキテクチャとは一線を画しています。この設計では、すべての入出力に明示的なカメラポーズと3D位置を条件付けることで、空間制御をコアコンポーネントとして扱います。
自分の素材とワークフローで確認したい項目
確認した情報源とその日時
情報源を確認した製品情報に基づく回答
Atlasは、テキスト、画像、ビデオ、3D深度マップ、およびカメラポーズをネイティブに処理し、共有された空間コンテキストを形成するマルチモーダルモデルです。
いいえ、Atlasはわずか1枚から数十枚の通常の画像から現実世界の空間を再構成できるため、高密度のキャプチャ機器を用意する必要はありません。
Atlasは精密なカメラジオメトリをネイティブな入力タイプとして使用するため、ユーザーはテキストベースの指示に頼るのではなく、正確なカメラの位置と角度を指定できます。
はい、このモデルはポイントクラウドや3Dガウススプラッティングを含む明示的な3D表現を出力でき、ロボティクス、ゲーム、デザインのワークフローに適しています。
はい、Atlasは環境を再構成し、ロボットのセンサーがナビゲーションや操作中に観察するRGBおよび深度データを生成することで、Real-to-Simワークフローをサポートします。