Atlas by World Labs
World Labs의 Atlas는 텍스트, 이미지, 비디오와 같은 멀티모달 입력을 통해 3D 환경을 생성, 재구성 및 시뮬레이션할 수 있는 공간 지능형 옴니 월드 모델입니다.
World Labs의 Atlas는 텍스트, 이미지, 비디오와 같은 멀티모달 입력을 통해 3D 환경을 생성, 재구성 및 시뮬레이션할 수 있는 공간 지능형 옴니 월드 모델입니다.
제품의 기능과 공식 포지셔닝
Atlas는 World Labs에서 개발한 멀티모달 자기회귀 확산 트랜스포머로, 세계의 외형, 행동 및 진화를 이해하여 일관된 3D 콘텐츠를 생성하고 실제 환경을 시뮬레이션하도록 설계되었습니다.
이 모델은 입력을 3D 공간에 배치하여 공간적 맥락을 통합함으로써 정밀한 카메라 제어와 새로운 뷰 합성을 가능하게 하며, 창의적인 작업, 로보틱스 및 시뮬레이션 워크플로우를 위해 고충실도 결과물을 제공합니다.
공식 출처로 확인된 활용 사례
물리적 공간을 재구성하고 RGB 및 깊이와 같은 센서 데이터를 생성하여 로봇의 내비게이션 및 조작 훈련과 테스트를 위한 Real-to-Sim 워크플로우를 지원합니다.
제작자가 여러 각도에서 비디오 구도를 다시 잡고, 시간을 멈추며, 정밀한 카메라 경로를 사용하여 일관된 장편 비디오 콘텐츠를 생성할 수 있도록 합니다.
Atlas는 모든 입력과 출력을 명시적인 카메라 포즈와 3D 위치에 조건화하여 공간 제어를 핵심 구성 요소로 처리하는 멀티모달 자기회귀 확산 트랜스포머를 활용함으로써 표준 LLM 및 비디오 모델 아키텍처와 차별화됩니다.
본인의 자료와 작업 흐름으로 직접 확인할 항목
확인한 출처와 확인 시점
출처를 확인한 제품 정보를 바탕으로 한 답변
Atlas는 텍스트, 이미지, 비디오, 3D 깊이 맵 및 카메라 포즈를 기본적으로 처리하여 공유된 공간 맥락을 형성하는 멀티모달 모델입니다.
아니요, Atlas는 단 한 장에서 수십 장의 일반 이미지만으로도 실제 공간을 재구성할 수 있어 고밀도 캡처 장비의 필요성을 제거합니다.
Atlas는 정밀한 카메라 기하학을 기본 입력 유형으로 사용하여 사용자가 텍스트 기반 지침에 의존하는 대신 정확한 카메라 위치와 각도를 지정할 수 있게 합니다.
예, 이 모델은 포인트 클라우드 및 3D 가우시안 스플랫을 포함한 명시적인 3D 표현을 출력할 수 있으며, 이는 로보틱스, 게임 및 디자인 워크플로우에 적합합니다.
예, Atlas는 환경을 재구성하고 로봇의 센서가 내비게이션이나 조작 중에 관찰하게 될 RGB 및 깊이 데이터를 생성함으로써 Real-to-Sim 워크플로우를 지원합니다.