A Controllable Generative World Model for Robot Manipulation — Stanford · Tsinghua (ICLR 2026)
Ctrl-World: A Controllable Generative World Model for Robot Manipulation
Generalist robot policies can now perform a wide range of manipulation skills, but evaluating and improving their ability with unfamiliar objects and instructions remains a significant challenge. Rigorous evaluation requires a large number of real-world ro
arxiv.org
Ctrl-World
Overview --> Ctrl-World is designed for policy-in-the-loop rollouts with generalist robot policies. It generates joint multi-view predictions (including wrist views), enforces fine-grained action control via frame-level conditioning, and sustains coherent
ctrl-world.github.io
0. Abstract

Generalist 로봇 정책(Generalist robot policies)은 이제 광범위한 조작 기술을 수행할 수 있지만, 낯선 객체와 지시문에 대한 그것들의 능력을 평가하고 개선하는 것은 여전히 중대한 과제로 남아 있다.
엄밀한 평가(Rigorous evaluation)는 대량의 실세계 rollout을 요구하는 반면, 체계적 개선(systematic improvement)은 전문가 라벨이 붙은 추가적인 교정 데이터(corrective data)를 요구한다.
이 두 과정 모두 느리고, 비싸며, 확장하기 어렵다.
월드 모델은 정책이 상상 공간(imagination space) 안에서 rollout할 수 있게 함으로써 유망하고 확장 가능한 대안을 제공한다.
그러나 핵심 과제는 generalist 로봇 정책과의 다단계 상호작용(multi-step interactions)을 다룰 수 있는 제어 가능한(controllable) 월드 모델을 구축하는 것이다.
이는 멀티뷰 예측(multi-view prediction), 세밀한 액션 제어(fine-grained action control), 그리고 일관된 장기 지평 상호작용(consistent long-horizon interactions)을 지원함으로써 현대의 generalist 정책과 호환되는 월드 모델을 요구하는데, 이는 이전 연구들에서는 달성되지 않았다.
이 논문에서 generalist 로봇 정책의 지시 이행 능력(instruction-following ability)을 평가하고 개선하는 데 사용될 수 있는
제어 가능한 멀티뷰 월드 모델을 도입함으로써 한 걸음 나아간다.
본 논문의 모델은 pose 조건 메모리 검색 메커니즘(pose-conditioned memory retrieval mechanism)으로 장기 지평 일관성을
유지하고, 프레임 수준 액션 조건화(frame-level action conditioning)를 통해 정밀한 액션 제어를 달성한다.
DROID 데이터셋(95k 궤적, 564 장면)으로 학습된 본 연구의 모델은 새로운 시나리오와 새로운 카메라 배치 하에서 20초 이상 동안 공간적·시간적으로 일관된 궤적을 생성한다.
이 방법이 실세계 로봇 rollout 없이 정책 성능을 정확하게 순위 매길 수 있음을 보인다.
나아가, 상상 속에서 성공 궤적을 합성하고 이를 supervised fine-tuning에 사용함으로써, 본 접근법은 정책 성공률을 44.7% 개선할 수 있다.
1. Introduction

비전-언어-액션(VLA) 모델의 최근 발전은 광범위한 조작 태스크와 시나리오에 걸쳐 역량을 입증했다.
그 유망함에도 불구하고, 현재의 정책들은 open-world 환경에서 시험될 때 여전히 취약(brittle)하다.
하나의 중심적 과제는 정책 평가(policy evaluation)이다.
Generalist 정책의 성능을 평가하는 것은 일반적으로 통계적 유의성을 달성하기 위해 태스크와 환경에 걸쳐 신중하게 반복되는 대량의
실세계 rollout을 요구한다.
이러한 프로토콜은 물류적으로 부담스럽고, 반복(iteration)을 늦추며, 현재 정책 능력에 대한 섬세한 이해를 저해한다.
마찬가지로 중요한 것이 정책 개선(policy improvement)이다:
약점이 드러나더라도, 기존 방법들은 더 많은 전문가 데이터를 수집하는 것 외에는 실패 사례에 대해 정책을 강화할 방법을 거의
제공하지 못한다.
대규모 사전학습이 어느 정도 강건성을 제공하지만, 정책들은 낯선 객체나 지시문을 마주칠 때 흔히 여전히 취약하다.
부족한 것은 generalist 모델을 정제하기 위한 빠르고 저렴한 피드백 주도(feedback-driven) 메커니즘이다:
실패 사례를 표면화하고, 교정 경험(corrective experiences)을 수집하며, 정책을 반복적으로 개선하는 방법이다.
예측 모델을 학습하고 상상 속에서 반복하는 것은 확장 가능하고 유망한 대안이다.
선행 연구가 액션 조건 월드 모델을 탐구했지만, 대부분의 접근은 수동적(passive) 비디오 예측 설정에 집중하며 진보된 generalist 정책과 능동적으로 상호작용하기에는 충분하지 않다.
policy-in-the-loop rollout을 지원하는 능력을 저해하는 몇 가지 중요한 한계를 관찰한다.
이러한 모델들은 일반적으로 단일 3인칭 카메라 시점만 시뮬레이션하는데, 이는 심각한 부분 관측성(partial observability)으로 이어지고, 그 결과 환각(hallucination)을 유발할 수 있다(예: 사전 물리적 접촉 없이 객체가 그리퍼로 순간이동하는 것).
이 단일 시점 입력은 또한 3인칭과 손목 시점(wrist-view) 카메라를 모두 입력으로 요구하는 많은 현대 VLA 정책과 비호환이다.
게다가, 기존 모델들은 일반적으로 고주파 액션의 인과적 효과(causal effects of high-frequency actions)를 포착하는 데 필요한 세밀한 제어가 부족하다.
마지막으로, 그것들은 장기 지평 비디오 생성에 걸쳐 시간적 일관성을 유지하는 데 어려움을 겪는다.

본 논문에서는 Figure 1에 예시된 것처럼, policy-in-the-loop 상호작용을 위해 설계되어 다단계 rollout을 전적으로 상상 공간 안에서 가능하게 하는, 제어 가능한(Controllable) 멀티뷰 생성형 월드 모델인 Ctrl-World를 도입한다.
설계는 세 가지 핵심 구성 요소에 의존한다:
(1) 공동 멀티뷰 예측(Joint multi-view prediction) : 장면의 더 포괄적인 시각 표현을 포착하고 현대 VLA 정책의 입력 형식을 충족한다.
특히, 손목 카메라 예측의 포함은 접촉이 많은(contact-rich) 객체 상호작용 동안의 환각을 유의미하게 감소시킨다.
(2) 프레임 수준 액션 조건화(Frame-level action conditioning) : 시각 동역학을 제어 신호와 긴밀히 정렬하여, 생성된 rollout이 각 액션의 인과적 효과를 반영하도록 보장한다.
(3) 메모리 검색(Memory retrieval) : 희소한 히스토리 프레임을 문맥에 추가하고 대응하는 pose 정보를 각 프레임에 투영하여,
모델이 유사한 과거 상태에 주의를 기울이고 관련 정보를 검색할 수 있게 한다.
이 메커니즘은 장기 지평 rollout을 안정화하고 시간적 일관성을 보존한다.
이러한 메커니즘들을 결합하면, 사전학습된 수동적 비디오 생성기(passive video generator)를 정책이 직접 제어·활용할 수 있는 상호작용형 시뮬레이터(policy-compatible interactive simulator)로 변환할 수 있게 된다.
이 연구의 핵심 기여는 로봇 조작을 위한 제어 가능한 월드 모델이다.
실험을 통해 이 모델이 정책이 평가될 수 있고 — 실세계 rollout과의 순위 정렬(ranking alignment)로 — 개선될 수 있는 — 성공률을 높이는 표적 합성 데이터(targeted synthetic data)를 통해 — 새로운 상상 기반 워크플로를 가능하게 함을 발견한다.
구체적으로, 본 연구에서는 Ctrl-World를 DROID 데이터셋(Khazatsky et al., 2024)으로 학습하고 그것이 새로운 장면과 카메라 배치로 일반화하여 20초 이상 동안 일관된 rollout을 지속함을 보인다.
나아가 Ctrl-World를 이용한 상상 기반 평가가 정책의 실세계 지시 이행 능력을 충실히 반영함을 보인다.
마지막으로, 월드 모델 안에서 성공 궤적을 합성하고 이러한 합성 rollout으로 지도 fine-tuning을 수행함으로써 미지의 객체와
새로운 지시문이 있는 downstream 태스크에서 π₀.₅-DROID(Intelligence et al., 2025)의 성능을 개선할 수 있음을 시연한다.
2. Related Works

Video Generation Models for Robotics.
비디오 생성 모델의 최근 발전(Agarwal et al., 2025; Wan et al., 2025; Blattmann et al., 2023a; Chi et al., 2025)은 사실적이고 시간적으로 일관된 콘텐츠의 생성을 가능하게 했으며, 이는 물리 세계에 대한 강한 이해를 반영한다.
일부 연구는 비디오 예측 모델을 활용해 가짜 액션 라벨(fake action labels)이 붙은 로봇 궤적을 합성하며, 이러한 합성 궤적은 그런 다음 정책 학습에 사용될 수 있다(Jang et al., 2025; Bharadhwaj et al., 2024).
다른 연구들은 비디오 모델을 정책 backbone으로 직접 사용하여, 트래킹(tracking)이나 역동역학(inverse dynamics)을 통해 액션을 디코딩한다(Black et al., 2023; Du et al., 2024; Yang et al., 2023; Hu et al., 2024; Liang et al., 2024; Liao et al., 2025; Tan et al., 2025; Feng et al., 2025).
이를 보완하는 연구 흐름은 co-training을 통해 미래 예측 목적함수(future-prediction objectives)를 generalist 정책에 통합하여, 물리 지식을 정책에 포함시킨다(Zhao et al., 2025; Li et al., 2025a; Zhu et al., 2025; Guo et al., 2024; Gao et al., 2024; Zhang et al., 2025; Zheng et al., 2025; Zhong et al., 2025).
이러한 연구들과 달리, 본 연구는 비디오 생성을 활용해 액션 조건 예측(action-conditioned prediction)을 수행하며, 이는 모델을 정책 평가와 정책 개선 양쪽 모두에 사용할 수 있게 한다.
Action-Conditioned World Models.
사전학습된 비디오 모델은 강력하지만, 흔히 고수준 언어 지시(high-level language instructions)에만 조건화된다.
그럼에도 불구하고, 일부 선행 연구들은 저차원 상태 공간(low-dimensional state spaces)(Nagabandi et al., 2020)에서와 이미지 관측(image observations)으로(Hafner et al., 2019, 2020; Hansen et al., 2022; Wu et al., 2023; Oh et al., 2015; Huang et al., 2025) 액션 조건 예측 모델(action-conditioned predictive models)의 사용을 탐구했다.
이러한 접근들 중 다수는 태스크 특화(task-specific) 모델을 학습하는(Hafner et al., 2019) 반면, 본 연구는 generalist·다중 태스크(multi-task) 월드 모델을 학습하는 데 집중한다.
초기 연구들(Finn & Levine, 2017; Ebert et al., 2018; Xie et al., 2019; Dasari et al., 2019; Yang et al., 2023; Wu et al., 2024)뿐 아니라 diffusion을 활용하는 더 최근의 접근들(Quevedo et al., 2025; Chen et al., 2024; Ball et al., 2025; Gao et al., 2025; Ren et al., 2025; Hafner et al., 2025)과 프레임 수준 액션 조건화(frame-level action conditioning)(Zhu et al., 2024) 위에 구축하여, 본 연구는 멀티뷰 예측(multi-view prediction), 장기 지평 시간 일관성(long-horizon temporal coherence), 그리고 세밀한 제어 가능성(fine-grained controllability)을 통합하는 모델을 제안한다.
본 연구의 실험은 이러한 능력들이 최신 generalist VLA 정책의 효과적인 평가와 개선을 가능하게 함을 보인다.
3. Problem Formulation
목표 — generalist 정책이 제안한 액션의 미래 결과를 예측하는 월드 모델 W 개발

본 연구는 generalist 로봇 정책이 제안한 액션의 미래 결과(future outcomes)를 예측할 수 있는 월드 모델을 개발하는 것을 목표로 한다.
현대의 generalist 정책 π는 일반적으로 멀티뷰 관측(multi-view observations)과 언어 지시(language instructions)를
액션 시퀀스로 매핑한다(Zhao et al., 2023; Black et al., 2025).
구체적으로, 로봇 관측 o_t = [I¹_t, …, Iⁿ_t, q_t]는 n개의 카메라 시점 [I¹_t, …, Iⁿ_t]과 로봇 pose q_t를 포함하며, 정책은 지시 l이 주어졌을 때 H-스텝 액션 청크(action chunk)를 출력한다:

목표는 월드 모델 W를 사용해 A_t = [a_{t+1}, …, a_{t+H}]의 각 스텝을 실행한 결과를 예측하는 것이다.
상상 공간에서 정책과의 다단계 상호작용(multi-step interaction)을 가능하게 하려면, W는 미래의 멀티뷰 관측을 생성해야 한다:

그런 다음 최종 예측 o_{t+H}는 정책 π로 다시 보내져 다음 액션 청크 A_{t+H} ∼ π(· | o_{t+H}, l)를 생성할 수 있다. 이런 방식으로, 정책과 월드 모델은 자기회귀적으로(auto-regressively) 상호작용하며, 장기 지평 rollout을 전적으로 상상 공간 안에서 가능하게 한다.
4. Controllable World Model for Robot Manipulation

4.1 Learning World Model Ctrl-World
본 연구의 목표는 현대 VLA 정책을 평가하고 개선하는 데 사용될 수 있는 월드 모델을 학습하는 것이다.
이를 달성하려면, 모델은 먼저 그러한 정책들이 흔히 사용하는 멀티뷰 관측을 지원해야 한다.
또한 모델이 제어 가능(controllable)한 것 — 그러한 제어 능력이 없는 사전학습 backbone에서 초기화되었더라도 액션 입력을 신뢰성 있게 그리고 긴밀하게 따르는 것 — 이 중요하다.
마지막으로, 모델은 일관된 rollout을 생성하기 위해, 가림(occlusion)이 존재하는 상황에서도 장기 지평에 걸쳐
시간적 일관성을 유지해야 한다.
본 연구에서는 월드 모델을 spatial-temporal transformer를 가진 사전학습 비디오 확산 backbone(Blattmann et al., 2023b)에서 초기화하고, Figure 2에 예시된 세 가지 핵심 적응(key adaptations)을 도입한다.

Multi-View Joint Predictions.
최신 VLA 모델은 흔히 전역 문맥(global context)을 위한 다수의 3인칭 카메라와 정밀한 상호작용을 위한 손목 장착 카메라에 의존한다(Intelligence et al., 2025; Liu et al., 2024, 2025).
이에 맞추기 위해, 월드 모델은 각 스텝에서 모든 시점에 걸쳐 공간적으로 일관된 예측을 생성해야 한다(Jiang et al., 2025).
선행 연구는 feed-forward transformer가 멀티뷰 카메라 간의 공간 관계를 확장 가능한 방식으로 효과적으로 포착할 수 있음을 보였다(Wang et al., 2025).
선행 연구를 따라, 본 연구는 각각 H×W개의 토큰을 담은 N개의 입력 이미지를 토큰 차원을 따라 연결(concatenate)하고
모든 시점 o_{t:t+H}를 공동으로 예측한다.
실험을 통해 멀티뷰 공동 예측이 일관성도 개선하고 환각을 상당히 감소시킴을 발견한다.
Pose-conditioned Memory Retrieval Mechanism.
월드 모델의 예측 오차는 긴 rollout에 걸쳐 누적되는 경향이 있어, 드리프트(drift)와 비일관성으로 이어진다.
이를 완화하기 위해, 모델 입력을 과거 프레임(past frames)으로 증강한다.
문맥이 너무 길어지는 것을 방지하기 위해, stride m으로 k개의 히스토리 프레임을 샘플링하여, 모델이 o_{t+1:t+H} ∼ W(· | o_{t−km}, …, o_t, l)를 예측할 수 있게 한다.
추가로, 대응하는 로봇 팔 pose [q_{t−km}, …, q_t]를 spatial transformer 내부의 프레임 단위 cross-attention을 통해 프레임 [o_{t−km}, …, o_t]에 임베딩한다.
이는 모델이 팔 pose를 사용해 과거로부터 관련 프레임을 식별하게 하여, 미래 예측을 관련 히스토리에 효과적으로 정박(anchoring)시킨다.
Frame-level Action Conditioning.
사전학습 비디오 모델은 텍스트와 이미지에만 조건화되어, 그 제어 정밀도가 제한된다.
완전한 제어 가능성을 가능하게 하기 위해, 추가로 모델을 정책이 출력한 액션 시퀀스 [a_{t+1:t+H}]에 조건화한다.
또한 각 액션 시퀀스를 Cartesian 공간 로봇 팔 pose [a′{t+1:t+H}]로 변환하고 과거 pose [q{t−km}, …, q_{t−m}, q_t]와 연결한다.
그런 다음 프레임 단위 cross-attention(Zhu et al., 2024; He et al., 2025)이 spatial transformer 내부에 적용되어, 각 프레임의 시각 토큰이 그것에 연관된 pose 임베딩에 주의를 기울이게 한다.
히스토리 프레임의 경우, 이 pose는 [q_{t−km}, …, q_{t−m}, q_t]에 대응하고, 미래 프레임의 경우 [a′_{t+1:t+H}]에 대응한다.
Training Objective.
본 연구는 연구 모델을 사전학습된 1.5B Stable-Video-Diffusion(SVD) 모델(Blattmann et al., 2023a)로 초기화한다.
사전학습 비디오 모델의 지식과 구조를 계승하기 위해, 입력 액션을 위한 action-projection MLP만 새로 초기화하고 초기화 시점에 다른 파라미터는 변경하지 않고 유지한다.
그런 다음 이 액션 조건 월드 모델은 diffusion loss(Ho et al., 2020; Karras et al., 2022)로 fine-tuning된다.
학습 동안, 예측 목표 x₀ = o_{t+1:t+H}는 스케줄러 ᾱ_{t′}를 사용해 diffusion 스텝 t′ ∈ [0, T′]에서 가우시안 노이즈 ε ∼ 𝒩(0, I)로
교란되어, x_{t′} = √ᾱ_{t′} x₀ + √(1−ᾱ_{t′}) ε_{t′}가 된다.
모델 입력은 히스토리 토큰과 noised future의 연결이다: [o_{t−km}, …, o_{t−m}, o_t, x_{t′}].
전체 학습 목적함수는 다음과 같다:

여기서 x̂₀는 모델의 예측을 나타내고, c = [q_{t−km}, …, q_t, a′{t+1:t+H}, o{t−km}, …, o_t]는 모든 모델 입력에 대응한다.
모델의 더 자세한 내용은 Appendix A에서 찾을 수 있다.
4.2 Using Ctrl-World for Policy Evaluation and Improvement
Policy Evaluation within World Model.
제어 가능하고 일관된 월드 모델이 학습되면, 상상 공간에서 policy-in-the-loop rollout을 수행할 수 있다.
초기 관측 o₀와 지시 l이 주어지면, 정책 π는 월드 모델 W와 함께 합성 궤적 τ를 생성할 수 있다.
초기 관측은 검증 데이터셋에서 샘플링되거나 실세계 셋업의 스냅샷으로 기록될 수 있다.
본 연구의 실험에서, 각 궤적을 인간 선호 판단(human preference judgments)에 기반해 성공 또는 실패로 라벨링한다.
최근 연구들(Du et al., 2023)이 Vision-Language 모델을 범용 보상 모델로 사용하는 것을 탐구하지만, 그러한 확장을 향후 연구로 남겨둔다.
Policy Improvement with Synthetic Data.

평가를 넘어, 월드 모델은 정책 성능을 개선하기 위해 성공적인 합성 궤적을 탐색하는 것을 가능하게 한다.
본 연구는 고정된 초기 관측과 지시 하에서 정책 행동이 매우 결정적(deterministic)인 경향이 있음을 관찰한다.
예를 들어, 정책은 여러 시도에 걸쳐 다양한 객체로 확률적으로 손을 뻗기보다 같은 객체를 잡으려는 경향이 있다.
더 큰 탐색 공간을 탐색하기 위해, 본 연구는 rollout의 다양성을 장려하는 구조적 섭동(structured perturbations)을 도입한다.
구체적으로, (i) 지시문을 재표현(rephrase)할 수 있는데, VLA 정책이 조종 가능(steerable)한 경향이 있어 서로 다른 지시에 대해 서로 다른 행동을 보이기 때문이다;
또는 (ii) 월드 모델 안에서 정책을 무작위 초기 상태로 리셋할 수 있는데, 이는 다양한 초기 관측으로 이어진다.
언어 지시 [l⁰, …, l^M]가 있는 downstream 태스크 집합에서 시작하여, 합성 rollout을 수집하고 인간 선호에 기반해 그것들을
점수화한다.
정책 성능을 개선하기 위해, 성공 궤적에 대해 정책을 fine-tuning한다. 전체 절차는 Algorithm 1에 요약되어 있다.
5. Experiments
Ctrl-World를 평가하기 위한 실험을 수행한다.
다음 질문들에 답하는 것을 목표로 한다:
(1) Ctrl-World는 높은 제어 가능성을 유지하면서 공간적·시간적으로 모두 일관된 장기 지평 rollout을 생성할 수 있는가?
(2) Ctrl-World는 상상 공간에서 서로 다른 generalist 로봇 정책을 신뢰성 있게 평가하여, 그것들의 실세계 성능 순위를 충실히
재현할 수 있는가?
(3) Ctrl-World는 전적으로 그 상상 안에서 성공 궤적을 발견하고 합성함으로써 정책의 지시 이행을 개선할 수 있는가?

5.1 Experiment Setups
DROID Platform and Dataset.
실험은 DROID 플랫폼(Khazatsky et al., 2024)을 사용하는데, 이는 Robotiq Gripper가 장착된 Panda 로봇 팔을 특징으로 한다.
이 플랫폼은 하나의 손목 시점 카메라와 작업 공간을 관찰하는 무작위로 배치된 두 개의 3인칭 시점 카메라를 포함한다.
DROID 데이터셋(Khazatsky et al., 2024)은 564개 장면에서 수집된 95,599개의 다양한 궤적을 담고 있으며, 작업 공간의 조밀한
커버리지를 제공한다.
이는 약 76k개의 성공 궤적과 약 19k개의 실패 궤적을 포함한다.
다양한 액션과 실패 데이터의 포함은 결정적인데, 이것이 광범위한 미래 시나리오를 시뮬레이션할 수 있는 제어 가능한 월드 모델을 학습할 수 있게 하기 때문이다.
Training Details.
학습 동안, 본 연구 모델은 각각 192×320 해상도의 세 카메라 모두로부터의 출력을 공동으로 예측한다.
모델은 프레임 사이 1–2초 간격의 7개 프레임 히스토리에 조건화된다.
모델을 다음 15개 미래 액션에 조건화하는데, 이는 DROID에서 1초 액션 청크에 대응한다.
상호작용 동안, 정책의 출력이 15스텝보다 적으면, 액션 청크를 더미 액션(dummy actions)으로 패딩하고 유효한 액션에 대한
예측만 사용한다.
모델을 2×8 H100 GPU에서 총 배치 크기 64로 학습한다. 학습은 약 2–3일 걸린다.
5.2 World Model Quality Analysis (월드 모델 품질 분석)
Baseline and Evaluation Matrices.
본 연구는 Ctrl-World를 두 개의 선행 액션 조건 월드 모델 — World-model-based Policy Evaluation(WPE)(Quevedo et al., 2025)와 IRASim(Zhu et al., 2024) — 과 정량적으로 비교한다.
이 모델들은 단일 3인칭 카메라 시점만 예측하므로, 공정한 비교를 위해 단일 3인칭 카메라만 입력·예측하는
단일 시점 버전 Ctrl-World-third-view를 학습한다.
평가를 위해, 궤적의 2%를 검증 세트로 보류하고 각각 10초 길이의 256개 비디오 클립을 무작위로 샘플링한다.
rollout 동안, 월드 모델은 15스텝 액션 청크(1초에 대응)를 받아 다음 프레임을 10스텝 동안 자기회귀적으로 예측하여, 10초 길이
궤적을 생성한다.
그런 다음 예측 비디오를 계산 기반(PSNR(Hore & Ziou, 2010), SSIM(Wang et al., 2004))과 모델 기반(LPIPS(Zhang et al., 2018), FID(Heusel et al., 2017), FVD(Unterthiner et al., 2018)) 지표를 모두 사용해 ground truth와 비교한다.
Quantitative and Qualitative Results on Multi-step Interaction Trajectories.

Table 1에서 보이듯이, Ctrl-World-third-view는 이러한 선행 모델들을 능가하며, 멀티뷰 공동 예측은 생성 품질을 더욱 개선한다.
선행 연구(Quevedo et al., 2025; Zhu et al., 2024)의 관찰과 일관되게, 본 연구는 또한 이러한 baseline들이 로봇-객체 상호작용을 포착하는 데 어려움을 겪고 흔히 환각적 예측을 생성함을 발견한다.

예를 들어, Figure 3에서 보이듯이, 단일 시점 예측 방법 WPE, IRASim, Ctrl-World-third-view는 모두 초록 수건을 옮기거나 빨간 그릇을 잡는 데 실패한다.
이와 대조적으로, Ctrl-World는 접촉 이벤트와 객체 상태 변화에 대한 결정적이고 세밀한 정보를 제공하는 손목 카메라 시점의 공동 예측을 통해 로봇-객체 상호작용을 정밀하게 모델링한다.
Controllability of the World Model.
월드 모델의 핵심 요건은 서로 다른 액션에 조건화된 다양한 미래 결과를 시뮬레이션하는 능력이다.

본 연구 모델이 단 몇 센티미터만 다른 액션에 대해서도 정밀한 미래 예측을 생성하는 세밀한 제어 가능성을 보임을 발견한다(Figure 4 참조).
이 제어 가능성이 두 가지 주요 요인에서 발생한다고 가설을 세운다:
첫째, DROID 데이터셋의 조밀한 액션 공간 커버리지;
둘째, 본 논문의 멀티뷰 예측과 프레임 수준 액션 조건화 사용인데, 이는 ablation 연구로도 뒷받침된다.
Figure 4의 왼쪽에서, 본 연구는 t=4s 프레임을 예측할 때의 attention 가중치를 시각화하고 유사한 pose를 가진 t=0s 프레임에 강한 attention이 있음을 관찰하며, 이는 본 논문에서 제시하는 메모리 검색 메커니즘의 효과를 부각한다.
Consistency of the World Model.
손목 카메라의 경우, 카메라의 시야(field of view)가 단일 궤적 안에서 극적으로 변하기 때문에, 모델이 일관되고 장기적인 예측을
생성하는 것이 어렵다.

Figure 5에서 보이듯이, 모델이 다른 카메라 시점과 히스토리 프레임 양쪽으로부터의 관련 정보를 효과적으로 활용하여, 일관된 손목 시점 예측을 생성할 수 있음을 발견한다.
메모리 구성 요소와 프레임 수준 조건에 대한 ablation은 Table 2에 있으며, 이는 각 구성 요소의 중요성을 확인한다.


5.3 World Model for Policy Evaluation
Ctrl-World가 generalist 로봇 정책의 지시 이행 능력을 평가하고 실세계에서의 그것들의 성능 순위를 정확하게 반영하는 데 사용될 수
있는지 평가한다(Li et al., 2024).
본 연구는 DROID 플랫폼을 설정하고 작업 공간 주위에 두 개의 3인칭 카메라를 무작위로 배치한다.
선행 연구들이 DROID 정책이 새로운 셋업으로 일반화하는 것을 본 것(Pertsch et al., 2025)과 유사하게, 본 연구는 오픈소스 DROID 데이터셋으로만 사전학습된 Ctrl-World가 새로운 카메라 배치를 가진 새로 구성된 장면에서 zero-shot으로 정확한 미래 예측을 할 수 있음을 발견한다.
Policies and Tasks.
세 개의 공개된 정책 π₀(Black et al., 2023), π₀-FAST(Pertsch et al., 2025), π₀.₅(Intelligence et al., 2025)를
본 연구의 DROID 플랫폼에서 Pick-and-Place, Towel-Folding, Drawer, Wipe-Table, Close-Laptop, Pull-tissue, Stack 태스크를 포함한 다양한 태스크에 걸쳐 평가한다.
실세계와 월드 모델 rollout을 동일한 초기 관측으로 초기화하고 Algorithm 1을 따라 각 정책을 실행한다.


Figure 7에 지시 이행률(instruction following rates)과 성공률을 보고하고 Figure 6에 실제와 상상된 rollout 간의 정성적 비교를 시각화한다. 더 자세한 rollout 내용은 Appendix B에서 찾을 수 있다.
Comparison Between Real-World and World Model Rollouts.
위 결과는 정책의 고수준 지시 이행 행동이 월드 모델에서 실세계에서 관찰된 것과 밀접하게 상관됨을 보인다.
그러나 저수준 실행 평가에서 일부 격차를 알아차리는데, 구체적으로 충돌, 객체가 미끄러져 나가는 것, 회전 등 복잡한 물리 동역학의 정밀한 모델링에서이다 (예: Figure 6에서 노트북과의 상호작용이 부정확하다).
또한 generalist 정책들이 실세계에서 실패한 시도 후 계속 재시도하는 경향이 있는데, 월드 모델이 이를 때때로 포착하지 못함을 관찰한다. 일부 실패 궤적이 DROID 데이터셋에 포함되어 있지만, 데이터 분포 밖의 실패 모드가 여전히 많다.
추가적인 in-domain 정책 rollout 데이터를 수집하는 것이 학습된 동역학의 충실도를 개선하고 이 격차를 좁힐 것으로 기대한다(Team, 2025).
5.4 World Model for Policy Improvement (정책 개선을 위한 월드 모델)
Post-train Policy with Synthetic Data.
이제 Ctrl-World가 실세계 데이터 없이 VLA 모델을 개선하기 위한 합성 post-training 데이터를 생성하는 데 사용될 수 있는지
평가한다.
π₀.₅를 기본 정책으로 사용하고 Algorithm 1을 따른다.
4.2절에서 설명한 것처럼, (1) 태스크 지시를 재표현하거나 (2) 로봇 팔을 새로운 초기 상태로 리셋함으로써 rollout 다양성을 장려한다.
재표현의 경우, 본 연구는 LLM API(Team et al., 2023)를 호출해 지시를 paraphase한다(예: "place glove in box"를 "pick up the cloth and put it inside the box"로 변환).
리셋의 경우, 정책-상호작용이 시작되기 전에 새로운 목표 초기 위치를 무작위로 샘플링하고
선형 보간 모션 플래너(linear-interpolation motion planner)를 사용해 로봇 팔을 그곳으로 이동시킨다.
태스크당 400개의 궤적을 생성하고 인간 선호 판단에 기반해 25–50개의 성공 궤적을 유지한다.
이 선택 단계는 보상 모델로 자동화될 수 있는데, 이는 활발한 연구 영역이다(Ma, 2025).
마지막으로, 큐레이션된 합성 데이터셋에 대해 정책을 2k 스텝 동안 fine-tuning하여, 낯선 지시문과 객체에 대한 기본 모델의 능력을 개선한다.

Results.
일부 대표적인 태스크 예시와 합성 궤적이 Figure 8에 시각화되어 있고, 정량 결과가 Figure 9에 보고되어 있다.

사전학습된 π₀.₅ 정책이 낯선 객체와 새로운 지시문에서 낮은 성공률을 달성하는 반면, post-training은 모델을 새로운 지시와 정렬하고 이러한 downstream 태스크에서 성공률을 38.7%에서 83.4%로 높인다. 태스크 세부 사항을 Appendix C에 포함한다.
6. Conclusion

모델의 상상 안에서 전적으로 closed-loop 정책 평가와 개선을 지원하는, 로봇 조작을 위한 제어 가능한 월드 모델인
Ctrl-World를 제시했다.
Ctrl-World에서 평가된 정책들은 실세계의 것을 밀접하게 반영하는 지시 이행 행동을 보인다.
주목할 만하게, 생성된 데이터에 대한 post-training은 사전학습된 로봇 정책의 새로운 지시문에 대한 성공률을 38.7%에서 83.4%로 높인다.
이러한 유망한 결과에도 불구하고, 중요한 과제들이 남아 있다.
본 모델은 정밀한 상호작용이나 장기 지평 추론을 포함하는 태스크에서 실패할 수 있으며, 성능은 초기 관측에 민감하다.
이러한 한계들은 비디오 backbone이 시간이 지나며 더 물리적으로 정확하고 일관되어짐에 따라 줄어들 수 있다.
또한, 본 연구의 실험은 지시 이행 개선에 집중하며, 본 모델이 이전에 본 지시문에 대한 저수준 성공률 같은 다른 측면의 성능을 개선하기에는 충분히 정확하지 않다고 기대한다.
반복적 정책 rollout과 fine-tuning으로 모델을 개선하는 것은 흥미로운 향후 방향이다.
Appendix

A. MORE DETAILS FOR WORLD MODEL LEARNING
Model Architecture.
본 연구의 월드 모델은 Stable Video Diffusion(SVD)(Blattmann et al., 2023a)의 아키텍처를 밀접하게 따르며,
SVD 사전학습 체크포인트에서 초기화한다.
유일하게 새로 초기화되는 구성 요소는 7차원 Cartesian 공간 액션을 1024차원 latent 임베딩으로 투영하는 3-layer MLP이다.
입력 이미지는 먼저 8×8의 공간 다운샘플링 비율을 가진 VAE로 인코딩된다.
실제로, 본 연구는 k=7개의 히스토리 프레임을 사용하며, 각각 강건성을 개선하기 위해 독립적인 무작위 노이즈로 교란한다.
액션 조건화 윈도우를 1초, 즉 15개 액션 스텝에 대응하도록 설정한다.
GPU 메모리 소비를 줄이기 위해, 이 15개 액션을 Cartesian 공간에서 변환하고(B절 참조) 모델에 입력하기 전에
시간적으로 5스텝으로 다운샘플링한다.
각 프레임은 세 개의 192×320 이미지를 담고 있으며, 이는 24×40 형태의 latent feature로 인코딩된다.
결과적으로 전체 입력 토큰 형태는 B × (7+5) × (3×24×40)이며, 이는 그런 다음 spatial-temporal transformer backbone에 의해 처리된다.
Training Datasets.
DROID 데이터셋의 95k개 궤적 전부를 사용한다.
각 학습 스텝마다, 궤적을 무작위로 샘플링한 다음 그 궤적 안에서 프레임을 균등하게 샘플링하여 현재 프레임으로 삼는다.
그런 다음 시간을 거슬러 뒤로 샘플링하여 메모리 프레임을 검색하고 모델의 예측 목표를 후속 미래 프레임으로 설정한다.
Training Process.
모델을 2×8 H100 GPU에서 총 배치 크기 64로 학습한다.
학습률은 1e-5로 설정되며, 100k 스텝 동안 학습하는데, 이는 완료하는 데 약 2–3일 걸린다.
B. MORE DETAILS FOR POLICY EVALUATION
Details on interaction between policy and world model.
Ctrl-World와 상호작용하기 위해 https://github.com/Physical-Intelligence/openpi 의 공식
π₀-DROID, π₀-FAST-DROID, π₀.₅-DROID 정책을 직접 사용한다.
Ctrl-World는 최신 VLA 모델 간의 policy-in-the-loop 상호작용을 가능하게 하는 최초의 월드 모델이다.
이러한 오픈소스 정책들은 관절 각도(joint angles)와 두 개의 카메라 시점을 입력으로 받아 관절 속도(joint velocities)를 출력한다.
이와 대조적으로, 본 연구의 월드 모델은 Cartesian 공간의 end-effector pose에 조건화한다.
이 불일치를 잇기 위해, DROID 데이터셋에서 현재 관절 각도 q_t^joint와 예측된 관절 속도 a_{t+1:t+H}^jv를
미래 관절 구성 q_{t+1:t+H}^joint로 매핑하는 adapter를 학습한다.
그런 다음 Franka Panda 순기구학(forward kinematics, FK)을 적용해 이 관절 구성을 Cartesian 공간 pose q_{t+1:t+H}^cartesian로 변환한다. 이 adapter는 단순한 2-layer MLP로 구현된다.
전체 과정은 다음과 같다:
현재 관절 구성 q_t^joint, 멀티뷰 관측 o_t, 언어 지시 l이 주어지면, 정책은 H-스텝 관절 속도를 출력한다:

이것들은 adapter를 통과해 미래 관절 구성을 예측하고, 이어서 FK로 Cartesian pose를 계산한다:

마지막으로, 월드 모델은 현재 관측, 계산된 Cartesian pose, 그리고 히스토리 Cartesian pose에 조건화하여 다음 H개 프레임을 예측한다:

이 셋업은 완전한 자기회귀 rollout을 가능하게 하여, 공식 π₀-DROID, π₀-FAST-DROID, π₀.₅-DROID 정책과 Ctrl-World가 상상 공간에서 매끄럽게 상호작용할 수 있게 한다.
Breakdown for policy evaluation.

Table 3에 지시 이행률과 저수준 실행 성공률을 제시한다.
Task details and Criterion.
본 연구의 실험에서, 각 궤적이 성공인지 실패인지 평가하기 위해 인간 어노테이터를 사용한다.
이 평가 과정은 향후 대규모 비전-언어 보상 모델을 사용해 자동화될 수 있지만, 이 논문에서 초점은 월드 모델 자체이므로,
보상 신호로 인간 선호에 의존한다.
본 연구는 궤적이 단지 지시를 따르는지 아니면 완전한 태스크 성공을 달성하는지 판단하기 위한 명확한 기준을 제공한다:
- Pick-place: 여러 객체와 용기(receptacle)가 탁상에 놓여 있다. 지시는 "A를 집어 B에 놓아라" 형태이다. 궤적은 정책이 올바른 객체 A를 잡으려 시도하면 지시를 따른 것으로 간주된다. 객체 A가 목표 용기 B에 성공적으로 놓이면 성공으로 간주된다.
- Fold the Towel: 수건이 테이블에 평평하게 놓여 있고, 다른 객체가 있을 수도 있다. 지시는 "수건을 접어라"이다. 궤적은 그리퍼가 수건 가장자리로 이동해 들어 올려 접으려 시도하면 지시를 따른 것으로 간주된다. 궤적은 최종적으로 수건의 표면적이 절반이 되면 성공으로 간주된다.
- Drawer: 지시는 "객체 A를 서랍에 넣어라"이다. 궤적은 로봇이 객체 A를 서랍 안에 넣으려 시도하면 지시를 따른 것이다. 객체 A가 최종적으로 서랍에 놓이면 성공이다.
- Wipe Table: 지시는 테이블 표면을 닦는 것이다. 궤적은 그리퍼가 수건과 접촉해 쓸기 동작으로 움직이면 지시를 따른 것이다. 테이블의 큰 부분이 쓸기 동작으로 덮이면 성공으로 간주된다.
- Close Laptop: 지시는 열린 노트북을 닫는 것이다. 궤적은 그리퍼가 노트북 덮개에 접근하면 지시를 따른 것이다. 덮개가 완전히 닫히면 성공으로 간주된다.
- Pull Tissue: 지시는 티슈 상자에서 티슈를 뽑는 것이다. 궤적은 그리퍼가 티슈 슬롯에 접근해 티슈를 집으면 지시를 따른 것이다. 최소 하나의 티슈가 완전히 추출되면 성공으로 간주된다.
- Stack: 지시는 한 객체를 다른 객체 위에 쌓는 것이다. 궤적은 그리퍼가 올바른 객체를 들어 올리면 지시를 따른 것이다. 객체가 목표 객체 위에 안정적으로 놓이면 성공이다.
C. MORE DETAILS FOR POLICY IMPROVEMENT
Fine-tuning Process.
공식 코드베이스 https://github.com/Physical-Intelligence/openpi 를 기반으로 π₀.₅-DROID 정책을 fine-tuning한다.
사전학습된 체크포인트를 본 연구의 합성 데이터셋에 대해 4개 H100 GPU에서 2k 스텝 동안 fine-tuning한다.
Task Descriptions :
- 공간 이해(Spatial Understanding) 태스크: 2–6개의 무작위 객체가 테이블에 놓인다. 정책은 지정된 공간 위치의 객체를 집어 상자에 놓도록 지시받는다. 예시 지시는 "오른쪽 위(top-right)의 객체를 집어 상자에 놓아라" 또는 "가장 왼쪽(far-left)의 객체를 상자에 넣어라"를 포함한다.
- 형태 이해(Shape Understanding) 태스크: 2–3개의 무작위 객체가 테이블에 놓이며, 일부는 같은 속성을 공유하지만 크기가 다르다. 정책은 크기에 기반해 객체를 구별해야 한다. 예시 지시: "더 큰 빨간 블록을 집어 상자에 놓아라."
- 방향이 있는 수건 접기(Towel-Folding with Directions): 수건과 다른 방해물(distractor)이 테이블에 놓이며, 정책은 특정 접기 방향을 지정하는 지시를 받는다(예: "수건을 왼쪽에서 오른쪽으로 접어라").
- 새로운 객체(Novel Objects): 사전학습된 정책이 잘 식별하지 못하는 장갑과 스테이플러 같은 미지의 객체를 도입한다.
Detailed success rate.
각 범주 내의 상세 태스크 성공률을 제공한다.

'Paper' 카테고리의 다른 글
| iVideoGPT_Interactive_VideoGPTs_are_Scalable_World_Models (0) | 2026.07.19 |
|---|---|
| IRASim: A Fine-Grained World Model forRobot Manipulation (0) | 2026.07.18 |
| Pre-Trained Video Generative Models as World Simulators (1) | 2026.07.18 |
| Generative World Modeling for Humanoids (0) | 2026.07.14 |
| [Paper Review] Improved Baselines Visual Instruction Tuning (0) | 2026.07.01 |





































































































































