Interactive VideoGPTs are Scalable World Models — Tsinghua · Huawei Noah's Ark Lab (NeurIPS 2024)

https://arxiv.org/abs/2405.15223

 

iVideoGPT: Interactive VideoGPTs are Scalable World Models

World models empower model-based agents to interactively explore, reason, and plan within imagined environments for real-world decision-making. However, the high demand for interactivity poses challenges in harnessing recent advancements in video generativ

arxiv.org

 

Authors: Jialong Wu¹*, Shaofeng Yin¹²*, Ningya Feng¹, Xu He³, Dong Li³, Jianye Hao³⁴, Mingsheng Long¹
Affiliation: ¹School of Software · BNRist, Tsinghua University · ²Zhili College, Tsinghua University · ³Huawei Noah's Ark Lab · ⁴Tianjin University
Venue: NeurIPS 2024 (38th Conference on Neural Information Processing Systems)

 

Preprint: arXiv:2405.15223v3 [cs.CV] (초판 May 2024, v3 개정 Oct 2024)

0. Abstract

 

월드 모델(World models)은 모델 기반 에이전트(model-based agents)가 실세계 의사결정을 위해 상상된 환경(imagined environments) 안에서 상호작용적으로 탐색하고, 추론하고, 계획할 수 있도록 한다.

그러나 상호작용성(interactivity)에 대한 높은 요구는 비디오 생성 모델(video generative models)의 최근 발전을 대규모 월드 모델

개발에 활용하는 데 있어 어려움을 제기한다.

 

 

이 연구는 Interactive VideoGPT(iVideoGPT)를 소개하는데, 이는 멀티모달 신호시각 관측(visual observations), 액션(actions), 보상(rewards) — 을 하나의 토큰 시퀀스로 통합하여 next-token 예측을 통해 에이전트의 상호작용적 경험을 가능하게 하는 확장 가능한 자기회귀 transformer 프레임워크이다.

 

 

iVideoGPT는 고차원 시각 관측을 효율적으로 이산화(discretize)하는 새로운 "압축 토큰화(compressive tokenization)" 기법을

특징으로 한다.

확장 가능한 아키텍처를 활용하여, iVideoGPT를 수백만 개의 인간 및 로봇 조작 궤적으로 사전학습할 수 있으며, 이를 통해 다양한 downstream 태스크를 위한 상호작용적 월드 모델로서 기능하도록 적응 가능한 다목적(versatile) 기반(foundation)을 구축한다.

 

 

이러한 태스크에는 액션 조건 비디오 예측(action-conditioned video prediction), 시각 계획(visual planning), 그리고 모델 기반 강화학습(model-based reinforcement learning)이 포함되며, 여기서 iVideoGPT는 최신(state-of-the-art) 방법들과 비교해

경쟁력 있는 성능을 달성한다.

 

 

본 연구는 상호작용적 범용 월드 모델(interactive general world models)의 개발을 진전시키며, 생성형 비디오 모델(generative video models)과 실용적인 모델 기반 강화학습 응용 사이의 간극을 잇는다.

코드와 사전학습 모델은 https://thuml.github.io/iVideoGPT 에서 참고 가능하다.

 


 

1. Introduction 

 

 

최근 몇 년간 텍스트, 오디오, 이미지를 포함한 멀티모달 콘텐츠의 생성 모델에서 괄목할 만한 발전이 있었으며, 이제 비디오 생성이 새로운 프런티어(frontier)로 부상하고 있다.

 

다양한 인터넷 규모(Internet-scale) 데이터에 대해 비지도 방식으로 학습된 이러한 생성형 비디오 모델의 특히 중요한 응용 중 하나는

대규모의 예측형 월드 모델(predictive world models)을 구축하는 것이다.

 

이러한 월드 모델은 세계가 작동하는 방식에 대한 상식적 지식(commonsense knowledge)을 축적하여, 에이전트의 액션에 기반한 잠재적 미래 결과(예: 시각 관측 및 보상 신호)의 예측을 가능하게 할 것으로 기대된다.

 

이러한 월드 모델을 활용함으로써, 모델 기반 강화학습(model-based RL)을 사용하는 에이전트는 월드 모델 안에서 상상하고, 추론하고, 계획할 수 있으며, 따라서 실세계에서 소수의 시도만으로 더 안전하고 효율적으로 새로운 기술을 습득할 수 있다.

이러한 근본적 연결에도 불구하고, 비디오 생성을 위한 생성 모델과 에이전트 학습을 위한 시각 월드 모델 사이에는

여전히 상당한 간극이 존재한다.

 

 

한 가지 주요한 과제는 상호작용성(interactivity) 확장성(scalability)의 양쪽 모두를 최대한 달성하는 것이다.

모델 기반 RL에서 월드 모델은 주로 순환 신경망(recurrent network) 아키텍처를 사용한다.

이 설계는 각 스텝에서 액션에 조건화된 관측 또는 잠재 상태(latent states)의 전이를 자연스럽게 허용하여, 상호작용적 행동 학습을 용이하게 한다. 그러나 이러한 순환 모델들은 대부분 단순한 시각 요소를 가진 게임이나 시뮬레이션 환경에 집중되어 있으며, 복잡한

in-the-wild 데이터를 대규모로 모델링하는 능력이 제한적이다. 

 

 

한편, 인터넷 규모의 생성형 비디오 모델은 생성 시작 시점에 텍스트 설명이나 미래 액션 시퀀스를 통해 제어 가능한, 사실적인 긴 비디오를 합성할 수 있다. 이들은 고수준 계획(high-level planning)에는 적합하지만, 그것들의 궤적 수준(trajectory-level) 상호작용성은 에이전트가 정밀한 기초 기술을 효율적으로 학습하기 위해 시뮬레이션 도중 스텝 단위로 개입하는 데 필요한 세밀함(granularity)

충분히 제공하지 못한다.

 

이 딜레마는 자연스럽게 다음 질문을 제기한다:

 

확장 가능한 비디오 생성 모델의 발전을 상호작용적 시각 월드 모델 개발에 어떻게 활용할 수 있는가?

 

 

이 연구에서, GPT류(GPT-like) 자기회귀 transformer 프레임워크 안에서 상호작용적이면서도 확장 가능한 월드 모델을 탐구한다.

 

 

최근 diffusion 모델masked 생성 모델을 통해 선구적인 시도들이 이루어졌다.

그럼에도 불구하고, 자기회귀 transformer를 활용하는 것은 확립된 대규모 언어 모델(LLM) 생태계와의 매끄러운 통합, 그리고 adapter 모듈과 같은 특정 아키텍처 수정 없이도 다양한 조건을 처리하는 더 큰 유연성 같은 뚜렷한 이점을 제공한다.

 

 

본 연구는 시각 관측, 액션, 보상을 포함한 멀티모달 신호를 상호작용적으로 자기회귀적인(interactively autoregressive) 방식으로 통합하는 확장 가능한 월드 모델 아키텍처인 Interactive VideoGPT(iVideoGPT)를 제시한다.

 

 

이미지 토크나이저를 사용해 시각 관측을 프레임 단위로(frame-by-frame) 토큰으로 이산화하는 멀티모달 LLM과 달리, 확장성을 높이기 위한 iVideoGPT의 핵심 혁신은 풍부한 문맥적 관측(contextual observations)에 조건화하여 각 관측에 대한 압축 토큰화(compressive tokenization)를 학습하는 것으로, 토큰 시퀀스 길이를 점근적으로(asymptotic) 16배 감소시킨다.

 

 

더 압축적인(compact) 비디오 토큰화가 더 효율적인 학습과 생성을 용이하게 할 뿐만 아니라 비디오 품질도 향상시킬 수 있음을 강조한다. 이는 문맥(context)을 동역학(dynamics)으로부터 분리(decoupling)함으로써 달성되며, 모델이 장면 내 시간적 일관성을 유지하면서 객체의 움직임(motion) 예측에 집중할 수 있게 한다.

iVideoGPT의 실용적 응용. iVideoGPT는 확장 가능하도록 설계되어 수백만 개의 인간 및 로봇 조작 궤적에 대한 사전학습을 가능하게 한다. 이는 광범위한 downstream 태스크에 적응 가능한, 단일의 다목적(versatile) 상호작용적 월드 모델 기반(foundation)으로 귀결된다.

 

Figure 1에 예시된 것처럼, 시각 로봇 조작(visual robotic manipulation)을 위한 iVideoGPT의 일련의 실용적 응용을 시연한다.

 

 

LLM에 의해 대중화된 2단계 접근을 본떠, 본 방법은 사전학습(pre-training) 후 도메인 특화 적응(domain-specific adaptation)을 포함한다.

사전학습 동안, iVideoGPT는 100만 개가 넘는 로봇 및 인간 조작 궤적의 혼합에 대한 action-free 비디오 예측에 대해 확장 가능하다.

사전학습된 iVideoGPT는 액션 조건 비디오 예측, 시각 계획, 시각 모델 기반 RL과 같은 다양한 downstream 태스크를 위한 단일의, 적응 가능한 상호작용적 월드 모델 기반으로 기능한다.

 

 

또한, 본 연구는 미지의 도메인에 대해 토크나이저 적응만을 요구하는

"fine-tuning 없는 사전학습 transformer의 예비적(preliminary) zero-shot 비디오 생성 능력"을 보여준다.

나아가 시퀀스 모델링의 유연성을 부각하는, goal-conditioned 비디오 예측을 위한 iVideoGPT의 변형(variant)을 탐구한다.

 

 

이 연구의 주요 기여는 다음과 같이 요약할 수 있다:

 

1. 시각 관측을 위한 압축 토큰화를 특징으로 하는, 확장 가능한 월드 모델을 위한 자기회귀 transformer 아키텍처인 Interactive VideoGPT(iVideoGPT)를 소개한다.

 

2. 수백만 개의 로봇 및 인간 조작 궤적으로 구성된 대규모 데이터셋으로 iVideoGPT를 사전학습하고 이를 도메인 특화 태스크에 적응시킨다. 사전학습된 모델들은 추가 연구를 장려하기 위해 공개되었다.

 

3. 비디오 예측, 시각 계획, 시각 모델 기반 RL을 아우르는 광범위한 실험은 iVideoGPT가 정확하고 사실적인 경험을 시뮬레이션할 수 있으며 최신 방법들과 비교해 경쟁력 있는 성능을 제공함을 보여준다.

 


 

2. Problem Formulation 

 

월드 모델(world model)은 환경을 시뮬레이션하기 위해 에이전트가 학습한 내부 모델(internal model)이다.

 

이 환경은 일반적으로 부분 관측 마르코프 결정 과정(partially observable Markov decision process, POMDP)

(𝒮, 𝒪, φ, 𝒜, p, r, γ)로 모델링된다.

 

각 스텝에서, s_t ∈ 𝒮는 환경의 근본 상태(underlying state)를 나타내고,

o_t = φ(s_t)는 에이전트가 받는 관측(observation)으로, s_t에 대한 불완전한 정보만을 제공한다.

액션 a_t ∈ 𝒜를 취한 후, p(s_{t+1}|s_t, a_t)는 상태 s_t에서 s_{t+1}로의 전이 확률(transition probability)을 정의한다.

에이전트는 또한 즉각적 보상 r_{t+1} = r(s_t, a_t)를 받으며, γ-할인 누적 보상 𝔼_{p,π}[Σ_t γ^{t−1} r_t]를 최대화하는 정책 π를 학습하는 것을 목표로 하되, 이때 a_t ∼ π(o_{1:t})이다.

 

 

월드 모델은 많은 유형의 데이터로부터 학습될 수 있지만, 비디오는 태스크 불문(task-agnostic)이고, 널리 이용 가능하며, 자기지도 방식(self-supervised way)으로 학습될 수 있는 광범위한 지식을 담고 있는 하나의 모달리티이다.

 

따라서, 본 연구는 시각 제어(visual control)를 위한 월드 모델 학습을 인터랙티브 비디오 예측(interactive video prediction) 문제로 정식화하며, 여기서 𝒪 = R^{H×W×3}는 비디오 프레임의 공간이다.

 

구체적으로, T₀개 프레임의 짧은 히스토리 시각 관측 o_{1:T₀}가 주어지면, 각 스텝 t = T₀, …, T−1에서 에이전트는 자신의 정책이전의 상상된 관측(previous imagined observations)에 기반하여 액션 a_t를 취하고, 그런 다음 월드 모델은 에이전트에게 피드백하기 위해 전이 p(o_{t+1}, r_{t+1} | o_{1:t}, a_{T₀:t})를 근사하고 샘플링해야 한다.

 

 

아키텍처 간 개념적 비교, 단순화를 위해 단일 문맥 프레임(T₀ = 1)을 사용하여 예시함. (a) Dreamer[29]와 MuZero[80] 같은 월드 모델을 위한 순환 아키텍처는 스텝 수준(step-level) 상호작용성을 제공하지만 확장성은 제한적이다. (b) VideoGPT[101]와 Stable Video Diffusion[8, 7] 같은 최근 비디오 생성의 발전은 궤적 수준(trajectory-level) 상호작용성만 제공할 수 있는 non-causal 시간 모듈을 사용한다. (c) 우리 모델은 각 스텝을 개별적으로 토큰 시퀀스로 매핑하는 자기회귀 transformer를 활용하여, 확장성과 상호작용성을 모두 달성한다.

 

 

Figure 2에 묘사된 것처럼, VideoGPT를 포함한 대부분의 진보된 비디오 생성 모델[101, 8, 104]은 인터랙티브 비디오 예측 문제를 다룰 수 없는데, 이는 그것들이 시간 차원(temporal dimension)을 따라 정보를 융합하는 non-causal 모듈을 설계하여, 생성 도중의 인과적·중간적 액션 제어(causal, intermediate action control) 능력이 결여되어 있기 때문이다(확장된 논의는 Appendix C.2 참조).

MBRL 문헌의 기존 월드 모델들[29, 80], 예컨대 Dreamer는 순환 아키텍처를 활용하지만 확장성이 부족하다.

 


 

3. Interactive VideoGPT

 

시각 관측·액션·보상 및 기타 잠재적 감각 입력을 포함한 멀티모달 신호를 통합할 큰 유연성을 갖춘, 확장 가능한 월드 모델 아키텍처인 Interactive VideoGPT를 소개한다. 그 핵심에서, iVideoGPT는 비디오 프레임을 이산화하는 "압축 토크나이저(compressive tokenizer)"와 후속 토큰을 예측하는 "자기회귀 transformer"로 구성된다(3.1절).

이 모델은 다양한 인간 및 로봇 조작 비디오에 대한 사전학습을 통해 여러 장면 속 움직임과 상호작용에 대한 공통 지식을 습득할 수 있으며, 그런 다음 추가 모달리티를 통합하는 downstream 태스크로 효과적으로 전이할 수 있다.


3.1 Architecture

iVideoGPT의 아키텍처, 단일 문맥 프레임(T₀ = 1)만 보이도록 단순화함. (a) 압축 토큰화는 시간적 중복성을 처리하기 위해 문맥 프레임에 조건화하여 미래 프레임을 이산화하는 조건부 VQGAN을 활용하여, 비디오 토큰 수를 유의미하게 감소시킨다. (b) 자기회귀 transformer는 멀티모달 신호 — 시각 관측·액션·보상 — 을 토큰 시퀀스로 통합하여, next-token 예측을 통해 인터랙티브 에이전트 경험을 가능하게 한다. 액션과 보상은 선택적이며 action-free 비디오 사전학습에는 포함되지 않는다.

 

Compressive tokenization.

 

Transformer는 이산 토큰의 시퀀스에 대해 작동하는 데 특히 뛰어나다.

VQGAN은 원시 픽셀에서 이산 토큰으로 변환하는 데 흔히 사용되는 시각 토크나이저이다.

 

각 프레임을 독립적으로 이산화하여 시퀀스 길이가 급증하게 만드는 이미지 토크나이저를 사용하거나, 상호작용성을 희생하면서 비디오를 시공간적으로 압축하는 3D 토크나이저를 사용하는 대신, 본 연구는 "이중 인코더·디코더 {(E_c, D_c), (E_p, D_p)}"로 구성된 새로운

"조건부 VQGAN(conditional VQGAN)"으로 비디오를 토큰화할 것을 제안한다.

(²이 연결로 인해, 본 연구는 "비디오 프레임"과 "시각 관측"이라는 용어를 서로 바꾸어 사용한다.)

 

 

Figure 3a에 예시된 것처럼, 문맥 정보가 풍부한 초기 문맥 프레임 o_{1:T₀}는 N개 토큰을 통해 독립적으로 토큰화되고 재구성된다:

 

이와 대조적으로, 문맥 프레임과 미래 프레임 사이의 시간적 중복성(temporal redundancy) 때문에, 움직이는 객체의 위치와 자세 같은 필수 동역학 정보만 인코딩되면 된다.

이는 훨씬 적은 수의 n개 토큰(n ≪ N)을 요구하는 조건부 인코더와 디코더를 사용해 달성된다:

 

본 연구는 이 조건화 메커니즘을 다중 스케일 feature map 간의 cross-attention을 사용해 구현한다.

(자세한 내용은 Appendix A.1 참조).

 

전체적으로, 제안된 토크나이저는 다음 목적함수로 학습된다:

 

 

여기서 𝓛_VQGAN(o; E, D)는 L₁ 재구성 손실, commitment 손실, perceptual 손실, 그리고 선택적으로 adversarial 손실의 조합이다.

 

제안된 토큰화에는 주로 두 가지 이점이 있다:

 

첫째, 이는 토큰화된 비디오의 시퀀스 길이를 유의미하게 감소시키는데, 이 길이는 프레임 수에 따라 선형적으로 증가하되 훨씬 작은 비율 n으로 증가한다. 이 연구에서는 N = 16×16, n = 4×4로 설정하여, 점근적으로 16배의 감소를 가져오고, 모델 기반 계획과 강화학습을 위한 더 빠른 rollout을 용이하게 한다.

 

둘째, 조건부 인코딩을 통해, 후속 토큰을 예측하는 transformer는 문맥의 시간적 일관성을 훨씬 쉽게 유지하고 필수 동역학 정보 모델링에 집중할 수 있다. 본 연구의 토큰화의 가정과 한계를 6절에서 논의한다.

 

Interactive prediction with Transformers.

 

토큰화 후, 비디오는 토큰 시퀀스로 평탄화된다:

x = (z_1^{(1)}, …, z_1^{(N)}, [S], z_2^{(1)}, …, z_2^{(N)}, …, [S], z_{T₀+1}^{(1)}, …, z_{T₀+1}^{(n)}, …),

 

이때 길이는 L = (N+1)T₀ + (n+1)(T−T₀) − 1이다. 특수한 slot 토큰 [S]가 삽입되어 프레임 경계를 구분하고 액션 같은 추가 저차원

모달리티의 통합을 용이하게 한다(자세한 내용은 3.3절 참조).

 

 

위 Figure 3b처럼, GPT류 자기회귀 transformer가 프레임 단위 next-token 생성을 통한 인터랙티브 비디오 예측에 활용된다.

이 연구에서 GPT-2의 모델 크기를 취하되, LLM 아키텍처를 위한 최신 혁신을 수용하기 위해 LLaMA 아키텍처를 채택하여, RMSNorm을 사용한 pre-normalization, SwiGLU 활성화 함수, 그리고 rotary positional embedding을 적용한다.


3.2 Pre-Training 

대규모 언어 모델은 next-word 예측을 통해 자기지도 방식으로 인터넷 텍스트로부터 광범위한 지식을 얻을 수 있다.

유사하게, 월드 모델을 위한 action-free 비디오 사전학습 패러다임은 비디오 예측을 사전학습 목적으로 삼아, LLM에 없는 물리 세계 지식을 담은 인터넷 규모의 감독(supervision)을 제공한다.

 

이 일반적 목적함수로 iVideoGPT를 사전학습하며, 후속 비디오 토큰을 예측하기 위해 cross-entropy 손실을 적용한다:

 

 

여기서 L은 전체 시퀀스 길이이고, (N+1)T₀+1은 예측될 프레임의 첫 토큰 인덱스를 표시한다.

특히, 앞서 논의한 대로 iVideoGPT가 문맥 프레임을 생성하도록 학습시키지 않으며, 이를 통해 그것의 용량(capacity)이 동역학 정보에 집중하게 한다.

 

Pre-training data

 

인터넷에는 수많은 비디오가 이용 가능하지만, 계산상의 제약으로 인해 iVideoGPT를 로봇 조작 도메인에 특화하여 사전학습한다.

Open X-Embodiment(OXE) 데이터셋의 35개 데이터셋과 Something-Something v2(SSv2) 데이터셋의 혼합을 활용하며,

총 140만 궤적이다(자세한 내용은 Appendix A.2 참조).

OXE는 다양한 로봇 embodiment, 장면, 태스크에서 온 로봇 학습 데이터셋의 다채로운 집합이다.

이 데이터셋들은 매우 이질적(heterogeneous)이지만 action-free 비디오 예측 태스크로 쉽게 통일될 수 있다.

다양성을 더욱 높이기 위해 인간-객체 상호작용 비디오 데이터셋인 SSv2도 포함하는데, 이는 선행 연구가 이러한 인간 조작 비디오로부터 로봇 조작 태스크를 위한 월드 모델 학습으로의 지식 전이를 입증했기 때문이다.

 

Flexibility of sequence modeling.

 

토큰 시퀀스는 태스크, 입력, 출력을 명시하는 유연한 방법을 제공한다.

이 유연성을 예비적으로 보여주기 위해, 본 연구는 goal-conditioned 비디오 예측을 위한 iVideoGPT의 변형을 소개한다:

 

여기서 모델은 지정된 목표 관측 o_T에 도달하는 비디오 시퀀스를 예측한다.

 

이는 아키텍처와 학습 절차를 위와 동일하게 유지하면서 프레임 시퀀스를 õ_{1:T} = (o_T, o₁, o₂, …, o_{T−1})로 단순히 재배열함으로써 달성된다(자세한 내용은 Appendix A.2 참조).

goal-conditioned 예측의 정성적 결과는 Figure 4에 나와 있으며, 추가 탐구는 향후 연구로 남겨둔다³.

(³별도로 명시하지 않는 한, action-free 및 goal-free 비디오 예측이 모든 실험을 위한 사전학습 모델을 얻기 위한 기본(default) 사전학습 목적으로 사용된다.)


3.3 Fine-Tuning

 

Action conditioning & reward prediction

 

본 아키텍처는 또한 인터랙티브 월드 모델 학습을 위해 추가 모달리티를 유연하게 통합하도록 설계되었으며, 이는 위 Figure 3b에

드러나 있다.

액션은 linear projection을 통해 slot 토큰 임베딩에 더해짐으로써 통합된다.

보상 예측의 경우, 독립적인 보상 예측기를 학습하는 대신, 각 관측의 마지막 토큰의 hidden state에 linear head를 추가한다.

이 멀티태스크 학습 접근은 태스크 관련 정보에 대한 모델의 집중을 높여, 제어 태스크에 대한 예측 정확도를 향상시킬 수 있다.

 

본 연구에서는 위 식의 cross-entropy 손실에 더하여 보상 예측을 위한 평균제곱오차(MSE) 손실을 사용한다.

 

Tokenizer adaptation

 

본 연구는 downstream 태스크를 위해 토크나이저를 포함한 전체 모델을 갱신하기로 선택하며, 이 전략이

파라미터 효율적 fine-tuning 방법보다 더 효과적임을 발견한다.

이는 인터넷 규모 이미지에 비해 본 연구의 사전학습 데이터의 다양성이 제한적이기 때문일 가능성이 높은데, 이 데이터는 방대하긴 하지만 로봇공학 같은 특정 실세계 응용을 충분히 커버하지 못할 수도 있다.

 

VQGAN 토크나이저를 도메인 특화 데이터에 적응시키는 것을 탐구한 문헌은 거의 없다.

 

본 연구의 토큰화는 동역학 정보를 문맥 조건으로부터 분리하도록 설계되었으므로, 저자들은 모델이 downstream 태스크에서 서로 다른 로봇 유형 같은 미지의 객체를 마주칠 수는 있어도, transformer가 다양한 장면으로부터 학습한 물리의 근본 지식 — 움직임과 상호작용 같은 — 은 공통적으로 공유된다고 가설을 세운다.

이 가설은 iVideoGPT를 혼합 사전학습 데이터에서 미지의 BAIR 데이터셋으로 전이하는 실험에 의해 뒷받침되는데, 여기서 사전학습된 transformer는 미지의 로봇 그리퍼에 대해 토크나이저만 fine-tuning하면 되면서 자연스러운 움직임을 예측하도록 zero-shot 일반화할 수 있다(Figure 8 참조).

이 특성은 GPT류 transformer를 큰 크기로 확장하는 데 특히 중요한데, transformer를 그대로 유지하면서

도메인 간 경량 정렬(lightweight alignment)을 가능하게 하기 때문이다.

 


 

 

4. Experiments

 

저자들은 iVideoGPT를 세 가지 서로 다른 제어 관련(control-relevant) 설정에서 평가하고 그 성능을 기존 최신 방법들과 비교한다.

iVideoGPT가 다양한 태스크에 걸쳐 경쟁력 있는 성능을 제공할 만큼 다목적임을 시연하고, 토큰화 및 예측 능력, 데이터 효율성, 모델 스케일링, 계산 효율성을 이해하기 위한 심층 분석을 수행한다.

실험 세부 사항은 Appendix A에서 찾을 수 있다.


4.1 Video Prediction

Setup.

 

BAIR 로봇 pushing 데이터셋은 43k개의 학습 비디오와 256개의 테스트 비디오로 구성되며, 여기서 저자들은 선행 연구의 표준 프로토콜에 따라 단일 초기 프레임으로부터 15개 프레임을 예측한다.

RoboNet 데이터셋은 7개 로봇 팔에 걸친 162k개의 비디오를 담고 있다.

선행 연구를 따라, 본 연구는 테스트에 256개 비디오를 사용하여 두 개 프레임으로부터 10개 프레임을 예측한다.

특히, RoboNet은 본 연구의 사전학습 데이터인 OXE와 겹치며, 저자들은 여기서 테스트 비디오를 신중하게 필터링했다.

variational, diffusion, masked, autoregressive 모델을 포함한 다양한 비디오 예측 모델과 네 가지 지표 — FVD, PSNR, SSIM, LPIPS — 에 걸쳐 비교한다.

 

Results.

BAIR 로봇 pushing과 RoboNet 데이터셋에 대한 비디오 예측 결과. 우리는 세 번의 실행에 대해 계산된 각 지표의 평균과 표준편차를 보고한다. "-"는 원 논문에서 해당 값이 보고되지 않았음을 표시한다. LPIPS와 SSIM 점수는 편의상 표시를 위해 100배로 스케일링된다.

 

Table 1에서 보이듯이, iVideoGPT는 최신 방법들 — BAIR의 MAGVIT와 RoboNet의 FitVid — 과 비교해 경쟁력 있는 성능을 제공하면서, 그 아키텍처에서 상호작용성과 확장성을 모두 달성한다.

 

처음에 action-free로 사전학습된 본 연구의 모델은 액션 조건화를 유연하게 허용하며, 이는 BAIR의 FVD를 거의 20% 유의미하게 개선한다.

 

주 실험은 64×64의 낮은 해상도에서 수행되지만, iVideoGPT는 RoboNet의 경우 256×256으로 쉽게 확장될 수 있다.

프레임 단위 토큰화를 활용하는 선행 방법인 MaskViT가 VQGAN 재구성에서 시간적 비일관성깜빡임(flicker) 아티팩트

겪는다는 점을 강조한다.

일관된 문맥 정보에 조건화된 압축 토큰화를 사용하는 본 연구의 모델은 이를 개선하며 MaskViT를 유의미하게 능가한다.

정성적 평가: Open X-Embodiment, RoboNet, VP²에 대한 iVideoGPT의 비디오 예측 결과. 자세한 내용은 확대하여 보라. 확장된 예시는 Appendix B.1에서 찾을 수 있다.

 


4.2 Visual Planning

Setup.

 

VP는 네 개의 Robosuite 태스크와 일곱 개의 RoboDesk 태스크에 걸쳐 시각 모델-예측 제어(visual model-predictive control, MPC)를 위한 비디오 예측 모델을 평가하는 제어 중심(control-centric) 벤치마크이다.

각 환경의 학습 데이터셋에는 noisy scripted 상호작용 궤적이 포함된다.

원 벤치마크 논문의 프로토콜을 따라, Robosuite에 대해 5k개 궤적, RoboDesk에 대해 35k개 궤적으로 iVideoGPT를 학습하여, 모델을 확립된 baseline들과 비교했다.

 

Results.

VP² 벤치마크에 대한 시각 MPC 결과. 우리는 3번의 제어 실행에 대한 iVideoGPT의 평균과 최소/최대 성능을 보고한다. 오른쪽에서는, 낮은 시뮬레이터 성능으로 인해 flat block을 제외한 모든 태스크에 걸쳐 평균낸 평균 점수를 시뮬레이터의 성능으로 정규화하여 보인다.

 

Figure 5는 baseline 모델들과 비교한 iVideoGPT의 성공률을 제시한다.

Tian et al.은 뛰어난 지각 지표가 효과적인 제어 성능과 항상 상관관계가 있는 것은 아님을 관찰했지만, iVideoGPT는 두 개의 RoboDesk 태스크에서 큰 격차로 모든 baseline을 능가하고 가장 강력한 모델인 SVG′와 비슷한 평균 성능을 달성한다.

 

Appendix C.3에서, 저자들은 open slide 태스크에 대한 iVideoGPT의 최적이 아닌 성능을 분석하는데, 이는 모델의 이산화(discretization) 한계와 벤치마크의 불완전한 내장 보상 설계 양쪽 모두에 기인한다.


4.3 Visual Model-based Reinforcement Learning

Setup.

 

Meta-World에서 난이도가 다양한 여섯 개의 로봇 조작 태스크에 대해 실험을 수행한다.

iVideoGPT를 인터랙티브 월드 모델로 활용하여, MBPO에서 적응한 모델 기반 RL 방법을 개발했는데, 이는 표준 actor-critic RL 알고리즘을 학습하기 위해 replay buffer를 합성 rollout으로 증강한다(의사코드는 Appendix A.5 참조).

 

구현은 최신 시각 model-free RL 방법인 DrQ-v2 위에 구축된다.

또한 월드 모델 사전학습이 있는 경우와 없는 경우 모두에 대해, 최신 모델 기반 RL 알고리즘인 DreamerV3와 비교한다.

 

 

Results.

Meta-world에 대한 시각 모델 기반 RL. (왼쪽) 종합 결과는 여섯 개 태스크에 걸친 총 30번의 실행에 대한 사분위 평균(interquartile mean)과 95% 신뢰구간(CI)[2]을 보고한다. (오른쪽) 각 태스크에 대한 개별 결과로, 다섯 번의 실행에 걸친 평균과 95% CI를 보고하며, 20개의 평가 에피소드에 대한 성공률을 측정한다. PT는 사전학습(pre-training)을 나타낸다.

 

Figure 7은 본 연구의 모델 기반 알고리즘이 model-free 대응물 대비 샘플 효율을 현저히 개선할 뿐만 아니라 DreamerV3의 성능과

대등하거나 이를 능가함을 보여준다.

 

이는 MBPO를 시각 연속 제어(visual continuous control) 태스크에 성공적으로 적용한 최초의 사례를 보고하는 것이다.

이러한 결과는, 강력한 월드 모델이 있으면, 월드 모델 안에서 잠재 상태(latent states)의 rollout에 대해 정책을 학습하기 위해 진보된 MBRL 시스템에서 흔히 사용되는 전략인 latent imagination의 필요성을 제거할 기회를 부각한다. (Figure 6의 비교 참조).

강력한 iVideoGPT는 모델 rollout과 정책 학습을 분리하는, 단순하지만 성능 좋은 MBRL 알고리즘을 가능하게 한다.

성능 좋은 MBRL 알고리즘에 대한 본 연구의 개발은 모델 학습과 정책 학습을 분리하며, 여기서 iVideoGPT는 단순히 환경의 drop-in 대체물로 기능한다. 이는 설계 공간(design space)을 상당히 단순화하여, 실세계 응용에서 MBRL 알고리즘의 실용성과 효과를 크게 높일 수 있다.

 

Comparison to recurrent world models.

 

저자들은 순환 월드 모델이 실세계 데이터에 대한 대규모 사전학습 능력 — 현대 foundation 모델에 결정적인 능력 — 이 부족하다고 주장한다. 이를 검증하기 위해, DreamerV3 XL(200M 파라미터, iVideoGPT에 필적)을 동일한 데이터셋으로 사전학습한다.

Appendix의 Figure 11에서 보이듯이, DreamerV3는 자연스러운 로봇 동역학을 포착하는 데 실패하여, 저품질의 흐릿한 예측을 낸다. Figure 7의 Meta-World 벤치마크에 대한 추가 평가는 DreamerV3가 그러한 비효과적인 사전학습으로부터 이득을 얻지 못함을 드러낸다.


4.4 Model Analysis

 

Zero-shot Prediction.

 

먼저 미지의 BAIR 데이터셋에 대한 대규모 사전학습 iVideoGPT의 zero-shot 비디오 예측 능력을 분석한다.

iVideoGPT에서 사전학습 transformer에 의한 zero-shot 예측. fine-tuning 없이, transformer는 사전학습 토크나이저를 사용해 다른 로봇 그리퍼의 자연스러운 움직임을 예측하지만(두 번째 행), 적응된 토크나이저로는 올바른 그리퍼 유형에 대해 정확하게 예측한다(세 번째 행).

흥미로운 점은, Figure 8의 두 번째 행에서 iVideoGPT가 fine-tuning 없이 — 비록 본 연구의 사전학습 데이터셋과는 다른 것이지만 — 로봇 그리퍼의 자연스러운 움직임을 예측하는 것을 관찰했다는 것이다.

이는 사전학습 데이터의 불충분한 다양성으로 인해 모델이 완전히 미지의 로봇에 대한 zero-shot 일반화 능력은 제한적이지만, 장면 문맥(scene context)을 움직임 동역학(motion dynamics)으로부터 효과적으로 분리함을 나타낸다.

 

이와 대조적으로, 적응된 토크나이저를 사용하면, 그 자체로는 fine-tuning되지 않은 transformer가 사전학습 지식을 성공적으로 전이하여 세 번째 행에서 새로운 로봇 유형에 대한 움직임을 예측하며, 네 번째 행의 완전히 fine-tuning된 transformer와 유사한 지각 품질을 제공한다. 정량적 결과는 Figure 9a에서 찾을 수 있다.

 

Few-shot Adaption.

 

대규모 사전학습 모델은 특히 데이터가 부족한 시나리오에서 효과적임이 입증되었다.

모델 분석. (a) BAIR에 대한 다양한 fine-tuning 전략과 데이터 크기에 따른 비디오 예측 결과. (b) 사전학습 데이터셋에 대한 138M 및 436M transformer 모델의 validation loss. (c) 서로 다른 토크나이저의 계산 효율과 재구성 품질.

 

Figure 9a는 다양한 크기의 action-free BAIR 궤적으로 fine-tuning했을 때의 iVideoGPT 성능을 보여준다.

전체 downstream 데이터가 이용 가능할 때는 사전학습이 최소한의 이득만 제공하지만, 데이터 부족(100개 또는 1,000개 궤적) 하에서는 그 이점이 유의미해짐을 관찰한다.

또한 1,000개의 action-conditioned BAIR 궤적을 사용해 iVideoGPT를 적응시켜, FVD 82.3을 달성한다.

소수의 데이터로 빠르게 적응하는 능력은 모델 기반 RL에서 특히 결정적이다.

Meta-world에 대한 시각 모델 기반 RL. (왼쪽) 종합 결과는 여섯 개 태스크에 걸친 총 30번의 실행에 대한 사분위 평균(interquartile mean)과 95% 신뢰구간(CI)[2]을 보고한다. (오른쪽) 각 태스크에 대한 개별 결과로, 다섯 번의 실행에 걸친 평균과 95% CI를 보고하며, 20개의 평가 에피소드에 대한 성공률을 측정한다. PT는 사전학습(pre-training)을 나타낸다.

 

Figure 7에서 보이듯이, from scratch로 학습된 월드 모델은 부정확한 예측을 생성할 수 있으며, 이로써 모델 기반 에이전트에 필수적인 샘플 효율을 저하시킨다.

 

Model scaling.

 

이전의 모든 실험은 12개의 transformer layer와 768차원 hidden state(138M 파라미터)를 가진 iVideoGPT를 사용해 수행되었다.

모델의 스케일링 거동을 예비적으로 조사하기 위해, 24개 layer와 1024차원 hidden state(436M 파라미터)를 가진 더 큰 iVideoGPT를 학습했다.

Figure 9b는 사전학습 데이터셋에 대한 validation loss 곡선을 나타낸다.

이는 (1) validation loss(perplexity)가 모델 크기와 무관하게 계속 감소하며, (2) 모델 크기 증가가 loss 감소를 가속함을 보여준다.

이러한 결과는 더 큰 모델 크기와 증가된 계산이 더 강력한 iVideoGPT를 구축할 수 있다는 연구의 기대와 일치한다.

 

Tokenization efficiency.

 

각 프레임을 독립적으로 16×16 및 4×4 토큰으로 변환하는 표준 VQGAN 토크나이저와 비교하여 본 연구의 압축 토큰화의 효과를 평가한다. 세 개의 토크나이저를 동일한 스텝 수 동안 RoboNet에서 from scratch로 학습한다.

 

Figure 9c처럼, 4×4 토큰을 가진 토크나이저는 불충분한 용량으로 인해 낮은 재구성 품질을 겪는다.

본 연구에서 제안한 토큰화 방법은 표준 16×16 토크나이저에 비해 재구성 품질을 약간 희생하지만, 비디오 예측 태스크에 유익한

더 일관된 문맥 정보를 제공할 수 있다.

더 중요하게는, 이는 유의미하게 더 적은 양의 토큰으로 계산 효율을 크게 향상시켜, 시간과 메모리를 크게 절약하고, 더 적은 비용으로 모델 크기를 확장할 수 있게 한다 (정량적 결과는 Appendix B.5 참조).

 

Context-dynamics decoupling.

 

본 연구의 토크나이저는 훨씬 적은 토큰의 병목(bottleneck)으로 설계되어, 원시 픽셀을 재구성하기 위해

초기 프레임과 문맥 정보를 공유하면서 미래 프레임에 필요한 동역학 정보 포착에만 집중한다.

이 문맥과 동역학 정보의 분리를 명시적으로 시각화하기 위해, 본 연구에서는 미래 프레임을 재구성할 때 디코더에서

문맥 프레임으로의 cross-attention 블록을 제거한다.

우리 압축 토큰화에서의 문맥-동역학 분리. 미래 프레임에서 문맥 프레임으로의 cross-attention을 제거함으로써, 디코더는 여전히 원본과 같은 방식으로 움직이는 궤적을 재구성할 수 있으나, 시각적 문맥은 거의 완전히 사라진다.

 

Figure 10의 결과는 디코더가 여전히 움직임 궤적을 정확하게 재현할 수 있으나 최소한의 문맥 정보만 담고 있음을 보여준다. 이 시각화는 Figure 8에 나타난 모델의 일반화 능력에 대한 설명을 뒷받침한다.

 

Goal-conditioned Prediction.

 

Figure 4에서, 또한 대규모 인간 및 로봇 비디오로 사전학습된 goal-conditioned iVideoGPT가 생성한 비디오 예측을 보여준다(3.2절). ground truth에서 벗어나는 궤적을 자주 초래하는 action-free 예측과 달리, goal-conditioned 모델은 지정된 목표에 도달하는 더 정확한 경로를 생성한다. 저자들은 이것이 통합 시퀀스 모델링 패러다임의 유연성을 활용하는 잠재력을 부각한다고 믿는다.


 

5 Related Work 

 

World models for visual control.

 

시각 도메인에서 범용 월드 모델을 학습하는 것은 모델 기반 강화학습에서 여전히 중대한 과제이다.

 

직관적인 방법 하나는 액션 조건 비디오 예측 모델을 학습하는 것이다.

진보된 모델 기반 RL 알고리즘은 더 효율적이고 정확한 rollout을 위해 latent imagination을 활용하지만,

모델 학습과 정책 학습을 긴밀하게 결합함으로써 스스로를 복잡하게 만든다.

특정 태스크를 넘어서는 일반화 가능한 지식을 축적한 강력한 월드 모델로 이 복잡성을 줄일 수 있음을 보인다.

이를 용이하게 하기 위한 최근 노력에는 transformer 같은 확장 가능한 아키텍처를 활용하는 것 대규모 데이터로부터 사전학습하는 것이 포함된다.

본 연구와 특히 관련이 있는 것은 UniSimGenie인데,

이들은 각각 diffusion과 masked 모델로 광범위하게 학습된 월드 모델을 개발했으나 둘 다 공개되어 있지 않다.

본 연구는 범용 자기회귀 transformer 프레임워크를 활용함으로써 스스로를 차별화하며, 확장 가능한 월드 모델의 유연성을 진전시킨다.

 

Video generation and prediction.

 

인터넷 규모 비디오 생성 모델의 최근 발전은 이제 클래스 레이블, 텍스트 설명, 그리고 초기 프레임 — 마지막 것은 비디오 예측 문제로도 알려져 있다 — 에 조건화된 사실적 비디오의 합성을 가능하게 한다.

결정론적 RNN, variational autoencoder, diffusion, masked, autoregressive 모델을 포함한 다양한 모델이 개발되었다.

그러나 대부분의 최근 연구는 비디오 예측을 동역학 모델링 문제로 취급하지 않고 시공간 압축(spatiotemporal compression)을 수행하며, 이에 따라 월드 모델로 기능하기에는 제한적인 상호작용성만 제공한다.

 

본 연구는 최소한의 귀납적 편향(inductive bias)을 가진 cross-attention 메커니즘을 활용하는 문맥 인지(context-aware) 표현을 통해 압축 토큰화와 상호작용성을 모두 달성한다.

이 방법은 모션 벡터나 광류(optical flow)에 의존하는 이전 기법들에서 벗어나며, 더 범용적인 형태의 비디오 토큰화를 제공한다.


 

6 Discussion

 

본 연구는 확장 가능한 자기회귀 transformer를 활용해 멀티모달 신호를 토큰 시퀀스로 통합하는, 범용적이고 효율적인 월드 모델 아키텍처인 Interactive VideoGPT(iVideoGPT)를 소개했으며, 이는 next-token 예측을 통해 상호작용적 에이전트 경험을 제공한다.

iVideoGPT는 수백만 개의 인간 및 로봇 조작 궤적으로 사전학습되고 광범위한 downstream 태스크에 적응되었다.

월드 모델의 강력한 기반으로서, 이는 정확하고 일반화 가능한 비디오 예측뿐 아니라 단순하면서도 성능 좋은 모델 기반 계획 또는 강화학습을 가능하게 한다.

 

Limitations and future work.

 

iVideoGPT는 중대한 진전을 이루었지만, 개선의 여지는 상당하다.

대규모 Open X-Embodiment 데이터셋을 포함해 공개적으로 이용 가능한 로봇 데이터에서 제한적인 다양성을 발견했으며, 인간 비디오로부터 지식을 전이하려는 노력을 시작했다.

 

저자들은 인간과 로봇 사이의 지식을 잇기 위해 iVideoGPT가 더 광범위한 데이터로 사전학습되어야 한다고 믿는다.

 

이는 또한 iVideoGPT가 action-free 비디오 예측을 넘어, 다중 시점 관측(multi-view observations), 고유수용감각 로봇 상태(proprioceptive robot states), 그리고 액션 같은 더 많은 모달리티를 통합 정식화(unified formulation) 안에 포함할 것

요구한다.

 

구체적으로, 고차원 시각 관측을 처리하기 위해, 본 연구의 압축 토큰화는 초기 프레임이 미래 프레임에 대한 충분한 문맥을 제공한다고 가정하는데, 이는 모델 기반 에이전트가 흔히 수십 스텝 앞을 내다보는 저수준 제어 태스크에는 유효하지만, 긴 비디오와 상당한 카메라 움직임이 있는 시나리오에서는 흔들릴 수 있다.

이 문제는 키프레임 추출(keyframe extraction)로 완화될 수 있으나, 탐구할 중요한 향후 방향으로 남아 있다.

 

마지막으로, 더 복잡한 실기 로봇 태스크로 확장하는 것이 필수적인데, 이는 downstream 제어 태스크를 위한 시각적으로 단순한 시뮬레이션 안에서는 모델을 훨씬 더 큰 크기로 스케일링하는 이점이 이 연구에서 아직 관찰되지 않았기 때문이다.




 

Appendix

 

 

 

 

이상으로 본 논문의 리뷰를 마친다.

+ Recent posts