JM_Research Blog

[VLA] π0 : A Vision-Language-Action Flow Model forGeneral Robot Control ๋ณธ๋ฌธ

+ ๋”ฅ๋Ÿฌ๋‹/VLA

[VLA] π0 : A Vision-Language-Action Flow Model forGeneral Robot Control

-jm- 2026. 9. 9. 18:01

๐Ÿ“„ π0: A Vision-Language-Action Flow Model for General Robot Control

0๏ธโƒฃ Meta

๊ตฌ์„ฑ ์š”์†Œ  ์„ค๋ช…
VLM Backbone PaliGemma, ์•ฝ 3B
Action Expert Transformer, ์•ฝ 300M
Action Modeling Flow Matching
์ถœ๋ ฅ 50-step Continuous Action Chunk

 


๐ŸŒžOne-line Summary

π0๋Š” VLM์˜ ์‹œ๊ฐ·์–ธ์–ด ์ง€์‹๊ณผ ๋กœ๋ด‡ ์ „์šฉ Action Expert๋ฅผ ๊ฒฐํ•ฉํ•˜๊ณ , Flow Matching ๊ธฐ๋ฐ˜์˜ ์—ฐ์† Action Chunk๋ฅผ ์ƒ์„ฑํ•˜์—ฌ ๋ฒ”์šฉ์„ฑ๊ณผ ์ •๊ตํ•œ ์กฐ์ž‘ ๋Šฅ๋ ฅ์„ ๋™์‹œ์— ํ™•๋ณดํ•˜๋Š” VLA ๋ชจ๋ธ์ด๋‹ค.

 

๋ฌธ์ œ

๊ธฐ์กด ๋กœ๋ด‡ ์ •์ฑ…์€ ํŠน์ • ์ž‘์—…์— ํŠนํ™”๋˜์–ด ์žˆ์–ด ๋ฐ์ดํ„ฐ ๋ถ€์กฑ, โ€‹์ผ๋ฐ˜ํ™”·๊ฐ•์ธ์„ฑ ๋ถ€์กฑ, โ€‹์ •๊ตํ•œ ์กฐ์ž‘์˜ ํ•œ๊ณ„๊ฐ€ ์กด์žฌํ•œ๋‹ค.

์ ‘๊ทผ

π0๋Š” ๋Œ€๊ทœ๋ชจ Vision-Language Model์˜ ์‚ฌ์ „ํ•™์Šต ์ง€์‹์„ ํ™œ์šฉํ•˜๋ฉด์„œ, ๋‹ค์–‘ํ•œ ๋กœ๋ด‡ ๊ฒฝํ—˜์„ ํ•จ๊ป˜ ํ•™์Šตํ•˜๋Š” Robot Foundation Model ์ ‘๊ทผ์„ ์ œ์•ˆํ•œ๋‹ค.

ํ•ต์‹ฌ ๋ฐฉ๋ฒ•

  1. VLM + Action Expert
    • PaliGemma์˜ ์‹œ๊ฐ·์–ธ์–ด ์ง€์‹์„ ํ™œ์šฉํ•˜๊ณ , Action Expert๋ฅผ ์ถ”๊ฐ€ํ•ด ๋กœ๋ด‡ ์ƒํƒœ์™€ ํ–‰๋™ ์ฒ˜๋ฆฌ์— ํŠนํ™”
  2. Flow Matching + Action Chunking
    • ์—ฐ์†์ ์ธ ํ–‰๋™ ๋ถ„ํฌ๋ฅผ ๋ชจ๋ธ๋งํ•˜๊ณ , ๋ฏธ๋ž˜์˜ ์—ฌ๋Ÿฌ action์„ chunk ๋‹จ์œ„๋กœ ์ƒ์„ฑํ•˜์—ฌ ์ •๊ตํ•˜๊ณ  ๊ณ ์ฃผํŒŒ์ˆ˜์ธ ๋กœ๋ด‡ ์ œ์–ด๋ฅผ ์ˆ˜ํ–‰
  3. Pre-training๊ณผ Post-training์˜ ์—ญํ•  ๋ถ„๋ฆฌ
    • Pre-training์—์„œ๋Š” ๋‹ค์–‘ํ•œ ๋กœ๋ด‡๊ณผ ์ž‘์—… ๋ฐ์ดํ„ฐ๋ฅผ ํ™œ์šฉํ•ด ๋ฒ”์šฉ์ ์ธ physical skill์„ ํ•™์Šต
    • Post-training์—์„œ๋Š” ํŠน์ • ์ž‘์—…์— ์ ํ•ฉํ•œ ๊ณ ํ’ˆ์งˆ ๋ฐ์ดํ„ฐ๋ฅผ ํ™œ์šฉํ•ด ์ˆ™๋ จ๋„์™€ ์ •๋ฐ€์„ฑ์„ ๊ฐ•ํ™”

๊ฒฐ๊ณผ

π0๋Š” Zero-shot ์„ฑ๋Šฅ, โ€‹์–ธ์–ด ๋ช…๋ น ์ถ”์ข…, โ€‹๋นจ๋ž˜ ์ ‘๊ธฐ์™€ ๊ฐ™์€ ๋ณต์žกํ•œ ๋‹ค๋‹จ๊ณ„ ์กฐ์ž‘ ์ž‘์—…์—์„œ ๊ธฐ์กด ๋ชจ๋ธ๋ณด๋‹ค ๋†’์€ ์„ฑ๋Šฅ์„ ๋ณด์ด๋ฉฐ, ๋ฒ”์šฉ ๋กœ๋ด‡ ํŒŒ์šด๋ฐ์ด์…˜ ๋ชจ๋ธ์˜ ๊ฐ€๋Šฅ์„ฑ์„ ๋ณด์—ฌ์ค€๋‹ค.


1. π0๊ฐ€ ํ•ด๊ฒฐํ•˜๋ ค๋Š” ๋ฌธ์ œ

๋กœ๋ด‡ ์ •์ฑ…์„ ๋ฒ”์šฉ์ ์œผ๋กœ ํ™•์žฅํ•˜๋ ค๋ฉด ํฌ๊ฒŒ ์„ธ ๊ฐ€์ง€ ๋ฌธ์ œ๊ฐ€ ์žˆ๋‹ค.

1.1 ๋ฐ์ดํ„ฐ ๊ทœ๋ชจ์™€ ๋‹ค์–‘์„ฑ

๋กœ๋ด‡ ๋ฐ์ดํ„ฐ๋Š” ์ธํ„ฐ๋„ท ์ด๋ฏธ์ง€·ํ…์ŠคํŠธ ๋ฐ์ดํ„ฐ๋ณด๋‹ค ์ˆ˜์ง‘ ๋น„์šฉ์ด ๋†’๊ณ  ๊ทœ๋ชจ๊ฐ€ ์ž‘๋‹ค. ๋˜ํ•œ ํŠน์ • task์™€ embodiment์— ์น˜์šฐ์นœ ๋ฐ์ดํ„ฐ๋งŒ์œผ๋กœ๋Š” ์ƒˆ๋กœ์šด ํ™˜๊ฒฝ๊ณผ ๋กœ๋ด‡์œผ๋กœ ์ผ๋ฐ˜ํ™”ํ•˜๊ธฐ ์–ด๋ ต๋‹ค.

1.2 ์‹œ๊ฐ·์–ธ์–ด ์ดํ•ด์™€ ๋กœ๋ด‡ ์ œ์–ด์˜ ์—ฐ๊ฒฐ

VLM์€ ์ด๋ฏธ์ง€์™€ ์–ธ์–ด๋ฅผ ์ดํ•ดํ•˜๋Š” ๋ฐ ๊ฐ•ํ•˜์ง€๋งŒ, ๋กœ๋ด‡ ์ œ์–ด์— ํ•„์š”ํ•œ ์—ฐ์†์ ์ธ ์ €์ˆ˜์ค€ action์„ ์ง์ ‘ ์ƒ์„ฑํ•˜๋„๋ก ์„ค๊ณ„๋œ ๋ชจ๋ธ์€ ์•„๋‹ˆ๋‹ค.

๋”ฐ๋ผ์„œ VLM์˜ semantic knowledge๋ฅผ ์œ ์ง€ํ•˜๋ฉด์„œ ์‹ค์ œ ๋กœ๋ด‡ ์ œ์–ด๋กœ ์—ฐ๊ฒฐํ•  ์ˆ˜ ์žˆ๋Š” ๊ตฌ์กฐ๊ฐ€ ํ•„์š”ํ•˜๋‹ค.

1.3 ๋ฒ”์šฉ์„ฑ๊ณผ ์ˆ™๋ จ๋„์˜ ๊ท ํ˜•

๋‹ค์–‘ํ•œ ์ž‘์—…์„ ํญ๋„“๊ฒŒ ํ•™์Šตํ•˜๋ฉด ์ผ๋ฐ˜ํ™”์—๋Š” ์œ ๋ฆฌํ•˜์ง€๋งŒ, ํŠน์ • ์ž‘์—…์—์„œ ๋†’์€ ์ˆ™๋ จ๋„๋ฅผ ์–ป๊ธฐ ์–ด๋ ต๋‹ค. ๋ฐ˜๋Œ€๋กœ ํŠน์ • task ๋ฐ์ดํ„ฐ๋งŒ ์ง‘์ค‘์ ์œผ๋กœ ํ•™์Šตํ•˜๋ฉด ์ˆ™๋ จ๋„๋Š” ๋†’์•„์งˆ ์ˆ˜ ์žˆ์ง€๋งŒ ๋ฒ”์šฉ์„ฑ์ด ๋–จ์–ด์ง„๋‹ค.

π0๋Š” ์ด๋ฅผ Pre-training๊ณผ Post-training์˜ ์—ญํ• ์„ ๋ถ„๋ฆฌํ•˜๋Š” ๋ฐฉ์‹์œผ๋กœ ํ•ด๊ฒฐํ•œ๋‹ค.

 


2. π0 ์˜ ํ•ต์‹ฌ ์•„์ด๋””์–ด

π0์˜ ํ•ต์‹ฌ์€ ํฌ๊ฒŒ ๋‘ ๊ฐ€์ง€๋‹ค.

  1. ์‚ฌ์ „ํ•™์Šต๋œ VLM์— Action Expert๋ฅผ ๊ฒฐํ•ฉํ•ด ๋กœ๋ด‡ ์ œ์–ด ๋Šฅ๋ ฅ์„ ์ถ”๊ฐ€ํ•œ๋‹ค.
  2. Flow Matching์„ ์‚ฌ์šฉํ•ด ์—ฐ์†์ ์ธ Action Chunk๋ฅผ ์ƒ์„ฑํ•œ๋‹ค.

2.1 VLM๊ณผ Action Expert์˜ ๊ฒฐํ•ฉ

π0๋Š” ์‚ฌ์ „ํ•™์Šต๋œ VLM์„ ๊ทธ๋Œ€๋กœ ๋กœ๋ด‡ ์ •์ฑ…์œผ๋กœ ์‚ฌ์šฉํ•˜๋Š” ๋Œ€์‹ , ๋กœ๋ด‡ ์ œ์–ด์— ํŠนํ™”๋œ Action Expert๋ฅผ ์ถ”๊ฐ€ํ•œ๋‹ค.

VLM์€ ๋‹ค์Œ ์—ญํ• ์„ ๋‹ด๋‹นํ•œ๋‹ค.

  • ์ด๋ฏธ์ง€ ์† ๊ฐ์ฒด์™€ ์žฅ๋ฉด์„ ์ดํ•ดํ•œ๋‹ค.
  • ์–ธ์–ด ๋ช…๋ น์˜ ์˜๋ฏธ๋ฅผ ํ•ด์„ํ•œ๋‹ค.
  • ๋Œ€๊ทœ๋ชจ ์‹œ๊ฐ·์–ธ์–ด ์‚ฌ์ „ํ•™์Šต์—์„œ ์–ป์€ semantic knowledge๋ฅผ ์ œ๊ณตํ•œ๋‹ค.

Action Expert๋Š” ๋‹ค์Œ ์ •๋ณด๋ฅผ ์ฒ˜๋ฆฌํ•œ๋‹ค.

  • robot state
  • noisy action chunk
  • flow timestep
  • VLM์—์„œ ์ „๋‹ฌ๋œ image-language context

์—ญํ• ์„ ๋‹จ์ˆœํ™”ํ•˜๋ฉด ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

VLM์€ ํ˜„์žฌ ์ƒํ™ฉ๊ณผ ๋ช…๋ น์„ ์ดํ•ดํ•˜๊ณ , Action Expert๋Š” ์ด๋ฅผ ์‹ค์ œ ๋กœ๋ด‡ action์œผ๋กœ ๋ณ€ํ™˜ํ•œ๋‹ค.

์ด ๊ตฌ์กฐ๋ฅผ ํ†ตํ•ด π0๋Š” VLM์˜ ์ผ๋ฐ˜์ ์ธ ์‹œ๊ฐ·์–ธ์–ด ์ง€์‹์„ ์œ ์ง€ํ•˜๋ฉด์„œ, ๋กœ๋ด‡ ์ œ์–ด์— ํ•„์š”ํ•œ ์—ฐ์†์ ์ด๊ณ  ์ •๋ฐ€ํ•œ ํ–‰๋™์„ ๋ณ„๋„๋กœ ํ•™์Šตํ•  ์ˆ˜ ์žˆ๋‹ค.


2.2 Flow Matching ๊ธฐ๋ฐ˜ Action Chunk ์ƒ์„ฑ

π0๋Š” action์„ discrete token์œผ๋กœ ํ•˜๋‚˜์”ฉ ์˜ˆ์ธกํ•˜์ง€ ์•Š๋Š”๋‹ค. ๋Œ€์‹  ๋žœ๋คํ•œ action noise์—์„œ ์‹œ์ž‘ํ•ด ์‹ค์ œ action ๋ฐฉํ–ฅ์œผ๋กœ ์ด๋™ํ•˜๋Š” vector field๋ฅผ ํ•™์Šตํ•˜๊ณ , ์ด๋ฅผ ์ ๋ถ„ํ•ด ์ตœ์ข… Action Chunk๋ฅผ ์ƒ์„ฑํ•œ๋‹ค.

ํ•ต์‹ฌ ์ง๊ด€์€ ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

ํ˜„์žฌ noisy action์—์„œ ์–ด๋А ๋ฐฉํ–ฅ์œผ๋กœ ์›€์ง์—ฌ์•ผ ์‹ค์ œ action์— ๊ฐ€๊นŒ์›Œ์ง€๋Š”์ง€๋ฅผ ํ•™์Šตํ•œ๋‹ค.

Random Action Noise
        ↓
Velocity ์˜ˆ์ธก
        ↓
Action ์—…๋ฐ์ดํŠธ
        ↓
Velocity ์˜ˆ์ธก
        ↓
...
        ↓
Continuous Action Chunk

π0๋Š” ์ถ”๋ก  ์‹œ ์—ฌ๋Ÿฌ ๋ฒˆ์˜ integration step์„ ๊ฑฐ์ณ 50-step continuous action chunk๋ฅผ ์ƒ์„ฑํ•œ๋‹ค.


3. Flow Matching์€ ์–ด๋–ป๊ฒŒ ํ•™์Šต๋˜๋Š”๊ฐ€?

3.1 Noisy Action ์ƒ์„ฑ

์‹ค์ œ action chunk๋ฅผ \(A_t\), Gaussian noise๋ฅผ \(\epsilon\)์ด๋ผ๊ณ  ํ•˜๋ฉด ์ค‘๊ฐ„ ์ƒํƒœ๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™์ด ์ •์˜ํ•œ๋‹ค.

$$A_t^{\tau} = \tau A_t + (1-\tau)\epsilon$$

์—ฌ๊ธฐ์„œ

 

  • \(A_t\): ์‹ค์ œ robot action chunk
  • \(\epsilon \sim \mathcal{N}(0,I)\): Gaussian noise
  • \(\tau \in [0,1]\): Flow Matching์˜ ์‹œ๊ฐ„
  • \(A_t^\tau\): noise์™€ ์‹ค์ œ action ์‚ฌ์ด์˜ ์ค‘๊ฐ„ ์ƒํƒœ

\(\tau=0\)์—์„œ๋Š” noise์— ๊ฐ€๊น๊ณ , \(\tau=1\)์—์„œ๋Š” ์‹ค์ œ action์— ๋„๋‹ฌํ•œ๋‹ค.


3.2 Target Vector Field

์œ„ ๊ฒฝ๋กœ๋ฅผ \(\tau\)์— ๋Œ€ํ•ด ๋ฏธ๋ถ„ํ•˜๋ฉด

$$\frac{dA_t^{\tau}}{d\tau} = A_t-\epsilon$$

 

๋”ฐ๋ผ์„œ ๋ชจ๋ธ์ด ๋งž์ถฐ์•ผ ํ•˜๋Š” target vector field๋Š”

$$u(A_t^{\tau} \mid A_t) = A_t-\epsilon$$

 

์ฆ‰ ๋ชจ๋ธ์€ ํ˜„์žฌ noisy action์—์„œ ์‹ค์ œ action ์ชฝ์œผ๋กœ ์ด๋™ํ•ด์•ผ ํ•˜๋Š” ๋ฐฉํ–ฅ๊ณผ ์†๋„๋ฅผ ํ•™์Šตํ•œ๋‹ค.


3.3 ๋ชจ๋ธ ์˜ˆ์ธก

๋ชจ๋ธ์€ ํ˜„์žฌ noisy action๊ณผ observation์„ ์ž…๋ ฅ๋ฐ›์•„ vector field๋ฅผ ์˜ˆ์ธกํ•œ๋‹ค.

$$v_{\theta}(A_t^{\tau}, o_t)$$

์—ฌ๊ธฐ์„œ \(o_t\)์—๋Š” ๋‹ค์Œ ์ •๋ณด๊ฐ€ ํฌํ•จ๋œ๋‹ค.

 

  • ์—ฌ๋Ÿฌ ์นด๋ฉ”๋ผ์˜ RGB ์ด๋ฏธ์ง€
  • ์–ธ์–ด ๋ช…๋ น
  • robot state

3.4 Loss

ํ•™์Šต์˜ ํ•ต์‹ฌ์€ ์˜ˆ์ธก vector field์™€ target vector field ์‚ฌ์ด์˜ ์ฐจ์ด๋ฅผ ์ตœ์†Œํ™”ํ•˜๋Š” ๊ฒƒ์ด๋‹ค.

$$\mathcal{L}^{\tau}(\theta) = \mathbb{E}{p(A_t \mid o_t), q(A_t^\tau \mid A_t)} \left[\left|v\theta(A_t^\tau,o_t)-u(A_t^\tau \mid A_t)\right|_2^2\right]$$

 

์—ฌ๊ธฐ์„œ ๊ฐ notation์˜ ์˜๋ฏธ๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

 

  • \(\mathcal{L}^{\tau}(\theta)\): ํƒ€์ž„์Šคํ… \(\tau\)์—์„œ์˜ Flow Matching loss
  • \(\theta\): ๋ชจ๋ธ์˜ ํ•™์Šต ํŒŒ๋ผ๋ฏธํ„ฐ
  • \(\mathbb{E}\): ํ•™์Šต ๋ฐ์ดํ„ฐ์™€ noisy action ์ƒ˜ํ”Œ์— ๋Œ€ํ•œ ๊ธฐ๋Œ€๊ฐ’
  • \(p(A_t \mid o_t)\): observation \(o_t\)๊ฐ€ ์ฃผ์–ด์กŒ์„ ๋•Œ ์‹ค์ œ action chunk \(A_t\)์˜ ๋ฐ์ดํ„ฐ ๋ถ„ํฌ
  • \(q(A_t^\tau \mid A_t)\): ์‹ค์ œ action \(A_t\)๋กœ๋ถ€ํ„ฐ ์ค‘๊ฐ„ noisy action \(A_t^\tau\)๋ฅผ ์ƒ์„ฑํ•˜๋Š” ํ™•๋ฅ  ๊ฒฝ๋กœ
  • \(A_t\): ์‹ค์ œ robot action chunk
  • \(A_t^\tau\): Flow Matching์˜ ํƒ€์ž„์Šคํ… \(\tau\)์—์„œ ์ƒ์„ฑ๋œ noisy action
  • \(o_t\): ํ˜„์žฌ observation
  • \(v_\theta(A_t^\tau,o_t)\): ๋ชจ๋ธ์ด ์˜ˆ์ธกํ•œ vector field
  • \(u(A_t^\tau \mid A_t)\): ๋ชจ๋ธ์ด ๋งž์ถฐ์•ผ ํ•˜๋Š” target vector field
  • \(|\cdot|_2^2\): ์˜ˆ์ธก vector field์™€ target vector field ์‚ฌ์ด์˜ squared L2 distance

์ฆ‰ ๋ชจ๋ธ์€ ๋‹ค์–‘ํ•œ noisy action ์ƒํƒœ์—์„œ ์‹ค์ œ action์œผ๋กœ ์ด๋™ํ•˜๋Š” ์˜ฌ๋ฐ”๋ฅธ ๋ฐฉํ–ฅ์„ ํ•™์Šตํ•œ๋‹ค.


3.5 Inference

์ถ”๋ก  ์‹œ์—๋Š” ์ •๋‹ต action์ด ์—†๊ธฐ ๋•Œ๋ฌธ์— random action noise์—์„œ ์‹œ์ž‘ํ•œ๋‹ค.

$$A_t^0 = \epsilon$$

๋ชจ๋ธ์ด velocity๋ฅผ ์˜ˆ์ธกํ•œ ๋’ค,

$$v_{\theta}(A_t^\tau,o_t)$$

๋‹ค์Œ๊ณผ ๊ฐ™์ด action์„ ์—…๋ฐ์ดํŠธํ•œ๋‹ค.

$$A_t^{\tau+\delta} = A_t^\tau + \delta v_{\theta}(A_t^\tau,o_t)$$

์ด ๊ณผ์ •์„ ๋ฐ˜๋ณตํ•ด ์ตœ์ข… Action Chunk๋ฅผ ์ƒ์„ฑํ•œ๋‹ค.


4. π0 ๋ชจ๋ธ ๊ตฌ์กฐ

π0์˜ ์ „์ฒด ๊ตฌ์กฐ๋Š” ํฌ๊ฒŒ Pretrained VLM + Action Expert๋กœ ๋ณผ ์ˆ˜ ์žˆ๋‹ค.

4.1 ์ž…๋ ฅ๊ณผ ์ถœ๋ ฅ

์ž…๋ ฅ

๊ด€์ธก๊ฐ’ \(o_t\)๋Š” ๋‹ค์Œ ์ •๋ณด๋ฅผ ํฌํ•จํ•œ๋‹ค.

 

  • ๋‹ค์ค‘ RGB ์ด๋ฏธ์ง€ \(I_i^t\)
  • ์–ธ์–ด ๋ช…๋ น \(l_t\)
  • ๋กœ๋ด‡ ์ƒํƒœ \(q_t\)
  • Noisy Action Chunk \(A_t^\tau\)

์ถœ๋ ฅ

π0๋Š” ๋ฏธ๋ž˜์˜ ํ–‰๋™ ํ•˜๋‚˜๊ฐ€ ์•„๋‹ˆ๋ผ Action Chunk๋ฅผ ์ถœ๋ ฅํ•œ๋‹ค.

\(A_t = [a_t, a_{t+1}, \dots, a_{t+H-1}]\)

๋…ผ๋ฌธ์—์„œ๋Š” \(H=50\)์œผ๋กœ ์„ค์ •ํ•œ๋‹ค.

๊ฐ \(a_{t'}\)๋Š” discrete token์ด ์•„๋‹ˆ๋ผ ์—ฐ์†์ ์ธ robot action vector์ด๋‹ค.


 

4.2 PaliGemma VLM

π0๋Š” ์•ฝ 30์–ต ํŒŒ๋ผ๋ฏธํ„ฐ ๊ทœ๋ชจ์˜ PaliGemma๋ฅผ VLM backbone์œผ๋กœ ์‚ฌ์šฉํ•œ๋‹ค.

PaliGemma๋Š” ์‚ฌ์ „ํ•™์Šต์„ ํ†ตํ•ด ์ด๋ฏธ์ง€์™€ ์–ธ์–ด์— ๋Œ€ํ•œ ํญ๋„“์€ semantic knowledge๋ฅผ ๊ฐ€์ง€๊ณ  ์žˆ์œผ๋ฉฐ, π0๋Š” ์ด ํ‘œํ˜„์„ ๋กœ๋ด‡ ์ œ์–ด์— ํ™œ์šฉํ•œ๋‹ค.


4.3 Action Expert

Action Expert๋Š” ์•ฝ 300M ๊ทœ๋ชจ์˜ Transformer ๊ธฐ๋ฐ˜ ๋ชจ๋“ˆ๋กœ ๋‹ค์Œ ์ •๋ณด๋ฅผ ์ด์šฉํ•œ๋‹ค.

 

  • VLM์˜ image-language context
  • current robot state
  • noisy action chunk
  • flow timestep \tau

์ด๋ฅผ ๋ฐ”ํƒ•์œผ๋กœ ๋‹ค์Œ velocity๋ฅผ ์˜ˆ์ธกํ•œ๋‹ค.

 $$v_{\theta}(A_t^\tau,o_t)$$

๊ตฌ์กฐ๋ฅผ ๋‹จ์ˆœํ™”ํ•˜๋ฉด ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

VLM Context
    +
Robot State
    +
Noisy Action
    +
Flow Timestep
        ↓
Action Expert
        ↓
Action Velocity

4.4 VLM๊ณผ Action Expert์˜ ์ •๋ณด ๊ฒฐํ•ฉ

(VLM๊ณผ Action Expert๋Š” ์™„์ „ํžˆ ๋ถ„๋ฆฌ๋œ ๋‘ ๋„คํŠธ์›Œํฌ๊ฐ€ ์•„๋‹ˆ๋‹ค.(MOE ๊ตฌ์กฐ)

π0๋Š” ํ•˜๋‚˜์˜ Transformer ์•ˆ์—์„œ ํ† ํฐ ์ข…๋ฅ˜์— ๋”ฐ๋ผ ์„œ๋กœ ๋‹ค๋ฅธ expert weight๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค.

  • VLM Expert
    • image token
    • language token
  • Action Expert
    • robot state token
    • action token

FFN์—์„œ๋Š” ํ† ํฐ ์ข…๋ฅ˜์— ๋”ฐ๋ผ ์„œ๋กœ ๋‹ค๋ฅธ expert weight๋ฅผ ์‚ฌ์šฉํ•˜์ง€๋งŒ, Self-Attention์„ ํ†ตํ•ด image-language context์™€ action ์ •๋ณด๊ฐ€ ๊ฒฐํ•ฉ๋œ๋‹ค.

๋”ฐ๋ผ์„œ action token์€ ์ด๋ฏธ์ง€์™€ ์–ธ์–ด์—์„œ ์–ป์€ ์ •๋ณด๋ฅผ ์ฐธ์กฐํ•ด ํ˜„์žฌ ์ƒํ™ฉ๊ณผ ๋ช…๋ น์— ๋งž๋Š” ํ–‰๋™์„ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ๋‹ค.

์ด ๊ตฌ์กฐ์˜ ์žฅ์ ์€ ๋‘ ๊ฐ€์ง€๋‹ค.

  • ์ „๋ฌธํ™”
    • VLM์˜ ์ผ๋ฐ˜ ์ง€์‹์€ ์œ ์ง€ํ•˜๋ฉด์„œ ๋กœ๋ด‡ ์ œ์–ด์— ํŠนํ™”๋œ ๊ฐ€์ค‘์น˜๋ฅผ ๋ณ„๋„๋กœ ํ•™์Šตํ•  ์ˆ˜ ์žˆ๋‹ค.
  • ์ถ”๋ก  ํšจ์œจ
    • Flow Matching ๊ณผ์ •์—์„œ action-related computation์€ ์—ฌ๋Ÿฌ ๋ฒˆ ๋ฐ˜๋ณต๋˜๋ฏ€๋กœ, ์ „์ฒด VLM๋ณด๋‹ค ์ž‘์€ Action Expert๋ฅผ ์‚ฌ์šฉํ•ด ๋ฐ˜๋ณต ๊ณ„์‚ฐ ๋น„์šฉ์„ ์ค„์ผ ์ˆ˜ ์žˆ๋‹ค.

5. ๋ฐ์ดํ„ฐ ๊ตฌ์„ฑ๊ณผ ํ•™์Šต ์ „๋žต

π0์˜ ์ค‘์š”ํ•œ ํŠน์ง• ์ค‘ ํ•˜๋‚˜๋Š” Pre-training๊ณผ Post-training์˜ ์—ญํ• ์„ ๋ช…ํ™•ํ•˜๊ฒŒ ๊ตฌ๋ถ„ํ•œ๋‹ค๋Š” ์ ์ด๋‹ค.

ํ•ต์‹ฌ์€ ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

Pre-training์€ ๋ฒ”์šฉ์„ฑ์„ ํ™•๋ณดํ•˜๊ณ , Post-training์€ ํŠน์ • task์˜ ์ˆ™๋ จ๋„๋ฅผ ๊ฐ•ํ™”ํ•œ๋‹ค.

 

5.1 Pre-training: ๋ฒ”์šฉ์ ์ธ Physical Skill ํ™•๋ณด

Pre-training์˜ ๋ชฉํ‘œ๋Š” ๋‹ค์–‘ํ•œ ๋กœ๋ด‡๊ณผ ์ž‘์—…์„ ๊ฒฝํ—˜ํ•˜๊ฒŒ ํ•ด ์žฌ์‚ฌ์šฉ ๊ฐ€๋Šฅํ•œ ์ผ๋ฐ˜์ ์ธ physical skill์„ ํ•™์Šตํ•˜๋Š” ๊ฒƒ์ด๋‹ค.

์ด๋ฅผ ์œ„ํ•ด ๋‹ค์Œ๊ณผ ๊ฐ™์€ ๋‹ค์–‘์„ฑ์„ ํ™•๋ณดํ•œ๋‹ค.

  • ๋‹ค์–‘ํ•œ robot embodiment
  • ๋‹ค์–‘ํ•œ task
  • ๋‹ค์–‘ํ•œ object์™€ environment
  • ๊ฐ task ์•ˆ์—์„œ ๋‹ค์–‘ํ•œ ํ–‰๋™ ํŒจํ„ด

π0๋Š” Open X-Embodiment(OXE)๋ฅผ ํฌํ•จํ•œ ๋Œ€๊ทœ๋ชจ ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ๋ฅผ ์‚ฌ์šฉํ•˜๋ฉฐ, ์ „์ฒด ์‚ฌ์ „ํ•™์Šต ๋ฐ์ดํ„ฐ ๊ทœ๋ชจ๋Š” 10,000์‹œ๊ฐ„ ์ด์ƒ์ด๋‹ค.


5.2 Post-training: ํŠน์ • Task์˜ ์ˆ™๋ จ๋„ ๊ฐ•ํ™”

Post-training์—์„œ๋Š” ๋ฒ”์šฉ์„ฑ์„ ๋„“ํžˆ๋Š” ๊ฒƒ๋ณด๋‹ค ํŠน์ • task๋ฅผ ์•ˆ์ •์ ์ด๊ณ  ๋Šฅ์ˆ™ํ•˜๊ฒŒ ์ˆ˜ํ–‰ํ•˜๋Š” ๊ฒƒ์— ์ดˆ์ ์„ ๋‘”๋‹ค.

๋”ฐ๋ผ์„œ ๋‹ค์Œ๊ณผ ๊ฐ™์€ ๋ฐ์ดํ„ฐ๊ฐ€ ์ค‘์š”ํ•˜๋‹ค.

  • ์ผ๊ด€๋œ ์‹คํ–‰ ์ „๋žต์„ ํฌํ•จํ•œ ๋ฐ์ดํ„ฐ
  • ํšจ๊ณผ์ ์ธ task completion์— ๋„์›€์ด ๋˜๋Š” ํ–‰๋™
  • ์ •๋ฐ€ ์กฐ์ž‘๊ณผ ๊ธด horizon์„ ํฌํ•จํ•œ ๊ณ ํ’ˆ์งˆ ๋ฐ์ดํ„ฐ

์ฆ‰ Pre-training์—์„œ ์–ป์€ ๋ฒ”์šฉ์ ์ธ ๋Šฅ๋ ฅ์„ ๊ธฐ๋ฐ˜์œผ๋กœ, Post-training์—์„œ task-specific dexterity๋ฅผ ๊ฐ•ํ™”ํ•œ๋‹ค.


5.3 ๋ฐ์ดํ„ฐ ํ๋ ˆ์ด์…˜ ์ „๋žต

π0๋Š” ๋‹จ์ˆœํžˆ ๋ชจ๋“  ๋ฐ์ดํ„ฐ๋ฅผ ๋™์ผํ•œ ๋น„์œจ๋กœ ์„ž์ง€ ์•Š๋Š”๋‹ค.

OXE Magic Soup

Open X-Embodiment ๋ฐ์ดํ„ฐ ๊ฐ€์šด๋ฐ ํ•™์Šต์— ์œ ์šฉํ•œ ๋ฐ์ดํ„ฐ์…‹์„ ์„ ๋ณ„ํ•˜๊ณ , ์ ์ ˆํ•œ ๋น„์œจ๋กœ ํ˜ผํ•ฉํ•œ๋‹ค.

Weighting

๋ฐ์ดํ„ฐ์…‹์˜ ๊ทœ๋ชจ๊ฐ€ ์„œ๋กœ ๋‹ค๋ฅด๊ธฐ ๋•Œ๋ฌธ์— ๋‹จ์ˆœ ์ƒ˜ํ”Œ๋ง์„ ์‚ฌ์šฉํ•˜๋ฉด ํŠน์ • ๋Œ€๊ทœ๋ชจ ๋ฐ์ดํ„ฐ๊ฐ€ ํ•™์Šต์„ ์ง€๋ฐฐํ•  ์ˆ˜ ์žˆ๋‹ค. ์ด๋ฅผ ๋ฐฉ์ง€ํ•˜๊ธฐ ์œ„ํ•ด ๋ฐ์ดํ„ฐ์…‹๋ณ„ sampling weight๋ฅผ ์กฐ์ ˆํ•œ๋‹ค.

Task ๊ตฌ์„ฑ

๋‹จ์ˆœํ•œ ๊ฐœ๋ณ„ ๋™์ž‘๋งŒ ํ•™์Šตํ•˜๋Š” ๊ฒƒ์ด ์•„๋‹ˆ๋ผ, ํ…Œ์ด๋ธ” ์ •๋ฆฌ์ฒ˜๋Ÿผ ์—ฌ๋Ÿฌ ํ–‰๋™์ด ์—ฐ๊ฒฐ๋˜๋Š” ๋ณต์žกํ•œ ํ–‰๋™ sequence๋„ ํ•™์Šต์— ํฌํ•จํ•œ๋‹ค.

๊ฒฐ๊ตญ π0์˜ ๋ฐ์ดํ„ฐ ์ „๋žต์€

๋‹ค์–‘ํ•œ ๋ฐ์ดํ„ฐ๋ฅผ ๋งŽ์ด ๋ชจ์œผ๋Š” ๊ฒƒ๋ณด๋‹ค, ์–ด๋–ค ๋ฐ์ดํ„ฐ๋ฅผ ์–ด๋–ค ๋น„์œจ๋กœ Pre-training๊ณผ Post-training์— ๋ฐฐ์น˜ํ•  ๊ฒƒ์ธ๊ฐ€

์— ์ดˆ์ ์„ ๋‘”๋‹ค.


6. ์‹คํ—˜ ๊ฒฐ๊ณผ

π0์˜ ์‹คํ—˜์€ ํฌ๊ฒŒ ๋„ค ๊ฐ€์ง€ ์งˆ๋ฌธ์„ ๊ฒ€์ฆํ•œ๋‹ค.

  1. ๋Œ€๊ทœ๋ชจ Pre-training์ด Zero-shot Generalization์— ๋„์›€์ด ๋˜๋Š”๊ฐ€?
  2. VLM์˜ ์–ธ์–ด ์ดํ•ด ๋Šฅ๋ ฅ์ด ์‹ค์ œ ๋กœ๋ด‡์˜ Language Following ์„ฑ๋Šฅ์œผ๋กœ ์ด์–ด์ง€๋Š”๊ฐ€?
  3. Pre-training์ด ์ƒˆ๋กœ์šด task์— ๋Œ€ํ•œ Fine-tuning๊ณผ Transfer๋ฅผ ๊ฐœ์„ ํ•˜๋Š”๊ฐ€?
  4. π0๊ฐ€ ๊ธด horizon๊ณผ ๋†’์€ ์ •๋ฐ€๋„๋ฅผ ์š”๊ตฌํ•˜๋Š” ๋ณต์žกํ•œ ๋‹ค๋‹จ๊ณ„ ์กฐ์ž‘ ์ž‘์—…๊นŒ์ง€ ์ˆ˜ํ–‰ํ•  ์ˆ˜ ์žˆ๋Š”๊ฐ€?

6.1 Zero-shot Generalization

๋ชฉ์ 

๋Œ€๊ทœ๋ชจ ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ๋กœ Pre-training๋œ π0๊ฐ€ ๋ณ„๋„์˜ Post-training ์—†์ด ๋‹ค์–‘ํ•œ ์ž‘์—…์„ ์–ผ๋งˆ๋‚˜ ์ž˜ ์ˆ˜ํ–‰ํ•˜๋Š”์ง€ ํ‰๊ฐ€ํ•œ๋‹ค.
์ฆ‰, Pre-training๋งŒ์œผ๋กœ ์–ด๋А ์ •๋„์˜ ๋ฒ”์šฉ์ ์ธ robot skill์„ ํ™•๋ณดํ•  ์ˆ˜ ์žˆ๋Š”์ง€๋ฅผ ํ™•์ธํ•˜๋Š” ์‹คํ—˜์ด๋‹ค.

ํ‰๊ฐ€ Task

Task  ์„ค๋ช…
Shirt Folding ์…”์ธ ๋ฅผ ํŽผ์น˜๊ณ  ์ ‘๋Š” ์ž‘์—…. ๋ณ€ํ˜•๋˜๋Š” ๋ฌผ์ฒด๋ฅผ ๋‹ค๋ค„์•ผ ํ•˜๋ฏ€๋กœ ์„ฌ์„ธํ•œ manipulation์ด ํ•„์š”ํ•จ
Bussing Easy / Hard ์‹๊ธฐ์™€ ์“ฐ๋ ˆ๊ธฐ๋ฅผ ๊ตฌ๋ถ„ํ•ด ๊ฐ๊ฐ ์˜ฌ๋ฐ”๋ฅธ ํ†ต์— ๋„ฃ๋Š” ๋‹ค๋‹จ๊ณ„ ์ž‘์—…. Hard ๋ฒ„์ „์€ ๋” ๋งŽ์€ ๋ฌผ์ฒด์™€ ๋ณต์žกํ•œ ๋ฐฐ์น˜๋ฅผ ํฌํ•จ
Grocery Bagging ๋‹ค์–‘ํ•œ ์‹๋ฃŒํ’ˆ์„ ์ธ์‹ํ•˜๊ณ  ๋ด‰ํˆฌ ์•ˆ์— ๋„ฃ๋Š” ์ž‘์—…
Toast Out of Toaster ํ† ์Šคํ„ฐ์—์„œ ํ† ์ŠคํŠธ๋ฅผ ๊บผ๋‚ด ์ ‘์‹œ์— ์˜ฌ๋ ค๋†“๋Š” ์ž‘์—…. ์ •ํ™•ํ•œ ํŒŒ์ง€์™€ ์œ„์น˜ ์ œ์–ด๊ฐ€ ํ•„์š”ํ•จ

๋น„๊ต ๋ชจ๋ธ

Model  ํŠน์ง•
OpenVLA ๊ธฐ์กด VLA baseline
Octo ๋ฒ”์šฉ ๋กœ๋ด‡ ์ •์ฑ… baseline
π0-small ์•ฝ 4์–ต 7์ฒœ๋งŒ ํŒŒ๋ผ๋ฏธํ„ฐ ๊ทœ๋ชจ, VLM ์‚ฌ์ „ํ•™์Šต์„ ์‚ฌ์šฉํ•˜์ง€ ์•Š์€ ์†Œํ˜• ๋ชจ๋ธ
π0 compute-parity baseline๊ณผ ์œ ์‚ฌํ•œ 160k training step์œผ๋กœ ํ•™์Šต
Full π0 700k step์œผ๋กœ ํ•™์Šตํ•œ ์ „์ฒด ๋ชจ๋ธ

์ฃผ์š” ๊ฒฐ๊ณผ

  • Full π0๊ฐ€ ๋ชจ๋“  Zero-shot task์—์„œ ๊ฐ€์žฅ ๋†’์€ ์„ฑ๋Šฅ์„ ๋ณด์˜€๋‹ค.
  • ํŠนํžˆ Shirt Folding๊ณผ Bussing Easy์—์„œ๋Š” ๋งค์šฐ ๋†’์€ ์„ฑ๊ณต๋ฅ ์„ ๊ธฐ๋กํ–ˆ๋‹ค.
  • ํ•™์Šต๋Ÿ‰์„ baseline๊ณผ ๋น„์Šทํ•˜๊ฒŒ ๋งž์ถ˜ π0 compute-parity ์—ญ์‹œ OpenVLA์™€ Octo๋ณด๋‹ค ๋†’์€ ์„ฑ๋Šฅ์„ ๋ณด์˜€๋‹ค.
  • π0์˜ ์„ฑ๋Šฅ ํ–ฅ์ƒ์€ ๋‹จ์ˆœํžˆ ๋” ๋งŽ์€ training step์„ ์‚ฌ์šฉํ•œ ๊ฒฐ๊ณผ๋งŒ์œผ๋กœ ์„ค๋ช…ํ•˜๊ธฐ ์–ด๋ ต๋‹ค.
    • ๋™์ผํ•œ ์ˆ˜์ค€์˜ compute์—์„œ๋„ π0๊ฐ€ baseline์„ ์•ž์„ฐ๋‹ค๋Š” ์ ์€ VLM ๊ธฐ๋ฐ˜ ํ‘œํ˜„, Action Expert, continuous action modeling์„ ๊ฒฐํ•ฉํ•œ π0์˜ ๊ตฌ์กฐ ์ž์ฒด๊ฐ€ ์„ฑ๋Šฅ์— ๊ธฐ์—ฌํ•œ๋‹ค๋Š” ์ ์„ ๋ณด์—ฌ์ค€๋‹ค.

6.2 Language Following

๋ชฉ์ 

π0๊ฐ€ ์–ธ์–ด ๋ช…๋ น์„ ์–ผ๋งˆ๋‚˜ ์ž˜ ์ดํ•ดํ•˜๊ณ  ์‹ค์ œ ํ–‰๋™์œผ๋กœ ์—ฐ๊ฒฐํ•˜๋Š”์ง€ ํ‰๊ฐ€ํ•œ๋‹ค.

ํŠนํžˆ ๋‹จ์ˆœํžˆ ์ „์ฒด task instruction๋งŒ ์ฃผ๋Š” ๊ฒฝ์šฐ์™€, ์ค‘๊ฐ„ ๋‹จ๊ณ„์˜ ์„ธ๋ถ€ ๋ช…๋ น์„ ์ถ”๊ฐ€๋กœ ์ œ๊ณตํ•˜๋Š” ๊ฒฝ์šฐ๋ฅผ ๋น„๊ตํ•ด VLM์˜ ์–ธ์–ด ์ดํ•ด ๋Šฅ๋ ฅ์ด ์‹ค์ œ robot performance์— ์˜ํ–ฅ์„ ์ฃผ๋Š”์ง€ ํ™•์ธํ•œ๋‹ค.

ํ‰๊ฐ€ Task

Task  ์„ค๋ช…
Bussing ๊ทธ๋ฆ‡๊ณผ ์‹๊ธฐ๋Š” ์‹๊ธฐํ†ต์—, ์“ฐ๋ ˆ๊ธฐ๋Š” ์“ฐ๋ ˆ๊ธฐํ†ต์— ๋„ฃ๋Š” ์ž‘์—…
Table Setting ํ†ต์—์„œ ํ•„์š”ํ•œ ๋ฌผ์ฒด๋ฅผ ๊บผ๋‚ด ์‹ํƒ์„ ์„ธํŒ…ํ•˜๊ณ , ์–ธ์–ด ์ง€์‹œ์— ๋”ฐ๋ผ ๋ฐฐ์น˜๋ฅผ ์กฐ์ •ํ•˜๋Š” ์ž‘์—…
Grocery Bagging ๋‹ค์–‘ํ•œ ์‹๋ฃŒํ’ˆ์„ ๋ด‰ํˆฌ์— ๋„ฃ๋Š” ์ž‘์—…์œผ๋กœ, ์ค‘๊ฐ„ ๋‹จ๊ณ„ ์–ธ์–ด ์ง€์‹œ์˜ ํšจ๊ณผ๋ฅผ ํ‰๊ฐ€

๋น„๊ต ๋ฐฉ์‹

Model  Setting ์„ค๋ช…
π0-flat / π0-small-flat ์ „์ฒด task instruction๋งŒ ์ œ๊ณต
π0-human / π0-small-human ์ธ๊ฐ„์ด ์ค‘๊ฐ„ ๋‹จ๊ณ„ instruction์„ ์ œ๊ณต
π0-HL High-level VLM policy๊ฐ€ ์ค‘๊ฐ„ ๋‹จ๊ณ„ instruction์„ ์ž๋™ ์ƒ์„ฑํ•ด π0์— ์ „๋‹ฌ

์ฃผ์š” ๊ฒฐ๊ณผ

  • π0๋Š” π0-small๋ณด๋‹ค ์ „๋ฐ˜์ ์œผ๋กœ ๋†’์€ Language Following ์„ฑ๋Šฅ์„ ๋ณด์˜€๋‹ค.
  • ์ธ๊ฐ„์ด ์ค‘๊ฐ„ instruction์„ ์ œ๊ณตํ–ˆ์„ ๋•Œ π0์˜ ์„ฑ๋Šฅ์ด ํฌ๊ฒŒ ํ–ฅ์ƒ๋๋‹ค.
  • High-level VLM์ด ์ƒ์„ฑํ•œ instruction์„ ์‚ฌ์šฉํ–ˆ์„ ๋•Œ๋„ ์„ฑ๋Šฅ ํ–ฅ์ƒ์ด ๋‚˜ํƒ€๋‚ฌ๋‹ค.
  • ๋ฐ˜๋ฉด π0-small์€ ์ค‘๊ฐ„ instruction์ด ์ถ”๊ฐ€๋˜์–ด๋„ ๊ฐœ์„  ํญ์ด ์ƒ๋Œ€์ ์œผ๋กœ ์ž‘์•˜๋‹ค.
  • VLM์˜ ์–ธ์–ด ์ดํ•ด ๋Šฅ๋ ฅ์ด ๋‹จ์ˆœํ•œ semantic representation์— ๋จธ๋ฌด๋ฅด์ง€ ์•Š๊ณ  ์‹ค์ œ robot action generation ์„ฑ๋Šฅ์œผ๋กœ ์—ฐ๊ฒฐ๋œ๋‹ค.
  • ํŠนํžˆ ๋ณต์žกํ•œ task๋ฅผ ์ž‘์€ ๋‹จ๊ณ„๋กœ ๋‚˜๋ˆ„์–ด ์–ธ์–ด๋กœ ์ œ์‹œํ–ˆ์„ ๋•Œ ์„ฑ๋Šฅ์ด ํ–ฅ์ƒ๋œ๋‹ค๋Š” ์ ์€, π0๊ฐ€ VLM์˜ ์–ธ์–ด ์ง€์‹์„ ์‹ค์ œ ์ œ์–ด์— ํšจ๊ณผ์ ์œผ๋กœ ํ™œ์šฉํ•˜๊ณ  ์žˆ์Œ์„ ๋ณด์—ฌ์ค€๋‹ค.

6.3 Fine-tuning & Transfer

๋ชฉ์ 

Pre-training ๋ฐ์ดํ„ฐ์— ํฌํ•จ๋˜์ง€ ์•Š์€ ์ƒˆ๋กœ์šด task์— π0๋ฅผ Fine-tuningํ–ˆ์„ ๋•Œ ์–ผ๋งˆ๋‚˜ ๋น ๋ฅด๊ฒŒ ์ ์‘ํ•˜๋Š”์ง€ ํ‰๊ฐ€ํ•œ๋‹ค.

ํŠนํžˆ Pre-training์—์„œ ํ•™์Šตํ•œ skill์ด ์ƒˆ๋กœ์šด task๋กœ ์–ผ๋งˆ๋‚˜ ์ž˜ transfer๋˜๋Š”์ง€, ๊ทธ๋ฆฌ๊ณ  ์ ์€ Fine-tuning ๋ฐ์ดํ„ฐ์—์„œ๋„ ํšจ๊ณผ๊ฐ€ ์žˆ๋Š”์ง€๋ฅผ ํ™•์ธํ•œ๋‹ค.

ํ‰๊ฐ€ Task

๊ตฌ๋ถ„  Task  ์„ค๋ช…
Easy Tier UR5e Stack Bowls ์—ฌ๋Ÿฌ ๊ฐœ์˜ ๊ทธ๋ฆ‡์„ ์ˆœ์„œ๋Œ€๋กœ ์Œ“๋Š” ์ž‘์—…
Easy Tier Towel Folding ์ˆ˜๊ฑด์„ ํŽผ์น˜๊ณ  ์ ‘๋Š” ์ž‘์—…
Unseen New Element Tupperware in Microwave ํ”Œ๋ผ์Šคํ‹ฑ ์šฉ๊ธฐ๋ฅผ ์ „์ž๋ ˆ์ธ์ง€ ์•ˆ์— ๋„ฃ๋Š” ์ž‘์—…. manipulation์€ ์œ ์‚ฌํ•˜์ง€๋งŒ ์ƒˆ๋กœ์šด ํ™˜๊ฒฝ ์š”์†Œ๊ฐ€ ๋“ฑ์žฅ
New Motions / Object Types Paper Towel Replacement ๊ธฐ์กด ํœด์ง€๋ฅผ ์ œ๊ฑฐํ•˜๊ณ  ์ƒˆ ํœด์ง€๋กœ ๊ต์ฒดํ•˜๋Š” ์ž‘์—…
New Motions / Object Types Franka Items in Drawer Franka ๋กœ๋ด‡์„ ์ด์šฉํ•ด ๋ฌผ์ฒด๋ฅผ ์„œ๋ž ์•ˆ์— ๋„ฃ๋Š” ์ž‘์—…

๋น„๊ต ๋ชจ๋ธ

Model  ํ•™์Šต ๋ฐฉ์‹
OpenVLA OXE Pre-training ํ›„ Fine-tuning
Octo OXE Pre-training ํ›„ Fine-tuning
ACT Target task ๋ฐ์ดํ„ฐ๋กœ scratch๋ถ€ํ„ฐ ํ•™์Šต
Diffusion Policy Target task ๋ฐ์ดํ„ฐ๋กœ scratch๋ถ€ํ„ฐ ํ•™์Šต
π0 Fine-tuned Pre-trained π0๋ฅผ ์ƒˆ๋กœ์šด task์— Fine-tuning
π0-scratch Pre-training ์—†์ด ํ•ด๋‹น task ๋ฐ์ดํ„ฐ๋งŒ์œผ๋กœ ํ•™์Šต

ํ‰๊ฐ€ ๋ฐฉ์‹

Fine-tuning์— ์‚ฌ์šฉํ•˜๋Š” ๋ฐ์ดํ„ฐ ์–‘์„ ๋ณ€ํ™”์‹œํ‚ค๋ฉฐ ์„ฑ๋Šฅ์„ ๋น„๊ตํ•œ๋‹ค.

์˜ˆ๋ฅผ ๋“ค์–ด

  • 1์‹œ๊ฐ„
  • 5์‹œ๊ฐ„
  • 25์‹œ๊ฐ„

๋“ฑ ์„œ๋กœ ๋‹ค๋ฅธ ๋ฐ์ดํ„ฐ ์–‘์—์„œ ๊ฐ ๋ชจ๋ธ์˜ ์„ฑ๋Šฅ ๋ณ€ํ™”๋ฅผ ์ธก์ •ํ•œ๋‹ค.

์ฃผ์š” ๊ฒฐ๊ณผ

  • π0 Fine-tuned๊ฐ€ ์ „๋ฐ˜์ ์œผ๋กœ ๋‹ค๋ฅธ ๋ฐฉ๋ฒ•๋ณด๋‹ค ๋†’์€ ์„ฑ๋Šฅ์„ ๋ณด์˜€๋‹ค.
  • ํŠนํžˆ ์ ์€ Fine-tuning ๋ฐ์ดํ„ฐ ์กฐ๊ฑด์—์„œ π0 Fine-tuned์™€ π0-scratch์˜ ์ฐจ์ด๊ฐ€ ํฌ๊ฒŒ ๋‚˜ํƒ€๋‚ฌ๋‹ค.
  • Pre-training์—์„œ ๊ฒฝํ—˜ํ•œ ํ–‰๋™๊ณผ ์œ ์‚ฌํ•œ task์ผ์ˆ˜๋ก transfer ํšจ๊ณผ๊ฐ€ ๋” ํฌ๊ฒŒ ๋‚˜ํƒ€๋‚ฌ๋‹ค.
  • ACT์™€ Diffusion Policy๋„ ์ผ๋ถ€ task์—์„œ ๋†’์€ ์„ฑ๋Šฅ์„ ๋ณด์˜€์ง€๋งŒ ์ „์ฒด์ ์œผ๋กœ π0๋ฅผ ๋„˜์ง€๋Š” ๋ชปํ–ˆ๋‹ค.
  • Pre-training์—์„œ ํ•™์Šตํ•œ ๋ฒ”์šฉ์ ์ธ physical skill์ด ์ƒˆ๋กœ์šด task์˜ ํ•™์Šต ํšจ์œจ์„ ๋†’์ธ๋‹ค.
    • ํŠนํžˆ ๋ฐ์ดํ„ฐ๊ฐ€ ์ ์„์ˆ˜๋ก Pre-training์˜ ์ด์ ์ด ํฌ๊ฒŒ ๋‚˜ํƒ€๋‚œ๋‹ค๋Š” ์ ์€, π0๊ฐ€ ํŠน์ • task์˜ ํ–‰๋™์„ ๋‹จ์ˆœํžˆ ์•”๊ธฐํ•œ ๊ฒƒ์ด ์•„๋‹ˆ๋ผ ๋‹ค๋ฅธ task์—์„œ๋„ ์žฌ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋Š” representation๊ณผ skill์„ ํ•™์Šตํ–ˆ์Œ์„ ๋ณด์—ฌ์ค€๋‹ค.

6.4 Complex Dexterous Manipulation

๋ชฉ์ 

π0๊ฐ€ ๋‹จ์ˆœํ•œ pick-and-place๋ฅผ ๋„˜์–ด, ์ˆ˜์‹ญ ๋ถ„ ๋™์•ˆ ์—ฌ๋Ÿฌ ํ–‰๋™์„ ์—ฐ์†์ ์œผ๋กœ ์ˆ˜ํ–‰ํ•ด์•ผ ํ•˜๋Š” ๋ณต์žกํ•˜๊ณ  ๊ธด horizon์˜ dexterous manipulation๊นŒ์ง€ ์ฒ˜๋ฆฌํ•  ์ˆ˜ ์žˆ๋Š”์ง€ ํ‰๊ฐ€ํ•œ๋‹ค.

์ด ์‹คํ—˜์—์„œ๋Š” ๊ฐ์ฒด ์ผ๋ฐ˜ํ™”, ์–‘ํŒ” ํ˜‘์‘, ์ •๋ฐ€ ํŒŒ์ง€, ํ–‰๋™ ์ˆœ์„œ ๊ฒฐ์ • ๋“ฑ ์—ฌ๋Ÿฌ ๋Šฅ๋ ฅ์ด ๋™์‹œ์— ์š”๊ตฌ๋œ๋‹ค.

ํ‰๊ฐ€ Task

Task  ์„ค๋ช…
Laundry Folding ์ดˆ๊ธฐ ์ƒํƒœ๊ฐ€ ๋งค๋ฒˆ ๋‹ค๋ฅธ ๋นจ๋ž˜๋ฅผ ํŽผ์น˜๊ณ  ์ ‘๋Š” ์ž‘์—…
Mobile Dryer ๋ชจ๋ฐ”์ผ ๋กœ๋ด‡์ด ๊ฑด์กฐ๊ธฐ์—์„œ ๋นจ๋ž˜๋ฅผ ๊บผ๋‚ด ๋ฐ”๊ตฌ๋‹ˆ์— ๋„ฃ๋Š” ์ž‘์—…
Table Bussing ๋‹ค์–‘ํ•œ ๋ฌผ์ฒด๊ฐ€ ๋†“์ธ ์‹ค์ œ ์‹ํƒ์„ ์ •๋ฆฌํ•˜๋Š” ์ž‘์—…
Box Building ๋‚ฉ์ž‘ํ•œ ํŒ์ง€ ์ƒ์ž๋ฅผ ์กฐ๋ฆฝํ•˜๋Š” ์ž‘์—…. ์–‘ํŒ” ํ˜‘์‘๊ณผ ๊ตฌ์กฐ ์ง€์ง€๊ฐ€ ํ•„์š”
To-go Box ์ ‘์‹œ์˜ ์Œ์‹์„ ํ…Œ์ดํฌ์•„์›ƒ ์šฉ๊ธฐ์— ์˜ฎ๊ธฐ๊ณ  ์ƒ์ž๋ฅผ ๋‹ซ๋Š” ์ž‘์—…
Packing Eggs ๋‹ฌ๊ฑ€์„ ์ง‘์–ด ๋‹ฌ๊ฑ€ํŒ์— ๋„ฃ๊ณ  ๋šœ๊ป‘์„ ๋‹ซ๋Š” ์ž‘์—…. ์ •๋ฐ€ ํŒŒ์ง€๊ฐ€ ํ•„์š”

๋น„๊ต ๋ฐฉ์‹

Model  ์„ค๋ช…
Full π0 Pre-training + Post-training์„ ๋ชจ๋‘ ์ˆ˜ํ–‰
π0 Zero-shot Pre-training๋งŒ ์ˆ˜ํ–‰
π0 Scratch Post-training์šฉ task ๋ฐ์ดํ„ฐ๋งŒ์œผ๋กœ ์ฒ˜์Œ๋ถ€ํ„ฐ ํ•™์Šต

์ฃผ์š” ๊ฒฐ๊ณผ

  • Full π0๊ฐ€ ๋ชจ๋“  ๋ณต์žกํ•œ task์—์„œ ๊ฐ€์žฅ ๋†’์€ ์„ฑ๋Šฅ์„ ๊ธฐ๋กํ–ˆ๋‹ค.
  • ๋‚œ๋„๊ฐ€ ๋†’์€ task์ผ์ˆ˜๋ก Pre-training์˜ ํšจ๊ณผ๊ฐ€ ๋” ํฌ๊ฒŒ ๋‚˜ํƒ€๋‚ฌ๋‹ค.
  • π0-scratch๋Š” ํŠนํžˆ ๋ณต์žกํ•œ multi-stage task์—์„œ ๋‚ฎ์€ ์„ฑ๋Šฅ์„ ๋ณด์˜€๋‹ค.
  • Pre-training๋งŒ ์ˆ˜ํ–‰ํ•œ Zero-shot ๋ชจ๋ธ๋ณด๋‹ค Post-training๊นŒ์ง€ ์ ์šฉํ•œ Full π0๊ฐ€ ์•ˆ์ •์ ์œผ๋กœ ๋†’์€ ์„ฑ๋Šฅ์„ ๋ณด์˜€๋‹ค.
  • Pre-training๊ณผ Post-training์€ ์„œ๋กœ ๋‹ค๋ฅธ ์—ญํ• ์„ ์ˆ˜ํ–‰ํ•˜๋ฉฐ, ๋‘ ๋‹จ๊ณ„๋ฅผ ๊ฒฐํ•ฉํ•  ๋•Œ ๋ณต์žกํ•œ manipulation์—์„œ ๊ฐ€์žฅ ๋†’์€ ์„ฑ๋Šฅ์„ ์–ป๋Š”๋‹ค.
    • Pre-training์€ ๋‹ค์–‘ํ•œ robot experience๋ฅผ ํ†ตํ•ด ๋ฒ”์šฉ์ ์ธ physical skill๊ณผ generalization ๋Šฅ๋ ฅ์„ ์ œ๊ณตํ•˜๊ณ , Post-training์€ ํŠน์ • task์—์„œ ์š”๊ตฌ๋˜๋Š” ์ •๋ฐ€์„ฑ, ์•ˆ์ •์„ฑ, ์ˆ™๋ จ๋„๋ฅผ ๊ฐ•ํ™”ํ•œ๋‹ค.

7. ํ•ต์‹ฌ ์ •๋ฆฌ

π0์˜ ํ•ต์‹ฌ์€ ๋‹จ์ˆœํžˆ VLM์— robot action head๋ฅผ ์ถ”๊ฐ€ํ•œ ๊ฒƒ์ด ์•„๋‹ˆ๋‹ค.

1. VLM์˜ ์ง€์‹์„ ๋กœ๋ด‡ ์ œ์–ด๋กœ ์—ฐ๊ฒฐ

PaliGemma์˜ ์‹œ๊ฐ·์–ธ์–ด ์ง€์‹์„ ์œ ์ง€ํ•˜๋ฉด์„œ Action Expert๋ฅผ ์ถ”๊ฐ€ํ•ด low-level robot control๊นŒ์ง€ ์—ฐ๊ฒฐํ•œ๋‹ค.

2. Continuous Action์„ ์ง์ ‘ ๋ชจ๋ธ๋ง

Flow Matching๊ณผ Action Chunking์„ ์‚ฌ์šฉํ•ด discrete token ๋Œ€์‹  ์—ฐ์†์ ์ธ action distribution์„ ๋ชจ๋ธ๋งํ•œ๋‹ค.

3. ๋ฒ”์šฉ์„ฑ๊ณผ ์ˆ™๋ จ๋„๋ฅผ ํ•™์Šต ๋‹จ๊ณ„์—์„œ ๋ถ„๋ฆฌ

  • Pre-training: ๋‹ค์–‘ํ•œ ๋กœ๋ด‡๊ณผ task์—์„œ ๋ฒ”์šฉ์ ์ธ physical skill ํ™•๋ณด
  • Post-training: ํŠน์ • task์˜ ์ˆ™๋ จ๋„์™€ ์ •๋ฐ€์„ฑ ๊ฐ•ํ™”

๊ฒฐ๊ตญ π0๋Š”

VLM์˜ semantic knowledge + continuous action modeling + large-scale robot learning

 

์„ ๊ฒฐํ•ฉํ•ด ๋ฒ”์šฉ์„ฑ(generalization)๊ณผ ๋Šฅ์ˆ™ํ•จ(dexterity)์„ ๋™์‹œ์— ํ™•๋ณดํ•˜๋ ค๋Š” Robot Foundation Model์ด๋‹ค.