| ์ผ | ์ | ํ | ์ | ๋ชฉ | ๊ธ | ํ |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- layoutlm
- ๋ฅ๋ฌ๋
- layoutxml
- document understanding
- OCR
- Test set
- joint training of textual and layout information
- Text Recognition
- VrDU
- multilingual
- ๋ ์ด๋ธ๋ง
- document image understanding
- Pre-training
- Today
- Total
JM_Research Blog
[VLA] π0 : A Vision-Language-Action Flow Model forGeneral Robot Control ๋ณธ๋ฌธ
[VLA] π0 : A Vision-Language-Action Flow Model forGeneral Robot Control
-jm- 2026. 9. 9. 18:01๐ π0: A Vision-Language-Action Flow Model for General Robot Control
0๏ธโฃ Meta
- Title: A Vision-Language-Action Flow Model for General Robot Control
- Authors / Year: 2024 10 31
- Venue:
- Paper link: https://arxiv.org/pdf/2410.24164v1
- Code / Project:
| ๊ตฌ์ฑ ์์ | ์ค๋ช |
| VLM Backbone | PaliGemma, ์ฝ 3B |
| Action Expert | Transformer, ์ฝ 300M |
| Action Modeling | Flow Matching |
| ์ถ๋ ฅ | 50-step Continuous Action Chunk |
๐One-line Summary

π0๋ VLM์ ์๊ฐ·์ธ์ด ์ง์๊ณผ ๋ก๋ด ์ ์ฉ Action Expert๋ฅผ ๊ฒฐํฉํ๊ณ , Flow Matching ๊ธฐ๋ฐ์ ์ฐ์ Action Chunk๋ฅผ ์์ฑํ์ฌ ๋ฒ์ฉ์ฑ๊ณผ ์ ๊ตํ ์กฐ์ ๋ฅ๋ ฅ์ ๋์์ ํ๋ณดํ๋ VLA ๋ชจ๋ธ์ด๋ค.
๋ฌธ์
๊ธฐ์กด ๋ก๋ด ์ ์ฑ ์ ํน์ ์์ ์ ํนํ๋์ด ์์ด ๋ฐ์ดํฐ ๋ถ์กฑ, โ์ผ๋ฐํ·๊ฐ์ธ์ฑ ๋ถ์กฑ, โ์ ๊ตํ ์กฐ์์ ํ๊ณ๊ฐ ์กด์ฌํ๋ค.
์ ๊ทผ
π0๋ ๋๊ท๋ชจ Vision-Language Model์ ์ฌ์ ํ์ต ์ง์์ ํ์ฉํ๋ฉด์, ๋ค์ํ ๋ก๋ด ๊ฒฝํ์ ํจ๊ป ํ์ตํ๋ Robot Foundation Model ์ ๊ทผ์ ์ ์ํ๋ค.
ํต์ฌ ๋ฐฉ๋ฒ
- VLM + Action Expert
- PaliGemma์ ์๊ฐ·์ธ์ด ์ง์์ ํ์ฉํ๊ณ , Action Expert๋ฅผ ์ถ๊ฐํด ๋ก๋ด ์ํ์ ํ๋ ์ฒ๋ฆฌ์ ํนํ
- Flow Matching + Action Chunking
- ์ฐ์์ ์ธ ํ๋ ๋ถํฌ๋ฅผ ๋ชจ๋ธ๋งํ๊ณ , ๋ฏธ๋์ ์ฌ๋ฌ action์ chunk ๋จ์๋ก ์์ฑํ์ฌ ์ ๊ตํ๊ณ ๊ณ ์ฃผํ์์ธ ๋ก๋ด ์ ์ด๋ฅผ ์ํ
- Pre-training๊ณผ Post-training์ ์ญํ ๋ถ๋ฆฌ
- Pre-training์์๋ ๋ค์ํ ๋ก๋ด๊ณผ ์์ ๋ฐ์ดํฐ๋ฅผ ํ์ฉํด ๋ฒ์ฉ์ ์ธ physical skill์ ํ์ต
- Post-training์์๋ ํน์ ์์ ์ ์ ํฉํ ๊ณ ํ์ง ๋ฐ์ดํฐ๋ฅผ ํ์ฉํด ์๋ จ๋์ ์ ๋ฐ์ฑ์ ๊ฐํ
๊ฒฐ๊ณผ
π0๋ Zero-shot ์ฑ๋ฅ, โ์ธ์ด ๋ช ๋ น ์ถ์ข , โ๋นจ๋ ์ ๊ธฐ์ ๊ฐ์ ๋ณต์กํ ๋ค๋จ๊ณ ์กฐ์ ์์ ์์ ๊ธฐ์กด ๋ชจ๋ธ๋ณด๋ค ๋์ ์ฑ๋ฅ์ ๋ณด์ด๋ฉฐ, ๋ฒ์ฉ ๋ก๋ด ํ์ด๋ฐ์ด์ ๋ชจ๋ธ์ ๊ฐ๋ฅ์ฑ์ ๋ณด์ฌ์ค๋ค.
1. π0๊ฐ ํด๊ฒฐํ๋ ค๋ ๋ฌธ์
๋ก๋ด ์ ์ฑ ์ ๋ฒ์ฉ์ ์ผ๋ก ํ์ฅํ๋ ค๋ฉด ํฌ๊ฒ ์ธ ๊ฐ์ง ๋ฌธ์ ๊ฐ ์๋ค.
1.1 ๋ฐ์ดํฐ ๊ท๋ชจ์ ๋ค์์ฑ
๋ก๋ด ๋ฐ์ดํฐ๋ ์ธํฐ๋ท ์ด๋ฏธ์ง·ํ ์คํธ ๋ฐ์ดํฐ๋ณด๋ค ์์ง ๋น์ฉ์ด ๋๊ณ ๊ท๋ชจ๊ฐ ์๋ค. ๋ํ ํน์ task์ embodiment์ ์น์ฐ์น ๋ฐ์ดํฐ๋ง์ผ๋ก๋ ์๋ก์ด ํ๊ฒฝ๊ณผ ๋ก๋ด์ผ๋ก ์ผ๋ฐํํ๊ธฐ ์ด๋ ต๋ค.
1.2 ์๊ฐ·์ธ์ด ์ดํด์ ๋ก๋ด ์ ์ด์ ์ฐ๊ฒฐ
VLM์ ์ด๋ฏธ์ง์ ์ธ์ด๋ฅผ ์ดํดํ๋ ๋ฐ ๊ฐํ์ง๋ง, ๋ก๋ด ์ ์ด์ ํ์ํ ์ฐ์์ ์ธ ์ ์์ค action์ ์ง์ ์์ฑํ๋๋ก ์ค๊ณ๋ ๋ชจ๋ธ์ ์๋๋ค.
๋ฐ๋ผ์ VLM์ semantic knowledge๋ฅผ ์ ์งํ๋ฉด์ ์ค์ ๋ก๋ด ์ ์ด๋ก ์ฐ๊ฒฐํ ์ ์๋ ๊ตฌ์กฐ๊ฐ ํ์ํ๋ค.
1.3 ๋ฒ์ฉ์ฑ๊ณผ ์๋ จ๋์ ๊ท ํ
๋ค์ํ ์์ ์ ํญ๋๊ฒ ํ์ตํ๋ฉด ์ผ๋ฐํ์๋ ์ ๋ฆฌํ์ง๋ง, ํน์ ์์ ์์ ๋์ ์๋ จ๋๋ฅผ ์ป๊ธฐ ์ด๋ ต๋ค. ๋ฐ๋๋ก ํน์ task ๋ฐ์ดํฐ๋ง ์ง์ค์ ์ผ๋ก ํ์ตํ๋ฉด ์๋ จ๋๋ ๋์์ง ์ ์์ง๋ง ๋ฒ์ฉ์ฑ์ด ๋จ์ด์ง๋ค.
π0๋ ์ด๋ฅผ Pre-training๊ณผ Post-training์ ์ญํ ์ ๋ถ๋ฆฌํ๋ ๋ฐฉ์์ผ๋ก ํด๊ฒฐํ๋ค.
2. π0 ์ ํต์ฌ ์์ด๋์ด
π0์ ํต์ฌ์ ํฌ๊ฒ ๋ ๊ฐ์ง๋ค.
- ์ฌ์ ํ์ต๋ VLM์ Action Expert๋ฅผ ๊ฒฐํฉํด ๋ก๋ด ์ ์ด ๋ฅ๋ ฅ์ ์ถ๊ฐํ๋ค.
- Flow Matching์ ์ฌ์ฉํด ์ฐ์์ ์ธ Action Chunk๋ฅผ ์์ฑํ๋ค.
2.1 VLM๊ณผ Action Expert์ ๊ฒฐํฉ
π0๋ ์ฌ์ ํ์ต๋ VLM์ ๊ทธ๋๋ก ๋ก๋ด ์ ์ฑ ์ผ๋ก ์ฌ์ฉํ๋ ๋์ , ๋ก๋ด ์ ์ด์ ํนํ๋ Action Expert๋ฅผ ์ถ๊ฐํ๋ค.
VLM์ ๋ค์ ์ญํ ์ ๋ด๋นํ๋ค.
- ์ด๋ฏธ์ง ์ ๊ฐ์ฒด์ ์ฅ๋ฉด์ ์ดํดํ๋ค.
- ์ธ์ด ๋ช ๋ น์ ์๋ฏธ๋ฅผ ํด์ํ๋ค.
- ๋๊ท๋ชจ ์๊ฐ·์ธ์ด ์ฌ์ ํ์ต์์ ์ป์ semantic knowledge๋ฅผ ์ ๊ณตํ๋ค.
Action Expert๋ ๋ค์ ์ ๋ณด๋ฅผ ์ฒ๋ฆฌํ๋ค.
- robot state
- noisy action chunk
- flow timestep
- VLM์์ ์ ๋ฌ๋ image-language context
์ญํ ์ ๋จ์ํํ๋ฉด ๋ค์๊ณผ ๊ฐ๋ค.
VLM์ ํ์ฌ ์ํฉ๊ณผ ๋ช ๋ น์ ์ดํดํ๊ณ , Action Expert๋ ์ด๋ฅผ ์ค์ ๋ก๋ด action์ผ๋ก ๋ณํํ๋ค.
์ด ๊ตฌ์กฐ๋ฅผ ํตํด π0๋ VLM์ ์ผ๋ฐ์ ์ธ ์๊ฐ·์ธ์ด ์ง์์ ์ ์งํ๋ฉด์, ๋ก๋ด ์ ์ด์ ํ์ํ ์ฐ์์ ์ด๊ณ ์ ๋ฐํ ํ๋์ ๋ณ๋๋ก ํ์ตํ ์ ์๋ค.
2.2 Flow Matching ๊ธฐ๋ฐ Action Chunk ์์ฑ
π0๋ action์ discrete token์ผ๋ก ํ๋์ฉ ์์ธกํ์ง ์๋๋ค. ๋์ ๋๋คํ action noise์์ ์์ํด ์ค์ action ๋ฐฉํฅ์ผ๋ก ์ด๋ํ๋ vector field๋ฅผ ํ์ตํ๊ณ , ์ด๋ฅผ ์ ๋ถํด ์ต์ข Action Chunk๋ฅผ ์์ฑํ๋ค.
ํต์ฌ ์ง๊ด์ ๋ค์๊ณผ ๊ฐ๋ค.
ํ์ฌ noisy action์์ ์ด๋ ๋ฐฉํฅ์ผ๋ก ์์ง์ฌ์ผ ์ค์ action์ ๊ฐ๊น์์ง๋์ง๋ฅผ ํ์ตํ๋ค.
Random Action Noise
↓
Velocity ์์ธก
↓
Action ์
๋ฐ์ดํธ
↓
Velocity ์์ธก
↓
...
↓
Continuous Action Chunk
π0๋ ์ถ๋ก ์ ์ฌ๋ฌ ๋ฒ์ integration step์ ๊ฑฐ์ณ 50-step continuous action chunk๋ฅผ ์์ฑํ๋ค.
3. Flow Matching์ ์ด๋ป๊ฒ ํ์ต๋๋๊ฐ?
3.1 Noisy Action ์์ฑ
์ค์ action chunk๋ฅผ \(A_t\), Gaussian noise๋ฅผ \(\epsilon\)์ด๋ผ๊ณ ํ๋ฉด ์ค๊ฐ ์ํ๋ ๋ค์๊ณผ ๊ฐ์ด ์ ์ํ๋ค.
$$A_t^{\tau} = \tau A_t + (1-\tau)\epsilon$$
์ฌ๊ธฐ์
- \(A_t\): ์ค์ robot action chunk
- \(\epsilon \sim \mathcal{N}(0,I)\): Gaussian noise
- \(\tau \in [0,1]\): Flow Matching์ ์๊ฐ
- \(A_t^\tau\): noise์ ์ค์ action ์ฌ์ด์ ์ค๊ฐ ์ํ
\(\tau=0\)์์๋ noise์ ๊ฐ๊น๊ณ , \(\tau=1\)์์๋ ์ค์ action์ ๋๋ฌํ๋ค.
3.2 Target Vector Field
์ ๊ฒฝ๋ก๋ฅผ \(\tau\)์ ๋ํด ๋ฏธ๋ถํ๋ฉด
$$\frac{dA_t^{\tau}}{d\tau} = A_t-\epsilon$$
๋ฐ๋ผ์ ๋ชจ๋ธ์ด ๋ง์ถฐ์ผ ํ๋ target vector field๋
$$u(A_t^{\tau} \mid A_t) = A_t-\epsilon$$
์ฆ ๋ชจ๋ธ์ ํ์ฌ noisy action์์ ์ค์ action ์ชฝ์ผ๋ก ์ด๋ํด์ผ ํ๋ ๋ฐฉํฅ๊ณผ ์๋๋ฅผ ํ์ตํ๋ค.
3.3 ๋ชจ๋ธ ์์ธก
๋ชจ๋ธ์ ํ์ฌ noisy action๊ณผ observation์ ์ ๋ ฅ๋ฐ์ vector field๋ฅผ ์์ธกํ๋ค.
$$v_{\theta}(A_t^{\tau}, o_t)$$
์ฌ๊ธฐ์ \(o_t\)์๋ ๋ค์ ์ ๋ณด๊ฐ ํฌํจ๋๋ค.
- ์ฌ๋ฌ ์นด๋ฉ๋ผ์ RGB ์ด๋ฏธ์ง
- ์ธ์ด ๋ช ๋ น
- robot state
3.4 Loss
ํ์ต์ ํต์ฌ์ ์์ธก vector field์ target vector field ์ฌ์ด์ ์ฐจ์ด๋ฅผ ์ต์ํํ๋ ๊ฒ์ด๋ค.
$$\mathcal{L}^{\tau}(\theta) = \mathbb{E}{p(A_t \mid o_t), q(A_t^\tau \mid A_t)} \left[\left|v\theta(A_t^\tau,o_t)-u(A_t^\tau \mid A_t)\right|_2^2\right]$$
์ฌ๊ธฐ์ ๊ฐ notation์ ์๋ฏธ๋ ๋ค์๊ณผ ๊ฐ๋ค.
- \(\mathcal{L}^{\tau}(\theta)\): ํ์์คํ \(\tau\)์์์ Flow Matching loss
- \(\theta\): ๋ชจ๋ธ์ ํ์ต ํ๋ผ๋ฏธํฐ
- \(\mathbb{E}\): ํ์ต ๋ฐ์ดํฐ์ noisy action ์ํ์ ๋ํ ๊ธฐ๋๊ฐ
- \(p(A_t \mid o_t)\): observation \(o_t\)๊ฐ ์ฃผ์ด์ก์ ๋ ์ค์ action chunk \(A_t\)์ ๋ฐ์ดํฐ ๋ถํฌ
- \(q(A_t^\tau \mid A_t)\): ์ค์ action \(A_t\)๋ก๋ถํฐ ์ค๊ฐ noisy action \(A_t^\tau\)๋ฅผ ์์ฑํ๋ ํ๋ฅ ๊ฒฝ๋ก
- \(A_t\): ์ค์ robot action chunk
- \(A_t^\tau\): Flow Matching์ ํ์์คํ \(\tau\)์์ ์์ฑ๋ noisy action
- \(o_t\): ํ์ฌ observation
- \(v_\theta(A_t^\tau,o_t)\): ๋ชจ๋ธ์ด ์์ธกํ vector field
- \(u(A_t^\tau \mid A_t)\): ๋ชจ๋ธ์ด ๋ง์ถฐ์ผ ํ๋ target vector field
- \(|\cdot|_2^2\): ์์ธก vector field์ target vector field ์ฌ์ด์ squared L2 distance
์ฆ ๋ชจ๋ธ์ ๋ค์ํ noisy action ์ํ์์ ์ค์ action์ผ๋ก ์ด๋ํ๋ ์ฌ๋ฐ๋ฅธ ๋ฐฉํฅ์ ํ์ตํ๋ค.
3.5 Inference
์ถ๋ก ์์๋ ์ ๋ต action์ด ์๊ธฐ ๋๋ฌธ์ random action noise์์ ์์ํ๋ค.
$$A_t^0 = \epsilon$$
๋ชจ๋ธ์ด velocity๋ฅผ ์์ธกํ ๋ค,
$$v_{\theta}(A_t^\tau,o_t)$$
๋ค์๊ณผ ๊ฐ์ด action์ ์ ๋ฐ์ดํธํ๋ค.
$$A_t^{\tau+\delta} = A_t^\tau + \delta v_{\theta}(A_t^\tau,o_t)$$
์ด ๊ณผ์ ์ ๋ฐ๋ณตํด ์ต์ข Action Chunk๋ฅผ ์์ฑํ๋ค.
4. π0 ๋ชจ๋ธ ๊ตฌ์กฐ
π0์ ์ ์ฒด ๊ตฌ์กฐ๋ ํฌ๊ฒ Pretrained VLM + Action Expert๋ก ๋ณผ ์ ์๋ค.
4.1 ์ ๋ ฅ๊ณผ ์ถ๋ ฅ
์ ๋ ฅ
๊ด์ธก๊ฐ \(o_t\)๋ ๋ค์ ์ ๋ณด๋ฅผ ํฌํจํ๋ค.
- ๋ค์ค RGB ์ด๋ฏธ์ง \(I_i^t\)
- ์ธ์ด ๋ช ๋ น \(l_t\)
- ๋ก๋ด ์ํ \(q_t\)
- Noisy Action Chunk \(A_t^\tau\)
์ถ๋ ฅ
π0๋ ๋ฏธ๋์ ํ๋ ํ๋๊ฐ ์๋๋ผ Action Chunk๋ฅผ ์ถ๋ ฅํ๋ค.
\(A_t = [a_t, a_{t+1}, \dots, a_{t+H-1}]\)
๋ ผ๋ฌธ์์๋ \(H=50\)์ผ๋ก ์ค์ ํ๋ค.
๊ฐ \(a_{t'}\)๋ discrete token์ด ์๋๋ผ ์ฐ์์ ์ธ robot action vector์ด๋ค.
4.2 PaliGemma VLM
π0๋ ์ฝ 30์ต ํ๋ผ๋ฏธํฐ ๊ท๋ชจ์ PaliGemma๋ฅผ VLM backbone์ผ๋ก ์ฌ์ฉํ๋ค.
PaliGemma๋ ์ฌ์ ํ์ต์ ํตํด ์ด๋ฏธ์ง์ ์ธ์ด์ ๋ํ ํญ๋์ semantic knowledge๋ฅผ ๊ฐ์ง๊ณ ์์ผ๋ฉฐ, π0๋ ์ด ํํ์ ๋ก๋ด ์ ์ด์ ํ์ฉํ๋ค.
4.3 Action Expert
Action Expert๋ ์ฝ 300M ๊ท๋ชจ์ Transformer ๊ธฐ๋ฐ ๋ชจ๋๋ก ๋ค์ ์ ๋ณด๋ฅผ ์ด์ฉํ๋ค.
- VLM์ image-language context
- current robot state
- noisy action chunk
- flow timestep \tau
์ด๋ฅผ ๋ฐํ์ผ๋ก ๋ค์ velocity๋ฅผ ์์ธกํ๋ค.
๊ตฌ์กฐ๋ฅผ ๋จ์ํํ๋ฉด ๋ค์๊ณผ ๊ฐ๋ค.
VLM Context
+
Robot State
+
Noisy Action
+
Flow Timestep
↓
Action Expert
↓
Action Velocity
4.4 VLM๊ณผ Action Expert์ ์ ๋ณด ๊ฒฐํฉ
(VLM๊ณผ Action Expert๋ ์์ ํ ๋ถ๋ฆฌ๋ ๋ ๋คํธ์ํฌ๊ฐ ์๋๋ค.(MOE ๊ตฌ์กฐ)
π0๋ ํ๋์ Transformer ์์์ ํ ํฐ ์ข ๋ฅ์ ๋ฐ๋ผ ์๋ก ๋ค๋ฅธ expert weight๋ฅผ ์ฌ์ฉํ๋ค.
- VLM Expert
- image token
- language token
- Action Expert
- robot state token
- action token
FFN์์๋ ํ ํฐ ์ข ๋ฅ์ ๋ฐ๋ผ ์๋ก ๋ค๋ฅธ expert weight๋ฅผ ์ฌ์ฉํ์ง๋ง, Self-Attention์ ํตํด image-language context์ action ์ ๋ณด๊ฐ ๊ฒฐํฉ๋๋ค.
๋ฐ๋ผ์ action token์ ์ด๋ฏธ์ง์ ์ธ์ด์์ ์ป์ ์ ๋ณด๋ฅผ ์ฐธ์กฐํด ํ์ฌ ์ํฉ๊ณผ ๋ช ๋ น์ ๋ง๋ ํ๋์ ์์ฑํ ์ ์๋ค.
์ด ๊ตฌ์กฐ์ ์ฅ์ ์ ๋ ๊ฐ์ง๋ค.
- ์ ๋ฌธํ
- VLM์ ์ผ๋ฐ ์ง์์ ์ ์งํ๋ฉด์ ๋ก๋ด ์ ์ด์ ํนํ๋ ๊ฐ์ค์น๋ฅผ ๋ณ๋๋ก ํ์ตํ ์ ์๋ค.
- ์ถ๋ก ํจ์จ
- Flow Matching ๊ณผ์ ์์ action-related computation์ ์ฌ๋ฌ ๋ฒ ๋ฐ๋ณต๋๋ฏ๋ก, ์ ์ฒด VLM๋ณด๋ค ์์ Action Expert๋ฅผ ์ฌ์ฉํด ๋ฐ๋ณต ๊ณ์ฐ ๋น์ฉ์ ์ค์ผ ์ ์๋ค.
5. ๋ฐ์ดํฐ ๊ตฌ์ฑ๊ณผ ํ์ต ์ ๋ต

π0์ ์ค์ํ ํน์ง ์ค ํ๋๋ Pre-training๊ณผ Post-training์ ์ญํ ์ ๋ช ํํ๊ฒ ๊ตฌ๋ถํ๋ค๋ ์ ์ด๋ค.
ํต์ฌ์ ๋ค์๊ณผ ๊ฐ๋ค.
Pre-training์ ๋ฒ์ฉ์ฑ์ ํ๋ณดํ๊ณ , Post-training์ ํน์ task์ ์๋ จ๋๋ฅผ ๊ฐํํ๋ค.
5.1 Pre-training: ๋ฒ์ฉ์ ์ธ Physical Skill ํ๋ณด
Pre-training์ ๋ชฉํ๋ ๋ค์ํ ๋ก๋ด๊ณผ ์์ ์ ๊ฒฝํํ๊ฒ ํด ์ฌ์ฌ์ฉ ๊ฐ๋ฅํ ์ผ๋ฐ์ ์ธ physical skill์ ํ์ตํ๋ ๊ฒ์ด๋ค.
์ด๋ฅผ ์ํด ๋ค์๊ณผ ๊ฐ์ ๋ค์์ฑ์ ํ๋ณดํ๋ค.
- ๋ค์ํ robot embodiment
- ๋ค์ํ task
- ๋ค์ํ object์ environment
- ๊ฐ task ์์์ ๋ค์ํ ํ๋ ํจํด
π0๋ Open X-Embodiment(OXE)๋ฅผ ํฌํจํ ๋๊ท๋ชจ ๋ก๋ด ๋ฐ์ดํฐ๋ฅผ ์ฌ์ฉํ๋ฉฐ, ์ ์ฒด ์ฌ์ ํ์ต ๋ฐ์ดํฐ ๊ท๋ชจ๋ 10,000์๊ฐ ์ด์์ด๋ค.
5.2 Post-training: ํน์ Task์ ์๋ จ๋ ๊ฐํ
Post-training์์๋ ๋ฒ์ฉ์ฑ์ ๋ํ๋ ๊ฒ๋ณด๋ค ํน์ task๋ฅผ ์์ ์ ์ด๊ณ ๋ฅ์ํ๊ฒ ์ํํ๋ ๊ฒ์ ์ด์ ์ ๋๋ค.
๋ฐ๋ผ์ ๋ค์๊ณผ ๊ฐ์ ๋ฐ์ดํฐ๊ฐ ์ค์ํ๋ค.
- ์ผ๊ด๋ ์คํ ์ ๋ต์ ํฌํจํ ๋ฐ์ดํฐ
- ํจ๊ณผ์ ์ธ task completion์ ๋์์ด ๋๋ ํ๋
- ์ ๋ฐ ์กฐ์๊ณผ ๊ธด horizon์ ํฌํจํ ๊ณ ํ์ง ๋ฐ์ดํฐ
์ฆ Pre-training์์ ์ป์ ๋ฒ์ฉ์ ์ธ ๋ฅ๋ ฅ์ ๊ธฐ๋ฐ์ผ๋ก, Post-training์์ task-specific dexterity๋ฅผ ๊ฐํํ๋ค.
5.3 ๋ฐ์ดํฐ ํ๋ ์ด์ ์ ๋ต
π0๋ ๋จ์ํ ๋ชจ๋ ๋ฐ์ดํฐ๋ฅผ ๋์ผํ ๋น์จ๋ก ์์ง ์๋๋ค.
OXE Magic Soup
Open X-Embodiment ๋ฐ์ดํฐ ๊ฐ์ด๋ฐ ํ์ต์ ์ ์ฉํ ๋ฐ์ดํฐ์ ์ ์ ๋ณํ๊ณ , ์ ์ ํ ๋น์จ๋ก ํผํฉํ๋ค.
Weighting
๋ฐ์ดํฐ์ ์ ๊ท๋ชจ๊ฐ ์๋ก ๋ค๋ฅด๊ธฐ ๋๋ฌธ์ ๋จ์ ์ํ๋ง์ ์ฌ์ฉํ๋ฉด ํน์ ๋๊ท๋ชจ ๋ฐ์ดํฐ๊ฐ ํ์ต์ ์ง๋ฐฐํ ์ ์๋ค. ์ด๋ฅผ ๋ฐฉ์งํ๊ธฐ ์ํด ๋ฐ์ดํฐ์ ๋ณ sampling weight๋ฅผ ์กฐ์ ํ๋ค.
Task ๊ตฌ์ฑ
๋จ์ํ ๊ฐ๋ณ ๋์๋ง ํ์ตํ๋ ๊ฒ์ด ์๋๋ผ, ํ ์ด๋ธ ์ ๋ฆฌ์ฒ๋ผ ์ฌ๋ฌ ํ๋์ด ์ฐ๊ฒฐ๋๋ ๋ณต์กํ ํ๋ sequence๋ ํ์ต์ ํฌํจํ๋ค.
๊ฒฐ๊ตญ π0์ ๋ฐ์ดํฐ ์ ๋ต์
๋ค์ํ ๋ฐ์ดํฐ๋ฅผ ๋ง์ด ๋ชจ์ผ๋ ๊ฒ๋ณด๋ค, ์ด๋ค ๋ฐ์ดํฐ๋ฅผ ์ด๋ค ๋น์จ๋ก Pre-training๊ณผ Post-training์ ๋ฐฐ์นํ ๊ฒ์ธ๊ฐ
์ ์ด์ ์ ๋๋ค.
6. ์คํ ๊ฒฐ๊ณผ
π0์ ์คํ์ ํฌ๊ฒ ๋ค ๊ฐ์ง ์ง๋ฌธ์ ๊ฒ์ฆํ๋ค.
- ๋๊ท๋ชจ Pre-training์ด Zero-shot Generalization์ ๋์์ด ๋๋๊ฐ?
- VLM์ ์ธ์ด ์ดํด ๋ฅ๋ ฅ์ด ์ค์ ๋ก๋ด์ Language Following ์ฑ๋ฅ์ผ๋ก ์ด์ด์ง๋๊ฐ?
- Pre-training์ด ์๋ก์ด task์ ๋ํ Fine-tuning๊ณผ Transfer๋ฅผ ๊ฐ์ ํ๋๊ฐ?
- π0๊ฐ ๊ธด horizon๊ณผ ๋์ ์ ๋ฐ๋๋ฅผ ์๊ตฌํ๋ ๋ณต์กํ ๋ค๋จ๊ณ ์กฐ์ ์์ ๊น์ง ์ํํ ์ ์๋๊ฐ?
6.1 Zero-shot Generalization

๋ชฉ์
๋๊ท๋ชจ ๋ก๋ด ๋ฐ์ดํฐ๋ก Pre-training๋ π0๊ฐ ๋ณ๋์ Post-training ์์ด ๋ค์ํ ์์
์ ์ผ๋ง๋ ์ ์ํํ๋์ง ํ๊ฐํ๋ค.
์ฆ, Pre-training๋ง์ผ๋ก ์ด๋ ์ ๋์ ๋ฒ์ฉ์ ์ธ robot skill์ ํ๋ณดํ ์ ์๋์ง๋ฅผ ํ์ธํ๋ ์คํ์ด๋ค.
ํ๊ฐ Task
| Task | ์ค๋ช |
| Shirt Folding | ์ ์ธ ๋ฅผ ํผ์น๊ณ ์ ๋ ์์ . ๋ณํ๋๋ ๋ฌผ์ฒด๋ฅผ ๋ค๋ค์ผ ํ๋ฏ๋ก ์ฌ์ธํ manipulation์ด ํ์ํจ |
| Bussing Easy / Hard | ์๊ธฐ์ ์ฐ๋ ๊ธฐ๋ฅผ ๊ตฌ๋ถํด ๊ฐ๊ฐ ์ฌ๋ฐ๋ฅธ ํต์ ๋ฃ๋ ๋ค๋จ๊ณ ์์ . Hard ๋ฒ์ ์ ๋ ๋ง์ ๋ฌผ์ฒด์ ๋ณต์กํ ๋ฐฐ์น๋ฅผ ํฌํจ |
| Grocery Bagging | ๋ค์ํ ์๋ฃํ์ ์ธ์ํ๊ณ ๋ดํฌ ์์ ๋ฃ๋ ์์ |
| Toast Out of Toaster | ํ ์คํฐ์์ ํ ์คํธ๋ฅผ ๊บผ๋ด ์ ์์ ์ฌ๋ ค๋๋ ์์ . ์ ํํ ํ์ง์ ์์น ์ ์ด๊ฐ ํ์ํจ |
๋น๊ต ๋ชจ๋ธ
| Model | ํน์ง |
| OpenVLA | ๊ธฐ์กด VLA baseline |
| Octo | ๋ฒ์ฉ ๋ก๋ด ์ ์ฑ baseline |
| π0-small | ์ฝ 4์ต 7์ฒ๋ง ํ๋ผ๋ฏธํฐ ๊ท๋ชจ, VLM ์ฌ์ ํ์ต์ ์ฌ์ฉํ์ง ์์ ์ํ ๋ชจ๋ธ |
| π0 compute-parity | baseline๊ณผ ์ ์ฌํ 160k training step์ผ๋ก ํ์ต |
| Full π0 | 700k step์ผ๋ก ํ์ตํ ์ ์ฒด ๋ชจ๋ธ |
์ฃผ์ ๊ฒฐ๊ณผ
- Full π0๊ฐ ๋ชจ๋ Zero-shot task์์ ๊ฐ์ฅ ๋์ ์ฑ๋ฅ์ ๋ณด์๋ค.
- ํนํ Shirt Folding๊ณผ Bussing Easy์์๋ ๋งค์ฐ ๋์ ์ฑ๊ณต๋ฅ ์ ๊ธฐ๋กํ๋ค.
- ํ์ต๋์ baseline๊ณผ ๋น์ทํ๊ฒ ๋ง์ถ π0 compute-parity ์ญ์ OpenVLA์ Octo๋ณด๋ค ๋์ ์ฑ๋ฅ์ ๋ณด์๋ค.
- π0์ ์ฑ๋ฅ ํฅ์์ ๋จ์ํ ๋ ๋ง์ training step์ ์ฌ์ฉํ ๊ฒฐ๊ณผ๋ง์ผ๋ก ์ค๋ช
ํ๊ธฐ ์ด๋ ต๋ค.
- ๋์ผํ ์์ค์ compute์์๋ π0๊ฐ baseline์ ์์ฐ๋ค๋ ์ ์ VLM ๊ธฐ๋ฐ ํํ, Action Expert, continuous action modeling์ ๊ฒฐํฉํ π0์ ๊ตฌ์กฐ ์์ฒด๊ฐ ์ฑ๋ฅ์ ๊ธฐ์ฌํ๋ค๋ ์ ์ ๋ณด์ฌ์ค๋ค.
6.2 Language Following

๋ชฉ์
π0๊ฐ ์ธ์ด ๋ช ๋ น์ ์ผ๋ง๋ ์ ์ดํดํ๊ณ ์ค์ ํ๋์ผ๋ก ์ฐ๊ฒฐํ๋์ง ํ๊ฐํ๋ค.
ํนํ ๋จ์ํ ์ ์ฒด task instruction๋ง ์ฃผ๋ ๊ฒฝ์ฐ์, ์ค๊ฐ ๋จ๊ณ์ ์ธ๋ถ ๋ช ๋ น์ ์ถ๊ฐ๋ก ์ ๊ณตํ๋ ๊ฒฝ์ฐ๋ฅผ ๋น๊ตํด VLM์ ์ธ์ด ์ดํด ๋ฅ๋ ฅ์ด ์ค์ robot performance์ ์ํฅ์ ์ฃผ๋์ง ํ์ธํ๋ค.
ํ๊ฐ Task
| Task | ์ค๋ช |
| Bussing | ๊ทธ๋ฆ๊ณผ ์๊ธฐ๋ ์๊ธฐํต์, ์ฐ๋ ๊ธฐ๋ ์ฐ๋ ๊ธฐํต์ ๋ฃ๋ ์์ |
| Table Setting | ํต์์ ํ์ํ ๋ฌผ์ฒด๋ฅผ ๊บผ๋ด ์ํ์ ์ธํ ํ๊ณ , ์ธ์ด ์ง์์ ๋ฐ๋ผ ๋ฐฐ์น๋ฅผ ์กฐ์ ํ๋ ์์ |
| Grocery Bagging | ๋ค์ํ ์๋ฃํ์ ๋ดํฌ์ ๋ฃ๋ ์์ ์ผ๋ก, ์ค๊ฐ ๋จ๊ณ ์ธ์ด ์ง์์ ํจ๊ณผ๋ฅผ ํ๊ฐ |
๋น๊ต ๋ฐฉ์
| Model | Setting ์ค๋ช |
| π0-flat / π0-small-flat | ์ ์ฒด task instruction๋ง ์ ๊ณต |
| π0-human / π0-small-human | ์ธ๊ฐ์ด ์ค๊ฐ ๋จ๊ณ instruction์ ์ ๊ณต |
| π0-HL | High-level VLM policy๊ฐ ์ค๊ฐ ๋จ๊ณ instruction์ ์๋ ์์ฑํด π0์ ์ ๋ฌ |
์ฃผ์ ๊ฒฐ๊ณผ
- π0๋ π0-small๋ณด๋ค ์ ๋ฐ์ ์ผ๋ก ๋์ Language Following ์ฑ๋ฅ์ ๋ณด์๋ค.
- ์ธ๊ฐ์ด ์ค๊ฐ instruction์ ์ ๊ณตํ์ ๋ π0์ ์ฑ๋ฅ์ด ํฌ๊ฒ ํฅ์๋๋ค.
- High-level VLM์ด ์์ฑํ instruction์ ์ฌ์ฉํ์ ๋๋ ์ฑ๋ฅ ํฅ์์ด ๋ํ๋ฌ๋ค.
- ๋ฐ๋ฉด π0-small์ ์ค๊ฐ instruction์ด ์ถ๊ฐ๋์ด๋ ๊ฐ์ ํญ์ด ์๋์ ์ผ๋ก ์์๋ค.
- VLM์ ์ธ์ด ์ดํด ๋ฅ๋ ฅ์ด ๋จ์ํ semantic representation์ ๋จธ๋ฌด๋ฅด์ง ์๊ณ ์ค์ robot action generation ์ฑ๋ฅ์ผ๋ก ์ฐ๊ฒฐ๋๋ค.
- ํนํ ๋ณต์กํ task๋ฅผ ์์ ๋จ๊ณ๋ก ๋๋์ด ์ธ์ด๋ก ์ ์ํ์ ๋ ์ฑ๋ฅ์ด ํฅ์๋๋ค๋ ์ ์, π0๊ฐ VLM์ ์ธ์ด ์ง์์ ์ค์ ์ ์ด์ ํจ๊ณผ์ ์ผ๋ก ํ์ฉํ๊ณ ์์์ ๋ณด์ฌ์ค๋ค.
6.3 Fine-tuning & Transfer

๋ชฉ์
Pre-training ๋ฐ์ดํฐ์ ํฌํจ๋์ง ์์ ์๋ก์ด task์ π0๋ฅผ Fine-tuningํ์ ๋ ์ผ๋ง๋ ๋น ๋ฅด๊ฒ ์ ์ํ๋์ง ํ๊ฐํ๋ค.
ํนํ Pre-training์์ ํ์ตํ skill์ด ์๋ก์ด task๋ก ์ผ๋ง๋ ์ transfer๋๋์ง, ๊ทธ๋ฆฌ๊ณ ์ ์ Fine-tuning ๋ฐ์ดํฐ์์๋ ํจ๊ณผ๊ฐ ์๋์ง๋ฅผ ํ์ธํ๋ค.
ํ๊ฐ Task
| ๊ตฌ๋ถ | Task | ์ค๋ช |
| Easy Tier | UR5e Stack Bowls | ์ฌ๋ฌ ๊ฐ์ ๊ทธ๋ฆ์ ์์๋๋ก ์๋ ์์ |
| Easy Tier | Towel Folding | ์๊ฑด์ ํผ์น๊ณ ์ ๋ ์์ |
| Unseen New Element | Tupperware in Microwave | ํ๋ผ์คํฑ ์ฉ๊ธฐ๋ฅผ ์ ์๋ ์ธ์ง ์์ ๋ฃ๋ ์์ . manipulation์ ์ ์ฌํ์ง๋ง ์๋ก์ด ํ๊ฒฝ ์์๊ฐ ๋ฑ์ฅ |
| New Motions / Object Types | Paper Towel Replacement | ๊ธฐ์กด ํด์ง๋ฅผ ์ ๊ฑฐํ๊ณ ์ ํด์ง๋ก ๊ต์ฒดํ๋ ์์ |
| New Motions / Object Types | Franka Items in Drawer | Franka ๋ก๋ด์ ์ด์ฉํด ๋ฌผ์ฒด๋ฅผ ์๋ ์์ ๋ฃ๋ ์์ |
๋น๊ต ๋ชจ๋ธ
| Model | ํ์ต ๋ฐฉ์ |
| OpenVLA | OXE Pre-training ํ Fine-tuning |
| Octo | OXE Pre-training ํ Fine-tuning |
| ACT | Target task ๋ฐ์ดํฐ๋ก scratch๋ถํฐ ํ์ต |
| Diffusion Policy | Target task ๋ฐ์ดํฐ๋ก scratch๋ถํฐ ํ์ต |
| π0 Fine-tuned | Pre-trained π0๋ฅผ ์๋ก์ด task์ Fine-tuning |
| π0-scratch | Pre-training ์์ด ํด๋น task ๋ฐ์ดํฐ๋ง์ผ๋ก ํ์ต |
ํ๊ฐ ๋ฐฉ์
Fine-tuning์ ์ฌ์ฉํ๋ ๋ฐ์ดํฐ ์์ ๋ณํ์ํค๋ฉฐ ์ฑ๋ฅ์ ๋น๊ตํ๋ค.
์๋ฅผ ๋ค์ด
- 1์๊ฐ
- 5์๊ฐ
- 25์๊ฐ
๋ฑ ์๋ก ๋ค๋ฅธ ๋ฐ์ดํฐ ์์์ ๊ฐ ๋ชจ๋ธ์ ์ฑ๋ฅ ๋ณํ๋ฅผ ์ธก์ ํ๋ค.
์ฃผ์ ๊ฒฐ๊ณผ
- π0 Fine-tuned๊ฐ ์ ๋ฐ์ ์ผ๋ก ๋ค๋ฅธ ๋ฐฉ๋ฒ๋ณด๋ค ๋์ ์ฑ๋ฅ์ ๋ณด์๋ค.
- ํนํ ์ ์ Fine-tuning ๋ฐ์ดํฐ ์กฐ๊ฑด์์ π0 Fine-tuned์ π0-scratch์ ์ฐจ์ด๊ฐ ํฌ๊ฒ ๋ํ๋ฌ๋ค.
- Pre-training์์ ๊ฒฝํํ ํ๋๊ณผ ์ ์ฌํ task์ผ์๋ก transfer ํจ๊ณผ๊ฐ ๋ ํฌ๊ฒ ๋ํ๋ฌ๋ค.
- ACT์ Diffusion Policy๋ ์ผ๋ถ task์์ ๋์ ์ฑ๋ฅ์ ๋ณด์์ง๋ง ์ ์ฒด์ ์ผ๋ก π0๋ฅผ ๋์ง๋ ๋ชปํ๋ค.
- Pre-training์์ ํ์ตํ ๋ฒ์ฉ์ ์ธ physical skill์ด ์๋ก์ด task์ ํ์ต ํจ์จ์ ๋์ธ๋ค.
- ํนํ ๋ฐ์ดํฐ๊ฐ ์ ์์๋ก Pre-training์ ์ด์ ์ด ํฌ๊ฒ ๋ํ๋๋ค๋ ์ ์, π0๊ฐ ํน์ task์ ํ๋์ ๋จ์ํ ์๊ธฐํ ๊ฒ์ด ์๋๋ผ ๋ค๋ฅธ task์์๋ ์ฌ์ฌ์ฉํ ์ ์๋ representation๊ณผ skill์ ํ์ตํ์์ ๋ณด์ฌ์ค๋ค.
6.4 Complex Dexterous Manipulation

๋ชฉ์
π0๊ฐ ๋จ์ํ pick-and-place๋ฅผ ๋์ด, ์์ญ ๋ถ ๋์ ์ฌ๋ฌ ํ๋์ ์ฐ์์ ์ผ๋ก ์ํํด์ผ ํ๋ ๋ณต์กํ๊ณ ๊ธด horizon์ dexterous manipulation๊น์ง ์ฒ๋ฆฌํ ์ ์๋์ง ํ๊ฐํ๋ค.
์ด ์คํ์์๋ ๊ฐ์ฒด ์ผ๋ฐํ, ์ํ ํ์, ์ ๋ฐ ํ์ง, ํ๋ ์์ ๊ฒฐ์ ๋ฑ ์ฌ๋ฌ ๋ฅ๋ ฅ์ด ๋์์ ์๊ตฌ๋๋ค.
ํ๊ฐ Task
| Task | ์ค๋ช |
| Laundry Folding | ์ด๊ธฐ ์ํ๊ฐ ๋งค๋ฒ ๋ค๋ฅธ ๋นจ๋๋ฅผ ํผ์น๊ณ ์ ๋ ์์ |
| Mobile Dryer | ๋ชจ๋ฐ์ผ ๋ก๋ด์ด ๊ฑด์กฐ๊ธฐ์์ ๋นจ๋๋ฅผ ๊บผ๋ด ๋ฐ๊ตฌ๋์ ๋ฃ๋ ์์ |
| Table Bussing | ๋ค์ํ ๋ฌผ์ฒด๊ฐ ๋์ธ ์ค์ ์ํ์ ์ ๋ฆฌํ๋ ์์ |
| Box Building | ๋ฉ์ํ ํ์ง ์์๋ฅผ ์กฐ๋ฆฝํ๋ ์์ . ์ํ ํ์๊ณผ ๊ตฌ์กฐ ์ง์ง๊ฐ ํ์ |
| To-go Box | ์ ์์ ์์์ ํ ์ดํฌ์์ ์ฉ๊ธฐ์ ์ฎ๊ธฐ๊ณ ์์๋ฅผ ๋ซ๋ ์์ |
| Packing Eggs | ๋ฌ๊ฑ์ ์ง์ด ๋ฌ๊ฑํ์ ๋ฃ๊ณ ๋๊ป์ ๋ซ๋ ์์ . ์ ๋ฐ ํ์ง๊ฐ ํ์ |
๋น๊ต ๋ฐฉ์
| Model | ์ค๋ช |
| Full π0 | Pre-training + Post-training์ ๋ชจ๋ ์ํ |
| π0 Zero-shot | Pre-training๋ง ์ํ |
| π0 Scratch | Post-training์ฉ task ๋ฐ์ดํฐ๋ง์ผ๋ก ์ฒ์๋ถํฐ ํ์ต |
์ฃผ์ ๊ฒฐ๊ณผ
- Full π0๊ฐ ๋ชจ๋ ๋ณต์กํ task์์ ๊ฐ์ฅ ๋์ ์ฑ๋ฅ์ ๊ธฐ๋กํ๋ค.
- ๋๋๊ฐ ๋์ task์ผ์๋ก Pre-training์ ํจ๊ณผ๊ฐ ๋ ํฌ๊ฒ ๋ํ๋ฌ๋ค.
- π0-scratch๋ ํนํ ๋ณต์กํ multi-stage task์์ ๋ฎ์ ์ฑ๋ฅ์ ๋ณด์๋ค.
- Pre-training๋ง ์ํํ Zero-shot ๋ชจ๋ธ๋ณด๋ค Post-training๊น์ง ์ ์ฉํ Full π0๊ฐ ์์ ์ ์ผ๋ก ๋์ ์ฑ๋ฅ์ ๋ณด์๋ค.
- Pre-training๊ณผ Post-training์ ์๋ก ๋ค๋ฅธ ์ญํ ์ ์ํํ๋ฉฐ, ๋ ๋จ๊ณ๋ฅผ ๊ฒฐํฉํ ๋ ๋ณต์กํ manipulation์์ ๊ฐ์ฅ ๋์ ์ฑ๋ฅ์ ์ป๋๋ค.
- Pre-training์ ๋ค์ํ robot experience๋ฅผ ํตํด ๋ฒ์ฉ์ ์ธ physical skill๊ณผ generalization ๋ฅ๋ ฅ์ ์ ๊ณตํ๊ณ , Post-training์ ํน์ task์์ ์๊ตฌ๋๋ ์ ๋ฐ์ฑ, ์์ ์ฑ, ์๋ จ๋๋ฅผ ๊ฐํํ๋ค.
7. ํต์ฌ ์ ๋ฆฌ
π0์ ํต์ฌ์ ๋จ์ํ VLM์ robot action head๋ฅผ ์ถ๊ฐํ ๊ฒ์ด ์๋๋ค.
1. VLM์ ์ง์์ ๋ก๋ด ์ ์ด๋ก ์ฐ๊ฒฐ
PaliGemma์ ์๊ฐ·์ธ์ด ์ง์์ ์ ์งํ๋ฉด์ Action Expert๋ฅผ ์ถ๊ฐํด low-level robot control๊น์ง ์ฐ๊ฒฐํ๋ค.
2. Continuous Action์ ์ง์ ๋ชจ๋ธ๋ง
Flow Matching๊ณผ Action Chunking์ ์ฌ์ฉํด discrete token ๋์ ์ฐ์์ ์ธ action distribution์ ๋ชจ๋ธ๋งํ๋ค.
3. ๋ฒ์ฉ์ฑ๊ณผ ์๋ จ๋๋ฅผ ํ์ต ๋จ๊ณ์์ ๋ถ๋ฆฌ
- Pre-training: ๋ค์ํ ๋ก๋ด๊ณผ task์์ ๋ฒ์ฉ์ ์ธ physical skill ํ๋ณด
- Post-training: ํน์ task์ ์๋ จ๋์ ์ ๋ฐ์ฑ ๊ฐํ
๊ฒฐ๊ตญ π0๋
VLM์ semantic knowledge + continuous action modeling + large-scale robot learning
์ ๊ฒฐํฉํด ๋ฒ์ฉ์ฑ(generalization)๊ณผ ๋ฅ์ํจ(dexterity)์ ๋์์ ํ๋ณดํ๋ ค๋ Robot Foundation Model์ด๋ค.