| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- joint training of textual and layout information
- multilingual
- layoutxml
- 레이블링
- Test set
- 딥러닝
- layoutlm
- VrDU
- document understanding
- OCR
- Text Recognition
- Pre-training
- document image understanding
- Today
- Total
목록전체 글 (29)
JM_Research Blog
DINOv2: Learning Robust Visual Features without Supervisionhttps://arxiv.org/abs/2304.07193Meta AI (FAIR)대규모의 정제된 이미지 데이터와 자기지도학습(Self-Supervised Learning)을 이용해, 별도의 라벨이나 텍스트 없이도 다양한 비전 태스크에 재사용할 수 있는 범용 시각 표현(General-purpose Visual Features)을 학습한 모델이다.3줄 요약DINOv2는 이미지 라벨이나 텍스트-이미지 쌍 없이, 1억 4,200만 장 규모의 LVD-142M 데이터로 강력한 범용 시각 특징을 학습한다.학습에는 DINO의 image-level self-distillation, iBOT의 masked patch..
📄 π0: A Vision-Language-Action Flow Model for General Robot Control0️⃣ MetaTitle: A Vision-Language-Action Flow Model for General Robot ControlAuthors / Year: 2024 10 31Venue:Paper link: https://arxiv.org/pdf/2410.24164v1Code / Project: 구성 요소 설명 VLM BackbonePaliGemma, 약 3BAction ExpertTransformer, 약 300MAction ModelingFlow Matching출력50-step Continuous Action Chunk 🌞One-line Summaryπ0는 VLM의 시..
1. 핵심 의의기존 VLA의 observation → action 직접 매핑 사이에 future visual subgoal을 삽입해, 언어 명령과 저수준 제어 사이에 명시적인 시각적 계획 단계를 만든다.미래 이미지를 단순 설명용 출력으로 사용하지 않고 action prediction의 조건으로 다시 입력해, 어디로 가야 하는가와 어떻게 갈 것인가를 연결한다.Future frame을 공통 supervision으로 사용하면 robot demonstration뿐 아니라 action label이 없는 일반 영상도 학습에 활용할 수 있다.Action chunk에는 full attention, 미래 visual token에는 causal attention을 적용해 하나의 decoder-only Transformer..
1. 핵심 의의1.1 Generalist Policy Pre-training여러 로봇의 데이터를 함께 사전학습해, 새로운 로봇에서도 처음부터 정책을 만들지 않고 적은 시연 데이터로 빠르게 적응할 수 있는 범용 정책 초기값을 만들었다.1.2 Modular Input / Output로봇마다 sensor와 action space가 달라도 pretrained Transformer를 최대한 재사용할 수 있도록 입력 tokenizer와 출력 action head를 모듈식으로 설계했다.1.3 Diffusion Action Chunk행동을 이산 token으로 바꾸지 않고 여러 미래의 continuous action을 하나의 chunk로 diffusion 생성해, 여러 가능한 행동 경로와 시간적으로 연결된 움직임을 표현..
