Weekly Review #1

2026.05.19 ~ 2026.06.05

이번 Weekly Review는 첫 번째 review이므로, 최근 일주일이 아니라 지금까지 읽었던 모든 논문을 커버한다.

최근 VLA/WAM 계열 연구는 단순한 “image + language → action” policy를 넘어, 로봇의 closed-loop behavior를 위해 action representation, latent reasoning, future prediction, inference scheduling, data repair loop까지 포함하는 structured robot intelligence stack으로 이동하고 있다.


이번 주 핵심 Axis

Generalist VLA / Foundation Model

  • 핵심 변화: 여러 task, embodiment, environment를 하나의 embodied action/world-modeling framework로 통합
  • 대표 논문: Qwen-VLA, Cosmos 3, $\tau_{0}$-WM

World Action Model / Video-Action Model

Inference-time Adaptation

Data and Sim-to-Real Loop

Structured Reasoning / Skill / Spatial Priors


논문 핵심 regime 해석

Qwen-VLA

  • 핵심 regime: mixed foundation-model training
  • 해석: pretrained VLM + scratch action expert + T2A/CPT/SFT/RL

Cosmos 3

  • 핵심 regime: foundation-model pretraining/post-training
  • 해석: omnimodal world model + robot policy post-training

$\tau_{0}$-WM

  • 핵심 regime: WAM training / foundation-model-style training
  • 해석: VAM, ACVS, action selection/rectification을 통합

SMoDP

  • 핵심 regime: scratch-training
  • 해석: skill-conditioned MoE diffusion policy 학습

Factory-Floor VLA

  • 핵심 regime: fine-tuning
  • 해석: pretrained π0.5를 industrial task에 맞게 fine-tuning

HyperSim

  • 핵심 regime: fine-tuning / sim-to-real co-training
  • 해석: simulation data + small real data로 policy 학습

VLAMotor

  • 핵심 regime: fine-tuning via data synthesis
  • 해석: failure-derived repaired data로 VLA fine-tuning

GRAIL

  • 핵심 regime: data-generation + policy fine-tuning
  • 해석: generated 4D HOI data로 tracking/visual policy 학습

3DThinkVLA

  • 핵심 regime: fine-tuning + auxiliary-module-training + component-scratch-training
  • 해석: 3D teacher/adapters를 학습 중 사용하고, inference에서는 2D image-only VLA로 동작

PointAction

  • 핵심 regime: fine-tuning + component-scratch-training
  • 해석: video model fine-tuning + action decoder 학습

OSCAR

  • 핵심 regime: fine-tuning
  • 해석: pretrained video DiT를 skeleton-conditioned WAM으로 fine-tuning

Flash-WAM

  • 핵심 regime: distillation / fine-tuning
  • 해석: teacher WAM을 modality-aware consistency distillation

ElegantVLA

  • 핵심 regime: scheduler-training
  • 해석: frozen VLA 위 lightweight RL scheduler 학습

SANTS

  • 핵심 regime: scheduler-training
  • 해석: frozen WAM 위 state-adaptive denoising scheduler 학습

Realtime-VLA FLASH

  • 핵심 regime: auxiliary-module-training
  • 해석: draft model + consistency verification framework

DEFLECT

  • 핵심 regime: fine-tuning
  • 해석: delay-derived preference pair로 flow-matching VLA post-training

OxyGen

  • 핵심 regime: training-free
  • 해석: unified KV cache manager 중심 inference system

PACE

  • 핵심 regime: training-free
  • 해석: action chunk speed valley 기반 test-time execution

DVAC

  • 핵심 regime: training-free
  • 해석: denoising variance 기반 adaptive chunking

Continuous Reasoning

  • 핵심 regime: fine-tuning
  • 해석: continuous thought interface와 self-verification objective

See Less, Specify More

  • 핵심 regime: fine-tuning
  • 해석: local language relabeling + visual evidence budget 학습