Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
Pose-VLA is proposed, a decoupled paradigm that separates VLA training into a pre-training phase for extracting universal 3D spatial priors in a unified camera-centric space, and a post-training phase for efficient embodiment alignment within robot-specific action space.