Stage-Aware Vision-Language-Action Model for Long-Horizon Robotic Manipulation
Vision-Language-Action (VLA) models learn generalist robot manipulation policies by mapping language instructions and visual observations to continuous actions through imitation learning. However, their performance degrades on long-horizon tasks, particularly when sub-tasks admit multiple valid execution orders. Since...