SLIP-VLA: Single-Step Latent Imagination for Policy Learning in Vision-Language-Action Models
Vision-Language-Action models are increasingly effective for robotic manipulation, yet most predict actions directly from current observations without explicitly modeling future scene evolution. Recent methods introduce future prediction to improve action generation, but dense future modeling often requires expensive i...