CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding
CLAP (Causal Language-Action Prediction), which prepends each numeric action sequence with a natural-language action description, causally conditioning precise action-token prediction on a language-action plan without modifying the backbone architecture, enabling controlled analysis of VLM-to-VLA capability transfer.