Preprint
Aug 2026
Knowing Isn't Always Saying: When Do Spatial Encodings Reach Answers in Vision-Language Models?
irection patching is addressed with direction patching, a class-conditioned causal intervention applied across layers, token positions, and prompt formats to reframe the encoding-grounding gap as a problem of conditional transport in VLMs.
Ze-Yu Wang, Xinming Xu
· 0 citations