Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents
Across multi-step visual tool-use benchmarks, SPARE achieves the highest average accuracy among pruning methods while removing 37.89-64.58\% of reasoning tokens, showing that reducing textual dominance restores reliance on visual evidence and mitigates over-conditioning on self-generated language.