Jul 2026
Scalable Visual Pretraining for Language Intelligence
This paper conducts a systematic study of unsupervised visual pretraining paradigms that directly leverage visual documents without text extraction, showing that Visual Pretraining is a scalable learner for foundation model intelligence.
Yiming Zhang, Zhonghan Zhao, Wenwei Zhang et al.
· arXiv.org · 2 citations