Scalable Visual Pretraining for Language Intelligence
This paper conducts a systematic study of unsupervised visual pretraining paradigms that directly leverage visual documents without text extraction, showing that Visual Pretraining is a scalable learner for foundation model intelligence.