Preprint
Jul 2026
Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers
Chimera, a hybrid visual diffusion backbone with a principled scaling recipe that combines Kimi Delta Attention for long-context state tracking with O(N) complexity, interleaved Multi-head Latent Attention (MLA) for direct global interaction, and modality-aware short convolutions for local spatiotemporal context is introduced.
Chongjian Ge, Hanwen Jiang, Tianyu Wang et al.
· 1 citation