Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization
This work presents Gradient-free Analytical Trajectory Optimization Video Generation (GATO-Vid), a novel training-free and gradient-free approach for precise spatial guidance that significantly outperforms existing baselines in localization accuracy while introducing minimal computational overhead.