AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research
This work introduces AutoWorldModel-Bench, a closed-loop benchmark in which frontier coding agents autonomously improve a provided base world model under a fixed compute budget, and offers a setting in which frontier coding agents can be evaluated on open-ended research rather than engineering-to-spec problems.