Aug 2026
Quality-Diversity Reinforcement Learning using Behavior Regulated Policy Gradient
BRPG-MAP-Elites is introduced, a new QD-RL algorithm adopting a strictly Markovian actor-critic architecture within the MAP-Elites framework that demonstrates a 43% improvement in average QD-scores over DCRL-MAP-Elites and achieves higher robustness in the generated policies.
Runjun Mao, Antoine Cully
· ACM Transactions on Evolutio... · 0 citations