Jul 2026
Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability
This work generalizes preference-based RL by formalizing a novel setting in which the expert can also label trajectory pairs as incomparable, i.e., when neither trajectory dominates the other.
Simone Drago, Marco Mussi, L. Bianconi et al.
· arXiv.org · 0 citations