Preventing Control Loss in Stochastic Environments: Recurrent Proximal Policy Optimization with Conditional Value at Risk
Preventing transient control loss in risk-critical human-machine systems requires dynamic intervention strategies that account for unobservable user states. Traditional control frameworks relying on fully observable Markov decision processes are inadequate for this task, as they inherently suffer from perceptual aliasi...