RISK-SENSITIVE Q-LEARNING IN A TWO-AGENT MARKOV ATTACK–DEFENSE MODEL
A risk-sensitive method for forming a web application security testing policy based on entropic-risk Q-learning in a two-agent Markov attack–defense model is proposed. The study addresses the need to detect short critical compromise trajectories under partial observability, noisy estimation of defensive attributes, and...