Integrating Physics-Informed Neural Networks for Safe Reinforcement Learning in a 1-DoF Helicopter System
This work-in-progress paper embeds a differentiable physics model directly into the proximal policy optimization (PPO) actor loss function, by simulating short-horizon future trajectories during training, to reduce constraint violations while maintaining reliable target tracking.