Embedding Safety into RL: A New Take on Trust Region Methods

  • Authors: Nikola Milosevic, Johannes Müller, Nico Scherf
  • First public date: 2024-11-05
  • arXiv: 2411.02957
  • Preprint year: 2024
  • Status: Published
  • Publication type: Conference paper
  • Publication year: 2025
  • Proceedings: Proceedings of the 42nd International Conference on Machine Learning, PMLR 267 (2025)
  • Publication details: Author’s publication list

Abstract

Reinforcement Learning (RL) agents can solve diverse tasks but often exhibit unsafe behavior. Constrained Markov Decision Processes (CMDPs) address this by enforcing safety constraints, yet existing methods either sacrifice reward maximization or allow unsafe training. We introduce Constrained Trust Region Policy Optimization (C-TRPO), which reshapes the policy space geometry to ensure trust regions contain only safe policies, guaranteeing constraint satisfaction throughout training. We analyze its theoretical properties and connections to TRPO, Natural Policy Gradient (NPG), and Constrained Policy Optimization (CPO). Experiments show that C-TRPO reduces constraint violations while maintaining competitive returns.

Associated SAiS members

Research areas

BibTeX

@inproceedings{arxiv241102957,
  title = {Embedding Safety into RL: A New Take on Trust Region Methods},
  author = {Nikola Milosevic and Johannes Müller and Nico Scherf},
  year = {2025},
  eprint = {2411.02957},
  archivePrefix = {arXiv},
  primaryClass = {cs.LG},
  booktitle = {Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025}
}

Similar Posts