@article{provablysafereinforcementlearningforstoc, title = {Provably Safe Reinforcement Learning for Stochastic Reach-Avoid Problems with Entropy Regularization}, author = {Abhijit Mazumdar and Rafal Wisniewski and Manuela L. Bujorianu}, year = {2026}, eprint = {2601.08646}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.08646}, }