@article{fp8rlapracticalandstablelowprecisionstac, title = {FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning}, author = {Zhaopeng Qiu and Shuang Yu and Jingqi Zhang and Shuai Zhang and Xue Huang and Jingyi Yang and Junjie Lai}, year = {2026}, eprint = {2601.18150}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.18150}, }