@article{pretraininglargelanguagemodelswithnvfp4, title = {Pretraining Large Language Models with NVFP4}, author = { NVIDIA and Felix Abecassis and Anjulie Agrusa and Dong Ahn and Jonah Alben and Stefania Alborghetti and Michael Andersch and Sivakumar Arayandi and Alexis Bjorlin and Aaron Blakeman and Evan Briones and Ian Buck and Bryan Catanzaro and Muya Chang and Jinhang Choi and Mike Chrzanowski and Eric Chung and Victor Cui and Steve Dai and Bita Darvish Rouhani and Carlo del Mundo and Deena Donia and Burc Eryilmaz and Henry Estela and Abhinav Goel and Oleg Goncharov and Yugi Guvvala and Robert Hesse and Russell Hewett and Herbert Hum and Ujval Kapasi and Brucek Khailany and Mikail Khona and Nick Knight and Alex Kondratenko and Ronny Krashinsky and Ben Lanir and Simon Layton and Michael Lightstone and Daniel Lo and Paulius Micikevicius and Asit Mishra and Tim Moon and Deepak Narayanan and Chao Ni and Abhijit Paithankar and Satish Pasumarthi and Ankit Patel and Mostofa Patwary and Ashwin Poojary and Gargi Prasad and Sweta Priyadarshi and Yigong Qin and Xiaowei Ren and Oleg Rybakov and Charbel Sakr and Sanjeev Satheesh and Stas Sergienko and Pasha Shamis and Kirthi Shankar and Nishant Sharma and Mohammad Shoeybi and Michael Siu and Misha Smelyanskiy and Darko Stosic and Dusan Stosic and Bor-Yiing Su and Frank Sun and Nima Tajbakhsh and Shelby Thomas and Przemek Tredak and Evgeny Tsykunov and Gandhi Vaithilingam and Aditya Vavre and Rangharajan Venkatesan and Roger Waleffe and Qiyu Wan and Hexin Wang and Mengdi Wang and Lizzie Wei and Hao Wu and Evan Wu and Keith Wyss and Ning Xu and Jinze Xue and Charlene Yang and Yujia Zhai and Ruoxi Zhang and Jingyang Zhu and Zhongbo Zhu}, year = {2025}, eprint = {2509.25149}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2509.25149}, }