@article{healthbenchevaluatinglargelanguagemodels, title = {HealthBench: Evaluating Large Language Models Towards Improved Human Health}, author = {Rahul K. Arora and Jason Wei and Rebecca Soskin Hicks and Preston Bowman and Joaquin QuiƱonero-Candela and Foivos Tsimpourlas and Michael Sharman and Meghan Shah and Andrea Vallone and Alex Beutel and Johannes Heidecke and Karan Singhal}, year = {2025}, eprint = {2505.08775}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.08775v1}, }