@article{medicallargelanguagemodelbenchmarks, title = {Medical Large Language Model Benchmarks Should Prioritize Construct Validity}, author = {Ahmed Alaa and Thomas Hartvigsen and Niloufar Golchini and Shiladitya Dutta and Frances Dean and Inioluwa Deborah Raji and Travis Zack}, year = {2025}, eprint = {2503.10694}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.10694v1}, }