@article{lostinbenchmarksrethinkinglargelanguage, title = {Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory}, author = {Hongli Zhou and Hui Huang and Ziqing Zhao and Lvyuan Han and Huicheng Wang and Kehai Chen and Muyun Yang and Wei Bao and Jian Dong and Bing Xu and Conghui Zhu and Hailong Cao and Tiejun Zhao}, year = {2025}, eprint = {2505.15055}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.15055v1}, }