@article{monitorbenchacomprehensivebenchmarkforch, title = {MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models}, author = {Han Wang and Yifan Sun and Brian Ko and Mann Talati and Jiawen Gong and Zimeng Li and Naicheng Yu and Xucheng Yu and Wei Shen and Vedant Jolly and Huan Zhang}, year = {2026}, eprint = {2603.28590}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2603.28590}, }