@article{yourrewardfunctionforrlisyourbestprmfors, title = {AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning}, author = {Can Jin and Yang Zhou and Qixin Zhang and Hongwu Peng and Di Zhang and Zihan Dong and Marco Pavone and Ligong Han and Zhang-Wei Hong and Tong Che and Dimitris N. Metaxas}, year = {2025}, eprint = {2508.14313}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2508.14313}, }