@article{provablyefficientofflinereinforcement, title = {Provably Efficient Offline Reinforcement Learning with Trajectory-Wise Reward}, author = {Tengyu Xu and Yue Wang and Shaofeng Zou and Yingbin Liang}, year = {2022}, eprint = {2206.06426}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2206.06426v2}, }