@article{tdgrokkinglearningfromzerorewardproblems, title = {TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition}, author = {Ningyuan Xi and Hao Xu and Hongsheng Xin and Ning Miao}, year = {2026}, eprint = {2606.09883}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.09883}, }