@article{batonenhancingbatchwiseinference, title = {BATON: Enhancing Batch-wise Inference Efficiency for Large Language Models via Dynamic Re-batching}, author = {Peizhuang Cong and Qizhi Chen and Haochen Zhao and Tong Yang}, year = {2024}, eprint = {2410.18701}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.18701v1}, }