paper-with-me

ListUltraFeedback

홈페이지 · 논문 1편

A listwise multi-response dataset for human preferences alignment. The dataset is derived from UltraFeedback and SimPO.

Texts English