paper-with-me

WikiText-TL-39

홈페이지 · 논문 3편

WikiText-TL-39 is a benchmark language modeling dataset in Filipino that has 39 million tokens in the training set. Source: [Evaluating Language Model Finetuning Techniques for Low-resource Languages](/paper/evaluating-language-model-finetuning)

Texts Filipino