paper-with-me

Hutter Prize

홈페이지 · 논문 12편

The Hutter Prize Wikipedia dataset, also known as enwiki8, is a byte-level dataset consisting of the first 100 million bytes of a Wikipedia XML dump. For simplicity we shall refer to it as a character-level dataset. Within these 100 million bytes are 205 unique tokens. Source: NLP Progress

Texts English

벤치마크

Language Modelling on Hutter Prize 결과 18개