paper-with-me

Language Modelling 벤치마크

Language Modelling on C4

9개 결과 · ⬇ CSV · JSON

Perplexity 낮을수록 좋음

12.35 13.24 14.13 15.02 15.91 2021-09 2026-09 Primer — 12.35 (2021-09-17) T5++ — 12.69 (2021-09-17) Original T5 — 13.25 (2021-09-17) N-Grammer 343M — 14.79 (2022-07-13) N-Grammer 288M — 15.01 (2022-07-13) Zeropoint LLM.int8 13B (vector-wise + decomp) — 12.45 (2022-08-15) LLM.float32 6.7B — 13.3 (2022-08-15) LLM.float32 2.7B — 14.43 (2022-08-15) LLM.float32 1.3B — 15.91 (2022-08-15) Primer — 12.35 (2021-09-17)
RankModel PerplexityTPUv3 HoursSteps PaperCodeYear
1 Primer 12.3517.3K1M Primer: Searching for Efficient Transformers for Language Modeling labmlai/annotated_deep_learning_paper_implementations · google-research/google-research · lucidrains/FLASH-pytorch · +1 2021
2 Zeropoint LLM.int8 13B (vector-wise + decomp) 12.45 LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale timdettmers/bitsandbytes · huggingface/transformers-bloom-inference · kohjingyu/fromage · +1 2022
3 T5++ 12.6916.5K1M Primer: Searching for Efficient Transformers for Language Modeling labmlai/annotated_deep_learning_paper_implementations · google-research/google-research · lucidrains/FLASH-pytorch · +1 2021
4 Original T5 13.2515.7K1M Primer: Searching for Efficient Transformers for Language Modeling labmlai/annotated_deep_learning_paper_implementations · google-research/google-research · lucidrains/FLASH-pytorch · +1 2021
5 LLM.float32 6.7B 13.3 LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale timdettmers/bitsandbytes · huggingface/transformers-bloom-inference · kohjingyu/fromage · +1 2022
6 LLM.float32 2.7B 14.43 LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale timdettmers/bitsandbytes · huggingface/transformers-bloom-inference · kohjingyu/fromage · +1 2022
7 N-Grammer 343M 14.79 N-Grammer: Augmenting Transformers with latent n-grams tensorflow/lingvo · yiyixuxu/n-grammer-flax 2022
8 N-Grammer 288M 15.01 N-Grammer: Augmenting Transformers with latent n-grams tensorflow/lingvo · yiyixuxu/n-grammer-flax 2022
9 LLM.float32 1.3B 15.91 LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale timdettmers/bitsandbytes · huggingface/transformers-bloom-inference · kohjingyu/fromage · +1 2022
1–9 / 9 페이지당 10 20 50 100