paper
-with-
me
Papers
Browse State-of-the-Art
Datasets
Methods
AI Agents
Trends
Digest
🌙
Language Modelling
벤치마크
Language Modelling on enwik8
42개 결과 ·
⬇ CSV
·
JSON
Bit per Character (BPC)
0.93
1.115
1.3
1.485
1.67
2013-08
2026-09
LSTM (7 layers) — 1.67 (2013-08-04)
Recurrent Highway Networks — 1.27 (2016-07-12)
LN HM-LSTM — 1.32 (2016-09-06)
Large mLSTM — 1.24 (2016-09-26)
Hypernetworks — 1.34 (2016-09-27)
ByteNet — 1.31 (2016-10-31)
Large FS-LSTM-4 — 1.25 (2017-05-24)
AWD-LSTM (3 layers) — 1.232 (2018-03-22)
Transformer (64 layers) — 1.06 (2018-08-09)
64-layer Character Transformer Model — 1.11 (2018-08-09)
Transformer-XL (24 layers) — 0.99 (2019-01-09)
Transformer-XL (18 layers) — 1.03 (2019-01-09)
Transformer-XL (12 layers) — 1.06 (2019-01-09)
GPT-2 (48 layers, h=1600) — 0.93 (2019-02-14)
Transformer-XL (24 layers, RMS dynamic eval, decay) — 0.94 (2019-04-17)
Sparse Transformer (30 layers, fixed attn) — 0.99 (2019-04-23)
Transformer (24 layers, 8k adaptive span) — 0.98 (2019-05-19)
Transformer (12 layers, 8k adaptive span) — 1.02 (2019-05-19)
All-attention network (18 layers) — 1.01 (2019-07-02)
Mogrifier LSTM — 1.146 (2019-09-04)
LSTM — 1.195 (2019-09-04)
Sandwich Transformer (adaptive span) — 0.968 (2019-11-10)
BP-Transformer (12 layers) — 1.02 (2019-11-11)
Compressive Transformer (24 layers) — 0.97 (2019-11-13)
SHA-RNN (4 layers, h=1024, attention head per layer) — 1.068 (2019-11-26)
SHA-RNN (4 layers, h=1024, single attention head) — 1.076 (2019-11-26)
SHA-LSTM (4 layers, h=1024, no attention head) — 1.33 (2019-11-26)
Feedback Transformer — 0.96 (2020-02-21)
Routing Transformer (12 layers) — 0.99 (2020-03-12)
Longformer (30 layers, h=512) — 0.99 (2020-04-10)
Longformer (12 layers, h=512) — 1.0 (2020-04-10)
Cluster-Former (#C=512) — 1.22 (2020-09-13)
SRU++ Large — 0.95 (2021-02-24)
SRU++ Base — 0.97 (2021-02-24)
Expire-Span (24 layers) — 0.95 (2021-05-13)
Transformer-LS (large) — 0.97 (2021-07-05)
Transformer-LS (small) — 0.99 (2021-07-05)
Hourglass — 0.997 (2021-10-26)
Focus — 0.94 (2023-05-24)
Transformer+SSA — 1.024 (2023-06-02)
Skip Cross-Head Transformer-XL — 1.033 (2023-11-14)
LSTM (7 layers) — 1.67 (2013-08-04)
2013-08-04 — LSTM (7 layers): Bit per Character (BPC) 1.67
Rank
Model
Bit per Character (BPC)
Number of params
Extra Training Data
Paper
Code
Year
1
GPT-2 (48 layers, h=1600)
0.93
1542M
✓
Language Models are Unsupervised Multitask Learners
huggingface/transformers
·
openai/gpt-2
·
PaddlePaddle/PaddleNLP
·
+18
2019
2
Transformer-XL (24 layers, RMS dynamic eval, decay)
0.940
277M
✓
Dynamic Evaluation of Transformer Language Models
benkrause/dynamiceval-transformer
2019
2
Focus
0.940
22M
Focus Your Attention (with Adaptive IIR Filters)
2023
4
Expire-Span (24 layers)
0.95
208M
Not All Memories are Created Equal: Learning to Forget by Expiring
facebookresearch/transformer-sequential
2021
4
SRU++ Large
0.95
195M
When Attention Meets Fast Recurrence: Training Language Models with Reduced Compute
asappresearch/sru
2021
6
Feedback Transformer
0.96
77M
Addressing Some Limitations of Transformers with Feedback Memory
labmlai/annotated_deep_learning_paper_implementations
·
facebookresearch/transformer-sequential
·
lucidrains/feedback-transformer-pytorch
·
+1
2020
7
Sandwich Transformer (adaptive span)
0.968
209M
Improving Transformer Models by Reordering their Sublayers
ofirpress/sandwich_transformer
·
JunnYu/x-transformers-paddle
2019
8
Compressive Transformer (24 layers)
0.97
277M
Compressive Transformers for Long-Range Sequence Modelling
labmlai/annotated_deep_learning_paper_implementations
·
google-deepmind/pg19
·
deepmind/pg19
·
+3
2019
8
Transformer-LS (large)
0.97
110M
Long-Short Transformer: Efficient Transformers for Language and Vision
keonlee9420/Comprehensive-Transformer-TTS
·
NVIDIA/transformer-ls
·
lucidrains/long-short-transformer
2021
8
SRU++ Base
0.97
108M
When Attention Meets Fast Recurrence: Training Language Models with Reduced Compute
asappresearch/sru
2021
11
Transformer (24 layers, 8k adaptive span)
0.98
209M
Adaptive Attention Span in Transformers
facebookresearch/adaptive-span
·
jerrodparker20/adaptive-transformers-in-rl
·
prajjwal1/fluence
·
+5
2019
12
Transformer-XL (24 layers)
0.99
277M
Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context
huggingface/transformers
·
labmlai/annotated_deep_learning_paper_implementations
·
NVIDIA/DeepLearningExamples
·
+34
2019
12
Longformer (30 layers, h=512)
0.99
102M
Longformer: The Long-Document Transformer
huggingface/transformers
·
mistralai/mistral-src
·
facebookresearch/xformers
·
+19
2020
12
Sparse Transformer (30 layers, fixed attn)
0.99
95M
Generating Long Sequences with Sparse Transformers
mistralai/mistral-src
·
openai/sparse_attention
·
wilson1yan/VideoGPT
·
+4
2019
12
Routing Transformer (12 layers)
0.99
–
Efficient Content-Based Sparse Attention with Routing Transformers
lucidrains/local-attention
·
lucidrains/routing-transformer
2020
12
Transformer-LS (small)
0.99
–
Long-Short Transformer: Efficient Transformers for Language and Vision
keonlee9420/Comprehensive-Transformer-TTS
·
NVIDIA/transformer-ls
·
lucidrains/long-short-transformer
2021
17
Hourglass
0.997
–
Hierarchical Transformers Are More Efficient Language Models
labmlai/annotated_deep_learning_paper_implementations
·
google/trax
·
lucidrains/hourglass-transformer-pytorch
2021
18
Longformer (12 layers, h=512)
1.00
41M
Longformer: The Long-Document Transformer
huggingface/transformers
·
mistralai/mistral-src
·
facebookresearch/xformers
·
+19
2020
19
All-attention network (18 layers)
1.01
39M
Augmenting Self-attention with Persistent Memory
lucidrains/x-transformers
·
facebookresearch/adaptive-span
2019
20
Transformer (12 layers, 8k adaptive span)
1.02
39M
Adaptive Attention Span in Transformers
facebookresearch/adaptive-span
·
jerrodparker20/adaptive-transformers-in-rl
·
prajjwal1/fluence
·
+5
2019
1–20 / 42
다음 →
페이지당
10
20
50
100