arXiv:1706.03762 · 2017
Attention Is All You Need
The dominant sequence transduction models are based on complex recurrent or convolutional neural networks that include an encoder and a decoder. The best performing models also connect the encoder and decoder through an attention mechanism. We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely. Experiments on two machine translation tasks show these models to be superior in quality while being more parallelizable and requiring significantly less time to train. Our model achieves 28.4 BLEU on the WMT 2014 English-to-German translation task, improving over the existing best results, including ensembles, by over 2 BLEU. On the WMT 2014 English-to-French translation task, our model establishes a new single-model state-of-the-art BLEU score of 41.8 after training for 3.5 days on eight GPUs, a small fraction of the training costs of the best models from the literature. We show that the Transformer generalizes well to other tasks by applying it successfully to English constituency parsing both with large and limited training data.
Current guide
Version 40
- Difficulty
- Intermediate
- Study time
- 120 minutes
- Coverage
- 6 learning objectives
- Quality
- Equation fidelity: high
Immutable history
Guide versions
- Version 40CurrentRead guide version 40
Show 38 earlier guide versions
- Version 39ArchivedRead guide version 39
- Version 38ArchivedRead guide version 38
- Version 37ArchivedRead guide version 37
- Version 36ArchivedRead guide version 36
- Version 35ArchivedRead guide version 35
- Version 34ArchivedRead guide version 34
- Version 33ArchivedRead guide version 33
- Version 32ArchivedRead guide version 32
- Version 31ArchivedRead guide version 31
- Version 30ArchivedRead guide version 30
- Version 29ArchivedRead guide version 29
- Version 28ArchivedRead guide version 28
- Version 27ArchivedRead guide version 27
- Version 26ArchivedRead guide version 26
- Version 25ArchivedRead guide version 25
- Version 24ArchivedRead guide version 24
- Version 23ArchivedRead guide version 23
- Version 22ArchivedRead guide version 22
- Version 21ArchivedRead guide version 21
- Version 20ArchivedRead guide version 20
- Version 19ArchivedRead guide version 19
- Version 18ArchivedRead guide version 18
- Version 17ArchivedRead guide version 17
- Version 16ArchivedRead guide version 16
- Version 15ArchivedRead guide version 15
- Version 14ArchivedRead guide version 14
- Version 13ArchivedRead guide version 13
- Version 12ArchivedRead guide version 12
- Version 11ArchivedRead guide version 11
- Version 10ArchivedRead guide version 10
- Version 9ArchivedRead guide version 9
- Version 8ArchivedRead guide version 8
- Version 7ArchivedRead guide version 7
- Version 6ArchivedRead guide version 6
- Version 5ArchivedRead guide version 5
- Version 4ArchivedRead guide version 4
- Version 3ArchivedRead guide version 3
- Version 1ArchivedRead guide version 1