Доминирующие модели передачи последовательности основаны на сложных рекуррентных или конволюционных нейронных сетях в конфигурации кодер-декодер. Наиболее эффективные модели также связывают кодер и декодер через механизм внимания. Мы предлагаем новую простую сетевую архитектуру «Трансформатор», основанную исключительно на механизмах внимания и полностью отказывающуюся от рекуррентных и конволюционных механизмов. Эксперименты на двух задачах машинного перевода показали, что эти модели превосходят по качеству, при этом они лучше распараллеливаются и требуют значительно меньше времени на обучение. Наша модель достигает 28,4 BLEU в задаче перевода с английского на немецкий язык WMT 2014, что более чем на 2 BLEU лучше существующих лучших результатов, включая ансамбли. На задаче перевода с английского на французский в рамках WMT 2014 наша модель показывает новый рекордный результат BLEU для одной модели — 41,0 балла после обучения в течение 3,5 дней на восьми графических процессорах, что составляет лишь малую часть затрат на обучение лучших моделей из литературы. Мы показываем, что трансформатор хорошо обобщается на другие задачи, успешно применяя его для синтаксического разбора английского языка как на больших, так и на ограниченных обучающих данных.
0
