Главное меню » Google Research Transformer
Google Research Transformer

Доминирующие модели передачи последовательности основаны на сложных рекуррентных или конволюционных нейронных сетях в конфигурации кодер-декодер. Наиболее эффективные модели также связывают кодер и декодер через механизм внимания. Мы предлагаем новую простую сетевую архитектуру «Трансформатор», основанную исключительно на механизмах внимания и полностью отказывающуюся от рекуррентных и конволюционных механизмов. Эксперименты на двух задачах машинного перевода показали, что эти модели превосходят по качеству, при этом они лучше распараллеливаются и требуют значительно меньше времени на обучение. Наша модель достигает 28,4 BLEU в задаче перевода с английского на немецкий язык WMT 2014, что более чем на 2 BLEU лучше существующих лучших результатов, включая ансамбли. На задаче перевода с английского на французский в рамках WMT 2014 наша модель показывает новый рекордный результат BLEU для одной модели — 41,0 балла после обучения в течение 3,5 дней на восьми графических процессорах, что составляет лишь малую часть затрат на обучение лучших моделей из литературы. Мы показываем, что трансформатор хорошо обобщается на другие задачи, успешно применяя его для синтаксического разбора английского языка как на больших, так и на ограниченных обучающих данных.

Вам может быть интересно:

Другие компании, работающие в сфере искусственного интеллекта

Для работы сайта aiomnitech.com нужны файлы cookie и сервисы аналитики. Продолжая использование сайта, вы соглашаетесь с нашей Политикой использования файлов cookie. Вы можете запретить файлы cookie в вашем браузере. Принять Политика использования файлов cookie