Как работают трансформеры

Урок 29 из 104 курса «HuggingFace: курс по Transformers»: официальный курс Hugging Face Learn (Хаггинг Фейс) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом разделе мы посмотрим в общих чертах на то, как работают трансформеры. Здесь приведены несколько ссылок на (короткую) историю трансформеров: Архитектура трансформеров была опубликована в июне 2017. Основной фокус оригинального исследования был сосредоточен на задачах перевода. Эта публикация повлекла за собой несколько влиятельных моделей: Июнь 2018: GPT, первая предобученная модель для тонкой настройки или дообучения (fine-tuning), которая показала результаты высокого качества для многих NLP-задач. Октябрь 2018: BERT, другая большая предобученная модель, была разработана для извлечения более точного содержания из предложений (больше мы узнаем об этом в следующей главе!) Февраль 2019: GPT-2, улучшенная (и более объемная) версия GPT, которая не была сразу опубликована по этическим соображениям Октябрь 2019: DistilBERT, «дистиллированная» версия BERT, которая на 60% быстрее и на 40% менее объемная, однако сохраняющая 97% производительности BERT Октябрь 2019: BART and T5, две больших модели, повторяющие архитектуру классического трансформера Май 2020, GPT-3, еще более крупная версия GPT-2, способная хорошо справляться с различными задачами без необходимости fine-tuning (так называемое zero-shot learning) Этот список далеко не полный, он всего лишь призван выделить несколько разновидностей моделей трансформеров. В широком смысле трансформеры могут быть классифицированы на три типа: GPT-подобные модели (также часто называемые авторегрессионные трансформеры) BERT-подобные модели (также часто называемые автокодирующие трансформеры (auto-encoding)) тип BART/T5 модели (также часто называются модели класса последовательность-последовательность (sequence-to-sequence, seq2seq)) Мы рассмотрим эти семейства более детально позже. Все модели трансформеров, упомянутые выше (GPT, BERT, BART, T5, etc.) обучены как языковые модели (англ. language models). Это означает, что они обучены на огромном количестве текста, используя технику самостоятельного обучения (англ. self-supervised learning). Самостоятельное обучение - это такой способ обучения, в котором цель обучения автоматически вычисляется на основе входных данных. Это означает, что люди не должны размечать данные! Такой тип моделей реализует статистическое понимание языка, на котором он был обучен, но он не очень полезен для конкретных практических задач.

План урока

  1. Немного истории
  2. Трансформеры - языковые модели
  3. Трансформеры - большие модели
  4. Трансферное обучение
  5. Общая архитектура
  6. Введение
  7. Слой внимания
  8. Первоначальная архитектура

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды