Архитектуры трансформеров: энкодеры и декодеры

Урок 31 из 104 курса «HuggingFace: курс по Transformers»: официальный курс Hugging Face Learn (Хаггинг Фейс) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В предыдущих разделах мы представили общую архитектуру Transformer и рассмотрели, как эти модели могут решать различные задачи. Теперь давайте подробнее рассмотрим три основных архитектурных варианта моделей Transformer и разберемся, когда использовать каждый из них. Затем мы рассмотрим, как эти архитектуры применяются к различным языковым задачам. В этом разделе мы углубимся в три основных архитектурных варианта моделей Transformer и разберемся, когда использовать каждый из них. [!СОВЕТ] Помните, что большинство моделей Transformer используют одну из трех архитектур: только энкодер, только декодер или энкодер-декодер (sequence-to-sequence). Понимание этих различий поможет вам выбрать подходящую модель для вашей конкретной задачи. Видео: youtube.com/watch?v=MUqNwgPjJvQ Модели-энкодеры используют только энкодер модели Transformer. На каждом этапе слои внимания могут получить доступ ко всем словам в исходном предложении. Эти модели часто характеризуются как обладающие "двунаправленным" вниманием и часто называются автокодирующими моделями. Предварительное обучение этих моделей обычно сводится к некоторому искажению заданного предложения (например, путем маскирования случайных слов в нем) и постановке перед моделью задачи по поиску или реконструкции исходного предложения. Модели-энкодеры лучше всего подходят для задач, требующих понимания всего предложения, таких как классификация предложений, распознавание именованных сущностей (и, в более общем смысле, классификация слов), а также извлекающий ответ на вопросы. [!СОВЕТ] Как мы видели в разделе Как 🤗 Transformer'ы решают задачи, модели-энкодеры, такие как BERT, превосходно справляются с пониманием текста, поскольку они могут рассматривать весь контекст в обоих направлениях. Это делает их идеальными для задач, где важно полное понимание входных данных. Представители этого семейства моделей включают: BERT DistilBERT ModernBERT Видео: youtube.com/watch?v=d_ixlCubqQw Модели-декодеры используют только декодер модели Transformer. На каждом этапе для заданного слова слои внимания могут получить доступ только к словам, расположенным перед ним в предложении. Эти модели часто называются авторегрессионными моделями. Предварительное обучение моделей-декодеров обычно сводится к предсказанию следующего слова в предложении.

План урока

  1. Модели-энкодеры[[encoder-models]]
  2. Модели-декодеры[[decoder-models]]
  3. Современные большие языковые модели (LLM)
  4. Ключевые возможности современных LLM
  5. Модели Sequence-to-sequence[[sequence-to-sequence-models]]
  6. Практические применения
  7. Выбор правильной архитектуры[[choosing-the-right-architecture]]
  8. Эволюция LLM

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды