О чём урок
В предыдущих разделах мы представили общую архитектуру Transformer и рассмотрели, как эти модели могут решать различные задачи. Теперь давайте подробнее рассмотрим три основных архитектурных варианта моделей Transformer и разберемся, когда использовать каждый из них. Затем мы рассмотрим, как эти архитектуры применяются к различным языковым задачам. В этом разделе мы углубимся в три основных архитектурных варианта моделей Transformer и разберемся, когда использовать каждый из них. [!СОВЕТ] Помните, что большинство моделей Transformer используют одну из трех архитектур: только энкодер, только декодер или энкодер-декодер (sequence-to-sequence). Понимание этих различий поможет вам выбрать подходящую модель для вашей конкретной задачи. Видео: youtube.com/watch?v=MUqNwgPjJvQ Модели-энкодеры используют только энкодер модели Transformer. На каждом этапе слои внимания могут получить доступ ко всем словам в исходном предложении. Эти модели часто характеризуются как обладающие "двунаправленным" вниманием и часто называются автокодирующими моделями. Предварительное обучение этих моделей обычно сводится к некоторому искажению заданного предложения (например, путем маскирования случайных слов в нем) и постановке перед моделью задачи по поиску или реконструкции исходного предложения. Модели-энкодеры лучше всего подходят для задач, требующих понимания всего предложения, таких как классификация предложений, распознавание именованных сущностей (и, в более общем смысле, классификация слов), а также извлекающий ответ на вопросы. [!СОВЕТ] Как мы видели в разделе Как 🤗 Transformer'ы решают задачи, модели-энкодеры, такие как BERT, превосходно справляются с пониманием текста, поскольку они могут рассматривать весь контекст в обоих направлениях. Это делает их идеальными для задач, где важно полное понимание входных данных. Представители этого семейства моделей включают: BERT DistilBERT ModernBERT Видео: youtube.com/watch?v=d_ixlCubqQw Модели-декодеры используют только декодер модели Transformer. На каждом этапе для заданного слова слои внимания могут получить доступ только к словам, расположенным перед ним в предложении. Эти модели часто называются авторегрессионными моделями. Предварительное обучение моделей-декодеров обычно сводится к предсказанию следующего слова в предложении.
План урока
- Модели-энкодеры[[encoder-models]]
- Модели-декодеры[[decoder-models]]
- Современные большие языковые модели (LLM)
- Ключевые возможности современных LLM
- Модели Sequence-to-sequence[[sequence-to-sequence-models]]
- Практические применения
- Выбор правильной архитектуры[[choosing-the-right-architecture]]
- Эволюция LLM
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.