Предобученные большие языковые модели

Урок 21 из 25 курса «Основы ИИ для начинающих»: официальный курс Microsoft AI for Beginners (Майкрософт) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Во всех предыдущих задачах мы обучали нейронную сеть выполнять определённую задачу, используя размеченный набор данных. В случае больших трансформерных моделей, таких как BERT, мы применяем языковое моделирование в самообучающемся режиме для создания языковой модели, которая затем специализируется на конкретной последующей задаче с помощью дополнительного обучения в предметной области. Однако было показано, что большие языковые модели (LLM) могут решать многие задачи и без какого-либо обучения в предметной области. Семейство моделей, способных на это, называется GPT: Generative Pre-Trained Transformer (генеративный предобученный трансформер). Идея о том, что нейронная сеть может выполнять общие задачи без последующего дообучения, представлена в статье Language Models are Unsupervised Multitask Learners. Основная мысль заключается в том, что многие другие задачи можно моделировать с помощью генерации текста, поскольку понимание текста по сути означает способность его создавать. Поскольку модель обучена на огромном объёме текста, охватывающем человеческие знания, она также становится осведомлённой в широком круге тем. Понимание и способность создавать текст также подразумевают знание чего-то об окружающем мире. Люди в значительной степени учатся через чтение, и сеть GPT похожа в этом отношении. Сети генерации текста работают, предсказывая вероятность следующего слова $$P(w_N)$$. Однако безусловная вероятность следующего слова равна частоте этого слова в текстовом корпусе. GPT может предоставить вам условную вероятность следующего слова, учитывая предыдущие: $$P(w_N | w_{n-1}, ..., w_0)$$ Подробнее о вероятностях вы можете прочитать в нашем курсе «Основы Data Science». Качество модели генерации языка можно определить с помощью перплексии. Это внутренняя метрика, которая позволяет измерять качество модели без использования набора данных, специфичного для конкретной задачи. Она основана на понятии вероятности предложения: модель присваивает высокую вероятность предложению, которое, скорее всего, является реальным (то есть модель не озадачена им), и низкую вероятность предложениям, которые имеют меньше смысла (например, Может ли это что?).

План урока

  1. Тест перед лекцией
  2. Генерация текста и перплексия
  3. GPT: семейство моделей
  4. Промпт-инжиниринг
  5. ✍️ Пример блокнота: Работа с OpenAI-GPT
  6. Заключение
  7. Тест после лекции

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды