О чём урок
Во всех предыдущих задачах мы обучали нейронную сеть выполнять определённую задачу, используя размеченный набор данных. В случае больших трансформерных моделей, таких как BERT, мы применяем языковое моделирование в самообучающемся режиме для создания языковой модели, которая затем специализируется на конкретной последующей задаче с помощью дополнительного обучения в предметной области. Однако было показано, что большие языковые модели (LLM) могут решать многие задачи и без какого-либо обучения в предметной области. Семейство моделей, способных на это, называется GPT: Generative Pre-Trained Transformer (генеративный предобученный трансформер). Идея о том, что нейронная сеть может выполнять общие задачи без последующего дообучения, представлена в статье Language Models are Unsupervised Multitask Learners. Основная мысль заключается в том, что многие другие задачи можно моделировать с помощью генерации текста, поскольку понимание текста по сути означает способность его создавать. Поскольку модель обучена на огромном объёме текста, охватывающем человеческие знания, она также становится осведомлённой в широком круге тем. Понимание и способность создавать текст также подразумевают знание чего-то об окружающем мире. Люди в значительной степени учатся через чтение, и сеть GPT похожа в этом отношении. Сети генерации текста работают, предсказывая вероятность следующего слова $$P(w_N)$$. Однако безусловная вероятность следующего слова равна частоте этого слова в текстовом корпусе. GPT может предоставить вам условную вероятность следующего слова, учитывая предыдущие: $$P(w_N | w_{n-1}, ..., w_0)$$ Подробнее о вероятностях вы можете прочитать в нашем курсе «Основы Data Science». Качество модели генерации языка можно определить с помощью перплексии. Это внутренняя метрика, которая позволяет измерять качество модели без использования набора данных, специфичного для конкретной задачи. Она основана на понятии вероятности предложения: модель присваивает высокую вероятность предложению, которое, скорее всего, является реальным (то есть модель не озадачена им), и низкую вероятность предложениям, которые имеют меньше смысла (например, Может ли это что?).
План урока
- Тест перед лекцией
- Генерация текста и перплексия
- GPT: семейство моделей
- Промпт-инжиниринг
- ✍️ Пример блокнота: Работа с OpenAI-GPT
- Заключение
- Тест после лекции
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.