Как модель подбирает следующее слово

Урок 4 из 14 курса «Возможности и ограничения AI»: официальный курс Anthropic Academy (Антропик) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Цели урока

  • Объяснить Предсказание Следующего Токена как основной механизм генеративного ИИ и понять, почему он приводит как к беглости, так и к вымыслам.
  • Размещать задачи на континууме Предсказания Следующего Токена (от "проторенного пути" до "неизведанной территории").
  • Определять специфичность (имена, даты, цитаты, статистика) как зону, где концентрируется вымысел.
  • Распознавать функции продукта (цитаты, сигнализация неопределенности, ограниченная генерация, паттерн "генератор-верификатор"), которые служат для смягчения этого ограничения.

О чём урок

Добро пожаловать в Академию Anthropic! В этом уроке мы погрузимся в фундаментальный механизм, лежащий в основе работы больших языковых моделей (LLM), таких как Claude: Предсказание Следующего Токена (Next Token Prediction). Понимание этого принципа крайне важно, поскольку он объясняет как удивительную беглость и связность, так и характерные ограничения, включая потенциальные "галлюцинации" или вымыслы. В основе генеративного ИИ лежит процесс предсказания: получив весь написанный до сих пор текст, модель предсказывает, что будет дальше, фрагмент за фрагментом. Это больше похоже на чрезвычайно сложную систему автодополнения, чем на поисковую систему. И это различие имеет огромное значение. Модель не "ищет" информацию в базе данных, а генерирует наиболее вероятную последовательность токенов (слов или частей слов), основываясь на статистических закономерностях, усвоенных во время обучения. Представьте, что вы пишете предложение, и ваш телефон предлагает следующее слово. LLM делает то же самое, но в гораздо более грандиозном масштабе и с невероятной способностью улавливать сложные контексты и стили. Например, цитата, которая выглядит как настоящая цитата, удовлетворяет статистическим паттернам так же хорошо, как и та, что указывает на реально существующую работу. Модель не "знает", существует ли документ, на который она ссылается; она просто генерирует текст, который статистически соответствует образцу цитаты. Один и тот же генеративный процесс работает всегда; меняется лишь то, насколько "проторенным" является путь для модели. Задачи можно расположить на континууме, где один конец представляет собой зону высокой компетентности, а другой — зону, где модель сталкивается с ограничениями. Это задачи, которые модель видела в бесчисленных вариациях во время обучения. Паттерны для таких задач плотны и последовательны. Примеры включают: Суммирование длинного отчета или статьи.

План урока

  1. Предсказание Следующего Токена: Сердце Генеративного ИИ
  2. Что такое Предсказание Следующего Токена? Автодополнение в Масштабе
  3. Континуум Возможностей и Ограничений
  4. Зона Возможностей: "Проторенный Путь"
  5. Зона Ограничений: "Неизведанная Территория"
  6. Парадокс Свободного Изложения и Вымысла
  7. Где концентрируется вымысел: Специфика
  8. Стратегии для Эффективного Использования LLM

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды