Токенизация: основы

Урок 11 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

LLM (большие языковые модели), какими мы их знаем сегодня, являются преимущественно авторегрессионными моделями, основанными на архитектуре трансформеров. Хотя их применение разнообразно и поражает мир высококвалифицированными чат-ботами, базовая технология следует простому принципу: LLM можно описать как машины для завершения текста. Получив предложение, текст или строку, модель разбивает его на несколько частей, называемых "токенами". Обученная на последовательностях этих токенов, модель предсказывает следующий токен для завершения последовательности. Токенизация — это процесс преобразования запроса, часто строки, в последовательность идентификаторов токенов, которую модель получит в качестве входных данных. Токен может быть чем угодно: от отдельного символа до подслова или символа. Модель обладает словарём токенов с соответствующими им идентификаторами. Задача токенизатора — разбить строку и преобразовать её в последовательность идентификаторов токенов, этот шаг называется "кодированием" (encoding). Также задача токенизатора — преобразовать последовательность идентификаторов обратно в строку, этот шаг называется "декодированием" (decoding). Получив последовательность идентификаторов токенов, модель пытается предсказать следующий токен. Для простоты давайте опишем токены как символы и целые слова. Представьте сценарий, в котором у нас есть следующее предложение: "Hello, how are" Токенизатор сначала разобьёт предложение на разные части, или токены. Например: Hello, how are Затем токенизатор получит идентификатор токена (token ID), соответствующий каждому токену. Например: Hello, -> 432 how -> 523 are -> 87 Эта последовательность идентификаторов токенов затем передаётся модели. Модель попытается предсказать следующий токен. Допустим, она предсказывает: 75 Тогда мы получим полную последовательность идентификаторов токенов: 432 + 523 + 87 + 75 Эту последовательность можно декодировать обратно в полную строку: Hello, + how + are + you -> Hello, how are you Затем мы можем повторять этот процесс столько раз, сколько потребуется. Модель снова попытается предсказать следующий токен. Допустим, она предсказывает: 868 Тогда мы получим полную последовательность идентификаторов токенов: 432 + 523 + 87 + 75 + 868 Эта последовательность будет декодирована обратно в полную строку: Hello, + how + are + you + ? -> Hello, how are you?

План урока

  1. Основы
  2. LLM - Краткий обзор
  3. Что такое токенизация?
  4. Как общаться с моделью?

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды