О чём урок
Давным-давно многие из нас играли в увлекательную игру: написать сообщение другу, используя только слова, которые предлагает автозаполнение на телефоне. Это казалось волшебством, словно телефон читал наши мысли и знал, что мы хотим сказать дальше. Мы называли это нашим "Me-bot" — роботом, который говорил нашим голосом, основываясь на наших индивидуальных шаблонах использования. В то время мы воспринимали это как проявление высоких технологий, не задумываясь о том, насколько прост может быть алгоритм, лежащий в основе. Однако именно этот принцип — предсказание следующего слова или, точнее, Next Token Prediction — является краеугольным камнем работы современных больших языковых моделей (LLM), таких как Claude. Чтобы понять, как работает Next Token Prediction, давайте представим, что мы "обучаем" очень простую модель. Для этого нам достаточно проанализировать небольшой набор текстов и подсчитать, какие слова чаще всего следуют за другими. Например, если у нас есть несколько сообщений, мы можем построить "карту связей" между словами. Представьте, что мы собираем статистику из фраз вроде "Привет, как дела?", "Как твои дела?", "Мои дела хорошо". Мы заметим, что после слова "как" часто следует "дела", а после "твои" — тоже "дела". Эта карта связей, где каждая связь имеет свой "вес" (частоту), называется Transition Matrix (матрица переходов). Если мы нормализуем каждую строку этой матрицы, мы получим probability distribution (распределение вероятностей) — то есть, для каждого слова мы будем знать вероятность появления следующего слова. Процесс выбора следующего слова на основе того, что уже было сказано, и есть Next Token Prediction. Этот термин используется как для простейших моделей, так и для сложных современных языковых моделей, таких как Claude. Разница лишь в масштабе и сложности вычислений, но суть остается той же: предсказать наиболее вероятный следующий элемент. Когда мы выбираем следующее слово, основываясь на распределении вероятностей, мы занимаемся sampling (сэмплированием). В простейшем случае можно было бы всегда выбирать слово с самой высокой вероятностью.
План урока
- Как Работает Предсказание: От Простого Подсчета к Вероятностям
- Искусство Выбора: Стратегии Сэмплирования
- Параметры Сэмплирования: Управление Творчеством и Точностью
- От Марковских Цепей к Трансформерам: Эволюция LLM
- Исторический Контекст: Столетие Инноваций
- Заключение: Фундамент Интеллекта Claude
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.