О чём урок
Этот урок завершает курс, но не ставит точку в вашем знакомстве с нейросетями, а скорее открывает дверь дальше. Мы коротко пройдёмся по всему маршруту, который вы проделали за пятнадцать уроков, сформулируем, какие именно навыки у вас теперь есть, и наметим конкретные шаги для закрепления материала и движения вперёд.
Весь курс был построен на одной идее: понять нейросети можно только через код, который вы написали или прочитали сами, строка за строкой. Вспомним путь.
Вы начали с micrograd, библиотеки на несколько сотен строк, которая реализует автоматическое дифференцирование для скалярных значений. Вы увидели, как из простого объекта Value с полями data и grad строится граф вычислений, как работает обратное распространение через правило цепочки, и как из отдельных значений складываются нейрон, слой и целая сеть. Это дало вам понимание того, что скрывается за вызовом loss.backward() в PyTorch: никакой магии, только граф операций и производные, которые аккуратно умножаются друг на друга.
Дальше вы перешли к makemore и языковому моделированию на уровне символов. Биграммная модель показала, как считать вероятности по статистике и как устроена функция потерь в виде отрицательного логарифмического правдоподобия. Многослойный перцептрон с эмбеддингами символов познакомил вас с идеей плотных векторных представлений дискретных объектов, идеей, на которой держится весь современный NLP.
Затем вы разобрались, почему глубокие сети плохо обучаются без присмотра за активациями: изучили инициализацию весов, батч-нормализацию и то, как распределение значений в сети влияет на градиенты. Иерархическая архитектура в духе WaveNet показала альтернативу плоскому объединению эмбеддингов соседних символов: контекст группируется по уровням попарно, что позволяет захватывать более длинную историю без взрыва числа параметров. Сама идея вдохновлена дилатированными свёртками оригинальной WaveNet, хотя в учебной модели она реализована через последовательное объединение и полносвязные слои, а не через настоящие свёрточные слои с дилатацией.
Вторая половина курса была посвящена nanoGPT. Вы прошли путь от токенизации текста до self-attention, собрали блок трансформера, обучили модель на небольшом корпусе и…
План урока
- Маршрут курса: от скаляра до трансформера
- Какие навыки вы получили
- Как закрепить материал: соберите свой проект
- Что читать и смотреть дальше
- Как продолжать на платформе AI University
- Попробуйте сами
- Итоги
- Лицензии и источники
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.