Что дальше, лицензии и источники

Урок 16 из 16 курса «Нейросети с нуля: по открытому коду Андрея Карпати»: неофициальный курс AI University по открытому коду (MIT). Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот урок завершает курс, но не ставит точку в вашем знакомстве с нейросетями, а скорее открывает дверь дальше. Мы коротко пройдёмся по всему маршруту, который вы проделали за пятнадцать уроков, сформулируем, какие именно навыки у вас теперь есть, и наметим конкретные шаги для закрепления материала и движения вперёд.

Весь курс был построен на одной идее: понять нейросети можно только через код, который вы написали или прочитали сами, строка за строкой. Вспомним путь.

Вы начали с micrograd, библиотеки на несколько сотен строк, которая реализует автоматическое дифференцирование для скалярных значений. Вы увидели, как из простого объекта Value с полями data и grad строится граф вычислений, как работает обратное распространение через правило цепочки, и как из отдельных значений складываются нейрон, слой и целая сеть. Это дало вам понимание того, что скрывается за вызовом loss.backward() в PyTorch: никакой магии, только граф операций и производные, которые аккуратно умножаются друг на друга.

Дальше вы перешли к makemore и языковому моделированию на уровне символов. Биграммная модель показала, как считать вероятности по статистике и как устроена функция потерь в виде отрицательного логарифмического правдоподобия. Многослойный перцептрон с эмбеддингами символов познакомил вас с идеей плотных векторных представлений дискретных объектов, идеей, на которой держится весь современный NLP.

Затем вы разобрались, почему глубокие сети плохо обучаются без присмотра за активациями: изучили инициализацию весов, батч-нормализацию и то, как распределение значений в сети влияет на градиенты. Иерархическая архитектура в духе WaveNet показала альтернативу плоскому объединению эмбеддингов соседних символов: контекст группируется по уровням попарно, что позволяет захватывать более длинную историю без взрыва числа параметров. Сама идея вдохновлена дилатированными свёртками оригинальной WaveNet, хотя в учебной модели она реализована через последовательное объединение и полносвязные слои, а не через настоящие свёрточные слои с дилатацией.

Вторая половина курса была посвящена nanoGPT. Вы прошли путь от токенизации текста до self-attention, собрали блок трансформера, обучили модель на небольшом корпусе и…

План урока

  1. Маршрут курса: от скаляра до трансформера
  2. Какие навыки вы получили
  3. Как закрепить материал: соберите свой проект
  4. Что читать и смотреть дальше
  5. Как продолжать на платформе AI University
  6. Попробуйте сами
  7. Итоги
  8. Лицензии и источники

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды