HuggingFace: курс по Transformers на русском — курс Hugging Face Learn

Полный курс по библиотеке Transformers: от основ NLP до fine-tuning и развёртывания моделей.

«HuggingFace: курс по Transformers» представляет собой официальный курс Hugging Face на русском языке, посвящённый одноимённой библиотеке и экосистеме вокруг неё. Он подойдёт разработчикам и специалистам по данным среднего уровня, которые хотят не просто вызывать готовые модели, а понимать, как они устроены, дообучать их и публиковать результат. В курсе 104 текстовых урока общим объёмом около 520 минут, с тестами по главам. Материалы открываются без VPN, первые 3 урока бесплатно.

Основная линия идёт от основ к практике. Сначала объясняется, что такое NLP и большие языковые модели, как работают трансформеры, чем отличаются энкодеры, декодеры и модели seq2seq и какие у моделей бывают предвзятости и ограничения. Затем библиотека Transformers разбирается изнутри: что происходит в пайплайне, как создаются и загружаются модели, как токенизатор превращает текст в числа, зачем нужны батчи и паддинг. После этого идёт дообучение предобученной модели через Trainer API и собственный цикл обучения.

Следующие главы расширяют инструментарий. Вы познакомитесь с Hugging Face Hub, научитесь публиковать модели и составлять для них карточки, освоите библиотеку Datasets, включая работу с большими данными и семантический поиск на FAISS. Глава о Tokenizers подробно разбирает BPE, WordPiece и Unigram. Прикладной блок охватывает классические задачи NLP: поиск именованных сущностей, машинный перевод, суммаризацию, ответы на вопросы и обучение языковой модели с нуля. Есть глава об отладке обучения и о том, как правильно просить помощи на форуме, и глава о демо на Gradio. Более новые разделы посвящены разметке данных в Argilla, supervised fine-tuning с шаблонами чата и LoRA, оценке дообученных моделей и обучению с подкреплением через GRPO на примере DeepSeek R1.

Объём большой, поэтому курсом удобно пользоваться по частям. Если нужна база, идите по главам с начала. Если задача конкретная, например дообучить модель через LoRA или разметить датасет, открывайте соответствующую главу и возвращайтесь к основам по мере необходимости. В результате вы сможете загружать модели, токенизировать текст и запускать инференс, дообучать модели на своих данных, размечать датасеты в Argilla, оценивать качество и делиться моделями через Hugging Face Hub.

Курс из программы Hugging Face Learn (Хаггинг Фейс) на русском языке. Первые 3 3 урока бесплатно, без VPN.

Официальный курс HuggingFace в переводе на русский язык. Открывается без VPN: все уроки, видео и субтитры уже переведены и лежат на нашей платформе. 104 урока, первые 3 бесплатно, дальше разовая оплата без подписки.

Уровень: Средний. Длительность: около 520 минут. Формат: текст с примерами.

Что вы сможете после курса

Почему этому курсу можно доверять

Уроки курса

  1. Знакомство с курсом
  2. Что такое Argilla
  3. Разворачиваем Argilla
  4. Загружаем свой датасет
  5. Размечаем данные
  6. Используем размеченный датасет
  7. Итоги главы про Argilla
  8. Тест по главе: Argilla
  9. Дообучение с учителем: обзор главы
  10. Шаблоны чата
  11. Дообучение с учителем (SFT) на практике
  12. LoRA: дообучение без переобучения всей модели
  13. Как оценивать дообученную модель
  14. Итоги главы про дообучение
  15. Экзамен по дообучению
  16. Open R1: курс для студентов
  17. Обучение с подкреплением и зачем оно LLM
  18. Разбираем статью про DeepSeek R1
  19. GRPO в DeepSeekMath: как устроен алгоритм
  20. GRPO в библиотеке TRL
  21. Практика: дообучаем модель через GRPO
  22. Практика: GRPO с Unsloth
  23. Что будет в курсе дальше
  24. О курсе: чего ожидать
  25. Тест по первой главе
  26. Экзамен по основам трансформеров
  27. NLP и большие языковые модели
  28. Что умеют трансформеры
  29. Как работают трансформеры
  30. Модели-энкодеры
  31. Архитектуры трансформеров: энкодеры и декодеры
  32. Модели seq2seq
  33. Предвзятость и ограничения моделей
  34. Итоги главы
  35. Как пользоваться библиотекой Transformers
  36. Что происходит внутри пайплайна
  37. Модели: создание и загрузка
  38. Токенизаторы: как текст превращается в числа
  39. Несколько последовательностей сразу: батчи и паддинг
  40. Собираем всё вместе: от токенизатора к модели
  41. Базовое использование освоено
  42. Тест по главе: пайплайн и модели
  43. Тест по главе: токенизаторы и модели
  44. Дообучение предобученной модели
  45. Готовим данные для обучения
  46. Дообучение модели через Trainer API
  47. Свой цикл обучения с нуля
  48. Итоги главы про дообучение моделей
  49. Тест по главе: дообучение
  50. Сертификат по главе
  51. Hugging Face Hub: что там есть
  52. Как пользоваться готовыми моделями
  53. Публикуем свою модель на Hub
  54. Как составить карточку модели
  55. Первая часть курса пройдена
  56. Тест по главе: Hub
  57. Библиотека Datasets
  58. Если датасета нет на Hub
  59. Режем и чистим данные в Datasets
  60. Большие данные: Datasets и отображение в память
  61. Собираем собственный датасет
  62. Семантический поиск с FAISS
  63. Итоги главы про Datasets
  64. Тест по главе: Datasets
  65. Библиотека Tokenizers
  66. Тест по главе: токенизаторы
  67. Обучаем новый токенизатор на основе старого
  68. Что умеют быстрые токенизаторы
  69. Быстрые токенизаторы в вопросно-ответной системе
  70. Нормализация и предварительная токенизация
  71. Токенизация BPE
  72. Токенизация WordPiece
  73. Токенизация Unigram
  74. Собираем токенизатор по кусочкам
  75. Итоги главы про токенизаторы
  76. Классические задачи NLP
  77. Классификация токенов: поиск именованных сущностей
  78. Дообучаем модель с маскированием слов
  79. Машинный перевод
  80. Суммаризация текстов
  81. Обучаем языковую модель с нуля
  82. Ответы на вопросы по тексту
  83. Итоги главы про задачи NLP
  84. Тест по главе: задачи NLP
  85. Как искать и исправлять ошибки
  86. Что делать, если вылетела ошибка
  87. Как правильно просить помощи на форуме
  88. Отладка обучения: проверяем данные
  89. Отладка обучения: проверяем собственные данные
  90. Как написать хороший issue
  91. Вторая часть курса пройдена
  92. Тест по главе: отладка
  93. Знакомство с Gradio
  94. Первое демо на Gradio
  95. Класс Interface изнутри
  96. Как поделиться демо с другими
  97. Gradio и Hugging Face Hub
  98. Продвинутые возможности Interface
  99. Gradio Blocks: гибкие интерфейсы
  100. Итоги главы про Gradio
  101. Тест по главе: Gradio
  102. Живые занятия и воркшопы
  103. Запуск второй части курса
  104. Gradio Blocks Party: конкурс демо

Вопросы о курсе

Курс бесплатный?

Первые 3 3 урока открыты бесплатно и без входа. Остальные уроки открывает доступ к курсам HuggingFace (1490 руб) или полный доступ ко всем курсам платформы (4900 руб), разовый платёж без подписки.

Нужен ли VPN?

Нет. Оригинал курса опубликован HuggingFace на английском и часто недоступен из России, а здесь все уроки, видео и субтитры уже переведены и открываются без VPN.

На каком языке курс?

На русском: переведены тексты уроков и субтитры к видео, термины и примеры кода сохранены в оригинале.

Выдаётся ли сертификат?

Да. После прохождения всех уроков курса при платном доступе выдаётся именной сертификат AI University с номером и QR-кодом, PDF приходит на почту, подлинность проверяется по номеру на сайте. Сертификат о прохождении курса не является документом об образовании.

Полезные гиды