HuggingFace: курс по Transformers на русском — курс Hugging Face Learn
Полный курс по библиотеке Transformers: от основ NLP до fine-tuning и развёртывания моделей.
«HuggingFace: курс по Transformers» представляет собой официальный курс Hugging Face на русском языке, посвящённый одноимённой библиотеке и экосистеме вокруг неё. Он подойдёт разработчикам и специалистам по данным среднего уровня, которые хотят не просто вызывать готовые модели, а понимать, как они устроены, дообучать их и публиковать результат. В курсе 104 текстовых урока общим объёмом около 520 минут, с тестами по главам. Материалы открываются без VPN, первые 3 урока бесплатно.
Основная линия идёт от основ к практике. Сначала объясняется, что такое NLP и большие языковые модели, как работают трансформеры, чем отличаются энкодеры, декодеры и модели seq2seq и какие у моделей бывают предвзятости и ограничения. Затем библиотека Transformers разбирается изнутри: что происходит в пайплайне, как создаются и загружаются модели, как токенизатор превращает текст в числа, зачем нужны батчи и паддинг. После этого идёт дообучение предобученной модели через Trainer API и собственный цикл обучения.
Следующие главы расширяют инструментарий. Вы познакомитесь с Hugging Face Hub, научитесь публиковать модели и составлять для них карточки, освоите библиотеку Datasets, включая работу с большими данными и семантический поиск на FAISS. Глава о Tokenizers подробно разбирает BPE, WordPiece и Unigram. Прикладной блок охватывает классические задачи NLP: поиск именованных сущностей, машинный перевод, суммаризацию, ответы на вопросы и обучение языковой модели с нуля. Есть глава об отладке обучения и о том, как правильно просить помощи на форуме, и глава о демо на Gradio. Более новые разделы посвящены разметке данных в Argilla, supervised fine-tuning с шаблонами чата и LoRA, оценке дообученных моделей и обучению с подкреплением через GRPO на примере DeepSeek R1.
Объём большой, поэтому курсом удобно пользоваться по частям. Если нужна база, идите по главам с начала. Если задача конкретная, например дообучить модель через LoRA или разметить датасет, открывайте соответствующую главу и возвращайтесь к основам по мере необходимости. В результате вы сможете загружать модели, токенизировать текст и запускать инференс, дообучать модели на своих данных, размечать датасеты в Argilla, оценивать качество и делиться моделями через Hugging Face Hub.
Курс из программы Hugging Face Learn (Хаггинг Фейс) на русском языке. Первые 3 3 урока бесплатно, без VPN.
Официальный курс HuggingFace в переводе на русский язык. Открывается без VPN: все уроки, видео и субтитры уже переведены и лежат на нашей платформе. 104 урока, первые 3 бесплатно, дальше разовая оплата без подписки.
Уровень: Средний. Длительность: около 520 минут. Формат: текст с примерами.
Что вы сможете после курса
- Работать с библиотекой Transformers: загружать модели, токенизировать, запускать инференс
- Дообучать модели (supervised fine-tuning, LoRA) на своих данных
- Размечать датасеты в Argilla и оценивать модели
- Разворачивать модели и делиться ими через Hugging Face Hub
Почему этому курсу можно доверять
- Первоисточник: курс опубликован самой HuggingFace, компанией, которая делает эти модели. Это официальная программа, а не пересказ блогера и не сгенерированный нейросетью «курс».
- Честный перевод: структура уроков, термины, примеры и код сохранены как в оригинале, видео с русскими субтитрами. Мы переводим и структурируем, а не переписываем.
- Без VPN и иностранных платформ: все уроки лежат здесь, вход через Telegram.
- Актуальность: следим за обновлениями первоисточника и добавляем новые уроки по мере выхода.
- Прозрачная оплата: первые 3 3 урока бесплатно, разовый платёж без подписки, доступ навсегда, возврат 14 дней. Российская компания, оферта и чек.
- Именной сертификат: после прохождения курса выдаём сертификат с номером, QR-кодом и страницей проверки подлинности, PDF приходит на почту.
Уроки курса
- Знакомство с курсом
- Что такое Argilla
- Разворачиваем Argilla
- Загружаем свой датасет
- Размечаем данные
- Используем размеченный датасет
- Итоги главы про Argilla
- Тест по главе: Argilla
- Дообучение с учителем: обзор главы
- Шаблоны чата
- Дообучение с учителем (SFT) на практике
- LoRA: дообучение без переобучения всей модели
- Как оценивать дообученную модель
- Итоги главы про дообучение
- Экзамен по дообучению
- Open R1: курс для студентов
- Обучение с подкреплением и зачем оно LLM
- Разбираем статью про DeepSeek R1
- GRPO в DeepSeekMath: как устроен алгоритм
- GRPO в библиотеке TRL
- Практика: дообучаем модель через GRPO
- Практика: GRPO с Unsloth
- Что будет в курсе дальше
- О курсе: чего ожидать
- Тест по первой главе
- Экзамен по основам трансформеров
- NLP и большие языковые модели
- Что умеют трансформеры
- Как работают трансформеры
- Модели-энкодеры
- Архитектуры трансформеров: энкодеры и декодеры
- Модели seq2seq
- Предвзятость и ограничения моделей
- Итоги главы
- Как пользоваться библиотекой Transformers
- Что происходит внутри пайплайна
- Модели: создание и загрузка
- Токенизаторы: как текст превращается в числа
- Несколько последовательностей сразу: батчи и паддинг
- Собираем всё вместе: от токенизатора к модели
- Базовое использование освоено
- Тест по главе: пайплайн и модели
- Тест по главе: токенизаторы и модели
- Дообучение предобученной модели
- Готовим данные для обучения
- Дообучение модели через Trainer API
- Свой цикл обучения с нуля
- Итоги главы про дообучение моделей
- Тест по главе: дообучение
- Сертификат по главе
- Hugging Face Hub: что там есть
- Как пользоваться готовыми моделями
- Публикуем свою модель на Hub
- Как составить карточку модели
- Первая часть курса пройдена
- Тест по главе: Hub
- Библиотека Datasets
- Если датасета нет на Hub
- Режем и чистим данные в Datasets
- Большие данные: Datasets и отображение в память
- Собираем собственный датасет
- Семантический поиск с FAISS
- Итоги главы про Datasets
- Тест по главе: Datasets
- Библиотека Tokenizers
- Тест по главе: токенизаторы
- Обучаем новый токенизатор на основе старого
- Что умеют быстрые токенизаторы
- Быстрые токенизаторы в вопросно-ответной системе
- Нормализация и предварительная токенизация
- Токенизация BPE
- Токенизация WordPiece
- Токенизация Unigram
- Собираем токенизатор по кусочкам
- Итоги главы про токенизаторы
- Классические задачи NLP
- Классификация токенов: поиск именованных сущностей
- Дообучаем модель с маскированием слов
- Машинный перевод
- Суммаризация текстов
- Обучаем языковую модель с нуля
- Ответы на вопросы по тексту
- Итоги главы про задачи NLP
- Тест по главе: задачи NLP
- Как искать и исправлять ошибки
- Что делать, если вылетела ошибка
- Как правильно просить помощи на форуме
- Отладка обучения: проверяем данные
- Отладка обучения: проверяем собственные данные
- Как написать хороший issue
- Вторая часть курса пройдена
- Тест по главе: отладка
- Знакомство с Gradio
- Первое демо на Gradio
- Класс Interface изнутри
- Как поделиться демо с другими
- Gradio и Hugging Face Hub
- Продвинутые возможности Interface
- Gradio Blocks: гибкие интерфейсы
- Итоги главы про Gradio
- Тест по главе: Gradio
- Живые занятия и воркшопы
- Запуск второй части курса
- Gradio Blocks Party: конкурс демо
Вопросы о курсе
Курс бесплатный?
Первые 3 3 урока открыты бесплатно и без входа. Остальные уроки открывает доступ к курсам HuggingFace (1490 руб) или полный доступ ко всем курсам платформы (4900 руб), разовый платёж без подписки.
Нужен ли VPN?
Нет. Оригинал курса опубликован HuggingFace на английском и часто недоступен из России, а здесь все уроки, видео и субтитры уже переведены и открываются без VPN.
На каком языке курс?
На русском: переведены тексты уроков и субтитры к видео, термины и примеры кода сохранены в оригинале.
Выдаётся ли сертификат?
Да. После прохождения всех уроков курса при платном доступе выдаётся именной сертификат AI University с номером и QR-кодом, PDF приходит на почту, подлинность проверяется по номеру на сайте. Сертификат о прохождении курса не является документом об образовании.