О чём урок
{#if fw === 'pt'} {:else} {/if} Для многих приложений NLP, в которых используются модели-трансформеры, можно просто взять предварительно обученную модель из Hugging Face Hub и дообучить ее непосредственно на ваших данных для решения поставленной задачи. При условии, что корпус, использованный для предварительного обучения, не слишком отличается от корпуса, используемого для дообучения, трансферное обучение обычно дает хорошие результаты. Однако есть несколько случаев, когда перед обучением специфичной для конкретной задачи головы необходимо дообучить языковые модели на ваших данных. Например, если ваш датасет содержит юридические контракты или научные статьи, ванильная модель трансформер, такая как BERT, обычно рассматривает специфические для области слова в вашем корпусе как редкие токены, и результирующее качество может быть менее чем удовлетворительным. Дообучив языковую модель на данных из домена, вы сможете повысить качество работы во многих последующих задачах, а это значит, что обычно этот шаг нужно выполнить только один раз! Этот процесс дообучить предварительно обученную языковую модель на данных из домена обычно называют доменной адаптацией (domain adaptation). Он был популяризирован в 2018 году благодаря ULMFiT, которая стала одной из первых нейронных архитектур (основанных на LSTM), заставивших трансферное обучение действительно работать в NLP. Пример доменной адаптации с помощью ULMFiT показан на изображении ниже; в этом разделе мы сделаем нечто подобное, но с трансформером вместо LSTM! К концу этого раздела у вас будет модель маскированного языкового моделирования на Hub, которая позволяет автоматически дописывать предложения, как показано ниже: Давайте погрузимся в работу! [!TIP] 🙋 Если термины "маскированное моделирование языка (masked language modeling)" и "предварительно обученная модель (pretrained model)" кажутся вам незнакомыми, загляните в Главу 1, где мы объясняем все эти основные понятия, сопровождая их видеороликами! Для начала давайте выберем подходящую предварительно обученную модель для маскированного языкового моделирования.
План урока
- Выбор предварительно обученной модели для маскированного моделирования языка
- Датасет
- Предварительная обработка данных
- Дообучение DistilBERT с помощью API Trainer
- Перплексия языковых моделей
- Дообучение DistilBERT с помощью 🤗 Accelerate
- Использование нашей дообученной модели
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.