Готовим данные для обучения

Урок 45 из 104 курса «HuggingFace: курс по Transformers»: официальный курс Hugging Face Learn (Хаггинг Фейс) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

{#if fw === 'pt'} {:else} {/if} {#if fw === 'pt'} Продолжим с примером из предыдущей главы, вот как мы будем обучать классификатор последовательности на одном батче с помощью PyTorch: {:else} Continuing with the example from the previous chapter, вот как мы будем обучать классификатор последовательности на одном батче с помощью TensorFlow: {/if} Обучение всего лишь на двух предложениях, конечно, не даст хорошего результата. Чтобы получить более качественные результаты, вам следует подготовить б_о_льший датасет. В данном разделе мы будем использовать в качестве примера MRPC (Microsoft Research Paraphrase Corpus) dataset, предложенный в статье авторами William B. Dolan и Chris Brockett. Датасет состоит из 5801 пар предложений с соответствующим им лейблом: является ли пара преложений парафразами или нет (т.е. идет ли речь в обоих предложениях об одном и том же). Мы выбрали именно этот датасет для этой главы потому что он небольшой: с ним легко экспериментировать в процессе обучения. {#if fw === 'pt'} {:else} {/if} Hub содержит не только модели, там также расположено множество датасетов на различных языках. Вы можете посмотреть на них тут, а также мы рекомендуем попровать загрузить новый датасет после того, как вы изучите текущий раздел (см. документацию здесь). Но сейчас вернемся к датасету MRPC! Это один из 10 датасетов из состава GLUE, который является тестом для производительности моделей машинного обучения в задачах классификации текста. Библиотека 🤗 Datasets предоставляет возможность использовать очень простую команду для загрузки и кэширования датасета с Hub. Мы можем загрузить датасет следующим образом: [!TIP] ⚠️ Предупреждение Убедитесь, что datasets установлены, выполнив pip install datasets. Затем загрузите набор данных MRPC и выведите его, чтобы увидеть, что он содержит. Как можно заметить, мы получили объект типа DatasetDict, который содержит обучающую выборку, валидационную выборку и тестовую выборку.

План урока

  1. Загрузка датасета с Hub
  2. Предобработка датасета
  3. Dynamic padding

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды