Тест по главе: токенизаторы: HuggingFace: курс по Transformers

Урок 66 из 104 курса «HuggingFace: курс по Transformers»: официальный курс Hugging Face Learn (Хаггинг Фейс) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Давайте проверим, чему вы научились в этой главе! .", explain: "Список списков текстов - это особый вид генератора списков текстов, поэтому метод примет и его. Попробуйте еще раз!" }, { text: "Это позволит избежать загрузки в память сразу всего набора данных.", explain: "Точно! Каждый батч текстов будет освобождаться из памяти при итерации, и выигрыш будет особенно заметен, если вы используете библиотеку 🤗 Datasets для хранения текстов.", correct: true }, { text: "Это позволит библиотеке 🤗 Tokenizers использовать многопроцессорность (multiprocessing).", explain: "Нет, она будет использовать многопроцессорность в любом случае." }, { text: "Обученный вами токенизатор будет генерировать более качественные тексты.", explain: "Токенизатор не генерирует текст - вы не путаете его с языковой моделью?" } ]} />

План урока

  1. 1. Когда следует обучать новый токенизатор?
  2. 3. Каковы преимущества использования "быстрого" токенизатора?
  3. 4. Как конвейер token-classification обрабатывает сущности, которые охватывают несколько токенов?
  4. 5. Как конвейер question-answering обрабатывает длинные контексты?
  5. 6. Что такое нормализация?
  6. 7. Что такое предварительная токенизация для токенизатора по подсловам?
  7. 8. Выберите предложения, которые относятся к модели токенизации BPE.
  8. 9. Выберите предложения, которые относятся к модели токенизации WordPiece.

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды