Тест по главе: токенизаторы и модели: HuggingFace: курс по Transformers

Урок 43 из 104 курса «HuggingFace: курс по Transformers»: официальный курс Hugging Face Learn (Хаггинг Фейс) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

<Question choices={[ { text: "Модель, которая автоматически обучается на ваших данных", explain: "Вы не путаете это с нашим продуктом AutoTrain?" }, { text: "Объект, который возвращает правильную архитектуру на основе checkpoint", explain: "Именно так: AutoModel достаточно знать checkpoint, из которого нужно инициализироваться, чтобы вернуть правильную архитектуру.", correct: true }, { text: "Модель, которая автоматически определяет язык, используемый для её входных данных, чтобы загрузить правильные веса", explain: "Хотя некоторые checkpoints и модели способны обрабатывать несколько языков, встроенных инструментов для автоматического выбора checkpoint в зависимости от языка не существует. Вам следует перейти на Model Hub, чтобы найти лучший checkpoint для вашей задачи!" } ]} /> <Question choices={[ { text: "encode, поскольку он может кодировать текст в ID и ID в предсказания", explain: "Неверно! Хотя метод encode существует для токенизаторов, он не существует для моделей." }, { text: "Прямой вызов объекта токенизатора.", explain: "Именно так! Метод call токенизатора — очень мощный метод, который может обрабатывать практически всё. Это также метод, используемый для получения предсказаний от модели.", correct: true }, { text: "pad", explain: "Неверно! Padding очень полезен, но это лишь одна часть API токенизатора." }, { text: "tokenize", explain: "Метод tokenize, возможно, является одним из самых полезных методов, но он не является ядром API токенизатора." } ]} /> <Question choices={[ { text: "Список строк, каждая строка является токеном", explain: "Абсолютно верно! Преобразуйте это в ID и отправьте их модели!", correct: true }, { text: "Список ID", explain: "Неверно; для этого предназначен метод call или convert_tokens_to_ids!" }, { text: "Строка, содержащая все токены", explain: "Это было бы неоптимально, так как цель состоит в разделении строки на несколько токенов." } ]} />

План урока

  1. 1. Каков порядок конвейера языкового моделирования?
  2. 2. Сколько измерений имеет тензор, выдаваемый базовой моделью Transformer, и каковы они?
  3. 3. Что из перечисленного является примером subword токенизации?
  4. 4. Что такое model head?
  5. 5. Что такое AutoModel?
  6. 6. Какие методы следует учитывать при объединении в batch последовательностей разной длины?
  7. 7. Какова цель применения функции SoftMax к logits, выдаваемым моделью классификации последовательностей?
  8. 8. Вокруг какого метода сосредоточена большая часть API токенизатора?

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды