О чём урок
В этом разделе мы посмотрим, на что способны трансформеры и первый раз применим функцию из библиотеки 🤗 Transformers: pipeline(). [!TIP] 👀 Видите кнопку справа сверху? Нажмите на нее, чтобы открыть блокнот в Google Colab с примерами кода этого раздела. Эта кнопка будет во всех разделах, которые содержат примеры кода. Если вы хотите запускать ноутбуки локально, то обратите внимание на раздел . Трансформеры используются для решения всех видов задач NLP, перечисленных в предыдущем разделе. Библиотека Transformers используется некоторыми компаниями и организациями, которые делятся своими моделями с сообществом Hugging Face: Прежде чем погрузиться в механизм работы трансформеров, давайте взглянем на несколько примеров того, как они могут быть использованы для решения задач NLP. Самый базовый объект библиотеки 🤗 Transformers - pipeline(). Он соединяет в себе необходимые шаги по предобработке и постобработке данных и позволяет передавать модели на вход текст, а на выходе получать читаемый ответ: Мы можем передать на вход сразу несколько предложений! По умолчанию этот пайплайн выбирает специальную модель, которая была предобучена для оценки тональности предложений на английском языке. Модель загружается и кэшируется когда вы создадаете объект classifier. Если вы перезапустите команду, будет использована кэшированная модель, т.е. загрузки новой модели не произойдет. В процессе обработки пайплайном текста, который вы ему передали, есть три главных шага: Текст предобрабатывается в формат, который понятен модели. Предобработанный текст передается в модель. Результаты модели проходят через постобработку и вы получаете читаемый ответ. Некоторые из доступных пайплайнов are: feature-extraction (превращение текста в векторы) fill-mask ner (распознавание именованных сущностей) question-answering sentiment-analysis summarization text-generation translation zero-shot-classification Давайте взглянем на некоторые из них! Мы начнем с более сложной задачи, где нам нужно классифицировать тексты, которые не были размечены (для них нет ответов - позитивный или негативный, агрессивный или нейтральный и тд). Это распространенный сценарий в реальных проектах, потому что разметка текста обычно занимает много времени и требует знаний в предметной области.
План урока
- Трансформеры повсюду!
- Работа с пайплайнами
- Zero-shot classification
- Генерация текста
- Использование произвольной модели из Hub в пайплайне
- The Inference API
- Заполнение пропусков
- Распознавание именованных сущностей (NER)
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.