О чём урок
{#if fw === 'pt'} {:else} {/if} Первое приложение, которое мы рассмотрим, - это классификация токенов. Эта общая задача охватывает любую проблему, которую можно сформулировать как "присвоение метки каждому токену в предложении", например: Распознавание именованных сущностей (Named entity recognition - NER): Поиск сущностей (например, лиц, мест или организаций) в предложении. Это можно сформулировать как приписывание метки каждому токену, имея один класс для сущности и один класс для "нет сущности". Морфологическая разметка (Part-of-speech tagging - POS): Пометить каждое слово в предложении как соответствующее определенной части речи (например, существительное, глагол, прилагательное и т. д.). Выделение токенов (Chunking): Поиск токенов, принадлежащих одной и той же сущности. Эта задача (которая может быть объединена с POS или NER) может быть сформулирована как присвоение одной метки (обычно B-) всем токенам, которые находятся в начале фрагмента текста, другой метки (обычно I-) - токенам, которые находятся внутри фрагмента текста, и третьей метки (обычно O) - токенам, которые не принадлежат ни к одному фрагменту. Конечно, существует множество других типов задач классификации токенов; это лишь несколько показательных примеров. В этом разделе мы дообучим модель (BERT) для задачи NER, которая затем сможет вычислять прогнозы, подобные этому: Вы можете найти модель, которую мы обучим и загрузим на хаб, и перепроверить ее предсказания здесь. Прежде всего, нам нужен набор данных, подходящий для классификации токенов. В этом разделе мы будем использовать набор данных CoNLL-2003, который содержит новости от Reuters. [!TIP] 💡 Если ваш набор данных состоит из текстов, часть которых состоит из слов с соответствующими метками, вы сможете адаптировать описанные здесь процедуры обработки данных к своему набору данных. Обратитесь к Главе 5, если вам нужно освежить в памяти то, как загружать собственные данные в Dataset. Для загрузки датасета CoNLL-2003 мы используем метод load_dataset() из библиотеки 🤗 Datasets: Это позволит загрузить и кэшировать датасет, как мы видели в Главе 3 для датасета GLUE MRPC.
План урока
- Подготовка данных
- Датасет CoNLL-2003
- Обработка данных
- Дообучение модели с помощью API Trainer
- Дообучение модели с помощью Keras
- Сопоставление данных
- Определение модели
- Дообучение модели
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.