О чём урок
В зависимости от задачи NLP, над которой вы работаете, а также от конкретного варианта использования или приложения, ваши данные и задача аннотирования будут выглядеть по-разному. Для этого раздела курса мы будем использовать набор данных, содержащий новости, для выполнения двух задач: классификации текста по его теме и классификации токенов для идентификации упомянутых именованных сущностей. Наборы данных можно импортировать из Hub напрямую через пользовательский интерфейс Argilla, но мы будем использовать SDK, чтобы научиться вносить дальнейшие изменения в данные при необходимости. Первый шаг — подключиться к нашему экземпляру Argilla, как мы это делали в предыдущем разделе: Теперь мы можем подумать о настройках нашего набора данных в Argilla. Они представляют собой задачу аннотирования, которую мы будем выполнять над нашими данными. Сначала мы можем загрузить набор данных из Hub и изучить его features, чтобы убедиться, что мы правильно его настроили. Вот features нашего набора данных: Он содержит поле text, а также некоторые начальные метки для классификации текста. Мы добавим их в настройки нашего набора данных вместе с вопросом spans для именованных сущностей: Давайте углубимся в то, что означают эти настройки. Во-первых, мы определили fields (поля), которые включают информацию, подлежащую аннотированию. В данном случае у нас есть только одно поле, и оно представлено в виде текста, поэтому мы выбрали TextField. Затем мы определяем questions (вопросы), которые представляют собой задачи, которые мы хотим выполнить над нашими данными: Для задачи классификации текста мы выбрали LabelQuestion и использовали уникальные значения столбца label_text в качестве наших меток, чтобы убедиться, что вопрос совместим с метками, которые уже существуют в наборе данных. Для задачи классификации токенов нам понадобится SpanQuestion. Мы определили набор меток, которые будем использовать для этой задачи, а также поле, на котором будем рисовать spans.
План урока
- Настройте свой набор данных
- Загрузите набор данных
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.