О чём урок
{#if fw === 'pt'} {:else} {/if} В этом разделе мы рассмотрим, как модели Transformer могут быть использованы для сжатия длинных документов в краткое изложение - задача, известная как суммаризация текста (text summarization). Это одна из самых сложных задач NLP, поскольку она требует целого ряда способностей, таких как понимание длинных отрывков и генерация связного текста, отражающего основные темы документа. Однако при правильном подходе суммаризация текста - это мощный инструмент, который может ускорить различные бизнес-процессы, избавив экспертов домена от необходимости детального прочтения длинных документов. Хотя на Hugging Face Hub уже существуют различные дообученные модели для суммаризации, почти все они подходят только для англоязычных документов. Поэтому, чтобы добавить изюминку в этот раздел, мы обучим двухязыковую модель для английского и испанского языков. К концу этого раздела у вас будет модель, способная к суммаризации отзывов покупателей, как показано здесь: Как мы увидим, эти резюме кратки, поскольку они составляются на основе названий, которые покупатели указывают в своих отзывах о товаре. Для начала давайте соберем подходящий двуязыковой корпус для этой задачи. Для создания нашей двуязыковой суммаризации мы будем использовать Multilingual Amazon Reviews Corpus. Этот корпус состоит из отзывов о товарах Amazon на шести языках и обычно используется для тестирования многоязыковых классификаторов. Однако, поскольку каждый отзыв сопровождается коротким заголовком, мы можем использовать заголовки в качестве целевых резюме для обучения нашей модели! Чтобы начать работу, давайте загрузим английские и испанские подмножества из Hugging Face Hub: Как видите, для каждого языка есть 200 000 отзывов в части train и по 5 000 отзывов в частях validation и test. Интересующая нас информация о рецензиях содержится в столбцах review_body и review_title. Давайте рассмотрим несколько примеров, создав простую функцию, которая берет случайную выборку из обучающего множества с помощью методов, изученных в Главе 5: [!TIP] ✏️ Попробуйте! Измените random seed в команде Dataset.shuffle(), чтобы изучить другие отзывы в корпусе.
План урока
- Подготовка многоязыкового корпуса
- Модели для суммаризации текста
- Предварительная обработка данных
- Метрики для суммаризации текста
- Создание сильного базового уровня
- Дообучение mT5 с API Trainer
- Дообучение mT5 с Keras
- Дообучение mT5 с 🤗 Accelerate
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.