Глава 1. Собираем данные об Олимпиаде 2020 из Википедии

Урок 189 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Для ответов на вопросы на основе текстовых документов мы рекомендуем процедуру, описанную в Question Answering using Embeddings. Часть представленного ниже кода может использовать устаревшие API endpoints. Идея этого проекта заключается в создании модели для ответов на вопросы, основанной на нескольких предоставленных абзацах текста. Базовые модели GPT-3 хорошо справляются с ответами на вопросы, когда ответ содержится в абзаце, однако если ответа нет, базовые модели, как правило, стараются ответить в любом случае, что часто приводит к вымышленным ответам. Чтобы создать модель, которая отвечает на вопросы только при наличии достаточного контекста, мы сначала формируем dataset из вопросов и ответов на основе абзацев текста. Для обучения модели отвечать только при наличии ответа, мы также добавляем состязательные примеры, где вопрос не соответствует контексту. В таких случаях мы просим модель выводить "No sufficient context for answering the question". Мы выполним эту задачу в трёх notebook'ах: Первый (этот) notebook посвящён сбору актуальных данных, которые GPT-3 не видел во время своего pre-training. Мы выбрали тему Олимпийских игр 2020 (которые фактически состоялись летом 2021 года) и загрузили 713 уникальных страниц. Мы организовали dataset по отдельным разделам, которые будут служить контекстом для постановки вопросов и ответов на них. Второй notebook будет использовать Davinci-instruct для постановки нескольких вопросов на основе раздела Википедии, а также для ответов на эти вопросы, основываясь на этом разделе. Третий notebook будет использовать dataset пар контекст-вопрос-ответ для дополнительного создания состязательных вопросов и пар контекст-вопрос, где вопрос не был сгенерирован на основе этого контекста. В таких случаях модели будет предложено ответить "No sufficient context for answering the question". Мы также обучим discriminator model, которая предсказывает, можно ли ответить на вопрос на основе контекста или нет. Извлечение данных займёт около получаса, и их обработка, вероятно, столько же.

План урока

  1. 1.1 Извлечение данных с использованием wikipedia API
  2. 1.2 Фильтрация страниц Википедии и их разделение на секции по заголовкам
  3. Сохранение dataset'а разделов
  4. 1.3 (Необязательно) Изучение данных

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды