О чём урок
Named Entity Recognition (NER) — это задача обработки естественного языка, которая идентифицирует и классифицирует именованные сущности (NE) по заранее определённым семантическим категориям (таким как люди, организации, местоположения, события, временные выражения и количества). Преобразуя необработанный текст в структурированную информацию, NER делает данные более пригодными для использования, облегчая такие задачи, как извлечение информации, агрегация данных, аналитика и мониторинг социальных сетей. Этот notebook демонстрирует, как выполнять NER с помощью chat completion и functions-calling для обогащения текста ссылками на базу знаний, такую как Wikipedia: Текст: В Германии, в 1440 году, ювелир Иоганн Гутенберг изобрёл печатный станок с подвижными литерами. Его работа привела к информационной революции и беспрецедентному массовому распространению литературы по всей Европе. Созданный по образцу существующих винтовых прессов, один печатный станок с подвижными литерами эпохи Возрождения мог производить до 3600 страниц в рабочий день. Текст, обогащённый ссылками на Wikipedia: В Германии, в 1440 году, ювелир Иоганн Гутенберг изобрёл печатный станок с подвижными литерами. Его работа привела к информационной революции и беспрецедентному массовому распространению литературы по всей Европе. Созданный по образцу существующих винтовых прессов, один печатный станок с подвижными литерами эпохи Возрождения мог производить до 3600 страниц в рабочий день. Стоимость инференса: В этом notebook также показано, как оценить стоимость вызовов OpenAI API. Вы можете сгенерировать API key в веб-интерфейсе OpenAI. Подробности см. по ссылке: https://platform.openai.com/account/api-keys. Этот notebook работает с последними моделями OpenAI gpt-3.5-turbo-0613 и gpt-4-0613. Мы определяем стандартный набор NER-меток для демонстрации широкого спектра вариантов использования. Однако для нашей конкретной задачи по обогащению текста ссылками на базу знаний требуется лишь подмножество. The chat completions API принимает список сообщений в качестве входных данных и выдаёт сгенерированное моделью сообщение в качестве выходных данных. Хотя формат чата в первую очередь предназначен для облегчения многоходовых бесед, он одинаково эффективен для одноходовых задач без какой-либо предшествующей беседы.
План урока
- Распознавание именованных сущностей (NER) для обогащения текста
- 1. Настройка
- 1.1 Установка/обновление пакетов Python
- 1.2 Загрузка пакетов и OPENAI_API_KEY
- 2. Определение NER-меток для идентификации
- 3. Подготовка сообщений
- 3.1 Системное сообщение
- 3.2 Сообщение ассистента
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.