О чём урок
Это простая демонстрация того, как мы можем объединить несколько моделей NLP для получения результата, гораздо ближе соответствующего нашим ожиданиям. Embeddings могут улавливать смысл фрагмента текста, выходя за рамки простого сопоставления ключевых слов. В этой статье мы создадим простую систему рекомендаций новостных статей, которая вычисляет embeddings всех доступных статей и рекомендует наиболее релевантные статьи на основе сходства embeddings. Мы также сделаем рекомендации более точными, используя классификацию текста для рекомендации только статей в той же категории. Затем мы извлечем список тегов из каждой рекомендованной статьи, что может дополнительно помочь читателям находить новые статьи. Все это будет сделано с помощью трех API endpoints Cohere, объединенных вместе: Embed, Classify и Chat. Мы реализуем следующие шаги: 1: Найти наиболее похожие статьи на ту, которую читают в данный момент, используя embeddings. 2: Оставить только статьи той же категории, используя классификацию текста. 3: Извлечь теги из этих статей. 4: Показать топ-5 рекомендованных статей. На протяжении всей этой статьи мы будем использовать набор данных новостных статей BBC в качестве примера [Источник]. Этот набор данных состоит из статей нескольких категорий: business, politics, tech, entertainment и sport. Мы извлечем подмножество данных и на Шаге 1 используем первые 100 точек данных. Далее мы преобразуем текст каждой статьи в embeddings. Embedding — это список чисел, которые наши модели используют для представления фрагмента текста, улавливая его контекст и смысл. Мы делаем это, вызывая Embed endpoint Cohere, который принимает текст в качестве входных данных и возвращает embeddings в качестве выходных данных. Далее мы выбираем любую статью, которую читатель в данный момент читает (назовем ее target), и находим другие статьи с наиболее похожими embeddings (назовем их candidates), используя косинусное сходство. Косинусное сходство — это метрика, которая измеряет, насколько похожи последовательности чисел (в нашем случае embeddings), и мы вычисляем ее для каждой пары target-candidate.
План урока
- Система рекомендаций статей с использованием текстовых эмбеддингов, классификации и извлечения
- 1.1: Получение статей
- 1.2: Преобразование статей в embeddings
- 1.3: Выбрать одну статью и найти наиболее похожие статьи
- 2.1: Создание классификатора
- 2.2: Измерение производительности
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.