О чём урок
Рекомендации широко распространены в интернете. «Купили этот товар? Попробуйте эти похожие товары.» «Понравилась эта книга? Попробуйте эти похожие названия.» «Это не та страница справки, которую вы искали? Попробуйте эти похожие страницы.» Этот notebook демонстрирует, как использовать embeddings для поиска похожих элементов для рекомендаций. В частности, в качестве нашего набора данных мы используем корпус новостных статей AG. Наша модель ответит на вопрос: если дана статья, какие другие статьи наиболее похожи на неё? Далее загрузим данные новостей AG и посмотрим, как они выглядят. title description label_int label 0 World Briefings BRITAIN: BLAIR WARNS OF CLIMATE THREAT Prime M... 1 World 1 Nvidia Puts a Firewall on a Motherboard (PC Wo... PC World - Upcoming chip set will include buil... 4 Sci/Tech 2 Olympic joy in Greek, Chinese press Newspapers in Greece reflect a mixture of exhi... 2 Sports 3 U2 Can iPod with Pictures SAN JOSE, Calif. -- Apple Computer (Quote, Cha... 4 Sci/Tech 4 The Dream Factory Any product, any shape, any size -- manufactur... 4 Sci/Tech Давайте взглянем на те же примеры, но без сокращений многоточием. Прежде чем получать embeddings для этих статей, давайте настроим кэш для сохранения генерируемых нами embeddings. В целом, хорошей идеей является сохранение ваших embeddings, чтобы вы могли повторно использовать их позже. Если вы не сохраните их, вы будете платить каждый раз, когда пересчитываете их. Кэш представляет собой словарь, который сопоставляет кортежи (text, model) с embedding, который является списком чисел с плавающей точкой. Кэш сохраняется как файл Python pickle. Давайте проверим, как это работает, получив embedding. Чтобы найти похожие статьи, давайте следовать плану из трех шагов: Получить similarity embeddings всех описаний статей Вычислить расстояние между исходным заголовком и всеми остальными статьями Вывести другие статьи, наиболее близкие к исходному заголовку Давайте поищем статьи, похожие на первую, которая была о Тони Блэре. Весьма неплохо!
План урока
- 2. Загрузка данных
- 3. Создание кэша для сохранения embeddings
- 4. Рекомендация похожих статей на основе embeddings
- 5. Примеры рекомендаций
- Приложение: Использование embeddings в более сложных рекомендательных системах
- Приложение: Использование embeddings для визуализации похожих статей
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.