О чём урок
Этот notebook демонстрирует, как получить embedding'и из большого набора данных. Набор данных, используемый в этом примере, — это отзывы о продуктах питания с Amazon. Набор данных содержит в общей сложности 568 454 отзыва о продуктах питания, оставленных пользователями Amazon до октября 2012 года. Для иллюстрации мы будем использовать подмножество этого набора данных, состоящее из 1000 самых свежих отзывов. Отзывы написаны на английском языке и, как правило, являются положительными или отрицательными. Каждый отзыв содержит ProductId, UserId, Score, заголовок отзыва (Summary) и текст отзыва (Text). Мы объединим заголовок отзыва и текст отзыва в единый комбинированный текст. Модель закодирует этот комбинированный текст и выдаст единый векторный embedding. Для запуска этого notebook'а вам потребуется установить: pandas, openai, transformers, plotly, matplotlib, scikit-learn, torch (transformer dep), torchvision, и scipy. Time ProductId UserId Score Summary Text combined 0 1351123200 B003XPF9BO A3R7JR3FMEBXQB 5 where does one start...and stop... with a tre... Wanted to save some to bring to my Chicago fam... Title: where does one start...and stop... wit... 1 1351123200 B003JK537S A3JBPC3WFUT5ZP 1 Arrived in pieces Not pleased at all. When I opened the box, mos... Title: Arrived in pieces; Content: Not pleased...
План урока
- 1. Загрузка набора данных
- 2. Получение embedding'ов и их сохранение для дальнейшего использования
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.