О чём урок
Текстовые эмбеддинги — это полезный способ преобразования текста в числа, которые отражают его смысл и контекст. В этом ноутбуке вы узнаете, как применять их на практике, используя Embed endpoint от Cohere. Вы рассчитаете эмбеддинги для набора данных предложений и построите их на плоскости, чтобы графически убедиться, что похожие предложения действительно отображаются в близкие точки в пространстве эмбеддингов. Вы также изучите, как использовать эмбеддинги для семантического поиска и кластеризации. Мы начнем с установки необходимых инструментов, а затем импортируем их. В этом разделе мы разберемся с интуицией, лежащей в основе текстовых эмбеддингов. Мы будем работать с подмножеством набора данных Airline Travel Information System (ATIS) (источник), созданного на основе запросов клиентов, связанных с бронированием рейсов, вылетами, прибытиями, задержками и отменами. В следующей ячейке кода мы создадим и предварительно просмотрим DataFrame df, содержащий 91 запрос. Далее мы используем функцию get_embeddings(), которая применяет Embed endpoint для генерации текстовых эмбеддингов. Мы сохраняем эмбеддинги в столбце query_embeds DataFrame df. Давайте получим некоторое визуальное представление об эмбеддингах, построив эти числа на тепловой карте. Мы можем сжать размерность до гораздо меньшего числа, скажем, 10. Мы можем сделать это с помощью метода, называемого анализом главных компонент (PCA), который уменьшает количество измерений в эмбеддинге, сохраняя при этом как можно больше информации. Далее мы визуализируем эмбеддинги первых 9 точек данных. Обратите внимание на 3 запроса о наземном транспорте в Бостоне — их паттерны эмбеддингов очень похожи и в то же время отличаются от остальных. Мы можем исследовать это дальше, сжав эмбеддинги до двух измерений и построив их на точечной диаграмме. Мы ожидаем, что тексты схожего значения будут расположены ближе друг к другу, и наоборот. Здесь тексты схожего значения расположены близко друг к другу. Мы видим запросы о билетах слева, запросы об авиакомпаниях где-то посередине и запросы о наземном транспорте в правом верхнем углу.
План урока
- Настройка
- Введение в текстовые эмбеддинги
- Шаг 1: Подготовка набора данных
- Шаг 2: Преобразование текста в эмбеддинги
- Шаг 3: Визуализация эмбеддингов на тепловой карте
- Шаг 4: Визуализация эмбеддингов на 2D-графике
- Введение в семантический поиск
- Шаг 1: Создание эмбеддинга поискового запроса
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.