Эмбеддинги через Embed

Урок 88 из 114 курса «Cohere: LLM University»: официальный курс Cohere LLM University (Кохир) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этой лабораторной работе мы узнаем, как анализировать текстовый набор данных с помощью конечной точки Cohere Embed. Этот Colab дополняет урок по конечной точке Embed из LLM University. Первый шаг — установить Cohere Python SDK. Затем создайте API key, который вы можете сгенерировать на панели управления Cohere. Конечная точка Cohere Embed принимает фрагмент текста и преобразует его в векторное embedding. Embeddings представляют текст в виде чисел, которые фиксируют его значение и контекст. Это означает, что она дает вам возможность превращать неструктурированные текстовые данные в структурированную форму. Это открывает возможности для их анализа и извлечения ценных сведений. Здесь у нас есть список из 50 самых популярных поисковых запросов о Hello, World!, взятых из инструмента для работы с ключевыми словами. Давайте рассмотрим несколько примеров: Мы используем конечную точку Embed для получения embeddings для каждого из этих поисковых запросов. Примечание: Этот раздел о семантическом поиске не включен в сообщение блога, но мы рекомендуем вам все равно ознакомиться с ним, если вы хотите увидеть, как embedding используется для поиска в наборе данных! Мы рассмотрим пару примеров приложений. Первый пример — семантический поиск. При наличии нового запроса наша «поисковая система» должна вернуть наиболее похожие часто задаваемые вопросы (FAQ), где FAQ — это 50 поисковых запросов, которые мы загрузили ранее. Мы используем косинусное сходство для сравнения сходства нового запроса с каждым из часто задаваемых вопросов. Наконец, мы отображаем 5 лучших часто задаваемых вопросов, которые соответствуют новому запросу. Во втором примере мы берем ту же идею, что и в семантическом поиске, и рассматриваем ее шире, а именно: исследование огромных объемов текста и анализ их семантических связей. Мы будем использовать те же 50 самых популярных поисковых запросов о Hello, World! Существуют различные методы, которые мы можем использовать для сжатия embeddings до всего лишь 2 измерений, сохраняя при этом как можно больше информации. Мы будем использовать технику под названием UMAP.

План урока

  1. Получение embeddings
  2. Семантический поиск
  3. Семантическое исследование

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды