Кластеризация с помощью эмбеддингов

Урок 43 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Для корректной работы этого notebook'а требуются лимиты скорости платного уровня. (см. цены для получения дополнительной информации). В этом руководстве показано, как визуализировать и выполнять кластеризацию с использованием embedding'ов из Gemini API. Вы визуализируете подмножество набора данных 20 Newsgroup с помощью t-SNE{:.external} и кластеризуете это подмножество с использованием алгоритма KMeans. Для получения дополнительной информации о начале работы с embedding'ами, сгенерированными с помощью Gemini API, ознакомьтесь с Руководством по началу работы. Вы можете запустить это краткое руководство в Google Colab. Чтобы выполнить это краткое руководство в вашей собственной среде разработки, убедитесь, что ваша среда соответствует следующим требованиям: Python 3.11+ Установленный jupyter для запуска notebook'а. Сначала загрузите и установите библиотеку Python для Gemini API. Прежде чем вы сможете использовать Gemini API, вы должны сначала получить ключ API. Если у вас его еще нет, создайте ключ одним щелчком мыши в Google AI Studio. Получить ключ API В Colab добавьте ключ в менеджер секретов под значком "🔑" на левой панели. Присвойте ему имя GEMINI_API_KEY. После получения ключа API передайте его в SDK. Это можно сделать двумя способами: Поместите ключ в переменную среды GEMINI_API_KEY (SDK автоматически подхватит его оттуда). Передайте ключ в genai.Client(api_key=...) Ключевой момент: Далее вы выберете модель. Для этого руководства подойдет любая модель embedding'ов, но для реальных приложений важно выбрать конкретную модель и придерживаться ее. Выходы разных моделей несовместимы друг с другом. Примечание: В настоящее время Gemini API доступен только в определенных регионах. Набор данных 20 Newsgroups Text Dataset{:.external} содержит 18 000 сообщений из групп новостей по 20 темам, разделенных на обучающие и тестовые наборы. Разделение между обучающими и тестовыми наборами данных основано на сообщениях, опубликованных до и после определенной даты. Для этого руководства вы будете использовать обучающее подмножество. Вот первый пример из обучающего набора.

План урока

  1. Обзор
  2. Предварительные требования
  3. Настройка
  4. Получение ключа API
  5. Выбор используемой модели
  6. Набор данных
  7. Генерация embedding'ов
  8. Снижение размерности

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды