Поиск аномалий с эмбеддингами: второй вариант

Урок 40 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Для корректной работы этого notebook требуются лимиты запросов платного уровня. (см. ценах для получения дополнительной информации). Этот учебник демонстрирует, как использовать embeddings из Gemini API для обнаружения потенциальных выбросов в вашем наборе данных. Вы визуализируете подмножество набора данных 20 Newsgroup с помощью t-SNE{:.external} и обнаружите выбросы за пределами определённого радиуса от центральной точки каждого категориального кластера. Для получения дополнительной информации о начале работы с embeddings, сгенерированными с помощью Gemini API, ознакомьтесь с руководством Начало работы. Вы можете запустить этот quickstart в Google Colab. Чтобы выполнить этот quickstart в вашей собственной среде разработки, убедитесь, что ваша среда соответствует следующим требованиям: Python 3.11+ Установленный jupyter для запуска notebook. Сначала загрузите и установите библиотеку Python для Gemini API. Прежде чем вы сможете использовать Gemini API, вам необходимо получить ключ API. Если у вас его ещё нет, создайте ключ одним нажатием в Google AI Studio. Получить ключ API В Colab добавьте ключ в менеджер секретов под значком "🔑" на левой панели. Присвойте ему имя GEMINI_API_KEY. Получив ключ API, передайте его в SDK. Вы можете сделать это двумя способами: Поместите ключ в переменную среды GEMINI_API_KEY (SDK автоматически получит его оттуда). Передайте ключ в genai.Client(api_key=...) Ключевой момент: Далее вы выберете модель. Любая модель embedding подойдёт для этого учебника, но для реальных приложений важно выбрать конкретную модель и придерживаться её. Выходные данные разных моделей несовместимы друг с другом. Набор данных 20 Newsgroups Text Dataset{:.external} содержит 18 000 сообщений из новостных групп по 20 темам, разделённых на обучающие и тестовые наборы. Разделение на обучающие и тестовые наборы данных основано на сообщениях, опубликованных до и после определённой даты. В этом учебнике используется обучающее подмножество. Вот первый пример из обучающего набора. Text Label Class Name 0 WHAT car is this!?\nNntp-Posting-Host: rac3.w...

План урока

  1. Обзор
  2. Предварительные требования
  3. Настройка
  4. Получите ключ API
  5. Выберите используемую модель
  6. Подготовка набора данных
  7. Генерация embeddings
  8. Снижение размерности

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды