О чём урок
Примечание: Для корректной работы этого notebook требуются лимиты запросов платного уровня. (см. цены для получения дополнительной информации). В этом notebook вы научитесь использовать embeddings, созданные с помощью Gemini API, для обучения модели, способной классифицировать различные типы сообщений из newsgroup по их тематике. Прежде чем использовать Gemini API, вы должны сначала получить API key. Если у вас его еще нет, создайте ключ одним щелчком мыши в Google AI Studio. Получить API key В Colab добавьте ключ в secrets manager под значком "🔑" на левой панели. Присвойте ему имя GEMINI_API_KEY. Получив API key, передайте его в SDK. Это можно сделать двумя способами: Поместите ключ в переменную среды GEMINI_API_KEY (SDK автоматически подхватит его оттуда). Передайте ключ в genai.Client(api_key=...) Ключевой момент: Далее вы выберете модель. Любая embedding модель подойдет для этого tutorial, но для реальных приложений важно выбрать конкретную модель и придерживаться ее. Выходы разных моделей несовместимы друг с другом. 20 Newsgroups Text Dataset содержит 18 000 сообщений из newsgroup по 20 темам, разделенных на обучающие и тестовые наборы. Разделение между обучающими и тестовыми dataset основано на сообщениях, опубликованных до и после определенной даты. Для этого tutorial вы будете использовать подмножества обучающих и тестовых dataset. Вы выполните предварительную обработку и организуете данные в Pandas dataframes. Вот пример того, как выглядит точка данных из обучающего набора. Теперь вы начнете предварительную обработку данных для этого tutorial. Удалите любую конфиденциальную информацию, такую как имена, адреса электронной почты, или избыточные части текста, такие как "From: " и "\nSubject: ". Организуйте информацию в Pandas dataframe, чтобы она была более читабельной. Text Label Class Name 0 WHAT car is this!?\nNntp-Posting-Host: rac3.w... 7 rec.autos 1 SI Clock Poll - Final Call\nSummary: Final ca... 4 comp.sys.mac.hardware 2 PB questions...\nOrganization: Purdue Univers...
План урока
- Обзор
- Получите API Key
- Выберите модель для использования
- Подготовка dataset
- Генерация embeddings
- Создание простой классификационной модели
- Обучение модели для классификации newsgroup
- Оценка производительности модели
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.