Gemini через совместимый с OpenAI API

Урок 26 из 69 курса «Gemini API: быстрый старт»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот пример демонстрирует, как взаимодействовать с Gemini API, используя библиотеку OpenAI Python. Этот notebook проведет вас через следующие шаги: Выполнение базовой генерации текста с использованием моделей Gemini через библиотеку OpenAI Эксперименты с мультимодальными взаимодействиями, отправка изображений в ваших prompt'ах Извлечение информации из текста с использованием структурированных output'ов (например, определенных полей или JSON output) Использование инструментов Gemini API, таких как function calling Генерация embedding'ов с использованием моделей Gemini API Более подробная информация об этой OpenAI compatibility представлена в документации. При запуске этого notebook вам потребуется установить следующие зависимости: Библиотека OpenAI Python Библиотеки pdf2image и pdfminer.six (и poppler-utils в качестве их зависимости) для работы с PDF-файлами Вам потребуется ваш Gemini API key для выполнения действий, описанных в этом notebook. Вы можете сгенерировать новый на странице Получить API key AI Studio. Вы можете начать с перечисления доступных моделей, используя библиотеку OpenAI. В этом примере вы будете использовать модель gemini-3.7-flash. Для получения более подробной информации о доступных моделях, ознакомьтесь со страницей Gemini models в документации Gemini API. Для вашего первого запроса используйте OpenAI SDK для выполнения генерации текста с текстовым prompt'ом. Вы можете работать с Gemini API для генерации кода. Модели Gemini способны обрабатывать различные модальности данных, такие как неструктурированные файлы, изображения, аудио и видео, что позволяет экспериментировать с мультимодальными сценариями, где вы можете попросить модель описать, объяснить, получить инсайты или извлечь информацию из мультимедийных данных, включенных в ваши prompt'ы. В этом разделе вы будете работать с различными сценариями, включающими мультимедийную информацию. ВАЖНО: Совместимость с OpenAI SDK поддерживает только встроенные изображения и аудиофайлы. Для поддержки видео используйте Python SDK Gemini API. Сначала вы загрузите изображение, с которым хотите работать. Теперь вы можете закодировать изображение и работать с библиотекой OpenAI для взаимодействия с моделями Gemini. Вы можете выполнить тот же процесс, отправляя несколько изображений в один и тот же prompt.

План урока

  1. Настройка
  2. Установка необходимых модулей
  3. Получите ваш Gemini API key
  4. Определение используемой модели Gemini
  5. Первое взаимодействие - генерация текста
  6. Генерация кода
  7. Мультимодальные взаимодействия
  8. Работа с изображениями (одно изображение)

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды