О чём урок
Этот пример демонстрирует, как взаимодействовать с Gemini API, используя библиотеку OpenAI Python. Этот notebook проведет вас через следующие шаги: Выполнение базовой генерации текста с использованием моделей Gemini через библиотеку OpenAI Эксперименты с мультимодальными взаимодействиями, отправка изображений в ваших prompt'ах Извлечение информации из текста с использованием структурированных output'ов (например, определенных полей или JSON output) Использование инструментов Gemini API, таких как function calling Генерация embedding'ов с использованием моделей Gemini API Более подробная информация об этой OpenAI compatibility представлена в документации. При запуске этого notebook вам потребуется установить следующие зависимости: Библиотека OpenAI Python Библиотеки pdf2image и pdfminer.six (и poppler-utils в качестве их зависимости) для работы с PDF-файлами Вам потребуется ваш Gemini API key для выполнения действий, описанных в этом notebook. Вы можете сгенерировать новый на странице Получить API key AI Studio. Вы можете начать с перечисления доступных моделей, используя библиотеку OpenAI. В этом примере вы будете использовать модель gemini-3.7-flash. Для получения более подробной информации о доступных моделях, ознакомьтесь со страницей Gemini models в документации Gemini API. Для вашего первого запроса используйте OpenAI SDK для выполнения генерации текста с текстовым prompt'ом. Вы можете работать с Gemini API для генерации кода. Модели Gemini способны обрабатывать различные модальности данных, такие как неструктурированные файлы, изображения, аудио и видео, что позволяет экспериментировать с мультимодальными сценариями, где вы можете попросить модель описать, объяснить, получить инсайты или извлечь информацию из мультимедийных данных, включенных в ваши prompt'ы. В этом разделе вы будете работать с различными сценариями, включающими мультимедийную информацию. ВАЖНО: Совместимость с OpenAI SDK поддерживает только встроенные изображения и аудиофайлы. Для поддержки видео используйте Python SDK Gemini API. Сначала вы загрузите изображение, с которым хотите работать. Теперь вы можете закодировать изображение и работать с библиотекой OpenAI для взаимодействия с моделями Gemini. Вы можете выполнить тот же процесс, отправляя несколько изображений в один и тот же prompt.
План урока
- Настройка
- Установка необходимых модулей
- Получите ваш Gemini API key
- Определение используемой модели Gemini
- Первое взаимодействие - генерация текста
- Генерация кода
- Мультимодальные взаимодействия
- Работа с изображениями (одно изображение)
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.