Разбираем диаграммы, графики и слайды

Урок 39 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Модели Gemini — это мощные мультимодальные LLM, способные обрабатывать как текстовые, так и графические данные. Этот notebook демонстрирует, как модель Gemini Flash способна извлекать данные из различных изображений. Чтобы запустить следующую cell, ваш API ключ должен быть сохранен в Colab Secret с именем GEMINI_API_KEY. Если у вас еще нет API ключа или вы не знаете, как создать Colab Secret, см. Authentication для примера. Вы будете использовать изображения из репозитория GCPSketchnote Приянки Вергадии. Эти страницы содержат множество деталей, которые должны послужить хорошим эталоном для оценки возможностей Gemini. Эти изображения распространяются по публичной международной лицензии Creative Commons Attribution 4.0. Изображение необходимо преобразовать в формат .jpg, поскольку формат .gif в настоящее время не поддерживается Gemini API. Теперь вы определите вспомогательные функции для уменьшения изображений и запроса модели с их использованием. ПРИМЕЧАНИЕ: В этом примере вы будете использовать библиотеку Pillow для загрузки изображений, но также будет работать использование Image из IPython.display или использование словаря с полями mime_type и data. Теперь давайте посмотрим, как LLM может обработать следующий запрос. Вы будете использовать модель для извлечения информации из одного слайда. В данном случае это график, описывающий pub/sub. Это несложный сценарий использования, однако он покажет, как можно вызывать модель. Вам необходимо загрузить пример диаграммы. Начнем с чего-то простого: Вы также можете использовать его для извлечения информации из определенных частей изображения: В то время как большинство моделей могут получать лишь небольшое количество изображений за раз, модель Gemini Flash способна принимать до 3600 изображений в одном запросе. Это означает, что большинство презентаций могут быть переданы модели без какого-либо разделения. В этом случае вы будете использовать LLM для создания набора вопросов, которые проверяют знание продуктов GCP: Широкие возможности Gemini API в обработке изображений, таких как диаграммы, графики и презентации, подчеркивают мощь мультимодальных LLM.

План урока

  1. Настройка вашего API ключа
  2. Настройка
  3. Интерпретация одной диаграммы
  4. Извлечение информации из одного слайда
  5. Презентации

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды