Указание точек и 3D-понимание сцены

Урок 31 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот colab демонстрирует некоторые из захватывающих вариантов использования Gemini в пространственном понимании. Он сосредоточен на том, как возможности Gemini по пониманию изображений и реального мира, включая указание и 3D-пространственное понимание, были кратко представлены в видеоролике "Создание с Gemini 2.0: Пространственное понимание". 🚧 Указание является важной возможностью для vision language моделей, поскольку оно позволяет модели точно ссылаться на сущность. Gemini Flash улучшил точность пространственного понимания, предлагая 2D-прогнозирование точек в качестве экспериментальной функции. Ниже вы увидите, что указание может быть объединено с рассуждением. Традиционно Vision Language Model (VLM) воспринимает мир в 2D, однако Gemini 3.7 Flash может выполнять 3D-обнаружение. Модель имеет общее представление о пространстве и знает, где находятся объекты в 3D-пространстве. Модель будет отвечать на запросы, связанные с пространственным пониманием, в формате json для облегчения парсинга, и координаты всегда имеют одинаковые соглашения. Чтобы этот пример был более читабельным, он накладывает пространственные сигналы на изображение, и читатели могут навести курсор на изображение, чтобы получить полный ответ. Координаты находятся в системе координат изображения и нормализованы до целого числа от 0 до 1000. Верхний левый угол — (0,0), а нижний правый — (1000,1000). Точка представлена в порядке [y, x], а 2D bounding boxes — в порядке y_min, x_min, y_max, x_max. Кроме того, 3D bounding boxes представлены 9 числами: первые 3 числа представляют центр объекта в системе координат камеры, они указаны в метрических единицах; следующие 3 числа представляют размер объекта в метрах, а последние 3 числа — углы Эйлера, представляющие roll, pitch и yaw, они указаны в градусах. Чтобы узнать больше о 2D-пространственном понимании, ознакомьтесь с 2D-примерами и примером пространственного понимания из Google AI Studio. Для запуска следующей cell ваш API key должен быть сохранен в Colab Secret с именем GEMINI_API_KEY. Если у вас еще нет API key или вы не знаете, как создать Colab Secret, см.

План урока

  1. Точки и 3D bounding boxes являются экспериментальными. Используйте 2D bounding boxes для повышения точности.
  2. Настройка
  3. Установка SDK
  4. Настройка вашего API key
  5. Инициализация клиента SDK
  6. Выбор модели
  7. Загрузка примеров изображений
  8. Указание на объекты с помощью Gemini

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды