Запросы с картинками

Урок 6 из 6 курса «Основы Anthropic API»: официальный курс Anthropic Academy (Антропик) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Семейство моделей Claude 3 обладает возможностями зрения (vision capabilities), которые позволяют Claude понимать и анализировать изображения. Теперь мы можем предоставлять как текстовые, так и графические данные для обогащения разговоров и создания мощных новых сценариев использования. Opus, Sonnet и Haiku способны понимать изображения и работать с ними. Поскольку Claude 3.5 Sonnet обладает самыми сильными возможностями зрения, мы будем использовать её на протяжении всего этого урока. Чтобы предоставить Claude изображения, мы просто используем тот же формат messages, который мы видели для текстовых разговоров. Типичное текстовое сообщение пользователя выглядит следующим образом: Чего мы еще не видели, так это того, что мы также можем установить content в сообщении как список блоков контента. Вместо: Мы могли бы перестроить структуру следующим образом: Следующие сообщения идентичны: Давайте попробуем: Как видите, это работает! Мы можем добавить сколько угодно блоков контента в список, как показано в этом примере: Зачем нам это делать? Вероятно, мы бы не стали использовать это для текстового промпта, но нам нужно использовать этот формат при работе с мультиканальными промптами! При предоставлении изображений Claude мы должны написать блок контента изображения. Вот пример: Эта диаграмма объясняет важные фрагменты информации, которые требуются при предоставлении Claude изображения: content в нашем сообщении устанавливается в словарь, содержащий следующие свойства: type - формат кодирования изображения. Пока это должно быть base64. media_type - тип носителя изображения. В настоящее время мы поддерживаем типы носителей image/jpeg, image/png, image/gif и image/webp. data - сами данные изображения. Чаще всего мы хотим предоставить некоторый текст вместе с изображениями в нашем промпте, но вполне допустимо предоставлять только изображение. Давайте попробуем! Мы включили несколько изображений для этого урока в папку prompting_images. Давайте начнем с просмотра одного из этих изображений с помощью Python: Wikimedia Commons, CC-BY-SA Теперь давайте попробуем предоставить это изображение Claude. Первый шаг — получить строку данных изображения, закодированных в base64, которую мы отправляем модели.

План урока

  1. Создание промптов с изображениями
  2. Возможности зрения (Vision capabilities)
  3. Промпты только с изображениями
  4. Промпты с изображениями и текстом
  5. Несколько изображений
  6. Создание вспомогательной функции для изображений
  7. Работа с нелокальными изображениями (изображения по URL)
  8. Советы по промптингу с использованием зрения

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды