Разработка с Claude API

Запросы, потоковые ответы, tool use, структурированный вывод и стоимость.

92 уроков, первые 3 бесплатно. Полный доступ: 1490 руб.

Уроки курса

  1. Welcome to the course
  2. Overview of Claude models
  3. Accessing the API
  4. Getting an API key
  5. Making a request
  6. Multi-Turn conversations
  7. Chat exercise
  8. System prompts
  9. System prompts exercise
  10. Temperature
  11. Course satisfaction survey
  12. Response streaming
  13. Structured data
  14. Structured data exercise
  15. Quiz on accessing Claude with the API
  16. Prompt evaluation
  17. A typical eval workflow
  18. Generating test datasets
  19. Running the eval
  20. Model based grading
  21. Code based grading
  22. Exercise on prompt evals
  23. Quiz on prompt evaluation
  24. Prompt engineering
  25. Being clear and direct
  26. Being specific
  27. Structure with XML tags
  28. Providing examples
  29. Exercise on prompting
  30. Quiz on prompt engineering techniques
  31. Introducing tool use
  32. Project overview
  33. Tool functions
  34. Tool schemas
  35. Handling message blocks
  36. Sending tool results
  37. Multi-turn conversations with tools
  38. Implementing multiple turns
  39. Using multiple tools
  40. Fine grained tool calling
  41. The text edit tool
  42. The web search tool
  43. Quiz on tool use with Claude
  44. Introducing Retrieval Augmented Generation
  45. Text chunking strategies
  46. Text embeddings
  47. The full RAG flow
  48. Implementing the RAG flow
  49. BM25 lexical search
  50. A Multi-Index RAG pipeline
  51. Extended thinking
  52. Image support
  53. PDF support
  54. Citations
  55. Prompt caching
  56. Rules of prompt caching
  57. Prompt caching in action
  58. Code execution and the Files API
  59. Quiz on features of Claude
  60. Introducing MCP
  61. MCP clients
  62. Project setup
  63. Defining tools with MCP
  64. The server inspector
  65. Implementing a client
  66. Defining resources
  67. Accessing resources
  68. Defining prompts
  69. Prompts in the client
  70. MCP review
  71. Quiz on Model Context Protocol
  72. Anthropic apps
  73. Claude Code setup
  74. Claude Code in action
  75. Enhancements with MCP servers
  76. Agents and workflows
  77. Parallelization workflows
  78. Chaining workflows
  79. Routing workflows
  80. Agents and tools
  81. Environment inspection
  82. Workflows vs agents
  83. Quiz on Agents and Workflows
  84. Final Assessment
  85. Course Wrap Up
  86. What You'll Learn
  87. What You'll Learn
  88. What You'll Learn
  89. What You'll Learn
  90. What You'll Learn
  91. What You'll Learn
  92. What You'll Learn

Возможности визуального анализа Claude: Работа с изображениями через API

Модели Claude от Anthropic обладают впечатляющими возможностями визуального анализа, позволяя включать изображения в ваши сообщения и запрашивать их анализ бесчисленными способами. Вы можете попросить Claude описать содержимое изображения, сравнить несколько изображений, подсчитать объекты или выполнить сложные задачи визуального анализа. Это открывает новые горизонты для автоматизации и взаимодействия с искусственным интеллектом, выходя за рамки чисто текстовых сценариев.

Основы работы с изображениями

При работе с изображениями в Claude API важно учитывать несколько ключевых ограничений и особенностей, чтобы обеспечить эффективное и безошибочное взаимодействие:

Чтобы отправить изображение в Claude, вы включаете блок изображения (image block) в сообщение пользователя наряду с текстовыми блоками (text block). Это позволяет Claude обрабатывать как визуальную, так и текстовую информацию в одном контексте. Например, вы можете отправить изображение и сразу же задать вопрос о нем. Взаимодействие происходит так же, как и при чисто текстовых запросах: ваш сервер отправляет сообщение, содержащее как изображение, так и текст, а Claude отвечает текстовым блоком, содержащим его анализ.

Пример структуры сообщения с изображением (для иллюстрации концепции, а не для прямого выполнения):


[
  {
    "type": "image",
    "source": {
      "type": "base64",
      "media_type": "image/png",
      "data": "..." // Здесь будут данные изображения в формате base64
    }
  },
  {
    "type": "text",
    "text": "Что вы видите на этом изображении?"
  }
]

Техники проектирования промптов для изображений

Ключ к получению высококачественных результатов при работе с изображениями заключается в применении тех же методов prompt engineering, которые вы используете для текста. Простые, общие промпты часто приводят к неточным или неудовлетворительным результатам. Например, вопрос "Сколько шариков на этом изображении?" может вернуть неверное количество, если изображение сложное или содержит много мелких деталей.

Вы можете значительно повысить точность и полезность ответов Claude, используя следующие стратегии:

Пошаговый анализ

Вместо того чтобы задавать простой вопрос, предоставьте Claude четкую методологию. Например, для подсчета шариков:

Вместо: "Сколько шариков на этом изображении?"

Попробуйте: "Проанализируйте это изображение шариков и определите точное количество, используя следующую методологию:

  1. Начните с идентификации каждого уникального шарика по одному. Присваивайте каждому номер по мере его идентификации.
  2. Проверьте свой результат, подсчитывая другим методом. Начните с нижнего левого угла и двигайтесь по рядам, слева направо.

Каково точное, проверенное количество шариков на этом изображении?"

Такой подход направляет Claude через структурированный процесс мышления, что значительно повышает вероятность получения точного ответа.

Примеры "одного выстрела" (One-Shot Examples)

Вы также можете улучшить точность, предоставляя примеры в своем сообщении. Включите изображение с известным количеством объектов, укажите правильный ответ, а затем задайте вопрос о вашем целевом изображении. Это дает Claude ориентир для типа анализа, который вы ожидаете.

Например: "Вот изображение с 5 яблоками. Теперь, сколько яблок на этом изображении?"

Реальный пример: Оценка пожарного риска

Рассмотрим практическое применение: автоматизация оценки пожарного риска для страхования жилья. Вместо того чтобы отправлять инспекторов на каждую собственность, страховые компании могут использовать спутниковые снимки и анализ Claude.

Система может анализировать спутниковые снимки для выявления:

Вместо простого промпта, такого как "предоставьте оценку пожарного риска", хорошо структурированный промпт разбивает анализ на конкретные шаги:

"Проанализируйте приложенное спутниковое изображение объекта, выполнив следующие конкретные шаги:

  1. Идентификация жилого дома: Найдите основной жилой дом на участке, ища:
    • Самое большое строение с крышей.
    • Типичные жилые особенности (подъездная дорога, правильная геометрия).
    • Отличие от других строений (гаражи, сараи, бассейны).
  2. Анализ нависающих деревьев: Изучите все деревья вблизи основного жилого дома:
    • Определите любые деревья, крона которых простирается непосредственно над какой-либо частью крыши.
    • Оцените процент крыши, покрытой нависающими ветвями (0-25%, 25-50%, 50-75%, 75%+).
    • Отметьте особенно густые участки нависания.
  3. Оценка пожарного риска: Для любых нависающих деревьев оцените:
    • Потенциальную уязвимость к лесным пожарам (точки улавливания искр, непрерывные пути распространения огня к строению).
    • Близость к дымоходам, вентиляционным отверстиям или другим отверстиям в крыше, если они видны.
    • Области, где ветви создают "мост" между дикой растительностью и строением.
  4. Идентификация защитного пространства: Оцените общую растительную структуру участка:
    • Определите, соединяются ли деревья, образуя непрерывный полог над домом или рядом с ним.
    • Отметьте любые очевидные "лестницы для огня" (растительность, которая может перенести огонь с земли на дерево, а затем на крышу).
  5. Рейтинг пожарного риска: На основе вашего анализа присвойте рейтинг пожарного риска от 1 до 4:
    • Рейтинг 1 (Низкий риск): Нет ветвей деревьев, нависающих над крышей, хорошее защитное пространство вокруг дома.
    • Рейтинг 2 (Умеренный риск): Минимальное нависание (<25% крыши), некоторое разделение между кронами деревьев.
    • Рейтинг 3 (Высокий риск): Значительное нависание (25-50% крыши), соединенные кроны деревьев, множественные точки уязвимости.
    • Рейтинг 4 (Серьезный риск): Обширное нависание (>50% крыши), густая растительность вплотную к строению.

По каждому пункту выше (1-5) напишите одно предложение, суммирующее ваши выводы, а ваш окончательный ответ должен быть числовым рейтингом."

Этот подробный промпт направляет Claude через систематический анализ, что приводит к гораздо более точным и полезным оценкам, чем простой запрос. Он демонстрирует, как детальное структурирование запроса позволяет использовать мощь визуальных возможностей Claude для решения сложных задач в реальном мире.

Заключение

Возможности Claude по работе с изображениями открывают огромный потенциал для разработчиков и компаний. Однако, как и в случае с текстовыми взаимодействиями, эффективность анализа изображений напрямую зависит от качества ваших промптов. Инвестируйте время в создание подробных, структурированных промптов, а не полагайтесь на простые вопросы, если вы хотите получить надежные и точные результаты. Применяя принципы prompt engineering, вы сможете раскрыть весь потенциал Claude в области визуального анализа.