Разработка с Claude API

Запросы, потоковые ответы, tool use, структурированный вывод и стоимость.

92 уроков, первые 3 бесплатно. Полный доступ: 1490 руб.

Уроки курса

  1. Welcome to the course
  2. Overview of Claude models
  3. Accessing the API
  4. Getting an API key
  5. Making a request
  6. Multi-Turn conversations
  7. Chat exercise
  8. System prompts
  9. System prompts exercise
  10. Temperature
  11. Course satisfaction survey
  12. Response streaming
  13. Structured data
  14. Structured data exercise
  15. Quiz on accessing Claude with the API
  16. Prompt evaluation
  17. A typical eval workflow
  18. Generating test datasets
  19. Running the eval
  20. Model based grading
  21. Code based grading
  22. Exercise on prompt evals
  23. Quiz on prompt evaluation
  24. Prompt engineering
  25. Being clear and direct
  26. Being specific
  27. Structure with XML tags
  28. Providing examples
  29. Exercise on prompting
  30. Quiz on prompt engineering techniques
  31. Introducing tool use
  32. Project overview
  33. Tool functions
  34. Tool schemas
  35. Handling message blocks
  36. Sending tool results
  37. Multi-turn conversations with tools
  38. Implementing multiple turns
  39. Using multiple tools
  40. Fine grained tool calling
  41. The text edit tool
  42. The web search tool
  43. Quiz on tool use with Claude
  44. Introducing Retrieval Augmented Generation
  45. Text chunking strategies
  46. Text embeddings
  47. The full RAG flow
  48. Implementing the RAG flow
  49. BM25 lexical search
  50. A Multi-Index RAG pipeline
  51. Extended thinking
  52. Image support
  53. PDF support
  54. Citations
  55. Prompt caching
  56. Rules of prompt caching
  57. Prompt caching in action
  58. Code execution and the Files API
  59. Quiz on features of Claude
  60. Introducing MCP
  61. MCP clients
  62. Project setup
  63. Defining tools with MCP
  64. The server inspector
  65. Implementing a client
  66. Defining resources
  67. Accessing resources
  68. Defining prompts
  69. Prompts in the client
  70. MCP review
  71. Quiz on Model Context Protocol
  72. Anthropic apps
  73. Claude Code setup
  74. Claude Code in action
  75. Enhancements with MCP servers
  76. Agents and workflows
  77. Parallelization workflows
  78. Chaining workflows
  79. Routing workflows
  80. Agents and tools
  81. Environment inspection
  82. Workflows vs agents
  83. Quiz on Agents and Workflows
  84. Final Assessment
  85. Course Wrap Up
  86. What You'll Learn
  87. What You'll Learn
  88. What You'll Learn
  89. What You'll Learn
  90. What You'll Learn
  91. What You'll Learn
  92. What You'll Learn

Оценка промптов: Ключ к надежным AI-приложениям с Claude

При работе с Claude, написание хорошего промпта — это только начало пути. Для создания по-настоящему надежных и эффективных AI-приложений необходимо освоить два критически важных понятия: инженерия промптов (Prompt Engineering) и оценка промптов (Prompt Evaluation). Если инженерия промптов предоставляет вам набор техник для написания более качественных запросов, то оценка промптов помогает измерить, насколько хорошо эти запросы на самом деле работают в реальных условиях.

Инженерия промптов: Искусство создания эффективных запросов

Инженерия промптов — это ваш инструментарий для создания четких, понятных и эффективных запросов к Claude. Она включает в себя различные методики, которые помогают модели лучше понять вашу задачу и желаемый формат ответа. Среди них:

Эти техники направлены на то, чтобы Claude точно понимал, что вы от него хотите и как именно вы ожидаете получить ответ, минимизируя двусмысленность и повышая предсказуемость поведения модели.

Оценка промптов: Измерение эффективности на практике

В отличие от инженерии промптов, которая фокусируется на том, как писать запросы, оценка промптов занимается измерением их эффективности. Это систематический процесс, который позволяет количественно определить, насколько хорошо промпт выполняет свою задачу. Вместо субъективного "кажется, работает", оценка предлагает объективные метрики. Вы можете:

Цель оценки — не просто найти ошибки, а понять, почему они возникают, и использовать эти знания для улучшения промптов.

Три пути после написания промпта

После того как вы составили черновик промпта, обычно перед вами открываются три возможных пути дальнейших действий:

  1. Протестировать промпт один раз и решить, что он достаточно хорош. Этот подход несет значительный риск сбоев в рабочей среде, когда пользователи предоставляют неожиданные входные данные. То, что казалось идеальным в вашем ограниченном тестировании, может быстро сломаться при столкновении с реальным разнообразием пользовательских запросов.
  2. Протестировать промпт несколько раз и подкорректировать его для обработки одного-двух крайних случаев. Хотя это лучше, чем первый вариант, пользователи часто будут предоставлять очень неожиданные входные данные, которые вы не учли. Такой подход все еще оставляет много "слепых зон".
  3. Запустить промпт через конвейер оценки, чтобы получить объективную оценку, а затем итерировать промпт на основе этих метрик. Этот подход требует больше усилий и затрат на начальном этапе, но дает гораздо больше уверенности в надежности вашего промпта. Он позволяет выявлять слабые места до того, как они станут проблемами в рабочей среде.

Почему большинство инженеров попадают в ловушки тестирования

Варианты 1 и 2 — это распространенные ловушки, в которые попадают многие инженеры. Естественно написать промпт для серьезного приложения и не протестировать его достаточно тщательно. Мы склонны недооценивать, сколько крайних случаев могут встретить реальные пользователи. Реальность такова, что когда вы развертываете промпт в продакшене, пользователи будут взаимодействовать с ним способами, которые вы никогда не предвидели. То, что казалось надежным промптом во время вашего ограниченного тестирования, может быстро дать сбой при столкновении со всем разнообразием реальных входных данных.

Подход «сначала оценка» (Evaluation-First Approach)

Вариант 3 представляет собой более систематический подход к разработке промптов. Запуская промпт через конвейер оценки, вы получаете объективные метрики его производительности в более широком диапазоне тестовых случаев. Этот подход, основанный на данных, позволяет вам:

Хотя этот подход требует больших первоначальных инвестиций во время и инфраструктуру тестирования, он окупается в виде надежности и отказоустойчивости вашего конечного приложения. Цель состоит в том, чтобы выявлять проблемы на этапе разработки, а не после того, как с ними столкнутся ваши пользователи. В конечном итоге, это приводит к созданию высококачественных LLM-приложений, которые стабильно работают и приносят ценность.