Claude в Google Vertex AI

Подключение Claude через Google Cloud — авторизация, регионы, биллинг.

100 уроков, первые 3 бесплатно. Полный доступ: 1490 руб.

Уроки курса

  1. Welcome to the course
  2. Overview of Claude models
  3. Accessing the API
  4. Vertex AI Setup
  5. Making a request
  6. Multi-turn conversations
  7. Chat exercise
  8. System prompts
  9. System prompts exercise
  10. Temperature
  11. Course satisfaction survey
  12. Response streaming
  13. Controlling model output
  14. Structured data
  15. Structured data exercise
  16. Quiz on accessing Claude with the API
  17. Prompt evaluation
  18. A typical eval workflow
  19. Generating test datasets
  20. Running the eval
  21. Model based grading
  22. Code based grading
  23. Exercise on prompt evals
  24. Quiz on prompt evaluation
  25. Prompt engineering
  26. Being clear and direct
  27. Being specific
  28. Structure with XML tags
  29. Providing examples
  30. Exercise on prompting
  31. Quiz on prompt engineering techniques
  32. Introducing tool use
  33. Project overview
  34. Tool functions
  35. Tool schemas
  36. Handling message blocks
  37. Sending tool results
  38. Multi-turn conversations with tools
  39. Implementing multiple turns
  40. Using multiple tools
  41. The batch tool
  42. Tools for structured data
  43. The text edit tool
  44. The web search tool
  45. Quiz on tool use with Claude
  46. Introducing Retrieval Augmented Generation
  47. Text chunking strategies
  48. Text embeddings
  49. The full RAG flow
  50. Implementing the RAG flow
  51. BM25 lexical search
  52. A Multi-index RAG pipeline
  53. Reranking results
  54. Contextual retrieval
  55. Quiz on Retrieval Augmented Generation
  56. Extended thinking
  57. Image support
  58. PDF support
  59. Citations
  60. Prompt caching
  61. Rules of prompt caching
  62. Prompt caching in action
  63. Quiz on features of Claude
  64. Introducing MCP
  65. MCP clients
  66. Project setup
  67. Defining tools with MCP
  68. The server inspector
  69. Implementing a client
  70. Defining resources
  71. Accessing resources
  72. Defining prompts
  73. Prompts in the client
  74. MCP review
  75. Quiz on Model Context Protocol
  76. Anthropic apps
  77. Claude Code setup
  78. Claude Code in action
  79. Enhancements with MCP servers
  80. Parallelizing Claude Code
  81. Automated debugging
  82. Computer use
  83. How computer use works
  84. Agents and workflows
  85. Parallelization workflows
  86. Chaining workflows
  87. Routing workflows
  88. Agents and tools
  89. Environment inspection
  90. Workflows vs agents
  91. Quiz on agents and workflows
  92. Final assessment quiz
  93. Course Wrap Up
  94. Course Description
  95. Course Description
  96. Course Description
  97. Course Description
  98. Course Description
  99. Course Description
  100. Course Description

Типовой рабочий процесс оценки промптов

В мире больших языковых моделей (LLM) таких как Claude, качество ответов напрямую зависит от качества входных данных, которые мы им предоставляем — так называемых промптов. Чтобы максимально эффективно использовать возможности Claude и постоянно улучшать его производительность для конкретных задач, необходим систематический подход к оценке и оптимизации промптов. Типовой рабочий процесс оценки промптов состоит из пяти ключевых шагов, которые позволяют объективно измерять и последовательно улучшать ваши запросы. Хотя существует множество различных способов организации этих рабочих процессов и доступных инструментов, понимание основного процесса поможет вам начать с малого и масштабировать свои усилия по мере необходимости.

Шаг 1: Разработка начального промпта

Первый шаг в любом процессе оптимизации — это создание отправной точки. Начните с написания первоначального промпта, который вы хотите улучшить. Этот промпт будет служить вашей "базовой линией" для тестирования и дальнейших улучшений. Он должен быть достаточно простым, чтобы его можно было легко модифицировать, но при этом выполнять основную задачу, для которой он предназначен. Например, для ответа на вопрос пользователя, ваш начальный промпт может выглядеть так:

prompt = f"""
Пожалуйста, ответьте на вопрос пользователя:
{question}
"""

Здесь {question} — это переменная, куда будет подставляться конкретный вопрос пользователя. Этот базовый промпт станет основой для наших экспериментов и измерений.

Шаг 2: Создание оценочного набора данных

После того как у вас есть базовый промпт, следующим шагом является создание оценочного набора данных. Этот набор данных содержит примеры входных данных, которые вы будете подавать в свой промпт. Поскольку наш пример промпта имеет только один вход (вопрос пользователя), нам нужна коллекция различных вопросов для тестирования. Важно, чтобы этот набор данных был репрезентативным для тех сценариев, в которых вы ожидаете использовать Claude. Он должен охватывать различные аспекты, сложности и потенциальные "краевые случаи" вашей задачи.

Вы можете собрать эти наборы данных вручную, используя реальные пользовательские запросы, или даже сгенерировать их с помощью самого Claude, если у вас есть четкие критерии. В реальных условиях оценочные наборы данных могут содержать десятки, сотни или даже тысячи различных записей. Однако для нашего примера мы начнем всего с нескольких вопросов, чтобы проиллюстрировать процесс:

Эти вопросы будут объединены с нашим промптом на следующем шаге.

Шаг 3: Прогон через Claude

Теперь, когда у вас есть базовый промпт и оценочный набор данных, пришло время пропустить их через Claude. На этом шаге вы берете каждый вопрос из вашего набора данных, объединяете его с шаблоном промпта, чтобы создать полный запрос, а затем отправляете каждый из них в Claude и собираете ответы. Этот процесс имитирует то, как Claude будет использоваться в реальных условиях.

Например, первый вопрос "Как приготовить овсянку?" будет объединен с нашим промптом, формируя полный запрос, который Claude обработает и вернет соответствующий ответ. Вы повторяете этот процесс для всех вопросов в вашем наборе данных, создавая коллекцию пар "вопрос-ответ". Каждый ответ должен быть сохранен для последующей оценки. Этот этап позволяет получить реальные результаты работы Claude с вашим текущим промптом на разнообразных входных данных.

Шаг 4: Оценка с помощью грейдера

После того как вы собрали ответы от Claude, наступает самый важный шаг — объективное измерение качества этих ответов. Для этого используется грейдер (от англ. "grader" — оценщик). Грейдер — это система или человек, который анализирует каждую пару "вопрос-ответ" и присваивает оценку на основе заранее определенных критериев качества. Это может быть как автоматизированная система, использующая другие LLM или эвристические правила, так и эксперт-человек, который вручную оценивает каждый ответ.

Грейдер присваивает баллы, обычно по шкале, например, от 1 до 10, где:

После оценки всех ответов вы усредняете полученные баллы. Например, если ответы на наши три вопроса получили баллы 10, 4 и 9, то средний балл составит (10 + 4 + 9) / 3 = 7.66. Этот средний балл дает вам объективную количественную оценку производительности вашего промпта. Он служит четким индикатором того, насколько хорошо ваш текущий промпт справляется с поставленной задачей.

Шаг 5: Изменение промпта и повторение процесса

Получив базовый балл производительности вашего промпта, вы можете приступить к его улучшению. На этом шаге вы модифицируете свой промпт, а затем запускаете весь процесс оценки заново, чтобы увидеть, улучшили ли ваши изменения производительность. Это итеративный процесс, который позволяет вам систематически экспериментировать и оптимизировать.

Например, вы можете улучшить исходный промпт, добавив более конкретные инструкции, чтобы побудить Claude давать более полные ответы:

prompt = f"""
Пожалуйста, ответьте на вопрос пользователя:
{question}
Ответьте на вопрос максимально подробно.
"""

После изменения промпта (теперь это будет "Prompt v2"), вы снова прогоняете его через тот же оценочный набор данных, собираете новые ответы и оцениваете их с помощью грейдера. Допустим, "Prompt v1" набрал 7.66 балла, а "Prompt v2" с добавленной инструкцией "Ответьте на вопрос максимально подробно" набрал 8.7 балла. Более высокий балл для "v2" предоставляет объективное доказательство того, что добавление этой инструкции улучшило производительность промпта.

Сила этого рабочего процесса заключается в получении объективных измерений производительности промптов. Вы можете сравнивать баллы между различными версиями промптов, чтобы определить, какая из них работает лучше. Затем вы можете использовать более эффективную версию или продолжить итерации, чтобы достичь еще более высоких результатов. Этот систематический подход устраняет догадки из процесса улучшения промптов и предоставляет вам надежную основу для оптимизации.

Заключение

Рабочий процесс оценки промптов является фундаментальным инструментом для всех, кто стремится максимально эффективно использовать LLM, таких как Claude. Он превращает интуитивные догадки в измеримые результаты, позволяя вам принимать обоснованные решения об изменениях в промптах. Хотя реализация эффективных грейдеров может быть сложной задачей, особенно при автоматизации, описанный здесь рабочий процесс обеспечивает прочную основу для создания вашей собственной системы оценки. Постоянно измеряя, изменяя и повторяя, вы можете значительно улучшить качество и надежность ответов Claude для ваших конкретных приложений.