Claude в Google Vertex AI

Подключение Claude через Google Cloud — авторизация, регионы, биллинг.

100 уроков, первые 3 бесплатно. Полный доступ: 1490 руб.

Уроки курса

  1. Welcome to the course
  2. Overview of Claude models
  3. Accessing the API
  4. Vertex AI Setup
  5. Making a request
  6. Multi-turn conversations
  7. Chat exercise
  8. System prompts
  9. System prompts exercise
  10. Temperature
  11. Course satisfaction survey
  12. Response streaming
  13. Controlling model output
  14. Structured data
  15. Structured data exercise
  16. Quiz on accessing Claude with the API
  17. Prompt evaluation
  18. A typical eval workflow
  19. Generating test datasets
  20. Running the eval
  21. Model based grading
  22. Code based grading
  23. Exercise on prompt evals
  24. Quiz on prompt evaluation
  25. Prompt engineering
  26. Being clear and direct
  27. Being specific
  28. Structure with XML tags
  29. Providing examples
  30. Exercise on prompting
  31. Quiz on prompt engineering techniques
  32. Introducing tool use
  33. Project overview
  34. Tool functions
  35. Tool schemas
  36. Handling message blocks
  37. Sending tool results
  38. Multi-turn conversations with tools
  39. Implementing multiple turns
  40. Using multiple tools
  41. The batch tool
  42. Tools for structured data
  43. The text edit tool
  44. The web search tool
  45. Quiz on tool use with Claude
  46. Introducing Retrieval Augmented Generation
  47. Text chunking strategies
  48. Text embeddings
  49. The full RAG flow
  50. Implementing the RAG flow
  51. BM25 lexical search
  52. A Multi-index RAG pipeline
  53. Reranking results
  54. Contextual retrieval
  55. Quiz on Retrieval Augmented Generation
  56. Extended thinking
  57. Image support
  58. PDF support
  59. Citations
  60. Prompt caching
  61. Rules of prompt caching
  62. Prompt caching in action
  63. Quiz on features of Claude
  64. Introducing MCP
  65. MCP clients
  66. Project setup
  67. Defining tools with MCP
  68. The server inspector
  69. Implementing a client
  70. Defining resources
  71. Accessing resources
  72. Defining prompts
  73. Prompts in the client
  74. MCP review
  75. Quiz on Model Context Protocol
  76. Anthropic apps
  77. Claude Code setup
  78. Claude Code in action
  79. Enhancements with MCP servers
  80. Parallelizing Claude Code
  81. Automated debugging
  82. Computer use
  83. How computer use works
  84. Agents and workflows
  85. Parallelization workflows
  86. Chaining workflows
  87. Routing workflows
  88. Agents and tools
  89. Environment inspection
  90. Workflows vs agents
  91. Quiz on agents and workflows
  92. Final assessment quiz
  93. Course Wrap Up
  94. Course Description
  95. Course Description
  96. Course Description
  97. Course Description
  98. Course Description
  99. Course Description
  100. Course Description

Оценка Качества Ответов Модели Claude с помощью Систем Градации

В процессе разработки и оптимизации запросов (промптов) для больших языковых моделей (LLM), таких как Claude, крайне важно иметь объективные методы оценки качества генерируемых ответов. Без четкой системы оценки сложно понять, насколько хорошо модель справляется с поставленной задачей, и куда направлять усилия по улучшению промптов. Именно здесь на помощь приходят системы градации (или оценки).

Градер — это механизм, который принимает на вход ответ, сгенерированный моделью, и возвращает некую измеримую обратную связь. Как правило, это числовая оценка, например, от 1 до 10, где 10 означает высочайшее качество, а 1 — неудовлетворительное. Такие системы позволяют автоматизировать процесс оценки и получить количественные метрики производительности ваших промптов.

Основные Подходы к Градации Ответов Модели

Существует три основных стратегии для оценки качества ответов, генерируемых моделями:

Программные Градеры

Программные градеры предоставляют огромную гибкость, позволяя реализовать практически любую проверку, которую можно выразить в коде. Они идеально подходят для объективных, легко формализуемых критериев. Типичные сценарии использования включают:

Эти градеры быстры и надежны для четко определенных задач, но не могут оценить субъективные качества, такие как креативность или тон.

Модельные Градеры

Модельные градеры предлагают исключительную гибкость, используя дополнительный вызов API к другой модели ИИ (часто той же самой или аналогичной LLM) для оценки ответов. Они особенно полезны для оценки более сложных и нюансированных аспектов, таких как:

Модельные градеры могут имитировать человеческую оценку в масштабе, что делает их мощным инструментом для итеративной разработки промптов.

Человеческие Градеры

Человеческие градеры обеспечивают максимальную гибкость, поскольку человек способен оценить ответы по любым, даже самым абстрактным критериям. Однако этот подход имеет существенные недостатки: он чрезвычайно трудоемок, дорог и медленен. Ручная оценка часто используется на начальных этапах или для калибровки автоматизированных систем.

Определение Критериев Оценки

Прежде чем приступать к реализации любого градера, крайне важно четко определить критерии оценки. Без ясных и измеримых критериев невозможно получить полезную обратную связь. Рассмотрим пример промпта для генерации кода. Ваши критерии могут включать:

В этом примере первые два критерия (формат и синтаксис) отлично подходят для программных градеров. Однако оценка того, насколько точно код решает задачу пользователя, требует более глубокого понимания контекста и лучше всего подходит для модельных градеров благодаря их способности к семантическому анализу.

Реализация Модельного Градера

Модельные градеры часто являются наиболее простыми в реализации, поскольку они используют уже существующие возможности LLM. Основная идея заключается в том, чтобы создать специальный промпт для модели-градера, который попросит ее оценить ответ другой модели. Этот промпт должен быть всеобъемлющим и включать:

Важный совет: просите у модели-градера не только числовую оценку. Запрашивайте также сильные и слабые стороны ответа, а также обоснование оценки. Это предотвращает склонность модели к выдаче "средних" оценок (например, 6 из 10) и вынуждает ее проводить более вдумчивую и детализированную оценку. Например, вместо простого {"score": 7}, запросите {"score": 7, "strengths": "Код синтаксически верен", "weaknesses": "Не полностью решает задачу", "reasoning": "Модель предоставила корректный синтаксис, но пропустила часть требований к функциональности."}.

Процесс оценки с помощью модельного градера выглядит следующим образом: вы отправляете специальный запрос к модели-градеру, который содержит все вышеупомянутые элементы. Модель-градер обрабатывает этот запрос и возвращает структурированный ответ с оценкой и обоснованием.

Интеграция Градеров в Ваш Рабочий Процесс

После того как вы определили функцию градера, ее необходимо интегрировать в общий процесс тестирования ваших промптов. Типичный рабочий процесс может выглядеть так:

  1. Запуск основной модели: Вы отправляете промпт к модели Claude (например, через Google Vertex AI) и получаете ее ответ.
  2. Вызов градера: Полученный ответ передается вашей функции градера (будь то программный или модельный градер).
  3. Сбор результатов: Градер возвращает оценку и, возможно, дополнительную информацию (обоснование, сильные/слабые стороны). Эти данные сохраняются.

После выполнения всех тестовых случаев (например, для целого набора данных промптов и ожидаемых ответов) вы можете рассчитать средний балл. Это дает вам объективную метрику производительности вашего промпта или набора промптов.

Например, если у вас есть набор из 100 тестовых случаев, вы запускаете каждый из них, получаете ответ от Claude, затем оцениваете этот ответ с помощью градера, собираете все оценки и в конце вычисляете среднее арифметическое. Это среднее значение становится конкретным числом, на котором вы можете сосредоточиться для улучшения. Если средний балл низкий, это сигнал к пересмотру промпта или даже архитектуры решения.

Заключение

Хотя модельные градеры могут быть иногда непредсказуемыми и требовать тонкой настройки промптов для градера, они предоставляют отличную отправную точку для объективной и масштабируемой оценки качества ответов LLM. Они позволяют быстро и итеративно улучшать ваши промпты, получая количественные данные о производительности. В сочетании с платформой Google Vertex AI, использование Claude для генерации и оценки ответов становится мощным инструментом в арсенале разработчика, стремящегося к созданию высококачественных и надежных решений на базе ИИ.