Проверяем ответы на базе MCP на своём наборе данных

Урок 182 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот notebook оценивает способность модели отвечать на вопросы о репозитории tiktoken на GitHub, используя фреймворк OpenAI Evals с пользовательским набором данных, хранящимся в памяти. Мы используем пользовательский набор данных пар «вопрос-ответ», хранящийся в памяти, и сравниваем две модели: gpt-4.1 и o4-mini, которые используют инструмент MCP для получения контекстно точных ответов с учетом содержимого репозитория. Цели: Показать, как настроить и запустить оценку с помощью OpenAI Evals с пользовательским набором данных. Сравнить производительность различных моделей, использующих инструменты на основе MCP. Предоставить лучшие практики для профессиональных, воспроизводимых рабочих процессов оценки. Далее: Мы настроим наше окружение и импортируем необходимые библиотеки. Мы начнем с импорта необходимых библиотек и настройки клиента OpenAI.Этот шаг гарантирует нам доступ к OpenAI API и всем необходимым утилитам для оценки. Мы определяем небольшой набор данных пар «вопрос-ответ» о репозитории tiktoken, хранящийся в памяти.Этот набор данных будет использоваться для проверки способности моделей предоставлять точные и релевантные ответы с помощью инструмента MCP. Каждый элемент содержит query (вопрос пользователя) и answer (ожидаемый эталонный ответ). Вы можете изменить или расширить этот набор данных в соответствии с вашим собственным сценарием использования или репозиторием. Для оценки ответов модели мы используем два оценщика: Оценщик «Прошел/Не прошел» (на основе LLM):Оценщик на основе LLM, который проверяет, соответствует ли ответ модели ожидаемому ответу (эталонному) или передает ли он тот же смысл. Python MCP Grader:Функция Python, которая проверяет, использовала ли модель инструмент MCP во время своего ответа (для аудита использования инструмента). Лучшая практика:Использование как LLM-based, так и программных оценщиков обеспечивает более надежную и прозрачную оценку. Теперь мы настраиваем оценку с использованием фреймворка OpenAI Evals. Этот шаг определяет: Название оценки и набор данных. Схему для каждого элемента (какие поля присутствуют в каждой паре «вопрос-ответ»). Используемые оценщики (на основе LLM и/или Python). Критерии прохождения и метки.

План урока

  1. Настройка окружения
  2. Определение пользовательского набора данных для оценки
  3. Определение логики оценивания
  4. Определение конфигурации оценки
  5. Запуск оценок для каждой модели
  6. Ожидание завершения и получение результатов
  7. Отображение и интерпретация результатов работы моделей
  8. Как мы можем улучшить?

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды