О чём урок
Этот notebook оценивает способность модели отвечать на вопросы о репозитории tiktoken на GitHub, используя фреймворк OpenAI Evals с пользовательским набором данных, хранящимся в памяти. Мы используем пользовательский набор данных пар «вопрос-ответ», хранящийся в памяти, и сравниваем две модели: gpt-4.1 и o4-mini, которые используют инструмент MCP для получения контекстно точных ответов с учетом содержимого репозитория. Цели: Показать, как настроить и запустить оценку с помощью OpenAI Evals с пользовательским набором данных. Сравнить производительность различных моделей, использующих инструменты на основе MCP. Предоставить лучшие практики для профессиональных, воспроизводимых рабочих процессов оценки. Далее: Мы настроим наше окружение и импортируем необходимые библиотеки. Мы начнем с импорта необходимых библиотек и настройки клиента OpenAI.Этот шаг гарантирует нам доступ к OpenAI API и всем необходимым утилитам для оценки. Мы определяем небольшой набор данных пар «вопрос-ответ» о репозитории tiktoken, хранящийся в памяти.Этот набор данных будет использоваться для проверки способности моделей предоставлять точные и релевантные ответы с помощью инструмента MCP. Каждый элемент содержит query (вопрос пользователя) и answer (ожидаемый эталонный ответ). Вы можете изменить или расширить этот набор данных в соответствии с вашим собственным сценарием использования или репозиторием. Для оценки ответов модели мы используем два оценщика: Оценщик «Прошел/Не прошел» (на основе LLM):Оценщик на основе LLM, который проверяет, соответствует ли ответ модели ожидаемому ответу (эталонному) или передает ли он тот же смысл. Python MCP Grader:Функция Python, которая проверяет, использовала ли модель инструмент MCP во время своего ответа (для аудита использования инструмента). Лучшая практика:Использование как LLM-based, так и программных оценщиков обеспечивает более надежную и прозрачную оценку. Теперь мы настраиваем оценку с использованием фреймворка OpenAI Evals. Этот шаг определяет: Название оценки и набор данных. Схему для каждого элемента (какие поля присутствуют в каждой паре «вопрос-ответ»). Используемые оценщики (на основе LLM и/или Python). Критерии прохождения и метки.
План урока
- Настройка окружения
- Определение пользовательского набора данных для оценки
- Определение логики оценивания
- Определение конфигурации оценки
- Запуск оценок для каждой модели
- Ожидание завершения и получение результатов
- Отображение и интерпретация результатов работы моделей
- Как мы можем улучшить?
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.