О чём урок
Этот notebook демонстрирует, как оценить способность модели получать правильные ответы из интернета, используя фреймворк OpenAI Evals с пользовательским набором данных, хранящимся в памяти. Цели: Показать, как настроить и запустить оценку качества веб-поиска. Предоставить шаблон для оценки возможностей извлечения информации LLM. Мы начинаем с импорта необходимых библиотек и настройки клиента OpenAI.Это гарантирует нам доступ к OpenAI API и всем необходимым утилитам для оценки. Мы определяем небольшой набор данных, хранящийся в памяти, состоящий из пар вопрос-ответ для оценки веб-поиска.Каждый элемент содержит query (поисковый prompt пользователя) и answer (ожидаемый эталонный ответ). Совет:Вы можете изменить или расширить этот набор данных в соответствии с вашим вариантом использования или для тестирования более широких сценариев поиска. Для оценки ответов модели мы используем LLM-оценщик типа «зачет/незачет»: Оценщик «Зачет/Незачет»:LLM-оценщик, который проверяет, соответствует ли ответ модели (из веб-поиска) ожидаемому ответу (эталонному) или содержит ли он правильную информацию. Рекомендация:Использование LLM-оценщика обеспечивает гибкость при оценке открытых или нечетких ответов. Теперь мы настраиваем оценку, используя фреймворк OpenAI Evals. Этот шаг определяет: Название оценки и набор данных. Схему для каждого элемента (какие поля присутствуют в каждой паре вопрос-ответ). Используемые оценщики (LLM-оценщики типа «зачет/незачет»). Критерии прохождения и метки. Рекомендация:Четкое определение схемы оценки и логики оценивания заранее обеспечивает воспроизводимость и прозрачность. Теперь мы запускаем оценку для выбранных моделей (gpt-4.1 и gpt-4.1-mini). После запуска оценки мы опрашиваем её состояние до завершения (либо completed, либо failed). Рекомендация:Опрос с задержкой позволяет избежать избыточных вызовов API и обеспечивает эффективное использование ресурсов. Наконец, мы отображаем выходные данные модели для ручной проверки и дальнейшего анализа. Каждый ответ выводится для каждого запроса в наборе данных. Вы можете сравнить выходные данные с ожидаемыми ответами для оценки качества, релевантности и правильности. GPT-4.1 Output GPT-4.1-mini Output 0 If you're captivated by the Philbrook Museum o...
План урока
- Настройка окружения
- Определение пользовательского набора данных для оценки
- Определение логики оценивания
- Определение конфигурации оценки
- Запуск модели и опрос на предмет завершения
- Отображение и интерпретация выходных данных модели
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.