О чём урок
В этом оценочном тесте мы сравним новую модель (gpt-4.1-mini) с нашей старой моделью (gpt-4o-mini), оценивая её на основе сохранённых ответов. Преимущество этого подхода для большинства разработчиков заключается в том, что им не придётся тратить время на создание полноценного оценочного теста — все их данные уже будут храниться на их странице логов. Мы хотим посмотреть, как gpt-4.1 сравнивается с gpt-4o в объяснении кодовой базы. Поскольку источник данных ответов можно использовать только при наличии пользовательского трафика, мы сгенерируем некоторый пример трафика с помощью 4o, а затем сравним его с gpt-4.1. Мы получим несколько примеров файлов кода из OpenAI SDK и попросим gpt-4o объяснить их нам. Теперь сгенерируем несколько ответов. Обратите внимание, что для работы этого функционала вы должны использовать организацию, в которой не отключено логирование данных (через zdr и т.д.). Если вы не уверены, так ли это в вашем случае, перейдите по ссылке https://platform.openai.com/logs?api=responses и проверьте, видны ли сгенерированные вами ответы. Сначала запустим прогон, чтобы оценить качество исходных ответов. Для этого мы просто устанавливаем фильтры для ответов, которые хотим оценить Теперь посмотрим, как покажет себя 4.1-mini! Теперь перейдём на панель управления (dashboard), чтобы посмотреть результаты!
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.