О чём урок
В этом руководстве показано, как использовать фреймворк Evals от OpenAI для задач, основанных на изображениях. Используя Evals API, мы будем оценивать ответы, сгенерированные моделью на изображение и prompt, применяя sampling для генерации ответов модели и оценку моделью (LLM в качестве судьи) для выставления оценки ответам модели по отношению к изображению, prompt и эталонному ответу. В этом примере мы оценим, насколько хорошо наша модель может: Генерировать адекватные ответы на пользовательские prompt'ы об изображениях Соответствовать эталонным ответам, которые представляют собой высококачественные ответы Мы используем набор данных VibeEval, размещенный на Hugging Face. Он содержит коллекцию пользовательских prompt'ов, сопутствующих изображений и эталонных ответов. Сначала мы загружаем набор данных. Мы извлекаем соответствующие поля и помещаем их в формат, подобный JSON, для передачи в качестве источника данных в Evals API. Входные данные изображений могут быть в виде веб-URL или строки, закодированной в base64. Здесь мы используем предоставленные веб-URL. Если вы выведете список источников данных, каждый элемент должен иметь вид, аналогичный следующему: Теперь, когда у нас есть источник данных и задача, мы создадим наши evals. Для документации OpenAI Evals API посетите документацию API. Evals состоят из двух частей: «Eval» и «Run». В «Eval» мы определяем ожидаемую структуру данных и критерии тестирования (grader). Исходя из собранных нами данных, наша конфигурация источника данных выглядит следующим образом: Для наших критериев тестирования мы настраиваем конфигурацию нашего grader'а. В этом примере это model grader, который принимает изображение, эталонный ответ и сэмплированный ответ модели (в пространстве имен sample), а затем выводит оценку от 0 до 1 в зависимости от того, насколько точно ответ модели соответствует эталонному ответу и насколько он в целом подходит для беседы. Для получения дополнительной информации о model grader'ах посетите документацию API Grader. Правильная настройка как данных, так и grader'а является ключом к эффективной оценке. Поэтому, вероятно, вам потребуется итеративно дорабатывать prompt'ы для ваших grader'ов.
План урока
- Установка зависимостей + Настройка
- Подготовка набора данных
- Конфигурация Eval
- Конфигурация источника данных
- Критерии тестирования
- Запуск Eval
- Опрос и отображение результатов
- Просмотр отдельных элементов вывода
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.