Первые шаги в OpenAI Evals

Урок 174 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: OpenAI теперь предлагает размещенный продукт для evals с API! Мы рекомендуем использовать его. См. Evals Фреймворк OpenAI Evals состоит из Фреймворка для оценки LLM (большой языковой модели) или системы, построенной на базе LLM. Реестра сложных evals с открытым исходным кодом. Этот notebook рассмотрит: Введение в оценку и библиотеку OpenAI Evals Создание Eval Запуск Eval Оценка — это процесс проверки и тестирования результатов, которые производят ваши LLM-приложения. Наличие надёжных оценок ("evals") означает более стабильное, надёжное приложение, устойчивое к изменениям кода и модели. Eval — это задача, используемая для измерения качества выходных данных LLM или LLM-системы. При наличии входного prompt генерируется выходной результат. Мы оцениваем этот результат с помощью набора идеальных ответов и определяем качество LLM-системы. Если вы создаёте решения на базе фундаментальных моделей, таких как GPT-4, создание высококачественных evals — одно из самых значимых действий, которые вы можете предпринять. Разработка AI-решений включает итеративный процесс проектирования. Без evals может быть очень сложно и трудоёмко понять, как различные версии моделей и prompt'ы могут повлиять на ваш сценарий использования. Благодаря постоянным обновлениям моделей OpenAI, evals позволяют эффективно тестировать производительность моделей для ваших сценариев использования стандартизированным способом. Разработка набора evals, адаптированных под ваши цели, поможет вам быстро и эффективно понять, как новые модели могут работать в ваших сценариях использования. Вы также можете включить evals в свой CI/CD-пайплайн, чтобы убедиться в достижении желаемой точности перед развёртыванием. Существует два основных способа оценки/проверки завершений: написание логики валидации в коде или использование самой модели для проверки ответа. Мы рассмотрим каждый из них на примерах. Написание логики для проверки ответов Самый простой и распространённый тип eval имеет входные данные и идеальный ответ. Например, у нас может быть образец eval, где входные данные — "В каком году Обама был впервые избран президентом?", а идеальный ответ — "2008". Мы подаём входные данные модели и получаем завершение. Если модель отвечает "2008", это считается правильным.

План урока

  1. Что такое оценки/ evals?
  2. Важность оценок
  3. Типы evals
  4. Шаблоны OpenAI Eval
  5. Настройка
  6. Создание оценки для фреймворка OpenAI Evals
  7. Создание набора данных для eval
  8. Запуск оценки

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды