Promptfoo: оценка с помощью модели

Урок 8 из 9 курса «Оценка качества промптов»: официальный курс Anthropic Academy (Антропик) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Этот урок находится в папке, содержащей соответствующие файлы кода. Загрузите всю папку, если хотите следовать инструкциям и запустить оценку самостоятельно До сих пор мы писали только оценки на основе кода. По возможности, оценки на основе кода являются самыми простыми и наименее затратными в проведении. Они предлагают четкие, объективные оценки, основанные на заранее определенных критериях, что делает их идеальными для задач с простыми, количественно измеримыми результатами. Проблема в том, что оценки на основе кода могут оценивать только определенные типы выводов, в основном те, которые могут быть сведены к точным совпадениям, числовым сравнениям или другой программируемой логике. Однако многие реальные приложения языковых моделей требуют более тонкой оценки. Предположим, мы хотели создать чат-бота для использования в классах средней школы. Мы могли бы захотеть оценить его ответы, чтобы убедиться, что они используют язык, соответствующий возрасту, поддерживают образовательный тон, избегают ответов на неакадемические вопросы или предоставляют объяснения на уровне сложности, подходящем для учеников средней школы. Эти критерии субъективны и зависят от контекста, что делает их сложными для оценки традиционными методами на основе кода. Именно здесь могут помочь оценки на основе моделей! Оценки на основе моделей используют возможности больших языковых моделей для оценки ответов на основе более сложных, тонких критериев. Используя другую модель в качестве оценщика, мы можем использовать тот же уровень понимания языка и контекстной осведомленности, который сгенерировал первоначальный ответ. Этот подход позволяет нам создавать более сложные метрики оценки, которые могут учитывать такие факторы, как тон, релевантность, уместность и даже креативность – аспекты, которые обычно недоступны для систем оценки на основе кода. Центральная идея оценок на основе моделей заключается в том, чтобы рассматривать саму оценку как задачу обработки естественного языка.

План урока

  1. Оценки на основе моделей с использованием promptfoo
  2. Оценки на основе моделей с promptfoo
  3. Написание собственной оценки
  4. Инициализация promptfoo
  5. Базовая конфигурация
  6. Второй prompt
  7. Оценка на предмет извинений

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды