Как оценивать качество пересказа

Урок 175 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом notebook мы углубимся в методы оценки задач абстрактивной суммаризации, используя простой пример. Мы рассмотрим традиционные методы оценки, такие как ROUGE и BERTScore, в дополнение к демонстрации более нового подхода с использованием LLM в качестве оценщиков. Оценка качества суммаризаций — трудоёмкий процесс, поскольку она включает различные метрики качества, такие как связность, лаконичность, читаемость и содержание. Традиционные метрики автоматической оценки, такие как ROUGE, BERTScore и другие, являются конкретными и надёжными, но они могут плохо коррелировать с фактическим качеством суммаризаций. Они показывают относительно низкую корреляцию с человеческими оценками, особенно для задач генерации открытого типа (Liu et al., 2023). Растёт потребность опираться на человеческие оценки, обратную связь от пользователей или метрики, основанные на моделях, при этом оставаясь бдительными в отношении потенциальных предубеждений. Хотя человеческая оценка даёт бесценные сведения, она часто не масштабируема и может быть слишком дорогостоящей. В дополнение к этим традиционным метрикам, мы демонстрируем метод (G-Eval), который использует большие языковые модели (LLM) в качестве новой, безопорной метрики для оценки абстрактивных суммаризаций. В данном случае мы используем gpt-4 для оценки кандидатских output'ов. gpt-4 эффективно освоила внутреннюю модель качества языка, которая позволяет ей различать беглый, связный текст и текст низкого качества. Использование этого внутреннего механизма оценки позволяет проводить автоматическую оценку новых кандидатских output'ов, сгенерированных LLM. Для целей этого notebook мы будем использовать приведённый ниже пример суммаризации. Обратите внимание, что мы предоставляем две сгенерированные суммаризации для сравнения и эталонную суммаризацию, написанную человеком, которая требуется для таких метрик оценки, как ROUGE и BERTScore. Отрывок (excerpt): OpenAI's mission is to ensure that artificial general intelligence (AGI) benefits all of humanity. OpenAI will build safe and beneficial AGI directly, but will also consider its mission fulfilled if its work aids others to achieve this outcome. OpenAI follows several key principles for this purpose.

План урока

  1. Настройка
  2. Пример задачи
  3. Оценка с использованием ROUGE
  4. Оценка с использованием BERTScore
  5. Оценка с использованием GPT-4
  6. Ограничения
  7. Заключение
  8. Ссылки

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды