О чём урок
В этом руководстве мы продемонстрируем подход, который мы используем для оценки задач суммаризации с помощью LLM-оценки. Начало работы Создание набора данных для оценки Создание фреймворка для оценки Запуск оценок Вам понадобится ключ Cohere API для запуска этого ноутбука. Если у вас нет ключа, перейдите на https://cohere.com/, чтобы сгенерировать свой ключ. В качестве тестовых данных мы будем использовать стенограммы из набора данных QMSum. Обратите внимание, что помимо стенограмм, этот набор данных также содержит эталонные суммаризации — мы будем использовать только стенограммы, поскольку наш подход не требует эталонов. Мы заинтересованы в оценке суммаризации в реальных, корпоративных сценариях использования, которые обычно имеют две отличительные особенности по сравнению с академическими бенчмарками суммаризации: Корпоративные сценарии использования часто сосредоточены на конкретных целях суммаризации, например, «суммировать пункты действий». Корпоративные сценарии использования часто включают конкретные ограничения инструкций, например, «суммировать в виде маркированного списка, где каждый пункт содержит менее 20 слов». Поэтому мы должны сначала создать набор данных, который содержит разнообразные prompt'ы для суммаризации. Мы сделаем это программно, создавая prompt'ы из их компонентов, как определено ниже: Prompt = текст (например, стенограмма для суммаризации) + инструкция Инструкция = цель инструкции (например, «суммировать пункты действий») + модификаторы Модификаторы = модификаторы формата/длины (например, «использовать маркированный список») + модификаторы стиля/тона (например, «не упоминать имена») + ... Сначала мы определяем prompt, который объединяет текст и инструкции. Здесь мы используем очень простой prompt: Далее мы создаем инструкции. Поскольку каждая инструкция может иметь различную цель и модификаторы, мы отслеживаем их с помощью метаданных. Это потребуется позже для оценки (т.е. чтобы знать, что запрашивает prompt). Давайте объединим цели и модификаторы формата/длины, чтобы завершить создание инструкций. Наконец, давайте создадим окончательные prompt'ы, полуслучайным образом сопоставляя инструкции со стенограммами из набора данных QMSum. Теперь мы настраиваем инструменты, которые будем использовать для оценки.
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.