О чём урок
В этом ноутбуке мы покажем вам, как оценивать вывод системы RAG. Общий поток RAG изображен на диаграмме ниже. Мы сосредоточимся на оценке Извлечения (Retrive) и Ответа (Response) (или Генерации (Generation)), и представим набор метрик для каждой фазы. Мы подробно рассмотрим каждую метрику, чтобы дать вам полное понимание того, как мы оцениваем модели и почему мы делаем это таким образом, а также предоставим код, чтобы вы могли воспроизвести это на своих собственных данных. Для демонстрации метрик мы будем использовать данные из набора данных Docugami's KG-RAG, который является набором данных RAG для финансовых отчетов 10Q. Мы сосредоточимся только на оценке, не выполняя фактические шаги Извлечения (Retrieval) и Генерации ответа (response Generation). Начало работы Оценка извлечения Оценка генерации Заключительные комментарии Давайте начнем с настройки окружения и загрузки набора данных. Для оценки Ответа (Response) мы будем использовать LLM в качестве судьи. Любой LLM может быть использован для этой цели, но поскольку оценка является очень сложной задачей, мы рекомендуем использовать мощные LLM, возможно, в виде ансамбля моделей. В предыдущей работе было показано, что модели склонны присваивать более высокие оценки своим собственным результатам. Поскольку мы генерировали ответы в этом ноутбуке с использованием command-r, мы не будем использовать его для оценки. Мы предоставим две альтернативы: gpt-4 и mistral. Мы устанавливаем gpt-4 в качестве модели по умолчанию, потому что, как упоминалось выше, оценка сложна, и gpt-4 достаточно мощна, чтобы эффективно выполнять эту задачу. На этапе Извлечения (Retrieval) мы оцениваем набор **извлеченных документов** по отношению к набору **эталонных документов**. Для оценки извлечения мы используем три стандартные метрики: **Точность** (Precision): доля возвращенных документов, которые релевантны, согласно золотой аннотации. **Полнота** (Recall): доля релевантных документов в золотых данных, найденных среди извлеченных документов. **Средняя точность** (Mean Average Precision) (**MAP**): измеряет способность извлекателя возвращать релевантные документы в верхней части списка.
План урока
- Начало работы
- Оценка извлечения
- Оценка генерации
- Извлечение утверждений
- Оценка утверждений
- Достоверность
- Корректность
- Покрытие
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.