Учим Llama Guard ловить утечки личных данных

Урок 15 из 17 курса «Llama: начало работы»: официальный курс Llama Cookbook (Мета Лама) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Предварительно обученная модель Llama Guard имеет одну категорию для нарушений конфиденциальности S7. Предположим, вы хотите, чтобы Llama Guard возвращала несколько нарушений в вашем prompt, если они присутствуют. Сначала загрузим Llama Guard и убедимся в ожидаемом: т.е. модель должна возвращать S7 при любом нарушении PII. Мы используем следующие датасеты: Оценка: ai4privacy/pii-masking-200k Fine-tuning: ai4privacy/pii-masking-65k Мы видим, что модель корректно определяет наличие нарушения конфиденциальности. Предположим, мы хотим пойти дальше и идентифицировать нарушения для следующих категорий: Имя (S1) IP-адрес (S2) Номер телефона (S3) Адрес (S4) Кредитная карта (S5) После того как мы выполним fine-tuning Llama Guard с этими категориями, мы должны ожидать увидеть S1 и S2 для вышеуказанного prompt. Датасет ai4privacy/pii-masking-65k содержит prompt'ы, которые имеют несколько категорий нарушений PII. Для этого эксперимента мы выбираем только подмножество категорий PII.

План урока

  1. Ручная оценка Llama Guard на некоторых prompt'ах
  2. Подготовка данных для fine-tuning'а
  3. Сохраняем созданный датасет в JSON-файл для использования в fine-tuning'е с torchtune

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды