О чём урок
Llama Guard 3 — это предварительно обученная модель Llama-3.1-8B, доработанная (fine-tuned) для классификации безопасности контента. Llama Guard 3 развивает возможности, представленные в Llama Guard 2, добавляя три новые категории: диффамация (Defamation), выборы (Elections) и злоупотребление интерпретатором кода (Code Interpreter Abuse). Новая модель поддерживает в общей сложности 14 категорий. Эта модель является многоязычной (см. карточку модели) и дополнительно представляет новый формат prompt'ов, который делает формат prompt'ов Llama Guard 3 совместимым с моделями Llama 3+ Instruct. Иногда этих 14 категорий недостаточно, и возникает необходимость в настройке существующих или создании новых политик. Этот notebook содержит инструкции по настройке Llama Guard 3 с использованием следующих методов: Добавление/удаление категорий — используется для разрешения или запрета определенных категорий. Zero-shot learning — используется, когда существующая категория безопасности близка к требованиям и необходимы незначительные изменения. Fine-tuning — используется, когда вышеуказанные методы недостаточны для внесения необходимых изменений. Llama Guard поставляется с эталонной таксономией, описанной на этой странице, где также объясняется формат prompting'а. Приведенные ниже функции объединяют уже существующий код форматирования prompt'ов в llama-recipes с пользовательским кодом для облегчения настройки таксономии. Код в ячейке ниже настраивает вспомогательные функции для быстрой настройки категорий: Чтобы протестировать поведение различных комбинаций категорий, мы загружаем модель (в данном случае Llama Guard 3) и настраиваем вспомогательную функцию для вывода ключевых данных во время тестирования. В целях демонстрации все тесты будут выполняться с типом ввода, установленным на «user». В реальных приложениях Llama Guard также будет использоваться для оценки выходных данных модели. Для этого тип ввода должен быть установлен на «agent». Убедитесь, что модель работает должным образом, запустив несколько тестов, первый из которых должен вернуть безопасный результат, а остальные — небезопасный с указанием соответствующих категорий: Категории могут быть удалены, чтобы сделать Llama Guard более толерантным (т.е. возвращать безопасный вердикт для входных данных, которые были бы определены как «небезопасные» при использовании полной таксономии).
План урока
- Введение в таксономию
- Настройка списка категорий
- Настройка модели для тестирования примеров
- Удаление категорий
- Обработка набора данных
- Оценка
- Пример Fine-tuning'а
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.