Защитные ограничения на уровне системы в Mistral API

Урок 61 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Mistral предлагает сервис модерации, основанный на модели-классификаторе Ministral 8B 24.10, отличающейся высоким качеством и скоростью для достижения впечатляющей производительности и модерации как: Текстового контента Разговорного контента Для получения подробной информации об обеспечении безопасности и модерации, пожалуйста, обратитесь к нашей документации здесь. Это руководство проведет вас через настройку клиента Mistral, генерацию ответов, модерацию диалогов и визуализацию результатов. Вы можете легко классифицировать текстовые или разговорные данные по девяти категориям. Для разговорных данных будет классифицировано последнее сообщение пользователя.Категории: Сексуальный контент Ненависть и дискриминация Насилие и угрозы Опасный и криминальный контент Самоповреждение Здоровье Финансы Закон ПИИ (Персонально идентифицируемая информация) Мы будем использовать наборы данных из Hugging Face и GitHub для тестирования нашей реализации. Прежде всего, настроим нашего клиента. Руководство протестировано с v1.2.3. Добавьте ваш API key, вы можете создать его здесь. Создайте функцию для генерации ответов от любой модели Mistral. Эта функция принимает на вход пользовательский prompt и количество генераций и возвращает список сгенерированных ответов от любой модели Mistral. Здесь мы выбрали mistral-large-latest. Обычно каждый ответ будет представлять собой небольшую вариацию, зависящую от температуры и других параметров сэмплирования. Они могут отличаться друг от друга в большей или меньшей степени. Метод client.chat.complete используется для генерации ответов. Создайте функцию для модерации диалога с использованием Mistral moderation API. Эта функция принимает на вход пользовательский prompt и ответ ассистента и возвращает результаты модерации. Создайте функцию для оценки и сортировки ответов на основе результатов модерации. Эта функция принимает на вход пользовательский prompt и список сгенерированных ответов и возвращает окончательный ответ и список оценок. Она оценивает каждый ответ на основе результатов модерации и сортирует их в порядке возрастания максимальной оценки. Если самая низкая оценка выше определенного порога, функция возвращает безопасный ответ по умолчанию. Создайте функцию для визуализации результатов модерации.

План урока

  1. Обзор
  2. Шаг 1: Настройка
  3. Шаг 2: Генерация ответов
  4. Шаг 3: Модерация диалога
  5. Шаг 4: Оценка и сортировка ответов
  6. Шаг 5: Визуализация результатов
  7. Шаг 6: Функция для работы с набором данных
  8. Шаг 7: Загрузка наборов данных

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды