О чём урок
Shieldstral — это 3B мультимодальный классификатор безопасности с открытыми весами от Mistral, который оценивает контент на соответствие политикам, выраженным на естественном языке, и возвращает непрерывный показатель безопасности. Shieldstral развертывается только на собственном хостинге — конечная точка API Mistral недоступна. В этом руководстве модель запускается локально с помощью Transformers или vLLM. Политики на естественном языке предоставляются во время инференса — без фиксированных категорий и без переобучения. Модель отвечает на вопрос «да/нет» о том, нарушает ли контент вашу политику, а логиты output дают непрерывный показатель безопасности. В этом руководстве рассматриваются два способа запуска Shieldstral: Transformers — загрузка модели локально (совместимо с Colab при наличии GPU T4) vLLM — развертывание OpenAI-совместимого сервера для производственного использования Для выполнения этого руководства вам понадобятся: Python 3.9 или новее GPU (NVIDIA с не менее чем 8 ГБ VRAM, или используйте Colab с runtime T4 или A100) Аккаунт HuggingFace с доступом к mistralai/Shieldstral-1.0-3B Установите библиотеку Transformers с поддержкой Mistral: Shieldstral — это модель для самостоятельного хостинга — ключ API Mistral не требуется. Установите ваш HuggingFace token для загрузки весов модели. Если он не установлен, ячейка ниже предложит вам ввести его. Shieldstral представляет модерацию как адаптивный к политике механизм вопросов и ответов. Каждый запрос имеет следующую структуру: Системный prompt (фиксированный): "Оцените, соответствует ли Документ требованиям, основываясь на Запросе и предоставленной Инструкции. Обратите внимание, что ответ может быть только 'да' или 'нет'." Пользовательское сообщение с тремя полями: <Instruct> — высокоуровневый контекст и уровень строгости <Query> — единственный вопрос «да/нет» о контенте <Document> — контент для оценки Output — единственный token yes или no. Извлеките непрерывный показатель безопасности, применив softmax к логитам yes/no: Показатель выше 0.5 означает, что контент помечен как небезопасный. Поскольку политика определяется на естественном языке, вы можете модерировать контент по любой категории — токсичность, NSFW, финансовые советы, правила, специфичные для предметной области — без переобучения модели.
План урока
- Предварительные требования
- Настройка окружения
- Установка
- Необходимые переменные окружения
- Запуск с использованием Transformers
- Загрузка модели
- Вспомогательная функция
- Создание запроса на модерацию
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.