О чём урок
Примечание: Это руководство призвано дополнить наш Guardrails Cookbook, предлагая более целенаправленный взгляд на методы модерации. Хотя в содержании и структуре есть некоторые совпадения, этот cookbook глубже рассматривает нюансы адаптации критериев модерации к конкретным потребностям, предлагая более детальный уровень контроля. Если вас интересует более широкий обзор мер по обеспечению безопасности контента, включая guardrails и модерацию, мы рекомендуем начать с Guardrails Cookbook. Вместе эти ресурсы предлагают всестороннее понимание того, как эффективно управлять контентом и модерировать его в ваших приложениях. Модерация, подобно guardrails в физическом мире, служит превентивной мерой для обеспечения того, чтобы ваше приложение оставалось в рамках приемлемого и безопасного контента. Методы модерации невероятно универсальны и могут быть применены к широкому спектру сценариев, где LLM могут столкнуться с проблемами. Этот notebook разработан для предоставления простых примеров, которые можно адаптировать к вашим конкретным потребностям, а также для обсуждения соображений и компромиссов, связанных с решением о том, стоит ли внедрять модерацию и как это сделать. Этот notebook будет использовать наш Moderation API — инструмент, который вы можете использовать для проверки потенциально вредоносного текста или изображения. Этот notebook сосредоточится на: Входная модерация (Input Moderation): Выявление и пометка неприемлемого или вредоносного контента до его обработки вашим LLM. Выходная модерация (Output Moderation): Проверка и валидация контента, сгенерированного вашим LLM, до того, как он достигнет конечного пользователя. Пользовательская модерация (Custom Moderation): Адаптация критериев и правил модерации к конкретным потребностям и контексту вашего приложения, обеспечивающая персонализированный и эффективный механизм контроля контента. Входная модерация сосредоточена на предотвращении попадания вредоносного или неприемлемого контента в LLM, а ее распространенные применения включают: Фильтрация контента: Предотвращение распространения вредоносного контента, такого как разжигание ненависти, домогательства, откровенные материалы и дезинформация, в социальных сетях, на форумах и платформах для создания контента.
План урока
- 1. Входная модерация
- Использование асинхронности
- Рабочий процесс
- 2. Выходная модерация
- Установка порогов модерации
- 3. Пользовательская модерация
- Заключение
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.