Модерация запросов и ответов через Moderation API

Урок 40 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Это руководство призвано дополнить наш Guardrails Cookbook, предлагая более целенаправленный взгляд на методы модерации. Хотя в содержании и структуре есть некоторые совпадения, этот cookbook глубже рассматривает нюансы адаптации критериев модерации к конкретным потребностям, предлагая более детальный уровень контроля. Если вас интересует более широкий обзор мер по обеспечению безопасности контента, включая guardrails и модерацию, мы рекомендуем начать с Guardrails Cookbook. Вместе эти ресурсы предлагают всестороннее понимание того, как эффективно управлять контентом и модерировать его в ваших приложениях. Модерация, подобно guardrails в физическом мире, служит превентивной мерой для обеспечения того, чтобы ваше приложение оставалось в рамках приемлемого и безопасного контента. Методы модерации невероятно универсальны и могут быть применены к широкому спектру сценариев, где LLM могут столкнуться с проблемами. Этот notebook разработан для предоставления простых примеров, которые можно адаптировать к вашим конкретным потребностям, а также для обсуждения соображений и компромиссов, связанных с решением о том, стоит ли внедрять модерацию и как это сделать. Этот notebook будет использовать наш Moderation API — инструмент, который вы можете использовать для проверки потенциально вредоносного текста или изображения. Этот notebook сосредоточится на: Входная модерация (Input Moderation): Выявление и пометка неприемлемого или вредоносного контента до его обработки вашим LLM. Выходная модерация (Output Moderation): Проверка и валидация контента, сгенерированного вашим LLM, до того, как он достигнет конечного пользователя. Пользовательская модерация (Custom Moderation): Адаптация критериев и правил модерации к конкретным потребностям и контексту вашего приложения, обеспечивающая персонализированный и эффективный механизм контроля контента. Входная модерация сосредоточена на предотвращении попадания вредоносного или неприемлемого контента в LLM, а ее распространенные применения включают: Фильтрация контента: Предотвращение распространения вредоносного контента, такого как разжигание ненависти, домогательства, откровенные материалы и дезинформация, в социальных сетях, на форумах и платформах для создания контента.

План урока

  1. 1. Входная модерация
  2. Использование асинхронности
  3. Рабочий процесс
  4. 2. Выходная модерация
  5. Установка порогов модерации
  6. 3. Пользовательская модерация
  7. Заключение

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды