Защитные механизмы на входе и выходе

Урок 39 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом notebook'е мы делимся примерами того, как реализовать защитные механизмы для ваших LLM-приложений. Защитный механизм (guardrail) — это общий термин для детективных средств контроля, которые призваны направлять ваше приложение. Большая управляемость является общим требованием, учитывая присущую LLM случайность, поэтому создание эффективных защитных механизмов стало одной из наиболее распространенных областей оптимизации производительности при переходе LLM от прототипа к продакшену. Защитные механизмы невероятно разнообразны и могут быть развернуты практически в любом контексте, где вы можете представить, что с LLM что-то пойдет не так. Этот notebook призван дать простые примеры, которые можно расширить для удовлетворения вашего уникального сценария использования, а также обозначить компромиссы, которые следует учитывать при принятии решения о внедрении защитного механизма и о том, как это сделать. Этот notebook будет посвящен: Входным защитным механизмам, которые помечают неприемлемый контент до того, как он попадет в вашу LLM Выходным защитным механизмам, которые проверяют то, что сгенерировала ваша LLM, прежде чем это попадет к клиенту Примечание: Этот notebook рассматривает защитные механизмы как обобщенный термин для детективных средств контроля вокруг LLM — для официальных библиотек, предоставляющих дистрибутивы готовых фреймворков защитных механизмов, пожалуйста, ознакомьтесь со следующими: NeMo Guardrails Guardrails AI Входные защитные механизмы призваны предотвратить попадание неприемлемого контента в LLM в первую очередь — некоторые распространенные сценарии использования: Тематические защитные механизмы: Определяют, когда пользователь задает вопрос не по теме, и дают ему совет о том, с какими темами LLM может помочь. Jailbreaking: Обнаруживают, когда пользователь пытается перехватить управление LLM и обойти ее prompting. Prompt injection: Выявляют случаи prompt injection, когда пользователи пытаются скрыть вредоносный код, который будет выполнен в любых последующих функциях, которые LLM запускает. Во всех этих случаях они действуют как превентивный контроль, работая либо до, либо параллельно с LLM, и заставляя ваше приложение вести себя иначе, если одно из этих условий выполняется.

План урока

  1. 1. Входные защитные механизмы
  2. Разработка защитного механизма
  3. Используйте асинхронность
  4. Ограничения
  5. Меры по смягчению
  6. 2. Выходные защитные механизмы
  7. Модерационный защитный механизм
  8. Установка пороговых значений для защитных механизмов

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды