Prompt Guard: защита от атак на промпт

Урок 17 из 17 курса «Llama: начало работы»: официальный курс Llama Cookbook (Мета Лама) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Цель данного руководства — предоставить обзор нескольких практических аспектов использования модели Prompt Guard. Мы рассмотрим: Область применения модели и от каких рисков она может защитить; Код для загрузки и выполнения модели, а также ожидаемая latency на CPU и GPU; Ограничения модели на новых datasets и процесс fine-tuning'а модели для адаптации к ним. Prompt Guard — это простая модель-классификатор. Самый простой способ загрузить модель — использовать библиотеку transformers: output модели — это logits, которые можно масштабировать для получения оценки в диапазоне $(0, 1)$: Положительная метка модели (1) соответствует input'у, содержащему технику jailbreaking. Это техники, предназначенные для отмены предыдущих инструкций или условий безопасности модели, и в целом направленные на злонамеренное изменение предполагаемого использования LLM разработчиками приложений. Модель может использоваться для обнаружения техник jailbreaking в прямых чатах с моделью. Как правило, это пользователи, пытающиеся напрямую отменить условия безопасности модели. Мы также можем проверять техники jailbreaking, используемые в произвольных данных, которые могут быть поглощены LLM, помимо просто prompt'ов. Это имеет смысл для сканирования контента из ненадежных сторонних источников, таких как инструменты, веб-поисковики или API. Это часто сценарии с наивысшим риском для техник jailbreaking, поскольку такие атаки могут быть направлены на пользователей приложения и использовать привилегированный доступ модели к данным пользователя, а не просто быть проблемой безопасности контента. Сама модель невелика и может быстро работать на CPU или GPU. GPU может обеспечить дальнейшее значительное ускорение, что может быть ключевым для создания LLM-приложений с низкой latency и высокой пропускной способностью. Каждое LLM-приложение будет сталкиваться с различным распределением prompt'ов, как безопасных, так и вредоносных, при развертывании в production. Хотя Prompt Guard может быть очень полезен для обнаружения вредоносных input'ов "из коробки", гораздо более точные результаты могут быть достигнуты путем непосредственной подгонки модели под ожидаемое распределение datapoints. Это может быть критически важно для снижения рисков приложений, не создавая при этом значительного числа нежелательных ложных срабатываний.

План урока

  1. Обнаружение прямых вредоносных атак
  2. Обнаружение косвенных атак.
  3. Latency inference
  4. Fine-tuning Prompt Guard на новых datasets для специализированных приложений

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды