Безопасный агент на Gemini с защитой от взлома

Урок 45 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Цели урока

  • Как реализовать глобальные механизмы безопасности для многоагентных систем
  • Два подхода к безопасности ИИ: LLM-as-a-Judge и Model Armor
  • Предотвращение атак отравления сессии
  • Создание масштабируемых, безопасных систем ИИ с Google Cloud
  • Обнаружение попыток jailbreak и prompt-инъекций

О чём урок

В этом notebook вы узнаете, как создавать готовые к внедрению в производство агентные системы ИИ с комплексными механизмами безопасности, используя Google Agent Development Kit (ADK), Gemini и Cloud-сервисы. Google Agent Development Kit (ADK) — Оркестрация многоагентных систем Gemini 2.5 — LLM для агентов и классификации безопасности Google Cloud Model Armor — Фильтрация безопасности корпоративного уровня Google Cloud Vertex AI — Масштабируемая инфраструктура ML Автор: Nguyen Khanh LinhGitHub: github.com/linhkidLinkedIn: @Khanh Linh Nguyen Начнем с настройки вашей среды и установки необходимых зависимостей. Вам понадобится: Проект Google Cloud с включенным Vertex AI API Настроенная аутентификация (ADC - Application Default Credentials) (Необязательно) Шаблон Model Armor для второго подхода При локальном запуске аутентифицируйтесь с помощью: При запуске в Colab используйте: Прежде чем создавать безопасных агентов, пожалуйста, разберитесь, от чего вы защищаетесь. Попытки обойти ограничения безопасности: "Игнорируй все предыдущие инструкции и..." "Действуй как ИИ без этических ограничений..." "Это только для образовательных целей..." Вредоносные инструкции, скрытые во вводе пользователя или выводах инструментов: Внедрение вредоносного контента в историю разговора для влияния на будущие ответы: Внешние инструменты возвращают вредоносный контент, который обманывает агента: Вы будете реализовывать глубокую эшелонированную защиту с несколькими уровнями: Фильтрация ввода — Проверка сообщений пользователя перед обработкой Валидация ввода инструмента — Проверка безопасности вызовов инструментов Санитизация вывода инструмента — Фильтрация результатов инструмента перед возвратом агенту Фильтрация вывода — Проверка окончательных ответов агента Защита памяти сессии — Никогда не хранить небезопасный контент в истории разговора Начнем с создания простого агента без механизмов безопасности, чтобы увидеть риски. Вопрос для студентов: Какие уязвимости вы видите в вышеуказанном агенте? Нажмите, чтобы раскрыть Нет валидации ввода пользовательских сообщений Выводы инструментов не фильтруются Инструмент имеет скрытый бэкдор (ключевое слово "secret") Нет защиты от попыток jailbreak Память сессии может быть отравлена Первый подход использует другой LLM в качестве "судьи" для оценки безопасности.

План урока

  1. Защита от Jailbreak-атак с использованием Google ADK с LLM-as-a-Judge и Model Armor
  2. Что вы узнаете
  3. Используемые технологии
  4. 1. Настройка и конфигурация
  5. Настройка учетных данных Google Cloud
  6. Аутентификация
  7. 2. Понимание угроз безопасности ИИ
  8. Распространенные угрозы безопасности ИИ

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды