Макро-оценки агентных систем

Урок 226 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Цели урока

  • Генерировать или собирать множество трассированных запусков агентов;
  • Выполнять оценки нижнего уровня для каждого завершенного запуска;
  • Превращать каждую трассировку в компактный документ;
  • Обнаруживать повторяющиеся шаблоны поведения по всей совокупности; и
  • Детально исследовать один высокоэффективный шаблон, чтобы определить, где человеку следует проверить систему в следующий раз.

О чём урок

Когда агентная система дает сбой, проблема часто выходит за рамки одного неудачного ответа. Передача управления может произойти слишком поздно, агент-специалист может пропустить один и тот же сигнал во многих запусках, или процесс проверки может быть запущен для неверного класса случаев. Чтобы улучшить систему, командам необходимо видеть повторяющееся поведение по всей совокупности трассировок. В этом руководстве описывается рабочий процесс макро-оценки для многоагентной системы. Мы используем синтетический рабочий процесс заказа электромобилей (EV), где агенты-специалисты обрабатывают решения по ценообразованию, соответствию требованиям, поставкам, маршрутизации на заводе, планированию и выпуску в условиях меняющихся рыночных и операционных условий. The notebook использует предварительно рассчитанные синтетические трассировки и сохраненные метки оценок нижнего уровня, поэтому вы можете запустить весь рабочий процесс без ключа OpenAI API. Вы узнаете, как: Цель состоит не в том, чтобы построить идеальную таксономию каждой трассировки. Цель состоит в том, чтобы показать, как команда инженеров AI может перейти от тысяч событий агентов к небольшому числу шаблонов, которые понятны как техническим специалистам, так и бизнес-заинтересованным сторонам. Ключевая идея заключается в том, что notebook оценивает сохраненную агентную систему, а не обычную стенограмму чата. Входные данные сценария управляют оркестрованным роем специалистов, среда выполнения генерирует пакеты трассировок, сохраненные метки Promptfoo присоединяются к нормализованным трассировкам, а слой макро-оценки превращает эти данные в представления шаблонов и диагностики. Оценки — это то, как команды AI измеряют работоспособность системы. Для простого вызова модели оценка может сравнивать один вывод с рубрикой или эталонным ответом. Для агентной системы нам также необходимо оценить, использовала ли система правильные инструменты, делегировала ли задачи нужному специалисту, приостанавливалась ли для проверки при высоком риске и оставалась ли в рамках бизнес-контекста.

План урока

  1. Карта сквозной агентной системы
  2. 1. Зачем нужны макро-оценки?
  3. Настройка и материалы данных
  4. 2. Симуляция: Автомобильные заказы в меняющемся мире
  5. Что представляет собой один пакет
  6. Как читать профиль набора данных
  7. Что означает case_type
  8. 3. Оценки агентов нижнего уровня с помощью Promptfoo

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды