Цели урока
- Генерировать или собирать множество трассированных запусков агентов;
- Выполнять оценки нижнего уровня для каждого завершенного запуска;
- Превращать каждую трассировку в компактный документ;
- Обнаруживать повторяющиеся шаблоны поведения по всей совокупности; и
- Детально исследовать один высокоэффективный шаблон, чтобы определить, где человеку следует проверить систему в следующий раз.
О чём урок
Когда агентная система дает сбой, проблема часто выходит за рамки одного неудачного ответа. Передача управления может произойти слишком поздно, агент-специалист может пропустить один и тот же сигнал во многих запусках, или процесс проверки может быть запущен для неверного класса случаев. Чтобы улучшить систему, командам необходимо видеть повторяющееся поведение по всей совокупности трассировок. В этом руководстве описывается рабочий процесс макро-оценки для многоагентной системы. Мы используем синтетический рабочий процесс заказа электромобилей (EV), где агенты-специалисты обрабатывают решения по ценообразованию, соответствию требованиям, поставкам, маршрутизации на заводе, планированию и выпуску в условиях меняющихся рыночных и операционных условий. The notebook использует предварительно рассчитанные синтетические трассировки и сохраненные метки оценок нижнего уровня, поэтому вы можете запустить весь рабочий процесс без ключа OpenAI API. Вы узнаете, как: Цель состоит не в том, чтобы построить идеальную таксономию каждой трассировки. Цель состоит в том, чтобы показать, как команда инженеров AI может перейти от тысяч событий агентов к небольшому числу шаблонов, которые понятны как техническим специалистам, так и бизнес-заинтересованным сторонам. Ключевая идея заключается в том, что notebook оценивает сохраненную агентную систему, а не обычную стенограмму чата. Входные данные сценария управляют оркестрованным роем специалистов, среда выполнения генерирует пакеты трассировок, сохраненные метки Promptfoo присоединяются к нормализованным трассировкам, а слой макро-оценки превращает эти данные в представления шаблонов и диагностики. Оценки — это то, как команды AI измеряют работоспособность системы. Для простого вызова модели оценка может сравнивать один вывод с рубрикой или эталонным ответом. Для агентной системы нам также необходимо оценить, использовала ли система правильные инструменты, делегировала ли задачи нужному специалисту, приостанавливалась ли для проверки при высоком риске и оставалась ли в рамках бизнес-контекста.
План урока
- Карта сквозной агентной системы
- 1. Зачем нужны макро-оценки?
- Настройка и материалы данных
- 2. Симуляция: Автомобильные заказы в меняющемся мире
- Что представляет собой один пакет
- Как читать профиль набора данных
- Что означает case_type
- 3. Оценки агентов нижнего уровня с помощью Promptfoo
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.