Цикл улучшения агента: трейсы, оценки и Codex

Урок 81 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот notebook создает маховик улучшения для агента. Мы начинаем с реальных traces, добавляем обратную связь от человека и модели, превращаем эту обратную связь в evals и используем полученные доказательства для предложения следующих изменений harness, которые Codex сможет реализовать. Вы сможете: Создать финансового аналитика на базе OpenAI Agents SDK Запустить его на синтетических данных компании и зафиксировать traces Добавить примеры обратной связи от человека и сгенерированной LLM обратной связи по результатам этих запусков Превратить эту обратную связь в evals для Promptfoo, которые можно будет повторно запустить позже Использовать HALO для ранжирования следующих изменений harness и подготовки handoff для Codex В этом notebook harness представляет собой полный контракт вокруг модели, включающий инструкции, инструменты, маршрутизацию, требования к output и проверки валидации. Маховик сохраняет то, что вы узнаете из каждого запуска. Traces показывают, что произошло, обратная связь объясняет, что было важно, evals делают эти ожидания многоразовыми, а Codex может действовать на основе полученного набора изменений. В итоге вы получите: Финансового аналитика на базе OpenAI Agents SDK, который анализирует материалы due diligence вымышленной компании в ходе пяти трассированных запусков Обратную связь от человека и сгенерированную LLM по тем же traces Автоматически сгенерированный набор evals для Promptfoo Входной контроль валидации Promptfoo для текущего поведения агента Оптимизационный проход HALO по traces, обратной связи и результатам evals Handoff для разработчика в Codex, чтобы он мог реализовать рекомендованные изменения harness Агент поддерживает проведение due diligence при приобретении вымышленной компании. Он анализирует финансовые отчеты, данные о клиентах, контракты, заметки по безопасности, материалы совета директоров и управленческие отчеты, затем отвечает на вопросы due diligence с цитатами и проверяемыми артефактами. Цикл записывает один файл, который продвигает работу вперед: сгенерированный файл codex_handoff.md в ARTIFACT_DIR. Он содержит полную диагностику HALO, ранжированные рекомендации, доказательства, лежащие в их основе, и руководство по реализации, необходимое Codex для следующего обновления harness.

План урока

  1. Что вы создадите
  2. Предварительные условия
  3. Шаг 1. Создание синтетических данных компании
  4. Повествовательные markdown-файлы в синтетических данных
  5. Определение синтетических исходных файлов
  6. Материализация синтетических данных
  7. Шаг 2. Определение аналитика на базе OpenAI Agents SDK
  8. Артефакты, генерируемые агентом

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды