О чём урок
В этом руководстве мы узнаем, как отслеживать внутренние шаги (traces) SDK агента OpenAI и оценивать его производительность с помощью Langfuse. Это руководство охватывает метрики онлайн- и офлайн-оценки, используемые командами для быстрого и надежного вывода агентов в production. Чтобы узнать больше о стратегиях оценки, ознакомьтесь с этой статьей в блоге. Почему оценка AI агентов важна: Отладка проблем, когда задачи не выполняются или дают субоптимальные результаты Мониторинг затрат и производительности в реальном времени Повышение надежности и безопасности за счет непрерывной обратной связи Ниже мы устанавливаем библиотеку openai-agents (SDK агентов OpenAI), инструментарий OpenTelemetry pydantic-ai[logfire], langfuse и библиотеку datasets от Hugging Face В этом notebook мы будем использовать Langfuse для трассировки, отладки и оценки нашего агента. Примечание: Если вы используете LlamaIndex или LangGraph, вы можете найти документацию по их инструментированию здесь и здесь. После установки переменных окружения мы можем инициализировать клиент Langfuse. get_client() инициализирует клиент Langfuse, используя учетные данные, предоставленные в переменных окружения. Pydantic Logfire предлагает инструментарий для SDK агентов OpenAI. Мы используем его для отправки traces в бэкенд OpenTelemetry Langfuse. Вот простой Q&A агент. Мы запускаем его, чтобы убедиться, что инструментарий работает правильно. Если все настроено правильно, вы увидите логи/spans на вашей панели мониторинга observability. Проверьте вашу панель Traces Langfuse, чтобы убедиться, что spans и логи были записаны. Ссылка на trace Теперь, когда вы убедились, что ваш инструментарий работает, давайте попробуем более сложный запрос, чтобы увидеть, как отслеживаются расширенные метрики (использование token, latency, затраты и т.д.). Langfuse записывает trace, который содержит spans, представляющие каждый шаг логики вашего агента. Здесь trace содержит общий запуск агента и под-spans для: Вызова инструмента (get_weather) Вызовов LLM (Responses API с 'gpt-4o') Вы можете просмотреть их, чтобы точно увидеть, где тратится время, сколько token используется и так далее: Ссылка на trace Онлайн-оценка относится к оценке агента в живой, реальной среде, т.е.
План урока
- Шаг 0: Установка необходимых библиотек
- Шаг 1: Инструментирование вашего агента
- Шаг 2: Тестирование инструментария
- Шаг 3: Наблюдение и оценка более сложного агента
- Структура Trace
- Онлайн-оценка
- Общие метрики для отслеживания в Production
- 1. Затраты
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.