Как оценивать голосовых агентов на Realtime API

Урок 53 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Evals — это то, что превращает голосовую демонстрацию в нечто, на что люди могут полагаться. Разрыв между «вроде нормально» и «работает каждый день» почти всегда заполняют evals. Это руководство показывает, как оценивать голосовые системы, постепенно наращивая сложность: начните с простого (Crawl), добавьте реализма (Walk), затем протестируйте многоходовые взаимодействия (Run). Попутно вы научитесь создавать три вещи, которые делают результаты надёжными: dataset, graders и eval harness, а также производственный flywheel, чтобы реальные сбои становились новыми тестами. Команды, которые инвестируют в evals, могут выпускать продукты в production в 5–10 раз быстрее, потому что они видят, что не работает, точно определяют причину и уверенно устраняют её. Если вам нужен исполняемый код для создания eval harness, сначала используйте эту папку репозитория: Путь к репозиторию GitHub: openai-cookbook/examples/evals/realtime_evals Он включает полные эталонные harness для каждого этапа зрелости: Crawl harness (одноходовое воспроизведение) Walk harness (воспроизведение сохранённого аудио) Run harness (многоходовое моделирование model) Вы можете направить Codex на нужный harness и попросить его адаптировать его к вашим данным и graders. Realtime сложнее, чем текст, потому что вы оцениваете streaming взаимодействие с двумя outputs: что делает assistant и как он звучит. Ответ может быть «правильным» и при этом звучать некорректно. Текстовые evals в основном спрашивают, правилен ли контент. Realtime добавляет вторую ось: качество аудио. Контент и аудио могут быть некорректными независимо друг от друга, поэтому одна оценка может скрывать реальные проблемы. Большинство realtime evals можно свести к двум независимым осям: Качество контента: Понял ли assistant пользователя и сделал ли правильные действия? Корректность, полезность, выбор инструмента, аргументы инструмента и следование инструкциям. Качество аудио: Звучал ли assistant приемлемо? Естественность, просодия, произношение, стабильность и поведение в условиях шума и несовершенной записи. С Responses API ментальная модель проста: request in → response out. С Realtime API «turn» — это связанный pipeline.

План урока

  1. Введение
  2. Код Realtime Eval Harness
  3. Часть I: Основы
  4. 1) Почему realtime evals сложны
  5. 1.1 Две оси качества в реальном времени
  6. 1.2 Сложность отладки
  7. 1.3 Transcript ≠ ground truth
  8. Часть II: Стратегия

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды