О чём урок
Evals — это то, что превращает голосовую демонстрацию в нечто, на что люди могут полагаться. Разрыв между «вроде нормально» и «работает каждый день» почти всегда заполняют evals. Это руководство показывает, как оценивать голосовые системы, постепенно наращивая сложность: начните с простого (Crawl), добавьте реализма (Walk), затем протестируйте многоходовые взаимодействия (Run). Попутно вы научитесь создавать три вещи, которые делают результаты надёжными: dataset, graders и eval harness, а также производственный flywheel, чтобы реальные сбои становились новыми тестами. Команды, которые инвестируют в evals, могут выпускать продукты в production в 5–10 раз быстрее, потому что они видят, что не работает, точно определяют причину и уверенно устраняют её. Если вам нужен исполняемый код для создания eval harness, сначала используйте эту папку репозитория: Путь к репозиторию GitHub: openai-cookbook/examples/evals/realtime_evals Он включает полные эталонные harness для каждого этапа зрелости: Crawl harness (одноходовое воспроизведение) Walk harness (воспроизведение сохранённого аудио) Run harness (многоходовое моделирование model) Вы можете направить Codex на нужный harness и попросить его адаптировать его к вашим данным и graders. Realtime сложнее, чем текст, потому что вы оцениваете streaming взаимодействие с двумя outputs: что делает assistant и как он звучит. Ответ может быть «правильным» и при этом звучать некорректно. Текстовые evals в основном спрашивают, правилен ли контент. Realtime добавляет вторую ось: качество аудио. Контент и аудио могут быть некорректными независимо друг от друга, поэтому одна оценка может скрывать реальные проблемы. Большинство realtime evals можно свести к двум независимым осям: Качество контента: Понял ли assistant пользователя и сделал ли правильные действия? Корректность, полезность, выбор инструмента, аргументы инструмента и следование инструкциям. Качество аудио: Звучал ли assistant приемлемо? Естественность, просодия, произношение, стабильность и поведение в условиях шума и несовершенной записи. С Responses API ментальная модель проста: request in → response out. С Realtime API «turn» — это связанный pipeline.
План урока
- Введение
- Код Realtime Eval Harness
- Часть I: Основы
- 1) Почему realtime evals сложны
- 1.1 Две оси качества в реальном времени
- 1.2 Сложность отладки
- 1.3 Transcript ≠ ground truth
- Часть II: Стратегия
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.