Evals API: оценка на аудиоданных

Урок 178 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Это руководство демонстрирует, как использовать фреймворк Evals от OpenAI для задач, основанных на аудио. Используя Evals API, мы будем оценивать ответы, сгенерированные моделью, на аудиосообщение и prompt, применяя sampling для генерации ответов модели и model grading для оценки ответов модели по отношению к выходному аудио и эталонному ответу. Обратите внимание, что оценка будет производиться по аудиовыходам из сэмплированного ответа. До добавления поддержки аудио, для оценки аудиоразговоров их сначала нужно было транскрибировать в текст. Теперь вы можете использовать исходное аудио и получать сэмплы от модели также в аудиоформате. Это более точно отражает рабочие процессы, такие как сценарий поддержки клиентов, где как пользователь, так и агент используют аудио. Для оценки мы будем использовать аудиомодель для оценки аудиоответа с помощью model grader. В качестве альтернативы или в комбинации мы могли бы использовать текстовую транскрипцию из сэмплированного аудио и задействовать существующий набор текстовых grader'ов. В этом примере мы оценим, насколько хорошо наша модель может: Генерировать подходящие ответы на user prompt'ы об аудиосообщении Соответствовать эталонным ответам, представляющим высококачественные ответы Мы используем набор данных big_bench_audio, который размещен на Hugging Face. Big Bench Audio — это аудиоверсия подмножества вопросов Big Bench Hard. Набор данных может быть использован для оценки рассуждающих способностей моделей, поддерживающих аудиоввод. Он содержит аудиоклип, описывающий логическую задачу, категорию и официальный ответ. Мы извлекаем соответствующие поля и помещаем их в JSON-подобный формат для передачи в качестве источника данных в Evals API. Входные аудиоданные должны быть в виде строки, закодированной в base64. Мы обрабатываем данные в аудиофайле и конвертируем их в base64. Примечание: Аудиомодели в настоящее время поддерживают форматы WAV, MP3, FLAC, Opus или PCM16. Подробности см. в разделе аудиовходы. Если вы выведете список источников данных, каждый элемент должен иметь схожий вид: Теперь, когда у нас есть источник данных и задача, мы создадим наши evals.

План урока

  1. Установка зависимостей + Настройка
  2. Подготовка набора данных
  3. Конфигурация Eval
  4. Конфигурация источника данных
  5. Критерии тестирования
  6. Запуск Eval
  7. Опрос и отображение результатов
  8. Просмотр отдельных выходных элементов

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды