О чём урок
Это руководство демонстрирует, как использовать фреймворк Evals от OpenAI для задач, основанных на аудио. Используя Evals API, мы будем оценивать ответы, сгенерированные моделью, на аудиосообщение и prompt, применяя sampling для генерации ответов модели и model grading для оценки ответов модели по отношению к выходному аудио и эталонному ответу. Обратите внимание, что оценка будет производиться по аудиовыходам из сэмплированного ответа. До добавления поддержки аудио, для оценки аудиоразговоров их сначала нужно было транскрибировать в текст. Теперь вы можете использовать исходное аудио и получать сэмплы от модели также в аудиоформате. Это более точно отражает рабочие процессы, такие как сценарий поддержки клиентов, где как пользователь, так и агент используют аудио. Для оценки мы будем использовать аудиомодель для оценки аудиоответа с помощью model grader. В качестве альтернативы или в комбинации мы могли бы использовать текстовую транскрипцию из сэмплированного аудио и задействовать существующий набор текстовых grader'ов. В этом примере мы оценим, насколько хорошо наша модель может: Генерировать подходящие ответы на user prompt'ы об аудиосообщении Соответствовать эталонным ответам, представляющим высококачественные ответы Мы используем набор данных big_bench_audio, который размещен на Hugging Face. Big Bench Audio — это аудиоверсия подмножества вопросов Big Bench Hard. Набор данных может быть использован для оценки рассуждающих способностей моделей, поддерживающих аудиоввод. Он содержит аудиоклип, описывающий логическую задачу, категорию и официальный ответ. Мы извлекаем соответствующие поля и помещаем их в JSON-подобный формат для передачи в качестве источника данных в Evals API. Входные аудиоданные должны быть в виде строки, закодированной в base64. Мы обрабатываем данные в аудиофайле и конвертируем их в base64. Примечание: Аудиомодели в настоящее время поддерживают форматы WAV, MP3, FLAC, Opus или PCM16. Подробности см. в разделе аудиовходы. Если вы выведете список источников данных, каждый элемент должен иметь схожий вид: Теперь, когда у нас есть источник данных и задача, мы создадим наши evals.
План урока
- Установка зависимостей + Настройка
- Подготовка набора данных
- Конфигурация Eval
- Конфигурация источника данных
- Критерии тестирования
- Запуск Eval
- Опрос и отображение результатов
- Просмотр отдельных выходных элементов
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.