Ошибки в расшифровке: промпт или постобработка

Урок 76 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Мы решаем проблему повышения точности транскрипций, особенно в отношении названий компаний и ссылок на продукты. Наше решение включает двойную стратегию, использующую как параметр prompt Whisper, так и возможности пост-обработки GPT-4. Существует два подхода к исправлению неточностей: Мы вводим список правильных написаний непосредственно в параметр prompt Whisper, чтобы направлять начальную транскрипцию. Мы использовали GPT-4 для исправления ошибок после транскрипции, снова применяя тот же список правильных написаний в prompt. Эти стратегии направлены на обеспечение точной транскрипции незнакомых собственных имён. Для начала: Импортируйте библиотеку OpenAI Python (если у вас её нет, вам потребуется установить её с помощью pip install openai) Загрузите пример аудиофайла Нашей отправной точкой является монолог, который был сгенерирован ChatGPT на основе prompt'ов, предоставленных автором. Затем автор озвучил этот контент. Таким образом, автор как направлял вывод ChatGPT с помощью prompt'ов, так и оживил его, произнеся вслух. Наша вымышленная компания ZyntriQix предлагает ряд технологических продуктов. Среди них Digique Plus, CynapseFive, VortiQore V8, EchoNix Array, OrbitalLink Seven и DigiFractal Matrix. Мы также возглавляем несколько инициатив, таких как PULSE, RAPT, B.R.I.C.K., Q.U.A.R.T.Z. и F.L.I.N.T. Whisper неправильно транскрибировал название нашей компании, названия продуктов и некорректно написал аббревиатуры. Давайте передадим правильные названия в виде списка в prompt. При передаче списка названий продуктов некоторые из них транскрибируются правильно, в то время как другие по-прежнему содержат ошибки. Использование GPT-4 оказывается особенно полезным, когда содержание речи заранее неизвестно, а у нас есть готовый список названий продуктов. Метод пост-обработки с использованием GPT-4 значительно более масштабируем, чем зависимость исключительно от параметра prompt Whisper, который имеет ограничение в 244 токена. GPT-4 позволяет нам обрабатывать более крупные списки правильных написаний, что делает его более надёжным методом для работы с обширными списками продуктов. Однако этот метод пост-обработки не лишён ограничений.

План урока

  1. Настройка
  2. Установка базового уровня с помощью вымышленной аудиозаписи
  3. Вы можете использовать GPT-4 для исправления орфографических ошибок

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды