О чём урок
Мы проведем fine-tuning классификатора babbage-002 (замена для моделей ada), чтобы различать два вида спорта: бейсбол и хоккей. Набор данных newsgroup можно загрузить с помощью sklearn. Сначала рассмотрим сами данные: Выше представлен один пример из категории бейсбола. Это электронное письмо в список рассылки. Мы видим, что у нас всего 1197 примеров, которые равномерно распределены между двумя видами спорта. Мы преобразуем набор данных в pandas dataframe с колонками для prompt и completion. Prompt содержит электронное письмо из списка рассылки, а completion — название вида спорта, либо хоккей, либо бейсбол. Исключительно для демонстрационных целей и ускорения fine-tuning мы берем только 300 примеров. В реальном сценарии чем больше примеров, тем выше производительность. prompt completion 0 From: dougb@comm.mot.com (Doug Bank)\nSubject:... baseball 1 From: gld@cunixb.cc.columbia.edu (Gary L Dare)... hockey 2 From: rudy@netcom.com (Rudy Wade)\nSubject: Re... baseball 3 From: monack@helium.gas.uug.arizona.edu (david... hockey 4 Subject: Let it be Known\nFrom: <ISSBTL@BYUVM.... baseball И бейсбол, и хоккей являются отдельными токенами. Мы сохраняем набор данных как файл jsonl. Теперь мы можем использовать инструмент подготовки данных, который предложит несколько улучшений для нашего набора данных перед fine-tuning. Перед запуском инструмента мы обновляем библиотеку openai, чтобы убедиться, что используем последнюю версию инструмента подготовки данных. Дополнительно мы указываем -q, что автоматически принимает все предложения. Инструмент любезно предлагает несколько улучшений для набора данных и разделяет его на обучающий и валидационный наборы. Суффикс между prompt и completion необходим, чтобы сообщить модели, что вводный текст закончился и теперь ей нужно предсказать класс. Поскольку мы используем один и тот же разделитель в каждом примере, модель способна научиться предсказывать либо бейсбол, либо хоккей после разделителя. Префикс пробела в completions полезен, так как большинство словесных токенов токенизируются с префиксом пробела.
План урока
- Исследование данных
- Подготовка данных
- Инструмент подготовки данных
- Fine-tuning
- [Продвинутый уровень] Результаты и ожидаемая производительность модели
- Использование модели
- Обобщение
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.