Генерация синтетических данных, часть 1

Урок 60 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Генерация синтетических данных с использованием больших языковых моделей (LLM) предлагает мощное решение часто встречающейся проблемы: доступности высококачественных, разнообразных и соответствующих требованиям конфиденциальности данных. Это может быть использовано в ряде сценариев, таких как обучение модели машинного обучения в области data science (SVM, деревья решений, KNN), fine-tuning другой модели GPT на этих данных, в качестве решения проблемы холодного старта, помощи в создании убедительных демонстраций/приложений с реалистичными данными, сценарного тестирования и т.д. Существует ряд ключевых факторов, которые могут побудить вас использовать синтетические данные. Человеческие данные могут иметь ограничения конфиденциальности и/или содержать идентифицируемую информацию, которую мы не хотим использовать. Синтетические данные могут быть гораздо более структурированными и, следовательно, легче поддаваться манипуляциям, чем реальные данные. В областях, где данные скудны или данные определенных категорий скудны, мы можем захотеть дополнить их. При работе с несбалансированными наборами данных или наборами данных, которым не хватает разнообразия, мы можем захотеть создать данные для повышения насыщенности наших наборов данных. В отличие от традиционных методов аугментации данных или ручного создания данных, использование LLM позволяет генерировать насыщенные, тонкие и контекстуально релевантные наборы данных, которые могут значительно повысить их полезность для предприятий и разработчиков. Мы разделили этот tutorial на 2 части. В этом cookbook мы рассмотрим следующее: CSV со структурированным prompt'ом CSV с программой на Python Многотабличный CSV с программой на Python Простое создание текстовых данных Работа с несбалансированными или недостаточно разнообразными текстовыми данными тогда как во второй части мы рассмотрим стратегии prompt'инга для получения более качественных текстовых данных. Последние два пункта особенно полезны для создания синтетических данных для fine-tuning другой модели GPT. Например, использование более качественных данных, произведенных gpt-4o, для fine-tuning более дешевой и быстрой gpt-3.5-turbo для повышения производительности при одновременном снижении затрат. Здесь мы создаем данные самым простым способом.

План урока

  1. Начальная настройка
  2. 1. CSV со структурированным prompt'ом
  3. 2. CSV с программой на Python
  4. 3. Многотабличный CSV с программой на Python
  5. 4. Простое создание текстовых данных
  6. 5. Работа с несбалансированными или недостаточно разнообразными текстовыми данными

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды