Классификация текстов через эмбеддинги

Урок 4 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Существует множество способов классификации текста. В этом notebook представлен пример классификации текста с использованием embeddings. Для многих задач классификации текста мы наблюдали, что fine-tuned модели показывают лучшие результаты, чем embeddings. Пример fine-tuned моделей для классификации можно найти в Fine-tuned_classification.ipynb. Мы также рекомендуем иметь больше примеров, чем размерность embedding, чего нам здесь не совсем удалось достичь. В этой задаче классификации текста мы предсказываем оценку отзыва о еде (от 1 до 5) на основе embedding текста отзыва. Мы разделяем набор данных на обучающий и тестовый для всех последующих задач, чтобы реалистично оценить производительность на невиданных ранее данных. Набор данных создан в Get_embeddings_from_dataset Notebook. Мы видим, что модель достаточно хорошо научилась различать категории. Отзывы с 5 звездами показывают наилучшую общую производительность, и это не слишком удивительно, поскольку они являются наиболее распространенными в наборе данных.

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды