Тематическое моделирование статей по ИИ

Урок 59 из 114 курса «Cohere: LLM University»: официальный курс Cohere LLM University (Кохир) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Цели урока

  • Соберете данные с самой свежей страницы ArXiv по AI, результатом чего станет список недавно опубликованных AI-статей.
  • Используете Embed Endpoint от Cohere для генерации word embeddings на основе вашего списка AI-статей.
  • Визуализируете embeddings и приступите к тематическому моделированию.
  • Используете инструмент для поиска статей, наиболее релевантных вашему запросу.

О чём урок

Обработка естественного языка (NLP) — это ключевая область машинного обучения, сфокусированная на анализе и понимании текстовых данных. Одним из популярных приложений NLP является тематическое моделирование, которое использует обучение без учителя и алгоритмы кластеризации для группировки схожих текстов и извлечения скрытых тем из коллекций документов. Этот подход обеспечивает автоматическую организацию документов, эффективный поиск информации и фильтрацию контента. Здесь вы узнаете, как использовать инструменты NLP от Cohere для выполнения семантического поиска и кластеризации AI-статей, что поможет вам выявить тенденции в AI. Вы: Чтобы следовать этому руководству, вам необходимо быть знакомым с Python и иметь установленную версию Python 3.6+, а также вам понадобится аккаунт Cohere. Все последующее можно протестировать с помощью блокнота Google Colab. Сначала вам необходимо установить зависимости Python, необходимые для запуска проекта. Используйте pip для их установки с помощью команды ниже. А также мы инициализируем клиент Cohere. После этого мы импортируем необходимые библиотеки для выполнения веб-запросов, обработки веб-контента и выполнения наших функций тематического моделирования. Далее, сделайте HTTP-запрос к исходному веб-сайту, который содержит архив AI-статей. Далее, сделайте HTTP-запрос к исходному веб-сайту, который содержит архив AI-статей. В этом разделе мы рассмотрим часть кода Python, который нам понадобится для нашего проекта по тематическому моделированию. Эта функция make_raw_df извлекает данные статей с заданного URL, вытягивая заголовки и аннотации. Она использует BeautifulSoup для парсинга HTML-контента, извлекая заголовки из элементов с классом "list-title mathjax" и аннотации из элементов параграфов с классом "mathjax". Наконец, она организует эти данные в pandas dataframe с двумя столбцами — "titles" и "texts" — где каждая строка представляет информацию из одной статьи. Word embedding — это техника для изучения числового представления слов. Вы можете использовать эти embeddings для: • Кластеризации больших объемов текста• Сопоставления запроса с другими похожими предложениями• Выполнения задач классификации, таких как классификация настроений Все это мы сделаем сегодня.

План урока

  1. Настройка необходимых функций
  2. Получение и обработка статей ArXiv.
  3. Генерация embeddings
  4. Получение сути тем
  5. Генерация графика тем
  6. Поиск схожести между статьями
  7. Заключение

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды