Цели урока
- Соберете данные с самой свежей страницы ArXiv по AI, результатом чего станет список недавно опубликованных AI-статей.
- Используете Embed Endpoint от Cohere для генерации word embeddings на основе вашего списка AI-статей.
- Визуализируете embeddings и приступите к тематическому моделированию.
- Используете инструмент для поиска статей, наиболее релевантных вашему запросу.
О чём урок
Обработка естественного языка (NLP) — это ключевая область машинного обучения, сфокусированная на анализе и понимании текстовых данных. Одним из популярных приложений NLP является тематическое моделирование, которое использует обучение без учителя и алгоритмы кластеризации для группировки схожих текстов и извлечения скрытых тем из коллекций документов. Этот подход обеспечивает автоматическую организацию документов, эффективный поиск информации и фильтрацию контента. Здесь вы узнаете, как использовать инструменты NLP от Cohere для выполнения семантического поиска и кластеризации AI-статей, что поможет вам выявить тенденции в AI. Вы: Чтобы следовать этому руководству, вам необходимо быть знакомым с Python и иметь установленную версию Python 3.6+, а также вам понадобится аккаунт Cohere. Все последующее можно протестировать с помощью блокнота Google Colab. Сначала вам необходимо установить зависимости Python, необходимые для запуска проекта. Используйте pip для их установки с помощью команды ниже. А также мы инициализируем клиент Cohere. После этого мы импортируем необходимые библиотеки для выполнения веб-запросов, обработки веб-контента и выполнения наших функций тематического моделирования. Далее, сделайте HTTP-запрос к исходному веб-сайту, который содержит архив AI-статей. Далее, сделайте HTTP-запрос к исходному веб-сайту, который содержит архив AI-статей. В этом разделе мы рассмотрим часть кода Python, который нам понадобится для нашего проекта по тематическому моделированию. Эта функция make_raw_df извлекает данные статей с заданного URL, вытягивая заголовки и аннотации. Она использует BeautifulSoup для парсинга HTML-контента, извлекая заголовки из элементов с классом "list-title mathjax" и аннотации из элементов параграфов с классом "mathjax". Наконец, она организует эти данные в pandas dataframe с двумя столбцами — "titles" и "texts" — где каждая строка представляет информацию из одной статьи. Word embedding — это техника для изучения числового представления слов. Вы можете использовать эти embeddings для: • Кластеризации больших объемов текста• Сопоставления запроса с другими похожими предложениями• Выполнения задач классификации, таких как классификация настроений Все это мы сделаем сегодня.
План урока
- Настройка необходимых функций
- Получение и обработка статей ArXiv.
- Генерация embeddings
- Получение сути тем
- Генерация графика тем
- Поиск схожести между статьями
- Заключение
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.