Моделирование языка

Урок 16 из 25 курса «Основы ИИ для начинающих»: официальный курс Microsoft AI for Beginners (Майкрософт) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Семантические эмбеддинги, такие как Word2Vec и GloVe, представляют собой первый шаг к моделированию языка: созданию моделей, которые каким-то образом понимают (или представляют) природу языка. Основная идея моделирования языка заключается в обучении моделей на неразмеченных наборах данных без учителя. Это важно, поскольку в нашем распоряжении имеются огромные объёмы неразмеченного текста, тогда как количество размеченного текста всегда будет ограничено объёмом усилий, которые мы можем потратить на разметку. Чаще всего мы можем создавать языковые модели, способные предсказывать пропущенные слова в тексте, так как легко замаскировать случайное слово в тексте и использовать его в качестве обучающего примера. В наших предыдущих примерах мы использовали предварительно обученные семантические эмбеддинги, но интересно рассмотреть, как эти эмбеддинги можно обучать. Существует несколько возможных подходов: N-граммное моделирование языка, когда мы предсказываем токен, основываясь на N предыдущих токенах (N-грамма). Непрерывный мешок слов (Continuous Bag-of-Words, CBoW), когда мы предсказываем центральный токен $W_0$ в последовательности токенов $W_{-N}$, ..., $W_N$. Skip-gram, где мы предсказываем набор соседних токенов {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} на основе центрального токена $W_0$. Изображение из этой статьи Продолжите обучение в следующих ноутбуках: Обучение CBoW Word2Vec с TensorFlow Обучение CBoW Word2Vec с PyTorch В предыдущем уроке мы убедились, что эмбеддинги слов работают как по волшебству! Теперь мы знаем, что обучение эмбеддингов слов не является очень сложной задачей, и при необходимости мы сможем обучить собственные эмбеддинги слов для предметно-ориентированного текста. Официальное руководство PyTorch по моделированию языка. Официальное руководство TensorFlow по обучению модели Word2Vec. Использование фреймворка gensim для обучения наиболее часто используемых эмбеддингов всего в нескольких строках кода описано в этой документации. В этой лабораторной работе мы предлагаем вам изменить код из данного урока, чтобы обучить модель Skip-Gram вместо CBoW. Прочитайте подробности. Источник: урок курса Microsoft «AI for Beginners», © Microsoft Corporation, лицензия MIT. Перевод и адаптация на русский: AI University.

План урока

  1. Тест перед лекцией
  2. Обучение эмбеддингов
  3. ✍️ Примеры ноутбуков: Обучение модели CBoW
  4. Заключение
  5. Тест после лекции
  6. Обзор и самостоятельное изучение
  7. 🚀 Задание: Обучите модель Skip-Gram

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды