Текстовые эмбеддинги

Урок 45 из 89 курса «Claude в Amazon Bedrock»: официальный курс Anthropic Academy (Антропик) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Кадр из видеоурока

О чём урок

В мире больших языковых моделей (LLM) и систем генерации с дополненной реальностью (RAG), способность находить точную и релевантную информацию является краеугольным камнем успеха. Представьте, что у вас есть огромная библиотека документов, и пользователь задает вопрос. Как быстро и точно найти те части текста, которые содержат ответ, даже если формулировка вопроса сильно отличается от текста в документах? Именно здесь на сцену выходят векторные представления текста, или Text Embeddings. Они являются фундаментом для семантического поиска — метода, который позволяет компьютерам понимать смысл текста, а не просто искать совпадения по ключевым словам. Прежде чем углубиться в суть Text Embeddings, давайте рассмотрим проблему, которую они решают. В типичном пайплайне RAG, после того как большой документ разбит на более мелкие фрагменты (или chunks), следующая задача — определить, какие из этих фрагментов наиболее релевантны запросу пользователя. Это, по сути, задача поиска: нужно просмотреть все текстовые фрагменты и выявить те, которые относятся к тому, о чем спрашивает пользователь. Вызов заключается в определении того, какие фрагменты "связаны" с вопросом пользователя. Это не так просто, как сопоставление ключевых слов. Например, если пользователь спрашивает "Каковы преимущества использования солнечной энергии?", а в документе написано "Солнечные панели предлагают значительную экономию средств и снижение выбросов углекислого газа", простое сопоставление слов может не сработать, так как слова "преимущества" и "экономия средств" или "снижение выбросов" не совпадают напрямую. Нам нужно понимание смысла и контекста как вопроса, так и фрагментов. Традиционный поиск по ключевым словам часто терпит неудачу, когда слова синонимичны, используются в разных формах или когда запрос и документ выражают одну и ту же идею совершенно разными словами. Для преодоления этого ограничения и был разработан семантический поиск. Text Embedding — это числовое представление смысла, содержащегося в некотором тексте. Представьте это как преобразование слов, фраз и предложений в формат, с которым компьютеры могут работать математически. Это своего рода "отпечаток пальца" текста, который улавливает его семантическую суть.

План урока

  1. Векторные представления текста: Ключ к семантическому поиску в RAG
  2. Проблема поиска релевантных фрагментов
  3. Что такое векторные представления текста (Text Embeddings)?
  4. Как "читать" эти числа?
  5. Создание векторных представлений: практический подход
  6. Почему векторные представления так важны для RAG?
  7. Заключение

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды