Cohere на AWS: семантический поиск в Bedrock

Урок 106 из 114 курса «Cohere: LLM University»: официальный курс Cohere LLM University (Кохир) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Текстовые embeddings — это числовые представления, созданные языковыми моделями, которые преобразуют текст в векторы. Они захватывают и кодируют контекст документа. Эти векторы хранят богатый контекст о документах, которые они представляют, открывая возможности для различных приложений, от semantic search и retrieval-augmented generation (RAG) до topic modeling и text classification. Модель Cohere Embed, доступная на Amazon Bedrock, является мощной моделью text embeddings, предлагающей эти возможности. Эта модель поддерживает более 100 языков и уникальна среди моделей text embedding благодаря акценту на качестве документов для таких приложений, как semantic search. В этом notebook мы рассмотрим, как использовать модель Cohere Embed на Amazon Bedrock. Сначала установим и импортируем необходимые библиотеки, а также настроим наш клиент Cohere с помощью Cohere SDK. Для использования Bedrock мы создаем BedrockClient, передавая необходимые AWS credentials. Мы используем набор данных (MultiFIN), содержащий список заголовков реальных статей на 15 языках (английский, турецкий, датский, испанский, польский, греческий, финский, иврит, японский, венгерский, норвежский, русский, итальянский, исландский и шведский). Это открытый набор данных, созданный для финансовой обработки естественного языка (NLP) и доступный в репозитории GitHub. В нашем случае мы создали CSV-файл с данными MultiFIN, а также столбец с переводами. Мы не используем этот столбец для подачи в модель; мы используем его, чтобы помочь нам следить за результатами, когда мы выводим их для тех, кто не говорит по-датски или по-испански. Мы указываем на этот CSV для создания нашего dataframe. MultiFIN содержит более 6000 записей на 15 различных языках. Для нашего примера мы сосредоточимся на трех языках: английском, испанском и датском. Для этого нам потребуется выполнить несколько шагов предварительной обработки. Сначала мы удалим дубликаты, удалим языки, кроме трех необходимых, и выберем 80 самых длинных статей для демонстрационных целей. Теперь мы хотим встроить наши документы и сохранить embeddings. Embeddings — это очень большие векторы, которые инкапсулируют semantic meaning нашего документа.

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды