О чём урок
В мире, где информация окружает нас со всех сторон, способность быстро находить и понимать релевантные данные становится критически важной. Долгое время поиск информации основывался на простом совпадении ключевых слов. Если вы искали "машина", вы получали документы, содержащие именно это слово. Вы не нашли бы "автомобиль", "транспортное средство" или "моему Civic нужны новые тормоза", если эти слова не были явно указаны. На протяжении десятилетий поисковые системы, такие как Google, постепенно улучшались благодаря инженерным решениям: словари синонимов связывали "машину" с "автомобилем", правила стемминга соединяли "бегущий" с "бежать", а анализ паттернов кликов показывал, что люди, ищущие "квартиры в Нью-Йорке", хотят те же результаты, что и по запросу "аренда жилья на Манхэттене". Связи между несовпадающими строками приходилось устанавливать более или менее вручную. Это был трудоемкий процесс, который не позволял компьютерам по-нанастоящему "понимать" смысл текста. Современные большие языковые модели (LLM), такие как Claude, изменили этот подход, предложив идею эмбеддингов (embeddings). Эмбеддинги — это способ преобразования текста в числовые координаты, где похожие концепции оказываются близко друг к другу в многомерном пространстве. Это отображение семантического пространства не является ручным; оно формируется автоматически в процессе обучения модели на огромных объемах данных. Представьте упрощенный пример. Допустим, у нас есть коллекция документов, и мы хотим оценить каждый из них по двум параметрам: насколько он связан с динозаврами и насколько он связан с американскими горками. Документы на схожие темы окажутся рядом друг с другом на этом двухмерном графике. Например: Детская книга о динозаврах будет иметь высокие оценки по "динозаврам" и низкие по "горкам". Веб-страница о "Velocicoaster" (аттракцион на тему динозавров) будет иметь высокие оценки по "горкам" и умеренные по "динозаврам". Энциклопедия, охватывающая множество тем, может иметь средние оценки по обоим параметрам. Таким образом, мы только что отобразили смысл в 2D-пространстве, расположив нашу коллекцию элементов на основе их содержания.
План урока
- Понимание смысла: Как LLM работают с текстом через эмбеддинги
- От ключевых слов к смыслу: Введение в эмбеддинги
- Многомерное пространство смысла
- Как работают эмбеддинг-модели
- Измерение сходства: Косинусная близость
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.