О чём урок
В последние месяцы мы разработали новую конечную точку релевантности, которая принимает запрос и список документов и предсказывает релевантность между запросом и каждым документом. Ее можно использовать в двухэтапной системе извлечения: сначала вы берете вопрос пользователя и извлекаете 100 наиболее релевантных документов из вашей коллекции, используя либо лексический, либо семантический поиск. Затем вы передаете вопрос и эти 100 наиболее релевантных документов нашей конечной точке релевантности, чтобы получить оценку для каждого документа. После этого вы можете ранжировать эти документы на основе этих оценок. В наших бенчмарках по 20 наборам данных мы отметили значительные улучшения по сравнению с лексическим и семантическим поиском, особенно для сценариев использования, где отсутствуют обучающие данные. В этом ноутбуке мы продемонстрируем конечную точку rerank. В следующей ячейке мы вызовем rerank для ранжирования docs на основе их релевантности к query. Ниже приведен пример того, как использовать эту модель сквозным образом для поиска по Simple English Wikipedia, которая состоит примерно из 500 тысяч отрывков. Мы используем лексический поиск BM25 для извлечения 100 наиболее релевантных отрывков, соответствующих запросу, а затем отправляем эти 100 отрывков и запрос в нашу конечную точку rerank, чтобы получить переранжированный список. Мы выводим 3 лучших результата согласно лексическому поиску BM25 (используемому, например, Elasticsearch) и переранжированный список из нашей конечной точки.
План урока
- Использование конечной точки
- Поиск в Wikipedia - Сквозная демонстрация
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.