О чём урок
Конечная точка Rerank от Cohere — это сложная система оценки и ранжирования семантической релевантности, которая оптимизирует результаты поиска, оценивая контекстуальную связь между запросами и фрагментами текста. Однако сложные предметные области представляют собой особую проблему из-за их сложной терминологии, контекста и требований к предметным знаниям. Эти области включают юридические документы, медицинские исследовательские работы, научную литературу, технические руководства, документацию для разработчиков, код, финансовые отчеты и другие области, требующие глубокого понимания специфического жаргона и сложных концепций. Эти области часто требуют тонкой настройки на пользовательских данных, чтобы гарантировать, что модели улавливают нюансы и экспертные знания, необходимые для точного понимания. Чтобы понять важность предметно-ориентированного обучения, мы рассмотрим пример кода, использующий набор данных из юридической области. Вы увидите, как тонкая настройка может значительно повысить точность модели. Мы выполним следующие шаги: Шаг 1: Подготовка набора данных - Загрузите набор данных, выберите подмножество и подготовьте его для конечной точки Rerank. Шаг 2: Оценка предварительно обученной модели - Вычислите точность предварительно обученной модели на тестовых данных. Шаг 3: Тонкая настройка модели - Запустите задачу тонкой настройки и подтвердите завершение обучения модели. Шаг 4: Оценка тонко настроенной модели - Оцените производительность тонко настроенной модели на тестовом наборе данных. Мы начнем с установки необходимых инструментов, а затем импортируем их. Вставьте свой ключ API Cohere в следующую ячейку. Для этого сначала зарегистрируйтесь в Cohere (бесплатно!), если вы еще этого не сделали. Затем получите свой ключ API здесь. Мы начинаем с загрузки набора данных CaseHOLD из Hugging Face. CaseHOLD — это задача Q&A с множественным выбором, состоящая из юридических решений, ссылающихся на другие решения в качестве прецедентов, называемых "holding statement". Это сложная задача, требующая специализированных юридических знаний для решения. Мы определяем его как IterableDataset, чтобы загружать только небольшую часть примеров за раз и избегать загрузки всего набора данных в память.
План урока
- Обзор
- Настройка
- Шаг 1: Подготовка набора данных
- Шаг 2: Оценка предварительно обученной модели
- Шаг 3: Тонкая настройка модели
- Шаг 4: Оценка тонко настроенной модели
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.