О чём урок
После fine-tuning модели с использованием SFT или LoRA SFT, её следует оценивать по стандартным benchmark. Как инженеры машинного обучения, вы должны поддерживать набор релевантных оценок для вашей целевой предметной области. На этой странице мы рассмотрим некоторые из наиболее распространённых benchmark и способы их использования для оценки вашей модели. Мы также рассмотрим, как создавать пользовательские benchmark для вашего конкретного сценария использования. Автоматические benchmark служат стандартизированными инструментами для оценки языковых моделей по различным задачам и возможностям. Хотя они предоставляют полезную отправную точку для понимания производительности модели, важно признать, что они представляют собой лишь одну часть комплексной стратегии оценки. Автоматические benchmark обычно состоят из тщательно отобранных наборов данных с предопределёнными задачами и метриками оценки. Эти benchmark направлены на оценку различных аспектов возможностей модели, от базового понимания языка до сложного рассуждения. Ключевое преимущество использования автоматических benchmark — их стандартизация: они позволяют проводить последовательное сравнение между различными моделями и обеспечивают воспроизводимые результаты. Однако крайне важно понимать, что производительность по benchmark не всегда напрямую переводится в реальную эффективность. Модель, отлично справляющаяся с академическими benchmark, всё ещё может испытывать трудности с конкретными предметными приложениями или практическими сценариями использования. MMLU (Massive Multitask Language Understanding) проверяет знания по 57 предметам, от естественных наук до гуманитарных. Хотя он всеобъемлющ, он может не отражать глубину экспертизы, необходимой для конкретных предметных областей. TruthfulQA оценивает склонность модели воспроизводить распространённые заблуждения, хотя он не может охватить все формы дезинформации. BBH (Big Bench Hard) и GSM8K сосредоточены на задачах сложного рассуждения. BBH проверяет логическое мышление и планирование, тогда как GSM8K специально нацелен на решение математических задач. Эти benchmark помогают оценить аналитические способности, но могут не охватывать тонкие рассуждения, необходимые в реальных сценариях. HELM предоставляет целостную систему оценки. Benchmark, подобные HELM, дают представление о возможностях обработки языка в таких аспектах, как здравый смысл, знание мира и рассуждение.
План урока
- Автоматические Benchmark
- Понимание автоматических Benchmark
- Benchmark общего знания
- Benchmark для оценки рассуждений
- Понимание языка
- Предметно-ориентированные Benchmark
- Альтернативные подходы к оценке
- LLM-as-Judge
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.