О чём урок
Ранее известный как GGML, GGUF пользуется большой популярностью в сообществе благодаря своей способности эффективно работать на CPU и устройствах Apple, перенося нагрузку на GPU, если он доступен! Это делает его хорошим выбором для локального тестирования и развертывания, поскольку он может эффективно использовать как RAM (так и VRAM, если она доступна). Ниже представлен список возможных вариантов квантизации с llama.cpp: q2_k q3_k_l q3_k_m q3_k_s q4_0: <- 4-битный q4_1 q4_k_s q4_k_m <- Рекомендуется q5_0: <- 5-битный q5_1 q5_k_s q5_k_m: <- Рекомендуется q6_k: <- Рекомендуется q8_0: <- 8-битный, очень близок к без потерь по сравнению с исходными весами Давайте проведем короткую демонстрацию и квантуем Mistral 7B! Сначала установим все необходимые зависимости и llama.cpp, а также скачаем модель. Cloning into 'llama.cpp'... remote: Enumerating objects: 32489, done. [K remote: Counting objects: 100% (11391/11391), done. [K remote: Compressing objects: 100% (708/708), done. [K remote: Total 32489 (delta 11079), reused 10702 (delta 10682), pack-reused 21098 (from 1) [K Receiving objects: 100% (32489/32489), 56.06 MiB | 14.27 MiB/s, done. Resolving deltas: 100% (23481/23481), done. Already up to date. I ccache not found. Consider installing it for faster compilation.
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.