Сжатие модели методом GPTQ

Урок 7 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

GPTQ — это формат квантования, оптимизированный для инференса на GPU. Он использует калибровочный набор данных для улучшения своих квантований. Проведём краткую демонстрацию и квантуем Mistral 7B. Сначала установим auto-gptq. Это позволит нам легко квантовать и выполнять инференс моделей GPTQ. Как только мы закончим, мы можем загрузить модель, которую хотим квантовать. Сначала войдём в систему с помощью read access token, чтобы получить доступ к моделям. Примечание: Вам необходимо сначала принять условия в репозитории. Теперь всё готово, так что мы можем загрузить модель и квантовать её! Здесь мы квантуем модель до 4-битной точности! Теперь, когда модель квантована, мы можем сохранить её, чтобы поделиться ею или загрузить позже! Поскольку квантование с помощью GPTQ занимает некоторое время и требует ресурсов, рекомендуется всегда сохранять их. Модель квантована и сохранена с 4-битной точностью GPTQ! Вы также можете загрузить её для инференса, используя auto-gptq следующим образом:

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды