О чём урок
GPTQ — это формат квантования, оптимизированный для инференса на GPU. Он использует калибровочный набор данных для улучшения своих квантований. Проведём краткую демонстрацию и квантуем Mistral 7B. Сначала установим auto-gptq. Это позволит нам легко квантовать и выполнять инференс моделей GPTQ. Как только мы закончим, мы можем загрузить модель, которую хотим квантовать. Сначала войдём в систему с помощью read access token, чтобы получить доступ к моделям. Примечание: Вам необходимо сначала принять условия в репозитории. Теперь всё готово, так что мы можем загрузить модель и квантовать её! Здесь мы квантуем модель до 4-битной точности! Теперь, когда модель квантована, мы можем сохранить её, чтобы поделиться ею или загрузить позже! Поскольку квантование с помощью GPTQ занимает некоторое время и требует ресурсов, рекомендуется всегда сохранять их. Модель квантована и сохранена с 4-битной точностью GPTQ! Вы также можете загрузить её для инференса, используя auto-gptq следующим образом:
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.