Сжатие модели через bitsandbytes

Урок 4 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Bits-and-bytes — это очень быстрый и простой подход к квантизации, выполняющий квантизацию во время загрузки. Однако скорость и качество не являются оптимальными, что делает его полезным для быстрой квантизации и загрузки моделей, квантизирующих на лету. Давайте проведем краткую демонстрацию и квантизируем Mistral 7B! Сначала мы установим transformers и все необходимые зависимости. Как только мы закончим, мы можем загрузить модель, которую хотим квантизировать. Сначала войдем с помощью read access token, чтобы получить доступ к моделям. Примечание: Вам необходимо сначала принять условия в репозитории. Теперь все готово, поэтому мы можем загрузить модель и квантизировать ее! Здесь мы квантизируем модель до 8-bit! В отличие от других методов, BnB довольно быстрый и эффективный. Нам не обязательно квантизировать его заранее, мы можем сделать это на лету! Как только модель будет готова, вы можете использовать ее следующим образом:

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды