Квантизация LLM: как запихнуть 70B модель в свою видюху
mr8bit 16 минут назад Квантизация LLM: как запихнуть 70B модель в свою видюху Средний 7 мин 574 Блог компании Cloud.ru Машинное обучение * Искусственный интеллект Natural Language Processing * Ну что, думаете что для...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Значимый прорыв формирует отрасль ИИ: mr8bit 16 минут назад Квантизация LLM: как запихнуть 70B модель в свою видюху Средний 7 мин 574 Блог компании Cloud. ru Машинное обучение * Искусственный интеллект Natural Language Processing * Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров.
Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху. Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ. Материал будет полезен как мимо проходящим ИИ-любопытствующим, так и хардкорным ML-инженерам и специалистам по инференсу LLM, которые хотят запускать большие модели на ограниченном железе.
Технические детали
Покажу, как все это гонять на практике и с кодом. Что за квантизация и на кой она нужнаСуть за 5 секунд: Квантизация — это когда мы сжимаем модель в 4–8 раз, теряя минимум качества. Это как JPEG: когда сжимаем фотку, пиксели теряют часть цветовой информации, но файл весит в 10 раз меньше, а невооруженным взглядом разница не видна.
Квантизация — то же самое, только для весов нейросети. Без этого трюка LLM на обычном железе — фантастика. Каждый параметр модели — это число.
По дефолту оно хранится как FP32 (32-битное число с плавающей запятой) — 4 байта на один параметр. Квантизация — это когда мы берем и говорим: «а давай хранить это число не в 32 битах, а в 8 или даже 4». Точность падает, но модель продолжает работать.
Отраслевые последствия
Сколько памяти это реально экономитВот вам наглядно LLaMA 3 70B при разной точности:Для MoE-моделей типа DeepSeek-V3 671B квантизация — это вообще вопрос жизни и смерти. Без нее модель жрет 2 600+ ГБ памяти. Чтобы прикинуть объем, вернитесь наверх к КДПВ, приглядитесь и увидите на ней сравнение объема памяти для LLM при разной точности для Dense и MoE.
Модель/ТочностьFP32 (4 байт/пар. )FP16/BF16 (2 байт/пар. 0 ГБMistral 7B (7B)~28.
5 ГБLLaMA 3 70B (70B)~280. 0 ГБMixtral 8x7B (MoE) (46. 4 ГБDeepSeek-V3 (MoE) (671B)~2684.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






