ai
3 мин
15 сентября 2026 г.
Источник: Dev.to AI Feed

Q4_K_M против Q8_0 для вашего местного LLM: что я на самом деле заметил (2026 г.)

Syed Masood Shah
Syed Masood Shah
RSS AI Ingest
Q4_K_M против Q8_0 для вашего местного LLM: что я на самом деле заметил (2026 г.)

Я провел целых три месяца, отказываясь что-либо квантовать из чистого упрямства. Полная точность или ничего. Это было глупо. Для модели 7B в режиме полного плавания требовалось около 14 ГБ видеопамяти, у моего графического процессора 8 ГБ, поэтому я наблюдал, как эта штука переливается в оперативную память процессора...

Я провел целых три месяца, отказываясь что-либо квантовать из чистого упрямства. Полная точность или ничего. Это было глупо. Для модели 7B в режиме полного плавания требовалось около 14 ГБ видеопамяти, у моего графического процессора 8 ГБ, поэтому я наблюдал, как эта штука перетекала в оперативную память процессора и ползала. Потом я действительно прочитал, что означает Q4_K_M, и перестал самодовольствоваться этим. Если вы новичок в этом, быстрая настройка условий, поскольку на страницах загрузки моделей предполагается, что вы уже знаете. Квантование сжимает веса модели от 16-битных чисел с плавающей запятой до 4-битных или 8-битных целых чисел, поэтому файл становится меньше и помещается в видеопамять. Имена выглядят как модельная тарабарщина, но в каждом репозитории GGUF вы увидите два — Q4 и Q8_0, и, честно говоря, суффикс K_M просто означает, что веса разбиваются на блоки, где чувствительные остаются немного более точными. Вот и все. В этом большая часть загадки. GGUF — это формат контейнера, который читают LM Studio и Ollama, поэтому, если вы когда-нибудь смотрели на страницу с обнимающимся лицом и надписью «Что мне нажать», это короткая версия: возьмите файл Q4_K_M и продолжайте свой день. Вот что я на самом деле измерил на своей локальной установке, когда дело доходит до локальной потери качества LLM. Переход от Q8_0 к Q4_K_M обошелся мне примерно в три процента на генераторе.

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект