Сколько видеопамяти нужно для запуска языковых моделей локально: полный расклад на 2026 год
Запуск больших языковых моделей на своём железе — вопрос не «можно ли», а «сколько видеопамяти хватит». Разбираем реальные цифры, подводные камни квантизации и ассортимент видеокарт 2026 года.
Модель либо влезает в видеопамять, либо нет — и формула для проверки помещается на салфетку. Весь вопрос в том, хватит ли вам места ещё и на разговор.
Каждый геймер уже знает это чувство
Если вы когда-нибудь играли в тяжёлые игры на слабой видеокарте, вы знаете этот момент: открываешь страницу в Steam, смотришь системные требования и задерживаешь дыхание. «Потянет?» Локальный ИИ унаследовал ту же тревогу, только вместо шейдеров и тактовой частоты главный вопрос свёлся к одной метрике: объём видеопамяти (VRAM).
Когда вы читаете, что «модель на 70 миллиардов параметров запускается локально», за кулисами всегда стоит невысказанный вопрос — а влезет ли она в вашу видеокарту? Хорошая новость: математика здесь проще, чем в игровой индустрии. Производительность игр зависит от драйверов, разрешения, сложности сцены и десятков переменных. С LLM всё однозначнее: модель занимает определённый объём памяти, и вы можете посчитать его заранее.
Формула, которую можно вычислить на салфетке
Потребление памяти языковой моделью пропорционально количеству её параметров и тому, в каком формате хранятся веса. Базовая формула:
VRAM ≈ (количество параметров × бит на вес) / 8
Результат получается в гигабайтах. На полной 16-битной точности (FP16) модель на 7 миллиардов параметров съедает около 14 гигабайт — и это только веса, без учёта контекста и служебных буферов. Именно поэтому практически все, кто запускает модели локально, используют квантизацию — сжатие весов до 8, 4 или даже 3 бит с небольшой потерей качества.
Квантизация — не побочная оптимизация, а фундаментальная причина, по которой локальный ИИ вообще стал возможен на потребительском железе. Формат GGUF с 4-битной квантизацией (Q4) стал де-факто стандартом для локального вывода, и именно от него стоит отталкиваться.
Вот как меняются аппетиты одной и той же 7B-модели в зависимости от точности:
- FP16 (16 бит): ~14 ГБ — не влезает на большинство потребительских карт
- Q8 (8 бит): ~7 ГБ — почти без потерь
- Q6 (6 бит): ~5,5 ГБ — очень хорошее качество
- Q4 (4 бит): ~4 ГБ — золотая середина
- Q3 (3 бит): ~3 ГБ — заметные артефакты
Каждый шаг вниз примерно вдвое экономит память, прибавляя немного ошибок квантизации. Порог Q4 — это компромисс, который сообщество признало оптимальным: модель влезает в mainstream-карты, а разницу с оригиналом большинство пользователей не замечает в повседневных задачах. Опускаться ниже стоит только в том случае, если альтернатива — не запускать модель вообще.
Реальные объёмы: сколько весит популярная модель
Формула — хорошо, но нужны конкретные цифры. Вот что происходит с популярными моделями при 4-битной квантизации (Q4):
- Llama 3 7B: ~4 ГБ на веса, ~5–6 ГБ реальный расход с контекстом
- Mistral 7B: ~4,8 ГБ на веса, ~6 ГБ с контекстом
- Qwen 3 14B: ~8 ГБ на веса, ~9–10 ГБ с контекстом
- Llama 3 70B: ~40 ГБ на веса, ~44–48 ГБ с контекстом
- Llama 3 405B: 200+ ГБ — нужны несколько GPU или сервер
Столбец «реальный расход» важнее, чем сухие веса. Контекстное окно, KV-кеш и сам рантайм живут в той же памяти. Модель на 70 миллиардов параметров при Q4 занимает около 40 ГБ весами, и ещё несколько гигабайт уходит на разумное контекстное окно — именно поэтому 70B на одной карте с 24 ГБ запускается неудобно, разве что с агрессивной квантизацией и коротким контекстом.
Аппаратный ландшафт 2026 года
Текущий потребительский флагман NVIDIA — RTX 5090 с 32 ГБ видеопамяти GDDR7 и пропускной способностью 1792 ГБ/с. Эти 32 гигабайта — водораздел: они спокойно вмещают модели на 7B, 14B и даже 32B при Q4, но 70B влезает только при Q3 или меньше. Для 70B на Q4 нужны либо две карты, либо workstation-решение.
Ещё один популярный путь — унифицированная память. Apple Mac Studio на M5 Ultra оснащается до 192 ГБ общей памяти между CPU и GPU, что позволяет запускать модели на 120+ миллиардов параметров — с такой задачей дискретная видеокарта не справится. Компромисс — пропускная способность: 819 ГБ/с у M5 Ultra против 1792 ГБ/с у RTX 5090, что напрямую ограничивает скорость генерации токенов.
Несколько конкретных вариантов:
- RTX 4060 Ti (8 ГБ): хватает для 7B при Q4
- RTX 4090 (24 ГБ): подходит для 14B–32B при Q4, 70B при Q3
- RTX 5090 (32 ГБ): 32B при Q4, 70B при Q3
- Mac Studio M5 Ultra (192 ГБ унифицированной): 70B–120B+ без ухищрений
Для моделей крупнее 70B есть два практических пути. Первый — мульти-GPU: две RTX 4090 дают 48 ГБ совокупной видеопамяти, чего хватает на 70B при Q4, но это требует поддержки на уровне материнской платы, мощного блока питания и рантайма вроде vLLM, умеющего разбивать модель между картами. Второй — десктопные ИИ-станции вроде NVIDIA DGX Spark с 128 ГБ унифицированной памяти за $4699. Каждый путь — это своя комбинация денег, сложности и скорости.
Почему контекст пожирает видеопамять
Практически каждое руководство говорит вам размер весов — и на этом успокаивается. Но причина, по которой ваш план «40 гигабайт на 70B» рассыпается на практике, — это KV-кеш. Это память, которую модель использует, чтобы помнить всё сказанное ранее в процессе генерации. Каждый токен в вашем запросе и каждый токен, который модель уже сгенерировала, хранятся в этом кеше, масштабируясь на количество слоёв внимания и головок.
KV-кеш — причина, по которой полезный объём VRAM уменьшается по мере развития разговора. Короткий запрос к 7B-модели может занять 1–2 ГБ кеша; длинный RAG-документ или многоходовой диалог — 4–8 ГБ и более. Размер кеша примерно пропорционален произведению длины контекста на размер модели, поэтому одна и та же модель чувствует себя «нормально» при контексте в 2K токенов и вдруг падает с ошибкой нехватки памяти при 32K.
Из этого рождается правило, которое большинство осваивает на собственном горьком опыте: модель влезает, а ваш диалог — нет. Планируя VRAM, сначала определите бюджет на контекст, а потом прибавьте его к размеру весов.
Как проверить реальное потребление
Теория даёт приблизительное представление; измерение — точный ответ. Как только модель запущена, можно убедиться, сколько памяти она на самом деле использует, не доверяя маркетинговым цифрам. Инструменты для этого бесплатны и встроены в операционную систему.
На Windows откройте Диспетчер задач, вкладка «Производительность» → «GPU». Там вы увидите «Выделенная память GPU» — это и есть ваша VRAM. Запустите модель, начните диалог и наблюдайте, как число растёт по мере увеличения промпта. Разница между показаниями в простое и под нагрузкой — реальный след модели, и она будет расти по мере заполнения контекстного окна.
На Linux задачу решают консольные утилиты. Команда nvidia-smi показывает распределение памяти по процессам для карт NVIDIA, а rocm-smi и radeontop — для AMD.
Практический смысл измерений в том, что рекламные цифры и реальные почти никогда не совпадают. «4-битная 7B» модель теоретически весит 4 ГБ, но запущенный процесс стабильно держит 5–6 ГБ после учёта токенизатора, буферов рантайма и нормального диалога. Знать реальный потолок, а не теоретический, — вот что превращает «должно влезть» в «влезает». Если вы оказались на грани, рычаги те же: перейти на более сильную квантизацию, укоротить контекст или выгрузить часть слоёв в оперативную память.
Пример расчёта: 70B на салфетке
Давайте посчитаем для 70-миллиардной модели при Q4 — именно этот случай вызывает больше всего путаницы.
Сначала веса: 70 × 4 / 8 = 35 ГБ. Только веса, безо всего прочего. Добавьте несколько гигабайт на KV-кеш при умеренном контекстном окне, накиньте накладные расходы рантайма — и вы на 40–44 ГБ. Против 32 ГБ у RTX 5090 модель не влезает. Реальные варианты: Q3 (меньше, но с потерей качества) или выгрузка слоёв в оперативную память (CPU offloading), когда часть модели хранится в RAM и активные слои подкачиваются через GPU.
Для 7B при Q4 та же формула даёт ~4 ГБ весов. С контекстом и накладными расходами — карта с 8 ГБ (RTX 4060 Ti) справляется без проблем. Поэтому 7B-модели — золотая середина для бюджетных локальных установок.
Пошаговый алгоритм: запустится или нет?
Представим реальную задачу: вы хотите запустить 32-миллиардную модель для локального кодинга с контекстным окном в 16K токенов и ограниченным бюджетом.
Шаг 1 — посчитать веса. При Q4: 32 × 4 / 8 = 16 ГБ. Уже исключены все карты с 8 ГБ и большинство 12-гигабайтных.
Шаг 2 — заложить контекст. 16K токенов на 32B-модели — примерно 3–5 ГБ KV-кеша плюс накладные расходы рантайма. Итого: 20–24 ГБ.
Шаг 3 — сопоставить с железом. RTX 4090 (24 ГБ) вмещает это при Q4 с умеренным контекстом. RTX 4060 Ti (8 ГБ) не подходит даже близко. Mac Studio M5 Ultra (192 ГБ) вмещает с запасом, но его пропускная способность 819 ГБ/с ограничивает скорость генерации ниже, чем у RTX 4090 с её 1008 ГБ/с.
Шаг 4 — оценить экономику. Прежде чем тратиться, стоит прикинуть: если вы используете 32B-модель дважды в месяц, облачные API-токены обойдутся дешевле, чем видеокарта за $1500. Локальное железо окупается только при регулярном использовании.
Эти четыре шага — веса, контекст, железо, экономика — весь навык ответа на вопрос «потянет ли?» для любой модели, которая появится в будущем.
Практические советы по выбору видеокарты
-
Определите реальное ограничение до покупки. Если нужны 7B-модели, хватит 8 ГБ. Если 32B и выше — вы уже в диапазоне 24–32 ГБ.
-
Не верьте цифрам «только веса». Рекламируемый объём VRAM часто учитывает лишь веса модели. Планируйте +2–6 ГБ на контекст и накладные расходы.
-
Квантизация — ваш союзник, не костыль. Q4 — оптимальный баланс качества и размера для большинства локальных сценариев. Q3 вмещает более крупные модели, но потеря качества заметна на сложных рассуждениях.
-
VRAM определяет, влезет ли модель. Пропускная способность — как быстро она будет работать. Модель на 120B в огромном унифицированном кеше Mac запускается медленнее, чем 7B на быстрой игровой карте. Модель, которую вы можете вместить — не то же самое, что модель, с которой комфортно работать.
-
Тестируйте, прежде чем покупать. Скачайте GGUF-файл, измерьте реальную скорость в токенах в секунду с вашим реальным контекстом, и только потом принимайте решение о покупке карты подороже.
-
Когда GPU НЕ нужен: если нагрузка эпизодическая и объём небольшой, облачные API обойдутся дешевле. Локальное железо окупается при интенсивном ежедневном использовании.
Ограничения и крайние случаи
Формула VRAM — полезная эвристика, а не точный оракул. Реальное потребление варьируется в зависимости от длины контекста, размера батча, поведения KV-кеша и конкретного рантайма (llama.cpp, MLX, vLLM управляют памятью по-разному). Столбец «реальный расход с контекстом» предполагает умеренное контекстное окно; тяжёлые RAG-сценарии с большими контекстами могут добавить 5–10 ГБ сверх табличных значений.
CPU offloading размывает границу ещё сильнее — модель формально «работает», частично подкачиваясь из оперативной памяти, но с существенной потерей скорости. А системы с унифицированной памятью (Apple Silicon, DGX Spark) используют другую модель памяти, где весь объём системной RAM доступен GPU, и вся арифметика меняется.
Короткие ответы на частые вопросы
Сколько VRAM нужно для 7B? Около 4 ГБ на веса при Q4, плюс 1–2 ГБ на контекст и накладные расходы. Карта с 8 ГБ — комфортный минимум.
Сколько нужно для 70B? Около 35 ГБ при Q4, итого 40–44 ГБ с контекстом. Это больше, чем 32 ГБ у RTX 5090, поэтому на Q4 нужны две карты, workstation-GPU или Mac с большим объёмом унифицированной памяти.
Можно ли запустить 70B на 24 ГБ? Только при Q3 или с выгрузкой в оперативную память. Q4 70B требует больше 24 ГБ; придётся жертвовать качеством или скоростью.
Больше VRAM = быстрее? Нет. VRAM определяет, влезет ли модель; пропускная способность — насколько быстро она генерирует. Mac с огромной памятью может быть медленнее игровой карты с маленькой моделью из-за разницы в пропускной способности.
Хватит ли 32 ГБ на всё в 2026 году? На реалистичный потребительский набор — да: до 32B при Q4 и 70B при Q3. Для 70B при Q4 и моделей класса 120B нужны две карты, workstation или унифицированная память на 96–192 ГБ.