17.08.2026 456 материалов

Сколько видеопамяти нужно для запуска языковых моделей локально: полный расклад на 2026 год

Запуск больших языковых моделей на своём железе — вопрос не «можно ли», а «сколько видеопамяти хватит». Разбираем реальные цифры, подводные камни квантизации и ассортимент видеокарт 2026 года.

Сколько видеопамяти нужно для запуска языковых моделей локально: полный расклад на 2026 год

Модель либо влезает в видеопамять, либо нет — и формула для проверки помещается на салфетку. Весь вопрос в том, хватит ли вам места ещё и на разговор.

Каждый геймер уже знает это чувство

Если вы когда-нибудь играли в тяжёлые игры на слабой видеокарте, вы знаете этот момент: открываешь страницу в Steam, смотришь системные требования и задерживаешь дыхание. «Потянет?» Локальный ИИ унаследовал ту же тревогу, только вместо шейдеров и тактовой частоты главный вопрос свёлся к одной метрике: объём видеопамяти (VRAM).

Когда вы читаете, что «модель на 70 миллиардов параметров запускается локально», за кулисами всегда стоит невысказанный вопрос — а влезет ли она в вашу видеокарту? Хорошая новость: математика здесь проще, чем в игровой индустрии. Производительность игр зависит от драйверов, разрешения, сложности сцены и десятков переменных. С LLM всё однозначнее: модель занимает определённый объём памяти, и вы можете посчитать его заранее.

Формула, которую можно вычислить на салфетке

Потребление памяти языковой моделью пропорционально количеству её параметров и тому, в каком формате хранятся веса. Базовая формула:

VRAM ≈ (количество параметров × бит на вес) / 8

Результат получается в гигабайтах. На полной 16-битной точности (FP16) модель на 7 миллиардов параметров съедает около 14 гигабайт — и это только веса, без учёта контекста и служебных буферов. Именно поэтому практически все, кто запускает модели локально, используют квантизацию — сжатие весов до 8, 4 или даже 3 бит с небольшой потерей качества.

Квантизация — не побочная оптимизация, а фундаментальная причина, по которой локальный ИИ вообще стал возможен на потребительском железе. Формат GGUF с 4-битной квантизацией (Q4) стал де-факто стандартом для локального вывода, и именно от него стоит отталкиваться.

Вот как меняются аппетиты одной и той же 7B-модели в зависимости от точности:

  • FP16 (16 бит): ~14 ГБ — не влезает на большинство потребительских карт
  • Q8 (8 бит): ~7 ГБ — почти без потерь
  • Q6 (6 бит): ~5,5 ГБ — очень хорошее качество
  • Q4 (4 бит): ~4 ГБ — золотая середина
  • Q3 (3 бит): ~3 ГБ — заметные артефакты

Каждый шаг вниз примерно вдвое экономит память, прибавляя немного ошибок квантизации. Порог Q4 — это компромисс, который сообщество признало оптимальным: модель влезает в mainstream-карты, а разницу с оригиналом большинство пользователей не замечает в повседневных задачах. Опускаться ниже стоит только в том случае, если альтернатива — не запускать модель вообще.

Реальные объёмы: сколько весит популярная модель

Формула — хорошо, но нужны конкретные цифры. Вот что происходит с популярными моделями при 4-битной квантизации (Q4):

  • Llama 3 7B: ~4 ГБ на веса, ~5–6 ГБ реальный расход с контекстом
  • Mistral 7B: ~4,8 ГБ на веса, ~6 ГБ с контекстом
  • Qwen 3 14B: ~8 ГБ на веса, ~9–10 ГБ с контекстом
  • Llama 3 70B: ~40 ГБ на веса, ~44–48 ГБ с контекстом
  • Llama 3 405B: 200+ ГБ — нужны несколько GPU или сервер

Столбец «реальный расход» важнее, чем сухие веса. Контекстное окно, KV-кеш и сам рантайм живут в той же памяти. Модель на 70 миллиардов параметров при Q4 занимает около 40 ГБ весами, и ещё несколько гигабайт уходит на разумное контекстное окно — именно поэтому 70B на одной карте с 24 ГБ запускается неудобно, разве что с агрессивной квантизацией и коротким контекстом.

Аппаратный ландшафт 2026 года

Текущий потребительский флагман NVIDIA — RTX 5090 с 32 ГБ видеопамяти GDDR7 и пропускной способностью 1792 ГБ/с. Эти 32 гигабайта — водораздел: они спокойно вмещают модели на 7B, 14B и даже 32B при Q4, но 70B влезает только при Q3 или меньше. Для 70B на Q4 нужны либо две карты, либо workstation-решение.

Ещё один популярный путь — унифицированная память. Apple Mac Studio на M5 Ultra оснащается до 192 ГБ общей памяти между CPU и GPU, что позволяет запускать модели на 120+ миллиардов параметров — с такой задачей дискретная видеокарта не справится. Компромисс — пропускная способность: 819 ГБ/с у M5 Ultra против 1792 ГБ/с у RTX 5090, что напрямую ограничивает скорость генерации токенов.

Несколько конкретных вариантов:

  • RTX 4060 Ti (8 ГБ): хватает для 7B при Q4
  • RTX 4090 (24 ГБ): подходит для 14B–32B при Q4, 70B при Q3
  • RTX 5090 (32 ГБ): 32B при Q4, 70B при Q3
  • Mac Studio M5 Ultra (192 ГБ унифицированной): 70B–120B+ без ухищрений

Для моделей крупнее 70B есть два практических пути. Первый — мульти-GPU: две RTX 4090 дают 48 ГБ совокупной видеопамяти, чего хватает на 70B при Q4, но это требует поддержки на уровне материнской платы, мощного блока питания и рантайма вроде vLLM, умеющего разбивать модель между картами. Второй — десктопные ИИ-станции вроде NVIDIA DGX Spark с 128 ГБ унифицированной памяти за $4699. Каждый путь — это своя комбинация денег, сложности и скорости.

Почему контекст пожирает видеопамять

Практически каждое руководство говорит вам размер весов — и на этом успокаивается. Но причина, по которой ваш план «40 гигабайт на 70B» рассыпается на практике, — это KV-кеш. Это память, которую модель использует, чтобы помнить всё сказанное ранее в процессе генерации. Каждый токен в вашем запросе и каждый токен, который модель уже сгенерировала, хранятся в этом кеше, масштабируясь на количество слоёв внимания и головок.

KV-кеш — причина, по которой полезный объём VRAM уменьшается по мере развития разговора. Короткий запрос к 7B-модели может занять 1–2 ГБ кеша; длинный RAG-документ или многоходовой диалог — 4–8 ГБ и более. Размер кеша примерно пропорционален произведению длины контекста на размер модели, поэтому одна и та же модель чувствует себя «нормально» при контексте в 2K токенов и вдруг падает с ошибкой нехватки памяти при 32K.

Из этого рождается правило, которое большинство осваивает на собственном горьком опыте: модель влезает, а ваш диалог — нет. Планируя VRAM, сначала определите бюджет на контекст, а потом прибавьте его к размеру весов.

Как проверить реальное потребление

Теория даёт приблизительное представление; измерение — точный ответ. Как только модель запущена, можно убедиться, сколько памяти она на самом деле использует, не доверяя маркетинговым цифрам. Инструменты для этого бесплатны и встроены в операционную систему.

На Windows откройте Диспетчер задач, вкладка «Производительность» → «GPU». Там вы увидите «Выделенная память GPU» — это и есть ваша VRAM. Запустите модель, начните диалог и наблюдайте, как число растёт по мере увеличения промпта. Разница между показаниями в простое и под нагрузкой — реальный след модели, и она будет расти по мере заполнения контекстного окна.

На Linux задачу решают консольные утилиты. Команда nvidia-smi показывает распределение памяти по процессам для карт NVIDIA, а rocm-smi и radeontop — для AMD.

Практический смысл измерений в том, что рекламные цифры и реальные почти никогда не совпадают. «4-битная 7B» модель теоретически весит 4 ГБ, но запущенный процесс стабильно держит 5–6 ГБ после учёта токенизатора, буферов рантайма и нормального диалога. Знать реальный потолок, а не теоретический, — вот что превращает «должно влезть» в «влезает». Если вы оказались на грани, рычаги те же: перейти на более сильную квантизацию, укоротить контекст или выгрузить часть слоёв в оперативную память.

Пример расчёта: 70B на салфетке

Давайте посчитаем для 70-миллиардной модели при Q4 — именно этот случай вызывает больше всего путаницы.

Сначала веса: 70 × 4 / 8 = 35 ГБ. Только веса, безо всего прочего. Добавьте несколько гигабайт на KV-кеш при умеренном контекстном окне, накиньте накладные расходы рантайма — и вы на 40–44 ГБ. Против 32 ГБ у RTX 5090 модель не влезает. Реальные варианты: Q3 (меньше, но с потерей качества) или выгрузка слоёв в оперативную память (CPU offloading), когда часть модели хранится в RAM и активные слои подкачиваются через GPU.

Для 7B при Q4 та же формула даёт ~4 ГБ весов. С контекстом и накладными расходами — карта с 8 ГБ (RTX 4060 Ti) справляется без проблем. Поэтому 7B-модели — золотая середина для бюджетных локальных установок.

Пошаговый алгоритм: запустится или нет?

Представим реальную задачу: вы хотите запустить 32-миллиардную модель для локального кодинга с контекстным окном в 16K токенов и ограниченным бюджетом.

Шаг 1 — посчитать веса. При Q4: 32 × 4 / 8 = 16 ГБ. Уже исключены все карты с 8 ГБ и большинство 12-гигабайтных.

Шаг 2 — заложить контекст. 16K токенов на 32B-модели — примерно 3–5 ГБ KV-кеша плюс накладные расходы рантайма. Итого: 20–24 ГБ.

Шаг 3 — сопоставить с железом. RTX 4090 (24 ГБ) вмещает это при Q4 с умеренным контекстом. RTX 4060 Ti (8 ГБ) не подходит даже близко. Mac Studio M5 Ultra (192 ГБ) вмещает с запасом, но его пропускная способность 819 ГБ/с ограничивает скорость генерации ниже, чем у RTX 4090 с её 1008 ГБ/с.

Шаг 4 — оценить экономику. Прежде чем тратиться, стоит прикинуть: если вы используете 32B-модель дважды в месяц, облачные API-токены обойдутся дешевле, чем видеокарта за $1500. Локальное железо окупается только при регулярном использовании.

Эти четыре шага — веса, контекст, железо, экономика — весь навык ответа на вопрос «потянет ли?» для любой модели, которая появится в будущем.

Практические советы по выбору видеокарты

  • Определите реальное ограничение до покупки. Если нужны 7B-модели, хватит 8 ГБ. Если 32B и выше — вы уже в диапазоне 24–32 ГБ.

  • Не верьте цифрам «только веса». Рекламируемый объём VRAM часто учитывает лишь веса модели. Планируйте +2–6 ГБ на контекст и накладные расходы.

  • Квантизация — ваш союзник, не костыль. Q4 — оптимальный баланс качества и размера для большинства локальных сценариев. Q3 вмещает более крупные модели, но потеря качества заметна на сложных рассуждениях.

  • VRAM определяет, влезет ли модель. Пропускная способность — как быстро она будет работать. Модель на 120B в огромном унифицированном кеше Mac запускается медленнее, чем 7B на быстрой игровой карте. Модель, которую вы можете вместить — не то же самое, что модель, с которой комфортно работать.

  • Тестируйте, прежде чем покупать. Скачайте GGUF-файл, измерьте реальную скорость в токенах в секунду с вашим реальным контекстом, и только потом принимайте решение о покупке карты подороже.

  • Когда GPU НЕ нужен: если нагрузка эпизодическая и объём небольшой, облачные API обойдутся дешевле. Локальное железо окупается при интенсивном ежедневном использовании.

Ограничения и крайние случаи

Формула VRAM — полезная эвристика, а не точный оракул. Реальное потребление варьируется в зависимости от длины контекста, размера батча, поведения KV-кеша и конкретного рантайма (llama.cpp, MLX, vLLM управляют памятью по-разному). Столбец «реальный расход с контекстом» предполагает умеренное контекстное окно; тяжёлые RAG-сценарии с большими контекстами могут добавить 5–10 ГБ сверх табличных значений.

CPU offloading размывает границу ещё сильнее — модель формально «работает», частично подкачиваясь из оперативной памяти, но с существенной потерей скорости. А системы с унифицированной памятью (Apple Silicon, DGX Spark) используют другую модель памяти, где весь объём системной RAM доступен GPU, и вся арифметика меняется.

Короткие ответы на частые вопросы

Сколько VRAM нужно для 7B? Около 4 ГБ на веса при Q4, плюс 1–2 ГБ на контекст и накладные расходы. Карта с 8 ГБ — комфортный минимум.

Сколько нужно для 70B? Около 35 ГБ при Q4, итого 40–44 ГБ с контекстом. Это больше, чем 32 ГБ у RTX 5090, поэтому на Q4 нужны две карты, workstation-GPU или Mac с большим объёмом унифицированной памяти.

Можно ли запустить 70B на 24 ГБ? Только при Q3 или с выгрузкой в оперативную память. Q4 70B требует больше 24 ГБ; придётся жертвовать качеством или скоростью.

Больше VRAM = быстрее? Нет. VRAM определяет, влезет ли модель; пропускная способность — насколько быстро она генерирует. Mac с огромной памятью может быть медленнее игровой карты с маленькой моделью из-за разницы в пропускной способности.

Хватит ли 32 ГБ на всё в 2026 году? На реалистичный потребительский набор — да: до 32B при Q4 и 70B при Q3. Для 70B при Q4 и моделей класса 120B нужны две карты, workstation или унифицированная память на 96–192 ГБ.