17.08.2026 456 материалов

VIDRAFT побеждает в соревновании по скорости инференса Gemma-4: 510 TPS на одном GPU

Компания VIDRAFT заняла первое место в конкурсе "The First Gemma Challenge", показав 510.58 токенов в секунду на модели Gemma-4 с одним GPU NVIDIA A10G. Ключ к победе — не в железе, а в тонкой настройке программных параметров.

VIDRAFT побеждает в соревновании по скорости инференса Gemma-4: 510 TPS на одном GPU

Скорость без контроля качества — это просто быстрый мусор. VIDRAFT доказала, что правильная оптимизация инференса может дать и скорость, и сохранение смысла.

Соревнование, где важны были не только мегагерцы

"The First Gemma Challenge" — конкурс инженеров, где участники должны были разогнать инференс языковой модели google/gemma-4-E4B-it на фиксированном оборудовании: одной видеокарте NVIDIA A10G. Менять модель или ставить более мощное железо было нельзя. Единственный рычаг — программная оптимизация.

Организаторы выставили два жестких критерия. Первый — скорость генерации в токенах в секунду (TPS). Второй, и это важно, — качество текста. Оно измерялось метрикой Perplexity (PPL), и порог был около 2.42. Если модель генерировала текст слишком быстро, но при этом начинала нести чепуху (PPL росла выше порога), результат дисквалифицировали. Более того, финальную проверку проводили вслепую, на наборе данных, который участники никогда не видели.

VIDRAFT показала 510.58 TPS при PPL 2.3930 и прошла все проверки. Главный конкурент выдал впечатляющие 535.91 TPS, но его PPL оказался около 2.44 — за пределами допустимого. Поэтому победителем стал именно VIDRAFT с меньшей, но подтвержденной скоростью.

Три столпа победы: окно, ядра и разогрев

Публичная конфигурация VIDRAFT раскрывает три ключевых направления оптимизации.

Сужение окна внимания (Sliding Window Attention). Параметр SLIDING_WINDOW=188. При генерации текста токен за токеном основным узким местом становится память для хранения контекста (KV-cache). Ограничивая окно внимания последними 188 токенами, VIDRAFT снизила нагрузку на память и ускорила генерацию. Число 188 — не круглое, что указывает на имперический подбор: слишком маленькое окно ухудшает качество, слишком большое — не дает нужного прироста скорости.

Тонкая настройка ядра (Centroid Top-K). Параметр CENTROID_TOP_K=49. Эта настройка работает на уровне вычислительного ядра и влияет и на скорость, и на качество. Команда перебирала значения (44, 48, 49), ища максимальное, при котором PPL оставалась в рамках. Это классический поиск Парето-оптимума под ограничением качества.

Дисциплина разогрева (Warm-up). Параметры WARMUP_BRIDGE=1, WARMUP_NUM_PROMPTS=64 и другие. Перед официальным замером система прогоняла 64 коротких тестовых запроса. Это позволило «прогреть» CUDA и JIT-компилятор до начала отсчета времени. По оценкам, один разогрев давал выигрыш около 15 TPS — в соревновании, где участников разделяли десятки токенов, это значительный запас.

Интересно, что VIDRAFT отключили флаг PRECACHE_BENCH, который мог бы исказить результат в их пользу. Они выбирали прозрачность: меряли то же самое, что видели бы судьи.

Спекулятивное декодирование и другие хитрости

Отдельного внимания заслуживает техника спекулятивного декодирования (SPECULATIVE_CONFIG, method=mtp, num_speculative_tokens=7). Суть в том, что маленькая, быстрая модель-«черновик» предсказывает несколько токенов вперед, а основная модель проверяет их одним проходом. Если предсказания верны, система генерирует сразу несколько токенов за шаг, не жертвуя качеством. Это одна из современных техник ускорения инференса LLM.

Другие выставленные параметры, вроде MAX_MODEL_LEN=4096 и GPU_MEMORY_UTILIZATION=0.90, более стандартны и отражают тщательный баланс между использованием видеопамяти и стабильностью работы.

Что это значит на практике

Эта победа — не просто запись в таблице лидеров. Она демонстрирует важный для индустрии принцип: на уже существующем и не самом новом оборудовании (A10G — карта не топового класса) можно добиться выдающейся производительности за счет грамотного софта.

Конкретные числа вроде 188 или 49 не стоит копировать напрямую — они подобраны именно под модель Gemma-4-E4B-it и именно под A10G. Но подход — качественно-ограниченный поиск параметров, изоляция разогрева от замера, использование спекулятивного декодирования — это общий инструментарий инженера по инференсу, который применим к другим моделям и картам.

VIDRAFT не раскрыла все свои инструменты публично, поэтому воспроизвести результат полностью пока нельзя. Но сам факт, что публичная часть конфигурации настолько подробна, уже задает тон для инженерного сообщества.

Формула скорости: качество как ограничитель

Победа VIDRAFT в "The First Gemma Challenge" — пример того, как важны детали в мире оптимизации инференса. Конкурент, показавший более высокую скорость, проиграл, потому что его модель стала хуже генерировать текст. VIDRAFT же нашла золотую серию настроек, где скорость и качество удерживались в равновесии. В эпоху, когда компании пытаются запускать LLM на минимальном и дешевом оборудовании, такой опыт бесценен.