Корейский стартап VIDRAFT заявил о пяти рекордах на бенчмарках с моделью Darwin-180B-RSI
Корейский стартап VIDRAFT представил модель Darwin-180B-RSI на 180 млрд параметров с архитектурой MoE и техникой рекурсивного самоулучшения, заявив первые места на пяти лидербордах Hugging Face. Проверяем, насколько обоснованы эти амбициозные претензии.
Совершенные результаты на математических олимпиадах от стартапа, о котором до недавнего времени мало кто слышал, — это повод не для восторга, а для здорового скепсиса. Данные пока только от самого разработчика.
Что произошло
Корейский AI-стартап VIDRAFT (он же GeniGenAI) объявил о выпуске модели Darwin-180B-RSI — открытой языковой модели с рекурсивным самоулучшением (Recursive Self-Improvement, RSI). Компания утверждает, что модель заняла первое место на пяти официальных лидербордах Hugging Face в области математики, естественных наук и мультимодального рассуждения.
Архитектура и технические характеристики
Darwin-180B-RSI построена на базе Qwen3.8-Flash-Next и использует архитектуру «смесь экспертов» (Mixture-of-Experts, MoE):
- 180 млрд параметров суммарно, 512 экспертов в сети
- На каждый запрос активируется только 10 из 512 экспертов — это стандартный для MoE-архитектур приём, позволяющий держать огромное число параметров, но считать только малую их долю при каждом токене
- Контекстное окно — около 260 000 токенов
- Модель не обучена с нуля, а создана через избирательное слияние моделей (selective model merging) на основе существующих чекпоинтов
Архитектурно здесь нет ничего революционного — MoE с разреженной активацией давно используется в Mixtral, DeepSeek-MoE и других моделях. Смысл в том, что при 180B параметрах вычислительная нагрузка при инференсе значительно ниже, чем у полносвязной (dense) модели аналогичного размера.
Технология рекурсивного самоулучшения
Главный маркетинговый козырь VIDRAFT — так называемое рекурсивное самоулучшение. Концептуально пайплайн выглядит так:
- Модель генерирует решения задач на рассуждение
- Решения автоматически проверяются по эталонным ответам (ground truth)
- Сохраняются только верные решения, которые используются для переобучения модели на следующей итерации
- Цикл повторяется
По сути, это вариация на тему rejection sampling fine-tuning и outcome-reward обучения (в духе STaR или GRPO). Подход работает хорошо в доменах с автоматически верифицируемыми ответами — математика, формальные науки. Ключевые детали реализации: количество итераций, критерии фильтрации, метод вознаграждения — не раскрыты.
Заявленные результаты на бенчмарках
VIDRAFT сообщает следующие результаты:
- AIME 2026 — 100% (идеальный результат)
- HMMT 2026 — 100% (идеальный результат)
- GPQA Diamond — 94,44%
- MMLU-Pro — 88,12%
- MMMU-Pro — 79,48%
Идеальные баллы на престижных математических олимпиадах — это экстраординарное заявление. Если оно подтвердится независимой проверкой, это действительно значимый результат. Но на данный момент все цифры — исключительно от самого VIDRAFT.
Что стоит за этими цифрами
Здесь нужно отнестись критически — и вот почему.
Источник новости — публикация на dev.to от аккаунта AI OpenFree, который ведёт из 41 (!) части состоящую серию материалов о VIDRAFT. Это не независимое журналистское расследование, а скорее последовательная агрегация пресс-релизов одной компании. Формат публикации — типичный для dev.to технический пост, не рецензированная статья и не результат независимого тестирования.
Нет независимой валидации. Ни одна сторонняя организация не подтвердила заявленные результаты. В мире AI бенчмарков это критически важный момент: модели легко оптимизировать под конкретные тестовые наборы данных, и даже без прямого «затачивания» модель, обученная на данных, пересекающихся с бенчмарком, может показывать завышенные результаты.
Детали RSI не раскрыты. Без информации о количестве итераций, размере обучающей выборки на каждом шаге, методе фильтрации и критериях верификации невозможно оценить, действительно ли рекурсивное самоулучшение даёт преимущество или это маркетинговая обёртка вокруг стандартного fine-tuning.
Контекст: VIDRAFT за последнее время выпустил множество продуктов — от on-device моделей до платформы обнаружения лекарств и системы аудита причинности. Для стартапа такой масштаб деятельности вызывает вопрос: речь идёт о реальном технологическом лидерстве или о PR-стратегии, нацеленной на привлечение государственных грантов и партнёрств в Корее?
Практические последствия
Если вы инженер или исследователь, который рассматривает Darwin-180B-RSI для своих задач, имеет смысл:
-
Дождаться независимых тестов. Официальные результаты на лидербордах Hugging Face — это одно, но реальная ценность модели определяется на собственных отложенных выборках. Подождите, пока модель проверят крупные независимые бенчмарки вроде LMSYS Chatbot Arena или специализированные оценки от исследовательских лабораторий.
-
Учесть стоимость развёртывания. Несмотря на разреженную активацию (10 из 512 экспертов), все 180 млрд параметров нужно где-то хранить. Для полной загрузки модели потребуется существенная видеопамять — квантизация и offloading будут необходимы для большинства конфигураций.
-
Оценить домен. Заявленные результаты сосредоточены на задачах с чёткими ответами (математика, естественные науки). RSI-подход с автоматической верификацией хуже переносится на задачи открытого типа — написание текста, диалоги, творческие задачи — где «правильного» ответа не существует.
Итог
Darwin-180B-RSI выглядит как амбициозный проект с интересной архитектурой, но к заявленным результатам стоит отнестись с осторожностью. Совершенные баллы на математических олимпиадах от относительно малоизвестного стартапа — это именно тот случай, когда хочется сначала увидеть независимое подтверждение, а потом уже строить выводы. Технология рекурсивного самоулучшения в теории перспективна, но без опубликованных деталей реализации и независимого воспроизведения она остаётся маркетинговым заявлением, а не научным фактом.