30.09.2026 721 материалов

Корейский стартап VIDRAFT заявил о пяти рекордах на бенчмарках с моделью Darwin-180B-RSI

Корейский стартап VIDRAFT представил модель Darwin-180B-RSI на 180 млрд параметров с архитектурой MoE и техникой рекурсивного самоулучшения, заявив первые места на пяти лидербордах Hugging Face. Проверяем, насколько обоснованы эти амбициозные претензии.

Корейский стартап VIDRAFT заявил о пяти рекордах на бенчмарках с моделью Darwin-180B-RSI

Совершенные результаты на математических олимпиадах от стартапа, о котором до недавнего времени мало кто слышал, — это повод не для восторга, а для здорового скепсиса. Данные пока только от самого разработчика.

Что произошло

Корейский AI-стартап VIDRAFT (он же GeniGenAI) объявил о выпуске модели Darwin-180B-RSI — открытой языковой модели с рекурсивным самоулучшением (Recursive Self-Improvement, RSI). Компания утверждает, что модель заняла первое место на пяти официальных лидербордах Hugging Face в области математики, естественных наук и мультимодального рассуждения.

Архитектура и технические характеристики

Darwin-180B-RSI построена на базе Qwen3.8-Flash-Next и использует архитектуру «смесь экспертов» (Mixture-of-Experts, MoE):

  • 180 млрд параметров суммарно, 512 экспертов в сети
  • На каждый запрос активируется только 10 из 512 экспертов — это стандартный для MoE-архитектур приём, позволяющий держать огромное число параметров, но считать только малую их долю при каждом токене
  • Контекстное окно — около 260 000 токенов
  • Модель не обучена с нуля, а создана через избирательное слияние моделей (selective model merging) на основе существующих чекпоинтов

Архитектурно здесь нет ничего революционного — MoE с разреженной активацией давно используется в Mixtral, DeepSeek-MoE и других моделях. Смысл в том, что при 180B параметрах вычислительная нагрузка при инференсе значительно ниже, чем у полносвязной (dense) модели аналогичного размера.

Технология рекурсивного самоулучшения

Главный маркетинговый козырь VIDRAFT — так называемое рекурсивное самоулучшение. Концептуально пайплайн выглядит так:

  1. Модель генерирует решения задач на рассуждение
  2. Решения автоматически проверяются по эталонным ответам (ground truth)
  3. Сохраняются только верные решения, которые используются для переобучения модели на следующей итерации
  4. Цикл повторяется

По сути, это вариация на тему rejection sampling fine-tuning и outcome-reward обучения (в духе STaR или GRPO). Подход работает хорошо в доменах с автоматически верифицируемыми ответами — математика, формальные науки. Ключевые детали реализации: количество итераций, критерии фильтрации, метод вознаграждения — не раскрыты.

Заявленные результаты на бенчмарках

VIDRAFT сообщает следующие результаты:

  • AIME 2026 — 100% (идеальный результат)
  • HMMT 2026 — 100% (идеальный результат)
  • GPQA Diamond — 94,44%
  • MMLU-Pro — 88,12%
  • MMMU-Pro — 79,48%

Идеальные баллы на престижных математических олимпиадах — это экстраординарное заявление. Если оно подтвердится независимой проверкой, это действительно значимый результат. Но на данный момент все цифры — исключительно от самого VIDRAFT.

Что стоит за этими цифрами

Здесь нужно отнестись критически — и вот почему.

Источник новости — публикация на dev.to от аккаунта AI OpenFree, который ведёт из 41 (!) части состоящую серию материалов о VIDRAFT. Это не независимое журналистское расследование, а скорее последовательная агрегация пресс-релизов одной компании. Формат публикации — типичный для dev.to технический пост, не рецензированная статья и не результат независимого тестирования.

Нет независимой валидации. Ни одна сторонняя организация не подтвердила заявленные результаты. В мире AI бенчмарков это критически важный момент: модели легко оптимизировать под конкретные тестовые наборы данных, и даже без прямого «затачивания» модель, обученная на данных, пересекающихся с бенчмарком, может показывать завышенные результаты.

Детали RSI не раскрыты. Без информации о количестве итераций, размере обучающей выборки на каждом шаге, методе фильтрации и критериях верификации невозможно оценить, действительно ли рекурсивное самоулучшение даёт преимущество или это маркетинговая обёртка вокруг стандартного fine-tuning.

Контекст: VIDRAFT за последнее время выпустил множество продуктов — от on-device моделей до платформы обнаружения лекарств и системы аудита причинности. Для стартапа такой масштаб деятельности вызывает вопрос: речь идёт о реальном технологическом лидерстве или о PR-стратегии, нацеленной на привлечение государственных грантов и партнёрств в Корее?

Практические последствия

Если вы инженер или исследователь, который рассматривает Darwin-180B-RSI для своих задач, имеет смысл:

  • Дождаться независимых тестов. Официальные результаты на лидербордах Hugging Face — это одно, но реальная ценность модели определяется на собственных отложенных выборках. Подождите, пока модель проверят крупные независимые бенчмарки вроде LMSYS Chatbot Arena или специализированные оценки от исследовательских лабораторий.

  • Учесть стоимость развёртывания. Несмотря на разреженную активацию (10 из 512 экспертов), все 180 млрд параметров нужно где-то хранить. Для полной загрузки модели потребуется существенная видеопамять — квантизация и offloading будут необходимы для большинства конфигураций.

  • Оценить домен. Заявленные результаты сосредоточены на задачах с чёткими ответами (математика, естественные науки). RSI-подход с автоматической верификацией хуже переносится на задачи открытого типа — написание текста, диалоги, творческие задачи — где «правильного» ответа не существует.

Итог

Darwin-180B-RSI выглядит как амбициозный проект с интересной архитектурой, но к заявленным результатам стоит отнестись с осторожностью. Совершенные баллы на математических олимпиадах от относительно малоизвестного стартапа — это именно тот случай, когда хочется сначала увидеть независимое подтверждение, а потом уже строить выводы. Технология рекурсивного самоулучшения в теории перспективна, но без опубликованных деталей реализации и независимого воспроизведения она остаётся маркетинговым заявлением, а не научным фактом.