DeepSeek представила модель V4.1 Flash и заявляет о превосходстве над Kimi K3 в тестах на кодинг и кибербезопасность
DeepSeek анонсировала модель V4.1 Flash с архитектурой Causal-Encoder-Decoder и смесью экспертов, которая, по заявлению разработчика, обходит Kimi K3 и даже собственную V4 Pro по ряду бенчмарков.
DeepSeek позиционирует V4.1 Flash как доказательство того, что в эпоху дефицита чипов можно делать мощные модели дешевле и быстрее — вопрос в том, насколько независимые тесты подтвердят эти амбиции.
Что произошло
Китайская компания DeepSeek анонсировала выход модели V4.1 Flash — якобы самого лёгкого варианта в новой линейке, но при этом с заявленными результатами, которые превышают показатели не только предыдущего флагмана V4 Pro, но и моделей конкурентов, включая Kimi K3 от Moonshot AI и даже GPT-5.6 Sol от OpenAI.
Модель построена на новой архитектуре Causal-Encoder-Decoder и использует механизм Mixture-of-Experts (MoE). Общее число параметров — 552 миллиарда, однако для обработки каждого конкретного запроса активируется лишь 8 миллиардов параметров на входе и 16 миллиардов на генерации ответа. Это ключевой инженерный трюк: вместо того чтобы прогонять каждый запрос через всю сеть, система направляет задачу только в те подсети, которые лучше всего для неё подходят.
Что заявлено в бенчмарках
DeepSeek приводит результаты на тесте Terminal-Bench 2.1, который оценивает модели на реальных вычислительных задачах:
- V4.1 Flash — 90.6
- GPT-5.6 Sol (OpenAI) — 88.8
- Kimi K3 (Moonshot AI) — 88.3
- V4 Pro (DeepSeek) — 87.9
Также компания утверждает, что V4.1 Flash превосходит предшественницу по задачам на написание кода, тестирование кибербезопасности и выполнение автономных агентных операций. Модель обладает нативной мультимодальной поддержкой — то есть умеет работать с визуальными данными «из коробки», без внешних обёрток.
Важная оговорка
Все приведённые цифры — результаты самой DeepSeek. Независимой верификации на момент публикации нет. Это стандартная ситуация для индустрии: компании традиционно подбирают бенчмарки, на которых их модель выглядит лучше всего, а детали тестирования (условия, версии промптов, конфигурация соперников) не всегда прозрачны. Впрочем, то же самое справедливо для большинства анонсов вроде «наша модель обходит GPT» — такие заголовки давно стали валютой ИИ-индустрии.
Почему это важно
Анонс V4.1 Flash интересен не столько сам по себе, сколько в контексте того, что сейчас происходит на китайском рынке ИИ.
Во-первых, жёсткие экспортные ограничения на передовые чипы — в первую очередь ускорители NVIDIA — заставляют китайских разработчиков искать обходные пути. DeepSeek с самого начала делала ставку на архитектурные оптимизации вместо brute-force наращивания вычислений. MoE-подход — классический пример: вы получаете «ум» огромной модели, но платите за инференс как за маленькую.
Во-вторых, в Китае разворачивается полноценная ценовая война за ИИ. Крупные игроки и стартапы пытаются одновременно снижать стоимость API и повышать качество моделей. Появление Flash-версии — это не просто технический апгрейд, а коммерческий ход: чем дешевле инференс, тем больше клиентов можно привлечь в эпоху, когда каждый юань на вычисления на счету.
В-третьих, DeepSeek, по данным СМИ, готовится к IPO с привлечением CITIC Securities в качестве андеррайтера. В таком контексте каждая новая модель — это не только технологический продукт, но и элемент инвестиционной истории. Заявления о превосходстве над конкурентами на этапе подготовки к размещению — вполне ожидаемый сценарий.
Что это значит на практике
Для конечного пользователя или разработчика, который выбирает модель для своего продукта, главное — не бенчмарки из пресс-релиза, а реальная производительность на конкретных задачах. MoE-архитектура действительно способна существенно снизить задержки и стоимость запросов, но качество ответов сильно зависит от того, насколько хорошо работает маршрутизация между экспертами. На узкоспециализированных задачах модель может блестяще справляться, а на нестандартных запросах — давать сбои, потому что «нужный эксперт» не был задействован.
Мультимодальность «из коробки» — приятное дополнение, но без понимания, на каких именно визуальных задачах модель тестировалась, делать выводы сложно. Отдельная работа с картинками и работа с текстом на одном уровне — это разные вещи.
Итог
DeepSeek делает ставку на эффективность вместо сырой мощности — и в условиях китайского рынка это рациональная стратегия. Заявленные результаты V4.1 Flash выглядят впечатляюще, но требуют независимой проверки. Пока что это скорее сигнал рынку и потенциальным инвесторам: мы умеем делать больше с меньшими ресурсами. Реальную картину покажет только практика — когда модель начнут использовать за пределами контролируемой тестовой среды.