02.08.2026 129 материалов

Thinking Machines выпустила Inkling-Small: почти тот же ИИ, но в четыре раза компактнее

Thinking Machines представила Inkling-Small — мультимодальную модель с открытым исходным кодом, которая по производительности почти не уступает флагману Inkling при четверти размера и активных параметров.

Thinking Machines выпустила Inkling-Small: почти тот же ИИ, но в четыре раза компактнее

Умная модель не та, которая больше — а та, которая умеет использовать нужные знания в нужный момент.

Что произошло

Месяцем ранее Thinking Machines — стартап Мирой Мурати, бывшего технического директора OpenAI — выпустил свою первую открытую модель Inkling на 975 млрд параметров. Теперь компания представила Inkling-Small: 276 млрд параметров, 12 млрд активных при обработке каждого токена. Разница — более чем трёхкратная. А по ряду бенчмарков маленькая модель даже обходит старшую.

Индекс Intelligence Index от Artificial Analysis поставил Inkling-Small на 40 из 100 баллов — тогда как полноразмерная Inkling набрала 41. Разница в один балл. При этом ни одна открытая модель размером с Inkling-Small или меньше не показала результата выше.

Как это работает внутри

Inkling-Small использует архитектуру Mixture-of-Experts. Все 276 млрд параметров распределены по 256 специализированных «экспертов», но при обработке каждого токена задействуются только шесть из них — плюс два общих эксперта, которые работают всегда. Итого 12 млрд активных параметров на шаг. Модель «помнит» больше, чем использует одновременно.

Модель мультимодальна: принимает текст, изображения и аудио, выдаёт текст, поддерживает контекст до миллиона токенов. Входные данные разных модальностей проецируются в общее пространство представлений и обрабатываются одним декодером — а не отдельными подсистемами.

Где маленькая модель бьёт большую

На нескольких кодинговых и рассуждающих бенчмарках Inkling-Small показывает лучшие результаты:

  • SWE-bench Verified — 80,2% у маленькой модели против 77,6% у большой
  • Terminal Bench 2.1 — 64,7% против 63,8%
  • Лидирует и на SciCode, Humanity's Last Exam, GPQA Diamond

Причины — улучшенный набор данных для предобучения, изменения в конвейере машинного обучения и дистилляция знаний от полноразмерной Inkling (она выступала «учителем»). После этого команда продолжила обучение с подкреплением на агентных задачах в течение двух недель.

Где Inkling-Small всё ещё слабее

По фактологическим задачам маленькая модель заметно уступает. На τ³-Banking она набирает 15,5% против 23,7% у флагмана. Индекс AA Omniscience у неё отрицательный — слабый охват фактических знаний, хотя уровень галлюцинаций чуть ниже.

Для пользователя это значит следующее: Inkling-Small подходит как кодовый ассистент, инструмент для анализа документов, RAG-систем или чат-ботов. Но если задача требует высокой точности factual-ответов — без внешней базы знаний, верификации и человека в цикле не обойтись.

Но забудьте про ноутбук

Несмотря на название, «Small» — понятие относительное. Это не модель для локального запуска на потребительском железе.

  • Базовая версия (BF16): минимум 600 ГБ суммарной GPU-памяти — четыре NVIDIA B300 или восемь H200.
  • Квантизированная (NVFP4): около 180 ГБ — одна B300 в режиме W4A4 или два H200 в W4A16.

Квантизация снижает точность представлений, но резко сокращает требования к памяти. Тем не менее даже 180 ГБ — это серверная конфигурация. Обычные рабочие станции, десктопные видеокарты и ноутбуки не подойдут.

Тем не менее разница с флагманом существенна. Трёхкратное сокращение архитектуры означает меньшую стоимость размещения, проще планировать ресурсы, а круг организаций, способных запускать модель самостоятельно, расширяется.

Лицензия Apache 2.0 — главное для бизнеса

Inkling-Small распространяется под Apache 2.0. Это позволяет использовать, изменять, дообучать, распространять и коммерчески применять модель — включая встраивание в проприетарные продукты — при соблюдении условий уведомления и атрибуции.

Это принципиально отличается от кастомных «открытых» лицензий, которые накладывают ограничения на выручку, обязуют к брендингу или устанавливают отдельные условия для крупных коммерческих развертываний.

Для юридических, закупочных и платформенных команд разница упрощает внедрение. Apache 2.0 не отменяет необходимость проверять политики допустимого использования, происхождение данных и нормативные ограничения — но даёт чёткую правовую базу.

Доступные цены на API

На старте Thinking Machines предлагает скидку 50%:

  • Standard 64K-контекст: $0,58 за миллион токенов ввода, $1,44 за миллион токенов вывода, $1,73 за миллион токенов обучения
  • Кешированные запросы ввода: $0,116 за миллион токенов
  • Вариант с 256K-контекстом — дороже

Веса модели опубликованы на Hugging Face. Поддерживается дообучение через API Tinker, а также развёртывание через SGLang, vLLM, TokenSpeed, Unsloth и инструменты Hugging Face.

Повторяемость — не менее важный сигнал

Хорас Хи, исследователь Thinking Machines, отмечает: если для запуска Inkling потребовалась целая команда на грани напряжения, Inkling-Small ощущался как рутинная операция. Конвейер, созданный для флагмана, просто принял уменьшенную модель — и выдал результат.

Это говорит о том, что Thinking Machines перешла от одноразовых исследовательских релизов к повторяемому инженерному процессу: предобучение, дообучение, RLHF, оценка, выпуск — всё это теперь стандартный конвейер. Для рынка открытых моделей это важный индикатор зрелости.


Inkling-Small — не революция, но логичный и значимый шаг. Компания доказала, что можно сократить модель втрое и почти не потерять в качестве, при этом выигрывая на ряде практических задач. Для организаций, которым нужны контроль над данными, гибкость дообучения и разумные требования к инфраструктуре — это одна из наиболее привлекательных открытых моделей сегодня.