30.09.2026 721 материалов

Лучшая модель для решений Jev недоступна через API. Вот что запустить вместо неё на одной видеокарте с 8 ГБ

Семь открытых альтернатив модели Jev испытали на одной потребительской видеокарте RTX 4060 с 8 ГБ памяти. Лучший вариант — Kev-4B в 4-битной квантизации: он занимает 3,8 ГБ VRAM и отстаёт от оригинала всего на 9,6 процентных пункта точности.

Лучшая модель для решений Jev недоступна через API. Вот что запустить вместо неё на одной видеокарте с 8 ГБ

Kev-4B в 4-битном режиме — лучший универсальный вариант для тех, кто не может вызвать облачный API: 87,2% точности, 188 мс на ответ, 3,8 ГБ видеопамяти. Это не замена Jev, но это вполне рабочий инструмент для автоматизации рутинных решений.


Зачем вообще нужны «модели решений»

Несколько недель назад компания TypeSafe выпустила модель Jev, и это событие заслуживает внимания — даже если вы не следите за каждым анонсом в мире ИИ.

Большинство задач, которые мы поручаем языковым моделям в продакшене, — это не генерация текста. Это принятие решений. Кому направить тикет? Нужен ли человек для обработки этого сообщения? Подпадает ли заявка под условия гарантии? Насколько срочна задача — по шкале от одного до трёх?

Стандартный подход до сих пор выглядел так: отправить запрос в генеративную модель, попросить ответить в формате JSON, распарсить результат и надеяться, что модель не выдумала несуществующие варианты. Jev выбрасывает текст из уравнения. Вы передаёте ей состояние и набор типизированных вопросов (выбрать вариант, да/нет, оценка по шкале), а она возвращает вероятности. Никакого парсинга, никаких повторных попыток, никаких галлюцинаций.

Именно вероятности — главная ценность. Если модель уверена на 97%, что тикет относится к бухгалтерии, его можно направить автоматически. А случаи с уверенностью 60% — отправить человеку. Эта схема «автоматизируй уверенное, эскалируй сомнительное» — и есть путь к внедрению ИИ в процессы, где ошибка дорого обходится. Маршрутизация, триаж, проверка политик, условия остановки агентов — всё превращается в быстрые вызовы функций с предсказуемой стоимостью.

Проблема: не все могут вызвать API

Вот только не каждая команда может просто взять и отправить запрос в облако. Авторы тестирования работают с командами в средах с высокими требованиями к соответствию нормативам (compliance). Для них «просто вызовите hosted API» — не вариант.

Регулируемые данные не покидают определённую сеть или страну. Подключение нового вендора означает месяцы проверок безопасности и приватности. Некоторые системы работают в сетях без доступа в интернет. А там, где внешний вызов формально разрешён, аудиторы хотят знать, какая именно модель приняла каждое конкретное решение, и что она не сменится незаметно.

Когда нельзя привезти данные к лучшей модели, приходится привозить хорошую модель к данным.

Семь претендентов за неделю

В течение первой недели после выхода Jev появилось как минимум семь открытых альтернатив. Каждая копирует ту же базовую идею — ответ в виде вероятностей вместо текста. Вот они:

  • Kev — модели Qwen3.5 (0,8B, 4B, 9B), дообученные выдавать вероятности вариантов за один проход.
  • Von — энкодер на 395 млн параметров, заточенный под скорость.
  • Laya — небольшие многоязычные энкодеры с языковым маршрутизатором.
  • Rizzo Flow — модели на 1,7B и 4B через llama.cpp с встроенным интерактивным интерфейсом.
  • SemIf — никакого дообучения: вычисляет оценки вариантов напрямую из вероятностей следующего токена обычной модели.
  • Nimble — модель на 9B с открытым рецептом курирования данных и обучения.
  • NanoJev — маленькая полностью обучаемая реплика, выпущенная с чекпоинтом, обученным на игровых состояниях.

Четыре из семи инструментов говорят на том же HTTP-интерфейсе, что и Jev, — это позволило провести честное сравнение.

Как тестировали

Всё работало на одной NVIDIA GeForce RTX 4060 с 8188 МБ памяти в виртуальной машине с пробросом GPU. Каждый инструмент запускался отдельно, по одному запросу за раз, и каждый ставился за единый интерфейс /v1/systemone, чтобы один и тот же скорер оценил всех.

В качестве тестового набора взяли независимый публичный бенчмарк jabr/classifier-benchmark v2 — 866 синтетических случаев по 49 бытовым задачам принятия решений: маршрутизация обращений, право на возврат или гарантию, проверка на фишинг и мошенничество, триаж, оценка тона и грамматики. Случаи сгенерированы и перепроверены комитетом из семи разных языковых моделей. Ни один из тестируемых инструментов не создавался под этот набор.

Три инструмента поставляются только с полновесными весами, которые не влезают в 8 ГБ, поэтому для них применили 4-битную и 8-битную квантизацию через bitsandbytes. Для сравнения также запустили сам Jev через API TypeSafe и обычную генеративную модель (Qwen3:8b через Ollama с запросом на JSON-ответ) в качестве «классического» базового уровня.

Что помещается в 8 ГБ

Почти всё — после квантизации. Единственное исключение: модель Nimble на 9B, которая загружается на 7,5 ГБ и падает с нехваткой памяти при первом же запросе.

Пиковый расход видеопамяти:

  • NanoJev 0,6B — 2,4 ГБ
  • Rizzo 1,7B (q8) — 2,5 ГБ
  • SemIf 4B (4-бит) — 3,2 ГБ
  • Von — 3,3 ГБ
  • Kev-4B (4-бит) — 3,8 ГБ
  • Rizzo 4B (q4) — 4,1 ГБ
  • Kev-0,8B — 4,5 ГБ
  • SemIf 4B (8-бит) — 5,0 ГБ
  • Kev-4B (8-бит) — 5,3 ГБ
  • Laya — 5,5 ГБ
  • Rizzo 4B (q8) — 5,7 ГБ
  • Kev-9B (4-бит) — 7,4 ГБ

Стоимость квантизации оказалась невелика. Kev-4B набрала 0,878 точности в 8-битном режиме и 0,872 в 4-битном — разница на уровне статистической погрешности. У Rizzo разброс ещё меньше: 0,807 против 0,799. Лишь SemIf потеряла заметнее — около трёх пунктов. Для маленького GPU этот компромисс очевиден: Kev-4B в полной точности не влезает в 8 ГБ, а в 4-битном режиме занимает 3,8 ГБ.

Точность против скорости

А вот здесь начинается самое интересное. Вот результаты — точность на 866 вопросах в сравнении с медианным временем ответа:

Инструмент Точность Ошибки при ≥90% доверии Автоматизируемо при 5% ошибок Медиана, мс Пик VRAM
Jev 1.13 (hosted) 0,968 0,2% 100% 135 hosted
Kev-9B (4-бит) 0,893 0,7% 76% 223 7,4 ГБ
Kev-4B (8-бит) 0,878 0,0% 77% 385 5,3 ГБ
Kev-4B (4-бит) 0,872 0,1% 75% 188 3,8 ГБ
SemIf 4B (8-бит) 0,866 3,6% 74% 168 5,0 ГБ
SemIf 4B (4-бит) 0,837 5,0% 66% 130 3,2 ГБ
Qwen3:8b (Ollama) 0,827 — — 207 5,9 ГБ
Rizzo 4B (q8) 0,807 12,4% 22% 71 5,7 ГБ
Von 0,724 1,7% 21% 18 3,3 ГБ
Kev-0,8B 0,718 0,3% 14% 29 4,5 ГБ
Rizzo 1,7B (q8) 0,639 22,5% 3% 35 2,5 ГБ
Laya 0,585 3,1% 0% 21 5,5 ГБ
NanoJev 0,6B 0,343 0,5% 0% 29 2,4 ГБ

Kev-4B в 4-битном режиме — лучший универсальный вариант. Точность 0,872, отставание от Jev на 9,6 пункта, всего 3,8 ГБ видеопамяти, 188 мс на вопрос. Причём доверие модели к своим ответам обосновано: лишь 0,1% ответов оказываются ошибочными при уверенности ≥90% (у Jev — 0,2%). Это значит, что с бюджетом ошибок в 5% можно автоматизировать примерно 75% решений без ручной проверки.

8-битная сборка чуть точнее, но вдвое медленнее. Kev-9B набирает немного больше (0,893), но съедает 7,4 из 8 ГБ — места для чего-либо ещё не остаётся.

SemIf — ближайший претендент, причём без обучения вообще. Он извлекает оценки вариантов напрямую из вероятностей следующего токена немодифицированной Qwen3.5-4B. 0,866 точности в 8-битном режиме, 0,837 в 4-битном. Идеальный выбор, если вы уже запускаете эту модель и не хотите подключать новую. Но есть нюанс: его уверенность требует калибровки — 3,6–5% ответов оказываются ошибочно уверенными.

Von — выбор тех, кому важна скорость. 18 мс на ответ в 3,3 ГБ — в десять раз быстрее Kev-4B. Точность 0,724. Надёжен на тональности и маршрутизации, но на уровне подбрасывания монетки справляется с проверками по правилам: гарантийные случаи, фишинг, подозрительные транзакции.

Остальных сложно рекомендовать прямо сейчас. Генеративная базовая линия (Qwen3:8b) набирает неплохие 0,827, но её уверенность бесполезна: 17% ответов она выдаёт ошибочно и уверенно. Rizzo быстра (71 мс) и набирает около 0,80, но 11–12% уверенных ответов ошибочны до калибровки, и с политиками она не справляется. Laya (0,585) и Kev-0,8B (0,718) отстают от Von, а NanoJev с игровым чекпоинтом показывает результат на уровне случайного угадывания.

Jev по-прежнему лучшая — и вот простой эксперимент, который это показывает

Разрыв в 9,6 пункта — существенный, и он растёт на сложных задачах: на проверке грамматики Jev набирает 0,81, а Kev-4B и SemIf — по 0,48. Но дело не только в цифрах.

Настоящее преимущество Jev проявляется на задачах, для которых её не обучали. Авторы проверили это следующим образом: десять разных ИИ-моделей переписали вступительный абзац статьи, сохранив все факты, но сделав текст более естественным. Добавили два контрольных абзаца — один нарочито канцелярский, другой нарочито разговорный. Затем задали Kev-4B и Jev три вопроса по каждому абзацу: написан ли он человеком, насколько звучит естественно, и какой из десяти вариантов самый «человеческий».

Kev не смог отличить контрольные образцы — разница в оценках составила 0,014 пункта, а три метрики не сошлись на победителе. Jev разделила их резко: 0,25 против 0,59 по вопросу «написано человеком», 0,14 против 0,84 по естественности. Её три метрики были согласованы друг с другом, а в топ-3 попали все переформулировки, сохранившие факты.

Это, конечно, маленький эксперимент с двенадцатью абзацами, а не бенчмарк. Но он указывает на реальное различие: Kev отлично справляется с формами решений, на которых обучалась, а Jev умеет обобщать — отвечать на вопросы, для которых её создатели явно не готовили обучающие данные.

Если можете использовать Jev — используйте Jev.

Где открытые модели находят своё место

Но если не можете — открытые модели не просто утешительный приз. Вот четыре реальных преимущества, которые они дают.

  1. Дообучение на собственных данных. Kev поставляется с полным рецептом обучения: LoRA-адаптеры на базовых моделях Qwen3.5. Авторы утверждают, что модель на 0,8B обучается на GPU с 4 ГБ. Модель, дообученная на нескольких тысячах ваших собственных размеченных решений, может существенно сократить разрыв с Jev на конкретных вопросах, которые вы задаёте.

  2. Калибровка на своих данных. Некоторые инструменты позволяют подогнать уверенность модели под ваши размеченные примеры. Калибровка не меняет, какой ответ побеждает, — но именно она делает порог уверенности тем, что можно обосновать аудитору.

  3. Фиксация и аудит модели. Локальная модель — это файл с контрольной суммой. Она не меняется, пока вы её не поменяете, и каждое принятое ею решение остаётся в вашей сети.

  4. Каскадирование решений. Пусть быстрая локальная модель обрабатывает уверенные рутинные вызовы, а сомнительные отправляются человеку или — если политика позволяет — в Jev. Все семь инструментов говорят на одном интерфейсе, так что переключение между ними — это изменение конфигурации.

Не только мы это тестируем

Авторы не единственные, кто исследует эту новую категорию. Независимые результаты сходятся в главном: Jev лидирует, а маленькие энкодеры отстают от моделей класса 4B.

  • jabr/classifier-benchmark — публичный набор, на котором всё здесь замерено. Его собственные результаты (Jev 0,964, Von 0,724, Laya 0,585) совпадают с результатами тестирования.
  • umstek/zero-shot-ie-bench — самое широкое исследование: 38 систем zero-shot извлечения, классификации и типизированных решений, локальных и облачных, на девяти языках.
  • scienthoon/jev-ood-calibration — проверяет, остаются ли вероятности Jev честными на задачах, которые она явно не видела при обучении. Точна, но склонна к завышенной уверенности на правилах, отсутствующих в тексте.
  • jaredpalmer/kev — замороженные наборы данных и код скоринга для Kev.

Что добавляет данное тестирование — это жёсткое ограничение: фиксированный бюджет в 8 ГБ видеопамяти, квантизация крупных моделей под этот бюджет и вопрос, который реально задают в compliance-командах: «Сколько из этого можно безопасно автоматизировать на оборудовании, которое мы контролируем?»

Попробуйте сами

Скорер, обёртка, патчи квантизации, адаптеры, все результаты и эксперимент с «человечностью» опубликованы в репозитории на GitHub. Если у вас запущен любой сервер с интерфейсом /v1/systemone, одна команда запускает тестирование:

python -m gutcheck.benchmark --endpoint http://127.0.0.1:8008 \
    --model kev-latest --suite suites/jabr-v2.jsonl --out runs/my-tool

Важная оговорка: всё тестирование проводилось на одном GPU, одной машине, на синтетических задачах. Ваши собственные решения могут расставить инструменты в другом порядке — тестируйте на размеченном наборе из вашей предметной области, прежде чем делать выбор. Все семь проектов были «в возрасте» нескольких дней на момент тестирования и быстро меняются; эти цифры — моментальный снимок, а не окончательный вердикт.

Но общий вывод достаточно ясен: Kev-4B в 4-битном режиме — это первый по-настоящему рабочий вариант для команд, которые хотят автоматизировать принятие решений на ИИ, но не могут позволить себе облачные API. Не идеальный, но контролируемый, аудируемый и помещающийся в одну потребительскую видеокарту.