Автономные ИИ-агенты оказались дешевле и точнее людей в петле проверки — пора пересчитать затраты
Привычка ставить человека на проверку каждого решения ИИ-агента обходится компаниям в десятки раз дороже автономных пайплайнов — и при этом часто снижает точность, а не повышает её. Разбираемся, когда петля проверки действительно нужна, а когда это просто дорогая иллюзия контроля.
Ставить человека в петле проверки не значит делать систему надёжнее — значит делать её медленнее, дороже и при масштабировании менее точной.
Привычка, которая дорого стоит
Если вы работаете над продуктом, где ИИ-агент принимает решения — классифицирует документы, маршрутизирует обращения, анализирует данные — вы наверняка слышали аргумент в пользу human-in-the-loop (HITL): мол, пусть ИИ делает первичную работу, а человек проверяет результат. Звучит ответственно. Звучит безопасно. И ещё звучит как затраты, которые вы, возможно, не считали.
Автор оригинальной публикации на Dev.to задаёт неудобный вопрос: а что если проверка человеком не просто дорого стоит, но и не даёт того качества, которое вы от неё ждёте? Что если в 2026 году для целого ряда задач автономные пайплайны превосходят связку «ИИ плюс человеческий контроль» и по деньгам, и по точности?
Давайте разберёмся, где здесь реальные аргументы, а где — преувеличения.
Откуда взялась мода на «человека в петле»
Понять логику HITL нетрудно. Когда компании в 2021–2022 годах начали массово строить продукты на базе моделей вроде GPT-3, главной проблемой были галлюцинации — модель уверенно выдавала выдуманные факты, и процент ошибок был таким, что без контроля не обойтись. Поставить специалиста проверять выводы ИИ было рационально: стоимость проверки была ниже стоимости ошибки, которая могла дойти до клиента.
С тех пор прошло четыре года. Модели стали заметно точнее, инструменты для структурированных задач — значительно надёжнее, а стоимость вычислений — существенно ниже. Но логика «обязательно проверяй» осталась на месте. И вот здесь начинаются проблемы.
Сколько на самом деле стоит проверка
При небольших объёмах человеческая проверка почти не ощущается в бюджете. Но стоит потоку выйти на несколько тысяч решений в день — а для серьёзного бизнес-процесса это совершенно нормальный объём — проверка становится самым дорогим звеном в цепочке.
Автор приводит конкретную арифметику для сценария классификации документов. Специалист, который проверяет решения ИИ, обходится компании примерно в $35–50 в час с учётом зарплаты, налогов, инструментов и управленческих накладных. При скорости 60 документов в час (а это щедрая оценка, если человек должен реально вдумываться) стоимость одной проверки — $0,58–0,83.
Вызов API модели уровня Claude Sonnet для структурированной классификации обходится в $0,003–0,015 за единицу. Даже если 10% результатов требуют переработки, автономный пайплайн обходится примерно в пятьдесят раз дешевле на каждый документ.
При 10 000 решений в день: проверка людьми — $5 800–8 300 ежедневно. Автономный пайплайн — $30–150. Разница за год — миллионы долларов.
Здесь стоит добавить нюанс: эти цифры справедливы прежде всего для рынка США и Западной Европы, где указанные зарплаты типичны. В российских реалиях стоимость специалиста будет ниже, но и пропорция между затратами на проверку и стоимостью API-вызова сохранится — просто масштаб экономии будет другим. Суть не в абсолютных цифрах, а в соотношении: автоматизация при масштабе выигрывает на порядки.
А что с точностью?
Вот здесь статья делает самый провокационный тезис: при большом объёме повторяющихся задач человек проверяет не точнее, а менее точно, чем хорошо настроенная автономная система.
Аргумент строится на хорошо известном явлении — усталости от принятия решений. Классическое исследование Данигера, Левава и Авнаим-Пессо (2011, Proceedings of the National Academy of Sciences) проанализировало 1 112 судебных решений и обнаружило, что процент положительных решений падал примерно с 65% до почти нуля в течение сессии перед перерывом, а затем резко восстанавливался после еды или отдыха. Иными словами, качество решений зависело не от сути дела, а от физического состояния судьи.
Перенесите это на рабочий процесс в компании. Человек, который классифицирует свой четырёхсотый документ за день — это совсем не тот человек, который классифицировал десятый. А ИИ-агент на своём четырёхсотом тысячном решении — точно такой же, как на первом. Его распределение ошибок стабильно, измеримо и улучшаемо. Распределение ошибок человека незаметно расширяется в течение дня — и вы не можете это надёжно отследить, потому что для этого нужен другой человек, который будет проверяющего проверять.
Доклад Stanford HAI за 2024 год зафиксировал, что ИИ превзошёл человеческий уровень по целому ряду бенчмарков — классификация изображений, визуальные рассуждения, понимание языка. Области, которые ещё в 2020 году считались «человеческой территорией», стремительно сдаются.
Честная оговорка: исследования вроде судебного — это данные о повторяющихся рутинных решениях. Творческие, высоковариативные задачи с непредсказуемым входом — совсем другая история. Но большинство корпоративных рабочих процессов, где ставят HITL, как раз и состоят из повторяющихся решений.
Какие задачи уже можно отдавать полностью автоматике
Автор статьи утверждает, что категорий задач, где автономия выигрывает, больше, чем принято признавать. И формулирует простой критерий: если входные данные структурированы, формат выхода определён, стоимость ошибки ограничена, а объём превышает примерно 500 единиц в день — пора убирать человека из петли.
Примеры таких задач: извлечение структурированных данных, маршрутизация документов, распознавание сущностей, классификация, суммаризация для внутреннего использования, первичный анализ логов, определение намерения клиента. Для всех этих категорий HITL не добавляет точности — добавляет задержку, стоимость и несогласованность, потому что каждый проверяющий немного по-своему интерпретирует инструкции.
Здесь полезно вспомнить исследование MIT (Noy и Zhang, 2023): специалисты, использующие ИИ-помощь, выполняли задачи на 55% быстрее, а качество их работы было оценено независимыми экспертами выше, чем у тех, кто работал без ИИ. При этом эксперты не знали, какие результаты были получены с помощью ИИ. Вывод, который часто теряется: человек, контролирующий ИИ-агента на продакшене, тоже не знает, какой результат правильный, пока не проверит его заново — а тогда это уже не проверка, а повторное выполнение работы.
Когда петля проверки всё-таки нужна
И вот здесь статья становится честнее — и важнее. Автономные агенты не должны работать без контроля, когда цена ошибки неограниченна и необратима. Это высокоставочные, низкообъёмные решения с непоправимыми последствиями: подача юридических документов, планы медицинского лечения, финансовые транзакции выше определённых порогов.
Ключевое слово — «неограниченна». Если неправильно классифицированное обращение попадёт в другую очередь, цена ошибки — один задержавшийся ответ. Ограничено. Если автономный агент подаст неправильный юридический документ, цена — проигранное дело. Неограничено.
Формула принятия решения проста и математична: автономный пайплайн побеждает, когда (доля ошибок агента × цена одной ошибки) меньше (стоимость проверки человека × объём). Подставьте свои цифры — и получите ответ, а не предмет для дискуссии.
Почему компании так медленно переходят на автономию
Автор оригинала справедливо замечает: дело не в математике — она простая. Дело в психологии. HITL ощущается как благоразумие, автономия — как риск. Это чувство, а не расчёт. И за него платят реальные деньги.
На это накладываются и регуляторные факторы: во многих отраслях требование «обязательного человеческого контроля» закреплено в нормативных актах или стандартных операционных процедурах. Даже если цифры показывают, что автоматизация надёжнее, изменить процесс можно не всегда быстро. Это реальное ограничение, которое нельзя списать со счетов.
Кроме того, приведённые в статье цифры по стоимости API и зарплатам специалистов — это срез момента. Стоимость вычислений продолжает падать, а значит, экономическое преимущество автономных пайплайнов будет только расти. Но и стоимость человеческого труда в развивающихся странах может быть существенно ниже, что сужает разрыв для локальных компаний.
Что это значит на практике
Если вы строите или эксплуатируете ИИ-пайплайн, есть простой набор действий, который стоит выполнить:
- Посчитайте реальную стоимость одной проверки человеком в вашем процессе — с учётом зарплаты, накладных, инструментов и времени на обучение.
- Измерьте текущую долю ошибок вашего автономного агента на репрезентативной выборке.
- Оцените фактическую стоимость одной ошибки — не абстрактную, а в рублях или долларах.
- Подставьте в формулу и посмотрите, где точка перелома.
Скорее всего, для структурированных повторяющихся задач с объёмом выше нескольких сотен в день ответ будет в пользу автономии. И этот результат может оказаться некомфортным — но именно некомфортные решения чаще всего экономят деньги.
Автор оригинальной публикации завершает текст жёстко: «Вы не проявляете осторожность, ставя проверку по умолчанию. Вы тратите лишнее». Формулировка резкая, но для тех, кто действительно не считал затраты, — попадает в цель. Безопасность, за которую платят, но не проверяют её реальную ценность, называется иначе: дорогая иллюзия контроля.