RAG недостаточно: почему поиск по документам всё ещё ошибается в 2026 году
Технология RAG, которая должна была избавить нейросети от выдумок, по-прежнему ошибается в каждом пятом ответе. И что хуже — добавление сносок делает ложные ответы убедительнее.
RAG снижает частоту галлюцинаций, но повышает уверенность пользователя в каждом отдельном ответе — именно это сочетание приводит к дисциплинарному взысканию, а не к пожатию плечами.
Если вы пользуетесь любым ИИ-ассистентом для работы с документами — будь то юридический поиск, медицинские справочники или анализ финансовой отчётности — эта новость касается вас напрямую. Обещание было простым: подключите к нейросети базу документов, и она перестанет выдумывать. Два года это обещание повторяли вендоры, инвесторы и консультанты. Теперь накопилось достаточно данных, чтобы сказать: обещание не выполнено. И проблема глубже, чем кажется на первый взгляд.
Что такое RAG и почему все на него надеялись
RAG — Retrieval-Augmented Generation — работает примерно так: перед тем как нейросеть сформирует ответ, система сначала ищет релевантные фрагменты в базе документов, а затем «заземляет» на них генерацию. Модель не выдумывает ответ из головы, а опирается на найденный текст. Звучит логично: если источник правильный и модель точно его цитирует, ошибок быть не должно.
Именно так продавались инструменты вроде Lexis+AI и Westlaw AI-Assisted Research — ведущие юридические ИИ-платформы, где ошибка в цитировании может стоить карьеры. На упаковке было написано «без галлюцинаций». В реальности оказалось иначе.
17–33%: что нашёл Стэнфорд
Исследователи из Стэнфордской RegLab протестировали три крупнейших юридических ИИ-инструмента — Lexis+AI, Westlaw AI-Assisted Research и Ask Practical Law AI. Все три построены на RAG, все три позиционируются как решение проблемы выдумок. Результат: инструменты галлюцинировали от 17% до 33% ответов. Не «немного отклонялись от темы» — изобретали несуществующие судебные решения, искажали фабулу дел, цитировали реальные документы в подтверждение тезисов, которые эти документы не содержат.
Для контекста: если бы юридический ассистент-человек ошибался в каждом третьем случае, его бы уволили. Но на рынке эти инструменты продаются как надёжные.
Проблема не в частоте, а в доверии
Вот что действительно важно понять: RAG действительно снижает частоту галлюцинаций по сравнению с обычным чат-ботом без привязки к документам. Это правда, и вендоры честно показывают эту метрику в своих презентациях. Но есть вторая метрика, которую в презентациях не встретишь — доверие пользователя к каждому конкретному ответу.
До RAG люди относились к ответам нейросети примерно как к уверенным репликам незнакомца в баре: занятно, но проверять надо. После RAG тот же самый ответ стал выглядеть как проверенный источник — потому что к нему прикреплена настоящая, кликабельная ссылка на документ. Галлюцинация без сноски выглядит как галлюцинация. Галлюцинация с оформленной цитатой выглядит как исследование.
Именно поэтому инструменты, которые агрессивно продвигались как решение проблемы, по собственным опубликованным оценкам ошибаются примерно в одном из пяти случаев. И добавленные после этого слои проверки сдвинули цифру вбок, а не вниз.
Проверка на отрицание: слепое пятно архитектуры
Есть более фундаментальная проблема, которую мало обсуждают. Тест NevIR проверил, могут ли системы поиска отличить «лекарство одобрено для детей до 12 лет» от «лекарство НЕ одобрено для детей до 12 лет». Одно слово разницы, противоположный смысл. Результат: поисковые модели, включая самые продвинутые, справлялись не лучше случайного угадывания — 25% точности.
Причина структурная: векторные модели кодируют тематическое сходство, а не логическую полярность. «Не одобрено» и «одобрено» оказываются соседями в векторном пространстве, потому что речь об одном и том же предмете. Для системы, чья задача — определить, какой документ релевантен запросу, неумение отличить «да» от «нет» — не погрешность, а фундаментальный изъян.
А длинный контекст — это не решение?
Примерно с 2024 года стандартным ответом на критику RAG стало: «Зачем вообще искать фрагменты? Загрузите весь корпус в окно контекста на миллион токенов, и модель сама прочтёт всё». Аргумент звучит элегантно, но не работает.
Исследование Liu et al. («Lost in the Middle») показало, что точность модели на длинных текстах описывает U-образную кривую: ответ хорошо находится в начале и в конце контекста, но если нужная информация спрятана в середине — точность резко падает. Иногда модель справляется хуже, чем вообще без релевантного документа.
Получается, что спор «RAG против длинного контекста» — это не два конкурирующих решения, а один и тот же сбой в двух нарядах. Чанкинг теряет информацию на границе извлечения; длинный контекст теряет её на границе внимания. Никто пока не победил.
Что дальше: слои, бюджет и прогноз Gartner
Поскольку одного RAG оказалось недостаточно, индустрия стала добавлять слои: реранкинг, верификационные агенты, петли самокритики, контроль человеком. Каждый слой добавляет задержку и стоимость по прямой линии, а точность растёт по кривой, которая уже упирается в потолок 15–20% ошибок — именно эти цифры независимо фиксируют и Стэнфорд, и Vectara.
Именно это имеет в виду Gartner в прогнозе июня 2025 года: более 40% проектов «агентного ИИ» будут закрыты к концу 2027 года. Причина — не в слабости моделей, а в кривой затрат. Из тысяч вендоров, называющих свои решения «агентными», реальный продукт под капотом есть примерно у 130. Остальное Gartner называет agent washing — «агентный фейсом».
Vectara Hallucination Leaderboard, который работает с 2023 года и сейчас оценивает более 7700 документов в юридической, медицинской и финансовой сферах, показывает: даже лучшие модели 2026 года ошибаются при суммаризации документа, который им дан. Gemini 2.0 Flash — около 0,7% галлюцинаций, GPT-4o — порядка 1,5%, Claude Opus — около 10%. Это при идеальных условиях: модели дают именно тот документ, который нужен, и просят просто кратко пересказать. Даже в этом сценарии ноль не достижим.
Что это значит на практике
Если вы полагаетесь на ИИ-инструменты для работы с документами — в юриспруденции, медицине, финансах, аналитике — стоит принять несколько вещей:
- Citations не равны гарантии. Наличие ссылки на источник не означает, что ответ точен. Ссылка может быть реальной, а вывод из неё — выдуманным.
- Отрицания модели не видят. Если ответ зависит от частицы «не», перепроверяйте вручную. Автоматические системы пока не умеют надёжно это делать.
- Слои проверки помогают, но не решают проблему. Добавление реранкинга и верификации сужает ошибки, но не убирает их.
- «Свободный от галлюцинаций» — маркетинговый ярлык, а не техническая спецификация. Ни один продукт на рынке не подтвердил это тестами.
Автор оригинальной статьи ставит конкретный прогноз: к концу 2027 года произойдёт хотя бы один публичный случай, когда юридический или медицинский специалист получит дисциплинарное взыскание за ссылку, сгенерированную RAG-инструментом с реранкингом и верификацией. И следующее обновление рейтинга Vectara по-прежнему покажет потолок ошибок в районе 15–20% — потому что слепое пятно на отрицание и деградация в середине контекста носят архитектурный характер, а не являются багами конкретной реализации.
Это не значит, что RAG бесполезен. Это значит, что обещание «подключил базу документов — и нейросеть больше не врёт» было преувеличением. Технология работает, но работает с оговорками, и игнорировать эти оговорки — особенно в критических сферах — пока рано.