10.09.2026 523 материалов

Тихие ошибки данных: как баги в кремнии срывают тренировки ИИ и что с этим делать

Тихие ошибки данных — баги в кремнии, которые не ловит стандартное тестирование — превращаются в серьезную угрозу для дата-центров. Индустрия переходит от одноразовой проверки к постоянному мониторингу здоровья чипов прямо в серверных стойках.

Тихие ошибки данных: как баги в кремнии срывают тренировки ИИ и что с этим делать

Задача тестирования больше не — найти неисправный чип. Новая цель — вычислить, какой из исправных на вид процессоров может однажды начать неправильно считать.

Представьте: суперкомпьютер неделями тренирует языковую модель, а в итоге выдает бред. При этом все логи чисты, серверы не падали, железо не перегревалось. Виновник — «тихая ошибка данных» (Silent Data Error, SDE), производственный баг в кристалле процессора, который пропускают все стандартные тесты на заводе.

Проблема размером с дата-цент

SDE — это не какая-то новая напасть. Но она становится катастрофической в масштабах современных облачных вычислений. Когда к вам приходит ошибка? Примерно на 1 из 1000 серверов с новейшими процессорами. В пересчете на крупный парк машин в несколько миллионов устройств это означает сбой раз в несколько дней. Для компании, чей бизнес — стабильные вычисления, такие простои и «битые» результаты обучения ИИ — катастрофа, которую оценивают в миллиарды долларов.

В чем подвох? Чип с тихой ошибкой формально здоров: он проходит все аттестационные тесты (ATPG), проверки на застрявшие неисправности (stuck-at) и тактовые дефекты (transition-fault). Но при выполнении определенной операции в реальных условиях — например, сложении или делении — он может дать неправильный ответ. Классический пример: 10 ÷ 2 = 4 вместо 5. Эта ошибка не оставляет следов в логах и каскадом проходит по системе, заражая данные.

Почему сейчас проблема обострилась?

Три глобальных тренда подливают масла в огонь:

  1. Переход на новые техпроцессы. Чем тоньше нормы (5 нм, 3 нм), тем меньше запасы прочности у транзисторов и соединений. Микроскопические неоднородности в слоях металла или оксида кремния, которые раньше были незначительны, теперь могут создавать устойчивые «мосты» или «обрывы», зависящие от напряжения и температуры.
  2. Эра ИИ и переменных нагрузок. Роль центрального процессора в системах с акселераторами изменилась. Он теперь не просто диспетчер, а активный исполнитель, постоянно планирующий, вызывающий инструменты и запускающий новые операции. Непредсказуемые и быстрые переходы между задачами делают маргинальные дефекты критичными.
  3. Рост масштаба. Вспомните, что даже «идеальный» показатель в 10 FIT (1 отказ на миллиард часов работы) на парке из 10 миллионов устройств превращается в регулярную поломку.

Как индустрия учится ловить призраков

Старый подход «тест → отгрузка» себя исчерпал. Стратегия борьбы с SDE теперь многоуровневая и непрерывная.

На этапе производства (и возвращаемся к нему снова). Проблема в том, что набор тестов, который эффективно ловит SDE для одного поколения чипов (например, Intel Xeon), почти бесполезен для следующего. Инженеры Intel, протестировав 1,2 миллиона процессоров пяти поколений, пришли к выводу: для надежного отсеивания нужен набор из более чем 1000 уникальных функциональных тестов и 5000 синтетических стресс-тестов. Причем более 70% дефектов обнаруживался только одним-единственным тестом из тысячи. Проще говоря, нужно не «проверить железо», а «проверить, что оно правильно выполняет все возможные вычисления».

Классические модели тестирования на задержки (transition fault model) тоже не справляются. Они основаны на одиночном переключении входов (SIS), тогда как в реальной работе происходит множественное переключение (MIS), что создает более сложные и непредсказуемые задержки. Без интеллектуальных стресс-тестов под разные рабочие точки (PVT: напряжение, температура, технологический разброс) вылавливать такие дефекты крайне сложно.

На уровне системы. Тестирование не заканчивается на заводе. Гиперскейлеры (Google, Meta*, AWS) практикуют:

  • Fleet-wide screening (Meta*): Серверы периодически выводят из продакшена и прогоняют по тестам с заранее известными ответами. Есть также программы типа Ripple (микротесты во время работы) и Hardware Sentinel (анализ поведения без выделения ресурсов на тесты).
  • Application-level telemetry (Google): Используются контрольные суммы, дублирование вычислений и проверка инвариантов. Приложение Spanner, например, может само обнаружить поврежденные данные и вывести из строя машину-виновника.
  • In-system testing и SLM (Silicon Lifecycle Management): Это философский сдвиг. В кристалл встраиваются датчики (мониторы задержек, напряжения, температуры), которые отслеживают «здоровье» чипа всю его жизнь. Машинное обучение анализирует эти данные в реальном времени, пытаясь предсказать отказ по трендам деградации, задолго до того как он проявится как ошибка.

В перспективе: данные как капитал. Главная боль — в закрытости данных. Компании и университеты копят ценнейшую информацию о отказах и условиях их проявления, но из соображений конкуренции и юридических рисков не делятся ею. Эксперты из Advantest прямо говорят: без открытого обмена данными между участниками экосистемы прогресс будет гораздо медленнее.

Что это значит для вас?

Если вы не инженер в дата-центре Google, почему это важно? Потому что это касается всех, кто использует облачные вычисления, особенно интенсивные, как тренировка ИИ. Цена тихой ошибки — это не просто перезагрузка сервера, а потерянные недели работы, «испорченный» набор данных или некорректно обученная модель, которую потом сложно отладить.

Индустрия делает ставку на переход от разовых проверок к концепции «здоровье кремния на протяжении всего жизненного цикла». Тестирование становится непрерывным процессом, встроенным в саму работу оборудования. Путь этот тернист, требует переосмысления самих понятий «годный» и «бракованный», но другого выхода у вычислительной индустрии, загнанной в угол сложностью собственных созданий, просто нет.


  • ✴ Meta* — входит в перечень общественных объединений и религиозных организаций, в отношении которых судом принято вступившее в законную силу решение о ликвидации или запрете деятельности по основаниям, предусмотренным Федеральным законом от 25.07.2002 № 114-ФЗ «О противодействии экстремистской деятельности».