Meta* перестроила хранилище данных: теперь GPU не простаивают часами из-за медленных дисков
Meta* полностью перепроектировала систему хранения данных для ИИ-кластеров — внедрение многоуровневого кэширования на SSD сократило загрузку датасетов с часов до минут. Главный мотив: простой дорогих GPU обходится дороже, чем покупка накопителей.
Когда видеокарта за полмиллиона рублей простаивает в ожидании данных с жёсткого диска, экономия на хранилище превращается в прямые убытки. Meta* это поняла — и перестроила инфраструктуру с нуля.
Проблема: GPU едят, но не жуют
Каждый, кто хотя бы раз тренировал нейросеть на собственном компьютере, знает ощущение: видеокарта мощная, оперативки хватает, а процессор загрузки датасета ползёт как улитка. GPU в это время крутит вентиляторы вхолостую, не совершая полезной работы. В масштабе одного ноутбука это раздражает. В масштабе инфраструктуры Meta* — это катастрофа в цифрах.
Компания управляет сотнями хранилищ экзабайтного масштаба, которые кормят данными Facebook, Instagram, Reality Labs, рекламные системы, базы данных и внутренние сервисы. Всё это хозяйство опирается на базовый слой хранения под названием Tectonic — он отвечает за объектное хранилище, файловые системы, блочные устройства и распределение данных между HDD и SSD.
Но вот в чём беда: нейросети работают с гигантскими массивами данных, а архитектура хранения до сих пор была спроектирована под классические файловые операции. Каждый раз, когда GPU-сервер запрашивал информацию, система вынуждена была проходить через несколько слоёв метаданных — и каждый слой добавлял задержку. Результат: дорогие ускорители простаивали в ожидании, а пайплайны обучения ИИ буксовали.

Что именно изменили
Инженеры Meta* не стали точечно чинить отдельные узкие места — они перепроектировали всю подсистему хранения для ИИ-нагрузок.
Упростили метаданные. Старая система использовала разрозненные механизмы для файлов, объектов и блоков. Новая — единая схема метаданных на базе ZippyDB (внутреннее хранилище ключ-значение от Meta*). Клиенты теперь обращаются напрямую к серверам хранения, минуя промежуточные уровни приложений. Метаданные отдаются за 1–2 миллисекунды.
Перевели на BLOB-хранилище. Вместо традиционного файлового подхода массивные ИИ-датасеты теперь хранятся в формате BLOB (Binary Large Object) — это унифицированный способ доступа, заточенный под высокую пропускную способность.
Внедрили распределённый кэш в три уровня. Это, пожалуй, самая элегантная часть решения:
- L1 — свободная память GPU используется как кэш первого уровня
- L2 — SSD-накопители внутри GPU-хостов
- L3 — региональные flash-хранилища BLOB-данных
При этом классические HDD остаются «источником правды» — основным хранилищем, где лежат все данные. Но прежде чем запрос дойдёт до медленных дисков, он проходит через кэш. Средний показатель попадания в кэш — 80%. Это означает, что в подавляющем большинстве случаев GPU получает данные из быстрого SSD или даже из собственной памяти, не дожидаясь чтения с магнитных дисков.
Разместили хранилища рядом с GPU. Региональные BLOB-системы поставили непосредственно рядом с GPU-кластерами, убрав задержки на передачу данных через удалённую инфраструктуру. Звучит очевидно, но до этого данные могли путешествовать через несколько промежуточных узлов.
Результаты: с 89 часов до трёх
Цифры впечатляют, и здесь сложно говорить о маркетинговом преувеличении — масштаб улучшений слишком велик.
| Сценарий | До | После | Ускорение |
|---|---|---|---|
| Загрузка датасета | 150 минут | 10 минут | 15x |
| Полный пайплайн обработки | 89 часов | ~3 часа | ~30x |
Загрузка одного набора данных сократилась с двух с половиной часов до десяти минут. Другая задача, которая раньше выполнялась почти четверо суток, теперь завершается чуть более чем за три часа. Это не косметическое улучшение — это смена порядка.
Экономика простоя: почему SSD оправданы
Здесь стоит задержаться на самой интригующей части истории — экономической логике.
Аналитик Citrini Research по имени Jukan обращает внимание на то, что хранилища традиционно оценивают по стоимости за терабайт ёмкости. Логика понятная: если HDD отдаёт терабайт в пять-восемь раз дешевле SSD, зачем переплачивать?
Но эта логика ломается, когда речь заходит об ИИ-кластерах. Мощный GPU, который простаивает в ожидании данных, сжигает деньги даже в холостом режиме — электричество, аренда стойки, амортизация оборудования. Если прокачка хранилища до SSD позволяет сократить простой с часов до минут, то экономия на жёстких дисках просто не покрывает потерь.
Формула получается почти тривиальная: если час простоя GPU обходится дороже, чем разница в цене между HDD и SSD за нужный объём — значит, пора ставить SSD. И чем дороже GPU (а в эпоху дефицита ускорителей это особенно актуально), тем быстрее окупается переход на flash-накопители.
Что это значит для отрасли
Случай Meta — частный, но показательный. Он демонстрирует проблему, которая касается любой серьёзной ИИ-инфраструктуры: хранилище — это не просто корзина для данных, а активный участник вычислительного процесса*. Если подсистема хранения не успевает за скоростью GPU, всё остальное теряет смысл.
Интересно, что инженеры Meta* сами описывают свою инфраструктуру как «планетарный компьютер» (planet-scale computer) — и в этом контексте SSD выполняют роль «диска» в этом гигантском организме. Термин красивый и, судя по цифрам, не лишён оснований.
Для остальных участников рынка это сигнал: инвестиции в GPU без параллельной модернизации хранения — это как покупать Ferrari и ставить на него колёса от телеги. Машина мощная, но ехать будет медленно.
✴ Meta* — входит в перечень общественных объединений и религиозных организаций, в отношении которых судом принято вступившее в законную силу решение о ликвидации или запрете деятельности по основаниям, предусмотренным Федеральным законом от 25.07.2002 № 114-ФЗ «О противодействии экстремистской деятельности».