Astera Labs обновляет контроллеры памяти Leo: помощь ИИ-центрам в борьбе с дефицитом памяти
Astera Labs представила обновлённую линейку контроллеров памяти Leo и коммутаторов Scorpio — они должны помочь дата-центрам справиться с нехваткой памяти при запуске всё более тяжёлых ИИ-моделей.
Память — вот настоящее узкое место гонки ИИ-вычислений. Пока GPU растут в мощности, память за ними не успевает — и Astera Labs предлагает закрыть этот разрыв с помощью контроллеров нового поколения, подключённых напрямую к фабрике PCIe.
Проблема: стена памяти вернулась
Казалось бы, мы уже давно обсуждали «стену памяти» в контексте классических серверных нагрузок. Но взрывной рост генеративного ИИ вернул проблему в центр внимания — и с удвоенной силой. Модели становятся больше, контекстные окна растут, а архитектура агентных систем требует многораундовых цепочек вызовов. Всё это давит на подсистему памяти так, как не давало ничто со времён эпохи big data.
Одновременно на рынке памяти разворачивается настоящий цейтнот: производители перебрасывают пластины на выпуск HBM (High Bandwidth Memory) для ускорителей, а цена на DDR5 по этой причине резко полезла вверх. Дата-центры оказываются между молотом и наковальней — нужно больше памяти, но она дорожает, а существующие DIMM-модули простаивают без дела.
Именно в этот момент Astera Labs решила атаковать проблему с нескольких сторон сразу.
Что обновилось: три серии контроллеров
Astera Labs обновила линейку Leo Smart Memory Controller тремя новыми продуктами:
- Leo X-Series — контроллер памяти, подключаемый непосредственно к фабрике (fabric-attached). Заточен под инференсные нагрузки, где кэш ключ-значение (KV cache) способен забить всю высокоскоростную память GPU.
- Leo 2 E-Series и P-Series — следующее поколение контроллеров для расширения и пулинга памяти через CXL, подключаемых к CPU.
Второе поколение поддерживает и DDR5, и повторно используемую DDR4. Максимальный объём — до 4 ТБ DDR5 на один контроллер и до 768 ГБ утилизированной DDR4. Это важный нюанс: у гиперскейлеров скопились горы старых DIMM-модулей, которые раньше отправлялись в утиль. Теперь, если верить Astera Labs, их можно вернуть в строй.
Кроме того, в контроллеры добавили встроенные функции тестирования памяти, телеметрии, предиктивного анализа сбоев и автоматического ремонта. Звучит как мелочь, но для операторов крупных кластеров это критичные возможности — ручная замена модулей в стойке с тысячами серверов попросту нежизнеспособна.
Leo X-Series: память для инференса через фабрику
Главная новинка — Leo X-Series. Это не просто контроллер, а часть связки с коммутатором Scorpio от Astera Labs. Вместе они создают выделенный уровень памяти, подключённый напрямую к PCIe-фабрике, минуя CPU.
Зачем это нужно? При инференсе больших языковых моделей ключевую роль играет KV cache — данные, которые модель удерживает в памяти для генерации последовательных токенов. В многораундовых агентных системах этот кэш может разрастаться настолько, что не влезает в HBM ускорителя. Классическое решение — сбрасывать данные в оперативную память CPU, но это добавляет задержки.
Leo X-Series предлагает альтернативу: выделенный слой памяти, доступный ускорителю напрямую через фабрику. Astera Labs приводит результаты бенчмарка: четыре GPU Nvidia H200 с моделью Qwen2.5-32B и многораундовыми агентными нагрузками показали снижение времени до первого токена (TTFT) на 62% и прирост пропускной способности на 22% по сравнению с классическим подходом через CPU-DRAM.
Впечатляющие цифры, но важно помнить: это собственный бенчмарк вендора, а значит, реальные результаты в продакшене могут отличаться.
Scorpio: коммутатор как активный участник
Коммутатор Scorpio X-Series с 320 линиями — не просто «труба» для перекидывания пакетов. Astera Labs позиционирует его как активный компонент системы: внутри стоят аппаратные ускорители, которые берут на себя часть коллективных операций (collective operations), ускоряя их до 2 раз.
Суть в том, что часть вычислений, которые раньше делались на GPU, теперь выполняется прямо в кремнии коммутатора. Меньше времени на передачу данных — больше на собственно вычисления — выше утилизация ускорителей. Плюс Scorpio обеспечивает связность между GPU за один хоп (single hop), что снижает латентность в крупных кластерах.
Ахмад Данеш, вице-президент Astera Labs по управлению продуктами, подчёркивает: на текущем масштабе развёртывания ИИ-инфраструктуры интерконнекты перестали быть пассивной «водопроводной трубой». Они стали активными участниками системы, влияющими на утилизацию GPU, качество обслуживания, отказоустойчивость и экономическую окупаемость энергобюджета дата-центра.
Cosmos: софт как клей
Помимо кремния, Astera Labs наращивает программную составляющую. Платформа Cosmos добавляет уровень интеллекта управления — телеметрия, динамическое распределение ресурсов, автоматизация. По словам тех же Данеша и Тада Омуры, старшего вице-президента компании, именно софт обеспечивает основную ценность на масштабах, с которыми работают гиперскейлеры.
Функция динамического пулинга и шеринга памяти в семействе Leo 2 призвана устранить проблему «осиротевших» ресурсов — объёмов памяти, которые выделены серверам, но простаивают без дела. Теперь эту ёмкость можно перераспределять между серверами по мере необходимости. Омура называет такие излишки DDR-памяти «следующим ресурсом для масштабирования».
Конкурентный контекст
Astera Labs работает не в вакууме. CXL как стандарт привлекает всё больше участников. Корейский стартап Xcena недавно показал устройство CXL Type 3, которое совмещает до 2 ТБ DDR5, SSD-подкреплённую «бесконечную память» и более тысячи RISC-V-ядер — вычисления переносятся прямо в модуль памяти. Synopsys обновил свой портфель CXL-IP, тоже нацеленный на расширение пропускной способности и ёмкости.
Конкуренция растёт, и это хорошо: рынок явно нуждается в нескольких подходах к одной проблеме.
Что это значит на практике
Для конечного пользователя, который спрашивает ChatGPT или использует ИИ-агента, все эти контроллеры и коммутаторы невидимы. Но они напрямую влияют на скорость ответа, стоимость инференса и, в конечном счёте, на то, сколько стоит запуск ИИ-сервиса.
Чем эффективнее память в дата-центре, тем больше запросов можно обработать на том же железе, тем ниже стоимость токена и тем доступнее ИИ-продукты. Astera Labs делает ставку на то, что CXL и «умная фабрика» станут тем слоем инфраструктуры, который позволит продолжить масштабирование даже в условиях дефицита памяти и роста цен на DDR5.
Реальные результаты покажет время — особенно когда крупные облачные провайдеры начнут массово интегрировать эти решения. Но направление движения понятно: эра «пассивных» интерконнектов в ИИ-центрах заканчивается.