ИИ, который строит ИИ: как новая система AIBuildAI-2.5 учит машину саму создавать нейросети
Исследователи представили систему AIBuildAI-2.5 — автономного агента, который сам проектирует и обучает модели машинного обучения, используя дерево решений под управлением языковых моделей.
Система, способная без участия человека пройти путь от идеи до работающей модели ИИ, — это уже не фантастика, а вопрос оптимизации. AIBuildAI-2.5 делает этот процесс втрое эффективнее, чем предыдущие подходы, и занимает первое место на профессиональном бенчмарке.
ИИ строит ИИ: зачем это нужно
Представьте, что вам нужна нейросеть для распознавания дефектов на производстве или прогнозирования спроса. Сегодня для этого нужна команда специалистов по машинному обучению, дорогое оборудование и недели работы. А если бы компьютер мог сам придумать архитектуру модели, написать код, обучить её и выдать готовый результат?
Именно над этой идеей работает направление автоматического построения ИИ-моделей. Концепт не новый — попытки автоматизировать машинное обучение (AutoML) предпринимаются уже лет десять. Но в последнее время на арену вышли так называемые автономные ИИ-агенты, которые используют большие языковые модели (LLM) в качестве «мозга», принимающего решения.
Система AIBuildAI-2.5, представленная исследователями под руководством Руичжана Чжана (Ruiyi Zhang), — свежий и, судя по результатам бенчмарков, весьма убедительный шаг в этом направлении.
Как это работает: дерево кодов
Принцип работы таких агентов проще объяснить через аналогию. Представьте, что вы садитесь за шахматную партию, но вместо фигур на доске — варианты программного кода. Каждый ход — это модификация предыдущего варианта: добавить слой в нейросеть, изменить функцию потерь, подобрать другой оптимизатор.
Система выстраивает «дерево решений», где каждый узел — это конкретная программа. От начальной идеи «ветвятся» десятки и сотни вариантов, каждый из которых проверяется на практике: запускается обучение, измеряется качество. Задача агента — найти оптимальную ветку, не перебирая все возможные комбинации (их бесконечно много).
Здесь и кроется главная инженерная проблема, которую авторы AIBuildAI-2.5 пытаются решить.
Три слабости предшественников
У существующих систем автоматического построения моделей есть три узких места, и авторы статьи честно их формулируют.
Первое: шум в оценках. Ресурсы ограничены — реальный бюджет не позволяет запустить обучение для каждого кандидата. Предыдущие системы в духе метода Монте-Карло оценивают узлы дерева по результатам выполнения, но если из тысячи вариантов проверены лишь десятки, оценки становятся ненадёжными. Это как пробовать три блюда из меню на сто позиций и делать вывод обо всём ресторане.
Второе: неэффективное использование железа. Обучение нейросетей — ресурсоёмкая задача. Если планировщик запусков не учитывает, какие GPU сейчас свободны, оборудование простаивает. Дорогостоящие видеокарты молчат, пока система ждёт, пока освободится нужный узел кластера.
Третье: перерасход на инференсе. Каждый шаг агента требует обращения к языковой модели. Когда за каждый вызов отвечает мощная (и дорогая) LLM вроде GPT-4-класса, стоимость разрастается, хотя многие задачи в пайплайне тривиальны и не требуют такого уровня интеллекта.
Что изменилось в AIBuildAI-2.5
Система решает все три проблемы — и делает это элегантно.
Умный судья вместо слепого перебора
Вместо того чтобы полагаться только на результаты обучения (дорогие и шумные), AIBuildAI-2.5 вводит специальный LLM-«судья». Он оценивает каждый кандидатный вариант кода по трём критериям:
- Ожидаемое улучшение — насколько этот вариант потенциально лучше текущего лидера;
- Обоснованность — опирается ли предложенная модификация на здравый смысл или это «выстрел в темноту»;
- Осуществимость — можно ли этот код вообще запустить без ошибок.
На основе этих оценок «селектор» формирует рейтинг кандидатов с учётом текущего состояния поиска. Это позволяет системе принимать осмысленные решения даже до того, как вариант был реально обучен и протестирован.
Планировщик, который думает о железе
Второе нововведение — планировщик обучающих задач, который мониторит текущее состояние GPU-кластера. Если часть оборудования свободна, он немедленно подгружает задачу в очередь, не дожидаясь формального слота. Результат — меньше холостого хода, больше полезных вычислений в единицу времени.
Для тех, кто работает с облачными ресурсами (а это большинство исследовательских команд), это прямая экономия денег.
Маршрутизатор для языковых моделей
Третья оптимизация — «роутер», который распределяет задачи между моделями разного класса. Нужно сгенерировать шаблон кода из описания? Справится лёгкая и дешёвая модель. Нужно разобраться в сложной ошибке в архитектуре? Подключается тяжёлая артиллерия.
Тот же принцип, по которому вы не вызываете скорую помощь при насморке, но и не пытаетесь лечить перелом дома. Рациональное распределение ресурсов между задачами разной сложности.
Результаты: первое место на бенчмарке
AIBuildAI-2.5 протестирована на двух известных бенчмарках:
-
MLE-Bench — набор задач по машинному обучению, структурированных как соревнования на платформе Kaggle. Система заняла первое место с показателем 73,3% «медальных» решений (то есть задач, выполненных на уровне, достаточном для призового места на реальных соревнованиях).
-
AIRS-Bench — шесть задач автономного ИИ-исследования, на которых AIBuildAI-2.5 превзошла сильный бейзлайн.
Критический взгляд: что стоит за цифрами
Показатели впечатляющие, но важно понимать контекст.
Во-первых, речь идёт о задачах с Kaggle — соревнованиях, где формулировка чёткая, данные подготовлены, а метрика известна. Это сильно упрощает жизнь агенту. В реальной инженерной работе задача часто размыта, данные «грязные», а критерий успеха неочевиден. Способность системы работать в таких условиях пока не подтверждена.
Во-вторых, 73,3% «медалей» — это результат на конкретном наборе задач. Бенчмарки удобны для сравнения, но они не всегда отражают реальную полезность. Система может отлично справляться с типовыми задачами, но оказаться бесполезной на нестандартных, требующих креативности или глубокого понимания предметной области.
В-третьих, статья вышла на arXiv — это препринт, который не прошёл полноценное рецензирование. Авторы, безусловно, приводят экспериментальные данные, но независимая верификация со стороны сообщества ещё впереди.
Что это значит на практике
Если отвлечься от бенчмарков и посмотреть на перспективу, значение подобных систем трудно переоценить.
Демократизация ИИ. Сегодня создание модели машинного обучения — удел подготовленных специалистов. Автономные агенты могут снизить порог входа: бизнесмен с чёткой задачей и набором данных сможет получить работающую модель без найма целой команды ML-инженеров.
Ускорение исследований. Даже для профессионалов автоматизация рутинных этапов — перебора архитектур, подбора гиперпараметров, отладки пайплайнов — экономит дни и недели работы. Исследователи смогут сосредоточиться на формулировке задач и интерпретации результатов, а не на бесконечных циклах проб и ошибок.
Экономия ресурсов. Оптимизация использования GPU и маршрутизация запросов к LLM — это не просто инженерная изящность, а реальное снижение стоимости экспериментов. Обучение нейросетей потребляет колоссальные объёмы электроэнергии, и любая оптимизация на этом уровне имеет экологическое и финансовое значение.
Но не всё так просто
Есть и контраргументы, которые стоит держать в голове.
Автоматизация создания ИИ-моделей ставит вопросы безопасности. Если систему можно попросить «сделать модель, которая решает задачу X» — а задача X связана с генерацией дипфейков, взломом систем или созданием дезинформации? Автономные агенты, способные проектировать нейросети, усиливают и существующие риски.
Кроме того, модели, созданные автоматически, часто оказываются «чёрными ящиками» вдвойне: непрозрачна не только сама нейросеть, но и логика, по которой агент выбрал именно такую архитектуру. Это затрудняет отладку, аудит и объяснение результатов.
Вместо итога
AIBuildAI-2.5 — не революция, но существенная эволюция. Система честно атакует конкретные инженерные проблемы предыдущих подходов и демонстрирует измеримые улучшения. Тройная оптимизация — умный поиск, планировщик ресурсов, маршрутизация LLM — делает процесс не просто автоматическим, но и рациональным.
Главный вопрос остаётся открытым: сможет ли такая система работать не только на стандартизированных задачах из бенчмарков, но и на реальных, «грязных», неопределённых инженерных проблемах? Ответ на него определит, станут ли подобные инструменты повседневной рабочей лошадкой или останутся демонстрацией возможностей в лабораторных условиях.