Новый подход позволяет языковым моделям управлять роботами — без сложного обучения
Исследователи из ShowLab представили систему Show-Harness, которая через компактный семантический интерфейс позволяет языково-визуальным моделям управлять роботами — без дорогостоящей подготовки и специализированного оборудования.
Правильный интерфейс оказывается важнее размера модели: даже небольшая языковая модель, «подключённая» к роботу через грамотный переводчик намерений в действия, способна справляться с задачами не хуже специализированных систем.
Зачем языковой модели руки
Представьте, что вы просите голосового помощника «принести кружку со стола». Человеку такая просьба не составит труда — мы интуитивно понимаем, что нужно подойти, протянуть руку, схватить, нести. Но для робота каждый из этих шагов — отдельная инженерная задача.
Языково-визуальные модели (VLM), такие как GPT-4o или Gemini, уже умеют «понимать» изображения и отвечать на вопросы о мире. Они знают, что кружка — это предмет, который берут за ручку, что стол стоит на полу, а не на потолке. Но знание о мире и умение управлять механическим телом — это разные вещи. Между «понимаю, что нужно сделать» и «могу это сделать» лежит пропасть.
Именно этот разрыв пытается закрыть Show-Harness — система, описанная в препринте на arXiv.
Как это работает
Ключевая идея Show-Harness проста и элегантна: не нужно переучивать языковую модель для работы с роботом. Вместо этого создаётся прослойка — «обёртка» (harness), — которая превращает абстрактные намерения модели в конкретные команды для конкретного робота.
Работает это так:
Модель видит изображение с камеры робота и получает задачу на естественном языке — например, «открой ящик». Затем она выбирает из набора семантических единиц действия — что-то вроде «взять предмет», «переместить руку в точку», «сжать захват». Эти единицы уже понятны модели, потому что они описаны на языке, на котором она обучена.
Дальше в дело вступает «переводчик» — компонент, специфичный для каждого типа робота. Он берёт семантическое действие и deterministic, то есть детерминированно, превращает его в низкоуровневые команды: углы сервоприводов, скорости моторов, траектории движения.
Получается двухуровневая архитектура: модель отвечает за «что сделать», а аппаратный интерпретатор — за «как именно». Это изящное разделение, потому что оно позволяет использовать одну и ту же модель для совершенно разных роботов — достаточно написать новый «переводчик».
Для кого это важно
Показательно, что система работает в двух режимах.
Первый — с мощными закрытыми моделями вроде GPT-4o или Claude. Их нельзя дообучить, но можно использовать «из коробки». Show-Harness позволяет отправлять им изображения с камеры и получать осмысленные управляющие команды без какой-либо дополнительной подготовки. Авторы называют это «zero-shot» — управление с нуля.
Второй режим — с небольшими открытыми моделями. Здесь хватает нескольких часов файн-тюнинга на одном GPU, чтобы модель научилась хорошо выбирать семантические действия. Это принципиально дешевле, чем обучение специализированных VLA-моделей (Vision-Language-Action), которые пытаются совместить понимание мира и управление в одном «тяжёлом» сетевом архитектуре.
GUMI: робот как игра
Отдельно стоит упомянуть компонент GUMI — GUI Manipulation Interface. Это система сбора демонстраций, в которой человек управляет виртуальным роботом через графический интерфейс, как в компьютерной игре. Не нужно дорогостоящее оборудование телеуправления с датчиками и манипуляторами — достаточно мыши и экрана.
Такой подход упрощает сбор обучающих данных. Вы показываете роботу, как выполнять задачу, «играя» за него на компьютере, а затем эти демонстрации используются для обучения. Звучит футуристично, но логика понятна: если нейросеть учится по видеоиграм, почему бы роботу не учиться по «симулятору наоборот» — когда человек играет за робота.
Результаты и скептицизм
Авторы утверждают, что Show-Harness превосходит существующие подходы — как агентные системы на основе LLM, так и специализированные VLA-модели — по обобщению на новые задачи, новые «тела» роботов и новые окружения.
Здесь стоит оговориться. Это препринт на arXiv, то есть научная работа, которая ещё не прошла полноценное рецензирование. «Превосходит» в академическом контексте означает «лучше по выбранным метрикам на выбранных бенчмарках». Реальный мир — это не бенчмарк: освещение бывает непредсказуемым, объекты — незнакомыми, а задачи — размытыми.
Тем не менее сама архитектурная идея — разнести «понимание» и «исполнение» — кажется перспективной. Она позволяет использовать самые мощные модели без модификации и адаптироваться к новым роботам простой заменой «переводчика». Это напоминает подход из классического ПО: абстрактный интерфейс и конкретные реализации.
Что это значит для индустрии
Сейчас робототехника и языковые модели развиваются почти параллельно. Роботы становятся подвижнее, модели — умнее, но стыкуются они с трудом. Каждый новый робот требует своего обучения, своих данных, своего пайплайна. Show-Harness предлагает один из вариантов универсального «штекера».
Если подход приживётся, это может снизить порог входа в робототехнику. Маленькая лаборатория или стартап смогут взять готовую языковую модель, написать простой интерпретатор для своего робота — и получить систему, способную выполнять осмысленные задачи. Без суперкомпьютеров, без месяцев обучения, без тонн размеченных данных.
Конечно, путь от архивного препринта до промышленного решения долог. Но направление движения понятно: будущее робототехники — не в гигантских специализированных моделях, а в грамотных интерфейсах между уже существующим интеллектом и физическим миром.