10.09.2026 523 материалов

Новый подход позволяет языковым моделям управлять роботами — без сложного обучения

Исследователи из ShowLab представили систему Show-Harness, которая через компактный семантический интерфейс позволяет языково-визуальным моделям управлять роботами — без дорогостоящей подготовки и специализированного оборудования.

Новый подход позволяет языковым моделям управлять роботами — без сложного обучения

Правильный интерфейс оказывается важнее размера модели: даже небольшая языковая модель, «подключённая» к роботу через грамотный переводчик намерений в действия, способна справляться с задачами не хуже специализированных систем.

Зачем языковой модели руки

Представьте, что вы просите голосового помощника «принести кружку со стола». Человеку такая просьба не составит труда — мы интуитивно понимаем, что нужно подойти, протянуть руку, схватить, нести. Но для робота каждый из этих шагов — отдельная инженерная задача.

Языково-визуальные модели (VLM), такие как GPT-4o или Gemini, уже умеют «понимать» изображения и отвечать на вопросы о мире. Они знают, что кружка — это предмет, который берут за ручку, что стол стоит на полу, а не на потолке. Но знание о мире и умение управлять механическим телом — это разные вещи. Между «понимаю, что нужно сделать» и «могу это сделать» лежит пропасть.

Именно этот разрыв пытается закрыть Show-Harness — система, описанная в препринте на arXiv.

Как это работает

Ключевая идея Show-Harness проста и элегантна: не нужно переучивать языковую модель для работы с роботом. Вместо этого создаётся прослойка — «обёртка» (harness), — которая превращает абстрактные намерения модели в конкретные команды для конкретного робота.

Работает это так:

Модель видит изображение с камеры робота и получает задачу на естественном языке — например, «открой ящик». Затем она выбирает из набора семантических единиц действия — что-то вроде «взять предмет», «переместить руку в точку», «сжать захват». Эти единицы уже понятны модели, потому что они описаны на языке, на котором она обучена.

Дальше в дело вступает «переводчик» — компонент, специфичный для каждого типа робота. Он берёт семантическое действие и deterministic, то есть детерминированно, превращает его в низкоуровневые команды: углы сервоприводов, скорости моторов, траектории движения.

Получается двухуровневая архитектура: модель отвечает за «что сделать», а аппаратный интерпретатор — за «как именно». Это изящное разделение, потому что оно позволяет использовать одну и ту же модель для совершенно разных роботов — достаточно написать новый «переводчик».

Для кого это важно

Показательно, что система работает в двух режимах.

Первый — с мощными закрытыми моделями вроде GPT-4o или Claude. Их нельзя дообучить, но можно использовать «из коробки». Show-Harness позволяет отправлять им изображения с камеры и получать осмысленные управляющие команды без какой-либо дополнительной подготовки. Авторы называют это «zero-shot» — управление с нуля.

Второй режим — с небольшими открытыми моделями. Здесь хватает нескольких часов файн-тюнинга на одном GPU, чтобы модель научилась хорошо выбирать семантические действия. Это принципиально дешевле, чем обучение специализированных VLA-моделей (Vision-Language-Action), которые пытаются совместить понимание мира и управление в одном «тяжёлом» сетевом архитектуре.

GUMI: робот как игра

Отдельно стоит упомянуть компонент GUMI — GUI Manipulation Interface. Это система сбора демонстраций, в которой человек управляет виртуальным роботом через графический интерфейс, как в компьютерной игре. Не нужно дорогостоящее оборудование телеуправления с датчиками и манипуляторами — достаточно мыши и экрана.

Такой подход упрощает сбор обучающих данных. Вы показываете роботу, как выполнять задачу, «играя» за него на компьютере, а затем эти демонстрации используются для обучения. Звучит футуристично, но логика понятна: если нейросеть учится по видеоиграм, почему бы роботу не учиться по «симулятору наоборот» — когда человек играет за робота.

Результаты и скептицизм

Авторы утверждают, что Show-Harness превосходит существующие подходы — как агентные системы на основе LLM, так и специализированные VLA-модели — по обобщению на новые задачи, новые «тела» роботов и новые окружения.

Здесь стоит оговориться. Это препринт на arXiv, то есть научная работа, которая ещё не прошла полноценное рецензирование. «Превосходит» в академическом контексте означает «лучше по выбранным метрикам на выбранных бенчмарках». Реальный мир — это не бенчмарк: освещение бывает непредсказуемым, объекты — незнакомыми, а задачи — размытыми.

Тем не менее сама архитектурная идея — разнести «понимание» и «исполнение» — кажется перспективной. Она позволяет использовать самые мощные модели без модификации и адаптироваться к новым роботам простой заменой «переводчика». Это напоминает подход из классического ПО: абстрактный интерфейс и конкретные реализации.

Что это значит для индустрии

Сейчас робототехника и языковые модели развиваются почти параллельно. Роботы становятся подвижнее, модели — умнее, но стыкуются они с трудом. Каждый новый робот требует своего обучения, своих данных, своего пайплайна. Show-Harness предлагает один из вариантов универсального «штекера».

Если подход приживётся, это может снизить порог входа в робототехнику. Маленькая лаборатория или стартап смогут взять готовую языковую модель, написать простой интерпретатор для своего робота — и получить систему, способную выполнять осмысленные задачи. Без суперкомпьютеров, без месяцев обучения, без тонн размеченных данных.

Конечно, путь от архивного препринта до промышленного решения долог. Но направление движения понятно: будущее робототехники — не в гигантских специализированных моделях, а в грамотных интерфейсах между уже существующим интеллектом и физическим миром.