Новые подходы Microsoft к улучшению взаимодействия роботов с окружающей средой

Роботы сталкиваются с задачами, которые людям кажутся простыми, например, определение связи действия с конкретным объектом и местом в пространстве. Microsoft, в сотрудничестве с университетскими исследователями, представила новый тест GroundedPlanBench, предназначенный для проверки навыков моделей в построении планов действий и привязке каждого шага к объекту на изображении.

Традиционно робот сначала получает текстовый план, а затем другой алгоритм переводит его в физические действия. Эта двухступенчатость часто приводит к ошибкам, когда первая модель не всегда правильно интерпретирует задачи. Например, при задании выбросить стаканчики робот может запутаться в том, какой из них взять. Эти проблемы усиливаются в сложных условиях, когда много похожих объектов.

В новом тесте акцент сделан на жесткой связи действий с конкретными предметами. Команда подготовила более 1000 заданий, основанных на реальных взаимодействиях с объектами. Простые задачи, как «положить ложку на тарелку», выполняются без проблем, но сложные, вроде «убраться на столе», показывают, что машины все еще далеки от человеческого понимания. Например, при задании «положить 4 салфетки на диван» система продолжала выбирать одну и ту же салфетку вместо разных.

В ответ на трудности команда предложила метод V2GP, обучающий систему на видео, где роботы выполняют реальные задачи. Такой подход позволил значительно увеличить точность выбора объектов. Тем не менее, остаются нерешенные проблемы, особенно при сложных и многошаговых инструкциях.

Исследования показывают, что более тесная интеграция планирования и пространственной привязки может улучшить производительность роботов, а дальнейшая работа предусматривает использование предсказательных моделей для оценки результатов действий до их выполнения.

Понравилась статья? Поделиться с друзьями: