Что сегодня реально умеют гуманоидные роботы? Видят ли они, слышат и чувствуют окружающий мир так же, как мы? И главное — смогут ли в ближайшем будущем забрать на себя работу, которую пока умеет только человек?
Наверняка вам попадались эти эффектные видео: роботы танцуют, прыгают, готовят кофе, берут со стола предметы и упаковывают их в посылки. Чем не Новый мир? За последние годы аппаратная база действительно сильно продвинулась: можно наблюдать переход от простых движений к сложной динамике и более естественному взаимодействию с окружающей средой.
Но на реальном производстве такие роботы пока скорее обуза, чем помощники. За красивой картинкой кроются системные проблемы Physical AI: нехватка данных, несовершенные сенсоры и отсутствие целостного восприятия мира.
Привет! Я Артем Лыков — руководитель R&D‑направления Physical AI в MWS. И сегодня попробуем разобраться, что уже работает, где мы спотыкаемся и что должно измениться, чтобы гуманоиды перестали быть просто дорогими игрушками.

Physical AI и гуманоид: в чем разница
Важно разделять понятия «Physical AI» и «гуманоидный робот». Они часто звучат вместе, но не являются синонимами.
Гуманоидный робот — это физическая форма: машина, внешне похожая на человека и способная выполнять близкие к человеческим действия: ходить, манипулировать объектами, взаимодействовать с пространством.
Physical AI — это интеллектуальная составляющая робота, система, которая воспринимает окружающий мир, понимает контекст, принимает решения и способна реализовать их в физической среде.
Когда мы говорим об универсальном роботе, который должен работать максимально близко к человеку, эти направления объединяются: человекоподобное тело и ИИ, позволяющий этому телу действовать.
Гуманоидное тело в 99% случаев не означает наличие Physical AI. Эффектные демонстрации — танцы, ходьба по лестнице — часто лишь результат имитационного обучения и заранее заданных сценариев. Робот повторяет последовательность действий, но не адаптируется к изменяющейся среде. Например, гуманоидный робот из Перми может приготовить кофе, но сыграть с вами в шахматы не сможет. И наоборот, Physical AI может существовать без гуманоидной формы — на промышленном манипуляторе или беспилотном автомобиле.
Настоящая магия начинается там, где робот способен воспринимать мир и выбирать действие в зависимости от ситуации. Именно это отличие между красивой имитацией движений и реальным взаимодействием с физическим миром является одним из ключевых вопросов развития робототехники.

Почему индустрия уходит от единого «мозга» для роботов
Один из ключевых трендов развития робототехники — это смена подхода к созданию интеллекта робота. Раньше считалось, что если собрать достаточно качественных данных, можно обучить огромную end‑to‑end модель — универсальный «мозг», который управлял бы роботом. На вход — видео, текст, звук, тактильные сигналы, положение в пространстве, заряд батареи. А на выходе модель сразу бы могла выдавать понимание ситуации и управляющие действия. Но больших успехов в таком подходе пока никто не добился.
В отличие от LLM, использующих огромные объемы данных из интернета, для обучения роботов пока не существует готовых датасетов нужного масштаба. Имеющиеся открытые наборы слишком ограничены. Добавляются и аппаратные ограничения: вычислительные мощности на борту и пропускная способность каналов связи с серверами.
Главная задача отрасли — сделать робота полезным. Не похожим на человека, а способным выполнять реальные производственные задачи, взаимодействовать со средой и приносить практическую пользу.
Один из основных трендов на сегодня — агентный подход
Вместо одного универсального «мозга» создается система из нескольких моделей‑агентов, каждая отвечает за свою модальность. Это позволяет быстрее приходить к результату, улучшать или заменять отдельных агентов, не перестраивая всю систему целиком, и адаптировать робота под новые задачи. Например, обновили агента движений — точность улучшилась на 10%, остальная архитектура не изменилась.
Я склоняюсь к тому, что большие end‑to‑end модели рано или поздно появятся. Это та самая идеальная цель, к которой движется индустрия, но прямо сейчас практический путь — агентность.
Еще один важный тренд — поиск новых способов обучения
Они должны позволить роботам осваивать больше навыков из меньшего объема данных. Чтобы робототехника совершила прорыв, нужно отказаться от практики, когда для обучения каждому действию вручную собираются и размечаются огромные датасеты.
Например, многие говорят про обучение по видео: робот смотрит, как человек выполняет задачу, и учится повторять. Но пока полностью обучить робота только по видео не получается — все равно нужны дополнительные данные: аннотации, понимание структуры движения, отслеживание положения суставов.
Возможно, в будущем роботы научатся изучать новые действия на основе уже освоенных, почти как дети, у которых скорость обучения растет экспоненциально, но до этого еще очень далеко.
Зрение как основной канал восприятия
У человека много сенсорных каналов: зрение, слух, осязание, ощущение тела в пространстве, обоняние, вкус. В робототехнике мы пытаемся воспроизвести их, но именно визуальный канал сегодня наиболее развит.
Робот может получить команду текстом, но чтобы выполнить действие, ему нужно понимать контекст среды. Контекст дает визуальная информация. Для этого используются Vision‑Language‑Action (VLA) модели. Они опираются на те же принципы, что и VLM: сохраняется механизм работы с визуальной информацией, используются уже обученные энкодеры изображения, затем модель дообучается для решения робототехнических задач.
Визуальный канал сегодня проще всего поддается моделированию. Еще до появления VLA существовали VLM — визуально‑языковые модели, которые учились понимать изображения: отвечать на вопросы, описывать объекты, связывать картинку с текстом. Ключевое здесь то, что изображение тоже удалось превратить в токены — как текст. Для модели и то, и другое становится последовательностью элементов, которые объединяются в единое векторное представление и идут на генерацию ответа.
Так роботу не нужно заново учиться базовому пониманию мира. Знания о том, что вода жидкая, песок сыпучий, а объекты имеют определенные свойства, уже заложены на этапе обучения LLM и VLM на огромном количестве изображений и текстов. Мы переиспользуем накопленное понимание и адаптируем его под физическое взаимодействие, поэтому визуальные модели стали фундаментом для развития робототехнических систем.
Должен ли робот видеть так же, как человек
Или у него могут быть другие сенсорные возможности — например, как у животных, воспринимающих ультрафиолет или инфракрасный диапазон? Или, наоборот, черно‑белое зрение могло бы упростить обработку данных?
Сегодня основной тренд — приближение к человеческому зрению. Большинство VLA‑моделей работают с RGB‑изображением (три цветовых канала). Но в реальных роботах уже используют дополнительные сенсоры: RGB‑D камеры (цвет + глубина) или лидары, которые дают 360-градусное облако точек. Это позволяет роботу получать полноценное 3D‑представление среды для навигации, локализации и предотвращения столкновений.
И здесь снова у агентного подхода преимущество. Один модуль может отвечать за зрение, другой — за навигацию, третий — за планирование. «Главная» модель объединяет информацию и выдает команды. Но здесь снова возникает та же проблема — данных с облаком точек еще меньше. Поэтому на практике такие решения встречаются редко.
Язык как интерфейс
Текст занимает особое место. Это не столько сенсорная модальность, сколько универсальный интерфейс для передачи команд и контекста.
Именно благодаря естественному языку современные роботы могут взаимодействовать с человеком на высоком уровне. Вместо низкоуровневых команд вроде «поверни мотор на 30 градусов» мы теперь можем сказать роботу: «принеси объект» или «подготовь рабочее место». Для Physical AI текст — это связующий слой между намерением человека и физическим действием. LLM, VLM и VLA уже хорошо работают с абстрактными знаниями: понимают инструкции, рассуждают, связывают понятия. Теперь задача заключается в том, чтобы связать это понимание с реальным физическим миром.
Например, команда «возьми красную чашку и поставь ее на стол» для робота — цепочка задач: найти чашку, определить положение, рассчитать траекторию, выполнить действие с учетом физики.
В современных архитектурах языковая модель часто выступает как высокоуровневый планировщик: разбивает задачу на этапы и передает инструкции специализированным модулям. Текст обладает огромным преимуществом — объемом доступных данных. Языковые модели уже получили фундаментальные знания из текстовых корпусов, и это позволяет переносить их в физическую среду.
Тактильное восприятие: почему роботу нужно чувствовать прикосновения
Фраза «возьми аккуратно» для человека очевидна: мы понимаем свойства материалов, вес предметов и что будет, если нажать слишком сильно. Роботу же этот опыт еще предстоит получить через обучение и реальное взаимодействие со средой. Поэтому среди всех дополнительных сенсорных каналов следующим по значимости я бы поставил тактильность.
Тактильность критически важна. Когда мы поднимаем объект, зрение помогает на старте. Но в момент, когда рука его закрывает, мы полагаемся на тактильную информацию: положение предмета, силу захвата, сопротивление, структуру материала. В повседневной жизни это происходит непрерывно. Вот берем чашку — мы не смотрим на каждое движение руки, мы уже знаем, где она. Нам хватает одного взгляда, а дальше работает осязание.
Поэтому тактильность сегодня — одна из ключевых модальностей в робототехнике. В отличие от других каналов, ее сложно заменить промежуточными представлениями в виде текста или описаний — слишком много информации теряется.
Особенно это важно в задачах, требующих точного взаимодействия с объектами. Робот не может сразу найти предмет и поднести его — ему нужно почувствовать правильность захвата, давление, момент касания и убедиться, что действие выполнено. То же самое с деформируемыми объектами: сложить одежду, протереть поверхность тканью, взять мягкий предмет — здесь одной лишь информации о прикосновении мало. Нужна силовая обратная связь: понимание усилия и реакции объекта на это воздействие.
Одно из самых интересных исследовательских направлений — искусственная кожа. Это сенсорные покрытия, которые измеряют давление, вибрации, скольжение, силу контакта — а в более продвинутых версиях даже температуру или химические воздействия. С научной точки зрения это перспективно, но на производственных роботах такие системы пока не применяются. На практике чаще используют отдельные силовые датчики на пальцах или захватах.
Например, если у робота заранее будет информация о том, с какой силой нужно сжимать предмет, качество его работы заметно улучшится. Следующий уровень — когда тактильная система становится более сложной и позволяет чувствовать текстуру, распределение давления, особенности поверхности, скольжение, контакт, реакцию материала. Без такого уровня восприятия роботы не смогут выполнять сложные физические задачи так же гибко, как человек.
Как робот ощущает собственное тело в пространстве
Есть канал, который не заметен внешне, но без него гуманоидный робот не сможет нормально работать, — ощущение собственного тела. Современные роботы знают свое положение через видео, лидары, кинематику, данные с приводов, понимают момент и усилие на отдельных сочленениях.
У человека за это отвечают вестибулярная система и мозжечок. Мы не думаем о положении руки или распределении веса — информация обрабатывается автоматически. У гуманоидного робота должна быть похожая система: постоянно понимать собственное состояние — где конечности, какой угол каждого сочленения, как распределяется нагрузка, устойчив ли он.
Одна камера с такой задачей не справляется, поэтому внутри робота есть набор сенсоров: энкодеры в приводах, инерциальные измерительные блоки (IMU), датчики момента и усилия, системы оценки положения суставов. Например, если гуманоид поднимает тяжелый груз, камера видит объект и руки, но не знает, какое усилие испытывают приводы, насколько сместился центр масс и не превышает ли нагрузка возможности робота. Он может потерять равновесие и упасть.
Управление гуманоидом — это не только про восприятие и планирование. Робот должен в реальном времени отслеживать состояние своего тела: корректировать положение суставов, перераспределять нагрузку, сохранять баланс. Часть таких возможностей уже есть в современных системах: датчики положения и момента в приводах контролируют каждое сочленение. Однако это пока аналог базовой моторики человека. Невидимые системы обратной связи в итоге определяют, сможет ли гуманоид реально работать в сложной среде — переносить грузы, взаимодействовать с объектами и безопасно выполнять задачи рядом с людьми.
Звук как недооцененный канал восприятия
Если зрение — основной канал, то звук — следующая большая модальность, которая сейчас находится на более раннем этапе развития. Аудиосигнал тоже можно преобразовывать в токены, но в современных VLA‑системах это практически не используется напрямую. Чаще звук проходит через промежуточный слой: сначала переводится в текст, а уже потом обрабатывается.
С голосовыми командами все понятно: система распознает речь, преобразует в текст, передает языковой модели, формирует ответ. Но окружающий мир сложнее. Звуки — это не только речь, но и шумы, вибрации, столкновения, деформации, работа механизмов. Для человека они напрямую связаны с действиями. У роботов такая связь пока не сформирована из‑за нехватки данных. Большинство робототехнических датасетов ориентированы на манипуляции, и звук в них либо не записывается, либо не размечен.
Чтобы робот использовал звук для понимания физического мира, нужны датасеты, где аудиосигнал привязан к результату действия. Например, звук трения может подсказать, что объект движется, звук деформации — что материал меняет форму, а хруст при сжатии ореха — что задача выполнена.
Создавать такие наборы данных сложно. Даже самые большие существующие датасеты для VLA‑моделей требуют огромных объемов информации — на воспроизведение одного из них могут уйти месяцы. А добавление звука как новой модальности требует отдельного масштабного сбора.
Кроме того, роботу нужно не только слышать, но и понимать, откуда идет звук. Для этого уже используют системы с несколькими микрофонами — как человек определяет направление двумя ушами. В будущем робот должен будет не просто распознавать звук, а понимать, что происходит: отличать реальный шум от звука из телевизора, определять источник, связывать его с действиями. Звук пока уступает зрению, но у него огромный потенциал для развития Physical AI.
Запах и вкус
Запах и вкус роботы только начинают осваивать: нужно не просто уловить сигнал, а понять, какому веществу он соответствует.
Для запахов уже есть подходы на основе «электронного носа» — набора высокоточных сенсоров, измеряющих состав окружающей среды. Данные обрабатываются нейронными сетями, которые ищут закономерности и связывают комбинации химических сигналов с запахами. Но снова проблема данных в том, что для обучения нужно собирать реальные объекты, фиксировать их химический состав и размечать.
Со вкусом еще сложнее, ведь человеческое восприятие — это комбинация химических сигналов и субъективного опыта. Поэтому чаще пока используют подход, где вкус описывают через набор тегов или характеристик, а модель учится связывать эти признаки с объектом.
Сейчас эти каналы восприятия развиваются не в приоритете, но уже можно представить, для каких роботов они станут действительно необходимы. Например, для роботов‑поваров, который будут не просто готовить по рецепту, а оценивать аромат и вкус, учиться у шеф‑поваров и сравнивать их с эталоном.
Конечно, до массового применения в робототехнике этим направлениям предстоит пройти большой путь.
От восприятия к предсказанию: как развиваются модели для роботов
Несмотря на разную скорость и формат сигналов, человеческий мозг объединяет в целостную картину мира зрение, слух, осязание и другие ощущения. Одна из главных задач в развитии гуманоидных роботов — создать систему, которая делает то же самое: собирает данные от всех сенсорных каналов и обрабатывает их так, чтобы робот воспринимал мир целиком.
Foundation‑модели в будущем должны стать именно таким «дирижером»
Пока полноценно работающих примеров нет, но индустрия движется в этом направлении. Сегодня из‑за ограничений вычислительных мощностей часть сложных задач (планирование, рассуждение) выносятся в облако — там доступны большие ресурсы, и задержка в несколько секунд не критична. А для управления физическим телом — движением руки, удержанием равновесия — решения должны приниматься мгновенно. Поэтому модели, отвечающие за управление, должны работать локально. Например, NVIDIA создает модули Jetson, в частности Jetson Thor, которые обеспечивают вычислительную мощность до 2070 FP4 TFLOPS.
Следующий шаг развития — World‑Action модели.
Это переход от систем, которые просто выбирают действие, к системам, которые сначала оценивают, что произойдет в физическом мире.
VLA‑модели работают по принципу: восприятие + инструкция = действие, а World‑Action умеют моделировать возможные варианты ее развития. По сути это попытка создать внутреннюю симуляцию физической реальности. Модель видит множество примеров взаимодействия людей с объектами и учится предсказывать, как будет выглядеть аналогичное действие в новом контексте.
Пока что генерация таких сценариев занимает несколько минут, что совершенно не подходит для работы в реальном времени. Так что это очень амбициозная задача. Архитектура, которая объединяет специализированных агентов под управлением Foundation‑модели, сегодня считается одним из приоритетных направлений развития Physical AI.
Гуманоид на практике: от закрытия «хвостов» к магазину профессий
На современном производстве все, что можно было автоматизировать классическими методами, уже автоматизировано. Появились роботизированные линии, конвейеры, манипуляторы, системы доставки, беспилотные автомобили. Но почти всегда остаются «хвосты» — небольшие задачи, которые сложно автоматизировать экономически: поправить упавшую коробку, принести материал, нажать кнопку, проверить оборудование, выполнить действие в нестандартной ситуации.
Производство уже роботизировано на 80–90%, но остаются операций, где все равно нужен контроль со стороны человека. Тут гуманоидные роботы как раз пришлись бы очень кстати — благодаря им не придется менять инфраструктуру. Ведь робот сможет ходить по тем же проходам, использовать те же двери, кнопки, рычаги и инструменты, которые рассчитаны на человека.
Однако в реальности возможностей гуманоидов пока ограничены. В интернете много эффектных видео, но часть из них — постановочные сцены, где показаны очень узкие сценарии с хорошим результат.
От отдельных функций к профессиям
Следующий шаг — переход от разовых задач к полноценным «профессиям». Роботы станут платформой, в которую можно будет добавлять новые навыки и профессии — как в магазине приложений.
Например, робот в гостиничном сервисе будет иметь базовый набор навыков: отвечать людям и выполнять простые операции. Чтобы он смог работать на производстве, нужно будет докупить дополнительный модуль, куда войдет понимание инструкций, умение перемещать объекты и взаимодействовать с оборудованием. Ну а чтобы робот работал поваром, нужен будет модуль с восприятием запахов, вкусов, текстуры и оценкой результата.

Когда гуманоиды станут частью повседневной жизни
Некоторые уверяют, что через пару лет по всему миру будут работать миллионы машин, но к таким оценкам лучше относиться с долей скептицизма — их авторы часто сами связаны с производством роботов и смотрят на перспективы через призму собственных бизнес‑интересов. А реальность пока выглядит намного скромнее.
Пока что гуманоидный робот — очень дорогая технология из‑за сложного железа, дорогих компонентов, мощных вычислений и огромного объема инженерной работы. Пока в большинстве сценариев проще и дешевле нанять человека.
Однако ситуация со стоимостью и доступностью может быстро поменяться. Когда‑то смартфоны были дорогим устройством для избранных, а сегодня они есть практически у каждого. Так что отрасль ждет первого большого прорыва: робота, который сможет самостоятельно выполнять сложную работу в реальных условиях.
Возможно, однажды робот в доме, на производстве или в сфере обслуживания будет восприниматься не как фантастика, а как привычный элемент инфраструктуры. А вы что думаете по этому поводу?
Viveksha
через пару лет роботы будут доступны как обычный автомобиль
bobcatt
Они то и сейчас доступны. Всего то за 7 миллионов вам домой доставят Unitree G1 Edu Flagship D, достаточно продвинутого андроида.
Вот только зачем он вам дома?