
Привет, Хабр! Как‑то я пересмотрела десяток роликов с роботами подряд — просто чтобы понять, что из увиденного вызывает у меня доверие, а что нет. Робот Figure, который делает кофе за минуту, гуманоид Tesla, эффектно падающий во время презентации в Майами, гимнастическая программа Atlas от Boston Dynamics с сальто и рывком через кувырок. Все три ролика показывают одну и ту же индустрию, но оставляют совершенно разное впечатление.
Разница не в том, что один робот «настоящий», а другой «фейк». Дело в другом: за последние два‑три года индустрия научилась производить зрелищные кадры гораздо быстрее, чем сама технология научилась делать то, что на этих кадрах показано. И читатель, который хочет понимать, где реально находится робототехника, а не где она хочет казаться, должен научиться разбирать не спецэффекты, а методологию.
Забегая вперед: переломного момента, после которого прогресс в этой области стал бы очевиден без объяснений — по аналогии с тем, что произошло несколько лет назад в языковых моделях, — в робототехнике пока не случилось. Технология развивается быстро и вполне предсказуемо — ее прогресс измеряется не вау‑эффектом, а скучными процентами в отчетах. Попробуем разобраться, как эти проценты читать.
Спектр между постановкой и автономией
Начнем с базового различия, которое проще всего перепутать: телеуправление (teleoperation) и автономия. В первом случае роботом в реальном времени управляет скрытый оператор — часто через VR‑гарнитуру. Во втором — решения принимает нейросеть на борту, без участия человека в моменте.
Проблема в том, что со стороны это почти невозможно отличить. В декабре 2025 года на презентации Tesla в Майами гуманоид Optimus раздавал воду посетителям, потерял равновесие и начал падать — а в момент падения обе его руки метнулись к голове характерным движением снятия VR‑шлема, хотя на голове робота никакого шлема не было. Наблюдатели, знакомые с системами телеуправления, сразу узнали в этом жесте типичное движение оператора,резко снимающего VR‑гарнитуру в разгар управления роботом. У компании к тому моменту уже была задокументированная история привлечения операторов‑людей к публичным демонстрациям без явного анонсирования этого факта: на мероприятии Robotaxi годом ранее один из роботов Optimus прямо признался посетителям, что пока управляется человеком. Ключевая претензия наблюдателей — не сам факт использования телеуправления как такового, а отсутствие последовательной политики, где Tesla явно обозначала бы, какие записи показывают автономное поведение, а какие нет.
Сопоставимая по резонансу, хотя и менее острая история произошла еще в январе 2024 года с роботом Figure 01, когда компания опубликовала видео, где робот заваривает кофе, назвав это «end‑to‑end AI» — обучением через простое наблюдение за видео с людьми. Инженер Figure Кори Линч прямо написал в X, чтовсе действия обучены нейросетью, а не управлялись оператором, и снято это на нормальной скорости одним дублем; позже это же подтвердил сооснователь компании Бретт Адкок. Независимого технического аудита ролика при этом никто не проводил — это осталось декларацией самой компании, хоть и не опровергнутой.
Отдельного разговора заслуживает ускорение видео без указания коэффициента — пожалуй, самая массовая и при этом наименее скандальная форма приукрашивания, куда более распространенная, чем подмена автономии телеуправлением. Хорошо иллюстрирует это пример китайской Unitree: под некоторыми записями компания честно указывает, ускорено видео или нет. Но такая пометка стоит не под каждым клипом, и зритель, который ее не заметил или не нашел под очередной вирусной публикацией, остается один на один с вопросом, смотрит ли он на реальную физику или на подретушированную. Дошло до курьеза, когда в одной из съемокUnitree с гуманоидом на роликовых коньках часть зрителей решила, что перед ними компьютерная графика — настолько плавным было движение по сравнению с привычной семенящей походкой роботов. Здесь недоверие возникло не из‑за реального обмана, а из‑за того, что физика догнала ожидания зрителя от голливудского CGI.
Для контраста полезно вспомнить обратный пример — демонстрацию Atlas от Boston Dynamics еще в 2019 году, когда робот выполнял гимнастическую программу с сальто, стойкой на руках и прыжком с поворотом. Компания сразу жесообщила конкретную цифру: связка получается с первого раза примерно в 80% случаев, то есть четыре попытки из пяти, — и на корпусе робота были заметны царапины от неудачных дублей. Позже, прощаясь со старой гидравлической версией Atlas, компания выпустила отдельную подборку неудачных дублей и падений вместо того, чтобы прятать их. Это скорее исключение, чем норма индустрии, но именно оно показывает, каким мог бы быть стандарт: не «либо безупречная запись, либо ничего», а конкретная цифра успеха плюс честный взгляд на то, что осталось за кадром.
И вот здесь мы подходим к главному: постановка постановке рознь. На одном полюсе — чистое телеуправление, выданное за автономию. Дальше — реальная автономная работа, но в тщательно подготовленной сцене с одним и тем же столом, одними и теми же объектами, без единой неожиданности. И только на другом полюсе — работа в непредсказуемой среде: новые дома, предметы и случайные препятствия. Зритель, посмотрев тридцать секунд записи, обычно не может отличить первый и второй вариант от третьего. А разница между ними — это как раз то, что отделяет лабораторный трюк от реальных возможностей.
Что вообще значит «метрика» в этой сфере
Допустим, компания честно говорит: наш робот решает задачу с точностью 88%. Хорошо это или плохо?
Смотря для чего. Компания Physical Intelligence, один из лидеров в разработке так называемых foundation‑моделей для роботов (моделей, предобученных на широком массиве данных перед адаптацией к конкретной задаче), в карточке своей модели π0.6 отмечает, что складывание белья и сборка коробки долгое время требовали дообучения на качественных данных, чтобы вообще получить ненулевой результат, а полная сборка коробки без дополнительного дообучения удается модели лишь в 20% случаев.
Стартап Sunday Robotics подошел к той же задаче иначе и показал 99,1% успеха на 785 попытках складывания одежды в незнакомых домах, куда робота прежде не завозили, — но и здесь самой сложной категорией оказались блузки с показателем 94,7%, тогда как простая по форме одежда доходила до 100%. Одна и та же в целом задача — «складывание белья» — а разброс в несколько процентных пунктов только из‑за формы и жесткости конкретной вещи.
Еще нагляднее пример бенчмарка RoboDojo, представленного в июле 2026 года большой международной командой исследователей и включающего 18 задач в реальном мире и 42 в симуляции. Авторы намеренно собрали задачи с длинным горизонтом планирования, зависимостью от памяти и высокой точностью исполнения — то есть максимально приближенные к реальным бытовым и производственным условиям. Результат: лучшая модель на момент публикации показывает лишь 12,8% успеха в реальных условиях, тогда как телеуправление человеком‑оператором на тех же задачах дает 76%. Разрыв почти в шесть раз между лучшей моделью и человеком под управлением — вот более честная картина состояния индустрии, чем любая отдельная вирусная запись.
Готовя этот материал, я поймала себя на том, что раздражают меня не сами по себе скромные цифры вроде 12,8% — с ними как раз все понятно, это честная фиксация текущего уровня сложности задачи. Раздражает другое: когда за красивым роликом вообще не стоит никакой цифры, и приходится либо верить компании на слово, либо самостоятельно разбирать кадр за кадром в поисках жеста, снимающего VR‑шлем.
Чтобы читать проценты осмысленно, аналитики из Epoch AI в отчете о состоянии автономной робототехники за 2026 год предлагают оценивать каждую задачу сразу по трем параметрам: надежность (собственно success rate и типичные сбои), скорость относительно человека, и перенос (transfer) — способность робота справляться с новыми объектами и средами, а не только с теми, на которых его обучали. Именно перенос авторы отчета называют главным узким местом: подавляющее большинство впечатляющих демонстраций показывает робота, дообученного на конкретной задаче в конкретной обстановке, и без явного подтверждения переноса такую способность не стоит предполагать по умолчанию.
Пять стадий готовности вместо одной цифры
Чтобы не оценивать каждую новую демонстрацию заново с нуля, полезно держать в голове рабочую шкалу. В том же отчете Epoch AI задачи для роботов разбиты на пять стадий: от фрагментарных исследований в лаборатории до доказанного коммерческого развертывания. Разница между ними — не в красоте ролика, а в объеме независимо подтвержденных данных за спиной демонстрации.
Уже работает и приносит деньги
На стадии реального коммерческого развертывания сегодня находится не так много задач, но они хорошо иллюстрируют принцип. Складской пикинг — пожалуй, самый зрелый пример: манипулятор Amazon Vulcan, по собственным данным компании, способен забрать и переложить около 75% всех наименований товаров на складе, двигаясь со скоростью, сопоставимой с человеческой, — и, как уточняет отчет Epoch AI, в редких случаях, когда предмет ему не дается, робот сам вызывает человека на подмогу, а не пытается справиться любой ценой. То же самое можно сказать про робота Boston Dynamics Stretch, который разгружает контейнеры с тяжелыми коробками на реальных складах, в том числе у ритейлера GAP. Столь же зрелая область — подводная навигация: аппарат Hydrus компании Advanced Navigation, по данным того же отчета, стоит около 45 тысяч долларов против более миллиона у конкурентов и работает на глубине до 300 метров, снимая с людей необходимость погружаться самим для инспекции трубопроводов и морского дна.
Работает, но пока только локально
Ступенью ниже — пилотное развертывание в ограниченных условиях, где независимость от лаборатории уже доказана, а вот масштаб и география — еще нет. Сюда попадает доставка еды и грузов небольшими автономными платформами, которые уже работают в отдельных городах на реальных заказах, но пока далеки от повсеместного присутствия.
Работает в лаборатории, но не везде и не со всем
Еще ниже по шкале — задачи, «подтвержденные в лаборатории», но пока не вышедшие на коммерческий уровень массово. Здесь разрыв между яркой демонстрацией и повседневной надежностью виден особенно ярко на примере складывания белья и смежных задач.
Компания DYNA Robotics провела 24-часовой непрерывный прогон, за который ее робот сложил свыше 700 салфеток со скоростью около 60% от человеческой при показателе успеха 99,4% и без единого вмешательства человека — при том, что у большинства предыдущих моделей показатель успеха на подобных задачах падал уже после часа‑двух работы. Систему уже установили в реальной прачечной в Сакраменто — но только для однородных, простых по форме предметов вроде полотенец, салфеток и белья. Стоит перейти к разнообразной одежде — джинсам, вывернутым наизнанку футболкам, рубашкам на пуговицах, — и та же Physical Intelligence в своем блоге отмечает, что складывание таких вещейзанимает у роботов заметно больше времени, чем складывание простых полотенец, а компания Weave Robotics сообщает о времени в 30–90 минут на полную загрузку белья.
Иными словами, при переходе от одной формы объекта к другой стадия готовности задачи откатывается на несколько ступеней назад — и это лучше всего объясняет, почему любое видео со стиркой стоит смотреть с вопросом «а что именно там складывают».
Показано фрагментами, а не целиком
На следующей ступени — задачи, где отдельные элементы уже умеют делать, но не всю задачу целиком и не в реальных условиях. Вынос мусора: тот же Tesla Optimus показан достающим пакет из наружного бака и открывающим крышку, но не снимающим пакет с внутренней урны и не перемещающимся по дому в процессе — то есть решена едва ли половина задачи, и решена в контролируемой обстановке без подтвержденного переноса на реальные дома.
Пока только фрагментарные исследования
А на нижней ступени однородность объекта перестает помогать вовсе — задачи требуют одновременно и точности, и импровизации, и от них пока есть только разрозненные лабораторные попытки. Готовка полноценных блюд — характерный пример: ни один робот пока не приготовил, скажем, пасту с нуля, включая нарезку ингредиентов и контроль степени готовности, хотя отдельные элементы — переворачивание продукта на сковороде, дозирование соуса — уже демонстрировались по отдельности.
Где на самом деле проходит фронтир
Автономия работает уверенно там, где среда прощает ошибку, и буксует там, где одновременно нужны точность исполнения и способность приспосабливаться к постоянно меняющейся обстановке. Навигация — с ее низкой ценой единичной ошибки в позиционировании — уже приносит коммерческую пользу даже в экстремальных условиях, вплоть до подводных инспекций. Манипуляция предметами — с необходимостью точного контроля силы контакта и постоянно меняющимися формами объектов — остается куда более сложным рубежом, и поэтому склад, где обстановку можно спроектировать вокруг возможностей робота, оказывается коммерчески зрелее дома, где пользователь не готов перекраивать быт под ограничения алгоритма.
На этом фоне заметен реальный технологический сдвиг, который редко попадает в заголовки, потому что не производит яркой картинки: переход индустрии на foundation‑модели — системы, предобученные на широком корпусе данных прежде, чем адаптироваться под конкретную задачу, по аналогии с тем, как в свое время дообучение предобученной языковой модели стало эффективнее обучения узкой модели с нуля.
Похожий эффект команда Google DeepMind и партнерских лабораторий зафиксировала в проекте Open X‑Embodiment: обобщенная модель RT-1-X, обученная на данных сразу с 22 разных типов роботов, показала результат на 50% выше, чем узкоспециализированные модели, обученные под конкретную задачу и конкретного робота. Boston Dynamics и Toyota Research Institute развили эту логику дальше: их совместная Large Behavior Model для Atlas обучена на смеси данных с самого Atlas и с открытого датасета Open X‑Embodiment, а не на узкой выборке под одну задачу — и именно это, по словам исследователей, стало ключевым источником устойчивого поведения модели в разных сценариях. Это не материал для вирусного распространения, но именно такие сравнения показывают, куда реально движется технология.
Вместо вывода
В робототехнике обычно за эффектным кадром действительно стоит рабочая технология, только показан ее лучший десятисекундный момент, вырванный из часов неудачных попыток и подготовки. Задача читателя — восстановить контекст, который автор ролика решил не показывать: сколько было дублей, на какой скорости снято, перенесется ли этот же трюк на новый объект или новую комнату.
Тем, кто следит за отраслью по научным отчетам и конференциям, видна ровная и не самая зрелищная картина: 80% успеха в гимнастической программе 2019 года превратились в отдельные складские задачи с надежностью выше 99%, 12,8% на трудном бенчмарке стали честной точкой отсчета для следующего поколения моделей, а лабораторная демонстрация складывания салфеток пошла в реальные тесты в прачечной в Сакраменто.
Так что при следующей встрече с вирусным видео стоит задавать себе не вопрос «это настоящее?», а вопрос точнее: на какой из пяти ступеней готовности находится эта задача и что в кадре доказывает перенос на условия, отличные от съемочной площадки, а что лишь на него намекает.