
Юни 2026 г. стана свидетел на изключителна експлозия в изданията на въплътени AI модели: 13 нови основни модела и световни модели бяха обявени за един месец, приблизително по един на всеки 48 часа. Вълната сигнализира за фундаментална промяна в индустрията на въплътения AI от конкуренция за хардуерни възможности към конкуренция за софтуерна интелигентност, като компаниите наблягат на уникалните технически подходи, а не на постепенните подобрения на хардуера.
BAAI пусна два напредъка на световния модел на конференцията Zhiyuan през 2026 г. Wujie Physis-v0.1 се фокусира върху предсказване на следващото физическо състояние чрез компресиране на видео, RGB-D, 3D облак от точки и силово-тактилна обратна връзка в унифицирано латентно пространство. Wujie RoboBrain Orca функционира като мозък на робот с унифицирано представяне, причинно-следствени разсъждения и мултимодално декодиране, използвайки сливане на език и визуални представяния в латентно пространство.
Alibaba пусна пакета Qwen-Robot на 16 юни, възприемайки фундаментално различен подход от мащабирането чрез груба сила, предпочитано от много конкуренти. Вместо просто да добавя повече данни и повече роботи, Alibaba твърди, че хетерогенността на физическия свят не може да бъде разрешена само чрез мащаб и изисква стратегии за подравняване на ниво модел. Qwen-RobotNav адаптира разпределението на визуалното внимание за мобилен контрол. Qwen-RobotManip стандартизира пространството за състояние-действие за манипулация. Qwen-RobotWorld използва интерфейси за действие на естествен език за прогнозиране на световната динамика.
CasiaHand стартира Brain-Si 0.5, първият в света човекоподобен сръчен манипулационен модел с трислойна архитектура: мозък от най-високо ниво за планиране на VLA-световен модел, базови модели от средно ниво за шест основни възможности за манипулиране, включително предварително захващане, общо захващане, функционална операция, отзивчиво предаване, бимануална координация и сливане човек-робот и физическо ниво на долно ниво интерпретируеми модели.
GalaxyBot пусна AstraBrain-WBC 0.5, основен модел на малкия мозък за хуманоиден контрол в реално време на цялото тяло, използвайки каузална трансформаторна архитектура в стил GPT, обучена на приблизително 2 милиарда кадъра от данни за човешки действия, достигайки 80 милиона параметъра. RoboScience разкри своята архитектура Visics с рамката VLOA, разделяща световния модел от операционния модел чрез представяне на траекторията на обекта. Current Robotics публикува Curl-0 за сръчна манипулация на цялото тяло като свързан проблем с обучението. BoundlessPower пусна световния модел на MWA за двупосочни физически причинно-следствени вериги с дълга последователност.
Общата нишка във всички подходи е преминаването от демонстриране на това какво могат да правят роботите към обяснение защо роботите все още се провалят при определени задачи, като всеки екип идентифицира различни тесни места, тактилна обратна връзка, координация на цялото тяло, прехвърляне от симулация към реалност или дългосрочно планиране и изграждане на специфични архитектури за справяне с тях.
