Продължете към съдържанието

Tencent Robotics X с отворен код Три въплътени фундаментални модела: Главният учен Zhang Zhengyou обяснява 3-слойната мозъчна архитектура Скорост на реакция на робота

  • от



Tencent Robotics X с отворен код Три въплътени фундаментални модела: Главният учен Zhang Zhengyou обяснява 3-слойната мозъчна архитектура Скорост на реакция на робота

Tencent Robotics X Laboratory отвори три въплътени основни модела на WAIC 2026: Hy-Embodied-VLM-1.0 за разбиране на пространството и сцената, Hy-Embodied-RxBrain-1.0 за когнитивно планиране с въображение за визуално състояние и Hy-Embodied-VLA-0.5 за преобразуване на цели от високо ниво в непрекъснати двигателни команди. Главният учен д-р Zhang Zhengyou представи архитектурата като решение на фундаментален проблем, неадекватно адресиран от настоящите VLA подходи: различните видове роботизиран интелект трябва да работят на различни честоти, тъй като самият физически свят работи в множество времеви мащаби.

Прозрението произтича от неуспешен експеримент за пренасяне на способностите на робота в OpenClaw, който причини десетки секунди забавяне, неприемливо за физически роботи, където дори 2-3 секунди когнитивна латентност вече е проблематична.

Трислойната архитектура се справя с това чрез разделяне на честотите. Hy-Embodied-VLM се справя с пространственото разбиране при по-ниска честота, интерпретира визуални сцени и взаимоотношения на обекти. Hy-Embodied-RxBrain представлява значителна иновация в когнитивната архитектура: той не само генерира стъпки на задачата на език, но си представя как трябва да изглежда физическият свят след завършване на всяка подзадача, използвайки визуални представяния на състоянието, а не текстови описания. Това е насочено към основното ограничение на системите за планиране само с език, където текстовите описания не могат ефективно да кодират пространствените отношения и физическите ограничения, които визията може да предаде незабавно. Hy-Embodied-VLA работи на най-високата честота, преобразувайки цели от високо ниво в непрекъснати действия от ниско ниво със скорости, достатъчни за физическо взаимодействие в реално време.

Tencent разкри, че Hy-Embodied-VLA е навлязъл в производствени тестове в ежедневна химическа фабрика, работеща с високо смесени, ниско партидни, интензивни линии за сглобяване на SKU с време за цикъл на отделна част под 6 секунди. Моделът може да се адаптира към нови SKU само с 8 часа събиране на данни и фина настройка. Средата за тестване се различава критично от лабораторните демонстрации: обектите са позиционирани на случаен принцип, осветлението варира, възникват прекъсвания на производството и роботът трябва да постигне почти нулев процент на отказ. Д-р Джан подчерта, че демонстрация с 80-90 точки без действително внедряване е на практика нулева стойност и фабричното тестване представлява ангажимент за измерима промишлена производителност, а не сравнителни резултати.

Когнитивният модел RxBrain се занимава с втори напреднал проблем: тясното място на езика в роботизираните разсъждения. Предишните системи Tairos разчитаха на текст за междумозъчна комуникация, но описването на пространствените отношения на обекти с думи е многословно и двусмислено. Чрез включването на въображението на визуалното състояние в цикъла на планиране, RxBrain постига по-висока честотна лента на трансфер на информация между възприятие и действие. Моделът е описан по-скоро като въплътен модел на световно познание, отколкото като пълен модел на света, тъй като областта все още не е обединена в единна архитектура на световния модел. Заедно трите модела и платформата с отворен код Tairos образуват Tencent цялостен вграден интелектуален стек, достъпен за приемане от всеки разработчик или производител, като общността на роботиката вече може да надгражда върху същата архитектура, съобразена с честотата, която Tencent разработи чрез отказ в реалния свят и итеративно усъвършенстване.



Source link