
Muka Robotics, четиримесечен стартъп, постигна второ място в света на WorldArena с модел LJM само на 32 графични процесора Zhenwu 810E. Постигайки 89,17 качество на движение, 92,60 3D точност и 85,93 контролируемост на LIBERO бенчмарк, той надмина конкурентите с 10-100x изчисление. Изпратено анонимно като SisyphusWorld. Основана от Chi Xiaowei с екип от MMLab, Tsinghua и PKU.
LJM адресира фундаментален провал: оптимизацията на ниво пиксел вреди на физическото разбиране. Стандартните дифузионни модели дават приоритет на 99% пикселна текстура над 1% в контактната точка на захващане-обект. LJM въвежда двоен експерт, разделящ разсъждението от изобразяването. Експерт по латентно разсъждение, базиран на Qwen3-VL-2B, работи в непрекъснато латентно пространство, за да симулира процеса на взаимодействие, даден на езикови инструкции, визуална история и планирани последователности от действия. Световен експерт по моделиране, базиран на Wan2.2-TI2V-5B, прави логичното взаимодействие в реалистични видео кадри. Ключовото прозрение е, че експертът по разсъждения трябва първо да разбере какво се случва, когато захващащото устройство се затвори и обектът се движи, след което експертът по изобразяване визуализира разбраното взаимодействие, обръщайки стандартната парадигма генериране-първо-разбиране-по-късно.
Архитектурата налага три физически ограничения за всеки латентен токен. Всеки разсъждаващ токен трябва едновременно да предвижда три бъдещи измерения: 3D позиция на крайния ефектор (състояние на робота), промени във визуалното състояние на обектите на сцената (визуална динамика) и посока на движение на пиксел (предварително изчислен оптичен поток). Тези ограничения се извличат директно от реални данни за обучение и не позволяват на модела да халюцинира физически невъзможни резултати, като същевременно поддържа високо визуално качество. Двамата експерти комуникират чрез механизъм за споделено внимание Mixture-of-Transformers, където логическите токени и видео токените си взаимодействат на всеки трансформаторен слой, което позволява двупосочен информационен поток през целия процес на генериране. Това замества последователния тръбопровод, при който разсъждението произвежда изход и го предава веднъж към изобразяване, като гарантира, че визуалното генериране остава непрекъснато ограничено от физическо разсъждение.
LJM демонстрира, че способността на световния модел изисква правилна архитектура, а не масивни изчисления. Архитектурните иновации компенсират китайските изчислителни ограничения. Предишните подходи преподаваха физика на видео моделите, което е структурно невъзможно. Предоставяйки на физиката собствен експерт с ясни цели, LJM постига висока физическа точност и визуално качество без компромис.
