
Екипът на BYD AI публикува първата си изследователска статия HyWorldVLA на 29 юли, разкривайки неразкрита досега изследователска група за AI с дълбоко ДНК на роботиката на Харбинския технологичен институт. Документът въвежда хибриден световен модел, съчетаващ моделиране на свят на ниво пиксел и латентно пространство с архитектура Vision-Language-Action за автономно шофиране. HyWorldVLA постигна 90,59 PDMS на публичния бенчмарк NAVSIM v1, надминавайки всички предишни най-съвременни резултати. Бенчмаркът измерва реално качество на шофиране чрез безопасност при сблъсък, съответствие на зоната за шофиране, безопасно разстояние, изпълнение на целта и комфорт на движение. Постижението бележи значителна промяна за BYD, която се възприема като фокусирана върху интегрирането на веригата за доставки и мащаба на производството, а не върху изследванията на AI на ниво код.
Архитектурата на модела на хибридния свят е насочена към основен компромис в световните модели на автономно шофиране. Моделите на ниво пиксел предвиждат бъдещи видео кадри за детайлите на околната среда, но страдат от високи изчислителни разходи и чувствителност към визуален шум. Моделите с латентно пространство работят в компресирани скрити представяния за ефективност, но рискуват да загубят детайли от реалния свят, които са критични за решенията за безопасно шофиране. HyWorldVLA запазва и двете, като използва наблюдение на ниво пиксел по време на обучение като куче-пазач, което принуждава латентното пространство да запази достатъчно информация за реконструкция на рамката, докато изпълнява изводи в компресираното пространство за ефективност. Изследването на аблация потвърди, че премахването на предсказването на ниво пиксел намалява PDMS от 90,59 на 87,50, а премахването на обработката на латентно пространство го намалява до 89,91, потвърждавайки, че и двата компонента са необходими.
Обучението протича на три етапа. Първо, видео VAE компресира непрекъснати видео кадри в компактни латентни функции, ръководени от текстови описания като семантичен контекст. Второ, изображението, действието, езикът и латентните характеристики се преобразуват в унифицирани дискретни токени за авторегресивно предсказване на следващия токен, с двоен надзор върху пикселното и латентното предсказване. Предсказанието на пикселния токен служи като гаранция за качество, предотвратяваща колапс на латентно представяне. Трето, модулът за генериране на действие обединява латентни характеристики с историческа информация за извеждане на траектория, потвърдена чрез оценяване на кандидат траектории и директно непрекъснато генериране на траектория.
Надзорното тегло на латентната функция се оказа критично: липсата на ограничение по време на фината настройка отбеляза 90,17, оптималното тегло при 0,1 достигна 90,59, а прекомерното тегло спадна до 89,75. Това предполага, че умереното ограничение запазва предварително обучената семантика, без да ограничава способността на модела да открива релевантни за управлението представяния. Документът също така потвърждава, че екипът на BYD работи върху дългосрочни базови модели за автономно шофиране, а не само върху специфични за производството системи. Публикацията установява BYD като сериозен участник в изследванията на AI за автономно шофиране, като потенциално привлича AI таланти от най-високо ниво и сигнализира за стратегическо намерение за разработване на основната технология за автономно шофиране вътрешно, вместо да разчита изцяло на доставчици. Това позиционира BYD заедно с NIO, XPeng и Li Auto в надпреварата за лидерство в AI при автономно шофиране, но с уникалното предимство да има най-голямата производствена база за внедряване на получените технологии в огромен мащаб.
