Продължете към съдържанието

Пълномодален модел AgiBot WITA-Omni оглавява глобалната класация на DailyOmni: Побеждава Google Gemini, ByteDance Doubao и Alibaba Qwen в Embodied Cross-Modal Understanding

  • от



Пълномодален модел AgiBot WITA-Omni оглавява глобалната класация на DailyOmni: Побеждава Google Gemini, ByteDance Doubao и Alibaba Qwen в Embodied Cross-Modal Understanding

Саморазработеният пълномодален голям модел на AgiBot WITA-Omni Preview отбеляза 85,21 в изчерпателната класация на DailyOmni, надминавайки Alibaba Qwen, Google Gemini, ByteDance Doubao и NVIDIA, за да претендира за челната позиция с шест резултата за първо място сред осем индикатора за оценка. Бенчмаркът тества способността за едновременно обработване на аудио и визуални сигнали в среда от реалния свят, включително аудио-визуално подравняване при 86.13, разсъждение във времето на събитието при 84.64, крос-модално цялостно разсъждение при 85.06 и водещи резултати при задачи за разбиране на видео от 30 секунди и 60 секунди. За разлика от мултимодалните модели с общо предназначение, оптимизирани за взаимодействие с цифрово съдържание, WITA-Omni е проектиран от самото начало за въплътено взаимодействие, при което роботите трябва да разбират, отговарят и действат във физическа среда в реално време.

Архитектурната иновация е парадигмата Мислител-Говорещ-Актор, която заменя традиционния сериен тръбопровод. Конвенционалното взаимодействие с роботи обработва разпознаване на реч, семантично разбиране, генериране на отговор, синтез на реч и извеждане на действие като последователни етапи, всеки от които добавя латентност и причинява кумулативно забавяне. WITA-Omni изпълнява мултимодално разсъждаващо ядро ​​на Thinker, генериране на поточна реч на Talker и модули за действие и изразяване на Actor паралелно в унифицирана времева линия. Модулът Actor приема не само семантичното състояние на Thinker като вход, но и аудио латентни променливи на Talker, позволявайки на жестовете и израженията на лицето да се синхронизират с ритъма на речта, паузите, ударението и емоционалния тон. Това елиминира липсата на връзка между това, което роботът казва и как се движи.

Архитектурата разширява парадигмата Thinker-Talker, разработена преди това за разговорен AI, като добавя модула Actor като първокласен изходен канал заедно с речта. Thinker обединява текст, изображение, аудио и видео входове чрез специални енкодери и олекотени проекционни слоеве в унифицирано пространство за представяне за междумодални разсъждения и решения за взаимодействие. Talker генерира естествена реч, обусловена от скритите състояния на Thinker. Actor управлява глава за действие и глава за изразяване, задвижвани както от семантичното състояние на Thinker, така и от аудио функциите на Talker. Механизмът за синхронизиране на кръстосания поток гарантира, че жестовете на робота реагират на промените в скоростта на речта, изместването на израза се съгласува с тона, а физическите действия поддържат времева съгласуваност с вербалната комуникация.

Класацията следва световния модел на AgiBot Genie Envisioner-Sim 2.0, който отбеляза първи точки на WorldArena по-рано. Двете постижения заедно създават набор от възможности за изкуствен интелект с три стълба: WITA-Omni за взаимодействие, модел на света за разбиране на физическия свят и хардуер на роботи за действие в него. Победата в класацията потвърждава, че въплътените AI компании могат да развият превъзходни общи възможности чрез оптимизиране за ограничения на взаимодействието в реалния свят, вместо да адаптират модели с общо предназначение. Тъй като роботите се преместват от контролирани фабрични среди към неструктурирани социални пространства, способността да обработват множество сензорни потоци синхронно и да отговарят с координирани вербални и физически действия се превръща в основен диференциращ фактор. AgiBot позиционира напълно модалното синхронно взаимодействие като ново конкурентно измерение във въплътената AI индустрия, отделно от конкуренцията с чисто качество на модела, която доминира в пространството на AI с общо предназначение.



Source link