XPENG публикува TuringViT, визуален енкодер за модели на визуален език и визуален език на действие, използвани при интелигентно шофиране, системи за интелигентни пилотски кабини и неговата програма за хуманоидни роботи IRON.
XPENG предлага TuringViT-18L и TuringViT-24L. При разделителна способност 1536 × 1536, компанията казва, че TuringViT-18L е достигнал 3,04 пъти пропускателната способност на Seed1.5-ViT и 2,16 пъти тази на SigLIP2-ViT-L.
XPENG казва, че моделът е обучен на 850 милиона двойки изображение-текст и е постигнал среден резултат от 83,6% в шест нулеви бенчмарка, надхвърляйки базовите линии с отворен код, обучени на 10 милиарда извадки. [IT Home, in Chinese]
Свързани
