
Екипът на Tencent Content Services Department BAC предложи ProLaViT, рамка за прогресивна латентна визуална мисъл, която адресира фундаментална слабост в мултимодалните големи езикови модели: невъзможността да се изпълняват визуални разсъждения стъпка по стъпка без скъпо междинно генериране на изображения или еднократно латентно предсказване, което се срива при сложни пространствени задачи. Документът беше приет на ECCV 2026, една от най-добрите конференции за компютърно зрение.
Настоящите подходи за инжектиране на визуална информация в логическите вериги страдат от дилема. Експлицитните методи, които генерират междинни изображения по време на разсъждение, като Anole и ThinkMorph, дават точни резултати, но водят до непосилни изчислителни разходи. Имплицитните методи, които се опитват да предскажат латентно пространство в една стъпка, като Mirage и LVR, се сриват в прецизност, тъй като вниманието на модела се разпръсква към неподходящи фонови региони. Разделянето на навигацията на ProLaViT е да разложи процеса на визуално разсъждение в причинно-следствена верига от латентни стъпки, всяка от които извършва малка, управляема трансформация: локализиране, фокусиране, изолиране за пространствени задачи и хипотеза, критика, проверка за задачи за логическо разсъждение.
Веригата Locate-Focus-Isolate прогресивно затяга зрителното внимание. Моделът първо локализира кандидат региони в латентното пространство, след това се фокусира върху най-подходящата област, като същевременно потиска фона, и накрая изолира целта, като я отделя от околния контекст. За задачи за решаване на пъзели и реконструкция веригата за диалектическо разсъждение HCV първо генерира хипотеза в латентна форма, критикува нейната съгласуваност с визуални доказателства, след което проверява прецизния резултат. Всяка стъпка е представена от набор от обучаеми токени в рамките на пространството за вграждане на LLM, като не се изискват външни базови модели на визия като SAM, DINO или DepthAnything като преподаватели.
Иновацията в обучението е ендогенна самодестилация, която елиминира зависимостта от външни експерти по визия, които въвеждат изместване на домейна и инженерна сложност. Вместо да наема външни учители за осигуряване на междинен надзор, ProLaViT използва собствения предварително обучен визуален енкодер на MLLM като учител чрез програмируем тръбопровод за синтез. Тръбопроводът генерира синтетични данни за обучение с известни карти на вниманието на истината на земята, което позволява на модела да интернализира прогресивното натрупване на визуални доказателства директно в своето латентно пространство. Загубата на разнообразие с претеглено разстояние предотвратява латентен колапс, при който последващите стъпки на разсъждение стават неразличими и веригата се изражда.
Последствията обхващат визуално търсене, локализиране на обекти, реконструкция на мозайката и отговор на пространствени въпроси. ProLaViT позволява на мултимодалните модели да разсъждават върху изображения със същата логическа строгост стъпка по стъпка, която веригата от мисли доведе до текстово базирано разсъждение, но изцяло във визуалното латентно пространство, без генериране на пикселни изходи или извикване на външни инструменти. Работата се насочва към мултимодални системи, които могат наистина да мислят за това, което виждат, прилагайки степенувано аналитично внимание, вместо да гадаят от холистични визуални характеристики. Тъй като мултимодалните модели навлизат в производствените приложения в автономното шофиране, медицинските изображения и промишлената инспекция, способността за извършване на надеждни многоетапни пространствени разсъждения без прекомерни изчислителни разходи става все по-критична.
