Продължете към съдържанието

LingBot-Vision на Ant Group твърди, че е 12 първи в света: 1.1B модел на параметри надминава 7B DINOv3



LingBot на Ant Group (蚂蚁灵波) представи LingBot-Depth 2.0, модел за пространствено възприятие, който постига 12 първи в света резултата в публични и частни набори от данни за бенчмарк. Основната технология на модела, основният модел LingBot-Vision, представлява първият в света основен модел за пространствено-нативно зрение, специално създаден за въплътен AI, и е пуснат като отворен код.

LingBot-Vision е промяна на парадигмата от конвенционалните базови модели за компютърно зрение. Традиционните модели като DINOv3 се учат от интернет изображения като „уеб зрители“, които могат да идентифицират обекти, но не могат да възприемат техните точни триизмерни граници и пространствени структури. LingBot-Vision се обучава от самото начало върху нуждите от пространствено възприятие и взаимодействие от първо лице, като вгражда геометричното пространствено разбиране като основна способност от самото начало.

С приблизително 1,1 милиарда параметъра (приблизително една седма от 7 милиарда на DINOv3) и по-малко от една трета от тренировъчните проби на DINOv3, LingBot-Vision постига превъзходна точност и изчерпателно превъзхожда 7B DINOv3 в бенчмарка за оценка на дълбочината NYUv2. Моделът адресира директно три критични режима на повреда на конвенционалната оценка на дълбочината: замъгляване на ръба на обекта, откриване на малки обекти и смущения от шум на дълги разстояния.

LingBot-Depth 2.0 демонстрира изключителна производителност при изключително трудни предизвикателства за възприемане. Той постига изключителна яснота на ръба за целостта на контура на обекта, позволявайки милиметър прецизно планиране на пътя на роботизираната ръка. Той драстично подобрява откриването на тънки обекти като жици, кабели и метални връзки. За бързо движещи се роботи моделът ефективно филтрира високочестотния шум на дълги разстояния, за да произведе надеждни резултати за дълбочина за отдалечени препятствия. Най-впечатляващото е, че поддържа плавни, пълни карти на дълбочината дори при предизвикателни условия, включително отразяващи повърхности, прозрачни обекти, екстремна тъмнина и силно претрупана запушена среда.

Моделът вече влезе в търговско внедряване чрез партньорство с ORBBEC, глобален лидер в хардуера за 3D визия. LingBot-Depth 2.0 премина строга индустриална сертификация в Depth Vision Lab на ORBBEC, демонстрирайки изключителна прецизност и екстремна работа с материали. Сътрудничеството доведе до три конкретни резултата: ново устройство за събиране на данни EGO-RGBD с вградена анотация за дълбочина на качеството, пълна интеграция на SDK, позволяваща пространствено възприемане с едно щракване за потребителите на хардуер ORBBEC, и предстояща интегрирана камера, която извежда чисти 3D визуални потоци без сложна настройка на алгоритъма.

Ant Group има LingBot-Vision с отворен код за Hugging Face и ModelScope, с достъпен код в GitHub. Техническият доклад е публикуван на arXiv.



Source link