
SenseTime пусна SenseNova-Vision с напълно отворен код, унифициран визуален модел в своя пакет за основни модели SenseNova. Моделът е проектиран да обработва откриване на обекти, оптично разпознаване на знаци, локализиране на ключови точки, сегментиране на изображението, оценка на дълбочината и 3D реконструкция в рамките на една система, вместо да разчита на отделни специализирани модели за всяка задача.
Моделът също така поддържа плътно геометрично прогнозиране, включително нормална оценка на повърхността, както и 3D задачи с множество изгледи, като реконструкция на облак от точки и оценка на позицията на камерата. SenseTime пусна SenseNova-Vision Corpus-50M, набор от данни с визуални инструкции, съдържащ 50 милиона проби, и планира да интегрира модела в своята U-серия SenseNova. [IT Home, in Chinese]
