Продължете към съдържанието

Лидерът на китайския Visual AI SenseTime обявява края на ерата на Stitch-Monster с унифициран модел за зрение с отворен код

  • от



Лидерът на китайския Visual AI SenseTime обявява края на ерата на Stitch-Monster с унифициран модел за зрение с отворен код

SenseTime пусна SenseNova-Vision с напълно отворен код, унифициран визуален голям модел, който се занимава с откриване, сегментиране, прогнозиране на дълбочина и 3D реконструкция в рамките на една архитектура. В момента моделът оглавява класацията на Hugging Face Any-to-Any в световен мащаб, отбелязвайки първия път, когато китайска компания за визуален AI претендира за челна позиция в този всеобхватен мултимодален бенчмарк.

SenseNova-Vision фундаментално предизвиква дългогодишната фрагментация на компютърното зрение. Традиционно задачи като откриване на обекти, сегментиране на изображения, оценка на дълбочината и 3D реконструкция изискват отделни експертни модели, което води до сложни изолирани системи. SenseNova-Vision обединява тези разнообразни изходи, като ги преформулира като проблеми с мултимодално генериране в рамките на единна генеративна рамка, елиминирайки необходимостта от специфични за задачата глави на модела, функции за загуба и правила за декодиране.

Техническата архитектура създава структура с двойна спирала между данни и разсъждения. Десетилетия натрупани визуални данни от промишлен клас в задачите за откриване, сегментиране и оценка на дълбочината се използват за директно захранване на големия модел. На свой ред се прилагат големи възможности за разсъждение на езиковия модел за подобряване на изпълнението на визуалните задачи. Разработчиците могат да дефинират изцяло нови визуални задачи, използвайки естествен език, задачи, които никога не са изрично изброени по време на обучението, демонстрирайки, че пространственото разбиране е станало естествено за модела, а не програмирана способност.

Бенчмарк тестовете показват, че SenseNova-Vision съвпада или надхвърля специализираните експертни модели във всичките четири основни задачи. Моделът демонстрира забележителни възможности за генерализиране с нулев изстрел, извършвайки едновременно нормално прогнозиране на повърхността, сегментиране на екземпляри и откриване на обекти върху изображения на игри като сцени на Minecraft без каквато и да е фина настройка. Във визуално предизвикателни сценарии, включващи плътно припокриващи се обекти, огледални отражения и илюзии за дълбочина, моделът показва постоянно превъзходство над традиционните специализирани модели.

Изданието с отворен код включва пълния модел, код, рецепта за обучение и висококачествен визуален корпус от 50 милиона проби. SenseTime предостави пълни правила за преобразуване и скриптове за възпроизвеждане от общността, използвайки публични набори от данни. Тази отвореност е рядкост във визуалното поле на AI, където повечето основни модели остават затворени или частично отворени. В комбинация с позицията на SenseTime като номер едно доставчик на визуален AI в Китай за десет последователни години и световен лидер във видео анализите от 2025 г., изданието сигнализира за стратегическа промяна към повторно използване на възможности, базирани на платформа, където един модел може да обслужва по-голямата част от нуждите за внедряване на високочестотен визуален AI в индустриални инспекции, автономно шофиране и интелигентни сценарии за търговия на дребно.



Source link