Продължете към съдържанието

Същият ден Jensen Huang Champions Open Source, Ant Bailing пуска 124B Ling-3.0-flash модел за изпълнение: Побеждаване на 1T-Ring-2.6 в 11 от 12 бенчмарка при 12% от параметрите

  • от



Същият ден Jensen Huang Champions Open Source, Ant Bailing пуска 124B Ling-3.0-flash модел за изпълнение: Побеждаване на 1T-Ring-2.6 в 11 от 12 бенчмарка при 12% от параметрите

В същия ден главният изпълнителен директор на NVIDIA Дженсън Хуанг публикува първата си X публикация, подкрепяща модели на изкуствен интелект с отворен код заедно с 25 подписали от индустрията подразделение Ant Group Bailing пусна Ling-3.0-flash, модел за изпълнение на общи параметри от 124B само с 5.1B активирани параметри, който постига по-висока плътност на интелигентност от собствения си флагман с трилион параметри. Моделът отбеляза първо място в 15 от 34 измерения за оценка и второ в 19, изравнявайки DeepSeek V4 Flash за най-високия среден резултат от 67,6, като същевременно надмина собствения си модел Ring-2.6-1T с трилион параметри с близо 8 точки. Ling-3.0-flash постига резултат за плътност на интелигентността от 0,5 и коефициент на ефективност от 13,2, и двата най-високи сред сравнимите модели, демонстрирайки, че дизайнът на фокусирания модел за изпълнение може да надмине мащабирането с общо предназначение за специфични работни натоварвания.

Моделът представлява стратегически залог върху парадигмата на модела за изпълнение, различна от моделите за разсъждение. Ling-3.0-flash дава приоритет на скоростта и ефективността за задачи на агенти в реално време, кодиране и извикване на функции. В SWE-Bench Pro за коригиране на грешки в хранилище на код, той отбеляза 56,6% първо място. В ArtifactsBench за генериране на цялостни интерактивни компоненти с едно преминаване, той постигна 77,0%, над 10 точки пред модела на второ място. В MiniAppBench, изискващ пълно генериране на APP от една инструкция, той достигна 25,3% срещу средно за 16 модела от 17%. Точността на извикване на функцията BFCL-v4 достигна 73,0%, изравнявайки Claude-Sonnet-4.6 за първото място. Оценката на GDPVal v2-AA агент от край до край отбеляза 1107 точки, най-високата сред тестваните модели.

Моделът първоначално поддържа 256K контекстни прозорци. MRCR_256K постигна 81,1%. Инструкцията за много обороти Multi-IF достигна 87,7% за второ място. Дългосрочната памет на инструкциите на LIFEBench отбеляза 77,3% за първо място. Способността за търсене на агент WideSearch отбеляза 73,6% за трето място, докато в режим на сътрудничество с множество агенти BrowseComp достигна 82,0%, почти съвпадайки с Claude-Sonnet-4.6 с 82,1%. Пълният набор от агентно-ориентирани оценки установява Ling-3.0-flash като оптимизиран за парадигмата за автономно изпълнение на задачи, където моделите оперират с инструменти, навигират интерфейси и изпълняват многоетапни цели, вместо да генерират разширени вериги за разсъждения.

Ant Bailing отвори модела с тегла, налични след края на безплатния пробен период на API на 3 август. Времето за пускане заедно с писмото с отворен код, подкрепено от NVIDIA, сигнализира, че китайските AI компании продължават да приемат отворения код, въпреки че Силиконовата долина обсъжда рисковете. Ling-3.0-flash позиционира ефективността като отличителна променлива: вместо да се конкурира с общия брой параметри, моделът демонстрира, че за работните натоварвания на изпълнението на агент, добре проектиран компактен модел за изпълнение с целенасочено обучение може да надмине 8 пъти по-големи модели. Това е в съответствие с тенденциите в индустрията към специфични за задачите модели, тъй като икономиката на разгръщането на изводите се превръща в основно ограничение. Седмичното класиране на OpenRouter се повиши от 9-то на 6-то място в рамките на пет дни, като обемът на 29 юли е само с 0,5% зад DeepSeek V4 Pro, потвърждавайки търсенето на пазара за ефективни модели за изпълнение.



Source link