
MindLab, една от най-забележителните NeoLabs в Китай, пусна Macaron-V1, пост-обучен модел, изграден върху основата на Zhipu AI GLM 5.2, който демонстрира как целенасочената RL-базирана фина настройка с минимални изчисления може значително да повиши възможностите на съществуващия модел. Водещият вариант на Venti при 748B параметри с 1 милион нативен контекст използва четирима независими 1B-параметър LoRA експерти, покриващи Chat, Agent, Coding и UI домейни, всеки обучен в изолирано адаптерно пространство, използвайки собствената техника Mixture-of-LoRA, която предотвратява смущенията във възможностите, които пречат на многозадачното след обучение.
MoL представлява фундаментална промяна от традиционната фина настройка. Стандартната многозадачна пост-обучение страда от ефект на люлка, при който подобряването на една способност влошава друга. Решението на MindLab монтира множество независими LoRA експерти върху замразен базов модел, като всеки оптимизира в собственото си адаптерно пространство с пълна изолация. Router Tool избира подходящия експерт за всяка заявка, а нови възможности могат да бъдат добавени просто чрез монтиране на друг LoRA експерт без повторно обучение на съществуващите. Подходът беше валидиран за първи път на Kimi K2 с помощта на 64 H800 GPU, демонстрирайки, че моделът с трилион параметри RL е постижим със скромен хардуер, когато се насочват само към 0,5% от основните параметри.
Техническите иновации се простират отвъд MoL. Macaron-V1 включва технологията LongStraw, разширяваща естествения контекст на GLM 5.2 до 2 милиона токена чрез повторно използване на споделени сегменти за подкана като постоянно състояние, което драматично намалява режийните разходи за дълга последователност. Лекият вариант Tall с параметри 35B е насочен към локално внедряване, базирано на Qwen 3.6. Три поддържащи системи бяха обучени съвместно: GenUI за изобразяване на интерактивни изгледи извън текстовия изход, REPL Harness, осигуряващ постоянно време за изпълнение на Python, позволяващо на модели да пишат и популяризират инструменти за глобални помощни програми за кръстосани сесии, и инфраструктура за обучение на MinT, предназначена за MoL, където Актьор и Учещ обменят само адаптери вместо пълни тегла, поддържайки директории на адаптери на милиони нива в мащаб от трилиони параметри.
MindLab също е създал два персонализирани бенчмарка за оценка. Macaron ChatBench оценява честността на агента в сценарии с дълъг контекст, независимо дали моделът допуска пропуски, вместо да измисля отговори. Macaron LivingBench симулира динамична пясъчна среда с три взаимодействащи механизма: динамичен шум, динамична жизнена среда и динамичен потребител, измервайки дали моделът може непрекъснато да разбира нуждите на потребителите, да проверява точността на информацията, да препланира пътеките на задачите и да изпълнява задачите, преди търпението на потребителя да изтече. При стандартни бенчмаркове Macaron-V1 постига скорост на генериране от 320 токена в секунда, значително по-бързо от сравнимите модели, въпреки че това може да отразява ниското натоварване на изводите по време на ранното тестване.
Macaron-V1 демонстрира, че възможностите на китайския AI вече не се определят единствено от мащаба на базовия модел на обучение, но също така и от ефективното последващо обучение. Постиженията на MindLab с 64 графични процесора потвърждават изчислително ефективната специализация. Тъй като базовите модели се сближават по отношение на качеството, конкурентната диференциация се измества към слоя след обучение, където техниките на MoL могат да определят кои екосистеми привличат най-способните приложения.
