Продължете към съдържанието

Деконструиране на техническия доклад на Kimi K3: Moonshot AI започва да създава проблеми за DeepSeek, тъй като две скалиращи оси предефинират границата

  • от



Деконструиране на техническия доклад на Kimi K3: Moonshot AI започва да създава проблеми за DeepSeek, тъй като две скалиращи оси предефинират границата

Техническият доклад от 47 страници на Kimi K3 разкрива проблеми с настройките на Moonshot AI, вместо да следва решения. Тезата: съществуват две оси на мащабиране на AI. Изчисления преди внедряване за по-големи модели и изчисления след внедряване за изводи. Отвореният код превъзхожда втория, но стагнира на първия с повечето модели на 1T. K3 избутва и двете оси, достигайки общо 2,78T със 104,2B активни на токен, повече от удвоявайки DeepSeek V4 Pro.

K3 възприема иновациите на DeepSeek, но поставя свои собствени проблеми: казусът на DSA ядрото и математически доказаното перфектно експертно равновесие подобряват V3. Посоката на отчетните сигнали е правилна, но изпълнението вече е по-добро.

Три архитектурни иновации са насочени към размерите на последователността, дълбочината и ширината на мащабирането на модела. За последователност, K3 замества 75% от слоевете на внимание с KDA линейно внимание, което поддържа буфер на състоянието с фиксиран размер за изчисления с линейно мащабиране, запазвайки един MLA слой на три KDA слоя за глобално възприемчиво поле. Критично подобрение добавя по-ниска граница към скоростта на затихване на KDA, позволявайки всички изчисления на бързи GPU тензорни ядра, вместо да изисква специален път. KDA също елиминира изцяло позиционното кодиране, позволявайки собствена обработка на 100K-токени без инженерна интерполация. За дълбочина AttnRes дава параметри за извличане на всеки слой за директен достъп до всеки по-ранен изход на слоя в 93 слоя, организирани като 9 компресирани блока, решавайки проблема с разреждането на характеристиките, създаван от стандартните остатъчни връзки в мащаб. За ширина, Stable LatentMoE с 896 експерта и 16 активни на токен използва базирано на квантил балансиране на натоварването, което изчислява произтичащите от разпределението предпочитания за планиране с едно преминаване, математически доказано, че постига перфектно равновесие без нестабилни спомагателни санкции.

Инфраструктурата за обучение разкрива мащаба. Математически е доказано, че експертно-паралелната комуникационна библиотека на MoonEP изисква само минимални излишни експерти за гарантирано балансирано разпределение при всякакво натоварване, като обучението никога не е прекъсвано. Обучителният пясъчник на RL, базиран на леки виртуални машини, създаде 51,2 милиона екземпляра по време на обучение и оценка, със 133ms моментна снимка и 49ms време за възстановяване. Пост-обучението използва девет саморазвити учители в общи, агентски и програмни домейни с три силни аргументи всеки, дестилирани в унифициран модел. Резултатът на BrowseComp от 91,2% при половината от цената на GPT-5.6 Sol и резултатът на Kimi Code Bench с 4 точки под Claude Fable 5 при 38% от цената му демонстрират, че двупосочният подход дава резултати.

K3 настоява DeepSeek да отговори на архитектурата, а не на цените. Докладът е едновременно документация и провокация, установявайки Moonshot AI като дефиниращ архитектурата, а не като последовател. Дебатът K3 срещу V4 определя следващия кръг.



Source link