
Moonshot AI с отворен код Kimi K3 на 27 юли с 2.8T MoE параметри, 896 насочени експерти, 16 активни на токен, собствена визия, 100K контекстен прозорец, което го прави най-големият отворен модел в световен мащаб. В сравнение с предишното поколение K2.5, мащабът на параметрите на K3 се увеличи приблизително 3 пъти, докато изчислителната ефективност се подобри 2,5 пъти чрез технологиите Kimi Delta Attention, Attention Residuals и MoonEP при ограничени изчислителни ресурси.
Техническият доклад разкрива множество архитектурни иновации. Хибридната структура на вниманието KDA плюс Gated MLA съчетава линейно внимание за ефективна обработка на дълъг контекст с затворено многоглаво латентно внимание за висококачествено локално представяне. Механизмът за стабилно маршрутизиране LatentMoE адресира проблема с колапса на експертите, често срещан при широкомащабно обучение на MoE, като стабилизира динамиката на градиента на рутера. Схемата за обучение на визуален енкодер MoonViT-V2 позволява нативно мултимодално разбиране без отделни адаптери за визуален език. Моделът обхваща измеренията на способностите на универсалното разсъждение, агента и кодиращия агент в обучението и оценката, демонстрирайки широчината на компетентността на K3 отвъд чисто езиковите задачи.
Освен самия модел, три инфраструктурни технологии бяха с отворен код. MoonEP е високоефективна експертна паралелна комуникационна библиотека, предназначена за широкомащабно обучение на MoE, адресирано до тясното място на комуникацията от всички към всички, което обикновено ограничава ефективността на мащабиране на MoE. FlashKDA предоставя високопроизводителното изчислително ядро за Kimi Delta Attention, като данните от бенчмарка показват 1,72 до 2,22 пъти подобрение на скоростта на Prefill спрямо базовата линия на flash-linear-attention на H20 GPU. AgentEnv е агентна пясъчна система, разработена с KVCache.ai, поддържаща възможности за бърза снимка, възстановяване и разклоняване за широкомащабни среди за обучение на агенти. Заедно тези издания на Infra намаляват бариерата за възпроизвеждане и надграждане върху обучението на модели от клас K3.
Изданието с отворен код носи значителни последици за екосистемата. K3 съвпада или надминава граничните модели със затворен код като GPT-5.6 и Claude Fable 5 по специфични показатели, особено генериране на код от предния край, като същевременно е с 40% по-евтин от Claude и 70% по-евтин от Fable по отношение на ценообразуването на API. Лицензът за отворено тегло позволява локално внедряване и разработване на персонализирани приложения без зависимост от API. Скалата на параметрите от 2.8T обаче означава, че дори локалното внедряване изисква значителен хардуер: най-малко 10 графични процесора от клас GB300 само за зареждане на модела, което означава, че цената на инфраструктурата за изводи, а не таксите за API, се превръща в основно съображение за внедряване.
Пускането предизвика екосистемни ефекти. Alibaba Cloud Qianwen AI платформата обяви наличността на K3. Huawei обяви 0-дневна адаптация на Ascend за K3, отбелязвайки първия отворен модел на ниво 3 трилиона, работещ на домашен хардуер. Общността с отворен код получи достъп до тегла на модела, чието копиране преди това изискваше стотици милиони инвестиции в обучение. Moonshot AI заяви, че инициативата с отворен код има за цел да развие екосистемата на модела с отворено тегло, намалявайки бариерите пред разгръщането и развитието за по-широката общност на AI. Изданието обаче бързо беше последвано от съобщение, че K3 е спрял абонаментите за нови потребители поради ограничения на изчислителния капацитет, подчертавайки напрежението между идеалите за отворен код и реалността на обслужване на модел с параметри 2.8T в мащаб.
