
Следващото голямо нещо на WAIC 2026 не е модел или чип, а продажбата на токени. Фабриките за токени се превърнаха в най-разпространената тема в изложбената зала, тъй като AI индустрията претърпява фундаментална промяна от отдаване под наем на компютри като хардуер към доставка на компютри като токени. Токенът, първоначално най-малката единица за потребление и изход на AI модел, се превръща в основна единица за измерване на производителността на AI. Промяната отразява прехода на индустрията от централизирано обучение към мащабирани изводи, което позволява нови бизнес модели, които отделят изчисленията от специфични хардуерни конфигурации.
Фабриките за токени приемат две основни форми. Моделът на твърда инфраструктура включва изграждане на специализирани центрове за данни или възстановяване на оттегления капацитет на GPU. iSoftStone изложи Пекинска фабрика за токени № 1, насочена към 1,4 трилиона дневно производство на токени, координирана с публична компютърна платформа в района на залива и фабриката в Шаогуан. Jiuzhang Cloud планира 10+ глобални AI изчислителни центъра с общо 30 EFLOPS, произвеждащи 50 милиарда жетони дневно, работещи с двоен двигател затворен цикъл с фабрика за обучение, обработваща усилващо обучение и модели за опаковане на фабрика за токени в стандартизирани услуги. Tiangang Zhisuan възстановява влошените графични процесори, използвайки изчислителна оптимизация за възстановяване на производителността от 20% до 40-60% от първоначалния капацитет, предлагайки изчисления с ниска цена на чувствителни към цените клиенти.
Моделът на мека услуга, ръководен от SiliconFlow, наема изчислителни системи нагоре по веригата, за да произвежда токени за клиенти надолу по веригата. Поддържайки повече от 170 масови AI модела в хардуера на Nvidia, Huawei Ascend, MUSA и Moore Threads, SiliconFlow постига над 1 трилион токени на ден. Гъвкавостта идва от маршрутизирането на пакетна обработка към неактивен суперкомпютър през нощта. Оптимизацията на системно ниво, включително механизми за планиране и извод, определя действителната ефективност на изхода на токена.
Предложението за клиентска стойност е ясно: по-евтино от облачните доставчици, по-универсално от индивидуалните модели API. Фабриките за токени агрегират модели с отворен код, включително GLM и DeepSeek заедно с интерфейси, съвместими с OpenAI и Anthropic, като предоставят един вход в API за множество модели с ценообразуване при плащане. Интелигентното маршрутизиране автоматично декомпозира мултимодални заявки, изискващи генериране на текст, изображение и видео, насочвайки всяка подзадача към най-добре представящия се модел, постигайки съвпадение от задача към модел, а не избор от човек към модел. Jiuzhang Cloud допълнително сегментира токените на три нива: потребителски клас за общи сценарии, професионален клас с вградени индустриални познания за финанси и производство и граничен клас за сложни задълбочени разсъждения и приложения за многоетапно планиране.
Предизвикателствата пред стандартизацията остават. Jiuzhang предложи модулът за изчисление на данни DCU, който преобразува различни чипове, включително Nvidia, Ascend и Hygon, в унифицирани измервания от 312 TFLOPS × 1 час, докато iSoftStone пусна първия глобален бенчмарк за производителност на завода за токени, използвайки характеризиране на хаотично натоварване за дългосрочно тестване на агенти. Възникващият консенсус в WAIC беше безпогрешен: конкурентната логика се измести от това колко графични процесора притежавате към това колко токени произвеждат вашите графични процесори и дали тези токени се превръщат в реална производителност. Фабриките за токени трансформират компютрите от капиталоемък хардуерен актив в стандартизирана единица за производителност, която може да се търгува, променяйки начина, по който AI изчисленията се купуват и продават.
