Продължете към съдържанието

520 TFLOPS при 14nm: Китайският самостоятелно разработен AI чип постига пробив в архитектурата със софтуерно дефинирани изчисления

  • от



520 TFLOPS при 14nm: Китайският самостоятелно разработен AI чип постига пробив в архитектурата със софтуерно дефинирани изчисления

Първият AI чип в Китай, използващ комбинация от софтуерно дефинирани и 3D изчислителни технологии с почти памет, беше представен в Шанхай на 13 юли, постигайки 520 трилиона операции с плаваща запетая в секунда (TFLOPS) при 14nm производствен процес. Чипът демонстрира алтернативен път към високопроизводителни изчисления с изкуствен интелект, които не разчитат на водещи технологии за процеси, а вместо това постигат производителност чрез архитектурни иновации.

Софтуерно дефинираната чипова архитектура позволява хардуерните ресурси да бъдат динамично преконфигурирани за различни изчислителни задачи, значително подобрявайки степента на използване на изчисленията в сравнение с ускорителите с фиксирана функция. Това означава, че един и същ чип може ефективно да се справя с различни работни натоварвания на AI от разпознаване на изображения и обработка на естествен език до научни изчисления, без наказанията за ефективност, обикновено свързани с хардуера с общо предназначение.

3D изчислителният подход почти с памет използва вертикално подреждане за плътно интегриране на изчислителни единици с памет, постигайки 6,4 TB за секунда честотна лента на паметта. Това основно адресира пречките в стената на паметта, които дълго време ограничават производителността на процесора, където движението на данни между отделни изчислителни и чипове с памет създава пречки в производителността и енергията. Чрез подреждане на паметта директно върху изчислението, физическото разстояние, което данните трябва да изминат, е драстично намалено.

Заедно с чипа беше пусната софтуерна инструментална верига с пълен стек, съвместима с основните рамки за дълбоко обучение. Продуктовото портфолио обхваща единични ускорителни карти, AI сървъри, супервъзли с течно охлаждане и широкомащабни интелигентни изчислителни клъстери, осигурявайки пълна екосистема за обучение на големи модели и внедряване на изводи. Архитектурата е проектирана да мащабира от крайни устройства до мащабни клъстери в центъра за данни.

Индустриалните анализатори разглеждат това като значителна демонстрация, че архитектурните иновации могат частично да заменят лидерството в процесните технологии. Чрез избягване на зависимостта от най-модерните леярски възли, веригата за доставки на чипове става по-стабилна и контролируема, критично съображение предвид текущия контрол върху износа на усъвършенствано оборудване за производство на полупроводници към Китай. Подходът представлява ясно различна философия както от подхода на NVIDIA GPU, така и от надпреварата за мащабиране на процеси, преследвана от водещите производители на чипове.

Чипът не съвпада със суровата производителност на NVIDIA H100 или B200 на водещи процесни възли, но неговата демонстрирана способност при 14nm предполага, че архитектурната иновация може да затвори значителна част от разликата в производителността, като същевременно предлага стабилност на веригата за доставки. Този двоен акцент върху управляваната от архитектурата производителност и устойчивостта на веригата за доставки се превръща в определяща характеристика на вътрешната китайска стратегия за развитие на AI чипове.



Source link