Китай представи в петък национална научна инфраструктура на Световната конференция за изкуствен интелект през 2026 г. в Шанхай, целяща да осигури висококачествена база данни, необходима за подкрепа на следващото поколение научни изследвания, задвижвани от AI.
Aocang S&T Corpus, разработен от Националната научна библиотека на Китайската академия на науките заедно с близо 100 институции, е проектиран да служи като национална инфраструктура от висококачествени, специфични за домейна и готови за AI данни, обхващащи всички основни научни дисциплини.
Наречен на Aocang, най-голямата държавна житница на династията Цин (221-206 г. пр. н. е.), която е построена в днешната провинция Хенан, за да доставя зърно за новообединената империя, корпусът носи същата стратегическа логика в цифровата ера, каза Qu Jiansheng, директор на Националната научна библиотека.
Стартирането идва, когато ИИ за наука — използването на изкуствен интелект за ускоряване на научните открития — се превърна в стратегически приоритет, като научното лидерство на Китай подчертава необходимостта от напредък в изследванията, базирани на ИИ, за да се подпомогне преходът на страната от глобален участник към новатор, каза той.
За разлика от интернет данните с общо предназначение, научните данни са силно структурирани, изискват много знания и често са фрагментирани между институциите. Изграждането на надеждни научни корпуси се превърна в общо предизвикателство за изследванията на ИИ в световен мащаб.
Aocang е проектиран да отговори на това предизвикателство чрез трансформиране на хетерогенни научни ресурси в стандартизирани, готови за AI корпуси за научни открития.
„Aocang има незаменима, основополагаща и стратегическа стойност за укрепване на основата на данните за националното развитие на ИИ и постигане на научна и технологична самостоятелност на високо ниво“, каза Ку.
Използвайки хранилищата на академията, Aocang интегрира повече от 320 петабайта научни данни, 150 милиона научни статии, 120 милиона патенти и 5 милиона научни книги.
Организиран в национална основна библиотека и множество специализирани бази данни, корпусът обхваща всички основни дисциплини — от фундаментална физика до индустриални иновации — и поддържа различни формати на данни, включително текст, формули, спектри и вълнови форми.
За да преодолеят празнината между необработените данни и машинночетимите знания, разработчиците създадоха тристепенна рамка за усъвършенстване, която надгражда основните набори от данни в богати на функции и богати на знания корпуси. Процесът значително подобрява семантичната плътност, произвеждайки това, което Qian Li, заместник-директор на Националната научна библиотека, описа като „готов за AI“ учебен материал.
„Тези корпуси с високо знание и висока семантична плътност могат да запълнят празнини в експертизата на домейните на големите модели, да коригират пристрастията към логическото разсъждение и да ги оборудват с истинско дисциплинарно разбиране и дългосрочна способност за разсъждение“, каза Qian.
Подкрепен от повече от 520 патентовани софтуерни инструмента, Aocang създаде напълно автоматизиран тръбопровод за обработка на данни, контрол на качеството и надеждно споделяне на данни.
Платформата е проектирана да се разширява непрекъснато чрез принос от глобалната изследователска общност.
Предварителните резултати показват, че Aocang е подобрил възможностите за разсъждение на разработения от CAS основополагащ научен модел ScienceOne.
Корпусът също се интегрира в основни търговски модели, включително медицинския AI модел на Doubao, Qwen и Ant Group.
В първата си фаза проектът има за цел да интегрира повече от 36 милиарда записи на научни ресурси в 2883 висококачествени научни корпуса и 68 петабайта изследователски данни, поддържайки повече от 500 сценария на приложение.
Ку каза, че академията ще продължи да разширява екосистемата на корпуса, укрепвайки възможностите за обработка на данни и изследвайки хибридни оперативни модели, които комбинират достъп от обществен интерес с устойчиви търговски механизми.
„Надяваме се, че нашият корпус ще даде възможност на нови качествени продуктивни сили и ще допринесе за надеждна база данни от световна класа за глобалните научни иновации“, добави той.
