Китай представи в петък национална научна инфраструктура на Световната конференция за изкуствен интелект през 2026 г. в Шанхай, целяща да предостави висококачествените данни, необходими за подкрепа на следващото поколение научни изследвания, ръководени от AI.
Наречена Aocang S&T Corpus, платформата е разработена съвместно от Националната научна библиотека на Китайската академия на науките и близо 100 изследователски институции. Той е проектиран като национално хранилище на висококачествени научни данни, обхващащи всички основни дисциплини, предоставяйки AI системи с надеждна информация за изследвания и иновации.
Името Aocang идва от най-голямата държавна житница на династията Цин (221-206 г. пр. н. е.), построена в днешната провинция Хенан, за да доставя зърно за новообединената империя. Qu Jiansheng, директор на Националната научна библиотека, каза, че проектът черпи вдъхновение от древната житница, като служи като стратегическо хранилище за научни знания в дигиталната ера.
Стартирането идва, когато AI за наука – използването на AI за подпомагане на учените да провеждат изследвания и да правят открития по-ефективно – се превърна в национален стратегически приоритет. Китай ускорява развитието на научни изследвания, базирани на AI, за да подкрепи целта си да стане глобален лидер в научните иновации, каза Ку.
За разлика от огромното количество информация, събрана от интернет, научните данни често са разпръснати в различни институции, съхраняват се в различни формати и изискват специализирани познания за тълкуване. Тези предизвикателства затрудняват използването на такива данни за обучение на AI модели.
Aocang е предназначен да реши този проблем чрез организиране на научна информация в унифициран формат, който системите с изкуствен интелект могат по-лесно да разберат и обработят.
„Aocang притежава незаменима, основополагаща и стратегическа стойност за укрепване на основата на данните за развитието на ИИ в Китай и напредъка на високо ниво на научно и технологично самоувереност“, каза Ку.
Използвайки обширните изследователски ресурси на CAS, Aocang интегрира повече от 320 петабайта научни данни, 150 милиона научни статии, 120 милиона патенти и 5 милиона научни книги.
Платформата е организирана в национална основна база данни и редица специализирани бази данни, обхващащи области, вариращи от фундаментална наука до индустриални технологии. Може да обработва много видове научна информация, включително научни статии, математически формули, спектрални данни и вълнови форми.
За да направят информацията по-полезна за AI, разработчиците изградиха тристепенна система за обработка, която почиства, организира и обогатява необработените научни данни, преди да ги превърне в обучителни материали. Според Qian Li, заместник-директор на Националната научна библиотека, процесът позволява на AI моделите да разбират по-добре научните концепции и взаимоотношения, вместо просто да разпознават думи или модели.
„Тези набори от данни, богати на знания, могат да укрепят експертизата на големите AI модели в специализирани области, да подобрят способността им за разсъждение и да им помогнат да разберат по-добре научните дисциплини“, каза Qian.
Повече от 520 собствени софтуерни инструмента поддържат автоматизираната система на платформата за обработка на данни, контрол на качеството и сигурно споделяне на данни. Разработчиците казаха, че корпусът ще продължи да се разширява, тъй като повече изследователски институции предоставят данни.
Първоначалните тестове показват, че Aocang е подобрил възможностите за разсъждение на ScienceOne, основен AI модел за научни изследвания, разработен от CAS.
Корпусът също се интегрира в няколко комерсиални AI модела, включително медицинския AI модел на Doubao, Qwen и Ant Group.
По време на първата си фаза проектът има за цел да интегрира повече от 36 милиарда записа на научни ресурси в 2883 висококачествени научни корпуса и 68 PB изследователски данни, поддържайки повече от 500 сценария за научноизследователски и индустриални приложения.
Цю каза, че академията ще продължи да разширява корпуса, подобрявайки възможностите си за обработка на данни и изследвайки оперативни модели, които съчетават публичен достъп с устойчиви търговски услуги.
„Надяваме се, че корпусът ще подпомогне развитието на нови качествени продуктивни сили и ще осигури надеждна база данни от световна класа за научни иновации по света“, каза той.
