
CAS ICT пусна система за социална интелигентност ZhiJing на 24 юли, адресирана до неспособността на AI да разбере социалния контекст, емоциите и неизречената комуникация. За разлика от GPT-5.5 в професионалното писане или DeepSeek в кода, AI в социалните настройки произвежда неудобни отговори. ZhiJing третира социалното познание като независима инженерна способност.
Първият компонент е SoMBench, бенчмарк за оценка на социалната интелигентност, който разлага неясната концепция за разбиране на хората в три основни измерения, 17 подизмерения и 71 фини задачи, обхващащи мотивиране на вярвания, разбиране на емоции, социални норми и моделиране на взаимоотношения. Бенчмаркът съдържа 3481 стриктно прегледани екземпляра с кръстосано валидиране от типа на няколко въпроса, включително въпроси с единичен отговор, множествен избор, преценка и въпроси с отворен край, с опционално смущение, откриване на пряк път и контролирано пренаписване за прецизно идентифициране на модели на грешки в модела. Тестването на 20 модела от най-високо ниво разкри, че най-силният модел постига само 72,08% точност, като нито един не достига тавана от 90%, което потвърждава социалната интелигентност като истинска неизследвана територия. Най-трудните предизвикателства включват едновременно разсъждение за ролеви взаимоотношения, имплицитни намерения, емоционални промени, социални норми и неизказани думи.
Методологията на Zing има три иновации. FLARE маховик на данни: когато се появят слабости, FLARE синтезира нови проби, насочени към същата празнина в способностите. Двуетапно обучение: обща основа чрез дестилация с множество учители и GRPO със смесено възнаграждение, след това специализирано укрепване за емоция, намерение, социални норми.
Третото нововъведение, On-Policy Destillation, адресира класическия риск от катастрофално забравяне при учене с подсилване. OPD въвежда ограничения за разпределение на ниво токен на учителски модел върху онлайн траекториите, позволявайки на модела на ученика да изследва по-добри пътища, без да се отклонява от валидирани ефективни модели на разсъждение. GRPO се движи напред, докато OPD предотвратява отклоняване, като и двете работят по една и съща траектория на вземане на проби. Комбинираната рамка означава, че FLARE определя какво да научите, двустепенното обучение определя кога да научите, а OPD определя от кого да научите и какво да не забравяте.
Zing-27B постигна 79,80% съставен резултат от пет бенчмарка, надминавайки GPT-5,5 със 78,44%, с предимства в HiToM рекурсивно проследяване на убеждения (+4,08pp) и EmoBench (+5,62pp). Това е първият модел под 100B, надминаващ GPT-5.5 на HiToM, установявайки социалната интелигентност като отделна инженерна дисциплина.
