Продължете към съдържанието

Екипът на Xiaohongshu Engine публикува HELMSMAN на OSDI 2026: Преоткриване на инфраструктура за векторно търсене в милиард мащаб на All-Flash Storage

  • от



Екипът на Xiaohongshu Engine публикува HELMSMAN на OSDI 2026: Преоткриване на инфраструктура за векторно търсене в милиард мащаб на All-Flash Storage

Екипът за архитектура на двигателя на Xiaohongshu публикува HELMSMAN на OSDI 2026, една от най-добрите системни конференции, представяйки рентабилна високопроизводителна векторна система за приблизително търсене на най-близък съсед, предназначена за изцяло флаш NVMe SSD масиви. Системата заменя предишната инфраструктура на Xiaohongshu от приблизително 35 000 процесорни ядра и 350 TB DRAM с приблизително 40 изцяло флаш сървъра, постигайки над 90% намаление на хардуерните разходи, като същевременно поддържа латентност на ниво милисекунда за фирмените услуги за търсене, препоръки и реклама, които обработват стотици милиарди високомерни вектори при милиони заявки в секунда.

Основното прозрение е, че базираните на клъстери ANNS, а не базираните на графики ANNS, е правилната архитектура за модерни SSD масиви с висока честотна лента. Графично базираните DRAM-SSD системи като DiskANN страдат от последователна I/O зависимост, при която всяко четене на SSD определя следващия съсед, който да бъде посетен, което прави невъзможно насищането на честотната лента на SSD. Системите, базирани на клъстериране, четат пакетно клъстери от кандидат-вектори паралелно, като естествено отговарят на възможностите за паралелен I/O на SSD. Традиционните системи за клъстериране SPANN обаче са изправени пред три производствени бариери: недостатъчна пропускателна способност от Linux I/O стека, неадаптивни стратегии за търсене, които пресканират или недостатъчно сканират в зависимост от трудността на заявката, и бавна конструкция на индекс, базиран на единичен процесор, който не може да мащабира до сто милиарда вектора.

HELMSMAN се справя с тези бариери чрез три иновации: стек за съхранение, персонализиран от ANNS, който заобикаля традиционните I/O пътища на Linux, за да управлява директно NVMe опашките в потребителското пространство, намалявайки излишните разходи на софтуера, които преди това са консумирали до 58% от латентността от край до край; механизъм за подрязване на йерархично научено търсене, който адаптивно прогнозира оптималния брой клъстери за сканиране на заявка въз основа на трудността на заявката, размера на top-k и разпределението на центроидното разстояние; и GPU-ускорен разпределен тръбопровод за изграждане, който позволява повторно изграждане на индекси в милиарди мащаби в рамките на часове, в крак с актуализациите на модела за вграждане в минута за системи за препоръки и реклама.

Производствените резултати показват ефективността на системата. HELMSMAN постига 2-16x подобрение на пропускателната способност в сравнение със съществуващите DRAM-SSD системи, включително DiskANN и SPANN, достигайки до 85% от чистата пропускателна способност на внедряване в паметта, като същевременно отговаря на SLAs за средно ниво на милисекунди и латентност на опашката. Възможността за възстановяване на индекси от 10 милиарда мащаба за часове прави HELMSMAN практичен за производствени среди, където вграждането на модели и векторните данни се актуализират с висока честота. Внедряването на Xiaohongshu обхваща множество бизнес вертикали, включително търсене, препоръки, реклама, безопасност на съдържанието и RAG тръбопроводи.

Последствията за разходите и мащабируемостта се простират отвъд Xiaohongshu. Инфраструктурата за векторно търсене е сред най-бързо развиващите се разходни центрове за интернет платформи, тъй като извличането, базирано на вграждане, става универсално в функциите за търсене, препоръки и AI. Зависимостта от DRAM е структурен двигател на разходите, с удвояване на векторните мащаби година след година. HELMSMAN демонстрира, че високопроизводителният ANNS на стоковото изцяло флаш хранилище е жизнеспособен дори за най-чувствителните към забавяне сценарии за онлайн обслужване, което потенциално променя икономиката на инфраструктурата за цялата индустрия. Изследването също така отваря въпроси за това дали други свързани с паметта AI инфраструктурни компоненти могат по подобен начин да се възползват от съвместното проектиране на стека за съхранение, а не от грубото разширение на DRAM.



Source link