Perplexity buduje własną infrastrukturę serwowania AI, aby obniżyć koszty i przyspieszyć wyszukiwanie
Najważniejsze informacje
- •Perplexity AI obsługuje około 400 milionów zapytań wyszukiwania miesięcznie i zbudowała własną infrastrukturę serwowania, aby zmniejszyć koszty obliczeniowe, które wyszukiwanie AI ponosi przy każdym zapytaniu.
- •Modele osadzania pplx-embed, wydane w lutym 2026 roku w rozmiarach 0,6 i 4 miliardów parametrów, wykorzystują kwantyzację do cięcia wymagań pamięciowych o nawet 32x.
- •Silnik serwowania ROSE Perplexity stosuje niestandardowe optymalizacje sieciowe RDMA osiągające do 97,1% efektywności pasma i potrafi obsługiwać modele Mixture-of-Experts z bilionami parametrów.
- •W listopadzie 2025 roku Perplexity opublikowała artykuł na arXiv o swoich optymalizacjach i udostępniła na licencji open source bibliotekę fabric-lib z niestandardowymi jądrami MoE, mającymi według firmy zapewniać opóźnienia na poziomie stanu sztuki.
- •Hybrydowy orkiestrator wnioskowania lokalno-chmurowego zaprezentowany w czerwcu 2026 roku kieruje zapytania między modelami na urządzeniu i w chmurze, eliminując koszty obsługi zapytań realizowanych lokalnie.

Prowadzenie wyszukiwarki AI obsługującej około 400 milionów zapytań miesięcznie wiąże się ze znacznymi kosztami. Perplexity AI po cichu buduje infrastrukturę, aby te wydatki zmniejszyć, publikując badania nad technologiami serwowania obejmującymi wszystko — od kompaktowych modeli osadzania po zastrzeżony silnik zdolny obsługiwać modele z bilionami parametrów.
Wysiłek ten odzwierciedla szerszą rzeczywistość branżową: wyszukiwarki AI ponoszą koszt obliczeniowy przy każdym zapytaniu, czego nie robi tradycyjne wyszukiwanie słów kluczowych — dlatego wydajność wnioskowania stała się centralnym polem bitwy dla firm ścigających się w czynieniu odpowiedzi AI ekonomicznymi w skali konsumenckiej.
Kompaktowe modele osadzania do wyszukiwania
Centrum ulepszeń wyszukiwania Perplexity stanowi rodzina modeli pplx-embed, obejmująca pplx-embed-v1 i pplx-embed-context-v1. Modele występują w dwóch rozmiarach: wariant o 0,6 miliarda parametrów oraz większa wersja o 4 miliardach parametrów. Oba wydano w lutym 2026 roku.
Dzięki technikom kwantyzacji — które zmniejszają precyzję numeryczną wag modelu bez niszczenia dokładności — Perplexity deklaruje redukcję wymagań pamięciowych o nawet 32x. Oba modele zoptymalizowano specjalnie pod wdrożenia o niskich wymaganiach存储, co odzwierciedla praktyczną rzeczywistość wyszukiwania w skali internetu, gdzie każde zapytanie wymaga przeszukiwania ogromnych indeksów osadzonych dokumentów.
ROSE i niestandardowa sieć
Bardziej ambitnym elementem infrastruktury jest ROSE, skrót od Runtime-Optimized Serving Engine. Wprowadzony około lutego 2025 roku ROSE został zaprojektowany do obsługi szerokiego zakresu architektur modeli, w tym coraz popularniejszego formatu Mixture-of-Experts (MoE), na którym opiera się wiele z dzisiejszych największych modeli językowych. Architektury MoE aktywują tylko część parametrów modelu przy każdym zapytaniu, ale stawiają wysokie wymagania komunikacji między GPU — dlatego efektywność sieciowa jest kluczową dźwignią pozwalającą obsługiwać je przystępnie kosztowo.
Perplexity zajęła się obsługą MoE za pomocą niestandardowych optymalizacji sieciowych RDMA osiągających do 97,1% efektywności pasma. RDMA, czyli Remote Direct Memory Access, pozwala GPU komunikować się bez udziału CPU. Silnik działa w środowiskach AWS Elastic Fabric Adapter. W listopadzie 2025 roku Perplexity opublikowała swój pierwszy artykuł na arXiv szczegółowo opisujący te optymalizacje i udostępniła na licencji open source bibliotekę fabric-lib, zawierającą niestandardowe jądra MoE, które według firmy zapewniają opóźnienia na poziomie stanu sztuki przy obsłudze modeli z bilionami parametrów. Decyzja o otwarciu kodu wpisuje Perplexity w szerszy trend laboratoriów AI publikujących publicznie badania nad infrastrukturą serwowania — podobnie jak w przypadku ujawnienia przez DeepSeek swoich technik optymalizacji wnioskowania.
Wnioskowanie hybrydowe i przetwarzanie na urządzeniu
W czerwcu 2026 roku Perplexity zaprezentowała hybrydowy orkiestrator wnioskowania lokalno-chmurowego. System automatycznie kieruje zadania między modelami uruchamianymi na lokalnym sprzęcie a potężniejszymi modelami chmurowymi, w zależności od złożoności zapytania. Orkiestrator obsługuje wiele lokalnych opcji krzemowych, a trzymanie części zapytań na urządzeniu oznacza, że nigdy nie trafiają one na serwer — co całkowicie eliminuje ich koszt obsługi, a przy tym uwzględnia kwestie opóźnień i prywatności.
Pozycja w wyścigu zbrojeń wnioskowania
Perplexity działa na infrastrukturze NVIDIA i utrzymuje strategiczne partnerstwa z NVIDIA oraz CoreWeave, dostawcą chmury GPU, który stał się pierwszym wyborem dla obciążeń AI. Przy 400 milionach zapytań miesięcznie 97,1% efektywności pasma ROSE i 32-krotna redukcja pamięci dzięki skwantyzowanym osadzeniom przekładają się bezpośrednio na oszczędności infrastrukturalne. Warto obserwować, czy opublikowany przez Perplexity stos serwowania i hybrydowy orkiestrator staną się wyróżnikami wobec większych rywali, którzy również budują własną infrastrukturę wnioskowania, oraz czy otwartoźródłowa biblioteka fabric-lib zyska przyjęcie w szerszej społeczności serwowania AI.