Perplexity bouwt eigen AI-serving-infrastructuur om kosten te verlagen en zoekopdrachten te versnellen
Belangrijkste punten
- •Perplexity AI verwerkt ongeveer 400 miljoen zoekopdrachten per maand en heeft aangepaste serving-infrastructuur gebouwd om de rekenkosten te verlagen die AI-zoeken bij elke query met zich meebrengt.
- •De pplx-embed embeddingmodellen, uitgebracht in februari 2026 in formaten van 0,6 en 4 miljard parameters, gebruiken kwantisatie om de opslagbehoefte met tot 32x te verminderen.
- •Perplexity's ROSE-servingengine gebruikt aangepaste RDMA-netwerkoptimalisaties om tot 97,1% bandbreedte-efficiëntie te bereiken en kan biljoenparameters-Mixture-of-Experts-modellen serveren.
- •In november 2025 publiceerde Perplexity een arXiv-paper over zijn optimalisaties en maakte het fabric-lib open source, een bibliotheek met aangepaste MoE-kernels waarvan wordt beweerd dat ze geavanceerde serving-latenties leveren.
- •Een hybride local-cloud-inferentie-orchestrator, onthuld in juni 2026, routeert queries tussen modellen op het apparaat en in de cloud, waarmee servingkosten voor lokaal afgehandelde queries volledig verdwijnen.

Het runnen van een AI-zoekmachine die ongeveer 400 miljoen queries per maand verwerkt, brengt aanzienlijke kosten met zich mee. Perplexity AI heeft in stilte infrastructuur opgebouwd om die kosten te verlagen en publiceert onderzoek naar aangepaste serving-technologie, variërend van compacte embeddingmodellen tot een eigen engine die biljoenparameters-modellen kan draaien.
De inspanning weerspiegelt een bredere realiteit in de sector: AI-zoekmachines maken bij elke query rekenkosten die traditioneel trefwoordzoeken niet kent. Daarom is inferentie-efficiëntie een centrale strijdploeg geworden voor bedrijven die AI-antwoorden economisch willen maken op consumentenschaal.
Compacte embeddingmodellen voor retrieval
Kern van de retrieval-verbeteringen van Perplexity is de pplx-embed-modellenfamilie, bestaande uit pplx-embed-v1 en pplx-embed-context-v1. De modellen komen in twee formaten: een variant van 0,6 miljard parameters en een grotere versie van 4 miljard parameters. Beide werden uitgebracht in februari 2026.
Met kwantisatietechnieken — die de numerieke precisie van modelgewichten verlagen zonder de nauwkeurigheid te vernietigen — claimt Perplexity een vermindering van de opslagbehoefte tot 32x. Beide modellen werden specifiek geoptimaliseerd voor implementatie met weinig opslag, een ontwerpkeuze die de praktische realiteit van retrieval op webschaal weerspiegelt, waarbij elke query gigantische indexen van geëmbedde documenten doorzoekt.
ROSE en aangepaste netwerken
Het meest ambitieuze stuk infrastructuur is ROSE, kort voor Runtime-Optimized Serving Engine. Geïntroduceerd rond februari 2025, is ROSE gebouwd om een breed scala aan modelarchitecturen te serveren, waaronder het steeds populairstere Mixture-of-Experts-formaat (MoE) dat veel van de grootste taalmodellen van vandaag onderbouwt. MoE-architecturen activeren per query slechts een fractie van de parameters van een model, maar stellen zware eisen aan de communicatie tussen GPU's, waardoor netwerkefficiëntie een belangrijke hefboom is om ze betaalbaar te serveren.
Perplexity pakte MoE-serving aan met aangepaste RDMA-netwerkoptimalisaties die tot 97,1% bandbreedte-efficiëntie behalen. RDMA, of Remote Direct Memory Access, stelt GPU's in staat te communiceren zonder tussenkomst van de CPU. De engine draait in AWS Elastic Fabric Adapter-omgevingen. In november 2025 publiceerde Perplexity zijn eerste paper op arXiv met details van deze optimalisaties en maakte het een bibliotheek genaamd fabric-lib open source, met aangepaste MoE-kernels die volgens het bedrijf geavanceerde latenties leveren voor het serveren van biljoenparameters-modellen. De keuze om het werk open source te maken plaatst Perplexity in een bredere trend van AI-labs die serving-infrastructuuronderzoek publiek vrijgeven, zoals eerder het geval was bij DeepSeek's openbaarmaking van zijn inferentie-optimalisatietechnieken.
Hybride inferentie en verwerking op het apparaat
In juni 2026 onthulde Perplexity een hybride local-cloud-inferentie-orchestrator. Het systeem routeert taken automatisch tussen modellen op het apparaat die op lokale hardware draaien en krachtigere cloudbased modellen, afhankelijk van de complexiteit van de query. De orchestrator ondersteunt meerdere lokale siliciumopties, en het op het apparaat houden van bepaalde queries betekent dat ze nooit een server raken — waarmee hun servingkosten volledig verdwijnen en ook latentie- en privacy-overwegingen worden aangepakt.
Positie in de inferentiewedloop
Perplexity draait op NVIDIA-infrastructuur en onderhoudt strategische partnerschappen met zowel NVIDIA als CoreWeave, de GPU-cloudprovider die uitgegroeid is tot een standaardkeuze voor AI-workloads. Bij 400 miljoen queries per maand vertalen ROSE's bandbreedte-efficiëntie van 97,1% en de 32x opslagreductie door gekwantiseerde embeddings zich direct in infrastructuurkostenbesparingen. Wat de komende tijd zal moeten blijken, is of Perplexity's gepubliceerde serving-stack en hybride orchestrator onderscheidend vermogen bieden tegen grotere rivalen die eveneens eigen inferentie-infrastructuur bouwen, en of de open-source fabric-lib ingang vindt in de bredere AI-servinggemeenschap.