ActualitésActionsPerplexity construit une infrastructure d'inférence personnalisée pour réduire les coûts et accélérer la recherche

Perplexity construit une infrastructure d'inférence personnalisée pour réduire les coûts et accélérer la recherche

Auteur: CryptoBriefing·

Points clés

  • Perplexity AI traite environ 400 millions de requêtes de recherche par mois et a construit une infrastructure de serving personnalisée pour réduire les coûts de calcul que la recherche par IA engendre à chaque requête.
  • Les modèles d'embedding pplx-embed, publiés en février 2026 en tailles de 0,6 et 4 milliards de paramètres, utilisent la quantification pour réduire les besoins de stockage jusqu'à 32 fois.
  • Le moteur de serving ROSE de Perplexity utilise des optimisations réseau RDMA personnalisées pour atteindre jusqu'à 97,1 % d'efficacité de bande passante et peut servir des modèles Mixture-of-Experts de mille milliards de paramètres.
  • En novembre 2025, Perplexity a publié un article sur arXiv concernant ses optimisations et a open-sourcé fabric-lib, une bibliothèque de noyaux MoE personnalisés censés offrir des latences de serving de pointe.
  • Un orchestrateur d'inférence hybride local-cloud dévoilé en juin 2026 achemine les requêtes entre modèles sur appareil et modèles cloud, éliminant les coûts de serving des requêtes traitées localement.
Perplexity construit une infrastructure d'inférence personnalisée pour réduire les coûts et accélérer la recherche

Exploiter un moteur de recherche par IA traitant environ 400 millions de requêtes par mois engendre des coûts considérables. Perplexity AI construit discrètement une infrastructure destinée à réduire ces dépenses, en publiant des travaux de recherche sur des technologies de serving personnalisées allant de modèles d'embedding compacts à un moteur propriétaire capable d'exécuter des modèles de mille milliards de paramètres.

Cet effort reflète une réalité plus large du secteur : les moteurs de recherche par IA absorbent, à chaque requête, un coût de calcul que la recherche par mots-clés traditionnelle n'a pas, ce qui explique pourquoi l'efficacité d'inférence est devenue un champ de bataille central pour les entreprises cherchant à rendre les réponses IA économiques à l'échelle grand public.

Des modèles d'embedding compacts pour la récupération

Au cœur des améliorations de récupération de Perplexity se trouve la famille de modèles pplx-embed, comprenant pplx-embed-v1 et pplx-embed-context-v1. Ces modèles existent en deux tailles : une variante de 0,6 milliard de paramètres et une version plus grande de 4 milliards de paramètres. Les deux ont été publiées en février 2026.

Grâce à des techniques de quantification — qui réduisent la précision numérique des poids du modèle sans détruire la précision des résultats — Perplexity affiche des réductions des besoins de stockage allant jusqu'à 32 fois. Les deux modèles ont été optimisés spécifiquement pour un déploiement à faible stockage, un choix de conception reflétant les réalités pratiques de la récupération à l'échelle du web, où chaque requête nécessite de rechercher dans d'immenses index de documents embarqués.

ROSE et le réseau personnalisé

La pièce d'infrastructure la plus ambitieuse est ROSE, pour Runtime-Optimized Serving Engine. Introduit vers février 2025, ROSE est conçu pour servir un large éventail d'architectures de modèles, y compris le format de plus en plus populaire Mixture-of-Experts (MoE), qui sous-tend nombre des plus grands modèles de langage actuels. Les architectures MoE n'activent qu'une fraction des paramètres d'un modèle par requête, mais elles imposent de lourdes exigences de communication entre GPU, raison pour laquelle l'efficacité du réseau est un levier clé pour les servir à coût abordable.

Perplexity a traité le serving MoE avec des optimisations réseau RDMA personnalisées atteignant jusqu'à 97,1 % d'efficacité de bande passante. Le RDMA, ou Remote Direct Memory Access, permet aux GPU de communiquer sans passer par le CPU. Le moteur fonctionne sur des environnements AWS Elastic Fabric Adapter. En novembre 2025, Perplexity a publié son premier article sur arXiv détaillant ces optimisations et a open-sourcé une bibliothèque nommée fabric-lib, contenant des noyaux MoE personnalisés qui, selon l'entreprise, offrent des latences de pointe pour le serving de modèles de mille milliards de paramètres. La décision d'open-sourcer ces travaux aligne Perplexity sur une tendance plus large de laboratoires d'IA publiant publiquement leurs recherches sur l'infrastructure de serving, comme ce fut le cas avec la divulgation par DeepSeek de ses techniques d'optimisation d'inférence.

Inférence hybride et traitement sur appareil

En juin 2026, Perplexity a dévoilé un orchestrateur d'inférence hybride local-cloud. Le système achemine automatiquement les tâches entre des modèles sur appareil fonctionnant sur du matériel local et des modèles cloud plus puissants, selon la complexité de la requête. L'orchestrateur prend en charge plusieurs options de silicium local, et le fait de garder certaines requêtes sur l'appareil signifie qu'elles ne touchent jamais un serveur — éliminant entièrement leur coût de serving tout en répondant également aux considérations de latence et de confidentialité.

Position dans la course aux armements de l'inférence

Perplexity fonctionne sur une infrastructure NVIDIA et entretient des partenariats stratégiques avec NVIDIA et CoreWeave, le fournisseur de cloud GPU devenu une référence pour les charges de travail IA. Avec 400 millions de requêtes mensuelles, l'efficacité de bande passante de 97,1 % de ROSE et la réduction de stockage de 32 fois obtenue grâce aux embeddings quantifiés se traduisent directement par des économies d'infrastructure. Reste à voir si la pile de serving publiée par Perplexity et son orchestrateur hybride deviendront des facteurs différenciants face à des concurrents plus importants qui construisent eux aussi leur propre infrastructure d'inférence, et si la bibliothèque fabric-lib open-sourcée sera adoptée par la communauté plus large du serving IA.