Perplexity construye infraestructura propia de servicio de IA para reducir costos y acelerar las búsquedas
Puntos clave
- •Perplexity AI procesa aproximadamente 400 millones de consultas de búsqueda al mes y ha construido infraestructura de servicio personalizada para reducir los costos de cómputo que la búsqueda con IA incurre en cada consulta.
- •Los modelos de embeddings pplx-embed, lanzados en febrero de 2026 en tamaños de 0,6 y 4 mil millones de parámetros, utilizan cuantización para reducir los requisitos de almacenamiento hasta 32 veces.
- •El motor de servicio ROSE de Perplexity emplea optimizaciones de red RDMA personalizadas para alcanzar hasta un 97,1% de eficiencia de ancho de banda y puede servir modelos de Mezcla de Expertos de billones de parámetros.
- •En noviembre de 2025, Perplexity publicó un artículo en arXiv sobre sus optimizaciones y liberó como código abierto fabric-lib, una biblioteca de kernels MoE personalizados que, según se afirma, ofrece latencias de servicio de vanguardia.
- •Un orquestador de inferencia híbrida local-nube presentado en junio de 2026 dirige las consultas entre modelos en el dispositivo y en la nube, eliminando los costos de servicio de las consultas atendidas localmente.

Operar un motor de búsqueda con IA que maneja aproximadamente 400 millones de consultas al mes conlleva costos significativos. Perplexity AI ha estado construyendo discretamente infraestructura para reducir esos gastos, publicando investigaciones sobre tecnología de servicio personalizada que abarca desde modelos de embeddings compactos hasta un motor propio capaz de ejecutar modelos de billones de parámetros.
El esfuerzo refleja una realidad más amplia de la industria: los motores de búsqueda con IA asumen un costo de cómputo en cada consulta que la búsqueda tradicional por palabras clave no tiene, razón por la cual la eficiencia de inferencia se ha convertido en un campo de batalla central para las empresas que compiten por hacer que las respuestas de IA sean económicas a escala de consumo.
Modelos de embeddings compactos para recuperación
En el centro de las mejoras de recuperación de Perplexity se encuentra la familia de modelos pplx-embed, compuesta por pplx-embed-v1 y pplx-embed-context-v1. Los modelos vienen en dos tamaños: una variante de 0,6 mil millones de parámetros y una versión más grande de 4 mil millones de parámetros. Ambos fueron lanzados en febrero de 2026.
Mediante técnicas de cuantización —que reducen la precisión numérica de los pesos del modelo sin destruir la exactitud—, Perplexity afirma reducciones de hasta 32 veces en los requisitos de almacenamiento. Ambos modelos fueron optimizados específicamente para implementaciones de bajo almacenamiento, una decisión de diseño que refleja las realidades prácticas de la recuperación a escala web, donde cada consulta exige buscar en vastos índices de documentos embebidos.
ROSE y las redes personalizadas
La pieza de infraestructura más ambiciosa es ROSE, sigla de Runtime-Optimized Serving Engine. Presentado alrededor de febrero de 2025, ROSE está diseñado para servir a una amplia gama de arquitecturas de modelos, incluido el formato cada vez más popular de Mezcla de Expertos (MoE) que sustenta muchos de los modelos de lenguaje más grandes de la actualidad. Las arquitecturas MoE activan solo una fracción de los parámetros del modelo por consulta, pero imponen fuertes demandas de comunicación entre GPUs, por lo que la eficiencia de red es una palanca clave para servirlos de forma asequible.
Perplexity abordó el servicio de modelos MoE con optimizaciones de red RDMA personalizadas que alcanzan hasta un 97,1% de eficiencia de ancho de banda. RDMA, o acceso directo a memoria remota, permite que las GPUs se comuniquen sin pasar por la CPU. El motor funciona en entornos de AWS Elastic Fabric Adapter. En noviembre de 2025, Perplexity publicó su primer artículo en arXiv detallando estas optimizaciones y liberó como código abierto una biblioteca llamada fabric-lib, que contiene kernels MoE personalizados que, según la compañía, ofrecen latencias de vanguardia para el servicio de modelos de billones de parámetros. La decisión de liberar el trabajo como código abierto alinea a Perplexity con una tendencia más amplia de laboratorios de IA que publican abiertamente su investigación sobre infraestructura de servicio, como ocurrió con la divulgación de las técnicas de optimización de inferencia de DeepSeek.
Inferencia híbrida y procesamiento en el dispositivo
En junio de 2026, Perplexity presentó un orquestador de inferencia híbrida local-nube. El sistema dirige automáticamente las tareas entre modelos que se ejecutan en el hardware local y modelos más potentes basados en la nube, según la complejidad de la consulta. El orquestador admite múltiples opciones de silicio local, y mantener ciertas consultas en el dispositivo significa que nunca tocan un servidor, lo que elimina por completo su costo de servicio y a la vez aborda consideraciones de latencia y privacidad.
Posición en la carrera armamentista de inferencia
Perplexity opera sobre infraestructura de NVIDIA y mantiene alianzas estratégicas tanto con NVIDIA como con CoreWeave, el proveedor de nube de GPUs que se ha convertido en referencia para las cargas de trabajo de IA. Con 400 millones de consultas mensuales, la eficiencia de ancho de banda del 97,1% de ROSE y la reducción de almacenamiento de 32 veces de los embeddings cuantizados se traducen directamente en ahorros de costos de infraestructura. Lo que habrá que observar en adelante es si la pila de servicio publicada por Perplexity y su orquestador híbrido se convierten en diferenciadores frente a rivales más grandes que también construyen su propia infraestructura de inferencia, y si fabric-lib, liberado como código abierto, gana adopción en la comunidad más amplia de servicio de IA.