Perplexity 打造自研 AI 服务基础设施,降低成本并加速搜索
要点速览
- •Perplexity AI 每月处理约 4 亿次搜索查询,并已构建定制服务基础设施,以降低 AI 搜索每次查询所产生的计算成本。
- •pplx-embed 嵌入模型于 2026 年 2 月发布,有 6 亿和 40 亿参数两种规格,利用量化技术将存储需求最多削减 32 倍。
- •Perplexity 的 ROSE 服务引擎采用定制 RDMA 网络优化,实现高达 97.1% 的带宽效率,并可服务万亿参数混合专家模型。
- •2025 年 11 月,Perplexity 在 arXiv 发表相关优化论文,并开源了 fabric-lib——一个据称可提供业界领先服务延迟的定制 MoE 内核库。
- •2026 年 6 月发布的混合本地-云端推理编排器可在端侧模型与云端模型之间分配查询,为本地处理的查询彻底消除服务成本。

运营一个每月处理约 4 亿次查询的 AI 搜索引擎成本高昂。Perplexity AI 一直在悄然构建基础设施以降低这些开支,并发布了涵盖从紧凑嵌入模型到能够运行万亿参数模型的专有引擎等定制服务技术的研究成果。
这一努力反映了更广泛的行业现实:AI 搜索引擎在每次查询中都要承担传统关键词搜索所没有的计算成本,这也是推理效率成为各公司竞相让 AI 回答在消费级规模上实现经济性的核心战场的原因。
用于检索的紧凑嵌入模型
Perplexity 检索改进的核心是 pplx-embed 系列模型,包括 pplx-embed-v1 和 pplx-embed-context-v1。这两个模型有两种规格:一个 6 亿参数版本和一个更大的 40 亿参数版本,均于 2026 年 2 月发布。
通过量化技术——即在不破坏精度的前提下降低模型权重数值精度——Perplexity 声称存储需求最多可减少 32 倍。两款模型均专门针对低存储部署进行了优化,这一设计选择反映了网络规模检索的实际现实:每次查询都需要搜索庞大的嵌入式文档索引。
ROSE 与定制网络
更宏大的基础设施是 ROSE,即运行时优化服务引擎(Runtime-Optimized Serving Engine)。ROSE 于 2025 年 2 月前后推出,旨在服务广泛的模型架构,包括支撑当今许多最大语言模型的、日益流行的混合专家(MoE)格式。MoE 架构每次查询仅激活模型参数的一小部分,但对 GPU 间通信提出了很高要求,因此网络效率是经济地服务此类模型的关键杠杆。
Perplexity 通过定制 RDMA 网络优化解决 MoE 服务问题,实现了高达 97.1% 的带宽效率。RDMA(远程直接内存访问)允许 GPU 无需经过 CPU 即可通信。该引擎可跨 AWS Elastic Fabric Adapter 环境运行。2025 年 11 月,Perplexity 在 arXiv 上发表了详述这些优化的首篇论文,并开源了一个名为 fabric-lib 的库,其中包含该公司称可为万亿参数模型服务提供业界领先延迟的定制 MoE 内核。开源这一工作的决定使 Perplexity 与 AI 实验室公开发布服务基础设施研究的更广泛趋势保持一致,DeepSeek 公开其推理优化技术便是先例。
混合推理与端侧处理
2026 年 6 月,Perplexity 发布了混合本地-云端推理编排器。该系统会根据查询复杂程度,自动在运行于本地硬件的端侧模型与更强大的云端模型之间分配任务。该编排器支持多种本地芯片选项,将某些查询保留在设备端意味着它们完全不经过服务器——彻底消除了其服务成本,同时兼顾了延迟和隐私方面的考量。
在推理军备竞赛中的位置
Perplexity 运行于 NVIDIA 基础设施之上,并与 NVIDIA 和 CoreWeave(已成为 AI 工作负载首选的 GPU 云提供商)保持战略合作伙伴关系。在每月 4 亿次查询的规模下,ROSE 的 97.1% 带宽效率和量化嵌入带来的 32 倍存储缩减直接转化为基础设施成本节约。未来值得关注的是,Perplexity 已发布的服务技术栈和混合编排器能否成为其对抗同样自建推理基础设施的更大竞争对手的差异化优势,以及开源的 fabric-lib 能否在更广泛的 AI 服务社区中获得采用。