新聞股票Perplexity 打造自研 AI 推論基礎設施,降低成本並加速搜尋

Perplexity 打造自研 AI 推論基礎設施,降低成本並加速搜尋

作者: CryptoBriefing·

重點速覽

  • Perplexity AI 每月處理約 4 億次搜尋查詢,並已打造自研服務基礎設施,以降低 AI 搜尋每次查詢所產生的運算成本。
  • 2026 年 2 月發布的 pplx-embed 嵌入式模型提供 6 億與 40 億參數兩種規模,透過量化技術將儲存需求最多削減 32 倍。
  • Perplexity 的 ROSE 服務引擎採用自訂 RDMA 網路優化,達到最高 97.1% 的頻寬效率,並可服務兆級參數的混合專家模型。
  • 2025 年 11 月,Perplexity 在 arXiv 發表優化技術論文,並開源 fabric-lib——一個宣稱可提供業界領先服務延遲的自訂 MoE 核心程式庫。
  • 2026 年 6 月推出的混合式本地-雲端推論編排器,會在裝置端模型與雲端模型之間分配查詢,徹底消除本地處理查詢的服務成本。
Perplexity 打造自研 AI 推論基礎設施,降低成本並加速搜尋

經營一個每月處理約 4 億次查詢的 AI 搜尋引擎,成本相當可觀。Perplexity AI 一直低調建構基礎設施以削減這些開支,並發表自研服務技術的研究成果,範圍涵蓋輕量嵌入式模型,一直到能夠運行兆級參數模型的專有引擎。

這項努力反映了更廣泛的產業現實:AI 搜尋引擎每次查詢都必須承擔傳統關鍵字搜尋所沒有的運算成本,這也是為何推論效率已成為各家競相讓 AI 回答在消費級規模下具經濟效益的關鍵戰場。

用於檢索的輕量嵌入式模型

Perplexity 檢索改善的核心是 pplx-embed 系列模型,包含 pplx-embed-v1 與 pplx-embed-context-v1。這些模型有兩種規模:6 億參數版本與較大的 40 億參數版本,兩者均於 2026 年 2 月發布。

透過量化技術(即在不損失準確度的前提下降低模型權重的數值精度),Perplexity 宣稱儲存需求最多可減少 32 倍。兩款模型皆針對低儲存部署進行優化,這項設計選擇反映了網路規模檢索的實際情況——每次查詢都需要搜尋龐大的嵌入式文件索引。

ROSE 與自訂網路

更具企圖心的基礎設施是 ROSE,即 Runtime-Optimized Serving Engine(執行時優化服務引擎)的縮寫。ROSE 於 2025 年 2 月前後推出,旨在服務多種模型架構,包括支撐當今許多最大型語言模型、日益流行的混合專家(MoE)架構。MoE 架構每次查詢僅啟動模型的一小部分參數,但對 GPU 間通訊的需求極高,因此網路效率是降低其服務成本的關鍵槓桿。

Perplexity 以自訂 RDMA 網路優化解決 MoE 服務問題,達到最高 97.1% 的頻寬效率。RDMA(遠端直接記憶體存取)讓 GPU 無需經過 CPU 即可互相通訊。該引擎運行於 AWS Elastic Fabric Adapter 環境。2025 年 11 月,Perplexity 在 arXiv 發表首篇詳述這些優化成果的論文,並開源名為 fabric-lib 的程式庫,其中包含自訂 MoE 核心,該公司表示可為兆級參數模型服務提供業界領先的延遲表現。選擇開源這項成果,使 Perplexity 與更多 AI 實驗室公開發布服務基礎設施研究的趨勢保持一致,DeepSeek 公開其推論優化技術即是一例。

混合推論與裝置端處理

2026 年 6 月,Perplexity 發表混合式本地-雲端推論編排器。該系統會根據查詢的複雜度,自動在本地硬體上運行的裝置端模型與更強大的雲端模型之間分配任務。此編排器支援多種本地晶片選項,而讓部分查詢留在裝置端處理,意味著這些查詢完全不需經過伺服器——徹底消除其服務成本,同時兼顧延遲與隱私考量。

在推論軍備競賽中的定位

Perplexity 運行於 NVIDIA 基礎設施之上,並與 NVIDIA 及 CoreWeave(已成為 AI 工作負載首選的 GPU 雲端供應商)維持策略性合作夥伴關係。在每月 4 億次查詢的規模下,ROSE 的 97.1% 頻寬效率與量化嵌入式模型帶來的 32 倍儲存縮減,直接轉化為基礎設施成本節省。未來值得觀察的是,Perplexity 公開的服務技術堆疊與混合編排器,能否成為對抗同樣自建推論基礎設施的更大型對手時的差異化優勢,以及開源的 fabric-lib 能否在更廣泛的 AI 服務社群中獲得採用。