НовостиАкцииPerplexity создаёт собственную инфраструктуру обслуживания ИИ, чтобы ускорить поиск и снизить расходы

Perplexity создаёт собственную инфраструктуру обслуживания ИИ, чтобы ускорить поиск и снизить расходы

Автор: CryptoBriefing·

Ключевые выводы

  • Perplexity AI обрабатывает около 400 миллионов поисковых запросов в месяц и создала собственную инфраструктуру обслуживания, чтобы снизить вычислительные затраты, которые ИИ-поиск несёт на каждом запросе.
  • Эмбеддинг-модели pplx-embed, выпущенные в феврале 2026 года в размерах 0,6 и 4 миллиарда параметров, используют квантизацию для сокращения требований к хранению до 32 раз.
  • Движок обслуживания ROSE от Perplexity использует кастомные оптимизации RDMA-сети, достигая эффективности полосы пропускания до 97,1% и способен обслуживать модели Mixture-of-Experts с триллионами параметров.
  • В ноябре 2025 года Perplexity опубликовала на arXiv статью о своих оптимизациях и открыла исходный код fabric-lib — библиотеки кастомных MoE-ядер, обеспечивающих, по заявлениям компании, лучшие в своём классе задержки обслуживания.
  • Гибридный оркестратор локально-облачного инференса, представленный в июне 2026 года, распределяет запросы между моделями на устройствах и в облаке, устраняя затраты на обслуживание для локально обрабатываемых запросов.
Perplexity создаёт собственную инфраструктуру обслуживания ИИ, чтобы ускорить поиск и снизить расходы

Работа поисковой системы на базе ИИ, обрабатывающей примерно 400 миллионов запросов в месяц, сопряжена со значительными затратами. Perplexity AI незаметно строила инфраструктуру для снижения этих расходов, публикуя исследования по кастомным технологиям обслуживания — от компактных эмбеддинг-моделей до собственного движка, способного запускать модели с триллионами параметров.

Эти усилия отражают более широкую отраслевую реальность: поисковые системы на базе ИИ несут вычислительные затраты на каждый запрос, которых нет у традиционного поиска по ключевым словам, поэтому эффективность инференса стала центральной ареной борьбы для компаний, стремящихся сделать ИИ-ответы экономически выгодными в потребительском масштабе.

Компактные эмбеддинг-модели для поиска

Основой улучшений поиска Perplexity является семейство моделей pplx-embed, включающее pplx-embed-v1 и pplx-embed-context-v1. Модели выпускаются в двух размерах: вариант на 0,6 миллиарда параметров и более крупная версия на 4 миллиарда параметров. Обе были выпущены в феврале 2026 года.

С помощью техник квантизации — которые снижают численную точность весов модели без потери точности результатов — Perplexity заявляет о сокращении требований к хранению до 32 раз. Обе модели были специально оптимизированы для развёртывания с минимальным объёмом хранения, что отражает практические реалии веб-масштабного поиска, где каждый запрос требует обработки огромных индексов эмбеддингов документов.

ROSE и кастомная сеть

Более амбициозной частью инфраструктуры является ROSE — сокращение от Runtime-Optimized Serving Engine. Представленный около февраля 2025 года, ROSE разработан для обслуживания широкого спектра архитектур моделей, включая набирающий популярность формат Mixture-of-Experts (MoE), лежащий в основе многих крупнейших языковых моделей современности. Архитектуры MoE активируют лишь часть параметров модели на каждый запрос, но предъявляют высокие требования к межGPU-коммуникации, поэтому эффективность сети является ключевым фактором доступного по цене обслуживания таких моделей.

Perplexity решила проблему обслуживания MoE с помощью кастомных оптимизаций RDMA-сети, достигнув эффективности полосы пропускания до 97,1%. RDMA (Remote Direct Memory Access, удалённый прямой доступ к памяти) позволяет графическим процессорам обмениваться данными без участия CPU. Движок работает в средах AWS Elastic Fabric Adapter. В ноябре 2025 года Perplexity опубликовала на arXiv свою первую статью с описанием этих оптимизаций и открыла исходный код библиотеки fabric-lib, содержащей кастомные MoE-ядра, которые, по словам компании, обеспечивают лучшие в своём классе задержки при обслуживании моделей с триллионами параметров. Решение открыть исходный код согласуется с более широкой тенденцией, когда ИИ-лаборатории публикуют исследования по инфраструктуре обслуживания, как это было в случае с раскрытием DeepSeek техник оптимизации инференса.

Гибридный инференс и обработка на устройствах

В июне 2026 года Perplexity представила гибридный оркестратор локально-облачного инференса. Система автоматически распределяет задачи между моделями на устройствах, работающими на локальном оборудовании, и более мощными облачными моделями в зависимости от сложности запроса. Оркестратор поддерживает несколько вариантов локального кремния, а обработка некоторых запросов на устройстве означает, что они вообще не достигают сервера — это полностью устраняет затраты на их обслуживание, а также решает вопросы задержек и конфиденциальности.

Позиция в гонке инференса

Perplexity работает на инфраструктуре NVIDIA и поддерживает стратегические партнёрства как с NVIDIA, так и с CoreWeave — облачным провайдером GPU, ставшим одним из основных вариантов для ИИ-нагрузок. При 400 миллионах запросов в месяц эффективность полосы пропускания ROSE в 97,1% и 32-кратное сокращение хранения за счёт квантованных эмбеддингов напрямую превращаются в экономию на инфраструктуре. Осталось наблюдать, станут ли опубликованный Perplexity стек обслуживания и гибридный оркестратор конкурентными преимуществами против более крупных rivals, также строящих собственную инфраструктуру инференса, и получит ли открытая библиотека fabric-lib распространение в более широком сообществе ИИ-обслуживания.