科技 来源:MarkTechPost 整理:feaOS 2026-09-06 12:43:39

Perplexity详解GPU嵌入式堆栈:Ivy、Tulip和ROSE如何支持pplx-embed

在AI搜索产品中,检索质量受限于两个因素:嵌入模型的质量和运行成本。本周,Perplexity工程团队发布了一篇文章《Fast Embeddings on GPUs》,详细介绍了支撑pplx-embed的服务基础设施和排名模型。文章指出,在成熟的Hopper和Blackwell硬件上,GPU侧的嵌入推理已经基本收敛。关键决策在于Perplexity没有构建单独的嵌入引擎,而是复用了其LLM堆栈中的预填充和解码内核。Ivy、Tulip和ROSE三个服务共同处理请求:Ivy是Rust HTTP网关,负责CPU侧的工作;Tulip作为推理服务器接口,处理调度和批处理;而ROSE则实现模型推理,并提供CUDA图管理等功能。

ENTRY_ID: NEWS-16013 READ_MODE: SHORT_SIGNAL