AI for Data🔥7.0

Prime Intellect推出Prime Inference:面向前沿开源模型的Serverless与预留式推理服务

原标题: Prime Intellect推出Prime Inference:面向前沿开源模型的Serverless与预留式推理服务

MarkTechPost·2026/10/3 05:37:18🔗 原文

📋总体概括

Prime Intellect推出Prime Inference,一个兼容OpenAI API的推理服务平台,主打Serverless按需与Reserved预留两种服务模式,聚焦在NVIDIA Blackwell硬件上服务前沿开源模型。其GLM-5.3部署采用Dynamo与vLLM作为推理引擎,并使用NVFP4 KV压缩技术,实现了每个prefill组承载66个会话、单用户101 tok/s的生成速度,展示其在开源模型高吞吐低成本推理上的工程能力。

⚡关键信息

  • ▸Prime Intellect发布Prime Inference推理平台,兼容OpenAI API接口
  • ▸平台同时提供Serverless按需与Reserved预留两种推理服务模式
  • ▸基于NVIDIA Blackwell硬件服务前沿开源模型,GLM-5.3已上线
  • ▸技术栈为Dynamo+vLLM,并用NVFP4 KV压缩优化显存与吞吐
  • ▸GLM-5.3部署实测:每个prefill组66个会话,单用户生成速度101 tok/s

🔥犀利点评

OpenAI兼容接口已是开源推理平台的标配,真正的差异化只能靠调度与内核优化。Prime Inference的看点是Serverless+Reserved双模式对齐了开发者与企业的不同付费习惯,而NVFP4 KV压缩直接决定单位GPU能塞多少会话——66会话/组、101 tok/s这个数据才是硬通货。在开源模型推理价格战打到地板的当下,没成本优势的平台都会被Togehter、Fireworks们的规模效应碾碎,Prime Intellect能否靠去中心化算力网络撑住成本结构,才是真正的悬念。

本文由本站自动聚合,以下为原始来源:前往 MarkTechPost 阅读全文 →