8月24日,摩尔线程宣布,《MTT S5000 Prefill-as-a-Service技术白皮书》面世,基于旗舰级AI训推一体智算卡MTT S5000构建“Prefill As a Service”新范式,面向AI Agent、代码生成、超长文档分析等长上下文推理场景,为行业提供兼顾推理效率、成本控制与算力变现的可落地路径。

“长上下文”时代,“算力错配”怎么办?
当前,大模型输入的上下文规模已经迈入数百K到1M 级别,长文本输入带来的算力消耗与首字时延压力持续攀升,正日益成为制约企业推理服务效率与总拥有成本的关键瓶颈。传统同构集群的算力部署模式,已难以应对不同计算阶段对硬件资源的差异化需求。算力供需矛盾的核心痛点在于结构性错配:在大模型在线推理中,输入阶段的Prefill(预填充)属计算密集型任务,受浮点算力约束;输出阶段的Decode(解码)属访存密集型任务,受显存带宽约束。两者在同一物理资源池中混跑,必然导致双向浪费——按Decode带宽选型,则Prefill的大容量显存长期低效;按Prefill算力选型,则Decode计算单元大面积空转。
破局:Prefill-Decode异构解耦,重构推理资源池
《白皮书》为突破瓶颈找到了一条可能的路径。
《白皮书》认为,这条路径的关键在于将Prefill与Decode彻底解耦,使二者各自运行在最契合自身计算特性的硬件资源池上:Prefill算力池:专攻高算力利用率与极低首字延迟(TTFT);Decode资源池:专攻高并发与稳定的每Token延迟(ITL)。通过硬件分层投入,算力配置从“通用冗余”转向“按需匹配”,在满足服务质量(SLO)约束的前提下,实现单位Token基础设施成本大幅下降。
MTT S5000构筑高吞吐Prefill专属算力池
作为一款全功能通用AI加速卡,MTT S5000在硬件特性上与Prefill任务高度契合,展现出出色的工程适配与规模化落地能力:
一方面,可以实现“高计算密度,压缩首字时延”,针对Prefill的计算密集型特征,MTT S5000提供高稠密算力,有效压缩首Token生成时延(TTFT);在长上下文场景下,以GLM-5.2为例,单机8卡可实现接近十万级Prefill吞吐,为Agent、长文档分析等业务提供确定性的SLO承诺与容量规划能力。
另一方面,拥有“原生FP8支持,消除格式转换开销”,支持FP8至FP64全精度计算,天然适配主流大模型原生精度,Prefill过程不引入额外精度损耗;原生FP8 KV Cache与Decode池保持高度兼容,消除跨节点传输前的格式转换成本,显著降低KV Cache传输时延。
因为上述的技术进展,摩尔线程得以进一步实现生态成熟兼容,并降低落地门槛。依托MUSA软件生态,全面兼容CUDA及PyTorch、SGLang、vLLM等主流推理框架,企业可基于现有代码资产实现平滑迁移与快速适配。
观察: 以“推理效率+商业回报”重构产业竞争逻辑
大模型产业竞争进入下半场,推理效率与商业回报的较量更加激烈。摩尔线程通过MTT S5000与Prefill-as-a-Service方案,不仅重塑了长上下文推理的性能与成本边界,更帮助企业在万亿参数与Agent时代牢牢掌握TCO主动权。
文、图/广州日报新花城记者:钟达文
广州日报新花城编辑:李光曼





























