摩尔线程与xLLM推理引擎深度协同 国产AI算力生态再添里程碑
近日摩尔线程与国产高性能大模型推理引擎xLLM完成深度协同优化。双方团队基于摩尔线程旗舰级训推一体智算卡MTT S5000围绕MUSA统一系统架构进行底层调优在多种典型推理负载下实现显著性能跃升。这不仅是国产AI算力生态的又一关键里程碑更为开发者提供了“国产芯片国产推理引擎”的高性能组合新选择。xLLM为国产加速器从零构建的高性能推理引擎xLLM是一款开源的大模型推理引擎专为国产AI加速芯片深度优化已在某电商零售核心业务中完成大规模生产环境验证。不同于vLLM、SGLang等基于Python生态的主流框架xLLM选择了一条从零构建的技术路线——以C重构推理引擎核心从系统层面突破性能瓶颈而非在现有Python框架上做增量优化。随着大模型推理进入毫秒级、微秒级响应竞争阶段性能瓶颈不再仅取决于算力峰值而更多暴露在任务调度、显存管理及内核并发等系统层级。xLLM采用服务层与引擎层解耦的架构设计服务层实现了弹性调度、动态PD分离、混合EPD多模态调度及高可用容错引擎层则通过多流并行计算、图融合优化、投机推理、动态负载均衡和全局KV缓存管理等技术实现对底层硬件算力的极致释放。目前xLLM已在多家主流国产芯片上完成深度适配其对摩尔线程MUSA后端的支持通过--device musa构建参数实现。摩尔线程MTT S5000作为xLLM官方支持的MUSA硬件平台之一双方已在底层展开了深度协同。MTT S5000 xLLM协同优化下的性能跃升摩尔线程MTT S5000是专为大模型训练、推理及高性能计算而设计的全功能GPU智算卡基于第四代MUSA架构“平湖”打造完整支持从FP8到FP64的全精度计算配备大容量显存与高带宽。目前已实现对PyTorch、Megatron-LM、vLLM及SGLang等主流AI框架的深度兼容。本次性能测试基于MTT S5000单卡环境在三种典型输入/输出长度配置2.5k-1k、3.5k-1.5k、9k-1k下分别测试Batch Size为1、2、4、8、16、32时的推理性能。结果显示随着并发数的提升各场景的吞吐量均表现出良好的扩展性。特别是在2.5k与3.5k这两个场景单卡并发32路时每Token输出时间TPOT可保持在40ms以内Decode吞吐超过2500 tokens/stgs。在SLA约束Mean TTFT1sMean TPOT50ms下进一步对比MTT S5000在xLLM与SGLang上的推理性能。得益于xLLM在C后端、多流并行计算及图融合等方面的框架特性在相同并发数下xLLM可降低TPOT 10%以上综合性能增益超过10%。若在SLA约束下选择对应最优并发配置在2.5k-1.5k场景中xLLM相比SGLang可获得53.9%的Decode吞吐性能收益。共建国产AI算力生态xLLM目前已支持Qwen、DeepSeek、GLM、MiniMax等主流大模型系列。摩尔线程与xLLM团队将持续深化合作重点推进以下工作。模型适配加速▼Qwen系列即将完成对Qwen全系列模型的深度适配与性能优化充分发挥MTT S5000在长序列处理中的硬件优势。▼DeepSeek系列将MTT S5000在DeepSeek-V4上积累的算子能力迁移至xLLM并完成适配优化。▼GLM系列延续xLLM已实现的GLM-5 Day0支持能力持续跟进GLM最新版本的极速适配。性能持续优化协同xLLM团队针对MUSA后端进行平台特定的Kernel实现优化结合MTT S5000硬件特性在算子融合、内存管理、通信并行等维度持续挖掘性能潜力。生态共建双方将共同推动国产AI基础设施的生态建设为开发者提供“国产芯片 国产推理引擎”的一站式高性能解决方案助力企业以更低成本、更高效率落地AI大模型应用。欢迎广大开发者关注摩尔线程及xLLM官方动态共同参与国产AI技术生态的构建与完善。*以上测试数据来自摩尔线程实验室。

相关新闻