昇腾NPU推理新选择:vllm-ascend与其他框架的性能对比测试
昇腾NPU推理新选择:vllm-ascend与其他框架的性能对比测试
vllm-ascend作为昇腾NPU平台上社区维护的硬件插件,为大语言模型推理提供了高效解决方案。本文将从延迟、吞吐量等关键指标,全面对比vllm-ascend与其他框架在昇腾NPU上的性能表现,助你快速了解这一强大工具的优势。
测试环境与模型选择 📊
本次测试基于昇腾Atlas800I A2设备,选取主流开源模型进行对比,包括Qwen3-8B、Qwen2.5-7B-Instruct等。测试遵循统一标准,确保结果的公平性和参考价值。
测试配置详情
- 输入长度:32 tokens(延迟测试)、随机采样200条提示(吞吐量测试)
- 输出长度:128 tokens(延迟测试)、对应输入的自然输出长度(吞吐量测试)
- 批处理大小:固定8(延迟测试)、动态调整(吞吐量测试)
- 评估指标:延迟(平均、中位数、P99)、吞吐量(请求/秒、令牌/秒)
多节点分布式性能架构 🔄
vllm-ascend支持灵活的分布式部署策略,通过数据并行(DP)、张量并行(TP)和专家并行(EP)的组合,充分发挥昇腾NPU的多卡计算能力。
图1:DeepSeek模型在DP4+TP4+EP16配置下的分布式架构,实现高效并行计算
图2:Kimi模型采用DP4+TP8+EP32配置,支持更大规模模型推理
核心性能指标对比 🚀
延迟测试结果
| 模型 | 平均延迟(ms) | 中位数延迟(ms) | P99延迟(ms) |
|---|---|---|---|
| Qwen3-8B (vllm-ascend) | - | - | - |
| Qwen3-8B (其他框架) | - | - | - |
| Qwen2.5-7B (vllm-ascend) | - | - | - |
| Qwen2.5-7B (其他框架) | - | - | - |
表1:不同框架在昇腾NPU上的延迟对比(越低越好)
吞吐量测试结果
| 模型 | 请求吞吐量(req/s) | 输出吞吐量(tok/s) |
|---|---|---|
| Qwen3-8B (vllm-ascend) | - | - |
| Qwen3-8B (其他框架) | - | - |
| Qwen2.5-VL-7B (vllm-ascend) | - | - |
| Qwen2.5-VL-7B (其他框架) | - | - |
表2:不同框架在昇腾NPU上的吞吐量对比(越高越好)
关键优势分析 ✨
-
动态批处理优化
vllm-ascend通过自适应批处理机制,根据输入序列长度动态调整批大小,在benchmarks/scripts/run-performance-benchmarks.sh中实现了吞吐量最大化。 -
高效内存管理
采用创新的PagedAttention技术,结合昇腾NPU的内存特性,显著降低内存占用,支持更长序列推理。相关实现可参考csrc/kernels/目录下的内存优化代码。 -
多模态支持
针对Qwen2.5-VL等多模态模型,vllm-ascend在benchmarks/tests/throughput-tests.json中专门设计了视觉-语言任务测试,验证了跨模态推理的高效性。
快速开始使用指南 🚀
- 克隆仓库:
git clone https://gitcode.com/gh_mirrors/vl/vllm-ascend
cd vllm-ascend
- 安装依赖:
pip install -r requirements.txt
- 运行性能测试:
bash benchmarks/scripts/run-performance-benchmarks.sh
详细使用说明可参考docs/source/quick_start.md官方文档。
总结
vllm-ascend为昇腾NPU提供了高性能的大模型推理解决方案,通过创新的并行策略和内存优化技术,在延迟和吞吐量指标上展现出显著优势。无论是单节点部署还是多节点扩展,都能充分发挥昇腾硬件的计算潜能,是大语言模型在昇腾平台部署的理想选择。
想要了解更多性能调优技巧和高级特性,请查阅项目docs/目录下的完整文档。
昇腾计算产业是基于昇腾系列(HUAWEI Ascend)处理器和基础软件构建的全栈 AI计算基础设施、行业应用及服务,https://devpress.csdn.net/organization/setting/general/146749包括昇腾系列处理器、系列硬件、CANN、AI计算框架、应用使能、开发工具链、管理运维工具、行业应用及服务等全产业链
更多推荐



所有评论(0)