- 2026-07-06: 🎉 xLLM 正式捐赠给开放原子开源基金会!
- 2026-06-13: 🎉 我们 day-0 支持了MiniMax-M3 模型的推理服务,部署请参考部署文档。
- 2026-04-24: 🎉 我们 day-0 支持了DeepSeek-V4 模型的推理服务,部署请参考部署文档。
更多新闻
- 2026-02-12: 🎉 我们 day-0 支持了最新的GLM-5 模型的高效推理服务,部署请参考部署文档。
- 2025-12-21: 🎉 我们在第一时间内支持了GLM-4.7模型的高效推理。
- 2025-12-08: 🎉 我们在第一时间内支持了GLM-4.6V模型的高效推理。
- 2025-12-05: 🎉 我们支持了GLM-4.5/GLM-4.6系列模型.
- 2025-12-05: 🎉 我们支持了VLM-R1 模型.
- 2025-12-05: 🎉 我们基于Mooncake构建了混合 KV 缓存管理机制,支持具备智能卸载与预取能力的全局 KV 缓存管理。
- 2025-10-16: 🎉 我们最近在 arXiv 上发布了我们的 xLLM 技术报告,提供了全面的技术蓝图和实施见解。
xLLM 是一个高效的开源大模型推理框架,专为国产芯片优化设计,提供企业级的服务部署,使得性能更高、成本更低。
- 顶尖性能:通过众多先进特性,提供高吞吐、低延迟的推理服务。
- 主流硬件支持:专为国产AI加速卡打造并深度优化。
- 服务-引擎分离架构:服务层负责调度与可用性,引擎层专注于计算。
- 企业级部署:已在京东零售核心业务中大规模落地验证。
| 硬件类型 | 简称 | 型号 | 备注 |
|---|---|---|---|
| Ascend NPU | NPU | A2, A3 | HDK Driver 25.2.0 + |
| Cambricon MLU | MLU | MLU | |
| Moore Threads GPU | MUSA | S5000 | |
| Hygon DCU | DCU | BW1000 | |
| MetaX MACA | MACA | MXC500 | |
| Iluvatar CoreX GPU | ILU | BI150 |
本项目的实现得益于以下开源项目:
- ScaleLLM - 采用了ScaleLLM中构图方式和借鉴Runtime执行。
- Mooncake - 依赖构建了多级KV Cache管理机制。
- brpc - 依赖brpc构建了高性能http service。
- tokenizers-cpp - 依赖tokenizers-cpp构建了c++ tokenizer。
- safetensors - 依赖其c binding safetensors能力。
- Partial JSON Parser - xLLM的C++版本JSON解析器,参考Python与Go实现的设计思路。
- concurrentqueue - 高性能无锁Queue.
感谢以下合作的高校实验室:
- THU-MIG(清华大学软件学院、北京信息科学与技术国家研究中心)
- USTC-Cloudlab(中国科学技术大学云计算实验室)
- Beihang-HiPO(北京航空航天大学HiPO研究组)
- PKU-DS-LAB(北京大学数据结构实验室)
- PKU-NetSys-LAB(北京大学网络系统实验室)
- TJU-TANKLab (天津大学TANK实验室)
感谢以下为xLLM作出贡献的开发者
如果你觉得这个仓库对你有帮助,欢迎引用我们:
@article{liu2025xllm,
title={xLLM Technical Report},
author={Liu, Tongxuan and Peng, Tao and Yang, Peijun and Zhao, Xiaoyang and Lu, Xiusheng and Huang, Weizhe and Liu, Zirui and Chen, Xiaoyu and Liang, Zhiwei and Xiong, Jun and others},
journal={arXiv preprint arXiv:2510.14686},
year={2025}
}


