Nunchaku 是一款为 4-bit 神经网络优化的高性能推理引擎,详见我们的论文 SVDQuant。底层量化库请参考 DeepCompressor。
欢迎加入我们的用户群:Slack、Discord 和 微信,与社区交流!更多详情见 这里。如有问题、遇到 bug 或有意贡献代码,欢迎随时联系我们!
- [2025-07-13] 🚀 官方 Nunchaku 文档 上线!欢迎查阅详细的入门指南和资源。
- [2025-06-29] 🔥 支持 FLUX.1-Kontext!可参考我们的示例脚本体验,在线演示见此处!
- [2025-06-01] 🚀 v0.3.0 发布! 本次更新支持多 batch 推理、ControlNet-Union-Pro 2.0、初步集成 PuLID,并引入 双 FB Cache。现已支持单文件加载 FLUX 模型,升级后的 4-bit T5 编码器 质量媲美 FP8 T5!
- [2025-04-16] 🎥 发布中英文安装与使用教程视频(B站)。
- [2025-04-09] 📢 发布 四月路线图 及 FAQ,助力社区快速上手并了解最新进展。
- [2025-04-05] 🚀 Nunchaku v0.2.0 发布! 本次更新带来 多 LoRA 和 ControlNet 支持,并通过 FP16 attention 和 First-Block Cache 实现更快推理。现已兼容 20 系显卡 —— Nunchaku 更易用!
更多历史
- [2025-03-07] 🚀 Nunchaku v0.1.4 发布! 支持 4-bit 文本编码器和逐层 CPU 下放,将 FLUX 最低显存需求降至 4 GiB,同时实现 2–3× 加速。本次还修复了分辨率、LoRA、pin memory 和稳定性等问题,详见发布说明!
- [2025-02-20] 🚀 RTX 5090 支持 NVFP4 精度! NVFP4 相比 INT4 画质更佳,在 RTX 5090 上比 BF16 快 ~3×。详情见博客,用法见
examples,在线体验点此! - [2025-02-18] 🔥 自定义 LoRA 转换 和 模型量化 教程上线!ComfyUI 工作流现已支持 自定义 LoRA 及 FLUX.1-Tools!
- [2025-02-11] 🎉 SVDQuant 入选 ICLR 2025 Spotlight!FLUX.1-tools Gradio 演示上线! 详情见 这里。全新 depth-to-image 演示 也已上线,欢迎体验!
- [2025-02-04] 🚀 4-bit FLUX.1-tools 发布! 推理速度比原模型快 2-3×。用法见 examples。ComfyUI 集成即将上线!
- [2025-01-23] 🚀 4-bit SANA 支持! 推理速度比 16-bit 模型快 2-3×。用法见 示例 和 部署指南。在线体验 svdquant.mit.edu!
- [2025-01-22] 🎉 SVDQuant 被 ICLR 2025 录用!
- [2024-12-08] 支持 ComfyUI。用法见 ComfyUI-nunchaku。
- [2024-11-07] 🔥 最新 W4A4 Diffusion 量化工作 SVDQuant 正式发布!量化库见 DeepCompressor。

SVDQuant: 通过低秩分支吸收异常值,实现 4-bit Diffusion 模型
Muyang Li*,Yujun Lin*,Zhekai Zhang*,Tianle Cai,Xiuyu Li,Junxian Guo,Enze Xie,Chenlin Meng,Jun-Yan Zhu,Song Han
MIT, NVIDIA, CMU, Princeton, UC Berkeley, SJTU, Pika Labs
demo.mov



- 安装指南
- 使用教程
- ComfyUI 插件:ComfyUI-nunchaku
- 自定义模型量化:DeepCompressor
- Gradio 演示应用
- 复现 SVDQuant 论文结果
- API 参考
- 贡献指南
- 常见问题 FAQ
暑期开发计划见 这里。
如有企业合作、技术咨询、赞助或合作意向,请联系 muyangli@mit.edu。
- Efficient Spatially Sparse Inference for Conditional GANs and Diffusion Models, NeurIPS 2022 & T-PAMI 2023
- SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models, ICML 2023
- Q-Diffusion: Quantizing Diffusion Models, ICCV 2023
- AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration, MLSys 2024
- DistriFusion: Distributed Parallel Inference for High-Resolution Diffusion Models, CVPR 2024
- QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving, MLSys 2025
- SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers, ICLR 2025
- Radial Attention: $O(n \log n)$ Sparse Attention with Energy Decay for Long Video Generation, ArXiv 2025
如果您觉得 nunchaku 对您的研究有用或相关,请引用我们的论文:
@inproceedings{
li2024svdquant,
title={SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models},
author={Li*, Muyang and Lin*, Yujun and Zhang*, Zhekai and Cai, Tianle and Li, Xiuyu and Guo, Junxian and Xie, Enze and Meng, Chenlin and Zhu, Jun-Yan and Han, Song},
booktitle={The Thirteenth International Conference on Learning Representations},
year={2025}
}我们感谢 MIT-IBM Watson AI Lab、MIT 和 Amazon Science Hub、MIT AI Hardware Program、National Science Foundation、Packard Foundation、Dell、LG、现代和三星对本研究的支持。我们感谢 NVIDIA 捐赠的 DGX 服务器。
我们使用 img2img-turbo 训练草图到图像的 LoRA。我们的文本到图像和图像到图像 UI 分别基于 playground-v.25 和 img2img-turbo 构建。我们的安全检查器来自 hart。
Nunchaku 还受到许多开源库的启发,包括(但不限于)TensorRT-LLM、vLLM、QServe、AWQ、FlashAttention-2 和 Atom。