Skip to content

Latest commit

 

History

History
193 lines (146 loc) · 11.9 KB

File metadata and controls

193 lines (146 loc) · 11.9 KB
xorbits

Xorbits Inference:讓模型部署變得簡單 🤖

Xinference Enterprise · 自我託管(Self-Hosting) · 文件

PyPI Latest Release License Build Status Docker Pulls Discord Telegram Twitter

English 日本語 한국어 Deutsch Français
Español Italiano Português 繁體中文 简体中文


Xorbits Inference(Xinference)是一個強大且通用的函式庫,適用於語言模型、語音識別與多模態模型。使用 Xinference,您可以只用一條指令部署自有模型或整合的尖端模型並將其提供為服務。研究者、開發者與資料科學家皆能充分發揮現代 AI 模型的能力。

🔥 重點功能與更新

框架強化

  • Xinference 3.0.0 已發布,包含遷移說明與破壞性變更:版本說明
  • 原生 Agent 部署:Xinference 與 Xagent 整合,支援動態規劃、工具使用與自動化多步驟推論,突破靜態 pipeline 的限制。
  • 自動批次(Batching):多個併發請求會自動合併以大幅提升吞吐量。 : #4197
  • Xllamacpp:Xinference 團隊維護的新一代 llama.cpp Python binding,支援連續批次並更適合生產環境。 : #2997
  • 分散式推論:模型可在多個 worker 之間分散執行: #2877
  • vLLM 改進:在多個複本之間共享 KV-cache: #2732

新增模型

整合項目

  • Xagent:企業級 Agent 平台,具規劃、記憶與工具整合。
  • Dify:LLMOps 平台,快速建立可視化與控制的應用。
  • FastGPT:基於 LLM 的知識平台,用於資料處理與模型呼叫。
  • RAGFlow:用於深度文件理解的開源 RAG 引擎。
  • MaxKB:具有 RAG 整合的開源知識庫助理。

主要功能

🌟 模型部署更簡單:簡化 LLM、語音識別與多模態模型的上線流程。實驗與生產模型都能透過單一命令設定與部署。

⚡️ 方便使用的尖端模型:只需一條指令即可嘗試整合的最新模型。Xinference 提供對最先進開源模型的存取。

🖥 異構硬體支援:有效利用 GPU 與 CPU(例如透過 ggml),以加速推論。

⚙️ 彈性的 API 與介面:OpenAI 相容的 RESTful API(包含 Function Calling)、RPC、CLI、Web UI 等。

🌐 分散式部署:方便在多台設備與機器間分散推論工作。

🔌 第三方整合:支援與 LangChain、[LlamaIndex]、[Dify]、[Chatbox] 等整合。

為何選擇 Xinference

功能 Xinference FastChat OpenLLM RayLLM
OpenAI 相容的 RESTful API
vLLM 整合
多種推論引擎(GGML、TensorRT)
支援多種平台(CPU、Metal)
多節點集群部署
影像模型(文字→影像)
文字嵌入模型
多模態模型
語音模型
OpenAI 類 Function Calling 支援

使用 Xinference

保持更新

在 GitHub 為 Xinference 加星,以取得發布更新通知。

star-us

開始使用

Docker

具有 NVIDIA GPU 的使用者可以使用 Xinference Docker 映像。請在安裝前確認系統已安裝 Docker 與 CUDA。

docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0

K8s (Helm)

在已啟用 GPU 的 Kubernetes 叢集中,執行下列指令安裝:

# 新增 Helm 倉庫
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts

# 更新索引並檢視版本
helm repo update xinference
helm search repo xinference/xinference --devel --versions

# 安裝 Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>

更多 K8s 選項請參閱文件。

快速上手

使用 pip 安裝 Xinference:

pip install "xinference[all]"

啟動本地實例:

$ xinference-local

啟動後可透過 Web UI、cURL、CLI 或 Python 客戶端來使用。

web UI

參與專案

平台 目的
Github Issues 報告錯誤與功能請求
Discord 與其他使用者協作
Telegram 社群討論
Twitter 新聞與公告

引用

若本專案對您有幫助,請以以下格式引用:

@inproceedings{lu2024xinference,
    title = "Xinference: Making Large Model Serving Easy",
    author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
    booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
    month = nov,
    year = "2024",
    address = "Miami, Florida, USA",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2024.emnlp-demo.30",
    pages = "291--300",
}

貢獻者

星星歷史

Star History Chart