Skip to content

Latest commit

 

History

History
193 lines (146 loc) · 14.5 KB

File metadata and controls

193 lines (146 loc) · 14.5 KB
xorbits

Xorbits Inference: モデルサービングを簡単に 🤖

Xinference エンタープライズ · セルフホスティング · ドキュメント

PyPI Latest Release License Build Status Docker Pulls Discord Telegram Twitter

English 日本語 한국어 Deutsch Français
Español Italiano Português 繁體中文 简体中文


Xorbits Inference(Xinference)は、言語、音声認識、マルチモーダルモデル向けの高機能で汎用性の高いライブラリです。Xorbits Inference を使えば、たった一つのコマンドで自分のモデルや組み込みの最先端モデルを簡単にデプロイしてサービス化できます。研究者、開発者、データサイエンティストいずれにとっても、最先端 AI モデルの能力を存分に引き出すことができます。

🔥 注目のトピック

フレームワークの強化

  • Xinference 3.0.0 が公開され、移行メモと破壊的変更を確認できます: リリースノート
  • Agent ネイティブ配信:Xinference は Xagent と統合し、動的プランニング、ツール利用、自己完結型の複数ステップ推論を可能にし、静的なパイプラインの限界を超えます。
  • 自動バッチ処理:複数の同時リクエストを自動的にバッチ化し、スループットを大幅に向上させます。: #4197
  • Xllamacpp: Xinference チームが管理する新しい llama.cpp の Python バインディングは、継続的なバッチ処理をサポートし、より本番運用に適しています。: #2997
  • 分散推論:ワーカー間でモデルを実行できます: #2877
  • VLLM の強化:複数レプリカ間で KV キャッシュを共有: #2732

新規モデル

統合

  • Xagent: 計画、メモリ、ツール利用を備えたエンタープライズ向けエージェントプラットフォームです。
  • Dify: LLMOps プラットフォームで、視覚化・操作可能な形で迅速にアプリを構築できます。
  • FastGPT: LLM ベースのナレッジプラットフォームで、データ処理やモデル呼び出し機能を提供します。
  • RAGFlow: 深層ドキュメント理解に基づくオープンソース RAG エンジンです。
  • MaxKB: RAG を統合したオープンソースの知識ベースアシスタントです。

主な機能

🌟 モデルサービングを簡単に: 大規模言語モデル、音声認識、マルチモーダルモデルの提供プロセスを簡素化します。実験用・本番用のモデルをワンコマンドでセットアップしてデプロイできます。

⚡️ 最先端モデルを手軽に: 組み込みの最先端モデルをコマンド一つで試せます。Xinference はオープンソースの最先端モデルへのアクセスを提供します。

🖥 異種ハードウェアの活用: ggml を用いて GPU と CPU を効率的に利用し、推論を高速化します。

⚙️ 柔軟な API とインターフェース: OpenAI 互換の RESTful API(Function Calling を含む)、RPC、CLI、Web UI など、多様なインターフェースでモデルを操作できます。

🌐 分散デプロイ: 複数デバイスやマシンにまたがる分散デプロイを容易にし、推論をシームレスに分散します。

🔌 サードパーティとの統合: LangChainLlamaIndexDifyChatbox 等とシームレスに連携します。

なぜ Xinference か

機能 Xinference FastChat OpenLLM RayLLM
OpenAI 互換の RESTful API
vLLM 統合
多様な推論エンジン(GGML、TensorRT)
多様なプラットフォーム(CPU、Metal)
マルチノードクラスタデプロイ
画像モデル(テキスト→画像)
テキスト埋め込みモデル
マルチモーダルモデル
音声モデル
OpenAI 機能(関数呼び出し)

Xinference の使い方

常に先を行くために

GitHub で Xinference にスターを付けると、新しいリリースの通知を受け取れます。

star-us

入門

Docker

Nvidia GPU ユーザーは Xinference Docker イメージ を使って Xinference サーバを起動できます。インストール実行前に、システムに DockerCUDA が導入されていることを確認してください。

docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0

K8s (helm)

Kubernetes クラスタで GPU を有効にした後、次のようにインストールします。

# リポジトリを追加
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts

# インデックスを更新し、バージョンを確認
helm repo update xinference
helm search repo xinference/xinference --devel --versions

# Xinference をインストール
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>

詳細な K8s 向けカスタムインストールについてはドキュメントを参照してください。

クイックスタート

pip を使って Xinference をインストールします(詳細はインストールページ参照)。

pip install "xinference[all]"

ローカルインスタンスを起動するには次を実行します:

$ xinference-local

起動後は Web UI、cURL、CLI、または Xinference の Python クライアントを通じて試すことができます。詳細はドキュメントを参照してください。

web UI

参加方法

プラットフォーム 目的
Github Issues バグ報告・機能要望の提出
Discord 他の Xinference ユーザーとの協力
Telegram 他の Xinference ユーザーとの対話
Twitter 新機能の最新情報

引用

このプロジェクトが役に立った場合、以下のように引用してください:

@inproceedings{lu2024xinference,
    title = "Xinference: Making Large Model Serving Easy",
    author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
    booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
    month = nov,
    year = "2024",
    address = "Miami, Florida, USA",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2024.emnlp-demo.30",
    pages = "291--300",
}

コントリビューター

Star 履歴

Star History Chart