Skip to content

Latest commit

 

History

History
193 lines (146 loc) · 12.6 KB

File metadata and controls

193 lines (146 loc) · 12.6 KB
xorbits

Xorbits Inference: Modell-Serving leicht gemacht 🤖

Xinference Enterprise · Self-Hosting · Dokumentation

PyPI Latest Release License Build Status Docker Pulls Discord Telegram Twitter

English 日本語 한국어 Deutsch Français
Español Italiano Português 繁體中文 简体中文


Xorbits Inference (Xinference) ist eine leistungsfähige und vielseitige Bibliothek für Sprach-, Spracherkennungs- und multimodale Modelle. Mit Xorbits Inference können Sie Ihr eigenes Modell oder integrierte Spitzenmodelle mit nur einem Befehl bereitstellen und als Dienst veröffentlichen. Forschende, Entwickler und Data Scientists können so das Potenzial moderner KI-Modelle vollständig ausschöpfen.

🔥 Aktuelle Highlights

Verbesserungen im Framework

  • Xinference 3.0.0 ist mit Migrationshinweisen und Breaking Changes verfügbar: Versionshinweise
  • Agent-native Bereitstellung: Xinference ist in Xagent integriert und ermöglicht dynamische Planung, Tool-Nutzung und eigenständige mehrstufige Inferenz, wodurch die Grenzen statischer Pipelines überwunden werden.
  • Automatisches Batching: Mehrere gleichzeitige Anfragen werden automatisch gebündelt, was den Durchsatz deutlich erhöht.: #4197
  • Xllamacpp: Neue Python-Bindings für llama.cpp, verwaltet vom Xinference-Team, unterstützen fortlaufendes Batching und sind produktionsfreundlicher.: #2997
  • Verteilte Inferenz: Modelle können über Worker verteilt ausgeführt werden: #2877
  • Verbesserungen für vLLM: Gemeinsame KV-Cache-Nutzung über mehrere Replikate: #2732

Neue Modelle

Integrationen

  • Xagent: Enterprise-Agentenplattform mit Planung, Speicher und Tool-Integration.
  • Dify: LLMOps-Plattform zur schnellen Anwendungsentwicklung mit Visualisierung und Bedienoberfläche.
  • FastGPT: LLM-basierte Knowledge-Plattform für Datenverarbeitung und Modellaufrufe.
  • RAGFlow: Open-Source-RAG-Engine für tiefes Dokumentenverständnis.
  • MaxKB: Open-Source-Wissensdatenbank-Assistent mit RAG-Integration.

Hauptfunktionen

🌟 Modell-Serving leicht gemacht: Vereinfachen Sie die Bereitstellung von LLMs, Spracherkennung und multimodalen Modellen. Tests und Produktionsmodelle lassen sich mit einem einzigen Befehl einrichten und deployen.

⚡️ State-of-the-art-Modelle einfach nutzbar: Probieren Sie integrierte Spitzenmodelle mit nur einem Befehl aus. Xinference bietet Zugang zu modernen Open-Source-Modellen.

🖥 Heterogene Hardware-Unterstützung: Nutzen Sie GPU und CPU effizient (z. B. über ggml), um Inferenz zu beschleunigen.

⚙️ Flexible APIs und Schnittstellen: OpenAI-kompatible RESTful API (inkl. Function Calling), RPC, CLI, Web UI und mehr.

🌐 Verteiltes Deployment: Einfache Verteilung von Inferenz über mehrere Geräte und Maschinen.

🔌 Third-Party-Integrationen: Nahtlose Integration mit LangChain, [LlamaIndex], [Dify], [Chatbox] u. a.

Warum Xinference

Funktion Xinference FastChat OpenLLM RayLLM
OpenAI-kompatible RESTful API
vLLM-Integration
Verschiedene Inferenz-Engines (GGML, TensorRT)
Verschiedene Plattformen (CPU, Metal)
Multi-Node Cluster Deployment
Bildmodelle (Text→Bild)
Text-Embedding-Modelle
Multimodale Modelle
Sprachmodelle
OpenAI-Funktionalität (Function Calling)

Wie man Xinference verwendet

Bleiben Sie vorne dabei

Sternen Sie Xinference auf GitHub, um Release-Updates zu erhalten.

star-us

Einstieg

Docker

NVIDIA-GPU-Benutzer können das Xinference Docker Image verwenden. Stellen Sie sicher, dass Docker und CUDA vor der Installation vorhanden sind.

docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0

K8s (Helm)

Nach Aktivierung von GPU im Kubernetes-Cluster installieren Sie wie folgt:

# Repository hinzufügen
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts

# Index aktualisieren und Version prüfen
helm repo update xinference
helm search repo xinference/xinference --devel --versions

# Xinference installieren
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>

Weitere K8s-Optionen finden Sie in der Dokumentation.

Quickstart

Installieren Sie Xinference per pip:

pip install "xinference[all]"

Starten Sie eine lokale Instanz mit:

$ xinference-local

Anschließend können Sie Web UI, cURL, CLI oder den Python-Client verwenden.

web UI

Mitmachen

Plattform Zweck
Github Issues Bug-Reports und Feature-Anfragen
Discord Zusammenarbeit mit anderen Anwendern
Telegram Diskussionen mit der Community
Twitter Neuigkeiten und Ankündigungen

Zitation

Wenn dieses Projekt hilfreich war, zitieren Sie bitte wie folgt:

@inproceedings{lu2024xinference,
    title = "Xinference: Making Large Model Serving Easy",
    author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
    booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
    month = nov,
    year = "2024",
    address = "Miami, Florida, USA",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2024.emnlp-demo.30",
    pages = "291--300",
}

Mitwirkende

Star-Verlauf

Star History Chart