Xorbits Inference (Xinference) ist eine leistungsfähige und vielseitige Bibliothek für Sprach-, Spracherkennungs- und multimodale Modelle. Mit Xorbits Inference können Sie Ihr eigenes Modell oder integrierte Spitzenmodelle mit nur einem Befehl bereitstellen und als Dienst veröffentlichen. Forschende, Entwickler und Data Scientists können so das Potenzial moderner KI-Modelle vollständig ausschöpfen.
- Xinference 3.0.0 ist mit Migrationshinweisen und Breaking Changes verfügbar: Versionshinweise
- Agent-native Bereitstellung: Xinference ist in Xagent integriert und ermöglicht dynamische Planung, Tool-Nutzung und eigenständige mehrstufige Inferenz, wodurch die Grenzen statischer Pipelines überwunden werden.
- Automatisches Batching: Mehrere gleichzeitige Anfragen werden automatisch gebündelt, was den Durchsatz deutlich erhöht.: #4197
- Xllamacpp: Neue Python-Bindings für llama.cpp, verwaltet vom Xinference-Team, unterstützen fortlaufendes Batching und sind produktionsfreundlicher.: #2997
- Verteilte Inferenz: Modelle können über Worker verteilt ausgeführt werden: #2877
- Verbesserungen für vLLM: Gemeinsame KV-Cache-Nutzung über mehrere Replikate: #2732
- Eingebautes MiniMax-M3: #5258
- Eingebaute VibeThinker-Serie (1.5B, 3B): #5085
- Eingebaute Nex-N2-Serie (mini, Pro, Pro-fp8): #5094
- Eingebautes Unlimited-OCR: #5103
- Eingebautes Ornith-1.0-35B: #5119
- Eingebautes MiniCPM5-1B: #5010
- Eingebaute jina-embeddings-v5 Serie (text-nano, text-small, omni-nano, omni-small): #5018
- Eingebaute MiniCPM-V-4.6 Serie (MiniCPM-V-4.6, MiniCPM-V-4.6-Thinking): #5025
- Xagent: Enterprise-Agentenplattform mit Planung, Speicher und Tool-Integration.
- Dify: LLMOps-Plattform zur schnellen Anwendungsentwicklung mit Visualisierung und Bedienoberfläche.
- FastGPT: LLM-basierte Knowledge-Plattform für Datenverarbeitung und Modellaufrufe.
- RAGFlow: Open-Source-RAG-Engine für tiefes Dokumentenverständnis.
- MaxKB: Open-Source-Wissensdatenbank-Assistent mit RAG-Integration.
🌟 Modell-Serving leicht gemacht: Vereinfachen Sie die Bereitstellung von LLMs, Spracherkennung und multimodalen Modellen. Tests und Produktionsmodelle lassen sich mit einem einzigen Befehl einrichten und deployen.
⚡️ State-of-the-art-Modelle einfach nutzbar: Probieren Sie integrierte Spitzenmodelle mit nur einem Befehl aus. Xinference bietet Zugang zu modernen Open-Source-Modellen.
🖥 Heterogene Hardware-Unterstützung: Nutzen Sie GPU und CPU effizient (z. B. über ggml), um Inferenz zu beschleunigen.
⚙️ Flexible APIs und Schnittstellen: OpenAI-kompatible RESTful API (inkl. Function Calling), RPC, CLI, Web UI und mehr.
🌐 Verteiltes Deployment: Einfache Verteilung von Inferenz über mehrere Geräte und Maschinen.
🔌 Third-Party-Integrationen: Nahtlose Integration mit LangChain, [LlamaIndex], [Dify], [Chatbox] u. a.
| Funktion | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| OpenAI-kompatible RESTful API | ✅ | ✅ | ✅ | ✅ |
| vLLM-Integration | ✅ | ✅ | ✅ | ✅ |
| Verschiedene Inferenz-Engines (GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| Verschiedene Plattformen (CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| Multi-Node Cluster Deployment | ✅ | ❌ | ❌ | ✅ |
| Bildmodelle (Text→Bild) | ✅ | ✅ | ❌ | ❌ |
| Text-Embedding-Modelle | ✅ | ❌ | ❌ | ❌ |
| Multimodale Modelle | ✅ | ❌ | ❌ | ❌ |
| Sprachmodelle | ✅ | ❌ | ❌ | ❌ |
| OpenAI-Funktionalität (Function Calling) | ✅ | ❌ | ❌ | ❌ |
-
Self-Hosting Xinference Community Edition Folgen Sie dem Starter-Guide, um Xinference lokal zu starten. Details in der Dokumentation: https://inference.readthedocs.io/.
-
Xinference für Unternehmen Es gibt zusätzliche Enterprise-Funktionen; für Anfragen kontaktieren Sie bitte: mailto:info@xinference.co?subject=[GitHub]Business%20License%20Inquiry
Sternen Sie Xinference auf GitHub, um Release-Updates zu erhalten.
NVIDIA-GPU-Benutzer können das Xinference Docker Image verwenden. Stellen Sie sicher, dass Docker und CUDA vor der Installation vorhanden sind.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0Nach Aktivierung von GPU im Kubernetes-Cluster installieren Sie wie folgt:
# Repository hinzufügen
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# Index aktualisieren und Version prüfen
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Xinference installieren
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
Weitere K8s-Optionen finden Sie in der Dokumentation.
Installieren Sie Xinference per pip:
pip install "xinference[all]"Starten Sie eine lokale Instanz mit:
$ xinference-localAnschließend können Sie Web UI, cURL, CLI oder den Python-Client verwenden.
| Plattform | Zweck |
|---|---|
| Github Issues | Bug-Reports und Feature-Anfragen |
| Discord | Zusammenarbeit mit anderen Anwendern |
| Telegram | Diskussionen mit der Community |
| Neuigkeiten und Ankündigungen |
Wenn dieses Projekt hilfreich war, zitieren Sie bitte wie folgt:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}

