Xorbits Inference (Xinference) es una biblioteca potente y versátil para modelos de lenguaje, reconocimiento de voz y modelos multimodales. Con Xorbits Inference puedes desplegar tu propio modelo o modelos avanzados integrados con un solo comando y ofrecerlos como servicio. Investigadores, desarrolladores y científicos de datos pueden aprovechar al máximo las capacidades de los modelos de IA modernos.
- Xinference 3.0.0 está disponible con notas de migración y cambios incompatibles: Notas de la versión
- Implementación nativa de agentes: Xinference se integra con Xagent y permite planificación dinámica, uso de herramientas e inferencias multietapa autónomas, superando los límites de las tuberías estáticas.
- Batching automático: múltiples solicitudes concurrentes se agrupan automáticamente para aumentar significativamente el rendimiento.: #4197
- Xllamacpp: los nuevos bindings de Python para llama.cpp, mantenidos por el equipo de Xinference, soportan batching continuo y son más aptos para producción.: #2997
- Inferencia distribuida: los modelos pueden ejecutarse entre workers: #2877
- Mejoras en vLLM: compartir el KV-cache entre réplicas: #2732
- Integrado MiniMax-M3: #5258
- Integrada la serie VibeThinker (1.5B, 3B): #5085
- Integrada la serie Nex-N2 (mini, Pro, Pro-fp8): #5094
- Integrado Unlimited-OCR: #5103
- Integrado Ornith-1.0-35B: #5119
- Integrado MiniCPM5-1B: #5010
- Integrada la serie jina-embeddings-v5 (text-nano, text-small, omni-nano, omni-small): #5018
- Integrada la serie MiniCPM-V-4.6 (MiniCPM-V-4.6, MiniCPM-V-4.6-Thinking): #5025
- Xagent: plataforma de agentes enterprise con planificación, memoria e integración de herramientas.
- Dify: plataforma LLMOps para construir aplicaciones rápidamente con visualización y control.
- FastGPT: plataforma de conocimiento basada en LLM para procesamiento de datos y llamadas a modelos.
- RAGFlow: motor RAG open-source para comprensión profunda de documentos.
- MaxKB: asistente de base de conocimiento open-source con integración RAG.
🌟 Servir modelos con facilidad: Simplifica el despliegue de LLMs, reconocimiento de voz y modelos multimodales. Los modelos de prueba y producción se pueden configurar y desplegar con un solo comando.
⚡️ Modelos de vanguardia accesibles: Prueba modelos integrados con un solo comando. Xinference ofrece acceso a modelos Open-Source avanzados.
🖥 Aprovechamiento de hardware heterogéneo: Utiliza GPU y CPU (por ejemplo, mediante ggml) para acelerar la inferencia.
⚙️ APIs y interfaces flexibles: API RESTful compatible con OpenAI (incluyendo Function Calling), RPC, CLI, Web UI y más.
🌐 Despliegue distribuido: Facilita la distribución de la inferencia a través de varios dispositivos y máquinas.
🔌 Integraciones de terceros: Integración con LangChain, [LlamaIndex], [Dify], [Chatbox], etc.
| Función | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| API RESTful compatible con OpenAI | ✅ | ✅ | ✅ | ✅ |
| Integración vLLM | ✅ | ✅ | ✅ | ✅ |
| Diversos motores de inferencia (GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| Diversas plataformas (CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| Despliegue en clúster multi-nodo | ✅ | ❌ | ❌ | ✅ |
| Modelos de imagen (Texto→Imagen) | ✅ | ✅ | ❌ | ❌ |
| Modelos de embedding de texto | ✅ | ❌ | ❌ | ❌ |
| Modelos multimodales | ✅ | ❌ | ❌ | ❌ |
| Modelos de voz | ✅ | ❌ | ❌ | ❌ |
| Funcionalidad OpenAI (Function Calling) | ✅ | ❌ | ❌ | ❌ |
-
Self-Hosting Xinference Community Edition Sigue la guía de inicio para poner en marcha Xinference localmente. Más detalles en la documentación: https://inference.readthedocs.io/.
-
Xinference para empresas Hay características enterprise adicionales; para consultas contacta: mailto:info@xinference.co?subject=[GitHub]Business%20License%20Inquiry
Dale una estrella a Xinference en GitHub para recibir actualizaciones de lanzamientos.
Usuarios con GPU NVIDIA pueden usar la imagen Docker de Xinference. Asegúrate de tener Docker y CUDA antes de la instalación.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0Tras habilitar GPU en tu clúster Kubernetes, instala así:
# Añadir repositorio
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# Actualizar índice y comprobar versiones
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Instalar Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
Más opciones de K8s en la documentación.
Instala Xinference con pip:
pip install "xinference[all]"Inicia una instancia local con:
$ xinference-localDespués podrás usar la Web UI, cURL, CLI o el cliente Python.
| Plataforma | Propósito |
|---|---|
| Github Issues | Reporte de bugs y solicitudes de features |
| Discord | Colaboración con otros usuarios |
| Telegram | Discusiones con la comunidad |
| Noticias y anuncios |
Si este proyecto te fue útil, cítalo así:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}

