Skip to content

Latest commit

 

History

History
194 lines (146 loc) · 12.5 KB

File metadata and controls

194 lines (146 loc) · 12.5 KB
xorbits

Xorbits Inference: Servir modelos con facilidad 🤖

Xinference Enterprise · Self-Hosting · Documentación

PyPI Latest Release License Build Status Docker Pulls Discord Telegram Twitter

English 日本語 한국어 Deutsch Français
Español Italiano Português 繁體中文 简体中文


Xorbits Inference (Xinference) es una biblioteca potente y versátil para modelos de lenguaje, reconocimiento de voz y modelos multimodales. Con Xorbits Inference puedes desplegar tu propio modelo o modelos avanzados integrados con un solo comando y ofrecerlos como servicio. Investigadores, desarrolladores y científicos de datos pueden aprovechar al máximo las capacidades de los modelos de IA modernos.

🔥 Temas destacados

Mejora del framework

  • Xinference 3.0.0 está disponible con notas de migración y cambios incompatibles: Notas de la versión
  • Implementación nativa de agentes: Xinference se integra con Xagent y permite planificación dinámica, uso de herramientas e inferencias multietapa autónomas, superando los límites de las tuberías estáticas.
  • Batching automático: múltiples solicitudes concurrentes se agrupan automáticamente para aumentar significativamente el rendimiento.: #4197
  • Xllamacpp: los nuevos bindings de Python para llama.cpp, mantenidos por el equipo de Xinference, soportan batching continuo y son más aptos para producción.: #2997
  • Inferencia distribuida: los modelos pueden ejecutarse entre workers: #2877
  • Mejoras en vLLM: compartir el KV-cache entre réplicas: #2732

Nuevos modelos

Integraciones

  • Xagent: plataforma de agentes enterprise con planificación, memoria e integración de herramientas.
  • Dify: plataforma LLMOps para construir aplicaciones rápidamente con visualización y control.
  • FastGPT: plataforma de conocimiento basada en LLM para procesamiento de datos y llamadas a modelos.
  • RAGFlow: motor RAG open-source para comprensión profunda de documentos.
  • MaxKB: asistente de base de conocimiento open-source con integración RAG.

Funcionalidades principales

🌟 Servir modelos con facilidad: Simplifica el despliegue de LLMs, reconocimiento de voz y modelos multimodales. Los modelos de prueba y producción se pueden configurar y desplegar con un solo comando.

⚡️ Modelos de vanguardia accesibles: Prueba modelos integrados con un solo comando. Xinference ofrece acceso a modelos Open-Source avanzados.

🖥 Aprovechamiento de hardware heterogéneo: Utiliza GPU y CPU (por ejemplo, mediante ggml) para acelerar la inferencia.

⚙️ APIs y interfaces flexibles: API RESTful compatible con OpenAI (incluyendo Function Calling), RPC, CLI, Web UI y más.

🌐 Despliegue distribuido: Facilita la distribución de la inferencia a través de varios dispositivos y máquinas.

🔌 Integraciones de terceros: Integración con LangChain, [LlamaIndex], [Dify], [Chatbox], etc.

Por qué Xinference

Función Xinference FastChat OpenLLM RayLLM
API RESTful compatible con OpenAI
Integración vLLM
Diversos motores de inferencia (GGML, TensorRT)
Diversas plataformas (CPU, Metal)
Despliegue en clúster multi-nodo
Modelos de imagen (Texto→Imagen)
Modelos de embedding de texto
Modelos multimodales
Modelos de voz
Funcionalidad OpenAI (Function Calling)

Cómo usar Xinference

Mantente al día

Dale una estrella a Xinference en GitHub para recibir actualizaciones de lanzamientos.

star-us

Inicio

Docker

Usuarios con GPU NVIDIA pueden usar la imagen Docker de Xinference. Asegúrate de tener Docker y CUDA antes de la instalación.

docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0

K8s (Helm)

Tras habilitar GPU en tu clúster Kubernetes, instala así:

# Añadir repositorio
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts

# Actualizar índice y comprobar versiones
helm repo update xinference
helm search repo xinference/xinference --devel --versions

# Instalar Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>

Más opciones de K8s en la documentación.

Quickstart

Instala Xinference con pip:

pip install "xinference[all]"

Inicia una instancia local con:

$ xinference-local

Después podrás usar la Web UI, cURL, CLI o el cliente Python.

web UI

Contribuir

Plataforma Propósito
Github Issues Reporte de bugs y solicitudes de features
Discord Colaboración con otros usuarios
Telegram Discusiones con la comunidad
Twitter Noticias y anuncios

Citación

Si este proyecto te fue útil, cítalo así:

@inproceedings{lu2024xinference,
		title = "Xinference: Making Large Model Serving Easy",
		author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
		booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
		month = nov,
		year = "2024",
		address = "Miami, Florida, USA",
		publisher = "Association for Computational Linguistics",
		url = "https://aclanthology.org/2024.emnlp-demo.30",
		pages = "291--300",
}

Colaboradores

Historial de estrellas

Star History Chart