Xorbits Inference (Xinference) é uma biblioteca poderosa e versátil para modelos de linguagem, reconhecimento de voz e modelos multimodais. Com o Xinference você pode implantar seu próprio modelo ou modelos integrados de ponta com um único comando e oferecê-los como um serviço. Pesquisadores, desenvolvedores e cientistas de dados podem explorar totalmente as capacidades dos modelos de IA modernos.
- O Xinference 3.0.0 está disponível com notas de migração e mudanças incompatíveis: Notas da versão
- Deploy nativo para agentes: o Xinference integra-se ao Xagent, permitindo planejamento dinâmico, uso de ferramentas e inferências multi-step autônomas, ultrapassando os limites de pipelines estáticos.
- Batching automático: múltiplas requisições simultâneas são agrupadas automaticamente para aumentar significativamente o throughput. : #4197
- Xllamacpp: novos bindings Python para llama.cpp mantidos pela equipe Xinference, suportam batching contínuo e são mais adequados para produção. : #2997
- Inferência distribuída: modelos podem ser executados entre vários workers: #2877
- Melhorias no vLLM: compartilhamento do KV-cache entre réplicas: #2732
- Integração da série VibeThinker (1.5B, 3B) : #5085
- Integração da série Nex-N2 (mini, Pro, Pro-fp8) : #5094
- Integração de Unlimited-OCR : #5103
- Integração de Ornith-1.0-35B : #5119
- Integração de MiniCPM5-1B : #5010
- Integração da série jina-embeddings-v5 (text-nano, text-small, omni-nano, omni-small) : #5018
- Integração da série MiniCPM-V-4.6 (MiniCPM-V-4.6, MiniCPM-V-4.6-Thinking) : #5025
- Integração da série Tencent Hy-MT2 (1.8B, 7B, 30B-A3B) : #5029
- Xagent: plataforma de agentes enterprise com planejamento, memória e integração de ferramentas.
- Dify: plataforma LLMOps para construir aplicações rapidamente com visualização e controle.
- FastGPT: plataforma de conhecimento baseada em LLM para processamento de dados e chamadas de modelo.
- RAGFlow: motor RAG open-source para compreensão profunda de documentos.
- MaxKB: assistente open-source de base de conhecimento com integração RAG.
🌟 Deploy de modelos simplificado: simplifica a disponibilização de LLMs, modelos de reconhecimento de voz e modelos multimodais. Modelos experimentais e de produção podem ser configurados e implantados com um único comando.
⚡️ Modelos de ponta acessíveis: experimente modelos integrados com um único comando. O Xinference fornece acesso a modelos open source de última geração.
🖥 Suporte para hardware heterogêneo: aproveite GPUs e CPUs eficientemente (ex.: via ggml) para acelerar a inferência.
⚙️ APIs e interfaces flexíveis: API RESTful compatível com OpenAI (incluindo Function Calling), RPC, CLI, Web UI e mais.
🌐 Deploy distribuído: facilita a distribuição de inferência através de múltiplos dispositivos e máquinas.
🔌 Integrações de terceiros: integração com LangChain, [LlamaIndex], [Dify], [Chatbox], etc.
| Função | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| API RESTful compatível com OpenAI | ✅ | ✅ | ✅ | ✅ |
| Integração vLLM | ✅ | ✅ | ✅ | ✅ |
| Diversos motores de inferência (GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| Diversas plataformas (CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| Deploy em cluster multi-nó | ✅ | ❌ | ❌ | ✅ |
| Modelos de imagem (Texto→Imagem) | ✅ | ✅ | ❌ | ❌ |
| Modelos de embeddings de texto | ✅ | ❌ | ❌ | ❌ |
| Modelos multimodais | ✅ | ❌ | ❌ | ❌ |
| Modelos de voz | ✅ | ❌ | ❌ | ❌ |
| Function Calling (OpenAI-like) | ✅ | ❌ | ❌ | ❌ |
-
Self-Hosting Xinference Community Edition Siga o guia de início para executar o Xinference localmente. Detalhes na documentação: https://inference.readthedocs.io/.
-
Xinference para empresas Recursos enterprise estão disponíveis; para solicitações, entre em contato: mailto:info@xinference.co?subject=[GitHub]Business%20License%20Inquiry
Dê uma estrela no Xinference no GitHub para receber atualizações de release.
Usuários com GPU NVIDIA podem usar a imagem Docker do Xinference. Certifique-se de ter Docker e CUDA antes de instalar.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0Após habilitar GPUs no cluster Kubernetes, instale com:
# Adicionar repositório
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# Atualizar índice e verificar versões
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Instalar Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
Mais opções de K8s na documentação.
Instale o Xinference via pip:
pip install "xinference[all]"Inicie uma instância local com:
$ xinference-localDepois, você pode usar a Web UI, cURL, CLI ou o cliente Python.
| Plataforma | Propósito |
|---|---|
| Github Issues | Reportar bugs e solicitar features |
| Discord | Colaboração com outros usuários |
| Telegram | Discussões com a comunidade |
| Notícias e anúncios |
Se este projeto foi útil, cite-o assim:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}

