Skip to content

Latest commit

 

History

History
193 lines (146 loc) · 12.8 KB

File metadata and controls

193 lines (146 loc) · 12.8 KB
xorbits

Xorbits Inference: Simplificando o deploy de modelos 🤖

Xinference Enterprise · Self-Hosting · Documentação

PyPI Latest Release License Build Status Docker Pulls Discord Telegram Twitter

English 日本語 한국어 Deutsch Français
Español Italiano Português 繁體中文 简体中文


Xorbits Inference (Xinference) é uma biblioteca poderosa e versátil para modelos de linguagem, reconhecimento de voz e modelos multimodais. Com o Xinference você pode implantar seu próprio modelo ou modelos integrados de ponta com um único comando e oferecê-los como um serviço. Pesquisadores, desenvolvedores e cientistas de dados podem explorar totalmente as capacidades dos modelos de IA modernos.

🔥 Destaques

Melhorias no framework

  • O Xinference 3.0.0 está disponível com notas de migração e mudanças incompatíveis: Notas da versão
  • Deploy nativo para agentes: o Xinference integra-se ao Xagent, permitindo planejamento dinâmico, uso de ferramentas e inferências multi-step autônomas, ultrapassando os limites de pipelines estáticos.
  • Batching automático: múltiplas requisições simultâneas são agrupadas automaticamente para aumentar significativamente o throughput. : #4197
  • Xllamacpp: novos bindings Python para llama.cpp mantidos pela equipe Xinference, suportam batching contínuo e são mais adequados para produção. : #2997
  • Inferência distribuída: modelos podem ser executados entre vários workers: #2877
  • Melhorias no vLLM: compartilhamento do KV-cache entre réplicas: #2732

Novos modelos

Integrações

  • Xagent: plataforma de agentes enterprise com planejamento, memória e integração de ferramentas.
  • Dify: plataforma LLMOps para construir aplicações rapidamente com visualização e controle.
  • FastGPT: plataforma de conhecimento baseada em LLM para processamento de dados e chamadas de modelo.
  • RAGFlow: motor RAG open-source para compreensão profunda de documentos.
  • MaxKB: assistente open-source de base de conhecimento com integração RAG.

Principais funcionalidades

🌟 Deploy de modelos simplificado: simplifica a disponibilização de LLMs, modelos de reconhecimento de voz e modelos multimodais. Modelos experimentais e de produção podem ser configurados e implantados com um único comando.

⚡️ Modelos de ponta acessíveis: experimente modelos integrados com um único comando. O Xinference fornece acesso a modelos open source de última geração.

🖥 Suporte para hardware heterogêneo: aproveite GPUs e CPUs eficientemente (ex.: via ggml) para acelerar a inferência.

⚙️ APIs e interfaces flexíveis: API RESTful compatível com OpenAI (incluindo Function Calling), RPC, CLI, Web UI e mais.

🌐 Deploy distribuído: facilita a distribuição de inferência através de múltiplos dispositivos e máquinas.

🔌 Integrações de terceiros: integração com LangChain, [LlamaIndex], [Dify], [Chatbox], etc.

Por que Xinference

Função Xinference FastChat OpenLLM RayLLM
API RESTful compatível com OpenAI
Integração vLLM
Diversos motores de inferência (GGML, TensorRT)
Diversas plataformas (CPU, Metal)
Deploy em cluster multi-nó
Modelos de imagem (Texto→Imagem)
Modelos de embeddings de texto
Modelos multimodais
Modelos de voz
Function Calling (OpenAI-like)

Como usar o Xinference

Fique atualizado

Dê uma estrela no Xinference no GitHub para receber atualizações de release.

star-us

Começando

Docker

Usuários com GPU NVIDIA podem usar a imagem Docker do Xinference. Certifique-se de ter Docker e CUDA antes de instalar.

docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0

K8s (Helm)

Após habilitar GPUs no cluster Kubernetes, instale com:

# Adicionar repositório
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts

# Atualizar índice e verificar versões
helm repo update xinference
helm search repo xinference/xinference --devel --versions

# Instalar Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>

Mais opções de K8s na documentação.

Quickstart

Instale o Xinference via pip:

pip install "xinference[all]"

Inicie uma instância local com:

$ xinference-local

Depois, você pode usar a Web UI, cURL, CLI ou o cliente Python.

web UI

Contribuir

Plataforma Propósito
Github Issues Reportar bugs e solicitar features
Discord Colaboração com outros usuários
Telegram Discussões com a comunidade
Twitter Notícias e anúncios

Citação

Se este projeto foi útil, cite-o assim:

@inproceedings{lu2024xinference,
    title = "Xinference: Making Large Model Serving Easy",
    author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
    booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
    month = nov,
    year = "2024",
    address = "Miami, Florida, USA",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2024.emnlp-demo.30",
    pages = "291--300",
}

Colaboradores

Histórico de estrelas

Star History Chart