Uma assistente virtual desenvolvida em Python capaz de conversar naturalmente em português, responder por voz, pesquisar na internet e interagir em tempo real com um avatar no VTube Studio.
[
demonstracao.mp4
A HOPE foi criada para aproximar inteligência artificial de uma experiência mais humana.
Mais do que um chatbot, ela possui voz, memória de conversa, pesquisa na internet, integração com modelos locais e em nuvem, além de controlar um avatar no VTube Studio, tornando as interações muito mais naturais.
Toda a arquitetura foi pensada para funcionar de forma resiliente, utilizando sistemas de fallback quando algum serviço externo fica indisponível.
A interação pode acontecer por texto ou voz.
Após receber uma mensagem, a HOPE interpreta o contexto, consulta sua memória recente, realiza pesquisas na internet quando necessário e gera uma resposta utilizando modelos de linguagem locais ou em nuvem.
O texto é convertido em voz, enviado para o VTube Studio e sincronizado automaticamente com o avatar.
Usuário fala ou digita
↓
Reconhecimento de fala (Speech Recognition)
↓
Memória da conversa
↓
Pesquisa Web / Clima (quando necessário)
↓
Modelo de IA
(OpenRouter → fallback Ollama)
↓
Resposta
↓
Síntese de Voz
(ElevenLabs → fallback Edge TTS)
↓
VB-CABLE
↓
VTube Studio
(Lip Sync + Expressões)
- Conversação em português.
- Suporte a múltiplos provedores de LLM.
- Pesquisa automática na internet.
- Consulta de clima em tempo real.
- Memória curta de conversação.
- Prompt personalizado para personalidade.
- Fallback automático entre provedores.
- Respostas por voz.
- Múltiplos provedores de TTS.
- Voz natural utilizando ElevenLabs.
- Ajuste de expressividade da voz.
- Fallback automático para Edge TTS.
- Entrada por microfone.
- Palavra de ativação.
- Ajuste de sensibilidade.
- Configuração de dispositivo de áudio.
- Integração completa com VTube Studio.
- Controle de expressões.
- Lip Sync automático.
- Movimentação durante a fala.
- Medição do tempo de resposta.
- Scripts de teste para microfone e TTS.
A HOPE suporta diferentes provedores de modelos de linguagem.
- OpenRouter
- Groq
- Ollama
Atualmente o projeto utiliza OpenRouter como provedor principal para obter respostas mais rápidas.
Caso o serviço fique indisponível, a HOPE alterna automaticamente para um modelo executado localmente pelo Ollama.
A assistente pode pesquisar informações recentes automaticamente quando necessário.
Também possui integração com a API pública do Open-Meteo, permitindo responder perguntas como:
- Temperatura atual
- Condições climáticas
- Previsão resumida
Além disso, entende perguntas em sequência.
Exemplo:
Usuário:
Clima
HOPE:
De qual cidade?
Usuário:
Brasília
HOPE:
Hoje em Brasília...
A HOPE suporta diversos motores de síntese de voz.
- ElevenLabs
- Edge TTS
- Microsoft SAPI
- Murf AI
- Voicebox (experimental)
Provedor principal
- ElevenLabs
Modelo
- eleven_flash_v2_5
Voz
- Jessica — Playful, Bright, Warm
Expressividade
ELEVENLABS_STYLE = 0.35
Caso a ElevenLabs fique indisponível, o sistema utiliza automaticamente o Edge TTS.
O reconhecimento de voz foi ajustado para reduzir falsos positivos e melhorar a experiência durante conversas.
Microfone:
USB AUDIO
Timeout:
10 segundos
Phrase Time Limit:
5 segundos
Energy Threshold:
450
Também foram criados scripts específicos para calibração do microfone.
- test_stt_capture.py
- test_mic_levels.py
A HOPE possui sistema de Wake Word.
Após diversos testes foi observado que "Hope" apresentava baixa taxa de reconhecimento.
Hoje a chamada principal é:
- Assistente
Também reconhece:
- Assiste
Exemplos:
Assistente
↓
Sim, estou aqui!
ou
Assistente, tudo bem?
↓
A HOPE entende apenas "tudo bem?" como comando.
A comunicação acontece através da API pública do VTube Studio utilizando WebSocket.
Durante as respostas, a HOPE pode:
- alterar expressões;
- acionar hotkeys;
- movimentar o rosto;
- sincronizar a boca automaticamente.
Parâmetros utilizados:
- FaceAngleX
- FaceAngleY
- FaceAngleZ
- FacePositionX
- FacePositionY
O lip sync acontece através do áudio enviado para o VB-CABLE, permitindo que o VTube Studio utilize a própria voz da assistente para movimentar a boca.
- Python
- OpenRouter
- Groq
- Ollama
- ElevenLabs
- Edge TTS
- Microsoft SAPI
- Murf AI
- Speech Recognition
- Open-Meteo
- WebSocket
- VTube Studio API
- VB-CABLE
O projeto também possui diversos scripts para testes individuais dos componentes.
| Script | Função |
|---|---|
| test_stt_capture.py | Testa reconhecimento de voz |
| test_mic_levels.py | Mede intensidade do microfone |
| test_voicebox_tts.py | Testes de síntese de voz |
| web_search.py | Pesquisa web e consulta clima |
- Memória de longo prazo
- Reconhecimento emocional avançado
- Expressões mais naturais
- Sistema de emoções persistentes
- Visão computacional
- Integração com plataformas de streaming
- Leitura de chat em tempo real
- Sistema de plugins
- Personalidade dinâmica baseada em contexto
🚧 Projeto em desenvolvimento ativo.
A HOPE continua evoluindo com foco em criar uma assistente virtual cada vez mais natural, rápida e expressiva, explorando integração entre inteligência artificial, síntese de voz e avatares virtuais.
Desenvolvido por Emanuel Penna