Skip to content

[services] migrate llamacpp-router models to llama-swap and retire service #106

Description

@alucero270

llamacpp-router.service serves 3 models not in llama-swap (Nemotron 120B x2, MiniMax M2.7 x3 context variants) plus 9 models that duplicate llama-swap's catalog.\n\n## Current endpoints\n- :8083 — gemma-192k Docker container (stopped)\n- :8084 — llamacpp-router (llama-cpp-turboquant, models-preset auto-loading)\n- :8085 — llama-swap (ik_llama.cpp, OpenAI-compatible proxy)\n\n## Unique models in llamacpp-router not yet in llama-swap\n- nemotron-udq2-128k — Nemotron 3 Super 120B Q2\n- nemotron-udq3-128k — Nemotron 3 Super 120B Q3\n- minimax-80k / minimax-96k / minimax-128k — MiniMax M2.7 IQ4_XS\n\n## Work needed\n- Add Nemotron and MiniMax model entries to llama-swap config.yaml\n- Validate models load and respond correctly via llama-swap\n- Stop and disable llamacpp-router.service\n- Update OpenWebUI endpoint config if needed\n- Remove or archive llama-router-models.ini and start script

Metadata

Metadata

Assignees

No one assigned

    Labels

    Projects

    No projects

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions