llamacpp-router.service serves 3 models not in llama-swap (Nemotron 120B x2, MiniMax M2.7 x3 context variants) plus 9 models that duplicate llama-swap's catalog.\n\n## Current endpoints\n- :8083 — gemma-192k Docker container (stopped)\n- :8084 — llamacpp-router (llama-cpp-turboquant, models-preset auto-loading)\n- :8085 — llama-swap (ik_llama.cpp, OpenAI-compatible proxy)\n\n## Unique models in llamacpp-router not yet in llama-swap\n- nemotron-udq2-128k — Nemotron 3 Super 120B Q2\n- nemotron-udq3-128k — Nemotron 3 Super 120B Q3\n- minimax-80k / minimax-96k / minimax-128k — MiniMax M2.7 IQ4_XS\n\n## Work needed\n- Add Nemotron and MiniMax model entries to llama-swap config.yaml\n- Validate models load and respond correctly via llama-swap\n- Stop and disable llamacpp-router.service\n- Update OpenWebUI endpoint config if needed\n- Remove or archive llama-router-models.ini and start script
llamacpp-router.service serves 3 models not in llama-swap (Nemotron 120B x2, MiniMax M2.7 x3 context variants) plus 9 models that duplicate llama-swap's catalog.\n\n## Current endpoints\n-
:8083— gemma-192k Docker container (stopped)\n-:8084— llamacpp-router (llama-cpp-turboquant, models-preset auto-loading)\n-:8085— llama-swap (ik_llama.cpp, OpenAI-compatible proxy)\n\n## Unique models in llamacpp-router not yet in llama-swap\n-nemotron-udq2-128k— Nemotron 3 Super 120B Q2\n-nemotron-udq3-128k— Nemotron 3 Super 120B Q3\n-minimax-80k / minimax-96k / minimax-128k— MiniMax M2.7 IQ4_XS\n\n## Work needed\n- Add Nemotron and MiniMax model entries to llama-swap config.yaml\n- Validate models load and respond correctly via llama-swap\n- Stop and disable llamacpp-router.service\n- Update OpenWebUI endpoint config if needed\n- Remove or archive llama-router-models.ini and start script