Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
3 changes: 3 additions & 0 deletions config/charts/README.md
Original file line number Diff line number Diff line change
Expand Up @@ -331,9 +331,12 @@ The sidecar runs vLLM's `vllm launch render <modelName>` and exposes `/v1/comple
| `router.tokenizer.port` | Container port the sidecar listens on. | `8000` |
| `router.tokenizer.command` | Override container command. Empty renders `["vllm", "launch", "render"]`. | `[]` |
| `router.tokenizer.args` | Override container args. Empty renders `["<modelName>", "--port=<port>"]`. | `[]` |
| `router.tokenizer.extraArgs` | Extra args appended to the tokenizer container after the default or overridden args. | `[]` |
| `router.tokenizer.initContainers` | Pod-level init containers rendered when the tokenizer is enabled. | `[]` |
| `router.tokenizer.env` | Extra environment variables (e.g., HuggingFace token). | `[HF_TOKEN]` |
| `router.tokenizer.resources` | Tokenizer container resource requests and limits. | `requests.cpu: "4"`, `requests.memory: 8Gi` |
| `router.tokenizer.volumeMounts` | Extra volume mounts for the tokenizer container. | `[]` |
| `router.tokenizer.volumes` | Pod-level volumes rendered alongside `model-cache` when the tokenizer is enabled. | `[]` |
| `router.tokenizer.readinessProbe` | Readiness probe spec. | `httpGet /health on the render-http named port` |

#### Complete Tokenizer Render Sidecar Example
Expand Down
10 changes: 10 additions & 0 deletions config/charts/routerlib/templates/_deployment.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -43,6 +43,10 @@ spec:
serviceAccountName: {{ include "llm-d-router.name" . }}
# Conservatively, this timeout should mirror the longest grace period of the pods within the pool
terminationGracePeriodSeconds: 130
{{- if and .Values.router.tokenizer.enabled .Values.router.tokenizer.initContainers }}
initContainers:
{{- toYaml .Values.router.tokenizer.initContainers | nindent 8 }}
{{- end }}
containers:
{{- if $proxySidecar }}
- name: {{ $proxy.name }}
Expand Down Expand Up @@ -253,6 +257,9 @@ spec:
- {{ $tokenizer.modelName | quote }}
- {{ printf "--port=%d" $renderPort | quote }}
{{- end }}
{{- with $tokenizer.extraArgs }}
{{- toYaml . | nindent 12 }}
{{- end }}
ports:
- name: render-http
containerPort: {{ $renderPort }}
Expand Down Expand Up @@ -283,6 +290,9 @@ spec:
{{- if .Values.router.tokenizer.enabled }}
- name: model-cache
emptyDir: {}
{{- with .Values.router.tokenizer.volumes }}
{{- toYaml . | nindent 8 }}
{{- end }}
{{- end }}
{{- if and $proxySidecar (eq $proxyType "agentgateway") $proxyConfigMapName }}
- name: agentgateway-config-template
Expand Down
6 changes: 6 additions & 0 deletions config/charts/routerlib/values.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -91,6 +91,12 @@ tokenizer:
port: 8000
command: []
args: []
# Extra args appended to the vllm-render container after the default or overridden args.
extraArgs: []
# Pod-level init containers rendered when the tokenizer is enabled.
initContainers: []
# Pod-level volumes rendered alongside model-cache when the tokenizer is enabled.
volumes: []
env:
- name: HF_TOKEN
valueFrom:
Expand Down