Skip to content

Commit 05d3aee

Browse files
committed
feat: Implement changes in deps and refactor llama config
1 parent ec8ee7d commit 05d3aee

7 files changed

Lines changed: 255 additions & 221 deletions

File tree

Dockerfile.agentic

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -37,7 +37,7 @@ ENV MODEL_DIRECTORY="${MODEL_DIRECTORY}"
3737
# %files
3838
#
3939
COPY --chmod=0755 --chown=${USER_NAME}:${USER_NAME} ./config/llama.cpp/service/* /etc/services.d/llama.cpp/
40-
COPY --chmod=0755 --chown=${USER_NAME}:${USER_NAME} ./config/llama.cpp/llama-swap.yaml "${HOME}/.config/llama-swap/config.yaml"
40+
COPY --chmod=0755 --chown=${USER_NAME}:${USER_NAME} ./config/llama-swap/config.yaml "${HOME}/.config/llama-swap/config.yaml"
4141
COPY --chmod=0755 --chown=${USER_NAME}:${USER_NAME} ./provision/agentic/* /tmp/scripts/
4242
COPY --chmod=0755 --chown=${USER_NAME}:${USER_NAME} ./provision/healthcheck /healthcheck
4343
#

Dockerfile.terminal

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -32,6 +32,7 @@ ENV VERSION="${VERSION}"
3232
ENV TZ=America/New_York
3333
ENV SHELL=/usr/bin/zsh
3434
ENV TERM=xterm-256color
35+
ENV PATH="/home/linuxbrew/.linuxbrew/bin:/home/linuxbrew/.linuxbrew/sbin:${PATH}"
3536
ENV PATH="${PATH}:${HOME}/.local/bin"
3637
ENV PATH="${PATH}:${HOME}/.nix-profile/bin"
3738
ENV PATH="${PATH}:${HOME}/.pixi/bin"
@@ -68,7 +69,6 @@ RUN curl -fsSL https://shell.jasonwohlgemuth.com/install.sh | bash \
6869
&& brew trust oven-sh/bun \
6970
&& brew bundle --file /tmp/scripts/Brewfile \
7071
&& brew cleanup --prune=all \
71-
&& eval "$(pkgx integrate)" \
7272
&& install_nix \
7373
&& install_ohmyzsh && /tmp/scripts/configure_ohmyzsh.sh \
7474
&& mkdir -p "${HOME}/.ssh" && chmod 700 "${HOME}/.ssh"
@@ -91,4 +91,4 @@ HEALTHCHECK NONE
9191
USER "${USER_NAME}"
9292
WORKDIR "${HOME}"
9393
ENTRYPOINT [ "/init" ]
94-
CMD ["/bin/zsh"]
94+
CMD ["/bin/zsh"]

Makefile

Lines changed: 6 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -36,8 +36,8 @@ lint:
3636
fi; \
3737
done
3838
download:
39-
@pwsh -NoProfile -File ./scripts/Get-Models.ps1 -Model all -Token "${HF_API_TOKEN}"
40-
# @yamllint .
39+
@pwsh -NoProfile -File ./scripts/Get-Models.ps1 -Model "$(MODELS)" -Token "${HF_API_TOKEN}"
40+
4141
#
4242
# Build tasks
4343
#
@@ -119,6 +119,7 @@ TARGETS = \
119119
changelog \
120120
check \
121121
convert \
122+
download \
122123
lint \
123124
update-mamba-version \
124125
gold-image \
@@ -129,3 +130,6 @@ TARGETS = \
129130
push-notebook \
130131
build-image \
131132
push-image
133+
MODELS = \
134+
openai/gpt-oss-20b \
135+
# openai/gpt-oss-120b

WARP.md

Lines changed: 0 additions & 165 deletions
This file was deleted.
Lines changed: 3 additions & 18 deletions
Original file line numberDiff line numberDiff line change
@@ -8,30 +8,15 @@ macros:
88
"ssl_key": "${env.HOME}/certs/my.key"
99
"ssl_cert": "${env.HOME}/certs/my.pem"
1010
models:
11-
"smollm2":
11+
"gpt-oss-20b":
1212
proxy: "http://127.0.0.1:${PORT}"
13-
description: "When should the model be used?"
14-
cmd: |
15-
llama-server
16-
--offline
17-
--batch-size 2048
18-
--host 0.0.0.0
19-
--jinja
20-
--model ${models_dir}/SmolLM2-135M-Instruct-Q4_K_M.gguf
21-
--port ${PORT}
22-
--sleep-idle-seconds 600
23-
--tools all
24-
--ubatch-size 2048
25-
"qwen2.5":
26-
proxy: "http://127.0.0.1:${PORT}"
27-
description: "When should the model be used?"
2813
cmd: |
2914
llama-server
3015
--offline
3116
--batch-size 2048
3217
--host 0.0.0.0
3318
--jinja
34-
--model ${models_dir}/Qwen2.5-0.5B-Instruct-Q4_K_M.gguf
19+
--model ${models_dir}/gpt-oss-20b
3520
--port ${PORT}
3621
--sleep-idle-seconds 600
3722
--tools all
@@ -53,4 +38,4 @@ models:
5338
--serving-name vllm-coder
5439
cmdStop: podman stop ${MODEL_ID}
5540
checkEndpoint: "none"
56-
ttl: 0
41+
ttl: 0

config/llama-swap/template.yaml

Lines changed: 29 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,29 @@
1+
healthCheckTimeout: 500
2+
proxy:
3+
listen: "http://0.0.0.0:10732"
4+
macros:
5+
"context_size": "${env.LLAMA_ARG_CTX_SIZE}"
6+
"parallel": "${env.LLAMA_ARG_N_PARALLEL}"
7+
"models_dir": "${env.HOME}/models"
8+
"ssl_key": "${env.HOME}/certs/my.key"
9+
"ssl_cert": "${env.HOME}/certs/my.pem"
10+
models:
11+
{{ generated_models }}
12+
"vllm-coder":
13+
proxy: "http://127.0.0.1:${PORT}"
14+
description: "When should the model be used?"
15+
cmd: |
16+
podman run
17+
--name ${MODEL_ID}
18+
--init
19+
--rm
20+
--gpus all
21+
--publish ${PORT}:8000
22+
-v "${env.HOME}/models:/root/models"
23+
docker.io/vllm/vllm-openai:latest
24+
--model ${models_dir}/Qwen2.5-0.5B-Instruct-Q4_K_M.gguf
25+
--port 8000
26+
--serving-name vllm-coder
27+
cmdStop: podman stop ${MODEL_ID}
28+
checkEndpoint: "none"
29+
ttl: 0

0 commit comments

Comments
 (0)