Skip to content

Commit 9960023

Browse files
committed
Use bigger runners
Signed-off-by: Huy Do <huydhn@gmail.com>
1 parent 585b42b commit 9960023

2 files changed

Lines changed: 11 additions & 8 deletions

File tree

.github/workflows/gpt-oss-benchmark.yml

Lines changed: 3 additions & 3 deletions
Original file line numberDiff line numberDiff line change
@@ -26,13 +26,13 @@ jobs:
2626
model: openai/gpt-oss-120b
2727
docker-image: rocm/vllm-dev:open-mi300-08052025
2828
# gpt-oss-20b
29-
- runner: linux.aws.h100
29+
- runner: linux.aws.h100.4
3030
model: openai/gpt-oss-20b
3131
docker-image: 'public.ecr.aws/q9t5s3a7/vllm-ci-test-repo:6d8d0a24c02bfd84d46b3016b865a44f048ae84b'
32-
- runner: linux.dgx.b200
32+
- runner: linux.dgx.b200.8
3333
model: openai/gpt-oss-20b
3434
docker-image: 'public.ecr.aws/q9t5s3a7/vllm-ci-test-repo:6d8d0a24c02bfd84d46b3016b865a44f048ae84b'
35-
- runner: linux.rocm.gpu.gfx942.2
35+
- runner: linux.rocm.gpu.gfx942.8
3636
model: openai/gpt-oss-20b
3737
docker-image: rocm/vllm-dev:open-mi300-08052025
3838
fail-fast: false

vllm-benchmarks/benchmarks/rocm/serving-tests.json

Lines changed: 8 additions & 5 deletions
Original file line numberDiff line numberDiff line change
@@ -421,7 +421,8 @@
421421
"disable_log_stats": "",
422422
"disable_log_requests": "",
423423
"load_format": "dummy",
424-
"max_model_len": 8192
424+
"max_model_len": 8192,
425+
"compilation-config": "{'full_cuda_graph': true}"
425426
},
426427
"client_parameters": {
427428
"model": "",
@@ -437,11 +438,12 @@
437438
"server_parameters": {
438439
"model": "openai/gpt-oss-120b",
439440
"tensor_parallel_size": 2,
440-
"swap_space": 128,
441+
"swap_space": 16,
441442
"disable_log_stats": "",
442443
"disable_log_requests": "",
443444
"load_format": "dummy",
444-
"max_model_len": 8192
445+
"max_model_len": 8192,
446+
"compilation-config": "{'full_cuda_graph': true}"
445447
},
446448
"client_parameters": {
447449
"model": "",
@@ -457,11 +459,12 @@
457459
"server_parameters": {
458460
"model": "openai/gpt-oss-120b",
459461
"tensor_parallel_size": 4,
460-
"swap_space": 128,
462+
"swap_space": 16,
461463
"disable_log_stats": "",
462464
"disable_log_requests": "",
463465
"load_format": "dummy",
464-
"max_model_len": 8192
466+
"max_model_len": 8192,
467+
"compilation-config": "{'full_cuda_graph': true}"
465468
},
466469
"client_parameters": {
467470
"model": "",

0 commit comments

Comments
 (0)