@@ -161,29 +161,6 @@ jobs:
161161 aws ecr-public get-login-password --region us-east-1 | docker login --username AWS --password-stdin public.ecr.aws
162162 fi
163163
164- # https://docs.vllm.ai/projects/recipes/en/latest/OpenAI/GPT-OSS.html
165- if [[ "${DEVICE_TYPE}" == *B200* ]]; then
166- export VLLM_USE_TRTLLM_ATTENTION=1
167- export VLLM_USE_TRTLLM_DECODE_ATTENTION=1
168- export VLLM_USE_TRTLLM_CONTEXT_ATTENTION=1
169- export VLLM_USE_FLASHINFER_MXFP4_BF16_MOE=1
170- else
171- export VLLM_USE_TRTLLM_ATTENTION=0
172- export VLLM_USE_TRTLLM_DECODE_ATTENTION=0
173- export VLLM_USE_TRTLLM_CONTEXT_ATTENTION=0
174- export VLLM_USE_FLASHINFER_MXFP4_BF16_MOE=0
175- fi
176-
177- if [[ "${DEVICE_NAME}" == *rocm* ]]; then
178- export VLLM_ROCM_USE_AITER=1
179- export VLLM_USE_AITER_UNIFIED_ATTENTION=1
180- export VLLM_ROCM_USE_AITER_MHA=0
181- else
182- export VLLM_ROCM_USE_AITER=0
183- export VLLM_USE_AITER_UNIFIED_ATTENTION=0
184- export VLLM_ROCM_USE_AITER_MHA=0
185- fi
186-
187164 container_name=$(docker run \
188165 ${GPU_FLAG:-} \
189166 -e MODEL \
@@ -192,13 +169,6 @@ jobs:
192169 -e HF_TOKEN \
193170 -e ENGINE_VERSION \
194171 -e SAVE_TO_PYTORCH_BENCHMARK_FORMAT \
195- -e VLLM_USE_TRTLLM_ATTENTION \
196- -e VLLM_USE_TRTLLM_DECODE_ATTENTION \
197- -e VLLM_USE_TRTLLM_CONTEXT_ATTENTION \
198- -e VLLM_USE_FLASHINFER_MXFP4_BF16_MOE \
199- -e VLLM_ROCM_USE_AITER \
200- -e VLLM_USE_AITER_UNIFIED_ATTENTION \
201- -e VLLM_ROCM_USE_AITER_MHA \
202172 --ipc=host \
203173 --tty \
204174 --detach \
0 commit comments