diff --git a/vllm/entrypoints/pooling/base/protocol.py b/vllm/entrypoints/pooling/base/protocol.py index 3de958fc1aea..e30195a7b1f9 100644 --- a/vllm/entrypoints/pooling/base/protocol.py +++ b/vllm/entrypoints/pooling/base/protocol.py @@ -179,7 +179,7 @@ def build_tok_params(self, model_config: ModelConfig) -> TokenizeParams: pooler_config = model_config.pooler_config if pooler_config is not None: if pooler_config.enable_chunked_processing: - max_total_tokens = None + max_total_tokens = pooler_config.max_embed_len else: max_embed_len = pooler_config.max_embed_len or default_max_total_tokens max_output_tokens = default_max_total_tokens - max_embed_len