From d2f70da116257d02f34d12bf478c974ea9179dac Mon Sep 17 00:00:00 2001 From: Uranus <109661872+UranusSeven@users.noreply.github.com> Date: Fri, 5 Jun 2026 15:43:04 +0800 Subject: [PATCH] fix: pad dummy run query_start_loc (#44603) Signed-off-by: UranusSeven <109661872+UranusSeven@users.noreply.github.com> --- vllm/v1/worker/gpu_model_runner.py | 3 +++ 1 file changed, 3 insertions(+) diff --git a/vllm/v1/worker/gpu_model_runner.py b/vllm/v1/worker/gpu_model_runner.py index 261995f4b01..8c726be337e 100644 --- a/vllm/v1/worker/gpu_model_runner.py +++ b/vllm/v1/worker/gpu_model_runner.py @@ -5787,6 +5787,9 @@ class GPUModelRunner( num_scheduled_tokens, self.query_pos.np ) self.query_start_loc.np[1 : num_reqs + 1] = cum_num_tokens + self.query_start_loc.np[num_reqs + 1 : num_reqs_padded + 1].fill( + cum_num_tokens[-1] + ) self.query_start_loc.copy_to_gpu() # Sync block table CPU->GPU so cleared rows from