From e2352c29743aeec4a2dafc66c4fdd0e10b37072e Mon Sep 17 00:00:00 2001 From: stefankoncarevic Date: Thu, 18 Jun 2026 18:59:37 +0200 Subject: [PATCH] [ROCm][Spec Decode] Fix probabilistic draft probs test attention backend (#45706) Signed-off-by: Stefan Koncarevic --- .buildkite/test_areas/misc.yaml | 6 ++++++ tests/v1/spec_decode/test_eagle.py | 8 ++++++-- 2 files changed, 12 insertions(+), 2 deletions(-) diff --git a/.buildkite/test_areas/misc.yaml b/.buildkite/test_areas/misc.yaml index 67fecf06df3..7db72be7b52 100644 --- a/.buildkite/test_areas/misc.yaml +++ b/.buildkite/test_areas/misc.yaml @@ -21,6 +21,12 @@ steps: - export VLLM_WORKER_MULTIPROC_METHOD=spawn # TODO: create another `optional` test group for slow tests - pytest -v -s -m 'not slow_test' v1/spec_decode + mirror: + amd: + device: mi300_1 + timeout_in_minutes: 65 + depends_on: + - image-build-amd - label: V1 Sample + Logits key: v1-sample-logits diff --git a/tests/v1/spec_decode/test_eagle.py b/tests/v1/spec_decode/test_eagle.py index 848130725ac..fecb72800e0 100644 --- a/tests/v1/spec_decode/test_eagle.py +++ b/tests/v1/spec_decode/test_eagle.py @@ -1002,7 +1002,11 @@ def test_propose(method, attn_backend, num_speculative_tokens, monkeypatch): assert torch.equal(result, expected_tokens) -def test_propose_stores_probabilistic_draft_probs(monkeypatch): +@pytest.mark.parametrize( + "attn_backend", + ["ROCM_ATTN", "TRITON_ATTN"] if current_platform.is_rocm() else ["FLASH_ATTN"], +) +def test_propose_stores_probabilistic_draft_probs(attn_backend, monkeypatch): device = torch.device(DEVICE_TYPE) batch_size = 2 seq_lens = [5, 3] @@ -1053,7 +1057,7 @@ def test_propose_stores_probabilistic_draft_probs(monkeypatch): ) attn_metadata_builder_cls, _ = try_get_attention_backend( - AttentionBackendEnum.FLASH_ATTN + AttentionBackendEnum[attn_backend] ) attn_metadata_builder = attn_metadata_builder_cls( kv_cache_spec=create_standard_kv_cache_spec(proposer.vllm_config),