mirror of
https://github.com/vllm-project/vllm.git
synced 2026-08-22 21:50:15 +00:00
[Disagg] return routed_experts on streaming generate responses (#44638)
Signed-off-by: aoshen02 <[email protected]> Co-authored-by: Claude Opus 4.8 (1M context) <[email protected]> Co-authored-by: Roger Wang <[email protected]>
This commit is contained in:
co-authored by
Claude Opus 4.8
Roger Wang
parent
b91b7726e0
commit
3e6e33526d
@@ -181,6 +181,7 @@ class GenerateResponseStreamChoice(BaseModel):
|
||||
logprobs: ChatCompletionLogProbs | None = None
|
||||
finish_reason: str | None = None
|
||||
token_ids: list[int] | None = None
|
||||
routed_experts: str | None = None
|
||||
|
||||
|
||||
class GenerateStreamResponse(BaseModel):
|
||||
|
||||
@@ -400,6 +400,14 @@ class ServingTokens(OpenAIServing):
|
||||
else:
|
||||
logprobs = None
|
||||
|
||||
routed_experts_b64 = None
|
||||
if output.routed_experts is not None:
|
||||
buf = io.BytesIO()
|
||||
np.save(buf, output.routed_experts)
|
||||
routed_experts_b64 = base64.b64encode(buf.getvalue()).decode(
|
||||
"ascii"
|
||||
)
|
||||
|
||||
chunk = GenerateStreamResponse(
|
||||
request_id=request_id,
|
||||
choices=[
|
||||
@@ -408,6 +416,7 @@ class ServingTokens(OpenAIServing):
|
||||
logprobs=logprobs,
|
||||
finish_reason=finish_reason,
|
||||
token_ids=as_list(delta_token_ids),
|
||||
routed_experts=routed_experts_b64,
|
||||
)
|
||||
],
|
||||
)
|
||||
|
||||
Reference in New Issue
Block a user