From a5e26d4ac39bb30cc82fd8c89a7dada178fb3cf8 Mon Sep 17 00:00:00 2001 From: Zhang Yulong <35552275+ZhangYulongg@users.noreply.github.com> Date: Fri, 21 Aug 2026 15:15:08 +0800 Subject: [PATCH] Update warmup logic for min_tokens and max_tokens Adjust warmup parameters to ensure min_tokens converges with max_tokens. --- benchmarks/benchmark_serving.py | 3 +++ 1 file changed, 3 insertions(+) diff --git a/benchmarks/benchmark_serving.py b/benchmarks/benchmark_serving.py index 8a13f1cdded..1658bb166b6 100644 --- a/benchmarks/benchmark_serving.py +++ b/benchmarks/benchmark_serving.py @@ -443,6 +443,9 @@ async def benchmark( # warmup短输出:取128和hyper_parameters中max_tokens的最小值 warmup_output_len = min(128, hyper_parameters.get("max_tokens", 128)) warmup_hyper = {k: v for k, v in hyper_parameters.items() if k != "max_tokens"} + # warmup 缩短了 max_tokens,min_tokens 必须一起收敛,否则服务端返回 400 + if warmup_hyper.get("min_tokens") is not None: + warmup_hyper["min_tokens"] = min(int(warmup_hyper["min_tokens"]), warmup_output_len) warmup_request_id = f"warmup_{uuid.uuid4().hex[:8]}" test_input = RequestFuncInput( model=model_id,