Files
enginex-ascend-910-vllm/tests/e2e/weekly/single_node/configs/Qwq_32b_A3.yaml
Sun Ruoxi 7f8a1b1f7a init v0.23.0
Signed-off-by: Sun Ruoxi <sunruoxi@4paradigm.com>
2026-08-27 15:11:51 +08:00

114 lines
3.8 KiB
YAML

# ==========================================
# Shared Configurations
# ==========================================
_envs: &envs
TASK_QUEUE_ENABLE: "1"
VLLM_USE_V1: "1"
HCCL_OP_EXPANSION_MODE: "AIV"
VLLM_ASCEND_ENABLE_FLASHCOMM: "1"
SERVER_PORT: "DEFAULT_PORT"
_server_cmd: &server_cmd
- "--tensor-parallel-size"
- "4"
- "--port"
- "$SERVER_PORT"
- "--distributed_executor_backend"
- "mp"
- "--trust-remote-code"
- "--reasoning-parser"
- "deepseek_r1"
- "--gpu-memory-utilization"
- "0.9"
_benchmarks_gsm8k_lite: &benchmarks_gsm8k_lite
acc:
case_type: accuracy
dataset_path: vllm-ascend/gsm8k_lite
request_conf: vllm_api_general_chat
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_chat_prompt
max_out_len: 10240
num_prompts: 32
batch_size: 32
baseline: 100
threshold: 10
_benchmarks_perf1: &benchmarks_perf1
perf:
case_type: performance
dataset_path: vllm-ascend/GSM8K-in3500-bs8000-qwen3
request_conf: vllm_api_stream_chat
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
num_prompts: 340
max_out_len: 1500
batch_size: 60
request_rate: 0
baseline: 724.59
threshold: 0.97
# ==========================================
# ACTUAL TEST CASES
# ==========================================
test_cases:
- name: "Qwq_32b_Feature_A3"
model: "Qwen/QwQ-32B"
envs:
<<: *envs
server_cmd: *server_cmd
server_cmd_extra:
- "--max-num-seqs"
- "256"
- "--max-model-len"
- "32768"
- "--max-num-batched-tokens"
- "32768"
- "--enforce-eager"
- "--additional-config"
- '{"ascend_scheduler_config":{"enabled":false}}'
- name: "Qwq_32B_gsm8k_Accuracy_A3"
model: "Qwen/QwQ-32B"
envs:
<<: *envs
LD_PRELOAD: "/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD"
VLLM_ASCEND_ENABLE_DENSE_OPTIMIZE: "1"
VLLM_ASCEND_ENABLE_PREFETCH_MLP: "1"
server_cmd: *server_cmd
server_cmd_extra:
- "--max-model-len"
- "35840"
- "--max-num-batched-tokens"
- "40960"
- "--block-size"
- "128"
- "--async-scheduling"
- "--no-enable-prefix-caching"
- "--compilation-config"
- '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
benchmarks:
<<: *benchmarks_gsm8k_lite
- name: "Qwq_Performance_A3_3500_1500_A3"
model: "Qwen/QwQ-32B"
envs:
<<: *envs
OMP_PROC_BIND: "false"
ASCEND_RT_VISIBLE_DEVICES: "0,1,2,3"
TASK_QUEUE_ENABLE: "1"
server_cmd: *server_cmd
server_cmd_extra:
- "--max-model-len"
- "5500"
- "--max-num-batched-tokens"
- "40960"
- "--block-size"
- "128"
- "--async-scheduling"
- "--compilation-config"
- '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [ 1,5,8,72,76,80,100,120,140,144,160,192,216,240,252,288,320,336,360,384,400,408,416,420,432,480,540,576,600 ]}'
- "--additional-config"
- '{"pa_shape_list": [32,33,34,35,36,37,38,39,40,41,42,43,44,45,46,47,48,49,50,51,52,53,54,55,56,57,58,59,60,61,62,63,64,65,66,67,68,69,70,71,72,73,74,75,76,77,78,79,80,81,82,83,84,85,86,87,88,89,90,91,92,93,94,95,96,97,98,99,100,101,102,103,104,105,106,107,108,109,110,111,112,113,114,115,116,117,118,119,120,121,122,123,124,125,126,127,128,129,130,131,132,133,134,135,136,137,138,139,140,141,142,143,144,145,146,147,148,149,150,151,152,153,154,155,156,157,158,159,160,161,162,163,164,165,166,167,168,169,170,171,172,173,174,175,176,177,178,179,180,181,182,183,184,185,186,187,188,189,190,191,192,193,194,195,196,197,198,199,200,201,202,203,204,205,206,207,208,209,210,211,212,213,214,215,216,217,218,219,220,221,222,223,224,225,226,227,228,229,230,231,232,233,234,235,236,237,238,239,240,241,242,243,244,245,246,247,248,249,250,251,252,253,254,255,256 ]}'
benchmarks:
<<: *benchmarks_perf1