# ========================================== # Shared Configurations # ========================================== _envs: &envs TASK_QUEUE_ENABLE: "1" VLLM_USE_V1: "1" HCCL_OP_EXPANSION_MODE: "AIV" VLLM_ASCEND_ENABLE_FLASHCOMM: "1" SERVER_PORT: "DEFAULT_PORT" _server_cmd: &server_cmd - "--tensor-parallel-size" - "4" - "--port" - "$SERVER_PORT" - "--distributed_executor_backend" - "mp" - "--trust-remote-code" - "--reasoning-parser" - "deepseek_r1" - "--gpu-memory-utilization" - "0.9" _benchmarks_gsm8k_lite: &benchmarks_gsm8k_lite acc: case_type: accuracy dataset_path: vllm-ascend/gsm8k_lite request_conf: vllm_api_general_chat dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_chat_prompt max_out_len: 10240 num_prompts: 32 batch_size: 32 baseline: 100 threshold: 10 _benchmarks_perf1: &benchmarks_perf1 perf: case_type: performance dataset_path: vllm-ascend/GSM8K-in3500-bs8000-qwen3 request_conf: vllm_api_stream_chat dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf num_prompts: 340 max_out_len: 1500 batch_size: 60 request_rate: 0 baseline: 724.59 threshold: 0.97 # ========================================== # ACTUAL TEST CASES # ========================================== test_cases: - name: "Qwq_32b_Feature_A3" model: "Qwen/QwQ-32B" envs: <<: *envs server_cmd: *server_cmd server_cmd_extra: - "--max-num-seqs" - "256" - "--max-model-len" - "32768" - "--max-num-batched-tokens" - "32768" - "--enforce-eager" - "--additional-config" - '{"ascend_scheduler_config":{"enabled":false}}' - name: "Qwq_32B_gsm8k_Accuracy_A3" model: "Qwen/QwQ-32B" envs: <<: *envs LD_PRELOAD: "/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD" VLLM_ASCEND_ENABLE_DENSE_OPTIMIZE: "1" VLLM_ASCEND_ENABLE_PREFETCH_MLP: "1" server_cmd: *server_cmd server_cmd_extra: - "--max-model-len" - "35840" - "--max-num-batched-tokens" - "40960" - "--block-size" - "128" - "--async-scheduling" - "--no-enable-prefix-caching" - "--compilation-config" - '{"cudagraph_mode": "FULL_DECODE_ONLY"}' benchmarks: <<: *benchmarks_gsm8k_lite - name: "Qwq_Performance_A3_3500_1500_A3" model: "Qwen/QwQ-32B" envs: <<: *envs OMP_PROC_BIND: "false" ASCEND_RT_VISIBLE_DEVICES: "0,1,2,3" TASK_QUEUE_ENABLE: "1" server_cmd: *server_cmd server_cmd_extra: - "--max-model-len" - "5500" - "--max-num-batched-tokens" - "40960" - "--block-size" - "128" - "--async-scheduling" - "--compilation-config" - '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [ 1,5,8,72,76,80,100,120,140,144,160,192,216,240,252,288,320,336,360,384,400,408,416,420,432,480,540,576,600 ]}' - "--additional-config" - '{"pa_shape_list": [32,33,34,35,36,37,38,39,40,41,42,43,44,45,46,47,48,49,50,51,52,53,54,55,56,57,58,59,60,61,62,63,64,65,66,67,68,69,70,71,72,73,74,75,76,77,78,79,80,81,82,83,84,85,86,87,88,89,90,91,92,93,94,95,96,97,98,99,100,101,102,103,104,105,106,107,108,109,110,111,112,113,114,115,116,117,118,119,120,121,122,123,124,125,126,127,128,129,130,131,132,133,134,135,136,137,138,139,140,141,142,143,144,145,146,147,148,149,150,151,152,153,154,155,156,157,158,159,160,161,162,163,164,165,166,167,168,169,170,171,172,173,174,175,176,177,178,179,180,181,182,183,184,185,186,187,188,189,190,191,192,193,194,195,196,197,198,199,200,201,202,203,204,205,206,207,208,209,210,211,212,213,214,215,216,217,218,219,220,221,222,223,224,225,226,227,228,229,230,231,232,233,234,235,236,237,238,239,240,241,242,243,244,245,246,247,248,249,250,251,252,253,254,255,256 ]}' benchmarks: <<: *benchmarks_perf1