# ========================================== # ACTUAL TEST CASES # ========================================== test_cases: - name: "Qwen3.5-397B-A17B-w8a8-64k-1k-90-50-single" model: "Eco-Tech/Qwen3.5-397B-A17B-w8a8-mtp" envs: VLLM_USE_MODELSCOPE: "true" PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True" HCCL_BUFFSIZE: "2048" OMP_NUM_THREADS: "1" TASK_QUEUE_ENABLE: "1" VLLM_ASCEND_ENABLE_FUSED_MC2: "0" VLLM_ASCEND_ENABLE_FLASHCOMM1: "1" VLLM_ASCEND_BALANCE_SCHEDULING: "1" SERVER_PORT: "DEFAULT_PORT" server_cmd: - "--port" - "$SERVER_PORT" - --data-parallel-size - "1" - --tensor-parallel-size - "16" - --quantization - "ascend" - --allowed-local-media-path - "/" - --seed - "1024" - --enable-prefix-caching - --enable-expert-parallel - --max-model-len - "140000" - --max-num-batched-tokens - "16384" - --max-num-seqs - "32" - --gpu-memory-utilization - "0.9" - --compilation-config - '{"cudagraph_capture_sizes":[1,4,8,16,24,32,48,64,96,108,128,192],"cudagraph_mode":"FULL_DECODE_ONLY"}' - --speculative_config - '{"method": "qwen3_5_mtp","num_speculative_tokens": 3}' - --additional-config - '{"enable_cpu_binding":true}' - --trust-remote-code - --async-scheduling - --mm-processor-cache-gb - "0" - --mm-encoder-tp-mode - "data" benchmarks: acc_aime2025: case_type: accuracy dataset_path: vllm-ascend/aime2025 request_conf: vllm_api_general_chat dataset_conf: aime2025/aime2025_gen_0_shot_chat_prompt max_out_len: 65536 batch_size: 32 baseline: 90 threshold: 10 temperature: 0.6 top_p: 0.95 top_k: 20 min_p: 0.0 presence_penalty: 0.0 repetition_penalty: 1.0 perf: case_type: performance dataset_path: vllm-ascend/GSM8K_prefix90_in65536_bs1000_qwen request_conf: vllm_api_stream_chat dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf num_prompts: 96 max_out_len: 1024 batch_size: 24 request_rate: 5 baseline: 374.5353 threshold: 0.97 perf_128k: case_type: performance dataset_path: vllm-ascend/GSM8K_prefix90_in131072_bs100_qwen request_conf: vllm_api_stream_chat dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf num_prompts: 80 max_out_len: 1024 batch_size: 20 request_rate: 5 baseline: 345.3004 threshold: 0.97