114 lines
3.8 KiB
YAML
114 lines
3.8 KiB
YAML
# ==========================================
|
|
# Shared Configurations
|
|
# ==========================================
|
|
|
|
_envs: &envs
|
|
TASK_QUEUE_ENABLE: "1"
|
|
VLLM_USE_V1: "1"
|
|
HCCL_OP_EXPANSION_MODE: "AIV"
|
|
VLLM_ASCEND_ENABLE_FLASHCOMM: "1"
|
|
SERVER_PORT: "DEFAULT_PORT"
|
|
|
|
_server_cmd: &server_cmd
|
|
- "--tensor-parallel-size"
|
|
- "4"
|
|
- "--port"
|
|
- "$SERVER_PORT"
|
|
- "--distributed_executor_backend"
|
|
- "mp"
|
|
- "--trust-remote-code"
|
|
- "--reasoning-parser"
|
|
- "deepseek_r1"
|
|
- "--gpu-memory-utilization"
|
|
- "0.9"
|
|
|
|
_benchmarks_gsm8k_lite: &benchmarks_gsm8k_lite
|
|
acc:
|
|
case_type: accuracy
|
|
dataset_path: vllm-ascend/gsm8k_lite
|
|
request_conf: vllm_api_general_chat
|
|
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_chat_prompt
|
|
max_out_len: 10240
|
|
num_prompts: 32
|
|
batch_size: 32
|
|
baseline: 100
|
|
threshold: 10
|
|
|
|
_benchmarks_perf1: &benchmarks_perf1
|
|
perf:
|
|
case_type: performance
|
|
dataset_path: vllm-ascend/GSM8K-in3500-bs8000-qwen3
|
|
request_conf: vllm_api_stream_chat
|
|
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
|
num_prompts: 340
|
|
max_out_len: 1500
|
|
batch_size: 60
|
|
request_rate: 0
|
|
baseline: 724.59
|
|
threshold: 0.97
|
|
|
|
# ==========================================
|
|
# ACTUAL TEST CASES
|
|
# ==========================================
|
|
|
|
test_cases:
|
|
- name: "Qwq_32b_Feature_A3"
|
|
model: "Qwen/QwQ-32B"
|
|
envs:
|
|
<<: *envs
|
|
server_cmd: *server_cmd
|
|
server_cmd_extra:
|
|
- "--max-num-seqs"
|
|
- "256"
|
|
- "--max-model-len"
|
|
- "32768"
|
|
- "--max-num-batched-tokens"
|
|
- "32768"
|
|
- "--enforce-eager"
|
|
- "--additional-config"
|
|
- '{"ascend_scheduler_config":{"enabled":false}}'
|
|
- name: "Qwq_32B_gsm8k_Accuracy_A3"
|
|
model: "Qwen/QwQ-32B"
|
|
envs:
|
|
<<: *envs
|
|
LD_PRELOAD: "/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD"
|
|
VLLM_ASCEND_ENABLE_DENSE_OPTIMIZE: "1"
|
|
VLLM_ASCEND_ENABLE_PREFETCH_MLP: "1"
|
|
server_cmd: *server_cmd
|
|
server_cmd_extra:
|
|
- "--max-model-len"
|
|
- "35840"
|
|
- "--max-num-batched-tokens"
|
|
- "40960"
|
|
- "--block-size"
|
|
- "128"
|
|
- "--async-scheduling"
|
|
- "--no-enable-prefix-caching"
|
|
- "--compilation-config"
|
|
- '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
|
benchmarks:
|
|
<<: *benchmarks_gsm8k_lite
|
|
- name: "Qwq_Performance_A3_3500_1500_A3"
|
|
model: "Qwen/QwQ-32B"
|
|
envs:
|
|
<<: *envs
|
|
OMP_PROC_BIND: "false"
|
|
ASCEND_RT_VISIBLE_DEVICES: "0,1,2,3"
|
|
TASK_QUEUE_ENABLE: "1"
|
|
server_cmd: *server_cmd
|
|
server_cmd_extra:
|
|
- "--max-model-len"
|
|
- "5500"
|
|
- "--max-num-batched-tokens"
|
|
- "40960"
|
|
- "--block-size"
|
|
- "128"
|
|
- "--async-scheduling"
|
|
- "--compilation-config"
|
|
- '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [ 1,5,8,72,76,80,100,120,140,144,160,192,216,240,252,288,320,336,360,384,400,408,416,420,432,480,540,576,600 ]}'
|
|
- "--additional-config"
|
|
- '{"pa_shape_list": [32,33,34,35,36,37,38,39,40,41,42,43,44,45,46,47,48,49,50,51,52,53,54,55,56,57,58,59,60,61,62,63,64,65,66,67,68,69,70,71,72,73,74,75,76,77,78,79,80,81,82,83,84,85,86,87,88,89,90,91,92,93,94,95,96,97,98,99,100,101,102,103,104,105,106,107,108,109,110,111,112,113,114,115,116,117,118,119,120,121,122,123,124,125,126,127,128,129,130,131,132,133,134,135,136,137,138,139,140,141,142,143,144,145,146,147,148,149,150,151,152,153,154,155,156,157,158,159,160,161,162,163,164,165,166,167,168,169,170,171,172,173,174,175,176,177,178,179,180,181,182,183,184,185,186,187,188,189,190,191,192,193,194,195,196,197,198,199,200,201,202,203,204,205,206,207,208,209,210,211,212,213,214,215,216,217,218,219,220,221,222,223,224,225,226,227,228,229,230,231,232,233,234,235,236,237,238,239,240,241,242,243,244,245,246,247,248,249,250,251,252,253,254,255,256 ]}'
|
|
benchmarks:
|
|
<<: *benchmarks_perf1
|
|
|