112
tests/e2e/weekly/multi_node/internal_dp/config/DeepSeek-V3.yaml
Normal file
112
tests/e2e/weekly/multi_node/internal_dp/config/DeepSeek-V3.yaml
Normal file
@@ -0,0 +1,112 @@
|
||||
# For disaggregated mode, set is_disaggregated: true, and set the following parameters:
|
||||
# Prefiller_index: the hosts index of the node running prefiller
|
||||
# Decoder_index: the hosts index of the node running decoder
|
||||
# Suppose we have **4 nodes** running a 2P1D setup (2 Prefillers + 1 Decoder):
|
||||
# ┌───────────────┬───────────────┬───────────────┬───────────────┐
|
||||
# │ node0 │ node1 │ node2 │ node3 │
|
||||
# │ Prefiller #1 │ Prefiller #2 │ Decoder │ Decoder │
|
||||
# └───────────────┴───────────────┴───────────────┴───────────────┘
|
||||
# For the prefiller nodes. the hosts should be node0 and node1
|
||||
# For the decoder nodes. we only have 1 decoder node(dp+tp+ep across node2 and node3. Where node3 is running with headless mode)
|
||||
# So the prefiller_host_index is [0, 1], and the decoder_host_index is [2]
|
||||
test_name: "test DeepSeek-V3 disaggregated_prefill"
|
||||
model: "vllm-ascend/DeepSeek-V3-W8A8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
VLLM_USE_MODELSCOPE: true
|
||||
OMP_PROC_BIND: false
|
||||
OMP_NUM_THREADS: 1
|
||||
TASK_QUEUE_ENABLE: 1
|
||||
HCCL_BUFFSIZE: 1024
|
||||
SERVER_PORT: 8080
|
||||
NUMEXPR_MAX_THREADS: 128
|
||||
DISAGGREGATED_PREFILL_PROXY_SCRIPT: "examples/disaggregated_prefill_v1/load_balance_proxy_server_example.py"
|
||||
# For None kubernetes deployment, list the IPs of all nodes used in order as follow
|
||||
# cluster_hosts: [10.0.0.103, 10.0.0.139]
|
||||
disaggregated_prefill:
|
||||
enabled: true
|
||||
prefiller_host_index: [0]
|
||||
decoder_host_index: [1]
|
||||
|
||||
deployment:
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve "vllm-ascend/DeepSeek-V3-W8A8"
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 2
|
||||
--data-parallel-size-local 2
|
||||
--tensor-parallel-size 8
|
||||
--seed 1024
|
||||
--enforce-eager
|
||||
--enable-expert-parallel
|
||||
--max-num-seqs 16
|
||||
--max-model-len 8192
|
||||
--max-num-batched-tokens 8192
|
||||
--quantization ascend
|
||||
--trust-remote-code
|
||||
--no-enable-prefix-caching
|
||||
--gpu-memory-utilization 0.9
|
||||
--kv-transfer-config
|
||||
'{"kv_connector": "MooncakeConnectorV1",
|
||||
"kv_role": "kv_producer",
|
||||
"kv_port": "30000",
|
||||
"kv_connector_extra_config": {
|
||||
"prefill": {
|
||||
"dp_size": 2,
|
||||
"tp_size": 8
|
||||
},
|
||||
"decode": {
|
||||
"dp_size": 2,
|
||||
"tp_size": 8
|
||||
}
|
||||
}
|
||||
}'
|
||||
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve "vllm-ascend/DeepSeek-V3-W8A8"
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 2
|
||||
--data-parallel-size-local 2
|
||||
--tensor-parallel-size 8
|
||||
--seed 1024
|
||||
--quantization ascend
|
||||
--max-num-seqs 16
|
||||
--max-model-len 8192
|
||||
--max-num-batched-tokens 8192
|
||||
--enable-expert-parallel
|
||||
--trust-remote-code
|
||||
--no-enable-prefix-caching
|
||||
--gpu-memory-utilization 0.9
|
||||
--kv-transfer-config
|
||||
'{"kv_connector": "MooncakeConnectorV1",
|
||||
"kv_role": "kv_consumer",
|
||||
"kv_port": "30200",
|
||||
"kv_connector_extra_config": {
|
||||
"prefill": {
|
||||
"dp_size": 2,
|
||||
"tp_size": 8
|
||||
},
|
||||
"decode": {
|
||||
"dp_size": 2,
|
||||
"tp_size": 8
|
||||
}
|
||||
}
|
||||
}'
|
||||
benchmarks:
|
||||
acc:
|
||||
case_type: accuracy
|
||||
dataset_path: vllm-ascend/gsm8k-lite
|
||||
request_conf: vllm_api_general_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_chat_prompt
|
||||
max_out_len: 4096
|
||||
batch_size: 512
|
||||
baseline: 95
|
||||
threshold: 10
|
||||
@@ -0,0 +1,198 @@
|
||||
test_name: "weekly test DeepSeek-V3.2-W8A8-EP disaggregated_prefill"
|
||||
model: "vllm-ascend/DeepSeek-V3.2-W8A8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
OMP_PROC_BIND: false
|
||||
OMP_NUM_THREADS: 10
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
|
||||
VLLM_USE_V1: "1"
|
||||
HCCL_BUFFSIZE: "360"
|
||||
ASCEND_AGGREGATE_ENABLE: "1"
|
||||
ASCEND_TRANSPORT_PRINT: "1"
|
||||
VLLM_NIXL_ABORT_REQUEST_TIMEOUT: "300000"
|
||||
VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
|
||||
VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
|
||||
VLLM_USE_MODELSCOPE: "true"
|
||||
SERVER_PORT: 8080
|
||||
|
||||
disaggregated_prefill:
|
||||
enabled: true
|
||||
prefiller_host_index: [0]
|
||||
decoder_host_index: [1]
|
||||
|
||||
deployment:
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
VLLM_ASCEND_ENABLE_FLASHCOMM1: 1
|
||||
server_cmd: >
|
||||
vllm serve vllm-ascend/DeepSeek-V3.2-W8A8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 1
|
||||
--data-parallel-start-rank 0
|
||||
--data-parallel-size-local 1
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--tensor-parallel-size 16
|
||||
--enable-expert-parallel
|
||||
--seed 1024
|
||||
--max-model-len 133000
|
||||
--max-num-batched-tokens 8192
|
||||
--trust-remote-code
|
||||
--max-num-seqs 16
|
||||
--gpu-memory-utilization 0.95
|
||||
--quantization ascend
|
||||
--enforce-eager
|
||||
--no-enable-prefix-caching
|
||||
--tokenizer-mode deepseek_v32
|
||||
--reasoning-parser deepseek_v3
|
||||
--speculative-config '{"num_speculative_tokens": 2, "method":"deepseek_mtp"}'
|
||||
--kv-transfer-config
|
||||
'{"kv_connector": "MooncakeConnectorV1",
|
||||
"kv_role": "kv_producer",
|
||||
"kv_port": "30000",
|
||||
"kv_connector_extra_config": {
|
||||
"prefill": {
|
||||
"dp_size": 1,
|
||||
"tp_size": 16
|
||||
},
|
||||
"decode": {
|
||||
"dp_size": 8,
|
||||
"tp_size": 2
|
||||
}
|
||||
}
|
||||
}'
|
||||
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
OMP_PROC_BIND: false
|
||||
OMP_NUM_THREADS: 10
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
|
||||
VLLM_USE_V1: "1"
|
||||
HCCL_BUFFSIZE: "1100"
|
||||
ASCEND_AGGREGATE_ENABLE: "1"
|
||||
ASCEND_TRANSPORT_PRINT: "1"
|
||||
ACL_OP_INIT_MODE: "1"
|
||||
ASCEND_A3_ENABLE: "1"
|
||||
VLLM_NIXL_ABORT_REQUEST_TIMEOUT: "300000"
|
||||
TASK_QUEUE_ENABLE: "1"
|
||||
VLLM_ASCEND_ENABLE_MLAPO: "1"
|
||||
VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
|
||||
DYNAMIC_EPLB: "true"
|
||||
server_cmd: >
|
||||
vllm serve vllm-ascend/DeepSeek-V3.2-W8A8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 8
|
||||
--data-parallel-start-rank 0
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--data-parallel-rpc-port 13389
|
||||
--tensor-parallel-size 2
|
||||
--enable-expert-parallel
|
||||
--seed 1024
|
||||
--max-model-len 133000
|
||||
--max-num-batched-tokens 100
|
||||
--speculative-config '{"num_speculative_tokens": 2, "method":"deepseek_mtp"}'
|
||||
--compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY", "cudagraph_capture_sizes":[3,6,9,12,15,18,21,24,27,30,33,36,39,42]}'
|
||||
--additional-config '{"recompute_scheduler_enable": true,"eplb_config": {"dynamic_eplb":true,"expert_heat_collection_interval":2000,"algorithm_execution_interval":50, "eplb_policy_type":3, "num_redundant_experts":0}}'
|
||||
--trust-remote-code
|
||||
--max-num-seqs 14
|
||||
--gpu-memory-utilization 0.92
|
||||
--no-enable-prefix-caching
|
||||
--quantization ascend
|
||||
--tokenizer-mode deepseek_v32
|
||||
--reasoning-parser deepseek_v3
|
||||
--kv-transfer-config
|
||||
'{"kv_connector": "MooncakeConnectorV1",
|
||||
"kv_role": "kv_consumer",
|
||||
"kv_port": "30200",
|
||||
"kv_connector_extra_config": {
|
||||
"prefill": {
|
||||
"dp_size": 1,
|
||||
"tp_size": 16
|
||||
},
|
||||
"decode": {
|
||||
"dp_size": 8,
|
||||
"tp_size": 2
|
||||
}
|
||||
}
|
||||
}'
|
||||
|
||||
|
||||
benchmarks:
|
||||
perf_16384_1024_num64:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_prefix0_in16384_bs1200_deepseek
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 64
|
||||
max_out_len: 1024
|
||||
batch_size: 16
|
||||
request_rate: 1
|
||||
baseline: 1
|
||||
threshold: 0.97
|
||||
|
||||
perf_16384_1024_num256:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_prefix0_in16384_bs1200_deepseek
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 256
|
||||
max_out_len: 1024
|
||||
batch_size: 64
|
||||
request_rate: 1
|
||||
baseline: 1
|
||||
threshold: 0.97
|
||||
|
||||
perf_32768_512_num32:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_prefix0_in32768_bs1000_deepseek
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 32
|
||||
max_out_len: 512
|
||||
batch_size: 8
|
||||
request_rate: 1
|
||||
baseline: 1
|
||||
threshold: 0.97
|
||||
|
||||
perf_32768_512_num128:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_prefix0_in32768_bs1000_deepseek
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 128
|
||||
max_out_len: 512
|
||||
batch_size: 32
|
||||
request_rate: 0.7
|
||||
baseline: 1
|
||||
threshold: 0.97
|
||||
|
||||
perf_65536_1024_num4:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_prefix0_in65536_bs400_deepseek
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 4
|
||||
max_out_len: 1024
|
||||
batch_size: 1
|
||||
request_rate: 0.1
|
||||
baseline: 1
|
||||
threshold: 0.97
|
||||
|
||||
perf_65536_1024_num16:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_prefix0_in65536_bs400_deepseek
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 16
|
||||
max_out_len: 1024
|
||||
batch_size: 4
|
||||
request_rate: 1
|
||||
baseline: 1
|
||||
threshold: 0.97
|
||||
@@ -0,0 +1,102 @@
|
||||
test_name: "test GLM-4.7-W8A8C8 PD separation with mooncake layerwise connector"
|
||||
model: "vllm-ascend/GLM-4.7-W8A8C8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
VLLM_USE_MODELSCOPE: true
|
||||
OMP_PROC_BIND: false
|
||||
HCCL_BUFFSIZE: 512
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
SERVER_PORT: 8080
|
||||
DISAGGREGATED_PREFILL_PROXY_SCRIPT: "examples/disaggregated_prefill_v1/load_balance_proxy_layerwise_server_example.py"
|
||||
|
||||
disaggregated_prefill:
|
||||
enabled: true
|
||||
prefiller_host_index: [0]
|
||||
decoder_host_index: [1]
|
||||
|
||||
deployment:
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve "vllm-ascend/GLM-4.7-W8A8C8"
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 2
|
||||
--data-parallel-size-local 2
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--data-parallel-rpc-port 13389
|
||||
--tensor-parallel-size 8
|
||||
--seed 1024
|
||||
--enforce-eager
|
||||
--enable-expert-parallel
|
||||
--max-num-seqs 32
|
||||
--max-model-len 8192
|
||||
--max-num-batched-tokens 8192
|
||||
--trust-remote-code
|
||||
--no-enable-prefix-caching
|
||||
--gpu-memory-utilization 0.9
|
||||
--additional-config '{"enable_shared_expert_dp": true}'
|
||||
--kv-transfer-config
|
||||
'{"kv_connector": "MooncakeLayerwiseConnector",
|
||||
"kv_role": "kv_producer",
|
||||
"kv_port": "30000",
|
||||
"kv_connector_extra_config": {
|
||||
"prefill": {
|
||||
"dp_size": 2,
|
||||
"tp_size": 8
|
||||
},
|
||||
"decode": {
|
||||
"dp_size": 2,
|
||||
"tp_size": 8
|
||||
}
|
||||
}
|
||||
}'
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve "vllm-ascend/GLM-4.7-W8A8C8"
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 2
|
||||
--data-parallel-size-local 2
|
||||
--data-parallel-address $MASTER_IP
|
||||
--data-parallel-rpc-port 13389
|
||||
--tensor-parallel-size 8
|
||||
--seed 1024
|
||||
--max-num-seqs 16
|
||||
--max-model-len 8192
|
||||
--max-num-batched-tokens 8192
|
||||
--enable-expert-parallel
|
||||
--trust-remote-code
|
||||
--no-enable-prefix-caching
|
||||
--gpu-memory-utilization 0.9
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--kv-transfer-config
|
||||
'{"kv_connector": "MooncakeLayerwiseConnector",
|
||||
"kv_role": "kv_consumer",
|
||||
"kv_port": "30200",
|
||||
"kv_connector_extra_config": {
|
||||
"prefill": {
|
||||
"dp_size": 2,
|
||||
"tp_size": 8
|
||||
},
|
||||
"decode": {
|
||||
"dp_size": 2,
|
||||
"tp_size": 8
|
||||
}
|
||||
}
|
||||
}'
|
||||
|
||||
benchmarks:
|
||||
acc:
|
||||
case_type: accuracy
|
||||
dataset_path: vllm-ascend/gsm8k-lite
|
||||
request_conf: vllm_api_general_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_chat_prompt
|
||||
max_out_len: 4096
|
||||
batch_size: 8
|
||||
baseline: 95
|
||||
threshold: 10
|
||||
@@ -0,0 +1,104 @@
|
||||
#198k长序列只验证功能
|
||||
test_name: "multi-node-GLM-5.1-W8A8C8-MTP-A3_198k_function"
|
||||
model: "Eco-Tech/GLM-5.1-w8a8c8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
OMP_PROC_BIND: "false"
|
||||
VLLM_USE_MODELSCOPE: "true"
|
||||
OMP_NUM_THREADS: "1"
|
||||
HCCL_BUFFSIZE: "400"
|
||||
PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
|
||||
VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
|
||||
VLLM_ASCEND_ENABLE_MLAPO: "1"
|
||||
VLLM_ENGINE_READY_TIMEOUT_S: "3000"
|
||||
VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
|
||||
SERVER_PORT: 8077
|
||||
|
||||
deployment:
|
||||
- envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.1-w8a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 0
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12980
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 6
|
||||
--max-model-len 202752
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.92
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.1-w8a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 4
|
||||
--headless
|
||||
--data-parallel-address $MASTER_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12980
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 6
|
||||
--max-model-len 202752
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.9
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
benchmarks:
|
||||
perf:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K-in3500-bs2800
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 8
|
||||
max_out_len: 1500
|
||||
batch_size: 2
|
||||
request_rate: 0
|
||||
baseline: 1
|
||||
threshold: 0.97
|
||||
acc_aime2025:
|
||||
case_type: accuracy
|
||||
dataset_path: vllm-ascend/aime2025
|
||||
request_conf: vllm_api_general_chat
|
||||
dataset_conf: aime2025/aime2025_gen_0_shot_chat_prompt
|
||||
max_out_len: 129024
|
||||
batch_size: 32
|
||||
baseline: 93.33
|
||||
threshold: 10
|
||||
temperature: 1.0
|
||||
top_p: 0.95
|
||||
@@ -0,0 +1,105 @@
|
||||
test_name: "multi-node-GLM-5.1-W8A8C8-MTP-A3_3.5k_1.5k_0_50"
|
||||
model: "Eco-Tech/GLM-5.1-w8a8c8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
OMP_PROC_BIND: "false"
|
||||
VLLM_USE_MODELSCOPE: "true"
|
||||
OMP_NUM_THREADS: "1"
|
||||
HCCL_BUFFSIZE: "400"
|
||||
PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
|
||||
VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
|
||||
VLLM_ASCEND_ENABLE_MLAPO: "1"
|
||||
VLLM_ENGINE_READY_TIMEOUT_S: "3000"
|
||||
VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
|
||||
SERVER_PORT: 8077
|
||||
|
||||
# TODO: need to identify why TP and mtp+1 divisibility rules break on dual-node case
|
||||
|
||||
deployment:
|
||||
- envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.1-w8a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 0
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12981
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 32
|
||||
--max-model-len 133120
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.92
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--no-enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": false, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.1-w8a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 4
|
||||
--headless
|
||||
--data-parallel-address $MASTER_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12981
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 32
|
||||
--max-model-len 133120
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.95
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--no-enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": false, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
benchmarks:
|
||||
perf_TPOT50:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_in3500_bs400
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 256
|
||||
max_out_len: 1500
|
||||
batch_size: 64
|
||||
request_rate: 0
|
||||
baseline: 1267.2573
|
||||
threshold: 0.97
|
||||
perf_TPOT20:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_in3500_bs400
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 32
|
||||
max_out_len: 1500
|
||||
batch_size: 8
|
||||
request_rate: 0
|
||||
baseline: 345.13
|
||||
threshold: 0.97
|
||||
@@ -0,0 +1,115 @@
|
||||
test_name: "multi-node-GLM-5.1-W8A8C8-MTP-A3_64k/128k"
|
||||
model: "Eco-Tech/GLM-5.1-w8a8c8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
OMP_PROC_BIND: "false"
|
||||
VLLM_USE_MODELSCOPE: "true"
|
||||
OMP_NUM_THREADS: "1"
|
||||
HCCL_BUFFSIZE: "400"
|
||||
PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
|
||||
VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
|
||||
VLLM_ASCEND_ENABLE_MLAPO: "1"
|
||||
VLLM_ENGINE_READY_TIMEOUT_S: "3000"
|
||||
VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
|
||||
SERVER_PORT: 8077
|
||||
|
||||
# TODO: need to identify why TP and mtp+1 divisibility rules break on dual-node case
|
||||
|
||||
deployment:
|
||||
- envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.1-w8a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 0
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12981
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 6
|
||||
--max-model-len 133120
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.92
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": false, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
- envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.1-w8a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 4
|
||||
--headless
|
||||
--data-parallel-address $MASTER_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12981
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 6
|
||||
--max-model-len 133120
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.9
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": false, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
benchmarks:
|
||||
perf_64k:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K-in65536-bs1500-prefix90-glm51
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 128
|
||||
max_out_len: 1024
|
||||
batch_size: 32
|
||||
request_rate: 0
|
||||
baseline: 539.11
|
||||
threshold: 0.97
|
||||
perf_128k_warmup:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K-in131072-bs500-prefix90-glm51
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 1
|
||||
max_out_len: 1
|
||||
batch_size: 1
|
||||
request_rate: 0
|
||||
baseline: 0
|
||||
threshold: 0.97
|
||||
perf_128k:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K-in131072-bs500-prefix90-glm51
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 256
|
||||
max_out_len: 1024
|
||||
batch_size: 64
|
||||
request_rate: 0
|
||||
baseline: 290.8308
|
||||
threshold: 0.97
|
||||
@@ -0,0 +1,104 @@
|
||||
#198k长序列只验证功能
|
||||
test_name: "multi-node-GLM-5.2-W4A8C8-MTP-A3_198k_function"
|
||||
model: "Eco-Tech/GLM-5.2-w4a8c8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
OMP_PROC_BIND: "false"
|
||||
VLLM_USE_MODELSCOPE: "true"
|
||||
OMP_NUM_THREADS: "1"
|
||||
HCCL_BUFFSIZE: "400"
|
||||
PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
|
||||
VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
|
||||
VLLM_ASCEND_ENABLE_MLAPO: "1"
|
||||
VLLM_ENGINE_READY_TIMEOUT_S: "3000"
|
||||
VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
|
||||
SERVER_PORT: 8077
|
||||
|
||||
deployment:
|
||||
- envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.2-w4a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 0
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12980
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 6
|
||||
--max-model-len 202752
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.92
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.2-w4a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 4
|
||||
--headless
|
||||
--data-parallel-address $MASTER_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12980
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 6
|
||||
--max-model-len 202752
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.9
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
benchmarks:
|
||||
perf:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K-in3500-bs2800
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 8
|
||||
max_out_len: 1500
|
||||
batch_size: 2
|
||||
request_rate: 0
|
||||
baseline: 1
|
||||
threshold: 0.97
|
||||
acc_aime2025:
|
||||
case_type: accuracy
|
||||
dataset_path: vllm-ascend/aime2025
|
||||
request_conf: vllm_api_general_chat
|
||||
dataset_conf: aime2025/aime2025_gen_0_shot_chat_prompt
|
||||
max_out_len: 129024
|
||||
batch_size: 32
|
||||
baseline: 93.33
|
||||
threshold: 10
|
||||
temperature: 1.0
|
||||
top_p: 0.95
|
||||
@@ -0,0 +1,105 @@
|
||||
test_name: "multi-node-GLM-5.2-W4A8C8-MTP-A3_3.5k_1.5k_0_50"
|
||||
model: "Eco-Tech/GLM-5.2-w4a8c8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
OMP_PROC_BIND: "false"
|
||||
VLLM_USE_MODELSCOPE: "true"
|
||||
OMP_NUM_THREADS: "1"
|
||||
HCCL_BUFFSIZE: "400"
|
||||
PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
|
||||
VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
|
||||
VLLM_ASCEND_ENABLE_MLAPO: "1"
|
||||
VLLM_ENGINE_READY_TIMEOUT_S: "3000"
|
||||
VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
|
||||
SERVER_PORT: 8077
|
||||
|
||||
# TODO: need to identify why TP and mtp+1 divisibility rules break on dual-node case
|
||||
|
||||
deployment:
|
||||
- envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.2-w4a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 0
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12981
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 32
|
||||
--max-model-len 133120
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.92
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--no-enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": false, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.2-w4a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 4
|
||||
--headless
|
||||
--data-parallel-address $MASTER_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12981
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 32
|
||||
--max-model-len 133120
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.95
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--no-enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": false, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
benchmarks:
|
||||
perf_TPOT50:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_in3500_bs400
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 256
|
||||
max_out_len: 1500
|
||||
batch_size: 64
|
||||
request_rate: 0
|
||||
baseline: 1267.2573
|
||||
threshold: 0.97
|
||||
perf_TPOT20:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K_in3500_bs400
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 32
|
||||
max_out_len: 1500
|
||||
batch_size: 8
|
||||
request_rate: 0
|
||||
baseline: 345.13
|
||||
threshold: 0.97
|
||||
@@ -0,0 +1,105 @@
|
||||
test_name: "multi-node-GLM-5.2-W4A8C8-MTP-A3_64k/128k"
|
||||
model: "Eco-Tech/GLM-5.2-w4a8c8"
|
||||
num_nodes: 2
|
||||
npu_per_node: 16
|
||||
env_common: &env_common
|
||||
HCCL_OP_EXPANSION_MODE: "AIV"
|
||||
OMP_PROC_BIND: "false"
|
||||
VLLM_USE_MODELSCOPE: "true"
|
||||
OMP_NUM_THREADS: "1"
|
||||
HCCL_BUFFSIZE: "400"
|
||||
PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
|
||||
VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
|
||||
VLLM_ASCEND_ENABLE_MLAPO: "1"
|
||||
VLLM_ENGINE_READY_TIMEOUT_S: "3000"
|
||||
VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
|
||||
SERVER_PORT: 8077
|
||||
|
||||
# TODO: need to identify why TP and mtp+1 divisibility rules break on dual-node case
|
||||
|
||||
deployment:
|
||||
- envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.2-w4a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 0
|
||||
--data-parallel-address $LOCAL_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12981
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 6
|
||||
--max-model-len 133120
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.92
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": false, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
-
|
||||
envs:
|
||||
<<: *env_common
|
||||
server_cmd: >
|
||||
vllm serve Eco-Tech/GLM-5.2-w4a8c8
|
||||
--host 0.0.0.0
|
||||
--port $SERVER_PORT
|
||||
--data-parallel-size 8
|
||||
--data-parallel-size-local 4
|
||||
--data-parallel-start-rank 4
|
||||
--headless
|
||||
--data-parallel-address $MASTER_IP
|
||||
--enable-expert-parallel
|
||||
--data-parallel-rpc-port 12981
|
||||
--tensor-parallel-size 4
|
||||
--hf-overrides '{"use_index_cache": true, "index_topk_freq": 4}'
|
||||
--seed 1024
|
||||
--tool-call-parser glm47
|
||||
--reasoning-parser glm45
|
||||
--enable-auto-tool-choice
|
||||
--max-num-seqs 6
|
||||
--max-model-len 133120
|
||||
--max-num-batched-tokens 4096
|
||||
--trust-remote-code
|
||||
--gpu-memory-utilization 0.9
|
||||
--quantization ascend
|
||||
--enable-chunked-prefill
|
||||
--enable-prefix-caching
|
||||
--async-scheduling
|
||||
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}'
|
||||
--additional-config '{"enable_dsa_cp": true, "enable_sparse_sfa_c8": false, "enable_sparse_li_c8": true, "enable_balance_scheduling": true, "fuse_muls_add": true, "multistream_overlap_shared_expert": true}'
|
||||
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
|
||||
benchmarks:
|
||||
perf_64k:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K-in65536-bs1500-prefix90-glm51
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 128
|
||||
max_out_len: 1024
|
||||
batch_size: 32
|
||||
request_rate: 0
|
||||
baseline: 539.11
|
||||
threshold: 0.97
|
||||
perf_128k:
|
||||
case_type: performance
|
||||
dataset_path: vllm-ascend/GSM8K-in131072-bs500-prefix90-glm51
|
||||
request_conf: vllm_api_stream_chat
|
||||
dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf
|
||||
num_prompts: 256
|
||||
max_out_len: 1024
|
||||
batch_size: 64
|
||||
request_rate: 0
|
||||
baseline: 796.35
|
||||
threshold: 0.97
|
||||
Reference in New Issue
Block a user