test_name: "Kimi-K2.7-W4A8-128k-1k-TPOT50-PD" model: "Eco-Tech/Kimi-K2.7-Code-w4a8" num_nodes: 2 npu_per_node: 16 routing: type: "disaggregated_prefill" groups: prefiller: [ 0 ] decoder: [ 1 ] config: - node_index: 0 port_start: 7100 dp_rpc_port: 12321 dp_size: 2 dp_size_local: 2 dp_rank_start: 0 tp_size: 8 dp_address: "${NODE_0_IP}" - node_index: 1 port_start: 7100 dp_rpc_port: 12321 dp_size: 4 dp_size_local: 4 dp_rank_start: 0 tp_size: 4 dp_address: "${NODE_1_IP}" env_common: &env_common SERVER_PORT: "${PORT}" VLLM_RPC_TIMEOUT: "3600000" VLLM_EXECUTE_MODEL_TIMEOUT_SECONDS: "30000" HCCL_EXEC_TIMEOUT: "204" HCCL_CONNECT_TIMEOUT: "120" OMP_PROC_BIND: "false" OMP_NUM_THREADS: "1" PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True" TASK_QUEUE_ENABLE: "1" HCCL_OP_EXPANSION_MODE: "AIV" VLLM_ASCEND_ENABLE_MLAPO: "1" VLLM_ASCEND_ENABLE_FUSED_MC2: "1" ASCEND_RT_VISIBLE_DEVICES: "${VISIBLE_DEVICES}" VLLM_USE_MODELSCOPE: "true" env_prefill: &env_prefill <<: *env_common HCCL_BUFFSIZE: "512" VLLM_ASCEND_ENABLE_FLASHCOMM1: "1" env_decode: &env_decode <<: *env_common HCCL_BUFFSIZE: "800" templates: - node_index: 0 envs: <<: *env_prefill server_cmd_template: - --allowed-local-media-path - "/" - --host - "0.0.0.0" - --port - $SERVER_PORT - --data-parallel-size - ${DP_SIZE} - --data-parallel-rank - ${DP_RANK} - --data-parallel-address - ${DP_ADDRESS} - --data-parallel-rpc-port - ${DP_RPC_PORT} - --tensor-parallel-size - ${TP_SIZE} - --safetensors-load-strategy - 'prefetch' - --enable-expert-parallel - --seed - "1024" - --max-model-len - "133120" - --max-num-batched-tokens - "8192" - --max-num-seqs - "8" - --enforce-eager - --trust-remote-code - --gpu-memory-utilization - "0.9" - --speculative-config - '{"method": "dflash","model": "z-lab/Kimi-K2.5-DFlash", "num_speculative_tokens": 1}' - --kv-transfer-config - '{"kv_connector": "MooncakeConnectorV1","kv_role": "kv_producer","kv_port": "30000","engine_id": "0","kv_connector_extra_config": {"use_ascend_direct": true,"prefill": {"dp_size": 2,"tp_size": 8},"decode": {"dp_size": 4,"tp_size": 4}}}' - node_index: 1 envs: <<: *env_decode server_cmd_template: - --allowed-local-media-path - "/" - --host - "0.0.0.0" - --port - $SERVER_PORT - --data-parallel-size - ${DP_SIZE} - --data-parallel-rank - ${DP_RANK} - --data-parallel-address - ${DP_ADDRESS} - --data-parallel-rpc-port - ${DP_RPC_PORT} - --tensor-parallel-size - ${TP_SIZE} - --enable-expert-parallel - --safetensors-load-strategy - 'prefetch' - --seed - "1024" - --max-model-len - "133120" - --max-num-batched-tokens - "256" - --max-num-seqs - "16" - --trust-remote-code - --gpu-memory-utilization - "0.92" - --speculative-config - '{"method": "dflash","model": "z-lab/Kimi-K2.5-DFlash", "num_speculative_tokens": 15}' - --compilation-config - '{"cudagraph_mode": "FULL_DECODE_ONLY"}' - --additional-config - '{"recompute_scheduler_enable":true, "lmhead_tensor_parallel_size":16}' - --kv-transfer-config - '{"kv_connector": "MooncakeConnectorV1","kv_role": "kv_consumer","kv_port": "30100","engine_id": "1","kv_connector_extra_config": {"use_ascend_direct": true,"prefill": {"dp_size": 2,"tp_size": 8},"decode": {"dp_size": 4,"tp_size": 4}}}' benchmarks: acc: case_type: accuracy dataset_path: vllm-ascend/aime2025 request_conf: vllm_api_general_chat dataset_conf: aime2025/aime2025_gen_0_shot_chat_prompt max_out_len: 32768 batch_size: 8 baseline: 93.33 threshold: 10 temperature: 1.0 top_p: 1 perf: case_type: performance dataset_path: vllm-ascend/GSM8K_prefix90_in131072_bs1000_kimi request_conf: vllm_api_stream_chat dataset_conf: gsm8k/gsm8k_gen_0_shot_cot_str_perf num_prompts: 40 max_out_len: 1024 batch_size: 10 request_rate: 0.3 baseline: 220.503 threshold: 0.97