[Doc] Upgrade env VLLM_ASCEND_ENABLE_FUSED_MC2 used in nightly test and tutorials (#8441)

### What this PR does / why we need it? The env `VLLM_ASCEND_ENABLE_FUSED_MC2` should only enabled in the decoder node during Prefill-Decode Disaggregation scenario --------- Signed-off-by: wangli <wangli858794774@gmail.com>
2026-04-20 22:39:23 +08:00
parent 3db5048d74
commit 36a0470de1
9 changed files with 10 additions and 21 deletions
--- a/tests/e2e/nightly/multi_node/config/Qwen3-235B-disagg-pd.yaml
+++ b/tests/e2e/nightly/multi_node/config/Qwen3-235B-disagg-pd.yaml
@@ -10,7 +10,6 @@ env_common:
  OMP_PROC_BIND: false
  OMP_NUM_THREADS: 1
  VLLM_ASCEND_ENABLE_FLASHCOMM1: 1
-  VLLM_ASCEND_ENABLE_FUSED_MC2: 2
  TASK_QUEUE_ENABLE: 1
  SERVER_PORT: 8080
  
@@ -21,6 +20,9 @@ disaggregated_prefill:

 deployment:
  -
+    envs:
+      # should disable this in the prefiller node
+      VLLM_ASCEND_ENABLE_FUSED_MC2: 0
    server_cmd: >
        vllm serve "Qwen/Qwen3-235B-A22B"
        --host 0.0.0.0
@@ -57,6 +59,8 @@ deployment:
        }'

  -
+    envs:
+      VLLM_ASCEND_ENABLE_FUSED_MC2: 2
    server_cmd: >
        vllm serve "Qwen/Qwen3-235B-A22B"
        --host 0.0.0.0
--- a/tests/e2e/nightly/single_node/models/configs/GLM-4.7.yaml
+++ b/tests/e2e/nightly/single_node/models/configs/GLM-4.7.yaml
@@ -12,7 +12,6 @@ _envs: &envs
  VLLM_ASCEND_BALANCE_SCHEDULING: "1"
  VLLM_ASCEND_ENABLE_TOPK_OPTIMIZE: "1"
  VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
-  VLLM_ASCEND_ENABLE_FUSED_MC2: "1"

 _server_cmd: &server_cmd
  - "--enable-expert-parallel"
--- a/tests/e2e/nightly/single_node/models/configs/Qwen3-VL-235B-A22B-Instruct-W8A8.yaml
+++ b/tests/e2e/nightly/single_node/models/configs/Qwen3-VL-235B-A22B-Instruct-W8A8.yaml
@@ -10,7 +10,6 @@ _envs: &envs
  HCCL_BUFFSIZE: "1536"
  PYTORCH_NPU_ALLOC_CONF: "expandable_segments:True"
  VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
-  VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
  VLLM_ASCEND_ENABLE_NZ: "2"
  VLLM_ASCEND_BALANCE_SCHEDULING: "1"
  SERVER_PORT: "DEFAULT_PORT"
--- a/tests/e2e/nightly/single_node/models/configs/Qwen3.5-397B-A17B-W8A8-mtp-A3.yaml
+++ b/tests/e2e/nightly/single_node/models/configs/Qwen3.5-397B-A17B-W8A8-mtp-A3.yaml
@@ -13,7 +13,6 @@ test_cases:
      OMP_NUM_THREADS: "1"
      TASK_QUEUE_ENABLE: "1"
      SERVER_PORT: "DEFAULT_PORT"
-      VLLM_ASCEND_ENABLE_FUSED_MC2: "1"
      VLLM_ASCEND_ENABLE_FLASHCOMM1: "1"
    server_cmd:
      - "--tensor-parallel-size"