[P/D][main]Offline the llmdatadist connector related parts of the code and files. (#4780)

### What this PR does / why we need it? As support for the mooncake connector is now available, the llmdatadist connector is no longer being maintained, so the llmdatadist-related files need to be retired. ### Does this PR introduce _any_ user-facing change? No ### How was this patch tested? By ci - vLLM version: v0.12.0 - vLLM main: ad32e3e19c --------- Signed-off-by: wangxiaoteng <wangxiaoteng@huawei.com> Signed-off-by: liziyu <liziyu16@huawei.com> Co-authored-by: liziyu <liziyu16@huawei.com>
2025-12-09 22:36:43 +08:00
parent 848419d1ba
commit a77045f355
19 changed files with 188 additions and 1819 deletions
--- a/tests/e2e/nightly/multi_node/config/models/DeepSeek-R1-W8A8-EPLB.yaml
+++ b/tests/e2e/nightly/multi_node/config/models/DeepSeek-R1-W8A8-EPLB.yaml
@@ -41,13 +41,21 @@ deployment:
          --gpu-memory-utilization 0.9
          --speculative-config '{"num_speculative_tokens": 1, "method":"mtp"}'
          --kv-transfer-config
-          '{"kv_connector": "LLMDataDistCMgrConnector",
-          "kv_buffer_device": "npu",
+          '{"kv_connector": "MooncakeConnector",
          "kv_role": "kv_producer",
-          "kv_parallel_size": 1,
-          "kv_port": "20001",
+          "kv_port": "30000",
          "engine_id": "0",
-          "kv_connector_module_path": "vllm_ascend.distributed.llmdatadist_c_mgr_connector"
+          "kv_connector_module_path": "vllm_ascend.distributed.mooncake_connector",
+          "kv_connector_extra_config": {
+                    "prefill": {
+                            "dp_size": 2,
+                            "tp_size": 8
+                    },
+                    "decode": {
+                            "dp_size": 32,
+                            "tp_size": 1
+                    }
+              }
          }'
          --additional-config
          '{"torchair_graph_config":{"enabled":false,"enable_multistream_shared_expert":false},"enable_prefill_optimizations":true,"enable_weight_nz_layout":true,"dynamic_eplb":true,"num_iterations_eplb_update":2048,"num_wait_worker_iterations":200}'
@@ -71,13 +79,21 @@ deployment:
          --gpu-memory-utilization 0.9
          --speculative-config '{"num_speculative_tokens": 1, "method":"mtp"}'
          --kv-transfer-config
-          '{"kv_connector": "LLMDataDistCMgrConnector",
-          "kv_buffer_device": "npu",
+          '{"kv_connector": "MooncakeConnector",
          "kv_role": "kv_producer",
-          "kv_parallel_size": 1,
-          "kv_port": "20001",
+          "kv_port": "30100",
          "engine_id": "1",
-          "kv_connector_module_path": "vllm_ascend.distributed.llmdatadist_c_mgr_connector"
+          "kv_connector_module_path": "vllm_ascend.distributed.mooncake_connector",
+          "kv_connector_extra_config": {
+                    "prefill": {
+                            "dp_size": 2,
+                            "tp_size": 8
+                    },
+                    "decode": {
+                            "dp_size": 32,
+                            "tp_size": 1
+                    }
+              }
          }'
          --additional-config
          '{"torchair_graph_config":{"enabled":false,"enable_multistream_shared_expert":false},"enable_prefill_optimizations":true,"enable_weight_nz_layout":true,"dynamic_eplb":true,"num_iterations_eplb_update":2048,"num_wait_worker_iterations":200}'
@@ -102,13 +118,21 @@ deployment:
        --gpu-memory-utilization 0.9
        --speculative-config '{"num_speculative_tokens": 1, "method":"mtp"}'
        --kv-transfer-config
-        '{"kv_connector": "LLMDataDistCMgrConnector",
-        "kv_buffer_device": "npu",
+        '{"kv_connector": "MooncakeConnector",
        "kv_role": "kv_consumer",
-        "kv_parallel_size": 1,
-        "kv_port": "20001",
+        "kv_port": "30200",
        "engine_id": "2",
-        "kv_connector_module_path": "vllm_ascend.distributed.llmdatadist_c_mgr_connector"
+        "kv_connector_module_path": "vllm_ascend.distributed.mooncake_connector",
+        "kv_connector_extra_config": {
+                  "prefill": {
+                          "dp_size": 2,
+                          "tp_size": 8
+                  },
+                  "decode": {
+                          "dp_size": 32,
+                          "tp_size": 1
+                  }
+            }
        }'
        --additional-config
        '{"torchair_graph_config":{"enabled":true,"enable_multistream_mla":true,"graph_batch_sizes":[28],"use_cached_graph":true,"enable_super_kernel":false},"multistream_overlap_shared_expert":true,"dynamic_eplb":true,"num_iterations_eplb_update":2048,"num_wait_worker_iterations":200}'
@@ -132,13 +156,21 @@ deployment:
        --gpu-memory-utilization 0.9
        --speculative-config '{"num_speculative_tokens": 1, "method":"mtp"}'
        --kv-transfer-config
-        '{"kv_connector": "LLMDataDistCMgrConnector",
-        "kv_buffer_device": "npu",
+        '{"kv_connector": "MooncakeConnector",
        "kv_role": "kv_consumer",
-        "kv_parallel_size": 1,
-        "kv_port": "20001",
+        "kv_port": "30200",
        "engine_id": "2",
-        "kv_connector_module_path": "vllm_ascend.distributed.llmdatadist_c_mgr_connector"
+        "kv_connector_module_path": "vllm_ascend.distributed.mooncake_connector",
+        "kv_connector_extra_config": {
+                  "prefill": {
+                          "dp_size": 2,
+                          "tp_size": 8
+                  },
+                  "decode": {
+                          "dp_size": 32,
+                          "tp_size": 1
+                  }
+            }
        }'
        --additional-config
        '{"torchair_graph_config":{"enabled":true,"enable_multistream_mla":true,"graph_batch_sizes":[28],"use_cached_graph":true,"enable_super_kernel":false},"multistream_overlap_shared_expert":true,"dynamic_eplb":true,"num_iterations_eplb_update":2048,"num_wait_worker_iterations":200}'
--- a/tests/e2e/nightly/multi_node/config/models/DeepSeek-R1-W8A8.yaml
+++ b/tests/e2e/nightly/multi_node/config/models/DeepSeek-R1-W8A8.yaml
@@ -40,13 +40,21 @@ deployment:
          --gpu-memory-utilization 0.9
          --speculative-config '{"num_speculative_tokens": 1, "method":"mtp"}'
          --kv-transfer-config
-          '{"kv_connector": "LLMDataDistCMgrConnector",
-          "kv_buffer_device": "npu",
+          '{"kv_connector": "MooncakeConnector",
          "kv_role": "kv_producer",
-          "kv_parallel_size": 1,
-          "kv_port": "20001",
+          "kv_port": "30000",
          "engine_id": "0",
-          "kv_connector_module_path": "vllm_ascend.distributed.llmdatadist_c_mgr_connector"
+          "kv_connector_module_path": "vllm_ascend.distributed.mooncake_connector",
+          "kv_connector_extra_config": {
+                    "prefill": {
+                            "dp_size": 2,
+                            "tp_size": 8
+                    },
+                    "decode": {
+                            "dp_size": 32,
+                            "tp_size": 1
+                    }
+              }
          }'
          --additional-config
          '{"torchair_graph_config":{"enabled":false,"enable_multistream_shared_expert":false},"enable_prefill_optimizations":true,"enable_weight_nz_layout":true}'
@@ -70,13 +78,21 @@ deployment:
          --gpu-memory-utilization 0.9
          --speculative-config '{"num_speculative_tokens": 1, "method":"mtp"}'
          --kv-transfer-config
-          '{"kv_connector": "LLMDataDistCMgrConnector",
-          "kv_buffer_device": "npu",
+          '{"kv_connector": "MooncakeConnector",
          "kv_role": "kv_producer",
-          "kv_parallel_size": 1,
-          "kv_port": "20001",
-          "engine_id": "0",
-          "kv_connector_module_path": "vllm_ascend.distributed.llmdatadist_c_mgr_connector"
+          "kv_port": "30100",
+          "engine_id": "1",
+          "kv_connector_module_path": "vllm_ascend.distributed.mooncake_connector",
+          "kv_connector_extra_config": {
+                    "prefill": {
+                            "dp_size": 2,
+                            "tp_size": 8
+                    },
+                    "decode": {
+                            "dp_size": 32,
+                            "tp_size": 1
+                    }
+              }
          }'
          --additional-config
          '{"torchair_graph_config":{"enabled":false,"enable_multistream_shared_expert":false},"enable_prefill_optimizations":true,"enable_weight_nz_layout":true}'
@@ -101,13 +117,21 @@ deployment:
        --gpu-memory-utilization 0.9
        --speculative-config '{"num_speculative_tokens": 1, "method":"mtp"}'
        --kv-transfer-config
-        '{"kv_connector": "LLMDataDistCMgrConnector",
-        "kv_buffer_device": "npu",
+        '{"kv_connector": "MooncakeConnector",
        "kv_role": "kv_consumer",
-        "kv_parallel_size": 1,
-        "kv_port": "20001",
-        "engine_id": "0",
-        "kv_connector_module_path": "vllm_ascend.distributed.llmdatadist_c_mgr_connector"
+        "kv_port": "30200",
+        "engine_id": "2",
+        "kv_connector_module_path": "vllm_ascend.distributed.mooncake_connector",
+        "kv_connector_extra_config": {
+                  "prefill": {
+                          "dp_size": 2,
+                          "tp_size": 8
+                  },
+                  "decode": {
+                          "dp_size": 32,
+                          "tp_size": 1
+                  }
+            }
        }'
        --additional-config
        '{"torchair_graph_config":{"enabled":true,"enable_multistream_mla":true,"graph_batch_sizes":[28],"use_cached_graph":true,"enable_super_kernel":false},"multistream_overlap_shared_expert":true}'
@@ -131,13 +155,21 @@ deployment:
        --gpu-memory-utilization 0.9
        --speculative-config '{"num_speculative_tokens": 1, "method":"mtp"}'
        --kv-transfer-config
-        '{"kv_connector": "LLMDataDistCMgrConnector",
-        "kv_buffer_device": "npu",
+        '{"kv_connector": "MooncakeConnector",
        "kv_role": "kv_consumer",
-        "kv_parallel_size": 1,
-        "kv_port": "20001",
-        "engine_id": "0",
-        "kv_connector_module_path": "vllm_ascend.distributed.llmdatadist_c_mgr_connector"
+        "kv_port": "30200",
+        "engine_id": "2",
+        "kv_connector_module_path": "vllm_ascend.distributed.mooncake_connector",
+        "kv_connector_extra_config": {
+                  "prefill": {
+                          "dp_size": 2,
+                          "tp_size": 8
+                  },
+                  "decode": {
+                          "dp_size": 32,
+                          "tp_size": 1
+                  }
+            }
        }'
        --additional-config
        '{"torchair_graph_config":{"enabled":true,"enable_multistream_mla":true,"graph_batch_sizes":[28],"use_cached_graph":true,"enable_super_kernel":false},"multistream_overlap_shared_expert":true}'
--- a/tests/e2e/nightly/multi_node/config/multi_node_config.py
+++ b/tests/e2e/nightly/multi_node/config/multi_node_config.py
@@ -127,9 +127,6 @@ class MultiNodeConfig:

        master_ip = self.master_ip
        if self.disaggregated_prefill:
-            self.envs[
-                "DISAGGREGATED_PREFILL_RANK_TABLE_PATH"] = self.disaggregated_prefill.get(
-                    "ranktable_path")
            if self.cur_index < self.decode_start_index:
                # For prefiller nodes, use the default master ip(index==0) as DP master
                master_ip = self.master_ip