xc-llm-ascend

Files

ttanzhiqiang 9d16c9982e rm router logits Improve TTOP 3ms (#1407 )

### What this PR does / why we need it?

The previous code is
router_logits, _ = self.gate(hidden_states)
hidden_states = get_dp_group().all_gather(hidden_states, 0)
router_logits = get_dp_group().all_gather(router_logits, 0)
I want to change the two all_gathers to one, reduce one all_gather
communication, and make it
hidden_states = get_dp_group().all_gather(hidden_states, 0)
router_logits, _ = self.gate(hidden_states)

### Does this PR introduce _any_ user-facing change?

### How was this patch tested?
bash examples/run_dp_attention_etp16.sh
bash examples/run_dp_attention_etp16_benmark.sh

gsm8k accuracy verification
<img width="1809" alt="截屏2025-06-24 21 53 24"
src="https://github.com/user-attachments/assets/47eace3b-a86b-41b4-9de8-773f57fea33b"
/>



- vLLM version: v0.9.2
- vLLM main:
77f77a951e

---------

Signed-off-by: ttanzhiqiang <389825161@qq.com>

2025-07-11 08:53:17 +08:00

__init__.py

[Bugfix] fix env variable in dbo (#1284 )

2025-06-23 09:07:57 +08:00

deepseek_dbo.py

Clean up v0.9.1 code (#1672 )

2025-07-09 08:52:24 +08:00

deepseek_mtp.py

[1/N][CI] Move linting system to pre-commits hooks (#1256 )

2025-07-10 14:17:15 +08:00

deepseek_v2.py

rm router logits Improve TTOP 3ms (#1407 )