xc-llm-ascend

Files

NeverRaR 807686dec9 perf : optimize memory for deepseek mtp (#2713 )

### What this PR does / why we need it?
delete the temp tensor to optimize memory for deepseek mtp for torchair
case

- vLLM version: v0.11.0rc3
- vLLM main: https://github.com/vllm-project/vllm/commit/v0.11.0

Signed-off-by: boying <897013703@qq.com>

2025-10-23 15:52:17 +08:00

models

perf : optimize memory for deepseek mtp (#2713 )

2025-10-23 15:52:17 +08:00

ops

[BugFix] fix deepseek torchair precision (#3624 )

2025-10-23 15:41:50 +08:00

quantization

[Feat][quantization] Support new version w4a8 dynamic quantization for Linear layers (#3311 )

2025-10-21 20:18:39 +08:00

__init__.py

[1/4][Refactor] Refactor torchair worker (#1885 )