Files
project_6/upstream_ref/xllm/docs/zh/features/prefix_cache.md

20 lines
867 B
Markdown
Raw Permalink Normal View History

# Prefix Cache 优化
## 功能介绍
xLLM支持prefix_cache匹配。prefix_cache基于mermer_hash使用lru淘汰策略提供更极致的匹配效率同时提高prefix_cache命中率。
同时对prefix_cache进行了优化支持continuous_scheduler、chunked_scheduler和zero_evict_scheduler在prefill之后即更新
prefix_cache提高匹配时效性同时对于chunked_scheduler支持多阶段chunked_prefill匹配减少计算量并尽可能减少kv_cache占用。
## 使用方式
prefix_cache已在xLLM实现并向外暴露gflag参数控制功能的开关。
- 开启zero_evict策略并设置max_decode_token_per_sequence。
```
--enable_prefix_cache=true
```
## 性能效果
开启prefix_cache之后在Qwen3-8B模型上限制TPOT50msE2E时延 **下降10%**
!!! warning "注意"
暂不支持PD分离调度器