716034bdd0cc38f18637a6cb882af53d4c77d9d0
5000 blocks KV cache fills GPU memory, flash_attn_varlen_func OOMs allocating temp attention buffer on first real request. 3000 blocks × 16 = 48K tokens capacity, leaves room for attention.
project_6
Description
Languages
C++
41.8%
Cuda
31.6%
Python
22.2%
C
2.1%
CMake
1.1%
Other
1.1%