20aac5b212dd371afbe7f902dd927cb250d0ea66
flash_attn_varlen OOMs at 4096 tokens, Q-tiling also OOMs (K tensor too large). During profiling (BI100_IN_STARTUP_PROFILE=1), return zeros immediately. Profiling only measures memory footprint, not output correctness. Restore: chunked_prefill=on, max_num_batched_tokens=4096.
project_6
Description
Languages
C++
41.8%
Cuda
31.6%
Python
22.2%
C
2.1%
CMake
1.1%
Other
1.1%