Compare commits
2 Commits
8c8c0286c9
...
bed1fc4d54
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
bed1fc4d54 | ||
|
|
4518a39d12 |
@@ -49,4 +49,6 @@ env:
|
|||||||
value: '1'
|
value: '1'
|
||||||
- name: PYTORCH_CUDA_ALLOC_CONF
|
- name: PYTORCH_CUDA_ALLOC_CONF
|
||||||
value: max_split_size_mb:512
|
value: max_split_size_mb:512
|
||||||
|
- name: LD_PRELOAD
|
||||||
|
value: /workspace/qwen3_6_scripts/cccl_preload/libcccl_allocator.so
|
||||||
|
|
||||||
|
|||||||
@@ -200,6 +200,10 @@ FALLBACK_METHOD = '''
|
|||||||
max_seqlen = max(seq_lens_list)
|
max_seqlen = max(seq_lens_list)
|
||||||
|
|
||||||
try:
|
try:
|
||||||
|
# Skip flash_attn during profiling — OOMs on large dummy batch
|
||||||
|
import os
|
||||||
|
if os.environ.get("BI100_IN_STARTUP_PROFILE") == "1":
|
||||||
|
raise RuntimeError("skip flash_attn during profiling")
|
||||||
out = _ixf.flash_attn_varlen_func(
|
out = _ixf.flash_attn_varlen_func(
|
||||||
q_flat.to(torch.float16),
|
q_flat.to(torch.float16),
|
||||||
k_flat.to(torch.float16),
|
k_flat.to(torch.float16),
|
||||||
|
|||||||
Reference in New Issue
Block a user