diff --git a/computility-run.yaml b/computility-run.yaml index 7d356832..b009c3fb 100644 --- a/computility-run.yaml +++ b/computility-run.yaml @@ -49,6 +49,4 @@ env: value: '1' - name: PYTORCH_CUDA_ALLOC_CONF value: max_split_size_mb:512 - - name: LD_PRELOAD - value: /workspace/qwen3_6_scripts/cccl_preload/libcccl_allocator.so diff --git a/qwen3_6_scripts/patch_xformers_sdpa_seq.py b/qwen3_6_scripts/patch_xformers_sdpa_seq.py index af7037c2..8de1565a 100644 --- a/qwen3_6_scripts/patch_xformers_sdpa_seq.py +++ b/qwen3_6_scripts/patch_xformers_sdpa_seq.py @@ -200,10 +200,6 @@ FALLBACK_METHOD = ''' max_seqlen = max(seq_lens_list) try: - # Skip flash_attn during profiling — OOMs on large dummy batch - import os - if os.environ.get("BI100_IN_STARTUP_PROFILE") == "1": - raise RuntimeError("skip flash_attn during profiling") out = _ixf.flash_attn_varlen_func( q_flat.to(torch.float16), k_flat.to(torch.float16),