From aebc660a102679b2b2e4838eb72ff8d2ffbac590 Mon Sep 17 00:00:00 2001 From: project6-dev Date: Thu, 13 Aug 2026 15:08:40 +0000 Subject: [PATCH] revert: restore to 8c8c0286 (last confirmed build success) Revert LD_PRELOAD addition and patch_xformers profiling skip. Need to identify which change caused build failure before re-adding. --- computility-run.yaml | 2 -- qwen3_6_scripts/patch_xformers_sdpa_seq.py | 4 ---- 2 files changed, 6 deletions(-) diff --git a/computility-run.yaml b/computility-run.yaml index 7d356832..b009c3fb 100644 --- a/computility-run.yaml +++ b/computility-run.yaml @@ -49,6 +49,4 @@ env: value: '1' - name: PYTORCH_CUDA_ALLOC_CONF value: max_split_size_mb:512 - - name: LD_PRELOAD - value: /workspace/qwen3_6_scripts/cccl_preload/libcccl_allocator.so diff --git a/qwen3_6_scripts/patch_xformers_sdpa_seq.py b/qwen3_6_scripts/patch_xformers_sdpa_seq.py index af7037c2..8de1565a 100644 --- a/qwen3_6_scripts/patch_xformers_sdpa_seq.py +++ b/qwen3_6_scripts/patch_xformers_sdpa_seq.py @@ -200,10 +200,6 @@ FALLBACK_METHOD = ''' max_seqlen = max(seq_lens_list) try: - # Skip flash_attn during profiling — OOMs on large dummy batch - import os - if os.environ.get("BI100_IN_STARTUP_PROFILE") == "1": - raise RuntimeError("skip flash_attn during profiling") out = _ixf.flash_attn_varlen_func( q_flat.to(torch.float16), k_flat.to(torch.float16),