Commit Graph

  • a4d16d36b8 fix(build): std::nullopt → c10::nullopt for CoreX c10::optional Claude 2026-08-14 01:50:47 +00:00
  • 56fe58ada3 fix(build): c10::optional for CoreX CUDA 10.2 — std::optional incompatible Claude 2026-08-14 01:49:25 +00:00
  • 1d9b620416 fix(crash): disable corex_gdn_chunk_recurrent — pybind signature mismatch Claude 2026-08-14 01:36:14 +00:00
  • 716034bdd0 fix(OOM): lower blocks cap 5000→3000 — flash_attn needs ~4GB temp buffer project6-dev 2026-08-14 01:33:06 +00:00
  • c8a982c4e8 feat: ix_full_bridge.so — dlopen bridge for ixformer::infer C++ API Claude 2026-08-14 01:25:16 +00:00
  • 872be0effa fix(build): strip \r\n from all .py files — CRLF breaks patch_ops.sh text matching Claude 2026-08-14 01:06:49 +00:00
  • aa4b4992d1 fix(build): hardcode blocks cap 5000 in .py — remove yaml env var project6-dev 2026-08-14 01:00:09 +00:00
  • 456380eed0 fix(OOM): cap GPU blocks at 5000 via BI100_MAX_GPU_BLOCKS env var project6-dev 2026-08-14 00:12:39 +00:00
  • c6aa1b9c62 fix(P0): protocol.py extra=allow — recover 180 rejected replay requests Claude 2026-08-14 00:10:54 +00:00
  • 20aac5b212 fix(OOM): return zeros during profiling — skip both flash_attn AND Q-tiling project6-dev 2026-08-13 16:36:17 +00:00
  • 048302bd4a Revert "fix: remove --enable-chunked-prefill — conflicts with small max_num_batched_tokens" project6-dev 2026-08-13 16:35:49 +00:00
  • 15ad56a454 fix: remove --enable-chunked-prefill — conflicts with small max_num_batched_tokens project6-dev 2026-08-13 16:34:44 +00:00
  • e31bd69779 fix(OOM): max-num-batched-tokens 4096→256 — profiling Q-tiling also OOMs project6-dev 2026-08-13 16:13:41 +00:00
  • 2717bafc30 fix(OOM): skip flash_attn_varlen during profiling project6-dev 2026-08-13 15:30:25 +00:00
  • aebc660a10 revert: restore to 8c8c0286 (last confirmed build success) project6-dev 2026-08-13 15:08:40 +00:00
  • bed1fc4d54 fix(OOM): skip flash_attn_varlen during profiling — use Q-tiling fallback project6-dev 2026-08-13 14:41:40 +00:00
  • 4518a39d12 fix: restore LD_PRELOAD libcccl_allocator.so — verified compiles in docker build project6-dev 2026-08-13 14:13:19 +00:00
  • 8c8c0286c9 Revert "fix(build): revert patch_ops.sh to a3c45d3b — remove cccl_preload + corex extension compile steps" project6-dev 2026-08-13 13:56:13 +00:00
  • 14d1725cdd fix(build): revert patch_ops.sh to a3c45d3b — remove cccl_preload + corex extension compile steps project6-dev 2026-08-13 13:53:21 +00:00
  • 09d92dce5d fix(build): remove 1106 extra CCCL headers — keep only 288 needed by allocator project6-dev 2026-08-13 13:40:17 +00:00
  • 5ec60dc574 fix(build): remove --num-gpu-blocks-override — may fail platform yaml validation project6-dev 2026-08-13 13:34:27 +00:00
  • 71644e1530 fix: num-gpu-blocks-override 4000→5500 — 4000 blocks can't fit a 70K prompt project6-dev 2026-08-13 13:25:23 +00:00
  • cf7824313f fix(OOM): add --num-gpu-blocks-override=4000 to skip profiling project6-dev 2026-08-13 13:24:36 +00:00
  • 8d2f30f065 fix(critical): remove LD_PRELOAD libcccl_allocator.so — crashes service if .so missing Claude 2026-08-13 13:15:13 +00:00
  • 451bdc8204 fix: lower gpu-memory-utilization to 0.85 — prevent profiling OOM Claude 2026-08-13 12:38:42 +00:00
  • 6092edebde fix: import torch.utils.cpp_extension explicitly in build script project6-dev 2026-08-13 11:37:10 +00:00
  • f6cf9d662e fix(CCCL): split compilation to isolate CCCL headers from torch/corex project6-dev 2026-08-13 11:35:43 +00:00
  • 05706f0d60 fix(build): use block-level CUB only — device-level API conflicts with corex CUDA 10.2 project6-dev 2026-08-13 11:25:37 +00:00
  • daa8067080 fix: remove expandable_segments:True from PYTORCH_CUDA_ALLOC_CONF Claude 2026-08-13 11:22:32 +00:00
  • 4c365b8c03 feat(CCCL): device-level CUB algorithms for MoE dispatch project6-dev 2026-08-13 11:18:52 +00:00
  • 7ba97f7977 fix: relax .dockerignore — remove *.txt *.md *.json wildcards that may break build Claude 2026-08-13 10:46:31 +00:00
  • 45161610f0 fix: thread_local reentrant guard — prevent cudaMalloc infinite recursion Claude 2026-08-13 10:37:32 +00:00
  • 3ce5bff10f fix: use cccl_preload::cub namespace — CUB_WRAPPED_NAMESPACE requires it Claude 2026-08-13 10:36:27 +00:00
  • c1e23615b5 fix: remove CUB_WRAPPED_NAMESPACE and _CCCL_COMPILER_GCC from build flags Claude 2026-08-13 10:35:11 +00:00
  • 32325f9624 build: wire CCCL preload into competition pipeline dylanyunlon 2026-08-13 10:31:17 +00:00
  • 3af2a32eb5 fix: verify_submission.sh — strip semicolons from path extraction grep Claude 2026-08-13 10:21:23 +00:00
  • 9ef5af3bda fix: wire CCCL preload into build+launch chain + pre-submission verification Claude 2026-08-13 10:00:26 +00:00
  • a6b5891bfc feat: CCCL CachingDeviceAllocator preload — 完整依赖链 288 files dylanyunlon 2026-08-13 09:24:42 +00:00
  • 8dc6462a2b feat: CCCL CachingDeviceAllocator LD_PRELOAD — bypass CoreX expandable_segments ASSERT dylanyunlon 2026-08-13 09:21:57 +00:00
  • 887e0981ad fix: remove expandable_segments — CoreX CUDACachingAllocator不支持 dylanyunlon 2026-08-13 09:08:47 +00:00
  • 9cfc6c72c0 feat(CCCL): LD_PRELOAD CachingDeviceAllocator — intercept cudaMalloc/cudaFree Claude 2026-08-13 09:21:45 +00:00
  • ca42633148 build: trigger rebuild after merge reconciliation root 2026-08-13 08:46:38 +00:00
  • 7e4e04b7c6 build: trigger rebuild after merge reconciliation root 2026-08-13 08:46:38 +00:00
  • 089e810984 feat: CCCL CachingDeviceAllocator preload — 完整依赖链 288 files dylanyunlon 2026-08-13 09:24:42 +00:00
  • e7c703ef94 feat: CCCL CachingDeviceAllocator LD_PRELOAD — bypass CoreX expandable_segments ASSERT dylanyunlon 2026-08-13 09:21:57 +00:00
  • c1e7065076 fix: remove expandable_segments — CoreX CUDACachingAllocator不支持 dylanyunlon 2026-08-13 09:08:47 +00:00
  • 1ea2100cb8 feat(CCCL): LD_PRELOAD CachingDeviceAllocator — intercept cudaMalloc/cudaFree Claude 2026-08-13 09:21:45 +00:00
  • abbc13c4d5 build: trigger rebuild after merge reconciliation root 2026-08-13 08:46:38 +00:00
  • a8304bf906 build: trigger rebuild after merge reconciliation root 2026-08-13 08:46:38 +00:00
  • ddfd24da27 fix: sync to real-machine verified version — ALL TESTS PASSED dylanyunlon 2026-08-13 09:52:15 +00:00
  • 93e498197a fix: thread_local reentrant guard — prevent cudaMalloc infinite recursion dylanyunlon 2026-08-13 09:42:26 +00:00
  • 0ac118911d fix: CUB_NS_QUALIFIER for wrapped namespace + drop _CCCL_COMPILER_GCC dylanyunlon 2026-08-13 09:31:45 +00:00
  • 8d6f9eaeb0 feat: CCCL CachingDeviceAllocator preload — 完整依赖链 288 files dylanyunlon 2026-08-13 09:24:42 +00:00
  • 967d572073 feat: CCCL CachingDeviceAllocator LD_PRELOAD — bypass CoreX expandable_segments ASSERT dylanyunlon 2026-08-13 09:21:57 +00:00
  • 502ea2fc96 fix: remove expandable_segments — CoreX CUDACachingAllocator不支持 dylanyunlon 2026-08-13 09:08:47 +00:00
  • 327c2c9044 feat(CCCL): LD_PRELOAD CachingDeviceAllocator — intercept cudaMalloc/cudaFree Claude 2026-08-13 09:21:45 +00:00
  • a1ae6e366f merge: reconcile squashed commit with modelhub history project6-dev 2026-08-13 07:10:03 +00:00
  • d2b4df54ff perf: native ixformer decode — v1 ≤32K, v2 >32K (no Python fallback) project6-dev 2026-08-13 07:09:50 +00:00
  • f28223c9da perf: native ixformer decode (v1 ≤32K, v2 >32K) + flash_attn_varlen prefill project6-dev 2026-08-13 07:04:21 +00:00
  • e78fa560c8 feat: wire corex_gdn_chunk_recurrent C++ kernel into GDN prefill path Claude 2026-08-13 06:25:09 +00:00
  • c720cbc3a3 docs: dlopen SO开发计划 — gap analysis from comp168 log + real tree Claude 2026-08-13 06:23:59 +00:00
  • 17fdf7e2d6 diag: probe KV cache layout with 5D key + 4D value project6-dev 2026-08-13 05:22:05 +00:00
  • cb03fc9993 diag: cat ixformer vllm.py source project6-dev 2026-08-13 05:20:01 +00:00
  • b0ed88e114 diag: probe ixformer KV cache 5D layout + read vllm.py source project6-dev 2026-08-13 05:18:50 +00:00
  • a8f0332e1c diag: verify_paged_attn.py — test ixformer paged attention v1/v2 with head_dim=256 project6-dev 2026-08-13 05:16:25 +00:00
  • ce568f94ed diag: probe ixformer paged attention signature project6-dev 2026-08-13 05:14:31 +00:00
  • ad6863ed84 perf: replace Python Q-tiling fallback with ixformer.flash_attn_varlen_func project6-dev 2026-08-13 05:14:08 +00:00
  • 9f02200ede diag: verify_flash_attn.py — test flash_attn_func correctness + perf for head_dim=256 project6-dev 2026-08-13 04:29:49 +00:00
  • 9c97a24edf diag: verify_ixformer_attn.py — test ixformer native attention with head_dim=256 project6-dev 2026-08-13 04:25:09 +00:00
  • 1aa2262a2c diag: test_triton.py — check if Triton works on BI-V100 project6-dev 2026-08-13 04:18:15 +00:00
  • a3f223ae45 fix: correct module name in debug_gdn_nan.py project6-dev 2026-08-13 04:13:33 +00:00
  • a617b743a3 diag: debug_gdn_nan.py — isolate NaN source in C++ chunk GDN project6-dev 2026-08-13 04:10:31 +00:00
  • 0861de65d0 feat: C++ GDN chunk+recurrent from xllm upstream + verification script project6-dev 2026-08-13 04:01:59 +00:00
  • 6f7d25f26d fix: add .dockerignore (exclude __pycache__) + e2e MoE verification script project6-dev 2026-08-13 03:55:49 +00:00
  • 796b09952c feat: integrate moe_compute_index kernel into MoE prefill path project6-dev 2026-08-13 03:52:35 +00:00
  • 71d39a1c7e feat: moe_compute_index + moe_combine_result CUDA kernels from xllm upstream project6-dev 2026-08-13 03:48:12 +00:00
  • 3045f29814 fix: enable corex topk_softmax kernel — verified correct on real BI-V100 project6-dev 2026-08-13 03:45:45 +00:00
  • fc7a089334 diag: verify_topk_softmax.py — test kernel vs PyTorch on real BI-V100 project6-dev 2026-08-13 03:25:43 +00:00
  • 0b0c47fddd fix(critical): fold max_completion_tokens + max_num_seqs=2 + max_model_len=80000 + xllm_latest layer import project6-dev 2026-08-13 03:19:39 +00:00
  • a3c45d3b36 fix(build): match project_7 proven Dockerfile — remove ENV lines + .dockerignore project6-dev 2026-08-13 02:48:28 +00:00
  • 5a05d4528c fix(stability): prevent OOM crash + disable garbled topk_softmax kernel project6-dev 2026-08-13 02:35:50 +00:00
  • 5696de5317 update sub 655 root 2026-08-13 02:29:40 +00:00
  • 544e255ec0 fix: copy_blocks use vllm_copy_cache project6-dev 2026-08-13 02:18:27 +00:00
  • 60e0b9da87 Revert "fix(precision): guard all corex .so outputs with nan_to_num + reduce max-model-len" project6-dev 2026-08-13 02:17:35 +00:00
  • 8acc47129b fix(precision): guard all corex .so outputs with nan_to_num + reduce max-model-len project6-dev 2026-08-13 02:12:16 +00:00
  • 8abc7cb0d7 diag: verify_so_loading.py — check all 13 prebuilt .so + base image dlopen chain Claude 2026-08-13 01:45:36 +00:00
  • 5769737264 fix(build): restore ENV lines — python3/vllm/torch require PATH+PYTHONPATH+LD_LIBRARY_PATH project6-dev 2026-08-13 01:28:28 +00:00
  • 2ac877cee4 fix: remove ENV lines — match project_7 proven Dockerfile project6-dev 2026-08-12 15:43:49 +00:00
  • 07e8681e2e fix: topk_softmax .so + fp32 router + enforce_eager + comp168 params project6-dev 2026-08-12 11:14:01 +00:00
  • a72877a509 fix(build): restore proven Dockerfile RUN format + keep wudixzy ENV project6-dev 2026-08-12 04:39:24 +00:00
  • 945bd1fca1 fix: mkdir -p → mkdir (match wudixzy Dockerfile exactly) project6-dev 2026-08-12 04:27:35 +00:00
  • a33060bc5e fix: align Dockerfile + yaml with wudixzy/competition upstream project6-dev 2026-08-12 04:26:09 +00:00
  • d025b08a95 upstream(xllm): sync to jd-opensource/xllm latest + revert serving_chat.py project6-dev 2026-08-12 04:22:34 +00:00
  • 6dcf3590d5 fix: cap default_max_tokens at 8192 — prevent OOM kill on unlimited generation project6-dev 2026-08-12 04:06:24 +00:00
  • 06828a459d fix: max-num-seqs=2 — t2_n_2测试需要n=2多路生成 project6-dev 2026-08-12 03:58:22 +00:00
  • 5b8c08ddfa fix(build): whitelist .dockerignore — only send Dockerfile + computility-run.yaml + qwen3_6_scripts/ project6-dev 2026-08-12 03:42:04 +00:00
  • 8030a11b96 feat: 替换为 project_7 验证通过的 wudixzy stack project6-dev 2026-08-12 03:31:05 +00:00
  • 2893a8e132 diag: comp 168 完整分析 + verify_deployment.sh project6-dev 2026-08-11 03:44:48 +00:00
  • d8ef8acc54 fix: exclude ex_engine from docker context root 2026-08-12 01:52:12 +00:00
  • 90c235a0fb fix(build): 回退到comp168(2d5232c)——唯一确认docker build成功的版本 Claude 2026-08-12 01:39:01 +00:00