Files
project_6/upstream_ref
Claude 32ee28122e ref(upstream): 搬运 xllm ilu kernel+layer 完整源码 — 2089行 14个API声明
来源: Deep-Spark/xllm core/kernels/ilu/ + core/layers/ilu/
  ixformer.h: 14个ixformer::infer API完整声明
  kernel wrappers: activation(32) attention(162) fused_moe(99) group_gemm(39)
                   matmul(73) norm(50) rope(31) + headers
  layer dispatch: fused_moe.cpp(797行) attention.cpp(189行) + headers

覆盖状态 (ix_moe_bridge.cpp vs ixformer.h 14个API):
  已覆盖 13/14: silu_and_mul, rms_norm, residual_rms_norm, ixformer_linear,
    ixformer_linear_ex, topk_softmax, moe_compute_token_index, moe_expand_input,
    moe_w16a16_group_gemm, moe_output_reduce_sum, xllm_paged_attention,
    xllm_reshape_and_cache, xllm_rotary_embedding
  缺失 1/14: ixinfer_flash_attn_unpad_with_block_tables

dlopen 调用链验证:
  12个 prebuilt .so → 9个 qwen3_5.py + 2个 paged_attn.py + 1个 block_major_kv_cache.py
  辅助模块: bi100_env, bi100_profile, gdn_prefix, block_major_kv_cache 全部到位
2026-08-11 04:41:29 +00:00
..

Upstream Reference: Deep-Spark xllm + vllm (FULL TREE)

Source repos (cloned 2026-08-09, Apache 2.0):

  • Deep-Spark/xllm — Iluvatar official C++ LLM inference engine (1470 files)
  • Deep-Spark/vllm — Iluvatar official vllm fork (703 files, csrc + model layer)

What's here

xllm/ (complete source minus git/binaries/submodules)

天数智芯官方下一代推理引擎C++ 原生,多平台(CUDA/ILU/MLU/NPU)。 包含 kernels → layers → models → runtime → scheduler → api_service 完整栈。

Key subtrees:

  • xllm/core/kernels/ilu/ — ixformer API wrappers (ixformer.h是金矿)
  • xllm/core/kernels/cuda/moe/ — MoE CUDA kernels (topk_softmax, fused_topk)
  • xllm/core/kernels/cuda/ — activation, norm, rope, attention CUDA kernels
  • xllm/core/layers/ilu/ — Iluvatar FusedMoE完整pipeline
  • xllm/core/layers/npu_torch/ — GatedDeltaNet C++ implementation
  • xllm/models/llm/qwen3_5.h — Qwen3.5 model definition
  • xllm/compiler/tilelang/ — GDN kernel code generation

ds_vllm/ (csrc + model layers + fused_moe)

天数智芯官方vllm forkPython + CUDA torch extension。

  • csrc/ — ALL CUDA source (attention, moe, quantization, cache)
  • csrc/libtorch_stable/moe/topk_softmax_kernels.cu — vllm topk_softmax
  • vllm/_custom_ops.py — Python → torch.ops._moe_C bridge
  • vllm/model_executor/models/qwen3_5.py — ds_vllm的qwen3_5实现
  • vllm/model_executor/layers/fused_moe/ — vllm FusedMoE Python layer