ddcfbad431065529b3ef0eaaa3eff74239f26d83
Based on verified result (issue #68): CUTLASS Cu10 TensorOp batched: 2.462ms (8 experts, 1 launch) vs 8× torch.matmul: 4.6ms (8 launches) vs Python F.linear loop: 10.36ms New files: ex_engine/xllm_kernels/cuda/bindings/corex_batched_gemm_bind.cpp pybind11 wrapper: batched_gemm_fp16() + moe_decode_fused() ex_engine/xllm_kernels/cuda/corex_batched_gemm_kernel.cu CUTLASS GemmBatched<half> kernel (from cat_files/batched_gemm.cu) qwen3_6_scripts/build_corex_batched_gemm.sh Build script for BI-V100 (ivcore10) Modified: qwen3_6_scripts/qwen3_5.py import corex_batched_gemm + _USE_COREX_BATCHED_GEMM flag Tier 1.5 in MoE decode: after corex_direct_routed, before corex_gather Build on device: bash qwen3_6_scripts/build_corex_batched_gemm.sh Output: prebuilt/corex-3.2.3-ivcore10/corex_batched_gemm.so
project_6
Description
Languages
C++
41.8%
Cuda
31.6%
Python
22.2%
C
2.1%
CMake
1.1%
Other
1.1%