SGEMM repos (upstream_ref/sgemm_cuda/, 41 files): siboehm/SGEMM_CUDA: kernel 1-12, runner, CMake, cuBLAS benchmark wangzyon/NVIDIA_SGEMM_PRACTICE: kernel 1-7 (Chinese comments), utils edtallison/sgemm-cuda: kernel 01-09 (learning notes), Makefile xllm kernels (ex_engine/xllm_kernels/cuda/): fused_qknorm_rope.cu + bind — saves 128 kernel launches/fwd xattention/ — 6 files from upstream xllm headers: corex_compat_utils.h, topk_last_dim.cuh ilu/CMakeLists.txt SO_BUILD_MANIFEST.md — complete .so inventory and call chain analysis
14 lines
572 B
Plaintext
14 lines
572 B
Plaintext
#pragma once
|
|
|
|
#include "kernels/10_kernel_warptiling.cuh"
|
|
#include "kernels/11_kernel_double_buffering.cuh"
|
|
#include "kernels/12_kernel_double_buffering.cuh"
|
|
#include "kernels/1_naive.cuh"
|
|
#include "kernels/2_kernel_global_mem_coalesce.cuh"
|
|
#include "kernels/3_kernel_shared_mem_blocking.cuh"
|
|
#include "kernels/4_kernel_1D_blocktiling.cuh"
|
|
#include "kernels/5_kernel_2D_blocktiling.cuh"
|
|
#include "kernels/6_kernel_vectorize.cuh"
|
|
#include "kernels/7_kernel_resolve_bank_conflicts.cuh"
|
|
#include "kernels/8_kernel_bank_extra_col.cuh"
|
|
#include "kernels/9_kernel_autotuned.cuh" |