16981f221e7008bff44a6c81b4636afd947b3ffe
From 1KB/55 lines (46× compression vs CCCL 70KB) to 203 lines: - Add 11 type specialization structs (key=1,2,4,8 × accum=1,2,4,8) - SM=16 tile maximization: k4_a4 hot path 100% SMEM (256*24*8=49152) - k8_a8 also at 100% SMEM (192*16*16=49152) - Delay halved for L2=6MB across all branches - CCCL-matching ReduceByKeyPolicy struct with ReduceByKeyAlgorithm enum - Dynamic SMEM fallback for unknown pair sizes
project_6
Description
Languages
C++
41.8%
Cuda
31.6%
Python
22.2%
C
2.1%
CMake
1.1%
Other
1.1%