From 1KB/55 lines (46× compression vs CCCL 70KB) to 203 lines: - Add 11 type specialization structs (key=1,2,4,8 × accum=1,2,4,8) - SM=16 tile maximization: k4_a4 hot path 100% SMEM (256*24*8=49152) - k8_a8 also at 100% SMEM (192*16*16=49152) - Delay halved for L2=6MB across all branches - CCCL-matching ReduceByKeyPolicy struct with ReduceByKeyAlgorithm enum - Dynamic SMEM fallback for unknown pair sizes