CCCL (CUDA C++ Core Libraries) provides: - CUB: device/block/warp-level GPU primitives (reduce, scan, sort, topk) - Thrust: high-level parallel algorithms (transform_reduce, sort, scan) - libcudacxx: CUDA C++ standard library (atomics, barriers, memory) - cudax: experimental features (memory resources, allocators) - Tuning policies: per-SM hardware-specific algorithm parameters Competition optimization vectors mapped to CCCL: - Output TPS (83% weight): warp_reduce, block_reduce, device_topk - Input TPS (14% weight): device_scan, block_load, prefetch - Cache TPS (3% weight): prefix caching strategy patterns - Memory (0.9 util): pooled/cached/buddy allocators Source: https://github.com/NVIDIA/cccl (shallow clone, HEAD only) License: Apache-2.0
30 lines
899 B
Plaintext
30 lines
899 B
Plaintext
CHECK: data series: [ 0 0 6 9 10 2 5 4 2 8 0 6 6 8 6 5 9 10 7 10 3 4 9 7 9 10 1 9 9 3 ]
|
|
CHECK-NEXT: simple moving averages (window = 4)
|
|
CHECK-NEXT: [ 0, 4) = 3.75
|
|
CHECK-NEXT: [ 1, 5) = 6.25
|
|
CHECK-NEXT: [ 2, 6) = 6.75
|
|
CHECK-NEXT: [ 3, 7) = 6.5
|
|
CHECK-NEXT: [ 4, 8) = 5.25
|
|
CHECK-NEXT: [ 5, 9) = 3.25
|
|
CHECK-NEXT: [ 6,10) = 4.75
|
|
CHECK-NEXT: [ 7,11) = 3.5
|
|
CHECK-NEXT: [ 8,12) = 4
|
|
CHECK-NEXT: [ 9,13) = 5
|
|
CHECK-NEXT: [10,14) = 5
|
|
CHECK-NEXT: [11,15) = 6.5
|
|
CHECK-NEXT: [12,16) = 6.25
|
|
CHECK-NEXT: [13,17) = 7
|
|
CHECK-NEXT: [14,18) = 7.5
|
|
CHECK-NEXT: [15,19) = 7.75
|
|
CHECK-NEXT: [16,20) = 9
|
|
CHECK-NEXT: [17,21) = 7.5
|
|
CHECK-NEXT: [18,22) = 6
|
|
CHECK-NEXT: [19,23) = 6.5
|
|
CHECK-NEXT: [20,24) = 5.75
|
|
CHECK-NEXT: [21,25) = 7.25
|
|
CHECK-NEXT: [22,26) = 8.75
|
|
CHECK-NEXT: [23,27) = 6.75
|
|
CHECK-NEXT: [24,28) = 7.25
|
|
CHECK-NEXT: [25,29) = 7.25
|
|
CHECK-NEXT: [26,30) = 5.5
|