32fdae237aee18593117179fac836c787111d237
thrust basic_vector.cu: device→host copy is batched (D = H, one memcpy). Our MoE segment loop did int() per iteration — N separate GPU→CPU syncs. Fix: .tolist() does ONE sync for all segment boundaries. Maps to: qwen3_6_scripts/qwen3_5.py (_pure_pytorch_experts prefill path)
project_6
Description
Languages
C++
41.8%
Cuda
31.6%
Python
22.2%
C
2.1%
CMake
1.1%
Other
1.1%