thrust basic_vector.cu: device→host copy is batched (D = H, one memcpy).
Our MoE segment loop did int() per iteration — N separate GPU→CPU syncs.
Fix: .tolist() does ONE sync for all segment boundaries.
Maps to: qwen3_6_scripts/qwen3_5.py (_pure_pytorch_experts prefill path)