11a8f3832a79a68bb76268fafd146d379fa463d0
从upstream_ref/xllm/xllm/core/layers/common/qwen2_vision_attention.cpp搬运 CUDA路径的compute_qwen2_vision_attention_cuda实现: - 按cu_seqlens逐序列切分 - q.permute(1,0,2) → matmul(q*scale, k^T) → softmax → matmul(attn, v) - 不依赖einops、不依赖F.scaled_dot_product_attention - 和xllm系统设计完全一致
project_6
Description
Languages
C++
41.8%
Cuda
31.6%
Python
22.2%
C
2.1%
CMake
1.1%
Other
1.1%