llama.cpp/ggml-cuda/fattn-vec-f16.cuh at b83bab15a5d2a1e7807d09613a9b34309d86cfaa - llama.cpp - Gitea - Peisong Xiao

CS348Project/llama.cpp

mirror of https://github.com/ggml-org/llama.cpp.git synced 2025-11-03 09:22:01 +00:00

Files

Johannes Gäßler dc685be466 CUDA: add FP32 FlashAttention vector kernel (#7188 )

* CUDA: add FP32 FlashAttention vector kernel

* fixup! CUDA: add FP32 FlashAttention vector kernel

* fixup! fixup! CUDA: add FP32 FlashAttention vector kernel

* fixup! fixup! fixup! CUDA: add FP32 FlashAttention vector kernel

2024-05-12 19:40:45 +02:00

6 lines

213 B

Plaintext

Raw Blame History

 #include "common.cuh"
 void ggml_cuda_flash_attn_ext_vec_f16(ggml_backend_cuda_context & ctx, ggml_tensor * dst);
 void ggml_cuda_flash_attn_ext_vec_f16_no_mma(ggml_backend_cuda_context & ctx, ggml_tensor * dst);