llama.cpp/ggml-cuda/fattn-common.cuh at 0d26d8ccd8caebab75af697c0275f599075fdacf

mirror of https://github.com/ggml-org/llama.cpp.git synced 2025-11-12 10:47:01 +00:00

Files

Johannes Gäßler dc685be466 CUDA: add FP32 FlashAttention vector kernel (#7188 )

* CUDA: add FP32 FlashAttention vector kernel

* fixup! CUDA: add FP32 FlashAttention vector kernel

* fixup! fixup! CUDA: add FP32 FlashAttention vector kernel

* fixup! fixup! fixup! CUDA: add FP32 FlashAttention vector kernel

2024-05-12 19:40:45 +02:00

1.8 KiB

Raw Blame History

View Raw

1.8 KiB Raw Blame History

1.8 KiB

Raw Blame History