llama.cpp/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_1.cu at da799b41891e34aac86ce4e173f9c4c0afd4fab3

mirror of https://github.com/ggml-org/llama.cpp.git synced 2025-11-02 09:12:03 +00:00

Files

Johannes Gäßler 7d1a378b8f CUDA: refactor mmq, dmmv, mmvq (#7716 )

* CUDA: refactor mmq, dmmv, mmvq

* fix out-of-bounds write

* struct for qk, qr, qi

* fix cmake build

* mmq_type_traits

2024-06-05 16:53:00 +02:00

View Raw