llama.cpp/tools/server/server.cpp at e0e806f52ebcd0ee285c994fe8fd8b8787d2cb0a

mirror of https://github.com/ggml-org/llama.cpp.git synced 2025-10-31 08:51:55 +00:00

Files

Georgi Gerganov 3637576288 server : disable speculative decoding for SWA models (#13970 )

* server : use swa-full fo draft context

ggml-ci

* server : disable speculative decoding for SWA models

2025-06-02 21:34:40 +03:00

View Raw