From 19064083bd3696682dbf886e23160f103137613e Mon Sep 17 00:00:00 2001 From: Concedo <39025047+LostRuins@users.noreply.github.com> Date: Tue, 23 Jun 2026 22:34:34 +0800 Subject: [PATCH] another fix for drafting --- gpttype_adapter.cpp | 5 +++++ 1 file changed, 5 insertions(+) diff --git a/gpttype_adapter.cpp b/gpttype_adapter.cpp index 245718c15..a355eddd7 100644 --- a/gpttype_adapter.cpp +++ b/gpttype_adapter.cpp @@ -2929,6 +2929,11 @@ ModelLoadResult gpttype_load_model(const load_model_inputs inputs, FileFormat in llama_ctx_params.offload_kqv = !inputs.low_vram; llama_ctx_params.kv_unified = true; + if((inputs.use_mtp || draftmodel_filename != "") && inputs.draft_amount > 0) + { + // Match llama-server's target rollback slots for speculative verification. + llama_ctx_params.n_rs_seq = inputs.draft_amount; + } model_params.use_mmap = inputs.use_mmap; model_params.use_mlock = inputs.use_mlock; model_params.use_direct_io = false; //no direct io for now until stable