diff --git a/gpttype_adapter.cpp b/gpttype_adapter.cpp index fdd85b42b..baf861799 100644 --- a/gpttype_adapter.cpp +++ b/gpttype_adapter.cpp @@ -3274,7 +3274,7 @@ ModelLoadResult gpttype_load_model(const load_model_inputs inputs, FileFormat in // Match llama-server's target rollback slots for speculative verification. llama_ctx_params.n_rs_seq = inputs.draft_amount; } - model_params.load_mode = inputs.use_mlock ? LLAMA_LOAD_MODE_MLOCK : (inputs.use_mmap ? LLAMA_LOAD_MODE_MMAP : LLAMA_LOAD_MODE_NONE); + model_params.load_mode = inputs.use_mlock ? (inputs.use_mmap ? LLAMA_LOAD_MODE_MMAP_MLOCK : LLAMA_LOAD_MODE_MLOCK) : (inputs.use_mmap ? LLAMA_LOAD_MODE_MMAP : LLAMA_LOAD_MODE_NONE); model_params.n_gpu_layers = inputs.gpulayers; model_params.no_host = inputs.no_host; model_params.load_mtp = inputs.use_mtp;