From b7428048fce19c24fcaa387c74ace4f20eac4e05 Mon Sep 17 00:00:00 2001 From: Concedo <39025047+LostRuins@users.noreply.github.com> Date: Thu, 11 Dec 2025 14:30:38 +0800 Subject: [PATCH] try reduce pipeline parallelism in order to reduce compute buffer sizes --- ggml/src/ggml-backend.cpp | 3 ++- koboldcpp.py | 2 +- 2 files changed, 3 insertions(+), 2 deletions(-) diff --git a/ggml/src/ggml-backend.cpp b/ggml/src/ggml-backend.cpp index 8b90a7d1e..84041d00f 100644 --- a/ggml/src/ggml-backend.cpp +++ b/ggml/src/ggml-backend.cpp @@ -662,7 +662,8 @@ static bool ggml_is_view_op(enum ggml_op op) { #endif #ifndef GGML_SCHED_MAX_COPIES -#define GGML_SCHED_MAX_COPIES 4 +//kcpp reduced from 4 to 2 to try make buffer sizes smaller on multigpu +#define GGML_SCHED_MAX_COPIES 2 #endif struct ggml_backend_sched_split { diff --git a/koboldcpp.py b/koboldcpp.py index 1c1ce2eed..9d407a801 100755 --- a/koboldcpp.py +++ b/koboldcpp.py @@ -66,7 +66,7 @@ dry_seq_break_max = 128 extra_images_max = 4 # for kontext/qwen img # global vars -KcppVersion = "1.103" +KcppVersion = "1.104" showdebug = True kcpp_instance = None #global running instance global_memory = {"tunnel_url": "", "restart_target":"", "input_to_exit":False, "load_complete":False, "restart_override_config_target":""}