mirror of
https://github.com/LostRuins/koboldcpp.git
synced 2026-08-25 22:21:14 +02:00
bump defaults, updated lite, fixed glm4.7 autoguess template
This commit is contained in:
+28
-2
@@ -12,7 +12,7 @@ Current version indicated by LITEVER below.
|
||||
-->
|
||||
<head>
|
||||
<script id="init-config">
|
||||
const LITEVER = 314;
|
||||
const LITEVER = 315;
|
||||
const urlParams = new URLSearchParams(window.location.search);
|
||||
var localflag = urlParams.get('local'); //this will be replaced automatically in embedded kcpp
|
||||
const STORAGE_PREFIX = (localflag?"e_":"")+"kaihordewebui_";
|
||||
@@ -4499,7 +4499,7 @@ Current version indicated by LITEVER below.
|
||||
second_ep_url:"",
|
||||
|
||||
max_context_length: (localflag?8192:3800),
|
||||
max_length: (localflag?896:460),
|
||||
max_length: (localflag?1024:500),
|
||||
last_maxctx: 0,
|
||||
auto_ctxlen: true,
|
||||
auto_genamt: true,
|
||||
@@ -5819,6 +5819,16 @@ Current version indicated by LITEVER below.
|
||||
const safeStop = escapeRegExp(localsettings.stop_thinking_tag);
|
||||
return `${safeStart}([\\s\\S]*?)${safeStop}`;
|
||||
}
|
||||
function get_orphaned_thinking_regex()
|
||||
{
|
||||
if(!localsettings.start_thinking_tag || !localsettings.stop_thinking_tag)
|
||||
{
|
||||
return "";
|
||||
}
|
||||
const safeStart = escapeRegExp(get_instructendplaceholder());
|
||||
const safeStop = escapeRegExp(localsettings.stop_thinking_tag);
|
||||
return `${safeStart}([\\s\\S]*?)${safeStop}`;
|
||||
}
|
||||
|
||||
function remove_all_instruct_tags(text)
|
||||
{
|
||||
@@ -19498,6 +19508,14 @@ Current version indicated by LITEVER below.
|
||||
{
|
||||
let pat = new RegExp(get_thinking_regex(), "gm");
|
||||
truncated_context = truncated_context.replace(pat, "");
|
||||
|
||||
//fallback, check for orphaned think tags and remove those as well
|
||||
if(localsettings.opmode==4 && localsettings.stop_thinking_tag && truncated_context.includes(localsettings.stop_thinking_tag))
|
||||
{
|
||||
let endmatcher = get_instructendplaceholder();
|
||||
let pat = new RegExp(get_orphaned_thinking_regex(), "gm");
|
||||
truncated_context = truncated_context.replace(pat, endmatcher);
|
||||
}
|
||||
}
|
||||
else if(localsettings.strip_thinking_mode==1) //strip except recent
|
||||
{
|
||||
@@ -19508,6 +19526,14 @@ Current version indicated by LITEVER below.
|
||||
let afterPart = truncated_context.slice(lastInstructIdx);
|
||||
let pat = new RegExp(get_thinking_regex(), "gm"); // Remove all thinking before splitpoint
|
||||
beforePart = beforePart.replace(pat, "");
|
||||
|
||||
//fallback, check for orphaned think tags and remove those as well
|
||||
if(localsettings.opmode==4 && localsettings.stop_thinking_tag && beforePart.includes(localsettings.stop_thinking_tag))
|
||||
{
|
||||
let pat = new RegExp(get_orphaned_thinking_regex(), "gm");
|
||||
beforePart = beforePart.replace(pat, endmatcher);
|
||||
}
|
||||
|
||||
truncated_context = beforePart + afterPart; // Combine and done
|
||||
}
|
||||
}
|
||||
|
||||
@@ -132,6 +132,17 @@
|
||||
"assistant_gen": "[/INST]",
|
||||
"assistant_end": "</s>"
|
||||
}
|
||||
}, {
|
||||
"search": ["[gMASK]<sop>","content.split('</think>')"],
|
||||
"name": "GLM-4.7",
|
||||
"adapter": {
|
||||
"system_start": "<|system|>\n",
|
||||
"system_end": "",
|
||||
"user_start": "<|user|>\n",
|
||||
"user_end": "",
|
||||
"assistant_start": "<|assistant|>\n<think>",
|
||||
"assistant_end": ""
|
||||
}
|
||||
}, {
|
||||
"search": ["[gMASK]<sop>"],
|
||||
"name": "GLM-4",
|
||||
|
||||
+5
-4
@@ -57,6 +57,7 @@ savestate_limit_default = 5
|
||||
savestate_limit = 0 #savestate slots start at 0, only set when load model
|
||||
default_vae_tile_threshold = 768
|
||||
default_native_ctx = 16384
|
||||
default_genlen = 1024
|
||||
overridekv_max = 4
|
||||
default_autofit_padding = 1024
|
||||
lora_filenames_max = 4
|
||||
@@ -69,7 +70,7 @@ dry_seq_break_max = 128
|
||||
extra_images_max = 4 # for kontext/qwen img
|
||||
|
||||
# global vars
|
||||
KcppVersion = "1.108.2"
|
||||
KcppVersion = "1.109"
|
||||
showdebug = True
|
||||
kcpp_instance = None #global running instance
|
||||
global_memory = {"tunnel_url": "", "restart_target":"", "input_to_exit":False, "load_complete":False, "restart_override_config_target":""}
|
||||
@@ -5587,7 +5588,7 @@ def show_gui():
|
||||
jinja_tools_var = ctk.IntVar(value=0)
|
||||
moeexperts_var = ctk.StringVar(value=str(-1))
|
||||
moecpu_var = ctk.StringVar(value=str(0))
|
||||
defaultgenamt_var = ctk.StringVar(value=str(896))
|
||||
defaultgenamt_var = ctk.StringVar(value=str(default_genlen))
|
||||
genlimit_var = ctk.StringVar(value=str(0))
|
||||
nobostoken_var = ctk.IntVar(value=0)
|
||||
override_kv_var = ctk.StringVar(value="")
|
||||
@@ -6647,7 +6648,7 @@ def show_gui():
|
||||
args.overridenativecontext = 0
|
||||
args.moeexperts = int(moeexperts_var.get()) if moeexperts_var.get()!="" else -1
|
||||
args.moecpu = int(moecpu_var.get()) if moecpu_var.get()!="" else 0
|
||||
args.defaultgenamt = int(defaultgenamt_var.get()) if defaultgenamt_var.get()!="" else 896
|
||||
args.defaultgenamt = int(defaultgenamt_var.get()) if defaultgenamt_var.get()!="" else default_genlen
|
||||
args.genlimit = int(genlimit_var.get()) if genlimit_var.get()!="" else 0
|
||||
args.nobostoken = (nobostoken_var.get()==1)
|
||||
args.jinja = (jinja_var.get()==1)
|
||||
@@ -9002,7 +9003,7 @@ if __name__ == '__main__':
|
||||
advparser.add_argument("--nomodel", help="Allows you to launch the GUI alone, without selecting any model.", action='store_true')
|
||||
advparser.add_argument("--moeexperts", metavar=('[num of experts]'), help="How many experts to use for MoE models (default=follow gguf)", type=int, default=-1)
|
||||
advparser.add_argument("--moecpu","--n-cpu-moe", "-ncmoe", metavar=('[layers affected]'), help="Keep the Mixture of Experts (MoE) weights of the first N layers in the CPU. If no value is provided, applies to all layers.", nargs='?', const=999, type=int, default=0)
|
||||
advparser.add_argument("--defaultgenamt", help="How many tokens to generate by default, if not specified. Must be smaller than context size. Usually, your frontend GUI will override this.", type=check_range(int,64,8192), default=896)
|
||||
advparser.add_argument("--defaultgenamt", help="How many tokens to generate by default, if not specified. Must be smaller than context size. Usually, your frontend GUI will override this.", type=check_range(int,64,8192), default=default_genlen)
|
||||
advparser.add_argument("--nobostoken", help="Prevents BOS token from being added at the start of any prompt. Usually NOT recommended for most models.", action='store_true')
|
||||
advparser.add_argument("--enableguidance", help="Enables the use of Classifier-Free-Guidance, which allows the use of negative prompts. Has performance and memory impact.", action='store_true')
|
||||
advparser.add_argument("--maxrequestsize", metavar=('[size in MB]'), help="Specify a max request payload size. Any requests to the server larger than this size will be dropped. Do not change if unsure.", type=int, default=32)
|
||||
|
||||
Reference in New Issue
Block a user