mirror of
https://github.com/ggml-org/llama.cpp.git
synced 2026-09-19 17:24:57 +02:00
Add a numeric context parameter declaring the maximum outputs one sequence
This commit is contained in:
@@ -30,6 +30,7 @@ int main(int argc, char ** argv){
|
||||
const int n_draft = params.speculative.draft.n_max;
|
||||
|
||||
params.n_outputs_max = common_speculative_n_outputs_max(params.n_batch, params.n_parallel, n_draft);
|
||||
params.n_sampling_outputs_per_seq_max = common_speculative_n_outputs_per_seq_max(params.n_batch, n_draft);
|
||||
|
||||
// init llama.cpp
|
||||
llama_backend_init();
|
||||
|
||||
@@ -32,6 +32,8 @@ int main(int argc, char ** argv) {
|
||||
|
||||
params.n_outputs_max = common_speculative_n_outputs_max(
|
||||
params.n_batch, params.n_parallel, common_speculative_n_max(¶ms.speculative));
|
||||
params.n_sampling_outputs_per_seq_max = common_speculative_n_outputs_per_seq_max(
|
||||
params.n_batch, common_speculative_n_max(¶ms.speculative));
|
||||
|
||||
// init llama.cpp
|
||||
llama_backend_init();
|
||||
@@ -59,6 +61,9 @@ int main(int argc, char ** argv) {
|
||||
|
||||
auto params_dft = params;
|
||||
|
||||
params_dft.n_outputs_max = params.n_parallel;
|
||||
params_dft.n_sampling_outputs_per_seq_max = 1;
|
||||
|
||||
params_dft.devices = params_spec.devices;
|
||||
params_dft.model = params_spec.mparams;
|
||||
params_dft.n_gpu_layers = params_spec.n_gpu_layers;
|
||||
|
||||
@@ -60,6 +60,8 @@ int main(int argc, char ** argv) {
|
||||
|
||||
params.n_outputs_max = common_speculative_n_outputs_max(
|
||||
params.n_batch, params.n_parallel, params.speculative.draft.n_max);
|
||||
params.n_sampling_outputs_per_seq_max = common_speculative_n_outputs_per_seq_max(
|
||||
params.n_batch, params.speculative.draft.n_max);
|
||||
|
||||
// probability threshold for splitting a draft branch (only for n_seq_dft > 1)
|
||||
const float p_draft_split = params.speculative.draft.p_split;
|
||||
@@ -87,6 +89,8 @@ int main(int argc, char ** argv) {
|
||||
params.devices = params.speculative.draft.devices;
|
||||
params.model = params.speculative.draft.mparams;
|
||||
params.n_gpu_layers = params.speculative.draft.n_gpu_layers;
|
||||
params.n_outputs_max = params.n_parallel;
|
||||
params.n_sampling_outputs_per_seq_max = 1;
|
||||
if (params.speculative.draft.cpuparams.n_threads > 0) {
|
||||
params.cpuparams.n_threads = params.speculative.draft.cpuparams.n_threads;
|
||||
}
|
||||
|
||||
Reference in New Issue
Block a user