diff --git a/src/llama-context.cpp b/src/llama-context.cpp index 17479166c..a293526b4 100644 --- a/src/llama-context.cpp +++ b/src/llama-context.cpp @@ -270,7 +270,7 @@ llama_context::llama_context( } } - if (!hparams.vocab_only) { + if (!hparams.vocab_only && memory) { llama_memory_context_ptr mctx; if (memory) { LLAMA_LOG_DEBUG("%s: reserving full memory module\n", __func__);