diff --git a/tools/server/server-models.cpp b/tools/server/server-models.cpp index 9d6b68b8e4..93e940951e 100644 --- a/tools/server/server-models.cpp +++ b/tools/server/server-models.cpp @@ -70,8 +70,8 @@ struct server_subproc { } }; -struct lru_sched { - lru_sched(server_models & models) : models(models) {} +struct server_lru_sched { + server_lru_sched(server_models & models) : models(models) {} bool has_capacity(std::unique_lock & lk) { check_lock(lk); @@ -412,7 +412,7 @@ server_models::server_models( base_params(params), base_env(get_environment()), base_preset(ctx_preset.load_from_args(argc, argv)), - sched(std::make_unique(*this)) { + sched(std::make_unique(*this)) { // clean up base preset unset_reserved_args(base_preset, true); // set binary path @@ -424,7 +424,7 @@ server_models::server_models( LOG_WRN("using original argv[0] as fallback: %s\n", argv[0]); } load_models(); - debug_fake_timing = !common_get_env("LLAMA_DEBUG_FAKE_TIMING").empty(); + debug_fake_timing = !common_get_env("LLAMA_SERVER_DEBUG_FAKE_TIMING").empty(); } server_models::~server_models() = default; diff --git a/tools/server/server-models.h b/tools/server/server-models.h index bd45f165ca..615acb577b 100644 --- a/tools/server/server-models.h +++ b/tools/server/server-models.h @@ -106,12 +106,12 @@ struct server_model_meta { }; struct server_models_routes; -struct server_subproc; // defined in server-models.cpp -struct lru_sched; // defined in server-models.cpp +struct server_subproc; // defined in server-models.cpp +struct server_lru_sched; // defined in server-models.cpp struct server_models { friend struct server_models_routes; - friend struct lru_sched; + friend struct server_lru_sched; private: struct instance_t { @@ -198,7 +198,7 @@ private: common_preset base_preset; // base preset from llama-server CLI args // queue of requests waiting for a models_max slot - std::unique_ptr sched; + std::unique_ptr sched; // if true, add some delay to simulate works (useful for testing) bool debug_fake_timing = false; diff --git a/tools/server/tests/unit/test_router.py b/tools/server/tests/unit/test_router.py index 34b4ddb71c..c503ee3420 100644 --- a/tools/server/tests/unit/test_router.py +++ b/tools/server/tests/unit/test_router.py @@ -145,7 +145,7 @@ def test_router_models_max_evicts_lru(): assert _get_model_status(first) == "unloaded" -# lru_sched tests (relying on LLAMA_DEBUG_FAKE_TIMING) +# server_lru_sched tests (relying on LLAMA_SERVER_DEBUG_FAKE_TIMING) MODEL_A = "ggml-org/tinygemma3-GGUF:Q8_0" MODEL_B = "ggml-org/test-model-stories260K:F32" diff --git a/tools/server/tests/utils.py b/tools/server/tests/utils.py index 9d9e300a7d..8f3a986424 100644 --- a/tools/server/tests/utils.py +++ b/tools/server/tests/utils.py @@ -134,7 +134,7 @@ class ServerProcess: def start(self, timeout_seconds: int = DEFAULT_HTTP_TIMEOUT) -> None: env = { **os.environ, - "LLAMA_DEBUG_FAKE_TIMING": "1", + "LLAMA_SERVER_DEBUG_FAKE_TIMING": "1", } if "LLAMA_CACHE" not in os.environ: env["LLAMA_CACHE"] = "tmp"