From a7a4e238fbbc2671eabc267c74b748da1405b767 Mon Sep 17 00:00:00 2001 From: Concedo <39025047+LostRuins@users.noreply.github.com> Date: Wed, 26 Jun 2024 13:38:59 +0800 Subject: [PATCH] i hate doing this --- CMakeLists.txt | 7 ++++--- ggml-cuda/mmq.cu | 5 ----- 2 files changed, 4 insertions(+), 8 deletions(-) diff --git a/CMakeLists.txt b/CMakeLists.txt index 6ede7ca40..44bf32571 100644 --- a/CMakeLists.txt +++ b/CMakeLists.txt @@ -126,14 +126,15 @@ if (LLAMA_CUBLAS) # 60 == f16 CUDA intrinsics # 61 == integer CUDA intrinsics # 70 == (assumed) compute capability at which unrolling a loop in mul_mat_q kernels is faster + # 75 == int8 tensor cores if (LLAMA_CUDA_F16 OR LLAMA_CUDA_DMMV_F16) - set(CMAKE_CUDA_ARCHITECTURES "60;61;70") # needed for f16 CUDA intrinsics + set(CMAKE_CUDA_ARCHITECTURES "60;61;70;75") # needed for f16 CUDA intrinsics else() message("CUDA Toolkit Version: ${CUDAToolkit_VERSION}") if(CUDAToolkit_VERSION VERSION_GREATER 12) - set(CMAKE_CUDA_ARCHITECTURES "52;61;70") # lowest CUDA 12 standard + lowest for integer intrinsics + set(CMAKE_CUDA_ARCHITECTURES "52;61;70;75") # lowest CUDA 12 standard + lowest for integer intrinsics else() - set(CMAKE_CUDA_ARCHITECTURES "37;52;61;70") # lowest CUDA 12 standard + lowest for integer intrinsics + set(CMAKE_CUDA_ARCHITECTURES "37;52;61;70;75") # lowest CUDA 12 standard + lowest for integer intrinsics endif() endif() endif() diff --git a/ggml-cuda/mmq.cu b/ggml-cuda/mmq.cu index b45d1a6b2..7d951035a 100644 --- a/ggml-cuda/mmq.cu +++ b/ggml-cuda/mmq.cu @@ -108,11 +108,6 @@ bool ggml_cuda_should_use_mmq(enum ggml_type type, int cc, int64_t ne11) { return false; } - if(g_mul_mat_q) - { - return true; - } - if (cc < CC_OFFSET_AMD) { return cc < CC_VOLTA || ne11 < MMQ_DP4A_MAX_BATCH_SIZE; }