direct fix

tikikun · tikikun · commit 397b3cddd44b · 2024-02-23T13:23:57.000+07:00
diff --git a/controllers/llamaCPP.h b/controllers/llamaCPP.h
@@ -16,6 +16,7 @@
 #include "clip.h"
 #include "common.h"
 #include "llama.h"
+#include "llava.h"
 
 #include "stb_image.h"
 
@@ -1065,39 +1066,24 @@ struct llama_server_context {
 
     return slot.has_next_token; // continue
   }
-
   bool process_images(llama_client_slot &slot) const {
     for (slot_image &img : slot.images) {
       if (!img.request_encode_image) {
         continue;
       }
-      clip_image_f32 *img_res = clip_image_f32_init();
-      if (!clip_image_preprocess(clp_ctx, img.img_data, img_res,
-                                 /*pad2square =*/true)) {
+
+      if (!llava_image_embed_make_with_clip_img(
+              clp_ctx, params.n_threads, img.img_data, &img.image_embedding,
+              &img.image_tokens)) {
         LOG_TEE("Error processing the given image");
-        clip_free(clp_ctx);
-        return false;
-      }
-      img.image_tokens = clip_n_patches(clp_ctx);
-      img.image_embedding = (float *)malloc(clip_embd_nbytes(clp_ctx));
-      if (!img.image_embedding) {
-        LOG_TEE("Unable to allocate memory for image embeddings\n");
-        clip_free(clp_ctx);
         return false;
       }
-      LOG_TEE("slot %i - encoding image [id: %i]\n", slot.id, img.id);
-      if (!clip_image_encode(clp_ctx, params.n_threads, img_res,
-                             img.image_embedding)) {
-        LOG_TEE("Unable to encode image\n");
-        return false;
-      }
-      clip_image_f32_free(img_res);
+
       img.request_encode_image = false;
     }
 
     return slot.images.size() > 0;
   }
-
   void send_error(task_server &task, std::string error) {
     std::unique_lock<std::mutex> lock(mutex_results);
     task_result res;
@@ -2004,295 +1990,6 @@ static void server_print_usage(const char *argv0, const gpt_params &params,
          "group attention factor `--grp-attn-n`");
   printf("\n");
 }
-
-static void server_params_parse(int argc, char **argv, server_params &sparams,
-                                gpt_params &params,
-                                llama_server_context &llama) {
-  gpt_params default_params;
-  server_params default_sparams;
-  std::string arg;
-  bool invalid_param = false;
-
-  for (int i = 1; i < argc; i++) {
-    arg = argv[i];
-    if (arg == "--port") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      sparams.port = std::stoi(argv[i]);
-    } else if (arg == "--host") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      sparams.hostname = argv[i];
-    } else if (arg == "--path") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      sparams.public_path = argv[i];
-    } else if (arg == "--api-key") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      sparams.api_key = argv[i];
-    } else if (arg == "--timeout" || arg == "-to") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      sparams.read_timeout = std::stoi(argv[i]);
-      sparams.write_timeout = std::stoi(argv[i]);
-    } else if (arg == "-m" || arg == "--model") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.model = argv[i];
-    } else if (arg == "-a" || arg == "--alias") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.model_alias = argv[i];
-    } else if (arg == "-h" || arg == "--help") {
-      server_print_usage(argv[0], default_params, default_sparams);
-      exit(0);
-    } else if (arg == "-c" || arg == "--ctx-size" || arg == "--ctx_size") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.n_ctx = std::stoi(argv[i]);
-    } else if (arg == "--rope-scaling") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      std::string value(argv[i]);
-      /**/ if (value == "none") {
-        params.rope_scaling_type = LLAMA_ROPE_SCALING_NONE;
-      } else if (value == "linear") {
-        params.rope_scaling_type = LLAMA_ROPE_SCALING_LINEAR;
-      } else if (value == "yarn") {
-        params.rope_scaling_type = LLAMA_ROPE_SCALING_YARN;
-      } else {
-        invalid_param = true;
-        break;
-      }
-    } else if (arg == "--rope-freq-base") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.rope_freq_base = std::stof(argv[i]);
-    } else if (arg == "--rope-freq-scale") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.rope_freq_scale = std::stof(argv[i]);
-    } else if (arg == "--yarn-ext-factor") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.yarn_ext_factor = std::stof(argv[i]);
-    } else if (arg == "--yarn-attn-factor") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.yarn_attn_factor = std::stof(argv[i]);
-    } else if (arg == "--yarn-beta-fast") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.yarn_beta_fast = std::stof(argv[i]);
-    } else if (arg == "--yarn-beta-slow") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.yarn_beta_slow = std::stof(argv[i]);
-    } else if (arg == "--threads" || arg == "-t") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.n_threads = std::stoi(argv[i]);
-    } else if (arg == "--threads-batch" || arg == "-tb") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.n_threads_batch = std::stoi(argv[i]);
-    } else if (arg == "-b" || arg == "--batch-size") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.n_batch = std::stoi(argv[i]);
-      params.n_batch = std::min(512, params.n_batch);
-    } else if (arg == "--gpu-layers" || arg == "-ngl" ||
-               arg == "--n-gpu-layers") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      if (llama_supports_gpu_offload()) {
-        params.n_gpu_layers = std::stoi(argv[i]);
-      } else {
-        LOG_WARNING_LLAMA(
-            "Not compiled with GPU offload support, --n-gpu-layers option will "
-            "be ignored. "
-            "See main README.md for information on enabling GPU BLAS support",
-            {{"n_gpu_layers", params.n_gpu_layers}});
-      }
-    } else if (arg == "--tensor-split" || arg == "-ts") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-#ifdef GGML_USE_CUBLAS
-      std::string arg_next = argv[i];
-
-      // split string by , and /
-      const std::regex regex{R"([,/]+)"};
-      std::sregex_token_iterator it{arg_next.begin(), arg_next.end(), regex,
-                                    -1};
-      std::vector<std::string> split_arg{it, {}};
-      GGML_ASSERT(split_arg.size() <= llama_max_devices());
-
-      for (size_t i_device = 0; i_device < llama_max_devices(); ++i_device) {
-        if (i_device < split_arg.size()) {
-          params.tensor_split[i_device] = std::stof(split_arg[i_device]);
-        } else {
-          params.tensor_split[i_device] = 0.0f;
-        }
-      }
-#else
-      LOG_WARNING_LLAMA("llama.cpp was compiled without cuBLAS. It is not "
-                        "possible to set a tensor split.\n",
-                        {});
-#endif // GGML_USE_CUBLAS
-    } else if (arg == "--no-mul-mat-q" || arg == "-nommq") {
-#ifdef GGML_USE_CUBLAS
-      params.mul_mat_q = false;
-#else
-      LOG_WARNING_LLAMA("warning: llama.cpp was compiled without cuBLAS. "
-                        "Disabling mul_mat_q kernels has no effect.\n",
-                        {});
-#endif // GGML_USE_CUBLAS
-    } else if (arg == "--main-gpu" || arg == "-mg") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-#ifdef GGML_USE_CUBLAS
-      params.main_gpu = std::stoi(argv[i]);
-#else
-      LOG_WARNING_LLAMA("llama.cpp was compiled without cuBLAS. It is not "
-                        "possible to set a main GPU.",
-                        {});
-#endif
-    } else if (arg == "--lora") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.lora_adapter.push_back(std::make_tuple(argv[i], 1.0f));
-      params.use_mmap = false;
-    } else if (arg == "--lora-scaled") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      const char *lora_adapter = argv[i];
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.lora_adapter.push_back(
-          std::make_tuple(lora_adapter, std::stof(argv[i])));
-      params.use_mmap = false;
-    } else if (arg == "--lora-base") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.lora_base = argv[i];
-    } else if (arg == "-v" || arg == "--verbose") {
-#if SERVER_VERBOSE != 1
-      LOG_WARNING_LLAMA("server.cpp is not built with verbose logging.", {});
-#else
-      server_verbose = true;
-#endif
-    } else if (arg == "--mlock") {
-      params.use_mlock = true;
-    } else if (arg == "--no-mmap") {
-      params.use_mmap = false;
-    } else if (arg == "--numa") {
-      params.numa = true;
-    } else if (arg == "--embedding") {
-      params.embedding = true;
-    } else if (arg == "-cb" || arg == "--cont-batching") {
-      params.cont_batching = true;
-    } else if (arg == "-np" || arg == "--parallel") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.n_parallel = std::stoi(argv[i]);
-    } else if (arg == "-n" || arg == "--n-predict") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.n_predict = std::stoi(argv[i]);
-    } else if (arg == "-spf" || arg == "--system-prompt-file") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      std::ifstream file(argv[i]);
-      if (!file) {
-        fprintf(stderr, "error: failed to open file '%s'\n", argv[i]);
-        invalid_param = true;
-        break;
-      }
-      std::string systm_content;
-      std::copy(std::istreambuf_iterator<char>(file),
-                std::istreambuf_iterator<char>(),
-                std::back_inserter(systm_content));
-      llama.process_system_prompt_data(json::parse(systm_content));
-    } else if (arg == "--mmproj") {
-      if (++i >= argc) {
-        invalid_param = true;
-        break;
-      }
-      params.mmproj = argv[i];
-    } else if (arg == "--log-disable") {
-      log_set_target(stdout);
-      LOG_INFO_LLAMA("logging to file is disabled.", {});
-    } else {
-      fprintf(stderr, "error: unknown argument: %s\n", arg.c_str());
-      server_print_usage(argv[0], default_params, default_sparams);
-      exit(1);
-    }
-  }
-
-  if (invalid_param) {
-    fprintf(stderr, "error: invalid parameter for argument: %s\n", arg.c_str());
-    server_print_usage(argv[0], default_params, default_sparams);
-    exit(1);
-  }
-}
-
 static std::string random_string() {
   static const std::string str(
       "0123456789ABCDEFGHIJKLMNOPQRSTUVWXYZabcdefghijklmnopqrstuvwxyz");