| 14065 | // |
| 14066 | |
| 14067 | llama_model_params llama_model_default_params() { |
| 14068 | llama_model_params result = { |
| 14069 | /*.devices =*/ nullptr, |
| 14070 | /*.tensor_buft_overrides =*/ nullptr, |
| 14071 | /*.n_gpu_layers =*/ 0, |
| 14072 | /*.split_mode =*/ LLAMA_SPLIT_MODE_LAYER, |
| 14073 | /*.main_gpu =*/ 0, |
| 14074 | /*.tensor_split =*/ nullptr, |
| 14075 | /*.progress_callback =*/ nullptr, |
| 14076 | /*.progress_callback_user_data =*/ nullptr, |
| 14077 | /*.kv_overrides =*/ nullptr, |
| 14078 | /*.vocab_only =*/ false, |
| 14079 | /*.use_mmap =*/ true, |
| 14080 | /*.use_mlock =*/ false, |
| 14081 | /*.check_tensors =*/ false |
| 14082 | }; |
| 14083 | |
| 14084 | #ifdef GGML_USE_METAL |
| 14085 | // note: we usually have plenty of VRAM, so by default offload all layers to the GPU |
| 14086 | result.n_gpu_layers = 999; |
| 14087 | #endif |
| 14088 | |
| 14089 | return result; |
| 14090 | } |
| 14091 | |
| 14092 | const llama_vocab * llama_model_get_vocab(const llama_model * model) { |
| 14093 | return &model->vocab; |
no outgoing calls