Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/abetlen/llama-cpp-python
/ functions
Functions
1,336 in github.com/abetlen/llama-cpp-python
⨍
Functions
1,336
◇
Types & classes
256
↳
Endpoints
95
↓ 1 callers
Method
compatibility_key_for_model
(cls, model: "Model")
examples/server/server.py:12366
↓ 1 callers
Method
completion_finish_chunk
( self, request: CompletionRequest, completion: Completion, finish_reason: str
examples/server/server.py:10167
↓ 1 callers
Method
completion_request_from_chat_request
( self, body: CreateChatCompletionRequest, )
examples/server/server.py:8520
↓ 1 callers
Method
consume_completion_chunk
( self, text: str, *, chunk_id: str, created: int, model: str,
examples/server/server.py:7687
↓ 1 callers
Method
convert_completion_response_to_response
( self, completion: OpenAICompletion, body: CreateResponseRequest, tool_name:
examples/server/server.py:9092
↓ 1 callers
Method
copy_draft_sequence
( self, source_seq_id: int, dest_seq_id: int, p0: int, p1: int, )
examples/server/server.py:12188
↓ 1 callers
Method
copy_sequence
( self, source_seq_id: int, dest_seq_id: int, p0: int, p1: int, )
examples/server/server.py:1192
↓ 1 callers
Function
create_app
()
examples/server/server.py:15737
↓ 1 callers
Method
create_chat_completion_openai_v1
Generate a chat completion with return type based on the the OpenAI v1 API. OpenAI python package is required to use this method. Yo
llama_cpp/llama.py:2100
↓ 1 callers
Method
create_embedding
( self, payload: CreateEmbeddingRequest, )
examples/server/server.py:15534
↓ 1 callers
Method
detect_embedding_model
(cls, llama_model: Any)
examples/server/server.py:11883
↓ 1 callers
Method
detokenize
( self, tokens: List[int], prev_tokens: Optional[List[int]] = None, special: b
llama_cpp/llama_tokenizer.py:54
↓ 1 callers
Function
download_file
(url, destination)
docker/open_llama/hug_model.py:29
↓ 1 callers
Method
draft
( self, input_ids: np.ndarray, /, *, seq_id: int, max_tokens:
examples/server/server.py:1170
↓ 1 callers
Method
draft
( self, input_ids: np.ndarray, /, *, seq_id: int, max_tokens:
examples/server/server.py:1726
↓ 1 callers
Method
draft_acceptance_length_metric_lines
(self)
examples/server/server.py:15152
↓ 1 callers
Method
embed
( self, inputs: Sequence[Union[str, List[int]]], )
examples/server/server.py:12204
↓ 1 callers
Method
encode_embedding
( embedding: Sequence[float], encoding_format: Literal["float", "base64"], dimensions:
examples/server/server.py:2641
↓ 1 callers
Function
env_or_def
(env, default)
examples/low_level_api/ReasonAct.py:7
↓ 1 callers
Method
error_message_wrapper
Wraps error message in OpenAI style error response
llama_cpp/server/errors.py:125
↓ 1 callers
Method
evict_if_needed
(self)
examples/server/server.py:10503
↓ 1 callers
Method
find_candidate_pred_tokens
( input_ids: npt.NDArray[np.intc], max_ngram_size: int, num_pred_tokens: int, )
llama_cpp/llama_speculative.py:25
↓ 1 callers
Method
find_sequence_cache_match
( self, request: CompletionRequest, resident_reuse_len: int, )
examples/server/server.py:13197
↓ 1 callers
Function
format
( messages: List[llama_types.ChatCompletionRequestMessage], **kwargs: Any, )
llama_cpp/llama_chat_format.py:1115
↓ 1 callers
Method
format_grammar
(self)
llama_cpp/llama_grammar.py:937
↓ 1 callers
Method
format_grammar
(self)
examples/server/server.py:764
↓ 1 callers
Method
from_embeddings
( cls, *, model: str, embeddings: Sequence[Sequence[float]], total_tok
examples/server/server.py:2658
↓ 1 callers
Method
from_prepared
( cls, *, payload: CreateCompletionRequest, prompt_text: str, prompt_p
examples/server/server.py:4201
↓ 1 callers
Method
from_pretrained
( cls, repo_id: str, filename: Optional[str], local_dir: Optional[Union[str, o
llama_cpp/llama_chat_format.py:3692
↓ 1 callers
Method
generate
(self)
examples/low_level_api/low_level_api_chat_cpp.py:338
↓ 1 callers
Function
generate_streaming
(tools, functions, function_call, prompt)
llama_cpp/llama_chat_format.py:2140
↓ 1 callers
Method
get_chat_completion_handler_by_name
( self, name: str )
llama_cpp/llama_chat_format.py:138
↓ 1 callers
Method
get_image_urls
(messages: List[llama_types.ChatCompletionRequestMessage])
llama_cpp/llama_chat_format.py:3140
↓ 1 callers
Method
get_logits
(self)
llama_cpp/_internals.py:345
↓ 1 callers
Method
get_sampler
(self)
llama_cpp/_internals.py:671
↓ 1 callers
Function
get_server_settings
()
llama_cpp/server/app.py:58
↓ 1 callers
Function
get_user_choice
(model_list)
docker/open_llama/hug_model.py:51
↓ 1 callers
Function
gpt_random_prompt
(rng)
examples/low_level_api/common.py:389
↓ 1 callers
Function
hf_autotokenizer_to_chat_formatter
( pretrained_model_name_or_path: Union[str, os.PathLike[str]], )
llama_cpp/llama_chat_format.py:760
↓ 1 callers
Method
initial_prompt_records
( self, payload: CreateCompletionRequest, prompt_plan: PromptPlan, prompt_visi
examples/server/server.py:15711
↓ 1 callers
Method
is_boundary
(self, pos: int)
examples/server/server.py:3971
↓ 1 callers
Method
is_sequence_cache_match_usable
( self, request: CompletionRequest, match: SequenceCache.Match, resident_reuse
examples/server/server.py:13177
↓ 1 callers
Function
json_schema_to_gbnf
(schema: str, prop_order: Optional[List[str]] = None)
llama_cpp/llama_grammar.py:944
↓ 1 callers
Method
key_for_media
(self, kind: Literal["image", "audio", "video"], media_bytes: bytes)
examples/server/server.py:10458
↓ 1 callers
Method
last_output_index
(output_indices: Sequence[Optional[int]])
examples/server/server.py:14611
↓ 1 callers
Function
llama_set_adapter_cvec
Apply a loaded control vector to a llama_context, or if data is NULL, clear the currently loaded vector. n_embd should be the size of a single
llama_cpp/llama_cpp.py:2227
↓ 1 callers
Function
llama_set_adapters_lora
Set LoRA adapters on the context if they differ from the current adapters.
llama_cpp/llama_cpp.py:2177
↓ 1 callers
Method
load_image
(self, image_url: str)
llama_cpp/llama_chat_format.py:2830
↓ 1 callers
Method
load_image
(self, image_url: str)
llama_cpp/llama_chat_format.py:3324
↓ 1 callers
Method
load_media
(self, media: MediaInput)
examples/server/server.py:10711
↓ 1 callers
Method
load_sequence_state_bytes
( self, seq_id: int, state_bytes: np.ndarray, )
examples/server/server.py:13234
↓ 1 callers
Method
logits_to_logprobs
(logits: np.ndarray)
examples/server/server.py:13357
↓ 1 callers
Method
lookup
(self, tokens: Sequence[int])
examples/server/server.py:4149
↓ 1 callers
Function
main
()
llama_cpp/server/__main__.py:43
↓ 1 callers
Function
main
()
docker/open_llama/hug_model.py:73
↓ 1 callers
Function
main
()
examples/server/server.py:16352
↓ 1 callers
Function
main
(args)
examples/low_level_api/quantize.py:6
↓ 1 callers
Method
maybe_fill_draft_tokens
(self, completion: Completion)
examples/server/server.py:14080
↓ 1 callers
Method
media_inputs_from_messages
( messages: Sequence[ChatCompletionRequestMessage], )
examples/server/server.py:3503
↓ 1 callers
Function
message_to_str
(msg: llama_types.ChatCompletionRequestMessage)
llama_cpp/llama_chat_format.py:1625
↓ 1 callers
Function
mtmd_get_audio_sample_rate
Get the audio sample rate in Hz. Returns -1 if audio is not supported.
llama_cpp/mtmd_cpp.py:309
↓ 1 callers
Function
mtmd_helper_bitmap_init_from_buf_wrapper
( ctx: mtmd_context_p, buf: CtypesArray[c_uint8], length: Union[c_size_t, int], placeholder: U
llama_cpp/mtmd_cpp.py:744
↓ 1 callers
Function
mtmd_helper_bitmap_init_from_file_wrapper
Initialize an MTMD bitmap wrapper from a file.
llama_cpp/mtmd_cpp.py:724
↓ 1 callers
Method
n_embd
Return the embedding size.
llama_cpp/llama.py:2252
↓ 1 callers
Method
observe_decode
( self, items: Sequence[Any], elapsed_seconds: float, )
examples/server/server.py:4097
↓ 1 callers
Method
observe_draft_process
( self, items: Sequence["CompletionScheduler.BatchItem"], elapsed_seconds: float,
examples/server/server.py:13452
↓ 1 callers
Method
observe_predicted_token
(self)
examples/server/server.py:4127
↓ 1 callers
Method
on_done
(result: OpenAICompletion)
examples/server/server.py:15581
↓ 1 callers
Method
on_error
(exc: BaseException)
examples/server/server.py:15586
↓ 1 callers
Method
parse_completion_message
(self, response_text: str)
examples/server/server.py:7529
↓ 1 callers
Method
pooling_type
Return the pooling type.
llama_cpp/llama.py:2276
↓ 1 callers
Method
position_increments_up_to
(self, pos: int)
examples/server/server.py:3958
↓ 1 callers
Method
position_length
(self, sequence_id: int)
examples/server/server.py:1082
↓ 1 callers
Method
prepare_completion_prompt
( self, payload: CreateCompletionRequest, )
examples/server/server.py:15681
↓ 1 callers
Method
prev_text_tokens_at
(self, pos: int)
examples/server/server.py:4024
↓ 1 callers
Method
print_timings
(self)
llama_cpp/_internals.py:457
↓ 1 callers
Method
process
(self, batch: Any, /)
examples/server/server.py:1183
↓ 1 callers
Method
process_batch
(self, items: List[CompletionScheduler.BatchItem])
examples/server/server.py:14005
↓ 1 callers
Method
process_draft_batch
(self)
examples/server/server.py:12172
↓ 1 callers
Method
process_generation_item
( self, completion: Completion, item: CompletionScheduler.BatchItem, output_co
examples/server/server.py:14366
↓ 1 callers
Method
process_sampled_draft_batch
( self, items: Sequence["CompletionScheduler.BatchItem"], )
examples/server/server.py:14200
↓ 1 callers
Method
prompt_visible_start
(self, prompt_plan: PromptPlan)
examples/server/server.py:15705
↓ 1 callers
Method
remove_pending_request
(self, request: CompletionRequest)
examples/server/server.py:14992
↓ 1 callers
Method
request_from_payload
( self, payload: CreateCompletionRequest, )
examples/server/server.py:15637
↓ 1 callers
Method
request_needs_uncached_prompt_logprobs
(request: CompletionRequest)
examples/server/server.py:13162
↓ 1 callers
Method
require_prefill
(self)
examples/server/server.py:12998
↓ 1 callers
Method
reset
(self)
llama_cpp/_internals.py:502
↓ 1 callers
Method
reset_timings
(self)
llama_cpp/_internals.py:454
↓ 1 callers
Method
resolve_draft_model_path
(self)
examples/server/server.py:3443
↓ 1 callers
Method
resolve_embedding_mode
( cls, llama_model: Any, embedding: Optional[bool], )
examples/server/server.py:11900
↓ 1 callers
Method
resolve_mmproj_path
(self)
examples/server/server.py:3362
↓ 1 callers
Method
resolve_path
(self)
examples/server/server.py:3331
↓ 1 callers
Method
resolve_refs
(self, schema: Dict[str, Any], url: str)
examples/server/server.py:329
↓ 1 callers
Method
responses_input_to_chat_messages
( self, body: CreateResponseRequest, )
examples/server/server.py:8137
↓ 1 callers
Method
returned_output_end
( self, completion: Completion, finish_reason: Optional[str], )
examples/server/server.py:10021
↓ 1 callers
Method
sample
(self, ctx: LlamaContext, idx: int = -1)
llama_cpp/_internals.py:857
↓ 1 callers
Method
sample
(self, ctx: llama_cpp.llama_context_p, output_index: int)
examples/server/server.py:10338
↓ 1 callers
Method
sample_completion
( self, completion: Completion, output_index: Optional[int], )
examples/server/server.py:14698
↓ 1 callers
Method
sample_completion_from_logits
( self, completion: Completion, logits: np.ndarray, )
examples/server/server.py:14739
↓ 1 callers
Method
sample_logits
(self, logits: np.ndarray)
examples/server/server.py:10366
← previous
next →
501–600 of 1,336, ranked by callers