Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/AtomaAI/atoma-infer
/ functions
Functions
613 in github.com/AtomaAI/atoma-infer
⨍
Functions
613
◇
Types & classes
173
↓ 319 callers
Method
clone
(&self)
models/src/phi3.rs:145
↓ 37 callers
Function
create_dummy_prompt
Create a dummy prompt sequence and sequence group.
backends/vllm/src/sequence.rs:2268
↓ 30 callers
Function
create_random_tensor
(device: &Device, dtype: DType)
csrc/tests/cache_manager_tests.rs:13
↓ 29 callers
Method
contains
(&self, block_number: u32)
backends/vllm/src/evictor.rs:84
↓ 28 callers
Function
copy
csrc/kernels/utils.h:344
↓ 28 callers
Method
sequence_id
Returns the unique identifier of the sequence. # Returns The `u64` sequence ID. # Example ``` let sequence = Sequence::new(42, /* ... */); assert_
backends/vllm/src/sequence.rs:968
↓ 26 callers
Method
sample
Samples next tokens for a batch of sequence groups # Arguments `logits` - The output logits from the forward pass `sequence_groups_metadata` - Metada
backends/vllm/src/model_executor.rs:173
↓ 24 callers
Method
device
Getter for `device`
backends/vllm/src/block.rs:192
↓ 24 callers
Method
send
(&self, request: ExecuteModelRequest)
backends/vllm/src/model_executor.rs:522
↓ 22 callers
Function
linear
(size1: usize, size2: usize, vb: VarBuilder)
models/src/llama_nccl.rs:17
↓ 21 callers
Method
read_lock
(&self)
backends/vllm/src/block.rs:271
↓ 18 callers
Method
set_sequence_status
Updates the status of the sequence. # Arguments `sequence_status` - The new `SequenceStatus` to set.
backends/vllm/src/sequence.rs:844
↓ 18 callers
Method
write_lock
(&self)
backends/vllm/src/block.rs:281
↓ 15 callers
Method
block_number
Getter for `block_number`
backends/vllm/src/block.rs:61
↓ 15 callers
Method
is_empty
Checks if the current instance is empty
backends/vllm/src/scheduler.rs:292
↓ 14 callers
Method
allocate
(&mut self, seq_group: &SequenceGroup)
backends/vllm/src/block_manager.rs:195
↓ 13 callers
Method
clone
(&self)
models/src/mistral.rs:149
↓ 13 callers
Method
get_number_of_free_gpu_blocks
Returns the number of free GPU blocks available in the block manager. This method provides a quick way to check the current availability of GPU memor
backends/vllm/src/block_manager.rs:974
↓ 13 callers
Method
is_empty
Checks if `token_ids` is empty
backends/vllm/src/block.rs:71
↓ 13 callers
Method
length
Returns the total number of tokens in the sequence. This method calculates the sum of prompt tokens and generated output tokens. # Returns `usize`
backends/vllm/src/sequence.rs:240
↓ 13 callers
Function
schedule_and_update_computed_tokens
( scheduler: &mut Scheduler<FcfsPolicy>, )
backends/vllm/src/scheduler.rs:2286
↓ 12 callers
Method
add_sequence_group
(&mut self, sequence_group: SequenceGroup)
backends/vllm/src/scheduler.rs:1739
↓ 12 callers
Method
config
(&self)
backends/vllm/src/tests/mod.rs:161
↓ 12 callers
Method
get_sequence_status
Returns the current status of the sequence. # Returns `SequenceStatus` - The current status of the sequence (e.g., Waiting, Running, Finished).
backends/vllm/src/sequence.rs:835
↓ 12 callers
Function
messages_to_hermes3_prompt
Function to convert a list of messages to a prompt string in Hermes3 format.
server/src/api/chat_completions.rs:393
↓ 12 callers
Function
round_multiple
(x: usize, m: usize)
csrc/src/lib.rs:2112
↓ 11 callers
Method
add_number_sequences
(&mut self, request_id: String, num_current_sequences: usize)
backends/vllm/src/scheduler.rs:118
↓ 11 callers
Method
add_token_id
(&mut self, token_id: u32, logprob: f32)
backends/vllm/src/sequence.rs:219
↓ 11 callers
Method
allocate_and_set_running
Allocates blocks to a `SequenceGroup` and sets its sequences' status to `Running`. This function performs two main tasks: 1. Allocates memory blocks
backends/vllm/src/scheduler.rs:2166
↓ 11 callers
Method
get_max_num_running_seqs
Returns the maximum number of sequences that could be running in parallel for this request. This method determines the upper bound of concurrent sequ
backends/vllm/src/sequence.rs:1380
↓ 11 callers
Function
get_sequence_groups
(scheduler_outputs: &SchedulerOutputs)
backends/vllm/src/scheduler.rs:2278
↓ 11 callers
Function
messages_to_llama3_prompt
Function to convert a list of messages to a prompt string in Llama3 format.
server/src/api/chat_completions.rs:324
↓ 11 callers
Method
update_num_computed_tokens
( &mut self, num_new_computed_tokens: usize, )
backends/vllm/src/sequence.rs:382
↓ 10 callers
Method
add_num_batched_tokens
(&mut self, request_id: String, num_batched_tokens: usize)
backends/vllm/src/scheduler.rs:94
↓ 10 callers
Method
forward
( &mut self, x: &Tensor, input_positions: &Tensor, kv_cache: &Tensor,
models/src/llama.rs:253
↓ 10 callers
Method
free
(&mut self, sequence_id: u64)
backends/vllm/src/block_manager.rs:870
↓ 9 callers
Function
add_new_token_to_sequence_group
( token_chunk_size: usize, sequence_group: &mut SequenceGroup, token_id: u32, )
backends/vllm/src/scheduler.rs:2335
↓ 9 callers
Function
copy_blocks
Launches the `copy_blocks_kernel` on the given `key_caches` and `value_caches`, following the `block_mapping`, to copy the blocks on both `key_cache`
csrc/src/cache_manager.rs:148
↓ 9 callers
Function
reshape_thread_tile
csrc/kernels/utils.h:322
↓ 9 callers
Method
schedule_prefills
( &mut self, mut waiting_queue: VecDeque<SequenceGroup>, budget: &mut SchedulingBudget
backends/vllm/src/scheduler.rs:897
↓ 9 callers
Function
swap_blocks
Swaps blocks from `src` to `dst` tensors, using the block_mapping. Both `src` and `dst` tensors must have the same dtype, and either be on the same cu
csrc/src/cache_manager.rs:18
↓ 8 callers
Method
is_finished
Checks if the sequence has finished processing. Returns `true` if the sequence has reached a terminal state (aborted, ignored, length capped, or stop
backends/vllm/src/sequence.rs:93
↓ 8 callers
Method
messages_to_prompt
(&self, messages: &[Message])
server/src/api/chat_completions.rs:159
↓ 7 callers
Method
get_block_size
(&self)
backends/vllm/src/worker.rs:644
↓ 7 callers
Method
is_prefill
Checks if the sequence is in the `Prefill` stage. # Returns `true` if the sequence is in the Prefill stage, `false` otherwise. # Example ``` let s
backends/vllm/src/sequence.rs:952
↓ 7 callers
Method
rank
Getter for `rank`
backends/vllm/src/sequence.rs:47
↓ 7 callers
Function
reshape_and_cache_flash
Launches the `reshape_and_cache_kernel_flash` on the given `key_caches` and `value_caches`, respecting a slot mapping. # Arguments `key` - A `Tensor
csrc/src/cache_manager.rs:319
↓ 7 callers
Method
schedule_swapped
( &mut self, swapped_queue: VecDeque<SequenceGroup>, budget: &mut SchedulingBudget,
backends/vllm/src/scheduler.rs:773
↓ 7 callers
Method
swap_out
( &mut self, sequence_group: &mut SequenceGroup, blocks_to_swap_out: &mut HashMap<u32,
backends/vllm/src/scheduler.rs:1976
↓ 6 callers
Method
fork
( &mut self, parent_sequence: RwLockReadGuard<Sequence>, child_sequence: RwLockReadGua
backends/vllm/src/block_manager.rs:408
↓ 6 callers
Method
forward
( &mut self, xs: &Tensor, input_positions: &Tensor, kv_cache: &Tensor,
models/src/phi3.rs:209
↓ 6 callers
Method
forward
( &mut self, xs: &Tensor, input_positions: &Tensor, kv_cache: &Tensor,
models/src/mistral.rs:218
↓ 6 callers
Method
get_block_table_ids
Retrieves the block IDs for a given sequence. # Arguments `sequence_id` - The ID of the sequence to retrieve block IDs for. # Returns `Some(Vec<u32>
backends/vllm/src/block_manager.rs:958
↓ 6 callers
Method
get_num_free_blocks
Get the number of free blocks for a given device
backends/vllm/src/block_manager.rs:89
↓ 6 callers
Method
get_num_tokens
( &self, sequence_group: &SequenceGroup, sequence_status: SequenceStatus, enab
backends/vllm/src/scheduler.rs:1588
↓ 6 callers
Method
get_sequence_from_id
Retrieves a shared reference to a `Sequence` with the specified `sequence_id`. This method searches through the sequences in the group and returns a
backends/vllm/src/sequence.rs:1555
↓ 6 callers
Method
sliding_window
Getter for `sliding_window`
backends/vllm/src/config.rs:305
↓ 5 callers
Function
add_new_token
(scheduler: &mut Scheduler<FcfsPolicy>, token_id: u32)
backends/vllm/src/scheduler.rs:2302
↓ 5 callers
Method
get_num_sequences
Returns the number of sequences in the group, optionally filtered by a specific status. # Arguments `status` - An optional `SequenceStatus` to filte
backends/vllm/src/sequence.rs:1750
↓ 5 callers
Method
get_token_ids
Getter for `token_ids`
backends/vllm/src/block.rs:123
↓ 5 callers
Method
head_dim
(&self)
models/src/phi3.rs:29
↓ 5 callers
Method
head_dim
(&self)
models/src/mistral.rs:29
↓ 5 callers
Method
into_config
(self)
models/src/llama.rs:65
↓ 5 callers
Method
max_num_batched_tokens
Getter for `max_num_batched_tokens`
backends/vllm/src/config.rs:424
↓ 5 callers
Method
split_kv_cache
Splits the KV cache
models/src/flash_attention.rs:249
↓ 5 callers
Method
to_prompt_string
Converts a message to its string representation in the prompt.
server/src/api/chat_completions.rs:228
↓ 4 callers
Function
add_token_budget
( budget: &mut SchedulingBudget, num_batched_tokens: usize, num_current_sequences: usi
backends/vllm/src/scheduler.rs:2355
↓ 4 callers
Method
append_slots
( &mut self, sequence_group: &SequenceGroup, blocks_to_copy: &mut HashMap<u32, u32>,
backends/vllm/src/scheduler.rs:1683
↓ 4 callers
Method
append_slots
( &mut self, sequence: RwLockReadGuard<Sequence>, )
backends/vllm/src/block_manager.rs:294
↓ 4 callers
Function
apply_softcap
csrc/kernels/flash_fwd_kernel.h:26
↓ 4 callers
Method
can_schedule
( &self, num_new_tokens: usize, num_new_sequences: usize, )
backends/vllm/src/scheduler.rs:71
↓ 4 callers
Function
convert_layout_acc_rowcol
csrc/kernels/utils.h:186
↓ 4 callers
Function
create_test_tensor
(device: &Device, dtype: DType)
csrc/tests/cache_manager_tests.rs:218
↓ 4 callers
Method
cumulative_logprob
Returns the cumulative log probability of all generated tokens in the sequence. # Returns `f32` - The sum of log probabilities for all generated tok
backends/vllm/src/sequence.rs:826
↓ 4 callers
Function
embedding
(cfg: &Config, vb: VarBuilder)
models/src/llama_nccl.rs:12
↓ 4 callers
Method
find
Finds a `Sequence` with the given `sequence_id` in this `SequenceGroup`. # Arguments `sequence_id` - The unique identifier of the sequence to find.
backends/vllm/src/sequence.rs:1872
↓ 4 callers
Function
gemm_rs
csrc/kernels/utils.h:164
↓ 4 callers
Method
get_block_table
Retrieves the `BlockTable` associated with a given `Sequence`. # Arguments `sequence` - A read guard to the `Sequence` for which to retrieve the bloc
backends/vllm/src/block_manager.rs:941
↓ 4 callers
Method
get_number_of_free_cpu_blocks
Returns the number of free CPU blocks available in the block manager. This method provides a quick way to check the current availability of CPU memor
backends/vllm/src/block_manager.rs:986
↓ 4 callers
Method
increment_ref_count
Increments the `ref_count` variable by +1
backends/vllm/src/block.rs:227
↓ 4 callers
Function
init_tracing
()
backends/vllm/src/tests/mod.rs:354
↓ 4 callers
Method
into_config
(self)
models/src/phi3.rs:37
↓ 4 callers
Method
max_num_sequences
Getter for `max_num_sequences`
backends/vllm/src/config.rs:429
↓ 4 callers
Method
preempt
( &mut self, sequence_group: &mut SequenceGroup, blocks_to_swap_out: &mut HashMap<u32,
backends/vllm/src/scheduler.rs:1778
↓ 4 callers
Method
remove
Removes a `Sequence` from this `SequenceGroup`. This method is idempotent - if no sequence with the given ID exists, this method does nothing. # Arg
backends/vllm/src/sequence.rs:1903
↓ 4 callers
Method
run
(mut self)
backends/vllm/src/llm_engine.rs:92
↓ 4 callers
Function
shard
(dim: usize, rank: usize, world_size: usize)
models/src/multi_gpu.rs:182
↓ 4 callers
Method
subtract_num_batched_tokens
(&mut self, request_id: &str, num_batched_tokens: usize)
backends/vllm/src/scheduler.rs:107
↓ 4 callers
Method
subtracts_number_sequences
(&mut self, request_id: &str, num_current_sequences: usize)
backends/vllm/src/scheduler.rs:131
↓ 4 callers
Method
verify_args
Verify `CacheConfig` arguments
backends/vllm/src/config.rs:259
↓ 3 callers
Method
allocate
(&mut self)
backends/vllm/src/block_allocator.rs:59
↓ 3 callers
Function
check_gpu_compatibility
(device_index: usize)
csrc/src/lib.rs:2216
↓ 3 callers
Function
compute_num_splits
( batch_size: usize, num_heads: usize, head_size: usize, max_seqlen_k: usize,
csrc/src/lib.rs:2169
↓ 3 callers
Method
enable_chunked_prefill
Getter for `enable_chunked_prefill`
backends/vllm/src/config.rs:414
↓ 3 callers
Function
flash_attn_kv_cache_full
Flash-attention v2 layer with key and value tensors cached. This implements scaled dot-product attention, `softmax(Q @ K^T . softmax_scale) @ V`. Mul
csrc/src/lib.rs:2083
↓ 3 callers
Function
gemm
csrc/kernels/utils.h:137
↓ 3 callers
Method
get_num_computed_tokens
Returns the number of tokens that have been computed so far. This includes both prefill tokens and any generated tokens that have been processed. #
backends/vllm/src/sequence.rs:328
↓ 3 callers
Method
get_num_total_logical_token_blocks
Gets the total number of logical token blocks in this sequence. # Returns The number of `LogicalTokenBlock`s in the `logical_token_blocks` vector.
backends/vllm/src/sequence.rs:703
↓ 3 callers
Method
get_sequences_ids
Retrieves sequence IDs from the `SequenceGroup`, optionally filtered by status. # Arguments `status` - An optional `SequenceStatus` to filter the se
backends/vllm/src/sequence.rs:1465
↓ 3 callers
Function
hub_load_safetensors
Helper function to download safetensors from the HF API
backends/vllm/src/models/mod.rs:9
next →
1–100 of 613, ranked by callers