Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/ScalingIntelligence/tokasaurus
/ functions
Functions
507 in github.com/ScalingIntelligence/tokasaurus
⨍
Functions
507
◇
Types & classes
95
↳
Endpoints
10
↓ 30 callers
Method
get
(self, sid: str)
tokasaurus/manager/types.py:167
↓ 28 callers
Method
sanity_checks
(self, seq_ids: set[str] | None = None)
tokasaurus/manager/allocator.py:158
↓ 28 callers
Method
to
(self, device: DeviceType, non_blocking: bool = False)
tokasaurus/model/types.py:235
↓ 18 callers
Method
allocate_with_prefix_match
( self, seq_id: str, prompt_ids: list[int], num_reserved_blocks: int = 0,
tokasaurus/manager/allocator.py:324
↓ 17 callers
Method
add
(self, value: float)
tokasaurus/manager/stopping_predictor.py:59
↓ 14 callers
Method
run
( self, input_batch_state: BatchState, non_blocking: bool = False, )
tokasaurus/model/utils.py:840
↓ 13 callers
Method
allocate_up_to_length
( self, seq_id: str, kv_indices: list[int], length: int, available_lea
tokasaurus/manager/allocator.py:265
↓ 13 callers
Method
empty
(self)
tokasaurus/manager/stopping_predictor.py:56
↓ 13 callers
Method
prompt_total
(self)
tokasaurus/manager/types.py:67
↓ 12 callers
Method
from_pretrained
( cls, model_name_or_path: str, extra_config: ExtraModelConfig | None = None,
tokasaurus/model/llama.py:774
↓ 11 callers
Method
remove
(self, sid: str)
tokasaurus/manager/types.py:207
↓ 10 callers
Method
wait
(self)
tokasaurus/common_types.py:18
↓ 8 callers
Function
all_gather
(x: Tensor, extra_config: ExtraModelConfig)
tokasaurus/model/llama.py:56
↓ 8 callers
Method
mean
(self)
tokasaurus/manager/stopping_predictor.py:141
↓ 8 callers
Method
prompt_to_schedule
(self)
tokasaurus/manager/types.py:73
↓ 8 callers
Method
total_scheduled
(self)
tokasaurus/manager/types.py:70
↓ 7 callers
Method
__init__
Taken from LlamaRMSNorm.
tokasaurus/model/llama.py:36
↓ 7 callers
Method
expected_completion_length
(self, add_buffer: bool = False)
tokasaurus/manager/types.py:76
↓ 7 callers
Function
find_free_port
()
tokasaurus/utils.py:312
↓ 7 callers
Method
free_and_update
(self, seq_id: str, kv_indices: list[int], token_ids: list[int])
tokasaurus/manager/allocator.py:387
↓ 7 callers
Method
kv_cache_num_blocks
(self)
tokasaurus/common_types.py:130
↓ 7 callers
Method
plan
(self, input_batch_state: BatchState, non_blocking: bool = False)
tokasaurus/model/utils.py:827
↓ 6 callers
Function
lprint
(*args, **kwargs)
tokasaurus/benchmarks/bench_model.py:114
↓ 6 callers
Function
make_messages
(word: str)
tests/test_basic.py:174
↓ 6 callers
Method
set_wrappers
(self, wrappers: WrapperCollection)
tokasaurus/model/llama.py:669
↓ 6 callers
Method
to
(self, device: DeviceType | None = None, dtype: torch.dtype | None = None)
tokasaurus/model/llama.py:766
↓ 5 callers
Method
add_sequence
( self, kv_indices: list[int], kv_seq_len: int, num_qtokens: int, page
tokasaurus/model/types.py:122
↓ 5 callers
Function
calc_block_usage_over_time
For each sequence, calculate how many kv blocks will be used right before the seq is deallocated and after all earlier-finishing sequences ha
tokasaurus/manager/scheduler.py:47
↓ 5 callers
Function
format_value
(value: int)
tokasaurus/manager/monitoring.py:256
↓ 5 callers
Method
head_dim
(self)
tokasaurus/model/llama.py:158
↓ 5 callers
Method
in_decoding
(self, sid: str)
tokasaurus/manager/types.py:217
↓ 5 callers
Method
is_initialized
(self)
tokasaurus/manager/monitoring.py:252
↓ 5 callers
Method
is_warmed_up
(self)
tokasaurus/manager/stopping_predictor.py:285
↓ 5 callers
Function
launch_server
(config: BaseConfig)
tokasaurus/benchmarks/utils.py:101
↓ 5 callers
Function
nowstamp
()
tokasaurus/server/types.py:15
↓ 5 callers
Function
pad_and_slice_tensor
( x: Tensor, num_padding: int, tp_rank: int, tp_size: int )
tokasaurus/model/utils.py:104
↓ 5 callers
Method
running_seqs
(self)
tokasaurus/manager/types.py:238
↓ 5 callers
Function
setup_logging
(config: "ServerConfig")
tokasaurus/utils.py:460
↓ 5 callers
Function
try_onboarding_seqs
( block_usage: BlockUsageOverTime, seqs: list[Sequence], existing_prefill_seqs: list[Sequence],
tokasaurus/manager/scheduler.py:408
↓ 4 callers
Function
add_decoding_ids_to_batch_state
( input_batch_state: BatchState, decoding_input_ids: Tensor, tp_rank: int = 0, tp_size: int =
tokasaurus/model/utils.py:205
↓ 4 callers
Method
add_sequence
(self, temperature: float, top_p: float)
tokasaurus/model/types.py:302
↓ 4 callers
Function
calc_kv_token_indices
( kv_block_indices: list[int], page_size: int, start_idx: int, num_tokens: int )
tokasaurus/manager/input_building.py:138
↓ 4 callers
Method
client
(self)
tokasaurus/benchmarks/utils.py:39
↓ 4 callers
Function
convert_unit
(milis: float, unit: str)
tokasaurus/utils.py:188
↓ 4 callers
Method
deallocate
(self, seq: Sequence)
tokasaurus/manager/types.py:324
↓ 4 callers
Method
elapsed_time
(self)
tokasaurus/manager/monitoring.py:136
↓ 4 callers
Method
expected_num_additional_blocks
(self, page_size: int, add_buffer: bool = False)
tokasaurus/manager/types.py:94
↓ 4 callers
Function
make_decision
(num_prefill: float)
tokasaurus/manager/scheduler.py:601
↓ 4 callers
Function
make_input_batch_state
( inp: ModelInput, tp_rank: int = 0, tp_size: int = 1, pp_rank: int = 0, pp_size: int = 1,
tokasaurus/model/utils.py:113
↓ 4 callers
Function
make_random_ids
(length: int)
tests/test_scheduler.py:33
↓ 4 callers
Function
maybe_save_results
(config: BaseConfig, results)
tokasaurus/benchmarks/utils.py:214
↓ 4 callers
Function
move_batch_state
( input_batch_state: BatchState, device: DeviceType, non_blocking: bool = False, )
tokasaurus/model/utils.py:227
↓ 4 callers
Method
num_prefill_tokens
(self)
tokasaurus/manager/types.py:280
↓ 4 callers
Method
num_running_seqs
(self)
tokasaurus/manager/types.py:249
↓ 4 callers
Method
num_unfinished_seqs
(self)
tokasaurus/manager/types.py:244
↓ 4 callers
Function
parallelize
( fn, items, num_workers: int | None = None, processes: bool = True, allow_unordered: bool
tokasaurus/benchmarks/utils.py:127
↓ 4 callers
Method
remove_decoding
(self, sid: str)
tokasaurus/manager/types.py:198
↓ 4 callers
Method
remove_queued
(self, sid: str)
tokasaurus/manager/types.py:204
↓ 4 callers
Function
server_manager
(config: ServerConfig, finalize=True)
tokasaurus/entry.py:91
↓ 4 callers
Function
shuffle_and_limit
(ds, config: BaseConfig)
tokasaurus/benchmarks/utils.py:182
↓ 4 callers
Method
update_seq_predictions
(self, seq: "Sequence")
tokasaurus/manager/stopping_predictor.py:190
↓ 3 callers
Method
batch_size
(self)
tokasaurus/manager/types.py:283
↓ 3 callers
Function
encode_array
(array: np.ndarray)
tokasaurus/server/utils.py:642
↓ 3 callers
Function
generate_output
( state: ServerState, request: CompletionsRequest | ChatCompletionRequest )
tokasaurus/server/utils.py:831
↓ 3 callers
Function
get_global_rank
parallelism order from outer to inner: dp -> pp -> tp
tokasaurus/model/utils.py:47
↓ 3 callers
Method
head_dim
(self)
tokasaurus/model/qwen3.py:42
↓ 3 callers
Method
in_prefilling
(self, sid: str)
tokasaurus/manager/types.py:220
↓ 3 callers
Method
in_queued
(self, sid: str)
tokasaurus/manager/types.py:223
↓ 3 callers
Function
make_model
( config: ServerConfig, device: str, dtype: torch.dtype, pp_rank: int = 0, tp_rank: int =
tokasaurus/model/utils.py:330
↓ 3 callers
Function
make_sequences
( num_shared_decoding_seqs: int = 128, num_unique_decoding_seqs: int = 128, num_prefilling_seqs: i
tests/test_scheduler.py:16
↓ 3 callers
Method
num_decoding_tokens
(self)
tokasaurus/manager/types.py:277
↓ 3 callers
Method
num_lm_head_tokens
(self)
tokasaurus/model/types.py:366
↓ 3 callers
Method
num_prefill_tokens
(self)
tokasaurus/model/types.py:360
↓ 3 callers
Function
process_chat_completions_output
( state: ServerState, crequest: ChatCompletionRequest, request: TokasaurusRequest, output: Req
tokasaurus/server/utils.py:694
↓ 3 callers
Function
real_allocate
( state: ManagerState, seq: Sequence, available_leaf_heap: list[PrefixTreeBlock], )
tokasaurus/manager/manager.py:451
↓ 3 callers
Function
reduce_scatter
(x: Tensor, extra_config: ExtraModelConfig)
tokasaurus/model/llama.py:75
↓ 3 callers
Function
reorder_decoding_seqs_for_hydragen
Our Hydragen implementation requires us to reorder the decoding sequences so that seqs in the same shared-prefix group are adjacent to each o
tokasaurus/manager/hydragen.py:10
↓ 3 callers
Function
set_async_tp_enabled
(enabled: bool)
tokasaurus/model/utils.py:383
↓ 3 callers
Method
total_tokens
(self)
tokasaurus/benchmarks/bench_model.py:69
↓ 2 callers
Method
add_prefilling
(self, seq: Sequence)
tokasaurus/manager/types.py:192
↓ 2 callers
Method
assign_block_to_seq
(self, block: PrefixTreeBlock, seq_id: str)
tokasaurus/manager/allocator.py:242
↓ 2 callers
Method
attn_fn
( ragged_q: Tensor, ragged_k: Tensor, ragged_v: Tensor, k_cach
tokasaurus/model/llama.py:166
↓ 2 callers
Method
buffer_len
(self)
tokasaurus/manager/stopping_predictor.py:282
↓ 2 callers
Method
buffer_mean
(self)
tokasaurus/manager/stopping_predictor.py:276
↓ 2 callers
Method
build
Convert builders to tensors
tokasaurus/model/types.py:179
↓ 2 callers
Method
calc_conditional_mean_stds
For each v in vals, calculate the mean and std of the buffer values that are greater than or equal to v.
tokasaurus/manager/stopping_predictor.py:63
↓ 2 callers
Method
calc_padding
returns (all_tokens_padding, lm_head_tokens_padding)
tokasaurus/model/utils.py:790
↓ 2 callers
Function
calc_pipeline_layer_start_and_end
( config: LlamaConfig, extra_config: ExtraModelConfig, )
tokasaurus/model/llama.py:585
↓ 2 callers
Function
cleanup_processes
(processes: list[mp.Process])
tokasaurus/entry.py:13
↓ 2 callers
Function
create_workspace_buffer
(device: DeviceType)
tokasaurus/model/attention_utils.py:16
↓ 2 callers
Function
decode_completion
( state: ServerState, request: TokasaurusRequest, output: RequestOutput )
tokasaurus/server/utils.py:380
↓ 2 callers
Method
decoding_batch_indices
(self)
tokasaurus/model/types.py:372
↓ 2 callers
Function
extract_answer_gsm8k
(completion)
tokasaurus/benchmarks/monkeys_gsm8k.py:58
↓ 2 callers
Function
extract_answer_gsm8k
(completion)
tokasaurus/benchmarks/standalone_monkeys_gsm8k.py:276
↓ 2 callers
Function
free_seq
(seq: Sequence)
tests/test_scheduler.py:126
↓ 2 callers
Function
get_dtype
(dtype_str: str)
tokasaurus/model/utils.py:34
↓ 2 callers
Function
get_eos_token_ids
(generation_config: GenerationConfig)
tokasaurus/utils.py:447
↓ 2 callers
Function
group_for_hydragen
Iterative version of depth-first search - we make a group for a given prefix if it meets the minimum group size/prefix length requirements,
tokasaurus/manager/hydragen.py:66
↓ 2 callers
Function
is_local
()
tokasaurus/utils.py:103
↓ 2 callers
Method
is_root
(self)
tokasaurus/manager/allocator.py:20
next →
1–100 of 507, ranked by callers