MCPcopy Create free account

hub / github.com/Mega4alik/ollm / functions

Functions149 in github.com/Mega4alik/ollm

↓ 14 callersFunction_walk_to_parent
Return (parent_obj, leaf_name) for attr_path like 'self_attn.q_proj.weight
src/ollm/utils.py:33
↓ 10 callersMethodset
(self, name, t1)
src/ollm/utils.py:20
↓ 8 callersFunctionfile_get_contents
(name)
src/ollm/utils.py:9
↓ 8 callersMethodgenerate
(self, **args)
src/ollm/llama.py:185
↓ 8 callersMethodpreload_layer_safetensors
(self, base)
src/ollm/gds_loader.py:354
↓ 7 callersFunction_assign_tensor_to_module
Assign a tensor into target_parent.<leaf>. - If target_parent.<leaf> has a .load call, call it with tensor. - Else, if attribute endswith
src/ollm/utils.py:41
↓ 7 callersFunction_set_meta_placeholder
Replace parameter/module attribute with a tiny meta-device Parameter to free VRAM.
src/ollm/utils.py:72
↓ 7 callersMethodkeys
(self)
src/ollm/gds_loader.py:196
↓ 6 callersMethodget_tensor
(self, name)
src/ollm/gds_loader.py:199
↓ 6 callersFunctionrun_test
(test_id, model_id, sm, um, kvcache=None, offload_layers_to_gpu=0, offload_layers_to_cpu=0, max_new_tokens=500
scripts/full_tests.py:5
↓ 5 callersMethod__init__
(self, config: Qwen3NextConfig)
src/ollm/qwen3_next.py:232
↓ 5 callersMethodload_dict_to_cuda
(self, base)
src/ollm/gds_loader.py:284
↓ 5 callersMethodoffload_dict_to_gpu_cpu
(self, base, gpu=False)
src/ollm/gds_loader.py:289
↓ 4 callersMethod__init__
(self, config:Gemma3Config)
src/ollm/gemma3.py:82
↓ 4 callersFunctionget_attn_implementation
()
src/ollm/inference.py:8
↓ 4 callersMethodini_model
(self, models_dir="./models/", force_download=False)
src/ollm/inference.py:69
↓ 4 callersMethodoffload_layers_to_cpu
(self, **args)
src/ollm/inference.py:121
↓ 4 callersMethodprint_and_clean
(self)
src/ollm/utils.py:24
↓ 3 callersMethodDiskCache
(self, cache_dir="./kvcache")
src/ollm/inference.py:127
↓ 3 callersMethod_get_my_manifests
(self)
src/ollm/gpt_oss.py:85
↓ 3 callersMethod_unload_expert_weights
(self)
src/ollm/qwen3_next.py:87
↓ 3 callersMethodget_base
(self, base)
src/ollm/gemma3.py:18
↓ 3 callersFunctionget_optimal_safetensor_reader
(filepath, device=None)
src/ollm/gds_loader.py:258
↓ 3 callersMethodget_seq_length
(self, layer_idx: Optional[int] = 0)
src/ollm/qwen3_next.py:25
↓ 3 callersMethodload_from_disk
(self, layer_idx)
src/ollm/kvcache.py:16
↓ 3 callersMethodload_param_to_cuda
(self, name: str)
src/ollm/gds_loader.py:27
↓ 3 callersMethodsave_to_disk
(self, tensors, layer_idx)
src/ollm/kvcache.py:24
↓ 2 callersMethod__init__
(self, config: GptOssConfig)
src/ollm/gpt_oss.py:124
↓ 2 callersMethod__init__
(self, config)
src/ollm/llama.py:104
↓ 2 callersMethod_layer_param_manifest_names
(self)
src/ollm/llama.py:33
↓ 2 callersMethod_load_expert_weights
(self)
src/ollm/qwen3_next.py:78
↓ 2 callersMethod_unload_layer_weights
(self)
src/ollm/gpt_oss.py:105
↓ 2 callersMethod_unload_layer_weights
(self)
src/ollm/qwen3_next.py:72
↓ 2 callersMethod_unload_layer_weights
(self)
src/ollm/llama.py:83
↓ 2 callersMethod_unload_layer_weights
(self)
src/ollm/gemma3.py:33
↓ 2 callersMethodclose
(self)
src/ollm/gds_loader.py:193
↓ 2 callersFunctionconvert_moe_packed_tensors
Convert the mxfp4 weights again, dequantizing and makes them compatible with the forward pass of GPT_OSS.
src/ollm/gds_loader.py:128
↓ 2 callersMethodforward
( self, input_ids: Optional[torch.LongTensor] = None, attention_mask: Optional[torch.Tensor] = None, p
src/ollm/gpt_oss.py:130
↓ 2 callersMethodforward
(self, x)
src/ollm/gemma3.py:42
↓ 2 callersMethodini_ocache
(self, cache_dir, device, stats)
src/ollm/kvcache.py:7
↓ 2 callersMethodload_dict_from_disk
(self, base, device='cpu')
src/ollm/gds_loader.py:301
↓ 2 callersMethodload_from_disk_to_cuda
(self, path, shape, dtype)
src/ollm/gds_loader.py:50
↓ 2 callersMethodload_model
(self, model_dir)
src/ollm/inference.py:84
↓ 2 callersMethodoffload_param_to_cpu
(self, name)
src/ollm/gds_loader.py:85
↓ 1 callersMethod__init__
(self, config, layer_idx: int)
src/ollm/voxtral.py:37
↓ 1 callersMethod_load_experts_weights
(self, experts_idx)
src/ollm/qwen3_next.py:93
↓ 1 callersMethod_load_layer_weights
(self)
src/ollm/voxtral.py:19
↓ 1 callersMethod_load_layer_weights
(self)
src/ollm/gpt_oss.py:94
↓ 1 callersMethod_load_layer_weights
(self)
src/ollm/qwen3_next.py:62
↓ 1 callersMethod_load_layer_weights
(self)
src/ollm/llama.py:72
↓ 1 callersMethod_load_layer_weights
(self)
src/ollm/gemma3.py:22
↓ 1 callersMethod_unload_experts_weights
(self, experts_idx)
src/ollm/qwen3_next.py:97
↓ 1 callersMethod_unload_layer_weights
(self)
src/ollm/voxtral.py:29
↓ 1 callersFunctionattention_ref
( query: torch.Tensor, key: torch.Tensor, value: torch.Tensor, sinks: torch.Tensor, sm_sca
src/ollm/gpt_oss_attention.py:170
↓ 1 callersMethodclose
(self)
src/ollm/gds_loader.py:228
↓ 1 callersFunctionconvert_moe_packed_tensors
Convert the mxfp4 weights again, dequantizing and makes them compatible with the forward pass of GPT_OSS.
scripts/gpt_oss_export.py:87
↓ 1 callersMethoddownload_and_unpack
(self, models_dir: str)
src/ollm/inference.py:24
↓ 1 callersMethodforward
(self, x)
src/ollm/qwen3_next.py:103
↓ 1 callersMethodforward
(self, x)
src/ollm/llama.py:20
↓ 1 callersMethodget_dtype
(self, dtype)
src/ollm/gds_loader.py:40
↓ 1 callersMethodget_offloaded_dict_to_cuda
(self, base)
src/ollm/gds_loader.py:293
↓ 1 callersMethodget_offloaded_from_cpu_to_cuda
(self, name)
src/ollm/gds_loader.py:94
↓ 1 callersFunctionget_sample
()
scripts/test_autoinference.py:7
↓ 1 callersMethodhf_download
(self, model_dir)
src/ollm/inference.py:53
↓ 1 callersFunctionhf_push_to_hub
()
scripts/scripts.py:35
↓ 1 callersFunctioninference_chat
()
scripts/test.py:26
↓ 1 callersFunctionini_model
(model_id)
scripts/test.py:10
↓ 1 callersMethodis_sharded
(self, model_dir)
src/ollm/inference.py:164
↓ 1 callersMethodload_mxfp4_from_disk
(self, path, shape, dtype)
src/ollm/gds_loader.py:80
↓ 1 callersMethodload_torch_from_disk
(self, path)
src/ollm/gds_loader.py:76
↓ 1 callersMethodoffload_layers_to_gpu_cpu
(self, gpu_layers_num=0, cpu_layers_num=0)
src/ollm/qwen3_next.py:330
↓ 1 callersMethodoffload_layers_to_gpu_cpu
(self, **args)
src/ollm/inference.py:124
↓ 1 callersFunctiononline_chunked_grouped_attention_rope
Online chunked grouped multi-head attention (RoPE already applied to q,k). - q: queries (B, Hq, Lq, D) - k,v: keys/values with Hkv heads
src/ollm/attention.py:141
↓ 1 callersMethodupdate
( self, key_states: torch.Tensor, value_states: torch.Tensor, layer_idx: int, cache_kwargs: Optional
src/ollm/kvcache.py:37
Method__enter__
(self)
src/ollm/gds_loader.py:222
Method__exit__
(self, exc_type, exc_val, exc_tb)
src/ollm/gds_loader.py:225
Method__getitem__
(self, layer_idx: int)
src/ollm/qwen3_next.py:28
Method__init__
(self, config)
src/ollm/voxtral.py:69
Method__init__
(self, config: GptOssConfig, layer_idx: int)
src/ollm/gpt_oss.py:112
Method__init__
(self, config)
src/ollm/gpt_oss.py:267
Method__init__
(self, config, cache_dir="./kv_cache", device="cuda:0", stats=None)
src/ollm/qwen3_next.py:20
Method__init__
(self, config, layer_idx)
src/ollm/qwen3_next.py:214
Method__init__
(self, config)
src/ollm/qwen3_next.py:318
Method__init__
(self, config)
src/ollm/qwen3_next.py:349
Method__init__
(self, config)
src/ollm/qwen3_next.py:377
Method__init__
(self, cache_dir="./kv_cache", device="cuda:0", stats=None)
src/ollm/kvcache.py:33
Method__init__
(self)
src/ollm/utils.py:17
Method__init__
(self, config: LlamaConfig, layer_idx: int)
src/ollm/llama.py:92
Method__init__
(self, config)
src/ollm/llama.py:199
Method__init__
(self, config, layer_idx)
src/ollm/gemma3.py:55
Method__init__
(self, config: Gemma3Config)
src/ollm/gemma3.py:67
Method__init__
(self, config)
src/ollm/gemma3.py:108
Method__init__
(self, config)
src/ollm/gemma3.py:114
Method__init__
(self, path: str, device="cuda:0")
src/ollm/gds_loader.py:19
Method__init__
(self, path)
src/ollm/gds_loader.py:184
Method__init__
(self, path: str, device="cuda:0")
src/ollm/gds_loader.py:210
Method__init__
(self, path: str, device="cuda:0")
src/ollm/gds_loader.py:267
Method__init__
(self, path: str, device="cuda:0")
src/ollm/gds_loader.py:315
Method__init__
(self, path: str, device="cuda:0")
src/ollm/gds_loader.py:337
Method__init__
(self, model_id, device="cuda:0", logging=True, multimodality=False)
src/ollm/inference.py:18
next →1–100 of 149, ranked by callers