MCPcopy Create free account

hub / github.com/MuLabPKU/TransArch / functions

Functions302 in github.com/MuLabPKU/TransArch

↓ 1 callersFunctionmodel_pca_calc
(model, outputs, device)
CLOVER_ICML_2025/src/pca_calc.py:211
↓ 1 callersFunctionmodel_rotate
(model: nn.Module, dtype, emb_Q: torch.Tensor, attn_Q: list[torch.Tensor], mlp_Q: list[torch.Tensor])
CLOVER_ICML_2025/src/rotate.py:64
↓ 1 callersFunctionmodify_config
(model, config_path: str, args)
TransMLA_NeurIPS_2025/transmla/modify_config.py:57
↓ 1 callersMethodmoe
r""" CALL FOR CONTRIBUTION! I don't have time to optimise this right now, but expert weights need to be fused to not have to do a loop
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:176
↓ 1 callersMethodmoe_infer
(self, x, topk_ids, topk_weight)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:591
↓ 1 callersFunctionparse_args
()
GQLA_preprint/src/convert.py:58
↓ 1 callersFunctionpartial_rope
(model, tokenizer, train_loader, test_loader, **kwargs)
TransMLA_NeurIPS_2025/transmla/partial_rope.py:196
↓ 1 callersFunctionpick_metric
Return (metric_name, value, stderr) preferring acc_norm over acc.
GQLA_preprint/scripts/summarize_lm_eval.py:25
↓ 1 callersFunctionpick_metric
(row: dict)
GQLA_preprint/scripts/summarize_commonsense_2x2.py:36
↓ 1 callersFunctionpost_attention_layernorm_hook_fn
(module, input, output, index)
CLOVER_ICML_2025/src/pca_calc.py:119
↓ 1 callersFunctionprepare_calibration_inputs
Pack ``nsamples`` chunks of exactly ``seqlen`` tokens from random rows.
GQLA_preprint/src/compression.py:86
↓ 1 callersFunctionprepare_dataloader
Get a DataLoader from a dataset. Args: dataset: The dataset to create a dataloader from. tokenizer: The tokenizer to use.
TransMLA_NeurIPS_2025/transmla/utils.py:103
↓ 1 callersFunctionprepare_dataloader
Get a DataLoader from a dataset. Args: dataset: The dataset to create a dataloader from. tokenizer: The tokenizer to use.
CLOVER_ICML_2025/src/data.py:107
↓ 1 callersFunctionprepare_ppl_dataloader
Fixed-length PPL loader (lm-eval-harness wikitext protocol: concat-and-chunk).
GQLA_preprint/src/compression.py:613
↓ 1 callersFunctionprepare_test_dataloader
Get a DataLoader from a test dataset. This dataloader should be used when comparing WikiText2 perplexities with other papers, e.g. SparseGPT (arx
TransMLA_NeurIPS_2025/transmla/utils.py:59
↓ 1 callersFunctionq_a_proj_hook_fn
(module, input, output, index)
TransMLA_NeurIPS_2025/transmla/utils.py:286
↓ 1 callersFunctionquery_hook_fn
(module, input, output, index)
TransMLA_NeurIPS_2025/transmla/utils.py:271
↓ 1 callersFunctionregister
()
GQLA_preprint/src/vllm_register.py:19
↓ 1 callersFunctionrepeat_kv
(hidden_states: torch.Tensor, n_rep: int)
TransMLA_NeurIPS_2025/transmla/lora_qkv.py:11
↓ 1 callersMethodreset_parameters
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:415
↓ 1 callersFunctionrotate_attention_inputs
(self_attn: nn.Module, Q: torch.Tensor)
CLOVER_ICML_2025/src/rotate.py:6
↓ 1 callersFunctionrotate_attention_output
(self_attn: nn.Module, Q: torch.Tensor)
CLOVER_ICML_2025/src/rotate.py:16
↓ 1 callersFunctionrotate_embeddings
(embed_tokens: nn.Module, Q: torch.Tensor)
CLOVER_ICML_2025/src/rotate.py:50
↓ 1 callersMethodrotate_k_proj
(self, U, freqfold=1)
TransMLA_NeurIPS_2025/transmla/partial_rope.py:108
↓ 1 callersMethodrotate_k_up_proj
(self, U, freqfold=1)
TransMLA_NeurIPS_2025/transmla/partial_rope.py:129
↓ 1 callersFunctionrotate_lm_head
(lm_head: nn.Module, Q: torch.Tensor)
CLOVER_ICML_2025/src/rotate.py:57
↓ 1 callersFunctionrotate_mlp_input
(mlp: nn.Module, Q: torch.Tensor)
CLOVER_ICML_2025/src/rotate.py:29
↓ 1 callersFunctionrotate_mlp_output
(mlp: nn.Module, Q: torch.Tensor)
CLOVER_ICML_2025/src/rotate.py:38
↓ 1 callersFunctionrun_hf
( requests: list[SampleRequest], model: str, tokenizer: PreTrainedTokenizerBase, n: int, m
TransMLA_NeurIPS_2025/throughput_test/benchmark_throughput.py:196
↓ 1 callersFunctionrun_mii
( requests: list[SampleRequest], model: str, tensor_parallel_size: int, output_len: int, )
TransMLA_NeurIPS_2025/throughput_test/benchmark_throughput.py:259
↓ 1 callersFunctionrun_vllm
( requests: list[SampleRequest], n: int, engine_args: EngineArgs, disable_detokenize: bool = F
TransMLA_NeurIPS_2025/throughput_test/benchmark_throughput.py:29
↓ 1 callersFunctionrun_vllm_async
( requests: list[SampleRequest], n: int, engine_args: AsyncEngineArgs, disable_frontend_multip
TransMLA_NeurIPS_2025/throughput_test/benchmark_throughput.py:140
↓ 1 callersFunctionrun_vllm_chat
Run vLLM chat benchmark. This function is recommended ONLY for benchmarking multimodal models as it properly handles multimodal inputs and ch
TransMLA_NeurIPS_2025/throughput_test/benchmark_throughput.py:101
↓ 1 callersMethodsample
( self, tokenizer: PreTrainedTokenizerBase, num_requests: int, prefix_len: int
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:284
↓ 1 callersFunctionslice_attention_inputs
(self_attn: nn.Module, dim: int)
CLOVER_ICML_2025/src/slice.py:6
↓ 1 callersFunctionslice_attention_output
(self_attn: nn.Module, dim: int)
CLOVER_ICML_2025/src/slice.py:14
↓ 1 callersFunctionslice_embeddings
(embed_tokens: nn.Module, dim: int)
CLOVER_ICML_2025/src/slice.py:42
↓ 1 callersFunctionslice_lm_head
(lm_head: nn.Module, dim: int)
CLOVER_ICML_2025/src/slice.py:48
↓ 1 callersFunctionslice_mlp_input
(mlp: nn.Module, dim: int)
CLOVER_ICML_2025/src/slice.py:24
↓ 1 callersFunctionslice_mlp_output
(mlp: nn.Module, dim: int)
CLOVER_ICML_2025/src/slice.py:32
↓ 1 callersFunctionstatistics_qkv_rmsnorm
(self_attn, q_a_outputs, kv_a_outputs)
TransMLA_NeurIPS_2025/transmla/utils.py:405
↓ 1 callersFunctionstrip_string
(string, skip_unit=False)
TransMLA_NeurIPS_2025/lighteval/math_utils.py:209
↓ 1 callersFunctionvalidate_args
Validate command-line arguments.
TransMLA_NeurIPS_2025/throughput_test/benchmark_throughput.py:375
↓ 1 callersFunctionvalue_hook_fn
(module, input, output, index)
TransMLA_NeurIPS_2025/transmla/utils.py:281
↓ 1 callersFunctionyarn_find_correction_range
( low_rot, high_rot, dim, base=10000, max_position_embeddings=2048 )
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:235
↓ 1 callersFunctionyarn_get_mscale
(scale: float = 1, mscale: float = 1)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:182
↓ 1 callersFunctionyarn_linear_ramp_mask
(min, max, dim)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:253
Method__call__
(self, features, return_tensors=None, separator_id=None)
TransMLA_NeurIPS_2025/training/train.py:47
Method__getitem__
(self, idx)
TransMLA_NeurIPS_2025/transmla/utils.py:92
Method__getitem__
(self, idx)
CLOVER_ICML_2025/src/data.py:95
Method__getitem__
(self, i)
GQLA_preprint/src/compression.py:631
Method__init__
Initialize the BenchmarkDataset with an optional dataset path and random seed. Args: dataset_path (Optional[str]): Path
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:51
Method__init__
( self, **kwargs, )
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:278
Method__init__
( self, name, prompt_function=None, hf_repo="lighteval/mmlu", hf_
TransMLA_NeurIPS_2025/lighteval/tasks.py:306
Method__init__
(self, *args, return_position_ids=True, separator_id=-100, max_len=8192, pad_token_id=128001, label_ignore_id=
TransMLA_NeurIPS_2025/training/train.py:35
Method__init__
Tokenize the entire dataset and reshape it into sequences of length seqlen.
TransMLA_NeurIPS_2025/transmla/utils.py:78
Method__init__
(self, self_attn, key_outputs=None, freqfold=1, rope_head=1, collapse=1)
TransMLA_NeurIPS_2025/transmla/partial_rope.py:48
Method__init__
( self, self_attn, query_outputs, key_outputs, value_outputs,
TransMLA_NeurIPS_2025/transmla/lora_qkv.py:21
Method__init__
(self, config, layer_idx: int)
TransMLA_NeurIPS_2025/transmla/transformers/mla.py:27
Method__init__
( self, *args, kv_lora_rank=512, q_lora_rank=None, qk_rope_head_dim=
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/configuration_mixtralmla.py:6
Method__init__
(self, config: MixtralMLAConfig, layer_idx: int)
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:24
Method__init__
(self, config)
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:47
Method__init__
( self, *args, kv_lora_rank=512, q_lora_rank=None, qk_rope_head_dim=
TransMLA_NeurIPS_2025/transmla/transformers/llama/configuration_llamamla.py:6
Method__init__
(self, config: LlamaMLAConfig, layer_idx: int)
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:24
Method__init__
(self, config)
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:47
Method__init__
DeepseekV3RMSNorm is equivalent to T5LayerNorm
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:40
Method__init__
(self, config: DeepseekV3Config, device=None)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:60
Method__init__
(self, config)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:111
Method__init__
(self, config)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:162
Method__init__
(self, config, layer_idx: int)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:331
Method__init__
(self, config: DeepseekV3Config, layer_idx: int)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:457
Method__init__
(self, config: DeepseekV3Config)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:548
Method__init__
(self, config)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:799
Method__init__
( self, vocab_size=129280, hidden_size=7168, intermediate_size=18432,
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/configuration_deepseek_v3.py:155
Method__init__
(self, config: Gemma2MLAConfig, layer_idx: int)
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:24
Method__init__
(self, config)
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:47
Method__init__
( self, *args, kv_lora_rank=512, q_lora_rank=None, qk_rope_head_dim=
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/configuration_gemma2mla.py:6
Method__init__
( self, config: PretrainedConfig, quant_config: Optional[QuantizationConfig] = None,
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:98
Method__init__
( self, config: PretrainedConfig, hidden_size: int, num_heads: int, qk
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:196
Method__init__
( self, config: PretrainedConfig, prefix: str, model_config: ModelConfig,
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:350
Method__init__
(self, *, vllm_config: VllmConfig, prefix: str = "")
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:461
Method__init__
(self, *, vllm_config: VllmConfig, prefix: str = "")
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:536
Method__init__
( self, vocab_size=102400, hidden_size=4096, intermediate_size=11008,
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/configuration_deepseek.py:115
Method__init__
DeepseekV2RMSNorm is equivalent to T5LayerNorm
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:95
Method__init__
(self, dim, max_position_embeddings=2048, base=10000, device=None)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:115
Method__init__
( self, dim, max_position_embeddings=2048, base=10000, device=None,
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:161
Method__init__
( self, dim, max_position_embeddings=2048, base=10000, device=None,
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:190
Method__init__
( self, dim, max_position_embeddings=2048, base=10000, device=None,
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:264
Method__init__
(self, config, hidden_size=None, intermediate_size=None)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:375
Method__init__
(self, config)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:526
Method__init__
(self, config: DeepseekV2Config, layer_idx: Optional[int] = None)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:686
Method__init__
(self, *args, **kwargs)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:922
Method__init__
(self, config: DeepseekV2Config, layer_idx: int)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1198
Method__init__
(self, config: DeepseekV2Config)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1423
Method__init__
(self, config)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1604
Method__init__
(self, config)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1822
Method__init__
Tokenize the entire dataset and reshape it into sequences of length seqlen.
CLOVER_ICML_2025/src/data.py:81
Method__init__
(self, config: Glm4MoeLiteConfig, layer_idx: int)
GQLA_preprint/src/modeling.py:23
Method__init__
(self, config: Glm4MoeLiteConfig, layer_idx: int)
GQLA_preprint/src/modeling.py:33
Method__init__
(self, config: Glm4MoeLiteConfig)
GQLA_preprint/src/modeling.py:48
← previousnext →101–200 of 302, ranked by callers