MCPcopy Create free account

hub / github.com/MuLabPKU/TransArch / functions

Functions302 in github.com/MuLabPKU/TransArch

Method__init__
( self, vllm_config: VllmConfig, config: "Glm4MoeLiteConfig", hidden_size: int
GQLA_preprint/src/vllm_model.py:67
Method__init__
( self, vllm_config: VllmConfig, prefix: str, config: "Glm4MoeLiteConfig | Non
GQLA_preprint/src/vllm_model.py:202
Method__init__
(self, *, vllm_config: VllmConfig, prefix: str = "")
GQLA_preprint/src/vllm_model.py:345
Method__init__
( self, vllm_config: VllmConfig, config: "Glm4MoeLiteConfig", hidden_size: int
GQLA_preprint/src/vllm_model.py:420
Method__init__
( self, vllm_config: VllmConfig, prefix: str, config: "Glm4MoeLiteConfig | Non
GQLA_preprint/src/vllm_model.py:535
Method__init__
(self, *, vllm_config: VllmConfig, prefix: str = "")
GQLA_preprint/src/vllm_model.py:607
Method__init__
(self, *, vllm_config: VllmConfig, prefix: str = "")
GQLA_preprint/src/vllm_model.py:690
Method__len__
(self)
TransMLA_NeurIPS_2025/transmla/utils.py:95
Method__len__
(self)
CLOVER_ICML_2025/src/data.py:98
Method__len__
(self)
GQLA_preprint/src/compression.py:630
Method_expanded
(it)
GQLA_preprint/src/vllm_model.py:678
Function_final_hook
(_m, args, kwargs)
GQLA_preprint/src/compression.py:134
Function_hook
(_m, args, kwargs)
GQLA_preprint/src/compression.py:127
Method_init_weights
(self, module)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:528
Method_init_weights
(self, module)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1329
Method_reorder_cache
(past_key_values, beam_idx)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1794
Method_set_cos_sin_cache
(self, seq_len, device, dtype)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:172
Method_set_cos_sin_cache
(self, seq_len, device, dtype)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:201
Method_set_cos_sin_cache
(self, seq_len, device, dtype)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:285
Method_shape
(self, tensor: torch.Tensor, seq_len: int, bsz: int)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:799
Methodapply_multimodal_chat_transformation
Transform a prompt and optional multimodal content into a chat format. This method is used for chat models that expect a specific con
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:71
Functionapply_rotary_pos_emb
Applies Rotary Position Embedding to the query and key tensors. Args: q (`torch.Tensor`): The query tensor. k (`torch.Tensor`): T
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:219
Methodbackward
(ctx, grad_output)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:514
Functionbbh_prompt
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:69
Methodcompute_logits
( self, hidden_states: torch.Tensor, sampling_metadata: SamplingMetadata, )
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:569
Functioneager_attention_forward
( module: nn.Module, query: torch.Tensor, key: torch.Tensor, value: torch.Tensor, attentio
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:258
Methodextra_repr
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:55
Methodforward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.Tensor] = None,
TransMLA_NeurIPS_2025/transmla/partial_rope.py:142
Methodforward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.Tensor] = None,
TransMLA_NeurIPS_2025/transmla/lora_qkv.py:220
Methodforward
( self, hidden_states: torch.Tensor, position_embeddings: Tuple[torch.Tensor, torch.Te
TransMLA_NeurIPS_2025/transmla/transformers/mla.py:76
Methodforward
(self, hidden_states)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:48
Methodforward
(self, x, position_ids)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:79
Methodforward
(self, x)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:105
Methodforward
(self, hidden_states)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:144
Methodforward
(self, hidden_states)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:202
Methodforward
( self, hidden_states: torch.Tensor, position_embeddings: Tuple[torch.Tensor, torch.Te
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:380
Methodforward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.Tensor] = None,
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:471
Methodforward
( self, input_ids: Optional[torch.LongTensor] = None, attention_mask: Optional[torch.T
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:572
Methodforward
r""" labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*): Labels for computing the masked language mo
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:828
Methodforward
(self, x)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:89
Methodforward
(self, hidden_states: torch.Tensor)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:151
Methodforward
( self, positions: torch.Tensor, hidden_states: torch.Tensor, )
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:324
Methodforward
( self, positions: torch.Tensor, hidden_states: torch.Tensor, residual: Option
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:411
Methodforward
( self, input_ids: torch.Tensor, positions: torch.Tensor, intermediate_tensors
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:503
Methodforward
( self, input_ids: torch.Tensor, positions: torch.Tensor, intermediate_tensors
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:558
Methodforward
(self, hidden_states)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:103
Methodforward
(self, x, seq_len=None)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:146
Methodforward
(self, x)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:388
Methodforward
(self, hidden_states)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:420
Methodforward
(ctx, x, loss)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:507
Methodforward
(self, hidden_states)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:568
Methodforward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.Tensor] = None,
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:806
Methodforward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.LongTensor] = None
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:930
Methodforward
Args: hidden_states (`torch.FloatTensor`): input to the layer of shape `(batch, seq_len, embed_dim)` attention_mask (
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1228
Methodforward
( self, input_ids: torch.LongTensor = None, attention_mask: Optional[torch.Tensor] = N
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1451
Methodforward
r""" Args: labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*): Labels for computing
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1635
Methodforward
r""" labels (`torch.LongTensor` of shape `(batch_size,)`, *optional*): Labels for computing the sequence classification/regression
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1838
Methodforward
( self, positions: torch.Tensor, hidden_states: torch.Tensor, llama_4_scaling:
GQLA_preprint/src/vllm_model.py:155
Methodforward
( self, input_ids: torch.Tensor | None, positions: torch.Tensor, intermediate_
GQLA_preprint/src/vllm_model.py:311
Methodforward
( self, positions: torch.Tensor, hidden_states: torch.Tensor, llama_4_scaling:
GQLA_preprint/src/vllm_model.py:523
Methodforward
( self, input_ids: torch.Tensor | None, positions: torch.Tensor, intermediate_
GQLA_preprint/src/vllm_model.py:644
Methodget_decoder
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:823
Methodget_decoder
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1628
Methodget_input_embeddings
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:564
Methodget_input_embeddings
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:808
Methodget_input_embeddings
(self, input_ids: torch.Tensor)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:555
Methodget_input_embeddings
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1444
Methodget_input_embeddings
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1613
Methodget_input_embeddings
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1831
Methodget_output_embeddings
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:814
Methodget_output_embeddings
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1619
Methodget_random_lora_request
Optionally select a random LoRA request and return its associated tokenizer. This method is used when LoRA parameters are pr
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:99
Functionis_valid_sequence
Validate a sequence based on prompt and output lengths. Default pruning criteria are copied from the original `sample_hf_requests` and `
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:186
Methodload_data
Load data from the dataset path into self.data. This method must be overridden by subclasses since the method to load data w
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:85
Methodload_weights
(self, weights: Iterable[Tuple[str, torch.Tensor]])
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:600
Methodload_weights
(self, weights)
GQLA_preprint/src/vllm_model.py:671
Methodmake_empty_intermediate_tensors
( self, batch_size: int, dtype: torch.dtype, device: torch.device)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:586
Methodmaybe_oversample_requests
Oversamples the list of requests if its size is less than the desired number. Args: requests (List[SampleRequest
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:162
Functionmmlu_cloze_prompt
MMLU prompt without choices
TransMLA_NeurIPS_2025/lighteval/tasks.py:55
Functionmmlu_pro_mc_prompt
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:38
Methodpadding_ret
(ret)
TransMLA_NeurIPS_2025/training/train.py:48
Methodprepare_inputs_for_generation
( self, input_ids, past_key_values=None, attention_mask=None, inputs_e
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1729
Functionpreprocess_function
(examples, tokenizer, seq_len)
TransMLA_NeurIPS_2025/training/train.py:8
Functionprocess_image
Process a single image input and return a multimedia content dictionary. Supports three input types: 1. Dictionary with raw image bytes
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:222
Functionprompt_commonsense_qa
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:29
Functionprompt_hellaswag
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:11
Functionprompt_math
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:77
Functionrepeat_kv
This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:668
Methodsample
Abstract method to generate sample requests from the dataset. Subclasses must override this method to implement dataset-specific log
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:143
Methodsample
( self, logits: Optional[torch.Tensor], sampling_metadata: SamplingMetadata, )
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:578
Methodset_decoder
(self, decoder)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:820
Methodset_decoder
(self, decoder)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1625
Methodset_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:567
Methodset_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:811
Methodset_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1447
Methodset_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1616
Methodset_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1834
Methodset_output_embeddings
(self, new_embeddings)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:817
Methodset_output_embeddings
(self, new_embeddings)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1622
Functiontokenize
(data_batch)
TransMLA_NeurIPS_2025/transmla/utils.py:163
← previousnext →201–300 of 302, ranked by callers