MCPcopy Create free account

hub / github.com/MuLabPKU/TransArch / types & classes

Types & classes76 in github.com/MuLabPKU/TransArch

↓ 7 callersClassDeepseekV3RMSNorm
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:39
↓ 5 callersClassDeepseekV2RMSNorm
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:94
↓ 4 callersClassDeepseekV2MLP
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:374
↓ 3 callersClassDeepseekV3MLP
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:93
↓ 3 callersClassMLAAttention
Modified from `transformers.models.llama.modeling_deepseek_v3.DeepseekV3Attention` add support for attention bias and softcapping
TransMLA_NeurIPS_2025/transmla/transformers/mla.py:22
↓ 2 callersClassDeepseekV2MLP
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:61
↓ 2 callersClassDeepseekV2Model
Transformer decoder consisting of *config.num_hidden_layers* layers. Each layer is a [`DeepseekV2DecoderLayer`] Args: config: Deepse
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1415
↓ 1 callersClassDataCollatorWithFlattening
Data collator used for padding free approach. Does the following: - concatate the entire mini batch into single long sequence [1, total_toke
TransMLA_NeurIPS_2025/training/train.py:26
↓ 1 callersClassDeepseekV2DecoderLayer
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:348
↓ 1 callersClassDeepseekV2DecoderLayer
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1197
↓ 1 callersClassDeepseekV2DynamicNTKScalingRotaryEmbedding
DeepseekV2RotaryEmbedding extended with Dynamic NTK scaling. Credits to the Reddit users /u/bloc97 and /u/emozilla
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:187
↓ 1 callersClassDeepseekV2LinearScalingRotaryEmbedding
DeepseekV2RotaryEmbedding extended with linear scaling. Credits to the Reddit user /u/kaiokendev
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:158
↓ 1 callersClassDeepseekV2MoE
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:96
↓ 1 callersClassDeepseekV2MoE
A mixed expert module containing shared experts.
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:521
↓ 1 callersClassDeepseekV2Model
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:457
↓ 1 callersClassDeepseekV2RotaryEmbedding
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:114
↓ 1 callersClassDeepseekV2YarnRotaryEmbedding
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:262
↓ 1 callersClassDeepseekV3Attention
Multi-headed attention from 'Attention Is All You Need' paper
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:328
↓ 1 callersClassDeepseekV3DecoderLayer
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:456
↓ 1 callersClassDeepseekV3MoE
A mixed expert module containing shared experts.
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:157
↓ 1 callersClassDeepseekV3Model
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:545
↓ 1 callersClassDeepseekV3RotaryEmbedding
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:59
↓ 1 callersClassDeepseekV3TopkRouter
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:110
↓ 1 callersClassGemma2MLADecoderLayer
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:22
↓ 1 callersClassGemma2MLAModel
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:35
↓ 1 callersClassGlm4MoeLiteGQLAAbsorbAttention
GLM-4.7-Flash attention serving a GQLA checkpoint via MLA absorb. Same shapes as vanilla MLA — ``kv_b_proj`` is sized for ``num_heads`` and w
GQLA_preprint/src/vllm_model.py:409
↓ 1 callersClassGlm4MoeLiteGQLAAbsorbDecoderLayer
Swap in GQLA-absorb attention; reuse parent forward + MoE/MLP wiring.
GQLA_preprint/src/vllm_model.py:532
↓ 1 callersClassGlm4MoeLiteGQLAAbsorbModel
Standalone twin of Glm4MoeLiteModel for the GQLA-absorb path. Cannot subclass Glm4MoeLiteModel directly (it is @support_torch_compile- decora
GQLA_preprint/src/vllm_model.py:598
↓ 1 callersClassGlm4MoeLiteGQLAAttention
GQLA_preprint/src/modeling.py:22
↓ 1 callersClassGlm4MoeLiteGQLAAttention
GLM-4.7-Flash attention with GQA-shaped KV. Requires q LoRA (always true on GLM-4.7).
GQLA_preprint/src/vllm_model.py:64
↓ 1 callersClassGlm4MoeLiteGQLADecoderLayer
GQLA_preprint/src/modeling.py:32
↓ 1 callersClassGlm4MoeLiteGQLADecoderLayer
Swap in GQLA attention; reuse parent forward + MoE/MLP wiring.
GQLA_preprint/src/vllm_model.py:199
↓ 1 callersClassGlm4MoeLiteGQLAModel
GQLA_preprint/src/modeling.py:38
↓ 1 callersClassGlm4MoeLiteGQLAModel
Standalone twin of Glm4MoeLiteModel. Cannot subclass it because the parent is @support_torch_compile-decorated; subclassing would break the c
GQLA_preprint/src/vllm_model.py:266
↓ 1 callersClassLlamaMLADecoderLayer
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:22
↓ 1 callersClassLlamaMLAModel
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:35
↓ 1 callersClassLoraQKV
TransMLA_NeurIPS_2025/transmla/lora_qkv.py:20
↓ 1 callersClassMixtralMLADecoderLayer
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:22
↓ 1 callersClassMixtralMLAModel
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:35
↓ 1 callersClassMoEGate
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:393
↓ 1 callersClassPartialRope
TransMLA_NeurIPS_2025/transmla/partial_rope.py:47
↓ 1 callersClassSampleRequest
Represents a single inference request for benchmarking.
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:30
↓ 1 callersClassTestDataset
TransMLA_NeurIPS_2025/transmla/utils.py:77
↓ 1 callersClassTestDataset
CLOVER_ICML_2025/src/data.py:80
↓ 1 callersClass_DS
GQLA_preprint/src/compression.py:629
ClassAddAuxiliaryLoss
The trick function of adding auxiliary (aux) loss, which includes the gradient of the aux loss during backpropagation.
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:500
ClassBenchmarkDataset
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:47
ClassCustomMMLUEvaluationTask
TransMLA_NeurIPS_2025/lighteval/tasks.py:305
ClassDeepseekV2Attention
Multi-headed attention from 'Attention Is All You Need' paper
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:683
ClassDeepseekV2Config
r""" This is the configuration class to store the configuration of a [`DeepseekV2Model`]. It is used to instantiate an DeepSeek model accordin
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/configuration_deepseek.py:7
ClassDeepseekV2FlashAttention2
DeepseekV2 flash attention module. This module inherits from `DeepseekV2Attention` as the weights of the module stays untouched. The only req
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:915
ClassDeepseekV2ForCausalLM
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:534
ClassDeepseekV2ForCausalLM
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1601
ClassDeepseekV2ForSequenceClassification
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1821
ClassDeepseekV2MLAAttention
Main reference: DeepseekV2 paper, and FlashInfer Implementation (https://arxiv.org/abs/2405.04434 and https://github.com/flashinfer-ai/flashi
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:188
ClassDeepseekV2PreTrainedModel
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1320
ClassDeepseekV3Config
r""" This is the configuration class to store the configuration of a [`DeepseekV3Model`]. It is used to instantiate an DeepSeek model accordin
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/configuration_deepseek_v3.py:26
ClassDeepseekV3ForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:794
ClassDeepseekV3ForCausalLM
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:689
ClassDeepseekV3PreTrainedModel
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:514
ClassGemma2MLAConfig
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/configuration_gemma2mla.py:3
ClassGemma2MLAForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:45
ClassGemma2MLAPreTrainedModel
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:29
ClassGlm4MoeLiteGQLAAbsorbForCausalLM
Top-level causal LM serving a GQLA checkpoint via MLA absorb.
GQLA_preprint/src/vllm_model.py:687
ClassGlm4MoeLiteGQLAForCausalLM
GQLA_preprint/src/modeling.py:47
ClassGlm4MoeLiteGQLAForCausalLM
Top-level causal LM. Same as parent except ``self.model``.
GQLA_preprint/src/vllm_model.py:342
ClassGqlaLayout
GQLA_preprint/src/compression.py:36
ClassKwargsForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:790
ClassLlamaMLAConfig
TransMLA_NeurIPS_2025/transmla/transformers/llama/configuration_llamamla.py:3
ClassLlamaMLAForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:45
ClassLlamaMLAPreTrainedModel
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:29
ClassMixtralMLAConfig
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/configuration_mixtralmla.py:3
ClassMixtralMLAForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:45
ClassMixtralMLAPreTrainedModel
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:29
ClassRandomDataset
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:271
ClassTrainingArguments
TransMLA_NeurIPS_2025/training/train.py:79