MCPcopy Create free account

hub / github.com/OpenSparseLLMs/Linear-MoE / functions

Functions1,498 in github.com/OpenSparseLLMs/Linear-MoE

↓ 1 callersFunctionyarn_linear_ramp_mask
(min, max, dim)
linear_moe/model/deepseek_v2/yarn_rotary_pos_embedding.py:89
↓ 1 callersFunctionyield_from_files
(fnames: list, semaphore)
toolkits/pretrain_data_preprocessing/preprocess_data.py:169
↓ 1 callersFunctionyielder
(fname, semaphore)
toolkits/pretrain_data_preprocessing/preprocess_data.py:170
MethodTokenToId
(self, token)
linear_moe/tokenizer/icetk_glm130b_tokenizer.py:319
Method__call__
(self, output_ids: torch.LongTensor, scores: torch.FloatTensor, **kwargs)
linear_moe/data/llava/mm_utils.py:102
Method__call__
(self, text, return_tensors=None, padding=None, max_length=None, truncation=None, add
linear_moe/tokenizer/__init__.py:184
Method__call__
(self, text, return_tensors=None, padding=None, max_length=None, truncation=None, add
linear_moe/tokenizer/__init__.py:245
Method__call__
(self, text, return_tensors=None, padding=None, max_length=None, truncation=None, add
linear_moe/tokenizer/__init__.py:337
Method__call__
(self, text, return_tensors=None, padding=None, max_length=None, truncation=None, add
linear_moe/tokenizer/__init__.py:410
Method__getitem__
(self, idx)
linear_moe/data/bloom.py:43
Method__getitem__
(self, idx)
linear_moe/data/llama.py:120
Method__getitem__
(self, idx)
linear_moe/data/llama.py:269
Method__getitem__
Returns the item at the given index. Args: idx (int): The index of the item to return. Returns: A dic
linear_moe/data/glm.py:85
Method__getitem__
(self, idx)
linear_moe/data/glm.py:146
Method__getitem__
(self, idx)
linear_moe/data/glm.py:262
Method__getitem__
(self, i)
linear_moe/data/qwen_vl.py:113
Method__getitem__
(self, idx)
linear_moe/data/starcoder.py:83
Method__getitem__
(self, i)
linear_moe/data/llava/mm_pretrain_dataset.py:214
Method__getitem__
(self, x: Union[int, str])
linear_moe/tokenizer/icetk_glm130b_tokenizer.py:242
Method__getstate__
(self)
linear_moe/tokenizer/tokenization_baichuan.py:72
Method__getstate__
(self)
linear_moe/tokenizer/tokenization_yi.py:85
Method__init__
(self, args)
toolkits/pretrain_data_preprocessing/preprocess_data_megatron.py:33
Method__init__
(self, args, workers)
toolkits/pretrain_data_preprocessing/preprocess_data_megatron.py:98
Method__init__
(self, args)
toolkits/pretrain_data_preprocessing/preprocess_data.py:34
Method__init__
( self, vocab_size=250880, hidden_size=64, n_layer=2, n_head=8,
toolkits/model_checkpoints_convertor/falcon40b/configuration_RW.py:31
Method__init__
(self, config)
toolkits/model_checkpoints_convertor/llama/hf_llama_moe/llama_moe.py:11
Method__init__
( self, vocab_size=64000, hidden_size=5120, intermediate_size=13696, n
toolkits/model_checkpoints_convertor/baichuan/configuration_baichuan.py:10
Method__init__
( self, vocab_size=250880, hidden_size=64, n_layer=2, n_head=8,
toolkits/model_checkpoints_convertor/falcon/configuration_RW.py:90
Method__init__
( self, vocab_size=64000, hidden_size=5120, intermediate_size=13696, n
toolkits/model_checkpoints_convertor/baichuan2/configuration_baichuan.py:10
Method__init__
(self, path: str = None, hf_cache_dir: Optional[str] = None,
eval/models/qwen2_linear_moe.py:46
Method__init__
( self, pretrained: Optional[Union[str, transformers.PreTrainedModel]] = "gpt2", max_l
linear_moe/lm_evaluate.py:42
Method__init__
( self, config, submodules: MomLinearAttentionSubmodules, layer_number=None,
linear_moe/sequence_modeling/mom_linear_attention.py:133
Method__init__
( self, config, submodules: LinearAttentionSubmodules, layer_number=None,
linear_moe/sequence_modeling/linear_attention.py:25
Method__init__
( self, config: TransformerConfig, submodules: MambaStackSubmodules, mamba_ssm
linear_moe/sequence_modeling/ssm.py:74
Method__init__
( self, config, submodules: LinearRNNSubmodules, layer_number=None, )
linear_moe/sequence_modeling/linear_rnn.py:33
Method__init__
( self, config, expand_ratio: Optional[int] = 128, )
linear_moe/sequence_modeling/hgrn2/hgrn2.py:16
Method__init__
( self, config: TransformerConfig, layer_number: int, attn_mask_type: AttnMask
linear_moe/sequence_modeling/attention/dot_product_attention.py:34
Method__init__
( self, config: TransformerConfig, submodules: MambaStackSubmodules, mamba_ssm
linear_moe/sequence_modeling/mamba2/mamba_block.py:74
Method__init__
( self, config: TransformerConfig, mamba_stack_spec: ModuleSpec, vocab_size: i
linear_moe/sequence_modeling/mamba2/mamba_model.py:39
Method__init__
(self, key)
linear_moe/sequence_modeling/mamba2/triton_cache_manager.py:33
Method__init__
( self, config: TransformerConfig, submodules: MambaMixerSubmodules, d_model,
linear_moe/sequence_modeling/mamba2/mamba_mixer.py:55
Method__init__
Top level Mamba Layer
linear_moe/sequence_modeling/mamba2/mamba_layer.py:28
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, )
linear_moe/sequence_modeling/rwkv7/rwkv7.py:16
Method__init__
( self, config, input_dim: int, output_dim: int, low_rank_dim: int,
linear_moe/sequence_modeling/rwkv7/lora_mlp.py:12
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, chunk_s
linear_moe/sequence_modeling/gated_deltanet/gated_deltanet.py:35
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, )
linear_moe/sequence_modeling/based/based.py:14
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, chunk_s
linear_moe/sequence_modeling/deltanet/deltanet.py:36
Method__init__
( self, input_dim: int, output_dim: int, low_rank_dim: Optional[int] = None
linear_moe/sequence_modeling/rwkv6/dd_lerp_linear.py:12
Method__init__
( self, config, input_dim: int, output_dim: int, low_rank_dim: Optiona
linear_moe/sequence_modeling/rwkv6/dd_lerp_linear.py:49
Method__init__
( self, config, expand_k: float = 0.5, expand_v: float = 1.0, )
linear_moe/sequence_modeling/rwkv6/rwkv6.py:16
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, )
linear_moe/sequence_modeling/basic_linear_attention/basic_linear_attention.py:17
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, use_gam
linear_moe/sequence_modeling/rebased/rebased.py:14
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, )
linear_moe/sequence_modeling/lasp2/lasp2.py:14
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, )
linear_moe/sequence_modeling/gla/gla.py:16
Method__init__
(self, config)
linear_moe/sequence_modeling/gla/gla_gate.py:11
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, )
linear_moe/sequence_modeling/lightning_attention/lightning_attention.py:15
Method__init__
( self, config, expand_k: float = 1.0, expand_v: float = 1.0, )
linear_moe/sequence_modeling/retention/retention.py:17
Method__init__
(self)
linear_moe/generation/gpt_predictor.py:29
Method__init__
(self)
linear_moe/model/mixtral/transformer_layer.py:60
Method__init__
( self, config: TransformerConfig, submodules: TransformerLayerSubmodules, lay
linear_moe/model/mixtral/transformer_layer.py:71
Method__init__
Mixtral is equivalent to T5LayerNorm
linear_moe/model/mixtral/rms_norm.py:5
Method__init__
( self, config: TransformerConfig, spec: Union[TransformerBlockSubmodules, ModuleSpec]
linear_moe/model/mixtral/transformer_block.py:107
Method__init__
( self, config: TransformerConfig, transformer_layer_spec: ModuleSpec, vocab_s
linear_moe/model/mixtral/model.py:49
Method__init__
( self, config: TransformerConfig, submodules: HybridTransformerBlockSubmodules,
linear_moe/model/mixtral/hybrid/hybrid_transformer_block.py:90
Method__init__
( self, config: TransformerConfig, hybrid_transformer_layer_spec: ModuleSpec,
linear_moe/model/mixtral/hybrid/hybrid_model.py:47
Method__init__
( self, config: TransformerConfig, submodules: SelfAttentionSubmodules, layer_
linear_moe/model/mixtral/transformer/attention.py:352
Method__init__
( self, config: TransformerConfig, submodules: CrossAttentionSubmodules, layer
linear_moe/model/mixtral/transformer/attention.py:527
Method__init__
( self, config: TransformerConfig, submodules: MLPSubmodules, is_expert: bool
linear_moe/model/mixtral/transformer/mlp.py:57
Method__init__
Initialize the zero token dropping router. Args: num_local_experts (int): The number of experts in the local process/gro
linear_moe/model/mixtral/moe/token_dispatcher.py:72
Method__init__
(self, num_local_experts, config: TransformerConfig, submodules: MLPSubmodules)
linear_moe/model/mixtral/moe/experts.py:177
Method__init__
(self, config: TransformerConfig)
linear_moe/model/mixtral/moe/moe_layer.py:34
Method__init__
Initialize the zero token dropping router. Args: num_local_experts (int): The number of local experts. local_expert_i
linear_moe/model/mixtral/moe/router.py:103
Method__init__
(self)
linear_moe/model/qwen2/transformer_layer.py:60
Method__init__
( self, config: TransformerConfig, submodules: TransformerLayerSubmodules, lay
linear_moe/model/qwen2/transformer_layer.py:71
Method__init__
Qwen2RMSNorm is equivalent to T5LayerNorm
linear_moe/model/qwen2/rms_norm.py:5
Method__init__
( self, config: TransformerConfig, spec: Union[TransformerBlockSubmodules, ModuleSpec]
linear_moe/model/qwen2/transformer_block.py:107
Method__init__
( self, config: TransformerConfig, transformer_layer_spec: ModuleSpec, vocab_s
linear_moe/model/qwen2/model.py:49
Method__init__
( self, config: TransformerConfig, submodules: HybridTransformerBlockSubmodules,
linear_moe/model/qwen2/hybrid/hybrid_transformer_block.py:90
Method__init__
( self, config: TransformerConfig, hybrid_transformer_layer_spec: ModuleSpec,
linear_moe/model/qwen2/hybrid/hybrid_model.py:47
Method__init__
( self, config: TransformerConfig, submodules: SelfAttentionSubmodules, layer_
linear_moe/model/qwen2/transformer/attention.py:352
Method__init__
( self, config: TransformerConfig, submodules: CrossAttentionSubmodules, layer
linear_moe/model/qwen2/transformer/attention.py:527
Method__init__
( self, config: TransformerConfig, submodules: MLPSubmodules, is_expert: bool
linear_moe/model/qwen2/transformer/mlp.py:57
Method__init__
Initialize the zero token dropping router.
linear_moe/model/qwen2/moe/token_dispatcher.py:74
Method__init__
Initialize the AlltoAll token dispatcher. Args: num_local_experts (int): Number of local experts on the current device.
linear_moe/model/qwen2/moe/token_dispatcher.py:299
Method__init__
(self, num_local_experts, config: TransformerConfig, submodules: MLPSubmodules)
linear_moe/model/qwen2/moe/experts.py:196
Method__init__
(self, config: TransformerConfig, layer_number: int = None)
linear_moe/model/qwen2/moe/moe_layer.py:44
Method__init__
Initialize the zero token dropping router. Args: config (TransformerConfig): The configuration for the transformer model.
linear_moe/model/qwen2/moe/router.py:183
Method__init__
( self, dim, max_position_embeddings=2048, base=10000, device=None,
linear_moe/model/deepseek_v2/yarn_rotary_pos_embedding.py:99
Method__init__
(self)
linear_moe/model/deepseek_v2/transformer_layer.py:63
Method__init__
( self, config: TransformerConfig, submodules: TransformerLayerSubmodules, lay
linear_moe/model/deepseek_v2/transformer_layer.py:74
Method__init__
DeepseekV2RMSNorm is equivalent to T5LayerNorm
linear_moe/model/deepseek_v2/rms_norm.py:5
Method__init__
( self, config: TransformerConfig, spec: Union[TransformerBlockSubmodules, ModuleSpec]
linear_moe/model/deepseek_v2/transformer_block.py:108
Method__init__
( self, config: TransformerConfig, transformer_layer_spec: ModuleSpec, vocab_s
linear_moe/model/deepseek_v2/model.py:41
Method__init__
( self, config: TransformerConfig, submodules: HybridTransformerBlockSubmodules,
linear_moe/model/deepseek_v2/hybrid/hybrid_transformer_block.py:88
Method__init__
( self, config: TransformerConfig, hybrid_transformer_layer_spec: ModuleSpec,
linear_moe/model/deepseek_v2/hybrid/hybrid_model.py:34
Method__init__
( self, config: TransformerConfig, submodules: SelfAttentionSubmodules, layer_
linear_moe/model/deepseek_v2/transformer/attention.py:235
Method__init__
( self, config: TransformerConfig, submodules: MLPSubmodules, is_expert: bool
linear_moe/model/deepseek_v2/transformer/mlp.py:58
Method__init__
Initialize the zero token dropping router.
linear_moe/model/deepseek_v2/moe/token_dispatcher.py:73
Method__init__
Initialize the AlltoAll token dispatcher. Args: num_local_experts (int): Number of local experts on the current device.
linear_moe/model/deepseek_v2/moe/token_dispatcher.py:293
Method__init__
Initialize the zero token dropping router. Args: config (TransformerConfig): The configuration for the transformer model.
linear_moe/model/deepseek_v2/moe/router_old.py:108
← previousnext →701–800 of 1,498, ranked by callers