MCPcopy Create free account

hub / github.com/WailordHe/DenseSSM / functions

Functions107 in github.com/WailordHe/DenseSSM

↓ 7 callersMethod__init__
LlamaRMSNorm is equivalent to T5LayerNorm
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:76
↓ 7 callersMethod__init__
LlamaRMSNorm is equivalent to T5LayerNorm
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:76
↓ 2 callersFunctionaccuracy
(predictions, references, normalize=True, sample_weight=None)
train.py:224
↓ 2 callersMethodgenerate
( self, input_ids: Optional[torch.Tensor] = None, parallel_compute_prompt=
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:855
↓ 2 callersMethodget_input_embeddings
(self)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:697
↓ 2 callersMethodget_output_embeddings
(self)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:703
↓ 2 callersFunctiontheta_shift
(x, sin, cos)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:98
↓ 2 callersFunctiontheta_shift
(x, sin, cos)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:98
↓ 1 callersFunction_expand_mask
Expands attention_mask from `[bsz, seq_len]` to `[bsz, 1, tgt_seq_len, src_seq_len]`.
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:61
↓ 1 callersFunction_expand_mask
Expands attention_mask from `[bsz, seq_len]` to `[bsz, 1, tgt_seq_len, src_seq_len]`.
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:61
↓ 1 callersFunction_make_causal_mask
Make causal mask used for bi-directional self-attention.
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:43
↓ 1 callersFunction_make_causal_mask
Make causal mask used for bi-directional self-attention.
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:43
↓ 1 callersMethod_prepare_decoder_attention_mask
(self, attention_mask, input_shape, inputs_embeds, past_key_values_length)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:504
↓ 1 callersMethod_prepare_decoder_attention_mask
(self, attention_mask, input_shape, inputs_embeds, past_key_values_length)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:504
↓ 1 callersFunction_tokenize_fn
Tokenize a list of strings.
train.py:377
↓ 1 callersFunctioncompute_acc
(eval_preds)
train.py:231
↓ 1 callersFunctioncompute_ppl
(eval_preds)
train.py:241
↓ 1 callersFunctionmain
()
inference_test.py:7
↓ 1 callersMethodparallel_forward
(self, qr, kr, v, mask)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:252
↓ 1 callersMethodparallel_forward
(self, qr, kr, v, mask)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:252
↓ 1 callersMethodrecurrent_forward
( self, qr, kr, v, decay, past_key_value, )
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:226
↓ 1 callersMethodrecurrent_forward
( self, qr, kr, v, decay, past_key_value, )
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:226
↓ 1 callersMethodreset_parameters
(self)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:155
↓ 1 callersMethodreset_parameters
(self)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:155
↓ 1 callersFunctionrotate_every_two
(x)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:93
↓ 1 callersFunctionrotate_every_two
(x)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:93
↓ 1 callersMethodsample_token
(self, logit, do_sample=False, top_k=1, top_p=1.0, temperature=1.0)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:848
↓ 1 callersMethodsample_token
(self, logit, do_sample=False, top_k=1, top_p=1.0, temperature=1.0)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:848
↓ 1 callersFunctionsmart_tokenizer_and_embedding_resize
Resize tokenizer and embedding. Note: This is the unoptimized version that may make your embedding size not be divisible by 64.
train.py:354
↓ 1 callersFunctionsmart_tokenizer_and_embedding_resize
( special_tokens_dict: Dict, tokenizer: transformers.PreTrainedTokenizer, model: trans
inference_test.py:13
↓ 1 callersFunctiontrain
()
train.py:420
Method__init__
(self, input_dim, mid_reduction_ratio=16, final_reduction_ratio=4)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:104
Method__init__
(self, config: LlamaConfig)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:119
Method__init__
(self, config: LlamaConfig)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:268
Method__init__
(self, decoder_embed_dim, decoder_retention_heads, query_key_dim)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:425
Method__init__
(self, config: LlamaConfig)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:464
Method__init__
(self, config)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:688
Method__init__
(self, config)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:908
Method__init__
(self, input_dim, mid_reduction_ratio=16, final_reduction_ratio=4)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:104
Method__init__
(self, config: LlamaConfig)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:119
Method__init__
(self, config: LlamaConfig)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:268
Method__init__
(self, decoder_embed_dim, decoder_retention_heads, query_key_dim)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:425
Method__init__
(self, config: LlamaConfig)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:464
Method__init__
(self, config)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:688
Method__init__
(self, config)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:908
Method__post_init__
(self)
train.py:135
Method__post_init__
(self)
train.py:206
Method_init_weights
(self, module)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:344
Method_init_weights
(self, module)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:344
Method_reorder_cache
(past_key_values, beam_idx)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:840
Method_reorder_cache
(past_key_values, beam_idx)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:840
Method_set_gradient_checkpointing
(self, module, value=False)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:355
Method_set_gradient_checkpointing
(self, module, value=False)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:355
Method_shape
(self, tensor: torch.Tensor, seq_len: int, bsz: int)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:222
Method_shape
(self, tensor: torch.Tensor, seq_len: int, bsz: int)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:222
Functioncompute_llama_ppl
calculate chunk wise PPL, and average across chunked examples
train.py:276
Functioncompute_metrics
(eval_preds)
train.py:288
Functioncompute_multi_metrics
calculate LLM accuracy and PPL. GPU always OOM as logits is large
train.py:263
Methodcreate_custom_forward
(module)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:620
Methodcreate_custom_forward
(module)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:620
Methodcustom_forward
(*inputs)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:621
Methodcustom_forward
(*inputs)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:621
Functionfault_tolerance_data_collator
(features: List)
train.py:310
Methodforward
(self, hidden_states)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:84
Methodforward
(self, x)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:109
Methodforward
( self, forward_impl: 'parallel', hidden_states: torch.Tensor,
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:169
Methodforward
( self, hidden_states: torch.Tensor, rel_pos=None, attention_m
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:278
Methodforward
(self, slen, activate_recurrent=False)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:433
Methodforward
( self, forward_impl: Optional[str] = 'parallel', input_ids: torch.LongTen
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:533
Methodforward
r""" Args: labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*): Labels for computing
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:717
Methodforward
r""" labels (`torch.LongTensor` of shape `(batch_size,)`, *optional*): Labels for computing the sequence classification/regression
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:924
Methodforward
(self, hidden_states)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:84
Methodforward
(self, x)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:109
Methodforward
( self, forward_impl: 'parallel', hidden_states: torch.Tensor,
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:169
Methodforward
( self, hidden_states: torch.Tensor, rel_pos=None, attention_m
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:278
Methodforward
(self, slen, activate_recurrent=False)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:433
Methodforward
( self, forward_impl: Optional[str] = 'parallel', input_ids: torch.LongTen
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:533
Methodforward
r""" Args: labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*): Labels for computing
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:717
Methodforward
r""" labels (`torch.LongTensor` of shape `(batch_size,)`, *optional*): Labels for computing the sequence classification/regression
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:924
Methodgenerate
( self, input_ids: Optional[torch.Tensor] = None, parallel_compute_prompt=
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:855
Methodget_decoder
(self)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:712
Methodget_decoder
(self)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:712
Methodget_input_embeddings
(self)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:497
Methodget_input_embeddings
(self)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:917
Methodget_input_embeddings
(self)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:497
Methodget_input_embeddings
(self)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:697
Methodget_input_embeddings
(self)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:917
Methodget_output_embeddings
(self)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:703
Functiongroup_texts
(examples)
train.py:507
Methodis_first_step
(self, incremental_state)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:527
Methodis_first_step
(self, incremental_state)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:527
Methodprepare_inputs_for_generation
( self, input_ids, past_key_values=None, attention_mask=None, inputs_embeds=None, **kwargs )
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:809
Methodprepare_inputs_for_generation
( self, input_ids, past_key_values=None, attention_mask=None, inputs_embeds=None, **kwargs )
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:809
Functionpreprocess
Preprocess the data by tokenizing.
train.py:401
Functionpreprocess_logits_for_llama_ppl
(logits, labels)
train.py:303
Functionpreprocess_logits_for_metrics
(logits, labels)
train.py:296
Methodset_decoder
(self, decoder)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:709
Methodset_decoder
(self, decoder)
modeling/dense_gau_retnet_350m/modeling_dense_gau_retnet.py:709
Methodset_input_embeddings
(self, value)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:500
Methodset_input_embeddings
(self, value)
modeling/dense_gau_retnet_1p3b/modeling_dense_gau_retnet.py:700
next →1–100 of 107, ranked by callers