MCPcopy Create free account

hub / github.com/JonasGeiping/cramming / functions

Functions411 in github.com/JonasGeiping/cramming

Method__init__
(self, param: Tensor)
cramming/backend/optimizers/shampoo/shampoo_utils.py:645
Method__init__
( self, param: Tensor, epsilon: float, beta2: float = 1.0, use_bias_co
cramming/backend/optimizers/shampoo/shampoo_utils.py:659
Method__init__
(self, param, epsilon: float, beta2: float)
cramming/backend/optimizers/shampoo/shampoo_utils.py:684
Method__init__
(self, param, epsilon: float, beta2: float)
cramming/backend/optimizers/shampoo/shampoo_utils.py:689
Method__init__
( self, params, lr: float = 1e-2, betas: Tuple[float, float] = (0.9, 1.0),
cramming/backend/optimizers/shampoo/shampoo.py:63
Method__init__
(self, sentences, model, mask_id, device, sweep_order)
cramming/data/generation_gibbs.py:12
Method__init__
Initialize with a given pytorch dataset.
cramming/data/lmdb_datasets.py:29
Method__init__
Initialize with a given pytorch dataset. The setup dictionary determines cache location and storage type.
cramming/data/cached_datasets.py:30
Method__init__
(self, hidden_size: int, cfg_attention, use_bias: bool = True, length_factor: float = 1.0)
cramming/architectures/funnel_transformers.py:27
Method__init__
(self, cfg_arch)
cramming/architectures/funnel_transformers.py:92
Method__init__
(self, ignore_index=-100, z_loss_factor=1e-4)
cramming/architectures/losses.py:12
Method__init__
Parameters as in Hui&Belkin, 2021, but k=1, and M=sqrt(C) (so maybe not really Hui&Belkin?)
cramming/architectures/losses.py:34
Method__init__
Parameters as in Hui&Belkin, 2021, but k=1, and M=sqrt(C) (so maybe not really Hui&Belkin?)
cramming/architectures/losses.py:60
Method__init__
Overrelax parameter is quite a bit speculative...
cramming/architectures/losses.py:111
Method__init__
(self, gamma: float = 5.0, size_average: bool = True, ignore_index: int = -100)
cramming/architectures/losses.py:159
Method__init__
(self, cfg_arch_container: dict = {}, **kwargs)
cramming/architectures/scriptable_bert.py:41
Method__init__
(self, config)
cramming/architectures/scriptable_bert.py:143
Method__init__
(self, config)
cramming/architectures/scriptable_bert.py:227
Method__init__
(self, config)
cramming/architectures/scriptable_bert.py:305
Method__init__
(self, hidden_size)
cramming/architectures/attention.py:56
Method__init__
(self, hidden_size, cfg_attention)
cramming/architectures/attention.py:69
Method__init__
(self, hidden_size, cfg_attention)
cramming/architectures/attention.py:90
Method__init__
(self, hidden_size: int, cfg_attention)
cramming/architectures/attention.py:126
Method__init__
(self, hidden_size, cfg_attention)
cramming/architectures/attention.py:274
Method__init__
(self, hidden_size, cfg_attention, length_factor=1.0)
cramming/architectures/attention.py:334
Method__init__
(self, hidden_size, cfg_attention)
cramming/architectures/attention.py:400
Method__init__
( self, hidden_size, cfg_attention, )
cramming/architectures/attention.py:461
Method__init__
( self, hidden_size, cfg_attention, )
cramming/architectures/attention.py:499
Method__init__
(self, hidden_size, cfg_attention)
cramming/architectures/attention.py:536
Method__init__
( self, hidden_size, cfg_attention, )
cramming/architectures/attention.py:582
Method__init__
(self, seq_op_in_fp32=False)
cramming/architectures/attention.py:680
Method__init__
Normalized attention pooling as described in Richter&Wattenhofer, 2020.
cramming/architectures/attention.py:699
Method__init__
(self, seq_op_in_fp32)
cramming/architectures/attention.py:725
Method__init__
(self, seq_op_in_fp32)
cramming/architectures/attention.py:738
Method__init__
(self, seq_op_in_fp32)
cramming/architectures/attention.py:751
Method__init__
(self, width, vocab_size)
cramming/architectures/sanity_check.py:9
Method__init__
(self, idx, cfg_arch)
cramming/architectures/recurrent_transformers.py:43
Method__init__
(self, cfg_arch)
cramming/architectures/recurrent_transformers.py:94
Method__init__
(self, list_of_modules)
cramming/architectures/recurrent_transformers.py:281
Method__init__
(self, embedding_dim, max_seq_length=5000)
cramming/architectures/embeddings.py:16
Method__init__
(self, embedding_dim, max_seq_length)
cramming/architectures/embeddings.py:44
Method__init__
(self, embedding_dim, max_seq_length=1024)
cramming/architectures/embeddings.py:64
Method__init__
(self, dim, base=10000, def_seq_length=128, seq_dim: int = 0)
cramming/architectures/embeddings.py:135
Method__init__
(self, dim_model: int, *_, **__)
cramming/architectures/embeddings.py:199
Method__init__
(self, idx, cfg_arch)
cramming/architectures/fixed_cramlm.py:33
Method__init__
(self, encoder, cfg_arch)
cramming/architectures/fixed_cramlm.py:87
Method__init__
(self, encoder, cfg_arch)
cramming/architectures/fixed_cramlm.py:148
Method__init__
(self, cfg_embedding, norm, norm_eps)
cramming/architectures/components.py:16
Method__init__
(self, idx, hidden_size, cfg_attention, use_bias=True)
cramming/architectures/components.py:49
Method__init__
(self, hidden_size, intermed_size, nonlin_fn=torch.nn.GELU, use_bias=True)
cramming/architectures/components.py:72
Method__init__
(self, idx, cfg_arch)
cramming/architectures/components.py:89
Method__init__
(self, idx, cfg_arch)
cramming/architectures/components.py:160
Method__init__
(self, cfg_head, main_model_hidden_size)
cramming/architectures/components.py:177
Method__init__
(self, cfg_arch)
cramming/architectures/components.py:202
Method__init__
(self, hidden_size: int, eps: float = 1e-5)
cramming/architectures/components.py:295
Method__init__
(self, hidden_size: int, eps: float = 1e-8)
cramming/architectures/components.py:308
Method__init__
(self, list_of_modules)
cramming/architectures/components.py:321
Method__len__
Draw length from target dataset.
cramming/data/lmdb_datasets.py:119
Method__len__
Length is length of self.dataset.
cramming/data/cached_datasets.py:69
Method__len__
(self)
cramming/architectures/recurrent_transformers.py:292
Method__next__
(self)
cramming/backend/utils.py:265
Method__repr__
(self)
cramming/backend/optimizers/optimizer_modifiers.py:27
Method__setstate__
(self, state)
cramming/backend/optimizers/optimizer_modifiers.py:24
Method__setstate__
(self, state)
cramming/data/lmdb_datasets.py:92
Method_forward_deepthinking
Requires the encoder to be a ScriptableRecurrentLM. Requires labels!
cramming/architectures/recurrent_transformers.py:207
Method_forward_fixed
Requires the encoder to be a ScriptableRecurrentLM. Requires labels!
cramming/architectures/recurrent_transformers.py:237
Method_forward_token_exit
Requires the encoder to be a ScriptableRecurrentLM. Requires labels!
cramming/architectures/recurrent_transformers.py:188
Functionavg_n_dicts
https://github.com/wronnyhuang/metapoison/blob/master/utils.py.
cramming/utils.py:401
Methodbroadcast
(self, src_rank: int)
cramming/backend/optimizers/shampoo/shampoo_utils.py:474
Methodbroadcast
(self, src_rank: int)
cramming/backend/optimizers/shampoo/shampoo_utils.py:611
Methodcompute_norm
(self, grad: Tensor)
cramming/backend/optimizers/shampoo/shampoo_utils.py:214
Methodcompute_norm
(self, grad: Tensor)
cramming/backend/optimizers/shampoo/shampoo_utils.py:471
Methodcompute_norm
(self, grad: Tensor)
cramming/backend/optimizers/shampoo/shampoo_utils.py:608
Methodcompute_root_inverse
(self)
cramming/backend/optimizers/shampoo/shampoo_utils.py:595
Functionconstruct_model
(cfg_arch, vocab_size, downstream_classes=None)
cramming/architectures/construction.py:16
Functioncount_token
(examples)
cramming/data/curriculum_sorting.py:66
Functioncount_unigrams
(examples)
cramming/data/curriculum_sorting.py:22
Functioncount_word_lengths
(examples)
cramming/data/curriculum_sorting.py:105
Methoddirection_norm
(self, grad: Tensor)
cramming/backend/optimizers/shampoo/shampoo_utils.py:651
Methoddirection_norm
(self, grad: Tensor)
cramming/backend/optimizers/shampoo/shampoo_utils.py:676
Functiondump_metrics
Simple yaml dump of metric values.
cramming/utils.py:421
Functionfilter_fn
Assume a metadata key 'meta' is present
cramming/data/pretraining_preparation.py:141
Functionfiltering_rule
(examples)
cramming/data/pretraining_preparation.py:397
Functionfind_pretrained_checkpoint
Load a checkpoint either locally or from the internet.
cramming/utils.py:172
Methodforward
(self, input_ids, labels)
cramming/backend/torch_default.py:435
Methodforward
(self, hidden_states, attention_mask: Optional[torch.Tensor] = None)
cramming/architectures/funnel_transformers.py:40
Methodforward
(self, states, attention_mask: Optional[torch.Tensor] = None)
cramming/architectures/funnel_transformers.py:65
Methodforward
(self, input_ids, attention_mask: Optional[torch.Tensor] = None, labels: Optional[torch.Tensor] = None)
cramming/architectures/funnel_transformers.py:124
Methodforward
Is this is the optimal implementation? Is this even what is meant? I wish there were more answers or code for PaLM This implementatio
cramming/architectures/losses.py:18
Methodforward
Is this is the optimal implementation? Could also do an index_select variation...
cramming/architectures/losses.py:39
Methodforward
Is this is the optimal implementation? This at least circumvents literal 1-hot labels
cramming/architectures/losses.py:65
Methodforward
Optimal scaling is less clear for L1
cramming/architectures/losses.py:89
Methodforward
This really just does L2(DNN(embed(x[:,:-1]), 2.0 * stop_gradient(embed(x[:,1:]))) as quoted above
cramming/architectures/losses.py:118
Methodforward
(self, input: torch.Tensor, target: torch.Tensor)
cramming/architectures/losses.py:165
Methodforward
(self, input: torch.Tensor, target: torch.Tensor)
cramming/architectures/losses.py:179
Methodforward
(self, input_ids, attention_mask: Optional[torch.Tensor] = None, labels: Optional[torch.Tensor] = None)
cramming/architectures/scriptable_bert.py:95
Methodforward
( self, input_ids, attention_mask: Optional[torch.Tensor] = None, labels: Opti
cramming/architectures/scriptable_bert.py:182
Methodforward
( self, input_ids, attention_mask: Optional[torch.Tensor] = None, labels: Opti
cramming/architectures/scriptable_bert.py:261
Methodforward
( self, input_ids, attention_mask: Optional[torch.Tensor] = None, labels: Opti
cramming/architectures/scriptable_bert.py:338
Methodforward
(self, hidden_states, attention_mask: Optional[torch.Tensor] = None)
cramming/architectures/attention.py:60
← previousnext →201–300 of 411, ranked by callers