↓ 1 callersMethodattention(self, query_layer, key_layer, value_layer, attention_mask: Optional[torch.Tensor] = None, training: bool = Fa
cramming/architectures/attention.py:168
Method__init__(self, optimizer, progress_rule="norm-based", theta=0.9, monotone=False, min_sample_guard=2, max_sample_guard=
cramming/backend/optimizers/progressive_batching.py:18
Method__init__(self, params, lr=0.15, betas=(0.9, 0.999), eps=1e-4, weight_decay=0, hessian_power=1, single_gpu=True)
cramming/backend/optimizers/adahessian.py:51