↓ 1 callersFunctionget_cosine_schedule_with_multiple_warmups(
optimizer,
*,
num_training_steps,
first_warmup_steps,
restart_warmup_steps,
restart_
peft_pretraining/training_utils.py:74
↓ 1 callersFunctionget_cyclical_cosine_schedule_with_min_lr(optimizer, num_warmup_steps, num_training_steps, cycle_length, min_lr_ratio=0.1, last_epoch=-1)
peft_pretraining/training_utils.py:56
↓ 1 callersFunctionpseudo_quantize_tensor(w, n_bit=8, zero_point=True, q_group_size=-1, inplace=False, get_scale_zp=False)
galore_torch/q_galore_adamw8bit.py:9
Method__init__(self, params, lr=1e-3, betas=(0.9, 0.999), eps=1e-8, weight_decay=1e-2, amsgrad=False, optim_bits=32,args=Non
galore_torch/q_galore_adamw8bit.py:54
Method__init__(
self,
params,
lr=None,
eps=(1e-30, 1e-3),
clip_threshold=1.0,
galore_torch/adafactor.py:99
Method__init__(self, params, lr=1e-3, betas=(0.9, 0.999), eps=1e-8, weight_decay=1e-2, amsgrad=False, optim_bits=32,args=Non
galore_torch/adamw8bit.py:9
Method__init__(self, rank, verbose=False, update_proj_gap=200, scale=1.0, proj_type='std')
galore_torch/galore_projector.py:8
Functionevaluate_model(model, preprocess_batched, pad_idx, global_rank, world_size, device, batch_size)
welore_continual_finetune.py:114