↓ 4 callersMethodupdate_layer(self, adapter_name, r, lora_alpha, lora_dropout, init_lora_weights)
utils/my_peft/tuners/adalora.py:331
↓ 3 callersFunction_flash_attn_backward(do, q, k, v, o, lse, dq, dk, dv, bias=None, causal=False, softmax_scale=None)
utils/flash_attention/triton_flash_att.py:644
↓ 3 callersMethodupdate_layer(self, adapter_name, r, lora_alpha, lora_dropout, init_lora_weights, r_sum)
utils/my_peft/tuners/lora.py:465
↓ 2 callersFunction_bwd_kernel_one_col_block(
start_n,
Q, K, V, Bias,
DO, DQ, DK, DV,
LSE, D,
softmax_scale,
stride_qm, stride_kn,
utils/flash_attention/triton_flash_att.py:282
↓ 2 callersFunction_bwd_store_dk_dv(
dk_ptrs, dv_ptrs, dk, dv, offs_n, offs_d, seqlen_k, headdim,
EVEN_M: tl.constexpr, EVEN_N: tl.conste
utils/flash_attention/triton_flash_att.py:259
↓ 1 callersMethod_prepare_batch Parameter: sample -> list of tuple of experiences -> i.e, [(content_1,attn_mask_1,label_1),.....,(content_k,attn_mask_
model/Replay/MbPAplusplus.py:54