Method__init__(self, dataset_name, tokenizer_name, dataset_config_name=None, max_length=1024,
cache_dir=Non
training/llama/train/datamodules/language_modeling_hf.py:42
Function_attn_bwd(Q, K, V, sm_scale, #
DO, #
DQ, DK, DV, #
M, D,
# s
analysis/baselines/attn/triton_baseline_v01.py:311
Function_attn_bwd(Q, K, V, sm_scale, alibi_slopes, DO, DQ, DK, DV, M, D,
# shared by Q/K/V/DO.
stri
analysis/baselines/attn/triton_baseline_v02.py:920
Function_attn_bwd_preprocess(O, DO, #
Delta, #
Z, H, N_CTX, #
analysis/baselines/attn/triton_baseline_v01.py:193
Function_attn_bwd_preprocess(
Out,
DO,
Delta,
stride_oz,
stride_oh,
stride_om,
stride_on,
stride_doz,
analysis/baselines/attn/triton_baseline_v02.py:770
Function_attn_fwd(Q, K, V, sm_scale, M, Out, #
stride_qz, stride_qh, stride_qm, stride_qk, #
stri
analysis/baselines/attn/triton_baseline_v01.py:102
Functionapply_rotary_emb Arguments: x: (batch_size, seqlen, nheads, headdim) if cu_seqlens is None else (total_seqlen, nheads, headdim) cos, s
training/llama/llama/models/rotary.py:93
Functionapply_rotary_emb_torch x: (batch_size, seqlen, nheads, headdim) cos, sin: (seqlen, rotary_dim / 2) or (batch_size, seqlen, rotary_dim / 2)
training/llama/llama/models/rotary.py:23
Functionattn_fwd(Q, K, V, bias, SM_SCALE: tl.constexpr, L, Out, stride_qz, stride_qh, stride_qm, stride_qk, stride_kz,
analysis/baselines/attn/triton_baseline_v02.py:443
Functionbench_flash_attention(BATCH, H, N_CTX, HEAD_DIM, causal, mode, provider, device="cuda")
analysis/baselines/attn/triton_baseline_v01.py:602
Functionbench_flash_attention(BATCH, HQ, HK, N_CTX_Q, N_CTX_K, D_HEAD, dtype, causal, mode, provider, device="cuda",
analysis/baselines/attn/triton_baseline_v02.py:1712