↓ 2 callersFunctionrun_llama_benchy(base_url, model_name, depths, pp, tg, runs, tokenizer, save_result, latency_mode="generation")
mirror_sd/benchmarks/llama_benchy.py:49
↓ 2 callersFunctionsave_benchmark(raw_path, label, args, model_name, model_path, draft_path, cfg=None)
mirror_sd/benchmarks/llama_benchy.py:71
↓ 1 callersFunctionbuild_final_norm_lm_head_kernelFused final RMSNorm + lm_head projection. Inputs: hidden [1, hidden, 1, w_sq], norm_w [1, hidden, 1, w_sq], lm_head_w [1, hidden, 1, vocab_size] Out
ane/src/dflash.rs:473
↓ 1 callersFunctionbuild_mega_qkv_kernel_q8Build the mega_qkv kernel with int8-quantized projection weights baked in. Inputs: hidden, in_norm_w, context, k_norm_w, q_norm_w, cos_k, sin_k, cos_
ane/src/dflash.rs:354
↓ 1 callersFunctionspec_mmlu(model, draft_model, tokenizer, prompt: str,
use_chat: bool, eos_ids, **spec_kwargs)
mirror_sd/benchmarks/mmlu.py:94