↓ 6 callersFunctionrun_test(test_id, model_id, sm, um, kvcache=None, offload_layers_to_gpu=0, offload_layers_to_cpu=0, max_new_tokens=500
scripts/full_tests.py:5
↓ 1 callersFunctiononline_chunked_grouped_attention_rope Online chunked grouped multi-head attention (RoPE already applied to q,k). - q: queries (B, Hq, Lq, D) - k,v: keys/values with Hkv heads
src/ollm/attention.py:141