MCPcopy Create free account
hub / github.com/andrewkchan/deepseek.cpp / attention_impl

Method attention_impl

src/model.cpp:493–515  ·  view source on GitHub ↗

Source from the content-addressed store, hash-verified

491}
492
493void BlockMHA::attention_impl(
494 InferenceState& s, int pos, int kv_sink, int kv_pos, int kv_len
495) const {
496 switch (_config->weight_quant) {
497 case Quant::F32:
498 _attention_impl<float>(s, pos, kv_sink, kv_pos, kv_len);
499 break;
500 case Quant::F16:
501 _attention_impl<f16_t>(s, pos, kv_sink, kv_pos, kv_len);
502 break;
503 case Quant::F8E5M2:
504 _attention_impl<f8e5m2_t>(s, pos, kv_sink, kv_pos, kv_len);
505 break;
506 case Quant::Q2_K:
507 _attention_impl<block_q2_K>(s, pos, kv_sink, kv_pos, kv_len);
508 break;
509 case Quant::Q3_K:
510 _attention_impl<block_q3_K>(s, pos, kv_sink, kv_pos, kv_len);
511 break;
512 default:
513 assert(false && "unsupported weight quantization for mha");
514 }
515}
516
517
518BlockMLA::BlockMLA(

Callers

nothing calls this directly

Calls

no outgoing calls

Tested by

no test coverage detected