Convert the LLM backbone config to cake's common Config.
(&self)
| 80 | |
| 81 | /// Convert the LLM backbone config to cake's common Config. |
| 82 | pub fn into_config(&self) -> Config { |
| 83 | let dc = &self.decoder_config; |
| 84 | Config { |
| 85 | hidden_size: dc.hidden_size, |
| 86 | intermediate_size: dc.intermediate_size, |
| 87 | vocab_size: dc.vocab_size, |
| 88 | num_hidden_layers: dc.num_hidden_layers, |
| 89 | num_attention_heads: dc.num_attention_heads, |
| 90 | num_key_value_heads: dc.num_key_value_heads, |
| 91 | rms_norm_eps: dc.rms_norm_eps, |
| 92 | rope_theta: dc.rope_theta as f32, |
| 93 | bos_token_id: None, |
| 94 | eos_token_id: None, |
| 95 | rope_scaling: None, |
| 96 | tie_word_embeddings: dc.tie_word_embeddings, |
| 97 | max_seq_len: dc.max_position_embeddings, |
| 98 | use_qkv_bias: true, // Qwen2.5 uses QKV bias |
| 99 | model_prefix: "model.tts_language_model".into(), |
| 100 | head_dim: None, |
| 101 | partial_rotary_factor: 1.0, |
| 102 | linear_attn: None, |
| 103 | residual_rms_norm: false, |
| 104 | use_qk_norm: false, |
| 105 | pre_reshape_qk_norm: false, |
| 106 | sliding_window: None, |
| 107 | fused_qkv_proj: false, |
| 108 | fused_gate_up_proj: false, |
| 109 | global_layers: vec![], |
| 110 | use_gelu_mlp: false, |
| 111 | embed_scale: None, |
| 112 | moe_intermediate_size: None, |
| 113 | num_experts: 0, |
| 114 | num_experts_per_tok: 0, |
| 115 | norm_topk_prob: false, |
| 116 | shared_expert_intermediate_size: None, |
| 117 | attn_output_gate: false, |
| 118 | } |
| 119 | } |
| 120 | } |
| 121 | |
| 122 | #[cfg(test)] |
no outgoing calls