(self, freeze_moe_router: bool = False, **kwargs)
| 129 | return transformer_layer_spec |
| 130 | |
| 131 | def initialize(self, freeze_moe_router: bool = False, **kwargs): |
| 132 | model = super().initialize(**kwargs) |
| 133 | if freeze_moe_router: |
| 134 | for layer in model.decoder.layers: |
| 135 | layer.mlp.router.weight.requires_grad = False |
| 136 | return model |
| 137 | |
| 138 | |
| 139 | class Qwen3MoEModel(BaseModelInitializer): |
no outgoing calls
no test coverage detected