(self, **kwargs)
| 139 | return transformer_layer_spec |
| 140 | |
| 141 | def initialize(self, **kwargs): |
| 142 | model = super().initialize(**kwargs) |
| 143 | freeze_moe_router = kwargs.get("freeze_moe_router", False) |
| 144 | if freeze_moe_router: |
| 145 | for layer in model.decoder.layers: |
| 146 | layer.mlp.router.weight.requires_grad = False |
| 147 | return model |
| 148 | |
| 149 | |
| 150 | class Qwen3MoEModel(BaseModelInitializer): |
no test coverage detected