MCPcopy Create free account
hub / github.com/UX-Decoder/Semantic-SAM / PatchEmbed

Class PatchEmbed

semantic_sam/backbone/focal.py:287–337  ·  view source on GitHub ↗

Image to Patch Embedding Args: patch_size (int): Patch token size. Default: 4. in_chans (int): Number of input image channels. Default: 3. embed_dim (int): Number of linear projection output channels. Default: 96. norm_layer (nn.Module, optional): Normalization

Source from the content-addressed store, hash-verified

285
286
287class PatchEmbed(nn.Module):
288 """ Image to Patch Embedding
289
290 Args:
291 patch_size (int): Patch token size. Default: 4.
292 in_chans (int): Number of input image channels. Default: 3.
293 embed_dim (int): Number of linear projection output channels. Default: 96.
294 norm_layer (nn.Module, optional): Normalization layer. Default: None
295 use_conv_embed (bool): Whether use overlapped convolution for patch embedding. Default: False
296 is_stem (bool): Is the stem block or not.
297 """
298
299 def __init__(self, patch_size=4, in_chans=3, embed_dim=96, norm_layer=None, use_conv_embed=False, is_stem=False):
300 super().__init__()
301 patch_size = to_2tuple(patch_size)
302 self.patch_size = patch_size
303
304 self.in_chans = in_chans
305 self.embed_dim = embed_dim
306
307 if use_conv_embed:
308 # if we choose to use conv embedding, then we treat the stem and non-stem differently
309 if is_stem:
310 kernel_size = 7; padding = 2; stride = 4
311 else:
312 kernel_size = 3; padding = 1; stride = 2
313 self.proj = nn.Conv2d(in_chans, embed_dim, kernel_size=kernel_size, stride=stride, padding=padding)
314 else:
315 self.proj = nn.Conv2d(in_chans, embed_dim, kernel_size=patch_size, stride=patch_size)
316
317 if norm_layer is not None:
318 self.norm = norm_layer(embed_dim)
319 else:
320 self.norm = None
321
322 def forward(self, x):
323 """Forward function."""
324 _, _, H, W = x.size()
325 if W % self.patch_size[1] != 0:
326 x = F.pad(x, (0, self.patch_size[1] - W % self.patch_size[1]))
327 if H % self.patch_size[0] != 0:
328 x = F.pad(x, (0, 0, 0, self.patch_size[0] - H % self.patch_size[0]))
329
330 x = self.proj(x) # B C Wh Ww
331 if self.norm is not None:
332 Wh, Ww = x.size(2), x.size(3)
333 x = x.flatten(2).transpose(1, 2)
334 x = self.norm(x)
335 x = x.transpose(1, 2).view(-1, self.embed_dim, Wh, Ww)
336
337 return x
338
339
340class FocalNet(nn.Module):

Callers 1

__init__Method · 0.70

Calls

no outgoing calls

Tested by

no test coverage detected