(
self,
d_model=256,
nhead=8,
num_queries=300,
num_encoder_layers=6,
num_decoder_layers=6,
dim_feedforward=2048,
dropout=0.0,
activation='relu',
normalize_before=False,
return_intermediate_dec=False,
query_dim=4,
num_patterns=0,
modulate_hw_attn=False,
# for deformable encoder
deformable_encoder=False,
deformable_decoder=False,
num_feature_levels=1,
enc_n_points=4,
dec_n_points=4,
# init query
learnable_tgt_init=False,
random_refpoints_xy=False,
# two stage
two_stage_type='no',
two_stage_learn_wh=False,
two_stage_keep_all_tokens=False,
# evo of #anchors
dec_layer_number=None,
rm_self_attn_layers=None,
# for detach
rm_detach=None,
decoder_sa_type='sa',
module_seq=['sa', 'ca', 'ffn'],
# for pose
embed_init_tgt=False,
num_body_points=0,
num_hand_points=0,
num_face_points=0,
num_box_decoder_layers=2,
num_hand_face_decoder_layers=4,
num_group=100)
| 2053 | |
| 2054 | class Transformer_Box(nn.Module): |
| 2055 | def __init__( |
| 2056 | self, |
| 2057 | d_model=256, |
| 2058 | nhead=8, |
| 2059 | num_queries=300, |
| 2060 | num_encoder_layers=6, |
| 2061 | num_decoder_layers=6, |
| 2062 | dim_feedforward=2048, |
| 2063 | dropout=0.0, |
| 2064 | activation='relu', |
| 2065 | normalize_before=False, |
| 2066 | return_intermediate_dec=False, |
| 2067 | query_dim=4, |
| 2068 | num_patterns=0, |
| 2069 | modulate_hw_attn=False, |
| 2070 | # for deformable encoder |
| 2071 | deformable_encoder=False, |
| 2072 | deformable_decoder=False, |
| 2073 | num_feature_levels=1, |
| 2074 | enc_n_points=4, |
| 2075 | dec_n_points=4, |
| 2076 | # init query |
| 2077 | learnable_tgt_init=False, |
| 2078 | random_refpoints_xy=False, |
| 2079 | # two stage |
| 2080 | two_stage_type='no', |
| 2081 | two_stage_learn_wh=False, |
| 2082 | two_stage_keep_all_tokens=False, |
| 2083 | # evo of #anchors |
| 2084 | dec_layer_number=None, |
| 2085 | rm_self_attn_layers=None, |
| 2086 | # for detach |
| 2087 | rm_detach=None, |
| 2088 | decoder_sa_type='sa', |
| 2089 | module_seq=['sa', 'ca', 'ffn'], |
| 2090 | # for pose |
| 2091 | embed_init_tgt=False, |
| 2092 | num_body_points=0, |
| 2093 | num_hand_points=0, |
| 2094 | num_face_points=0, |
| 2095 | num_box_decoder_layers=2, |
| 2096 | num_hand_face_decoder_layers=4, |
| 2097 | num_group=100): |
| 2098 | super().__init__() |
| 2099 | # pdb.set_trace() |
| 2100 | self.num_feature_levels = num_feature_levels # 4 |
| 2101 | self.num_encoder_layers = num_encoder_layers # 6 |
| 2102 | self.num_decoder_layers = num_decoder_layers # 6 |
| 2103 | self.deformable_encoder = deformable_encoder |
| 2104 | self.deformable_decoder = deformable_decoder |
| 2105 | self.two_stage_keep_all_tokens = two_stage_keep_all_tokens # False |
| 2106 | self.num_queries = num_queries # 900 |
| 2107 | self.random_refpoints_xy = random_refpoints_xy # False |
| 2108 | assert query_dim == 4 |
| 2109 | |
| 2110 | if num_feature_levels > 1: |
| 2111 | assert deformable_encoder, 'only support deformable_encoder for num_feature_levels > 1' |
| 2112 |
nothing calls this directly
no test coverage detected