model.backbone.conv0p1s1.kernel: torch.Size([125, 3, 32])
model.backbone.bn0.bn.weight: torch.Size([32])
model.backbone.bn0.bn.bias: torch.Size([32])
model.backbone.bn0.bn.running_mean: torch.Size([32])
model.backbone.bn0.bn.running_var: torch.Size([32])
model.backbone.bn0.bn.num_batches_tracked: torch.Size([])
model.backbone.conv1p1s2.kernel: torch.Size([8, 32, 32])
model.backbone.bn1.bn.weight: torch.Size([32])
model.backbone.bn1.bn.bias: torch.Size([32])
model.backbone.bn1.bn.running_mean: torch.Size([32])
model.backbone.bn1.bn.running_var: torch.Size([32])
model.backbone.bn1.bn.num_batches_tracked: torch.Size([])
model.backbone.block1.0.conv1.kernel: torch.Size([27, 32, 32])
model.backbone.block1.0.norm1.bn.weight: torch.Size([32])
model.backbone.block1.0.norm1.bn.bias: torch.Size([32])
model.backbone.block1.0.norm1.bn.running_mean: torch.Size([32])
model.backbone.block1.0.norm1.bn.running_var: torch.Size([32])
model.backbone.block1.0.norm1.bn.num_batches_tracked: torch.Size([])
model.backbone.block1.0.conv2.kernel: torch.Size([27, 32, 32])
model.backbone.block1.0.norm2.bn.weight: torch.Size([32])
model.backbone.block1.0.norm2.bn.bias: torch.Size([32])
model.backbone.block1.0.norm2.bn.running_mean: torch.Size([32])
model.backbone.block1.0.norm2.bn.running_var: torch.Size([32])
model.backbone.block1.0.norm2.bn.num_batches_tracked: torch.Size([])
model.backbone.conv2p2s2.kernel: torch.Size([8, 32, 32])
model.backbone.bn2.bn.weight: torch.Size([32])
model.backbone.bn2.bn.bias: torch.Size([32])
model.backbone.bn2.bn.running_mean: torch.Size([32])
model.backbone.bn2.bn.running_var: torch.Size([32])
model.backbone.bn2.bn.num_batches_tracked: torch.Size([])
model.backbone.block2.0.conv1.kernel: torch.Size([27, 32, 64])
model.backbone.block2.0.norm1.bn.weight: torch.Size([64])
model.backbone.block2.0.norm1.bn.bias: torch.Size([64])
model.backbone.block2.0.norm1.bn.running_mean: torch.Size([64])
model.backbone.block2.0.norm1.bn.running_var: torch.Size([64])
model.backbone.block2.0.norm1.bn.num_batches_tracked: torch.Size([])
model.backbone.block2.0.conv2.kernel: torch.Size([27, 64, 64])
model.backbone.block2.0.norm2.bn.weight: torch.Size([64])
model.backbone.block2.0.norm2.bn.bias: torch.Size([64])
model.backbone.block2.0.norm2.bn.running_mean: torch.Size([64])
model.backbone.block2.0.norm2.bn.running_var: torch.Size([64])
model.backbone.block2.0.norm2.bn.num_batches_tracked: torch.Size([])
model.backbone.block2.0.downsample.0.kernel: torch.Size([32, 64])
model.backbone.block2.0.downsample.1.bn.weight: torch.Size([64])
model.backbone.block2.0.downsample.1.bn.bias: torch.Size([64])
model.backbone.block2.0.downsample.1.bn.running_mean: torch.Size([64])
model.backbone.block2.0.downsample.1.bn.running_var: torch.Size([64])
model.backbone.block2.0.downsample.1.bn.num_batches_tracked: torch.Size([])
model.backbone.conv3p4s2.kernel: torch.Size([8, 64, 64])
model.backbone.bn3.bn.weight: torch.Size([64])
model.backbone.bn3.bn.bias: torch.Size([64])
model.backbone.bn3.bn.running_mean: torch.Size([64])
model.backbone.bn3.bn.running_var: torch.Size([64])
model.backbone.bn3.bn.num_batches_tracked: torch.Size([])
model.backbone.block3.0.conv1.kernel: torch.Size([27, 64, 128])
model.backbone.block3.0.norm1.bn.weight: torch.Size([128])
model.backbone.block3.0.norm1.bn.bias: torch.Size([128])
model.backbone.block3.0.norm1.bn.running_mean: torch.Size([128])
model.backbone.block3.0.norm1.bn.running_var: torch.Size([128])
model.backbone.block3.0.norm1.bn.num_batches_tracked: torch.Size([])
model.backbone.block3.0.conv2.kernel: torch.Size([27, 128, 128])
model.backbone.block3.0.norm2.bn.weight: torch.Size([128])
model.backbone.block3.0.norm2.bn.bias: torch.Size([128])
model.backbone.block3.0.norm2.bn.running_mean: torch.Size([128])
model.backbone.block3.0.norm2.bn.running_var: torch.Size([128])
model.backbone.block3.0.norm2.bn.num_batches_tracked: torch.Size([])
model.backbone.block3.0.downsample.0.kernel: torch.Size([64, 128])
model.backbone.block3.0.downsample.1.bn.weight: torch.Size([128])
model.backbone.block3.0.downsample.1.bn.bias: torch.Size([128])
model.backbone.block3.0.downsample.1.bn.running_mean: torch.Size([128])
model.backbone.block3.0.downsample.1.bn.running_var: torch.Size([128])
model.backbone.block3.0.downsample.1.bn.num_batches_tracked: torch.Size([])
model.backbone.conv4p8s2.kernel: torch.Size([8, 128, 128])
model.backbone.bn4.bn.weight: torch.Size([128])
model.backbone.bn4.bn.bias: torch.Size([128])
model.backbone.bn4.bn.running_mean: torch.Size([128])
model.backbone.bn4.bn.running_var: torch.Size([128])
model.backbone.bn4.bn.num_batches_tracked: torch.Size([])
model.backbone.block4.0.conv1.kernel: torch.Size([27, 128, 256])
model.backbone.block4.0.norm1.bn.weight: torch.Size([256])
model.backbone.block4.0.norm1.bn.bias: torch.Size([256])
model.backbone.block4.0.norm1.bn.running_mean: torch.Size([256])
model.backbone.block4.0.norm1.bn.running_var: torch.Size([256])
model.backbone.block4.0.norm1.bn.num_batches_tracked: torch.Size([])
model.backbone.block4.0.conv2.kernel: torch.Size([27, 256, 256])
model.backbone.block4.0.norm2.bn.weight: torch.Size([256])
model.backbone.block4.0.norm2.bn.bias: torch.Size([256])
model.backbone.block4.0.norm2.bn.running_mean: torch.Size([256])
model.backbone.block4.0.norm2.bn.running_var: torch.Size([256])
model.backbone.block4.0.norm2.bn.num_batches_tracked: torch.Size([])
model.backbone.block4.0.downsample.0.kernel: torch.Size([128, 256])
model.backbone.block4.0.downsample.1.bn.weight: torch.Size([256])
model.backbone.block4.0.downsample.1.bn.bias: torch.Size([256])
model.backbone.block4.0.downsample.1.bn.running_mean: torch.Size([256])
model.backbone.block4.0.downsample.1.bn.running_var: torch.Size([256])
model.backbone.block4.0.downsample.1.bn.num_batches_tracked: torch.Size([])
model.backbone.convtr4p16s2.kernel: torch.Size([8, 256, 128])
model.backbone.bntr4.bn.weight: torch.Size([128])
model.backbone.bntr4.bn.bias: torch.Size([128])
model.backbone.bntr4.bn.running_mean: torch.Size([128])
model.backbone.bntr4.bn.running_var: torch.Size([128])
model.backbone.bntr4.bn.num_batches_tracked: torch.Size([])
model.backbone.block5.0.conv1.kernel: torch.Size([27, 256, 128])
model.backbone.block5.0.norm1.bn.weight: torch.Size([128])
model.backbone.block5.0.norm1.bn.bias: torch.Size([128])
model.backbone.block5.0.norm1.bn.running_mean: torch.Size([128])
model.backbone.block5.0.norm1.bn.running_var: torch.Size([128])
model.backbone.block5.0.norm1.bn.num_batches_tracked: torch.Size([])
model.backbone.block5.0.conv2.kernel: torch.Size([27, 128, 128])
model.backbone.block5.0.norm2.bn.weight: torch.Size([128])
model.backbone.block5.0.norm2.bn.bias: torch.Size([128])
model.backbone.block5.0.norm2.bn.running_mean: torch.Size([128])
model.backbone.block5.0.norm2.bn.running_var: torch.Size([128])
model.backbone.block5.0.norm2.bn.num_batches_tracked: torch.Size([])
model.backbone.block5.0.downsample.0.kernel: torch.Size([256, 128])
model.backbone.block5.0.downsample.1.bn.weight: torch.Size([128])
model.backbone.block5.0.downsample.1.bn.bias: torch.Size([128])
model.backbone.block5.0.downsample.1.bn.running_mean: torch.Size([128])
model.backbone.block5.0.downsample.1.bn.running_var: torch.Size([128])
model.backbone.block5.0.downsample.1.bn.num_batches_tracked: torch.Size([])
model.backbone.convtr5p8s2.kernel: torch.Size([8, 128, 128])
model.backbone.bntr5.bn.weight: torch.Size([128])
model.backbone.bntr5.bn.bias: torch.Size([128])
model.backbone.bntr5.bn.running_mean: torch.Size([128])
model.backbone.bntr5.bn.running_var: torch.Size([128])
model.backbone.bntr5.bn.num_batches_tracked: torch.Size([])
model.backbone.block6.0.conv1.kernel: torch.Size([27, 192, 128])
model.backbone.block6.0.norm1.bn.weight: torch.Size([128])
model.backbone.block6.0.norm1.bn.bias: torch.Size([128])
model.backbone.block6.0.norm1.bn.running_mean: torch.Size([128])
model.backbone.block6.0.norm1.bn.running_var: torch.Size([128])
model.backbone.block6.0.norm1.bn.num_batches_tracked: torch.Size([])
model.backbone.block6.0.conv2.kernel: torch.Size([27, 128, 128])
model.backbone.block6.0.norm2.bn.weight: torch.Size([128])
model.backbone.block6.0.norm2.bn.bias: torch.Size([128])
model.backbone.block6.0.norm2.bn.running_mean: torch.Size([128])
model.backbone.block6.0.norm2.bn.running_var: torch.Size([128])
model.backbone.block6.0.norm2.bn.num_batches_tracked: torch.Size([])
model.backbone.block6.0.downsample.0.kernel: torch.Size([192, 128])
model.backbone.block6.0.downsample.1.bn.weight: torch.Size([128])
model.backbone.block6.0.downsample.1.bn.bias: torch.Size([128])
model.backbone.block6.0.downsample.1.bn.running_mean: torch.Size([128])
model.backbone.block6.0.downsample.1.bn.running_var: torch.Size([128])
model.backbone.block6.0.downsample.1.bn.num_batches_tracked: torch.Size([])
model.backbone.convtr6p4s2.kernel: torch.Size([8, 128, 128])
model.backbone.bntr6.bn.weight: torch.Size([128])
model.backbone.bntr6.bn.bias: torch.Size([128])
model.backbone.bntr6.bn.running_mean: torch.Size([128])
model.backbone.bntr6.bn.running_var: torch.Size([128])
model.backbone.bntr6.bn.num_batches_tracked: torch.Size([])
model.backbone.block7.0.conv1.kernel: torch.Size([27, 160, 128])
model.backbone.block7.0.norm1.bn.weight: torch.Size([128])
model.backbone.block7.0.norm1.bn.bias: torch.Size([128])
model.backbone.block7.0.norm1.bn.running_mean: torch.Size([128])
model.backbone.block7.0.norm1.bn.running_var: torch.Size([128])
model.backbone.block7.0.norm1.bn.num_batches_tracked: torch.Size([])
model.backbone.block7.0.conv2.kernel: torch.Size([27, 128, 128])
model.backbone.block7.0.norm2.bn.weight: torch.Size([128])
model.backbone.block7.0.norm2.bn.bias: torch.Size([128])
model.backbone.block7.0.norm2.bn.running_mean: torch.Size([128])
model.backbone.block7.0.norm2.bn.running_var: torch.Size([128])
model.backbone.block7.0.norm2.bn.num_batches_tracked: torch.Size([])
model.backbone.block7.0.downsample.0.kernel: torch.Size([160, 128])
model.backbone.block7.0.downsample.1.bn.weight: torch.Size([128])
model.backbone.block7.0.downsample.1.bn.bias: torch.Size([128])
model.backbone.block7.0.downsample.1.bn.running_mean: torch.Size([128])
model.backbone.block7.0.downsample.1.bn.running_var: torch.Size([128])
model.backbone.block7.0.downsample.1.bn.num_batches_tracked: torch.Size([])
model.backbone.convtr7p2s2.kernel: torch.Size([8, 128, 128])
model.backbone.bntr7.bn.weight: torch.Size([128])
model.backbone.bntr7.bn.bias: torch.Size([128])
model.backbone.bntr7.bn.running_mean: torch.Size([128])
model.backbone.bntr7.bn.running_var: torch.Size([128])
model.backbone.bntr7.bn.num_batches_tracked: torch.Size([])
model.backbone.block8.0.conv1.kernel: torch.Size([27, 160, 128])
model.backbone.block8.0.norm1.bn.weight: torch.Size([128])
model.backbone.block8.0.norm1.bn.bias: torch.Size([128])
model.backbone.block8.0.norm1.bn.running_mean: torch.Size([128])
model.backbone.block8.0.norm1.bn.running_var: torch.Size([128])
model.backbone.block8.0.norm1.bn.num_batches_tracked: torch.Size([])
model.backbone.block8.0.conv2.kernel: torch.Size([27, 128, 128])
model.backbone.block8.0.norm2.bn.weight: torch.Size([128])
model.backbone.block8.0.norm2.bn.bias: torch.Size([128])
model.backbone.block8.0.norm2.bn.running_mean: torch.Size([128])
model.backbone.block8.0.norm2.bn.running_var: torch.Size([128])
model.backbone.block8.0.norm2.bn.num_batches_tracked: torch.Size([])
model.backbone.block8.0.downsample.0.kernel: torch.Size([160, 128])
model.backbone.block8.0.downsample.1.bn.weight: torch.Size([128])
model.backbone.block8.0.downsample.1.bn.bias: torch.Size([128])
model.backbone.block8.0.downsample.1.bn.running_mean: torch.Size([128])
model.backbone.block8.0.downsample.1.bn.running_var: torch.Size([128])
model.backbone.block8.0.downsample.1.bn.num_batches_tracked: torch.Size([])
model.backbone.final.kernel: torch.Size([128, 13])
model.backbone.final.bias: torch.Size([1, 13])
model.mask_features_head.kernel: torch.Size([128, 128])
model.mask_features_head.bias: torch.Size([1, 128])
model.query_projection.layers.0.weight: torch.Size([128, 128, 1])
model.query_projection.layers.0.bias: torch.Size([128])
model.query_projection.layers.2.weight: torch.Size([128, 128, 1])
model.query_projection.layers.2.bias: torch.Size([128])
model.mask_embed_head.0.weight: torch.Size([128, 128])
model.mask_embed_head.0.bias: torch.Size([128])
model.mask_embed_head.2.weight: torch.Size([128, 128])
model.mask_embed_head.2.bias: torch.Size([128])
model.class_embed_head.weight: torch.Size([14, 128])
model.class_embed_head.bias: torch.Size([14])
model.pos_enc.gauss_B: torch.Size([3, 64])
model.cross_attention.0.0.multihead_attn.in_proj_weight: torch.Size([384, 128])
model.cross_attention.0.0.multihead_attn.in_proj_bias: torch.Size([384])
model.cross_attention.0.0.multihead_attn.out_proj.weight: torch.Size([128, 128])
model.cross_attention.0.0.multihead_attn.out_proj.bias: torch.Size([128])
model.cross_attention.0.0.norm.weight: torch.Size([128])
model.cross_attention.0.0.norm.bias: torch.Size([128])
model.cross_attention.0.1.multihead_attn.in_proj_weight: torch.Size([384, 128])
model.cross_attention.0.1.multihead_attn.in_proj_bias: torch.Size([384])
model.cross_attention.0.1.multihead_attn.out_proj.weight: torch.Size([128, 128])
model.cross_attention.0.1.multihead_attn.out_proj.bias: torch.Size([128])
model.cross_attention.0.1.norm.weight: torch.Size([128])
model.cross_attention.0.1.norm.bias: torch.Size([128])
model.cross_attention.0.2.multihead_attn.in_proj_weight: torch.Size([384, 128])
model.cross_attention.0.2.multihead_attn.in_proj_bias: torch.Size([384])
model.cross_attention.0.2.multihead_attn.out_proj.weight: torch.Size([128, 128])
model.cross_attention.0.2.multihead_attn.out_proj.bias: torch.Size([128])
model.cross_attention.0.2.norm.weight: torch.Size([128])
model.cross_attention.0.2.norm.bias: torch.Size([128])
model.cross_attention.0.3.multihead_attn.in_proj_weight: torch.Size([384, 128])
model.cross_attention.0.3.multihead_attn.in_proj_bias: torch.Size([384])
model.cross_attention.0.3.multihead_attn.out_proj.weight: torch.Size([128, 128])
model.cross_attention.0.3.multihead_attn.out_proj.bias: torch.Size([128])
model.cross_attention.0.3.norm.weight: torch.Size([128])
model.cross_attention.0.3.norm.bias: torch.Size([128])
model.self_attention.0.0.self_attn.in_proj_weight: torch.Size([384, 128])
model.self_attention.0.0.self_attn.in_proj_bias: torch.Size([384])
model.self_attention.0.0.self_attn.out_proj.weight: torch.Size([128, 128])
model.self_attention.0.0.self_attn.out_proj.bias: torch.Size([128])
model.self_attention.0.0.norm.weight: torch.Size([128])
model.self_attention.0.0.norm.bias: torch.Size([128])
model.self_attention.0.1.self_attn.in_proj_weight: torch.Size([384, 128])
model.self_attention.0.1.self_attn.in_proj_bias: torch.Size([384])
model.self_attention.0.1.self_attn.out_proj.weight: torch.Size([128, 128])
model.self_attention.0.1.self_attn.out_proj.bias: torch.Size([128])
model.self_attention.0.1.norm.weight: torch.Size([128])
model.self_attention.0.1.norm.bias: torch.Size([128])
model.self_attention.0.2.self_attn.in_proj_weight: torch.Size([384, 128])
model.self_attention.0.2.self_attn.in_proj_bias: torch.Size([384])
model.self_attention.0.2.self_attn.out_proj.weight: torch.Size([128, 128])
model.self_attention.0.2.self_attn.out_proj.bias: torch.Size([128])
model.self_attention.0.2.norm.weight: torch.Size([128])
model.self_attention.0.2.norm.bias: torch.Size([128])
model.self_attention.0.3.self_attn.in_proj_weight: torch.Size([384, 128])
model.self_attention.0.3.self_attn.in_proj_bias: torch.Size([384])
model.self_attention.0.3.self_attn.out_proj.weight: torch.Size([128, 128])
model.self_attention.0.3.self_attn.out_proj.bias: torch.Size([128])
model.self_attention.0.3.norm.weight: torch.Size([128])
model.self_attention.0.3.norm.bias: torch.Size([128])
model.ffn_attention.0.0.linear1.weight: torch.Size([1024, 128])
model.ffn_attention.0.0.linear1.bias: torch.Size([1024])
model.ffn_attention.0.0.linear2.weight: torch.Size([128, 1024])
model.ffn_attention.0.0.linear2.bias: torch.Size([128])
model.ffn_attention.0.0.norm.weight: torch.Size([128])
model.ffn_attention.0.0.norm.bias: torch.Size([128])
model.ffn_attention.0.1.linear1.weight: torch.Size([1024, 128])
model.ffn_attention.0.1.linear1.bias: torch.Size([1024])
model.ffn_attention.0.1.linear2.weight: torch.Size([128, 1024])
model.ffn_attention.0.1.linear2.bias: torch.Size([128])
model.ffn_attention.0.1.norm.weight: torch.Size([128])
model.ffn_attention.0.1.norm.bias: torch.Size([128])
model.ffn_attention.0.2.linear1.weight: torch.Size([1024, 128])
model.ffn_attention.0.2.linear1.bias: torch.Size([1024])
model.ffn_attention.0.2.linear2.weight: torch.Size([128, 1024])
model.ffn_attention.0.2.linear2.bias: torch.Size([128])
model.ffn_attention.0.2.norm.weight: torch.Size([128])
model.ffn_attention.0.2.norm.bias: torch.Size([128])
model.ffn_attention.0.3.linear1.weight: torch.Size([1024, 128])
model.ffn_attention.0.3.linear1.bias: torch.Size([1024])
model.ffn_attention.0.3.linear2.weight: torch.Size([128, 1024])
model.ffn_attention.0.3.linear2.bias: torch.Size([128])
model.ffn_attention.0.3.norm.weight: torch.Size([128])
model.ffn_attention.0.3.norm.bias: torch.Size([128])
model.lin_squeeze.0.0.weight: torch.Size([128, 256])
model.lin_squeeze.0.0.bias: torch.Size([128])
model.lin_squeeze.0.1.weight: torch.Size([128, 128])
model.lin_squeeze.0.1.bias: torch.Size([128])
model.lin_squeeze.0.2.weight: torch.Size([128, 128])
model.lin_squeeze.0.2.bias: torch.Size([128])
model.lin_squeeze.0.3.weight: torch.Size([128, 128])
model.lin_squeeze.0.3.bias: torch.Size([128])
model.decoder_norm.weight: torch.Size([128])
model.decoder_norm.bias: torch.Size([128])
criterion.empty_weight: torch.Size([14])
key: backbone 8968205
key: mask_features_head 16512
key: query_projection 33024
key: mask_embed_head 33024
key: pos_enc 192
key: cross_attention 265216
key: self_attention 265216
key: ffn_attention 1054208
key: lin_squeeze 82432
key: decoder_norm 256
