{ "quantization": { "method": "jang-importance", "profile": "JANG_4M", "target_bits": 4.0, "actual_bits": 4.12, "block_size": 64, "calibration_method": "weights", "quantization_method": "mse", "scoring_method": "weight-magnitude", "bit_widths_used": [ 4, 8 ], "passthrough_bit_widths_used": [], "passthrough_tensor_count": 0, "quantization_scheme": "asymmetric", "quantization_backend": "mx.quantize", "hadamard_rotation": false, "mlp_asymmetry_floor": true, "split_gate_up_quant": false, "split_gate_bits": null, "split_up_bits": null, "n2_down_bits": null, "n2_linear_attn_input_bits": null, "n2_linear_attn_out_bits": null, "n2_self_attn_bits": null, "n2_shared_expert_gate_up_bits": null, "n2_token_io_bits": null, "n2_lm_head_bits": null, "expert_prune_keep": null, "expert_prune_map": null, "expert_prune_method": null, "tensor_quantization_manifest_schema": 1, "tensor_quantization_manifest_count": 169, "tensor_quantization_manifest": { "language_model.model.embed_tokens": { "source_tensor": "model.language_model.embed_tokens.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.embed_tokens.weight", "scales_key": "language_model.model.embed_tokens.scales", "biases_key": "language_model.model.embed_tokens.biases", "weight_shape": [ 128000, 256 ], "scales_shape": [ 128000, 32 ], "biases_shape": [ 128000, 32 ] }, "language_model.model.layers.0.conv.in_proj": { "source_tensor": "model.language_model.layers.0.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.0.conv.in_proj.weight", "scales_key": "language_model.model.layers.0.conv.in_proj.scales", "biases_key": "language_model.model.layers.0.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.0.conv.out_proj": { "source_tensor": "model.language_model.layers.0.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.0.conv.out_proj.weight", "scales_key": "language_model.model.layers.0.conv.out_proj.scales", "biases_key": "language_model.model.layers.0.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.0.feed_forward.w1": { "source_tensor": "model.language_model.layers.0.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.0.feed_forward.w1.weight", "scales_key": "language_model.model.layers.0.feed_forward.w1.scales", "biases_key": "language_model.model.layers.0.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.0.feed_forward.w2": { "source_tensor": "model.language_model.layers.0.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.0.feed_forward.w2.weight", "scales_key": "language_model.model.layers.0.feed_forward.w2.scales", "biases_key": "language_model.model.layers.0.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.0.feed_forward.w3": { "source_tensor": "model.language_model.layers.0.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.0.feed_forward.w3.weight", "scales_key": "language_model.model.layers.0.feed_forward.w3.scales", "biases_key": "language_model.model.layers.0.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.1.conv.in_proj": { "source_tensor": "model.language_model.layers.1.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.1.conv.in_proj.weight", "scales_key": "language_model.model.layers.1.conv.in_proj.scales", "biases_key": "language_model.model.layers.1.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.1.conv.out_proj": { "source_tensor": "model.language_model.layers.1.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.1.conv.out_proj.weight", "scales_key": "language_model.model.layers.1.conv.out_proj.scales", "biases_key": "language_model.model.layers.1.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.1.feed_forward.w1": { "source_tensor": "model.language_model.layers.1.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.1.feed_forward.w1.weight", "scales_key": "language_model.model.layers.1.feed_forward.w1.scales", "biases_key": "language_model.model.layers.1.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.1.feed_forward.w2": { "source_tensor": "model.language_model.layers.1.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.1.feed_forward.w2.weight", "scales_key": "language_model.model.layers.1.feed_forward.w2.scales", "biases_key": "language_model.model.layers.1.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.1.feed_forward.w3": { "source_tensor": "model.language_model.layers.1.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.1.feed_forward.w3.weight", "scales_key": "language_model.model.layers.1.feed_forward.w3.scales", "biases_key": "language_model.model.layers.1.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.10.conv.in_proj": { "source_tensor": "model.language_model.layers.10.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.10.conv.in_proj.weight", "scales_key": "language_model.model.layers.10.conv.in_proj.scales", "biases_key": "language_model.model.layers.10.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.10.conv.out_proj": { "source_tensor": "model.language_model.layers.10.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.10.conv.out_proj.weight", "scales_key": "language_model.model.layers.10.conv.out_proj.scales", "biases_key": "language_model.model.layers.10.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.10.feed_forward.w1": { "source_tensor": "model.language_model.layers.10.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.10.feed_forward.w1.weight", "scales_key": "language_model.model.layers.10.feed_forward.w1.scales", "biases_key": "language_model.model.layers.10.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.10.feed_forward.w2": { "source_tensor": "model.language_model.layers.10.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.10.feed_forward.w2.weight", "scales_key": "language_model.model.layers.10.feed_forward.w2.scales", "biases_key": "language_model.model.layers.10.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.10.feed_forward.w3": { "source_tensor": "model.language_model.layers.10.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.10.feed_forward.w3.weight", "scales_key": "language_model.model.layers.10.feed_forward.w3.scales", "biases_key": "language_model.model.layers.10.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.11.conv.in_proj": { "source_tensor": "model.language_model.layers.11.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.11.conv.in_proj.weight", "scales_key": "language_model.model.layers.11.conv.in_proj.scales", "biases_key": "language_model.model.layers.11.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.11.conv.out_proj": { "source_tensor": "model.language_model.layers.11.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.11.conv.out_proj.weight", "scales_key": "language_model.model.layers.11.conv.out_proj.scales", "biases_key": "language_model.model.layers.11.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.11.feed_forward.w1": { "source_tensor": "model.language_model.layers.11.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.11.feed_forward.w1.weight", "scales_key": "language_model.model.layers.11.feed_forward.w1.scales", "biases_key": "language_model.model.layers.11.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.11.feed_forward.w2": { "source_tensor": "model.language_model.layers.11.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.11.feed_forward.w2.weight", "scales_key": "language_model.model.layers.11.feed_forward.w2.scales", "biases_key": "language_model.model.layers.11.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.11.feed_forward.w3": { "source_tensor": "model.language_model.layers.11.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.11.feed_forward.w3.weight", "scales_key": "language_model.model.layers.11.feed_forward.w3.scales", "biases_key": "language_model.model.layers.11.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.12.conv.in_proj": { "source_tensor": "model.language_model.layers.12.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.12.conv.in_proj.weight", "scales_key": "language_model.model.layers.12.conv.in_proj.scales", "biases_key": "language_model.model.layers.12.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.12.conv.out_proj": { "source_tensor": "model.language_model.layers.12.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.12.conv.out_proj.weight", "scales_key": "language_model.model.layers.12.conv.out_proj.scales", "biases_key": "language_model.model.layers.12.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.12.feed_forward.w1": { "source_tensor": "model.language_model.layers.12.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.12.feed_forward.w1.weight", "scales_key": "language_model.model.layers.12.feed_forward.w1.scales", "biases_key": "language_model.model.layers.12.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.12.feed_forward.w2": { "source_tensor": "model.language_model.layers.12.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.12.feed_forward.w2.weight", "scales_key": "language_model.model.layers.12.feed_forward.w2.scales", "biases_key": "language_model.model.layers.12.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.12.feed_forward.w3": { "source_tensor": "model.language_model.layers.12.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.12.feed_forward.w3.weight", "scales_key": "language_model.model.layers.12.feed_forward.w3.scales", "biases_key": "language_model.model.layers.12.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.13.feed_forward.w1": { "source_tensor": "model.language_model.layers.13.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.13.feed_forward.w1.weight", "scales_key": "language_model.model.layers.13.feed_forward.w1.scales", "biases_key": "language_model.model.layers.13.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.13.feed_forward.w2": { "source_tensor": "model.language_model.layers.13.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.13.feed_forward.w2.weight", "scales_key": "language_model.model.layers.13.feed_forward.w2.scales", "biases_key": "language_model.model.layers.13.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.13.feed_forward.w3": { "source_tensor": "model.language_model.layers.13.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.13.feed_forward.w3.weight", "scales_key": "language_model.model.layers.13.feed_forward.w3.scales", "biases_key": "language_model.model.layers.13.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.13.self_attn.k_proj": { "source_tensor": "model.language_model.layers.13.self_attn.k_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.13.self_attn.k_proj.weight", "scales_key": "language_model.model.layers.13.self_attn.k_proj.scales", "biases_key": "language_model.model.layers.13.self_attn.k_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.13.self_attn.out_proj": { "source_tensor": "model.language_model.layers.13.self_attn.out_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.13.self_attn.out_proj.weight", "scales_key": "language_model.model.layers.13.self_attn.out_proj.scales", "biases_key": "language_model.model.layers.13.self_attn.out_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.13.self_attn.q_proj": { "source_tensor": "model.language_model.layers.13.self_attn.q_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.13.self_attn.q_proj.weight", "scales_key": "language_model.model.layers.13.self_attn.q_proj.scales", "biases_key": "language_model.model.layers.13.self_attn.q_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.13.self_attn.v_proj": { "source_tensor": "model.language_model.layers.13.self_attn.v_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.13.self_attn.v_proj.weight", "scales_key": "language_model.model.layers.13.self_attn.v_proj.scales", "biases_key": "language_model.model.layers.13.self_attn.v_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.14.conv.in_proj": { "source_tensor": "model.language_model.layers.14.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.14.conv.in_proj.weight", "scales_key": "language_model.model.layers.14.conv.in_proj.scales", "biases_key": "language_model.model.layers.14.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.14.conv.out_proj": { "source_tensor": "model.language_model.layers.14.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.14.conv.out_proj.weight", "scales_key": "language_model.model.layers.14.conv.out_proj.scales", "biases_key": "language_model.model.layers.14.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.14.feed_forward.w1": { "source_tensor": "model.language_model.layers.14.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.14.feed_forward.w1.weight", "scales_key": "language_model.model.layers.14.feed_forward.w1.scales", "biases_key": "language_model.model.layers.14.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.14.feed_forward.w2": { "source_tensor": "model.language_model.layers.14.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.14.feed_forward.w2.weight", "scales_key": "language_model.model.layers.14.feed_forward.w2.scales", "biases_key": "language_model.model.layers.14.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.14.feed_forward.w3": { "source_tensor": "model.language_model.layers.14.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.14.feed_forward.w3.weight", "scales_key": "language_model.model.layers.14.feed_forward.w3.scales", "biases_key": "language_model.model.layers.14.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.15.conv.in_proj": { "source_tensor": "model.language_model.layers.15.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.15.conv.in_proj.weight", "scales_key": "language_model.model.layers.15.conv.in_proj.scales", "biases_key": "language_model.model.layers.15.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.15.conv.out_proj": { "source_tensor": "model.language_model.layers.15.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.15.conv.out_proj.weight", "scales_key": "language_model.model.layers.15.conv.out_proj.scales", "biases_key": "language_model.model.layers.15.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.15.feed_forward.w1": { "source_tensor": "model.language_model.layers.15.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.15.feed_forward.w1.weight", "scales_key": "language_model.model.layers.15.feed_forward.w1.scales", "biases_key": "language_model.model.layers.15.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.15.feed_forward.w2": { "source_tensor": "model.language_model.layers.15.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.15.feed_forward.w2.weight", "scales_key": "language_model.model.layers.15.feed_forward.w2.scales", "biases_key": "language_model.model.layers.15.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.15.feed_forward.w3": { "source_tensor": "model.language_model.layers.15.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.15.feed_forward.w3.weight", "scales_key": "language_model.model.layers.15.feed_forward.w3.scales", "biases_key": "language_model.model.layers.15.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.16.conv.in_proj": { "source_tensor": "model.language_model.layers.16.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.16.conv.in_proj.weight", "scales_key": "language_model.model.layers.16.conv.in_proj.scales", "biases_key": "language_model.model.layers.16.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.16.conv.out_proj": { "source_tensor": "model.language_model.layers.16.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.16.conv.out_proj.weight", "scales_key": "language_model.model.layers.16.conv.out_proj.scales", "biases_key": "language_model.model.layers.16.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.16.feed_forward.w1": { "source_tensor": "model.language_model.layers.16.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.16.feed_forward.w1.weight", "scales_key": "language_model.model.layers.16.feed_forward.w1.scales", "biases_key": "language_model.model.layers.16.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.16.feed_forward.w2": { "source_tensor": "model.language_model.layers.16.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.16.feed_forward.w2.weight", "scales_key": "language_model.model.layers.16.feed_forward.w2.scales", "biases_key": "language_model.model.layers.16.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.16.feed_forward.w3": { "source_tensor": "model.language_model.layers.16.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.16.feed_forward.w3.weight", "scales_key": "language_model.model.layers.16.feed_forward.w3.scales", "biases_key": "language_model.model.layers.16.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.17.feed_forward.w1": { "source_tensor": "model.language_model.layers.17.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.17.feed_forward.w1.weight", "scales_key": "language_model.model.layers.17.feed_forward.w1.scales", "biases_key": "language_model.model.layers.17.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.17.feed_forward.w2": { "source_tensor": "model.language_model.layers.17.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.17.feed_forward.w2.weight", "scales_key": "language_model.model.layers.17.feed_forward.w2.scales", "biases_key": "language_model.model.layers.17.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.17.feed_forward.w3": { "source_tensor": "model.language_model.layers.17.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.17.feed_forward.w3.weight", "scales_key": "language_model.model.layers.17.feed_forward.w3.scales", "biases_key": "language_model.model.layers.17.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.17.self_attn.k_proj": { "source_tensor": "model.language_model.layers.17.self_attn.k_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.17.self_attn.k_proj.weight", "scales_key": "language_model.model.layers.17.self_attn.k_proj.scales", "biases_key": "language_model.model.layers.17.self_attn.k_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.17.self_attn.out_proj": { "source_tensor": "model.language_model.layers.17.self_attn.out_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.17.self_attn.out_proj.weight", "scales_key": "language_model.model.layers.17.self_attn.out_proj.scales", "biases_key": "language_model.model.layers.17.self_attn.out_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.17.self_attn.q_proj": { "source_tensor": "model.language_model.layers.17.self_attn.q_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.17.self_attn.q_proj.weight", "scales_key": "language_model.model.layers.17.self_attn.q_proj.scales", "biases_key": "language_model.model.layers.17.self_attn.q_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.17.self_attn.v_proj": { "source_tensor": "model.language_model.layers.17.self_attn.v_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.17.self_attn.v_proj.weight", "scales_key": "language_model.model.layers.17.self_attn.v_proj.scales", "biases_key": "language_model.model.layers.17.self_attn.v_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.18.conv.in_proj": { "source_tensor": "model.language_model.layers.18.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.18.conv.in_proj.weight", "scales_key": "language_model.model.layers.18.conv.in_proj.scales", "biases_key": "language_model.model.layers.18.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.18.conv.out_proj": { "source_tensor": "model.language_model.layers.18.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.18.conv.out_proj.weight", "scales_key": "language_model.model.layers.18.conv.out_proj.scales", "biases_key": "language_model.model.layers.18.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.18.feed_forward.w1": { "source_tensor": "model.language_model.layers.18.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.18.feed_forward.w1.weight", "scales_key": "language_model.model.layers.18.feed_forward.w1.scales", "biases_key": "language_model.model.layers.18.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.18.feed_forward.w2": { "source_tensor": "model.language_model.layers.18.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.18.feed_forward.w2.weight", "scales_key": "language_model.model.layers.18.feed_forward.w2.scales", "biases_key": "language_model.model.layers.18.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.18.feed_forward.w3": { "source_tensor": "model.language_model.layers.18.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.18.feed_forward.w3.weight", "scales_key": "language_model.model.layers.18.feed_forward.w3.scales", "biases_key": "language_model.model.layers.18.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.19.conv.in_proj": { "source_tensor": "model.language_model.layers.19.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.19.conv.in_proj.weight", "scales_key": "language_model.model.layers.19.conv.in_proj.scales", "biases_key": "language_model.model.layers.19.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.19.conv.out_proj": { "source_tensor": "model.language_model.layers.19.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.19.conv.out_proj.weight", "scales_key": "language_model.model.layers.19.conv.out_proj.scales", "biases_key": "language_model.model.layers.19.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.19.feed_forward.w1": { "source_tensor": "model.language_model.layers.19.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.19.feed_forward.w1.weight", "scales_key": "language_model.model.layers.19.feed_forward.w1.scales", "biases_key": "language_model.model.layers.19.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.19.feed_forward.w2": { "source_tensor": "model.language_model.layers.19.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.19.feed_forward.w2.weight", "scales_key": "language_model.model.layers.19.feed_forward.w2.scales", "biases_key": "language_model.model.layers.19.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.19.feed_forward.w3": { "source_tensor": "model.language_model.layers.19.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.19.feed_forward.w3.weight", "scales_key": "language_model.model.layers.19.feed_forward.w3.scales", "biases_key": "language_model.model.layers.19.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.2.feed_forward.w1": { "source_tensor": "model.language_model.layers.2.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.2.feed_forward.w1.weight", "scales_key": "language_model.model.layers.2.feed_forward.w1.scales", "biases_key": "language_model.model.layers.2.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.2.feed_forward.w2": { "source_tensor": "model.language_model.layers.2.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.2.feed_forward.w2.weight", "scales_key": "language_model.model.layers.2.feed_forward.w2.scales", "biases_key": "language_model.model.layers.2.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.2.feed_forward.w3": { "source_tensor": "model.language_model.layers.2.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.2.feed_forward.w3.weight", "scales_key": "language_model.model.layers.2.feed_forward.w3.scales", "biases_key": "language_model.model.layers.2.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.2.self_attn.k_proj": { "source_tensor": "model.language_model.layers.2.self_attn.k_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.2.self_attn.k_proj.weight", "scales_key": "language_model.model.layers.2.self_attn.k_proj.scales", "biases_key": "language_model.model.layers.2.self_attn.k_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.2.self_attn.out_proj": { "source_tensor": "model.language_model.layers.2.self_attn.out_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.2.self_attn.out_proj.weight", "scales_key": "language_model.model.layers.2.self_attn.out_proj.scales", "biases_key": "language_model.model.layers.2.self_attn.out_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.2.self_attn.q_proj": { "source_tensor": "model.language_model.layers.2.self_attn.q_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.2.self_attn.q_proj.weight", "scales_key": "language_model.model.layers.2.self_attn.q_proj.scales", "biases_key": "language_model.model.layers.2.self_attn.q_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.2.self_attn.v_proj": { "source_tensor": "model.language_model.layers.2.self_attn.v_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.2.self_attn.v_proj.weight", "scales_key": "language_model.model.layers.2.self_attn.v_proj.scales", "biases_key": "language_model.model.layers.2.self_attn.v_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.20.conv.in_proj": { "source_tensor": "model.language_model.layers.20.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.20.conv.in_proj.weight", "scales_key": "language_model.model.layers.20.conv.in_proj.scales", "biases_key": "language_model.model.layers.20.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.20.conv.out_proj": { "source_tensor": "model.language_model.layers.20.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.20.conv.out_proj.weight", "scales_key": "language_model.model.layers.20.conv.out_proj.scales", "biases_key": "language_model.model.layers.20.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.20.feed_forward.w1": { "source_tensor": "model.language_model.layers.20.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.20.feed_forward.w1.weight", "scales_key": "language_model.model.layers.20.feed_forward.w1.scales", "biases_key": "language_model.model.layers.20.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.20.feed_forward.w2": { "source_tensor": "model.language_model.layers.20.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.20.feed_forward.w2.weight", "scales_key": "language_model.model.layers.20.feed_forward.w2.scales", "biases_key": "language_model.model.layers.20.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.20.feed_forward.w3": { "source_tensor": "model.language_model.layers.20.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.20.feed_forward.w3.weight", "scales_key": "language_model.model.layers.20.feed_forward.w3.scales", "biases_key": "language_model.model.layers.20.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.21.feed_forward.w1": { "source_tensor": "model.language_model.layers.21.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.21.feed_forward.w1.weight", "scales_key": "language_model.model.layers.21.feed_forward.w1.scales", "biases_key": "language_model.model.layers.21.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.21.feed_forward.w2": { "source_tensor": "model.language_model.layers.21.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.21.feed_forward.w2.weight", "scales_key": "language_model.model.layers.21.feed_forward.w2.scales", "biases_key": "language_model.model.layers.21.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.21.feed_forward.w3": { "source_tensor": "model.language_model.layers.21.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.21.feed_forward.w3.weight", "scales_key": "language_model.model.layers.21.feed_forward.w3.scales", "biases_key": "language_model.model.layers.21.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.21.self_attn.k_proj": { "source_tensor": "model.language_model.layers.21.self_attn.k_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.21.self_attn.k_proj.weight", "scales_key": "language_model.model.layers.21.self_attn.k_proj.scales", "biases_key": "language_model.model.layers.21.self_attn.k_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.21.self_attn.out_proj": { "source_tensor": "model.language_model.layers.21.self_attn.out_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.21.self_attn.out_proj.weight", "scales_key": "language_model.model.layers.21.self_attn.out_proj.scales", "biases_key": "language_model.model.layers.21.self_attn.out_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.21.self_attn.q_proj": { "source_tensor": "model.language_model.layers.21.self_attn.q_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.21.self_attn.q_proj.weight", "scales_key": "language_model.model.layers.21.self_attn.q_proj.scales", "biases_key": "language_model.model.layers.21.self_attn.q_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.21.self_attn.v_proj": { "source_tensor": "model.language_model.layers.21.self_attn.v_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.21.self_attn.v_proj.weight", "scales_key": "language_model.model.layers.21.self_attn.v_proj.scales", "biases_key": "language_model.model.layers.21.self_attn.v_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.22.conv.in_proj": { "source_tensor": "model.language_model.layers.22.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.22.conv.in_proj.weight", "scales_key": "language_model.model.layers.22.conv.in_proj.scales", "biases_key": "language_model.model.layers.22.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.22.conv.out_proj": { "source_tensor": "model.language_model.layers.22.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.22.conv.out_proj.weight", "scales_key": "language_model.model.layers.22.conv.out_proj.scales", "biases_key": "language_model.model.layers.22.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.22.feed_forward.w1": { "source_tensor": "model.language_model.layers.22.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.22.feed_forward.w1.weight", "scales_key": "language_model.model.layers.22.feed_forward.w1.scales", "biases_key": "language_model.model.layers.22.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.22.feed_forward.w2": { "source_tensor": "model.language_model.layers.22.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.22.feed_forward.w2.weight", "scales_key": "language_model.model.layers.22.feed_forward.w2.scales", "biases_key": "language_model.model.layers.22.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.22.feed_forward.w3": { "source_tensor": "model.language_model.layers.22.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.22.feed_forward.w3.weight", "scales_key": "language_model.model.layers.22.feed_forward.w3.scales", "biases_key": "language_model.model.layers.22.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.23.conv.in_proj": { "source_tensor": "model.language_model.layers.23.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.23.conv.in_proj.weight", "scales_key": "language_model.model.layers.23.conv.in_proj.scales", "biases_key": "language_model.model.layers.23.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.23.conv.out_proj": { "source_tensor": "model.language_model.layers.23.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.23.conv.out_proj.weight", "scales_key": "language_model.model.layers.23.conv.out_proj.scales", "biases_key": "language_model.model.layers.23.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.23.feed_forward.w1": { "source_tensor": "model.language_model.layers.23.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.23.feed_forward.w1.weight", "scales_key": "language_model.model.layers.23.feed_forward.w1.scales", "biases_key": "language_model.model.layers.23.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.23.feed_forward.w2": { "source_tensor": "model.language_model.layers.23.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.23.feed_forward.w2.weight", "scales_key": "language_model.model.layers.23.feed_forward.w2.scales", "biases_key": "language_model.model.layers.23.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.23.feed_forward.w3": { "source_tensor": "model.language_model.layers.23.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.23.feed_forward.w3.weight", "scales_key": "language_model.model.layers.23.feed_forward.w3.scales", "biases_key": "language_model.model.layers.23.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.24.feed_forward.w1": { "source_tensor": "model.language_model.layers.24.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.24.feed_forward.w1.weight", "scales_key": "language_model.model.layers.24.feed_forward.w1.scales", "biases_key": "language_model.model.layers.24.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.24.feed_forward.w2": { "source_tensor": "model.language_model.layers.24.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.24.feed_forward.w2.weight", "scales_key": "language_model.model.layers.24.feed_forward.w2.scales", "biases_key": "language_model.model.layers.24.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.24.feed_forward.w3": { "source_tensor": "model.language_model.layers.24.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.24.feed_forward.w3.weight", "scales_key": "language_model.model.layers.24.feed_forward.w3.scales", "biases_key": "language_model.model.layers.24.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.24.self_attn.k_proj": { "source_tensor": "model.language_model.layers.24.self_attn.k_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.24.self_attn.k_proj.weight", "scales_key": "language_model.model.layers.24.self_attn.k_proj.scales", "biases_key": "language_model.model.layers.24.self_attn.k_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.24.self_attn.out_proj": { "source_tensor": "model.language_model.layers.24.self_attn.out_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.24.self_attn.out_proj.weight", "scales_key": "language_model.model.layers.24.self_attn.out_proj.scales", "biases_key": "language_model.model.layers.24.self_attn.out_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.24.self_attn.q_proj": { "source_tensor": "model.language_model.layers.24.self_attn.q_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.24.self_attn.q_proj.weight", "scales_key": "language_model.model.layers.24.self_attn.q_proj.scales", "biases_key": "language_model.model.layers.24.self_attn.q_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.24.self_attn.v_proj": { "source_tensor": "model.language_model.layers.24.self_attn.v_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.24.self_attn.v_proj.weight", "scales_key": "language_model.model.layers.24.self_attn.v_proj.scales", "biases_key": "language_model.model.layers.24.self_attn.v_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.25.conv.in_proj": { "source_tensor": "model.language_model.layers.25.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.25.conv.in_proj.weight", "scales_key": "language_model.model.layers.25.conv.in_proj.scales", "biases_key": "language_model.model.layers.25.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.25.conv.out_proj": { "source_tensor": "model.language_model.layers.25.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.25.conv.out_proj.weight", "scales_key": "language_model.model.layers.25.conv.out_proj.scales", "biases_key": "language_model.model.layers.25.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.25.feed_forward.w1": { "source_tensor": "model.language_model.layers.25.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.25.feed_forward.w1.weight", "scales_key": "language_model.model.layers.25.feed_forward.w1.scales", "biases_key": "language_model.model.layers.25.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.25.feed_forward.w2": { "source_tensor": "model.language_model.layers.25.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.25.feed_forward.w2.weight", "scales_key": "language_model.model.layers.25.feed_forward.w2.scales", "biases_key": "language_model.model.layers.25.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.25.feed_forward.w3": { "source_tensor": "model.language_model.layers.25.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.25.feed_forward.w3.weight", "scales_key": "language_model.model.layers.25.feed_forward.w3.scales", "biases_key": "language_model.model.layers.25.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.26.conv.in_proj": { "source_tensor": "model.language_model.layers.26.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.26.conv.in_proj.weight", "scales_key": "language_model.model.layers.26.conv.in_proj.scales", "biases_key": "language_model.model.layers.26.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.26.conv.out_proj": { "source_tensor": "model.language_model.layers.26.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.26.conv.out_proj.weight", "scales_key": "language_model.model.layers.26.conv.out_proj.scales", "biases_key": "language_model.model.layers.26.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.26.feed_forward.w1": { "source_tensor": "model.language_model.layers.26.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.26.feed_forward.w1.weight", "scales_key": "language_model.model.layers.26.feed_forward.w1.scales", "biases_key": "language_model.model.layers.26.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.26.feed_forward.w2": { "source_tensor": "model.language_model.layers.26.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.26.feed_forward.w2.weight", "scales_key": "language_model.model.layers.26.feed_forward.w2.scales", "biases_key": "language_model.model.layers.26.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.26.feed_forward.w3": { "source_tensor": "model.language_model.layers.26.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.26.feed_forward.w3.weight", "scales_key": "language_model.model.layers.26.feed_forward.w3.scales", "biases_key": "language_model.model.layers.26.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.27.feed_forward.w1": { "source_tensor": "model.language_model.layers.27.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.27.feed_forward.w1.weight", "scales_key": "language_model.model.layers.27.feed_forward.w1.scales", "biases_key": "language_model.model.layers.27.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.27.feed_forward.w2": { "source_tensor": "model.language_model.layers.27.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.27.feed_forward.w2.weight", "scales_key": "language_model.model.layers.27.feed_forward.w2.scales", "biases_key": "language_model.model.layers.27.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.27.feed_forward.w3": { "source_tensor": "model.language_model.layers.27.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.27.feed_forward.w3.weight", "scales_key": "language_model.model.layers.27.feed_forward.w3.scales", "biases_key": "language_model.model.layers.27.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.27.self_attn.k_proj": { "source_tensor": "model.language_model.layers.27.self_attn.k_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.27.self_attn.k_proj.weight", "scales_key": "language_model.model.layers.27.self_attn.k_proj.scales", "biases_key": "language_model.model.layers.27.self_attn.k_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.27.self_attn.out_proj": { "source_tensor": "model.language_model.layers.27.self_attn.out_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.27.self_attn.out_proj.weight", "scales_key": "language_model.model.layers.27.self_attn.out_proj.scales", "biases_key": "language_model.model.layers.27.self_attn.out_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.27.self_attn.q_proj": { "source_tensor": "model.language_model.layers.27.self_attn.q_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.27.self_attn.q_proj.weight", "scales_key": "language_model.model.layers.27.self_attn.q_proj.scales", "biases_key": "language_model.model.layers.27.self_attn.q_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.27.self_attn.v_proj": { "source_tensor": "model.language_model.layers.27.self_attn.v_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.27.self_attn.v_proj.weight", "scales_key": "language_model.model.layers.27.self_attn.v_proj.scales", "biases_key": "language_model.model.layers.27.self_attn.v_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.28.conv.in_proj": { "source_tensor": "model.language_model.layers.28.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.28.conv.in_proj.weight", "scales_key": "language_model.model.layers.28.conv.in_proj.scales", "biases_key": "language_model.model.layers.28.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.28.conv.out_proj": { "source_tensor": "model.language_model.layers.28.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.28.conv.out_proj.weight", "scales_key": "language_model.model.layers.28.conv.out_proj.scales", "biases_key": "language_model.model.layers.28.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.28.feed_forward.w1": { "source_tensor": "model.language_model.layers.28.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.28.feed_forward.w1.weight", "scales_key": "language_model.model.layers.28.feed_forward.w1.scales", "biases_key": "language_model.model.layers.28.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.28.feed_forward.w2": { "source_tensor": "model.language_model.layers.28.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.28.feed_forward.w2.weight", "scales_key": "language_model.model.layers.28.feed_forward.w2.scales", "biases_key": "language_model.model.layers.28.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.28.feed_forward.w3": { "source_tensor": "model.language_model.layers.28.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.28.feed_forward.w3.weight", "scales_key": "language_model.model.layers.28.feed_forward.w3.scales", "biases_key": "language_model.model.layers.28.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.29.conv.in_proj": { "source_tensor": "model.language_model.layers.29.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.29.conv.in_proj.weight", "scales_key": "language_model.model.layers.29.conv.in_proj.scales", "biases_key": "language_model.model.layers.29.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.29.conv.out_proj": { "source_tensor": "model.language_model.layers.29.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.29.conv.out_proj.weight", "scales_key": "language_model.model.layers.29.conv.out_proj.scales", "biases_key": "language_model.model.layers.29.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.29.feed_forward.w1": { "source_tensor": "model.language_model.layers.29.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.29.feed_forward.w1.weight", "scales_key": "language_model.model.layers.29.feed_forward.w1.scales", "biases_key": "language_model.model.layers.29.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.29.feed_forward.w2": { "source_tensor": "model.language_model.layers.29.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.29.feed_forward.w2.weight", "scales_key": "language_model.model.layers.29.feed_forward.w2.scales", "biases_key": "language_model.model.layers.29.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.29.feed_forward.w3": { "source_tensor": "model.language_model.layers.29.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.29.feed_forward.w3.weight", "scales_key": "language_model.model.layers.29.feed_forward.w3.scales", "biases_key": "language_model.model.layers.29.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.3.conv.in_proj": { "source_tensor": "model.language_model.layers.3.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.3.conv.in_proj.weight", "scales_key": "language_model.model.layers.3.conv.in_proj.scales", "biases_key": "language_model.model.layers.3.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.3.conv.out_proj": { "source_tensor": "model.language_model.layers.3.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.3.conv.out_proj.weight", "scales_key": "language_model.model.layers.3.conv.out_proj.scales", "biases_key": "language_model.model.layers.3.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.3.feed_forward.w1": { "source_tensor": "model.language_model.layers.3.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.3.feed_forward.w1.weight", "scales_key": "language_model.model.layers.3.feed_forward.w1.scales", "biases_key": "language_model.model.layers.3.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.3.feed_forward.w2": { "source_tensor": "model.language_model.layers.3.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.3.feed_forward.w2.weight", "scales_key": "language_model.model.layers.3.feed_forward.w2.scales", "biases_key": "language_model.model.layers.3.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.3.feed_forward.w3": { "source_tensor": "model.language_model.layers.3.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.3.feed_forward.w3.weight", "scales_key": "language_model.model.layers.3.feed_forward.w3.scales", "biases_key": "language_model.model.layers.3.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.4.conv.in_proj": { "source_tensor": "model.language_model.layers.4.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.4.conv.in_proj.weight", "scales_key": "language_model.model.layers.4.conv.in_proj.scales", "biases_key": "language_model.model.layers.4.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.4.conv.out_proj": { "source_tensor": "model.language_model.layers.4.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.4.conv.out_proj.weight", "scales_key": "language_model.model.layers.4.conv.out_proj.scales", "biases_key": "language_model.model.layers.4.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.4.feed_forward.w1": { "source_tensor": "model.language_model.layers.4.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.4.feed_forward.w1.weight", "scales_key": "language_model.model.layers.4.feed_forward.w1.scales", "biases_key": "language_model.model.layers.4.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.4.feed_forward.w2": { "source_tensor": "model.language_model.layers.4.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.4.feed_forward.w2.weight", "scales_key": "language_model.model.layers.4.feed_forward.w2.scales", "biases_key": "language_model.model.layers.4.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.4.feed_forward.w3": { "source_tensor": "model.language_model.layers.4.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.4.feed_forward.w3.weight", "scales_key": "language_model.model.layers.4.feed_forward.w3.scales", "biases_key": "language_model.model.layers.4.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.5.feed_forward.w1": { "source_tensor": "model.language_model.layers.5.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.5.feed_forward.w1.weight", "scales_key": "language_model.model.layers.5.feed_forward.w1.scales", "biases_key": "language_model.model.layers.5.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.5.feed_forward.w2": { "source_tensor": "model.language_model.layers.5.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.5.feed_forward.w2.weight", "scales_key": "language_model.model.layers.5.feed_forward.w2.scales", "biases_key": "language_model.model.layers.5.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.5.feed_forward.w3": { "source_tensor": "model.language_model.layers.5.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.5.feed_forward.w3.weight", "scales_key": "language_model.model.layers.5.feed_forward.w3.scales", "biases_key": "language_model.model.layers.5.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.5.self_attn.k_proj": { "source_tensor": "model.language_model.layers.5.self_attn.k_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.5.self_attn.k_proj.weight", "scales_key": "language_model.model.layers.5.self_attn.k_proj.scales", "biases_key": "language_model.model.layers.5.self_attn.k_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.5.self_attn.out_proj": { "source_tensor": "model.language_model.layers.5.self_attn.out_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.5.self_attn.out_proj.weight", "scales_key": "language_model.model.layers.5.self_attn.out_proj.scales", "biases_key": "language_model.model.layers.5.self_attn.out_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.5.self_attn.q_proj": { "source_tensor": "model.language_model.layers.5.self_attn.q_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.5.self_attn.q_proj.weight", "scales_key": "language_model.model.layers.5.self_attn.q_proj.scales", "biases_key": "language_model.model.layers.5.self_attn.q_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.5.self_attn.v_proj": { "source_tensor": "model.language_model.layers.5.self_attn.v_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.5.self_attn.v_proj.weight", "scales_key": "language_model.model.layers.5.self_attn.v_proj.scales", "biases_key": "language_model.model.layers.5.self_attn.v_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.6.conv.in_proj": { "source_tensor": "model.language_model.layers.6.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.6.conv.in_proj.weight", "scales_key": "language_model.model.layers.6.conv.in_proj.scales", "biases_key": "language_model.model.layers.6.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.6.conv.out_proj": { "source_tensor": "model.language_model.layers.6.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.6.conv.out_proj.weight", "scales_key": "language_model.model.layers.6.conv.out_proj.scales", "biases_key": "language_model.model.layers.6.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.6.feed_forward.w1": { "source_tensor": "model.language_model.layers.6.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.6.feed_forward.w1.weight", "scales_key": "language_model.model.layers.6.feed_forward.w1.scales", "biases_key": "language_model.model.layers.6.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.6.feed_forward.w2": { "source_tensor": "model.language_model.layers.6.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.6.feed_forward.w2.weight", "scales_key": "language_model.model.layers.6.feed_forward.w2.scales", "biases_key": "language_model.model.layers.6.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.6.feed_forward.w3": { "source_tensor": "model.language_model.layers.6.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.6.feed_forward.w3.weight", "scales_key": "language_model.model.layers.6.feed_forward.w3.scales", "biases_key": "language_model.model.layers.6.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.7.conv.in_proj": { "source_tensor": "model.language_model.layers.7.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.7.conv.in_proj.weight", "scales_key": "language_model.model.layers.7.conv.in_proj.scales", "biases_key": "language_model.model.layers.7.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.7.conv.out_proj": { "source_tensor": "model.language_model.layers.7.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.7.conv.out_proj.weight", "scales_key": "language_model.model.layers.7.conv.out_proj.scales", "biases_key": "language_model.model.layers.7.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.7.feed_forward.w1": { "source_tensor": "model.language_model.layers.7.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.7.feed_forward.w1.weight", "scales_key": "language_model.model.layers.7.feed_forward.w1.scales", "biases_key": "language_model.model.layers.7.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.7.feed_forward.w2": { "source_tensor": "model.language_model.layers.7.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.7.feed_forward.w2.weight", "scales_key": "language_model.model.layers.7.feed_forward.w2.scales", "biases_key": "language_model.model.layers.7.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.7.feed_forward.w3": { "source_tensor": "model.language_model.layers.7.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.7.feed_forward.w3.weight", "scales_key": "language_model.model.layers.7.feed_forward.w3.scales", "biases_key": "language_model.model.layers.7.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.8.conv.in_proj": { "source_tensor": "model.language_model.layers.8.conv.in_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.8.conv.in_proj.weight", "scales_key": "language_model.model.layers.8.conv.in_proj.scales", "biases_key": "language_model.model.layers.8.conv.in_proj.biases", "weight_shape": [ 6144, 256 ], "scales_shape": [ 6144, 32 ], "biases_shape": [ 6144, 32 ] }, "language_model.model.layers.8.conv.out_proj": { "source_tensor": "model.language_model.layers.8.conv.out_proj.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.8.conv.out_proj.weight", "scales_key": "language_model.model.layers.8.conv.out_proj.scales", "biases_key": "language_model.model.layers.8.conv.out_proj.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.8.feed_forward.w1": { "source_tensor": "model.language_model.layers.8.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.8.feed_forward.w1.weight", "scales_key": "language_model.model.layers.8.feed_forward.w1.scales", "biases_key": "language_model.model.layers.8.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.8.feed_forward.w2": { "source_tensor": "model.language_model.layers.8.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.8.feed_forward.w2.weight", "scales_key": "language_model.model.layers.8.feed_forward.w2.scales", "biases_key": "language_model.model.layers.8.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.8.feed_forward.w3": { "source_tensor": "model.language_model.layers.8.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.8.feed_forward.w3.weight", "scales_key": "language_model.model.layers.8.feed_forward.w3.scales", "biases_key": "language_model.model.layers.8.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.9.feed_forward.w1": { "source_tensor": "model.language_model.layers.9.feed_forward.w1.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.9.feed_forward.w1.weight", "scales_key": "language_model.model.layers.9.feed_forward.w1.scales", "biases_key": "language_model.model.layers.9.feed_forward.w1.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.9.feed_forward.w2": { "source_tensor": "model.language_model.layers.9.feed_forward.w2.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.9.feed_forward.w2.weight", "scales_key": "language_model.model.layers.9.feed_forward.w2.scales", "biases_key": "language_model.model.layers.9.feed_forward.w2.biases", "weight_shape": [ 2048, 1344 ], "scales_shape": [ 2048, 168 ], "biases_shape": [ 2048, 168 ] }, "language_model.model.layers.9.feed_forward.w3": { "source_tensor": "model.language_model.layers.9.feed_forward.w3.weight", "bits": 4, "group_size": 64, "weight_key": "language_model.model.layers.9.feed_forward.w3.weight", "scales_key": "language_model.model.layers.9.feed_forward.w3.scales", "biases_key": "language_model.model.layers.9.feed_forward.w3.biases", "weight_shape": [ 10752, 256 ], "scales_shape": [ 10752, 32 ], "biases_shape": [ 10752, 32 ] }, "language_model.model.layers.9.self_attn.k_proj": { "source_tensor": "model.language_model.layers.9.self_attn.k_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.9.self_attn.k_proj.weight", "scales_key": "language_model.model.layers.9.self_attn.k_proj.scales", "biases_key": "language_model.model.layers.9.self_attn.k_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "language_model.model.layers.9.self_attn.out_proj": { "source_tensor": "model.language_model.layers.9.self_attn.out_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.9.self_attn.out_proj.weight", "scales_key": "language_model.model.layers.9.self_attn.out_proj.scales", "biases_key": "language_model.model.layers.9.self_attn.out_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.9.self_attn.q_proj": { "source_tensor": "model.language_model.layers.9.self_attn.q_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.9.self_attn.q_proj.weight", "scales_key": "language_model.model.layers.9.self_attn.q_proj.scales", "biases_key": "language_model.model.layers.9.self_attn.q_proj.biases", "weight_shape": [ 2048, 512 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] }, "language_model.model.layers.9.self_attn.v_proj": { "source_tensor": "model.language_model.layers.9.self_attn.v_proj.weight", "bits": 8, "group_size": 64, "weight_key": "language_model.model.layers.9.self_attn.v_proj.weight", "scales_key": "language_model.model.layers.9.self_attn.v_proj.scales", "biases_key": "language_model.model.layers.9.self_attn.v_proj.biases", "weight_shape": [ 512, 512 ], "scales_shape": [ 512, 32 ], "biases_shape": [ 512, 32 ] }, "model.multi_modal_projector.linear_1": { "source_tensor": "model.multi_modal_projector.linear_1.weight", "bits": 4, "group_size": 64, "weight_key": "model.multi_modal_projector.linear_1.weight", "scales_key": "model.multi_modal_projector.linear_1.scales", "biases_key": "model.multi_modal_projector.linear_1.biases", "weight_shape": [ 2048, 576 ], "scales_shape": [ 2048, 72 ], "biases_shape": [ 2048, 72 ] }, "model.multi_modal_projector.linear_2": { "source_tensor": "model.multi_modal_projector.linear_2.weight", "bits": 4, "group_size": 64, "weight_key": "model.multi_modal_projector.linear_2.weight", "scales_key": "model.multi_modal_projector.linear_2.scales", "biases_key": "model.multi_modal_projector.linear_2.biases", "weight_shape": [ 2048, 256 ], "scales_shape": [ 2048, 32 ], "biases_shape": [ 2048, 32 ] } } }, "source_model": { "name": "LFM2.5-VL-3B", "dtype": "bfloat16", "parameters": "2.7B" }, "architecture": { "type": "transformer", "attention": "gqa", "has_vision": true, "has_ssm": false, "has_moe": false }, "runtime": { "total_weight_bytes": 2392606560, "total_weight_gb": 2.23 }, "capabilities": { "reasoning_parser": "qwen3", "tool_parser": "lfm2", "think_in_template": false, "supports_tools": true, "supports_thinking": false, "family": "lfm2", "modality": "vision", "modalities": { "text": true, "vision": true, "audio": false, "video": false }, "has_vision": true, "has_audio": false, "has_video": false, "cache_type": "hybrid", "default_reasoning": "off" }, "format": "jang", "format_version": "2.0", "chat": { "sampling_defaults": { "temperature": 0.2, "top_p": 1.0, "top_k": 50, "repetition_penalty": 1.0, "source": "vendor_card+generation_config_2026-08-12" }, "stop_token_ids": [ 124900 ] }, "reasoning": { "supported": false, "default": "off", "think_in_template": false, "tiers": null, "note": "LFM2.5-VL-3B answers directly; the card states it does not reason. The template has no prefill and no enable_thinking kwarg. `preserve_thinking` (default false) only controls whether in PRIOR assistant turns is kept \u2014 it is history handling, not a reasoning rail." }, "tools": { "supported": true, "parser": "lfm2", "mlx_lm_parser": "pythonic", "dialect": "pythonic", "format": "<|tool_call_start|>[fn(arg='v')]<|tool_call_end|>", "tools_in_system_prompt": true }, "vision": { "supported": true, "tower": "siglip2_vision_model (so400m-patch16-naflex)", "tower_precision": "source (not quantized)", "image_token_id": 124907, "max_image_tokens": 256, "max_tiles": 10, "processor": "Lfm2VlProcessor (processor_config.json)" } }