{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 1755, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0017094017094017094, "grad_norm": 15.0625, "learning_rate": 5.681818181818182e-08, "loss": 1.3066431283950806, "step": 1, "token_acc": 0.7159380060143419 }, { "epoch": 0.08547008547008547, "grad_norm": 7.46875, "learning_rate": 2.8409090909090916e-06, "loss": 1.2084802900041853, "step": 50, "token_acc": 0.7292212264173042 }, { "epoch": 0.17094017094017094, "grad_norm": 2.890625, "learning_rate": 4.999360732624273e-06, "loss": 0.9122968292236329, "step": 100, "token_acc": 0.753969500240032 }, { "epoch": 0.2564102564102564, "grad_norm": 2.921875, "learning_rate": 4.9829537920824185e-06, "loss": 0.8321476745605468, "step": 150, "token_acc": 0.7675780382260687 }, { "epoch": 0.3418803418803419, "grad_norm": 3.015625, "learning_rate": 4.944516784287853e-06, "loss": 0.8292338562011718, "step": 200, "token_acc": 0.7674050705465351 }, { "epoch": 0.42735042735042733, "grad_norm": 3.09375, "learning_rate": 4.884390742516911e-06, "loss": 0.7959442901611328, "step": 250, "token_acc": 0.7729205563645134 }, { "epoch": 0.5128205128205128, "grad_norm": 2.53125, "learning_rate": 4.803109136521662e-06, "loss": 0.7765541076660156, "step": 300, "token_acc": 0.7768116204435069 }, { "epoch": 0.5982905982905983, "grad_norm": 3.171875, "learning_rate": 4.701393139306689e-06, "loss": 0.7773086547851562, "step": 350, "token_acc": 0.778023227333016 }, { "epoch": 0.6837606837606838, "grad_norm": 3.28125, "learning_rate": 4.5801452285042655e-06, "loss": 0.7690617370605469, "step": 400, "token_acc": 0.7791949190530791 }, { "epoch": 0.7692307692307693, "grad_norm": 3.109375, "learning_rate": 4.440441179119851e-06, "loss": 0.7732680511474609, "step": 450, "token_acc": 0.7783357143196153 }, { "epoch": 0.8547008547008547, "grad_norm": 2.765625, "learning_rate": 4.28352051869247e-06, "loss": 0.776756591796875, "step": 500, "token_acc": 0.7770325603100023 }, { "epoch": 0.9401709401709402, "grad_norm": 2.9375, "learning_rate": 4.110775529556807e-06, "loss": 0.7824362945556641, "step": 550, "token_acc": 0.7757224632997877 }, { "epoch": 1.0256410256410255, "grad_norm": 2.78125, "learning_rate": 3.923738895784698e-06, "loss": 0.7578450775146485, "step": 600, "token_acc": 0.7808272094745979 }, { "epoch": 1.1111111111111112, "grad_norm": 2.859375, "learning_rate": 3.7240701044088277e-06, "loss": 0.7588211059570312, "step": 650, "token_acc": 0.7814435027994716 }, { "epoch": 1.1965811965811965, "grad_norm": 3.46875, "learning_rate": 3.5135407215841166e-06, "loss": 0.7481551361083985, "step": 700, "token_acc": 0.7833868291553018 }, { "epoch": 1.282051282051282, "grad_norm": 2.921875, "learning_rate": 3.294018674324384e-06, "loss": 0.753250732421875, "step": 750, "token_acc": 0.7816448681001995 }, { "epoch": 1.3675213675213675, "grad_norm": 3.390625, "learning_rate": 3.0674516772749886e-06, "loss": 0.7472420501708984, "step": 800, "token_acc": 0.7838917921918229 }, { "epoch": 1.452991452991453, "grad_norm": 3.140625, "learning_rate": 2.835849951567775e-06, "loss": 0.7469297027587891, "step": 850, "token_acc": 0.7837927886809676 }, { "epoch": 1.5384615384615383, "grad_norm": 3.078125, "learning_rate": 2.60126838908573e-06, "loss": 0.7334256744384766, "step": 900, "token_acc": 0.7865374697051991 }, { "epoch": 1.623931623931624, "grad_norm": 3.3125, "learning_rate": 2.365788320385306e-06, "loss": 0.7391526031494141, "step": 950, "token_acc": 0.783706698418852 }, { "epoch": 1.7094017094017095, "grad_norm": 2.890625, "learning_rate": 2.131499048040996e-06, "loss": 0.7512391662597656, "step": 1000, "token_acc": 0.7837811052849704 }, { "epoch": 1.7948717948717947, "grad_norm": 2.984375, "learning_rate": 1.9004793092579756e-06, "loss": 0.7405524444580078, "step": 1050, "token_acc": 0.7852440708156427 }, { "epoch": 1.8803418803418803, "grad_norm": 3.21875, "learning_rate": 1.6747788322262437e-06, "loss": 0.7450194549560547, "step": 1100, "token_acc": 0.7843423893486866 }, { "epoch": 1.965811965811966, "grad_norm": 2.859375, "learning_rate": 1.4564001498579425e-06, "loss": 0.7450698089599609, "step": 1150, "token_acc": 0.7845538037725732 }, { "epoch": 2.051282051282051, "grad_norm": 3.3125, "learning_rate": 1.247280832265926e-06, "loss": 0.7369001770019531, "step": 1200, "token_acc": 0.7857595940374247 }, { "epoch": 2.1367521367521367, "grad_norm": 2.890625, "learning_rate": 1.0492762956263162e-06, "loss": 0.7386644744873047, "step": 1250, "token_acc": 0.7860841155134701 }, { "epoch": 2.2222222222222223, "grad_norm": 2.59375, "learning_rate": 8.641433399538466e-07, "loss": 0.7391439056396485, "step": 1300, "token_acc": 0.7862151522825112 }, { "epoch": 2.3076923076923075, "grad_norm": 3.03125, "learning_rate": 6.935245618514666e-07, "loss": 0.7429191589355468, "step": 1350, "token_acc": 0.7847435690017797 }, { "epoch": 2.393162393162393, "grad_norm": 2.71875, "learning_rate": 5.389337805324687e-07, "loss": 0.7441853332519531, "step": 1400, "token_acc": 0.7835661798058605 }, { "epoch": 2.4786324786324787, "grad_norm": 3.265625, "learning_rate": 4.017426064230995e-07, "loss": 0.7286052703857422, "step": 1450, "token_acc": 0.7877004145766489 }, { "epoch": 2.564102564102564, "grad_norm": 2.984375, "learning_rate": 2.8316827151605444e-07, "loss": 0.7406098175048829, "step": 1500, "token_acc": 0.7840002165547049 }, { "epoch": 2.6495726495726495, "grad_norm": 3.390625, "learning_rate": 1.8426282945033957e-07, "loss": 0.7333684539794922, "step": 1550, "token_acc": 0.7866899334919993 }, { "epoch": 2.735042735042735, "grad_norm": 3.140625, "learning_rate": 1.0590382114005481e-07, "loss": 0.7373855590820313, "step": 1600, "token_acc": 0.7864740649587948 }, { "epoch": 2.8205128205128203, "grad_norm": 3.625, "learning_rate": 4.878648877151643e-08, "loss": 0.7367401123046875, "step": 1650, "token_acc": 0.7855127723260985 }, { "epoch": 2.905982905982906, "grad_norm": 2.546875, "learning_rate": 1.3417607250237053e-08, "loss": 0.7399304962158203, "step": 1700, "token_acc": 0.7852329450915141 }, { "epoch": 2.9914529914529915, "grad_norm": 3.140625, "learning_rate": 1.1098782838336874e-10, "loss": 0.7475210571289063, "step": 1750, "token_acc": 0.7824921559838638 } ], "logging_steps": 50, "max_steps": 1755, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 6.872592034540954e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }