{ "best_metric": 0.8500627352572145, "best_model_checkpoint": "./hatebert_finetuned_v5/checkpoint-15000", "epoch": 1.8799348289259306, "eval_steps": 1000, "global_step": 15000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.06266449429753101, "grad_norm": 2.7858245372772217, "learning_rate": 4.160401002506266e-06, "loss": 0.5658, "step": 500 }, { "epoch": 0.12532898859506203, "grad_norm": 0.6836428642272949, "learning_rate": 8.320802005012531e-06, "loss": 0.3394, "step": 1000 }, { "epoch": 0.12532898859506203, "eval_accuracy": 0.9509008303305656, "eval_f1": 0.7696604439217992, "eval_loss": 0.3321492373943329, "eval_optimal_threshold": 0.7856788039207458, "eval_runtime": 24.5664, "eval_samples_per_second": 1299.13, "eval_steps_per_second": 40.625, "step": 1000 }, { "epoch": 0.18799348289259304, "grad_norm": 0.07630700618028641, "learning_rate": 1.2497911445279867e-05, "loss": 0.3098, "step": 1500 }, { "epoch": 0.25065797719012406, "grad_norm": 0.6884164214134216, "learning_rate": 1.66750208855472e-05, "loss": 0.3245, "step": 2000 }, { "epoch": 0.25065797719012406, "eval_accuracy": 0.9620241265862447, "eval_f1": 0.8181272509003601, "eval_loss": 0.24252600967884064, "eval_optimal_threshold": 0.6846858263015747, "eval_runtime": 24.5401, "eval_samples_per_second": 1300.526, "eval_steps_per_second": 40.668, "step": 2000 }, { "epoch": 0.3133224714876551, "grad_norm": 1.6269655227661133, "learning_rate": 1.9906234043540826e-05, "loss": 0.2939, "step": 2500 }, { "epoch": 0.3759869657851861, "grad_norm": 53.418663024902344, "learning_rate": 1.9442046140277588e-05, "loss": 0.2911, "step": 3000 }, { "epoch": 0.3759869657851861, "eval_accuracy": 0.9669434435218549, "eval_f1": 0.8339889850511408, "eval_loss": 0.32369741797447205, "eval_optimal_threshold": 0.639145016670227, "eval_runtime": 24.5157, "eval_samples_per_second": 1301.819, "eval_steps_per_second": 40.709, "step": 3000 }, { "epoch": 0.43865146008271716, "grad_norm": 2.552913188934326, "learning_rate": 1.8977858237014345e-05, "loss": 0.2717, "step": 3500 }, { "epoch": 0.5013159543802481, "grad_norm": 74.53817749023438, "learning_rate": 1.8513670333751103e-05, "loss": 0.2574, "step": 4000 }, { "epoch": 0.5013159543802481, "eval_accuracy": 0.9656587811373962, "eval_f1": 0.8311768330252619, "eval_loss": 0.344524085521698, "eval_optimal_threshold": 0.903037965297699, "eval_runtime": 24.5127, "eval_samples_per_second": 1301.981, "eval_steps_per_second": 40.714, "step": 4000 }, { "epoch": 0.5639804486777792, "grad_norm": 4.5688018798828125, "learning_rate": 1.8049482430487864e-05, "loss": 0.2455, "step": 4500 }, { "epoch": 0.6266449429753101, "grad_norm": 0.18218272924423218, "learning_rate": 1.7585294527224622e-05, "loss": 0.278, "step": 5000 }, { "epoch": 0.6266449429753101, "eval_accuracy": 0.966818110606298, "eval_f1": 0.8378005820186859, "eval_loss": 0.22682912647724152, "eval_optimal_threshold": 0.8996956944465637, "eval_runtime": 24.5217, "eval_samples_per_second": 1301.5, "eval_steps_per_second": 40.699, "step": 5000 }, { "epoch": 0.6893094372728412, "grad_norm": 1.167153239250183, "learning_rate": 1.712110662396138e-05, "loss": 0.2859, "step": 5500 }, { "epoch": 0.7519739315703722, "grad_norm": 8.231012344360352, "learning_rate": 1.665691872069814e-05, "loss": 0.2335, "step": 6000 }, { "epoch": 0.7519739315703722, "eval_accuracy": 0.9660661131129563, "eval_f1": 0.8360333080999243, "eval_loss": 0.2758038341999054, "eval_optimal_threshold": 0.3707093894481659, "eval_runtime": 24.5444, "eval_samples_per_second": 1300.296, "eval_steps_per_second": 40.661, "step": 6000 }, { "epoch": 0.8146384258679032, "grad_norm": 8.103411674499512, "learning_rate": 1.6193659193241424e-05, "loss": 0.2617, "step": 6500 }, { "epoch": 0.8773029201654343, "grad_norm": 0.008309279568493366, "learning_rate": 1.5729471289978185e-05, "loss": 0.2656, "step": 7000 }, { "epoch": 0.8773029201654343, "eval_accuracy": 0.966034779884067, "eval_f1": 0.8370904718966036, "eval_loss": 0.28418678045272827, "eval_optimal_threshold": 0.9179669618606567, "eval_runtime": 24.512, "eval_samples_per_second": 1302.016, "eval_steps_per_second": 40.715, "step": 7000 }, { "epoch": 0.9399674144629653, "grad_norm": 11.311033248901367, "learning_rate": 1.5265283386714943e-05, "loss": 0.2464, "step": 7500 }, { "epoch": 1.0026319087604962, "grad_norm": 0.2538510262966156, "learning_rate": 1.4801095483451701e-05, "loss": 0.2474, "step": 8000 }, { "epoch": 1.0026319087604962, "eval_accuracy": 0.9657841140529532, "eval_f1": 0.8362327534493101, "eval_loss": 0.29536861181259155, "eval_optimal_threshold": 0.9757624268531799, "eval_runtime": 24.5401, "eval_samples_per_second": 1300.525, "eval_steps_per_second": 40.668, "step": 8000 }, { "epoch": 1.0652964030580274, "grad_norm": 0.09177704900503159, "learning_rate": 1.4336907580188462e-05, "loss": 0.1691, "step": 8500 }, { "epoch": 1.1279608973555584, "grad_norm": 0.3952280580997467, "learning_rate": 1.3872719676925222e-05, "loss": 0.1862, "step": 9000 }, { "epoch": 1.1279608973555584, "eval_accuracy": 0.9682907723640921, "eval_f1": 0.843440594059406, "eval_loss": 0.298546701669693, "eval_optimal_threshold": 0.8941442370414734, "eval_runtime": 24.557, "eval_samples_per_second": 1299.63, "eval_steps_per_second": 40.64, "step": 9000 }, { "epoch": 1.1906253916530893, "grad_norm": 0.009977204725146294, "learning_rate": 1.340853177366198e-05, "loss": 0.1579, "step": 9500 }, { "epoch": 1.2532898859506203, "grad_norm": 0.2561907470226288, "learning_rate": 1.2944343870398739e-05, "loss": 0.1869, "step": 10000 }, { "epoch": 1.2532898859506203, "eval_accuracy": 0.9682594391352028, "eval_f1": 0.8454143140546315, "eval_loss": 0.3232070207595825, "eval_optimal_threshold": 0.9672868847846985, "eval_runtime": 24.5414, "eval_samples_per_second": 1300.454, "eval_steps_per_second": 40.666, "step": 10000 }, { "epoch": 1.3159543802481515, "grad_norm": 0.14401866495609283, "learning_rate": 1.2480155967135497e-05, "loss": 0.1901, "step": 10500 }, { "epoch": 1.3786188745456824, "grad_norm": 0.20385725796222687, "learning_rate": 1.2015968063872256e-05, "loss": 0.173, "step": 11000 }, { "epoch": 1.3786188745456824, "eval_accuracy": 0.9673194422685257, "eval_f1": 0.8431343059106633, "eval_loss": 0.26260536909103394, "eval_optimal_threshold": 0.9728307723999023, "eval_runtime": 24.51, "eval_samples_per_second": 1302.121, "eval_steps_per_second": 40.718, "step": 11000 }, { "epoch": 1.4412833688432134, "grad_norm": 0.26596102118492126, "learning_rate": 1.1552708536415542e-05, "loss": 0.1654, "step": 11500 }, { "epoch": 1.5039478631407444, "grad_norm": 0.09112328290939331, "learning_rate": 1.10885206331523e-05, "loss": 0.2088, "step": 12000 }, { "epoch": 1.5039478631407444, "eval_accuracy": 0.9675387748707505, "eval_f1": 0.8438347904733192, "eval_loss": 0.30822300910949707, "eval_optimal_threshold": 0.9813465476036072, "eval_runtime": 24.5129, "eval_samples_per_second": 1301.97, "eval_steps_per_second": 40.713, "step": 12000 }, { "epoch": 1.5666123574382755, "grad_norm": 0.1223333552479744, "learning_rate": 1.0625261105695586e-05, "loss": 0.168, "step": 12500 }, { "epoch": 1.6292768517358065, "grad_norm": 21.354354858398438, "learning_rate": 1.0161073202432346e-05, "loss": 0.1621, "step": 13000 }, { "epoch": 1.6292768517358065, "eval_accuracy": 0.9618361272129093, "eval_f1": 0.82609937178755, "eval_loss": 0.2638513147830963, "eval_optimal_threshold": 0.9734938144683838, "eval_runtime": 24.4962, "eval_samples_per_second": 1302.854, "eval_steps_per_second": 40.741, "step": 13000 }, { "epoch": 1.6919413460333375, "grad_norm": 0.11861222982406616, "learning_rate": 9.696885299169104e-06, "loss": 0.1757, "step": 13500 }, { "epoch": 1.7546058403308686, "grad_norm": 0.12898346781730652, "learning_rate": 9.232697395905863e-06, "loss": 0.1665, "step": 14000 }, { "epoch": 1.7546058403308686, "eval_accuracy": 0.9669434435218549, "eval_f1": 0.8423726281189302, "eval_loss": 0.3221518099308014, "eval_optimal_threshold": 0.92950439453125, "eval_runtime": 24.5035, "eval_samples_per_second": 1302.465, "eval_steps_per_second": 40.729, "step": 14000 }, { "epoch": 1.8172703346283996, "grad_norm": 0.4160967171192169, "learning_rate": 8.76943786844915e-06, "loss": 0.185, "step": 14500 }, { "epoch": 1.8799348289259306, "grad_norm": 0.013835388235747814, "learning_rate": 8.305249965185907e-06, "loss": 0.1556, "step": 15000 }, { "epoch": 1.8799348289259306, "eval_accuracy": 0.9700454331818894, "eval_f1": 0.8500627352572145, "eval_loss": 0.3804091215133667, "eval_optimal_threshold": 0.7121821045875549, "eval_runtime": 24.4818, "eval_samples_per_second": 1303.622, "eval_steps_per_second": 40.765, "step": 15000 } ], "logging_steps": 500, "max_steps": 23937, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 1000, "total_flos": 0.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }