{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 1875, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.008, "grad_norm": 5.211891174316406, "learning_rate": 4.999943853127351e-05, "loss": 4.482, "num_input_tokens_seen": 6000, "step": 5 }, { "epoch": 0.016, "grad_norm": 2.5028183460235596, "learning_rate": 4.999715760779541e-05, "loss": 3.7966, "num_input_tokens_seen": 12912, "step": 10 }, { "epoch": 0.024, "grad_norm": 2.7427284717559814, "learning_rate": 4.999312229773022e-05, "loss": 3.4993, "num_input_tokens_seen": 18512, "step": 15 }, { "epoch": 0.032, "grad_norm": 2.573559522628784, "learning_rate": 4.998733288428987e-05, "loss": 3.1988, "num_input_tokens_seen": 25584, "step": 20 }, { "epoch": 0.04, "grad_norm": 2.6185526847839355, "learning_rate": 4.997978977379536e-05, "loss": 2.8839, "num_input_tokens_seen": 32128, "step": 25 }, { "epoch": 0.048, "grad_norm": 2.775859832763672, "learning_rate": 4.997049349564814e-05, "loss": 2.7057, "num_input_tokens_seen": 37984, "step": 30 }, { "epoch": 0.056, "grad_norm": 3.018771171569824, "learning_rate": 4.995944470229302e-05, "loss": 2.6265, "num_input_tokens_seen": 44320, "step": 35 }, { "epoch": 0.064, "grad_norm": 2.792170763015747, "learning_rate": 4.9946644169172355e-05, "loss": 2.5242, "num_input_tokens_seen": 51136, "step": 40 }, { "epoch": 0.072, "grad_norm": 2.7025442123413086, "learning_rate": 4.993209279467164e-05, "loss": 2.4338, "num_input_tokens_seen": 57552, "step": 45 }, { "epoch": 0.08, "grad_norm": 2.5979084968566895, "learning_rate": 4.991579160005644e-05, "loss": 2.2604, "num_input_tokens_seen": 64112, "step": 50 }, { "epoch": 0.088, "grad_norm": 3.2108237743377686, "learning_rate": 4.9897741729400705e-05, "loss": 2.2676, "num_input_tokens_seen": 70704, "step": 55 }, { "epoch": 0.096, "grad_norm": 3.074040651321411, "learning_rate": 4.987794444950651e-05, "loss": 2.2402, "num_input_tokens_seen": 77600, "step": 60 }, { "epoch": 0.104, "grad_norm": 2.9350333213806152, "learning_rate": 4.9856401149815126e-05, "loss": 2.0383, "num_input_tokens_seen": 84512, "step": 65 }, { "epoch": 0.112, "grad_norm": 3.459714412689209, "learning_rate": 4.98331133423095e-05, "loss": 1.9534, "num_input_tokens_seen": 91328, "step": 70 }, { "epoch": 0.12, "grad_norm": 4.01439905166626, "learning_rate": 4.980808266140813e-05, "loss": 1.9574, "num_input_tokens_seen": 97616, "step": 75 }, { "epoch": 0.128, "grad_norm": 3.519948720932007, "learning_rate": 4.9781310863850405e-05, "loss": 2.0109, "num_input_tokens_seen": 103696, "step": 80 }, { "epoch": 0.136, "grad_norm": 3.308018684387207, "learning_rate": 4.975279982857324e-05, "loss": 1.8779, "num_input_tokens_seen": 110512, "step": 85 }, { "epoch": 0.144, "grad_norm": 3.8108999729156494, "learning_rate": 4.972255155657925e-05, "loss": 1.8983, "num_input_tokens_seen": 116464, "step": 90 }, { "epoch": 0.152, "grad_norm": 3.3505210876464844, "learning_rate": 4.969056817079633e-05, "loss": 1.6856, "num_input_tokens_seen": 123968, "step": 95 }, { "epoch": 0.16, "grad_norm": 3.2357165813446045, "learning_rate": 4.965685191592859e-05, "loss": 1.7751, "num_input_tokens_seen": 130608, "step": 100 }, { "epoch": 0.168, "grad_norm": 3.8320517539978027, "learning_rate": 4.96214051582989e-05, "loss": 1.6848, "num_input_tokens_seen": 136512, "step": 105 }, { "epoch": 0.176, "grad_norm": 4.119499206542969, "learning_rate": 4.958423038568274e-05, "loss": 1.7686, "num_input_tokens_seen": 142688, "step": 110 }, { "epoch": 0.184, "grad_norm": 3.845122814178467, "learning_rate": 4.9545330207133664e-05, "loss": 1.5997, "num_input_tokens_seen": 149456, "step": 115 }, { "epoch": 0.192, "grad_norm": 4.3131537437438965, "learning_rate": 4.9504707352800125e-05, "loss": 1.6921, "num_input_tokens_seen": 156560, "step": 120 }, { "epoch": 0.2, "grad_norm": 4.0912089347839355, "learning_rate": 4.946236467373392e-05, "loss": 1.6171, "num_input_tokens_seen": 162960, "step": 125 }, { "epoch": 0.208, "grad_norm": 3.5116782188415527, "learning_rate": 4.941830514169004e-05, "loss": 1.6444, "num_input_tokens_seen": 169856, "step": 130 }, { "epoch": 0.216, "grad_norm": 4.033109664916992, "learning_rate": 4.9372531848918145e-05, "loss": 1.6453, "num_input_tokens_seen": 176816, "step": 135 }, { "epoch": 0.224, "grad_norm": 3.906648874282837, "learning_rate": 4.9325048007945526e-05, "loss": 1.6189, "num_input_tokens_seen": 183024, "step": 140 }, { "epoch": 0.232, "grad_norm": 4.060617923736572, "learning_rate": 4.927585695135162e-05, "loss": 1.5828, "num_input_tokens_seen": 190176, "step": 145 }, { "epoch": 0.24, "grad_norm": 3.4880213737487793, "learning_rate": 4.922496213153416e-05, "loss": 1.549, "num_input_tokens_seen": 197616, "step": 150 }, { "epoch": 0.248, "grad_norm": 4.554350852966309, "learning_rate": 4.917236712046682e-05, "loss": 1.6037, "num_input_tokens_seen": 204080, "step": 155 }, { "epoch": 0.256, "grad_norm": 3.911822557449341, "learning_rate": 4.911807560944858e-05, "loss": 1.5218, "num_input_tokens_seen": 210656, "step": 160 }, { "epoch": 0.264, "grad_norm": 4.279529094696045, "learning_rate": 4.906209140884459e-05, "loss": 1.455, "num_input_tokens_seen": 217376, "step": 165 }, { "epoch": 0.272, "grad_norm": 5.295681953430176, "learning_rate": 4.9004418447818815e-05, "loss": 1.4421, "num_input_tokens_seen": 223968, "step": 170 }, { "epoch": 0.28, "grad_norm": 5.107441425323486, "learning_rate": 4.894506077405824e-05, "loss": 1.5054, "num_input_tokens_seen": 230240, "step": 175 }, { "epoch": 0.288, "grad_norm": 4.014343738555908, "learning_rate": 4.888402255348876e-05, "loss": 1.4786, "num_input_tokens_seen": 236912, "step": 180 }, { "epoch": 0.296, "grad_norm": 4.109804153442383, "learning_rate": 4.8821308069982867e-05, "loss": 1.5626, "num_input_tokens_seen": 243040, "step": 185 }, { "epoch": 0.304, "grad_norm": 4.771740913391113, "learning_rate": 4.8756921725058934e-05, "loss": 1.4438, "num_input_tokens_seen": 250000, "step": 190 }, { "epoch": 0.312, "grad_norm": 5.005781650543213, "learning_rate": 4.8690868037572346e-05, "loss": 1.3603, "num_input_tokens_seen": 256128, "step": 195 }, { "epoch": 0.32, "grad_norm": 5.3310136795043945, "learning_rate": 4.862315164339829e-05, "loss": 1.4616, "num_input_tokens_seen": 263088, "step": 200 }, { "epoch": 0.328, "grad_norm": 4.358487129211426, "learning_rate": 4.855377729510648e-05, "loss": 1.3917, "num_input_tokens_seen": 270096, "step": 205 }, { "epoch": 0.336, "grad_norm": 4.911283016204834, "learning_rate": 4.848274986162754e-05, "loss": 1.3146, "num_input_tokens_seen": 277040, "step": 210 }, { "epoch": 0.344, "grad_norm": 4.217891216278076, "learning_rate": 4.841007432791129e-05, "loss": 1.4117, "num_input_tokens_seen": 283776, "step": 215 }, { "epoch": 0.352, "grad_norm": 4.528128623962402, "learning_rate": 4.833575579457691e-05, "loss": 1.4422, "num_input_tokens_seen": 290752, "step": 220 }, { "epoch": 0.36, "grad_norm": 4.210456848144531, "learning_rate": 4.8259799477554965e-05, "loss": 1.4179, "num_input_tokens_seen": 297792, "step": 225 }, { "epoch": 0.368, "grad_norm": 4.201178550720215, "learning_rate": 4.8182210707721284e-05, "loss": 1.3685, "num_input_tokens_seen": 304464, "step": 230 }, { "epoch": 0.376, "grad_norm": 4.0117268562316895, "learning_rate": 4.810299493052289e-05, "loss": 1.3603, "num_input_tokens_seen": 310816, "step": 235 }, { "epoch": 0.384, "grad_norm": 4.414295196533203, "learning_rate": 4.802215770559577e-05, "loss": 1.3605, "num_input_tokens_seen": 317632, "step": 240 }, { "epoch": 0.392, "grad_norm": 5.311755657196045, "learning_rate": 4.793970470637469e-05, "loss": 1.3752, "num_input_tokens_seen": 324400, "step": 245 }, { "epoch": 0.4, "grad_norm": 5.168431758880615, "learning_rate": 4.7855641719695023e-05, "loss": 1.1998, "num_input_tokens_seen": 331232, "step": 250 }, { "epoch": 0.408, "grad_norm": 2.856295585632324, "learning_rate": 4.776997464538662e-05, "loss": 1.2035, "num_input_tokens_seen": 338624, "step": 255 }, { "epoch": 0.416, "grad_norm": 5.690861225128174, "learning_rate": 4.768270949585968e-05, "loss": 1.3473, "num_input_tokens_seen": 344752, "step": 260 }, { "epoch": 0.424, "grad_norm": 4.342827320098877, "learning_rate": 4.759385239568289e-05, "loss": 1.4272, "num_input_tokens_seen": 350608, "step": 265 }, { "epoch": 0.432, "grad_norm": 4.6672468185424805, "learning_rate": 4.750340958115346e-05, "loss": 1.3359, "num_input_tokens_seen": 356848, "step": 270 }, { "epoch": 0.44, "grad_norm": 5.1840081214904785, "learning_rate": 4.741138739985951e-05, "loss": 1.2609, "num_input_tokens_seen": 363312, "step": 275 }, { "epoch": 0.448, "grad_norm": 4.333302974700928, "learning_rate": 4.731779231023456e-05, "loss": 1.2936, "num_input_tokens_seen": 370512, "step": 280 }, { "epoch": 0.456, "grad_norm": 4.599977493286133, "learning_rate": 4.722263088110426e-05, "loss": 1.171, "num_input_tokens_seen": 377456, "step": 285 }, { "epoch": 0.464, "grad_norm": 5.032026767730713, "learning_rate": 4.712590979122534e-05, "loss": 1.3206, "num_input_tokens_seen": 383584, "step": 290 }, { "epoch": 0.472, "grad_norm": 4.346674919128418, "learning_rate": 4.702763582881692e-05, "loss": 1.2582, "num_input_tokens_seen": 391120, "step": 295 }, { "epoch": 0.48, "grad_norm": 4.144872665405273, "learning_rate": 4.692781589108402e-05, "loss": 1.2324, "num_input_tokens_seen": 397648, "step": 300 }, { "epoch": 0.488, "grad_norm": 5.145121097564697, "learning_rate": 4.682645698373357e-05, "loss": 1.2978, "num_input_tokens_seen": 403872, "step": 305 }, { "epoch": 0.496, "grad_norm": 5.409262180328369, "learning_rate": 4.6723566220482664e-05, "loss": 1.2644, "num_input_tokens_seen": 410192, "step": 310 }, { "epoch": 0.504, "grad_norm": 4.336021900177002, "learning_rate": 4.661915082255932e-05, "loss": 1.1224, "num_input_tokens_seen": 417472, "step": 315 }, { "epoch": 0.512, "grad_norm": 4.864579677581787, "learning_rate": 4.651321811819568e-05, "loss": 1.1621, "num_input_tokens_seen": 424880, "step": 320 }, { "epoch": 0.52, "grad_norm": 4.952954292297363, "learning_rate": 4.640577554211366e-05, "loss": 1.2365, "num_input_tokens_seen": 431488, "step": 325 }, { "epoch": 0.528, "grad_norm": 5.332362174987793, "learning_rate": 4.629683063500319e-05, "loss": 1.2764, "num_input_tokens_seen": 438064, "step": 330 }, { "epoch": 0.536, "grad_norm": 5.671170234680176, "learning_rate": 4.618639104299294e-05, "loss": 1.2609, "num_input_tokens_seen": 444096, "step": 335 }, { "epoch": 0.544, "grad_norm": 5.552740097045898, "learning_rate": 4.607446451711372e-05, "loss": 1.1504, "num_input_tokens_seen": 450368, "step": 340 }, { "epoch": 0.552, "grad_norm": 5.54111385345459, "learning_rate": 4.596105891275449e-05, "loss": 1.1347, "num_input_tokens_seen": 456496, "step": 345 }, { "epoch": 0.56, "grad_norm": 4.788923263549805, "learning_rate": 4.5846182189111035e-05, "loss": 1.183, "num_input_tokens_seen": 463408, "step": 350 }, { "epoch": 0.568, "grad_norm": 4.818716049194336, "learning_rate": 4.5729842408627334e-05, "loss": 1.1623, "num_input_tokens_seen": 470096, "step": 355 }, { "epoch": 0.576, "grad_norm": 4.24908971786499, "learning_rate": 4.561204773642974e-05, "loss": 1.1498, "num_input_tokens_seen": 476096, "step": 360 }, { "epoch": 0.584, "grad_norm": 5.277526378631592, "learning_rate": 4.5492806439753935e-05, "loss": 1.1961, "num_input_tokens_seen": 482832, "step": 365 }, { "epoch": 0.592, "grad_norm": 5.597021579742432, "learning_rate": 4.5372126887364655e-05, "loss": 1.1888, "num_input_tokens_seen": 489504, "step": 370 }, { "epoch": 0.6, "grad_norm": 4.754395008087158, "learning_rate": 4.5250017548968404e-05, "loss": 1.2106, "num_input_tokens_seen": 495456, "step": 375 }, { "epoch": 0.608, "grad_norm": 5.067101001739502, "learning_rate": 4.512648699461897e-05, "loss": 1.1692, "num_input_tokens_seen": 501472, "step": 380 }, { "epoch": 0.616, "grad_norm": 4.505124568939209, "learning_rate": 4.5001543894115975e-05, "loss": 1.1807, "num_input_tokens_seen": 507920, "step": 385 }, { "epoch": 0.624, "grad_norm": 4.827609062194824, "learning_rate": 4.487519701639641e-05, "loss": 1.2016, "num_input_tokens_seen": 514016, "step": 390 }, { "epoch": 0.632, "grad_norm": 5.530371189117432, "learning_rate": 4.4747455228919146e-05, "loss": 1.1268, "num_input_tokens_seen": 520672, "step": 395 }, { "epoch": 0.64, "grad_norm": 5.6696038246154785, "learning_rate": 4.461832749704268e-05, "loss": 1.1203, "num_input_tokens_seen": 527248, "step": 400 }, { "epoch": 0.648, "grad_norm": 4.725157737731934, "learning_rate": 4.4487822883395805e-05, "loss": 1.1945, "num_input_tokens_seen": 533696, "step": 405 }, { "epoch": 0.656, "grad_norm": 6.170118808746338, "learning_rate": 4.4355950547241645e-05, "loss": 1.1527, "num_input_tokens_seen": 539968, "step": 410 }, { "epoch": 0.664, "grad_norm": 5.390254020690918, "learning_rate": 4.422271974383479e-05, "loss": 1.0895, "num_input_tokens_seen": 546112, "step": 415 }, { "epoch": 0.672, "grad_norm": 5.188884735107422, "learning_rate": 4.4088139823771744e-05, "loss": 1.202, "num_input_tokens_seen": 552112, "step": 420 }, { "epoch": 0.68, "grad_norm": 4.36733341217041, "learning_rate": 4.395222023233466e-05, "loss": 1.104, "num_input_tokens_seen": 559008, "step": 425 }, { "epoch": 0.688, "grad_norm": 5.411820888519287, "learning_rate": 4.381497050882845e-05, "loss": 1.0959, "num_input_tokens_seen": 564784, "step": 430 }, { "epoch": 0.696, "grad_norm": 5.965424537658691, "learning_rate": 4.3676400285911256e-05, "loss": 1.158, "num_input_tokens_seen": 570736, "step": 435 }, { "epoch": 0.704, "grad_norm": 5.538514614105225, "learning_rate": 4.353651928891842e-05, "loss": 1.1841, "num_input_tokens_seen": 576992, "step": 440 }, { "epoch": 0.712, "grad_norm": 3.329176664352417, "learning_rate": 4.3395337335179945e-05, "loss": 1.0173, "num_input_tokens_seen": 583888, "step": 445 }, { "epoch": 0.72, "grad_norm": 5.082017421722412, "learning_rate": 4.325286433333142e-05, "loss": 1.1729, "num_input_tokens_seen": 589856, "step": 450 }, { "epoch": 0.728, "grad_norm": 4.892393112182617, "learning_rate": 4.310911028261867e-05, "loss": 1.105, "num_input_tokens_seen": 596624, "step": 455 }, { "epoch": 0.736, "grad_norm": 4.692873001098633, "learning_rate": 4.296408527219592e-05, "loss": 1.1137, "num_input_tokens_seen": 603184, "step": 460 }, { "epoch": 0.744, "grad_norm": 4.720251560211182, "learning_rate": 4.281779948041772e-05, "loss": 0.9949, "num_input_tokens_seen": 609280, "step": 465 }, { "epoch": 0.752, "grad_norm": 5.242442607879639, "learning_rate": 4.267026317412461e-05, "loss": 1.0397, "num_input_tokens_seen": 616160, "step": 470 }, { "epoch": 0.76, "grad_norm": 5.894191265106201, "learning_rate": 4.252148670792254e-05, "loss": 1.1702, "num_input_tokens_seen": 622464, "step": 475 }, { "epoch": 0.768, "grad_norm": 4.998919486999512, "learning_rate": 4.237148052345616e-05, "loss": 1.0943, "num_input_tokens_seen": 628832, "step": 480 }, { "epoch": 0.776, "grad_norm": 5.455171585083008, "learning_rate": 4.2220255148675956e-05, "loss": 1.0487, "num_input_tokens_seen": 634464, "step": 485 }, { "epoch": 0.784, "grad_norm": 5.683940410614014, "learning_rate": 4.206782119709942e-05, "loss": 1.1097, "num_input_tokens_seen": 641504, "step": 490 }, { "epoch": 0.792, "grad_norm": 5.903459548950195, "learning_rate": 4.1914189367066094e-05, "loss": 1.047, "num_input_tokens_seen": 647760, "step": 495 }, { "epoch": 0.8, "grad_norm": 5.085323333740234, "learning_rate": 4.1759370440986775e-05, "loss": 1.1237, "num_input_tokens_seen": 654592, "step": 500 }, { "epoch": 0.808, "grad_norm": 5.392106533050537, "learning_rate": 4.160337528458676e-05, "loss": 1.1501, "num_input_tokens_seen": 661360, "step": 505 }, { "epoch": 0.816, "grad_norm": 5.11650276184082, "learning_rate": 4.144621484614319e-05, "loss": 1.1284, "num_input_tokens_seen": 668080, "step": 510 }, { "epoch": 0.824, "grad_norm": 5.24700927734375, "learning_rate": 4.1287900155716784e-05, "loss": 1.0633, "num_input_tokens_seen": 673472, "step": 515 }, { "epoch": 0.832, "grad_norm": 6.16030740737915, "learning_rate": 4.112844232437757e-05, "loss": 1.0798, "num_input_tokens_seen": 680128, "step": 520 }, { "epoch": 0.84, "grad_norm": 4.552190780639648, "learning_rate": 4.0967852543425175e-05, "loss": 0.7796, "num_input_tokens_seen": 688768, "step": 525 }, { "epoch": 0.848, "grad_norm": 3.760404109954834, "learning_rate": 4.080614208360336e-05, "loss": 1.051, "num_input_tokens_seen": 696416, "step": 530 }, { "epoch": 0.856, "grad_norm": 6.2114386558532715, "learning_rate": 4.064332229430895e-05, "loss": 1.0647, "num_input_tokens_seen": 702592, "step": 535 }, { "epoch": 0.864, "grad_norm": 5.2313032150268555, "learning_rate": 4.047940460279537e-05, "loss": 1.0644, "num_input_tokens_seen": 709136, "step": 540 }, { "epoch": 0.872, "grad_norm": 5.142989158630371, "learning_rate": 4.031440051337056e-05, "loss": 1.0907, "num_input_tokens_seen": 715216, "step": 545 }, { "epoch": 0.88, "grad_norm": 4.840134620666504, "learning_rate": 4.0148321606589656e-05, "loss": 1.009, "num_input_tokens_seen": 721712, "step": 550 }, { "epoch": 0.888, "grad_norm": 5.025780200958252, "learning_rate": 3.9981179538442146e-05, "loss": 0.9835, "num_input_tokens_seen": 728112, "step": 555 }, { "epoch": 0.896, "grad_norm": 7.77101993560791, "learning_rate": 3.981298603953385e-05, "loss": 0.9688, "num_input_tokens_seen": 734608, "step": 560 }, { "epoch": 0.904, "grad_norm": 5.2934770584106445, "learning_rate": 3.964375291426361e-05, "loss": 0.9882, "num_input_tokens_seen": 740864, "step": 565 }, { "epoch": 0.912, "grad_norm": 5.84243106842041, "learning_rate": 3.947349203999484e-05, "loss": 0.9927, "num_input_tokens_seen": 746512, "step": 570 }, { "epoch": 0.92, "grad_norm": 4.940598964691162, "learning_rate": 3.930221536622191e-05, "loss": 1.0481, "num_input_tokens_seen": 753280, "step": 575 }, { "epoch": 0.928, "grad_norm": 4.853553295135498, "learning_rate": 3.91299349137315e-05, "loss": 0.9097, "num_input_tokens_seen": 759872, "step": 580 }, { "epoch": 0.936, "grad_norm": 4.950205326080322, "learning_rate": 3.895666277375892e-05, "loss": 0.9216, "num_input_tokens_seen": 766144, "step": 585 }, { "epoch": 0.944, "grad_norm": 5.953805446624756, "learning_rate": 3.8782411107139564e-05, "loss": 1.0334, "num_input_tokens_seen": 772448, "step": 590 }, { "epoch": 0.952, "grad_norm": 5.650152206420898, "learning_rate": 3.8607192143455326e-05, "loss": 0.9875, "num_input_tokens_seen": 779136, "step": 595 }, { "epoch": 0.96, "grad_norm": 4.282099723815918, "learning_rate": 3.843101818017637e-05, "loss": 1.0499, "num_input_tokens_seen": 786320, "step": 600 }, { "epoch": 0.968, "grad_norm": 5.714658260345459, "learning_rate": 3.8253901581798016e-05, "loss": 1.0884, "num_input_tokens_seen": 793136, "step": 605 }, { "epoch": 0.976, "grad_norm": 4.641557693481445, "learning_rate": 3.8075854778972955e-05, "loss": 1.0082, "num_input_tokens_seen": 799792, "step": 610 }, { "epoch": 0.984, "grad_norm": 5.510296821594238, "learning_rate": 3.789689026763883e-05, "loss": 0.9715, "num_input_tokens_seen": 806208, "step": 615 }, { "epoch": 0.992, "grad_norm": 5.0314106941223145, "learning_rate": 3.771702060814123e-05, "loss": 0.9564, "num_input_tokens_seen": 812480, "step": 620 }, { "epoch": 1.0, "grad_norm": 5.7377028465271, "learning_rate": 3.753625842435216e-05, "loss": 1.0693, "num_input_tokens_seen": 818608, "step": 625 }, { "epoch": 1.008, "grad_norm": 4.714173316955566, "learning_rate": 3.7354616402784035e-05, "loss": 0.9512, "num_input_tokens_seen": 825824, "step": 630 }, { "epoch": 1.016, "grad_norm": 5.2931036949157715, "learning_rate": 3.717210729169935e-05, "loss": 0.8803, "num_input_tokens_seen": 832832, "step": 635 }, { "epoch": 1.024, "grad_norm": 5.152520179748535, "learning_rate": 3.6988743900215894e-05, "loss": 0.9242, "num_input_tokens_seen": 838464, "step": 640 }, { "epoch": 1.032, "grad_norm": 4.291209697723389, "learning_rate": 3.680453909740782e-05, "loss": 0.9662, "num_input_tokens_seen": 845296, "step": 645 }, { "epoch": 1.04, "grad_norm": 4.950625896453857, "learning_rate": 3.661950581140239e-05, "loss": 0.8432, "num_input_tokens_seen": 851904, "step": 650 }, { "epoch": 1.048, "grad_norm": 5.483580589294434, "learning_rate": 3.643365702847272e-05, "loss": 0.8771, "num_input_tokens_seen": 859632, "step": 655 }, { "epoch": 1.056, "grad_norm": 4.987343788146973, "learning_rate": 3.624700579212626e-05, "loss": 0.8642, "num_input_tokens_seen": 865776, "step": 660 }, { "epoch": 1.064, "grad_norm": 5.25522518157959, "learning_rate": 3.6059565202189435e-05, "loss": 0.8519, "num_input_tokens_seen": 872336, "step": 665 }, { "epoch": 1.072, "grad_norm": 5.969356536865234, "learning_rate": 3.5871348413888204e-05, "loss": 1.0019, "num_input_tokens_seen": 878272, "step": 670 }, { "epoch": 1.08, "grad_norm": 4.862826824188232, "learning_rate": 3.568236863692482e-05, "loss": 0.9431, "num_input_tokens_seen": 885280, "step": 675 }, { "epoch": 1.088, "grad_norm": 6.21727991104126, "learning_rate": 3.5492639134550695e-05, "loss": 0.8563, "num_input_tokens_seen": 891392, "step": 680 }, { "epoch": 1.096, "grad_norm": 4.942775726318359, "learning_rate": 3.5302173222635524e-05, "loss": 0.908, "num_input_tokens_seen": 897456, "step": 685 }, { "epoch": 1.104, "grad_norm": 5.569796562194824, "learning_rate": 3.511098426873283e-05, "loss": 0.905, "num_input_tokens_seen": 904016, "step": 690 }, { "epoch": 1.112, "grad_norm": 5.717967987060547, "learning_rate": 3.491908569114164e-05, "loss": 0.8745, "num_input_tokens_seen": 910496, "step": 695 }, { "epoch": 1.12, "grad_norm": 5.90877628326416, "learning_rate": 3.4726490957964834e-05, "loss": 0.8864, "num_input_tokens_seen": 916640, "step": 700 }, { "epoch": 1.1280000000000001, "grad_norm": 5.11007833480835, "learning_rate": 3.453321358616393e-05, "loss": 0.8327, "num_input_tokens_seen": 922800, "step": 705 }, { "epoch": 1.1360000000000001, "grad_norm": 5.624155044555664, "learning_rate": 3.433926714061032e-05, "loss": 0.9515, "num_input_tokens_seen": 928896, "step": 710 }, { "epoch": 1.144, "grad_norm": 5.189602851867676, "learning_rate": 3.414466523313332e-05, "loss": 0.9265, "num_input_tokens_seen": 936064, "step": 715 }, { "epoch": 1.152, "grad_norm": 5.5833587646484375, "learning_rate": 3.394942152156482e-05, "loss": 0.9191, "num_input_tokens_seen": 942720, "step": 720 }, { "epoch": 1.16, "grad_norm": 5.759437561035156, "learning_rate": 3.375354970878073e-05, "loss": 0.9103, "num_input_tokens_seen": 949120, "step": 725 }, { "epoch": 1.168, "grad_norm": 5.949998378753662, "learning_rate": 3.355706354173928e-05, "loss": 0.8963, "num_input_tokens_seen": 955424, "step": 730 }, { "epoch": 1.176, "grad_norm": 5.6423420906066895, "learning_rate": 3.3359976810516164e-05, "loss": 0.9571, "num_input_tokens_seen": 961680, "step": 735 }, { "epoch": 1.184, "grad_norm": 4.929549217224121, "learning_rate": 3.3162303347336764e-05, "loss": 0.8842, "num_input_tokens_seen": 968832, "step": 740 }, { "epoch": 1.192, "grad_norm": 4.750211238861084, "learning_rate": 3.296405702560532e-05, "loss": 0.9295, "num_input_tokens_seen": 975232, "step": 745 }, { "epoch": 1.2, "grad_norm": 5.610837459564209, "learning_rate": 3.276525175893126e-05, "loss": 0.9305, "num_input_tokens_seen": 981552, "step": 750 }, { "epoch": 1.208, "grad_norm": 6.68215799331665, "learning_rate": 3.25659015001527e-05, "loss": 0.8855, "num_input_tokens_seen": 987936, "step": 755 }, { "epoch": 1.216, "grad_norm": 5.899706840515137, "learning_rate": 3.236602024035716e-05, "loss": 0.8349, "num_input_tokens_seen": 994480, "step": 760 }, { "epoch": 1.224, "grad_norm": 5.103348731994629, "learning_rate": 3.2165622007899676e-05, "loss": 0.888, "num_input_tokens_seen": 1001488, "step": 765 }, { "epoch": 1.232, "grad_norm": 5.507425308227539, "learning_rate": 3.196472086741815e-05, "loss": 0.884, "num_input_tokens_seen": 1007200, "step": 770 }, { "epoch": 1.24, "grad_norm": 5.364018440246582, "learning_rate": 3.176333091884635e-05, "loss": 0.8897, "num_input_tokens_seen": 1013744, "step": 775 }, { "epoch": 1.248, "grad_norm": 6.075136661529541, "learning_rate": 3.156146629642425e-05, "loss": 0.8845, "num_input_tokens_seen": 1021072, "step": 780 }, { "epoch": 1.256, "grad_norm": 5.49012565612793, "learning_rate": 3.135914116770609e-05, "loss": 0.9178, "num_input_tokens_seen": 1028064, "step": 785 }, { "epoch": 1.264, "grad_norm": 4.626290798187256, "learning_rate": 3.1156369732566006e-05, "loss": 0.9141, "num_input_tokens_seen": 1035184, "step": 790 }, { "epoch": 1.272, "grad_norm": 6.4841437339782715, "learning_rate": 3.0953166222201476e-05, "loss": 0.8258, "num_input_tokens_seen": 1041280, "step": 795 }, { "epoch": 1.28, "grad_norm": 6.494681358337402, "learning_rate": 3.074954489813449e-05, "loss": 0.8271, "num_input_tokens_seen": 1047520, "step": 800 }, { "epoch": 1.288, "grad_norm": 5.340859889984131, "learning_rate": 3.054552005121064e-05, "loss": 0.8407, "num_input_tokens_seen": 1053920, "step": 805 }, { "epoch": 1.296, "grad_norm": 5.7333879470825195, "learning_rate": 3.034110600059616e-05, "loss": 0.9351, "num_input_tokens_seen": 1060480, "step": 810 }, { "epoch": 1.304, "grad_norm": 5.079939365386963, "learning_rate": 3.013631709277292e-05, "loss": 0.8622, "num_input_tokens_seen": 1067312, "step": 815 }, { "epoch": 1.312, "grad_norm": 5.47499418258667, "learning_rate": 2.9931167700531578e-05, "loss": 0.7646, "num_input_tokens_seen": 1073856, "step": 820 }, { "epoch": 1.32, "grad_norm": 5.8759379386901855, "learning_rate": 2.97256722219628e-05, "loss": 0.8869, "num_input_tokens_seen": 1080144, "step": 825 }, { "epoch": 1.328, "grad_norm": 5.712034225463867, "learning_rate": 2.9519845079446823e-05, "loss": 0.8583, "num_input_tokens_seen": 1086800, "step": 830 }, { "epoch": 1.336, "grad_norm": 5.631429672241211, "learning_rate": 2.9313700718641167e-05, "loss": 0.9651, "num_input_tokens_seen": 1094192, "step": 835 }, { "epoch": 1.3439999999999999, "grad_norm": 5.5782694816589355, "learning_rate": 2.9107253607466832e-05, "loss": 0.9531, "num_input_tokens_seen": 1101520, "step": 840 }, { "epoch": 1.3519999999999999, "grad_norm": 5.170969009399414, "learning_rate": 2.8900518235092905e-05, "loss": 0.8686, "num_input_tokens_seen": 1108352, "step": 845 }, { "epoch": 1.3599999999999999, "grad_norm": 6.310078144073486, "learning_rate": 2.8693509110919598e-05, "loss": 0.8434, "num_input_tokens_seen": 1114512, "step": 850 }, { "epoch": 1.3679999999999999, "grad_norm": 6.386317253112793, "learning_rate": 2.8486240763559986e-05, "loss": 0.8637, "num_input_tokens_seen": 1120912, "step": 855 }, { "epoch": 1.376, "grad_norm": 5.666493892669678, "learning_rate": 2.8278727739820333e-05, "loss": 0.9294, "num_input_tokens_seen": 1127360, "step": 860 }, { "epoch": 1.384, "grad_norm": 5.921559810638428, "learning_rate": 2.8070984603679107e-05, "loss": 0.8557, "num_input_tokens_seen": 1134112, "step": 865 }, { "epoch": 1.392, "grad_norm": 6.2435383796691895, "learning_rate": 2.7863025935264875e-05, "loss": 0.9056, "num_input_tokens_seen": 1140592, "step": 870 }, { "epoch": 1.4, "grad_norm": 5.0157246589660645, "learning_rate": 2.7654866329833002e-05, "loss": 0.8511, "num_input_tokens_seen": 1147568, "step": 875 }, { "epoch": 1.408, "grad_norm": 5.033071994781494, "learning_rate": 2.744652039674129e-05, "loss": 0.884, "num_input_tokens_seen": 1154256, "step": 880 }, { "epoch": 1.416, "grad_norm": 5.921014308929443, "learning_rate": 2.723800275842468e-05, "loss": 0.9172, "num_input_tokens_seen": 1160864, "step": 885 }, { "epoch": 1.424, "grad_norm": 5.19156551361084, "learning_rate": 2.702932804936894e-05, "loss": 0.8077, "num_input_tokens_seen": 1168096, "step": 890 }, { "epoch": 1.432, "grad_norm": 5.669256210327148, "learning_rate": 2.6820510915083648e-05, "loss": 0.8873, "num_input_tokens_seen": 1174224, "step": 895 }, { "epoch": 1.44, "grad_norm": 7.450194358825684, "learning_rate": 2.661156601107424e-05, "loss": 0.9441, "num_input_tokens_seen": 1180240, "step": 900 }, { "epoch": 1.448, "grad_norm": 6.64365291595459, "learning_rate": 2.6402508001813496e-05, "loss": 0.9357, "num_input_tokens_seen": 1186800, "step": 905 }, { "epoch": 1.456, "grad_norm": 6.2755126953125, "learning_rate": 2.6193351559712292e-05, "loss": 0.8376, "num_input_tokens_seen": 1193184, "step": 910 }, { "epoch": 1.464, "grad_norm": 5.1714324951171875, "learning_rate": 2.5984111364089876e-05, "loss": 0.8699, "num_input_tokens_seen": 1199120, "step": 915 }, { "epoch": 1.472, "grad_norm": 5.131344318389893, "learning_rate": 2.5774802100143592e-05, "loss": 0.7691, "num_input_tokens_seen": 1205472, "step": 920 }, { "epoch": 1.48, "grad_norm": 5.99024772644043, "learning_rate": 2.5565438457918244e-05, "loss": 0.825, "num_input_tokens_seen": 1212144, "step": 925 }, { "epoch": 1.488, "grad_norm": 6.630756378173828, "learning_rate": 2.5356035131275096e-05, "loss": 0.8829, "num_input_tokens_seen": 1218272, "step": 930 }, { "epoch": 1.496, "grad_norm": 5.101822376251221, "learning_rate": 2.5146606816860597e-05, "loss": 0.8135, "num_input_tokens_seen": 1224880, "step": 935 }, { "epoch": 1.504, "grad_norm": 5.636932373046875, "learning_rate": 2.4937168213074907e-05, "loss": 0.8377, "num_input_tokens_seen": 1231760, "step": 940 }, { "epoch": 1.512, "grad_norm": 5.158182621002197, "learning_rate": 2.472773401904037e-05, "loss": 0.7784, "num_input_tokens_seen": 1239136, "step": 945 }, { "epoch": 1.52, "grad_norm": 5.6569976806640625, "learning_rate": 2.4518318933569785e-05, "loss": 0.8143, "num_input_tokens_seen": 1246096, "step": 950 }, { "epoch": 1.528, "grad_norm": 4.830045223236084, "learning_rate": 2.4308937654134893e-05, "loss": 0.7414, "num_input_tokens_seen": 1252608, "step": 955 }, { "epoch": 1.536, "grad_norm": 5.795775413513184, "learning_rate": 2.4099604875834795e-05, "loss": 0.7988, "num_input_tokens_seen": 1258688, "step": 960 }, { "epoch": 1.544, "grad_norm": 6.66441011428833, "learning_rate": 2.3890335290364595e-05, "loss": 0.8191, "num_input_tokens_seen": 1264736, "step": 965 }, { "epoch": 1.552, "grad_norm": 5.739951133728027, "learning_rate": 2.368114358498434e-05, "loss": 0.8813, "num_input_tokens_seen": 1271360, "step": 970 }, { "epoch": 1.56, "grad_norm": 5.536952018737793, "learning_rate": 2.3472044441488174e-05, "loss": 0.8435, "num_input_tokens_seen": 1276832, "step": 975 }, { "epoch": 1.568, "grad_norm": 6.003225803375244, "learning_rate": 2.32630525351739e-05, "loss": 0.876, "num_input_tokens_seen": 1283136, "step": 980 }, { "epoch": 1.576, "grad_norm": 6.880493640899658, "learning_rate": 2.3054182533813087e-05, "loss": 0.8883, "num_input_tokens_seen": 1289552, "step": 985 }, { "epoch": 1.584, "grad_norm": 5.1923675537109375, "learning_rate": 2.284544909662158e-05, "loss": 0.8653, "num_input_tokens_seen": 1296512, "step": 990 }, { "epoch": 1.592, "grad_norm": 6.762387275695801, "learning_rate": 2.2636866873230677e-05, "loss": 0.9483, "num_input_tokens_seen": 1302512, "step": 995 }, { "epoch": 1.6, "grad_norm": 4.309864521026611, "learning_rate": 2.2428450502658967e-05, "loss": 0.7619, "num_input_tokens_seen": 1309984, "step": 1000 }, { "epoch": 1.608, "grad_norm": 6.295886039733887, "learning_rate": 2.2220214612284924e-05, "loss": 0.8426, "num_input_tokens_seen": 1315872, "step": 1005 }, { "epoch": 1.616, "grad_norm": 4.982956886291504, "learning_rate": 2.2012173816820297e-05, "loss": 0.8076, "num_input_tokens_seen": 1322672, "step": 1010 }, { "epoch": 1.624, "grad_norm": 6.953153133392334, "learning_rate": 2.1804342717284415e-05, "loss": 0.8432, "num_input_tokens_seen": 1329408, "step": 1015 }, { "epoch": 1.6320000000000001, "grad_norm": 6.00987434387207, "learning_rate": 2.1596735899979396e-05, "loss": 0.8961, "num_input_tokens_seen": 1334880, "step": 1020 }, { "epoch": 1.6400000000000001, "grad_norm": 6.879395484924316, "learning_rate": 2.138936793546649e-05, "loss": 0.9016, "num_input_tokens_seen": 1341584, "step": 1025 }, { "epoch": 1.6480000000000001, "grad_norm": 5.388754844665527, "learning_rate": 2.1182253377543425e-05, "loss": 0.8779, "num_input_tokens_seen": 1348240, "step": 1030 }, { "epoch": 1.6560000000000001, "grad_norm": 5.502389430999756, "learning_rate": 2.0975406762222966e-05, "loss": 0.809, "num_input_tokens_seen": 1354480, "step": 1035 }, { "epoch": 1.6640000000000001, "grad_norm": 3.7813355922698975, "learning_rate": 2.076884260671276e-05, "loss": 0.7541, "num_input_tokens_seen": 1361456, "step": 1040 }, { "epoch": 1.6720000000000002, "grad_norm": 6.419345855712891, "learning_rate": 2.056257540839647e-05, "loss": 0.8278, "num_input_tokens_seen": 1367984, "step": 1045 }, { "epoch": 1.6800000000000002, "grad_norm": 4.702061653137207, "learning_rate": 2.0356619643816234e-05, "loss": 0.8217, "num_input_tokens_seen": 1374480, "step": 1050 }, { "epoch": 1.688, "grad_norm": 6.7628984451293945, "learning_rate": 2.0150989767656728e-05, "loss": 0.7578, "num_input_tokens_seen": 1382160, "step": 1055 }, { "epoch": 1.696, "grad_norm": 5.897040843963623, "learning_rate": 1.994570021173067e-05, "loss": 0.8402, "num_input_tokens_seen": 1389120, "step": 1060 }, { "epoch": 1.704, "grad_norm": 6.665550231933594, "learning_rate": 1.9740765383965893e-05, "loss": 0.8512, "num_input_tokens_seen": 1395712, "step": 1065 }, { "epoch": 1.712, "grad_norm": 5.517580509185791, "learning_rate": 1.9536199667394215e-05, "loss": 0.8197, "num_input_tokens_seen": 1402208, "step": 1070 }, { "epoch": 1.72, "grad_norm": 5.793928146362305, "learning_rate": 1.9332017419141962e-05, "loss": 0.8453, "num_input_tokens_seen": 1408640, "step": 1075 }, { "epoch": 1.728, "grad_norm": 5.839468479156494, "learning_rate": 1.9128232969422315e-05, "loss": 0.816, "num_input_tokens_seen": 1414848, "step": 1080 }, { "epoch": 1.736, "grad_norm": 6.3471479415893555, "learning_rate": 1.8924860620529594e-05, "loss": 0.8817, "num_input_tokens_seen": 1421456, "step": 1085 }, { "epoch": 1.744, "grad_norm": 6.201384544372559, "learning_rate": 1.872191464583547e-05, "loss": 0.7613, "num_input_tokens_seen": 1427872, "step": 1090 }, { "epoch": 1.752, "grad_norm": 6.5023064613342285, "learning_rate": 1.851940928878718e-05, "loss": 0.8203, "num_input_tokens_seen": 1434592, "step": 1095 }, { "epoch": 1.76, "grad_norm": 5.858229160308838, "learning_rate": 1.8317358761907942e-05, "loss": 0.7657, "num_input_tokens_seen": 1440800, "step": 1100 }, { "epoch": 1.768, "grad_norm": 5.838942527770996, "learning_rate": 1.811577724579938e-05, "loss": 0.8285, "num_input_tokens_seen": 1446976, "step": 1105 }, { "epoch": 1.776, "grad_norm": 5.380393981933594, "learning_rate": 1.7914678888146347e-05, "loss": 0.8087, "num_input_tokens_seen": 1453280, "step": 1110 }, { "epoch": 1.784, "grad_norm": 4.861492156982422, "learning_rate": 1.7714077802723994e-05, "loss": 0.8048, "num_input_tokens_seen": 1459600, "step": 1115 }, { "epoch": 1.792, "grad_norm": 6.196881294250488, "learning_rate": 1.7513988068407146e-05, "loss": 0.8194, "num_input_tokens_seen": 1466544, "step": 1120 }, { "epoch": 1.8, "grad_norm": 6.481358051300049, "learning_rate": 1.7314423728182283e-05, "loss": 0.8346, "num_input_tokens_seen": 1473856, "step": 1125 }, { "epoch": 1.808, "grad_norm": 5.957236289978027, "learning_rate": 1.7115398788161925e-05, "loss": 0.8259, "num_input_tokens_seen": 1479712, "step": 1130 }, { "epoch": 1.8159999999999998, "grad_norm": 4.8695573806762695, "learning_rate": 1.6916927216601593e-05, "loss": 0.8222, "num_input_tokens_seen": 1486000, "step": 1135 }, { "epoch": 1.8239999999999998, "grad_norm": 5.079285144805908, "learning_rate": 1.6719022942919527e-05, "loss": 0.8857, "num_input_tokens_seen": 1492720, "step": 1140 }, { "epoch": 1.8319999999999999, "grad_norm": 4.920922756195068, "learning_rate": 1.6521699856719062e-05, "loss": 0.8005, "num_input_tokens_seen": 1499312, "step": 1145 }, { "epoch": 1.8399999999999999, "grad_norm": 6.130289077758789, "learning_rate": 1.6324971806813767e-05, "loss": 0.855, "num_input_tokens_seen": 1505648, "step": 1150 }, { "epoch": 1.8479999999999999, "grad_norm": 7.0988030433654785, "learning_rate": 1.612885260025552e-05, "loss": 0.8266, "num_input_tokens_seen": 1513024, "step": 1155 }, { "epoch": 1.8559999999999999, "grad_norm": 6.3503594398498535, "learning_rate": 1.59333560013655e-05, "loss": 0.8106, "num_input_tokens_seen": 1518960, "step": 1160 }, { "epoch": 1.8639999999999999, "grad_norm": 7.253221035003662, "learning_rate": 1.5738495730768105e-05, "loss": 0.8073, "num_input_tokens_seen": 1525136, "step": 1165 }, { "epoch": 1.8719999999999999, "grad_norm": 6.441041469573975, "learning_rate": 1.5544285464428045e-05, "loss": 0.7954, "num_input_tokens_seen": 1532000, "step": 1170 }, { "epoch": 1.88, "grad_norm": 5.565557956695557, "learning_rate": 1.535073883269048e-05, "loss": 0.8736, "num_input_tokens_seen": 1538416, "step": 1175 }, { "epoch": 1.888, "grad_norm": 4.04221773147583, "learning_rate": 1.515786941932441e-05, "loss": 0.7713, "num_input_tokens_seen": 1544992, "step": 1180 }, { "epoch": 1.896, "grad_norm": 5.468989372253418, "learning_rate": 1.4965690760569346e-05, "loss": 0.7552, "num_input_tokens_seen": 1551360, "step": 1185 }, { "epoch": 1.904, "grad_norm": 7.29986047744751, "learning_rate": 1.4774216344185205e-05, "loss": 0.7731, "num_input_tokens_seen": 1557616, "step": 1190 }, { "epoch": 1.912, "grad_norm": 5.466056823730469, "learning_rate": 1.4583459608505801e-05, "loss": 0.7138, "num_input_tokens_seen": 1565504, "step": 1195 }, { "epoch": 1.92, "grad_norm": 6.537974834442139, "learning_rate": 1.4393433941495637e-05, "loss": 0.8888, "num_input_tokens_seen": 1571808, "step": 1200 }, { "epoch": 1.928, "grad_norm": 5.771127223968506, "learning_rate": 1.4204152679810258e-05, "loss": 0.7852, "num_input_tokens_seen": 1578320, "step": 1205 }, { "epoch": 1.936, "grad_norm": 5.833364963531494, "learning_rate": 1.401562910786034e-05, "loss": 0.8193, "num_input_tokens_seen": 1585888, "step": 1210 }, { "epoch": 1.944, "grad_norm": 6.242034435272217, "learning_rate": 1.3827876456879246e-05, "loss": 0.7761, "num_input_tokens_seen": 1591712, "step": 1215 }, { "epoch": 1.952, "grad_norm": 6.540128707885742, "learning_rate": 1.3640907903994454e-05, "loss": 0.8357, "num_input_tokens_seen": 1598560, "step": 1220 }, { "epoch": 1.96, "grad_norm": 6.001108646392822, "learning_rate": 1.3454736571302763e-05, "loss": 0.7871, "num_input_tokens_seen": 1605568, "step": 1225 }, { "epoch": 1.968, "grad_norm": 7.643476963043213, "learning_rate": 1.3269375524949284e-05, "loss": 0.8225, "num_input_tokens_seen": 1611984, "step": 1230 }, { "epoch": 1.976, "grad_norm": 5.949811935424805, "learning_rate": 1.308483777421046e-05, "loss": 0.7597, "num_input_tokens_seen": 1618528, "step": 1235 }, { "epoch": 1.984, "grad_norm": 6.608103275299072, "learning_rate": 1.2901136270580993e-05, "loss": 0.7157, "num_input_tokens_seen": 1625840, "step": 1240 }, { "epoch": 1.992, "grad_norm": 6.3687849044799805, "learning_rate": 1.2718283906864939e-05, "loss": 0.8312, "num_input_tokens_seen": 1632304, "step": 1245 }, { "epoch": 2.0, "grad_norm": 5.552835941314697, "learning_rate": 1.2536293516270703e-05, "loss": 0.8579, "num_input_tokens_seen": 1638512, "step": 1250 }, { "epoch": 2.008, "grad_norm": 5.662571430206299, "learning_rate": 1.2355177871510538e-05, "loss": 0.7455, "num_input_tokens_seen": 1644576, "step": 1255 }, { "epoch": 2.016, "grad_norm": 5.270674705505371, "learning_rate": 1.2174949683903941e-05, "loss": 0.7716, "num_input_tokens_seen": 1651344, "step": 1260 }, { "epoch": 2.024, "grad_norm": 5.09323787689209, "learning_rate": 1.1995621602485685e-05, "loss": 0.739, "num_input_tokens_seen": 1657872, "step": 1265 }, { "epoch": 2.032, "grad_norm": 4.8315749168396, "learning_rate": 1.1817206213117942e-05, "loss": 0.7423, "num_input_tokens_seen": 1664400, "step": 1270 }, { "epoch": 2.04, "grad_norm": 5.925480842590332, "learning_rate": 1.1639716037607035e-05, "loss": 0.7219, "num_input_tokens_seen": 1670576, "step": 1275 }, { "epoch": 2.048, "grad_norm": 5.623491287231445, "learning_rate": 1.1463163532824572e-05, "loss": 0.6975, "num_input_tokens_seen": 1676592, "step": 1280 }, { "epoch": 2.056, "grad_norm": 7.131720542907715, "learning_rate": 1.1287561089833248e-05, "loss": 0.7536, "num_input_tokens_seen": 1683152, "step": 1285 }, { "epoch": 2.064, "grad_norm": 5.964690685272217, "learning_rate": 1.1112921033017079e-05, "loss": 0.7828, "num_input_tokens_seen": 1689808, "step": 1290 }, { "epoch": 2.072, "grad_norm": 5.969583511352539, "learning_rate": 1.093925561921657e-05, "loss": 0.7186, "num_input_tokens_seen": 1696352, "step": 1295 }, { "epoch": 2.08, "grad_norm": 5.476303577423096, "learning_rate": 1.0766577036868395e-05, "loss": 0.689, "num_input_tokens_seen": 1703056, "step": 1300 }, { "epoch": 2.088, "grad_norm": 6.045198440551758, "learning_rate": 1.0594897405149995e-05, "loss": 0.7234, "num_input_tokens_seen": 1709040, "step": 1305 }, { "epoch": 2.096, "grad_norm": 5.853973865509033, "learning_rate": 1.0424228773129019e-05, "loss": 0.7442, "num_input_tokens_seen": 1715616, "step": 1310 }, { "epoch": 2.104, "grad_norm": 5.016544342041016, "learning_rate": 1.0254583118917698e-05, "loss": 0.6908, "num_input_tokens_seen": 1722192, "step": 1315 }, { "epoch": 2.112, "grad_norm": 5.601842880249023, "learning_rate": 1.0085972348832137e-05, "loss": 0.6929, "num_input_tokens_seen": 1729232, "step": 1320 }, { "epoch": 2.12, "grad_norm": 7.124587059020996, "learning_rate": 9.918408296556706e-06, "loss": 0.7966, "num_input_tokens_seen": 1735408, "step": 1325 }, { "epoch": 2.128, "grad_norm": 6.398017406463623, "learning_rate": 9.751902722313527e-06, "loss": 0.6879, "num_input_tokens_seen": 1742608, "step": 1330 }, { "epoch": 2.136, "grad_norm": 4.915652751922607, "learning_rate": 9.586467312037075e-06, "loss": 0.7194, "num_input_tokens_seen": 1748704, "step": 1335 }, { "epoch": 2.144, "grad_norm": 6.361541271209717, "learning_rate": 9.422113676554073e-06, "loss": 0.7192, "num_input_tokens_seen": 1755024, "step": 1340 }, { "epoch": 2.152, "grad_norm": 6.177706241607666, "learning_rate": 9.258853350768499e-06, "loss": 0.7604, "num_input_tokens_seen": 1761808, "step": 1345 }, { "epoch": 2.16, "grad_norm": 6.024658203125, "learning_rate": 9.096697792852155e-06, "loss": 0.7169, "num_input_tokens_seen": 1768688, "step": 1350 }, { "epoch": 2.168, "grad_norm": 5.89205265045166, "learning_rate": 8.93565838344039e-06, "loss": 0.8025, "num_input_tokens_seen": 1774928, "step": 1355 }, { "epoch": 2.176, "grad_norm": 6.651025772094727, "learning_rate": 8.775746424833427e-06, "loss": 0.6733, "num_input_tokens_seen": 1781408, "step": 1360 }, { "epoch": 2.184, "grad_norm": 6.420565605163574, "learning_rate": 8.616973140203098e-06, "loss": 0.7122, "num_input_tokens_seen": 1787872, "step": 1365 }, { "epoch": 2.192, "grad_norm": 6.494694709777832, "learning_rate": 8.459349672805198e-06, "loss": 0.7446, "num_input_tokens_seen": 1794176, "step": 1370 }, { "epoch": 2.2, "grad_norm": 5.824810028076172, "learning_rate": 8.302887085197341e-06, "loss": 0.6692, "num_input_tokens_seen": 1801088, "step": 1375 }, { "epoch": 2.208, "grad_norm": 5.81256103515625, "learning_rate": 8.147596358462662e-06, "loss": 0.6532, "num_input_tokens_seen": 1808864, "step": 1380 }, { "epoch": 2.216, "grad_norm": 5.595151424407959, "learning_rate": 7.993488391439025e-06, "loss": 0.735, "num_input_tokens_seen": 1815424, "step": 1385 }, { "epoch": 2.224, "grad_norm": 6.604226589202881, "learning_rate": 7.840573999954153e-06, "loss": 0.7757, "num_input_tokens_seen": 1821680, "step": 1390 }, { "epoch": 2.232, "grad_norm": 6.494365692138672, "learning_rate": 7.688863916066524e-06, "loss": 0.7276, "num_input_tokens_seen": 1828528, "step": 1395 }, { "epoch": 2.24, "grad_norm": 7.171821594238281, "learning_rate": 7.538368787312186e-06, "loss": 0.7284, "num_input_tokens_seen": 1834592, "step": 1400 }, { "epoch": 2.248, "grad_norm": 6.457537651062012, "learning_rate": 7.389099175957426e-06, "loss": 0.7064, "num_input_tokens_seen": 1840960, "step": 1405 }, { "epoch": 2.2560000000000002, "grad_norm": 5.4786906242370605, "learning_rate": 7.241065558257512e-06, "loss": 0.8045, "num_input_tokens_seen": 1847328, "step": 1410 }, { "epoch": 2.2640000000000002, "grad_norm": 6.286975383758545, "learning_rate": 7.094278323721417e-06, "loss": 0.7438, "num_input_tokens_seen": 1853504, "step": 1415 }, { "epoch": 2.2720000000000002, "grad_norm": 6.678887844085693, "learning_rate": 6.94874777438265e-06, "loss": 0.6711, "num_input_tokens_seen": 1860560, "step": 1420 }, { "epoch": 2.2800000000000002, "grad_norm": 6.511438846588135, "learning_rate": 6.804484124076249e-06, "loss": 0.6982, "num_input_tokens_seen": 1867120, "step": 1425 }, { "epoch": 2.288, "grad_norm": 5.361278057098389, "learning_rate": 6.661497497721872e-06, "loss": 0.7343, "num_input_tokens_seen": 1873552, "step": 1430 }, { "epoch": 2.296, "grad_norm": 5.182500839233398, "learning_rate": 6.519797930613289e-06, "loss": 0.681, "num_input_tokens_seen": 1880048, "step": 1435 }, { "epoch": 2.304, "grad_norm": 5.267027378082275, "learning_rate": 6.379395367713984e-06, "loss": 0.7301, "num_input_tokens_seen": 1886320, "step": 1440 }, { "epoch": 2.312, "grad_norm": 6.636712074279785, "learning_rate": 6.240299662959237e-06, "loss": 0.7269, "num_input_tokens_seen": 1892512, "step": 1445 }, { "epoch": 2.32, "grad_norm": 6.594943046569824, "learning_rate": 6.102520578564508e-06, "loss": 0.7214, "num_input_tokens_seen": 1899088, "step": 1450 }, { "epoch": 2.328, "grad_norm": 6.010622978210449, "learning_rate": 5.966067784340346e-06, "loss": 0.7283, "num_input_tokens_seen": 1906000, "step": 1455 }, { "epoch": 2.336, "grad_norm": 6.823734283447266, "learning_rate": 5.8309508570136284e-06, "loss": 0.7583, "num_input_tokens_seen": 1912016, "step": 1460 }, { "epoch": 2.344, "grad_norm": 5.9860310554504395, "learning_rate": 5.6971792795555505e-06, "loss": 0.7206, "num_input_tokens_seen": 1918688, "step": 1465 }, { "epoch": 2.352, "grad_norm": 5.339646339416504, "learning_rate": 5.5647624405159945e-06, "loss": 0.7089, "num_input_tokens_seen": 1925664, "step": 1470 }, { "epoch": 2.36, "grad_norm": 5.947216987609863, "learning_rate": 5.4337096333646365e-06, "loss": 0.7013, "num_input_tokens_seen": 1932080, "step": 1475 }, { "epoch": 2.368, "grad_norm": 5.9478912353515625, "learning_rate": 5.304030055838705e-06, "loss": 0.6382, "num_input_tokens_seen": 1938992, "step": 1480 }, { "epoch": 2.376, "grad_norm": 5.693755626678467, "learning_rate": 5.175732809297434e-06, "loss": 0.7408, "num_input_tokens_seen": 1945280, "step": 1485 }, { "epoch": 2.384, "grad_norm": 6.069830417633057, "learning_rate": 5.048826898083331e-06, "loss": 0.7486, "num_input_tokens_seen": 1952112, "step": 1490 }, { "epoch": 2.392, "grad_norm": 5.075676441192627, "learning_rate": 4.9233212288901845e-06, "loss": 0.7354, "num_input_tokens_seen": 1958560, "step": 1495 }, { "epoch": 2.4, "grad_norm": 6.984851837158203, "learning_rate": 4.799224610137976e-06, "loss": 0.7147, "num_input_tokens_seen": 1964480, "step": 1500 }, { "epoch": 2.408, "grad_norm": 6.267239570617676, "learning_rate": 4.676545751354674e-06, "loss": 0.7311, "num_input_tokens_seen": 1971200, "step": 1505 }, { "epoch": 2.416, "grad_norm": 6.076528549194336, "learning_rate": 4.5552932625649944e-06, "loss": 0.6918, "num_input_tokens_seen": 1977824, "step": 1510 }, { "epoch": 2.424, "grad_norm": 5.985647201538086, "learning_rate": 4.43547565368605e-06, "loss": 0.6621, "num_input_tokens_seen": 1985088, "step": 1515 }, { "epoch": 2.432, "grad_norm": 5.833768844604492, "learning_rate": 4.317101333930191e-06, "loss": 0.7025, "num_input_tokens_seen": 1991344, "step": 1520 }, { "epoch": 2.44, "grad_norm": 6.63688325881958, "learning_rate": 4.200178611214736e-06, "loss": 0.6912, "num_input_tokens_seen": 1997984, "step": 1525 }, { "epoch": 2.448, "grad_norm": 5.703419208526611, "learning_rate": 4.084715691578939e-06, "loss": 0.7216, "num_input_tokens_seen": 2005152, "step": 1530 }, { "epoch": 2.456, "grad_norm": 5.383528709411621, "learning_rate": 3.970720678608034e-06, "loss": 0.6081, "num_input_tokens_seen": 2011696, "step": 1535 }, { "epoch": 2.464, "grad_norm": 7.719223976135254, "learning_rate": 3.858201572864537e-06, "loss": 0.663, "num_input_tokens_seen": 2017904, "step": 1540 }, { "epoch": 2.472, "grad_norm": 6.381964683532715, "learning_rate": 3.7471662713266744e-06, "loss": 0.6668, "num_input_tokens_seen": 2023824, "step": 1545 }, { "epoch": 2.48, "grad_norm": 6.049680233001709, "learning_rate": 3.6376225668342284e-06, "loss": 0.6697, "num_input_tokens_seen": 2030096, "step": 1550 }, { "epoch": 2.488, "grad_norm": 5.877965927124023, "learning_rate": 3.529578147541532e-06, "loss": 0.5921, "num_input_tokens_seen": 2036672, "step": 1555 }, { "epoch": 2.496, "grad_norm": 5.371738433837891, "learning_rate": 3.4230405963779355e-06, "loss": 0.7071, "num_input_tokens_seen": 2044016, "step": 1560 }, { "epoch": 2.504, "grad_norm": 6.318173885345459, "learning_rate": 3.3180173905155902e-06, "loss": 0.6577, "num_input_tokens_seen": 2051216, "step": 1565 }, { "epoch": 2.512, "grad_norm": 6.8952484130859375, "learning_rate": 3.2145159008446807e-06, "loss": 0.7241, "num_input_tokens_seen": 2057504, "step": 1570 }, { "epoch": 2.52, "grad_norm": 5.24618673324585, "learning_rate": 3.1125433914561186e-06, "loss": 0.6901, "num_input_tokens_seen": 2064208, "step": 1575 }, { "epoch": 2.528, "grad_norm": 6.14894962310791, "learning_rate": 3.0121070191317074e-06, "loss": 0.7656, "num_input_tokens_seen": 2070528, "step": 1580 }, { "epoch": 2.536, "grad_norm": 5.479616165161133, "learning_rate": 2.9132138328418573e-06, "loss": 0.5938, "num_input_tokens_seen": 2078016, "step": 1585 }, { "epoch": 2.544, "grad_norm": 5.223906993865967, "learning_rate": 2.8158707732508727e-06, "loss": 0.7392, "num_input_tokens_seen": 2083568, "step": 1590 }, { "epoch": 2.552, "grad_norm": 6.1376519203186035, "learning_rate": 2.72008467222985e-06, "loss": 0.6447, "num_input_tokens_seen": 2089856, "step": 1595 }, { "epoch": 2.56, "grad_norm": 3.5924127101898193, "learning_rate": 2.6258622523771287e-06, "loss": 0.6891, "num_input_tokens_seen": 2097120, "step": 1600 }, { "epoch": 2.568, "grad_norm": 7.396603584289551, "learning_rate": 2.5332101265465648e-06, "loss": 0.7287, "num_input_tokens_seen": 2102960, "step": 1605 }, { "epoch": 2.576, "grad_norm": 5.440645217895508, "learning_rate": 2.442134797383344e-06, "loss": 0.6739, "num_input_tokens_seen": 2108912, "step": 1610 }, { "epoch": 2.584, "grad_norm": 5.821516036987305, "learning_rate": 2.3526426568676483e-06, "loss": 0.6185, "num_input_tokens_seen": 2115824, "step": 1615 }, { "epoch": 2.592, "grad_norm": 6.806615829467773, "learning_rate": 2.2647399858660156e-06, "loss": 0.7561, "num_input_tokens_seen": 2122048, "step": 1620 }, { "epoch": 2.6, "grad_norm": 5.234946250915527, "learning_rate": 2.178432953690565e-06, "loss": 0.7218, "num_input_tokens_seen": 2129312, "step": 1625 }, { "epoch": 2.608, "grad_norm": 6.068792819976807, "learning_rate": 2.093727617665955e-06, "loss": 0.6861, "num_input_tokens_seen": 2135488, "step": 1630 }, { "epoch": 2.616, "grad_norm": 6.392036437988281, "learning_rate": 2.0106299227043297e-06, "loss": 0.712, "num_input_tokens_seen": 2141072, "step": 1635 }, { "epoch": 2.624, "grad_norm": 5.817321300506592, "learning_rate": 1.929145700888008e-06, "loss": 0.7248, "num_input_tokens_seen": 2148144, "step": 1640 }, { "epoch": 2.632, "grad_norm": 6.509500026702881, "learning_rate": 1.8492806710602496e-06, "loss": 0.7942, "num_input_tokens_seen": 2155152, "step": 1645 }, { "epoch": 2.64, "grad_norm": 7.039202690124512, "learning_rate": 1.7710404384238155e-06, "loss": 0.7315, "num_input_tokens_seen": 2162048, "step": 1650 }, { "epoch": 2.648, "grad_norm": 6.398265361785889, "learning_rate": 1.6944304941476225e-06, "loss": 0.7056, "num_input_tokens_seen": 2168304, "step": 1655 }, { "epoch": 2.656, "grad_norm": 4.7756524085998535, "learning_rate": 1.6194562149813242e-06, "loss": 0.7023, "num_input_tokens_seen": 2175504, "step": 1660 }, { "epoch": 2.664, "grad_norm": 7.072215557098389, "learning_rate": 1.54612286287798e-06, "loss": 0.7725, "num_input_tokens_seen": 2182048, "step": 1665 }, { "epoch": 2.672, "grad_norm": 5.781796455383301, "learning_rate": 1.4744355846247255e-06, "loss": 0.6212, "num_input_tokens_seen": 2188704, "step": 1670 }, { "epoch": 2.68, "grad_norm": 6.597018718719482, "learning_rate": 1.4043994114815661e-06, "loss": 0.7874, "num_input_tokens_seen": 2195072, "step": 1675 }, { "epoch": 2.6879999999999997, "grad_norm": 5.874861717224121, "learning_rate": 1.3360192588282832e-06, "loss": 0.7656, "num_input_tokens_seen": 2202352, "step": 1680 }, { "epoch": 2.6959999999999997, "grad_norm": 4.774026393890381, "learning_rate": 1.2692999258194088e-06, "loss": 0.7421, "num_input_tokens_seen": 2209120, "step": 1685 }, { "epoch": 2.7039999999999997, "grad_norm": 6.998686790466309, "learning_rate": 1.2042460950474648e-06, "loss": 0.6949, "num_input_tokens_seen": 2215648, "step": 1690 }, { "epoch": 2.7119999999999997, "grad_norm": 5.336740493774414, "learning_rate": 1.1408623322142736e-06, "loss": 0.7663, "num_input_tokens_seen": 2222496, "step": 1695 }, { "epoch": 2.7199999999999998, "grad_norm": 5.413997650146484, "learning_rate": 1.0791530858105387e-06, "loss": 0.6896, "num_input_tokens_seen": 2229312, "step": 1700 }, { "epoch": 2.7279999999999998, "grad_norm": 5.846436977386475, "learning_rate": 1.0191226868036418e-06, "loss": 0.6872, "num_input_tokens_seen": 2235344, "step": 1705 }, { "epoch": 2.7359999999999998, "grad_norm": 6.408481597900391, "learning_rate": 9.607753483336811e-07, "loss": 0.721, "num_input_tokens_seen": 2242000, "step": 1710 }, { "epoch": 2.7439999999999998, "grad_norm": 7.655921459197998, "learning_rate": 9.041151654177487e-07, "loss": 0.7264, "num_input_tokens_seen": 2249040, "step": 1715 }, { "epoch": 2.752, "grad_norm": 5.736323833465576, "learning_rate": 8.491461146625773e-07, "loss": 0.7402, "num_input_tokens_seen": 2256000, "step": 1720 }, { "epoch": 2.76, "grad_norm": 6.008438587188721, "learning_rate": 7.95872053985397e-07, "loss": 0.7244, "num_input_tokens_seen": 2262512, "step": 1725 }, { "epoch": 2.768, "grad_norm": 5.405884265899658, "learning_rate": 7.442967223432212e-07, "loss": 0.7318, "num_input_tokens_seen": 2269744, "step": 1730 }, { "epoch": 2.776, "grad_norm": 6.758678436279297, "learning_rate": 6.944237394703984e-07, "loss": 0.7264, "num_input_tokens_seen": 2276112, "step": 1735 }, { "epoch": 2.784, "grad_norm": 5.777829170227051, "learning_rate": 6.462566056245761e-07, "loss": 0.7297, "num_input_tokens_seen": 2282912, "step": 1740 }, { "epoch": 2.792, "grad_norm": 5.518516540527344, "learning_rate": 5.997987013410533e-07, "loss": 0.648, "num_input_tokens_seen": 2289504, "step": 1745 }, { "epoch": 2.8, "grad_norm": 6.5723557472229, "learning_rate": 5.550532871955061e-07, "loss": 0.7339, "num_input_tokens_seen": 2296048, "step": 1750 }, { "epoch": 2.808, "grad_norm": 5.465515613555908, "learning_rate": 5.120235035751653e-07, "loss": 0.7185, "num_input_tokens_seen": 2301968, "step": 1755 }, { "epoch": 2.816, "grad_norm": 5.395256996154785, "learning_rate": 4.7071237045839266e-07, "loss": 0.7423, "num_input_tokens_seen": 2308400, "step": 1760 }, { "epoch": 2.824, "grad_norm": 6.215610504150391, "learning_rate": 4.311227872027479e-07, "loss": 0.6996, "num_input_tokens_seen": 2314784, "step": 1765 }, { "epoch": 2.832, "grad_norm": 6.787163734436035, "learning_rate": 3.932575323414928e-07, "loss": 0.6314, "num_input_tokens_seen": 2321376, "step": 1770 }, { "epoch": 2.84, "grad_norm": 3.62884259223938, "learning_rate": 3.571192633885834e-07, "loss": 0.6817, "num_input_tokens_seen": 2328576, "step": 1775 }, { "epoch": 2.848, "grad_norm": 5.678812503814697, "learning_rate": 3.227105166521638e-07, "loss": 0.671, "num_input_tokens_seen": 2334800, "step": 1780 }, { "epoch": 2.856, "grad_norm": 6.032224178314209, "learning_rate": 2.900337070565473e-07, "loss": 0.753, "num_input_tokens_seen": 2340608, "step": 1785 }, { "epoch": 2.864, "grad_norm": 6.061573505401611, "learning_rate": 2.5909112797274093e-07, "loss": 0.7097, "num_input_tokens_seen": 2347536, "step": 1790 }, { "epoch": 2.872, "grad_norm": 5.2953009605407715, "learning_rate": 2.298849510574824e-07, "loss": 0.7588, "num_input_tokens_seen": 2353888, "step": 1795 }, { "epoch": 2.88, "grad_norm": 6.579641819000244, "learning_rate": 2.024172261008178e-07, "loss": 0.68, "num_input_tokens_seen": 2360128, "step": 1800 }, { "epoch": 2.888, "grad_norm": 8.196795463562012, "learning_rate": 1.7668988088226924e-07, "loss": 0.7627, "num_input_tokens_seen": 2366624, "step": 1805 }, { "epoch": 2.896, "grad_norm": 5.645856857299805, "learning_rate": 1.5270472103549315e-07, "loss": 0.704, "num_input_tokens_seen": 2373424, "step": 1810 }, { "epoch": 2.904, "grad_norm": 5.634349822998047, "learning_rate": 1.3046342992159566e-07, "loss": 0.6698, "num_input_tokens_seen": 2379872, "step": 1815 }, { "epoch": 2.912, "grad_norm": 3.3688719272613525, "learning_rate": 1.0996756851096579e-07, "loss": 0.6955, "num_input_tokens_seen": 2386592, "step": 1820 }, { "epoch": 2.92, "grad_norm": 5.799430847167969, "learning_rate": 9.121857527372158e-08, "loss": 0.7248, "num_input_tokens_seen": 2392912, "step": 1825 }, { "epoch": 2.928, "grad_norm": 6.198770523071289, "learning_rate": 7.421776607876019e-08, "loss": 0.6922, "num_input_tokens_seen": 2399360, "step": 1830 }, { "epoch": 2.936, "grad_norm": 5.737548828125, "learning_rate": 5.896633410141239e-08, "loss": 0.6992, "num_input_tokens_seen": 2405808, "step": 1835 }, { "epoch": 2.944, "grad_norm": 6.3686652183532715, "learning_rate": 4.546534973968175e-08, "loss": 0.6978, "num_input_tokens_seen": 2412656, "step": 1840 }, { "epoch": 2.952, "grad_norm": 5.940762042999268, "learning_rate": 3.37157605391325e-08, "loss": 0.7273, "num_input_tokens_seen": 2418448, "step": 1845 }, { "epoch": 2.96, "grad_norm": 6.598605632781982, "learning_rate": 2.3718391126392738e-08, "loss": 0.676, "num_input_tokens_seen": 2426192, "step": 1850 }, { "epoch": 2.968, "grad_norm": 4.683955192565918, "learning_rate": 1.5473943151270153e-08, "loss": 0.6869, "num_input_tokens_seen": 2432480, "step": 1855 }, { "epoch": 2.976, "grad_norm": 5.59522008895874, "learning_rate": 8.982995237505342e-09, "loss": 0.6852, "num_input_tokens_seen": 2438576, "step": 1860 }, { "epoch": 2.984, "grad_norm": 6.2029218673706055, "learning_rate": 4.246002942173699e-09, "loss": 0.7215, "num_input_tokens_seen": 2445056, "step": 1865 }, { "epoch": 2.992, "grad_norm": 5.723230361938477, "learning_rate": 1.2632987237054528e-09, "loss": 0.7314, "num_input_tokens_seen": 2451360, "step": 1870 }, { "epoch": 3.0, "grad_norm": 5.415881156921387, "learning_rate": 3.509191854877969e-11, "loss": 0.6885, "num_input_tokens_seen": 2458144, "step": 1875 } ], "logging_steps": 5, "max_steps": 1875, "num_input_tokens_seen": 2458144, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.4435925671411712e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }