{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5847953216374269, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.593726110458374, "epoch": 0.005847953216374269, "grad_norm": 1.2734375, "learning_rate": 2e-06, "loss": 7.6031, "mean_token_accuracy": 0.13570500910282135, "num_tokens": 12656.0, "step": 5 }, { "entropy": 7.586997556686401, "epoch": 0.011695906432748537, "grad_norm": 1.1796875, "learning_rate": 4.5e-06, "loss": 7.6652, "mean_token_accuracy": 0.12274946123361588, "num_tokens": 25207.0, "step": 10 }, { "entropy": 7.649361896514892, "epoch": 0.017543859649122806, "grad_norm": 1.0703125, "learning_rate": 7e-06, "loss": 7.673, "mean_token_accuracy": 0.12404287382960319, "num_tokens": 38096.0, "step": 15 }, { "entropy": 7.637357187271118, "epoch": 0.023391812865497075, "grad_norm": 1.1015625, "learning_rate": 9.5e-06, "loss": 7.7506, "mean_token_accuracy": 0.12453248649835587, "num_tokens": 50626.0, "step": 20 }, { "entropy": 7.673450565338134, "epoch": 0.029239766081871343, "grad_norm": 1.0234375, "learning_rate": 1.2e-05, "loss": 7.6825, "mean_token_accuracy": 0.12940182387828827, "num_tokens": 63448.0, "step": 25 }, { "entropy": 7.774927949905395, "epoch": 0.03508771929824561, "grad_norm": 1.1015625, "learning_rate": 1.4500000000000002e-05, "loss": 7.731, "mean_token_accuracy": 0.12124454602599144, "num_tokens": 75656.0, "step": 30 }, { "entropy": 7.754840278625489, "epoch": 0.04093567251461988, "grad_norm": 1.0625, "learning_rate": 1.7000000000000003e-05, "loss": 7.7155, "mean_token_accuracy": 0.12517715990543365, "num_tokens": 88756.0, "step": 35 }, { "entropy": 7.778929853439331, "epoch": 0.04678362573099415, "grad_norm": 0.96484375, "learning_rate": 1.95e-05, "loss": 7.6499, "mean_token_accuracy": 0.12550911605358123, "num_tokens": 100934.0, "step": 40 }, { "entropy": 7.761408805847168, "epoch": 0.05263157894736842, "grad_norm": 1.1015625, "learning_rate": 2.2e-05, "loss": 7.6072, "mean_token_accuracy": 0.12898701280355454, "num_tokens": 112212.0, "step": 45 }, { "entropy": 7.740135717391968, "epoch": 0.05847953216374269, "grad_norm": 0.99609375, "learning_rate": 2.4500000000000003e-05, "loss": 7.6067, "mean_token_accuracy": 0.12694446071982385, "num_tokens": 126314.0, "step": 50 }, { "entropy": 7.718768978118897, "epoch": 0.06432748538011696, "grad_norm": 1.1015625, "learning_rate": 2.7e-05, "loss": 7.652, "mean_token_accuracy": 0.13094937354326247, "num_tokens": 138416.0, "step": 55 }, { "entropy": 7.7235801219940186, "epoch": 0.07017543859649122, "grad_norm": 1.0078125, "learning_rate": 2.95e-05, "loss": 7.6356, "mean_token_accuracy": 0.12992877885699272, "num_tokens": 149903.0, "step": 60 }, { "entropy": 7.728446578979492, "epoch": 0.07602339181286549, "grad_norm": 0.8515625, "learning_rate": 3.2e-05, "loss": 7.616, "mean_token_accuracy": 0.13435307145118713, "num_tokens": 163516.0, "step": 65 }, { "entropy": 7.745584630966187, "epoch": 0.08187134502923976, "grad_norm": 0.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 7.6154, "mean_token_accuracy": 0.12847506403923034, "num_tokens": 176024.0, "step": 70 }, { "entropy": 7.79000825881958, "epoch": 0.08771929824561403, "grad_norm": 0.95703125, "learning_rate": 3.7e-05, "loss": 7.6904, "mean_token_accuracy": 0.12912894561886787, "num_tokens": 189337.0, "step": 75 }, { "entropy": 7.840251207351685, "epoch": 0.0935672514619883, "grad_norm": 1.0625, "learning_rate": 3.95e-05, "loss": 7.632, "mean_token_accuracy": 0.1310859203338623, "num_tokens": 201752.0, "step": 80 }, { "entropy": 7.792728662490845, "epoch": 0.09941520467836257, "grad_norm": 1.0546875, "learning_rate": 4.2000000000000004e-05, "loss": 7.7007, "mean_token_accuracy": 0.1200527586042881, "num_tokens": 214676.0, "step": 85 }, { "entropy": 7.769255495071411, "epoch": 0.10526315789473684, "grad_norm": 1.015625, "learning_rate": 4.45e-05, "loss": 7.6036, "mean_token_accuracy": 0.1250310204923153, "num_tokens": 225474.0, "step": 90 }, { "entropy": 7.832526683807373, "epoch": 0.1111111111111111, "grad_norm": 1.0859375, "learning_rate": 4.7000000000000004e-05, "loss": 7.6196, "mean_token_accuracy": 0.13330849632620811, "num_tokens": 237345.0, "step": 95 }, { "entropy": 7.786408853530884, "epoch": 0.11695906432748537, "grad_norm": 1.0078125, "learning_rate": 4.9500000000000004e-05, "loss": 7.5976, "mean_token_accuracy": 0.13106755986809732, "num_tokens": 249633.0, "step": 100 }, { "entropy": 7.785315036773682, "epoch": 0.12280701754385964, "grad_norm": 1.0546875, "learning_rate": 5.2e-05, "loss": 7.5707, "mean_token_accuracy": 0.12854716926813126, "num_tokens": 261840.0, "step": 105 }, { "entropy": 7.7381500720977785, "epoch": 0.1286549707602339, "grad_norm": 1.0234375, "learning_rate": 5.45e-05, "loss": 7.6581, "mean_token_accuracy": 0.12695110440254212, "num_tokens": 273838.0, "step": 110 }, { "entropy": 7.7819578647613525, "epoch": 0.13450292397660818, "grad_norm": 1.0, "learning_rate": 5.7e-05, "loss": 7.6314, "mean_token_accuracy": 0.12518885657191275, "num_tokens": 286001.0, "step": 115 }, { "entropy": 7.892224454879761, "epoch": 0.14035087719298245, "grad_norm": 1.1171875, "learning_rate": 5.9499999999999996e-05, "loss": 7.5622, "mean_token_accuracy": 0.1403429314494133, "num_tokens": 299052.0, "step": 120 }, { "entropy": 7.751383972167969, "epoch": 0.14619883040935672, "grad_norm": 1.1640625, "learning_rate": 6.2e-05, "loss": 7.6007, "mean_token_accuracy": 0.12698042243719102, "num_tokens": 311803.0, "step": 125 }, { "entropy": 7.862428855895996, "epoch": 0.15204678362573099, "grad_norm": 1.0703125, "learning_rate": 6.450000000000001e-05, "loss": 7.6155, "mean_token_accuracy": 0.1285979501903057, "num_tokens": 323712.0, "step": 130 }, { "entropy": 7.733092164993286, "epoch": 0.15789473684210525, "grad_norm": 1.03125, "learning_rate": 6.7e-05, "loss": 7.5735, "mean_token_accuracy": 0.1340746872127056, "num_tokens": 335171.0, "step": 135 }, { "entropy": 7.840703058242798, "epoch": 0.16374269005847952, "grad_norm": 1.1015625, "learning_rate": 6.950000000000001e-05, "loss": 7.6469, "mean_token_accuracy": 0.12687307894229888, "num_tokens": 347185.0, "step": 140 }, { "entropy": 7.806375932693482, "epoch": 0.1695906432748538, "grad_norm": 1.796875, "learning_rate": 7.2e-05, "loss": 7.5806, "mean_token_accuracy": 0.12792280316352844, "num_tokens": 359695.0, "step": 145 }, { "entropy": 7.806016826629639, "epoch": 0.17543859649122806, "grad_norm": 1.0625, "learning_rate": 7.45e-05, "loss": 7.6646, "mean_token_accuracy": 0.13149451091885567, "num_tokens": 373805.0, "step": 150 }, { "entropy": 7.811039972305298, "epoch": 0.18128654970760233, "grad_norm": 1.203125, "learning_rate": 7.7e-05, "loss": 7.615, "mean_token_accuracy": 0.13272017240524292, "num_tokens": 385772.0, "step": 155 }, { "entropy": 7.7556663990020756, "epoch": 0.1871345029239766, "grad_norm": 0.98828125, "learning_rate": 7.950000000000001e-05, "loss": 7.5329, "mean_token_accuracy": 0.13663637787103652, "num_tokens": 397641.0, "step": 160 }, { "entropy": 7.7673561573028564, "epoch": 0.19298245614035087, "grad_norm": 1.03125, "learning_rate": 8.2e-05, "loss": 7.5761, "mean_token_accuracy": 0.13438102826476098, "num_tokens": 410241.0, "step": 165 }, { "entropy": 7.851863145828247, "epoch": 0.19883040935672514, "grad_norm": 1.0, "learning_rate": 8.450000000000001e-05, "loss": 7.5371, "mean_token_accuracy": 0.12968598157167435, "num_tokens": 422079.0, "step": 170 }, { "entropy": 7.722187614440918, "epoch": 0.2046783625730994, "grad_norm": 1.046875, "learning_rate": 8.7e-05, "loss": 7.6151, "mean_token_accuracy": 0.12510994151234628, "num_tokens": 435187.0, "step": 175 }, { "entropy": 7.802532577514649, "epoch": 0.21052631578947367, "grad_norm": 1.0078125, "learning_rate": 8.95e-05, "loss": 7.59, "mean_token_accuracy": 0.12483937367796898, "num_tokens": 447329.0, "step": 180 }, { "entropy": 7.7081256866455075, "epoch": 0.21637426900584794, "grad_norm": 1.1015625, "learning_rate": 9.2e-05, "loss": 7.5244, "mean_token_accuracy": 0.13455075845122338, "num_tokens": 459316.0, "step": 185 }, { "entropy": 7.866452074050903, "epoch": 0.2222222222222222, "grad_norm": 1.2421875, "learning_rate": 9.45e-05, "loss": 7.602, "mean_token_accuracy": 0.13409386128187178, "num_tokens": 471184.0, "step": 190 }, { "entropy": 7.7785547256469725, "epoch": 0.22807017543859648, "grad_norm": 1.015625, "learning_rate": 9.7e-05, "loss": 7.5964, "mean_token_accuracy": 0.13105484768748282, "num_tokens": 483988.0, "step": 195 }, { "entropy": 7.754951095581054, "epoch": 0.23391812865497075, "grad_norm": 1.0390625, "learning_rate": 9.95e-05, "loss": 7.6021, "mean_token_accuracy": 0.12733055427670478, "num_tokens": 495995.0, "step": 200 }, { "entropy": 7.760473966598511, "epoch": 0.23976608187134502, "grad_norm": 1.015625, "learning_rate": 0.000102, "loss": 7.5481, "mean_token_accuracy": 0.13547581657767296, "num_tokens": 507382.0, "step": 205 }, { "entropy": 7.720216274261475, "epoch": 0.24561403508771928, "grad_norm": 1.1875, "learning_rate": 0.00010449999999999999, "loss": 7.5492, "mean_token_accuracy": 0.1361517131328583, "num_tokens": 518748.0, "step": 210 }, { "entropy": 7.7840687274932865, "epoch": 0.25146198830409355, "grad_norm": 1.0390625, "learning_rate": 0.000107, "loss": 7.5697, "mean_token_accuracy": 0.12845324501395225, "num_tokens": 531571.0, "step": 215 }, { "entropy": 7.810080337524414, "epoch": 0.2573099415204678, "grad_norm": 0.99609375, "learning_rate": 0.0001095, "loss": 7.5872, "mean_token_accuracy": 0.1274337127804756, "num_tokens": 544699.0, "step": 220 }, { "entropy": 7.742982816696167, "epoch": 0.2631578947368421, "grad_norm": 1.0703125, "learning_rate": 0.000112, "loss": 7.5439, "mean_token_accuracy": 0.13237009420990944, "num_tokens": 558110.0, "step": 225 }, { "entropy": 7.847256898880005, "epoch": 0.26900584795321636, "grad_norm": 1.0625, "learning_rate": 0.0001145, "loss": 7.6277, "mean_token_accuracy": 0.12315782383084298, "num_tokens": 571566.0, "step": 230 }, { "entropy": 7.752783679962159, "epoch": 0.27485380116959063, "grad_norm": 1.3125, "learning_rate": 0.00011700000000000001, "loss": 7.5427, "mean_token_accuracy": 0.130996935069561, "num_tokens": 583149.0, "step": 235 }, { "entropy": 7.764012479782105, "epoch": 0.2807017543859649, "grad_norm": 1.203125, "learning_rate": 0.00011949999999999999, "loss": 7.5734, "mean_token_accuracy": 0.1311168886721134, "num_tokens": 596360.0, "step": 240 }, { "entropy": 7.776003646850586, "epoch": 0.28654970760233917, "grad_norm": 1.0390625, "learning_rate": 0.000122, "loss": 7.57, "mean_token_accuracy": 0.12710137963294982, "num_tokens": 607719.0, "step": 245 }, { "entropy": 7.803481483459473, "epoch": 0.29239766081871343, "grad_norm": 1.1796875, "learning_rate": 0.0001245, "loss": 7.5331, "mean_token_accuracy": 0.13498716056346893, "num_tokens": 619002.0, "step": 250 }, { "entropy": 7.713655710220337, "epoch": 0.2982456140350877, "grad_norm": 1.1484375, "learning_rate": 0.000127, "loss": 7.5076, "mean_token_accuracy": 0.13216801062226297, "num_tokens": 631437.0, "step": 255 }, { "entropy": 7.640055465698242, "epoch": 0.30409356725146197, "grad_norm": 1.1875, "learning_rate": 0.0001295, "loss": 7.5087, "mean_token_accuracy": 0.13282301425933837, "num_tokens": 642611.0, "step": 260 }, { "entropy": 7.83185043334961, "epoch": 0.30994152046783624, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 7.5447, "mean_token_accuracy": 0.1268044739961624, "num_tokens": 654874.0, "step": 265 }, { "entropy": 7.68661732673645, "epoch": 0.3157894736842105, "grad_norm": 1.109375, "learning_rate": 0.00013450000000000002, "loss": 7.629, "mean_token_accuracy": 0.1293095037341118, "num_tokens": 669141.0, "step": 270 }, { "entropy": 7.781434631347656, "epoch": 0.3216374269005848, "grad_norm": 1.28125, "learning_rate": 0.00013700000000000002, "loss": 7.5456, "mean_token_accuracy": 0.13286237716674804, "num_tokens": 681192.0, "step": 275 }, { "entropy": 7.814055967330932, "epoch": 0.32748538011695905, "grad_norm": 1.171875, "learning_rate": 0.0001395, "loss": 7.5423, "mean_token_accuracy": 0.13368416726589202, "num_tokens": 693191.0, "step": 280 }, { "entropy": 7.664337110519409, "epoch": 0.3333333333333333, "grad_norm": 1.2578125, "learning_rate": 0.00014199999999999998, "loss": 7.5257, "mean_token_accuracy": 0.1304435022175312, "num_tokens": 705131.0, "step": 285 }, { "entropy": 7.808525848388672, "epoch": 0.3391812865497076, "grad_norm": 1.1015625, "learning_rate": 0.0001445, "loss": 7.5226, "mean_token_accuracy": 0.1330956645309925, "num_tokens": 717873.0, "step": 290 }, { "entropy": 7.779027700424194, "epoch": 0.34502923976608185, "grad_norm": 1.1171875, "learning_rate": 0.000147, "loss": 7.5753, "mean_token_accuracy": 0.12839027419686316, "num_tokens": 730527.0, "step": 295 }, { "entropy": 7.754869270324707, "epoch": 0.3508771929824561, "grad_norm": 1.09375, "learning_rate": 0.0001495, "loss": 7.6158, "mean_token_accuracy": 0.1226100891828537, "num_tokens": 743263.0, "step": 300 }, { "entropy": 7.853420972824097, "epoch": 0.3567251461988304, "grad_norm": 1.1640625, "learning_rate": 0.000152, "loss": 7.6122, "mean_token_accuracy": 0.12751553878188132, "num_tokens": 755422.0, "step": 305 }, { "entropy": 7.644754314422608, "epoch": 0.36257309941520466, "grad_norm": 1.375, "learning_rate": 0.00015450000000000001, "loss": 7.4967, "mean_token_accuracy": 0.13192886114120483, "num_tokens": 767854.0, "step": 310 }, { "entropy": 7.757552576065064, "epoch": 0.3684210526315789, "grad_norm": 1.03125, "learning_rate": 0.000157, "loss": 7.4794, "mean_token_accuracy": 0.13279144391417502, "num_tokens": 779969.0, "step": 315 }, { "entropy": 7.734856033325196, "epoch": 0.3742690058479532, "grad_norm": 1.0078125, "learning_rate": 0.0001595, "loss": 7.5177, "mean_token_accuracy": 0.12462197691202163, "num_tokens": 792544.0, "step": 320 }, { "entropy": 7.747901725769043, "epoch": 0.38011695906432746, "grad_norm": 1.0703125, "learning_rate": 0.000162, "loss": 7.5284, "mean_token_accuracy": 0.1278999462723732, "num_tokens": 804603.0, "step": 325 }, { "entropy": 7.6661285877227785, "epoch": 0.38596491228070173, "grad_norm": 1.3203125, "learning_rate": 0.00016450000000000001, "loss": 7.4698, "mean_token_accuracy": 0.1412305675446987, "num_tokens": 816006.0, "step": 330 }, { "entropy": 7.718921327590943, "epoch": 0.391812865497076, "grad_norm": 1.078125, "learning_rate": 0.00016700000000000002, "loss": 7.4472, "mean_token_accuracy": 0.13868665173649788, "num_tokens": 828003.0, "step": 335 }, { "entropy": 7.650281476974487, "epoch": 0.39766081871345027, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 7.5019, "mean_token_accuracy": 0.13453598469495773, "num_tokens": 840649.0, "step": 340 }, { "entropy": 7.828660154342652, "epoch": 0.40350877192982454, "grad_norm": 1.234375, "learning_rate": 0.00017199999999999998, "loss": 7.5351, "mean_token_accuracy": 0.12318970710039139, "num_tokens": 853736.0, "step": 345 }, { "entropy": 7.61459264755249, "epoch": 0.4093567251461988, "grad_norm": 1.1953125, "learning_rate": 0.00017449999999999999, "loss": 7.5521, "mean_token_accuracy": 0.1260755755007267, "num_tokens": 866346.0, "step": 350 }, { "entropy": 7.783421611785888, "epoch": 0.4152046783625731, "grad_norm": 1.0546875, "learning_rate": 0.000177, "loss": 7.4784, "mean_token_accuracy": 0.12796891778707503, "num_tokens": 879163.0, "step": 355 }, { "entropy": 7.739914035797119, "epoch": 0.42105263157894735, "grad_norm": 1.1875, "learning_rate": 0.0001795, "loss": 7.5281, "mean_token_accuracy": 0.1271045207977295, "num_tokens": 891452.0, "step": 360 }, { "entropy": 7.692205429077148, "epoch": 0.4269005847953216, "grad_norm": 1.390625, "learning_rate": 0.000182, "loss": 7.5409, "mean_token_accuracy": 0.13060612305998803, "num_tokens": 903351.0, "step": 365 }, { "entropy": 7.750999116897583, "epoch": 0.4327485380116959, "grad_norm": 1.203125, "learning_rate": 0.0001845, "loss": 7.4841, "mean_token_accuracy": 0.1305551879107952, "num_tokens": 914818.0, "step": 370 }, { "entropy": 7.551722192764283, "epoch": 0.43859649122807015, "grad_norm": 1.1484375, "learning_rate": 0.000187, "loss": 7.3844, "mean_token_accuracy": 0.14969016388058662, "num_tokens": 927337.0, "step": 375 }, { "entropy": 7.822294139862061, "epoch": 0.4444444444444444, "grad_norm": 1.1640625, "learning_rate": 0.0001895, "loss": 7.5932, "mean_token_accuracy": 0.1261659525334835, "num_tokens": 940058.0, "step": 380 }, { "entropy": 7.664493227005005, "epoch": 0.4502923976608187, "grad_norm": 1.390625, "learning_rate": 0.000192, "loss": 7.3961, "mean_token_accuracy": 0.13526701480150222, "num_tokens": 952820.0, "step": 385 }, { "entropy": 7.564838886260986, "epoch": 0.45614035087719296, "grad_norm": 1.328125, "learning_rate": 0.0001945, "loss": 7.4493, "mean_token_accuracy": 0.13812072202563286, "num_tokens": 965132.0, "step": 390 }, { "entropy": 7.727004194259644, "epoch": 0.4619883040935672, "grad_norm": 1.0703125, "learning_rate": 0.00019700000000000002, "loss": 7.4848, "mean_token_accuracy": 0.1320212572813034, "num_tokens": 978695.0, "step": 395 }, { "entropy": 7.706100749969482, "epoch": 0.4678362573099415, "grad_norm": 1.3046875, "learning_rate": 0.00019950000000000002, "loss": 7.4478, "mean_token_accuracy": 0.13389745727181435, "num_tokens": 992427.0, "step": 400 }, { "entropy": 7.581472444534302, "epoch": 0.47368421052631576, "grad_norm": 1.2109375, "learning_rate": 0.000202, "loss": 7.4625, "mean_token_accuracy": 0.13692987337708473, "num_tokens": 1005090.0, "step": 405 }, { "entropy": 7.768648767471314, "epoch": 0.47953216374269003, "grad_norm": 1.21875, "learning_rate": 0.00020449999999999998, "loss": 7.4654, "mean_token_accuracy": 0.13497180566191674, "num_tokens": 1017219.0, "step": 410 }, { "entropy": 7.577150154113769, "epoch": 0.4853801169590643, "grad_norm": 1.109375, "learning_rate": 0.000207, "loss": 7.5118, "mean_token_accuracy": 0.12923638001084328, "num_tokens": 1029576.0, "step": 415 }, { "entropy": 7.703565454483032, "epoch": 0.49122807017543857, "grad_norm": 1.25, "learning_rate": 0.0002095, "loss": 7.5447, "mean_token_accuracy": 0.12888929918408393, "num_tokens": 1042259.0, "step": 420 }, { "entropy": 7.760423231124878, "epoch": 0.49707602339181284, "grad_norm": 1.2109375, "learning_rate": 0.000212, "loss": 7.4665, "mean_token_accuracy": 0.12709181681275367, "num_tokens": 1054965.0, "step": 425 }, { "entropy": 7.540304946899414, "epoch": 0.5029239766081871, "grad_norm": 1.171875, "learning_rate": 0.0002145, "loss": 7.4192, "mean_token_accuracy": 0.13073362559080123, "num_tokens": 1067346.0, "step": 430 }, { "entropy": 7.69997730255127, "epoch": 0.5087719298245614, "grad_norm": 1.1171875, "learning_rate": 0.00021700000000000002, "loss": 7.4084, "mean_token_accuracy": 0.12967713326215743, "num_tokens": 1080366.0, "step": 435 }, { "entropy": 7.659937810897827, "epoch": 0.5146198830409356, "grad_norm": 1.140625, "learning_rate": 0.0002195, "loss": 7.3841, "mean_token_accuracy": 0.1347927011549473, "num_tokens": 1091904.0, "step": 440 }, { "entropy": 7.573716306686402, "epoch": 0.52046783625731, "grad_norm": 1.2109375, "learning_rate": 0.000222, "loss": 7.3977, "mean_token_accuracy": 0.13465345576405524, "num_tokens": 1103363.0, "step": 445 }, { "entropy": 7.556374645233154, "epoch": 0.5263157894736842, "grad_norm": 1.1171875, "learning_rate": 0.0002245, "loss": 7.4271, "mean_token_accuracy": 0.1363191269338131, "num_tokens": 1115178.0, "step": 450 }, { "entropy": 7.6787323474884035, "epoch": 0.5321637426900585, "grad_norm": 1.3125, "learning_rate": 0.00022700000000000002, "loss": 7.364, "mean_token_accuracy": 0.13259132504463195, "num_tokens": 1128276.0, "step": 455 }, { "entropy": 7.688528728485108, "epoch": 0.5380116959064327, "grad_norm": 1.2421875, "learning_rate": 0.00022950000000000002, "loss": 7.4907, "mean_token_accuracy": 0.13230301365256308, "num_tokens": 1142100.0, "step": 460 }, { "entropy": 7.469075775146484, "epoch": 0.543859649122807, "grad_norm": 1.234375, "learning_rate": 0.00023200000000000003, "loss": 7.4026, "mean_token_accuracy": 0.13583226278424262, "num_tokens": 1154928.0, "step": 465 }, { "entropy": 7.702433824539185, "epoch": 0.5497076023391813, "grad_norm": 1.328125, "learning_rate": 0.00023449999999999998, "loss": 7.4994, "mean_token_accuracy": 0.1225062869489193, "num_tokens": 1166937.0, "step": 470 }, { "entropy": 7.537669372558594, "epoch": 0.5555555555555556, "grad_norm": 1.2578125, "learning_rate": 0.000237, "loss": 7.4175, "mean_token_accuracy": 0.1342865504324436, "num_tokens": 1180008.0, "step": 475 }, { "entropy": 7.674032211303711, "epoch": 0.5614035087719298, "grad_norm": 1.2578125, "learning_rate": 0.0002395, "loss": 7.4255, "mean_token_accuracy": 0.12588841170072557, "num_tokens": 1191926.0, "step": 480 }, { "entropy": 7.737406444549561, "epoch": 0.5672514619883041, "grad_norm": 1.0625, "learning_rate": 0.000242, "loss": 7.4953, "mean_token_accuracy": 0.12321070730686187, "num_tokens": 1204904.0, "step": 485 }, { "entropy": 7.525170803070068, "epoch": 0.5730994152046783, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 7.3645, "mean_token_accuracy": 0.13284065276384355, "num_tokens": 1217006.0, "step": 490 }, { "entropy": 7.552954483032226, "epoch": 0.5789473684210527, "grad_norm": 1.21875, "learning_rate": 0.000247, "loss": 7.3799, "mean_token_accuracy": 0.13598829582333566, "num_tokens": 1228460.0, "step": 495 }, { "entropy": 7.607265853881836, "epoch": 0.5847953216374269, "grad_norm": 1.1796875, "learning_rate": 0.0002495, "loss": 7.4021, "mean_token_accuracy": 0.1343585431575775, "num_tokens": 1240891.0, "step": 500 }, { "epoch": 0.5847953216374269, "eval_entropy": 7.373745485041345, "eval_loss": 7.422036647796631, "eval_mean_token_accuracy": 0.12701122225660577, "eval_num_tokens": 1240891.0, "eval_runtime": 2.2961, "eval_samples_per_second": 1178.964, "eval_steps_per_second": 147.643, "step": 500 } ], "logging_steps": 5, "max_steps": 8540, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1778933311488000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }