{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.1695906432748537, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.593726110458374, "epoch": 0.005847953216374269, "grad_norm": 1.2734375, "learning_rate": 2e-06, "loss": 7.6031, "mean_token_accuracy": 0.13570500910282135, "num_tokens": 12656.0, "step": 5 }, { "entropy": 7.586997556686401, "epoch": 0.011695906432748537, "grad_norm": 1.1796875, "learning_rate": 4.5e-06, "loss": 7.6652, "mean_token_accuracy": 0.12274946123361588, "num_tokens": 25207.0, "step": 10 }, { "entropy": 7.649361896514892, "epoch": 0.017543859649122806, "grad_norm": 1.0703125, "learning_rate": 7e-06, "loss": 7.673, "mean_token_accuracy": 0.12404287382960319, "num_tokens": 38096.0, "step": 15 }, { "entropy": 7.637357187271118, "epoch": 0.023391812865497075, "grad_norm": 1.1015625, "learning_rate": 9.5e-06, "loss": 7.7506, "mean_token_accuracy": 0.12453248649835587, "num_tokens": 50626.0, "step": 20 }, { "entropy": 7.673450565338134, "epoch": 0.029239766081871343, "grad_norm": 1.0234375, "learning_rate": 1.2e-05, "loss": 7.6825, "mean_token_accuracy": 0.12940182387828827, "num_tokens": 63448.0, "step": 25 }, { "entropy": 7.774927949905395, "epoch": 0.03508771929824561, "grad_norm": 1.1015625, "learning_rate": 1.4500000000000002e-05, "loss": 7.731, "mean_token_accuracy": 0.12124454602599144, "num_tokens": 75656.0, "step": 30 }, { "entropy": 7.754840278625489, "epoch": 0.04093567251461988, "grad_norm": 1.0625, "learning_rate": 1.7000000000000003e-05, "loss": 7.7155, "mean_token_accuracy": 0.12517715990543365, "num_tokens": 88756.0, "step": 35 }, { "entropy": 7.778929853439331, "epoch": 0.04678362573099415, "grad_norm": 0.96484375, "learning_rate": 1.95e-05, "loss": 7.6499, "mean_token_accuracy": 0.12550911605358123, "num_tokens": 100934.0, "step": 40 }, { "entropy": 7.761408805847168, "epoch": 0.05263157894736842, "grad_norm": 1.1015625, "learning_rate": 2.2e-05, "loss": 7.6072, "mean_token_accuracy": 0.12898701280355454, "num_tokens": 112212.0, "step": 45 }, { "entropy": 7.740135717391968, "epoch": 0.05847953216374269, "grad_norm": 0.99609375, "learning_rate": 2.4500000000000003e-05, "loss": 7.6067, "mean_token_accuracy": 0.12694446071982385, "num_tokens": 126314.0, "step": 50 }, { "entropy": 7.718768978118897, "epoch": 0.06432748538011696, "grad_norm": 1.1015625, "learning_rate": 2.7e-05, "loss": 7.652, "mean_token_accuracy": 0.13094937354326247, "num_tokens": 138416.0, "step": 55 }, { "entropy": 7.7235801219940186, "epoch": 0.07017543859649122, "grad_norm": 1.0078125, "learning_rate": 2.95e-05, "loss": 7.6356, "mean_token_accuracy": 0.12992877885699272, "num_tokens": 149903.0, "step": 60 }, { "entropy": 7.728446578979492, "epoch": 0.07602339181286549, "grad_norm": 0.8515625, "learning_rate": 3.2e-05, "loss": 7.616, "mean_token_accuracy": 0.13435307145118713, "num_tokens": 163516.0, "step": 65 }, { "entropy": 7.745584630966187, "epoch": 0.08187134502923976, "grad_norm": 0.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 7.6154, "mean_token_accuracy": 0.12847506403923034, "num_tokens": 176024.0, "step": 70 }, { "entropy": 7.79000825881958, "epoch": 0.08771929824561403, "grad_norm": 0.95703125, "learning_rate": 3.7e-05, "loss": 7.6904, "mean_token_accuracy": 0.12912894561886787, "num_tokens": 189337.0, "step": 75 }, { "entropy": 7.840251207351685, "epoch": 0.0935672514619883, "grad_norm": 1.0625, "learning_rate": 3.95e-05, "loss": 7.632, "mean_token_accuracy": 0.1310859203338623, "num_tokens": 201752.0, "step": 80 }, { "entropy": 7.792728662490845, "epoch": 0.09941520467836257, "grad_norm": 1.0546875, "learning_rate": 4.2000000000000004e-05, "loss": 7.7007, "mean_token_accuracy": 0.1200527586042881, "num_tokens": 214676.0, "step": 85 }, { "entropy": 7.769255495071411, "epoch": 0.10526315789473684, "grad_norm": 1.015625, "learning_rate": 4.45e-05, "loss": 7.6036, "mean_token_accuracy": 0.1250310204923153, "num_tokens": 225474.0, "step": 90 }, { "entropy": 7.832526683807373, "epoch": 0.1111111111111111, "grad_norm": 1.0859375, "learning_rate": 4.7000000000000004e-05, "loss": 7.6196, "mean_token_accuracy": 0.13330849632620811, "num_tokens": 237345.0, "step": 95 }, { "entropy": 7.786408853530884, "epoch": 0.11695906432748537, "grad_norm": 1.0078125, "learning_rate": 4.9500000000000004e-05, "loss": 7.5976, "mean_token_accuracy": 0.13106755986809732, "num_tokens": 249633.0, "step": 100 }, { "entropy": 7.785315036773682, "epoch": 0.12280701754385964, "grad_norm": 1.0546875, "learning_rate": 5.2e-05, "loss": 7.5707, "mean_token_accuracy": 0.12854716926813126, "num_tokens": 261840.0, "step": 105 }, { "entropy": 7.7381500720977785, "epoch": 0.1286549707602339, "grad_norm": 1.0234375, "learning_rate": 5.45e-05, "loss": 7.6581, "mean_token_accuracy": 0.12695110440254212, "num_tokens": 273838.0, "step": 110 }, { "entropy": 7.7819578647613525, "epoch": 0.13450292397660818, "grad_norm": 1.0, "learning_rate": 5.7e-05, "loss": 7.6314, "mean_token_accuracy": 0.12518885657191275, "num_tokens": 286001.0, "step": 115 }, { "entropy": 7.892224454879761, "epoch": 0.14035087719298245, "grad_norm": 1.1171875, "learning_rate": 5.9499999999999996e-05, "loss": 7.5622, "mean_token_accuracy": 0.1403429314494133, "num_tokens": 299052.0, "step": 120 }, { "entropy": 7.751383972167969, "epoch": 0.14619883040935672, "grad_norm": 1.1640625, "learning_rate": 6.2e-05, "loss": 7.6007, "mean_token_accuracy": 0.12698042243719102, "num_tokens": 311803.0, "step": 125 }, { "entropy": 7.862428855895996, "epoch": 0.15204678362573099, "grad_norm": 1.0703125, "learning_rate": 6.450000000000001e-05, "loss": 7.6155, "mean_token_accuracy": 0.1285979501903057, "num_tokens": 323712.0, "step": 130 }, { "entropy": 7.733092164993286, "epoch": 0.15789473684210525, "grad_norm": 1.03125, "learning_rate": 6.7e-05, "loss": 7.5735, "mean_token_accuracy": 0.1340746872127056, "num_tokens": 335171.0, "step": 135 }, { "entropy": 7.840703058242798, "epoch": 0.16374269005847952, "grad_norm": 1.1015625, "learning_rate": 6.950000000000001e-05, "loss": 7.6469, "mean_token_accuracy": 0.12687307894229888, "num_tokens": 347185.0, "step": 140 }, { "entropy": 7.806375932693482, "epoch": 0.1695906432748538, "grad_norm": 1.796875, "learning_rate": 7.2e-05, "loss": 7.5806, "mean_token_accuracy": 0.12792280316352844, "num_tokens": 359695.0, "step": 145 }, { "entropy": 7.806016826629639, "epoch": 0.17543859649122806, "grad_norm": 1.0625, "learning_rate": 7.45e-05, "loss": 7.6646, "mean_token_accuracy": 0.13149451091885567, "num_tokens": 373805.0, "step": 150 }, { "entropy": 7.811039972305298, "epoch": 0.18128654970760233, "grad_norm": 1.203125, "learning_rate": 7.7e-05, "loss": 7.615, "mean_token_accuracy": 0.13272017240524292, "num_tokens": 385772.0, "step": 155 }, { "entropy": 7.7556663990020756, "epoch": 0.1871345029239766, "grad_norm": 0.98828125, "learning_rate": 7.950000000000001e-05, "loss": 7.5329, "mean_token_accuracy": 0.13663637787103652, "num_tokens": 397641.0, "step": 160 }, { "entropy": 7.7673561573028564, "epoch": 0.19298245614035087, "grad_norm": 1.03125, "learning_rate": 8.2e-05, "loss": 7.5761, "mean_token_accuracy": 0.13438102826476098, "num_tokens": 410241.0, "step": 165 }, { "entropy": 7.851863145828247, "epoch": 0.19883040935672514, "grad_norm": 1.0, "learning_rate": 8.450000000000001e-05, "loss": 7.5371, "mean_token_accuracy": 0.12968598157167435, "num_tokens": 422079.0, "step": 170 }, { "entropy": 7.722187614440918, "epoch": 0.2046783625730994, "grad_norm": 1.046875, "learning_rate": 8.7e-05, "loss": 7.6151, "mean_token_accuracy": 0.12510994151234628, "num_tokens": 435187.0, "step": 175 }, { "entropy": 7.802532577514649, "epoch": 0.21052631578947367, "grad_norm": 1.0078125, "learning_rate": 8.95e-05, "loss": 7.59, "mean_token_accuracy": 0.12483937367796898, "num_tokens": 447329.0, "step": 180 }, { "entropy": 7.7081256866455075, "epoch": 0.21637426900584794, "grad_norm": 1.1015625, "learning_rate": 9.2e-05, "loss": 7.5244, "mean_token_accuracy": 0.13455075845122338, "num_tokens": 459316.0, "step": 185 }, { "entropy": 7.866452074050903, "epoch": 0.2222222222222222, "grad_norm": 1.2421875, "learning_rate": 9.45e-05, "loss": 7.602, "mean_token_accuracy": 0.13409386128187178, "num_tokens": 471184.0, "step": 190 }, { "entropy": 7.7785547256469725, "epoch": 0.22807017543859648, "grad_norm": 1.015625, "learning_rate": 9.7e-05, "loss": 7.5964, "mean_token_accuracy": 0.13105484768748282, "num_tokens": 483988.0, "step": 195 }, { "entropy": 7.754951095581054, "epoch": 0.23391812865497075, "grad_norm": 1.0390625, "learning_rate": 9.95e-05, "loss": 7.6021, "mean_token_accuracy": 0.12733055427670478, "num_tokens": 495995.0, "step": 200 }, { "entropy": 7.760473966598511, "epoch": 0.23976608187134502, "grad_norm": 1.015625, "learning_rate": 0.000102, "loss": 7.5481, "mean_token_accuracy": 0.13547581657767296, "num_tokens": 507382.0, "step": 205 }, { "entropy": 7.720216274261475, "epoch": 0.24561403508771928, "grad_norm": 1.1875, "learning_rate": 0.00010449999999999999, "loss": 7.5492, "mean_token_accuracy": 0.1361517131328583, "num_tokens": 518748.0, "step": 210 }, { "entropy": 7.7840687274932865, "epoch": 0.25146198830409355, "grad_norm": 1.0390625, "learning_rate": 0.000107, "loss": 7.5697, "mean_token_accuracy": 0.12845324501395225, "num_tokens": 531571.0, "step": 215 }, { "entropy": 7.810080337524414, "epoch": 0.2573099415204678, "grad_norm": 0.99609375, "learning_rate": 0.0001095, "loss": 7.5872, "mean_token_accuracy": 0.1274337127804756, "num_tokens": 544699.0, "step": 220 }, { "entropy": 7.742982816696167, "epoch": 0.2631578947368421, "grad_norm": 1.0703125, "learning_rate": 0.000112, "loss": 7.5439, "mean_token_accuracy": 0.13237009420990944, "num_tokens": 558110.0, "step": 225 }, { "entropy": 7.847256898880005, "epoch": 0.26900584795321636, "grad_norm": 1.0625, "learning_rate": 0.0001145, "loss": 7.6277, "mean_token_accuracy": 0.12315782383084298, "num_tokens": 571566.0, "step": 230 }, { "entropy": 7.752783679962159, "epoch": 0.27485380116959063, "grad_norm": 1.3125, "learning_rate": 0.00011700000000000001, "loss": 7.5427, "mean_token_accuracy": 0.130996935069561, "num_tokens": 583149.0, "step": 235 }, { "entropy": 7.764012479782105, "epoch": 0.2807017543859649, "grad_norm": 1.203125, "learning_rate": 0.00011949999999999999, "loss": 7.5734, "mean_token_accuracy": 0.1311168886721134, "num_tokens": 596360.0, "step": 240 }, { "entropy": 7.776003646850586, "epoch": 0.28654970760233917, "grad_norm": 1.0390625, "learning_rate": 0.000122, "loss": 7.57, "mean_token_accuracy": 0.12710137963294982, "num_tokens": 607719.0, "step": 245 }, { "entropy": 7.803481483459473, "epoch": 0.29239766081871343, "grad_norm": 1.1796875, "learning_rate": 0.0001245, "loss": 7.5331, "mean_token_accuracy": 0.13498716056346893, "num_tokens": 619002.0, "step": 250 }, { "entropy": 7.713655710220337, "epoch": 0.2982456140350877, "grad_norm": 1.1484375, "learning_rate": 0.000127, "loss": 7.5076, "mean_token_accuracy": 0.13216801062226297, "num_tokens": 631437.0, "step": 255 }, { "entropy": 7.640055465698242, "epoch": 0.30409356725146197, "grad_norm": 1.1875, "learning_rate": 0.0001295, "loss": 7.5087, "mean_token_accuracy": 0.13282301425933837, "num_tokens": 642611.0, "step": 260 }, { "entropy": 7.83185043334961, "epoch": 0.30994152046783624, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 7.5447, "mean_token_accuracy": 0.1268044739961624, "num_tokens": 654874.0, "step": 265 }, { "entropy": 7.68661732673645, "epoch": 0.3157894736842105, "grad_norm": 1.109375, "learning_rate": 0.00013450000000000002, "loss": 7.629, "mean_token_accuracy": 0.1293095037341118, "num_tokens": 669141.0, "step": 270 }, { "entropy": 7.781434631347656, "epoch": 0.3216374269005848, "grad_norm": 1.28125, "learning_rate": 0.00013700000000000002, "loss": 7.5456, "mean_token_accuracy": 0.13286237716674804, "num_tokens": 681192.0, "step": 275 }, { "entropy": 7.814055967330932, "epoch": 0.32748538011695905, "grad_norm": 1.171875, "learning_rate": 0.0001395, "loss": 7.5423, "mean_token_accuracy": 0.13368416726589202, "num_tokens": 693191.0, "step": 280 }, { "entropy": 7.664337110519409, "epoch": 0.3333333333333333, "grad_norm": 1.2578125, "learning_rate": 0.00014199999999999998, "loss": 7.5257, "mean_token_accuracy": 0.1304435022175312, "num_tokens": 705131.0, "step": 285 }, { "entropy": 7.808525848388672, "epoch": 0.3391812865497076, "grad_norm": 1.1015625, "learning_rate": 0.0001445, "loss": 7.5226, "mean_token_accuracy": 0.1330956645309925, "num_tokens": 717873.0, "step": 290 }, { "entropy": 7.779027700424194, "epoch": 0.34502923976608185, "grad_norm": 1.1171875, "learning_rate": 0.000147, "loss": 7.5753, "mean_token_accuracy": 0.12839027419686316, "num_tokens": 730527.0, "step": 295 }, { "entropy": 7.754869270324707, "epoch": 0.3508771929824561, "grad_norm": 1.09375, "learning_rate": 0.0001495, "loss": 7.6158, "mean_token_accuracy": 0.1226100891828537, "num_tokens": 743263.0, "step": 300 }, { "entropy": 7.853420972824097, "epoch": 0.3567251461988304, "grad_norm": 1.1640625, "learning_rate": 0.000152, "loss": 7.6122, "mean_token_accuracy": 0.12751553878188132, "num_tokens": 755422.0, "step": 305 }, { "entropy": 7.644754314422608, "epoch": 0.36257309941520466, "grad_norm": 1.375, "learning_rate": 0.00015450000000000001, "loss": 7.4967, "mean_token_accuracy": 0.13192886114120483, "num_tokens": 767854.0, "step": 310 }, { "entropy": 7.757552576065064, "epoch": 0.3684210526315789, "grad_norm": 1.03125, "learning_rate": 0.000157, "loss": 7.4794, "mean_token_accuracy": 0.13279144391417502, "num_tokens": 779969.0, "step": 315 }, { "entropy": 7.734856033325196, "epoch": 0.3742690058479532, "grad_norm": 1.0078125, "learning_rate": 0.0001595, "loss": 7.5177, "mean_token_accuracy": 0.12462197691202163, "num_tokens": 792544.0, "step": 320 }, { "entropy": 7.747901725769043, "epoch": 0.38011695906432746, "grad_norm": 1.0703125, "learning_rate": 0.000162, "loss": 7.5284, "mean_token_accuracy": 0.1278999462723732, "num_tokens": 804603.0, "step": 325 }, { "entropy": 7.6661285877227785, "epoch": 0.38596491228070173, "grad_norm": 1.3203125, "learning_rate": 0.00016450000000000001, "loss": 7.4698, "mean_token_accuracy": 0.1412305675446987, "num_tokens": 816006.0, "step": 330 }, { "entropy": 7.718921327590943, "epoch": 0.391812865497076, "grad_norm": 1.078125, "learning_rate": 0.00016700000000000002, "loss": 7.4472, "mean_token_accuracy": 0.13868665173649788, "num_tokens": 828003.0, "step": 335 }, { "entropy": 7.650281476974487, "epoch": 0.39766081871345027, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 7.5019, "mean_token_accuracy": 0.13453598469495773, "num_tokens": 840649.0, "step": 340 }, { "entropy": 7.828660154342652, "epoch": 0.40350877192982454, "grad_norm": 1.234375, "learning_rate": 0.00017199999999999998, "loss": 7.5351, "mean_token_accuracy": 0.12318970710039139, "num_tokens": 853736.0, "step": 345 }, { "entropy": 7.61459264755249, "epoch": 0.4093567251461988, "grad_norm": 1.1953125, "learning_rate": 0.00017449999999999999, "loss": 7.5521, "mean_token_accuracy": 0.1260755755007267, "num_tokens": 866346.0, "step": 350 }, { "entropy": 7.783421611785888, "epoch": 0.4152046783625731, "grad_norm": 1.0546875, "learning_rate": 0.000177, "loss": 7.4784, "mean_token_accuracy": 0.12796891778707503, "num_tokens": 879163.0, "step": 355 }, { "entropy": 7.739914035797119, "epoch": 0.42105263157894735, "grad_norm": 1.1875, "learning_rate": 0.0001795, "loss": 7.5281, "mean_token_accuracy": 0.1271045207977295, "num_tokens": 891452.0, "step": 360 }, { "entropy": 7.692205429077148, "epoch": 0.4269005847953216, "grad_norm": 1.390625, "learning_rate": 0.000182, "loss": 7.5409, "mean_token_accuracy": 0.13060612305998803, "num_tokens": 903351.0, "step": 365 }, { "entropy": 7.750999116897583, "epoch": 0.4327485380116959, "grad_norm": 1.203125, "learning_rate": 0.0001845, "loss": 7.4841, "mean_token_accuracy": 0.1305551879107952, "num_tokens": 914818.0, "step": 370 }, { "entropy": 7.551722192764283, "epoch": 0.43859649122807015, "grad_norm": 1.1484375, "learning_rate": 0.000187, "loss": 7.3844, "mean_token_accuracy": 0.14969016388058662, "num_tokens": 927337.0, "step": 375 }, { "entropy": 7.822294139862061, "epoch": 0.4444444444444444, "grad_norm": 1.1640625, "learning_rate": 0.0001895, "loss": 7.5932, "mean_token_accuracy": 0.1261659525334835, "num_tokens": 940058.0, "step": 380 }, { "entropy": 7.664493227005005, "epoch": 0.4502923976608187, "grad_norm": 1.390625, "learning_rate": 0.000192, "loss": 7.3961, "mean_token_accuracy": 0.13526701480150222, "num_tokens": 952820.0, "step": 385 }, { "entropy": 7.564838886260986, "epoch": 0.45614035087719296, "grad_norm": 1.328125, "learning_rate": 0.0001945, "loss": 7.4493, "mean_token_accuracy": 0.13812072202563286, "num_tokens": 965132.0, "step": 390 }, { "entropy": 7.727004194259644, "epoch": 0.4619883040935672, "grad_norm": 1.0703125, "learning_rate": 0.00019700000000000002, "loss": 7.4848, "mean_token_accuracy": 0.1320212572813034, "num_tokens": 978695.0, "step": 395 }, { "entropy": 7.706100749969482, "epoch": 0.4678362573099415, "grad_norm": 1.3046875, "learning_rate": 0.00019950000000000002, "loss": 7.4478, "mean_token_accuracy": 0.13389745727181435, "num_tokens": 992427.0, "step": 400 }, { "entropy": 7.581472444534302, "epoch": 0.47368421052631576, "grad_norm": 1.2109375, "learning_rate": 0.000202, "loss": 7.4625, "mean_token_accuracy": 0.13692987337708473, "num_tokens": 1005090.0, "step": 405 }, { "entropy": 7.768648767471314, "epoch": 0.47953216374269003, "grad_norm": 1.21875, "learning_rate": 0.00020449999999999998, "loss": 7.4654, "mean_token_accuracy": 0.13497180566191674, "num_tokens": 1017219.0, "step": 410 }, { "entropy": 7.577150154113769, "epoch": 0.4853801169590643, "grad_norm": 1.109375, "learning_rate": 0.000207, "loss": 7.5118, "mean_token_accuracy": 0.12923638001084328, "num_tokens": 1029576.0, "step": 415 }, { "entropy": 7.703565454483032, "epoch": 0.49122807017543857, "grad_norm": 1.25, "learning_rate": 0.0002095, "loss": 7.5447, "mean_token_accuracy": 0.12888929918408393, "num_tokens": 1042259.0, "step": 420 }, { "entropy": 7.760423231124878, "epoch": 0.49707602339181284, "grad_norm": 1.2109375, "learning_rate": 0.000212, "loss": 7.4665, "mean_token_accuracy": 0.12709181681275367, "num_tokens": 1054965.0, "step": 425 }, { "entropy": 7.540304946899414, "epoch": 0.5029239766081871, "grad_norm": 1.171875, "learning_rate": 0.0002145, "loss": 7.4192, "mean_token_accuracy": 0.13073362559080123, "num_tokens": 1067346.0, "step": 430 }, { "entropy": 7.69997730255127, "epoch": 0.5087719298245614, "grad_norm": 1.1171875, "learning_rate": 0.00021700000000000002, "loss": 7.4084, "mean_token_accuracy": 0.12967713326215743, "num_tokens": 1080366.0, "step": 435 }, { "entropy": 7.659937810897827, "epoch": 0.5146198830409356, "grad_norm": 1.140625, "learning_rate": 0.0002195, "loss": 7.3841, "mean_token_accuracy": 0.1347927011549473, "num_tokens": 1091904.0, "step": 440 }, { "entropy": 7.573716306686402, "epoch": 0.52046783625731, "grad_norm": 1.2109375, "learning_rate": 0.000222, "loss": 7.3977, "mean_token_accuracy": 0.13465345576405524, "num_tokens": 1103363.0, "step": 445 }, { "entropy": 7.556374645233154, "epoch": 0.5263157894736842, "grad_norm": 1.1171875, "learning_rate": 0.0002245, "loss": 7.4271, "mean_token_accuracy": 0.1363191269338131, "num_tokens": 1115178.0, "step": 450 }, { "entropy": 7.6787323474884035, "epoch": 0.5321637426900585, "grad_norm": 1.3125, "learning_rate": 0.00022700000000000002, "loss": 7.364, "mean_token_accuracy": 0.13259132504463195, "num_tokens": 1128276.0, "step": 455 }, { "entropy": 7.688528728485108, "epoch": 0.5380116959064327, "grad_norm": 1.2421875, "learning_rate": 0.00022950000000000002, "loss": 7.4907, "mean_token_accuracy": 0.13230301365256308, "num_tokens": 1142100.0, "step": 460 }, { "entropy": 7.469075775146484, "epoch": 0.543859649122807, "grad_norm": 1.234375, "learning_rate": 0.00023200000000000003, "loss": 7.4026, "mean_token_accuracy": 0.13583226278424262, "num_tokens": 1154928.0, "step": 465 }, { "entropy": 7.702433824539185, "epoch": 0.5497076023391813, "grad_norm": 1.328125, "learning_rate": 0.00023449999999999998, "loss": 7.4994, "mean_token_accuracy": 0.1225062869489193, "num_tokens": 1166937.0, "step": 470 }, { "entropy": 7.537669372558594, "epoch": 0.5555555555555556, "grad_norm": 1.2578125, "learning_rate": 0.000237, "loss": 7.4175, "mean_token_accuracy": 0.1342865504324436, "num_tokens": 1180008.0, "step": 475 }, { "entropy": 7.674032211303711, "epoch": 0.5614035087719298, "grad_norm": 1.2578125, "learning_rate": 0.0002395, "loss": 7.4255, "mean_token_accuracy": 0.12588841170072557, "num_tokens": 1191926.0, "step": 480 }, { "entropy": 7.737406444549561, "epoch": 0.5672514619883041, "grad_norm": 1.0625, "learning_rate": 0.000242, "loss": 7.4953, "mean_token_accuracy": 0.12321070730686187, "num_tokens": 1204904.0, "step": 485 }, { "entropy": 7.525170803070068, "epoch": 0.5730994152046783, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 7.3645, "mean_token_accuracy": 0.13284065276384355, "num_tokens": 1217006.0, "step": 490 }, { "entropy": 7.552954483032226, "epoch": 0.5789473684210527, "grad_norm": 1.21875, "learning_rate": 0.000247, "loss": 7.3799, "mean_token_accuracy": 0.13598829582333566, "num_tokens": 1228460.0, "step": 495 }, { "entropy": 7.607265853881836, "epoch": 0.5847953216374269, "grad_norm": 1.1796875, "learning_rate": 0.0002495, "loss": 7.4021, "mean_token_accuracy": 0.1343585431575775, "num_tokens": 1240891.0, "step": 500 }, { "epoch": 0.5847953216374269, "eval_entropy": 7.373745485041345, "eval_loss": 7.422036647796631, "eval_mean_token_accuracy": 0.12701122225660577, "eval_num_tokens": 1240891.0, "eval_runtime": 2.2961, "eval_samples_per_second": 1178.964, "eval_steps_per_second": 147.643, "step": 500 }, { "entropy": 7.5875434398651125, "epoch": 0.5906432748538012, "grad_norm": 1.234375, "learning_rate": 0.000252, "loss": 7.3656, "mean_token_accuracy": 0.1350531853735447, "num_tokens": 1254385.0, "step": 505 }, { "entropy": 7.6494550704956055, "epoch": 0.5964912280701754, "grad_norm": 1.265625, "learning_rate": 0.0002545, "loss": 7.4191, "mean_token_accuracy": 0.13399955853819848, "num_tokens": 1266809.0, "step": 510 }, { "entropy": 7.640181350708008, "epoch": 0.6023391812865497, "grad_norm": 1.0546875, "learning_rate": 0.000257, "loss": 7.4899, "mean_token_accuracy": 0.12867182418704032, "num_tokens": 1279478.0, "step": 515 }, { "entropy": 7.59810357093811, "epoch": 0.6081871345029239, "grad_norm": 1.0703125, "learning_rate": 0.0002595, "loss": 7.4026, "mean_token_accuracy": 0.13495590910315514, "num_tokens": 1291241.0, "step": 520 }, { "entropy": 7.57518630027771, "epoch": 0.6140350877192983, "grad_norm": 1.1171875, "learning_rate": 0.000262, "loss": 7.3959, "mean_token_accuracy": 0.1318567432463169, "num_tokens": 1303776.0, "step": 525 }, { "entropy": 7.491529178619385, "epoch": 0.6198830409356725, "grad_norm": 1.2109375, "learning_rate": 0.00026450000000000003, "loss": 7.3455, "mean_token_accuracy": 0.13106245100498198, "num_tokens": 1315970.0, "step": 530 }, { "entropy": 7.7029557704925535, "epoch": 0.6257309941520468, "grad_norm": 1.109375, "learning_rate": 0.00026700000000000004, "loss": 7.423, "mean_token_accuracy": 0.12939090728759767, "num_tokens": 1328142.0, "step": 535 }, { "entropy": 7.564161109924316, "epoch": 0.631578947368421, "grad_norm": 1.2109375, "learning_rate": 0.00026950000000000005, "loss": 7.3336, "mean_token_accuracy": 0.13661645874381065, "num_tokens": 1341126.0, "step": 540 }, { "entropy": 7.525344514846802, "epoch": 0.6374269005847953, "grad_norm": 1.109375, "learning_rate": 0.00027200000000000005, "loss": 7.3498, "mean_token_accuracy": 0.13808920085430146, "num_tokens": 1353820.0, "step": 545 }, { "entropy": 7.3739342212677, "epoch": 0.6432748538011696, "grad_norm": 1.203125, "learning_rate": 0.0002745, "loss": 7.3519, "mean_token_accuracy": 0.13071095943450928, "num_tokens": 1365342.0, "step": 550 }, { "entropy": 7.562578582763672, "epoch": 0.6491228070175439, "grad_norm": 1.09375, "learning_rate": 0.000277, "loss": 7.373, "mean_token_accuracy": 0.13720307797193526, "num_tokens": 1377965.0, "step": 555 }, { "entropy": 7.589451599121094, "epoch": 0.6549707602339181, "grad_norm": 1.0703125, "learning_rate": 0.0002795, "loss": 7.4585, "mean_token_accuracy": 0.12641436904668807, "num_tokens": 1391128.0, "step": 560 }, { "entropy": 7.503201961517334, "epoch": 0.6608187134502924, "grad_norm": 1.25, "learning_rate": 0.00028199999999999997, "loss": 7.3229, "mean_token_accuracy": 0.13581799939274788, "num_tokens": 1402866.0, "step": 565 }, { "entropy": 7.522457122802734, "epoch": 0.6666666666666666, "grad_norm": 1.0703125, "learning_rate": 0.0002845, "loss": 7.4011, "mean_token_accuracy": 0.13442004173994065, "num_tokens": 1415314.0, "step": 570 }, { "entropy": 7.550132846832275, "epoch": 0.672514619883041, "grad_norm": 1.25, "learning_rate": 0.000287, "loss": 7.3021, "mean_token_accuracy": 0.13721019327640532, "num_tokens": 1427003.0, "step": 575 }, { "entropy": 7.435861873626709, "epoch": 0.6783625730994152, "grad_norm": 1.65625, "learning_rate": 0.0002895, "loss": 7.2802, "mean_token_accuracy": 0.13575370907783507, "num_tokens": 1438950.0, "step": 580 }, { "entropy": 7.538718414306641, "epoch": 0.6842105263157895, "grad_norm": 1.1328125, "learning_rate": 0.000292, "loss": 7.3822, "mean_token_accuracy": 0.13449773266911508, "num_tokens": 1451640.0, "step": 585 }, { "entropy": 7.539703464508056, "epoch": 0.6900584795321637, "grad_norm": 1.2421875, "learning_rate": 0.0002945, "loss": 7.3901, "mean_token_accuracy": 0.13477873280644417, "num_tokens": 1464282.0, "step": 590 }, { "entropy": 7.420022916793823, "epoch": 0.695906432748538, "grad_norm": 1.0390625, "learning_rate": 0.000297, "loss": 7.3199, "mean_token_accuracy": 0.13606854826211928, "num_tokens": 1476199.0, "step": 595 }, { "entropy": 7.528499126434326, "epoch": 0.7017543859649122, "grad_norm": 1.4140625, "learning_rate": 0.0002995, "loss": 7.3494, "mean_token_accuracy": 0.13913520947098731, "num_tokens": 1488055.0, "step": 600 }, { "entropy": 7.544654035568238, "epoch": 0.7076023391812866, "grad_norm": 1.1328125, "learning_rate": 0.000302, "loss": 7.2989, "mean_token_accuracy": 0.13840262964367867, "num_tokens": 1500764.0, "step": 605 }, { "entropy": 7.431989049911499, "epoch": 0.7134502923976608, "grad_norm": 1.046875, "learning_rate": 0.0003045, "loss": 7.3203, "mean_token_accuracy": 0.13689279779791833, "num_tokens": 1513645.0, "step": 610 }, { "entropy": 7.424747610092163, "epoch": 0.7192982456140351, "grad_norm": 1.0859375, "learning_rate": 0.000307, "loss": 7.2418, "mean_token_accuracy": 0.14617047160863877, "num_tokens": 1528146.0, "step": 615 }, { "entropy": 7.445183849334716, "epoch": 0.7251461988304093, "grad_norm": 1.328125, "learning_rate": 0.0003095, "loss": 7.3038, "mean_token_accuracy": 0.13819727301597595, "num_tokens": 1541336.0, "step": 620 }, { "entropy": 7.532771015167237, "epoch": 0.7309941520467836, "grad_norm": 2.3125, "learning_rate": 0.000312, "loss": 7.3238, "mean_token_accuracy": 0.13210776224732398, "num_tokens": 1554609.0, "step": 625 }, { "entropy": 7.47041335105896, "epoch": 0.7368421052631579, "grad_norm": 1.265625, "learning_rate": 0.0003145, "loss": 7.4036, "mean_token_accuracy": 0.13117921128869056, "num_tokens": 1567520.0, "step": 630 }, { "entropy": 7.4976729393005375, "epoch": 0.7426900584795322, "grad_norm": 1.1015625, "learning_rate": 0.000317, "loss": 7.2851, "mean_token_accuracy": 0.14150782003998758, "num_tokens": 1579783.0, "step": 635 }, { "entropy": 7.376789665222168, "epoch": 0.7485380116959064, "grad_norm": 1.0703125, "learning_rate": 0.0003195, "loss": 7.2247, "mean_token_accuracy": 0.13450378701090812, "num_tokens": 1592830.0, "step": 640 }, { "entropy": 7.538475275039673, "epoch": 0.7543859649122807, "grad_norm": 1.15625, "learning_rate": 0.000322, "loss": 7.4304, "mean_token_accuracy": 0.12484153211116791, "num_tokens": 1605470.0, "step": 645 }, { "entropy": 7.442430639266968, "epoch": 0.7602339181286549, "grad_norm": 1.1015625, "learning_rate": 0.00032450000000000003, "loss": 7.2943, "mean_token_accuracy": 0.13867733925580977, "num_tokens": 1618106.0, "step": 650 }, { "entropy": 7.355888032913208, "epoch": 0.7660818713450293, "grad_norm": 1.125, "learning_rate": 0.00032700000000000003, "loss": 7.3423, "mean_token_accuracy": 0.12944767996668816, "num_tokens": 1632043.0, "step": 655 }, { "entropy": 7.49034104347229, "epoch": 0.7719298245614035, "grad_norm": 1.3046875, "learning_rate": 0.00032950000000000004, "loss": 7.2699, "mean_token_accuracy": 0.1375485248863697, "num_tokens": 1644671.0, "step": 660 }, { "entropy": 7.438511610031128, "epoch": 0.7777777777777778, "grad_norm": 1.2265625, "learning_rate": 0.00033200000000000005, "loss": 7.2571, "mean_token_accuracy": 0.13946201801300048, "num_tokens": 1657000.0, "step": 665 }, { "entropy": 7.363019323348999, "epoch": 0.783625730994152, "grad_norm": 1.0703125, "learning_rate": 0.00033450000000000005, "loss": 7.288, "mean_token_accuracy": 0.1353791870176792, "num_tokens": 1669874.0, "step": 670 }, { "entropy": 7.394830369949341, "epoch": 0.7894736842105263, "grad_norm": 1.1640625, "learning_rate": 0.000337, "loss": 7.3037, "mean_token_accuracy": 0.13502334728837012, "num_tokens": 1681238.0, "step": 675 }, { "entropy": 7.389416217803955, "epoch": 0.7953216374269005, "grad_norm": 1.265625, "learning_rate": 0.0003395, "loss": 7.1837, "mean_token_accuracy": 0.1395817719399929, "num_tokens": 1694887.0, "step": 680 }, { "entropy": 7.460854482650757, "epoch": 0.8011695906432749, "grad_norm": 1.40625, "learning_rate": 0.000342, "loss": 7.3458, "mean_token_accuracy": 0.13248592168092727, "num_tokens": 1706888.0, "step": 685 }, { "entropy": 7.458899688720703, "epoch": 0.8070175438596491, "grad_norm": 1.3125, "learning_rate": 0.00034449999999999997, "loss": 7.3121, "mean_token_accuracy": 0.13233812376856804, "num_tokens": 1718681.0, "step": 690 }, { "entropy": 7.411834287643432, "epoch": 0.8128654970760234, "grad_norm": 1.2421875, "learning_rate": 0.000347, "loss": 7.3076, "mean_token_accuracy": 0.13430518060922622, "num_tokens": 1732073.0, "step": 695 }, { "entropy": 7.387229108810425, "epoch": 0.8187134502923976, "grad_norm": 1.2265625, "learning_rate": 0.0003495, "loss": 7.2038, "mean_token_accuracy": 0.13365850895643233, "num_tokens": 1744176.0, "step": 700 }, { "entropy": 7.384578371047974, "epoch": 0.8245614035087719, "grad_norm": 0.9765625, "learning_rate": 0.000352, "loss": 7.2441, "mean_token_accuracy": 0.1429324761033058, "num_tokens": 1757138.0, "step": 705 }, { "entropy": 7.342513751983643, "epoch": 0.8304093567251462, "grad_norm": 1.09375, "learning_rate": 0.0003545, "loss": 7.193, "mean_token_accuracy": 0.14023306518793105, "num_tokens": 1768762.0, "step": 710 }, { "entropy": 7.379601860046387, "epoch": 0.8362573099415205, "grad_norm": 1.2265625, "learning_rate": 0.000357, "loss": 7.2776, "mean_token_accuracy": 0.1369776740670204, "num_tokens": 1781274.0, "step": 715 }, { "entropy": 7.324306583404541, "epoch": 0.8421052631578947, "grad_norm": 1.0859375, "learning_rate": 0.0003595, "loss": 7.1528, "mean_token_accuracy": 0.14969784170389175, "num_tokens": 1794092.0, "step": 720 }, { "entropy": 7.376630353927612, "epoch": 0.847953216374269, "grad_norm": 0.98828125, "learning_rate": 0.000362, "loss": 7.3085, "mean_token_accuracy": 0.13185275122523307, "num_tokens": 1806605.0, "step": 725 }, { "entropy": 7.482823085784912, "epoch": 0.8538011695906432, "grad_norm": 1.3828125, "learning_rate": 0.0003645, "loss": 7.3004, "mean_token_accuracy": 0.12456657811999321, "num_tokens": 1820064.0, "step": 730 }, { "entropy": 7.312306928634643, "epoch": 0.8596491228070176, "grad_norm": 1.0703125, "learning_rate": 0.000367, "loss": 7.1611, "mean_token_accuracy": 0.1399262838065624, "num_tokens": 1832899.0, "step": 735 }, { "entropy": 7.350351285934448, "epoch": 0.8654970760233918, "grad_norm": 1.09375, "learning_rate": 0.0003695, "loss": 7.2602, "mean_token_accuracy": 0.13681291192770004, "num_tokens": 1845701.0, "step": 740 }, { "entropy": 7.113675498962403, "epoch": 0.8713450292397661, "grad_norm": 1.203125, "learning_rate": 0.000372, "loss": 7.0812, "mean_token_accuracy": 0.14980586394667625, "num_tokens": 1858143.0, "step": 745 }, { "entropy": 7.359517431259155, "epoch": 0.8771929824561403, "grad_norm": 1.078125, "learning_rate": 0.0003745, "loss": 7.2215, "mean_token_accuracy": 0.13886995390057563, "num_tokens": 1871111.0, "step": 750 }, { "entropy": 7.3289408683776855, "epoch": 0.8830409356725146, "grad_norm": 1.0625, "learning_rate": 0.000377, "loss": 7.1813, "mean_token_accuracy": 0.1427088886499405, "num_tokens": 1882806.0, "step": 755 }, { "entropy": 7.2833109378814695, "epoch": 0.8888888888888888, "grad_norm": 1.25, "learning_rate": 0.0003795, "loss": 7.1914, "mean_token_accuracy": 0.14085574224591255, "num_tokens": 1895451.0, "step": 760 }, { "entropy": 7.306222057342529, "epoch": 0.8947368421052632, "grad_norm": 1.1328125, "learning_rate": 0.000382, "loss": 7.1696, "mean_token_accuracy": 0.1424693427979946, "num_tokens": 1906959.0, "step": 765 }, { "entropy": 7.268920803070069, "epoch": 0.9005847953216374, "grad_norm": 1.0703125, "learning_rate": 0.0003845, "loss": 7.2486, "mean_token_accuracy": 0.13296061381697655, "num_tokens": 1919889.0, "step": 770 }, { "entropy": 7.426680231094361, "epoch": 0.9064327485380117, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 7.2794, "mean_token_accuracy": 0.13839673027396202, "num_tokens": 1932152.0, "step": 775 }, { "entropy": 7.396844387054443, "epoch": 0.9122807017543859, "grad_norm": 1.0390625, "learning_rate": 0.00038950000000000003, "loss": 7.2329, "mean_token_accuracy": 0.1382187895476818, "num_tokens": 1944874.0, "step": 780 }, { "entropy": 7.191975879669189, "epoch": 0.9181286549707602, "grad_norm": 1.265625, "learning_rate": 0.00039200000000000004, "loss": 7.2003, "mean_token_accuracy": 0.1381520450115204, "num_tokens": 1956698.0, "step": 785 }, { "entropy": 7.353271389007569, "epoch": 0.9239766081871345, "grad_norm": 0.984375, "learning_rate": 0.00039450000000000005, "loss": 7.1834, "mean_token_accuracy": 0.1376000702381134, "num_tokens": 1970553.0, "step": 790 }, { "entropy": 7.22394437789917, "epoch": 0.9298245614035088, "grad_norm": 1.21875, "learning_rate": 0.00039700000000000005, "loss": 7.1715, "mean_token_accuracy": 0.13637209460139274, "num_tokens": 1982836.0, "step": 795 }, { "entropy": 7.331004190444946, "epoch": 0.935672514619883, "grad_norm": 1.0390625, "learning_rate": 0.0003995, "loss": 7.182, "mean_token_accuracy": 0.14434827119112015, "num_tokens": 1994012.0, "step": 800 }, { "entropy": 7.191262865066529, "epoch": 0.9415204678362573, "grad_norm": 1.109375, "learning_rate": 0.000402, "loss": 7.0765, "mean_token_accuracy": 0.14728244692087172, "num_tokens": 2007058.0, "step": 805 }, { "entropy": 7.346480751037598, "epoch": 0.9473684210526315, "grad_norm": 0.99609375, "learning_rate": 0.0004045, "loss": 7.2807, "mean_token_accuracy": 0.1287767119705677, "num_tokens": 2019191.0, "step": 810 }, { "entropy": 7.356786680221558, "epoch": 0.9532163742690059, "grad_norm": 1.046875, "learning_rate": 0.00040699999999999997, "loss": 7.2192, "mean_token_accuracy": 0.1383483201265335, "num_tokens": 2031485.0, "step": 815 }, { "entropy": 7.276351737976074, "epoch": 0.9590643274853801, "grad_norm": 1.015625, "learning_rate": 0.0004095, "loss": 7.2438, "mean_token_accuracy": 0.12981143370270729, "num_tokens": 2044606.0, "step": 820 }, { "entropy": 7.322518301010132, "epoch": 0.9649122807017544, "grad_norm": 1.03125, "learning_rate": 0.000412, "loss": 7.2186, "mean_token_accuracy": 0.1239808440208435, "num_tokens": 2056170.0, "step": 825 }, { "entropy": 7.2173041820526125, "epoch": 0.9707602339181286, "grad_norm": 1.1796875, "learning_rate": 0.0004145, "loss": 7.1692, "mean_token_accuracy": 0.13378976061940193, "num_tokens": 2069257.0, "step": 830 }, { "entropy": 7.278322315216064, "epoch": 0.9766081871345029, "grad_norm": 1.09375, "learning_rate": 0.000417, "loss": 7.1461, "mean_token_accuracy": 0.13162968605756759, "num_tokens": 2081347.0, "step": 835 }, { "entropy": 7.183484840393066, "epoch": 0.9824561403508771, "grad_norm": 0.97265625, "learning_rate": 0.0004195, "loss": 7.0693, "mean_token_accuracy": 0.14508000239729882, "num_tokens": 2093121.0, "step": 840 }, { "entropy": 7.276888608932495, "epoch": 0.9883040935672515, "grad_norm": 0.984375, "learning_rate": 0.000422, "loss": 7.154, "mean_token_accuracy": 0.13984944075345992, "num_tokens": 2105098.0, "step": 845 }, { "entropy": 7.281503057479858, "epoch": 0.9941520467836257, "grad_norm": 1.0234375, "learning_rate": 0.0004245, "loss": 7.257, "mean_token_accuracy": 0.12888796031475067, "num_tokens": 2118305.0, "step": 850 }, { "entropy": 7.19629979133606, "epoch": 1.0, "grad_norm": 1.1953125, "learning_rate": 0.000427, "loss": 7.1088, "mean_token_accuracy": 0.14972682297229767, "num_tokens": 2129484.0, "step": 855 }, { "entropy": 7.273441553115845, "epoch": 1.0058479532163742, "grad_norm": 1.0, "learning_rate": 0.0004295, "loss": 6.9959, "mean_token_accuracy": 0.13713507130742073, "num_tokens": 2141996.0, "step": 860 }, { "entropy": 7.136537981033325, "epoch": 1.0116959064327484, "grad_norm": 0.94140625, "learning_rate": 0.000432, "loss": 6.9814, "mean_token_accuracy": 0.14575768858194352, "num_tokens": 2154396.0, "step": 865 }, { "entropy": 7.241056442260742, "epoch": 1.0175438596491229, "grad_norm": 1.109375, "learning_rate": 0.0004345, "loss": 6.8824, "mean_token_accuracy": 0.13679319769144058, "num_tokens": 2166397.0, "step": 870 }, { "entropy": 7.1693150997161865, "epoch": 1.023391812865497, "grad_norm": 1.1796875, "learning_rate": 0.000437, "loss": 7.052, "mean_token_accuracy": 0.13590832501649858, "num_tokens": 2180441.0, "step": 875 }, { "entropy": 7.1720458507537845, "epoch": 1.0292397660818713, "grad_norm": 1.1328125, "learning_rate": 0.0004395, "loss": 6.9798, "mean_token_accuracy": 0.14448419958353043, "num_tokens": 2192759.0, "step": 880 }, { "entropy": 7.048953914642334, "epoch": 1.0350877192982457, "grad_norm": 1.3828125, "learning_rate": 0.000442, "loss": 6.9222, "mean_token_accuracy": 0.14383947402238845, "num_tokens": 2205989.0, "step": 885 }, { "entropy": 7.172360372543335, "epoch": 1.04093567251462, "grad_norm": 1.046875, "learning_rate": 0.0004445, "loss": 6.9968, "mean_token_accuracy": 0.14286552369594574, "num_tokens": 2218780.0, "step": 890 }, { "entropy": 7.109023189544677, "epoch": 1.0467836257309941, "grad_norm": 1.125, "learning_rate": 0.000447, "loss": 7.0301, "mean_token_accuracy": 0.14032476022839546, "num_tokens": 2231748.0, "step": 895 }, { "entropy": 7.228937244415283, "epoch": 1.0526315789473684, "grad_norm": 1.203125, "learning_rate": 0.00044950000000000003, "loss": 7.0109, "mean_token_accuracy": 0.1399959348142147, "num_tokens": 2244635.0, "step": 900 }, { "entropy": 7.132290601730347, "epoch": 1.0584795321637426, "grad_norm": 1.140625, "learning_rate": 0.00045200000000000004, "loss": 6.9031, "mean_token_accuracy": 0.14366517663002015, "num_tokens": 2255941.0, "step": 905 }, { "entropy": 7.007370376586914, "epoch": 1.064327485380117, "grad_norm": 1.4765625, "learning_rate": 0.00045450000000000004, "loss": 6.9809, "mean_token_accuracy": 0.14777857810258865, "num_tokens": 2267162.0, "step": 910 }, { "entropy": 7.138269233703613, "epoch": 1.0701754385964912, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 6.9496, "mean_token_accuracy": 0.14804905876517296, "num_tokens": 2279290.0, "step": 915 }, { "entropy": 7.11580114364624, "epoch": 1.0760233918128654, "grad_norm": 1.1015625, "learning_rate": 0.00045950000000000006, "loss": 7.0084, "mean_token_accuracy": 0.13601162061095237, "num_tokens": 2293053.0, "step": 920 }, { "entropy": 7.015692281723022, "epoch": 1.0818713450292399, "grad_norm": 1.0703125, "learning_rate": 0.000462, "loss": 6.9212, "mean_token_accuracy": 0.14603447318077087, "num_tokens": 2305489.0, "step": 925 }, { "entropy": 7.051322793960571, "epoch": 1.087719298245614, "grad_norm": 1.03125, "learning_rate": 0.0004645, "loss": 6.8687, "mean_token_accuracy": 0.15775832384824753, "num_tokens": 2319310.0, "step": 930 }, { "entropy": 7.131311130523682, "epoch": 1.0935672514619883, "grad_norm": 0.98828125, "learning_rate": 0.000467, "loss": 7.0298, "mean_token_accuracy": 0.13980275765061378, "num_tokens": 2332132.0, "step": 935 }, { "entropy": 7.102800178527832, "epoch": 1.0994152046783625, "grad_norm": 1.1328125, "learning_rate": 0.0004695, "loss": 7.0008, "mean_token_accuracy": 0.14390438795089722, "num_tokens": 2343505.0, "step": 940 }, { "entropy": 7.119720315933227, "epoch": 1.1052631578947367, "grad_norm": 1.046875, "learning_rate": 0.000472, "loss": 6.9893, "mean_token_accuracy": 0.14247232899069787, "num_tokens": 2355930.0, "step": 945 }, { "entropy": 7.099494981765747, "epoch": 1.1111111111111112, "grad_norm": 1.015625, "learning_rate": 0.0004745, "loss": 6.9565, "mean_token_accuracy": 0.14375333711504937, "num_tokens": 2369820.0, "step": 950 }, { "entropy": 7.016859483718872, "epoch": 1.1169590643274854, "grad_norm": 1.0703125, "learning_rate": 0.000477, "loss": 6.9159, "mean_token_accuracy": 0.14982443079352378, "num_tokens": 2382375.0, "step": 955 }, { "entropy": 7.053458166122437, "epoch": 1.1228070175438596, "grad_norm": 1.1640625, "learning_rate": 0.0004795, "loss": 7.0089, "mean_token_accuracy": 0.14104411751031876, "num_tokens": 2393391.0, "step": 960 }, { "entropy": 7.047031879425049, "epoch": 1.128654970760234, "grad_norm": 1.171875, "learning_rate": 0.000482, "loss": 6.9345, "mean_token_accuracy": 0.1424281544983387, "num_tokens": 2405266.0, "step": 965 }, { "entropy": 7.0777851104736325, "epoch": 1.1345029239766082, "grad_norm": 1.0546875, "learning_rate": 0.0004845, "loss": 6.9704, "mean_token_accuracy": 0.14111316949129105, "num_tokens": 2418620.0, "step": 970 }, { "entropy": 7.027369260787964, "epoch": 1.1403508771929824, "grad_norm": 1.1328125, "learning_rate": 0.000487, "loss": 7.065, "mean_token_accuracy": 0.1403935208916664, "num_tokens": 2431107.0, "step": 975 }, { "entropy": 7.187720537185669, "epoch": 1.1461988304093567, "grad_norm": 1.046875, "learning_rate": 0.0004895, "loss": 7.0144, "mean_token_accuracy": 0.13802240937948226, "num_tokens": 2443729.0, "step": 980 }, { "entropy": 7.010544013977051, "epoch": 1.1520467836257309, "grad_norm": 1.0625, "learning_rate": 0.000492, "loss": 6.9195, "mean_token_accuracy": 0.14878860712051392, "num_tokens": 2456798.0, "step": 985 }, { "entropy": 7.0476819515228275, "epoch": 1.1578947368421053, "grad_norm": 1.1328125, "learning_rate": 0.0004945, "loss": 7.009, "mean_token_accuracy": 0.1457380011677742, "num_tokens": 2468701.0, "step": 990 }, { "entropy": 6.9938723087310795, "epoch": 1.1637426900584795, "grad_norm": 1.09375, "learning_rate": 0.000497, "loss": 6.9561, "mean_token_accuracy": 0.14130357205867766, "num_tokens": 2480391.0, "step": 995 }, { "entropy": 7.076553392410278, "epoch": 1.1695906432748537, "grad_norm": 1.015625, "learning_rate": 0.0004995, "loss": 6.9596, "mean_token_accuracy": 0.14768824875354766, "num_tokens": 2491887.0, "step": 1000 }, { "epoch": 1.1695906432748537, "eval_entropy": 6.926040534072921, "eval_loss": 7.151692867279053, "eval_mean_token_accuracy": 0.13112522253167752, "eval_num_tokens": 2491887.0, "eval_runtime": 2.2827, "eval_samples_per_second": 1185.89, "eval_steps_per_second": 148.51, "step": 1000 } ], "logging_steps": 5, "max_steps": 8540, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3617710663680000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }