{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.3391812865497075, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.593726110458374, "epoch": 0.005847953216374269, "grad_norm": 1.2734375, "learning_rate": 2e-06, "loss": 7.6031, "mean_token_accuracy": 0.13570500910282135, "num_tokens": 12656.0, "step": 5 }, { "entropy": 7.586997556686401, "epoch": 0.011695906432748537, "grad_norm": 1.1796875, "learning_rate": 4.5e-06, "loss": 7.6652, "mean_token_accuracy": 0.12274946123361588, "num_tokens": 25207.0, "step": 10 }, { "entropy": 7.649361896514892, "epoch": 0.017543859649122806, "grad_norm": 1.0703125, "learning_rate": 7e-06, "loss": 7.673, "mean_token_accuracy": 0.12404287382960319, "num_tokens": 38096.0, "step": 15 }, { "entropy": 7.637357187271118, "epoch": 0.023391812865497075, "grad_norm": 1.1015625, "learning_rate": 9.5e-06, "loss": 7.7506, "mean_token_accuracy": 0.12453248649835587, "num_tokens": 50626.0, "step": 20 }, { "entropy": 7.673450565338134, "epoch": 0.029239766081871343, "grad_norm": 1.0234375, "learning_rate": 1.2e-05, "loss": 7.6825, "mean_token_accuracy": 0.12940182387828827, "num_tokens": 63448.0, "step": 25 }, { "entropy": 7.774927949905395, "epoch": 0.03508771929824561, "grad_norm": 1.1015625, "learning_rate": 1.4500000000000002e-05, "loss": 7.731, "mean_token_accuracy": 0.12124454602599144, "num_tokens": 75656.0, "step": 30 }, { "entropy": 7.754840278625489, "epoch": 0.04093567251461988, "grad_norm": 1.0625, "learning_rate": 1.7000000000000003e-05, "loss": 7.7155, "mean_token_accuracy": 0.12517715990543365, "num_tokens": 88756.0, "step": 35 }, { "entropy": 7.778929853439331, "epoch": 0.04678362573099415, "grad_norm": 0.96484375, "learning_rate": 1.95e-05, "loss": 7.6499, "mean_token_accuracy": 0.12550911605358123, "num_tokens": 100934.0, "step": 40 }, { "entropy": 7.761408805847168, "epoch": 0.05263157894736842, "grad_norm": 1.1015625, "learning_rate": 2.2e-05, "loss": 7.6072, "mean_token_accuracy": 0.12898701280355454, "num_tokens": 112212.0, "step": 45 }, { "entropy": 7.740135717391968, "epoch": 0.05847953216374269, "grad_norm": 0.99609375, "learning_rate": 2.4500000000000003e-05, "loss": 7.6067, "mean_token_accuracy": 0.12694446071982385, "num_tokens": 126314.0, "step": 50 }, { "entropy": 7.718768978118897, "epoch": 0.06432748538011696, "grad_norm": 1.1015625, "learning_rate": 2.7e-05, "loss": 7.652, "mean_token_accuracy": 0.13094937354326247, "num_tokens": 138416.0, "step": 55 }, { "entropy": 7.7235801219940186, "epoch": 0.07017543859649122, "grad_norm": 1.0078125, "learning_rate": 2.95e-05, "loss": 7.6356, "mean_token_accuracy": 0.12992877885699272, "num_tokens": 149903.0, "step": 60 }, { "entropy": 7.728446578979492, "epoch": 0.07602339181286549, "grad_norm": 0.8515625, "learning_rate": 3.2e-05, "loss": 7.616, "mean_token_accuracy": 0.13435307145118713, "num_tokens": 163516.0, "step": 65 }, { "entropy": 7.745584630966187, "epoch": 0.08187134502923976, "grad_norm": 0.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 7.6154, "mean_token_accuracy": 0.12847506403923034, "num_tokens": 176024.0, "step": 70 }, { "entropy": 7.79000825881958, "epoch": 0.08771929824561403, "grad_norm": 0.95703125, "learning_rate": 3.7e-05, "loss": 7.6904, "mean_token_accuracy": 0.12912894561886787, "num_tokens": 189337.0, "step": 75 }, { "entropy": 7.840251207351685, "epoch": 0.0935672514619883, "grad_norm": 1.0625, "learning_rate": 3.95e-05, "loss": 7.632, "mean_token_accuracy": 0.1310859203338623, "num_tokens": 201752.0, "step": 80 }, { "entropy": 7.792728662490845, "epoch": 0.09941520467836257, "grad_norm": 1.0546875, "learning_rate": 4.2000000000000004e-05, "loss": 7.7007, "mean_token_accuracy": 0.1200527586042881, "num_tokens": 214676.0, "step": 85 }, { "entropy": 7.769255495071411, "epoch": 0.10526315789473684, "grad_norm": 1.015625, "learning_rate": 4.45e-05, "loss": 7.6036, "mean_token_accuracy": 0.1250310204923153, "num_tokens": 225474.0, "step": 90 }, { "entropy": 7.832526683807373, "epoch": 0.1111111111111111, "grad_norm": 1.0859375, "learning_rate": 4.7000000000000004e-05, "loss": 7.6196, "mean_token_accuracy": 0.13330849632620811, "num_tokens": 237345.0, "step": 95 }, { "entropy": 7.786408853530884, "epoch": 0.11695906432748537, "grad_norm": 1.0078125, "learning_rate": 4.9500000000000004e-05, "loss": 7.5976, "mean_token_accuracy": 0.13106755986809732, "num_tokens": 249633.0, "step": 100 }, { "entropy": 7.785315036773682, "epoch": 0.12280701754385964, "grad_norm": 1.0546875, "learning_rate": 5.2e-05, "loss": 7.5707, "mean_token_accuracy": 0.12854716926813126, "num_tokens": 261840.0, "step": 105 }, { "entropy": 7.7381500720977785, "epoch": 0.1286549707602339, "grad_norm": 1.0234375, "learning_rate": 5.45e-05, "loss": 7.6581, "mean_token_accuracy": 0.12695110440254212, "num_tokens": 273838.0, "step": 110 }, { "entropy": 7.7819578647613525, "epoch": 0.13450292397660818, "grad_norm": 1.0, "learning_rate": 5.7e-05, "loss": 7.6314, "mean_token_accuracy": 0.12518885657191275, "num_tokens": 286001.0, "step": 115 }, { "entropy": 7.892224454879761, "epoch": 0.14035087719298245, "grad_norm": 1.1171875, "learning_rate": 5.9499999999999996e-05, "loss": 7.5622, "mean_token_accuracy": 0.1403429314494133, "num_tokens": 299052.0, "step": 120 }, { "entropy": 7.751383972167969, "epoch": 0.14619883040935672, "grad_norm": 1.1640625, "learning_rate": 6.2e-05, "loss": 7.6007, "mean_token_accuracy": 0.12698042243719102, "num_tokens": 311803.0, "step": 125 }, { "entropy": 7.862428855895996, "epoch": 0.15204678362573099, "grad_norm": 1.0703125, "learning_rate": 6.450000000000001e-05, "loss": 7.6155, "mean_token_accuracy": 0.1285979501903057, "num_tokens": 323712.0, "step": 130 }, { "entropy": 7.733092164993286, "epoch": 0.15789473684210525, "grad_norm": 1.03125, "learning_rate": 6.7e-05, "loss": 7.5735, "mean_token_accuracy": 0.1340746872127056, "num_tokens": 335171.0, "step": 135 }, { "entropy": 7.840703058242798, "epoch": 0.16374269005847952, "grad_norm": 1.1015625, "learning_rate": 6.950000000000001e-05, "loss": 7.6469, "mean_token_accuracy": 0.12687307894229888, "num_tokens": 347185.0, "step": 140 }, { "entropy": 7.806375932693482, "epoch": 0.1695906432748538, "grad_norm": 1.796875, "learning_rate": 7.2e-05, "loss": 7.5806, "mean_token_accuracy": 0.12792280316352844, "num_tokens": 359695.0, "step": 145 }, { "entropy": 7.806016826629639, "epoch": 0.17543859649122806, "grad_norm": 1.0625, "learning_rate": 7.45e-05, "loss": 7.6646, "mean_token_accuracy": 0.13149451091885567, "num_tokens": 373805.0, "step": 150 }, { "entropy": 7.811039972305298, "epoch": 0.18128654970760233, "grad_norm": 1.203125, "learning_rate": 7.7e-05, "loss": 7.615, "mean_token_accuracy": 0.13272017240524292, "num_tokens": 385772.0, "step": 155 }, { "entropy": 7.7556663990020756, "epoch": 0.1871345029239766, "grad_norm": 0.98828125, "learning_rate": 7.950000000000001e-05, "loss": 7.5329, "mean_token_accuracy": 0.13663637787103652, "num_tokens": 397641.0, "step": 160 }, { "entropy": 7.7673561573028564, "epoch": 0.19298245614035087, "grad_norm": 1.03125, "learning_rate": 8.2e-05, "loss": 7.5761, "mean_token_accuracy": 0.13438102826476098, "num_tokens": 410241.0, "step": 165 }, { "entropy": 7.851863145828247, "epoch": 0.19883040935672514, "grad_norm": 1.0, "learning_rate": 8.450000000000001e-05, "loss": 7.5371, "mean_token_accuracy": 0.12968598157167435, "num_tokens": 422079.0, "step": 170 }, { "entropy": 7.722187614440918, "epoch": 0.2046783625730994, "grad_norm": 1.046875, "learning_rate": 8.7e-05, "loss": 7.6151, "mean_token_accuracy": 0.12510994151234628, "num_tokens": 435187.0, "step": 175 }, { "entropy": 7.802532577514649, "epoch": 0.21052631578947367, "grad_norm": 1.0078125, "learning_rate": 8.95e-05, "loss": 7.59, "mean_token_accuracy": 0.12483937367796898, "num_tokens": 447329.0, "step": 180 }, { "entropy": 7.7081256866455075, "epoch": 0.21637426900584794, "grad_norm": 1.1015625, "learning_rate": 9.2e-05, "loss": 7.5244, "mean_token_accuracy": 0.13455075845122338, "num_tokens": 459316.0, "step": 185 }, { "entropy": 7.866452074050903, "epoch": 0.2222222222222222, "grad_norm": 1.2421875, "learning_rate": 9.45e-05, "loss": 7.602, "mean_token_accuracy": 0.13409386128187178, "num_tokens": 471184.0, "step": 190 }, { "entropy": 7.7785547256469725, "epoch": 0.22807017543859648, "grad_norm": 1.015625, "learning_rate": 9.7e-05, "loss": 7.5964, "mean_token_accuracy": 0.13105484768748282, "num_tokens": 483988.0, "step": 195 }, { "entropy": 7.754951095581054, "epoch": 0.23391812865497075, "grad_norm": 1.0390625, "learning_rate": 9.95e-05, "loss": 7.6021, "mean_token_accuracy": 0.12733055427670478, "num_tokens": 495995.0, "step": 200 }, { "entropy": 7.760473966598511, "epoch": 0.23976608187134502, "grad_norm": 1.015625, "learning_rate": 0.000102, "loss": 7.5481, "mean_token_accuracy": 0.13547581657767296, "num_tokens": 507382.0, "step": 205 }, { "entropy": 7.720216274261475, "epoch": 0.24561403508771928, "grad_norm": 1.1875, "learning_rate": 0.00010449999999999999, "loss": 7.5492, "mean_token_accuracy": 0.1361517131328583, "num_tokens": 518748.0, "step": 210 }, { "entropy": 7.7840687274932865, "epoch": 0.25146198830409355, "grad_norm": 1.0390625, "learning_rate": 0.000107, "loss": 7.5697, "mean_token_accuracy": 0.12845324501395225, "num_tokens": 531571.0, "step": 215 }, { "entropy": 7.810080337524414, "epoch": 0.2573099415204678, "grad_norm": 0.99609375, "learning_rate": 0.0001095, "loss": 7.5872, "mean_token_accuracy": 0.1274337127804756, "num_tokens": 544699.0, "step": 220 }, { "entropy": 7.742982816696167, "epoch": 0.2631578947368421, "grad_norm": 1.0703125, "learning_rate": 0.000112, "loss": 7.5439, "mean_token_accuracy": 0.13237009420990944, "num_tokens": 558110.0, "step": 225 }, { "entropy": 7.847256898880005, "epoch": 0.26900584795321636, "grad_norm": 1.0625, "learning_rate": 0.0001145, "loss": 7.6277, "mean_token_accuracy": 0.12315782383084298, "num_tokens": 571566.0, "step": 230 }, { "entropy": 7.752783679962159, "epoch": 0.27485380116959063, "grad_norm": 1.3125, "learning_rate": 0.00011700000000000001, "loss": 7.5427, "mean_token_accuracy": 0.130996935069561, "num_tokens": 583149.0, "step": 235 }, { "entropy": 7.764012479782105, "epoch": 0.2807017543859649, "grad_norm": 1.203125, "learning_rate": 0.00011949999999999999, "loss": 7.5734, "mean_token_accuracy": 0.1311168886721134, "num_tokens": 596360.0, "step": 240 }, { "entropy": 7.776003646850586, "epoch": 0.28654970760233917, "grad_norm": 1.0390625, "learning_rate": 0.000122, "loss": 7.57, "mean_token_accuracy": 0.12710137963294982, "num_tokens": 607719.0, "step": 245 }, { "entropy": 7.803481483459473, "epoch": 0.29239766081871343, "grad_norm": 1.1796875, "learning_rate": 0.0001245, "loss": 7.5331, "mean_token_accuracy": 0.13498716056346893, "num_tokens": 619002.0, "step": 250 }, { "entropy": 7.713655710220337, "epoch": 0.2982456140350877, "grad_norm": 1.1484375, "learning_rate": 0.000127, "loss": 7.5076, "mean_token_accuracy": 0.13216801062226297, "num_tokens": 631437.0, "step": 255 }, { "entropy": 7.640055465698242, "epoch": 0.30409356725146197, "grad_norm": 1.1875, "learning_rate": 0.0001295, "loss": 7.5087, "mean_token_accuracy": 0.13282301425933837, "num_tokens": 642611.0, "step": 260 }, { "entropy": 7.83185043334961, "epoch": 0.30994152046783624, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 7.5447, "mean_token_accuracy": 0.1268044739961624, "num_tokens": 654874.0, "step": 265 }, { "entropy": 7.68661732673645, "epoch": 0.3157894736842105, "grad_norm": 1.109375, "learning_rate": 0.00013450000000000002, "loss": 7.629, "mean_token_accuracy": 0.1293095037341118, "num_tokens": 669141.0, "step": 270 }, { "entropy": 7.781434631347656, "epoch": 0.3216374269005848, "grad_norm": 1.28125, "learning_rate": 0.00013700000000000002, "loss": 7.5456, "mean_token_accuracy": 0.13286237716674804, "num_tokens": 681192.0, "step": 275 }, { "entropy": 7.814055967330932, "epoch": 0.32748538011695905, "grad_norm": 1.171875, "learning_rate": 0.0001395, "loss": 7.5423, "mean_token_accuracy": 0.13368416726589202, "num_tokens": 693191.0, "step": 280 }, { "entropy": 7.664337110519409, "epoch": 0.3333333333333333, "grad_norm": 1.2578125, "learning_rate": 0.00014199999999999998, "loss": 7.5257, "mean_token_accuracy": 0.1304435022175312, "num_tokens": 705131.0, "step": 285 }, { "entropy": 7.808525848388672, "epoch": 0.3391812865497076, "grad_norm": 1.1015625, "learning_rate": 0.0001445, "loss": 7.5226, "mean_token_accuracy": 0.1330956645309925, "num_tokens": 717873.0, "step": 290 }, { "entropy": 7.779027700424194, "epoch": 0.34502923976608185, "grad_norm": 1.1171875, "learning_rate": 0.000147, "loss": 7.5753, "mean_token_accuracy": 0.12839027419686316, "num_tokens": 730527.0, "step": 295 }, { "entropy": 7.754869270324707, "epoch": 0.3508771929824561, "grad_norm": 1.09375, "learning_rate": 0.0001495, "loss": 7.6158, "mean_token_accuracy": 0.1226100891828537, "num_tokens": 743263.0, "step": 300 }, { "entropy": 7.853420972824097, "epoch": 0.3567251461988304, "grad_norm": 1.1640625, "learning_rate": 0.000152, "loss": 7.6122, "mean_token_accuracy": 0.12751553878188132, "num_tokens": 755422.0, "step": 305 }, { "entropy": 7.644754314422608, "epoch": 0.36257309941520466, "grad_norm": 1.375, "learning_rate": 0.00015450000000000001, "loss": 7.4967, "mean_token_accuracy": 0.13192886114120483, "num_tokens": 767854.0, "step": 310 }, { "entropy": 7.757552576065064, "epoch": 0.3684210526315789, "grad_norm": 1.03125, "learning_rate": 0.000157, "loss": 7.4794, "mean_token_accuracy": 0.13279144391417502, "num_tokens": 779969.0, "step": 315 }, { "entropy": 7.734856033325196, "epoch": 0.3742690058479532, "grad_norm": 1.0078125, "learning_rate": 0.0001595, "loss": 7.5177, "mean_token_accuracy": 0.12462197691202163, "num_tokens": 792544.0, "step": 320 }, { "entropy": 7.747901725769043, "epoch": 0.38011695906432746, "grad_norm": 1.0703125, "learning_rate": 0.000162, "loss": 7.5284, "mean_token_accuracy": 0.1278999462723732, "num_tokens": 804603.0, "step": 325 }, { "entropy": 7.6661285877227785, "epoch": 0.38596491228070173, "grad_norm": 1.3203125, "learning_rate": 0.00016450000000000001, "loss": 7.4698, "mean_token_accuracy": 0.1412305675446987, "num_tokens": 816006.0, "step": 330 }, { "entropy": 7.718921327590943, "epoch": 0.391812865497076, "grad_norm": 1.078125, "learning_rate": 0.00016700000000000002, "loss": 7.4472, "mean_token_accuracy": 0.13868665173649788, "num_tokens": 828003.0, "step": 335 }, { "entropy": 7.650281476974487, "epoch": 0.39766081871345027, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 7.5019, "mean_token_accuracy": 0.13453598469495773, "num_tokens": 840649.0, "step": 340 }, { "entropy": 7.828660154342652, "epoch": 0.40350877192982454, "grad_norm": 1.234375, "learning_rate": 0.00017199999999999998, "loss": 7.5351, "mean_token_accuracy": 0.12318970710039139, "num_tokens": 853736.0, "step": 345 }, { "entropy": 7.61459264755249, "epoch": 0.4093567251461988, "grad_norm": 1.1953125, "learning_rate": 0.00017449999999999999, "loss": 7.5521, "mean_token_accuracy": 0.1260755755007267, "num_tokens": 866346.0, "step": 350 }, { "entropy": 7.783421611785888, "epoch": 0.4152046783625731, "grad_norm": 1.0546875, "learning_rate": 0.000177, "loss": 7.4784, "mean_token_accuracy": 0.12796891778707503, "num_tokens": 879163.0, "step": 355 }, { "entropy": 7.739914035797119, "epoch": 0.42105263157894735, "grad_norm": 1.1875, "learning_rate": 0.0001795, "loss": 7.5281, "mean_token_accuracy": 0.1271045207977295, "num_tokens": 891452.0, "step": 360 }, { "entropy": 7.692205429077148, "epoch": 0.4269005847953216, "grad_norm": 1.390625, "learning_rate": 0.000182, "loss": 7.5409, "mean_token_accuracy": 0.13060612305998803, "num_tokens": 903351.0, "step": 365 }, { "entropy": 7.750999116897583, "epoch": 0.4327485380116959, "grad_norm": 1.203125, "learning_rate": 0.0001845, "loss": 7.4841, "mean_token_accuracy": 0.1305551879107952, "num_tokens": 914818.0, "step": 370 }, { "entropy": 7.551722192764283, "epoch": 0.43859649122807015, "grad_norm": 1.1484375, "learning_rate": 0.000187, "loss": 7.3844, "mean_token_accuracy": 0.14969016388058662, "num_tokens": 927337.0, "step": 375 }, { "entropy": 7.822294139862061, "epoch": 0.4444444444444444, "grad_norm": 1.1640625, "learning_rate": 0.0001895, "loss": 7.5932, "mean_token_accuracy": 0.1261659525334835, "num_tokens": 940058.0, "step": 380 }, { "entropy": 7.664493227005005, "epoch": 0.4502923976608187, "grad_norm": 1.390625, "learning_rate": 0.000192, "loss": 7.3961, "mean_token_accuracy": 0.13526701480150222, "num_tokens": 952820.0, "step": 385 }, { "entropy": 7.564838886260986, "epoch": 0.45614035087719296, "grad_norm": 1.328125, "learning_rate": 0.0001945, "loss": 7.4493, "mean_token_accuracy": 0.13812072202563286, "num_tokens": 965132.0, "step": 390 }, { "entropy": 7.727004194259644, "epoch": 0.4619883040935672, "grad_norm": 1.0703125, "learning_rate": 0.00019700000000000002, "loss": 7.4848, "mean_token_accuracy": 0.1320212572813034, "num_tokens": 978695.0, "step": 395 }, { "entropy": 7.706100749969482, "epoch": 0.4678362573099415, "grad_norm": 1.3046875, "learning_rate": 0.00019950000000000002, "loss": 7.4478, "mean_token_accuracy": 0.13389745727181435, "num_tokens": 992427.0, "step": 400 }, { "entropy": 7.581472444534302, "epoch": 0.47368421052631576, "grad_norm": 1.2109375, "learning_rate": 0.000202, "loss": 7.4625, "mean_token_accuracy": 0.13692987337708473, "num_tokens": 1005090.0, "step": 405 }, { "entropy": 7.768648767471314, "epoch": 0.47953216374269003, "grad_norm": 1.21875, "learning_rate": 0.00020449999999999998, "loss": 7.4654, "mean_token_accuracy": 0.13497180566191674, "num_tokens": 1017219.0, "step": 410 }, { "entropy": 7.577150154113769, "epoch": 0.4853801169590643, "grad_norm": 1.109375, "learning_rate": 0.000207, "loss": 7.5118, "mean_token_accuracy": 0.12923638001084328, "num_tokens": 1029576.0, "step": 415 }, { "entropy": 7.703565454483032, "epoch": 0.49122807017543857, "grad_norm": 1.25, "learning_rate": 0.0002095, "loss": 7.5447, "mean_token_accuracy": 0.12888929918408393, "num_tokens": 1042259.0, "step": 420 }, { "entropy": 7.760423231124878, "epoch": 0.49707602339181284, "grad_norm": 1.2109375, "learning_rate": 0.000212, "loss": 7.4665, "mean_token_accuracy": 0.12709181681275367, "num_tokens": 1054965.0, "step": 425 }, { "entropy": 7.540304946899414, "epoch": 0.5029239766081871, "grad_norm": 1.171875, "learning_rate": 0.0002145, "loss": 7.4192, "mean_token_accuracy": 0.13073362559080123, "num_tokens": 1067346.0, "step": 430 }, { "entropy": 7.69997730255127, "epoch": 0.5087719298245614, "grad_norm": 1.1171875, "learning_rate": 0.00021700000000000002, "loss": 7.4084, "mean_token_accuracy": 0.12967713326215743, "num_tokens": 1080366.0, "step": 435 }, { "entropy": 7.659937810897827, "epoch": 0.5146198830409356, "grad_norm": 1.140625, "learning_rate": 0.0002195, "loss": 7.3841, "mean_token_accuracy": 0.1347927011549473, "num_tokens": 1091904.0, "step": 440 }, { "entropy": 7.573716306686402, "epoch": 0.52046783625731, "grad_norm": 1.2109375, "learning_rate": 0.000222, "loss": 7.3977, "mean_token_accuracy": 0.13465345576405524, "num_tokens": 1103363.0, "step": 445 }, { "entropy": 7.556374645233154, "epoch": 0.5263157894736842, "grad_norm": 1.1171875, "learning_rate": 0.0002245, "loss": 7.4271, "mean_token_accuracy": 0.1363191269338131, "num_tokens": 1115178.0, "step": 450 }, { "entropy": 7.6787323474884035, "epoch": 0.5321637426900585, "grad_norm": 1.3125, "learning_rate": 0.00022700000000000002, "loss": 7.364, "mean_token_accuracy": 0.13259132504463195, "num_tokens": 1128276.0, "step": 455 }, { "entropy": 7.688528728485108, "epoch": 0.5380116959064327, "grad_norm": 1.2421875, "learning_rate": 0.00022950000000000002, "loss": 7.4907, "mean_token_accuracy": 0.13230301365256308, "num_tokens": 1142100.0, "step": 460 }, { "entropy": 7.469075775146484, "epoch": 0.543859649122807, "grad_norm": 1.234375, "learning_rate": 0.00023200000000000003, "loss": 7.4026, "mean_token_accuracy": 0.13583226278424262, "num_tokens": 1154928.0, "step": 465 }, { "entropy": 7.702433824539185, "epoch": 0.5497076023391813, "grad_norm": 1.328125, "learning_rate": 0.00023449999999999998, "loss": 7.4994, "mean_token_accuracy": 0.1225062869489193, "num_tokens": 1166937.0, "step": 470 }, { "entropy": 7.537669372558594, "epoch": 0.5555555555555556, "grad_norm": 1.2578125, "learning_rate": 0.000237, "loss": 7.4175, "mean_token_accuracy": 0.1342865504324436, "num_tokens": 1180008.0, "step": 475 }, { "entropy": 7.674032211303711, "epoch": 0.5614035087719298, "grad_norm": 1.2578125, "learning_rate": 0.0002395, "loss": 7.4255, "mean_token_accuracy": 0.12588841170072557, "num_tokens": 1191926.0, "step": 480 }, { "entropy": 7.737406444549561, "epoch": 0.5672514619883041, "grad_norm": 1.0625, "learning_rate": 0.000242, "loss": 7.4953, "mean_token_accuracy": 0.12321070730686187, "num_tokens": 1204904.0, "step": 485 }, { "entropy": 7.525170803070068, "epoch": 0.5730994152046783, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 7.3645, "mean_token_accuracy": 0.13284065276384355, "num_tokens": 1217006.0, "step": 490 }, { "entropy": 7.552954483032226, "epoch": 0.5789473684210527, "grad_norm": 1.21875, "learning_rate": 0.000247, "loss": 7.3799, "mean_token_accuracy": 0.13598829582333566, "num_tokens": 1228460.0, "step": 495 }, { "entropy": 7.607265853881836, "epoch": 0.5847953216374269, "grad_norm": 1.1796875, "learning_rate": 0.0002495, "loss": 7.4021, "mean_token_accuracy": 0.1343585431575775, "num_tokens": 1240891.0, "step": 500 }, { "epoch": 0.5847953216374269, "eval_entropy": 7.373745485041345, "eval_loss": 7.422036647796631, "eval_mean_token_accuracy": 0.12701122225660577, "eval_num_tokens": 1240891.0, "eval_runtime": 2.2961, "eval_samples_per_second": 1178.964, "eval_steps_per_second": 147.643, "step": 500 }, { "entropy": 7.5875434398651125, "epoch": 0.5906432748538012, "grad_norm": 1.234375, "learning_rate": 0.000252, "loss": 7.3656, "mean_token_accuracy": 0.1350531853735447, "num_tokens": 1254385.0, "step": 505 }, { "entropy": 7.6494550704956055, "epoch": 0.5964912280701754, "grad_norm": 1.265625, "learning_rate": 0.0002545, "loss": 7.4191, "mean_token_accuracy": 0.13399955853819848, "num_tokens": 1266809.0, "step": 510 }, { "entropy": 7.640181350708008, "epoch": 0.6023391812865497, "grad_norm": 1.0546875, "learning_rate": 0.000257, "loss": 7.4899, "mean_token_accuracy": 0.12867182418704032, "num_tokens": 1279478.0, "step": 515 }, { "entropy": 7.59810357093811, "epoch": 0.6081871345029239, "grad_norm": 1.0703125, "learning_rate": 0.0002595, "loss": 7.4026, "mean_token_accuracy": 0.13495590910315514, "num_tokens": 1291241.0, "step": 520 }, { "entropy": 7.57518630027771, "epoch": 0.6140350877192983, "grad_norm": 1.1171875, "learning_rate": 0.000262, "loss": 7.3959, "mean_token_accuracy": 0.1318567432463169, "num_tokens": 1303776.0, "step": 525 }, { "entropy": 7.491529178619385, "epoch": 0.6198830409356725, "grad_norm": 1.2109375, "learning_rate": 0.00026450000000000003, "loss": 7.3455, "mean_token_accuracy": 0.13106245100498198, "num_tokens": 1315970.0, "step": 530 }, { "entropy": 7.7029557704925535, "epoch": 0.6257309941520468, "grad_norm": 1.109375, "learning_rate": 0.00026700000000000004, "loss": 7.423, "mean_token_accuracy": 0.12939090728759767, "num_tokens": 1328142.0, "step": 535 }, { "entropy": 7.564161109924316, "epoch": 0.631578947368421, "grad_norm": 1.2109375, "learning_rate": 0.00026950000000000005, "loss": 7.3336, "mean_token_accuracy": 0.13661645874381065, "num_tokens": 1341126.0, "step": 540 }, { "entropy": 7.525344514846802, "epoch": 0.6374269005847953, "grad_norm": 1.109375, "learning_rate": 0.00027200000000000005, "loss": 7.3498, "mean_token_accuracy": 0.13808920085430146, "num_tokens": 1353820.0, "step": 545 }, { "entropy": 7.3739342212677, "epoch": 0.6432748538011696, "grad_norm": 1.203125, "learning_rate": 0.0002745, "loss": 7.3519, "mean_token_accuracy": 0.13071095943450928, "num_tokens": 1365342.0, "step": 550 }, { "entropy": 7.562578582763672, "epoch": 0.6491228070175439, "grad_norm": 1.09375, "learning_rate": 0.000277, "loss": 7.373, "mean_token_accuracy": 0.13720307797193526, "num_tokens": 1377965.0, "step": 555 }, { "entropy": 7.589451599121094, "epoch": 0.6549707602339181, "grad_norm": 1.0703125, "learning_rate": 0.0002795, "loss": 7.4585, "mean_token_accuracy": 0.12641436904668807, "num_tokens": 1391128.0, "step": 560 }, { "entropy": 7.503201961517334, "epoch": 0.6608187134502924, "grad_norm": 1.25, "learning_rate": 0.00028199999999999997, "loss": 7.3229, "mean_token_accuracy": 0.13581799939274788, "num_tokens": 1402866.0, "step": 565 }, { "entropy": 7.522457122802734, "epoch": 0.6666666666666666, "grad_norm": 1.0703125, "learning_rate": 0.0002845, "loss": 7.4011, "mean_token_accuracy": 0.13442004173994065, "num_tokens": 1415314.0, "step": 570 }, { "entropy": 7.550132846832275, "epoch": 0.672514619883041, "grad_norm": 1.25, "learning_rate": 0.000287, "loss": 7.3021, "mean_token_accuracy": 0.13721019327640532, "num_tokens": 1427003.0, "step": 575 }, { "entropy": 7.435861873626709, "epoch": 0.6783625730994152, "grad_norm": 1.65625, "learning_rate": 0.0002895, "loss": 7.2802, "mean_token_accuracy": 0.13575370907783507, "num_tokens": 1438950.0, "step": 580 }, { "entropy": 7.538718414306641, "epoch": 0.6842105263157895, "grad_norm": 1.1328125, "learning_rate": 0.000292, "loss": 7.3822, "mean_token_accuracy": 0.13449773266911508, "num_tokens": 1451640.0, "step": 585 }, { "entropy": 7.539703464508056, "epoch": 0.6900584795321637, "grad_norm": 1.2421875, "learning_rate": 0.0002945, "loss": 7.3901, "mean_token_accuracy": 0.13477873280644417, "num_tokens": 1464282.0, "step": 590 }, { "entropy": 7.420022916793823, "epoch": 0.695906432748538, "grad_norm": 1.0390625, "learning_rate": 0.000297, "loss": 7.3199, "mean_token_accuracy": 0.13606854826211928, "num_tokens": 1476199.0, "step": 595 }, { "entropy": 7.528499126434326, "epoch": 0.7017543859649122, "grad_norm": 1.4140625, "learning_rate": 0.0002995, "loss": 7.3494, "mean_token_accuracy": 0.13913520947098731, "num_tokens": 1488055.0, "step": 600 }, { "entropy": 7.544654035568238, "epoch": 0.7076023391812866, "grad_norm": 1.1328125, "learning_rate": 0.000302, "loss": 7.2989, "mean_token_accuracy": 0.13840262964367867, "num_tokens": 1500764.0, "step": 605 }, { "entropy": 7.431989049911499, "epoch": 0.7134502923976608, "grad_norm": 1.046875, "learning_rate": 0.0003045, "loss": 7.3203, "mean_token_accuracy": 0.13689279779791833, "num_tokens": 1513645.0, "step": 610 }, { "entropy": 7.424747610092163, "epoch": 0.7192982456140351, "grad_norm": 1.0859375, "learning_rate": 0.000307, "loss": 7.2418, "mean_token_accuracy": 0.14617047160863877, "num_tokens": 1528146.0, "step": 615 }, { "entropy": 7.445183849334716, "epoch": 0.7251461988304093, "grad_norm": 1.328125, "learning_rate": 0.0003095, "loss": 7.3038, "mean_token_accuracy": 0.13819727301597595, "num_tokens": 1541336.0, "step": 620 }, { "entropy": 7.532771015167237, "epoch": 0.7309941520467836, "grad_norm": 2.3125, "learning_rate": 0.000312, "loss": 7.3238, "mean_token_accuracy": 0.13210776224732398, "num_tokens": 1554609.0, "step": 625 }, { "entropy": 7.47041335105896, "epoch": 0.7368421052631579, "grad_norm": 1.265625, "learning_rate": 0.0003145, "loss": 7.4036, "mean_token_accuracy": 0.13117921128869056, "num_tokens": 1567520.0, "step": 630 }, { "entropy": 7.4976729393005375, "epoch": 0.7426900584795322, "grad_norm": 1.1015625, "learning_rate": 0.000317, "loss": 7.2851, "mean_token_accuracy": 0.14150782003998758, "num_tokens": 1579783.0, "step": 635 }, { "entropy": 7.376789665222168, "epoch": 0.7485380116959064, "grad_norm": 1.0703125, "learning_rate": 0.0003195, "loss": 7.2247, "mean_token_accuracy": 0.13450378701090812, "num_tokens": 1592830.0, "step": 640 }, { "entropy": 7.538475275039673, "epoch": 0.7543859649122807, "grad_norm": 1.15625, "learning_rate": 0.000322, "loss": 7.4304, "mean_token_accuracy": 0.12484153211116791, "num_tokens": 1605470.0, "step": 645 }, { "entropy": 7.442430639266968, "epoch": 0.7602339181286549, "grad_norm": 1.1015625, "learning_rate": 0.00032450000000000003, "loss": 7.2943, "mean_token_accuracy": 0.13867733925580977, "num_tokens": 1618106.0, "step": 650 }, { "entropy": 7.355888032913208, "epoch": 0.7660818713450293, "grad_norm": 1.125, "learning_rate": 0.00032700000000000003, "loss": 7.3423, "mean_token_accuracy": 0.12944767996668816, "num_tokens": 1632043.0, "step": 655 }, { "entropy": 7.49034104347229, "epoch": 0.7719298245614035, "grad_norm": 1.3046875, "learning_rate": 0.00032950000000000004, "loss": 7.2699, "mean_token_accuracy": 0.1375485248863697, "num_tokens": 1644671.0, "step": 660 }, { "entropy": 7.438511610031128, "epoch": 0.7777777777777778, "grad_norm": 1.2265625, "learning_rate": 0.00033200000000000005, "loss": 7.2571, "mean_token_accuracy": 0.13946201801300048, "num_tokens": 1657000.0, "step": 665 }, { "entropy": 7.363019323348999, "epoch": 0.783625730994152, "grad_norm": 1.0703125, "learning_rate": 0.00033450000000000005, "loss": 7.288, "mean_token_accuracy": 0.1353791870176792, "num_tokens": 1669874.0, "step": 670 }, { "entropy": 7.394830369949341, "epoch": 0.7894736842105263, "grad_norm": 1.1640625, "learning_rate": 0.000337, "loss": 7.3037, "mean_token_accuracy": 0.13502334728837012, "num_tokens": 1681238.0, "step": 675 }, { "entropy": 7.389416217803955, "epoch": 0.7953216374269005, "grad_norm": 1.265625, "learning_rate": 0.0003395, "loss": 7.1837, "mean_token_accuracy": 0.1395817719399929, "num_tokens": 1694887.0, "step": 680 }, { "entropy": 7.460854482650757, "epoch": 0.8011695906432749, "grad_norm": 1.40625, "learning_rate": 0.000342, "loss": 7.3458, "mean_token_accuracy": 0.13248592168092727, "num_tokens": 1706888.0, "step": 685 }, { "entropy": 7.458899688720703, "epoch": 0.8070175438596491, "grad_norm": 1.3125, "learning_rate": 0.00034449999999999997, "loss": 7.3121, "mean_token_accuracy": 0.13233812376856804, "num_tokens": 1718681.0, "step": 690 }, { "entropy": 7.411834287643432, "epoch": 0.8128654970760234, "grad_norm": 1.2421875, "learning_rate": 0.000347, "loss": 7.3076, "mean_token_accuracy": 0.13430518060922622, "num_tokens": 1732073.0, "step": 695 }, { "entropy": 7.387229108810425, "epoch": 0.8187134502923976, "grad_norm": 1.2265625, "learning_rate": 0.0003495, "loss": 7.2038, "mean_token_accuracy": 0.13365850895643233, "num_tokens": 1744176.0, "step": 700 }, { "entropy": 7.384578371047974, "epoch": 0.8245614035087719, "grad_norm": 0.9765625, "learning_rate": 0.000352, "loss": 7.2441, "mean_token_accuracy": 0.1429324761033058, "num_tokens": 1757138.0, "step": 705 }, { "entropy": 7.342513751983643, "epoch": 0.8304093567251462, "grad_norm": 1.09375, "learning_rate": 0.0003545, "loss": 7.193, "mean_token_accuracy": 0.14023306518793105, "num_tokens": 1768762.0, "step": 710 }, { "entropy": 7.379601860046387, "epoch": 0.8362573099415205, "grad_norm": 1.2265625, "learning_rate": 0.000357, "loss": 7.2776, "mean_token_accuracy": 0.1369776740670204, "num_tokens": 1781274.0, "step": 715 }, { "entropy": 7.324306583404541, "epoch": 0.8421052631578947, "grad_norm": 1.0859375, "learning_rate": 0.0003595, "loss": 7.1528, "mean_token_accuracy": 0.14969784170389175, "num_tokens": 1794092.0, "step": 720 }, { "entropy": 7.376630353927612, "epoch": 0.847953216374269, "grad_norm": 0.98828125, "learning_rate": 0.000362, "loss": 7.3085, "mean_token_accuracy": 0.13185275122523307, "num_tokens": 1806605.0, "step": 725 }, { "entropy": 7.482823085784912, "epoch": 0.8538011695906432, "grad_norm": 1.3828125, "learning_rate": 0.0003645, "loss": 7.3004, "mean_token_accuracy": 0.12456657811999321, "num_tokens": 1820064.0, "step": 730 }, { "entropy": 7.312306928634643, "epoch": 0.8596491228070176, "grad_norm": 1.0703125, "learning_rate": 0.000367, "loss": 7.1611, "mean_token_accuracy": 0.1399262838065624, "num_tokens": 1832899.0, "step": 735 }, { "entropy": 7.350351285934448, "epoch": 0.8654970760233918, "grad_norm": 1.09375, "learning_rate": 0.0003695, "loss": 7.2602, "mean_token_accuracy": 0.13681291192770004, "num_tokens": 1845701.0, "step": 740 }, { "entropy": 7.113675498962403, "epoch": 0.8713450292397661, "grad_norm": 1.203125, "learning_rate": 0.000372, "loss": 7.0812, "mean_token_accuracy": 0.14980586394667625, "num_tokens": 1858143.0, "step": 745 }, { "entropy": 7.359517431259155, "epoch": 0.8771929824561403, "grad_norm": 1.078125, "learning_rate": 0.0003745, "loss": 7.2215, "mean_token_accuracy": 0.13886995390057563, "num_tokens": 1871111.0, "step": 750 }, { "entropy": 7.3289408683776855, "epoch": 0.8830409356725146, "grad_norm": 1.0625, "learning_rate": 0.000377, "loss": 7.1813, "mean_token_accuracy": 0.1427088886499405, "num_tokens": 1882806.0, "step": 755 }, { "entropy": 7.2833109378814695, "epoch": 0.8888888888888888, "grad_norm": 1.25, "learning_rate": 0.0003795, "loss": 7.1914, "mean_token_accuracy": 0.14085574224591255, "num_tokens": 1895451.0, "step": 760 }, { "entropy": 7.306222057342529, "epoch": 0.8947368421052632, "grad_norm": 1.1328125, "learning_rate": 0.000382, "loss": 7.1696, "mean_token_accuracy": 0.1424693427979946, "num_tokens": 1906959.0, "step": 765 }, { "entropy": 7.268920803070069, "epoch": 0.9005847953216374, "grad_norm": 1.0703125, "learning_rate": 0.0003845, "loss": 7.2486, "mean_token_accuracy": 0.13296061381697655, "num_tokens": 1919889.0, "step": 770 }, { "entropy": 7.426680231094361, "epoch": 0.9064327485380117, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 7.2794, "mean_token_accuracy": 0.13839673027396202, "num_tokens": 1932152.0, "step": 775 }, { "entropy": 7.396844387054443, "epoch": 0.9122807017543859, "grad_norm": 1.0390625, "learning_rate": 0.00038950000000000003, "loss": 7.2329, "mean_token_accuracy": 0.1382187895476818, "num_tokens": 1944874.0, "step": 780 }, { "entropy": 7.191975879669189, "epoch": 0.9181286549707602, "grad_norm": 1.265625, "learning_rate": 0.00039200000000000004, "loss": 7.2003, "mean_token_accuracy": 0.1381520450115204, "num_tokens": 1956698.0, "step": 785 }, { "entropy": 7.353271389007569, "epoch": 0.9239766081871345, "grad_norm": 0.984375, "learning_rate": 0.00039450000000000005, "loss": 7.1834, "mean_token_accuracy": 0.1376000702381134, "num_tokens": 1970553.0, "step": 790 }, { "entropy": 7.22394437789917, "epoch": 0.9298245614035088, "grad_norm": 1.21875, "learning_rate": 0.00039700000000000005, "loss": 7.1715, "mean_token_accuracy": 0.13637209460139274, "num_tokens": 1982836.0, "step": 795 }, { "entropy": 7.331004190444946, "epoch": 0.935672514619883, "grad_norm": 1.0390625, "learning_rate": 0.0003995, "loss": 7.182, "mean_token_accuracy": 0.14434827119112015, "num_tokens": 1994012.0, "step": 800 }, { "entropy": 7.191262865066529, "epoch": 0.9415204678362573, "grad_norm": 1.109375, "learning_rate": 0.000402, "loss": 7.0765, "mean_token_accuracy": 0.14728244692087172, "num_tokens": 2007058.0, "step": 805 }, { "entropy": 7.346480751037598, "epoch": 0.9473684210526315, "grad_norm": 0.99609375, "learning_rate": 0.0004045, "loss": 7.2807, "mean_token_accuracy": 0.1287767119705677, "num_tokens": 2019191.0, "step": 810 }, { "entropy": 7.356786680221558, "epoch": 0.9532163742690059, "grad_norm": 1.046875, "learning_rate": 0.00040699999999999997, "loss": 7.2192, "mean_token_accuracy": 0.1383483201265335, "num_tokens": 2031485.0, "step": 815 }, { "entropy": 7.276351737976074, "epoch": 0.9590643274853801, "grad_norm": 1.015625, "learning_rate": 0.0004095, "loss": 7.2438, "mean_token_accuracy": 0.12981143370270729, "num_tokens": 2044606.0, "step": 820 }, { "entropy": 7.322518301010132, "epoch": 0.9649122807017544, "grad_norm": 1.03125, "learning_rate": 0.000412, "loss": 7.2186, "mean_token_accuracy": 0.1239808440208435, "num_tokens": 2056170.0, "step": 825 }, { "entropy": 7.2173041820526125, "epoch": 0.9707602339181286, "grad_norm": 1.1796875, "learning_rate": 0.0004145, "loss": 7.1692, "mean_token_accuracy": 0.13378976061940193, "num_tokens": 2069257.0, "step": 830 }, { "entropy": 7.278322315216064, "epoch": 0.9766081871345029, "grad_norm": 1.09375, "learning_rate": 0.000417, "loss": 7.1461, "mean_token_accuracy": 0.13162968605756759, "num_tokens": 2081347.0, "step": 835 }, { "entropy": 7.183484840393066, "epoch": 0.9824561403508771, "grad_norm": 0.97265625, "learning_rate": 0.0004195, "loss": 7.0693, "mean_token_accuracy": 0.14508000239729882, "num_tokens": 2093121.0, "step": 840 }, { "entropy": 7.276888608932495, "epoch": 0.9883040935672515, "grad_norm": 0.984375, "learning_rate": 0.000422, "loss": 7.154, "mean_token_accuracy": 0.13984944075345992, "num_tokens": 2105098.0, "step": 845 }, { "entropy": 7.281503057479858, "epoch": 0.9941520467836257, "grad_norm": 1.0234375, "learning_rate": 0.0004245, "loss": 7.257, "mean_token_accuracy": 0.12888796031475067, "num_tokens": 2118305.0, "step": 850 }, { "entropy": 7.19629979133606, "epoch": 1.0, "grad_norm": 1.1953125, "learning_rate": 0.000427, "loss": 7.1088, "mean_token_accuracy": 0.14972682297229767, "num_tokens": 2129484.0, "step": 855 }, { "entropy": 7.273441553115845, "epoch": 1.0058479532163742, "grad_norm": 1.0, "learning_rate": 0.0004295, "loss": 6.9959, "mean_token_accuracy": 0.13713507130742073, "num_tokens": 2141996.0, "step": 860 }, { "entropy": 7.136537981033325, "epoch": 1.0116959064327484, "grad_norm": 0.94140625, "learning_rate": 0.000432, "loss": 6.9814, "mean_token_accuracy": 0.14575768858194352, "num_tokens": 2154396.0, "step": 865 }, { "entropy": 7.241056442260742, "epoch": 1.0175438596491229, "grad_norm": 1.109375, "learning_rate": 0.0004345, "loss": 6.8824, "mean_token_accuracy": 0.13679319769144058, "num_tokens": 2166397.0, "step": 870 }, { "entropy": 7.1693150997161865, "epoch": 1.023391812865497, "grad_norm": 1.1796875, "learning_rate": 0.000437, "loss": 7.052, "mean_token_accuracy": 0.13590832501649858, "num_tokens": 2180441.0, "step": 875 }, { "entropy": 7.1720458507537845, "epoch": 1.0292397660818713, "grad_norm": 1.1328125, "learning_rate": 0.0004395, "loss": 6.9798, "mean_token_accuracy": 0.14448419958353043, "num_tokens": 2192759.0, "step": 880 }, { "entropy": 7.048953914642334, "epoch": 1.0350877192982457, "grad_norm": 1.3828125, "learning_rate": 0.000442, "loss": 6.9222, "mean_token_accuracy": 0.14383947402238845, "num_tokens": 2205989.0, "step": 885 }, { "entropy": 7.172360372543335, "epoch": 1.04093567251462, "grad_norm": 1.046875, "learning_rate": 0.0004445, "loss": 6.9968, "mean_token_accuracy": 0.14286552369594574, "num_tokens": 2218780.0, "step": 890 }, { "entropy": 7.109023189544677, "epoch": 1.0467836257309941, "grad_norm": 1.125, "learning_rate": 0.000447, "loss": 7.0301, "mean_token_accuracy": 0.14032476022839546, "num_tokens": 2231748.0, "step": 895 }, { "entropy": 7.228937244415283, "epoch": 1.0526315789473684, "grad_norm": 1.203125, "learning_rate": 0.00044950000000000003, "loss": 7.0109, "mean_token_accuracy": 0.1399959348142147, "num_tokens": 2244635.0, "step": 900 }, { "entropy": 7.132290601730347, "epoch": 1.0584795321637426, "grad_norm": 1.140625, "learning_rate": 0.00045200000000000004, "loss": 6.9031, "mean_token_accuracy": 0.14366517663002015, "num_tokens": 2255941.0, "step": 905 }, { "entropy": 7.007370376586914, "epoch": 1.064327485380117, "grad_norm": 1.4765625, "learning_rate": 0.00045450000000000004, "loss": 6.9809, "mean_token_accuracy": 0.14777857810258865, "num_tokens": 2267162.0, "step": 910 }, { "entropy": 7.138269233703613, "epoch": 1.0701754385964912, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 6.9496, "mean_token_accuracy": 0.14804905876517296, "num_tokens": 2279290.0, "step": 915 }, { "entropy": 7.11580114364624, "epoch": 1.0760233918128654, "grad_norm": 1.1015625, "learning_rate": 0.00045950000000000006, "loss": 7.0084, "mean_token_accuracy": 0.13601162061095237, "num_tokens": 2293053.0, "step": 920 }, { "entropy": 7.015692281723022, "epoch": 1.0818713450292399, "grad_norm": 1.0703125, "learning_rate": 0.000462, "loss": 6.9212, "mean_token_accuracy": 0.14603447318077087, "num_tokens": 2305489.0, "step": 925 }, { "entropy": 7.051322793960571, "epoch": 1.087719298245614, "grad_norm": 1.03125, "learning_rate": 0.0004645, "loss": 6.8687, "mean_token_accuracy": 0.15775832384824753, "num_tokens": 2319310.0, "step": 930 }, { "entropy": 7.131311130523682, "epoch": 1.0935672514619883, "grad_norm": 0.98828125, "learning_rate": 0.000467, "loss": 7.0298, "mean_token_accuracy": 0.13980275765061378, "num_tokens": 2332132.0, "step": 935 }, { "entropy": 7.102800178527832, "epoch": 1.0994152046783625, "grad_norm": 1.1328125, "learning_rate": 0.0004695, "loss": 7.0008, "mean_token_accuracy": 0.14390438795089722, "num_tokens": 2343505.0, "step": 940 }, { "entropy": 7.119720315933227, "epoch": 1.1052631578947367, "grad_norm": 1.046875, "learning_rate": 0.000472, "loss": 6.9893, "mean_token_accuracy": 0.14247232899069787, "num_tokens": 2355930.0, "step": 945 }, { "entropy": 7.099494981765747, "epoch": 1.1111111111111112, "grad_norm": 1.015625, "learning_rate": 0.0004745, "loss": 6.9565, "mean_token_accuracy": 0.14375333711504937, "num_tokens": 2369820.0, "step": 950 }, { "entropy": 7.016859483718872, "epoch": 1.1169590643274854, "grad_norm": 1.0703125, "learning_rate": 0.000477, "loss": 6.9159, "mean_token_accuracy": 0.14982443079352378, "num_tokens": 2382375.0, "step": 955 }, { "entropy": 7.053458166122437, "epoch": 1.1228070175438596, "grad_norm": 1.1640625, "learning_rate": 0.0004795, "loss": 7.0089, "mean_token_accuracy": 0.14104411751031876, "num_tokens": 2393391.0, "step": 960 }, { "entropy": 7.047031879425049, "epoch": 1.128654970760234, "grad_norm": 1.171875, "learning_rate": 0.000482, "loss": 6.9345, "mean_token_accuracy": 0.1424281544983387, "num_tokens": 2405266.0, "step": 965 }, { "entropy": 7.0777851104736325, "epoch": 1.1345029239766082, "grad_norm": 1.0546875, "learning_rate": 0.0004845, "loss": 6.9704, "mean_token_accuracy": 0.14111316949129105, "num_tokens": 2418620.0, "step": 970 }, { "entropy": 7.027369260787964, "epoch": 1.1403508771929824, "grad_norm": 1.1328125, "learning_rate": 0.000487, "loss": 7.065, "mean_token_accuracy": 0.1403935208916664, "num_tokens": 2431107.0, "step": 975 }, { "entropy": 7.187720537185669, "epoch": 1.1461988304093567, "grad_norm": 1.046875, "learning_rate": 0.0004895, "loss": 7.0144, "mean_token_accuracy": 0.13802240937948226, "num_tokens": 2443729.0, "step": 980 }, { "entropy": 7.010544013977051, "epoch": 1.1520467836257309, "grad_norm": 1.0625, "learning_rate": 0.000492, "loss": 6.9195, "mean_token_accuracy": 0.14878860712051392, "num_tokens": 2456798.0, "step": 985 }, { "entropy": 7.0476819515228275, "epoch": 1.1578947368421053, "grad_norm": 1.1328125, "learning_rate": 0.0004945, "loss": 7.009, "mean_token_accuracy": 0.1457380011677742, "num_tokens": 2468701.0, "step": 990 }, { "entropy": 6.9938723087310795, "epoch": 1.1637426900584795, "grad_norm": 1.09375, "learning_rate": 0.000497, "loss": 6.9561, "mean_token_accuracy": 0.14130357205867766, "num_tokens": 2480391.0, "step": 995 }, { "entropy": 7.076553392410278, "epoch": 1.1695906432748537, "grad_norm": 1.015625, "learning_rate": 0.0004995, "loss": 6.9596, "mean_token_accuracy": 0.14768824875354766, "num_tokens": 2491887.0, "step": 1000 }, { "epoch": 1.1695906432748537, "eval_entropy": 6.926040534072921, "eval_loss": 7.151692867279053, "eval_mean_token_accuracy": 0.13112522253167752, "eval_num_tokens": 2491887.0, "eval_runtime": 2.2827, "eval_samples_per_second": 1185.89, "eval_steps_per_second": 148.51, "step": 1000 }, { "entropy": 7.03064193725586, "epoch": 1.1754385964912282, "grad_norm": 1.1015625, "learning_rate": 0.0004999996875147963, "loss": 6.9415, "mean_token_accuracy": 0.14060102105140687, "num_tokens": 2503490.0, "step": 1005 }, { "entropy": 7.09430251121521, "epoch": 1.1812865497076024, "grad_norm": 1.1015625, "learning_rate": 0.0004999984180451436, "loss": 7.0456, "mean_token_accuracy": 0.13780836313962935, "num_tokens": 2515330.0, "step": 1010 }, { "entropy": 7.0454943656921385, "epoch": 1.1871345029239766, "grad_norm": 1.0703125, "learning_rate": 0.0004999961720662221, "loss": 6.9752, "mean_token_accuracy": 0.1445000797510147, "num_tokens": 2526743.0, "step": 1015 }, { "entropy": 6.988425970077515, "epoch": 1.1929824561403508, "grad_norm": 1.03125, "learning_rate": 0.0004999929495877796, "loss": 7.0217, "mean_token_accuracy": 0.14440475553274154, "num_tokens": 2538343.0, "step": 1020 }, { "entropy": 7.189151477813721, "epoch": 1.198830409356725, "grad_norm": 2.21875, "learning_rate": 0.0004999887506238018, "loss": 7.1389, "mean_token_accuracy": 0.13006046786904335, "num_tokens": 2552687.0, "step": 1025 }, { "entropy": 6.918720817565918, "epoch": 1.2046783625730995, "grad_norm": 1.3671875, "learning_rate": 0.0004999835751925124, "loss": 6.9506, "mean_token_accuracy": 0.15075658932328223, "num_tokens": 2565666.0, "step": 1030 }, { "entropy": 6.996754360198975, "epoch": 1.2105263157894737, "grad_norm": 1.171875, "learning_rate": 0.0004999774233163734, "loss": 6.9527, "mean_token_accuracy": 0.1366286665201187, "num_tokens": 2578233.0, "step": 1035 }, { "entropy": 7.082205200195313, "epoch": 1.2163742690058479, "grad_norm": 1.0, "learning_rate": 0.0004999702950220841, "loss": 6.9552, "mean_token_accuracy": 0.14596255272626876, "num_tokens": 2590221.0, "step": 1040 }, { "entropy": 6.949472808837891, "epoch": 1.2222222222222223, "grad_norm": 1.1015625, "learning_rate": 0.0004999621903405819, "loss": 6.9768, "mean_token_accuracy": 0.13911690190434456, "num_tokens": 2602807.0, "step": 1045 }, { "entropy": 7.050590658187867, "epoch": 1.2280701754385965, "grad_norm": 1.0, "learning_rate": 0.000499953109307042, "loss": 7.0195, "mean_token_accuracy": 0.13519042506814002, "num_tokens": 2615273.0, "step": 1050 }, { "entropy": 7.007106781005859, "epoch": 1.2339181286549707, "grad_norm": 1.0, "learning_rate": 0.0004999430519608762, "loss": 6.9877, "mean_token_accuracy": 0.13718256056308747, "num_tokens": 2627077.0, "step": 1055 }, { "entropy": 7.059272384643554, "epoch": 1.239766081871345, "grad_norm": 1.1171875, "learning_rate": 0.0004999320183457346, "loss": 6.9618, "mean_token_accuracy": 0.13905680626630784, "num_tokens": 2640580.0, "step": 1060 }, { "entropy": 6.970555400848388, "epoch": 1.2456140350877192, "grad_norm": 1.0078125, "learning_rate": 0.0004999200085095035, "loss": 7.0246, "mean_token_accuracy": 0.13743191361427307, "num_tokens": 2653906.0, "step": 1065 }, { "entropy": 6.9946081161499025, "epoch": 1.2514619883040936, "grad_norm": 0.97265625, "learning_rate": 0.0004999070225043068, "loss": 6.97, "mean_token_accuracy": 0.14154034852981567, "num_tokens": 2666021.0, "step": 1070 }, { "entropy": 7.074818181991577, "epoch": 1.2573099415204678, "grad_norm": 1.015625, "learning_rate": 0.0004998930603865042, "loss": 6.9002, "mean_token_accuracy": 0.14058925807476044, "num_tokens": 2678542.0, "step": 1075 }, { "entropy": 6.897901296615601, "epoch": 1.263157894736842, "grad_norm": 1.03125, "learning_rate": 0.0004998781222166929, "loss": 6.943, "mean_token_accuracy": 0.14766753390431403, "num_tokens": 2691006.0, "step": 1080 }, { "entropy": 7.105810642242432, "epoch": 1.2690058479532165, "grad_norm": 0.9609375, "learning_rate": 0.0004998622080597052, "loss": 7.0293, "mean_token_accuracy": 0.14189143255352973, "num_tokens": 2704064.0, "step": 1085 }, { "entropy": 6.975711107254028, "epoch": 1.2748538011695907, "grad_norm": 1.078125, "learning_rate": 0.0004998453179846098, "loss": 6.9269, "mean_token_accuracy": 0.13873959332704544, "num_tokens": 2717452.0, "step": 1090 }, { "entropy": 6.936954832077026, "epoch": 1.280701754385965, "grad_norm": 1.0546875, "learning_rate": 0.0004998274520647109, "loss": 6.8894, "mean_token_accuracy": 0.1417660728096962, "num_tokens": 2730969.0, "step": 1095 }, { "entropy": 6.8774402141571045, "epoch": 1.286549707602339, "grad_norm": 1.015625, "learning_rate": 0.0004998086103775478, "loss": 6.8991, "mean_token_accuracy": 0.1409339912235737, "num_tokens": 2742648.0, "step": 1100 }, { "entropy": 6.919243955612183, "epoch": 1.2923976608187133, "grad_norm": 1.125, "learning_rate": 0.0004997887930048947, "loss": 6.8285, "mean_token_accuracy": 0.1467128537595272, "num_tokens": 2754816.0, "step": 1105 }, { "entropy": 6.961157989501953, "epoch": 1.2982456140350878, "grad_norm": 0.95703125, "learning_rate": 0.0004997680000327607, "loss": 6.9841, "mean_token_accuracy": 0.13582526817917823, "num_tokens": 2767066.0, "step": 1110 }, { "entropy": 6.939070129394532, "epoch": 1.304093567251462, "grad_norm": 1.0078125, "learning_rate": 0.0004997462315513884, "loss": 6.873, "mean_token_accuracy": 0.14410377591848372, "num_tokens": 2779251.0, "step": 1115 }, { "entropy": 6.994794654846191, "epoch": 1.3099415204678362, "grad_norm": 0.96484375, "learning_rate": 0.000499723487655255, "loss": 6.8864, "mean_token_accuracy": 0.1423727609217167, "num_tokens": 2791743.0, "step": 1120 }, { "entropy": 6.952969026565552, "epoch": 1.3157894736842106, "grad_norm": 0.9375, "learning_rate": 0.0004996997684430703, "loss": 6.9278, "mean_token_accuracy": 0.14672429263591766, "num_tokens": 2804694.0, "step": 1125 }, { "entropy": 6.930943393707276, "epoch": 1.3216374269005848, "grad_norm": 1.109375, "learning_rate": 0.0004996750740177775, "loss": 6.905, "mean_token_accuracy": 0.14298794865608216, "num_tokens": 2816484.0, "step": 1130 }, { "entropy": 6.945026159286499, "epoch": 1.327485380116959, "grad_norm": 0.953125, "learning_rate": 0.0004996494044865521, "loss": 6.9284, "mean_token_accuracy": 0.1373042084276676, "num_tokens": 2829353.0, "step": 1135 }, { "entropy": 6.875068235397339, "epoch": 1.3333333333333333, "grad_norm": 0.9609375, "learning_rate": 0.0004996227599608018, "loss": 6.8588, "mean_token_accuracy": 0.14598043411970138, "num_tokens": 2842695.0, "step": 1140 }, { "entropy": 6.885642242431641, "epoch": 1.3391812865497075, "grad_norm": 1.09375, "learning_rate": 0.0004995951405561658, "loss": 6.836, "mean_token_accuracy": 0.14788470193743705, "num_tokens": 2855627.0, "step": 1145 }, { "entropy": 6.8490643978118895, "epoch": 1.345029239766082, "grad_norm": 1.0625, "learning_rate": 0.0004995665463925142, "loss": 6.8251, "mean_token_accuracy": 0.15566134750843047, "num_tokens": 2868132.0, "step": 1150 }, { "entropy": 6.898070859909057, "epoch": 1.3508771929824561, "grad_norm": 1.0, "learning_rate": 0.0004995369775939478, "loss": 6.8227, "mean_token_accuracy": 0.13949502557516097, "num_tokens": 2880641.0, "step": 1155 }, { "entropy": 6.863165760040284, "epoch": 1.3567251461988303, "grad_norm": 1.03125, "learning_rate": 0.0004995064342887972, "loss": 6.8693, "mean_token_accuracy": 0.14175399467349054, "num_tokens": 2892479.0, "step": 1160 }, { "entropy": 6.998213052749634, "epoch": 1.3625730994152048, "grad_norm": 0.9296875, "learning_rate": 0.0004994749166096226, "loss": 6.9284, "mean_token_accuracy": 0.14056200981140138, "num_tokens": 2905675.0, "step": 1165 }, { "entropy": 6.885084772109986, "epoch": 1.368421052631579, "grad_norm": 1.015625, "learning_rate": 0.0004994424246932129, "loss": 6.9458, "mean_token_accuracy": 0.1405379667878151, "num_tokens": 2918259.0, "step": 1170 }, { "entropy": 6.960570287704468, "epoch": 1.3742690058479532, "grad_norm": 0.97265625, "learning_rate": 0.0004994089586805856, "loss": 6.8332, "mean_token_accuracy": 0.15375758558511735, "num_tokens": 2932280.0, "step": 1175 }, { "entropy": 6.81732406616211, "epoch": 1.3801169590643274, "grad_norm": 1.0546875, "learning_rate": 0.0004993745187169852, "loss": 6.877, "mean_token_accuracy": 0.14667267948389054, "num_tokens": 2944385.0, "step": 1180 }, { "entropy": 6.933884525299073, "epoch": 1.3859649122807016, "grad_norm": 1.1328125, "learning_rate": 0.000499339104951884, "loss": 6.8819, "mean_token_accuracy": 0.13797343596816064, "num_tokens": 2956239.0, "step": 1185 }, { "entropy": 6.908072471618652, "epoch": 1.391812865497076, "grad_norm": 0.98046875, "learning_rate": 0.00049930271753898, "loss": 6.9006, "mean_token_accuracy": 0.14377526491880416, "num_tokens": 2967948.0, "step": 1190 }, { "entropy": 6.873384141921997, "epoch": 1.3976608187134503, "grad_norm": 0.98828125, "learning_rate": 0.0004992653566361974, "loss": 6.8464, "mean_token_accuracy": 0.14522414803504943, "num_tokens": 2979589.0, "step": 1195 }, { "entropy": 6.831958150863647, "epoch": 1.4035087719298245, "grad_norm": 0.9765625, "learning_rate": 0.0004992270224056849, "loss": 6.8398, "mean_token_accuracy": 0.14143177419900893, "num_tokens": 2991679.0, "step": 1200 }, { "entropy": 6.917820596694947, "epoch": 1.409356725146199, "grad_norm": 1.0078125, "learning_rate": 0.0004991877150138162, "loss": 6.8751, "mean_token_accuracy": 0.13764828592538833, "num_tokens": 3004037.0, "step": 1205 }, { "entropy": 6.871622037887573, "epoch": 1.4152046783625731, "grad_norm": 0.9765625, "learning_rate": 0.0004991474346311879, "loss": 6.8488, "mean_token_accuracy": 0.14050350114703178, "num_tokens": 3016632.0, "step": 1210 }, { "entropy": 6.868418455123901, "epoch": 1.4210526315789473, "grad_norm": 1.015625, "learning_rate": 0.0004991061814326198, "loss": 6.8466, "mean_token_accuracy": 0.14317608624696732, "num_tokens": 3029095.0, "step": 1215 }, { "entropy": 6.901586484909058, "epoch": 1.4269005847953216, "grad_norm": 0.9375, "learning_rate": 0.0004990639555971539, "loss": 6.8753, "mean_token_accuracy": 0.13867598176002502, "num_tokens": 3042467.0, "step": 1220 }, { "entropy": 6.995685815811157, "epoch": 1.4327485380116958, "grad_norm": 0.94140625, "learning_rate": 0.0004990207573080533, "loss": 6.9927, "mean_token_accuracy": 0.13158960789442062, "num_tokens": 3056233.0, "step": 1225 }, { "entropy": 6.840405225753784, "epoch": 1.4385964912280702, "grad_norm": 1.0078125, "learning_rate": 0.0004989765867528014, "loss": 6.9191, "mean_token_accuracy": 0.14545614793896675, "num_tokens": 3069216.0, "step": 1230 }, { "entropy": 6.882023048400879, "epoch": 1.4444444444444444, "grad_norm": 0.94140625, "learning_rate": 0.0004989314441231019, "loss": 6.8113, "mean_token_accuracy": 0.15136598646640778, "num_tokens": 3081116.0, "step": 1235 }, { "entropy": 6.936877727508545, "epoch": 1.4502923976608186, "grad_norm": 1.0078125, "learning_rate": 0.000498885329614877, "loss": 6.9482, "mean_token_accuracy": 0.13658374026417733, "num_tokens": 3093284.0, "step": 1240 }, { "entropy": 6.829084968566894, "epoch": 1.456140350877193, "grad_norm": 1.0625, "learning_rate": 0.0004988382434282668, "loss": 6.856, "mean_token_accuracy": 0.14588840380311013, "num_tokens": 3105147.0, "step": 1245 }, { "entropy": 6.857968950271607, "epoch": 1.4619883040935673, "grad_norm": 0.99609375, "learning_rate": 0.000498790185767629, "loss": 6.8391, "mean_token_accuracy": 0.1462831415235996, "num_tokens": 3116457.0, "step": 1250 }, { "entropy": 6.828664684295655, "epoch": 1.4678362573099415, "grad_norm": 0.98828125, "learning_rate": 0.000498741156841537, "loss": 6.8415, "mean_token_accuracy": 0.1462543435394764, "num_tokens": 3128223.0, "step": 1255 }, { "entropy": 6.85268268585205, "epoch": 1.4736842105263157, "grad_norm": 1.03125, "learning_rate": 0.00049869115686278, "loss": 6.8888, "mean_token_accuracy": 0.14214529991149902, "num_tokens": 3139886.0, "step": 1260 }, { "entropy": 6.931294393539429, "epoch": 1.47953216374269, "grad_norm": 0.93359375, "learning_rate": 0.0004986401860483615, "loss": 6.878, "mean_token_accuracy": 0.13950230181217194, "num_tokens": 3152624.0, "step": 1265 }, { "entropy": 6.762976217269897, "epoch": 1.4853801169590644, "grad_norm": 0.9609375, "learning_rate": 0.0004985882446194984, "loss": 6.7706, "mean_token_accuracy": 0.14813553541898727, "num_tokens": 3164881.0, "step": 1270 }, { "entropy": 6.894041299819946, "epoch": 1.4912280701754386, "grad_norm": 0.99609375, "learning_rate": 0.0004985353328016204, "loss": 6.8605, "mean_token_accuracy": 0.13663011640310288, "num_tokens": 3177967.0, "step": 1275 }, { "entropy": 6.873754501342773, "epoch": 1.4970760233918128, "grad_norm": 0.9921875, "learning_rate": 0.0004984814508243685, "loss": 6.8768, "mean_token_accuracy": 0.14321380108594894, "num_tokens": 3190646.0, "step": 1280 }, { "entropy": 6.8783287525177, "epoch": 1.5029239766081872, "grad_norm": 1.4140625, "learning_rate": 0.0004984265989215942, "loss": 6.8155, "mean_token_accuracy": 0.13877278193831444, "num_tokens": 3203299.0, "step": 1285 }, { "entropy": 6.81124324798584, "epoch": 1.5087719298245614, "grad_norm": 1.015625, "learning_rate": 0.0004983707773313589, "loss": 6.9135, "mean_token_accuracy": 0.13964597284793853, "num_tokens": 3215992.0, "step": 1290 }, { "entropy": 6.783960151672363, "epoch": 1.5146198830409356, "grad_norm": 1.1328125, "learning_rate": 0.0004983139862959322, "loss": 6.8065, "mean_token_accuracy": 0.14580969959497453, "num_tokens": 3228989.0, "step": 1295 }, { "entropy": 6.869039011001587, "epoch": 1.52046783625731, "grad_norm": 0.984375, "learning_rate": 0.0004982562260617912, "loss": 6.9118, "mean_token_accuracy": 0.1454062916338444, "num_tokens": 3241635.0, "step": 1300 }, { "entropy": 6.80722713470459, "epoch": 1.526315789473684, "grad_norm": 0.89453125, "learning_rate": 0.0004981974968796197, "loss": 6.843, "mean_token_accuracy": 0.14277214854955672, "num_tokens": 3253590.0, "step": 1305 }, { "entropy": 6.783811759948731, "epoch": 1.5321637426900585, "grad_norm": 1.0625, "learning_rate": 0.0004981377990043064, "loss": 6.7871, "mean_token_accuracy": 0.15090060085058213, "num_tokens": 3264859.0, "step": 1310 }, { "entropy": 6.9159692287445065, "epoch": 1.5380116959064327, "grad_norm": 1.03125, "learning_rate": 0.0004980771326949442, "loss": 6.8957, "mean_token_accuracy": 0.14444180428981782, "num_tokens": 3276353.0, "step": 1315 }, { "entropy": 6.745017957687378, "epoch": 1.543859649122807, "grad_norm": 0.94921875, "learning_rate": 0.0004980154982148296, "loss": 6.8208, "mean_token_accuracy": 0.14608026593923568, "num_tokens": 3288876.0, "step": 1320 }, { "entropy": 6.809013080596924, "epoch": 1.5497076023391814, "grad_norm": 0.98828125, "learning_rate": 0.0004979528958314604, "loss": 6.8369, "mean_token_accuracy": 0.13851020634174346, "num_tokens": 3300648.0, "step": 1325 }, { "entropy": 6.806869745254517, "epoch": 1.5555555555555556, "grad_norm": 0.98828125, "learning_rate": 0.0004978893258165354, "loss": 6.7788, "mean_token_accuracy": 0.1443500228226185, "num_tokens": 3313664.0, "step": 1330 }, { "entropy": 6.917032289505005, "epoch": 1.5614035087719298, "grad_norm": 0.95703125, "learning_rate": 0.0004978247884459532, "loss": 6.8891, "mean_token_accuracy": 0.13166723549365997, "num_tokens": 3326221.0, "step": 1335 }, { "entropy": 6.7701085090637205, "epoch": 1.5672514619883042, "grad_norm": 1.125, "learning_rate": 0.0004977592839998105, "loss": 6.8167, "mean_token_accuracy": 0.14367288127541541, "num_tokens": 3337470.0, "step": 1340 }, { "entropy": 6.8947234630584715, "epoch": 1.5730994152046782, "grad_norm": 1.140625, "learning_rate": 0.0004976928127624013, "loss": 6.9031, "mean_token_accuracy": 0.14372491762042044, "num_tokens": 3350925.0, "step": 1345 }, { "entropy": 6.732043361663818, "epoch": 1.5789473684210527, "grad_norm": 1.4609375, "learning_rate": 0.0004976253750222157, "loss": 6.8264, "mean_token_accuracy": 0.14307058081030846, "num_tokens": 3363387.0, "step": 1350 }, { "entropy": 6.8033754348754885, "epoch": 1.5847953216374269, "grad_norm": 0.99609375, "learning_rate": 0.0004975569710719382, "loss": 6.8028, "mean_token_accuracy": 0.14749399870634078, "num_tokens": 3376640.0, "step": 1355 }, { "entropy": 6.904033422470093, "epoch": 1.590643274853801, "grad_norm": 0.984375, "learning_rate": 0.0004974876012084468, "loss": 6.8209, "mean_token_accuracy": 0.14032859951257706, "num_tokens": 3389848.0, "step": 1360 }, { "entropy": 6.781014633178711, "epoch": 1.5964912280701755, "grad_norm": 1.015625, "learning_rate": 0.0004974172657328116, "loss": 6.8459, "mean_token_accuracy": 0.14404987692832946, "num_tokens": 3401862.0, "step": 1365 }, { "entropy": 6.809361743927002, "epoch": 1.6023391812865497, "grad_norm": 1.0234375, "learning_rate": 0.0004973459649502939, "loss": 6.8454, "mean_token_accuracy": 0.14433501437306404, "num_tokens": 3414719.0, "step": 1370 }, { "entropy": 6.862741851806641, "epoch": 1.608187134502924, "grad_norm": 1.03125, "learning_rate": 0.0004972736991703439, "loss": 6.7987, "mean_token_accuracy": 0.14657391011714935, "num_tokens": 3427391.0, "step": 1375 }, { "entropy": 6.804032707214356, "epoch": 1.6140350877192984, "grad_norm": 0.97265625, "learning_rate": 0.0004972004687066005, "loss": 6.8671, "mean_token_accuracy": 0.14304091930389404, "num_tokens": 3440203.0, "step": 1380 }, { "entropy": 6.806503057479858, "epoch": 1.6198830409356724, "grad_norm": 1.15625, "learning_rate": 0.000497126273876889, "loss": 6.7804, "mean_token_accuracy": 0.14722208082675933, "num_tokens": 3451801.0, "step": 1385 }, { "entropy": 6.850189828872681, "epoch": 1.6257309941520468, "grad_norm": 0.97265625, "learning_rate": 0.0004970511150032205, "loss": 6.7863, "mean_token_accuracy": 0.1449687287211418, "num_tokens": 3464039.0, "step": 1390 }, { "entropy": 6.808931350708008, "epoch": 1.631578947368421, "grad_norm": 0.90625, "learning_rate": 0.0004969749924117896, "loss": 6.8233, "mean_token_accuracy": 0.14308529123663902, "num_tokens": 3476373.0, "step": 1395 }, { "entropy": 6.705229377746582, "epoch": 1.6374269005847952, "grad_norm": 1.0625, "learning_rate": 0.0004968979064329741, "loss": 6.7733, "mean_token_accuracy": 0.1510583981871605, "num_tokens": 3487586.0, "step": 1400 }, { "entropy": 6.747954416275024, "epoch": 1.6432748538011697, "grad_norm": 0.98828125, "learning_rate": 0.0004968198574013323, "loss": 6.7678, "mean_token_accuracy": 0.14269521757960318, "num_tokens": 3501210.0, "step": 1405 }, { "entropy": 6.826955032348633, "epoch": 1.6491228070175439, "grad_norm": 0.984375, "learning_rate": 0.000496740845655603, "loss": 6.786, "mean_token_accuracy": 0.143802759796381, "num_tokens": 3513958.0, "step": 1410 }, { "entropy": 6.692679595947266, "epoch": 1.654970760233918, "grad_norm": 0.94921875, "learning_rate": 0.0004966608715387029, "loss": 6.7705, "mean_token_accuracy": 0.15449799299240113, "num_tokens": 3526297.0, "step": 1415 }, { "entropy": 6.825113105773926, "epoch": 1.6608187134502925, "grad_norm": 0.95703125, "learning_rate": 0.0004965799353977248, "loss": 6.7264, "mean_token_accuracy": 0.1499396577477455, "num_tokens": 3538308.0, "step": 1420 }, { "entropy": 6.663604831695556, "epoch": 1.6666666666666665, "grad_norm": 1.0546875, "learning_rate": 0.0004964980375839379, "loss": 6.7788, "mean_token_accuracy": 0.14948643296957015, "num_tokens": 3550240.0, "step": 1425 }, { "entropy": 6.810740041732788, "epoch": 1.672514619883041, "grad_norm": 1.125, "learning_rate": 0.0004964151784527844, "loss": 6.8177, "mean_token_accuracy": 0.14038417786359786, "num_tokens": 3562181.0, "step": 1430 }, { "entropy": 6.7995506763458256, "epoch": 1.6783625730994152, "grad_norm": 0.953125, "learning_rate": 0.000496331358363879, "loss": 6.8748, "mean_token_accuracy": 0.14474193155765533, "num_tokens": 3574643.0, "step": 1435 }, { "entropy": 6.722173357009888, "epoch": 1.6842105263157894, "grad_norm": 0.98046875, "learning_rate": 0.0004962465776810066, "loss": 6.6783, "mean_token_accuracy": 0.14990489184856415, "num_tokens": 3586415.0, "step": 1440 }, { "entropy": 6.80692310333252, "epoch": 1.6900584795321638, "grad_norm": 1.0390625, "learning_rate": 0.0004961608367721217, "loss": 6.796, "mean_token_accuracy": 0.14830706417560577, "num_tokens": 3598452.0, "step": 1445 }, { "entropy": 6.748047399520874, "epoch": 1.695906432748538, "grad_norm": 0.9921875, "learning_rate": 0.0004960741360093459, "loss": 6.8383, "mean_token_accuracy": 0.1371912442147732, "num_tokens": 3610899.0, "step": 1450 }, { "entropy": 6.785003566741944, "epoch": 1.7017543859649122, "grad_norm": 0.9453125, "learning_rate": 0.0004959864757689669, "loss": 6.7816, "mean_token_accuracy": 0.14844242185354234, "num_tokens": 3622475.0, "step": 1455 }, { "entropy": 6.718051433563232, "epoch": 1.7076023391812867, "grad_norm": 0.97265625, "learning_rate": 0.0004958978564314361, "loss": 6.8765, "mean_token_accuracy": 0.1463383197784424, "num_tokens": 3635860.0, "step": 1460 }, { "entropy": 6.84115424156189, "epoch": 1.7134502923976607, "grad_norm": 0.875, "learning_rate": 0.000495808278381368, "loss": 6.8372, "mean_token_accuracy": 0.13889722377061844, "num_tokens": 3648718.0, "step": 1465 }, { "entropy": 6.708309984207153, "epoch": 1.719298245614035, "grad_norm": 0.96484375, "learning_rate": 0.0004957177420075377, "loss": 6.7553, "mean_token_accuracy": 0.14848395586013793, "num_tokens": 3660746.0, "step": 1470 }, { "entropy": 6.7734802722930905, "epoch": 1.7251461988304093, "grad_norm": 0.8984375, "learning_rate": 0.0004956262477028797, "loss": 6.7964, "mean_token_accuracy": 0.14100225493311883, "num_tokens": 3673573.0, "step": 1475 }, { "entropy": 6.736315965652466, "epoch": 1.7309941520467835, "grad_norm": 1.0859375, "learning_rate": 0.0004955337958644857, "loss": 6.6375, "mean_token_accuracy": 0.1544882595539093, "num_tokens": 3685771.0, "step": 1480 }, { "entropy": 6.674497795104981, "epoch": 1.736842105263158, "grad_norm": 0.9609375, "learning_rate": 0.0004954403868936032, "loss": 6.7876, "mean_token_accuracy": 0.1484549582004547, "num_tokens": 3698882.0, "step": 1485 }, { "entropy": 6.761597156524658, "epoch": 1.7426900584795322, "grad_norm": 0.984375, "learning_rate": 0.000495346021195634, "loss": 6.8086, "mean_token_accuracy": 0.14867511242628098, "num_tokens": 3712820.0, "step": 1490 }, { "entropy": 6.776470708847046, "epoch": 1.7485380116959064, "grad_norm": 0.96875, "learning_rate": 0.0004952506991801319, "loss": 6.7569, "mean_token_accuracy": 0.14823356494307519, "num_tokens": 3724845.0, "step": 1495 }, { "entropy": 6.657959222793579, "epoch": 1.7543859649122808, "grad_norm": 0.95703125, "learning_rate": 0.0004951544212608015, "loss": 6.6243, "mean_token_accuracy": 0.16444699168205262, "num_tokens": 3736309.0, "step": 1500 }, { "epoch": 1.7543859649122808, "eval_entropy": 6.543074199935328, "eval_loss": 6.911302089691162, "eval_mean_token_accuracy": 0.1365549994500733, "eval_num_tokens": 3736309.0, "eval_runtime": 2.2834, "eval_samples_per_second": 1185.535, "eval_steps_per_second": 148.466, "step": 1500 }, { "entropy": 6.784309244155883, "epoch": 1.7602339181286548, "grad_norm": 0.98046875, "learning_rate": 0.0004950571878554956, "loss": 6.792, "mean_token_accuracy": 0.14341349452733992, "num_tokens": 3748800.0, "step": 1505 }, { "entropy": 6.687272214889527, "epoch": 1.7660818713450293, "grad_norm": 0.94921875, "learning_rate": 0.0004949589993862143, "loss": 6.7631, "mean_token_accuracy": 0.15106673985719682, "num_tokens": 3760753.0, "step": 1510 }, { "entropy": 6.770102500915527, "epoch": 1.7719298245614035, "grad_norm": 0.90234375, "learning_rate": 0.0004948598562791025, "loss": 6.8495, "mean_token_accuracy": 0.14250847771763803, "num_tokens": 3773915.0, "step": 1515 }, { "entropy": 6.74422779083252, "epoch": 1.7777777777777777, "grad_norm": 0.98046875, "learning_rate": 0.0004947597589644484, "loss": 6.7437, "mean_token_accuracy": 0.14317139536142348, "num_tokens": 3785907.0, "step": 1520 }, { "entropy": 6.7505429744720455, "epoch": 1.7836257309941521, "grad_norm": 0.9140625, "learning_rate": 0.0004946587078766818, "loss": 6.6894, "mean_token_accuracy": 0.15321093127131463, "num_tokens": 3798407.0, "step": 1525 }, { "entropy": 6.542722606658936, "epoch": 1.7894736842105263, "grad_norm": 0.97265625, "learning_rate": 0.0004945567034543712, "loss": 6.704, "mean_token_accuracy": 0.15031700879335402, "num_tokens": 3810586.0, "step": 1530 }, { "entropy": 6.850691318511963, "epoch": 1.7953216374269005, "grad_norm": 1.125, "learning_rate": 0.0004944537461402234, "loss": 6.7884, "mean_token_accuracy": 0.14434545189142228, "num_tokens": 3823901.0, "step": 1535 }, { "entropy": 6.730458450317383, "epoch": 1.801169590643275, "grad_norm": 0.94140625, "learning_rate": 0.0004943498363810807, "loss": 6.8062, "mean_token_accuracy": 0.13911711871623994, "num_tokens": 3836926.0, "step": 1540 }, { "entropy": 6.723568391799927, "epoch": 1.807017543859649, "grad_norm": 0.9921875, "learning_rate": 0.0004942449746279184, "loss": 6.5866, "mean_token_accuracy": 0.15482160598039627, "num_tokens": 3849291.0, "step": 1545 }, { "entropy": 6.727809047698974, "epoch": 1.8128654970760234, "grad_norm": 0.97265625, "learning_rate": 0.0004941391613358444, "loss": 6.8201, "mean_token_accuracy": 0.1427263304591179, "num_tokens": 3862002.0, "step": 1550 }, { "entropy": 6.651541233062744, "epoch": 1.8187134502923976, "grad_norm": 0.94921875, "learning_rate": 0.000494032396964096, "loss": 6.725, "mean_token_accuracy": 0.1479753792285919, "num_tokens": 3874538.0, "step": 1555 }, { "entropy": 6.704821348190308, "epoch": 1.8245614035087718, "grad_norm": 0.88671875, "learning_rate": 0.000493924681976038, "loss": 6.6901, "mean_token_accuracy": 0.1507028266787529, "num_tokens": 3886682.0, "step": 1560 }, { "entropy": 6.611117172241211, "epoch": 1.8304093567251463, "grad_norm": 0.953125, "learning_rate": 0.0004938160168391614, "loss": 6.6522, "mean_token_accuracy": 0.14730015993118287, "num_tokens": 3898144.0, "step": 1565 }, { "entropy": 6.8177355289459225, "epoch": 1.8362573099415205, "grad_norm": 0.96484375, "learning_rate": 0.0004937064020250804, "loss": 6.8447, "mean_token_accuracy": 0.14146786481142043, "num_tokens": 3910209.0, "step": 1570 }, { "entropy": 6.690582036972046, "epoch": 1.8421052631578947, "grad_norm": 1.0, "learning_rate": 0.0004935958380095316, "loss": 6.764, "mean_token_accuracy": 0.15035033375024795, "num_tokens": 3923401.0, "step": 1575 }, { "entropy": 6.772142171859741, "epoch": 1.8479532163742691, "grad_norm": 0.94140625, "learning_rate": 0.0004934843252723702, "loss": 6.6814, "mean_token_accuracy": 0.1467684879899025, "num_tokens": 3934970.0, "step": 1580 }, { "entropy": 6.598661994934082, "epoch": 1.8538011695906431, "grad_norm": 0.9609375, "learning_rate": 0.00049337186429757, "loss": 6.5979, "mean_token_accuracy": 0.15314390659332275, "num_tokens": 3945543.0, "step": 1585 }, { "entropy": 6.618632888793945, "epoch": 1.8596491228070176, "grad_norm": 0.99609375, "learning_rate": 0.0004932584555732192, "loss": 6.7086, "mean_token_accuracy": 0.15223760306835174, "num_tokens": 3958152.0, "step": 1590 }, { "entropy": 6.754468250274658, "epoch": 1.8654970760233918, "grad_norm": 0.93359375, "learning_rate": 0.0004931440995915203, "loss": 6.7092, "mean_token_accuracy": 0.14498373717069626, "num_tokens": 3972173.0, "step": 1595 }, { "entropy": 6.704925966262818, "epoch": 1.871345029239766, "grad_norm": 0.89453125, "learning_rate": 0.000493028796848786, "loss": 6.7804, "mean_token_accuracy": 0.1387328766286373, "num_tokens": 3985865.0, "step": 1600 }, { "entropy": 6.787711143493652, "epoch": 1.8771929824561404, "grad_norm": 1.2890625, "learning_rate": 0.0004929125478454389, "loss": 6.6433, "mean_token_accuracy": 0.15223552137613297, "num_tokens": 3999026.0, "step": 1605 }, { "entropy": 6.648384428024292, "epoch": 1.8830409356725146, "grad_norm": 1.015625, "learning_rate": 0.0004927953530860077, "loss": 6.7554, "mean_token_accuracy": 0.14936705231666564, "num_tokens": 4011270.0, "step": 1610 }, { "entropy": 6.763438940048218, "epoch": 1.8888888888888888, "grad_norm": 0.921875, "learning_rate": 0.0004926772130791261, "loss": 6.7552, "mean_token_accuracy": 0.14583429992198943, "num_tokens": 4024162.0, "step": 1615 }, { "entropy": 6.708201503753662, "epoch": 1.8947368421052633, "grad_norm": 0.9609375, "learning_rate": 0.0004925581283375303, "loss": 6.7003, "mean_token_accuracy": 0.1484905406832695, "num_tokens": 4037066.0, "step": 1620 }, { "entropy": 6.667509937286377, "epoch": 1.9005847953216373, "grad_norm": 0.94921875, "learning_rate": 0.0004924380993780566, "loss": 6.7202, "mean_token_accuracy": 0.14748010113835336, "num_tokens": 4050096.0, "step": 1625 }, { "entropy": 6.7155702114105225, "epoch": 1.9064327485380117, "grad_norm": 0.94140625, "learning_rate": 0.0004923171267216392, "loss": 6.7029, "mean_token_accuracy": 0.14461838454008102, "num_tokens": 4061691.0, "step": 1630 }, { "entropy": 6.605735349655151, "epoch": 1.912280701754386, "grad_norm": 0.9375, "learning_rate": 0.0004921952108933083, "loss": 6.6427, "mean_token_accuracy": 0.15174098312854767, "num_tokens": 4073087.0, "step": 1635 }, { "entropy": 6.74940333366394, "epoch": 1.9181286549707601, "grad_norm": 0.95703125, "learning_rate": 0.0004920723524221871, "loss": 6.7546, "mean_token_accuracy": 0.149676413834095, "num_tokens": 4086055.0, "step": 1640 }, { "entropy": 6.657784175872803, "epoch": 1.9239766081871346, "grad_norm": 0.90234375, "learning_rate": 0.0004919485518414902, "loss": 6.6928, "mean_token_accuracy": 0.1461845487356186, "num_tokens": 4099258.0, "step": 1645 }, { "entropy": 6.716952657699585, "epoch": 1.9298245614035088, "grad_norm": 0.9609375, "learning_rate": 0.0004918238096885213, "loss": 6.7637, "mean_token_accuracy": 0.14263566285371782, "num_tokens": 4111545.0, "step": 1650 }, { "entropy": 6.661676263809204, "epoch": 1.935672514619883, "grad_norm": 0.9140625, "learning_rate": 0.00049169812650467, "loss": 6.7076, "mean_token_accuracy": 0.15014173984527587, "num_tokens": 4123373.0, "step": 1655 }, { "entropy": 6.673471117019654, "epoch": 1.9415204678362574, "grad_norm": 0.87109375, "learning_rate": 0.0004915715028354102, "loss": 6.7194, "mean_token_accuracy": 0.1462250053882599, "num_tokens": 4136551.0, "step": 1660 }, { "entropy": 6.69158616065979, "epoch": 1.9473684210526314, "grad_norm": 0.9609375, "learning_rate": 0.0004914439392302981, "loss": 6.6811, "mean_token_accuracy": 0.14650024399161338, "num_tokens": 4149560.0, "step": 1665 }, { "entropy": 6.646466588973999, "epoch": 1.9532163742690059, "grad_norm": 0.91796875, "learning_rate": 0.0004913154362429686, "loss": 6.5991, "mean_token_accuracy": 0.15584417134523393, "num_tokens": 4161767.0, "step": 1670 }, { "entropy": 6.681569337844849, "epoch": 1.95906432748538, "grad_norm": 0.921875, "learning_rate": 0.0004911859944311341, "loss": 6.6893, "mean_token_accuracy": 0.15823563933372498, "num_tokens": 4174203.0, "step": 1675 }, { "entropy": 6.643621110916138, "epoch": 1.9649122807017543, "grad_norm": 0.8984375, "learning_rate": 0.0004910556143565812, "loss": 6.7018, "mean_token_accuracy": 0.15049159824848174, "num_tokens": 4186725.0, "step": 1680 }, { "entropy": 6.665674304962158, "epoch": 1.9707602339181287, "grad_norm": 0.8984375, "learning_rate": 0.0004909242965851688, "loss": 6.7362, "mean_token_accuracy": 0.15222102999687195, "num_tokens": 4199278.0, "step": 1685 }, { "entropy": 6.739201164245605, "epoch": 1.976608187134503, "grad_norm": 0.87890625, "learning_rate": 0.0004907920416868253, "loss": 6.7216, "mean_token_accuracy": 0.14601051211357116, "num_tokens": 4213163.0, "step": 1690 }, { "entropy": 6.582593631744385, "epoch": 1.9824561403508771, "grad_norm": 1.0078125, "learning_rate": 0.0004906588502355467, "loss": 6.5807, "mean_token_accuracy": 0.14897475093603135, "num_tokens": 4225222.0, "step": 1695 }, { "entropy": 6.638074016571045, "epoch": 1.9883040935672516, "grad_norm": 1.0390625, "learning_rate": 0.0004905247228093933, "loss": 6.6304, "mean_token_accuracy": 0.15521894097328187, "num_tokens": 4236286.0, "step": 1700 }, { "entropy": 6.530340576171875, "epoch": 1.9941520467836256, "grad_norm": 1.03125, "learning_rate": 0.0004903896599904878, "loss": 6.6647, "mean_token_accuracy": 0.14791015088558196, "num_tokens": 4247462.0, "step": 1705 }, { "entropy": 6.7336372375488285, "epoch": 2.0, "grad_norm": 1.1953125, "learning_rate": 0.0004902536623650125, "loss": 6.7514, "mean_token_accuracy": 0.1418044872581959, "num_tokens": 4258968.0, "step": 1710 }, { "entropy": 6.613061475753784, "epoch": 2.0058479532163744, "grad_norm": 0.984375, "learning_rate": 0.0004901167305232068, "loss": 6.3199, "mean_token_accuracy": 0.15634880512952803, "num_tokens": 4271022.0, "step": 1715 }, { "entropy": 6.678990364074707, "epoch": 2.0116959064327484, "grad_norm": 0.94921875, "learning_rate": 0.0004899788650593648, "loss": 6.3559, "mean_token_accuracy": 0.1503312237560749, "num_tokens": 4283348.0, "step": 1720 }, { "entropy": 6.541168832778931, "epoch": 2.017543859649123, "grad_norm": 1.03125, "learning_rate": 0.0004898400665718325, "loss": 6.2881, "mean_token_accuracy": 0.15968621373176575, "num_tokens": 4295775.0, "step": 1725 }, { "entropy": 6.719831800460815, "epoch": 2.023391812865497, "grad_norm": 0.90234375, "learning_rate": 0.0004897003356630052, "loss": 6.3368, "mean_token_accuracy": 0.1551282972097397, "num_tokens": 4308408.0, "step": 1730 }, { "entropy": 6.478828239440918, "epoch": 2.0292397660818713, "grad_norm": 1.0, "learning_rate": 0.0004895596729393252, "loss": 6.2524, "mean_token_accuracy": 0.1626296654343605, "num_tokens": 4320614.0, "step": 1735 }, { "entropy": 6.523333215713501, "epoch": 2.0350877192982457, "grad_norm": 0.99609375, "learning_rate": 0.0004894180790112787, "loss": 6.2112, "mean_token_accuracy": 0.16793770492076873, "num_tokens": 4334118.0, "step": 1740 }, { "entropy": 6.555729389190674, "epoch": 2.0409356725146197, "grad_norm": 0.9609375, "learning_rate": 0.0004892755544933934, "loss": 6.3314, "mean_token_accuracy": 0.1544162929058075, "num_tokens": 4346486.0, "step": 1745 }, { "entropy": 6.517939233779908, "epoch": 2.046783625730994, "grad_norm": 0.95703125, "learning_rate": 0.0004891321000042361, "loss": 6.3986, "mean_token_accuracy": 0.15014228150248526, "num_tokens": 4358408.0, "step": 1750 }, { "entropy": 6.6038178443908695, "epoch": 2.0526315789473686, "grad_norm": 1.015625, "learning_rate": 0.0004889877161664096, "loss": 6.3349, "mean_token_accuracy": 0.15063187554478646, "num_tokens": 4369816.0, "step": 1755 }, { "entropy": 6.564553737640381, "epoch": 2.0584795321637426, "grad_norm": 0.9453125, "learning_rate": 0.00048884240360655, "loss": 6.3834, "mean_token_accuracy": 0.14581367149949073, "num_tokens": 4382192.0, "step": 1760 }, { "entropy": 6.567172908782959, "epoch": 2.064327485380117, "grad_norm": 0.8828125, "learning_rate": 0.0004886961629553242, "loss": 6.3496, "mean_token_accuracy": 0.15813596695661544, "num_tokens": 4395546.0, "step": 1765 }, { "entropy": 6.526296615600586, "epoch": 2.0701754385964914, "grad_norm": 1.03125, "learning_rate": 0.0004885489948474272, "loss": 6.3753, "mean_token_accuracy": 0.15297993570566176, "num_tokens": 4407988.0, "step": 1770 }, { "entropy": 6.5855114459991455, "epoch": 2.0760233918128654, "grad_norm": 1.015625, "learning_rate": 0.0004884008999215792, "loss": 6.2988, "mean_token_accuracy": 0.1582840144634247, "num_tokens": 4419668.0, "step": 1775 }, { "entropy": 6.584148645401001, "epoch": 2.08187134502924, "grad_norm": 0.890625, "learning_rate": 0.0004882518788205225, "loss": 6.3854, "mean_token_accuracy": 0.14738436043262482, "num_tokens": 4431493.0, "step": 1780 }, { "entropy": 6.5512090682983395, "epoch": 2.087719298245614, "grad_norm": 0.875, "learning_rate": 0.0004881019321910198, "loss": 6.353, "mean_token_accuracy": 0.15487503558397292, "num_tokens": 4443237.0, "step": 1785 }, { "entropy": 6.513033437728882, "epoch": 2.0935672514619883, "grad_norm": 1.0703125, "learning_rate": 0.00048795106068384985, "loss": 6.3583, "mean_token_accuracy": 0.15871656984090804, "num_tokens": 4455238.0, "step": 1790 }, { "entropy": 6.637407732009888, "epoch": 2.0994152046783627, "grad_norm": 0.8984375, "learning_rate": 0.000487799264953806, "loss": 6.4203, "mean_token_accuracy": 0.14721036553382874, "num_tokens": 4469180.0, "step": 1795 }, { "entropy": 6.610451412200928, "epoch": 2.1052631578947367, "grad_norm": 0.953125, "learning_rate": 0.0004876465456596926, "loss": 6.4533, "mean_token_accuracy": 0.1517632856965065, "num_tokens": 4481169.0, "step": 1800 }, { "entropy": 6.543406438827515, "epoch": 2.111111111111111, "grad_norm": 0.9453125, "learning_rate": 0.0004874929034643223, "loss": 6.3631, "mean_token_accuracy": 0.14619019031524658, "num_tokens": 4494051.0, "step": 1805 }, { "entropy": 6.454391813278198, "epoch": 2.116959064327485, "grad_norm": 1.0234375, "learning_rate": 0.0004873383390345132, "loss": 6.3206, "mean_token_accuracy": 0.16392768919467926, "num_tokens": 4508230.0, "step": 1810 }, { "entropy": 6.593087863922119, "epoch": 2.1228070175438596, "grad_norm": 0.84375, "learning_rate": 0.00048718285304108613, "loss": 6.3171, "mean_token_accuracy": 0.15622008740901946, "num_tokens": 4520555.0, "step": 1815 }, { "entropy": 6.444989585876465, "epoch": 2.128654970760234, "grad_norm": 0.94921875, "learning_rate": 0.00048702644615886137, "loss": 6.3646, "mean_token_accuracy": 0.151460662484169, "num_tokens": 4532126.0, "step": 1820 }, { "entropy": 6.621482419967651, "epoch": 2.134502923976608, "grad_norm": 0.94921875, "learning_rate": 0.00048686911906665597, "loss": 6.4521, "mean_token_accuracy": 0.14833228290081024, "num_tokens": 4543754.0, "step": 1825 }, { "entropy": 6.429253005981446, "epoch": 2.1403508771929824, "grad_norm": 1.0703125, "learning_rate": 0.00048671087244728093, "loss": 6.2887, "mean_token_accuracy": 0.1584049344062805, "num_tokens": 4555907.0, "step": 1830 }, { "entropy": 6.561292409896851, "epoch": 2.146198830409357, "grad_norm": 1.0078125, "learning_rate": 0.00048655170698753774, "loss": 6.4126, "mean_token_accuracy": 0.15332231670618057, "num_tokens": 4568461.0, "step": 1835 }, { "entropy": 6.525373888015747, "epoch": 2.152046783625731, "grad_norm": 0.98046875, "learning_rate": 0.000486391623378216, "loss": 6.3628, "mean_token_accuracy": 0.15623549669981002, "num_tokens": 4581391.0, "step": 1840 }, { "entropy": 6.457386541366577, "epoch": 2.1578947368421053, "grad_norm": 0.9609375, "learning_rate": 0.0004862306223140901, "loss": 6.3492, "mean_token_accuracy": 0.15107778757810592, "num_tokens": 4594187.0, "step": 1845 }, { "entropy": 6.504654359817505, "epoch": 2.1637426900584797, "grad_norm": 0.98046875, "learning_rate": 0.00048606870449391604, "loss": 6.3854, "mean_token_accuracy": 0.15558697730302812, "num_tokens": 4607162.0, "step": 1850 }, { "entropy": 6.578766107559204, "epoch": 2.1695906432748537, "grad_norm": 1.015625, "learning_rate": 0.00048590587062042907, "loss": 6.4904, "mean_token_accuracy": 0.14629387259483337, "num_tokens": 4619717.0, "step": 1855 }, { "entropy": 6.447008419036865, "epoch": 2.175438596491228, "grad_norm": 1.0390625, "learning_rate": 0.00048574212140033965, "loss": 6.2273, "mean_token_accuracy": 0.16127332150936127, "num_tokens": 4631938.0, "step": 1860 }, { "entropy": 6.438826036453247, "epoch": 2.181286549707602, "grad_norm": 0.9609375, "learning_rate": 0.0004855774575443311, "loss": 6.3345, "mean_token_accuracy": 0.1587992399930954, "num_tokens": 4644377.0, "step": 1865 }, { "entropy": 6.539951610565185, "epoch": 2.1871345029239766, "grad_norm": 0.92578125, "learning_rate": 0.00048541187976705645, "loss": 6.2964, "mean_token_accuracy": 0.16265074014663697, "num_tokens": 4656657.0, "step": 1870 }, { "entropy": 6.491901159286499, "epoch": 2.192982456140351, "grad_norm": 1.0390625, "learning_rate": 0.00048524538878713517, "loss": 6.2791, "mean_token_accuracy": 0.16020860895514488, "num_tokens": 4670156.0, "step": 1875 }, { "entropy": 6.5246663093566895, "epoch": 2.198830409356725, "grad_norm": 0.95703125, "learning_rate": 0.00048507798532715005, "loss": 6.3826, "mean_token_accuracy": 0.14875538647174835, "num_tokens": 4683564.0, "step": 1880 }, { "entropy": 6.444547891616821, "epoch": 2.2046783625730995, "grad_norm": 1.390625, "learning_rate": 0.00048490967011364394, "loss": 6.3352, "mean_token_accuracy": 0.16067604571580887, "num_tokens": 4696008.0, "step": 1885 }, { "entropy": 6.373475456237793, "epoch": 2.2105263157894735, "grad_norm": 0.94921875, "learning_rate": 0.0004847404438771172, "loss": 6.2113, "mean_token_accuracy": 0.16405704319477082, "num_tokens": 4707956.0, "step": 1890 }, { "entropy": 6.469513893127441, "epoch": 2.216374269005848, "grad_norm": 0.93359375, "learning_rate": 0.0004845703073520236, "loss": 6.4399, "mean_token_accuracy": 0.14858177527785302, "num_tokens": 4720683.0, "step": 1895 }, { "entropy": 6.590300607681274, "epoch": 2.2222222222222223, "grad_norm": 0.99609375, "learning_rate": 0.00048439926127676796, "loss": 6.3683, "mean_token_accuracy": 0.15888102650642394, "num_tokens": 4732524.0, "step": 1900 }, { "entropy": 6.465745878219605, "epoch": 2.2280701754385963, "grad_norm": 0.91015625, "learning_rate": 0.00048422730639370256, "loss": 6.4267, "mean_token_accuracy": 0.15533056408166884, "num_tokens": 4746483.0, "step": 1905 }, { "entropy": 6.493499422073365, "epoch": 2.2339181286549707, "grad_norm": 0.92578125, "learning_rate": 0.0004840544434491238, "loss": 6.3532, "mean_token_accuracy": 0.15531336814165114, "num_tokens": 4759543.0, "step": 1910 }, { "entropy": 6.377004480361938, "epoch": 2.239766081871345, "grad_norm": 1.15625, "learning_rate": 0.00048388067319326937, "loss": 6.3158, "mean_token_accuracy": 0.15956761240959166, "num_tokens": 4770766.0, "step": 1915 }, { "entropy": 6.536472988128662, "epoch": 2.245614035087719, "grad_norm": 0.9609375, "learning_rate": 0.00048370599638031464, "loss": 6.3084, "mean_token_accuracy": 0.16118213832378386, "num_tokens": 4783157.0, "step": 1920 }, { "entropy": 6.363384056091308, "epoch": 2.2514619883040936, "grad_norm": 1.0859375, "learning_rate": 0.00048353041376836937, "loss": 6.3827, "mean_token_accuracy": 0.16078438013792037, "num_tokens": 4795874.0, "step": 1925 }, { "entropy": 6.52140212059021, "epoch": 2.257309941520468, "grad_norm": 1.0, "learning_rate": 0.0004833539261194749, "loss": 6.3334, "mean_token_accuracy": 0.1594570055603981, "num_tokens": 4806968.0, "step": 1930 }, { "entropy": 6.3824951171875, "epoch": 2.263157894736842, "grad_norm": 0.8984375, "learning_rate": 0.00048317653419960007, "loss": 6.3644, "mean_token_accuracy": 0.155350361764431, "num_tokens": 4819927.0, "step": 1935 }, { "entropy": 6.4782744407653805, "epoch": 2.2690058479532165, "grad_norm": 1.0390625, "learning_rate": 0.00048299823877863857, "loss": 6.3349, "mean_token_accuracy": 0.160041144490242, "num_tokens": 4831824.0, "step": 1940 }, { "entropy": 6.478532791137695, "epoch": 2.2748538011695905, "grad_norm": 0.91796875, "learning_rate": 0.0004828190406304054, "loss": 6.3812, "mean_token_accuracy": 0.152671180665493, "num_tokens": 4844405.0, "step": 1945 }, { "entropy": 6.451467847824096, "epoch": 2.280701754385965, "grad_norm": 0.96484375, "learning_rate": 0.0004826389405326334, "loss": 6.3273, "mean_token_accuracy": 0.16256463527679443, "num_tokens": 4856424.0, "step": 1950 }, { "entropy": 6.527578496932984, "epoch": 2.2865497076023393, "grad_norm": 0.94921875, "learning_rate": 0.0004824579392669698, "loss": 6.4768, "mean_token_accuracy": 0.1487383469939232, "num_tokens": 4869473.0, "step": 1955 }, { "entropy": 6.367396450042724, "epoch": 2.2923976608187133, "grad_norm": 1.0, "learning_rate": 0.00048227603761897316, "loss": 6.2911, "mean_token_accuracy": 0.16065459549427033, "num_tokens": 4881220.0, "step": 1960 }, { "entropy": 6.414208173751831, "epoch": 2.2982456140350878, "grad_norm": 0.9296875, "learning_rate": 0.0004820932363781096, "loss": 6.472, "mean_token_accuracy": 0.14860487282276152, "num_tokens": 4892766.0, "step": 1965 }, { "entropy": 6.45541353225708, "epoch": 2.3040935672514617, "grad_norm": 0.98828125, "learning_rate": 0.0004819095363377496, "loss": 6.3238, "mean_token_accuracy": 0.15184853971004486, "num_tokens": 4904549.0, "step": 1970 }, { "entropy": 6.419804286956787, "epoch": 2.309941520467836, "grad_norm": 0.953125, "learning_rate": 0.00048172493829516465, "loss": 6.3309, "mean_token_accuracy": 0.15828023850917816, "num_tokens": 4917204.0, "step": 1975 }, { "entropy": 6.4697606563568115, "epoch": 2.3157894736842106, "grad_norm": 0.9921875, "learning_rate": 0.0004815394430515234, "loss": 6.4003, "mean_token_accuracy": 0.16001321077346803, "num_tokens": 4928838.0, "step": 1980 }, { "entropy": 6.530691719055175, "epoch": 2.3216374269005846, "grad_norm": 0.96484375, "learning_rate": 0.0004813530514118884, "loss": 6.3734, "mean_token_accuracy": 0.1554233744740486, "num_tokens": 4940281.0, "step": 1985 }, { "entropy": 6.41666464805603, "epoch": 2.327485380116959, "grad_norm": 1.0, "learning_rate": 0.0004811657641852129, "loss": 6.3576, "mean_token_accuracy": 0.15298293232917787, "num_tokens": 4953355.0, "step": 1990 }, { "entropy": 6.50026125907898, "epoch": 2.3333333333333335, "grad_norm": 0.890625, "learning_rate": 0.00048097758218433687, "loss": 6.3659, "mean_token_accuracy": 0.15752369314432144, "num_tokens": 4966128.0, "step": 1995 }, { "entropy": 6.474570655822754, "epoch": 2.3391812865497075, "grad_norm": 0.8515625, "learning_rate": 0.00048078850622598355, "loss": 6.3719, "mean_token_accuracy": 0.15596262663602828, "num_tokens": 4979409.0, "step": 2000 }, { "epoch": 2.3391812865497075, "eval_entropy": 6.244584498503919, "eval_loss": 6.810573577880859, "eval_mean_token_accuracy": 0.14119860577427268, "eval_num_tokens": 4979409.0, "eval_runtime": 2.2734, "eval_samples_per_second": 1190.728, "eval_steps_per_second": 149.116, "step": 2000 } ], "logging_steps": 5, "max_steps": 8540, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7220033676288000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }