{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.093567251461988, "eval_steps": 500, "global_step": 3500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.593726110458374, "epoch": 0.005847953216374269, "grad_norm": 1.2734375, "learning_rate": 2e-06, "loss": 7.6031, "mean_token_accuracy": 0.13570500910282135, "num_tokens": 12656.0, "step": 5 }, { "entropy": 7.586997556686401, "epoch": 0.011695906432748537, "grad_norm": 1.1796875, "learning_rate": 4.5e-06, "loss": 7.6652, "mean_token_accuracy": 0.12274946123361588, "num_tokens": 25207.0, "step": 10 }, { "entropy": 7.649361896514892, "epoch": 0.017543859649122806, "grad_norm": 1.0703125, "learning_rate": 7e-06, "loss": 7.673, "mean_token_accuracy": 0.12404287382960319, "num_tokens": 38096.0, "step": 15 }, { "entropy": 7.637357187271118, "epoch": 0.023391812865497075, "grad_norm": 1.1015625, "learning_rate": 9.5e-06, "loss": 7.7506, "mean_token_accuracy": 0.12453248649835587, "num_tokens": 50626.0, "step": 20 }, { "entropy": 7.673450565338134, "epoch": 0.029239766081871343, "grad_norm": 1.0234375, "learning_rate": 1.2e-05, "loss": 7.6825, "mean_token_accuracy": 0.12940182387828827, "num_tokens": 63448.0, "step": 25 }, { "entropy": 7.774927949905395, "epoch": 0.03508771929824561, "grad_norm": 1.1015625, "learning_rate": 1.4500000000000002e-05, "loss": 7.731, "mean_token_accuracy": 0.12124454602599144, "num_tokens": 75656.0, "step": 30 }, { "entropy": 7.754840278625489, "epoch": 0.04093567251461988, "grad_norm": 1.0625, "learning_rate": 1.7000000000000003e-05, "loss": 7.7155, "mean_token_accuracy": 0.12517715990543365, "num_tokens": 88756.0, "step": 35 }, { "entropy": 7.778929853439331, "epoch": 0.04678362573099415, "grad_norm": 0.96484375, "learning_rate": 1.95e-05, "loss": 7.6499, "mean_token_accuracy": 0.12550911605358123, "num_tokens": 100934.0, "step": 40 }, { "entropy": 7.761408805847168, "epoch": 0.05263157894736842, "grad_norm": 1.1015625, "learning_rate": 2.2e-05, "loss": 7.6072, "mean_token_accuracy": 0.12898701280355454, "num_tokens": 112212.0, "step": 45 }, { "entropy": 7.740135717391968, "epoch": 0.05847953216374269, "grad_norm": 0.99609375, "learning_rate": 2.4500000000000003e-05, "loss": 7.6067, "mean_token_accuracy": 0.12694446071982385, "num_tokens": 126314.0, "step": 50 }, { "entropy": 7.718768978118897, "epoch": 0.06432748538011696, "grad_norm": 1.1015625, "learning_rate": 2.7e-05, "loss": 7.652, "mean_token_accuracy": 0.13094937354326247, "num_tokens": 138416.0, "step": 55 }, { "entropy": 7.7235801219940186, "epoch": 0.07017543859649122, "grad_norm": 1.0078125, "learning_rate": 2.95e-05, "loss": 7.6356, "mean_token_accuracy": 0.12992877885699272, "num_tokens": 149903.0, "step": 60 }, { "entropy": 7.728446578979492, "epoch": 0.07602339181286549, "grad_norm": 0.8515625, "learning_rate": 3.2e-05, "loss": 7.616, "mean_token_accuracy": 0.13435307145118713, "num_tokens": 163516.0, "step": 65 }, { "entropy": 7.745584630966187, "epoch": 0.08187134502923976, "grad_norm": 0.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 7.6154, "mean_token_accuracy": 0.12847506403923034, "num_tokens": 176024.0, "step": 70 }, { "entropy": 7.79000825881958, "epoch": 0.08771929824561403, "grad_norm": 0.95703125, "learning_rate": 3.7e-05, "loss": 7.6904, "mean_token_accuracy": 0.12912894561886787, "num_tokens": 189337.0, "step": 75 }, { "entropy": 7.840251207351685, "epoch": 0.0935672514619883, "grad_norm": 1.0625, "learning_rate": 3.95e-05, "loss": 7.632, "mean_token_accuracy": 0.1310859203338623, "num_tokens": 201752.0, "step": 80 }, { "entropy": 7.792728662490845, "epoch": 0.09941520467836257, "grad_norm": 1.0546875, "learning_rate": 4.2000000000000004e-05, "loss": 7.7007, "mean_token_accuracy": 0.1200527586042881, "num_tokens": 214676.0, "step": 85 }, { "entropy": 7.769255495071411, "epoch": 0.10526315789473684, "grad_norm": 1.015625, "learning_rate": 4.45e-05, "loss": 7.6036, "mean_token_accuracy": 0.1250310204923153, "num_tokens": 225474.0, "step": 90 }, { "entropy": 7.832526683807373, "epoch": 0.1111111111111111, "grad_norm": 1.0859375, "learning_rate": 4.7000000000000004e-05, "loss": 7.6196, "mean_token_accuracy": 0.13330849632620811, "num_tokens": 237345.0, "step": 95 }, { "entropy": 7.786408853530884, "epoch": 0.11695906432748537, "grad_norm": 1.0078125, "learning_rate": 4.9500000000000004e-05, "loss": 7.5976, "mean_token_accuracy": 0.13106755986809732, "num_tokens": 249633.0, "step": 100 }, { "entropy": 7.785315036773682, "epoch": 0.12280701754385964, "grad_norm": 1.0546875, "learning_rate": 5.2e-05, "loss": 7.5707, "mean_token_accuracy": 0.12854716926813126, "num_tokens": 261840.0, "step": 105 }, { "entropy": 7.7381500720977785, "epoch": 0.1286549707602339, "grad_norm": 1.0234375, "learning_rate": 5.45e-05, "loss": 7.6581, "mean_token_accuracy": 0.12695110440254212, "num_tokens": 273838.0, "step": 110 }, { "entropy": 7.7819578647613525, "epoch": 0.13450292397660818, "grad_norm": 1.0, "learning_rate": 5.7e-05, "loss": 7.6314, "mean_token_accuracy": 0.12518885657191275, "num_tokens": 286001.0, "step": 115 }, { "entropy": 7.892224454879761, "epoch": 0.14035087719298245, "grad_norm": 1.1171875, "learning_rate": 5.9499999999999996e-05, "loss": 7.5622, "mean_token_accuracy": 0.1403429314494133, "num_tokens": 299052.0, "step": 120 }, { "entropy": 7.751383972167969, "epoch": 0.14619883040935672, "grad_norm": 1.1640625, "learning_rate": 6.2e-05, "loss": 7.6007, "mean_token_accuracy": 0.12698042243719102, "num_tokens": 311803.0, "step": 125 }, { "entropy": 7.862428855895996, "epoch": 0.15204678362573099, "grad_norm": 1.0703125, "learning_rate": 6.450000000000001e-05, "loss": 7.6155, "mean_token_accuracy": 0.1285979501903057, "num_tokens": 323712.0, "step": 130 }, { "entropy": 7.733092164993286, "epoch": 0.15789473684210525, "grad_norm": 1.03125, "learning_rate": 6.7e-05, "loss": 7.5735, "mean_token_accuracy": 0.1340746872127056, "num_tokens": 335171.0, "step": 135 }, { "entropy": 7.840703058242798, "epoch": 0.16374269005847952, "grad_norm": 1.1015625, "learning_rate": 6.950000000000001e-05, "loss": 7.6469, "mean_token_accuracy": 0.12687307894229888, "num_tokens": 347185.0, "step": 140 }, { "entropy": 7.806375932693482, "epoch": 0.1695906432748538, "grad_norm": 1.796875, "learning_rate": 7.2e-05, "loss": 7.5806, "mean_token_accuracy": 0.12792280316352844, "num_tokens": 359695.0, "step": 145 }, { "entropy": 7.806016826629639, "epoch": 0.17543859649122806, "grad_norm": 1.0625, "learning_rate": 7.45e-05, "loss": 7.6646, "mean_token_accuracy": 0.13149451091885567, "num_tokens": 373805.0, "step": 150 }, { "entropy": 7.811039972305298, "epoch": 0.18128654970760233, "grad_norm": 1.203125, "learning_rate": 7.7e-05, "loss": 7.615, "mean_token_accuracy": 0.13272017240524292, "num_tokens": 385772.0, "step": 155 }, { "entropy": 7.7556663990020756, "epoch": 0.1871345029239766, "grad_norm": 0.98828125, "learning_rate": 7.950000000000001e-05, "loss": 7.5329, "mean_token_accuracy": 0.13663637787103652, "num_tokens": 397641.0, "step": 160 }, { "entropy": 7.7673561573028564, "epoch": 0.19298245614035087, "grad_norm": 1.03125, "learning_rate": 8.2e-05, "loss": 7.5761, "mean_token_accuracy": 0.13438102826476098, "num_tokens": 410241.0, "step": 165 }, { "entropy": 7.851863145828247, "epoch": 0.19883040935672514, "grad_norm": 1.0, "learning_rate": 8.450000000000001e-05, "loss": 7.5371, "mean_token_accuracy": 0.12968598157167435, "num_tokens": 422079.0, "step": 170 }, { "entropy": 7.722187614440918, "epoch": 0.2046783625730994, "grad_norm": 1.046875, "learning_rate": 8.7e-05, "loss": 7.6151, "mean_token_accuracy": 0.12510994151234628, "num_tokens": 435187.0, "step": 175 }, { "entropy": 7.802532577514649, "epoch": 0.21052631578947367, "grad_norm": 1.0078125, "learning_rate": 8.95e-05, "loss": 7.59, "mean_token_accuracy": 0.12483937367796898, "num_tokens": 447329.0, "step": 180 }, { "entropy": 7.7081256866455075, "epoch": 0.21637426900584794, "grad_norm": 1.1015625, "learning_rate": 9.2e-05, "loss": 7.5244, "mean_token_accuracy": 0.13455075845122338, "num_tokens": 459316.0, "step": 185 }, { "entropy": 7.866452074050903, "epoch": 0.2222222222222222, "grad_norm": 1.2421875, "learning_rate": 9.45e-05, "loss": 7.602, "mean_token_accuracy": 0.13409386128187178, "num_tokens": 471184.0, "step": 190 }, { "entropy": 7.7785547256469725, "epoch": 0.22807017543859648, "grad_norm": 1.015625, "learning_rate": 9.7e-05, "loss": 7.5964, "mean_token_accuracy": 0.13105484768748282, "num_tokens": 483988.0, "step": 195 }, { "entropy": 7.754951095581054, "epoch": 0.23391812865497075, "grad_norm": 1.0390625, "learning_rate": 9.95e-05, "loss": 7.6021, "mean_token_accuracy": 0.12733055427670478, "num_tokens": 495995.0, "step": 200 }, { "entropy": 7.760473966598511, "epoch": 0.23976608187134502, "grad_norm": 1.015625, "learning_rate": 0.000102, "loss": 7.5481, "mean_token_accuracy": 0.13547581657767296, "num_tokens": 507382.0, "step": 205 }, { "entropy": 7.720216274261475, "epoch": 0.24561403508771928, "grad_norm": 1.1875, "learning_rate": 0.00010449999999999999, "loss": 7.5492, "mean_token_accuracy": 0.1361517131328583, "num_tokens": 518748.0, "step": 210 }, { "entropy": 7.7840687274932865, "epoch": 0.25146198830409355, "grad_norm": 1.0390625, "learning_rate": 0.000107, "loss": 7.5697, "mean_token_accuracy": 0.12845324501395225, "num_tokens": 531571.0, "step": 215 }, { "entropy": 7.810080337524414, "epoch": 0.2573099415204678, "grad_norm": 0.99609375, "learning_rate": 0.0001095, "loss": 7.5872, "mean_token_accuracy": 0.1274337127804756, "num_tokens": 544699.0, "step": 220 }, { "entropy": 7.742982816696167, "epoch": 0.2631578947368421, "grad_norm": 1.0703125, "learning_rate": 0.000112, "loss": 7.5439, "mean_token_accuracy": 0.13237009420990944, "num_tokens": 558110.0, "step": 225 }, { "entropy": 7.847256898880005, "epoch": 0.26900584795321636, "grad_norm": 1.0625, "learning_rate": 0.0001145, "loss": 7.6277, "mean_token_accuracy": 0.12315782383084298, "num_tokens": 571566.0, "step": 230 }, { "entropy": 7.752783679962159, "epoch": 0.27485380116959063, "grad_norm": 1.3125, "learning_rate": 0.00011700000000000001, "loss": 7.5427, "mean_token_accuracy": 0.130996935069561, "num_tokens": 583149.0, "step": 235 }, { "entropy": 7.764012479782105, "epoch": 0.2807017543859649, "grad_norm": 1.203125, "learning_rate": 0.00011949999999999999, "loss": 7.5734, "mean_token_accuracy": 0.1311168886721134, "num_tokens": 596360.0, "step": 240 }, { "entropy": 7.776003646850586, "epoch": 0.28654970760233917, "grad_norm": 1.0390625, "learning_rate": 0.000122, "loss": 7.57, "mean_token_accuracy": 0.12710137963294982, "num_tokens": 607719.0, "step": 245 }, { "entropy": 7.803481483459473, "epoch": 0.29239766081871343, "grad_norm": 1.1796875, "learning_rate": 0.0001245, "loss": 7.5331, "mean_token_accuracy": 0.13498716056346893, "num_tokens": 619002.0, "step": 250 }, { "entropy": 7.713655710220337, "epoch": 0.2982456140350877, "grad_norm": 1.1484375, "learning_rate": 0.000127, "loss": 7.5076, "mean_token_accuracy": 0.13216801062226297, "num_tokens": 631437.0, "step": 255 }, { "entropy": 7.640055465698242, "epoch": 0.30409356725146197, "grad_norm": 1.1875, "learning_rate": 0.0001295, "loss": 7.5087, "mean_token_accuracy": 0.13282301425933837, "num_tokens": 642611.0, "step": 260 }, { "entropy": 7.83185043334961, "epoch": 0.30994152046783624, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 7.5447, "mean_token_accuracy": 0.1268044739961624, "num_tokens": 654874.0, "step": 265 }, { "entropy": 7.68661732673645, "epoch": 0.3157894736842105, "grad_norm": 1.109375, "learning_rate": 0.00013450000000000002, "loss": 7.629, "mean_token_accuracy": 0.1293095037341118, "num_tokens": 669141.0, "step": 270 }, { "entropy": 7.781434631347656, "epoch": 0.3216374269005848, "grad_norm": 1.28125, "learning_rate": 0.00013700000000000002, "loss": 7.5456, "mean_token_accuracy": 0.13286237716674804, "num_tokens": 681192.0, "step": 275 }, { "entropy": 7.814055967330932, "epoch": 0.32748538011695905, "grad_norm": 1.171875, "learning_rate": 0.0001395, "loss": 7.5423, "mean_token_accuracy": 0.13368416726589202, "num_tokens": 693191.0, "step": 280 }, { "entropy": 7.664337110519409, "epoch": 0.3333333333333333, "grad_norm": 1.2578125, "learning_rate": 0.00014199999999999998, "loss": 7.5257, "mean_token_accuracy": 0.1304435022175312, "num_tokens": 705131.0, "step": 285 }, { "entropy": 7.808525848388672, "epoch": 0.3391812865497076, "grad_norm": 1.1015625, "learning_rate": 0.0001445, "loss": 7.5226, "mean_token_accuracy": 0.1330956645309925, "num_tokens": 717873.0, "step": 290 }, { "entropy": 7.779027700424194, "epoch": 0.34502923976608185, "grad_norm": 1.1171875, "learning_rate": 0.000147, "loss": 7.5753, "mean_token_accuracy": 0.12839027419686316, "num_tokens": 730527.0, "step": 295 }, { "entropy": 7.754869270324707, "epoch": 0.3508771929824561, "grad_norm": 1.09375, "learning_rate": 0.0001495, "loss": 7.6158, "mean_token_accuracy": 0.1226100891828537, "num_tokens": 743263.0, "step": 300 }, { "entropy": 7.853420972824097, "epoch": 0.3567251461988304, "grad_norm": 1.1640625, "learning_rate": 0.000152, "loss": 7.6122, "mean_token_accuracy": 0.12751553878188132, "num_tokens": 755422.0, "step": 305 }, { "entropy": 7.644754314422608, "epoch": 0.36257309941520466, "grad_norm": 1.375, "learning_rate": 0.00015450000000000001, "loss": 7.4967, "mean_token_accuracy": 0.13192886114120483, "num_tokens": 767854.0, "step": 310 }, { "entropy": 7.757552576065064, "epoch": 0.3684210526315789, "grad_norm": 1.03125, "learning_rate": 0.000157, "loss": 7.4794, "mean_token_accuracy": 0.13279144391417502, "num_tokens": 779969.0, "step": 315 }, { "entropy": 7.734856033325196, "epoch": 0.3742690058479532, "grad_norm": 1.0078125, "learning_rate": 0.0001595, "loss": 7.5177, "mean_token_accuracy": 0.12462197691202163, "num_tokens": 792544.0, "step": 320 }, { "entropy": 7.747901725769043, "epoch": 0.38011695906432746, "grad_norm": 1.0703125, "learning_rate": 0.000162, "loss": 7.5284, "mean_token_accuracy": 0.1278999462723732, "num_tokens": 804603.0, "step": 325 }, { "entropy": 7.6661285877227785, "epoch": 0.38596491228070173, "grad_norm": 1.3203125, "learning_rate": 0.00016450000000000001, "loss": 7.4698, "mean_token_accuracy": 0.1412305675446987, "num_tokens": 816006.0, "step": 330 }, { "entropy": 7.718921327590943, "epoch": 0.391812865497076, "grad_norm": 1.078125, "learning_rate": 0.00016700000000000002, "loss": 7.4472, "mean_token_accuracy": 0.13868665173649788, "num_tokens": 828003.0, "step": 335 }, { "entropy": 7.650281476974487, "epoch": 0.39766081871345027, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 7.5019, "mean_token_accuracy": 0.13453598469495773, "num_tokens": 840649.0, "step": 340 }, { "entropy": 7.828660154342652, "epoch": 0.40350877192982454, "grad_norm": 1.234375, "learning_rate": 0.00017199999999999998, "loss": 7.5351, "mean_token_accuracy": 0.12318970710039139, "num_tokens": 853736.0, "step": 345 }, { "entropy": 7.61459264755249, "epoch": 0.4093567251461988, "grad_norm": 1.1953125, "learning_rate": 0.00017449999999999999, "loss": 7.5521, "mean_token_accuracy": 0.1260755755007267, "num_tokens": 866346.0, "step": 350 }, { "entropy": 7.783421611785888, "epoch": 0.4152046783625731, "grad_norm": 1.0546875, "learning_rate": 0.000177, "loss": 7.4784, "mean_token_accuracy": 0.12796891778707503, "num_tokens": 879163.0, "step": 355 }, { "entropy": 7.739914035797119, "epoch": 0.42105263157894735, "grad_norm": 1.1875, "learning_rate": 0.0001795, "loss": 7.5281, "mean_token_accuracy": 0.1271045207977295, "num_tokens": 891452.0, "step": 360 }, { "entropy": 7.692205429077148, "epoch": 0.4269005847953216, "grad_norm": 1.390625, "learning_rate": 0.000182, "loss": 7.5409, "mean_token_accuracy": 0.13060612305998803, "num_tokens": 903351.0, "step": 365 }, { "entropy": 7.750999116897583, "epoch": 0.4327485380116959, "grad_norm": 1.203125, "learning_rate": 0.0001845, "loss": 7.4841, "mean_token_accuracy": 0.1305551879107952, "num_tokens": 914818.0, "step": 370 }, { "entropy": 7.551722192764283, "epoch": 0.43859649122807015, "grad_norm": 1.1484375, "learning_rate": 0.000187, "loss": 7.3844, "mean_token_accuracy": 0.14969016388058662, "num_tokens": 927337.0, "step": 375 }, { "entropy": 7.822294139862061, "epoch": 0.4444444444444444, "grad_norm": 1.1640625, "learning_rate": 0.0001895, "loss": 7.5932, "mean_token_accuracy": 0.1261659525334835, "num_tokens": 940058.0, "step": 380 }, { "entropy": 7.664493227005005, "epoch": 0.4502923976608187, "grad_norm": 1.390625, "learning_rate": 0.000192, "loss": 7.3961, "mean_token_accuracy": 0.13526701480150222, "num_tokens": 952820.0, "step": 385 }, { "entropy": 7.564838886260986, "epoch": 0.45614035087719296, "grad_norm": 1.328125, "learning_rate": 0.0001945, "loss": 7.4493, "mean_token_accuracy": 0.13812072202563286, "num_tokens": 965132.0, "step": 390 }, { "entropy": 7.727004194259644, "epoch": 0.4619883040935672, "grad_norm": 1.0703125, "learning_rate": 0.00019700000000000002, "loss": 7.4848, "mean_token_accuracy": 0.1320212572813034, "num_tokens": 978695.0, "step": 395 }, { "entropy": 7.706100749969482, "epoch": 0.4678362573099415, "grad_norm": 1.3046875, "learning_rate": 0.00019950000000000002, "loss": 7.4478, "mean_token_accuracy": 0.13389745727181435, "num_tokens": 992427.0, "step": 400 }, { "entropy": 7.581472444534302, "epoch": 0.47368421052631576, "grad_norm": 1.2109375, "learning_rate": 0.000202, "loss": 7.4625, "mean_token_accuracy": 0.13692987337708473, "num_tokens": 1005090.0, "step": 405 }, { "entropy": 7.768648767471314, "epoch": 0.47953216374269003, "grad_norm": 1.21875, "learning_rate": 0.00020449999999999998, "loss": 7.4654, "mean_token_accuracy": 0.13497180566191674, "num_tokens": 1017219.0, "step": 410 }, { "entropy": 7.577150154113769, "epoch": 0.4853801169590643, "grad_norm": 1.109375, "learning_rate": 0.000207, "loss": 7.5118, "mean_token_accuracy": 0.12923638001084328, "num_tokens": 1029576.0, "step": 415 }, { "entropy": 7.703565454483032, "epoch": 0.49122807017543857, "grad_norm": 1.25, "learning_rate": 0.0002095, "loss": 7.5447, "mean_token_accuracy": 0.12888929918408393, "num_tokens": 1042259.0, "step": 420 }, { "entropy": 7.760423231124878, "epoch": 0.49707602339181284, "grad_norm": 1.2109375, "learning_rate": 0.000212, "loss": 7.4665, "mean_token_accuracy": 0.12709181681275367, "num_tokens": 1054965.0, "step": 425 }, { "entropy": 7.540304946899414, "epoch": 0.5029239766081871, "grad_norm": 1.171875, "learning_rate": 0.0002145, "loss": 7.4192, "mean_token_accuracy": 0.13073362559080123, "num_tokens": 1067346.0, "step": 430 }, { "entropy": 7.69997730255127, "epoch": 0.5087719298245614, "grad_norm": 1.1171875, "learning_rate": 0.00021700000000000002, "loss": 7.4084, "mean_token_accuracy": 0.12967713326215743, "num_tokens": 1080366.0, "step": 435 }, { "entropy": 7.659937810897827, "epoch": 0.5146198830409356, "grad_norm": 1.140625, "learning_rate": 0.0002195, "loss": 7.3841, "mean_token_accuracy": 0.1347927011549473, "num_tokens": 1091904.0, "step": 440 }, { "entropy": 7.573716306686402, "epoch": 0.52046783625731, "grad_norm": 1.2109375, "learning_rate": 0.000222, "loss": 7.3977, "mean_token_accuracy": 0.13465345576405524, "num_tokens": 1103363.0, "step": 445 }, { "entropy": 7.556374645233154, "epoch": 0.5263157894736842, "grad_norm": 1.1171875, "learning_rate": 0.0002245, "loss": 7.4271, "mean_token_accuracy": 0.1363191269338131, "num_tokens": 1115178.0, "step": 450 }, { "entropy": 7.6787323474884035, "epoch": 0.5321637426900585, "grad_norm": 1.3125, "learning_rate": 0.00022700000000000002, "loss": 7.364, "mean_token_accuracy": 0.13259132504463195, "num_tokens": 1128276.0, "step": 455 }, { "entropy": 7.688528728485108, "epoch": 0.5380116959064327, "grad_norm": 1.2421875, "learning_rate": 0.00022950000000000002, "loss": 7.4907, "mean_token_accuracy": 0.13230301365256308, "num_tokens": 1142100.0, "step": 460 }, { "entropy": 7.469075775146484, "epoch": 0.543859649122807, "grad_norm": 1.234375, "learning_rate": 0.00023200000000000003, "loss": 7.4026, "mean_token_accuracy": 0.13583226278424262, "num_tokens": 1154928.0, "step": 465 }, { "entropy": 7.702433824539185, "epoch": 0.5497076023391813, "grad_norm": 1.328125, "learning_rate": 0.00023449999999999998, "loss": 7.4994, "mean_token_accuracy": 0.1225062869489193, "num_tokens": 1166937.0, "step": 470 }, { "entropy": 7.537669372558594, "epoch": 0.5555555555555556, "grad_norm": 1.2578125, "learning_rate": 0.000237, "loss": 7.4175, "mean_token_accuracy": 0.1342865504324436, "num_tokens": 1180008.0, "step": 475 }, { "entropy": 7.674032211303711, "epoch": 0.5614035087719298, "grad_norm": 1.2578125, "learning_rate": 0.0002395, "loss": 7.4255, "mean_token_accuracy": 0.12588841170072557, "num_tokens": 1191926.0, "step": 480 }, { "entropy": 7.737406444549561, "epoch": 0.5672514619883041, "grad_norm": 1.0625, "learning_rate": 0.000242, "loss": 7.4953, "mean_token_accuracy": 0.12321070730686187, "num_tokens": 1204904.0, "step": 485 }, { "entropy": 7.525170803070068, "epoch": 0.5730994152046783, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 7.3645, "mean_token_accuracy": 0.13284065276384355, "num_tokens": 1217006.0, "step": 490 }, { "entropy": 7.552954483032226, "epoch": 0.5789473684210527, "grad_norm": 1.21875, "learning_rate": 0.000247, "loss": 7.3799, "mean_token_accuracy": 0.13598829582333566, "num_tokens": 1228460.0, "step": 495 }, { "entropy": 7.607265853881836, "epoch": 0.5847953216374269, "grad_norm": 1.1796875, "learning_rate": 0.0002495, "loss": 7.4021, "mean_token_accuracy": 0.1343585431575775, "num_tokens": 1240891.0, "step": 500 }, { "epoch": 0.5847953216374269, "eval_entropy": 7.373745485041345, "eval_loss": 7.422036647796631, "eval_mean_token_accuracy": 0.12701122225660577, "eval_num_tokens": 1240891.0, "eval_runtime": 2.2961, "eval_samples_per_second": 1178.964, "eval_steps_per_second": 147.643, "step": 500 }, { "entropy": 7.5875434398651125, "epoch": 0.5906432748538012, "grad_norm": 1.234375, "learning_rate": 0.000252, "loss": 7.3656, "mean_token_accuracy": 0.1350531853735447, "num_tokens": 1254385.0, "step": 505 }, { "entropy": 7.6494550704956055, "epoch": 0.5964912280701754, "grad_norm": 1.265625, "learning_rate": 0.0002545, "loss": 7.4191, "mean_token_accuracy": 0.13399955853819848, "num_tokens": 1266809.0, "step": 510 }, { "entropy": 7.640181350708008, "epoch": 0.6023391812865497, "grad_norm": 1.0546875, "learning_rate": 0.000257, "loss": 7.4899, "mean_token_accuracy": 0.12867182418704032, "num_tokens": 1279478.0, "step": 515 }, { "entropy": 7.59810357093811, "epoch": 0.6081871345029239, "grad_norm": 1.0703125, "learning_rate": 0.0002595, "loss": 7.4026, "mean_token_accuracy": 0.13495590910315514, "num_tokens": 1291241.0, "step": 520 }, { "entropy": 7.57518630027771, "epoch": 0.6140350877192983, "grad_norm": 1.1171875, "learning_rate": 0.000262, "loss": 7.3959, "mean_token_accuracy": 0.1318567432463169, "num_tokens": 1303776.0, "step": 525 }, { "entropy": 7.491529178619385, "epoch": 0.6198830409356725, "grad_norm": 1.2109375, "learning_rate": 0.00026450000000000003, "loss": 7.3455, "mean_token_accuracy": 0.13106245100498198, "num_tokens": 1315970.0, "step": 530 }, { "entropy": 7.7029557704925535, "epoch": 0.6257309941520468, "grad_norm": 1.109375, "learning_rate": 0.00026700000000000004, "loss": 7.423, "mean_token_accuracy": 0.12939090728759767, "num_tokens": 1328142.0, "step": 535 }, { "entropy": 7.564161109924316, "epoch": 0.631578947368421, "grad_norm": 1.2109375, "learning_rate": 0.00026950000000000005, "loss": 7.3336, "mean_token_accuracy": 0.13661645874381065, "num_tokens": 1341126.0, "step": 540 }, { "entropy": 7.525344514846802, "epoch": 0.6374269005847953, "grad_norm": 1.109375, "learning_rate": 0.00027200000000000005, "loss": 7.3498, "mean_token_accuracy": 0.13808920085430146, "num_tokens": 1353820.0, "step": 545 }, { "entropy": 7.3739342212677, "epoch": 0.6432748538011696, "grad_norm": 1.203125, "learning_rate": 0.0002745, "loss": 7.3519, "mean_token_accuracy": 0.13071095943450928, "num_tokens": 1365342.0, "step": 550 }, { "entropy": 7.562578582763672, "epoch": 0.6491228070175439, "grad_norm": 1.09375, "learning_rate": 0.000277, "loss": 7.373, "mean_token_accuracy": 0.13720307797193526, "num_tokens": 1377965.0, "step": 555 }, { "entropy": 7.589451599121094, "epoch": 0.6549707602339181, "grad_norm": 1.0703125, "learning_rate": 0.0002795, "loss": 7.4585, "mean_token_accuracy": 0.12641436904668807, "num_tokens": 1391128.0, "step": 560 }, { "entropy": 7.503201961517334, "epoch": 0.6608187134502924, "grad_norm": 1.25, "learning_rate": 0.00028199999999999997, "loss": 7.3229, "mean_token_accuracy": 0.13581799939274788, "num_tokens": 1402866.0, "step": 565 }, { "entropy": 7.522457122802734, "epoch": 0.6666666666666666, "grad_norm": 1.0703125, "learning_rate": 0.0002845, "loss": 7.4011, "mean_token_accuracy": 0.13442004173994065, "num_tokens": 1415314.0, "step": 570 }, { "entropy": 7.550132846832275, "epoch": 0.672514619883041, "grad_norm": 1.25, "learning_rate": 0.000287, "loss": 7.3021, "mean_token_accuracy": 0.13721019327640532, "num_tokens": 1427003.0, "step": 575 }, { "entropy": 7.435861873626709, "epoch": 0.6783625730994152, "grad_norm": 1.65625, "learning_rate": 0.0002895, "loss": 7.2802, "mean_token_accuracy": 0.13575370907783507, "num_tokens": 1438950.0, "step": 580 }, { "entropy": 7.538718414306641, "epoch": 0.6842105263157895, "grad_norm": 1.1328125, "learning_rate": 0.000292, "loss": 7.3822, "mean_token_accuracy": 0.13449773266911508, "num_tokens": 1451640.0, "step": 585 }, { "entropy": 7.539703464508056, "epoch": 0.6900584795321637, "grad_norm": 1.2421875, "learning_rate": 0.0002945, "loss": 7.3901, "mean_token_accuracy": 0.13477873280644417, "num_tokens": 1464282.0, "step": 590 }, { "entropy": 7.420022916793823, "epoch": 0.695906432748538, "grad_norm": 1.0390625, "learning_rate": 0.000297, "loss": 7.3199, "mean_token_accuracy": 0.13606854826211928, "num_tokens": 1476199.0, "step": 595 }, { "entropy": 7.528499126434326, "epoch": 0.7017543859649122, "grad_norm": 1.4140625, "learning_rate": 0.0002995, "loss": 7.3494, "mean_token_accuracy": 0.13913520947098731, "num_tokens": 1488055.0, "step": 600 }, { "entropy": 7.544654035568238, "epoch": 0.7076023391812866, "grad_norm": 1.1328125, "learning_rate": 0.000302, "loss": 7.2989, "mean_token_accuracy": 0.13840262964367867, "num_tokens": 1500764.0, "step": 605 }, { "entropy": 7.431989049911499, "epoch": 0.7134502923976608, "grad_norm": 1.046875, "learning_rate": 0.0003045, "loss": 7.3203, "mean_token_accuracy": 0.13689279779791833, "num_tokens": 1513645.0, "step": 610 }, { "entropy": 7.424747610092163, "epoch": 0.7192982456140351, "grad_norm": 1.0859375, "learning_rate": 0.000307, "loss": 7.2418, "mean_token_accuracy": 0.14617047160863877, "num_tokens": 1528146.0, "step": 615 }, { "entropy": 7.445183849334716, "epoch": 0.7251461988304093, "grad_norm": 1.328125, "learning_rate": 0.0003095, "loss": 7.3038, "mean_token_accuracy": 0.13819727301597595, "num_tokens": 1541336.0, "step": 620 }, { "entropy": 7.532771015167237, "epoch": 0.7309941520467836, "grad_norm": 2.3125, "learning_rate": 0.000312, "loss": 7.3238, "mean_token_accuracy": 0.13210776224732398, "num_tokens": 1554609.0, "step": 625 }, { "entropy": 7.47041335105896, "epoch": 0.7368421052631579, "grad_norm": 1.265625, "learning_rate": 0.0003145, "loss": 7.4036, "mean_token_accuracy": 0.13117921128869056, "num_tokens": 1567520.0, "step": 630 }, { "entropy": 7.4976729393005375, "epoch": 0.7426900584795322, "grad_norm": 1.1015625, "learning_rate": 0.000317, "loss": 7.2851, "mean_token_accuracy": 0.14150782003998758, "num_tokens": 1579783.0, "step": 635 }, { "entropy": 7.376789665222168, "epoch": 0.7485380116959064, "grad_norm": 1.0703125, "learning_rate": 0.0003195, "loss": 7.2247, "mean_token_accuracy": 0.13450378701090812, "num_tokens": 1592830.0, "step": 640 }, { "entropy": 7.538475275039673, "epoch": 0.7543859649122807, "grad_norm": 1.15625, "learning_rate": 0.000322, "loss": 7.4304, "mean_token_accuracy": 0.12484153211116791, "num_tokens": 1605470.0, "step": 645 }, { "entropy": 7.442430639266968, "epoch": 0.7602339181286549, "grad_norm": 1.1015625, "learning_rate": 0.00032450000000000003, "loss": 7.2943, "mean_token_accuracy": 0.13867733925580977, "num_tokens": 1618106.0, "step": 650 }, { "entropy": 7.355888032913208, "epoch": 0.7660818713450293, "grad_norm": 1.125, "learning_rate": 0.00032700000000000003, "loss": 7.3423, "mean_token_accuracy": 0.12944767996668816, "num_tokens": 1632043.0, "step": 655 }, { "entropy": 7.49034104347229, "epoch": 0.7719298245614035, "grad_norm": 1.3046875, "learning_rate": 0.00032950000000000004, "loss": 7.2699, "mean_token_accuracy": 0.1375485248863697, "num_tokens": 1644671.0, "step": 660 }, { "entropy": 7.438511610031128, "epoch": 0.7777777777777778, "grad_norm": 1.2265625, "learning_rate": 0.00033200000000000005, "loss": 7.2571, "mean_token_accuracy": 0.13946201801300048, "num_tokens": 1657000.0, "step": 665 }, { "entropy": 7.363019323348999, "epoch": 0.783625730994152, "grad_norm": 1.0703125, "learning_rate": 0.00033450000000000005, "loss": 7.288, "mean_token_accuracy": 0.1353791870176792, "num_tokens": 1669874.0, "step": 670 }, { "entropy": 7.394830369949341, "epoch": 0.7894736842105263, "grad_norm": 1.1640625, "learning_rate": 0.000337, "loss": 7.3037, "mean_token_accuracy": 0.13502334728837012, "num_tokens": 1681238.0, "step": 675 }, { "entropy": 7.389416217803955, "epoch": 0.7953216374269005, "grad_norm": 1.265625, "learning_rate": 0.0003395, "loss": 7.1837, "mean_token_accuracy": 0.1395817719399929, "num_tokens": 1694887.0, "step": 680 }, { "entropy": 7.460854482650757, "epoch": 0.8011695906432749, "grad_norm": 1.40625, "learning_rate": 0.000342, "loss": 7.3458, "mean_token_accuracy": 0.13248592168092727, "num_tokens": 1706888.0, "step": 685 }, { "entropy": 7.458899688720703, "epoch": 0.8070175438596491, "grad_norm": 1.3125, "learning_rate": 0.00034449999999999997, "loss": 7.3121, "mean_token_accuracy": 0.13233812376856804, "num_tokens": 1718681.0, "step": 690 }, { "entropy": 7.411834287643432, "epoch": 0.8128654970760234, "grad_norm": 1.2421875, "learning_rate": 0.000347, "loss": 7.3076, "mean_token_accuracy": 0.13430518060922622, "num_tokens": 1732073.0, "step": 695 }, { "entropy": 7.387229108810425, "epoch": 0.8187134502923976, "grad_norm": 1.2265625, "learning_rate": 0.0003495, "loss": 7.2038, "mean_token_accuracy": 0.13365850895643233, "num_tokens": 1744176.0, "step": 700 }, { "entropy": 7.384578371047974, "epoch": 0.8245614035087719, "grad_norm": 0.9765625, "learning_rate": 0.000352, "loss": 7.2441, "mean_token_accuracy": 0.1429324761033058, "num_tokens": 1757138.0, "step": 705 }, { "entropy": 7.342513751983643, "epoch": 0.8304093567251462, "grad_norm": 1.09375, "learning_rate": 0.0003545, "loss": 7.193, "mean_token_accuracy": 0.14023306518793105, "num_tokens": 1768762.0, "step": 710 }, { "entropy": 7.379601860046387, "epoch": 0.8362573099415205, "grad_norm": 1.2265625, "learning_rate": 0.000357, "loss": 7.2776, "mean_token_accuracy": 0.1369776740670204, "num_tokens": 1781274.0, "step": 715 }, { "entropy": 7.324306583404541, "epoch": 0.8421052631578947, "grad_norm": 1.0859375, "learning_rate": 0.0003595, "loss": 7.1528, "mean_token_accuracy": 0.14969784170389175, "num_tokens": 1794092.0, "step": 720 }, { "entropy": 7.376630353927612, "epoch": 0.847953216374269, "grad_norm": 0.98828125, "learning_rate": 0.000362, "loss": 7.3085, "mean_token_accuracy": 0.13185275122523307, "num_tokens": 1806605.0, "step": 725 }, { "entropy": 7.482823085784912, "epoch": 0.8538011695906432, "grad_norm": 1.3828125, "learning_rate": 0.0003645, "loss": 7.3004, "mean_token_accuracy": 0.12456657811999321, "num_tokens": 1820064.0, "step": 730 }, { "entropy": 7.312306928634643, "epoch": 0.8596491228070176, "grad_norm": 1.0703125, "learning_rate": 0.000367, "loss": 7.1611, "mean_token_accuracy": 0.1399262838065624, "num_tokens": 1832899.0, "step": 735 }, { "entropy": 7.350351285934448, "epoch": 0.8654970760233918, "grad_norm": 1.09375, "learning_rate": 0.0003695, "loss": 7.2602, "mean_token_accuracy": 0.13681291192770004, "num_tokens": 1845701.0, "step": 740 }, { "entropy": 7.113675498962403, "epoch": 0.8713450292397661, "grad_norm": 1.203125, "learning_rate": 0.000372, "loss": 7.0812, "mean_token_accuracy": 0.14980586394667625, "num_tokens": 1858143.0, "step": 745 }, { "entropy": 7.359517431259155, "epoch": 0.8771929824561403, "grad_norm": 1.078125, "learning_rate": 0.0003745, "loss": 7.2215, "mean_token_accuracy": 0.13886995390057563, "num_tokens": 1871111.0, "step": 750 }, { "entropy": 7.3289408683776855, "epoch": 0.8830409356725146, "grad_norm": 1.0625, "learning_rate": 0.000377, "loss": 7.1813, "mean_token_accuracy": 0.1427088886499405, "num_tokens": 1882806.0, "step": 755 }, { "entropy": 7.2833109378814695, "epoch": 0.8888888888888888, "grad_norm": 1.25, "learning_rate": 0.0003795, "loss": 7.1914, "mean_token_accuracy": 0.14085574224591255, "num_tokens": 1895451.0, "step": 760 }, { "entropy": 7.306222057342529, "epoch": 0.8947368421052632, "grad_norm": 1.1328125, "learning_rate": 0.000382, "loss": 7.1696, "mean_token_accuracy": 0.1424693427979946, "num_tokens": 1906959.0, "step": 765 }, { "entropy": 7.268920803070069, "epoch": 0.9005847953216374, "grad_norm": 1.0703125, "learning_rate": 0.0003845, "loss": 7.2486, "mean_token_accuracy": 0.13296061381697655, "num_tokens": 1919889.0, "step": 770 }, { "entropy": 7.426680231094361, "epoch": 0.9064327485380117, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 7.2794, "mean_token_accuracy": 0.13839673027396202, "num_tokens": 1932152.0, "step": 775 }, { "entropy": 7.396844387054443, "epoch": 0.9122807017543859, "grad_norm": 1.0390625, "learning_rate": 0.00038950000000000003, "loss": 7.2329, "mean_token_accuracy": 0.1382187895476818, "num_tokens": 1944874.0, "step": 780 }, { "entropy": 7.191975879669189, "epoch": 0.9181286549707602, "grad_norm": 1.265625, "learning_rate": 0.00039200000000000004, "loss": 7.2003, "mean_token_accuracy": 0.1381520450115204, "num_tokens": 1956698.0, "step": 785 }, { "entropy": 7.353271389007569, "epoch": 0.9239766081871345, "grad_norm": 0.984375, "learning_rate": 0.00039450000000000005, "loss": 7.1834, "mean_token_accuracy": 0.1376000702381134, "num_tokens": 1970553.0, "step": 790 }, { "entropy": 7.22394437789917, "epoch": 0.9298245614035088, "grad_norm": 1.21875, "learning_rate": 0.00039700000000000005, "loss": 7.1715, "mean_token_accuracy": 0.13637209460139274, "num_tokens": 1982836.0, "step": 795 }, { "entropy": 7.331004190444946, "epoch": 0.935672514619883, "grad_norm": 1.0390625, "learning_rate": 0.0003995, "loss": 7.182, "mean_token_accuracy": 0.14434827119112015, "num_tokens": 1994012.0, "step": 800 }, { "entropy": 7.191262865066529, "epoch": 0.9415204678362573, "grad_norm": 1.109375, "learning_rate": 0.000402, "loss": 7.0765, "mean_token_accuracy": 0.14728244692087172, "num_tokens": 2007058.0, "step": 805 }, { "entropy": 7.346480751037598, "epoch": 0.9473684210526315, "grad_norm": 0.99609375, "learning_rate": 0.0004045, "loss": 7.2807, "mean_token_accuracy": 0.1287767119705677, "num_tokens": 2019191.0, "step": 810 }, { "entropy": 7.356786680221558, "epoch": 0.9532163742690059, "grad_norm": 1.046875, "learning_rate": 0.00040699999999999997, "loss": 7.2192, "mean_token_accuracy": 0.1383483201265335, "num_tokens": 2031485.0, "step": 815 }, { "entropy": 7.276351737976074, "epoch": 0.9590643274853801, "grad_norm": 1.015625, "learning_rate": 0.0004095, "loss": 7.2438, "mean_token_accuracy": 0.12981143370270729, "num_tokens": 2044606.0, "step": 820 }, { "entropy": 7.322518301010132, "epoch": 0.9649122807017544, "grad_norm": 1.03125, "learning_rate": 0.000412, "loss": 7.2186, "mean_token_accuracy": 0.1239808440208435, "num_tokens": 2056170.0, "step": 825 }, { "entropy": 7.2173041820526125, "epoch": 0.9707602339181286, "grad_norm": 1.1796875, "learning_rate": 0.0004145, "loss": 7.1692, "mean_token_accuracy": 0.13378976061940193, "num_tokens": 2069257.0, "step": 830 }, { "entropy": 7.278322315216064, "epoch": 0.9766081871345029, "grad_norm": 1.09375, "learning_rate": 0.000417, "loss": 7.1461, "mean_token_accuracy": 0.13162968605756759, "num_tokens": 2081347.0, "step": 835 }, { "entropy": 7.183484840393066, "epoch": 0.9824561403508771, "grad_norm": 0.97265625, "learning_rate": 0.0004195, "loss": 7.0693, "mean_token_accuracy": 0.14508000239729882, "num_tokens": 2093121.0, "step": 840 }, { "entropy": 7.276888608932495, "epoch": 0.9883040935672515, "grad_norm": 0.984375, "learning_rate": 0.000422, "loss": 7.154, "mean_token_accuracy": 0.13984944075345992, "num_tokens": 2105098.0, "step": 845 }, { "entropy": 7.281503057479858, "epoch": 0.9941520467836257, "grad_norm": 1.0234375, "learning_rate": 0.0004245, "loss": 7.257, "mean_token_accuracy": 0.12888796031475067, "num_tokens": 2118305.0, "step": 850 }, { "entropy": 7.19629979133606, "epoch": 1.0, "grad_norm": 1.1953125, "learning_rate": 0.000427, "loss": 7.1088, "mean_token_accuracy": 0.14972682297229767, "num_tokens": 2129484.0, "step": 855 }, { "entropy": 7.273441553115845, "epoch": 1.0058479532163742, "grad_norm": 1.0, "learning_rate": 0.0004295, "loss": 6.9959, "mean_token_accuracy": 0.13713507130742073, "num_tokens": 2141996.0, "step": 860 }, { "entropy": 7.136537981033325, "epoch": 1.0116959064327484, "grad_norm": 0.94140625, "learning_rate": 0.000432, "loss": 6.9814, "mean_token_accuracy": 0.14575768858194352, "num_tokens": 2154396.0, "step": 865 }, { "entropy": 7.241056442260742, "epoch": 1.0175438596491229, "grad_norm": 1.109375, "learning_rate": 0.0004345, "loss": 6.8824, "mean_token_accuracy": 0.13679319769144058, "num_tokens": 2166397.0, "step": 870 }, { "entropy": 7.1693150997161865, "epoch": 1.023391812865497, "grad_norm": 1.1796875, "learning_rate": 0.000437, "loss": 7.052, "mean_token_accuracy": 0.13590832501649858, "num_tokens": 2180441.0, "step": 875 }, { "entropy": 7.1720458507537845, "epoch": 1.0292397660818713, "grad_norm": 1.1328125, "learning_rate": 0.0004395, "loss": 6.9798, "mean_token_accuracy": 0.14448419958353043, "num_tokens": 2192759.0, "step": 880 }, { "entropy": 7.048953914642334, "epoch": 1.0350877192982457, "grad_norm": 1.3828125, "learning_rate": 0.000442, "loss": 6.9222, "mean_token_accuracy": 0.14383947402238845, "num_tokens": 2205989.0, "step": 885 }, { "entropy": 7.172360372543335, "epoch": 1.04093567251462, "grad_norm": 1.046875, "learning_rate": 0.0004445, "loss": 6.9968, "mean_token_accuracy": 0.14286552369594574, "num_tokens": 2218780.0, "step": 890 }, { "entropy": 7.109023189544677, "epoch": 1.0467836257309941, "grad_norm": 1.125, "learning_rate": 0.000447, "loss": 7.0301, "mean_token_accuracy": 0.14032476022839546, "num_tokens": 2231748.0, "step": 895 }, { "entropy": 7.228937244415283, "epoch": 1.0526315789473684, "grad_norm": 1.203125, "learning_rate": 0.00044950000000000003, "loss": 7.0109, "mean_token_accuracy": 0.1399959348142147, "num_tokens": 2244635.0, "step": 900 }, { "entropy": 7.132290601730347, "epoch": 1.0584795321637426, "grad_norm": 1.140625, "learning_rate": 0.00045200000000000004, "loss": 6.9031, "mean_token_accuracy": 0.14366517663002015, "num_tokens": 2255941.0, "step": 905 }, { "entropy": 7.007370376586914, "epoch": 1.064327485380117, "grad_norm": 1.4765625, "learning_rate": 0.00045450000000000004, "loss": 6.9809, "mean_token_accuracy": 0.14777857810258865, "num_tokens": 2267162.0, "step": 910 }, { "entropy": 7.138269233703613, "epoch": 1.0701754385964912, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 6.9496, "mean_token_accuracy": 0.14804905876517296, "num_tokens": 2279290.0, "step": 915 }, { "entropy": 7.11580114364624, "epoch": 1.0760233918128654, "grad_norm": 1.1015625, "learning_rate": 0.00045950000000000006, "loss": 7.0084, "mean_token_accuracy": 0.13601162061095237, "num_tokens": 2293053.0, "step": 920 }, { "entropy": 7.015692281723022, "epoch": 1.0818713450292399, "grad_norm": 1.0703125, "learning_rate": 0.000462, "loss": 6.9212, "mean_token_accuracy": 0.14603447318077087, "num_tokens": 2305489.0, "step": 925 }, { "entropy": 7.051322793960571, "epoch": 1.087719298245614, "grad_norm": 1.03125, "learning_rate": 0.0004645, "loss": 6.8687, "mean_token_accuracy": 0.15775832384824753, "num_tokens": 2319310.0, "step": 930 }, { "entropy": 7.131311130523682, "epoch": 1.0935672514619883, "grad_norm": 0.98828125, "learning_rate": 0.000467, "loss": 7.0298, "mean_token_accuracy": 0.13980275765061378, "num_tokens": 2332132.0, "step": 935 }, { "entropy": 7.102800178527832, "epoch": 1.0994152046783625, "grad_norm": 1.1328125, "learning_rate": 0.0004695, "loss": 7.0008, "mean_token_accuracy": 0.14390438795089722, "num_tokens": 2343505.0, "step": 940 }, { "entropy": 7.119720315933227, "epoch": 1.1052631578947367, "grad_norm": 1.046875, "learning_rate": 0.000472, "loss": 6.9893, "mean_token_accuracy": 0.14247232899069787, "num_tokens": 2355930.0, "step": 945 }, { "entropy": 7.099494981765747, "epoch": 1.1111111111111112, "grad_norm": 1.015625, "learning_rate": 0.0004745, "loss": 6.9565, "mean_token_accuracy": 0.14375333711504937, "num_tokens": 2369820.0, "step": 950 }, { "entropy": 7.016859483718872, "epoch": 1.1169590643274854, "grad_norm": 1.0703125, "learning_rate": 0.000477, "loss": 6.9159, "mean_token_accuracy": 0.14982443079352378, "num_tokens": 2382375.0, "step": 955 }, { "entropy": 7.053458166122437, "epoch": 1.1228070175438596, "grad_norm": 1.1640625, "learning_rate": 0.0004795, "loss": 7.0089, "mean_token_accuracy": 0.14104411751031876, "num_tokens": 2393391.0, "step": 960 }, { "entropy": 7.047031879425049, "epoch": 1.128654970760234, "grad_norm": 1.171875, "learning_rate": 0.000482, "loss": 6.9345, "mean_token_accuracy": 0.1424281544983387, "num_tokens": 2405266.0, "step": 965 }, { "entropy": 7.0777851104736325, "epoch": 1.1345029239766082, "grad_norm": 1.0546875, "learning_rate": 0.0004845, "loss": 6.9704, "mean_token_accuracy": 0.14111316949129105, "num_tokens": 2418620.0, "step": 970 }, { "entropy": 7.027369260787964, "epoch": 1.1403508771929824, "grad_norm": 1.1328125, "learning_rate": 0.000487, "loss": 7.065, "mean_token_accuracy": 0.1403935208916664, "num_tokens": 2431107.0, "step": 975 }, { "entropy": 7.187720537185669, "epoch": 1.1461988304093567, "grad_norm": 1.046875, "learning_rate": 0.0004895, "loss": 7.0144, "mean_token_accuracy": 0.13802240937948226, "num_tokens": 2443729.0, "step": 980 }, { "entropy": 7.010544013977051, "epoch": 1.1520467836257309, "grad_norm": 1.0625, "learning_rate": 0.000492, "loss": 6.9195, "mean_token_accuracy": 0.14878860712051392, "num_tokens": 2456798.0, "step": 985 }, { "entropy": 7.0476819515228275, "epoch": 1.1578947368421053, "grad_norm": 1.1328125, "learning_rate": 0.0004945, "loss": 7.009, "mean_token_accuracy": 0.1457380011677742, "num_tokens": 2468701.0, "step": 990 }, { "entropy": 6.9938723087310795, "epoch": 1.1637426900584795, "grad_norm": 1.09375, "learning_rate": 0.000497, "loss": 6.9561, "mean_token_accuracy": 0.14130357205867766, "num_tokens": 2480391.0, "step": 995 }, { "entropy": 7.076553392410278, "epoch": 1.1695906432748537, "grad_norm": 1.015625, "learning_rate": 0.0004995, "loss": 6.9596, "mean_token_accuracy": 0.14768824875354766, "num_tokens": 2491887.0, "step": 1000 }, { "epoch": 1.1695906432748537, "eval_entropy": 6.926040534072921, "eval_loss": 7.151692867279053, "eval_mean_token_accuracy": 0.13112522253167752, "eval_num_tokens": 2491887.0, "eval_runtime": 2.2827, "eval_samples_per_second": 1185.89, "eval_steps_per_second": 148.51, "step": 1000 }, { "entropy": 7.03064193725586, "epoch": 1.1754385964912282, "grad_norm": 1.1015625, "learning_rate": 0.0004999996875147963, "loss": 6.9415, "mean_token_accuracy": 0.14060102105140687, "num_tokens": 2503490.0, "step": 1005 }, { "entropy": 7.09430251121521, "epoch": 1.1812865497076024, "grad_norm": 1.1015625, "learning_rate": 0.0004999984180451436, "loss": 7.0456, "mean_token_accuracy": 0.13780836313962935, "num_tokens": 2515330.0, "step": 1010 }, { "entropy": 7.0454943656921385, "epoch": 1.1871345029239766, "grad_norm": 1.0703125, "learning_rate": 0.0004999961720662221, "loss": 6.9752, "mean_token_accuracy": 0.1445000797510147, "num_tokens": 2526743.0, "step": 1015 }, { "entropy": 6.988425970077515, "epoch": 1.1929824561403508, "grad_norm": 1.03125, "learning_rate": 0.0004999929495877796, "loss": 7.0217, "mean_token_accuracy": 0.14440475553274154, "num_tokens": 2538343.0, "step": 1020 }, { "entropy": 7.189151477813721, "epoch": 1.198830409356725, "grad_norm": 2.21875, "learning_rate": 0.0004999887506238018, "loss": 7.1389, "mean_token_accuracy": 0.13006046786904335, "num_tokens": 2552687.0, "step": 1025 }, { "entropy": 6.918720817565918, "epoch": 1.2046783625730995, "grad_norm": 1.3671875, "learning_rate": 0.0004999835751925124, "loss": 6.9506, "mean_token_accuracy": 0.15075658932328223, "num_tokens": 2565666.0, "step": 1030 }, { "entropy": 6.996754360198975, "epoch": 1.2105263157894737, "grad_norm": 1.171875, "learning_rate": 0.0004999774233163734, "loss": 6.9527, "mean_token_accuracy": 0.1366286665201187, "num_tokens": 2578233.0, "step": 1035 }, { "entropy": 7.082205200195313, "epoch": 1.2163742690058479, "grad_norm": 1.0, "learning_rate": 0.0004999702950220841, "loss": 6.9552, "mean_token_accuracy": 0.14596255272626876, "num_tokens": 2590221.0, "step": 1040 }, { "entropy": 6.949472808837891, "epoch": 1.2222222222222223, "grad_norm": 1.1015625, "learning_rate": 0.0004999621903405819, "loss": 6.9768, "mean_token_accuracy": 0.13911690190434456, "num_tokens": 2602807.0, "step": 1045 }, { "entropy": 7.050590658187867, "epoch": 1.2280701754385965, "grad_norm": 1.0, "learning_rate": 0.000499953109307042, "loss": 7.0195, "mean_token_accuracy": 0.13519042506814002, "num_tokens": 2615273.0, "step": 1050 }, { "entropy": 7.007106781005859, "epoch": 1.2339181286549707, "grad_norm": 1.0, "learning_rate": 0.0004999430519608762, "loss": 6.9877, "mean_token_accuracy": 0.13718256056308747, "num_tokens": 2627077.0, "step": 1055 }, { "entropy": 7.059272384643554, "epoch": 1.239766081871345, "grad_norm": 1.1171875, "learning_rate": 0.0004999320183457346, "loss": 6.9618, "mean_token_accuracy": 0.13905680626630784, "num_tokens": 2640580.0, "step": 1060 }, { "entropy": 6.970555400848388, "epoch": 1.2456140350877192, "grad_norm": 1.0078125, "learning_rate": 0.0004999200085095035, "loss": 7.0246, "mean_token_accuracy": 0.13743191361427307, "num_tokens": 2653906.0, "step": 1065 }, { "entropy": 6.9946081161499025, "epoch": 1.2514619883040936, "grad_norm": 0.97265625, "learning_rate": 0.0004999070225043068, "loss": 6.97, "mean_token_accuracy": 0.14154034852981567, "num_tokens": 2666021.0, "step": 1070 }, { "entropy": 7.074818181991577, "epoch": 1.2573099415204678, "grad_norm": 1.015625, "learning_rate": 0.0004998930603865042, "loss": 6.9002, "mean_token_accuracy": 0.14058925807476044, "num_tokens": 2678542.0, "step": 1075 }, { "entropy": 6.897901296615601, "epoch": 1.263157894736842, "grad_norm": 1.03125, "learning_rate": 0.0004998781222166929, "loss": 6.943, "mean_token_accuracy": 0.14766753390431403, "num_tokens": 2691006.0, "step": 1080 }, { "entropy": 7.105810642242432, "epoch": 1.2690058479532165, "grad_norm": 0.9609375, "learning_rate": 0.0004998622080597052, "loss": 7.0293, "mean_token_accuracy": 0.14189143255352973, "num_tokens": 2704064.0, "step": 1085 }, { "entropy": 6.975711107254028, "epoch": 1.2748538011695907, "grad_norm": 1.078125, "learning_rate": 0.0004998453179846098, "loss": 6.9269, "mean_token_accuracy": 0.13873959332704544, "num_tokens": 2717452.0, "step": 1090 }, { "entropy": 6.936954832077026, "epoch": 1.280701754385965, "grad_norm": 1.0546875, "learning_rate": 0.0004998274520647109, "loss": 6.8894, "mean_token_accuracy": 0.1417660728096962, "num_tokens": 2730969.0, "step": 1095 }, { "entropy": 6.8774402141571045, "epoch": 1.286549707602339, "grad_norm": 1.015625, "learning_rate": 0.0004998086103775478, "loss": 6.8991, "mean_token_accuracy": 0.1409339912235737, "num_tokens": 2742648.0, "step": 1100 }, { "entropy": 6.919243955612183, "epoch": 1.2923976608187133, "grad_norm": 1.125, "learning_rate": 0.0004997887930048947, "loss": 6.8285, "mean_token_accuracy": 0.1467128537595272, "num_tokens": 2754816.0, "step": 1105 }, { "entropy": 6.961157989501953, "epoch": 1.2982456140350878, "grad_norm": 0.95703125, "learning_rate": 0.0004997680000327607, "loss": 6.9841, "mean_token_accuracy": 0.13582526817917823, "num_tokens": 2767066.0, "step": 1110 }, { "entropy": 6.939070129394532, "epoch": 1.304093567251462, "grad_norm": 1.0078125, "learning_rate": 0.0004997462315513884, "loss": 6.873, "mean_token_accuracy": 0.14410377591848372, "num_tokens": 2779251.0, "step": 1115 }, { "entropy": 6.994794654846191, "epoch": 1.3099415204678362, "grad_norm": 0.96484375, "learning_rate": 0.000499723487655255, "loss": 6.8864, "mean_token_accuracy": 0.1423727609217167, "num_tokens": 2791743.0, "step": 1120 }, { "entropy": 6.952969026565552, "epoch": 1.3157894736842106, "grad_norm": 0.9375, "learning_rate": 0.0004996997684430703, "loss": 6.9278, "mean_token_accuracy": 0.14672429263591766, "num_tokens": 2804694.0, "step": 1125 }, { "entropy": 6.930943393707276, "epoch": 1.3216374269005848, "grad_norm": 1.109375, "learning_rate": 0.0004996750740177775, "loss": 6.905, "mean_token_accuracy": 0.14298794865608216, "num_tokens": 2816484.0, "step": 1130 }, { "entropy": 6.945026159286499, "epoch": 1.327485380116959, "grad_norm": 0.953125, "learning_rate": 0.0004996494044865521, "loss": 6.9284, "mean_token_accuracy": 0.1373042084276676, "num_tokens": 2829353.0, "step": 1135 }, { "entropy": 6.875068235397339, "epoch": 1.3333333333333333, "grad_norm": 0.9609375, "learning_rate": 0.0004996227599608018, "loss": 6.8588, "mean_token_accuracy": 0.14598043411970138, "num_tokens": 2842695.0, "step": 1140 }, { "entropy": 6.885642242431641, "epoch": 1.3391812865497075, "grad_norm": 1.09375, "learning_rate": 0.0004995951405561658, "loss": 6.836, "mean_token_accuracy": 0.14788470193743705, "num_tokens": 2855627.0, "step": 1145 }, { "entropy": 6.8490643978118895, "epoch": 1.345029239766082, "grad_norm": 1.0625, "learning_rate": 0.0004995665463925142, "loss": 6.8251, "mean_token_accuracy": 0.15566134750843047, "num_tokens": 2868132.0, "step": 1150 }, { "entropy": 6.898070859909057, "epoch": 1.3508771929824561, "grad_norm": 1.0, "learning_rate": 0.0004995369775939478, "loss": 6.8227, "mean_token_accuracy": 0.13949502557516097, "num_tokens": 2880641.0, "step": 1155 }, { "entropy": 6.863165760040284, "epoch": 1.3567251461988303, "grad_norm": 1.03125, "learning_rate": 0.0004995064342887972, "loss": 6.8693, "mean_token_accuracy": 0.14175399467349054, "num_tokens": 2892479.0, "step": 1160 }, { "entropy": 6.998213052749634, "epoch": 1.3625730994152048, "grad_norm": 0.9296875, "learning_rate": 0.0004994749166096226, "loss": 6.9284, "mean_token_accuracy": 0.14056200981140138, "num_tokens": 2905675.0, "step": 1165 }, { "entropy": 6.885084772109986, "epoch": 1.368421052631579, "grad_norm": 1.015625, "learning_rate": 0.0004994424246932129, "loss": 6.9458, "mean_token_accuracy": 0.1405379667878151, "num_tokens": 2918259.0, "step": 1170 }, { "entropy": 6.960570287704468, "epoch": 1.3742690058479532, "grad_norm": 0.97265625, "learning_rate": 0.0004994089586805856, "loss": 6.8332, "mean_token_accuracy": 0.15375758558511735, "num_tokens": 2932280.0, "step": 1175 }, { "entropy": 6.81732406616211, "epoch": 1.3801169590643274, "grad_norm": 1.0546875, "learning_rate": 0.0004993745187169852, "loss": 6.877, "mean_token_accuracy": 0.14667267948389054, "num_tokens": 2944385.0, "step": 1180 }, { "entropy": 6.933884525299073, "epoch": 1.3859649122807016, "grad_norm": 1.1328125, "learning_rate": 0.000499339104951884, "loss": 6.8819, "mean_token_accuracy": 0.13797343596816064, "num_tokens": 2956239.0, "step": 1185 }, { "entropy": 6.908072471618652, "epoch": 1.391812865497076, "grad_norm": 0.98046875, "learning_rate": 0.00049930271753898, "loss": 6.9006, "mean_token_accuracy": 0.14377526491880416, "num_tokens": 2967948.0, "step": 1190 }, { "entropy": 6.873384141921997, "epoch": 1.3976608187134503, "grad_norm": 0.98828125, "learning_rate": 0.0004992653566361974, "loss": 6.8464, "mean_token_accuracy": 0.14522414803504943, "num_tokens": 2979589.0, "step": 1195 }, { "entropy": 6.831958150863647, "epoch": 1.4035087719298245, "grad_norm": 0.9765625, "learning_rate": 0.0004992270224056849, "loss": 6.8398, "mean_token_accuracy": 0.14143177419900893, "num_tokens": 2991679.0, "step": 1200 }, { "entropy": 6.917820596694947, "epoch": 1.409356725146199, "grad_norm": 1.0078125, "learning_rate": 0.0004991877150138162, "loss": 6.8751, "mean_token_accuracy": 0.13764828592538833, "num_tokens": 3004037.0, "step": 1205 }, { "entropy": 6.871622037887573, "epoch": 1.4152046783625731, "grad_norm": 0.9765625, "learning_rate": 0.0004991474346311879, "loss": 6.8488, "mean_token_accuracy": 0.14050350114703178, "num_tokens": 3016632.0, "step": 1210 }, { "entropy": 6.868418455123901, "epoch": 1.4210526315789473, "grad_norm": 1.015625, "learning_rate": 0.0004991061814326198, "loss": 6.8466, "mean_token_accuracy": 0.14317608624696732, "num_tokens": 3029095.0, "step": 1215 }, { "entropy": 6.901586484909058, "epoch": 1.4269005847953216, "grad_norm": 0.9375, "learning_rate": 0.0004990639555971539, "loss": 6.8753, "mean_token_accuracy": 0.13867598176002502, "num_tokens": 3042467.0, "step": 1220 }, { "entropy": 6.995685815811157, "epoch": 1.4327485380116958, "grad_norm": 0.94140625, "learning_rate": 0.0004990207573080533, "loss": 6.9927, "mean_token_accuracy": 0.13158960789442062, "num_tokens": 3056233.0, "step": 1225 }, { "entropy": 6.840405225753784, "epoch": 1.4385964912280702, "grad_norm": 1.0078125, "learning_rate": 0.0004989765867528014, "loss": 6.9191, "mean_token_accuracy": 0.14545614793896675, "num_tokens": 3069216.0, "step": 1230 }, { "entropy": 6.882023048400879, "epoch": 1.4444444444444444, "grad_norm": 0.94140625, "learning_rate": 0.0004989314441231019, "loss": 6.8113, "mean_token_accuracy": 0.15136598646640778, "num_tokens": 3081116.0, "step": 1235 }, { "entropy": 6.936877727508545, "epoch": 1.4502923976608186, "grad_norm": 1.0078125, "learning_rate": 0.000498885329614877, "loss": 6.9482, "mean_token_accuracy": 0.13658374026417733, "num_tokens": 3093284.0, "step": 1240 }, { "entropy": 6.829084968566894, "epoch": 1.456140350877193, "grad_norm": 1.0625, "learning_rate": 0.0004988382434282668, "loss": 6.856, "mean_token_accuracy": 0.14588840380311013, "num_tokens": 3105147.0, "step": 1245 }, { "entropy": 6.857968950271607, "epoch": 1.4619883040935673, "grad_norm": 0.99609375, "learning_rate": 0.000498790185767629, "loss": 6.8391, "mean_token_accuracy": 0.1462831415235996, "num_tokens": 3116457.0, "step": 1250 }, { "entropy": 6.828664684295655, "epoch": 1.4678362573099415, "grad_norm": 0.98828125, "learning_rate": 0.000498741156841537, "loss": 6.8415, "mean_token_accuracy": 0.1462543435394764, "num_tokens": 3128223.0, "step": 1255 }, { "entropy": 6.85268268585205, "epoch": 1.4736842105263157, "grad_norm": 1.03125, "learning_rate": 0.00049869115686278, "loss": 6.8888, "mean_token_accuracy": 0.14214529991149902, "num_tokens": 3139886.0, "step": 1260 }, { "entropy": 6.931294393539429, "epoch": 1.47953216374269, "grad_norm": 0.93359375, "learning_rate": 0.0004986401860483615, "loss": 6.878, "mean_token_accuracy": 0.13950230181217194, "num_tokens": 3152624.0, "step": 1265 }, { "entropy": 6.762976217269897, "epoch": 1.4853801169590644, "grad_norm": 0.9609375, "learning_rate": 0.0004985882446194984, "loss": 6.7706, "mean_token_accuracy": 0.14813553541898727, "num_tokens": 3164881.0, "step": 1270 }, { "entropy": 6.894041299819946, "epoch": 1.4912280701754386, "grad_norm": 0.99609375, "learning_rate": 0.0004985353328016204, "loss": 6.8605, "mean_token_accuracy": 0.13663011640310288, "num_tokens": 3177967.0, "step": 1275 }, { "entropy": 6.873754501342773, "epoch": 1.4970760233918128, "grad_norm": 0.9921875, "learning_rate": 0.0004984814508243685, "loss": 6.8768, "mean_token_accuracy": 0.14321380108594894, "num_tokens": 3190646.0, "step": 1280 }, { "entropy": 6.8783287525177, "epoch": 1.5029239766081872, "grad_norm": 1.4140625, "learning_rate": 0.0004984265989215942, "loss": 6.8155, "mean_token_accuracy": 0.13877278193831444, "num_tokens": 3203299.0, "step": 1285 }, { "entropy": 6.81124324798584, "epoch": 1.5087719298245614, "grad_norm": 1.015625, "learning_rate": 0.0004983707773313589, "loss": 6.9135, "mean_token_accuracy": 0.13964597284793853, "num_tokens": 3215992.0, "step": 1290 }, { "entropy": 6.783960151672363, "epoch": 1.5146198830409356, "grad_norm": 1.1328125, "learning_rate": 0.0004983139862959322, "loss": 6.8065, "mean_token_accuracy": 0.14580969959497453, "num_tokens": 3228989.0, "step": 1295 }, { "entropy": 6.869039011001587, "epoch": 1.52046783625731, "grad_norm": 0.984375, "learning_rate": 0.0004982562260617912, "loss": 6.9118, "mean_token_accuracy": 0.1454062916338444, "num_tokens": 3241635.0, "step": 1300 }, { "entropy": 6.80722713470459, "epoch": 1.526315789473684, "grad_norm": 0.89453125, "learning_rate": 0.0004981974968796197, "loss": 6.843, "mean_token_accuracy": 0.14277214854955672, "num_tokens": 3253590.0, "step": 1305 }, { "entropy": 6.783811759948731, "epoch": 1.5321637426900585, "grad_norm": 1.0625, "learning_rate": 0.0004981377990043064, "loss": 6.7871, "mean_token_accuracy": 0.15090060085058213, "num_tokens": 3264859.0, "step": 1310 }, { "entropy": 6.9159692287445065, "epoch": 1.5380116959064327, "grad_norm": 1.03125, "learning_rate": 0.0004980771326949442, "loss": 6.8957, "mean_token_accuracy": 0.14444180428981782, "num_tokens": 3276353.0, "step": 1315 }, { "entropy": 6.745017957687378, "epoch": 1.543859649122807, "grad_norm": 0.94921875, "learning_rate": 0.0004980154982148296, "loss": 6.8208, "mean_token_accuracy": 0.14608026593923568, "num_tokens": 3288876.0, "step": 1320 }, { "entropy": 6.809013080596924, "epoch": 1.5497076023391814, "grad_norm": 0.98828125, "learning_rate": 0.0004979528958314604, "loss": 6.8369, "mean_token_accuracy": 0.13851020634174346, "num_tokens": 3300648.0, "step": 1325 }, { "entropy": 6.806869745254517, "epoch": 1.5555555555555556, "grad_norm": 0.98828125, "learning_rate": 0.0004978893258165354, "loss": 6.7788, "mean_token_accuracy": 0.1443500228226185, "num_tokens": 3313664.0, "step": 1330 }, { "entropy": 6.917032289505005, "epoch": 1.5614035087719298, "grad_norm": 0.95703125, "learning_rate": 0.0004978247884459532, "loss": 6.8891, "mean_token_accuracy": 0.13166723549365997, "num_tokens": 3326221.0, "step": 1335 }, { "entropy": 6.7701085090637205, "epoch": 1.5672514619883042, "grad_norm": 1.125, "learning_rate": 0.0004977592839998105, "loss": 6.8167, "mean_token_accuracy": 0.14367288127541541, "num_tokens": 3337470.0, "step": 1340 }, { "entropy": 6.8947234630584715, "epoch": 1.5730994152046782, "grad_norm": 1.140625, "learning_rate": 0.0004976928127624013, "loss": 6.9031, "mean_token_accuracy": 0.14372491762042044, "num_tokens": 3350925.0, "step": 1345 }, { "entropy": 6.732043361663818, "epoch": 1.5789473684210527, "grad_norm": 1.4609375, "learning_rate": 0.0004976253750222157, "loss": 6.8264, "mean_token_accuracy": 0.14307058081030846, "num_tokens": 3363387.0, "step": 1350 }, { "entropy": 6.8033754348754885, "epoch": 1.5847953216374269, "grad_norm": 0.99609375, "learning_rate": 0.0004975569710719382, "loss": 6.8028, "mean_token_accuracy": 0.14749399870634078, "num_tokens": 3376640.0, "step": 1355 }, { "entropy": 6.904033422470093, "epoch": 1.590643274853801, "grad_norm": 0.984375, "learning_rate": 0.0004974876012084468, "loss": 6.8209, "mean_token_accuracy": 0.14032859951257706, "num_tokens": 3389848.0, "step": 1360 }, { "entropy": 6.781014633178711, "epoch": 1.5964912280701755, "grad_norm": 1.015625, "learning_rate": 0.0004974172657328116, "loss": 6.8459, "mean_token_accuracy": 0.14404987692832946, "num_tokens": 3401862.0, "step": 1365 }, { "entropy": 6.809361743927002, "epoch": 1.6023391812865497, "grad_norm": 1.0234375, "learning_rate": 0.0004973459649502939, "loss": 6.8454, "mean_token_accuracy": 0.14433501437306404, "num_tokens": 3414719.0, "step": 1370 }, { "entropy": 6.862741851806641, "epoch": 1.608187134502924, "grad_norm": 1.03125, "learning_rate": 0.0004972736991703439, "loss": 6.7987, "mean_token_accuracy": 0.14657391011714935, "num_tokens": 3427391.0, "step": 1375 }, { "entropy": 6.804032707214356, "epoch": 1.6140350877192984, "grad_norm": 0.97265625, "learning_rate": 0.0004972004687066005, "loss": 6.8671, "mean_token_accuracy": 0.14304091930389404, "num_tokens": 3440203.0, "step": 1380 }, { "entropy": 6.806503057479858, "epoch": 1.6198830409356724, "grad_norm": 1.15625, "learning_rate": 0.000497126273876889, "loss": 6.7804, "mean_token_accuracy": 0.14722208082675933, "num_tokens": 3451801.0, "step": 1385 }, { "entropy": 6.850189828872681, "epoch": 1.6257309941520468, "grad_norm": 0.97265625, "learning_rate": 0.0004970511150032205, "loss": 6.7863, "mean_token_accuracy": 0.1449687287211418, "num_tokens": 3464039.0, "step": 1390 }, { "entropy": 6.808931350708008, "epoch": 1.631578947368421, "grad_norm": 0.90625, "learning_rate": 0.0004969749924117896, "loss": 6.8233, "mean_token_accuracy": 0.14308529123663902, "num_tokens": 3476373.0, "step": 1395 }, { "entropy": 6.705229377746582, "epoch": 1.6374269005847952, "grad_norm": 1.0625, "learning_rate": 0.0004968979064329741, "loss": 6.7733, "mean_token_accuracy": 0.1510583981871605, "num_tokens": 3487586.0, "step": 1400 }, { "entropy": 6.747954416275024, "epoch": 1.6432748538011697, "grad_norm": 0.98828125, "learning_rate": 0.0004968198574013323, "loss": 6.7678, "mean_token_accuracy": 0.14269521757960318, "num_tokens": 3501210.0, "step": 1405 }, { "entropy": 6.826955032348633, "epoch": 1.6491228070175439, "grad_norm": 0.984375, "learning_rate": 0.000496740845655603, "loss": 6.786, "mean_token_accuracy": 0.143802759796381, "num_tokens": 3513958.0, "step": 1410 }, { "entropy": 6.692679595947266, "epoch": 1.654970760233918, "grad_norm": 0.94921875, "learning_rate": 0.0004966608715387029, "loss": 6.7705, "mean_token_accuracy": 0.15449799299240113, "num_tokens": 3526297.0, "step": 1415 }, { "entropy": 6.825113105773926, "epoch": 1.6608187134502925, "grad_norm": 0.95703125, "learning_rate": 0.0004965799353977248, "loss": 6.7264, "mean_token_accuracy": 0.1499396577477455, "num_tokens": 3538308.0, "step": 1420 }, { "entropy": 6.663604831695556, "epoch": 1.6666666666666665, "grad_norm": 1.0546875, "learning_rate": 0.0004964980375839379, "loss": 6.7788, "mean_token_accuracy": 0.14948643296957015, "num_tokens": 3550240.0, "step": 1425 }, { "entropy": 6.810740041732788, "epoch": 1.672514619883041, "grad_norm": 1.125, "learning_rate": 0.0004964151784527844, "loss": 6.8177, "mean_token_accuracy": 0.14038417786359786, "num_tokens": 3562181.0, "step": 1430 }, { "entropy": 6.7995506763458256, "epoch": 1.6783625730994152, "grad_norm": 0.953125, "learning_rate": 0.000496331358363879, "loss": 6.8748, "mean_token_accuracy": 0.14474193155765533, "num_tokens": 3574643.0, "step": 1435 }, { "entropy": 6.722173357009888, "epoch": 1.6842105263157894, "grad_norm": 0.98046875, "learning_rate": 0.0004962465776810066, "loss": 6.6783, "mean_token_accuracy": 0.14990489184856415, "num_tokens": 3586415.0, "step": 1440 }, { "entropy": 6.80692310333252, "epoch": 1.6900584795321638, "grad_norm": 1.0390625, "learning_rate": 0.0004961608367721217, "loss": 6.796, "mean_token_accuracy": 0.14830706417560577, "num_tokens": 3598452.0, "step": 1445 }, { "entropy": 6.748047399520874, "epoch": 1.695906432748538, "grad_norm": 0.9921875, "learning_rate": 0.0004960741360093459, "loss": 6.8383, "mean_token_accuracy": 0.1371912442147732, "num_tokens": 3610899.0, "step": 1450 }, { "entropy": 6.785003566741944, "epoch": 1.7017543859649122, "grad_norm": 0.9453125, "learning_rate": 0.0004959864757689669, "loss": 6.7816, "mean_token_accuracy": 0.14844242185354234, "num_tokens": 3622475.0, "step": 1455 }, { "entropy": 6.718051433563232, "epoch": 1.7076023391812867, "grad_norm": 0.97265625, "learning_rate": 0.0004958978564314361, "loss": 6.8765, "mean_token_accuracy": 0.1463383197784424, "num_tokens": 3635860.0, "step": 1460 }, { "entropy": 6.84115424156189, "epoch": 1.7134502923976607, "grad_norm": 0.875, "learning_rate": 0.000495808278381368, "loss": 6.8372, "mean_token_accuracy": 0.13889722377061844, "num_tokens": 3648718.0, "step": 1465 }, { "entropy": 6.708309984207153, "epoch": 1.719298245614035, "grad_norm": 0.96484375, "learning_rate": 0.0004957177420075377, "loss": 6.7553, "mean_token_accuracy": 0.14848395586013793, "num_tokens": 3660746.0, "step": 1470 }, { "entropy": 6.7734802722930905, "epoch": 1.7251461988304093, "grad_norm": 0.8984375, "learning_rate": 0.0004956262477028797, "loss": 6.7964, "mean_token_accuracy": 0.14100225493311883, "num_tokens": 3673573.0, "step": 1475 }, { "entropy": 6.736315965652466, "epoch": 1.7309941520467835, "grad_norm": 1.0859375, "learning_rate": 0.0004955337958644857, "loss": 6.6375, "mean_token_accuracy": 0.1544882595539093, "num_tokens": 3685771.0, "step": 1480 }, { "entropy": 6.674497795104981, "epoch": 1.736842105263158, "grad_norm": 0.9609375, "learning_rate": 0.0004954403868936032, "loss": 6.7876, "mean_token_accuracy": 0.1484549582004547, "num_tokens": 3698882.0, "step": 1485 }, { "entropy": 6.761597156524658, "epoch": 1.7426900584795322, "grad_norm": 0.984375, "learning_rate": 0.000495346021195634, "loss": 6.8086, "mean_token_accuracy": 0.14867511242628098, "num_tokens": 3712820.0, "step": 1490 }, { "entropy": 6.776470708847046, "epoch": 1.7485380116959064, "grad_norm": 0.96875, "learning_rate": 0.0004952506991801319, "loss": 6.7569, "mean_token_accuracy": 0.14823356494307519, "num_tokens": 3724845.0, "step": 1495 }, { "entropy": 6.657959222793579, "epoch": 1.7543859649122808, "grad_norm": 0.95703125, "learning_rate": 0.0004951544212608015, "loss": 6.6243, "mean_token_accuracy": 0.16444699168205262, "num_tokens": 3736309.0, "step": 1500 }, { "epoch": 1.7543859649122808, "eval_entropy": 6.543074199935328, "eval_loss": 6.911302089691162, "eval_mean_token_accuracy": 0.1365549994500733, "eval_num_tokens": 3736309.0, "eval_runtime": 2.2834, "eval_samples_per_second": 1185.535, "eval_steps_per_second": 148.466, "step": 1500 }, { "entropy": 6.784309244155883, "epoch": 1.7602339181286548, "grad_norm": 0.98046875, "learning_rate": 0.0004950571878554956, "loss": 6.792, "mean_token_accuracy": 0.14341349452733992, "num_tokens": 3748800.0, "step": 1505 }, { "entropy": 6.687272214889527, "epoch": 1.7660818713450293, "grad_norm": 0.94921875, "learning_rate": 0.0004949589993862143, "loss": 6.7631, "mean_token_accuracy": 0.15106673985719682, "num_tokens": 3760753.0, "step": 1510 }, { "entropy": 6.770102500915527, "epoch": 1.7719298245614035, "grad_norm": 0.90234375, "learning_rate": 0.0004948598562791025, "loss": 6.8495, "mean_token_accuracy": 0.14250847771763803, "num_tokens": 3773915.0, "step": 1515 }, { "entropy": 6.74422779083252, "epoch": 1.7777777777777777, "grad_norm": 0.98046875, "learning_rate": 0.0004947597589644484, "loss": 6.7437, "mean_token_accuracy": 0.14317139536142348, "num_tokens": 3785907.0, "step": 1520 }, { "entropy": 6.7505429744720455, "epoch": 1.7836257309941521, "grad_norm": 0.9140625, "learning_rate": 0.0004946587078766818, "loss": 6.6894, "mean_token_accuracy": 0.15321093127131463, "num_tokens": 3798407.0, "step": 1525 }, { "entropy": 6.542722606658936, "epoch": 1.7894736842105263, "grad_norm": 0.97265625, "learning_rate": 0.0004945567034543712, "loss": 6.704, "mean_token_accuracy": 0.15031700879335402, "num_tokens": 3810586.0, "step": 1530 }, { "entropy": 6.850691318511963, "epoch": 1.7953216374269005, "grad_norm": 1.125, "learning_rate": 0.0004944537461402234, "loss": 6.7884, "mean_token_accuracy": 0.14434545189142228, "num_tokens": 3823901.0, "step": 1535 }, { "entropy": 6.730458450317383, "epoch": 1.801169590643275, "grad_norm": 0.94140625, "learning_rate": 0.0004943498363810807, "loss": 6.8062, "mean_token_accuracy": 0.13911711871623994, "num_tokens": 3836926.0, "step": 1540 }, { "entropy": 6.723568391799927, "epoch": 1.807017543859649, "grad_norm": 0.9921875, "learning_rate": 0.0004942449746279184, "loss": 6.5866, "mean_token_accuracy": 0.15482160598039627, "num_tokens": 3849291.0, "step": 1545 }, { "entropy": 6.727809047698974, "epoch": 1.8128654970760234, "grad_norm": 0.97265625, "learning_rate": 0.0004941391613358444, "loss": 6.8201, "mean_token_accuracy": 0.1427263304591179, "num_tokens": 3862002.0, "step": 1550 }, { "entropy": 6.651541233062744, "epoch": 1.8187134502923976, "grad_norm": 0.94921875, "learning_rate": 0.000494032396964096, "loss": 6.725, "mean_token_accuracy": 0.1479753792285919, "num_tokens": 3874538.0, "step": 1555 }, { "entropy": 6.704821348190308, "epoch": 1.8245614035087718, "grad_norm": 0.88671875, "learning_rate": 0.000493924681976038, "loss": 6.6901, "mean_token_accuracy": 0.1507028266787529, "num_tokens": 3886682.0, "step": 1560 }, { "entropy": 6.611117172241211, "epoch": 1.8304093567251463, "grad_norm": 0.953125, "learning_rate": 0.0004938160168391614, "loss": 6.6522, "mean_token_accuracy": 0.14730015993118287, "num_tokens": 3898144.0, "step": 1565 }, { "entropy": 6.8177355289459225, "epoch": 1.8362573099415205, "grad_norm": 0.96484375, "learning_rate": 0.0004937064020250804, "loss": 6.8447, "mean_token_accuracy": 0.14146786481142043, "num_tokens": 3910209.0, "step": 1570 }, { "entropy": 6.690582036972046, "epoch": 1.8421052631578947, "grad_norm": 1.0, "learning_rate": 0.0004935958380095316, "loss": 6.764, "mean_token_accuracy": 0.15035033375024795, "num_tokens": 3923401.0, "step": 1575 }, { "entropy": 6.772142171859741, "epoch": 1.8479532163742691, "grad_norm": 0.94140625, "learning_rate": 0.0004934843252723702, "loss": 6.6814, "mean_token_accuracy": 0.1467684879899025, "num_tokens": 3934970.0, "step": 1580 }, { "entropy": 6.598661994934082, "epoch": 1.8538011695906431, "grad_norm": 0.9609375, "learning_rate": 0.00049337186429757, "loss": 6.5979, "mean_token_accuracy": 0.15314390659332275, "num_tokens": 3945543.0, "step": 1585 }, { "entropy": 6.618632888793945, "epoch": 1.8596491228070176, "grad_norm": 0.99609375, "learning_rate": 0.0004932584555732192, "loss": 6.7086, "mean_token_accuracy": 0.15223760306835174, "num_tokens": 3958152.0, "step": 1590 }, { "entropy": 6.754468250274658, "epoch": 1.8654970760233918, "grad_norm": 0.93359375, "learning_rate": 0.0004931440995915203, "loss": 6.7092, "mean_token_accuracy": 0.14498373717069626, "num_tokens": 3972173.0, "step": 1595 }, { "entropy": 6.704925966262818, "epoch": 1.871345029239766, "grad_norm": 0.89453125, "learning_rate": 0.000493028796848786, "loss": 6.7804, "mean_token_accuracy": 0.1387328766286373, "num_tokens": 3985865.0, "step": 1600 }, { "entropy": 6.787711143493652, "epoch": 1.8771929824561404, "grad_norm": 1.2890625, "learning_rate": 0.0004929125478454389, "loss": 6.6433, "mean_token_accuracy": 0.15223552137613297, "num_tokens": 3999026.0, "step": 1605 }, { "entropy": 6.648384428024292, "epoch": 1.8830409356725146, "grad_norm": 1.015625, "learning_rate": 0.0004927953530860077, "loss": 6.7554, "mean_token_accuracy": 0.14936705231666564, "num_tokens": 4011270.0, "step": 1610 }, { "entropy": 6.763438940048218, "epoch": 1.8888888888888888, "grad_norm": 0.921875, "learning_rate": 0.0004926772130791261, "loss": 6.7552, "mean_token_accuracy": 0.14583429992198943, "num_tokens": 4024162.0, "step": 1615 }, { "entropy": 6.708201503753662, "epoch": 1.8947368421052633, "grad_norm": 0.9609375, "learning_rate": 0.0004925581283375303, "loss": 6.7003, "mean_token_accuracy": 0.1484905406832695, "num_tokens": 4037066.0, "step": 1620 }, { "entropy": 6.667509937286377, "epoch": 1.9005847953216373, "grad_norm": 0.94921875, "learning_rate": 0.0004924380993780566, "loss": 6.7202, "mean_token_accuracy": 0.14748010113835336, "num_tokens": 4050096.0, "step": 1625 }, { "entropy": 6.7155702114105225, "epoch": 1.9064327485380117, "grad_norm": 0.94140625, "learning_rate": 0.0004923171267216392, "loss": 6.7029, "mean_token_accuracy": 0.14461838454008102, "num_tokens": 4061691.0, "step": 1630 }, { "entropy": 6.605735349655151, "epoch": 1.912280701754386, "grad_norm": 0.9375, "learning_rate": 0.0004921952108933083, "loss": 6.6427, "mean_token_accuracy": 0.15174098312854767, "num_tokens": 4073087.0, "step": 1635 }, { "entropy": 6.74940333366394, "epoch": 1.9181286549707601, "grad_norm": 0.95703125, "learning_rate": 0.0004920723524221871, "loss": 6.7546, "mean_token_accuracy": 0.149676413834095, "num_tokens": 4086055.0, "step": 1640 }, { "entropy": 6.657784175872803, "epoch": 1.9239766081871346, "grad_norm": 0.90234375, "learning_rate": 0.0004919485518414902, "loss": 6.6928, "mean_token_accuracy": 0.1461845487356186, "num_tokens": 4099258.0, "step": 1645 }, { "entropy": 6.716952657699585, "epoch": 1.9298245614035088, "grad_norm": 0.9609375, "learning_rate": 0.0004918238096885213, "loss": 6.7637, "mean_token_accuracy": 0.14263566285371782, "num_tokens": 4111545.0, "step": 1650 }, { "entropy": 6.661676263809204, "epoch": 1.935672514619883, "grad_norm": 0.9140625, "learning_rate": 0.00049169812650467, "loss": 6.7076, "mean_token_accuracy": 0.15014173984527587, "num_tokens": 4123373.0, "step": 1655 }, { "entropy": 6.673471117019654, "epoch": 1.9415204678362574, "grad_norm": 0.87109375, "learning_rate": 0.0004915715028354102, "loss": 6.7194, "mean_token_accuracy": 0.1462250053882599, "num_tokens": 4136551.0, "step": 1660 }, { "entropy": 6.69158616065979, "epoch": 1.9473684210526314, "grad_norm": 0.9609375, "learning_rate": 0.0004914439392302981, "loss": 6.6811, "mean_token_accuracy": 0.14650024399161338, "num_tokens": 4149560.0, "step": 1665 }, { "entropy": 6.646466588973999, "epoch": 1.9532163742690059, "grad_norm": 0.91796875, "learning_rate": 0.0004913154362429686, "loss": 6.5991, "mean_token_accuracy": 0.15584417134523393, "num_tokens": 4161767.0, "step": 1670 }, { "entropy": 6.681569337844849, "epoch": 1.95906432748538, "grad_norm": 0.921875, "learning_rate": 0.0004911859944311341, "loss": 6.6893, "mean_token_accuracy": 0.15823563933372498, "num_tokens": 4174203.0, "step": 1675 }, { "entropy": 6.643621110916138, "epoch": 1.9649122807017543, "grad_norm": 0.8984375, "learning_rate": 0.0004910556143565812, "loss": 6.7018, "mean_token_accuracy": 0.15049159824848174, "num_tokens": 4186725.0, "step": 1680 }, { "entropy": 6.665674304962158, "epoch": 1.9707602339181287, "grad_norm": 0.8984375, "learning_rate": 0.0004909242965851688, "loss": 6.7362, "mean_token_accuracy": 0.15222102999687195, "num_tokens": 4199278.0, "step": 1685 }, { "entropy": 6.739201164245605, "epoch": 1.976608187134503, "grad_norm": 0.87890625, "learning_rate": 0.0004907920416868253, "loss": 6.7216, "mean_token_accuracy": 0.14601051211357116, "num_tokens": 4213163.0, "step": 1690 }, { "entropy": 6.582593631744385, "epoch": 1.9824561403508771, "grad_norm": 1.0078125, "learning_rate": 0.0004906588502355467, "loss": 6.5807, "mean_token_accuracy": 0.14897475093603135, "num_tokens": 4225222.0, "step": 1695 }, { "entropy": 6.638074016571045, "epoch": 1.9883040935672516, "grad_norm": 1.0390625, "learning_rate": 0.0004905247228093933, "loss": 6.6304, "mean_token_accuracy": 0.15521894097328187, "num_tokens": 4236286.0, "step": 1700 }, { "entropy": 6.530340576171875, "epoch": 1.9941520467836256, "grad_norm": 1.03125, "learning_rate": 0.0004903896599904878, "loss": 6.6647, "mean_token_accuracy": 0.14791015088558196, "num_tokens": 4247462.0, "step": 1705 }, { "entropy": 6.7336372375488285, "epoch": 2.0, "grad_norm": 1.1953125, "learning_rate": 0.0004902536623650125, "loss": 6.7514, "mean_token_accuracy": 0.1418044872581959, "num_tokens": 4258968.0, "step": 1710 }, { "entropy": 6.613061475753784, "epoch": 2.0058479532163744, "grad_norm": 0.984375, "learning_rate": 0.0004901167305232068, "loss": 6.3199, "mean_token_accuracy": 0.15634880512952803, "num_tokens": 4271022.0, "step": 1715 }, { "entropy": 6.678990364074707, "epoch": 2.0116959064327484, "grad_norm": 0.94921875, "learning_rate": 0.0004899788650593648, "loss": 6.3559, "mean_token_accuracy": 0.1503312237560749, "num_tokens": 4283348.0, "step": 1720 }, { "entropy": 6.541168832778931, "epoch": 2.017543859649123, "grad_norm": 1.03125, "learning_rate": 0.0004898400665718325, "loss": 6.2881, "mean_token_accuracy": 0.15968621373176575, "num_tokens": 4295775.0, "step": 1725 }, { "entropy": 6.719831800460815, "epoch": 2.023391812865497, "grad_norm": 0.90234375, "learning_rate": 0.0004897003356630052, "loss": 6.3368, "mean_token_accuracy": 0.1551282972097397, "num_tokens": 4308408.0, "step": 1730 }, { "entropy": 6.478828239440918, "epoch": 2.0292397660818713, "grad_norm": 1.0, "learning_rate": 0.0004895596729393252, "loss": 6.2524, "mean_token_accuracy": 0.1626296654343605, "num_tokens": 4320614.0, "step": 1735 }, { "entropy": 6.523333215713501, "epoch": 2.0350877192982457, "grad_norm": 0.99609375, "learning_rate": 0.0004894180790112787, "loss": 6.2112, "mean_token_accuracy": 0.16793770492076873, "num_tokens": 4334118.0, "step": 1740 }, { "entropy": 6.555729389190674, "epoch": 2.0409356725146197, "grad_norm": 0.9609375, "learning_rate": 0.0004892755544933934, "loss": 6.3314, "mean_token_accuracy": 0.1544162929058075, "num_tokens": 4346486.0, "step": 1745 }, { "entropy": 6.517939233779908, "epoch": 2.046783625730994, "grad_norm": 0.95703125, "learning_rate": 0.0004891321000042361, "loss": 6.3986, "mean_token_accuracy": 0.15014228150248526, "num_tokens": 4358408.0, "step": 1750 }, { "entropy": 6.6038178443908695, "epoch": 2.0526315789473686, "grad_norm": 1.015625, "learning_rate": 0.0004889877161664096, "loss": 6.3349, "mean_token_accuracy": 0.15063187554478646, "num_tokens": 4369816.0, "step": 1755 }, { "entropy": 6.564553737640381, "epoch": 2.0584795321637426, "grad_norm": 0.9453125, "learning_rate": 0.00048884240360655, "loss": 6.3834, "mean_token_accuracy": 0.14581367149949073, "num_tokens": 4382192.0, "step": 1760 }, { "entropy": 6.567172908782959, "epoch": 2.064327485380117, "grad_norm": 0.8828125, "learning_rate": 0.0004886961629553242, "loss": 6.3496, "mean_token_accuracy": 0.15813596695661544, "num_tokens": 4395546.0, "step": 1765 }, { "entropy": 6.526296615600586, "epoch": 2.0701754385964914, "grad_norm": 1.03125, "learning_rate": 0.0004885489948474272, "loss": 6.3753, "mean_token_accuracy": 0.15297993570566176, "num_tokens": 4407988.0, "step": 1770 }, { "entropy": 6.5855114459991455, "epoch": 2.0760233918128654, "grad_norm": 1.015625, "learning_rate": 0.0004884008999215792, "loss": 6.2988, "mean_token_accuracy": 0.1582840144634247, "num_tokens": 4419668.0, "step": 1775 }, { "entropy": 6.584148645401001, "epoch": 2.08187134502924, "grad_norm": 0.890625, "learning_rate": 0.0004882518788205225, "loss": 6.3854, "mean_token_accuracy": 0.14738436043262482, "num_tokens": 4431493.0, "step": 1780 }, { "entropy": 6.5512090682983395, "epoch": 2.087719298245614, "grad_norm": 0.875, "learning_rate": 0.0004881019321910198, "loss": 6.353, "mean_token_accuracy": 0.15487503558397292, "num_tokens": 4443237.0, "step": 1785 }, { "entropy": 6.513033437728882, "epoch": 2.0935672514619883, "grad_norm": 1.0703125, "learning_rate": 0.00048795106068384985, "loss": 6.3583, "mean_token_accuracy": 0.15871656984090804, "num_tokens": 4455238.0, "step": 1790 }, { "entropy": 6.637407732009888, "epoch": 2.0994152046783627, "grad_norm": 0.8984375, "learning_rate": 0.000487799264953806, "loss": 6.4203, "mean_token_accuracy": 0.14721036553382874, "num_tokens": 4469180.0, "step": 1795 }, { "entropy": 6.610451412200928, "epoch": 2.1052631578947367, "grad_norm": 0.953125, "learning_rate": 0.0004876465456596926, "loss": 6.4533, "mean_token_accuracy": 0.1517632856965065, "num_tokens": 4481169.0, "step": 1800 }, { "entropy": 6.543406438827515, "epoch": 2.111111111111111, "grad_norm": 0.9453125, "learning_rate": 0.0004874929034643223, "loss": 6.3631, "mean_token_accuracy": 0.14619019031524658, "num_tokens": 4494051.0, "step": 1805 }, { "entropy": 6.454391813278198, "epoch": 2.116959064327485, "grad_norm": 1.0234375, "learning_rate": 0.0004873383390345132, "loss": 6.3206, "mean_token_accuracy": 0.16392768919467926, "num_tokens": 4508230.0, "step": 1810 }, { "entropy": 6.593087863922119, "epoch": 2.1228070175438596, "grad_norm": 0.84375, "learning_rate": 0.00048718285304108613, "loss": 6.3171, "mean_token_accuracy": 0.15622008740901946, "num_tokens": 4520555.0, "step": 1815 }, { "entropy": 6.444989585876465, "epoch": 2.128654970760234, "grad_norm": 0.94921875, "learning_rate": 0.00048702644615886137, "loss": 6.3646, "mean_token_accuracy": 0.151460662484169, "num_tokens": 4532126.0, "step": 1820 }, { "entropy": 6.621482419967651, "epoch": 2.134502923976608, "grad_norm": 0.94921875, "learning_rate": 0.00048686911906665597, "loss": 6.4521, "mean_token_accuracy": 0.14833228290081024, "num_tokens": 4543754.0, "step": 1825 }, { "entropy": 6.429253005981446, "epoch": 2.1403508771929824, "grad_norm": 1.0703125, "learning_rate": 0.00048671087244728093, "loss": 6.2887, "mean_token_accuracy": 0.1584049344062805, "num_tokens": 4555907.0, "step": 1830 }, { "entropy": 6.561292409896851, "epoch": 2.146198830409357, "grad_norm": 1.0078125, "learning_rate": 0.00048655170698753774, "loss": 6.4126, "mean_token_accuracy": 0.15332231670618057, "num_tokens": 4568461.0, "step": 1835 }, { "entropy": 6.525373888015747, "epoch": 2.152046783625731, "grad_norm": 0.98046875, "learning_rate": 0.000486391623378216, "loss": 6.3628, "mean_token_accuracy": 0.15623549669981002, "num_tokens": 4581391.0, "step": 1840 }, { "entropy": 6.457386541366577, "epoch": 2.1578947368421053, "grad_norm": 0.9609375, "learning_rate": 0.0004862306223140901, "loss": 6.3492, "mean_token_accuracy": 0.15107778757810592, "num_tokens": 4594187.0, "step": 1845 }, { "entropy": 6.504654359817505, "epoch": 2.1637426900584797, "grad_norm": 0.98046875, "learning_rate": 0.00048606870449391604, "loss": 6.3854, "mean_token_accuracy": 0.15558697730302812, "num_tokens": 4607162.0, "step": 1850 }, { "entropy": 6.578766107559204, "epoch": 2.1695906432748537, "grad_norm": 1.015625, "learning_rate": 0.00048590587062042907, "loss": 6.4904, "mean_token_accuracy": 0.14629387259483337, "num_tokens": 4619717.0, "step": 1855 }, { "entropy": 6.447008419036865, "epoch": 2.175438596491228, "grad_norm": 1.0390625, "learning_rate": 0.00048574212140033965, "loss": 6.2273, "mean_token_accuracy": 0.16127332150936127, "num_tokens": 4631938.0, "step": 1860 }, { "entropy": 6.438826036453247, "epoch": 2.181286549707602, "grad_norm": 0.9609375, "learning_rate": 0.0004855774575443311, "loss": 6.3345, "mean_token_accuracy": 0.1587992399930954, "num_tokens": 4644377.0, "step": 1865 }, { "entropy": 6.539951610565185, "epoch": 2.1871345029239766, "grad_norm": 0.92578125, "learning_rate": 0.00048541187976705645, "loss": 6.2964, "mean_token_accuracy": 0.16265074014663697, "num_tokens": 4656657.0, "step": 1870 }, { "entropy": 6.491901159286499, "epoch": 2.192982456140351, "grad_norm": 1.0390625, "learning_rate": 0.00048524538878713517, "loss": 6.2791, "mean_token_accuracy": 0.16020860895514488, "num_tokens": 4670156.0, "step": 1875 }, { "entropy": 6.5246663093566895, "epoch": 2.198830409356725, "grad_norm": 0.95703125, "learning_rate": 0.00048507798532715005, "loss": 6.3826, "mean_token_accuracy": 0.14875538647174835, "num_tokens": 4683564.0, "step": 1880 }, { "entropy": 6.444547891616821, "epoch": 2.2046783625730995, "grad_norm": 1.390625, "learning_rate": 0.00048490967011364394, "loss": 6.3352, "mean_token_accuracy": 0.16067604571580887, "num_tokens": 4696008.0, "step": 1885 }, { "entropy": 6.373475456237793, "epoch": 2.2105263157894735, "grad_norm": 0.94921875, "learning_rate": 0.0004847404438771172, "loss": 6.2113, "mean_token_accuracy": 0.16405704319477082, "num_tokens": 4707956.0, "step": 1890 }, { "entropy": 6.469513893127441, "epoch": 2.216374269005848, "grad_norm": 0.93359375, "learning_rate": 0.0004845703073520236, "loss": 6.4399, "mean_token_accuracy": 0.14858177527785302, "num_tokens": 4720683.0, "step": 1895 }, { "entropy": 6.590300607681274, "epoch": 2.2222222222222223, "grad_norm": 0.99609375, "learning_rate": 0.00048439926127676796, "loss": 6.3683, "mean_token_accuracy": 0.15888102650642394, "num_tokens": 4732524.0, "step": 1900 }, { "entropy": 6.465745878219605, "epoch": 2.2280701754385963, "grad_norm": 0.91015625, "learning_rate": 0.00048422730639370256, "loss": 6.4267, "mean_token_accuracy": 0.15533056408166884, "num_tokens": 4746483.0, "step": 1905 }, { "entropy": 6.493499422073365, "epoch": 2.2339181286549707, "grad_norm": 0.92578125, "learning_rate": 0.0004840544434491238, "loss": 6.3532, "mean_token_accuracy": 0.15531336814165114, "num_tokens": 4759543.0, "step": 1910 }, { "entropy": 6.377004480361938, "epoch": 2.239766081871345, "grad_norm": 1.15625, "learning_rate": 0.00048388067319326937, "loss": 6.3158, "mean_token_accuracy": 0.15956761240959166, "num_tokens": 4770766.0, "step": 1915 }, { "entropy": 6.536472988128662, "epoch": 2.245614035087719, "grad_norm": 0.9609375, "learning_rate": 0.00048370599638031464, "loss": 6.3084, "mean_token_accuracy": 0.16118213832378386, "num_tokens": 4783157.0, "step": 1920 }, { "entropy": 6.363384056091308, "epoch": 2.2514619883040936, "grad_norm": 1.0859375, "learning_rate": 0.00048353041376836937, "loss": 6.3827, "mean_token_accuracy": 0.16078438013792037, "num_tokens": 4795874.0, "step": 1925 }, { "entropy": 6.52140212059021, "epoch": 2.257309941520468, "grad_norm": 1.0, "learning_rate": 0.0004833539261194749, "loss": 6.3334, "mean_token_accuracy": 0.1594570055603981, "num_tokens": 4806968.0, "step": 1930 }, { "entropy": 6.3824951171875, "epoch": 2.263157894736842, "grad_norm": 0.8984375, "learning_rate": 0.00048317653419960007, "loss": 6.3644, "mean_token_accuracy": 0.155350361764431, "num_tokens": 4819927.0, "step": 1935 }, { "entropy": 6.4782744407653805, "epoch": 2.2690058479532165, "grad_norm": 1.0390625, "learning_rate": 0.00048299823877863857, "loss": 6.3349, "mean_token_accuracy": 0.160041144490242, "num_tokens": 4831824.0, "step": 1940 }, { "entropy": 6.478532791137695, "epoch": 2.2748538011695905, "grad_norm": 0.91796875, "learning_rate": 0.0004828190406304054, "loss": 6.3812, "mean_token_accuracy": 0.152671180665493, "num_tokens": 4844405.0, "step": 1945 }, { "entropy": 6.451467847824096, "epoch": 2.280701754385965, "grad_norm": 0.96484375, "learning_rate": 0.0004826389405326334, "loss": 6.3273, "mean_token_accuracy": 0.16256463527679443, "num_tokens": 4856424.0, "step": 1950 }, { "entropy": 6.527578496932984, "epoch": 2.2865497076023393, "grad_norm": 0.94921875, "learning_rate": 0.0004824579392669698, "loss": 6.4768, "mean_token_accuracy": 0.1487383469939232, "num_tokens": 4869473.0, "step": 1955 }, { "entropy": 6.367396450042724, "epoch": 2.2923976608187133, "grad_norm": 1.0, "learning_rate": 0.00048227603761897316, "loss": 6.2911, "mean_token_accuracy": 0.16065459549427033, "num_tokens": 4881220.0, "step": 1960 }, { "entropy": 6.414208173751831, "epoch": 2.2982456140350878, "grad_norm": 0.9296875, "learning_rate": 0.0004820932363781096, "loss": 6.472, "mean_token_accuracy": 0.14860487282276152, "num_tokens": 4892766.0, "step": 1965 }, { "entropy": 6.45541353225708, "epoch": 2.3040935672514617, "grad_norm": 0.98828125, "learning_rate": 0.0004819095363377496, "loss": 6.3238, "mean_token_accuracy": 0.15184853971004486, "num_tokens": 4904549.0, "step": 1970 }, { "entropy": 6.419804286956787, "epoch": 2.309941520467836, "grad_norm": 0.953125, "learning_rate": 0.00048172493829516465, "loss": 6.3309, "mean_token_accuracy": 0.15828023850917816, "num_tokens": 4917204.0, "step": 1975 }, { "entropy": 6.4697606563568115, "epoch": 2.3157894736842106, "grad_norm": 0.9921875, "learning_rate": 0.0004815394430515234, "loss": 6.4003, "mean_token_accuracy": 0.16001321077346803, "num_tokens": 4928838.0, "step": 1980 }, { "entropy": 6.530691719055175, "epoch": 2.3216374269005846, "grad_norm": 0.96484375, "learning_rate": 0.0004813530514118884, "loss": 6.3734, "mean_token_accuracy": 0.1554233744740486, "num_tokens": 4940281.0, "step": 1985 }, { "entropy": 6.41666464805603, "epoch": 2.327485380116959, "grad_norm": 1.0, "learning_rate": 0.0004811657641852129, "loss": 6.3576, "mean_token_accuracy": 0.15298293232917787, "num_tokens": 4953355.0, "step": 1990 }, { "entropy": 6.50026125907898, "epoch": 2.3333333333333335, "grad_norm": 0.890625, "learning_rate": 0.00048097758218433687, "loss": 6.3659, "mean_token_accuracy": 0.15752369314432144, "num_tokens": 4966128.0, "step": 1995 }, { "entropy": 6.474570655822754, "epoch": 2.3391812865497075, "grad_norm": 0.8515625, "learning_rate": 0.00048078850622598355, "loss": 6.3719, "mean_token_accuracy": 0.15596262663602828, "num_tokens": 4979409.0, "step": 2000 }, { "epoch": 2.3391812865497075, "eval_entropy": 6.244584498503919, "eval_loss": 6.810573577880859, "eval_mean_token_accuracy": 0.14119860577427268, "eval_num_tokens": 4979409.0, "eval_runtime": 2.2734, "eval_samples_per_second": 1190.728, "eval_steps_per_second": 149.116, "step": 2000 }, { "entropy": 6.445643615722656, "epoch": 2.345029239766082, "grad_norm": 1.03125, "learning_rate": 0.00048059853713075637, "loss": 6.3789, "mean_token_accuracy": 0.15238464921712874, "num_tokens": 4991086.0, "step": 2005 }, { "entropy": 6.449284791946411, "epoch": 2.3508771929824563, "grad_norm": 0.94140625, "learning_rate": 0.0004804076757231347, "loss": 6.3238, "mean_token_accuracy": 0.16143079102039337, "num_tokens": 5002837.0, "step": 2010 }, { "entropy": 6.443182754516601, "epoch": 2.3567251461988303, "grad_norm": 0.9609375, "learning_rate": 0.00048021592283147073, "loss": 6.3949, "mean_token_accuracy": 0.15568165928125383, "num_tokens": 5014688.0, "step": 2015 }, { "entropy": 6.489663219451904, "epoch": 2.3625730994152048, "grad_norm": 0.9921875, "learning_rate": 0.0004800232792879858, "loss": 6.375, "mean_token_accuracy": 0.1525643140077591, "num_tokens": 5026677.0, "step": 2020 }, { "entropy": 6.34787015914917, "epoch": 2.3684210526315788, "grad_norm": 0.9453125, "learning_rate": 0.00047982974592876665, "loss": 6.3747, "mean_token_accuracy": 0.16030002385377884, "num_tokens": 5039504.0, "step": 2025 }, { "entropy": 6.453823661804199, "epoch": 2.374269005847953, "grad_norm": 0.98828125, "learning_rate": 0.000479635323593762, "loss": 6.274, "mean_token_accuracy": 0.16640568822622298, "num_tokens": 5051071.0, "step": 2030 }, { "entropy": 6.334503221511841, "epoch": 2.3801169590643276, "grad_norm": 0.93359375, "learning_rate": 0.00047944001312677867, "loss": 6.3277, "mean_token_accuracy": 0.16389417946338652, "num_tokens": 5064489.0, "step": 2035 }, { "entropy": 6.433465576171875, "epoch": 2.3859649122807016, "grad_norm": 0.91796875, "learning_rate": 0.0004792438153754782, "loss": 6.3748, "mean_token_accuracy": 0.1552420049905777, "num_tokens": 5076742.0, "step": 2040 }, { "entropy": 6.431836032867432, "epoch": 2.391812865497076, "grad_norm": 0.92578125, "learning_rate": 0.0004790467311913727, "loss": 6.3354, "mean_token_accuracy": 0.16166526228189468, "num_tokens": 5089194.0, "step": 2045 }, { "entropy": 6.544153165817261, "epoch": 2.39766081871345, "grad_norm": 1.0390625, "learning_rate": 0.0004788487614298219, "loss": 6.4077, "mean_token_accuracy": 0.15238103717565538, "num_tokens": 5100712.0, "step": 2050 }, { "entropy": 6.286121654510498, "epoch": 2.4035087719298245, "grad_norm": 1.265625, "learning_rate": 0.0004786499069500286, "loss": 6.1947, "mean_token_accuracy": 0.1636320561170578, "num_tokens": 5114844.0, "step": 2055 }, { "entropy": 6.388913488388061, "epoch": 2.409356725146199, "grad_norm": 1.0234375, "learning_rate": 0.00047845016861503556, "loss": 6.3178, "mean_token_accuracy": 0.15902430713176727, "num_tokens": 5126626.0, "step": 2060 }, { "entropy": 6.4127631187438965, "epoch": 2.415204678362573, "grad_norm": 0.92578125, "learning_rate": 0.00047824954729172136, "loss": 6.3931, "mean_token_accuracy": 0.15777807235717772, "num_tokens": 5138527.0, "step": 2065 }, { "entropy": 6.561508512496948, "epoch": 2.4210526315789473, "grad_norm": 0.87109375, "learning_rate": 0.0004780480438507972, "loss": 6.4737, "mean_token_accuracy": 0.14927541017532348, "num_tokens": 5152045.0, "step": 2070 }, { "entropy": 6.493700265884399, "epoch": 2.426900584795322, "grad_norm": 0.9765625, "learning_rate": 0.00047784565916680216, "loss": 6.4653, "mean_token_accuracy": 0.14986254870891572, "num_tokens": 5164806.0, "step": 2075 }, { "entropy": 6.4221197128295895, "epoch": 2.4327485380116958, "grad_norm": 0.88671875, "learning_rate": 0.0004776423941181005, "loss": 6.4082, "mean_token_accuracy": 0.14851786941289902, "num_tokens": 5178676.0, "step": 2080 }, { "entropy": 6.49404993057251, "epoch": 2.43859649122807, "grad_norm": 0.89453125, "learning_rate": 0.00047743824958687694, "loss": 6.3918, "mean_token_accuracy": 0.1562908411026001, "num_tokens": 5191183.0, "step": 2085 }, { "entropy": 6.386559343338012, "epoch": 2.4444444444444446, "grad_norm": 1.0, "learning_rate": 0.00047723322645913354, "loss": 6.3147, "mean_token_accuracy": 0.16154536008834838, "num_tokens": 5203460.0, "step": 2090 }, { "entropy": 6.416320276260376, "epoch": 2.4502923976608186, "grad_norm": 0.9765625, "learning_rate": 0.0004770273256246853, "loss": 6.3038, "mean_token_accuracy": 0.1643177568912506, "num_tokens": 5215362.0, "step": 2095 }, { "entropy": 6.427623701095581, "epoch": 2.456140350877193, "grad_norm": 0.9296875, "learning_rate": 0.0004768205479771566, "loss": 6.4046, "mean_token_accuracy": 0.15239704698324202, "num_tokens": 5228592.0, "step": 2100 }, { "entropy": 6.423169565200806, "epoch": 2.461988304093567, "grad_norm": 0.94921875, "learning_rate": 0.00047661289441397724, "loss": 6.355, "mean_token_accuracy": 0.15616060495376588, "num_tokens": 5242337.0, "step": 2105 }, { "entropy": 6.388077688217163, "epoch": 2.4678362573099415, "grad_norm": 1.0, "learning_rate": 0.00047640436583637865, "loss": 6.2911, "mean_token_accuracy": 0.15808799415826796, "num_tokens": 5255566.0, "step": 2110 }, { "entropy": 6.470604658126831, "epoch": 2.473684210526316, "grad_norm": 1.0390625, "learning_rate": 0.00047619496314938977, "loss": 6.3989, "mean_token_accuracy": 0.15252429395914077, "num_tokens": 5268638.0, "step": 2115 }, { "entropy": 6.355663251876831, "epoch": 2.47953216374269, "grad_norm": 1.125, "learning_rate": 0.0004759846872618332, "loss": 6.3615, "mean_token_accuracy": 0.15340882539749146, "num_tokens": 5280031.0, "step": 2120 }, { "entropy": 6.407628536224365, "epoch": 2.4853801169590644, "grad_norm": 0.96875, "learning_rate": 0.00047577353908632156, "loss": 6.3039, "mean_token_accuracy": 0.1645380064845085, "num_tokens": 5291792.0, "step": 2125 }, { "entropy": 6.404614114761353, "epoch": 2.4912280701754383, "grad_norm": 0.90625, "learning_rate": 0.00047556151953925287, "loss": 6.4094, "mean_token_accuracy": 0.15307499915361406, "num_tokens": 5303752.0, "step": 2130 }, { "entropy": 6.465473699569702, "epoch": 2.497076023391813, "grad_norm": 0.95703125, "learning_rate": 0.0004753486295408073, "loss": 6.351, "mean_token_accuracy": 0.15327188968658448, "num_tokens": 5315711.0, "step": 2135 }, { "entropy": 6.426405763626098, "epoch": 2.502923976608187, "grad_norm": 0.97265625, "learning_rate": 0.00047513487001494257, "loss": 6.3683, "mean_token_accuracy": 0.16236188709735871, "num_tokens": 5329449.0, "step": 2140 }, { "entropy": 6.4586772441864015, "epoch": 2.5087719298245617, "grad_norm": 1.1015625, "learning_rate": 0.00047492024188939056, "loss": 6.3991, "mean_token_accuracy": 0.1537608489394188, "num_tokens": 5341015.0, "step": 2145 }, { "entropy": 6.481842708587647, "epoch": 2.5146198830409356, "grad_norm": 1.0078125, "learning_rate": 0.0004747047460956525, "loss": 6.3922, "mean_token_accuracy": 0.15520621985197067, "num_tokens": 5352537.0, "step": 2150 }, { "entropy": 6.437920093536377, "epoch": 2.52046783625731, "grad_norm": 0.921875, "learning_rate": 0.0004744883835689958, "loss": 6.3519, "mean_token_accuracy": 0.16303111612796783, "num_tokens": 5364617.0, "step": 2155 }, { "entropy": 6.420978021621704, "epoch": 2.526315789473684, "grad_norm": 1.0546875, "learning_rate": 0.0004742711552484492, "loss": 6.3798, "mean_token_accuracy": 0.1547342821955681, "num_tokens": 5377939.0, "step": 2160 }, { "entropy": 6.408878135681152, "epoch": 2.5321637426900585, "grad_norm": 1.1015625, "learning_rate": 0.00047405306207679926, "loss": 6.305, "mean_token_accuracy": 0.163915978372097, "num_tokens": 5390111.0, "step": 2165 }, { "entropy": 6.379895401000977, "epoch": 2.538011695906433, "grad_norm": 0.94140625, "learning_rate": 0.0004738341050005859, "loss": 6.3846, "mean_token_accuracy": 0.152874419093132, "num_tokens": 5403690.0, "step": 2170 }, { "entropy": 6.504248809814453, "epoch": 2.543859649122807, "grad_norm": 0.88671875, "learning_rate": 0.0004736142849700986, "loss": 6.3599, "mean_token_accuracy": 0.1571785405278206, "num_tokens": 5416456.0, "step": 2175 }, { "entropy": 6.42173318862915, "epoch": 2.5497076023391814, "grad_norm": 0.953125, "learning_rate": 0.0004733936029393721, "loss": 6.474, "mean_token_accuracy": 0.14887326657772065, "num_tokens": 5429490.0, "step": 2180 }, { "entropy": 6.463390684127807, "epoch": 2.5555555555555554, "grad_norm": 1.0390625, "learning_rate": 0.0004731720598661821, "loss": 6.3615, "mean_token_accuracy": 0.1581603243947029, "num_tokens": 5441382.0, "step": 2185 }, { "entropy": 6.4675092697143555, "epoch": 2.56140350877193, "grad_norm": 0.9921875, "learning_rate": 0.0004729496567120415, "loss": 6.4369, "mean_token_accuracy": 0.156419774889946, "num_tokens": 5453135.0, "step": 2190 }, { "entropy": 6.351563835144043, "epoch": 2.5672514619883042, "grad_norm": 1.0078125, "learning_rate": 0.000472726394442196, "loss": 6.2849, "mean_token_accuracy": 0.17103164792060851, "num_tokens": 5467026.0, "step": 2195 }, { "entropy": 6.407415962219238, "epoch": 2.573099415204678, "grad_norm": 1.015625, "learning_rate": 0.00047250227402561976, "loss": 6.3949, "mean_token_accuracy": 0.1573207288980484, "num_tokens": 5479328.0, "step": 2200 }, { "entropy": 6.4740362644195555, "epoch": 2.5789473684210527, "grad_norm": 0.94140625, "learning_rate": 0.0004722772964350115, "loss": 6.3941, "mean_token_accuracy": 0.15537292510271072, "num_tokens": 5490843.0, "step": 2205 }, { "entropy": 6.365005779266357, "epoch": 2.5847953216374266, "grad_norm": 0.98046875, "learning_rate": 0.00047205146264679015, "loss": 6.308, "mean_token_accuracy": 0.15925779044628144, "num_tokens": 5502721.0, "step": 2210 }, { "entropy": 6.40563702583313, "epoch": 2.590643274853801, "grad_norm": 1.03125, "learning_rate": 0.00047182477364109045, "loss": 6.3553, "mean_token_accuracy": 0.15847325325012207, "num_tokens": 5514190.0, "step": 2215 }, { "entropy": 6.4377704620361325, "epoch": 2.5964912280701755, "grad_norm": 1.0625, "learning_rate": 0.00047159723040175896, "loss": 6.2704, "mean_token_accuracy": 0.16171683073043824, "num_tokens": 5528259.0, "step": 2220 }, { "entropy": 6.409121179580689, "epoch": 2.60233918128655, "grad_norm": 0.9921875, "learning_rate": 0.00047136883391634966, "loss": 6.4424, "mean_token_accuracy": 0.15242915600538254, "num_tokens": 5540375.0, "step": 2225 }, { "entropy": 6.443257904052734, "epoch": 2.608187134502924, "grad_norm": 1.046875, "learning_rate": 0.0004711395851761198, "loss": 6.3391, "mean_token_accuracy": 0.16303063035011292, "num_tokens": 5552848.0, "step": 2230 }, { "entropy": 6.385362005233764, "epoch": 2.6140350877192984, "grad_norm": 0.9375, "learning_rate": 0.0004709094851760251, "loss": 6.3218, "mean_token_accuracy": 0.16016172021627426, "num_tokens": 5565988.0, "step": 2235 }, { "entropy": 6.409554672241211, "epoch": 2.6198830409356724, "grad_norm": 0.9140625, "learning_rate": 0.0004706785349147163, "loss": 6.3978, "mean_token_accuracy": 0.15372055619955063, "num_tokens": 5578110.0, "step": 2240 }, { "entropy": 6.422667646408081, "epoch": 2.625730994152047, "grad_norm": 0.88671875, "learning_rate": 0.000470446735394534, "loss": 6.3774, "mean_token_accuracy": 0.1569847896695137, "num_tokens": 5590997.0, "step": 2245 }, { "entropy": 6.401986503601075, "epoch": 2.6315789473684212, "grad_norm": 0.96875, "learning_rate": 0.0004702140876215047, "loss": 6.2686, "mean_token_accuracy": 0.16344404965639114, "num_tokens": 5602407.0, "step": 2250 }, { "entropy": 6.382628488540649, "epoch": 2.6374269005847952, "grad_norm": 1.015625, "learning_rate": 0.0004699805926053365, "loss": 6.3799, "mean_token_accuracy": 0.15904879868030547, "num_tokens": 5615298.0, "step": 2255 }, { "entropy": 6.403160190582275, "epoch": 2.6432748538011697, "grad_norm": 0.9375, "learning_rate": 0.00046974625135941445, "loss": 6.3306, "mean_token_accuracy": 0.1589551791548729, "num_tokens": 5627197.0, "step": 2260 }, { "entropy": 6.531083774566651, "epoch": 2.6491228070175437, "grad_norm": 1.0625, "learning_rate": 0.00046951106490079636, "loss": 6.3901, "mean_token_accuracy": 0.14688626676797867, "num_tokens": 5640345.0, "step": 2265 }, { "entropy": 6.354160737991333, "epoch": 2.654970760233918, "grad_norm": 1.0703125, "learning_rate": 0.00046927503425020847, "loss": 6.4245, "mean_token_accuracy": 0.15789488106966018, "num_tokens": 5653866.0, "step": 2270 }, { "entropy": 6.4712237358093265, "epoch": 2.6608187134502925, "grad_norm": 0.98828125, "learning_rate": 0.00046903816043204045, "loss": 6.3754, "mean_token_accuracy": 0.1609050899744034, "num_tokens": 5666618.0, "step": 2275 }, { "entropy": 6.276658153533935, "epoch": 2.6666666666666665, "grad_norm": 0.97265625, "learning_rate": 0.0004688004444743419, "loss": 6.3325, "mean_token_accuracy": 0.16040945500135423, "num_tokens": 5679165.0, "step": 2280 }, { "entropy": 6.471549844741821, "epoch": 2.672514619883041, "grad_norm": 0.97265625, "learning_rate": 0.000468561887408817, "loss": 6.3708, "mean_token_accuracy": 0.15915319621562957, "num_tokens": 5691387.0, "step": 2285 }, { "entropy": 6.2920068264007565, "epoch": 2.678362573099415, "grad_norm": 0.87890625, "learning_rate": 0.0004683224902708206, "loss": 6.2909, "mean_token_accuracy": 0.16518297046422958, "num_tokens": 5703804.0, "step": 2290 }, { "entropy": 6.511602783203125, "epoch": 2.6842105263157894, "grad_norm": 0.921875, "learning_rate": 0.0004680822540993534, "loss": 6.452, "mean_token_accuracy": 0.15097396522760392, "num_tokens": 5716338.0, "step": 2295 }, { "entropy": 6.409046220779419, "epoch": 2.690058479532164, "grad_norm": 1.03125, "learning_rate": 0.00046784117993705753, "loss": 6.3906, "mean_token_accuracy": 0.1572423741221428, "num_tokens": 5729644.0, "step": 2300 }, { "entropy": 6.403546667098999, "epoch": 2.6959064327485383, "grad_norm": 0.97265625, "learning_rate": 0.00046759926883021234, "loss": 6.3193, "mean_token_accuracy": 0.16220491826534272, "num_tokens": 5741357.0, "step": 2305 }, { "entropy": 6.446309185028076, "epoch": 2.7017543859649122, "grad_norm": 0.953125, "learning_rate": 0.00046735652182872925, "loss": 6.4356, "mean_token_accuracy": 0.15013170689344407, "num_tokens": 5754783.0, "step": 2310 }, { "entropy": 6.367806100845337, "epoch": 2.7076023391812867, "grad_norm": 0.97265625, "learning_rate": 0.0004671129399861476, "loss": 6.2865, "mean_token_accuracy": 0.16693611145019532, "num_tokens": 5766845.0, "step": 2315 }, { "entropy": 6.487013912200927, "epoch": 2.7134502923976607, "grad_norm": 0.90234375, "learning_rate": 0.00046686852435963016, "loss": 6.442, "mean_token_accuracy": 0.1500522792339325, "num_tokens": 5779340.0, "step": 2320 }, { "entropy": 6.3810874938964846, "epoch": 2.719298245614035, "grad_norm": 1.0078125, "learning_rate": 0.0004666232760099583, "loss": 6.2877, "mean_token_accuracy": 0.16884452253580093, "num_tokens": 5791305.0, "step": 2325 }, { "entropy": 6.435328722000122, "epoch": 2.7251461988304095, "grad_norm": 1.1328125, "learning_rate": 0.00046637719600152737, "loss": 6.3852, "mean_token_accuracy": 0.15519808381795883, "num_tokens": 5805005.0, "step": 2330 }, { "entropy": 6.335537528991699, "epoch": 2.7309941520467835, "grad_norm": 1.0390625, "learning_rate": 0.00046613028540234226, "loss": 6.2757, "mean_token_accuracy": 0.16379417330026627, "num_tokens": 5817875.0, "step": 2335 }, { "entropy": 6.439946603775025, "epoch": 2.736842105263158, "grad_norm": 1.015625, "learning_rate": 0.00046588254528401264, "loss": 6.4141, "mean_token_accuracy": 0.15380895882844925, "num_tokens": 5830529.0, "step": 2340 }, { "entropy": 6.383373785018921, "epoch": 2.742690058479532, "grad_norm": 0.98046875, "learning_rate": 0.0004656339767217485, "loss": 6.3354, "mean_token_accuracy": 0.1607013463973999, "num_tokens": 5842505.0, "step": 2345 }, { "entropy": 6.419260168075562, "epoch": 2.7485380116959064, "grad_norm": 1.046875, "learning_rate": 0.00046538458079435516, "loss": 6.316, "mean_token_accuracy": 0.15341950505971907, "num_tokens": 5854215.0, "step": 2350 }, { "entropy": 6.422201204299927, "epoch": 2.754385964912281, "grad_norm": 0.96875, "learning_rate": 0.0004651343585842287, "loss": 6.3595, "mean_token_accuracy": 0.15550109148025512, "num_tokens": 5866484.0, "step": 2355 }, { "entropy": 6.393207168579101, "epoch": 2.760233918128655, "grad_norm": 1.0078125, "learning_rate": 0.00046488331117735176, "loss": 6.3654, "mean_token_accuracy": 0.15960022509098054, "num_tokens": 5879131.0, "step": 2360 }, { "entropy": 6.420015954971314, "epoch": 2.7660818713450293, "grad_norm": 0.9296875, "learning_rate": 0.0004646314396632878, "loss": 6.3798, "mean_token_accuracy": 0.15467930138111113, "num_tokens": 5891776.0, "step": 2365 }, { "entropy": 6.420463514328003, "epoch": 2.7719298245614032, "grad_norm": 1.0078125, "learning_rate": 0.0004643787451351774, "loss": 6.2981, "mean_token_accuracy": 0.15805638134479522, "num_tokens": 5904246.0, "step": 2370 }, { "entropy": 6.319274616241455, "epoch": 2.7777777777777777, "grad_norm": 0.921875, "learning_rate": 0.00046412522868973297, "loss": 6.3117, "mean_token_accuracy": 0.16229696124792098, "num_tokens": 5917278.0, "step": 2375 }, { "entropy": 6.393973112106323, "epoch": 2.783625730994152, "grad_norm": 0.95703125, "learning_rate": 0.00046387089142723386, "loss": 6.4015, "mean_token_accuracy": 0.14831992760300636, "num_tokens": 5930157.0, "step": 2380 }, { "entropy": 6.429065275192261, "epoch": 2.7894736842105265, "grad_norm": 0.8984375, "learning_rate": 0.00046361573445152224, "loss": 6.2455, "mean_token_accuracy": 0.16678779423236847, "num_tokens": 5942821.0, "step": 2385 }, { "entropy": 6.359903049468994, "epoch": 2.7953216374269005, "grad_norm": 1.0, "learning_rate": 0.00046335975886999754, "loss": 6.3201, "mean_token_accuracy": 0.16159365475177764, "num_tokens": 5954123.0, "step": 2390 }, { "entropy": 6.392605876922607, "epoch": 2.801169590643275, "grad_norm": 0.9921875, "learning_rate": 0.00046310296579361225, "loss": 6.2983, "mean_token_accuracy": 0.1590059816837311, "num_tokens": 5965629.0, "step": 2395 }, { "entropy": 6.369566631317139, "epoch": 2.807017543859649, "grad_norm": 0.98046875, "learning_rate": 0.0004628453563368666, "loss": 6.3403, "mean_token_accuracy": 0.16067956686019896, "num_tokens": 5979157.0, "step": 2400 }, { "entropy": 6.424136638641357, "epoch": 2.8128654970760234, "grad_norm": 1.1953125, "learning_rate": 0.0004625869316178043, "loss": 6.2869, "mean_token_accuracy": 0.17058369666337966, "num_tokens": 5992729.0, "step": 2405 }, { "entropy": 6.247052431106567, "epoch": 2.818713450292398, "grad_norm": 0.9375, "learning_rate": 0.000462327692758007, "loss": 6.4088, "mean_token_accuracy": 0.15289342552423477, "num_tokens": 6004685.0, "step": 2410 }, { "entropy": 6.410907745361328, "epoch": 2.824561403508772, "grad_norm": 0.97265625, "learning_rate": 0.00046206764088259003, "loss": 6.3736, "mean_token_accuracy": 0.16130629777908326, "num_tokens": 6016139.0, "step": 2415 }, { "entropy": 6.358149909973145, "epoch": 2.8304093567251463, "grad_norm": 1.03125, "learning_rate": 0.00046180677712019707, "loss": 6.3559, "mean_token_accuracy": 0.1639443278312683, "num_tokens": 6028236.0, "step": 2420 }, { "entropy": 6.369370174407959, "epoch": 2.8362573099415203, "grad_norm": 0.9765625, "learning_rate": 0.0004615451026029957, "loss": 6.3645, "mean_token_accuracy": 0.1627436622977257, "num_tokens": 6040017.0, "step": 2425 }, { "entropy": 6.4513365745544435, "epoch": 2.8421052631578947, "grad_norm": 0.98046875, "learning_rate": 0.000461282618466672, "loss": 6.3813, "mean_token_accuracy": 0.1559862807393074, "num_tokens": 6052962.0, "step": 2430 }, { "entropy": 6.277508544921875, "epoch": 2.847953216374269, "grad_norm": 0.9765625, "learning_rate": 0.00046101932585042597, "loss": 6.35, "mean_token_accuracy": 0.15423065721988677, "num_tokens": 6065187.0, "step": 2435 }, { "entropy": 6.3818567276000975, "epoch": 2.853801169590643, "grad_norm": 0.90625, "learning_rate": 0.00046075522589696636, "loss": 6.2982, "mean_token_accuracy": 0.1641393393278122, "num_tokens": 6078347.0, "step": 2440 }, { "entropy": 6.39556245803833, "epoch": 2.8596491228070176, "grad_norm": 0.9453125, "learning_rate": 0.000460490319752506, "loss": 6.3867, "mean_token_accuracy": 0.15675798803567886, "num_tokens": 6091156.0, "step": 2445 }, { "entropy": 6.361089658737183, "epoch": 2.8654970760233915, "grad_norm": 0.9296875, "learning_rate": 0.00046022460856675663, "loss": 6.3249, "mean_token_accuracy": 0.16081140488386153, "num_tokens": 6103800.0, "step": 2450 }, { "entropy": 6.35357403755188, "epoch": 2.871345029239766, "grad_norm": 1.0, "learning_rate": 0.0004599580934929237, "loss": 6.342, "mean_token_accuracy": 0.16039023846387862, "num_tokens": 6116469.0, "step": 2455 }, { "entropy": 6.349758434295654, "epoch": 2.8771929824561404, "grad_norm": 1.0, "learning_rate": 0.0004596907756877018, "loss": 6.3853, "mean_token_accuracy": 0.15386279225349425, "num_tokens": 6129297.0, "step": 2460 }, { "entropy": 6.435890197753906, "epoch": 2.883040935672515, "grad_norm": 0.890625, "learning_rate": 0.00045942265631126935, "loss": 6.3576, "mean_token_accuracy": 0.15894166380167007, "num_tokens": 6141139.0, "step": 2465 }, { "entropy": 6.387912940979004, "epoch": 2.888888888888889, "grad_norm": 1.03125, "learning_rate": 0.0004591537365272837, "loss": 6.3091, "mean_token_accuracy": 0.16368301808834076, "num_tokens": 6154271.0, "step": 2470 }, { "entropy": 6.409696483612061, "epoch": 2.8947368421052633, "grad_norm": 0.95703125, "learning_rate": 0.000458884017502876, "loss": 6.3262, "mean_token_accuracy": 0.15825672224164009, "num_tokens": 6166296.0, "step": 2475 }, { "entropy": 6.250841951370239, "epoch": 2.9005847953216373, "grad_norm": 1.015625, "learning_rate": 0.0004586135004086461, "loss": 6.1801, "mean_token_accuracy": 0.16876088231801986, "num_tokens": 6178146.0, "step": 2480 }, { "entropy": 6.41408371925354, "epoch": 2.9064327485380117, "grad_norm": 0.94921875, "learning_rate": 0.0004583421864186577, "loss": 6.3381, "mean_token_accuracy": 0.15795808732509614, "num_tokens": 6190591.0, "step": 2485 }, { "entropy": 6.353419542312622, "epoch": 2.912280701754386, "grad_norm": 0.9765625, "learning_rate": 0.0004580700767104328, "loss": 6.317, "mean_token_accuracy": 0.16341704577207566, "num_tokens": 6201996.0, "step": 2490 }, { "entropy": 6.394930791854859, "epoch": 2.91812865497076, "grad_norm": 1.0078125, "learning_rate": 0.00045779717246494724, "loss": 6.3896, "mean_token_accuracy": 0.15675280690193177, "num_tokens": 6214640.0, "step": 2495 }, { "entropy": 6.486262416839599, "epoch": 2.9239766081871346, "grad_norm": 1.0234375, "learning_rate": 0.0004575234748666249, "loss": 6.4475, "mean_token_accuracy": 0.15161905139684678, "num_tokens": 6227811.0, "step": 2500 }, { "epoch": 2.9239766081871346, "eval_entropy": 6.3679620073256595, "eval_loss": 6.7001118659973145, "eval_mean_token_accuracy": 0.14387351291248668, "eval_num_tokens": 6227811.0, "eval_runtime": 2.2778, "eval_samples_per_second": 1188.439, "eval_steps_per_second": 148.829, "step": 2500 }, { "entropy": 6.447972249984741, "epoch": 2.9298245614035086, "grad_norm": 0.9453125, "learning_rate": 0.000457248985103333, "loss": 6.3699, "mean_token_accuracy": 0.1568946972489357, "num_tokens": 6240897.0, "step": 2505 }, { "entropy": 6.364565420150757, "epoch": 2.935672514619883, "grad_norm": 0.94140625, "learning_rate": 0.0004569737043663768, "loss": 6.367, "mean_token_accuracy": 0.15833095759153365, "num_tokens": 6252416.0, "step": 2510 }, { "entropy": 6.411330461502075, "epoch": 2.9415204678362574, "grad_norm": 1.015625, "learning_rate": 0.0004566976338504945, "loss": 6.4325, "mean_token_accuracy": 0.14796094745397567, "num_tokens": 6265203.0, "step": 2515 }, { "entropy": 6.372057485580444, "epoch": 2.9473684210526314, "grad_norm": 0.91796875, "learning_rate": 0.00045642077475385186, "loss": 6.3175, "mean_token_accuracy": 0.16635856479406358, "num_tokens": 6277384.0, "step": 2520 }, { "entropy": 6.38411660194397, "epoch": 2.953216374269006, "grad_norm": 0.93359375, "learning_rate": 0.0004561431282780372, "loss": 6.3569, "mean_token_accuracy": 0.1604871705174446, "num_tokens": 6291114.0, "step": 2525 }, { "entropy": 6.306672811508179, "epoch": 2.95906432748538, "grad_norm": 0.8046875, "learning_rate": 0.00045586469562805624, "loss": 6.2933, "mean_token_accuracy": 0.1560649335384369, "num_tokens": 6304604.0, "step": 2530 }, { "entropy": 6.376500940322876, "epoch": 2.9649122807017543, "grad_norm": 1.0625, "learning_rate": 0.0004555854780123265, "loss": 6.4141, "mean_token_accuracy": 0.15167758017778396, "num_tokens": 6316434.0, "step": 2535 }, { "entropy": 6.408717250823974, "epoch": 2.9707602339181287, "grad_norm": 0.9765625, "learning_rate": 0.0004553054766426725, "loss": 6.2689, "mean_token_accuracy": 0.15962534844875337, "num_tokens": 6328147.0, "step": 2540 }, { "entropy": 6.301998233795166, "epoch": 2.976608187134503, "grad_norm": 0.98828125, "learning_rate": 0.0004550246927343203, "loss": 6.2661, "mean_token_accuracy": 0.16512599289417268, "num_tokens": 6339836.0, "step": 2545 }, { "entropy": 6.4500223159790036, "epoch": 2.982456140350877, "grad_norm": 1.046875, "learning_rate": 0.00045474312750589226, "loss": 6.3751, "mean_token_accuracy": 0.1530895672738552, "num_tokens": 6352093.0, "step": 2550 }, { "entropy": 6.309706306457519, "epoch": 2.9883040935672516, "grad_norm": 0.89453125, "learning_rate": 0.00045446078217940155, "loss": 6.2957, "mean_token_accuracy": 0.1603766605257988, "num_tokens": 6364748.0, "step": 2555 }, { "entropy": 6.274790906906128, "epoch": 2.9941520467836256, "grad_norm": 1.0, "learning_rate": 0.00045417765798024716, "loss": 6.1146, "mean_token_accuracy": 0.16290974020957946, "num_tokens": 6376384.0, "step": 2560 }, { "entropy": 6.364281797409058, "epoch": 3.0, "grad_norm": 1.0703125, "learning_rate": 0.0004538937561372086, "loss": 6.3485, "mean_token_accuracy": 0.1564707338809967, "num_tokens": 6388452.0, "step": 2565 }, { "entropy": 6.385696840286255, "epoch": 3.0058479532163744, "grad_norm": 0.875, "learning_rate": 0.0004536090778824398, "loss": 5.9455, "mean_token_accuracy": 0.16394055783748626, "num_tokens": 6401876.0, "step": 2570 }, { "entropy": 6.325968074798584, "epoch": 3.0116959064327484, "grad_norm": 0.98046875, "learning_rate": 0.0004533236244514652, "loss": 5.9787, "mean_token_accuracy": 0.16571004986763, "num_tokens": 6413607.0, "step": 2575 }, { "entropy": 6.363959264755249, "epoch": 3.017543859649123, "grad_norm": 0.97265625, "learning_rate": 0.00045303739708317303, "loss": 5.9905, "mean_token_accuracy": 0.1685149371623993, "num_tokens": 6426295.0, "step": 2580 }, { "entropy": 6.260405969619751, "epoch": 3.023391812865497, "grad_norm": 0.96484375, "learning_rate": 0.0004527503970198105, "loss": 5.8862, "mean_token_accuracy": 0.17230862528085708, "num_tokens": 6438257.0, "step": 2585 }, { "entropy": 6.326606035232544, "epoch": 3.0292397660818713, "grad_norm": 0.9921875, "learning_rate": 0.0004524626255069786, "loss": 6.0472, "mean_token_accuracy": 0.1555703967809677, "num_tokens": 6451020.0, "step": 2590 }, { "entropy": 6.297233438491821, "epoch": 3.0350877192982457, "grad_norm": 0.89453125, "learning_rate": 0.00045217408379362635, "loss": 6.0091, "mean_token_accuracy": 0.1690215915441513, "num_tokens": 6463528.0, "step": 2595 }, { "entropy": 6.244835615158081, "epoch": 3.0409356725146197, "grad_norm": 0.93359375, "learning_rate": 0.00045188477313204536, "loss": 5.8807, "mean_token_accuracy": 0.17526089102029802, "num_tokens": 6475030.0, "step": 2600 }, { "entropy": 6.393086957931518, "epoch": 3.046783625730994, "grad_norm": 0.953125, "learning_rate": 0.00045159469477786457, "loss": 5.9884, "mean_token_accuracy": 0.17051160335540771, "num_tokens": 6487889.0, "step": 2605 }, { "entropy": 6.2137922763824465, "epoch": 3.0526315789473686, "grad_norm": 0.93359375, "learning_rate": 0.0004513038499900451, "loss": 5.9341, "mean_token_accuracy": 0.1741265207529068, "num_tokens": 6501806.0, "step": 2610 }, { "entropy": 6.225668668746948, "epoch": 3.0584795321637426, "grad_norm": 0.98828125, "learning_rate": 0.000451012240030874, "loss": 5.8621, "mean_token_accuracy": 0.17396994680166245, "num_tokens": 6512980.0, "step": 2615 }, { "entropy": 6.362692213058471, "epoch": 3.064327485380117, "grad_norm": 0.94140625, "learning_rate": 0.00045071986616595946, "loss": 5.9823, "mean_token_accuracy": 0.15765693187713622, "num_tokens": 6525156.0, "step": 2620 }, { "entropy": 6.276885890960694, "epoch": 3.0701754385964914, "grad_norm": 0.88671875, "learning_rate": 0.00045042672966422506, "loss": 5.9774, "mean_token_accuracy": 0.17088396698236466, "num_tokens": 6538048.0, "step": 2625 }, { "entropy": 6.162761640548706, "epoch": 3.0760233918128654, "grad_norm": 0.99609375, "learning_rate": 0.0004501328317979041, "loss": 5.8537, "mean_token_accuracy": 0.17376164197921753, "num_tokens": 6549088.0, "step": 2630 }, { "entropy": 6.2773816108703615, "epoch": 3.08187134502924, "grad_norm": 1.0078125, "learning_rate": 0.0004498381738425346, "loss": 6.0316, "mean_token_accuracy": 0.15929657816886902, "num_tokens": 6561597.0, "step": 2635 }, { "entropy": 6.277020883560181, "epoch": 3.087719298245614, "grad_norm": 0.96484375, "learning_rate": 0.00044954275707695304, "loss": 5.9434, "mean_token_accuracy": 0.16779058426618576, "num_tokens": 6573253.0, "step": 2640 }, { "entropy": 6.279333066940308, "epoch": 3.0935672514619883, "grad_norm": 0.97265625, "learning_rate": 0.0004492465827832894, "loss": 6.0267, "mean_token_accuracy": 0.16542163789272307, "num_tokens": 6584619.0, "step": 2645 }, { "entropy": 6.264507198333741, "epoch": 3.0994152046783627, "grad_norm": 0.95703125, "learning_rate": 0.00044894965224696144, "loss": 5.9489, "mean_token_accuracy": 0.16943052113056184, "num_tokens": 6597514.0, "step": 2650 }, { "entropy": 6.3290825366973875, "epoch": 3.1052631578947367, "grad_norm": 1.03125, "learning_rate": 0.00044865196675666886, "loss": 6.0226, "mean_token_accuracy": 0.16399950683116912, "num_tokens": 6610486.0, "step": 2655 }, { "entropy": 6.303022146224976, "epoch": 3.111111111111111, "grad_norm": 0.984375, "learning_rate": 0.0004483535276043881, "loss": 5.9443, "mean_token_accuracy": 0.17359011471271515, "num_tokens": 6622936.0, "step": 2660 }, { "entropy": 6.154239749908447, "epoch": 3.116959064327485, "grad_norm": 0.91796875, "learning_rate": 0.0004480543360853665, "loss": 5.8152, "mean_token_accuracy": 0.1817859560251236, "num_tokens": 6635841.0, "step": 2665 }, { "entropy": 6.322794437408447, "epoch": 3.1228070175438596, "grad_norm": 0.93359375, "learning_rate": 0.0004477543934981167, "loss": 6.0443, "mean_token_accuracy": 0.16220160573720932, "num_tokens": 6648611.0, "step": 2670 }, { "entropy": 6.237705373764038, "epoch": 3.128654970760234, "grad_norm": 0.99609375, "learning_rate": 0.00044745370114441103, "loss": 5.9954, "mean_token_accuracy": 0.16805303543806077, "num_tokens": 6660557.0, "step": 2675 }, { "entropy": 6.288750123977661, "epoch": 3.134502923976608, "grad_norm": 0.98046875, "learning_rate": 0.00044715226032927585, "loss": 5.995, "mean_token_accuracy": 0.16606099158525467, "num_tokens": 6672172.0, "step": 2680 }, { "entropy": 6.28822660446167, "epoch": 3.1403508771929824, "grad_norm": 0.97265625, "learning_rate": 0.0004468500723609859, "loss": 5.9925, "mean_token_accuracy": 0.16786604523658752, "num_tokens": 6685244.0, "step": 2685 }, { "entropy": 6.335166311264038, "epoch": 3.146198830409357, "grad_norm": 1.03125, "learning_rate": 0.00044654713855105864, "loss": 6.0474, "mean_token_accuracy": 0.168092343211174, "num_tokens": 6698401.0, "step": 2690 }, { "entropy": 6.183216619491577, "epoch": 3.152046783625731, "grad_norm": 0.97265625, "learning_rate": 0.0004462434602142486, "loss": 5.9933, "mean_token_accuracy": 0.16719063818454744, "num_tokens": 6710562.0, "step": 2695 }, { "entropy": 6.300883626937866, "epoch": 3.1578947368421053, "grad_norm": 0.90234375, "learning_rate": 0.0004459390386685414, "loss": 5.9741, "mean_token_accuracy": 0.16917198300361633, "num_tokens": 6724046.0, "step": 2700 }, { "entropy": 6.205930137634278, "epoch": 3.1637426900584797, "grad_norm": 0.94140625, "learning_rate": 0.00044563387523514854, "loss": 5.9398, "mean_token_accuracy": 0.17038815468549728, "num_tokens": 6736028.0, "step": 2705 }, { "entropy": 6.191318225860596, "epoch": 3.1695906432748537, "grad_norm": 0.984375, "learning_rate": 0.0004453279712385011, "loss": 5.9298, "mean_token_accuracy": 0.17975495308637618, "num_tokens": 6748828.0, "step": 2710 }, { "entropy": 6.244331216812133, "epoch": 3.175438596491228, "grad_norm": 0.94140625, "learning_rate": 0.0004450213280062444, "loss": 6.0125, "mean_token_accuracy": 0.16804856061935425, "num_tokens": 6761029.0, "step": 2715 }, { "entropy": 6.214777278900146, "epoch": 3.181286549707602, "grad_norm": 1.015625, "learning_rate": 0.00044471394686923206, "loss": 5.9348, "mean_token_accuracy": 0.1671859934926033, "num_tokens": 6772008.0, "step": 2720 }, { "entropy": 6.259116220474243, "epoch": 3.1871345029239766, "grad_norm": 1.0390625, "learning_rate": 0.0004444058291615202, "loss": 6.004, "mean_token_accuracy": 0.1627207562327385, "num_tokens": 6784913.0, "step": 2725 }, { "entropy": 6.246962594985962, "epoch": 3.192982456140351, "grad_norm": 0.98828125, "learning_rate": 0.0004440969762203618, "loss": 6.0286, "mean_token_accuracy": 0.1614857569336891, "num_tokens": 6797354.0, "step": 2730 }, { "entropy": 6.2715987205505375, "epoch": 3.198830409356725, "grad_norm": 0.9765625, "learning_rate": 0.0004437873893862008, "loss": 6.03, "mean_token_accuracy": 0.1656293749809265, "num_tokens": 6810010.0, "step": 2735 }, { "entropy": 6.213133382797241, "epoch": 3.2046783625730995, "grad_norm": 1.09375, "learning_rate": 0.00044347707000266627, "loss": 5.8755, "mean_token_accuracy": 0.17746605724096298, "num_tokens": 6821264.0, "step": 2740 }, { "entropy": 6.190156173706055, "epoch": 3.2105263157894735, "grad_norm": 0.9765625, "learning_rate": 0.00044316601941656655, "loss": 6.0178, "mean_token_accuracy": 0.16163998246192932, "num_tokens": 6833578.0, "step": 2745 }, { "entropy": 6.2568563461303714, "epoch": 3.216374269005848, "grad_norm": 0.96875, "learning_rate": 0.0004428542389778834, "loss": 5.8727, "mean_token_accuracy": 0.17870430648326874, "num_tokens": 6845744.0, "step": 2750 }, { "entropy": 6.1800566673278805, "epoch": 3.2222222222222223, "grad_norm": 0.94921875, "learning_rate": 0.0004425417300397665, "loss": 6.0205, "mean_token_accuracy": 0.16778453886508943, "num_tokens": 6857970.0, "step": 2755 }, { "entropy": 6.309784173965454, "epoch": 3.2280701754385963, "grad_norm": 0.95703125, "learning_rate": 0.00044222849395852683, "loss": 6.0367, "mean_token_accuracy": 0.1630901277065277, "num_tokens": 6870586.0, "step": 2760 }, { "entropy": 6.237935781478882, "epoch": 3.2339181286549707, "grad_norm": 1.0078125, "learning_rate": 0.00044191453209363165, "loss": 6.0678, "mean_token_accuracy": 0.16293592303991317, "num_tokens": 6883667.0, "step": 2765 }, { "entropy": 6.23095703125, "epoch": 3.239766081871345, "grad_norm": 1.0, "learning_rate": 0.0004415998458076978, "loss": 6.0468, "mean_token_accuracy": 0.16571044474840163, "num_tokens": 6896709.0, "step": 2770 }, { "entropy": 6.243925714492798, "epoch": 3.245614035087719, "grad_norm": 0.9609375, "learning_rate": 0.00044128443646648634, "loss": 5.9543, "mean_token_accuracy": 0.17564820051193236, "num_tokens": 6909899.0, "step": 2775 }, { "entropy": 6.22199125289917, "epoch": 3.2514619883040936, "grad_norm": 1.046875, "learning_rate": 0.00044096830543889653, "loss": 6.0247, "mean_token_accuracy": 0.16570626199245453, "num_tokens": 6922751.0, "step": 2780 }, { "entropy": 6.247598361968994, "epoch": 3.257309941520468, "grad_norm": 1.0390625, "learning_rate": 0.0004406514540969596, "loss": 5.9863, "mean_token_accuracy": 0.17584278881549836, "num_tokens": 6936011.0, "step": 2785 }, { "entropy": 6.248948287963867, "epoch": 3.263157894736842, "grad_norm": 0.98046875, "learning_rate": 0.00044033388381583324, "loss": 6.0991, "mean_token_accuracy": 0.15915966033935547, "num_tokens": 6948831.0, "step": 2790 }, { "entropy": 6.250845289230346, "epoch": 3.2690058479532165, "grad_norm": 0.99609375, "learning_rate": 0.00044001559597379503, "loss": 5.9181, "mean_token_accuracy": 0.17828963398933412, "num_tokens": 6961329.0, "step": 2795 }, { "entropy": 6.146090030670166, "epoch": 3.2748538011695905, "grad_norm": 0.99609375, "learning_rate": 0.0004396965919522373, "loss": 5.9652, "mean_token_accuracy": 0.17339591979980468, "num_tokens": 6973075.0, "step": 2800 }, { "entropy": 6.204458570480346, "epoch": 3.280701754385965, "grad_norm": 0.98046875, "learning_rate": 0.00043937687313565997, "loss": 5.9621, "mean_token_accuracy": 0.17302401214838029, "num_tokens": 6985592.0, "step": 2805 }, { "entropy": 6.256625604629517, "epoch": 3.2865497076023393, "grad_norm": 1.03125, "learning_rate": 0.0004390564409116661, "loss": 6.0016, "mean_token_accuracy": 0.17008765041828156, "num_tokens": 6998075.0, "step": 2810 }, { "entropy": 6.181208372116089, "epoch": 3.2923976608187133, "grad_norm": 1.0859375, "learning_rate": 0.00043873529667095423, "loss": 5.9488, "mean_token_accuracy": 0.17330780029296874, "num_tokens": 7008790.0, "step": 2815 }, { "entropy": 6.264780902862549, "epoch": 3.2982456140350878, "grad_norm": 1.0, "learning_rate": 0.00043841344180731346, "loss": 6.0486, "mean_token_accuracy": 0.1657038301229477, "num_tokens": 7022031.0, "step": 2820 }, { "entropy": 6.227780055999756, "epoch": 3.3040935672514617, "grad_norm": 0.96484375, "learning_rate": 0.000438090877717617, "loss": 6.0054, "mean_token_accuracy": 0.16618477702140808, "num_tokens": 7033491.0, "step": 2825 }, { "entropy": 6.263735961914063, "epoch": 3.309941520467836, "grad_norm": 1.046875, "learning_rate": 0.0004377676058018161, "loss": 5.9906, "mean_token_accuracy": 0.16891173124313355, "num_tokens": 7045472.0, "step": 2830 }, { "entropy": 6.172624301910401, "epoch": 3.3157894736842106, "grad_norm": 0.96484375, "learning_rate": 0.0004374436274629341, "loss": 5.9318, "mean_token_accuracy": 0.16880391538143158, "num_tokens": 7059050.0, "step": 2835 }, { "entropy": 6.258979606628418, "epoch": 3.3216374269005846, "grad_norm": 1.078125, "learning_rate": 0.0004371189441070602, "loss": 6.0633, "mean_token_accuracy": 0.1651046544313431, "num_tokens": 7070604.0, "step": 2840 }, { "entropy": 6.183944797515869, "epoch": 3.327485380116959, "grad_norm": 0.96875, "learning_rate": 0.0004367935571433433, "loss": 5.982, "mean_token_accuracy": 0.17618281543254852, "num_tokens": 7083687.0, "step": 2845 }, { "entropy": 6.221978092193604, "epoch": 3.3333333333333335, "grad_norm": 1.03125, "learning_rate": 0.0004364674679839864, "loss": 6.0221, "mean_token_accuracy": 0.1694357842206955, "num_tokens": 7095846.0, "step": 2850 }, { "entropy": 6.247653579711914, "epoch": 3.3391812865497075, "grad_norm": 1.0, "learning_rate": 0.0004361406780442398, "loss": 5.9794, "mean_token_accuracy": 0.16668584048748017, "num_tokens": 7108051.0, "step": 2855 }, { "entropy": 6.251958322525025, "epoch": 3.345029239766082, "grad_norm": 1.0078125, "learning_rate": 0.00043581318874239504, "loss": 6.0401, "mean_token_accuracy": 0.161568284034729, "num_tokens": 7120699.0, "step": 2860 }, { "entropy": 6.213390874862671, "epoch": 3.3508771929824563, "grad_norm": 0.94140625, "learning_rate": 0.00043548500149977946, "loss": 6.0328, "mean_token_accuracy": 0.17091115117073058, "num_tokens": 7134039.0, "step": 2865 }, { "entropy": 6.268674278259278, "epoch": 3.3567251461988303, "grad_norm": 0.99609375, "learning_rate": 0.0004351561177407491, "loss": 6.0295, "mean_token_accuracy": 0.16179833561182022, "num_tokens": 7145196.0, "step": 2870 }, { "entropy": 6.158988666534424, "epoch": 3.3625730994152048, "grad_norm": 0.984375, "learning_rate": 0.0004348265388926831, "loss": 6.0532, "mean_token_accuracy": 0.15928393006324768, "num_tokens": 7156818.0, "step": 2875 }, { "entropy": 6.207103300094604, "epoch": 3.3684210526315788, "grad_norm": 0.99609375, "learning_rate": 0.0004344962663859771, "loss": 5.9047, "mean_token_accuracy": 0.16933748573064805, "num_tokens": 7169282.0, "step": 2880 }, { "entropy": 6.218513298034668, "epoch": 3.374269005847953, "grad_norm": 1.0390625, "learning_rate": 0.00043416530165403777, "loss": 6.0129, "mean_token_accuracy": 0.17008000761270523, "num_tokens": 7180663.0, "step": 2885 }, { "entropy": 6.1580695629119875, "epoch": 3.3801169590643276, "grad_norm": 0.96875, "learning_rate": 0.0004338336461332756, "loss": 6.0213, "mean_token_accuracy": 0.16719587296247482, "num_tokens": 7192529.0, "step": 2890 }, { "entropy": 6.2996687412261965, "epoch": 3.3859649122807016, "grad_norm": 1.015625, "learning_rate": 0.00043350130126309936, "loss": 6.0187, "mean_token_accuracy": 0.16427617371082306, "num_tokens": 7204484.0, "step": 2895 }, { "entropy": 6.178333759307861, "epoch": 3.391812865497076, "grad_norm": 1.015625, "learning_rate": 0.00043316826848590955, "loss": 5.9632, "mean_token_accuracy": 0.16770129203796386, "num_tokens": 7217312.0, "step": 2900 }, { "entropy": 6.126302576065063, "epoch": 3.39766081871345, "grad_norm": 1.1015625, "learning_rate": 0.0004328345492470924, "loss": 5.9567, "mean_token_accuracy": 0.17035896927118302, "num_tokens": 7229032.0, "step": 2905 }, { "entropy": 6.224781942367554, "epoch": 3.4035087719298245, "grad_norm": 0.953125, "learning_rate": 0.0004325001449950134, "loss": 6.0456, "mean_token_accuracy": 0.16447727084159852, "num_tokens": 7242827.0, "step": 2910 }, { "entropy": 6.10618371963501, "epoch": 3.409356725146199, "grad_norm": 1.015625, "learning_rate": 0.0004321650571810109, "loss": 5.9579, "mean_token_accuracy": 0.1736912399530411, "num_tokens": 7256152.0, "step": 2915 }, { "entropy": 6.269802236557007, "epoch": 3.415204678362573, "grad_norm": 1.0, "learning_rate": 0.0004318292872593899, "loss": 6.0582, "mean_token_accuracy": 0.163247187435627, "num_tokens": 7268122.0, "step": 2920 }, { "entropy": 6.287968540191651, "epoch": 3.4210526315789473, "grad_norm": 1.0078125, "learning_rate": 0.0004314928366874162, "loss": 6.0484, "mean_token_accuracy": 0.17468223869800567, "num_tokens": 7281914.0, "step": 2925 }, { "entropy": 6.052388477325439, "epoch": 3.426900584795322, "grad_norm": 1.0546875, "learning_rate": 0.0004311557069253092, "loss": 5.9439, "mean_token_accuracy": 0.1708640545606613, "num_tokens": 7294555.0, "step": 2930 }, { "entropy": 6.196170806884766, "epoch": 3.4327485380116958, "grad_norm": 0.98046875, "learning_rate": 0.0004308178994362364, "loss": 6.0224, "mean_token_accuracy": 0.1732296958565712, "num_tokens": 7307606.0, "step": 2935 }, { "entropy": 6.247723245620728, "epoch": 3.43859649122807, "grad_norm": 0.921875, "learning_rate": 0.00043047941568630644, "loss": 6.0571, "mean_token_accuracy": 0.17093972414731978, "num_tokens": 7322003.0, "step": 2940 }, { "entropy": 6.216898107528687, "epoch": 3.4444444444444446, "grad_norm": 1.0, "learning_rate": 0.00043014025714456305, "loss": 6.0057, "mean_token_accuracy": 0.16487190499901772, "num_tokens": 7333932.0, "step": 2945 }, { "entropy": 6.269065189361572, "epoch": 3.4502923976608186, "grad_norm": 1.078125, "learning_rate": 0.0004298004252829787, "loss": 6.0437, "mean_token_accuracy": 0.16805607676506043, "num_tokens": 7346849.0, "step": 2950 }, { "entropy": 6.2054437637329105, "epoch": 3.456140350877193, "grad_norm": 0.9609375, "learning_rate": 0.000429459921576448, "loss": 6.0929, "mean_token_accuracy": 0.16196269243955613, "num_tokens": 7358940.0, "step": 2955 }, { "entropy": 6.141955709457397, "epoch": 3.461988304093567, "grad_norm": 1.1640625, "learning_rate": 0.00042911874750278133, "loss": 5.9353, "mean_token_accuracy": 0.18545606434345246, "num_tokens": 7371883.0, "step": 2960 }, { "entropy": 6.171265268325806, "epoch": 3.4678362573099415, "grad_norm": 0.91796875, "learning_rate": 0.00042877690454269884, "loss": 5.9664, "mean_token_accuracy": 0.17044519484043122, "num_tokens": 7384203.0, "step": 2965 }, { "entropy": 6.18736047744751, "epoch": 3.473684210526316, "grad_norm": 0.94921875, "learning_rate": 0.00042843439417982344, "loss": 5.994, "mean_token_accuracy": 0.16554267406463624, "num_tokens": 7397851.0, "step": 2970 }, { "entropy": 6.150423145294189, "epoch": 3.47953216374269, "grad_norm": 1.046875, "learning_rate": 0.0004280912179006746, "loss": 5.9952, "mean_token_accuracy": 0.17289814352989197, "num_tokens": 7410684.0, "step": 2975 }, { "entropy": 6.178168869018554, "epoch": 3.4853801169590644, "grad_norm": 1.0234375, "learning_rate": 0.000427747377194662, "loss": 6.0022, "mean_token_accuracy": 0.17682780921459199, "num_tokens": 7423393.0, "step": 2980 }, { "entropy": 6.163204765319824, "epoch": 3.4912280701754383, "grad_norm": 1.0546875, "learning_rate": 0.0004274028735540789, "loss": 5.951, "mean_token_accuracy": 0.17342002987861632, "num_tokens": 7436170.0, "step": 2985 }, { "entropy": 6.162869501113891, "epoch": 3.497076023391813, "grad_norm": 0.93359375, "learning_rate": 0.00042705770847409596, "loss": 6.0194, "mean_token_accuracy": 0.16856492310762405, "num_tokens": 7448915.0, "step": 2990 }, { "entropy": 6.195002555847168, "epoch": 3.502923976608187, "grad_norm": 0.91796875, "learning_rate": 0.00042671188345275423, "loss": 6.0179, "mean_token_accuracy": 0.16502529233694077, "num_tokens": 7461585.0, "step": 2995 }, { "entropy": 6.21580867767334, "epoch": 3.5087719298245617, "grad_norm": 1.03125, "learning_rate": 0.0004263653999909593, "loss": 5.9884, "mean_token_accuracy": 0.17214400917291642, "num_tokens": 7473826.0, "step": 3000 }, { "epoch": 3.5087719298245617, "eval_entropy": 6.110265312644936, "eval_loss": 6.669482707977295, "eval_mean_token_accuracy": 0.14564121225546595, "eval_num_tokens": 7473826.0, "eval_runtime": 2.2807, "eval_samples_per_second": 1186.915, "eval_steps_per_second": 148.638, "step": 3000 }, { "entropy": 6.168160915374756, "epoch": 3.5146198830409356, "grad_norm": 0.984375, "learning_rate": 0.000426018259592474, "loss": 5.9714, "mean_token_accuracy": 0.17308609932661057, "num_tokens": 7486271.0, "step": 3005 }, { "entropy": 6.158830356597901, "epoch": 3.52046783625731, "grad_norm": 0.953125, "learning_rate": 0.0004256704637639126, "loss": 5.99, "mean_token_accuracy": 0.16976851373910903, "num_tokens": 7499160.0, "step": 3010 }, { "entropy": 6.174773645401001, "epoch": 3.526315789473684, "grad_norm": 1.0234375, "learning_rate": 0.0004253220140147341, "loss": 6.0677, "mean_token_accuracy": 0.1640997663140297, "num_tokens": 7511424.0, "step": 3015 }, { "entropy": 6.226050233840942, "epoch": 3.5321637426900585, "grad_norm": 0.95703125, "learning_rate": 0.0004249729118572352, "loss": 6.016, "mean_token_accuracy": 0.1699744313955307, "num_tokens": 7523113.0, "step": 3020 }, { "entropy": 6.267972946166992, "epoch": 3.538011695906433, "grad_norm": 0.93359375, "learning_rate": 0.0004246231588065444, "loss": 6.0965, "mean_token_accuracy": 0.15748149454593657, "num_tokens": 7536198.0, "step": 3025 }, { "entropy": 6.100395584106446, "epoch": 3.543859649122807, "grad_norm": 0.984375, "learning_rate": 0.000424272756380615, "loss": 5.917, "mean_token_accuracy": 0.17440422251820564, "num_tokens": 7548782.0, "step": 3030 }, { "entropy": 6.188682985305786, "epoch": 3.5497076023391814, "grad_norm": 1.0078125, "learning_rate": 0.0004239217061002188, "loss": 6.0274, "mean_token_accuracy": 0.16385763883590698, "num_tokens": 7560745.0, "step": 3035 }, { "entropy": 6.2717749118804935, "epoch": 3.5555555555555554, "grad_norm": 1.0234375, "learning_rate": 0.00042357000948893894, "loss": 6.0325, "mean_token_accuracy": 0.16803848445415498, "num_tokens": 7572095.0, "step": 3040 }, { "entropy": 6.16748628616333, "epoch": 3.56140350877193, "grad_norm": 0.91015625, "learning_rate": 0.00042321766807316405, "loss": 6.0787, "mean_token_accuracy": 0.1694350227713585, "num_tokens": 7584462.0, "step": 3045 }, { "entropy": 6.280899858474731, "epoch": 3.5672514619883042, "grad_norm": 1.046875, "learning_rate": 0.00042286468338208113, "loss": 6.007, "mean_token_accuracy": 0.17000401318073272, "num_tokens": 7596910.0, "step": 3050 }, { "entropy": 6.111650514602661, "epoch": 3.573099415204678, "grad_norm": 0.9765625, "learning_rate": 0.0004225110569476691, "loss": 6.0113, "mean_token_accuracy": 0.16991945058107377, "num_tokens": 7609298.0, "step": 3055 }, { "entropy": 6.139304828643799, "epoch": 3.5789473684210527, "grad_norm": 0.9609375, "learning_rate": 0.000422156790304692, "loss": 6.0016, "mean_token_accuracy": 0.17069095075130464, "num_tokens": 7622945.0, "step": 3060 }, { "entropy": 6.227212619781494, "epoch": 3.5847953216374266, "grad_norm": 1.046875, "learning_rate": 0.00042180188499069246, "loss": 5.935, "mean_token_accuracy": 0.1692454621195793, "num_tokens": 7635880.0, "step": 3065 }, { "entropy": 6.076358413696289, "epoch": 3.590643274853801, "grad_norm": 0.96875, "learning_rate": 0.000421446342545985, "loss": 5.9835, "mean_token_accuracy": 0.169833804666996, "num_tokens": 7648079.0, "step": 3070 }, { "entropy": 6.206840181350708, "epoch": 3.5964912280701755, "grad_norm": 1.046875, "learning_rate": 0.00042109016451364933, "loss": 6.0421, "mean_token_accuracy": 0.16122946441173552, "num_tokens": 7660701.0, "step": 3075 }, { "entropy": 6.154277420043945, "epoch": 3.60233918128655, "grad_norm": 1.171875, "learning_rate": 0.00042073335243952354, "loss": 5.8997, "mean_token_accuracy": 0.1736776426434517, "num_tokens": 7672496.0, "step": 3080 }, { "entropy": 6.14108510017395, "epoch": 3.608187134502924, "grad_norm": 1.34375, "learning_rate": 0.0004203759078721979, "loss": 6.0705, "mean_token_accuracy": 0.1707608222961426, "num_tokens": 7684407.0, "step": 3085 }, { "entropy": 6.227617835998535, "epoch": 3.6140350877192984, "grad_norm": 1.078125, "learning_rate": 0.0004200178323630072, "loss": 5.9926, "mean_token_accuracy": 0.16486037969589235, "num_tokens": 7697195.0, "step": 3090 }, { "entropy": 6.159926795959473, "epoch": 3.6198830409356724, "grad_norm": 1.0, "learning_rate": 0.00041965912746602495, "loss": 5.9801, "mean_token_accuracy": 0.17005882859230043, "num_tokens": 7709698.0, "step": 3095 }, { "entropy": 6.1045825481414795, "epoch": 3.625730994152047, "grad_norm": 0.9296875, "learning_rate": 0.00041929979473805606, "loss": 5.9693, "mean_token_accuracy": 0.17374220192432405, "num_tokens": 7722638.0, "step": 3100 }, { "entropy": 6.214031934738159, "epoch": 3.6315789473684212, "grad_norm": 1.015625, "learning_rate": 0.00041893983573863044, "loss": 5.9751, "mean_token_accuracy": 0.17192549854516984, "num_tokens": 7735513.0, "step": 3105 }, { "entropy": 6.179910898208618, "epoch": 3.6374269005847952, "grad_norm": 0.88671875, "learning_rate": 0.00041857925202999586, "loss": 6.1075, "mean_token_accuracy": 0.1613726243376732, "num_tokens": 7748826.0, "step": 3110 }, { "entropy": 6.03430757522583, "epoch": 3.6432748538011697, "grad_norm": 0.89453125, "learning_rate": 0.0004182180451771115, "loss": 5.9075, "mean_token_accuracy": 0.17266260087490082, "num_tokens": 7761139.0, "step": 3115 }, { "entropy": 6.277319002151489, "epoch": 3.6491228070175437, "grad_norm": 1.078125, "learning_rate": 0.0004178562167476409, "loss": 6.064, "mean_token_accuracy": 0.1629991427063942, "num_tokens": 7772723.0, "step": 3120 }, { "entropy": 6.239894437789917, "epoch": 3.654970760233918, "grad_norm": 1.0078125, "learning_rate": 0.00041749376831194565, "loss": 6.0519, "mean_token_accuracy": 0.17082974016666413, "num_tokens": 7784436.0, "step": 3125 }, { "entropy": 6.130610227584839, "epoch": 3.6608187134502925, "grad_norm": 0.9765625, "learning_rate": 0.0004171307014430777, "loss": 5.9757, "mean_token_accuracy": 0.17419460713863372, "num_tokens": 7797471.0, "step": 3130 }, { "entropy": 6.134858846664429, "epoch": 3.6666666666666665, "grad_norm": 0.99609375, "learning_rate": 0.00041676701771677343, "loss": 5.9935, "mean_token_accuracy": 0.16835572570562363, "num_tokens": 7809923.0, "step": 3135 }, { "entropy": 6.257731676101685, "epoch": 3.672514619883041, "grad_norm": 1.0078125, "learning_rate": 0.0004164027187114463, "loss": 6.0368, "mean_token_accuracy": 0.16347835212945938, "num_tokens": 7821793.0, "step": 3140 }, { "entropy": 6.244524002075195, "epoch": 3.678362573099415, "grad_norm": 0.96484375, "learning_rate": 0.00041603780600818, "loss": 6.0558, "mean_token_accuracy": 0.16942404508590697, "num_tokens": 7834263.0, "step": 3145 }, { "entropy": 6.115977811813354, "epoch": 3.6842105263157894, "grad_norm": 1.140625, "learning_rate": 0.0004156722811907219, "loss": 5.9724, "mean_token_accuracy": 0.1744808316230774, "num_tokens": 7845533.0, "step": 3150 }, { "entropy": 6.131769132614136, "epoch": 3.690058479532164, "grad_norm": 1.0234375, "learning_rate": 0.00041530614584547594, "loss": 5.9743, "mean_token_accuracy": 0.1665850654244423, "num_tokens": 7857290.0, "step": 3155 }, { "entropy": 6.128918600082398, "epoch": 3.6959064327485383, "grad_norm": 1.0078125, "learning_rate": 0.00041493940156149577, "loss": 6.0232, "mean_token_accuracy": 0.16824957877397537, "num_tokens": 7870049.0, "step": 3160 }, { "entropy": 6.180130052566528, "epoch": 3.7017543859649122, "grad_norm": 1.0625, "learning_rate": 0.000414572049930478, "loss": 6.0084, "mean_token_accuracy": 0.17029111087322235, "num_tokens": 7882154.0, "step": 3165 }, { "entropy": 6.132463121414185, "epoch": 3.7076023391812867, "grad_norm": 0.92578125, "learning_rate": 0.00041420409254675465, "loss": 6.0728, "mean_token_accuracy": 0.1656474679708481, "num_tokens": 7895173.0, "step": 3170 }, { "entropy": 6.204341125488281, "epoch": 3.7134502923976607, "grad_norm": 1.0390625, "learning_rate": 0.0004138355310072876, "loss": 6.0228, "mean_token_accuracy": 0.16480461210012437, "num_tokens": 7908032.0, "step": 3175 }, { "entropy": 6.26247353553772, "epoch": 3.719298245614035, "grad_norm": 0.9765625, "learning_rate": 0.00041346636691166015, "loss": 6.0733, "mean_token_accuracy": 0.15896032750606537, "num_tokens": 7921551.0, "step": 3180 }, { "entropy": 6.234937381744385, "epoch": 3.7251461988304095, "grad_norm": 0.95703125, "learning_rate": 0.00041309660186207093, "loss": 6.0624, "mean_token_accuracy": 0.16706914007663726, "num_tokens": 7933986.0, "step": 3185 }, { "entropy": 6.208376455307007, "epoch": 3.7309941520467835, "grad_norm": 1.0, "learning_rate": 0.00041272623746332687, "loss": 6.021, "mean_token_accuracy": 0.1685838967561722, "num_tokens": 7946072.0, "step": 3190 }, { "entropy": 6.198312664031983, "epoch": 3.736842105263158, "grad_norm": 1.0078125, "learning_rate": 0.00041235527532283603, "loss": 6.0702, "mean_token_accuracy": 0.16089875549077987, "num_tokens": 7959779.0, "step": 3195 }, { "entropy": 6.221551370620728, "epoch": 3.742690058479532, "grad_norm": 0.98046875, "learning_rate": 0.0004119837170506005, "loss": 5.9995, "mean_token_accuracy": 0.16619008779525757, "num_tokens": 7972868.0, "step": 3200 }, { "entropy": 6.172733783721924, "epoch": 3.7485380116959064, "grad_norm": 0.90625, "learning_rate": 0.00041161156425921004, "loss": 5.98, "mean_token_accuracy": 0.17230560332536698, "num_tokens": 7986160.0, "step": 3205 }, { "entropy": 6.086882019042969, "epoch": 3.754385964912281, "grad_norm": 0.984375, "learning_rate": 0.00041123881856383436, "loss": 5.9981, "mean_token_accuracy": 0.1715784415602684, "num_tokens": 7999286.0, "step": 3210 }, { "entropy": 6.217818021774292, "epoch": 3.760233918128655, "grad_norm": 1.0234375, "learning_rate": 0.0004108654815822165, "loss": 6.0075, "mean_token_accuracy": 0.16945263892412185, "num_tokens": 8012745.0, "step": 3215 }, { "entropy": 6.156993055343628, "epoch": 3.7660818713450293, "grad_norm": 1.015625, "learning_rate": 0.0004104915549346658, "loss": 6.0431, "mean_token_accuracy": 0.1693377137184143, "num_tokens": 8025865.0, "step": 3220 }, { "entropy": 6.175265645980835, "epoch": 3.7719298245614032, "grad_norm": 0.96875, "learning_rate": 0.00041011704024405065, "loss": 6.0039, "mean_token_accuracy": 0.16357186883687974, "num_tokens": 8038345.0, "step": 3225 }, { "entropy": 6.1215215682983395, "epoch": 3.7777777777777777, "grad_norm": 1.046875, "learning_rate": 0.00040974193913579174, "loss": 5.8609, "mean_token_accuracy": 0.17776030898094178, "num_tokens": 8049861.0, "step": 3230 }, { "entropy": 6.072991895675659, "epoch": 3.783625730994152, "grad_norm": 1.0078125, "learning_rate": 0.0004093662532378547, "loss": 5.9577, "mean_token_accuracy": 0.1761360615491867, "num_tokens": 8061762.0, "step": 3235 }, { "entropy": 6.2837165832519535, "epoch": 3.7894736842105265, "grad_norm": 1.0078125, "learning_rate": 0.0004089899841807433, "loss": 6.0521, "mean_token_accuracy": 0.1629977360367775, "num_tokens": 8074074.0, "step": 3240 }, { "entropy": 6.106632947921753, "epoch": 3.7953216374269005, "grad_norm": 1.0234375, "learning_rate": 0.00040861313359749217, "loss": 5.9817, "mean_token_accuracy": 0.16985149085521697, "num_tokens": 8085664.0, "step": 3245 }, { "entropy": 6.165804529190064, "epoch": 3.801169590643275, "grad_norm": 1.0234375, "learning_rate": 0.00040823570312366005, "loss": 6.0924, "mean_token_accuracy": 0.16323314905166625, "num_tokens": 8097768.0, "step": 3250 }, { "entropy": 6.173748350143432, "epoch": 3.807017543859649, "grad_norm": 1.0625, "learning_rate": 0.000407857694397322, "loss": 5.9755, "mean_token_accuracy": 0.17611339837312698, "num_tokens": 8109240.0, "step": 3255 }, { "entropy": 6.164474678039551, "epoch": 3.8128654970760234, "grad_norm": 0.92578125, "learning_rate": 0.0004074791090590632, "loss": 6.0412, "mean_token_accuracy": 0.1648976132273674, "num_tokens": 8121658.0, "step": 3260 }, { "entropy": 6.179024171829224, "epoch": 3.818713450292398, "grad_norm": 0.9921875, "learning_rate": 0.0004070999487519711, "loss": 6.0579, "mean_token_accuracy": 0.16155336946249008, "num_tokens": 8133353.0, "step": 3265 }, { "entropy": 6.094624471664429, "epoch": 3.824561403508772, "grad_norm": 0.98046875, "learning_rate": 0.00040672021512162864, "loss": 6.05, "mean_token_accuracy": 0.1641142785549164, "num_tokens": 8146589.0, "step": 3270 }, { "entropy": 6.264404773712158, "epoch": 3.8304093567251463, "grad_norm": 1.0234375, "learning_rate": 0.000406339909816107, "loss": 6.0213, "mean_token_accuracy": 0.16167487800121308, "num_tokens": 8158676.0, "step": 3275 }, { "entropy": 6.129144954681396, "epoch": 3.8362573099415203, "grad_norm": 1.03125, "learning_rate": 0.0004059590344859584, "loss": 5.893, "mean_token_accuracy": 0.18017241209745408, "num_tokens": 8170616.0, "step": 3280 }, { "entropy": 5.99580717086792, "epoch": 3.8421052631578947, "grad_norm": 0.9921875, "learning_rate": 0.0004055775907842092, "loss": 6.0134, "mean_token_accuracy": 0.17614096999168397, "num_tokens": 8183045.0, "step": 3285 }, { "entropy": 6.239017581939697, "epoch": 3.847953216374269, "grad_norm": 1.0859375, "learning_rate": 0.0004051955803663523, "loss": 6.0581, "mean_token_accuracy": 0.17262273877859116, "num_tokens": 8195215.0, "step": 3290 }, { "entropy": 6.170020008087159, "epoch": 3.853801169590643, "grad_norm": 1.046875, "learning_rate": 0.0004048130048903404, "loss": 6.038, "mean_token_accuracy": 0.16725364923477173, "num_tokens": 8207963.0, "step": 3295 }, { "entropy": 6.154378414154053, "epoch": 3.8596491228070176, "grad_norm": 1.0078125, "learning_rate": 0.0004044298660165786, "loss": 5.9784, "mean_token_accuracy": 0.17133220434188842, "num_tokens": 8220908.0, "step": 3300 }, { "entropy": 6.240460634231567, "epoch": 3.8654970760233915, "grad_norm": 0.98046875, "learning_rate": 0.00040404616540791683, "loss": 5.9752, "mean_token_accuracy": 0.17119812965393066, "num_tokens": 8233600.0, "step": 3305 }, { "entropy": 6.1052779197692875, "epoch": 3.871345029239766, "grad_norm": 1.0390625, "learning_rate": 0.0004036619047296435, "loss": 5.9502, "mean_token_accuracy": 0.18522704094648362, "num_tokens": 8246209.0, "step": 3310 }, { "entropy": 6.1566300868988035, "epoch": 3.8771929824561404, "grad_norm": 1.046875, "learning_rate": 0.0004032770856494772, "loss": 6.0201, "mean_token_accuracy": 0.1704757332801819, "num_tokens": 8257655.0, "step": 3315 }, { "entropy": 6.18036150932312, "epoch": 3.883040935672515, "grad_norm": 0.95703125, "learning_rate": 0.00040289170983756075, "loss": 6.0087, "mean_token_accuracy": 0.17002097219228746, "num_tokens": 8270701.0, "step": 3320 }, { "entropy": 6.148637771606445, "epoch": 3.888888888888889, "grad_norm": 0.99609375, "learning_rate": 0.0004025057789664524, "loss": 6.0335, "mean_token_accuracy": 0.16643901467323302, "num_tokens": 8283270.0, "step": 3325 }, { "entropy": 6.158613920211792, "epoch": 3.8947368421052633, "grad_norm": 1.0390625, "learning_rate": 0.0004021192947111201, "loss": 6.0065, "mean_token_accuracy": 0.16925504952669143, "num_tokens": 8294842.0, "step": 3330 }, { "entropy": 6.1078980445861815, "epoch": 3.9005847953216373, "grad_norm": 1.1640625, "learning_rate": 0.00040173225874893305, "loss": 5.8036, "mean_token_accuracy": 0.18257610499858856, "num_tokens": 8307527.0, "step": 3335 }, { "entropy": 6.118655967712402, "epoch": 3.9064327485380117, "grad_norm": 0.94921875, "learning_rate": 0.00040134467275965515, "loss": 5.982, "mean_token_accuracy": 0.17393046170473098, "num_tokens": 8319220.0, "step": 3340 }, { "entropy": 6.233961963653565, "epoch": 3.912280701754386, "grad_norm": 1.03125, "learning_rate": 0.0004009565384254374, "loss": 6.0261, "mean_token_accuracy": 0.16972270756959915, "num_tokens": 8331577.0, "step": 3345 }, { "entropy": 6.120598983764649, "epoch": 3.91812865497076, "grad_norm": 1.0625, "learning_rate": 0.00040056785743081065, "loss": 6.0985, "mean_token_accuracy": 0.16492811292409898, "num_tokens": 8343327.0, "step": 3350 }, { "entropy": 6.216963291168213, "epoch": 3.9239766081871346, "grad_norm": 0.97265625, "learning_rate": 0.0004001786314626783, "loss": 6.0776, "mean_token_accuracy": 0.16241157054901123, "num_tokens": 8356063.0, "step": 3355 }, { "entropy": 6.181361246109009, "epoch": 3.9298245614035086, "grad_norm": 1.0546875, "learning_rate": 0.0003997888622103088, "loss": 6.0741, "mean_token_accuracy": 0.15976226478815078, "num_tokens": 8368547.0, "step": 3360 }, { "entropy": 6.10531849861145, "epoch": 3.935672514619883, "grad_norm": 0.953125, "learning_rate": 0.0003993985513653289, "loss": 5.9001, "mean_token_accuracy": 0.1757778897881508, "num_tokens": 8381172.0, "step": 3365 }, { "entropy": 6.183521318435669, "epoch": 3.9415204678362574, "grad_norm": 1.0390625, "learning_rate": 0.0003990077006217155, "loss": 6.0812, "mean_token_accuracy": 0.16544191539287567, "num_tokens": 8392560.0, "step": 3370 }, { "entropy": 6.172083234786987, "epoch": 3.9473684210526314, "grad_norm": 1.0859375, "learning_rate": 0.000398616311675789, "loss": 5.9894, "mean_token_accuracy": 0.16490666568279266, "num_tokens": 8405547.0, "step": 3375 }, { "entropy": 6.165727376937866, "epoch": 3.953216374269006, "grad_norm": 1.0234375, "learning_rate": 0.00039822438622620523, "loss": 6.0125, "mean_token_accuracy": 0.1696140930056572, "num_tokens": 8418749.0, "step": 3380 }, { "entropy": 6.113630151748657, "epoch": 3.95906432748538, "grad_norm": 0.98828125, "learning_rate": 0.00039783192597394896, "loss": 6.037, "mean_token_accuracy": 0.17148204445838927, "num_tokens": 8430979.0, "step": 3385 }, { "entropy": 6.1933770179748535, "epoch": 3.9649122807017543, "grad_norm": 1.0078125, "learning_rate": 0.00039743893262232584, "loss": 5.9959, "mean_token_accuracy": 0.16409866660833358, "num_tokens": 8443256.0, "step": 3390 }, { "entropy": 6.145831298828125, "epoch": 3.9707602339181287, "grad_norm": 1.046875, "learning_rate": 0.0003970454078769551, "loss": 5.9922, "mean_token_accuracy": 0.16444988250732423, "num_tokens": 8454933.0, "step": 3395 }, { "entropy": 6.192234945297241, "epoch": 3.976608187134503, "grad_norm": 1.0, "learning_rate": 0.0003966513534457623, "loss": 6.0383, "mean_token_accuracy": 0.1717495933175087, "num_tokens": 8467517.0, "step": 3400 }, { "entropy": 6.0661486148834225, "epoch": 3.982456140350877, "grad_norm": 0.98046875, "learning_rate": 0.0003962567710389721, "loss": 6.0111, "mean_token_accuracy": 0.1670329064130783, "num_tokens": 8481084.0, "step": 3405 }, { "entropy": 6.217316913604736, "epoch": 3.9883040935672516, "grad_norm": 1.0703125, "learning_rate": 0.00039586166236910033, "loss": 6.0117, "mean_token_accuracy": 0.1652706429362297, "num_tokens": 8493236.0, "step": 3410 }, { "entropy": 6.004075002670288, "epoch": 3.9941520467836256, "grad_norm": 1.0546875, "learning_rate": 0.0003954660291509469, "loss": 5.8034, "mean_token_accuracy": 0.1852240741252899, "num_tokens": 8506152.0, "step": 3415 }, { "entropy": 6.148331594467163, "epoch": 4.0, "grad_norm": 1.21875, "learning_rate": 0.00039506987310158854, "loss": 5.9765, "mean_token_accuracy": 0.16524131447076798, "num_tokens": 8517936.0, "step": 3420 }, { "entropy": 6.208982992172241, "epoch": 4.005847953216374, "grad_norm": 1.0234375, "learning_rate": 0.00039467319594037076, "loss": 5.6229, "mean_token_accuracy": 0.1820027008652687, "num_tokens": 8530099.0, "step": 3425 }, { "entropy": 6.058341026306152, "epoch": 4.011695906432749, "grad_norm": 0.97265625, "learning_rate": 0.0003942759993889009, "loss": 5.6727, "mean_token_accuracy": 0.1847613424062729, "num_tokens": 8542145.0, "step": 3430 }, { "entropy": 6.1071876049041744, "epoch": 4.017543859649122, "grad_norm": 0.9921875, "learning_rate": 0.00039387828517104044, "loss": 5.713, "mean_token_accuracy": 0.1795678973197937, "num_tokens": 8553758.0, "step": 3435 }, { "entropy": 6.073211717605591, "epoch": 4.023391812865497, "grad_norm": 0.88671875, "learning_rate": 0.00039348005501289775, "loss": 5.6637, "mean_token_accuracy": 0.1778433293104172, "num_tokens": 8566215.0, "step": 3440 }, { "entropy": 6.1634174346923825, "epoch": 4.029239766081871, "grad_norm": 1.03125, "learning_rate": 0.00039308131064282016, "loss": 5.6641, "mean_token_accuracy": 0.1766158401966095, "num_tokens": 8578256.0, "step": 3445 }, { "entropy": 6.055958652496338, "epoch": 4.035087719298246, "grad_norm": 0.921875, "learning_rate": 0.0003926820537913868, "loss": 5.6126, "mean_token_accuracy": 0.18623143434524536, "num_tokens": 8591235.0, "step": 3450 }, { "entropy": 5.961992931365967, "epoch": 4.04093567251462, "grad_norm": 1.03125, "learning_rate": 0.0003922822861914012, "loss": 5.5232, "mean_token_accuracy": 0.18734114915132521, "num_tokens": 8603230.0, "step": 3455 }, { "entropy": 6.08734655380249, "epoch": 4.046783625730994, "grad_norm": 1.0234375, "learning_rate": 0.0003918820095778832, "loss": 5.6244, "mean_token_accuracy": 0.1852467656135559, "num_tokens": 8615114.0, "step": 3460 }, { "entropy": 5.97623496055603, "epoch": 4.052631578947368, "grad_norm": 0.87890625, "learning_rate": 0.00039148122568806215, "loss": 5.5808, "mean_token_accuracy": 0.19530852288007736, "num_tokens": 8627212.0, "step": 3465 }, { "entropy": 6.029066705703736, "epoch": 4.058479532163743, "grad_norm": 1.015625, "learning_rate": 0.0003910799362613688, "loss": 5.6803, "mean_token_accuracy": 0.17855599969625474, "num_tokens": 8639887.0, "step": 3470 }, { "entropy": 6.140685224533081, "epoch": 4.064327485380117, "grad_norm": 0.88671875, "learning_rate": 0.00039067814303942806, "loss": 5.7328, "mean_token_accuracy": 0.18161029368638992, "num_tokens": 8653097.0, "step": 3475 }, { "entropy": 6.050816392898559, "epoch": 4.0701754385964914, "grad_norm": 0.90625, "learning_rate": 0.00039027584776605136, "loss": 5.6436, "mean_token_accuracy": 0.1780172884464264, "num_tokens": 8666830.0, "step": 3480 }, { "entropy": 5.970085477828979, "epoch": 4.076023391812866, "grad_norm": 0.98828125, "learning_rate": 0.00038987305218722904, "loss": 5.5956, "mean_token_accuracy": 0.1876891404390335, "num_tokens": 8679725.0, "step": 3485 }, { "entropy": 6.093829774856568, "epoch": 4.081871345029239, "grad_norm": 1.015625, "learning_rate": 0.0003894697580511226, "loss": 5.7409, "mean_token_accuracy": 0.1759042337536812, "num_tokens": 8691280.0, "step": 3490 }, { "entropy": 6.0667116165161135, "epoch": 4.087719298245614, "grad_norm": 0.953125, "learning_rate": 0.0003890659671080579, "loss": 5.7308, "mean_token_accuracy": 0.17748655378818512, "num_tokens": 8702555.0, "step": 3495 }, { "entropy": 6.158699989318848, "epoch": 4.093567251461988, "grad_norm": 1.0078125, "learning_rate": 0.0003886616811105162, "loss": 5.7297, "mean_token_accuracy": 0.17546985894441605, "num_tokens": 8714693.0, "step": 3500 }, { "epoch": 4.093567251461988, "eval_entropy": 6.059477153429239, "eval_loss": 6.620388031005859, "eval_mean_token_accuracy": 0.14776903937040528, "eval_num_tokens": 8714693.0, "eval_runtime": 2.2886, "eval_samples_per_second": 1182.803, "eval_steps_per_second": 148.124, "step": 3500 } ], "logging_steps": 5, "max_steps": 8540, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.2610735299072e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }