{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.9885629040278467, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 8.055328845977783, "epoch": 0.004972650422675286, "grad_norm": 1.0859375, "learning_rate": 2e-06, "loss": 7.7699, "mean_token_accuracy": 0.09289914444088936, "num_tokens": 9089.0, "step": 5 }, { "entropy": 7.9934410572052, "epoch": 0.009945300845350571, "grad_norm": 1.03125, "learning_rate": 4.5e-06, "loss": 7.9292, "mean_token_accuracy": 0.0899883709847927, "num_tokens": 21650.0, "step": 10 }, { "entropy": 8.043873596191407, "epoch": 0.014917951268025857, "grad_norm": 1.40625, "learning_rate": 7e-06, "loss": 7.8569, "mean_token_accuracy": 0.0829312488436699, "num_tokens": 31067.0, "step": 15 }, { "entropy": 7.9948217391967775, "epoch": 0.019890601690701143, "grad_norm": 1.125, "learning_rate": 9.5e-06, "loss": 7.8229, "mean_token_accuracy": 0.08587435036897659, "num_tokens": 40816.0, "step": 20 }, { "entropy": 8.020876693725587, "epoch": 0.02486325211337643, "grad_norm": 1.125, "learning_rate": 1.2e-05, "loss": 7.8415, "mean_token_accuracy": 0.08777489773929119, "num_tokens": 51065.0, "step": 25 }, { "entropy": 8.016945314407348, "epoch": 0.029835902536051714, "grad_norm": 1.1171875, "learning_rate": 1.4500000000000002e-05, "loss": 7.8082, "mean_token_accuracy": 0.09032100439071655, "num_tokens": 60539.0, "step": 30 }, { "entropy": 8.016125869750976, "epoch": 0.034808552958727, "grad_norm": 0.97265625, "learning_rate": 1.7000000000000003e-05, "loss": 7.8391, "mean_token_accuracy": 0.08789670392870903, "num_tokens": 71010.0, "step": 35 }, { "entropy": 8.02649121284485, "epoch": 0.039781203381402286, "grad_norm": 0.98828125, "learning_rate": 1.95e-05, "loss": 7.9238, "mean_token_accuracy": 0.08401809930801392, "num_tokens": 81394.0, "step": 40 }, { "entropy": 8.087946605682372, "epoch": 0.04475385380407757, "grad_norm": 1.171875, "learning_rate": 2.2e-05, "loss": 7.9606, "mean_token_accuracy": 0.08528241962194442, "num_tokens": 92491.0, "step": 45 }, { "entropy": 8.078335189819336, "epoch": 0.04972650422675286, "grad_norm": 1.0390625, "learning_rate": 2.4500000000000003e-05, "loss": 7.788, "mean_token_accuracy": 0.09470873698592186, "num_tokens": 102113.0, "step": 50 }, { "entropy": 8.062228298187256, "epoch": 0.05469915464942814, "grad_norm": 1.8125, "learning_rate": 2.7e-05, "loss": 7.9462, "mean_token_accuracy": 0.08278393298387528, "num_tokens": 112211.0, "step": 55 }, { "entropy": 8.023606491088866, "epoch": 0.05967180507210343, "grad_norm": 0.953125, "learning_rate": 2.95e-05, "loss": 7.7747, "mean_token_accuracy": 0.0901342697441578, "num_tokens": 122166.0, "step": 60 }, { "entropy": 8.003111219406128, "epoch": 0.06464445549477872, "grad_norm": 1.015625, "learning_rate": 3.2e-05, "loss": 7.7581, "mean_token_accuracy": 0.09486681148409844, "num_tokens": 131016.0, "step": 65 }, { "entropy": 7.973823165893554, "epoch": 0.069617105917454, "grad_norm": 1.1015625, "learning_rate": 3.4500000000000005e-05, "loss": 7.8401, "mean_token_accuracy": 0.09549511298537254, "num_tokens": 141369.0, "step": 70 }, { "entropy": 8.026473474502563, "epoch": 0.07458975634012929, "grad_norm": 1.015625, "learning_rate": 3.7e-05, "loss": 7.7438, "mean_token_accuracy": 0.09063734859228134, "num_tokens": 150939.0, "step": 75 }, { "entropy": 8.038272190093995, "epoch": 0.07956240676280457, "grad_norm": 1.0546875, "learning_rate": 3.95e-05, "loss": 7.7447, "mean_token_accuracy": 0.09616999849677085, "num_tokens": 159981.0, "step": 80 }, { "entropy": 7.98382682800293, "epoch": 0.08453505718547986, "grad_norm": 1.03125, "learning_rate": 4.2000000000000004e-05, "loss": 7.7952, "mean_token_accuracy": 0.08998179510235786, "num_tokens": 170139.0, "step": 85 }, { "entropy": 8.070371198654176, "epoch": 0.08950770760815514, "grad_norm": 1.0625, "learning_rate": 4.45e-05, "loss": 7.7446, "mean_token_accuracy": 0.09454798772931099, "num_tokens": 180746.0, "step": 90 }, { "entropy": 8.05376615524292, "epoch": 0.09448035803083044, "grad_norm": 1.09375, "learning_rate": 4.7000000000000004e-05, "loss": 7.6953, "mean_token_accuracy": 0.09375635012984276, "num_tokens": 190250.0, "step": 95 }, { "entropy": 7.960572814941406, "epoch": 0.09945300845350571, "grad_norm": 1.0859375, "learning_rate": 4.9500000000000004e-05, "loss": 7.851, "mean_token_accuracy": 0.08996001482009888, "num_tokens": 201185.0, "step": 100 }, { "entropy": 8.003534412384033, "epoch": 0.10442565887618101, "grad_norm": 1.1171875, "learning_rate": 5.2e-05, "loss": 7.8286, "mean_token_accuracy": 0.08292106837034226, "num_tokens": 211476.0, "step": 105 }, { "entropy": 8.028951740264892, "epoch": 0.10939830929885629, "grad_norm": 1.09375, "learning_rate": 5.45e-05, "loss": 7.7808, "mean_token_accuracy": 0.08876777328550815, "num_tokens": 220965.0, "step": 110 }, { "entropy": 8.002874565124511, "epoch": 0.11437095972153158, "grad_norm": 0.984375, "learning_rate": 5.7e-05, "loss": 7.8037, "mean_token_accuracy": 0.08823544830083847, "num_tokens": 231539.0, "step": 115 }, { "entropy": 8.01924533843994, "epoch": 0.11934361014420686, "grad_norm": 1.1015625, "learning_rate": 5.9499999999999996e-05, "loss": 7.7812, "mean_token_accuracy": 0.08827254623174667, "num_tokens": 241206.0, "step": 120 }, { "entropy": 7.982138299942017, "epoch": 0.12431626056688215, "grad_norm": 1.0859375, "learning_rate": 6.2e-05, "loss": 7.7187, "mean_token_accuracy": 0.09137163013219833, "num_tokens": 250629.0, "step": 125 }, { "entropy": 8.054266786575317, "epoch": 0.12928891098955744, "grad_norm": 1.09375, "learning_rate": 6.450000000000001e-05, "loss": 7.8412, "mean_token_accuracy": 0.09213275685906411, "num_tokens": 260705.0, "step": 130 }, { "entropy": 8.1447190284729, "epoch": 0.13426156141223272, "grad_norm": 1.03125, "learning_rate": 6.7e-05, "loss": 7.7988, "mean_token_accuracy": 0.09144297614693642, "num_tokens": 270499.0, "step": 135 }, { "entropy": 8.07759428024292, "epoch": 0.139234211834908, "grad_norm": 1.2265625, "learning_rate": 6.950000000000001e-05, "loss": 7.8214, "mean_token_accuracy": 0.08136414065957069, "num_tokens": 279998.0, "step": 140 }, { "entropy": 7.998452997207641, "epoch": 0.14420686225758328, "grad_norm": 1.0859375, "learning_rate": 7.2e-05, "loss": 7.7959, "mean_token_accuracy": 0.09346884936094284, "num_tokens": 290322.0, "step": 145 }, { "entropy": 8.026957654953003, "epoch": 0.14917951268025859, "grad_norm": 1.046875, "learning_rate": 7.45e-05, "loss": 7.741, "mean_token_accuracy": 0.09033143669366836, "num_tokens": 299893.0, "step": 150 }, { "entropy": 7.940546894073487, "epoch": 0.15415216310293386, "grad_norm": 1.234375, "learning_rate": 7.7e-05, "loss": 7.7927, "mean_token_accuracy": 0.09222338274121285, "num_tokens": 309191.0, "step": 155 }, { "entropy": 8.115492153167725, "epoch": 0.15912481352560914, "grad_norm": 1.140625, "learning_rate": 7.950000000000001e-05, "loss": 7.7385, "mean_token_accuracy": 0.09139059036970139, "num_tokens": 318494.0, "step": 160 }, { "entropy": 7.960078859329224, "epoch": 0.16409746394828442, "grad_norm": 1.078125, "learning_rate": 8.2e-05, "loss": 7.7788, "mean_token_accuracy": 0.0923788644373417, "num_tokens": 328299.0, "step": 165 }, { "entropy": 8.144480419158935, "epoch": 0.16907011437095973, "grad_norm": 1.1328125, "learning_rate": 8.450000000000001e-05, "loss": 7.8496, "mean_token_accuracy": 0.08552220612764358, "num_tokens": 338878.0, "step": 170 }, { "entropy": 8.092591524124146, "epoch": 0.174042764793635, "grad_norm": 1.3046875, "learning_rate": 8.7e-05, "loss": 7.7971, "mean_token_accuracy": 0.08752194195985794, "num_tokens": 348508.0, "step": 175 }, { "entropy": 7.965788459777832, "epoch": 0.1790154152163103, "grad_norm": 1.125, "learning_rate": 8.95e-05, "loss": 7.7449, "mean_token_accuracy": 0.08802809938788414, "num_tokens": 358233.0, "step": 180 }, { "entropy": 8.010887241363525, "epoch": 0.1839880656389856, "grad_norm": 1.34375, "learning_rate": 9.2e-05, "loss": 7.7062, "mean_token_accuracy": 0.09302832186222076, "num_tokens": 367297.0, "step": 185 }, { "entropy": 8.047781038284302, "epoch": 0.18896071606166087, "grad_norm": 1.0546875, "learning_rate": 9.45e-05, "loss": 7.7319, "mean_token_accuracy": 0.08684638142585754, "num_tokens": 376880.0, "step": 190 }, { "entropy": 8.015840673446656, "epoch": 0.19393336648433615, "grad_norm": 1.0546875, "learning_rate": 9.7e-05, "loss": 7.7585, "mean_token_accuracy": 0.09129639342427254, "num_tokens": 386806.0, "step": 195 }, { "entropy": 7.969292211532593, "epoch": 0.19890601690701143, "grad_norm": 1.359375, "learning_rate": 9.95e-05, "loss": 7.7064, "mean_token_accuracy": 0.0939807079732418, "num_tokens": 396161.0, "step": 200 }, { "entropy": 8.018733930587768, "epoch": 0.20387866732968674, "grad_norm": 1.265625, "learning_rate": 0.000102, "loss": 7.7352, "mean_token_accuracy": 0.09067206978797912, "num_tokens": 405643.0, "step": 205 }, { "entropy": 8.042714643478394, "epoch": 0.20885131775236201, "grad_norm": 1.15625, "learning_rate": 0.00010449999999999999, "loss": 7.7571, "mean_token_accuracy": 0.09590560421347619, "num_tokens": 414367.0, "step": 210 }, { "entropy": 8.020010566711425, "epoch": 0.2138239681750373, "grad_norm": 1.15625, "learning_rate": 0.000107, "loss": 7.7188, "mean_token_accuracy": 0.09117217287421227, "num_tokens": 424430.0, "step": 215 }, { "entropy": 8.063075876235962, "epoch": 0.21879661859771257, "grad_norm": 1.1328125, "learning_rate": 0.0001095, "loss": 7.7448, "mean_token_accuracy": 0.09226949140429497, "num_tokens": 435176.0, "step": 220 }, { "entropy": 8.007707548141479, "epoch": 0.22376926902038788, "grad_norm": 1.1640625, "learning_rate": 0.000112, "loss": 7.8191, "mean_token_accuracy": 0.09036103039979934, "num_tokens": 445611.0, "step": 225 }, { "entropy": 8.024854516983032, "epoch": 0.22874191944306316, "grad_norm": 1.1796875, "learning_rate": 0.0001145, "loss": 7.732, "mean_token_accuracy": 0.09320453926920891, "num_tokens": 455143.0, "step": 230 }, { "entropy": 8.067090892791748, "epoch": 0.23371456986573844, "grad_norm": 1.6953125, "learning_rate": 0.00011700000000000001, "loss": 7.7643, "mean_token_accuracy": 0.09478386417031288, "num_tokens": 465507.0, "step": 235 }, { "entropy": 8.055903482437134, "epoch": 0.23868722028841372, "grad_norm": 1.0703125, "learning_rate": 0.00011949999999999999, "loss": 7.8112, "mean_token_accuracy": 0.08999223560094834, "num_tokens": 476152.0, "step": 240 }, { "entropy": 7.923675012588501, "epoch": 0.24365987071108902, "grad_norm": 1.0859375, "learning_rate": 0.000122, "loss": 7.6274, "mean_token_accuracy": 0.09889271780848503, "num_tokens": 486341.0, "step": 245 }, { "entropy": 7.941055393218994, "epoch": 0.2486325211337643, "grad_norm": 1.109375, "learning_rate": 0.0001245, "loss": 7.5837, "mean_token_accuracy": 0.09929879531264305, "num_tokens": 495915.0, "step": 250 }, { "entropy": 7.947218942642212, "epoch": 0.2536051715564396, "grad_norm": 1.1953125, "learning_rate": 0.000127, "loss": 7.7126, "mean_token_accuracy": 0.09258004277944565, "num_tokens": 505666.0, "step": 255 }, { "entropy": 7.92978081703186, "epoch": 0.2585778219791149, "grad_norm": 1.1484375, "learning_rate": 0.0001295, "loss": 7.5981, "mean_token_accuracy": 0.09562918171286583, "num_tokens": 515411.0, "step": 260 }, { "entropy": 7.961107540130615, "epoch": 0.26355047240179014, "grad_norm": 1.1796875, "learning_rate": 0.000132, "loss": 7.7116, "mean_token_accuracy": 0.09054910317063332, "num_tokens": 525018.0, "step": 265 }, { "entropy": 7.943254613876343, "epoch": 0.26852312282446544, "grad_norm": 1.1953125, "learning_rate": 0.00013450000000000002, "loss": 7.6326, "mean_token_accuracy": 0.09534763172268867, "num_tokens": 535056.0, "step": 270 }, { "entropy": 7.991715574264527, "epoch": 0.27349577324714075, "grad_norm": 1.1484375, "learning_rate": 0.00013700000000000002, "loss": 7.6291, "mean_token_accuracy": 0.09336584955453872, "num_tokens": 545115.0, "step": 275 }, { "entropy": 8.080969667434692, "epoch": 0.278468423669816, "grad_norm": 1.1953125, "learning_rate": 0.0001395, "loss": 7.6495, "mean_token_accuracy": 0.09909325316548348, "num_tokens": 554429.0, "step": 280 }, { "entropy": 7.849652528762817, "epoch": 0.2834410740924913, "grad_norm": 1.1953125, "learning_rate": 0.00014199999999999998, "loss": 7.5983, "mean_token_accuracy": 0.10442101955413818, "num_tokens": 563357.0, "step": 285 }, { "entropy": 7.9693444728851315, "epoch": 0.28841372451516656, "grad_norm": 1.140625, "learning_rate": 0.0001445, "loss": 7.6591, "mean_token_accuracy": 0.09824569448828697, "num_tokens": 574480.0, "step": 290 }, { "entropy": 7.956569957733154, "epoch": 0.29338637493784187, "grad_norm": 1.1484375, "learning_rate": 0.000147, "loss": 7.6345, "mean_token_accuracy": 0.0936326451599598, "num_tokens": 583722.0, "step": 295 }, { "entropy": 7.912858390808106, "epoch": 0.29835902536051717, "grad_norm": 1.0625, "learning_rate": 0.0001495, "loss": 7.5976, "mean_token_accuracy": 0.10199215114116669, "num_tokens": 593644.0, "step": 300 }, { "entropy": 7.891701698303223, "epoch": 0.3033316757831924, "grad_norm": 1.1796875, "learning_rate": 0.000152, "loss": 7.6595, "mean_token_accuracy": 0.09747006073594093, "num_tokens": 603547.0, "step": 305 }, { "entropy": 7.942541217803955, "epoch": 0.30830432620586773, "grad_norm": 1.1953125, "learning_rate": 0.00015450000000000001, "loss": 7.6749, "mean_token_accuracy": 0.09077658727765084, "num_tokens": 613880.0, "step": 310 }, { "entropy": 8.01622257232666, "epoch": 0.31327697662854304, "grad_norm": 1.5078125, "learning_rate": 0.000157, "loss": 7.6791, "mean_token_accuracy": 0.09485002011060714, "num_tokens": 624213.0, "step": 315 }, { "entropy": 7.940730810165405, "epoch": 0.3182496270512183, "grad_norm": 1.390625, "learning_rate": 0.0001595, "loss": 7.7188, "mean_token_accuracy": 0.09535183757543564, "num_tokens": 634350.0, "step": 320 }, { "entropy": 8.01810598373413, "epoch": 0.3232222774738936, "grad_norm": 1.296875, "learning_rate": 0.000162, "loss": 7.6764, "mean_token_accuracy": 0.09407038241624832, "num_tokens": 644040.0, "step": 325 }, { "entropy": 7.90651569366455, "epoch": 0.32819492789656884, "grad_norm": 1.1953125, "learning_rate": 0.00016450000000000001, "loss": 7.6464, "mean_token_accuracy": 0.09886646866798401, "num_tokens": 652915.0, "step": 330 }, { "entropy": 7.997863626480102, "epoch": 0.33316757831924415, "grad_norm": 1.2421875, "learning_rate": 0.00016700000000000002, "loss": 7.663, "mean_token_accuracy": 0.09337838441133499, "num_tokens": 662665.0, "step": 335 }, { "entropy": 7.880599927902222, "epoch": 0.33814022874191946, "grad_norm": 1.1015625, "learning_rate": 0.00016950000000000003, "loss": 7.6934, "mean_token_accuracy": 0.09364098682999611, "num_tokens": 671667.0, "step": 340 }, { "entropy": 8.07152271270752, "epoch": 0.3431128791645947, "grad_norm": 1.359375, "learning_rate": 0.00017199999999999998, "loss": 7.6974, "mean_token_accuracy": 0.08758332729339599, "num_tokens": 680432.0, "step": 345 }, { "entropy": 7.930040788650513, "epoch": 0.34808552958727, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 7.7059, "mean_token_accuracy": 0.09117975533008575, "num_tokens": 690184.0, "step": 350 }, { "entropy": 7.958481740951538, "epoch": 0.3530581800099453, "grad_norm": 1.265625, "learning_rate": 0.000177, "loss": 7.5809, "mean_token_accuracy": 0.09757120013237, "num_tokens": 699147.0, "step": 355 }, { "entropy": 7.778140354156494, "epoch": 0.3580308304326206, "grad_norm": 1.140625, "learning_rate": 0.0001795, "loss": 7.6241, "mean_token_accuracy": 0.09795154929161072, "num_tokens": 708696.0, "step": 360 }, { "entropy": 7.94059271812439, "epoch": 0.3630034808552959, "grad_norm": 1.171875, "learning_rate": 0.000182, "loss": 7.5868, "mean_token_accuracy": 0.09651872366666794, "num_tokens": 718438.0, "step": 365 }, { "entropy": 7.958788824081421, "epoch": 0.3679761312779712, "grad_norm": 1.265625, "learning_rate": 0.0001845, "loss": 7.7347, "mean_token_accuracy": 0.08726413100957871, "num_tokens": 728157.0, "step": 370 }, { "entropy": 7.920962810516357, "epoch": 0.37294878170064644, "grad_norm": 1.3671875, "learning_rate": 0.000187, "loss": 7.6345, "mean_token_accuracy": 0.09856286793947219, "num_tokens": 737007.0, "step": 375 }, { "entropy": 7.974191665649414, "epoch": 0.37792143212332174, "grad_norm": 1.3515625, "learning_rate": 0.0001895, "loss": 7.5487, "mean_token_accuracy": 0.1027902714908123, "num_tokens": 746873.0, "step": 380 }, { "entropy": 7.777252101898194, "epoch": 0.382894082545997, "grad_norm": 1.21875, "learning_rate": 0.000192, "loss": 7.4764, "mean_token_accuracy": 0.10671861693263054, "num_tokens": 755486.0, "step": 385 }, { "entropy": 7.895697546005249, "epoch": 0.3878667329686723, "grad_norm": 1.2578125, "learning_rate": 0.0001945, "loss": 7.6079, "mean_token_accuracy": 0.09227629154920577, "num_tokens": 765481.0, "step": 390 }, { "entropy": 7.837667560577392, "epoch": 0.3928393833913476, "grad_norm": 1.328125, "learning_rate": 0.00019700000000000002, "loss": 7.5488, "mean_token_accuracy": 0.09985539466142654, "num_tokens": 774335.0, "step": 395 }, { "entropy": 8.047065830230713, "epoch": 0.39781203381402286, "grad_norm": 1.375, "learning_rate": 0.00019950000000000002, "loss": 7.6338, "mean_token_accuracy": 0.09441028982400894, "num_tokens": 784307.0, "step": 400 }, { "entropy": 7.9048755168914795, "epoch": 0.40278468423669817, "grad_norm": 1.3359375, "learning_rate": 0.000202, "loss": 7.6761, "mean_token_accuracy": 0.09370537623763084, "num_tokens": 795058.0, "step": 405 }, { "entropy": 8.047796821594238, "epoch": 0.40775733465937347, "grad_norm": 1.8515625, "learning_rate": 0.00020449999999999998, "loss": 7.6291, "mean_token_accuracy": 0.09702575877308846, "num_tokens": 805687.0, "step": 410 }, { "entropy": 7.804214286804199, "epoch": 0.4127299850820487, "grad_norm": 1.2265625, "learning_rate": 0.000207, "loss": 7.6174, "mean_token_accuracy": 0.09554455727338791, "num_tokens": 815138.0, "step": 415 }, { "entropy": 7.951880931854248, "epoch": 0.41770263550472403, "grad_norm": 1.234375, "learning_rate": 0.0002095, "loss": 7.5742, "mean_token_accuracy": 0.09677162915468215, "num_tokens": 825009.0, "step": 420 }, { "entropy": 7.795875835418701, "epoch": 0.4226752859273993, "grad_norm": 1.2265625, "learning_rate": 0.000212, "loss": 7.5637, "mean_token_accuracy": 0.09957250207662582, "num_tokens": 834708.0, "step": 425 }, { "entropy": 7.925895738601684, "epoch": 0.4276479363500746, "grad_norm": 1.375, "learning_rate": 0.0002145, "loss": 7.6117, "mean_token_accuracy": 0.0967609629034996, "num_tokens": 843888.0, "step": 430 }, { "entropy": 7.853721952438354, "epoch": 0.4326205867727499, "grad_norm": 1.3515625, "learning_rate": 0.00021700000000000002, "loss": 7.6049, "mean_token_accuracy": 0.09610669240355492, "num_tokens": 853057.0, "step": 435 }, { "entropy": 7.923298740386963, "epoch": 0.43759323719542514, "grad_norm": 1.3046875, "learning_rate": 0.0002195, "loss": 7.6546, "mean_token_accuracy": 0.09225371703505517, "num_tokens": 862701.0, "step": 440 }, { "entropy": 7.815232610702514, "epoch": 0.44256588761810045, "grad_norm": 1.203125, "learning_rate": 0.000222, "loss": 7.549, "mean_token_accuracy": 0.10032494440674782, "num_tokens": 872129.0, "step": 445 }, { "entropy": 7.797481489181519, "epoch": 0.44753853804077576, "grad_norm": 1.15625, "learning_rate": 0.0002245, "loss": 7.5867, "mean_token_accuracy": 0.0956971988081932, "num_tokens": 883166.0, "step": 450 }, { "entropy": 7.8453751564025875, "epoch": 0.452511188463451, "grad_norm": 1.234375, "learning_rate": 0.00022700000000000002, "loss": 7.4193, "mean_token_accuracy": 0.10789886862039566, "num_tokens": 894159.0, "step": 455 }, { "entropy": 7.877769851684571, "epoch": 0.4574838388861263, "grad_norm": 1.1875, "learning_rate": 0.00022950000000000002, "loss": 7.5812, "mean_token_accuracy": 0.09706785902380943, "num_tokens": 904588.0, "step": 460 }, { "entropy": 7.8562257289886475, "epoch": 0.46245648930880157, "grad_norm": 1.3515625, "learning_rate": 0.00023200000000000003, "loss": 7.5406, "mean_token_accuracy": 0.09594281017780304, "num_tokens": 915554.0, "step": 465 }, { "entropy": 7.823633670806885, "epoch": 0.4674291397314769, "grad_norm": 1.234375, "learning_rate": 0.00023449999999999998, "loss": 7.593, "mean_token_accuracy": 0.09437503591179848, "num_tokens": 925546.0, "step": 470 }, { "entropy": 7.860237646102905, "epoch": 0.4724017901541522, "grad_norm": 1.3203125, "learning_rate": 0.000237, "loss": 7.5458, "mean_token_accuracy": 0.09933575987815857, "num_tokens": 936615.0, "step": 475 }, { "entropy": 7.841644430160523, "epoch": 0.47737444057682743, "grad_norm": 1.5234375, "learning_rate": 0.0002395, "loss": 7.5854, "mean_token_accuracy": 0.09283004775643348, "num_tokens": 947374.0, "step": 480 }, { "entropy": 7.803491544723511, "epoch": 0.48234709099950274, "grad_norm": 1.2265625, "learning_rate": 0.000242, "loss": 7.5083, "mean_token_accuracy": 0.09690938144922256, "num_tokens": 957772.0, "step": 485 }, { "entropy": 7.840833377838135, "epoch": 0.48731974142217804, "grad_norm": 1.2578125, "learning_rate": 0.0002445, "loss": 7.6166, "mean_token_accuracy": 0.09776200726628304, "num_tokens": 967724.0, "step": 490 }, { "entropy": 7.732542610168457, "epoch": 0.4922923918448533, "grad_norm": 1.3125, "learning_rate": 0.000247, "loss": 7.5253, "mean_token_accuracy": 0.0953903116285801, "num_tokens": 976497.0, "step": 495 }, { "entropy": 7.777756214141846, "epoch": 0.4972650422675286, "grad_norm": 1.3359375, "learning_rate": 0.0002495, "loss": 7.5113, "mean_token_accuracy": 0.09828274846076965, "num_tokens": 986207.0, "step": 500 }, { "epoch": 0.4972650422675286, "eval_entropy": 7.791762825530795, "eval_loss": 7.572336673736572, "eval_mean_token_accuracy": 0.09290712282559427, "eval_num_tokens": 986207.0, "eval_runtime": 10.6134, "eval_samples_per_second": 326.475, "eval_steps_per_second": 40.892, "step": 500 }, { "entropy": 7.700582551956177, "epoch": 0.5022376926902039, "grad_norm": 1.203125, "learning_rate": 0.000252, "loss": 7.4704, "mean_token_accuracy": 0.10335623621940612, "num_tokens": 995568.0, "step": 505 }, { "entropy": 7.818715000152588, "epoch": 0.5072103431128792, "grad_norm": 1.140625, "learning_rate": 0.0002545, "loss": 7.5242, "mean_token_accuracy": 0.09710540696978569, "num_tokens": 1005829.0, "step": 510 }, { "entropy": 7.748081254959106, "epoch": 0.5121829935355544, "grad_norm": 1.171875, "learning_rate": 0.000257, "loss": 7.4813, "mean_token_accuracy": 0.0990183673799038, "num_tokens": 1015290.0, "step": 515 }, { "entropy": 7.806796503067017, "epoch": 0.5171556439582298, "grad_norm": 1.3359375, "learning_rate": 0.0002595, "loss": 7.4393, "mean_token_accuracy": 0.10151970684528351, "num_tokens": 1024479.0, "step": 520 }, { "entropy": 7.689154100418091, "epoch": 0.522128294380905, "grad_norm": 1.6953125, "learning_rate": 0.000262, "loss": 7.3823, "mean_token_accuracy": 0.10462581366300583, "num_tokens": 1034092.0, "step": 525 }, { "entropy": 7.866795063018799, "epoch": 0.5271009448035803, "grad_norm": 1.1875, "learning_rate": 0.00026450000000000003, "loss": 7.5921, "mean_token_accuracy": 0.09865057915449142, "num_tokens": 1043844.0, "step": 530 }, { "entropy": 7.7049336433410645, "epoch": 0.5320735952262556, "grad_norm": 1.3515625, "learning_rate": 0.00026700000000000004, "loss": 7.438, "mean_token_accuracy": 0.09978735372424126, "num_tokens": 1052646.0, "step": 535 }, { "entropy": 7.812493181228637, "epoch": 0.5370462456489309, "grad_norm": 1.296875, "learning_rate": 0.00026950000000000005, "loss": 7.4984, "mean_token_accuracy": 0.10014364868402481, "num_tokens": 1062345.0, "step": 540 }, { "entropy": 7.697603464126587, "epoch": 0.5420188960716061, "grad_norm": 1.265625, "learning_rate": 0.00027200000000000005, "loss": 7.4877, "mean_token_accuracy": 0.10163192600011825, "num_tokens": 1071116.0, "step": 545 }, { "entropy": 7.705530023574829, "epoch": 0.5469915464942815, "grad_norm": 1.2734375, "learning_rate": 0.0002745, "loss": 7.4518, "mean_token_accuracy": 0.10024819299578666, "num_tokens": 1080562.0, "step": 550 }, { "entropy": 7.769873380661011, "epoch": 0.5519641969169568, "grad_norm": 1.078125, "learning_rate": 0.000277, "loss": 7.5085, "mean_token_accuracy": 0.09623854458332062, "num_tokens": 1091944.0, "step": 555 }, { "entropy": 7.738706064224243, "epoch": 0.556936847339632, "grad_norm": 1.265625, "learning_rate": 0.0002795, "loss": 7.428, "mean_token_accuracy": 0.09941570535302162, "num_tokens": 1101412.0, "step": 560 }, { "entropy": 7.751716041564942, "epoch": 0.5619094977623074, "grad_norm": 1.171875, "learning_rate": 0.00028199999999999997, "loss": 7.5273, "mean_token_accuracy": 0.09751861318945884, "num_tokens": 1110652.0, "step": 565 }, { "entropy": 7.731394052505493, "epoch": 0.5668821481849826, "grad_norm": 1.15625, "learning_rate": 0.0002845, "loss": 7.4286, "mean_token_accuracy": 0.10633731186389923, "num_tokens": 1120420.0, "step": 570 }, { "entropy": 7.672761011123657, "epoch": 0.5718547986076579, "grad_norm": 1.390625, "learning_rate": 0.000287, "loss": 7.4971, "mean_token_accuracy": 0.09915391579270363, "num_tokens": 1130046.0, "step": 575 }, { "entropy": 7.727224063873291, "epoch": 0.5768274490303331, "grad_norm": 1.484375, "learning_rate": 0.0002895, "loss": 7.4616, "mean_token_accuracy": 0.09992800429463386, "num_tokens": 1138946.0, "step": 580 }, { "entropy": 7.676466178894043, "epoch": 0.5818000994530085, "grad_norm": 1.4140625, "learning_rate": 0.000292, "loss": 7.2396, "mean_token_accuracy": 0.10890419781208038, "num_tokens": 1149440.0, "step": 585 }, { "entropy": 7.697867679595947, "epoch": 0.5867727498756837, "grad_norm": 1.2265625, "learning_rate": 0.0002945, "loss": 7.5005, "mean_token_accuracy": 0.09577652290463448, "num_tokens": 1158636.0, "step": 590 }, { "entropy": 7.611849689483643, "epoch": 0.591745400298359, "grad_norm": 1.28125, "learning_rate": 0.000297, "loss": 7.3645, "mean_token_accuracy": 0.10494528487324714, "num_tokens": 1167776.0, "step": 595 }, { "entropy": 7.796306943893432, "epoch": 0.5967180507210343, "grad_norm": 1.140625, "learning_rate": 0.0002995, "loss": 7.3803, "mean_token_accuracy": 0.10176268145442009, "num_tokens": 1177919.0, "step": 600 }, { "entropy": 7.503759813308716, "epoch": 0.6016907011437096, "grad_norm": 1.203125, "learning_rate": 0.000302, "loss": 7.4353, "mean_token_accuracy": 0.10978803336620331, "num_tokens": 1187363.0, "step": 605 }, { "entropy": 7.82352294921875, "epoch": 0.6066633515663848, "grad_norm": 1.3671875, "learning_rate": 0.0003045, "loss": 7.6222, "mean_token_accuracy": 0.0936784565448761, "num_tokens": 1197329.0, "step": 610 }, { "entropy": 7.739608573913574, "epoch": 0.6116360019890602, "grad_norm": 1.3046875, "learning_rate": 0.000307, "loss": 7.5092, "mean_token_accuracy": 0.10064340829849243, "num_tokens": 1207408.0, "step": 615 }, { "entropy": 7.672548484802246, "epoch": 0.6166086524117355, "grad_norm": 1.421875, "learning_rate": 0.0003095, "loss": 7.4761, "mean_token_accuracy": 0.09743527770042419, "num_tokens": 1219258.0, "step": 620 }, { "entropy": 7.729985666275025, "epoch": 0.6215813028344107, "grad_norm": 1.40625, "learning_rate": 0.000312, "loss": 7.4926, "mean_token_accuracy": 0.10201280266046524, "num_tokens": 1228561.0, "step": 625 }, { "entropy": 7.63199667930603, "epoch": 0.6265539532570861, "grad_norm": 1.078125, "learning_rate": 0.0003145, "loss": 7.4172, "mean_token_accuracy": 0.10181611031293869, "num_tokens": 1239665.0, "step": 630 }, { "entropy": 7.664997196197509, "epoch": 0.6315266036797613, "grad_norm": 1.125, "learning_rate": 0.000317, "loss": 7.4299, "mean_token_accuracy": 0.10080647617578506, "num_tokens": 1249490.0, "step": 635 }, { "entropy": 7.661840343475342, "epoch": 0.6364992541024366, "grad_norm": 1.1171875, "learning_rate": 0.0003195, "loss": 7.444, "mean_token_accuracy": 0.09851267859339714, "num_tokens": 1259328.0, "step": 640 }, { "entropy": 7.728383016586304, "epoch": 0.6414719045251119, "grad_norm": 1.21875, "learning_rate": 0.000322, "loss": 7.3382, "mean_token_accuracy": 0.10014413371682167, "num_tokens": 1269523.0, "step": 645 }, { "entropy": 7.566671514511109, "epoch": 0.6464445549477872, "grad_norm": 1.296875, "learning_rate": 0.00032450000000000003, "loss": 7.4814, "mean_token_accuracy": 0.09888403639197349, "num_tokens": 1277961.0, "step": 650 }, { "entropy": 7.71548638343811, "epoch": 0.6514172053704624, "grad_norm": 1.09375, "learning_rate": 0.00032700000000000003, "loss": 7.4241, "mean_token_accuracy": 0.10168351605534554, "num_tokens": 1288228.0, "step": 655 }, { "entropy": 7.617433977127075, "epoch": 0.6563898557931377, "grad_norm": 1.0546875, "learning_rate": 0.00032950000000000004, "loss": 7.3612, "mean_token_accuracy": 0.10187801942229271, "num_tokens": 1299636.0, "step": 660 }, { "entropy": 7.645993185043335, "epoch": 0.661362506215813, "grad_norm": 1.3515625, "learning_rate": 0.00033200000000000005, "loss": 7.4156, "mean_token_accuracy": 0.1010623887181282, "num_tokens": 1310035.0, "step": 665 }, { "entropy": 7.518844509124756, "epoch": 0.6663351566384883, "grad_norm": 1.09375, "learning_rate": 0.00033450000000000005, "loss": 7.4243, "mean_token_accuracy": 0.10684464648365974, "num_tokens": 1320751.0, "step": 670 }, { "entropy": 7.560531044006348, "epoch": 0.6713078070611636, "grad_norm": 1.921875, "learning_rate": 0.000337, "loss": 7.3123, "mean_token_accuracy": 0.1015079528093338, "num_tokens": 1331023.0, "step": 675 }, { "entropy": 7.549887800216675, "epoch": 0.6762804574838389, "grad_norm": 1.2578125, "learning_rate": 0.0003395, "loss": 7.4162, "mean_token_accuracy": 0.0934910848736763, "num_tokens": 1341814.0, "step": 680 }, { "entropy": 7.5861584663391115, "epoch": 0.6812531079065142, "grad_norm": 1.265625, "learning_rate": 0.000342, "loss": 7.3119, "mean_token_accuracy": 0.10053951293230057, "num_tokens": 1351026.0, "step": 685 }, { "entropy": 7.675773239135742, "epoch": 0.6862257583291894, "grad_norm": 1.2265625, "learning_rate": 0.00034449999999999997, "loss": 7.4987, "mean_token_accuracy": 0.09008960351347924, "num_tokens": 1361004.0, "step": 690 }, { "entropy": 7.494913244247437, "epoch": 0.6911984087518648, "grad_norm": 1.453125, "learning_rate": 0.000347, "loss": 7.3688, "mean_token_accuracy": 0.09771248623728752, "num_tokens": 1370729.0, "step": 695 }, { "entropy": 7.63529224395752, "epoch": 0.69617105917454, "grad_norm": 1.296875, "learning_rate": 0.0003495, "loss": 7.3343, "mean_token_accuracy": 0.10306410938501358, "num_tokens": 1379525.0, "step": 700 }, { "entropy": 7.504175186157227, "epoch": 0.7011437095972153, "grad_norm": 1.2890625, "learning_rate": 0.000352, "loss": 7.4201, "mean_token_accuracy": 0.09782344102859497, "num_tokens": 1389863.0, "step": 705 }, { "entropy": 7.53595929145813, "epoch": 0.7061163600198906, "grad_norm": 1.3984375, "learning_rate": 0.0003545, "loss": 7.5219, "mean_token_accuracy": 0.09682246819138526, "num_tokens": 1399468.0, "step": 710 }, { "entropy": 7.5885009765625, "epoch": 0.7110890104425659, "grad_norm": 1.140625, "learning_rate": 0.000357, "loss": 7.3137, "mean_token_accuracy": 0.1067239873111248, "num_tokens": 1408785.0, "step": 715 }, { "entropy": 7.479005336761475, "epoch": 0.7160616608652411, "grad_norm": 1.25, "learning_rate": 0.0003595, "loss": 7.3641, "mean_token_accuracy": 0.106873170286417, "num_tokens": 1418666.0, "step": 720 }, { "entropy": 7.666646814346313, "epoch": 0.7210343112879165, "grad_norm": 1.2734375, "learning_rate": 0.000362, "loss": 7.456, "mean_token_accuracy": 0.10155233442783355, "num_tokens": 1428699.0, "step": 725 }, { "entropy": 7.585138511657715, "epoch": 0.7260069617105918, "grad_norm": 1.3359375, "learning_rate": 0.0003645, "loss": 7.3622, "mean_token_accuracy": 0.1017698161303997, "num_tokens": 1437354.0, "step": 730 }, { "entropy": 7.572378015518188, "epoch": 0.730979612133267, "grad_norm": 1.2578125, "learning_rate": 0.000367, "loss": 7.3688, "mean_token_accuracy": 0.1023016132414341, "num_tokens": 1447327.0, "step": 735 }, { "entropy": 7.603588342666626, "epoch": 0.7359522625559424, "grad_norm": 1.140625, "learning_rate": 0.0003695, "loss": 7.4419, "mean_token_accuracy": 0.103351029753685, "num_tokens": 1457793.0, "step": 740 }, { "entropy": 7.511776924133301, "epoch": 0.7409249129786176, "grad_norm": 1.1328125, "learning_rate": 0.000372, "loss": 7.3378, "mean_token_accuracy": 0.10458240360021591, "num_tokens": 1467143.0, "step": 745 }, { "entropy": 7.545070505142212, "epoch": 0.7458975634012929, "grad_norm": 1.3515625, "learning_rate": 0.0003745, "loss": 7.4118, "mean_token_accuracy": 0.1036214292049408, "num_tokens": 1476422.0, "step": 750 }, { "entropy": 7.486561870574951, "epoch": 0.7508702138239681, "grad_norm": 1.3046875, "learning_rate": 0.000377, "loss": 7.3393, "mean_token_accuracy": 0.10872172713279724, "num_tokens": 1486253.0, "step": 755 }, { "entropy": 7.460987997055054, "epoch": 0.7558428642466435, "grad_norm": 1.2578125, "learning_rate": 0.0003795, "loss": 7.3504, "mean_token_accuracy": 0.10164174363017082, "num_tokens": 1496080.0, "step": 760 }, { "entropy": 7.541303873062134, "epoch": 0.7608155146693187, "grad_norm": 1.1875, "learning_rate": 0.000382, "loss": 7.2914, "mean_token_accuracy": 0.10655068382620811, "num_tokens": 1505532.0, "step": 765 }, { "entropy": 7.487213468551635, "epoch": 0.765788165091994, "grad_norm": 1.1015625, "learning_rate": 0.0003845, "loss": 7.2302, "mean_token_accuracy": 0.10376732945442199, "num_tokens": 1515705.0, "step": 770 }, { "entropy": 7.382348251342774, "epoch": 0.7707608155146694, "grad_norm": 1.140625, "learning_rate": 0.00038700000000000003, "loss": 7.3104, "mean_token_accuracy": 0.10365234911441804, "num_tokens": 1525651.0, "step": 775 }, { "entropy": 7.496106147766113, "epoch": 0.7757334659373446, "grad_norm": 1.34375, "learning_rate": 0.00038950000000000003, "loss": 7.2997, "mean_token_accuracy": 0.10095278844237328, "num_tokens": 1534576.0, "step": 780 }, { "entropy": 7.319676780700684, "epoch": 0.7807061163600199, "grad_norm": 3.75, "learning_rate": 0.00039200000000000004, "loss": 7.1693, "mean_token_accuracy": 0.1153423972427845, "num_tokens": 1544765.0, "step": 785 }, { "entropy": 7.5089842796325685, "epoch": 0.7856787667826952, "grad_norm": 1.234375, "learning_rate": 0.00039450000000000005, "loss": 7.2884, "mean_token_accuracy": 0.11112908571958542, "num_tokens": 1553636.0, "step": 790 }, { "entropy": 7.429884243011474, "epoch": 0.7906514172053705, "grad_norm": 1.1171875, "learning_rate": 0.00039700000000000005, "loss": 7.2552, "mean_token_accuracy": 0.10479394719004631, "num_tokens": 1563356.0, "step": 795 }, { "entropy": 7.357166290283203, "epoch": 0.7956240676280457, "grad_norm": 1.109375, "learning_rate": 0.0003995, "loss": 7.2638, "mean_token_accuracy": 0.10951004400849343, "num_tokens": 1572508.0, "step": 800 }, { "entropy": 7.495957851409912, "epoch": 0.8005967180507211, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 7.3002, "mean_token_accuracy": 0.10887534394860268, "num_tokens": 1581583.0, "step": 805 }, { "entropy": 7.4536933422088625, "epoch": 0.8055693684733963, "grad_norm": 1.2421875, "learning_rate": 0.0004045, "loss": 7.3065, "mean_token_accuracy": 0.10426458492875099, "num_tokens": 1592114.0, "step": 810 }, { "entropy": 7.473225355148315, "epoch": 0.8105420188960716, "grad_norm": 1.171875, "learning_rate": 0.00040699999999999997, "loss": 7.2075, "mean_token_accuracy": 0.10634186267852783, "num_tokens": 1602417.0, "step": 815 }, { "entropy": 7.363744163513184, "epoch": 0.8155146693187469, "grad_norm": 1.4765625, "learning_rate": 0.0004095, "loss": 7.3076, "mean_token_accuracy": 0.10592522397637368, "num_tokens": 1611753.0, "step": 820 }, { "entropy": 7.4581629753112795, "epoch": 0.8204873197414222, "grad_norm": 1.1484375, "learning_rate": 0.000412, "loss": 7.3749, "mean_token_accuracy": 0.10747737661004067, "num_tokens": 1621959.0, "step": 825 }, { "entropy": 7.386861944198609, "epoch": 0.8254599701640974, "grad_norm": 1.203125, "learning_rate": 0.0004145, "loss": 7.2712, "mean_token_accuracy": 0.10451980754733085, "num_tokens": 1630909.0, "step": 830 }, { "entropy": 7.430747222900391, "epoch": 0.8304326205867727, "grad_norm": 1.078125, "learning_rate": 0.000417, "loss": 7.231, "mean_token_accuracy": 0.10984086617827415, "num_tokens": 1641316.0, "step": 835 }, { "entropy": 7.31324348449707, "epoch": 0.8354052710094481, "grad_norm": 1.2890625, "learning_rate": 0.0004195, "loss": 7.162, "mean_token_accuracy": 0.11068534851074219, "num_tokens": 1651506.0, "step": 840 }, { "entropy": 7.327385950088501, "epoch": 0.8403779214321233, "grad_norm": 1.3359375, "learning_rate": 0.000422, "loss": 7.1863, "mean_token_accuracy": 0.1077701598405838, "num_tokens": 1659871.0, "step": 845 }, { "entropy": 7.48043303489685, "epoch": 0.8453505718547986, "grad_norm": 1.2890625, "learning_rate": 0.0004245, "loss": 7.3945, "mean_token_accuracy": 0.1023897610604763, "num_tokens": 1670178.0, "step": 850 }, { "entropy": 7.385392951965332, "epoch": 0.8503232222774739, "grad_norm": 1.203125, "learning_rate": 0.000427, "loss": 7.2603, "mean_token_accuracy": 0.10792220383882523, "num_tokens": 1680131.0, "step": 855 }, { "entropy": 7.27159686088562, "epoch": 0.8552958727001492, "grad_norm": 1.2421875, "learning_rate": 0.0004295, "loss": 7.1722, "mean_token_accuracy": 0.10633963197469712, "num_tokens": 1689568.0, "step": 860 }, { "entropy": 7.463675117492675, "epoch": 0.8602685231228244, "grad_norm": 1.203125, "learning_rate": 0.000432, "loss": 7.2091, "mean_token_accuracy": 0.11588807627558709, "num_tokens": 1698039.0, "step": 865 }, { "entropy": 7.324467611312866, "epoch": 0.8652411735454998, "grad_norm": 1.2109375, "learning_rate": 0.0004345, "loss": 7.2559, "mean_token_accuracy": 0.11219154074788093, "num_tokens": 1707659.0, "step": 870 }, { "entropy": 7.355623626708985, "epoch": 0.870213823968175, "grad_norm": 1.1640625, "learning_rate": 0.000437, "loss": 7.1977, "mean_token_accuracy": 0.1129053220152855, "num_tokens": 1716952.0, "step": 875 }, { "entropy": 7.395571517944336, "epoch": 0.8751864743908503, "grad_norm": 1.359375, "learning_rate": 0.0004395, "loss": 7.2837, "mean_token_accuracy": 0.10170883014798164, "num_tokens": 1726323.0, "step": 880 }, { "entropy": 7.420442390441894, "epoch": 0.8801591248135257, "grad_norm": 1.0859375, "learning_rate": 0.000442, "loss": 7.2683, "mean_token_accuracy": 0.10080605000257492, "num_tokens": 1736265.0, "step": 885 }, { "entropy": 7.318033504486084, "epoch": 0.8851317752362009, "grad_norm": 1.15625, "learning_rate": 0.0004445, "loss": 7.2224, "mean_token_accuracy": 0.1113182045519352, "num_tokens": 1745150.0, "step": 890 }, { "entropy": 7.413629579544067, "epoch": 0.8901044256588762, "grad_norm": 1.0625, "learning_rate": 0.000447, "loss": 7.3464, "mean_token_accuracy": 0.103422349691391, "num_tokens": 1754641.0, "step": 895 }, { "entropy": 7.228156900405883, "epoch": 0.8950770760815515, "grad_norm": 1.15625, "learning_rate": 0.00044950000000000003, "loss": 7.1335, "mean_token_accuracy": 0.11196400448679925, "num_tokens": 1763468.0, "step": 900 }, { "entropy": 7.363440370559692, "epoch": 0.9000497265042268, "grad_norm": 1.0234375, "learning_rate": 0.00045200000000000004, "loss": 7.2689, "mean_token_accuracy": 0.1072551429271698, "num_tokens": 1774845.0, "step": 905 }, { "entropy": 7.326597213745117, "epoch": 0.905022376926902, "grad_norm": 1.0703125, "learning_rate": 0.00045450000000000004, "loss": 7.2023, "mean_token_accuracy": 0.10989816784858704, "num_tokens": 1784606.0, "step": 910 }, { "entropy": 7.279292297363281, "epoch": 0.9099950273495774, "grad_norm": 1.140625, "learning_rate": 0.00045700000000000005, "loss": 7.2172, "mean_token_accuracy": 0.11103402152657509, "num_tokens": 1793893.0, "step": 915 }, { "entropy": 7.359324836730957, "epoch": 0.9149676777722526, "grad_norm": 1.109375, "learning_rate": 0.00045950000000000006, "loss": 7.2327, "mean_token_accuracy": 0.11132587045431137, "num_tokens": 1804095.0, "step": 920 }, { "entropy": 7.383117151260376, "epoch": 0.9199403281949279, "grad_norm": 1.2109375, "learning_rate": 0.000462, "loss": 7.2325, "mean_token_accuracy": 0.11229527816176414, "num_tokens": 1813475.0, "step": 925 }, { "entropy": 7.1859687805175785, "epoch": 0.9249129786176031, "grad_norm": 1.1171875, "learning_rate": 0.0004645, "loss": 7.1476, "mean_token_accuracy": 0.11770151481032372, "num_tokens": 1822779.0, "step": 930 }, { "entropy": 7.370684814453125, "epoch": 0.9298856290402785, "grad_norm": 1.34375, "learning_rate": 0.000467, "loss": 7.1676, "mean_token_accuracy": 0.1098080925643444, "num_tokens": 1832239.0, "step": 935 }, { "entropy": 7.159108829498291, "epoch": 0.9348582794629537, "grad_norm": 1.5546875, "learning_rate": 0.0004695, "loss": 7.1597, "mean_token_accuracy": 0.10881416276097297, "num_tokens": 1843395.0, "step": 940 }, { "entropy": 7.331651067733764, "epoch": 0.939830929885629, "grad_norm": 1.1484375, "learning_rate": 0.000472, "loss": 7.2928, "mean_token_accuracy": 0.10963825955986976, "num_tokens": 1853861.0, "step": 945 }, { "entropy": 7.316252088546753, "epoch": 0.9448035803083044, "grad_norm": 1.203125, "learning_rate": 0.0004745, "loss": 7.1811, "mean_token_accuracy": 0.11016927137970925, "num_tokens": 1862992.0, "step": 950 }, { "entropy": 7.308121156692505, "epoch": 0.9497762307309796, "grad_norm": 1.0703125, "learning_rate": 0.000477, "loss": 7.2191, "mean_token_accuracy": 0.10547153875231743, "num_tokens": 1871684.0, "step": 955 }, { "entropy": 7.327257347106934, "epoch": 0.9547488811536549, "grad_norm": 1.171875, "learning_rate": 0.0004795, "loss": 7.2388, "mean_token_accuracy": 0.10471320077776909, "num_tokens": 1881956.0, "step": 960 }, { "entropy": 7.2531952381134035, "epoch": 0.9597215315763302, "grad_norm": 1.15625, "learning_rate": 0.000482, "loss": 7.3038, "mean_token_accuracy": 0.1041056789457798, "num_tokens": 1891860.0, "step": 965 }, { "entropy": 7.325952672958374, "epoch": 0.9646941819990055, "grad_norm": 1.125, "learning_rate": 0.0004845, "loss": 7.198, "mean_token_accuracy": 0.11258542090654373, "num_tokens": 1901521.0, "step": 970 }, { "entropy": 7.231018781661987, "epoch": 0.9696668324216807, "grad_norm": 1.2890625, "learning_rate": 0.000487, "loss": 7.1664, "mean_token_accuracy": 0.11102576702833175, "num_tokens": 1910438.0, "step": 975 }, { "entropy": 7.181985664367676, "epoch": 0.9746394828443561, "grad_norm": 1.140625, "learning_rate": 0.0004895, "loss": 7.204, "mean_token_accuracy": 0.11018524467945098, "num_tokens": 1922045.0, "step": 980 }, { "entropy": 7.2546672344207765, "epoch": 0.9796121332670313, "grad_norm": 1.2734375, "learning_rate": 0.000492, "loss": 7.0342, "mean_token_accuracy": 0.12166386395692826, "num_tokens": 1930330.0, "step": 985 }, { "entropy": 7.023459434509277, "epoch": 0.9845847836897066, "grad_norm": 1.1484375, "learning_rate": 0.0004945, "loss": 7.0554, "mean_token_accuracy": 0.11036473363637925, "num_tokens": 1939485.0, "step": 990 }, { "entropy": 7.2998260974884035, "epoch": 0.989557434112382, "grad_norm": 1.0859375, "learning_rate": 0.000497, "loss": 7.1335, "mean_token_accuracy": 0.10684073865413665, "num_tokens": 1949448.0, "step": 995 }, { "entropy": 7.224824094772339, "epoch": 0.9945300845350572, "grad_norm": 0.984375, "learning_rate": 0.0004995, "loss": 7.2343, "mean_token_accuracy": 0.10612170770764351, "num_tokens": 1959923.0, "step": 1000 }, { "epoch": 0.9945300845350572, "eval_entropy": 7.155893044537663, "eval_loss": 7.266453742980957, "eval_mean_token_accuracy": 0.10303841252309111, "eval_num_tokens": 1959923.0, "eval_runtime": 17.9035, "eval_samples_per_second": 193.537, "eval_steps_per_second": 24.241, "step": 1000 }, { "entropy": 7.241476678848267, "epoch": 0.9995027349577325, "grad_norm": 1.2890625, "learning_rate": 0.0004999997830922735, "loss": 7.1783, "mean_token_accuracy": 0.11285145059227944, "num_tokens": 1969105.0, "step": 1005 }, { "entropy": 7.1709286901685925, "epoch": 1.0039781203381402, "grad_norm": 0.90234375, "learning_rate": 0.0004999989019053515, "loss": 6.9728, "mean_token_accuracy": 0.11111065910922156, "num_tokens": 1979124.0, "step": 1010 }, { "entropy": 7.242545461654663, "epoch": 1.0089507707608154, "grad_norm": 1.2265625, "learning_rate": 0.0004999973428851536, "loss": 6.9845, "mean_token_accuracy": 0.11652704775333404, "num_tokens": 1987813.0, "step": 1015 }, { "entropy": 7.173238372802734, "epoch": 1.0139234211834909, "grad_norm": 1.1875, "learning_rate": 0.0004999951060363766, "loss": 6.9709, "mean_token_accuracy": 0.10800814852118493, "num_tokens": 1996743.0, "step": 1020 }, { "entropy": 7.169902324676514, "epoch": 1.0188960716061661, "grad_norm": 1.1484375, "learning_rate": 0.0004999921913657592, "loss": 6.9781, "mean_token_accuracy": 0.11889770552515984, "num_tokens": 2006499.0, "step": 1025 }, { "entropy": 7.142313623428345, "epoch": 1.0238687220288414, "grad_norm": 1.3359375, "learning_rate": 0.0004999885988820821, "loss": 6.938, "mean_token_accuracy": 0.11886951848864555, "num_tokens": 2015103.0, "step": 1030 }, { "entropy": 7.117598581314087, "epoch": 1.0288413724515166, "grad_norm": 1.09375, "learning_rate": 0.0004999843285961683, "loss": 6.8916, "mean_token_accuracy": 0.11825998350977898, "num_tokens": 2024681.0, "step": 1035 }, { "entropy": 7.157252025604248, "epoch": 1.0338140228741919, "grad_norm": 1.1171875, "learning_rate": 0.0004999793805208822, "loss": 6.9673, "mean_token_accuracy": 0.10880548655986785, "num_tokens": 2034388.0, "step": 1040 }, { "entropy": 7.067089462280274, "epoch": 1.0387866732968671, "grad_norm": 1.1640625, "learning_rate": 0.0004999737546711305, "loss": 6.8928, "mean_token_accuracy": 0.11720709502696991, "num_tokens": 2042729.0, "step": 1045 }, { "entropy": 7.257500410079956, "epoch": 1.0437593237195426, "grad_norm": 1.15625, "learning_rate": 0.0004999674510638618, "loss": 7.0073, "mean_token_accuracy": 0.10822945088148117, "num_tokens": 2051669.0, "step": 1050 }, { "entropy": 7.103691864013672, "epoch": 1.0487319741422179, "grad_norm": 1.1171875, "learning_rate": 0.0004999604697180661, "loss": 6.9321, "mean_token_accuracy": 0.11978971287608146, "num_tokens": 2061002.0, "step": 1055 }, { "entropy": 7.070641994476318, "epoch": 1.053704624564893, "grad_norm": 1.1796875, "learning_rate": 0.0004999528106547759, "loss": 6.8387, "mean_token_accuracy": 0.12227742224931717, "num_tokens": 2070222.0, "step": 1060 }, { "entropy": 7.130647850036621, "epoch": 1.0586772749875684, "grad_norm": 1.140625, "learning_rate": 0.0004999444738970644, "loss": 7.0321, "mean_token_accuracy": 0.11664234772324562, "num_tokens": 2079683.0, "step": 1065 }, { "entropy": 7.198758506774903, "epoch": 1.0636499254102436, "grad_norm": 1.046875, "learning_rate": 0.0004999354594700474, "loss": 7.01, "mean_token_accuracy": 0.11501247957348823, "num_tokens": 2089659.0, "step": 1070 }, { "entropy": 7.092316198348999, "epoch": 1.0686225758329189, "grad_norm": 1.1640625, "learning_rate": 0.0004999257674008817, "loss": 6.972, "mean_token_accuracy": 0.11740045994520187, "num_tokens": 2099766.0, "step": 1075 }, { "entropy": 7.127299070358276, "epoch": 1.0735952262555943, "grad_norm": 1.1796875, "learning_rate": 0.0004999153977187656, "loss": 7.0844, "mean_token_accuracy": 0.10562424808740616, "num_tokens": 2110244.0, "step": 1080 }, { "entropy": 7.178738021850586, "epoch": 1.0785678766782696, "grad_norm": 1.6015625, "learning_rate": 0.000499904350454939, "loss": 6.995, "mean_token_accuracy": 0.11412457302212715, "num_tokens": 2120068.0, "step": 1085 }, { "entropy": 7.041600370407105, "epoch": 1.0835405271009448, "grad_norm": 1.1640625, "learning_rate": 0.0004998926256426829, "loss": 6.9809, "mean_token_accuracy": 0.11297853365540504, "num_tokens": 2128862.0, "step": 1090 }, { "entropy": 7.311644601821899, "epoch": 1.08851317752362, "grad_norm": 1.0625, "learning_rate": 0.0004998802233173196, "loss": 6.9714, "mean_token_accuracy": 0.10598357245326043, "num_tokens": 2140618.0, "step": 1095 }, { "entropy": 7.031351327896118, "epoch": 1.0934858279462953, "grad_norm": 1.0, "learning_rate": 0.0004998671435162123, "loss": 6.9358, "mean_token_accuracy": 0.11448398232460022, "num_tokens": 2151890.0, "step": 1100 }, { "entropy": 7.107405376434326, "epoch": 1.0984584783689706, "grad_norm": 1.15625, "learning_rate": 0.0004998533862787657, "loss": 6.9429, "mean_token_accuracy": 0.12040551453828811, "num_tokens": 2160862.0, "step": 1105 }, { "entropy": 7.082157278060913, "epoch": 1.1034311287916458, "grad_norm": 1.1015625, "learning_rate": 0.0004998389516464244, "loss": 6.972, "mean_token_accuracy": 0.1206208162009716, "num_tokens": 2171631.0, "step": 1110 }, { "entropy": 7.101116418838501, "epoch": 1.1084037792143213, "grad_norm": 1.2109375, "learning_rate": 0.0004998238396626746, "loss": 6.9039, "mean_token_accuracy": 0.11683834940195084, "num_tokens": 2181564.0, "step": 1115 }, { "entropy": 7.0888330936431885, "epoch": 1.1133764296369966, "grad_norm": 1.0703125, "learning_rate": 0.0004998080503730427, "loss": 6.9483, "mean_token_accuracy": 0.1219956248998642, "num_tokens": 2191288.0, "step": 1120 }, { "entropy": 7.077724838256836, "epoch": 1.1183490800596718, "grad_norm": 1.125, "learning_rate": 0.0004997915838250956, "loss": 6.9091, "mean_token_accuracy": 0.11639309674501419, "num_tokens": 2201254.0, "step": 1125 }, { "entropy": 7.03474612236023, "epoch": 1.123321730482347, "grad_norm": 1.1015625, "learning_rate": 0.0004997744400684406, "loss": 6.8604, "mean_token_accuracy": 0.12253397256135941, "num_tokens": 2210325.0, "step": 1130 }, { "entropy": 7.013818979263306, "epoch": 1.1282943809050223, "grad_norm": 1.1640625, "learning_rate": 0.0004997566191547251, "loss": 6.9783, "mean_token_accuracy": 0.11415349319577217, "num_tokens": 2220357.0, "step": 1135 }, { "entropy": 7.125763177871704, "epoch": 1.1332670313276976, "grad_norm": 1.171875, "learning_rate": 0.0004997381211376364, "loss": 6.9136, "mean_token_accuracy": 0.12185454815626144, "num_tokens": 2229208.0, "step": 1140 }, { "entropy": 6.976495838165283, "epoch": 1.138239681750373, "grad_norm": 1.0546875, "learning_rate": 0.0004997189460729019, "loss": 6.9066, "mean_token_accuracy": 0.1208449885249138, "num_tokens": 2238780.0, "step": 1145 }, { "entropy": 7.023766660690308, "epoch": 1.1432123321730483, "grad_norm": 1.1015625, "learning_rate": 0.0004996990940182884, "loss": 6.9321, "mean_token_accuracy": 0.11635106280446053, "num_tokens": 2249457.0, "step": 1150 }, { "entropy": 7.03515591621399, "epoch": 1.1481849825957235, "grad_norm": 1.0703125, "learning_rate": 0.0004996785650336024, "loss": 6.9243, "mean_token_accuracy": 0.12004116848111153, "num_tokens": 2259565.0, "step": 1155 }, { "entropy": 7.0158350467681885, "epoch": 1.1531576330183988, "grad_norm": 1.2265625, "learning_rate": 0.0004996573591806898, "loss": 6.8362, "mean_token_accuracy": 0.1266941860318184, "num_tokens": 2268301.0, "step": 1160 }, { "entropy": 7.0392069816589355, "epoch": 1.158130283441074, "grad_norm": 1.15625, "learning_rate": 0.0004996354765234353, "loss": 6.9599, "mean_token_accuracy": 0.12106132805347443, "num_tokens": 2278298.0, "step": 1165 }, { "entropy": 6.984105157852173, "epoch": 1.1631029338637493, "grad_norm": 1.0625, "learning_rate": 0.0004996129171277628, "loss": 6.9147, "mean_token_accuracy": 0.11764297261834145, "num_tokens": 2288442.0, "step": 1170 }, { "entropy": 7.064280462265015, "epoch": 1.1680755842864246, "grad_norm": 1.1875, "learning_rate": 0.0004995896810616349, "loss": 6.8592, "mean_token_accuracy": 0.11508701145648956, "num_tokens": 2298785.0, "step": 1175 }, { "entropy": 7.0413929462432865, "epoch": 1.1730482347091, "grad_norm": 1.015625, "learning_rate": 0.0004995657683950528, "loss": 6.9754, "mean_token_accuracy": 0.11580611690878868, "num_tokens": 2308881.0, "step": 1180 }, { "entropy": 6.988332509994507, "epoch": 1.1780208851317753, "grad_norm": 1.078125, "learning_rate": 0.0004995411792000559, "loss": 6.8893, "mean_token_accuracy": 0.12281140014529228, "num_tokens": 2318447.0, "step": 1185 }, { "entropy": 7.054516458511353, "epoch": 1.1829935355544505, "grad_norm": 1.2265625, "learning_rate": 0.0004995159135507218, "loss": 6.8734, "mean_token_accuracy": 0.1290799207985401, "num_tokens": 2327162.0, "step": 1190 }, { "entropy": 7.068665790557861, "epoch": 1.1879661859771258, "grad_norm": 1.1640625, "learning_rate": 0.000499489971523166, "loss": 6.9212, "mean_token_accuracy": 0.11114579290151597, "num_tokens": 2337207.0, "step": 1195 }, { "entropy": 6.90760908126831, "epoch": 1.192938836399801, "grad_norm": 0.984375, "learning_rate": 0.0004994633531955415, "loss": 6.915, "mean_token_accuracy": 0.1156627170741558, "num_tokens": 2347381.0, "step": 1200 }, { "entropy": 7.137280416488648, "epoch": 1.1979114868224765, "grad_norm": 1.0, "learning_rate": 0.0004994360586480391, "loss": 6.9566, "mean_token_accuracy": 0.11516986638307572, "num_tokens": 2357942.0, "step": 1205 }, { "entropy": 6.938902187347412, "epoch": 1.2028841372451518, "grad_norm": 1.2109375, "learning_rate": 0.0004994080879628864, "loss": 6.8771, "mean_token_accuracy": 0.12062501758337021, "num_tokens": 2367242.0, "step": 1210 }, { "entropy": 7.070527029037476, "epoch": 1.207856787667827, "grad_norm": 1.1953125, "learning_rate": 0.0004993794412243481, "loss": 6.9193, "mean_token_accuracy": 0.1242191381752491, "num_tokens": 2376344.0, "step": 1215 }, { "entropy": 6.961205291748047, "epoch": 1.2128294380905023, "grad_norm": 0.9765625, "learning_rate": 0.0004993501185187255, "loss": 6.9481, "mean_token_accuracy": 0.12189279198646545, "num_tokens": 2387206.0, "step": 1220 }, { "entropy": 7.075365877151489, "epoch": 1.2178020885131775, "grad_norm": 1.1015625, "learning_rate": 0.0004993201199343565, "loss": 6.9677, "mean_token_accuracy": 0.11550175845623016, "num_tokens": 2397532.0, "step": 1225 }, { "entropy": 6.982903003692627, "epoch": 1.2227747389358528, "grad_norm": 1.078125, "learning_rate": 0.0004992894455616149, "loss": 6.8367, "mean_token_accuracy": 0.11436758115887642, "num_tokens": 2409165.0, "step": 1230 }, { "entropy": 6.945490407943725, "epoch": 1.227747389358528, "grad_norm": 1.015625, "learning_rate": 0.0004992580954929108, "loss": 6.9284, "mean_token_accuracy": 0.11924622058868409, "num_tokens": 2420657.0, "step": 1235 }, { "entropy": 7.063077449798584, "epoch": 1.2327200397812033, "grad_norm": 1.046875, "learning_rate": 0.0004992260698226894, "loss": 6.8696, "mean_token_accuracy": 0.11942782625555992, "num_tokens": 2429936.0, "step": 1240 }, { "entropy": 6.959188175201416, "epoch": 1.2376926902038787, "grad_norm": 1.140625, "learning_rate": 0.0004991933686474315, "loss": 6.8697, "mean_token_accuracy": 0.1241569198668003, "num_tokens": 2440386.0, "step": 1245 }, { "entropy": 6.9969260692596436, "epoch": 1.242665340626554, "grad_norm": 1.046875, "learning_rate": 0.0004991599920656529, "loss": 7.0142, "mean_token_accuracy": 0.11339911371469498, "num_tokens": 2449086.0, "step": 1250 }, { "entropy": 7.175140237808227, "epoch": 1.2476379910492292, "grad_norm": 1.1015625, "learning_rate": 0.0004991259401779042, "loss": 7.0377, "mean_token_accuracy": 0.11450302749872207, "num_tokens": 2459380.0, "step": 1255 }, { "entropy": 6.951718759536743, "epoch": 1.2526106414719045, "grad_norm": 1.125, "learning_rate": 0.0004990912130867704, "loss": 6.8848, "mean_token_accuracy": 0.12214633822441101, "num_tokens": 2468623.0, "step": 1260 }, { "entropy": 7.023490524291992, "epoch": 1.2575832918945797, "grad_norm": 1.21875, "learning_rate": 0.0004990558108968703, "loss": 6.8114, "mean_token_accuracy": 0.11972368806600571, "num_tokens": 2479817.0, "step": 1265 }, { "entropy": 6.9894520282745365, "epoch": 1.2625559423172552, "grad_norm": 2.15625, "learning_rate": 0.0004990197337148571, "loss": 6.8848, "mean_token_accuracy": 0.12344507575035095, "num_tokens": 2490544.0, "step": 1270 }, { "entropy": 6.928281021118164, "epoch": 1.2675285927399305, "grad_norm": 1.0390625, "learning_rate": 0.000498982981649417, "loss": 6.8455, "mean_token_accuracy": 0.1291354365646839, "num_tokens": 2500516.0, "step": 1275 }, { "entropy": 7.020780372619629, "epoch": 1.2725012431626057, "grad_norm": 1.0859375, "learning_rate": 0.0004989455548112695, "loss": 6.9773, "mean_token_accuracy": 0.12090862020850182, "num_tokens": 2510508.0, "step": 1280 }, { "entropy": 6.979570388793945, "epoch": 1.277473893585281, "grad_norm": 1.1328125, "learning_rate": 0.0004989074533131671, "loss": 6.9218, "mean_token_accuracy": 0.12041369453072548, "num_tokens": 2520532.0, "step": 1285 }, { "entropy": 7.023465776443482, "epoch": 1.2824465440079562, "grad_norm": 1.0859375, "learning_rate": 0.0004988686772698945, "loss": 6.887, "mean_token_accuracy": 0.11943913698196411, "num_tokens": 2529912.0, "step": 1290 }, { "entropy": 6.949926042556763, "epoch": 1.2874191944306315, "grad_norm": 1.0546875, "learning_rate": 0.0004988292267982689, "loss": 6.9624, "mean_token_accuracy": 0.11250624060630798, "num_tokens": 2540700.0, "step": 1295 }, { "entropy": 6.981410264968872, "epoch": 1.2923918448533067, "grad_norm": 1.1796875, "learning_rate": 0.0004987891020171387, "loss": 6.8543, "mean_token_accuracy": 0.12385431155562401, "num_tokens": 2549343.0, "step": 1300 }, { "entropy": 6.865144109725952, "epoch": 1.297364495275982, "grad_norm": 1.171875, "learning_rate": 0.0004987483030473845, "loss": 6.8602, "mean_token_accuracy": 0.12558662444353103, "num_tokens": 2558630.0, "step": 1305 }, { "entropy": 6.992158222198486, "epoch": 1.3023371456986574, "grad_norm": 1.2109375, "learning_rate": 0.0004987068300119173, "loss": 6.8568, "mean_token_accuracy": 0.12431244775652886, "num_tokens": 2568559.0, "step": 1310 }, { "entropy": 6.963652801513672, "epoch": 1.3073097961213327, "grad_norm": 1.03125, "learning_rate": 0.0004986646830356792, "loss": 6.9209, "mean_token_accuracy": 0.1234417900443077, "num_tokens": 2578088.0, "step": 1315 }, { "entropy": 6.930180501937866, "epoch": 1.312282446544008, "grad_norm": 0.90625, "learning_rate": 0.0004986218622456423, "loss": 6.8663, "mean_token_accuracy": 0.12683536410331725, "num_tokens": 2588518.0, "step": 1320 }, { "entropy": 7.067978286743164, "epoch": 1.3172550969666832, "grad_norm": 1.0390625, "learning_rate": 0.000498578367770809, "loss": 6.9898, "mean_token_accuracy": 0.11430260315537452, "num_tokens": 2598850.0, "step": 1325 }, { "entropy": 7.021387243270874, "epoch": 1.3222277473893587, "grad_norm": 0.96484375, "learning_rate": 0.0004985341997422111, "loss": 6.9686, "mean_token_accuracy": 0.1073531225323677, "num_tokens": 2610667.0, "step": 1330 }, { "entropy": 6.954224586486816, "epoch": 1.327200397812034, "grad_norm": 1.1484375, "learning_rate": 0.0004984893582929093, "loss": 6.8191, "mean_token_accuracy": 0.1314563162624836, "num_tokens": 2620430.0, "step": 1335 }, { "entropy": 6.77024655342102, "epoch": 1.3321730482347092, "grad_norm": 1.15625, "learning_rate": 0.0004984438435579933, "loss": 6.7138, "mean_token_accuracy": 0.12848498672246933, "num_tokens": 2629433.0, "step": 1340 }, { "entropy": 6.951243495941162, "epoch": 1.3371456986573844, "grad_norm": 1.25, "learning_rate": 0.0004983976556745812, "loss": 6.8848, "mean_token_accuracy": 0.11360282599925994, "num_tokens": 2639611.0, "step": 1345 }, { "entropy": 7.018729877471924, "epoch": 1.3421183490800597, "grad_norm": 1.0078125, "learning_rate": 0.000498350794781819, "loss": 6.8893, "mean_token_accuracy": 0.11612915620207787, "num_tokens": 2649494.0, "step": 1350 }, { "entropy": 6.918116617202759, "epoch": 1.347090999502735, "grad_norm": 1.03125, "learning_rate": 0.0004983032610208801, "loss": 6.7948, "mean_token_accuracy": 0.12346037551760673, "num_tokens": 2658723.0, "step": 1355 }, { "entropy": 6.913340854644775, "epoch": 1.3520636499254102, "grad_norm": 1.09375, "learning_rate": 0.0004982550545349649, "loss": 6.8747, "mean_token_accuracy": 0.12230955138802528, "num_tokens": 2668530.0, "step": 1360 }, { "entropy": 6.951289796829224, "epoch": 1.3570363003480854, "grad_norm": 1.09375, "learning_rate": 0.0004982061754693008, "loss": 6.9435, "mean_token_accuracy": 0.12191602662205696, "num_tokens": 2678788.0, "step": 1365 }, { "entropy": 6.9707471370697025, "epoch": 1.362008950770761, "grad_norm": 1.0625, "learning_rate": 0.0004981566239711412, "loss": 6.838, "mean_token_accuracy": 0.12125239670276641, "num_tokens": 2688308.0, "step": 1370 }, { "entropy": 6.735447740554809, "epoch": 1.3669816011934361, "grad_norm": 2.640625, "learning_rate": 0.0004981064001897651, "loss": 6.7852, "mean_token_accuracy": 0.1300181344151497, "num_tokens": 2698146.0, "step": 1375 }, { "entropy": 7.007236576080322, "epoch": 1.3719542516161114, "grad_norm": 1.3359375, "learning_rate": 0.0004980555042764772, "loss": 6.8533, "mean_token_accuracy": 0.12391836419701577, "num_tokens": 2707336.0, "step": 1380 }, { "entropy": 6.90031623840332, "epoch": 1.3769269020387866, "grad_norm": 1.0859375, "learning_rate": 0.0004980039363846069, "loss": 6.8073, "mean_token_accuracy": 0.1273755319416523, "num_tokens": 2717573.0, "step": 1385 }, { "entropy": 6.875842666625976, "epoch": 1.381899552461462, "grad_norm": 1.1015625, "learning_rate": 0.000497951696669508, "loss": 6.8247, "mean_token_accuracy": 0.12682975456118584, "num_tokens": 2727488.0, "step": 1390 }, { "entropy": 6.834414958953857, "epoch": 1.3868722028841374, "grad_norm": 1.0390625, "learning_rate": 0.0004978987852885579, "loss": 6.8143, "mean_token_accuracy": 0.13222975805401802, "num_tokens": 2738010.0, "step": 1395 }, { "entropy": 6.945574712753296, "epoch": 1.3918448533068126, "grad_norm": 1.15625, "learning_rate": 0.0004978452024011582, "loss": 6.8677, "mean_token_accuracy": 0.12154300883412361, "num_tokens": 2746984.0, "step": 1400 }, { "entropy": 6.899899244308472, "epoch": 1.3968175037294879, "grad_norm": 1.1796875, "learning_rate": 0.000497790948168733, "loss": 6.8654, "mean_token_accuracy": 0.11535304635763169, "num_tokens": 2756578.0, "step": 1405 }, { "entropy": 6.906005001068115, "epoch": 1.4017901541521631, "grad_norm": 1.0546875, "learning_rate": 0.0004977360227547288, "loss": 6.8023, "mean_token_accuracy": 0.12816528901457785, "num_tokens": 2765773.0, "step": 1410 }, { "entropy": 6.878059434890747, "epoch": 1.4067628045748384, "grad_norm": 1.09375, "learning_rate": 0.0004976804263246146, "loss": 6.8035, "mean_token_accuracy": 0.12617505267262458, "num_tokens": 2775002.0, "step": 1415 }, { "entropy": 6.936922693252564, "epoch": 1.4117354549975136, "grad_norm": 1.0234375, "learning_rate": 0.0004976241590458803, "loss": 6.873, "mean_token_accuracy": 0.12435229048132897, "num_tokens": 2784682.0, "step": 1420 }, { "entropy": 6.884806394577026, "epoch": 1.4167081054201889, "grad_norm": 1.0234375, "learning_rate": 0.0004975672210880372, "loss": 6.7813, "mean_token_accuracy": 0.13019969910383225, "num_tokens": 2794371.0, "step": 1425 }, { "entropy": 6.919467496871948, "epoch": 1.4216807558428641, "grad_norm": 1.078125, "learning_rate": 0.0004975096126226171, "loss": 6.8578, "mean_token_accuracy": 0.11788132414221764, "num_tokens": 2803840.0, "step": 1430 }, { "entropy": 6.835882663726807, "epoch": 1.4266534062655396, "grad_norm": 1.078125, "learning_rate": 0.0004974513338231715, "loss": 6.7454, "mean_token_accuracy": 0.13257994279265403, "num_tokens": 2813536.0, "step": 1435 }, { "entropy": 6.843277454376221, "epoch": 1.4316260566882149, "grad_norm": 1.0078125, "learning_rate": 0.0004973923848652715, "loss": 6.8069, "mean_token_accuracy": 0.12237441018223763, "num_tokens": 2822741.0, "step": 1440 }, { "entropy": 6.898312330245972, "epoch": 1.43659870711089, "grad_norm": 1.1953125, "learning_rate": 0.0004973327659265073, "loss": 6.7842, "mean_token_accuracy": 0.12550862208008767, "num_tokens": 2832208.0, "step": 1445 }, { "entropy": 6.686010265350342, "epoch": 1.4415713575335654, "grad_norm": 1.140625, "learning_rate": 0.0004972724771864874, "loss": 6.663, "mean_token_accuracy": 0.1326310396194458, "num_tokens": 2841672.0, "step": 1450 }, { "entropy": 6.867441606521607, "epoch": 1.4465440079562406, "grad_norm": 0.99609375, "learning_rate": 0.0004972115188268378, "loss": 6.7861, "mean_token_accuracy": 0.12769792675971986, "num_tokens": 2852323.0, "step": 1455 }, { "entropy": 6.86247444152832, "epoch": 1.451516658378916, "grad_norm": 1.1328125, "learning_rate": 0.0004971498910312024, "loss": 6.8429, "mean_token_accuracy": 0.1261087991297245, "num_tokens": 2861863.0, "step": 1460 }, { "entropy": 6.926764297485351, "epoch": 1.4564893088015913, "grad_norm": 1.0234375, "learning_rate": 0.0004970875939852412, "loss": 6.7867, "mean_token_accuracy": 0.12548809126019478, "num_tokens": 2871608.0, "step": 1465 }, { "entropy": 6.9585823059082035, "epoch": 1.4614619592242666, "grad_norm": 1.1953125, "learning_rate": 0.000497024627876631, "loss": 6.7525, "mean_token_accuracy": 0.1302333578467369, "num_tokens": 2882091.0, "step": 1470 }, { "entropy": 6.817167139053344, "epoch": 1.4664346096469418, "grad_norm": 1.1953125, "learning_rate": 0.0004969609928950639, "loss": 6.7359, "mean_token_accuracy": 0.13480845838785172, "num_tokens": 2892499.0, "step": 1475 }, { "entropy": 6.845238065719604, "epoch": 1.471407260069617, "grad_norm": 1.03125, "learning_rate": 0.0004968966892322468, "loss": 6.7645, "mean_token_accuracy": 0.12246781513094902, "num_tokens": 2902208.0, "step": 1480 }, { "entropy": 6.857409286499023, "epoch": 1.4763799104922923, "grad_norm": 1.1640625, "learning_rate": 0.0004968317170819018, "loss": 6.7555, "mean_token_accuracy": 0.1244891531765461, "num_tokens": 2911196.0, "step": 1485 }, { "entropy": 6.825583457946777, "epoch": 1.4813525609149676, "grad_norm": 1.1953125, "learning_rate": 0.0004967660766397642, "loss": 6.8108, "mean_token_accuracy": 0.12157977223396302, "num_tokens": 2921339.0, "step": 1490 }, { "entropy": 6.829862213134765, "epoch": 1.4863252113376428, "grad_norm": 1.1875, "learning_rate": 0.0004966997681035829, "loss": 6.7633, "mean_token_accuracy": 0.12412352785468102, "num_tokens": 2930795.0, "step": 1495 }, { "entropy": 6.815878105163574, "epoch": 1.4912978617603183, "grad_norm": 1.0546875, "learning_rate": 0.0004966327916731195, "loss": 6.7273, "mean_token_accuracy": 0.1268233872950077, "num_tokens": 2939647.0, "step": 1500 }, { "epoch": 1.4912978617603183, "eval_entropy": 6.714339637536607, "eval_loss": 7.027554512023926, "eval_mean_token_accuracy": 0.1158115748350384, "eval_num_tokens": 2939647.0, "eval_runtime": 13.3039, "eval_samples_per_second": 260.45, "eval_steps_per_second": 32.622, "step": 1500 }, { "entropy": 6.835459756851196, "epoch": 1.4962705121829936, "grad_norm": 1.1328125, "learning_rate": 0.0004965651475501476, "loss": 6.7481, "mean_token_accuracy": 0.12527029886841773, "num_tokens": 2948365.0, "step": 1505 }, { "entropy": 6.746442461013794, "epoch": 1.5012431626056688, "grad_norm": 1.1328125, "learning_rate": 0.0004964968359384524, "loss": 6.7688, "mean_token_accuracy": 0.12213929519057273, "num_tokens": 2957447.0, "step": 1510 }, { "entropy": 6.8704711437225345, "epoch": 1.506215813028344, "grad_norm": 1.125, "learning_rate": 0.0004964278570438299, "loss": 6.7511, "mean_token_accuracy": 0.1285943053662777, "num_tokens": 2965938.0, "step": 1515 }, { "entropy": 6.894935607910156, "epoch": 1.5111884634510195, "grad_norm": 1.125, "learning_rate": 0.0004963582110740865, "loss": 6.7707, "mean_token_accuracy": 0.12603728622198104, "num_tokens": 2975830.0, "step": 1520 }, { "entropy": 6.8132643699646, "epoch": 1.5161611138736948, "grad_norm": 1.0703125, "learning_rate": 0.0004962878982390381, "loss": 6.7491, "mean_token_accuracy": 0.12986776381731033, "num_tokens": 2985391.0, "step": 1525 }, { "entropy": 6.82594780921936, "epoch": 1.52113376429637, "grad_norm": 1.2265625, "learning_rate": 0.0004962169187505097, "loss": 6.744, "mean_token_accuracy": 0.1368634097278118, "num_tokens": 2994397.0, "step": 1530 }, { "entropy": 6.81362738609314, "epoch": 1.5261064147190453, "grad_norm": 1.0078125, "learning_rate": 0.0004961452728223343, "loss": 6.7869, "mean_token_accuracy": 0.12196057885885239, "num_tokens": 3005085.0, "step": 1535 }, { "entropy": 6.807890462875366, "epoch": 1.5310790651417205, "grad_norm": 1.015625, "learning_rate": 0.0004960729606703535, "loss": 6.771, "mean_token_accuracy": 0.12297940105199814, "num_tokens": 3015500.0, "step": 1540 }, { "entropy": 6.883302497863769, "epoch": 1.5360517155643958, "grad_norm": 1.0703125, "learning_rate": 0.0004959999825124147, "loss": 6.8824, "mean_token_accuracy": 0.12056382745504379, "num_tokens": 3024862.0, "step": 1545 }, { "entropy": 6.900200939178466, "epoch": 1.541024365987071, "grad_norm": 1.1484375, "learning_rate": 0.000495926338568373, "loss": 6.7142, "mean_token_accuracy": 0.13087142780423164, "num_tokens": 3034775.0, "step": 1550 }, { "entropy": 6.749657487869262, "epoch": 1.5459970164097463, "grad_norm": 1.1875, "learning_rate": 0.0004958520290600884, "loss": 6.7871, "mean_token_accuracy": 0.12653839439153672, "num_tokens": 3044048.0, "step": 1555 }, { "entropy": 6.909590578079223, "epoch": 1.5509696668324215, "grad_norm": 1.1484375, "learning_rate": 0.0004957770542114262, "loss": 6.7998, "mean_token_accuracy": 0.1275485150516033, "num_tokens": 3054237.0, "step": 1560 }, { "entropy": 6.612554597854614, "epoch": 1.555942317255097, "grad_norm": 0.9921875, "learning_rate": 0.0004957014142482563, "loss": 6.6053, "mean_token_accuracy": 0.13363586664199828, "num_tokens": 3064787.0, "step": 1565 }, { "entropy": 6.7135475158691404, "epoch": 1.5609149676777723, "grad_norm": 1.1875, "learning_rate": 0.0004956251093984521, "loss": 6.7758, "mean_token_accuracy": 0.1243907667696476, "num_tokens": 3074002.0, "step": 1570 }, { "entropy": 6.749949312210083, "epoch": 1.5658876181004475, "grad_norm": 1.1796875, "learning_rate": 0.0004955481398918902, "loss": 6.6525, "mean_token_accuracy": 0.129579795897007, "num_tokens": 3084270.0, "step": 1575 }, { "entropy": 6.872102737426758, "epoch": 1.5708602685231228, "grad_norm": 0.97265625, "learning_rate": 0.0004954705059604495, "loss": 6.7541, "mean_token_accuracy": 0.13147178888320923, "num_tokens": 3095236.0, "step": 1580 }, { "entropy": 6.74047703742981, "epoch": 1.5758329189457982, "grad_norm": 1.140625, "learning_rate": 0.0004953922078380104, "loss": 6.7342, "mean_token_accuracy": 0.12891987785696984, "num_tokens": 3104912.0, "step": 1585 }, { "entropy": 6.77790150642395, "epoch": 1.5808055693684735, "grad_norm": 1.046875, "learning_rate": 0.0004953132457604544, "loss": 6.7544, "mean_token_accuracy": 0.1278040237724781, "num_tokens": 3114782.0, "step": 1590 }, { "entropy": 6.925691080093384, "epoch": 1.5857782197911487, "grad_norm": 1.1015625, "learning_rate": 0.0004952336199656632, "loss": 6.7819, "mean_token_accuracy": 0.13000695928931236, "num_tokens": 3123606.0, "step": 1595 }, { "entropy": 6.682368040084839, "epoch": 1.590750870213824, "grad_norm": 1.1796875, "learning_rate": 0.0004951533306935181, "loss": 6.6029, "mean_token_accuracy": 0.13756740540266038, "num_tokens": 3133343.0, "step": 1600 }, { "entropy": 6.910130405426026, "epoch": 1.5957235206364992, "grad_norm": 1.140625, "learning_rate": 0.0004950723781858991, "loss": 6.8401, "mean_token_accuracy": 0.11867891177535057, "num_tokens": 3143137.0, "step": 1605 }, { "entropy": 6.797189426422119, "epoch": 1.6006961710591745, "grad_norm": 1.1171875, "learning_rate": 0.0004949907626866844, "loss": 6.7056, "mean_token_accuracy": 0.12898564338684082, "num_tokens": 3152595.0, "step": 1610 }, { "entropy": 6.758291721343994, "epoch": 1.6056688214818498, "grad_norm": 1.1640625, "learning_rate": 0.0004949084844417493, "loss": 6.8001, "mean_token_accuracy": 0.12771535739302636, "num_tokens": 3162333.0, "step": 1615 }, { "entropy": 6.749180459976197, "epoch": 1.610641471904525, "grad_norm": 1.0078125, "learning_rate": 0.0004948255436989657, "loss": 6.6662, "mean_token_accuracy": 0.12852055877447127, "num_tokens": 3172765.0, "step": 1620 }, { "entropy": 6.855949831008911, "epoch": 1.6156141223272003, "grad_norm": 0.94921875, "learning_rate": 0.0004947419407082017, "loss": 6.8392, "mean_token_accuracy": 0.12078842222690582, "num_tokens": 3183613.0, "step": 1625 }, { "entropy": 6.871716928482056, "epoch": 1.6205867727498757, "grad_norm": 1.1640625, "learning_rate": 0.0004946576757213202, "loss": 6.7259, "mean_token_accuracy": 0.1271841213107109, "num_tokens": 3193020.0, "step": 1630 }, { "entropy": 6.740650987625122, "epoch": 1.625559423172551, "grad_norm": 1.0, "learning_rate": 0.0004945727489921784, "loss": 6.7367, "mean_token_accuracy": 0.12784550338983536, "num_tokens": 3202845.0, "step": 1635 }, { "entropy": 6.698820781707764, "epoch": 1.6305320735952262, "grad_norm": 1.34375, "learning_rate": 0.0004944871607766273, "loss": 6.6635, "mean_token_accuracy": 0.12537247836589813, "num_tokens": 3211195.0, "step": 1640 }, { "entropy": 6.819862747192383, "epoch": 1.6355047240179017, "grad_norm": 1.015625, "learning_rate": 0.0004944009113325104, "loss": 6.7534, "mean_token_accuracy": 0.13159084394574166, "num_tokens": 3221549.0, "step": 1645 }, { "entropy": 6.688119506835937, "epoch": 1.640477374440577, "grad_norm": 1.0703125, "learning_rate": 0.0004943140009196635, "loss": 6.6053, "mean_token_accuracy": 0.13880132585763932, "num_tokens": 3232206.0, "step": 1650 }, { "entropy": 6.809904432296753, "epoch": 1.6454500248632522, "grad_norm": 1.0703125, "learning_rate": 0.0004942264297999135, "loss": 6.7225, "mean_token_accuracy": 0.1224221020936966, "num_tokens": 3241613.0, "step": 1655 }, { "entropy": 6.65362229347229, "epoch": 1.6504226752859275, "grad_norm": 0.9765625, "learning_rate": 0.0004941381982370778, "loss": 6.6798, "mean_token_accuracy": 0.13001496493816375, "num_tokens": 3251968.0, "step": 1660 }, { "entropy": 6.732522678375244, "epoch": 1.6553953257086027, "grad_norm": 1.0859375, "learning_rate": 0.0004940493064969633, "loss": 6.6513, "mean_token_accuracy": 0.13061657845973967, "num_tokens": 3261969.0, "step": 1665 }, { "entropy": 6.7879266262054445, "epoch": 1.660367976131278, "grad_norm": 1.1953125, "learning_rate": 0.000493959754847366, "loss": 6.713, "mean_token_accuracy": 0.1265723451972008, "num_tokens": 3270894.0, "step": 1670 }, { "entropy": 6.723002815246582, "epoch": 1.6653406265539532, "grad_norm": 1.1640625, "learning_rate": 0.0004938695435580698, "loss": 6.7505, "mean_token_accuracy": 0.12020857334136963, "num_tokens": 3280949.0, "step": 1675 }, { "entropy": 6.85877799987793, "epoch": 1.6703132769766285, "grad_norm": 1.2578125, "learning_rate": 0.0004937786729008459, "loss": 6.7185, "mean_token_accuracy": 0.12710705101490022, "num_tokens": 3291449.0, "step": 1680 }, { "entropy": 6.644477128982544, "epoch": 1.6752859273993037, "grad_norm": 1.1484375, "learning_rate": 0.0004936871431494517, "loss": 6.7215, "mean_token_accuracy": 0.12685354053974152, "num_tokens": 3301632.0, "step": 1685 }, { "entropy": 6.804497814178466, "epoch": 1.680258577821979, "grad_norm": 1.28125, "learning_rate": 0.0004935949545796307, "loss": 6.5871, "mean_token_accuracy": 0.1358786255121231, "num_tokens": 3310802.0, "step": 1690 }, { "entropy": 6.711171293258667, "epoch": 1.6852312282446544, "grad_norm": 1.0078125, "learning_rate": 0.0004935021074691106, "loss": 6.6606, "mean_token_accuracy": 0.13076258674263955, "num_tokens": 3320833.0, "step": 1695 }, { "entropy": 6.716874408721924, "epoch": 1.6902038786673297, "grad_norm": 1.015625, "learning_rate": 0.0004934086020976032, "loss": 6.6396, "mean_token_accuracy": 0.13465334549546243, "num_tokens": 3330030.0, "step": 1700 }, { "entropy": 6.516720962524414, "epoch": 1.695176529090005, "grad_norm": 1.1875, "learning_rate": 0.0004933144387468037, "loss": 6.44, "mean_token_accuracy": 0.14811225682497026, "num_tokens": 3338745.0, "step": 1705 }, { "entropy": 6.724125480651855, "epoch": 1.7001491795126804, "grad_norm": 1.0859375, "learning_rate": 0.0004932196177003891, "loss": 6.6863, "mean_token_accuracy": 0.1328687660396099, "num_tokens": 3348067.0, "step": 1710 }, { "entropy": 6.690582752227783, "epoch": 1.7051218299353557, "grad_norm": 1.046875, "learning_rate": 0.000493124139244018, "loss": 6.5785, "mean_token_accuracy": 0.13962048292160034, "num_tokens": 3357061.0, "step": 1715 }, { "entropy": 6.695200443267822, "epoch": 1.710094480358031, "grad_norm": 1.09375, "learning_rate": 0.0004930280036653294, "loss": 6.596, "mean_token_accuracy": 0.1310545489192009, "num_tokens": 3366573.0, "step": 1720 }, { "entropy": 6.709780216217041, "epoch": 1.7150671307807062, "grad_norm": 1.0703125, "learning_rate": 0.000492931211253942, "loss": 6.6797, "mean_token_accuracy": 0.12514400482177734, "num_tokens": 3376996.0, "step": 1725 }, { "entropy": 6.850689458847046, "epoch": 1.7200397812033814, "grad_norm": 1.0546875, "learning_rate": 0.0004928337623014535, "loss": 6.7079, "mean_token_accuracy": 0.12260405942797661, "num_tokens": 3387615.0, "step": 1730 }, { "entropy": 6.5351707458496096, "epoch": 1.7250124316260567, "grad_norm": 1.03125, "learning_rate": 0.000492735657101439, "loss": 6.5019, "mean_token_accuracy": 0.15043683126568794, "num_tokens": 3397578.0, "step": 1735 }, { "entropy": 6.659417963027954, "epoch": 1.729985082048732, "grad_norm": 1.109375, "learning_rate": 0.0004926368959494513, "loss": 6.6746, "mean_token_accuracy": 0.12657460197806358, "num_tokens": 3406697.0, "step": 1740 }, { "entropy": 6.783771085739136, "epoch": 1.7349577324714072, "grad_norm": 0.99609375, "learning_rate": 0.0004925374791430186, "loss": 6.6459, "mean_token_accuracy": 0.13219962567090987, "num_tokens": 3416631.0, "step": 1745 }, { "entropy": 6.719735622406006, "epoch": 1.7399303828940824, "grad_norm": 1.15625, "learning_rate": 0.0004924374069816448, "loss": 6.7346, "mean_token_accuracy": 0.12242367416620255, "num_tokens": 3426564.0, "step": 1750 }, { "entropy": 6.769449996948242, "epoch": 1.7449030333167577, "grad_norm": 1.15625, "learning_rate": 0.0004923366797668081, "loss": 6.7388, "mean_token_accuracy": 0.1309608444571495, "num_tokens": 3436200.0, "step": 1755 }, { "entropy": 6.741757011413574, "epoch": 1.7498756837394331, "grad_norm": 1.0625, "learning_rate": 0.0004922352978019597, "loss": 6.7252, "mean_token_accuracy": 0.1283721849322319, "num_tokens": 3446460.0, "step": 1760 }, { "entropy": 6.724111890792846, "epoch": 1.7548483341621084, "grad_norm": 1.921875, "learning_rate": 0.0004921332613925239, "loss": 6.5913, "mean_token_accuracy": 0.1381916008889675, "num_tokens": 3457629.0, "step": 1765 }, { "entropy": 6.721476221084595, "epoch": 1.7598209845847836, "grad_norm": 1.5859375, "learning_rate": 0.0004920305708458964, "loss": 6.7723, "mean_token_accuracy": 0.12472076639533043, "num_tokens": 3467754.0, "step": 1770 }, { "entropy": 6.6909526824951175, "epoch": 1.7647936350074591, "grad_norm": 1.1171875, "learning_rate": 0.0004919272264714431, "loss": 6.6901, "mean_token_accuracy": 0.12899342849850653, "num_tokens": 3477094.0, "step": 1775 }, { "entropy": 6.709241199493408, "epoch": 1.7697662854301344, "grad_norm": 1.09375, "learning_rate": 0.0004918232285805004, "loss": 6.649, "mean_token_accuracy": 0.13431572914123535, "num_tokens": 3487276.0, "step": 1780 }, { "entropy": 6.6987536430358885, "epoch": 1.7747389358528096, "grad_norm": 1.0546875, "learning_rate": 0.0004917185774863727, "loss": 6.6413, "mean_token_accuracy": 0.133719053119421, "num_tokens": 3498118.0, "step": 1785 }, { "entropy": 6.633240509033203, "epoch": 1.7797115862754849, "grad_norm": 0.98046875, "learning_rate": 0.0004916132735043329, "loss": 6.4763, "mean_token_accuracy": 0.13459513634443282, "num_tokens": 3508286.0, "step": 1790 }, { "entropy": 6.6068065643310545, "epoch": 1.7846842366981601, "grad_norm": 1.09375, "learning_rate": 0.0004915073169516204, "loss": 6.5962, "mean_token_accuracy": 0.13357006162405013, "num_tokens": 3517979.0, "step": 1795 }, { "entropy": 6.689920902252197, "epoch": 1.7896568871208354, "grad_norm": 1.078125, "learning_rate": 0.0004914007081474406, "loss": 6.6253, "mean_token_accuracy": 0.13220322877168655, "num_tokens": 3528003.0, "step": 1800 }, { "entropy": 6.789654922485352, "epoch": 1.7946295375435106, "grad_norm": 1.1875, "learning_rate": 0.0004912934474129641, "loss": 6.6844, "mean_token_accuracy": 0.12885999754071237, "num_tokens": 3537932.0, "step": 1805 }, { "entropy": 6.6286862850189205, "epoch": 1.7996021879661859, "grad_norm": 1.0390625, "learning_rate": 0.0004911855350713251, "loss": 6.8181, "mean_token_accuracy": 0.12549626901745797, "num_tokens": 3548584.0, "step": 1810 }, { "entropy": 6.8323548316955565, "epoch": 1.8045748383888611, "grad_norm": 1.1796875, "learning_rate": 0.0004910769714476214, "loss": 6.6232, "mean_token_accuracy": 0.13544862642884253, "num_tokens": 3558117.0, "step": 1815 }, { "entropy": 6.687149953842163, "epoch": 1.8095474888115366, "grad_norm": 1.0390625, "learning_rate": 0.0004909677568689122, "loss": 6.7517, "mean_token_accuracy": 0.12215576767921447, "num_tokens": 3569226.0, "step": 1820 }, { "entropy": 6.743102121353149, "epoch": 1.8145201392342118, "grad_norm": 1.1328125, "learning_rate": 0.0004908578916642183, "loss": 6.5999, "mean_token_accuracy": 0.13134600892663, "num_tokens": 3578375.0, "step": 1825 }, { "entropy": 6.685059261322022, "epoch": 1.819492789656887, "grad_norm": 1.1796875, "learning_rate": 0.0004907473761645205, "loss": 6.6304, "mean_token_accuracy": 0.13430401384830476, "num_tokens": 3587356.0, "step": 1830 }, { "entropy": 6.726788187026978, "epoch": 1.8244654400795626, "grad_norm": 1.1484375, "learning_rate": 0.0004906362107027583, "loss": 6.6957, "mean_token_accuracy": 0.13085027858614923, "num_tokens": 3596785.0, "step": 1835 }, { "entropy": 6.662399053573608, "epoch": 1.8294380905022378, "grad_norm": 1.1171875, "learning_rate": 0.0004905243956138298, "loss": 6.5802, "mean_token_accuracy": 0.13663700297474862, "num_tokens": 3605357.0, "step": 1840 }, { "entropy": 6.723802614212036, "epoch": 1.834410740924913, "grad_norm": 0.98828125, "learning_rate": 0.0004904119312345896, "loss": 6.5997, "mean_token_accuracy": 0.1368691235780716, "num_tokens": 3614979.0, "step": 1845 }, { "entropy": 6.673075103759766, "epoch": 1.8393833913475883, "grad_norm": 1.1796875, "learning_rate": 0.0004902988179038492, "loss": 6.583, "mean_token_accuracy": 0.13440734073519706, "num_tokens": 3624594.0, "step": 1850 }, { "entropy": 6.635775375366211, "epoch": 1.8443560417702636, "grad_norm": 1.15625, "learning_rate": 0.000490185055962374, "loss": 6.6129, "mean_token_accuracy": 0.1337726093828678, "num_tokens": 3633998.0, "step": 1855 }, { "entropy": 6.698388481140137, "epoch": 1.8493286921929388, "grad_norm": 1.25, "learning_rate": 0.0004900706457528845, "loss": 6.5638, "mean_token_accuracy": 0.13645450323820113, "num_tokens": 3642406.0, "step": 1860 }, { "entropy": 6.578488683700561, "epoch": 1.854301342615614, "grad_norm": 0.96875, "learning_rate": 0.0004899555876200535, "loss": 6.633, "mean_token_accuracy": 0.12992775663733483, "num_tokens": 3652905.0, "step": 1865 }, { "entropy": 6.679895401000977, "epoch": 1.8592739930382893, "grad_norm": 1.0625, "learning_rate": 0.0004898398819105059, "loss": 6.5709, "mean_token_accuracy": 0.13101621717214584, "num_tokens": 3662518.0, "step": 1870 }, { "entropy": 6.699575424194336, "epoch": 1.8642466434609646, "grad_norm": 1.140625, "learning_rate": 0.0004897235289728178, "loss": 6.6244, "mean_token_accuracy": 0.13423072993755342, "num_tokens": 3672102.0, "step": 1875 }, { "entropy": 6.703206348419189, "epoch": 1.8692192938836398, "grad_norm": 1.0703125, "learning_rate": 0.0004896065291575145, "loss": 6.6389, "mean_token_accuracy": 0.13154254257678985, "num_tokens": 3681821.0, "step": 1880 }, { "entropy": 6.7686851978302, "epoch": 1.8741919443063153, "grad_norm": 1.2421875, "learning_rate": 0.0004894888828170708, "loss": 6.7336, "mean_token_accuracy": 0.12900978326797485, "num_tokens": 3690753.0, "step": 1885 }, { "entropy": 6.642085838317871, "epoch": 1.8791645947289906, "grad_norm": 1.015625, "learning_rate": 0.0004893705903059087, "loss": 6.6865, "mean_token_accuracy": 0.12560946121811867, "num_tokens": 3701694.0, "step": 1890 }, { "entropy": 6.69543228149414, "epoch": 1.8841372451516658, "grad_norm": 1.1015625, "learning_rate": 0.0004892516519803971, "loss": 6.6102, "mean_token_accuracy": 0.13482431396842004, "num_tokens": 3710894.0, "step": 1895 }, { "entropy": 6.643682813644409, "epoch": 1.8891098955743413, "grad_norm": 1.09375, "learning_rate": 0.0004891320681988504, "loss": 6.5572, "mean_token_accuracy": 0.1428975597023964, "num_tokens": 3720081.0, "step": 1900 }, { "entropy": 6.644357204437256, "epoch": 1.8940825459970165, "grad_norm": 1.09375, "learning_rate": 0.0004890118393215277, "loss": 6.6654, "mean_token_accuracy": 0.12970876395702363, "num_tokens": 3731168.0, "step": 1905 }, { "entropy": 6.65168194770813, "epoch": 1.8990551964196918, "grad_norm": 1.0859375, "learning_rate": 0.0004888909657106311, "loss": 6.453, "mean_token_accuracy": 0.14205871373414994, "num_tokens": 3740533.0, "step": 1910 }, { "entropy": 6.578559398651123, "epoch": 1.904027846842367, "grad_norm": 1.0234375, "learning_rate": 0.0004887694477303055, "loss": 6.6241, "mean_token_accuracy": 0.12968793734908104, "num_tokens": 3750523.0, "step": 1915 }, { "entropy": 6.690841817855835, "epoch": 1.9090004972650423, "grad_norm": 0.98046875, "learning_rate": 0.0004886472857466368, "loss": 6.6616, "mean_token_accuracy": 0.13006103932857513, "num_tokens": 3760323.0, "step": 1920 }, { "entropy": 6.4785408020019535, "epoch": 1.9139731476877175, "grad_norm": 1.0078125, "learning_rate": 0.0004885244801276509, "loss": 6.4094, "mean_token_accuracy": 0.15436080545186998, "num_tokens": 3770970.0, "step": 1925 }, { "entropy": 6.657366704940796, "epoch": 1.9189457981103928, "grad_norm": 1.109375, "learning_rate": 0.0004884010312433131, "loss": 6.6583, "mean_token_accuracy": 0.13346222266554833, "num_tokens": 3780810.0, "step": 1930 }, { "entropy": 6.691922521591186, "epoch": 1.923918448533068, "grad_norm": 1.0859375, "learning_rate": 0.00048827693946552615, "loss": 6.5706, "mean_token_accuracy": 0.13881206288933753, "num_tokens": 3791461.0, "step": 1935 }, { "entropy": 6.514286136627197, "epoch": 1.9288910989557433, "grad_norm": 1.0234375, "learning_rate": 0.00048815220516813004, "loss": 6.3493, "mean_token_accuracy": 0.15353642255067826, "num_tokens": 3800353.0, "step": 1940 }, { "entropy": 6.594685983657837, "epoch": 1.9338637493784185, "grad_norm": 1.0, "learning_rate": 0.0004880268287269, "loss": 6.5385, "mean_token_accuracy": 0.1411295749247074, "num_tokens": 3810633.0, "step": 1945 }, { "entropy": 6.682897472381592, "epoch": 1.938836399801094, "grad_norm": 1.1015625, "learning_rate": 0.00048790081051954605, "loss": 6.6878, "mean_token_accuracy": 0.13393995463848113, "num_tokens": 3820254.0, "step": 1950 }, { "entropy": 6.710420083999634, "epoch": 1.9438090502237693, "grad_norm": 1.2109375, "learning_rate": 0.0004877741509257116, "loss": 6.6716, "mean_token_accuracy": 0.13213822916150092, "num_tokens": 3829976.0, "step": 1955 }, { "entropy": 6.63531084060669, "epoch": 1.9487817006464445, "grad_norm": 1.0390625, "learning_rate": 0.0004876468503269721, "loss": 6.616, "mean_token_accuracy": 0.12971105426549911, "num_tokens": 3840593.0, "step": 1960 }, { "entropy": 6.6207164287567135, "epoch": 1.95375435106912, "grad_norm": 1.1640625, "learning_rate": 0.00048751890910683434, "loss": 6.5933, "mean_token_accuracy": 0.14084266349673272, "num_tokens": 3850063.0, "step": 1965 }, { "entropy": 6.678275203704834, "epoch": 1.9587270014917952, "grad_norm": 1.03125, "learning_rate": 0.00048739032765073487, "loss": 6.6364, "mean_token_accuracy": 0.13240463137626649, "num_tokens": 3860132.0, "step": 1970 }, { "entropy": 6.625484371185303, "epoch": 1.9636996519144705, "grad_norm": 1.0234375, "learning_rate": 0.00048726110634603913, "loss": 6.5804, "mean_token_accuracy": 0.13869195356965064, "num_tokens": 3869914.0, "step": 1975 }, { "entropy": 6.618179845809936, "epoch": 1.9686723023371457, "grad_norm": 0.99609375, "learning_rate": 0.00048713124558204013, "loss": 6.5323, "mean_token_accuracy": 0.146308434009552, "num_tokens": 3879825.0, "step": 1980 }, { "entropy": 6.647174978256226, "epoch": 1.973644952759821, "grad_norm": 1.0859375, "learning_rate": 0.0004870007457499573, "loss": 6.6094, "mean_token_accuracy": 0.14014348685741423, "num_tokens": 3889318.0, "step": 1985 }, { "entropy": 6.63746223449707, "epoch": 1.9786176031824962, "grad_norm": 1.1484375, "learning_rate": 0.00048686960724293537, "loss": 6.587, "mean_token_accuracy": 0.13484067544341088, "num_tokens": 3899017.0, "step": 1990 }, { "entropy": 6.648053073883057, "epoch": 1.9835902536051715, "grad_norm": 1.1328125, "learning_rate": 0.0004867378304560432, "loss": 6.5633, "mean_token_accuracy": 0.13868496119976043, "num_tokens": 3907766.0, "step": 1995 }, { "entropy": 6.609647560119629, "epoch": 1.9885629040278467, "grad_norm": 1.140625, "learning_rate": 0.0004866054157862723, "loss": 6.5422, "mean_token_accuracy": 0.1334989458322525, "num_tokens": 3916323.0, "step": 2000 }, { "epoch": 1.9885629040278467, "eval_entropy": 6.389401653395271, "eval_loss": 6.812779426574707, "eval_mean_token_accuracy": 0.12556906916578794, "eval_num_tokens": 3916323.0, "eval_runtime": 10.4359, "eval_samples_per_second": 332.027, "eval_steps_per_second": 41.587, "step": 2000 } ], "logging_steps": 5, "max_steps": 10050, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6433363490688000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }