{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9945300845350572, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 8.055328845977783, "epoch": 0.004972650422675286, "grad_norm": 1.0859375, "learning_rate": 2e-06, "loss": 7.7699, "mean_token_accuracy": 0.09289914444088936, "num_tokens": 9089.0, "step": 5 }, { "entropy": 7.9934410572052, "epoch": 0.009945300845350571, "grad_norm": 1.03125, "learning_rate": 4.5e-06, "loss": 7.9292, "mean_token_accuracy": 0.0899883709847927, "num_tokens": 21650.0, "step": 10 }, { "entropy": 8.043873596191407, "epoch": 0.014917951268025857, "grad_norm": 1.40625, "learning_rate": 7e-06, "loss": 7.8569, "mean_token_accuracy": 0.0829312488436699, "num_tokens": 31067.0, "step": 15 }, { "entropy": 7.9948217391967775, "epoch": 0.019890601690701143, "grad_norm": 1.125, "learning_rate": 9.5e-06, "loss": 7.8229, "mean_token_accuracy": 0.08587435036897659, "num_tokens": 40816.0, "step": 20 }, { "entropy": 8.020876693725587, "epoch": 0.02486325211337643, "grad_norm": 1.125, "learning_rate": 1.2e-05, "loss": 7.8415, "mean_token_accuracy": 0.08777489773929119, "num_tokens": 51065.0, "step": 25 }, { "entropy": 8.016945314407348, "epoch": 0.029835902536051714, "grad_norm": 1.1171875, "learning_rate": 1.4500000000000002e-05, "loss": 7.8082, "mean_token_accuracy": 0.09032100439071655, "num_tokens": 60539.0, "step": 30 }, { "entropy": 8.016125869750976, "epoch": 0.034808552958727, "grad_norm": 0.97265625, "learning_rate": 1.7000000000000003e-05, "loss": 7.8391, "mean_token_accuracy": 0.08789670392870903, "num_tokens": 71010.0, "step": 35 }, { "entropy": 8.02649121284485, "epoch": 0.039781203381402286, "grad_norm": 0.98828125, "learning_rate": 1.95e-05, "loss": 7.9238, "mean_token_accuracy": 0.08401809930801392, "num_tokens": 81394.0, "step": 40 }, { "entropy": 8.087946605682372, "epoch": 0.04475385380407757, "grad_norm": 1.171875, "learning_rate": 2.2e-05, "loss": 7.9606, "mean_token_accuracy": 0.08528241962194442, "num_tokens": 92491.0, "step": 45 }, { "entropy": 8.078335189819336, "epoch": 0.04972650422675286, "grad_norm": 1.0390625, "learning_rate": 2.4500000000000003e-05, "loss": 7.788, "mean_token_accuracy": 0.09470873698592186, "num_tokens": 102113.0, "step": 50 }, { "entropy": 8.062228298187256, "epoch": 0.05469915464942814, "grad_norm": 1.8125, "learning_rate": 2.7e-05, "loss": 7.9462, "mean_token_accuracy": 0.08278393298387528, "num_tokens": 112211.0, "step": 55 }, { "entropy": 8.023606491088866, "epoch": 0.05967180507210343, "grad_norm": 0.953125, "learning_rate": 2.95e-05, "loss": 7.7747, "mean_token_accuracy": 0.0901342697441578, "num_tokens": 122166.0, "step": 60 }, { "entropy": 8.003111219406128, "epoch": 0.06464445549477872, "grad_norm": 1.015625, "learning_rate": 3.2e-05, "loss": 7.7581, "mean_token_accuracy": 0.09486681148409844, "num_tokens": 131016.0, "step": 65 }, { "entropy": 7.973823165893554, "epoch": 0.069617105917454, "grad_norm": 1.1015625, "learning_rate": 3.4500000000000005e-05, "loss": 7.8401, "mean_token_accuracy": 0.09549511298537254, "num_tokens": 141369.0, "step": 70 }, { "entropy": 8.026473474502563, "epoch": 0.07458975634012929, "grad_norm": 1.015625, "learning_rate": 3.7e-05, "loss": 7.7438, "mean_token_accuracy": 0.09063734859228134, "num_tokens": 150939.0, "step": 75 }, { "entropy": 8.038272190093995, "epoch": 0.07956240676280457, "grad_norm": 1.0546875, "learning_rate": 3.95e-05, "loss": 7.7447, "mean_token_accuracy": 0.09616999849677085, "num_tokens": 159981.0, "step": 80 }, { "entropy": 7.98382682800293, "epoch": 0.08453505718547986, "grad_norm": 1.03125, "learning_rate": 4.2000000000000004e-05, "loss": 7.7952, "mean_token_accuracy": 0.08998179510235786, "num_tokens": 170139.0, "step": 85 }, { "entropy": 8.070371198654176, "epoch": 0.08950770760815514, "grad_norm": 1.0625, "learning_rate": 4.45e-05, "loss": 7.7446, "mean_token_accuracy": 0.09454798772931099, "num_tokens": 180746.0, "step": 90 }, { "entropy": 8.05376615524292, "epoch": 0.09448035803083044, "grad_norm": 1.09375, "learning_rate": 4.7000000000000004e-05, "loss": 7.6953, "mean_token_accuracy": 0.09375635012984276, "num_tokens": 190250.0, "step": 95 }, { "entropy": 7.960572814941406, "epoch": 0.09945300845350571, "grad_norm": 1.0859375, "learning_rate": 4.9500000000000004e-05, "loss": 7.851, "mean_token_accuracy": 0.08996001482009888, "num_tokens": 201185.0, "step": 100 }, { "entropy": 8.003534412384033, "epoch": 0.10442565887618101, "grad_norm": 1.1171875, "learning_rate": 5.2e-05, "loss": 7.8286, "mean_token_accuracy": 0.08292106837034226, "num_tokens": 211476.0, "step": 105 }, { "entropy": 8.028951740264892, "epoch": 0.10939830929885629, "grad_norm": 1.09375, "learning_rate": 5.45e-05, "loss": 7.7808, "mean_token_accuracy": 0.08876777328550815, "num_tokens": 220965.0, "step": 110 }, { "entropy": 8.002874565124511, "epoch": 0.11437095972153158, "grad_norm": 0.984375, "learning_rate": 5.7e-05, "loss": 7.8037, "mean_token_accuracy": 0.08823544830083847, "num_tokens": 231539.0, "step": 115 }, { "entropy": 8.01924533843994, "epoch": 0.11934361014420686, "grad_norm": 1.1015625, "learning_rate": 5.9499999999999996e-05, "loss": 7.7812, "mean_token_accuracy": 0.08827254623174667, "num_tokens": 241206.0, "step": 120 }, { "entropy": 7.982138299942017, "epoch": 0.12431626056688215, "grad_norm": 1.0859375, "learning_rate": 6.2e-05, "loss": 7.7187, "mean_token_accuracy": 0.09137163013219833, "num_tokens": 250629.0, "step": 125 }, { "entropy": 8.054266786575317, "epoch": 0.12928891098955744, "grad_norm": 1.09375, "learning_rate": 6.450000000000001e-05, "loss": 7.8412, "mean_token_accuracy": 0.09213275685906411, "num_tokens": 260705.0, "step": 130 }, { "entropy": 8.1447190284729, "epoch": 0.13426156141223272, "grad_norm": 1.03125, "learning_rate": 6.7e-05, "loss": 7.7988, "mean_token_accuracy": 0.09144297614693642, "num_tokens": 270499.0, "step": 135 }, { "entropy": 8.07759428024292, "epoch": 0.139234211834908, "grad_norm": 1.2265625, "learning_rate": 6.950000000000001e-05, "loss": 7.8214, "mean_token_accuracy": 0.08136414065957069, "num_tokens": 279998.0, "step": 140 }, { "entropy": 7.998452997207641, "epoch": 0.14420686225758328, "grad_norm": 1.0859375, "learning_rate": 7.2e-05, "loss": 7.7959, "mean_token_accuracy": 0.09346884936094284, "num_tokens": 290322.0, "step": 145 }, { "entropy": 8.026957654953003, "epoch": 0.14917951268025859, "grad_norm": 1.046875, "learning_rate": 7.45e-05, "loss": 7.741, "mean_token_accuracy": 0.09033143669366836, "num_tokens": 299893.0, "step": 150 }, { "entropy": 7.940546894073487, "epoch": 0.15415216310293386, "grad_norm": 1.234375, "learning_rate": 7.7e-05, "loss": 7.7927, "mean_token_accuracy": 0.09222338274121285, "num_tokens": 309191.0, "step": 155 }, { "entropy": 8.115492153167725, "epoch": 0.15912481352560914, "grad_norm": 1.140625, "learning_rate": 7.950000000000001e-05, "loss": 7.7385, "mean_token_accuracy": 0.09139059036970139, "num_tokens": 318494.0, "step": 160 }, { "entropy": 7.960078859329224, "epoch": 0.16409746394828442, "grad_norm": 1.078125, "learning_rate": 8.2e-05, "loss": 7.7788, "mean_token_accuracy": 0.0923788644373417, "num_tokens": 328299.0, "step": 165 }, { "entropy": 8.144480419158935, "epoch": 0.16907011437095973, "grad_norm": 1.1328125, "learning_rate": 8.450000000000001e-05, "loss": 7.8496, "mean_token_accuracy": 0.08552220612764358, "num_tokens": 338878.0, "step": 170 }, { "entropy": 8.092591524124146, "epoch": 0.174042764793635, "grad_norm": 1.3046875, "learning_rate": 8.7e-05, "loss": 7.7971, "mean_token_accuracy": 0.08752194195985794, "num_tokens": 348508.0, "step": 175 }, { "entropy": 7.965788459777832, "epoch": 0.1790154152163103, "grad_norm": 1.125, "learning_rate": 8.95e-05, "loss": 7.7449, "mean_token_accuracy": 0.08802809938788414, "num_tokens": 358233.0, "step": 180 }, { "entropy": 8.010887241363525, "epoch": 0.1839880656389856, "grad_norm": 1.34375, "learning_rate": 9.2e-05, "loss": 7.7062, "mean_token_accuracy": 0.09302832186222076, "num_tokens": 367297.0, "step": 185 }, { "entropy": 8.047781038284302, "epoch": 0.18896071606166087, "grad_norm": 1.0546875, "learning_rate": 9.45e-05, "loss": 7.7319, "mean_token_accuracy": 0.08684638142585754, "num_tokens": 376880.0, "step": 190 }, { "entropy": 8.015840673446656, "epoch": 0.19393336648433615, "grad_norm": 1.0546875, "learning_rate": 9.7e-05, "loss": 7.7585, "mean_token_accuracy": 0.09129639342427254, "num_tokens": 386806.0, "step": 195 }, { "entropy": 7.969292211532593, "epoch": 0.19890601690701143, "grad_norm": 1.359375, "learning_rate": 9.95e-05, "loss": 7.7064, "mean_token_accuracy": 0.0939807079732418, "num_tokens": 396161.0, "step": 200 }, { "entropy": 8.018733930587768, "epoch": 0.20387866732968674, "grad_norm": 1.265625, "learning_rate": 0.000102, "loss": 7.7352, "mean_token_accuracy": 0.09067206978797912, "num_tokens": 405643.0, "step": 205 }, { "entropy": 8.042714643478394, "epoch": 0.20885131775236201, "grad_norm": 1.15625, "learning_rate": 0.00010449999999999999, "loss": 7.7571, "mean_token_accuracy": 0.09590560421347619, "num_tokens": 414367.0, "step": 210 }, { "entropy": 8.020010566711425, "epoch": 0.2138239681750373, "grad_norm": 1.15625, "learning_rate": 0.000107, "loss": 7.7188, "mean_token_accuracy": 0.09117217287421227, "num_tokens": 424430.0, "step": 215 }, { "entropy": 8.063075876235962, "epoch": 0.21879661859771257, "grad_norm": 1.1328125, "learning_rate": 0.0001095, "loss": 7.7448, "mean_token_accuracy": 0.09226949140429497, "num_tokens": 435176.0, "step": 220 }, { "entropy": 8.007707548141479, "epoch": 0.22376926902038788, "grad_norm": 1.1640625, "learning_rate": 0.000112, "loss": 7.8191, "mean_token_accuracy": 0.09036103039979934, "num_tokens": 445611.0, "step": 225 }, { "entropy": 8.024854516983032, "epoch": 0.22874191944306316, "grad_norm": 1.1796875, "learning_rate": 0.0001145, "loss": 7.732, "mean_token_accuracy": 0.09320453926920891, "num_tokens": 455143.0, "step": 230 }, { "entropy": 8.067090892791748, "epoch": 0.23371456986573844, "grad_norm": 1.6953125, "learning_rate": 0.00011700000000000001, "loss": 7.7643, "mean_token_accuracy": 0.09478386417031288, "num_tokens": 465507.0, "step": 235 }, { "entropy": 8.055903482437134, "epoch": 0.23868722028841372, "grad_norm": 1.0703125, "learning_rate": 0.00011949999999999999, "loss": 7.8112, "mean_token_accuracy": 0.08999223560094834, "num_tokens": 476152.0, "step": 240 }, { "entropy": 7.923675012588501, "epoch": 0.24365987071108902, "grad_norm": 1.0859375, "learning_rate": 0.000122, "loss": 7.6274, "mean_token_accuracy": 0.09889271780848503, "num_tokens": 486341.0, "step": 245 }, { "entropy": 7.941055393218994, "epoch": 0.2486325211337643, "grad_norm": 1.109375, "learning_rate": 0.0001245, "loss": 7.5837, "mean_token_accuracy": 0.09929879531264305, "num_tokens": 495915.0, "step": 250 }, { "entropy": 7.947218942642212, "epoch": 0.2536051715564396, "grad_norm": 1.1953125, "learning_rate": 0.000127, "loss": 7.7126, "mean_token_accuracy": 0.09258004277944565, "num_tokens": 505666.0, "step": 255 }, { "entropy": 7.92978081703186, "epoch": 0.2585778219791149, "grad_norm": 1.1484375, "learning_rate": 0.0001295, "loss": 7.5981, "mean_token_accuracy": 0.09562918171286583, "num_tokens": 515411.0, "step": 260 }, { "entropy": 7.961107540130615, "epoch": 0.26355047240179014, "grad_norm": 1.1796875, "learning_rate": 0.000132, "loss": 7.7116, "mean_token_accuracy": 0.09054910317063332, "num_tokens": 525018.0, "step": 265 }, { "entropy": 7.943254613876343, "epoch": 0.26852312282446544, "grad_norm": 1.1953125, "learning_rate": 0.00013450000000000002, "loss": 7.6326, "mean_token_accuracy": 0.09534763172268867, "num_tokens": 535056.0, "step": 270 }, { "entropy": 7.991715574264527, "epoch": 0.27349577324714075, "grad_norm": 1.1484375, "learning_rate": 0.00013700000000000002, "loss": 7.6291, "mean_token_accuracy": 0.09336584955453872, "num_tokens": 545115.0, "step": 275 }, { "entropy": 8.080969667434692, "epoch": 0.278468423669816, "grad_norm": 1.1953125, "learning_rate": 0.0001395, "loss": 7.6495, "mean_token_accuracy": 0.09909325316548348, "num_tokens": 554429.0, "step": 280 }, { "entropy": 7.849652528762817, "epoch": 0.2834410740924913, "grad_norm": 1.1953125, "learning_rate": 0.00014199999999999998, "loss": 7.5983, "mean_token_accuracy": 0.10442101955413818, "num_tokens": 563357.0, "step": 285 }, { "entropy": 7.9693444728851315, "epoch": 0.28841372451516656, "grad_norm": 1.140625, "learning_rate": 0.0001445, "loss": 7.6591, "mean_token_accuracy": 0.09824569448828697, "num_tokens": 574480.0, "step": 290 }, { "entropy": 7.956569957733154, "epoch": 0.29338637493784187, "grad_norm": 1.1484375, "learning_rate": 0.000147, "loss": 7.6345, "mean_token_accuracy": 0.0936326451599598, "num_tokens": 583722.0, "step": 295 }, { "entropy": 7.912858390808106, "epoch": 0.29835902536051717, "grad_norm": 1.0625, "learning_rate": 0.0001495, "loss": 7.5976, "mean_token_accuracy": 0.10199215114116669, "num_tokens": 593644.0, "step": 300 }, { "entropy": 7.891701698303223, "epoch": 0.3033316757831924, "grad_norm": 1.1796875, "learning_rate": 0.000152, "loss": 7.6595, "mean_token_accuracy": 0.09747006073594093, "num_tokens": 603547.0, "step": 305 }, { "entropy": 7.942541217803955, "epoch": 0.30830432620586773, "grad_norm": 1.1953125, "learning_rate": 0.00015450000000000001, "loss": 7.6749, "mean_token_accuracy": 0.09077658727765084, "num_tokens": 613880.0, "step": 310 }, { "entropy": 8.01622257232666, "epoch": 0.31327697662854304, "grad_norm": 1.5078125, "learning_rate": 0.000157, "loss": 7.6791, "mean_token_accuracy": 0.09485002011060714, "num_tokens": 624213.0, "step": 315 }, { "entropy": 7.940730810165405, "epoch": 0.3182496270512183, "grad_norm": 1.390625, "learning_rate": 0.0001595, "loss": 7.7188, "mean_token_accuracy": 0.09535183757543564, "num_tokens": 634350.0, "step": 320 }, { "entropy": 8.01810598373413, "epoch": 0.3232222774738936, "grad_norm": 1.296875, "learning_rate": 0.000162, "loss": 7.6764, "mean_token_accuracy": 0.09407038241624832, "num_tokens": 644040.0, "step": 325 }, { "entropy": 7.90651569366455, "epoch": 0.32819492789656884, "grad_norm": 1.1953125, "learning_rate": 0.00016450000000000001, "loss": 7.6464, "mean_token_accuracy": 0.09886646866798401, "num_tokens": 652915.0, "step": 330 }, { "entropy": 7.997863626480102, "epoch": 0.33316757831924415, "grad_norm": 1.2421875, "learning_rate": 0.00016700000000000002, "loss": 7.663, "mean_token_accuracy": 0.09337838441133499, "num_tokens": 662665.0, "step": 335 }, { "entropy": 7.880599927902222, "epoch": 0.33814022874191946, "grad_norm": 1.1015625, "learning_rate": 0.00016950000000000003, "loss": 7.6934, "mean_token_accuracy": 0.09364098682999611, "num_tokens": 671667.0, "step": 340 }, { "entropy": 8.07152271270752, "epoch": 0.3431128791645947, "grad_norm": 1.359375, "learning_rate": 0.00017199999999999998, "loss": 7.6974, "mean_token_accuracy": 0.08758332729339599, "num_tokens": 680432.0, "step": 345 }, { "entropy": 7.930040788650513, "epoch": 0.34808552958727, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 7.7059, "mean_token_accuracy": 0.09117975533008575, "num_tokens": 690184.0, "step": 350 }, { "entropy": 7.958481740951538, "epoch": 0.3530581800099453, "grad_norm": 1.265625, "learning_rate": 0.000177, "loss": 7.5809, "mean_token_accuracy": 0.09757120013237, "num_tokens": 699147.0, "step": 355 }, { "entropy": 7.778140354156494, "epoch": 0.3580308304326206, "grad_norm": 1.140625, "learning_rate": 0.0001795, "loss": 7.6241, "mean_token_accuracy": 0.09795154929161072, "num_tokens": 708696.0, "step": 360 }, { "entropy": 7.94059271812439, "epoch": 0.3630034808552959, "grad_norm": 1.171875, "learning_rate": 0.000182, "loss": 7.5868, "mean_token_accuracy": 0.09651872366666794, "num_tokens": 718438.0, "step": 365 }, { "entropy": 7.958788824081421, "epoch": 0.3679761312779712, "grad_norm": 1.265625, "learning_rate": 0.0001845, "loss": 7.7347, "mean_token_accuracy": 0.08726413100957871, "num_tokens": 728157.0, "step": 370 }, { "entropy": 7.920962810516357, "epoch": 0.37294878170064644, "grad_norm": 1.3671875, "learning_rate": 0.000187, "loss": 7.6345, "mean_token_accuracy": 0.09856286793947219, "num_tokens": 737007.0, "step": 375 }, { "entropy": 7.974191665649414, "epoch": 0.37792143212332174, "grad_norm": 1.3515625, "learning_rate": 0.0001895, "loss": 7.5487, "mean_token_accuracy": 0.1027902714908123, "num_tokens": 746873.0, "step": 380 }, { "entropy": 7.777252101898194, "epoch": 0.382894082545997, "grad_norm": 1.21875, "learning_rate": 0.000192, "loss": 7.4764, "mean_token_accuracy": 0.10671861693263054, "num_tokens": 755486.0, "step": 385 }, { "entropy": 7.895697546005249, "epoch": 0.3878667329686723, "grad_norm": 1.2578125, "learning_rate": 0.0001945, "loss": 7.6079, "mean_token_accuracy": 0.09227629154920577, "num_tokens": 765481.0, "step": 390 }, { "entropy": 7.837667560577392, "epoch": 0.3928393833913476, "grad_norm": 1.328125, "learning_rate": 0.00019700000000000002, "loss": 7.5488, "mean_token_accuracy": 0.09985539466142654, "num_tokens": 774335.0, "step": 395 }, { "entropy": 8.047065830230713, "epoch": 0.39781203381402286, "grad_norm": 1.375, "learning_rate": 0.00019950000000000002, "loss": 7.6338, "mean_token_accuracy": 0.09441028982400894, "num_tokens": 784307.0, "step": 400 }, { "entropy": 7.9048755168914795, "epoch": 0.40278468423669817, "grad_norm": 1.3359375, "learning_rate": 0.000202, "loss": 7.6761, "mean_token_accuracy": 0.09370537623763084, "num_tokens": 795058.0, "step": 405 }, { "entropy": 8.047796821594238, "epoch": 0.40775733465937347, "grad_norm": 1.8515625, "learning_rate": 0.00020449999999999998, "loss": 7.6291, "mean_token_accuracy": 0.09702575877308846, "num_tokens": 805687.0, "step": 410 }, { "entropy": 7.804214286804199, "epoch": 0.4127299850820487, "grad_norm": 1.2265625, "learning_rate": 0.000207, "loss": 7.6174, "mean_token_accuracy": 0.09554455727338791, "num_tokens": 815138.0, "step": 415 }, { "entropy": 7.951880931854248, "epoch": 0.41770263550472403, "grad_norm": 1.234375, "learning_rate": 0.0002095, "loss": 7.5742, "mean_token_accuracy": 0.09677162915468215, "num_tokens": 825009.0, "step": 420 }, { "entropy": 7.795875835418701, "epoch": 0.4226752859273993, "grad_norm": 1.2265625, "learning_rate": 0.000212, "loss": 7.5637, "mean_token_accuracy": 0.09957250207662582, "num_tokens": 834708.0, "step": 425 }, { "entropy": 7.925895738601684, "epoch": 0.4276479363500746, "grad_norm": 1.375, "learning_rate": 0.0002145, "loss": 7.6117, "mean_token_accuracy": 0.0967609629034996, "num_tokens": 843888.0, "step": 430 }, { "entropy": 7.853721952438354, "epoch": 0.4326205867727499, "grad_norm": 1.3515625, "learning_rate": 0.00021700000000000002, "loss": 7.6049, "mean_token_accuracy": 0.09610669240355492, "num_tokens": 853057.0, "step": 435 }, { "entropy": 7.923298740386963, "epoch": 0.43759323719542514, "grad_norm": 1.3046875, "learning_rate": 0.0002195, "loss": 7.6546, "mean_token_accuracy": 0.09225371703505517, "num_tokens": 862701.0, "step": 440 }, { "entropy": 7.815232610702514, "epoch": 0.44256588761810045, "grad_norm": 1.203125, "learning_rate": 0.000222, "loss": 7.549, "mean_token_accuracy": 0.10032494440674782, "num_tokens": 872129.0, "step": 445 }, { "entropy": 7.797481489181519, "epoch": 0.44753853804077576, "grad_norm": 1.15625, "learning_rate": 0.0002245, "loss": 7.5867, "mean_token_accuracy": 0.0956971988081932, "num_tokens": 883166.0, "step": 450 }, { "entropy": 7.8453751564025875, "epoch": 0.452511188463451, "grad_norm": 1.234375, "learning_rate": 0.00022700000000000002, "loss": 7.4193, "mean_token_accuracy": 0.10789886862039566, "num_tokens": 894159.0, "step": 455 }, { "entropy": 7.877769851684571, "epoch": 0.4574838388861263, "grad_norm": 1.1875, "learning_rate": 0.00022950000000000002, "loss": 7.5812, "mean_token_accuracy": 0.09706785902380943, "num_tokens": 904588.0, "step": 460 }, { "entropy": 7.8562257289886475, "epoch": 0.46245648930880157, "grad_norm": 1.3515625, "learning_rate": 0.00023200000000000003, "loss": 7.5406, "mean_token_accuracy": 0.09594281017780304, "num_tokens": 915554.0, "step": 465 }, { "entropy": 7.823633670806885, "epoch": 0.4674291397314769, "grad_norm": 1.234375, "learning_rate": 0.00023449999999999998, "loss": 7.593, "mean_token_accuracy": 0.09437503591179848, "num_tokens": 925546.0, "step": 470 }, { "entropy": 7.860237646102905, "epoch": 0.4724017901541522, "grad_norm": 1.3203125, "learning_rate": 0.000237, "loss": 7.5458, "mean_token_accuracy": 0.09933575987815857, "num_tokens": 936615.0, "step": 475 }, { "entropy": 7.841644430160523, "epoch": 0.47737444057682743, "grad_norm": 1.5234375, "learning_rate": 0.0002395, "loss": 7.5854, "mean_token_accuracy": 0.09283004775643348, "num_tokens": 947374.0, "step": 480 }, { "entropy": 7.803491544723511, "epoch": 0.48234709099950274, "grad_norm": 1.2265625, "learning_rate": 0.000242, "loss": 7.5083, "mean_token_accuracy": 0.09690938144922256, "num_tokens": 957772.0, "step": 485 }, { "entropy": 7.840833377838135, "epoch": 0.48731974142217804, "grad_norm": 1.2578125, "learning_rate": 0.0002445, "loss": 7.6166, "mean_token_accuracy": 0.09776200726628304, "num_tokens": 967724.0, "step": 490 }, { "entropy": 7.732542610168457, "epoch": 0.4922923918448533, "grad_norm": 1.3125, "learning_rate": 0.000247, "loss": 7.5253, "mean_token_accuracy": 0.0953903116285801, "num_tokens": 976497.0, "step": 495 }, { "entropy": 7.777756214141846, "epoch": 0.4972650422675286, "grad_norm": 1.3359375, "learning_rate": 0.0002495, "loss": 7.5113, "mean_token_accuracy": 0.09828274846076965, "num_tokens": 986207.0, "step": 500 }, { "epoch": 0.4972650422675286, "eval_entropy": 7.791762825530795, "eval_loss": 7.572336673736572, "eval_mean_token_accuracy": 0.09290712282559427, "eval_num_tokens": 986207.0, "eval_runtime": 10.6134, "eval_samples_per_second": 326.475, "eval_steps_per_second": 40.892, "step": 500 }, { "entropy": 7.700582551956177, "epoch": 0.5022376926902039, "grad_norm": 1.203125, "learning_rate": 0.000252, "loss": 7.4704, "mean_token_accuracy": 0.10335623621940612, "num_tokens": 995568.0, "step": 505 }, { "entropy": 7.818715000152588, "epoch": 0.5072103431128792, "grad_norm": 1.140625, "learning_rate": 0.0002545, "loss": 7.5242, "mean_token_accuracy": 0.09710540696978569, "num_tokens": 1005829.0, "step": 510 }, { "entropy": 7.748081254959106, "epoch": 0.5121829935355544, "grad_norm": 1.171875, "learning_rate": 0.000257, "loss": 7.4813, "mean_token_accuracy": 0.0990183673799038, "num_tokens": 1015290.0, "step": 515 }, { "entropy": 7.806796503067017, "epoch": 0.5171556439582298, "grad_norm": 1.3359375, "learning_rate": 0.0002595, "loss": 7.4393, "mean_token_accuracy": 0.10151970684528351, "num_tokens": 1024479.0, "step": 520 }, { "entropy": 7.689154100418091, "epoch": 0.522128294380905, "grad_norm": 1.6953125, "learning_rate": 0.000262, "loss": 7.3823, "mean_token_accuracy": 0.10462581366300583, "num_tokens": 1034092.0, "step": 525 }, { "entropy": 7.866795063018799, "epoch": 0.5271009448035803, "grad_norm": 1.1875, "learning_rate": 0.00026450000000000003, "loss": 7.5921, "mean_token_accuracy": 0.09865057915449142, "num_tokens": 1043844.0, "step": 530 }, { "entropy": 7.7049336433410645, "epoch": 0.5320735952262556, "grad_norm": 1.3515625, "learning_rate": 0.00026700000000000004, "loss": 7.438, "mean_token_accuracy": 0.09978735372424126, "num_tokens": 1052646.0, "step": 535 }, { "entropy": 7.812493181228637, "epoch": 0.5370462456489309, "grad_norm": 1.296875, "learning_rate": 0.00026950000000000005, "loss": 7.4984, "mean_token_accuracy": 0.10014364868402481, "num_tokens": 1062345.0, "step": 540 }, { "entropy": 7.697603464126587, "epoch": 0.5420188960716061, "grad_norm": 1.265625, "learning_rate": 0.00027200000000000005, "loss": 7.4877, "mean_token_accuracy": 0.10163192600011825, "num_tokens": 1071116.0, "step": 545 }, { "entropy": 7.705530023574829, "epoch": 0.5469915464942815, "grad_norm": 1.2734375, "learning_rate": 0.0002745, "loss": 7.4518, "mean_token_accuracy": 0.10024819299578666, "num_tokens": 1080562.0, "step": 550 }, { "entropy": 7.769873380661011, "epoch": 0.5519641969169568, "grad_norm": 1.078125, "learning_rate": 0.000277, "loss": 7.5085, "mean_token_accuracy": 0.09623854458332062, "num_tokens": 1091944.0, "step": 555 }, { "entropy": 7.738706064224243, "epoch": 0.556936847339632, "grad_norm": 1.265625, "learning_rate": 0.0002795, "loss": 7.428, "mean_token_accuracy": 0.09941570535302162, "num_tokens": 1101412.0, "step": 560 }, { "entropy": 7.751716041564942, "epoch": 0.5619094977623074, "grad_norm": 1.171875, "learning_rate": 0.00028199999999999997, "loss": 7.5273, "mean_token_accuracy": 0.09751861318945884, "num_tokens": 1110652.0, "step": 565 }, { "entropy": 7.731394052505493, "epoch": 0.5668821481849826, "grad_norm": 1.15625, "learning_rate": 0.0002845, "loss": 7.4286, "mean_token_accuracy": 0.10633731186389923, "num_tokens": 1120420.0, "step": 570 }, { "entropy": 7.672761011123657, "epoch": 0.5718547986076579, "grad_norm": 1.390625, "learning_rate": 0.000287, "loss": 7.4971, "mean_token_accuracy": 0.09915391579270363, "num_tokens": 1130046.0, "step": 575 }, { "entropy": 7.727224063873291, "epoch": 0.5768274490303331, "grad_norm": 1.484375, "learning_rate": 0.0002895, "loss": 7.4616, "mean_token_accuracy": 0.09992800429463386, "num_tokens": 1138946.0, "step": 580 }, { "entropy": 7.676466178894043, "epoch": 0.5818000994530085, "grad_norm": 1.4140625, "learning_rate": 0.000292, "loss": 7.2396, "mean_token_accuracy": 0.10890419781208038, "num_tokens": 1149440.0, "step": 585 }, { "entropy": 7.697867679595947, "epoch": 0.5867727498756837, "grad_norm": 1.2265625, "learning_rate": 0.0002945, "loss": 7.5005, "mean_token_accuracy": 0.09577652290463448, "num_tokens": 1158636.0, "step": 590 }, { "entropy": 7.611849689483643, "epoch": 0.591745400298359, "grad_norm": 1.28125, "learning_rate": 0.000297, "loss": 7.3645, "mean_token_accuracy": 0.10494528487324714, "num_tokens": 1167776.0, "step": 595 }, { "entropy": 7.796306943893432, "epoch": 0.5967180507210343, "grad_norm": 1.140625, "learning_rate": 0.0002995, "loss": 7.3803, "mean_token_accuracy": 0.10176268145442009, "num_tokens": 1177919.0, "step": 600 }, { "entropy": 7.503759813308716, "epoch": 0.6016907011437096, "grad_norm": 1.203125, "learning_rate": 0.000302, "loss": 7.4353, "mean_token_accuracy": 0.10978803336620331, "num_tokens": 1187363.0, "step": 605 }, { "entropy": 7.82352294921875, "epoch": 0.6066633515663848, "grad_norm": 1.3671875, "learning_rate": 0.0003045, "loss": 7.6222, "mean_token_accuracy": 0.0936784565448761, "num_tokens": 1197329.0, "step": 610 }, { "entropy": 7.739608573913574, "epoch": 0.6116360019890602, "grad_norm": 1.3046875, "learning_rate": 0.000307, "loss": 7.5092, "mean_token_accuracy": 0.10064340829849243, "num_tokens": 1207408.0, "step": 615 }, { "entropy": 7.672548484802246, "epoch": 0.6166086524117355, "grad_norm": 1.421875, "learning_rate": 0.0003095, "loss": 7.4761, "mean_token_accuracy": 0.09743527770042419, "num_tokens": 1219258.0, "step": 620 }, { "entropy": 7.729985666275025, "epoch": 0.6215813028344107, "grad_norm": 1.40625, "learning_rate": 0.000312, "loss": 7.4926, "mean_token_accuracy": 0.10201280266046524, "num_tokens": 1228561.0, "step": 625 }, { "entropy": 7.63199667930603, "epoch": 0.6265539532570861, "grad_norm": 1.078125, "learning_rate": 0.0003145, "loss": 7.4172, "mean_token_accuracy": 0.10181611031293869, "num_tokens": 1239665.0, "step": 630 }, { "entropy": 7.664997196197509, "epoch": 0.6315266036797613, "grad_norm": 1.125, "learning_rate": 0.000317, "loss": 7.4299, "mean_token_accuracy": 0.10080647617578506, "num_tokens": 1249490.0, "step": 635 }, { "entropy": 7.661840343475342, "epoch": 0.6364992541024366, "grad_norm": 1.1171875, "learning_rate": 0.0003195, "loss": 7.444, "mean_token_accuracy": 0.09851267859339714, "num_tokens": 1259328.0, "step": 640 }, { "entropy": 7.728383016586304, "epoch": 0.6414719045251119, "grad_norm": 1.21875, "learning_rate": 0.000322, "loss": 7.3382, "mean_token_accuracy": 0.10014413371682167, "num_tokens": 1269523.0, "step": 645 }, { "entropy": 7.566671514511109, "epoch": 0.6464445549477872, "grad_norm": 1.296875, "learning_rate": 0.00032450000000000003, "loss": 7.4814, "mean_token_accuracy": 0.09888403639197349, "num_tokens": 1277961.0, "step": 650 }, { "entropy": 7.71548638343811, "epoch": 0.6514172053704624, "grad_norm": 1.09375, "learning_rate": 0.00032700000000000003, "loss": 7.4241, "mean_token_accuracy": 0.10168351605534554, "num_tokens": 1288228.0, "step": 655 }, { "entropy": 7.617433977127075, "epoch": 0.6563898557931377, "grad_norm": 1.0546875, "learning_rate": 0.00032950000000000004, "loss": 7.3612, "mean_token_accuracy": 0.10187801942229271, "num_tokens": 1299636.0, "step": 660 }, { "entropy": 7.645993185043335, "epoch": 0.661362506215813, "grad_norm": 1.3515625, "learning_rate": 0.00033200000000000005, "loss": 7.4156, "mean_token_accuracy": 0.1010623887181282, "num_tokens": 1310035.0, "step": 665 }, { "entropy": 7.518844509124756, "epoch": 0.6663351566384883, "grad_norm": 1.09375, "learning_rate": 0.00033450000000000005, "loss": 7.4243, "mean_token_accuracy": 0.10684464648365974, "num_tokens": 1320751.0, "step": 670 }, { "entropy": 7.560531044006348, "epoch": 0.6713078070611636, "grad_norm": 1.921875, "learning_rate": 0.000337, "loss": 7.3123, "mean_token_accuracy": 0.1015079528093338, "num_tokens": 1331023.0, "step": 675 }, { "entropy": 7.549887800216675, "epoch": 0.6762804574838389, "grad_norm": 1.2578125, "learning_rate": 0.0003395, "loss": 7.4162, "mean_token_accuracy": 0.0934910848736763, "num_tokens": 1341814.0, "step": 680 }, { "entropy": 7.5861584663391115, "epoch": 0.6812531079065142, "grad_norm": 1.265625, "learning_rate": 0.000342, "loss": 7.3119, "mean_token_accuracy": 0.10053951293230057, "num_tokens": 1351026.0, "step": 685 }, { "entropy": 7.675773239135742, "epoch": 0.6862257583291894, "grad_norm": 1.2265625, "learning_rate": 0.00034449999999999997, "loss": 7.4987, "mean_token_accuracy": 0.09008960351347924, "num_tokens": 1361004.0, "step": 690 }, { "entropy": 7.494913244247437, "epoch": 0.6911984087518648, "grad_norm": 1.453125, "learning_rate": 0.000347, "loss": 7.3688, "mean_token_accuracy": 0.09771248623728752, "num_tokens": 1370729.0, "step": 695 }, { "entropy": 7.63529224395752, "epoch": 0.69617105917454, "grad_norm": 1.296875, "learning_rate": 0.0003495, "loss": 7.3343, "mean_token_accuracy": 0.10306410938501358, "num_tokens": 1379525.0, "step": 700 }, { "entropy": 7.504175186157227, "epoch": 0.7011437095972153, "grad_norm": 1.2890625, "learning_rate": 0.000352, "loss": 7.4201, "mean_token_accuracy": 0.09782344102859497, "num_tokens": 1389863.0, "step": 705 }, { "entropy": 7.53595929145813, "epoch": 0.7061163600198906, "grad_norm": 1.3984375, "learning_rate": 0.0003545, "loss": 7.5219, "mean_token_accuracy": 0.09682246819138526, "num_tokens": 1399468.0, "step": 710 }, { "entropy": 7.5885009765625, "epoch": 0.7110890104425659, "grad_norm": 1.140625, "learning_rate": 0.000357, "loss": 7.3137, "mean_token_accuracy": 0.1067239873111248, "num_tokens": 1408785.0, "step": 715 }, { "entropy": 7.479005336761475, "epoch": 0.7160616608652411, "grad_norm": 1.25, "learning_rate": 0.0003595, "loss": 7.3641, "mean_token_accuracy": 0.106873170286417, "num_tokens": 1418666.0, "step": 720 }, { "entropy": 7.666646814346313, "epoch": 0.7210343112879165, "grad_norm": 1.2734375, "learning_rate": 0.000362, "loss": 7.456, "mean_token_accuracy": 0.10155233442783355, "num_tokens": 1428699.0, "step": 725 }, { "entropy": 7.585138511657715, "epoch": 0.7260069617105918, "grad_norm": 1.3359375, "learning_rate": 0.0003645, "loss": 7.3622, "mean_token_accuracy": 0.1017698161303997, "num_tokens": 1437354.0, "step": 730 }, { "entropy": 7.572378015518188, "epoch": 0.730979612133267, "grad_norm": 1.2578125, "learning_rate": 0.000367, "loss": 7.3688, "mean_token_accuracy": 0.1023016132414341, "num_tokens": 1447327.0, "step": 735 }, { "entropy": 7.603588342666626, "epoch": 0.7359522625559424, "grad_norm": 1.140625, "learning_rate": 0.0003695, "loss": 7.4419, "mean_token_accuracy": 0.103351029753685, "num_tokens": 1457793.0, "step": 740 }, { "entropy": 7.511776924133301, "epoch": 0.7409249129786176, "grad_norm": 1.1328125, "learning_rate": 0.000372, "loss": 7.3378, "mean_token_accuracy": 0.10458240360021591, "num_tokens": 1467143.0, "step": 745 }, { "entropy": 7.545070505142212, "epoch": 0.7458975634012929, "grad_norm": 1.3515625, "learning_rate": 0.0003745, "loss": 7.4118, "mean_token_accuracy": 0.1036214292049408, "num_tokens": 1476422.0, "step": 750 }, { "entropy": 7.486561870574951, "epoch": 0.7508702138239681, "grad_norm": 1.3046875, "learning_rate": 0.000377, "loss": 7.3393, "mean_token_accuracy": 0.10872172713279724, "num_tokens": 1486253.0, "step": 755 }, { "entropy": 7.460987997055054, "epoch": 0.7558428642466435, "grad_norm": 1.2578125, "learning_rate": 0.0003795, "loss": 7.3504, "mean_token_accuracy": 0.10164174363017082, "num_tokens": 1496080.0, "step": 760 }, { "entropy": 7.541303873062134, "epoch": 0.7608155146693187, "grad_norm": 1.1875, "learning_rate": 0.000382, "loss": 7.2914, "mean_token_accuracy": 0.10655068382620811, "num_tokens": 1505532.0, "step": 765 }, { "entropy": 7.487213468551635, "epoch": 0.765788165091994, "grad_norm": 1.1015625, "learning_rate": 0.0003845, "loss": 7.2302, "mean_token_accuracy": 0.10376732945442199, "num_tokens": 1515705.0, "step": 770 }, { "entropy": 7.382348251342774, "epoch": 0.7707608155146694, "grad_norm": 1.140625, "learning_rate": 0.00038700000000000003, "loss": 7.3104, "mean_token_accuracy": 0.10365234911441804, "num_tokens": 1525651.0, "step": 775 }, { "entropy": 7.496106147766113, "epoch": 0.7757334659373446, "grad_norm": 1.34375, "learning_rate": 0.00038950000000000003, "loss": 7.2997, "mean_token_accuracy": 0.10095278844237328, "num_tokens": 1534576.0, "step": 780 }, { "entropy": 7.319676780700684, "epoch": 0.7807061163600199, "grad_norm": 3.75, "learning_rate": 0.00039200000000000004, "loss": 7.1693, "mean_token_accuracy": 0.1153423972427845, "num_tokens": 1544765.0, "step": 785 }, { "entropy": 7.5089842796325685, "epoch": 0.7856787667826952, "grad_norm": 1.234375, "learning_rate": 0.00039450000000000005, "loss": 7.2884, "mean_token_accuracy": 0.11112908571958542, "num_tokens": 1553636.0, "step": 790 }, { "entropy": 7.429884243011474, "epoch": 0.7906514172053705, "grad_norm": 1.1171875, "learning_rate": 0.00039700000000000005, "loss": 7.2552, "mean_token_accuracy": 0.10479394719004631, "num_tokens": 1563356.0, "step": 795 }, { "entropy": 7.357166290283203, "epoch": 0.7956240676280457, "grad_norm": 1.109375, "learning_rate": 0.0003995, "loss": 7.2638, "mean_token_accuracy": 0.10951004400849343, "num_tokens": 1572508.0, "step": 800 }, { "entropy": 7.495957851409912, "epoch": 0.8005967180507211, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 7.3002, "mean_token_accuracy": 0.10887534394860268, "num_tokens": 1581583.0, "step": 805 }, { "entropy": 7.4536933422088625, "epoch": 0.8055693684733963, "grad_norm": 1.2421875, "learning_rate": 0.0004045, "loss": 7.3065, "mean_token_accuracy": 0.10426458492875099, "num_tokens": 1592114.0, "step": 810 }, { "entropy": 7.473225355148315, "epoch": 0.8105420188960716, "grad_norm": 1.171875, "learning_rate": 0.00040699999999999997, "loss": 7.2075, "mean_token_accuracy": 0.10634186267852783, "num_tokens": 1602417.0, "step": 815 }, { "entropy": 7.363744163513184, "epoch": 0.8155146693187469, "grad_norm": 1.4765625, "learning_rate": 0.0004095, "loss": 7.3076, "mean_token_accuracy": 0.10592522397637368, "num_tokens": 1611753.0, "step": 820 }, { "entropy": 7.4581629753112795, "epoch": 0.8204873197414222, "grad_norm": 1.1484375, "learning_rate": 0.000412, "loss": 7.3749, "mean_token_accuracy": 0.10747737661004067, "num_tokens": 1621959.0, "step": 825 }, { "entropy": 7.386861944198609, "epoch": 0.8254599701640974, "grad_norm": 1.203125, "learning_rate": 0.0004145, "loss": 7.2712, "mean_token_accuracy": 0.10451980754733085, "num_tokens": 1630909.0, "step": 830 }, { "entropy": 7.430747222900391, "epoch": 0.8304326205867727, "grad_norm": 1.078125, "learning_rate": 0.000417, "loss": 7.231, "mean_token_accuracy": 0.10984086617827415, "num_tokens": 1641316.0, "step": 835 }, { "entropy": 7.31324348449707, "epoch": 0.8354052710094481, "grad_norm": 1.2890625, "learning_rate": 0.0004195, "loss": 7.162, "mean_token_accuracy": 0.11068534851074219, "num_tokens": 1651506.0, "step": 840 }, { "entropy": 7.327385950088501, "epoch": 0.8403779214321233, "grad_norm": 1.3359375, "learning_rate": 0.000422, "loss": 7.1863, "mean_token_accuracy": 0.1077701598405838, "num_tokens": 1659871.0, "step": 845 }, { "entropy": 7.48043303489685, "epoch": 0.8453505718547986, "grad_norm": 1.2890625, "learning_rate": 0.0004245, "loss": 7.3945, "mean_token_accuracy": 0.1023897610604763, "num_tokens": 1670178.0, "step": 850 }, { "entropy": 7.385392951965332, "epoch": 0.8503232222774739, "grad_norm": 1.203125, "learning_rate": 0.000427, "loss": 7.2603, "mean_token_accuracy": 0.10792220383882523, "num_tokens": 1680131.0, "step": 855 }, { "entropy": 7.27159686088562, "epoch": 0.8552958727001492, "grad_norm": 1.2421875, "learning_rate": 0.0004295, "loss": 7.1722, "mean_token_accuracy": 0.10633963197469712, "num_tokens": 1689568.0, "step": 860 }, { "entropy": 7.463675117492675, "epoch": 0.8602685231228244, "grad_norm": 1.203125, "learning_rate": 0.000432, "loss": 7.2091, "mean_token_accuracy": 0.11588807627558709, "num_tokens": 1698039.0, "step": 865 }, { "entropy": 7.324467611312866, "epoch": 0.8652411735454998, "grad_norm": 1.2109375, "learning_rate": 0.0004345, "loss": 7.2559, "mean_token_accuracy": 0.11219154074788093, "num_tokens": 1707659.0, "step": 870 }, { "entropy": 7.355623626708985, "epoch": 0.870213823968175, "grad_norm": 1.1640625, "learning_rate": 0.000437, "loss": 7.1977, "mean_token_accuracy": 0.1129053220152855, "num_tokens": 1716952.0, "step": 875 }, { "entropy": 7.395571517944336, "epoch": 0.8751864743908503, "grad_norm": 1.359375, "learning_rate": 0.0004395, "loss": 7.2837, "mean_token_accuracy": 0.10170883014798164, "num_tokens": 1726323.0, "step": 880 }, { "entropy": 7.420442390441894, "epoch": 0.8801591248135257, "grad_norm": 1.0859375, "learning_rate": 0.000442, "loss": 7.2683, "mean_token_accuracy": 0.10080605000257492, "num_tokens": 1736265.0, "step": 885 }, { "entropy": 7.318033504486084, "epoch": 0.8851317752362009, "grad_norm": 1.15625, "learning_rate": 0.0004445, "loss": 7.2224, "mean_token_accuracy": 0.1113182045519352, "num_tokens": 1745150.0, "step": 890 }, { "entropy": 7.413629579544067, "epoch": 0.8901044256588762, "grad_norm": 1.0625, "learning_rate": 0.000447, "loss": 7.3464, "mean_token_accuracy": 0.103422349691391, "num_tokens": 1754641.0, "step": 895 }, { "entropy": 7.228156900405883, "epoch": 0.8950770760815515, "grad_norm": 1.15625, "learning_rate": 0.00044950000000000003, "loss": 7.1335, "mean_token_accuracy": 0.11196400448679925, "num_tokens": 1763468.0, "step": 900 }, { "entropy": 7.363440370559692, "epoch": 0.9000497265042268, "grad_norm": 1.0234375, "learning_rate": 0.00045200000000000004, "loss": 7.2689, "mean_token_accuracy": 0.1072551429271698, "num_tokens": 1774845.0, "step": 905 }, { "entropy": 7.326597213745117, "epoch": 0.905022376926902, "grad_norm": 1.0703125, "learning_rate": 0.00045450000000000004, "loss": 7.2023, "mean_token_accuracy": 0.10989816784858704, "num_tokens": 1784606.0, "step": 910 }, { "entropy": 7.279292297363281, "epoch": 0.9099950273495774, "grad_norm": 1.140625, "learning_rate": 0.00045700000000000005, "loss": 7.2172, "mean_token_accuracy": 0.11103402152657509, "num_tokens": 1793893.0, "step": 915 }, { "entropy": 7.359324836730957, "epoch": 0.9149676777722526, "grad_norm": 1.109375, "learning_rate": 0.00045950000000000006, "loss": 7.2327, "mean_token_accuracy": 0.11132587045431137, "num_tokens": 1804095.0, "step": 920 }, { "entropy": 7.383117151260376, "epoch": 0.9199403281949279, "grad_norm": 1.2109375, "learning_rate": 0.000462, "loss": 7.2325, "mean_token_accuracy": 0.11229527816176414, "num_tokens": 1813475.0, "step": 925 }, { "entropy": 7.1859687805175785, "epoch": 0.9249129786176031, "grad_norm": 1.1171875, "learning_rate": 0.0004645, "loss": 7.1476, "mean_token_accuracy": 0.11770151481032372, "num_tokens": 1822779.0, "step": 930 }, { "entropy": 7.370684814453125, "epoch": 0.9298856290402785, "grad_norm": 1.34375, "learning_rate": 0.000467, "loss": 7.1676, "mean_token_accuracy": 0.1098080925643444, "num_tokens": 1832239.0, "step": 935 }, { "entropy": 7.159108829498291, "epoch": 0.9348582794629537, "grad_norm": 1.5546875, "learning_rate": 0.0004695, "loss": 7.1597, "mean_token_accuracy": 0.10881416276097297, "num_tokens": 1843395.0, "step": 940 }, { "entropy": 7.331651067733764, "epoch": 0.939830929885629, "grad_norm": 1.1484375, "learning_rate": 0.000472, "loss": 7.2928, "mean_token_accuracy": 0.10963825955986976, "num_tokens": 1853861.0, "step": 945 }, { "entropy": 7.316252088546753, "epoch": 0.9448035803083044, "grad_norm": 1.203125, "learning_rate": 0.0004745, "loss": 7.1811, "mean_token_accuracy": 0.11016927137970925, "num_tokens": 1862992.0, "step": 950 }, { "entropy": 7.308121156692505, "epoch": 0.9497762307309796, "grad_norm": 1.0703125, "learning_rate": 0.000477, "loss": 7.2191, "mean_token_accuracy": 0.10547153875231743, "num_tokens": 1871684.0, "step": 955 }, { "entropy": 7.327257347106934, "epoch": 0.9547488811536549, "grad_norm": 1.171875, "learning_rate": 0.0004795, "loss": 7.2388, "mean_token_accuracy": 0.10471320077776909, "num_tokens": 1881956.0, "step": 960 }, { "entropy": 7.2531952381134035, "epoch": 0.9597215315763302, "grad_norm": 1.15625, "learning_rate": 0.000482, "loss": 7.3038, "mean_token_accuracy": 0.1041056789457798, "num_tokens": 1891860.0, "step": 965 }, { "entropy": 7.325952672958374, "epoch": 0.9646941819990055, "grad_norm": 1.125, "learning_rate": 0.0004845, "loss": 7.198, "mean_token_accuracy": 0.11258542090654373, "num_tokens": 1901521.0, "step": 970 }, { "entropy": 7.231018781661987, "epoch": 0.9696668324216807, "grad_norm": 1.2890625, "learning_rate": 0.000487, "loss": 7.1664, "mean_token_accuracy": 0.11102576702833175, "num_tokens": 1910438.0, "step": 975 }, { "entropy": 7.181985664367676, "epoch": 0.9746394828443561, "grad_norm": 1.140625, "learning_rate": 0.0004895, "loss": 7.204, "mean_token_accuracy": 0.11018524467945098, "num_tokens": 1922045.0, "step": 980 }, { "entropy": 7.2546672344207765, "epoch": 0.9796121332670313, "grad_norm": 1.2734375, "learning_rate": 0.000492, "loss": 7.0342, "mean_token_accuracy": 0.12166386395692826, "num_tokens": 1930330.0, "step": 985 }, { "entropy": 7.023459434509277, "epoch": 0.9845847836897066, "grad_norm": 1.1484375, "learning_rate": 0.0004945, "loss": 7.0554, "mean_token_accuracy": 0.11036473363637925, "num_tokens": 1939485.0, "step": 990 }, { "entropy": 7.2998260974884035, "epoch": 0.989557434112382, "grad_norm": 1.0859375, "learning_rate": 0.000497, "loss": 7.1335, "mean_token_accuracy": 0.10684073865413665, "num_tokens": 1949448.0, "step": 995 }, { "entropy": 7.224824094772339, "epoch": 0.9945300845350572, "grad_norm": 0.984375, "learning_rate": 0.0004995, "loss": 7.2343, "mean_token_accuracy": 0.10612170770764351, "num_tokens": 1959923.0, "step": 1000 }, { "epoch": 0.9945300845350572, "eval_entropy": 7.155893044537663, "eval_loss": 7.266453742980957, "eval_mean_token_accuracy": 0.10303841252309111, "eval_num_tokens": 1959923.0, "eval_runtime": 17.9035, "eval_samples_per_second": 193.537, "eval_steps_per_second": 24.241, "step": 1000 } ], "logging_steps": 5, "max_steps": 10050, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3220538609664000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }