{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.41841004184100417, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.891409587860108, "epoch": 0.0041841004184100415, "grad_norm": 24.125, "learning_rate": 2e-06, "loss": 14.1621, "mean_token_accuracy": 0.0, "num_tokens": 9848.0, "step": 5 }, { "entropy": 4.9063023090362545, "epoch": 0.008368200836820083, "grad_norm": 25.0, "learning_rate": 4.5e-06, "loss": 14.0066, "mean_token_accuracy": 0.0, "num_tokens": 18196.0, "step": 10 }, { "entropy": 4.956460618972779, "epoch": 0.012552301255230125, "grad_norm": 27.25, "learning_rate": 7e-06, "loss": 13.9152, "mean_token_accuracy": 0.00022191319148987532, "num_tokens": 26927.0, "step": 15 }, { "entropy": 5.071391153335571, "epoch": 0.016736401673640166, "grad_norm": 34.5, "learning_rate": 9.5e-06, "loss": 13.5124, "mean_token_accuracy": 0.0, "num_tokens": 34987.0, "step": 20 }, { "entropy": 5.681827545166016, "epoch": 0.02092050209205021, "grad_norm": 42.5, "learning_rate": 1.2e-05, "loss": 12.7729, "mean_token_accuracy": 0.0, "num_tokens": 44936.0, "step": 25 }, { "entropy": 7.654202032089233, "epoch": 0.02510460251046025, "grad_norm": 24.5, "learning_rate": 1.4500000000000002e-05, "loss": 11.6009, "mean_token_accuracy": 0.0, "num_tokens": 54562.0, "step": 30 }, { "entropy": 10.472756958007812, "epoch": 0.029288702928870293, "grad_norm": 3.703125, "learning_rate": 1.7000000000000003e-05, "loss": 10.6978, "mean_token_accuracy": 0.005889179778750986, "num_tokens": 63844.0, "step": 35 }, { "entropy": 10.730471515655518, "epoch": 0.03347280334728033, "grad_norm": 3.296875, "learning_rate": 1.95e-05, "loss": 10.5735, "mean_token_accuracy": 0.015836346428841352, "num_tokens": 74331.0, "step": 40 }, { "entropy": 10.730430603027344, "epoch": 0.03765690376569038, "grad_norm": 2.90625, "learning_rate": 2.2e-05, "loss": 10.3807, "mean_token_accuracy": 0.019579107593744993, "num_tokens": 83028.0, "step": 45 }, { "entropy": 10.661893463134765, "epoch": 0.04184100418410042, "grad_norm": 2.265625, "learning_rate": 2.4500000000000003e-05, "loss": 10.2168, "mean_token_accuracy": 0.020131182763725518, "num_tokens": 91395.0, "step": 50 }, { "entropy": 10.666141891479493, "epoch": 0.04602510460251046, "grad_norm": 2.578125, "learning_rate": 2.7e-05, "loss": 10.0907, "mean_token_accuracy": 0.016700492519885302, "num_tokens": 101868.0, "step": 55 }, { "entropy": 10.728130531311034, "epoch": 0.0502092050209205, "grad_norm": 2.03125, "learning_rate": 2.95e-05, "loss": 9.9346, "mean_token_accuracy": 0.02238125018775463, "num_tokens": 110403.0, "step": 60 }, { "entropy": 10.730528163909913, "epoch": 0.05439330543933055, "grad_norm": 1.8828125, "learning_rate": 3.2e-05, "loss": 9.9073, "mean_token_accuracy": 0.02675023004412651, "num_tokens": 119557.0, "step": 65 }, { "entropy": 10.718873310089112, "epoch": 0.058577405857740586, "grad_norm": 1.9765625, "learning_rate": 3.4500000000000005e-05, "loss": 9.7675, "mean_token_accuracy": 0.024789097160100936, "num_tokens": 128903.0, "step": 70 }, { "entropy": 10.718735504150391, "epoch": 0.06276150627615062, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7466, "mean_token_accuracy": 0.03036366552114487, "num_tokens": 137630.0, "step": 75 }, { "entropy": 10.720433235168457, "epoch": 0.06694560669456066, "grad_norm": 1.9296875, "learning_rate": 3.95e-05, "loss": 9.6143, "mean_token_accuracy": 0.03396541755646467, "num_tokens": 146335.0, "step": 80 }, { "entropy": 10.716510105133057, "epoch": 0.07112970711297072, "grad_norm": 1.9765625, "learning_rate": 4.2000000000000004e-05, "loss": 9.5501, "mean_token_accuracy": 0.03693135865032673, "num_tokens": 155766.0, "step": 85 }, { "entropy": 10.7073184967041, "epoch": 0.07531380753138076, "grad_norm": 1.8125, "learning_rate": 4.45e-05, "loss": 9.4819, "mean_token_accuracy": 0.029630407132208346, "num_tokens": 165844.0, "step": 90 }, { "entropy": 10.698113632202148, "epoch": 0.0794979079497908, "grad_norm": 1.8359375, "learning_rate": 4.7000000000000004e-05, "loss": 9.3976, "mean_token_accuracy": 0.040011851117014885, "num_tokens": 174858.0, "step": 95 }, { "entropy": 10.68637809753418, "epoch": 0.08368200836820083, "grad_norm": 1.859375, "learning_rate": 4.9500000000000004e-05, "loss": 9.2692, "mean_token_accuracy": 0.04454572442919016, "num_tokens": 184020.0, "step": 100 }, { "entropy": 10.661810874938965, "epoch": 0.08786610878661087, "grad_norm": 1.8359375, "learning_rate": 5.2e-05, "loss": 9.1619, "mean_token_accuracy": 0.044953469187021255, "num_tokens": 193714.0, "step": 105 }, { "entropy": 10.638691425323486, "epoch": 0.09205020920502092, "grad_norm": 1.875, "learning_rate": 5.45e-05, "loss": 9.0919, "mean_token_accuracy": 0.04682178944349289, "num_tokens": 203139.0, "step": 110 }, { "entropy": 10.608509731292724, "epoch": 0.09623430962343096, "grad_norm": 1.859375, "learning_rate": 5.7e-05, "loss": 8.935, "mean_token_accuracy": 0.05361910648643971, "num_tokens": 212446.0, "step": 115 }, { "entropy": 10.535148620605469, "epoch": 0.100418410041841, "grad_norm": 1.796875, "learning_rate": 5.9499999999999996e-05, "loss": 8.7879, "mean_token_accuracy": 0.05296131558716297, "num_tokens": 220910.0, "step": 120 }, { "entropy": 10.479767608642579, "epoch": 0.10460251046025104, "grad_norm": 1.6953125, "learning_rate": 6.2e-05, "loss": 8.7201, "mean_token_accuracy": 0.05455400906503201, "num_tokens": 230522.0, "step": 125 }, { "entropy": 10.398798561096191, "epoch": 0.1087866108786611, "grad_norm": 1.7421875, "learning_rate": 6.450000000000001e-05, "loss": 8.5632, "mean_token_accuracy": 0.05519989021122455, "num_tokens": 240092.0, "step": 130 }, { "entropy": 10.31678285598755, "epoch": 0.11297071129707113, "grad_norm": 1.578125, "learning_rate": 6.7e-05, "loss": 8.469, "mean_token_accuracy": 0.056049537286162375, "num_tokens": 249478.0, "step": 135 }, { "entropy": 10.232394123077393, "epoch": 0.11715481171548117, "grad_norm": 1.875, "learning_rate": 6.950000000000001e-05, "loss": 8.2797, "mean_token_accuracy": 0.05960724465548992, "num_tokens": 257714.0, "step": 140 }, { "entropy": 10.128987789154053, "epoch": 0.12133891213389121, "grad_norm": 1.4375, "learning_rate": 7.2e-05, "loss": 8.2716, "mean_token_accuracy": 0.054746852815151216, "num_tokens": 266569.0, "step": 145 }, { "entropy": 10.016991806030273, "epoch": 0.12552301255230125, "grad_norm": 1.34375, "learning_rate": 7.45e-05, "loss": 8.1522, "mean_token_accuracy": 0.05324812866747379, "num_tokens": 276688.0, "step": 150 }, { "entropy": 9.930090236663819, "epoch": 0.1297071129707113, "grad_norm": 1.4375, "learning_rate": 7.7e-05, "loss": 7.969, "mean_token_accuracy": 0.05717452354729176, "num_tokens": 285430.0, "step": 155 }, { "entropy": 9.747330951690675, "epoch": 0.13389121338912133, "grad_norm": 1.34375, "learning_rate": 7.950000000000001e-05, "loss": 7.8918, "mean_token_accuracy": 0.05585745945572853, "num_tokens": 295727.0, "step": 160 }, { "entropy": 9.500588703155518, "epoch": 0.13807531380753138, "grad_norm": 1.0625, "learning_rate": 8.2e-05, "loss": 7.7962, "mean_token_accuracy": 0.05966520681977272, "num_tokens": 304854.0, "step": 165 }, { "entropy": 9.284924411773682, "epoch": 0.14225941422594143, "grad_norm": 1.0546875, "learning_rate": 8.450000000000001e-05, "loss": 7.7152, "mean_token_accuracy": 0.06037968210875988, "num_tokens": 313579.0, "step": 170 }, { "entropy": 9.0167311668396, "epoch": 0.14644351464435146, "grad_norm": 0.9140625, "learning_rate": 8.7e-05, "loss": 7.7018, "mean_token_accuracy": 0.05947771333158016, "num_tokens": 323310.0, "step": 175 }, { "entropy": 8.793067455291748, "epoch": 0.1506276150627615, "grad_norm": 1.0234375, "learning_rate": 8.95e-05, "loss": 7.5597, "mean_token_accuracy": 0.054980911687016486, "num_tokens": 331720.0, "step": 180 }, { "entropy": 8.578739547729493, "epoch": 0.15481171548117154, "grad_norm": 1.328125, "learning_rate": 9.2e-05, "loss": 7.4836, "mean_token_accuracy": 0.05964849032461643, "num_tokens": 340331.0, "step": 185 }, { "entropy": 8.347243404388427, "epoch": 0.1589958158995816, "grad_norm": 1.1640625, "learning_rate": 9.45e-05, "loss": 7.4873, "mean_token_accuracy": 0.05853373594582081, "num_tokens": 349677.0, "step": 190 }, { "entropy": 8.249125862121582, "epoch": 0.16317991631799164, "grad_norm": 0.74609375, "learning_rate": 9.7e-05, "loss": 7.4457, "mean_token_accuracy": 0.05640666857361794, "num_tokens": 358674.0, "step": 195 }, { "entropy": 8.108446025848389, "epoch": 0.16736401673640167, "grad_norm": 0.83203125, "learning_rate": 9.95e-05, "loss": 7.4564, "mean_token_accuracy": 0.05889376923441887, "num_tokens": 368258.0, "step": 200 }, { "entropy": 8.07214674949646, "epoch": 0.17154811715481172, "grad_norm": 1.15625, "learning_rate": 0.000102, "loss": 7.3668, "mean_token_accuracy": 0.06832478605210782, "num_tokens": 377083.0, "step": 205 }, { "entropy": 8.066781759262085, "epoch": 0.17573221757322174, "grad_norm": 1.21875, "learning_rate": 0.00010449999999999999, "loss": 7.4131, "mean_token_accuracy": 0.05864137038588524, "num_tokens": 385456.0, "step": 210 }, { "entropy": 7.966042947769165, "epoch": 0.1799163179916318, "grad_norm": 0.89453125, "learning_rate": 0.000107, "loss": 7.3069, "mean_token_accuracy": 0.06798864156007767, "num_tokens": 395295.0, "step": 215 }, { "entropy": 8.028728580474853, "epoch": 0.18410041841004185, "grad_norm": 1.03125, "learning_rate": 0.0001095, "loss": 7.3528, "mean_token_accuracy": 0.06413010321557522, "num_tokens": 405023.0, "step": 220 }, { "entropy": 7.929877233505249, "epoch": 0.18828451882845187, "grad_norm": 0.8125, "learning_rate": 0.000112, "loss": 7.3556, "mean_token_accuracy": 0.06588337235152722, "num_tokens": 414224.0, "step": 225 }, { "entropy": 7.9531862258911135, "epoch": 0.19246861924686193, "grad_norm": 1.1640625, "learning_rate": 0.0001145, "loss": 7.2507, "mean_token_accuracy": 0.06776628717780113, "num_tokens": 423951.0, "step": 230 }, { "entropy": 7.959342336654663, "epoch": 0.19665271966527198, "grad_norm": 0.96875, "learning_rate": 0.00011700000000000001, "loss": 7.2897, "mean_token_accuracy": 0.0697428148239851, "num_tokens": 432427.0, "step": 235 }, { "entropy": 7.9486246585845945, "epoch": 0.200836820083682, "grad_norm": 1.0390625, "learning_rate": 0.00011949999999999999, "loss": 7.1966, "mean_token_accuracy": 0.07294891811907292, "num_tokens": 441560.0, "step": 240 }, { "entropy": 7.970178651809692, "epoch": 0.20502092050209206, "grad_norm": 1.3828125, "learning_rate": 0.000122, "loss": 7.2917, "mean_token_accuracy": 0.06312177963554859, "num_tokens": 450364.0, "step": 245 }, { "entropy": 7.8968164920806885, "epoch": 0.20920502092050208, "grad_norm": 0.86328125, "learning_rate": 0.0001245, "loss": 7.2249, "mean_token_accuracy": 0.07028925977647305, "num_tokens": 460076.0, "step": 250 }, { "entropy": 7.926723957061768, "epoch": 0.21338912133891214, "grad_norm": 0.9296875, "learning_rate": 0.000127, "loss": 7.1878, "mean_token_accuracy": 0.07347588390111923, "num_tokens": 468718.0, "step": 255 }, { "entropy": 7.886239528656006, "epoch": 0.2175732217573222, "grad_norm": 1.171875, "learning_rate": 0.0001295, "loss": 7.2306, "mean_token_accuracy": 0.07341902256011963, "num_tokens": 478436.0, "step": 260 }, { "entropy": 7.901343250274659, "epoch": 0.2217573221757322, "grad_norm": 1.09375, "learning_rate": 0.000132, "loss": 7.2425, "mean_token_accuracy": 0.07287401147186756, "num_tokens": 486833.0, "step": 265 }, { "entropy": 7.8618532657623295, "epoch": 0.22594142259414227, "grad_norm": 1.015625, "learning_rate": 0.00013450000000000002, "loss": 7.1112, "mean_token_accuracy": 0.08160877451300622, "num_tokens": 495119.0, "step": 270 }, { "entropy": 7.881023740768432, "epoch": 0.2301255230125523, "grad_norm": 2.8125, "learning_rate": 0.00013700000000000002, "loss": 7.2378, "mean_token_accuracy": 0.07865233719348907, "num_tokens": 505396.0, "step": 275 }, { "entropy": 7.713179016113282, "epoch": 0.23430962343096234, "grad_norm": 1.015625, "learning_rate": 0.0001395, "loss": 7.1126, "mean_token_accuracy": 0.07563550472259521, "num_tokens": 515259.0, "step": 280 }, { "entropy": 7.866283369064331, "epoch": 0.2384937238493724, "grad_norm": 1.1640625, "learning_rate": 0.00014199999999999998, "loss": 7.1237, "mean_token_accuracy": 0.07651542238891125, "num_tokens": 523608.0, "step": 285 }, { "entropy": 7.718380069732666, "epoch": 0.24267782426778242, "grad_norm": 1.28125, "learning_rate": 0.0001445, "loss": 7.123, "mean_token_accuracy": 0.07430066615343094, "num_tokens": 534613.0, "step": 290 }, { "entropy": 7.648086595535278, "epoch": 0.24686192468619247, "grad_norm": 0.96484375, "learning_rate": 0.000147, "loss": 7.1218, "mean_token_accuracy": 0.08086465299129486, "num_tokens": 543347.0, "step": 295 }, { "entropy": 7.774254369735718, "epoch": 0.2510460251046025, "grad_norm": 0.9140625, "learning_rate": 0.0001495, "loss": 7.096, "mean_token_accuracy": 0.07647029384970665, "num_tokens": 552371.0, "step": 300 }, { "entropy": 7.655633068084716, "epoch": 0.25523012552301255, "grad_norm": 1.15625, "learning_rate": 0.000152, "loss": 7.0231, "mean_token_accuracy": 0.08150922022759914, "num_tokens": 560742.0, "step": 305 }, { "entropy": 7.669692802429199, "epoch": 0.2594142259414226, "grad_norm": 1.3671875, "learning_rate": 0.00015450000000000001, "loss": 7.1089, "mean_token_accuracy": 0.08333353251218796, "num_tokens": 569960.0, "step": 310 }, { "entropy": 7.660837411880493, "epoch": 0.26359832635983266, "grad_norm": 1.046875, "learning_rate": 0.000157, "loss": 7.0674, "mean_token_accuracy": 0.07987545132637024, "num_tokens": 578859.0, "step": 315 }, { "entropy": 7.71635251045227, "epoch": 0.26778242677824265, "grad_norm": 1.4921875, "learning_rate": 0.0001595, "loss": 7.0662, "mean_token_accuracy": 0.08209685683250427, "num_tokens": 588146.0, "step": 320 }, { "entropy": 7.540524530410766, "epoch": 0.2719665271966527, "grad_norm": 1.3046875, "learning_rate": 0.000162, "loss": 7.0169, "mean_token_accuracy": 0.08419515639543533, "num_tokens": 597268.0, "step": 325 }, { "entropy": 7.600224113464355, "epoch": 0.27615062761506276, "grad_norm": 0.96875, "learning_rate": 0.00016450000000000001, "loss": 6.9492, "mean_token_accuracy": 0.08558865413069724, "num_tokens": 606199.0, "step": 330 }, { "entropy": 7.614625310897827, "epoch": 0.2803347280334728, "grad_norm": 1.1640625, "learning_rate": 0.00016700000000000002, "loss": 7.0511, "mean_token_accuracy": 0.07545995935797692, "num_tokens": 615966.0, "step": 335 }, { "entropy": 7.659131479263306, "epoch": 0.28451882845188287, "grad_norm": 1.4375, "learning_rate": 0.00016950000000000003, "loss": 7.026, "mean_token_accuracy": 0.08085056543350219, "num_tokens": 625689.0, "step": 340 }, { "entropy": 7.566850900650024, "epoch": 0.28870292887029286, "grad_norm": 1.2890625, "learning_rate": 0.00017199999999999998, "loss": 7.061, "mean_token_accuracy": 0.08259228393435478, "num_tokens": 634877.0, "step": 345 }, { "entropy": 7.583298397064209, "epoch": 0.2928870292887029, "grad_norm": 1.0546875, "learning_rate": 0.00017449999999999999, "loss": 6.9891, "mean_token_accuracy": 0.08486707210540771, "num_tokens": 644042.0, "step": 350 }, { "entropy": 7.560001087188721, "epoch": 0.29707112970711297, "grad_norm": 1.21875, "learning_rate": 0.000177, "loss": 6.959, "mean_token_accuracy": 0.08440612144768238, "num_tokens": 653072.0, "step": 355 }, { "entropy": 7.451096248626709, "epoch": 0.301255230125523, "grad_norm": 1.25, "learning_rate": 0.0001795, "loss": 6.9641, "mean_token_accuracy": 0.08682873398065567, "num_tokens": 663686.0, "step": 360 }, { "entropy": 7.523260593414307, "epoch": 0.3054393305439331, "grad_norm": 1.15625, "learning_rate": 0.000182, "loss": 6.9034, "mean_token_accuracy": 0.08619396463036537, "num_tokens": 672293.0, "step": 365 }, { "entropy": 7.444020557403564, "epoch": 0.30962343096234307, "grad_norm": 1.21875, "learning_rate": 0.0001845, "loss": 6.867, "mean_token_accuracy": 0.08871779963374138, "num_tokens": 681758.0, "step": 370 }, { "entropy": 7.431160640716553, "epoch": 0.3138075313807531, "grad_norm": 1.140625, "learning_rate": 0.000187, "loss": 6.8923, "mean_token_accuracy": 0.08616945594549179, "num_tokens": 690727.0, "step": 375 }, { "entropy": 7.471702432632446, "epoch": 0.3179916317991632, "grad_norm": 1.9140625, "learning_rate": 0.0001895, "loss": 6.8543, "mean_token_accuracy": 0.08554501757025719, "num_tokens": 701210.0, "step": 380 }, { "entropy": 7.374780702590942, "epoch": 0.32217573221757323, "grad_norm": 1.5, "learning_rate": 0.000192, "loss": 6.8415, "mean_token_accuracy": 0.08815910518169404, "num_tokens": 710869.0, "step": 385 }, { "entropy": 7.413737440109253, "epoch": 0.3263598326359833, "grad_norm": 1.40625, "learning_rate": 0.0001945, "loss": 6.9429, "mean_token_accuracy": 0.08294537365436554, "num_tokens": 721455.0, "step": 390 }, { "entropy": 7.397308969497681, "epoch": 0.3305439330543933, "grad_norm": 1.1171875, "learning_rate": 0.00019700000000000002, "loss": 6.8361, "mean_token_accuracy": 0.09202742874622345, "num_tokens": 730917.0, "step": 395 }, { "entropy": 7.375412464141846, "epoch": 0.33472803347280333, "grad_norm": 1.71875, "learning_rate": 0.00019950000000000002, "loss": 6.8569, "mean_token_accuracy": 0.09109241589903831, "num_tokens": 739302.0, "step": 400 }, { "entropy": 7.446383142471314, "epoch": 0.3389121338912134, "grad_norm": 1.265625, "learning_rate": 0.000202, "loss": 6.8401, "mean_token_accuracy": 0.08787635415792465, "num_tokens": 748785.0, "step": 405 }, { "entropy": 7.324094533920288, "epoch": 0.34309623430962344, "grad_norm": 1.15625, "learning_rate": 0.00020449999999999998, "loss": 6.7754, "mean_token_accuracy": 0.09026021733880044, "num_tokens": 757215.0, "step": 410 }, { "entropy": 7.308840560913086, "epoch": 0.3472803347280335, "grad_norm": 1.1796875, "learning_rate": 0.000207, "loss": 6.7076, "mean_token_accuracy": 0.09466831386089325, "num_tokens": 765682.0, "step": 415 }, { "entropy": 7.378483152389526, "epoch": 0.3514644351464435, "grad_norm": 1.828125, "learning_rate": 0.0002095, "loss": 6.9007, "mean_token_accuracy": 0.08436162248253823, "num_tokens": 774814.0, "step": 420 }, { "entropy": 7.392928743362427, "epoch": 0.35564853556485354, "grad_norm": 1.7578125, "learning_rate": 0.000212, "loss": 6.8148, "mean_token_accuracy": 0.091542549431324, "num_tokens": 784019.0, "step": 425 }, { "entropy": 7.225587844848633, "epoch": 0.3598326359832636, "grad_norm": 1.1640625, "learning_rate": 0.0002145, "loss": 6.6954, "mean_token_accuracy": 0.0938286691904068, "num_tokens": 793237.0, "step": 430 }, { "entropy": 7.288524055480957, "epoch": 0.36401673640167365, "grad_norm": 1.0, "learning_rate": 0.00021700000000000002, "loss": 6.7272, "mean_token_accuracy": 0.09245252907276154, "num_tokens": 801548.0, "step": 435 }, { "entropy": 7.260332345962524, "epoch": 0.3682008368200837, "grad_norm": 1.34375, "learning_rate": 0.0002195, "loss": 6.7725, "mean_token_accuracy": 0.09467287361621857, "num_tokens": 810974.0, "step": 440 }, { "entropy": 7.250288343429565, "epoch": 0.3723849372384937, "grad_norm": 0.984375, "learning_rate": 0.000222, "loss": 6.6705, "mean_token_accuracy": 0.09519676417112351, "num_tokens": 820023.0, "step": 445 }, { "entropy": 7.248160552978516, "epoch": 0.37656903765690375, "grad_norm": 1.4765625, "learning_rate": 0.0002245, "loss": 6.7607, "mean_token_accuracy": 0.0901703730225563, "num_tokens": 828297.0, "step": 450 }, { "entropy": 7.292386770248413, "epoch": 0.3807531380753138, "grad_norm": 1.359375, "learning_rate": 0.00022700000000000002, "loss": 6.807, "mean_token_accuracy": 0.08642732873558998, "num_tokens": 838268.0, "step": 455 }, { "entropy": 7.304117202758789, "epoch": 0.38493723849372385, "grad_norm": 1.1875, "learning_rate": 0.00022950000000000002, "loss": 6.7244, "mean_token_accuracy": 0.09284975379705429, "num_tokens": 846491.0, "step": 460 }, { "entropy": 7.163941526412964, "epoch": 0.3891213389121339, "grad_norm": 1.0859375, "learning_rate": 0.00023200000000000003, "loss": 6.6779, "mean_token_accuracy": 0.09622682482004166, "num_tokens": 856501.0, "step": 465 }, { "entropy": 7.226222562789917, "epoch": 0.39330543933054396, "grad_norm": 1.625, "learning_rate": 0.00023449999999999998, "loss": 6.7058, "mean_token_accuracy": 0.09297544807195664, "num_tokens": 867054.0, "step": 470 }, { "entropy": 7.1907635688781735, "epoch": 0.39748953974895396, "grad_norm": 1.15625, "learning_rate": 0.000237, "loss": 6.7284, "mean_token_accuracy": 0.0978313222527504, "num_tokens": 875956.0, "step": 475 }, { "entropy": 7.051689147949219, "epoch": 0.401673640167364, "grad_norm": 1.65625, "learning_rate": 0.0002395, "loss": 6.6452, "mean_token_accuracy": 0.09968722686171531, "num_tokens": 884427.0, "step": 480 }, { "entropy": 7.282907915115357, "epoch": 0.40585774058577406, "grad_norm": 1.109375, "learning_rate": 0.000242, "loss": 6.7298, "mean_token_accuracy": 0.09669127762317657, "num_tokens": 894181.0, "step": 485 }, { "entropy": 7.166344404220581, "epoch": 0.4100418410041841, "grad_norm": 1.3671875, "learning_rate": 0.0002445, "loss": 6.5834, "mean_token_accuracy": 0.10224275141954423, "num_tokens": 904076.0, "step": 490 }, { "entropy": 7.067501544952393, "epoch": 0.41422594142259417, "grad_norm": 1.125, "learning_rate": 0.000247, "loss": 6.7161, "mean_token_accuracy": 0.09675642251968383, "num_tokens": 913915.0, "step": 495 }, { "entropy": 7.267646312713623, "epoch": 0.41841004184100417, "grad_norm": 1.1875, "learning_rate": 0.0002495, "loss": 6.7693, "mean_token_accuracy": 0.0949087992310524, "num_tokens": 922876.0, "step": 500 }, { "epoch": 0.41841004184100417, "eval_entropy": 7.11538662354639, "eval_loss": 6.712912559509277, "eval_mean_token_accuracy": 0.1014816391915997, "eval_num_tokens": 922876.0, "eval_runtime": 2.2023, "eval_samples_per_second": 1774.078, "eval_steps_per_second": 222.044, "step": 500 } ], "logging_steps": 5, "max_steps": 11950, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 200351734824960.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }