{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.324012427873946, "eval_steps": 500, "global_step": 6000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.78931941986084, "epoch": 0.004438526409232135, "grad_norm": 1.0390625, "learning_rate": 2e-06, "loss": 7.4769, "mean_token_accuracy": 0.08522442281246186, "num_tokens": 10699.0, "step": 5 }, { "entropy": 7.787262725830078, "epoch": 0.00887705281846427, "grad_norm": 1.0546875, "learning_rate": 4.5e-06, "loss": 7.4824, "mean_token_accuracy": 0.08313449285924435, "num_tokens": 20868.0, "step": 10 }, { "entropy": 7.764151668548584, "epoch": 0.013315579227696404, "grad_norm": 1.046875, "learning_rate": 7e-06, "loss": 7.4352, "mean_token_accuracy": 0.08592776954174042, "num_tokens": 31565.0, "step": 15 }, { "entropy": 7.8020752429962155, "epoch": 0.01775410563692854, "grad_norm": 0.91796875, "learning_rate": 9.5e-06, "loss": 7.5052, "mean_token_accuracy": 0.08421143889427185, "num_tokens": 42396.0, "step": 20 }, { "entropy": 7.809156513214111, "epoch": 0.022192632046160676, "grad_norm": 1.015625, "learning_rate": 1.2e-05, "loss": 7.5029, "mean_token_accuracy": 0.08358340412378311, "num_tokens": 52422.0, "step": 25 }, { "entropy": 7.804666757583618, "epoch": 0.02663115845539281, "grad_norm": 1.0078125, "learning_rate": 1.4500000000000002e-05, "loss": 7.4415, "mean_token_accuracy": 0.0846289798617363, "num_tokens": 63167.0, "step": 30 }, { "entropy": 7.820871639251709, "epoch": 0.031069684864624945, "grad_norm": 0.94921875, "learning_rate": 1.7000000000000003e-05, "loss": 7.4654, "mean_token_accuracy": 0.08765448182821274, "num_tokens": 73620.0, "step": 35 }, { "entropy": 7.827526521682739, "epoch": 0.03550821127385708, "grad_norm": 0.9140625, "learning_rate": 1.95e-05, "loss": 7.3795, "mean_token_accuracy": 0.08707336336374283, "num_tokens": 83176.0, "step": 40 }, { "entropy": 7.789561748504639, "epoch": 0.03994673768308921, "grad_norm": 0.9921875, "learning_rate": 2.2e-05, "loss": 7.435, "mean_token_accuracy": 0.0886497862637043, "num_tokens": 94238.0, "step": 45 }, { "entropy": 7.7829310417175295, "epoch": 0.04438526409232135, "grad_norm": 0.84375, "learning_rate": 2.4500000000000003e-05, "loss": 7.4332, "mean_token_accuracy": 0.08750618845224381, "num_tokens": 104855.0, "step": 50 }, { "entropy": 7.799046611785888, "epoch": 0.048823790501553485, "grad_norm": 0.90625, "learning_rate": 2.7e-05, "loss": 7.4366, "mean_token_accuracy": 0.09203671216964722, "num_tokens": 113812.0, "step": 55 }, { "entropy": 7.795975160598755, "epoch": 0.05326231691078562, "grad_norm": 0.84375, "learning_rate": 2.95e-05, "loss": 7.4903, "mean_token_accuracy": 0.08637641668319702, "num_tokens": 123392.0, "step": 60 }, { "entropy": 7.796218681335449, "epoch": 0.05770084332001776, "grad_norm": 0.8984375, "learning_rate": 3.2e-05, "loss": 7.4831, "mean_token_accuracy": 0.08530961498618125, "num_tokens": 132764.0, "step": 65 }, { "entropy": 7.810373401641845, "epoch": 0.06213936972924989, "grad_norm": 1.0625, "learning_rate": 3.4500000000000005e-05, "loss": 7.434, "mean_token_accuracy": 0.08844730108976365, "num_tokens": 142965.0, "step": 70 }, { "entropy": 7.803947973251343, "epoch": 0.06657789613848203, "grad_norm": 0.90234375, "learning_rate": 3.7e-05, "loss": 7.4512, "mean_token_accuracy": 0.08455823883414268, "num_tokens": 152939.0, "step": 75 }, { "entropy": 7.8467789649963375, "epoch": 0.07101642254771416, "grad_norm": 0.82421875, "learning_rate": 3.95e-05, "loss": 7.5052, "mean_token_accuracy": 0.08405138589441777, "num_tokens": 164455.0, "step": 80 }, { "entropy": 7.778741502761841, "epoch": 0.0754549489569463, "grad_norm": 0.90234375, "learning_rate": 4.2000000000000004e-05, "loss": 7.4599, "mean_token_accuracy": 0.08571180626749993, "num_tokens": 174110.0, "step": 85 }, { "entropy": 7.789217472076416, "epoch": 0.07989347536617843, "grad_norm": 0.8671875, "learning_rate": 4.45e-05, "loss": 7.4293, "mean_token_accuracy": 0.0909264013171196, "num_tokens": 184160.0, "step": 90 }, { "entropy": 7.8063740730285645, "epoch": 0.08433200177541056, "grad_norm": 0.87109375, "learning_rate": 4.7000000000000004e-05, "loss": 7.4067, "mean_token_accuracy": 0.08633613213896751, "num_tokens": 194797.0, "step": 95 }, { "entropy": 7.8098077297210695, "epoch": 0.0887705281846427, "grad_norm": 0.87109375, "learning_rate": 4.9500000000000004e-05, "loss": 7.4494, "mean_token_accuracy": 0.08306959643959999, "num_tokens": 204108.0, "step": 100 }, { "entropy": 7.793222093582154, "epoch": 0.09320905459387484, "grad_norm": 1.0625, "learning_rate": 5.2e-05, "loss": 7.4157, "mean_token_accuracy": 0.08446534052491188, "num_tokens": 214945.0, "step": 105 }, { "entropy": 7.810083961486816, "epoch": 0.09764758100310697, "grad_norm": 0.87890625, "learning_rate": 5.45e-05, "loss": 7.5058, "mean_token_accuracy": 0.08473781980574131, "num_tokens": 226787.0, "step": 110 }, { "entropy": 7.764282941818237, "epoch": 0.1020861074123391, "grad_norm": 0.88671875, "learning_rate": 5.7e-05, "loss": 7.3897, "mean_token_accuracy": 0.08418168947100639, "num_tokens": 237273.0, "step": 115 }, { "entropy": 7.864174175262451, "epoch": 0.10652463382157124, "grad_norm": 1.0078125, "learning_rate": 5.9499999999999996e-05, "loss": 7.4156, "mean_token_accuracy": 0.09291890189051628, "num_tokens": 246793.0, "step": 120 }, { "entropy": 7.779165315628052, "epoch": 0.11096316023080337, "grad_norm": 0.83984375, "learning_rate": 6.2e-05, "loss": 7.4275, "mean_token_accuracy": 0.0859360195696354, "num_tokens": 258022.0, "step": 125 }, { "entropy": 7.7436638355255125, "epoch": 0.11540168664003551, "grad_norm": 0.90625, "learning_rate": 6.450000000000001e-05, "loss": 7.4169, "mean_token_accuracy": 0.08928811252117157, "num_tokens": 267670.0, "step": 130 }, { "entropy": 7.7615663528442385, "epoch": 0.11984021304926765, "grad_norm": 1.0078125, "learning_rate": 6.7e-05, "loss": 7.4734, "mean_token_accuracy": 0.08662445694208146, "num_tokens": 278441.0, "step": 135 }, { "entropy": 7.868949317932129, "epoch": 0.12427873945849978, "grad_norm": 0.98046875, "learning_rate": 6.950000000000001e-05, "loss": 7.44, "mean_token_accuracy": 0.0834168739616871, "num_tokens": 288501.0, "step": 140 }, { "entropy": 7.918918085098267, "epoch": 0.1287172658677319, "grad_norm": 1.0078125, "learning_rate": 7.2e-05, "loss": 7.5111, "mean_token_accuracy": 0.08065465465188026, "num_tokens": 299557.0, "step": 145 }, { "entropy": 7.7995758056640625, "epoch": 0.13315579227696406, "grad_norm": 0.8828125, "learning_rate": 7.45e-05, "loss": 7.4013, "mean_token_accuracy": 0.09215340986847878, "num_tokens": 309221.0, "step": 150 }, { "entropy": 7.789921569824219, "epoch": 0.13759431868619618, "grad_norm": 0.9609375, "learning_rate": 7.7e-05, "loss": 7.3926, "mean_token_accuracy": 0.0882001981139183, "num_tokens": 318890.0, "step": 155 }, { "entropy": 7.7831714153289795, "epoch": 0.14203284509542832, "grad_norm": 0.96484375, "learning_rate": 7.950000000000001e-05, "loss": 7.3731, "mean_token_accuracy": 0.08587820529937744, "num_tokens": 329547.0, "step": 160 }, { "entropy": 7.732769966125488, "epoch": 0.14647137150466044, "grad_norm": 0.8203125, "learning_rate": 8.2e-05, "loss": 7.4036, "mean_token_accuracy": 0.09170155450701714, "num_tokens": 339819.0, "step": 165 }, { "entropy": 7.838970375061035, "epoch": 0.1509098979138926, "grad_norm": 0.96875, "learning_rate": 8.450000000000001e-05, "loss": 7.4284, "mean_token_accuracy": 0.09364147260785102, "num_tokens": 349132.0, "step": 170 }, { "entropy": 7.720353078842163, "epoch": 0.15534842432312473, "grad_norm": 0.98046875, "learning_rate": 8.7e-05, "loss": 7.4269, "mean_token_accuracy": 0.08701886683702469, "num_tokens": 358950.0, "step": 175 }, { "entropy": 7.802455282211303, "epoch": 0.15978695073235685, "grad_norm": 0.93359375, "learning_rate": 8.95e-05, "loss": 7.3911, "mean_token_accuracy": 0.08798973783850669, "num_tokens": 368710.0, "step": 180 }, { "entropy": 7.7396303653717045, "epoch": 0.164225477141589, "grad_norm": 1.03125, "learning_rate": 9.2e-05, "loss": 7.4086, "mean_token_accuracy": 0.09115821123123169, "num_tokens": 377388.0, "step": 185 }, { "entropy": 7.784192132949829, "epoch": 0.16866400355082112, "grad_norm": 1.0078125, "learning_rate": 9.45e-05, "loss": 7.368, "mean_token_accuracy": 0.08906726986169815, "num_tokens": 387860.0, "step": 190 }, { "entropy": 7.78899359703064, "epoch": 0.17310252996005326, "grad_norm": 1.03125, "learning_rate": 9.7e-05, "loss": 7.3988, "mean_token_accuracy": 0.09347473680973054, "num_tokens": 397737.0, "step": 195 }, { "entropy": 7.7772763729095455, "epoch": 0.1775410563692854, "grad_norm": 0.93359375, "learning_rate": 9.95e-05, "loss": 7.4405, "mean_token_accuracy": 0.08559705466032028, "num_tokens": 408016.0, "step": 200 }, { "entropy": 7.831363105773926, "epoch": 0.18197958277851753, "grad_norm": 0.90625, "learning_rate": 0.000102, "loss": 7.4124, "mean_token_accuracy": 0.08368377536535263, "num_tokens": 417578.0, "step": 205 }, { "entropy": 7.737787818908691, "epoch": 0.18641810918774968, "grad_norm": 1.03125, "learning_rate": 0.00010449999999999999, "loss": 7.3308, "mean_token_accuracy": 0.08822357207536698, "num_tokens": 428746.0, "step": 210 }, { "entropy": 7.837935161590576, "epoch": 0.1908566355969818, "grad_norm": 1.0078125, "learning_rate": 0.000107, "loss": 7.39, "mean_token_accuracy": 0.08428716734051704, "num_tokens": 439500.0, "step": 215 }, { "entropy": 7.771363592147827, "epoch": 0.19529516200621394, "grad_norm": 1.0078125, "learning_rate": 0.0001095, "loss": 7.4119, "mean_token_accuracy": 0.08383373767137528, "num_tokens": 450105.0, "step": 220 }, { "entropy": 7.8077551364898685, "epoch": 0.19973368841544606, "grad_norm": 0.96484375, "learning_rate": 0.000112, "loss": 7.3646, "mean_token_accuracy": 0.09255110621452331, "num_tokens": 459800.0, "step": 225 }, { "entropy": 7.745184326171875, "epoch": 0.2041722148246782, "grad_norm": 0.94921875, "learning_rate": 0.0001145, "loss": 7.2759, "mean_token_accuracy": 0.09842955991625786, "num_tokens": 470371.0, "step": 230 }, { "entropy": 7.753671360015869, "epoch": 0.20861074123391035, "grad_norm": 1.0859375, "learning_rate": 0.00011700000000000001, "loss": 7.3007, "mean_token_accuracy": 0.09646429568529129, "num_tokens": 480347.0, "step": 235 }, { "entropy": 7.81769061088562, "epoch": 0.21304926764314247, "grad_norm": 0.90625, "learning_rate": 0.00011949999999999999, "loss": 7.3843, "mean_token_accuracy": 0.08836668208241463, "num_tokens": 491058.0, "step": 240 }, { "entropy": 7.67605414390564, "epoch": 0.21748779405237462, "grad_norm": 1.125, "learning_rate": 0.000122, "loss": 7.3048, "mean_token_accuracy": 0.08849572688341141, "num_tokens": 500826.0, "step": 245 }, { "entropy": 7.790542507171631, "epoch": 0.22192632046160674, "grad_norm": 1.1875, "learning_rate": 0.0001245, "loss": 7.284, "mean_token_accuracy": 0.08906695693731308, "num_tokens": 510952.0, "step": 250 }, { "entropy": 7.7136742115020756, "epoch": 0.22636484687083888, "grad_norm": 0.94921875, "learning_rate": 0.000127, "loss": 7.2967, "mean_token_accuracy": 0.09439613595604897, "num_tokens": 520680.0, "step": 255 }, { "entropy": 7.686872863769532, "epoch": 0.23080337328007103, "grad_norm": 0.98828125, "learning_rate": 0.0001295, "loss": 7.378, "mean_token_accuracy": 0.0834910437464714, "num_tokens": 531400.0, "step": 260 }, { "entropy": 7.752029180526733, "epoch": 0.23524189968930315, "grad_norm": 1.3125, "learning_rate": 0.000132, "loss": 7.4008, "mean_token_accuracy": 0.08466090187430382, "num_tokens": 541657.0, "step": 265 }, { "entropy": 7.805071783065796, "epoch": 0.2396804260985353, "grad_norm": 1.0703125, "learning_rate": 0.00013450000000000002, "loss": 7.3264, "mean_token_accuracy": 0.09501602202653885, "num_tokens": 550609.0, "step": 270 }, { "entropy": 7.560798215866089, "epoch": 0.2441189525077674, "grad_norm": 1.046875, "learning_rate": 0.00013700000000000002, "loss": 7.292, "mean_token_accuracy": 0.09585189595818519, "num_tokens": 561482.0, "step": 275 }, { "entropy": 7.8325278759002686, "epoch": 0.24855747891699956, "grad_norm": 1.1171875, "learning_rate": 0.0001395, "loss": 7.2829, "mean_token_accuracy": 0.09389769136905671, "num_tokens": 570582.0, "step": 280 }, { "entropy": 7.7413294315338135, "epoch": 0.2529960053262317, "grad_norm": 1.015625, "learning_rate": 0.00014199999999999998, "loss": 7.392, "mean_token_accuracy": 0.0857204593718052, "num_tokens": 581206.0, "step": 285 }, { "entropy": 7.825753402709961, "epoch": 0.2574345317354638, "grad_norm": 1.5546875, "learning_rate": 0.0001445, "loss": 7.193, "mean_token_accuracy": 0.09314141124486923, "num_tokens": 592122.0, "step": 290 }, { "entropy": 7.66306438446045, "epoch": 0.26187305814469597, "grad_norm": 1.0546875, "learning_rate": 0.000147, "loss": 7.3151, "mean_token_accuracy": 0.08986739963293075, "num_tokens": 602919.0, "step": 295 }, { "entropy": 7.771809720993042, "epoch": 0.2663115845539281, "grad_norm": 1.0625, "learning_rate": 0.0001495, "loss": 7.2954, "mean_token_accuracy": 0.09381957724690437, "num_tokens": 612864.0, "step": 300 }, { "entropy": 7.627486038208008, "epoch": 0.2707501109631602, "grad_norm": 0.9765625, "learning_rate": 0.000152, "loss": 7.2278, "mean_token_accuracy": 0.09549270346760749, "num_tokens": 622682.0, "step": 305 }, { "entropy": 7.6965526103973385, "epoch": 0.27518863737239235, "grad_norm": 0.9609375, "learning_rate": 0.00015450000000000001, "loss": 7.3782, "mean_token_accuracy": 0.09121644049882889, "num_tokens": 634017.0, "step": 310 }, { "entropy": 7.837769556045532, "epoch": 0.2796271637816245, "grad_norm": 1.109375, "learning_rate": 0.000157, "loss": 7.4513, "mean_token_accuracy": 0.08749650418758392, "num_tokens": 644132.0, "step": 315 }, { "entropy": 7.789153337478638, "epoch": 0.28406569019085665, "grad_norm": 1.0703125, "learning_rate": 0.0001595, "loss": 7.3349, "mean_token_accuracy": 0.09567861631512642, "num_tokens": 655246.0, "step": 320 }, { "entropy": 7.75645751953125, "epoch": 0.2885042166000888, "grad_norm": 1.125, "learning_rate": 0.000162, "loss": 7.3554, "mean_token_accuracy": 0.08929399326443672, "num_tokens": 664899.0, "step": 325 }, { "entropy": 7.748797941207886, "epoch": 0.2929427430093209, "grad_norm": 1.0390625, "learning_rate": 0.00016450000000000001, "loss": 7.375, "mean_token_accuracy": 0.09080832377076149, "num_tokens": 675989.0, "step": 330 }, { "entropy": 7.664048528671264, "epoch": 0.29738126941855303, "grad_norm": 1.1328125, "learning_rate": 0.00016700000000000002, "loss": 7.3221, "mean_token_accuracy": 0.09584744423627853, "num_tokens": 687759.0, "step": 335 }, { "entropy": 7.7706445217132565, "epoch": 0.3018197958277852, "grad_norm": 1.015625, "learning_rate": 0.00016950000000000003, "loss": 7.2649, "mean_token_accuracy": 0.09178439974784851, "num_tokens": 696943.0, "step": 340 }, { "entropy": 7.699291706085205, "epoch": 0.3062583222370173, "grad_norm": 1.265625, "learning_rate": 0.00017199999999999998, "loss": 7.2908, "mean_token_accuracy": 0.0902982622385025, "num_tokens": 708139.0, "step": 345 }, { "entropy": 7.69988489151001, "epoch": 0.31069684864624947, "grad_norm": 1.125, "learning_rate": 0.00017449999999999999, "loss": 7.2561, "mean_token_accuracy": 0.09475043341517449, "num_tokens": 718000.0, "step": 350 }, { "entropy": 7.659535074234009, "epoch": 0.31513537505548156, "grad_norm": 1.140625, "learning_rate": 0.000177, "loss": 7.2602, "mean_token_accuracy": 0.09070580154657364, "num_tokens": 728188.0, "step": 355 }, { "entropy": 7.705199956893921, "epoch": 0.3195739014647137, "grad_norm": 1.0546875, "learning_rate": 0.0001795, "loss": 7.291, "mean_token_accuracy": 0.09317795038223267, "num_tokens": 738590.0, "step": 360 }, { "entropy": 7.739383554458618, "epoch": 0.32401242787394585, "grad_norm": 1.109375, "learning_rate": 0.000182, "loss": 7.3736, "mean_token_accuracy": 0.09111551642417907, "num_tokens": 748628.0, "step": 365 }, { "entropy": 7.654271173477173, "epoch": 0.328450954283178, "grad_norm": 1.3515625, "learning_rate": 0.0001845, "loss": 7.2501, "mean_token_accuracy": 0.09355314895510673, "num_tokens": 760126.0, "step": 370 }, { "entropy": 7.799070549011231, "epoch": 0.33288948069241014, "grad_norm": 1.140625, "learning_rate": 0.000187, "loss": 7.3846, "mean_token_accuracy": 0.08661651834845543, "num_tokens": 770255.0, "step": 375 }, { "entropy": 7.63041615486145, "epoch": 0.33732800710164224, "grad_norm": 0.95703125, "learning_rate": 0.0001895, "loss": 7.3517, "mean_token_accuracy": 0.08633785173296929, "num_tokens": 780744.0, "step": 380 }, { "entropy": 7.73739104270935, "epoch": 0.3417665335108744, "grad_norm": 1.0390625, "learning_rate": 0.000192, "loss": 7.2372, "mean_token_accuracy": 0.09704277291893959, "num_tokens": 790617.0, "step": 385 }, { "entropy": 7.6727227687835695, "epoch": 0.34620505992010653, "grad_norm": 0.9765625, "learning_rate": 0.0001945, "loss": 7.2751, "mean_token_accuracy": 0.09424345120787621, "num_tokens": 800751.0, "step": 390 }, { "entropy": 7.7567243576049805, "epoch": 0.3506435863293387, "grad_norm": 1.2265625, "learning_rate": 0.00019700000000000002, "loss": 7.3627, "mean_token_accuracy": 0.09301683828234672, "num_tokens": 810596.0, "step": 395 }, { "entropy": 7.74293794631958, "epoch": 0.3550821127385708, "grad_norm": 1.078125, "learning_rate": 0.00019950000000000002, "loss": 7.3311, "mean_token_accuracy": 0.08610923066735268, "num_tokens": 821001.0, "step": 400 }, { "entropy": 7.658763313293457, "epoch": 0.3595206391478029, "grad_norm": 1.1171875, "learning_rate": 0.000202, "loss": 7.2313, "mean_token_accuracy": 0.09779016748070717, "num_tokens": 831653.0, "step": 405 }, { "entropy": 7.616789484024048, "epoch": 0.36395916555703506, "grad_norm": 1.0859375, "learning_rate": 0.00020449999999999998, "loss": 7.1687, "mean_token_accuracy": 0.10131467953324318, "num_tokens": 842953.0, "step": 410 }, { "entropy": 7.563587284088134, "epoch": 0.3683976919662672, "grad_norm": 1.0703125, "learning_rate": 0.000207, "loss": 7.2395, "mean_token_accuracy": 0.0917266458272934, "num_tokens": 853521.0, "step": 415 }, { "entropy": 7.62612771987915, "epoch": 0.37283621837549935, "grad_norm": 0.98828125, "learning_rate": 0.0002095, "loss": 7.1909, "mean_token_accuracy": 0.09840409010648728, "num_tokens": 863525.0, "step": 420 }, { "entropy": 7.7186483383178714, "epoch": 0.37727474478473144, "grad_norm": 1.2109375, "learning_rate": 0.000212, "loss": 7.2794, "mean_token_accuracy": 0.09545301347970962, "num_tokens": 874101.0, "step": 425 }, { "entropy": 7.579249715805053, "epoch": 0.3817132711939636, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 7.1828, "mean_token_accuracy": 0.1006378948688507, "num_tokens": 884422.0, "step": 430 }, { "entropy": 7.561653470993042, "epoch": 0.38615179760319573, "grad_norm": 1.0234375, "learning_rate": 0.00021700000000000002, "loss": 7.1764, "mean_token_accuracy": 0.09805170893669128, "num_tokens": 894787.0, "step": 435 }, { "entropy": 7.73306303024292, "epoch": 0.3905903240124279, "grad_norm": 1.0546875, "learning_rate": 0.0002195, "loss": 7.2928, "mean_token_accuracy": 0.08978268429636956, "num_tokens": 906295.0, "step": 440 }, { "entropy": 7.6030584335327145, "epoch": 0.39502885042166, "grad_norm": 1.078125, "learning_rate": 0.000222, "loss": 7.2112, "mean_token_accuracy": 0.09668504521250725, "num_tokens": 916791.0, "step": 445 }, { "entropy": 7.55758113861084, "epoch": 0.3994673768308921, "grad_norm": 1.0546875, "learning_rate": 0.0002245, "loss": 7.1147, "mean_token_accuracy": 0.09961161985993386, "num_tokens": 926383.0, "step": 450 }, { "entropy": 7.644591426849365, "epoch": 0.40390590324012426, "grad_norm": 1.0859375, "learning_rate": 0.00022700000000000002, "loss": 7.1943, "mean_token_accuracy": 0.10151847004890442, "num_tokens": 937319.0, "step": 455 }, { "entropy": 7.615101528167725, "epoch": 0.4083444296493564, "grad_norm": 1.234375, "learning_rate": 0.00022950000000000002, "loss": 7.2615, "mean_token_accuracy": 0.09779548048973083, "num_tokens": 947641.0, "step": 460 }, { "entropy": 7.583732938766479, "epoch": 0.41278295605858856, "grad_norm": 1.2421875, "learning_rate": 0.00023200000000000003, "loss": 7.1568, "mean_token_accuracy": 0.09658500477671624, "num_tokens": 957778.0, "step": 465 }, { "entropy": 7.627662897109985, "epoch": 0.4172214824678207, "grad_norm": 1.171875, "learning_rate": 0.00023449999999999998, "loss": 7.1428, "mean_token_accuracy": 0.09743335545063019, "num_tokens": 967619.0, "step": 470 }, { "entropy": 7.599508905410767, "epoch": 0.4216600088770528, "grad_norm": 1.09375, "learning_rate": 0.000237, "loss": 7.2186, "mean_token_accuracy": 0.09613262861967087, "num_tokens": 978301.0, "step": 475 }, { "entropy": 7.5192223072052, "epoch": 0.42609853528628494, "grad_norm": 1.09375, "learning_rate": 0.0002395, "loss": 7.2032, "mean_token_accuracy": 0.09714524820446968, "num_tokens": 989783.0, "step": 480 }, { "entropy": 7.552160596847534, "epoch": 0.4305370616955171, "grad_norm": 1.0546875, "learning_rate": 0.000242, "loss": 7.0988, "mean_token_accuracy": 0.10628278627991676, "num_tokens": 999827.0, "step": 485 }, { "entropy": 7.5833902835845945, "epoch": 0.43497558810474923, "grad_norm": 1.078125, "learning_rate": 0.0002445, "loss": 7.2168, "mean_token_accuracy": 0.09577535167336464, "num_tokens": 1011294.0, "step": 490 }, { "entropy": 7.581695985794068, "epoch": 0.4394141145139814, "grad_norm": 1.09375, "learning_rate": 0.000247, "loss": 7.1425, "mean_token_accuracy": 0.09786203876137733, "num_tokens": 1021672.0, "step": 495 }, { "entropy": 7.592150259017944, "epoch": 0.44385264092321347, "grad_norm": 1.1796875, "learning_rate": 0.0002495, "loss": 7.1239, "mean_token_accuracy": 0.10068506821990013, "num_tokens": 1031281.0, "step": 500 }, { "epoch": 0.44385264092321347, "eval_entropy": 7.398865165166787, "eval_loss": 7.180932521820068, "eval_mean_token_accuracy": 0.09428256430669806, "eval_num_tokens": 1031281.0, "eval_runtime": 2.1123, "eval_samples_per_second": 1593.963, "eval_steps_per_second": 199.305, "step": 500 }, { "entropy": 7.5125542163848875, "epoch": 0.4482911673324456, "grad_norm": 1.1875, "learning_rate": 0.000252, "loss": 7.1865, "mean_token_accuracy": 0.09644722416996956, "num_tokens": 1042458.0, "step": 505 }, { "entropy": 7.581930828094483, "epoch": 0.45272969374167776, "grad_norm": 1.203125, "learning_rate": 0.0002545, "loss": 7.1654, "mean_token_accuracy": 0.10110429748892784, "num_tokens": 1051645.0, "step": 510 }, { "entropy": 7.556396198272705, "epoch": 0.4571682201509099, "grad_norm": 1.1328125, "learning_rate": 0.000257, "loss": 7.1574, "mean_token_accuracy": 0.10311417281627655, "num_tokens": 1061634.0, "step": 515 }, { "entropy": 7.615333938598633, "epoch": 0.46160674656014206, "grad_norm": 1.15625, "learning_rate": 0.0002595, "loss": 7.1778, "mean_token_accuracy": 0.10142057165503501, "num_tokens": 1071666.0, "step": 520 }, { "entropy": 7.468676328659058, "epoch": 0.46604527296937415, "grad_norm": 1.0703125, "learning_rate": 0.000262, "loss": 7.1345, "mean_token_accuracy": 0.09515785649418831, "num_tokens": 1082652.0, "step": 525 }, { "entropy": 7.533456087112427, "epoch": 0.4704837993786063, "grad_norm": 1.1640625, "learning_rate": 0.00026450000000000003, "loss": 7.0998, "mean_token_accuracy": 0.0970863476395607, "num_tokens": 1092396.0, "step": 530 }, { "entropy": 7.495568656921387, "epoch": 0.47492232578783844, "grad_norm": 1.015625, "learning_rate": 0.00026700000000000004, "loss": 7.0605, "mean_token_accuracy": 0.10546803250908851, "num_tokens": 1102504.0, "step": 535 }, { "entropy": 7.440021228790283, "epoch": 0.4793608521970706, "grad_norm": 1.15625, "learning_rate": 0.00026950000000000005, "loss": 7.112, "mean_token_accuracy": 0.09773821383714676, "num_tokens": 1112505.0, "step": 540 }, { "entropy": 7.558693218231201, "epoch": 0.48379937860630273, "grad_norm": 1.296875, "learning_rate": 0.00027200000000000005, "loss": 7.1158, "mean_token_accuracy": 0.0986550621688366, "num_tokens": 1122603.0, "step": 545 }, { "entropy": 7.461544179916382, "epoch": 0.4882379050155348, "grad_norm": 1.0859375, "learning_rate": 0.0002745, "loss": 7.1284, "mean_token_accuracy": 0.09657116010785102, "num_tokens": 1132178.0, "step": 550 }, { "entropy": 7.562966060638428, "epoch": 0.49267643142476697, "grad_norm": 1.171875, "learning_rate": 0.000277, "loss": 7.0946, "mean_token_accuracy": 0.09613885954022408, "num_tokens": 1141712.0, "step": 555 }, { "entropy": 7.508441638946533, "epoch": 0.4971149578339991, "grad_norm": 1.3828125, "learning_rate": 0.0002795, "loss": 7.1157, "mean_token_accuracy": 0.0992264598608017, "num_tokens": 1151748.0, "step": 560 }, { "entropy": 7.558133125305176, "epoch": 0.5015534842432312, "grad_norm": 2.265625, "learning_rate": 0.00028199999999999997, "loss": 7.0116, "mean_token_accuracy": 0.10735590234398842, "num_tokens": 1161234.0, "step": 565 }, { "entropy": 7.4882372379302975, "epoch": 0.5059920106524634, "grad_norm": 1.359375, "learning_rate": 0.0002845, "loss": 7.0915, "mean_token_accuracy": 0.10239496752619744, "num_tokens": 1171656.0, "step": 570 }, { "entropy": 7.4804298877716064, "epoch": 0.5104305370616955, "grad_norm": 1.0390625, "learning_rate": 0.000287, "loss": 7.1359, "mean_token_accuracy": 0.09924655333161354, "num_tokens": 1182983.0, "step": 575 }, { "entropy": 7.447319459915161, "epoch": 0.5148690634709276, "grad_norm": 1.25, "learning_rate": 0.0002895, "loss": 7.1005, "mean_token_accuracy": 0.09991766214370727, "num_tokens": 1193720.0, "step": 580 }, { "entropy": 7.4760712623596195, "epoch": 0.5193075898801598, "grad_norm": 1.21875, "learning_rate": 0.000292, "loss": 7.0304, "mean_token_accuracy": 0.10363117456436158, "num_tokens": 1203286.0, "step": 585 }, { "entropy": 7.436632061004639, "epoch": 0.5237461162893919, "grad_norm": 1.140625, "learning_rate": 0.0002945, "loss": 7.0193, "mean_token_accuracy": 0.10448477938771247, "num_tokens": 1212875.0, "step": 590 }, { "entropy": 7.479945039749145, "epoch": 0.5281846426986241, "grad_norm": 1.1953125, "learning_rate": 0.000297, "loss": 7.0455, "mean_token_accuracy": 0.09875646382570266, "num_tokens": 1223629.0, "step": 595 }, { "entropy": 7.455782127380371, "epoch": 0.5326231691078562, "grad_norm": 1.3671875, "learning_rate": 0.0002995, "loss": 7.1663, "mean_token_accuracy": 0.10330844521522523, "num_tokens": 1233670.0, "step": 600 }, { "entropy": 7.540210819244384, "epoch": 0.5370616955170884, "grad_norm": 1.3828125, "learning_rate": 0.000302, "loss": 7.0882, "mean_token_accuracy": 0.10033463165163994, "num_tokens": 1244140.0, "step": 605 }, { "entropy": 7.42637152671814, "epoch": 0.5415002219263204, "grad_norm": 1.0390625, "learning_rate": 0.0003045, "loss": 7.0617, "mean_token_accuracy": 0.10370045378804207, "num_tokens": 1254496.0, "step": 610 }, { "entropy": 7.397940731048584, "epoch": 0.5459387483355526, "grad_norm": 1.0859375, "learning_rate": 0.000307, "loss": 7.0262, "mean_token_accuracy": 0.10960142239928246, "num_tokens": 1265391.0, "step": 615 }, { "entropy": 7.426065683364868, "epoch": 0.5503772747447847, "grad_norm": 1.046875, "learning_rate": 0.0003095, "loss": 6.9633, "mean_token_accuracy": 0.10688221156597137, "num_tokens": 1275857.0, "step": 620 }, { "entropy": 7.255760049819946, "epoch": 0.5548158011540169, "grad_norm": 1.109375, "learning_rate": 0.000312, "loss": 6.9785, "mean_token_accuracy": 0.10750289410352706, "num_tokens": 1285122.0, "step": 625 }, { "entropy": 7.525947952270508, "epoch": 0.559254327563249, "grad_norm": 1.390625, "learning_rate": 0.0003145, "loss": 7.0365, "mean_token_accuracy": 0.10156842395663261, "num_tokens": 1294476.0, "step": 630 }, { "entropy": 7.383149433135986, "epoch": 0.5636928539724811, "grad_norm": 1.0703125, "learning_rate": 0.000317, "loss": 7.0386, "mean_token_accuracy": 0.10288441628217697, "num_tokens": 1304959.0, "step": 635 }, { "entropy": 7.389831638336181, "epoch": 0.5681313803817133, "grad_norm": 1.0234375, "learning_rate": 0.0003195, "loss": 6.9818, "mean_token_accuracy": 0.10231715813279152, "num_tokens": 1316121.0, "step": 640 }, { "entropy": 7.392814636230469, "epoch": 0.5725699067909454, "grad_norm": 1.21875, "learning_rate": 0.000322, "loss": 7.0793, "mean_token_accuracy": 0.10169301480054856, "num_tokens": 1326750.0, "step": 645 }, { "entropy": 7.383424234390259, "epoch": 0.5770084332001776, "grad_norm": 1.1015625, "learning_rate": 0.00032450000000000003, "loss": 6.9712, "mean_token_accuracy": 0.10646747648715973, "num_tokens": 1337044.0, "step": 650 }, { "entropy": 7.4170256614685055, "epoch": 0.5814469596094097, "grad_norm": 1.1484375, "learning_rate": 0.00032700000000000003, "loss": 7.0334, "mean_token_accuracy": 0.09991655647754669, "num_tokens": 1347610.0, "step": 655 }, { "entropy": 7.2603747844696045, "epoch": 0.5858854860186418, "grad_norm": 1.1875, "learning_rate": 0.00032950000000000004, "loss": 6.9609, "mean_token_accuracy": 0.10539844930171967, "num_tokens": 1356521.0, "step": 660 }, { "entropy": 7.422995662689209, "epoch": 0.5903240124278739, "grad_norm": 1.1953125, "learning_rate": 0.00033200000000000005, "loss": 6.9662, "mean_token_accuracy": 0.10543927997350692, "num_tokens": 1366741.0, "step": 665 }, { "entropy": 7.369775009155274, "epoch": 0.5947625388371061, "grad_norm": 1.203125, "learning_rate": 0.00033450000000000005, "loss": 7.0411, "mean_token_accuracy": 0.10072910860180855, "num_tokens": 1377018.0, "step": 670 }, { "entropy": 7.43230504989624, "epoch": 0.5992010652463382, "grad_norm": 1.1171875, "learning_rate": 0.000337, "loss": 6.959, "mean_token_accuracy": 0.10484865829348564, "num_tokens": 1386387.0, "step": 675 }, { "entropy": 7.3505573749542235, "epoch": 0.6036395916555704, "grad_norm": 1.2109375, "learning_rate": 0.0003395, "loss": 6.961, "mean_token_accuracy": 0.10673004984855652, "num_tokens": 1396049.0, "step": 680 }, { "entropy": 7.355041980743408, "epoch": 0.6080781180648025, "grad_norm": 1.125, "learning_rate": 0.000342, "loss": 7.0803, "mean_token_accuracy": 0.0983244001865387, "num_tokens": 1406952.0, "step": 685 }, { "entropy": 7.410180234909058, "epoch": 0.6125166444740346, "grad_norm": 1.0703125, "learning_rate": 0.00034449999999999997, "loss": 6.9874, "mean_token_accuracy": 0.10184509009122848, "num_tokens": 1417146.0, "step": 690 }, { "entropy": 7.331110858917237, "epoch": 0.6169551708832668, "grad_norm": 1.2109375, "learning_rate": 0.000347, "loss": 6.9654, "mean_token_accuracy": 0.11014403700828553, "num_tokens": 1426146.0, "step": 695 }, { "entropy": 7.430603981018066, "epoch": 0.6213936972924989, "grad_norm": 1.0390625, "learning_rate": 0.0003495, "loss": 7.0644, "mean_token_accuracy": 0.10093853399157524, "num_tokens": 1437913.0, "step": 700 }, { "entropy": 7.3031325340271, "epoch": 0.625832223701731, "grad_norm": 1.125, "learning_rate": 0.000352, "loss": 6.9308, "mean_token_accuracy": 0.11181655824184418, "num_tokens": 1448329.0, "step": 705 }, { "entropy": 7.382747077941895, "epoch": 0.6302707501109631, "grad_norm": 1.265625, "learning_rate": 0.0003545, "loss": 6.9559, "mean_token_accuracy": 0.10284734219312668, "num_tokens": 1457896.0, "step": 710 }, { "entropy": 7.310059356689453, "epoch": 0.6347092765201953, "grad_norm": 1.21875, "learning_rate": 0.000357, "loss": 6.9601, "mean_token_accuracy": 0.1071910947561264, "num_tokens": 1467705.0, "step": 715 }, { "entropy": 7.25341272354126, "epoch": 0.6391478029294274, "grad_norm": 1.1328125, "learning_rate": 0.0003595, "loss": 6.9512, "mean_token_accuracy": 0.10645409822463989, "num_tokens": 1478132.0, "step": 720 }, { "entropy": 7.391849327087402, "epoch": 0.6435863293386596, "grad_norm": 1.203125, "learning_rate": 0.000362, "loss": 7.019, "mean_token_accuracy": 0.10602135583758354, "num_tokens": 1488424.0, "step": 725 }, { "entropy": 7.310156202316284, "epoch": 0.6480248557478917, "grad_norm": 1.0859375, "learning_rate": 0.0003645, "loss": 6.8812, "mean_token_accuracy": 0.11527719348669052, "num_tokens": 1498197.0, "step": 730 }, { "entropy": 7.234117460250855, "epoch": 0.6524633821571239, "grad_norm": 1.1640625, "learning_rate": 0.000367, "loss": 6.9052, "mean_token_accuracy": 0.10894913673400879, "num_tokens": 1508242.0, "step": 735 }, { "entropy": 7.232631635665894, "epoch": 0.656901908566356, "grad_norm": 1.0859375, "learning_rate": 0.0003695, "loss": 6.8983, "mean_token_accuracy": 0.11159973964095116, "num_tokens": 1517652.0, "step": 740 }, { "entropy": 7.2952375411987305, "epoch": 0.6613404349755881, "grad_norm": 1.1484375, "learning_rate": 0.000372, "loss": 6.9347, "mean_token_accuracy": 0.10787282809615135, "num_tokens": 1527501.0, "step": 745 }, { "entropy": 7.291040468215942, "epoch": 0.6657789613848203, "grad_norm": 0.97265625, "learning_rate": 0.0003745, "loss": 6.9339, "mean_token_accuracy": 0.11132785305380821, "num_tokens": 1537640.0, "step": 750 }, { "entropy": 7.20764536857605, "epoch": 0.6702174877940523, "grad_norm": 1.1640625, "learning_rate": 0.000377, "loss": 6.8701, "mean_token_accuracy": 0.11440131813287735, "num_tokens": 1548049.0, "step": 755 }, { "entropy": 7.340287876129151, "epoch": 0.6746560142032845, "grad_norm": 1.28125, "learning_rate": 0.0003795, "loss": 7.0474, "mean_token_accuracy": 0.10261607840657234, "num_tokens": 1558389.0, "step": 760 }, { "entropy": 7.222410678863525, "epoch": 0.6790945406125166, "grad_norm": 1.0859375, "learning_rate": 0.000382, "loss": 6.8176, "mean_token_accuracy": 0.11613213866949082, "num_tokens": 1568489.0, "step": 765 }, { "entropy": 7.2836723804473875, "epoch": 0.6835330670217488, "grad_norm": 1.1953125, "learning_rate": 0.0003845, "loss": 6.9313, "mean_token_accuracy": 0.10658463388681412, "num_tokens": 1578430.0, "step": 770 }, { "entropy": 7.352204275131226, "epoch": 0.6879715934309809, "grad_norm": 1.09375, "learning_rate": 0.00038700000000000003, "loss": 7.001, "mean_token_accuracy": 0.10380481109023094, "num_tokens": 1590307.0, "step": 775 }, { "entropy": 7.313673448562622, "epoch": 0.6924101198402131, "grad_norm": 1.84375, "learning_rate": 0.00038950000000000003, "loss": 6.8585, "mean_token_accuracy": 0.11356580927968025, "num_tokens": 1601719.0, "step": 780 }, { "entropy": 7.149180507659912, "epoch": 0.6968486462494452, "grad_norm": 1.140625, "learning_rate": 0.00039200000000000004, "loss": 6.8735, "mean_token_accuracy": 0.11371317654848098, "num_tokens": 1612047.0, "step": 785 }, { "entropy": 7.195708179473877, "epoch": 0.7012871726586773, "grad_norm": 1.0546875, "learning_rate": 0.00039450000000000005, "loss": 6.8651, "mean_token_accuracy": 0.11098539307713509, "num_tokens": 1623141.0, "step": 790 }, { "entropy": 7.241322708129883, "epoch": 0.7057256990679095, "grad_norm": 1.1015625, "learning_rate": 0.00039700000000000005, "loss": 6.8738, "mean_token_accuracy": 0.1125923864543438, "num_tokens": 1633249.0, "step": 795 }, { "entropy": 7.270007610321045, "epoch": 0.7101642254771416, "grad_norm": 1.1328125, "learning_rate": 0.0003995, "loss": 6.9612, "mean_token_accuracy": 0.10728915557265281, "num_tokens": 1644451.0, "step": 800 }, { "entropy": 7.245293235778808, "epoch": 0.7146027518863737, "grad_norm": 1.140625, "learning_rate": 0.000402, "loss": 6.8967, "mean_token_accuracy": 0.11031619012355805, "num_tokens": 1655196.0, "step": 805 }, { "entropy": 7.137471008300781, "epoch": 0.7190412782956058, "grad_norm": 1.015625, "learning_rate": 0.0004045, "loss": 6.8781, "mean_token_accuracy": 0.11013623625040055, "num_tokens": 1665613.0, "step": 810 }, { "entropy": 7.282591247558594, "epoch": 0.723479804704838, "grad_norm": 1.140625, "learning_rate": 0.00040699999999999997, "loss": 6.8188, "mean_token_accuracy": 0.11500794291496277, "num_tokens": 1675116.0, "step": 815 }, { "entropy": 7.219833612442017, "epoch": 0.7279183311140701, "grad_norm": 1.3984375, "learning_rate": 0.0004095, "loss": 6.9236, "mean_token_accuracy": 0.10631008669734002, "num_tokens": 1684055.0, "step": 820 }, { "entropy": 7.231753492355347, "epoch": 0.7323568575233023, "grad_norm": 1.1328125, "learning_rate": 0.000412, "loss": 6.7797, "mean_token_accuracy": 0.12125139310956001, "num_tokens": 1694046.0, "step": 825 }, { "entropy": 7.143084859848022, "epoch": 0.7367953839325344, "grad_norm": 1.5078125, "learning_rate": 0.0004145, "loss": 6.8325, "mean_token_accuracy": 0.1153494082391262, "num_tokens": 1704133.0, "step": 830 }, { "entropy": 7.14149580001831, "epoch": 0.7412339103417666, "grad_norm": 1.09375, "learning_rate": 0.000417, "loss": 6.9275, "mean_token_accuracy": 0.11007370427250862, "num_tokens": 1714678.0, "step": 835 }, { "entropy": 7.204297304153442, "epoch": 0.7456724367509987, "grad_norm": 1.21875, "learning_rate": 0.0004195, "loss": 6.7453, "mean_token_accuracy": 0.12288743630051613, "num_tokens": 1725145.0, "step": 840 }, { "entropy": 7.071165657043457, "epoch": 0.7501109631602308, "grad_norm": 1.2109375, "learning_rate": 0.000422, "loss": 6.8729, "mean_token_accuracy": 0.11628773137927055, "num_tokens": 1735530.0, "step": 845 }, { "entropy": 7.21942458152771, "epoch": 0.7545494895694629, "grad_norm": 1.0703125, "learning_rate": 0.0004245, "loss": 6.8964, "mean_token_accuracy": 0.11181129217147827, "num_tokens": 1746520.0, "step": 850 }, { "entropy": 7.154268980026245, "epoch": 0.758988015978695, "grad_norm": 1.1953125, "learning_rate": 0.000427, "loss": 6.8532, "mean_token_accuracy": 0.1179992400109768, "num_tokens": 1756091.0, "step": 855 }, { "entropy": 7.089676809310913, "epoch": 0.7634265423879272, "grad_norm": 1.03125, "learning_rate": 0.0004295, "loss": 6.8561, "mean_token_accuracy": 0.10415932089090348, "num_tokens": 1765968.0, "step": 860 }, { "entropy": 7.192745923995972, "epoch": 0.7678650687971593, "grad_norm": 1.0078125, "learning_rate": 0.000432, "loss": 6.8773, "mean_token_accuracy": 0.11299539059400558, "num_tokens": 1777409.0, "step": 865 }, { "entropy": 7.130894994735717, "epoch": 0.7723035952063915, "grad_norm": 1.1171875, "learning_rate": 0.0004345, "loss": 6.8824, "mean_token_accuracy": 0.10640934631228446, "num_tokens": 1788440.0, "step": 870 }, { "entropy": 7.20861964225769, "epoch": 0.7767421216156236, "grad_norm": 1.15625, "learning_rate": 0.000437, "loss": 6.8417, "mean_token_accuracy": 0.11558186262845993, "num_tokens": 1799145.0, "step": 875 }, { "entropy": 7.05075421333313, "epoch": 0.7811806480248558, "grad_norm": 1.2109375, "learning_rate": 0.0004395, "loss": 6.808, "mean_token_accuracy": 0.116386828571558, "num_tokens": 1809366.0, "step": 880 }, { "entropy": 7.129081392288208, "epoch": 0.7856191744340879, "grad_norm": 1.046875, "learning_rate": 0.000442, "loss": 6.8875, "mean_token_accuracy": 0.10899080038070678, "num_tokens": 1820878.0, "step": 885 }, { "entropy": 7.155272579193115, "epoch": 0.79005770084332, "grad_norm": 1.046875, "learning_rate": 0.0004445, "loss": 6.8349, "mean_token_accuracy": 0.11343251317739486, "num_tokens": 1831870.0, "step": 890 }, { "entropy": 7.249894714355468, "epoch": 0.7944962272525522, "grad_norm": 1.15625, "learning_rate": 0.000447, "loss": 6.801, "mean_token_accuracy": 0.11338023543357849, "num_tokens": 1841482.0, "step": 895 }, { "entropy": 6.969785833358765, "epoch": 0.7989347536617842, "grad_norm": 1.125, "learning_rate": 0.00044950000000000003, "loss": 6.8102, "mean_token_accuracy": 0.11380291059613228, "num_tokens": 1851748.0, "step": 900 }, { "entropy": 7.100828695297241, "epoch": 0.8033732800710164, "grad_norm": 1.109375, "learning_rate": 0.00045200000000000004, "loss": 6.7389, "mean_token_accuracy": 0.1162735216319561, "num_tokens": 1862292.0, "step": 905 }, { "entropy": 7.249449729919434, "epoch": 0.8078118064802485, "grad_norm": 1.1171875, "learning_rate": 0.00045450000000000004, "loss": 6.959, "mean_token_accuracy": 0.10582878962159156, "num_tokens": 1873825.0, "step": 910 }, { "entropy": 7.126041460037231, "epoch": 0.8122503328894807, "grad_norm": 1.1171875, "learning_rate": 0.00045700000000000005, "loss": 6.7795, "mean_token_accuracy": 0.11718677878379821, "num_tokens": 1883824.0, "step": 915 }, { "entropy": 7.029882144927979, "epoch": 0.8166888592987128, "grad_norm": 1.0703125, "learning_rate": 0.00045950000000000006, "loss": 6.7984, "mean_token_accuracy": 0.10695101991295815, "num_tokens": 1894236.0, "step": 920 }, { "entropy": 7.212645196914673, "epoch": 0.821127385707945, "grad_norm": 1.21875, "learning_rate": 0.000462, "loss": 6.779, "mean_token_accuracy": 0.11693326756358147, "num_tokens": 1904083.0, "step": 925 }, { "entropy": 7.023255491256714, "epoch": 0.8255659121171771, "grad_norm": 0.98828125, "learning_rate": 0.0004645, "loss": 6.7907, "mean_token_accuracy": 0.11693133264780045, "num_tokens": 1914845.0, "step": 930 }, { "entropy": 7.073426914215088, "epoch": 0.8300044385264093, "grad_norm": 1.03125, "learning_rate": 0.000467, "loss": 6.7945, "mean_token_accuracy": 0.11135339140892028, "num_tokens": 1925999.0, "step": 935 }, { "entropy": 7.0789491653442385, "epoch": 0.8344429649356414, "grad_norm": 1.171875, "learning_rate": 0.0004695, "loss": 6.694, "mean_token_accuracy": 0.1280534103512764, "num_tokens": 1935401.0, "step": 940 }, { "entropy": 6.9891969680786135, "epoch": 0.8388814913448736, "grad_norm": 1.25, "learning_rate": 0.000472, "loss": 6.7607, "mean_token_accuracy": 0.12046314924955367, "num_tokens": 1945510.0, "step": 945 }, { "entropy": 7.16357650756836, "epoch": 0.8433200177541056, "grad_norm": 1.203125, "learning_rate": 0.0004745, "loss": 6.7473, "mean_token_accuracy": 0.11847912147641182, "num_tokens": 1956934.0, "step": 950 }, { "entropy": 7.054219198226929, "epoch": 0.8477585441633377, "grad_norm": 1.03125, "learning_rate": 0.000477, "loss": 6.7688, "mean_token_accuracy": 0.11719952076673508, "num_tokens": 1967032.0, "step": 955 }, { "entropy": 7.080799579620361, "epoch": 0.8521970705725699, "grad_norm": 1.0546875, "learning_rate": 0.0004795, "loss": 6.8584, "mean_token_accuracy": 0.11015522852540016, "num_tokens": 1978895.0, "step": 960 }, { "entropy": 7.09550929069519, "epoch": 0.856635596981802, "grad_norm": 1.0390625, "learning_rate": 0.000482, "loss": 6.816, "mean_token_accuracy": 0.11443090364336968, "num_tokens": 1990156.0, "step": 965 }, { "entropy": 7.139660930633545, "epoch": 0.8610741233910342, "grad_norm": 1.1953125, "learning_rate": 0.0004845, "loss": 6.7035, "mean_token_accuracy": 0.11342604532837867, "num_tokens": 1999643.0, "step": 970 }, { "entropy": 6.957034969329834, "epoch": 0.8655126498002663, "grad_norm": 1.0390625, "learning_rate": 0.000487, "loss": 6.7472, "mean_token_accuracy": 0.11747978329658508, "num_tokens": 2010328.0, "step": 975 }, { "entropy": 7.062716341018676, "epoch": 0.8699511762094985, "grad_norm": 1.0625, "learning_rate": 0.0004895, "loss": 6.8272, "mean_token_accuracy": 0.11245640963315964, "num_tokens": 2021353.0, "step": 980 }, { "entropy": 7.081027889251709, "epoch": 0.8743897026187306, "grad_norm": 1.140625, "learning_rate": 0.000492, "loss": 6.7701, "mean_token_accuracy": 0.11547347530722618, "num_tokens": 2032331.0, "step": 985 }, { "entropy": 7.023243951797485, "epoch": 0.8788282290279628, "grad_norm": 1.078125, "learning_rate": 0.0004945, "loss": 6.7011, "mean_token_accuracy": 0.1206856571137905, "num_tokens": 2041786.0, "step": 990 }, { "entropy": 6.975612211227417, "epoch": 0.8832667554371949, "grad_norm": 1.03125, "learning_rate": 0.000497, "loss": 6.6885, "mean_token_accuracy": 0.11817316859960555, "num_tokens": 2052512.0, "step": 995 }, { "entropy": 7.02327561378479, "epoch": 0.8877052818464269, "grad_norm": 1.265625, "learning_rate": 0.0004995, "loss": 6.6295, "mean_token_accuracy": 0.12657489329576493, "num_tokens": 2062785.0, "step": 1000 }, { "epoch": 0.8877052818464269, "eval_entropy": 6.811686369698857, "eval_loss": 6.767911434173584, "eval_mean_token_accuracy": 0.11571601520772501, "eval_num_tokens": 2062785.0, "eval_runtime": 2.1114, "eval_samples_per_second": 1594.66, "eval_steps_per_second": 199.392, "step": 1000 }, { "entropy": 7.073720645904541, "epoch": 0.8921438082556591, "grad_norm": 1.1328125, "learning_rate": 0.0004999998312369076, "loss": 6.7709, "mean_token_accuracy": 0.11314490139484405, "num_tokens": 2072621.0, "step": 1005 }, { "entropy": 7.060971355438232, "epoch": 0.8965823346648912, "grad_norm": 1.0546875, "learning_rate": 0.0004999991456372788, "loss": 6.8178, "mean_token_accuracy": 0.10872112512588501, "num_tokens": 2083356.0, "step": 1010 }, { "entropy": 7.0227889060974125, "epoch": 0.9010208610741234, "grad_norm": 1.203125, "learning_rate": 0.000499997932655026, "loss": 6.7777, "mean_token_accuracy": 0.11077685430645942, "num_tokens": 2092787.0, "step": 1015 }, { "entropy": 6.9889302253723145, "epoch": 0.9054593874833555, "grad_norm": 0.99609375, "learning_rate": 0.0004999961922929925, "loss": 6.6739, "mean_token_accuracy": 0.11871889233589172, "num_tokens": 2103721.0, "step": 1020 }, { "entropy": 6.950629568099975, "epoch": 0.9098979138925877, "grad_norm": 1.1484375, "learning_rate": 0.0004999939245552573, "loss": 6.6956, "mean_token_accuracy": 0.12753814980387687, "num_tokens": 2115016.0, "step": 1025 }, { "entropy": 6.951031637191773, "epoch": 0.9143364403018198, "grad_norm": 1.1640625, "learning_rate": 0.000499991129447136, "loss": 6.6594, "mean_token_accuracy": 0.1263865128159523, "num_tokens": 2126183.0, "step": 1030 }, { "entropy": 6.928300905227661, "epoch": 0.918774966711052, "grad_norm": 1.15625, "learning_rate": 0.0004999878069751803, "loss": 6.7069, "mean_token_accuracy": 0.11957084909081458, "num_tokens": 2135955.0, "step": 1035 }, { "entropy": 6.915622138977051, "epoch": 0.9232134931202841, "grad_norm": 1.171875, "learning_rate": 0.0004999839571471776, "loss": 6.6919, "mean_token_accuracy": 0.11919597014784813, "num_tokens": 2146064.0, "step": 1040 }, { "entropy": 6.9707104682922365, "epoch": 0.9276520195295161, "grad_norm": 1.2421875, "learning_rate": 0.0004999795799721517, "loss": 6.6444, "mean_token_accuracy": 0.1262632966041565, "num_tokens": 2155707.0, "step": 1045 }, { "entropy": 6.99800386428833, "epoch": 0.9320905459387483, "grad_norm": 1.0546875, "learning_rate": 0.0004999746754603624, "loss": 6.6928, "mean_token_accuracy": 0.11961428299546242, "num_tokens": 2166037.0, "step": 1050 }, { "entropy": 6.904142761230469, "epoch": 0.9365290723479804, "grad_norm": 1.1328125, "learning_rate": 0.0004999692436233055, "loss": 6.7519, "mean_token_accuracy": 0.11929019168019295, "num_tokens": 2175993.0, "step": 1055 }, { "entropy": 7.008247995376587, "epoch": 0.9409675987572126, "grad_norm": 1.2265625, "learning_rate": 0.000499963284473713, "loss": 6.7099, "mean_token_accuracy": 0.12117866948246955, "num_tokens": 2186829.0, "step": 1060 }, { "entropy": 6.9378032207489015, "epoch": 0.9454061251664447, "grad_norm": 1.1640625, "learning_rate": 0.0004999567980255526, "loss": 6.665, "mean_token_accuracy": 0.12237748578190803, "num_tokens": 2195845.0, "step": 1065 }, { "entropy": 7.0276360511779785, "epoch": 0.9498446515756769, "grad_norm": 1.1875, "learning_rate": 0.0004999497842940282, "loss": 6.6921, "mean_token_accuracy": 0.12066913396120071, "num_tokens": 2204937.0, "step": 1070 }, { "entropy": 6.900293159484863, "epoch": 0.954283177984909, "grad_norm": 1.078125, "learning_rate": 0.0004999422432955794, "loss": 6.6703, "mean_token_accuracy": 0.12011573910713196, "num_tokens": 2214582.0, "step": 1075 }, { "entropy": 6.922044038772583, "epoch": 0.9587217043941412, "grad_norm": 1.09375, "learning_rate": 0.0004999341750478818, "loss": 6.6229, "mean_token_accuracy": 0.1269613318145275, "num_tokens": 2225157.0, "step": 1080 }, { "entropy": 6.99785623550415, "epoch": 0.9631602308033733, "grad_norm": 1.078125, "learning_rate": 0.000499925579569847, "loss": 6.6932, "mean_token_accuracy": 0.12152787148952485, "num_tokens": 2234823.0, "step": 1085 }, { "entropy": 6.851722621917725, "epoch": 0.9675987572126055, "grad_norm": 1.0625, "learning_rate": 0.0004999164568816219, "loss": 6.6802, "mean_token_accuracy": 0.119229806214571, "num_tokens": 2244666.0, "step": 1090 }, { "entropy": 7.007480764389038, "epoch": 0.9720372836218375, "grad_norm": 1.078125, "learning_rate": 0.0004999068070045897, "loss": 6.6412, "mean_token_accuracy": 0.117543176561594, "num_tokens": 2254586.0, "step": 1095 }, { "entropy": 6.836320638656616, "epoch": 0.9764758100310696, "grad_norm": 1.015625, "learning_rate": 0.000499896629961369, "loss": 6.6026, "mean_token_accuracy": 0.12370306029915809, "num_tokens": 2264453.0, "step": 1100 }, { "entropy": 6.999147844314575, "epoch": 0.9809143364403018, "grad_norm": 0.93359375, "learning_rate": 0.000499885925775814, "loss": 6.6656, "mean_token_accuracy": 0.11901217773556709, "num_tokens": 2275170.0, "step": 1105 }, { "entropy": 6.810418939590454, "epoch": 0.9853528628495339, "grad_norm": 1.0703125, "learning_rate": 0.0004998746944730148, "loss": 6.6517, "mean_token_accuracy": 0.12251685783267022, "num_tokens": 2285448.0, "step": 1110 }, { "entropy": 6.978043413162231, "epoch": 0.9897913892587661, "grad_norm": 1.0703125, "learning_rate": 0.0004998629360792965, "loss": 6.6361, "mean_token_accuracy": 0.1255613885819912, "num_tokens": 2295673.0, "step": 1115 }, { "entropy": 6.860985517501831, "epoch": 0.9942299156679982, "grad_norm": 1.03125, "learning_rate": 0.0004998506506222202, "loss": 6.644, "mean_token_accuracy": 0.12026142254471779, "num_tokens": 2306115.0, "step": 1120 }, { "entropy": 6.872910737991333, "epoch": 0.9986684420772304, "grad_norm": 1.2265625, "learning_rate": 0.0004998378381305821, "loss": 6.637, "mean_token_accuracy": 0.12394563928246498, "num_tokens": 2316495.0, "step": 1125 }, { "entropy": 6.93203698264228, "epoch": 1.0026631158455392, "grad_norm": 1.21875, "learning_rate": 0.0004998244986344138, "loss": 6.5838, "mean_token_accuracy": 0.1257213337553872, "num_tokens": 2326409.0, "step": 1130 }, { "entropy": 6.777434873580932, "epoch": 1.0071016422547714, "grad_norm": 1.140625, "learning_rate": 0.0004998106321649822, "loss": 6.439, "mean_token_accuracy": 0.1350421704351902, "num_tokens": 2337394.0, "step": 1135 }, { "entropy": 6.8583564281463625, "epoch": 1.0115401686640035, "grad_norm": 0.93359375, "learning_rate": 0.0004997962387547893, "loss": 6.5089, "mean_token_accuracy": 0.12366606816649436, "num_tokens": 2347768.0, "step": 1140 }, { "entropy": 6.965995025634766, "epoch": 1.0159786950732357, "grad_norm": 1.0859375, "learning_rate": 0.0004997813184375723, "loss": 6.5134, "mean_token_accuracy": 0.12577569335699082, "num_tokens": 2357969.0, "step": 1145 }, { "entropy": 6.872522068023682, "epoch": 1.0204172214824678, "grad_norm": 1.125, "learning_rate": 0.0004997658712483034, "loss": 6.4866, "mean_token_accuracy": 0.1270396701991558, "num_tokens": 2367878.0, "step": 1150 }, { "entropy": 6.814556646347046, "epoch": 1.0248557478917, "grad_norm": 1.1484375, "learning_rate": 0.0004997498972231898, "loss": 6.4781, "mean_token_accuracy": 0.12578893974423408, "num_tokens": 2377072.0, "step": 1155 }, { "entropy": 6.867713165283203, "epoch": 1.0292942743009321, "grad_norm": 1.140625, "learning_rate": 0.0004997333963996734, "loss": 6.503, "mean_token_accuracy": 0.13253186494112015, "num_tokens": 2387348.0, "step": 1160 }, { "entropy": 6.912645387649536, "epoch": 1.0337328007101643, "grad_norm": 1.0234375, "learning_rate": 0.0004997163688164313, "loss": 6.4919, "mean_token_accuracy": 0.12540172412991524, "num_tokens": 2398113.0, "step": 1165 }, { "entropy": 6.738404178619385, "epoch": 1.0381713271193964, "grad_norm": 1.03125, "learning_rate": 0.0004996988145133745, "loss": 6.3882, "mean_token_accuracy": 0.13407822996377944, "num_tokens": 2408074.0, "step": 1170 }, { "entropy": 6.699475193023682, "epoch": 1.0426098535286286, "grad_norm": 1.015625, "learning_rate": 0.0004996807335316496, "loss": 6.3874, "mean_token_accuracy": 0.1336548797786236, "num_tokens": 2419752.0, "step": 1175 }, { "entropy": 6.843112182617188, "epoch": 1.0470483799378607, "grad_norm": 1.0703125, "learning_rate": 0.0004996621259136368, "loss": 6.4743, "mean_token_accuracy": 0.1282840073108673, "num_tokens": 2430853.0, "step": 1180 }, { "entropy": 6.741962194442749, "epoch": 1.0514869063470929, "grad_norm": 1.109375, "learning_rate": 0.0004996429917029513, "loss": 6.4597, "mean_token_accuracy": 0.1284678265452385, "num_tokens": 2440686.0, "step": 1185 }, { "entropy": 6.87503981590271, "epoch": 1.055925432756325, "grad_norm": 1.0625, "learning_rate": 0.0004996233309444424, "loss": 6.4862, "mean_token_accuracy": 0.1273033231496811, "num_tokens": 2450849.0, "step": 1190 }, { "entropy": 6.7747828483581545, "epoch": 1.060363959165557, "grad_norm": 1.09375, "learning_rate": 0.0004996031436841934, "loss": 6.3842, "mean_token_accuracy": 0.13247138634324074, "num_tokens": 2460827.0, "step": 1195 }, { "entropy": 6.7094989776611325, "epoch": 1.064802485574789, "grad_norm": 1.125, "learning_rate": 0.0004995824299695219, "loss": 6.4723, "mean_token_accuracy": 0.1337954096496105, "num_tokens": 2471265.0, "step": 1200 }, { "entropy": 6.8431929588317875, "epoch": 1.0692410119840212, "grad_norm": 1.078125, "learning_rate": 0.0004995611898489796, "loss": 6.3655, "mean_token_accuracy": 0.13849280402064323, "num_tokens": 2481346.0, "step": 1205 }, { "entropy": 6.77330379486084, "epoch": 1.0736795383932534, "grad_norm": 1.0390625, "learning_rate": 0.0004995394233723516, "loss": 6.4696, "mean_token_accuracy": 0.13246190845966338, "num_tokens": 2492281.0, "step": 1210 }, { "entropy": 6.771844577789307, "epoch": 1.0781180648024855, "grad_norm": 1.0703125, "learning_rate": 0.0004995171305906574, "loss": 6.397, "mean_token_accuracy": 0.1389589823782444, "num_tokens": 2502094.0, "step": 1215 }, { "entropy": 6.706840229034424, "epoch": 1.0825565912117177, "grad_norm": 1.1640625, "learning_rate": 0.0004994943115561495, "loss": 6.3975, "mean_token_accuracy": 0.13392824158072472, "num_tokens": 2512553.0, "step": 1220 }, { "entropy": 6.795430517196655, "epoch": 1.0869951176209498, "grad_norm": 1.140625, "learning_rate": 0.0004994709663223143, "loss": 6.3947, "mean_token_accuracy": 0.13575630336999894, "num_tokens": 2522350.0, "step": 1225 }, { "entropy": 6.717914056777954, "epoch": 1.091433644030182, "grad_norm": 1.1796875, "learning_rate": 0.0004994470949438712, "loss": 6.4571, "mean_token_accuracy": 0.12943646237254142, "num_tokens": 2532884.0, "step": 1230 }, { "entropy": 6.821149110794067, "epoch": 1.095872170439414, "grad_norm": 1.078125, "learning_rate": 0.0004994226974767734, "loss": 6.4947, "mean_token_accuracy": 0.12449371442198753, "num_tokens": 2543364.0, "step": 1235 }, { "entropy": 6.7451752662658695, "epoch": 1.1003106968486462, "grad_norm": 1.1328125, "learning_rate": 0.0004993977739782066, "loss": 6.3817, "mean_token_accuracy": 0.13001500964164733, "num_tokens": 2552281.0, "step": 1240 }, { "entropy": 6.721602582931519, "epoch": 1.1047492232578784, "grad_norm": 1.1953125, "learning_rate": 0.00049937232450659, "loss": 6.446, "mean_token_accuracy": 0.12717969268560408, "num_tokens": 2561963.0, "step": 1245 }, { "entropy": 6.7753888130187985, "epoch": 1.1091877496671105, "grad_norm": 1.0546875, "learning_rate": 0.0004993463491215753, "loss": 6.4337, "mean_token_accuracy": 0.13999854624271393, "num_tokens": 2572951.0, "step": 1250 }, { "entropy": 6.816381406784058, "epoch": 1.1136262760763427, "grad_norm": 1.140625, "learning_rate": 0.000499319847884047, "loss": 6.4535, "mean_token_accuracy": 0.1278873711824417, "num_tokens": 2583019.0, "step": 1255 }, { "entropy": 6.7529043674469, "epoch": 1.1180648024855748, "grad_norm": 1.0234375, "learning_rate": 0.0004992928208561224, "loss": 6.3902, "mean_token_accuracy": 0.13753967881202697, "num_tokens": 2593385.0, "step": 1260 }, { "entropy": 6.774140882492065, "epoch": 1.122503328894807, "grad_norm": 1.078125, "learning_rate": 0.0004992652681011508, "loss": 6.3959, "mean_token_accuracy": 0.13451069965958595, "num_tokens": 2603679.0, "step": 1265 }, { "entropy": 6.745535135269165, "epoch": 1.1269418553040391, "grad_norm": 1.2109375, "learning_rate": 0.000499237189683714, "loss": 6.458, "mean_token_accuracy": 0.1327129691839218, "num_tokens": 2614029.0, "step": 1270 }, { "entropy": 6.658591461181641, "epoch": 1.1313803817132713, "grad_norm": 1.03125, "learning_rate": 0.0004992085856696259, "loss": 6.4209, "mean_token_accuracy": 0.1382272757589817, "num_tokens": 2624063.0, "step": 1275 }, { "entropy": 6.722748279571533, "epoch": 1.1358189081225034, "grad_norm": 1.1953125, "learning_rate": 0.0004991794561259325, "loss": 6.3691, "mean_token_accuracy": 0.14201630800962448, "num_tokens": 2633792.0, "step": 1280 }, { "entropy": 6.6542223453521725, "epoch": 1.1402574345317356, "grad_norm": 1.15625, "learning_rate": 0.0004991498011209112, "loss": 6.3232, "mean_token_accuracy": 0.13645180314779282, "num_tokens": 2643401.0, "step": 1285 }, { "entropy": 6.773741817474365, "epoch": 1.1446959609409677, "grad_norm": 1.1328125, "learning_rate": 0.0004991196207240714, "loss": 6.4539, "mean_token_accuracy": 0.1282748505473137, "num_tokens": 2653909.0, "step": 1290 }, { "entropy": 6.693137884140015, "epoch": 1.1491344873501999, "grad_norm": 1.25, "learning_rate": 0.0004990889150061541, "loss": 6.4317, "mean_token_accuracy": 0.1349467732012272, "num_tokens": 2664386.0, "step": 1295 }, { "entropy": 6.766120195388794, "epoch": 1.1535730137594318, "grad_norm": 1.171875, "learning_rate": 0.0004990576840391312, "loss": 6.4865, "mean_token_accuracy": 0.12709747180342673, "num_tokens": 2675398.0, "step": 1300 }, { "entropy": 6.749423599243164, "epoch": 1.158011540168664, "grad_norm": 1.1953125, "learning_rate": 0.000499025927896206, "loss": 6.389, "mean_token_accuracy": 0.1319727636873722, "num_tokens": 2684895.0, "step": 1305 }, { "entropy": 6.622655010223388, "epoch": 1.162450066577896, "grad_norm": 1.296875, "learning_rate": 0.0004989936466518127, "loss": 6.367, "mean_token_accuracy": 0.1397032156586647, "num_tokens": 2694706.0, "step": 1310 }, { "entropy": 6.733213758468628, "epoch": 1.1668885929871282, "grad_norm": 1.0234375, "learning_rate": 0.0004989608403816164, "loss": 6.3576, "mean_token_accuracy": 0.13502043187618257, "num_tokens": 2706486.0, "step": 1315 }, { "entropy": 6.691570997238159, "epoch": 1.1713271193963604, "grad_norm": 1.0625, "learning_rate": 0.0004989275091625126, "loss": 6.4414, "mean_token_accuracy": 0.14210355877876282, "num_tokens": 2716613.0, "step": 1320 }, { "entropy": 6.886738586425781, "epoch": 1.1757656458055925, "grad_norm": 0.96875, "learning_rate": 0.0004988936530726276, "loss": 6.5302, "mean_token_accuracy": 0.1268772892653942, "num_tokens": 2727313.0, "step": 1325 }, { "entropy": 6.723033380508423, "epoch": 1.1802041722148247, "grad_norm": 1.0546875, "learning_rate": 0.0004988592721913176, "loss": 6.3995, "mean_token_accuracy": 0.1361616112291813, "num_tokens": 2737826.0, "step": 1330 }, { "entropy": 6.63746075630188, "epoch": 1.1846426986240568, "grad_norm": 1.4609375, "learning_rate": 0.0004988243665991692, "loss": 6.3232, "mean_token_accuracy": 0.13523943722248077, "num_tokens": 2748962.0, "step": 1335 }, { "entropy": 6.7660548210144045, "epoch": 1.189081225033289, "grad_norm": 1.0078125, "learning_rate": 0.0004987889363779985, "loss": 6.3726, "mean_token_accuracy": 0.13909099400043487, "num_tokens": 2760116.0, "step": 1340 }, { "entropy": 6.642192268371582, "epoch": 1.193519751442521, "grad_norm": 1.015625, "learning_rate": 0.0004987529816108517, "loss": 6.3868, "mean_token_accuracy": 0.13063296377658845, "num_tokens": 2771664.0, "step": 1345 }, { "entropy": 6.735338401794434, "epoch": 1.1979582778517532, "grad_norm": 1.1796875, "learning_rate": 0.0004987165023820043, "loss": 6.3339, "mean_token_accuracy": 0.13763192743062974, "num_tokens": 2781792.0, "step": 1350 }, { "entropy": 6.5532543659210205, "epoch": 1.2023968042609854, "grad_norm": 1.015625, "learning_rate": 0.0004986794987769611, "loss": 6.3272, "mean_token_accuracy": 0.1380511462688446, "num_tokens": 2792203.0, "step": 1355 }, { "entropy": 6.720197010040283, "epoch": 1.2068353306702175, "grad_norm": 1.1015625, "learning_rate": 0.000498641970882456, "loss": 6.4867, "mean_token_accuracy": 0.13111176937818528, "num_tokens": 2802077.0, "step": 1360 }, { "entropy": 6.638952589035034, "epoch": 1.2112738570794497, "grad_norm": 1.078125, "learning_rate": 0.0004986039187864518, "loss": 6.3655, "mean_token_accuracy": 0.14026057049632074, "num_tokens": 2811993.0, "step": 1365 }, { "entropy": 6.676184177398682, "epoch": 1.2157123834886818, "grad_norm": 1.125, "learning_rate": 0.0004985653425781401, "loss": 6.402, "mean_token_accuracy": 0.13089463859796524, "num_tokens": 2821924.0, "step": 1370 }, { "entropy": 6.675514078140258, "epoch": 1.220150909897914, "grad_norm": 1.1796875, "learning_rate": 0.0004985262423479408, "loss": 6.3627, "mean_token_accuracy": 0.1411583587527275, "num_tokens": 2831521.0, "step": 1375 }, { "entropy": 6.686585426330566, "epoch": 1.2245894363071461, "grad_norm": 1.109375, "learning_rate": 0.0004984866181875021, "loss": 6.3526, "mean_token_accuracy": 0.13705047890543937, "num_tokens": 2841864.0, "step": 1380 }, { "entropy": 6.604874324798584, "epoch": 1.229027962716378, "grad_norm": 1.171875, "learning_rate": 0.0004984464701897005, "loss": 6.3588, "mean_token_accuracy": 0.13925145491957663, "num_tokens": 2852199.0, "step": 1385 }, { "entropy": 6.6554466724395756, "epoch": 1.2334664891256102, "grad_norm": 1.140625, "learning_rate": 0.0004984057984486402, "loss": 6.3641, "mean_token_accuracy": 0.1341533102095127, "num_tokens": 2862167.0, "step": 1390 }, { "entropy": 6.686126089096069, "epoch": 1.2379050155348423, "grad_norm": 1.125, "learning_rate": 0.0004983646030596527, "loss": 6.4079, "mean_token_accuracy": 0.13984917402267455, "num_tokens": 2872604.0, "step": 1395 }, { "entropy": 6.672490835189819, "epoch": 1.2423435419440745, "grad_norm": 1.3203125, "learning_rate": 0.0004983228841192975, "loss": 6.3752, "mean_token_accuracy": 0.13595345988869667, "num_tokens": 2882401.0, "step": 1400 }, { "entropy": 6.631757831573486, "epoch": 1.2467820683533066, "grad_norm": 1.1328125, "learning_rate": 0.0004982806417253607, "loss": 6.3511, "mean_token_accuracy": 0.13876891285181045, "num_tokens": 2892004.0, "step": 1405 }, { "entropy": 6.63784236907959, "epoch": 1.2512205947625388, "grad_norm": 1.1171875, "learning_rate": 0.0004982378759768557, "loss": 6.3538, "mean_token_accuracy": 0.13770614489912986, "num_tokens": 2902369.0, "step": 1410 }, { "entropy": 6.656727027893067, "epoch": 1.255659121171771, "grad_norm": 1.0546875, "learning_rate": 0.0004981945869740225, "loss": 6.3934, "mean_token_accuracy": 0.13234489262104035, "num_tokens": 2912532.0, "step": 1415 }, { "entropy": 6.692376708984375, "epoch": 1.260097647581003, "grad_norm": 1.1875, "learning_rate": 0.0004981507748183276, "loss": 6.3853, "mean_token_accuracy": 0.1314159318804741, "num_tokens": 2922621.0, "step": 1420 }, { "entropy": 6.710336446762085, "epoch": 1.2645361739902352, "grad_norm": 1.125, "learning_rate": 0.0004981064396124635, "loss": 6.3583, "mean_token_accuracy": 0.13584646657109262, "num_tokens": 2932510.0, "step": 1425 }, { "entropy": 6.6139873504638675, "epoch": 1.2689747003994674, "grad_norm": 1.140625, "learning_rate": 0.0004980615814603492, "loss": 6.3846, "mean_token_accuracy": 0.12972714975476266, "num_tokens": 2942982.0, "step": 1430 }, { "entropy": 6.653766632080078, "epoch": 1.2734132268086995, "grad_norm": 1.25, "learning_rate": 0.0004980162004671288, "loss": 6.2817, "mean_token_accuracy": 0.1397496670484543, "num_tokens": 2953417.0, "step": 1435 }, { "entropy": 6.590647983551025, "epoch": 1.2778517532179317, "grad_norm": 1.171875, "learning_rate": 0.0004979702967391725, "loss": 6.287, "mean_token_accuracy": 0.14722541570663453, "num_tokens": 2961771.0, "step": 1440 }, { "entropy": 6.587854480743408, "epoch": 1.2822902796271638, "grad_norm": 1.09375, "learning_rate": 0.0004979238703840755, "loss": 6.3671, "mean_token_accuracy": 0.13086313456296922, "num_tokens": 2971980.0, "step": 1445 }, { "entropy": 6.69378170967102, "epoch": 1.286728806036396, "grad_norm": 1.0625, "learning_rate": 0.0004978769215106579, "loss": 6.3792, "mean_token_accuracy": 0.13028891906142234, "num_tokens": 2982087.0, "step": 1450 }, { "entropy": 6.681559753417969, "epoch": 1.291167332445628, "grad_norm": 1.1484375, "learning_rate": 0.0004978294502289646, "loss": 6.4874, "mean_token_accuracy": 0.12749797403812407, "num_tokens": 2993424.0, "step": 1455 }, { "entropy": 6.710448789596557, "epoch": 1.2956058588548602, "grad_norm": 1.125, "learning_rate": 0.0004977814566502651, "loss": 6.3213, "mean_token_accuracy": 0.1379827730357647, "num_tokens": 3003081.0, "step": 1460 }, { "entropy": 6.677050495147705, "epoch": 1.3000443852640924, "grad_norm": 1.21875, "learning_rate": 0.0004977329408870532, "loss": 6.4048, "mean_token_accuracy": 0.1378847599029541, "num_tokens": 3013829.0, "step": 1465 }, { "entropy": 6.576231288909912, "epoch": 1.3044829116733245, "grad_norm": 1.015625, "learning_rate": 0.0004976839030530464, "loss": 6.3102, "mean_token_accuracy": 0.1419086903333664, "num_tokens": 3024511.0, "step": 1470 }, { "entropy": 6.593928623199463, "epoch": 1.3089214380825567, "grad_norm": 1.0859375, "learning_rate": 0.000497634343263186, "loss": 6.4043, "mean_token_accuracy": 0.12826052978634833, "num_tokens": 3034503.0, "step": 1475 }, { "entropy": 6.648963260650635, "epoch": 1.3133599644917888, "grad_norm": 1.0234375, "learning_rate": 0.0004975842616336369, "loss": 6.3201, "mean_token_accuracy": 0.141230496019125, "num_tokens": 3044823.0, "step": 1480 }, { "entropy": 6.510059928894043, "epoch": 1.317798490901021, "grad_norm": 0.93359375, "learning_rate": 0.0004975336582817869, "loss": 6.33, "mean_token_accuracy": 0.1362045116722584, "num_tokens": 3056412.0, "step": 1485 }, { "entropy": 6.728832674026489, "epoch": 1.3222370173102531, "grad_norm": 0.99609375, "learning_rate": 0.0004974825333262469, "loss": 6.3945, "mean_token_accuracy": 0.12927686050534248, "num_tokens": 3067101.0, "step": 1490 }, { "entropy": 6.7084520816802975, "epoch": 1.3266755437194853, "grad_norm": 1.0078125, "learning_rate": 0.0004974308868868501, "loss": 6.3995, "mean_token_accuracy": 0.12630158364772798, "num_tokens": 3077638.0, "step": 1495 }, { "entropy": 6.551306915283203, "epoch": 1.3311140701287172, "grad_norm": 1.265625, "learning_rate": 0.0004973787190846524, "loss": 6.3218, "mean_token_accuracy": 0.14200132787227632, "num_tokens": 3087970.0, "step": 1500 }, { "epoch": 1.3311140701287172, "eval_entropy": 6.368161134651891, "eval_loss": 6.45974588394165, "eval_mean_token_accuracy": 0.13263512823969623, "eval_num_tokens": 3087970.0, "eval_runtime": 2.0891, "eval_samples_per_second": 1611.728, "eval_steps_per_second": 201.526, "step": 1500 }, { "entropy": 6.630201387405395, "epoch": 1.3355525965379493, "grad_norm": 1.09375, "learning_rate": 0.0004973260300419316, "loss": 6.3578, "mean_token_accuracy": 0.13766367435455323, "num_tokens": 3097895.0, "step": 1505 }, { "entropy": 6.590450048446655, "epoch": 1.3399911229471815, "grad_norm": 1.1640625, "learning_rate": 0.0004972728198821871, "loss": 6.3072, "mean_token_accuracy": 0.1387806810438633, "num_tokens": 3107042.0, "step": 1510 }, { "entropy": 6.625532007217407, "epoch": 1.3444296493564136, "grad_norm": 1.046875, "learning_rate": 0.00049721908873014, "loss": 6.315, "mean_token_accuracy": 0.14337668791413308, "num_tokens": 3117959.0, "step": 1515 }, { "entropy": 6.558200359344482, "epoch": 1.3488681757656458, "grad_norm": 0.9921875, "learning_rate": 0.0004971648367117323, "loss": 6.3543, "mean_token_accuracy": 0.13464199230074883, "num_tokens": 3128407.0, "step": 1520 }, { "entropy": 6.676009941101074, "epoch": 1.353306702174878, "grad_norm": 1.234375, "learning_rate": 0.0004971100639541271, "loss": 6.3267, "mean_token_accuracy": 0.14146978706121444, "num_tokens": 3138265.0, "step": 1525 }, { "entropy": 6.57694182395935, "epoch": 1.35774522858411, "grad_norm": 1.1171875, "learning_rate": 0.000497054770585708, "loss": 6.3353, "mean_token_accuracy": 0.13715606033802033, "num_tokens": 3148677.0, "step": 1530 }, { "entropy": 6.556269979476928, "epoch": 1.3621837549933422, "grad_norm": 1.2109375, "learning_rate": 0.0004969989567360788, "loss": 6.3503, "mean_token_accuracy": 0.13542981594800949, "num_tokens": 3158684.0, "step": 1535 }, { "entropy": 6.643629789352417, "epoch": 1.3666222814025744, "grad_norm": 1.1171875, "learning_rate": 0.0004969426225360635, "loss": 6.3543, "mean_token_accuracy": 0.1378885067999363, "num_tokens": 3169124.0, "step": 1540 }, { "entropy": 6.596967315673828, "epoch": 1.3710608078118065, "grad_norm": 1.3125, "learning_rate": 0.0004968857681177056, "loss": 6.2667, "mean_token_accuracy": 0.1364466980099678, "num_tokens": 3179282.0, "step": 1545 }, { "entropy": 6.605694532394409, "epoch": 1.3754993342210386, "grad_norm": 1.109375, "learning_rate": 0.0004968283936142679, "loss": 6.301, "mean_token_accuracy": 0.13783995881676675, "num_tokens": 3190144.0, "step": 1550 }, { "entropy": 6.484689426422119, "epoch": 1.3799378606302708, "grad_norm": 0.89453125, "learning_rate": 0.0004967704991602322, "loss": 6.3025, "mean_token_accuracy": 0.14239512234926224, "num_tokens": 3201277.0, "step": 1555 }, { "entropy": 6.584119367599487, "epoch": 1.384376387039503, "grad_norm": 1.1171875, "learning_rate": 0.0004967120848912995, "loss": 6.318, "mean_token_accuracy": 0.13924861773848535, "num_tokens": 3211691.0, "step": 1560 }, { "entropy": 6.51182188987732, "epoch": 1.388814913448735, "grad_norm": 1.0625, "learning_rate": 0.0004966531509443884, "loss": 6.2972, "mean_token_accuracy": 0.1423930622637272, "num_tokens": 3220452.0, "step": 1565 }, { "entropy": 6.665063858032227, "epoch": 1.3932534398579672, "grad_norm": 1.078125, "learning_rate": 0.0004965936974576363, "loss": 6.2572, "mean_token_accuracy": 0.1434251219034195, "num_tokens": 3230821.0, "step": 1570 }, { "entropy": 6.569358205795288, "epoch": 1.3976919662671992, "grad_norm": 1.171875, "learning_rate": 0.0004965337245703981, "loss": 6.333, "mean_token_accuracy": 0.13867368102073668, "num_tokens": 3240621.0, "step": 1575 }, { "entropy": 6.564372253417969, "epoch": 1.4021304926764313, "grad_norm": 0.99609375, "learning_rate": 0.0004964732324232462, "loss": 6.302, "mean_token_accuracy": 0.13816518783569337, "num_tokens": 3251442.0, "step": 1580 }, { "entropy": 6.6255796432495115, "epoch": 1.4065690190856635, "grad_norm": 1.140625, "learning_rate": 0.00049641222115797, "loss": 6.3077, "mean_token_accuracy": 0.13412498235702514, "num_tokens": 3261164.0, "step": 1585 }, { "entropy": 6.539021825790405, "epoch": 1.4110075454948956, "grad_norm": 1.140625, "learning_rate": 0.0004963506909175758, "loss": 6.3365, "mean_token_accuracy": 0.13258393555879594, "num_tokens": 3271442.0, "step": 1590 }, { "entropy": 6.633949136734008, "epoch": 1.4154460719041277, "grad_norm": 1.0234375, "learning_rate": 0.000496288641846286, "loss": 6.3385, "mean_token_accuracy": 0.13758450075984002, "num_tokens": 3282159.0, "step": 1595 }, { "entropy": 6.485613584518433, "epoch": 1.41988459831336, "grad_norm": 1.09375, "learning_rate": 0.0004962260740895398, "loss": 6.2791, "mean_token_accuracy": 0.14571996703743934, "num_tokens": 3291424.0, "step": 1600 }, { "entropy": 6.557862329483032, "epoch": 1.424323124722592, "grad_norm": 1.15625, "learning_rate": 0.0004961629877939913, "loss": 6.3422, "mean_token_accuracy": 0.1376090705394745, "num_tokens": 3302098.0, "step": 1605 }, { "entropy": 6.554436111450196, "epoch": 1.4287616511318242, "grad_norm": 1.0546875, "learning_rate": 0.000496099383107511, "loss": 6.3472, "mean_token_accuracy": 0.13372454419732094, "num_tokens": 3313292.0, "step": 1610 }, { "entropy": 6.600845575332642, "epoch": 1.4332001775410563, "grad_norm": 1.0546875, "learning_rate": 0.0004960352601791835, "loss": 6.2123, "mean_token_accuracy": 0.14182500839233397, "num_tokens": 3324272.0, "step": 1615 }, { "entropy": 6.54074878692627, "epoch": 1.4376387039502885, "grad_norm": 0.921875, "learning_rate": 0.0004959706191593087, "loss": 6.3102, "mean_token_accuracy": 0.1401732988655567, "num_tokens": 3335299.0, "step": 1620 }, { "entropy": 6.616578388214111, "epoch": 1.4420772303595206, "grad_norm": 1.1953125, "learning_rate": 0.0004959054601994007, "loss": 6.2826, "mean_token_accuracy": 0.1450162336230278, "num_tokens": 3344652.0, "step": 1625 }, { "entropy": 6.52901258468628, "epoch": 1.4465157567687528, "grad_norm": 0.96484375, "learning_rate": 0.0004958397834521878, "loss": 6.3048, "mean_token_accuracy": 0.139273801445961, "num_tokens": 3355166.0, "step": 1630 }, { "entropy": 6.562482261657715, "epoch": 1.450954283177985, "grad_norm": 1.09375, "learning_rate": 0.0004957735890716115, "loss": 6.2622, "mean_token_accuracy": 0.1440594784915447, "num_tokens": 3366330.0, "step": 1635 }, { "entropy": 6.549576234817505, "epoch": 1.455392809587217, "grad_norm": 1.09375, "learning_rate": 0.0004957068772128273, "loss": 6.3315, "mean_token_accuracy": 0.14034282714128493, "num_tokens": 3375930.0, "step": 1640 }, { "entropy": 6.5108832836151125, "epoch": 1.4598313359964492, "grad_norm": 1.0703125, "learning_rate": 0.000495639648032203, "loss": 6.1684, "mean_token_accuracy": 0.16133927404880524, "num_tokens": 3387310.0, "step": 1645 }, { "entropy": 6.47861647605896, "epoch": 1.4642698624056814, "grad_norm": 1.0234375, "learning_rate": 0.0004955719016873192, "loss": 6.2004, "mean_token_accuracy": 0.1491427481174469, "num_tokens": 3398022.0, "step": 1650 }, { "entropy": 6.540802431106568, "epoch": 1.4687083888149135, "grad_norm": 1.1953125, "learning_rate": 0.0004955036383369688, "loss": 6.216, "mean_token_accuracy": 0.14632173478603364, "num_tokens": 3407315.0, "step": 1655 }, { "entropy": 6.459036493301392, "epoch": 1.4731469152241456, "grad_norm": 1.03125, "learning_rate": 0.0004954348581411564, "loss": 6.3148, "mean_token_accuracy": 0.14125865548849106, "num_tokens": 3418009.0, "step": 1660 }, { "entropy": 6.666120433807373, "epoch": 1.4775854416333778, "grad_norm": 1.0703125, "learning_rate": 0.000495365561261098, "loss": 6.3262, "mean_token_accuracy": 0.13915122225880622, "num_tokens": 3428659.0, "step": 1665 }, { "entropy": 6.513209629058838, "epoch": 1.48202396804261, "grad_norm": 1.1796875, "learning_rate": 0.0004952957478592209, "loss": 6.2605, "mean_token_accuracy": 0.14562821611762047, "num_tokens": 3439102.0, "step": 1670 }, { "entropy": 6.495951080322266, "epoch": 1.486462494451842, "grad_norm": 1.234375, "learning_rate": 0.0004952254180991628, "loss": 6.3143, "mean_token_accuracy": 0.14086345955729485, "num_tokens": 3450269.0, "step": 1675 }, { "entropy": 6.550183248519898, "epoch": 1.4909010208610742, "grad_norm": 1.0859375, "learning_rate": 0.0004951545721457719, "loss": 6.2323, "mean_token_accuracy": 0.15024334490299224, "num_tokens": 3459876.0, "step": 1680 }, { "entropy": 6.439149618148804, "epoch": 1.4953395472703064, "grad_norm": 1.2109375, "learning_rate": 0.0004950832101651062, "loss": 6.2879, "mean_token_accuracy": 0.1395568035542965, "num_tokens": 3469276.0, "step": 1685 }, { "entropy": 6.540930128097534, "epoch": 1.4997780736795385, "grad_norm": 1.0703125, "learning_rate": 0.0004950113323244336, "loss": 6.1873, "mean_token_accuracy": 0.14649046510457991, "num_tokens": 3479835.0, "step": 1690 }, { "entropy": 6.476472091674805, "epoch": 1.5042166000887707, "grad_norm": 1.0, "learning_rate": 0.0004949389387922305, "loss": 6.2472, "mean_token_accuracy": 0.14312107488512993, "num_tokens": 3491176.0, "step": 1695 }, { "entropy": 6.531066989898681, "epoch": 1.5086551264980028, "grad_norm": 1.1171875, "learning_rate": 0.0004948660297381826, "loss": 6.2262, "mean_token_accuracy": 0.14610032215714455, "num_tokens": 3501122.0, "step": 1700 }, { "entropy": 6.392983913421631, "epoch": 1.5130936529072347, "grad_norm": 1.140625, "learning_rate": 0.0004947926053331836, "loss": 6.1558, "mean_token_accuracy": 0.1542304791510105, "num_tokens": 3510875.0, "step": 1705 }, { "entropy": 6.541310834884643, "epoch": 1.517532179316467, "grad_norm": 1.0078125, "learning_rate": 0.0004947186657493354, "loss": 6.2377, "mean_token_accuracy": 0.1494641751050949, "num_tokens": 3521798.0, "step": 1710 }, { "entropy": 6.438729286193848, "epoch": 1.521970705725699, "grad_norm": 1.0390625, "learning_rate": 0.0004946442111599473, "loss": 6.2043, "mean_token_accuracy": 0.1451006591320038, "num_tokens": 3531456.0, "step": 1715 }, { "entropy": 6.580926847457886, "epoch": 1.5264092321349312, "grad_norm": 1.140625, "learning_rate": 0.0004945692417395358, "loss": 6.251, "mean_token_accuracy": 0.14176156222820283, "num_tokens": 3541315.0, "step": 1720 }, { "entropy": 6.448061084747314, "epoch": 1.5308477585441633, "grad_norm": 0.9453125, "learning_rate": 0.000494493757663824, "loss": 6.2238, "mean_token_accuracy": 0.14351213127374648, "num_tokens": 3552876.0, "step": 1725 }, { "entropy": 6.4509584426879885, "epoch": 1.5352862849533955, "grad_norm": 0.96875, "learning_rate": 0.0004944177591097415, "loss": 6.2331, "mean_token_accuracy": 0.14354335144162178, "num_tokens": 3563967.0, "step": 1730 }, { "entropy": 6.457042932510376, "epoch": 1.5397248113626276, "grad_norm": 1.1015625, "learning_rate": 0.0004943412462554236, "loss": 6.2159, "mean_token_accuracy": 0.1507117457687855, "num_tokens": 3573510.0, "step": 1735 }, { "entropy": 6.546308755874634, "epoch": 1.5441633377718598, "grad_norm": 1.0078125, "learning_rate": 0.0004942642192802114, "loss": 6.3099, "mean_token_accuracy": 0.13970684260129929, "num_tokens": 3584863.0, "step": 1740 }, { "entropy": 6.455177211761475, "epoch": 1.548601864181092, "grad_norm": 1.203125, "learning_rate": 0.0004941866783646508, "loss": 6.2268, "mean_token_accuracy": 0.14618334472179412, "num_tokens": 3594489.0, "step": 1745 }, { "entropy": 6.556396770477295, "epoch": 1.553040390590324, "grad_norm": 1.0, "learning_rate": 0.0004941086236904923, "loss": 6.2043, "mean_token_accuracy": 0.14727460145950316, "num_tokens": 3605159.0, "step": 1750 }, { "entropy": 6.481395721435547, "epoch": 1.557478916999556, "grad_norm": 1.0859375, "learning_rate": 0.0004940300554406909, "loss": 6.3012, "mean_token_accuracy": 0.14313508197665215, "num_tokens": 3615254.0, "step": 1755 }, { "entropy": 6.445766162872315, "epoch": 1.5619174434087881, "grad_norm": 1.0390625, "learning_rate": 0.000493950973799405, "loss": 6.1703, "mean_token_accuracy": 0.15018191039562226, "num_tokens": 3625015.0, "step": 1760 }, { "entropy": 6.42508454322815, "epoch": 1.5663559698180203, "grad_norm": 1.171875, "learning_rate": 0.0004938713789519967, "loss": 6.2497, "mean_token_accuracy": 0.1505135826766491, "num_tokens": 3636083.0, "step": 1765 }, { "entropy": 6.512313747406006, "epoch": 1.5707944962272524, "grad_norm": 1.2265625, "learning_rate": 0.0004937912710850309, "loss": 6.166, "mean_token_accuracy": 0.1465531922876835, "num_tokens": 3646363.0, "step": 1770 }, { "entropy": 6.370706844329834, "epoch": 1.5752330226364846, "grad_norm": 1.046875, "learning_rate": 0.0004937106503862749, "loss": 6.1685, "mean_token_accuracy": 0.1537150263786316, "num_tokens": 3656868.0, "step": 1775 }, { "entropy": 6.539106035232544, "epoch": 1.5796715490457167, "grad_norm": 1.1953125, "learning_rate": 0.0004936295170446981, "loss": 6.3492, "mean_token_accuracy": 0.1347063384950161, "num_tokens": 3668105.0, "step": 1780 }, { "entropy": 6.607371664047241, "epoch": 1.5841100754549489, "grad_norm": 1.0234375, "learning_rate": 0.0004935478712504715, "loss": 6.2487, "mean_token_accuracy": 0.1385604441165924, "num_tokens": 3678841.0, "step": 1785 }, { "entropy": 6.4086525440216064, "epoch": 1.588548601864181, "grad_norm": 1.125, "learning_rate": 0.0004934657131949674, "loss": 6.2415, "mean_token_accuracy": 0.14987936168909072, "num_tokens": 3688603.0, "step": 1790 }, { "entropy": 6.529016494750977, "epoch": 1.5929871282734132, "grad_norm": 1.359375, "learning_rate": 0.0004933830430707585, "loss": 6.2542, "mean_token_accuracy": 0.13600879460573195, "num_tokens": 3698312.0, "step": 1795 }, { "entropy": 6.4327093124389645, "epoch": 1.5974256546826453, "grad_norm": 1.046875, "learning_rate": 0.000493299861071618, "loss": 6.1204, "mean_token_accuracy": 0.15229299366474153, "num_tokens": 3708252.0, "step": 1800 }, { "entropy": 6.483391284942627, "epoch": 1.6018641810918774, "grad_norm": 1.1015625, "learning_rate": 0.0004932161673925189, "loss": 6.1691, "mean_token_accuracy": 0.1462477594614029, "num_tokens": 3718431.0, "step": 1805 }, { "entropy": 6.433411121368408, "epoch": 1.6063027075011096, "grad_norm": 1.0078125, "learning_rate": 0.0004931319622296333, "loss": 6.0884, "mean_token_accuracy": 0.15784337967634202, "num_tokens": 3729170.0, "step": 1810 }, { "entropy": 6.474455261230469, "epoch": 1.6107412339103417, "grad_norm": 1.140625, "learning_rate": 0.0004930472457803324, "loss": 6.1861, "mean_token_accuracy": 0.1482206791639328, "num_tokens": 3738885.0, "step": 1815 }, { "entropy": 6.340183973312378, "epoch": 1.6151797603195739, "grad_norm": 1.1640625, "learning_rate": 0.0004929620182431858, "loss": 6.1744, "mean_token_accuracy": 0.15203531160950662, "num_tokens": 3748535.0, "step": 1820 }, { "entropy": 6.444498491287232, "epoch": 1.619618286728806, "grad_norm": 1.0390625, "learning_rate": 0.0004928762798179612, "loss": 6.237, "mean_token_accuracy": 0.14974780827760698, "num_tokens": 3758827.0, "step": 1825 }, { "entropy": 6.455253171920776, "epoch": 1.6240568131380382, "grad_norm": 1.046875, "learning_rate": 0.0004927900307056233, "loss": 6.1615, "mean_token_accuracy": 0.1510964810848236, "num_tokens": 3768632.0, "step": 1830 }, { "entropy": 6.441723012924195, "epoch": 1.6284953395472703, "grad_norm": 1.09375, "learning_rate": 0.0004927032711083342, "loss": 6.214, "mean_token_accuracy": 0.14101684093475342, "num_tokens": 3779324.0, "step": 1835 }, { "entropy": 6.381724882125854, "epoch": 1.6329338659565025, "grad_norm": 1.0546875, "learning_rate": 0.0004926160012294526, "loss": 6.1586, "mean_token_accuracy": 0.15024627447128297, "num_tokens": 3789744.0, "step": 1840 }, { "entropy": 6.370701789855957, "epoch": 1.6373723923657346, "grad_norm": 1.1171875, "learning_rate": 0.000492528221273533, "loss": 6.1104, "mean_token_accuracy": 0.1493580684065819, "num_tokens": 3799831.0, "step": 1845 }, { "entropy": 6.542438220977783, "epoch": 1.6418109187749668, "grad_norm": 1.078125, "learning_rate": 0.0004924399314463258, "loss": 6.2365, "mean_token_accuracy": 0.14592818170785904, "num_tokens": 3812102.0, "step": 1850 }, { "entropy": 6.4679584980010985, "epoch": 1.646249445184199, "grad_norm": 1.03125, "learning_rate": 0.0004923511319547761, "loss": 6.2914, "mean_token_accuracy": 0.13645976781845093, "num_tokens": 3822750.0, "step": 1855 }, { "entropy": 6.439510631561279, "epoch": 1.650687971593431, "grad_norm": 1.0546875, "learning_rate": 0.000492261823007024, "loss": 6.2064, "mean_token_accuracy": 0.1489210918545723, "num_tokens": 3832354.0, "step": 1860 }, { "entropy": 6.458003902435303, "epoch": 1.6551264980026632, "grad_norm": 1.1015625, "learning_rate": 0.0004921720048124034, "loss": 6.2224, "mean_token_accuracy": 0.1468009516596794, "num_tokens": 3842930.0, "step": 1865 }, { "entropy": 6.5039207458496096, "epoch": 1.6595650244118954, "grad_norm": 1.171875, "learning_rate": 0.0004920816775814422, "loss": 6.2599, "mean_token_accuracy": 0.14020814523100852, "num_tokens": 3852952.0, "step": 1870 }, { "entropy": 6.454715347290039, "epoch": 1.6640035508211275, "grad_norm": 1.1484375, "learning_rate": 0.0004919908415258612, "loss": 6.2067, "mean_token_accuracy": 0.14455220550298692, "num_tokens": 3863070.0, "step": 1875 }, { "entropy": 6.4132616996765135, "epoch": 1.6684420772303596, "grad_norm": 1.1484375, "learning_rate": 0.000491899496858574, "loss": 6.1501, "mean_token_accuracy": 0.15156037211418152, "num_tokens": 3872767.0, "step": 1880 }, { "entropy": 6.3353992938995365, "epoch": 1.6728806036395918, "grad_norm": 1.0546875, "learning_rate": 0.0004918076437936859, "loss": 6.1056, "mean_token_accuracy": 0.15438561514019966, "num_tokens": 3883183.0, "step": 1885 }, { "entropy": 6.433599185943604, "epoch": 1.677319130048824, "grad_norm": 0.9921875, "learning_rate": 0.0004917152825464947, "loss": 6.1996, "mean_token_accuracy": 0.1471118450164795, "num_tokens": 3893304.0, "step": 1890 }, { "entropy": 6.44781608581543, "epoch": 1.681757656458056, "grad_norm": 1.0, "learning_rate": 0.0004916224133334885, "loss": 6.135, "mean_token_accuracy": 0.1504994697868824, "num_tokens": 3903786.0, "step": 1895 }, { "entropy": 6.413273906707763, "epoch": 1.686196182867288, "grad_norm": 1.1171875, "learning_rate": 0.0004915290363723465, "loss": 6.1426, "mean_token_accuracy": 0.14888948425650597, "num_tokens": 3913703.0, "step": 1900 }, { "entropy": 6.3861230373382565, "epoch": 1.6906347092765202, "grad_norm": 0.96875, "learning_rate": 0.0004914351518819379, "loss": 6.197, "mean_token_accuracy": 0.14716671407222748, "num_tokens": 3923653.0, "step": 1905 }, { "entropy": 6.3618451118469235, "epoch": 1.6950732356857523, "grad_norm": 1.1875, "learning_rate": 0.0004913407600823216, "loss": 6.0837, "mean_token_accuracy": 0.15539871603250505, "num_tokens": 3933915.0, "step": 1910 }, { "entropy": 6.429026556015015, "epoch": 1.6995117620949844, "grad_norm": 1.109375, "learning_rate": 0.0004912458611947454, "loss": 6.1613, "mean_token_accuracy": 0.14607803374528885, "num_tokens": 3943334.0, "step": 1915 }, { "entropy": 6.512318658828735, "epoch": 1.7039502885042166, "grad_norm": 1.1015625, "learning_rate": 0.000491150455441646, "loss": 6.2164, "mean_token_accuracy": 0.13555126562714576, "num_tokens": 3952608.0, "step": 1920 }, { "entropy": 6.345305156707764, "epoch": 1.7083888149134487, "grad_norm": 1.0390625, "learning_rate": 0.0004910545430466478, "loss": 6.123, "mean_token_accuracy": 0.1472136050462723, "num_tokens": 3963398.0, "step": 1925 }, { "entropy": 6.38430609703064, "epoch": 1.7128273413226809, "grad_norm": 1.046875, "learning_rate": 0.0004909581242345628, "loss": 6.1552, "mean_token_accuracy": 0.14694450199604034, "num_tokens": 3973878.0, "step": 1930 }, { "entropy": 6.430195760726929, "epoch": 1.717265867731913, "grad_norm": 1.2109375, "learning_rate": 0.0004908611992313905, "loss": 6.1648, "mean_token_accuracy": 0.13664614632725716, "num_tokens": 3983681.0, "step": 1935 }, { "entropy": 6.39329776763916, "epoch": 1.7217043941411452, "grad_norm": 1.1953125, "learning_rate": 0.0004907637682643162, "loss": 6.201, "mean_token_accuracy": 0.14567800536751746, "num_tokens": 3995026.0, "step": 1940 }, { "entropy": 6.430534839630127, "epoch": 1.7261429205503773, "grad_norm": 1.1015625, "learning_rate": 0.0004906658315617112, "loss": 6.2022, "mean_token_accuracy": 0.14595392793416978, "num_tokens": 4005089.0, "step": 1945 }, { "entropy": 6.359121513366699, "epoch": 1.7305814469596092, "grad_norm": 1.0078125, "learning_rate": 0.0004905673893531331, "loss": 6.1076, "mean_token_accuracy": 0.15097568482160567, "num_tokens": 4014795.0, "step": 1950 }, { "entropy": 6.326131105422974, "epoch": 1.7350199733688414, "grad_norm": 1.5703125, "learning_rate": 0.0004904684418693231, "loss": 6.1828, "mean_token_accuracy": 0.14517654925584794, "num_tokens": 4025563.0, "step": 1955 }, { "entropy": 6.499860239028931, "epoch": 1.7394584997780735, "grad_norm": 1.0546875, "learning_rate": 0.0004903689893422077, "loss": 6.116, "mean_token_accuracy": 0.1486818477511406, "num_tokens": 4035050.0, "step": 1960 }, { "entropy": 6.305110931396484, "epoch": 1.7438970261873057, "grad_norm": 0.984375, "learning_rate": 0.0004902690320048966, "loss": 6.1345, "mean_token_accuracy": 0.14928318560123444, "num_tokens": 4046109.0, "step": 1965 }, { "entropy": 6.449776601791382, "epoch": 1.7483355525965378, "grad_norm": 1.0703125, "learning_rate": 0.000490168570091683, "loss": 6.1848, "mean_token_accuracy": 0.1390085846185684, "num_tokens": 4056776.0, "step": 1970 }, { "entropy": 6.319344854354858, "epoch": 1.75277407900577, "grad_norm": 1.125, "learning_rate": 0.0004900676038380429, "loss": 6.0406, "mean_token_accuracy": 0.16621824055910112, "num_tokens": 4066326.0, "step": 1975 }, { "entropy": 6.454939699172973, "epoch": 1.7572126054150021, "grad_norm": 0.98828125, "learning_rate": 0.0004899661334806342, "loss": 6.1759, "mean_token_accuracy": 0.15071096420288085, "num_tokens": 4077478.0, "step": 1980 }, { "entropy": 6.262599611282349, "epoch": 1.7616511318242343, "grad_norm": 1.109375, "learning_rate": 0.0004898641592572965, "loss": 6.1057, "mean_token_accuracy": 0.15066718459129333, "num_tokens": 4087661.0, "step": 1985 }, { "entropy": 6.442129898071289, "epoch": 1.7660896582334664, "grad_norm": 1.0625, "learning_rate": 0.0004897616814070505, "loss": 6.1694, "mean_token_accuracy": 0.15258410200476646, "num_tokens": 4097450.0, "step": 1990 }, { "entropy": 6.382274055480957, "epoch": 1.7705281846426986, "grad_norm": 1.0546875, "learning_rate": 0.0004896587001700972, "loss": 6.2003, "mean_token_accuracy": 0.14331723377108574, "num_tokens": 4106850.0, "step": 1995 }, { "entropy": 6.4386186599731445, "epoch": 1.7749667110519307, "grad_norm": 0.9375, "learning_rate": 0.0004895552157878174, "loss": 6.2273, "mean_token_accuracy": 0.1446727268397808, "num_tokens": 4117561.0, "step": 2000 }, { "epoch": 1.7749667110519307, "eval_entropy": 6.304367476574315, "eval_loss": 6.241267681121826, "eval_mean_token_accuracy": 0.14483241421876214, "eval_num_tokens": 4117561.0, "eval_runtime": 2.0862, "eval_samples_per_second": 1613.972, "eval_steps_per_second": 201.806, "step": 2000 }, { "entropy": 6.513484525680542, "epoch": 1.7794052374611629, "grad_norm": 1.1875, "learning_rate": 0.0004894512285027717, "loss": 6.1375, "mean_token_accuracy": 0.15294163376092912, "num_tokens": 4126913.0, "step": 2005 }, { "entropy": 6.32349796295166, "epoch": 1.783843763870395, "grad_norm": 1.046875, "learning_rate": 0.0004893467385586991, "loss": 6.1763, "mean_token_accuracy": 0.14652613997459413, "num_tokens": 4136501.0, "step": 2010 }, { "entropy": 6.455650901794433, "epoch": 1.7882822902796272, "grad_norm": 1.0234375, "learning_rate": 0.000489241746200517, "loss": 6.1304, "mean_token_accuracy": 0.14899376183748245, "num_tokens": 4147263.0, "step": 2015 }, { "entropy": 6.39251856803894, "epoch": 1.7927208166888593, "grad_norm": 0.91796875, "learning_rate": 0.0004891362516743201, "loss": 6.1805, "mean_token_accuracy": 0.1439195953309536, "num_tokens": 4159251.0, "step": 2020 }, { "entropy": 6.375892972946167, "epoch": 1.7971593430980914, "grad_norm": 1.03125, "learning_rate": 0.0004890302552273805, "loss": 6.1605, "mean_token_accuracy": 0.14276045113801955, "num_tokens": 4170601.0, "step": 2025 }, { "entropy": 6.455142402648926, "epoch": 1.8015978695073236, "grad_norm": 1.0703125, "learning_rate": 0.0004889237571081465, "loss": 6.1291, "mean_token_accuracy": 0.1502329871058464, "num_tokens": 4181650.0, "step": 2030 }, { "entropy": 6.3142640590667725, "epoch": 1.8060363959165557, "grad_norm": 1.0234375, "learning_rate": 0.0004888167575662425, "loss": 6.0242, "mean_token_accuracy": 0.1540951281785965, "num_tokens": 4191514.0, "step": 2035 }, { "entropy": 6.364542388916016, "epoch": 1.8104749223257879, "grad_norm": 1.0234375, "learning_rate": 0.0004887092568524682, "loss": 6.1543, "mean_token_accuracy": 0.1545771673321724, "num_tokens": 4200909.0, "step": 2040 }, { "entropy": 6.418929243087769, "epoch": 1.81491344873502, "grad_norm": 1.0625, "learning_rate": 0.0004886012552187979, "loss": 6.0958, "mean_token_accuracy": 0.1500440776348114, "num_tokens": 4211139.0, "step": 2045 }, { "entropy": 6.353375577926636, "epoch": 1.8193519751442522, "grad_norm": 0.89453125, "learning_rate": 0.0004884927529183799, "loss": 6.1404, "mean_token_accuracy": 0.1507970094680786, "num_tokens": 4221754.0, "step": 2050 }, { "entropy": 6.401797246932984, "epoch": 1.8237905015534843, "grad_norm": 1.0703125, "learning_rate": 0.0004883837502055363, "loss": 6.0354, "mean_token_accuracy": 0.15554228723049163, "num_tokens": 4232771.0, "step": 2055 }, { "entropy": 6.274783992767334, "epoch": 1.8282290279627165, "grad_norm": 1.0, "learning_rate": 0.0004882742473357619, "loss": 6.047, "mean_token_accuracy": 0.162461756169796, "num_tokens": 4242860.0, "step": 2060 }, { "entropy": 6.384546136856079, "epoch": 1.8326675543719486, "grad_norm": 0.98828125, "learning_rate": 0.00048816424456572403, "loss": 6.2057, "mean_token_accuracy": 0.1450534589588642, "num_tokens": 4253442.0, "step": 2065 }, { "entropy": 6.373266220092773, "epoch": 1.8371060807811808, "grad_norm": 1.171875, "learning_rate": 0.0004880537421532618, "loss": 6.1037, "mean_token_accuracy": 0.14555230140686035, "num_tokens": 4263856.0, "step": 2070 }, { "entropy": 6.2938440322875975, "epoch": 1.841544607190413, "grad_norm": 1.0546875, "learning_rate": 0.00048794274035738515, "loss": 6.0456, "mean_token_accuracy": 0.158289635181427, "num_tokens": 4274251.0, "step": 2075 }, { "entropy": 6.333366107940674, "epoch": 1.845983133599645, "grad_norm": 1.2109375, "learning_rate": 0.0004878312394382747, "loss": 6.0724, "mean_token_accuracy": 0.15534539371728898, "num_tokens": 4283486.0, "step": 2080 }, { "entropy": 6.355884695053101, "epoch": 1.8504216600088772, "grad_norm": 1.03125, "learning_rate": 0.000487719239657281, "loss": 6.168, "mean_token_accuracy": 0.14514408335089685, "num_tokens": 4293908.0, "step": 2085 }, { "entropy": 6.315519952774048, "epoch": 1.8548601864181093, "grad_norm": 1.03125, "learning_rate": 0.000487606741276924, "loss": 6.0074, "mean_token_accuracy": 0.15041493326425553, "num_tokens": 4303255.0, "step": 2090 }, { "entropy": 6.367549180984497, "epoch": 1.8592987128273413, "grad_norm": 1.5703125, "learning_rate": 0.0004874937445608921, "loss": 6.222, "mean_token_accuracy": 0.14236995279788972, "num_tokens": 4313981.0, "step": 2095 }, { "entropy": 6.414429569244385, "epoch": 1.8637372392365734, "grad_norm": 0.96875, "learning_rate": 0.0004873802497740418, "loss": 6.1659, "mean_token_accuracy": 0.1489059269428253, "num_tokens": 4325010.0, "step": 2100 }, { "entropy": 6.336979866027832, "epoch": 1.8681757656458056, "grad_norm": 1.078125, "learning_rate": 0.0004872662571823973, "loss": 6.142, "mean_token_accuracy": 0.15032578706741334, "num_tokens": 4336279.0, "step": 2105 }, { "entropy": 6.276753234863281, "epoch": 1.8726142920550377, "grad_norm": 0.984375, "learning_rate": 0.00048715176705314936, "loss": 6.0886, "mean_token_accuracy": 0.15055317282676697, "num_tokens": 4345816.0, "step": 2110 }, { "entropy": 6.390111589431763, "epoch": 1.8770528184642699, "grad_norm": 1.15625, "learning_rate": 0.00048703677965465506, "loss": 6.1546, "mean_token_accuracy": 0.14694484174251557, "num_tokens": 4356520.0, "step": 2115 }, { "entropy": 6.38926854133606, "epoch": 1.881491344873502, "grad_norm": 1.03125, "learning_rate": 0.00048692129525643694, "loss": 6.0455, "mean_token_accuracy": 0.15440051704645158, "num_tokens": 4367517.0, "step": 2120 }, { "entropy": 6.319567394256592, "epoch": 1.8859298712827341, "grad_norm": 1.140625, "learning_rate": 0.00048680531412918267, "loss": 6.1221, "mean_token_accuracy": 0.14795979335904122, "num_tokens": 4378043.0, "step": 2125 }, { "entropy": 6.339055061340332, "epoch": 1.8903683976919663, "grad_norm": 1.0703125, "learning_rate": 0.0004866888365447439, "loss": 6.1116, "mean_token_accuracy": 0.15579188615083694, "num_tokens": 4388098.0, "step": 2130 }, { "entropy": 6.342102432250977, "epoch": 1.8948069241011984, "grad_norm": 1.1640625, "learning_rate": 0.0004865718627761363, "loss": 6.0351, "mean_token_accuracy": 0.16426317244768143, "num_tokens": 4397745.0, "step": 2135 }, { "entropy": 6.255016899108886, "epoch": 1.8992454505104306, "grad_norm": 1.1015625, "learning_rate": 0.0004864543930975383, "loss": 6.1125, "mean_token_accuracy": 0.1508719764649868, "num_tokens": 4407995.0, "step": 2140 }, { "entropy": 6.372575426101685, "epoch": 1.9036839769196625, "grad_norm": 1.125, "learning_rate": 0.0004863364277842908, "loss": 6.0864, "mean_token_accuracy": 0.1544354021549225, "num_tokens": 4417574.0, "step": 2145 }, { "entropy": 6.287673425674439, "epoch": 1.9081225033288947, "grad_norm": 1.046875, "learning_rate": 0.0004862179671128965, "loss": 6.0029, "mean_token_accuracy": 0.1653035208582878, "num_tokens": 4428772.0, "step": 2150 }, { "entropy": 6.284837818145752, "epoch": 1.9125610297381268, "grad_norm": 1.1015625, "learning_rate": 0.000486099011361019, "loss": 6.0921, "mean_token_accuracy": 0.156430184841156, "num_tokens": 4438971.0, "step": 2155 }, { "entropy": 6.439360094070435, "epoch": 1.916999556147359, "grad_norm": 0.953125, "learning_rate": 0.00048597956080748264, "loss": 6.2184, "mean_token_accuracy": 0.147563187032938, "num_tokens": 4449685.0, "step": 2160 }, { "entropy": 6.310244178771972, "epoch": 1.921438082556591, "grad_norm": 1.0078125, "learning_rate": 0.00048585961573227116, "loss": 6.1103, "mean_token_accuracy": 0.15256588608026506, "num_tokens": 4460260.0, "step": 2165 }, { "entropy": 6.324094629287719, "epoch": 1.9258766089658232, "grad_norm": 1.1015625, "learning_rate": 0.0004857391764165277, "loss": 6.0654, "mean_token_accuracy": 0.15756789296865464, "num_tokens": 4471149.0, "step": 2170 }, { "entropy": 6.27415452003479, "epoch": 1.9303151353750554, "grad_norm": 1.0234375, "learning_rate": 0.00048561824314255383, "loss": 6.0969, "mean_token_accuracy": 0.15434358417987823, "num_tokens": 4481506.0, "step": 2175 }, { "entropy": 6.373397016525269, "epoch": 1.9347536617842875, "grad_norm": 1.015625, "learning_rate": 0.00048549681619380886, "loss": 6.1389, "mean_token_accuracy": 0.14398213624954223, "num_tokens": 4492541.0, "step": 2180 }, { "entropy": 6.348176717758179, "epoch": 1.9391921881935197, "grad_norm": 1.046875, "learning_rate": 0.0004853748958549092, "loss": 6.0879, "mean_token_accuracy": 0.15113953053951262, "num_tokens": 4502727.0, "step": 2185 }, { "entropy": 6.243179750442505, "epoch": 1.9436307146027518, "grad_norm": 1.1171875, "learning_rate": 0.0004852524824116278, "loss": 6.1136, "mean_token_accuracy": 0.14689265042543412, "num_tokens": 4512657.0, "step": 2190 }, { "entropy": 6.332787084579468, "epoch": 1.948069241011984, "grad_norm": 1.140625, "learning_rate": 0.00048512957615089354, "loss": 5.9777, "mean_token_accuracy": 0.15856263190507888, "num_tokens": 4522083.0, "step": 2195 }, { "entropy": 6.226612901687622, "epoch": 1.9525077674212161, "grad_norm": 1.0078125, "learning_rate": 0.0004850061773607902, "loss": 6.0255, "mean_token_accuracy": 0.1586281806230545, "num_tokens": 4531882.0, "step": 2200 }, { "entropy": 6.2661069393157955, "epoch": 1.9569462938304483, "grad_norm": 1.078125, "learning_rate": 0.000484882286330556, "loss": 6.0668, "mean_token_accuracy": 0.15751879066228866, "num_tokens": 4541724.0, "step": 2205 }, { "entropy": 6.290356159210205, "epoch": 1.9613848202396804, "grad_norm": 0.984375, "learning_rate": 0.0004847579033505833, "loss": 6.0823, "mean_token_accuracy": 0.1551389679312706, "num_tokens": 4551889.0, "step": 2210 }, { "entropy": 6.299551630020142, "epoch": 1.9658233466489126, "grad_norm": 1.015625, "learning_rate": 0.0004846330287124171, "loss": 6.1149, "mean_token_accuracy": 0.1571243390440941, "num_tokens": 4561792.0, "step": 2215 }, { "entropy": 6.349295568466187, "epoch": 1.9702618730581447, "grad_norm": 1.0078125, "learning_rate": 0.00048450766270875513, "loss": 6.0104, "mean_token_accuracy": 0.1578826203942299, "num_tokens": 4572021.0, "step": 2220 }, { "entropy": 6.304033708572388, "epoch": 1.9747003994673769, "grad_norm": 1.03125, "learning_rate": 0.00048438180563344666, "loss": 6.0659, "mean_token_accuracy": 0.15220063626766206, "num_tokens": 4582800.0, "step": 2225 }, { "entropy": 6.356626272201538, "epoch": 1.979138925876609, "grad_norm": 1.046875, "learning_rate": 0.00048425545778149213, "loss": 6.1376, "mean_token_accuracy": 0.1478087991476059, "num_tokens": 4593035.0, "step": 2230 }, { "entropy": 6.293792295455932, "epoch": 1.9835774522858411, "grad_norm": 1.0859375, "learning_rate": 0.0004841286194490423, "loss": 6.0004, "mean_token_accuracy": 0.1586893692612648, "num_tokens": 4602625.0, "step": 2235 }, { "entropy": 6.298813009262085, "epoch": 1.9880159786950733, "grad_norm": 0.95703125, "learning_rate": 0.00048400129093339745, "loss": 6.0939, "mean_token_accuracy": 0.15187210515141486, "num_tokens": 4613419.0, "step": 2240 }, { "entropy": 6.2934352397918705, "epoch": 1.9924545051043054, "grad_norm": 1.2578125, "learning_rate": 0.00048387347253300703, "loss": 6.0592, "mean_token_accuracy": 0.15442992970347405, "num_tokens": 4622575.0, "step": 2245 }, { "entropy": 6.2924830436706545, "epoch": 1.9968930315135376, "grad_norm": 1.0546875, "learning_rate": 0.0004837451645474685, "loss": 6.0589, "mean_token_accuracy": 0.15284667909145355, "num_tokens": 4632497.0, "step": 2250 }, { "entropy": 6.336415661705865, "epoch": 2.0008877052818463, "grad_norm": 1.0390625, "learning_rate": 0.00048361636727752716, "loss": 6.0301, "mean_token_accuracy": 0.15711821946832868, "num_tokens": 4641305.0, "step": 2255 }, { "entropy": 6.320528984069824, "epoch": 2.0053262316910785, "grad_norm": 1.109375, "learning_rate": 0.000483487081025075, "loss": 5.826, "mean_token_accuracy": 0.16330702155828475, "num_tokens": 4650986.0, "step": 2260 }, { "entropy": 6.267225694656372, "epoch": 2.0097647581003106, "grad_norm": 1.015625, "learning_rate": 0.00048335730609315, "loss": 5.7919, "mean_token_accuracy": 0.165120992064476, "num_tokens": 4661836.0, "step": 2265 }, { "entropy": 6.285591506958008, "epoch": 2.014203284509543, "grad_norm": 1.078125, "learning_rate": 0.00048322704278593595, "loss": 5.7822, "mean_token_accuracy": 0.1718212589621544, "num_tokens": 4671325.0, "step": 2270 }, { "entropy": 6.2631378173828125, "epoch": 2.018641810918775, "grad_norm": 1.0390625, "learning_rate": 0.00048309629140876097, "loss": 5.7983, "mean_token_accuracy": 0.16487672328948974, "num_tokens": 4682334.0, "step": 2275 }, { "entropy": 6.278176546096802, "epoch": 2.023080337328007, "grad_norm": 1.0078125, "learning_rate": 0.0004829650522680974, "loss": 5.8037, "mean_token_accuracy": 0.16945539861917497, "num_tokens": 4691486.0, "step": 2280 }, { "entropy": 6.2450908660888675, "epoch": 2.027518863737239, "grad_norm": 1.0546875, "learning_rate": 0.0004828333256715609, "loss": 5.7808, "mean_token_accuracy": 0.1654707446694374, "num_tokens": 4700841.0, "step": 2285 }, { "entropy": 6.16944465637207, "epoch": 2.0319573901464714, "grad_norm": 1.015625, "learning_rate": 0.0004827011119279096, "loss": 5.7364, "mean_token_accuracy": 0.17380234599113464, "num_tokens": 4709842.0, "step": 2290 }, { "entropy": 6.2213818550109865, "epoch": 2.0363959165557035, "grad_norm": 1.015625, "learning_rate": 0.00048256841134704335, "loss": 5.7495, "mean_token_accuracy": 0.1679978162050247, "num_tokens": 4720193.0, "step": 2295 }, { "entropy": 6.182414245605469, "epoch": 2.0408344429649357, "grad_norm": 1.03125, "learning_rate": 0.00048243522424000333, "loss": 5.8063, "mean_token_accuracy": 0.1693178117275238, "num_tokens": 4729503.0, "step": 2300 }, { "entropy": 6.248026180267334, "epoch": 2.045272969374168, "grad_norm": 1.0390625, "learning_rate": 0.000482301550918971, "loss": 5.7874, "mean_token_accuracy": 0.17118435055017472, "num_tokens": 4740241.0, "step": 2305 }, { "entropy": 6.120760440826416, "epoch": 2.0497114957834, "grad_norm": 0.99609375, "learning_rate": 0.0004821673916972676, "loss": 5.676, "mean_token_accuracy": 0.18444487154483796, "num_tokens": 4749616.0, "step": 2310 }, { "entropy": 6.1944496631622314, "epoch": 2.054150022192632, "grad_norm": 1.0859375, "learning_rate": 0.000482032746889353, "loss": 5.7767, "mean_token_accuracy": 0.16697147488594055, "num_tokens": 4759846.0, "step": 2315 }, { "entropy": 6.24187216758728, "epoch": 2.0585885486018642, "grad_norm": 1.078125, "learning_rate": 0.00048189761681082557, "loss": 5.8296, "mean_token_accuracy": 0.16175905466079712, "num_tokens": 4769441.0, "step": 2320 }, { "entropy": 6.2141406536102295, "epoch": 2.0630270750110964, "grad_norm": 1.1875, "learning_rate": 0.0004817620017784209, "loss": 5.7617, "mean_token_accuracy": 0.16938935965299606, "num_tokens": 4779962.0, "step": 2325 }, { "entropy": 6.242314195632934, "epoch": 2.0674656014203285, "grad_norm": 1.078125, "learning_rate": 0.00048162590211001143, "loss": 5.8326, "mean_token_accuracy": 0.16407378911972045, "num_tokens": 4790275.0, "step": 2330 }, { "entropy": 6.061077022552491, "epoch": 2.0719041278295607, "grad_norm": 1.0859375, "learning_rate": 0.00048148931812460536, "loss": 5.7234, "mean_token_accuracy": 0.17769070863723754, "num_tokens": 4800799.0, "step": 2335 }, { "entropy": 6.300735187530518, "epoch": 2.076342654238793, "grad_norm": 1.1875, "learning_rate": 0.0004813522501423464, "loss": 5.8311, "mean_token_accuracy": 0.16275566965341567, "num_tokens": 4811786.0, "step": 2340 }, { "entropy": 6.152251577377319, "epoch": 2.080781180648025, "grad_norm": 1.0625, "learning_rate": 0.0004812146984845124, "loss": 5.7383, "mean_token_accuracy": 0.17451401948928832, "num_tokens": 4821321.0, "step": 2345 }, { "entropy": 6.21392674446106, "epoch": 2.085219707057257, "grad_norm": 1.0234375, "learning_rate": 0.00048107666347351505, "loss": 5.7691, "mean_token_accuracy": 0.17131485641002656, "num_tokens": 4831418.0, "step": 2350 }, { "entropy": 6.152781057357788, "epoch": 2.0896582334664893, "grad_norm": 0.984375, "learning_rate": 0.00048093814543289894, "loss": 5.7544, "mean_token_accuracy": 0.1736764594912529, "num_tokens": 4843326.0, "step": 2355 }, { "entropy": 6.162942695617676, "epoch": 2.0940967598757214, "grad_norm": 1.1796875, "learning_rate": 0.00048079914468734117, "loss": 5.7209, "mean_token_accuracy": 0.17366211116313934, "num_tokens": 4853946.0, "step": 2360 }, { "entropy": 6.194116878509521, "epoch": 2.0985352862849536, "grad_norm": 1.1171875, "learning_rate": 0.00048065966156264964, "loss": 5.761, "mean_token_accuracy": 0.1711730867624283, "num_tokens": 4863494.0, "step": 2365 }, { "entropy": 6.145648765563965, "epoch": 2.1029738126941857, "grad_norm": 1.1484375, "learning_rate": 0.00048051969638576345, "loss": 5.749, "mean_token_accuracy": 0.16969802528619765, "num_tokens": 4872583.0, "step": 2370 }, { "entropy": 6.198772192001343, "epoch": 2.107412339103418, "grad_norm": 0.97265625, "learning_rate": 0.00048037924948475134, "loss": 5.6999, "mean_token_accuracy": 0.18126114159822465, "num_tokens": 4882333.0, "step": 2375 }, { "entropy": 6.133423471450806, "epoch": 2.11185086551265, "grad_norm": 1.0703125, "learning_rate": 0.0004802383211888114, "loss": 5.8388, "mean_token_accuracy": 0.16247562766075135, "num_tokens": 4892874.0, "step": 2380 }, { "entropy": 6.190569829940796, "epoch": 2.116289391921882, "grad_norm": 1.0, "learning_rate": 0.0004800969118282697, "loss": 5.7077, "mean_token_accuracy": 0.17178617119789125, "num_tokens": 4903666.0, "step": 2385 }, { "entropy": 6.148941993713379, "epoch": 2.120727918331114, "grad_norm": 1.0390625, "learning_rate": 0.0004799550217345803, "loss": 5.8135, "mean_token_accuracy": 0.16479915231466294, "num_tokens": 4913565.0, "step": 2390 }, { "entropy": 6.25219759941101, "epoch": 2.125166444740346, "grad_norm": 1.015625, "learning_rate": 0.00047981265124032375, "loss": 5.8806, "mean_token_accuracy": 0.16119145303964616, "num_tokens": 4924664.0, "step": 2395 }, { "entropy": 6.1365477561950685, "epoch": 2.129604971149578, "grad_norm": 1.015625, "learning_rate": 0.00047966980067920686, "loss": 5.787, "mean_token_accuracy": 0.16446771174669267, "num_tokens": 4935361.0, "step": 2400 }, { "entropy": 6.212709236145019, "epoch": 2.1340434975588103, "grad_norm": 0.96484375, "learning_rate": 0.00047952647038606157, "loss": 5.7139, "mean_token_accuracy": 0.1764111801981926, "num_tokens": 4946954.0, "step": 2405 }, { "entropy": 6.166495609283447, "epoch": 2.1384820239680424, "grad_norm": 1.1484375, "learning_rate": 0.0004793826606968443, "loss": 5.8285, "mean_token_accuracy": 0.1607503190636635, "num_tokens": 4957497.0, "step": 2410 }, { "entropy": 6.101367950439453, "epoch": 2.1429205503772746, "grad_norm": 1.1640625, "learning_rate": 0.000479238371948635, "loss": 5.7757, "mean_token_accuracy": 0.16357363164424896, "num_tokens": 4968069.0, "step": 2415 }, { "entropy": 6.219218921661377, "epoch": 2.1473590767865067, "grad_norm": 1.0625, "learning_rate": 0.0004790936044796369, "loss": 5.7844, "mean_token_accuracy": 0.17338328510522844, "num_tokens": 4978417.0, "step": 2420 }, { "entropy": 6.17771635055542, "epoch": 2.151797603195739, "grad_norm": 1.1015625, "learning_rate": 0.00047894835862917473, "loss": 5.7621, "mean_token_accuracy": 0.16970881968736648, "num_tokens": 4989670.0, "step": 2425 }, { "entropy": 6.143991899490357, "epoch": 2.156236129604971, "grad_norm": 0.9921875, "learning_rate": 0.00047880263473769514, "loss": 5.8096, "mean_token_accuracy": 0.16401513367891313, "num_tokens": 5000346.0, "step": 2430 }, { "entropy": 6.209756994247437, "epoch": 2.160674656014203, "grad_norm": 1.078125, "learning_rate": 0.0004786564331467648, "loss": 5.7988, "mean_token_accuracy": 0.16377755850553513, "num_tokens": 5011878.0, "step": 2435 }, { "entropy": 6.224458789825439, "epoch": 2.1651131824234353, "grad_norm": 1.0234375, "learning_rate": 0.00047850975419907034, "loss": 5.8718, "mean_token_accuracy": 0.162304849922657, "num_tokens": 5022939.0, "step": 2440 }, { "entropy": 6.232002401351929, "epoch": 2.1695517088326675, "grad_norm": 1.1953125, "learning_rate": 0.00047836259823841716, "loss": 5.7963, "mean_token_accuracy": 0.1669462203979492, "num_tokens": 5033613.0, "step": 2445 }, { "entropy": 6.125792789459228, "epoch": 2.1739902352418996, "grad_norm": 1.0625, "learning_rate": 0.0004782149656097287, "loss": 5.7654, "mean_token_accuracy": 0.1679580643773079, "num_tokens": 5043926.0, "step": 2450 }, { "entropy": 6.151848697662354, "epoch": 2.1784287616511318, "grad_norm": 1.0859375, "learning_rate": 0.00047806685665904586, "loss": 5.8006, "mean_token_accuracy": 0.17178182303905487, "num_tokens": 5054179.0, "step": 2455 }, { "entropy": 6.080358839035034, "epoch": 2.182867288060364, "grad_norm": 1.140625, "learning_rate": 0.0004779182717335258, "loss": 5.7625, "mean_token_accuracy": 0.16996095776557923, "num_tokens": 5063654.0, "step": 2460 }, { "entropy": 6.169263648986816, "epoch": 2.187305814469596, "grad_norm": 1.078125, "learning_rate": 0.00047776921118144154, "loss": 5.8695, "mean_token_accuracy": 0.1624024137854576, "num_tokens": 5073558.0, "step": 2465 }, { "entropy": 6.250872087478638, "epoch": 2.191744340878828, "grad_norm": 1.0625, "learning_rate": 0.00047761967535218084, "loss": 5.8175, "mean_token_accuracy": 0.16334515810012817, "num_tokens": 5083218.0, "step": 2470 }, { "entropy": 6.116773986816407, "epoch": 2.1961828672880603, "grad_norm": 1.0859375, "learning_rate": 0.0004774696645962453, "loss": 5.7848, "mean_token_accuracy": 0.17051488161087036, "num_tokens": 5093037.0, "step": 2475 }, { "entropy": 6.085236072540283, "epoch": 2.2006213936972925, "grad_norm": 1.015625, "learning_rate": 0.0004773191792652501, "loss": 5.7379, "mean_token_accuracy": 0.17253995835781097, "num_tokens": 5103434.0, "step": 2480 }, { "entropy": 6.203386831283569, "epoch": 2.2050599201065246, "grad_norm": 1.046875, "learning_rate": 0.0004771682197119224, "loss": 5.8513, "mean_token_accuracy": 0.16081491261720657, "num_tokens": 5113325.0, "step": 2485 }, { "entropy": 6.135442781448364, "epoch": 2.2094984465157568, "grad_norm": 1.0625, "learning_rate": 0.00047701678629010115, "loss": 5.812, "mean_token_accuracy": 0.16577334851026534, "num_tokens": 5124957.0, "step": 2490 }, { "entropy": 6.2259856224060055, "epoch": 2.213936972924989, "grad_norm": 1.0859375, "learning_rate": 0.0004768648793547359, "loss": 5.7559, "mean_token_accuracy": 0.17162533700466157, "num_tokens": 5134491.0, "step": 2495 }, { "entropy": 6.040803050994873, "epoch": 2.218375499334221, "grad_norm": 1.0390625, "learning_rate": 0.0004767124992618863, "loss": 5.7236, "mean_token_accuracy": 0.17656566202640533, "num_tokens": 5145063.0, "step": 2500 }, { "epoch": 2.218375499334221, "eval_entropy": 5.758825140157958, "eval_loss": 6.117055416107178, "eval_mean_token_accuracy": 0.15501565050838112, "eval_num_tokens": 5145063.0, "eval_runtime": 2.0862, "eval_samples_per_second": 1613.95, "eval_steps_per_second": 201.804, "step": 2500 }, { "entropy": 6.138974285125732, "epoch": 2.222814025743453, "grad_norm": 1.203125, "learning_rate": 0.0004765596463687207, "loss": 5.839, "mean_token_accuracy": 0.16339409202337266, "num_tokens": 5155396.0, "step": 2505 }, { "entropy": 6.151093578338623, "epoch": 2.2272525521526854, "grad_norm": 1.046875, "learning_rate": 0.00047640632103351576, "loss": 5.7831, "mean_token_accuracy": 0.16532318145036698, "num_tokens": 5166499.0, "step": 2510 }, { "entropy": 6.171177387237549, "epoch": 2.2316910785619175, "grad_norm": 1.1484375, "learning_rate": 0.00047625252361565586, "loss": 5.8143, "mean_token_accuracy": 0.1652636408805847, "num_tokens": 5177530.0, "step": 2515 }, { "entropy": 6.115115642547607, "epoch": 2.2361296049711497, "grad_norm": 1.21875, "learning_rate": 0.00047609825447563137, "loss": 5.6925, "mean_token_accuracy": 0.1710483983159065, "num_tokens": 5187427.0, "step": 2520 }, { "entropy": 6.033501386642456, "epoch": 2.240568131380382, "grad_norm": 1.1015625, "learning_rate": 0.0004759435139750388, "loss": 5.6936, "mean_token_accuracy": 0.17407233715057374, "num_tokens": 5198888.0, "step": 2525 }, { "entropy": 6.088896322250366, "epoch": 2.245006657789614, "grad_norm": 1.109375, "learning_rate": 0.00047578830247657915, "loss": 5.6968, "mean_token_accuracy": 0.17464374303817748, "num_tokens": 5208463.0, "step": 2530 }, { "entropy": 6.135959005355835, "epoch": 2.249445184198846, "grad_norm": 1.171875, "learning_rate": 0.00047563262034405773, "loss": 5.8129, "mean_token_accuracy": 0.16065521836280822, "num_tokens": 5219989.0, "step": 2535 }, { "entropy": 6.196387863159179, "epoch": 2.2538837106080782, "grad_norm": 1.15625, "learning_rate": 0.00047547646794238277, "loss": 5.823, "mean_token_accuracy": 0.16879613399505616, "num_tokens": 5231443.0, "step": 2540 }, { "entropy": 6.069067049026489, "epoch": 2.2583222370173104, "grad_norm": 1.1484375, "learning_rate": 0.0004753198456375647, "loss": 5.7687, "mean_token_accuracy": 0.17048330157995223, "num_tokens": 5241633.0, "step": 2545 }, { "entropy": 6.197365951538086, "epoch": 2.2627607634265425, "grad_norm": 1.0546875, "learning_rate": 0.0004751627537967158, "loss": 5.7616, "mean_token_accuracy": 0.17182915061712264, "num_tokens": 5252486.0, "step": 2550 }, { "entropy": 6.106606483459473, "epoch": 2.2671992898357747, "grad_norm": 1.015625, "learning_rate": 0.00047500519278804835, "loss": 5.7842, "mean_token_accuracy": 0.16441592425107956, "num_tokens": 5262672.0, "step": 2555 }, { "entropy": 6.161299324035644, "epoch": 2.271637816245007, "grad_norm": 1.046875, "learning_rate": 0.0004748471629808746, "loss": 5.7257, "mean_token_accuracy": 0.1692223384976387, "num_tokens": 5273547.0, "step": 2560 }, { "entropy": 6.044488430023193, "epoch": 2.276076342654239, "grad_norm": 1.0078125, "learning_rate": 0.00047468866474560575, "loss": 5.7477, "mean_token_accuracy": 0.1677919000387192, "num_tokens": 5284935.0, "step": 2565 }, { "entropy": 6.1366087913513185, "epoch": 2.280514869063471, "grad_norm": 1.1328125, "learning_rate": 0.00047452969845375074, "loss": 5.7731, "mean_token_accuracy": 0.17664981484413148, "num_tokens": 5295237.0, "step": 2570 }, { "entropy": 6.143746471405029, "epoch": 2.2849533954727033, "grad_norm": 1.15625, "learning_rate": 0.0004743702644779157, "loss": 5.8109, "mean_token_accuracy": 0.16415809839963913, "num_tokens": 5305288.0, "step": 2575 }, { "entropy": 6.148390245437622, "epoch": 2.2893919218819354, "grad_norm": 0.98828125, "learning_rate": 0.000474210363191803, "loss": 5.7359, "mean_token_accuracy": 0.1691213622689247, "num_tokens": 5316031.0, "step": 2580 }, { "entropy": 6.067453241348266, "epoch": 2.2938304482911676, "grad_norm": 1.0390625, "learning_rate": 0.0004740499949702103, "loss": 5.7778, "mean_token_accuracy": 0.16342108249664306, "num_tokens": 5327544.0, "step": 2585 }, { "entropy": 6.038386487960816, "epoch": 2.2982689747003997, "grad_norm": 1.109375, "learning_rate": 0.0004738891601890298, "loss": 5.718, "mean_token_accuracy": 0.17032305002212525, "num_tokens": 5338282.0, "step": 2590 }, { "entropy": 6.144178962707519, "epoch": 2.302707501109632, "grad_norm": 1.078125, "learning_rate": 0.0004737278592252473, "loss": 5.7589, "mean_token_accuracy": 0.17450494766235353, "num_tokens": 5348300.0, "step": 2595 }, { "entropy": 6.15695972442627, "epoch": 2.3071460275188636, "grad_norm": 0.98828125, "learning_rate": 0.0004735660924569411, "loss": 5.8636, "mean_token_accuracy": 0.16162828356027603, "num_tokens": 5360193.0, "step": 2600 }, { "entropy": 6.121260452270508, "epoch": 2.3115845539280957, "grad_norm": 1.0703125, "learning_rate": 0.0004734038602632815, "loss": 5.7297, "mean_token_accuracy": 0.1731833279132843, "num_tokens": 5369655.0, "step": 2605 }, { "entropy": 6.111371564865112, "epoch": 2.316023080337328, "grad_norm": 0.94921875, "learning_rate": 0.00047324116302452975, "loss": 5.792, "mean_token_accuracy": 0.16499196141958236, "num_tokens": 5379654.0, "step": 2610 }, { "entropy": 6.121448135375976, "epoch": 2.32046160674656, "grad_norm": 1.0625, "learning_rate": 0.0004730780011220369, "loss": 5.7201, "mean_token_accuracy": 0.17435721009969712, "num_tokens": 5389527.0, "step": 2615 }, { "entropy": 6.137268733978272, "epoch": 2.324900133155792, "grad_norm": 1.0390625, "learning_rate": 0.0004729143749382435, "loss": 5.8075, "mean_token_accuracy": 0.1641774520277977, "num_tokens": 5399480.0, "step": 2620 }, { "entropy": 6.093860912322998, "epoch": 2.3293386595650243, "grad_norm": 1.015625, "learning_rate": 0.00047275028485667793, "loss": 5.6667, "mean_token_accuracy": 0.17897211164236068, "num_tokens": 5410065.0, "step": 2625 }, { "entropy": 6.025512218475342, "epoch": 2.3337771859742564, "grad_norm": 1.1171875, "learning_rate": 0.0004725857312619563, "loss": 5.7156, "mean_token_accuracy": 0.17173065543174743, "num_tokens": 5419519.0, "step": 2630 }, { "entropy": 6.155104923248291, "epoch": 2.3382157123834886, "grad_norm": 1.03125, "learning_rate": 0.0004724207145397809, "loss": 5.7943, "mean_token_accuracy": 0.1667987123131752, "num_tokens": 5429907.0, "step": 2635 }, { "entropy": 6.147578144073487, "epoch": 2.3426542387927207, "grad_norm": 1.09375, "learning_rate": 0.0004722552350769397, "loss": 5.7846, "mean_token_accuracy": 0.1689673498272896, "num_tokens": 5440051.0, "step": 2640 }, { "entropy": 6.044529819488526, "epoch": 2.347092765201953, "grad_norm": 0.93359375, "learning_rate": 0.00047208929326130535, "loss": 5.7874, "mean_token_accuracy": 0.16316695511341095, "num_tokens": 5452596.0, "step": 2645 }, { "entropy": 6.1003374576568605, "epoch": 2.351531291611185, "grad_norm": 0.9921875, "learning_rate": 0.00047192288948183394, "loss": 5.8084, "mean_token_accuracy": 0.15916725099086762, "num_tokens": 5463133.0, "step": 2650 }, { "entropy": 6.074586248397827, "epoch": 2.355969818020417, "grad_norm": 1.0390625, "learning_rate": 0.00047175602412856453, "loss": 5.7162, "mean_token_accuracy": 0.17868943214416505, "num_tokens": 5473934.0, "step": 2655 }, { "entropy": 6.048851585388183, "epoch": 2.3604083444296493, "grad_norm": 1.1171875, "learning_rate": 0.00047158869759261843, "loss": 5.7626, "mean_token_accuracy": 0.1687912866473198, "num_tokens": 5483921.0, "step": 2660 }, { "entropy": 6.145990705490112, "epoch": 2.3648468708388815, "grad_norm": 1.0546875, "learning_rate": 0.0004714209102661973, "loss": 5.7686, "mean_token_accuracy": 0.16941458731889725, "num_tokens": 5494218.0, "step": 2665 }, { "entropy": 6.121583032608032, "epoch": 2.3692853972481136, "grad_norm": 0.97265625, "learning_rate": 0.0004712526625425832, "loss": 5.811, "mean_token_accuracy": 0.1643875315785408, "num_tokens": 5504942.0, "step": 2670 }, { "entropy": 6.102924728393555, "epoch": 2.3737239236573457, "grad_norm": 1.0703125, "learning_rate": 0.00047108395481613736, "loss": 5.8558, "mean_token_accuracy": 0.15613222420215606, "num_tokens": 5514624.0, "step": 2675 }, { "entropy": 6.14481372833252, "epoch": 2.378162450066578, "grad_norm": 1.078125, "learning_rate": 0.00047091478748229927, "loss": 5.6984, "mean_token_accuracy": 0.17392003685235977, "num_tokens": 5524098.0, "step": 2680 }, { "entropy": 6.04828372001648, "epoch": 2.38260097647581, "grad_norm": 0.96484375, "learning_rate": 0.0004707451609375854, "loss": 5.7557, "mean_token_accuracy": 0.1692517578601837, "num_tokens": 5534585.0, "step": 2685 }, { "entropy": 6.10555362701416, "epoch": 2.387039502885042, "grad_norm": 1.125, "learning_rate": 0.0004705750755795889, "loss": 5.7966, "mean_token_accuracy": 0.168571537733078, "num_tokens": 5544136.0, "step": 2690 }, { "entropy": 6.117819595336914, "epoch": 2.3914780292942743, "grad_norm": 0.9921875, "learning_rate": 0.00047040453180697823, "loss": 5.691, "mean_token_accuracy": 0.1738590866327286, "num_tokens": 5554939.0, "step": 2695 }, { "entropy": 6.123975086212158, "epoch": 2.3959165557035065, "grad_norm": 1.0390625, "learning_rate": 0.0004702335300194963, "loss": 5.7762, "mean_token_accuracy": 0.16760747879743576, "num_tokens": 5564533.0, "step": 2700 }, { "entropy": 6.117423820495605, "epoch": 2.4003550821127386, "grad_norm": 1.0, "learning_rate": 0.0004700620706179596, "loss": 5.8196, "mean_token_accuracy": 0.16853979229927063, "num_tokens": 5575140.0, "step": 2705 }, { "entropy": 6.141474914550781, "epoch": 2.4047936085219708, "grad_norm": 1.0546875, "learning_rate": 0.0004698901540042573, "loss": 5.7775, "mean_token_accuracy": 0.16901845932006837, "num_tokens": 5585399.0, "step": 2710 }, { "entropy": 6.079065132141113, "epoch": 2.409232134931203, "grad_norm": 0.98828125, "learning_rate": 0.00046971778058135024, "loss": 5.6638, "mean_token_accuracy": 0.18335538804531099, "num_tokens": 5596194.0, "step": 2715 }, { "entropy": 6.042174386978149, "epoch": 2.413670661340435, "grad_norm": 1.2734375, "learning_rate": 0.00046954495075326986, "loss": 5.8439, "mean_token_accuracy": 0.16659024804830552, "num_tokens": 5608317.0, "step": 2720 }, { "entropy": 6.13245415687561, "epoch": 2.418109187749667, "grad_norm": 1.140625, "learning_rate": 0.00046937166492511746, "loss": 5.725, "mean_token_accuracy": 0.1753625452518463, "num_tokens": 5617777.0, "step": 2725 }, { "entropy": 6.06634931564331, "epoch": 2.4225477141588994, "grad_norm": 1.1875, "learning_rate": 0.00046919792350306317, "loss": 5.7311, "mean_token_accuracy": 0.1771342933177948, "num_tokens": 5628056.0, "step": 2730 }, { "entropy": 5.94120683670044, "epoch": 2.4269862405681315, "grad_norm": 1.015625, "learning_rate": 0.0004690237268943451, "loss": 5.7222, "mean_token_accuracy": 0.17666102647781373, "num_tokens": 5638073.0, "step": 2735 }, { "entropy": 6.103239822387695, "epoch": 2.4314247669773636, "grad_norm": 1.140625, "learning_rate": 0.00046884907550726816, "loss": 5.6812, "mean_token_accuracy": 0.1819820836186409, "num_tokens": 5647290.0, "step": 2740 }, { "entropy": 6.077079916000367, "epoch": 2.435863293386596, "grad_norm": 1.0859375, "learning_rate": 0.00046867396975120324, "loss": 5.7744, "mean_token_accuracy": 0.16964205503463745, "num_tokens": 5656882.0, "step": 2745 }, { "entropy": 6.1173424243927, "epoch": 2.440301819795828, "grad_norm": 1.03125, "learning_rate": 0.0004684984100365863, "loss": 5.8316, "mean_token_accuracy": 0.16495220363140106, "num_tokens": 5667803.0, "step": 2750 }, { "entropy": 6.142762899398804, "epoch": 2.44474034620506, "grad_norm": 1.0625, "learning_rate": 0.00046832239677491736, "loss": 5.7461, "mean_token_accuracy": 0.1722828820347786, "num_tokens": 5678319.0, "step": 2755 }, { "entropy": 6.022468090057373, "epoch": 2.4491788726142922, "grad_norm": 1.0703125, "learning_rate": 0.0004681459303787594, "loss": 5.7948, "mean_token_accuracy": 0.16484333127737044, "num_tokens": 5688677.0, "step": 2760 }, { "entropy": 6.150290822982788, "epoch": 2.4536173990235244, "grad_norm": 0.99609375, "learning_rate": 0.0004679690112617376, "loss": 5.8075, "mean_token_accuracy": 0.16610533744096756, "num_tokens": 5699538.0, "step": 2765 }, { "entropy": 6.095004320144653, "epoch": 2.458055925432756, "grad_norm": 1.046875, "learning_rate": 0.0004677916398385383, "loss": 5.6928, "mean_token_accuracy": 0.18449453860521317, "num_tokens": 5709461.0, "step": 2770 }, { "entropy": 6.063209056854248, "epoch": 2.4624944518419882, "grad_norm": 1.109375, "learning_rate": 0.000467613816524908, "loss": 5.7058, "mean_token_accuracy": 0.17079256027936934, "num_tokens": 5718220.0, "step": 2775 }, { "entropy": 6.105566453933716, "epoch": 2.4669329782512204, "grad_norm": 0.9765625, "learning_rate": 0.0004674355417376524, "loss": 5.7678, "mean_token_accuracy": 0.16715284287929535, "num_tokens": 5728638.0, "step": 2780 }, { "entropy": 6.0401427268981935, "epoch": 2.4713715046604525, "grad_norm": 1.1015625, "learning_rate": 0.00046725681589463537, "loss": 5.7113, "mean_token_accuracy": 0.17297857254743576, "num_tokens": 5738854.0, "step": 2785 }, { "entropy": 6.040780830383301, "epoch": 2.4758100310696847, "grad_norm": 1.1796875, "learning_rate": 0.00046707763941477817, "loss": 5.6819, "mean_token_accuracy": 0.1767168715596199, "num_tokens": 5748624.0, "step": 2790 }, { "entropy": 6.007115411758423, "epoch": 2.480248557478917, "grad_norm": 1.046875, "learning_rate": 0.0004668980127180582, "loss": 5.7215, "mean_token_accuracy": 0.17497175931930542, "num_tokens": 5759846.0, "step": 2795 }, { "entropy": 6.1033079624176025, "epoch": 2.484687083888149, "grad_norm": 1.0078125, "learning_rate": 0.0004667179362255081, "loss": 5.7512, "mean_token_accuracy": 0.17809866815805436, "num_tokens": 5769983.0, "step": 2800 }, { "entropy": 6.070840358734131, "epoch": 2.489125610297381, "grad_norm": 1.078125, "learning_rate": 0.0004665374103592149, "loss": 5.7566, "mean_token_accuracy": 0.1682102620601654, "num_tokens": 5780691.0, "step": 2805 }, { "entropy": 6.047124242782592, "epoch": 2.4935641367066133, "grad_norm": 1.046875, "learning_rate": 0.0004663564355423189, "loss": 5.6824, "mean_token_accuracy": 0.17610101848840715, "num_tokens": 5790690.0, "step": 2810 }, { "entropy": 6.104051399230957, "epoch": 2.4980026631158454, "grad_norm": 1.0546875, "learning_rate": 0.0004661750121990128, "loss": 5.7507, "mean_token_accuracy": 0.17295027673244476, "num_tokens": 5801088.0, "step": 2815 }, { "entropy": 5.899098825454712, "epoch": 2.5024411895250775, "grad_norm": 1.0703125, "learning_rate": 0.00046599314075454034, "loss": 5.6632, "mean_token_accuracy": 0.17894352227449417, "num_tokens": 5811451.0, "step": 2820 }, { "entropy": 6.042473268508911, "epoch": 2.5068797159343097, "grad_norm": 1.0859375, "learning_rate": 0.00046581082163519585, "loss": 5.6985, "mean_token_accuracy": 0.1734083727002144, "num_tokens": 5822024.0, "step": 2825 }, { "entropy": 5.998702621459961, "epoch": 2.511318242343542, "grad_norm": 1.046875, "learning_rate": 0.00046562805526832284, "loss": 5.7612, "mean_token_accuracy": 0.1688615247607231, "num_tokens": 5831634.0, "step": 2830 }, { "entropy": 6.080638408660889, "epoch": 2.515756768752774, "grad_norm": 1.1484375, "learning_rate": 0.0004654448420823133, "loss": 5.7544, "mean_token_accuracy": 0.17119256556034088, "num_tokens": 5842422.0, "step": 2835 }, { "entropy": 6.030310201644897, "epoch": 2.520195295162006, "grad_norm": 1.140625, "learning_rate": 0.00046526118250660636, "loss": 5.7404, "mean_token_accuracy": 0.17302993685007095, "num_tokens": 5851658.0, "step": 2840 }, { "entropy": 6.0097393035888675, "epoch": 2.5246338215712383, "grad_norm": 1.046875, "learning_rate": 0.0004650770769716875, "loss": 5.7635, "mean_token_accuracy": 0.16970502585172653, "num_tokens": 5861900.0, "step": 2845 }, { "entropy": 6.13044376373291, "epoch": 2.5290723479804704, "grad_norm": 1.1015625, "learning_rate": 0.0004648925259090875, "loss": 5.8304, "mean_token_accuracy": 0.16660041362047195, "num_tokens": 5872675.0, "step": 2850 }, { "entropy": 6.098389196395874, "epoch": 2.5335108743897026, "grad_norm": 0.984375, "learning_rate": 0.00046470752975138146, "loss": 5.7127, "mean_token_accuracy": 0.17505834698677064, "num_tokens": 5882768.0, "step": 2855 }, { "entropy": 5.994097661972046, "epoch": 2.5379494007989347, "grad_norm": 1.1171875, "learning_rate": 0.00046452208893218777, "loss": 5.7086, "mean_token_accuracy": 0.17897956669330597, "num_tokens": 5892970.0, "step": 2860 }, { "entropy": 6.031912326812744, "epoch": 2.542387927208167, "grad_norm": 1.0390625, "learning_rate": 0.000464336203886167, "loss": 5.6679, "mean_token_accuracy": 0.17664587646722793, "num_tokens": 5903597.0, "step": 2865 }, { "entropy": 6.076654577255249, "epoch": 2.546826453617399, "grad_norm": 1.03125, "learning_rate": 0.000464149875049021, "loss": 5.7082, "mean_token_accuracy": 0.17591760605573653, "num_tokens": 5913908.0, "step": 2870 }, { "entropy": 6.035532999038696, "epoch": 2.551264980026631, "grad_norm": 1.015625, "learning_rate": 0.00046396310285749175, "loss": 5.7447, "mean_token_accuracy": 0.17051061540842055, "num_tokens": 5923022.0, "step": 2875 }, { "entropy": 6.030104494094848, "epoch": 2.5557035064358633, "grad_norm": 1.125, "learning_rate": 0.00046377588774936077, "loss": 5.7383, "mean_token_accuracy": 0.17380277961492538, "num_tokens": 5933005.0, "step": 2880 }, { "entropy": 6.0437328815460205, "epoch": 2.5601420328450954, "grad_norm": 1.1015625, "learning_rate": 0.00046358823016344713, "loss": 5.7029, "mean_token_accuracy": 0.17715244591236115, "num_tokens": 5943197.0, "step": 2885 }, { "entropy": 6.017801523208618, "epoch": 2.5645805592543276, "grad_norm": 0.9765625, "learning_rate": 0.0004634001305396076, "loss": 5.7701, "mean_token_accuracy": 0.17026674896478652, "num_tokens": 5954788.0, "step": 2890 }, { "entropy": 6.168081951141358, "epoch": 2.5690190856635597, "grad_norm": 1.1484375, "learning_rate": 0.00046321158931873486, "loss": 5.7751, "mean_token_accuracy": 0.16409984081983567, "num_tokens": 5965896.0, "step": 2895 }, { "entropy": 5.9579003810882565, "epoch": 2.573457612072792, "grad_norm": 1.203125, "learning_rate": 0.0004630226069427566, "loss": 5.616, "mean_token_accuracy": 0.18554621189832687, "num_tokens": 5975492.0, "step": 2900 }, { "entropy": 6.020355606079102, "epoch": 2.577896138482024, "grad_norm": 1.1015625, "learning_rate": 0.00046283318385463454, "loss": 5.6971, "mean_token_accuracy": 0.1745652511715889, "num_tokens": 5985489.0, "step": 2905 }, { "entropy": 5.985205554962159, "epoch": 2.582334664891256, "grad_norm": 1.1953125, "learning_rate": 0.0004626433204983636, "loss": 5.647, "mean_token_accuracy": 0.174534772336483, "num_tokens": 5995031.0, "step": 2910 }, { "entropy": 6.006907415390015, "epoch": 2.5867731913004883, "grad_norm": 1.0625, "learning_rate": 0.00046245301731897024, "loss": 5.7595, "mean_token_accuracy": 0.16590401232242585, "num_tokens": 6005010.0, "step": 2915 }, { "entropy": 6.114031076431274, "epoch": 2.5912117177097205, "grad_norm": 0.984375, "learning_rate": 0.00046226227476251256, "loss": 5.6742, "mean_token_accuracy": 0.1767223834991455, "num_tokens": 6016403.0, "step": 2920 }, { "entropy": 5.938989210128784, "epoch": 2.5956502441189526, "grad_norm": 1.0546875, "learning_rate": 0.0004620710932760776, "loss": 5.6682, "mean_token_accuracy": 0.18038018196821212, "num_tokens": 6026312.0, "step": 2925 }, { "entropy": 6.016516923904419, "epoch": 2.6000887705281848, "grad_norm": 1.078125, "learning_rate": 0.000461879473307782, "loss": 5.867, "mean_token_accuracy": 0.16858119815587996, "num_tokens": 6036857.0, "step": 2930 }, { "entropy": 6.142938184738159, "epoch": 2.604527296937417, "grad_norm": 1.0625, "learning_rate": 0.0004616874153067698, "loss": 5.7728, "mean_token_accuracy": 0.16579627990722656, "num_tokens": 6048270.0, "step": 2935 }, { "entropy": 6.05487551689148, "epoch": 2.608965823346649, "grad_norm": 1.0234375, "learning_rate": 0.0004614949197232118, "loss": 5.696, "mean_token_accuracy": 0.17658320367336272, "num_tokens": 6059351.0, "step": 2940 }, { "entropy": 5.983553838729859, "epoch": 2.613404349755881, "grad_norm": 1.0390625, "learning_rate": 0.0004613019870083045, "loss": 5.7345, "mean_token_accuracy": 0.1750687301158905, "num_tokens": 6069639.0, "step": 2945 }, { "entropy": 6.009236431121826, "epoch": 2.6178428761651134, "grad_norm": 0.96484375, "learning_rate": 0.00046110861761426903, "loss": 5.7475, "mean_token_accuracy": 0.16875652074813843, "num_tokens": 6081393.0, "step": 2950 }, { "entropy": 6.063278436660767, "epoch": 2.6222814025743455, "grad_norm": 1.078125, "learning_rate": 0.00046091481199435005, "loss": 5.7469, "mean_token_accuracy": 0.1720976859331131, "num_tokens": 6091043.0, "step": 2955 }, { "entropy": 6.051684427261352, "epoch": 2.6267199289835776, "grad_norm": 1.0234375, "learning_rate": 0.0004607205706028147, "loss": 5.733, "mean_token_accuracy": 0.1665470317006111, "num_tokens": 6101502.0, "step": 2960 }, { "entropy": 5.959883069992065, "epoch": 2.63115845539281, "grad_norm": 1.09375, "learning_rate": 0.0004605258938949514, "loss": 5.6537, "mean_token_accuracy": 0.1800918236374855, "num_tokens": 6110908.0, "step": 2965 }, { "entropy": 6.070306491851807, "epoch": 2.635596981802042, "grad_norm": 1.09375, "learning_rate": 0.00046033078232706923, "loss": 5.7551, "mean_token_accuracy": 0.17454806268215178, "num_tokens": 6120189.0, "step": 2970 }, { "entropy": 6.073927783966065, "epoch": 2.640035508211274, "grad_norm": 1.1953125, "learning_rate": 0.00046013523635649625, "loss": 5.7497, "mean_token_accuracy": 0.16859546005725862, "num_tokens": 6129095.0, "step": 2975 }, { "entropy": 6.0158473491668705, "epoch": 2.6444740346205062, "grad_norm": 0.94921875, "learning_rate": 0.00045993925644157883, "loss": 5.7132, "mean_token_accuracy": 0.1755117155611515, "num_tokens": 6139129.0, "step": 2980 }, { "entropy": 5.979988050460816, "epoch": 2.6489125610297384, "grad_norm": 1.0703125, "learning_rate": 0.0004597428430416807, "loss": 5.7295, "mean_token_accuracy": 0.17120434045791627, "num_tokens": 6148966.0, "step": 2985 }, { "entropy": 6.136995887756347, "epoch": 2.6533510874389705, "grad_norm": 1.1796875, "learning_rate": 0.00045954599661718126, "loss": 5.8193, "mean_token_accuracy": 0.1676889553666115, "num_tokens": 6158254.0, "step": 2990 }, { "entropy": 6.045438051223755, "epoch": 2.6577896138482027, "grad_norm": 0.97265625, "learning_rate": 0.00045934871762947504, "loss": 5.6964, "mean_token_accuracy": 0.17370334416627883, "num_tokens": 6167922.0, "step": 2995 }, { "entropy": 5.940775346755982, "epoch": 2.6622281402574344, "grad_norm": 1.0390625, "learning_rate": 0.00045915100654097076, "loss": 5.7092, "mean_token_accuracy": 0.17816627770662308, "num_tokens": 6179494.0, "step": 3000 }, { "epoch": 2.6622281402574344, "eval_entropy": 5.789337054001181, "eval_loss": 6.018830299377441, "eval_mean_token_accuracy": 0.16076800524480553, "eval_num_tokens": 6179494.0, "eval_runtime": 2.0923, "eval_samples_per_second": 1609.206, "eval_steps_per_second": 201.211, "step": 3000 }, { "entropy": 6.011846494674683, "epoch": 2.6666666666666665, "grad_norm": 1.234375, "learning_rate": 0.00045895286381508944, "loss": 5.7312, "mean_token_accuracy": 0.1753581464290619, "num_tokens": 6189732.0, "step": 3005 }, { "entropy": 6.029772520065308, "epoch": 2.6711051930758987, "grad_norm": 0.95703125, "learning_rate": 0.0004587542899162642, "loss": 5.7683, "mean_token_accuracy": 0.16387217342853547, "num_tokens": 6200582.0, "step": 3010 }, { "entropy": 6.066657304763794, "epoch": 2.675543719485131, "grad_norm": 1.1171875, "learning_rate": 0.00045855528530993874, "loss": 5.7476, "mean_token_accuracy": 0.17216766774654388, "num_tokens": 6210009.0, "step": 3015 }, { "entropy": 6.039933919906616, "epoch": 2.679982245894363, "grad_norm": 1.03125, "learning_rate": 0.0004583558504625661, "loss": 5.7558, "mean_token_accuracy": 0.1696187898516655, "num_tokens": 6220178.0, "step": 3020 }, { "entropy": 5.955683088302612, "epoch": 2.684420772303595, "grad_norm": 0.9921875, "learning_rate": 0.00045815598584160824, "loss": 5.6471, "mean_token_accuracy": 0.1844172552227974, "num_tokens": 6230147.0, "step": 3025 }, { "entropy": 6.097689056396485, "epoch": 2.6888592987128273, "grad_norm": 0.98046875, "learning_rate": 0.00045795569191553384, "loss": 5.7985, "mean_token_accuracy": 0.16727579087018968, "num_tokens": 6241561.0, "step": 3030 }, { "entropy": 5.979752445220948, "epoch": 2.6932978251220594, "grad_norm": 1.078125, "learning_rate": 0.0004577549691538183, "loss": 5.7252, "mean_token_accuracy": 0.18227578103542327, "num_tokens": 6251360.0, "step": 3035 }, { "entropy": 6.113001489639283, "epoch": 2.6977363515312915, "grad_norm": 1.2421875, "learning_rate": 0.00045755381802694206, "loss": 5.7266, "mean_token_accuracy": 0.1760123386979103, "num_tokens": 6261947.0, "step": 3040 }, { "entropy": 6.00572943687439, "epoch": 2.7021748779405237, "grad_norm": 1.1484375, "learning_rate": 0.00045735223900638967, "loss": 5.7118, "mean_token_accuracy": 0.16842464506626129, "num_tokens": 6272247.0, "step": 3045 }, { "entropy": 6.02584981918335, "epoch": 2.706613404349756, "grad_norm": 1.109375, "learning_rate": 0.00045715023256464855, "loss": 5.7608, "mean_token_accuracy": 0.1715293511748314, "num_tokens": 6282171.0, "step": 3050 }, { "entropy": 6.107793283462525, "epoch": 2.711051930758988, "grad_norm": 1.1796875, "learning_rate": 0.00045694779917520797, "loss": 5.7451, "mean_token_accuracy": 0.17290424555540085, "num_tokens": 6290993.0, "step": 3055 }, { "entropy": 5.978008699417114, "epoch": 2.71549045716822, "grad_norm": 1.09375, "learning_rate": 0.000456744939312558, "loss": 5.6471, "mean_token_accuracy": 0.18025294095277786, "num_tokens": 6301039.0, "step": 3060 }, { "entropy": 5.9843508243560795, "epoch": 2.7199289835774523, "grad_norm": 1.09375, "learning_rate": 0.0004565416534521883, "loss": 5.7301, "mean_token_accuracy": 0.16947097778320314, "num_tokens": 6312095.0, "step": 3065 }, { "entropy": 5.932244157791137, "epoch": 2.7243675099866844, "grad_norm": 1.1015625, "learning_rate": 0.000456337942070587, "loss": 5.6472, "mean_token_accuracy": 0.18285827040672303, "num_tokens": 6322621.0, "step": 3070 }, { "entropy": 6.0621102809906, "epoch": 2.7288060363959166, "grad_norm": 1.046875, "learning_rate": 0.0004561338056452396, "loss": 5.7749, "mean_token_accuracy": 0.17220864966511726, "num_tokens": 6332733.0, "step": 3075 }, { "entropy": 5.973612880706787, "epoch": 2.7332445628051487, "grad_norm": 1.0703125, "learning_rate": 0.0004559292446546281, "loss": 5.7143, "mean_token_accuracy": 0.17332967817783357, "num_tokens": 6343162.0, "step": 3080 }, { "entropy": 6.0895998001098635, "epoch": 2.737683089214381, "grad_norm": 0.984375, "learning_rate": 0.0004557242595782293, "loss": 5.742, "mean_token_accuracy": 0.17037878483533858, "num_tokens": 6354283.0, "step": 3085 }, { "entropy": 6.039672994613648, "epoch": 2.742121615623613, "grad_norm": 1.0078125, "learning_rate": 0.0004555188508965144, "loss": 5.6795, "mean_token_accuracy": 0.17761039584875107, "num_tokens": 6364645.0, "step": 3090 }, { "entropy": 5.966477537155152, "epoch": 2.746560142032845, "grad_norm": 1.09375, "learning_rate": 0.00045531301909094724, "loss": 5.6686, "mean_token_accuracy": 0.17619081139564513, "num_tokens": 6375156.0, "step": 3095 }, { "entropy": 6.012517929077148, "epoch": 2.7509986684420773, "grad_norm": 1.078125, "learning_rate": 0.0004551067646439834, "loss": 5.6824, "mean_token_accuracy": 0.17580184042453767, "num_tokens": 6385105.0, "step": 3100 }, { "entropy": 6.031947231292724, "epoch": 2.7554371948513094, "grad_norm": 1.140625, "learning_rate": 0.00045490008803906936, "loss": 5.7849, "mean_token_accuracy": 0.1666751965880394, "num_tokens": 6396122.0, "step": 3105 }, { "entropy": 6.084775066375732, "epoch": 2.7598757212605416, "grad_norm": 1.1640625, "learning_rate": 0.0004546929897606409, "loss": 5.6284, "mean_token_accuracy": 0.18060048222541808, "num_tokens": 6405668.0, "step": 3110 }, { "entropy": 5.962884092330933, "epoch": 2.7643142476697737, "grad_norm": 1.078125, "learning_rate": 0.00045448547029412225, "loss": 5.7133, "mean_token_accuracy": 0.17631541192531586, "num_tokens": 6415845.0, "step": 3115 }, { "entropy": 5.991909742355347, "epoch": 2.768752774079006, "grad_norm": 1.0625, "learning_rate": 0.00045427753012592477, "loss": 5.6724, "mean_token_accuracy": 0.1697130471467972, "num_tokens": 6424945.0, "step": 3120 }, { "entropy": 6.0469557762146, "epoch": 2.773191300488238, "grad_norm": 1.046875, "learning_rate": 0.00045406916974344617, "loss": 5.7563, "mean_token_accuracy": 0.17011816203594207, "num_tokens": 6435224.0, "step": 3125 }, { "entropy": 6.046081399917602, "epoch": 2.77762982689747, "grad_norm": 1.1953125, "learning_rate": 0.00045386038963506883, "loss": 5.7334, "mean_token_accuracy": 0.1699560046195984, "num_tokens": 6444519.0, "step": 3130 }, { "entropy": 5.950239896774292, "epoch": 2.7820683533067023, "grad_norm": 1.0546875, "learning_rate": 0.0004536511902901591, "loss": 5.7693, "mean_token_accuracy": 0.17263632714748384, "num_tokens": 6454377.0, "step": 3135 }, { "entropy": 5.952496862411499, "epoch": 2.7865068797159345, "grad_norm": 1.1640625, "learning_rate": 0.0004534415721990659, "loss": 5.5402, "mean_token_accuracy": 0.1998279348015785, "num_tokens": 6464073.0, "step": 3140 }, { "entropy": 6.071445178985596, "epoch": 2.790945406125166, "grad_norm": 1.1484375, "learning_rate": 0.00045323153585311975, "loss": 5.7179, "mean_token_accuracy": 0.1706698343157768, "num_tokens": 6473517.0, "step": 3145 }, { "entropy": 6.029016780853271, "epoch": 2.7953839325343983, "grad_norm": 1.1328125, "learning_rate": 0.0004530210817446316, "loss": 5.6796, "mean_token_accuracy": 0.17350984811782838, "num_tokens": 6482465.0, "step": 3150 }, { "entropy": 6.018514966964721, "epoch": 2.7998224589436305, "grad_norm": 1.0625, "learning_rate": 0.0004528102103668913, "loss": 5.7618, "mean_token_accuracy": 0.17125869393348694, "num_tokens": 6493420.0, "step": 3155 }, { "entropy": 6.028185033798218, "epoch": 2.8042609853528626, "grad_norm": 1.078125, "learning_rate": 0.0004525989222141671, "loss": 5.719, "mean_token_accuracy": 0.1788898825645447, "num_tokens": 6503395.0, "step": 3160 }, { "entropy": 6.030786037445068, "epoch": 2.8086995117620948, "grad_norm": 1.046875, "learning_rate": 0.00045238721778170386, "loss": 5.7436, "mean_token_accuracy": 0.17074056565761567, "num_tokens": 6514353.0, "step": 3165 }, { "entropy": 6.061694574356079, "epoch": 2.813138038171327, "grad_norm": 1.1484375, "learning_rate": 0.00045217509756572256, "loss": 5.6871, "mean_token_accuracy": 0.17090310156345367, "num_tokens": 6523501.0, "step": 3170 }, { "entropy": 5.97159743309021, "epoch": 2.817576564580559, "grad_norm": 0.96875, "learning_rate": 0.0004519625620634182, "loss": 5.7318, "mean_token_accuracy": 0.16962333917617797, "num_tokens": 6535135.0, "step": 3175 }, { "entropy": 6.10450177192688, "epoch": 2.822015090989791, "grad_norm": 0.98046875, "learning_rate": 0.00045174961177295964, "loss": 5.7209, "mean_token_accuracy": 0.17412717789411544, "num_tokens": 6546100.0, "step": 3180 }, { "entropy": 5.934656810760498, "epoch": 2.8264536173990233, "grad_norm": 1.0078125, "learning_rate": 0.00045153624719348773, "loss": 5.6484, "mean_token_accuracy": 0.17352755069732667, "num_tokens": 6557091.0, "step": 3185 }, { "entropy": 5.935671329498291, "epoch": 2.8308921438082555, "grad_norm": 1.03125, "learning_rate": 0.00045132246882511457, "loss": 5.6754, "mean_token_accuracy": 0.17148020267486572, "num_tokens": 6567469.0, "step": 3190 }, { "entropy": 6.015770435333252, "epoch": 2.8353306702174876, "grad_norm": 1.109375, "learning_rate": 0.0004511082771689219, "loss": 5.7007, "mean_token_accuracy": 0.17414820641279222, "num_tokens": 6577442.0, "step": 3195 }, { "entropy": 6.07279109954834, "epoch": 2.83976919662672, "grad_norm": 1.1875, "learning_rate": 0.00045089367272696046, "loss": 5.6299, "mean_token_accuracy": 0.1816476598381996, "num_tokens": 6587321.0, "step": 3200 }, { "entropy": 6.001161098480225, "epoch": 2.844207723035952, "grad_norm": 1.0390625, "learning_rate": 0.00045067865600224833, "loss": 5.7098, "mean_token_accuracy": 0.17837129086256026, "num_tokens": 6597971.0, "step": 3205 }, { "entropy": 5.96258053779602, "epoch": 2.848646249445184, "grad_norm": 1.0078125, "learning_rate": 0.00045046322749877005, "loss": 5.6859, "mean_token_accuracy": 0.1785979002714157, "num_tokens": 6608251.0, "step": 3210 }, { "entropy": 6.015719032287597, "epoch": 2.853084775854416, "grad_norm": 0.96875, "learning_rate": 0.00045024738772147534, "loss": 5.6568, "mean_token_accuracy": 0.1777540847659111, "num_tokens": 6618045.0, "step": 3215 }, { "entropy": 6.079815149307251, "epoch": 2.8575233022636484, "grad_norm": 0.95703125, "learning_rate": 0.0004500311371762778, "loss": 5.723, "mean_token_accuracy": 0.1762673020362854, "num_tokens": 6628162.0, "step": 3220 }, { "entropy": 6.04972767829895, "epoch": 2.8619618286728805, "grad_norm": 0.99609375, "learning_rate": 0.00044981447637005396, "loss": 5.7761, "mean_token_accuracy": 0.16095962822437287, "num_tokens": 6639225.0, "step": 3225 }, { "entropy": 5.983947801589966, "epoch": 2.8664003550821127, "grad_norm": 1.0078125, "learning_rate": 0.000449597405810642, "loss": 5.6133, "mean_token_accuracy": 0.17978738248348236, "num_tokens": 6649248.0, "step": 3230 }, { "entropy": 5.941468191146851, "epoch": 2.870838881491345, "grad_norm": 1.03125, "learning_rate": 0.0004493799260068405, "loss": 5.7351, "mean_token_accuracy": 0.17311612367630005, "num_tokens": 6660458.0, "step": 3235 }, { "entropy": 6.038877630233765, "epoch": 2.875277407900577, "grad_norm": 1.078125, "learning_rate": 0.0004491620374684072, "loss": 5.6762, "mean_token_accuracy": 0.17014368772506713, "num_tokens": 6669951.0, "step": 3240 }, { "entropy": 6.017770910263062, "epoch": 2.879715934309809, "grad_norm": 1.1171875, "learning_rate": 0.00044894374070605795, "loss": 5.743, "mean_token_accuracy": 0.17674416303634644, "num_tokens": 6680472.0, "step": 3245 }, { "entropy": 6.084974384307861, "epoch": 2.8841544607190412, "grad_norm": 1.15625, "learning_rate": 0.00044872503623146544, "loss": 5.7117, "mean_token_accuracy": 0.16619863510131835, "num_tokens": 6690939.0, "step": 3250 }, { "entropy": 5.94278769493103, "epoch": 2.8885929871282734, "grad_norm": 1.171875, "learning_rate": 0.00044850592455725804, "loss": 5.7764, "mean_token_accuracy": 0.17108806669712068, "num_tokens": 6701087.0, "step": 3255 }, { "entropy": 6.017983531951904, "epoch": 2.8930315135375055, "grad_norm": 1.0859375, "learning_rate": 0.0004482864061970185, "loss": 5.6862, "mean_token_accuracy": 0.18754952698945998, "num_tokens": 6712292.0, "step": 3260 }, { "entropy": 6.036191987991333, "epoch": 2.8974700399467377, "grad_norm": 1.046875, "learning_rate": 0.00044806648166528286, "loss": 5.659, "mean_token_accuracy": 0.17132395058870314, "num_tokens": 6722818.0, "step": 3265 }, { "entropy": 5.893555545806885, "epoch": 2.90190856635597, "grad_norm": 1.078125, "learning_rate": 0.00044784615147753934, "loss": 5.6816, "mean_token_accuracy": 0.1757792666554451, "num_tokens": 6733303.0, "step": 3270 }, { "entropy": 5.996296119689942, "epoch": 2.906347092765202, "grad_norm": 1.109375, "learning_rate": 0.00044762541615022664, "loss": 5.7015, "mean_token_accuracy": 0.17875064462423323, "num_tokens": 6742483.0, "step": 3275 }, { "entropy": 5.979998683929443, "epoch": 2.910785619174434, "grad_norm": 1.03125, "learning_rate": 0.00044740427620073344, "loss": 5.6603, "mean_token_accuracy": 0.17813819795846939, "num_tokens": 6752836.0, "step": 3280 }, { "entropy": 5.954287004470825, "epoch": 2.9152241455836663, "grad_norm": 1.0390625, "learning_rate": 0.00044718273214739654, "loss": 5.7308, "mean_token_accuracy": 0.17084962874650955, "num_tokens": 6764321.0, "step": 3285 }, { "entropy": 6.067618417739868, "epoch": 2.9196626719928984, "grad_norm": 1.09375, "learning_rate": 0.0004469607845095002, "loss": 5.6775, "mean_token_accuracy": 0.1735297128558159, "num_tokens": 6774034.0, "step": 3290 }, { "entropy": 5.988525152206421, "epoch": 2.9241011984021306, "grad_norm": 1.03125, "learning_rate": 0.0004467384338072744, "loss": 5.7772, "mean_token_accuracy": 0.1673002153635025, "num_tokens": 6786182.0, "step": 3295 }, { "entropy": 6.02162880897522, "epoch": 2.9285397248113627, "grad_norm": 1.0703125, "learning_rate": 0.0004465156805618941, "loss": 5.6475, "mean_token_accuracy": 0.17642576694488527, "num_tokens": 6795631.0, "step": 3300 }, { "entropy": 5.964630270004273, "epoch": 2.932978251220595, "grad_norm": 1.09375, "learning_rate": 0.0004462925252954775, "loss": 5.7392, "mean_token_accuracy": 0.16975196450948715, "num_tokens": 6805212.0, "step": 3305 }, { "entropy": 6.031642150878906, "epoch": 2.937416777629827, "grad_norm": 1.0859375, "learning_rate": 0.0004460689685310855, "loss": 5.7476, "mean_token_accuracy": 0.1703239858150482, "num_tokens": 6815680.0, "step": 3310 }, { "entropy": 6.008225917816162, "epoch": 2.941855304039059, "grad_norm": 1.109375, "learning_rate": 0.0004458450107927199, "loss": 5.6538, "mean_token_accuracy": 0.180711767077446, "num_tokens": 6824694.0, "step": 3315 }, { "entropy": 5.845587253570557, "epoch": 2.9462938304482913, "grad_norm": 1.0625, "learning_rate": 0.00044562065260532214, "loss": 5.621, "mean_token_accuracy": 0.17849345952272416, "num_tokens": 6835219.0, "step": 3320 }, { "entropy": 6.04475736618042, "epoch": 2.9507323568575234, "grad_norm": 1.0390625, "learning_rate": 0.00044539589449477265, "loss": 5.7213, "mean_token_accuracy": 0.1738622322678566, "num_tokens": 6845992.0, "step": 3325 }, { "entropy": 6.052994966506958, "epoch": 2.9551708832667556, "grad_norm": 1.0546875, "learning_rate": 0.000445170736987889, "loss": 5.6658, "mean_token_accuracy": 0.18287943601608275, "num_tokens": 6855287.0, "step": 3330 }, { "entropy": 6.029227447509766, "epoch": 2.9596094096759877, "grad_norm": 1.046875, "learning_rate": 0.000444945180612425, "loss": 5.775, "mean_token_accuracy": 0.17114163041114808, "num_tokens": 6865841.0, "step": 3335 }, { "entropy": 6.034116411209107, "epoch": 2.96404793608522, "grad_norm": 1.0078125, "learning_rate": 0.00044471922589706944, "loss": 5.8053, "mean_token_accuracy": 0.16967750638723372, "num_tokens": 6875931.0, "step": 3340 }, { "entropy": 6.023122358322143, "epoch": 2.968486462494452, "grad_norm": 1.0546875, "learning_rate": 0.0004444928733714446, "loss": 5.7363, "mean_token_accuracy": 0.17056947499513625, "num_tokens": 6886092.0, "step": 3345 }, { "entropy": 6.0595800399780275, "epoch": 2.972924988903684, "grad_norm": 1.0859375, "learning_rate": 0.00044426612356610555, "loss": 5.7344, "mean_token_accuracy": 0.16704397201538085, "num_tokens": 6897312.0, "step": 3350 }, { "entropy": 5.955773544311524, "epoch": 2.9773635153129163, "grad_norm": 1.0703125, "learning_rate": 0.0004440389770125382, "loss": 5.6457, "mean_token_accuracy": 0.18342512249946594, "num_tokens": 6907838.0, "step": 3355 }, { "entropy": 5.930391263961792, "epoch": 2.9818020417221485, "grad_norm": 1.109375, "learning_rate": 0.0004438114342431586, "loss": 5.6485, "mean_token_accuracy": 0.17502613514661788, "num_tokens": 6916729.0, "step": 3360 }, { "entropy": 5.983162069320679, "epoch": 2.9862405681313806, "grad_norm": 1.078125, "learning_rate": 0.00044358349579131143, "loss": 5.5849, "mean_token_accuracy": 0.1869617834687233, "num_tokens": 6927074.0, "step": 3365 }, { "entropy": 5.962836027145386, "epoch": 2.9906790945406128, "grad_norm": 1.1015625, "learning_rate": 0.00044335516219126876, "loss": 5.6287, "mean_token_accuracy": 0.17767293900251388, "num_tokens": 6938437.0, "step": 3370 }, { "entropy": 5.964249944686889, "epoch": 2.995117620949845, "grad_norm": 1.046875, "learning_rate": 0.00044312643397822907, "loss": 5.6745, "mean_token_accuracy": 0.18153784573078155, "num_tokens": 6949036.0, "step": 3375 }, { "entropy": 6.030031394958496, "epoch": 2.999556147359077, "grad_norm": 1.0390625, "learning_rate": 0.00044289731168831566, "loss": 5.5911, "mean_token_accuracy": 0.18498829305171965, "num_tokens": 6958459.0, "step": 3380 }, { "entropy": 5.8808572557237415, "epoch": 3.003550821127386, "grad_norm": 1.0078125, "learning_rate": 0.0004426677958585755, "loss": 5.4157, "mean_token_accuracy": 0.19034291472699907, "num_tokens": 6967264.0, "step": 3385 }, { "entropy": 5.903432178497314, "epoch": 3.007989347536618, "grad_norm": 0.99609375, "learning_rate": 0.00044243788702697797, "loss": 5.3709, "mean_token_accuracy": 0.19530602395534516, "num_tokens": 6977465.0, "step": 3390 }, { "entropy": 5.998833322525025, "epoch": 3.01242787394585, "grad_norm": 0.9765625, "learning_rate": 0.0004422075857324137, "loss": 5.3929, "mean_token_accuracy": 0.19290464073419572, "num_tokens": 6987583.0, "step": 3395 }, { "entropy": 5.954317235946656, "epoch": 3.0168664003550822, "grad_norm": 1.109375, "learning_rate": 0.00044197689251469324, "loss": 5.38, "mean_token_accuracy": 0.1891101285815239, "num_tokens": 6997894.0, "step": 3400 }, { "entropy": 5.9602972030639645, "epoch": 3.0213049267643144, "grad_norm": 1.0703125, "learning_rate": 0.00044174580791454555, "loss": 5.3515, "mean_token_accuracy": 0.19597329050302506, "num_tokens": 7008019.0, "step": 3405 }, { "entropy": 5.9017480373382565, "epoch": 3.0257434531735465, "grad_norm": 1.0546875, "learning_rate": 0.0004415143324736174, "loss": 5.3916, "mean_token_accuracy": 0.19494948536157608, "num_tokens": 7018272.0, "step": 3410 }, { "entropy": 5.968024396896363, "epoch": 3.0301819795827787, "grad_norm": 1.0703125, "learning_rate": 0.0004412824667344712, "loss": 5.439, "mean_token_accuracy": 0.1884671375155449, "num_tokens": 7028185.0, "step": 3415 }, { "entropy": 6.047925806045532, "epoch": 3.034620505992011, "grad_norm": 1.046875, "learning_rate": 0.00044105021124058455, "loss": 5.4481, "mean_token_accuracy": 0.18440557271242142, "num_tokens": 7038123.0, "step": 3420 }, { "entropy": 5.86896710395813, "epoch": 3.039059032401243, "grad_norm": 1.03125, "learning_rate": 0.00044081756653634825, "loss": 5.342, "mean_token_accuracy": 0.1948542922735214, "num_tokens": 7048379.0, "step": 3425 }, { "entropy": 5.908081436157227, "epoch": 3.043497558810475, "grad_norm": 1.0234375, "learning_rate": 0.0004405845331670659, "loss": 5.323, "mean_token_accuracy": 0.20013415217399597, "num_tokens": 7057878.0, "step": 3430 }, { "entropy": 5.90395884513855, "epoch": 3.0479360852197073, "grad_norm": 1.1171875, "learning_rate": 0.0004403511116789514, "loss": 5.4602, "mean_token_accuracy": 0.18673462122678758, "num_tokens": 7067998.0, "step": 3435 }, { "entropy": 5.890441370010376, "epoch": 3.052374611628939, "grad_norm": 1.046875, "learning_rate": 0.00044011730261912915, "loss": 5.3764, "mean_token_accuracy": 0.19622484892606734, "num_tokens": 7079236.0, "step": 3440 }, { "entropy": 5.89832239151001, "epoch": 3.056813138038171, "grad_norm": 1.1015625, "learning_rate": 0.0004398831065356314, "loss": 5.3428, "mean_token_accuracy": 0.19831295162439347, "num_tokens": 7088947.0, "step": 3445 }, { "entropy": 5.946053075790405, "epoch": 3.0612516644474033, "grad_norm": 1.109375, "learning_rate": 0.00043964852397739793, "loss": 5.4557, "mean_token_accuracy": 0.18364953398704528, "num_tokens": 7099480.0, "step": 3450 }, { "entropy": 5.869796800613403, "epoch": 3.0656901908566354, "grad_norm": 1.3125, "learning_rate": 0.000439413555494274, "loss": 5.3686, "mean_token_accuracy": 0.1966594323515892, "num_tokens": 7109471.0, "step": 3455 }, { "entropy": 5.870002937316895, "epoch": 3.0701287172658676, "grad_norm": 1.109375, "learning_rate": 0.0004391782016370098, "loss": 5.4148, "mean_token_accuracy": 0.1896324947476387, "num_tokens": 7119790.0, "step": 3460 }, { "entropy": 5.988854026794433, "epoch": 3.0745672436750997, "grad_norm": 1.0859375, "learning_rate": 0.0004389424629572586, "loss": 5.3878, "mean_token_accuracy": 0.19112442284822465, "num_tokens": 7129736.0, "step": 3465 }, { "entropy": 5.899620294570923, "epoch": 3.079005770084332, "grad_norm": 1.109375, "learning_rate": 0.00043870634000757605, "loss": 5.3816, "mean_token_accuracy": 0.18703049421310425, "num_tokens": 7139786.0, "step": 3470 }, { "entropy": 5.943547010421753, "epoch": 3.083444296493564, "grad_norm": 1.140625, "learning_rate": 0.0004384698333414179, "loss": 5.387, "mean_token_accuracy": 0.1897724226117134, "num_tokens": 7150742.0, "step": 3475 }, { "entropy": 5.958523893356324, "epoch": 3.087882822902796, "grad_norm": 1.0859375, "learning_rate": 0.0004382329435131396, "loss": 5.4457, "mean_token_accuracy": 0.18277957141399384, "num_tokens": 7161740.0, "step": 3480 }, { "entropy": 5.954104804992676, "epoch": 3.0923213493120283, "grad_norm": 0.98046875, "learning_rate": 0.00043799567107799504, "loss": 5.423, "mean_token_accuracy": 0.18841141164302827, "num_tokens": 7172615.0, "step": 3485 }, { "entropy": 5.788148641586304, "epoch": 3.0967598757212604, "grad_norm": 1.0859375, "learning_rate": 0.00043775801659213425, "loss": 5.3323, "mean_token_accuracy": 0.20167517215013503, "num_tokens": 7183037.0, "step": 3490 }, { "entropy": 5.911949014663696, "epoch": 3.1011984021304926, "grad_norm": 1.015625, "learning_rate": 0.0004375199806126034, "loss": 5.4289, "mean_token_accuracy": 0.19386280030012132, "num_tokens": 7193621.0, "step": 3495 }, { "entropy": 5.8650144100189205, "epoch": 3.1056369285397247, "grad_norm": 1.15625, "learning_rate": 0.00043728156369734236, "loss": 5.313, "mean_token_accuracy": 0.20414462238550185, "num_tokens": 7204419.0, "step": 3500 }, { "epoch": 3.1056369285397247, "eval_entropy": 5.6460988130818635, "eval_loss": 5.959334373474121, "eval_mean_token_accuracy": 0.16493839260872073, "eval_num_tokens": 7204419.0, "eval_runtime": 2.0846, "eval_samples_per_second": 1615.155, "eval_steps_per_second": 201.954, "step": 3500 }, { "entropy": 5.834872102737426, "epoch": 3.110075454948957, "grad_norm": 1.1875, "learning_rate": 0.0004370427664051841, "loss": 5.3529, "mean_token_accuracy": 0.19269932806491852, "num_tokens": 7214372.0, "step": 3505 }, { "entropy": 5.863707590103149, "epoch": 3.114513981358189, "grad_norm": 1.0703125, "learning_rate": 0.0004368035892958533, "loss": 5.3994, "mean_token_accuracy": 0.19355032294988633, "num_tokens": 7224990.0, "step": 3510 }, { "entropy": 5.937055206298828, "epoch": 3.118952507767421, "grad_norm": 1.1171875, "learning_rate": 0.00043656403292996454, "loss": 5.4193, "mean_token_accuracy": 0.1840432032942772, "num_tokens": 7235487.0, "step": 3515 }, { "entropy": 5.885832786560059, "epoch": 3.1233910341766533, "grad_norm": 1.0546875, "learning_rate": 0.0004363240978690218, "loss": 5.4026, "mean_token_accuracy": 0.19053976088762284, "num_tokens": 7245942.0, "step": 3520 }, { "entropy": 5.951666831970215, "epoch": 3.1278295605858855, "grad_norm": 1.09375, "learning_rate": 0.00043608378467541626, "loss": 5.4028, "mean_token_accuracy": 0.18414484113454818, "num_tokens": 7255323.0, "step": 3525 }, { "entropy": 5.941895866394043, "epoch": 3.1322680869951176, "grad_norm": 1.046875, "learning_rate": 0.00043584309391242584, "loss": 5.4639, "mean_token_accuracy": 0.1837260752916336, "num_tokens": 7266339.0, "step": 3530 }, { "entropy": 5.955119895935058, "epoch": 3.1367066134043498, "grad_norm": 1.125, "learning_rate": 0.0004356020261442131, "loss": 5.4029, "mean_token_accuracy": 0.1911745175719261, "num_tokens": 7277501.0, "step": 3535 }, { "entropy": 5.9398706436157225, "epoch": 3.141145139813582, "grad_norm": 1.0703125, "learning_rate": 0.00043536058193582443, "loss": 5.455, "mean_token_accuracy": 0.1892775923013687, "num_tokens": 7287639.0, "step": 3540 }, { "entropy": 5.849388504028321, "epoch": 3.145583666222814, "grad_norm": 1.03125, "learning_rate": 0.0004351187618531886, "loss": 5.3415, "mean_token_accuracy": 0.19347691684961318, "num_tokens": 7297333.0, "step": 3545 }, { "entropy": 5.835960865020752, "epoch": 3.150022192632046, "grad_norm": 1.0390625, "learning_rate": 0.00043487656646311535, "loss": 5.4584, "mean_token_accuracy": 0.18551218509674072, "num_tokens": 7307750.0, "step": 3550 }, { "entropy": 5.860294580459595, "epoch": 3.1544607190412783, "grad_norm": 1.125, "learning_rate": 0.0004346339963332941, "loss": 5.3436, "mean_token_accuracy": 0.20199633687734603, "num_tokens": 7317128.0, "step": 3555 }, { "entropy": 5.871670961380005, "epoch": 3.1588992454505105, "grad_norm": 1.1015625, "learning_rate": 0.0004343910520322927, "loss": 5.4169, "mean_token_accuracy": 0.1937512531876564, "num_tokens": 7327574.0, "step": 3560 }, { "entropy": 5.894437789916992, "epoch": 3.1633377718597426, "grad_norm": 1.1796875, "learning_rate": 0.000434147734129556, "loss": 5.4207, "mean_token_accuracy": 0.192408949136734, "num_tokens": 7337776.0, "step": 3565 }, { "entropy": 5.906270456314087, "epoch": 3.1677762982689748, "grad_norm": 1.1328125, "learning_rate": 0.00043390404319540443, "loss": 5.4257, "mean_token_accuracy": 0.19216728061437607, "num_tokens": 7347691.0, "step": 3570 }, { "entropy": 5.894905376434326, "epoch": 3.172214824678207, "grad_norm": 1.125, "learning_rate": 0.00043365997980103304, "loss": 5.4454, "mean_token_accuracy": 0.18370102643966674, "num_tokens": 7358152.0, "step": 3575 }, { "entropy": 5.903047180175781, "epoch": 3.176653351087439, "grad_norm": 1.1015625, "learning_rate": 0.00043341554451850964, "loss": 5.3993, "mean_token_accuracy": 0.19171175360679626, "num_tokens": 7369017.0, "step": 3580 }, { "entropy": 5.9143860816955565, "epoch": 3.181091877496671, "grad_norm": 1.0546875, "learning_rate": 0.00043317073792077394, "loss": 5.4409, "mean_token_accuracy": 0.19202805012464524, "num_tokens": 7378589.0, "step": 3585 }, { "entropy": 5.907209157943726, "epoch": 3.1855304039059034, "grad_norm": 1.140625, "learning_rate": 0.0004329255605816357, "loss": 5.3684, "mean_token_accuracy": 0.19171188175678253, "num_tokens": 7388053.0, "step": 3590 }, { "entropy": 5.889437580108643, "epoch": 3.1899689303151355, "grad_norm": 1.078125, "learning_rate": 0.000432680013075774, "loss": 5.4492, "mean_token_accuracy": 0.18419877737760543, "num_tokens": 7398200.0, "step": 3595 }, { "entropy": 5.893877220153809, "epoch": 3.1944074567243677, "grad_norm": 1.046875, "learning_rate": 0.0004324340959787354, "loss": 5.3605, "mean_token_accuracy": 0.20110263228416442, "num_tokens": 7408378.0, "step": 3600 }, { "entropy": 5.872954082489014, "epoch": 3.1988459831336, "grad_norm": 1.2265625, "learning_rate": 0.00043218780986693274, "loss": 5.4328, "mean_token_accuracy": 0.1992975264787674, "num_tokens": 7418961.0, "step": 3605 }, { "entropy": 5.846698236465454, "epoch": 3.203284509542832, "grad_norm": 1.0703125, "learning_rate": 0.0004319411553176438, "loss": 5.5195, "mean_token_accuracy": 0.18346895426511764, "num_tokens": 7429844.0, "step": 3610 }, { "entropy": 5.879422616958618, "epoch": 3.207723035952064, "grad_norm": 1.0625, "learning_rate": 0.0004316941329090101, "loss": 5.3498, "mean_token_accuracy": 0.20174553096294404, "num_tokens": 7440824.0, "step": 3615 }, { "entropy": 5.9176287174224855, "epoch": 3.2121615623612962, "grad_norm": 1.21875, "learning_rate": 0.00043144674322003525, "loss": 5.4666, "mean_token_accuracy": 0.1915660098195076, "num_tokens": 7451666.0, "step": 3620 }, { "entropy": 5.904341077804565, "epoch": 3.2166000887705284, "grad_norm": 1.1328125, "learning_rate": 0.0004311989868305837, "loss": 5.4375, "mean_token_accuracy": 0.1913430780172348, "num_tokens": 7462476.0, "step": 3625 }, { "entropy": 5.900774383544922, "epoch": 3.2210386151797605, "grad_norm": 1.171875, "learning_rate": 0.00043095086432137954, "loss": 5.4534, "mean_token_accuracy": 0.18185227811336518, "num_tokens": 7472388.0, "step": 3630 }, { "entropy": 5.887851858139038, "epoch": 3.2254771415889927, "grad_norm": 1.125, "learning_rate": 0.000430702376274005, "loss": 5.401, "mean_token_accuracy": 0.19130902141332626, "num_tokens": 7482770.0, "step": 3635 }, { "entropy": 5.906753969192505, "epoch": 3.2299156679982244, "grad_norm": 1.1171875, "learning_rate": 0.00043045352327089907, "loss": 5.468, "mean_token_accuracy": 0.1859576016664505, "num_tokens": 7492107.0, "step": 3640 }, { "entropy": 5.898250150680542, "epoch": 3.2343541944074565, "grad_norm": 1.140625, "learning_rate": 0.00043020430589535625, "loss": 5.3594, "mean_token_accuracy": 0.19287962913513185, "num_tokens": 7501597.0, "step": 3645 }, { "entropy": 5.905869817733764, "epoch": 3.2387927208166887, "grad_norm": 1.109375, "learning_rate": 0.000429954724731525, "loss": 5.4058, "mean_token_accuracy": 0.19971251338720322, "num_tokens": 7513200.0, "step": 3650 }, { "entropy": 5.91200532913208, "epoch": 3.243231247225921, "grad_norm": 1.1015625, "learning_rate": 0.0004297047803644063, "loss": 5.3459, "mean_token_accuracy": 0.19347363710403442, "num_tokens": 7522807.0, "step": 3655 }, { "entropy": 5.8334047317504885, "epoch": 3.247669773635153, "grad_norm": 1.0234375, "learning_rate": 0.000429454473379853, "loss": 5.3477, "mean_token_accuracy": 0.1945561319589615, "num_tokens": 7533577.0, "step": 3660 }, { "entropy": 5.883318090438843, "epoch": 3.252108300044385, "grad_norm": 1.125, "learning_rate": 0.0004292038043645675, "loss": 5.4106, "mean_token_accuracy": 0.18551634699106218, "num_tokens": 7543640.0, "step": 3665 }, { "entropy": 5.794455099105835, "epoch": 3.2565468264536173, "grad_norm": 0.95703125, "learning_rate": 0.00042895277390610074, "loss": 5.4428, "mean_token_accuracy": 0.19491562098264695, "num_tokens": 7554692.0, "step": 3670 }, { "entropy": 5.990721559524536, "epoch": 3.2609853528628494, "grad_norm": 1.1484375, "learning_rate": 0.0004287013825928509, "loss": 5.385, "mean_token_accuracy": 0.18947930932044982, "num_tokens": 7563925.0, "step": 3675 }, { "entropy": 5.733651828765869, "epoch": 3.2654238792720816, "grad_norm": 1.34375, "learning_rate": 0.0004284496310140622, "loss": 5.2984, "mean_token_accuracy": 0.20197273343801497, "num_tokens": 7573484.0, "step": 3680 }, { "entropy": 5.799650478363037, "epoch": 3.2698624056813137, "grad_norm": 1.125, "learning_rate": 0.0004281975197598231, "loss": 5.3955, "mean_token_accuracy": 0.19549006968736649, "num_tokens": 7582808.0, "step": 3685 }, { "entropy": 5.88456883430481, "epoch": 3.274300932090546, "grad_norm": 1.125, "learning_rate": 0.0004279450494210651, "loss": 5.4827, "mean_token_accuracy": 0.18646293729543686, "num_tokens": 7593790.0, "step": 3690 }, { "entropy": 5.911808729171753, "epoch": 3.278739458499778, "grad_norm": 1.0546875, "learning_rate": 0.0004276922205895614, "loss": 5.48, "mean_token_accuracy": 0.1881803423166275, "num_tokens": 7603756.0, "step": 3695 }, { "entropy": 5.939221954345703, "epoch": 3.28317798490901, "grad_norm": 1.0703125, "learning_rate": 0.0004274390338579257, "loss": 5.4207, "mean_token_accuracy": 0.19052503407001495, "num_tokens": 7614126.0, "step": 3700 }, { "entropy": 5.749071359634399, "epoch": 3.2876165113182423, "grad_norm": 1.109375, "learning_rate": 0.0004271854898196102, "loss": 5.3746, "mean_token_accuracy": 0.19580249339342118, "num_tokens": 7624573.0, "step": 3705 }, { "entropy": 5.878935194015503, "epoch": 3.2920550377274744, "grad_norm": 1.1484375, "learning_rate": 0.0004269315890689049, "loss": 5.4431, "mean_token_accuracy": 0.1863309696316719, "num_tokens": 7634715.0, "step": 3710 }, { "entropy": 5.853589487075806, "epoch": 3.2964935641367066, "grad_norm": 1.140625, "learning_rate": 0.00042667733220093574, "loss": 5.3239, "mean_token_accuracy": 0.20386914610862733, "num_tokens": 7644241.0, "step": 3715 }, { "entropy": 5.874784135818482, "epoch": 3.3009320905459387, "grad_norm": 1.125, "learning_rate": 0.0004264227198116635, "loss": 5.4795, "mean_token_accuracy": 0.18705491870641708, "num_tokens": 7655655.0, "step": 3720 }, { "entropy": 5.848001718521118, "epoch": 3.305370616955171, "grad_norm": 1.1796875, "learning_rate": 0.00042616775249788223, "loss": 5.4973, "mean_token_accuracy": 0.18835359066724777, "num_tokens": 7665232.0, "step": 3725 }, { "entropy": 5.913939046859741, "epoch": 3.309809143364403, "grad_norm": 1.171875, "learning_rate": 0.0004259124308572178, "loss": 5.4316, "mean_token_accuracy": 0.1916329488158226, "num_tokens": 7675178.0, "step": 3730 }, { "entropy": 5.899500942230224, "epoch": 3.314247669773635, "grad_norm": 1.0390625, "learning_rate": 0.0004256567554881268, "loss": 5.3627, "mean_token_accuracy": 0.1938821107149124, "num_tokens": 7685835.0, "step": 3735 }, { "entropy": 5.912274503707886, "epoch": 3.3186861961828673, "grad_norm": 1.2578125, "learning_rate": 0.0004254007269898948, "loss": 5.3577, "mean_token_accuracy": 0.1939299672842026, "num_tokens": 7694828.0, "step": 3740 }, { "entropy": 5.82884202003479, "epoch": 3.3231247225920995, "grad_norm": 1.046875, "learning_rate": 0.00042514434596263513, "loss": 5.4271, "mean_token_accuracy": 0.1924677923321724, "num_tokens": 7706055.0, "step": 3745 }, { "entropy": 5.830545425415039, "epoch": 3.3275632490013316, "grad_norm": 1.1328125, "learning_rate": 0.0004248876130072873, "loss": 5.4581, "mean_token_accuracy": 0.1842326655983925, "num_tokens": 7716220.0, "step": 3750 }, { "entropy": 5.860052013397217, "epoch": 3.3320017754105637, "grad_norm": 0.98828125, "learning_rate": 0.00042463052872561587, "loss": 5.4372, "mean_token_accuracy": 0.19057605415582657, "num_tokens": 7726709.0, "step": 3755 }, { "entropy": 5.963085699081421, "epoch": 3.336440301819796, "grad_norm": 1.2265625, "learning_rate": 0.00042437309372020886, "loss": 5.4012, "mean_token_accuracy": 0.1977565497159958, "num_tokens": 7736507.0, "step": 3760 }, { "entropy": 5.872720527648926, "epoch": 3.340878828229028, "grad_norm": 1.140625, "learning_rate": 0.00042411530859447634, "loss": 5.4912, "mean_token_accuracy": 0.1859763205051422, "num_tokens": 7747031.0, "step": 3765 }, { "entropy": 5.914382410049439, "epoch": 3.34531735463826, "grad_norm": 1.1328125, "learning_rate": 0.0004238571739526489, "loss": 5.5078, "mean_token_accuracy": 0.18674080073833466, "num_tokens": 7756896.0, "step": 3770 }, { "entropy": 5.829860639572144, "epoch": 3.3497558810474923, "grad_norm": 1.0234375, "learning_rate": 0.0004235986903997767, "loss": 5.3098, "mean_token_accuracy": 0.1985625222325325, "num_tokens": 7768243.0, "step": 3775 }, { "entropy": 5.909512329101562, "epoch": 3.3541944074567245, "grad_norm": 1.1484375, "learning_rate": 0.0004233398585417275, "loss": 5.3886, "mean_token_accuracy": 0.1947034165263176, "num_tokens": 7778017.0, "step": 3780 }, { "entropy": 5.905759811401367, "epoch": 3.3586329338659566, "grad_norm": 1.171875, "learning_rate": 0.0004230806789851854, "loss": 5.4766, "mean_token_accuracy": 0.18501238375902176, "num_tokens": 7788648.0, "step": 3785 }, { "entropy": 5.870203638076783, "epoch": 3.3630714602751888, "grad_norm": 1.0859375, "learning_rate": 0.00042282115233764953, "loss": 5.4228, "mean_token_accuracy": 0.1922216847538948, "num_tokens": 7799444.0, "step": 3790 }, { "entropy": 5.915548610687256, "epoch": 3.367509986684421, "grad_norm": 1.1875, "learning_rate": 0.0004225612792074326, "loss": 5.4095, "mean_token_accuracy": 0.18869893848896027, "num_tokens": 7809324.0, "step": 3795 }, { "entropy": 5.847271156311035, "epoch": 3.371948513093653, "grad_norm": 1.0859375, "learning_rate": 0.00042230106020365964, "loss": 5.4219, "mean_token_accuracy": 0.18740808665752412, "num_tokens": 7819835.0, "step": 3800 }, { "entropy": 5.823662281036377, "epoch": 3.376387039502885, "grad_norm": 1.125, "learning_rate": 0.00042204049593626617, "loss": 5.3148, "mean_token_accuracy": 0.19989162534475327, "num_tokens": 7829978.0, "step": 3805 }, { "entropy": 5.8751567840576175, "epoch": 3.3808255659121174, "grad_norm": 1.1875, "learning_rate": 0.00042177958701599696, "loss": 5.466, "mean_token_accuracy": 0.1890934631228447, "num_tokens": 7840638.0, "step": 3810 }, { "entropy": 5.777163314819336, "epoch": 3.3852640923213495, "grad_norm": 1.1171875, "learning_rate": 0.0004215183340544047, "loss": 5.2881, "mean_token_accuracy": 0.20688982158899308, "num_tokens": 7852025.0, "step": 3815 }, { "entropy": 5.833953237533569, "epoch": 3.389702618730581, "grad_norm": 1.1328125, "learning_rate": 0.0004212567376638485, "loss": 5.3775, "mean_token_accuracy": 0.19608416706323623, "num_tokens": 7861446.0, "step": 3820 }, { "entropy": 5.823704862594605, "epoch": 3.3941411451398134, "grad_norm": 1.2421875, "learning_rate": 0.00042099479845749256, "loss": 5.4895, "mean_token_accuracy": 0.18594682961702347, "num_tokens": 7871521.0, "step": 3825 }, { "entropy": 5.859103012084961, "epoch": 3.3985796715490455, "grad_norm": 1.125, "learning_rate": 0.00042073251704930414, "loss": 5.4215, "mean_token_accuracy": 0.19555966407060624, "num_tokens": 7882352.0, "step": 3830 }, { "entropy": 5.895108985900879, "epoch": 3.4030181979582776, "grad_norm": 1.0625, "learning_rate": 0.00042046989405405326, "loss": 5.3998, "mean_token_accuracy": 0.19245795011520386, "num_tokens": 7892487.0, "step": 3835 }, { "entropy": 5.786870241165161, "epoch": 3.40745672436751, "grad_norm": 1.1171875, "learning_rate": 0.0004202069300873102, "loss": 5.3629, "mean_token_accuracy": 0.19259919673204423, "num_tokens": 7902262.0, "step": 3840 }, { "entropy": 5.887244415283203, "epoch": 3.411895250776742, "grad_norm": 1.4765625, "learning_rate": 0.0004199436257654445, "loss": 5.3403, "mean_token_accuracy": 0.19992637187242507, "num_tokens": 7913415.0, "step": 3845 }, { "entropy": 5.800942850112915, "epoch": 3.416333777185974, "grad_norm": 1.0859375, "learning_rate": 0.0004196799817056234, "loss": 5.3702, "mean_token_accuracy": 0.1944957345724106, "num_tokens": 7923378.0, "step": 3850 }, { "entropy": 5.833743000030518, "epoch": 3.4207723035952062, "grad_norm": 1.296875, "learning_rate": 0.00041941599852581067, "loss": 5.4005, "mean_token_accuracy": 0.192107592523098, "num_tokens": 7932155.0, "step": 3855 }, { "entropy": 5.866676568984985, "epoch": 3.4252108300044384, "grad_norm": 1.109375, "learning_rate": 0.00041915167684476495, "loss": 5.4391, "mean_token_accuracy": 0.1913757935166359, "num_tokens": 7942236.0, "step": 3860 }, { "entropy": 5.916124677658081, "epoch": 3.4296493564136705, "grad_norm": 1.171875, "learning_rate": 0.000418887017282038, "loss": 5.4685, "mean_token_accuracy": 0.19052421748638154, "num_tokens": 7952067.0, "step": 3865 }, { "entropy": 5.809151649475098, "epoch": 3.4340878828229027, "grad_norm": 1.0859375, "learning_rate": 0.00041862202045797386, "loss": 5.3092, "mean_token_accuracy": 0.19900714755058288, "num_tokens": 7961456.0, "step": 3870 }, { "entropy": 5.823811960220337, "epoch": 3.438526409232135, "grad_norm": 1.0546875, "learning_rate": 0.0004183566869937069, "loss": 5.3782, "mean_token_accuracy": 0.20037556439638138, "num_tokens": 7971601.0, "step": 3875 }, { "entropy": 5.87151517868042, "epoch": 3.442964935641367, "grad_norm": 1.1953125, "learning_rate": 0.0004180910175111608, "loss": 5.4483, "mean_token_accuracy": 0.18243330270051955, "num_tokens": 7982732.0, "step": 3880 }, { "entropy": 5.812599134445191, "epoch": 3.447403462050599, "grad_norm": 1.34375, "learning_rate": 0.00041782501263304655, "loss": 5.4182, "mean_token_accuracy": 0.18896383941173553, "num_tokens": 7993550.0, "step": 3885 }, { "entropy": 5.85041913986206, "epoch": 3.4518419884598313, "grad_norm": 1.1015625, "learning_rate": 0.0004175586729828614, "loss": 5.3866, "mean_token_accuracy": 0.1983974426984787, "num_tokens": 8003753.0, "step": 3890 }, { "entropy": 5.848913478851318, "epoch": 3.4562805148690634, "grad_norm": 1.0703125, "learning_rate": 0.00041729199918488725, "loss": 5.367, "mean_token_accuracy": 0.1954442948102951, "num_tokens": 8014516.0, "step": 3895 }, { "entropy": 5.776366281509399, "epoch": 3.4607190412782955, "grad_norm": 1.1953125, "learning_rate": 0.00041702499186418936, "loss": 5.4013, "mean_token_accuracy": 0.191869093477726, "num_tokens": 8024734.0, "step": 3900 }, { "entropy": 5.825012636184693, "epoch": 3.4651575676875277, "grad_norm": 1.234375, "learning_rate": 0.00041675765164661473, "loss": 5.2844, "mean_token_accuracy": 0.20244546234607697, "num_tokens": 8033681.0, "step": 3905 }, { "entropy": 5.812342643737793, "epoch": 3.46959609409676, "grad_norm": 1.25, "learning_rate": 0.0004164899791587903, "loss": 5.4335, "mean_token_accuracy": 0.18668857365846633, "num_tokens": 8043202.0, "step": 3910 }, { "entropy": 5.874458456039429, "epoch": 3.474034620505992, "grad_norm": 1.2734375, "learning_rate": 0.00041622197502812224, "loss": 5.4737, "mean_token_accuracy": 0.18350510895252228, "num_tokens": 8052964.0, "step": 3915 }, { "entropy": 5.868040704727173, "epoch": 3.478473146915224, "grad_norm": 0.97265625, "learning_rate": 0.000415953639882794, "loss": 5.4358, "mean_token_accuracy": 0.191118323802948, "num_tokens": 8063964.0, "step": 3920 }, { "entropy": 5.817435216903687, "epoch": 3.4829116733244563, "grad_norm": 1.078125, "learning_rate": 0.00041568497435176473, "loss": 5.3394, "mean_token_accuracy": 0.1965772658586502, "num_tokens": 8073659.0, "step": 3925 }, { "entropy": 5.775618934631348, "epoch": 3.4873501997336884, "grad_norm": 1.25, "learning_rate": 0.0004154159790647681, "loss": 5.4096, "mean_token_accuracy": 0.1935155361890793, "num_tokens": 8083850.0, "step": 3930 }, { "entropy": 5.857674884796142, "epoch": 3.4917887261429206, "grad_norm": 1.0703125, "learning_rate": 0.00041514665465231063, "loss": 5.3836, "mean_token_accuracy": 0.19599000364542007, "num_tokens": 8094308.0, "step": 3935 }, { "entropy": 5.884661388397217, "epoch": 3.4962272525521527, "grad_norm": 0.98046875, "learning_rate": 0.00041487700174567036, "loss": 5.4342, "mean_token_accuracy": 0.1878661945462227, "num_tokens": 8105383.0, "step": 3940 }, { "entropy": 5.894474458694458, "epoch": 3.500665778961385, "grad_norm": 1.2265625, "learning_rate": 0.00041460702097689535, "loss": 5.4853, "mean_token_accuracy": 0.1829699918627739, "num_tokens": 8116888.0, "step": 3945 }, { "entropy": 5.815571308135986, "epoch": 3.505104305370617, "grad_norm": 1.0859375, "learning_rate": 0.00041433671297880204, "loss": 5.3644, "mean_token_accuracy": 0.2002154141664505, "num_tokens": 8126419.0, "step": 3950 }, { "entropy": 5.856853008270264, "epoch": 3.509542831779849, "grad_norm": 1.109375, "learning_rate": 0.0004140660783849739, "loss": 5.4585, "mean_token_accuracy": 0.18545352667570114, "num_tokens": 8136734.0, "step": 3955 }, { "entropy": 5.7611549377441404, "epoch": 3.5139813581890813, "grad_norm": 1.109375, "learning_rate": 0.00041379511782975995, "loss": 5.4275, "mean_token_accuracy": 0.18803369849920273, "num_tokens": 8146362.0, "step": 3960 }, { "entropy": 5.867103481292725, "epoch": 3.5184198845983135, "grad_norm": 1.2265625, "learning_rate": 0.0004135238319482731, "loss": 5.3396, "mean_token_accuracy": 0.19985446333885193, "num_tokens": 8156493.0, "step": 3965 }, { "entropy": 5.827406597137451, "epoch": 3.5228584110075456, "grad_norm": 1.1796875, "learning_rate": 0.00041325222137638914, "loss": 5.3822, "mean_token_accuracy": 0.198279732465744, "num_tokens": 8166693.0, "step": 3970 }, { "entropy": 5.8414324760437015, "epoch": 3.5272969374167777, "grad_norm": 1.0234375, "learning_rate": 0.0004129802867507444, "loss": 5.5056, "mean_token_accuracy": 0.18893716484308243, "num_tokens": 8177819.0, "step": 3975 }, { "entropy": 5.8395007133483885, "epoch": 3.53173546382601, "grad_norm": 1.140625, "learning_rate": 0.0004127080287087354, "loss": 5.4563, "mean_token_accuracy": 0.19080454111099243, "num_tokens": 8187559.0, "step": 3980 }, { "entropy": 5.878630113601685, "epoch": 3.536173990235242, "grad_norm": 1.1015625, "learning_rate": 0.00041243544788851616, "loss": 5.4661, "mean_token_accuracy": 0.18955991715192794, "num_tokens": 8198051.0, "step": 3985 }, { "entropy": 5.788226985931397, "epoch": 3.540612516644474, "grad_norm": 1.0859375, "learning_rate": 0.00041216254492899753, "loss": 5.2939, "mean_token_accuracy": 0.20163479596376419, "num_tokens": 8207969.0, "step": 3990 }, { "entropy": 5.814974308013916, "epoch": 3.5450510430537063, "grad_norm": 0.91796875, "learning_rate": 0.0004118893204698454, "loss": 5.3902, "mean_token_accuracy": 0.18923236578702926, "num_tokens": 8219057.0, "step": 3995 }, { "entropy": 5.7541250705719, "epoch": 3.5494895694629385, "grad_norm": 1.1875, "learning_rate": 0.0004116157751514793, "loss": 5.3578, "mean_token_accuracy": 0.19907362014055252, "num_tokens": 8228156.0, "step": 4000 }, { "epoch": 3.5494895694629385, "eval_entropy": 5.581153839047901, "eval_loss": 5.913293838500977, "eval_mean_token_accuracy": 0.16851918041847663, "eval_num_tokens": 8228156.0, "eval_runtime": 2.0884, "eval_samples_per_second": 1612.224, "eval_steps_per_second": 201.588, "step": 4000 }, { "entropy": 5.824972915649414, "epoch": 3.5539280958721706, "grad_norm": 1.0703125, "learning_rate": 0.00041134190961507073, "loss": 5.4659, "mean_token_accuracy": 0.19036727249622346, "num_tokens": 8238707.0, "step": 4005 }, { "entropy": 5.870899343490601, "epoch": 3.5583666222814028, "grad_norm": 1.1640625, "learning_rate": 0.00041106772450254177, "loss": 5.4352, "mean_token_accuracy": 0.19054232090711593, "num_tokens": 8248026.0, "step": 4010 }, { "entropy": 5.803697156906128, "epoch": 3.562805148690635, "grad_norm": 1.046875, "learning_rate": 0.00041079322045656366, "loss": 5.3887, "mean_token_accuracy": 0.2025946080684662, "num_tokens": 8258615.0, "step": 4015 }, { "entropy": 5.885553455352783, "epoch": 3.567243675099867, "grad_norm": 1.0859375, "learning_rate": 0.000410518398120555, "loss": 5.4536, "mean_token_accuracy": 0.1920897349715233, "num_tokens": 8268912.0, "step": 4020 }, { "entropy": 5.87697319984436, "epoch": 3.571682201509099, "grad_norm": 1.0703125, "learning_rate": 0.00041024325813868065, "loss": 5.4202, "mean_token_accuracy": 0.19221669733524321, "num_tokens": 8278503.0, "step": 4025 }, { "entropy": 5.786037254333496, "epoch": 3.5761207279183314, "grad_norm": 1.15625, "learning_rate": 0.00040996780115584995, "loss": 5.4195, "mean_token_accuracy": 0.1956888884305954, "num_tokens": 8289725.0, "step": 4030 }, { "entropy": 5.849604320526123, "epoch": 3.5805592543275635, "grad_norm": 1.09375, "learning_rate": 0.0004096920278177153, "loss": 5.4054, "mean_token_accuracy": 0.19833215177059174, "num_tokens": 8300391.0, "step": 4035 }, { "entropy": 5.870030736923217, "epoch": 3.5849977807367956, "grad_norm": 1.15625, "learning_rate": 0.0004094159387706703, "loss": 5.4031, "mean_token_accuracy": 0.19163014888763427, "num_tokens": 8310656.0, "step": 4040 }, { "entropy": 5.793809986114502, "epoch": 3.589436307146028, "grad_norm": 1.1328125, "learning_rate": 0.0004091395346618491, "loss": 5.3533, "mean_token_accuracy": 0.2000315383076668, "num_tokens": 8320605.0, "step": 4045 }, { "entropy": 5.88753571510315, "epoch": 3.5938748335552595, "grad_norm": 1.15625, "learning_rate": 0.00040886281613912396, "loss": 5.4909, "mean_token_accuracy": 0.18160921484231948, "num_tokens": 8331683.0, "step": 4050 }, { "entropy": 5.859517431259155, "epoch": 3.5983133599644916, "grad_norm": 1.0859375, "learning_rate": 0.0004085857838511042, "loss": 5.494, "mean_token_accuracy": 0.18673501014709473, "num_tokens": 8342132.0, "step": 4055 }, { "entropy": 5.813091182708741, "epoch": 3.602751886373724, "grad_norm": 1.0703125, "learning_rate": 0.00040830843844713447, "loss": 5.4091, "mean_token_accuracy": 0.1943575844168663, "num_tokens": 8352202.0, "step": 4060 }, { "entropy": 5.824704217910766, "epoch": 3.607190412782956, "grad_norm": 1.140625, "learning_rate": 0.00040803078057729354, "loss": 5.4583, "mean_token_accuracy": 0.18807061463594438, "num_tokens": 8362204.0, "step": 4065 }, { "entropy": 5.858654499053955, "epoch": 3.611628939192188, "grad_norm": 1.140625, "learning_rate": 0.0004077528108923924, "loss": 5.4523, "mean_token_accuracy": 0.19497880935668946, "num_tokens": 8372525.0, "step": 4070 }, { "entropy": 5.830624771118164, "epoch": 3.6160674656014202, "grad_norm": 1.1015625, "learning_rate": 0.0004074745300439732, "loss": 5.4152, "mean_token_accuracy": 0.1913478270173073, "num_tokens": 8383007.0, "step": 4075 }, { "entropy": 5.777306318283081, "epoch": 3.6205059920106524, "grad_norm": 1.078125, "learning_rate": 0.000407195938684307, "loss": 5.3941, "mean_token_accuracy": 0.19022576361894608, "num_tokens": 8392928.0, "step": 4080 }, { "entropy": 5.886033535003662, "epoch": 3.6249445184198845, "grad_norm": 1.078125, "learning_rate": 0.000406917037466393, "loss": 5.4263, "mean_token_accuracy": 0.19012691229581832, "num_tokens": 8403008.0, "step": 4085 }, { "entropy": 5.789344787597656, "epoch": 3.6293830448291167, "grad_norm": 1.09375, "learning_rate": 0.0004066378270439567, "loss": 5.4782, "mean_token_accuracy": 0.17886057496070862, "num_tokens": 8413513.0, "step": 4090 }, { "entropy": 5.841081666946411, "epoch": 3.633821571238349, "grad_norm": 1.203125, "learning_rate": 0.0004063583080714481, "loss": 5.3738, "mean_token_accuracy": 0.1967576861381531, "num_tokens": 8423894.0, "step": 4095 }, { "entropy": 5.8004848003387455, "epoch": 3.638260097647581, "grad_norm": 1.15625, "learning_rate": 0.00040607848120404063, "loss": 5.413, "mean_token_accuracy": 0.19520466923713684, "num_tokens": 8434467.0, "step": 4100 }, { "entropy": 5.803511476516723, "epoch": 3.642698624056813, "grad_norm": 1.2734375, "learning_rate": 0.0004057983470976293, "loss": 5.357, "mean_token_accuracy": 0.2016320988535881, "num_tokens": 8446037.0, "step": 4105 }, { "entropy": 5.77181224822998, "epoch": 3.6471371504660453, "grad_norm": 1.140625, "learning_rate": 0.00040551790640882954, "loss": 5.4094, "mean_token_accuracy": 0.20021369606256484, "num_tokens": 8457032.0, "step": 4110 }, { "entropy": 5.854924535751342, "epoch": 3.6515756768752774, "grad_norm": 1.203125, "learning_rate": 0.00040523715979497486, "loss": 5.4118, "mean_token_accuracy": 0.19359598606824874, "num_tokens": 8466088.0, "step": 4115 }, { "entropy": 5.865506505966186, "epoch": 3.6560142032845095, "grad_norm": 1.1171875, "learning_rate": 0.0004049561079141163, "loss": 5.4117, "mean_token_accuracy": 0.19178108721971512, "num_tokens": 8477214.0, "step": 4120 }, { "entropy": 5.798425579071045, "epoch": 3.6604527296937417, "grad_norm": 1.125, "learning_rate": 0.0004046747514250202, "loss": 5.4725, "mean_token_accuracy": 0.19099220335483552, "num_tokens": 8488031.0, "step": 4125 }, { "entropy": 5.95139889717102, "epoch": 3.664891256102974, "grad_norm": 1.078125, "learning_rate": 0.0004043930909871671, "loss": 5.5991, "mean_token_accuracy": 0.18338969349861145, "num_tokens": 8500214.0, "step": 4130 }, { "entropy": 5.890401697158813, "epoch": 3.669329782512206, "grad_norm": 1.046875, "learning_rate": 0.00040411112726074954, "loss": 5.439, "mean_token_accuracy": 0.19255967885255815, "num_tokens": 8509768.0, "step": 4135 }, { "entropy": 5.854125690460205, "epoch": 3.673768308921438, "grad_norm": 1.109375, "learning_rate": 0.00040382886090667154, "loss": 5.4488, "mean_token_accuracy": 0.19439015686511993, "num_tokens": 8519967.0, "step": 4140 }, { "entropy": 5.899671220779419, "epoch": 3.6782068353306703, "grad_norm": 1.09375, "learning_rate": 0.0004035462925865459, "loss": 5.4697, "mean_token_accuracy": 0.18602120280265808, "num_tokens": 8531624.0, "step": 4145 }, { "entropy": 5.917951536178589, "epoch": 3.6826453617399024, "grad_norm": 1.1796875, "learning_rate": 0.00040326342296269363, "loss": 5.4044, "mean_token_accuracy": 0.19721968472003937, "num_tokens": 8542130.0, "step": 4150 }, { "entropy": 5.776456356048584, "epoch": 3.6870838881491346, "grad_norm": 1.1640625, "learning_rate": 0.00040298025269814165, "loss": 5.4315, "mean_token_accuracy": 0.19611175805330278, "num_tokens": 8552155.0, "step": 4155 }, { "entropy": 5.807200622558594, "epoch": 3.6915224145583667, "grad_norm": 1.1640625, "learning_rate": 0.0004026967824566218, "loss": 5.3751, "mean_token_accuracy": 0.19862941205501555, "num_tokens": 8561602.0, "step": 4160 }, { "entropy": 5.829988574981689, "epoch": 3.695960940967599, "grad_norm": 1.15625, "learning_rate": 0.000402413012902569, "loss": 5.3549, "mean_token_accuracy": 0.1946346491575241, "num_tokens": 8571957.0, "step": 4165 }, { "entropy": 5.757293558120727, "epoch": 3.700399467376831, "grad_norm": 1.15625, "learning_rate": 0.00040212894470111966, "loss": 5.3879, "mean_token_accuracy": 0.19661612063646317, "num_tokens": 8582550.0, "step": 4170 }, { "entropy": 5.827823162078857, "epoch": 3.704837993786063, "grad_norm": 1.234375, "learning_rate": 0.0004018445785181102, "loss": 5.422, "mean_token_accuracy": 0.19695309102535247, "num_tokens": 8592353.0, "step": 4175 }, { "entropy": 5.832696485519409, "epoch": 3.7092765201952953, "grad_norm": 1.2265625, "learning_rate": 0.0004015599150200755, "loss": 5.4116, "mean_token_accuracy": 0.1886480987071991, "num_tokens": 8602629.0, "step": 4180 }, { "entropy": 5.811392307281494, "epoch": 3.7137150466045274, "grad_norm": 1.171875, "learning_rate": 0.00040127495487424735, "loss": 5.4699, "mean_token_accuracy": 0.19141082167625428, "num_tokens": 8612308.0, "step": 4185 }, { "entropy": 5.834705829620361, "epoch": 3.7181535730137596, "grad_norm": 1.125, "learning_rate": 0.0004009896987485531, "loss": 5.366, "mean_token_accuracy": 0.20177424997091292, "num_tokens": 8622177.0, "step": 4190 }, { "entropy": 5.809908723831176, "epoch": 3.7225920994229913, "grad_norm": 1.078125, "learning_rate": 0.00040070414731161326, "loss": 5.443, "mean_token_accuracy": 0.19458999037742614, "num_tokens": 8632435.0, "step": 4195 }, { "entropy": 5.747843647003174, "epoch": 3.7270306258322234, "grad_norm": 1.140625, "learning_rate": 0.00040041830123274105, "loss": 5.2288, "mean_token_accuracy": 0.20880044400691986, "num_tokens": 8642331.0, "step": 4200 }, { "entropy": 5.903952407836914, "epoch": 3.7314691522414556, "grad_norm": 1.0859375, "learning_rate": 0.0004001321611819401, "loss": 5.3903, "mean_token_accuracy": 0.18388656824827193, "num_tokens": 8652838.0, "step": 4205 }, { "entropy": 5.80471625328064, "epoch": 3.7359076786506877, "grad_norm": 1.1015625, "learning_rate": 0.0003998457278299033, "loss": 5.4137, "mean_token_accuracy": 0.19091238379478453, "num_tokens": 8662908.0, "step": 4210 }, { "entropy": 5.801855611801147, "epoch": 3.74034620505992, "grad_norm": 1.0625, "learning_rate": 0.0003995590018480107, "loss": 5.4813, "mean_token_accuracy": 0.18728871196508406, "num_tokens": 8673015.0, "step": 4215 }, { "entropy": 5.828760576248169, "epoch": 3.744784731469152, "grad_norm": 1.15625, "learning_rate": 0.00039927198390832843, "loss": 5.3716, "mean_token_accuracy": 0.20105525702238083, "num_tokens": 8682149.0, "step": 4220 }, { "entropy": 5.803042364120484, "epoch": 3.749223257878384, "grad_norm": 1.0234375, "learning_rate": 0.000398984674683607, "loss": 5.3658, "mean_token_accuracy": 0.19573144614696503, "num_tokens": 8692715.0, "step": 4225 }, { "entropy": 5.784009027481079, "epoch": 3.7536617842876163, "grad_norm": 1.1328125, "learning_rate": 0.0003986970748472795, "loss": 5.4067, "mean_token_accuracy": 0.20018333494663237, "num_tokens": 8702379.0, "step": 4230 }, { "entropy": 5.8258195400238035, "epoch": 3.7581003106968485, "grad_norm": 1.1484375, "learning_rate": 0.0003984091850734604, "loss": 5.3853, "mean_token_accuracy": 0.19552432000637054, "num_tokens": 8712653.0, "step": 4235 }, { "entropy": 5.8420146942138675, "epoch": 3.7625388371060806, "grad_norm": 0.9609375, "learning_rate": 0.0003981210060369435, "loss": 5.4715, "mean_token_accuracy": 0.18399242907762528, "num_tokens": 8724054.0, "step": 4240 }, { "entropy": 5.857115030288696, "epoch": 3.7669773635153128, "grad_norm": 1.078125, "learning_rate": 0.000397832538413201, "loss": 5.5001, "mean_token_accuracy": 0.18325462341308593, "num_tokens": 8734629.0, "step": 4245 }, { "entropy": 5.845765590667725, "epoch": 3.771415889924545, "grad_norm": 1.0, "learning_rate": 0.0003975437828783811, "loss": 5.4329, "mean_token_accuracy": 0.1934712439775467, "num_tokens": 8746198.0, "step": 4250 }, { "entropy": 5.730560302734375, "epoch": 3.775854416333777, "grad_norm": 1.09375, "learning_rate": 0.00039725474010930716, "loss": 5.3907, "mean_token_accuracy": 0.20444272756576537, "num_tokens": 8756604.0, "step": 4255 }, { "entropy": 5.827708339691162, "epoch": 3.780292942743009, "grad_norm": 1.171875, "learning_rate": 0.0003969654107834756, "loss": 5.4509, "mean_token_accuracy": 0.1945435181260109, "num_tokens": 8768088.0, "step": 4260 }, { "entropy": 5.82703127861023, "epoch": 3.7847314691522413, "grad_norm": 0.9765625, "learning_rate": 0.0003966757955790547, "loss": 5.3874, "mean_token_accuracy": 0.19351006299257278, "num_tokens": 8778318.0, "step": 4265 }, { "entropy": 5.848085165023804, "epoch": 3.7891699955614735, "grad_norm": 1.1171875, "learning_rate": 0.0003963858951748826, "loss": 5.4017, "mean_token_accuracy": 0.1907930001616478, "num_tokens": 8788659.0, "step": 4270 }, { "entropy": 5.796998500823975, "epoch": 3.7936085219707056, "grad_norm": 1.0546875, "learning_rate": 0.0003960957102504661, "loss": 5.4293, "mean_token_accuracy": 0.18963894993066788, "num_tokens": 8799052.0, "step": 4275 }, { "entropy": 5.907032918930054, "epoch": 3.798047048379938, "grad_norm": 1.1171875, "learning_rate": 0.0003958052414859788, "loss": 5.4359, "mean_token_accuracy": 0.1835399091243744, "num_tokens": 8808534.0, "step": 4280 }, { "entropy": 5.759076499938965, "epoch": 3.80248557478917, "grad_norm": 1.0625, "learning_rate": 0.0003955144895622597, "loss": 5.3888, "mean_token_accuracy": 0.1968761757016182, "num_tokens": 8818802.0, "step": 4285 }, { "entropy": 5.813445806503296, "epoch": 3.806924101198402, "grad_norm": 1.1171875, "learning_rate": 0.0003952234551608114, "loss": 5.3661, "mean_token_accuracy": 0.18817414045333863, "num_tokens": 8829123.0, "step": 4290 }, { "entropy": 5.800790023803711, "epoch": 3.8113626276076342, "grad_norm": 1.1171875, "learning_rate": 0.0003949321389637986, "loss": 5.4292, "mean_token_accuracy": 0.19044290333986283, "num_tokens": 8839771.0, "step": 4295 }, { "entropy": 5.825014877319336, "epoch": 3.8158011540168664, "grad_norm": 1.109375, "learning_rate": 0.0003946405416540466, "loss": 5.4491, "mean_token_accuracy": 0.18945735543966294, "num_tokens": 8849621.0, "step": 4300 }, { "entropy": 5.940211343765259, "epoch": 3.8202396804260985, "grad_norm": 1.125, "learning_rate": 0.00039434866391503963, "loss": 5.4527, "mean_token_accuracy": 0.1803130567073822, "num_tokens": 8860672.0, "step": 4305 }, { "entropy": 5.789125680923462, "epoch": 3.8246782068353307, "grad_norm": 1.09375, "learning_rate": 0.00039405650643091917, "loss": 5.3998, "mean_token_accuracy": 0.19494441598653794, "num_tokens": 8870721.0, "step": 4310 }, { "entropy": 5.757489824295044, "epoch": 3.829116733244563, "grad_norm": 1.0859375, "learning_rate": 0.0003937640698864823, "loss": 5.4515, "mean_token_accuracy": 0.19027765691280366, "num_tokens": 8882142.0, "step": 4315 }, { "entropy": 5.861147117614746, "epoch": 3.833555259653795, "grad_norm": 1.0390625, "learning_rate": 0.00039347135496718027, "loss": 5.4136, "mean_token_accuracy": 0.1945791110396385, "num_tokens": 8892573.0, "step": 4320 }, { "entropy": 5.772451877593994, "epoch": 3.837993786063027, "grad_norm": 1.015625, "learning_rate": 0.00039317836235911705, "loss": 5.4017, "mean_token_accuracy": 0.195092111825943, "num_tokens": 8902942.0, "step": 4325 }, { "entropy": 5.806214046478272, "epoch": 3.8424323124722592, "grad_norm": 1.140625, "learning_rate": 0.0003928850927490472, "loss": 5.4216, "mean_token_accuracy": 0.18946156948804854, "num_tokens": 8913208.0, "step": 4330 }, { "entropy": 5.805463075637817, "epoch": 3.8468708388814914, "grad_norm": 1.2265625, "learning_rate": 0.0003925915468243746, "loss": 5.4276, "mean_token_accuracy": 0.1883111536502838, "num_tokens": 8923080.0, "step": 4335 }, { "entropy": 5.89415135383606, "epoch": 3.8513093652907235, "grad_norm": 1.2421875, "learning_rate": 0.00039229772527315073, "loss": 5.4224, "mean_token_accuracy": 0.18533381819725037, "num_tokens": 8933823.0, "step": 4340 }, { "entropy": 5.795059251785278, "epoch": 3.8557478916999557, "grad_norm": 1.1484375, "learning_rate": 0.0003920036287840734, "loss": 5.3395, "mean_token_accuracy": 0.19785182178020477, "num_tokens": 8943412.0, "step": 4345 }, { "entropy": 5.793986701965332, "epoch": 3.860186418109188, "grad_norm": 1.125, "learning_rate": 0.00039170925804648486, "loss": 5.4513, "mean_token_accuracy": 0.19680401533842087, "num_tokens": 8953616.0, "step": 4350 }, { "entropy": 5.841963052749634, "epoch": 3.86462494451842, "grad_norm": 1.140625, "learning_rate": 0.00039141461375036957, "loss": 5.4467, "mean_token_accuracy": 0.18167138546705247, "num_tokens": 8964790.0, "step": 4355 }, { "entropy": 5.803447532653808, "epoch": 3.869063470927652, "grad_norm": 1.125, "learning_rate": 0.0003911196965863539, "loss": 5.3662, "mean_token_accuracy": 0.1910330817103386, "num_tokens": 8975476.0, "step": 4360 }, { "entropy": 5.852850914001465, "epoch": 3.8735019973368843, "grad_norm": 1.0625, "learning_rate": 0.00039082450724570357, "loss": 5.4888, "mean_token_accuracy": 0.18827887177467345, "num_tokens": 8986132.0, "step": 4365 }, { "entropy": 5.80005111694336, "epoch": 3.8779405237461164, "grad_norm": 1.234375, "learning_rate": 0.0003905290464203221, "loss": 5.4303, "mean_token_accuracy": 0.19234416782855987, "num_tokens": 8996384.0, "step": 4370 }, { "entropy": 5.816908454895019, "epoch": 3.8823790501553486, "grad_norm": 1.0546875, "learning_rate": 0.0003902333148027495, "loss": 5.391, "mean_token_accuracy": 0.20051574110984802, "num_tokens": 9006288.0, "step": 4375 }, { "entropy": 5.857726764678955, "epoch": 3.8868175765645807, "grad_norm": 1.109375, "learning_rate": 0.0003899373130861605, "loss": 5.4102, "mean_token_accuracy": 0.19304264485836028, "num_tokens": 9016713.0, "step": 4380 }, { "entropy": 5.917016649246216, "epoch": 3.891256102973813, "grad_norm": 1.046875, "learning_rate": 0.00038964104196436284, "loss": 5.3835, "mean_token_accuracy": 0.19150962233543395, "num_tokens": 9026524.0, "step": 4385 }, { "entropy": 5.777474451065063, "epoch": 3.895694629383045, "grad_norm": 1.2109375, "learning_rate": 0.00038934450213179596, "loss": 5.4493, "mean_token_accuracy": 0.1875316545367241, "num_tokens": 9037063.0, "step": 4390 }, { "entropy": 5.824544095993042, "epoch": 3.900133155792277, "grad_norm": 1.1171875, "learning_rate": 0.00038904769428352873, "loss": 5.4017, "mean_token_accuracy": 0.1963329166173935, "num_tokens": 9047685.0, "step": 4395 }, { "entropy": 5.849619722366333, "epoch": 3.9045716822015093, "grad_norm": 1.109375, "learning_rate": 0.00038875061911525856, "loss": 5.3666, "mean_token_accuracy": 0.1921242356300354, "num_tokens": 9058084.0, "step": 4400 }, { "entropy": 5.744299793243409, "epoch": 3.9090102086107414, "grad_norm": 1.046875, "learning_rate": 0.0003884532773233094, "loss": 5.3635, "mean_token_accuracy": 0.20264142900705337, "num_tokens": 9068384.0, "step": 4405 }, { "entropy": 5.833960247039795, "epoch": 3.9134487350199736, "grad_norm": 1.078125, "learning_rate": 0.00038815566960463015, "loss": 5.4482, "mean_token_accuracy": 0.18840712010860444, "num_tokens": 9079222.0, "step": 4410 }, { "entropy": 5.850077724456787, "epoch": 3.9178872614292057, "grad_norm": 1.125, "learning_rate": 0.00038785779665679275, "loss": 5.4202, "mean_token_accuracy": 0.18839995115995406, "num_tokens": 9089526.0, "step": 4415 }, { "entropy": 5.751740980148315, "epoch": 3.922325787838438, "grad_norm": 1.0859375, "learning_rate": 0.0003875596591779913, "loss": 5.3186, "mean_token_accuracy": 0.2056492105126381, "num_tokens": 9099054.0, "step": 4420 }, { "entropy": 5.793323278427124, "epoch": 3.92676431424767, "grad_norm": 1.09375, "learning_rate": 0.0003872612578670395, "loss": 5.4754, "mean_token_accuracy": 0.18841795325279237, "num_tokens": 9109290.0, "step": 4425 }, { "entropy": 5.885016775131225, "epoch": 3.931202840656902, "grad_norm": 1.078125, "learning_rate": 0.00038696259342336966, "loss": 5.499, "mean_token_accuracy": 0.18841444998979567, "num_tokens": 9120796.0, "step": 4430 }, { "entropy": 5.861675357818603, "epoch": 3.935641367066134, "grad_norm": 1.2734375, "learning_rate": 0.00038666366654703077, "loss": 5.4846, "mean_token_accuracy": 0.1862151712179184, "num_tokens": 9131306.0, "step": 4435 }, { "entropy": 5.840978145599365, "epoch": 3.940079893475366, "grad_norm": 1.203125, "learning_rate": 0.00038636447793868715, "loss": 5.4734, "mean_token_accuracy": 0.18990519195795058, "num_tokens": 9140278.0, "step": 4440 }, { "entropy": 5.851602220535279, "epoch": 3.944518419884598, "grad_norm": 1.0703125, "learning_rate": 0.00038606502829961645, "loss": 5.4267, "mean_token_accuracy": 0.19005220383405685, "num_tokens": 9150742.0, "step": 4445 }, { "entropy": 5.7608050346374515, "epoch": 3.9489569462938303, "grad_norm": 1.2734375, "learning_rate": 0.0003857653183317081, "loss": 5.3303, "mean_token_accuracy": 0.19899591207504272, "num_tokens": 9160227.0, "step": 4450 }, { "entropy": 5.791858434677124, "epoch": 3.9533954727030625, "grad_norm": 1.0390625, "learning_rate": 0.0003854653487374617, "loss": 5.4306, "mean_token_accuracy": 0.19147539585828782, "num_tokens": 9170733.0, "step": 4455 }, { "entropy": 5.8443633079528805, "epoch": 3.9578339991122946, "grad_norm": 1.140625, "learning_rate": 0.0003851651202199856, "loss": 5.413, "mean_token_accuracy": 0.19143973886966706, "num_tokens": 9180582.0, "step": 4460 }, { "entropy": 5.821952390670776, "epoch": 3.9622725255215268, "grad_norm": 1.1640625, "learning_rate": 0.0003848646334829949, "loss": 5.4525, "mean_token_accuracy": 0.1855350062251091, "num_tokens": 9191245.0, "step": 4465 }, { "entropy": 5.840106630325318, "epoch": 3.966711051930759, "grad_norm": 1.03125, "learning_rate": 0.00038456388923081006, "loss": 5.4459, "mean_token_accuracy": 0.18592941164970397, "num_tokens": 9201657.0, "step": 4470 }, { "entropy": 5.830752325057984, "epoch": 3.971149578339991, "grad_norm": 1.1953125, "learning_rate": 0.00038426288816835485, "loss": 5.4103, "mean_token_accuracy": 0.18891609460115433, "num_tokens": 9212102.0, "step": 4475 }, { "entropy": 5.847698926925659, "epoch": 3.975588104749223, "grad_norm": 1.1171875, "learning_rate": 0.0003839616310011554, "loss": 5.3934, "mean_token_accuracy": 0.18960051685571672, "num_tokens": 9221022.0, "step": 4480 }, { "entropy": 5.806353616714477, "epoch": 3.9800266311584553, "grad_norm": 0.98046875, "learning_rate": 0.0003836601184353379, "loss": 5.4564, "mean_token_accuracy": 0.18732759356498718, "num_tokens": 9232105.0, "step": 4485 }, { "entropy": 5.804685926437378, "epoch": 3.9844651575676875, "grad_norm": 0.90625, "learning_rate": 0.00038335835117762706, "loss": 5.3984, "mean_token_accuracy": 0.1938449651002884, "num_tokens": 9242338.0, "step": 4490 }, { "entropy": 5.864504861831665, "epoch": 3.9889036839769196, "grad_norm": 1.140625, "learning_rate": 0.00038305632993534483, "loss": 5.4276, "mean_token_accuracy": 0.1886606141924858, "num_tokens": 9252551.0, "step": 4495 }, { "entropy": 5.843533515930176, "epoch": 3.993342210386152, "grad_norm": 1.1328125, "learning_rate": 0.00038275405541640835, "loss": 5.403, "mean_token_accuracy": 0.19167436361312867, "num_tokens": 9263424.0, "step": 4500 }, { "epoch": 3.993342210386152, "eval_entropy": 5.580333083372501, "eval_loss": 5.84522008895874, "eval_mean_token_accuracy": 0.17348938688388063, "eval_num_tokens": 9263424.0, "eval_runtime": 2.2779, "eval_samples_per_second": 1478.121, "eval_steps_per_second": 184.82, "step": 4500 }, { "entropy": 5.849137592315674, "epoch": 3.997780736795384, "grad_norm": 1.0546875, "learning_rate": 0.00038245152832932843, "loss": 5.4953, "mean_token_accuracy": 0.1837543785572052, "num_tokens": 9274355.0, "step": 4505 }, { "entropy": 5.780615064832899, "epoch": 4.001775410563693, "grad_norm": 0.984375, "learning_rate": 0.00038214874938320795, "loss": 5.2503, "mean_token_accuracy": 0.205965217616823, "num_tokens": 9283179.0, "step": 4510 }, { "entropy": 5.817928743362427, "epoch": 4.006213936972925, "grad_norm": 1.15625, "learning_rate": 0.0003818457192877399, "loss": 5.1978, "mean_token_accuracy": 0.208414126932621, "num_tokens": 9293709.0, "step": 4515 }, { "entropy": 5.824892950057984, "epoch": 4.010652463382157, "grad_norm": 1.1328125, "learning_rate": 0.0003815424387532063, "loss": 5.2238, "mean_token_accuracy": 0.21198973655700684, "num_tokens": 9303971.0, "step": 4520 }, { "entropy": 5.810022640228271, "epoch": 4.015090989791389, "grad_norm": 1.109375, "learning_rate": 0.000381238908490476, "loss": 5.1717, "mean_token_accuracy": 0.208732508122921, "num_tokens": 9313578.0, "step": 4525 }, { "entropy": 5.752050828933716, "epoch": 4.019529516200621, "grad_norm": 1.09375, "learning_rate": 0.00038093512921100306, "loss": 5.1907, "mean_token_accuracy": 0.2054088294506073, "num_tokens": 9323538.0, "step": 4530 }, { "entropy": 5.838475942611694, "epoch": 4.023968042609853, "grad_norm": 1.1171875, "learning_rate": 0.0003806311016268254, "loss": 5.1886, "mean_token_accuracy": 0.20790643393993377, "num_tokens": 9335266.0, "step": 4535 }, { "entropy": 5.79393162727356, "epoch": 4.028406569019086, "grad_norm": 1.15625, "learning_rate": 0.000380326826450563, "loss": 5.1481, "mean_token_accuracy": 0.20686888098716735, "num_tokens": 9345247.0, "step": 4540 }, { "entropy": 5.778472805023194, "epoch": 4.032845095428318, "grad_norm": 1.2265625, "learning_rate": 0.00038002230439541603, "loss": 5.1838, "mean_token_accuracy": 0.20136410593986512, "num_tokens": 9355435.0, "step": 4545 }, { "entropy": 5.719447374343872, "epoch": 4.03728362183755, "grad_norm": 1.109375, "learning_rate": 0.00037971753617516336, "loss": 5.109, "mean_token_accuracy": 0.2196057543158531, "num_tokens": 9365503.0, "step": 4550 }, { "entropy": 5.798331022262573, "epoch": 4.041722148246782, "grad_norm": 1.21875, "learning_rate": 0.00037941252250416074, "loss": 5.0692, "mean_token_accuracy": 0.21513248682022096, "num_tokens": 9374361.0, "step": 4555 }, { "entropy": 5.722120237350464, "epoch": 4.046160674656014, "grad_norm": 1.1640625, "learning_rate": 0.00037910726409733965, "loss": 5.0786, "mean_token_accuracy": 0.22050419300794602, "num_tokens": 9383992.0, "step": 4560 }, { "entropy": 5.756671810150147, "epoch": 4.050599201065246, "grad_norm": 1.03125, "learning_rate": 0.0003788017616702048, "loss": 5.2069, "mean_token_accuracy": 0.20192554146051406, "num_tokens": 9394270.0, "step": 4565 }, { "entropy": 5.837602424621582, "epoch": 4.055037727474478, "grad_norm": 1.15625, "learning_rate": 0.00037849601593883297, "loss": 5.1378, "mean_token_accuracy": 0.20951651483774186, "num_tokens": 9404913.0, "step": 4570 }, { "entropy": 5.830431222915649, "epoch": 4.059476253883711, "grad_norm": 1.0703125, "learning_rate": 0.00037819002761987127, "loss": 5.2469, "mean_token_accuracy": 0.20075388699769975, "num_tokens": 9415718.0, "step": 4575 }, { "entropy": 5.777271699905396, "epoch": 4.063914780292943, "grad_norm": 1.0625, "learning_rate": 0.0003778837974305355, "loss": 5.1694, "mean_token_accuracy": 0.20675463527441024, "num_tokens": 9425761.0, "step": 4580 }, { "entropy": 5.696642255783081, "epoch": 4.068353306702175, "grad_norm": 1.0546875, "learning_rate": 0.00037757732608860824, "loss": 5.1757, "mean_token_accuracy": 0.2074501171708107, "num_tokens": 9437519.0, "step": 4585 }, { "entropy": 5.773201513290405, "epoch": 4.072791833111407, "grad_norm": 1.2265625, "learning_rate": 0.00037727061431243737, "loss": 5.0117, "mean_token_accuracy": 0.22399133294820786, "num_tokens": 9447452.0, "step": 4590 }, { "entropy": 5.802689504623413, "epoch": 4.077230359520639, "grad_norm": 1.2890625, "learning_rate": 0.00037696366282093433, "loss": 5.2194, "mean_token_accuracy": 0.20754450112581252, "num_tokens": 9458155.0, "step": 4595 }, { "entropy": 5.665275192260742, "epoch": 4.081668885929871, "grad_norm": 1.1796875, "learning_rate": 0.00037665647233357243, "loss": 5.035, "mean_token_accuracy": 0.22337092012166976, "num_tokens": 9467478.0, "step": 4600 }, { "entropy": 5.747597599029541, "epoch": 4.0861074123391035, "grad_norm": 1.15625, "learning_rate": 0.0003763490435703853, "loss": 5.1954, "mean_token_accuracy": 0.2060795918107033, "num_tokens": 9478636.0, "step": 4605 }, { "entropy": 5.818109655380249, "epoch": 4.090545938748336, "grad_norm": 1.3125, "learning_rate": 0.0003760413772519648, "loss": 5.1343, "mean_token_accuracy": 0.21224167048931122, "num_tokens": 9488626.0, "step": 4610 }, { "entropy": 5.805790519714355, "epoch": 4.094984465157568, "grad_norm": 1.015625, "learning_rate": 0.00037573347409945983, "loss": 5.2094, "mean_token_accuracy": 0.20401569008827208, "num_tokens": 9501119.0, "step": 4615 }, { "entropy": 5.736809253692627, "epoch": 4.0994229915668, "grad_norm": 1.2578125, "learning_rate": 0.0003754253348345743, "loss": 5.0526, "mean_token_accuracy": 0.21723955422639846, "num_tokens": 9511075.0, "step": 4620 }, { "entropy": 5.720714664459228, "epoch": 4.103861517976032, "grad_norm": 1.2265625, "learning_rate": 0.0003751169601795657, "loss": 5.1149, "mean_token_accuracy": 0.2152253657579422, "num_tokens": 9520956.0, "step": 4625 }, { "entropy": 5.765715742111206, "epoch": 4.108300044385264, "grad_norm": 1.1328125, "learning_rate": 0.00037480835085724313, "loss": 5.1922, "mean_token_accuracy": 0.20740145891904832, "num_tokens": 9531020.0, "step": 4630 }, { "entropy": 5.826910781860351, "epoch": 4.112738570794496, "grad_norm": 1.1640625, "learning_rate": 0.0003744995075909656, "loss": 5.1995, "mean_token_accuracy": 0.20915032178163528, "num_tokens": 9541230.0, "step": 4635 }, { "entropy": 5.742929315567016, "epoch": 4.1171770972037285, "grad_norm": 1.265625, "learning_rate": 0.0003741904311046408, "loss": 5.1937, "mean_token_accuracy": 0.20653378814458848, "num_tokens": 9551055.0, "step": 4640 }, { "entropy": 5.820126247406006, "epoch": 4.121615623612961, "grad_norm": 1.15625, "learning_rate": 0.0003738811221227228, "loss": 5.2131, "mean_token_accuracy": 0.2067299783229828, "num_tokens": 9560982.0, "step": 4645 }, { "entropy": 5.5898134231567385, "epoch": 4.126054150022193, "grad_norm": 1.1484375, "learning_rate": 0.00037357158137021077, "loss": 5.0703, "mean_token_accuracy": 0.21925579160451888, "num_tokens": 9571950.0, "step": 4650 }, { "entropy": 5.7765885353088375, "epoch": 4.130492676431425, "grad_norm": 1.2265625, "learning_rate": 0.000373261809572647, "loss": 5.192, "mean_token_accuracy": 0.2030755400657654, "num_tokens": 9581670.0, "step": 4655 }, { "entropy": 5.8400060653686525, "epoch": 4.134931202840657, "grad_norm": 1.109375, "learning_rate": 0.00037295180745611553, "loss": 5.2075, "mean_token_accuracy": 0.2056944653391838, "num_tokens": 9592282.0, "step": 4660 }, { "entropy": 5.656895732879638, "epoch": 4.139369729249889, "grad_norm": 1.1015625, "learning_rate": 0.0003726415757472401, "loss": 5.1455, "mean_token_accuracy": 0.21399735808372497, "num_tokens": 9602530.0, "step": 4665 }, { "entropy": 5.784669542312622, "epoch": 4.143808255659121, "grad_norm": 1.2578125, "learning_rate": 0.00037233111517318257, "loss": 5.2154, "mean_token_accuracy": 0.20880706161260604, "num_tokens": 9612454.0, "step": 4670 }, { "entropy": 5.761039924621582, "epoch": 4.1482467820683535, "grad_norm": 1.0390625, "learning_rate": 0.0003720204264616414, "loss": 5.1301, "mean_token_accuracy": 0.21270381510257722, "num_tokens": 9623461.0, "step": 4675 }, { "entropy": 5.727607536315918, "epoch": 4.152685308477586, "grad_norm": 1.109375, "learning_rate": 0.0003717095103408497, "loss": 5.1241, "mean_token_accuracy": 0.21046421229839324, "num_tokens": 9632502.0, "step": 4680 }, { "entropy": 5.74509973526001, "epoch": 4.157123834886818, "grad_norm": 1.1953125, "learning_rate": 0.00037139836753957353, "loss": 5.1327, "mean_token_accuracy": 0.2110206052660942, "num_tokens": 9642801.0, "step": 4685 }, { "entropy": 5.717509031295776, "epoch": 4.16156236129605, "grad_norm": 1.296875, "learning_rate": 0.00037108699878711044, "loss": 5.1467, "mean_token_accuracy": 0.22023138552904128, "num_tokens": 9652638.0, "step": 4690 }, { "entropy": 5.7005359649658205, "epoch": 4.166000887705282, "grad_norm": 1.1484375, "learning_rate": 0.00037077540481328744, "loss": 5.1091, "mean_token_accuracy": 0.21125866025686263, "num_tokens": 9662480.0, "step": 4695 }, { "entropy": 5.737263202667236, "epoch": 4.170439414114514, "grad_norm": 1.21875, "learning_rate": 0.0003704635863484596, "loss": 5.2501, "mean_token_accuracy": 0.20748572200536727, "num_tokens": 9673269.0, "step": 4700 }, { "entropy": 5.7536533832550045, "epoch": 4.174877940523746, "grad_norm": 1.2265625, "learning_rate": 0.00037015154412350806, "loss": 5.0887, "mean_token_accuracy": 0.20911131352186202, "num_tokens": 9682905.0, "step": 4705 }, { "entropy": 5.684925746917725, "epoch": 4.1793164669329785, "grad_norm": 1.1953125, "learning_rate": 0.00036983927886983847, "loss": 5.1556, "mean_token_accuracy": 0.212339323759079, "num_tokens": 9693609.0, "step": 4710 }, { "entropy": 5.720796203613281, "epoch": 4.183754993342211, "grad_norm": 1.1171875, "learning_rate": 0.00036952679131937923, "loss": 5.1308, "mean_token_accuracy": 0.21655481159687043, "num_tokens": 9703927.0, "step": 4715 }, { "entropy": 5.760318803787231, "epoch": 4.188193519751443, "grad_norm": 1.15625, "learning_rate": 0.0003692140822045798, "loss": 5.1275, "mean_token_accuracy": 0.21760178804397584, "num_tokens": 9714440.0, "step": 4720 }, { "entropy": 5.6793900489807125, "epoch": 4.192632046160675, "grad_norm": 1.1640625, "learning_rate": 0.00036890115225840904, "loss": 5.1579, "mean_token_accuracy": 0.21766061335802078, "num_tokens": 9724586.0, "step": 4725 }, { "entropy": 5.717368078231812, "epoch": 4.197070572569907, "grad_norm": 1.1484375, "learning_rate": 0.0003685880022143533, "loss": 5.1252, "mean_token_accuracy": 0.2100989669561386, "num_tokens": 9734602.0, "step": 4730 }, { "entropy": 5.812760972976685, "epoch": 4.201509098979139, "grad_norm": 1.328125, "learning_rate": 0.00036827463280641494, "loss": 5.2243, "mean_token_accuracy": 0.19821423143148423, "num_tokens": 9744970.0, "step": 4735 }, { "entropy": 5.766703367233276, "epoch": 4.205947625388371, "grad_norm": 1.2578125, "learning_rate": 0.00036796104476911033, "loss": 5.1653, "mean_token_accuracy": 0.2106243133544922, "num_tokens": 9754529.0, "step": 4740 }, { "entropy": 5.708454179763794, "epoch": 4.210386151797604, "grad_norm": 1.2734375, "learning_rate": 0.00036764723883746865, "loss": 5.1962, "mean_token_accuracy": 0.20117447674274444, "num_tokens": 9765742.0, "step": 4745 }, { "entropy": 5.742970275878906, "epoch": 4.214824678206836, "grad_norm": 1.3203125, "learning_rate": 0.0003673332157470293, "loss": 5.1156, "mean_token_accuracy": 0.2144193544983864, "num_tokens": 9776563.0, "step": 4750 }, { "entropy": 5.772315835952758, "epoch": 4.219263204616068, "grad_norm": 1.2109375, "learning_rate": 0.000367018976233841, "loss": 5.137, "mean_token_accuracy": 0.2113969936966896, "num_tokens": 9786663.0, "step": 4755 }, { "entropy": 5.725389003753662, "epoch": 4.2237017310253, "grad_norm": 1.1875, "learning_rate": 0.0003667045210344598, "loss": 5.1432, "mean_token_accuracy": 0.2056875169277191, "num_tokens": 9796499.0, "step": 4760 }, { "entropy": 5.7241839408874515, "epoch": 4.228140257434532, "grad_norm": 1.1640625, "learning_rate": 0.0003663898508859471, "loss": 5.1622, "mean_token_accuracy": 0.21654269099235535, "num_tokens": 9807305.0, "step": 4765 }, { "entropy": 5.753515100479126, "epoch": 4.232578783843764, "grad_norm": 1.140625, "learning_rate": 0.0003660749665258684, "loss": 5.1908, "mean_token_accuracy": 0.20672854781150818, "num_tokens": 9818259.0, "step": 4770 }, { "entropy": 5.696164798736572, "epoch": 4.237017310252996, "grad_norm": 1.0078125, "learning_rate": 0.0003657598686922909, "loss": 5.1094, "mean_token_accuracy": 0.21507840007543563, "num_tokens": 9830146.0, "step": 4775 }, { "entropy": 5.7545092582702635, "epoch": 4.241455836662228, "grad_norm": 1.1953125, "learning_rate": 0.0003654445581237824, "loss": 5.1845, "mean_token_accuracy": 0.20769521594047546, "num_tokens": 9840847.0, "step": 4780 }, { "entropy": 5.662838459014893, "epoch": 4.245894363071461, "grad_norm": 1.234375, "learning_rate": 0.0003651290355594096, "loss": 5.1024, "mean_token_accuracy": 0.2179262727499008, "num_tokens": 9850948.0, "step": 4785 }, { "entropy": 5.748239183425904, "epoch": 4.250332889480692, "grad_norm": 1.09375, "learning_rate": 0.0003648133017387356, "loss": 5.1987, "mean_token_accuracy": 0.20759087502956391, "num_tokens": 9861205.0, "step": 4790 }, { "entropy": 5.666525506973267, "epoch": 4.254771415889924, "grad_norm": 1.046875, "learning_rate": 0.00036449735740181884, "loss": 5.1803, "mean_token_accuracy": 0.205241397023201, "num_tokens": 9871660.0, "step": 4795 }, { "entropy": 5.73541841506958, "epoch": 4.259209942299156, "grad_norm": 1.1328125, "learning_rate": 0.00036418120328921146, "loss": 5.0938, "mean_token_accuracy": 0.22027103304862977, "num_tokens": 9881533.0, "step": 4800 }, { "entropy": 5.766236066818237, "epoch": 4.263648468708388, "grad_norm": 1.21875, "learning_rate": 0.00036386484014195696, "loss": 5.2506, "mean_token_accuracy": 0.20312998443841934, "num_tokens": 9892707.0, "step": 4805 }, { "entropy": 5.696821928024292, "epoch": 4.268086995117621, "grad_norm": 1.28125, "learning_rate": 0.0003635482687015891, "loss": 5.0745, "mean_token_accuracy": 0.21657687425613403, "num_tokens": 9901562.0, "step": 4810 }, { "entropy": 5.70862922668457, "epoch": 4.272525521526853, "grad_norm": 1.25, "learning_rate": 0.00036323148971012954, "loss": 5.1427, "mean_token_accuracy": 0.2149751827120781, "num_tokens": 9910742.0, "step": 4815 }, { "entropy": 5.784573650360107, "epoch": 4.276964047936085, "grad_norm": 1.03125, "learning_rate": 0.00036291450391008655, "loss": 5.2066, "mean_token_accuracy": 0.20904852747917174, "num_tokens": 9922322.0, "step": 4820 }, { "entropy": 5.728090095520019, "epoch": 4.281402574345317, "grad_norm": 1.25, "learning_rate": 0.00036259731204445347, "loss": 5.117, "mean_token_accuracy": 0.20740775316953658, "num_tokens": 9931868.0, "step": 4825 }, { "entropy": 5.731380271911621, "epoch": 4.285841100754549, "grad_norm": 1.125, "learning_rate": 0.0003622799148567061, "loss": 5.179, "mean_token_accuracy": 0.21309688240289687, "num_tokens": 9942198.0, "step": 4830 }, { "entropy": 5.804520463943481, "epoch": 4.290279627163781, "grad_norm": 1.0859375, "learning_rate": 0.0003619623130908017, "loss": 5.209, "mean_token_accuracy": 0.2023901730775833, "num_tokens": 9953094.0, "step": 4835 }, { "entropy": 5.745091295242309, "epoch": 4.2947181535730135, "grad_norm": 1.1484375, "learning_rate": 0.0003616445074911774, "loss": 5.1656, "mean_token_accuracy": 0.2081662744283676, "num_tokens": 9964759.0, "step": 4840 }, { "entropy": 5.738615322113037, "epoch": 4.299156679982246, "grad_norm": 1.3125, "learning_rate": 0.0003613264988027477, "loss": 5.1629, "mean_token_accuracy": 0.2116822764277458, "num_tokens": 9973916.0, "step": 4845 }, { "entropy": 5.72474102973938, "epoch": 4.303595206391478, "grad_norm": 1.171875, "learning_rate": 0.0003610082877709031, "loss": 5.2008, "mean_token_accuracy": 0.20751210302114487, "num_tokens": 9985388.0, "step": 4850 }, { "entropy": 5.754292154312134, "epoch": 4.30803373280071, "grad_norm": 1.1953125, "learning_rate": 0.00036068987514150866, "loss": 5.1662, "mean_token_accuracy": 0.21000789403915404, "num_tokens": 9996143.0, "step": 4855 }, { "entropy": 5.7305224418640135, "epoch": 4.312472259209942, "grad_norm": 1.171875, "learning_rate": 0.00036037126166090167, "loss": 5.2454, "mean_token_accuracy": 0.1990845561027527, "num_tokens": 10007376.0, "step": 4860 }, { "entropy": 5.722129201889038, "epoch": 4.316910785619174, "grad_norm": 1.296875, "learning_rate": 0.0003600524480758906, "loss": 5.1317, "mean_token_accuracy": 0.2125830441713333, "num_tokens": 10016435.0, "step": 4865 }, { "entropy": 5.771578645706176, "epoch": 4.321349312028406, "grad_norm": 1.1640625, "learning_rate": 0.00035973343513375254, "loss": 5.2502, "mean_token_accuracy": 0.20185581594705582, "num_tokens": 10027577.0, "step": 4870 }, { "entropy": 5.819239234924316, "epoch": 4.3257878384376385, "grad_norm": 1.171875, "learning_rate": 0.000359414223582232, "loss": 5.1953, "mean_token_accuracy": 0.1998763546347618, "num_tokens": 10037099.0, "step": 4875 }, { "entropy": 5.746256351470947, "epoch": 4.330226364846871, "grad_norm": 1.171875, "learning_rate": 0.0003590948141695392, "loss": 5.1537, "mean_token_accuracy": 0.20699663162231446, "num_tokens": 10047718.0, "step": 4880 }, { "entropy": 5.696747159957885, "epoch": 4.334664891256103, "grad_norm": 1.1953125, "learning_rate": 0.0003587752076443479, "loss": 5.1114, "mean_token_accuracy": 0.2158285990357399, "num_tokens": 10057507.0, "step": 4885 }, { "entropy": 5.7871781349182125, "epoch": 4.339103417665335, "grad_norm": 1.2421875, "learning_rate": 0.0003584554047557939, "loss": 5.2184, "mean_token_accuracy": 0.20748222768306732, "num_tokens": 10067643.0, "step": 4890 }, { "entropy": 5.658500385284424, "epoch": 4.343541944074567, "grad_norm": 1.1953125, "learning_rate": 0.00035813540625347334, "loss": 5.0818, "mean_token_accuracy": 0.21400361955165864, "num_tokens": 10077296.0, "step": 4895 }, { "entropy": 5.799658584594726, "epoch": 4.347980470483799, "grad_norm": 1.375, "learning_rate": 0.0003578152128874409, "loss": 5.2096, "mean_token_accuracy": 0.20976602435112, "num_tokens": 10087218.0, "step": 4900 }, { "entropy": 5.7649839401245115, "epoch": 4.352418996893031, "grad_norm": 1.21875, "learning_rate": 0.00035749482540820796, "loss": 5.2046, "mean_token_accuracy": 0.2050032064318657, "num_tokens": 10096915.0, "step": 4905 }, { "entropy": 5.669079971313477, "epoch": 4.3568575233022635, "grad_norm": 1.25, "learning_rate": 0.00035717424456674086, "loss": 5.1605, "mean_token_accuracy": 0.20748622417449952, "num_tokens": 10108096.0, "step": 4910 }, { "entropy": 5.729409265518188, "epoch": 4.361296049711496, "grad_norm": 1.25, "learning_rate": 0.0003568534711144591, "loss": 5.1616, "mean_token_accuracy": 0.20923524498939514, "num_tokens": 10119131.0, "step": 4915 }, { "entropy": 5.727017021179199, "epoch": 4.365734576120728, "grad_norm": 1.1640625, "learning_rate": 0.00035653250580323383, "loss": 5.2125, "mean_token_accuracy": 0.2000671833753586, "num_tokens": 10129490.0, "step": 4920 }, { "entropy": 5.716195392608642, "epoch": 4.37017310252996, "grad_norm": 1.125, "learning_rate": 0.00035621134938538585, "loss": 5.0923, "mean_token_accuracy": 0.2212134048342705, "num_tokens": 10140282.0, "step": 4925 }, { "entropy": 5.7920060634613035, "epoch": 4.374611628939192, "grad_norm": 1.1328125, "learning_rate": 0.0003558900026136838, "loss": 5.2556, "mean_token_accuracy": 0.20267445594072342, "num_tokens": 10150256.0, "step": 4930 }, { "entropy": 5.661780214309692, "epoch": 4.379050155348424, "grad_norm": 1.171875, "learning_rate": 0.0003555684662413424, "loss": 5.1197, "mean_token_accuracy": 0.21318988204002381, "num_tokens": 10160993.0, "step": 4935 }, { "entropy": 5.699134492874146, "epoch": 4.383488681757656, "grad_norm": 1.21875, "learning_rate": 0.0003552467410220212, "loss": 5.1816, "mean_token_accuracy": 0.20566583573818206, "num_tokens": 10171585.0, "step": 4940 }, { "entropy": 5.622805070877075, "epoch": 4.3879272081668885, "grad_norm": 1.3046875, "learning_rate": 0.0003549248277098221, "loss": 5.1294, "mean_token_accuracy": 0.21171367913484573, "num_tokens": 10180923.0, "step": 4945 }, { "entropy": 5.71085786819458, "epoch": 4.392365734576121, "grad_norm": 1.140625, "learning_rate": 0.0003546027270592878, "loss": 5.1071, "mean_token_accuracy": 0.21543533205986024, "num_tokens": 10190365.0, "step": 4950 }, { "entropy": 5.789462852478027, "epoch": 4.396804260985353, "grad_norm": 1.1953125, "learning_rate": 0.00035428043982540017, "loss": 5.2529, "mean_token_accuracy": 0.2044300004839897, "num_tokens": 10200400.0, "step": 4955 }, { "entropy": 5.729992198944092, "epoch": 4.401242787394585, "grad_norm": 1.125, "learning_rate": 0.00035395796676357855, "loss": 5.174, "mean_token_accuracy": 0.21109428107738495, "num_tokens": 10210489.0, "step": 4960 }, { "entropy": 5.7173525333404545, "epoch": 4.405681313803817, "grad_norm": 1.1484375, "learning_rate": 0.0003536353086296778, "loss": 5.1718, "mean_token_accuracy": 0.20589128136634827, "num_tokens": 10221141.0, "step": 4965 }, { "entropy": 5.723089933395386, "epoch": 4.410119840213049, "grad_norm": 1.2421875, "learning_rate": 0.00035331246617998654, "loss": 5.1542, "mean_token_accuracy": 0.2141341060400009, "num_tokens": 10230776.0, "step": 4970 }, { "entropy": 5.744500684738159, "epoch": 4.414558366622281, "grad_norm": 1.2578125, "learning_rate": 0.0003529894401712253, "loss": 5.1449, "mean_token_accuracy": 0.21146791875362397, "num_tokens": 10240366.0, "step": 4975 }, { "entropy": 5.6858978271484375, "epoch": 4.4189968930315136, "grad_norm": 1.1875, "learning_rate": 0.00035266623136054505, "loss": 5.1778, "mean_token_accuracy": 0.20696759223937988, "num_tokens": 10250833.0, "step": 4980 }, { "entropy": 5.750640869140625, "epoch": 4.423435419440746, "grad_norm": 1.3359375, "learning_rate": 0.00035234284050552516, "loss": 5.2571, "mean_token_accuracy": 0.2038218379020691, "num_tokens": 10260242.0, "step": 4985 }, { "entropy": 5.765140056610107, "epoch": 4.427873945849978, "grad_norm": 1.1015625, "learning_rate": 0.0003520192683641718, "loss": 5.2297, "mean_token_accuracy": 0.2027687519788742, "num_tokens": 10272362.0, "step": 4990 }, { "entropy": 5.744220781326294, "epoch": 4.43231247225921, "grad_norm": 1.140625, "learning_rate": 0.0003516955156949157, "loss": 5.1941, "mean_token_accuracy": 0.20152689814567565, "num_tokens": 10283176.0, "step": 4995 }, { "entropy": 5.7464361667633055, "epoch": 4.436750998668442, "grad_norm": 1.1953125, "learning_rate": 0.00035137158325661115, "loss": 5.2608, "mean_token_accuracy": 0.20259124040603638, "num_tokens": 10293630.0, "step": 5000 }, { "epoch": 4.436750998668442, "eval_entropy": 5.5769944247610495, "eval_loss": 5.8343658447265625, "eval_mean_token_accuracy": 0.17468414655632192, "eval_num_tokens": 10293630.0, "eval_runtime": 2.0854, "eval_samples_per_second": 1614.524, "eval_steps_per_second": 201.875, "step": 5000 }, { "entropy": 5.790251922607422, "epoch": 4.441189525077674, "grad_norm": 1.1640625, "learning_rate": 0.00035104747180853376, "loss": 5.1822, "mean_token_accuracy": 0.20639875233173371, "num_tokens": 10303775.0, "step": 5005 }, { "entropy": 5.715227222442627, "epoch": 4.445628051486906, "grad_norm": 1.078125, "learning_rate": 0.0003507231821103785, "loss": 5.1551, "mean_token_accuracy": 0.21106622070074083, "num_tokens": 10314142.0, "step": 5010 }, { "entropy": 5.747024440765381, "epoch": 4.450066577896139, "grad_norm": 1.1328125, "learning_rate": 0.00035039871492225814, "loss": 5.1535, "mean_token_accuracy": 0.2024983510375023, "num_tokens": 10324401.0, "step": 5015 }, { "entropy": 5.675720167160034, "epoch": 4.454505104305371, "grad_norm": 1.2265625, "learning_rate": 0.00035007407100470187, "loss": 5.1739, "mean_token_accuracy": 0.21270538568496705, "num_tokens": 10334872.0, "step": 5020 }, { "entropy": 5.7632105350494385, "epoch": 4.458943630714603, "grad_norm": 1.078125, "learning_rate": 0.0003497492511186527, "loss": 5.253, "mean_token_accuracy": 0.1968903511762619, "num_tokens": 10345504.0, "step": 5025 }, { "entropy": 5.672514867782593, "epoch": 4.463382157123835, "grad_norm": 1.28125, "learning_rate": 0.00034942425602546616, "loss": 5.1775, "mean_token_accuracy": 0.2216365560889244, "num_tokens": 10355191.0, "step": 5030 }, { "entropy": 5.778588008880615, "epoch": 4.467820683533067, "grad_norm": 1.296875, "learning_rate": 0.00034909908648690874, "loss": 5.2407, "mean_token_accuracy": 0.20244300067424775, "num_tokens": 10365185.0, "step": 5035 }, { "entropy": 5.789299154281617, "epoch": 4.472259209942299, "grad_norm": 1.1875, "learning_rate": 0.00034877374326515556, "loss": 5.1825, "mean_token_accuracy": 0.207652448117733, "num_tokens": 10374977.0, "step": 5040 }, { "entropy": 5.714522647857666, "epoch": 4.4766977363515315, "grad_norm": 1.1640625, "learning_rate": 0.00034844822712278874, "loss": 5.2086, "mean_token_accuracy": 0.21069382429122924, "num_tokens": 10385182.0, "step": 5045 }, { "entropy": 5.704091644287109, "epoch": 4.481136262760764, "grad_norm": 1.125, "learning_rate": 0.0003481225388227961, "loss": 5.1767, "mean_token_accuracy": 0.21677854061126708, "num_tokens": 10395685.0, "step": 5050 }, { "entropy": 5.69912896156311, "epoch": 4.485574789169996, "grad_norm": 1.1796875, "learning_rate": 0.00034779667912856864, "loss": 5.1712, "mean_token_accuracy": 0.2076883152127266, "num_tokens": 10405920.0, "step": 5055 }, { "entropy": 5.758427858352661, "epoch": 4.490013315579228, "grad_norm": 1.265625, "learning_rate": 0.0003474706488038993, "loss": 5.2679, "mean_token_accuracy": 0.19982607960700988, "num_tokens": 10417815.0, "step": 5060 }, { "entropy": 5.775757932662964, "epoch": 4.49445184198846, "grad_norm": 1.125, "learning_rate": 0.00034714444861298077, "loss": 5.2791, "mean_token_accuracy": 0.20297911316156386, "num_tokens": 10428603.0, "step": 5065 }, { "entropy": 5.725766277313232, "epoch": 4.498890368397692, "grad_norm": 1.3515625, "learning_rate": 0.00034681807932040407, "loss": 5.1524, "mean_token_accuracy": 0.2125113993883133, "num_tokens": 10438053.0, "step": 5070 }, { "entropy": 5.751907110214233, "epoch": 4.503328894806924, "grad_norm": 1.2421875, "learning_rate": 0.0003464915416911565, "loss": 5.2354, "mean_token_accuracy": 0.2079993560910225, "num_tokens": 10447750.0, "step": 5075 }, { "entropy": 5.751536750793457, "epoch": 4.5077674212161565, "grad_norm": 1.1796875, "learning_rate": 0.00034616483649062003, "loss": 5.2334, "mean_token_accuracy": 0.19996216744184495, "num_tokens": 10458168.0, "step": 5080 }, { "entropy": 5.77265772819519, "epoch": 4.512205947625389, "grad_norm": 1.234375, "learning_rate": 0.0003458379644845693, "loss": 5.2019, "mean_token_accuracy": 0.20402003526687623, "num_tokens": 10468537.0, "step": 5085 }, { "entropy": 5.749958181381226, "epoch": 4.516644474034621, "grad_norm": 1.1328125, "learning_rate": 0.0003455109264391699, "loss": 5.2142, "mean_token_accuracy": 0.20577894747257233, "num_tokens": 10478549.0, "step": 5090 }, { "entropy": 5.679034996032715, "epoch": 4.521083000443853, "grad_norm": 1.2265625, "learning_rate": 0.0003451837231209766, "loss": 5.1651, "mean_token_accuracy": 0.22028762549161912, "num_tokens": 10488579.0, "step": 5095 }, { "entropy": 5.727813005447388, "epoch": 4.525521526853085, "grad_norm": 1.203125, "learning_rate": 0.00034485635529693173, "loss": 5.2168, "mean_token_accuracy": 0.21334245204925537, "num_tokens": 10498869.0, "step": 5100 }, { "entropy": 5.774104833602905, "epoch": 4.529960053262317, "grad_norm": 1.09375, "learning_rate": 0.0003445288237343632, "loss": 5.1222, "mean_token_accuracy": 0.21038362979888917, "num_tokens": 10509994.0, "step": 5105 }, { "entropy": 5.692390060424804, "epoch": 4.534398579671549, "grad_norm": 1.25, "learning_rate": 0.00034420112920098247, "loss": 5.1689, "mean_token_accuracy": 0.20680999457836152, "num_tokens": 10520386.0, "step": 5110 }, { "entropy": 5.761635255813599, "epoch": 4.5388371060807815, "grad_norm": 1.1640625, "learning_rate": 0.0003438732724648831, "loss": 5.3269, "mean_token_accuracy": 0.19650017619132995, "num_tokens": 10530802.0, "step": 5115 }, { "entropy": 5.7955528736114506, "epoch": 4.543275632490014, "grad_norm": 1.1640625, "learning_rate": 0.00034354525429453894, "loss": 5.1972, "mean_token_accuracy": 0.2062854290008545, "num_tokens": 10540581.0, "step": 5120 }, { "entropy": 5.708793306350708, "epoch": 4.547714158899246, "grad_norm": 1.1484375, "learning_rate": 0.00034321707545880223, "loss": 5.1542, "mean_token_accuracy": 0.21162179708480836, "num_tokens": 10550908.0, "step": 5125 }, { "entropy": 5.64053750038147, "epoch": 4.552152685308478, "grad_norm": 1.1015625, "learning_rate": 0.00034288873672690167, "loss": 5.1124, "mean_token_accuracy": 0.21572550535202026, "num_tokens": 10561710.0, "step": 5130 }, { "entropy": 5.748101234436035, "epoch": 4.55659121171771, "grad_norm": 1.28125, "learning_rate": 0.00034256023886844076, "loss": 5.1799, "mean_token_accuracy": 0.20977407246828078, "num_tokens": 10571469.0, "step": 5135 }, { "entropy": 5.795603084564209, "epoch": 4.561029738126942, "grad_norm": 1.1875, "learning_rate": 0.00034223158265339615, "loss": 5.1568, "mean_token_accuracy": 0.2124243423342705, "num_tokens": 10580968.0, "step": 5140 }, { "entropy": 5.732140684127808, "epoch": 4.5654682645361735, "grad_norm": 1.2265625, "learning_rate": 0.00034190276885211554, "loss": 5.1957, "mean_token_accuracy": 0.20838963836431504, "num_tokens": 10590848.0, "step": 5145 }, { "entropy": 5.73495044708252, "epoch": 4.5699067909454065, "grad_norm": 1.3203125, "learning_rate": 0.0003415737982353159, "loss": 5.1829, "mean_token_accuracy": 0.202427276968956, "num_tokens": 10600341.0, "step": 5150 }, { "entropy": 5.7257547855377195, "epoch": 4.574345317354638, "grad_norm": 1.2578125, "learning_rate": 0.000341244671574082, "loss": 5.1245, "mean_token_accuracy": 0.21159932017326355, "num_tokens": 10611733.0, "step": 5155 }, { "entropy": 5.703883457183838, "epoch": 4.578783843763871, "grad_norm": 1.2578125, "learning_rate": 0.0003409153896398641, "loss": 5.1376, "mean_token_accuracy": 0.20912213623523712, "num_tokens": 10621570.0, "step": 5160 }, { "entropy": 5.7086564064025875, "epoch": 4.583222370173102, "grad_norm": 1.203125, "learning_rate": 0.00034058595320447685, "loss": 5.1727, "mean_token_accuracy": 0.20659724175930022, "num_tokens": 10632438.0, "step": 5165 }, { "entropy": 5.724616813659668, "epoch": 4.587660896582335, "grad_norm": 1.234375, "learning_rate": 0.00034025636304009646, "loss": 5.0619, "mean_token_accuracy": 0.21662326902151108, "num_tokens": 10641738.0, "step": 5170 }, { "entropy": 5.72975525856018, "epoch": 4.592099422991566, "grad_norm": 1.078125, "learning_rate": 0.0003399266199192597, "loss": 5.2308, "mean_token_accuracy": 0.20958700329065322, "num_tokens": 10652854.0, "step": 5175 }, { "entropy": 5.65272216796875, "epoch": 4.596537949400799, "grad_norm": 1.203125, "learning_rate": 0.0003395967246148622, "loss": 5.1518, "mean_token_accuracy": 0.2112141489982605, "num_tokens": 10663401.0, "step": 5180 }, { "entropy": 5.7544811248779295, "epoch": 4.600976475810031, "grad_norm": 1.1328125, "learning_rate": 0.00033926667790015584, "loss": 5.2547, "mean_token_accuracy": 0.20084319710731507, "num_tokens": 10675126.0, "step": 5185 }, { "entropy": 5.77255654335022, "epoch": 4.605415002219264, "grad_norm": 1.3203125, "learning_rate": 0.0003389364805487476, "loss": 5.2229, "mean_token_accuracy": 0.20229778736829757, "num_tokens": 10685212.0, "step": 5190 }, { "entropy": 5.691144752502441, "epoch": 4.609853528628495, "grad_norm": 1.1953125, "learning_rate": 0.00033860613333459757, "loss": 5.1348, "mean_token_accuracy": 0.2177197515964508, "num_tokens": 10695467.0, "step": 5195 }, { "entropy": 5.67885947227478, "epoch": 4.614292055037727, "grad_norm": 1.2265625, "learning_rate": 0.0003382756370320169, "loss": 5.1713, "mean_token_accuracy": 0.20744576752185823, "num_tokens": 10706089.0, "step": 5200 }, { "entropy": 5.803925657272339, "epoch": 4.618730581446959, "grad_norm": 1.125, "learning_rate": 0.0003379449924156664, "loss": 5.1694, "mean_token_accuracy": 0.20873753428459169, "num_tokens": 10716593.0, "step": 5205 }, { "entropy": 5.753027248382568, "epoch": 4.623169107856191, "grad_norm": 1.1875, "learning_rate": 0.0003376142002605547, "loss": 5.1973, "mean_token_accuracy": 0.20896549969911576, "num_tokens": 10727642.0, "step": 5210 }, { "entropy": 5.683163452148437, "epoch": 4.6276076342654235, "grad_norm": 1.2265625, "learning_rate": 0.0003372832613420356, "loss": 5.0631, "mean_token_accuracy": 0.21866176128387452, "num_tokens": 10737135.0, "step": 5215 }, { "entropy": 5.693540334701538, "epoch": 4.632046160674656, "grad_norm": 1.109375, "learning_rate": 0.0003369521764358075, "loss": 5.2051, "mean_token_accuracy": 0.20459542274475098, "num_tokens": 10747527.0, "step": 5220 }, { "entropy": 5.647522068023681, "epoch": 4.636484687083888, "grad_norm": 1.171875, "learning_rate": 0.0003366209463179109, "loss": 5.072, "mean_token_accuracy": 0.21823544502258302, "num_tokens": 10757082.0, "step": 5225 }, { "entropy": 5.7527947425842285, "epoch": 4.64092321349312, "grad_norm": 1.2265625, "learning_rate": 0.0003362895717647265, "loss": 5.2071, "mean_token_accuracy": 0.20612578988075256, "num_tokens": 10768280.0, "step": 5230 }, { "entropy": 5.79077115058899, "epoch": 4.645361739902352, "grad_norm": 1.1328125, "learning_rate": 0.0003359580535529735, "loss": 5.1666, "mean_token_accuracy": 0.20676536858081818, "num_tokens": 10778276.0, "step": 5235 }, { "entropy": 5.723053407669068, "epoch": 4.649800266311584, "grad_norm": 1.296875, "learning_rate": 0.00033562639245970807, "loss": 5.1456, "mean_token_accuracy": 0.206996351480484, "num_tokens": 10788004.0, "step": 5240 }, { "entropy": 5.712559366226197, "epoch": 4.654238792720816, "grad_norm": 1.203125, "learning_rate": 0.00033529458926232105, "loss": 5.2224, "mean_token_accuracy": 0.2089390218257904, "num_tokens": 10797918.0, "step": 5245 }, { "entropy": 5.691585636138916, "epoch": 4.658677319130049, "grad_norm": 1.15625, "learning_rate": 0.0003349626447385366, "loss": 5.157, "mean_token_accuracy": 0.2116892606019974, "num_tokens": 10808545.0, "step": 5250 }, { "entropy": 5.678885221481323, "epoch": 4.663115845539281, "grad_norm": 1.1875, "learning_rate": 0.0003346305596664099, "loss": 5.2123, "mean_token_accuracy": 0.20954641252756118, "num_tokens": 10818941.0, "step": 5255 }, { "entropy": 5.76534628868103, "epoch": 4.667554371948513, "grad_norm": 1.2578125, "learning_rate": 0.00033429833482432567, "loss": 5.2666, "mean_token_accuracy": 0.2046421304345131, "num_tokens": 10829980.0, "step": 5260 }, { "entropy": 5.735799407958984, "epoch": 4.671992898357745, "grad_norm": 1.1171875, "learning_rate": 0.00033396597099099624, "loss": 5.1517, "mean_token_accuracy": 0.212375408411026, "num_tokens": 10840512.0, "step": 5265 }, { "entropy": 5.748387145996094, "epoch": 4.676431424766977, "grad_norm": 1.2109375, "learning_rate": 0.00033363346894545984, "loss": 5.1999, "mean_token_accuracy": 0.2036992847919464, "num_tokens": 10850837.0, "step": 5270 }, { "entropy": 5.699161005020142, "epoch": 4.680869951176209, "grad_norm": 1.140625, "learning_rate": 0.00033330082946707827, "loss": 5.1828, "mean_token_accuracy": 0.21137236356735228, "num_tokens": 10862036.0, "step": 5275 }, { "entropy": 5.781758213043213, "epoch": 4.6853084775854414, "grad_norm": 1.2890625, "learning_rate": 0.000332968053335536, "loss": 5.1708, "mean_token_accuracy": 0.211983323097229, "num_tokens": 10870900.0, "step": 5280 }, { "entropy": 5.730520582199096, "epoch": 4.689747003994674, "grad_norm": 1.1640625, "learning_rate": 0.00033263514133083757, "loss": 5.2581, "mean_token_accuracy": 0.20092154294252396, "num_tokens": 10880989.0, "step": 5285 }, { "entropy": 5.704589605331421, "epoch": 4.694185530403906, "grad_norm": 1.21875, "learning_rate": 0.00033230209423330587, "loss": 5.178, "mean_token_accuracy": 0.2079184263944626, "num_tokens": 10890759.0, "step": 5290 }, { "entropy": 5.781274271011353, "epoch": 4.698624056813138, "grad_norm": 1.171875, "learning_rate": 0.0003319689128235804, "loss": 5.1725, "mean_token_accuracy": 0.20617727935314178, "num_tokens": 10900700.0, "step": 5295 }, { "entropy": 5.6957298755645756, "epoch": 4.70306258322237, "grad_norm": 1.2578125, "learning_rate": 0.00033163559788261575, "loss": 5.1661, "mean_token_accuracy": 0.20840034782886505, "num_tokens": 10910378.0, "step": 5300 }, { "entropy": 5.7365562915802, "epoch": 4.707501109631602, "grad_norm": 1.421875, "learning_rate": 0.0003313021501916795, "loss": 5.1849, "mean_token_accuracy": 0.20706552118062974, "num_tokens": 10920605.0, "step": 5305 }, { "entropy": 5.672279596328735, "epoch": 4.711939636040834, "grad_norm": 1.1328125, "learning_rate": 0.00033096857053235016, "loss": 5.14, "mean_token_accuracy": 0.21455953121185303, "num_tokens": 10931063.0, "step": 5310 }, { "entropy": 5.710047006607056, "epoch": 4.7163781624500665, "grad_norm": 1.171875, "learning_rate": 0.00033063485968651545, "loss": 5.1996, "mean_token_accuracy": 0.21062558740377427, "num_tokens": 10941418.0, "step": 5315 }, { "entropy": 5.646402835845947, "epoch": 4.720816688859299, "grad_norm": 1.09375, "learning_rate": 0.0003303010184363711, "loss": 5.1237, "mean_token_accuracy": 0.21142874658107758, "num_tokens": 10951664.0, "step": 5320 }, { "entropy": 5.749710512161255, "epoch": 4.725255215268531, "grad_norm": 1.2578125, "learning_rate": 0.00032996704756441803, "loss": 5.2223, "mean_token_accuracy": 0.20792291164398194, "num_tokens": 10962060.0, "step": 5325 }, { "entropy": 5.758749008178711, "epoch": 4.729693741677763, "grad_norm": 1.1484375, "learning_rate": 0.0003296329478534612, "loss": 5.2622, "mean_token_accuracy": 0.20276703983545302, "num_tokens": 10973630.0, "step": 5330 }, { "entropy": 5.694210529327393, "epoch": 4.734132268086995, "grad_norm": 1.1484375, "learning_rate": 0.0003292987200866075, "loss": 5.2161, "mean_token_accuracy": 0.2052842602133751, "num_tokens": 10984016.0, "step": 5335 }, { "entropy": 5.766045379638672, "epoch": 4.738570794496227, "grad_norm": 1.3203125, "learning_rate": 0.0003289643650472639, "loss": 5.1933, "mean_token_accuracy": 0.217355939745903, "num_tokens": 10994531.0, "step": 5340 }, { "entropy": 5.7393327236175535, "epoch": 4.743009320905459, "grad_norm": 1.328125, "learning_rate": 0.0003286298835191358, "loss": 5.1673, "mean_token_accuracy": 0.2125002473592758, "num_tokens": 11004498.0, "step": 5345 }, { "entropy": 5.7455676078796385, "epoch": 4.7474478473146915, "grad_norm": 1.2734375, "learning_rate": 0.00032829527628622517, "loss": 5.1947, "mean_token_accuracy": 0.20545327067375183, "num_tokens": 11014460.0, "step": 5350 }, { "entropy": 5.711310625076294, "epoch": 4.751886373723924, "grad_norm": 1.1796875, "learning_rate": 0.00032796054413282834, "loss": 5.1853, "mean_token_accuracy": 0.2101360887289047, "num_tokens": 11024488.0, "step": 5355 }, { "entropy": 5.7556007385253904, "epoch": 4.756324900133156, "grad_norm": 1.1953125, "learning_rate": 0.0003276256878435347, "loss": 5.2054, "mean_token_accuracy": 0.21297023296356202, "num_tokens": 11033652.0, "step": 5360 }, { "entropy": 5.807051658630371, "epoch": 4.760763426542388, "grad_norm": 1.265625, "learning_rate": 0.0003272907082032244, "loss": 5.2588, "mean_token_accuracy": 0.20238023847341538, "num_tokens": 11044587.0, "step": 5365 }, { "entropy": 5.66930661201477, "epoch": 4.76520195295162, "grad_norm": 1.2734375, "learning_rate": 0.00032695560599706706, "loss": 5.1097, "mean_token_accuracy": 0.21576271057128907, "num_tokens": 11053836.0, "step": 5370 }, { "entropy": 5.657267951965332, "epoch": 4.769640479360852, "grad_norm": 1.1328125, "learning_rate": 0.00032662038201051915, "loss": 5.1985, "mean_token_accuracy": 0.2085062623023987, "num_tokens": 11064250.0, "step": 5375 }, { "entropy": 5.730874490737915, "epoch": 4.774079005770084, "grad_norm": 1.2734375, "learning_rate": 0.00032628503702932275, "loss": 5.2485, "mean_token_accuracy": 0.2009250283241272, "num_tokens": 11074516.0, "step": 5380 }, { "entropy": 5.77521390914917, "epoch": 4.7785175321793165, "grad_norm": 1.28125, "learning_rate": 0.0003259495718395038, "loss": 5.1925, "mean_token_accuracy": 0.21358498334884643, "num_tokens": 11084519.0, "step": 5385 }, { "entropy": 5.704379510879517, "epoch": 4.782956058588549, "grad_norm": 1.2734375, "learning_rate": 0.0003256139872273696, "loss": 5.2315, "mean_token_accuracy": 0.20225883275270462, "num_tokens": 11094492.0, "step": 5390 }, { "entropy": 5.678598880767822, "epoch": 4.787394584997781, "grad_norm": 1.234375, "learning_rate": 0.00032527828397950763, "loss": 5.1649, "mean_token_accuracy": 0.2148972600698471, "num_tokens": 11104196.0, "step": 5395 }, { "entropy": 5.673313236236572, "epoch": 4.791833111407013, "grad_norm": 1.25, "learning_rate": 0.0003249424628827834, "loss": 5.071, "mean_token_accuracy": 0.2209952265024185, "num_tokens": 11114436.0, "step": 5400 }, { "entropy": 5.779289436340332, "epoch": 4.796271637816245, "grad_norm": 1.2265625, "learning_rate": 0.00032460652472433854, "loss": 5.2209, "mean_token_accuracy": 0.20202610343694688, "num_tokens": 11123866.0, "step": 5405 }, { "entropy": 5.7611284255981445, "epoch": 4.800710164225477, "grad_norm": 1.1796875, "learning_rate": 0.00032427047029158924, "loss": 5.2148, "mean_token_accuracy": 0.21345822662115096, "num_tokens": 11134817.0, "step": 5410 }, { "entropy": 5.715837097167968, "epoch": 4.805148690634709, "grad_norm": 1.1640625, "learning_rate": 0.0003239343003722239, "loss": 5.1417, "mean_token_accuracy": 0.2122260719537735, "num_tokens": 11145252.0, "step": 5415 }, { "entropy": 5.738485956192017, "epoch": 4.8095872170439415, "grad_norm": 1.15625, "learning_rate": 0.000323598015754202, "loss": 5.2536, "mean_token_accuracy": 0.20232891887426377, "num_tokens": 11154957.0, "step": 5420 }, { "entropy": 5.721615982055664, "epoch": 4.814025743453174, "grad_norm": 1.1328125, "learning_rate": 0.0003232616172257518, "loss": 5.1721, "mean_token_accuracy": 0.21200567334890366, "num_tokens": 11166565.0, "step": 5425 }, { "entropy": 5.751074361801147, "epoch": 4.818464269862406, "grad_norm": 1.1640625, "learning_rate": 0.00032292510557536844, "loss": 5.2772, "mean_token_accuracy": 0.20485566854476928, "num_tokens": 11176922.0, "step": 5430 }, { "entropy": 5.765995121002197, "epoch": 4.822902796271638, "grad_norm": 1.21875, "learning_rate": 0.000322588481591812, "loss": 5.1212, "mean_token_accuracy": 0.21359312385320664, "num_tokens": 11187526.0, "step": 5435 }, { "entropy": 5.726685285568237, "epoch": 4.82734132268087, "grad_norm": 1.109375, "learning_rate": 0.00032225174606410634, "loss": 5.1969, "mean_token_accuracy": 0.20894990414381026, "num_tokens": 11199138.0, "step": 5440 }, { "entropy": 5.756986904144287, "epoch": 4.831779849090102, "grad_norm": 1.21875, "learning_rate": 0.00032191489978153646, "loss": 5.2013, "mean_token_accuracy": 0.20594589412212372, "num_tokens": 11209158.0, "step": 5445 }, { "entropy": 5.692794561386108, "epoch": 4.836218375499334, "grad_norm": 1.1953125, "learning_rate": 0.0003215779435336471, "loss": 5.11, "mean_token_accuracy": 0.22132737040519715, "num_tokens": 11218202.0, "step": 5450 }, { "entropy": 5.732383728027344, "epoch": 4.840656901908567, "grad_norm": 1.140625, "learning_rate": 0.0003212408781102404, "loss": 5.1896, "mean_token_accuracy": 0.20523899495601655, "num_tokens": 11227885.0, "step": 5455 }, { "entropy": 5.655904531478882, "epoch": 4.845095428317799, "grad_norm": 1.09375, "learning_rate": 0.0003209037043013751, "loss": 5.2079, "mean_token_accuracy": 0.20618089586496352, "num_tokens": 11237686.0, "step": 5460 }, { "entropy": 5.712638187408447, "epoch": 4.849533954727031, "grad_norm": 1.03125, "learning_rate": 0.0003205664228973632, "loss": 5.1826, "mean_token_accuracy": 0.20865253657102584, "num_tokens": 11248287.0, "step": 5465 }, { "entropy": 5.777940988540649, "epoch": 4.853972481136263, "grad_norm": 1.0625, "learning_rate": 0.0003202290346887696, "loss": 5.1814, "mean_token_accuracy": 0.20437095165252686, "num_tokens": 11258376.0, "step": 5470 }, { "entropy": 5.766065216064453, "epoch": 4.858411007545495, "grad_norm": 1.1953125, "learning_rate": 0.0003198915404664088, "loss": 5.2219, "mean_token_accuracy": 0.19672314822673798, "num_tokens": 11268966.0, "step": 5475 }, { "entropy": 5.700806474685669, "epoch": 4.862849533954727, "grad_norm": 1.2734375, "learning_rate": 0.00031955394102134454, "loss": 5.2355, "mean_token_accuracy": 0.2040538489818573, "num_tokens": 11279836.0, "step": 5480 }, { "entropy": 5.7688816547393795, "epoch": 4.8672880603639594, "grad_norm": 1.203125, "learning_rate": 0.0003192162371448868, "loss": 5.2809, "mean_token_accuracy": 0.20273662358522415, "num_tokens": 11290009.0, "step": 5485 }, { "entropy": 5.706856298446655, "epoch": 4.871726586773192, "grad_norm": 1.15625, "learning_rate": 0.00031887842962859033, "loss": 5.1465, "mean_token_accuracy": 0.2068696990609169, "num_tokens": 11300460.0, "step": 5490 }, { "entropy": 5.7477126121521, "epoch": 4.876165113182424, "grad_norm": 1.171875, "learning_rate": 0.00031854051926425277, "loss": 5.2111, "mean_token_accuracy": 0.20210069715976714, "num_tokens": 11309995.0, "step": 5495 }, { "entropy": 5.722295808792114, "epoch": 4.880603639591656, "grad_norm": 1.2890625, "learning_rate": 0.00031820250684391304, "loss": 5.1839, "mean_token_accuracy": 0.21283525675535203, "num_tokens": 11319682.0, "step": 5500 }, { "epoch": 4.880603639591656, "eval_entropy": 5.523329989643957, "eval_loss": 5.800832271575928, "eval_mean_token_accuracy": 0.17711487331044928, "eval_num_tokens": 11319682.0, "eval_runtime": 2.2641, "eval_samples_per_second": 1487.117, "eval_steps_per_second": 185.945, "step": 5500 }, { "entropy": 5.73695330619812, "epoch": 4.885042166000888, "grad_norm": 1.171875, "learning_rate": 0.00031786439315984925, "loss": 5.2303, "mean_token_accuracy": 0.20797490924596787, "num_tokens": 11330186.0, "step": 5505 }, { "entropy": 5.770789432525635, "epoch": 4.88948069241012, "grad_norm": 1.265625, "learning_rate": 0.00031752617900457656, "loss": 5.2255, "mean_token_accuracy": 0.21493835896253585, "num_tokens": 11340284.0, "step": 5510 }, { "entropy": 5.741439962387085, "epoch": 4.893919218819352, "grad_norm": 1.2109375, "learning_rate": 0.000317187865170846, "loss": 5.2033, "mean_token_accuracy": 0.2078318029642105, "num_tokens": 11351098.0, "step": 5515 }, { "entropy": 5.707396221160889, "epoch": 4.8983577452285845, "grad_norm": 1.125, "learning_rate": 0.000316849452451642, "loss": 5.2368, "mean_token_accuracy": 0.20806288421154023, "num_tokens": 11361783.0, "step": 5520 }, { "entropy": 5.690252161026001, "epoch": 4.902796271637817, "grad_norm": 1.15625, "learning_rate": 0.00031651094164018097, "loss": 5.1346, "mean_token_accuracy": 0.21844119280576707, "num_tokens": 11372840.0, "step": 5525 }, { "entropy": 5.7909657001495365, "epoch": 4.907234798047049, "grad_norm": 1.1015625, "learning_rate": 0.0003161723335299089, "loss": 5.1128, "mean_token_accuracy": 0.2176864340901375, "num_tokens": 11382785.0, "step": 5530 }, { "entropy": 5.6382709503173825, "epoch": 4.911673324456281, "grad_norm": 1.1484375, "learning_rate": 0.0003158336289145003, "loss": 5.1838, "mean_token_accuracy": 0.21205998063087464, "num_tokens": 11392714.0, "step": 5535 }, { "entropy": 5.741606950759888, "epoch": 4.916111850865512, "grad_norm": 1.171875, "learning_rate": 0.00031549482858785554, "loss": 5.2685, "mean_token_accuracy": 0.19965731650590895, "num_tokens": 11404755.0, "step": 5540 }, { "entropy": 5.803937005996704, "epoch": 4.920550377274745, "grad_norm": 1.25, "learning_rate": 0.00031515593334409934, "loss": 5.2045, "mean_token_accuracy": 0.20873982608318328, "num_tokens": 11414938.0, "step": 5545 }, { "entropy": 5.686682176589966, "epoch": 4.9249889036839765, "grad_norm": 1.1015625, "learning_rate": 0.0003148169439775792, "loss": 5.1479, "mean_token_accuracy": 0.21138025522232057, "num_tokens": 11424962.0, "step": 5550 }, { "entropy": 5.696095275878906, "epoch": 4.9294274300932095, "grad_norm": 0.98828125, "learning_rate": 0.00031447786128286286, "loss": 5.1778, "mean_token_accuracy": 0.21060777753591536, "num_tokens": 11436416.0, "step": 5555 }, { "entropy": 5.765445613861084, "epoch": 4.933865956502441, "grad_norm": 1.1796875, "learning_rate": 0.0003141386860547371, "loss": 5.2256, "mean_token_accuracy": 0.20483573526144028, "num_tokens": 11446820.0, "step": 5560 }, { "entropy": 5.775624513626099, "epoch": 4.938304482911674, "grad_norm": 1.1171875, "learning_rate": 0.0003137994190882054, "loss": 5.1784, "mean_token_accuracy": 0.2152741551399231, "num_tokens": 11456880.0, "step": 5565 }, { "entropy": 5.679759883880616, "epoch": 4.942743009320905, "grad_norm": 1.28125, "learning_rate": 0.0003134600611784865, "loss": 5.1812, "mean_token_accuracy": 0.20349172353744507, "num_tokens": 11465758.0, "step": 5570 }, { "entropy": 5.664295959472656, "epoch": 4.947181535730138, "grad_norm": 1.1640625, "learning_rate": 0.0003131206131210119, "loss": 5.0953, "mean_token_accuracy": 0.21441334635019302, "num_tokens": 11476209.0, "step": 5575 }, { "entropy": 5.703896141052246, "epoch": 4.951620062139369, "grad_norm": 1.1796875, "learning_rate": 0.0003127810757114249, "loss": 5.1239, "mean_token_accuracy": 0.21405192017555236, "num_tokens": 11486510.0, "step": 5580 }, { "entropy": 5.755063581466675, "epoch": 4.9560585885486015, "grad_norm": 1.203125, "learning_rate": 0.00031244144974557775, "loss": 5.1462, "mean_token_accuracy": 0.2157666265964508, "num_tokens": 11496910.0, "step": 5585 }, { "entropy": 5.703655195236206, "epoch": 4.960497114957834, "grad_norm": 1.0703125, "learning_rate": 0.0003121017360195308, "loss": 5.1891, "mean_token_accuracy": 0.20666308254003524, "num_tokens": 11507488.0, "step": 5590 }, { "entropy": 5.749307441711426, "epoch": 4.964935641367066, "grad_norm": 1.1015625, "learning_rate": 0.00031176193532954957, "loss": 5.2232, "mean_token_accuracy": 0.20651409029960632, "num_tokens": 11518398.0, "step": 5595 }, { "entropy": 5.7297381401062015, "epoch": 4.969374167776298, "grad_norm": 1.171875, "learning_rate": 0.0003114220484721038, "loss": 5.1564, "mean_token_accuracy": 0.20705897808074952, "num_tokens": 11528470.0, "step": 5600 }, { "entropy": 5.670311784744262, "epoch": 4.97381269418553, "grad_norm": 1.203125, "learning_rate": 0.00031108207624386486, "loss": 5.1299, "mean_token_accuracy": 0.2155166521668434, "num_tokens": 11537765.0, "step": 5605 }, { "entropy": 5.7339622497558596, "epoch": 4.978251220594762, "grad_norm": 1.1953125, "learning_rate": 0.0003107420194417047, "loss": 5.249, "mean_token_accuracy": 0.2012795925140381, "num_tokens": 11549065.0, "step": 5610 }, { "entropy": 5.769830179214478, "epoch": 4.982689747003994, "grad_norm": 1.0859375, "learning_rate": 0.000310401878862693, "loss": 5.2641, "mean_token_accuracy": 0.20485369861125946, "num_tokens": 11559010.0, "step": 5615 }, { "entropy": 5.698846435546875, "epoch": 4.9871282734132265, "grad_norm": 1.2109375, "learning_rate": 0.0003100616553040962, "loss": 5.1158, "mean_token_accuracy": 0.21705816090106964, "num_tokens": 11567978.0, "step": 5620 }, { "entropy": 5.703730916976928, "epoch": 4.991566799822459, "grad_norm": 1.2109375, "learning_rate": 0.00030972134956337493, "loss": 5.1565, "mean_token_accuracy": 0.20373631715774537, "num_tokens": 11579433.0, "step": 5625 }, { "entropy": 5.69541335105896, "epoch": 4.996005326231691, "grad_norm": 1.171875, "learning_rate": 0.00030938096243818275, "loss": 5.1387, "mean_token_accuracy": 0.21119639426469802, "num_tokens": 11589882.0, "step": 5630 }, { "entropy": 5.7001016404893665, "epoch": 5.0, "grad_norm": 2.296875, "learning_rate": 0.00030904049472636367, "loss": 5.1901, "mean_token_accuracy": 0.21247350341743892, "num_tokens": 11598630.0, "step": 5635 }, { "entropy": 5.739415073394776, "epoch": 5.004438526409232, "grad_norm": 1.1875, "learning_rate": 0.00030869994722595095, "loss": 5.008, "mean_token_accuracy": 0.22126824110746385, "num_tokens": 11608797.0, "step": 5640 }, { "entropy": 5.663621139526367, "epoch": 5.008877052818464, "grad_norm": 1.1796875, "learning_rate": 0.0003083593207351644, "loss": 5.0175, "mean_token_accuracy": 0.22501287162303923, "num_tokens": 11619095.0, "step": 5645 }, { "entropy": 5.700268888473511, "epoch": 5.013315579227696, "grad_norm": 1.234375, "learning_rate": 0.0003080186160524095, "loss": 5.0311, "mean_token_accuracy": 0.22601672559976577, "num_tokens": 11629770.0, "step": 5650 }, { "entropy": 5.718568563461304, "epoch": 5.017754105636929, "grad_norm": 1.2421875, "learning_rate": 0.0003076778339762745, "loss": 4.948, "mean_token_accuracy": 0.23284862637519838, "num_tokens": 11640785.0, "step": 5655 }, { "entropy": 5.695920658111572, "epoch": 5.022192632046161, "grad_norm": 1.1640625, "learning_rate": 0.00030733697530552955, "loss": 4.9336, "mean_token_accuracy": 0.22667457312345504, "num_tokens": 11651995.0, "step": 5660 }, { "entropy": 5.738033103942871, "epoch": 5.026631158455393, "grad_norm": 1.2109375, "learning_rate": 0.0003069960408391239, "loss": 5.0168, "mean_token_accuracy": 0.21783950328826904, "num_tokens": 11662821.0, "step": 5665 }, { "entropy": 5.666689348220825, "epoch": 5.031069684864625, "grad_norm": 1.21875, "learning_rate": 0.00030665503137618466, "loss": 4.8584, "mean_token_accuracy": 0.2404223471879959, "num_tokens": 11672423.0, "step": 5670 }, { "entropy": 5.6299999237060545, "epoch": 5.035508211273857, "grad_norm": 1.1484375, "learning_rate": 0.0003063139477160147, "loss": 4.918, "mean_token_accuracy": 0.23635224550962447, "num_tokens": 11683010.0, "step": 5675 }, { "entropy": 5.682493114471436, "epoch": 5.039946737683089, "grad_norm": 1.1953125, "learning_rate": 0.00030597279065809103, "loss": 4.9942, "mean_token_accuracy": 0.22202890664339064, "num_tokens": 11693887.0, "step": 5680 }, { "entropy": 5.711723518371582, "epoch": 5.0443852640923215, "grad_norm": 1.0234375, "learning_rate": 0.0003056315610020622, "loss": 5.0131, "mean_token_accuracy": 0.22168050855398178, "num_tokens": 11705152.0, "step": 5685 }, { "entropy": 5.658341979980468, "epoch": 5.048823790501554, "grad_norm": 1.3359375, "learning_rate": 0.0003052902595477474, "loss": 4.9349, "mean_token_accuracy": 0.22618422508239747, "num_tokens": 11714953.0, "step": 5690 }, { "entropy": 5.796881008148193, "epoch": 5.053262316910786, "grad_norm": 1.3671875, "learning_rate": 0.00030494888709513377, "loss": 5.048, "mean_token_accuracy": 0.2163314253091812, "num_tokens": 11725273.0, "step": 5695 }, { "entropy": 5.722124481201172, "epoch": 5.057700843320018, "grad_norm": 1.15625, "learning_rate": 0.0003046074444443751, "loss": 5.0219, "mean_token_accuracy": 0.21710677593946456, "num_tokens": 11735757.0, "step": 5700 }, { "entropy": 5.642864036560058, "epoch": 5.06213936972925, "grad_norm": 1.328125, "learning_rate": 0.00030426593239578966, "loss": 5.0246, "mean_token_accuracy": 0.22806545048952104, "num_tokens": 11746190.0, "step": 5705 }, { "entropy": 5.654903078079224, "epoch": 5.066577896138482, "grad_norm": 1.2578125, "learning_rate": 0.0003039243517498583, "loss": 4.9854, "mean_token_accuracy": 0.2298506259918213, "num_tokens": 11756692.0, "step": 5710 }, { "entropy": 5.702650833129883, "epoch": 5.071016422547714, "grad_norm": 1.1875, "learning_rate": 0.0003035827033072228, "loss": 4.9319, "mean_token_accuracy": 0.22459085732698442, "num_tokens": 11768071.0, "step": 5715 }, { "entropy": 5.720613718032837, "epoch": 5.0754549489569465, "grad_norm": 1.1640625, "learning_rate": 0.00030324098786868364, "loss": 5.0182, "mean_token_accuracy": 0.22162954807281493, "num_tokens": 11778685.0, "step": 5720 }, { "entropy": 5.6652062892913815, "epoch": 5.079893475366179, "grad_norm": 1.1640625, "learning_rate": 0.00030289920623519854, "loss": 4.9676, "mean_token_accuracy": 0.2229399025440216, "num_tokens": 11788078.0, "step": 5725 }, { "entropy": 5.676460599899292, "epoch": 5.084332001775411, "grad_norm": 1.3359375, "learning_rate": 0.0003025573592078803, "loss": 4.9833, "mean_token_accuracy": 0.22160238772630692, "num_tokens": 11796440.0, "step": 5730 }, { "entropy": 5.745248508453369, "epoch": 5.088770528184643, "grad_norm": 1.3359375, "learning_rate": 0.000302215447587995, "loss": 5.0358, "mean_token_accuracy": 0.21714013665914536, "num_tokens": 11806263.0, "step": 5735 }, { "entropy": 5.646965360641479, "epoch": 5.093209054593875, "grad_norm": 1.1875, "learning_rate": 0.00030187347217696005, "loss": 4.9496, "mean_token_accuracy": 0.22523796260356904, "num_tokens": 11816368.0, "step": 5740 }, { "entropy": 5.5966925621032715, "epoch": 5.097647581003107, "grad_norm": 1.125, "learning_rate": 0.00030153143377634244, "loss": 4.9276, "mean_token_accuracy": 0.22945380359888076, "num_tokens": 11826319.0, "step": 5745 }, { "entropy": 5.676280736923218, "epoch": 5.102086107412339, "grad_norm": 1.1171875, "learning_rate": 0.0003011893331878569, "loss": 4.9664, "mean_token_accuracy": 0.23140579015016555, "num_tokens": 11835971.0, "step": 5750 }, { "entropy": 5.701886701583862, "epoch": 5.1065246338215715, "grad_norm": 1.28125, "learning_rate": 0.00030084717121336383, "loss": 4.9618, "mean_token_accuracy": 0.22556509524583818, "num_tokens": 11845506.0, "step": 5755 }, { "entropy": 5.715242481231689, "epoch": 5.110963160230804, "grad_norm": 1.125, "learning_rate": 0.00030050494865486744, "loss": 5.0605, "mean_token_accuracy": 0.2205240473151207, "num_tokens": 11856083.0, "step": 5760 }, { "entropy": 5.595279550552368, "epoch": 5.115401686640036, "grad_norm": 1.265625, "learning_rate": 0.0003001626663145141, "loss": 4.9238, "mean_token_accuracy": 0.23146225064992904, "num_tokens": 11867061.0, "step": 5765 }, { "entropy": 5.720956182479858, "epoch": 5.119840213049268, "grad_norm": 1.25, "learning_rate": 0.00029982032499459017, "loss": 5.0122, "mean_token_accuracy": 0.22077643722295762, "num_tokens": 11877751.0, "step": 5770 }, { "entropy": 5.651248216629028, "epoch": 5.1242787394585, "grad_norm": 1.21875, "learning_rate": 0.00029947792549752034, "loss": 4.9893, "mean_token_accuracy": 0.22719825357198714, "num_tokens": 11887649.0, "step": 5775 }, { "entropy": 5.659734487533569, "epoch": 5.128717265867732, "grad_norm": 1.109375, "learning_rate": 0.00029913546862586567, "loss": 5.0319, "mean_token_accuracy": 0.223132161796093, "num_tokens": 11898833.0, "step": 5780 }, { "entropy": 5.735756158828735, "epoch": 5.133155792276964, "grad_norm": 1.1640625, "learning_rate": 0.0002987929551823215, "loss": 5.0595, "mean_token_accuracy": 0.22174521237611772, "num_tokens": 11910341.0, "step": 5785 }, { "entropy": 5.6615043640136715, "epoch": 5.1375943186861965, "grad_norm": 1.28125, "learning_rate": 0.0002984503859697162, "loss": 4.9508, "mean_token_accuracy": 0.23014761209487916, "num_tokens": 11919393.0, "step": 5790 }, { "entropy": 5.6714434146881105, "epoch": 5.142032845095429, "grad_norm": 1.3203125, "learning_rate": 0.0002981077617910085, "loss": 4.9194, "mean_token_accuracy": 0.23738617449998856, "num_tokens": 11930765.0, "step": 5795 }, { "entropy": 5.629246377944947, "epoch": 5.146471371504661, "grad_norm": 1.2265625, "learning_rate": 0.00029776508344928597, "loss": 4.9687, "mean_token_accuracy": 0.22703385949134827, "num_tokens": 11940054.0, "step": 5800 }, { "entropy": 5.650801801681519, "epoch": 5.150909897913893, "grad_norm": 1.109375, "learning_rate": 0.0002974223517477633, "loss": 4.9464, "mean_token_accuracy": 0.23225471675395964, "num_tokens": 11950756.0, "step": 5805 }, { "entropy": 5.657662773132325, "epoch": 5.155348424323125, "grad_norm": 1.09375, "learning_rate": 0.0002970795674897802, "loss": 4.9582, "mean_token_accuracy": 0.22137288451194764, "num_tokens": 11961062.0, "step": 5810 }, { "entropy": 5.690600299835205, "epoch": 5.159786950732357, "grad_norm": 1.234375, "learning_rate": 0.0002967367314787995, "loss": 4.9235, "mean_token_accuracy": 0.22654454112052919, "num_tokens": 11970557.0, "step": 5815 }, { "entropy": 5.638317346572876, "epoch": 5.164225477141589, "grad_norm": 1.125, "learning_rate": 0.00029639384451840545, "loss": 4.9384, "mean_token_accuracy": 0.22700047940015794, "num_tokens": 11981331.0, "step": 5820 }, { "entropy": 5.6244978427886965, "epoch": 5.168664003550822, "grad_norm": 1.2265625, "learning_rate": 0.0002960509074123015, "loss": 4.9891, "mean_token_accuracy": 0.21644605994224547, "num_tokens": 11992159.0, "step": 5825 }, { "entropy": 5.716595268249511, "epoch": 5.173102529960053, "grad_norm": 1.234375, "learning_rate": 0.000295707920964309, "loss": 4.9931, "mean_token_accuracy": 0.22334617823362352, "num_tokens": 12002603.0, "step": 5830 }, { "entropy": 5.7139030456542965, "epoch": 5.177541056369286, "grad_norm": 1.2421875, "learning_rate": 0.0002953648859783646, "loss": 5.1011, "mean_token_accuracy": 0.21508881002664565, "num_tokens": 12012623.0, "step": 5835 }, { "entropy": 5.665186405181885, "epoch": 5.181979582778517, "grad_norm": 1.1484375, "learning_rate": 0.0002950218032585191, "loss": 4.9749, "mean_token_accuracy": 0.22413384765386582, "num_tokens": 12023017.0, "step": 5840 }, { "entropy": 5.671549224853516, "epoch": 5.186418109187749, "grad_norm": 1.21875, "learning_rate": 0.0002946786736089346, "loss": 4.9773, "mean_token_accuracy": 0.2214719161391258, "num_tokens": 12033032.0, "step": 5845 }, { "entropy": 5.677174139022827, "epoch": 5.190856635596981, "grad_norm": 1.125, "learning_rate": 0.0002943354978338838, "loss": 5.0024, "mean_token_accuracy": 0.2283272624015808, "num_tokens": 12043609.0, "step": 5850 }, { "entropy": 5.730323934555054, "epoch": 5.1952951620062136, "grad_norm": 1.2578125, "learning_rate": 0.0002939922767377472, "loss": 5.0104, "mean_token_accuracy": 0.22389555275440215, "num_tokens": 12053282.0, "step": 5855 }, { "entropy": 5.7337881565094, "epoch": 5.199733688415446, "grad_norm": 1.1484375, "learning_rate": 0.0002936490111250116, "loss": 5.0561, "mean_token_accuracy": 0.217279052734375, "num_tokens": 12063672.0, "step": 5860 }, { "entropy": 5.663741397857666, "epoch": 5.204172214824678, "grad_norm": 1.3125, "learning_rate": 0.0002933057018002681, "loss": 4.9316, "mean_token_accuracy": 0.22680189162492753, "num_tokens": 12073921.0, "step": 5865 }, { "entropy": 5.718992376327515, "epoch": 5.20861074123391, "grad_norm": 1.1953125, "learning_rate": 0.00029296234956821044, "loss": 4.9402, "mean_token_accuracy": 0.22692192792892457, "num_tokens": 12085149.0, "step": 5870 }, { "entropy": 5.621643352508545, "epoch": 5.213049267643142, "grad_norm": 1.1484375, "learning_rate": 0.0002926189552336326, "loss": 4.9647, "mean_token_accuracy": 0.2331915631890297, "num_tokens": 12096515.0, "step": 5875 }, { "entropy": 5.674287557601929, "epoch": 5.217487794052374, "grad_norm": 1.203125, "learning_rate": 0.0002922755196014277, "loss": 4.9135, "mean_token_accuracy": 0.22644905298948287, "num_tokens": 12106352.0, "step": 5880 }, { "entropy": 5.652184581756591, "epoch": 5.221926320461606, "grad_norm": 1.3125, "learning_rate": 0.000291932043476585, "loss": 4.9627, "mean_token_accuracy": 0.2293543979525566, "num_tokens": 12116344.0, "step": 5885 }, { "entropy": 5.67815523147583, "epoch": 5.226364846870839, "grad_norm": 1.0703125, "learning_rate": 0.0002915885276641895, "loss": 5.1006, "mean_token_accuracy": 0.21285598427057267, "num_tokens": 12127402.0, "step": 5890 }, { "entropy": 5.687961149215698, "epoch": 5.230803373280071, "grad_norm": 1.359375, "learning_rate": 0.00029124497296941843, "loss": 4.9267, "mean_token_accuracy": 0.22959166169166564, "num_tokens": 12138065.0, "step": 5895 }, { "entropy": 5.636407089233399, "epoch": 5.235241899689303, "grad_norm": 1.203125, "learning_rate": 0.00029090138019754075, "loss": 4.9783, "mean_token_accuracy": 0.22571838796138763, "num_tokens": 12148450.0, "step": 5900 }, { "entropy": 5.608906221389771, "epoch": 5.239680426098535, "grad_norm": 1.265625, "learning_rate": 0.0002905577501539144, "loss": 4.9822, "mean_token_accuracy": 0.21735644042491914, "num_tokens": 12158587.0, "step": 5905 }, { "entropy": 5.650953483581543, "epoch": 5.244118952507767, "grad_norm": 1.2734375, "learning_rate": 0.0002902140836439847, "loss": 4.9359, "mean_token_accuracy": 0.22076532393693923, "num_tokens": 12169139.0, "step": 5910 }, { "entropy": 5.664229774475098, "epoch": 5.248557478916999, "grad_norm": 1.3125, "learning_rate": 0.0002898703814732824, "loss": 4.9963, "mean_token_accuracy": 0.22586210668087006, "num_tokens": 12179178.0, "step": 5915 }, { "entropy": 5.747469329833985, "epoch": 5.2529960053262315, "grad_norm": 1.2734375, "learning_rate": 0.00028952664444742204, "loss": 5.0667, "mean_token_accuracy": 0.21449797302484513, "num_tokens": 12189018.0, "step": 5920 }, { "entropy": 5.725044107437133, "epoch": 5.257434531735464, "grad_norm": 1.2734375, "learning_rate": 0.0002891828733720996, "loss": 5.0464, "mean_token_accuracy": 0.22428497821092605, "num_tokens": 12199250.0, "step": 5925 }, { "entropy": 5.674435091018677, "epoch": 5.261873058144696, "grad_norm": 1.359375, "learning_rate": 0.00028883906905309103, "loss": 5.0602, "mean_token_accuracy": 0.21731068789958954, "num_tokens": 12209572.0, "step": 5930 }, { "entropy": 5.678584957122803, "epoch": 5.266311584553928, "grad_norm": 1.265625, "learning_rate": 0.0002884952322962502, "loss": 5.0185, "mean_token_accuracy": 0.22419251948595048, "num_tokens": 12220168.0, "step": 5935 }, { "entropy": 5.725101184844971, "epoch": 5.27075011096316, "grad_norm": 1.3046875, "learning_rate": 0.00028815136390750694, "loss": 4.967, "mean_token_accuracy": 0.2251395106315613, "num_tokens": 12229765.0, "step": 5940 }, { "entropy": 5.604526662826538, "epoch": 5.275188637372392, "grad_norm": 1.3828125, "learning_rate": 0.0002878074646928653, "loss": 4.9616, "mean_token_accuracy": 0.22482145875692366, "num_tokens": 12240087.0, "step": 5945 }, { "entropy": 5.676482009887695, "epoch": 5.279627163781624, "grad_norm": 1.203125, "learning_rate": 0.0002874635354584015, "loss": 4.9899, "mean_token_accuracy": 0.22442464679479598, "num_tokens": 12251489.0, "step": 5950 }, { "entropy": 5.718767786026001, "epoch": 5.2840656901908565, "grad_norm": 1.2890625, "learning_rate": 0.0002871195770102621, "loss": 5.0116, "mean_token_accuracy": 0.22521375119686127, "num_tokens": 12261114.0, "step": 5955 }, { "entropy": 5.649609994888306, "epoch": 5.288504216600089, "grad_norm": 1.3125, "learning_rate": 0.0002867755901546624, "loss": 4.9961, "mean_token_accuracy": 0.21924589872360228, "num_tokens": 12271840.0, "step": 5960 }, { "entropy": 5.661839437484741, "epoch": 5.292942743009321, "grad_norm": 1.25, "learning_rate": 0.00028643157569788386, "loss": 4.9661, "mean_token_accuracy": 0.22587821185588836, "num_tokens": 12281407.0, "step": 5965 }, { "entropy": 5.667834806442261, "epoch": 5.297381269418553, "grad_norm": 1.1640625, "learning_rate": 0.00028608753444627307, "loss": 4.9471, "mean_token_accuracy": 0.23786964565515517, "num_tokens": 12293087.0, "step": 5970 }, { "entropy": 5.657839250564575, "epoch": 5.301819795827785, "grad_norm": 1.1328125, "learning_rate": 0.000285743467206239, "loss": 4.9241, "mean_token_accuracy": 0.23313162177801133, "num_tokens": 12303638.0, "step": 5975 }, { "entropy": 5.723939514160156, "epoch": 5.306258322237017, "grad_norm": 1.1796875, "learning_rate": 0.00028539937478425196, "loss": 5.004, "mean_token_accuracy": 0.22194170355796813, "num_tokens": 12314059.0, "step": 5980 }, { "entropy": 5.626681756973267, "epoch": 5.310696848646249, "grad_norm": 1.265625, "learning_rate": 0.0002850552579868409, "loss": 4.9439, "mean_token_accuracy": 0.23021697402000427, "num_tokens": 12323447.0, "step": 5985 }, { "entropy": 5.587870359420776, "epoch": 5.3151353750554815, "grad_norm": 1.3203125, "learning_rate": 0.0002847111176205922, "loss": 4.9479, "mean_token_accuracy": 0.23014504015445708, "num_tokens": 12333676.0, "step": 5990 }, { "entropy": 5.688661241531372, "epoch": 5.319573901464714, "grad_norm": 1.3125, "learning_rate": 0.0002843669544921473, "loss": 5.0272, "mean_token_accuracy": 0.22250010669231415, "num_tokens": 12344188.0, "step": 5995 }, { "entropy": 5.607497310638427, "epoch": 5.324012427873946, "grad_norm": 1.3515625, "learning_rate": 0.0002840227694082011, "loss": 4.8953, "mean_token_accuracy": 0.2363758459687233, "num_tokens": 12353898.0, "step": 6000 }, { "epoch": 5.324012427873946, "eval_entropy": 5.461305147112124, "eval_loss": 5.801708221435547, "eval_mean_token_accuracy": 0.1778349627579193, "eval_num_tokens": 12353898.0, "eval_runtime": 2.0862, "eval_samples_per_second": 1613.94, "eval_steps_per_second": 201.802, "step": 6000 } ], "logging_steps": 5, "max_steps": 11260, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2779609975511040.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }