{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2621690116228262, "eval_steps": 3000, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.896485424041748, "epoch": 0.0004369483527047103, "grad_norm": 19.125, "learning_rate": 2e-06, "loss": 14.1403, "mean_token_accuracy": 0.0004707288753706962, "num_tokens": 10478.0, "step": 5 }, { "entropy": 4.8918811798095705, "epoch": 0.0008738967054094206, "grad_norm": 19.125, "learning_rate": 4.5e-06, "loss": 14.1677, "mean_token_accuracy": 0.0009102159005124122, "num_tokens": 21152.0, "step": 10 }, { "entropy": 4.9260358810424805, "epoch": 0.0013108450581141308, "grad_norm": 21.25, "learning_rate": 7e-06, "loss": 14.0135, "mean_token_accuracy": 0.00043343613506294785, "num_tokens": 31246.0, "step": 15 }, { "entropy": 5.002536630630493, "epoch": 0.0017477934108188413, "grad_norm": 27.75, "learning_rate": 9.5e-06, "loss": 13.7803, "mean_token_accuracy": 0.00043386173201724886, "num_tokens": 41934.0, "step": 20 }, { "entropy": 5.2952552318573, "epoch": 0.0021847417635235517, "grad_norm": 33.5, "learning_rate": 1.2e-05, "loss": 13.2447, "mean_token_accuracy": 0.00043462926405481996, "num_tokens": 52830.0, "step": 25 }, { "entropy": 6.374371004104614, "epoch": 0.0026216901162282617, "grad_norm": 37.75, "learning_rate": 1.4500000000000002e-05, "loss": 12.2103, "mean_token_accuracy": 0.0001860347867477685, "num_tokens": 62706.0, "step": 30 }, { "entropy": 9.60359296798706, "epoch": 0.003058638468932972, "grad_norm": 3.5625, "learning_rate": 1.7000000000000003e-05, "loss": 10.9691, "mean_token_accuracy": 0.0, "num_tokens": 72619.0, "step": 35 }, { "entropy": 10.6598690032959, "epoch": 0.0034955868216376825, "grad_norm": 3.984375, "learning_rate": 1.95e-05, "loss": 10.6826, "mean_token_accuracy": 0.0027851671096868814, "num_tokens": 82903.0, "step": 40 }, { "entropy": 10.72455415725708, "epoch": 0.003932535174342393, "grad_norm": 3.09375, "learning_rate": 2.2e-05, "loss": 10.5546, "mean_token_accuracy": 0.011984702153131365, "num_tokens": 94243.0, "step": 45 }, { "entropy": 10.698091506958008, "epoch": 0.004369483527047103, "grad_norm": 2.515625, "learning_rate": 2.4500000000000003e-05, "loss": 10.3469, "mean_token_accuracy": 0.017781304474920035, "num_tokens": 103618.0, "step": 50 }, { "entropy": 10.646620655059815, "epoch": 0.004806431879751813, "grad_norm": 2.09375, "learning_rate": 2.7e-05, "loss": 10.1899, "mean_token_accuracy": 0.01909907590597868, "num_tokens": 112180.0, "step": 55 }, { "entropy": 10.682601261138917, "epoch": 0.005243380232456523, "grad_norm": 2.296875, "learning_rate": 2.95e-05, "loss": 10.0898, "mean_token_accuracy": 0.01639490285888314, "num_tokens": 122462.0, "step": 60 }, { "entropy": 10.703626728057861, "epoch": 0.005680328585161234, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.9926, "mean_token_accuracy": 0.029707580246031283, "num_tokens": 132741.0, "step": 65 }, { "entropy": 10.696713733673096, "epoch": 0.006117276937865944, "grad_norm": 2.0625, "learning_rate": 3.4500000000000005e-05, "loss": 9.8566, "mean_token_accuracy": 0.05769682787358761, "num_tokens": 142973.0, "step": 70 }, { "entropy": 10.690417957305907, "epoch": 0.006554225290570655, "grad_norm": 1.796875, "learning_rate": 3.7e-05, "loss": 9.8804, "mean_token_accuracy": 0.05056782606989145, "num_tokens": 153199.0, "step": 75 }, { "entropy": 10.685645198822021, "epoch": 0.006991173643275365, "grad_norm": 1.8359375, "learning_rate": 3.95e-05, "loss": 9.768, "mean_token_accuracy": 0.05694139041006565, "num_tokens": 163079.0, "step": 80 }, { "entropy": 10.66970682144165, "epoch": 0.0074281219959800755, "grad_norm": 1.765625, "learning_rate": 4.2000000000000004e-05, "loss": 9.71, "mean_token_accuracy": 0.06373655460774899, "num_tokens": 173308.0, "step": 85 }, { "entropy": 10.657975387573241, "epoch": 0.007865070348684786, "grad_norm": 1.6640625, "learning_rate": 4.45e-05, "loss": 9.6122, "mean_token_accuracy": 0.0695813860744238, "num_tokens": 183856.0, "step": 90 }, { "entropy": 10.634114265441895, "epoch": 0.008302018701389496, "grad_norm": 1.796875, "learning_rate": 4.7000000000000004e-05, "loss": 9.5337, "mean_token_accuracy": 0.060128339752554896, "num_tokens": 193368.0, "step": 95 }, { "entropy": 10.613899898529052, "epoch": 0.008738967054094207, "grad_norm": 1.75, "learning_rate": 4.9500000000000004e-05, "loss": 9.4681, "mean_token_accuracy": 0.06204190067946911, "num_tokens": 202686.0, "step": 100 }, { "entropy": 10.591835975646973, "epoch": 0.009175915406798917, "grad_norm": 1.7265625, "learning_rate": 5.2e-05, "loss": 9.3641, "mean_token_accuracy": 0.06793517135083675, "num_tokens": 213237.0, "step": 105 }, { "entropy": 10.56372594833374, "epoch": 0.009612863759503626, "grad_norm": 1.59375, "learning_rate": 5.45e-05, "loss": 9.3006, "mean_token_accuracy": 0.06861048303544522, "num_tokens": 222406.0, "step": 110 }, { "entropy": 10.523597049713135, "epoch": 0.010049812112208336, "grad_norm": 1.6640625, "learning_rate": 5.7e-05, "loss": 9.2349, "mean_token_accuracy": 0.06383556276559829, "num_tokens": 232139.0, "step": 115 }, { "entropy": 10.474488925933837, "epoch": 0.010486760464913047, "grad_norm": 1.40625, "learning_rate": 5.9499999999999996e-05, "loss": 9.1603, "mean_token_accuracy": 0.06192168295383453, "num_tokens": 242438.0, "step": 120 }, { "entropy": 10.428980922698974, "epoch": 0.010923708817617757, "grad_norm": 1.484375, "learning_rate": 6.2e-05, "loss": 9.0417, "mean_token_accuracy": 0.06691903881728649, "num_tokens": 253082.0, "step": 125 }, { "entropy": 10.344741821289062, "epoch": 0.011360657170322468, "grad_norm": 1.515625, "learning_rate": 6.450000000000001e-05, "loss": 8.9769, "mean_token_accuracy": 0.07010326012969018, "num_tokens": 264067.0, "step": 130 }, { "entropy": 10.246838283538818, "epoch": 0.011797605523027178, "grad_norm": 1.4453125, "learning_rate": 6.7e-05, "loss": 8.8954, "mean_token_accuracy": 0.061506147310137746, "num_tokens": 274571.0, "step": 135 }, { "entropy": 10.181257820129394, "epoch": 0.012234553875731888, "grad_norm": 1.4921875, "learning_rate": 6.950000000000001e-05, "loss": 8.7923, "mean_token_accuracy": 0.06518892385065556, "num_tokens": 284561.0, "step": 140 }, { "entropy": 10.101185703277588, "epoch": 0.012671502228436599, "grad_norm": 1.2421875, "learning_rate": 7.2e-05, "loss": 8.653, "mean_token_accuracy": 0.06580178663134575, "num_tokens": 295366.0, "step": 145 }, { "entropy": 10.015565013885498, "epoch": 0.01310845058114131, "grad_norm": 1.0625, "learning_rate": 7.45e-05, "loss": 8.6783, "mean_token_accuracy": 0.06620895192027092, "num_tokens": 305423.0, "step": 150 }, { "entropy": 9.899238300323486, "epoch": 0.01354539893384602, "grad_norm": 1.109375, "learning_rate": 7.7e-05, "loss": 8.5289, "mean_token_accuracy": 0.06539785154163838, "num_tokens": 315182.0, "step": 155 }, { "entropy": 9.770205783843995, "epoch": 0.01398234728655073, "grad_norm": 1.1171875, "learning_rate": 7.950000000000001e-05, "loss": 8.4638, "mean_token_accuracy": 0.0697988323867321, "num_tokens": 324780.0, "step": 160 }, { "entropy": 9.595983505249023, "epoch": 0.01441929563925544, "grad_norm": 0.83984375, "learning_rate": 8.2e-05, "loss": 8.4388, "mean_token_accuracy": 0.06649183593690396, "num_tokens": 335104.0, "step": 165 }, { "entropy": 9.459788513183593, "epoch": 0.014856243991960151, "grad_norm": 0.9453125, "learning_rate": 8.450000000000001e-05, "loss": 8.361, "mean_token_accuracy": 0.06445354036986828, "num_tokens": 345073.0, "step": 170 }, { "entropy": 9.294847583770752, "epoch": 0.015293192344664861, "grad_norm": 0.8984375, "learning_rate": 8.7e-05, "loss": 8.32, "mean_token_accuracy": 0.057173581421375276, "num_tokens": 354342.0, "step": 175 }, { "entropy": 9.100028991699219, "epoch": 0.015730140697369572, "grad_norm": 0.75390625, "learning_rate": 8.95e-05, "loss": 8.21, "mean_token_accuracy": 0.06767738796770573, "num_tokens": 364441.0, "step": 180 }, { "entropy": 8.956842231750489, "epoch": 0.01616708905007428, "grad_norm": 1.140625, "learning_rate": 9.2e-05, "loss": 8.2102, "mean_token_accuracy": 0.06345368176698685, "num_tokens": 373918.0, "step": 185 }, { "entropy": 8.87299690246582, "epoch": 0.016604037402778993, "grad_norm": 0.75390625, "learning_rate": 9.45e-05, "loss": 8.2134, "mean_token_accuracy": 0.061258262023329735, "num_tokens": 383273.0, "step": 190 }, { "entropy": 8.69699010848999, "epoch": 0.0170409857554837, "grad_norm": 0.8671875, "learning_rate": 9.7e-05, "loss": 8.0918, "mean_token_accuracy": 0.07180375047028065, "num_tokens": 393262.0, "step": 195 }, { "entropy": 8.610151290893555, "epoch": 0.017477934108188414, "grad_norm": 0.66796875, "learning_rate": 9.95e-05, "loss": 8.194, "mean_token_accuracy": 0.061346839740872385, "num_tokens": 402389.0, "step": 200 }, { "entropy": 8.630728244781494, "epoch": 0.017914882460893122, "grad_norm": 0.74609375, "learning_rate": 0.000102, "loss": 8.1296, "mean_token_accuracy": 0.06509425193071365, "num_tokens": 412997.0, "step": 205 }, { "entropy": 8.581557655334473, "epoch": 0.018351830813597834, "grad_norm": 0.6875, "learning_rate": 0.00010449999999999999, "loss": 8.1323, "mean_token_accuracy": 0.06776191368699074, "num_tokens": 422222.0, "step": 210 }, { "entropy": 8.459476566314697, "epoch": 0.018788779166302543, "grad_norm": 0.66015625, "learning_rate": 0.000107, "loss": 8.0772, "mean_token_accuracy": 0.06964709646999837, "num_tokens": 432539.0, "step": 215 }, { "entropy": 8.583655071258544, "epoch": 0.019225727519007252, "grad_norm": 0.6796875, "learning_rate": 0.0001095, "loss": 8.0763, "mean_token_accuracy": 0.07036846987903118, "num_tokens": 442311.0, "step": 220 }, { "entropy": 8.413945198059082, "epoch": 0.019662675871711964, "grad_norm": 0.70703125, "learning_rate": 0.000112, "loss": 8.0586, "mean_token_accuracy": 0.06845476403832436, "num_tokens": 452727.0, "step": 225 }, { "entropy": 8.500650024414062, "epoch": 0.020099624224416673, "grad_norm": 0.88671875, "learning_rate": 0.0001145, "loss": 8.0851, "mean_token_accuracy": 0.07086162865161896, "num_tokens": 462461.0, "step": 230 }, { "entropy": 8.524639797210693, "epoch": 0.020536572577121385, "grad_norm": 1.0234375, "learning_rate": 0.00011700000000000001, "loss": 8.0572, "mean_token_accuracy": 0.07282712981104851, "num_tokens": 472362.0, "step": 235 }, { "entropy": 8.431649208068848, "epoch": 0.020973520929826094, "grad_norm": 0.76953125, "learning_rate": 0.00011949999999999999, "loss": 8.0476, "mean_token_accuracy": 0.07426296398043633, "num_tokens": 482718.0, "step": 240 }, { "entropy": 8.454423236846925, "epoch": 0.021410469282530806, "grad_norm": 0.703125, "learning_rate": 0.000122, "loss": 8.0537, "mean_token_accuracy": 0.07146380059421062, "num_tokens": 492947.0, "step": 245 }, { "entropy": 8.405343437194825, "epoch": 0.021847417635235514, "grad_norm": 0.92578125, "learning_rate": 0.0001245, "loss": 8.0819, "mean_token_accuracy": 0.06912912614643574, "num_tokens": 502957.0, "step": 250 }, { "entropy": 8.408589458465576, "epoch": 0.022284365987940227, "grad_norm": 0.83984375, "learning_rate": 0.000127, "loss": 8.037, "mean_token_accuracy": 0.07069992832839489, "num_tokens": 513220.0, "step": 255 }, { "entropy": 8.416099166870117, "epoch": 0.022721314340644935, "grad_norm": 0.74609375, "learning_rate": 0.0001295, "loss": 7.9798, "mean_token_accuracy": 0.07073883488774299, "num_tokens": 523217.0, "step": 260 }, { "entropy": 8.420017719268799, "epoch": 0.023158262693349647, "grad_norm": 0.78515625, "learning_rate": 0.000132, "loss": 8.0086, "mean_token_accuracy": 0.06777435280382633, "num_tokens": 533789.0, "step": 265 }, { "entropy": 8.379833126068116, "epoch": 0.023595211046054356, "grad_norm": 0.75390625, "learning_rate": 0.00013450000000000002, "loss": 7.9839, "mean_token_accuracy": 0.07827216312289238, "num_tokens": 544146.0, "step": 270 }, { "entropy": 8.337002563476563, "epoch": 0.02403215939875907, "grad_norm": 0.7265625, "learning_rate": 0.00013700000000000002, "loss": 8.0224, "mean_token_accuracy": 0.06755217313766479, "num_tokens": 554215.0, "step": 275 }, { "entropy": 8.356577014923095, "epoch": 0.024469107751463777, "grad_norm": 0.8671875, "learning_rate": 0.0001395, "loss": 7.9919, "mean_token_accuracy": 0.0684168841689825, "num_tokens": 564587.0, "step": 280 }, { "entropy": 8.399262714385987, "epoch": 0.024906056104168486, "grad_norm": 0.8125, "learning_rate": 0.00014199999999999998, "loss": 8.0404, "mean_token_accuracy": 0.07138842865824699, "num_tokens": 574819.0, "step": 285 }, { "entropy": 8.372067642211913, "epoch": 0.025343004456873198, "grad_norm": 0.8125, "learning_rate": 0.0001445, "loss": 7.9538, "mean_token_accuracy": 0.07292748279869557, "num_tokens": 585178.0, "step": 290 }, { "entropy": 8.315776348114014, "epoch": 0.025779952809577907, "grad_norm": 0.859375, "learning_rate": 0.000147, "loss": 7.9432, "mean_token_accuracy": 0.07378942035138607, "num_tokens": 595086.0, "step": 295 }, { "entropy": 8.330533981323242, "epoch": 0.02621690116228262, "grad_norm": 0.7265625, "learning_rate": 0.0001495, "loss": 7.9452, "mean_token_accuracy": 0.07910944558680058, "num_tokens": 604942.0, "step": 300 }, { "entropy": 8.304435920715331, "epoch": 0.026653849514987327, "grad_norm": 0.91015625, "learning_rate": 0.000152, "loss": 7.9291, "mean_token_accuracy": 0.07603786624968052, "num_tokens": 616082.0, "step": 305 }, { "entropy": 8.352412796020507, "epoch": 0.02709079786769204, "grad_norm": 0.921875, "learning_rate": 0.00015450000000000001, "loss": 7.9481, "mean_token_accuracy": 0.07412574216723442, "num_tokens": 626375.0, "step": 310 }, { "entropy": 8.253109741210938, "epoch": 0.027527746220396748, "grad_norm": 0.84765625, "learning_rate": 0.000157, "loss": 7.9133, "mean_token_accuracy": 0.07124261260032654, "num_tokens": 637563.0, "step": 315 }, { "entropy": 8.222493076324463, "epoch": 0.02796469457310146, "grad_norm": 0.859375, "learning_rate": 0.0001595, "loss": 7.9205, "mean_token_accuracy": 0.07289120145142078, "num_tokens": 647256.0, "step": 320 }, { "entropy": 8.32628002166748, "epoch": 0.02840164292580617, "grad_norm": 0.78125, "learning_rate": 0.000162, "loss": 7.9747, "mean_token_accuracy": 0.07336639389395713, "num_tokens": 657247.0, "step": 325 }, { "entropy": 8.336363315582275, "epoch": 0.02883859127851088, "grad_norm": 1.125, "learning_rate": 0.00016450000000000001, "loss": 7.8957, "mean_token_accuracy": 0.07113592401146888, "num_tokens": 667613.0, "step": 330 }, { "entropy": 8.263669490814209, "epoch": 0.02927553963121559, "grad_norm": 0.8203125, "learning_rate": 0.00016700000000000002, "loss": 7.9176, "mean_token_accuracy": 0.07490575201809406, "num_tokens": 678048.0, "step": 335 }, { "entropy": 8.235548973083496, "epoch": 0.029712487983920302, "grad_norm": 0.9296875, "learning_rate": 0.00016950000000000003, "loss": 7.9202, "mean_token_accuracy": 0.07333524562418461, "num_tokens": 688468.0, "step": 340 }, { "entropy": 8.21406421661377, "epoch": 0.03014943633662501, "grad_norm": 0.7734375, "learning_rate": 0.00017199999999999998, "loss": 7.885, "mean_token_accuracy": 0.078083186596632, "num_tokens": 699809.0, "step": 345 }, { "entropy": 8.228328514099122, "epoch": 0.030586384689329723, "grad_norm": 0.78125, "learning_rate": 0.00017449999999999999, "loss": 7.8454, "mean_token_accuracy": 0.07926662042737007, "num_tokens": 709227.0, "step": 350 }, { "entropy": 8.25043773651123, "epoch": 0.03102333304203443, "grad_norm": 1.0, "learning_rate": 0.000177, "loss": 7.9612, "mean_token_accuracy": 0.07075673900544643, "num_tokens": 720178.0, "step": 355 }, { "entropy": 8.20638427734375, "epoch": 0.031460281394739144, "grad_norm": 0.75390625, "learning_rate": 0.0001795, "loss": 7.8735, "mean_token_accuracy": 0.07839432805776596, "num_tokens": 730514.0, "step": 360 }, { "entropy": 8.303699684143066, "epoch": 0.03189722974744385, "grad_norm": 0.79296875, "learning_rate": 0.000182, "loss": 7.9139, "mean_token_accuracy": 0.07378935068845749, "num_tokens": 741345.0, "step": 365 }, { "entropy": 8.170354652404786, "epoch": 0.03233417810014856, "grad_norm": 0.890625, "learning_rate": 0.0001845, "loss": 7.8564, "mean_token_accuracy": 0.07958053424954414, "num_tokens": 751163.0, "step": 370 }, { "entropy": 8.218745231628418, "epoch": 0.03277112645285327, "grad_norm": 1.21875, "learning_rate": 0.000187, "loss": 7.8577, "mean_token_accuracy": 0.07420928552746772, "num_tokens": 762090.0, "step": 375 }, { "entropy": 8.191785526275634, "epoch": 0.033208074805557986, "grad_norm": 1.21875, "learning_rate": 0.0001895, "loss": 7.831, "mean_token_accuracy": 0.07720481157302857, "num_tokens": 772049.0, "step": 380 }, { "entropy": 8.150869464874267, "epoch": 0.03364502315826269, "grad_norm": 1.0625, "learning_rate": 0.000192, "loss": 7.7882, "mean_token_accuracy": 0.08157530575990676, "num_tokens": 781280.0, "step": 385 }, { "entropy": 8.15115146636963, "epoch": 0.0340819715109674, "grad_norm": 1.0546875, "learning_rate": 0.0001945, "loss": 7.8737, "mean_token_accuracy": 0.07709059566259384, "num_tokens": 791642.0, "step": 390 }, { "entropy": 8.20585823059082, "epoch": 0.034518919863672115, "grad_norm": 0.83984375, "learning_rate": 0.00019700000000000002, "loss": 7.8441, "mean_token_accuracy": 0.07621582746505737, "num_tokens": 801224.0, "step": 395 }, { "entropy": 8.199099254608154, "epoch": 0.03495586821637683, "grad_norm": 0.91796875, "learning_rate": 0.00019950000000000002, "loss": 7.7916, "mean_token_accuracy": 0.07633770778775215, "num_tokens": 810727.0, "step": 400 }, { "entropy": 8.255587577819824, "epoch": 0.03539281656908153, "grad_norm": 1.046875, "learning_rate": 0.000202, "loss": 7.8705, "mean_token_accuracy": 0.07444445230066776, "num_tokens": 819943.0, "step": 405 }, { "entropy": 8.048962116241455, "epoch": 0.035829764921786245, "grad_norm": 0.86328125, "learning_rate": 0.00020449999999999998, "loss": 7.7977, "mean_token_accuracy": 0.07640674635767937, "num_tokens": 829474.0, "step": 410 }, { "entropy": 8.137162065505981, "epoch": 0.03626671327449096, "grad_norm": 1.015625, "learning_rate": 0.000207, "loss": 7.7691, "mean_token_accuracy": 0.0750108852982521, "num_tokens": 839288.0, "step": 415 }, { "entropy": 8.195742893218995, "epoch": 0.03670366162719567, "grad_norm": 0.84765625, "learning_rate": 0.0002095, "loss": 7.793, "mean_token_accuracy": 0.07822757884860039, "num_tokens": 850064.0, "step": 420 }, { "entropy": 8.037298011779786, "epoch": 0.037140609979900374, "grad_norm": 0.88671875, "learning_rate": 0.000212, "loss": 7.7651, "mean_token_accuracy": 0.08010210767388344, "num_tokens": 860732.0, "step": 425 }, { "entropy": 8.097493267059326, "epoch": 0.037577558332605086, "grad_norm": 0.875, "learning_rate": 0.0002145, "loss": 7.7724, "mean_token_accuracy": 0.0774189442396164, "num_tokens": 870076.0, "step": 430 }, { "entropy": 8.05912742614746, "epoch": 0.0380145066853098, "grad_norm": 0.90625, "learning_rate": 0.00021700000000000002, "loss": 7.6706, "mean_token_accuracy": 0.08113809823989868, "num_tokens": 880201.0, "step": 435 }, { "entropy": 8.00949149131775, "epoch": 0.038451455038014504, "grad_norm": 0.7265625, "learning_rate": 0.0002195, "loss": 7.7294, "mean_token_accuracy": 0.08016021810472011, "num_tokens": 890344.0, "step": 440 }, { "entropy": 7.997669124603272, "epoch": 0.038888403390719216, "grad_norm": 0.9609375, "learning_rate": 0.000222, "loss": 7.7322, "mean_token_accuracy": 0.0784931242465973, "num_tokens": 900443.0, "step": 445 }, { "entropy": 8.134346008300781, "epoch": 0.03932535174342393, "grad_norm": 0.7734375, "learning_rate": 0.0002245, "loss": 7.7529, "mean_token_accuracy": 0.07578973248600959, "num_tokens": 910284.0, "step": 450 }, { "entropy": 8.158567905426025, "epoch": 0.03976230009612864, "grad_norm": 1.0234375, "learning_rate": 0.00022700000000000002, "loss": 7.8343, "mean_token_accuracy": 0.07556049451231957, "num_tokens": 920986.0, "step": 455 }, { "entropy": 7.912718629837036, "epoch": 0.040199248448833345, "grad_norm": 0.875, "learning_rate": 0.00022950000000000002, "loss": 7.7393, "mean_token_accuracy": 0.08137748837471008, "num_tokens": 930481.0, "step": 460 }, { "entropy": 8.1414954662323, "epoch": 0.04063619680153806, "grad_norm": 0.875, "learning_rate": 0.00023200000000000003, "loss": 7.764, "mean_token_accuracy": 0.08360744118690491, "num_tokens": 940554.0, "step": 465 }, { "entropy": 8.014440441131592, "epoch": 0.04107314515424277, "grad_norm": 0.97265625, "learning_rate": 0.00023449999999999998, "loss": 7.6943, "mean_token_accuracy": 0.08052223920822144, "num_tokens": 950005.0, "step": 470 }, { "entropy": 8.032914018630981, "epoch": 0.04151009350694748, "grad_norm": 0.7265625, "learning_rate": 0.000237, "loss": 7.6964, "mean_token_accuracy": 0.0742336355149746, "num_tokens": 959414.0, "step": 475 }, { "entropy": 8.050236415863036, "epoch": 0.04194704185965219, "grad_norm": 0.83203125, "learning_rate": 0.0002395, "loss": 7.7366, "mean_token_accuracy": 0.07452398836612702, "num_tokens": 969352.0, "step": 480 }, { "entropy": 8.132762765884399, "epoch": 0.0423839902123569, "grad_norm": 0.82421875, "learning_rate": 0.000242, "loss": 7.7524, "mean_token_accuracy": 0.07607904821634293, "num_tokens": 980294.0, "step": 485 }, { "entropy": 7.920047473907471, "epoch": 0.04282093856506161, "grad_norm": 0.98046875, "learning_rate": 0.0002445, "loss": 7.6372, "mean_token_accuracy": 0.0846704125404358, "num_tokens": 990453.0, "step": 490 }, { "entropy": 8.083022117614746, "epoch": 0.04325788691776632, "grad_norm": 1.1640625, "learning_rate": 0.000247, "loss": 7.6619, "mean_token_accuracy": 0.0859624132514, "num_tokens": 1000509.0, "step": 495 }, { "entropy": 8.04277811050415, "epoch": 0.04369483527047103, "grad_norm": 0.8984375, "learning_rate": 0.0002495, "loss": 7.7908, "mean_token_accuracy": 0.07289138622581959, "num_tokens": 1011747.0, "step": 500 }, { "entropy": 8.003987789154053, "epoch": 0.04413178362317574, "grad_norm": 1.109375, "learning_rate": 0.000252, "loss": 7.7292, "mean_token_accuracy": 0.07683630660176277, "num_tokens": 1021511.0, "step": 505 }, { "entropy": 8.018040466308594, "epoch": 0.04456873197588045, "grad_norm": 1.140625, "learning_rate": 0.0002545, "loss": 7.7397, "mean_token_accuracy": 0.07697788439691067, "num_tokens": 1032116.0, "step": 510 }, { "entropy": 7.920564413070679, "epoch": 0.04500568032858516, "grad_norm": 0.98828125, "learning_rate": 0.000257, "loss": 7.6298, "mean_token_accuracy": 0.08404637426137924, "num_tokens": 1041356.0, "step": 515 }, { "entropy": 7.942330694198608, "epoch": 0.04544262868128987, "grad_norm": 1.0859375, "learning_rate": 0.0002595, "loss": 7.7028, "mean_token_accuracy": 0.07776187285780907, "num_tokens": 1051314.0, "step": 520 }, { "entropy": 8.040958166122437, "epoch": 0.04587957703399458, "grad_norm": 0.89453125, "learning_rate": 0.000262, "loss": 7.6852, "mean_token_accuracy": 0.08220702111721039, "num_tokens": 1060857.0, "step": 525 }, { "entropy": 8.020647382736206, "epoch": 0.046316525386699295, "grad_norm": 0.984375, "learning_rate": 0.00026450000000000003, "loss": 7.6951, "mean_token_accuracy": 0.07845601513981819, "num_tokens": 1071744.0, "step": 530 }, { "entropy": 7.9700311660766605, "epoch": 0.046753473739404, "grad_norm": 0.8671875, "learning_rate": 0.00026700000000000004, "loss": 7.6381, "mean_token_accuracy": 0.08291278034448624, "num_tokens": 1080777.0, "step": 535 }, { "entropy": 7.986575984954834, "epoch": 0.04719042209210871, "grad_norm": 1.0234375, "learning_rate": 0.00026950000000000005, "loss": 7.6373, "mean_token_accuracy": 0.08483078628778458, "num_tokens": 1090951.0, "step": 540 }, { "entropy": 7.9460187435150145, "epoch": 0.047627370444813424, "grad_norm": 1.1171875, "learning_rate": 0.00027200000000000005, "loss": 7.6187, "mean_token_accuracy": 0.07862685099244118, "num_tokens": 1101667.0, "step": 545 }, { "entropy": 7.9729594707489015, "epoch": 0.04806431879751814, "grad_norm": 1.21875, "learning_rate": 0.0002745, "loss": 7.7162, "mean_token_accuracy": 0.07553440034389496, "num_tokens": 1112652.0, "step": 550 }, { "entropy": 7.875039529800415, "epoch": 0.04850126715022284, "grad_norm": 0.9140625, "learning_rate": 0.000277, "loss": 7.6821, "mean_token_accuracy": 0.08174617812037469, "num_tokens": 1122518.0, "step": 555 }, { "entropy": 8.032792949676514, "epoch": 0.048938215502927554, "grad_norm": 1.078125, "learning_rate": 0.0002795, "loss": 7.6805, "mean_token_accuracy": 0.08198884315788746, "num_tokens": 1132867.0, "step": 560 }, { "entropy": 7.95278844833374, "epoch": 0.049375163855632266, "grad_norm": 0.9609375, "learning_rate": 0.00028199999999999997, "loss": 7.7381, "mean_token_accuracy": 0.07585004493594169, "num_tokens": 1142524.0, "step": 565 }, { "entropy": 8.021573352813721, "epoch": 0.04981211220833697, "grad_norm": 1.140625, "learning_rate": 0.0002845, "loss": 7.6283, "mean_token_accuracy": 0.08681625351309777, "num_tokens": 1152983.0, "step": 570 }, { "entropy": 7.975176620483398, "epoch": 0.050249060561041684, "grad_norm": 0.94140625, "learning_rate": 0.000287, "loss": 7.6872, "mean_token_accuracy": 0.08164099827408791, "num_tokens": 1164271.0, "step": 575 }, { "entropy": 7.9183494567871096, "epoch": 0.050686008913746396, "grad_norm": 0.953125, "learning_rate": 0.0002895, "loss": 7.541, "mean_token_accuracy": 0.08640064373612404, "num_tokens": 1173567.0, "step": 580 }, { "entropy": 7.924293804168701, "epoch": 0.05112295726645111, "grad_norm": 1.0859375, "learning_rate": 0.000292, "loss": 7.5932, "mean_token_accuracy": 0.08321595788002015, "num_tokens": 1183619.0, "step": 585 }, { "entropy": 7.873846387863159, "epoch": 0.05155990561915581, "grad_norm": 0.9609375, "learning_rate": 0.0002945, "loss": 7.5453, "mean_token_accuracy": 0.0821442298591137, "num_tokens": 1193922.0, "step": 590 }, { "entropy": 7.94070348739624, "epoch": 0.051996853971860525, "grad_norm": 1.171875, "learning_rate": 0.000297, "loss": 7.6536, "mean_token_accuracy": 0.0783975936472416, "num_tokens": 1203665.0, "step": 595 }, { "entropy": 7.832107400894165, "epoch": 0.05243380232456524, "grad_norm": 0.9375, "learning_rate": 0.0002995, "loss": 7.6423, "mean_token_accuracy": 0.0841694563627243, "num_tokens": 1214119.0, "step": 600 }, { "entropy": 7.960584402084351, "epoch": 0.05287075067726995, "grad_norm": 1.2265625, "learning_rate": 0.000302, "loss": 7.6685, "mean_token_accuracy": 0.07720493376255036, "num_tokens": 1225275.0, "step": 605 }, { "entropy": 7.838187599182129, "epoch": 0.053307699029974655, "grad_norm": 1.078125, "learning_rate": 0.0003045, "loss": 7.5356, "mean_token_accuracy": 0.08203468546271324, "num_tokens": 1235199.0, "step": 610 }, { "entropy": 7.830732774734497, "epoch": 0.05374464738267937, "grad_norm": 0.84375, "learning_rate": 0.000307, "loss": 7.5585, "mean_token_accuracy": 0.08500108271837234, "num_tokens": 1245648.0, "step": 615 }, { "entropy": 7.852081918716431, "epoch": 0.05418159573538408, "grad_norm": 0.9453125, "learning_rate": 0.0003095, "loss": 7.4995, "mean_token_accuracy": 0.08836419135332108, "num_tokens": 1254793.0, "step": 620 }, { "entropy": 7.985955429077149, "epoch": 0.05461854408808879, "grad_norm": 0.96875, "learning_rate": 0.000312, "loss": 7.5573, "mean_token_accuracy": 0.0857199877500534, "num_tokens": 1264429.0, "step": 625 }, { "entropy": 7.8001152038574215, "epoch": 0.055055492440793496, "grad_norm": 1.1484375, "learning_rate": 0.0003145, "loss": 7.5317, "mean_token_accuracy": 0.08314449116587638, "num_tokens": 1274449.0, "step": 630 }, { "entropy": 7.813184595108032, "epoch": 0.05549244079349821, "grad_norm": 1.1484375, "learning_rate": 0.000317, "loss": 7.6222, "mean_token_accuracy": 0.07996979467570782, "num_tokens": 1284987.0, "step": 635 }, { "entropy": 7.950613355636596, "epoch": 0.05592938914620292, "grad_norm": 0.94140625, "learning_rate": 0.0003195, "loss": 7.6343, "mean_token_accuracy": 0.07661416307091713, "num_tokens": 1295984.0, "step": 640 }, { "entropy": 7.814332628250122, "epoch": 0.056366337498907626, "grad_norm": 1.0078125, "learning_rate": 0.000322, "loss": 7.5214, "mean_token_accuracy": 0.08348236829042435, "num_tokens": 1305738.0, "step": 645 }, { "entropy": 7.804314756393433, "epoch": 0.05680328585161234, "grad_norm": 1.0390625, "learning_rate": 0.00032450000000000003, "loss": 7.4795, "mean_token_accuracy": 0.07995264530181885, "num_tokens": 1315691.0, "step": 650 }, { "entropy": 7.752275705337524, "epoch": 0.05724023420431705, "grad_norm": 0.84765625, "learning_rate": 0.00032700000000000003, "loss": 7.4882, "mean_token_accuracy": 0.09246278628706932, "num_tokens": 1326195.0, "step": 655 }, { "entropy": 7.765911626815796, "epoch": 0.05767718255702176, "grad_norm": 1.1328125, "learning_rate": 0.00032950000000000004, "loss": 7.5164, "mean_token_accuracy": 0.08554120138287544, "num_tokens": 1336916.0, "step": 660 }, { "entropy": 7.800547170639038, "epoch": 0.05811413090972647, "grad_norm": 1.0546875, "learning_rate": 0.00033200000000000005, "loss": 7.5327, "mean_token_accuracy": 0.08561304733157157, "num_tokens": 1347386.0, "step": 665 }, { "entropy": 7.849845457077026, "epoch": 0.05855107926243118, "grad_norm": 1.1015625, "learning_rate": 0.00033450000000000005, "loss": 7.5301, "mean_token_accuracy": 0.08292968645691871, "num_tokens": 1357959.0, "step": 670 }, { "entropy": 7.800776195526123, "epoch": 0.05898802761513589, "grad_norm": 1.0234375, "learning_rate": 0.000337, "loss": 7.4917, "mean_token_accuracy": 0.08568408265709877, "num_tokens": 1368135.0, "step": 675 }, { "entropy": 7.8050871849060055, "epoch": 0.059424975967840604, "grad_norm": 0.90234375, "learning_rate": 0.0003395, "loss": 7.5337, "mean_token_accuracy": 0.08384500592947006, "num_tokens": 1378702.0, "step": 680 }, { "entropy": 7.720953702926636, "epoch": 0.05986192432054531, "grad_norm": 1.1640625, "learning_rate": 0.000342, "loss": 7.3887, "mean_token_accuracy": 0.08918830305337906, "num_tokens": 1387902.0, "step": 685 }, { "entropy": 7.801330518722534, "epoch": 0.06029887267325002, "grad_norm": 1.015625, "learning_rate": 0.00034449999999999997, "loss": 7.4145, "mean_token_accuracy": 0.09191453829407692, "num_tokens": 1397288.0, "step": 690 }, { "entropy": 7.620101451873779, "epoch": 0.060735821025954734, "grad_norm": 0.96875, "learning_rate": 0.000347, "loss": 7.4673, "mean_token_accuracy": 0.08888877630233764, "num_tokens": 1407416.0, "step": 695 }, { "entropy": 7.842352247238159, "epoch": 0.061172769378659446, "grad_norm": 0.95703125, "learning_rate": 0.0003495, "loss": 7.5187, "mean_token_accuracy": 0.08510556891560554, "num_tokens": 1417733.0, "step": 700 }, { "entropy": 7.77461576461792, "epoch": 0.06160971773136415, "grad_norm": 1.6015625, "learning_rate": 0.000352, "loss": 7.4219, "mean_token_accuracy": 0.0847130298614502, "num_tokens": 1426723.0, "step": 705 }, { "entropy": 7.718229103088379, "epoch": 0.06204666608406886, "grad_norm": 1.1484375, "learning_rate": 0.0003545, "loss": 7.4886, "mean_token_accuracy": 0.08168335855007172, "num_tokens": 1437290.0, "step": 710 }, { "entropy": 7.7265349388122555, "epoch": 0.062483614436773575, "grad_norm": 1.1015625, "learning_rate": 0.000357, "loss": 7.4101, "mean_token_accuracy": 0.08986271098256111, "num_tokens": 1446756.0, "step": 715 }, { "entropy": 7.732719802856446, "epoch": 0.06292056278947829, "grad_norm": 1.1328125, "learning_rate": 0.0003595, "loss": 7.4766, "mean_token_accuracy": 0.08280604630708695, "num_tokens": 1457074.0, "step": 720 }, { "entropy": 7.706831645965576, "epoch": 0.06335751114218299, "grad_norm": 1.109375, "learning_rate": 0.000362, "loss": 7.5222, "mean_token_accuracy": 0.08136801272630692, "num_tokens": 1467785.0, "step": 725 }, { "entropy": 7.702896404266357, "epoch": 0.0637944594948877, "grad_norm": 0.9140625, "learning_rate": 0.0003645, "loss": 7.4124, "mean_token_accuracy": 0.08612973466515542, "num_tokens": 1477532.0, "step": 730 }, { "entropy": 7.657266235351562, "epoch": 0.06423140784759242, "grad_norm": 0.96484375, "learning_rate": 0.000367, "loss": 7.354, "mean_token_accuracy": 0.08939684703946113, "num_tokens": 1487102.0, "step": 735 }, { "entropy": 7.676237678527832, "epoch": 0.06466835620029712, "grad_norm": 1.015625, "learning_rate": 0.0003695, "loss": 7.4367, "mean_token_accuracy": 0.08506104946136475, "num_tokens": 1497459.0, "step": 740 }, { "entropy": 7.6919153213500975, "epoch": 0.06510530455300184, "grad_norm": 0.8671875, "learning_rate": 0.000372, "loss": 7.4116, "mean_token_accuracy": 0.08696235418319702, "num_tokens": 1508756.0, "step": 745 }, { "entropy": 7.655456924438477, "epoch": 0.06554225290570655, "grad_norm": 0.82421875, "learning_rate": 0.0003745, "loss": 7.334, "mean_token_accuracy": 0.09340226426720619, "num_tokens": 1518735.0, "step": 750 }, { "entropy": 7.632836103439331, "epoch": 0.06597920125841125, "grad_norm": 1.09375, "learning_rate": 0.000377, "loss": 7.373, "mean_token_accuracy": 0.0900121010839939, "num_tokens": 1528632.0, "step": 755 }, { "entropy": 7.59655385017395, "epoch": 0.06641614961111597, "grad_norm": 0.9609375, "learning_rate": 0.0003795, "loss": 7.3537, "mean_token_accuracy": 0.09101043492555619, "num_tokens": 1538180.0, "step": 760 }, { "entropy": 7.675789928436279, "epoch": 0.06685309796382068, "grad_norm": 1.0546875, "learning_rate": 0.000382, "loss": 7.3641, "mean_token_accuracy": 0.09065457805991173, "num_tokens": 1547788.0, "step": 765 }, { "entropy": 7.655756425857544, "epoch": 0.06729004631652538, "grad_norm": 1.046875, "learning_rate": 0.0003845, "loss": 7.3488, "mean_token_accuracy": 0.09222541823983192, "num_tokens": 1558008.0, "step": 770 }, { "entropy": 7.611498165130615, "epoch": 0.0677269946692301, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 7.3996, "mean_token_accuracy": 0.08548890501260757, "num_tokens": 1567728.0, "step": 775 }, { "entropy": 7.6110608100891115, "epoch": 0.0681639430219348, "grad_norm": 1.1015625, "learning_rate": 0.00038950000000000003, "loss": 7.3381, "mean_token_accuracy": 0.08824502006173134, "num_tokens": 1578488.0, "step": 780 }, { "entropy": 7.646148300170898, "epoch": 0.06860089137463951, "grad_norm": 1.0859375, "learning_rate": 0.00039200000000000004, "loss": 7.3251, "mean_token_accuracy": 0.09305397123098373, "num_tokens": 1588070.0, "step": 785 }, { "entropy": 7.577291822433471, "epoch": 0.06903783972734423, "grad_norm": 0.88671875, "learning_rate": 0.00039450000000000005, "loss": 7.4018, "mean_token_accuracy": 0.08525708541274071, "num_tokens": 1598572.0, "step": 790 }, { "entropy": 7.725144910812378, "epoch": 0.06947478808004894, "grad_norm": 1.171875, "learning_rate": 0.00039700000000000005, "loss": 7.3944, "mean_token_accuracy": 0.0888714350759983, "num_tokens": 1607982.0, "step": 795 }, { "entropy": 7.575393867492676, "epoch": 0.06991173643275365, "grad_norm": 1.234375, "learning_rate": 0.0003995, "loss": 7.4, "mean_token_accuracy": 0.09165657237172127, "num_tokens": 1618785.0, "step": 800 }, { "entropy": 7.640562582015991, "epoch": 0.07034868478545836, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 7.3264, "mean_token_accuracy": 0.09215063080191613, "num_tokens": 1627988.0, "step": 805 }, { "entropy": 7.606148958206177, "epoch": 0.07078563313816306, "grad_norm": 1.28125, "learning_rate": 0.0004045, "loss": 7.4088, "mean_token_accuracy": 0.08241811096668243, "num_tokens": 1638024.0, "step": 810 }, { "entropy": 7.635509967803955, "epoch": 0.07122258149086778, "grad_norm": 1.1328125, "learning_rate": 0.00040699999999999997, "loss": 7.3984, "mean_token_accuracy": 0.08276447355747223, "num_tokens": 1649215.0, "step": 815 }, { "entropy": 7.5351354598999025, "epoch": 0.07165952984357249, "grad_norm": 0.8828125, "learning_rate": 0.0004095, "loss": 7.2742, "mean_token_accuracy": 0.09341849088668823, "num_tokens": 1659198.0, "step": 820 }, { "entropy": 7.591096258163452, "epoch": 0.0720964781962772, "grad_norm": 1.0703125, "learning_rate": 0.000412, "loss": 7.3213, "mean_token_accuracy": 0.08587326556444168, "num_tokens": 1668972.0, "step": 825 }, { "entropy": 7.505528831481934, "epoch": 0.07253342654898191, "grad_norm": 1.046875, "learning_rate": 0.0004145, "loss": 7.3155, "mean_token_accuracy": 0.09277390204370022, "num_tokens": 1679807.0, "step": 830 }, { "entropy": 7.6023828983306885, "epoch": 0.07297037490168662, "grad_norm": 1.0625, "learning_rate": 0.000417, "loss": 7.3551, "mean_token_accuracy": 0.08633830323815346, "num_tokens": 1690567.0, "step": 835 }, { "entropy": 7.440132284164429, "epoch": 0.07340732325439134, "grad_norm": 0.97265625, "learning_rate": 0.0004195, "loss": 7.2531, "mean_token_accuracy": 0.09126588180661202, "num_tokens": 1700939.0, "step": 840 }, { "entropy": 7.51141676902771, "epoch": 0.07384427160709604, "grad_norm": 0.92578125, "learning_rate": 0.000422, "loss": 7.2943, "mean_token_accuracy": 0.09781363755464553, "num_tokens": 1711181.0, "step": 845 }, { "entropy": 7.651186609268189, "epoch": 0.07428121995980075, "grad_norm": 1.0546875, "learning_rate": 0.0004245, "loss": 7.3272, "mean_token_accuracy": 0.08526805341243744, "num_tokens": 1721392.0, "step": 850 }, { "entropy": 7.507527637481689, "epoch": 0.07471816831250547, "grad_norm": 0.91796875, "learning_rate": 0.000427, "loss": 7.2344, "mean_token_accuracy": 0.09549994468688965, "num_tokens": 1731942.0, "step": 855 }, { "entropy": 7.518540573120117, "epoch": 0.07515511666521017, "grad_norm": 0.78515625, "learning_rate": 0.0004295, "loss": 7.3444, "mean_token_accuracy": 0.08721731156110764, "num_tokens": 1743409.0, "step": 860 }, { "entropy": 7.473425197601318, "epoch": 0.07559206501791488, "grad_norm": 0.8984375, "learning_rate": 0.000432, "loss": 7.2332, "mean_token_accuracy": 0.09332804158329963, "num_tokens": 1753425.0, "step": 865 }, { "entropy": 7.484533405303955, "epoch": 0.0760290133706196, "grad_norm": 0.90625, "learning_rate": 0.0004345, "loss": 7.263, "mean_token_accuracy": 0.09156408160924911, "num_tokens": 1762722.0, "step": 870 }, { "entropy": 7.63799090385437, "epoch": 0.0764659617233243, "grad_norm": 0.97265625, "learning_rate": 0.000437, "loss": 7.3416, "mean_token_accuracy": 0.08278580531477928, "num_tokens": 1771895.0, "step": 875 }, { "entropy": 7.450203514099121, "epoch": 0.07690291007602901, "grad_norm": 0.90625, "learning_rate": 0.0004395, "loss": 7.2387, "mean_token_accuracy": 0.09428637102246284, "num_tokens": 1782175.0, "step": 880 }, { "entropy": 7.548505687713623, "epoch": 0.07733985842873373, "grad_norm": 1.0390625, "learning_rate": 0.000442, "loss": 7.3003, "mean_token_accuracy": 0.09130567386746406, "num_tokens": 1792409.0, "step": 885 }, { "entropy": 7.5660957336425785, "epoch": 0.07777680678143843, "grad_norm": 1.0625, "learning_rate": 0.0004445, "loss": 7.342, "mean_token_accuracy": 0.08967537879943847, "num_tokens": 1802721.0, "step": 890 }, { "entropy": 7.403235387802124, "epoch": 0.07821375513414315, "grad_norm": 0.9765625, "learning_rate": 0.000447, "loss": 7.1835, "mean_token_accuracy": 0.09422190114855766, "num_tokens": 1812064.0, "step": 895 }, { "entropy": 7.539788246154785, "epoch": 0.07865070348684786, "grad_norm": 1.0, "learning_rate": 0.00044950000000000003, "loss": 7.2802, "mean_token_accuracy": 0.0889531396329403, "num_tokens": 1822284.0, "step": 900 }, { "entropy": 7.418588542938233, "epoch": 0.07908765183955256, "grad_norm": 1.03125, "learning_rate": 0.00045200000000000004, "loss": 7.1734, "mean_token_accuracy": 0.10003943592309952, "num_tokens": 1832150.0, "step": 905 }, { "entropy": 7.502434968948364, "epoch": 0.07952460019225728, "grad_norm": 1.0703125, "learning_rate": 0.00045450000000000004, "loss": 7.3111, "mean_token_accuracy": 0.08902120292186737, "num_tokens": 1842870.0, "step": 910 }, { "entropy": 7.440501403808594, "epoch": 0.07996154854496199, "grad_norm": 0.94921875, "learning_rate": 0.00045700000000000005, "loss": 7.1386, "mean_token_accuracy": 0.10121746063232422, "num_tokens": 1852771.0, "step": 915 }, { "entropy": 7.499157047271728, "epoch": 0.08039849689766669, "grad_norm": 0.9453125, "learning_rate": 0.00045950000000000006, "loss": 7.2641, "mean_token_accuracy": 0.08988009616732598, "num_tokens": 1863095.0, "step": 920 }, { "entropy": 7.418407726287842, "epoch": 0.08083544525037141, "grad_norm": 0.96875, "learning_rate": 0.000462, "loss": 7.2466, "mean_token_accuracy": 0.09539340287446976, "num_tokens": 1873060.0, "step": 925 }, { "entropy": 7.4301539897918705, "epoch": 0.08127239360307612, "grad_norm": 0.89453125, "learning_rate": 0.0004645, "loss": 7.1842, "mean_token_accuracy": 0.09798025488853454, "num_tokens": 1882574.0, "step": 930 }, { "entropy": 7.432036447525024, "epoch": 0.08170934195578082, "grad_norm": 0.91015625, "learning_rate": 0.000467, "loss": 7.2438, "mean_token_accuracy": 0.09283970594406128, "num_tokens": 1892227.0, "step": 935 }, { "entropy": 7.447924375534058, "epoch": 0.08214629030848554, "grad_norm": 1.03125, "learning_rate": 0.0004695, "loss": 7.2762, "mean_token_accuracy": 0.0921746976673603, "num_tokens": 1902868.0, "step": 940 }, { "entropy": 7.454946565628052, "epoch": 0.08258323866119024, "grad_norm": 0.86328125, "learning_rate": 0.000472, "loss": 7.2095, "mean_token_accuracy": 0.091494170576334, "num_tokens": 1912781.0, "step": 945 }, { "entropy": 7.3900199890136715, "epoch": 0.08302018701389496, "grad_norm": 0.83984375, "learning_rate": 0.0004745, "loss": 7.2071, "mean_token_accuracy": 0.09347877204418183, "num_tokens": 1923638.0, "step": 950 }, { "entropy": 7.410589408874512, "epoch": 0.08345713536659967, "grad_norm": 0.9609375, "learning_rate": 0.000477, "loss": 7.1738, "mean_token_accuracy": 0.0997669093310833, "num_tokens": 1933498.0, "step": 955 }, { "entropy": 7.345382642745972, "epoch": 0.08389408371930437, "grad_norm": 0.94921875, "learning_rate": 0.0004795, "loss": 7.1795, "mean_token_accuracy": 0.09802865833044053, "num_tokens": 1943798.0, "step": 960 }, { "entropy": 7.41419472694397, "epoch": 0.0843310320720091, "grad_norm": 1.0390625, "learning_rate": 0.000482, "loss": 7.2289, "mean_token_accuracy": 0.08998453319072723, "num_tokens": 1954235.0, "step": 965 }, { "entropy": 7.420694160461426, "epoch": 0.0847679804247138, "grad_norm": 0.875, "learning_rate": 0.0004845, "loss": 7.1975, "mean_token_accuracy": 0.08924680277705192, "num_tokens": 1964421.0, "step": 970 }, { "entropy": 7.348307037353516, "epoch": 0.0852049287774185, "grad_norm": 0.9296875, "learning_rate": 0.000487, "loss": 7.1912, "mean_token_accuracy": 0.09613144919276237, "num_tokens": 1975862.0, "step": 975 }, { "entropy": 7.43187837600708, "epoch": 0.08564187713012322, "grad_norm": 0.96875, "learning_rate": 0.0004895, "loss": 7.1916, "mean_token_accuracy": 0.09355136156082153, "num_tokens": 1985758.0, "step": 980 }, { "entropy": 7.304799795150757, "epoch": 0.08607882548282793, "grad_norm": 0.984375, "learning_rate": 0.000492, "loss": 7.1507, "mean_token_accuracy": 0.09453744739294052, "num_tokens": 1996904.0, "step": 985 }, { "entropy": 7.544142961502075, "epoch": 0.08651577383553263, "grad_norm": 0.94140625, "learning_rate": 0.0004945, "loss": 7.2387, "mean_token_accuracy": 0.09486401230096816, "num_tokens": 2006114.0, "step": 990 }, { "entropy": 7.3271314144134525, "epoch": 0.08695272218823735, "grad_norm": 0.9765625, "learning_rate": 0.000497, "loss": 7.187, "mean_token_accuracy": 0.09526639729738236, "num_tokens": 2016349.0, "step": 995 }, { "entropy": 7.326001262664795, "epoch": 0.08738967054094206, "grad_norm": 0.9921875, "learning_rate": 0.0004995, "loss": 7.1294, "mean_token_accuracy": 0.09752104729413986, "num_tokens": 2026701.0, "step": 1000 }, { "entropy": 7.363681697845459, "epoch": 0.08782661889364678, "grad_norm": 0.92578125, "learning_rate": 0.0004999999986190023, "loss": 7.1313, "mean_token_accuracy": 0.09394256100058555, "num_tokens": 2036950.0, "step": 1005 }, { "entropy": 7.389071273803711, "epoch": 0.08826356724635148, "grad_norm": 0.984375, "learning_rate": 0.0004999999930086991, "loss": 7.1271, "mean_token_accuracy": 0.09964141845703126, "num_tokens": 2047655.0, "step": 1010 }, { "entropy": 7.2618661403656, "epoch": 0.08870051559905619, "grad_norm": 0.99609375, "learning_rate": 0.000499999983082778, "loss": 7.0867, "mean_token_accuracy": 0.09885328710079193, "num_tokens": 2056800.0, "step": 1015 }, { "entropy": 7.379116010665894, "epoch": 0.0891374639517609, "grad_norm": 1.015625, "learning_rate": 0.0004999999688412394, "loss": 7.1357, "mean_token_accuracy": 0.09616564437747002, "num_tokens": 2066862.0, "step": 1020 }, { "entropy": 7.303624439239502, "epoch": 0.08957441230446561, "grad_norm": 0.96484375, "learning_rate": 0.0004999999502840836, "loss": 7.1615, "mean_token_accuracy": 0.09557585939764976, "num_tokens": 2076585.0, "step": 1025 }, { "entropy": 7.345246982574463, "epoch": 0.09001136065717032, "grad_norm": 0.94921875, "learning_rate": 0.0004999999274113107, "loss": 7.2304, "mean_token_accuracy": 0.09007581695914268, "num_tokens": 2087768.0, "step": 1030 }, { "entropy": 7.375523328781128, "epoch": 0.09044830900987504, "grad_norm": 0.89453125, "learning_rate": 0.0004999999002229214, "loss": 7.1331, "mean_token_accuracy": 0.09556613713502884, "num_tokens": 2097027.0, "step": 1035 }, { "entropy": 7.343056964874267, "epoch": 0.09088525736257974, "grad_norm": 0.88671875, "learning_rate": 0.0004999998687189161, "loss": 7.0493, "mean_token_accuracy": 0.10475894957780837, "num_tokens": 2107055.0, "step": 1040 }, { "entropy": 7.232951641082764, "epoch": 0.09132220571528446, "grad_norm": 0.98046875, "learning_rate": 0.0004999998328992954, "loss": 6.9891, "mean_token_accuracy": 0.09808351546525955, "num_tokens": 2116771.0, "step": 1045 }, { "entropy": 7.251108074188233, "epoch": 0.09175915406798917, "grad_norm": 1.0546875, "learning_rate": 0.00049999979276406, "loss": 7.1275, "mean_token_accuracy": 0.09823357462882995, "num_tokens": 2126881.0, "step": 1050 }, { "entropy": 7.334365940093994, "epoch": 0.09219610242069387, "grad_norm": 1.09375, "learning_rate": 0.0004999997483132108, "loss": 7.1095, "mean_token_accuracy": 0.09823260232806205, "num_tokens": 2136964.0, "step": 1055 }, { "entropy": 7.285873460769653, "epoch": 0.09263305077339859, "grad_norm": 0.91015625, "learning_rate": 0.0004999996995467483, "loss": 7.1465, "mean_token_accuracy": 0.09619581401348114, "num_tokens": 2147263.0, "step": 1060 }, { "entropy": 7.269978046417236, "epoch": 0.0930699991261033, "grad_norm": 0.90625, "learning_rate": 0.0004999996464646738, "loss": 7.1421, "mean_token_accuracy": 0.09753268361091613, "num_tokens": 2157474.0, "step": 1065 }, { "entropy": 7.301066493988037, "epoch": 0.093506947478808, "grad_norm": 0.92578125, "learning_rate": 0.0004999995890669882, "loss": 7.0887, "mean_token_accuracy": 0.09752897918224335, "num_tokens": 2167701.0, "step": 1070 }, { "entropy": 7.1919232368469235, "epoch": 0.09394389583151272, "grad_norm": 0.94140625, "learning_rate": 0.0004999995273536925, "loss": 7.0485, "mean_token_accuracy": 0.10060491785407066, "num_tokens": 2178581.0, "step": 1075 }, { "entropy": 7.291404294967651, "epoch": 0.09438084418421742, "grad_norm": 0.85546875, "learning_rate": 0.000499999461324788, "loss": 7.0571, "mean_token_accuracy": 0.0973673515021801, "num_tokens": 2189529.0, "step": 1080 }, { "entropy": 7.293972587585449, "epoch": 0.09481779253692213, "grad_norm": 1.0078125, "learning_rate": 0.0004999993909802759, "loss": 7.1293, "mean_token_accuracy": 0.09355574771761895, "num_tokens": 2199805.0, "step": 1085 }, { "entropy": 7.219992399215698, "epoch": 0.09525474088962685, "grad_norm": 0.84765625, "learning_rate": 0.0004999993163201577, "loss": 7.0882, "mean_token_accuracy": 0.09490575790405273, "num_tokens": 2210108.0, "step": 1090 }, { "entropy": 7.3503416061401365, "epoch": 0.09569168924233155, "grad_norm": 0.9765625, "learning_rate": 0.0004999992373444347, "loss": 7.0748, "mean_token_accuracy": 0.09794154390692711, "num_tokens": 2220325.0, "step": 1095 }, { "entropy": 7.212787294387818, "epoch": 0.09612863759503627, "grad_norm": 0.921875, "learning_rate": 0.0004999991540531084, "loss": 7.078, "mean_token_accuracy": 0.09457284510135651, "num_tokens": 2230521.0, "step": 1100 }, { "entropy": 7.296592044830322, "epoch": 0.09656558594774098, "grad_norm": 1.125, "learning_rate": 0.0004999990664461804, "loss": 7.1008, "mean_token_accuracy": 0.0982304073870182, "num_tokens": 2240372.0, "step": 1105 }, { "entropy": 7.249142646789551, "epoch": 0.09700253430044568, "grad_norm": 1.1328125, "learning_rate": 0.0004999989745236524, "loss": 7.0654, "mean_token_accuracy": 0.10029410496354103, "num_tokens": 2250522.0, "step": 1110 }, { "entropy": 7.172446870803833, "epoch": 0.0974394826531504, "grad_norm": 0.984375, "learning_rate": 0.0004999988782855261, "loss": 7.0139, "mean_token_accuracy": 0.0998832106590271, "num_tokens": 2260142.0, "step": 1115 }, { "entropy": 7.262675666809082, "epoch": 0.09787643100585511, "grad_norm": 0.96875, "learning_rate": 0.0004999987777318035, "loss": 7.0449, "mean_token_accuracy": 0.0934498131275177, "num_tokens": 2270372.0, "step": 1120 }, { "entropy": 7.145792722702026, "epoch": 0.09831337935855981, "grad_norm": 1.015625, "learning_rate": 0.0004999986728624865, "loss": 6.9603, "mean_token_accuracy": 0.1059371255338192, "num_tokens": 2280517.0, "step": 1125 }, { "entropy": 7.340591526031494, "epoch": 0.09875032771126453, "grad_norm": 0.98828125, "learning_rate": 0.000499998563677577, "loss": 7.0665, "mean_token_accuracy": 0.097840715944767, "num_tokens": 2290778.0, "step": 1130 }, { "entropy": 7.222999715805054, "epoch": 0.09918727606396924, "grad_norm": 0.94140625, "learning_rate": 0.0004999984501770771, "loss": 7.1046, "mean_token_accuracy": 0.09563738405704499, "num_tokens": 2301692.0, "step": 1135 }, { "entropy": 7.17807970046997, "epoch": 0.09962422441667394, "grad_norm": 1.0234375, "learning_rate": 0.0004999983323609891, "loss": 6.9737, "mean_token_accuracy": 0.10515563935041428, "num_tokens": 2312759.0, "step": 1140 }, { "entropy": 7.259163951873779, "epoch": 0.10006117276937866, "grad_norm": 0.9765625, "learning_rate": 0.0004999982102293153, "loss": 6.9729, "mean_token_accuracy": 0.10644988417625427, "num_tokens": 2322016.0, "step": 1145 }, { "entropy": 7.230524587631225, "epoch": 0.10049812112208337, "grad_norm": 0.90234375, "learning_rate": 0.0004999980837820578, "loss": 6.9835, "mean_token_accuracy": 0.10811527222394943, "num_tokens": 2332476.0, "step": 1150 }, { "entropy": 7.183452081680298, "epoch": 0.10093506947478809, "grad_norm": 0.984375, "learning_rate": 0.0004999979530192192, "loss": 7.0065, "mean_token_accuracy": 0.0977212980389595, "num_tokens": 2342914.0, "step": 1155 }, { "entropy": 7.134286832809448, "epoch": 0.10137201782749279, "grad_norm": 0.9140625, "learning_rate": 0.0004999978179408019, "loss": 7.0586, "mean_token_accuracy": 0.09377534911036492, "num_tokens": 2353381.0, "step": 1160 }, { "entropy": 7.30219407081604, "epoch": 0.1018089661801975, "grad_norm": 0.859375, "learning_rate": 0.0004999976785468085, "loss": 7.0465, "mean_token_accuracy": 0.10484937131404877, "num_tokens": 2364207.0, "step": 1165 }, { "entropy": 7.110436010360718, "epoch": 0.10224591453290222, "grad_norm": 0.9921875, "learning_rate": 0.0004999975348372418, "loss": 6.9636, "mean_token_accuracy": 0.10252279341220856, "num_tokens": 2374985.0, "step": 1170 }, { "entropy": 7.178512048721314, "epoch": 0.10268286288560692, "grad_norm": 0.91015625, "learning_rate": 0.0004999973868121044, "loss": 7.0417, "mean_token_accuracy": 0.10154772102832794, "num_tokens": 2385684.0, "step": 1175 }, { "entropy": 7.308528852462769, "epoch": 0.10311981123831163, "grad_norm": 0.921875, "learning_rate": 0.0004999972344713994, "loss": 6.9786, "mean_token_accuracy": 0.10362603068351746, "num_tokens": 2395177.0, "step": 1180 }, { "entropy": 7.079153251647949, "epoch": 0.10355675959101635, "grad_norm": 0.9140625, "learning_rate": 0.0004999970778151295, "loss": 6.9996, "mean_token_accuracy": 0.1028733141720295, "num_tokens": 2405154.0, "step": 1185 }, { "entropy": 7.193738412857056, "epoch": 0.10399370794372105, "grad_norm": 0.921875, "learning_rate": 0.0004999969168432976, "loss": 6.9717, "mean_token_accuracy": 0.10190057530999183, "num_tokens": 2415818.0, "step": 1190 }, { "entropy": 7.1862547397613525, "epoch": 0.10443065629642576, "grad_norm": 1.0390625, "learning_rate": 0.0004999967515559071, "loss": 6.948, "mean_token_accuracy": 0.10600498467683792, "num_tokens": 2425072.0, "step": 1195 }, { "entropy": 7.127433347702026, "epoch": 0.10486760464913047, "grad_norm": 0.96875, "learning_rate": 0.000499996581952961, "loss": 7.0112, "mean_token_accuracy": 0.10471701920032501, "num_tokens": 2435055.0, "step": 1200 }, { "entropy": 7.183917045593262, "epoch": 0.10530455300183518, "grad_norm": 1.03125, "learning_rate": 0.0004999964080344625, "loss": 6.9105, "mean_token_accuracy": 0.10828652903437615, "num_tokens": 2444434.0, "step": 1205 }, { "entropy": 7.123368644714356, "epoch": 0.1057415013545399, "grad_norm": 0.94140625, "learning_rate": 0.0004999962298004151, "loss": 6.9342, "mean_token_accuracy": 0.10267825126647949, "num_tokens": 2453860.0, "step": 1210 }, { "entropy": 7.156991624832154, "epoch": 0.1061784497072446, "grad_norm": 1.046875, "learning_rate": 0.0004999960472508219, "loss": 7.0422, "mean_token_accuracy": 0.09686045348644257, "num_tokens": 2464235.0, "step": 1215 }, { "entropy": 7.170539712905883, "epoch": 0.10661539805994931, "grad_norm": 0.95703125, "learning_rate": 0.0004999958603856869, "loss": 6.9567, "mean_token_accuracy": 0.1066193401813507, "num_tokens": 2474561.0, "step": 1220 }, { "entropy": 7.07088451385498, "epoch": 0.10705234641265403, "grad_norm": 0.875, "learning_rate": 0.0004999956692050132, "loss": 6.9471, "mean_token_accuracy": 0.10514729768037796, "num_tokens": 2484574.0, "step": 1225 }, { "entropy": 7.207800436019897, "epoch": 0.10748929476535873, "grad_norm": 1.015625, "learning_rate": 0.0004999954737088048, "loss": 6.9074, "mean_token_accuracy": 0.11164658814668656, "num_tokens": 2494146.0, "step": 1230 }, { "entropy": 7.073509597778321, "epoch": 0.10792624311806344, "grad_norm": 0.96484375, "learning_rate": 0.0004999952738970652, "loss": 6.9986, "mean_token_accuracy": 0.10540383160114289, "num_tokens": 2504157.0, "step": 1235 }, { "entropy": 7.107709217071533, "epoch": 0.10836319147076816, "grad_norm": 0.99609375, "learning_rate": 0.0004999950697697983, "loss": 6.9445, "mean_token_accuracy": 0.10252791419625282, "num_tokens": 2512979.0, "step": 1240 }, { "entropy": 7.164508867263794, "epoch": 0.10880013982347286, "grad_norm": 0.94140625, "learning_rate": 0.0004999948613270081, "loss": 6.9823, "mean_token_accuracy": 0.09834418892860412, "num_tokens": 2523202.0, "step": 1245 }, { "entropy": 7.125106716156006, "epoch": 0.10923708817617758, "grad_norm": 0.8984375, "learning_rate": 0.0004999946485686987, "loss": 6.9302, "mean_token_accuracy": 0.1016211062669754, "num_tokens": 2532790.0, "step": 1250 }, { "entropy": 7.114097547531128, "epoch": 0.10967403652888229, "grad_norm": 0.984375, "learning_rate": 0.000499994431494874, "loss": 6.9191, "mean_token_accuracy": 0.10513179227709771, "num_tokens": 2542337.0, "step": 1255 }, { "entropy": 7.029775667190552, "epoch": 0.11011098488158699, "grad_norm": 0.8671875, "learning_rate": 0.0004999942101055381, "loss": 6.8665, "mean_token_accuracy": 0.11162453517317772, "num_tokens": 2552762.0, "step": 1260 }, { "entropy": 7.129621982574463, "epoch": 0.11054793323429171, "grad_norm": 1.0, "learning_rate": 0.0004999939844006955, "loss": 6.9116, "mean_token_accuracy": 0.10495460107922554, "num_tokens": 2563261.0, "step": 1265 }, { "entropy": 7.162447929382324, "epoch": 0.11098488158699642, "grad_norm": 0.99609375, "learning_rate": 0.0004999937543803503, "loss": 6.8825, "mean_token_accuracy": 0.10844132751226425, "num_tokens": 2573089.0, "step": 1270 }, { "entropy": 7.0640336036682125, "epoch": 0.11142182993970112, "grad_norm": 0.921875, "learning_rate": 0.000499993520044507, "loss": 6.9735, "mean_token_accuracy": 0.10243528857827186, "num_tokens": 2584358.0, "step": 1275 }, { "entropy": 7.16273775100708, "epoch": 0.11185877829240584, "grad_norm": 1.109375, "learning_rate": 0.0004999932813931702, "loss": 6.9331, "mean_token_accuracy": 0.1072621412575245, "num_tokens": 2594981.0, "step": 1280 }, { "entropy": 7.042669677734375, "epoch": 0.11229572664511055, "grad_norm": 1.0390625, "learning_rate": 0.0004999930384263441, "loss": 6.938, "mean_token_accuracy": 0.10397336781024932, "num_tokens": 2603508.0, "step": 1285 }, { "entropy": 7.144971084594727, "epoch": 0.11273267499781525, "grad_norm": 1.0078125, "learning_rate": 0.000499992791144034, "loss": 6.9346, "mean_token_accuracy": 0.10637803673744202, "num_tokens": 2613666.0, "step": 1290 }, { "entropy": 7.241996955871582, "epoch": 0.11316962335051997, "grad_norm": 1.0078125, "learning_rate": 0.0004999925395462439, "loss": 6.9627, "mean_token_accuracy": 0.09948229417204857, "num_tokens": 2624441.0, "step": 1295 }, { "entropy": 7.0352034091949465, "epoch": 0.11360657170322468, "grad_norm": 0.8984375, "learning_rate": 0.0004999922836329793, "loss": 6.923, "mean_token_accuracy": 0.10289243534207344, "num_tokens": 2635261.0, "step": 1300 }, { "entropy": 7.011289453506469, "epoch": 0.1140435200559294, "grad_norm": 1.0546875, "learning_rate": 0.0004999920234042446, "loss": 6.8854, "mean_token_accuracy": 0.11003832370042801, "num_tokens": 2645493.0, "step": 1305 }, { "entropy": 7.1208052158355715, "epoch": 0.1144804684086341, "grad_norm": 0.9609375, "learning_rate": 0.0004999917588600451, "loss": 6.852, "mean_token_accuracy": 0.11447785347700119, "num_tokens": 2655430.0, "step": 1310 }, { "entropy": 7.098808240890503, "epoch": 0.1149174167613388, "grad_norm": 1.0078125, "learning_rate": 0.0004999914900003857, "loss": 6.9128, "mean_token_accuracy": 0.10278257057070732, "num_tokens": 2665675.0, "step": 1315 }, { "entropy": 7.085298490524292, "epoch": 0.11535436511404352, "grad_norm": 0.97265625, "learning_rate": 0.0004999912168252717, "loss": 6.8695, "mean_token_accuracy": 0.10640941336750984, "num_tokens": 2675962.0, "step": 1320 }, { "entropy": 7.03753924369812, "epoch": 0.11579131346674823, "grad_norm": 0.9296875, "learning_rate": 0.0004999909393347083, "loss": 6.9073, "mean_token_accuracy": 0.10800022035837173, "num_tokens": 2687015.0, "step": 1325 }, { "entropy": 7.064095830917358, "epoch": 0.11622826181945294, "grad_norm": 0.8203125, "learning_rate": 0.0004999906575287006, "loss": 6.9613, "mean_token_accuracy": 0.10142027139663697, "num_tokens": 2698065.0, "step": 1330 }, { "entropy": 7.07314624786377, "epoch": 0.11666521017215765, "grad_norm": 0.90625, "learning_rate": 0.0004999903714072544, "loss": 6.847, "mean_token_accuracy": 0.11568356677889824, "num_tokens": 2709046.0, "step": 1335 }, { "entropy": 7.1079401016235355, "epoch": 0.11710215852486236, "grad_norm": 0.8671875, "learning_rate": 0.0004999900809703749, "loss": 6.9191, "mean_token_accuracy": 0.10752326548099518, "num_tokens": 2719705.0, "step": 1340 }, { "entropy": 7.064958286285401, "epoch": 0.11753910687756706, "grad_norm": 1.3984375, "learning_rate": 0.0004999897862180678, "loss": 6.8041, "mean_token_accuracy": 0.11670546159148217, "num_tokens": 2729556.0, "step": 1345 }, { "entropy": 6.963649272918701, "epoch": 0.11797605523027178, "grad_norm": 0.90625, "learning_rate": 0.0004999894871503386, "loss": 6.9142, "mean_token_accuracy": 0.10688972845673561, "num_tokens": 2741144.0, "step": 1350 }, { "entropy": 7.1297893047332765, "epoch": 0.11841300358297649, "grad_norm": 0.8828125, "learning_rate": 0.0004999891837671932, "loss": 6.8313, "mean_token_accuracy": 0.11042980030179024, "num_tokens": 2751384.0, "step": 1355 }, { "entropy": 7.002114248275757, "epoch": 0.11884995193568121, "grad_norm": 1.046875, "learning_rate": 0.0004999888760686375, "loss": 6.8575, "mean_token_accuracy": 0.10566901117563247, "num_tokens": 2761044.0, "step": 1360 }, { "entropy": 6.988346195220947, "epoch": 0.11928690028838591, "grad_norm": 0.87109375, "learning_rate": 0.000499988564054677, "loss": 6.8086, "mean_token_accuracy": 0.11115672811865807, "num_tokens": 2770946.0, "step": 1365 }, { "entropy": 7.10092191696167, "epoch": 0.11972384864109062, "grad_norm": 0.91796875, "learning_rate": 0.0004999882477253182, "loss": 6.8658, "mean_token_accuracy": 0.10557007491588592, "num_tokens": 2781247.0, "step": 1370 }, { "entropy": 6.943843507766724, "epoch": 0.12016079699379534, "grad_norm": 0.859375, "learning_rate": 0.0004999879270805667, "loss": 6.7182, "mean_token_accuracy": 0.11588958874344826, "num_tokens": 2792078.0, "step": 1375 }, { "entropy": 7.026294994354248, "epoch": 0.12059774534650004, "grad_norm": 0.8984375, "learning_rate": 0.0004999876021204291, "loss": 6.8013, "mean_token_accuracy": 0.10884896218776703, "num_tokens": 2802458.0, "step": 1380 }, { "entropy": 6.9799354553222654, "epoch": 0.12103469369920475, "grad_norm": 0.984375, "learning_rate": 0.0004999872728449112, "loss": 6.9463, "mean_token_accuracy": 0.10275301113724708, "num_tokens": 2813352.0, "step": 1385 }, { "entropy": 7.118425130844116, "epoch": 0.12147164205190947, "grad_norm": 0.98046875, "learning_rate": 0.0004999869392540195, "loss": 6.8378, "mean_token_accuracy": 0.10523320958018303, "num_tokens": 2822954.0, "step": 1390 }, { "entropy": 7.004513549804687, "epoch": 0.12190859040461417, "grad_norm": 0.8203125, "learning_rate": 0.0004999866013477605, "loss": 6.8669, "mean_token_accuracy": 0.10665129348635674, "num_tokens": 2833375.0, "step": 1395 }, { "entropy": 7.019338464736938, "epoch": 0.12234553875731889, "grad_norm": 0.8671875, "learning_rate": 0.0004999862591261407, "loss": 6.7998, "mean_token_accuracy": 0.10706322714686393, "num_tokens": 2843103.0, "step": 1400 }, { "entropy": 7.052399921417236, "epoch": 0.1227824871100236, "grad_norm": 0.890625, "learning_rate": 0.0004999859125891664, "loss": 6.8627, "mean_token_accuracy": 0.10739990398287773, "num_tokens": 2853801.0, "step": 1405 }, { "entropy": 7.02172212600708, "epoch": 0.1232194354627283, "grad_norm": 0.9765625, "learning_rate": 0.0004999855617368445, "loss": 6.8554, "mean_token_accuracy": 0.10320612639188767, "num_tokens": 2863851.0, "step": 1410 }, { "entropy": 6.942949008941651, "epoch": 0.12365638381543302, "grad_norm": 0.87890625, "learning_rate": 0.0004999852065691816, "loss": 6.7966, "mean_token_accuracy": 0.11276845708489418, "num_tokens": 2875073.0, "step": 1415 }, { "entropy": 7.042190361022949, "epoch": 0.12409333216813773, "grad_norm": 0.87109375, "learning_rate": 0.0004999848470861846, "loss": 6.8247, "mean_token_accuracy": 0.11047491133213043, "num_tokens": 2885676.0, "step": 1420 }, { "entropy": 7.036431312561035, "epoch": 0.12453028052084243, "grad_norm": 1.09375, "learning_rate": 0.0004999844832878602, "loss": 6.835, "mean_token_accuracy": 0.11439931541681289, "num_tokens": 2896663.0, "step": 1425 }, { "entropy": 6.9360435009002686, "epoch": 0.12496722887354715, "grad_norm": 0.91796875, "learning_rate": 0.0004999841151742156, "loss": 6.8149, "mean_token_accuracy": 0.1112043671309948, "num_tokens": 2907555.0, "step": 1430 }, { "entropy": 7.092131185531616, "epoch": 0.12540417722625186, "grad_norm": 1.0, "learning_rate": 0.0004999837427452578, "loss": 6.8264, "mean_token_accuracy": 0.11113670319318772, "num_tokens": 2917173.0, "step": 1435 }, { "entropy": 6.94360384941101, "epoch": 0.12584112557895658, "grad_norm": 0.9453125, "learning_rate": 0.000499983366000994, "loss": 6.8074, "mean_token_accuracy": 0.10906619876623154, "num_tokens": 2928268.0, "step": 1440 }, { "entropy": 7.049355125427246, "epoch": 0.12627807393166127, "grad_norm": 1.015625, "learning_rate": 0.0004999829849414312, "loss": 6.7696, "mean_token_accuracy": 0.11551543027162552, "num_tokens": 2938203.0, "step": 1445 }, { "entropy": 6.926217317581177, "epoch": 0.12671502228436599, "grad_norm": 0.9765625, "learning_rate": 0.000499982599566577, "loss": 6.8056, "mean_token_accuracy": 0.11572478860616683, "num_tokens": 2948094.0, "step": 1450 }, { "entropy": 7.031111526489258, "epoch": 0.1271519706370707, "grad_norm": 0.9921875, "learning_rate": 0.0004999822098764385, "loss": 6.8032, "mean_token_accuracy": 0.10698436871170998, "num_tokens": 2957865.0, "step": 1455 }, { "entropy": 6.903406238555908, "epoch": 0.1275889189897754, "grad_norm": 0.87890625, "learning_rate": 0.0004999818158710234, "loss": 6.7279, "mean_token_accuracy": 0.11594445258378983, "num_tokens": 2967880.0, "step": 1460 }, { "entropy": 6.977146100997925, "epoch": 0.12802586734248012, "grad_norm": 1.0078125, "learning_rate": 0.0004999814175503392, "loss": 6.7898, "mean_token_accuracy": 0.11242105588316917, "num_tokens": 2979537.0, "step": 1465 }, { "entropy": 6.962574195861817, "epoch": 0.12846281569518483, "grad_norm": 1.015625, "learning_rate": 0.0004999810149143935, "loss": 6.7715, "mean_token_accuracy": 0.10995072573423385, "num_tokens": 2989700.0, "step": 1470 }, { "entropy": 6.879771089553833, "epoch": 0.12889976404788953, "grad_norm": 0.9765625, "learning_rate": 0.000499980607963194, "loss": 6.7658, "mean_token_accuracy": 0.11039941981434823, "num_tokens": 2999141.0, "step": 1475 }, { "entropy": 6.992912673950196, "epoch": 0.12933671240059424, "grad_norm": 1.046875, "learning_rate": 0.0004999801966967486, "loss": 6.7351, "mean_token_accuracy": 0.11658515930175781, "num_tokens": 3008259.0, "step": 1480 }, { "entropy": 7.007751703262329, "epoch": 0.12977366075329896, "grad_norm": 0.9296875, "learning_rate": 0.0004999797811150652, "loss": 6.771, "mean_token_accuracy": 0.10813285559415817, "num_tokens": 3018281.0, "step": 1485 }, { "entropy": 6.9875898361206055, "epoch": 0.13021060910600368, "grad_norm": 0.92578125, "learning_rate": 0.0004999793612181516, "loss": 6.7811, "mean_token_accuracy": 0.11372531205415726, "num_tokens": 3029062.0, "step": 1490 }, { "entropy": 6.8786805152893065, "epoch": 0.13064755745870837, "grad_norm": 1.046875, "learning_rate": 0.0004999789370060161, "loss": 6.7488, "mean_token_accuracy": 0.11443367153406143, "num_tokens": 3038142.0, "step": 1495 }, { "entropy": 7.021120643615722, "epoch": 0.1310845058114131, "grad_norm": 0.87890625, "learning_rate": 0.0004999785084786667, "loss": 6.845, "mean_token_accuracy": 0.1017142303287983, "num_tokens": 3049123.0, "step": 1500 }, { "entropy": 6.958976125717163, "epoch": 0.1315214541641178, "grad_norm": 0.98828125, "learning_rate": 0.0004999780756361114, "loss": 6.7553, "mean_token_accuracy": 0.10809942036867141, "num_tokens": 3059031.0, "step": 1505 }, { "entropy": 6.929660081863403, "epoch": 0.1319584025168225, "grad_norm": 0.89453125, "learning_rate": 0.0004999776384783589, "loss": 6.787, "mean_token_accuracy": 0.11125006899237633, "num_tokens": 3068830.0, "step": 1510 }, { "entropy": 6.878285837173462, "epoch": 0.13239535086952722, "grad_norm": 0.7578125, "learning_rate": 0.0004999771970054174, "loss": 6.763, "mean_token_accuracy": 0.11348566561937332, "num_tokens": 3080124.0, "step": 1515 }, { "entropy": 7.005362796783447, "epoch": 0.13283229922223194, "grad_norm": 0.87109375, "learning_rate": 0.0004999767512172953, "loss": 6.771, "mean_token_accuracy": 0.10827827528119087, "num_tokens": 3089607.0, "step": 1520 }, { "entropy": 6.95645546913147, "epoch": 0.13326924757493663, "grad_norm": 0.890625, "learning_rate": 0.0004999763011140013, "loss": 6.8462, "mean_token_accuracy": 0.10264672636985779, "num_tokens": 3099363.0, "step": 1525 }, { "entropy": 7.003346729278564, "epoch": 0.13370619592764135, "grad_norm": 0.91796875, "learning_rate": 0.0004999758466955439, "loss": 6.7483, "mean_token_accuracy": 0.11257248520851135, "num_tokens": 3109552.0, "step": 1530 }, { "entropy": 6.890552520751953, "epoch": 0.13414314428034607, "grad_norm": 0.91015625, "learning_rate": 0.0004999753879619319, "loss": 6.7293, "mean_token_accuracy": 0.11494478285312652, "num_tokens": 3119536.0, "step": 1535 }, { "entropy": 6.977446985244751, "epoch": 0.13458009263305076, "grad_norm": 0.76953125, "learning_rate": 0.0004999749249131741, "loss": 6.7719, "mean_token_accuracy": 0.11656006649136544, "num_tokens": 3130552.0, "step": 1540 }, { "entropy": 6.943555307388306, "epoch": 0.13501704098575548, "grad_norm": 0.87109375, "learning_rate": 0.0004999744575492793, "loss": 6.663, "mean_token_accuracy": 0.11371774896979332, "num_tokens": 3140723.0, "step": 1545 }, { "entropy": 6.942564630508423, "epoch": 0.1354539893384602, "grad_norm": 0.84765625, "learning_rate": 0.0004999739858702567, "loss": 6.7176, "mean_token_accuracy": 0.12080485373735428, "num_tokens": 3151031.0, "step": 1550 }, { "entropy": 6.856326866149902, "epoch": 0.1358909376911649, "grad_norm": 0.87890625, "learning_rate": 0.000499973509876115, "loss": 6.7141, "mean_token_accuracy": 0.11423594728112221, "num_tokens": 3161373.0, "step": 1555 }, { "entropy": 6.9513795375823975, "epoch": 0.1363278860438696, "grad_norm": 0.91015625, "learning_rate": 0.0004999730295668634, "loss": 6.7394, "mean_token_accuracy": 0.11483867838978767, "num_tokens": 3171094.0, "step": 1560 }, { "entropy": 6.879623651504517, "epoch": 0.13676483439657433, "grad_norm": 1.0703125, "learning_rate": 0.0004999725449425114, "loss": 6.6879, "mean_token_accuracy": 0.11481415182352066, "num_tokens": 3181646.0, "step": 1565 }, { "entropy": 6.871405601501465, "epoch": 0.13720178274927902, "grad_norm": 0.9765625, "learning_rate": 0.000499972056003068, "loss": 6.6551, "mean_token_accuracy": 0.11951215118169785, "num_tokens": 3190727.0, "step": 1570 }, { "entropy": 6.925275754928589, "epoch": 0.13763873110198374, "grad_norm": 0.96875, "learning_rate": 0.0004999715627485426, "loss": 6.761, "mean_token_accuracy": 0.10644741803407669, "num_tokens": 3200316.0, "step": 1575 }, { "entropy": 6.952586555480957, "epoch": 0.13807567945468846, "grad_norm": 0.90625, "learning_rate": 0.000499971065178945, "loss": 6.7275, "mean_token_accuracy": 0.10815547704696656, "num_tokens": 3211830.0, "step": 1580 }, { "entropy": 6.832159805297851, "epoch": 0.13851262780739318, "grad_norm": 0.9609375, "learning_rate": 0.0004999705632942843, "loss": 6.739, "mean_token_accuracy": 0.11103120297193528, "num_tokens": 3222711.0, "step": 1585 }, { "entropy": 6.977508449554444, "epoch": 0.13894957616009787, "grad_norm": 0.8984375, "learning_rate": 0.0004999700570945704, "loss": 6.657, "mean_token_accuracy": 0.12132718712091446, "num_tokens": 3232810.0, "step": 1590 }, { "entropy": 6.748742961883545, "epoch": 0.1393865245128026, "grad_norm": 0.984375, "learning_rate": 0.0004999695465798128, "loss": 6.722, "mean_token_accuracy": 0.11645966917276382, "num_tokens": 3243366.0, "step": 1595 }, { "entropy": 7.011563968658447, "epoch": 0.1398234728655073, "grad_norm": 0.89453125, "learning_rate": 0.0004999690317500215, "loss": 6.7095, "mean_token_accuracy": 0.11738921105861663, "num_tokens": 3254000.0, "step": 1600 }, { "entropy": 6.944188117980957, "epoch": 0.140260421218212, "grad_norm": 1.03125, "learning_rate": 0.0004999685126052063, "loss": 6.7427, "mean_token_accuracy": 0.11331361308693885, "num_tokens": 3263601.0, "step": 1605 }, { "entropy": 6.870913124084472, "epoch": 0.14069736957091672, "grad_norm": 0.921875, "learning_rate": 0.0004999679891453772, "loss": 6.7751, "mean_token_accuracy": 0.10785396099090576, "num_tokens": 3273243.0, "step": 1610 }, { "entropy": 6.945408201217651, "epoch": 0.14113431792362144, "grad_norm": 0.80078125, "learning_rate": 0.000499967461370544, "loss": 6.7204, "mean_token_accuracy": 0.11248369067907334, "num_tokens": 3284208.0, "step": 1615 }, { "entropy": 6.906504917144775, "epoch": 0.14157126627632613, "grad_norm": 0.94921875, "learning_rate": 0.0004999669292807172, "loss": 6.6823, "mean_token_accuracy": 0.11680415868759156, "num_tokens": 3294216.0, "step": 1620 }, { "entropy": 6.915546798706055, "epoch": 0.14200821462903085, "grad_norm": 0.953125, "learning_rate": 0.0004999663928759066, "loss": 6.7472, "mean_token_accuracy": 0.11192744225263596, "num_tokens": 3304576.0, "step": 1625 }, { "entropy": 6.897689294815064, "epoch": 0.14244516298173557, "grad_norm": 0.94921875, "learning_rate": 0.0004999658521561229, "loss": 6.7145, "mean_token_accuracy": 0.10784238651394844, "num_tokens": 3314214.0, "step": 1630 }, { "entropy": 6.929960298538208, "epoch": 0.14288211133444026, "grad_norm": 0.93359375, "learning_rate": 0.0004999653071213763, "loss": 6.7304, "mean_token_accuracy": 0.10703980401158333, "num_tokens": 3325527.0, "step": 1635 }, { "entropy": 6.783003330230713, "epoch": 0.14331905968714498, "grad_norm": 0.97265625, "learning_rate": 0.0004999647577716771, "loss": 6.6364, "mean_token_accuracy": 0.11789060086011886, "num_tokens": 3334511.0, "step": 1640 }, { "entropy": 6.935398960113526, "epoch": 0.1437560080398497, "grad_norm": 0.97265625, "learning_rate": 0.0004999642041070361, "loss": 6.6406, "mean_token_accuracy": 0.12125914841890335, "num_tokens": 3343922.0, "step": 1645 }, { "entropy": 6.825817012786866, "epoch": 0.1441929563925544, "grad_norm": 0.93359375, "learning_rate": 0.0004999636461274637, "loss": 6.6609, "mean_token_accuracy": 0.11183852404356003, "num_tokens": 3353895.0, "step": 1650 }, { "entropy": 6.892046880722046, "epoch": 0.1446299047452591, "grad_norm": 0.83203125, "learning_rate": 0.0004999630838329706, "loss": 6.712, "mean_token_accuracy": 0.11429799050092697, "num_tokens": 3364637.0, "step": 1655 }, { "entropy": 6.898443794250488, "epoch": 0.14506685309796383, "grad_norm": 0.984375, "learning_rate": 0.0004999625172235679, "loss": 6.6721, "mean_token_accuracy": 0.11531461402773857, "num_tokens": 3374308.0, "step": 1660 }, { "entropy": 6.860412073135376, "epoch": 0.14550380145066852, "grad_norm": 0.91796875, "learning_rate": 0.000499961946299266, "loss": 6.6627, "mean_token_accuracy": 0.11255936473608016, "num_tokens": 3383637.0, "step": 1665 }, { "entropy": 6.8619140625, "epoch": 0.14594074980337324, "grad_norm": 0.9453125, "learning_rate": 0.0004999613710600763, "loss": 6.7309, "mean_token_accuracy": 0.10881676152348518, "num_tokens": 3394150.0, "step": 1670 }, { "entropy": 6.886914920806885, "epoch": 0.14637769815607796, "grad_norm": 0.96484375, "learning_rate": 0.0004999607915060094, "loss": 6.6871, "mean_token_accuracy": 0.11321992725133896, "num_tokens": 3404445.0, "step": 1675 }, { "entropy": 6.786718940734863, "epoch": 0.14681464650878268, "grad_norm": 0.796875, "learning_rate": 0.0004999602076370768, "loss": 6.6002, "mean_token_accuracy": 0.12198357656598091, "num_tokens": 3415183.0, "step": 1680 }, { "entropy": 6.8183753490448, "epoch": 0.14725159486148737, "grad_norm": 0.9375, "learning_rate": 0.0004999596194532895, "loss": 6.5695, "mean_token_accuracy": 0.1226851724088192, "num_tokens": 3424824.0, "step": 1685 }, { "entropy": 6.875542020797729, "epoch": 0.1476885432141921, "grad_norm": 0.94140625, "learning_rate": 0.0004999590269546588, "loss": 6.6749, "mean_token_accuracy": 0.11421856135129929, "num_tokens": 3434789.0, "step": 1690 }, { "entropy": 6.737638378143311, "epoch": 0.1481254915668968, "grad_norm": 0.875, "learning_rate": 0.0004999584301411961, "loss": 6.5652, "mean_token_accuracy": 0.1369031101465225, "num_tokens": 3445810.0, "step": 1695 }, { "entropy": 6.955615425109864, "epoch": 0.1485624399196015, "grad_norm": 0.9609375, "learning_rate": 0.0004999578290129129, "loss": 6.7108, "mean_token_accuracy": 0.11079858317971229, "num_tokens": 3455510.0, "step": 1700 }, { "entropy": 6.795374155044556, "epoch": 0.14899938827230622, "grad_norm": 0.859375, "learning_rate": 0.0004999572235698206, "loss": 6.6809, "mean_token_accuracy": 0.11354952603578568, "num_tokens": 3465785.0, "step": 1705 }, { "entropy": 6.860705327987671, "epoch": 0.14943633662501093, "grad_norm": 0.8515625, "learning_rate": 0.0004999566138119308, "loss": 6.7346, "mean_token_accuracy": 0.10918433368206024, "num_tokens": 3477568.0, "step": 1710 }, { "entropy": 6.796298360824585, "epoch": 0.14987328497771563, "grad_norm": 0.9375, "learning_rate": 0.0004999559997392554, "loss": 6.5705, "mean_token_accuracy": 0.13033040314912797, "num_tokens": 3487703.0, "step": 1715 }, { "entropy": 6.803538990020752, "epoch": 0.15031023333042035, "grad_norm": 0.90234375, "learning_rate": 0.0004999553813518061, "loss": 6.6467, "mean_token_accuracy": 0.11564805582165719, "num_tokens": 3497757.0, "step": 1720 }, { "entropy": 6.815519523620606, "epoch": 0.15074718168312506, "grad_norm": 0.9609375, "learning_rate": 0.0004999547586495946, "loss": 6.6123, "mean_token_accuracy": 0.11909747421741486, "num_tokens": 3507594.0, "step": 1725 }, { "entropy": 6.858670568466186, "epoch": 0.15118413003582976, "grad_norm": 0.98046875, "learning_rate": 0.0004999541316326329, "loss": 6.6982, "mean_token_accuracy": 0.11421534195542335, "num_tokens": 3517889.0, "step": 1730 }, { "entropy": 6.789118671417237, "epoch": 0.15162107838853447, "grad_norm": 0.8828125, "learning_rate": 0.0004999535003009332, "loss": 6.6842, "mean_token_accuracy": 0.11443898230791091, "num_tokens": 3528158.0, "step": 1735 }, { "entropy": 6.85327639579773, "epoch": 0.1520580267412392, "grad_norm": 0.80859375, "learning_rate": 0.0004999528646545074, "loss": 6.6617, "mean_token_accuracy": 0.11684061735868453, "num_tokens": 3539099.0, "step": 1740 }, { "entropy": 6.868143224716187, "epoch": 0.15249497509394389, "grad_norm": 0.94140625, "learning_rate": 0.0004999522246933678, "loss": 6.6744, "mean_token_accuracy": 0.11591163650155067, "num_tokens": 3549819.0, "step": 1745 }, { "entropy": 6.924664878845215, "epoch": 0.1529319234466486, "grad_norm": 1.03125, "learning_rate": 0.0004999515804175268, "loss": 6.6708, "mean_token_accuracy": 0.1160687893629074, "num_tokens": 3560022.0, "step": 1750 }, { "entropy": 6.796440887451172, "epoch": 0.15336887179935332, "grad_norm": 0.921875, "learning_rate": 0.0004999509318269964, "loss": 6.6229, "mean_token_accuracy": 0.11483302041888237, "num_tokens": 3569681.0, "step": 1755 }, { "entropy": 6.931779527664185, "epoch": 0.15380582015205801, "grad_norm": 0.93359375, "learning_rate": 0.0004999502789217894, "loss": 6.7187, "mean_token_accuracy": 0.11464278921484947, "num_tokens": 3580731.0, "step": 1760 }, { "entropy": 6.735879182815552, "epoch": 0.15424276850476273, "grad_norm": 0.9296875, "learning_rate": 0.0004999496217019181, "loss": 6.6771, "mean_token_accuracy": 0.12017816901206971, "num_tokens": 3590482.0, "step": 1765 }, { "entropy": 6.846047735214233, "epoch": 0.15467971685746745, "grad_norm": 0.9765625, "learning_rate": 0.0004999489601673952, "loss": 6.6588, "mean_token_accuracy": 0.11184544190764427, "num_tokens": 3600988.0, "step": 1770 }, { "entropy": 6.966546869277954, "epoch": 0.15511666521017214, "grad_norm": 0.80859375, "learning_rate": 0.0004999482943182334, "loss": 6.7207, "mean_token_accuracy": 0.11034572273492813, "num_tokens": 3611226.0, "step": 1775 }, { "entropy": 6.7466967582702635, "epoch": 0.15555361356287686, "grad_norm": 0.890625, "learning_rate": 0.0004999476241544454, "loss": 6.6406, "mean_token_accuracy": 0.11693034246563912, "num_tokens": 3621324.0, "step": 1780 }, { "entropy": 6.859796237945557, "epoch": 0.15599056191558158, "grad_norm": 0.96875, "learning_rate": 0.0004999469496760441, "loss": 6.5745, "mean_token_accuracy": 0.11757055521011353, "num_tokens": 3631650.0, "step": 1785 }, { "entropy": 6.793846988677979, "epoch": 0.1564275102682863, "grad_norm": 0.921875, "learning_rate": 0.0004999462708830425, "loss": 6.5964, "mean_token_accuracy": 0.13014772459864615, "num_tokens": 3641173.0, "step": 1790 }, { "entropy": 6.7543669700622555, "epoch": 0.156864458620991, "grad_norm": 0.94140625, "learning_rate": 0.0004999455877754535, "loss": 6.6099, "mean_token_accuracy": 0.11783762127161027, "num_tokens": 3651846.0, "step": 1795 }, { "entropy": 6.839160680770874, "epoch": 0.1573014069736957, "grad_norm": 0.921875, "learning_rate": 0.0004999449003532903, "loss": 6.6181, "mean_token_accuracy": 0.11612390056252479, "num_tokens": 3661174.0, "step": 1800 }, { "entropy": 6.767947387695313, "epoch": 0.15773835532640043, "grad_norm": 0.91015625, "learning_rate": 0.0004999442086165661, "loss": 6.5785, "mean_token_accuracy": 0.11563654839992524, "num_tokens": 3671042.0, "step": 1805 }, { "entropy": 6.836207246780395, "epoch": 0.15817530367910512, "grad_norm": 0.89453125, "learning_rate": 0.000499943512565294, "loss": 6.5404, "mean_token_accuracy": 0.11653607487678527, "num_tokens": 3681206.0, "step": 1810 }, { "entropy": 6.777206325531006, "epoch": 0.15861225203180984, "grad_norm": 0.921875, "learning_rate": 0.0004999428121994874, "loss": 6.6427, "mean_token_accuracy": 0.11898047327995301, "num_tokens": 3691748.0, "step": 1815 }, { "entropy": 6.702393054962158, "epoch": 0.15904920038451456, "grad_norm": 1.0234375, "learning_rate": 0.0004999421075191599, "loss": 6.5483, "mean_token_accuracy": 0.12115112468600273, "num_tokens": 3701730.0, "step": 1820 }, { "entropy": 6.887295866012574, "epoch": 0.15948614873721925, "grad_norm": 1.125, "learning_rate": 0.0004999413985243249, "loss": 6.6747, "mean_token_accuracy": 0.1129259705543518, "num_tokens": 3712525.0, "step": 1825 }, { "entropy": 6.863398599624634, "epoch": 0.15992309708992397, "grad_norm": 0.95703125, "learning_rate": 0.000499940685214996, "loss": 6.6086, "mean_token_accuracy": 0.11575344502925873, "num_tokens": 3722016.0, "step": 1830 }, { "entropy": 6.761053848266601, "epoch": 0.1603600454426287, "grad_norm": 0.9140625, "learning_rate": 0.0004999399675911869, "loss": 6.5318, "mean_token_accuracy": 0.12198757007718086, "num_tokens": 3731299.0, "step": 1835 }, { "entropy": 6.743390274047852, "epoch": 0.16079699379533338, "grad_norm": 0.9921875, "learning_rate": 0.0004999392456529113, "loss": 6.5806, "mean_token_accuracy": 0.12458991408348083, "num_tokens": 3740922.0, "step": 1840 }, { "entropy": 6.758446550369262, "epoch": 0.1612339421480381, "grad_norm": 0.93359375, "learning_rate": 0.0004999385194001831, "loss": 6.5937, "mean_token_accuracy": 0.11810147613286973, "num_tokens": 3750339.0, "step": 1845 }, { "entropy": 6.787387943267822, "epoch": 0.16167089050074282, "grad_norm": 0.953125, "learning_rate": 0.0004999377888330164, "loss": 6.5467, "mean_token_accuracy": 0.12232641279697418, "num_tokens": 3761379.0, "step": 1850 }, { "entropy": 6.749542856216431, "epoch": 0.1621078388534475, "grad_norm": 0.90625, "learning_rate": 0.0004999370539514249, "loss": 6.6294, "mean_token_accuracy": 0.11457357108592987, "num_tokens": 3771649.0, "step": 1855 }, { "entropy": 6.757665014266967, "epoch": 0.16254478720615223, "grad_norm": 0.92578125, "learning_rate": 0.0004999363147554229, "loss": 6.5497, "mean_token_accuracy": 0.12577750012278557, "num_tokens": 3782393.0, "step": 1860 }, { "entropy": 6.820600986480713, "epoch": 0.16298173555885695, "grad_norm": 0.90234375, "learning_rate": 0.0004999355712450244, "loss": 6.5986, "mean_token_accuracy": 0.12362995967268944, "num_tokens": 3792849.0, "step": 1865 }, { "entropy": 6.747550010681152, "epoch": 0.16341868391156164, "grad_norm": 0.98046875, "learning_rate": 0.0004999348234202438, "loss": 6.5515, "mean_token_accuracy": 0.12130374014377594, "num_tokens": 3803848.0, "step": 1870 }, { "entropy": 6.627656269073486, "epoch": 0.16385563226426636, "grad_norm": 0.90625, "learning_rate": 0.0004999340712810956, "loss": 6.4677, "mean_token_accuracy": 0.13533140793442727, "num_tokens": 3814704.0, "step": 1875 }, { "entropy": 6.747098636627197, "epoch": 0.16429258061697108, "grad_norm": 0.86328125, "learning_rate": 0.0004999333148275939, "loss": 6.6244, "mean_token_accuracy": 0.11492595672607422, "num_tokens": 3824955.0, "step": 1880 }, { "entropy": 6.810025024414062, "epoch": 0.1647295289696758, "grad_norm": 0.86328125, "learning_rate": 0.0004999325540597535, "loss": 6.5992, "mean_token_accuracy": 0.12268827185034752, "num_tokens": 3836540.0, "step": 1885 }, { "entropy": 6.680448246002197, "epoch": 0.1651664773223805, "grad_norm": 0.921875, "learning_rate": 0.0004999317889775887, "loss": 6.4789, "mean_token_accuracy": 0.1307223454117775, "num_tokens": 3846472.0, "step": 1890 }, { "entropy": 6.797214794158935, "epoch": 0.1656034256750852, "grad_norm": 0.88671875, "learning_rate": 0.0004999310195811143, "loss": 6.6013, "mean_token_accuracy": 0.11527118012309075, "num_tokens": 3857187.0, "step": 1895 }, { "entropy": 6.796212434768677, "epoch": 0.16604037402778993, "grad_norm": 0.9375, "learning_rate": 0.0004999302458703451, "loss": 6.5513, "mean_token_accuracy": 0.12751033753156663, "num_tokens": 3866259.0, "step": 1900 }, { "entropy": 6.679151391983032, "epoch": 0.16647732238049462, "grad_norm": 0.953125, "learning_rate": 0.000499929467845296, "loss": 6.6161, "mean_token_accuracy": 0.11295140087604523, "num_tokens": 3876869.0, "step": 1905 }, { "entropy": 6.8329041481018065, "epoch": 0.16691427073319934, "grad_norm": 0.8203125, "learning_rate": 0.0004999286855059818, "loss": 6.59, "mean_token_accuracy": 0.12256261631846428, "num_tokens": 3888278.0, "step": 1910 }, { "entropy": 6.806984758377075, "epoch": 0.16735121908590406, "grad_norm": 1.0703125, "learning_rate": 0.0004999278988524177, "loss": 6.6406, "mean_token_accuracy": 0.11997235789895058, "num_tokens": 3898648.0, "step": 1915 }, { "entropy": 6.776583909988403, "epoch": 0.16778816743860875, "grad_norm": 0.98046875, "learning_rate": 0.0004999271078846184, "loss": 6.573, "mean_token_accuracy": 0.11964118704199792, "num_tokens": 3908282.0, "step": 1920 }, { "entropy": 6.679054212570191, "epoch": 0.16822511579131347, "grad_norm": 0.87890625, "learning_rate": 0.0004999263126025994, "loss": 6.5397, "mean_token_accuracy": 0.12275912463665009, "num_tokens": 3918333.0, "step": 1925 }, { "entropy": 6.806920671463013, "epoch": 0.1686620641440182, "grad_norm": 0.9453125, "learning_rate": 0.0004999255130063759, "loss": 6.5461, "mean_token_accuracy": 0.12174615561962128, "num_tokens": 3927403.0, "step": 1930 }, { "entropy": 6.764342546463013, "epoch": 0.16909901249672288, "grad_norm": 0.94140625, "learning_rate": 0.0004999247090959633, "loss": 6.5812, "mean_token_accuracy": 0.12118082121014595, "num_tokens": 3937352.0, "step": 1935 }, { "entropy": 6.679003667831421, "epoch": 0.1695359608494276, "grad_norm": 0.8671875, "learning_rate": 0.0004999239008713767, "loss": 6.4088, "mean_token_accuracy": 0.12937364503741264, "num_tokens": 3947164.0, "step": 1940 }, { "entropy": 6.770146179199219, "epoch": 0.16997290920213232, "grad_norm": 0.8203125, "learning_rate": 0.0004999230883326319, "loss": 6.5737, "mean_token_accuracy": 0.1233607918024063, "num_tokens": 3956887.0, "step": 1945 }, { "entropy": 6.735566186904907, "epoch": 0.170409857554837, "grad_norm": 0.875, "learning_rate": 0.0004999222714797445, "loss": 6.56, "mean_token_accuracy": 0.11969926655292511, "num_tokens": 3966542.0, "step": 1950 }, { "entropy": 6.785258102416992, "epoch": 0.17084680590754173, "grad_norm": 0.90625, "learning_rate": 0.00049992145031273, "loss": 6.5065, "mean_token_accuracy": 0.1332083135843277, "num_tokens": 3976127.0, "step": 1955 }, { "entropy": 6.6167535305023195, "epoch": 0.17128375426024645, "grad_norm": 0.86328125, "learning_rate": 0.0004999206248316043, "loss": 6.4685, "mean_token_accuracy": 0.12284221649169921, "num_tokens": 3987371.0, "step": 1960 }, { "entropy": 6.667543745040893, "epoch": 0.17172070261295114, "grad_norm": 0.921875, "learning_rate": 0.000499919795036383, "loss": 6.4859, "mean_token_accuracy": 0.1272851638495922, "num_tokens": 3997924.0, "step": 1965 }, { "entropy": 6.740949630737305, "epoch": 0.17215765096565586, "grad_norm": 0.8515625, "learning_rate": 0.0004999189609270823, "loss": 6.5751, "mean_token_accuracy": 0.12322761192917824, "num_tokens": 4009150.0, "step": 1970 }, { "entropy": 6.729563045501709, "epoch": 0.17259459931836058, "grad_norm": 0.8671875, "learning_rate": 0.000499918122503718, "loss": 6.5836, "mean_token_accuracy": 0.12200360670685768, "num_tokens": 4018899.0, "step": 1975 }, { "entropy": 6.730152893066406, "epoch": 0.17303154767106527, "grad_norm": 0.93359375, "learning_rate": 0.0004999172797663064, "loss": 6.5475, "mean_token_accuracy": 0.12035959288477897, "num_tokens": 4028652.0, "step": 1980 }, { "entropy": 6.713821458816528, "epoch": 0.17346849602376999, "grad_norm": 0.8359375, "learning_rate": 0.0004999164327148634, "loss": 6.5693, "mean_token_accuracy": 0.12123406901955605, "num_tokens": 4039819.0, "step": 1985 }, { "entropy": 6.741577911376953, "epoch": 0.1739054443764747, "grad_norm": 0.921875, "learning_rate": 0.0004999155813494053, "loss": 6.4755, "mean_token_accuracy": 0.1275830537080765, "num_tokens": 4050029.0, "step": 1990 }, { "entropy": 6.6802998065948485, "epoch": 0.17434239272917942, "grad_norm": 0.83203125, "learning_rate": 0.0004999147256699487, "loss": 6.5211, "mean_token_accuracy": 0.12550380676984788, "num_tokens": 4060497.0, "step": 1995 }, { "entropy": 6.783202648162842, "epoch": 0.17477934108188412, "grad_norm": 0.8515625, "learning_rate": 0.0004999138656765096, "loss": 6.4997, "mean_token_accuracy": 0.12641414254903793, "num_tokens": 4071477.0, "step": 2000 }, { "entropy": 6.732838535308838, "epoch": 0.17521628943458883, "grad_norm": 0.86328125, "learning_rate": 0.0004999130013691049, "loss": 6.584, "mean_token_accuracy": 0.11925829127430916, "num_tokens": 4081869.0, "step": 2005 }, { "entropy": 6.760075616836548, "epoch": 0.17565323778729355, "grad_norm": 0.890625, "learning_rate": 0.0004999121327477509, "loss": 6.5618, "mean_token_accuracy": 0.1242613822221756, "num_tokens": 4092797.0, "step": 2010 }, { "entropy": 6.757962799072265, "epoch": 0.17609018613999824, "grad_norm": 1.015625, "learning_rate": 0.0004999112598124642, "loss": 6.5178, "mean_token_accuracy": 0.12427477762103081, "num_tokens": 4103688.0, "step": 2015 }, { "entropy": 6.619799852371216, "epoch": 0.17652713449270296, "grad_norm": 0.94140625, "learning_rate": 0.0004999103825632618, "loss": 6.4814, "mean_token_accuracy": 0.12500133290886878, "num_tokens": 4114037.0, "step": 2020 }, { "entropy": 6.713038921356201, "epoch": 0.17696408284540768, "grad_norm": 0.91796875, "learning_rate": 0.0004999095010001605, "loss": 6.4755, "mean_token_accuracy": 0.11943754628300667, "num_tokens": 4124164.0, "step": 2025 }, { "entropy": 6.727624893188477, "epoch": 0.17740103119811237, "grad_norm": 0.8984375, "learning_rate": 0.000499908615123177, "loss": 6.5808, "mean_token_accuracy": 0.1142855279147625, "num_tokens": 4134225.0, "step": 2030 }, { "entropy": 6.74792366027832, "epoch": 0.1778379795508171, "grad_norm": 0.8671875, "learning_rate": 0.0004999077249323284, "loss": 6.6281, "mean_token_accuracy": 0.12126999646425247, "num_tokens": 4145962.0, "step": 2035 }, { "entropy": 6.74753704071045, "epoch": 0.1782749279035218, "grad_norm": 0.8515625, "learning_rate": 0.0004999068304276319, "loss": 6.5234, "mean_token_accuracy": 0.12188527584075928, "num_tokens": 4156572.0, "step": 2040 }, { "entropy": 6.6771139144897464, "epoch": 0.1787118762562265, "grad_norm": 0.91796875, "learning_rate": 0.0004999059316091045, "loss": 6.5804, "mean_token_accuracy": 0.11935446932911872, "num_tokens": 4166960.0, "step": 2045 }, { "entropy": 6.767083215713501, "epoch": 0.17914882460893122, "grad_norm": 0.8828125, "learning_rate": 0.0004999050284767634, "loss": 6.5431, "mean_token_accuracy": 0.12220514565706253, "num_tokens": 4177833.0, "step": 2050 }, { "entropy": 6.569900465011597, "epoch": 0.17958577296163594, "grad_norm": 1.0546875, "learning_rate": 0.0004999041210306261, "loss": 6.4581, "mean_token_accuracy": 0.12861283570528032, "num_tokens": 4187858.0, "step": 2055 }, { "entropy": 6.775664949417115, "epoch": 0.18002272131434063, "grad_norm": 0.89453125, "learning_rate": 0.0004999032092707098, "loss": 6.5951, "mean_token_accuracy": 0.11695825308561325, "num_tokens": 4198207.0, "step": 2060 }, { "entropy": 6.746979188919068, "epoch": 0.18045966966704535, "grad_norm": 1.0, "learning_rate": 0.0004999022931970323, "loss": 6.4872, "mean_token_accuracy": 0.12345504090189933, "num_tokens": 4207594.0, "step": 2065 }, { "entropy": 6.626251983642578, "epoch": 0.18089661801975007, "grad_norm": 0.9140625, "learning_rate": 0.0004999013728096107, "loss": 6.4911, "mean_token_accuracy": 0.12829106748104097, "num_tokens": 4217334.0, "step": 2070 }, { "entropy": 6.721229362487793, "epoch": 0.18133356637245476, "grad_norm": 0.921875, "learning_rate": 0.000499900448108463, "loss": 6.4728, "mean_token_accuracy": 0.1287317655980587, "num_tokens": 4226407.0, "step": 2075 }, { "entropy": 6.631599426269531, "epoch": 0.18177051472515948, "grad_norm": 0.91796875, "learning_rate": 0.000499899519093607, "loss": 6.4147, "mean_token_accuracy": 0.1277851089835167, "num_tokens": 4237818.0, "step": 2080 }, { "entropy": 6.699046468734741, "epoch": 0.1822074630778642, "grad_norm": 1.0703125, "learning_rate": 0.0004998985857650603, "loss": 6.5392, "mean_token_accuracy": 0.11802871823310852, "num_tokens": 4247783.0, "step": 2085 }, { "entropy": 6.62796630859375, "epoch": 0.18264441143056892, "grad_norm": 0.91796875, "learning_rate": 0.0004998976481228409, "loss": 6.4955, "mean_token_accuracy": 0.12168094217777252, "num_tokens": 4258049.0, "step": 2090 }, { "entropy": 6.694241905212403, "epoch": 0.1830813597832736, "grad_norm": 0.82421875, "learning_rate": 0.0004998967061669668, "loss": 6.4824, "mean_token_accuracy": 0.12094468101859093, "num_tokens": 4269357.0, "step": 2095 }, { "entropy": 6.694693088531494, "epoch": 0.18351830813597833, "grad_norm": 0.9453125, "learning_rate": 0.0004998957598974559, "loss": 6.4142, "mean_token_accuracy": 0.13116534650325776, "num_tokens": 4279576.0, "step": 2100 }, { "entropy": 6.660217428207398, "epoch": 0.18395525648868305, "grad_norm": 0.91796875, "learning_rate": 0.0004998948093143266, "loss": 6.4518, "mean_token_accuracy": 0.13070998936891556, "num_tokens": 4289761.0, "step": 2105 }, { "entropy": 6.606316137313843, "epoch": 0.18439220484138774, "grad_norm": 0.92578125, "learning_rate": 0.000499893854417597, "loss": 6.3993, "mean_token_accuracy": 0.13042399287223816, "num_tokens": 4299231.0, "step": 2110 }, { "entropy": 6.696398591995239, "epoch": 0.18482915319409246, "grad_norm": 0.94921875, "learning_rate": 0.0004998928952072854, "loss": 6.5671, "mean_token_accuracy": 0.12065399885177612, "num_tokens": 4308687.0, "step": 2115 }, { "entropy": 6.724217700958252, "epoch": 0.18526610154679718, "grad_norm": 0.98828125, "learning_rate": 0.0004998919316834102, "loss": 6.5186, "mean_token_accuracy": 0.1235981173813343, "num_tokens": 4318183.0, "step": 2120 }, { "entropy": 6.707517290115357, "epoch": 0.18570304989950187, "grad_norm": 0.9453125, "learning_rate": 0.00049989096384599, "loss": 6.544, "mean_token_accuracy": 0.11985958814620971, "num_tokens": 4328482.0, "step": 2125 }, { "entropy": 6.697282981872559, "epoch": 0.1861399982522066, "grad_norm": 1.0859375, "learning_rate": 0.0004998899916950431, "loss": 6.4329, "mean_token_accuracy": 0.1220651850104332, "num_tokens": 4339313.0, "step": 2130 }, { "entropy": 6.647680282592773, "epoch": 0.1865769466049113, "grad_norm": 0.9765625, "learning_rate": 0.0004998890152305885, "loss": 6.5417, "mean_token_accuracy": 0.12274084091186524, "num_tokens": 4350299.0, "step": 2135 }, { "entropy": 6.823352575302124, "epoch": 0.187013894957616, "grad_norm": 0.90234375, "learning_rate": 0.0004998880344526447, "loss": 6.4685, "mean_token_accuracy": 0.12892222180962562, "num_tokens": 4361424.0, "step": 2140 }, { "entropy": 6.548090219497681, "epoch": 0.18745084331032072, "grad_norm": 0.875, "learning_rate": 0.0004998870493612306, "loss": 6.4544, "mean_token_accuracy": 0.12490695714950562, "num_tokens": 4371480.0, "step": 2145 }, { "entropy": 6.629548788070679, "epoch": 0.18788779166302544, "grad_norm": 0.86328125, "learning_rate": 0.0004998860599563649, "loss": 6.4753, "mean_token_accuracy": 0.12593501806259155, "num_tokens": 4381951.0, "step": 2150 }, { "entropy": 6.677478265762329, "epoch": 0.18832474001573013, "grad_norm": 0.85546875, "learning_rate": 0.0004998850662380668, "loss": 6.5327, "mean_token_accuracy": 0.11975304633378983, "num_tokens": 4392290.0, "step": 2155 }, { "entropy": 6.600126171112061, "epoch": 0.18876168836843485, "grad_norm": 0.8515625, "learning_rate": 0.0004998840682063553, "loss": 6.281, "mean_token_accuracy": 0.1401298873126507, "num_tokens": 4403350.0, "step": 2160 }, { "entropy": 6.602562713623047, "epoch": 0.18919863672113957, "grad_norm": 0.8515625, "learning_rate": 0.0004998830658612496, "loss": 6.4852, "mean_token_accuracy": 0.12300979048013687, "num_tokens": 4413171.0, "step": 2165 }, { "entropy": 6.6313416957855225, "epoch": 0.18963558507384426, "grad_norm": 0.9453125, "learning_rate": 0.0004998820592027688, "loss": 6.4376, "mean_token_accuracy": 0.12936783209443092, "num_tokens": 4424371.0, "step": 2170 }, { "entropy": 6.684165811538696, "epoch": 0.19007253342654898, "grad_norm": 0.90625, "learning_rate": 0.0004998810482309322, "loss": 6.4014, "mean_token_accuracy": 0.12163952067494392, "num_tokens": 4434040.0, "step": 2175 }, { "entropy": 6.727186775207519, "epoch": 0.1905094817792537, "grad_norm": 0.92578125, "learning_rate": 0.0004998800329457595, "loss": 6.5153, "mean_token_accuracy": 0.11811432018876075, "num_tokens": 4444663.0, "step": 2180 }, { "entropy": 6.65099720954895, "epoch": 0.1909464301319584, "grad_norm": 0.90234375, "learning_rate": 0.0004998790133472697, "loss": 6.4614, "mean_token_accuracy": 0.12238967642188073, "num_tokens": 4454733.0, "step": 2185 }, { "entropy": 6.613533592224121, "epoch": 0.1913833784846631, "grad_norm": 0.9140625, "learning_rate": 0.0004998779894354827, "loss": 6.4482, "mean_token_accuracy": 0.12639879956841468, "num_tokens": 4464286.0, "step": 2190 }, { "entropy": 6.706346750259399, "epoch": 0.19182032683736783, "grad_norm": 0.86328125, "learning_rate": 0.000499876961210418, "loss": 6.4161, "mean_token_accuracy": 0.13247158452868463, "num_tokens": 4475005.0, "step": 2195 }, { "entropy": 6.5794055461883545, "epoch": 0.19225727519007255, "grad_norm": 0.92578125, "learning_rate": 0.0004998759286720953, "loss": 6.3851, "mean_token_accuracy": 0.12563437446951867, "num_tokens": 4484606.0, "step": 2200 }, { "entropy": 6.607835817337036, "epoch": 0.19269422354277724, "grad_norm": 0.9375, "learning_rate": 0.0004998748918205345, "loss": 6.4861, "mean_token_accuracy": 0.12292944341897964, "num_tokens": 4494930.0, "step": 2205 }, { "entropy": 6.6335704803466795, "epoch": 0.19313117189548196, "grad_norm": 0.921875, "learning_rate": 0.0004998738506557554, "loss": 6.4963, "mean_token_accuracy": 0.12030340284109116, "num_tokens": 4505304.0, "step": 2210 }, { "entropy": 6.737761306762695, "epoch": 0.19356812024818668, "grad_norm": 0.921875, "learning_rate": 0.000499872805177778, "loss": 6.4433, "mean_token_accuracy": 0.1285339929163456, "num_tokens": 4514333.0, "step": 2215 }, { "entropy": 6.530314922332764, "epoch": 0.19400506860089137, "grad_norm": 0.94921875, "learning_rate": 0.0004998717553866225, "loss": 6.4858, "mean_token_accuracy": 0.13358827754855157, "num_tokens": 4525175.0, "step": 2220 }, { "entropy": 6.710753393173218, "epoch": 0.1944420169535961, "grad_norm": 0.8828125, "learning_rate": 0.0004998707012823087, "loss": 6.3632, "mean_token_accuracy": 0.12810946255922318, "num_tokens": 4534212.0, "step": 2225 }, { "entropy": 6.524042177200317, "epoch": 0.1948789653063008, "grad_norm": 0.82421875, "learning_rate": 0.0004998696428648573, "loss": 6.5338, "mean_token_accuracy": 0.12357461825013161, "num_tokens": 4545141.0, "step": 2230 }, { "entropy": 6.690764856338501, "epoch": 0.1953159136590055, "grad_norm": 0.9921875, "learning_rate": 0.0004998685801342881, "loss": 6.404, "mean_token_accuracy": 0.13337788805365564, "num_tokens": 4554410.0, "step": 2235 }, { "entropy": 6.552084350585938, "epoch": 0.19575286201171022, "grad_norm": 0.921875, "learning_rate": 0.0004998675130906217, "loss": 6.4012, "mean_token_accuracy": 0.13402877897024154, "num_tokens": 4564397.0, "step": 2240 }, { "entropy": 6.539749431610107, "epoch": 0.19618981036441493, "grad_norm": 0.875, "learning_rate": 0.0004998664417338787, "loss": 6.3971, "mean_token_accuracy": 0.13362254872918128, "num_tokens": 4573986.0, "step": 2245 }, { "entropy": 6.70291690826416, "epoch": 0.19662675871711963, "grad_norm": 1.1015625, "learning_rate": 0.0004998653660640794, "loss": 6.4073, "mean_token_accuracy": 0.1318839006125927, "num_tokens": 4583449.0, "step": 2250 }, { "entropy": 6.56984543800354, "epoch": 0.19706370706982435, "grad_norm": 1.046875, "learning_rate": 0.0004998642860812447, "loss": 6.4369, "mean_token_accuracy": 0.12867740020155907, "num_tokens": 4593637.0, "step": 2255 }, { "entropy": 6.647236490249634, "epoch": 0.19750065542252906, "grad_norm": 1.0234375, "learning_rate": 0.0004998632017853951, "loss": 6.4067, "mean_token_accuracy": 0.13120522499084472, "num_tokens": 4603865.0, "step": 2260 }, { "entropy": 6.672588539123535, "epoch": 0.19793760377523376, "grad_norm": 1.0078125, "learning_rate": 0.0004998621131765514, "loss": 6.4538, "mean_token_accuracy": 0.13059509620070459, "num_tokens": 4613502.0, "step": 2265 }, { "entropy": 6.535258674621582, "epoch": 0.19837455212793847, "grad_norm": 0.953125, "learning_rate": 0.0004998610202547345, "loss": 6.4143, "mean_token_accuracy": 0.13172344267368316, "num_tokens": 4623163.0, "step": 2270 }, { "entropy": 6.695293951034546, "epoch": 0.1988115004806432, "grad_norm": 0.875, "learning_rate": 0.0004998599230199654, "loss": 6.4193, "mean_token_accuracy": 0.13490767627954484, "num_tokens": 4632850.0, "step": 2275 }, { "entropy": 6.589443254470825, "epoch": 0.19924844883334789, "grad_norm": 0.953125, "learning_rate": 0.0004998588214722653, "loss": 6.4396, "mean_token_accuracy": 0.1286391481757164, "num_tokens": 4642858.0, "step": 2280 }, { "entropy": 6.698593091964722, "epoch": 0.1996853971860526, "grad_norm": 0.8828125, "learning_rate": 0.0004998577156116551, "loss": 6.4627, "mean_token_accuracy": 0.11916870698332786, "num_tokens": 4653083.0, "step": 2285 }, { "entropy": 6.624360275268555, "epoch": 0.20012234553875732, "grad_norm": 0.921875, "learning_rate": 0.0004998566054381561, "loss": 6.4798, "mean_token_accuracy": 0.1257111832499504, "num_tokens": 4663353.0, "step": 2290 }, { "entropy": 6.623066425323486, "epoch": 0.20055929389146204, "grad_norm": 1.21875, "learning_rate": 0.0004998554909517895, "loss": 6.3213, "mean_token_accuracy": 0.13321887254714965, "num_tokens": 4673878.0, "step": 2295 }, { "entropy": 6.537002611160278, "epoch": 0.20099624224416673, "grad_norm": 0.8828125, "learning_rate": 0.0004998543721525769, "loss": 6.4024, "mean_token_accuracy": 0.12497134804725647, "num_tokens": 4683661.0, "step": 2300 }, { "entropy": 6.5673808574676515, "epoch": 0.20143319059687145, "grad_norm": 0.953125, "learning_rate": 0.0004998532490405397, "loss": 6.4518, "mean_token_accuracy": 0.12829202711582183, "num_tokens": 4693817.0, "step": 2305 }, { "entropy": 6.611567735671997, "epoch": 0.20187013894957617, "grad_norm": 0.92578125, "learning_rate": 0.0004998521216156991, "loss": 6.3772, "mean_token_accuracy": 0.12686420530080794, "num_tokens": 4703550.0, "step": 2310 }, { "entropy": 6.595733690261841, "epoch": 0.20230708730228086, "grad_norm": 0.90234375, "learning_rate": 0.0004998509898780771, "loss": 6.4934, "mean_token_accuracy": 0.12352922856807709, "num_tokens": 4714872.0, "step": 2315 }, { "entropy": 6.627568149566651, "epoch": 0.20274403565498558, "grad_norm": 0.84765625, "learning_rate": 0.0004998498538276954, "loss": 6.3898, "mean_token_accuracy": 0.13363091200590133, "num_tokens": 4725745.0, "step": 2320 }, { "entropy": 6.600788736343384, "epoch": 0.2031809840076903, "grad_norm": 0.91796875, "learning_rate": 0.0004998487134645755, "loss": 6.4799, "mean_token_accuracy": 0.1253775343298912, "num_tokens": 4735560.0, "step": 2325 }, { "entropy": 6.63616189956665, "epoch": 0.203617932360395, "grad_norm": 0.9453125, "learning_rate": 0.0004998475687887396, "loss": 6.4533, "mean_token_accuracy": 0.12529229298233985, "num_tokens": 4746304.0, "step": 2330 }, { "entropy": 6.672122478485107, "epoch": 0.2040548807130997, "grad_norm": 0.921875, "learning_rate": 0.0004998464198002095, "loss": 6.4285, "mean_token_accuracy": 0.12777206525206566, "num_tokens": 4756200.0, "step": 2335 }, { "entropy": 6.560856103897095, "epoch": 0.20449182906580443, "grad_norm": 0.92578125, "learning_rate": 0.0004998452664990072, "loss": 6.436, "mean_token_accuracy": 0.12261992320418358, "num_tokens": 4766249.0, "step": 2340 }, { "entropy": 6.714810609817505, "epoch": 0.20492877741850912, "grad_norm": 0.87109375, "learning_rate": 0.0004998441088851548, "loss": 6.4579, "mean_token_accuracy": 0.12660123854875566, "num_tokens": 4776510.0, "step": 2345 }, { "entropy": 6.561935997009277, "epoch": 0.20536572577121384, "grad_norm": 0.84765625, "learning_rate": 0.0004998429469586748, "loss": 6.4211, "mean_token_accuracy": 0.1272496648132801, "num_tokens": 4786798.0, "step": 2350 }, { "entropy": 6.608212327957153, "epoch": 0.20580267412391856, "grad_norm": 0.921875, "learning_rate": 0.000499841780719589, "loss": 6.3616, "mean_token_accuracy": 0.12745508700609207, "num_tokens": 4796001.0, "step": 2355 }, { "entropy": 6.519495153427124, "epoch": 0.20623962247662325, "grad_norm": 1.125, "learning_rate": 0.0004998406101679202, "loss": 6.3445, "mean_token_accuracy": 0.13589456528425217, "num_tokens": 4807634.0, "step": 2360 }, { "entropy": 6.578785228729248, "epoch": 0.20667657082932797, "grad_norm": 0.91796875, "learning_rate": 0.0004998394353036906, "loss": 6.3473, "mean_token_accuracy": 0.13589533045887947, "num_tokens": 4817840.0, "step": 2365 }, { "entropy": 6.551007890701294, "epoch": 0.2071135191820327, "grad_norm": 0.97265625, "learning_rate": 0.0004998382561269229, "loss": 6.3326, "mean_token_accuracy": 0.1385917641222477, "num_tokens": 4827186.0, "step": 2370 }, { "entropy": 6.533224439620971, "epoch": 0.20755046753473738, "grad_norm": 0.85546875, "learning_rate": 0.0004998370726376395, "loss": 6.3894, "mean_token_accuracy": 0.12424067407846451, "num_tokens": 4837140.0, "step": 2375 }, { "entropy": 6.589614820480347, "epoch": 0.2079874158874421, "grad_norm": 0.9296875, "learning_rate": 0.0004998358848358634, "loss": 6.4017, "mean_token_accuracy": 0.12754351869225503, "num_tokens": 4846907.0, "step": 2380 }, { "entropy": 6.561453104019165, "epoch": 0.20842436424014682, "grad_norm": 0.87890625, "learning_rate": 0.000499834692721617, "loss": 6.421, "mean_token_accuracy": 0.13229633197188378, "num_tokens": 4856165.0, "step": 2385 }, { "entropy": 6.578060579299927, "epoch": 0.2088613125928515, "grad_norm": 0.95703125, "learning_rate": 0.0004998334962949237, "loss": 6.2911, "mean_token_accuracy": 0.14010017663240432, "num_tokens": 4865308.0, "step": 2390 }, { "entropy": 6.493227291107178, "epoch": 0.20929826094555623, "grad_norm": 1.0859375, "learning_rate": 0.0004998322955558059, "loss": 6.358, "mean_token_accuracy": 0.1417185001075268, "num_tokens": 4876286.0, "step": 2395 }, { "entropy": 6.591450119018555, "epoch": 0.20973520929826095, "grad_norm": 0.81640625, "learning_rate": 0.0004998310905042869, "loss": 6.384, "mean_token_accuracy": 0.13348621502518654, "num_tokens": 4887227.0, "step": 2400 }, { "entropy": 6.593507528305054, "epoch": 0.21017215765096567, "grad_norm": 0.8125, "learning_rate": 0.0004998298811403898, "loss": 6.3979, "mean_token_accuracy": 0.1288406252861023, "num_tokens": 4896994.0, "step": 2405 }, { "entropy": 6.533228969573974, "epoch": 0.21060910600367036, "grad_norm": 1.015625, "learning_rate": 0.0004998286674641378, "loss": 6.4045, "mean_token_accuracy": 0.12903448343276977, "num_tokens": 4907623.0, "step": 2410 }, { "entropy": 6.558895254135132, "epoch": 0.21104605435637508, "grad_norm": 0.8984375, "learning_rate": 0.000499827449475554, "loss": 6.3204, "mean_token_accuracy": 0.12823840528726577, "num_tokens": 4917040.0, "step": 2415 }, { "entropy": 6.683346271514893, "epoch": 0.2114830027090798, "grad_norm": 0.8984375, "learning_rate": 0.000499826227174662, "loss": 6.436, "mean_token_accuracy": 0.12896525338292122, "num_tokens": 4928390.0, "step": 2420 }, { "entropy": 6.50466251373291, "epoch": 0.2119199510617845, "grad_norm": 0.890625, "learning_rate": 0.0004998250005614852, "loss": 6.3981, "mean_token_accuracy": 0.12751310169696808, "num_tokens": 4939040.0, "step": 2425 }, { "entropy": 6.558785009384155, "epoch": 0.2123568994144892, "grad_norm": 0.8671875, "learning_rate": 0.000499823769636047, "loss": 6.4371, "mean_token_accuracy": 0.12819619551301004, "num_tokens": 4949915.0, "step": 2430 }, { "entropy": 6.607331132888794, "epoch": 0.21279384776719393, "grad_norm": 0.87890625, "learning_rate": 0.0004998225343983712, "loss": 6.3391, "mean_token_accuracy": 0.1329527035355568, "num_tokens": 4960127.0, "step": 2435 }, { "entropy": 6.574900817871094, "epoch": 0.21323079611989862, "grad_norm": 0.9140625, "learning_rate": 0.0004998212948484814, "loss": 6.3847, "mean_token_accuracy": 0.126432553678751, "num_tokens": 4970152.0, "step": 2440 }, { "entropy": 6.571488666534424, "epoch": 0.21366774447260334, "grad_norm": 0.91015625, "learning_rate": 0.0004998200509864012, "loss": 6.3577, "mean_token_accuracy": 0.1341804251074791, "num_tokens": 4979745.0, "step": 2445 }, { "entropy": 6.594966459274292, "epoch": 0.21410469282530806, "grad_norm": 0.89453125, "learning_rate": 0.0004998188028121547, "loss": 6.3687, "mean_token_accuracy": 0.1393337517976761, "num_tokens": 4989924.0, "step": 2450 }, { "entropy": 6.498985242843628, "epoch": 0.21454164117801275, "grad_norm": 0.8828125, "learning_rate": 0.0004998175503257658, "loss": 6.316, "mean_token_accuracy": 0.14141854122281075, "num_tokens": 4999698.0, "step": 2455 }, { "entropy": 6.539078855514527, "epoch": 0.21497858953071747, "grad_norm": 0.89453125, "learning_rate": 0.0004998162935272585, "loss": 6.4223, "mean_token_accuracy": 0.13204047605395317, "num_tokens": 5010625.0, "step": 2460 }, { "entropy": 6.532508611679077, "epoch": 0.2154155378834222, "grad_norm": 0.9375, "learning_rate": 0.0004998150324166568, "loss": 6.3072, "mean_token_accuracy": 0.13948291540145874, "num_tokens": 5019740.0, "step": 2465 }, { "entropy": 6.578542041778564, "epoch": 0.21585248623612688, "grad_norm": 0.78125, "learning_rate": 0.000499813766993985, "loss": 6.4354, "mean_token_accuracy": 0.12458334863185883, "num_tokens": 5030601.0, "step": 2470 }, { "entropy": 6.645995283126831, "epoch": 0.2162894345888316, "grad_norm": 0.94921875, "learning_rate": 0.0004998124972592674, "loss": 6.3675, "mean_token_accuracy": 0.13052909597754478, "num_tokens": 5040567.0, "step": 2475 }, { "entropy": 6.499893093109131, "epoch": 0.21672638294153632, "grad_norm": 1.046875, "learning_rate": 0.0004998112232125283, "loss": 6.2648, "mean_token_accuracy": 0.13649773374199867, "num_tokens": 5049512.0, "step": 2480 }, { "entropy": 6.491473197937012, "epoch": 0.217163331294241, "grad_norm": 0.82421875, "learning_rate": 0.000499809944853792, "loss": 6.4316, "mean_token_accuracy": 0.1274581141769886, "num_tokens": 5060986.0, "step": 2485 }, { "entropy": 6.577273893356323, "epoch": 0.21760027964694573, "grad_norm": 0.9375, "learning_rate": 0.0004998086621830833, "loss": 6.3573, "mean_token_accuracy": 0.13598684519529342, "num_tokens": 5071492.0, "step": 2490 }, { "entropy": 6.544683933258057, "epoch": 0.21803722799965045, "grad_norm": 0.86328125, "learning_rate": 0.0004998073752004267, "loss": 6.3905, "mean_token_accuracy": 0.12805117219686507, "num_tokens": 5081722.0, "step": 2495 }, { "entropy": 6.5953404903411865, "epoch": 0.21847417635235516, "grad_norm": 0.94921875, "learning_rate": 0.0004998060839058467, "loss": 6.3545, "mean_token_accuracy": 0.1329400770366192, "num_tokens": 5091906.0, "step": 2500 }, { "entropy": 6.5407976627349855, "epoch": 0.21891112470505986, "grad_norm": 0.9296875, "learning_rate": 0.0004998047882993683, "loss": 6.3426, "mean_token_accuracy": 0.13389598056674004, "num_tokens": 5102025.0, "step": 2505 }, { "entropy": 6.509171485900879, "epoch": 0.21934807305776458, "grad_norm": 0.85546875, "learning_rate": 0.0004998034883810162, "loss": 6.3367, "mean_token_accuracy": 0.13235569521784782, "num_tokens": 5112354.0, "step": 2510 }, { "entropy": 6.513673925399781, "epoch": 0.2197850214104693, "grad_norm": 0.875, "learning_rate": 0.0004998021841508155, "loss": 6.2825, "mean_token_accuracy": 0.13621082603931428, "num_tokens": 5121695.0, "step": 2515 }, { "entropy": 6.564906120300293, "epoch": 0.22022196976317399, "grad_norm": 0.87109375, "learning_rate": 0.0004998008756087911, "loss": 6.3891, "mean_token_accuracy": 0.12776936888694762, "num_tokens": 5132561.0, "step": 2520 }, { "entropy": 6.589311695098877, "epoch": 0.2206589181158787, "grad_norm": 0.88671875, "learning_rate": 0.000499799562754968, "loss": 6.4257, "mean_token_accuracy": 0.12993937209248543, "num_tokens": 5141981.0, "step": 2525 }, { "entropy": 6.544518756866455, "epoch": 0.22109586646858342, "grad_norm": 0.93359375, "learning_rate": 0.0004997982455893716, "loss": 6.2883, "mean_token_accuracy": 0.1357527531683445, "num_tokens": 5151550.0, "step": 2530 }, { "entropy": 6.574628019332886, "epoch": 0.22153281482128812, "grad_norm": 0.984375, "learning_rate": 0.0004997969241120271, "loss": 6.3807, "mean_token_accuracy": 0.1260584406554699, "num_tokens": 5161679.0, "step": 2535 }, { "entropy": 6.491645574569702, "epoch": 0.22196976317399283, "grad_norm": 0.91796875, "learning_rate": 0.0004997955983229597, "loss": 6.4026, "mean_token_accuracy": 0.1277308262884617, "num_tokens": 5171575.0, "step": 2540 }, { "entropy": 6.547885131835938, "epoch": 0.22240671152669755, "grad_norm": 0.98828125, "learning_rate": 0.000499794268222195, "loss": 6.2719, "mean_token_accuracy": 0.13648097291588784, "num_tokens": 5180152.0, "step": 2545 }, { "entropy": 6.491997766494751, "epoch": 0.22284365987940224, "grad_norm": 0.96875, "learning_rate": 0.0004997929338097583, "loss": 6.3554, "mean_token_accuracy": 0.13152262344956397, "num_tokens": 5190518.0, "step": 2550 }, { "entropy": 6.607607460021972, "epoch": 0.22328060823210696, "grad_norm": 0.91796875, "learning_rate": 0.0004997915950856755, "loss": 6.3933, "mean_token_accuracy": 0.12704384401440622, "num_tokens": 5201729.0, "step": 2555 }, { "entropy": 6.559991312026978, "epoch": 0.22371755658481168, "grad_norm": 0.921875, "learning_rate": 0.0004997902520499721, "loss": 6.3744, "mean_token_accuracy": 0.1310870312154293, "num_tokens": 5211940.0, "step": 2560 }, { "entropy": 6.471191549301148, "epoch": 0.22415450493751637, "grad_norm": 0.9609375, "learning_rate": 0.0004997889047026738, "loss": 6.3049, "mean_token_accuracy": 0.13113719150424002, "num_tokens": 5221028.0, "step": 2565 }, { "entropy": 6.549423122406006, "epoch": 0.2245914532902211, "grad_norm": 0.94921875, "learning_rate": 0.0004997875530438066, "loss": 6.287, "mean_token_accuracy": 0.1366332732141018, "num_tokens": 5230498.0, "step": 2570 }, { "entropy": 6.511614179611206, "epoch": 0.2250284016429258, "grad_norm": 0.8984375, "learning_rate": 0.0004997861970733963, "loss": 6.3353, "mean_token_accuracy": 0.12960499599575998, "num_tokens": 5240112.0, "step": 2575 }, { "entropy": 6.5579187870025635, "epoch": 0.2254653499956305, "grad_norm": 0.91796875, "learning_rate": 0.000499784836791469, "loss": 6.3078, "mean_token_accuracy": 0.13300390243530275, "num_tokens": 5249201.0, "step": 2580 }, { "entropy": 6.493053865432739, "epoch": 0.22590229834833522, "grad_norm": 0.87890625, "learning_rate": 0.0004997834721980507, "loss": 6.305, "mean_token_accuracy": 0.13774593099951743, "num_tokens": 5258541.0, "step": 2585 }, { "entropy": 6.616273880004883, "epoch": 0.22633924670103994, "grad_norm": 1.1796875, "learning_rate": 0.0004997821032931676, "loss": 6.4101, "mean_token_accuracy": 0.1332601450383663, "num_tokens": 5268524.0, "step": 2590 }, { "entropy": 6.509102439880371, "epoch": 0.22677619505374463, "grad_norm": 0.8203125, "learning_rate": 0.000499780730076846, "loss": 6.3307, "mean_token_accuracy": 0.1330648258328438, "num_tokens": 5280702.0, "step": 2595 }, { "entropy": 6.528602409362793, "epoch": 0.22721314340644935, "grad_norm": 0.89453125, "learning_rate": 0.0004997793525491122, "loss": 6.31, "mean_token_accuracy": 0.1283218316733837, "num_tokens": 5291214.0, "step": 2600 }, { "entropy": 6.432008266448975, "epoch": 0.22765009175915407, "grad_norm": 0.98046875, "learning_rate": 0.0004997779707099926, "loss": 6.2639, "mean_token_accuracy": 0.14060572162270546, "num_tokens": 5300729.0, "step": 2605 }, { "entropy": 6.540947341918946, "epoch": 0.2280870401118588, "grad_norm": 0.875, "learning_rate": 0.0004997765845595138, "loss": 6.4009, "mean_token_accuracy": 0.1288476750254631, "num_tokens": 5310551.0, "step": 2610 }, { "entropy": 6.5121190547943115, "epoch": 0.22852398846456348, "grad_norm": 0.94140625, "learning_rate": 0.0004997751940977024, "loss": 6.2763, "mean_token_accuracy": 0.13367155566811562, "num_tokens": 5320038.0, "step": 2615 }, { "entropy": 6.493434906005859, "epoch": 0.2289609368172682, "grad_norm": 0.89453125, "learning_rate": 0.0004997737993245848, "loss": 6.3191, "mean_token_accuracy": 0.1320577569305897, "num_tokens": 5329753.0, "step": 2620 }, { "entropy": 6.4705726146698, "epoch": 0.22939788516997292, "grad_norm": 0.92578125, "learning_rate": 0.0004997724002401881, "loss": 6.304, "mean_token_accuracy": 0.13512743636965752, "num_tokens": 5340546.0, "step": 2625 }, { "entropy": 6.446058702468872, "epoch": 0.2298348335226776, "grad_norm": 0.9140625, "learning_rate": 0.0004997709968445391, "loss": 6.3795, "mean_token_accuracy": 0.12804465666413306, "num_tokens": 5352097.0, "step": 2630 }, { "entropy": 6.65869174003601, "epoch": 0.23027178187538233, "grad_norm": 0.91796875, "learning_rate": 0.0004997695891376644, "loss": 6.3208, "mean_token_accuracy": 0.13751014918088914, "num_tokens": 5361646.0, "step": 2635 }, { "entropy": 6.395161771774292, "epoch": 0.23070873022808705, "grad_norm": 1.0234375, "learning_rate": 0.0004997681771195912, "loss": 6.3041, "mean_token_accuracy": 0.13794874846935273, "num_tokens": 5371695.0, "step": 2640 }, { "entropy": 6.512343025207519, "epoch": 0.23114567858079174, "grad_norm": 0.9140625, "learning_rate": 0.0004997667607903466, "loss": 6.3805, "mean_token_accuracy": 0.13010330498218536, "num_tokens": 5381978.0, "step": 2645 }, { "entropy": 6.660280466079712, "epoch": 0.23158262693349646, "grad_norm": 0.9140625, "learning_rate": 0.0004997653401499578, "loss": 6.3697, "mean_token_accuracy": 0.13411956354975701, "num_tokens": 5391891.0, "step": 2650 }, { "entropy": 6.493831157684326, "epoch": 0.23201957528620118, "grad_norm": 0.8671875, "learning_rate": 0.000499763915198452, "loss": 6.327, "mean_token_accuracy": 0.13065533563494683, "num_tokens": 5403172.0, "step": 2655 }, { "entropy": 6.456011819839477, "epoch": 0.23245652363890587, "grad_norm": 0.875, "learning_rate": 0.0004997624859358565, "loss": 6.3345, "mean_token_accuracy": 0.13543095886707307, "num_tokens": 5413130.0, "step": 2660 }, { "entropy": 6.504063415527344, "epoch": 0.2328934719916106, "grad_norm": 0.890625, "learning_rate": 0.0004997610523621988, "loss": 6.3657, "mean_token_accuracy": 0.13021062016487123, "num_tokens": 5423510.0, "step": 2665 }, { "entropy": 6.5001222610473635, "epoch": 0.2333304203443153, "grad_norm": 1.0859375, "learning_rate": 0.0004997596144775063, "loss": 6.2, "mean_token_accuracy": 0.13856842517852783, "num_tokens": 5433707.0, "step": 2670 }, { "entropy": 6.316236448287964, "epoch": 0.23376736869702, "grad_norm": 0.8515625, "learning_rate": 0.0004997581722818067, "loss": 6.3145, "mean_token_accuracy": 0.13552152067422868, "num_tokens": 5444381.0, "step": 2675 }, { "entropy": 6.673515939712525, "epoch": 0.23420431704972472, "grad_norm": 0.8828125, "learning_rate": 0.0004997567257751275, "loss": 6.264, "mean_token_accuracy": 0.13442860767245293, "num_tokens": 5453905.0, "step": 2680 }, { "entropy": 6.449249124526977, "epoch": 0.23464126540242944, "grad_norm": 0.89453125, "learning_rate": 0.0004997552749574965, "loss": 6.2845, "mean_token_accuracy": 0.13393480256199836, "num_tokens": 5464839.0, "step": 2685 }, { "entropy": 6.488210773468017, "epoch": 0.23507821375513413, "grad_norm": 0.95703125, "learning_rate": 0.0004997538198289416, "loss": 6.3229, "mean_token_accuracy": 0.12909892126917838, "num_tokens": 5475459.0, "step": 2690 }, { "entropy": 6.478167104721069, "epoch": 0.23551516210783885, "grad_norm": 0.98046875, "learning_rate": 0.0004997523603894907, "loss": 6.3397, "mean_token_accuracy": 0.13458095341920853, "num_tokens": 5484886.0, "step": 2695 }, { "entropy": 6.4847033500671385, "epoch": 0.23595211046054357, "grad_norm": 0.91796875, "learning_rate": 0.0004997508966391717, "loss": 6.318, "mean_token_accuracy": 0.13543656319379807, "num_tokens": 5494803.0, "step": 2700 }, { "entropy": 6.465766191482544, "epoch": 0.2363890588132483, "grad_norm": 0.92578125, "learning_rate": 0.0004997494285780129, "loss": 6.2689, "mean_token_accuracy": 0.13447927311062813, "num_tokens": 5504997.0, "step": 2705 }, { "entropy": 6.446899366378784, "epoch": 0.23682600716595298, "grad_norm": 0.95703125, "learning_rate": 0.0004997479562060421, "loss": 6.2569, "mean_token_accuracy": 0.14331548362970353, "num_tokens": 5514492.0, "step": 2710 }, { "entropy": 6.511632680892944, "epoch": 0.2372629555186577, "grad_norm": 0.90234375, "learning_rate": 0.0004997464795232877, "loss": 6.3097, "mean_token_accuracy": 0.13123842626810073, "num_tokens": 5524419.0, "step": 2715 }, { "entropy": 6.525136137008667, "epoch": 0.23769990387136242, "grad_norm": 0.859375, "learning_rate": 0.0004997449985297782, "loss": 6.323, "mean_token_accuracy": 0.1331531934440136, "num_tokens": 5534289.0, "step": 2720 }, { "entropy": 6.446746015548706, "epoch": 0.2381368522240671, "grad_norm": 1.046875, "learning_rate": 0.0004997435132255418, "loss": 6.2524, "mean_token_accuracy": 0.13549713790416718, "num_tokens": 5543034.0, "step": 2725 }, { "entropy": 6.511647033691406, "epoch": 0.23857380057677183, "grad_norm": 0.875, "learning_rate": 0.0004997420236106071, "loss": 6.3347, "mean_token_accuracy": 0.12996043935418128, "num_tokens": 5553291.0, "step": 2730 }, { "entropy": 6.52672061920166, "epoch": 0.23901074892947655, "grad_norm": 0.8515625, "learning_rate": 0.0004997405296850026, "loss": 6.3147, "mean_token_accuracy": 0.1387110285460949, "num_tokens": 5563772.0, "step": 2735 }, { "entropy": 6.469681453704834, "epoch": 0.23944769728218124, "grad_norm": 0.96875, "learning_rate": 0.0004997390314487569, "loss": 6.352, "mean_token_accuracy": 0.13162039518356322, "num_tokens": 5574348.0, "step": 2740 }, { "entropy": 6.486959552764892, "epoch": 0.23988464563488596, "grad_norm": 0.92578125, "learning_rate": 0.0004997375289018989, "loss": 6.2096, "mean_token_accuracy": 0.13282159790396691, "num_tokens": 5583491.0, "step": 2745 }, { "entropy": 6.399618673324585, "epoch": 0.24032159398759068, "grad_norm": 0.94140625, "learning_rate": 0.0004997360220444574, "loss": 6.3508, "mean_token_accuracy": 0.12875445038080216, "num_tokens": 5594273.0, "step": 2750 }, { "entropy": 6.516872072219849, "epoch": 0.24075854234029537, "grad_norm": 0.98828125, "learning_rate": 0.0004997345108764611, "loss": 6.2636, "mean_token_accuracy": 0.13464151471853256, "num_tokens": 5604529.0, "step": 2755 }, { "entropy": 6.463331794738769, "epoch": 0.2411954906930001, "grad_norm": 0.8984375, "learning_rate": 0.0004997329953979391, "loss": 6.2527, "mean_token_accuracy": 0.14141659960150718, "num_tokens": 5614036.0, "step": 2760 }, { "entropy": 6.510278177261353, "epoch": 0.2416324390457048, "grad_norm": 0.91796875, "learning_rate": 0.0004997314756089206, "loss": 6.2963, "mean_token_accuracy": 0.13726957514882088, "num_tokens": 5624036.0, "step": 2765 }, { "entropy": 6.450707244873047, "epoch": 0.2420693873984095, "grad_norm": 0.9609375, "learning_rate": 0.0004997299515094347, "loss": 6.289, "mean_token_accuracy": 0.13998497128486634, "num_tokens": 5633987.0, "step": 2770 }, { "entropy": 6.427713871002197, "epoch": 0.24250633575111422, "grad_norm": 0.90625, "learning_rate": 0.0004997284230995105, "loss": 6.166, "mean_token_accuracy": 0.14919004142284392, "num_tokens": 5643905.0, "step": 2775 }, { "entropy": 6.4683431625366214, "epoch": 0.24294328410381894, "grad_norm": 0.91015625, "learning_rate": 0.0004997268903791773, "loss": 6.3625, "mean_token_accuracy": 0.13415857255458832, "num_tokens": 5654922.0, "step": 2780 }, { "entropy": 6.475963926315307, "epoch": 0.24338023245652363, "grad_norm": 0.82421875, "learning_rate": 0.0004997253533484647, "loss": 6.1973, "mean_token_accuracy": 0.1422443114221096, "num_tokens": 5664407.0, "step": 2785 }, { "entropy": 6.472312259674072, "epoch": 0.24381718080922835, "grad_norm": 0.9375, "learning_rate": 0.0004997238120074021, "loss": 6.2675, "mean_token_accuracy": 0.13551050946116447, "num_tokens": 5674524.0, "step": 2790 }, { "entropy": 6.439700555801392, "epoch": 0.24425412916193306, "grad_norm": 0.87109375, "learning_rate": 0.0004997222663560188, "loss": 6.3007, "mean_token_accuracy": 0.1321689762175083, "num_tokens": 5684691.0, "step": 2795 }, { "entropy": 6.4623698711395265, "epoch": 0.24469107751463778, "grad_norm": 0.98828125, "learning_rate": 0.0004997207163943449, "loss": 6.2353, "mean_token_accuracy": 0.13899511322379113, "num_tokens": 5693683.0, "step": 2800 }, { "entropy": 6.442118167877197, "epoch": 0.24512802586734248, "grad_norm": 0.8984375, "learning_rate": 0.0004997191621224098, "loss": 6.2998, "mean_token_accuracy": 0.13590859174728392, "num_tokens": 5704394.0, "step": 2805 }, { "entropy": 6.445099401473999, "epoch": 0.2455649742200472, "grad_norm": 0.85546875, "learning_rate": 0.0004997176035402435, "loss": 6.2111, "mean_token_accuracy": 0.1418813318014145, "num_tokens": 5715480.0, "step": 2810 }, { "entropy": 6.484379482269287, "epoch": 0.2460019225727519, "grad_norm": 0.8671875, "learning_rate": 0.0004997160406478758, "loss": 6.2227, "mean_token_accuracy": 0.14038358852267266, "num_tokens": 5725973.0, "step": 2815 }, { "entropy": 6.332956981658936, "epoch": 0.2464388709254566, "grad_norm": 0.9453125, "learning_rate": 0.0004997144734453367, "loss": 6.2387, "mean_token_accuracy": 0.14358900636434554, "num_tokens": 5735798.0, "step": 2820 }, { "entropy": 6.579839372634888, "epoch": 0.24687581927816132, "grad_norm": 0.859375, "learning_rate": 0.0004997129019326562, "loss": 6.3218, "mean_token_accuracy": 0.12896375134587287, "num_tokens": 5746623.0, "step": 2825 }, { "entropy": 6.478277635574341, "epoch": 0.24731276763086604, "grad_norm": 0.97265625, "learning_rate": 0.0004997113261098645, "loss": 6.2624, "mean_token_accuracy": 0.14029808342456818, "num_tokens": 5756526.0, "step": 2830 }, { "entropy": 6.400695037841797, "epoch": 0.24774971598357073, "grad_norm": 0.90234375, "learning_rate": 0.0004997097459769919, "loss": 6.2642, "mean_token_accuracy": 0.13547210171818733, "num_tokens": 5766670.0, "step": 2835 }, { "entropy": 6.524441814422607, "epoch": 0.24818666433627545, "grad_norm": 0.87109375, "learning_rate": 0.0004997081615340685, "loss": 6.3055, "mean_token_accuracy": 0.1356332018971443, "num_tokens": 5776473.0, "step": 2840 }, { "entropy": 6.552545595169067, "epoch": 0.24862361268898017, "grad_norm": 0.9609375, "learning_rate": 0.0004997065727811249, "loss": 6.3397, "mean_token_accuracy": 0.13625893667340278, "num_tokens": 5787059.0, "step": 2845 }, { "entropy": 6.441537141799927, "epoch": 0.24906056104168486, "grad_norm": 0.84765625, "learning_rate": 0.0004997049797181915, "loss": 6.3197, "mean_token_accuracy": 0.12882847487926483, "num_tokens": 5797367.0, "step": 2850 }, { "entropy": 6.392263746261596, "epoch": 0.24949750939438958, "grad_norm": 0.92578125, "learning_rate": 0.0004997033823452988, "loss": 6.2121, "mean_token_accuracy": 0.14500029981136323, "num_tokens": 5806704.0, "step": 2855 }, { "entropy": 6.455396413803101, "epoch": 0.2499344577470943, "grad_norm": 0.80859375, "learning_rate": 0.0004997017806624774, "loss": 6.2725, "mean_token_accuracy": 0.1365084804594517, "num_tokens": 5817797.0, "step": 2860 }, { "entropy": 6.506603479385376, "epoch": 0.250371406099799, "grad_norm": 0.9140625, "learning_rate": 0.0004997001746697582, "loss": 6.3181, "mean_token_accuracy": 0.13766707554459573, "num_tokens": 5829270.0, "step": 2865 }, { "entropy": 6.450180387496948, "epoch": 0.2508083544525037, "grad_norm": 0.9296875, "learning_rate": 0.0004996985643671719, "loss": 6.2536, "mean_token_accuracy": 0.1362561121582985, "num_tokens": 5839214.0, "step": 2870 }, { "entropy": 6.388732814788819, "epoch": 0.2512453028052084, "grad_norm": 0.8984375, "learning_rate": 0.0004996969497547495, "loss": 6.2499, "mean_token_accuracy": 0.13788965120911598, "num_tokens": 5848171.0, "step": 2875 }, { "entropy": 6.440700387954712, "epoch": 0.25168225115791315, "grad_norm": 0.8359375, "learning_rate": 0.0004996953308325217, "loss": 6.1604, "mean_token_accuracy": 0.14541597664356232, "num_tokens": 5858399.0, "step": 2880 }, { "entropy": 6.306634092330933, "epoch": 0.25211919951061784, "grad_norm": 0.90234375, "learning_rate": 0.0004996937076005198, "loss": 6.1752, "mean_token_accuracy": 0.148306243121624, "num_tokens": 5868212.0, "step": 2885 }, { "entropy": 6.465786075592041, "epoch": 0.25255614786332253, "grad_norm": 0.8984375, "learning_rate": 0.0004996920800587749, "loss": 6.2557, "mean_token_accuracy": 0.1431330159306526, "num_tokens": 5877883.0, "step": 2890 }, { "entropy": 6.490456247329712, "epoch": 0.2529930962160273, "grad_norm": 0.90234375, "learning_rate": 0.0004996904482073181, "loss": 6.2612, "mean_token_accuracy": 0.13619642183184624, "num_tokens": 5887090.0, "step": 2895 }, { "entropy": 6.379231071472168, "epoch": 0.25343004456873197, "grad_norm": 0.9140625, "learning_rate": 0.0004996888120461808, "loss": 6.299, "mean_token_accuracy": 0.1262368731200695, "num_tokens": 5897491.0, "step": 2900 }, { "entropy": 6.50172791481018, "epoch": 0.25386699292143666, "grad_norm": 0.89453125, "learning_rate": 0.0004996871715753943, "loss": 6.3195, "mean_token_accuracy": 0.13194667026400567, "num_tokens": 5908494.0, "step": 2905 }, { "entropy": 6.527822208404541, "epoch": 0.2543039412741414, "grad_norm": 0.8828125, "learning_rate": 0.00049968552679499, "loss": 6.3587, "mean_token_accuracy": 0.12604505568742752, "num_tokens": 5919708.0, "step": 2910 }, { "entropy": 6.4339385509490965, "epoch": 0.2547408896268461, "grad_norm": 0.98046875, "learning_rate": 0.0004996838777049998, "loss": 6.2224, "mean_token_accuracy": 0.13939420580863954, "num_tokens": 5930122.0, "step": 2915 }, { "entropy": 6.35483832359314, "epoch": 0.2551778379795508, "grad_norm": 0.921875, "learning_rate": 0.000499682224305455, "loss": 6.2036, "mean_token_accuracy": 0.1342392973601818, "num_tokens": 5940033.0, "step": 2920 }, { "entropy": 6.388920021057129, "epoch": 0.25561478633225554, "grad_norm": 0.8984375, "learning_rate": 0.0004996805665963874, "loss": 6.2204, "mean_token_accuracy": 0.13428228572010995, "num_tokens": 5949335.0, "step": 2925 }, { "entropy": 6.490639734268188, "epoch": 0.25605173468496023, "grad_norm": 0.9609375, "learning_rate": 0.0004996789045778287, "loss": 6.264, "mean_token_accuracy": 0.13692333027720452, "num_tokens": 5959299.0, "step": 2930 }, { "entropy": 6.447759532928467, "epoch": 0.2564886830376649, "grad_norm": 0.828125, "learning_rate": 0.0004996772382498111, "loss": 6.2174, "mean_token_accuracy": 0.13530389219522476, "num_tokens": 5970114.0, "step": 2935 }, { "entropy": 6.415350341796875, "epoch": 0.25692563139036967, "grad_norm": 0.859375, "learning_rate": 0.0004996755676123662, "loss": 6.3127, "mean_token_accuracy": 0.134555646777153, "num_tokens": 5979630.0, "step": 2940 }, { "entropy": 6.529413795471191, "epoch": 0.25736257974307436, "grad_norm": 0.96875, "learning_rate": 0.0004996738926655262, "loss": 6.289, "mean_token_accuracy": 0.13147507831454278, "num_tokens": 5990190.0, "step": 2945 }, { "entropy": 6.40431022644043, "epoch": 0.25779952809577905, "grad_norm": 0.87109375, "learning_rate": 0.0004996722134093231, "loss": 6.3126, "mean_token_accuracy": 0.13044267743825913, "num_tokens": 6000706.0, "step": 2950 }, { "entropy": 6.401627731323242, "epoch": 0.2582364764484838, "grad_norm": 0.9375, "learning_rate": 0.0004996705298437894, "loss": 6.2655, "mean_token_accuracy": 0.1423163965344429, "num_tokens": 6011274.0, "step": 2955 }, { "entropy": 6.5021644115448, "epoch": 0.2586734248011885, "grad_norm": 0.88671875, "learning_rate": 0.0004996688419689572, "loss": 6.1833, "mean_token_accuracy": 0.1421648696064949, "num_tokens": 6021481.0, "step": 2960 }, { "entropy": 6.357604551315307, "epoch": 0.25911037315389324, "grad_norm": 0.9140625, "learning_rate": 0.0004996671497848589, "loss": 6.2652, "mean_token_accuracy": 0.1401491306722164, "num_tokens": 6032091.0, "step": 2965 }, { "entropy": 6.467347812652588, "epoch": 0.25954732150659793, "grad_norm": 0.890625, "learning_rate": 0.0004996654532915269, "loss": 6.2658, "mean_token_accuracy": 0.1289597101509571, "num_tokens": 6043371.0, "step": 2970 }, { "entropy": 6.476518726348877, "epoch": 0.2599842698593026, "grad_norm": 0.9375, "learning_rate": 0.0004996637524889937, "loss": 6.2193, "mean_token_accuracy": 0.1412220261991024, "num_tokens": 6052812.0, "step": 2975 }, { "entropy": 6.3784160137176515, "epoch": 0.26042121821200737, "grad_norm": 0.84765625, "learning_rate": 0.0004996620473772921, "loss": 6.2135, "mean_token_accuracy": 0.13825001195073128, "num_tokens": 6064033.0, "step": 2980 }, { "entropy": 6.435154962539673, "epoch": 0.26085816656471206, "grad_norm": 0.85546875, "learning_rate": 0.0004996603379564546, "loss": 6.3394, "mean_token_accuracy": 0.13179437443614006, "num_tokens": 6075837.0, "step": 2985 }, { "entropy": 6.565837717056274, "epoch": 0.26129511491741675, "grad_norm": 0.83984375, "learning_rate": 0.0004996586242265142, "loss": 6.244, "mean_token_accuracy": 0.14351730942726135, "num_tokens": 6085514.0, "step": 2990 }, { "entropy": 6.4207676410675045, "epoch": 0.2617320632701215, "grad_norm": 0.9375, "learning_rate": 0.0004996569061875036, "loss": 6.1518, "mean_token_accuracy": 0.14098117351531983, "num_tokens": 6094992.0, "step": 2995 }, { "entropy": 6.362293386459351, "epoch": 0.2621690116228262, "grad_norm": 0.8671875, "learning_rate": 0.0004996551838394559, "loss": 6.2304, "mean_token_accuracy": 0.13752028718590736, "num_tokens": 6104841.0, "step": 3000 }, { "epoch": 0.2621690116228262, "eval_entropy": 6.155421564639298, "eval_loss": 6.250469207763672, "eval_mean_token_accuracy": 0.14463501781151133, "eval_num_tokens": 6104841.0, "eval_runtime": 21.3728, "eval_samples_per_second": 1731.83, "eval_steps_per_second": 216.49, "step": 3000 } ], "logging_steps": 5, "max_steps": 114420, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1356222751211520.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }