{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.601828438047073, "eval_steps": 3000, "global_step": 72000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.34880576133728, "epoch": 0.00038902937171756465, "grad_norm": 1.0703125, "learning_rate": 2e-06, "loss": 7.0252, "mean_token_accuracy": 0.10256106480956077, "num_tokens": 9243.0, "step": 5 }, { "entropy": 7.446655797958374, "epoch": 0.0007780587434351293, "grad_norm": 1.1328125, "learning_rate": 4.5e-06, "loss": 7.1577, "mean_token_accuracy": 0.0929850086569786, "num_tokens": 18424.0, "step": 10 }, { "entropy": 7.352576017379761, "epoch": 0.001167088115152694, "grad_norm": 1.0703125, "learning_rate": 7e-06, "loss": 7.0451, "mean_token_accuracy": 0.0964082270860672, "num_tokens": 27006.0, "step": 15 }, { "entropy": 7.343383884429931, "epoch": 0.0015561174868702586, "grad_norm": 1.078125, "learning_rate": 9.5e-06, "loss": 7.0864, "mean_token_accuracy": 0.0972217358648777, "num_tokens": 35577.0, "step": 20 }, { "entropy": 7.42727689743042, "epoch": 0.0019451468585878235, "grad_norm": 0.96875, "learning_rate": 1.2e-05, "loss": 7.0596, "mean_token_accuracy": 0.09545032754540443, "num_tokens": 43706.0, "step": 25 }, { "entropy": 7.413392829895019, "epoch": 0.002334176230305388, "grad_norm": 1.0859375, "learning_rate": 1.4500000000000002e-05, "loss": 7.0333, "mean_token_accuracy": 0.09936482384800911, "num_tokens": 52571.0, "step": 30 }, { "entropy": 7.465293312072754, "epoch": 0.0027232056020229526, "grad_norm": 0.984375, "learning_rate": 1.7000000000000003e-05, "loss": 7.0159, "mean_token_accuracy": 0.09479603916406631, "num_tokens": 61900.0, "step": 35 }, { "entropy": 7.500431871414184, "epoch": 0.0031122349737405172, "grad_norm": 1.0234375, "learning_rate": 1.95e-05, "loss": 7.0403, "mean_token_accuracy": 0.0956958994269371, "num_tokens": 71234.0, "step": 40 }, { "entropy": 7.569026231765747, "epoch": 0.003501264345458082, "grad_norm": 1.140625, "learning_rate": 2.2e-05, "loss": 7.1142, "mean_token_accuracy": 0.09231705740094184, "num_tokens": 79610.0, "step": 45 }, { "entropy": 7.532996749877929, "epoch": 0.003890293717175647, "grad_norm": 1.09375, "learning_rate": 2.4500000000000003e-05, "loss": 6.9294, "mean_token_accuracy": 0.1006363645195961, "num_tokens": 87527.0, "step": 50 }, { "entropy": 7.560778427124023, "epoch": 0.004279323088893211, "grad_norm": 1.125, "learning_rate": 2.7e-05, "loss": 7.0757, "mean_token_accuracy": 0.09589893892407417, "num_tokens": 95512.0, "step": 55 }, { "entropy": 7.501343441009522, "epoch": 0.004668352460610776, "grad_norm": 0.99609375, "learning_rate": 2.95e-05, "loss": 7.0864, "mean_token_accuracy": 0.09744687899947166, "num_tokens": 104395.0, "step": 60 }, { "entropy": 7.478601932525635, "epoch": 0.0050573818323283405, "grad_norm": 0.9609375, "learning_rate": 3.2e-05, "loss": 6.9791, "mean_token_accuracy": 0.10184086710214615, "num_tokens": 112562.0, "step": 65 }, { "entropy": 7.405571556091308, "epoch": 0.005446411204045905, "grad_norm": 1.1015625, "learning_rate": 3.4500000000000005e-05, "loss": 6.86, "mean_token_accuracy": 0.09663667231798172, "num_tokens": 121962.0, "step": 70 }, { "entropy": 7.51507978439331, "epoch": 0.00583544057576347, "grad_norm": 1.0234375, "learning_rate": 3.7e-05, "loss": 7.126, "mean_token_accuracy": 0.09231036975979805, "num_tokens": 130714.0, "step": 75 }, { "entropy": 7.520365238189697, "epoch": 0.0062244699474810344, "grad_norm": 0.95703125, "learning_rate": 3.95e-05, "loss": 6.9241, "mean_token_accuracy": 0.10009283497929573, "num_tokens": 139674.0, "step": 80 }, { "entropy": 7.47720103263855, "epoch": 0.006613499319198599, "grad_norm": 1.03125, "learning_rate": 4.2000000000000004e-05, "loss": 6.9803, "mean_token_accuracy": 0.09953748062252998, "num_tokens": 148654.0, "step": 85 }, { "entropy": 7.46751070022583, "epoch": 0.007002528690916164, "grad_norm": 1.09375, "learning_rate": 4.45e-05, "loss": 6.8751, "mean_token_accuracy": 0.10261099562048911, "num_tokens": 156180.0, "step": 90 }, { "entropy": 7.383714389801026, "epoch": 0.007391558062633729, "grad_norm": 0.94140625, "learning_rate": 4.7000000000000004e-05, "loss": 6.9565, "mean_token_accuracy": 0.09331886917352676, "num_tokens": 165608.0, "step": 95 }, { "entropy": 7.432891321182251, "epoch": 0.007780587434351294, "grad_norm": 0.9921875, "learning_rate": 4.9500000000000004e-05, "loss": 6.936, "mean_token_accuracy": 0.10059967562556267, "num_tokens": 173871.0, "step": 100 }, { "entropy": 7.461685752868652, "epoch": 0.008169616806068859, "grad_norm": 1.0390625, "learning_rate": 5.2e-05, "loss": 7.0248, "mean_token_accuracy": 0.09571366757154465, "num_tokens": 182356.0, "step": 105 }, { "entropy": 7.499224996566772, "epoch": 0.008558646177786422, "grad_norm": 0.98828125, "learning_rate": 5.45e-05, "loss": 7.0179, "mean_token_accuracy": 0.09466839730739593, "num_tokens": 190361.0, "step": 110 }, { "entropy": 7.435716581344605, "epoch": 0.008947675549503988, "grad_norm": 1.0234375, "learning_rate": 5.7e-05, "loss": 6.9827, "mean_token_accuracy": 0.0984235167503357, "num_tokens": 199253.0, "step": 115 }, { "entropy": 7.429847049713135, "epoch": 0.009336704921221552, "grad_norm": 1.109375, "learning_rate": 5.9499999999999996e-05, "loss": 6.9557, "mean_token_accuracy": 0.09870526567101479, "num_tokens": 208181.0, "step": 120 }, { "entropy": 7.515597820281982, "epoch": 0.009725734292939117, "grad_norm": 0.9921875, "learning_rate": 6.2e-05, "loss": 6.9546, "mean_token_accuracy": 0.09591879844665527, "num_tokens": 216898.0, "step": 125 }, { "entropy": 7.421197032928466, "epoch": 0.010114763664656681, "grad_norm": 1.0625, "learning_rate": 6.450000000000001e-05, "loss": 7.0039, "mean_token_accuracy": 0.09688223078846932, "num_tokens": 226051.0, "step": 130 }, { "entropy": 7.492958879470825, "epoch": 0.010503793036374246, "grad_norm": 1.015625, "learning_rate": 6.7e-05, "loss": 7.042, "mean_token_accuracy": 0.09841900020837784, "num_tokens": 235018.0, "step": 135 }, { "entropy": 7.432940196990967, "epoch": 0.01089282240809181, "grad_norm": 1.0546875, "learning_rate": 6.950000000000001e-05, "loss": 6.9703, "mean_token_accuracy": 0.09938597083091735, "num_tokens": 244268.0, "step": 140 }, { "entropy": 7.446199369430542, "epoch": 0.011281851779809376, "grad_norm": 0.98046875, "learning_rate": 7.2e-05, "loss": 6.9842, "mean_token_accuracy": 0.09659678265452384, "num_tokens": 253545.0, "step": 145 }, { "entropy": 7.365108060836792, "epoch": 0.01167088115152694, "grad_norm": 1.1015625, "learning_rate": 7.45e-05, "loss": 6.8048, "mean_token_accuracy": 0.10624724552035332, "num_tokens": 261767.0, "step": 150 }, { "entropy": 7.435336446762085, "epoch": 0.012059910523244505, "grad_norm": 0.9609375, "learning_rate": 7.7e-05, "loss": 6.9655, "mean_token_accuracy": 0.10120068341493607, "num_tokens": 270372.0, "step": 155 }, { "entropy": 7.463044929504394, "epoch": 0.012448939894962069, "grad_norm": 1.046875, "learning_rate": 7.950000000000001e-05, "loss": 7.026, "mean_token_accuracy": 0.09834155589342117, "num_tokens": 279726.0, "step": 160 }, { "entropy": 7.4832648754119875, "epoch": 0.012837969266679634, "grad_norm": 1.109375, "learning_rate": 8.2e-05, "loss": 6.9905, "mean_token_accuracy": 0.10089058354496956, "num_tokens": 288955.0, "step": 165 }, { "entropy": 7.449814510345459, "epoch": 0.013226998638397198, "grad_norm": 1.1171875, "learning_rate": 8.450000000000001e-05, "loss": 6.9218, "mean_token_accuracy": 0.09420814290642739, "num_tokens": 297898.0, "step": 170 }, { "entropy": 7.396070957183838, "epoch": 0.013616028010114764, "grad_norm": 1.046875, "learning_rate": 8.7e-05, "loss": 6.9188, "mean_token_accuracy": 0.10343953669071197, "num_tokens": 306189.0, "step": 175 }, { "entropy": 7.427816915512085, "epoch": 0.014005057381832327, "grad_norm": 1.0703125, "learning_rate": 8.95e-05, "loss": 6.9462, "mean_token_accuracy": 0.09905305579304695, "num_tokens": 314881.0, "step": 180 }, { "entropy": 7.363733434677124, "epoch": 0.014394086753549893, "grad_norm": 1.1796875, "learning_rate": 9.2e-05, "loss": 6.9415, "mean_token_accuracy": 0.09854480773210525, "num_tokens": 323357.0, "step": 185 }, { "entropy": 7.500346422195435, "epoch": 0.014783116125267459, "grad_norm": 1.046875, "learning_rate": 9.45e-05, "loss": 6.9926, "mean_token_accuracy": 0.09660296440124512, "num_tokens": 331799.0, "step": 190 }, { "entropy": 7.395345211029053, "epoch": 0.015172145496985022, "grad_norm": 1.125, "learning_rate": 9.7e-05, "loss": 6.904, "mean_token_accuracy": 0.10265823528170585, "num_tokens": 340320.0, "step": 195 }, { "entropy": 7.404849243164063, "epoch": 0.015561174868702588, "grad_norm": 1.171875, "learning_rate": 9.95e-05, "loss": 6.8857, "mean_token_accuracy": 0.1047187753021717, "num_tokens": 348990.0, "step": 200 }, { "entropy": 7.39699239730835, "epoch": 0.01595020424042015, "grad_norm": 1.2109375, "learning_rate": 0.000102, "loss": 6.9065, "mean_token_accuracy": 0.09710254445672035, "num_tokens": 357661.0, "step": 205 }, { "entropy": 7.321025276184082, "epoch": 0.016339233612137717, "grad_norm": 1.1015625, "learning_rate": 0.00010449999999999999, "loss": 6.8787, "mean_token_accuracy": 0.10586154833436012, "num_tokens": 366099.0, "step": 210 }, { "entropy": 7.5005217552185055, "epoch": 0.016728262983855283, "grad_norm": 1.0234375, "learning_rate": 0.000107, "loss": 7.0379, "mean_token_accuracy": 0.09788483828306198, "num_tokens": 374926.0, "step": 215 }, { "entropy": 7.418247509002685, "epoch": 0.017117292355572845, "grad_norm": 1.15625, "learning_rate": 0.0001095, "loss": 6.946, "mean_token_accuracy": 0.098393777012825, "num_tokens": 383846.0, "step": 220 }, { "entropy": 7.378245735168457, "epoch": 0.01750632172729041, "grad_norm": 1.171875, "learning_rate": 0.000112, "loss": 6.8894, "mean_token_accuracy": 0.1021482452750206, "num_tokens": 393678.0, "step": 225 }, { "entropy": 7.4670178413391115, "epoch": 0.017895351099007976, "grad_norm": 1.1484375, "learning_rate": 0.0001145, "loss": 6.9755, "mean_token_accuracy": 0.09847855567932129, "num_tokens": 401866.0, "step": 230 }, { "entropy": 7.473496532440185, "epoch": 0.01828438047072554, "grad_norm": 1.0859375, "learning_rate": 0.00011700000000000001, "loss": 6.9365, "mean_token_accuracy": 0.10552924722433091, "num_tokens": 411057.0, "step": 235 }, { "entropy": 7.397612524032593, "epoch": 0.018673409842443103, "grad_norm": 1.1640625, "learning_rate": 0.00011949999999999999, "loss": 6.9395, "mean_token_accuracy": 0.10260751843452454, "num_tokens": 419083.0, "step": 240 }, { "entropy": 7.325595569610596, "epoch": 0.01906243921416067, "grad_norm": 1.1484375, "learning_rate": 0.000122, "loss": 6.7993, "mean_token_accuracy": 0.10741342976689339, "num_tokens": 427503.0, "step": 245 }, { "entropy": 7.431865072250366, "epoch": 0.019451468585878234, "grad_norm": 1.3046875, "learning_rate": 0.0001245, "loss": 6.9643, "mean_token_accuracy": 0.09718445464968681, "num_tokens": 435820.0, "step": 250 }, { "entropy": 7.301518154144287, "epoch": 0.0198404979575958, "grad_norm": 1.1484375, "learning_rate": 0.000127, "loss": 6.8424, "mean_token_accuracy": 0.10523844137787819, "num_tokens": 444692.0, "step": 255 }, { "entropy": 7.322385978698731, "epoch": 0.020229527329313362, "grad_norm": 1.1640625, "learning_rate": 0.0001295, "loss": 6.8813, "mean_token_accuracy": 0.09604761153459548, "num_tokens": 453536.0, "step": 260 }, { "entropy": 7.500930261611939, "epoch": 0.020618556701030927, "grad_norm": 1.265625, "learning_rate": 0.000132, "loss": 6.9135, "mean_token_accuracy": 0.10178809389472007, "num_tokens": 462264.0, "step": 265 }, { "entropy": 7.466741132736206, "epoch": 0.021007586072748493, "grad_norm": 1.09375, "learning_rate": 0.00013450000000000002, "loss": 7.0681, "mean_token_accuracy": 0.09854813367128372, "num_tokens": 471819.0, "step": 270 }, { "entropy": 7.39691653251648, "epoch": 0.02139661544446606, "grad_norm": 1.0625, "learning_rate": 0.00013700000000000002, "loss": 6.9438, "mean_token_accuracy": 0.0978664368391037, "num_tokens": 480878.0, "step": 275 }, { "entropy": 7.483294820785522, "epoch": 0.02178564481618362, "grad_norm": 1.2421875, "learning_rate": 0.0001395, "loss": 6.9213, "mean_token_accuracy": 0.1020102322101593, "num_tokens": 489454.0, "step": 280 }, { "entropy": 7.298464393615722, "epoch": 0.022174674187901186, "grad_norm": 1.0703125, "learning_rate": 0.00014199999999999998, "loss": 6.8179, "mean_token_accuracy": 0.10413895472884178, "num_tokens": 498378.0, "step": 285 }, { "entropy": 7.501266813278198, "epoch": 0.02256370355961875, "grad_norm": 1.234375, "learning_rate": 0.0001445, "loss": 7.0766, "mean_token_accuracy": 0.09656166881322861, "num_tokens": 507638.0, "step": 290 }, { "entropy": 7.435027980804444, "epoch": 0.022952732931336317, "grad_norm": 1.265625, "learning_rate": 0.000147, "loss": 6.9631, "mean_token_accuracy": 0.10347767695784568, "num_tokens": 517047.0, "step": 295 }, { "entropy": 7.468677520751953, "epoch": 0.02334176230305388, "grad_norm": 1.1953125, "learning_rate": 0.0001495, "loss": 6.8928, "mean_token_accuracy": 0.10784424841403961, "num_tokens": 525287.0, "step": 300 }, { "entropy": 7.284840393066406, "epoch": 0.023730791674771445, "grad_norm": 1.3203125, "learning_rate": 0.000152, "loss": 6.827, "mean_token_accuracy": 0.09975214079022407, "num_tokens": 533266.0, "step": 305 }, { "entropy": 7.383808851242065, "epoch": 0.02411982104648901, "grad_norm": 1.125, "learning_rate": 0.00015450000000000001, "loss": 6.9865, "mean_token_accuracy": 0.09793580844998359, "num_tokens": 542448.0, "step": 310 }, { "entropy": 7.3777937412261965, "epoch": 0.024508850418206576, "grad_norm": 1.40625, "learning_rate": 0.000157, "loss": 6.8559, "mean_token_accuracy": 0.10171961411833763, "num_tokens": 550872.0, "step": 315 }, { "entropy": 7.398427724838257, "epoch": 0.024897879789924138, "grad_norm": 1.2109375, "learning_rate": 0.0001595, "loss": 6.945, "mean_token_accuracy": 0.10726686492562294, "num_tokens": 559616.0, "step": 320 }, { "entropy": 7.43606333732605, "epoch": 0.025286909161641703, "grad_norm": 1.2890625, "learning_rate": 0.000162, "loss": 6.892, "mean_token_accuracy": 0.1080216646194458, "num_tokens": 568379.0, "step": 325 }, { "entropy": 7.339574384689331, "epoch": 0.02567593853335927, "grad_norm": 1.1796875, "learning_rate": 0.00016450000000000001, "loss": 6.9344, "mean_token_accuracy": 0.09556459337472915, "num_tokens": 577288.0, "step": 330 }, { "entropy": 7.394017219543457, "epoch": 0.026064967905076834, "grad_norm": 1.140625, "learning_rate": 0.00016700000000000002, "loss": 6.8893, "mean_token_accuracy": 0.09673169776797294, "num_tokens": 587054.0, "step": 335 }, { "entropy": 7.3556236743927, "epoch": 0.026453997276794396, "grad_norm": 1.3046875, "learning_rate": 0.00016950000000000003, "loss": 7.0419, "mean_token_accuracy": 0.10046090409159661, "num_tokens": 595405.0, "step": 340 }, { "entropy": 7.431601905822754, "epoch": 0.026843026648511962, "grad_norm": 1.1875, "learning_rate": 0.00017199999999999998, "loss": 6.8507, "mean_token_accuracy": 0.10375126153230667, "num_tokens": 604095.0, "step": 345 }, { "entropy": 7.273375415802002, "epoch": 0.027232056020229527, "grad_norm": 1.1484375, "learning_rate": 0.00017449999999999999, "loss": 6.9004, "mean_token_accuracy": 0.10230252891778946, "num_tokens": 613518.0, "step": 350 }, { "entropy": 7.408315944671631, "epoch": 0.027621085391947093, "grad_norm": 1.2265625, "learning_rate": 0.000177, "loss": 6.7702, "mean_token_accuracy": 0.1080463670194149, "num_tokens": 621212.0, "step": 355 }, { "entropy": 7.285730218887329, "epoch": 0.028010114763664655, "grad_norm": 1.2109375, "learning_rate": 0.0001795, "loss": 6.8426, "mean_token_accuracy": 0.1072110302746296, "num_tokens": 629326.0, "step": 360 }, { "entropy": 7.37860689163208, "epoch": 0.02839914413538222, "grad_norm": 1.203125, "learning_rate": 0.000182, "loss": 6.8696, "mean_token_accuracy": 0.10251942202448845, "num_tokens": 637034.0, "step": 365 }, { "entropy": 7.277339124679566, "epoch": 0.028788173507099786, "grad_norm": 1.171875, "learning_rate": 0.0001845, "loss": 6.7723, "mean_token_accuracy": 0.10722191333770752, "num_tokens": 645924.0, "step": 370 }, { "entropy": 7.407964897155762, "epoch": 0.02917720287881735, "grad_norm": 1.1640625, "learning_rate": 0.000187, "loss": 7.0054, "mean_token_accuracy": 0.10154261440038681, "num_tokens": 655020.0, "step": 375 }, { "entropy": 7.300928163528442, "epoch": 0.029566232250534917, "grad_norm": 1.1171875, "learning_rate": 0.0001895, "loss": 6.8082, "mean_token_accuracy": 0.10665615424513816, "num_tokens": 663451.0, "step": 380 }, { "entropy": 7.367715358734131, "epoch": 0.02995526162225248, "grad_norm": 1.1875, "learning_rate": 0.000192, "loss": 6.9123, "mean_token_accuracy": 0.1059771090745926, "num_tokens": 671973.0, "step": 385 }, { "entropy": 7.3022441387176515, "epoch": 0.030344290993970045, "grad_norm": 1.2265625, "learning_rate": 0.0001945, "loss": 6.797, "mean_token_accuracy": 0.10909434482455253, "num_tokens": 680583.0, "step": 390 }, { "entropy": 7.2918174266815186, "epoch": 0.03073332036568761, "grad_norm": 1.3046875, "learning_rate": 0.00019700000000000002, "loss": 6.8136, "mean_token_accuracy": 0.10621452257037163, "num_tokens": 689000.0, "step": 395 }, { "entropy": 7.341504812240601, "epoch": 0.031122349737405176, "grad_norm": 1.2109375, "learning_rate": 0.00019950000000000002, "loss": 6.8056, "mean_token_accuracy": 0.10639143735170364, "num_tokens": 698047.0, "step": 400 }, { "entropy": 7.3614107131958, "epoch": 0.03151137910912274, "grad_norm": 1.078125, "learning_rate": 0.000202, "loss": 6.9386, "mean_token_accuracy": 0.10114315450191498, "num_tokens": 707192.0, "step": 405 }, { "entropy": 7.2852061748504635, "epoch": 0.0319004084808403, "grad_norm": 1.421875, "learning_rate": 0.00020449999999999998, "loss": 6.735, "mean_token_accuracy": 0.11116274818778038, "num_tokens": 715895.0, "step": 410 }, { "entropy": 7.310044527053833, "epoch": 0.03228943785255787, "grad_norm": 1.1640625, "learning_rate": 0.000207, "loss": 6.847, "mean_token_accuracy": 0.10309791564941406, "num_tokens": 724891.0, "step": 415 }, { "entropy": 7.340569972991943, "epoch": 0.032678467224275434, "grad_norm": 1.1953125, "learning_rate": 0.0002095, "loss": 6.8936, "mean_token_accuracy": 0.10329565331339836, "num_tokens": 733378.0, "step": 420 }, { "entropy": 7.354770565032959, "epoch": 0.033067496595993, "grad_norm": 1.265625, "learning_rate": 0.000212, "loss": 6.875, "mean_token_accuracy": 0.10341520011425018, "num_tokens": 741098.0, "step": 425 }, { "entropy": 7.338204622268677, "epoch": 0.033456525967710565, "grad_norm": 1.546875, "learning_rate": 0.0002145, "loss": 6.8378, "mean_token_accuracy": 0.10154023990035058, "num_tokens": 749902.0, "step": 430 }, { "entropy": 7.19447169303894, "epoch": 0.033845555339428124, "grad_norm": 1.296875, "learning_rate": 0.00021700000000000002, "loss": 6.8057, "mean_token_accuracy": 0.10481407195329666, "num_tokens": 758638.0, "step": 435 }, { "entropy": 7.39279146194458, "epoch": 0.03423458471114569, "grad_norm": 1.28125, "learning_rate": 0.0002195, "loss": 6.9067, "mean_token_accuracy": 0.10383950993418693, "num_tokens": 768170.0, "step": 440 }, { "entropy": 7.251432418823242, "epoch": 0.034623614082863255, "grad_norm": 1.3203125, "learning_rate": 0.000222, "loss": 6.7917, "mean_token_accuracy": 0.10390266478061676, "num_tokens": 776745.0, "step": 445 }, { "entropy": 7.344013214111328, "epoch": 0.03501264345458082, "grad_norm": 1.421875, "learning_rate": 0.0002245, "loss": 6.9049, "mean_token_accuracy": 0.10472740978002548, "num_tokens": 785030.0, "step": 450 }, { "entropy": 7.348719453811645, "epoch": 0.035401672826298386, "grad_norm": 1.359375, "learning_rate": 0.00022700000000000002, "loss": 6.8656, "mean_token_accuracy": 0.10142385959625244, "num_tokens": 793543.0, "step": 455 }, { "entropy": 7.12188196182251, "epoch": 0.03579070219801595, "grad_norm": 1.25, "learning_rate": 0.00022950000000000002, "loss": 6.7096, "mean_token_accuracy": 0.1019783414900303, "num_tokens": 802401.0, "step": 460 }, { "entropy": 7.367281770706176, "epoch": 0.03617973156973352, "grad_norm": 1.046875, "learning_rate": 0.00023200000000000003, "loss": 6.8284, "mean_token_accuracy": 0.10576049014925956, "num_tokens": 811625.0, "step": 465 }, { "entropy": 7.186238098144531, "epoch": 0.03656876094145108, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.7775, "mean_token_accuracy": 0.10242061167955399, "num_tokens": 820742.0, "step": 470 }, { "entropy": 7.257758092880249, "epoch": 0.03695779031316864, "grad_norm": 1.03125, "learning_rate": 0.000237, "loss": 6.8914, "mean_token_accuracy": 0.10146046429872513, "num_tokens": 829580.0, "step": 475 }, { "entropy": 7.289563941955566, "epoch": 0.03734681968488621, "grad_norm": 1.1328125, "learning_rate": 0.0002395, "loss": 6.8122, "mean_token_accuracy": 0.10589663460850715, "num_tokens": 838818.0, "step": 480 }, { "entropy": 7.339207744598388, "epoch": 0.03773584905660377, "grad_norm": 1.2578125, "learning_rate": 0.000242, "loss": 6.8286, "mean_token_accuracy": 0.09875347390770912, "num_tokens": 847804.0, "step": 485 }, { "entropy": 7.0710687160491945, "epoch": 0.03812487842832134, "grad_norm": 1.25, "learning_rate": 0.0002445, "loss": 6.5909, "mean_token_accuracy": 0.11272379085421562, "num_tokens": 856395.0, "step": 490 }, { "entropy": 7.308010816574097, "epoch": 0.0385139078000389, "grad_norm": 1.2421875, "learning_rate": 0.000247, "loss": 6.8648, "mean_token_accuracy": 0.10699901208281518, "num_tokens": 865219.0, "step": 495 }, { "entropy": 7.108584594726563, "epoch": 0.03890293717175647, "grad_norm": 1.2265625, "learning_rate": 0.0002495, "loss": 6.6471, "mean_token_accuracy": 0.1104583702981472, "num_tokens": 873868.0, "step": 500 }, { "entropy": 7.20792145729065, "epoch": 0.039291966543474034, "grad_norm": 1.1484375, "learning_rate": 0.000252, "loss": 6.7601, "mean_token_accuracy": 0.10320616662502288, "num_tokens": 882698.0, "step": 505 }, { "entropy": 7.190888500213623, "epoch": 0.0396809959151916, "grad_norm": 1.328125, "learning_rate": 0.0002545, "loss": 6.6947, "mean_token_accuracy": 0.11407066881656647, "num_tokens": 891280.0, "step": 510 }, { "entropy": 7.244538879394531, "epoch": 0.04007002528690916, "grad_norm": 1.25, "learning_rate": 0.000257, "loss": 6.7425, "mean_token_accuracy": 0.09894983395934105, "num_tokens": 900044.0, "step": 515 }, { "entropy": 7.08066873550415, "epoch": 0.040459054658626724, "grad_norm": 1.2421875, "learning_rate": 0.0002595, "loss": 6.7217, "mean_token_accuracy": 0.0992046169936657, "num_tokens": 909297.0, "step": 520 }, { "entropy": 7.1543323516845705, "epoch": 0.04084808403034429, "grad_norm": 1.25, "learning_rate": 0.000262, "loss": 6.7075, "mean_token_accuracy": 0.10772032216191292, "num_tokens": 917514.0, "step": 525 }, { "entropy": 7.194704627990722, "epoch": 0.041237113402061855, "grad_norm": 1.3359375, "learning_rate": 0.00026450000000000003, "loss": 6.6951, "mean_token_accuracy": 0.1101997010409832, "num_tokens": 925842.0, "step": 530 }, { "entropy": 7.067590141296387, "epoch": 0.04162614277377942, "grad_norm": 1.21875, "learning_rate": 0.00026700000000000004, "loss": 6.8094, "mean_token_accuracy": 0.09961830377578736, "num_tokens": 934676.0, "step": 535 }, { "entropy": 7.194618606567383, "epoch": 0.042015172145496986, "grad_norm": 1.21875, "learning_rate": 0.00026950000000000005, "loss": 6.7182, "mean_token_accuracy": 0.10596418976783753, "num_tokens": 943763.0, "step": 540 }, { "entropy": 7.158230352401733, "epoch": 0.04240420151721455, "grad_norm": 1.25, "learning_rate": 0.00027200000000000005, "loss": 6.7183, "mean_token_accuracy": 0.1088571310043335, "num_tokens": 952721.0, "step": 545 }, { "entropy": 7.143984985351563, "epoch": 0.04279323088893212, "grad_norm": 1.1875, "learning_rate": 0.0002745, "loss": 6.7143, "mean_token_accuracy": 0.11388995125889778, "num_tokens": 960899.0, "step": 550 }, { "entropy": 7.069172191619873, "epoch": 0.04318226026064968, "grad_norm": 1.375, "learning_rate": 0.000277, "loss": 6.7067, "mean_token_accuracy": 0.1085039384663105, "num_tokens": 969362.0, "step": 555 }, { "entropy": 7.178910207748413, "epoch": 0.04357128963236724, "grad_norm": 1.203125, "learning_rate": 0.0002795, "loss": 6.6775, "mean_token_accuracy": 0.11293213590979576, "num_tokens": 978028.0, "step": 560 }, { "entropy": 7.113482236862183, "epoch": 0.04396031900408481, "grad_norm": 1.1875, "learning_rate": 0.00028199999999999997, "loss": 6.6594, "mean_token_accuracy": 0.11223076805472373, "num_tokens": 985709.0, "step": 565 }, { "entropy": 7.220449066162109, "epoch": 0.04434934837580237, "grad_norm": 1.4140625, "learning_rate": 0.0002845, "loss": 6.7666, "mean_token_accuracy": 0.10906944498419761, "num_tokens": 994769.0, "step": 570 }, { "entropy": 7.125522947311401, "epoch": 0.04473837774751994, "grad_norm": 1.234375, "learning_rate": 0.000287, "loss": 6.7365, "mean_token_accuracy": 0.11124032214283944, "num_tokens": 1003997.0, "step": 575 }, { "entropy": 7.162062454223633, "epoch": 0.0451274071192375, "grad_norm": 1.296875, "learning_rate": 0.0002895, "loss": 6.7353, "mean_token_accuracy": 0.10934066548943519, "num_tokens": 1012931.0, "step": 580 }, { "entropy": 7.170513248443603, "epoch": 0.04551643649095507, "grad_norm": 1.3671875, "learning_rate": 0.000292, "loss": 6.7534, "mean_token_accuracy": 0.10608652755618095, "num_tokens": 1021149.0, "step": 585 }, { "entropy": 7.184502792358399, "epoch": 0.045905465862672634, "grad_norm": 1.28125, "learning_rate": 0.0002945, "loss": 6.7344, "mean_token_accuracy": 0.11254923641681672, "num_tokens": 1029421.0, "step": 590 }, { "entropy": 7.233080053329468, "epoch": 0.0462944952343902, "grad_norm": 1.453125, "learning_rate": 0.000297, "loss": 6.8544, "mean_token_accuracy": 0.10738511979579926, "num_tokens": 1037222.0, "step": 595 }, { "entropy": 7.11895523071289, "epoch": 0.04668352460610776, "grad_norm": 1.234375, "learning_rate": 0.0002995, "loss": 6.7686, "mean_token_accuracy": 0.10719419568777085, "num_tokens": 1046903.0, "step": 600 }, { "entropy": 7.1854307651519775, "epoch": 0.047072553977825324, "grad_norm": 1.1875, "learning_rate": 0.000302, "loss": 6.8112, "mean_token_accuracy": 0.10291046276688576, "num_tokens": 1055516.0, "step": 605 }, { "entropy": 7.158183145523071, "epoch": 0.04746158334954289, "grad_norm": 1.171875, "learning_rate": 0.0003045, "loss": 6.738, "mean_token_accuracy": 0.10869069769978523, "num_tokens": 1063846.0, "step": 610 }, { "entropy": 7.114259338378906, "epoch": 0.047850612721260455, "grad_norm": 1.1328125, "learning_rate": 0.000307, "loss": 6.7027, "mean_token_accuracy": 0.10939538329839707, "num_tokens": 1072500.0, "step": 615 }, { "entropy": 7.126255798339844, "epoch": 0.04823964209297802, "grad_norm": 1.2890625, "learning_rate": 0.0003095, "loss": 6.7245, "mean_token_accuracy": 0.10950846374034881, "num_tokens": 1081399.0, "step": 620 }, { "entropy": 7.04192967414856, "epoch": 0.048628671464695586, "grad_norm": 1.2734375, "learning_rate": 0.000312, "loss": 6.6774, "mean_token_accuracy": 0.11167947575449944, "num_tokens": 1089666.0, "step": 625 }, { "entropy": 7.143467807769776, "epoch": 0.04901770083641315, "grad_norm": 1.3359375, "learning_rate": 0.0003145, "loss": 6.5626, "mean_token_accuracy": 0.11535401195287705, "num_tokens": 1097496.0, "step": 630 }, { "entropy": 7.058351707458496, "epoch": 0.04940673020813072, "grad_norm": 1.2734375, "learning_rate": 0.000317, "loss": 6.7028, "mean_token_accuracy": 0.11161455810070038, "num_tokens": 1105840.0, "step": 635 }, { "entropy": 7.135726547241211, "epoch": 0.049795759579848276, "grad_norm": 1.171875, "learning_rate": 0.0003195, "loss": 6.7684, "mean_token_accuracy": 0.10728443264961243, "num_tokens": 1115507.0, "step": 640 }, { "entropy": 7.041813230514526, "epoch": 0.05018478895156584, "grad_norm": 1.078125, "learning_rate": 0.000322, "loss": 6.7167, "mean_token_accuracy": 0.10211084112524986, "num_tokens": 1124820.0, "step": 645 }, { "entropy": 7.087520885467529, "epoch": 0.05057381832328341, "grad_norm": 1.1328125, "learning_rate": 0.00032450000000000003, "loss": 6.5609, "mean_token_accuracy": 0.11316258385777474, "num_tokens": 1133641.0, "step": 650 }, { "entropy": 6.982738447189331, "epoch": 0.05096284769500097, "grad_norm": 1.2734375, "learning_rate": 0.00032700000000000003, "loss": 6.616, "mean_token_accuracy": 0.11105628833174705, "num_tokens": 1142182.0, "step": 655 }, { "entropy": 7.091386175155639, "epoch": 0.05135187706671854, "grad_norm": 1.21875, "learning_rate": 0.00032950000000000004, "loss": 6.6894, "mean_token_accuracy": 0.11387185752391815, "num_tokens": 1150737.0, "step": 660 }, { "entropy": 6.989086723327636, "epoch": 0.0517409064384361, "grad_norm": 1.171875, "learning_rate": 0.00033200000000000005, "loss": 6.5525, "mean_token_accuracy": 0.11128119602799416, "num_tokens": 1158899.0, "step": 665 }, { "entropy": 7.124065494537353, "epoch": 0.05212993581015367, "grad_norm": 1.3125, "learning_rate": 0.00033450000000000005, "loss": 6.6359, "mean_token_accuracy": 0.11705312058329582, "num_tokens": 1167397.0, "step": 670 }, { "entropy": 7.050602674484253, "epoch": 0.052518965181871234, "grad_norm": 1.1875, "learning_rate": 0.000337, "loss": 6.6545, "mean_token_accuracy": 0.10680999159812928, "num_tokens": 1177044.0, "step": 675 }, { "entropy": 6.930141878128052, "epoch": 0.05290799455358879, "grad_norm": 1.3984375, "learning_rate": 0.0003395, "loss": 6.524, "mean_token_accuracy": 0.11300303936004638, "num_tokens": 1185740.0, "step": 680 }, { "entropy": 6.976816177368164, "epoch": 0.05329702392530636, "grad_norm": 1.2734375, "learning_rate": 0.000342, "loss": 6.6738, "mean_token_accuracy": 0.11296947225928307, "num_tokens": 1194970.0, "step": 685 }, { "entropy": 7.070580577850341, "epoch": 0.053686053297023924, "grad_norm": 1.1875, "learning_rate": 0.00034449999999999997, "loss": 6.6134, "mean_token_accuracy": 0.11393867209553718, "num_tokens": 1203565.0, "step": 690 }, { "entropy": 7.023531770706176, "epoch": 0.05407508266874149, "grad_norm": 1.1328125, "learning_rate": 0.000347, "loss": 6.6592, "mean_token_accuracy": 0.10934962257742882, "num_tokens": 1213226.0, "step": 695 }, { "entropy": 6.905843925476074, "epoch": 0.054464112040459055, "grad_norm": 1.2109375, "learning_rate": 0.0003495, "loss": 6.5837, "mean_token_accuracy": 0.10722511857748032, "num_tokens": 1221710.0, "step": 700 }, { "entropy": 7.033835506439209, "epoch": 0.05485314141217662, "grad_norm": 1.046875, "learning_rate": 0.000352, "loss": 6.6413, "mean_token_accuracy": 0.10701307356357574, "num_tokens": 1231125.0, "step": 705 }, { "entropy": 7.04109468460083, "epoch": 0.055242170783894186, "grad_norm": 1.109375, "learning_rate": 0.0003545, "loss": 6.5952, "mean_token_accuracy": 0.11328281164169311, "num_tokens": 1239521.0, "step": 710 }, { "entropy": 6.99030909538269, "epoch": 0.05563120015561175, "grad_norm": 1.34375, "learning_rate": 0.000357, "loss": 6.4967, "mean_token_accuracy": 0.11905190572142602, "num_tokens": 1247363.0, "step": 715 }, { "entropy": 6.949197673797608, "epoch": 0.05602022952732931, "grad_norm": 1.25, "learning_rate": 0.0003595, "loss": 6.5756, "mean_token_accuracy": 0.10785499513149262, "num_tokens": 1255395.0, "step": 720 }, { "entropy": 7.050080490112305, "epoch": 0.056409258899046875, "grad_norm": 1.2265625, "learning_rate": 0.000362, "loss": 6.6461, "mean_token_accuracy": 0.10883620008826256, "num_tokens": 1264135.0, "step": 725 }, { "entropy": 7.0190126419067385, "epoch": 0.05679828827076444, "grad_norm": 1.1875, "learning_rate": 0.0003645, "loss": 6.5703, "mean_token_accuracy": 0.1117468774318695, "num_tokens": 1272375.0, "step": 730 }, { "entropy": 6.988955736160278, "epoch": 0.057187317642482006, "grad_norm": 1.125, "learning_rate": 0.000367, "loss": 6.6249, "mean_token_accuracy": 0.10667285323143005, "num_tokens": 1280960.0, "step": 735 }, { "entropy": 7.041416883468628, "epoch": 0.05757634701419957, "grad_norm": 1.234375, "learning_rate": 0.0003695, "loss": 6.6797, "mean_token_accuracy": 0.11113242357969284, "num_tokens": 1289273.0, "step": 740 }, { "entropy": 6.986820077896118, "epoch": 0.05796537638591714, "grad_norm": 1.3828125, "learning_rate": 0.000372, "loss": 6.5673, "mean_token_accuracy": 0.11231251433491707, "num_tokens": 1297571.0, "step": 745 }, { "entropy": 7.002435827255249, "epoch": 0.0583544057576347, "grad_norm": 1.21875, "learning_rate": 0.0003745, "loss": 6.6165, "mean_token_accuracy": 0.11419098302721978, "num_tokens": 1305686.0, "step": 750 }, { "entropy": 6.96313853263855, "epoch": 0.05874343512935227, "grad_norm": 1.1875, "learning_rate": 0.000377, "loss": 6.6372, "mean_token_accuracy": 0.1087796851992607, "num_tokens": 1314483.0, "step": 755 }, { "entropy": 6.946442985534668, "epoch": 0.059132464501069834, "grad_norm": 1.1796875, "learning_rate": 0.0003795, "loss": 6.5161, "mean_token_accuracy": 0.10849898308515549, "num_tokens": 1323183.0, "step": 760 }, { "entropy": 6.952772951126098, "epoch": 0.05952149387278739, "grad_norm": 1.2578125, "learning_rate": 0.000382, "loss": 6.6204, "mean_token_accuracy": 0.11015321984887123, "num_tokens": 1331964.0, "step": 765 }, { "entropy": 6.933269834518432, "epoch": 0.05991052324450496, "grad_norm": 1.3046875, "learning_rate": 0.0003845, "loss": 6.5707, "mean_token_accuracy": 0.11390582174062729, "num_tokens": 1340185.0, "step": 770 }, { "entropy": 7.053455209732055, "epoch": 0.060299552616222524, "grad_norm": 1.203125, "learning_rate": 0.00038700000000000003, "loss": 6.6715, "mean_token_accuracy": 0.1104957066476345, "num_tokens": 1349522.0, "step": 775 }, { "entropy": 7.057522010803223, "epoch": 0.06068858198794009, "grad_norm": 1.265625, "learning_rate": 0.00038950000000000003, "loss": 6.6406, "mean_token_accuracy": 0.10729108974337578, "num_tokens": 1357893.0, "step": 780 }, { "entropy": 6.856075191497803, "epoch": 0.061077611359657655, "grad_norm": 1.171875, "learning_rate": 0.00039200000000000004, "loss": 6.5272, "mean_token_accuracy": 0.11494160592555999, "num_tokens": 1366685.0, "step": 785 }, { "entropy": 6.961356449127197, "epoch": 0.06146664073137522, "grad_norm": 1.171875, "learning_rate": 0.00039450000000000005, "loss": 6.4661, "mean_token_accuracy": 0.11778462678194046, "num_tokens": 1375245.0, "step": 790 }, { "entropy": 6.9094297885894775, "epoch": 0.061855670103092786, "grad_norm": 1.1953125, "learning_rate": 0.00039700000000000005, "loss": 6.6459, "mean_token_accuracy": 0.1119820773601532, "num_tokens": 1383724.0, "step": 795 }, { "entropy": 7.064331769943237, "epoch": 0.06224469947481035, "grad_norm": 1.1640625, "learning_rate": 0.0003995, "loss": 6.6246, "mean_token_accuracy": 0.11086539849638939, "num_tokens": 1392455.0, "step": 800 }, { "entropy": 7.040333318710327, "epoch": 0.06263372884652792, "grad_norm": 1.1328125, "learning_rate": 0.000402, "loss": 6.6322, "mean_token_accuracy": 0.11222699806094169, "num_tokens": 1401262.0, "step": 805 }, { "entropy": 6.833669853210449, "epoch": 0.06302275821824548, "grad_norm": 1.3125, "learning_rate": 0.0004045, "loss": 6.528, "mean_token_accuracy": 0.11181755363941193, "num_tokens": 1409991.0, "step": 810 }, { "entropy": 6.826368951797486, "epoch": 0.06341178758996305, "grad_norm": 1.21875, "learning_rate": 0.00040699999999999997, "loss": 6.5143, "mean_token_accuracy": 0.11217057034373283, "num_tokens": 1418208.0, "step": 815 }, { "entropy": 7.009344673156738, "epoch": 0.0638008169616806, "grad_norm": 1.3828125, "learning_rate": 0.0004095, "loss": 6.5279, "mean_token_accuracy": 0.1156628392636776, "num_tokens": 1426665.0, "step": 820 }, { "entropy": 6.799173259735108, "epoch": 0.06418984633339817, "grad_norm": 1.2265625, "learning_rate": 0.000412, "loss": 6.4582, "mean_token_accuracy": 0.11917970553040505, "num_tokens": 1435247.0, "step": 825 }, { "entropy": 6.870002889633179, "epoch": 0.06457887570511574, "grad_norm": 1.1171875, "learning_rate": 0.0004145, "loss": 6.5052, "mean_token_accuracy": 0.11340074241161346, "num_tokens": 1443678.0, "step": 830 }, { "entropy": 6.767337274551392, "epoch": 0.0649679050768333, "grad_norm": 1.2578125, "learning_rate": 0.000417, "loss": 6.4409, "mean_token_accuracy": 0.12152031734585762, "num_tokens": 1451567.0, "step": 835 }, { "entropy": 6.837034368515015, "epoch": 0.06535693444855087, "grad_norm": 1.2265625, "learning_rate": 0.0004195, "loss": 6.4578, "mean_token_accuracy": 0.11555799394845963, "num_tokens": 1460618.0, "step": 840 }, { "entropy": 6.84786286354065, "epoch": 0.06574596382026843, "grad_norm": 1.203125, "learning_rate": 0.000422, "loss": 6.521, "mean_token_accuracy": 0.1165824718773365, "num_tokens": 1469821.0, "step": 845 }, { "entropy": 6.948866891860962, "epoch": 0.066134993191986, "grad_norm": 1.1484375, "learning_rate": 0.0004245, "loss": 6.596, "mean_token_accuracy": 0.11146286725997925, "num_tokens": 1477989.0, "step": 850 }, { "entropy": 6.937360382080078, "epoch": 0.06652402256370356, "grad_norm": 1.203125, "learning_rate": 0.000427, "loss": 6.6151, "mean_token_accuracy": 0.11400183513760567, "num_tokens": 1486822.0, "step": 855 }, { "entropy": 6.887311553955078, "epoch": 0.06691305193542113, "grad_norm": 1.2421875, "learning_rate": 0.0004295, "loss": 6.4833, "mean_token_accuracy": 0.11117951571941376, "num_tokens": 1496604.0, "step": 860 }, { "entropy": 6.801223611831665, "epoch": 0.06730208130713869, "grad_norm": 1.1953125, "learning_rate": 0.000432, "loss": 6.5104, "mean_token_accuracy": 0.11625081971287728, "num_tokens": 1504725.0, "step": 865 }, { "entropy": 6.889442777633667, "epoch": 0.06769111067885625, "grad_norm": 1.1875, "learning_rate": 0.0004345, "loss": 6.5156, "mean_token_accuracy": 0.11729802563786507, "num_tokens": 1513222.0, "step": 870 }, { "entropy": 6.880262184143066, "epoch": 0.06808014005057382, "grad_norm": 1.3046875, "learning_rate": 0.000437, "loss": 6.4837, "mean_token_accuracy": 0.1164153091609478, "num_tokens": 1522183.0, "step": 875 }, { "entropy": 6.819140386581421, "epoch": 0.06846916942229138, "grad_norm": 1.359375, "learning_rate": 0.0004395, "loss": 6.5135, "mean_token_accuracy": 0.11310733184218406, "num_tokens": 1531316.0, "step": 880 }, { "entropy": 6.924764108657837, "epoch": 0.06885819879400895, "grad_norm": 1.265625, "learning_rate": 0.000442, "loss": 6.579, "mean_token_accuracy": 0.11591333150863647, "num_tokens": 1540053.0, "step": 885 }, { "entropy": 6.83437933921814, "epoch": 0.06924722816572651, "grad_norm": 1.21875, "learning_rate": 0.0004445, "loss": 6.4385, "mean_token_accuracy": 0.1197456382215023, "num_tokens": 1549391.0, "step": 890 }, { "entropy": 6.9253668785095215, "epoch": 0.06963625753744408, "grad_norm": 1.25, "learning_rate": 0.000447, "loss": 6.5571, "mean_token_accuracy": 0.1145814374089241, "num_tokens": 1557364.0, "step": 895 }, { "entropy": 6.799445247650146, "epoch": 0.07002528690916164, "grad_norm": 1.3359375, "learning_rate": 0.00044950000000000003, "loss": 6.3947, "mean_token_accuracy": 0.1110591433942318, "num_tokens": 1567011.0, "step": 900 }, { "entropy": 6.749784517288208, "epoch": 0.0704143162808792, "grad_norm": 1.234375, "learning_rate": 0.00045200000000000004, "loss": 6.5116, "mean_token_accuracy": 0.11603075638413429, "num_tokens": 1575441.0, "step": 905 }, { "entropy": 6.821898317337036, "epoch": 0.07080334565259677, "grad_norm": 1.234375, "learning_rate": 0.00045450000000000004, "loss": 6.4575, "mean_token_accuracy": 0.11487730145454407, "num_tokens": 1583757.0, "step": 910 }, { "entropy": 6.860511064529419, "epoch": 0.07119237502431433, "grad_norm": 1.2109375, "learning_rate": 0.00045700000000000005, "loss": 6.5019, "mean_token_accuracy": 0.11874779388308525, "num_tokens": 1592406.0, "step": 915 }, { "entropy": 6.792093992233276, "epoch": 0.0715814043960319, "grad_norm": 1.3359375, "learning_rate": 0.00045950000000000006, "loss": 6.4787, "mean_token_accuracy": 0.11637907922267914, "num_tokens": 1601665.0, "step": 920 }, { "entropy": 6.8411633491516115, "epoch": 0.07197043376774946, "grad_norm": 1.46875, "learning_rate": 0.000462, "loss": 6.502, "mean_token_accuracy": 0.11683260723948478, "num_tokens": 1609788.0, "step": 925 }, { "entropy": 6.7901835441589355, "epoch": 0.07235946313946703, "grad_norm": 1.2421875, "learning_rate": 0.0004645, "loss": 6.5025, "mean_token_accuracy": 0.11982274875044822, "num_tokens": 1618030.0, "step": 930 }, { "entropy": 6.767443609237671, "epoch": 0.07274849251118459, "grad_norm": 1.2265625, "learning_rate": 0.000467, "loss": 6.5022, "mean_token_accuracy": 0.11648002341389656, "num_tokens": 1626901.0, "step": 935 }, { "entropy": 6.773926687240601, "epoch": 0.07313752188290217, "grad_norm": 1.1953125, "learning_rate": 0.0004695, "loss": 6.3908, "mean_token_accuracy": 0.1169219508767128, "num_tokens": 1635372.0, "step": 940 }, { "entropy": 6.745931243896484, "epoch": 0.07352655125461972, "grad_norm": 1.15625, "learning_rate": 0.000472, "loss": 6.4347, "mean_token_accuracy": 0.1165583461523056, "num_tokens": 1643791.0, "step": 945 }, { "entropy": 6.671934700012207, "epoch": 0.07391558062633728, "grad_norm": 1.25, "learning_rate": 0.0004745, "loss": 6.4064, "mean_token_accuracy": 0.12068933174014092, "num_tokens": 1652161.0, "step": 950 }, { "entropy": 6.832337713241577, "epoch": 0.07430460999805485, "grad_norm": 1.1328125, "learning_rate": 0.000477, "loss": 6.4351, "mean_token_accuracy": 0.11309069246053696, "num_tokens": 1661077.0, "step": 955 }, { "entropy": 6.688000345230103, "epoch": 0.07469363936977241, "grad_norm": 1.3203125, "learning_rate": 0.0004795, "loss": 6.4195, "mean_token_accuracy": 0.11566439867019654, "num_tokens": 1669010.0, "step": 960 }, { "entropy": 6.826863241195679, "epoch": 0.07508266874148999, "grad_norm": 1.15625, "learning_rate": 0.000482, "loss": 6.5798, "mean_token_accuracy": 0.11118761152029037, "num_tokens": 1678002.0, "step": 965 }, { "entropy": 6.840054130554199, "epoch": 0.07547169811320754, "grad_norm": 1.265625, "learning_rate": 0.0004845, "loss": 6.532, "mean_token_accuracy": 0.11202086359262467, "num_tokens": 1687403.0, "step": 970 }, { "entropy": 6.791687536239624, "epoch": 0.07586072748492512, "grad_norm": 1.203125, "learning_rate": 0.000487, "loss": 6.4514, "mean_token_accuracy": 0.11927441358566285, "num_tokens": 1695512.0, "step": 975 }, { "entropy": 6.763000774383545, "epoch": 0.07624975685664268, "grad_norm": 1.2578125, "learning_rate": 0.0004895, "loss": 6.4496, "mean_token_accuracy": 0.1148236095905304, "num_tokens": 1705116.0, "step": 980 }, { "entropy": 6.659470129013061, "epoch": 0.07663878622836025, "grad_norm": 1.265625, "learning_rate": 0.000492, "loss": 6.3587, "mean_token_accuracy": 0.11876563057303428, "num_tokens": 1713715.0, "step": 985 }, { "entropy": 6.745743465423584, "epoch": 0.0770278156000778, "grad_norm": 1.1953125, "learning_rate": 0.0004945, "loss": 6.4189, "mean_token_accuracy": 0.11852910742163658, "num_tokens": 1721881.0, "step": 990 }, { "entropy": 6.7183277130126955, "epoch": 0.07741684497179536, "grad_norm": 1.1875, "learning_rate": 0.000497, "loss": 6.4432, "mean_token_accuracy": 0.1176742009818554, "num_tokens": 1730716.0, "step": 995 }, { "entropy": 6.888888120651245, "epoch": 0.07780587434351294, "grad_norm": 1.1875, "learning_rate": 0.0004995, "loss": 6.5998, "mean_token_accuracy": 0.11513158455491065, "num_tokens": 1740257.0, "step": 1000 }, { "entropy": 6.787261962890625, "epoch": 0.0781949037152305, "grad_norm": 1.1171875, "learning_rate": 0.0004999999989075146, "loss": 6.5037, "mean_token_accuracy": 0.1148828312754631, "num_tokens": 1749071.0, "step": 1005 }, { "entropy": 6.743206596374511, "epoch": 0.07858393308694807, "grad_norm": 1.1328125, "learning_rate": 0.0004999999944692927, "loss": 6.5174, "mean_token_accuracy": 0.10950450450181962, "num_tokens": 1757952.0, "step": 1010 }, { "entropy": 6.725841903686524, "epoch": 0.07897296245866563, "grad_norm": 1.125, "learning_rate": 0.000499999986617054, "loss": 6.4453, "mean_token_accuracy": 0.11559172496199607, "num_tokens": 1766027.0, "step": 1015 }, { "entropy": 6.709922885894775, "epoch": 0.0793619918303832, "grad_norm": 1.0546875, "learning_rate": 0.0004999999753507986, "loss": 6.4473, "mean_token_accuracy": 0.11136003509163857, "num_tokens": 1775039.0, "step": 1020 }, { "entropy": 6.766154432296753, "epoch": 0.07975102120210076, "grad_norm": 1.1328125, "learning_rate": 0.0004999999606705267, "loss": 6.4508, "mean_token_accuracy": 0.12302565276622772, "num_tokens": 1783971.0, "step": 1025 }, { "entropy": 6.6978371143341064, "epoch": 0.08014005057381832, "grad_norm": 1.109375, "learning_rate": 0.0004999999425762385, "loss": 6.3723, "mean_token_accuracy": 0.11690968126058579, "num_tokens": 1792743.0, "step": 1030 }, { "entropy": 6.746917724609375, "epoch": 0.08052907994553589, "grad_norm": 1.1171875, "learning_rate": 0.0004999999210679344, "loss": 6.5249, "mean_token_accuracy": 0.10790274739265442, "num_tokens": 1801435.0, "step": 1035 }, { "entropy": 6.829019927978516, "epoch": 0.08091810931725345, "grad_norm": 1.15625, "learning_rate": 0.0004999998961456145, "loss": 6.4185, "mean_token_accuracy": 0.11439956873655319, "num_tokens": 1810147.0, "step": 1040 }, { "entropy": 6.664861822128296, "epoch": 0.08130713868897102, "grad_norm": 1.1953125, "learning_rate": 0.0004999998678092794, "loss": 6.3459, "mean_token_accuracy": 0.12141675725579262, "num_tokens": 1818672.0, "step": 1045 }, { "entropy": 6.779337644577026, "epoch": 0.08169616806068858, "grad_norm": 1.1484375, "learning_rate": 0.0004999998360589293, "loss": 6.5038, "mean_token_accuracy": 0.11229550465941429, "num_tokens": 1827590.0, "step": 1050 }, { "entropy": 6.68260350227356, "epoch": 0.08208519743240615, "grad_norm": 1.1484375, "learning_rate": 0.000499999800894565, "loss": 6.4138, "mean_token_accuracy": 0.11804961189627647, "num_tokens": 1836467.0, "step": 1055 }, { "entropy": 6.659322786331177, "epoch": 0.08247422680412371, "grad_norm": 1.21875, "learning_rate": 0.0004999997623161866, "loss": 6.3545, "mean_token_accuracy": 0.11814910471439362, "num_tokens": 1845537.0, "step": 1060 }, { "entropy": 6.668975210189819, "epoch": 0.08286325617584128, "grad_norm": 1.1796875, "learning_rate": 0.0004999997203237951, "loss": 6.3591, "mean_token_accuracy": 0.12657058462500573, "num_tokens": 1854433.0, "step": 1065 }, { "entropy": 6.699471855163575, "epoch": 0.08325228554755884, "grad_norm": 1.1015625, "learning_rate": 0.000499999674917391, "loss": 6.4629, "mean_token_accuracy": 0.11414268612861633, "num_tokens": 1863708.0, "step": 1070 }, { "entropy": 6.6790022373199465, "epoch": 0.0836413149192764, "grad_norm": 1.2109375, "learning_rate": 0.0004999996260969748, "loss": 6.3401, "mean_token_accuracy": 0.12237241193652153, "num_tokens": 1871854.0, "step": 1075 }, { "entropy": 6.618637943267823, "epoch": 0.08403034429099397, "grad_norm": 1.15625, "learning_rate": 0.0004999995738625475, "loss": 6.2953, "mean_token_accuracy": 0.12108489871025085, "num_tokens": 1880471.0, "step": 1080 }, { "entropy": 6.6455847263336185, "epoch": 0.08441937366271153, "grad_norm": 1.1796875, "learning_rate": 0.0004999995182141099, "loss": 6.3643, "mean_token_accuracy": 0.12223557531833648, "num_tokens": 1889882.0, "step": 1085 }, { "entropy": 6.545784616470337, "epoch": 0.0848084030344291, "grad_norm": 1.09375, "learning_rate": 0.0004999994591516626, "loss": 6.255, "mean_token_accuracy": 0.12821755334734916, "num_tokens": 1898701.0, "step": 1090 }, { "entropy": 6.611828470230103, "epoch": 0.08519743240614666, "grad_norm": 1.1484375, "learning_rate": 0.0004999993966752066, "loss": 6.3715, "mean_token_accuracy": 0.11571631282567978, "num_tokens": 1908165.0, "step": 1095 }, { "entropy": 6.640139150619507, "epoch": 0.08558646177786423, "grad_norm": 1.1015625, "learning_rate": 0.000499999330784743, "loss": 6.4811, "mean_token_accuracy": 0.1190013438463211, "num_tokens": 1916295.0, "step": 1100 }, { "entropy": 6.72911229133606, "epoch": 0.08597549114958179, "grad_norm": 1.2265625, "learning_rate": 0.0004999992614802725, "loss": 6.3657, "mean_token_accuracy": 0.12518487498164177, "num_tokens": 1924643.0, "step": 1105 }, { "entropy": 6.63273024559021, "epoch": 0.08636452052129936, "grad_norm": 1.0703125, "learning_rate": 0.0004999991887617966, "loss": 6.3742, "mean_token_accuracy": 0.11607154682278634, "num_tokens": 1933822.0, "step": 1110 }, { "entropy": 6.567139911651611, "epoch": 0.08675354989301692, "grad_norm": 1.2265625, "learning_rate": 0.0004999991126293158, "loss": 6.3671, "mean_token_accuracy": 0.119285686314106, "num_tokens": 1943278.0, "step": 1115 }, { "entropy": 6.764870882034302, "epoch": 0.08714257926473448, "grad_norm": 1.296875, "learning_rate": 0.0004999990330828318, "loss": 6.4038, "mean_token_accuracy": 0.11785744428634644, "num_tokens": 1951883.0, "step": 1120 }, { "entropy": 6.537186765670777, "epoch": 0.08753160863645205, "grad_norm": 1.140625, "learning_rate": 0.0004999989501223456, "loss": 6.2868, "mean_token_accuracy": 0.12786889150738717, "num_tokens": 1959567.0, "step": 1125 }, { "entropy": 6.700858688354492, "epoch": 0.08792063800816961, "grad_norm": 1.1015625, "learning_rate": 0.0004999988637478584, "loss": 6.3722, "mean_token_accuracy": 0.12128480300307273, "num_tokens": 1968190.0, "step": 1130 }, { "entropy": 6.507136249542237, "epoch": 0.08830966737988719, "grad_norm": 1.09375, "learning_rate": 0.0004999987739593716, "loss": 6.2919, "mean_token_accuracy": 0.1241019494831562, "num_tokens": 1977519.0, "step": 1135 }, { "entropy": 6.6155976295471195, "epoch": 0.08869869675160474, "grad_norm": 1.2890625, "learning_rate": 0.0004999986807568865, "loss": 6.2728, "mean_token_accuracy": 0.12157176062464714, "num_tokens": 1985796.0, "step": 1140 }, { "entropy": 6.703161907196045, "epoch": 0.08908772612332232, "grad_norm": 1.15625, "learning_rate": 0.0004999985841404045, "loss": 6.4198, "mean_token_accuracy": 0.11606316342949867, "num_tokens": 1993874.0, "step": 1145 }, { "entropy": 6.698982381820679, "epoch": 0.08947675549503988, "grad_norm": 1.2421875, "learning_rate": 0.0004999984841099271, "loss": 6.3686, "mean_token_accuracy": 0.12184037938714028, "num_tokens": 2001663.0, "step": 1150 }, { "entropy": 6.559295749664306, "epoch": 0.08986578486675743, "grad_norm": 1.203125, "learning_rate": 0.000499998380665456, "loss": 6.3539, "mean_token_accuracy": 0.1229154959321022, "num_tokens": 2010179.0, "step": 1155 }, { "entropy": 6.653844833374023, "epoch": 0.090254814238475, "grad_norm": 1.1796875, "learning_rate": 0.0004999982738069924, "loss": 6.2589, "mean_token_accuracy": 0.12252619490027428, "num_tokens": 2020013.0, "step": 1160 }, { "entropy": 6.594068193435669, "epoch": 0.09064384361019256, "grad_norm": 1.7109375, "learning_rate": 0.0004999981635345382, "loss": 6.3751, "mean_token_accuracy": 0.12590979486703874, "num_tokens": 2028396.0, "step": 1165 }, { "entropy": 6.726529788970947, "epoch": 0.09103287298191014, "grad_norm": 1.1015625, "learning_rate": 0.0004999980498480949, "loss": 6.4733, "mean_token_accuracy": 0.11403553262352943, "num_tokens": 2036947.0, "step": 1170 }, { "entropy": 6.585730981826782, "epoch": 0.0914219023536277, "grad_norm": 1.203125, "learning_rate": 0.0004999979327476644, "loss": 6.3254, "mean_token_accuracy": 0.11759492009878159, "num_tokens": 2045162.0, "step": 1175 }, { "entropy": 6.6485522270202635, "epoch": 0.09181093172534527, "grad_norm": 1.0859375, "learning_rate": 0.0004999978122332485, "loss": 6.4095, "mean_token_accuracy": 0.11743757203221321, "num_tokens": 2054198.0, "step": 1180 }, { "entropy": 6.583405160903931, "epoch": 0.09219996109706283, "grad_norm": 1.25, "learning_rate": 0.0004999976883048487, "loss": 6.3297, "mean_token_accuracy": 0.11797131523489952, "num_tokens": 2062558.0, "step": 1185 }, { "entropy": 6.551700019836426, "epoch": 0.0925889904687804, "grad_norm": 1.296875, "learning_rate": 0.0004999975609624673, "loss": 6.2095, "mean_token_accuracy": 0.11727948859333992, "num_tokens": 2070816.0, "step": 1190 }, { "entropy": 6.552899169921875, "epoch": 0.09297801984049796, "grad_norm": 1.1796875, "learning_rate": 0.0004999974302061059, "loss": 6.2712, "mean_token_accuracy": 0.12385502606630325, "num_tokens": 2079058.0, "step": 1195 }, { "entropy": 6.530488681793213, "epoch": 0.09336704921221552, "grad_norm": 1.2578125, "learning_rate": 0.0004999972960357666, "loss": 6.2343, "mean_token_accuracy": 0.12390355318784714, "num_tokens": 2086679.0, "step": 1200 }, { "entropy": 6.622032976150512, "epoch": 0.09375607858393309, "grad_norm": 1.3125, "learning_rate": 0.0004999971584514516, "loss": 6.3462, "mean_token_accuracy": 0.12203274443745613, "num_tokens": 2095788.0, "step": 1205 }, { "entropy": 6.5792169094085695, "epoch": 0.09414510795565065, "grad_norm": 1.078125, "learning_rate": 0.0004999970174531627, "loss": 6.3628, "mean_token_accuracy": 0.11934652253985405, "num_tokens": 2105435.0, "step": 1210 }, { "entropy": 6.570254611968994, "epoch": 0.09453413732736822, "grad_norm": 1.140625, "learning_rate": 0.0004999968730409022, "loss": 6.3156, "mean_token_accuracy": 0.1212031789124012, "num_tokens": 2114318.0, "step": 1215 }, { "entropy": 6.521538877487183, "epoch": 0.09492316669908578, "grad_norm": 1.2578125, "learning_rate": 0.0004999967252146723, "loss": 6.245, "mean_token_accuracy": 0.13023234903812408, "num_tokens": 2122707.0, "step": 1220 }, { "entropy": 6.497583961486816, "epoch": 0.09531219607080335, "grad_norm": 1.171875, "learning_rate": 0.0004999965739744752, "loss": 6.3365, "mean_token_accuracy": 0.1240180067718029, "num_tokens": 2131176.0, "step": 1225 }, { "entropy": 6.681749296188355, "epoch": 0.09570122544252091, "grad_norm": 1.1328125, "learning_rate": 0.0004999964193203132, "loss": 6.3785, "mean_token_accuracy": 0.12624216973781585, "num_tokens": 2139872.0, "step": 1230 }, { "entropy": 6.508302974700928, "epoch": 0.09609025481423847, "grad_norm": 1.1484375, "learning_rate": 0.0004999962612521888, "loss": 6.2386, "mean_token_accuracy": 0.1306472271680832, "num_tokens": 2148668.0, "step": 1235 }, { "entropy": 6.534418439865112, "epoch": 0.09647928418595604, "grad_norm": 1.140625, "learning_rate": 0.0004999960997701041, "loss": 6.24, "mean_token_accuracy": 0.12787432298064233, "num_tokens": 2156628.0, "step": 1240 }, { "entropy": 6.563996267318726, "epoch": 0.0968683135576736, "grad_norm": 1.0234375, "learning_rate": 0.0004999959348740618, "loss": 6.3335, "mean_token_accuracy": 0.11790938824415206, "num_tokens": 2165620.0, "step": 1245 }, { "entropy": 6.626491832733154, "epoch": 0.09725734292939117, "grad_norm": 1.2890625, "learning_rate": 0.0004999957665640641, "loss": 6.3967, "mean_token_accuracy": 0.11869805678725243, "num_tokens": 2174493.0, "step": 1250 }, { "entropy": 6.55765929222107, "epoch": 0.09764637230110873, "grad_norm": 1.2421875, "learning_rate": 0.000499995594840114, "loss": 6.2909, "mean_token_accuracy": 0.11683699488639832, "num_tokens": 2183258.0, "step": 1255 }, { "entropy": 6.548435878753662, "epoch": 0.0980354016728263, "grad_norm": 1.2109375, "learning_rate": 0.0004999954197022138, "loss": 6.3454, "mean_token_accuracy": 0.11895403861999512, "num_tokens": 2192263.0, "step": 1260 }, { "entropy": 6.651948308944702, "epoch": 0.09842443104454386, "grad_norm": 1.125, "learning_rate": 0.0004999952411503661, "loss": 6.3889, "mean_token_accuracy": 0.1177945502102375, "num_tokens": 2201797.0, "step": 1265 }, { "entropy": 6.354124736785889, "epoch": 0.09881346041626143, "grad_norm": 1.2265625, "learning_rate": 0.0004999950591845738, "loss": 6.1299, "mean_token_accuracy": 0.1311613693833351, "num_tokens": 2209454.0, "step": 1270 }, { "entropy": 6.649595832824707, "epoch": 0.09920248978797899, "grad_norm": 1.234375, "learning_rate": 0.0004999948738048397, "loss": 6.3022, "mean_token_accuracy": 0.12611282840371132, "num_tokens": 2217761.0, "step": 1275 }, { "entropy": 6.47292742729187, "epoch": 0.09959151915969655, "grad_norm": 1.2890625, "learning_rate": 0.0004999946850111663, "loss": 6.2906, "mean_token_accuracy": 0.12207216396927834, "num_tokens": 2225793.0, "step": 1280 }, { "entropy": 6.592188453674316, "epoch": 0.09998054853141412, "grad_norm": 1.125, "learning_rate": 0.0004999944928035569, "loss": 6.1805, "mean_token_accuracy": 0.1319039449095726, "num_tokens": 2234620.0, "step": 1285 }, { "entropy": 6.4829436302185055, "epoch": 0.10036957790313168, "grad_norm": 1.125, "learning_rate": 0.000499994297182014, "loss": 6.2643, "mean_token_accuracy": 0.12326281145215034, "num_tokens": 2242829.0, "step": 1290 }, { "entropy": 6.57083477973938, "epoch": 0.10075860727484925, "grad_norm": 1.125, "learning_rate": 0.0004999940981465408, "loss": 6.3014, "mean_token_accuracy": 0.11634257808327675, "num_tokens": 2251356.0, "step": 1295 }, { "entropy": 6.523905658721924, "epoch": 0.10114763664656681, "grad_norm": 1.1640625, "learning_rate": 0.0004999938956971404, "loss": 6.3684, "mean_token_accuracy": 0.11852610781788826, "num_tokens": 2259327.0, "step": 1300 }, { "entropy": 6.59006552696228, "epoch": 0.10153666601828439, "grad_norm": 1.0625, "learning_rate": 0.0004999936898338156, "loss": 6.3871, "mean_token_accuracy": 0.11884624063968659, "num_tokens": 2267948.0, "step": 1305 }, { "entropy": 6.446884679794311, "epoch": 0.10192569539000194, "grad_norm": 1.1875, "learning_rate": 0.0004999934805565698, "loss": 6.194, "mean_token_accuracy": 0.1225943498313427, "num_tokens": 2275828.0, "step": 1310 }, { "entropy": 6.5004541873931885, "epoch": 0.10231472476171952, "grad_norm": 1.1328125, "learning_rate": 0.000499993267865406, "loss": 6.1373, "mean_token_accuracy": 0.1289021112024784, "num_tokens": 2284246.0, "step": 1315 }, { "entropy": 6.385093450546265, "epoch": 0.10270375413343708, "grad_norm": 1.203125, "learning_rate": 0.0004999930517603275, "loss": 6.1261, "mean_token_accuracy": 0.13380536437034607, "num_tokens": 2291837.0, "step": 1320 }, { "entropy": 6.546138572692871, "epoch": 0.10309278350515463, "grad_norm": 1.1875, "learning_rate": 0.0004999928322413374, "loss": 6.206, "mean_token_accuracy": 0.12851327955722808, "num_tokens": 2299853.0, "step": 1325 }, { "entropy": 6.574787330627442, "epoch": 0.1034818128768722, "grad_norm": 1.1875, "learning_rate": 0.0004999926093084394, "loss": 6.3075, "mean_token_accuracy": 0.1206931158900261, "num_tokens": 2308416.0, "step": 1330 }, { "entropy": 6.507684230804443, "epoch": 0.10387084224858976, "grad_norm": 1.15625, "learning_rate": 0.0004999923829616365, "loss": 6.3388, "mean_token_accuracy": 0.12228097319602967, "num_tokens": 2318104.0, "step": 1335 }, { "entropy": 6.501170110702515, "epoch": 0.10425987162030734, "grad_norm": 1.0390625, "learning_rate": 0.0004999921532009323, "loss": 6.2612, "mean_token_accuracy": 0.12383703589439392, "num_tokens": 2326807.0, "step": 1340 }, { "entropy": 6.528704977035522, "epoch": 0.1046489009920249, "grad_norm": 1.0546875, "learning_rate": 0.0004999919200263304, "loss": 6.259, "mean_token_accuracy": 0.12394311875104905, "num_tokens": 2335921.0, "step": 1345 }, { "entropy": 6.505633020401001, "epoch": 0.10503793036374247, "grad_norm": 1.1640625, "learning_rate": 0.0004999916834378342, "loss": 6.2739, "mean_token_accuracy": 0.12304315939545632, "num_tokens": 2344914.0, "step": 1350 }, { "entropy": 6.447750616073608, "epoch": 0.10542695973546003, "grad_norm": 1.09375, "learning_rate": 0.0004999914434354472, "loss": 6.2044, "mean_token_accuracy": 0.125525876134634, "num_tokens": 2353211.0, "step": 1355 }, { "entropy": 6.4893646240234375, "epoch": 0.10581598910717759, "grad_norm": 1.1640625, "learning_rate": 0.0004999912000191733, "loss": 6.3487, "mean_token_accuracy": 0.12199961394071579, "num_tokens": 2361717.0, "step": 1360 }, { "entropy": 6.525090074539184, "epoch": 0.10620501847889516, "grad_norm": 1.0859375, "learning_rate": 0.000499990953189016, "loss": 6.2712, "mean_token_accuracy": 0.13059643879532815, "num_tokens": 2370114.0, "step": 1365 }, { "entropy": 6.630150699615479, "epoch": 0.10659404785061272, "grad_norm": 1.171875, "learning_rate": 0.0004999907029449791, "loss": 6.263, "mean_token_accuracy": 0.12237593159079552, "num_tokens": 2378820.0, "step": 1370 }, { "entropy": 6.354615974426269, "epoch": 0.10698307722233029, "grad_norm": 1.0625, "learning_rate": 0.0004999904492870663, "loss": 6.1715, "mean_token_accuracy": 0.12704389467835425, "num_tokens": 2387119.0, "step": 1375 }, { "entropy": 6.53058009147644, "epoch": 0.10737210659404785, "grad_norm": 1.1875, "learning_rate": 0.0004999901922152816, "loss": 6.2259, "mean_token_accuracy": 0.12630244940519333, "num_tokens": 2396246.0, "step": 1380 }, { "entropy": 6.406842041015625, "epoch": 0.10776113596576542, "grad_norm": 1.1171875, "learning_rate": 0.0004999899317296288, "loss": 6.2855, "mean_token_accuracy": 0.12351492792367935, "num_tokens": 2405428.0, "step": 1385 }, { "entropy": 6.490512895584106, "epoch": 0.10815016533748298, "grad_norm": 1.171875, "learning_rate": 0.0004999896678301121, "loss": 6.2421, "mean_token_accuracy": 0.1267989382147789, "num_tokens": 2414669.0, "step": 1390 }, { "entropy": 6.563437604904175, "epoch": 0.10853919470920055, "grad_norm": 1.1875, "learning_rate": 0.0004999894005167352, "loss": 6.3, "mean_token_accuracy": 0.12090388685464859, "num_tokens": 2423193.0, "step": 1395 }, { "entropy": 6.500105094909668, "epoch": 0.10892822408091811, "grad_norm": 1.1875, "learning_rate": 0.000499989129789502, "loss": 6.2664, "mean_token_accuracy": 0.12048013284802436, "num_tokens": 2431150.0, "step": 1400 }, { "entropy": 6.445392656326294, "epoch": 0.10931725345263567, "grad_norm": 1.171875, "learning_rate": 0.0004999888556484172, "loss": 6.2446, "mean_token_accuracy": 0.12127585709095001, "num_tokens": 2440337.0, "step": 1405 }, { "entropy": 6.441078138351441, "epoch": 0.10970628282435324, "grad_norm": 1.171875, "learning_rate": 0.0004999885780934845, "loss": 6.1736, "mean_token_accuracy": 0.1296399176120758, "num_tokens": 2449246.0, "step": 1410 }, { "entropy": 6.434943819046021, "epoch": 0.1100953121960708, "grad_norm": 1.109375, "learning_rate": 0.0004999882971247081, "loss": 6.1752, "mean_token_accuracy": 0.13090624362230302, "num_tokens": 2457982.0, "step": 1415 }, { "entropy": 6.44070029258728, "epoch": 0.11048434156778837, "grad_norm": 1.0, "learning_rate": 0.0004999880127420926, "loss": 6.1661, "mean_token_accuracy": 0.12823255807161332, "num_tokens": 2466697.0, "step": 1420 }, { "entropy": 6.419079399108886, "epoch": 0.11087337093950593, "grad_norm": 1.1015625, "learning_rate": 0.0004999877249456421, "loss": 6.1397, "mean_token_accuracy": 0.13144427835941314, "num_tokens": 2475457.0, "step": 1425 }, { "entropy": 6.336713647842407, "epoch": 0.1112624003112235, "grad_norm": 1.0546875, "learning_rate": 0.0004999874337353609, "loss": 6.1393, "mean_token_accuracy": 0.12938348650932313, "num_tokens": 2484753.0, "step": 1430 }, { "entropy": 6.465570974349975, "epoch": 0.11165142968294106, "grad_norm": 1.1484375, "learning_rate": 0.0004999871391112535, "loss": 6.2556, "mean_token_accuracy": 0.124443519115448, "num_tokens": 2492921.0, "step": 1435 }, { "entropy": 6.46670618057251, "epoch": 0.11204045905465862, "grad_norm": 1.140625, "learning_rate": 0.0004999868410733244, "loss": 6.224, "mean_token_accuracy": 0.12451541647315026, "num_tokens": 2501371.0, "step": 1440 }, { "entropy": 6.471292209625244, "epoch": 0.11242948842637619, "grad_norm": 1.234375, "learning_rate": 0.000499986539621578, "loss": 6.1023, "mean_token_accuracy": 0.12834953069686889, "num_tokens": 2509521.0, "step": 1445 }, { "entropy": 6.416775035858154, "epoch": 0.11281851779809375, "grad_norm": 1.2109375, "learning_rate": 0.0004999862347560191, "loss": 6.2143, "mean_token_accuracy": 0.12635174617171288, "num_tokens": 2518316.0, "step": 1450 }, { "entropy": 6.514144420623779, "epoch": 0.11320754716981132, "grad_norm": 1.078125, "learning_rate": 0.0004999859264766521, "loss": 6.309, "mean_token_accuracy": 0.1220340982079506, "num_tokens": 2527549.0, "step": 1455 }, { "entropy": 6.501974773406983, "epoch": 0.11359657654152888, "grad_norm": 1.046875, "learning_rate": 0.0004999856147834817, "loss": 6.33, "mean_token_accuracy": 0.12365049570798874, "num_tokens": 2536341.0, "step": 1460 }, { "entropy": 6.390389823913575, "epoch": 0.11398560591324645, "grad_norm": 1.1328125, "learning_rate": 0.0004999852996765129, "loss": 6.2144, "mean_token_accuracy": 0.13640521019697188, "num_tokens": 2544869.0, "step": 1465 }, { "entropy": 6.442426967620849, "epoch": 0.11437463528496401, "grad_norm": 1.171875, "learning_rate": 0.0004999849811557502, "loss": 6.1124, "mean_token_accuracy": 0.1380823515355587, "num_tokens": 2553432.0, "step": 1470 }, { "entropy": 6.435215473175049, "epoch": 0.11476366465668159, "grad_norm": 1.1328125, "learning_rate": 0.0004999846592211984, "loss": 6.245, "mean_token_accuracy": 0.12433946654200553, "num_tokens": 2561996.0, "step": 1475 }, { "entropy": 6.435883617401123, "epoch": 0.11515269402839914, "grad_norm": 1.1171875, "learning_rate": 0.0004999843338728626, "loss": 6.1732, "mean_token_accuracy": 0.13035295605659486, "num_tokens": 2571315.0, "step": 1480 }, { "entropy": 6.433837747573852, "epoch": 0.1155417234001167, "grad_norm": 1.2109375, "learning_rate": 0.0004999840051107476, "loss": 6.2935, "mean_token_accuracy": 0.12482402846217155, "num_tokens": 2579589.0, "step": 1485 }, { "entropy": 6.433605575561524, "epoch": 0.11593075277183428, "grad_norm": 1.1171875, "learning_rate": 0.0004999836729348584, "loss": 6.0607, "mean_token_accuracy": 0.1283522941172123, "num_tokens": 2588528.0, "step": 1490 }, { "entropy": 6.3824395656585695, "epoch": 0.11631978214355183, "grad_norm": 1.0546875, "learning_rate": 0.0004999833373452, "loss": 6.1744, "mean_token_accuracy": 0.12705983147025107, "num_tokens": 2596820.0, "step": 1495 }, { "entropy": 6.30913896560669, "epoch": 0.1167088115152694, "grad_norm": 1.15625, "learning_rate": 0.0004999829983417778, "loss": 6.1168, "mean_token_accuracy": 0.12735813558101655, "num_tokens": 2605502.0, "step": 1500 }, { "entropy": 6.378449249267578, "epoch": 0.11709784088698696, "grad_norm": 1.1875, "learning_rate": 0.0004999826559245965, "loss": 6.1193, "mean_token_accuracy": 0.13392857909202577, "num_tokens": 2613974.0, "step": 1505 }, { "entropy": 6.370792722702026, "epoch": 0.11748687025870454, "grad_norm": 1.109375, "learning_rate": 0.0004999823100936615, "loss": 6.1965, "mean_token_accuracy": 0.12880947291851044, "num_tokens": 2622581.0, "step": 1510 }, { "entropy": 6.402956151962281, "epoch": 0.1178758996304221, "grad_norm": 1.0859375, "learning_rate": 0.0004999819608489781, "loss": 6.0841, "mean_token_accuracy": 0.1251236990094185, "num_tokens": 2631868.0, "step": 1515 }, { "entropy": 6.339415788650513, "epoch": 0.11826492900213967, "grad_norm": 1.203125, "learning_rate": 0.0004999816081905515, "loss": 6.1093, "mean_token_accuracy": 0.1355234570801258, "num_tokens": 2640501.0, "step": 1520 }, { "entropy": 6.433193206787109, "epoch": 0.11865395837385723, "grad_norm": 1.0859375, "learning_rate": 0.0004999812521183872, "loss": 6.1035, "mean_token_accuracy": 0.13361863121390344, "num_tokens": 2648916.0, "step": 1525 }, { "entropy": 6.406140279769898, "epoch": 0.11904298774557479, "grad_norm": 1.078125, "learning_rate": 0.0004999808926324903, "loss": 6.1896, "mean_token_accuracy": 0.1334061346948147, "num_tokens": 2657725.0, "step": 1530 }, { "entropy": 6.353977298736572, "epoch": 0.11943201711729236, "grad_norm": 1.171875, "learning_rate": 0.0004999805297328665, "loss": 6.1751, "mean_token_accuracy": 0.1281532824039459, "num_tokens": 2665983.0, "step": 1535 }, { "entropy": 6.392253303527832, "epoch": 0.11982104648900992, "grad_norm": 1.140625, "learning_rate": 0.0004999801634195214, "loss": 6.1957, "mean_token_accuracy": 0.13333539366722108, "num_tokens": 2674546.0, "step": 1540 }, { "entropy": 6.389540004730224, "epoch": 0.12021007586072749, "grad_norm": 1.0859375, "learning_rate": 0.0004999797936924603, "loss": 6.1091, "mean_token_accuracy": 0.13411504104733468, "num_tokens": 2684088.0, "step": 1545 }, { "entropy": 6.37681622505188, "epoch": 0.12059910523244505, "grad_norm": 1.0546875, "learning_rate": 0.000499979420551689, "loss": 6.1664, "mean_token_accuracy": 0.12699728310108185, "num_tokens": 2693289.0, "step": 1550 }, { "entropy": 6.318667316436768, "epoch": 0.12098813460416262, "grad_norm": 1.1171875, "learning_rate": 0.000499979043997213, "loss": 6.095, "mean_token_accuracy": 0.13104904145002366, "num_tokens": 2701744.0, "step": 1555 }, { "entropy": 6.411156368255615, "epoch": 0.12137716397588018, "grad_norm": 1.1015625, "learning_rate": 0.0004999786640290381, "loss": 6.1499, "mean_token_accuracy": 0.12439182624220849, "num_tokens": 2710584.0, "step": 1560 }, { "entropy": 6.411997509002686, "epoch": 0.12176619334759774, "grad_norm": 1.0625, "learning_rate": 0.0004999782806471701, "loss": 6.1491, "mean_token_accuracy": 0.13031079471111298, "num_tokens": 2719478.0, "step": 1565 }, { "entropy": 6.465567684173584, "epoch": 0.12215522271931531, "grad_norm": 1.0625, "learning_rate": 0.0004999778938516147, "loss": 6.2286, "mean_token_accuracy": 0.12305473163723946, "num_tokens": 2729105.0, "step": 1570 }, { "entropy": 6.401231145858764, "epoch": 0.12254425209103287, "grad_norm": 1.0078125, "learning_rate": 0.000499977503642378, "loss": 6.1908, "mean_token_accuracy": 0.1272389329969883, "num_tokens": 2738300.0, "step": 1575 }, { "entropy": 6.384681034088135, "epoch": 0.12293328146275044, "grad_norm": 1.078125, "learning_rate": 0.0004999771100194656, "loss": 6.1335, "mean_token_accuracy": 0.12494338452816009, "num_tokens": 2747236.0, "step": 1580 }, { "entropy": 6.289424848556519, "epoch": 0.123322310834468, "grad_norm": 1.09375, "learning_rate": 0.0004999767129828837, "loss": 6.0956, "mean_token_accuracy": 0.13419784530997275, "num_tokens": 2755919.0, "step": 1585 }, { "entropy": 6.305175161361694, "epoch": 0.12371134020618557, "grad_norm": 1.140625, "learning_rate": 0.0004999763125326383, "loss": 6.0768, "mean_token_accuracy": 0.1307978369295597, "num_tokens": 2764469.0, "step": 1590 }, { "entropy": 6.355486297607422, "epoch": 0.12410036957790313, "grad_norm": 1.1171875, "learning_rate": 0.0004999759086687355, "loss": 6.081, "mean_token_accuracy": 0.1366819642484188, "num_tokens": 2772663.0, "step": 1595 }, { "entropy": 6.419379472732544, "epoch": 0.1244893989496207, "grad_norm": 1.09375, "learning_rate": 0.0004999755013911813, "loss": 6.1161, "mean_token_accuracy": 0.12876046895980836, "num_tokens": 2780719.0, "step": 1600 }, { "entropy": 6.330186557769776, "epoch": 0.12487842832133826, "grad_norm": 1.1015625, "learning_rate": 0.000499975090699982, "loss": 6.1714, "mean_token_accuracy": 0.128857558965683, "num_tokens": 2789186.0, "step": 1605 }, { "entropy": 6.337528562545776, "epoch": 0.12526745769305583, "grad_norm": 1.15625, "learning_rate": 0.0004999746765951438, "loss": 6.0856, "mean_token_accuracy": 0.13346567153930664, "num_tokens": 2797993.0, "step": 1610 }, { "entropy": 6.312220811843872, "epoch": 0.1256564870647734, "grad_norm": 1.2265625, "learning_rate": 0.0004999742590766729, "loss": 6.0464, "mean_token_accuracy": 0.13435178622603416, "num_tokens": 2806375.0, "step": 1615 }, { "entropy": 6.440674829483032, "epoch": 0.12604551643649095, "grad_norm": 1.1015625, "learning_rate": 0.0004999738381445757, "loss": 6.1942, "mean_token_accuracy": 0.13562749326229095, "num_tokens": 2814772.0, "step": 1620 }, { "entropy": 6.202065896987915, "epoch": 0.1264345458082085, "grad_norm": 1.09375, "learning_rate": 0.0004999734137988586, "loss": 6.0582, "mean_token_accuracy": 0.13596921488642694, "num_tokens": 2824231.0, "step": 1625 }, { "entropy": 6.376500511169434, "epoch": 0.1268235751799261, "grad_norm": 1.0234375, "learning_rate": 0.000499972986039528, "loss": 6.1245, "mean_token_accuracy": 0.12782634794712067, "num_tokens": 2833470.0, "step": 1630 }, { "entropy": 6.353403902053833, "epoch": 0.12721260455164365, "grad_norm": 1.0546875, "learning_rate": 0.0004999725548665904, "loss": 6.1327, "mean_token_accuracy": 0.1281338281929493, "num_tokens": 2843010.0, "step": 1635 }, { "entropy": 6.346253395080566, "epoch": 0.1276016339233612, "grad_norm": 1.0625, "learning_rate": 0.0004999721202800524, "loss": 6.0231, "mean_token_accuracy": 0.13678104057908058, "num_tokens": 2851545.0, "step": 1640 }, { "entropy": 6.269683694839477, "epoch": 0.12799066329507877, "grad_norm": 1.0234375, "learning_rate": 0.0004999716822799206, "loss": 6.1796, "mean_token_accuracy": 0.11961811035871506, "num_tokens": 2861230.0, "step": 1645 }, { "entropy": 6.395336675643921, "epoch": 0.12837969266679633, "grad_norm": 1.1796875, "learning_rate": 0.0004999712408662016, "loss": 6.1356, "mean_token_accuracy": 0.1289409004151821, "num_tokens": 2869436.0, "step": 1650 }, { "entropy": 6.306952619552613, "epoch": 0.12876872203851392, "grad_norm": 1.1484375, "learning_rate": 0.0004999707960389021, "loss": 5.9996, "mean_token_accuracy": 0.13151076734066008, "num_tokens": 2877688.0, "step": 1655 }, { "entropy": 6.365733051300049, "epoch": 0.12915775141023147, "grad_norm": 1.109375, "learning_rate": 0.0004999703477980288, "loss": 6.1389, "mean_token_accuracy": 0.13166750520467757, "num_tokens": 2887043.0, "step": 1660 }, { "entropy": 6.262747430801392, "epoch": 0.12954678078194903, "grad_norm": 1.1484375, "learning_rate": 0.0004999698961435885, "loss": 6.0721, "mean_token_accuracy": 0.13516117706894876, "num_tokens": 2895732.0, "step": 1665 }, { "entropy": 6.256302070617676, "epoch": 0.1299358101536666, "grad_norm": 1.171875, "learning_rate": 0.0004999694410755882, "loss": 6.039, "mean_token_accuracy": 0.13851652070879936, "num_tokens": 2904162.0, "step": 1670 }, { "entropy": 6.356344509124756, "epoch": 0.13032483952538418, "grad_norm": 1.0703125, "learning_rate": 0.0004999689825940347, "loss": 6.1758, "mean_token_accuracy": 0.13067347109317778, "num_tokens": 2912783.0, "step": 1675 }, { "entropy": 6.319488096237182, "epoch": 0.13071386889710174, "grad_norm": 1.0859375, "learning_rate": 0.0004999685206989349, "loss": 6.0558, "mean_token_accuracy": 0.13287809044122695, "num_tokens": 2921027.0, "step": 1680 }, { "entropy": 6.344622087478638, "epoch": 0.1311028982688193, "grad_norm": 1.0859375, "learning_rate": 0.0004999680553902959, "loss": 6.093, "mean_token_accuracy": 0.13244052454829217, "num_tokens": 2930398.0, "step": 1685 }, { "entropy": 6.316963481903076, "epoch": 0.13149192764053685, "grad_norm": 1.1640625, "learning_rate": 0.0004999675866681247, "loss": 6.1126, "mean_token_accuracy": 0.1291515350341797, "num_tokens": 2938703.0, "step": 1690 }, { "entropy": 6.272860383987426, "epoch": 0.1318809570122544, "grad_norm": 1.1484375, "learning_rate": 0.0004999671145324286, "loss": 6.0394, "mean_token_accuracy": 0.13433808013796805, "num_tokens": 2947007.0, "step": 1695 }, { "entropy": 6.319776296615601, "epoch": 0.132269986383972, "grad_norm": 1.2421875, "learning_rate": 0.0004999666389832144, "loss": 6.1923, "mean_token_accuracy": 0.13449379578232765, "num_tokens": 2955485.0, "step": 1700 }, { "entropy": 6.353970575332641, "epoch": 0.13265901575568956, "grad_norm": 1.125, "learning_rate": 0.0004999661600204897, "loss": 6.0481, "mean_token_accuracy": 0.1327715963125229, "num_tokens": 2964416.0, "step": 1705 }, { "entropy": 6.239326429367066, "epoch": 0.13304804512740712, "grad_norm": 1.140625, "learning_rate": 0.0004999656776442615, "loss": 6.0398, "mean_token_accuracy": 0.1316245622932911, "num_tokens": 2972737.0, "step": 1710 }, { "entropy": 6.29252290725708, "epoch": 0.13343707449912467, "grad_norm": 1.1015625, "learning_rate": 0.0004999651918545372, "loss": 6.084, "mean_token_accuracy": 0.13347245752811432, "num_tokens": 2981166.0, "step": 1715 }, { "entropy": 6.313875722885132, "epoch": 0.13382610387084226, "grad_norm": 1.078125, "learning_rate": 0.0004999647026513243, "loss": 6.124, "mean_token_accuracy": 0.13230146765708922, "num_tokens": 2989689.0, "step": 1720 }, { "entropy": 6.354332733154297, "epoch": 0.13421513324255982, "grad_norm": 1.1953125, "learning_rate": 0.00049996421003463, "loss": 6.0353, "mean_token_accuracy": 0.1331894539296627, "num_tokens": 2998793.0, "step": 1725 }, { "entropy": 6.235461759567261, "epoch": 0.13460416261427738, "grad_norm": 1.1796875, "learning_rate": 0.0004999637140044619, "loss": 6.1931, "mean_token_accuracy": 0.12982380986213685, "num_tokens": 3007320.0, "step": 1730 }, { "entropy": 6.328571414947509, "epoch": 0.13499319198599494, "grad_norm": 1.1328125, "learning_rate": 0.0004999632145608275, "loss": 6.0911, "mean_token_accuracy": 0.13207585886120796, "num_tokens": 3015024.0, "step": 1735 }, { "entropy": 6.351219606399536, "epoch": 0.1353822213577125, "grad_norm": 1.2109375, "learning_rate": 0.0004999627117037343, "loss": 6.1831, "mean_token_accuracy": 0.1294490687549114, "num_tokens": 3023058.0, "step": 1740 }, { "entropy": 6.363010501861572, "epoch": 0.13577125072943008, "grad_norm": 1.140625, "learning_rate": 0.00049996220543319, "loss": 6.0924, "mean_token_accuracy": 0.13458985537290574, "num_tokens": 3031308.0, "step": 1745 }, { "entropy": 6.337850189208984, "epoch": 0.13616028010114764, "grad_norm": 1.03125, "learning_rate": 0.0004999616957492025, "loss": 6.1513, "mean_token_accuracy": 0.1289216734468937, "num_tokens": 3039598.0, "step": 1750 }, { "entropy": 6.253518009185791, "epoch": 0.1365493094728652, "grad_norm": 1.140625, "learning_rate": 0.0004999611826517793, "loss": 5.9714, "mean_token_accuracy": 0.1398603707551956, "num_tokens": 3047598.0, "step": 1755 }, { "entropy": 6.273720216751099, "epoch": 0.13693833884458276, "grad_norm": 1.1171875, "learning_rate": 0.0004999606661409281, "loss": 6.1199, "mean_token_accuracy": 0.1361253760755062, "num_tokens": 3055702.0, "step": 1760 }, { "entropy": 6.330643892288208, "epoch": 0.13732736821630034, "grad_norm": 1.125, "learning_rate": 0.0004999601462166569, "loss": 5.9841, "mean_token_accuracy": 0.14291464164853096, "num_tokens": 3063908.0, "step": 1765 }, { "entropy": 6.251221227645874, "epoch": 0.1377163975880179, "grad_norm": 1.0859375, "learning_rate": 0.0004999596228789736, "loss": 6.0754, "mean_token_accuracy": 0.1333239495754242, "num_tokens": 3072077.0, "step": 1770 }, { "entropy": 6.303908920288086, "epoch": 0.13810542695973546, "grad_norm": 1.078125, "learning_rate": 0.0004999590961278859, "loss": 6.0791, "mean_token_accuracy": 0.13312057927250862, "num_tokens": 3080498.0, "step": 1775 }, { "entropy": 6.31710524559021, "epoch": 0.13849445633145302, "grad_norm": 1.140625, "learning_rate": 0.0004999585659634021, "loss": 6.0814, "mean_token_accuracy": 0.1339930735528469, "num_tokens": 3089055.0, "step": 1780 }, { "entropy": 6.248744344711303, "epoch": 0.13888348570317058, "grad_norm": 1.0703125, "learning_rate": 0.0004999580323855301, "loss": 6.0718, "mean_token_accuracy": 0.1378532275557518, "num_tokens": 3096944.0, "step": 1785 }, { "entropy": 6.228180599212647, "epoch": 0.13927251507488816, "grad_norm": 1.0703125, "learning_rate": 0.0004999574953942781, "loss": 5.965, "mean_token_accuracy": 0.13897001892328262, "num_tokens": 3105596.0, "step": 1790 }, { "entropy": 6.191677761077881, "epoch": 0.13966154444660572, "grad_norm": 1.125, "learning_rate": 0.0004999569549896541, "loss": 5.958, "mean_token_accuracy": 0.14424095302820206, "num_tokens": 3114349.0, "step": 1795 }, { "entropy": 6.258058547973633, "epoch": 0.14005057381832328, "grad_norm": 1.1875, "learning_rate": 0.0004999564111716665, "loss": 6.0799, "mean_token_accuracy": 0.12551943436264992, "num_tokens": 3122490.0, "step": 1800 }, { "entropy": 6.355373287200928, "epoch": 0.14043960319004084, "grad_norm": 1.1875, "learning_rate": 0.0004999558639403232, "loss": 6.1203, "mean_token_accuracy": 0.13192636370658875, "num_tokens": 3130988.0, "step": 1805 }, { "entropy": 6.246408748626709, "epoch": 0.1408286325617584, "grad_norm": 1.09375, "learning_rate": 0.0004999553132956328, "loss": 5.9784, "mean_token_accuracy": 0.13481251522898674, "num_tokens": 3139488.0, "step": 1810 }, { "entropy": 6.221766948699951, "epoch": 0.14121766193347599, "grad_norm": 1.0859375, "learning_rate": 0.0004999547592376035, "loss": 6.0288, "mean_token_accuracy": 0.13629044219851494, "num_tokens": 3147955.0, "step": 1815 }, { "entropy": 6.249310064315796, "epoch": 0.14160669130519354, "grad_norm": 1.0390625, "learning_rate": 0.0004999542017662438, "loss": 6.0759, "mean_token_accuracy": 0.1276159830391407, "num_tokens": 3157608.0, "step": 1820 }, { "entropy": 6.328677940368652, "epoch": 0.1419957206769111, "grad_norm": 1.2734375, "learning_rate": 0.0004999536408815623, "loss": 6.0303, "mean_token_accuracy": 0.130377709120512, "num_tokens": 3166124.0, "step": 1825 }, { "entropy": 6.159740209579468, "epoch": 0.14238475004862866, "grad_norm": 1.09375, "learning_rate": 0.0004999530765835672, "loss": 6.0358, "mean_token_accuracy": 0.13254115357995033, "num_tokens": 3175069.0, "step": 1830 }, { "entropy": 6.292894077301026, "epoch": 0.14277377942034625, "grad_norm": 1.0859375, "learning_rate": 0.0004999525088722673, "loss": 6.0664, "mean_token_accuracy": 0.13529409915208818, "num_tokens": 3184259.0, "step": 1835 }, { "entropy": 6.275870656967163, "epoch": 0.1431628087920638, "grad_norm": 1.0703125, "learning_rate": 0.0004999519377476711, "loss": 5.9672, "mean_token_accuracy": 0.1381848506629467, "num_tokens": 3193015.0, "step": 1840 }, { "entropy": 6.267138957977295, "epoch": 0.14355183816378136, "grad_norm": 1.1015625, "learning_rate": 0.0004999513632097872, "loss": 5.9147, "mean_token_accuracy": 0.14502743408083915, "num_tokens": 3201624.0, "step": 1845 }, { "entropy": 6.208207750320435, "epoch": 0.14394086753549892, "grad_norm": 1.15625, "learning_rate": 0.0004999507852586245, "loss": 6.0294, "mean_token_accuracy": 0.13966942057013512, "num_tokens": 3209474.0, "step": 1850 }, { "entropy": 6.183934068679809, "epoch": 0.14432989690721648, "grad_norm": 1.0859375, "learning_rate": 0.0004999502038941917, "loss": 6.0023, "mean_token_accuracy": 0.13654958382248877, "num_tokens": 3218550.0, "step": 1855 }, { "entropy": 6.118973255157471, "epoch": 0.14471892627893407, "grad_norm": 1.0390625, "learning_rate": 0.0004999496191164975, "loss": 5.9653, "mean_token_accuracy": 0.13626407235860824, "num_tokens": 3227108.0, "step": 1860 }, { "entropy": 6.250623989105224, "epoch": 0.14510795565065163, "grad_norm": 1.1015625, "learning_rate": 0.000499949030925551, "loss": 6.0032, "mean_token_accuracy": 0.13892803117632865, "num_tokens": 3235785.0, "step": 1865 }, { "entropy": 6.293147802352905, "epoch": 0.14549698502236919, "grad_norm": 1.1328125, "learning_rate": 0.0004999484393213609, "loss": 6.0377, "mean_token_accuracy": 0.1293921411037445, "num_tokens": 3244180.0, "step": 1870 }, { "entropy": 6.158266830444336, "epoch": 0.14588601439408674, "grad_norm": 1.0625, "learning_rate": 0.0004999478443039363, "loss": 5.9157, "mean_token_accuracy": 0.14264118522405625, "num_tokens": 3253098.0, "step": 1875 }, { "entropy": 6.26281852722168, "epoch": 0.14627504376580433, "grad_norm": 1.125, "learning_rate": 0.0004999472458732862, "loss": 5.962, "mean_token_accuracy": 0.14164620488882065, "num_tokens": 3261726.0, "step": 1880 }, { "entropy": 6.122699928283692, "epoch": 0.1466640731375219, "grad_norm": 1.1796875, "learning_rate": 0.0004999466440294198, "loss": 5.9218, "mean_token_accuracy": 0.13797034472227096, "num_tokens": 3270362.0, "step": 1885 }, { "entropy": 6.218784666061401, "epoch": 0.14705310250923945, "grad_norm": 1.1328125, "learning_rate": 0.000499946038772346, "loss": 5.9119, "mean_token_accuracy": 0.1409492813050747, "num_tokens": 3278332.0, "step": 1890 }, { "entropy": 6.106905126571656, "epoch": 0.147442131880957, "grad_norm": 1.09375, "learning_rate": 0.0004999454301020741, "loss": 5.8984, "mean_token_accuracy": 0.14537974447011948, "num_tokens": 3286800.0, "step": 1895 }, { "entropy": 6.261422252655029, "epoch": 0.14783116125267456, "grad_norm": 0.9921875, "learning_rate": 0.0004999448180186133, "loss": 6.1243, "mean_token_accuracy": 0.12735687866806983, "num_tokens": 3296186.0, "step": 1900 }, { "entropy": 6.170867204666138, "epoch": 0.14822019062439215, "grad_norm": 1.1640625, "learning_rate": 0.000499944202521973, "loss": 5.9874, "mean_token_accuracy": 0.14373966082930564, "num_tokens": 3303973.0, "step": 1905 }, { "entropy": 6.154075765609742, "epoch": 0.1486092199961097, "grad_norm": 1.1875, "learning_rate": 0.0004999435836121624, "loss": 5.9417, "mean_token_accuracy": 0.13721608817577363, "num_tokens": 3312550.0, "step": 1910 }, { "entropy": 6.231463432312012, "epoch": 0.14899824936782727, "grad_norm": 1.1328125, "learning_rate": 0.000499942961289191, "loss": 6.0136, "mean_token_accuracy": 0.13601985946297646, "num_tokens": 3321342.0, "step": 1915 }, { "entropy": 6.136085319519043, "epoch": 0.14938727873954483, "grad_norm": 1.125, "learning_rate": 0.0004999423355530683, "loss": 5.8833, "mean_token_accuracy": 0.14982874765992166, "num_tokens": 3329293.0, "step": 1920 }, { "entropy": 6.077541828155518, "epoch": 0.1497763081112624, "grad_norm": 1.1171875, "learning_rate": 0.0004999417064038035, "loss": 5.947, "mean_token_accuracy": 0.135797318816185, "num_tokens": 3338278.0, "step": 1925 }, { "entropy": 6.248018217086792, "epoch": 0.15016533748297997, "grad_norm": 1.109375, "learning_rate": 0.0004999410738414065, "loss": 6.0446, "mean_token_accuracy": 0.1355997994542122, "num_tokens": 3346757.0, "step": 1930 }, { "entropy": 6.1532470226287845, "epoch": 0.15055436685469753, "grad_norm": 1.0390625, "learning_rate": 0.0004999404378658866, "loss": 6.0451, "mean_token_accuracy": 0.1347198210656643, "num_tokens": 3355903.0, "step": 1935 }, { "entropy": 6.208436155319214, "epoch": 0.1509433962264151, "grad_norm": 1.125, "learning_rate": 0.0004999397984772536, "loss": 6.0141, "mean_token_accuracy": 0.12824626341462136, "num_tokens": 3365440.0, "step": 1940 }, { "entropy": 6.216444635391236, "epoch": 0.15133242559813265, "grad_norm": 1.1484375, "learning_rate": 0.0004999391556755172, "loss": 5.9763, "mean_token_accuracy": 0.1436944492161274, "num_tokens": 3373672.0, "step": 1945 }, { "entropy": 6.172102642059326, "epoch": 0.15172145496985023, "grad_norm": 1.1640625, "learning_rate": 0.0004999385094606872, "loss": 5.9552, "mean_token_accuracy": 0.13290092200040818, "num_tokens": 3382733.0, "step": 1950 }, { "entropy": 6.100259685516358, "epoch": 0.1521104843415678, "grad_norm": 1.0390625, "learning_rate": 0.0004999378598327733, "loss": 5.9076, "mean_token_accuracy": 0.1429830349981785, "num_tokens": 3390842.0, "step": 1955 }, { "entropy": 6.200795269012451, "epoch": 0.15249951371328535, "grad_norm": 1.0703125, "learning_rate": 0.0004999372067917854, "loss": 6.061, "mean_token_accuracy": 0.13028706163167952, "num_tokens": 3399761.0, "step": 1960 }, { "entropy": 6.219650220870972, "epoch": 0.1528885430850029, "grad_norm": 1.09375, "learning_rate": 0.0004999365503377335, "loss": 5.9837, "mean_token_accuracy": 0.13638316243886947, "num_tokens": 3408986.0, "step": 1965 }, { "entropy": 6.199184322357178, "epoch": 0.1532775724567205, "grad_norm": 1.15625, "learning_rate": 0.0004999358904706273, "loss": 5.9356, "mean_token_accuracy": 0.13719403147697448, "num_tokens": 3418051.0, "step": 1970 }, { "entropy": 6.225965929031372, "epoch": 0.15366660182843805, "grad_norm": 1.0625, "learning_rate": 0.0004999352271904771, "loss": 6.0436, "mean_token_accuracy": 0.13756765872240068, "num_tokens": 3427185.0, "step": 1975 }, { "entropy": 6.179631471633911, "epoch": 0.1540556312001556, "grad_norm": 1.0859375, "learning_rate": 0.0004999345604972928, "loss": 5.9495, "mean_token_accuracy": 0.13750605583190917, "num_tokens": 3435367.0, "step": 1980 }, { "entropy": 6.154869127273559, "epoch": 0.15444466057187317, "grad_norm": 1.0859375, "learning_rate": 0.0004999338903910846, "loss": 5.9934, "mean_token_accuracy": 0.1389468789100647, "num_tokens": 3443451.0, "step": 1985 }, { "entropy": 6.200529718399048, "epoch": 0.15483368994359073, "grad_norm": 1.0859375, "learning_rate": 0.0004999332168718626, "loss": 5.9893, "mean_token_accuracy": 0.1442691780626774, "num_tokens": 3451038.0, "step": 1990 }, { "entropy": 6.408123874664307, "epoch": 0.15522271931530832, "grad_norm": 1.1015625, "learning_rate": 0.0004999325399396371, "loss": 6.1241, "mean_token_accuracy": 0.1256192870438099, "num_tokens": 3459693.0, "step": 1995 }, { "entropy": 6.269746255874634, "epoch": 0.15561174868702587, "grad_norm": 1.25, "learning_rate": 0.0004999318595944183, "loss": 6.0106, "mean_token_accuracy": 0.13469778150320053, "num_tokens": 3468347.0, "step": 2000 }, { "entropy": 6.145987224578858, "epoch": 0.15600077805874343, "grad_norm": 1.1796875, "learning_rate": 0.0004999311758362166, "loss": 5.986, "mean_token_accuracy": 0.13514223098754882, "num_tokens": 3476030.0, "step": 2005 }, { "entropy": 6.12372317314148, "epoch": 0.156389807430461, "grad_norm": 1.0546875, "learning_rate": 0.0004999304886650422, "loss": 5.9609, "mean_token_accuracy": 0.13282474353909493, "num_tokens": 3484840.0, "step": 2010 }, { "entropy": 6.290483140945435, "epoch": 0.15677883680217858, "grad_norm": 1.046875, "learning_rate": 0.0004999297980809058, "loss": 6.0489, "mean_token_accuracy": 0.13376422077417374, "num_tokens": 3492662.0, "step": 2015 }, { "entropy": 6.2352056980133055, "epoch": 0.15716786617389614, "grad_norm": 1.125, "learning_rate": 0.0004999291040838176, "loss": 5.9688, "mean_token_accuracy": 0.13237249329686165, "num_tokens": 3501582.0, "step": 2020 }, { "entropy": 6.179763507843018, "epoch": 0.1575568955456137, "grad_norm": 1.0390625, "learning_rate": 0.0004999284066737884, "loss": 5.9639, "mean_token_accuracy": 0.14239997863769532, "num_tokens": 3510141.0, "step": 2025 }, { "entropy": 6.209929418563843, "epoch": 0.15794592491733125, "grad_norm": 1.078125, "learning_rate": 0.0004999277058508285, "loss": 6.0049, "mean_token_accuracy": 0.14213063940405846, "num_tokens": 3518530.0, "step": 2030 }, { "entropy": 6.1083790302276615, "epoch": 0.1583349542890488, "grad_norm": 1.15625, "learning_rate": 0.0004999270016149486, "loss": 5.9775, "mean_token_accuracy": 0.1358012966811657, "num_tokens": 3526815.0, "step": 2035 }, { "entropy": 6.179563379287719, "epoch": 0.1587239836607664, "grad_norm": 1.03125, "learning_rate": 0.0004999262939661596, "loss": 6.0282, "mean_token_accuracy": 0.13272086828947066, "num_tokens": 3535840.0, "step": 2040 }, { "entropy": 6.240152835845947, "epoch": 0.15911301303248396, "grad_norm": 1.09375, "learning_rate": 0.0004999255829044721, "loss": 6.0579, "mean_token_accuracy": 0.13129353299736976, "num_tokens": 3544876.0, "step": 2045 }, { "entropy": 6.140031433105468, "epoch": 0.15950204240420152, "grad_norm": 1.140625, "learning_rate": 0.0004999248684298968, "loss": 5.7949, "mean_token_accuracy": 0.14725889563560485, "num_tokens": 3553018.0, "step": 2050 }, { "entropy": 6.0304547309875485, "epoch": 0.15989107177591907, "grad_norm": 1.09375, "learning_rate": 0.0004999241505424447, "loss": 5.8511, "mean_token_accuracy": 0.1435144364833832, "num_tokens": 3560909.0, "step": 2055 }, { "entropy": 6.116934061050415, "epoch": 0.16028010114763663, "grad_norm": 1.078125, "learning_rate": 0.0004999234292421265, "loss": 5.9999, "mean_token_accuracy": 0.1397472143173218, "num_tokens": 3569235.0, "step": 2060 }, { "entropy": 6.105283117294311, "epoch": 0.16066913051935422, "grad_norm": 1.140625, "learning_rate": 0.0004999227045289535, "loss": 5.8792, "mean_token_accuracy": 0.14063235372304916, "num_tokens": 3577646.0, "step": 2065 }, { "entropy": 6.068844556808472, "epoch": 0.16105815989107178, "grad_norm": 1.046875, "learning_rate": 0.0004999219764029363, "loss": 5.9745, "mean_token_accuracy": 0.1359837457537651, "num_tokens": 3586499.0, "step": 2070 }, { "entropy": 6.221855163574219, "epoch": 0.16144718926278934, "grad_norm": 1.109375, "learning_rate": 0.0004999212448640861, "loss": 5.9812, "mean_token_accuracy": 0.14166299402713775, "num_tokens": 3595391.0, "step": 2075 }, { "entropy": 6.117988729476929, "epoch": 0.1618362186345069, "grad_norm": 1.0234375, "learning_rate": 0.0004999205099124141, "loss": 5.903, "mean_token_accuracy": 0.14056897163391113, "num_tokens": 3603774.0, "step": 2080 }, { "entropy": 6.214944982528687, "epoch": 0.16222524800622448, "grad_norm": 1.1484375, "learning_rate": 0.0004999197715479313, "loss": 5.9841, "mean_token_accuracy": 0.13269646242260932, "num_tokens": 3611980.0, "step": 2085 }, { "entropy": 6.1437524318695065, "epoch": 0.16261427737794204, "grad_norm": 1.046875, "learning_rate": 0.0004999190297706489, "loss": 5.902, "mean_token_accuracy": 0.1393118217587471, "num_tokens": 3620902.0, "step": 2090 }, { "entropy": 6.299076747894287, "epoch": 0.1630033067496596, "grad_norm": 1.0625, "learning_rate": 0.0004999182845805783, "loss": 6.1871, "mean_token_accuracy": 0.12861791327595712, "num_tokens": 3628924.0, "step": 2095 }, { "entropy": 6.2256190299987795, "epoch": 0.16339233612137716, "grad_norm": 1.0625, "learning_rate": 0.0004999175359777306, "loss": 6.0231, "mean_token_accuracy": 0.13702933117747307, "num_tokens": 3637538.0, "step": 2100 }, { "entropy": 6.148886060714721, "epoch": 0.16378136549309472, "grad_norm": 1.09375, "learning_rate": 0.0004999167839621174, "loss": 6.0424, "mean_token_accuracy": 0.130807376652956, "num_tokens": 3646309.0, "step": 2105 }, { "entropy": 6.18635630607605, "epoch": 0.1641703948648123, "grad_norm": 1.0390625, "learning_rate": 0.0004999160285337501, "loss": 5.8807, "mean_token_accuracy": 0.14085181877017022, "num_tokens": 3655204.0, "step": 2110 }, { "entropy": 6.139962005615234, "epoch": 0.16455942423652986, "grad_norm": 1.0625, "learning_rate": 0.0004999152696926399, "loss": 6.031, "mean_token_accuracy": 0.1334392912685871, "num_tokens": 3663939.0, "step": 2115 }, { "entropy": 6.174469661712647, "epoch": 0.16494845360824742, "grad_norm": 1.0546875, "learning_rate": 0.0004999145074387985, "loss": 5.9681, "mean_token_accuracy": 0.13877132534980774, "num_tokens": 3673167.0, "step": 2120 }, { "entropy": 6.170883893966675, "epoch": 0.16533748297996498, "grad_norm": 1.046875, "learning_rate": 0.0004999137417722374, "loss": 5.9079, "mean_token_accuracy": 0.1417030766606331, "num_tokens": 3682234.0, "step": 2125 }, { "entropy": 6.110505771636963, "epoch": 0.16572651235168256, "grad_norm": 1.0859375, "learning_rate": 0.0004999129726929684, "loss": 5.904, "mean_token_accuracy": 0.14176712557673454, "num_tokens": 3690835.0, "step": 2130 }, { "entropy": 6.160515642166137, "epoch": 0.16611554172340012, "grad_norm": 1.09375, "learning_rate": 0.0004999122002010029, "loss": 5.9654, "mean_token_accuracy": 0.13802013844251632, "num_tokens": 3699348.0, "step": 2135 }, { "entropy": 6.086480808258057, "epoch": 0.16650457109511768, "grad_norm": 1.1015625, "learning_rate": 0.0004999114242963527, "loss": 5.8711, "mean_token_accuracy": 0.1402495212852955, "num_tokens": 3708205.0, "step": 2140 }, { "entropy": 6.106543445587159, "epoch": 0.16689360046683524, "grad_norm": 1.15625, "learning_rate": 0.0004999106449790298, "loss": 5.9423, "mean_token_accuracy": 0.1402938574552536, "num_tokens": 3717016.0, "step": 2145 }, { "entropy": 6.246592807769775, "epoch": 0.1672826298385528, "grad_norm": 1.1171875, "learning_rate": 0.0004999098622490458, "loss": 5.9544, "mean_token_accuracy": 0.13701125010848045, "num_tokens": 3725509.0, "step": 2150 }, { "entropy": 6.154575967788697, "epoch": 0.16767165921027039, "grad_norm": 0.98828125, "learning_rate": 0.0004999090761064125, "loss": 6.0286, "mean_token_accuracy": 0.1339248612523079, "num_tokens": 3734674.0, "step": 2155 }, { "entropy": 6.060240173339844, "epoch": 0.16806068858198794, "grad_norm": 1.0859375, "learning_rate": 0.000499908286551142, "loss": 5.8456, "mean_token_accuracy": 0.1407431736588478, "num_tokens": 3742930.0, "step": 2160 }, { "entropy": 6.154189491271973, "epoch": 0.1684497179537055, "grad_norm": 1.0625, "learning_rate": 0.0004999074935832463, "loss": 5.9369, "mean_token_accuracy": 0.1409689135849476, "num_tokens": 3751314.0, "step": 2165 }, { "entropy": 6.216179037094117, "epoch": 0.16883874732542306, "grad_norm": 1.109375, "learning_rate": 0.0004999066972027373, "loss": 6.0535, "mean_token_accuracy": 0.13319066762924195, "num_tokens": 3760229.0, "step": 2170 }, { "entropy": 6.285803413391113, "epoch": 0.16922777669714065, "grad_norm": 1.046875, "learning_rate": 0.0004999058974096271, "loss": 6.0545, "mean_token_accuracy": 0.1335298717021942, "num_tokens": 3769037.0, "step": 2175 }, { "entropy": 6.052758312225341, "epoch": 0.1696168060688582, "grad_norm": 1.046875, "learning_rate": 0.000499905094203928, "loss": 5.9238, "mean_token_accuracy": 0.13934388458728791, "num_tokens": 3777686.0, "step": 2180 }, { "entropy": 6.218620347976684, "epoch": 0.17000583544057576, "grad_norm": 1.0625, "learning_rate": 0.000499904287585652, "loss": 6.0044, "mean_token_accuracy": 0.13825156837701796, "num_tokens": 3786412.0, "step": 2185 }, { "entropy": 6.192234373092651, "epoch": 0.17039486481229332, "grad_norm": 1.1328125, "learning_rate": 0.0004999034775548113, "loss": 6.0351, "mean_token_accuracy": 0.13853697702288628, "num_tokens": 3794981.0, "step": 2190 }, { "entropy": 6.155090808868408, "epoch": 0.17078389418401088, "grad_norm": 1.046875, "learning_rate": 0.0004999026641114185, "loss": 5.9303, "mean_token_accuracy": 0.14125299602746963, "num_tokens": 3803069.0, "step": 2195 }, { "entropy": 6.151627492904663, "epoch": 0.17117292355572847, "grad_norm": 1.078125, "learning_rate": 0.0004999018472554857, "loss": 6.0112, "mean_token_accuracy": 0.1394211769104004, "num_tokens": 3811986.0, "step": 2200 }, { "entropy": 6.219188404083252, "epoch": 0.17156195292744603, "grad_norm": 1.0390625, "learning_rate": 0.0004999010269870253, "loss": 5.9302, "mean_token_accuracy": 0.13892962485551835, "num_tokens": 3820626.0, "step": 2205 }, { "entropy": 6.105683422088623, "epoch": 0.17195098229916359, "grad_norm": 1.078125, "learning_rate": 0.0004999002033060498, "loss": 5.9254, "mean_token_accuracy": 0.1396380692720413, "num_tokens": 3828608.0, "step": 2210 }, { "entropy": 6.041509485244751, "epoch": 0.17234001167088114, "grad_norm": 1.0625, "learning_rate": 0.0004998993762125716, "loss": 5.8795, "mean_token_accuracy": 0.1437774755060673, "num_tokens": 3837059.0, "step": 2215 }, { "entropy": 6.148551082611084, "epoch": 0.17272904104259873, "grad_norm": 1.0703125, "learning_rate": 0.0004998985457066034, "loss": 5.8953, "mean_token_accuracy": 0.13735355138778688, "num_tokens": 3845137.0, "step": 2220 }, { "entropy": 6.128031158447266, "epoch": 0.1731180704143163, "grad_norm": 1.140625, "learning_rate": 0.0004998977117881576, "loss": 5.8861, "mean_token_accuracy": 0.14574987590312957, "num_tokens": 3854012.0, "step": 2225 }, { "entropy": 6.015646696090698, "epoch": 0.17350709978603385, "grad_norm": 1.109375, "learning_rate": 0.0004998968744572472, "loss": 5.8295, "mean_token_accuracy": 0.1409018814563751, "num_tokens": 3862308.0, "step": 2230 }, { "entropy": 6.067210721969604, "epoch": 0.1738961291577514, "grad_norm": 1.0, "learning_rate": 0.0004998960337138845, "loss": 5.7717, "mean_token_accuracy": 0.13879043981432915, "num_tokens": 3870975.0, "step": 2235 }, { "entropy": 6.087196779251099, "epoch": 0.17428515852946896, "grad_norm": 1.1640625, "learning_rate": 0.0004998951895580826, "loss": 5.9544, "mean_token_accuracy": 0.14272485896945, "num_tokens": 3879621.0, "step": 2240 }, { "entropy": 6.093369865417481, "epoch": 0.17467418790118655, "grad_norm": 1.0859375, "learning_rate": 0.0004998943419898542, "loss": 5.9166, "mean_token_accuracy": 0.13817212730646133, "num_tokens": 3889214.0, "step": 2245 }, { "entropy": 6.146738815307617, "epoch": 0.1750632172729041, "grad_norm": 1.0390625, "learning_rate": 0.0004998934910092119, "loss": 5.9504, "mean_token_accuracy": 0.14284390732645988, "num_tokens": 3898250.0, "step": 2250 }, { "entropy": 6.129539108276367, "epoch": 0.17545224664462167, "grad_norm": 1.03125, "learning_rate": 0.0004998926366161689, "loss": 5.9798, "mean_token_accuracy": 0.13206198140978814, "num_tokens": 3906971.0, "step": 2255 }, { "entropy": 6.1653541088104244, "epoch": 0.17584127601633923, "grad_norm": 0.9765625, "learning_rate": 0.0004998917788107383, "loss": 6.0139, "mean_token_accuracy": 0.13972242698073387, "num_tokens": 3916663.0, "step": 2260 }, { "entropy": 6.103351974487305, "epoch": 0.17623030538805678, "grad_norm": 1.0078125, "learning_rate": 0.0004998909175929326, "loss": 5.8942, "mean_token_accuracy": 0.14154435321688652, "num_tokens": 3926848.0, "step": 2265 }, { "entropy": 6.034053564071655, "epoch": 0.17661933475977437, "grad_norm": 1.140625, "learning_rate": 0.0004998900529627653, "loss": 5.8613, "mean_token_accuracy": 0.1404354229569435, "num_tokens": 3935729.0, "step": 2270 }, { "entropy": 6.141492509841919, "epoch": 0.17700836413149193, "grad_norm": 1.109375, "learning_rate": 0.0004998891849202495, "loss": 5.8766, "mean_token_accuracy": 0.1424740418791771, "num_tokens": 3943408.0, "step": 2275 }, { "entropy": 6.052723979949951, "epoch": 0.1773973935032095, "grad_norm": 1.109375, "learning_rate": 0.000499888313465398, "loss": 5.8509, "mean_token_accuracy": 0.14049414843320845, "num_tokens": 3952473.0, "step": 2280 }, { "entropy": 6.178114128112793, "epoch": 0.17778642287492705, "grad_norm": 1.125, "learning_rate": 0.0004998874385982247, "loss": 6.0018, "mean_token_accuracy": 0.13325022533535957, "num_tokens": 3960878.0, "step": 2285 }, { "entropy": 6.208947801589966, "epoch": 0.17817545224664463, "grad_norm": 1.09375, "learning_rate": 0.0004998865603187421, "loss": 5.945, "mean_token_accuracy": 0.13925340324640273, "num_tokens": 3969282.0, "step": 2290 }, { "entropy": 6.132673740386963, "epoch": 0.1785644816183622, "grad_norm": 1.0546875, "learning_rate": 0.000499885678626964, "loss": 5.9267, "mean_token_accuracy": 0.14256497994065284, "num_tokens": 3978516.0, "step": 2295 }, { "entropy": 6.066269874572754, "epoch": 0.17895351099007975, "grad_norm": 1.0859375, "learning_rate": 0.0004998847935229038, "loss": 5.7855, "mean_token_accuracy": 0.15060577318072318, "num_tokens": 3986580.0, "step": 2300 }, { "entropy": 5.910192060470581, "epoch": 0.1793425403617973, "grad_norm": 1.109375, "learning_rate": 0.0004998839050065746, "loss": 5.8052, "mean_token_accuracy": 0.14743324518203735, "num_tokens": 3995144.0, "step": 2305 }, { "entropy": 6.101610565185547, "epoch": 0.17973156973351487, "grad_norm": 1.0390625, "learning_rate": 0.0004998830130779902, "loss": 5.8075, "mean_token_accuracy": 0.13889141082763673, "num_tokens": 4003887.0, "step": 2310 }, { "entropy": 6.0803686618804935, "epoch": 0.18012059910523245, "grad_norm": 1.046875, "learning_rate": 0.000499882117737164, "loss": 5.9209, "mean_token_accuracy": 0.14422064125537873, "num_tokens": 4012607.0, "step": 2315 }, { "entropy": 6.053954172134399, "epoch": 0.18050962847695, "grad_norm": 1.1328125, "learning_rate": 0.0004998812189841096, "loss": 6.0034, "mean_token_accuracy": 0.13622427582740784, "num_tokens": 4021950.0, "step": 2320 }, { "entropy": 6.1665068626403805, "epoch": 0.18089865784866757, "grad_norm": 1.0546875, "learning_rate": 0.0004998803168188407, "loss": 5.9668, "mean_token_accuracy": 0.1415689304471016, "num_tokens": 4031076.0, "step": 2325 }, { "entropy": 5.990097284317017, "epoch": 0.18128768722038513, "grad_norm": 0.99609375, "learning_rate": 0.0004998794112413708, "loss": 5.8054, "mean_token_accuracy": 0.14801988750696182, "num_tokens": 4040414.0, "step": 2330 }, { "entropy": 6.18867506980896, "epoch": 0.18167671659210272, "grad_norm": 1.0859375, "learning_rate": 0.0004998785022517137, "loss": 5.8924, "mean_token_accuracy": 0.14523087441921234, "num_tokens": 4048931.0, "step": 2335 }, { "entropy": 5.915593385696411, "epoch": 0.18206574596382027, "grad_norm": 1.0859375, "learning_rate": 0.0004998775898498835, "loss": 5.7899, "mean_token_accuracy": 0.1424514263868332, "num_tokens": 4057688.0, "step": 2340 }, { "entropy": 6.047796154022217, "epoch": 0.18245477533553783, "grad_norm": 1.125, "learning_rate": 0.0004998766740358936, "loss": 5.9117, "mean_token_accuracy": 0.14413589462637902, "num_tokens": 4066365.0, "step": 2345 }, { "entropy": 6.0719398021697994, "epoch": 0.1828438047072554, "grad_norm": 0.9921875, "learning_rate": 0.0004998757548097582, "loss": 5.7968, "mean_token_accuracy": 0.14763821363449098, "num_tokens": 4075136.0, "step": 2350 }, { "entropy": 6.112574434280395, "epoch": 0.18323283407897295, "grad_norm": 1.0703125, "learning_rate": 0.0004998748321714911, "loss": 5.9058, "mean_token_accuracy": 0.1457724839448929, "num_tokens": 4083337.0, "step": 2355 }, { "entropy": 6.00722303390503, "epoch": 0.18362186345069054, "grad_norm": 1.0546875, "learning_rate": 0.0004998739061211065, "loss": 5.8555, "mean_token_accuracy": 0.14413827881217003, "num_tokens": 4091201.0, "step": 2360 }, { "entropy": 6.140283298492432, "epoch": 0.1840108928224081, "grad_norm": 1.015625, "learning_rate": 0.0004998729766586181, "loss": 5.9072, "mean_token_accuracy": 0.14183114990592002, "num_tokens": 4099480.0, "step": 2365 }, { "entropy": 5.984076595306396, "epoch": 0.18439992219412565, "grad_norm": 1.046875, "learning_rate": 0.0004998720437840403, "loss": 5.8158, "mean_token_accuracy": 0.1437339261174202, "num_tokens": 4108151.0, "step": 2370 }, { "entropy": 5.961683034896851, "epoch": 0.1847889515658432, "grad_norm": 1.0078125, "learning_rate": 0.0004998711074973871, "loss": 5.8251, "mean_token_accuracy": 0.1457428365945816, "num_tokens": 4117380.0, "step": 2375 }, { "entropy": 6.036372423171997, "epoch": 0.1851779809375608, "grad_norm": 1.0, "learning_rate": 0.0004998701677986728, "loss": 5.8689, "mean_token_accuracy": 0.14735556095838548, "num_tokens": 4126757.0, "step": 2380 }, { "entropy": 6.031168508529663, "epoch": 0.18556701030927836, "grad_norm": 1.03125, "learning_rate": 0.0004998692246879116, "loss": 5.7891, "mean_token_accuracy": 0.146223184466362, "num_tokens": 4135326.0, "step": 2385 }, { "entropy": 6.053634834289551, "epoch": 0.18595603968099592, "grad_norm": 0.97265625, "learning_rate": 0.0004998682781651178, "loss": 5.7988, "mean_token_accuracy": 0.15181397199630736, "num_tokens": 4143624.0, "step": 2390 }, { "entropy": 5.992155838012695, "epoch": 0.18634506905271347, "grad_norm": 1.0546875, "learning_rate": 0.0004998673282303059, "loss": 5.7659, "mean_token_accuracy": 0.14670938700437547, "num_tokens": 4152193.0, "step": 2395 }, { "entropy": 6.03981647491455, "epoch": 0.18673409842443103, "grad_norm": 1.1640625, "learning_rate": 0.0004998663748834901, "loss": 5.8835, "mean_token_accuracy": 0.141094571352005, "num_tokens": 4160614.0, "step": 2400 }, { "entropy": 6.138073205947876, "epoch": 0.18712312779614862, "grad_norm": 1.0625, "learning_rate": 0.0004998654181246851, "loss": 5.9151, "mean_token_accuracy": 0.1435561805963516, "num_tokens": 4168715.0, "step": 2405 }, { "entropy": 6.1046959400177006, "epoch": 0.18751215716786618, "grad_norm": 1.078125, "learning_rate": 0.0004998644579539052, "loss": 5.956, "mean_token_accuracy": 0.1427804246544838, "num_tokens": 4176676.0, "step": 2410 }, { "entropy": 6.041570472717285, "epoch": 0.18790118653958374, "grad_norm": 1.015625, "learning_rate": 0.000499863494371165, "loss": 5.9196, "mean_token_accuracy": 0.13990830332040788, "num_tokens": 4185613.0, "step": 2415 }, { "entropy": 6.056922721862793, "epoch": 0.1882902159113013, "grad_norm": 1.1015625, "learning_rate": 0.0004998625273764793, "loss": 5.9221, "mean_token_accuracy": 0.1435866177082062, "num_tokens": 4193985.0, "step": 2420 }, { "entropy": 6.057398271560669, "epoch": 0.18867924528301888, "grad_norm": 1.0546875, "learning_rate": 0.0004998615569698626, "loss": 5.8347, "mean_token_accuracy": 0.1472941130399704, "num_tokens": 4202713.0, "step": 2425 }, { "entropy": 6.15912766456604, "epoch": 0.18906827465473644, "grad_norm": 1.0546875, "learning_rate": 0.0004998605831513296, "loss": 5.9598, "mean_token_accuracy": 0.13513548597693442, "num_tokens": 4210858.0, "step": 2430 }, { "entropy": 6.027268743515014, "epoch": 0.189457304026454, "grad_norm": 1.0625, "learning_rate": 0.0004998596059208953, "loss": 5.876, "mean_token_accuracy": 0.14263733327388764, "num_tokens": 4219570.0, "step": 2435 }, { "entropy": 6.034002113342285, "epoch": 0.18984633339817156, "grad_norm": 1.1484375, "learning_rate": 0.0004998586252785743, "loss": 5.7873, "mean_token_accuracy": 0.14603268951177598, "num_tokens": 4228026.0, "step": 2440 }, { "entropy": 6.043663167953492, "epoch": 0.19023536276988912, "grad_norm": 1.1328125, "learning_rate": 0.0004998576412243816, "loss": 5.8084, "mean_token_accuracy": 0.14466246217489243, "num_tokens": 4235993.0, "step": 2445 }, { "entropy": 6.009197854995728, "epoch": 0.1906243921416067, "grad_norm": 1.0625, "learning_rate": 0.0004998566537583321, "loss": 5.8151, "mean_token_accuracy": 0.147155824303627, "num_tokens": 4244225.0, "step": 2450 }, { "entropy": 5.965597009658813, "epoch": 0.19101342151332426, "grad_norm": 1.0546875, "learning_rate": 0.0004998556628804408, "loss": 5.7885, "mean_token_accuracy": 0.1485578991472721, "num_tokens": 4252989.0, "step": 2455 }, { "entropy": 6.069110679626465, "epoch": 0.19140245088504182, "grad_norm": 1.125, "learning_rate": 0.0004998546685907225, "loss": 5.8298, "mean_token_accuracy": 0.14657569378614427, "num_tokens": 4261297.0, "step": 2460 }, { "entropy": 6.0928350448608395, "epoch": 0.19179148025675938, "grad_norm": 1.0, "learning_rate": 0.0004998536708891927, "loss": 5.9644, "mean_token_accuracy": 0.13758677765727043, "num_tokens": 4270299.0, "step": 2465 }, { "entropy": 6.128661823272705, "epoch": 0.19218050962847694, "grad_norm": 0.953125, "learning_rate": 0.0004998526697758663, "loss": 5.9728, "mean_token_accuracy": 0.13565355464816092, "num_tokens": 4279662.0, "step": 2470 }, { "entropy": 6.051914119720459, "epoch": 0.19256953900019452, "grad_norm": 1.0625, "learning_rate": 0.0004998516652507585, "loss": 5.7902, "mean_token_accuracy": 0.1471126437187195, "num_tokens": 4287876.0, "step": 2475 }, { "entropy": 6.014107513427734, "epoch": 0.19295856837191208, "grad_norm": 1.09375, "learning_rate": 0.0004998506573138846, "loss": 5.9218, "mean_token_accuracy": 0.14491380155086517, "num_tokens": 4296415.0, "step": 2480 }, { "entropy": 5.982778406143188, "epoch": 0.19334759774362964, "grad_norm": 1.0234375, "learning_rate": 0.0004998496459652598, "loss": 5.7484, "mean_token_accuracy": 0.14843220636248589, "num_tokens": 4304434.0, "step": 2485 }, { "entropy": 6.051380062103272, "epoch": 0.1937366271153472, "grad_norm": 1.09375, "learning_rate": 0.0004998486312048995, "loss": 5.9265, "mean_token_accuracy": 0.1381976492702961, "num_tokens": 4313266.0, "step": 2490 }, { "entropy": 6.0365697860717775, "epoch": 0.19412565648706478, "grad_norm": 0.98046875, "learning_rate": 0.0004998476130328193, "loss": 5.8013, "mean_token_accuracy": 0.14801377803087234, "num_tokens": 4322121.0, "step": 2495 }, { "entropy": 5.980331611633301, "epoch": 0.19451468585878234, "grad_norm": 1.1328125, "learning_rate": 0.0004998465914490343, "loss": 5.8202, "mean_token_accuracy": 0.14618535935878754, "num_tokens": 4330596.0, "step": 2500 }, { "entropy": 6.062447881698608, "epoch": 0.1949037152304999, "grad_norm": 1.1171875, "learning_rate": 0.00049984556645356, "loss": 5.9022, "mean_token_accuracy": 0.1466861292719841, "num_tokens": 4337779.0, "step": 2505 }, { "entropy": 6.0627391815185545, "epoch": 0.19529274460221746, "grad_norm": 1.078125, "learning_rate": 0.0004998445380464124, "loss": 5.7454, "mean_token_accuracy": 0.14693358018994332, "num_tokens": 4346623.0, "step": 2510 }, { "entropy": 5.929016637802124, "epoch": 0.19568177397393502, "grad_norm": 1.1015625, "learning_rate": 0.0004998435062276066, "loss": 5.8526, "mean_token_accuracy": 0.14088083803653717, "num_tokens": 4355435.0, "step": 2515 }, { "entropy": 6.1320250034332275, "epoch": 0.1960708033456526, "grad_norm": 1.0625, "learning_rate": 0.0004998424709971586, "loss": 5.902, "mean_token_accuracy": 0.14303931146860122, "num_tokens": 4363636.0, "step": 2520 }, { "entropy": 5.970055866241455, "epoch": 0.19645983271737016, "grad_norm": 1.03125, "learning_rate": 0.0004998414323550839, "loss": 5.7269, "mean_token_accuracy": 0.15075851678848268, "num_tokens": 4372337.0, "step": 2525 }, { "entropy": 5.979619741439819, "epoch": 0.19684886208908772, "grad_norm": 1.15625, "learning_rate": 0.0004998403903013984, "loss": 5.7561, "mean_token_accuracy": 0.15269921571016312, "num_tokens": 4380528.0, "step": 2530 }, { "entropy": 5.998526477813721, "epoch": 0.19723789146080528, "grad_norm": 1.0859375, "learning_rate": 0.0004998393448361179, "loss": 5.8501, "mean_token_accuracy": 0.13916658014059066, "num_tokens": 4389464.0, "step": 2535 }, { "entropy": 6.082704496383667, "epoch": 0.19762692083252287, "grad_norm": 1.1328125, "learning_rate": 0.000499838295959258, "loss": 5.9085, "mean_token_accuracy": 0.14364177733659744, "num_tokens": 4397879.0, "step": 2540 }, { "entropy": 6.062457323074341, "epoch": 0.19801595020424043, "grad_norm": 1.1171875, "learning_rate": 0.000499837243670835, "loss": 5.932, "mean_token_accuracy": 0.14348311796784402, "num_tokens": 4406145.0, "step": 2545 }, { "entropy": 6.0163922786712645, "epoch": 0.19840497957595798, "grad_norm": 0.9765625, "learning_rate": 0.0004998361879708646, "loss": 5.8382, "mean_token_accuracy": 0.14055323377251625, "num_tokens": 4415480.0, "step": 2550 }, { "entropy": 6.038650321960449, "epoch": 0.19879400894767554, "grad_norm": 1.046875, "learning_rate": 0.000499835128859363, "loss": 5.8457, "mean_token_accuracy": 0.14373011589050294, "num_tokens": 4423355.0, "step": 2555 }, { "entropy": 5.971053647994995, "epoch": 0.1991830383193931, "grad_norm": 1.015625, "learning_rate": 0.0004998340663363461, "loss": 5.7288, "mean_token_accuracy": 0.15200028717517852, "num_tokens": 4432059.0, "step": 2560 }, { "entropy": 5.9389901638031, "epoch": 0.1995720676911107, "grad_norm": 1.0078125, "learning_rate": 0.0004998330004018301, "loss": 5.8266, "mean_token_accuracy": 0.14117742702364922, "num_tokens": 4441146.0, "step": 2565 }, { "entropy": 5.973790550231934, "epoch": 0.19996109706282825, "grad_norm": 1.140625, "learning_rate": 0.0004998319310558312, "loss": 5.6701, "mean_token_accuracy": 0.15412732362747192, "num_tokens": 4448553.0, "step": 2570 }, { "entropy": 5.836313152313233, "epoch": 0.2003501264345458, "grad_norm": 1.140625, "learning_rate": 0.0004998308582983657, "loss": 5.7375, "mean_token_accuracy": 0.15181366503238677, "num_tokens": 4456930.0, "step": 2575 }, { "entropy": 6.073364543914795, "epoch": 0.20073915580626336, "grad_norm": 1.0859375, "learning_rate": 0.0004998297821294497, "loss": 5.9386, "mean_token_accuracy": 0.14404268860816954, "num_tokens": 4464932.0, "step": 2580 }, { "entropy": 5.992941284179688, "epoch": 0.20112818517798095, "grad_norm": 1.0390625, "learning_rate": 0.0004998287025490995, "loss": 5.6672, "mean_token_accuracy": 0.15902086794376374, "num_tokens": 4473695.0, "step": 2585 }, { "entropy": 5.925492858886718, "epoch": 0.2015172145496985, "grad_norm": 1.0078125, "learning_rate": 0.0004998276195573317, "loss": 5.8921, "mean_token_accuracy": 0.14221425950527192, "num_tokens": 4483375.0, "step": 2590 }, { "entropy": 6.11337890625, "epoch": 0.20190624392141607, "grad_norm": 1.109375, "learning_rate": 0.0004998265331541627, "loss": 5.9193, "mean_token_accuracy": 0.13467642813920974, "num_tokens": 4491695.0, "step": 2595 }, { "entropy": 6.003162908554077, "epoch": 0.20229527329313363, "grad_norm": 1.1796875, "learning_rate": 0.0004998254433396088, "loss": 5.8721, "mean_token_accuracy": 0.1440841868519783, "num_tokens": 4500361.0, "step": 2600 }, { "entropy": 5.987391805648803, "epoch": 0.20268430266485118, "grad_norm": 1.0234375, "learning_rate": 0.0004998243501136867, "loss": 5.8079, "mean_token_accuracy": 0.14264530092477798, "num_tokens": 4509368.0, "step": 2605 }, { "entropy": 6.039334154129028, "epoch": 0.20307333203656877, "grad_norm": 1.0703125, "learning_rate": 0.0004998232534764129, "loss": 5.7889, "mean_token_accuracy": 0.14281965047121048, "num_tokens": 4518146.0, "step": 2610 }, { "entropy": 6.01565580368042, "epoch": 0.20346236140828633, "grad_norm": 1.1015625, "learning_rate": 0.0004998221534278041, "loss": 5.8405, "mean_token_accuracy": 0.14281932562589644, "num_tokens": 4526128.0, "step": 2615 }, { "entropy": 6.036164903640747, "epoch": 0.2038513907800039, "grad_norm": 0.95703125, "learning_rate": 0.0004998210499678769, "loss": 5.8847, "mean_token_accuracy": 0.14803217351436615, "num_tokens": 4534724.0, "step": 2620 }, { "entropy": 5.968258047103882, "epoch": 0.20424042015172145, "grad_norm": 1.078125, "learning_rate": 0.0004998199430966481, "loss": 5.7427, "mean_token_accuracy": 0.14365783631801604, "num_tokens": 4543725.0, "step": 2625 }, { "entropy": 6.012339067459107, "epoch": 0.20462944952343903, "grad_norm": 1.0546875, "learning_rate": 0.0004998188328141346, "loss": 5.8252, "mean_token_accuracy": 0.14723241925239564, "num_tokens": 4551758.0, "step": 2630 }, { "entropy": 5.894060182571411, "epoch": 0.2050184788951566, "grad_norm": 1.0625, "learning_rate": 0.0004998177191203531, "loss": 5.7079, "mean_token_accuracy": 0.15085572972893715, "num_tokens": 4559990.0, "step": 2635 }, { "entropy": 5.93325366973877, "epoch": 0.20540750826687415, "grad_norm": 1.0390625, "learning_rate": 0.0004998166020153204, "loss": 5.7558, "mean_token_accuracy": 0.1438131585717201, "num_tokens": 4568651.0, "step": 2640 }, { "entropy": 5.900708532333374, "epoch": 0.2057965376385917, "grad_norm": 1.0078125, "learning_rate": 0.0004998154814990538, "loss": 5.6758, "mean_token_accuracy": 0.15049925595521926, "num_tokens": 4577981.0, "step": 2645 }, { "entropy": 5.955266237258911, "epoch": 0.20618556701030927, "grad_norm": 1.1328125, "learning_rate": 0.00049981435757157, "loss": 5.8312, "mean_token_accuracy": 0.147544726729393, "num_tokens": 4586480.0, "step": 2650 }, { "entropy": 5.980217790603637, "epoch": 0.20657459638202685, "grad_norm": 1.0703125, "learning_rate": 0.0004998132302328862, "loss": 5.7291, "mean_token_accuracy": 0.1525867000222206, "num_tokens": 4595554.0, "step": 2655 }, { "entropy": 5.923847293853759, "epoch": 0.2069636257537444, "grad_norm": 1.0, "learning_rate": 0.0004998120994830195, "loss": 5.7566, "mean_token_accuracy": 0.15113697126507758, "num_tokens": 4604091.0, "step": 2660 }, { "entropy": 6.023667430877685, "epoch": 0.20735265512546197, "grad_norm": 1.046875, "learning_rate": 0.000499810965321987, "loss": 5.8615, "mean_token_accuracy": 0.14118051454424857, "num_tokens": 4612603.0, "step": 2665 }, { "entropy": 6.032278680801392, "epoch": 0.20774168449717953, "grad_norm": 1.078125, "learning_rate": 0.0004998098277498059, "loss": 5.7592, "mean_token_accuracy": 0.1470929801464081, "num_tokens": 4621041.0, "step": 2670 }, { "entropy": 5.90060658454895, "epoch": 0.2081307138688971, "grad_norm": 1.03125, "learning_rate": 0.0004998086867664934, "loss": 5.7983, "mean_token_accuracy": 0.15032607913017274, "num_tokens": 4629849.0, "step": 2675 }, { "entropy": 6.054356479644776, "epoch": 0.20851974324061467, "grad_norm": 1.0078125, "learning_rate": 0.000499807542372067, "loss": 5.8687, "mean_token_accuracy": 0.14306920617818833, "num_tokens": 4639426.0, "step": 2680 }, { "entropy": 5.9633255958557125, "epoch": 0.20890877261233223, "grad_norm": 1.03125, "learning_rate": 0.0004998063945665439, "loss": 5.7888, "mean_token_accuracy": 0.14868860244750975, "num_tokens": 4647257.0, "step": 2685 }, { "entropy": 5.958910369873047, "epoch": 0.2092978019840498, "grad_norm": 1.046875, "learning_rate": 0.0004998052433499416, "loss": 5.7688, "mean_token_accuracy": 0.14971182197332383, "num_tokens": 4655773.0, "step": 2690 }, { "entropy": 5.995905542373658, "epoch": 0.20968683135576735, "grad_norm": 1.0625, "learning_rate": 0.0004998040887222776, "loss": 5.8141, "mean_token_accuracy": 0.14208999648690224, "num_tokens": 4664292.0, "step": 2695 }, { "entropy": 6.006470203399658, "epoch": 0.21007586072748494, "grad_norm": 1.046875, "learning_rate": 0.0004998029306835693, "loss": 5.8357, "mean_token_accuracy": 0.1457445926964283, "num_tokens": 4672774.0, "step": 2700 }, { "entropy": 6.1288737773895265, "epoch": 0.2104648900992025, "grad_norm": 1.0, "learning_rate": 0.0004998017692338344, "loss": 5.954, "mean_token_accuracy": 0.14017487764358522, "num_tokens": 4681855.0, "step": 2705 }, { "entropy": 5.958335494995117, "epoch": 0.21085391947092005, "grad_norm": 1.125, "learning_rate": 0.0004998006043730905, "loss": 5.7565, "mean_token_accuracy": 0.14842477068305016, "num_tokens": 4689771.0, "step": 2710 }, { "entropy": 6.003065395355224, "epoch": 0.2112429488426376, "grad_norm": 1.015625, "learning_rate": 0.0004997994361013551, "loss": 5.8986, "mean_token_accuracy": 0.1353430561721325, "num_tokens": 4698808.0, "step": 2715 }, { "entropy": 5.980752849578858, "epoch": 0.21163197821435517, "grad_norm": 1.0234375, "learning_rate": 0.0004997982644186461, "loss": 5.7782, "mean_token_accuracy": 0.14798913151025772, "num_tokens": 4707627.0, "step": 2720 }, { "entropy": 5.949896383285522, "epoch": 0.21202100758607276, "grad_norm": 1.09375, "learning_rate": 0.0004997970893249813, "loss": 5.7576, "mean_token_accuracy": 0.14555923044681549, "num_tokens": 4716091.0, "step": 2725 }, { "entropy": 5.944676637649536, "epoch": 0.21241003695779032, "grad_norm": 1.0703125, "learning_rate": 0.0004997959108203785, "loss": 5.788, "mean_token_accuracy": 0.1488296665251255, "num_tokens": 4724042.0, "step": 2730 }, { "entropy": 5.887519454956054, "epoch": 0.21279906632950787, "grad_norm": 1.0859375, "learning_rate": 0.0004997947289048554, "loss": 5.7058, "mean_token_accuracy": 0.15533653944730758, "num_tokens": 4731745.0, "step": 2735 }, { "entropy": 5.945332145690918, "epoch": 0.21318809570122543, "grad_norm": 1.046875, "learning_rate": 0.0004997935435784302, "loss": 5.872, "mean_token_accuracy": 0.146851022541523, "num_tokens": 4740386.0, "step": 2740 }, { "entropy": 6.041448068618775, "epoch": 0.21357712507294302, "grad_norm": 1.0078125, "learning_rate": 0.0004997923548411208, "loss": 5.8834, "mean_token_accuracy": 0.1391231372952461, "num_tokens": 4749809.0, "step": 2745 }, { "entropy": 6.063974905014038, "epoch": 0.21396615444466058, "grad_norm": 0.91796875, "learning_rate": 0.000499791162692945, "loss": 5.9768, "mean_token_accuracy": 0.1409013733267784, "num_tokens": 4759507.0, "step": 2750 }, { "entropy": 5.960179090499878, "epoch": 0.21435518381637814, "grad_norm": 0.98828125, "learning_rate": 0.0004997899671339214, "loss": 5.7479, "mean_token_accuracy": 0.1449030451476574, "num_tokens": 4768793.0, "step": 2755 }, { "entropy": 6.029723405838013, "epoch": 0.2147442131880957, "grad_norm": 1.046875, "learning_rate": 0.0004997887681640675, "loss": 5.9008, "mean_token_accuracy": 0.14465020522475242, "num_tokens": 4777344.0, "step": 2760 }, { "entropy": 6.030321025848389, "epoch": 0.21513324255981325, "grad_norm": 1.140625, "learning_rate": 0.0004997875657834021, "loss": 5.8127, "mean_token_accuracy": 0.1441117987036705, "num_tokens": 4785934.0, "step": 2765 }, { "entropy": 5.947022724151611, "epoch": 0.21552227193153084, "grad_norm": 1.125, "learning_rate": 0.0004997863599919432, "loss": 5.7731, "mean_token_accuracy": 0.1485394760966301, "num_tokens": 4794889.0, "step": 2770 }, { "entropy": 5.944930124282837, "epoch": 0.2159113013032484, "grad_norm": 1.0703125, "learning_rate": 0.0004997851507897089, "loss": 5.8881, "mean_token_accuracy": 0.14024131819605828, "num_tokens": 4803597.0, "step": 2775 }, { "entropy": 5.933191776275635, "epoch": 0.21630033067496596, "grad_norm": 1.03125, "learning_rate": 0.0004997839381767178, "loss": 5.6613, "mean_token_accuracy": 0.15584157705307006, "num_tokens": 4812706.0, "step": 2780 }, { "entropy": 5.90777177810669, "epoch": 0.21668936004668352, "grad_norm": 0.984375, "learning_rate": 0.0004997827221529882, "loss": 5.7295, "mean_token_accuracy": 0.1480869472026825, "num_tokens": 4821790.0, "step": 2785 }, { "entropy": 5.968650197982788, "epoch": 0.2170783894184011, "grad_norm": 1.0078125, "learning_rate": 0.0004997815027185386, "loss": 5.7899, "mean_token_accuracy": 0.1485279232263565, "num_tokens": 4830123.0, "step": 2790 }, { "entropy": 5.94366946220398, "epoch": 0.21746741879011866, "grad_norm": 1.0859375, "learning_rate": 0.0004997802798733874, "loss": 5.7194, "mean_token_accuracy": 0.1537564590573311, "num_tokens": 4838066.0, "step": 2795 }, { "entropy": 5.9353564262390135, "epoch": 0.21785644816183622, "grad_norm": 1.078125, "learning_rate": 0.0004997790536175534, "loss": 5.7944, "mean_token_accuracy": 0.14718551486730574, "num_tokens": 4846877.0, "step": 2800 }, { "entropy": 5.991869354248047, "epoch": 0.21824547753355378, "grad_norm": 0.8828125, "learning_rate": 0.0004997778239510548, "loss": 5.8426, "mean_token_accuracy": 0.14051205813884735, "num_tokens": 4856960.0, "step": 2805 }, { "entropy": 6.004691219329834, "epoch": 0.21863450690527134, "grad_norm": 1.0546875, "learning_rate": 0.0004997765908739106, "loss": 5.8542, "mean_token_accuracy": 0.14763535112142562, "num_tokens": 4865440.0, "step": 2810 }, { "entropy": 5.893306064605713, "epoch": 0.21902353627698892, "grad_norm": 1.046875, "learning_rate": 0.0004997753543861395, "loss": 5.7417, "mean_token_accuracy": 0.1489579737186432, "num_tokens": 4874187.0, "step": 2815 }, { "entropy": 6.102828645706177, "epoch": 0.21941256564870648, "grad_norm": 0.93359375, "learning_rate": 0.00049977411448776, "loss": 5.8831, "mean_token_accuracy": 0.14227399230003357, "num_tokens": 4883151.0, "step": 2820 }, { "entropy": 5.983131647109985, "epoch": 0.21980159502042404, "grad_norm": 0.98828125, "learning_rate": 0.0004997728711787912, "loss": 5.7977, "mean_token_accuracy": 0.14272094666957855, "num_tokens": 4890968.0, "step": 2825 }, { "entropy": 5.879379606246948, "epoch": 0.2201906243921416, "grad_norm": 0.99609375, "learning_rate": 0.0004997716244592518, "loss": 5.6825, "mean_token_accuracy": 0.15600915551185607, "num_tokens": 4899389.0, "step": 2830 }, { "entropy": 5.905595302581787, "epoch": 0.22057965376385918, "grad_norm": 1.0390625, "learning_rate": 0.0004997703743291607, "loss": 5.7509, "mean_token_accuracy": 0.15158967077732086, "num_tokens": 4907622.0, "step": 2835 }, { "entropy": 5.943753623962403, "epoch": 0.22096868313557674, "grad_norm": 0.9921875, "learning_rate": 0.000499769120788537, "loss": 5.7491, "mean_token_accuracy": 0.1479824811220169, "num_tokens": 4916151.0, "step": 2840 }, { "entropy": 5.892854356765747, "epoch": 0.2213577125072943, "grad_norm": 1.0234375, "learning_rate": 0.0004997678638373995, "loss": 5.6692, "mean_token_accuracy": 0.15641618967056276, "num_tokens": 4923938.0, "step": 2845 }, { "entropy": 5.87450475692749, "epoch": 0.22174674187901186, "grad_norm": 1.046875, "learning_rate": 0.0004997666034757676, "loss": 5.7613, "mean_token_accuracy": 0.16034080535173417, "num_tokens": 4932027.0, "step": 2850 }, { "entropy": 5.947768974304199, "epoch": 0.22213577125072942, "grad_norm": 1.15625, "learning_rate": 0.0004997653397036603, "loss": 5.7766, "mean_token_accuracy": 0.1560262620449066, "num_tokens": 4940229.0, "step": 2855 }, { "entropy": 5.907529211044311, "epoch": 0.222524800622447, "grad_norm": 1.0390625, "learning_rate": 0.0004997640725210965, "loss": 5.8405, "mean_token_accuracy": 0.14572847858071328, "num_tokens": 4948662.0, "step": 2860 }, { "entropy": 5.958647584915161, "epoch": 0.22291382999416456, "grad_norm": 1.0234375, "learning_rate": 0.0004997628019280958, "loss": 5.7854, "mean_token_accuracy": 0.1521115556359291, "num_tokens": 4956847.0, "step": 2865 }, { "entropy": 5.970917129516602, "epoch": 0.22330285936588212, "grad_norm": 1.0625, "learning_rate": 0.0004997615279246773, "loss": 5.7205, "mean_token_accuracy": 0.14754560068249703, "num_tokens": 4965139.0, "step": 2870 }, { "entropy": 6.0411519527435305, "epoch": 0.22369188873759968, "grad_norm": 1.0546875, "learning_rate": 0.0004997602505108603, "loss": 5.8952, "mean_token_accuracy": 0.14166620448231698, "num_tokens": 4973671.0, "step": 2875 }, { "entropy": 5.933946704864502, "epoch": 0.22408091810931724, "grad_norm": 1.109375, "learning_rate": 0.0004997589696866644, "loss": 5.7652, "mean_token_accuracy": 0.14397089332342147, "num_tokens": 4981970.0, "step": 2880 }, { "entropy": 5.935157251358032, "epoch": 0.22446994748103483, "grad_norm": 1.0625, "learning_rate": 0.0004997576854521088, "loss": 5.7921, "mean_token_accuracy": 0.14724297374486922, "num_tokens": 4990591.0, "step": 2885 }, { "entropy": 5.9578015327453615, "epoch": 0.22485897685275238, "grad_norm": 1.125, "learning_rate": 0.000499756397807213, "loss": 5.7954, "mean_token_accuracy": 0.14315731078386307, "num_tokens": 4999623.0, "step": 2890 }, { "entropy": 6.011578512191773, "epoch": 0.22524800622446994, "grad_norm": 1.125, "learning_rate": 0.0004997551067519966, "loss": 5.8545, "mean_token_accuracy": 0.1422098271548748, "num_tokens": 5008387.0, "step": 2895 }, { "entropy": 5.949732828140259, "epoch": 0.2256370355961875, "grad_norm": 0.984375, "learning_rate": 0.0004997538122864792, "loss": 5.7775, "mean_token_accuracy": 0.1461174599826336, "num_tokens": 5016788.0, "step": 2900 }, { "entropy": 6.023969125747681, "epoch": 0.2260260649679051, "grad_norm": 1.0625, "learning_rate": 0.0004997525144106804, "loss": 5.8104, "mean_token_accuracy": 0.14314667582511903, "num_tokens": 5025508.0, "step": 2905 }, { "entropy": 5.927273511886597, "epoch": 0.22641509433962265, "grad_norm": 1.1328125, "learning_rate": 0.00049975121312462, "loss": 5.7821, "mean_token_accuracy": 0.14801414608955382, "num_tokens": 5035081.0, "step": 2910 }, { "entropy": 5.879549169540406, "epoch": 0.2268041237113402, "grad_norm": 1.03125, "learning_rate": 0.0004997499084283177, "loss": 5.7173, "mean_token_accuracy": 0.15523723959922792, "num_tokens": 5043655.0, "step": 2915 }, { "entropy": 5.91579909324646, "epoch": 0.22719315308305776, "grad_norm": 1.0546875, "learning_rate": 0.0004997486003217932, "loss": 5.74, "mean_token_accuracy": 0.15187966972589492, "num_tokens": 5052080.0, "step": 2920 }, { "entropy": 5.888910627365112, "epoch": 0.22758218245477532, "grad_norm": 1.015625, "learning_rate": 0.0004997472888050664, "loss": 5.7076, "mean_token_accuracy": 0.15852134227752684, "num_tokens": 5061325.0, "step": 2925 }, { "entropy": 5.961522054672241, "epoch": 0.2279712118264929, "grad_norm": 1.1796875, "learning_rate": 0.0004997459738781573, "loss": 5.8208, "mean_token_accuracy": 0.15095880776643752, "num_tokens": 5069461.0, "step": 2930 }, { "entropy": 5.988435316085815, "epoch": 0.22836024119821047, "grad_norm": 1.0546875, "learning_rate": 0.0004997446555410857, "loss": 5.7807, "mean_token_accuracy": 0.14658573567867278, "num_tokens": 5077747.0, "step": 2935 }, { "entropy": 5.988274765014649, "epoch": 0.22874927056992803, "grad_norm": 1.1328125, "learning_rate": 0.0004997433337938716, "loss": 5.8365, "mean_token_accuracy": 0.15124830231070518, "num_tokens": 5086300.0, "step": 2940 }, { "entropy": 5.844106388092041, "epoch": 0.22913829994164558, "grad_norm": 1.0, "learning_rate": 0.0004997420086365351, "loss": 5.6151, "mean_token_accuracy": 0.15467342734336853, "num_tokens": 5094762.0, "step": 2945 }, { "entropy": 5.89040789604187, "epoch": 0.22952732931336317, "grad_norm": 1.171875, "learning_rate": 0.0004997406800690966, "loss": 5.7742, "mean_token_accuracy": 0.14963481277227403, "num_tokens": 5103364.0, "step": 2950 }, { "entropy": 6.023597526550293, "epoch": 0.22991635868508073, "grad_norm": 1.015625, "learning_rate": 0.0004997393480915758, "loss": 5.8799, "mean_token_accuracy": 0.14407353550195695, "num_tokens": 5111730.0, "step": 2955 }, { "entropy": 5.970983409881592, "epoch": 0.2303053880567983, "grad_norm": 1.0078125, "learning_rate": 0.0004997380127039931, "loss": 5.6786, "mean_token_accuracy": 0.1486763596534729, "num_tokens": 5119878.0, "step": 2960 }, { "entropy": 5.9219104766845705, "epoch": 0.23069441742851585, "grad_norm": 1.0859375, "learning_rate": 0.0004997366739063688, "loss": 5.7901, "mean_token_accuracy": 0.1522405095398426, "num_tokens": 5129146.0, "step": 2965 }, { "entropy": 5.892798137664795, "epoch": 0.2310834468002334, "grad_norm": 1.046875, "learning_rate": 0.0004997353316987231, "loss": 5.8065, "mean_token_accuracy": 0.14348602443933486, "num_tokens": 5137989.0, "step": 2970 }, { "entropy": 6.039399528503418, "epoch": 0.231472476171951, "grad_norm": 0.98046875, "learning_rate": 0.0004997339860810765, "loss": 5.8268, "mean_token_accuracy": 0.14684822633862496, "num_tokens": 5146722.0, "step": 2975 }, { "entropy": 6.007096481323242, "epoch": 0.23186150554366855, "grad_norm": 1.1015625, "learning_rate": 0.0004997326370534495, "loss": 5.8128, "mean_token_accuracy": 0.14832943975925444, "num_tokens": 5154902.0, "step": 2980 }, { "entropy": 5.963329792022705, "epoch": 0.2322505349153861, "grad_norm": 1.1328125, "learning_rate": 0.0004997312846158622, "loss": 5.827, "mean_token_accuracy": 0.14517123103141785, "num_tokens": 5163594.0, "step": 2985 }, { "entropy": 5.939759683609009, "epoch": 0.23263956428710367, "grad_norm": 1.015625, "learning_rate": 0.0004997299287683355, "loss": 5.7065, "mean_token_accuracy": 0.1531409054994583, "num_tokens": 5172139.0, "step": 2990 }, { "entropy": 5.937909650802612, "epoch": 0.23302859365882125, "grad_norm": 1.1015625, "learning_rate": 0.0004997285695108898, "loss": 5.8315, "mean_token_accuracy": 0.15084856152534484, "num_tokens": 5180077.0, "step": 2995 }, { "entropy": 5.849994754791259, "epoch": 0.2334176230305388, "grad_norm": 1.0703125, "learning_rate": 0.0004997272068435458, "loss": 5.6851, "mean_token_accuracy": 0.14938049018383026, "num_tokens": 5188500.0, "step": 3000 }, { "epoch": 0.2334176230305388, "eval_entropy": 5.659352120260876, "eval_loss": 5.808426856994629, "eval_mean_token_accuracy": 0.15537977798754946, "eval_num_tokens": 5188500.0, "eval_runtime": 21.8125, "eval_samples_per_second": 1905.236, "eval_steps_per_second": 238.166, "step": 3000 }, { "entropy": 5.93622145652771, "epoch": 0.23380665240225637, "grad_norm": 1.15625, "learning_rate": 0.000499725840766324, "loss": 5.7657, "mean_token_accuracy": 0.14401972368359567, "num_tokens": 5197214.0, "step": 3005 }, { "entropy": 6.025457191467285, "epoch": 0.23419568177397393, "grad_norm": 1.015625, "learning_rate": 0.0004997244712792453, "loss": 5.8495, "mean_token_accuracy": 0.14099710583686828, "num_tokens": 5206348.0, "step": 3010 }, { "entropy": 5.808966779708863, "epoch": 0.2345847111456915, "grad_norm": 1.03125, "learning_rate": 0.0004997230983823305, "loss": 5.6655, "mean_token_accuracy": 0.14906769394874572, "num_tokens": 5215425.0, "step": 3015 }, { "entropy": 6.039634037017822, "epoch": 0.23497374051740907, "grad_norm": 0.984375, "learning_rate": 0.0004997217220756003, "loss": 5.891, "mean_token_accuracy": 0.13933431655168532, "num_tokens": 5224899.0, "step": 3020 }, { "entropy": 5.964243030548095, "epoch": 0.23536276988912663, "grad_norm": 1.0703125, "learning_rate": 0.0004997203423590757, "loss": 5.8292, "mean_token_accuracy": 0.14440490528941155, "num_tokens": 5233829.0, "step": 3025 }, { "entropy": 5.998610305786133, "epoch": 0.2357517992608442, "grad_norm": 1.0390625, "learning_rate": 0.0004997189592327775, "loss": 5.9395, "mean_token_accuracy": 0.1378275215625763, "num_tokens": 5243144.0, "step": 3030 }, { "entropy": 5.9781769752502445, "epoch": 0.23614082863256175, "grad_norm": 1.046875, "learning_rate": 0.0004997175726967268, "loss": 5.7548, "mean_token_accuracy": 0.1460421398282051, "num_tokens": 5251097.0, "step": 3035 }, { "entropy": 5.962513780593872, "epoch": 0.23652985800427934, "grad_norm": 1.0390625, "learning_rate": 0.0004997161827509447, "loss": 5.8404, "mean_token_accuracy": 0.15355018228292466, "num_tokens": 5260050.0, "step": 3040 }, { "entropy": 5.938783931732178, "epoch": 0.2369188873759969, "grad_norm": 1.0390625, "learning_rate": 0.0004997147893954521, "loss": 5.645, "mean_token_accuracy": 0.15660878717899324, "num_tokens": 5268363.0, "step": 3045 }, { "entropy": 5.887162923812866, "epoch": 0.23730791674771445, "grad_norm": 1.078125, "learning_rate": 0.0004997133926302702, "loss": 5.8357, "mean_token_accuracy": 0.1478561833500862, "num_tokens": 5276821.0, "step": 3050 }, { "entropy": 5.9527363777160645, "epoch": 0.237696946119432, "grad_norm": 1.125, "learning_rate": 0.0004997119924554204, "loss": 5.7226, "mean_token_accuracy": 0.14752280563116074, "num_tokens": 5285419.0, "step": 3055 }, { "entropy": 5.866193866729736, "epoch": 0.23808597549114957, "grad_norm": 1.0078125, "learning_rate": 0.0004997105888709236, "loss": 5.6553, "mean_token_accuracy": 0.1510017544031143, "num_tokens": 5294004.0, "step": 3060 }, { "entropy": 5.8557802677154545, "epoch": 0.23847500486286716, "grad_norm": 1.03125, "learning_rate": 0.0004997091818768015, "loss": 5.8301, "mean_token_accuracy": 0.14936043918132783, "num_tokens": 5302699.0, "step": 3065 }, { "entropy": 5.966806888580322, "epoch": 0.23886403423458472, "grad_norm": 1.0546875, "learning_rate": 0.000499707771473075, "loss": 5.7575, "mean_token_accuracy": 0.15072435289621353, "num_tokens": 5311115.0, "step": 3070 }, { "entropy": 5.901711511611938, "epoch": 0.23925306360630227, "grad_norm": 1.0625, "learning_rate": 0.0004997063576597659, "loss": 5.7648, "mean_token_accuracy": 0.15388039052486419, "num_tokens": 5319795.0, "step": 3075 }, { "entropy": 5.978531169891357, "epoch": 0.23964209297801983, "grad_norm": 0.9765625, "learning_rate": 0.0004997049404368954, "loss": 5.8031, "mean_token_accuracy": 0.15001416355371475, "num_tokens": 5328273.0, "step": 3080 }, { "entropy": 5.9556351661682125, "epoch": 0.2400311223497374, "grad_norm": 1.125, "learning_rate": 0.000499703519804485, "loss": 5.7934, "mean_token_accuracy": 0.1462474137544632, "num_tokens": 5336394.0, "step": 3085 }, { "entropy": 5.87838306427002, "epoch": 0.24042015172145498, "grad_norm": 1.125, "learning_rate": 0.0004997020957625564, "loss": 5.7355, "mean_token_accuracy": 0.15258182883262633, "num_tokens": 5344480.0, "step": 3090 }, { "entropy": 5.896993970870971, "epoch": 0.24080918109317254, "grad_norm": 0.94140625, "learning_rate": 0.0004997006683111312, "loss": 5.797, "mean_token_accuracy": 0.141014863550663, "num_tokens": 5353445.0, "step": 3095 }, { "entropy": 5.892958879470825, "epoch": 0.2411982104648901, "grad_norm": 1.015625, "learning_rate": 0.000499699237450231, "loss": 5.6596, "mean_token_accuracy": 0.16075871959328653, "num_tokens": 5362356.0, "step": 3100 }, { "entropy": 5.916681575775146, "epoch": 0.24158723983660765, "grad_norm": 1.0703125, "learning_rate": 0.0004996978031798774, "loss": 5.7964, "mean_token_accuracy": 0.14848088175058366, "num_tokens": 5371467.0, "step": 3105 }, { "entropy": 5.812461185455322, "epoch": 0.24197626920832524, "grad_norm": 1.0859375, "learning_rate": 0.0004996963655000924, "loss": 5.6558, "mean_token_accuracy": 0.15510347113013268, "num_tokens": 5380256.0, "step": 3110 }, { "entropy": 5.971241188049317, "epoch": 0.2423652985800428, "grad_norm": 1.046875, "learning_rate": 0.0004996949244108977, "loss": 5.7135, "mean_token_accuracy": 0.15098942071199417, "num_tokens": 5388884.0, "step": 3115 }, { "entropy": 5.897061204910278, "epoch": 0.24275432795176036, "grad_norm": 1.0703125, "learning_rate": 0.000499693479912315, "loss": 5.6853, "mean_token_accuracy": 0.15718052834272384, "num_tokens": 5397980.0, "step": 3120 }, { "entropy": 5.859615325927734, "epoch": 0.24314335732347792, "grad_norm": 1.0703125, "learning_rate": 0.0004996920320043666, "loss": 5.7922, "mean_token_accuracy": 0.14827542155981063, "num_tokens": 5406879.0, "step": 3125 }, { "entropy": 5.936743116378784, "epoch": 0.24353238669519547, "grad_norm": 0.984375, "learning_rate": 0.0004996905806870742, "loss": 5.7959, "mean_token_accuracy": 0.14135870039463044, "num_tokens": 5416161.0, "step": 3130 }, { "entropy": 5.887562036514282, "epoch": 0.24392141606691306, "grad_norm": 1.0, "learning_rate": 0.0004996891259604598, "loss": 5.6741, "mean_token_accuracy": 0.15898128598928452, "num_tokens": 5424323.0, "step": 3135 }, { "entropy": 5.883194923400879, "epoch": 0.24431044543863062, "grad_norm": 1.0078125, "learning_rate": 0.0004996876678245455, "loss": 5.8032, "mean_token_accuracy": 0.14068420529365538, "num_tokens": 5433750.0, "step": 3140 }, { "entropy": 5.986171770095825, "epoch": 0.24469947481034818, "grad_norm": 1.046875, "learning_rate": 0.0004996862062793536, "loss": 5.821, "mean_token_accuracy": 0.14756249487400055, "num_tokens": 5442113.0, "step": 3145 }, { "entropy": 5.898403453826904, "epoch": 0.24508850418206574, "grad_norm": 1.0546875, "learning_rate": 0.0004996847413249061, "loss": 5.6867, "mean_token_accuracy": 0.1511594235897064, "num_tokens": 5450403.0, "step": 3150 }, { "entropy": 5.896078729629517, "epoch": 0.24547753355378332, "grad_norm": 1.0390625, "learning_rate": 0.0004996832729612252, "loss": 5.7644, "mean_token_accuracy": 0.14809978604316712, "num_tokens": 5459018.0, "step": 3155 }, { "entropy": 5.9197851657867435, "epoch": 0.24586656292550088, "grad_norm": 1.03125, "learning_rate": 0.0004996818011883333, "loss": 5.7983, "mean_token_accuracy": 0.14402209520339965, "num_tokens": 5468314.0, "step": 3160 }, { "entropy": 5.9504999160766605, "epoch": 0.24625559229721844, "grad_norm": 1.0390625, "learning_rate": 0.0004996803260062527, "loss": 5.7793, "mean_token_accuracy": 0.1457969695329666, "num_tokens": 5476950.0, "step": 3165 }, { "entropy": 5.940018224716186, "epoch": 0.246644621668936, "grad_norm": 0.9921875, "learning_rate": 0.0004996788474150057, "loss": 5.7464, "mean_token_accuracy": 0.1534033253788948, "num_tokens": 5485201.0, "step": 3170 }, { "entropy": 6.006494426727295, "epoch": 0.24703365104065356, "grad_norm": 1.109375, "learning_rate": 0.0004996773654146149, "loss": 5.8628, "mean_token_accuracy": 0.14921573102474212, "num_tokens": 5493096.0, "step": 3175 }, { "entropy": 5.871295690536499, "epoch": 0.24742268041237114, "grad_norm": 1.0234375, "learning_rate": 0.0004996758800051026, "loss": 5.6369, "mean_token_accuracy": 0.15377923771739005, "num_tokens": 5502413.0, "step": 3180 }, { "entropy": 5.906892967224121, "epoch": 0.2478117097840887, "grad_norm": 1.140625, "learning_rate": 0.0004996743911864916, "loss": 5.781, "mean_token_accuracy": 0.15396690219640732, "num_tokens": 5511670.0, "step": 3185 }, { "entropy": 5.927646780014038, "epoch": 0.24820073915580626, "grad_norm": 1.0625, "learning_rate": 0.0004996728989588041, "loss": 5.6606, "mean_token_accuracy": 0.15735298097133638, "num_tokens": 5519344.0, "step": 3190 }, { "entropy": 5.830929899215699, "epoch": 0.24858976852752382, "grad_norm": 1.0, "learning_rate": 0.0004996714033220632, "loss": 5.6786, "mean_token_accuracy": 0.14968922585248948, "num_tokens": 5528413.0, "step": 3195 }, { "entropy": 5.8730100154876705, "epoch": 0.2489787978992414, "grad_norm": 1.0390625, "learning_rate": 0.0004996699042762911, "loss": 5.7738, "mean_token_accuracy": 0.14690972194075586, "num_tokens": 5537201.0, "step": 3200 }, { "entropy": 5.923853874206543, "epoch": 0.24936782727095896, "grad_norm": 1.0390625, "learning_rate": 0.0004996684018215111, "loss": 5.7804, "mean_token_accuracy": 0.14298839941620828, "num_tokens": 5545975.0, "step": 3205 }, { "entropy": 5.8805577754974365, "epoch": 0.24975685664267652, "grad_norm": 0.94921875, "learning_rate": 0.0004996668959577453, "loss": 5.8066, "mean_token_accuracy": 0.1442289024591446, "num_tokens": 5555237.0, "step": 3210 }, { "entropy": 5.989409494400024, "epoch": 0.2501458860143941, "grad_norm": 1.0, "learning_rate": 0.0004996653866850173, "loss": 5.6911, "mean_token_accuracy": 0.15224729627370834, "num_tokens": 5564048.0, "step": 3215 }, { "entropy": 5.877629709243775, "epoch": 0.25053491538611167, "grad_norm": 1.109375, "learning_rate": 0.0004996638740033495, "loss": 5.7427, "mean_token_accuracy": 0.154438579082489, "num_tokens": 5573615.0, "step": 3220 }, { "entropy": 5.876510715484619, "epoch": 0.2509239447578292, "grad_norm": 1.0390625, "learning_rate": 0.0004996623579127651, "loss": 5.6247, "mean_token_accuracy": 0.15758016407489778, "num_tokens": 5582211.0, "step": 3225 }, { "entropy": 5.906939220428467, "epoch": 0.2513129741295468, "grad_norm": 0.9453125, "learning_rate": 0.0004996608384132868, "loss": 5.8569, "mean_token_accuracy": 0.14443435817956923, "num_tokens": 5592542.0, "step": 3230 }, { "entropy": 5.988466691970825, "epoch": 0.25170200350126437, "grad_norm": 1.0078125, "learning_rate": 0.000499659315504938, "loss": 5.8257, "mean_token_accuracy": 0.15278731137514115, "num_tokens": 5601279.0, "step": 3235 }, { "entropy": 5.927760648727417, "epoch": 0.2520910328729819, "grad_norm": 1.171875, "learning_rate": 0.0004996577891877417, "loss": 5.7578, "mean_token_accuracy": 0.1475792944431305, "num_tokens": 5610266.0, "step": 3240 }, { "entropy": 5.8933803081512455, "epoch": 0.2524800622446995, "grad_norm": 0.98828125, "learning_rate": 0.0004996562594617209, "loss": 5.8036, "mean_token_accuracy": 0.14620354622602463, "num_tokens": 5618799.0, "step": 3245 }, { "entropy": 6.05321683883667, "epoch": 0.252869091616417, "grad_norm": 0.984375, "learning_rate": 0.0004996547263268991, "loss": 5.7447, "mean_token_accuracy": 0.15469980388879775, "num_tokens": 5627861.0, "step": 3250 }, { "entropy": 5.931217432022095, "epoch": 0.2532581209881346, "grad_norm": 1.21875, "learning_rate": 0.0004996531897832993, "loss": 5.7375, "mean_token_accuracy": 0.14861182644963264, "num_tokens": 5636229.0, "step": 3255 }, { "entropy": 5.938875341415406, "epoch": 0.2536471503598522, "grad_norm": 0.90234375, "learning_rate": 0.000499651649830945, "loss": 5.9558, "mean_token_accuracy": 0.14124528542160988, "num_tokens": 5645828.0, "step": 3260 }, { "entropy": 5.8967883586883545, "epoch": 0.2540361797315697, "grad_norm": 1.0, "learning_rate": 0.0004996501064698593, "loss": 5.5671, "mean_token_accuracy": 0.15032654106616974, "num_tokens": 5654750.0, "step": 3265 }, { "entropy": 5.8799279689788815, "epoch": 0.2544252091032873, "grad_norm": 1.015625, "learning_rate": 0.000499648559700066, "loss": 5.7448, "mean_token_accuracy": 0.14809657484292985, "num_tokens": 5664017.0, "step": 3270 }, { "entropy": 5.874881553649902, "epoch": 0.25481423847500484, "grad_norm": 1.0625, "learning_rate": 0.0004996470095215884, "loss": 5.7406, "mean_token_accuracy": 0.14475095346570016, "num_tokens": 5672220.0, "step": 3275 }, { "entropy": 5.830359411239624, "epoch": 0.2552032678467224, "grad_norm": 0.97265625, "learning_rate": 0.0004996454559344498, "loss": 5.6864, "mean_token_accuracy": 0.1500364437699318, "num_tokens": 5680921.0, "step": 3280 }, { "entropy": 5.955457019805908, "epoch": 0.25559229721844, "grad_norm": 1.09375, "learning_rate": 0.0004996438989386741, "loss": 5.6874, "mean_token_accuracy": 0.1482978232204914, "num_tokens": 5689226.0, "step": 3285 }, { "entropy": 5.929180049896241, "epoch": 0.25598132659015754, "grad_norm": 1.0, "learning_rate": 0.0004996423385342847, "loss": 5.8345, "mean_token_accuracy": 0.143748040497303, "num_tokens": 5698413.0, "step": 3290 }, { "entropy": 5.851541137695312, "epoch": 0.25637035596187513, "grad_norm": 1.0078125, "learning_rate": 0.0004996407747213055, "loss": 5.718, "mean_token_accuracy": 0.14506666213274003, "num_tokens": 5707724.0, "step": 3295 }, { "entropy": 5.939691019058228, "epoch": 0.25675938533359266, "grad_norm": 1.078125, "learning_rate": 0.00049963920749976, "loss": 5.7271, "mean_token_accuracy": 0.14950018227100373, "num_tokens": 5716566.0, "step": 3300 }, { "entropy": 5.84193868637085, "epoch": 0.25714841470531025, "grad_norm": 1.078125, "learning_rate": 0.0004996376368696721, "loss": 5.6666, "mean_token_accuracy": 0.1517062321305275, "num_tokens": 5725463.0, "step": 3305 }, { "entropy": 5.895420980453491, "epoch": 0.25753744407702783, "grad_norm": 1.0546875, "learning_rate": 0.0004996360628310656, "loss": 5.6642, "mean_token_accuracy": 0.1558502957224846, "num_tokens": 5734143.0, "step": 3310 }, { "entropy": 5.89042387008667, "epoch": 0.25792647344874536, "grad_norm": 1.015625, "learning_rate": 0.0004996344853839644, "loss": 5.7478, "mean_token_accuracy": 0.15216899216175078, "num_tokens": 5742981.0, "step": 3315 }, { "entropy": 5.7684619426727295, "epoch": 0.25831550282046295, "grad_norm": 1.046875, "learning_rate": 0.0004996329045283924, "loss": 5.625, "mean_token_accuracy": 0.1628153458237648, "num_tokens": 5751294.0, "step": 3320 }, { "entropy": 5.869237899780273, "epoch": 0.25870453219218054, "grad_norm": 1.0390625, "learning_rate": 0.0004996313202643737, "loss": 5.7406, "mean_token_accuracy": 0.1526793658733368, "num_tokens": 5760958.0, "step": 3325 }, { "entropy": 5.935721826553345, "epoch": 0.25909356156389807, "grad_norm": 1.046875, "learning_rate": 0.0004996297325919321, "loss": 5.7595, "mean_token_accuracy": 0.1518444985151291, "num_tokens": 5769077.0, "step": 3330 }, { "entropy": 5.96410346031189, "epoch": 0.25948259093561565, "grad_norm": 1.1015625, "learning_rate": 0.0004996281415110919, "loss": 5.7934, "mean_token_accuracy": 0.14791057929396628, "num_tokens": 5778093.0, "step": 3335 }, { "entropy": 5.904092693328858, "epoch": 0.2598716203073332, "grad_norm": 1.046875, "learning_rate": 0.0004996265470218773, "loss": 5.7365, "mean_token_accuracy": 0.15056012198328972, "num_tokens": 5786996.0, "step": 3340 }, { "entropy": 5.893521738052368, "epoch": 0.26026064967905077, "grad_norm": 0.98046875, "learning_rate": 0.0004996249491243122, "loss": 5.7462, "mean_token_accuracy": 0.1535051003098488, "num_tokens": 5794831.0, "step": 3345 }, { "entropy": 5.789423561096191, "epoch": 0.26064967905076836, "grad_norm": 1.046875, "learning_rate": 0.0004996233478184211, "loss": 5.5761, "mean_token_accuracy": 0.15884069055318834, "num_tokens": 5802286.0, "step": 3350 }, { "entropy": 5.788263034820557, "epoch": 0.2610387084224859, "grad_norm": 1.1328125, "learning_rate": 0.0004996217431042282, "loss": 5.7195, "mean_token_accuracy": 0.15141943246126174, "num_tokens": 5810985.0, "step": 3355 }, { "entropy": 5.955795001983643, "epoch": 0.2614277377942035, "grad_norm": 0.95703125, "learning_rate": 0.000499620134981758, "loss": 5.7707, "mean_token_accuracy": 0.15107223987579346, "num_tokens": 5820037.0, "step": 3360 }, { "entropy": 5.795082426071167, "epoch": 0.261816767165921, "grad_norm": 1.1484375, "learning_rate": 0.0004996185234510346, "loss": 5.6242, "mean_token_accuracy": 0.16446445733308793, "num_tokens": 5828232.0, "step": 3365 }, { "entropy": 5.909881448745727, "epoch": 0.2622057965376386, "grad_norm": 0.94921875, "learning_rate": 0.0004996169085120828, "loss": 5.8446, "mean_token_accuracy": 0.15064912438392639, "num_tokens": 5838184.0, "step": 3370 }, { "entropy": 5.951297903060913, "epoch": 0.2625948259093562, "grad_norm": 0.98828125, "learning_rate": 0.0004996152901649268, "loss": 5.6708, "mean_token_accuracy": 0.15528088957071304, "num_tokens": 5846705.0, "step": 3375 }, { "entropy": 5.891704511642456, "epoch": 0.2629838552810737, "grad_norm": 1.03125, "learning_rate": 0.0004996136684095913, "loss": 5.7557, "mean_token_accuracy": 0.14960285723209382, "num_tokens": 5855959.0, "step": 3380 }, { "entropy": 5.8450446128845215, "epoch": 0.2633728846527913, "grad_norm": 0.9921875, "learning_rate": 0.0004996120432461009, "loss": 5.7099, "mean_token_accuracy": 0.15203075855970383, "num_tokens": 5865283.0, "step": 3385 }, { "entropy": 5.913759851455689, "epoch": 0.2637619140245088, "grad_norm": 0.98828125, "learning_rate": 0.0004996104146744804, "loss": 5.7391, "mean_token_accuracy": 0.1565643608570099, "num_tokens": 5873833.0, "step": 3390 }, { "entropy": 5.948887634277344, "epoch": 0.2641509433962264, "grad_norm": 0.98828125, "learning_rate": 0.0004996087826947541, "loss": 5.6684, "mean_token_accuracy": 0.16087514907121658, "num_tokens": 5882027.0, "step": 3395 }, { "entropy": 5.710987138748169, "epoch": 0.264539972767944, "grad_norm": 0.96484375, "learning_rate": 0.0004996071473069471, "loss": 5.548, "mean_token_accuracy": 0.16150110214948654, "num_tokens": 5890650.0, "step": 3400 }, { "entropy": 5.778266859054566, "epoch": 0.26492900213966153, "grad_norm": 1.0078125, "learning_rate": 0.0004996055085110842, "loss": 5.6004, "mean_token_accuracy": 0.16101501286029815, "num_tokens": 5898595.0, "step": 3405 }, { "entropy": 5.916549825668335, "epoch": 0.2653180315113791, "grad_norm": 1.0546875, "learning_rate": 0.0004996038663071902, "loss": 5.7157, "mean_token_accuracy": 0.1523623764514923, "num_tokens": 5907234.0, "step": 3410 }, { "entropy": 5.877885484695435, "epoch": 0.26570706088309665, "grad_norm": 1.0546875, "learning_rate": 0.0004996022206952901, "loss": 5.6562, "mean_token_accuracy": 0.15936153680086135, "num_tokens": 5915690.0, "step": 3415 }, { "entropy": 5.798541498184204, "epoch": 0.26609609025481423, "grad_norm": 1.0, "learning_rate": 0.0004996005716754086, "loss": 5.6053, "mean_token_accuracy": 0.16079822927713394, "num_tokens": 5924481.0, "step": 3420 }, { "entropy": 5.808663415908813, "epoch": 0.2664851196265318, "grad_norm": 1.1328125, "learning_rate": 0.000499598919247571, "loss": 5.6951, "mean_token_accuracy": 0.1579988867044449, "num_tokens": 5933059.0, "step": 3425 }, { "entropy": 5.887850189208985, "epoch": 0.26687414899824935, "grad_norm": 0.98046875, "learning_rate": 0.0004995972634118023, "loss": 5.8016, "mean_token_accuracy": 0.14508845061063766, "num_tokens": 5941767.0, "step": 3430 }, { "entropy": 5.844564151763916, "epoch": 0.26726317836996694, "grad_norm": 1.0390625, "learning_rate": 0.0004995956041681277, "loss": 5.691, "mean_token_accuracy": 0.15415164232254028, "num_tokens": 5950202.0, "step": 3435 }, { "entropy": 5.848789262771606, "epoch": 0.2676522077416845, "grad_norm": 1.03125, "learning_rate": 0.0004995939415165722, "loss": 5.7359, "mean_token_accuracy": 0.14812117516994477, "num_tokens": 5959242.0, "step": 3440 }, { "entropy": 5.846918964385987, "epoch": 0.26804123711340205, "grad_norm": 0.92578125, "learning_rate": 0.0004995922754571611, "loss": 5.6836, "mean_token_accuracy": 0.15515549182891847, "num_tokens": 5968404.0, "step": 3445 }, { "entropy": 5.860494327545166, "epoch": 0.26843026648511964, "grad_norm": 1.046875, "learning_rate": 0.0004995906059899197, "loss": 5.8005, "mean_token_accuracy": 0.15509908199310302, "num_tokens": 5976711.0, "step": 3450 }, { "entropy": 5.894256687164306, "epoch": 0.26881929585683717, "grad_norm": 1.078125, "learning_rate": 0.0004995889331148733, "loss": 5.6551, "mean_token_accuracy": 0.14889176189899445, "num_tokens": 5985049.0, "step": 3455 }, { "entropy": 5.8000787734985355, "epoch": 0.26920832522855476, "grad_norm": 1.0625, "learning_rate": 0.0004995872568320474, "loss": 5.6823, "mean_token_accuracy": 0.15802373141050338, "num_tokens": 5993904.0, "step": 3460 }, { "entropy": 5.915686511993409, "epoch": 0.26959735460027234, "grad_norm": 1.0625, "learning_rate": 0.0004995855771414673, "loss": 5.7404, "mean_token_accuracy": 0.15314059257507323, "num_tokens": 6001832.0, "step": 3465 }, { "entropy": 5.825476264953613, "epoch": 0.2699863839719899, "grad_norm": 1.0, "learning_rate": 0.0004995838940431585, "loss": 5.6599, "mean_token_accuracy": 0.1504707530140877, "num_tokens": 6010609.0, "step": 3470 }, { "entropy": 5.851345634460449, "epoch": 0.27037541334370746, "grad_norm": 1.0390625, "learning_rate": 0.0004995822075371466, "loss": 5.7193, "mean_token_accuracy": 0.15108724534511567, "num_tokens": 6019299.0, "step": 3475 }, { "entropy": 5.943111848831177, "epoch": 0.270764442715425, "grad_norm": 0.98828125, "learning_rate": 0.0004995805176234571, "loss": 5.7676, "mean_token_accuracy": 0.14575971737504007, "num_tokens": 6028743.0, "step": 3480 }, { "entropy": 5.879656744003296, "epoch": 0.2711534720871426, "grad_norm": 1.1484375, "learning_rate": 0.0004995788243021158, "loss": 5.6713, "mean_token_accuracy": 0.14724702388048172, "num_tokens": 6038064.0, "step": 3485 }, { "entropy": 5.793353033065796, "epoch": 0.27154250145886016, "grad_norm": 1.046875, "learning_rate": 0.0004995771275731483, "loss": 5.6612, "mean_token_accuracy": 0.1524479627609253, "num_tokens": 6047031.0, "step": 3490 }, { "entropy": 5.889426136016846, "epoch": 0.2719315308305777, "grad_norm": 1.0078125, "learning_rate": 0.0004995754274365802, "loss": 5.7498, "mean_token_accuracy": 0.15119700282812118, "num_tokens": 6056147.0, "step": 3495 }, { "entropy": 5.890491199493408, "epoch": 0.2723205602022953, "grad_norm": 0.984375, "learning_rate": 0.0004995737238924376, "loss": 5.6689, "mean_token_accuracy": 0.15356390327215194, "num_tokens": 6064641.0, "step": 3500 }, { "entropy": 5.796261215209961, "epoch": 0.2727095895740128, "grad_norm": 0.98828125, "learning_rate": 0.0004995720169407461, "loss": 5.5947, "mean_token_accuracy": 0.15325731337070464, "num_tokens": 6073664.0, "step": 3505 }, { "entropy": 5.811582803726196, "epoch": 0.2730986189457304, "grad_norm": 1.0625, "learning_rate": 0.0004995703065815317, "loss": 5.5752, "mean_token_accuracy": 0.16186247318983077, "num_tokens": 6081480.0, "step": 3510 }, { "entropy": 5.8565483570098875, "epoch": 0.273487648317448, "grad_norm": 1.0, "learning_rate": 0.0004995685928148203, "loss": 5.7021, "mean_token_accuracy": 0.14859129190444947, "num_tokens": 6090408.0, "step": 3515 }, { "entropy": 5.866174983978271, "epoch": 0.2738766776891655, "grad_norm": 1.046875, "learning_rate": 0.000499566875640638, "loss": 5.699, "mean_token_accuracy": 0.15143164694309236, "num_tokens": 6099076.0, "step": 3520 }, { "entropy": 5.874391031265259, "epoch": 0.2742657070608831, "grad_norm": 1.0234375, "learning_rate": 0.0004995651550590108, "loss": 5.7466, "mean_token_accuracy": 0.14636368602514266, "num_tokens": 6108346.0, "step": 3525 }, { "entropy": 5.837771892547607, "epoch": 0.2746547364326007, "grad_norm": 1.0234375, "learning_rate": 0.0004995634310699647, "loss": 5.7037, "mean_token_accuracy": 0.15670324489474297, "num_tokens": 6116974.0, "step": 3530 }, { "entropy": 5.913712024688721, "epoch": 0.2750437658043182, "grad_norm": 1.03125, "learning_rate": 0.0004995617036735261, "loss": 5.7323, "mean_token_accuracy": 0.1500618875026703, "num_tokens": 6125510.0, "step": 3535 }, { "entropy": 5.865264272689819, "epoch": 0.2754327951760358, "grad_norm": 0.953125, "learning_rate": 0.0004995599728697211, "loss": 5.7712, "mean_token_accuracy": 0.14675354063510895, "num_tokens": 6134959.0, "step": 3540 }, { "entropy": 5.930070304870606, "epoch": 0.27582182454775334, "grad_norm": 1.125, "learning_rate": 0.0004995582386585759, "loss": 5.7049, "mean_token_accuracy": 0.145357196778059, "num_tokens": 6144485.0, "step": 3545 }, { "entropy": 5.86058931350708, "epoch": 0.2762108539194709, "grad_norm": 0.9765625, "learning_rate": 0.0004995565010401167, "loss": 5.6487, "mean_token_accuracy": 0.15821592509746552, "num_tokens": 6153991.0, "step": 3550 }, { "entropy": 5.739012575149536, "epoch": 0.2765998832911885, "grad_norm": 1.0078125, "learning_rate": 0.0004995547600143702, "loss": 5.6425, "mean_token_accuracy": 0.1544785276055336, "num_tokens": 6162649.0, "step": 3555 }, { "entropy": 5.813714075088501, "epoch": 0.27698891266290604, "grad_norm": 0.98046875, "learning_rate": 0.0004995530155813625, "loss": 5.5463, "mean_token_accuracy": 0.15806780904531478, "num_tokens": 6171525.0, "step": 3560 }, { "entropy": 5.872299385070801, "epoch": 0.2773779420346236, "grad_norm": 0.9921875, "learning_rate": 0.0004995512677411203, "loss": 5.7726, "mean_token_accuracy": 0.15298861116170884, "num_tokens": 6180403.0, "step": 3565 }, { "entropy": 5.834949064254761, "epoch": 0.27776697140634116, "grad_norm": 1.0703125, "learning_rate": 0.0004995495164936698, "loss": 5.6142, "mean_token_accuracy": 0.15946034938097, "num_tokens": 6188361.0, "step": 3570 }, { "entropy": 5.807054090499878, "epoch": 0.27815600077805874, "grad_norm": 1.046875, "learning_rate": 0.0004995477618390381, "loss": 5.6716, "mean_token_accuracy": 0.14874202236533166, "num_tokens": 6197418.0, "step": 3575 }, { "entropy": 5.810306215286255, "epoch": 0.27854503014977633, "grad_norm": 1.078125, "learning_rate": 0.0004995460037772513, "loss": 5.6813, "mean_token_accuracy": 0.15601591318845748, "num_tokens": 6206040.0, "step": 3580 }, { "entropy": 5.79304084777832, "epoch": 0.27893405952149386, "grad_norm": 1.140625, "learning_rate": 0.0004995442423083365, "loss": 5.5968, "mean_token_accuracy": 0.15546937584877013, "num_tokens": 6214433.0, "step": 3585 }, { "entropy": 5.769221782684326, "epoch": 0.27932308889321145, "grad_norm": 1.0234375, "learning_rate": 0.0004995424774323201, "loss": 5.5765, "mean_token_accuracy": 0.15947029739618301, "num_tokens": 6223375.0, "step": 3590 }, { "entropy": 5.744332695007325, "epoch": 0.279712118264929, "grad_norm": 0.921875, "learning_rate": 0.000499540709149229, "loss": 5.6898, "mean_token_accuracy": 0.15379903316497803, "num_tokens": 6232597.0, "step": 3595 }, { "entropy": 5.785550165176391, "epoch": 0.28010114763664656, "grad_norm": 1.109375, "learning_rate": 0.0004995389374590901, "loss": 5.5429, "mean_token_accuracy": 0.16784969419240953, "num_tokens": 6240634.0, "step": 3600 }, { "entropy": 5.780906867980957, "epoch": 0.28049017700836415, "grad_norm": 1.03125, "learning_rate": 0.0004995371623619301, "loss": 5.5015, "mean_token_accuracy": 0.15682514160871505, "num_tokens": 6249098.0, "step": 3605 }, { "entropy": 5.739667129516602, "epoch": 0.2808792063800817, "grad_norm": 0.984375, "learning_rate": 0.000499535383857776, "loss": 5.5472, "mean_token_accuracy": 0.16006743013858796, "num_tokens": 6257572.0, "step": 3610 }, { "entropy": 5.859043931961059, "epoch": 0.28126823575179927, "grad_norm": 1.046875, "learning_rate": 0.000499533601946655, "loss": 5.8165, "mean_token_accuracy": 0.14751632660627365, "num_tokens": 6266492.0, "step": 3615 }, { "entropy": 5.865448904037476, "epoch": 0.2816572651235168, "grad_norm": 1.1171875, "learning_rate": 0.0004995318166285938, "loss": 5.6829, "mean_token_accuracy": 0.155305153131485, "num_tokens": 6275149.0, "step": 3620 }, { "entropy": 5.874626731872558, "epoch": 0.2820462944952344, "grad_norm": 1.0390625, "learning_rate": 0.0004995300279036199, "loss": 5.6956, "mean_token_accuracy": 0.15312935113906861, "num_tokens": 6283208.0, "step": 3625 }, { "entropy": 5.855358982086182, "epoch": 0.28243532386695197, "grad_norm": 1.0625, "learning_rate": 0.00049952823577176, "loss": 5.6347, "mean_token_accuracy": 0.15589332580566406, "num_tokens": 6292084.0, "step": 3630 }, { "entropy": 5.784860134124756, "epoch": 0.2828243532386695, "grad_norm": 0.90234375, "learning_rate": 0.0004995264402330416, "loss": 5.6336, "mean_token_accuracy": 0.1528566986322403, "num_tokens": 6301855.0, "step": 3635 }, { "entropy": 5.845756483078003, "epoch": 0.2832133826103871, "grad_norm": 1.015625, "learning_rate": 0.0004995246412874919, "loss": 5.6379, "mean_token_accuracy": 0.15769062787294388, "num_tokens": 6310166.0, "step": 3640 }, { "entropy": 5.783097553253174, "epoch": 0.2836024119821047, "grad_norm": 1.046875, "learning_rate": 0.000499522838935138, "loss": 5.6228, "mean_token_accuracy": 0.16248167604207991, "num_tokens": 6318928.0, "step": 3645 }, { "entropy": 5.826745843887329, "epoch": 0.2839914413538222, "grad_norm": 1.03125, "learning_rate": 0.0004995210331760074, "loss": 5.6509, "mean_token_accuracy": 0.1659294068813324, "num_tokens": 6327790.0, "step": 3650 }, { "entropy": 5.85683012008667, "epoch": 0.2843804707255398, "grad_norm": 1.0703125, "learning_rate": 0.0004995192240101275, "loss": 5.7141, "mean_token_accuracy": 0.1522120863199234, "num_tokens": 6335517.0, "step": 3655 }, { "entropy": 5.789180564880371, "epoch": 0.2847695000972573, "grad_norm": 0.9921875, "learning_rate": 0.0004995174114375258, "loss": 5.7049, "mean_token_accuracy": 0.15419832319021226, "num_tokens": 6344218.0, "step": 3660 }, { "entropy": 5.769765949249267, "epoch": 0.2851585294689749, "grad_norm": 1.0078125, "learning_rate": 0.0004995155954582297, "loss": 5.5136, "mean_token_accuracy": 0.16411114037036895, "num_tokens": 6353125.0, "step": 3665 }, { "entropy": 5.8027407169342045, "epoch": 0.2855475588406925, "grad_norm": 0.9921875, "learning_rate": 0.0004995137760722668, "loss": 5.6528, "mean_token_accuracy": 0.1551785096526146, "num_tokens": 6362113.0, "step": 3670 }, { "entropy": 5.844509744644165, "epoch": 0.28593658821241, "grad_norm": 1.0234375, "learning_rate": 0.0004995119532796646, "loss": 5.7323, "mean_token_accuracy": 0.15433150082826613, "num_tokens": 6370916.0, "step": 3675 }, { "entropy": 5.866036510467529, "epoch": 0.2863256175841276, "grad_norm": 1.03125, "learning_rate": 0.000499510127080451, "loss": 5.5915, "mean_token_accuracy": 0.1586878553032875, "num_tokens": 6379256.0, "step": 3680 }, { "entropy": 5.825314474105835, "epoch": 0.28671464695584514, "grad_norm": 0.95703125, "learning_rate": 0.0004995082974746535, "loss": 5.723, "mean_token_accuracy": 0.15312020778656005, "num_tokens": 6388098.0, "step": 3685 }, { "entropy": 5.7031796932220455, "epoch": 0.28710367632756273, "grad_norm": 1.0390625, "learning_rate": 0.0004995064644622999, "loss": 5.5249, "mean_token_accuracy": 0.16168365329504014, "num_tokens": 6396292.0, "step": 3690 }, { "entropy": 5.792140960693359, "epoch": 0.2874927056992803, "grad_norm": 1.015625, "learning_rate": 0.0004995046280434181, "loss": 5.5502, "mean_token_accuracy": 0.16206852197647095, "num_tokens": 6404968.0, "step": 3695 }, { "entropy": 5.691653776168823, "epoch": 0.28788173507099785, "grad_norm": 1.046875, "learning_rate": 0.0004995027882180358, "loss": 5.6329, "mean_token_accuracy": 0.15900261849164962, "num_tokens": 6412839.0, "step": 3700 }, { "entropy": 5.784019470214844, "epoch": 0.28827076444271543, "grad_norm": 0.98828125, "learning_rate": 0.0004995009449861812, "loss": 5.6493, "mean_token_accuracy": 0.14958156421780586, "num_tokens": 6421943.0, "step": 3705 }, { "entropy": 5.855062103271484, "epoch": 0.28865979381443296, "grad_norm": 0.98046875, "learning_rate": 0.000499499098347882, "loss": 5.7285, "mean_token_accuracy": 0.14923914447426795, "num_tokens": 6430731.0, "step": 3710 }, { "entropy": 5.851906061172485, "epoch": 0.28904882318615055, "grad_norm": 1.0546875, "learning_rate": 0.0004994972483031662, "loss": 5.6556, "mean_token_accuracy": 0.1556018888950348, "num_tokens": 6439365.0, "step": 3715 }, { "entropy": 5.8089118003845215, "epoch": 0.28943785255786814, "grad_norm": 0.95703125, "learning_rate": 0.000499495394852062, "loss": 5.6021, "mean_token_accuracy": 0.16112566590309144, "num_tokens": 6448085.0, "step": 3720 }, { "entropy": 5.684608078002929, "epoch": 0.28982688192958567, "grad_norm": 1.03125, "learning_rate": 0.0004994935379945977, "loss": 5.6652, "mean_token_accuracy": 0.14997439682483674, "num_tokens": 6457630.0, "step": 3725 }, { "entropy": 5.838469409942627, "epoch": 0.29021591130130325, "grad_norm": 1.125, "learning_rate": 0.0004994916777308012, "loss": 5.5251, "mean_token_accuracy": 0.1629138931632042, "num_tokens": 6465781.0, "step": 3730 }, { "entropy": 5.844767808914185, "epoch": 0.29060494067302084, "grad_norm": 1.0390625, "learning_rate": 0.0004994898140607007, "loss": 5.7055, "mean_token_accuracy": 0.1529698833823204, "num_tokens": 6473723.0, "step": 3735 }, { "entropy": 5.711420583724975, "epoch": 0.29099397004473837, "grad_norm": 1.015625, "learning_rate": 0.0004994879469843247, "loss": 5.6375, "mean_token_accuracy": 0.1572704315185547, "num_tokens": 6482535.0, "step": 3740 }, { "entropy": 5.8504077911376955, "epoch": 0.29138299941645596, "grad_norm": 1.0625, "learning_rate": 0.0004994860765017013, "loss": 5.6747, "mean_token_accuracy": 0.1574747622013092, "num_tokens": 6491297.0, "step": 3745 }, { "entropy": 5.773846578598023, "epoch": 0.2917720287881735, "grad_norm": 1.046875, "learning_rate": 0.000499484202612859, "loss": 5.6295, "mean_token_accuracy": 0.15734697729349137, "num_tokens": 6499809.0, "step": 3750 }, { "entropy": 5.7556627750396725, "epoch": 0.2921610581598911, "grad_norm": 1.1015625, "learning_rate": 0.0004994823253178264, "loss": 5.6075, "mean_token_accuracy": 0.16184348315000535, "num_tokens": 6507965.0, "step": 3755 }, { "entropy": 5.852641582489014, "epoch": 0.29255008753160866, "grad_norm": 1.3828125, "learning_rate": 0.0004994804446166317, "loss": 5.6552, "mean_token_accuracy": 0.15120026841759682, "num_tokens": 6517106.0, "step": 3760 }, { "entropy": 5.845433378219605, "epoch": 0.2929391169033262, "grad_norm": 1.0625, "learning_rate": 0.0004994785605093035, "loss": 5.7337, "mean_token_accuracy": 0.15373013466596602, "num_tokens": 6526663.0, "step": 3765 }, { "entropy": 5.927438497543335, "epoch": 0.2933281462750438, "grad_norm": 1.0078125, "learning_rate": 0.0004994766729958705, "loss": 5.7739, "mean_token_accuracy": 0.1520956665277481, "num_tokens": 6535732.0, "step": 3770 }, { "entropy": 5.808690547943115, "epoch": 0.2937171756467613, "grad_norm": 0.953125, "learning_rate": 0.0004994747820763612, "loss": 5.6301, "mean_token_accuracy": 0.15487213283777237, "num_tokens": 6544938.0, "step": 3775 }, { "entropy": 5.802787160873413, "epoch": 0.2941062050184789, "grad_norm": 1.0625, "learning_rate": 0.0004994728877508046, "loss": 5.6336, "mean_token_accuracy": 0.1528394863009453, "num_tokens": 6554507.0, "step": 3780 }, { "entropy": 5.839257526397705, "epoch": 0.2944952343901965, "grad_norm": 0.953125, "learning_rate": 0.0004994709900192289, "loss": 5.6781, "mean_token_accuracy": 0.15294660478830338, "num_tokens": 6563285.0, "step": 3785 }, { "entropy": 5.752003622055054, "epoch": 0.294884263761914, "grad_norm": 0.99609375, "learning_rate": 0.0004994690888816635, "loss": 5.56, "mean_token_accuracy": 0.15720225274562835, "num_tokens": 6572223.0, "step": 3790 }, { "entropy": 5.823800420761108, "epoch": 0.2952732931336316, "grad_norm": 1.015625, "learning_rate": 0.0004994671843381367, "loss": 5.7438, "mean_token_accuracy": 0.14936941713094712, "num_tokens": 6580686.0, "step": 3795 }, { "entropy": 5.855613756179809, "epoch": 0.29566232250534913, "grad_norm": 1.0078125, "learning_rate": 0.0004994652763886778, "loss": 5.6053, "mean_token_accuracy": 0.1560147821903229, "num_tokens": 6589056.0, "step": 3800 }, { "entropy": 5.8202354431152346, "epoch": 0.2960513518770667, "grad_norm": 1.0390625, "learning_rate": 0.0004994633650333155, "loss": 5.6695, "mean_token_accuracy": 0.15734007209539413, "num_tokens": 6598221.0, "step": 3805 }, { "entropy": 5.879884719848633, "epoch": 0.2964403812487843, "grad_norm": 1.0546875, "learning_rate": 0.0004994614502720792, "loss": 5.72, "mean_token_accuracy": 0.15723774582147598, "num_tokens": 6606657.0, "step": 3810 }, { "entropy": 5.883637285232544, "epoch": 0.29682941062050183, "grad_norm": 0.96484375, "learning_rate": 0.0004994595321049974, "loss": 5.8057, "mean_token_accuracy": 0.14732917174696922, "num_tokens": 6616203.0, "step": 3815 }, { "entropy": 5.904540967941284, "epoch": 0.2972184399922194, "grad_norm": 0.8984375, "learning_rate": 0.0004994576105320994, "loss": 5.6617, "mean_token_accuracy": 0.15442878901958465, "num_tokens": 6624982.0, "step": 3820 }, { "entropy": 5.843383693695069, "epoch": 0.29760746936393695, "grad_norm": 1.0390625, "learning_rate": 0.0004994556855534146, "loss": 5.6234, "mean_token_accuracy": 0.16022102981805803, "num_tokens": 6632548.0, "step": 3825 }, { "entropy": 5.7950318336486815, "epoch": 0.29799649873565454, "grad_norm": 1.0234375, "learning_rate": 0.0004994537571689719, "loss": 5.7647, "mean_token_accuracy": 0.14879212528467178, "num_tokens": 6641943.0, "step": 3830 }, { "entropy": 5.838181400299073, "epoch": 0.2983855281073721, "grad_norm": 0.9765625, "learning_rate": 0.0004994518253788007, "loss": 5.6, "mean_token_accuracy": 0.16140060871839523, "num_tokens": 6650371.0, "step": 3835 }, { "entropy": 5.819985818862915, "epoch": 0.29877455747908965, "grad_norm": 0.9921875, "learning_rate": 0.0004994498901829304, "loss": 5.6843, "mean_token_accuracy": 0.15791809260845185, "num_tokens": 6659324.0, "step": 3840 }, { "entropy": 5.810818195343018, "epoch": 0.29916358685080724, "grad_norm": 1.0390625, "learning_rate": 0.0004994479515813903, "loss": 5.6492, "mean_token_accuracy": 0.1515626162290573, "num_tokens": 6668237.0, "step": 3845 }, { "entropy": 5.808945417404175, "epoch": 0.2995526162225248, "grad_norm": 0.984375, "learning_rate": 0.0004994460095742096, "loss": 5.5772, "mean_token_accuracy": 0.16233526021242142, "num_tokens": 6677213.0, "step": 3850 }, { "entropy": 5.7874250411987305, "epoch": 0.29994164559424236, "grad_norm": 0.98046875, "learning_rate": 0.000499444064161418, "loss": 5.587, "mean_token_accuracy": 0.15759442001581192, "num_tokens": 6686850.0, "step": 3855 }, { "entropy": 5.77463321685791, "epoch": 0.30033067496595994, "grad_norm": 0.94921875, "learning_rate": 0.000499442115343045, "loss": 5.5608, "mean_token_accuracy": 0.16466309428215026, "num_tokens": 6695697.0, "step": 3860 }, { "entropy": 5.764589834213257, "epoch": 0.3007197043376775, "grad_norm": 1.1796875, "learning_rate": 0.0004994401631191202, "loss": 5.6185, "mean_token_accuracy": 0.16456811875104904, "num_tokens": 6704525.0, "step": 3865 }, { "entropy": 5.749872732162475, "epoch": 0.30110873370939506, "grad_norm": 1.03125, "learning_rate": 0.0004994382074896731, "loss": 5.555, "mean_token_accuracy": 0.1628976732492447, "num_tokens": 6713562.0, "step": 3870 }, { "entropy": 5.841018533706665, "epoch": 0.30149776308111265, "grad_norm": 1.0390625, "learning_rate": 0.0004994362484547335, "loss": 5.6633, "mean_token_accuracy": 0.15924778133630751, "num_tokens": 6721817.0, "step": 3875 }, { "entropy": 5.8318479537963865, "epoch": 0.3018867924528302, "grad_norm": 1.0390625, "learning_rate": 0.0004994342860143309, "loss": 5.5799, "mean_token_accuracy": 0.16334821432828903, "num_tokens": 6729757.0, "step": 3880 }, { "entropy": 5.756866598129273, "epoch": 0.30227582182454776, "grad_norm": 0.99609375, "learning_rate": 0.0004994323201684953, "loss": 5.6585, "mean_token_accuracy": 0.1475125730037689, "num_tokens": 6738354.0, "step": 3885 }, { "entropy": 5.819000101089477, "epoch": 0.3026648511962653, "grad_norm": 1.046875, "learning_rate": 0.0004994303509172566, "loss": 5.7076, "mean_token_accuracy": 0.15129155218601226, "num_tokens": 6746505.0, "step": 3890 }, { "entropy": 5.904794931411743, "epoch": 0.3030538805679829, "grad_norm": 1.0703125, "learning_rate": 0.0004994283782606444, "loss": 5.6111, "mean_token_accuracy": 0.15827509462833406, "num_tokens": 6754547.0, "step": 3895 }, { "entropy": 5.7554058074951175, "epoch": 0.30344290993970047, "grad_norm": 1.0234375, "learning_rate": 0.0004994264021986888, "loss": 5.5293, "mean_token_accuracy": 0.16018292903900147, "num_tokens": 6763213.0, "step": 3900 }, { "entropy": 5.691382646560669, "epoch": 0.303831939311418, "grad_norm": 1.0546875, "learning_rate": 0.0004994244227314197, "loss": 5.5787, "mean_token_accuracy": 0.15872986018657684, "num_tokens": 6771060.0, "step": 3905 }, { "entropy": 5.808207893371582, "epoch": 0.3042209686831356, "grad_norm": 1.03125, "learning_rate": 0.0004994224398588672, "loss": 5.7216, "mean_token_accuracy": 0.15398526936769485, "num_tokens": 6779819.0, "step": 3910 }, { "entropy": 5.835114002227783, "epoch": 0.3046099980548531, "grad_norm": 0.98046875, "learning_rate": 0.0004994204535810615, "loss": 5.618, "mean_token_accuracy": 0.15699677169322968, "num_tokens": 6788660.0, "step": 3915 }, { "entropy": 5.723716831207275, "epoch": 0.3049990274265707, "grad_norm": 1.0234375, "learning_rate": 0.0004994184638980326, "loss": 5.5708, "mean_token_accuracy": 0.16314460784196855, "num_tokens": 6797298.0, "step": 3920 }, { "entropy": 5.743786954879761, "epoch": 0.3053880567982883, "grad_norm": 1.0078125, "learning_rate": 0.0004994164708098107, "loss": 5.6223, "mean_token_accuracy": 0.15216543674468994, "num_tokens": 6806148.0, "step": 3925 }, { "entropy": 5.764825057983399, "epoch": 0.3057770861700058, "grad_norm": 1.0078125, "learning_rate": 0.000499414474316426, "loss": 5.6592, "mean_token_accuracy": 0.157614828646183, "num_tokens": 6815494.0, "step": 3930 }, { "entropy": 5.904352045059204, "epoch": 0.3061661155417234, "grad_norm": 1.0, "learning_rate": 0.0004994124744179088, "loss": 5.7051, "mean_token_accuracy": 0.15148080736398697, "num_tokens": 6824852.0, "step": 3935 }, { "entropy": 5.787218236923218, "epoch": 0.306555144913441, "grad_norm": 0.91015625, "learning_rate": 0.0004994104711142896, "loss": 5.5069, "mean_token_accuracy": 0.16816734969615937, "num_tokens": 6834200.0, "step": 3940 }, { "entropy": 5.774364185333252, "epoch": 0.3069441742851585, "grad_norm": 1.1015625, "learning_rate": 0.0004994084644055986, "loss": 5.6567, "mean_token_accuracy": 0.15507219433784486, "num_tokens": 6842869.0, "step": 3945 }, { "entropy": 5.814112663269043, "epoch": 0.3073332036568761, "grad_norm": 1.03125, "learning_rate": 0.0004994064542918664, "loss": 5.6178, "mean_token_accuracy": 0.1599549800157547, "num_tokens": 6851668.0, "step": 3950 }, { "entropy": 5.831446838378906, "epoch": 0.30772223302859364, "grad_norm": 0.97265625, "learning_rate": 0.0004994044407731235, "loss": 5.6875, "mean_token_accuracy": 0.16353656947612763, "num_tokens": 6860710.0, "step": 3955 }, { "entropy": 5.75144510269165, "epoch": 0.3081112624003112, "grad_norm": 1.0234375, "learning_rate": 0.0004994024238494002, "loss": 5.6216, "mean_token_accuracy": 0.1537766396999359, "num_tokens": 6869608.0, "step": 3960 }, { "entropy": 5.827413606643677, "epoch": 0.3085002917720288, "grad_norm": 1.0859375, "learning_rate": 0.0004994004035207274, "loss": 5.639, "mean_token_accuracy": 0.1554042413830757, "num_tokens": 6878108.0, "step": 3965 }, { "entropy": 5.779709196090698, "epoch": 0.30888932114374634, "grad_norm": 1.0078125, "learning_rate": 0.0004993983797871356, "loss": 5.5448, "mean_token_accuracy": 0.15877590030431749, "num_tokens": 6886369.0, "step": 3970 }, { "entropy": 5.7670244693756105, "epoch": 0.30927835051546393, "grad_norm": 1.015625, "learning_rate": 0.0004993963526486555, "loss": 5.607, "mean_token_accuracy": 0.15788756608963012, "num_tokens": 6895410.0, "step": 3975 }, { "entropy": 5.797284984588623, "epoch": 0.30966737988718146, "grad_norm": 1.0234375, "learning_rate": 0.000499394322105318, "loss": 5.5952, "mean_token_accuracy": 0.15986649543046952, "num_tokens": 6904380.0, "step": 3980 }, { "entropy": 5.797864580154419, "epoch": 0.31005640925889905, "grad_norm": 1.0390625, "learning_rate": 0.0004993922881571538, "loss": 5.6206, "mean_token_accuracy": 0.15683696866035463, "num_tokens": 6913012.0, "step": 3985 }, { "entropy": 5.7702795505523685, "epoch": 0.31044543863061663, "grad_norm": 1.0, "learning_rate": 0.0004993902508041939, "loss": 5.6387, "mean_token_accuracy": 0.15548964440822602, "num_tokens": 6921696.0, "step": 3990 }, { "entropy": 5.791179227828979, "epoch": 0.31083446800233416, "grad_norm": 1.0078125, "learning_rate": 0.000499388210046469, "loss": 5.579, "mean_token_accuracy": 0.15531976968050004, "num_tokens": 6930017.0, "step": 3995 }, { "entropy": 5.709838199615478, "epoch": 0.31122349737405175, "grad_norm": 0.953125, "learning_rate": 0.0004993861658840102, "loss": 5.5464, "mean_token_accuracy": 0.1598093330860138, "num_tokens": 6938410.0, "step": 4000 }, { "entropy": 5.782442045211792, "epoch": 0.3116125267457693, "grad_norm": 1.0703125, "learning_rate": 0.0004993841183168484, "loss": 5.6157, "mean_token_accuracy": 0.15706539303064346, "num_tokens": 6946227.0, "step": 4005 }, { "entropy": 5.797301340103149, "epoch": 0.31200155611748687, "grad_norm": 0.9453125, "learning_rate": 0.0004993820673450148, "loss": 5.6096, "mean_token_accuracy": 0.15807232558727263, "num_tokens": 6954747.0, "step": 4010 }, { "entropy": 5.788407516479492, "epoch": 0.31239058548920445, "grad_norm": 1.125, "learning_rate": 0.0004993800129685404, "loss": 5.6804, "mean_token_accuracy": 0.15833715796470643, "num_tokens": 6962990.0, "step": 4015 }, { "entropy": 5.777428436279297, "epoch": 0.312779614860922, "grad_norm": 1.015625, "learning_rate": 0.0004993779551874565, "loss": 5.638, "mean_token_accuracy": 0.1595762073993683, "num_tokens": 6972351.0, "step": 4020 }, { "entropy": 5.789421892166137, "epoch": 0.31316864423263957, "grad_norm": 1.109375, "learning_rate": 0.0004993758940017943, "loss": 5.5714, "mean_token_accuracy": 0.16144972741603852, "num_tokens": 6980387.0, "step": 4025 }, { "entropy": 5.658299160003662, "epoch": 0.31355767360435716, "grad_norm": 1.046875, "learning_rate": 0.000499373829411585, "loss": 5.6357, "mean_token_accuracy": 0.1596735969185829, "num_tokens": 6989388.0, "step": 4030 }, { "entropy": 5.87131175994873, "epoch": 0.3139467029760747, "grad_norm": 1.03125, "learning_rate": 0.00049937176141686, "loss": 5.5914, "mean_token_accuracy": 0.16546436548233032, "num_tokens": 6997714.0, "step": 4035 }, { "entropy": 5.819481420516968, "epoch": 0.3143357323477923, "grad_norm": 0.98046875, "learning_rate": 0.0004993696900176506, "loss": 5.5748, "mean_token_accuracy": 0.16345698684453963, "num_tokens": 7006453.0, "step": 4040 }, { "entropy": 5.764643812179566, "epoch": 0.3147247617195098, "grad_norm": 0.953125, "learning_rate": 0.0004993676152139883, "loss": 5.6514, "mean_token_accuracy": 0.15526093393564225, "num_tokens": 7015398.0, "step": 4045 }, { "entropy": 5.767642402648926, "epoch": 0.3151137910912274, "grad_norm": 1.046875, "learning_rate": 0.0004993655370059046, "loss": 5.5952, "mean_token_accuracy": 0.1578880578279495, "num_tokens": 7023796.0, "step": 4050 }, { "entropy": 5.703687334060669, "epoch": 0.315502820462945, "grad_norm": 0.9765625, "learning_rate": 0.0004993634553934309, "loss": 5.5446, "mean_token_accuracy": 0.1635144382715225, "num_tokens": 7032453.0, "step": 4055 }, { "entropy": 5.7386377334594725, "epoch": 0.3158918498346625, "grad_norm": 1.0625, "learning_rate": 0.0004993613703765989, "loss": 5.6841, "mean_token_accuracy": 0.15243002027273178, "num_tokens": 7041034.0, "step": 4060 }, { "entropy": 5.8850563049316404, "epoch": 0.3162808792063801, "grad_norm": 1.0625, "learning_rate": 0.0004993592819554402, "loss": 5.7752, "mean_token_accuracy": 0.1502375230193138, "num_tokens": 7050289.0, "step": 4065 }, { "entropy": 5.781525039672852, "epoch": 0.3166699085780976, "grad_norm": 1.0078125, "learning_rate": 0.0004993571901299866, "loss": 5.6123, "mean_token_accuracy": 0.16497506499290465, "num_tokens": 7059638.0, "step": 4070 }, { "entropy": 5.751022434234619, "epoch": 0.3170589379498152, "grad_norm": 1.0390625, "learning_rate": 0.0004993550949002697, "loss": 5.622, "mean_token_accuracy": 0.15959509760141372, "num_tokens": 7067763.0, "step": 4075 }, { "entropy": 5.7526812076568605, "epoch": 0.3174479673215328, "grad_norm": 0.98828125, "learning_rate": 0.0004993529962663213, "loss": 5.5854, "mean_token_accuracy": 0.16497846245765685, "num_tokens": 7076126.0, "step": 4080 }, { "entropy": 5.754148960113525, "epoch": 0.31783699669325033, "grad_norm": 0.96484375, "learning_rate": 0.0004993508942281732, "loss": 5.5271, "mean_token_accuracy": 0.16019581109285355, "num_tokens": 7084403.0, "step": 4085 }, { "entropy": 5.6758214950561525, "epoch": 0.3182260260649679, "grad_norm": 0.98828125, "learning_rate": 0.0004993487887858575, "loss": 5.4989, "mean_token_accuracy": 0.1651519536972046, "num_tokens": 7093450.0, "step": 4090 }, { "entropy": 5.695490217208862, "epoch": 0.31861505543668545, "grad_norm": 0.9765625, "learning_rate": 0.000499346679939406, "loss": 5.4938, "mean_token_accuracy": 0.1639673426747322, "num_tokens": 7101722.0, "step": 4095 }, { "entropy": 5.70269193649292, "epoch": 0.31900408480840303, "grad_norm": 0.93359375, "learning_rate": 0.0004993445676888507, "loss": 5.5973, "mean_token_accuracy": 0.15606338530778885, "num_tokens": 7111285.0, "step": 4100 }, { "entropy": 5.855121707916259, "epoch": 0.3193931141801206, "grad_norm": 1.0234375, "learning_rate": 0.0004993424520342236, "loss": 5.6664, "mean_token_accuracy": 0.1561015322804451, "num_tokens": 7120281.0, "step": 4105 }, { "entropy": 5.717962598800659, "epoch": 0.31978214355183815, "grad_norm": 1.0078125, "learning_rate": 0.0004993403329755569, "loss": 5.5438, "mean_token_accuracy": 0.16015197783708573, "num_tokens": 7128584.0, "step": 4110 }, { "entropy": 5.808613395690918, "epoch": 0.32017117292355574, "grad_norm": 1.03125, "learning_rate": 0.0004993382105128828, "loss": 5.6513, "mean_token_accuracy": 0.15905333682894707, "num_tokens": 7137570.0, "step": 4115 }, { "entropy": 5.773133039474487, "epoch": 0.32056020229527327, "grad_norm": 0.984375, "learning_rate": 0.0004993360846462333, "loss": 5.6899, "mean_token_accuracy": 0.15812519043684006, "num_tokens": 7146965.0, "step": 4120 }, { "entropy": 5.787432909011841, "epoch": 0.32094923166699085, "grad_norm": 1.0234375, "learning_rate": 0.0004993339553756408, "loss": 5.6272, "mean_token_accuracy": 0.15931697189807892, "num_tokens": 7155657.0, "step": 4125 }, { "entropy": 5.8046619415283205, "epoch": 0.32133826103870844, "grad_norm": 0.99609375, "learning_rate": 0.0004993318227011378, "loss": 5.5615, "mean_token_accuracy": 0.1596067264676094, "num_tokens": 7164369.0, "step": 4130 }, { "entropy": 5.7777173042297365, "epoch": 0.32172729041042597, "grad_norm": 1.078125, "learning_rate": 0.0004993296866227562, "loss": 5.5399, "mean_token_accuracy": 0.1697876438498497, "num_tokens": 7172161.0, "step": 4135 }, { "entropy": 5.706020784378052, "epoch": 0.32211631978214356, "grad_norm": 0.98828125, "learning_rate": 0.0004993275471405288, "loss": 5.5862, "mean_token_accuracy": 0.15171700865030288, "num_tokens": 7180606.0, "step": 4140 }, { "entropy": 5.728547096252441, "epoch": 0.32250534915386114, "grad_norm": 0.9921875, "learning_rate": 0.0004993254042544879, "loss": 5.6262, "mean_token_accuracy": 0.1590207114815712, "num_tokens": 7188912.0, "step": 4145 }, { "entropy": 5.788024091720581, "epoch": 0.3228943785255787, "grad_norm": 0.93359375, "learning_rate": 0.000499323257964666, "loss": 5.6215, "mean_token_accuracy": 0.15666755810379981, "num_tokens": 7197477.0, "step": 4150 }, { "entropy": 5.801720523834229, "epoch": 0.32328340789729626, "grad_norm": 1.03125, "learning_rate": 0.0004993211082710957, "loss": 5.6026, "mean_token_accuracy": 0.16264097541570663, "num_tokens": 7206571.0, "step": 4155 }, { "entropy": 5.751149368286133, "epoch": 0.3236724372690138, "grad_norm": 1.0234375, "learning_rate": 0.0004993189551738097, "loss": 5.4462, "mean_token_accuracy": 0.15989296287298202, "num_tokens": 7215319.0, "step": 4160 }, { "entropy": 5.73461594581604, "epoch": 0.3240614666407314, "grad_norm": 1.0625, "learning_rate": 0.0004993167986728405, "loss": 5.6286, "mean_token_accuracy": 0.1550238996744156, "num_tokens": 7223389.0, "step": 4165 }, { "entropy": 5.771875619888306, "epoch": 0.32445049601244896, "grad_norm": 0.984375, "learning_rate": 0.000499314638768221, "loss": 5.6018, "mean_token_accuracy": 0.15770421475172042, "num_tokens": 7231853.0, "step": 4170 }, { "entropy": 5.761664533615113, "epoch": 0.3248395253841665, "grad_norm": 0.93359375, "learning_rate": 0.0004993124754599839, "loss": 5.5293, "mean_token_accuracy": 0.16403157413005828, "num_tokens": 7241081.0, "step": 4175 }, { "entropy": 5.71790828704834, "epoch": 0.3252285547558841, "grad_norm": 1.046875, "learning_rate": 0.0004993103087481619, "loss": 5.5487, "mean_token_accuracy": 0.1609074741601944, "num_tokens": 7249742.0, "step": 4180 }, { "entropy": 5.8293393611907955, "epoch": 0.3256175841276016, "grad_norm": 0.94140625, "learning_rate": 0.0004993081386327881, "loss": 5.6852, "mean_token_accuracy": 0.15708462446928023, "num_tokens": 7258285.0, "step": 4185 }, { "entropy": 5.750807237625122, "epoch": 0.3260066134993192, "grad_norm": 0.99609375, "learning_rate": 0.0004993059651138953, "loss": 5.5018, "mean_token_accuracy": 0.16263256967067719, "num_tokens": 7266843.0, "step": 4190 }, { "entropy": 5.682654571533203, "epoch": 0.3263956428710368, "grad_norm": 0.99609375, "learning_rate": 0.0004993037881915165, "loss": 5.5913, "mean_token_accuracy": 0.16370514035224915, "num_tokens": 7276041.0, "step": 4195 }, { "entropy": 5.738144969940185, "epoch": 0.3267846722427543, "grad_norm": 0.97265625, "learning_rate": 0.0004993016078656847, "loss": 5.6502, "mean_token_accuracy": 0.15509369671344758, "num_tokens": 7285144.0, "step": 4200 }, { "entropy": 5.65037989616394, "epoch": 0.3271737016144719, "grad_norm": 0.98046875, "learning_rate": 0.000499299424136433, "loss": 5.4993, "mean_token_accuracy": 0.16100571006536485, "num_tokens": 7293976.0, "step": 4205 }, { "entropy": 5.765503311157227, "epoch": 0.32756273098618943, "grad_norm": 1.125, "learning_rate": 0.0004992972370037946, "loss": 5.5695, "mean_token_accuracy": 0.15914326161146164, "num_tokens": 7302365.0, "step": 4210 }, { "entropy": 5.791704416275024, "epoch": 0.327951760357907, "grad_norm": 1.0859375, "learning_rate": 0.0004992950464678026, "loss": 5.6453, "mean_token_accuracy": 0.15589653253555297, "num_tokens": 7310909.0, "step": 4215 }, { "entropy": 5.762666463851929, "epoch": 0.3283407897296246, "grad_norm": 1.015625, "learning_rate": 0.0004992928525284903, "loss": 5.6041, "mean_token_accuracy": 0.15364096760749818, "num_tokens": 7319391.0, "step": 4220 }, { "entropy": 5.86359977722168, "epoch": 0.32872981910134214, "grad_norm": 1.0234375, "learning_rate": 0.000499290655185891, "loss": 5.6782, "mean_token_accuracy": 0.16046358346939088, "num_tokens": 7328076.0, "step": 4225 }, { "entropy": 5.7980348587036135, "epoch": 0.3291188484730597, "grad_norm": 1.0234375, "learning_rate": 0.000499288454440038, "loss": 5.6062, "mean_token_accuracy": 0.15722377076745034, "num_tokens": 7336833.0, "step": 4230 }, { "entropy": 5.711167240142823, "epoch": 0.3295078778447773, "grad_norm": 1.0703125, "learning_rate": 0.0004992862502909645, "loss": 5.5223, "mean_token_accuracy": 0.1646954208612442, "num_tokens": 7344862.0, "step": 4235 }, { "entropy": 5.775886392593383, "epoch": 0.32989690721649484, "grad_norm": 1.0546875, "learning_rate": 0.0004992840427387043, "loss": 5.5541, "mean_token_accuracy": 0.16591128408908845, "num_tokens": 7354503.0, "step": 4240 }, { "entropy": 5.760515594482422, "epoch": 0.3302859365882124, "grad_norm": 1.0625, "learning_rate": 0.0004992818317832908, "loss": 5.5568, "mean_token_accuracy": 0.16480007916688919, "num_tokens": 7363000.0, "step": 4245 }, { "entropy": 5.701372575759888, "epoch": 0.33067496595992996, "grad_norm": 0.96875, "learning_rate": 0.0004992796174247574, "loss": 5.6312, "mean_token_accuracy": 0.15584687665104865, "num_tokens": 7372619.0, "step": 4250 }, { "entropy": 5.803398752212525, "epoch": 0.33106399533164754, "grad_norm": 1.125, "learning_rate": 0.0004992773996631378, "loss": 5.5015, "mean_token_accuracy": 0.17060409784317015, "num_tokens": 7380531.0, "step": 4255 }, { "entropy": 5.745937347412109, "epoch": 0.33145302470336513, "grad_norm": 1.0234375, "learning_rate": 0.0004992751784984656, "loss": 5.6194, "mean_token_accuracy": 0.16034240871667862, "num_tokens": 7389153.0, "step": 4260 }, { "entropy": 5.725397109985352, "epoch": 0.33184205407508266, "grad_norm": 1.0078125, "learning_rate": 0.0004992729539307745, "loss": 5.5189, "mean_token_accuracy": 0.16305640786886216, "num_tokens": 7397880.0, "step": 4265 }, { "entropy": 5.78955659866333, "epoch": 0.33223108344680025, "grad_norm": 1.0390625, "learning_rate": 0.0004992707259600984, "loss": 5.5854, "mean_token_accuracy": 0.15720919668674468, "num_tokens": 7406180.0, "step": 4270 }, { "entropy": 5.7014524936676025, "epoch": 0.3326201128185178, "grad_norm": 1.0, "learning_rate": 0.0004992684945864709, "loss": 5.593, "mean_token_accuracy": 0.16094412356615068, "num_tokens": 7415069.0, "step": 4275 }, { "entropy": 5.744061803817749, "epoch": 0.33300914219023536, "grad_norm": 1.0078125, "learning_rate": 0.0004992662598099261, "loss": 5.6493, "mean_token_accuracy": 0.15555099695920943, "num_tokens": 7423921.0, "step": 4280 }, { "entropy": 5.696127796173096, "epoch": 0.33339817156195295, "grad_norm": 0.94140625, "learning_rate": 0.0004992640216304975, "loss": 5.3854, "mean_token_accuracy": 0.17118807137012482, "num_tokens": 7432655.0, "step": 4285 }, { "entropy": 5.776129102706909, "epoch": 0.3337872009336705, "grad_norm": 0.99609375, "learning_rate": 0.0004992617800482196, "loss": 5.578, "mean_token_accuracy": 0.16193160861730577, "num_tokens": 7441858.0, "step": 4290 }, { "entropy": 5.6602355480194095, "epoch": 0.33417623030538807, "grad_norm": 1.0703125, "learning_rate": 0.000499259535063126, "loss": 5.5398, "mean_token_accuracy": 0.16309095025062562, "num_tokens": 7450030.0, "step": 4295 }, { "entropy": 5.785944986343384, "epoch": 0.3345652596771056, "grad_norm": 1.0234375, "learning_rate": 0.000499257286675251, "loss": 5.6258, "mean_token_accuracy": 0.15881484746932983, "num_tokens": 7458256.0, "step": 4300 }, { "entropy": 5.786884784698486, "epoch": 0.3349542890488232, "grad_norm": 1.0703125, "learning_rate": 0.0004992550348846285, "loss": 5.5915, "mean_token_accuracy": 0.15856461822986603, "num_tokens": 7466710.0, "step": 4305 }, { "entropy": 5.710636949539184, "epoch": 0.33534331842054077, "grad_norm": 0.91796875, "learning_rate": 0.0004992527796912928, "loss": 5.5344, "mean_token_accuracy": 0.16328217089176178, "num_tokens": 7475445.0, "step": 4310 }, { "entropy": 5.79075436592102, "epoch": 0.3357323477922583, "grad_norm": 1.0390625, "learning_rate": 0.0004992505210952782, "loss": 5.6155, "mean_token_accuracy": 0.15852408558130265, "num_tokens": 7484326.0, "step": 4315 }, { "entropy": 5.715756559371949, "epoch": 0.3361213771639759, "grad_norm": 1.0078125, "learning_rate": 0.0004992482590966188, "loss": 5.5138, "mean_token_accuracy": 0.15974442958831786, "num_tokens": 7493028.0, "step": 4320 }, { "entropy": 5.810898685455323, "epoch": 0.3365104065356934, "grad_norm": 1.0, "learning_rate": 0.0004992459936953489, "loss": 5.691, "mean_token_accuracy": 0.1529371842741966, "num_tokens": 7502284.0, "step": 4325 }, { "entropy": 5.789745283126831, "epoch": 0.336899435907411, "grad_norm": 1.046875, "learning_rate": 0.0004992437248915032, "loss": 5.572, "mean_token_accuracy": 0.15930989682674407, "num_tokens": 7510728.0, "step": 4330 }, { "entropy": 5.705639839172363, "epoch": 0.3372884652791286, "grad_norm": 0.984375, "learning_rate": 0.0004992414526851157, "loss": 5.5308, "mean_token_accuracy": 0.1664871394634247, "num_tokens": 7519578.0, "step": 4335 }, { "entropy": 5.7081053256988525, "epoch": 0.3376774946508461, "grad_norm": 1.03125, "learning_rate": 0.0004992391770762212, "loss": 5.6538, "mean_token_accuracy": 0.15889098793268203, "num_tokens": 7528853.0, "step": 4340 }, { "entropy": 5.90105094909668, "epoch": 0.3380665240225637, "grad_norm": 1.046875, "learning_rate": 0.000499236898064854, "loss": 5.6981, "mean_token_accuracy": 0.156148099899292, "num_tokens": 7537000.0, "step": 4345 }, { "entropy": 5.771493673324585, "epoch": 0.3384555533942813, "grad_norm": 0.98828125, "learning_rate": 0.0004992346156510488, "loss": 5.6498, "mean_token_accuracy": 0.15839225202798843, "num_tokens": 7545439.0, "step": 4350 }, { "entropy": 5.763132333755493, "epoch": 0.3388445827659988, "grad_norm": 0.9609375, "learning_rate": 0.0004992323298348403, "loss": 5.5485, "mean_token_accuracy": 0.1569911375641823, "num_tokens": 7553808.0, "step": 4355 }, { "entropy": 5.793811559677124, "epoch": 0.3392336121377164, "grad_norm": 0.99609375, "learning_rate": 0.000499230040616263, "loss": 5.5838, "mean_token_accuracy": 0.16720182895660402, "num_tokens": 7562124.0, "step": 4360 }, { "entropy": 5.779132938385009, "epoch": 0.33962264150943394, "grad_norm": 0.93359375, "learning_rate": 0.0004992277479953518, "loss": 5.626, "mean_token_accuracy": 0.1591033309698105, "num_tokens": 7570692.0, "step": 4365 }, { "entropy": 5.69827675819397, "epoch": 0.34001167088115153, "grad_norm": 1.015625, "learning_rate": 0.0004992254519721414, "loss": 5.5254, "mean_token_accuracy": 0.1599597990512848, "num_tokens": 7579380.0, "step": 4370 }, { "entropy": 5.712707996368408, "epoch": 0.3404007002528691, "grad_norm": 1.0703125, "learning_rate": 0.0004992231525466666, "loss": 5.5748, "mean_token_accuracy": 0.15763231217861176, "num_tokens": 7587581.0, "step": 4375 }, { "entropy": 5.803431415557862, "epoch": 0.34078972962458665, "grad_norm": 0.9765625, "learning_rate": 0.0004992208497189624, "loss": 5.6207, "mean_token_accuracy": 0.15856635421514512, "num_tokens": 7596373.0, "step": 4380 }, { "entropy": 5.769613647460938, "epoch": 0.34117875899630423, "grad_norm": 0.9921875, "learning_rate": 0.0004992185434890637, "loss": 5.63, "mean_token_accuracy": 0.15952463150024415, "num_tokens": 7605698.0, "step": 4385 }, { "entropy": 5.831510257720947, "epoch": 0.34156778836802176, "grad_norm": 1.03125, "learning_rate": 0.0004992162338570055, "loss": 5.6701, "mean_token_accuracy": 0.15391338169574736, "num_tokens": 7614299.0, "step": 4390 }, { "entropy": 5.711894607543945, "epoch": 0.34195681773973935, "grad_norm": 1.015625, "learning_rate": 0.0004992139208228227, "loss": 5.5742, "mean_token_accuracy": 0.1665854424238205, "num_tokens": 7622244.0, "step": 4395 }, { "entropy": 5.799953508377075, "epoch": 0.34234584711145694, "grad_norm": 1.0234375, "learning_rate": 0.0004992116043865506, "loss": 5.6835, "mean_token_accuracy": 0.14930743724107742, "num_tokens": 7631421.0, "step": 4400 }, { "entropy": 5.780383348464966, "epoch": 0.34273487648317447, "grad_norm": 0.9765625, "learning_rate": 0.0004992092845482244, "loss": 5.617, "mean_token_accuracy": 0.1649213418364525, "num_tokens": 7640483.0, "step": 4405 }, { "entropy": 5.734336900711059, "epoch": 0.34312390585489205, "grad_norm": 0.97265625, "learning_rate": 0.0004992069613078791, "loss": 5.5434, "mean_token_accuracy": 0.16003944873809814, "num_tokens": 7648928.0, "step": 4410 }, { "entropy": 5.748956537246704, "epoch": 0.3435129352266096, "grad_norm": 0.99609375, "learning_rate": 0.0004992046346655499, "loss": 5.556, "mean_token_accuracy": 0.16345997750759125, "num_tokens": 7658158.0, "step": 4415 }, { "entropy": 5.79419469833374, "epoch": 0.34390196459832717, "grad_norm": 0.91796875, "learning_rate": 0.0004992023046212723, "loss": 5.6394, "mean_token_accuracy": 0.15967277586460113, "num_tokens": 7666657.0, "step": 4420 }, { "entropy": 5.756088972091675, "epoch": 0.34429099397004476, "grad_norm": 1.03125, "learning_rate": 0.0004991999711750816, "loss": 5.5864, "mean_token_accuracy": 0.1604827433824539, "num_tokens": 7675182.0, "step": 4425 }, { "entropy": 5.713095378875733, "epoch": 0.3446800233417623, "grad_norm": 0.984375, "learning_rate": 0.0004991976343270133, "loss": 5.537, "mean_token_accuracy": 0.16038379073143005, "num_tokens": 7684132.0, "step": 4430 }, { "entropy": 5.707273960113525, "epoch": 0.3450690527134799, "grad_norm": 0.9609375, "learning_rate": 0.0004991952940771026, "loss": 5.4828, "mean_token_accuracy": 0.16817560493946077, "num_tokens": 7692574.0, "step": 4435 }, { "entropy": 5.682709455490112, "epoch": 0.34545808208519746, "grad_norm": 0.98046875, "learning_rate": 0.0004991929504253852, "loss": 5.5448, "mean_token_accuracy": 0.1668045476078987, "num_tokens": 7700969.0, "step": 4440 }, { "entropy": 5.786290264129638, "epoch": 0.345847111456915, "grad_norm": 1.0390625, "learning_rate": 0.0004991906033718966, "loss": 5.6863, "mean_token_accuracy": 0.15646209716796874, "num_tokens": 7710688.0, "step": 4445 }, { "entropy": 5.8290328025817875, "epoch": 0.3462361408286326, "grad_norm": 1.0234375, "learning_rate": 0.0004991882529166724, "loss": 5.6461, "mean_token_accuracy": 0.1635972410440445, "num_tokens": 7720071.0, "step": 4450 }, { "entropy": 5.673279428482056, "epoch": 0.3466251702003501, "grad_norm": 0.96875, "learning_rate": 0.0004991858990597483, "loss": 5.4371, "mean_token_accuracy": 0.16662000864744186, "num_tokens": 7728418.0, "step": 4455 }, { "entropy": 5.733144617080688, "epoch": 0.3470141995720677, "grad_norm": 1.0625, "learning_rate": 0.0004991835418011601, "loss": 5.67, "mean_token_accuracy": 0.1602802112698555, "num_tokens": 7736849.0, "step": 4460 }, { "entropy": 5.787078762054444, "epoch": 0.3474032289437853, "grad_norm": 1.03125, "learning_rate": 0.0004991811811409434, "loss": 5.5981, "mean_token_accuracy": 0.1622970446944237, "num_tokens": 7745730.0, "step": 4465 }, { "entropy": 5.771909475326538, "epoch": 0.3477922583155028, "grad_norm": 1.0234375, "learning_rate": 0.0004991788170791341, "loss": 5.4965, "mean_token_accuracy": 0.16542282104492187, "num_tokens": 7755040.0, "step": 4470 }, { "entropy": 5.734687471389771, "epoch": 0.3481812876872204, "grad_norm": 0.96484375, "learning_rate": 0.0004991764496157682, "loss": 5.5207, "mean_token_accuracy": 0.16281888782978057, "num_tokens": 7763765.0, "step": 4475 }, { "entropy": 5.622528505325318, "epoch": 0.34857031705893793, "grad_norm": 0.9765625, "learning_rate": 0.0004991740787508814, "loss": 5.5206, "mean_token_accuracy": 0.16116178408265114, "num_tokens": 7772261.0, "step": 4480 }, { "entropy": 5.827115106582641, "epoch": 0.3489593464306555, "grad_norm": 1.0234375, "learning_rate": 0.0004991717044845097, "loss": 5.6628, "mean_token_accuracy": 0.15989381670951844, "num_tokens": 7781651.0, "step": 4485 }, { "entropy": 5.714611434936524, "epoch": 0.3493483758023731, "grad_norm": 1.0390625, "learning_rate": 0.0004991693268166892, "loss": 5.518, "mean_token_accuracy": 0.15781033784151077, "num_tokens": 7789926.0, "step": 4490 }, { "entropy": 5.715775346755981, "epoch": 0.34973740517409063, "grad_norm": 0.9609375, "learning_rate": 0.0004991669457474559, "loss": 5.5567, "mean_token_accuracy": 0.15968117415904998, "num_tokens": 7798435.0, "step": 4495 }, { "entropy": 5.662638235092163, "epoch": 0.3501264345458082, "grad_norm": 1.0078125, "learning_rate": 0.0004991645612768461, "loss": 5.4951, "mean_token_accuracy": 0.15639443546533585, "num_tokens": 7806674.0, "step": 4500 }, { "entropy": 5.754309892654419, "epoch": 0.35051546391752575, "grad_norm": 1.0078125, "learning_rate": 0.0004991621734048958, "loss": 5.5444, "mean_token_accuracy": 0.16342764496803283, "num_tokens": 7814774.0, "step": 4505 }, { "entropy": 5.704548788070679, "epoch": 0.35090449328924334, "grad_norm": 1.0, "learning_rate": 0.0004991597821316415, "loss": 5.5986, "mean_token_accuracy": 0.16580508202314376, "num_tokens": 7822879.0, "step": 4510 }, { "entropy": 5.696450519561767, "epoch": 0.3512935226609609, "grad_norm": 0.98046875, "learning_rate": 0.0004991573874571192, "loss": 5.5416, "mean_token_accuracy": 0.15570010393857955, "num_tokens": 7831418.0, "step": 4515 }, { "entropy": 5.7250312805175785, "epoch": 0.35168255203267845, "grad_norm": 1.1171875, "learning_rate": 0.0004991549893813653, "loss": 5.5079, "mean_token_accuracy": 0.15775506496429442, "num_tokens": 7839513.0, "step": 4520 }, { "entropy": 5.691388750076294, "epoch": 0.35207158140439604, "grad_norm": 1.0234375, "learning_rate": 0.0004991525879044162, "loss": 5.5324, "mean_token_accuracy": 0.16139761209487916, "num_tokens": 7847653.0, "step": 4525 }, { "entropy": 5.782090950012207, "epoch": 0.35246061077611357, "grad_norm": 1.03125, "learning_rate": 0.0004991501830263084, "loss": 5.6185, "mean_token_accuracy": 0.1575747847557068, "num_tokens": 7857093.0, "step": 4530 }, { "entropy": 5.737625694274902, "epoch": 0.35284964014783116, "grad_norm": 1.015625, "learning_rate": 0.0004991477747470783, "loss": 5.582, "mean_token_accuracy": 0.1566581904888153, "num_tokens": 7866129.0, "step": 4535 }, { "entropy": 5.70094780921936, "epoch": 0.35323866951954874, "grad_norm": 1.125, "learning_rate": 0.0004991453630667625, "loss": 5.6615, "mean_token_accuracy": 0.15456809997558593, "num_tokens": 7874613.0, "step": 4540 }, { "entropy": 5.6414001941680905, "epoch": 0.3536276988912663, "grad_norm": 1.0234375, "learning_rate": 0.0004991429479853976, "loss": 5.4164, "mean_token_accuracy": 0.16817961633205414, "num_tokens": 7882292.0, "step": 4545 }, { "entropy": 5.737434244155883, "epoch": 0.35401672826298386, "grad_norm": 1.046875, "learning_rate": 0.0004991405295030202, "loss": 5.4426, "mean_token_accuracy": 0.17088190019130706, "num_tokens": 7890810.0, "step": 4550 }, { "entropy": 5.730095767974854, "epoch": 0.35440575763470145, "grad_norm": 1.015625, "learning_rate": 0.0004991381076196671, "loss": 5.5862, "mean_token_accuracy": 0.15629213452339172, "num_tokens": 7899964.0, "step": 4555 }, { "entropy": 5.672501754760742, "epoch": 0.354794787006419, "grad_norm": 0.98828125, "learning_rate": 0.0004991356823353748, "loss": 5.4754, "mean_token_accuracy": 0.16402625739574433, "num_tokens": 7908600.0, "step": 4560 }, { "entropy": 5.677447080612183, "epoch": 0.35518381637813656, "grad_norm": 1.03125, "learning_rate": 0.0004991332536501804, "loss": 5.5912, "mean_token_accuracy": 0.15798643827438355, "num_tokens": 7916893.0, "step": 4565 }, { "entropy": 5.731996774673462, "epoch": 0.3555728457498541, "grad_norm": 0.92578125, "learning_rate": 0.0004991308215641205, "loss": 5.4517, "mean_token_accuracy": 0.1716650128364563, "num_tokens": 7925230.0, "step": 4570 }, { "entropy": 5.719581079483032, "epoch": 0.3559618751215717, "grad_norm": 1.0078125, "learning_rate": 0.0004991283860772323, "loss": 5.5052, "mean_token_accuracy": 0.16825538873672485, "num_tokens": 7933487.0, "step": 4575 }, { "entropy": 5.671692514419556, "epoch": 0.35635090449328927, "grad_norm": 1.0546875, "learning_rate": 0.0004991259471895525, "loss": 5.5453, "mean_token_accuracy": 0.16380455940961838, "num_tokens": 7941957.0, "step": 4580 }, { "entropy": 5.7017723560333256, "epoch": 0.3567399338650068, "grad_norm": 0.96484375, "learning_rate": 0.0004991235049011182, "loss": 5.4838, "mean_token_accuracy": 0.16157088428735733, "num_tokens": 7950912.0, "step": 4585 }, { "entropy": 5.68826847076416, "epoch": 0.3571289632367244, "grad_norm": 0.96484375, "learning_rate": 0.0004991210592119663, "loss": 5.5453, "mean_token_accuracy": 0.16106254905462264, "num_tokens": 7959724.0, "step": 4590 }, { "entropy": 5.739056968688965, "epoch": 0.3575179926084419, "grad_norm": 0.9609375, "learning_rate": 0.0004991186101221342, "loss": 5.5182, "mean_token_accuracy": 0.1671526774764061, "num_tokens": 7968683.0, "step": 4595 }, { "entropy": 5.694250869750976, "epoch": 0.3579070219801595, "grad_norm": 0.9765625, "learning_rate": 0.000499116157631659, "loss": 5.4915, "mean_token_accuracy": 0.1625325247645378, "num_tokens": 7977004.0, "step": 4600 }, { "entropy": 5.774178075790405, "epoch": 0.3582960513518771, "grad_norm": 1.0078125, "learning_rate": 0.0004991137017405777, "loss": 5.6947, "mean_token_accuracy": 0.1508305624127388, "num_tokens": 7985537.0, "step": 4605 }, { "entropy": 5.810094594955444, "epoch": 0.3586850807235946, "grad_norm": 1.03125, "learning_rate": 0.0004991112424489277, "loss": 5.5914, "mean_token_accuracy": 0.16004215627908708, "num_tokens": 7994298.0, "step": 4610 }, { "entropy": 5.675488615036011, "epoch": 0.3590741100953122, "grad_norm": 0.984375, "learning_rate": 0.0004991087797567462, "loss": 5.5485, "mean_token_accuracy": 0.16430403739213945, "num_tokens": 8003145.0, "step": 4615 }, { "entropy": 5.653676176071167, "epoch": 0.35946313946702974, "grad_norm": 1.015625, "learning_rate": 0.0004991063136640709, "loss": 5.5177, "mean_token_accuracy": 0.16057982444763183, "num_tokens": 8011839.0, "step": 4620 }, { "entropy": 5.8171083450317385, "epoch": 0.3598521688387473, "grad_norm": 1.0078125, "learning_rate": 0.0004991038441709388, "loss": 5.5952, "mean_token_accuracy": 0.15525781512260436, "num_tokens": 8020248.0, "step": 4625 }, { "entropy": 5.770076322555542, "epoch": 0.3602411982104649, "grad_norm": 0.9765625, "learning_rate": 0.0004991013712773877, "loss": 5.6226, "mean_token_accuracy": 0.1595271795988083, "num_tokens": 8029360.0, "step": 4630 }, { "entropy": 5.830290365219116, "epoch": 0.36063022758218244, "grad_norm": 1.0859375, "learning_rate": 0.0004990988949834549, "loss": 5.6756, "mean_token_accuracy": 0.15414261519908906, "num_tokens": 8037407.0, "step": 4635 }, { "entropy": 5.773358583450317, "epoch": 0.3610192569539, "grad_norm": 0.98046875, "learning_rate": 0.000499096415289178, "loss": 5.4892, "mean_token_accuracy": 0.1608835220336914, "num_tokens": 8045935.0, "step": 4640 }, { "entropy": 5.71015191078186, "epoch": 0.3614082863256176, "grad_norm": 1.0703125, "learning_rate": 0.0004990939321945948, "loss": 5.6419, "mean_token_accuracy": 0.14878360480070113, "num_tokens": 8054640.0, "step": 4645 }, { "entropy": 5.802717781066894, "epoch": 0.36179731569733514, "grad_norm": 0.984375, "learning_rate": 0.0004990914456997427, "loss": 5.6215, "mean_token_accuracy": 0.15971666425466538, "num_tokens": 8063845.0, "step": 4650 }, { "entropy": 5.790019845962524, "epoch": 0.36218634506905273, "grad_norm": 1.015625, "learning_rate": 0.0004990889558046598, "loss": 5.5653, "mean_token_accuracy": 0.15723626762628556, "num_tokens": 8072389.0, "step": 4655 }, { "entropy": 5.651761722564697, "epoch": 0.36257537444077026, "grad_norm": 0.98828125, "learning_rate": 0.0004990864625093836, "loss": 5.4354, "mean_token_accuracy": 0.1628458485007286, "num_tokens": 8080683.0, "step": 4660 }, { "entropy": 5.626598167419433, "epoch": 0.36296440381248785, "grad_norm": 1.0703125, "learning_rate": 0.0004990839658139519, "loss": 5.469, "mean_token_accuracy": 0.1658550351858139, "num_tokens": 8088945.0, "step": 4665 }, { "entropy": 5.662598133087158, "epoch": 0.36335343318420543, "grad_norm": 0.9765625, "learning_rate": 0.0004990814657184028, "loss": 5.528, "mean_token_accuracy": 0.16415927559137344, "num_tokens": 8097447.0, "step": 4670 }, { "entropy": 5.654489183425904, "epoch": 0.36374246255592296, "grad_norm": 1.046875, "learning_rate": 0.0004990789622227741, "loss": 5.3741, "mean_token_accuracy": 0.18078008890151978, "num_tokens": 8105570.0, "step": 4675 }, { "entropy": 5.64568943977356, "epoch": 0.36413149192764055, "grad_norm": 0.98828125, "learning_rate": 0.0004990764553271038, "loss": 5.5065, "mean_token_accuracy": 0.16293679773807526, "num_tokens": 8114842.0, "step": 4680 }, { "entropy": 5.6961933135986325, "epoch": 0.3645205212993581, "grad_norm": 0.984375, "learning_rate": 0.0004990739450314299, "loss": 5.4941, "mean_token_accuracy": 0.16237769424915313, "num_tokens": 8122960.0, "step": 4685 }, { "entropy": 5.800394201278687, "epoch": 0.36490955067107567, "grad_norm": 1.015625, "learning_rate": 0.0004990714313357906, "loss": 5.6298, "mean_token_accuracy": 0.16036661416292192, "num_tokens": 8131850.0, "step": 4690 }, { "entropy": 5.730320596694947, "epoch": 0.36529858004279325, "grad_norm": 1.09375, "learning_rate": 0.000499068914240224, "loss": 5.5025, "mean_token_accuracy": 0.16529248505830765, "num_tokens": 8139818.0, "step": 4695 }, { "entropy": 5.6371876239776615, "epoch": 0.3656876094145108, "grad_norm": 0.98828125, "learning_rate": 0.0004990663937447682, "loss": 5.5769, "mean_token_accuracy": 0.16349330991506578, "num_tokens": 8147995.0, "step": 4700 }, { "entropy": 5.758992433547974, "epoch": 0.36607663878622837, "grad_norm": 1.0390625, "learning_rate": 0.0004990638698494615, "loss": 5.5741, "mean_token_accuracy": 0.16156561821699142, "num_tokens": 8156879.0, "step": 4705 }, { "entropy": 5.740928316116333, "epoch": 0.3664656681579459, "grad_norm": 1.0625, "learning_rate": 0.0004990613425543423, "loss": 5.5433, "mean_token_accuracy": 0.150849449634552, "num_tokens": 8164860.0, "step": 4710 }, { "entropy": 5.624187231063843, "epoch": 0.3668546975296635, "grad_norm": 0.96875, "learning_rate": 0.0004990588118594487, "loss": 5.3721, "mean_token_accuracy": 0.17311475276947022, "num_tokens": 8173319.0, "step": 4715 }, { "entropy": 5.68842396736145, "epoch": 0.3672437269013811, "grad_norm": 1.0078125, "learning_rate": 0.0004990562777648194, "loss": 5.5738, "mean_token_accuracy": 0.16338748335838318, "num_tokens": 8182385.0, "step": 4720 }, { "entropy": 5.749617624282837, "epoch": 0.3676327562730986, "grad_norm": 1.078125, "learning_rate": 0.0004990537402704928, "loss": 5.494, "mean_token_accuracy": 0.16597676873207093, "num_tokens": 8190394.0, "step": 4725 }, { "entropy": 5.677096652984619, "epoch": 0.3680217856448162, "grad_norm": 1.109375, "learning_rate": 0.0004990511993765071, "loss": 5.5141, "mean_token_accuracy": 0.156700736284256, "num_tokens": 8198532.0, "step": 4730 }, { "entropy": 5.582213068008423, "epoch": 0.3684108150165337, "grad_norm": 0.9921875, "learning_rate": 0.0004990486550829011, "loss": 5.4755, "mean_token_accuracy": 0.16821785122156144, "num_tokens": 8207436.0, "step": 4735 }, { "entropy": 5.749109268188477, "epoch": 0.3687998443882513, "grad_norm": 0.8984375, "learning_rate": 0.0004990461073897134, "loss": 5.5093, "mean_token_accuracy": 0.16389241069555283, "num_tokens": 8216316.0, "step": 4740 }, { "entropy": 5.682870817184448, "epoch": 0.3691888737599689, "grad_norm": 0.984375, "learning_rate": 0.0004990435562969827, "loss": 5.4634, "mean_token_accuracy": 0.16937032341957092, "num_tokens": 8224918.0, "step": 4745 }, { "entropy": 5.652633953094482, "epoch": 0.3695779031316864, "grad_norm": 1.015625, "learning_rate": 0.0004990410018047475, "loss": 5.4855, "mean_token_accuracy": 0.16341211497783661, "num_tokens": 8233506.0, "step": 4750 }, { "entropy": 5.686648225784301, "epoch": 0.369966932503404, "grad_norm": 1.03125, "learning_rate": 0.0004990384439130467, "loss": 5.5371, "mean_token_accuracy": 0.16136658936738968, "num_tokens": 8243122.0, "step": 4755 }, { "entropy": 5.695843458175659, "epoch": 0.3703559618751216, "grad_norm": 0.98828125, "learning_rate": 0.0004990358826219192, "loss": 5.4954, "mean_token_accuracy": 0.16794812679290771, "num_tokens": 8251639.0, "step": 4760 }, { "entropy": 5.694685459136963, "epoch": 0.37074499124683913, "grad_norm": 1.0078125, "learning_rate": 0.0004990333179314038, "loss": 5.5441, "mean_token_accuracy": 0.1565728172659874, "num_tokens": 8260487.0, "step": 4765 }, { "entropy": 5.731024360656738, "epoch": 0.3711340206185567, "grad_norm": 0.99609375, "learning_rate": 0.0004990307498415393, "loss": 5.5353, "mean_token_accuracy": 0.16720337867736818, "num_tokens": 8270111.0, "step": 4770 }, { "entropy": 5.732585525512695, "epoch": 0.37152304999027425, "grad_norm": 1.015625, "learning_rate": 0.0004990281783523648, "loss": 5.6699, "mean_token_accuracy": 0.15745235085487366, "num_tokens": 8278171.0, "step": 4775 }, { "entropy": 5.728489589691162, "epoch": 0.37191207936199183, "grad_norm": 0.96484375, "learning_rate": 0.0004990256034639192, "loss": 5.5444, "mean_token_accuracy": 0.16361308097839355, "num_tokens": 8287278.0, "step": 4780 }, { "entropy": 5.801375198364258, "epoch": 0.3723011087337094, "grad_norm": 0.99609375, "learning_rate": 0.0004990230251762418, "loss": 5.6581, "mean_token_accuracy": 0.15506795942783355, "num_tokens": 8296874.0, "step": 4785 }, { "entropy": 5.677485656738281, "epoch": 0.37269013810542695, "grad_norm": 1.0859375, "learning_rate": 0.0004990204434893713, "loss": 5.5292, "mean_token_accuracy": 0.16247798800468444, "num_tokens": 8305375.0, "step": 4790 }, { "entropy": 5.805545330047607, "epoch": 0.37307916747714454, "grad_norm": 0.99609375, "learning_rate": 0.0004990178584033474, "loss": 5.5798, "mean_token_accuracy": 0.1593550831079483, "num_tokens": 8313960.0, "step": 4795 }, { "entropy": 5.732056093215943, "epoch": 0.37346819684886207, "grad_norm": 0.96875, "learning_rate": 0.0004990152699182089, "loss": 5.5091, "mean_token_accuracy": 0.1695062816143036, "num_tokens": 8321838.0, "step": 4800 }, { "entropy": 5.647253465652466, "epoch": 0.37385722622057965, "grad_norm": 0.94921875, "learning_rate": 0.0004990126780339953, "loss": 5.549, "mean_token_accuracy": 0.15523339807987213, "num_tokens": 8331325.0, "step": 4805 }, { "entropy": 5.7562426090240475, "epoch": 0.37424625559229724, "grad_norm": 0.9765625, "learning_rate": 0.0004990100827507459, "loss": 5.5963, "mean_token_accuracy": 0.1604474112391472, "num_tokens": 8340105.0, "step": 4810 }, { "entropy": 5.675045204162598, "epoch": 0.37463528496401477, "grad_norm": 0.94140625, "learning_rate": 0.0004990074840684999, "loss": 5.4176, "mean_token_accuracy": 0.17652603089809418, "num_tokens": 8348256.0, "step": 4815 }, { "entropy": 5.65481014251709, "epoch": 0.37502431433573236, "grad_norm": 0.9453125, "learning_rate": 0.0004990048819872969, "loss": 5.6006, "mean_token_accuracy": 0.15629589855670928, "num_tokens": 8357456.0, "step": 4820 }, { "entropy": 5.74207820892334, "epoch": 0.3754133437074499, "grad_norm": 0.95703125, "learning_rate": 0.0004990022765071765, "loss": 5.4483, "mean_token_accuracy": 0.16962354630231857, "num_tokens": 8366939.0, "step": 4825 }, { "entropy": 5.838831901550293, "epoch": 0.3758023730791675, "grad_norm": 1.0390625, "learning_rate": 0.000498999667628178, "loss": 5.6137, "mean_token_accuracy": 0.15240543484687805, "num_tokens": 8376062.0, "step": 4830 }, { "entropy": 5.771680784225464, "epoch": 0.37619140245088506, "grad_norm": 1.078125, "learning_rate": 0.0004989970553503411, "loss": 5.5276, "mean_token_accuracy": 0.16518781930208207, "num_tokens": 8383803.0, "step": 4835 }, { "entropy": 5.6745326042175295, "epoch": 0.3765804318226026, "grad_norm": 1.0234375, "learning_rate": 0.0004989944396737054, "loss": 5.6889, "mean_token_accuracy": 0.15957241952419282, "num_tokens": 8392844.0, "step": 4840 }, { "entropy": 5.768671894073487, "epoch": 0.3769694611943202, "grad_norm": 1.03125, "learning_rate": 0.0004989918205983106, "loss": 5.5881, "mean_token_accuracy": 0.1660487473011017, "num_tokens": 8401937.0, "step": 4845 }, { "entropy": 5.746508407592773, "epoch": 0.37735849056603776, "grad_norm": 1.1015625, "learning_rate": 0.0004989891981241964, "loss": 5.5918, "mean_token_accuracy": 0.15559911131858825, "num_tokens": 8410383.0, "step": 4850 }, { "entropy": 5.664513111114502, "epoch": 0.3777475199377553, "grad_norm": 0.94921875, "learning_rate": 0.0004989865722514027, "loss": 5.547, "mean_token_accuracy": 0.1587306007742882, "num_tokens": 8419053.0, "step": 4855 }, { "entropy": 5.702281188964844, "epoch": 0.3781365493094729, "grad_norm": 1.1015625, "learning_rate": 0.0004989839429799692, "loss": 5.5249, "mean_token_accuracy": 0.16742938309907912, "num_tokens": 8427311.0, "step": 4860 }, { "entropy": 5.715058994293213, "epoch": 0.3785255786811904, "grad_norm": 1.0390625, "learning_rate": 0.000498981310309936, "loss": 5.5741, "mean_token_accuracy": 0.15908973962068557, "num_tokens": 8436050.0, "step": 4865 }, { "entropy": 5.820055341720581, "epoch": 0.378914608052908, "grad_norm": 1.0234375, "learning_rate": 0.0004989786742413428, "loss": 5.5313, "mean_token_accuracy": 0.1646547108888626, "num_tokens": 8444579.0, "step": 4870 }, { "entropy": 5.689808559417725, "epoch": 0.3793036374246256, "grad_norm": 0.9921875, "learning_rate": 0.0004989760347742298, "loss": 5.5276, "mean_token_accuracy": 0.1638904482126236, "num_tokens": 8454013.0, "step": 4875 }, { "entropy": 5.724506807327271, "epoch": 0.3796926667963431, "grad_norm": 0.95703125, "learning_rate": 0.0004989733919086369, "loss": 5.6429, "mean_token_accuracy": 0.15735770165920257, "num_tokens": 8462564.0, "step": 4880 }, { "entropy": 5.7334497451782225, "epoch": 0.3800816961680607, "grad_norm": 0.9609375, "learning_rate": 0.0004989707456446043, "loss": 5.4841, "mean_token_accuracy": 0.16679838299751282, "num_tokens": 8471035.0, "step": 4885 }, { "entropy": 5.680740404129028, "epoch": 0.38047072553977823, "grad_norm": 1.0625, "learning_rate": 0.0004989680959821721, "loss": 5.4693, "mean_token_accuracy": 0.16390866339206694, "num_tokens": 8479475.0, "step": 4890 }, { "entropy": 5.623473501205444, "epoch": 0.3808597549114958, "grad_norm": 0.984375, "learning_rate": 0.0004989654429213805, "loss": 5.5591, "mean_token_accuracy": 0.1630413204431534, "num_tokens": 8488163.0, "step": 4895 }, { "entropy": 5.821042728424072, "epoch": 0.3812487842832134, "grad_norm": 0.94140625, "learning_rate": 0.0004989627864622699, "loss": 5.5995, "mean_token_accuracy": 0.15810228884220123, "num_tokens": 8497735.0, "step": 4900 }, { "entropy": 5.743423938751221, "epoch": 0.38163781365493094, "grad_norm": 0.94921875, "learning_rate": 0.0004989601266048804, "loss": 5.5459, "mean_token_accuracy": 0.16006243228912354, "num_tokens": 8506986.0, "step": 4905 }, { "entropy": 5.6776947498321535, "epoch": 0.3820268430266485, "grad_norm": 0.9765625, "learning_rate": 0.0004989574633492525, "loss": 5.5709, "mean_token_accuracy": 0.16254400610923767, "num_tokens": 8515168.0, "step": 4910 }, { "entropy": 5.690753602981568, "epoch": 0.38241587239836605, "grad_norm": 0.9765625, "learning_rate": 0.0004989547966954266, "loss": 5.5509, "mean_token_accuracy": 0.16618261039257048, "num_tokens": 8523980.0, "step": 4915 }, { "entropy": 5.658663177490235, "epoch": 0.38280490177008364, "grad_norm": 1.03125, "learning_rate": 0.000498952126643443, "loss": 5.5032, "mean_token_accuracy": 0.16129754930734636, "num_tokens": 8532938.0, "step": 4920 }, { "entropy": 5.67104868888855, "epoch": 0.3831939311418012, "grad_norm": 0.9453125, "learning_rate": 0.0004989494531933424, "loss": 5.4671, "mean_token_accuracy": 0.16780146807432175, "num_tokens": 8541951.0, "step": 4925 }, { "entropy": 5.74264087677002, "epoch": 0.38358296051351876, "grad_norm": 1.03125, "learning_rate": 0.0004989467763451652, "loss": 5.6436, "mean_token_accuracy": 0.15836040526628495, "num_tokens": 8550981.0, "step": 4930 }, { "entropy": 5.670666360855103, "epoch": 0.38397198988523634, "grad_norm": 1.015625, "learning_rate": 0.0004989440960989523, "loss": 5.5569, "mean_token_accuracy": 0.15649997144937516, "num_tokens": 8559711.0, "step": 4935 }, { "entropy": 5.681796836853027, "epoch": 0.3843610192569539, "grad_norm": 1.046875, "learning_rate": 0.000498941412454744, "loss": 5.4853, "mean_token_accuracy": 0.15973234325647354, "num_tokens": 8567797.0, "step": 4940 }, { "entropy": 5.7254406929016115, "epoch": 0.38475004862867146, "grad_norm": 0.98828125, "learning_rate": 0.0004989387254125813, "loss": 5.5791, "mean_token_accuracy": 0.15818444043397903, "num_tokens": 8576719.0, "step": 4945 }, { "entropy": 5.737820959091186, "epoch": 0.38513907800038905, "grad_norm": 0.99609375, "learning_rate": 0.0004989360349725049, "loss": 5.5682, "mean_token_accuracy": 0.1667224258184433, "num_tokens": 8585871.0, "step": 4950 }, { "entropy": 5.708989763259888, "epoch": 0.3855281073721066, "grad_norm": 1.0546875, "learning_rate": 0.0004989333411345555, "loss": 5.4759, "mean_token_accuracy": 0.16250301152467728, "num_tokens": 8594018.0, "step": 4955 }, { "entropy": 5.680680894851685, "epoch": 0.38591713674382416, "grad_norm": 0.99609375, "learning_rate": 0.0004989306438987742, "loss": 5.5976, "mean_token_accuracy": 0.15720874518156053, "num_tokens": 8602788.0, "step": 4960 }, { "entropy": 5.760657072067261, "epoch": 0.38630616611554175, "grad_norm": 0.921875, "learning_rate": 0.0004989279432652018, "loss": 5.5509, "mean_token_accuracy": 0.16338287740945817, "num_tokens": 8611837.0, "step": 4965 }, { "entropy": 5.704029893875122, "epoch": 0.3866951954872593, "grad_norm": 1.0703125, "learning_rate": 0.0004989252392338791, "loss": 5.5267, "mean_token_accuracy": 0.16973906457424165, "num_tokens": 8620114.0, "step": 4970 }, { "entropy": 5.8096014022827145, "epoch": 0.38708422485897687, "grad_norm": 1.1640625, "learning_rate": 0.0004989225318048475, "loss": 5.6419, "mean_token_accuracy": 0.15283987894654275, "num_tokens": 8628777.0, "step": 4975 }, { "entropy": 5.7505690574646, "epoch": 0.3874732542306944, "grad_norm": 0.984375, "learning_rate": 0.0004989198209781478, "loss": 5.5492, "mean_token_accuracy": 0.15922651141881944, "num_tokens": 8637088.0, "step": 4980 }, { "entropy": 5.732375717163086, "epoch": 0.387862283602412, "grad_norm": 1.09375, "learning_rate": 0.0004989171067538211, "loss": 5.5598, "mean_token_accuracy": 0.16299061924219133, "num_tokens": 8645261.0, "step": 4985 }, { "entropy": 5.73756160736084, "epoch": 0.38825131297412957, "grad_norm": 1.0078125, "learning_rate": 0.000498914389131909, "loss": 5.5689, "mean_token_accuracy": 0.16376165598630904, "num_tokens": 8653492.0, "step": 4990 }, { "entropy": 5.660993385314941, "epoch": 0.3886403423458471, "grad_norm": 1.03125, "learning_rate": 0.0004989116681124523, "loss": 5.5167, "mean_token_accuracy": 0.16651235818862914, "num_tokens": 8661909.0, "step": 4995 }, { "entropy": 5.676572227478028, "epoch": 0.3890293717175647, "grad_norm": 1.03125, "learning_rate": 0.0004989089436954924, "loss": 5.4822, "mean_token_accuracy": 0.16759965121746062, "num_tokens": 8670332.0, "step": 5000 }, { "entropy": 5.762911462783814, "epoch": 0.3894184010892822, "grad_norm": 0.9765625, "learning_rate": 0.0004989062158810706, "loss": 5.5234, "mean_token_accuracy": 0.1680043324828148, "num_tokens": 8678537.0, "step": 5005 }, { "entropy": 5.692707681655884, "epoch": 0.3898074304609998, "grad_norm": 1.03125, "learning_rate": 0.0004989034846692284, "loss": 5.4863, "mean_token_accuracy": 0.1656753972172737, "num_tokens": 8686839.0, "step": 5010 }, { "entropy": 5.6931657791137695, "epoch": 0.3901964598327174, "grad_norm": 1.0625, "learning_rate": 0.0004989007500600073, "loss": 5.5426, "mean_token_accuracy": 0.16253531575202942, "num_tokens": 8694407.0, "step": 5015 }, { "entropy": 5.662943887710571, "epoch": 0.3905854892044349, "grad_norm": 1.0625, "learning_rate": 0.0004988980120534486, "loss": 5.4984, "mean_token_accuracy": 0.1695681780576706, "num_tokens": 8703484.0, "step": 5020 }, { "entropy": 5.807813596725464, "epoch": 0.3909745185761525, "grad_norm": 0.99609375, "learning_rate": 0.000498895270649594, "loss": 5.6039, "mean_token_accuracy": 0.1552526980638504, "num_tokens": 8712634.0, "step": 5025 }, { "entropy": 5.683317804336548, "epoch": 0.39136354794787004, "grad_norm": 0.94921875, "learning_rate": 0.000498892525848485, "loss": 5.487, "mean_token_accuracy": 0.1599026545882225, "num_tokens": 8721229.0, "step": 5030 }, { "entropy": 5.661917400360108, "epoch": 0.3917525773195876, "grad_norm": 0.97265625, "learning_rate": 0.0004988897776501633, "loss": 5.541, "mean_token_accuracy": 0.16514813005924225, "num_tokens": 8730010.0, "step": 5035 }, { "entropy": 5.674532079696656, "epoch": 0.3921416066913052, "grad_norm": 0.9765625, "learning_rate": 0.0004988870260546705, "loss": 5.5342, "mean_token_accuracy": 0.1578855812549591, "num_tokens": 8739046.0, "step": 5040 }, { "entropy": 5.742646265029907, "epoch": 0.39253063606302274, "grad_norm": 0.9921875, "learning_rate": 0.0004988842710620486, "loss": 5.6198, "mean_token_accuracy": 0.16325782537460326, "num_tokens": 8747650.0, "step": 5045 }, { "entropy": 5.667177534103393, "epoch": 0.39291966543474033, "grad_norm": 0.984375, "learning_rate": 0.0004988815126723391, "loss": 5.5398, "mean_token_accuracy": 0.16407661586999894, "num_tokens": 8756319.0, "step": 5050 }, { "entropy": 5.6189886093139645, "epoch": 0.3933086948064579, "grad_norm": 0.96875, "learning_rate": 0.0004988787508855841, "loss": 5.554, "mean_token_accuracy": 0.16317882537841796, "num_tokens": 8765448.0, "step": 5055 }, { "entropy": 5.711760187149048, "epoch": 0.39369772417817545, "grad_norm": 0.98046875, "learning_rate": 0.0004988759857018253, "loss": 5.5024, "mean_token_accuracy": 0.15837739109992982, "num_tokens": 8774146.0, "step": 5060 }, { "entropy": 5.642172765731812, "epoch": 0.39408675354989303, "grad_norm": 1.0, "learning_rate": 0.0004988732171211048, "loss": 5.3808, "mean_token_accuracy": 0.16725590229034423, "num_tokens": 8782311.0, "step": 5065 }, { "entropy": 5.620117568969727, "epoch": 0.39447578292161056, "grad_norm": 1.09375, "learning_rate": 0.0004988704451434644, "loss": 5.4233, "mean_token_accuracy": 0.167247074842453, "num_tokens": 8790196.0, "step": 5070 }, { "entropy": 5.670018005371094, "epoch": 0.39486481229332815, "grad_norm": 1.0390625, "learning_rate": 0.0004988676697689465, "loss": 5.5098, "mean_token_accuracy": 0.1597319647669792, "num_tokens": 8798836.0, "step": 5075 }, { "entropy": 5.671954202651977, "epoch": 0.39525384166504574, "grad_norm": 1.0625, "learning_rate": 0.000498864890997593, "loss": 5.5441, "mean_token_accuracy": 0.16164022088050842, "num_tokens": 8806942.0, "step": 5080 }, { "entropy": 5.761148405075073, "epoch": 0.39564287103676327, "grad_norm": 1.0546875, "learning_rate": 0.0004988621088294461, "loss": 5.7312, "mean_token_accuracy": 0.15544241815805435, "num_tokens": 8816354.0, "step": 5085 }, { "entropy": 5.7759716510772705, "epoch": 0.39603190040848085, "grad_norm": 0.9921875, "learning_rate": 0.000498859323264548, "loss": 5.4963, "mean_token_accuracy": 0.1662037640810013, "num_tokens": 8824802.0, "step": 5090 }, { "entropy": 5.677498435974121, "epoch": 0.3964209297801984, "grad_norm": 1.0, "learning_rate": 0.000498856534302941, "loss": 5.4777, "mean_token_accuracy": 0.1677809789776802, "num_tokens": 8833348.0, "step": 5095 }, { "entropy": 5.632452917098999, "epoch": 0.39680995915191597, "grad_norm": 1.0078125, "learning_rate": 0.0004988537419446673, "loss": 5.4872, "mean_token_accuracy": 0.16559952795505523, "num_tokens": 8841131.0, "step": 5100 }, { "entropy": 5.647958040237427, "epoch": 0.39719898852363356, "grad_norm": 1.0, "learning_rate": 0.0004988509461897694, "loss": 5.4972, "mean_token_accuracy": 0.16812338382005693, "num_tokens": 8849768.0, "step": 5105 }, { "entropy": 5.73589940071106, "epoch": 0.3975880178953511, "grad_norm": 1.046875, "learning_rate": 0.0004988481470382897, "loss": 5.466, "mean_token_accuracy": 0.17053375840187074, "num_tokens": 8858170.0, "step": 5110 }, { "entropy": 5.652495384216309, "epoch": 0.3979770472670687, "grad_norm": 1.0234375, "learning_rate": 0.0004988453444902708, "loss": 5.4898, "mean_token_accuracy": 0.16427329331636428, "num_tokens": 8866720.0, "step": 5115 }, { "entropy": 5.744022846221924, "epoch": 0.3983660766387862, "grad_norm": 1.046875, "learning_rate": 0.0004988425385457549, "loss": 5.5027, "mean_token_accuracy": 0.1700969159603119, "num_tokens": 8875141.0, "step": 5120 }, { "entropy": 5.721825456619262, "epoch": 0.3987551060105038, "grad_norm": 1.0703125, "learning_rate": 0.0004988397292047848, "loss": 5.5215, "mean_token_accuracy": 0.17009811848402023, "num_tokens": 8884512.0, "step": 5125 }, { "entropy": 5.744118022918701, "epoch": 0.3991441353822214, "grad_norm": 1.0, "learning_rate": 0.0004988369164674032, "loss": 5.5924, "mean_token_accuracy": 0.1634611889719963, "num_tokens": 8893487.0, "step": 5130 }, { "entropy": 5.661117696762085, "epoch": 0.3995331647539389, "grad_norm": 0.96484375, "learning_rate": 0.0004988341003336526, "loss": 5.5359, "mean_token_accuracy": 0.1611662432551384, "num_tokens": 8902909.0, "step": 5135 }, { "entropy": 5.72418098449707, "epoch": 0.3999221941256565, "grad_norm": 0.953125, "learning_rate": 0.0004988312808035757, "loss": 5.4443, "mean_token_accuracy": 0.1671905130147934, "num_tokens": 8911311.0, "step": 5140 }, { "entropy": 5.624884366989136, "epoch": 0.400311223497374, "grad_norm": 0.9609375, "learning_rate": 0.0004988284578772155, "loss": 5.4728, "mean_token_accuracy": 0.1723196566104889, "num_tokens": 8920222.0, "step": 5145 }, { "entropy": 5.642570638656617, "epoch": 0.4007002528690916, "grad_norm": 1.0234375, "learning_rate": 0.0004988256315546146, "loss": 5.5248, "mean_token_accuracy": 0.16120615154504775, "num_tokens": 8928763.0, "step": 5150 }, { "entropy": 5.795141744613647, "epoch": 0.4010892822408092, "grad_norm": 0.93359375, "learning_rate": 0.0004988228018358161, "loss": 5.5824, "mean_token_accuracy": 0.16073987632989883, "num_tokens": 8937832.0, "step": 5155 }, { "entropy": 5.649924993515015, "epoch": 0.40147831161252673, "grad_norm": 1.0859375, "learning_rate": 0.0004988199687208628, "loss": 5.4415, "mean_token_accuracy": 0.1690294101834297, "num_tokens": 8945662.0, "step": 5160 }, { "entropy": 5.631535243988037, "epoch": 0.4018673409842443, "grad_norm": 0.9453125, "learning_rate": 0.0004988171322097977, "loss": 5.5209, "mean_token_accuracy": 0.16340990066528321, "num_tokens": 8954570.0, "step": 5165 }, { "entropy": 5.723238515853882, "epoch": 0.4022563703559619, "grad_norm": 1.0078125, "learning_rate": 0.0004988142923026638, "loss": 5.5174, "mean_token_accuracy": 0.16258451640605925, "num_tokens": 8962827.0, "step": 5170 }, { "entropy": 5.70035228729248, "epoch": 0.40264539972767943, "grad_norm": 0.94921875, "learning_rate": 0.0004988114489995044, "loss": 5.5363, "mean_token_accuracy": 0.16639768928289414, "num_tokens": 8972119.0, "step": 5175 }, { "entropy": 5.6737593650817875, "epoch": 0.403034429099397, "grad_norm": 1.015625, "learning_rate": 0.0004988086023003624, "loss": 5.4556, "mean_token_accuracy": 0.16658223271369935, "num_tokens": 8980498.0, "step": 5180 }, { "entropy": 5.702155590057373, "epoch": 0.40342345847111455, "grad_norm": 0.98046875, "learning_rate": 0.0004988057522052811, "loss": 5.6045, "mean_token_accuracy": 0.16114473044872285, "num_tokens": 8989819.0, "step": 5185 }, { "entropy": 5.76625337600708, "epoch": 0.40381248784283214, "grad_norm": 0.96484375, "learning_rate": 0.0004988028987143037, "loss": 5.6453, "mean_token_accuracy": 0.15599432587623596, "num_tokens": 8998884.0, "step": 5190 }, { "entropy": 5.686150741577149, "epoch": 0.4042015172145497, "grad_norm": 0.88671875, "learning_rate": 0.0004988000418274736, "loss": 5.5014, "mean_token_accuracy": 0.1671816885471344, "num_tokens": 9007806.0, "step": 5195 }, { "entropy": 5.734596157073975, "epoch": 0.40459054658626725, "grad_norm": 1.015625, "learning_rate": 0.0004987971815448341, "loss": 5.6647, "mean_token_accuracy": 0.15147211849689485, "num_tokens": 9016541.0, "step": 5200 }, { "entropy": 5.6630021095275875, "epoch": 0.40497957595798484, "grad_norm": 1.015625, "learning_rate": 0.0004987943178664285, "loss": 5.429, "mean_token_accuracy": 0.16656740009784698, "num_tokens": 9024503.0, "step": 5205 }, { "entropy": 5.718490028381348, "epoch": 0.40536860532970237, "grad_norm": 1.03125, "learning_rate": 0.0004987914507923004, "loss": 5.5085, "mean_token_accuracy": 0.16654182076454163, "num_tokens": 9033182.0, "step": 5210 }, { "entropy": 5.655713081359863, "epoch": 0.40575763470141996, "grad_norm": 0.96484375, "learning_rate": 0.0004987885803224931, "loss": 5.5342, "mean_token_accuracy": 0.1643572121858597, "num_tokens": 9042281.0, "step": 5215 }, { "entropy": 5.745838260650634, "epoch": 0.40614666407313754, "grad_norm": 1.0546875, "learning_rate": 0.0004987857064570505, "loss": 5.447, "mean_token_accuracy": 0.1690574824810028, "num_tokens": 9050570.0, "step": 5220 }, { "entropy": 5.760504627227784, "epoch": 0.4065356934448551, "grad_norm": 1.015625, "learning_rate": 0.0004987828291960158, "loss": 5.6251, "mean_token_accuracy": 0.1569422021508217, "num_tokens": 9059782.0, "step": 5225 }, { "entropy": 5.624711227416992, "epoch": 0.40692472281657266, "grad_norm": 1.0390625, "learning_rate": 0.000498779948539433, "loss": 5.3755, "mean_token_accuracy": 0.1710534617304802, "num_tokens": 9067484.0, "step": 5230 }, { "entropy": 5.667460870742798, "epoch": 0.4073137521882902, "grad_norm": 0.96484375, "learning_rate": 0.0004987770644873455, "loss": 5.5824, "mean_token_accuracy": 0.15947526395320893, "num_tokens": 9075740.0, "step": 5235 }, { "entropy": 5.768729782104492, "epoch": 0.4077027815600078, "grad_norm": 1.0390625, "learning_rate": 0.0004987741770397974, "loss": 5.6286, "mean_token_accuracy": 0.15769142508506775, "num_tokens": 9084137.0, "step": 5240 }, { "entropy": 5.665251207351685, "epoch": 0.40809181093172536, "grad_norm": 0.96484375, "learning_rate": 0.0004987712861968323, "loss": 5.4091, "mean_token_accuracy": 0.17634232938289643, "num_tokens": 9093245.0, "step": 5245 }, { "entropy": 5.578675079345703, "epoch": 0.4084808403034429, "grad_norm": 1.0, "learning_rate": 0.000498768391958494, "loss": 5.4075, "mean_token_accuracy": 0.16961877197027206, "num_tokens": 9102837.0, "step": 5250 }, { "entropy": 5.6759144306182865, "epoch": 0.4088698696751605, "grad_norm": 0.953125, "learning_rate": 0.0004987654943248266, "loss": 5.4679, "mean_token_accuracy": 0.16916224360466003, "num_tokens": 9111087.0, "step": 5255 }, { "entropy": 5.666718244552612, "epoch": 0.40925889904687807, "grad_norm": 1.0390625, "learning_rate": 0.0004987625932958739, "loss": 5.4955, "mean_token_accuracy": 0.17213426232337953, "num_tokens": 9120506.0, "step": 5260 }, { "entropy": 5.754262399673462, "epoch": 0.4096479284185956, "grad_norm": 0.9609375, "learning_rate": 0.0004987596888716801, "loss": 5.6924, "mean_token_accuracy": 0.15665965899825096, "num_tokens": 9129637.0, "step": 5265 }, { "entropy": 5.753048419952393, "epoch": 0.4100369577903132, "grad_norm": 1.0078125, "learning_rate": 0.0004987567810522892, "loss": 5.4725, "mean_token_accuracy": 0.16619387418031692, "num_tokens": 9139338.0, "step": 5270 }, { "entropy": 5.6472631931304935, "epoch": 0.4104259871620307, "grad_norm": 1.015625, "learning_rate": 0.0004987538698377451, "loss": 5.5164, "mean_token_accuracy": 0.16488752961158754, "num_tokens": 9148034.0, "step": 5275 }, { "entropy": 5.662676572799683, "epoch": 0.4108150165337483, "grad_norm": 0.95703125, "learning_rate": 0.0004987509552280924, "loss": 5.4633, "mean_token_accuracy": 0.16608307063579558, "num_tokens": 9156744.0, "step": 5280 }, { "entropy": 5.606441593170166, "epoch": 0.4112040459054659, "grad_norm": 1.03125, "learning_rate": 0.000498748037223375, "loss": 5.4493, "mean_token_accuracy": 0.1717175617814064, "num_tokens": 9165174.0, "step": 5285 }, { "entropy": 5.640111970901489, "epoch": 0.4115930752771834, "grad_norm": 1.0, "learning_rate": 0.0004987451158236372, "loss": 5.451, "mean_token_accuracy": 0.17056777477264404, "num_tokens": 9173945.0, "step": 5290 }, { "entropy": 5.71455397605896, "epoch": 0.411982104648901, "grad_norm": 1.015625, "learning_rate": 0.0004987421910289234, "loss": 5.4518, "mean_token_accuracy": 0.16707825809717178, "num_tokens": 9182728.0, "step": 5295 }, { "entropy": 5.591234254837036, "epoch": 0.41237113402061853, "grad_norm": 0.98046875, "learning_rate": 0.0004987392628392781, "loss": 5.4896, "mean_token_accuracy": 0.1636035606265068, "num_tokens": 9191494.0, "step": 5300 }, { "entropy": 5.655320119857788, "epoch": 0.4127601633923361, "grad_norm": 1.0390625, "learning_rate": 0.0004987363312547456, "loss": 5.5143, "mean_token_accuracy": 0.16841454058885574, "num_tokens": 9199190.0, "step": 5305 }, { "entropy": 5.651890897750855, "epoch": 0.4131491927640537, "grad_norm": 1.0234375, "learning_rate": 0.0004987333962753703, "loss": 5.4463, "mean_token_accuracy": 0.16756607592105865, "num_tokens": 9208066.0, "step": 5310 }, { "entropy": 5.643588495254517, "epoch": 0.41353822213577124, "grad_norm": 0.99609375, "learning_rate": 0.0004987304579011967, "loss": 5.4525, "mean_token_accuracy": 0.1683342546224594, "num_tokens": 9217103.0, "step": 5315 }, { "entropy": 5.648463869094849, "epoch": 0.4139272515074888, "grad_norm": 1.1015625, "learning_rate": 0.0004987275161322697, "loss": 5.4995, "mean_token_accuracy": 0.16448337435722352, "num_tokens": 9225786.0, "step": 5320 }, { "entropy": 5.739774513244629, "epoch": 0.41431628087920636, "grad_norm": 1.0703125, "learning_rate": 0.0004987245709686337, "loss": 5.5035, "mean_token_accuracy": 0.171517077088356, "num_tokens": 9234182.0, "step": 5325 }, { "entropy": 5.693743753433227, "epoch": 0.41470531025092394, "grad_norm": 1.03125, "learning_rate": 0.0004987216224103334, "loss": 5.4811, "mean_token_accuracy": 0.1606791913509369, "num_tokens": 9243844.0, "step": 5330 }, { "entropy": 5.649951553344726, "epoch": 0.41509433962264153, "grad_norm": 0.94921875, "learning_rate": 0.0004987186704574136, "loss": 5.4631, "mean_token_accuracy": 0.17001460939645768, "num_tokens": 9252901.0, "step": 5335 }, { "entropy": 5.588115978240967, "epoch": 0.41548336899435906, "grad_norm": 0.9140625, "learning_rate": 0.0004987157151099189, "loss": 5.4564, "mean_token_accuracy": 0.16492853313684464, "num_tokens": 9260947.0, "step": 5340 }, { "entropy": 5.7257404804229735, "epoch": 0.41587239836607665, "grad_norm": 1.0078125, "learning_rate": 0.0004987127563678945, "loss": 5.5146, "mean_token_accuracy": 0.1641767904162407, "num_tokens": 9269249.0, "step": 5345 }, { "entropy": 5.650511598587036, "epoch": 0.4162614277377942, "grad_norm": 1.015625, "learning_rate": 0.0004987097942313852, "loss": 5.5138, "mean_token_accuracy": 0.16471074074506759, "num_tokens": 9277668.0, "step": 5350 }, { "entropy": 5.667751789093018, "epoch": 0.41665045710951176, "grad_norm": 1.0703125, "learning_rate": 0.0004987068287004355, "loss": 5.5103, "mean_token_accuracy": 0.15986161753535272, "num_tokens": 9286000.0, "step": 5355 }, { "entropy": 5.684542274475097, "epoch": 0.41703948648122935, "grad_norm": 0.96875, "learning_rate": 0.0004987038597750909, "loss": 5.5558, "mean_token_accuracy": 0.15900709629058837, "num_tokens": 9295090.0, "step": 5360 }, { "entropy": 5.656639814376831, "epoch": 0.4174285158529469, "grad_norm": 1.0, "learning_rate": 0.0004987008874553964, "loss": 5.4706, "mean_token_accuracy": 0.16817761659622193, "num_tokens": 9302996.0, "step": 5365 }, { "entropy": 5.613350296020508, "epoch": 0.41781754522466447, "grad_norm": 1.0625, "learning_rate": 0.0004986979117413969, "loss": 5.3777, "mean_token_accuracy": 0.17125458717346193, "num_tokens": 9311636.0, "step": 5370 }, { "entropy": 5.645034265518189, "epoch": 0.41820657459638205, "grad_norm": 1.03125, "learning_rate": 0.0004986949326331376, "loss": 5.4855, "mean_token_accuracy": 0.16353526413440705, "num_tokens": 9319884.0, "step": 5375 }, { "entropy": 5.59897813796997, "epoch": 0.4185956039680996, "grad_norm": 1.0078125, "learning_rate": 0.0004986919501306638, "loss": 5.4166, "mean_token_accuracy": 0.16931099370121955, "num_tokens": 9328273.0, "step": 5380 }, { "entropy": 5.65986647605896, "epoch": 0.41898463333981717, "grad_norm": 1.046875, "learning_rate": 0.0004986889642340207, "loss": 5.5473, "mean_token_accuracy": 0.1573350176215172, "num_tokens": 9337696.0, "step": 5385 }, { "entropy": 5.6967016696929935, "epoch": 0.4193736627115347, "grad_norm": 0.92578125, "learning_rate": 0.0004986859749432536, "loss": 5.5193, "mean_token_accuracy": 0.16329908072948457, "num_tokens": 9346596.0, "step": 5390 }, { "entropy": 5.662880325317383, "epoch": 0.4197626920832523, "grad_norm": 0.9921875, "learning_rate": 0.0004986829822584078, "loss": 5.4472, "mean_token_accuracy": 0.16471709311008453, "num_tokens": 9355480.0, "step": 5395 }, { "entropy": 5.650768995285034, "epoch": 0.4201517214549699, "grad_norm": 0.94140625, "learning_rate": 0.0004986799861795289, "loss": 5.5032, "mean_token_accuracy": 0.166390161216259, "num_tokens": 9364422.0, "step": 5400 }, { "entropy": 5.634923124313355, "epoch": 0.4205407508266874, "grad_norm": 1.078125, "learning_rate": 0.0004986769867066622, "loss": 5.3819, "mean_token_accuracy": 0.16537950336933135, "num_tokens": 9372311.0, "step": 5405 }, { "entropy": 5.655995321273804, "epoch": 0.420929780198405, "grad_norm": 1.0546875, "learning_rate": 0.0004986739838398532, "loss": 5.5105, "mean_token_accuracy": 0.16196997761726378, "num_tokens": 9380936.0, "step": 5410 }, { "entropy": 5.6495442390441895, "epoch": 0.4213188095701225, "grad_norm": 0.9140625, "learning_rate": 0.0004986709775791475, "loss": 5.4565, "mean_token_accuracy": 0.16568768620491028, "num_tokens": 9390008.0, "step": 5415 }, { "entropy": 5.68368182182312, "epoch": 0.4217078389418401, "grad_norm": 1.03125, "learning_rate": 0.0004986679679245907, "loss": 5.539, "mean_token_accuracy": 0.16439356058835983, "num_tokens": 9398771.0, "step": 5420 }, { "entropy": 5.65579195022583, "epoch": 0.4220968683135577, "grad_norm": 0.96484375, "learning_rate": 0.0004986649548762286, "loss": 5.5314, "mean_token_accuracy": 0.16600719690322877, "num_tokens": 9407105.0, "step": 5425 }, { "entropy": 5.6679205894470215, "epoch": 0.4224858976852752, "grad_norm": 0.9609375, "learning_rate": 0.0004986619384341066, "loss": 5.5147, "mean_token_accuracy": 0.1649916112422943, "num_tokens": 9415737.0, "step": 5430 }, { "entropy": 5.6381096839904785, "epoch": 0.4228749270569928, "grad_norm": 1.015625, "learning_rate": 0.0004986589185982708, "loss": 5.4651, "mean_token_accuracy": 0.16958317011594773, "num_tokens": 9424661.0, "step": 5435 }, { "entropy": 5.731217908859253, "epoch": 0.42326395642871034, "grad_norm": 1.0234375, "learning_rate": 0.0004986558953687671, "loss": 5.535, "mean_token_accuracy": 0.1611144796013832, "num_tokens": 9433971.0, "step": 5440 }, { "entropy": 5.628467655181884, "epoch": 0.42365298580042793, "grad_norm": 1.0078125, "learning_rate": 0.0004986528687456409, "loss": 5.4786, "mean_token_accuracy": 0.16527963280677796, "num_tokens": 9442905.0, "step": 5445 }, { "entropy": 5.631464242935181, "epoch": 0.4240420151721455, "grad_norm": 1.140625, "learning_rate": 0.0004986498387289384, "loss": 5.5061, "mean_token_accuracy": 0.1702937290072441, "num_tokens": 9451258.0, "step": 5450 }, { "entropy": 5.669587421417236, "epoch": 0.42443104454386305, "grad_norm": 1.0, "learning_rate": 0.0004986468053187058, "loss": 5.4643, "mean_token_accuracy": 0.16737881749868394, "num_tokens": 9460218.0, "step": 5455 }, { "entropy": 5.6664165496826175, "epoch": 0.42482007391558063, "grad_norm": 1.046875, "learning_rate": 0.0004986437685149887, "loss": 5.5074, "mean_token_accuracy": 0.1663854479789734, "num_tokens": 9468756.0, "step": 5460 }, { "entropy": 5.695584869384765, "epoch": 0.4252091032872982, "grad_norm": 1.0390625, "learning_rate": 0.0004986407283178334, "loss": 5.528, "mean_token_accuracy": 0.16710674911737441, "num_tokens": 9477622.0, "step": 5465 }, { "entropy": 5.6477516174316404, "epoch": 0.42559813265901575, "grad_norm": 0.96484375, "learning_rate": 0.0004986376847272861, "loss": 5.4023, "mean_token_accuracy": 0.17134957611560822, "num_tokens": 9486332.0, "step": 5470 }, { "entropy": 5.6369672298431395, "epoch": 0.42598716203073334, "grad_norm": 1.015625, "learning_rate": 0.0004986346377433929, "loss": 5.4079, "mean_token_accuracy": 0.1770221471786499, "num_tokens": 9494703.0, "step": 5475 }, { "entropy": 5.6113409996032715, "epoch": 0.42637619140245087, "grad_norm": 0.95703125, "learning_rate": 0.0004986315873661999, "loss": 5.3682, "mean_token_accuracy": 0.17947474718093873, "num_tokens": 9503008.0, "step": 5480 }, { "entropy": 5.647426748275757, "epoch": 0.42676522077416845, "grad_norm": 1.0078125, "learning_rate": 0.0004986285335957536, "loss": 5.475, "mean_token_accuracy": 0.16509030908346176, "num_tokens": 9511752.0, "step": 5485 }, { "entropy": 5.595451688766479, "epoch": 0.42715425014588604, "grad_norm": 1.078125, "learning_rate": 0.0004986254764321002, "loss": 5.3896, "mean_token_accuracy": 0.16756030768156052, "num_tokens": 9520490.0, "step": 5490 }, { "entropy": 5.626486682891846, "epoch": 0.42754327951760357, "grad_norm": 1.046875, "learning_rate": 0.0004986224158752861, "loss": 5.4421, "mean_token_accuracy": 0.16567257046699524, "num_tokens": 9528474.0, "step": 5495 }, { "entropy": 5.688561153411865, "epoch": 0.42793230888932116, "grad_norm": 0.9609375, "learning_rate": 0.0004986193519253578, "loss": 5.5345, "mean_token_accuracy": 0.16336488127708435, "num_tokens": 9537747.0, "step": 5500 }, { "entropy": 5.632611274719238, "epoch": 0.4283213382610387, "grad_norm": 1.046875, "learning_rate": 0.0004986162845823618, "loss": 5.4534, "mean_token_accuracy": 0.16207062304019929, "num_tokens": 9546414.0, "step": 5505 }, { "entropy": 5.664350414276123, "epoch": 0.4287103676327563, "grad_norm": 0.92578125, "learning_rate": 0.0004986132138463446, "loss": 5.4661, "mean_token_accuracy": 0.1694653421640396, "num_tokens": 9555166.0, "step": 5510 }, { "entropy": 5.688541412353516, "epoch": 0.42909939700447386, "grad_norm": 1.0703125, "learning_rate": 0.0004986101397173528, "loss": 5.519, "mean_token_accuracy": 0.16417355090379715, "num_tokens": 9563217.0, "step": 5515 }, { "entropy": 5.645942831039429, "epoch": 0.4294884263761914, "grad_norm": 0.9765625, "learning_rate": 0.000498607062195433, "loss": 5.5671, "mean_token_accuracy": 0.15941138565540314, "num_tokens": 9572837.0, "step": 5520 }, { "entropy": 5.718004369735718, "epoch": 0.429877455747909, "grad_norm": 0.9765625, "learning_rate": 0.000498603981280632, "loss": 5.462, "mean_token_accuracy": 0.16318256556987762, "num_tokens": 9581297.0, "step": 5525 }, { "entropy": 5.6322996616363525, "epoch": 0.4302664851196265, "grad_norm": 0.9375, "learning_rate": 0.0004986008969729964, "loss": 5.5443, "mean_token_accuracy": 0.1617195874452591, "num_tokens": 9590431.0, "step": 5530 }, { "entropy": 5.723177671432495, "epoch": 0.4306555144913441, "grad_norm": 0.99609375, "learning_rate": 0.0004985978092725731, "loss": 5.5917, "mean_token_accuracy": 0.16330402940511704, "num_tokens": 9598719.0, "step": 5535 }, { "entropy": 5.7271167755126955, "epoch": 0.4310445438630617, "grad_norm": 1.0390625, "learning_rate": 0.000498594718179409, "loss": 5.5861, "mean_token_accuracy": 0.15970134884119033, "num_tokens": 9606935.0, "step": 5540 }, { "entropy": 5.710335636138916, "epoch": 0.4314335732347792, "grad_norm": 1.125, "learning_rate": 0.0004985916236935508, "loss": 5.5288, "mean_token_accuracy": 0.17187016010284423, "num_tokens": 9615104.0, "step": 5545 }, { "entropy": 5.803662633895874, "epoch": 0.4318226026064968, "grad_norm": 1.0703125, "learning_rate": 0.0004985885258150458, "loss": 5.5578, "mean_token_accuracy": 0.15836212933063507, "num_tokens": 9623332.0, "step": 5550 }, { "entropy": 5.581446504592895, "epoch": 0.43221163197821433, "grad_norm": 0.9765625, "learning_rate": 0.0004985854245439408, "loss": 5.3979, "mean_token_accuracy": 0.16912583708763124, "num_tokens": 9631874.0, "step": 5555 }, { "entropy": 5.609959077835083, "epoch": 0.4326006613499319, "grad_norm": 0.953125, "learning_rate": 0.0004985823198802827, "loss": 5.4509, "mean_token_accuracy": 0.1646541029214859, "num_tokens": 9641150.0, "step": 5560 }, { "entropy": 5.571775960922241, "epoch": 0.4329896907216495, "grad_norm": 1.078125, "learning_rate": 0.0004985792118241188, "loss": 5.2773, "mean_token_accuracy": 0.1755918726325035, "num_tokens": 9649116.0, "step": 5565 }, { "entropy": 5.6169108867645265, "epoch": 0.43337872009336703, "grad_norm": 1.0546875, "learning_rate": 0.0004985761003754961, "loss": 5.5178, "mean_token_accuracy": 0.166967211663723, "num_tokens": 9657579.0, "step": 5570 }, { "entropy": 5.635841417312622, "epoch": 0.4337677494650846, "grad_norm": 1.0234375, "learning_rate": 0.0004985729855344622, "loss": 5.4908, "mean_token_accuracy": 0.1659495487809181, "num_tokens": 9666242.0, "step": 5575 }, { "entropy": 5.669478797912598, "epoch": 0.4341567788368022, "grad_norm": 0.99609375, "learning_rate": 0.000498569867301064, "loss": 5.4663, "mean_token_accuracy": 0.16676506102085115, "num_tokens": 9675196.0, "step": 5580 }, { "entropy": 5.643025684356689, "epoch": 0.43454580820851973, "grad_norm": 1.0625, "learning_rate": 0.0004985667456753489, "loss": 5.4287, "mean_token_accuracy": 0.16679195463657379, "num_tokens": 9683681.0, "step": 5585 }, { "entropy": 5.592366361618042, "epoch": 0.4349348375802373, "grad_norm": 1.125, "learning_rate": 0.0004985636206573642, "loss": 5.4964, "mean_token_accuracy": 0.1720845341682434, "num_tokens": 9692445.0, "step": 5590 }, { "entropy": 5.6447841167449955, "epoch": 0.43532386695195485, "grad_norm": 0.98828125, "learning_rate": 0.0004985604922471575, "loss": 5.3954, "mean_token_accuracy": 0.1695060133934021, "num_tokens": 9701256.0, "step": 5595 }, { "entropy": 5.647923994064331, "epoch": 0.43571289632367244, "grad_norm": 1.015625, "learning_rate": 0.0004985573604447761, "loss": 5.4284, "mean_token_accuracy": 0.16670031696558, "num_tokens": 9710351.0, "step": 5600 }, { "entropy": 5.681913232803344, "epoch": 0.43610192569539, "grad_norm": 1.03125, "learning_rate": 0.0004985542252502676, "loss": 5.5098, "mean_token_accuracy": 0.15940970182418823, "num_tokens": 9718795.0, "step": 5605 }, { "entropy": 5.679136896133423, "epoch": 0.43649095506710756, "grad_norm": 1.046875, "learning_rate": 0.0004985510866636796, "loss": 5.4323, "mean_token_accuracy": 0.16713555306196212, "num_tokens": 9727136.0, "step": 5610 }, { "entropy": 5.578325414657593, "epoch": 0.43687998443882514, "grad_norm": 1.0234375, "learning_rate": 0.0004985479446850596, "loss": 5.4182, "mean_token_accuracy": 0.17000139653682708, "num_tokens": 9735712.0, "step": 5615 }, { "entropy": 5.6629225730896, "epoch": 0.4372690138105427, "grad_norm": 1.0234375, "learning_rate": 0.0004985447993144554, "loss": 5.4542, "mean_token_accuracy": 0.16782625317573546, "num_tokens": 9744027.0, "step": 5620 }, { "entropy": 5.750279188156128, "epoch": 0.43765804318226026, "grad_norm": 1.015625, "learning_rate": 0.0004985416505519147, "loss": 5.59, "mean_token_accuracy": 0.1612232133746147, "num_tokens": 9753083.0, "step": 5625 }, { "entropy": 5.72616057395935, "epoch": 0.43804707255397785, "grad_norm": 0.97265625, "learning_rate": 0.0004985384983974853, "loss": 5.5179, "mean_token_accuracy": 0.16758409440517424, "num_tokens": 9762098.0, "step": 5630 }, { "entropy": 5.692498731613159, "epoch": 0.4384361019256954, "grad_norm": 1.046875, "learning_rate": 0.0004985353428512148, "loss": 5.4615, "mean_token_accuracy": 0.16436221897602082, "num_tokens": 9770956.0, "step": 5635 }, { "entropy": 5.574732780456543, "epoch": 0.43882513129741296, "grad_norm": 1.0, "learning_rate": 0.0004985321839131514, "loss": 5.4127, "mean_token_accuracy": 0.1726594388484955, "num_tokens": 9779427.0, "step": 5640 }, { "entropy": 5.621200513839722, "epoch": 0.4392141606691305, "grad_norm": 0.91796875, "learning_rate": 0.0004985290215833428, "loss": 5.4777, "mean_token_accuracy": 0.17316209226846696, "num_tokens": 9787655.0, "step": 5645 }, { "entropy": 5.668504667282105, "epoch": 0.4396031900408481, "grad_norm": 0.9765625, "learning_rate": 0.0004985258558618372, "loss": 5.4158, "mean_token_accuracy": 0.1715027719736099, "num_tokens": 9796850.0, "step": 5650 }, { "entropy": 5.651020812988281, "epoch": 0.43999221941256567, "grad_norm": 0.94140625, "learning_rate": 0.0004985226867486825, "loss": 5.5034, "mean_token_accuracy": 0.17284105122089385, "num_tokens": 9805317.0, "step": 5655 }, { "entropy": 5.650268125534057, "epoch": 0.4403812487842832, "grad_norm": 1.0625, "learning_rate": 0.0004985195142439267, "loss": 5.4416, "mean_token_accuracy": 0.17098015695810317, "num_tokens": 9814249.0, "step": 5660 }, { "entropy": 5.67411699295044, "epoch": 0.4407702781560008, "grad_norm": 0.9609375, "learning_rate": 0.0004985163383476181, "loss": 5.539, "mean_token_accuracy": 0.16412654519081116, "num_tokens": 9823122.0, "step": 5665 }, { "entropy": 5.595461463928222, "epoch": 0.44115930752771837, "grad_norm": 1.0234375, "learning_rate": 0.0004985131590598048, "loss": 5.4086, "mean_token_accuracy": 0.17494799494743346, "num_tokens": 9831470.0, "step": 5670 }, { "entropy": 5.623825263977051, "epoch": 0.4415483368994359, "grad_norm": 1.0078125, "learning_rate": 0.0004985099763805352, "loss": 5.5128, "mean_token_accuracy": 0.16640195101499558, "num_tokens": 9840096.0, "step": 5675 }, { "entropy": 5.687500905990601, "epoch": 0.4419373662711535, "grad_norm": 0.98046875, "learning_rate": 0.0004985067903098574, "loss": 5.4607, "mean_token_accuracy": 0.17098743170499803, "num_tokens": 9848595.0, "step": 5680 }, { "entropy": 5.637724256515503, "epoch": 0.442326395642871, "grad_norm": 0.96484375, "learning_rate": 0.0004985036008478197, "loss": 5.4073, "mean_token_accuracy": 0.16370895206928254, "num_tokens": 9857353.0, "step": 5685 }, { "entropy": 5.63226637840271, "epoch": 0.4427154250145886, "grad_norm": 1.046875, "learning_rate": 0.0004985004079944707, "loss": 5.46, "mean_token_accuracy": 0.16471842527389527, "num_tokens": 9865828.0, "step": 5690 }, { "entropy": 5.593899774551391, "epoch": 0.4431044543863062, "grad_norm": 0.9375, "learning_rate": 0.0004984972117498587, "loss": 5.4735, "mean_token_accuracy": 0.16496108174324037, "num_tokens": 9874540.0, "step": 5695 }, { "entropy": 5.677505302429199, "epoch": 0.4434934837580237, "grad_norm": 0.9765625, "learning_rate": 0.0004984940121140323, "loss": 5.4622, "mean_token_accuracy": 0.16470122337341309, "num_tokens": 9883046.0, "step": 5700 }, { "entropy": 5.6196901321411135, "epoch": 0.4438825131297413, "grad_norm": 1.0625, "learning_rate": 0.00049849080908704, "loss": 5.4166, "mean_token_accuracy": 0.16411941945552827, "num_tokens": 9892282.0, "step": 5705 }, { "entropy": 5.635061359405517, "epoch": 0.44427154250145884, "grad_norm": 0.9609375, "learning_rate": 0.0004984876026689302, "loss": 5.3502, "mean_token_accuracy": 0.17350826859474183, "num_tokens": 9900653.0, "step": 5710 }, { "entropy": 5.568204784393311, "epoch": 0.4446605718731764, "grad_norm": 1.0390625, "learning_rate": 0.000498484392859752, "loss": 5.3852, "mean_token_accuracy": 0.17214204668998717, "num_tokens": 9909323.0, "step": 5715 }, { "entropy": 5.582053184509277, "epoch": 0.445049601244894, "grad_norm": 0.97265625, "learning_rate": 0.0004984811796595538, "loss": 5.5187, "mean_token_accuracy": 0.16376986354589462, "num_tokens": 9918155.0, "step": 5720 }, { "entropy": 5.747524881362915, "epoch": 0.44543863061661154, "grad_norm": 1.0234375, "learning_rate": 0.0004984779630683843, "loss": 5.4763, "mean_token_accuracy": 0.16589940339326859, "num_tokens": 9925977.0, "step": 5725 }, { "entropy": 5.637293529510498, "epoch": 0.44582765998832913, "grad_norm": 0.9375, "learning_rate": 0.0004984747430862924, "loss": 5.4612, "mean_token_accuracy": 0.16873055398464204, "num_tokens": 9934606.0, "step": 5730 }, { "entropy": 5.580166482925415, "epoch": 0.44621668936004666, "grad_norm": 1.0390625, "learning_rate": 0.0004984715197133271, "loss": 5.4339, "mean_token_accuracy": 0.16639334559440613, "num_tokens": 9943638.0, "step": 5735 }, { "entropy": 5.641740894317627, "epoch": 0.44660571873176425, "grad_norm": 1.0078125, "learning_rate": 0.0004984682929495371, "loss": 5.4527, "mean_token_accuracy": 0.16659653931856155, "num_tokens": 9952686.0, "step": 5740 }, { "entropy": 5.693140602111816, "epoch": 0.44699474810348183, "grad_norm": 0.96484375, "learning_rate": 0.0004984650627949715, "loss": 5.6415, "mean_token_accuracy": 0.15615570396184922, "num_tokens": 9961947.0, "step": 5745 }, { "entropy": 5.670505428314209, "epoch": 0.44738377747519936, "grad_norm": 0.90234375, "learning_rate": 0.0004984618292496792, "loss": 5.4647, "mean_token_accuracy": 0.16673058420419692, "num_tokens": 9971218.0, "step": 5750 }, { "entropy": 5.664007711410522, "epoch": 0.44777280684691695, "grad_norm": 1.0625, "learning_rate": 0.0004984585923137093, "loss": 5.4916, "mean_token_accuracy": 0.1662154719233513, "num_tokens": 9980741.0, "step": 5755 }, { "entropy": 5.694485855102539, "epoch": 0.4481618362186345, "grad_norm": 1.03125, "learning_rate": 0.000498455351987111, "loss": 5.4705, "mean_token_accuracy": 0.16652709394693374, "num_tokens": 9989483.0, "step": 5760 }, { "entropy": 5.693090534210205, "epoch": 0.44855086559035207, "grad_norm": 1.03125, "learning_rate": 0.0004984521082699333, "loss": 5.4978, "mean_token_accuracy": 0.16687163412570954, "num_tokens": 9998491.0, "step": 5765 }, { "entropy": 5.543629884719849, "epoch": 0.44893989496206965, "grad_norm": 0.98828125, "learning_rate": 0.0004984488611622256, "loss": 5.3806, "mean_token_accuracy": 0.17117684185504914, "num_tokens": 10006276.0, "step": 5770 }, { "entropy": 5.5802089214324955, "epoch": 0.4493289243337872, "grad_norm": 0.96875, "learning_rate": 0.000498445610664037, "loss": 5.4696, "mean_token_accuracy": 0.16785627007484435, "num_tokens": 10015088.0, "step": 5775 }, { "entropy": 5.663906669616699, "epoch": 0.44971795370550477, "grad_norm": 0.94140625, "learning_rate": 0.000498442356775417, "loss": 5.4266, "mean_token_accuracy": 0.16554765850305558, "num_tokens": 10023305.0, "step": 5780 }, { "entropy": 5.575909042358399, "epoch": 0.45010698307722236, "grad_norm": 1.046875, "learning_rate": 0.0004984390994964148, "loss": 5.3805, "mean_token_accuracy": 0.16881942003965378, "num_tokens": 10031540.0, "step": 5785 }, { "entropy": 5.6279661655426025, "epoch": 0.4504960124489399, "grad_norm": 0.9140625, "learning_rate": 0.00049843583882708, "loss": 5.4733, "mean_token_accuracy": 0.16908168643712998, "num_tokens": 10040025.0, "step": 5790 }, { "entropy": 5.6401628971099855, "epoch": 0.4508850418206575, "grad_norm": 0.9609375, "learning_rate": 0.000498432574767462, "loss": 5.48, "mean_token_accuracy": 0.16680154353380203, "num_tokens": 10048904.0, "step": 5795 }, { "entropy": 5.644533729553222, "epoch": 0.451274071192375, "grad_norm": 1.0, "learning_rate": 0.0004984293073176103, "loss": 5.5133, "mean_token_accuracy": 0.16642902791500092, "num_tokens": 10057608.0, "step": 5800 }, { "entropy": 5.713375568389893, "epoch": 0.4516631005640926, "grad_norm": 0.98046875, "learning_rate": 0.0004984260364775744, "loss": 5.4701, "mean_token_accuracy": 0.17314359098672866, "num_tokens": 10066587.0, "step": 5805 }, { "entropy": 5.608742380142212, "epoch": 0.4520521299358102, "grad_norm": 1.015625, "learning_rate": 0.000498422762247404, "loss": 5.4281, "mean_token_accuracy": 0.1667902648448944, "num_tokens": 10075651.0, "step": 5810 }, { "entropy": 5.65361647605896, "epoch": 0.4524411593075277, "grad_norm": 0.984375, "learning_rate": 0.0004984194846271489, "loss": 5.5379, "mean_token_accuracy": 0.16456001549959182, "num_tokens": 10084158.0, "step": 5815 }, { "entropy": 5.714414310455322, "epoch": 0.4528301886792453, "grad_norm": 1.078125, "learning_rate": 0.0004984162036168586, "loss": 5.4715, "mean_token_accuracy": 0.16263072341680526, "num_tokens": 10093730.0, "step": 5820 }, { "entropy": 5.636698055267334, "epoch": 0.4532192180509628, "grad_norm": 1.015625, "learning_rate": 0.0004984129192165831, "loss": 5.3956, "mean_token_accuracy": 0.16606880724430084, "num_tokens": 10102457.0, "step": 5825 }, { "entropy": 5.657480669021607, "epoch": 0.4536082474226804, "grad_norm": 1.0390625, "learning_rate": 0.0004984096314263722, "loss": 5.5361, "mean_token_accuracy": 0.1659406006336212, "num_tokens": 10111188.0, "step": 5830 }, { "entropy": 5.691649389266968, "epoch": 0.453997276794398, "grad_norm": 1.0234375, "learning_rate": 0.0004984063402462757, "loss": 5.4321, "mean_token_accuracy": 0.1693912699818611, "num_tokens": 10120268.0, "step": 5835 }, { "entropy": 5.646623325347901, "epoch": 0.45438630616611553, "grad_norm": 0.97265625, "learning_rate": 0.0004984030456763435, "loss": 5.5018, "mean_token_accuracy": 0.159344282746315, "num_tokens": 10129262.0, "step": 5840 }, { "entropy": 5.604523992538452, "epoch": 0.4547753355378331, "grad_norm": 1.015625, "learning_rate": 0.0004983997477166257, "loss": 5.4425, "mean_token_accuracy": 0.17042097300291062, "num_tokens": 10137417.0, "step": 5845 }, { "entropy": 5.60966420173645, "epoch": 0.45516436490955064, "grad_norm": 0.98828125, "learning_rate": 0.0004983964463671723, "loss": 5.3859, "mean_token_accuracy": 0.169807331264019, "num_tokens": 10145804.0, "step": 5850 }, { "entropy": 5.6830277919769285, "epoch": 0.45555339428126823, "grad_norm": 0.9375, "learning_rate": 0.0004983931416280334, "loss": 5.5243, "mean_token_accuracy": 0.1644147291779518, "num_tokens": 10154421.0, "step": 5855 }, { "entropy": 5.750033950805664, "epoch": 0.4559424236529858, "grad_norm": 1.015625, "learning_rate": 0.0004983898334992591, "loss": 5.5348, "mean_token_accuracy": 0.16695573478937148, "num_tokens": 10163631.0, "step": 5860 }, { "entropy": 5.64238224029541, "epoch": 0.45633145302470335, "grad_norm": 1.0234375, "learning_rate": 0.0004983865219808998, "loss": 5.4525, "mean_token_accuracy": 0.1701275646686554, "num_tokens": 10172926.0, "step": 5865 }, { "entropy": 5.679831504821777, "epoch": 0.45672048239642093, "grad_norm": 1.203125, "learning_rate": 0.0004983832070730055, "loss": 5.5529, "mean_token_accuracy": 0.15790846645832063, "num_tokens": 10181671.0, "step": 5870 }, { "entropy": 5.6128734111785885, "epoch": 0.4571095117681385, "grad_norm": 1.046875, "learning_rate": 0.0004983798887756265, "loss": 5.3875, "mean_token_accuracy": 0.17633408457040786, "num_tokens": 10189626.0, "step": 5875 }, { "entropy": 5.681553602218628, "epoch": 0.45749854113985605, "grad_norm": 0.98828125, "learning_rate": 0.0004983765670888133, "loss": 5.5232, "mean_token_accuracy": 0.16761491298675538, "num_tokens": 10198212.0, "step": 5880 }, { "entropy": 5.586812591552734, "epoch": 0.45788757051157364, "grad_norm": 1.0078125, "learning_rate": 0.0004983732420126163, "loss": 5.4185, "mean_token_accuracy": 0.16471427530050278, "num_tokens": 10207342.0, "step": 5885 }, { "entropy": 5.704931020736694, "epoch": 0.45827659988329117, "grad_norm": 0.9453125, "learning_rate": 0.0004983699135470858, "loss": 5.5231, "mean_token_accuracy": 0.15820106565952302, "num_tokens": 10216413.0, "step": 5890 }, { "entropy": 5.657903099060059, "epoch": 0.45866562925500876, "grad_norm": 0.9453125, "learning_rate": 0.0004983665816922723, "loss": 5.4524, "mean_token_accuracy": 0.16937243938446045, "num_tokens": 10225889.0, "step": 5895 }, { "entropy": 5.589326333999634, "epoch": 0.45905465862672634, "grad_norm": 1.046875, "learning_rate": 0.0004983632464482267, "loss": 5.4063, "mean_token_accuracy": 0.17112260311841965, "num_tokens": 10234518.0, "step": 5900 }, { "entropy": 5.695744514465332, "epoch": 0.4594436879984439, "grad_norm": 0.96875, "learning_rate": 0.0004983599078149991, "loss": 5.5391, "mean_token_accuracy": 0.16143682301044465, "num_tokens": 10243074.0, "step": 5905 }, { "entropy": 5.771560573577881, "epoch": 0.45983271737016146, "grad_norm": 1.0078125, "learning_rate": 0.0004983565657926405, "loss": 5.4887, "mean_token_accuracy": 0.16415552347898482, "num_tokens": 10253473.0, "step": 5910 }, { "entropy": 5.69731650352478, "epoch": 0.460221746741879, "grad_norm": 1.0390625, "learning_rate": 0.0004983532203812017, "loss": 5.5747, "mean_token_accuracy": 0.1648534968495369, "num_tokens": 10261866.0, "step": 5915 }, { "entropy": 5.649386692047119, "epoch": 0.4606107761135966, "grad_norm": 0.98828125, "learning_rate": 0.0004983498715807331, "loss": 5.4187, "mean_token_accuracy": 0.1710118681192398, "num_tokens": 10270350.0, "step": 5920 }, { "entropy": 5.647009754180909, "epoch": 0.46099980548531416, "grad_norm": 0.9765625, "learning_rate": 0.0004983465193912857, "loss": 5.5711, "mean_token_accuracy": 0.15795120000839233, "num_tokens": 10279556.0, "step": 5925 }, { "entropy": 5.586729669570923, "epoch": 0.4613888348570317, "grad_norm": 1.015625, "learning_rate": 0.0004983431638129104, "loss": 5.3409, "mean_token_accuracy": 0.1722436711192131, "num_tokens": 10287489.0, "step": 5930 }, { "entropy": 5.604912328720093, "epoch": 0.4617778642287493, "grad_norm": 1.0390625, "learning_rate": 0.0004983398048456581, "loss": 5.3242, "mean_token_accuracy": 0.16806061565876007, "num_tokens": 10296280.0, "step": 5935 }, { "entropy": 5.619849300384521, "epoch": 0.4621668936004668, "grad_norm": 1.0234375, "learning_rate": 0.0004983364424895796, "loss": 5.4869, "mean_token_accuracy": 0.1619819775223732, "num_tokens": 10304091.0, "step": 5940 }, { "entropy": 5.668075275421143, "epoch": 0.4625559229721844, "grad_norm": 0.98046875, "learning_rate": 0.0004983330767447262, "loss": 5.5026, "mean_token_accuracy": 0.15887704938650132, "num_tokens": 10313058.0, "step": 5945 }, { "entropy": 5.622173261642456, "epoch": 0.462944952343902, "grad_norm": 1.1015625, "learning_rate": 0.0004983297076111489, "loss": 5.4749, "mean_token_accuracy": 0.1640453204512596, "num_tokens": 10321642.0, "step": 5950 }, { "entropy": 5.577755784988403, "epoch": 0.4633339817156195, "grad_norm": 0.98046875, "learning_rate": 0.0004983263350888987, "loss": 5.2922, "mean_token_accuracy": 0.17254432886838914, "num_tokens": 10329829.0, "step": 5955 }, { "entropy": 5.640766525268555, "epoch": 0.4637230110873371, "grad_norm": 1.0078125, "learning_rate": 0.0004983229591780268, "loss": 5.5284, "mean_token_accuracy": 0.16286519914865494, "num_tokens": 10338182.0, "step": 5960 }, { "entropy": 5.673437929153442, "epoch": 0.46411204045905463, "grad_norm": 1.0859375, "learning_rate": 0.0004983195798785844, "loss": 5.4208, "mean_token_accuracy": 0.1703182965517044, "num_tokens": 10346377.0, "step": 5965 }, { "entropy": 5.668019008636475, "epoch": 0.4645010698307722, "grad_norm": 1.0234375, "learning_rate": 0.0004983161971906228, "loss": 5.4089, "mean_token_accuracy": 0.17171140760183334, "num_tokens": 10354937.0, "step": 5970 }, { "entropy": 5.543028974533081, "epoch": 0.4648900992024898, "grad_norm": 1.03125, "learning_rate": 0.0004983128111141935, "loss": 5.3114, "mean_token_accuracy": 0.17455710768699645, "num_tokens": 10363706.0, "step": 5975 }, { "entropy": 5.574260568618774, "epoch": 0.46527912857420733, "grad_norm": 0.96484375, "learning_rate": 0.0004983094216493475, "loss": 5.4645, "mean_token_accuracy": 0.16650742590427398, "num_tokens": 10372292.0, "step": 5980 }, { "entropy": 5.671193408966064, "epoch": 0.4656681579459249, "grad_norm": 0.921875, "learning_rate": 0.0004983060287961367, "loss": 5.4386, "mean_token_accuracy": 0.17165132462978364, "num_tokens": 10381260.0, "step": 5985 }, { "entropy": 5.648577165603638, "epoch": 0.4660571873176425, "grad_norm": 1.046875, "learning_rate": 0.0004983026325546123, "loss": 5.4539, "mean_token_accuracy": 0.16947742700576782, "num_tokens": 10390646.0, "step": 5990 }, { "entropy": 5.625260925292968, "epoch": 0.46644621668936004, "grad_norm": 1.0390625, "learning_rate": 0.0004982992329248257, "loss": 5.5166, "mean_token_accuracy": 0.16828270852565766, "num_tokens": 10399056.0, "step": 5995 }, { "entropy": 5.6372960090637205, "epoch": 0.4668352460610776, "grad_norm": 0.94921875, "learning_rate": 0.0004982958299068289, "loss": 5.5048, "mean_token_accuracy": 0.16254437565803528, "num_tokens": 10408746.0, "step": 6000 }, { "epoch": 0.4668352460610776, "eval_entropy": 5.468773723818914, "eval_loss": 5.478248119354248, "eval_mean_token_accuracy": 0.17529629864178678, "eval_num_tokens": 10408746.0, "eval_runtime": 21.786, "eval_samples_per_second": 1907.559, "eval_steps_per_second": 238.456, "step": 6000 }, { "entropy": 5.667443513870239, "epoch": 0.46722427543279516, "grad_norm": 0.96875, "learning_rate": 0.000498292423500673, "loss": 5.4276, "mean_token_accuracy": 0.16848916113376616, "num_tokens": 10416937.0, "step": 6005 }, { "entropy": 5.6209752559661865, "epoch": 0.46761330480451274, "grad_norm": 0.984375, "learning_rate": 0.0004982890137064102, "loss": 5.4023, "mean_token_accuracy": 0.17630034387111665, "num_tokens": 10426343.0, "step": 6010 }, { "entropy": 5.6079370975494385, "epoch": 0.46800233417623033, "grad_norm": 0.90234375, "learning_rate": 0.000498285600524092, "loss": 5.4317, "mean_token_accuracy": 0.1709451973438263, "num_tokens": 10435014.0, "step": 6015 }, { "entropy": 5.557825231552124, "epoch": 0.46839136354794786, "grad_norm": 1.015625, "learning_rate": 0.0004982821839537701, "loss": 5.447, "mean_token_accuracy": 0.16832986921072007, "num_tokens": 10443522.0, "step": 6020 }, { "entropy": 5.6745398998260494, "epoch": 0.46878039291966545, "grad_norm": 1.015625, "learning_rate": 0.0004982787639954966, "loss": 5.4939, "mean_token_accuracy": 0.1648608475923538, "num_tokens": 10452202.0, "step": 6025 }, { "entropy": 5.631177759170532, "epoch": 0.469169422291383, "grad_norm": 0.94140625, "learning_rate": 0.0004982753406493232, "loss": 5.4735, "mean_token_accuracy": 0.16007108837366105, "num_tokens": 10462293.0, "step": 6030 }, { "entropy": 5.586612892150879, "epoch": 0.46955845166310056, "grad_norm": 0.98828125, "learning_rate": 0.0004982719139153018, "loss": 5.4051, "mean_token_accuracy": 0.1679594933986664, "num_tokens": 10470322.0, "step": 6035 }, { "entropy": 5.635045433044434, "epoch": 0.46994748103481815, "grad_norm": 1.0546875, "learning_rate": 0.0004982684837934845, "loss": 5.3935, "mean_token_accuracy": 0.17465801239013673, "num_tokens": 10479581.0, "step": 6040 }, { "entropy": 5.655844640731812, "epoch": 0.4703365104065357, "grad_norm": 0.96875, "learning_rate": 0.0004982650502839234, "loss": 5.4006, "mean_token_accuracy": 0.1719515100121498, "num_tokens": 10488207.0, "step": 6045 }, { "entropy": 5.579202795028687, "epoch": 0.47072553977825327, "grad_norm": 1.015625, "learning_rate": 0.0004982616133866705, "loss": 5.4117, "mean_token_accuracy": 0.16743631064891815, "num_tokens": 10497360.0, "step": 6050 }, { "entropy": 5.578354835510254, "epoch": 0.4711145691499708, "grad_norm": 0.953125, "learning_rate": 0.0004982581731017779, "loss": 5.3959, "mean_token_accuracy": 0.16868714839220048, "num_tokens": 10506131.0, "step": 6055 }, { "entropy": 5.615327072143555, "epoch": 0.4715035985216884, "grad_norm": 0.98828125, "learning_rate": 0.0004982547294292979, "loss": 5.4404, "mean_token_accuracy": 0.16701407134532928, "num_tokens": 10514955.0, "step": 6060 }, { "entropy": 5.593543672561646, "epoch": 0.47189262789340597, "grad_norm": 1.03125, "learning_rate": 0.0004982512823692828, "loss": 5.4119, "mean_token_accuracy": 0.16133114844560623, "num_tokens": 10523743.0, "step": 6065 }, { "entropy": 5.605992555618286, "epoch": 0.4722816572651235, "grad_norm": 1.0078125, "learning_rate": 0.0004982478319217848, "loss": 5.3815, "mean_token_accuracy": 0.1775616154074669, "num_tokens": 10533149.0, "step": 6070 }, { "entropy": 5.565766048431397, "epoch": 0.4726706866368411, "grad_norm": 1.0234375, "learning_rate": 0.0004982443780868562, "loss": 5.417, "mean_token_accuracy": 0.17523194700479508, "num_tokens": 10541291.0, "step": 6075 }, { "entropy": 5.651870632171631, "epoch": 0.4730597160085587, "grad_norm": 1.0625, "learning_rate": 0.0004982409208645496, "loss": 5.4601, "mean_token_accuracy": 0.16842615902423858, "num_tokens": 10550005.0, "step": 6080 }, { "entropy": 5.692563199996949, "epoch": 0.4734487453802762, "grad_norm": 0.9765625, "learning_rate": 0.0004982374602549173, "loss": 5.4792, "mean_token_accuracy": 0.16938978135585786, "num_tokens": 10558957.0, "step": 6085 }, { "entropy": 5.64795618057251, "epoch": 0.4738377747519938, "grad_norm": 1.03125, "learning_rate": 0.0004982339962580119, "loss": 5.3678, "mean_token_accuracy": 0.16741629391908647, "num_tokens": 10567293.0, "step": 6090 }, { "entropy": 5.580725526809692, "epoch": 0.4742268041237113, "grad_norm": 1.0078125, "learning_rate": 0.0004982305288738859, "loss": 5.3384, "mean_token_accuracy": 0.17617610692977906, "num_tokens": 10575546.0, "step": 6095 }, { "entropy": 5.528723192214966, "epoch": 0.4746158334954289, "grad_norm": 0.9296875, "learning_rate": 0.0004982270581025919, "loss": 5.465, "mean_token_accuracy": 0.17209935039281846, "num_tokens": 10584779.0, "step": 6100 }, { "entropy": 5.587629985809326, "epoch": 0.4750048628671465, "grad_norm": 1.0078125, "learning_rate": 0.0004982235839441826, "loss": 5.3955, "mean_token_accuracy": 0.17494287937879563, "num_tokens": 10592852.0, "step": 6105 }, { "entropy": 5.655500841140747, "epoch": 0.475393892238864, "grad_norm": 0.9765625, "learning_rate": 0.0004982201063987108, "loss": 5.4999, "mean_token_accuracy": 0.1644456207752228, "num_tokens": 10601875.0, "step": 6110 }, { "entropy": 5.611720180511474, "epoch": 0.4757829216105816, "grad_norm": 1.015625, "learning_rate": 0.0004982166254662292, "loss": 5.4688, "mean_token_accuracy": 0.17126654237508773, "num_tokens": 10610438.0, "step": 6115 }, { "entropy": 5.627661180496216, "epoch": 0.47617195098229914, "grad_norm": 1.0625, "learning_rate": 0.0004982131411467904, "loss": 5.4636, "mean_token_accuracy": 0.16586989760398865, "num_tokens": 10619479.0, "step": 6120 }, { "entropy": 5.612498712539673, "epoch": 0.4765609803540167, "grad_norm": 1.0, "learning_rate": 0.0004982096534404476, "loss": 5.3893, "mean_token_accuracy": 0.17240849733352662, "num_tokens": 10628519.0, "step": 6125 }, { "entropy": 5.640328454971313, "epoch": 0.4769500097257343, "grad_norm": 1.015625, "learning_rate": 0.0004982061623472535, "loss": 5.3526, "mean_token_accuracy": 0.17426417917013168, "num_tokens": 10636522.0, "step": 6130 }, { "entropy": 5.569852495193482, "epoch": 0.47733903909745184, "grad_norm": 0.98828125, "learning_rate": 0.0004982026678672612, "loss": 5.3648, "mean_token_accuracy": 0.16899030655622482, "num_tokens": 10645728.0, "step": 6135 }, { "entropy": 5.596399021148682, "epoch": 0.47772806846916943, "grad_norm": 1.0, "learning_rate": 0.0004981991700005238, "loss": 5.4789, "mean_token_accuracy": 0.1673264682292938, "num_tokens": 10654868.0, "step": 6140 }, { "entropy": 5.548848628997803, "epoch": 0.47811709784088696, "grad_norm": 0.98828125, "learning_rate": 0.000498195668747094, "loss": 5.3646, "mean_token_accuracy": 0.17227984219789505, "num_tokens": 10662958.0, "step": 6145 }, { "entropy": 5.6338269233703615, "epoch": 0.47850612721260455, "grad_norm": 1.0625, "learning_rate": 0.0004981921641070254, "loss": 5.3796, "mean_token_accuracy": 0.17123519778251647, "num_tokens": 10671333.0, "step": 6150 }, { "entropy": 5.627652263641357, "epoch": 0.47889515658432213, "grad_norm": 0.96875, "learning_rate": 0.0004981886560803708, "loss": 5.4014, "mean_token_accuracy": 0.1699555292725563, "num_tokens": 10680523.0, "step": 6155 }, { "entropy": 5.619808626174927, "epoch": 0.47928418595603967, "grad_norm": 0.96875, "learning_rate": 0.0004981851446671838, "loss": 5.4687, "mean_token_accuracy": 0.16397960782051085, "num_tokens": 10689656.0, "step": 6160 }, { "entropy": 5.666473770141602, "epoch": 0.47967321532775725, "grad_norm": 1.109375, "learning_rate": 0.0004981816298675173, "loss": 5.5385, "mean_token_accuracy": 0.16096996814012526, "num_tokens": 10698423.0, "step": 6165 }, { "entropy": 5.625974845886231, "epoch": 0.4800622446994748, "grad_norm": 1.03125, "learning_rate": 0.0004981781116814248, "loss": 5.4071, "mean_token_accuracy": 0.1723208859562874, "num_tokens": 10706760.0, "step": 6170 }, { "entropy": 5.707794189453125, "epoch": 0.48045127407119237, "grad_norm": 1.0, "learning_rate": 0.0004981745901089596, "loss": 5.5088, "mean_token_accuracy": 0.1589950516819954, "num_tokens": 10716221.0, "step": 6175 }, { "entropy": 5.5495470523834225, "epoch": 0.48084030344290996, "grad_norm": 1.015625, "learning_rate": 0.0004981710651501753, "loss": 5.3102, "mean_token_accuracy": 0.18165120333433152, "num_tokens": 10724603.0, "step": 6180 }, { "entropy": 5.645468711853027, "epoch": 0.4812293328146275, "grad_norm": 0.96875, "learning_rate": 0.0004981675368051254, "loss": 5.5351, "mean_token_accuracy": 0.15899534821510314, "num_tokens": 10733577.0, "step": 6185 }, { "entropy": 5.712690258026123, "epoch": 0.4816183621863451, "grad_norm": 0.9140625, "learning_rate": 0.0004981640050738633, "loss": 5.4466, "mean_token_accuracy": 0.17270689308643342, "num_tokens": 10743199.0, "step": 6190 }, { "entropy": 5.616707849502563, "epoch": 0.48200739155806266, "grad_norm": 0.95703125, "learning_rate": 0.0004981604699564426, "loss": 5.3312, "mean_token_accuracy": 0.17357029765844345, "num_tokens": 10751734.0, "step": 6195 }, { "entropy": 5.6283769607543945, "epoch": 0.4823964209297802, "grad_norm": 1.046875, "learning_rate": 0.0004981569314529169, "loss": 5.4868, "mean_token_accuracy": 0.16709917336702346, "num_tokens": 10760194.0, "step": 6200 }, { "entropy": 5.650402545928955, "epoch": 0.4827854503014978, "grad_norm": 0.97265625, "learning_rate": 0.00049815338956334, "loss": 5.4036, "mean_token_accuracy": 0.17521733343601226, "num_tokens": 10768944.0, "step": 6205 }, { "entropy": 5.69504828453064, "epoch": 0.4831744796732153, "grad_norm": 0.9140625, "learning_rate": 0.0004981498442877656, "loss": 5.5049, "mean_token_accuracy": 0.1730547532439232, "num_tokens": 10777685.0, "step": 6210 }, { "entropy": 5.642111921310425, "epoch": 0.4835635090449329, "grad_norm": 0.95703125, "learning_rate": 0.0004981462956262474, "loss": 5.4765, "mean_token_accuracy": 0.16693192422389985, "num_tokens": 10787264.0, "step": 6215 }, { "entropy": 5.602992391586303, "epoch": 0.4839525384166505, "grad_norm": 0.9296875, "learning_rate": 0.0004981427435788396, "loss": 5.4393, "mean_token_accuracy": 0.1655664786696434, "num_tokens": 10796555.0, "step": 6220 }, { "entropy": 5.525999927520752, "epoch": 0.484341567788368, "grad_norm": 0.984375, "learning_rate": 0.0004981391881455957, "loss": 5.3515, "mean_token_accuracy": 0.17589380443096161, "num_tokens": 10805379.0, "step": 6225 }, { "entropy": 5.565594863891602, "epoch": 0.4847305971600856, "grad_norm": 0.90625, "learning_rate": 0.0004981356293265696, "loss": 5.4786, "mean_token_accuracy": 0.16520614624023439, "num_tokens": 10815406.0, "step": 6230 }, { "entropy": 5.658706951141357, "epoch": 0.4851196265318031, "grad_norm": 0.9765625, "learning_rate": 0.0004981320671218157, "loss": 5.5369, "mean_token_accuracy": 0.16370739042758942, "num_tokens": 10824443.0, "step": 6235 }, { "entropy": 5.686445903778076, "epoch": 0.4855086559035207, "grad_norm": 1.0390625, "learning_rate": 0.0004981285015313877, "loss": 5.366, "mean_token_accuracy": 0.1736448109149933, "num_tokens": 10833497.0, "step": 6240 }, { "entropy": 5.557299995422364, "epoch": 0.4858976852752383, "grad_norm": 1.0546875, "learning_rate": 0.0004981249325553399, "loss": 5.4135, "mean_token_accuracy": 0.1717936083674431, "num_tokens": 10841864.0, "step": 6245 }, { "entropy": 5.662262201309204, "epoch": 0.48628671464695583, "grad_norm": 1.0546875, "learning_rate": 0.0004981213601937264, "loss": 5.4643, "mean_token_accuracy": 0.17284016013145448, "num_tokens": 10850887.0, "step": 6250 }, { "entropy": 5.590152788162231, "epoch": 0.4866757440186734, "grad_norm": 0.9609375, "learning_rate": 0.0004981177844466013, "loss": 5.3453, "mean_token_accuracy": 0.174080491065979, "num_tokens": 10859629.0, "step": 6255 }, { "entropy": 5.652895593643189, "epoch": 0.48706477339039095, "grad_norm": 1.015625, "learning_rate": 0.0004981142053140192, "loss": 5.5285, "mean_token_accuracy": 0.16324191689491271, "num_tokens": 10868457.0, "step": 6260 }, { "entropy": 5.6257092475891115, "epoch": 0.48745380276210853, "grad_norm": 0.9296875, "learning_rate": 0.0004981106227960339, "loss": 5.4483, "mean_token_accuracy": 0.16676026433706284, "num_tokens": 10878007.0, "step": 6265 }, { "entropy": 5.703521251678467, "epoch": 0.4878428321338261, "grad_norm": 0.98828125, "learning_rate": 0.0004981070368927001, "loss": 5.4914, "mean_token_accuracy": 0.16467054486274718, "num_tokens": 10887689.0, "step": 6270 }, { "entropy": 5.585311794281006, "epoch": 0.48823186150554365, "grad_norm": 0.91796875, "learning_rate": 0.000498103447604072, "loss": 5.2933, "mean_token_accuracy": 0.17395345568656922, "num_tokens": 10896214.0, "step": 6275 }, { "entropy": 5.55946979522705, "epoch": 0.48862089087726124, "grad_norm": 1.015625, "learning_rate": 0.0004980998549302044, "loss": 5.4149, "mean_token_accuracy": 0.16991112530231475, "num_tokens": 10904946.0, "step": 6280 }, { "entropy": 5.693157911300659, "epoch": 0.4890099202489788, "grad_norm": 1.046875, "learning_rate": 0.0004980962588711516, "loss": 5.4979, "mean_token_accuracy": 0.1608987919986248, "num_tokens": 10913382.0, "step": 6285 }, { "entropy": 5.672442865371704, "epoch": 0.48939894962069636, "grad_norm": 0.94140625, "learning_rate": 0.000498092659426968, "loss": 5.4338, "mean_token_accuracy": 0.17338544130325317, "num_tokens": 10922055.0, "step": 6290 }, { "entropy": 5.615342998504639, "epoch": 0.48978797899241394, "grad_norm": 0.98046875, "learning_rate": 0.0004980890565977085, "loss": 5.4267, "mean_token_accuracy": 0.16947162002325059, "num_tokens": 10930282.0, "step": 6295 }, { "entropy": 5.565211153030395, "epoch": 0.4901770083641315, "grad_norm": 1.0078125, "learning_rate": 0.0004980854503834276, "loss": 5.4367, "mean_token_accuracy": 0.17593979835510254, "num_tokens": 10938432.0, "step": 6300 }, { "entropy": 5.670564031600952, "epoch": 0.49056603773584906, "grad_norm": 1.0234375, "learning_rate": 0.0004980818407841802, "loss": 5.4375, "mean_token_accuracy": 0.17329999804496765, "num_tokens": 10946354.0, "step": 6305 }, { "entropy": 5.725423860549927, "epoch": 0.49095506710756665, "grad_norm": 0.9765625, "learning_rate": 0.0004980782278000207, "loss": 5.4683, "mean_token_accuracy": 0.16744253635406495, "num_tokens": 10954885.0, "step": 6310 }, { "entropy": 5.590633678436279, "epoch": 0.4913440964792842, "grad_norm": 1.046875, "learning_rate": 0.0004980746114310043, "loss": 5.3743, "mean_token_accuracy": 0.1690499573945999, "num_tokens": 10963173.0, "step": 6315 }, { "entropy": 5.634382104873657, "epoch": 0.49173312585100176, "grad_norm": 0.9453125, "learning_rate": 0.0004980709916771858, "loss": 5.5258, "mean_token_accuracy": 0.15521946102380751, "num_tokens": 10972264.0, "step": 6320 }, { "entropy": 5.617056846618652, "epoch": 0.4921221552227193, "grad_norm": 0.98046875, "learning_rate": 0.0004980673685386198, "loss": 5.3702, "mean_token_accuracy": 0.1731475278735161, "num_tokens": 10980645.0, "step": 6325 }, { "entropy": 5.541935157775879, "epoch": 0.4925111845944369, "grad_norm": 1.046875, "learning_rate": 0.0004980637420153618, "loss": 5.33, "mean_token_accuracy": 0.17462508678436278, "num_tokens": 10989121.0, "step": 6330 }, { "entropy": 5.581294679641724, "epoch": 0.49290021396615447, "grad_norm": 1.046875, "learning_rate": 0.0004980601121074664, "loss": 5.3333, "mean_token_accuracy": 0.18154052793979644, "num_tokens": 10998249.0, "step": 6335 }, { "entropy": 5.693126916885376, "epoch": 0.493289243337872, "grad_norm": 0.9765625, "learning_rate": 0.0004980564788149889, "loss": 5.448, "mean_token_accuracy": 0.16501189395785332, "num_tokens": 11007470.0, "step": 6340 }, { "entropy": 5.657134103775024, "epoch": 0.4936782727095896, "grad_norm": 1.0234375, "learning_rate": 0.0004980528421379844, "loss": 5.3946, "mean_token_accuracy": 0.1677241399884224, "num_tokens": 11015912.0, "step": 6345 }, { "entropy": 5.585910654067993, "epoch": 0.4940673020813071, "grad_norm": 0.9765625, "learning_rate": 0.000498049202076508, "loss": 5.418, "mean_token_accuracy": 0.16667619943618775, "num_tokens": 11024629.0, "step": 6350 }, { "entropy": 5.614324712753296, "epoch": 0.4944563314530247, "grad_norm": 1.0, "learning_rate": 0.0004980455586306149, "loss": 5.3509, "mean_token_accuracy": 0.1716369092464447, "num_tokens": 11033953.0, "step": 6355 }, { "entropy": 5.545697212219238, "epoch": 0.4948453608247423, "grad_norm": 0.953125, "learning_rate": 0.0004980419118003605, "loss": 5.4262, "mean_token_accuracy": 0.1693047046661377, "num_tokens": 11042891.0, "step": 6360 }, { "entropy": 5.601671361923218, "epoch": 0.4952343901964598, "grad_norm": 1.0, "learning_rate": 0.0004980382615858001, "loss": 5.5162, "mean_token_accuracy": 0.16135913282632827, "num_tokens": 11051262.0, "step": 6365 }, { "entropy": 5.606281852722168, "epoch": 0.4956234195681774, "grad_norm": 1.046875, "learning_rate": 0.0004980346079869892, "loss": 5.3472, "mean_token_accuracy": 0.1761609584093094, "num_tokens": 11059357.0, "step": 6370 }, { "entropy": 5.603213357925415, "epoch": 0.49601244893989493, "grad_norm": 0.9609375, "learning_rate": 0.000498030951003983, "loss": 5.3587, "mean_token_accuracy": 0.1736203297972679, "num_tokens": 11068076.0, "step": 6375 }, { "entropy": 5.53122091293335, "epoch": 0.4964014783116125, "grad_norm": 1.5390625, "learning_rate": 0.0004980272906368371, "loss": 5.2448, "mean_token_accuracy": 0.18355217725038528, "num_tokens": 11076804.0, "step": 6380 }, { "entropy": 5.650952482223511, "epoch": 0.4967905076833301, "grad_norm": 0.9765625, "learning_rate": 0.0004980236268856071, "loss": 5.4407, "mean_token_accuracy": 0.17113036364316941, "num_tokens": 11085794.0, "step": 6385 }, { "entropy": 5.527957010269165, "epoch": 0.49717953705504764, "grad_norm": 0.9296875, "learning_rate": 0.0004980199597503487, "loss": 5.3427, "mean_token_accuracy": 0.16856258362531662, "num_tokens": 11094989.0, "step": 6390 }, { "entropy": 5.545766878128052, "epoch": 0.4975685664267652, "grad_norm": 1.03125, "learning_rate": 0.0004980162892311171, "loss": 5.3043, "mean_token_accuracy": 0.18141588121652602, "num_tokens": 11103046.0, "step": 6395 }, { "entropy": 5.5342535972595215, "epoch": 0.4979575957984828, "grad_norm": 0.9375, "learning_rate": 0.0004980126153279684, "loss": 5.3777, "mean_token_accuracy": 0.17280755192041397, "num_tokens": 11111533.0, "step": 6400 }, { "entropy": 5.606961250305176, "epoch": 0.49834662517020034, "grad_norm": 1.015625, "learning_rate": 0.0004980089380409583, "loss": 5.5668, "mean_token_accuracy": 0.15929663628339769, "num_tokens": 11120534.0, "step": 6405 }, { "entropy": 5.7170703411102295, "epoch": 0.4987356545419179, "grad_norm": 1.046875, "learning_rate": 0.0004980052573701424, "loss": 5.4978, "mean_token_accuracy": 0.17221135199069976, "num_tokens": 11128354.0, "step": 6410 }, { "entropy": 5.644919776916504, "epoch": 0.49912468391363546, "grad_norm": 1.0078125, "learning_rate": 0.0004980015733155767, "loss": 5.412, "mean_token_accuracy": 0.16755639761686325, "num_tokens": 11136201.0, "step": 6415 }, { "entropy": 5.673887538909912, "epoch": 0.49951371328535304, "grad_norm": 1.0390625, "learning_rate": 0.0004979978858773171, "loss": 5.3676, "mean_token_accuracy": 0.1745676428079605, "num_tokens": 11145131.0, "step": 6420 }, { "entropy": 5.552023649215698, "epoch": 0.49990274265707063, "grad_norm": 1.0390625, "learning_rate": 0.0004979941950554195, "loss": 5.3054, "mean_token_accuracy": 0.1781318262219429, "num_tokens": 11154514.0, "step": 6425 }, { "entropy": 5.660540771484375, "epoch": 0.5002917720287882, "grad_norm": 0.96875, "learning_rate": 0.0004979905008499399, "loss": 5.3985, "mean_token_accuracy": 0.17282738238573075, "num_tokens": 11163160.0, "step": 6430 }, { "entropy": 5.576961517333984, "epoch": 0.5006808014005057, "grad_norm": 1.0546875, "learning_rate": 0.0004979868032609344, "loss": 5.3869, "mean_token_accuracy": 0.17956127524375914, "num_tokens": 11171573.0, "step": 6435 }, { "entropy": 5.56858458518982, "epoch": 0.5010698307722233, "grad_norm": 0.98046875, "learning_rate": 0.0004979831022884591, "loss": 5.3739, "mean_token_accuracy": 0.17165141701698303, "num_tokens": 11180028.0, "step": 6440 }, { "entropy": 5.55673394203186, "epoch": 0.5014588601439409, "grad_norm": 1.0703125, "learning_rate": 0.0004979793979325701, "loss": 5.2887, "mean_token_accuracy": 0.17160007655620574, "num_tokens": 11188403.0, "step": 6445 }, { "entropy": 5.49115891456604, "epoch": 0.5018478895156584, "grad_norm": 1.0234375, "learning_rate": 0.0004979756901933236, "loss": 5.2994, "mean_token_accuracy": 0.18273988515138626, "num_tokens": 11196391.0, "step": 6450 }, { "entropy": 5.588707399368286, "epoch": 0.502236918887376, "grad_norm": 1.03125, "learning_rate": 0.000497971979070776, "loss": 5.4289, "mean_token_accuracy": 0.1710171401500702, "num_tokens": 11204596.0, "step": 6455 }, { "entropy": 5.60586142539978, "epoch": 0.5026259482590936, "grad_norm": 1.0625, "learning_rate": 0.0004979682645649834, "loss": 5.3772, "mean_token_accuracy": 0.17194198518991471, "num_tokens": 11212629.0, "step": 6460 }, { "entropy": 5.6631279468536375, "epoch": 0.5030149776308112, "grad_norm": 0.99609375, "learning_rate": 0.0004979645466760025, "loss": 5.4461, "mean_token_accuracy": 0.1727239266037941, "num_tokens": 11221836.0, "step": 6465 }, { "entropy": 5.644039964675903, "epoch": 0.5034040070025287, "grad_norm": 1.046875, "learning_rate": 0.0004979608254038892, "loss": 5.5072, "mean_token_accuracy": 0.161077281832695, "num_tokens": 11230600.0, "step": 6470 }, { "entropy": 5.740381383895874, "epoch": 0.5037930363742462, "grad_norm": 0.96875, "learning_rate": 0.0004979571007487003, "loss": 5.4891, "mean_token_accuracy": 0.16057279258966445, "num_tokens": 11239664.0, "step": 6475 }, { "entropy": 5.589925527572632, "epoch": 0.5041820657459638, "grad_norm": 0.984375, "learning_rate": 0.0004979533727104924, "loss": 5.4073, "mean_token_accuracy": 0.1660124585032463, "num_tokens": 11249111.0, "step": 6480 }, { "entropy": 5.558521556854248, "epoch": 0.5045710951176814, "grad_norm": 0.9765625, "learning_rate": 0.000497949641289322, "loss": 5.3128, "mean_token_accuracy": 0.1722047045826912, "num_tokens": 11257599.0, "step": 6485 }, { "entropy": 5.5940399169921875, "epoch": 0.504960124489399, "grad_norm": 1.0, "learning_rate": 0.0004979459064852456, "loss": 5.433, "mean_token_accuracy": 0.18156720101833343, "num_tokens": 11265586.0, "step": 6490 }, { "entropy": 5.708671045303345, "epoch": 0.5053491538611166, "grad_norm": 0.9609375, "learning_rate": 0.0004979421682983197, "loss": 5.5548, "mean_token_accuracy": 0.16661259680986404, "num_tokens": 11274736.0, "step": 6495 }, { "entropy": 5.630670738220215, "epoch": 0.505738183232834, "grad_norm": 1.078125, "learning_rate": 0.0004979384267286015, "loss": 5.3417, "mean_token_accuracy": 0.18198635578155517, "num_tokens": 11282596.0, "step": 6500 }, { "entropy": 5.623176193237304, "epoch": 0.5061272126045516, "grad_norm": 1.0078125, "learning_rate": 0.0004979346817761475, "loss": 5.4219, "mean_token_accuracy": 0.16544625163078308, "num_tokens": 11290974.0, "step": 6505 }, { "entropy": 5.506893968582153, "epoch": 0.5065162419762692, "grad_norm": 0.97265625, "learning_rate": 0.0004979309334410144, "loss": 5.3031, "mean_token_accuracy": 0.17951635420322418, "num_tokens": 11299196.0, "step": 6510 }, { "entropy": 5.595285224914551, "epoch": 0.5069052713479868, "grad_norm": 1.03125, "learning_rate": 0.0004979271817232594, "loss": 5.4252, "mean_token_accuracy": 0.16717837750911713, "num_tokens": 11308214.0, "step": 6515 }, { "entropy": 5.613783502578736, "epoch": 0.5072943007197044, "grad_norm": 1.0078125, "learning_rate": 0.0004979234266229391, "loss": 5.4134, "mean_token_accuracy": 0.17198467999696732, "num_tokens": 11316566.0, "step": 6520 }, { "entropy": 5.5896409034729, "epoch": 0.5076833300914219, "grad_norm": 1.0625, "learning_rate": 0.0004979196681401106, "loss": 5.3964, "mean_token_accuracy": 0.17299696058034897, "num_tokens": 11325079.0, "step": 6525 }, { "entropy": 5.591872882843018, "epoch": 0.5080723594631394, "grad_norm": 1.015625, "learning_rate": 0.000497915906274831, "loss": 5.415, "mean_token_accuracy": 0.16943266242742538, "num_tokens": 11333829.0, "step": 6530 }, { "entropy": 5.550478506088257, "epoch": 0.508461388834857, "grad_norm": 0.9296875, "learning_rate": 0.0004979121410271574, "loss": 5.3552, "mean_token_accuracy": 0.1776174560189247, "num_tokens": 11343078.0, "step": 6535 }, { "entropy": 5.612886571884156, "epoch": 0.5088504182065746, "grad_norm": 0.9765625, "learning_rate": 0.0004979083723971468, "loss": 5.4797, "mean_token_accuracy": 0.1714700222015381, "num_tokens": 11351475.0, "step": 6540 }, { "entropy": 5.579367780685425, "epoch": 0.5092394475782922, "grad_norm": 1.0234375, "learning_rate": 0.0004979046003848564, "loss": 5.3507, "mean_token_accuracy": 0.17437137365341188, "num_tokens": 11359810.0, "step": 6545 }, { "entropy": 5.637637901306152, "epoch": 0.5096284769500097, "grad_norm": 1.0078125, "learning_rate": 0.0004979008249903435, "loss": 5.4018, "mean_token_accuracy": 0.17298720329999923, "num_tokens": 11368585.0, "step": 6550 }, { "entropy": 5.618145275115967, "epoch": 0.5100175063217273, "grad_norm": 1.0390625, "learning_rate": 0.0004978970462136655, "loss": 5.4293, "mean_token_accuracy": 0.17616247981786728, "num_tokens": 11377393.0, "step": 6555 }, { "entropy": 5.609848976135254, "epoch": 0.5104065356934449, "grad_norm": 1.03125, "learning_rate": 0.0004978932640548794, "loss": 5.4073, "mean_token_accuracy": 0.165021151304245, "num_tokens": 11385877.0, "step": 6560 }, { "entropy": 5.553051280975342, "epoch": 0.5107955650651624, "grad_norm": 0.9921875, "learning_rate": 0.0004978894785140429, "loss": 5.3125, "mean_token_accuracy": 0.1768214926123619, "num_tokens": 11394457.0, "step": 6565 }, { "entropy": 5.530999422073364, "epoch": 0.51118459443688, "grad_norm": 1.0546875, "learning_rate": 0.0004978856895912132, "loss": 5.3406, "mean_token_accuracy": 0.17647128850221633, "num_tokens": 11403007.0, "step": 6570 }, { "entropy": 5.6438335418701175, "epoch": 0.5115736238085975, "grad_norm": 0.99609375, "learning_rate": 0.0004978818972864481, "loss": 5.4125, "mean_token_accuracy": 0.16737185269594193, "num_tokens": 11412237.0, "step": 6575 }, { "entropy": 5.6251890659332275, "epoch": 0.5119626531803151, "grad_norm": 0.98828125, "learning_rate": 0.0004978781015998048, "loss": 5.3685, "mean_token_accuracy": 0.16872357279062272, "num_tokens": 11421219.0, "step": 6580 }, { "entropy": 5.618922996520996, "epoch": 0.5123516825520327, "grad_norm": 1.03125, "learning_rate": 0.0004978743025313413, "loss": 5.3626, "mean_token_accuracy": 0.16852298229932786, "num_tokens": 11428933.0, "step": 6585 }, { "entropy": 5.549186086654663, "epoch": 0.5127407119237503, "grad_norm": 1.0390625, "learning_rate": 0.0004978705000811148, "loss": 5.4657, "mean_token_accuracy": 0.16887375563383103, "num_tokens": 11437551.0, "step": 6590 }, { "entropy": 5.6655247688293455, "epoch": 0.5131297412954678, "grad_norm": 1.0703125, "learning_rate": 0.0004978666942491832, "loss": 5.5484, "mean_token_accuracy": 0.16170087456703186, "num_tokens": 11446045.0, "step": 6595 }, { "entropy": 5.709177684783936, "epoch": 0.5135187706671853, "grad_norm": 0.99609375, "learning_rate": 0.0004978628850356043, "loss": 5.4712, "mean_token_accuracy": 0.16923767775297166, "num_tokens": 11455159.0, "step": 6600 }, { "entropy": 5.635027027130127, "epoch": 0.5139078000389029, "grad_norm": 0.99609375, "learning_rate": 0.0004978590724404358, "loss": 5.3689, "mean_token_accuracy": 0.17412376254796982, "num_tokens": 11463835.0, "step": 6605 }, { "entropy": 5.584535932540893, "epoch": 0.5142968294106205, "grad_norm": 1.0078125, "learning_rate": 0.0004978552564637356, "loss": 5.4477, "mean_token_accuracy": 0.1742961212992668, "num_tokens": 11472439.0, "step": 6610 }, { "entropy": 5.613216876983643, "epoch": 0.5146858587823381, "grad_norm": 0.9609375, "learning_rate": 0.0004978514371055616, "loss": 5.482, "mean_token_accuracy": 0.1656497597694397, "num_tokens": 11481626.0, "step": 6615 }, { "entropy": 5.561394691467285, "epoch": 0.5150748881540557, "grad_norm": 0.98828125, "learning_rate": 0.0004978476143659718, "loss": 5.3634, "mean_token_accuracy": 0.17834966033697128, "num_tokens": 11490571.0, "step": 6620 }, { "entropy": 5.6569291114807125, "epoch": 0.5154639175257731, "grad_norm": 1.0390625, "learning_rate": 0.0004978437882450241, "loss": 5.4625, "mean_token_accuracy": 0.1672450289130211, "num_tokens": 11499145.0, "step": 6625 }, { "entropy": 5.643627548217774, "epoch": 0.5158529468974907, "grad_norm": 0.98828125, "learning_rate": 0.0004978399587427766, "loss": 5.399, "mean_token_accuracy": 0.1676664710044861, "num_tokens": 11508133.0, "step": 6630 }, { "entropy": 5.459604072570801, "epoch": 0.5162419762692083, "grad_norm": 0.9453125, "learning_rate": 0.0004978361258592874, "loss": 5.285, "mean_token_accuracy": 0.17830432951450348, "num_tokens": 11516790.0, "step": 6635 }, { "entropy": 5.564607620239258, "epoch": 0.5166310056409259, "grad_norm": 0.9609375, "learning_rate": 0.0004978322895946147, "loss": 5.3745, "mean_token_accuracy": 0.16994131356477737, "num_tokens": 11525963.0, "step": 6640 }, { "entropy": 5.590848112106324, "epoch": 0.5170200350126435, "grad_norm": 1.0234375, "learning_rate": 0.0004978284499488167, "loss": 5.3554, "mean_token_accuracy": 0.17311257421970366, "num_tokens": 11534193.0, "step": 6645 }, { "entropy": 5.609114074707032, "epoch": 0.5174090643843611, "grad_norm": 1.140625, "learning_rate": 0.0004978246069219516, "loss": 5.375, "mean_token_accuracy": 0.16920317709445953, "num_tokens": 11542517.0, "step": 6650 }, { "entropy": 5.574249744415283, "epoch": 0.5177980937560785, "grad_norm": 0.9921875, "learning_rate": 0.0004978207605140777, "loss": 5.4459, "mean_token_accuracy": 0.16738450825214385, "num_tokens": 11550874.0, "step": 6655 }, { "entropy": 5.631093215942383, "epoch": 0.5181871231277961, "grad_norm": 1.0, "learning_rate": 0.0004978169107252534, "loss": 5.4513, "mean_token_accuracy": 0.16461260616779327, "num_tokens": 11560562.0, "step": 6660 }, { "entropy": 5.592811727523804, "epoch": 0.5185761524995137, "grad_norm": 1.046875, "learning_rate": 0.0004978130575555373, "loss": 5.3429, "mean_token_accuracy": 0.17423924505710603, "num_tokens": 11569887.0, "step": 6665 }, { "entropy": 5.5215840339660645, "epoch": 0.5189651818712313, "grad_norm": 1.0, "learning_rate": 0.0004978092010049877, "loss": 5.2705, "mean_token_accuracy": 0.18187254369258882, "num_tokens": 11578608.0, "step": 6670 }, { "entropy": 5.581983661651611, "epoch": 0.5193542112429489, "grad_norm": 0.9296875, "learning_rate": 0.000497805341073663, "loss": 5.3912, "mean_token_accuracy": 0.17022958993911744, "num_tokens": 11587435.0, "step": 6675 }, { "entropy": 5.595023345947266, "epoch": 0.5197432406146664, "grad_norm": 1.0859375, "learning_rate": 0.0004978014777616219, "loss": 5.4862, "mean_token_accuracy": 0.16470641642808914, "num_tokens": 11596094.0, "step": 6680 }, { "entropy": 5.631581449508667, "epoch": 0.520132269986384, "grad_norm": 1.046875, "learning_rate": 0.0004977976110689229, "loss": 5.4378, "mean_token_accuracy": 0.16952349245548248, "num_tokens": 11604521.0, "step": 6685 }, { "entropy": 5.641193103790283, "epoch": 0.5205212993581015, "grad_norm": 0.96484375, "learning_rate": 0.000497793740995625, "loss": 5.4025, "mean_token_accuracy": 0.17098213583230973, "num_tokens": 11613143.0, "step": 6690 }, { "entropy": 5.630144119262695, "epoch": 0.5209103287298191, "grad_norm": 0.97265625, "learning_rate": 0.0004977898675417866, "loss": 5.445, "mean_token_accuracy": 0.17159462794661523, "num_tokens": 11622667.0, "step": 6695 }, { "entropy": 5.602881956100464, "epoch": 0.5212993581015367, "grad_norm": 1.015625, "learning_rate": 0.0004977859907074664, "loss": 5.4167, "mean_token_accuracy": 0.1751892313361168, "num_tokens": 11632114.0, "step": 6700 }, { "entropy": 5.625202655792236, "epoch": 0.5216883874732542, "grad_norm": 1.0546875, "learning_rate": 0.0004977821104927236, "loss": 5.3335, "mean_token_accuracy": 0.17328906655311585, "num_tokens": 11640731.0, "step": 6705 }, { "entropy": 5.5024106979370115, "epoch": 0.5220774168449718, "grad_norm": 0.9375, "learning_rate": 0.0004977782268976167, "loss": 5.3149, "mean_token_accuracy": 0.1757868632674217, "num_tokens": 11648975.0, "step": 6710 }, { "entropy": 5.582853174209594, "epoch": 0.5224664462166894, "grad_norm": 0.99609375, "learning_rate": 0.0004977743399222048, "loss": 5.3494, "mean_token_accuracy": 0.17825236171483994, "num_tokens": 11657598.0, "step": 6715 }, { "entropy": 5.709061145782471, "epoch": 0.522855475588407, "grad_norm": 1.1328125, "learning_rate": 0.0004977704495665471, "loss": 5.5124, "mean_token_accuracy": 0.1737692803144455, "num_tokens": 11665504.0, "step": 6720 }, { "entropy": 5.629387521743775, "epoch": 0.5232445049601245, "grad_norm": 1.1171875, "learning_rate": 0.0004977665558307023, "loss": 5.4329, "mean_token_accuracy": 0.17330906242132188, "num_tokens": 11674337.0, "step": 6725 }, { "entropy": 5.485547828674316, "epoch": 0.523633534331842, "grad_norm": 0.94921875, "learning_rate": 0.0004977626587147295, "loss": 5.2716, "mean_token_accuracy": 0.18216868340969086, "num_tokens": 11682626.0, "step": 6730 }, { "entropy": 5.547606945037842, "epoch": 0.5240225637035596, "grad_norm": 0.9765625, "learning_rate": 0.000497758758218688, "loss": 5.3259, "mean_token_accuracy": 0.1781942442059517, "num_tokens": 11691403.0, "step": 6735 }, { "entropy": 5.651517009735107, "epoch": 0.5244115930752772, "grad_norm": 1.0546875, "learning_rate": 0.0004977548543426368, "loss": 5.4553, "mean_token_accuracy": 0.166091488301754, "num_tokens": 11700590.0, "step": 6740 }, { "entropy": 5.625852966308594, "epoch": 0.5248006224469948, "grad_norm": 1.0390625, "learning_rate": 0.0004977509470866353, "loss": 5.3641, "mean_token_accuracy": 0.16962600648403167, "num_tokens": 11708799.0, "step": 6745 }, { "entropy": 5.567790889739991, "epoch": 0.5251896518187124, "grad_norm": 1.0, "learning_rate": 0.0004977470364507427, "loss": 5.3627, "mean_token_accuracy": 0.17713444232940673, "num_tokens": 11716953.0, "step": 6750 }, { "entropy": 5.605804109573365, "epoch": 0.5255786811904298, "grad_norm": 0.95703125, "learning_rate": 0.0004977431224350184, "loss": 5.4306, "mean_token_accuracy": 0.1685882940888405, "num_tokens": 11725032.0, "step": 6755 }, { "entropy": 5.613562965393067, "epoch": 0.5259677105621474, "grad_norm": 1.0390625, "learning_rate": 0.0004977392050395217, "loss": 5.4337, "mean_token_accuracy": 0.16917459070682525, "num_tokens": 11733359.0, "step": 6760 }, { "entropy": 5.665448999404907, "epoch": 0.526356739933865, "grad_norm": 1.0234375, "learning_rate": 0.0004977352842643121, "loss": 5.4167, "mean_token_accuracy": 0.17600178420543672, "num_tokens": 11740936.0, "step": 6765 }, { "entropy": 5.61443829536438, "epoch": 0.5267457693055826, "grad_norm": 0.92578125, "learning_rate": 0.000497731360109449, "loss": 5.4559, "mean_token_accuracy": 0.16777198761701584, "num_tokens": 11749764.0, "step": 6770 }, { "entropy": 5.64350323677063, "epoch": 0.5271347986773002, "grad_norm": 1.015625, "learning_rate": 0.0004977274325749922, "loss": 5.4631, "mean_token_accuracy": 0.17370951920747757, "num_tokens": 11757945.0, "step": 6775 }, { "entropy": 5.547140598297119, "epoch": 0.5275238280490177, "grad_norm": 1.078125, "learning_rate": 0.0004977235016610011, "loss": 5.3372, "mean_token_accuracy": 0.17899322956800462, "num_tokens": 11766333.0, "step": 6780 }, { "entropy": 5.56026520729065, "epoch": 0.5279128574207352, "grad_norm": 0.921875, "learning_rate": 0.0004977195673675353, "loss": 5.3937, "mean_token_accuracy": 0.17261524647474288, "num_tokens": 11775041.0, "step": 6785 }, { "entropy": 5.610231876373291, "epoch": 0.5283018867924528, "grad_norm": 1.0078125, "learning_rate": 0.0004977156296946545, "loss": 5.377, "mean_token_accuracy": 0.1705646276473999, "num_tokens": 11783958.0, "step": 6790 }, { "entropy": 5.579576539993286, "epoch": 0.5286909161641704, "grad_norm": 1.0234375, "learning_rate": 0.0004977116886424187, "loss": 5.4475, "mean_token_accuracy": 0.16637502908706664, "num_tokens": 11792174.0, "step": 6795 }, { "entropy": 5.5774702548980715, "epoch": 0.529079945535888, "grad_norm": 1.03125, "learning_rate": 0.0004977077442108873, "loss": 5.3465, "mean_token_accuracy": 0.17724884301424026, "num_tokens": 11800514.0, "step": 6800 }, { "entropy": 5.590536308288574, "epoch": 0.5294689749076055, "grad_norm": 0.96875, "learning_rate": 0.0004977037964001204, "loss": 5.2651, "mean_token_accuracy": 0.18220219165086746, "num_tokens": 11808918.0, "step": 6805 }, { "entropy": 5.654633092880249, "epoch": 0.5298580042793231, "grad_norm": 0.984375, "learning_rate": 0.000497699845210178, "loss": 5.5187, "mean_token_accuracy": 0.1643660172820091, "num_tokens": 11818014.0, "step": 6810 }, { "entropy": 5.5917236328125, "epoch": 0.5302470336510406, "grad_norm": 0.95703125, "learning_rate": 0.0004976958906411197, "loss": 5.4426, "mean_token_accuracy": 0.16338089257478713, "num_tokens": 11826477.0, "step": 6815 }, { "entropy": 5.673809576034546, "epoch": 0.5306360630227582, "grad_norm": 0.984375, "learning_rate": 0.0004976919326930059, "loss": 5.4992, "mean_token_accuracy": 0.16627666354179382, "num_tokens": 11835513.0, "step": 6820 }, { "entropy": 5.695989656448364, "epoch": 0.5310250923944758, "grad_norm": 0.98828125, "learning_rate": 0.0004976879713658964, "loss": 5.481, "mean_token_accuracy": 0.17325812727212905, "num_tokens": 11844495.0, "step": 6825 }, { "entropy": 5.628694486618042, "epoch": 0.5314141217661933, "grad_norm": 0.89453125, "learning_rate": 0.0004976840066598514, "loss": 5.4452, "mean_token_accuracy": 0.16433378607034682, "num_tokens": 11853013.0, "step": 6830 }, { "entropy": 5.51334285736084, "epoch": 0.5318031511379109, "grad_norm": 0.9921875, "learning_rate": 0.0004976800385749309, "loss": 5.2287, "mean_token_accuracy": 0.17677582651376725, "num_tokens": 11861899.0, "step": 6835 }, { "entropy": 5.5065830707550045, "epoch": 0.5321921805096285, "grad_norm": 0.92578125, "learning_rate": 0.0004976760671111954, "loss": 5.3119, "mean_token_accuracy": 0.18060407787561417, "num_tokens": 11870836.0, "step": 6840 }, { "entropy": 5.568042039871216, "epoch": 0.532581209881346, "grad_norm": 0.953125, "learning_rate": 0.000497672092268705, "loss": 5.3677, "mean_token_accuracy": 0.16628734916448593, "num_tokens": 11879363.0, "step": 6845 }, { "entropy": 5.6174729347229, "epoch": 0.5329702392530636, "grad_norm": 1.015625, "learning_rate": 0.00049766811404752, "loss": 5.3655, "mean_token_accuracy": 0.17461650520563127, "num_tokens": 11887696.0, "step": 6850 }, { "entropy": 5.585926151275634, "epoch": 0.5333592686247812, "grad_norm": 1.0234375, "learning_rate": 0.0004976641324477008, "loss": 5.3776, "mean_token_accuracy": 0.1717255249619484, "num_tokens": 11895867.0, "step": 6855 }, { "entropy": 5.632009267807007, "epoch": 0.5337482979964987, "grad_norm": 1.0, "learning_rate": 0.0004976601474693077, "loss": 5.3103, "mean_token_accuracy": 0.17238852828741075, "num_tokens": 11904537.0, "step": 6860 }, { "entropy": 5.675828123092652, "epoch": 0.5341373273682163, "grad_norm": 0.94140625, "learning_rate": 0.0004976561591124014, "loss": 5.4333, "mean_token_accuracy": 0.17629104405641555, "num_tokens": 11913097.0, "step": 6865 }, { "entropy": 5.496969223022461, "epoch": 0.5345263567399339, "grad_norm": 0.98046875, "learning_rate": 0.0004976521673770421, "loss": 5.2426, "mean_token_accuracy": 0.17388982623815535, "num_tokens": 11921852.0, "step": 6870 }, { "entropy": 5.594495582580566, "epoch": 0.5349153861116515, "grad_norm": 0.9765625, "learning_rate": 0.0004976481722632907, "loss": 5.427, "mean_token_accuracy": 0.1668204829096794, "num_tokens": 11930836.0, "step": 6875 }, { "entropy": 5.647954893112183, "epoch": 0.535304415483369, "grad_norm": 1.0, "learning_rate": 0.0004976441737712076, "loss": 5.4943, "mean_token_accuracy": 0.1578487128019333, "num_tokens": 11940069.0, "step": 6880 }, { "entropy": 5.67997374534607, "epoch": 0.5356934448550865, "grad_norm": 1.0859375, "learning_rate": 0.0004976401719008536, "loss": 5.4275, "mean_token_accuracy": 0.17309840321540831, "num_tokens": 11948525.0, "step": 6885 }, { "entropy": 5.600617599487305, "epoch": 0.5360824742268041, "grad_norm": 1.0703125, "learning_rate": 0.0004976361666522893, "loss": 5.4058, "mean_token_accuracy": 0.17392354756593703, "num_tokens": 11956912.0, "step": 6890 }, { "entropy": 5.507595109939575, "epoch": 0.5364715035985217, "grad_norm": 1.09375, "learning_rate": 0.0004976321580255755, "loss": 5.5035, "mean_token_accuracy": 0.16616453230381012, "num_tokens": 11965782.0, "step": 6895 }, { "entropy": 5.623979187011718, "epoch": 0.5368605329702393, "grad_norm": 0.9375, "learning_rate": 0.0004976281460207731, "loss": 5.4132, "mean_token_accuracy": 0.17315759211778642, "num_tokens": 11974889.0, "step": 6900 }, { "entropy": 5.655584335327148, "epoch": 0.5372495623419569, "grad_norm": 0.9375, "learning_rate": 0.000497624130637943, "loss": 5.4103, "mean_token_accuracy": 0.1678052067756653, "num_tokens": 11983507.0, "step": 6905 }, { "entropy": 5.534413576126099, "epoch": 0.5376385917136743, "grad_norm": 1.078125, "learning_rate": 0.000497620111877146, "loss": 5.275, "mean_token_accuracy": 0.1823041096329689, "num_tokens": 11991646.0, "step": 6910 }, { "entropy": 5.4777453422546385, "epoch": 0.5380276210853919, "grad_norm": 1.0703125, "learning_rate": 0.0004976160897384431, "loss": 5.3216, "mean_token_accuracy": 0.17367151379585266, "num_tokens": 12000223.0, "step": 6915 }, { "entropy": 5.622479200363159, "epoch": 0.5384166504571095, "grad_norm": 1.1171875, "learning_rate": 0.0004976120642218955, "loss": 5.4153, "mean_token_accuracy": 0.17153375297784806, "num_tokens": 12009012.0, "step": 6920 }, { "entropy": 5.717148637771606, "epoch": 0.5388056798288271, "grad_norm": 0.953125, "learning_rate": 0.000497608035327564, "loss": 5.459, "mean_token_accuracy": 0.16472576260566713, "num_tokens": 12018001.0, "step": 6925 }, { "entropy": 5.5548868656158445, "epoch": 0.5391947092005447, "grad_norm": 1.0703125, "learning_rate": 0.00049760400305551, "loss": 5.2903, "mean_token_accuracy": 0.18364150524139405, "num_tokens": 12025943.0, "step": 6930 }, { "entropy": 5.576215124130249, "epoch": 0.5395837385722622, "grad_norm": 0.9921875, "learning_rate": 0.0004975999674057944, "loss": 5.3333, "mean_token_accuracy": 0.1743236228823662, "num_tokens": 12035073.0, "step": 6935 }, { "entropy": 5.650489425659179, "epoch": 0.5399727679439797, "grad_norm": 0.94921875, "learning_rate": 0.0004975959283784787, "loss": 5.5105, "mean_token_accuracy": 0.16534960120916367, "num_tokens": 12043698.0, "step": 6940 }, { "entropy": 5.6009152889251705, "epoch": 0.5403617973156973, "grad_norm": 0.984375, "learning_rate": 0.0004975918859736241, "loss": 5.3966, "mean_token_accuracy": 0.17727003395557403, "num_tokens": 12052247.0, "step": 6945 }, { "entropy": 5.594502592086792, "epoch": 0.5407508266874149, "grad_norm": 0.97265625, "learning_rate": 0.0004975878401912919, "loss": 5.4101, "mean_token_accuracy": 0.1762482464313507, "num_tokens": 12061187.0, "step": 6950 }, { "entropy": 5.57668399810791, "epoch": 0.5411398560591325, "grad_norm": 1.0234375, "learning_rate": 0.0004975837910315436, "loss": 5.3585, "mean_token_accuracy": 0.170804201066494, "num_tokens": 12070121.0, "step": 6955 }, { "entropy": 5.609505748748779, "epoch": 0.54152888543085, "grad_norm": 1.0078125, "learning_rate": 0.0004975797384944405, "loss": 5.3086, "mean_token_accuracy": 0.18491584211587905, "num_tokens": 12078578.0, "step": 6960 }, { "entropy": 5.585539960861206, "epoch": 0.5419179148025676, "grad_norm": 1.015625, "learning_rate": 0.000497575682580044, "loss": 5.466, "mean_token_accuracy": 0.1712225630879402, "num_tokens": 12087029.0, "step": 6965 }, { "entropy": 5.7061645030975345, "epoch": 0.5423069441742852, "grad_norm": 0.9140625, "learning_rate": 0.000497571623288416, "loss": 5.435, "mean_token_accuracy": 0.16743697375059127, "num_tokens": 12096105.0, "step": 6970 }, { "entropy": 5.756121730804443, "epoch": 0.5426959735460027, "grad_norm": 0.953125, "learning_rate": 0.0004975675606196177, "loss": 5.506, "mean_token_accuracy": 0.16332751214504243, "num_tokens": 12105098.0, "step": 6975 }, { "entropy": 5.599440097808838, "epoch": 0.5430850029177203, "grad_norm": 1.015625, "learning_rate": 0.000497563494573711, "loss": 5.3063, "mean_token_accuracy": 0.17674217969179154, "num_tokens": 12112894.0, "step": 6980 }, { "entropy": 5.5193421840667725, "epoch": 0.5434740322894378, "grad_norm": 1.0, "learning_rate": 0.0004975594251507575, "loss": 5.4403, "mean_token_accuracy": 0.17357636839151383, "num_tokens": 12121457.0, "step": 6985 }, { "entropy": 5.639322137832641, "epoch": 0.5438630616611554, "grad_norm": 1.0234375, "learning_rate": 0.000497555352350819, "loss": 5.3172, "mean_token_accuracy": 0.1768542766571045, "num_tokens": 12129998.0, "step": 6990 }, { "entropy": 5.666340065002442, "epoch": 0.544252091032873, "grad_norm": 1.03125, "learning_rate": 0.0004975512761739572, "loss": 5.389, "mean_token_accuracy": 0.17072022557258607, "num_tokens": 12137861.0, "step": 6995 }, { "entropy": 5.556141805648804, "epoch": 0.5446411204045906, "grad_norm": 0.984375, "learning_rate": 0.000497547196620234, "loss": 5.3912, "mean_token_accuracy": 0.17440045475959778, "num_tokens": 12146294.0, "step": 7000 }, { "entropy": 5.559613847732544, "epoch": 0.5450301497763081, "grad_norm": 1.0078125, "learning_rate": 0.0004975431136897114, "loss": 5.3929, "mean_token_accuracy": 0.17047546803951263, "num_tokens": 12155642.0, "step": 7005 }, { "entropy": 5.735659790039063, "epoch": 0.5454191791480256, "grad_norm": 0.984375, "learning_rate": 0.0004975390273824512, "loss": 5.4939, "mean_token_accuracy": 0.16992603689432145, "num_tokens": 12164709.0, "step": 7010 }, { "entropy": 5.617656564712524, "epoch": 0.5458082085197432, "grad_norm": 0.984375, "learning_rate": 0.0004975349376985155, "loss": 5.3662, "mean_token_accuracy": 0.17637594640254975, "num_tokens": 12173591.0, "step": 7015 }, { "entropy": 5.585110187530518, "epoch": 0.5461972378914608, "grad_norm": 1.09375, "learning_rate": 0.0004975308446379663, "loss": 5.4247, "mean_token_accuracy": 0.1666642650961876, "num_tokens": 12182050.0, "step": 7020 }, { "entropy": 5.649959850311279, "epoch": 0.5465862672631784, "grad_norm": 0.921875, "learning_rate": 0.0004975267482008657, "loss": 5.4722, "mean_token_accuracy": 0.16861061453819276, "num_tokens": 12190870.0, "step": 7025 }, { "entropy": 5.492293834686279, "epoch": 0.546975296634896, "grad_norm": 0.98828125, "learning_rate": 0.000497522648387276, "loss": 5.2108, "mean_token_accuracy": 0.18491959273815156, "num_tokens": 12199624.0, "step": 7030 }, { "entropy": 5.6087899684906, "epoch": 0.5473643260066134, "grad_norm": 1.0546875, "learning_rate": 0.0004975185451972592, "loss": 5.4624, "mean_token_accuracy": 0.16690078377723694, "num_tokens": 12208087.0, "step": 7035 }, { "entropy": 5.680318450927734, "epoch": 0.547753355378331, "grad_norm": 1.0234375, "learning_rate": 0.0004975144386308776, "loss": 5.4131, "mean_token_accuracy": 0.17517598122358322, "num_tokens": 12216531.0, "step": 7040 }, { "entropy": 5.615996551513672, "epoch": 0.5481423847500486, "grad_norm": 1.0, "learning_rate": 0.0004975103286881936, "loss": 5.3705, "mean_token_accuracy": 0.17713344991207122, "num_tokens": 12225094.0, "step": 7045 }, { "entropy": 5.560548114776611, "epoch": 0.5485314141217662, "grad_norm": 0.95703125, "learning_rate": 0.0004975062153692696, "loss": 5.3765, "mean_token_accuracy": 0.17883004546165465, "num_tokens": 12233824.0, "step": 7050 }, { "entropy": 5.554152297973633, "epoch": 0.5489204434934838, "grad_norm": 0.9609375, "learning_rate": 0.0004975020986741678, "loss": 5.2767, "mean_token_accuracy": 0.17529497891664506, "num_tokens": 12242923.0, "step": 7055 }, { "entropy": 5.581981992721557, "epoch": 0.5493094728652014, "grad_norm": 1.015625, "learning_rate": 0.0004974979786029509, "loss": 5.3156, "mean_token_accuracy": 0.17031585723161696, "num_tokens": 12251963.0, "step": 7060 }, { "entropy": 5.586628723144531, "epoch": 0.5496985022369189, "grad_norm": 1.0390625, "learning_rate": 0.0004974938551556814, "loss": 5.4442, "mean_token_accuracy": 0.17018938660621644, "num_tokens": 12260347.0, "step": 7065 }, { "entropy": 5.551030397415161, "epoch": 0.5500875316086364, "grad_norm": 0.9765625, "learning_rate": 0.0004974897283324217, "loss": 5.4813, "mean_token_accuracy": 0.16576917320489884, "num_tokens": 12269156.0, "step": 7070 }, { "entropy": 5.632766628265381, "epoch": 0.550476560980354, "grad_norm": 1.0390625, "learning_rate": 0.0004974855981332343, "loss": 5.3835, "mean_token_accuracy": 0.17017189860343934, "num_tokens": 12277636.0, "step": 7075 }, { "entropy": 5.631530666351319, "epoch": 0.5508655903520716, "grad_norm": 0.96875, "learning_rate": 0.0004974814645581823, "loss": 5.3576, "mean_token_accuracy": 0.17621888518333434, "num_tokens": 12286027.0, "step": 7080 }, { "entropy": 5.633374929428101, "epoch": 0.5512546197237892, "grad_norm": 0.91015625, "learning_rate": 0.0004974773276073282, "loss": 5.4807, "mean_token_accuracy": 0.16844650804996492, "num_tokens": 12295085.0, "step": 7085 }, { "entropy": 5.676600170135498, "epoch": 0.5516436490955067, "grad_norm": 1.0390625, "learning_rate": 0.0004974731872807347, "loss": 5.4533, "mean_token_accuracy": 0.17263481616973878, "num_tokens": 12304275.0, "step": 7090 }, { "entropy": 5.550247097015381, "epoch": 0.5520326784672243, "grad_norm": 1.140625, "learning_rate": 0.0004974690435784647, "loss": 5.2629, "mean_token_accuracy": 0.1946805715560913, "num_tokens": 12312841.0, "step": 7095 }, { "entropy": 5.572363948822021, "epoch": 0.5524217078389418, "grad_norm": 1.015625, "learning_rate": 0.0004974648965005811, "loss": 5.3797, "mean_token_accuracy": 0.16614917069673538, "num_tokens": 12322133.0, "step": 7100 }, { "entropy": 5.581380891799927, "epoch": 0.5528107372106594, "grad_norm": 1.0625, "learning_rate": 0.0004974607460471466, "loss": 5.3535, "mean_token_accuracy": 0.17336255609989165, "num_tokens": 12330502.0, "step": 7105 }, { "entropy": 5.6251250267028805, "epoch": 0.553199766582377, "grad_norm": 1.1015625, "learning_rate": 0.0004974565922182246, "loss": 5.3795, "mean_token_accuracy": 0.17468350678682326, "num_tokens": 12338899.0, "step": 7110 }, { "entropy": 5.556831884384155, "epoch": 0.5535887959540945, "grad_norm": 0.9765625, "learning_rate": 0.0004974524350138777, "loss": 5.3728, "mean_token_accuracy": 0.17247378528118135, "num_tokens": 12348299.0, "step": 7115 }, { "entropy": 5.624515962600708, "epoch": 0.5539778253258121, "grad_norm": 1.015625, "learning_rate": 0.0004974482744341693, "loss": 5.3927, "mean_token_accuracy": 0.17165566980838776, "num_tokens": 12356582.0, "step": 7120 }, { "entropy": 5.673182439804077, "epoch": 0.5543668546975297, "grad_norm": 1.0703125, "learning_rate": 0.0004974441104791624, "loss": 5.4972, "mean_token_accuracy": 0.15884086936712266, "num_tokens": 12366209.0, "step": 7125 }, { "entropy": 5.608900737762451, "epoch": 0.5547558840692473, "grad_norm": 1.0, "learning_rate": 0.0004974399431489201, "loss": 5.4221, "mean_token_accuracy": 0.16073356568813324, "num_tokens": 12374777.0, "step": 7130 }, { "entropy": 5.546727514266967, "epoch": 0.5551449134409648, "grad_norm": 1.0390625, "learning_rate": 0.0004974357724435057, "loss": 5.381, "mean_token_accuracy": 0.16626832336187364, "num_tokens": 12384405.0, "step": 7135 }, { "entropy": 5.6791276931762695, "epoch": 0.5555339428126823, "grad_norm": 0.98828125, "learning_rate": 0.0004974315983629825, "loss": 5.4615, "mean_token_accuracy": 0.16987256854772567, "num_tokens": 12393464.0, "step": 7140 }, { "entropy": 5.695638513565063, "epoch": 0.5559229721843999, "grad_norm": 1.078125, "learning_rate": 0.0004974274209074139, "loss": 5.4619, "mean_token_accuracy": 0.1698928251862526, "num_tokens": 12401917.0, "step": 7145 }, { "entropy": 5.474405193328858, "epoch": 0.5563120015561175, "grad_norm": 1.0234375, "learning_rate": 0.0004974232400768632, "loss": 5.2478, "mean_token_accuracy": 0.1800903260707855, "num_tokens": 12410928.0, "step": 7150 }, { "entropy": 5.548608446121216, "epoch": 0.5567010309278351, "grad_norm": 0.94921875, "learning_rate": 0.0004974190558713939, "loss": 5.3278, "mean_token_accuracy": 0.17504773437976837, "num_tokens": 12419747.0, "step": 7155 }, { "entropy": 5.63728699684143, "epoch": 0.5570900602995527, "grad_norm": 0.98828125, "learning_rate": 0.0004974148682910694, "loss": 5.364, "mean_token_accuracy": 0.17363888621330262, "num_tokens": 12428608.0, "step": 7160 }, { "entropy": 5.69043550491333, "epoch": 0.5574790896712701, "grad_norm": 0.98046875, "learning_rate": 0.0004974106773359533, "loss": 5.4498, "mean_token_accuracy": 0.16662293970584868, "num_tokens": 12437101.0, "step": 7165 }, { "entropy": 5.541791868209839, "epoch": 0.5578681190429877, "grad_norm": 0.89453125, "learning_rate": 0.0004974064830061091, "loss": 5.4083, "mean_token_accuracy": 0.16861678659915924, "num_tokens": 12446813.0, "step": 7170 }, { "entropy": 5.622215843200683, "epoch": 0.5582571484147053, "grad_norm": 1.0546875, "learning_rate": 0.0004974022853016006, "loss": 5.3703, "mean_token_accuracy": 0.17372025400400162, "num_tokens": 12455931.0, "step": 7175 }, { "entropy": 5.6301921844482425, "epoch": 0.5586461777864229, "grad_norm": 1.03125, "learning_rate": 0.0004973980842224913, "loss": 5.3379, "mean_token_accuracy": 0.17587753683328627, "num_tokens": 12463586.0, "step": 7180 }, { "entropy": 5.559577131271363, "epoch": 0.5590352071581405, "grad_norm": 1.0546875, "learning_rate": 0.0004973938797688452, "loss": 5.3626, "mean_token_accuracy": 0.17821425795555115, "num_tokens": 12472063.0, "step": 7185 }, { "entropy": 5.597116994857788, "epoch": 0.559424236529858, "grad_norm": 1.078125, "learning_rate": 0.0004973896719407259, "loss": 5.3745, "mean_token_accuracy": 0.17003683000802994, "num_tokens": 12480763.0, "step": 7190 }, { "entropy": 5.614082002639771, "epoch": 0.5598132659015755, "grad_norm": 0.9609375, "learning_rate": 0.0004973854607381972, "loss": 5.3305, "mean_token_accuracy": 0.1768320009112358, "num_tokens": 12488757.0, "step": 7195 }, { "entropy": 5.5355589389801025, "epoch": 0.5602022952732931, "grad_norm": 1.046875, "learning_rate": 0.0004973812461613232, "loss": 5.3783, "mean_token_accuracy": 0.17371366620063783, "num_tokens": 12497030.0, "step": 7200 }, { "entropy": 5.5868391513824465, "epoch": 0.5605913246450107, "grad_norm": 1.0234375, "learning_rate": 0.0004973770282101677, "loss": 5.397, "mean_token_accuracy": 0.1695732444524765, "num_tokens": 12506067.0, "step": 7205 }, { "entropy": 5.5814941883087155, "epoch": 0.5609803540167283, "grad_norm": 1.0234375, "learning_rate": 0.0004973728068847947, "loss": 5.3318, "mean_token_accuracy": 0.1736765220761299, "num_tokens": 12514246.0, "step": 7210 }, { "entropy": 5.609518241882324, "epoch": 0.5613693833884458, "grad_norm": 0.94140625, "learning_rate": 0.0004973685821852684, "loss": 5.3719, "mean_token_accuracy": 0.17128328680992128, "num_tokens": 12523523.0, "step": 7215 }, { "entropy": 5.615756368637085, "epoch": 0.5617584127601634, "grad_norm": 0.97265625, "learning_rate": 0.0004973643541116528, "loss": 5.3579, "mean_token_accuracy": 0.17098272442817689, "num_tokens": 12532142.0, "step": 7220 }, { "entropy": 5.577594757080078, "epoch": 0.562147442131881, "grad_norm": 1.1171875, "learning_rate": 0.000497360122664012, "loss": 5.4065, "mean_token_accuracy": 0.16962229311466218, "num_tokens": 12540647.0, "step": 7225 }, { "entropy": 5.551422119140625, "epoch": 0.5625364715035985, "grad_norm": 0.95703125, "learning_rate": 0.0004973558878424104, "loss": 5.3217, "mean_token_accuracy": 0.17154066264629364, "num_tokens": 12549010.0, "step": 7230 }, { "entropy": 5.5718786239624025, "epoch": 0.5629255008753161, "grad_norm": 0.94921875, "learning_rate": 0.0004973516496469119, "loss": 5.3123, "mean_token_accuracy": 0.17378498762845992, "num_tokens": 12557428.0, "step": 7235 }, { "entropy": 5.51436676979065, "epoch": 0.5633145302470336, "grad_norm": 0.94921875, "learning_rate": 0.0004973474080775811, "loss": 5.2595, "mean_token_accuracy": 0.17589602768421173, "num_tokens": 12566610.0, "step": 7240 }, { "entropy": 5.515880918502807, "epoch": 0.5637035596187512, "grad_norm": 1.0546875, "learning_rate": 0.0004973431631344824, "loss": 5.3742, "mean_token_accuracy": 0.17670979499816894, "num_tokens": 12576016.0, "step": 7245 }, { "entropy": 5.48199200630188, "epoch": 0.5640925889904688, "grad_norm": 1.0390625, "learning_rate": 0.00049733891481768, "loss": 5.2015, "mean_token_accuracy": 0.18723199367523194, "num_tokens": 12584033.0, "step": 7250 }, { "entropy": 5.607383584976196, "epoch": 0.5644816183621864, "grad_norm": 0.96875, "learning_rate": 0.0004973346631272384, "loss": 5.3339, "mean_token_accuracy": 0.1781315878033638, "num_tokens": 12592784.0, "step": 7255 }, { "entropy": 5.615625619888306, "epoch": 0.5648706477339039, "grad_norm": 1.0625, "learning_rate": 0.0004973304080632222, "loss": 5.4719, "mean_token_accuracy": 0.1671131283044815, "num_tokens": 12601259.0, "step": 7260 }, { "entropy": 5.5404987812042235, "epoch": 0.5652596771056215, "grad_norm": 0.9765625, "learning_rate": 0.000497326149625696, "loss": 5.3057, "mean_token_accuracy": 0.16903193295001984, "num_tokens": 12610264.0, "step": 7265 }, { "entropy": 5.611272859573364, "epoch": 0.565648706477339, "grad_norm": 0.99609375, "learning_rate": 0.0004973218878147244, "loss": 5.312, "mean_token_accuracy": 0.17460647821426392, "num_tokens": 12618817.0, "step": 7270 }, { "entropy": 5.547258949279785, "epoch": 0.5660377358490566, "grad_norm": 1.015625, "learning_rate": 0.0004973176226303719, "loss": 5.3416, "mean_token_accuracy": 0.17069429606199266, "num_tokens": 12627224.0, "step": 7275 }, { "entropy": 5.619957113265992, "epoch": 0.5664267652207742, "grad_norm": 0.96875, "learning_rate": 0.0004973133540727033, "loss": 5.3435, "mean_token_accuracy": 0.1835724949836731, "num_tokens": 12635020.0, "step": 7280 }, { "entropy": 5.6189040184021, "epoch": 0.5668157945924918, "grad_norm": 0.96875, "learning_rate": 0.0004973090821417835, "loss": 5.4567, "mean_token_accuracy": 0.1689133107662201, "num_tokens": 12643821.0, "step": 7285 }, { "entropy": 5.663434267044067, "epoch": 0.5672048239642093, "grad_norm": 1.078125, "learning_rate": 0.0004973048068376772, "loss": 5.4172, "mean_token_accuracy": 0.16706288903951644, "num_tokens": 12652091.0, "step": 7290 }, { "entropy": 5.639904451370239, "epoch": 0.5675938533359268, "grad_norm": 1.0, "learning_rate": 0.0004973005281604492, "loss": 5.4209, "mean_token_accuracy": 0.17488816380500793, "num_tokens": 12661389.0, "step": 7295 }, { "entropy": 5.608521747589111, "epoch": 0.5679828827076444, "grad_norm": 0.953125, "learning_rate": 0.0004972962461101646, "loss": 5.4461, "mean_token_accuracy": 0.17284394204616546, "num_tokens": 12670361.0, "step": 7300 }, { "entropy": 5.547716951370239, "epoch": 0.568371912079362, "grad_norm": 1.0390625, "learning_rate": 0.0004972919606868883, "loss": 5.2478, "mean_token_accuracy": 0.1760653153061867, "num_tokens": 12677765.0, "step": 7305 }, { "entropy": 5.5433228492736815, "epoch": 0.5687609414510796, "grad_norm": 1.03125, "learning_rate": 0.0004972876718906852, "loss": 5.2956, "mean_token_accuracy": 0.18404784053564072, "num_tokens": 12686461.0, "step": 7310 }, { "entropy": 5.5584510326385494, "epoch": 0.5691499708227972, "grad_norm": 0.984375, "learning_rate": 0.0004972833797216206, "loss": 5.3116, "mean_token_accuracy": 0.17475184798240662, "num_tokens": 12694663.0, "step": 7315 }, { "entropy": 5.576896142959595, "epoch": 0.5695390001945146, "grad_norm": 0.96484375, "learning_rate": 0.0004972790841797595, "loss": 5.3838, "mean_token_accuracy": 0.17167252004146577, "num_tokens": 12703659.0, "step": 7320 }, { "entropy": 5.546174049377441, "epoch": 0.5699280295662322, "grad_norm": 1.0234375, "learning_rate": 0.000497274785265167, "loss": 5.3451, "mean_token_accuracy": 0.17827020734548568, "num_tokens": 12711402.0, "step": 7325 }, { "entropy": 5.593303918838501, "epoch": 0.5703170589379498, "grad_norm": 0.98828125, "learning_rate": 0.0004972704829779086, "loss": 5.4083, "mean_token_accuracy": 0.16783702671527861, "num_tokens": 12720500.0, "step": 7330 }, { "entropy": 5.664913368225098, "epoch": 0.5707060883096674, "grad_norm": 0.99609375, "learning_rate": 0.0004972661773180492, "loss": 5.4369, "mean_token_accuracy": 0.1647883877158165, "num_tokens": 12729325.0, "step": 7335 }, { "entropy": 5.6450872898101805, "epoch": 0.571095117681385, "grad_norm": 0.9609375, "learning_rate": 0.0004972618682856545, "loss": 5.4592, "mean_token_accuracy": 0.16735735088586806, "num_tokens": 12738573.0, "step": 7340 }, { "entropy": 5.566001844406128, "epoch": 0.5714841470531025, "grad_norm": 0.9609375, "learning_rate": 0.0004972575558807896, "loss": 5.3145, "mean_token_accuracy": 0.17694940716028212, "num_tokens": 12746608.0, "step": 7345 }, { "entropy": 5.562113475799561, "epoch": 0.57187317642482, "grad_norm": 1.0390625, "learning_rate": 0.0004972532401035201, "loss": 5.3049, "mean_token_accuracy": 0.17716436237096786, "num_tokens": 12754724.0, "step": 7350 }, { "entropy": 5.545844411849975, "epoch": 0.5722622057965376, "grad_norm": 1.0, "learning_rate": 0.0004972489209539114, "loss": 5.3816, "mean_token_accuracy": 0.1792597457766533, "num_tokens": 12762654.0, "step": 7355 }, { "entropy": 5.579734849929809, "epoch": 0.5726512351682552, "grad_norm": 0.98828125, "learning_rate": 0.0004972445984320292, "loss": 5.3944, "mean_token_accuracy": 0.16492784172296523, "num_tokens": 12771615.0, "step": 7360 }, { "entropy": 5.691576433181763, "epoch": 0.5730402645399728, "grad_norm": 1.015625, "learning_rate": 0.0004972402725379388, "loss": 5.4626, "mean_token_accuracy": 0.17010326236486434, "num_tokens": 12780991.0, "step": 7365 }, { "entropy": 5.644831895828247, "epoch": 0.5734292939116903, "grad_norm": 1.015625, "learning_rate": 0.000497235943271706, "loss": 5.3302, "mean_token_accuracy": 0.17996573746204375, "num_tokens": 12789402.0, "step": 7370 }, { "entropy": 5.5373939037322994, "epoch": 0.5738183232834079, "grad_norm": 0.9453125, "learning_rate": 0.0004972316106333966, "loss": 5.3083, "mean_token_accuracy": 0.1795029029250145, "num_tokens": 12798095.0, "step": 7375 }, { "entropy": 5.63902177810669, "epoch": 0.5742073526551255, "grad_norm": 0.9921875, "learning_rate": 0.0004972272746230761, "loss": 5.4044, "mean_token_accuracy": 0.17136958986520767, "num_tokens": 12806976.0, "step": 7380 }, { "entropy": 5.585088205337525, "epoch": 0.574596382026843, "grad_norm": 0.921875, "learning_rate": 0.0004972229352408104, "loss": 5.3162, "mean_token_accuracy": 0.18278878778219224, "num_tokens": 12815228.0, "step": 7385 }, { "entropy": 5.585175561904907, "epoch": 0.5749854113985606, "grad_norm": 0.953125, "learning_rate": 0.0004972185924866655, "loss": 5.4097, "mean_token_accuracy": 0.16959019750356674, "num_tokens": 12823674.0, "step": 7390 }, { "entropy": 5.6082837104797365, "epoch": 0.5753744407702781, "grad_norm": 1.0703125, "learning_rate": 0.0004972142463607071, "loss": 5.512, "mean_token_accuracy": 0.16803084313869476, "num_tokens": 12832810.0, "step": 7395 }, { "entropy": 5.687703227996826, "epoch": 0.5757634701419957, "grad_norm": 0.96484375, "learning_rate": 0.0004972098968630012, "loss": 5.4418, "mean_token_accuracy": 0.16590020209550857, "num_tokens": 12841430.0, "step": 7400 }, { "entropy": 5.609046506881714, "epoch": 0.5761524995137133, "grad_norm": 0.97265625, "learning_rate": 0.0004972055439936137, "loss": 5.3278, "mean_token_accuracy": 0.17771490216255187, "num_tokens": 12850539.0, "step": 7405 }, { "entropy": 5.6279497146606445, "epoch": 0.5765415288854309, "grad_norm": 1.015625, "learning_rate": 0.0004972011877526109, "loss": 5.447, "mean_token_accuracy": 0.17289159595966339, "num_tokens": 12859066.0, "step": 7410 }, { "entropy": 5.52370662689209, "epoch": 0.5769305582571485, "grad_norm": 1.0625, "learning_rate": 0.0004971968281400587, "loss": 5.3349, "mean_token_accuracy": 0.18174415230751037, "num_tokens": 12867603.0, "step": 7415 }, { "entropy": 5.455781126022339, "epoch": 0.5773195876288659, "grad_norm": 0.9921875, "learning_rate": 0.0004971924651560233, "loss": 5.2013, "mean_token_accuracy": 0.18343908637762069, "num_tokens": 12875950.0, "step": 7420 }, { "entropy": 5.640551328659058, "epoch": 0.5777086170005835, "grad_norm": 1.0703125, "learning_rate": 0.0004971880988005709, "loss": 5.4606, "mean_token_accuracy": 0.16838063895702363, "num_tokens": 12884154.0, "step": 7425 }, { "entropy": 5.654052639007569, "epoch": 0.5780976463723011, "grad_norm": 1.0078125, "learning_rate": 0.0004971837290737677, "loss": 5.5061, "mean_token_accuracy": 0.16462810784578324, "num_tokens": 12892515.0, "step": 7430 }, { "entropy": 5.546605968475342, "epoch": 0.5784866757440187, "grad_norm": 1.0078125, "learning_rate": 0.0004971793559756801, "loss": 5.322, "mean_token_accuracy": 0.18057667464017868, "num_tokens": 12900919.0, "step": 7435 }, { "entropy": 5.5282165050506595, "epoch": 0.5788757051157363, "grad_norm": 0.9609375, "learning_rate": 0.0004971749795063744, "loss": 5.2933, "mean_token_accuracy": 0.18205010741949082, "num_tokens": 12909338.0, "step": 7440 }, { "entropy": 5.652127838134765, "epoch": 0.5792647344874537, "grad_norm": 1.0546875, "learning_rate": 0.000497170599665917, "loss": 5.4062, "mean_token_accuracy": 0.1692366525530815, "num_tokens": 12918118.0, "step": 7445 }, { "entropy": 5.635789680480957, "epoch": 0.5796537638591713, "grad_norm": 1.0390625, "learning_rate": 0.0004971662164543743, "loss": 5.4427, "mean_token_accuracy": 0.16868827491998672, "num_tokens": 12926878.0, "step": 7450 }, { "entropy": 5.559504508972168, "epoch": 0.5800427932308889, "grad_norm": 1.078125, "learning_rate": 0.0004971618298718131, "loss": 5.3067, "mean_token_accuracy": 0.17664028257131575, "num_tokens": 12934869.0, "step": 7455 }, { "entropy": 5.508236598968506, "epoch": 0.5804318226026065, "grad_norm": 0.953125, "learning_rate": 0.0004971574399182995, "loss": 5.3606, "mean_token_accuracy": 0.17187800258398056, "num_tokens": 12944281.0, "step": 7460 }, { "entropy": 5.611026191711426, "epoch": 0.5808208519743241, "grad_norm": 0.94140625, "learning_rate": 0.0004971530465939005, "loss": 5.3873, "mean_token_accuracy": 0.17068445384502412, "num_tokens": 12953281.0, "step": 7465 }, { "entropy": 5.613557481765747, "epoch": 0.5812098813460417, "grad_norm": 0.98828125, "learning_rate": 0.0004971486498986825, "loss": 5.3671, "mean_token_accuracy": 0.1724362462759018, "num_tokens": 12962136.0, "step": 7470 }, { "entropy": 5.509874391555786, "epoch": 0.5815989107177592, "grad_norm": 1.0, "learning_rate": 0.0004971442498327124, "loss": 5.3246, "mean_token_accuracy": 0.17531097084283828, "num_tokens": 12971288.0, "step": 7475 }, { "entropy": 5.574598217010498, "epoch": 0.5819879400894767, "grad_norm": 1.09375, "learning_rate": 0.0004971398463960568, "loss": 5.2967, "mean_token_accuracy": 0.1769063279032707, "num_tokens": 12979836.0, "step": 7480 }, { "entropy": 5.564197444915772, "epoch": 0.5823769694611943, "grad_norm": 1.0078125, "learning_rate": 0.0004971354395887827, "loss": 5.3059, "mean_token_accuracy": 0.18093591332435607, "num_tokens": 12988233.0, "step": 7485 }, { "entropy": 5.561965847015381, "epoch": 0.5827659988329119, "grad_norm": 1.078125, "learning_rate": 0.0004971310294109569, "loss": 5.317, "mean_token_accuracy": 0.17434777021408082, "num_tokens": 12997077.0, "step": 7490 }, { "entropy": 5.549249458312988, "epoch": 0.5831550282046295, "grad_norm": 0.984375, "learning_rate": 0.0004971266158626461, "loss": 5.3422, "mean_token_accuracy": 0.17838245630264282, "num_tokens": 13005058.0, "step": 7495 }, { "entropy": 5.6491687297821045, "epoch": 0.583544057576347, "grad_norm": 1.0234375, "learning_rate": 0.0004971221989439177, "loss": 5.4007, "mean_token_accuracy": 0.17415667623281478, "num_tokens": 13013347.0, "step": 7500 }, { "entropy": 5.656944322586059, "epoch": 0.5839330869480646, "grad_norm": 1.0859375, "learning_rate": 0.0004971177786548384, "loss": 5.3388, "mean_token_accuracy": 0.1761828675866127, "num_tokens": 13021555.0, "step": 7505 }, { "entropy": 5.568319988250733, "epoch": 0.5843221163197821, "grad_norm": 1.03125, "learning_rate": 0.0004971133549954753, "loss": 5.414, "mean_token_accuracy": 0.17406437993049623, "num_tokens": 13029817.0, "step": 7510 }, { "entropy": 5.583380794525146, "epoch": 0.5847111456914997, "grad_norm": 1.03125, "learning_rate": 0.0004971089279658954, "loss": 5.3826, "mean_token_accuracy": 0.17224892526865004, "num_tokens": 13038119.0, "step": 7515 }, { "entropy": 5.566053342819214, "epoch": 0.5851001750632173, "grad_norm": 0.95703125, "learning_rate": 0.0004971044975661663, "loss": 5.31, "mean_token_accuracy": 0.17912320643663407, "num_tokens": 13047004.0, "step": 7520 }, { "entropy": 5.577041339874268, "epoch": 0.5854892044349348, "grad_norm": 0.9765625, "learning_rate": 0.0004971000637963549, "loss": 5.2967, "mean_token_accuracy": 0.1811252474784851, "num_tokens": 13055045.0, "step": 7525 }, { "entropy": 5.614419794082641, "epoch": 0.5858782338066524, "grad_norm": 0.95703125, "learning_rate": 0.0004970956266565285, "loss": 5.3933, "mean_token_accuracy": 0.17078788280487062, "num_tokens": 13064535.0, "step": 7530 }, { "entropy": 5.615678119659424, "epoch": 0.58626726317837, "grad_norm": 1.0078125, "learning_rate": 0.0004970911861467544, "loss": 5.4565, "mean_token_accuracy": 0.16273304224014282, "num_tokens": 13073089.0, "step": 7535 }, { "entropy": 5.569165563583374, "epoch": 0.5866562925500876, "grad_norm": 0.9921875, "learning_rate": 0.0004970867422671002, "loss": 5.3926, "mean_token_accuracy": 0.17114685624837875, "num_tokens": 13082161.0, "step": 7540 }, { "entropy": 5.559341335296631, "epoch": 0.5870453219218051, "grad_norm": 0.93359375, "learning_rate": 0.000497082295017633, "loss": 5.261, "mean_token_accuracy": 0.18079383820295333, "num_tokens": 13090632.0, "step": 7545 }, { "entropy": 5.624056482315064, "epoch": 0.5874343512935226, "grad_norm": 1.0859375, "learning_rate": 0.0004970778443984206, "loss": 5.3232, "mean_token_accuracy": 0.17447323203086854, "num_tokens": 13098825.0, "step": 7550 }, { "entropy": 5.634274244308472, "epoch": 0.5878233806652402, "grad_norm": 0.97265625, "learning_rate": 0.0004970733904095303, "loss": 5.3991, "mean_token_accuracy": 0.17641332894563674, "num_tokens": 13107059.0, "step": 7555 }, { "entropy": 5.6285295486450195, "epoch": 0.5882124100369578, "grad_norm": 1.0390625, "learning_rate": 0.0004970689330510298, "loss": 5.4063, "mean_token_accuracy": 0.16372135579586028, "num_tokens": 13116783.0, "step": 7560 }, { "entropy": 5.636148834228516, "epoch": 0.5886014394086754, "grad_norm": 1.0703125, "learning_rate": 0.0004970644723229868, "loss": 5.3586, "mean_token_accuracy": 0.17543469071388246, "num_tokens": 13124998.0, "step": 7565 }, { "entropy": 5.6454380512237545, "epoch": 0.588990468780393, "grad_norm": 1.0390625, "learning_rate": 0.0004970600082254687, "loss": 5.4192, "mean_token_accuracy": 0.1735449880361557, "num_tokens": 13134507.0, "step": 7570 }, { "entropy": 5.549423742294311, "epoch": 0.5893794981521104, "grad_norm": 1.0390625, "learning_rate": 0.0004970555407585436, "loss": 5.3189, "mean_token_accuracy": 0.17249612510204315, "num_tokens": 13143682.0, "step": 7575 }, { "entropy": 5.58020977973938, "epoch": 0.589768527523828, "grad_norm": 1.0078125, "learning_rate": 0.000497051069922279, "loss": 5.4013, "mean_token_accuracy": 0.17372599989175797, "num_tokens": 13151924.0, "step": 7580 }, { "entropy": 5.5826180934906, "epoch": 0.5901575568955456, "grad_norm": 0.99609375, "learning_rate": 0.0004970465957167429, "loss": 5.3322, "mean_token_accuracy": 0.17643746584653855, "num_tokens": 13160853.0, "step": 7585 }, { "entropy": 5.621823501586914, "epoch": 0.5905465862672632, "grad_norm": 1.0, "learning_rate": 0.000497042118142003, "loss": 5.379, "mean_token_accuracy": 0.180886971950531, "num_tokens": 13168993.0, "step": 7590 }, { "entropy": 5.562651824951172, "epoch": 0.5909356156389808, "grad_norm": 1.046875, "learning_rate": 0.0004970376371981275, "loss": 5.3061, "mean_token_accuracy": 0.17483243048191072, "num_tokens": 13177266.0, "step": 7595 }, { "entropy": 5.621056079864502, "epoch": 0.5913246450106983, "grad_norm": 1.0703125, "learning_rate": 0.0004970331528851842, "loss": 5.3839, "mean_token_accuracy": 0.16920152455568313, "num_tokens": 13185328.0, "step": 7600 }, { "entropy": 5.540424346923828, "epoch": 0.5917136743824158, "grad_norm": 0.93359375, "learning_rate": 0.0004970286652032412, "loss": 5.2685, "mean_token_accuracy": 0.18061549067497254, "num_tokens": 13194502.0, "step": 7605 }, { "entropy": 5.563891077041626, "epoch": 0.5921027037541334, "grad_norm": 1.09375, "learning_rate": 0.0004970241741523667, "loss": 5.4074, "mean_token_accuracy": 0.17013546228408813, "num_tokens": 13203745.0, "step": 7610 }, { "entropy": 5.606880235671997, "epoch": 0.592491733125851, "grad_norm": 0.91796875, "learning_rate": 0.0004970196797326286, "loss": 5.4611, "mean_token_accuracy": 0.1726463630795479, "num_tokens": 13213115.0, "step": 7615 }, { "entropy": 5.696786546707154, "epoch": 0.5928807624975686, "grad_norm": 0.9609375, "learning_rate": 0.0004970151819440955, "loss": 5.484, "mean_token_accuracy": 0.167642742395401, "num_tokens": 13222231.0, "step": 7620 }, { "entropy": 5.590134191513061, "epoch": 0.5932697918692861, "grad_norm": 0.9765625, "learning_rate": 0.0004970106807868351, "loss": 5.2815, "mean_token_accuracy": 0.17260773181915284, "num_tokens": 13231346.0, "step": 7625 }, { "entropy": 5.575092601776123, "epoch": 0.5936588212410037, "grad_norm": 0.9765625, "learning_rate": 0.000497006176260916, "loss": 5.4107, "mean_token_accuracy": 0.16619206964969635, "num_tokens": 13240436.0, "step": 7630 }, { "entropy": 5.629506921768188, "epoch": 0.5940478506127213, "grad_norm": 0.98828125, "learning_rate": 0.0004970016683664068, "loss": 5.3303, "mean_token_accuracy": 0.1771960213780403, "num_tokens": 13249501.0, "step": 7635 }, { "entropy": 5.4879992485046385, "epoch": 0.5944368799844388, "grad_norm": 0.9609375, "learning_rate": 0.0004969971571033754, "loss": 5.2579, "mean_token_accuracy": 0.18234076499938964, "num_tokens": 13258322.0, "step": 7640 }, { "entropy": 5.556401205062866, "epoch": 0.5948259093561564, "grad_norm": 1.046875, "learning_rate": 0.0004969926424718906, "loss": 5.4351, "mean_token_accuracy": 0.17190596908330918, "num_tokens": 13267418.0, "step": 7645 }, { "entropy": 5.677619123458863, "epoch": 0.5952149387278739, "grad_norm": 0.95703125, "learning_rate": 0.0004969881244720207, "loss": 5.4237, "mean_token_accuracy": 0.16786353588104247, "num_tokens": 13276243.0, "step": 7650 }, { "entropy": 5.4979438304901125, "epoch": 0.5956039680995915, "grad_norm": 0.94921875, "learning_rate": 0.0004969836031038343, "loss": 5.3041, "mean_token_accuracy": 0.16940934658050538, "num_tokens": 13285611.0, "step": 7655 }, { "entropy": 5.584447860717773, "epoch": 0.5959929974713091, "grad_norm": 0.97265625, "learning_rate": 0.0004969790783674002, "loss": 5.3985, "mean_token_accuracy": 0.17014468610286712, "num_tokens": 13293949.0, "step": 7660 }, { "entropy": 5.576897478103637, "epoch": 0.5963820268430267, "grad_norm": 1.0234375, "learning_rate": 0.0004969745502627868, "loss": 5.3419, "mean_token_accuracy": 0.17507205307483673, "num_tokens": 13302593.0, "step": 7665 }, { "entropy": 5.589267921447754, "epoch": 0.5967710562147442, "grad_norm": 1.0390625, "learning_rate": 0.0004969700187900629, "loss": 5.3911, "mean_token_accuracy": 0.169544081389904, "num_tokens": 13310947.0, "step": 7670 }, { "entropy": 5.620465183258057, "epoch": 0.5971600855864618, "grad_norm": 1.078125, "learning_rate": 0.0004969654839492973, "loss": 5.3729, "mean_token_accuracy": 0.1709015414118767, "num_tokens": 13319233.0, "step": 7675 }, { "entropy": 5.654470491409302, "epoch": 0.5975491149581793, "grad_norm": 0.953125, "learning_rate": 0.0004969609457405588, "loss": 5.464, "mean_token_accuracy": 0.16662180572748184, "num_tokens": 13327979.0, "step": 7680 }, { "entropy": 5.604493188858032, "epoch": 0.5979381443298969, "grad_norm": 0.98046875, "learning_rate": 0.0004969564041639163, "loss": 5.4169, "mean_token_accuracy": 0.17162067741155623, "num_tokens": 13336699.0, "step": 7685 }, { "entropy": 5.585852384567261, "epoch": 0.5983271737016145, "grad_norm": 1.015625, "learning_rate": 0.0004969518592194386, "loss": 5.299, "mean_token_accuracy": 0.1750283420085907, "num_tokens": 13344688.0, "step": 7690 }, { "entropy": 5.544575977325439, "epoch": 0.5987162030733321, "grad_norm": 0.9765625, "learning_rate": 0.0004969473109071946, "loss": 5.3237, "mean_token_accuracy": 0.17674118876457215, "num_tokens": 13353442.0, "step": 7695 }, { "entropy": 5.6312174797058105, "epoch": 0.5991052324450497, "grad_norm": 1.015625, "learning_rate": 0.0004969427592272535, "loss": 5.3944, "mean_token_accuracy": 0.1720339149236679, "num_tokens": 13362388.0, "step": 7700 }, { "entropy": 5.483028316497803, "epoch": 0.5994942618167671, "grad_norm": 0.984375, "learning_rate": 0.0004969382041796843, "loss": 5.196, "mean_token_accuracy": 0.18541455566883086, "num_tokens": 13370796.0, "step": 7705 }, { "entropy": 5.510852098464966, "epoch": 0.5998832911884847, "grad_norm": 0.9375, "learning_rate": 0.000496933645764556, "loss": 5.3521, "mean_token_accuracy": 0.17108747214078904, "num_tokens": 13379733.0, "step": 7710 }, { "entropy": 5.534001636505127, "epoch": 0.6002723205602023, "grad_norm": 0.98046875, "learning_rate": 0.0004969290839819381, "loss": 5.2606, "mean_token_accuracy": 0.1825840100646019, "num_tokens": 13388278.0, "step": 7715 }, { "entropy": 5.6160965919494625, "epoch": 0.6006613499319199, "grad_norm": 1.0, "learning_rate": 0.0004969245188318994, "loss": 5.4387, "mean_token_accuracy": 0.17236709743738174, "num_tokens": 13397461.0, "step": 7720 }, { "entropy": 5.53111891746521, "epoch": 0.6010503793036375, "grad_norm": 1.0078125, "learning_rate": 0.0004969199503145093, "loss": 5.307, "mean_token_accuracy": 0.1779583439230919, "num_tokens": 13406087.0, "step": 7725 }, { "entropy": 5.592005586624145, "epoch": 0.601439408675355, "grad_norm": 0.95703125, "learning_rate": 0.0004969153784298374, "loss": 5.2829, "mean_token_accuracy": 0.1804654434323311, "num_tokens": 13414760.0, "step": 7730 }, { "entropy": 5.533606243133545, "epoch": 0.6018284380470725, "grad_norm": 1.046875, "learning_rate": 0.0004969108031779527, "loss": 5.3577, "mean_token_accuracy": 0.17098020613193513, "num_tokens": 13423574.0, "step": 7735 }, { "entropy": 5.529449605941773, "epoch": 0.6022174674187901, "grad_norm": 0.9453125, "learning_rate": 0.0004969062245589247, "loss": 5.286, "mean_token_accuracy": 0.18063054382801055, "num_tokens": 13431799.0, "step": 7740 }, { "entropy": 5.571295166015625, "epoch": 0.6026064967905077, "grad_norm": 0.96875, "learning_rate": 0.0004969016425728231, "loss": 5.3392, "mean_token_accuracy": 0.17426727712154388, "num_tokens": 13440436.0, "step": 7745 }, { "entropy": 5.569225454330445, "epoch": 0.6029955261622253, "grad_norm": 1.0390625, "learning_rate": 0.0004968970572197172, "loss": 5.2949, "mean_token_accuracy": 0.18219717293977739, "num_tokens": 13449236.0, "step": 7750 }, { "entropy": 5.485515785217285, "epoch": 0.6033845555339428, "grad_norm": 1.015625, "learning_rate": 0.0004968924684996765, "loss": 5.254, "mean_token_accuracy": 0.17624879032373428, "num_tokens": 13457697.0, "step": 7755 }, { "entropy": 5.540696716308593, "epoch": 0.6037735849056604, "grad_norm": 1.046875, "learning_rate": 0.000496887876412771, "loss": 5.3577, "mean_token_accuracy": 0.17585546374320984, "num_tokens": 13465939.0, "step": 7760 }, { "entropy": 5.566684436798096, "epoch": 0.6041626142773779, "grad_norm": 0.9921875, "learning_rate": 0.0004968832809590701, "loss": 5.2813, "mean_token_accuracy": 0.18138911575078964, "num_tokens": 13474154.0, "step": 7765 }, { "entropy": 5.613201427459717, "epoch": 0.6045516436490955, "grad_norm": 0.97265625, "learning_rate": 0.0004968786821386435, "loss": 5.2996, "mean_token_accuracy": 0.17543721199035645, "num_tokens": 13482943.0, "step": 7770 }, { "entropy": 5.597583436965943, "epoch": 0.6049406730208131, "grad_norm": 0.97265625, "learning_rate": 0.0004968740799515611, "loss": 5.4377, "mean_token_accuracy": 0.1688978724181652, "num_tokens": 13491945.0, "step": 7775 }, { "entropy": 5.537314510345459, "epoch": 0.6053297023925306, "grad_norm": 0.96484375, "learning_rate": 0.0004968694743978926, "loss": 5.3675, "mean_token_accuracy": 0.16827480494976044, "num_tokens": 13501277.0, "step": 7780 }, { "entropy": 5.613169622421265, "epoch": 0.6057187317642482, "grad_norm": 0.99609375, "learning_rate": 0.0004968648654777081, "loss": 5.393, "mean_token_accuracy": 0.17645200192928315, "num_tokens": 13509609.0, "step": 7785 }, { "entropy": 5.581654214859009, "epoch": 0.6061077611359658, "grad_norm": 0.96484375, "learning_rate": 0.0004968602531910773, "loss": 5.391, "mean_token_accuracy": 0.16612172424793242, "num_tokens": 13518707.0, "step": 7790 }, { "entropy": 5.587740039825439, "epoch": 0.6064967905076833, "grad_norm": 0.9453125, "learning_rate": 0.0004968556375380704, "loss": 5.3508, "mean_token_accuracy": 0.17670366466045379, "num_tokens": 13527973.0, "step": 7795 }, { "entropy": 5.5790623188018795, "epoch": 0.6068858198794009, "grad_norm": 0.99609375, "learning_rate": 0.0004968510185187571, "loss": 5.288, "mean_token_accuracy": 0.18264268040657045, "num_tokens": 13536580.0, "step": 7800 }, { "entropy": 5.509527015686035, "epoch": 0.6072748492511184, "grad_norm": 1.09375, "learning_rate": 0.000496846396133208, "loss": 5.3231, "mean_token_accuracy": 0.17557021826505662, "num_tokens": 13544826.0, "step": 7805 }, { "entropy": 5.588966751098633, "epoch": 0.607663878622836, "grad_norm": 0.9921875, "learning_rate": 0.0004968417703814928, "loss": 5.3712, "mean_token_accuracy": 0.18416630029678344, "num_tokens": 13552821.0, "step": 7810 }, { "entropy": 5.500114679336548, "epoch": 0.6080529079945536, "grad_norm": 1.03125, "learning_rate": 0.0004968371412636818, "loss": 5.2417, "mean_token_accuracy": 0.17580069303512574, "num_tokens": 13560827.0, "step": 7815 }, { "entropy": 5.547198343276977, "epoch": 0.6084419373662712, "grad_norm": 0.984375, "learning_rate": 0.0004968325087798453, "loss": 5.4232, "mean_token_accuracy": 0.17011705040931702, "num_tokens": 13569311.0, "step": 7820 }, { "entropy": 5.649914121627807, "epoch": 0.6088309667379888, "grad_norm": 1.0, "learning_rate": 0.0004968278729300536, "loss": 5.4098, "mean_token_accuracy": 0.16785431355237962, "num_tokens": 13579035.0, "step": 7825 }, { "entropy": 5.596644639968872, "epoch": 0.6092199961097062, "grad_norm": 1.046875, "learning_rate": 0.0004968232337143769, "loss": 5.3608, "mean_token_accuracy": 0.17886339426040648, "num_tokens": 13587508.0, "step": 7830 }, { "entropy": 5.5370063304901125, "epoch": 0.6096090254814238, "grad_norm": 0.98046875, "learning_rate": 0.0004968185911328858, "loss": 5.4058, "mean_token_accuracy": 0.17701992094516755, "num_tokens": 13596515.0, "step": 7835 }, { "entropy": 5.544048547744751, "epoch": 0.6099980548531414, "grad_norm": 1.015625, "learning_rate": 0.0004968139451856506, "loss": 5.2967, "mean_token_accuracy": 0.1797937497496605, "num_tokens": 13605162.0, "step": 7840 }, { "entropy": 5.561970663070679, "epoch": 0.610387084224859, "grad_norm": 0.8984375, "learning_rate": 0.0004968092958727419, "loss": 5.2798, "mean_token_accuracy": 0.17963772565126418, "num_tokens": 13614398.0, "step": 7845 }, { "entropy": 5.54109377861023, "epoch": 0.6107761135965766, "grad_norm": 1.0234375, "learning_rate": 0.00049680464319423, "loss": 5.2511, "mean_token_accuracy": 0.17509905099868775, "num_tokens": 13622347.0, "step": 7850 }, { "entropy": 5.503065776824951, "epoch": 0.6111651429682942, "grad_norm": 1.046875, "learning_rate": 0.0004967999871501858, "loss": 5.2657, "mean_token_accuracy": 0.17665477693080903, "num_tokens": 13630773.0, "step": 7855 }, { "entropy": 5.551439714431763, "epoch": 0.6115541723400116, "grad_norm": 1.0234375, "learning_rate": 0.0004967953277406798, "loss": 5.2635, "mean_token_accuracy": 0.1790945053100586, "num_tokens": 13639857.0, "step": 7860 }, { "entropy": 5.6004712104797365, "epoch": 0.6119432017117292, "grad_norm": 1.0078125, "learning_rate": 0.0004967906649657828, "loss": 5.3727, "mean_token_accuracy": 0.17795006930828094, "num_tokens": 13649959.0, "step": 7865 }, { "entropy": 5.625068473815918, "epoch": 0.6123322310834468, "grad_norm": 1.1328125, "learning_rate": 0.0004967859988255655, "loss": 5.3995, "mean_token_accuracy": 0.17279022485017775, "num_tokens": 13658072.0, "step": 7870 }, { "entropy": 5.529886484146118, "epoch": 0.6127212604551644, "grad_norm": 1.0, "learning_rate": 0.0004967813293200985, "loss": 5.3382, "mean_token_accuracy": 0.18108959943056108, "num_tokens": 13666816.0, "step": 7875 }, { "entropy": 5.525184059143067, "epoch": 0.613110289826882, "grad_norm": 0.92578125, "learning_rate": 0.0004967766564494529, "loss": 5.1971, "mean_token_accuracy": 0.18741032481193542, "num_tokens": 13675415.0, "step": 7880 }, { "entropy": 5.510573244094848, "epoch": 0.6134993191985995, "grad_norm": 1.0625, "learning_rate": 0.0004967719802136996, "loss": 5.2432, "mean_token_accuracy": 0.18263396471738816, "num_tokens": 13684090.0, "step": 7885 }, { "entropy": 5.516405916213989, "epoch": 0.613888348570317, "grad_norm": 0.98828125, "learning_rate": 0.0004967673006129094, "loss": 5.2915, "mean_token_accuracy": 0.18200115412473677, "num_tokens": 13692515.0, "step": 7890 }, { "entropy": 5.516071128845215, "epoch": 0.6142773779420346, "grad_norm": 1.1171875, "learning_rate": 0.0004967626176471536, "loss": 5.356, "mean_token_accuracy": 0.1775418221950531, "num_tokens": 13700780.0, "step": 7895 }, { "entropy": 5.636789226531983, "epoch": 0.6146664073137522, "grad_norm": 1.0078125, "learning_rate": 0.0004967579313165028, "loss": 5.3535, "mean_token_accuracy": 0.1797405645251274, "num_tokens": 13708638.0, "step": 7900 }, { "entropy": 5.601937341690063, "epoch": 0.6150554366854698, "grad_norm": 0.953125, "learning_rate": 0.0004967532416210284, "loss": 5.3831, "mean_token_accuracy": 0.1653753012418747, "num_tokens": 13717867.0, "step": 7905 }, { "entropy": 5.563804340362549, "epoch": 0.6154444660571873, "grad_norm": 1.0, "learning_rate": 0.0004967485485608016, "loss": 5.3028, "mean_token_accuracy": 0.17676510214805602, "num_tokens": 13727280.0, "step": 7910 }, { "entropy": 5.595907878875733, "epoch": 0.6158334954289049, "grad_norm": 0.9765625, "learning_rate": 0.0004967438521358934, "loss": 5.3475, "mean_token_accuracy": 0.17540148198604583, "num_tokens": 13735255.0, "step": 7915 }, { "entropy": 5.532194900512695, "epoch": 0.6162225248006225, "grad_norm": 1.0078125, "learning_rate": 0.0004967391523463754, "loss": 5.3775, "mean_token_accuracy": 0.17733073532581328, "num_tokens": 13743418.0, "step": 7920 }, { "entropy": 5.543993854522705, "epoch": 0.61661155417234, "grad_norm": 0.96484375, "learning_rate": 0.0004967344491923185, "loss": 5.2762, "mean_token_accuracy": 0.17798438519239426, "num_tokens": 13752714.0, "step": 7925 }, { "entropy": 5.6618695735931395, "epoch": 0.6170005835440576, "grad_norm": 1.0625, "learning_rate": 0.0004967297426737943, "loss": 5.4486, "mean_token_accuracy": 0.16520682275295256, "num_tokens": 13761350.0, "step": 7930 }, { "entropy": 5.5297904968261715, "epoch": 0.6173896129157751, "grad_norm": 0.96875, "learning_rate": 0.0004967250327908742, "loss": 5.2824, "mean_token_accuracy": 0.17875937521457672, "num_tokens": 13769769.0, "step": 7935 }, { "entropy": 5.550059127807617, "epoch": 0.6177786422874927, "grad_norm": 0.95703125, "learning_rate": 0.0004967203195436297, "loss": 5.311, "mean_token_accuracy": 0.17310796827077865, "num_tokens": 13778432.0, "step": 7940 }, { "entropy": 5.5211821556091305, "epoch": 0.6181676716592103, "grad_norm": 0.9921875, "learning_rate": 0.0004967156029321322, "loss": 5.3308, "mean_token_accuracy": 0.17745684683322907, "num_tokens": 13786968.0, "step": 7945 }, { "entropy": 5.61552062034607, "epoch": 0.6185567010309279, "grad_norm": 1.0078125, "learning_rate": 0.0004967108829564532, "loss": 5.4223, "mean_token_accuracy": 0.16451818495988846, "num_tokens": 13795824.0, "step": 7950 }, { "entropy": 5.629518461227417, "epoch": 0.6189457304026454, "grad_norm": 0.93359375, "learning_rate": 0.0004967061596166646, "loss": 5.3494, "mean_token_accuracy": 0.17811042666435242, "num_tokens": 13804748.0, "step": 7955 }, { "entropy": 5.509480619430542, "epoch": 0.6193347597743629, "grad_norm": 1.0390625, "learning_rate": 0.0004967014329128378, "loss": 5.3398, "mean_token_accuracy": 0.17735178172588348, "num_tokens": 13813106.0, "step": 7960 }, { "entropy": 5.555459022521973, "epoch": 0.6197237891460805, "grad_norm": 0.98828125, "learning_rate": 0.0004966967028450448, "loss": 5.3667, "mean_token_accuracy": 0.17630673050880433, "num_tokens": 13821787.0, "step": 7965 }, { "entropy": 5.603826332092285, "epoch": 0.6201128185177981, "grad_norm": 1.0546875, "learning_rate": 0.000496691969413357, "loss": 5.3539, "mean_token_accuracy": 0.17787329405546187, "num_tokens": 13830275.0, "step": 7970 }, { "entropy": 5.557550859451294, "epoch": 0.6205018478895157, "grad_norm": 1.0390625, "learning_rate": 0.0004966872326178466, "loss": 5.2798, "mean_token_accuracy": 0.1828768104314804, "num_tokens": 13838868.0, "step": 7975 }, { "entropy": 5.551296949386597, "epoch": 0.6208908772612333, "grad_norm": 1.03125, "learning_rate": 0.0004966824924585851, "loss": 5.3555, "mean_token_accuracy": 0.17854246348142624, "num_tokens": 13846970.0, "step": 7980 }, { "entropy": 5.613220357894898, "epoch": 0.6212799066329507, "grad_norm": 1.0546875, "learning_rate": 0.0004966777489356448, "loss": 5.4196, "mean_token_accuracy": 0.17233560085296631, "num_tokens": 13856059.0, "step": 7985 }, { "entropy": 5.587001371383667, "epoch": 0.6216689360046683, "grad_norm": 0.95703125, "learning_rate": 0.0004966730020490975, "loss": 5.3059, "mean_token_accuracy": 0.17722841799259187, "num_tokens": 13865461.0, "step": 7990 }, { "entropy": 5.5760759830474855, "epoch": 0.6220579653763859, "grad_norm": 0.96875, "learning_rate": 0.000496668251799015, "loss": 5.2765, "mean_token_accuracy": 0.17371441125869752, "num_tokens": 13874124.0, "step": 7995 }, { "entropy": 5.613064813613891, "epoch": 0.6224469947481035, "grad_norm": 0.99609375, "learning_rate": 0.0004966634981854699, "loss": 5.3814, "mean_token_accuracy": 0.17237360179424285, "num_tokens": 13882952.0, "step": 8000 }, { "entropy": 5.585406970977783, "epoch": 0.6228360241198211, "grad_norm": 1.0, "learning_rate": 0.0004966587412085339, "loss": 5.3293, "mean_token_accuracy": 0.17545945644378663, "num_tokens": 13890687.0, "step": 8005 }, { "entropy": 5.577899980545044, "epoch": 0.6232250534915386, "grad_norm": 0.984375, "learning_rate": 0.0004966539808682793, "loss": 5.4074, "mean_token_accuracy": 0.1689345955848694, "num_tokens": 13899773.0, "step": 8010 }, { "entropy": 5.468811941146851, "epoch": 0.6236140828632561, "grad_norm": 1.046875, "learning_rate": 0.0004966492171647783, "loss": 5.1914, "mean_token_accuracy": 0.18073903769254684, "num_tokens": 13908313.0, "step": 8015 }, { "entropy": 5.554126024246216, "epoch": 0.6240031122349737, "grad_norm": 0.99609375, "learning_rate": 0.0004966444500981032, "loss": 5.3005, "mean_token_accuracy": 0.18334477245807648, "num_tokens": 13916422.0, "step": 8020 }, { "entropy": 5.580251407623291, "epoch": 0.6243921416066913, "grad_norm": 1.03125, "learning_rate": 0.0004966396796683265, "loss": 5.3621, "mean_token_accuracy": 0.17060983330011367, "num_tokens": 13924971.0, "step": 8025 }, { "entropy": 5.572302627563476, "epoch": 0.6247811709784089, "grad_norm": 0.95703125, "learning_rate": 0.0004966349058755204, "loss": 5.2716, "mean_token_accuracy": 0.17709621489048005, "num_tokens": 13933016.0, "step": 8030 }, { "entropy": 5.673058271408081, "epoch": 0.6251702003501264, "grad_norm": 0.984375, "learning_rate": 0.0004966301287197573, "loss": 5.3638, "mean_token_accuracy": 0.17842250913381577, "num_tokens": 13941814.0, "step": 8035 }, { "entropy": 5.531317281723022, "epoch": 0.625559229721844, "grad_norm": 1.0390625, "learning_rate": 0.0004966253482011098, "loss": 5.1933, "mean_token_accuracy": 0.1801487997174263, "num_tokens": 13950344.0, "step": 8040 }, { "entropy": 5.555147981643676, "epoch": 0.6259482590935616, "grad_norm": 1.0546875, "learning_rate": 0.0004966205643196503, "loss": 5.4287, "mean_token_accuracy": 0.1682429000735283, "num_tokens": 13959456.0, "step": 8045 }, { "entropy": 5.592694234848023, "epoch": 0.6263372884652791, "grad_norm": 1.03125, "learning_rate": 0.0004966157770754516, "loss": 5.3065, "mean_token_accuracy": 0.18245015740394593, "num_tokens": 13967303.0, "step": 8050 }, { "entropy": 5.585998249053955, "epoch": 0.6267263178369967, "grad_norm": 0.96875, "learning_rate": 0.000496610986468586, "loss": 5.3509, "mean_token_accuracy": 0.16850290894508363, "num_tokens": 13977138.0, "step": 8055 }, { "entropy": 5.638797283172607, "epoch": 0.6271153472087143, "grad_norm": 1.1015625, "learning_rate": 0.0004966061924991267, "loss": 5.4227, "mean_token_accuracy": 0.17261697947978974, "num_tokens": 13985062.0, "step": 8060 }, { "entropy": 5.668380260467529, "epoch": 0.6275043765804318, "grad_norm": 1.0234375, "learning_rate": 0.000496601395167146, "loss": 5.3426, "mean_token_accuracy": 0.1716477170586586, "num_tokens": 13992923.0, "step": 8065 }, { "entropy": 5.543324136734009, "epoch": 0.6278934059521494, "grad_norm": 1.1015625, "learning_rate": 0.0004965965944727168, "loss": 5.4132, "mean_token_accuracy": 0.16822911947965621, "num_tokens": 14002116.0, "step": 8070 }, { "entropy": 5.580185413360596, "epoch": 0.628282435323867, "grad_norm": 0.953125, "learning_rate": 0.0004965917904159121, "loss": 5.3931, "mean_token_accuracy": 0.17099771350622178, "num_tokens": 14011053.0, "step": 8075 }, { "entropy": 5.630213594436645, "epoch": 0.6286714646955845, "grad_norm": 1.0234375, "learning_rate": 0.0004965869829968046, "loss": 5.3342, "mean_token_accuracy": 0.1766078531742096, "num_tokens": 14019226.0, "step": 8080 }, { "entropy": 5.4770303726196286, "epoch": 0.6290604940673021, "grad_norm": 1.0625, "learning_rate": 0.0004965821722154674, "loss": 5.3391, "mean_token_accuracy": 0.17408648133277893, "num_tokens": 14027630.0, "step": 8085 }, { "entropy": 5.544252061843872, "epoch": 0.6294495234390196, "grad_norm": 0.91015625, "learning_rate": 0.0004965773580719734, "loss": 5.2561, "mean_token_accuracy": 0.18546278923749923, "num_tokens": 14036004.0, "step": 8090 }, { "entropy": 5.5833745956420895, "epoch": 0.6298385528107372, "grad_norm": 1.046875, "learning_rate": 0.0004965725405663957, "loss": 5.3554, "mean_token_accuracy": 0.17322381734848022, "num_tokens": 14045359.0, "step": 8095 }, { "entropy": 5.542785596847534, "epoch": 0.6302275821824548, "grad_norm": 0.9921875, "learning_rate": 0.0004965677196988073, "loss": 5.2898, "mean_token_accuracy": 0.1769864469766617, "num_tokens": 14054099.0, "step": 8100 }, { "entropy": 5.564396667480469, "epoch": 0.6306166115541724, "grad_norm": 1.046875, "learning_rate": 0.0004965628954692815, "loss": 5.3129, "mean_token_accuracy": 0.18053655177354813, "num_tokens": 14062414.0, "step": 8105 }, { "entropy": 5.538123321533203, "epoch": 0.63100564092589, "grad_norm": 1.0078125, "learning_rate": 0.0004965580678778913, "loss": 5.3513, "mean_token_accuracy": 0.17966470420360564, "num_tokens": 14071016.0, "step": 8110 }, { "entropy": 5.558867883682251, "epoch": 0.6313946702976074, "grad_norm": 1.046875, "learning_rate": 0.0004965532369247102, "loss": 5.343, "mean_token_accuracy": 0.17081669420003892, "num_tokens": 14080622.0, "step": 8115 }, { "entropy": 5.537043571472168, "epoch": 0.631783699669325, "grad_norm": 0.9296875, "learning_rate": 0.0004965484026098111, "loss": 5.1584, "mean_token_accuracy": 0.18677742630243302, "num_tokens": 14089500.0, "step": 8120 }, { "entropy": 5.58234395980835, "epoch": 0.6321727290410426, "grad_norm": 1.03125, "learning_rate": 0.0004965435649332679, "loss": 5.4148, "mean_token_accuracy": 0.17902248948812485, "num_tokens": 14098260.0, "step": 8125 }, { "entropy": 5.554372978210449, "epoch": 0.6325617584127602, "grad_norm": 0.94921875, "learning_rate": 0.0004965387238951536, "loss": 5.2376, "mean_token_accuracy": 0.1855595663189888, "num_tokens": 14106561.0, "step": 8130 }, { "entropy": 5.603929567337036, "epoch": 0.6329507877844778, "grad_norm": 1.015625, "learning_rate": 0.0004965338794955418, "loss": 5.338, "mean_token_accuracy": 0.1756177231669426, "num_tokens": 14115049.0, "step": 8135 }, { "entropy": 5.541755533218383, "epoch": 0.6333398171561953, "grad_norm": 0.984375, "learning_rate": 0.0004965290317345061, "loss": 5.2387, "mean_token_accuracy": 0.17843602746725082, "num_tokens": 14123204.0, "step": 8140 }, { "entropy": 5.4808355331420895, "epoch": 0.6337288465279128, "grad_norm": 0.9921875, "learning_rate": 0.0004965241806121198, "loss": 5.2868, "mean_token_accuracy": 0.18215357661247253, "num_tokens": 14132146.0, "step": 8145 }, { "entropy": 5.628285121917725, "epoch": 0.6341178758996304, "grad_norm": 0.9765625, "learning_rate": 0.0004965193261284567, "loss": 5.3899, "mean_token_accuracy": 0.16875875890254974, "num_tokens": 14140839.0, "step": 8150 }, { "entropy": 5.610815334320068, "epoch": 0.634506905271348, "grad_norm": 1.0703125, "learning_rate": 0.0004965144682835904, "loss": 5.3795, "mean_token_accuracy": 0.1781456559896469, "num_tokens": 14149551.0, "step": 8155 }, { "entropy": 5.515106868743897, "epoch": 0.6348959346430656, "grad_norm": 1.078125, "learning_rate": 0.0004965096070775946, "loss": 5.3471, "mean_token_accuracy": 0.1755740150809288, "num_tokens": 14158414.0, "step": 8160 }, { "entropy": 5.577139282226563, "epoch": 0.6352849640147831, "grad_norm": 0.93359375, "learning_rate": 0.0004965047425105431, "loss": 5.3882, "mean_token_accuracy": 0.17380691021680833, "num_tokens": 14167984.0, "step": 8165 }, { "entropy": 5.535385370254517, "epoch": 0.6356739933865007, "grad_norm": 0.98828125, "learning_rate": 0.0004964998745825097, "loss": 5.316, "mean_token_accuracy": 0.17888084948062896, "num_tokens": 14177244.0, "step": 8170 }, { "entropy": 5.588834619522094, "epoch": 0.6360630227582182, "grad_norm": 1.03125, "learning_rate": 0.0004964950032935682, "loss": 5.2512, "mean_token_accuracy": 0.1779651641845703, "num_tokens": 14185754.0, "step": 8175 }, { "entropy": 5.528890562057495, "epoch": 0.6364520521299358, "grad_norm": 1.03125, "learning_rate": 0.0004964901286437927, "loss": 5.2899, "mean_token_accuracy": 0.1799963116645813, "num_tokens": 14194242.0, "step": 8180 }, { "entropy": 5.524556064605713, "epoch": 0.6368410815016534, "grad_norm": 0.97265625, "learning_rate": 0.0004964852506332568, "loss": 5.2153, "mean_token_accuracy": 0.18313002586364746, "num_tokens": 14202496.0, "step": 8185 }, { "entropy": 5.5839591979980465, "epoch": 0.6372301108733709, "grad_norm": 1.0390625, "learning_rate": 0.000496480369262035, "loss": 5.448, "mean_token_accuracy": 0.17073566168546678, "num_tokens": 14210510.0, "step": 8190 }, { "entropy": 5.605168581008911, "epoch": 0.6376191402450885, "grad_norm": 0.953125, "learning_rate": 0.000496475484530201, "loss": 5.4347, "mean_token_accuracy": 0.16247031688690186, "num_tokens": 14219238.0, "step": 8195 }, { "entropy": 5.502722358703613, "epoch": 0.6380081696168061, "grad_norm": 0.96484375, "learning_rate": 0.0004964705964378292, "loss": 5.243, "mean_token_accuracy": 0.18735675364732743, "num_tokens": 14227651.0, "step": 8200 }, { "entropy": 5.496855878829956, "epoch": 0.6383971989885237, "grad_norm": 1.0546875, "learning_rate": 0.0004964657049849934, "loss": 5.2097, "mean_token_accuracy": 0.18215781450271606, "num_tokens": 14236144.0, "step": 8205 }, { "entropy": 5.635563611984253, "epoch": 0.6387862283602412, "grad_norm": 1.0546875, "learning_rate": 0.0004964608101717681, "loss": 5.3734, "mean_token_accuracy": 0.16718583106994628, "num_tokens": 14244706.0, "step": 8210 }, { "entropy": 5.574279880523681, "epoch": 0.6391752577319587, "grad_norm": 1.1015625, "learning_rate": 0.0004964559119982275, "loss": 5.3199, "mean_token_accuracy": 0.18086613714694977, "num_tokens": 14252873.0, "step": 8215 }, { "entropy": 5.576375818252563, "epoch": 0.6395642871036763, "grad_norm": 1.0625, "learning_rate": 0.000496451010464446, "loss": 5.3899, "mean_token_accuracy": 0.1750391438603401, "num_tokens": 14261383.0, "step": 8220 }, { "entropy": 5.475570201873779, "epoch": 0.6399533164753939, "grad_norm": 1.0546875, "learning_rate": 0.0004964461055704978, "loss": 5.1957, "mean_token_accuracy": 0.18437148928642272, "num_tokens": 14270087.0, "step": 8225 }, { "entropy": 5.6076884269714355, "epoch": 0.6403423458471115, "grad_norm": 1.0390625, "learning_rate": 0.0004964411973164574, "loss": 5.3609, "mean_token_accuracy": 0.18397365808486937, "num_tokens": 14278826.0, "step": 8230 }, { "entropy": 5.507570075988769, "epoch": 0.6407313752188291, "grad_norm": 0.9609375, "learning_rate": 0.0004964362857023993, "loss": 5.2796, "mean_token_accuracy": 0.17902056723833085, "num_tokens": 14287554.0, "step": 8235 }, { "entropy": 5.566535139083863, "epoch": 0.6411204045905465, "grad_norm": 0.9296875, "learning_rate": 0.000496431370728398, "loss": 5.2667, "mean_token_accuracy": 0.17709399312734603, "num_tokens": 14295839.0, "step": 8240 }, { "entropy": 5.555580949783325, "epoch": 0.6415094339622641, "grad_norm": 0.98046875, "learning_rate": 0.0004964264523945281, "loss": 5.3024, "mean_token_accuracy": 0.1806720845401287, "num_tokens": 14304831.0, "step": 8245 }, { "entropy": 5.575355482101441, "epoch": 0.6418984633339817, "grad_norm": 0.95703125, "learning_rate": 0.0004964215307008643, "loss": 5.2754, "mean_token_accuracy": 0.17711037695407866, "num_tokens": 14313249.0, "step": 8250 }, { "entropy": 5.573872232437134, "epoch": 0.6422874927056993, "grad_norm": 1.0546875, "learning_rate": 0.0004964166056474811, "loss": 5.3412, "mean_token_accuracy": 0.17384667545557023, "num_tokens": 14321978.0, "step": 8255 }, { "entropy": 5.4906227588653564, "epoch": 0.6426765220774169, "grad_norm": 1.03125, "learning_rate": 0.0004964116772344534, "loss": 5.2501, "mean_token_accuracy": 0.17830630242824555, "num_tokens": 14330379.0, "step": 8260 }, { "entropy": 5.5215977191925045, "epoch": 0.6430655514491345, "grad_norm": 1.03125, "learning_rate": 0.0004964067454618559, "loss": 5.2935, "mean_token_accuracy": 0.18217869699001313, "num_tokens": 14339121.0, "step": 8265 }, { "entropy": 5.504442310333252, "epoch": 0.6434545808208519, "grad_norm": 1.125, "learning_rate": 0.0004964018103297634, "loss": 5.247, "mean_token_accuracy": 0.18260000348091127, "num_tokens": 14347443.0, "step": 8270 }, { "entropy": 5.5835634708404545, "epoch": 0.6438436101925695, "grad_norm": 0.9765625, "learning_rate": 0.0004963968718382509, "loss": 5.3465, "mean_token_accuracy": 0.17404672801494597, "num_tokens": 14356459.0, "step": 8275 }, { "entropy": 5.550328874588013, "epoch": 0.6442326395642871, "grad_norm": 0.9609375, "learning_rate": 0.0004963919299873931, "loss": 5.2589, "mean_token_accuracy": 0.17677343338727952, "num_tokens": 14365359.0, "step": 8280 }, { "entropy": 5.450421857833862, "epoch": 0.6446216689360047, "grad_norm": 1.0859375, "learning_rate": 0.0004963869847772653, "loss": 5.196, "mean_token_accuracy": 0.18321047723293304, "num_tokens": 14373345.0, "step": 8285 }, { "entropy": 5.513602542877197, "epoch": 0.6450106983077223, "grad_norm": 1.0234375, "learning_rate": 0.0004963820362079423, "loss": 5.2799, "mean_token_accuracy": 0.18093516677618027, "num_tokens": 14381977.0, "step": 8290 }, { "entropy": 5.462281084060669, "epoch": 0.6453997276794398, "grad_norm": 0.99609375, "learning_rate": 0.0004963770842794994, "loss": 5.1796, "mean_token_accuracy": 0.1848599746823311, "num_tokens": 14390486.0, "step": 8295 }, { "entropy": 5.5589361667633055, "epoch": 0.6457887570511573, "grad_norm": 0.94140625, "learning_rate": 0.0004963721289920115, "loss": 5.3657, "mean_token_accuracy": 0.17912714034318925, "num_tokens": 14399064.0, "step": 8300 }, { "entropy": 5.539777040481567, "epoch": 0.6461777864228749, "grad_norm": 1.0234375, "learning_rate": 0.0004963671703455538, "loss": 5.2194, "mean_token_accuracy": 0.1839711531996727, "num_tokens": 14406965.0, "step": 8305 }, { "entropy": 5.482750988006591, "epoch": 0.6465668157945925, "grad_norm": 0.94921875, "learning_rate": 0.0004963622083402018, "loss": 5.3649, "mean_token_accuracy": 0.17665068954229354, "num_tokens": 14416293.0, "step": 8310 }, { "entropy": 5.606808519363403, "epoch": 0.6469558451663101, "grad_norm": 1.0234375, "learning_rate": 0.0004963572429760305, "loss": 5.3405, "mean_token_accuracy": 0.17011832147836686, "num_tokens": 14424515.0, "step": 8315 }, { "entropy": 5.556892204284668, "epoch": 0.6473448745380276, "grad_norm": 1.0, "learning_rate": 0.0004963522742531155, "loss": 5.1785, "mean_token_accuracy": 0.18246434181928634, "num_tokens": 14432706.0, "step": 8320 }, { "entropy": 5.480896806716919, "epoch": 0.6477339039097452, "grad_norm": 1.0390625, "learning_rate": 0.000496347302171532, "loss": 5.2834, "mean_token_accuracy": 0.1854716181755066, "num_tokens": 14441462.0, "step": 8325 }, { "entropy": 5.467887020111084, "epoch": 0.6481229332814628, "grad_norm": 1.0234375, "learning_rate": 0.0004963423267313554, "loss": 5.2568, "mean_token_accuracy": 0.1838444337248802, "num_tokens": 14450218.0, "step": 8330 }, { "entropy": 5.616094160079956, "epoch": 0.6485119626531803, "grad_norm": 0.953125, "learning_rate": 0.0004963373479326614, "loss": 5.4552, "mean_token_accuracy": 0.16786930859088897, "num_tokens": 14459825.0, "step": 8335 }, { "entropy": 5.570043230056763, "epoch": 0.6489009920248979, "grad_norm": 0.94921875, "learning_rate": 0.0004963323657755255, "loss": 5.2699, "mean_token_accuracy": 0.17940721809864044, "num_tokens": 14468647.0, "step": 8340 }, { "entropy": 5.465993928909302, "epoch": 0.6492900213966154, "grad_norm": 1.015625, "learning_rate": 0.0004963273802600231, "loss": 5.1626, "mean_token_accuracy": 0.1850014716386795, "num_tokens": 14476892.0, "step": 8345 }, { "entropy": 5.603579473495484, "epoch": 0.649679050768333, "grad_norm": 1.0390625, "learning_rate": 0.00049632239138623, "loss": 5.429, "mean_token_accuracy": 0.17392351776361464, "num_tokens": 14485541.0, "step": 8350 }, { "entropy": 5.520974779129029, "epoch": 0.6500680801400506, "grad_norm": 0.93359375, "learning_rate": 0.0004963173991542219, "loss": 5.2557, "mean_token_accuracy": 0.18615519255399704, "num_tokens": 14494184.0, "step": 8355 }, { "entropy": 5.593913173675537, "epoch": 0.6504571095117682, "grad_norm": 1.0859375, "learning_rate": 0.0004963124035640746, "loss": 5.3781, "mean_token_accuracy": 0.1692001700401306, "num_tokens": 14502151.0, "step": 8360 }, { "entropy": 5.55236496925354, "epoch": 0.6508461388834857, "grad_norm": 1.0234375, "learning_rate": 0.0004963074046158637, "loss": 5.3677, "mean_token_accuracy": 0.18047490417957307, "num_tokens": 14511254.0, "step": 8365 }, { "entropy": 5.6321656703948975, "epoch": 0.6512351682552032, "grad_norm": 1.0078125, "learning_rate": 0.0004963024023096652, "loss": 5.4118, "mean_token_accuracy": 0.16682166159152984, "num_tokens": 14520492.0, "step": 8370 }, { "entropy": 5.631375026702881, "epoch": 0.6516241976269208, "grad_norm": 1.046875, "learning_rate": 0.0004962973966455551, "loss": 5.3601, "mean_token_accuracy": 0.16875505596399307, "num_tokens": 14530082.0, "step": 8375 }, { "entropy": 5.546644496917724, "epoch": 0.6520132269986384, "grad_norm": 0.98046875, "learning_rate": 0.0004962923876236092, "loss": 5.3218, "mean_token_accuracy": 0.17745062112808227, "num_tokens": 14539124.0, "step": 8380 }, { "entropy": 5.607315874099731, "epoch": 0.652402256370356, "grad_norm": 1.0703125, "learning_rate": 0.0004962873752439035, "loss": 5.2968, "mean_token_accuracy": 0.1814492389559746, "num_tokens": 14547780.0, "step": 8385 }, { "entropy": 5.554334831237793, "epoch": 0.6527912857420736, "grad_norm": 0.9921875, "learning_rate": 0.0004962823595065141, "loss": 5.2198, "mean_token_accuracy": 0.1786617323756218, "num_tokens": 14556225.0, "step": 8390 }, { "entropy": 5.594890832901001, "epoch": 0.653180315113791, "grad_norm": 1.1328125, "learning_rate": 0.0004962773404115172, "loss": 5.3183, "mean_token_accuracy": 0.1761225014925003, "num_tokens": 14564147.0, "step": 8395 }, { "entropy": 5.551420640945435, "epoch": 0.6535693444855086, "grad_norm": 1.078125, "learning_rate": 0.0004962723179589886, "loss": 5.3068, "mean_token_accuracy": 0.17587434202432634, "num_tokens": 14573519.0, "step": 8400 }, { "entropy": 5.59135627746582, "epoch": 0.6539583738572262, "grad_norm": 0.9375, "learning_rate": 0.000496267292149005, "loss": 5.4309, "mean_token_accuracy": 0.16442757546901704, "num_tokens": 14582806.0, "step": 8405 }, { "entropy": 5.543904972076416, "epoch": 0.6543474032289438, "grad_norm": 1.0078125, "learning_rate": 0.0004962622629816423, "loss": 5.3068, "mean_token_accuracy": 0.1739957958459854, "num_tokens": 14591274.0, "step": 8410 }, { "entropy": 5.530463457107544, "epoch": 0.6547364326006614, "grad_norm": 1.0546875, "learning_rate": 0.000496257230456977, "loss": 5.3608, "mean_token_accuracy": 0.17313478589057923, "num_tokens": 14599902.0, "step": 8415 }, { "entropy": 5.493044996261597, "epoch": 0.6551254619723789, "grad_norm": 0.953125, "learning_rate": 0.0004962521945750855, "loss": 5.2596, "mean_token_accuracy": 0.17716848850250244, "num_tokens": 14608931.0, "step": 8420 }, { "entropy": 5.530213308334351, "epoch": 0.6555144913440965, "grad_norm": 1.0859375, "learning_rate": 0.000496247155336044, "loss": 5.2194, "mean_token_accuracy": 0.18342820256948472, "num_tokens": 14617547.0, "step": 8425 }, { "entropy": 5.550770044326782, "epoch": 0.655903520715814, "grad_norm": 1.03125, "learning_rate": 0.0004962421127399291, "loss": 5.3447, "mean_token_accuracy": 0.17101119011640548, "num_tokens": 14626523.0, "step": 8430 }, { "entropy": 5.586200857162476, "epoch": 0.6562925500875316, "grad_norm": 0.99609375, "learning_rate": 0.0004962370667868172, "loss": 5.2946, "mean_token_accuracy": 0.1851767346262932, "num_tokens": 14634846.0, "step": 8435 }, { "entropy": 5.528326034545898, "epoch": 0.6566815794592492, "grad_norm": 1.0078125, "learning_rate": 0.0004962320174767851, "loss": 5.294, "mean_token_accuracy": 0.1716813012957573, "num_tokens": 14643092.0, "step": 8440 }, { "entropy": 5.591558742523193, "epoch": 0.6570706088309667, "grad_norm": 0.96875, "learning_rate": 0.000496226964809909, "loss": 5.3704, "mean_token_accuracy": 0.1788558319211006, "num_tokens": 14651456.0, "step": 8445 }, { "entropy": 5.539442729949951, "epoch": 0.6574596382026843, "grad_norm": 0.9375, "learning_rate": 0.000496221908786266, "loss": 5.2565, "mean_token_accuracy": 0.18235833197832108, "num_tokens": 14660488.0, "step": 8450 }, { "entropy": 5.618861961364746, "epoch": 0.6578486675744019, "grad_norm": 0.9609375, "learning_rate": 0.0004962168494059327, "loss": 5.4666, "mean_token_accuracy": 0.17066026628017425, "num_tokens": 14670131.0, "step": 8455 }, { "entropy": 5.613412618637085, "epoch": 0.6582376969461194, "grad_norm": 1.0078125, "learning_rate": 0.0004962117866689857, "loss": 5.2624, "mean_token_accuracy": 0.1764333188533783, "num_tokens": 14678402.0, "step": 8460 }, { "entropy": 5.541571140289307, "epoch": 0.658626726317837, "grad_norm": 1.0078125, "learning_rate": 0.000496206720575502, "loss": 5.2897, "mean_token_accuracy": 0.16646923422813414, "num_tokens": 14687589.0, "step": 8465 }, { "entropy": 5.584652948379516, "epoch": 0.6590157556895546, "grad_norm": 0.9765625, "learning_rate": 0.0004962016511255584, "loss": 5.4188, "mean_token_accuracy": 0.1722184956073761, "num_tokens": 14696288.0, "step": 8470 }, { "entropy": 5.634091234207153, "epoch": 0.6594047850612721, "grad_norm": 0.99609375, "learning_rate": 0.0004961965783192318, "loss": 5.3419, "mean_token_accuracy": 0.17304196506738662, "num_tokens": 14705269.0, "step": 8475 }, { "entropy": 5.558816766738891, "epoch": 0.6597938144329897, "grad_norm": 0.921875, "learning_rate": 0.0004961915021565992, "loss": 5.3162, "mean_token_accuracy": 0.17708727568387986, "num_tokens": 14713669.0, "step": 8480 }, { "entropy": 5.500200891494751, "epoch": 0.6601828438047073, "grad_norm": 0.94140625, "learning_rate": 0.0004961864226377377, "loss": 5.3647, "mean_token_accuracy": 0.17835226505994797, "num_tokens": 14722529.0, "step": 8485 }, { "entropy": 5.575636339187622, "epoch": 0.6605718731764249, "grad_norm": 0.984375, "learning_rate": 0.0004961813397627241, "loss": 5.3458, "mean_token_accuracy": 0.18031770139932632, "num_tokens": 14730956.0, "step": 8490 }, { "entropy": 5.5568760395050045, "epoch": 0.6609609025481424, "grad_norm": 1.0390625, "learning_rate": 0.0004961762535316358, "loss": 5.3101, "mean_token_accuracy": 0.18019221276044844, "num_tokens": 14739320.0, "step": 8495 }, { "entropy": 5.523578739166259, "epoch": 0.6613499319198599, "grad_norm": 0.96484375, "learning_rate": 0.0004961711639445499, "loss": 5.3665, "mean_token_accuracy": 0.17696610540151597, "num_tokens": 14748030.0, "step": 8500 }, { "entropy": 5.552655601501465, "epoch": 0.6617389612915775, "grad_norm": 0.98828125, "learning_rate": 0.0004961660710015435, "loss": 5.2504, "mean_token_accuracy": 0.18410542160272597, "num_tokens": 14756786.0, "step": 8505 }, { "entropy": 5.567683458328247, "epoch": 0.6621279906632951, "grad_norm": 1.0234375, "learning_rate": 0.0004961609747026943, "loss": 5.3213, "mean_token_accuracy": 0.1770300105214119, "num_tokens": 14765538.0, "step": 8510 }, { "entropy": 5.5553281784057615, "epoch": 0.6625170200350127, "grad_norm": 0.953125, "learning_rate": 0.0004961558750480791, "loss": 5.2499, "mean_token_accuracy": 0.18100422173738479, "num_tokens": 14773845.0, "step": 8515 }, { "entropy": 5.499459505081177, "epoch": 0.6629060494067303, "grad_norm": 0.99609375, "learning_rate": 0.0004961507720377756, "loss": 5.2031, "mean_token_accuracy": 0.18550216108560563, "num_tokens": 14782022.0, "step": 8520 }, { "entropy": 5.564083671569824, "epoch": 0.6632950787784477, "grad_norm": 0.99609375, "learning_rate": 0.0004961456656718611, "loss": 5.343, "mean_token_accuracy": 0.18136597871780397, "num_tokens": 14790150.0, "step": 8525 }, { "entropy": 5.549467277526856, "epoch": 0.6636841081501653, "grad_norm": 0.96484375, "learning_rate": 0.000496140555950413, "loss": 5.379, "mean_token_accuracy": 0.17202800512313843, "num_tokens": 14799239.0, "step": 8530 }, { "entropy": 5.526183414459228, "epoch": 0.6640731375218829, "grad_norm": 0.95703125, "learning_rate": 0.0004961354428735091, "loss": 5.3029, "mean_token_accuracy": 0.16849559545516968, "num_tokens": 14808740.0, "step": 8535 }, { "entropy": 5.681412315368652, "epoch": 0.6644621668936005, "grad_norm": 0.98046875, "learning_rate": 0.0004961303264412267, "loss": 5.4267, "mean_token_accuracy": 0.17152373641729354, "num_tokens": 14817329.0, "step": 8540 }, { "entropy": 5.554582118988037, "epoch": 0.6648511962653181, "grad_norm": 0.9921875, "learning_rate": 0.0004961252066536437, "loss": 5.279, "mean_token_accuracy": 0.17454319149255754, "num_tokens": 14826240.0, "step": 8545 }, { "entropy": 5.548708868026734, "epoch": 0.6652402256370356, "grad_norm": 1.0, "learning_rate": 0.0004961200835108375, "loss": 5.299, "mean_token_accuracy": 0.1745982825756073, "num_tokens": 14834471.0, "step": 8550 }, { "entropy": 5.569959831237793, "epoch": 0.6656292550087531, "grad_norm": 0.9921875, "learning_rate": 0.000496114957012886, "loss": 5.304, "mean_token_accuracy": 0.16618645787239075, "num_tokens": 14842724.0, "step": 8555 }, { "entropy": 5.517120409011841, "epoch": 0.6660182843804707, "grad_norm": 0.96875, "learning_rate": 0.0004961098271598671, "loss": 5.218, "mean_token_accuracy": 0.18385373651981354, "num_tokens": 14850725.0, "step": 8560 }, { "entropy": 5.458403539657593, "epoch": 0.6664073137521883, "grad_norm": 1.0, "learning_rate": 0.0004961046939518585, "loss": 5.19, "mean_token_accuracy": 0.18690327554941177, "num_tokens": 14859412.0, "step": 8565 }, { "entropy": 5.5778275489807125, "epoch": 0.6667963431239059, "grad_norm": 1.0703125, "learning_rate": 0.0004960995573889379, "loss": 5.2877, "mean_token_accuracy": 0.17646803557872773, "num_tokens": 14867526.0, "step": 8570 }, { "entropy": 5.488861894607544, "epoch": 0.6671853724956234, "grad_norm": 1.0078125, "learning_rate": 0.0004960944174711836, "loss": 5.1961, "mean_token_accuracy": 0.17473305016756058, "num_tokens": 14875770.0, "step": 8575 }, { "entropy": 5.506997108459473, "epoch": 0.667574401867341, "grad_norm": 1.015625, "learning_rate": 0.0004960892741986734, "loss": 5.2818, "mean_token_accuracy": 0.18370694667100906, "num_tokens": 14883872.0, "step": 8580 }, { "entropy": 5.532104063034057, "epoch": 0.6679634312390585, "grad_norm": 1.046875, "learning_rate": 0.0004960841275714853, "loss": 5.2978, "mean_token_accuracy": 0.17296381145715714, "num_tokens": 14891526.0, "step": 8585 }, { "entropy": 5.5480423927307125, "epoch": 0.6683524606107761, "grad_norm": 1.078125, "learning_rate": 0.0004960789775896975, "loss": 5.3519, "mean_token_accuracy": 0.17991099506616592, "num_tokens": 14900171.0, "step": 8590 }, { "entropy": 5.594220685958862, "epoch": 0.6687414899824937, "grad_norm": 1.0234375, "learning_rate": 0.0004960738242533881, "loss": 5.3147, "mean_token_accuracy": 0.1777023196220398, "num_tokens": 14908537.0, "step": 8595 }, { "entropy": 5.508582925796508, "epoch": 0.6691305193542112, "grad_norm": 0.921875, "learning_rate": 0.0004960686675626353, "loss": 5.2544, "mean_token_accuracy": 0.17995063066482545, "num_tokens": 14917387.0, "step": 8600 }, { "entropy": 5.5501314163208, "epoch": 0.6695195487259288, "grad_norm": 0.99609375, "learning_rate": 0.0004960635075175173, "loss": 5.276, "mean_token_accuracy": 0.17990948408842086, "num_tokens": 14925945.0, "step": 8605 }, { "entropy": 5.539242887496949, "epoch": 0.6699085780976464, "grad_norm": 1.046875, "learning_rate": 0.0004960583441181124, "loss": 5.2811, "mean_token_accuracy": 0.17707243263721467, "num_tokens": 14934002.0, "step": 8610 }, { "entropy": 5.532008934020996, "epoch": 0.670297607469364, "grad_norm": 0.9609375, "learning_rate": 0.0004960531773644992, "loss": 5.316, "mean_token_accuracy": 0.16889427751302719, "num_tokens": 14942658.0, "step": 8615 }, { "entropy": 5.613341426849365, "epoch": 0.6706866368410815, "grad_norm": 0.9921875, "learning_rate": 0.0004960480072567557, "loss": 5.3829, "mean_token_accuracy": 0.17451770156621932, "num_tokens": 14952324.0, "step": 8620 }, { "entropy": 5.624604940414429, "epoch": 0.671075666212799, "grad_norm": 0.88671875, "learning_rate": 0.0004960428337949604, "loss": 5.4182, "mean_token_accuracy": 0.1732550621032715, "num_tokens": 14961964.0, "step": 8625 }, { "entropy": 5.65596866607666, "epoch": 0.6714646955845166, "grad_norm": 0.99609375, "learning_rate": 0.0004960376569791921, "loss": 5.3486, "mean_token_accuracy": 0.1749127060174942, "num_tokens": 14970267.0, "step": 8630 }, { "entropy": 5.4941013813018795, "epoch": 0.6718537249562342, "grad_norm": 1.0, "learning_rate": 0.0004960324768095291, "loss": 5.2082, "mean_token_accuracy": 0.1824185848236084, "num_tokens": 14978546.0, "step": 8635 }, { "entropy": 5.591194486618042, "epoch": 0.6722427543279518, "grad_norm": 1.03125, "learning_rate": 0.0004960272932860502, "loss": 5.2791, "mean_token_accuracy": 0.17944162338972092, "num_tokens": 14986785.0, "step": 8640 }, { "entropy": 5.565518426895141, "epoch": 0.6726317836996694, "grad_norm": 1.0234375, "learning_rate": 0.0004960221064088338, "loss": 5.2121, "mean_token_accuracy": 0.17982794344425201, "num_tokens": 14994873.0, "step": 8645 }, { "entropy": 5.528623771667481, "epoch": 0.6730208130713868, "grad_norm": 1.0703125, "learning_rate": 0.0004960169161779588, "loss": 5.2442, "mean_token_accuracy": 0.18907042294740678, "num_tokens": 15003108.0, "step": 8650 }, { "entropy": 5.401618480682373, "epoch": 0.6734098424431044, "grad_norm": 0.96875, "learning_rate": 0.0004960117225935038, "loss": 5.1494, "mean_token_accuracy": 0.18058359175920485, "num_tokens": 15011802.0, "step": 8655 }, { "entropy": 5.530126285552979, "epoch": 0.673798871814822, "grad_norm": 0.9453125, "learning_rate": 0.0004960065256555477, "loss": 5.3056, "mean_token_accuracy": 0.17976801544427873, "num_tokens": 15020785.0, "step": 8660 }, { "entropy": 5.646392774581909, "epoch": 0.6741879011865396, "grad_norm": 0.9921875, "learning_rate": 0.0004960013253641695, "loss": 5.3922, "mean_token_accuracy": 0.17093995064496995, "num_tokens": 15029218.0, "step": 8665 }, { "entropy": 5.60396032333374, "epoch": 0.6745769305582572, "grad_norm": 1.0078125, "learning_rate": 0.0004959961217194477, "loss": 5.3492, "mean_token_accuracy": 0.16516607105731965, "num_tokens": 15037843.0, "step": 8670 }, { "entropy": 5.530879878997803, "epoch": 0.6749659599299748, "grad_norm": 0.94140625, "learning_rate": 0.0004959909147214615, "loss": 5.2725, "mean_token_accuracy": 0.18173045814037322, "num_tokens": 15047053.0, "step": 8675 }, { "entropy": 5.571678161621094, "epoch": 0.6753549893016922, "grad_norm": 0.92578125, "learning_rate": 0.0004959857043702902, "loss": 5.3923, "mean_token_accuracy": 0.17267663776874542, "num_tokens": 15056159.0, "step": 8680 }, { "entropy": 5.560159969329834, "epoch": 0.6757440186734098, "grad_norm": 1.015625, "learning_rate": 0.0004959804906660124, "loss": 5.3358, "mean_token_accuracy": 0.16832655519247056, "num_tokens": 15064853.0, "step": 8685 }, { "entropy": 5.582832288742066, "epoch": 0.6761330480451274, "grad_norm": 1.0390625, "learning_rate": 0.0004959752736087073, "loss": 5.3437, "mean_token_accuracy": 0.17521180510520934, "num_tokens": 15072671.0, "step": 8690 }, { "entropy": 5.525656604766846, "epoch": 0.676522077416845, "grad_norm": 1.0234375, "learning_rate": 0.0004959700531984543, "loss": 5.2552, "mean_token_accuracy": 0.18609519004821778, "num_tokens": 15080787.0, "step": 8695 }, { "entropy": 5.537931632995606, "epoch": 0.6769111067885626, "grad_norm": 0.97265625, "learning_rate": 0.0004959648294353324, "loss": 5.337, "mean_token_accuracy": 0.17343332022428512, "num_tokens": 15089906.0, "step": 8700 }, { "entropy": 5.553527593612671, "epoch": 0.6773001361602801, "grad_norm": 1.015625, "learning_rate": 0.0004959596023194208, "loss": 5.3828, "mean_token_accuracy": 0.17819689959287643, "num_tokens": 15099329.0, "step": 8705 }, { "entropy": 5.594941329956055, "epoch": 0.6776891655319977, "grad_norm": 0.94140625, "learning_rate": 0.000495954371850799, "loss": 5.3673, "mean_token_accuracy": 0.17315385341644288, "num_tokens": 15107744.0, "step": 8710 }, { "entropy": 5.612883567810059, "epoch": 0.6780781949037152, "grad_norm": 1.0625, "learning_rate": 0.0004959491380295463, "loss": 5.383, "mean_token_accuracy": 0.1757282093167305, "num_tokens": 15115918.0, "step": 8715 }, { "entropy": 5.57036247253418, "epoch": 0.6784672242754328, "grad_norm": 0.98046875, "learning_rate": 0.0004959439008557422, "loss": 5.2432, "mean_token_accuracy": 0.18154032826423644, "num_tokens": 15124074.0, "step": 8720 }, { "entropy": 5.531103658676147, "epoch": 0.6788562536471504, "grad_norm": 1.0390625, "learning_rate": 0.000495938660329466, "loss": 5.2554, "mean_token_accuracy": 0.18637112081050872, "num_tokens": 15132402.0, "step": 8725 }, { "entropy": 5.5278421401977536, "epoch": 0.6792452830188679, "grad_norm": 0.90234375, "learning_rate": 0.0004959334164507973, "loss": 5.381, "mean_token_accuracy": 0.17353248447179795, "num_tokens": 15141640.0, "step": 8730 }, { "entropy": 5.59519329071045, "epoch": 0.6796343123905855, "grad_norm": 1.046875, "learning_rate": 0.0004959281692198155, "loss": 5.261, "mean_token_accuracy": 0.18473790287971498, "num_tokens": 15149919.0, "step": 8735 }, { "entropy": 5.491541719436645, "epoch": 0.6800233417623031, "grad_norm": 1.0625, "learning_rate": 0.0004959229186366007, "loss": 5.1076, "mean_token_accuracy": 0.19363221228122712, "num_tokens": 15157536.0, "step": 8740 }, { "entropy": 5.456545400619507, "epoch": 0.6804123711340206, "grad_norm": 1.0390625, "learning_rate": 0.000495917664701232, "loss": 5.3419, "mean_token_accuracy": 0.17189399525523186, "num_tokens": 15165848.0, "step": 8745 }, { "entropy": 5.569458913803101, "epoch": 0.6808014005057382, "grad_norm": 1.03125, "learning_rate": 0.0004959124074137894, "loss": 5.324, "mean_token_accuracy": 0.17281854897737503, "num_tokens": 15174799.0, "step": 8750 }, { "entropy": 5.636410856246949, "epoch": 0.6811904298774557, "grad_norm": 1.015625, "learning_rate": 0.0004959071467743526, "loss": 5.4293, "mean_token_accuracy": 0.17031558603048325, "num_tokens": 15183695.0, "step": 8755 }, { "entropy": 5.664930534362793, "epoch": 0.6815794592491733, "grad_norm": 0.9296875, "learning_rate": 0.0004959018827830016, "loss": 5.4388, "mean_token_accuracy": 0.17168623954057693, "num_tokens": 15193620.0, "step": 8760 }, { "entropy": 5.611712694168091, "epoch": 0.6819684886208909, "grad_norm": 0.99609375, "learning_rate": 0.000495896615439816, "loss": 5.2593, "mean_token_accuracy": 0.1811678811907768, "num_tokens": 15201535.0, "step": 8765 }, { "entropy": 5.654981660842895, "epoch": 0.6823575179926085, "grad_norm": 0.984375, "learning_rate": 0.0004958913447448759, "loss": 5.406, "mean_token_accuracy": 0.1682290881872177, "num_tokens": 15209678.0, "step": 8770 }, { "entropy": 5.486663866043091, "epoch": 0.682746547364326, "grad_norm": 1.0390625, "learning_rate": 0.0004958860706982613, "loss": 5.2933, "mean_token_accuracy": 0.17819326519966125, "num_tokens": 15218579.0, "step": 8775 }, { "entropy": 5.437908411026001, "epoch": 0.6831355767360435, "grad_norm": 0.95703125, "learning_rate": 0.000495880793300052, "loss": 5.2003, "mean_token_accuracy": 0.1872469514608383, "num_tokens": 15227225.0, "step": 8780 }, { "entropy": 5.575411701202393, "epoch": 0.6835246061077611, "grad_norm": 0.93359375, "learning_rate": 0.0004958755125503284, "loss": 5.3169, "mean_token_accuracy": 0.17595237642526626, "num_tokens": 15235900.0, "step": 8785 }, { "entropy": 5.615043497085571, "epoch": 0.6839136354794787, "grad_norm": 1.0390625, "learning_rate": 0.0004958702284491703, "loss": 5.2745, "mean_token_accuracy": 0.1787177413702011, "num_tokens": 15244538.0, "step": 8790 }, { "entropy": 5.476218605041504, "epoch": 0.6843026648511963, "grad_norm": 1.0625, "learning_rate": 0.0004958649409966581, "loss": 5.2536, "mean_token_accuracy": 0.18225927352905275, "num_tokens": 15252902.0, "step": 8795 }, { "entropy": 5.539601230621338, "epoch": 0.6846916942229139, "grad_norm": 1.015625, "learning_rate": 0.000495859650192872, "loss": 5.4068, "mean_token_accuracy": 0.16932478845119475, "num_tokens": 15261514.0, "step": 8800 }, { "entropy": 5.595240354537964, "epoch": 0.6850807235946313, "grad_norm": 1.0546875, "learning_rate": 0.0004958543560378922, "loss": 5.3335, "mean_token_accuracy": 0.17627801597118378, "num_tokens": 15270140.0, "step": 8805 }, { "entropy": 5.552701330184936, "epoch": 0.6854697529663489, "grad_norm": 0.953125, "learning_rate": 0.0004958490585317991, "loss": 5.2879, "mean_token_accuracy": 0.17693503946065903, "num_tokens": 15279551.0, "step": 8810 }, { "entropy": 5.494368410110473, "epoch": 0.6858587823380665, "grad_norm": 0.98828125, "learning_rate": 0.000495843757674673, "loss": 5.2693, "mean_token_accuracy": 0.1851952090859413, "num_tokens": 15288767.0, "step": 8815 }, { "entropy": 5.5630992412567135, "epoch": 0.6862478117097841, "grad_norm": 1.0390625, "learning_rate": 0.0004958384534665945, "loss": 5.2907, "mean_token_accuracy": 0.1815930113196373, "num_tokens": 15297713.0, "step": 8820 }, { "entropy": 5.571929407119751, "epoch": 0.6866368410815017, "grad_norm": 1.0234375, "learning_rate": 0.0004958331459076438, "loss": 5.2981, "mean_token_accuracy": 0.17549618035554887, "num_tokens": 15306139.0, "step": 8825 }, { "entropy": 5.621170234680176, "epoch": 0.6870258704532192, "grad_norm": 0.95703125, "learning_rate": 0.0004958278349979018, "loss": 5.3584, "mean_token_accuracy": 0.17428736686706542, "num_tokens": 15315015.0, "step": 8830 }, { "entropy": 5.564057683944702, "epoch": 0.6874148998249368, "grad_norm": 1.015625, "learning_rate": 0.0004958225207374488, "loss": 5.2324, "mean_token_accuracy": 0.1814328208565712, "num_tokens": 15323366.0, "step": 8835 }, { "entropy": 5.493619823455811, "epoch": 0.6878039291966543, "grad_norm": 1.0390625, "learning_rate": 0.0004958172031263655, "loss": 5.2192, "mean_token_accuracy": 0.1869863450527191, "num_tokens": 15331135.0, "step": 8840 }, { "entropy": 5.50973072052002, "epoch": 0.6881929585683719, "grad_norm": 1.078125, "learning_rate": 0.0004958118821647326, "loss": 5.2526, "mean_token_accuracy": 0.18131258487701415, "num_tokens": 15339561.0, "step": 8845 }, { "entropy": 5.563919305801392, "epoch": 0.6885819879400895, "grad_norm": 1.0625, "learning_rate": 0.0004958065578526308, "loss": 5.146, "mean_token_accuracy": 0.18987538367509843, "num_tokens": 15348000.0, "step": 8850 }, { "entropy": 5.597847843170166, "epoch": 0.688971017311807, "grad_norm": 1.15625, "learning_rate": 0.000495801230190141, "loss": 5.3535, "mean_token_accuracy": 0.1803091585636139, "num_tokens": 15355916.0, "step": 8855 }, { "entropy": 5.417778778076172, "epoch": 0.6893600466835246, "grad_norm": 1.046875, "learning_rate": 0.0004957958991773441, "loss": 5.1951, "mean_token_accuracy": 0.17953578978776932, "num_tokens": 15364561.0, "step": 8860 }, { "entropy": 5.5490752220153805, "epoch": 0.6897490760552422, "grad_norm": 1.1015625, "learning_rate": 0.0004957905648143206, "loss": 5.2359, "mean_token_accuracy": 0.17897392362356185, "num_tokens": 15372582.0, "step": 8865 }, { "entropy": 5.545386743545532, "epoch": 0.6901381054269597, "grad_norm": 0.9921875, "learning_rate": 0.0004957852271011519, "loss": 5.3297, "mean_token_accuracy": 0.1711472824215889, "num_tokens": 15381684.0, "step": 8870 }, { "entropy": 5.6327790260314945, "epoch": 0.6905271347986773, "grad_norm": 0.94921875, "learning_rate": 0.0004957798860379187, "loss": 5.3492, "mean_token_accuracy": 0.1704866975545883, "num_tokens": 15390858.0, "step": 8875 }, { "entropy": 5.549315643310547, "epoch": 0.6909161641703949, "grad_norm": 0.98828125, "learning_rate": 0.0004957745416247022, "loss": 5.175, "mean_token_accuracy": 0.18461504131555556, "num_tokens": 15399439.0, "step": 8880 }, { "entropy": 5.481848478317261, "epoch": 0.6913051935421124, "grad_norm": 0.984375, "learning_rate": 0.0004957691938615833, "loss": 5.2553, "mean_token_accuracy": 0.18324231952428818, "num_tokens": 15407784.0, "step": 8885 }, { "entropy": 5.619164657592774, "epoch": 0.69169422291383, "grad_norm": 1.0078125, "learning_rate": 0.0004957638427486434, "loss": 5.3771, "mean_token_accuracy": 0.1737549901008606, "num_tokens": 15415985.0, "step": 8890 }, { "entropy": 5.524836540222168, "epoch": 0.6920832522855476, "grad_norm": 0.96875, "learning_rate": 0.0004957584882859636, "loss": 5.2655, "mean_token_accuracy": 0.18107877522706986, "num_tokens": 15424433.0, "step": 8895 }, { "entropy": 5.529126119613648, "epoch": 0.6924722816572652, "grad_norm": 0.9609375, "learning_rate": 0.0004957531304736251, "loss": 5.3518, "mean_token_accuracy": 0.17498830556869507, "num_tokens": 15433041.0, "step": 8900 }, { "entropy": 5.493073415756226, "epoch": 0.6928613110289827, "grad_norm": 1.046875, "learning_rate": 0.0004957477693117091, "loss": 5.1882, "mean_token_accuracy": 0.17712959349155427, "num_tokens": 15441159.0, "step": 8905 }, { "entropy": 5.6728880405426025, "epoch": 0.6932503404007002, "grad_norm": 1.0078125, "learning_rate": 0.0004957424048002971, "loss": 5.503, "mean_token_accuracy": 0.17157228887081147, "num_tokens": 15450687.0, "step": 8910 }, { "entropy": 5.490257120132446, "epoch": 0.6936393697724178, "grad_norm": 0.9609375, "learning_rate": 0.0004957370369394706, "loss": 5.2117, "mean_token_accuracy": 0.1827506020665169, "num_tokens": 15460450.0, "step": 8915 }, { "entropy": 5.500311231613159, "epoch": 0.6940283991441354, "grad_norm": 1.109375, "learning_rate": 0.0004957316657293107, "loss": 5.2392, "mean_token_accuracy": 0.18319796472787858, "num_tokens": 15468435.0, "step": 8920 }, { "entropy": 5.488282489776611, "epoch": 0.694417428515853, "grad_norm": 0.984375, "learning_rate": 0.0004957262911698992, "loss": 5.2068, "mean_token_accuracy": 0.18449322432279586, "num_tokens": 15476232.0, "step": 8925 }, { "entropy": 5.606828832626343, "epoch": 0.6948064578875706, "grad_norm": 0.99609375, "learning_rate": 0.0004957209132613175, "loss": 5.3058, "mean_token_accuracy": 0.181530599296093, "num_tokens": 15484569.0, "step": 8930 }, { "entropy": 5.541490125656128, "epoch": 0.695195487259288, "grad_norm": 1.0234375, "learning_rate": 0.0004957155320036473, "loss": 5.2239, "mean_token_accuracy": 0.1850089207291603, "num_tokens": 15492583.0, "step": 8935 }, { "entropy": 5.5534101009368895, "epoch": 0.6955845166310056, "grad_norm": 0.98046875, "learning_rate": 0.0004957101473969702, "loss": 5.3658, "mean_token_accuracy": 0.17595504075288773, "num_tokens": 15501722.0, "step": 8940 }, { "entropy": 5.581349658966064, "epoch": 0.6959735460027232, "grad_norm": 1.109375, "learning_rate": 0.000495704759441368, "loss": 5.306, "mean_token_accuracy": 0.17931180596351623, "num_tokens": 15509682.0, "step": 8945 }, { "entropy": 5.620917654037475, "epoch": 0.6963625753744408, "grad_norm": 1.0234375, "learning_rate": 0.0004956993681369221, "loss": 5.2986, "mean_token_accuracy": 0.18323905318975447, "num_tokens": 15518971.0, "step": 8950 }, { "entropy": 5.558902025222778, "epoch": 0.6967516047461584, "grad_norm": 0.9765625, "learning_rate": 0.0004956939734837148, "loss": 5.2752, "mean_token_accuracy": 0.17688121646642685, "num_tokens": 15527385.0, "step": 8955 }, { "entropy": 5.582807779312134, "epoch": 0.6971406341178759, "grad_norm": 1.0390625, "learning_rate": 0.0004956885754818277, "loss": 5.3996, "mean_token_accuracy": 0.17462659776210784, "num_tokens": 15535325.0, "step": 8960 }, { "entropy": 5.604357385635376, "epoch": 0.6975296634895934, "grad_norm": 0.94140625, "learning_rate": 0.0004956831741313427, "loss": 5.369, "mean_token_accuracy": 0.17730585783720015, "num_tokens": 15544098.0, "step": 8965 }, { "entropy": 5.5868736743927006, "epoch": 0.697918692861311, "grad_norm": 0.93359375, "learning_rate": 0.0004956777694323418, "loss": 5.2427, "mean_token_accuracy": 0.17640165984630585, "num_tokens": 15552547.0, "step": 8970 }, { "entropy": 5.513116931915283, "epoch": 0.6983077222330286, "grad_norm": 1.0078125, "learning_rate": 0.000495672361384907, "loss": 5.2732, "mean_token_accuracy": 0.17443608194589616, "num_tokens": 15561044.0, "step": 8975 }, { "entropy": 5.55181188583374, "epoch": 0.6986967516047462, "grad_norm": 1.0078125, "learning_rate": 0.0004956669499891202, "loss": 5.3358, "mean_token_accuracy": 0.16730567812919617, "num_tokens": 15569379.0, "step": 8980 }, { "entropy": 5.604987478256225, "epoch": 0.6990857809764637, "grad_norm": 0.98828125, "learning_rate": 0.0004956615352450639, "loss": 5.3403, "mean_token_accuracy": 0.1733030527830124, "num_tokens": 15578535.0, "step": 8985 }, { "entropy": 5.511005640029907, "epoch": 0.6994748103481813, "grad_norm": 1.015625, "learning_rate": 0.0004956561171528198, "loss": 5.1889, "mean_token_accuracy": 0.18649003952741622, "num_tokens": 15586972.0, "step": 8990 }, { "entropy": 5.460616207122802, "epoch": 0.6998638397198989, "grad_norm": 1.0078125, "learning_rate": 0.0004956506957124704, "loss": 5.1611, "mean_token_accuracy": 0.1901437148451805, "num_tokens": 15595092.0, "step": 8995 }, { "entropy": 5.612773513793945, "epoch": 0.7002528690916164, "grad_norm": 0.99609375, "learning_rate": 0.000495645270924098, "loss": 5.4611, "mean_token_accuracy": 0.17564321607351302, "num_tokens": 15604348.0, "step": 9000 }, { "epoch": 0.7002528690916164, "eval_entropy": 5.389798035222366, "eval_loss": 5.328912734985352, "eval_mean_token_accuracy": 0.18488086865384837, "eval_num_tokens": 15604348.0, "eval_runtime": 21.6858, "eval_samples_per_second": 1916.373, "eval_steps_per_second": 239.558, "step": 9000 }, { "entropy": 5.556111764907837, "epoch": 0.700641898463334, "grad_norm": 1.078125, "learning_rate": 0.0004956398427877847, "loss": 5.3005, "mean_token_accuracy": 0.17604861706495284, "num_tokens": 15612597.0, "step": 9005 }, { "entropy": 5.540850639343262, "epoch": 0.7010309278350515, "grad_norm": 1.0, "learning_rate": 0.000495634411303613, "loss": 5.2751, "mean_token_accuracy": 0.1795080214738846, "num_tokens": 15621555.0, "step": 9010 }, { "entropy": 5.554760408401489, "epoch": 0.7014199572067691, "grad_norm": 1.0390625, "learning_rate": 0.0004956289764716654, "loss": 5.2341, "mean_token_accuracy": 0.17902394235134125, "num_tokens": 15630518.0, "step": 9015 }, { "entropy": 5.5721453666687015, "epoch": 0.7018089865784867, "grad_norm": 0.91015625, "learning_rate": 0.0004956235382920241, "loss": 5.41, "mean_token_accuracy": 0.16584509015083312, "num_tokens": 15639126.0, "step": 9020 }, { "entropy": 5.493175649642945, "epoch": 0.7021980159502043, "grad_norm": 1.03125, "learning_rate": 0.0004956180967647717, "loss": 5.2275, "mean_token_accuracy": 0.1841141924262047, "num_tokens": 15647436.0, "step": 9025 }, { "entropy": 5.530618476867676, "epoch": 0.7025870453219218, "grad_norm": 0.953125, "learning_rate": 0.0004956126518899911, "loss": 5.2626, "mean_token_accuracy": 0.18042101860046386, "num_tokens": 15656439.0, "step": 9030 }, { "entropy": 5.552502059936524, "epoch": 0.7029760746936393, "grad_norm": 1.0234375, "learning_rate": 0.0004956072036677644, "loss": 5.2988, "mean_token_accuracy": 0.17644090354442596, "num_tokens": 15665119.0, "step": 9035 }, { "entropy": 5.566791677474976, "epoch": 0.7033651040653569, "grad_norm": 1.0390625, "learning_rate": 0.0004956017520981746, "loss": 5.3522, "mean_token_accuracy": 0.17432471066713334, "num_tokens": 15673430.0, "step": 9040 }, { "entropy": 5.643865871429443, "epoch": 0.7037541334370745, "grad_norm": 1.046875, "learning_rate": 0.0004955962971813044, "loss": 5.4061, "mean_token_accuracy": 0.16947294473648072, "num_tokens": 15682739.0, "step": 9045 }, { "entropy": 5.558068943023682, "epoch": 0.7041431628087921, "grad_norm": 1.1328125, "learning_rate": 0.0004955908389172364, "loss": 5.3604, "mean_token_accuracy": 0.1732873484492302, "num_tokens": 15691206.0, "step": 9050 }, { "entropy": 5.621509456634522, "epoch": 0.7045321921805097, "grad_norm": 0.9609375, "learning_rate": 0.0004955853773060536, "loss": 5.3898, "mean_token_accuracy": 0.17490919977426528, "num_tokens": 15700238.0, "step": 9055 }, { "entropy": 5.600115966796875, "epoch": 0.7049212215522271, "grad_norm": 0.98046875, "learning_rate": 0.0004955799123478388, "loss": 5.2572, "mean_token_accuracy": 0.1805904373526573, "num_tokens": 15708654.0, "step": 9060 }, { "entropy": 5.606193733215332, "epoch": 0.7053102509239447, "grad_norm": 0.984375, "learning_rate": 0.0004955744440426748, "loss": 5.4156, "mean_token_accuracy": 0.17848946005105973, "num_tokens": 15717204.0, "step": 9065 }, { "entropy": 5.4877345085144045, "epoch": 0.7056992802956623, "grad_norm": 1.0390625, "learning_rate": 0.0004955689723906448, "loss": 5.1556, "mean_token_accuracy": 0.1923369437456131, "num_tokens": 15725016.0, "step": 9070 }, { "entropy": 5.649702692031861, "epoch": 0.7060883096673799, "grad_norm": 0.98828125, "learning_rate": 0.0004955634973918318, "loss": 5.5062, "mean_token_accuracy": 0.17271387353539466, "num_tokens": 15734714.0, "step": 9075 }, { "entropy": 5.596701908111572, "epoch": 0.7064773390390975, "grad_norm": 1.0390625, "learning_rate": 0.0004955580190463186, "loss": 5.3283, "mean_token_accuracy": 0.17548872381448746, "num_tokens": 15742867.0, "step": 9080 }, { "entropy": 5.573616409301758, "epoch": 0.7068663684108151, "grad_norm": 0.94921875, "learning_rate": 0.0004955525373541886, "loss": 5.3359, "mean_token_accuracy": 0.17494852393865584, "num_tokens": 15752059.0, "step": 9085 }, { "entropy": 5.5120330333709715, "epoch": 0.7072553977825325, "grad_norm": 0.9140625, "learning_rate": 0.0004955470523155249, "loss": 5.3605, "mean_token_accuracy": 0.17450406402349472, "num_tokens": 15761783.0, "step": 9090 }, { "entropy": 5.525177240371704, "epoch": 0.7076444271542501, "grad_norm": 0.9140625, "learning_rate": 0.0004955415639304107, "loss": 5.2011, "mean_token_accuracy": 0.1823938637971878, "num_tokens": 15770451.0, "step": 9095 }, { "entropy": 5.549926280975342, "epoch": 0.7080334565259677, "grad_norm": 0.9765625, "learning_rate": 0.0004955360721989292, "loss": 5.3088, "mean_token_accuracy": 0.18095069825649263, "num_tokens": 15779529.0, "step": 9100 }, { "entropy": 5.561652946472168, "epoch": 0.7084224858976853, "grad_norm": 0.95703125, "learning_rate": 0.0004955305771211641, "loss": 5.2761, "mean_token_accuracy": 0.1786726161837578, "num_tokens": 15788427.0, "step": 9105 }, { "entropy": 5.561768960952759, "epoch": 0.7088115152694029, "grad_norm": 1.0546875, "learning_rate": 0.0004955250786971982, "loss": 5.3107, "mean_token_accuracy": 0.17775446325540542, "num_tokens": 15796530.0, "step": 9110 }, { "entropy": 5.49405255317688, "epoch": 0.7092005446411204, "grad_norm": 1.125, "learning_rate": 0.0004955195769271154, "loss": 5.2599, "mean_token_accuracy": 0.1851181998848915, "num_tokens": 15805058.0, "step": 9115 }, { "entropy": 5.65776515007019, "epoch": 0.709589574012838, "grad_norm": 1.03125, "learning_rate": 0.0004955140718109991, "loss": 5.3609, "mean_token_accuracy": 0.17976813912391662, "num_tokens": 15813729.0, "step": 9120 }, { "entropy": 5.577265214920044, "epoch": 0.7099786033845555, "grad_norm": 0.95703125, "learning_rate": 0.0004955085633489326, "loss": 5.2097, "mean_token_accuracy": 0.18789018839597701, "num_tokens": 15822305.0, "step": 9125 }, { "entropy": 5.553754806518555, "epoch": 0.7103676327562731, "grad_norm": 0.95703125, "learning_rate": 0.0004955030515409997, "loss": 5.3513, "mean_token_accuracy": 0.17451984584331512, "num_tokens": 15830842.0, "step": 9130 }, { "entropy": 5.469909429550171, "epoch": 0.7107566621279907, "grad_norm": 0.96875, "learning_rate": 0.0004954975363872838, "loss": 5.1965, "mean_token_accuracy": 0.17950347810983658, "num_tokens": 15839790.0, "step": 9135 }, { "entropy": 5.5804030418396, "epoch": 0.7111456914997082, "grad_norm": 1.0078125, "learning_rate": 0.0004954920178878689, "loss": 5.3998, "mean_token_accuracy": 0.16854211539030076, "num_tokens": 15849307.0, "step": 9140 }, { "entropy": 5.647359418869018, "epoch": 0.7115347208714258, "grad_norm": 0.99609375, "learning_rate": 0.0004954864960428385, "loss": 5.3326, "mean_token_accuracy": 0.1800499364733696, "num_tokens": 15858688.0, "step": 9145 }, { "entropy": 5.576810455322265, "epoch": 0.7119237502431434, "grad_norm": 0.9765625, "learning_rate": 0.0004954809708522765, "loss": 5.2099, "mean_token_accuracy": 0.17958054095506668, "num_tokens": 15867574.0, "step": 9150 }, { "entropy": 5.537421703338623, "epoch": 0.712312779614861, "grad_norm": 1.0625, "learning_rate": 0.0004954754423162667, "loss": 5.235, "mean_token_accuracy": 0.18324693739414216, "num_tokens": 15875871.0, "step": 9155 }, { "entropy": 5.529123449325562, "epoch": 0.7127018089865785, "grad_norm": 1.03125, "learning_rate": 0.000495469910434893, "loss": 5.303, "mean_token_accuracy": 0.17866899222135543, "num_tokens": 15884386.0, "step": 9160 }, { "entropy": 5.587394571304321, "epoch": 0.713090838358296, "grad_norm": 1.0078125, "learning_rate": 0.0004954643752082392, "loss": 5.2933, "mean_token_accuracy": 0.17422557026147842, "num_tokens": 15893086.0, "step": 9165 }, { "entropy": 5.517653369903565, "epoch": 0.7134798677300136, "grad_norm": 1.0, "learning_rate": 0.0004954588366363896, "loss": 5.3217, "mean_token_accuracy": 0.17549112886190416, "num_tokens": 15902266.0, "step": 9170 }, { "entropy": 5.702410888671875, "epoch": 0.7138688971017312, "grad_norm": 1.03125, "learning_rate": 0.0004954532947194279, "loss": 5.448, "mean_token_accuracy": 0.16685094088315963, "num_tokens": 15911133.0, "step": 9175 }, { "entropy": 5.529084730148315, "epoch": 0.7142579264734488, "grad_norm": 1.0625, "learning_rate": 0.0004954477494574384, "loss": 5.2194, "mean_token_accuracy": 0.18191736340522766, "num_tokens": 15919455.0, "step": 9180 }, { "entropy": 5.49851655960083, "epoch": 0.7146469558451664, "grad_norm": 1.109375, "learning_rate": 0.0004954422008505052, "loss": 5.2822, "mean_token_accuracy": 0.18629485964775086, "num_tokens": 15927592.0, "step": 9185 }, { "entropy": 5.491498279571533, "epoch": 0.7150359852168838, "grad_norm": 0.9921875, "learning_rate": 0.0004954366488987125, "loss": 5.221, "mean_token_accuracy": 0.1816892832517624, "num_tokens": 15935979.0, "step": 9190 }, { "entropy": 5.5549968719482425, "epoch": 0.7154250145886014, "grad_norm": 1.0390625, "learning_rate": 0.0004954310936021444, "loss": 5.3768, "mean_token_accuracy": 0.17618247270584106, "num_tokens": 15945921.0, "step": 9195 }, { "entropy": 5.626093864440918, "epoch": 0.715814043960319, "grad_norm": 1.0546875, "learning_rate": 0.0004954255349608853, "loss": 5.3012, "mean_token_accuracy": 0.18052035868167876, "num_tokens": 15954875.0, "step": 9200 }, { "entropy": 5.56747088432312, "epoch": 0.7162030733320366, "grad_norm": 0.9765625, "learning_rate": 0.0004954199729750198, "loss": 5.3087, "mean_token_accuracy": 0.17858943343162537, "num_tokens": 15963391.0, "step": 9205 }, { "entropy": 5.630508947372436, "epoch": 0.7165921027037542, "grad_norm": 0.9765625, "learning_rate": 0.0004954144076446318, "loss": 5.427, "mean_token_accuracy": 0.16947771459817887, "num_tokens": 15972366.0, "step": 9210 }, { "entropy": 5.638298368453979, "epoch": 0.7169811320754716, "grad_norm": 0.9453125, "learning_rate": 0.0004954088389698061, "loss": 5.3947, "mean_token_accuracy": 0.177106873691082, "num_tokens": 15981196.0, "step": 9215 }, { "entropy": 5.48401198387146, "epoch": 0.7173701614471892, "grad_norm": 0.96875, "learning_rate": 0.000495403266950627, "loss": 5.3291, "mean_token_accuracy": 0.17288484573364257, "num_tokens": 15990811.0, "step": 9220 }, { "entropy": 5.557605028152466, "epoch": 0.7177591908189068, "grad_norm": 1.0546875, "learning_rate": 0.0004953976915871792, "loss": 5.317, "mean_token_accuracy": 0.17596275806427003, "num_tokens": 15999594.0, "step": 9225 }, { "entropy": 5.687898397445679, "epoch": 0.7181482201906244, "grad_norm": 0.96875, "learning_rate": 0.0004953921128795472, "loss": 5.4282, "mean_token_accuracy": 0.16423819810152054, "num_tokens": 16008179.0, "step": 9230 }, { "entropy": 5.582005643844605, "epoch": 0.718537249562342, "grad_norm": 1.03125, "learning_rate": 0.0004953865308278156, "loss": 5.3464, "mean_token_accuracy": 0.17871031463146209, "num_tokens": 16016583.0, "step": 9235 }, { "entropy": 5.609802484512329, "epoch": 0.7189262789340595, "grad_norm": 0.97265625, "learning_rate": 0.0004953809454320693, "loss": 5.356, "mean_token_accuracy": 0.17320025712251663, "num_tokens": 16025516.0, "step": 9240 }, { "entropy": 5.472203969955444, "epoch": 0.7193153083057771, "grad_norm": 1.0390625, "learning_rate": 0.0004953753566923929, "loss": 5.2189, "mean_token_accuracy": 0.1882613107562065, "num_tokens": 16033536.0, "step": 9245 }, { "entropy": 5.519918298721313, "epoch": 0.7197043376774946, "grad_norm": 0.96484375, "learning_rate": 0.0004953697646088712, "loss": 5.1493, "mean_token_accuracy": 0.1862490639090538, "num_tokens": 16041918.0, "step": 9250 }, { "entropy": 5.49515471458435, "epoch": 0.7200933670492122, "grad_norm": 0.9765625, "learning_rate": 0.0004953641691815891, "loss": 5.2444, "mean_token_accuracy": 0.1890513315796852, "num_tokens": 16050806.0, "step": 9255 }, { "entropy": 5.549209785461426, "epoch": 0.7204823964209298, "grad_norm": 0.984375, "learning_rate": 0.0004953585704106315, "loss": 5.3574, "mean_token_accuracy": 0.1688122883439064, "num_tokens": 16060140.0, "step": 9260 }, { "entropy": 5.590003824234008, "epoch": 0.7208714257926473, "grad_norm": 0.9765625, "learning_rate": 0.0004953529682960832, "loss": 5.2188, "mean_token_accuracy": 0.18012620657682418, "num_tokens": 16068182.0, "step": 9265 }, { "entropy": 5.591183280944824, "epoch": 0.7212604551643649, "grad_norm": 0.9609375, "learning_rate": 0.0004953473628380295, "loss": 5.3626, "mean_token_accuracy": 0.1735826015472412, "num_tokens": 16076798.0, "step": 9270 }, { "entropy": 5.423460483551025, "epoch": 0.7216494845360825, "grad_norm": 1.0, "learning_rate": 0.0004953417540365553, "loss": 5.1083, "mean_token_accuracy": 0.18438050895929337, "num_tokens": 16084739.0, "step": 9275 }, { "entropy": 5.559713363647461, "epoch": 0.7220385139078, "grad_norm": 0.92578125, "learning_rate": 0.0004953361418917455, "loss": 5.2661, "mean_token_accuracy": 0.18010660707950593, "num_tokens": 16093434.0, "step": 9280 }, { "entropy": 5.543549537658691, "epoch": 0.7224275432795176, "grad_norm": 1.0625, "learning_rate": 0.0004953305264036856, "loss": 5.3158, "mean_token_accuracy": 0.17837266623973846, "num_tokens": 16102163.0, "step": 9285 }, { "entropy": 5.489007902145386, "epoch": 0.7228165726512352, "grad_norm": 0.98828125, "learning_rate": 0.0004953249075724607, "loss": 5.29, "mean_token_accuracy": 0.18584892600774766, "num_tokens": 16110761.0, "step": 9290 }, { "entropy": 5.545398187637329, "epoch": 0.7232056020229527, "grad_norm": 0.91015625, "learning_rate": 0.0004953192853981559, "loss": 5.325, "mean_token_accuracy": 0.1777096062898636, "num_tokens": 16119774.0, "step": 9295 }, { "entropy": 5.5385864734649655, "epoch": 0.7235946313946703, "grad_norm": 1.09375, "learning_rate": 0.0004953136598808566, "loss": 5.196, "mean_token_accuracy": 0.18555736243724824, "num_tokens": 16128232.0, "step": 9300 }, { "entropy": 5.5455903053283695, "epoch": 0.7239836607663879, "grad_norm": 0.95703125, "learning_rate": 0.0004953080310206481, "loss": 5.2331, "mean_token_accuracy": 0.1827569469809532, "num_tokens": 16137370.0, "step": 9305 }, { "entropy": 5.507047891616821, "epoch": 0.7243726901381055, "grad_norm": 1.046875, "learning_rate": 0.0004953023988176162, "loss": 5.2536, "mean_token_accuracy": 0.1793384850025177, "num_tokens": 16145791.0, "step": 9310 }, { "entropy": 5.635753631591797, "epoch": 0.724761719509823, "grad_norm": 1.0390625, "learning_rate": 0.0004952967632718458, "loss": 5.3666, "mean_token_accuracy": 0.17886020988225937, "num_tokens": 16153713.0, "step": 9315 }, { "entropy": 5.504679250717163, "epoch": 0.7251507488815405, "grad_norm": 0.98828125, "learning_rate": 0.0004952911243834227, "loss": 5.2166, "mean_token_accuracy": 0.17856226563453675, "num_tokens": 16162362.0, "step": 9320 }, { "entropy": 5.557938098907471, "epoch": 0.7255397782532581, "grad_norm": 0.98046875, "learning_rate": 0.0004952854821524324, "loss": 5.289, "mean_token_accuracy": 0.1809445485472679, "num_tokens": 16171094.0, "step": 9325 }, { "entropy": 5.59300479888916, "epoch": 0.7259288076249757, "grad_norm": 1.0390625, "learning_rate": 0.0004952798365789606, "loss": 5.3487, "mean_token_accuracy": 0.17876584231853485, "num_tokens": 16180282.0, "step": 9330 }, { "entropy": 5.5803542137146, "epoch": 0.7263178369966933, "grad_norm": 1.0703125, "learning_rate": 0.0004952741876630928, "loss": 5.2435, "mean_token_accuracy": 0.1806937649846077, "num_tokens": 16188497.0, "step": 9335 }, { "entropy": 5.607930040359497, "epoch": 0.7267068663684109, "grad_norm": 0.9453125, "learning_rate": 0.0004952685354049148, "loss": 5.4144, "mean_token_accuracy": 0.16779697239398955, "num_tokens": 16197822.0, "step": 9340 }, { "entropy": 5.591944837570191, "epoch": 0.7270958957401283, "grad_norm": 0.98046875, "learning_rate": 0.0004952628798045124, "loss": 5.3089, "mean_token_accuracy": 0.17668944597244263, "num_tokens": 16207770.0, "step": 9345 }, { "entropy": 5.5045722961425785, "epoch": 0.7274849251118459, "grad_norm": 0.97265625, "learning_rate": 0.0004952572208619714, "loss": 5.2394, "mean_token_accuracy": 0.1829061135649681, "num_tokens": 16216624.0, "step": 9350 }, { "entropy": 5.483622121810913, "epoch": 0.7278739544835635, "grad_norm": 0.95703125, "learning_rate": 0.0004952515585773778, "loss": 5.1996, "mean_token_accuracy": 0.17681387364864348, "num_tokens": 16225585.0, "step": 9355 }, { "entropy": 5.52840633392334, "epoch": 0.7282629838552811, "grad_norm": 1.0078125, "learning_rate": 0.0004952458929508171, "loss": 5.1684, "mean_token_accuracy": 0.18971401453018188, "num_tokens": 16233988.0, "step": 9360 }, { "entropy": 5.581288576126099, "epoch": 0.7286520132269987, "grad_norm": 0.9921875, "learning_rate": 0.0004952402239823757, "loss": 5.3464, "mean_token_accuracy": 0.17401268780231477, "num_tokens": 16242291.0, "step": 9365 }, { "entropy": 5.472625684738159, "epoch": 0.7290410425987162, "grad_norm": 1.1015625, "learning_rate": 0.0004952345516721393, "loss": 5.2122, "mean_token_accuracy": 0.18057327717542648, "num_tokens": 16251102.0, "step": 9370 }, { "entropy": 5.479851818084716, "epoch": 0.7294300719704337, "grad_norm": 1.0234375, "learning_rate": 0.0004952288760201942, "loss": 5.211, "mean_token_accuracy": 0.18755067735910416, "num_tokens": 16259136.0, "step": 9375 }, { "entropy": 5.559380006790161, "epoch": 0.7298191013421513, "grad_norm": 0.96484375, "learning_rate": 0.0004952231970266265, "loss": 5.3283, "mean_token_accuracy": 0.17745242565870284, "num_tokens": 16267958.0, "step": 9380 }, { "entropy": 5.667397785186767, "epoch": 0.7302081307138689, "grad_norm": 1.0078125, "learning_rate": 0.0004952175146915223, "loss": 5.4393, "mean_token_accuracy": 0.1704097494482994, "num_tokens": 16277616.0, "step": 9385 }, { "entropy": 5.65295000076294, "epoch": 0.7305971600855865, "grad_norm": 0.98828125, "learning_rate": 0.0004952118290149679, "loss": 5.3033, "mean_token_accuracy": 0.18273016065359116, "num_tokens": 16286454.0, "step": 9390 }, { "entropy": 5.566510534286499, "epoch": 0.730986189457304, "grad_norm": 0.9375, "learning_rate": 0.0004952061399970492, "loss": 5.2741, "mean_token_accuracy": 0.17336290329694748, "num_tokens": 16295722.0, "step": 9395 }, { "entropy": 5.566493225097656, "epoch": 0.7313752188290216, "grad_norm": 1.0234375, "learning_rate": 0.000495200447637853, "loss": 5.3381, "mean_token_accuracy": 0.17226790636777878, "num_tokens": 16304180.0, "step": 9400 }, { "entropy": 5.531685256958008, "epoch": 0.7317642482007392, "grad_norm": 1.015625, "learning_rate": 0.0004951947519374655, "loss": 5.225, "mean_token_accuracy": 0.18427305519580842, "num_tokens": 16312766.0, "step": 9405 }, { "entropy": 5.545846557617187, "epoch": 0.7321532775724567, "grad_norm": 1.046875, "learning_rate": 0.0004951890528959731, "loss": 5.3232, "mean_token_accuracy": 0.1751926675438881, "num_tokens": 16321174.0, "step": 9410 }, { "entropy": 5.498131275177002, "epoch": 0.7325423069441743, "grad_norm": 0.94921875, "learning_rate": 0.0004951833505134623, "loss": 5.2399, "mean_token_accuracy": 0.17664798051118852, "num_tokens": 16329870.0, "step": 9415 }, { "entropy": 5.5950346946716305, "epoch": 0.7329313363158918, "grad_norm": 0.95703125, "learning_rate": 0.0004951776447900196, "loss": 5.2883, "mean_token_accuracy": 0.17546151727437972, "num_tokens": 16338998.0, "step": 9420 }, { "entropy": 5.59651255607605, "epoch": 0.7333203656876094, "grad_norm": 1.078125, "learning_rate": 0.0004951719357257317, "loss": 5.2742, "mean_token_accuracy": 0.17708998173475266, "num_tokens": 16347313.0, "step": 9425 }, { "entropy": 5.56943187713623, "epoch": 0.733709395059327, "grad_norm": 0.9921875, "learning_rate": 0.000495166223320685, "loss": 5.3988, "mean_token_accuracy": 0.17598551213741304, "num_tokens": 16356565.0, "step": 9430 }, { "entropy": 5.5626061916351315, "epoch": 0.7340984244310446, "grad_norm": 1.0, "learning_rate": 0.0004951605075749662, "loss": 5.3924, "mean_token_accuracy": 0.1750992491841316, "num_tokens": 16365747.0, "step": 9435 }, { "entropy": 5.606553077697754, "epoch": 0.7344874538027621, "grad_norm": 0.98828125, "learning_rate": 0.0004951547884886623, "loss": 5.3413, "mean_token_accuracy": 0.1672863632440567, "num_tokens": 16374650.0, "step": 9440 }, { "entropy": 5.567455911636353, "epoch": 0.7348764831744796, "grad_norm": 0.91015625, "learning_rate": 0.0004951490660618598, "loss": 5.2837, "mean_token_accuracy": 0.17836343348026276, "num_tokens": 16384119.0, "step": 9445 }, { "entropy": 5.544294929504394, "epoch": 0.7352655125461972, "grad_norm": 0.98828125, "learning_rate": 0.0004951433402946457, "loss": 5.2417, "mean_token_accuracy": 0.18445164561271668, "num_tokens": 16392606.0, "step": 9450 }, { "entropy": 5.481019306182861, "epoch": 0.7356545419179148, "grad_norm": 0.98828125, "learning_rate": 0.0004951376111871068, "loss": 5.2042, "mean_token_accuracy": 0.18546178191900253, "num_tokens": 16401006.0, "step": 9455 }, { "entropy": 5.523701953887939, "epoch": 0.7360435712896324, "grad_norm": 0.96875, "learning_rate": 0.0004951318787393299, "loss": 5.2553, "mean_token_accuracy": 0.18083978742361068, "num_tokens": 16409401.0, "step": 9460 }, { "entropy": 5.602548837661743, "epoch": 0.73643260066135, "grad_norm": 1.03125, "learning_rate": 0.0004951261429514023, "loss": 5.3174, "mean_token_accuracy": 0.17583308815956117, "num_tokens": 16418771.0, "step": 9465 }, { "entropy": 5.5785486698150635, "epoch": 0.7368216300330674, "grad_norm": 1.046875, "learning_rate": 0.0004951204038234106, "loss": 5.3619, "mean_token_accuracy": 0.1764096811413765, "num_tokens": 16427624.0, "step": 9470 }, { "entropy": 5.541777753829956, "epoch": 0.737210659404785, "grad_norm": 1.1015625, "learning_rate": 0.0004951146613554424, "loss": 5.2329, "mean_token_accuracy": 0.1854480504989624, "num_tokens": 16435669.0, "step": 9475 }, { "entropy": 5.582617092132568, "epoch": 0.7375996887765026, "grad_norm": 1.0078125, "learning_rate": 0.0004951089155475843, "loss": 5.2911, "mean_token_accuracy": 0.18146839141845703, "num_tokens": 16444283.0, "step": 9480 }, { "entropy": 5.4931660175323485, "epoch": 0.7379887181482202, "grad_norm": 1.046875, "learning_rate": 0.000495103166399924, "loss": 5.2616, "mean_token_accuracy": 0.17441291362047195, "num_tokens": 16452741.0, "step": 9485 }, { "entropy": 5.522454881668091, "epoch": 0.7383777475199378, "grad_norm": 1.0234375, "learning_rate": 0.0004950974139125484, "loss": 5.3088, "mean_token_accuracy": 0.1850725769996643, "num_tokens": 16461386.0, "step": 9490 }, { "entropy": 5.627692127227784, "epoch": 0.7387667768916554, "grad_norm": 1.046875, "learning_rate": 0.0004950916580855448, "loss": 5.3251, "mean_token_accuracy": 0.17463397830724717, "num_tokens": 16469901.0, "step": 9495 }, { "entropy": 5.560376739501953, "epoch": 0.7391558062633728, "grad_norm": 0.99609375, "learning_rate": 0.0004950858989190007, "loss": 5.2499, "mean_token_accuracy": 0.1811629593372345, "num_tokens": 16478076.0, "step": 9500 }, { "entropy": 5.480900526046753, "epoch": 0.7395448356350904, "grad_norm": 1.046875, "learning_rate": 0.0004950801364130032, "loss": 5.2604, "mean_token_accuracy": 0.18097128719091415, "num_tokens": 16486568.0, "step": 9505 }, { "entropy": 5.5960197925567625, "epoch": 0.739933865006808, "grad_norm": 0.98828125, "learning_rate": 0.0004950743705676401, "loss": 5.3449, "mean_token_accuracy": 0.17725475132465363, "num_tokens": 16495299.0, "step": 9510 }, { "entropy": 5.539008760452271, "epoch": 0.7403228943785256, "grad_norm": 1.0390625, "learning_rate": 0.0004950686013829987, "loss": 5.2531, "mean_token_accuracy": 0.17483892142772675, "num_tokens": 16504576.0, "step": 9515 }, { "entropy": 5.574979066848755, "epoch": 0.7407119237502432, "grad_norm": 1.0390625, "learning_rate": 0.0004950628288591665, "loss": 5.3242, "mean_token_accuracy": 0.17738772332668304, "num_tokens": 16512715.0, "step": 9520 }, { "entropy": 5.613685178756714, "epoch": 0.7411009531219607, "grad_norm": 0.98828125, "learning_rate": 0.0004950570529962311, "loss": 5.2746, "mean_token_accuracy": 0.1810723900794983, "num_tokens": 16521375.0, "step": 9525 }, { "entropy": 5.55305233001709, "epoch": 0.7414899824936783, "grad_norm": 1.0234375, "learning_rate": 0.0004950512737942803, "loss": 5.2493, "mean_token_accuracy": 0.18598097711801528, "num_tokens": 16529772.0, "step": 9530 }, { "entropy": 5.611551809310913, "epoch": 0.7418790118653958, "grad_norm": 1.0078125, "learning_rate": 0.0004950454912534015, "loss": 5.2967, "mean_token_accuracy": 0.18408222794532775, "num_tokens": 16538365.0, "step": 9535 }, { "entropy": 5.6260138034820555, "epoch": 0.7422680412371134, "grad_norm": 1.046875, "learning_rate": 0.0004950397053736827, "loss": 5.4118, "mean_token_accuracy": 0.16625734269618989, "num_tokens": 16547668.0, "step": 9540 }, { "entropy": 5.631437683105469, "epoch": 0.742657070608831, "grad_norm": 0.953125, "learning_rate": 0.0004950339161552117, "loss": 5.3923, "mean_token_accuracy": 0.16748718023300171, "num_tokens": 16557060.0, "step": 9545 }, { "entropy": 5.593369626998902, "epoch": 0.7430460999805485, "grad_norm": 0.97265625, "learning_rate": 0.0004950281235980761, "loss": 5.3649, "mean_token_accuracy": 0.18361901491880417, "num_tokens": 16565814.0, "step": 9550 }, { "entropy": 5.5311542510986325, "epoch": 0.7434351293522661, "grad_norm": 1.0546875, "learning_rate": 0.000495022327702364, "loss": 5.1699, "mean_token_accuracy": 0.18616349399089813, "num_tokens": 16574536.0, "step": 9555 }, { "entropy": 5.522435569763184, "epoch": 0.7438241587239837, "grad_norm": 0.9765625, "learning_rate": 0.0004950165284681631, "loss": 5.1448, "mean_token_accuracy": 0.19001736789941787, "num_tokens": 16583349.0, "step": 9560 }, { "entropy": 5.485368776321411, "epoch": 0.7442131880957013, "grad_norm": 0.98046875, "learning_rate": 0.0004950107258955618, "loss": 5.1509, "mean_token_accuracy": 0.18268264830112457, "num_tokens": 16591374.0, "step": 9565 }, { "entropy": 5.503294038772583, "epoch": 0.7446022174674188, "grad_norm": 1.0703125, "learning_rate": 0.0004950049199846479, "loss": 5.2609, "mean_token_accuracy": 0.17910871505737305, "num_tokens": 16599684.0, "step": 9570 }, { "entropy": 5.556149101257324, "epoch": 0.7449912468391363, "grad_norm": 1.1171875, "learning_rate": 0.0004949991107355095, "loss": 5.2553, "mean_token_accuracy": 0.17982286363840103, "num_tokens": 16607618.0, "step": 9575 }, { "entropy": 5.535337591171265, "epoch": 0.7453802762108539, "grad_norm": 1.0234375, "learning_rate": 0.0004949932981482347, "loss": 5.3675, "mean_token_accuracy": 0.17090606391429902, "num_tokens": 16616259.0, "step": 9580 }, { "entropy": 5.541644048690796, "epoch": 0.7457693055825715, "grad_norm": 1.046875, "learning_rate": 0.0004949874822229118, "loss": 5.225, "mean_token_accuracy": 0.1834418684244156, "num_tokens": 16624972.0, "step": 9585 }, { "entropy": 5.61938967704773, "epoch": 0.7461583349542891, "grad_norm": 1.0, "learning_rate": 0.0004949816629596288, "loss": 5.3308, "mean_token_accuracy": 0.17839625775814055, "num_tokens": 16633517.0, "step": 9590 }, { "entropy": 5.598763275146484, "epoch": 0.7465473643260067, "grad_norm": 0.96875, "learning_rate": 0.0004949758403584746, "loss": 5.3331, "mean_token_accuracy": 0.1768048346042633, "num_tokens": 16642695.0, "step": 9595 }, { "entropy": 5.459473657608032, "epoch": 0.7469363936977241, "grad_norm": 1.03125, "learning_rate": 0.0004949700144195368, "loss": 5.2168, "mean_token_accuracy": 0.1797614425420761, "num_tokens": 16651251.0, "step": 9600 }, { "entropy": 5.521040964126587, "epoch": 0.7473254230694417, "grad_norm": 1.0078125, "learning_rate": 0.0004949641851429043, "loss": 5.2773, "mean_token_accuracy": 0.17668697834014893, "num_tokens": 16660570.0, "step": 9605 }, { "entropy": 5.5326752185821535, "epoch": 0.7477144524411593, "grad_norm": 1.0234375, "learning_rate": 0.0004949583525286654, "loss": 5.312, "mean_token_accuracy": 0.17187793254852296, "num_tokens": 16668678.0, "step": 9610 }, { "entropy": 5.43628339767456, "epoch": 0.7481034818128769, "grad_norm": 1.046875, "learning_rate": 0.0004949525165769085, "loss": 5.1444, "mean_token_accuracy": 0.18645231425762177, "num_tokens": 16677207.0, "step": 9615 }, { "entropy": 5.582274103164673, "epoch": 0.7484925111845945, "grad_norm": 1.0625, "learning_rate": 0.0004949466772877224, "loss": 5.3344, "mean_token_accuracy": 0.1755437359213829, "num_tokens": 16686015.0, "step": 9620 }, { "entropy": 5.54477105140686, "epoch": 0.748881540556312, "grad_norm": 1.046875, "learning_rate": 0.0004949408346611955, "loss": 5.1845, "mean_token_accuracy": 0.18544931560754777, "num_tokens": 16694989.0, "step": 9625 }, { "entropy": 5.584083795547485, "epoch": 0.7492705699280295, "grad_norm": 0.92578125, "learning_rate": 0.0004949349886974165, "loss": 5.3611, "mean_token_accuracy": 0.17635638415813445, "num_tokens": 16703888.0, "step": 9630 }, { "entropy": 5.55716118812561, "epoch": 0.7496595992997471, "grad_norm": 1.0546875, "learning_rate": 0.0004949291393964741, "loss": 5.2835, "mean_token_accuracy": 0.17723703235387803, "num_tokens": 16711880.0, "step": 9635 }, { "entropy": 5.583466053009033, "epoch": 0.7500486286714647, "grad_norm": 1.015625, "learning_rate": 0.000494923286758457, "loss": 5.2772, "mean_token_accuracy": 0.18172440379858018, "num_tokens": 16720858.0, "step": 9640 }, { "entropy": 5.550045967102051, "epoch": 0.7504376580431823, "grad_norm": 1.0546875, "learning_rate": 0.0004949174307834541, "loss": 5.3488, "mean_token_accuracy": 0.17593863606452942, "num_tokens": 16729223.0, "step": 9645 }, { "entropy": 5.578950548171997, "epoch": 0.7508266874148998, "grad_norm": 1.03125, "learning_rate": 0.0004949115714715543, "loss": 5.316, "mean_token_accuracy": 0.17637102603912352, "num_tokens": 16737854.0, "step": 9650 }, { "entropy": 5.5745062828063965, "epoch": 0.7512157167866174, "grad_norm": 1.0078125, "learning_rate": 0.0004949057088228465, "loss": 5.3249, "mean_token_accuracy": 0.17119787484407425, "num_tokens": 16747081.0, "step": 9655 }, { "entropy": 5.498596286773681, "epoch": 0.751604746158335, "grad_norm": 0.96875, "learning_rate": 0.0004948998428374194, "loss": 5.1653, "mean_token_accuracy": 0.18802380561828613, "num_tokens": 16756410.0, "step": 9660 }, { "entropy": 5.494810676574707, "epoch": 0.7519937755300525, "grad_norm": 1.0078125, "learning_rate": 0.0004948939735153622, "loss": 5.1923, "mean_token_accuracy": 0.18529070615768434, "num_tokens": 16764774.0, "step": 9665 }, { "entropy": 5.528837108612061, "epoch": 0.7523828049017701, "grad_norm": 1.015625, "learning_rate": 0.0004948881008567641, "loss": 5.3482, "mean_token_accuracy": 0.17671961337327957, "num_tokens": 16773484.0, "step": 9670 }, { "entropy": 5.576663970947266, "epoch": 0.7527718342734876, "grad_norm": 1.0546875, "learning_rate": 0.0004948822248617139, "loss": 5.1586, "mean_token_accuracy": 0.191119584441185, "num_tokens": 16781167.0, "step": 9675 }, { "entropy": 5.464426851272583, "epoch": 0.7531608636452052, "grad_norm": 0.9453125, "learning_rate": 0.000494876345530301, "loss": 5.212, "mean_token_accuracy": 0.18175776600837706, "num_tokens": 16790838.0, "step": 9680 }, { "entropy": 5.524459981918335, "epoch": 0.7535498930169228, "grad_norm": 0.96875, "learning_rate": 0.0004948704628626145, "loss": 5.2641, "mean_token_accuracy": 0.1849897548556328, "num_tokens": 16799179.0, "step": 9685 }, { "entropy": 5.606106233596802, "epoch": 0.7539389223886404, "grad_norm": 0.97265625, "learning_rate": 0.0004948645768587437, "loss": 5.1909, "mean_token_accuracy": 0.17714202255010605, "num_tokens": 16807516.0, "step": 9690 }, { "entropy": 5.601245403289795, "epoch": 0.7543279517603579, "grad_norm": 0.9375, "learning_rate": 0.0004948586875187778, "loss": 5.4131, "mean_token_accuracy": 0.17605143338441848, "num_tokens": 16816601.0, "step": 9695 }, { "entropy": 5.533262538909912, "epoch": 0.7547169811320755, "grad_norm": 0.9296875, "learning_rate": 0.0004948527948428064, "loss": 5.2989, "mean_token_accuracy": 0.17988608181476592, "num_tokens": 16825498.0, "step": 9700 }, { "entropy": 5.593303298950195, "epoch": 0.755106010503793, "grad_norm": 0.95703125, "learning_rate": 0.0004948468988309187, "loss": 5.3737, "mean_token_accuracy": 0.17876372784376143, "num_tokens": 16834833.0, "step": 9705 }, { "entropy": 5.560336494445801, "epoch": 0.7554950398755106, "grad_norm": 1.09375, "learning_rate": 0.0004948409994832043, "loss": 5.2511, "mean_token_accuracy": 0.18087394088506697, "num_tokens": 16843476.0, "step": 9710 }, { "entropy": 5.517852830886841, "epoch": 0.7558840692472282, "grad_norm": 1.0546875, "learning_rate": 0.0004948350967997526, "loss": 5.1705, "mean_token_accuracy": 0.18963382989168168, "num_tokens": 16851859.0, "step": 9715 }, { "entropy": 5.580209112167358, "epoch": 0.7562730986189458, "grad_norm": 1.0703125, "learning_rate": 0.0004948291907806532, "loss": 5.2378, "mean_token_accuracy": 0.18185634762048722, "num_tokens": 16860642.0, "step": 9720 }, { "entropy": 5.591513061523438, "epoch": 0.7566621279906633, "grad_norm": 1.0078125, "learning_rate": 0.0004948232814259957, "loss": 5.3797, "mean_token_accuracy": 0.1745381847023964, "num_tokens": 16869232.0, "step": 9725 }, { "entropy": 5.492669534683228, "epoch": 0.7570511573623808, "grad_norm": 0.9765625, "learning_rate": 0.0004948173687358699, "loss": 5.1244, "mean_token_accuracy": 0.1836826354265213, "num_tokens": 16877880.0, "step": 9730 }, { "entropy": 5.456797504425049, "epoch": 0.7574401867340984, "grad_norm": 0.92578125, "learning_rate": 0.0004948114527103652, "loss": 5.2193, "mean_token_accuracy": 0.18095895498991013, "num_tokens": 16887060.0, "step": 9735 }, { "entropy": 5.574520063400269, "epoch": 0.757829216105816, "grad_norm": 1.0078125, "learning_rate": 0.0004948055333495717, "loss": 5.2626, "mean_token_accuracy": 0.17601558417081833, "num_tokens": 16895980.0, "step": 9740 }, { "entropy": 5.662924909591675, "epoch": 0.7582182454775336, "grad_norm": 1.078125, "learning_rate": 0.0004947996106535791, "loss": 5.4047, "mean_token_accuracy": 0.17123472839593887, "num_tokens": 16904334.0, "step": 9745 }, { "entropy": 5.501442003250122, "epoch": 0.7586072748492512, "grad_norm": 0.9609375, "learning_rate": 0.0004947936846224773, "loss": 5.2864, "mean_token_accuracy": 0.18169119507074355, "num_tokens": 16913436.0, "step": 9750 }, { "entropy": 5.503163862228393, "epoch": 0.7589963042209686, "grad_norm": 0.9921875, "learning_rate": 0.0004947877552563562, "loss": 5.2727, "mean_token_accuracy": 0.17634390145540238, "num_tokens": 16923214.0, "step": 9755 }, { "entropy": 5.579230499267578, "epoch": 0.7593853335926862, "grad_norm": 1.03125, "learning_rate": 0.0004947818225553056, "loss": 5.2044, "mean_token_accuracy": 0.18720707297325134, "num_tokens": 16932523.0, "step": 9760 }, { "entropy": 5.601711845397949, "epoch": 0.7597743629644038, "grad_norm": 0.9921875, "learning_rate": 0.0004947758865194156, "loss": 5.3313, "mean_token_accuracy": 0.17638456970453262, "num_tokens": 16940649.0, "step": 9765 }, { "entropy": 5.550697326660156, "epoch": 0.7601633923361214, "grad_norm": 0.94140625, "learning_rate": 0.0004947699471487766, "loss": 5.2834, "mean_token_accuracy": 0.18467652052640915, "num_tokens": 16949373.0, "step": 9770 }, { "entropy": 5.604041671752929, "epoch": 0.760552421707839, "grad_norm": 0.98046875, "learning_rate": 0.0004947640044434782, "loss": 5.2943, "mean_token_accuracy": 0.18377356231212616, "num_tokens": 16957787.0, "step": 9775 }, { "entropy": 5.525785446166992, "epoch": 0.7609414510795565, "grad_norm": 1.015625, "learning_rate": 0.0004947580584036109, "loss": 5.2154, "mean_token_accuracy": 0.18299616128206253, "num_tokens": 16967589.0, "step": 9780 }, { "entropy": 5.551060009002685, "epoch": 0.761330480451274, "grad_norm": 0.9765625, "learning_rate": 0.0004947521090292649, "loss": 5.2228, "mean_token_accuracy": 0.18813629150390626, "num_tokens": 16976719.0, "step": 9785 }, { "entropy": 5.5405426025390625, "epoch": 0.7617195098229916, "grad_norm": 1.0234375, "learning_rate": 0.0004947461563205304, "loss": 5.3578, "mean_token_accuracy": 0.18054259270429612, "num_tokens": 16984805.0, "step": 9790 }, { "entropy": 5.530938386917114, "epoch": 0.7621085391947092, "grad_norm": 0.984375, "learning_rate": 0.0004947402002774977, "loss": 5.2936, "mean_token_accuracy": 0.175130957365036, "num_tokens": 16993298.0, "step": 9795 }, { "entropy": 5.506849193572998, "epoch": 0.7624975685664268, "grad_norm": 0.9453125, "learning_rate": 0.0004947342409002572, "loss": 5.1691, "mean_token_accuracy": 0.19266698211431504, "num_tokens": 17002170.0, "step": 9800 }, { "entropy": 5.521035671234131, "epoch": 0.7628865979381443, "grad_norm": 1.0078125, "learning_rate": 0.0004947282781888994, "loss": 5.2667, "mean_token_accuracy": 0.19202028065919877, "num_tokens": 17011218.0, "step": 9805 }, { "entropy": 5.520613718032837, "epoch": 0.7632756273098619, "grad_norm": 0.92578125, "learning_rate": 0.0004947223121435147, "loss": 5.1636, "mean_token_accuracy": 0.1823309525847435, "num_tokens": 17019628.0, "step": 9810 }, { "entropy": 5.545638942718506, "epoch": 0.7636646566815795, "grad_norm": 0.99609375, "learning_rate": 0.0004947163427641936, "loss": 5.3798, "mean_token_accuracy": 0.17455653548240663, "num_tokens": 17028342.0, "step": 9815 }, { "entropy": 5.6043336391448975, "epoch": 0.764053686053297, "grad_norm": 0.9375, "learning_rate": 0.0004947103700510268, "loss": 5.3258, "mean_token_accuracy": 0.176914082467556, "num_tokens": 17037844.0, "step": 9820 }, { "entropy": 5.538714170455933, "epoch": 0.7644427154250146, "grad_norm": 1.0, "learning_rate": 0.0004947043940041047, "loss": 5.1678, "mean_token_accuracy": 0.18721466660499572, "num_tokens": 17046430.0, "step": 9825 }, { "entropy": 5.522770977020263, "epoch": 0.7648317447967321, "grad_norm": 1.140625, "learning_rate": 0.0004946984146235183, "loss": 5.2463, "mean_token_accuracy": 0.17984112799167634, "num_tokens": 17055757.0, "step": 9830 }, { "entropy": 5.562282133102417, "epoch": 0.7652207741684497, "grad_norm": 1.0546875, "learning_rate": 0.0004946924319093579, "loss": 5.3668, "mean_token_accuracy": 0.1770143076777458, "num_tokens": 17063944.0, "step": 9835 }, { "entropy": 5.570206069946289, "epoch": 0.7656098035401673, "grad_norm": 0.9921875, "learning_rate": 0.0004946864458617148, "loss": 5.2588, "mean_token_accuracy": 0.17300845831632614, "num_tokens": 17072895.0, "step": 9840 }, { "entropy": 5.521096086502075, "epoch": 0.7659988329118849, "grad_norm": 0.98046875, "learning_rate": 0.0004946804564806793, "loss": 5.2973, "mean_token_accuracy": 0.1775191456079483, "num_tokens": 17081828.0, "step": 9845 }, { "entropy": 5.536095046997071, "epoch": 0.7663878622836025, "grad_norm": 1.0390625, "learning_rate": 0.0004946744637663427, "loss": 5.2203, "mean_token_accuracy": 0.18323799669742585, "num_tokens": 17090386.0, "step": 9850 }, { "entropy": 5.663650846481323, "epoch": 0.7667768916553199, "grad_norm": 1.015625, "learning_rate": 0.0004946684677187956, "loss": 5.4161, "mean_token_accuracy": 0.1748966947197914, "num_tokens": 17099429.0, "step": 9855 }, { "entropy": 5.554952335357666, "epoch": 0.7671659210270375, "grad_norm": 0.9921875, "learning_rate": 0.0004946624683381292, "loss": 5.2989, "mean_token_accuracy": 0.17905012965202333, "num_tokens": 17107868.0, "step": 9860 }, { "entropy": 5.5565272808074955, "epoch": 0.7675549503987551, "grad_norm": 0.95703125, "learning_rate": 0.0004946564656244345, "loss": 5.3356, "mean_token_accuracy": 0.17248685657978058, "num_tokens": 17116936.0, "step": 9865 }, { "entropy": 5.590495014190674, "epoch": 0.7679439797704727, "grad_norm": 0.984375, "learning_rate": 0.0004946504595778026, "loss": 5.264, "mean_token_accuracy": 0.17216774672269822, "num_tokens": 17125475.0, "step": 9870 }, { "entropy": 5.595300626754761, "epoch": 0.7683330091421903, "grad_norm": 1.046875, "learning_rate": 0.0004946444501983246, "loss": 5.2723, "mean_token_accuracy": 0.18637385070323945, "num_tokens": 17134041.0, "step": 9875 }, { "entropy": 5.534225416183472, "epoch": 0.7687220385139077, "grad_norm": 1.0234375, "learning_rate": 0.0004946384374860916, "loss": 5.2857, "mean_token_accuracy": 0.1820813775062561, "num_tokens": 17142088.0, "step": 9880 }, { "entropy": 5.5372497081756595, "epoch": 0.7691110678856253, "grad_norm": 1.078125, "learning_rate": 0.0004946324214411949, "loss": 5.1765, "mean_token_accuracy": 0.1841478690505028, "num_tokens": 17150185.0, "step": 9885 }, { "entropy": 5.470294761657715, "epoch": 0.7695000972573429, "grad_norm": 1.0078125, "learning_rate": 0.0004946264020637259, "loss": 5.0628, "mean_token_accuracy": 0.1939447656273842, "num_tokens": 17158437.0, "step": 9890 }, { "entropy": 5.440548849105835, "epoch": 0.7698891266290605, "grad_norm": 1.015625, "learning_rate": 0.0004946203793537757, "loss": 5.244, "mean_token_accuracy": 0.1837555557489395, "num_tokens": 17167811.0, "step": 9895 }, { "entropy": 5.562580537796021, "epoch": 0.7702781560007781, "grad_norm": 1.0, "learning_rate": 0.0004946143533114358, "loss": 5.3101, "mean_token_accuracy": 0.17614355236291884, "num_tokens": 17176982.0, "step": 9900 }, { "entropy": 5.608755016326905, "epoch": 0.7706671853724957, "grad_norm": 1.0625, "learning_rate": 0.0004946083239367976, "loss": 5.2377, "mean_token_accuracy": 0.17974676787853242, "num_tokens": 17185633.0, "step": 9905 }, { "entropy": 5.4947271823883055, "epoch": 0.7710562147442132, "grad_norm": 1.03125, "learning_rate": 0.0004946022912299527, "loss": 5.285, "mean_token_accuracy": 0.17526287883520125, "num_tokens": 17194996.0, "step": 9910 }, { "entropy": 5.6518114566802975, "epoch": 0.7714452441159307, "grad_norm": 1.0, "learning_rate": 0.0004945962551909926, "loss": 5.3927, "mean_token_accuracy": 0.17043281644582747, "num_tokens": 17204159.0, "step": 9915 }, { "entropy": 5.51574559211731, "epoch": 0.7718342734876483, "grad_norm": 1.0, "learning_rate": 0.0004945902158200089, "loss": 5.2703, "mean_token_accuracy": 0.1770494043827057, "num_tokens": 17212930.0, "step": 9920 }, { "entropy": 5.624597072601318, "epoch": 0.7722233028593659, "grad_norm": 0.98828125, "learning_rate": 0.0004945841731170931, "loss": 5.3393, "mean_token_accuracy": 0.17416706383228303, "num_tokens": 17221884.0, "step": 9925 }, { "entropy": 5.518691301345825, "epoch": 0.7726123322310835, "grad_norm": 0.9765625, "learning_rate": 0.0004945781270823369, "loss": 5.2288, "mean_token_accuracy": 0.18571600914001465, "num_tokens": 17230525.0, "step": 9930 }, { "entropy": 5.439535808563233, "epoch": 0.773001361602801, "grad_norm": 0.9765625, "learning_rate": 0.0004945720777158323, "loss": 5.1666, "mean_token_accuracy": 0.18698474764823914, "num_tokens": 17239240.0, "step": 9935 }, { "entropy": 5.619084358215332, "epoch": 0.7733903909745186, "grad_norm": 0.9453125, "learning_rate": 0.0004945660250176708, "loss": 5.2884, "mean_token_accuracy": 0.1752843976020813, "num_tokens": 17248174.0, "step": 9940 }, { "entropy": 5.574867486953735, "epoch": 0.7737794203462361, "grad_norm": 0.921875, "learning_rate": 0.0004945599689879443, "loss": 5.2803, "mean_token_accuracy": 0.17735401540994644, "num_tokens": 17256935.0, "step": 9945 }, { "entropy": 5.5688135623931885, "epoch": 0.7741684497179537, "grad_norm": 1.0, "learning_rate": 0.0004945539096267448, "loss": 5.2913, "mean_token_accuracy": 0.18053762316703797, "num_tokens": 17265831.0, "step": 9950 }, { "entropy": 5.469559907913208, "epoch": 0.7745574790896713, "grad_norm": 1.0859375, "learning_rate": 0.0004945478469341642, "loss": 5.1775, "mean_token_accuracy": 0.188815376162529, "num_tokens": 17273851.0, "step": 9955 }, { "entropy": 5.547821998596191, "epoch": 0.7749465084613888, "grad_norm": 0.9296875, "learning_rate": 0.0004945417809102944, "loss": 5.2865, "mean_token_accuracy": 0.17088476270437242, "num_tokens": 17283547.0, "step": 9960 }, { "entropy": 5.490760421752929, "epoch": 0.7753355378331064, "grad_norm": 1.0234375, "learning_rate": 0.0004945357115552275, "loss": 5.1435, "mean_token_accuracy": 0.18845568150281905, "num_tokens": 17291958.0, "step": 9965 }, { "entropy": 5.469471740722656, "epoch": 0.775724567204824, "grad_norm": 0.9921875, "learning_rate": 0.0004945296388690557, "loss": 5.2974, "mean_token_accuracy": 0.1850552275776863, "num_tokens": 17301374.0, "step": 9970 }, { "entropy": 5.597596454620361, "epoch": 0.7761135965765416, "grad_norm": 0.9765625, "learning_rate": 0.000494523562851871, "loss": 5.4476, "mean_token_accuracy": 0.17390787452459336, "num_tokens": 17310649.0, "step": 9975 }, { "entropy": 5.664722537994384, "epoch": 0.7765026259482591, "grad_norm": 1.140625, "learning_rate": 0.0004945174835037655, "loss": 5.3408, "mean_token_accuracy": 0.1781105414032936, "num_tokens": 17319156.0, "step": 9980 }, { "entropy": 5.5528970718383786, "epoch": 0.7768916553199766, "grad_norm": 0.96484375, "learning_rate": 0.0004945114008248319, "loss": 5.2616, "mean_token_accuracy": 0.18411820977926255, "num_tokens": 17327906.0, "step": 9985 }, { "entropy": 5.530083465576172, "epoch": 0.7772806846916942, "grad_norm": 0.99609375, "learning_rate": 0.0004945053148151619, "loss": 5.2427, "mean_token_accuracy": 0.1852427065372467, "num_tokens": 17337042.0, "step": 9990 }, { "entropy": 5.544866991043091, "epoch": 0.7776697140634118, "grad_norm": 1.0546875, "learning_rate": 0.0004944992254748482, "loss": 5.2979, "mean_token_accuracy": 0.17376251220703126, "num_tokens": 17346208.0, "step": 9995 }, { "entropy": 5.609505224227905, "epoch": 0.7780587434351294, "grad_norm": 1.03125, "learning_rate": 0.0004944931328039832, "loss": 5.3232, "mean_token_accuracy": 0.18415360450744628, "num_tokens": 17354965.0, "step": 10000 }, { "entropy": 5.57321515083313, "epoch": 0.778447772806847, "grad_norm": 1.0546875, "learning_rate": 0.0004944870368026592, "loss": 5.284, "mean_token_accuracy": 0.17819664627313614, "num_tokens": 17364129.0, "step": 10005 }, { "entropy": 5.573775291442871, "epoch": 0.7788368021785644, "grad_norm": 1.0234375, "learning_rate": 0.0004944809374709689, "loss": 5.2878, "mean_token_accuracy": 0.17610488533973695, "num_tokens": 17372928.0, "step": 10010 }, { "entropy": 5.612327718734742, "epoch": 0.779225831550282, "grad_norm": 1.125, "learning_rate": 0.0004944748348090045, "loss": 5.3089, "mean_token_accuracy": 0.17743565291166305, "num_tokens": 17381076.0, "step": 10015 }, { "entropy": 5.590665245056153, "epoch": 0.7796148609219996, "grad_norm": 1.0390625, "learning_rate": 0.0004944687288168589, "loss": 5.3056, "mean_token_accuracy": 0.1801182821393013, "num_tokens": 17389614.0, "step": 10020 }, { "entropy": 5.6176183223724365, "epoch": 0.7800038902937172, "grad_norm": 1.0859375, "learning_rate": 0.0004944626194946246, "loss": 5.414, "mean_token_accuracy": 0.1738124206662178, "num_tokens": 17398718.0, "step": 10025 }, { "entropy": 5.554498147964478, "epoch": 0.7803929196654348, "grad_norm": 1.046875, "learning_rate": 0.0004944565068423945, "loss": 5.203, "mean_token_accuracy": 0.18256326615810395, "num_tokens": 17408504.0, "step": 10030 }, { "entropy": 5.4566785335540775, "epoch": 0.7807819490371523, "grad_norm": 1.1015625, "learning_rate": 0.0004944503908602612, "loss": 5.1594, "mean_token_accuracy": 0.18209146857261657, "num_tokens": 17417826.0, "step": 10035 }, { "entropy": 5.590363836288452, "epoch": 0.7811709784088698, "grad_norm": 1.0234375, "learning_rate": 0.0004944442715483174, "loss": 5.3467, "mean_token_accuracy": 0.17133993804454803, "num_tokens": 17426581.0, "step": 10040 }, { "entropy": 5.6116899967193605, "epoch": 0.7815600077805874, "grad_norm": 1.0234375, "learning_rate": 0.0004944381489066561, "loss": 5.3081, "mean_token_accuracy": 0.17582398653030396, "num_tokens": 17435320.0, "step": 10045 }, { "entropy": 5.534014320373535, "epoch": 0.781949037152305, "grad_norm": 1.0, "learning_rate": 0.0004944320229353702, "loss": 5.247, "mean_token_accuracy": 0.1847595140337944, "num_tokens": 17443707.0, "step": 10050 }, { "entropy": 5.437810373306275, "epoch": 0.7823380665240226, "grad_norm": 1.015625, "learning_rate": 0.0004944258936345526, "loss": 5.133, "mean_token_accuracy": 0.18285618871450424, "num_tokens": 17452410.0, "step": 10055 }, { "entropy": 5.519442367553711, "epoch": 0.7827270958957401, "grad_norm": 1.1328125, "learning_rate": 0.0004944197610042963, "loss": 5.224, "mean_token_accuracy": 0.1846740022301674, "num_tokens": 17460000.0, "step": 10060 }, { "entropy": 5.542432737350464, "epoch": 0.7831161252674577, "grad_norm": 0.92578125, "learning_rate": 0.0004944136250446944, "loss": 5.2107, "mean_token_accuracy": 0.18191176801919937, "num_tokens": 17469179.0, "step": 10065 }, { "entropy": 5.5194908618927006, "epoch": 0.7835051546391752, "grad_norm": 0.97265625, "learning_rate": 0.0004944074857558399, "loss": 5.2328, "mean_token_accuracy": 0.1840083658695221, "num_tokens": 17478048.0, "step": 10070 }, { "entropy": 5.458236980438232, "epoch": 0.7838941840108928, "grad_norm": 1.03125, "learning_rate": 0.0004944013431378261, "loss": 5.131, "mean_token_accuracy": 0.18433062583208085, "num_tokens": 17485959.0, "step": 10075 }, { "entropy": 5.512459135055542, "epoch": 0.7842832133826104, "grad_norm": 1.0546875, "learning_rate": 0.0004943951971907461, "loss": 5.222, "mean_token_accuracy": 0.1845149204134941, "num_tokens": 17495158.0, "step": 10080 }, { "entropy": 5.522275066375732, "epoch": 0.7846722427543279, "grad_norm": 1.0546875, "learning_rate": 0.0004943890479146933, "loss": 5.2476, "mean_token_accuracy": 0.18333764970302582, "num_tokens": 17503939.0, "step": 10085 }, { "entropy": 5.52121205329895, "epoch": 0.7850612721260455, "grad_norm": 0.96484375, "learning_rate": 0.0004943828953097607, "loss": 5.2873, "mean_token_accuracy": 0.17532044351100923, "num_tokens": 17513391.0, "step": 10090 }, { "entropy": 5.599463081359863, "epoch": 0.7854503014977631, "grad_norm": 1.0, "learning_rate": 0.000494376739376042, "loss": 5.3201, "mean_token_accuracy": 0.17570871859788895, "num_tokens": 17522922.0, "step": 10095 }, { "entropy": 5.580346012115479, "epoch": 0.7858393308694807, "grad_norm": 1.0078125, "learning_rate": 0.0004943705801136304, "loss": 5.3136, "mean_token_accuracy": 0.17581601142883302, "num_tokens": 17531920.0, "step": 10100 }, { "entropy": 5.646449947357178, "epoch": 0.7862283602411982, "grad_norm": 1.0078125, "learning_rate": 0.0004943644175226193, "loss": 5.3353, "mean_token_accuracy": 0.1789740428328514, "num_tokens": 17539816.0, "step": 10105 }, { "entropy": 5.647852277755737, "epoch": 0.7866173896129158, "grad_norm": 1.0234375, "learning_rate": 0.0004943582516031025, "loss": 5.2833, "mean_token_accuracy": 0.18268545418977739, "num_tokens": 17548584.0, "step": 10110 }, { "entropy": 5.513976001739502, "epoch": 0.7870064189846333, "grad_norm": 1.015625, "learning_rate": 0.0004943520823551732, "loss": 5.2978, "mean_token_accuracy": 0.18332510590553283, "num_tokens": 17557095.0, "step": 10115 }, { "entropy": 5.569630289077759, "epoch": 0.7873954483563509, "grad_norm": 0.9375, "learning_rate": 0.0004943459097789252, "loss": 5.2692, "mean_token_accuracy": 0.18324509412050247, "num_tokens": 17565937.0, "step": 10120 }, { "entropy": 5.516526746749878, "epoch": 0.7877844777280685, "grad_norm": 0.953125, "learning_rate": 0.0004943397338744523, "loss": 5.3523, "mean_token_accuracy": 0.17756358534097672, "num_tokens": 17574948.0, "step": 10125 }, { "entropy": 5.619197940826416, "epoch": 0.7881735070997861, "grad_norm": 0.90625, "learning_rate": 0.000494333554641848, "loss": 5.3654, "mean_token_accuracy": 0.1765134796500206, "num_tokens": 17584307.0, "step": 10130 }, { "entropy": 5.545857238769531, "epoch": 0.7885625364715037, "grad_norm": 1.046875, "learning_rate": 0.000494327372081206, "loss": 5.2297, "mean_token_accuracy": 0.1844295084476471, "num_tokens": 17592828.0, "step": 10135 }, { "entropy": 5.581251811981201, "epoch": 0.7889515658432211, "grad_norm": 0.9921875, "learning_rate": 0.0004943211861926204, "loss": 5.2854, "mean_token_accuracy": 0.18676233440637588, "num_tokens": 17601110.0, "step": 10140 }, { "entropy": 5.5625608444213865, "epoch": 0.7893405952149387, "grad_norm": 1.0859375, "learning_rate": 0.0004943149969761848, "loss": 5.2436, "mean_token_accuracy": 0.18348842412233352, "num_tokens": 17610221.0, "step": 10145 }, { "entropy": 5.540854406356812, "epoch": 0.7897296245866563, "grad_norm": 1.109375, "learning_rate": 0.0004943088044319932, "loss": 5.174, "mean_token_accuracy": 0.18292491137981415, "num_tokens": 17618343.0, "step": 10150 }, { "entropy": 5.546886253356933, "epoch": 0.7901186539583739, "grad_norm": 1.0546875, "learning_rate": 0.0004943026085601395, "loss": 5.2839, "mean_token_accuracy": 0.1819344252347946, "num_tokens": 17626885.0, "step": 10155 }, { "entropy": 5.536163425445556, "epoch": 0.7905076833300915, "grad_norm": 0.97265625, "learning_rate": 0.0004942964093607178, "loss": 5.36, "mean_token_accuracy": 0.17669307738542556, "num_tokens": 17635891.0, "step": 10160 }, { "entropy": 5.57954740524292, "epoch": 0.790896712701809, "grad_norm": 0.9765625, "learning_rate": 0.0004942902068338222, "loss": 5.1719, "mean_token_accuracy": 0.18569800853729249, "num_tokens": 17643815.0, "step": 10165 }, { "entropy": 5.565684032440186, "epoch": 0.7912857420735265, "grad_norm": 1.0234375, "learning_rate": 0.0004942840009795466, "loss": 5.2398, "mean_token_accuracy": 0.1842930570244789, "num_tokens": 17652414.0, "step": 10170 }, { "entropy": 5.547009086608886, "epoch": 0.7916747714452441, "grad_norm": 1.0, "learning_rate": 0.0004942777917979855, "loss": 5.3034, "mean_token_accuracy": 0.17551807165145875, "num_tokens": 17661382.0, "step": 10175 }, { "entropy": 5.531071758270263, "epoch": 0.7920638008169617, "grad_norm": 0.95703125, "learning_rate": 0.0004942715792892328, "loss": 5.252, "mean_token_accuracy": 0.17437173128128053, "num_tokens": 17669745.0, "step": 10180 }, { "entropy": 5.560464191436767, "epoch": 0.7924528301886793, "grad_norm": 0.94921875, "learning_rate": 0.000494265363453383, "loss": 5.2042, "mean_token_accuracy": 0.18362361043691636, "num_tokens": 17678646.0, "step": 10185 }, { "entropy": 5.574765539169311, "epoch": 0.7928418595603968, "grad_norm": 1.0, "learning_rate": 0.0004942591442905302, "loss": 5.342, "mean_token_accuracy": 0.17223089784383774, "num_tokens": 17687197.0, "step": 10190 }, { "entropy": 5.568060207366943, "epoch": 0.7932308889321144, "grad_norm": 1.0625, "learning_rate": 0.0004942529218007689, "loss": 5.3322, "mean_token_accuracy": 0.17627218663692473, "num_tokens": 17696528.0, "step": 10195 }, { "entropy": 5.532153463363647, "epoch": 0.7936199183038319, "grad_norm": 1.0078125, "learning_rate": 0.0004942466959841936, "loss": 5.2109, "mean_token_accuracy": 0.18019879162311553, "num_tokens": 17704688.0, "step": 10200 }, { "entropy": 5.437143087387085, "epoch": 0.7940089476755495, "grad_norm": 1.015625, "learning_rate": 0.0004942404668408985, "loss": 5.1121, "mean_token_accuracy": 0.197529399394989, "num_tokens": 17713039.0, "step": 10205 }, { "entropy": 5.585537385940552, "epoch": 0.7943979770472671, "grad_norm": 1.03125, "learning_rate": 0.0004942342343709783, "loss": 5.4013, "mean_token_accuracy": 0.17179318517446518, "num_tokens": 17721771.0, "step": 10210 }, { "entropy": 5.5868367671966555, "epoch": 0.7947870064189846, "grad_norm": 1.0, "learning_rate": 0.0004942279985745275, "loss": 5.2341, "mean_token_accuracy": 0.1795405477285385, "num_tokens": 17729982.0, "step": 10215 }, { "entropy": 5.548766279220581, "epoch": 0.7951760357907022, "grad_norm": 1.03125, "learning_rate": 0.0004942217594516409, "loss": 5.2484, "mean_token_accuracy": 0.1787489965558052, "num_tokens": 17738397.0, "step": 10220 }, { "entropy": 5.618678569793701, "epoch": 0.7955650651624198, "grad_norm": 1.078125, "learning_rate": 0.000494215517002413, "loss": 5.359, "mean_token_accuracy": 0.17360880672931672, "num_tokens": 17747421.0, "step": 10225 }, { "entropy": 5.576296138763428, "epoch": 0.7959540945341373, "grad_norm": 1.09375, "learning_rate": 0.0004942092712269384, "loss": 5.2894, "mean_token_accuracy": 0.17363293170928956, "num_tokens": 17756629.0, "step": 10230 }, { "entropy": 5.558225202560425, "epoch": 0.7963431239058549, "grad_norm": 1.0703125, "learning_rate": 0.0004942030221253122, "loss": 5.2961, "mean_token_accuracy": 0.18580178320407867, "num_tokens": 17764595.0, "step": 10235 }, { "entropy": 5.547394037246704, "epoch": 0.7967321532775724, "grad_norm": 0.94140625, "learning_rate": 0.0004941967696976289, "loss": 5.182, "mean_token_accuracy": 0.18426274955272676, "num_tokens": 17773522.0, "step": 10240 }, { "entropy": 5.536650896072388, "epoch": 0.79712118264929, "grad_norm": 1.0859375, "learning_rate": 0.0004941905139439835, "loss": 5.3027, "mean_token_accuracy": 0.183289997279644, "num_tokens": 17782850.0, "step": 10245 }, { "entropy": 5.470347118377686, "epoch": 0.7975102120210076, "grad_norm": 0.98046875, "learning_rate": 0.0004941842548644712, "loss": 5.158, "mean_token_accuracy": 0.18935055434703826, "num_tokens": 17790638.0, "step": 10250 }, { "entropy": 5.573339891433716, "epoch": 0.7978992413927252, "grad_norm": 1.015625, "learning_rate": 0.0004941779924591864, "loss": 5.3018, "mean_token_accuracy": 0.17207662612199784, "num_tokens": 17799992.0, "step": 10255 }, { "entropy": 5.505545663833618, "epoch": 0.7982882707644428, "grad_norm": 1.0, "learning_rate": 0.0004941717267282244, "loss": 5.2067, "mean_token_accuracy": 0.1826378509402275, "num_tokens": 17808643.0, "step": 10260 }, { "entropy": 5.541860151290893, "epoch": 0.7986773001361602, "grad_norm": 1.0625, "learning_rate": 0.0004941654576716806, "loss": 5.2106, "mean_token_accuracy": 0.18334080129861832, "num_tokens": 17816551.0, "step": 10265 }, { "entropy": 5.516403532028198, "epoch": 0.7990663295078778, "grad_norm": 0.9609375, "learning_rate": 0.0004941591852896495, "loss": 5.2391, "mean_token_accuracy": 0.18402206003665925, "num_tokens": 17825692.0, "step": 10270 }, { "entropy": 5.572368001937866, "epoch": 0.7994553588795954, "grad_norm": 0.9765625, "learning_rate": 0.0004941529095822268, "loss": 5.3479, "mean_token_accuracy": 0.17121150195598603, "num_tokens": 17833920.0, "step": 10275 }, { "entropy": 5.572353267669678, "epoch": 0.799844388251313, "grad_norm": 0.95703125, "learning_rate": 0.0004941466305495074, "loss": 5.3154, "mean_token_accuracy": 0.17272062599658966, "num_tokens": 17842339.0, "step": 10280 }, { "entropy": 5.507529592514038, "epoch": 0.8002334176230306, "grad_norm": 1.0078125, "learning_rate": 0.0004941403481915867, "loss": 5.221, "mean_token_accuracy": 0.18210890889167786, "num_tokens": 17851273.0, "step": 10285 }, { "entropy": 5.511989450454712, "epoch": 0.800622446994748, "grad_norm": 1.046875, "learning_rate": 0.0004941340625085601, "loss": 5.2588, "mean_token_accuracy": 0.18199315816164016, "num_tokens": 17860131.0, "step": 10290 }, { "entropy": 5.451030826568603, "epoch": 0.8010114763664656, "grad_norm": 1.0078125, "learning_rate": 0.0004941277735005228, "loss": 5.183, "mean_token_accuracy": 0.18900831192731857, "num_tokens": 17868670.0, "step": 10295 }, { "entropy": 5.55652003288269, "epoch": 0.8014005057381832, "grad_norm": 1.0625, "learning_rate": 0.0004941214811675702, "loss": 5.1796, "mean_token_accuracy": 0.18667263090610503, "num_tokens": 17876972.0, "step": 10300 }, { "entropy": 5.5093494892120365, "epoch": 0.8017895351099008, "grad_norm": 0.96484375, "learning_rate": 0.0004941151855097982, "loss": 5.2754, "mean_token_accuracy": 0.17642293125391006, "num_tokens": 17885708.0, "step": 10305 }, { "entropy": 5.601290845870972, "epoch": 0.8021785644816184, "grad_norm": 1.03125, "learning_rate": 0.0004941088865273018, "loss": 5.291, "mean_token_accuracy": 0.17429496645927428, "num_tokens": 17894003.0, "step": 10310 }, { "entropy": 5.5281816005706785, "epoch": 0.802567593853336, "grad_norm": 1.09375, "learning_rate": 0.0004941025842201769, "loss": 5.1275, "mean_token_accuracy": 0.19140205681324005, "num_tokens": 17903113.0, "step": 10315 }, { "entropy": 5.514891910552978, "epoch": 0.8029566232250535, "grad_norm": 1.0234375, "learning_rate": 0.0004940962785885189, "loss": 5.2165, "mean_token_accuracy": 0.17935004234313964, "num_tokens": 17912222.0, "step": 10320 }, { "entropy": 5.55033392906189, "epoch": 0.803345652596771, "grad_norm": 1.0, "learning_rate": 0.0004940899696324237, "loss": 5.2994, "mean_token_accuracy": 0.17741072028875352, "num_tokens": 17920900.0, "step": 10325 }, { "entropy": 5.60826849937439, "epoch": 0.8037346819684886, "grad_norm": 1.0078125, "learning_rate": 0.0004940836573519868, "loss": 5.3233, "mean_token_accuracy": 0.17978237718343734, "num_tokens": 17929221.0, "step": 10330 }, { "entropy": 5.515179872512817, "epoch": 0.8041237113402062, "grad_norm": 1.0390625, "learning_rate": 0.0004940773417473043, "loss": 5.235, "mean_token_accuracy": 0.18211790919303894, "num_tokens": 17938019.0, "step": 10335 }, { "entropy": 5.500888681411743, "epoch": 0.8045127407119238, "grad_norm": 1.0078125, "learning_rate": 0.0004940710228184717, "loss": 5.2083, "mean_token_accuracy": 0.18903656899929047, "num_tokens": 17946972.0, "step": 10340 }, { "entropy": 5.590160894393921, "epoch": 0.8049017700836413, "grad_norm": 0.91796875, "learning_rate": 0.000494064700565585, "loss": 5.3162, "mean_token_accuracy": 0.17665481865406035, "num_tokens": 17956487.0, "step": 10345 }, { "entropy": 5.478394937515259, "epoch": 0.8052907994553589, "grad_norm": 0.89453125, "learning_rate": 0.0004940583749887403, "loss": 5.2167, "mean_token_accuracy": 0.18098169267177583, "num_tokens": 17965838.0, "step": 10350 }, { "entropy": 5.621855020523071, "epoch": 0.8056798288270764, "grad_norm": 1.0625, "learning_rate": 0.0004940520460880333, "loss": 5.3214, "mean_token_accuracy": 0.17822395712137223, "num_tokens": 17974492.0, "step": 10355 }, { "entropy": 5.5938249111175535, "epoch": 0.806068858198794, "grad_norm": 1.0234375, "learning_rate": 0.0004940457138635601, "loss": 5.2904, "mean_token_accuracy": 0.18426005989313127, "num_tokens": 17983056.0, "step": 10360 }, { "entropy": 5.501426029205322, "epoch": 0.8064578875705116, "grad_norm": 1.03125, "learning_rate": 0.0004940393783154169, "loss": 5.2478, "mean_token_accuracy": 0.1829010561108589, "num_tokens": 17990822.0, "step": 10365 }, { "entropy": 5.47200608253479, "epoch": 0.8068469169422291, "grad_norm": 0.98828125, "learning_rate": 0.0004940330394436999, "loss": 5.1643, "mean_token_accuracy": 0.19085012078285218, "num_tokens": 17999284.0, "step": 10370 }, { "entropy": 5.548887825012207, "epoch": 0.8072359463139467, "grad_norm": 0.98046875, "learning_rate": 0.000494026697248505, "loss": 5.3193, "mean_token_accuracy": 0.18064596951007844, "num_tokens": 18007585.0, "step": 10375 }, { "entropy": 5.448264741897583, "epoch": 0.8076249756856643, "grad_norm": 1.0234375, "learning_rate": 0.0004940203517299287, "loss": 5.1755, "mean_token_accuracy": 0.18118565976619722, "num_tokens": 18016332.0, "step": 10380 }, { "entropy": 5.569855976104736, "epoch": 0.8080140050573819, "grad_norm": 0.96484375, "learning_rate": 0.000494014002888067, "loss": 5.2932, "mean_token_accuracy": 0.1763343408703804, "num_tokens": 18025524.0, "step": 10385 }, { "entropy": 5.552229404449463, "epoch": 0.8084030344290994, "grad_norm": 0.9765625, "learning_rate": 0.0004940076507230166, "loss": 5.2792, "mean_token_accuracy": 0.1820867657661438, "num_tokens": 18033951.0, "step": 10390 }, { "entropy": 5.680067157745361, "epoch": 0.8087920638008169, "grad_norm": 1.109375, "learning_rate": 0.0004940012952348735, "loss": 5.3969, "mean_token_accuracy": 0.17616181969642639, "num_tokens": 18042258.0, "step": 10395 }, { "entropy": 5.593752193450928, "epoch": 0.8091810931725345, "grad_norm": 0.98828125, "learning_rate": 0.0004939949364237345, "loss": 5.1729, "mean_token_accuracy": 0.18507616072893143, "num_tokens": 18050630.0, "step": 10400 }, { "entropy": 5.519416952133179, "epoch": 0.8095701225442521, "grad_norm": 1.1015625, "learning_rate": 0.0004939885742896958, "loss": 5.2703, "mean_token_accuracy": 0.18009306788444518, "num_tokens": 18059141.0, "step": 10405 }, { "entropy": 5.5265296459197994, "epoch": 0.8099591519159697, "grad_norm": 1.03125, "learning_rate": 0.000493982208832854, "loss": 5.2749, "mean_token_accuracy": 0.17932132631540298, "num_tokens": 18067831.0, "step": 10410 }, { "entropy": 5.637141418457031, "epoch": 0.8103481812876873, "grad_norm": 1.125, "learning_rate": 0.0004939758400533058, "loss": 5.3654, "mean_token_accuracy": 0.17379961013793946, "num_tokens": 18076629.0, "step": 10415 }, { "entropy": 5.549745702743531, "epoch": 0.8107372106594047, "grad_norm": 1.0078125, "learning_rate": 0.0004939694679511478, "loss": 5.2133, "mean_token_accuracy": 0.18306296020746232, "num_tokens": 18085930.0, "step": 10420 }, { "entropy": 5.551803255081177, "epoch": 0.8111262400311223, "grad_norm": 1.015625, "learning_rate": 0.0004939630925264765, "loss": 5.2515, "mean_token_accuracy": 0.18021342754364014, "num_tokens": 18094947.0, "step": 10425 }, { "entropy": 5.555429410934448, "epoch": 0.8115152694028399, "grad_norm": 1.0703125, "learning_rate": 0.000493956713779389, "loss": 5.3133, "mean_token_accuracy": 0.1799653187394142, "num_tokens": 18103838.0, "step": 10430 }, { "entropy": 5.554565286636352, "epoch": 0.8119042987745575, "grad_norm": 1.015625, "learning_rate": 0.0004939503317099817, "loss": 5.177, "mean_token_accuracy": 0.1844314604997635, "num_tokens": 18112587.0, "step": 10435 }, { "entropy": 5.527368497848511, "epoch": 0.8122933281462751, "grad_norm": 1.1015625, "learning_rate": 0.0004939439463183517, "loss": 5.1996, "mean_token_accuracy": 0.18574080765247344, "num_tokens": 18121094.0, "step": 10440 }, { "entropy": 5.594413471221924, "epoch": 0.8126823575179926, "grad_norm": 1.1171875, "learning_rate": 0.0004939375576045958, "loss": 5.3006, "mean_token_accuracy": 0.18318731486797332, "num_tokens": 18129699.0, "step": 10445 }, { "entropy": 5.570493602752686, "epoch": 0.8130713868897101, "grad_norm": 0.9921875, "learning_rate": 0.0004939311655688109, "loss": 5.2515, "mean_token_accuracy": 0.1860767811536789, "num_tokens": 18138466.0, "step": 10450 }, { "entropy": 5.527794408798218, "epoch": 0.8134604162614277, "grad_norm": 1.0390625, "learning_rate": 0.0004939247702110941, "loss": 5.3087, "mean_token_accuracy": 0.1832980751991272, "num_tokens": 18147436.0, "step": 10455 }, { "entropy": 5.56290225982666, "epoch": 0.8138494456331453, "grad_norm": 0.97265625, "learning_rate": 0.0004939183715315423, "loss": 5.2612, "mean_token_accuracy": 0.18561258018016816, "num_tokens": 18156228.0, "step": 10460 }, { "entropy": 5.56533784866333, "epoch": 0.8142384750048629, "grad_norm": 1.0546875, "learning_rate": 0.0004939119695302526, "loss": 5.2736, "mean_token_accuracy": 0.17960922569036483, "num_tokens": 18164571.0, "step": 10465 }, { "entropy": 5.551176643371582, "epoch": 0.8146275043765804, "grad_norm": 1.1171875, "learning_rate": 0.0004939055642073224, "loss": 5.2899, "mean_token_accuracy": 0.17826141268014908, "num_tokens": 18173322.0, "step": 10470 }, { "entropy": 5.590441417694092, "epoch": 0.815016533748298, "grad_norm": 1.015625, "learning_rate": 0.0004938991555628484, "loss": 5.3691, "mean_token_accuracy": 0.17837988436222077, "num_tokens": 18182306.0, "step": 10475 }, { "entropy": 5.642142868041992, "epoch": 0.8154055631200156, "grad_norm": 1.140625, "learning_rate": 0.0004938927435969283, "loss": 5.3275, "mean_token_accuracy": 0.17471859157085418, "num_tokens": 18190567.0, "step": 10480 }, { "entropy": 5.636589860916137, "epoch": 0.8157945924917331, "grad_norm": 1.0859375, "learning_rate": 0.0004938863283096592, "loss": 5.358, "mean_token_accuracy": 0.1726572796702385, "num_tokens": 18199678.0, "step": 10485 }, { "entropy": 5.484126138687134, "epoch": 0.8161836218634507, "grad_norm": 1.0078125, "learning_rate": 0.0004938799097011384, "loss": 5.0973, "mean_token_accuracy": 0.18642169684171678, "num_tokens": 18208350.0, "step": 10490 }, { "entropy": 5.579818677902222, "epoch": 0.8165726512351682, "grad_norm": 0.984375, "learning_rate": 0.0004938734877714634, "loss": 5.2205, "mean_token_accuracy": 0.17800672203302384, "num_tokens": 18216618.0, "step": 10495 }, { "entropy": 5.56155366897583, "epoch": 0.8169616806068858, "grad_norm": 1.0078125, "learning_rate": 0.0004938670625207317, "loss": 5.2438, "mean_token_accuracy": 0.18664785325527192, "num_tokens": 18224633.0, "step": 10500 }, { "entropy": 5.540253305435181, "epoch": 0.8173507099786034, "grad_norm": 1.0859375, "learning_rate": 0.0004938606339490406, "loss": 5.1886, "mean_token_accuracy": 0.18040821105241775, "num_tokens": 18233212.0, "step": 10505 }, { "entropy": 5.608698081970215, "epoch": 0.817739739350321, "grad_norm": 1.015625, "learning_rate": 0.0004938542020564877, "loss": 5.3636, "mean_token_accuracy": 0.17857760190963745, "num_tokens": 18241796.0, "step": 10510 }, { "entropy": 5.5558243751525875, "epoch": 0.8181287687220385, "grad_norm": 1.4453125, "learning_rate": 0.0004938477668431706, "loss": 5.3693, "mean_token_accuracy": 0.1828357234597206, "num_tokens": 18251416.0, "step": 10515 }, { "entropy": 5.548902797698974, "epoch": 0.8185177980937561, "grad_norm": 1.0703125, "learning_rate": 0.0004938413283091871, "loss": 5.1576, "mean_token_accuracy": 0.18625995218753816, "num_tokens": 18259880.0, "step": 10520 }, { "entropy": 5.478700160980225, "epoch": 0.8189068274654736, "grad_norm": 1.125, "learning_rate": 0.0004938348864546347, "loss": 5.2436, "mean_token_accuracy": 0.18840804994106292, "num_tokens": 18268217.0, "step": 10525 }, { "entropy": 5.490329313278198, "epoch": 0.8192958568371912, "grad_norm": 1.0625, "learning_rate": 0.0004938284412796111, "loss": 5.301, "mean_token_accuracy": 0.18139395713806153, "num_tokens": 18276556.0, "step": 10530 }, { "entropy": 5.542969799041748, "epoch": 0.8196848862089088, "grad_norm": 1.03125, "learning_rate": 0.0004938219927842144, "loss": 5.2535, "mean_token_accuracy": 0.18201657980680466, "num_tokens": 18285199.0, "step": 10535 }, { "entropy": 5.543492555618286, "epoch": 0.8200739155806264, "grad_norm": 0.953125, "learning_rate": 0.0004938155409685422, "loss": 5.221, "mean_token_accuracy": 0.18483659029006957, "num_tokens": 18294004.0, "step": 10540 }, { "entropy": 5.479832887649536, "epoch": 0.820462944952344, "grad_norm": 1.0625, "learning_rate": 0.0004938090858326923, "loss": 5.1451, "mean_token_accuracy": 0.1871393457055092, "num_tokens": 18301761.0, "step": 10545 }, { "entropy": 5.584003448486328, "epoch": 0.8208519743240614, "grad_norm": 1.0625, "learning_rate": 0.000493802627376763, "loss": 5.349, "mean_token_accuracy": 0.17411619573831558, "num_tokens": 18309555.0, "step": 10550 }, { "entropy": 5.5634064197540285, "epoch": 0.821241003695779, "grad_norm": 1.03125, "learning_rate": 0.0004937961656008518, "loss": 5.3124, "mean_token_accuracy": 0.17790265679359435, "num_tokens": 18318011.0, "step": 10555 }, { "entropy": 5.587578916549683, "epoch": 0.8216300330674966, "grad_norm": 1.0, "learning_rate": 0.0004937897005050573, "loss": 5.3019, "mean_token_accuracy": 0.17786704897880554, "num_tokens": 18326108.0, "step": 10560 }, { "entropy": 5.5615644454956055, "epoch": 0.8220190624392142, "grad_norm": 1.09375, "learning_rate": 0.0004937832320894772, "loss": 5.2564, "mean_token_accuracy": 0.1778743878006935, "num_tokens": 18334777.0, "step": 10565 }, { "entropy": 5.5428698539733885, "epoch": 0.8224080918109318, "grad_norm": 0.953125, "learning_rate": 0.0004937767603542098, "loss": 5.223, "mean_token_accuracy": 0.17921229600906372, "num_tokens": 18343796.0, "step": 10570 }, { "entropy": 5.549758958816528, "epoch": 0.8227971211826492, "grad_norm": 0.9765625, "learning_rate": 0.0004937702852993534, "loss": 5.2602, "mean_token_accuracy": 0.1769055426120758, "num_tokens": 18352396.0, "step": 10575 }, { "entropy": 5.534566402435303, "epoch": 0.8231861505543668, "grad_norm": 1.0234375, "learning_rate": 0.000493763806925006, "loss": 5.2718, "mean_token_accuracy": 0.1870693102478981, "num_tokens": 18360914.0, "step": 10580 }, { "entropy": 5.5200659275054935, "epoch": 0.8235751799260844, "grad_norm": 1.03125, "learning_rate": 0.0004937573252312661, "loss": 5.2379, "mean_token_accuracy": 0.18408682346343994, "num_tokens": 18369281.0, "step": 10585 }, { "entropy": 5.510223770141602, "epoch": 0.823964209297802, "grad_norm": 1.109375, "learning_rate": 0.000493750840218232, "loss": 5.0911, "mean_token_accuracy": 0.19342626482248307, "num_tokens": 18377305.0, "step": 10590 }, { "entropy": 5.5342694282531735, "epoch": 0.8243532386695196, "grad_norm": 0.9921875, "learning_rate": 0.0004937443518860021, "loss": 5.2192, "mean_token_accuracy": 0.1735801115632057, "num_tokens": 18386563.0, "step": 10595 }, { "entropy": 5.528779554367065, "epoch": 0.8247422680412371, "grad_norm": 0.9609375, "learning_rate": 0.0004937378602346747, "loss": 5.2364, "mean_token_accuracy": 0.1893967166543007, "num_tokens": 18395150.0, "step": 10600 }, { "entropy": 5.559446954727173, "epoch": 0.8251312974129547, "grad_norm": 1.0859375, "learning_rate": 0.0004937313652643485, "loss": 5.3637, "mean_token_accuracy": 0.17537704557180406, "num_tokens": 18403790.0, "step": 10605 }, { "entropy": 5.588216972351074, "epoch": 0.8255203267846722, "grad_norm": 1.015625, "learning_rate": 0.000493724866975122, "loss": 5.2308, "mean_token_accuracy": 0.18539801836013795, "num_tokens": 18411936.0, "step": 10610 }, { "entropy": 5.4975566387176515, "epoch": 0.8259093561563898, "grad_norm": 0.9296875, "learning_rate": 0.0004937183653670937, "loss": 5.1205, "mean_token_accuracy": 0.1907249301671982, "num_tokens": 18421146.0, "step": 10615 }, { "entropy": 5.54138445854187, "epoch": 0.8262983855281074, "grad_norm": 1.0234375, "learning_rate": 0.0004937118604403623, "loss": 5.2338, "mean_token_accuracy": 0.18405063152313234, "num_tokens": 18429498.0, "step": 10620 }, { "entropy": 5.594035053253174, "epoch": 0.8266874148998249, "grad_norm": 0.89453125, "learning_rate": 0.0004937053521950266, "loss": 5.3016, "mean_token_accuracy": 0.1795467182993889, "num_tokens": 18438600.0, "step": 10625 }, { "entropy": 5.529293155670166, "epoch": 0.8270764442715425, "grad_norm": 1.078125, "learning_rate": 0.0004936988406311854, "loss": 5.1834, "mean_token_accuracy": 0.18156871795654297, "num_tokens": 18447397.0, "step": 10630 }, { "entropy": 5.523371791839599, "epoch": 0.8274654736432601, "grad_norm": 1.015625, "learning_rate": 0.0004936923257489373, "loss": 5.2629, "mean_token_accuracy": 0.17718516588211058, "num_tokens": 18456677.0, "step": 10635 }, { "entropy": 5.508723735809326, "epoch": 0.8278545030149776, "grad_norm": 1.0, "learning_rate": 0.0004936858075483811, "loss": 5.1952, "mean_token_accuracy": 0.18520419001579286, "num_tokens": 18465605.0, "step": 10640 }, { "entropy": 5.508184766769409, "epoch": 0.8282435323866952, "grad_norm": 1.0390625, "learning_rate": 0.000493679286029616, "loss": 5.2287, "mean_token_accuracy": 0.1800902873277664, "num_tokens": 18474419.0, "step": 10645 }, { "entropy": 5.64747462272644, "epoch": 0.8286325617584127, "grad_norm": 1.1171875, "learning_rate": 0.0004936727611927407, "loss": 5.354, "mean_token_accuracy": 0.17717713862657547, "num_tokens": 18482646.0, "step": 10650 }, { "entropy": 5.54002046585083, "epoch": 0.8290215911301303, "grad_norm": 1.015625, "learning_rate": 0.0004936662330378546, "loss": 5.2057, "mean_token_accuracy": 0.1830547034740448, "num_tokens": 18490899.0, "step": 10655 }, { "entropy": 5.526831150054932, "epoch": 0.8294106205018479, "grad_norm": 1.015625, "learning_rate": 0.0004936597015650561, "loss": 5.2091, "mean_token_accuracy": 0.18813900351524354, "num_tokens": 18499238.0, "step": 10660 }, { "entropy": 5.520270872116089, "epoch": 0.8297996498735655, "grad_norm": 1.0859375, "learning_rate": 0.0004936531667744448, "loss": 5.1793, "mean_token_accuracy": 0.17968463003635407, "num_tokens": 18507668.0, "step": 10665 }, { "entropy": 5.588473844528198, "epoch": 0.8301886792452831, "grad_norm": 1.109375, "learning_rate": 0.0004936466286661197, "loss": 5.2449, "mean_token_accuracy": 0.18253855854272844, "num_tokens": 18516366.0, "step": 10670 }, { "entropy": 5.5107598304748535, "epoch": 0.8305777086170005, "grad_norm": 0.9453125, "learning_rate": 0.00049364008724018, "loss": 5.2216, "mean_token_accuracy": 0.18302127122879028, "num_tokens": 18525012.0, "step": 10675 }, { "entropy": 5.5812681198120115, "epoch": 0.8309667379887181, "grad_norm": 1.0546875, "learning_rate": 0.000493633542496725, "loss": 5.3062, "mean_token_accuracy": 0.18337736427783966, "num_tokens": 18533277.0, "step": 10680 }, { "entropy": 5.57138500213623, "epoch": 0.8313557673604357, "grad_norm": 1.0546875, "learning_rate": 0.0004936269944358539, "loss": 5.3108, "mean_token_accuracy": 0.17496419250965117, "num_tokens": 18541738.0, "step": 10685 }, { "entropy": 5.58394193649292, "epoch": 0.8317447967321533, "grad_norm": 0.984375, "learning_rate": 0.0004936204430576664, "loss": 5.271, "mean_token_accuracy": 0.18091964572668076, "num_tokens": 18550305.0, "step": 10690 }, { "entropy": 5.544063138961792, "epoch": 0.8321338261038709, "grad_norm": 1.015625, "learning_rate": 0.0004936138883622614, "loss": 5.2318, "mean_token_accuracy": 0.19183179289102553, "num_tokens": 18558528.0, "step": 10695 }, { "entropy": 5.469418525695801, "epoch": 0.8325228554755884, "grad_norm": 0.953125, "learning_rate": 0.0004936073303497387, "loss": 5.1722, "mean_token_accuracy": 0.18760383278131484, "num_tokens": 18567166.0, "step": 10700 }, { "entropy": 5.494637823104858, "epoch": 0.8329118848473059, "grad_norm": 1.0, "learning_rate": 0.0004936007690201976, "loss": 5.1935, "mean_token_accuracy": 0.18928715586662292, "num_tokens": 18575986.0, "step": 10705 }, { "entropy": 5.599856281280518, "epoch": 0.8333009142190235, "grad_norm": 0.9375, "learning_rate": 0.000493594204373738, "loss": 5.2465, "mean_token_accuracy": 0.17514331936836242, "num_tokens": 18585446.0, "step": 10710 }, { "entropy": 5.553297996520996, "epoch": 0.8336899435907411, "grad_norm": 1.015625, "learning_rate": 0.0004935876364104591, "loss": 5.2774, "mean_token_accuracy": 0.18375732898712158, "num_tokens": 18594236.0, "step": 10715 }, { "entropy": 5.539151382446289, "epoch": 0.8340789729624587, "grad_norm": 0.99609375, "learning_rate": 0.0004935810651304608, "loss": 5.2727, "mean_token_accuracy": 0.1795378729701042, "num_tokens": 18603229.0, "step": 10720 }, { "entropy": 5.518246507644653, "epoch": 0.8344680023341763, "grad_norm": 1.0, "learning_rate": 0.0004935744905338427, "loss": 5.1297, "mean_token_accuracy": 0.19666348099708558, "num_tokens": 18611783.0, "step": 10725 }, { "entropy": 5.610187101364136, "epoch": 0.8348570317058938, "grad_norm": 1.015625, "learning_rate": 0.0004935679126207046, "loss": 5.3275, "mean_token_accuracy": 0.17979582101106645, "num_tokens": 18620901.0, "step": 10730 }, { "entropy": 5.523731851577759, "epoch": 0.8352460610776113, "grad_norm": 1.09375, "learning_rate": 0.0004935613313911463, "loss": 5.2326, "mean_token_accuracy": 0.17777478843927383, "num_tokens": 18629447.0, "step": 10735 }, { "entropy": 5.581677579879761, "epoch": 0.8356350904493289, "grad_norm": 1.0625, "learning_rate": 0.0004935547468452678, "loss": 5.2634, "mean_token_accuracy": 0.18409804850816727, "num_tokens": 18637895.0, "step": 10740 }, { "entropy": 5.576303434371948, "epoch": 0.8360241198210465, "grad_norm": 1.1484375, "learning_rate": 0.0004935481589831688, "loss": 5.3899, "mean_token_accuracy": 0.17418855279684067, "num_tokens": 18646417.0, "step": 10745 }, { "entropy": 5.575652599334717, "epoch": 0.8364131491927641, "grad_norm": 1.03125, "learning_rate": 0.0004935415678049492, "loss": 5.3088, "mean_token_accuracy": 0.17884970754384993, "num_tokens": 18654814.0, "step": 10750 }, { "entropy": 5.595830678939819, "epoch": 0.8368021785644816, "grad_norm": 0.9453125, "learning_rate": 0.0004935349733107094, "loss": 5.2989, "mean_token_accuracy": 0.18440109640359878, "num_tokens": 18663520.0, "step": 10755 }, { "entropy": 5.545376777648926, "epoch": 0.8371912079361992, "grad_norm": 0.953125, "learning_rate": 0.000493528375500549, "loss": 5.3275, "mean_token_accuracy": 0.1782543271780014, "num_tokens": 18672033.0, "step": 10760 }, { "entropy": 5.54251537322998, "epoch": 0.8375802373079168, "grad_norm": 1.0625, "learning_rate": 0.0004935217743745685, "loss": 5.1263, "mean_token_accuracy": 0.191961570084095, "num_tokens": 18680690.0, "step": 10765 }, { "entropy": 5.522523355484009, "epoch": 0.8379692666796343, "grad_norm": 1.140625, "learning_rate": 0.0004935151699328677, "loss": 5.2418, "mean_token_accuracy": 0.17692058384418488, "num_tokens": 18688683.0, "step": 10770 }, { "entropy": 5.484722566604614, "epoch": 0.8383582960513519, "grad_norm": 1.015625, "learning_rate": 0.0004935085621755471, "loss": 5.3234, "mean_token_accuracy": 0.17820271998643875, "num_tokens": 18697273.0, "step": 10775 }, { "entropy": 5.616714000701904, "epoch": 0.8387473254230694, "grad_norm": 1.046875, "learning_rate": 0.000493501951102707, "loss": 5.2921, "mean_token_accuracy": 0.17552858144044875, "num_tokens": 18705076.0, "step": 10780 }, { "entropy": 5.537790441513062, "epoch": 0.839136354794787, "grad_norm": 0.96484375, "learning_rate": 0.0004934953367144474, "loss": 5.1677, "mean_token_accuracy": 0.1860572099685669, "num_tokens": 18713596.0, "step": 10785 }, { "entropy": 5.485022783279419, "epoch": 0.8395253841665046, "grad_norm": 0.98828125, "learning_rate": 0.0004934887190108688, "loss": 5.1857, "mean_token_accuracy": 0.1858276531100273, "num_tokens": 18722611.0, "step": 10790 }, { "entropy": 5.609499931335449, "epoch": 0.8399144135382222, "grad_norm": 0.98828125, "learning_rate": 0.0004934820979920719, "loss": 5.3379, "mean_token_accuracy": 0.1708538606762886, "num_tokens": 18731126.0, "step": 10795 }, { "entropy": 5.534915781021118, "epoch": 0.8403034429099397, "grad_norm": 1.09375, "learning_rate": 0.0004934754736581567, "loss": 5.2294, "mean_token_accuracy": 0.17858947664499283, "num_tokens": 18739815.0, "step": 10800 }, { "entropy": 5.478046035766601, "epoch": 0.8406924722816572, "grad_norm": 0.98046875, "learning_rate": 0.000493468846009224, "loss": 5.1545, "mean_token_accuracy": 0.19134612679481505, "num_tokens": 18748603.0, "step": 10805 }, { "entropy": 5.507309770584106, "epoch": 0.8410815016533748, "grad_norm": 0.9609375, "learning_rate": 0.0004934622150453742, "loss": 5.2552, "mean_token_accuracy": 0.17772441059350969, "num_tokens": 18757819.0, "step": 10810 }, { "entropy": 5.602052545547485, "epoch": 0.8414705310250924, "grad_norm": 0.94140625, "learning_rate": 0.000493455580766708, "loss": 5.266, "mean_token_accuracy": 0.17887115776538848, "num_tokens": 18766135.0, "step": 10815 }, { "entropy": 5.515768527984619, "epoch": 0.84185956039681, "grad_norm": 1.046875, "learning_rate": 0.0004934489431733262, "loss": 5.1591, "mean_token_accuracy": 0.18530394583940507, "num_tokens": 18775202.0, "step": 10820 }, { "entropy": 5.508689069747925, "epoch": 0.8422485897685276, "grad_norm": 1.046875, "learning_rate": 0.0004934423022653293, "loss": 5.2298, "mean_token_accuracy": 0.18810921162366867, "num_tokens": 18783466.0, "step": 10825 }, { "entropy": 5.543803453445435, "epoch": 0.842637619140245, "grad_norm": 1.0546875, "learning_rate": 0.0004934356580428182, "loss": 5.2305, "mean_token_accuracy": 0.1796533927321434, "num_tokens": 18791772.0, "step": 10830 }, { "entropy": 5.617976713180542, "epoch": 0.8430266485119626, "grad_norm": 1.0859375, "learning_rate": 0.0004934290105058937, "loss": 5.3857, "mean_token_accuracy": 0.17383247017860412, "num_tokens": 18801094.0, "step": 10835 }, { "entropy": 5.553902578353882, "epoch": 0.8434156778836802, "grad_norm": 0.96484375, "learning_rate": 0.0004934223596546565, "loss": 5.1615, "mean_token_accuracy": 0.18740533292293549, "num_tokens": 18809256.0, "step": 10840 }, { "entropy": 5.533125305175782, "epoch": 0.8438047072553978, "grad_norm": 1.0078125, "learning_rate": 0.0004934157054892077, "loss": 5.3314, "mean_token_accuracy": 0.18046908229589462, "num_tokens": 18818109.0, "step": 10845 }, { "entropy": 5.549737119674683, "epoch": 0.8441937366271154, "grad_norm": 1.0234375, "learning_rate": 0.0004934090480096482, "loss": 5.203, "mean_token_accuracy": 0.1879824861884117, "num_tokens": 18826330.0, "step": 10850 }, { "entropy": 5.629470348358154, "epoch": 0.8445827659988329, "grad_norm": 1.0703125, "learning_rate": 0.0004934023872160791, "loss": 5.4019, "mean_token_accuracy": 0.17526203095912934, "num_tokens": 18835280.0, "step": 10855 }, { "entropy": 5.499673795700073, "epoch": 0.8449717953705504, "grad_norm": 1.140625, "learning_rate": 0.0004933957231086014, "loss": 5.1609, "mean_token_accuracy": 0.1841066911816597, "num_tokens": 18843300.0, "step": 10860 }, { "entropy": 5.463746643066406, "epoch": 0.845360824742268, "grad_norm": 1.078125, "learning_rate": 0.0004933890556873161, "loss": 5.2548, "mean_token_accuracy": 0.17553244531154633, "num_tokens": 18852257.0, "step": 10865 }, { "entropy": 5.56828932762146, "epoch": 0.8457498541139856, "grad_norm": 1.078125, "learning_rate": 0.0004933823849523246, "loss": 5.2856, "mean_token_accuracy": 0.18161431699991226, "num_tokens": 18860621.0, "step": 10870 }, { "entropy": 5.5673925399780275, "epoch": 0.8461388834857032, "grad_norm": 1.0703125, "learning_rate": 0.0004933757109037279, "loss": 5.1902, "mean_token_accuracy": 0.18614138811826705, "num_tokens": 18869390.0, "step": 10875 }, { "entropy": 5.555185747146607, "epoch": 0.8465279128574207, "grad_norm": 1.0078125, "learning_rate": 0.0004933690335416274, "loss": 5.2911, "mean_token_accuracy": 0.17937638312578202, "num_tokens": 18877942.0, "step": 10880 }, { "entropy": 5.503046321868896, "epoch": 0.8469169422291383, "grad_norm": 1.0703125, "learning_rate": 0.0004933623528661245, "loss": 5.2779, "mean_token_accuracy": 0.1784745156764984, "num_tokens": 18886752.0, "step": 10885 }, { "entropy": 5.5775063037872314, "epoch": 0.8473059716008559, "grad_norm": 1.0, "learning_rate": 0.0004933556688773203, "loss": 5.2903, "mean_token_accuracy": 0.17868355214595794, "num_tokens": 18895708.0, "step": 10890 }, { "entropy": 5.567748641967773, "epoch": 0.8476950009725734, "grad_norm": 1.0078125, "learning_rate": 0.0004933489815753165, "loss": 5.2268, "mean_token_accuracy": 0.18473885357379913, "num_tokens": 18904610.0, "step": 10895 }, { "entropy": 5.520393228530883, "epoch": 0.848084030344291, "grad_norm": 1.015625, "learning_rate": 0.0004933422909602143, "loss": 5.2711, "mean_token_accuracy": 0.1805527240037918, "num_tokens": 18912886.0, "step": 10900 }, { "entropy": 5.569060850143432, "epoch": 0.8484730597160085, "grad_norm": 1.0625, "learning_rate": 0.0004933355970321155, "loss": 5.3132, "mean_token_accuracy": 0.17902422547340394, "num_tokens": 18921685.0, "step": 10905 }, { "entropy": 5.564014148712158, "epoch": 0.8488620890877261, "grad_norm": 0.984375, "learning_rate": 0.0004933288997911215, "loss": 5.2286, "mean_token_accuracy": 0.1850571870803833, "num_tokens": 18929843.0, "step": 10910 }, { "entropy": 5.497473621368409, "epoch": 0.8492511184594437, "grad_norm": 0.9453125, "learning_rate": 0.0004933221992373338, "loss": 5.2166, "mean_token_accuracy": 0.17965936958789824, "num_tokens": 18938402.0, "step": 10915 }, { "entropy": 5.563475131988525, "epoch": 0.8496401478311613, "grad_norm": 1.03125, "learning_rate": 0.0004933154953708544, "loss": 5.3496, "mean_token_accuracy": 0.1703747108578682, "num_tokens": 18947643.0, "step": 10920 }, { "entropy": 5.616429376602173, "epoch": 0.8500291772028788, "grad_norm": 1.03125, "learning_rate": 0.0004933087881917848, "loss": 5.2793, "mean_token_accuracy": 0.17879072725772857, "num_tokens": 18956320.0, "step": 10925 }, { "entropy": 5.681483268737793, "epoch": 0.8504182065745964, "grad_norm": 1.0078125, "learning_rate": 0.0004933020777002268, "loss": 5.2558, "mean_token_accuracy": 0.1776057004928589, "num_tokens": 18964804.0, "step": 10930 }, { "entropy": 5.464506435394287, "epoch": 0.8508072359463139, "grad_norm": 1.140625, "learning_rate": 0.0004932953638962823, "loss": 5.2032, "mean_token_accuracy": 0.1821805253624916, "num_tokens": 18973061.0, "step": 10935 }, { "entropy": 5.506009244918824, "epoch": 0.8511962653180315, "grad_norm": 1.1328125, "learning_rate": 0.000493288646780053, "loss": 5.1873, "mean_token_accuracy": 0.18650328516960143, "num_tokens": 18981604.0, "step": 10940 }, { "entropy": 5.55337553024292, "epoch": 0.8515852946897491, "grad_norm": 1.046875, "learning_rate": 0.0004932819263516409, "loss": 5.2905, "mean_token_accuracy": 0.17652418315410615, "num_tokens": 18990194.0, "step": 10945 }, { "entropy": 5.532214689254761, "epoch": 0.8519743240614667, "grad_norm": 0.98828125, "learning_rate": 0.0004932752026111481, "loss": 5.1958, "mean_token_accuracy": 0.181524658203125, "num_tokens": 18998803.0, "step": 10950 }, { "entropy": 5.625107955932617, "epoch": 0.8523633534331843, "grad_norm": 0.99609375, "learning_rate": 0.0004932684755586765, "loss": 5.3102, "mean_token_accuracy": 0.17468704134225846, "num_tokens": 19007247.0, "step": 10955 }, { "entropy": 5.5398841381073, "epoch": 0.8527523828049017, "grad_norm": 1.0, "learning_rate": 0.0004932617451943282, "loss": 5.233, "mean_token_accuracy": 0.18560332357883452, "num_tokens": 19015436.0, "step": 10960 }, { "entropy": 5.594821643829346, "epoch": 0.8531414121766193, "grad_norm": 1.0546875, "learning_rate": 0.0004932550115182053, "loss": 5.329, "mean_token_accuracy": 0.17277351170778274, "num_tokens": 19023673.0, "step": 10965 }, { "entropy": 5.534565210342407, "epoch": 0.8535304415483369, "grad_norm": 1.0078125, "learning_rate": 0.00049324827453041, "loss": 5.1617, "mean_token_accuracy": 0.1841248795390129, "num_tokens": 19031714.0, "step": 10970 }, { "entropy": 5.432816839218139, "epoch": 0.8539194709200545, "grad_norm": 1.03125, "learning_rate": 0.0004932415342310446, "loss": 5.1636, "mean_token_accuracy": 0.1836773708462715, "num_tokens": 19039910.0, "step": 10975 }, { "entropy": 5.564401769638062, "epoch": 0.8543085002917721, "grad_norm": 0.953125, "learning_rate": 0.0004932347906202111, "loss": 5.2955, "mean_token_accuracy": 0.18685130327939986, "num_tokens": 19048293.0, "step": 10980 }, { "entropy": 5.569058752059936, "epoch": 0.8546975296634896, "grad_norm": 0.9921875, "learning_rate": 0.000493228043698012, "loss": 5.2267, "mean_token_accuracy": 0.17633443474769592, "num_tokens": 19056209.0, "step": 10985 }, { "entropy": 5.5361498355865475, "epoch": 0.8550865590352071, "grad_norm": 1.0, "learning_rate": 0.0004932212934645498, "loss": 5.131, "mean_token_accuracy": 0.18912424743175507, "num_tokens": 19063974.0, "step": 10990 }, { "entropy": 5.55227575302124, "epoch": 0.8554755884069247, "grad_norm": 1.0078125, "learning_rate": 0.0004932145399199268, "loss": 5.3794, "mean_token_accuracy": 0.17500831484794616, "num_tokens": 19072531.0, "step": 10995 }, { "entropy": 5.653836059570312, "epoch": 0.8558646177786423, "grad_norm": 0.984375, "learning_rate": 0.0004932077830642455, "loss": 5.3062, "mean_token_accuracy": 0.17791387736797332, "num_tokens": 19081299.0, "step": 11000 }, { "entropy": 5.5676939487457275, "epoch": 0.8562536471503599, "grad_norm": 1.015625, "learning_rate": 0.0004932010228976084, "loss": 5.2054, "mean_token_accuracy": 0.19290074110031127, "num_tokens": 19089599.0, "step": 11005 }, { "entropy": 5.505162048339844, "epoch": 0.8566426765220774, "grad_norm": 1.0234375, "learning_rate": 0.000493194259420118, "loss": 5.1904, "mean_token_accuracy": 0.18730612546205522, "num_tokens": 19097910.0, "step": 11010 }, { "entropy": 5.47117166519165, "epoch": 0.857031705893795, "grad_norm": 1.09375, "learning_rate": 0.000493187492631877, "loss": 5.1448, "mean_token_accuracy": 0.19171023964881898, "num_tokens": 19105939.0, "step": 11015 }, { "entropy": 5.477901887893677, "epoch": 0.8574207352655125, "grad_norm": 0.99609375, "learning_rate": 0.0004931807225329882, "loss": 5.2035, "mean_token_accuracy": 0.18485299944877626, "num_tokens": 19115407.0, "step": 11020 }, { "entropy": 5.48896336555481, "epoch": 0.8578097646372301, "grad_norm": 1.0859375, "learning_rate": 0.0004931739491235541, "loss": 5.1254, "mean_token_accuracy": 0.19273362755775453, "num_tokens": 19123715.0, "step": 11025 }, { "entropy": 5.63070068359375, "epoch": 0.8581987940089477, "grad_norm": 0.98046875, "learning_rate": 0.0004931671724036777, "loss": 5.3584, "mean_token_accuracy": 0.17230788320302964, "num_tokens": 19132978.0, "step": 11030 }, { "entropy": 5.544386148452759, "epoch": 0.8585878233806652, "grad_norm": 1.046875, "learning_rate": 0.0004931603923734616, "loss": 5.304, "mean_token_accuracy": 0.18017314970493317, "num_tokens": 19141822.0, "step": 11035 }, { "entropy": 5.48143048286438, "epoch": 0.8589768527523828, "grad_norm": 1.15625, "learning_rate": 0.0004931536090330088, "loss": 5.1992, "mean_token_accuracy": 0.17714929580688477, "num_tokens": 19150612.0, "step": 11040 }, { "entropy": 5.528379964828491, "epoch": 0.8593658821241004, "grad_norm": 1.03125, "learning_rate": 0.0004931468223824222, "loss": 5.154, "mean_token_accuracy": 0.187422776222229, "num_tokens": 19159266.0, "step": 11045 }, { "entropy": 5.66276741027832, "epoch": 0.859754911495818, "grad_norm": 1.0234375, "learning_rate": 0.0004931400324218048, "loss": 5.3327, "mean_token_accuracy": 0.18183230310678483, "num_tokens": 19167111.0, "step": 11050 }, { "entropy": 5.5265590190887455, "epoch": 0.8601439408675355, "grad_norm": 1.0078125, "learning_rate": 0.0004931332391512597, "loss": 5.299, "mean_token_accuracy": 0.17914700508117676, "num_tokens": 19177152.0, "step": 11055 }, { "entropy": 5.481976747512817, "epoch": 0.860532970239253, "grad_norm": 1.1484375, "learning_rate": 0.0004931264425708897, "loss": 5.1277, "mean_token_accuracy": 0.18320668041706084, "num_tokens": 19185692.0, "step": 11060 }, { "entropy": 5.541192865371704, "epoch": 0.8609219996109706, "grad_norm": 1.046875, "learning_rate": 0.0004931196426807983, "loss": 5.2936, "mean_token_accuracy": 0.18152756094932557, "num_tokens": 19194620.0, "step": 11065 }, { "entropy": 5.561440801620483, "epoch": 0.8613110289826882, "grad_norm": 1.1015625, "learning_rate": 0.0004931128394810884, "loss": 5.1748, "mean_token_accuracy": 0.18811147212982177, "num_tokens": 19202569.0, "step": 11070 }, { "entropy": 5.5706174850463865, "epoch": 0.8617000583544058, "grad_norm": 1.1015625, "learning_rate": 0.0004931060329718634, "loss": 5.3196, "mean_token_accuracy": 0.1782485216856003, "num_tokens": 19211117.0, "step": 11075 }, { "entropy": 5.602764034271241, "epoch": 0.8620890877261234, "grad_norm": 1.0703125, "learning_rate": 0.0004930992231532265, "loss": 5.3058, "mean_token_accuracy": 0.1797836884856224, "num_tokens": 19220015.0, "step": 11080 }, { "entropy": 5.619830846786499, "epoch": 0.8624781170978408, "grad_norm": 1.0390625, "learning_rate": 0.000493092410025281, "loss": 5.3065, "mean_token_accuracy": 0.17686312794685363, "num_tokens": 19228344.0, "step": 11085 }, { "entropy": 5.50443320274353, "epoch": 0.8628671464695584, "grad_norm": 0.98046875, "learning_rate": 0.0004930855935881302, "loss": 5.1899, "mean_token_accuracy": 0.19230535328388215, "num_tokens": 19236776.0, "step": 11090 }, { "entropy": 5.623230743408203, "epoch": 0.863256175841276, "grad_norm": 1.03125, "learning_rate": 0.0004930787738418777, "loss": 5.4134, "mean_token_accuracy": 0.1671035945415497, "num_tokens": 19246107.0, "step": 11095 }, { "entropy": 5.607535982131958, "epoch": 0.8636452052129936, "grad_norm": 1.03125, "learning_rate": 0.0004930719507866269, "loss": 5.2901, "mean_token_accuracy": 0.18587073683738708, "num_tokens": 19254549.0, "step": 11100 }, { "entropy": 5.572094249725342, "epoch": 0.8640342345847112, "grad_norm": 0.94921875, "learning_rate": 0.0004930651244224814, "loss": 5.2949, "mean_token_accuracy": 0.1801662638783455, "num_tokens": 19263024.0, "step": 11105 }, { "entropy": 5.512962055206299, "epoch": 0.8644232639564287, "grad_norm": 0.9609375, "learning_rate": 0.0004930582947495448, "loss": 5.208, "mean_token_accuracy": 0.18059032112360002, "num_tokens": 19271442.0, "step": 11110 }, { "entropy": 5.517531108856201, "epoch": 0.8648122933281462, "grad_norm": 0.96484375, "learning_rate": 0.0004930514617679206, "loss": 5.1614, "mean_token_accuracy": 0.19100626111030578, "num_tokens": 19279869.0, "step": 11115 }, { "entropy": 5.5686924934387205, "epoch": 0.8652013226998638, "grad_norm": 1.0234375, "learning_rate": 0.0004930446254777125, "loss": 5.3574, "mean_token_accuracy": 0.17958442270755767, "num_tokens": 19288726.0, "step": 11120 }, { "entropy": 5.583649730682373, "epoch": 0.8655903520715814, "grad_norm": 1.03125, "learning_rate": 0.0004930377858790242, "loss": 5.3107, "mean_token_accuracy": 0.1751727432012558, "num_tokens": 19297546.0, "step": 11125 }, { "entropy": 5.6224347114562985, "epoch": 0.865979381443299, "grad_norm": 0.9609375, "learning_rate": 0.0004930309429719595, "loss": 5.3092, "mean_token_accuracy": 0.17556509673595427, "num_tokens": 19306060.0, "step": 11130 }, { "entropy": 5.566957283020019, "epoch": 0.8663684108150166, "grad_norm": 1.046875, "learning_rate": 0.0004930240967566224, "loss": 5.2567, "mean_token_accuracy": 0.18031541854143143, "num_tokens": 19314759.0, "step": 11135 }, { "entropy": 5.527809047698975, "epoch": 0.8667574401867341, "grad_norm": 1.046875, "learning_rate": 0.0004930172472331167, "loss": 5.2052, "mean_token_accuracy": 0.18215182721614837, "num_tokens": 19322922.0, "step": 11140 }, { "entropy": 5.4821202754974365, "epoch": 0.8671464695584516, "grad_norm": 0.984375, "learning_rate": 0.0004930103944015463, "loss": 5.1269, "mean_token_accuracy": 0.18408451080322266, "num_tokens": 19331946.0, "step": 11145 }, { "entropy": 5.600930023193359, "epoch": 0.8675354989301692, "grad_norm": 1.0546875, "learning_rate": 0.0004930035382620149, "loss": 5.2751, "mean_token_accuracy": 0.1778065100312233, "num_tokens": 19340512.0, "step": 11150 }, { "entropy": 5.529328298568726, "epoch": 0.8679245283018868, "grad_norm": 0.9609375, "learning_rate": 0.000492996678814627, "loss": 5.2405, "mean_token_accuracy": 0.1811877131462097, "num_tokens": 19349135.0, "step": 11155 }, { "entropy": 5.535189580917359, "epoch": 0.8683135576736044, "grad_norm": 1.0859375, "learning_rate": 0.0004929898160594865, "loss": 5.3284, "mean_token_accuracy": 0.17958931028842925, "num_tokens": 19358593.0, "step": 11160 }, { "entropy": 5.6465692043304445, "epoch": 0.8687025870453219, "grad_norm": 0.984375, "learning_rate": 0.0004929829499966974, "loss": 5.3534, "mean_token_accuracy": 0.17606135904788972, "num_tokens": 19367366.0, "step": 11165 }, { "entropy": 5.592950296401978, "epoch": 0.8690916164170395, "grad_norm": 0.97265625, "learning_rate": 0.0004929760806263641, "loss": 5.3247, "mean_token_accuracy": 0.1734875425696373, "num_tokens": 19376872.0, "step": 11170 }, { "entropy": 5.615838670730591, "epoch": 0.8694806457887571, "grad_norm": 1.03125, "learning_rate": 0.0004929692079485906, "loss": 5.3295, "mean_token_accuracy": 0.17325059622526168, "num_tokens": 19385582.0, "step": 11175 }, { "entropy": 5.5427587032318115, "epoch": 0.8698696751604746, "grad_norm": 1.0546875, "learning_rate": 0.0004929623319634814, "loss": 5.2206, "mean_token_accuracy": 0.1821684569120407, "num_tokens": 19394102.0, "step": 11180 }, { "entropy": 5.562895441055298, "epoch": 0.8702587045321922, "grad_norm": 1.0546875, "learning_rate": 0.0004929554526711407, "loss": 5.2562, "mean_token_accuracy": 0.17677873075008393, "num_tokens": 19403170.0, "step": 11185 }, { "entropy": 5.5495288372039795, "epoch": 0.8706477339039097, "grad_norm": 0.9453125, "learning_rate": 0.0004929485700716729, "loss": 5.2215, "mean_token_accuracy": 0.1873213306069374, "num_tokens": 19412396.0, "step": 11190 }, { "entropy": 5.550656509399414, "epoch": 0.8710367632756273, "grad_norm": 1.046875, "learning_rate": 0.0004929416841651824, "loss": 5.2, "mean_token_accuracy": 0.18274609446525575, "num_tokens": 19421247.0, "step": 11195 }, { "entropy": 5.526799917221069, "epoch": 0.8714257926473449, "grad_norm": 0.9765625, "learning_rate": 0.0004929347949517739, "loss": 5.2357, "mean_token_accuracy": 0.1788181945681572, "num_tokens": 19429412.0, "step": 11200 }, { "entropy": 5.582285690307617, "epoch": 0.8718148220190625, "grad_norm": 1.046875, "learning_rate": 0.0004929279024315516, "loss": 5.261, "mean_token_accuracy": 0.17433381527662278, "num_tokens": 19437551.0, "step": 11205 }, { "entropy": 5.462672519683838, "epoch": 0.87220385139078, "grad_norm": 1.0390625, "learning_rate": 0.0004929210066046204, "loss": 5.0975, "mean_token_accuracy": 0.18734758198261262, "num_tokens": 19446356.0, "step": 11210 }, { "entropy": 5.46998782157898, "epoch": 0.8725928807624975, "grad_norm": 1.21875, "learning_rate": 0.0004929141074710847, "loss": 5.0587, "mean_token_accuracy": 0.19531500339508057, "num_tokens": 19454142.0, "step": 11215 }, { "entropy": 5.617652940750122, "epoch": 0.8729819101342151, "grad_norm": 1.109375, "learning_rate": 0.0004929072050310491, "loss": 5.3743, "mean_token_accuracy": 0.1781470462679863, "num_tokens": 19462849.0, "step": 11220 }, { "entropy": 5.5333860397338865, "epoch": 0.8733709395059327, "grad_norm": 0.95703125, "learning_rate": 0.0004929002992846188, "loss": 5.1635, "mean_token_accuracy": 0.18983460515737532, "num_tokens": 19471287.0, "step": 11225 }, { "entropy": 5.52715311050415, "epoch": 0.8737599688776503, "grad_norm": 1.0, "learning_rate": 0.0004928933902318981, "loss": 5.2262, "mean_token_accuracy": 0.18716436475515366, "num_tokens": 19480661.0, "step": 11230 }, { "entropy": 5.476283359527588, "epoch": 0.8741489982493679, "grad_norm": 1.125, "learning_rate": 0.000492886477872992, "loss": 5.1206, "mean_token_accuracy": 0.1878957837820053, "num_tokens": 19489716.0, "step": 11235 }, { "entropy": 5.516184234619141, "epoch": 0.8745380276210853, "grad_norm": 1.046875, "learning_rate": 0.0004928795622080054, "loss": 5.271, "mean_token_accuracy": 0.17724187672138214, "num_tokens": 19499019.0, "step": 11240 }, { "entropy": 5.5679398536682125, "epoch": 0.8749270569928029, "grad_norm": 1.09375, "learning_rate": 0.0004928726432370434, "loss": 5.2028, "mean_token_accuracy": 0.18291952461004257, "num_tokens": 19507281.0, "step": 11245 }, { "entropy": 5.585212564468383, "epoch": 0.8753160863645205, "grad_norm": 1.015625, "learning_rate": 0.0004928657209602107, "loss": 5.2724, "mean_token_accuracy": 0.18346301317214966, "num_tokens": 19516196.0, "step": 11250 }, { "entropy": 5.568840551376343, "epoch": 0.8757051157362381, "grad_norm": 1.109375, "learning_rate": 0.0004928587953776125, "loss": 5.301, "mean_token_accuracy": 0.1767169713973999, "num_tokens": 19523966.0, "step": 11255 }, { "entropy": 5.544528913497925, "epoch": 0.8760941451079557, "grad_norm": 1.015625, "learning_rate": 0.0004928518664893538, "loss": 5.1989, "mean_token_accuracy": 0.18428248316049575, "num_tokens": 19532848.0, "step": 11260 }, { "entropy": 5.5038737773895265, "epoch": 0.8764831744796732, "grad_norm": 1.015625, "learning_rate": 0.0004928449342955397, "loss": 5.1579, "mean_token_accuracy": 0.18306698352098466, "num_tokens": 19540929.0, "step": 11265 }, { "entropy": 5.5189353942871096, "epoch": 0.8768722038513908, "grad_norm": 1.015625, "learning_rate": 0.0004928379987962756, "loss": 5.2666, "mean_token_accuracy": 0.1850006937980652, "num_tokens": 19549628.0, "step": 11270 }, { "entropy": 5.520605087280273, "epoch": 0.8772612332231083, "grad_norm": 0.93359375, "learning_rate": 0.0004928310599916666, "loss": 5.2004, "mean_token_accuracy": 0.17930981069803237, "num_tokens": 19559002.0, "step": 11275 }, { "entropy": 5.522569465637207, "epoch": 0.8776502625948259, "grad_norm": 0.96484375, "learning_rate": 0.0004928241178818178, "loss": 5.211, "mean_token_accuracy": 0.185836298763752, "num_tokens": 19567757.0, "step": 11280 }, { "entropy": 5.536190605163574, "epoch": 0.8780392919665435, "grad_norm": 1.0546875, "learning_rate": 0.0004928171724668349, "loss": 5.1391, "mean_token_accuracy": 0.19180002361536025, "num_tokens": 19576595.0, "step": 11285 }, { "entropy": 5.529078960418701, "epoch": 0.878428321338261, "grad_norm": 1.03125, "learning_rate": 0.0004928102237468229, "loss": 5.2671, "mean_token_accuracy": 0.17619390189647674, "num_tokens": 19585237.0, "step": 11290 }, { "entropy": 5.504305791854859, "epoch": 0.8788173507099786, "grad_norm": 1.015625, "learning_rate": 0.0004928032717218876, "loss": 5.1496, "mean_token_accuracy": 0.18973541706800462, "num_tokens": 19594474.0, "step": 11295 }, { "entropy": 5.515873193740845, "epoch": 0.8792063800816962, "grad_norm": 0.97265625, "learning_rate": 0.0004927963163921343, "loss": 5.1986, "mean_token_accuracy": 0.18612133711576462, "num_tokens": 19603121.0, "step": 11300 }, { "entropy": 5.548409557342529, "epoch": 0.8795954094534137, "grad_norm": 1.0625, "learning_rate": 0.0004927893577576685, "loss": 5.2416, "mean_token_accuracy": 0.178195983171463, "num_tokens": 19611820.0, "step": 11305 }, { "entropy": 5.574872350692749, "epoch": 0.8799844388251313, "grad_norm": 1.0859375, "learning_rate": 0.0004927823958185959, "loss": 5.2413, "mean_token_accuracy": 0.1796655535697937, "num_tokens": 19620265.0, "step": 11310 }, { "entropy": 5.457470178604126, "epoch": 0.8803734681968488, "grad_norm": 1.0703125, "learning_rate": 0.000492775430575022, "loss": 5.0919, "mean_token_accuracy": 0.18922037333250047, "num_tokens": 19628847.0, "step": 11315 }, { "entropy": 5.51951265335083, "epoch": 0.8807624975685664, "grad_norm": 0.9921875, "learning_rate": 0.0004927684620270527, "loss": 5.2556, "mean_token_accuracy": 0.18119800239801406, "num_tokens": 19637636.0, "step": 11320 }, { "entropy": 5.527203226089478, "epoch": 0.881151526940284, "grad_norm": 0.98046875, "learning_rate": 0.0004927614901747935, "loss": 5.2369, "mean_token_accuracy": 0.1773467481136322, "num_tokens": 19646663.0, "step": 11325 }, { "entropy": 5.531182050704956, "epoch": 0.8815405563120016, "grad_norm": 0.96484375, "learning_rate": 0.0004927545150183503, "loss": 5.2139, "mean_token_accuracy": 0.18406083434820175, "num_tokens": 19655382.0, "step": 11330 }, { "entropy": 5.52825083732605, "epoch": 0.8819295856837192, "grad_norm": 1.078125, "learning_rate": 0.000492747536557829, "loss": 5.2201, "mean_token_accuracy": 0.18831291794776917, "num_tokens": 19663851.0, "step": 11335 }, { "entropy": 5.479758596420288, "epoch": 0.8823186150554367, "grad_norm": 1.03125, "learning_rate": 0.0004927405547933353, "loss": 5.1738, "mean_token_accuracy": 0.1878650203347206, "num_tokens": 19672813.0, "step": 11340 }, { "entropy": 5.5052190780639645, "epoch": 0.8827076444271542, "grad_norm": 0.96875, "learning_rate": 0.0004927335697249753, "loss": 5.1695, "mean_token_accuracy": 0.18782930672168732, "num_tokens": 19682240.0, "step": 11345 }, { "entropy": 5.569630765914917, "epoch": 0.8830966737988718, "grad_norm": 0.97265625, "learning_rate": 0.0004927265813528549, "loss": 5.2212, "mean_token_accuracy": 0.18088840693235397, "num_tokens": 19691080.0, "step": 11350 }, { "entropy": 5.5099883556365965, "epoch": 0.8834857031705894, "grad_norm": 1.09375, "learning_rate": 0.0004927195896770804, "loss": 5.1779, "mean_token_accuracy": 0.1918042242527008, "num_tokens": 19700067.0, "step": 11355 }, { "entropy": 5.529403257369995, "epoch": 0.883874732542307, "grad_norm": 0.953125, "learning_rate": 0.0004927125946977574, "loss": 5.1834, "mean_token_accuracy": 0.18812153488397598, "num_tokens": 19708236.0, "step": 11360 }, { "entropy": 5.560075139999389, "epoch": 0.8842637619140246, "grad_norm": 0.99609375, "learning_rate": 0.0004927055964149923, "loss": 5.3031, "mean_token_accuracy": 0.18180075138807297, "num_tokens": 19717225.0, "step": 11365 }, { "entropy": 5.522982168197632, "epoch": 0.884652791285742, "grad_norm": 1.046875, "learning_rate": 0.0004926985948288914, "loss": 5.2625, "mean_token_accuracy": 0.1891829937696457, "num_tokens": 19725169.0, "step": 11370 }, { "entropy": 5.536978340148925, "epoch": 0.8850418206574596, "grad_norm": 1.03125, "learning_rate": 0.0004926915899395608, "loss": 5.2319, "mean_token_accuracy": 0.1837349683046341, "num_tokens": 19733937.0, "step": 11375 }, { "entropy": 5.510504961013794, "epoch": 0.8854308500291772, "grad_norm": 0.9453125, "learning_rate": 0.0004926845817471068, "loss": 5.1838, "mean_token_accuracy": 0.19284587651491164, "num_tokens": 19742661.0, "step": 11380 }, { "entropy": 5.487407159805298, "epoch": 0.8858198794008948, "grad_norm": 1.1015625, "learning_rate": 0.0004926775702516358, "loss": 5.244, "mean_token_accuracy": 0.18677958250045776, "num_tokens": 19751314.0, "step": 11385 }, { "entropy": 5.523621511459351, "epoch": 0.8862089087726124, "grad_norm": 1.109375, "learning_rate": 0.0004926705554532541, "loss": 5.1774, "mean_token_accuracy": 0.1917124480009079, "num_tokens": 19760144.0, "step": 11390 }, { "entropy": 5.505693769454956, "epoch": 0.8865979381443299, "grad_norm": 1.0078125, "learning_rate": 0.0004926635373520682, "loss": 5.1946, "mean_token_accuracy": 0.18730054050683975, "num_tokens": 19768574.0, "step": 11395 }, { "entropy": 5.585032606124878, "epoch": 0.8869869675160474, "grad_norm": 0.95703125, "learning_rate": 0.0004926565159481845, "loss": 5.2959, "mean_token_accuracy": 0.1737936854362488, "num_tokens": 19778383.0, "step": 11400 }, { "entropy": 5.551654720306397, "epoch": 0.887375996887765, "grad_norm": 1.0390625, "learning_rate": 0.0004926494912417097, "loss": 5.2116, "mean_token_accuracy": 0.1848152220249176, "num_tokens": 19787707.0, "step": 11405 }, { "entropy": 5.531039810180664, "epoch": 0.8877650262594826, "grad_norm": 1.1171875, "learning_rate": 0.0004926424632327503, "loss": 5.1094, "mean_token_accuracy": 0.19663903564214708, "num_tokens": 19795909.0, "step": 11410 }, { "entropy": 5.4795300483703615, "epoch": 0.8881540556312002, "grad_norm": 1.0546875, "learning_rate": 0.0004926354319214129, "loss": 5.1733, "mean_token_accuracy": 0.18454110771417617, "num_tokens": 19804094.0, "step": 11415 }, { "entropy": 5.460201930999756, "epoch": 0.8885430850029177, "grad_norm": 0.9765625, "learning_rate": 0.0004926283973078041, "loss": 5.0873, "mean_token_accuracy": 0.18923551142215728, "num_tokens": 19813061.0, "step": 11420 }, { "entropy": 5.472792053222657, "epoch": 0.8889321143746353, "grad_norm": 1.09375, "learning_rate": 0.0004926213593920309, "loss": 5.101, "mean_token_accuracy": 0.1912500724196434, "num_tokens": 19821432.0, "step": 11425 }, { "entropy": 5.5045366287231445, "epoch": 0.8893211437463528, "grad_norm": 1.0234375, "learning_rate": 0.0004926143181742, "loss": 5.2396, "mean_token_accuracy": 0.18476988971233368, "num_tokens": 19830278.0, "step": 11430 }, { "entropy": 5.429034233093262, "epoch": 0.8897101731180704, "grad_norm": 1.0859375, "learning_rate": 0.0004926072736544181, "loss": 5.1641, "mean_token_accuracy": 0.18787843286991118, "num_tokens": 19838872.0, "step": 11435 }, { "entropy": 5.632330846786499, "epoch": 0.890099202489788, "grad_norm": 1.046875, "learning_rate": 0.0004926002258327922, "loss": 5.2996, "mean_token_accuracy": 0.17796659767627715, "num_tokens": 19848032.0, "step": 11440 }, { "entropy": 5.509681034088135, "epoch": 0.8904882318615055, "grad_norm": 1.0703125, "learning_rate": 0.0004925931747094292, "loss": 5.1606, "mean_token_accuracy": 0.19246817976236344, "num_tokens": 19856711.0, "step": 11445 }, { "entropy": 5.380377531051636, "epoch": 0.8908772612332231, "grad_norm": 1.0, "learning_rate": 0.0004925861202844361, "loss": 5.1387, "mean_token_accuracy": 0.18535495549440384, "num_tokens": 19865643.0, "step": 11450 }, { "entropy": 5.535952854156494, "epoch": 0.8912662906049407, "grad_norm": 1.0859375, "learning_rate": 0.00049257906255792, "loss": 5.1655, "mean_token_accuracy": 0.18515115231275558, "num_tokens": 19874029.0, "step": 11455 }, { "entropy": 5.645742321014405, "epoch": 0.8916553199766583, "grad_norm": 1.0625, "learning_rate": 0.000492572001529988, "loss": 5.2919, "mean_token_accuracy": 0.17810761630535127, "num_tokens": 19883347.0, "step": 11460 }, { "entropy": 5.544638681411743, "epoch": 0.8920443493483758, "grad_norm": 1.046875, "learning_rate": 0.0004925649372007469, "loss": 5.209, "mean_token_accuracy": 0.18567140847444535, "num_tokens": 19891822.0, "step": 11465 }, { "entropy": 5.475942897796631, "epoch": 0.8924333787200933, "grad_norm": 1.0625, "learning_rate": 0.0004925578695703045, "loss": 5.1903, "mean_token_accuracy": 0.18323710560798645, "num_tokens": 19899899.0, "step": 11470 }, { "entropy": 5.577597141265869, "epoch": 0.8928224080918109, "grad_norm": 1.0625, "learning_rate": 0.0004925507986387676, "loss": 5.3281, "mean_token_accuracy": 0.18126303404569627, "num_tokens": 19908189.0, "step": 11475 }, { "entropy": 5.566147327423096, "epoch": 0.8932114374635285, "grad_norm": 1.078125, "learning_rate": 0.0004925437244062436, "loss": 5.2064, "mean_token_accuracy": 0.18268861174583434, "num_tokens": 19916166.0, "step": 11480 }, { "entropy": 5.528143358230591, "epoch": 0.8936004668352461, "grad_norm": 1.0546875, "learning_rate": 0.0004925366468728397, "loss": 5.2331, "mean_token_accuracy": 0.18684028089046478, "num_tokens": 19924222.0, "step": 11485 }, { "entropy": 5.52174859046936, "epoch": 0.8939894962069637, "grad_norm": 1.0546875, "learning_rate": 0.0004925295660386635, "loss": 5.3024, "mean_token_accuracy": 0.17870192229747772, "num_tokens": 19931925.0, "step": 11490 }, { "entropy": 5.583100175857544, "epoch": 0.8943785255786811, "grad_norm": 0.96875, "learning_rate": 0.0004925224819038224, "loss": 5.2565, "mean_token_accuracy": 0.18239305317401885, "num_tokens": 19940432.0, "step": 11495 }, { "entropy": 5.591109132766723, "epoch": 0.8947675549503987, "grad_norm": 1.046875, "learning_rate": 0.0004925153944684239, "loss": 5.2367, "mean_token_accuracy": 0.18197857439517975, "num_tokens": 19948013.0, "step": 11500 }, { "entropy": 5.552106237411499, "epoch": 0.8951565843221163, "grad_norm": 0.9921875, "learning_rate": 0.0004925083037325754, "loss": 5.1803, "mean_token_accuracy": 0.18869636058807374, "num_tokens": 19956161.0, "step": 11505 }, { "entropy": 5.570696830749512, "epoch": 0.8955456136938339, "grad_norm": 1.0703125, "learning_rate": 0.0004925012096963847, "loss": 5.1691, "mean_token_accuracy": 0.19198454171419144, "num_tokens": 19964533.0, "step": 11510 }, { "entropy": 5.597382402420044, "epoch": 0.8959346430655515, "grad_norm": 0.9609375, "learning_rate": 0.0004924941123599593, "loss": 5.2119, "mean_token_accuracy": 0.18112147301435472, "num_tokens": 19973915.0, "step": 11515 }, { "entropy": 5.461422252655029, "epoch": 0.896323672437269, "grad_norm": 1.0625, "learning_rate": 0.0004924870117234069, "loss": 5.2152, "mean_token_accuracy": 0.18430526405572892, "num_tokens": 19983422.0, "step": 11520 }, { "entropy": 5.562084293365478, "epoch": 0.8967127018089865, "grad_norm": 1.0703125, "learning_rate": 0.0004924799077868353, "loss": 5.2086, "mean_token_accuracy": 0.18218649327754974, "num_tokens": 19992185.0, "step": 11525 }, { "entropy": 5.545620536804199, "epoch": 0.8971017311807041, "grad_norm": 1.0546875, "learning_rate": 0.0004924728005503522, "loss": 5.0783, "mean_token_accuracy": 0.18648597598075867, "num_tokens": 20000735.0, "step": 11530 }, { "entropy": 5.496080160140991, "epoch": 0.8974907605524217, "grad_norm": 1.0390625, "learning_rate": 0.0004924656900140655, "loss": 5.2555, "mean_token_accuracy": 0.18169461488723754, "num_tokens": 20009758.0, "step": 11535 }, { "entropy": 5.5143226146697994, "epoch": 0.8978797899241393, "grad_norm": 1.0625, "learning_rate": 0.0004924585761780831, "loss": 5.1629, "mean_token_accuracy": 0.17769721448421477, "num_tokens": 20018369.0, "step": 11540 }, { "entropy": 5.59825382232666, "epoch": 0.8982688192958569, "grad_norm": 0.97265625, "learning_rate": 0.000492451459042513, "loss": 5.3005, "mean_token_accuracy": 0.17755273431539537, "num_tokens": 20027469.0, "step": 11545 }, { "entropy": 5.606056261062622, "epoch": 0.8986578486675744, "grad_norm": 1.0234375, "learning_rate": 0.000492444338607463, "loss": 5.2245, "mean_token_accuracy": 0.17962005585432053, "num_tokens": 20035504.0, "step": 11550 }, { "entropy": 5.508863162994385, "epoch": 0.899046878039292, "grad_norm": 0.9375, "learning_rate": 0.0004924372148730413, "loss": 5.1739, "mean_token_accuracy": 0.19141211062669755, "num_tokens": 20045272.0, "step": 11555 }, { "entropy": 5.5456148147583, "epoch": 0.8994359074110095, "grad_norm": 1.0625, "learning_rate": 0.000492430087839356, "loss": 5.1627, "mean_token_accuracy": 0.1815532147884369, "num_tokens": 20054041.0, "step": 11560 }, { "entropy": 5.543204641342163, "epoch": 0.8998249367827271, "grad_norm": 1.0390625, "learning_rate": 0.0004924229575065152, "loss": 5.1177, "mean_token_accuracy": 0.18746805787086487, "num_tokens": 20062337.0, "step": 11565 }, { "entropy": 5.539514589309692, "epoch": 0.9002139661544447, "grad_norm": 1.03125, "learning_rate": 0.000492415823874627, "loss": 5.2739, "mean_token_accuracy": 0.18309991359710692, "num_tokens": 20070767.0, "step": 11570 }, { "entropy": 5.591424417495728, "epoch": 0.9006029955261622, "grad_norm": 1.015625, "learning_rate": 0.0004924086869437998, "loss": 5.2098, "mean_token_accuracy": 0.18047481924295425, "num_tokens": 20079791.0, "step": 11575 }, { "entropy": 5.481707239151001, "epoch": 0.9009920248978798, "grad_norm": 1.0703125, "learning_rate": 0.0004924015467141417, "loss": 5.1125, "mean_token_accuracy": 0.19219427406787873, "num_tokens": 20088458.0, "step": 11580 }, { "entropy": 5.493997955322266, "epoch": 0.9013810542695974, "grad_norm": 1.0546875, "learning_rate": 0.0004923944031857613, "loss": 5.1994, "mean_token_accuracy": 0.1861426368355751, "num_tokens": 20097559.0, "step": 11585 }, { "entropy": 5.4814629554748535, "epoch": 0.901770083641315, "grad_norm": 1.1328125, "learning_rate": 0.0004923872563587668, "loss": 5.0878, "mean_token_accuracy": 0.19254623651504515, "num_tokens": 20105403.0, "step": 11590 }, { "entropy": 5.466583919525147, "epoch": 0.9021591130130325, "grad_norm": 0.94921875, "learning_rate": 0.0004923801062332666, "loss": 5.2492, "mean_token_accuracy": 0.18395482003688812, "num_tokens": 20115073.0, "step": 11595 }, { "entropy": 5.479728555679321, "epoch": 0.90254814238475, "grad_norm": 0.90234375, "learning_rate": 0.0004923729528093694, "loss": 5.2026, "mean_token_accuracy": 0.1841553971171379, "num_tokens": 20124064.0, "step": 11600 }, { "entropy": 5.583331441879272, "epoch": 0.9029371717564676, "grad_norm": 1.0078125, "learning_rate": 0.0004923657960871836, "loss": 5.2442, "mean_token_accuracy": 0.19219164103269576, "num_tokens": 20133364.0, "step": 11605 }, { "entropy": 5.494344425201416, "epoch": 0.9033262011281852, "grad_norm": 1.0078125, "learning_rate": 0.0004923586360668178, "loss": 5.2281, "mean_token_accuracy": 0.1866675928235054, "num_tokens": 20142099.0, "step": 11610 }, { "entropy": 5.4702314853668215, "epoch": 0.9037152304999028, "grad_norm": 1.0078125, "learning_rate": 0.0004923514727483807, "loss": 5.142, "mean_token_accuracy": 0.18838441967964173, "num_tokens": 20150421.0, "step": 11615 }, { "entropy": 5.574986743927002, "epoch": 0.9041042598716204, "grad_norm": 1.0078125, "learning_rate": 0.000492344306131981, "loss": 5.3034, "mean_token_accuracy": 0.18428612500429153, "num_tokens": 20159294.0, "step": 11620 }, { "entropy": 5.6521648406982425, "epoch": 0.9044932892433378, "grad_norm": 1.0859375, "learning_rate": 0.0004923371362177272, "loss": 5.3508, "mean_token_accuracy": 0.17535435110330583, "num_tokens": 20168082.0, "step": 11625 }, { "entropy": 5.544291162490845, "epoch": 0.9048823186150554, "grad_norm": 1.0390625, "learning_rate": 0.0004923299630057284, "loss": 5.1912, "mean_token_accuracy": 0.18422658890485763, "num_tokens": 20176933.0, "step": 11630 }, { "entropy": 5.5124529838562015, "epoch": 0.905271347986773, "grad_norm": 1.0625, "learning_rate": 0.0004923227864960934, "loss": 5.2498, "mean_token_accuracy": 0.18039043694734574, "num_tokens": 20185507.0, "step": 11635 }, { "entropy": 5.534951019287109, "epoch": 0.9056603773584906, "grad_norm": 1.0234375, "learning_rate": 0.000492315606688931, "loss": 5.2419, "mean_token_accuracy": 0.18117894232273102, "num_tokens": 20195206.0, "step": 11640 }, { "entropy": 5.536805629730225, "epoch": 0.9060494067302082, "grad_norm": 1.03125, "learning_rate": 0.0004923084235843501, "loss": 5.1733, "mean_token_accuracy": 0.1895822137594223, "num_tokens": 20203290.0, "step": 11645 }, { "entropy": 5.5393036842346195, "epoch": 0.9064384361019256, "grad_norm": 0.9921875, "learning_rate": 0.0004923012371824598, "loss": 5.2688, "mean_token_accuracy": 0.18187354505062103, "num_tokens": 20211808.0, "step": 11650 }, { "entropy": 5.572345542907715, "epoch": 0.9068274654736432, "grad_norm": 1.0, "learning_rate": 0.000492294047483369, "loss": 5.2667, "mean_token_accuracy": 0.17910204082727432, "num_tokens": 20219980.0, "step": 11655 }, { "entropy": 5.5504203796386715, "epoch": 0.9072164948453608, "grad_norm": 1.1875, "learning_rate": 0.0004922868544871869, "loss": 5.1714, "mean_token_accuracy": 0.1864182770252228, "num_tokens": 20227880.0, "step": 11660 }, { "entropy": 5.497947359085083, "epoch": 0.9076055242170784, "grad_norm": 1.046875, "learning_rate": 0.0004922796581940227, "loss": 5.229, "mean_token_accuracy": 0.17243314981460572, "num_tokens": 20237023.0, "step": 11665 }, { "entropy": 5.611249113082886, "epoch": 0.907994553588796, "grad_norm": 1.09375, "learning_rate": 0.0004922724586039855, "loss": 5.2695, "mean_token_accuracy": 0.18479921221733092, "num_tokens": 20246046.0, "step": 11670 }, { "entropy": 5.616004896163941, "epoch": 0.9083835829605135, "grad_norm": 1.078125, "learning_rate": 0.0004922652557171846, "loss": 5.2141, "mean_token_accuracy": 0.1874903380870819, "num_tokens": 20254392.0, "step": 11675 }, { "entropy": 5.444818639755249, "epoch": 0.9087726123322311, "grad_norm": 0.98828125, "learning_rate": 0.0004922580495337292, "loss": 5.1491, "mean_token_accuracy": 0.19083634465932847, "num_tokens": 20263529.0, "step": 11680 }, { "entropy": 5.488363361358642, "epoch": 0.9091616417039486, "grad_norm": 0.9921875, "learning_rate": 0.0004922508400537288, "loss": 5.2219, "mean_token_accuracy": 0.18348418176174164, "num_tokens": 20272226.0, "step": 11685 }, { "entropy": 5.542445135116577, "epoch": 0.9095506710756662, "grad_norm": 1.046875, "learning_rate": 0.0004922436272772926, "loss": 5.3149, "mean_token_accuracy": 0.17373220771551132, "num_tokens": 20281084.0, "step": 11690 }, { "entropy": 5.553008699417115, "epoch": 0.9099397004473838, "grad_norm": 0.9609375, "learning_rate": 0.0004922364112045301, "loss": 5.3019, "mean_token_accuracy": 0.18025858253240584, "num_tokens": 20290137.0, "step": 11695 }, { "entropy": 5.545133972167969, "epoch": 0.9103287298191013, "grad_norm": 0.9765625, "learning_rate": 0.000492229191835551, "loss": 5.1282, "mean_token_accuracy": 0.19323284775018693, "num_tokens": 20298305.0, "step": 11700 }, { "entropy": 5.530434894561767, "epoch": 0.9107177591908189, "grad_norm": 1.0625, "learning_rate": 0.0004922219691704645, "loss": 5.2398, "mean_token_accuracy": 0.18429169952869415, "num_tokens": 20306289.0, "step": 11705 }, { "entropy": 5.603179264068603, "epoch": 0.9111067885625365, "grad_norm": 0.9296875, "learning_rate": 0.0004922147432093805, "loss": 5.3343, "mean_token_accuracy": 0.1802520915865898, "num_tokens": 20314826.0, "step": 11710 }, { "entropy": 5.663875675201416, "epoch": 0.911495817934254, "grad_norm": 1.015625, "learning_rate": 0.0004922075139524083, "loss": 5.3789, "mean_token_accuracy": 0.1761022612452507, "num_tokens": 20323244.0, "step": 11715 }, { "entropy": 5.552782726287842, "epoch": 0.9118848473059716, "grad_norm": 1.0625, "learning_rate": 0.000492200281399658, "loss": 5.2543, "mean_token_accuracy": 0.17747358977794647, "num_tokens": 20331943.0, "step": 11720 }, { "entropy": 5.545907878875733, "epoch": 0.9122738766776891, "grad_norm": 1.0625, "learning_rate": 0.000492193045551239, "loss": 5.2501, "mean_token_accuracy": 0.18026496320962906, "num_tokens": 20339940.0, "step": 11725 }, { "entropy": 5.582332372665405, "epoch": 0.9126629060494067, "grad_norm": 1.0078125, "learning_rate": 0.0004921858064072612, "loss": 5.1045, "mean_token_accuracy": 0.19396570026874543, "num_tokens": 20348556.0, "step": 11730 }, { "entropy": 5.5467949390411375, "epoch": 0.9130519354211243, "grad_norm": 1.0625, "learning_rate": 0.0004921785639678347, "loss": 5.284, "mean_token_accuracy": 0.1855788990855217, "num_tokens": 20356909.0, "step": 11735 }, { "entropy": 5.522295665740967, "epoch": 0.9134409647928419, "grad_norm": 1.0, "learning_rate": 0.000492171318233069, "loss": 5.1802, "mean_token_accuracy": 0.18770511597394943, "num_tokens": 20365496.0, "step": 11740 }, { "entropy": 5.512374591827393, "epoch": 0.9138299941645595, "grad_norm": 1.1328125, "learning_rate": 0.0004921640692030742, "loss": 5.192, "mean_token_accuracy": 0.18125805705785752, "num_tokens": 20374763.0, "step": 11745 }, { "entropy": 5.5617804527282715, "epoch": 0.914219023536277, "grad_norm": 0.9765625, "learning_rate": 0.0004921568168779603, "loss": 5.2463, "mean_token_accuracy": 0.18501508980989456, "num_tokens": 20383861.0, "step": 11750 }, { "entropy": 5.54015588760376, "epoch": 0.9146080529079945, "grad_norm": 1.0546875, "learning_rate": 0.0004921495612578374, "loss": 5.2102, "mean_token_accuracy": 0.19265497624874114, "num_tokens": 20392004.0, "step": 11755 }, { "entropy": 5.566636085510254, "epoch": 0.9149970822797121, "grad_norm": 0.9921875, "learning_rate": 0.0004921423023428156, "loss": 5.2262, "mean_token_accuracy": 0.17809344977140426, "num_tokens": 20401078.0, "step": 11760 }, { "entropy": 5.676298666000366, "epoch": 0.9153861116514297, "grad_norm": 1.03125, "learning_rate": 0.0004921350401330049, "loss": 5.363, "mean_token_accuracy": 0.17461358308792113, "num_tokens": 20409347.0, "step": 11765 }, { "entropy": 5.572146987915039, "epoch": 0.9157751410231473, "grad_norm": 0.97265625, "learning_rate": 0.0004921277746285155, "loss": 5.181, "mean_token_accuracy": 0.18716677725315095, "num_tokens": 20417862.0, "step": 11770 }, { "entropy": 5.502587556838989, "epoch": 0.9161641703948649, "grad_norm": 0.9921875, "learning_rate": 0.0004921205058294579, "loss": 5.1463, "mean_token_accuracy": 0.18311374336481095, "num_tokens": 20426556.0, "step": 11775 }, { "entropy": 5.554633855819702, "epoch": 0.9165531997665823, "grad_norm": 1.046875, "learning_rate": 0.000492113233735942, "loss": 5.274, "mean_token_accuracy": 0.17725925594568254, "num_tokens": 20435336.0, "step": 11780 }, { "entropy": 5.576182079315186, "epoch": 0.9169422291382999, "grad_norm": 1.0546875, "learning_rate": 0.0004921059583480785, "loss": 5.2452, "mean_token_accuracy": 0.18238117545843124, "num_tokens": 20443884.0, "step": 11785 }, { "entropy": 5.522510528564453, "epoch": 0.9173312585100175, "grad_norm": 1.109375, "learning_rate": 0.0004920986796659775, "loss": 5.1359, "mean_token_accuracy": 0.19682417213916778, "num_tokens": 20451953.0, "step": 11790 }, { "entropy": 5.54691219329834, "epoch": 0.9177202878817351, "grad_norm": 1.0078125, "learning_rate": 0.0004920913976897498, "loss": 5.2864, "mean_token_accuracy": 0.1833428680896759, "num_tokens": 20461480.0, "step": 11795 }, { "entropy": 5.584488487243652, "epoch": 0.9181093172534527, "grad_norm": 1.015625, "learning_rate": 0.0004920841124195055, "loss": 5.2438, "mean_token_accuracy": 0.1795766457915306, "num_tokens": 20470324.0, "step": 11800 }, { "entropy": 5.589950799942017, "epoch": 0.9184983466251702, "grad_norm": 1.1015625, "learning_rate": 0.0004920768238553554, "loss": 5.2297, "mean_token_accuracy": 0.1787121295928955, "num_tokens": 20478795.0, "step": 11805 }, { "entropy": 5.560394668579102, "epoch": 0.9188873759968877, "grad_norm": 1.015625, "learning_rate": 0.0004920695319974099, "loss": 5.1903, "mean_token_accuracy": 0.18176875114440919, "num_tokens": 20487922.0, "step": 11810 }, { "entropy": 5.5067990779876705, "epoch": 0.9192764053686053, "grad_norm": 1.078125, "learning_rate": 0.0004920622368457798, "loss": 5.1975, "mean_token_accuracy": 0.1936303734779358, "num_tokens": 20495883.0, "step": 11815 }, { "entropy": 5.522235488891601, "epoch": 0.9196654347403229, "grad_norm": 0.96875, "learning_rate": 0.0004920549384005759, "loss": 5.2036, "mean_token_accuracy": 0.18583762496709824, "num_tokens": 20504403.0, "step": 11820 }, { "entropy": 5.495119857788086, "epoch": 0.9200544641120405, "grad_norm": 0.9609375, "learning_rate": 0.0004920476366619086, "loss": 5.1019, "mean_token_accuracy": 0.19050845205783845, "num_tokens": 20512603.0, "step": 11825 }, { "entropy": 5.473958349227905, "epoch": 0.920443493483758, "grad_norm": 1.0546875, "learning_rate": 0.000492040331629889, "loss": 5.1275, "mean_token_accuracy": 0.18999258577823638, "num_tokens": 20520764.0, "step": 11830 }, { "entropy": 5.463704442977905, "epoch": 0.9208325228554756, "grad_norm": 0.9921875, "learning_rate": 0.0004920330233046277, "loss": 5.0985, "mean_token_accuracy": 0.1880857989192009, "num_tokens": 20529648.0, "step": 11835 }, { "entropy": 5.51321325302124, "epoch": 0.9212215522271932, "grad_norm": 1.0234375, "learning_rate": 0.0004920257116862359, "loss": 5.163, "mean_token_accuracy": 0.1889480784535408, "num_tokens": 20538489.0, "step": 11840 }, { "entropy": 5.546636533737183, "epoch": 0.9216105815989107, "grad_norm": 1.0859375, "learning_rate": 0.0004920183967748241, "loss": 5.1991, "mean_token_accuracy": 0.1878497987985611, "num_tokens": 20548042.0, "step": 11845 }, { "entropy": 5.436558675765991, "epoch": 0.9219996109706283, "grad_norm": 1.09375, "learning_rate": 0.0004920110785705037, "loss": 5.1087, "mean_token_accuracy": 0.1985417440533638, "num_tokens": 20556559.0, "step": 11850 }, { "entropy": 5.576743412017822, "epoch": 0.9223886403423458, "grad_norm": 1.0234375, "learning_rate": 0.0004920037570733857, "loss": 5.3405, "mean_token_accuracy": 0.1739198684692383, "num_tokens": 20566162.0, "step": 11855 }, { "entropy": 5.5404211521148685, "epoch": 0.9227776697140634, "grad_norm": 1.0546875, "learning_rate": 0.0004919964322835809, "loss": 5.0518, "mean_token_accuracy": 0.1928445130586624, "num_tokens": 20574575.0, "step": 11860 }, { "entropy": 5.4385003566741945, "epoch": 0.923166699085781, "grad_norm": 0.9296875, "learning_rate": 0.0004919891042012006, "loss": 5.1272, "mean_token_accuracy": 0.18770445883274078, "num_tokens": 20583394.0, "step": 11865 }, { "entropy": 5.483497285842896, "epoch": 0.9235557284574986, "grad_norm": 0.98828125, "learning_rate": 0.0004919817728263562, "loss": 5.2105, "mean_token_accuracy": 0.18159369379281998, "num_tokens": 20592413.0, "step": 11870 }, { "entropy": 5.569636392593384, "epoch": 0.9239447578292161, "grad_norm": 1.0390625, "learning_rate": 0.0004919744381591586, "loss": 5.1687, "mean_token_accuracy": 0.1906165897846222, "num_tokens": 20601403.0, "step": 11875 }, { "entropy": 5.538726663589477, "epoch": 0.9243337872009336, "grad_norm": 1.0234375, "learning_rate": 0.0004919671001997193, "loss": 5.1762, "mean_token_accuracy": 0.18856113404035568, "num_tokens": 20610342.0, "step": 11880 }, { "entropy": 5.490780687332153, "epoch": 0.9247228165726512, "grad_norm": 1.03125, "learning_rate": 0.0004919597589481497, "loss": 5.2173, "mean_token_accuracy": 0.18497272133827208, "num_tokens": 20619120.0, "step": 11885 }, { "entropy": 5.466904354095459, "epoch": 0.9251118459443688, "grad_norm": 1.0078125, "learning_rate": 0.000491952414404561, "loss": 5.1606, "mean_token_accuracy": 0.18369911164045333, "num_tokens": 20628713.0, "step": 11890 }, { "entropy": 5.580748081207275, "epoch": 0.9255008753160864, "grad_norm": 1.0625, "learning_rate": 0.0004919450665690646, "loss": 5.1597, "mean_token_accuracy": 0.18222711682319642, "num_tokens": 20636338.0, "step": 11895 }, { "entropy": 5.579671859741211, "epoch": 0.925889904687804, "grad_norm": 1.0234375, "learning_rate": 0.0004919377154417724, "loss": 5.1742, "mean_token_accuracy": 0.18615632355213166, "num_tokens": 20644186.0, "step": 11900 }, { "entropy": 5.51911997795105, "epoch": 0.9262789340595214, "grad_norm": 1.078125, "learning_rate": 0.0004919303610227954, "loss": 5.2634, "mean_token_accuracy": 0.18841380923986434, "num_tokens": 20653672.0, "step": 11905 }, { "entropy": 5.488134717941284, "epoch": 0.926667963431239, "grad_norm": 1.0078125, "learning_rate": 0.0004919230033122457, "loss": 5.1478, "mean_token_accuracy": 0.1854111894965172, "num_tokens": 20662936.0, "step": 11910 }, { "entropy": 5.518908405303955, "epoch": 0.9270569928029566, "grad_norm": 1.0859375, "learning_rate": 0.0004919156423102345, "loss": 5.2568, "mean_token_accuracy": 0.18243345767259597, "num_tokens": 20671265.0, "step": 11915 }, { "entropy": 5.613058280944824, "epoch": 0.9274460221746742, "grad_norm": 1.046875, "learning_rate": 0.0004919082780168736, "loss": 5.2967, "mean_token_accuracy": 0.17161622494459153, "num_tokens": 20680049.0, "step": 11920 }, { "entropy": 5.517641925811768, "epoch": 0.9278350515463918, "grad_norm": 1.0234375, "learning_rate": 0.0004919009104322751, "loss": 5.1451, "mean_token_accuracy": 0.1864025816321373, "num_tokens": 20688411.0, "step": 11925 }, { "entropy": 5.548143529891968, "epoch": 0.9282240809181093, "grad_norm": 1.1328125, "learning_rate": 0.0004918935395565503, "loss": 5.2864, "mean_token_accuracy": 0.1809676021337509, "num_tokens": 20696012.0, "step": 11930 }, { "entropy": 5.503843879699707, "epoch": 0.9286131102898268, "grad_norm": 1.0234375, "learning_rate": 0.0004918861653898113, "loss": 5.1957, "mean_token_accuracy": 0.18054557740688323, "num_tokens": 20704135.0, "step": 11935 }, { "entropy": 5.63679838180542, "epoch": 0.9290021396615444, "grad_norm": 1.0625, "learning_rate": 0.0004918787879321701, "loss": 5.2541, "mean_token_accuracy": 0.17987410575151444, "num_tokens": 20712529.0, "step": 11940 }, { "entropy": 5.462137937545776, "epoch": 0.929391169033262, "grad_norm": 0.99609375, "learning_rate": 0.0004918714071837384, "loss": 5.0497, "mean_token_accuracy": 0.19069624841213226, "num_tokens": 20721079.0, "step": 11945 }, { "entropy": 5.549027156829834, "epoch": 0.9297801984049796, "grad_norm": 0.92578125, "learning_rate": 0.0004918640231446282, "loss": 5.2716, "mean_token_accuracy": 0.1769583523273468, "num_tokens": 20730079.0, "step": 11950 }, { "entropy": 5.618971157073974, "epoch": 0.9301692277766972, "grad_norm": 1.0390625, "learning_rate": 0.0004918566358149517, "loss": 5.3079, "mean_token_accuracy": 0.18117557018995284, "num_tokens": 20738200.0, "step": 11955 }, { "entropy": 5.527298355102539, "epoch": 0.9305582571484147, "grad_norm": 1.03125, "learning_rate": 0.000491849245194821, "loss": 5.1883, "mean_token_accuracy": 0.18633153140544892, "num_tokens": 20746663.0, "step": 11960 }, { "entropy": 5.5764788627624515, "epoch": 0.9309472865201323, "grad_norm": 1.046875, "learning_rate": 0.0004918418512843479, "loss": 5.3183, "mean_token_accuracy": 0.17480258643627167, "num_tokens": 20755990.0, "step": 11965 }, { "entropy": 5.601742506027222, "epoch": 0.9313363158918498, "grad_norm": 1.0234375, "learning_rate": 0.0004918344540836451, "loss": 5.2167, "mean_token_accuracy": 0.1803658574819565, "num_tokens": 20764985.0, "step": 11970 }, { "entropy": 5.541550254821777, "epoch": 0.9317253452635674, "grad_norm": 0.99609375, "learning_rate": 0.0004918270535928244, "loss": 5.2209, "mean_token_accuracy": 0.18549701571464539, "num_tokens": 20773415.0, "step": 11975 }, { "entropy": 5.542168283462525, "epoch": 0.932114374635285, "grad_norm": 0.984375, "learning_rate": 0.0004918196498119984, "loss": 5.2735, "mean_token_accuracy": 0.1800215870141983, "num_tokens": 20782611.0, "step": 11980 }, { "entropy": 5.65689058303833, "epoch": 0.9325034040070025, "grad_norm": 0.9921875, "learning_rate": 0.0004918122427412793, "loss": 5.3108, "mean_token_accuracy": 0.17959070801734925, "num_tokens": 20790859.0, "step": 11985 }, { "entropy": 5.610575008392334, "epoch": 0.9328924333787201, "grad_norm": 1.1171875, "learning_rate": 0.0004918048323807795, "loss": 5.2126, "mean_token_accuracy": 0.18499375879764557, "num_tokens": 20798994.0, "step": 11990 }, { "entropy": 5.533700275421142, "epoch": 0.9332814627504377, "grad_norm": 0.99609375, "learning_rate": 0.0004917974187306114, "loss": 5.1613, "mean_token_accuracy": 0.18504722267389298, "num_tokens": 20807343.0, "step": 11995 }, { "entropy": 5.557862138748169, "epoch": 0.9336704921221552, "grad_norm": 0.97265625, "learning_rate": 0.0004917900017908875, "loss": 5.1642, "mean_token_accuracy": 0.1907860204577446, "num_tokens": 20815703.0, "step": 12000 }, { "epoch": 0.9336704921221552, "eval_entropy": 5.344935700432169, "eval_loss": 5.24092960357666, "eval_mean_token_accuracy": 0.19120996321217157, "eval_num_tokens": 20815703.0, "eval_runtime": 21.784, "eval_samples_per_second": 1907.735, "eval_steps_per_second": 238.478, "step": 12000 }, { "entropy": 5.539333724975586, "epoch": 0.9340595214938728, "grad_norm": 1.03125, "learning_rate": 0.0004917825815617205, "loss": 5.1612, "mean_token_accuracy": 0.18685321658849716, "num_tokens": 20823901.0, "step": 12005 }, { "entropy": 5.590603351593018, "epoch": 0.9344485508655903, "grad_norm": 1.03125, "learning_rate": 0.0004917751580432229, "loss": 5.3046, "mean_token_accuracy": 0.17925916463136674, "num_tokens": 20832933.0, "step": 12010 }, { "entropy": 5.565207862854004, "epoch": 0.9348375802373079, "grad_norm": 1.0703125, "learning_rate": 0.0004917677312355072, "loss": 5.1593, "mean_token_accuracy": 0.19245655238628387, "num_tokens": 20841090.0, "step": 12015 }, { "entropy": 5.557745027542114, "epoch": 0.9352266096090255, "grad_norm": 1.0703125, "learning_rate": 0.0004917603011386863, "loss": 5.2019, "mean_token_accuracy": 0.18042668849229812, "num_tokens": 20848705.0, "step": 12020 }, { "entropy": 5.5556652545928955, "epoch": 0.9356156389807431, "grad_norm": 0.99609375, "learning_rate": 0.0004917528677528727, "loss": 5.2269, "mean_token_accuracy": 0.179660427570343, "num_tokens": 20857149.0, "step": 12025 }, { "entropy": 5.593832492828369, "epoch": 0.9360046683524607, "grad_norm": 1.03125, "learning_rate": 0.0004917454310781795, "loss": 5.2913, "mean_token_accuracy": 0.183056016266346, "num_tokens": 20866035.0, "step": 12030 }, { "entropy": 5.54173731803894, "epoch": 0.9363936977241781, "grad_norm": 0.984375, "learning_rate": 0.0004917379911147193, "loss": 5.2, "mean_token_accuracy": 0.18876660019159316, "num_tokens": 20874590.0, "step": 12035 }, { "entropy": 5.593485164642334, "epoch": 0.9367827270958957, "grad_norm": 0.9765625, "learning_rate": 0.0004917305478626049, "loss": 5.2299, "mean_token_accuracy": 0.18825214654207229, "num_tokens": 20883872.0, "step": 12040 }, { "entropy": 5.499920177459717, "epoch": 0.9371717564676133, "grad_norm": 1.0234375, "learning_rate": 0.0004917231013219495, "loss": 5.1352, "mean_token_accuracy": 0.19150085896253585, "num_tokens": 20892515.0, "step": 12045 }, { "entropy": 5.529827070236206, "epoch": 0.9375607858393309, "grad_norm": 1.03125, "learning_rate": 0.000491715651492866, "loss": 5.2308, "mean_token_accuracy": 0.18484504520893097, "num_tokens": 20901337.0, "step": 12050 }, { "entropy": 5.526296615600586, "epoch": 0.9379498152110485, "grad_norm": 0.984375, "learning_rate": 0.0004917081983754675, "loss": 5.2277, "mean_token_accuracy": 0.18402009308338166, "num_tokens": 20910034.0, "step": 12055 }, { "entropy": 5.598119640350342, "epoch": 0.938338844582766, "grad_norm": 1.0390625, "learning_rate": 0.0004917007419698669, "loss": 5.2581, "mean_token_accuracy": 0.18303631991147995, "num_tokens": 20918832.0, "step": 12060 }, { "entropy": 5.4956066608428955, "epoch": 0.9387278739544835, "grad_norm": 1.015625, "learning_rate": 0.0004916932822761776, "loss": 5.0805, "mean_token_accuracy": 0.19157517403364183, "num_tokens": 20927734.0, "step": 12065 }, { "entropy": 5.543244457244873, "epoch": 0.9391169033262011, "grad_norm": 1.0625, "learning_rate": 0.0004916858192945126, "loss": 5.1174, "mean_token_accuracy": 0.1897149235010147, "num_tokens": 20935888.0, "step": 12070 }, { "entropy": 5.5040624141693115, "epoch": 0.9395059326979187, "grad_norm": 1.0546875, "learning_rate": 0.0004916783530249852, "loss": 5.1154, "mean_token_accuracy": 0.18593257814645767, "num_tokens": 20944577.0, "step": 12075 }, { "entropy": 5.510186719894409, "epoch": 0.9398949620696363, "grad_norm": 1.0, "learning_rate": 0.0004916708834677086, "loss": 5.2261, "mean_token_accuracy": 0.181659696996212, "num_tokens": 20952527.0, "step": 12080 }, { "entropy": 5.598353004455566, "epoch": 0.9402839914413538, "grad_norm": 1.0078125, "learning_rate": 0.0004916634106227962, "loss": 5.2704, "mean_token_accuracy": 0.18085542172193528, "num_tokens": 20961882.0, "step": 12085 }, { "entropy": 5.650716781616211, "epoch": 0.9406730208130714, "grad_norm": 1.0, "learning_rate": 0.0004916559344903614, "loss": 5.3354, "mean_token_accuracy": 0.18876594603061675, "num_tokens": 20970782.0, "step": 12090 }, { "entropy": 5.562792205810547, "epoch": 0.941062050184789, "grad_norm": 1.0546875, "learning_rate": 0.0004916484550705176, "loss": 5.2499, "mean_token_accuracy": 0.1796768546104431, "num_tokens": 20979927.0, "step": 12095 }, { "entropy": 5.520222759246826, "epoch": 0.9414510795565065, "grad_norm": 0.97265625, "learning_rate": 0.0004916409723633785, "loss": 5.1696, "mean_token_accuracy": 0.18996877670288087, "num_tokens": 20988626.0, "step": 12100 }, { "entropy": 5.565795230865478, "epoch": 0.9418401089282241, "grad_norm": 1.078125, "learning_rate": 0.0004916334863690573, "loss": 5.2828, "mean_token_accuracy": 0.17252252697944642, "num_tokens": 20997065.0, "step": 12105 }, { "entropy": 5.455416250228882, "epoch": 0.9422291382999416, "grad_norm": 1.03125, "learning_rate": 0.0004916259970876678, "loss": 5.0346, "mean_token_accuracy": 0.1853836178779602, "num_tokens": 21005611.0, "step": 12110 }, { "entropy": 5.418533182144165, "epoch": 0.9426181676716592, "grad_norm": 1.0078125, "learning_rate": 0.0004916185045193237, "loss": 5.0488, "mean_token_accuracy": 0.19643110483884813, "num_tokens": 21014162.0, "step": 12115 }, { "entropy": 5.503196096420288, "epoch": 0.9430071970433768, "grad_norm": 1.15625, "learning_rate": 0.0004916110086641384, "loss": 5.2703, "mean_token_accuracy": 0.18162964880466462, "num_tokens": 21022780.0, "step": 12120 }, { "entropy": 5.575558137893677, "epoch": 0.9433962264150944, "grad_norm": 0.9921875, "learning_rate": 0.0004916035095222259, "loss": 5.1858, "mean_token_accuracy": 0.18557081669569014, "num_tokens": 21031101.0, "step": 12125 }, { "entropy": 5.4627422332763675, "epoch": 0.9437852557868119, "grad_norm": 0.984375, "learning_rate": 0.0004915960070936999, "loss": 5.1065, "mean_token_accuracy": 0.1908903867006302, "num_tokens": 21040212.0, "step": 12130 }, { "entropy": 5.515059280395508, "epoch": 0.9441742851585294, "grad_norm": 0.9921875, "learning_rate": 0.0004915885013786742, "loss": 5.1421, "mean_token_accuracy": 0.1901004806160927, "num_tokens": 21048643.0, "step": 12135 }, { "entropy": 5.543565320968628, "epoch": 0.944563314530247, "grad_norm": 1.0625, "learning_rate": 0.0004915809923772628, "loss": 5.2118, "mean_token_accuracy": 0.1857934921979904, "num_tokens": 21057070.0, "step": 12140 }, { "entropy": 5.5097757339477536, "epoch": 0.9449523439019646, "grad_norm": 1.0625, "learning_rate": 0.0004915734800895796, "loss": 5.2025, "mean_token_accuracy": 0.185279943048954, "num_tokens": 21065102.0, "step": 12145 }, { "entropy": 5.563621950149536, "epoch": 0.9453413732736822, "grad_norm": 1.078125, "learning_rate": 0.0004915659645157383, "loss": 5.304, "mean_token_accuracy": 0.1851240798830986, "num_tokens": 21073968.0, "step": 12150 }, { "entropy": 5.609937620162964, "epoch": 0.9457304026453998, "grad_norm": 1.015625, "learning_rate": 0.0004915584456558535, "loss": 5.3462, "mean_token_accuracy": 0.17858497351408004, "num_tokens": 21083363.0, "step": 12155 }, { "entropy": 5.607294368743896, "epoch": 0.9461194320171173, "grad_norm": 1.0625, "learning_rate": 0.0004915509235100388, "loss": 5.3237, "mean_token_accuracy": 0.17933631539344788, "num_tokens": 21091691.0, "step": 12160 }, { "entropy": 5.513938617706299, "epoch": 0.9465084613888348, "grad_norm": 0.9921875, "learning_rate": 0.0004915433980784086, "loss": 5.1462, "mean_token_accuracy": 0.17888393700122834, "num_tokens": 21100512.0, "step": 12165 }, { "entropy": 5.493751955032349, "epoch": 0.9468974907605524, "grad_norm": 1.046875, "learning_rate": 0.0004915358693610769, "loss": 5.2542, "mean_token_accuracy": 0.18847894966602324, "num_tokens": 21109658.0, "step": 12170 }, { "entropy": 5.505000829696655, "epoch": 0.94728652013227, "grad_norm": 1.0859375, "learning_rate": 0.0004915283373581581, "loss": 5.1964, "mean_token_accuracy": 0.18724531531333924, "num_tokens": 21118710.0, "step": 12175 }, { "entropy": 5.548243665695191, "epoch": 0.9476755495039876, "grad_norm": 1.0078125, "learning_rate": 0.0004915208020697664, "loss": 5.1678, "mean_token_accuracy": 0.190705007314682, "num_tokens": 21127672.0, "step": 12180 }, { "entropy": 5.6351231098175045, "epoch": 0.9480645788757052, "grad_norm": 1.0546875, "learning_rate": 0.0004915132634960162, "loss": 5.3377, "mean_token_accuracy": 0.17378480285406112, "num_tokens": 21135688.0, "step": 12185 }, { "entropy": 5.598523139953613, "epoch": 0.9484536082474226, "grad_norm": 1.078125, "learning_rate": 0.0004915057216370218, "loss": 5.1896, "mean_token_accuracy": 0.18350013345479965, "num_tokens": 21143557.0, "step": 12190 }, { "entropy": 5.55081090927124, "epoch": 0.9488426376191402, "grad_norm": 1.046875, "learning_rate": 0.0004914981764928977, "loss": 5.2341, "mean_token_accuracy": 0.18359110206365586, "num_tokens": 21152056.0, "step": 12195 }, { "entropy": 5.482287836074829, "epoch": 0.9492316669908578, "grad_norm": 1.0234375, "learning_rate": 0.0004914906280637584, "loss": 5.1855, "mean_token_accuracy": 0.18782722651958467, "num_tokens": 21160590.0, "step": 12200 }, { "entropy": 5.52836012840271, "epoch": 0.9496206963625754, "grad_norm": 1.03125, "learning_rate": 0.0004914830763497183, "loss": 5.2694, "mean_token_accuracy": 0.17721753269433976, "num_tokens": 21169333.0, "step": 12205 }, { "entropy": 5.519309663772583, "epoch": 0.950009725734293, "grad_norm": 1.0546875, "learning_rate": 0.0004914755213508922, "loss": 5.0301, "mean_token_accuracy": 0.19665799736976625, "num_tokens": 21178222.0, "step": 12210 }, { "entropy": 5.49220495223999, "epoch": 0.9503987551060105, "grad_norm": 1.0703125, "learning_rate": 0.0004914679630673945, "loss": 5.0913, "mean_token_accuracy": 0.1919606015086174, "num_tokens": 21187029.0, "step": 12215 }, { "entropy": 5.600217294692993, "epoch": 0.950787784477728, "grad_norm": 1.0390625, "learning_rate": 0.0004914604014993401, "loss": 5.2356, "mean_token_accuracy": 0.18390725255012513, "num_tokens": 21195994.0, "step": 12220 }, { "entropy": 5.542682838439942, "epoch": 0.9511768138494456, "grad_norm": 0.98046875, "learning_rate": 0.0004914528366468436, "loss": 5.1855, "mean_token_accuracy": 0.18452553302049637, "num_tokens": 21204534.0, "step": 12225 }, { "entropy": 5.4876096725463865, "epoch": 0.9515658432211632, "grad_norm": 1.0625, "learning_rate": 0.0004914452685100199, "loss": 5.0602, "mean_token_accuracy": 0.20137422531843185, "num_tokens": 21212852.0, "step": 12230 }, { "entropy": 5.556637001037598, "epoch": 0.9519548725928808, "grad_norm": 1.015625, "learning_rate": 0.0004914376970889836, "loss": 5.2568, "mean_token_accuracy": 0.1755823850631714, "num_tokens": 21221040.0, "step": 12235 }, { "entropy": 5.49406213760376, "epoch": 0.9523439019645983, "grad_norm": 1.0, "learning_rate": 0.0004914301223838497, "loss": 5.0824, "mean_token_accuracy": 0.1865405797958374, "num_tokens": 21230227.0, "step": 12240 }, { "entropy": 5.572826814651489, "epoch": 0.9527329313363159, "grad_norm": 1.109375, "learning_rate": 0.0004914225443947334, "loss": 5.3065, "mean_token_accuracy": 0.17179667800664902, "num_tokens": 21238496.0, "step": 12245 }, { "entropy": 5.498713159561158, "epoch": 0.9531219607080335, "grad_norm": 1.0703125, "learning_rate": 0.0004914149631217494, "loss": 5.1683, "mean_token_accuracy": 0.18232299834489823, "num_tokens": 21246806.0, "step": 12250 }, { "entropy": 5.509085035324096, "epoch": 0.953510990079751, "grad_norm": 1.0, "learning_rate": 0.0004914073785650127, "loss": 5.1536, "mean_token_accuracy": 0.18383436799049377, "num_tokens": 21255841.0, "step": 12255 }, { "entropy": 5.601258993148804, "epoch": 0.9539000194514686, "grad_norm": 1.0, "learning_rate": 0.0004913997907246385, "loss": 5.2045, "mean_token_accuracy": 0.1773657813668251, "num_tokens": 21264823.0, "step": 12260 }, { "entropy": 5.530019950866699, "epoch": 0.9542890488231861, "grad_norm": 0.984375, "learning_rate": 0.000491392199600742, "loss": 5.2244, "mean_token_accuracy": 0.18132253587245942, "num_tokens": 21273382.0, "step": 12265 }, { "entropy": 5.514166307449341, "epoch": 0.9546780781949037, "grad_norm": 1.015625, "learning_rate": 0.0004913846051934382, "loss": 5.2299, "mean_token_accuracy": 0.18331311494112015, "num_tokens": 21282216.0, "step": 12270 }, { "entropy": 5.567118835449219, "epoch": 0.9550671075666213, "grad_norm": 1.078125, "learning_rate": 0.0004913770075028425, "loss": 5.2073, "mean_token_accuracy": 0.1815290629863739, "num_tokens": 21290208.0, "step": 12275 }, { "entropy": 5.631261491775513, "epoch": 0.9554561369383389, "grad_norm": 1.109375, "learning_rate": 0.0004913694065290701, "loss": 5.2797, "mean_token_accuracy": 0.17556531429290773, "num_tokens": 21298864.0, "step": 12280 }, { "entropy": 5.439242029190064, "epoch": 0.9558451663100564, "grad_norm": 1.0078125, "learning_rate": 0.0004913618022722363, "loss": 5.1179, "mean_token_accuracy": 0.1903344064950943, "num_tokens": 21307484.0, "step": 12285 }, { "entropy": 5.491755819320678, "epoch": 0.9562341956817739, "grad_norm": 1.0859375, "learning_rate": 0.0004913541947324566, "loss": 5.1982, "mean_token_accuracy": 0.18501874059438705, "num_tokens": 21316160.0, "step": 12290 }, { "entropy": 5.519949579238892, "epoch": 0.9566232250534915, "grad_norm": 1.0546875, "learning_rate": 0.0004913465839098463, "loss": 5.0924, "mean_token_accuracy": 0.19052087664604186, "num_tokens": 21324777.0, "step": 12295 }, { "entropy": 5.578331565856933, "epoch": 0.9570122544252091, "grad_norm": 1.046875, "learning_rate": 0.0004913389698045209, "loss": 5.2174, "mean_token_accuracy": 0.1854473501443863, "num_tokens": 21332994.0, "step": 12300 }, { "entropy": 5.48744387626648, "epoch": 0.9574012837969267, "grad_norm": 0.97265625, "learning_rate": 0.000491331352416596, "loss": 5.152, "mean_token_accuracy": 0.18614051192998887, "num_tokens": 21341457.0, "step": 12305 }, { "entropy": 5.551470232009888, "epoch": 0.9577903131686443, "grad_norm": 1.046875, "learning_rate": 0.0004913237317461872, "loss": 5.1957, "mean_token_accuracy": 0.17776983380317687, "num_tokens": 21349487.0, "step": 12310 }, { "entropy": 5.492322158813477, "epoch": 0.9581793425403617, "grad_norm": 0.97265625, "learning_rate": 0.00049131610779341, "loss": 5.2213, "mean_token_accuracy": 0.18082193285226822, "num_tokens": 21358411.0, "step": 12315 }, { "entropy": 5.57997088432312, "epoch": 0.9585683719120793, "grad_norm": 1.0546875, "learning_rate": 0.0004913084805583803, "loss": 5.2725, "mean_token_accuracy": 0.18279048949480056, "num_tokens": 21367257.0, "step": 12320 }, { "entropy": 5.612073993682861, "epoch": 0.9589574012837969, "grad_norm": 1.0859375, "learning_rate": 0.0004913008500412136, "loss": 5.2816, "mean_token_accuracy": 0.17700959891080856, "num_tokens": 21376361.0, "step": 12325 }, { "entropy": 5.595424509048462, "epoch": 0.9593464306555145, "grad_norm": 1.0234375, "learning_rate": 0.0004912932162420259, "loss": 5.2577, "mean_token_accuracy": 0.18183140605688095, "num_tokens": 21384658.0, "step": 12330 }, { "entropy": 5.510373592376709, "epoch": 0.9597354600272321, "grad_norm": 1.0859375, "learning_rate": 0.0004912855791609327, "loss": 5.1322, "mean_token_accuracy": 0.1854855313897133, "num_tokens": 21393390.0, "step": 12335 }, { "entropy": 5.584775400161743, "epoch": 0.9601244893989496, "grad_norm": 1.078125, "learning_rate": 0.0004912779387980502, "loss": 5.255, "mean_token_accuracy": 0.1805700972676277, "num_tokens": 21401591.0, "step": 12340 }, { "entropy": 5.415788412094116, "epoch": 0.9605135187706672, "grad_norm": 1.046875, "learning_rate": 0.0004912702951534942, "loss": 5.0317, "mean_token_accuracy": 0.19965379685163498, "num_tokens": 21409933.0, "step": 12345 }, { "entropy": 5.531234216690064, "epoch": 0.9609025481423847, "grad_norm": 1.0078125, "learning_rate": 0.0004912626482273809, "loss": 5.1114, "mean_token_accuracy": 0.18745438605546952, "num_tokens": 21418665.0, "step": 12350 }, { "entropy": 5.5606427669525145, "epoch": 0.9612915775141023, "grad_norm": 1.046875, "learning_rate": 0.0004912549980198258, "loss": 5.2846, "mean_token_accuracy": 0.18365840315818788, "num_tokens": 21427532.0, "step": 12355 }, { "entropy": 5.6447347640991214, "epoch": 0.9616806068858199, "grad_norm": 1.15625, "learning_rate": 0.0004912473445309455, "loss": 5.2209, "mean_token_accuracy": 0.18302836567163466, "num_tokens": 21436101.0, "step": 12360 }, { "entropy": 5.583501625061035, "epoch": 0.9620696362575375, "grad_norm": 0.98828125, "learning_rate": 0.000491239687760856, "loss": 5.1721, "mean_token_accuracy": 0.1888975739479065, "num_tokens": 21444905.0, "step": 12365 }, { "entropy": 5.588873767852784, "epoch": 0.962458665629255, "grad_norm": 1.078125, "learning_rate": 0.0004912320277096732, "loss": 5.2947, "mean_token_accuracy": 0.175302354991436, "num_tokens": 21453498.0, "step": 12370 }, { "entropy": 5.560341024398804, "epoch": 0.9628476950009726, "grad_norm": 0.9609375, "learning_rate": 0.0004912243643775137, "loss": 5.1811, "mean_token_accuracy": 0.19413408190011977, "num_tokens": 21461884.0, "step": 12375 }, { "entropy": 5.486970710754394, "epoch": 0.9632367243726901, "grad_norm": 1.0625, "learning_rate": 0.0004912166977644936, "loss": 5.0631, "mean_token_accuracy": 0.19314700216054917, "num_tokens": 21469694.0, "step": 12380 }, { "entropy": 5.505225419998169, "epoch": 0.9636257537444077, "grad_norm": 0.99609375, "learning_rate": 0.0004912090278707293, "loss": 5.2424, "mean_token_accuracy": 0.18412844687700272, "num_tokens": 21478988.0, "step": 12385 }, { "entropy": 5.653407335281372, "epoch": 0.9640147831161253, "grad_norm": 0.98828125, "learning_rate": 0.000491201354696337, "loss": 5.2834, "mean_token_accuracy": 0.18375380635261535, "num_tokens": 21488336.0, "step": 12390 }, { "entropy": 5.552691698074341, "epoch": 0.9644038124878428, "grad_norm": 0.9921875, "learning_rate": 0.0004911936782414334, "loss": 5.21, "mean_token_accuracy": 0.1889895647764206, "num_tokens": 21496792.0, "step": 12395 }, { "entropy": 5.524241018295288, "epoch": 0.9647928418595604, "grad_norm": 0.9765625, "learning_rate": 0.0004911859985061348, "loss": 5.2217, "mean_token_accuracy": 0.17647273391485213, "num_tokens": 21505796.0, "step": 12400 }, { "entropy": 5.517217540740967, "epoch": 0.965181871231278, "grad_norm": 1.0, "learning_rate": 0.0004911783154905577, "loss": 5.2023, "mean_token_accuracy": 0.18912200033664703, "num_tokens": 21514904.0, "step": 12405 }, { "entropy": 5.603016376495361, "epoch": 0.9655709006029956, "grad_norm": 1.109375, "learning_rate": 0.0004911706291948188, "loss": 5.3784, "mean_token_accuracy": 0.17836669236421585, "num_tokens": 21524231.0, "step": 12410 }, { "entropy": 5.573432683944702, "epoch": 0.9659599299747131, "grad_norm": 1.046875, "learning_rate": 0.0004911629396190348, "loss": 5.1622, "mean_token_accuracy": 0.18772236108779908, "num_tokens": 21532852.0, "step": 12415 }, { "entropy": 5.592479038238525, "epoch": 0.9663489593464306, "grad_norm": 1.03125, "learning_rate": 0.0004911552467633221, "loss": 5.2286, "mean_token_accuracy": 0.1844874456524849, "num_tokens": 21542562.0, "step": 12420 }, { "entropy": 5.525732088088989, "epoch": 0.9667379887181482, "grad_norm": 1.0625, "learning_rate": 0.0004911475506277976, "loss": 5.2385, "mean_token_accuracy": 0.17982458770275117, "num_tokens": 21551503.0, "step": 12425 }, { "entropy": 5.4624053001403805, "epoch": 0.9671270180898658, "grad_norm": 1.0, "learning_rate": 0.000491139851212578, "loss": 5.0396, "mean_token_accuracy": 0.202691887319088, "num_tokens": 21560712.0, "step": 12430 }, { "entropy": 5.505254459381104, "epoch": 0.9675160474615834, "grad_norm": 1.0078125, "learning_rate": 0.0004911321485177802, "loss": 5.1119, "mean_token_accuracy": 0.19221523702144622, "num_tokens": 21569811.0, "step": 12435 }, { "entropy": 5.491925954818726, "epoch": 0.967905076833301, "grad_norm": 1.046875, "learning_rate": 0.0004911244425435212, "loss": 5.2313, "mean_token_accuracy": 0.18152496665716172, "num_tokens": 21578423.0, "step": 12440 }, { "entropy": 5.530194234848023, "epoch": 0.9682941062050184, "grad_norm": 0.98046875, "learning_rate": 0.0004911167332899176, "loss": 5.1861, "mean_token_accuracy": 0.18658440113067626, "num_tokens": 21587509.0, "step": 12445 }, { "entropy": 5.572329521179199, "epoch": 0.968683135576736, "grad_norm": 1.0390625, "learning_rate": 0.0004911090207570867, "loss": 5.1729, "mean_token_accuracy": 0.19146473109722137, "num_tokens": 21596054.0, "step": 12450 }, { "entropy": 5.588417959213257, "epoch": 0.9690721649484536, "grad_norm": 1.0078125, "learning_rate": 0.0004911013049451453, "loss": 5.2193, "mean_token_accuracy": 0.18457165211439133, "num_tokens": 21604872.0, "step": 12455 }, { "entropy": 5.599390029907227, "epoch": 0.9694611943201712, "grad_norm": 0.94921875, "learning_rate": 0.0004910935858542106, "loss": 5.2629, "mean_token_accuracy": 0.1784984514117241, "num_tokens": 21613773.0, "step": 12460 }, { "entropy": 5.4978679656982425, "epoch": 0.9698502236918888, "grad_norm": 1.046875, "learning_rate": 0.0004910858634843997, "loss": 5.1018, "mean_token_accuracy": 0.1890167698264122, "num_tokens": 21622071.0, "step": 12465 }, { "entropy": 5.5291248798370365, "epoch": 0.9702392530636063, "grad_norm": 0.97265625, "learning_rate": 0.0004910781378358297, "loss": 5.1166, "mean_token_accuracy": 0.18756571859121324, "num_tokens": 21630698.0, "step": 12470 }, { "entropy": 5.592549467086792, "epoch": 0.9706282824353238, "grad_norm": 1.078125, "learning_rate": 0.0004910704089086178, "loss": 5.1985, "mean_token_accuracy": 0.19187143743038176, "num_tokens": 21638446.0, "step": 12475 }, { "entropy": 5.5418932914733885, "epoch": 0.9710173118070414, "grad_norm": 0.98828125, "learning_rate": 0.0004910626767028815, "loss": 5.2034, "mean_token_accuracy": 0.18510141372680664, "num_tokens": 21647214.0, "step": 12480 }, { "entropy": 5.582453489303589, "epoch": 0.971406341178759, "grad_norm": 1.0859375, "learning_rate": 0.0004910549412187379, "loss": 5.3091, "mean_token_accuracy": 0.1761996865272522, "num_tokens": 21656047.0, "step": 12485 }, { "entropy": 5.62225308418274, "epoch": 0.9717953705504766, "grad_norm": 1.0625, "learning_rate": 0.0004910472024563045, "loss": 5.2221, "mean_token_accuracy": 0.1827482298016548, "num_tokens": 21664374.0, "step": 12490 }, { "entropy": 5.625817823410034, "epoch": 0.9721843999221941, "grad_norm": 1.0546875, "learning_rate": 0.0004910394604156987, "loss": 5.2175, "mean_token_accuracy": 0.1825633242726326, "num_tokens": 21673334.0, "step": 12495 }, { "entropy": 5.553891038894653, "epoch": 0.9725734292939117, "grad_norm": 1.0390625, "learning_rate": 0.0004910317150970379, "loss": 5.1419, "mean_token_accuracy": 0.19343614876270293, "num_tokens": 21681392.0, "step": 12500 }, { "entropy": 5.55709547996521, "epoch": 0.9729624586656292, "grad_norm": 1.015625, "learning_rate": 0.0004910239665004397, "loss": 5.1598, "mean_token_accuracy": 0.18340199589729309, "num_tokens": 21690039.0, "step": 12505 }, { "entropy": 5.503588247299194, "epoch": 0.9733514880373468, "grad_norm": 0.9921875, "learning_rate": 0.0004910162146260216, "loss": 5.1345, "mean_token_accuracy": 0.1927665263414383, "num_tokens": 21699006.0, "step": 12510 }, { "entropy": 5.510761451721192, "epoch": 0.9737405174090644, "grad_norm": 1.0859375, "learning_rate": 0.0004910084594739013, "loss": 5.1415, "mean_token_accuracy": 0.18670180737972258, "num_tokens": 21707730.0, "step": 12515 }, { "entropy": 5.528998613357544, "epoch": 0.9741295467807819, "grad_norm": 0.984375, "learning_rate": 0.0004910007010441964, "loss": 5.2105, "mean_token_accuracy": 0.18834204971790314, "num_tokens": 21715671.0, "step": 12520 }, { "entropy": 5.570176410675049, "epoch": 0.9745185761524995, "grad_norm": 1.0859375, "learning_rate": 0.0004909929393370248, "loss": 5.2717, "mean_token_accuracy": 0.1823419839143753, "num_tokens": 21724000.0, "step": 12525 }, { "entropy": 5.626552104949951, "epoch": 0.9749076055242171, "grad_norm": 1.0234375, "learning_rate": 0.0004909851743525041, "loss": 5.2792, "mean_token_accuracy": 0.18159958273172377, "num_tokens": 21732915.0, "step": 12530 }, { "entropy": 5.698964405059814, "epoch": 0.9752966348959347, "grad_norm": 1.09375, "learning_rate": 0.000490977406090752, "loss": 5.3776, "mean_token_accuracy": 0.17277083843946456, "num_tokens": 21742495.0, "step": 12535 }, { "entropy": 5.565761423110962, "epoch": 0.9756856642676522, "grad_norm": 1.0390625, "learning_rate": 0.0004909696345518867, "loss": 5.1848, "mean_token_accuracy": 0.1832648128271103, "num_tokens": 21751198.0, "step": 12540 }, { "entropy": 5.503470325469971, "epoch": 0.9760746936393697, "grad_norm": 0.9921875, "learning_rate": 0.0004909618597360258, "loss": 5.2174, "mean_token_accuracy": 0.19248865842819213, "num_tokens": 21759804.0, "step": 12545 }, { "entropy": 5.483126401901245, "epoch": 0.9764637230110873, "grad_norm": 0.98046875, "learning_rate": 0.0004909540816432876, "loss": 5.0838, "mean_token_accuracy": 0.1929810792207718, "num_tokens": 21768541.0, "step": 12550 }, { "entropy": 5.526939058303833, "epoch": 0.9768527523828049, "grad_norm": 0.97265625, "learning_rate": 0.0004909463002737897, "loss": 5.1519, "mean_token_accuracy": 0.19035652428865432, "num_tokens": 21777909.0, "step": 12555 }, { "entropy": 5.570001649856567, "epoch": 0.9772417817545225, "grad_norm": 0.9765625, "learning_rate": 0.0004909385156276506, "loss": 5.2326, "mean_token_accuracy": 0.18371648341417313, "num_tokens": 21786844.0, "step": 12560 }, { "entropy": 5.526794385910034, "epoch": 0.9776308111262401, "grad_norm": 1.09375, "learning_rate": 0.0004909307277049881, "loss": 5.1177, "mean_token_accuracy": 0.18790711909532548, "num_tokens": 21796157.0, "step": 12565 }, { "entropy": 5.5055419921875, "epoch": 0.9780198404979576, "grad_norm": 1.046875, "learning_rate": 0.0004909229365059205, "loss": 5.2303, "mean_token_accuracy": 0.18127598464488984, "num_tokens": 21804447.0, "step": 12570 }, { "entropy": 5.552242946624756, "epoch": 0.9784088698696751, "grad_norm": 1.015625, "learning_rate": 0.0004909151420305661, "loss": 5.2426, "mean_token_accuracy": 0.18326650857925414, "num_tokens": 21813569.0, "step": 12575 }, { "entropy": 5.5926836967468265, "epoch": 0.9787978992413927, "grad_norm": 0.9921875, "learning_rate": 0.000490907344279043, "loss": 5.231, "mean_token_accuracy": 0.18444594293832778, "num_tokens": 21822194.0, "step": 12580 }, { "entropy": 5.574924373626709, "epoch": 0.9791869286131103, "grad_norm": 1.140625, "learning_rate": 0.0004908995432514698, "loss": 5.2384, "mean_token_accuracy": 0.18146923184394836, "num_tokens": 21830012.0, "step": 12585 }, { "entropy": 5.486664915084839, "epoch": 0.9795759579848279, "grad_norm": 1.03125, "learning_rate": 0.0004908917389479645, "loss": 5.1651, "mean_token_accuracy": 0.1896378830075264, "num_tokens": 21838177.0, "step": 12590 }, { "entropy": 5.496251249313355, "epoch": 0.9799649873565455, "grad_norm": 1.015625, "learning_rate": 0.0004908839313686456, "loss": 5.1923, "mean_token_accuracy": 0.1851340040564537, "num_tokens": 21847005.0, "step": 12595 }, { "entropy": 5.584972620010376, "epoch": 0.980354016728263, "grad_norm": 1.0390625, "learning_rate": 0.0004908761205136319, "loss": 5.1256, "mean_token_accuracy": 0.18699826449155807, "num_tokens": 21854363.0, "step": 12600 }, { "entropy": 5.597399377822876, "epoch": 0.9807430460999805, "grad_norm": 1.0625, "learning_rate": 0.0004908683063830414, "loss": 5.1544, "mean_token_accuracy": 0.18721675276756286, "num_tokens": 21862285.0, "step": 12605 }, { "entropy": 5.528862190246582, "epoch": 0.9811320754716981, "grad_norm": 1.0859375, "learning_rate": 0.0004908604889769932, "loss": 5.2228, "mean_token_accuracy": 0.18969684988260269, "num_tokens": 21870632.0, "step": 12610 }, { "entropy": 5.599672126770019, "epoch": 0.9815211048434157, "grad_norm": 1.0859375, "learning_rate": 0.0004908526682956054, "loss": 5.3218, "mean_token_accuracy": 0.18269346952438353, "num_tokens": 21879251.0, "step": 12615 }, { "entropy": 5.515309047698975, "epoch": 0.9819101342151333, "grad_norm": 1.0859375, "learning_rate": 0.0004908448443389972, "loss": 5.0742, "mean_token_accuracy": 0.1889792114496231, "num_tokens": 21887582.0, "step": 12620 }, { "entropy": 5.545315980911255, "epoch": 0.9822991635868508, "grad_norm": 1.015625, "learning_rate": 0.0004908370171072869, "loss": 5.1853, "mean_token_accuracy": 0.18147605806589126, "num_tokens": 21896418.0, "step": 12625 }, { "entropy": 5.514461946487427, "epoch": 0.9826881929585684, "grad_norm": 0.94921875, "learning_rate": 0.0004908291866005933, "loss": 5.1281, "mean_token_accuracy": 0.18880711495876312, "num_tokens": 21905035.0, "step": 12630 }, { "entropy": 5.553278589248658, "epoch": 0.9830772223302859, "grad_norm": 1.046875, "learning_rate": 0.0004908213528190355, "loss": 5.1543, "mean_token_accuracy": 0.19049129635095596, "num_tokens": 21913858.0, "step": 12635 }, { "entropy": 5.569316101074219, "epoch": 0.9834662517020035, "grad_norm": 0.96875, "learning_rate": 0.0004908135157627321, "loss": 5.2159, "mean_token_accuracy": 0.1872427299618721, "num_tokens": 21922375.0, "step": 12640 }, { "entropy": 5.585264205932617, "epoch": 0.9838552810737211, "grad_norm": 1.0234375, "learning_rate": 0.0004908056754318022, "loss": 5.2353, "mean_token_accuracy": 0.17861511409282685, "num_tokens": 21931216.0, "step": 12645 }, { "entropy": 5.5599353313446045, "epoch": 0.9842443104454386, "grad_norm": 1.046875, "learning_rate": 0.0004907978318263646, "loss": 5.2165, "mean_token_accuracy": 0.18171363919973374, "num_tokens": 21939683.0, "step": 12650 }, { "entropy": 5.580514144897461, "epoch": 0.9846333398171562, "grad_norm": 1.03125, "learning_rate": 0.0004907899849465383, "loss": 5.2629, "mean_token_accuracy": 0.18881067931652068, "num_tokens": 21948288.0, "step": 12655 }, { "entropy": 5.529097175598144, "epoch": 0.9850223691888738, "grad_norm": 0.99609375, "learning_rate": 0.0004907821347924424, "loss": 5.1936, "mean_token_accuracy": 0.18810323178768157, "num_tokens": 21957870.0, "step": 12660 }, { "entropy": 5.609283018112182, "epoch": 0.9854113985605913, "grad_norm": 1.0859375, "learning_rate": 0.0004907742813641963, "loss": 5.2459, "mean_token_accuracy": 0.1858854278922081, "num_tokens": 21965844.0, "step": 12665 }, { "entropy": 5.477437305450439, "epoch": 0.9858004279323089, "grad_norm": 1.03125, "learning_rate": 0.0004907664246619187, "loss": 5.147, "mean_token_accuracy": 0.1858885794878006, "num_tokens": 21974364.0, "step": 12670 }, { "entropy": 5.481590747833252, "epoch": 0.9861894573040264, "grad_norm": 1.03125, "learning_rate": 0.0004907585646857293, "loss": 5.0948, "mean_token_accuracy": 0.1894430011510849, "num_tokens": 21982618.0, "step": 12675 }, { "entropy": 5.561007738113403, "epoch": 0.986578486675744, "grad_norm": 1.015625, "learning_rate": 0.0004907507014357467, "loss": 5.2402, "mean_token_accuracy": 0.18591585904359817, "num_tokens": 21991823.0, "step": 12680 }, { "entropy": 5.572273397445679, "epoch": 0.9869675160474616, "grad_norm": 1.03125, "learning_rate": 0.0004907428349120909, "loss": 5.1427, "mean_token_accuracy": 0.18160430043935777, "num_tokens": 22000773.0, "step": 12685 }, { "entropy": 5.607509613037109, "epoch": 0.9873565454191792, "grad_norm": 1.1171875, "learning_rate": 0.0004907349651148809, "loss": 5.3092, "mean_token_accuracy": 0.1756952613592148, "num_tokens": 22009895.0, "step": 12690 }, { "entropy": 5.600894927978516, "epoch": 0.9877455747908968, "grad_norm": 1.0078125, "learning_rate": 0.0004907270920442361, "loss": 5.2368, "mean_token_accuracy": 0.17951168566942216, "num_tokens": 22017624.0, "step": 12695 }, { "entropy": 5.616975402832031, "epoch": 0.9881346041626142, "grad_norm": 0.9765625, "learning_rate": 0.0004907192157002762, "loss": 5.3479, "mean_token_accuracy": 0.1795940190553665, "num_tokens": 22026700.0, "step": 12700 }, { "entropy": 5.55825514793396, "epoch": 0.9885236335343318, "grad_norm": 1.03125, "learning_rate": 0.0004907113360831204, "loss": 5.2131, "mean_token_accuracy": 0.19315554350614547, "num_tokens": 22034623.0, "step": 12705 }, { "entropy": 5.545919513702392, "epoch": 0.9889126629060494, "grad_norm": 0.9921875, "learning_rate": 0.0004907034531928886, "loss": 5.2179, "mean_token_accuracy": 0.18369993269443513, "num_tokens": 22042871.0, "step": 12710 }, { "entropy": 5.484036254882812, "epoch": 0.989301692277767, "grad_norm": 0.95703125, "learning_rate": 0.0004906955670297001, "loss": 5.0888, "mean_token_accuracy": 0.1927085191011429, "num_tokens": 22051818.0, "step": 12715 }, { "entropy": 5.634485292434692, "epoch": 0.9896907216494846, "grad_norm": 1.0, "learning_rate": 0.0004906876775936746, "loss": 5.2328, "mean_token_accuracy": 0.1796593874692917, "num_tokens": 22060464.0, "step": 12720 }, { "entropy": 5.553441667556763, "epoch": 0.990079751021202, "grad_norm": 1.046875, "learning_rate": 0.0004906797848849321, "loss": 5.2212, "mean_token_accuracy": 0.17699324786663057, "num_tokens": 22069037.0, "step": 12725 }, { "entropy": 5.545280885696411, "epoch": 0.9904687803929196, "grad_norm": 1.0625, "learning_rate": 0.000490671888903592, "loss": 5.1827, "mean_token_accuracy": 0.18326786607503892, "num_tokens": 22077010.0, "step": 12730 }, { "entropy": 5.501655578613281, "epoch": 0.9908578097646372, "grad_norm": 0.96484375, "learning_rate": 0.0004906639896497744, "loss": 5.2385, "mean_token_accuracy": 0.18212108165025712, "num_tokens": 22086165.0, "step": 12735 }, { "entropy": 5.507706499099731, "epoch": 0.9912468391363548, "grad_norm": 1.1171875, "learning_rate": 0.0004906560871235988, "loss": 5.0883, "mean_token_accuracy": 0.18723068833351136, "num_tokens": 22094798.0, "step": 12740 }, { "entropy": 5.61138129234314, "epoch": 0.9916358685080724, "grad_norm": 1.0, "learning_rate": 0.0004906481813251854, "loss": 5.2564, "mean_token_accuracy": 0.18288826048374177, "num_tokens": 22103959.0, "step": 12745 }, { "entropy": 5.583155298233033, "epoch": 0.9920248978797899, "grad_norm": 1.0078125, "learning_rate": 0.0004906402722546542, "loss": 5.2343, "mean_token_accuracy": 0.1878318041563034, "num_tokens": 22112719.0, "step": 12750 }, { "entropy": 5.523591136932373, "epoch": 0.9924139272515075, "grad_norm": 1.09375, "learning_rate": 0.000490632359912125, "loss": 5.1037, "mean_token_accuracy": 0.18953030109405516, "num_tokens": 22121145.0, "step": 12755 }, { "entropy": 5.537987518310547, "epoch": 0.992802956623225, "grad_norm": 0.99609375, "learning_rate": 0.000490624444297718, "loss": 5.2239, "mean_token_accuracy": 0.18051352053880693, "num_tokens": 22130606.0, "step": 12760 }, { "entropy": 5.55096926689148, "epoch": 0.9931919859949426, "grad_norm": 0.94921875, "learning_rate": 0.0004906165254115533, "loss": 5.2282, "mean_token_accuracy": 0.17990311980247498, "num_tokens": 22140237.0, "step": 12765 }, { "entropy": 5.544623136520386, "epoch": 0.9935810153666602, "grad_norm": 0.98828125, "learning_rate": 0.000490608603253751, "loss": 5.1995, "mean_token_accuracy": 0.17970874905586243, "num_tokens": 22149734.0, "step": 12770 }, { "entropy": 5.5156396389007565, "epoch": 0.9939700447383778, "grad_norm": 0.9375, "learning_rate": 0.0004906006778244312, "loss": 5.2618, "mean_token_accuracy": 0.18165697455406188, "num_tokens": 22159346.0, "step": 12775 }, { "entropy": 5.455259084701538, "epoch": 0.9943590741100953, "grad_norm": 1.046875, "learning_rate": 0.0004905927491237145, "loss": 5.0809, "mean_token_accuracy": 0.18956034779548644, "num_tokens": 22167624.0, "step": 12780 }, { "entropy": 5.6506531715393065, "epoch": 0.9947481034818129, "grad_norm": 1.125, "learning_rate": 0.0004905848171517208, "loss": 5.3197, "mean_token_accuracy": 0.1811376094818115, "num_tokens": 22176124.0, "step": 12785 }, { "entropy": 5.540608310699463, "epoch": 0.9951371328535304, "grad_norm": 1.0390625, "learning_rate": 0.0004905768819085706, "loss": 5.2278, "mean_token_accuracy": 0.18458505868911743, "num_tokens": 22184434.0, "step": 12790 }, { "entropy": 5.537732219696045, "epoch": 0.995526162225248, "grad_norm": 1.03125, "learning_rate": 0.0004905689433943846, "loss": 5.2133, "mean_token_accuracy": 0.18687775880098342, "num_tokens": 22193431.0, "step": 12795 }, { "entropy": 5.536033821105957, "epoch": 0.9959151915969656, "grad_norm": 1.078125, "learning_rate": 0.0004905610016092828, "loss": 5.1693, "mean_token_accuracy": 0.18484147191047667, "num_tokens": 22201634.0, "step": 12800 }, { "entropy": 5.499694204330444, "epoch": 0.9963042209686831, "grad_norm": 0.9765625, "learning_rate": 0.0004905530565533859, "loss": 5.2203, "mean_token_accuracy": 0.1857329100370407, "num_tokens": 22210864.0, "step": 12805 }, { "entropy": 5.571992874145508, "epoch": 0.9966932503404007, "grad_norm": 1.0390625, "learning_rate": 0.0004905451082268146, "loss": 5.2261, "mean_token_accuracy": 0.18939330875873567, "num_tokens": 22219800.0, "step": 12810 }, { "entropy": 5.565126562118531, "epoch": 0.9970822797121183, "grad_norm": 1.0234375, "learning_rate": 0.0004905371566296891, "loss": 5.2598, "mean_token_accuracy": 0.18318777680397033, "num_tokens": 22228826.0, "step": 12815 }, { "entropy": 5.5704811096191404, "epoch": 0.9974713090838359, "grad_norm": 0.9921875, "learning_rate": 0.0004905292017621305, "loss": 5.2071, "mean_token_accuracy": 0.18567290306091308, "num_tokens": 22237076.0, "step": 12820 }, { "entropy": 5.531954193115235, "epoch": 0.9978603384555534, "grad_norm": 1.03125, "learning_rate": 0.0004905212436242593, "loss": 5.1709, "mean_token_accuracy": 0.18910606801509858, "num_tokens": 22245984.0, "step": 12825 }, { "entropy": 5.523936986923218, "epoch": 0.9982493678272709, "grad_norm": 1.0546875, "learning_rate": 0.0004905132822161962, "loss": 5.2307, "mean_token_accuracy": 0.18591742366552352, "num_tokens": 22254122.0, "step": 12830 }, { "entropy": 5.529425859451294, "epoch": 0.9986383971989885, "grad_norm": 0.9375, "learning_rate": 0.0004905053175380621, "loss": 5.2462, "mean_token_accuracy": 0.17681712806224822, "num_tokens": 22263027.0, "step": 12835 }, { "entropy": 5.521054887771607, "epoch": 0.9990274265707061, "grad_norm": 1.015625, "learning_rate": 0.0004904973495899778, "loss": 5.1666, "mean_token_accuracy": 0.18843168914318084, "num_tokens": 22272175.0, "step": 12840 }, { "entropy": 5.564848470687866, "epoch": 0.9994164559424237, "grad_norm": 1.0859375, "learning_rate": 0.0004904893783720642, "loss": 5.2302, "mean_token_accuracy": 0.18553511798381805, "num_tokens": 22281127.0, "step": 12845 }, { "entropy": 5.600316762924194, "epoch": 0.9998054853141413, "grad_norm": 1.140625, "learning_rate": 0.0004904814038844424, "loss": 5.3276, "mean_token_accuracy": 0.17699699848890305, "num_tokens": 22289696.0, "step": 12850 }, { "entropy": 5.570947435167101, "epoch": 1.000155611748687, "grad_norm": 1.0078125, "learning_rate": 0.0004904734261272332, "loss": 5.2162, "mean_token_accuracy": 0.1872315224674013, "num_tokens": 22298101.0, "step": 12855 }, { "entropy": 5.566927242279053, "epoch": 1.0005446411204046, "grad_norm": 1.09375, "learning_rate": 0.0004904654451005576, "loss": 5.123, "mean_token_accuracy": 0.18937319964170457, "num_tokens": 22305872.0, "step": 12860 }, { "entropy": 5.5282454013824465, "epoch": 1.0009336704921221, "grad_norm": 1.0703125, "learning_rate": 0.0004904574608045369, "loss": 5.1391, "mean_token_accuracy": 0.18944088220596314, "num_tokens": 22314743.0, "step": 12865 }, { "entropy": 5.594086933135986, "epoch": 1.0013226998638398, "grad_norm": 1.0234375, "learning_rate": 0.0004904494732392923, "loss": 5.1582, "mean_token_accuracy": 0.18941092044115065, "num_tokens": 22324158.0, "step": 12870 }, { "entropy": 5.50680832862854, "epoch": 1.0017117292355573, "grad_norm": 1.0390625, "learning_rate": 0.0004904414824049448, "loss": 5.0604, "mean_token_accuracy": 0.19448835402727127, "num_tokens": 22333263.0, "step": 12875 }, { "entropy": 5.497782754898071, "epoch": 1.0021007586072748, "grad_norm": 1.078125, "learning_rate": 0.0004904334883016156, "loss": 5.0301, "mean_token_accuracy": 0.18971726000308992, "num_tokens": 22341053.0, "step": 12880 }, { "entropy": 5.503505611419678, "epoch": 1.0024897879789925, "grad_norm": 1.0078125, "learning_rate": 0.0004904254909294261, "loss": 5.0366, "mean_token_accuracy": 0.19540570229291915, "num_tokens": 22348924.0, "step": 12885 }, { "entropy": 5.5107889652252195, "epoch": 1.00287881735071, "grad_norm": 1.1484375, "learning_rate": 0.0004904174902884978, "loss": 5.1182, "mean_token_accuracy": 0.18857326805591584, "num_tokens": 22356738.0, "step": 12890 }, { "entropy": 5.547894430160523, "epoch": 1.0032678467224276, "grad_norm": 0.99609375, "learning_rate": 0.0004904094863789519, "loss": 5.1509, "mean_token_accuracy": 0.18756003230810164, "num_tokens": 22365461.0, "step": 12895 }, { "entropy": 5.601795101165772, "epoch": 1.0036568760941451, "grad_norm": 1.015625, "learning_rate": 0.00049040147920091, "loss": 5.1087, "mean_token_accuracy": 0.18588180989027023, "num_tokens": 22374895.0, "step": 12900 }, { "entropy": 5.556158399581909, "epoch": 1.0040459054658626, "grad_norm": 1.046875, "learning_rate": 0.0004903934687544933, "loss": 5.1441, "mean_token_accuracy": 0.18870716392993928, "num_tokens": 22384276.0, "step": 12905 }, { "entropy": 5.582968282699585, "epoch": 1.0044349348375803, "grad_norm": 1.0234375, "learning_rate": 0.0004903854550398237, "loss": 5.1022, "mean_token_accuracy": 0.18820783942937852, "num_tokens": 22392415.0, "step": 12910 }, { "entropy": 5.574676084518432, "epoch": 1.0048239642092978, "grad_norm": 1.0234375, "learning_rate": 0.0004903774380570226, "loss": 5.1983, "mean_token_accuracy": 0.1800116553902626, "num_tokens": 22402054.0, "step": 12915 }, { "entropy": 5.520833683013916, "epoch": 1.0052129935810155, "grad_norm": 1.0, "learning_rate": 0.0004903694178062117, "loss": 5.0742, "mean_token_accuracy": 0.18684456497430801, "num_tokens": 22410505.0, "step": 12920 }, { "entropy": 5.446739435195923, "epoch": 1.005602022952733, "grad_norm": 0.96875, "learning_rate": 0.0004903613942875126, "loss": 5.0316, "mean_token_accuracy": 0.1939515694975853, "num_tokens": 22419718.0, "step": 12925 }, { "entropy": 5.534476566314697, "epoch": 1.0059910523244504, "grad_norm": 1.0, "learning_rate": 0.0004903533675010472, "loss": 5.068, "mean_token_accuracy": 0.2003800392150879, "num_tokens": 22427787.0, "step": 12930 }, { "entropy": 5.562624883651734, "epoch": 1.006380081696168, "grad_norm": 1.0859375, "learning_rate": 0.0004903453374469373, "loss": 5.1275, "mean_token_accuracy": 0.18749895989894866, "num_tokens": 22436385.0, "step": 12935 }, { "entropy": 5.477677631378174, "epoch": 1.0067691110678856, "grad_norm": 1.0625, "learning_rate": 0.0004903373041253045, "loss": 5.0632, "mean_token_accuracy": 0.19734283685684204, "num_tokens": 22444477.0, "step": 12940 }, { "entropy": 5.531784868240356, "epoch": 1.0071581404396033, "grad_norm": 1.0703125, "learning_rate": 0.0004903292675362709, "loss": 5.0534, "mean_token_accuracy": 0.19506693929433822, "num_tokens": 22452412.0, "step": 12945 }, { "entropy": 5.480631399154663, "epoch": 1.0075471698113208, "grad_norm": 1.0859375, "learning_rate": 0.0004903212276799584, "loss": 5.0428, "mean_token_accuracy": 0.20085077583789826, "num_tokens": 22461570.0, "step": 12950 }, { "entropy": 5.595657873153686, "epoch": 1.0079361991830382, "grad_norm": 1.03125, "learning_rate": 0.0004903131845564889, "loss": 5.1544, "mean_token_accuracy": 0.1855711206793785, "num_tokens": 22469835.0, "step": 12955 }, { "entropy": 5.509905433654785, "epoch": 1.008325228554756, "grad_norm": 1.171875, "learning_rate": 0.0004903051381659847, "loss": 5.1157, "mean_token_accuracy": 0.19227265417575837, "num_tokens": 22478771.0, "step": 12960 }, { "entropy": 5.4361261367797855, "epoch": 1.0087142579264734, "grad_norm": 1.046875, "learning_rate": 0.0004902970885085677, "loss": 5.0277, "mean_token_accuracy": 0.1993486315011978, "num_tokens": 22487138.0, "step": 12965 }, { "entropy": 5.473689126968384, "epoch": 1.009103287298191, "grad_norm": 1.0546875, "learning_rate": 0.00049028903558436, "loss": 5.0955, "mean_token_accuracy": 0.19316711127758027, "num_tokens": 22495384.0, "step": 12970 }, { "entropy": 5.627360773086548, "epoch": 1.0094923166699086, "grad_norm": 1.046875, "learning_rate": 0.0004902809793934838, "loss": 5.1869, "mean_token_accuracy": 0.1792323723435402, "num_tokens": 22503521.0, "step": 12975 }, { "entropy": 5.583735036849975, "epoch": 1.009881346041626, "grad_norm": 0.96484375, "learning_rate": 0.0004902729199360615, "loss": 5.1443, "mean_token_accuracy": 0.1965876966714859, "num_tokens": 22512155.0, "step": 12980 }, { "entropy": 5.59104642868042, "epoch": 1.0102703754133437, "grad_norm": 1.0703125, "learning_rate": 0.0004902648572122153, "loss": 5.1687, "mean_token_accuracy": 0.18694278597831726, "num_tokens": 22519844.0, "step": 12985 }, { "entropy": 5.490280294418335, "epoch": 1.0106594047850612, "grad_norm": 1.015625, "learning_rate": 0.0004902567912220674, "loss": 5.1123, "mean_token_accuracy": 0.18605371415615082, "num_tokens": 22529123.0, "step": 12990 }, { "entropy": 5.588703155517578, "epoch": 1.011048434156779, "grad_norm": 1.046875, "learning_rate": 0.0004902487219657404, "loss": 5.1489, "mean_token_accuracy": 0.19163298308849336, "num_tokens": 22537632.0, "step": 12995 }, { "entropy": 5.545936059951782, "epoch": 1.0114374635284964, "grad_norm": 1.078125, "learning_rate": 0.0004902406494433566, "loss": 5.0418, "mean_token_accuracy": 0.1861702486872673, "num_tokens": 22546370.0, "step": 13000 }, { "entropy": 5.516361236572266, "epoch": 1.0118264929002139, "grad_norm": 1.296875, "learning_rate": 0.0004902325736550386, "loss": 5.1246, "mean_token_accuracy": 0.1919540986418724, "num_tokens": 22554527.0, "step": 13005 }, { "entropy": 5.538467264175415, "epoch": 1.0122155222719316, "grad_norm": 0.984375, "learning_rate": 0.0004902244946009088, "loss": 5.0938, "mean_token_accuracy": 0.1949560597538948, "num_tokens": 22563803.0, "step": 13010 }, { "entropy": 5.562205600738525, "epoch": 1.012604551643649, "grad_norm": 1.078125, "learning_rate": 0.0004902164122810899, "loss": 5.0839, "mean_token_accuracy": 0.19037722945213317, "num_tokens": 22572333.0, "step": 13015 }, { "entropy": 5.459561347961426, "epoch": 1.0129935810153667, "grad_norm": 1.1015625, "learning_rate": 0.0004902083266957045, "loss": 5.0213, "mean_token_accuracy": 0.20114053040742874, "num_tokens": 22580376.0, "step": 13020 }, { "entropy": 5.504111480712891, "epoch": 1.0133826103870842, "grad_norm": 1.078125, "learning_rate": 0.0004902002378448753, "loss": 5.1692, "mean_token_accuracy": 0.18777503669261933, "num_tokens": 22589074.0, "step": 13025 }, { "entropy": 5.517139339447022, "epoch": 1.0137716397588017, "grad_norm": 1.03125, "learning_rate": 0.000490192145728725, "loss": 4.9898, "mean_token_accuracy": 0.19804249405860902, "num_tokens": 22596905.0, "step": 13030 }, { "entropy": 5.461124849319458, "epoch": 1.0141606691305194, "grad_norm": 1.0078125, "learning_rate": 0.0004901840503473764, "loss": 5.1232, "mean_token_accuracy": 0.18640264123678207, "num_tokens": 22605556.0, "step": 13035 }, { "entropy": 5.5397154808044435, "epoch": 1.0145496985022369, "grad_norm": 1.0078125, "learning_rate": 0.0004901759517009522, "loss": 5.0884, "mean_token_accuracy": 0.19742010533809662, "num_tokens": 22613443.0, "step": 13040 }, { "entropy": 5.448122787475586, "epoch": 1.0149387278739546, "grad_norm": 1.03125, "learning_rate": 0.0004901678497895755, "loss": 5.031, "mean_token_accuracy": 0.19067345708608627, "num_tokens": 22622287.0, "step": 13045 }, { "entropy": 5.486344480514527, "epoch": 1.015327757245672, "grad_norm": 1.1171875, "learning_rate": 0.0004901597446133692, "loss": 5.0449, "mean_token_accuracy": 0.1972237393260002, "num_tokens": 22630961.0, "step": 13050 }, { "entropy": 5.546230983734131, "epoch": 1.0157167866173895, "grad_norm": 1.0390625, "learning_rate": 0.0004901516361724564, "loss": 5.1062, "mean_token_accuracy": 0.19114070534706115, "num_tokens": 22639325.0, "step": 13055 }, { "entropy": 5.57363920211792, "epoch": 1.0161058159891072, "grad_norm": 1.0, "learning_rate": 0.0004901435244669597, "loss": 5.1301, "mean_token_accuracy": 0.1863555818796158, "num_tokens": 22649028.0, "step": 13060 }, { "entropy": 5.521204805374145, "epoch": 1.0164948453608247, "grad_norm": 0.890625, "learning_rate": 0.0004901354094970025, "loss": 5.0876, "mean_token_accuracy": 0.1956435263156891, "num_tokens": 22657742.0, "step": 13065 }, { "entropy": 5.550022315979004, "epoch": 1.0168838747325424, "grad_norm": 1.0703125, "learning_rate": 0.0004901272912627081, "loss": 5.0596, "mean_token_accuracy": 0.1880657345056534, "num_tokens": 22665807.0, "step": 13070 }, { "entropy": 5.452243185043335, "epoch": 1.0172729041042599, "grad_norm": 1.1171875, "learning_rate": 0.0004901191697641992, "loss": 5.0005, "mean_token_accuracy": 0.20027755498886107, "num_tokens": 22674182.0, "step": 13075 }, { "entropy": 5.450249338150025, "epoch": 1.0176619334759773, "grad_norm": 1.078125, "learning_rate": 0.0004901110450015994, "loss": 5.1258, "mean_token_accuracy": 0.18456079959869384, "num_tokens": 22683129.0, "step": 13080 }, { "entropy": 5.573884296417236, "epoch": 1.018050962847695, "grad_norm": 1.046875, "learning_rate": 0.0004901029169750319, "loss": 5.1753, "mean_token_accuracy": 0.19053862243890762, "num_tokens": 22692394.0, "step": 13085 }, { "entropy": 5.495051145553589, "epoch": 1.0184399922194125, "grad_norm": 1.1015625, "learning_rate": 0.0004900947856846201, "loss": 4.9741, "mean_token_accuracy": 0.19873649179935454, "num_tokens": 22700830.0, "step": 13090 }, { "entropy": 5.604632806777954, "epoch": 1.0188290215911302, "grad_norm": 1.09375, "learning_rate": 0.000490086651130487, "loss": 5.1463, "mean_token_accuracy": 0.19330211281776427, "num_tokens": 22709796.0, "step": 13095 }, { "entropy": 5.4647266387939455, "epoch": 1.0192180509628477, "grad_norm": 1.046875, "learning_rate": 0.0004900785133127566, "loss": 5.0712, "mean_token_accuracy": 0.1953159302473068, "num_tokens": 22717550.0, "step": 13100 }, { "entropy": 5.507863855361938, "epoch": 1.0196070803345652, "grad_norm": 1.03125, "learning_rate": 0.000490070372231552, "loss": 5.1308, "mean_token_accuracy": 0.1866422951221466, "num_tokens": 22726630.0, "step": 13105 }, { "entropy": 5.598577880859375, "epoch": 1.0199961097062828, "grad_norm": 1.09375, "learning_rate": 0.0004900622278869968, "loss": 5.1299, "mean_token_accuracy": 0.1922068029642105, "num_tokens": 22735364.0, "step": 13110 }, { "entropy": 5.517694759368896, "epoch": 1.0203851390780003, "grad_norm": 1.0859375, "learning_rate": 0.0004900540802792146, "loss": 5.009, "mean_token_accuracy": 0.19232653230428695, "num_tokens": 22743910.0, "step": 13115 }, { "entropy": 5.473497533798218, "epoch": 1.020774168449718, "grad_norm": 0.9609375, "learning_rate": 0.000490045929408329, "loss": 5.0541, "mean_token_accuracy": 0.19305328279733658, "num_tokens": 22753061.0, "step": 13120 }, { "entropy": 5.54612545967102, "epoch": 1.0211631978214355, "grad_norm": 1.0859375, "learning_rate": 0.0004900377752744637, "loss": 5.0904, "mean_token_accuracy": 0.19209272563457488, "num_tokens": 22761401.0, "step": 13125 }, { "entropy": 5.586156034469605, "epoch": 1.021552227193153, "grad_norm": 1.09375, "learning_rate": 0.0004900296178777426, "loss": 5.1661, "mean_token_accuracy": 0.18434716612100602, "num_tokens": 22769307.0, "step": 13130 }, { "entropy": 5.5873126029968265, "epoch": 1.0219412565648707, "grad_norm": 1.0703125, "learning_rate": 0.000490021457218289, "loss": 5.2136, "mean_token_accuracy": 0.1899673029780388, "num_tokens": 22778159.0, "step": 13135 }, { "entropy": 5.46327052116394, "epoch": 1.0223302859365881, "grad_norm": 1.109375, "learning_rate": 0.0004900132932962272, "loss": 4.9486, "mean_token_accuracy": 0.19610001742839814, "num_tokens": 22785872.0, "step": 13140 }, { "entropy": 5.537806367874145, "epoch": 1.0227193153083058, "grad_norm": 1.109375, "learning_rate": 0.000490005126111681, "loss": 5.123, "mean_token_accuracy": 0.19678149819374086, "num_tokens": 22794531.0, "step": 13145 }, { "entropy": 5.54573769569397, "epoch": 1.0231083446800233, "grad_norm": 1.0859375, "learning_rate": 0.000489996955664774, "loss": 5.1454, "mean_token_accuracy": 0.18805739134550095, "num_tokens": 22803246.0, "step": 13150 }, { "entropy": 5.502979040145874, "epoch": 1.023497374051741, "grad_norm": 1.15625, "learning_rate": 0.0004899887819556306, "loss": 5.081, "mean_token_accuracy": 0.1919192299246788, "num_tokens": 22811316.0, "step": 13155 }, { "entropy": 5.521839046478272, "epoch": 1.0238864034234585, "grad_norm": 1.0234375, "learning_rate": 0.0004899806049843745, "loss": 5.0778, "mean_token_accuracy": 0.18884354829788208, "num_tokens": 22820754.0, "step": 13160 }, { "entropy": 5.569931507110596, "epoch": 1.024275432795176, "grad_norm": 1.1015625, "learning_rate": 0.0004899724247511299, "loss": 5.176, "mean_token_accuracy": 0.18050881773233413, "num_tokens": 22829185.0, "step": 13165 }, { "entropy": 5.604481363296509, "epoch": 1.0246644621668937, "grad_norm": 1.015625, "learning_rate": 0.000489964241256021, "loss": 5.1757, "mean_token_accuracy": 0.18873506635427476, "num_tokens": 22838379.0, "step": 13170 }, { "entropy": 5.504822444915772, "epoch": 1.0250534915386111, "grad_norm": 0.95703125, "learning_rate": 0.0004899560544991718, "loss": 5.1359, "mean_token_accuracy": 0.18978343307971954, "num_tokens": 22847186.0, "step": 13175 }, { "entropy": 5.509841251373291, "epoch": 1.0254425209103288, "grad_norm": 1.0, "learning_rate": 0.0004899478644807068, "loss": 5.1588, "mean_token_accuracy": 0.19042373597621917, "num_tokens": 22856882.0, "step": 13180 }, { "entropy": 5.531721305847168, "epoch": 1.0258315502820463, "grad_norm": 1.0625, "learning_rate": 0.0004899396712007498, "loss": 5.057, "mean_token_accuracy": 0.19042808711528778, "num_tokens": 22865747.0, "step": 13185 }, { "entropy": 5.408338928222657, "epoch": 1.0262205796537638, "grad_norm": 1.15625, "learning_rate": 0.0004899314746594256, "loss": 4.9172, "mean_token_accuracy": 0.20211312025785447, "num_tokens": 22873847.0, "step": 13190 }, { "entropy": 5.4934186935424805, "epoch": 1.0266096090254815, "grad_norm": 1.0234375, "learning_rate": 0.0004899232748568584, "loss": 5.0577, "mean_token_accuracy": 0.1899716481566429, "num_tokens": 22882333.0, "step": 13195 }, { "entropy": 5.520166110992432, "epoch": 1.026998638397199, "grad_norm": 0.96875, "learning_rate": 0.0004899150717931724, "loss": 5.0072, "mean_token_accuracy": 0.19532584697008132, "num_tokens": 22891344.0, "step": 13200 }, { "entropy": 5.534826707839966, "epoch": 1.0273876677689167, "grad_norm": 1.03125, "learning_rate": 0.0004899068654684924, "loss": 5.1456, "mean_token_accuracy": 0.18749040216207505, "num_tokens": 22899783.0, "step": 13205 }, { "entropy": 5.508007287979126, "epoch": 1.0277766971406341, "grad_norm": 1.0703125, "learning_rate": 0.0004898986558829428, "loss": 5.0455, "mean_token_accuracy": 0.19265253245830535, "num_tokens": 22907274.0, "step": 13210 }, { "entropy": 5.538780403137207, "epoch": 1.0281657265123516, "grad_norm": 1.1015625, "learning_rate": 0.0004898904430366479, "loss": 5.1805, "mean_token_accuracy": 0.18277360051870345, "num_tokens": 22915744.0, "step": 13215 }, { "entropy": 5.588352537155151, "epoch": 1.0285547558840693, "grad_norm": 1.0, "learning_rate": 0.0004898822269297328, "loss": 5.1175, "mean_token_accuracy": 0.1881759434938431, "num_tokens": 22924244.0, "step": 13220 }, { "entropy": 5.5746777057647705, "epoch": 1.0289437852557868, "grad_norm": 1.078125, "learning_rate": 0.0004898740075623218, "loss": 5.1495, "mean_token_accuracy": 0.19108967781066893, "num_tokens": 22932676.0, "step": 13225 }, { "entropy": 5.519115591049195, "epoch": 1.0293328146275045, "grad_norm": 1.078125, "learning_rate": 0.0004898657849345399, "loss": 5.0632, "mean_token_accuracy": 0.19305302202701569, "num_tokens": 22941327.0, "step": 13230 }, { "entropy": 5.504632759094238, "epoch": 1.029721843999222, "grad_norm": 1.0703125, "learning_rate": 0.0004898575590465116, "loss": 5.0715, "mean_token_accuracy": 0.19412790685892106, "num_tokens": 22949540.0, "step": 13235 }, { "entropy": 5.571454381942749, "epoch": 1.0301108733709394, "grad_norm": 1.0078125, "learning_rate": 0.0004898493298983619, "loss": 5.2109, "mean_token_accuracy": 0.1841746151447296, "num_tokens": 22958375.0, "step": 13240 }, { "entropy": 5.582480335235596, "epoch": 1.0304999027426571, "grad_norm": 1.03125, "learning_rate": 0.0004898410974902155, "loss": 5.1198, "mean_token_accuracy": 0.1899153023958206, "num_tokens": 22966594.0, "step": 13245 }, { "entropy": 5.59900689125061, "epoch": 1.0308889321143746, "grad_norm": 1.0078125, "learning_rate": 0.0004898328618221974, "loss": 5.1851, "mean_token_accuracy": 0.17713644504547119, "num_tokens": 22975208.0, "step": 13250 }, { "entropy": 5.556050157546997, "epoch": 1.0312779614860923, "grad_norm": 1.109375, "learning_rate": 0.0004898246228944327, "loss": 5.1365, "mean_token_accuracy": 0.18322844803333282, "num_tokens": 22983563.0, "step": 13255 }, { "entropy": 5.474011850357056, "epoch": 1.0316669908578098, "grad_norm": 0.94140625, "learning_rate": 0.0004898163807070461, "loss": 5.045, "mean_token_accuracy": 0.19628906548023223, "num_tokens": 22992866.0, "step": 13260 }, { "entropy": 5.508804988861084, "epoch": 1.0320560202295272, "grad_norm": 1.046875, "learning_rate": 0.0004898081352601629, "loss": 5.0478, "mean_token_accuracy": 0.19585597068071364, "num_tokens": 23001536.0, "step": 13265 }, { "entropy": 5.492587232589722, "epoch": 1.032445049601245, "grad_norm": 1.0234375, "learning_rate": 0.0004897998865539082, "loss": 5.0393, "mean_token_accuracy": 0.19023662507534028, "num_tokens": 23009712.0, "step": 13270 }, { "entropy": 5.486681318283081, "epoch": 1.0328340789729624, "grad_norm": 1.046875, "learning_rate": 0.0004897916345884069, "loss": 4.9991, "mean_token_accuracy": 0.19824901670217515, "num_tokens": 23017970.0, "step": 13275 }, { "entropy": 5.500798749923706, "epoch": 1.0332231083446801, "grad_norm": 1.0390625, "learning_rate": 0.0004897833793637847, "loss": 5.0585, "mean_token_accuracy": 0.19602361172437668, "num_tokens": 23026231.0, "step": 13280 }, { "entropy": 5.586293888092041, "epoch": 1.0336121377163976, "grad_norm": 0.98046875, "learning_rate": 0.0004897751208801665, "loss": 5.1671, "mean_token_accuracy": 0.1916987344622612, "num_tokens": 23034962.0, "step": 13285 }, { "entropy": 5.521128988265991, "epoch": 1.034001167088115, "grad_norm": 0.98828125, "learning_rate": 0.0004897668591376777, "loss": 5.1133, "mean_token_accuracy": 0.18796224445104598, "num_tokens": 23045105.0, "step": 13290 }, { "entropy": 5.523331880569458, "epoch": 1.0343901964598328, "grad_norm": 1.015625, "learning_rate": 0.0004897585941364436, "loss": 5.0959, "mean_token_accuracy": 0.18961455225944518, "num_tokens": 23054315.0, "step": 13295 }, { "entropy": 5.581834506988526, "epoch": 1.0347792258315502, "grad_norm": 1.078125, "learning_rate": 0.0004897503258765896, "loss": 5.1295, "mean_token_accuracy": 0.18837738633155823, "num_tokens": 23063089.0, "step": 13300 }, { "entropy": 5.547751426696777, "epoch": 1.035168255203268, "grad_norm": 1.0390625, "learning_rate": 0.0004897420543582413, "loss": 5.131, "mean_token_accuracy": 0.1804849848151207, "num_tokens": 23071827.0, "step": 13305 }, { "entropy": 5.469673919677734, "epoch": 1.0355572845749854, "grad_norm": 1.0078125, "learning_rate": 0.000489733779581524, "loss": 5.0443, "mean_token_accuracy": 0.1970272183418274, "num_tokens": 23080090.0, "step": 13310 }, { "entropy": 5.529992628097534, "epoch": 1.035946313946703, "grad_norm": 1.046875, "learning_rate": 0.0004897255015465635, "loss": 5.1499, "mean_token_accuracy": 0.18443081974983216, "num_tokens": 23089201.0, "step": 13315 }, { "entropy": 5.553167629241943, "epoch": 1.0363353433184206, "grad_norm": 1.078125, "learning_rate": 0.0004897172202534853, "loss": 5.0771, "mean_token_accuracy": 0.19346014112234117, "num_tokens": 23097708.0, "step": 13320 }, { "entropy": 5.566406297683716, "epoch": 1.036724372690138, "grad_norm": 1.046875, "learning_rate": 0.000489708935702415, "loss": 5.1994, "mean_token_accuracy": 0.17937947511672975, "num_tokens": 23107554.0, "step": 13325 }, { "entropy": 5.511495876312256, "epoch": 1.0371134020618558, "grad_norm": 0.96875, "learning_rate": 0.0004897006478934784, "loss": 5.0669, "mean_token_accuracy": 0.19319655746221542, "num_tokens": 23116781.0, "step": 13330 }, { "entropy": 5.450475072860717, "epoch": 1.0375024314335732, "grad_norm": 1.0078125, "learning_rate": 0.0004896923568268011, "loss": 5.0409, "mean_token_accuracy": 0.19122885167598724, "num_tokens": 23125490.0, "step": 13335 }, { "entropy": 5.550891923904419, "epoch": 1.0378914608052907, "grad_norm": 1.15625, "learning_rate": 0.000489684062502509, "loss": 5.1537, "mean_token_accuracy": 0.1895194470882416, "num_tokens": 23133693.0, "step": 13340 }, { "entropy": 5.409361886978149, "epoch": 1.0382804901770084, "grad_norm": 0.98828125, "learning_rate": 0.0004896757649207281, "loss": 4.98, "mean_token_accuracy": 0.19491089433431624, "num_tokens": 23142888.0, "step": 13345 }, { "entropy": 5.5186511993408205, "epoch": 1.0386695195487259, "grad_norm": 1.0546875, "learning_rate": 0.000489667464081584, "loss": 4.9968, "mean_token_accuracy": 0.19732685983181, "num_tokens": 23151413.0, "step": 13350 }, { "entropy": 5.520129728317261, "epoch": 1.0390585489204436, "grad_norm": 1.1015625, "learning_rate": 0.0004896591599852029, "loss": 5.0228, "mean_token_accuracy": 0.19055050760507583, "num_tokens": 23159545.0, "step": 13355 }, { "entropy": 5.542135095596313, "epoch": 1.039447578292161, "grad_norm": 1.078125, "learning_rate": 0.0004896508526317107, "loss": 5.0923, "mean_token_accuracy": 0.19229323863983155, "num_tokens": 23167963.0, "step": 13360 }, { "entropy": 5.519417572021484, "epoch": 1.0398366076638785, "grad_norm": 0.99609375, "learning_rate": 0.0004896425420212334, "loss": 5.096, "mean_token_accuracy": 0.18962192088365554, "num_tokens": 23176505.0, "step": 13365 }, { "entropy": 5.476184415817261, "epoch": 1.0402256370355962, "grad_norm": 1.109375, "learning_rate": 0.0004896342281538973, "loss": 4.9915, "mean_token_accuracy": 0.19449099898338318, "num_tokens": 23184776.0, "step": 13370 }, { "entropy": 5.584010219573974, "epoch": 1.0406146664073137, "grad_norm": 1.046875, "learning_rate": 0.0004896259110298283, "loss": 5.1527, "mean_token_accuracy": 0.19312323331832887, "num_tokens": 23193284.0, "step": 13375 }, { "entropy": 5.609039258956909, "epoch": 1.0410036957790314, "grad_norm": 1.09375, "learning_rate": 0.0004896175906491528, "loss": 5.1033, "mean_token_accuracy": 0.18922057449817659, "num_tokens": 23201664.0, "step": 13380 }, { "entropy": 5.530050992965698, "epoch": 1.0413927251507489, "grad_norm": 1.0703125, "learning_rate": 0.0004896092670119968, "loss": 5.0936, "mean_token_accuracy": 0.19316325038671495, "num_tokens": 23210831.0, "step": 13385 }, { "entropy": 5.481321811676025, "epoch": 1.0417817545224664, "grad_norm": 1.171875, "learning_rate": 0.0004896009401184869, "loss": 5.0875, "mean_token_accuracy": 0.18993585109710692, "num_tokens": 23218945.0, "step": 13390 }, { "entropy": 5.501623487472534, "epoch": 1.042170783894184, "grad_norm": 1.0390625, "learning_rate": 0.0004895926099687493, "loss": 5.1051, "mean_token_accuracy": 0.18563676625490189, "num_tokens": 23227922.0, "step": 13395 }, { "entropy": 5.517203712463379, "epoch": 1.0425598132659015, "grad_norm": 0.99609375, "learning_rate": 0.0004895842765629104, "loss": 5.0465, "mean_token_accuracy": 0.19482695907354355, "num_tokens": 23237726.0, "step": 13400 }, { "entropy": 5.528455829620361, "epoch": 1.0429488426376192, "grad_norm": 1.0625, "learning_rate": 0.0004895759399010966, "loss": 5.0895, "mean_token_accuracy": 0.18443805128335952, "num_tokens": 23246237.0, "step": 13405 }, { "entropy": 5.458320951461792, "epoch": 1.0433378720093367, "grad_norm": 1.0625, "learning_rate": 0.0004895675999834345, "loss": 5.0574, "mean_token_accuracy": 0.1902329295873642, "num_tokens": 23254883.0, "step": 13410 }, { "entropy": 5.583170700073242, "epoch": 1.0437269013810542, "grad_norm": 1.1015625, "learning_rate": 0.0004895592568100505, "loss": 5.1936, "mean_token_accuracy": 0.18406160473823546, "num_tokens": 23263270.0, "step": 13415 }, { "entropy": 5.520224142074585, "epoch": 1.0441159307527719, "grad_norm": 1.0859375, "learning_rate": 0.0004895509103810714, "loss": 5.0305, "mean_token_accuracy": 0.18978043347597123, "num_tokens": 23271823.0, "step": 13420 }, { "entropy": 5.528475332260132, "epoch": 1.0445049601244893, "grad_norm": 1.0703125, "learning_rate": 0.0004895425606966237, "loss": 5.0646, "mean_token_accuracy": 0.19269345551729203, "num_tokens": 23280382.0, "step": 13425 }, { "entropy": 5.560562562942505, "epoch": 1.044893989496207, "grad_norm": 1.1171875, "learning_rate": 0.000489534207756834, "loss": 5.1508, "mean_token_accuracy": 0.18927441239356996, "num_tokens": 23288107.0, "step": 13430 }, { "entropy": 5.482879304885865, "epoch": 1.0452830188679245, "grad_norm": 1.0625, "learning_rate": 0.0004895258515618293, "loss": 5.0621, "mean_token_accuracy": 0.19035191535949708, "num_tokens": 23295661.0, "step": 13435 }, { "entropy": 5.599353504180908, "epoch": 1.045672048239642, "grad_norm": 1.015625, "learning_rate": 0.0004895174921117362, "loss": 5.1533, "mean_token_accuracy": 0.1922643169760704, "num_tokens": 23304862.0, "step": 13440 }, { "entropy": 5.612282943725586, "epoch": 1.0460610776113597, "grad_norm": 1.0546875, "learning_rate": 0.0004895091294066816, "loss": 5.1348, "mean_token_accuracy": 0.19007511138916017, "num_tokens": 23312992.0, "step": 13445 }, { "entropy": 5.576588678359985, "epoch": 1.0464501069830772, "grad_norm": 1.0078125, "learning_rate": 0.0004895007634467924, "loss": 5.1994, "mean_token_accuracy": 0.18481669574975967, "num_tokens": 23321942.0, "step": 13450 }, { "entropy": 5.515787935256958, "epoch": 1.0468391363547949, "grad_norm": 1.0, "learning_rate": 0.0004894923942321955, "loss": 5.0924, "mean_token_accuracy": 0.18557893931865693, "num_tokens": 23330608.0, "step": 13455 }, { "entropy": 5.49301962852478, "epoch": 1.0472281657265123, "grad_norm": 1.078125, "learning_rate": 0.0004894840217630179, "loss": 5.1036, "mean_token_accuracy": 0.19485004991292953, "num_tokens": 23339792.0, "step": 13460 }, { "entropy": 5.55698595046997, "epoch": 1.0476171950982298, "grad_norm": 1.109375, "learning_rate": 0.0004894756460393868, "loss": 5.0872, "mean_token_accuracy": 0.19522764384746552, "num_tokens": 23347813.0, "step": 13465 }, { "entropy": 5.437216520309448, "epoch": 1.0480062244699475, "grad_norm": 1.125, "learning_rate": 0.000489467267061429, "loss": 5.056, "mean_token_accuracy": 0.19620070308446885, "num_tokens": 23356110.0, "step": 13470 }, { "entropy": 5.529351329803466, "epoch": 1.048395253841665, "grad_norm": 1.0859375, "learning_rate": 0.0004894588848292718, "loss": 5.1082, "mean_token_accuracy": 0.18862626254558562, "num_tokens": 23364249.0, "step": 13475 }, { "entropy": 5.567995834350586, "epoch": 1.0487842832133827, "grad_norm": 0.95703125, "learning_rate": 0.0004894504993430425, "loss": 5.1286, "mean_token_accuracy": 0.1856210336089134, "num_tokens": 23373072.0, "step": 13480 }, { "entropy": 5.460308647155761, "epoch": 1.0491733125851002, "grad_norm": 1.015625, "learning_rate": 0.000489442110602868, "loss": 4.9963, "mean_token_accuracy": 0.18919277787208558, "num_tokens": 23381752.0, "step": 13485 }, { "entropy": 5.517527675628662, "epoch": 1.0495623419568176, "grad_norm": 1.0859375, "learning_rate": 0.0004894337186088759, "loss": 5.1152, "mean_token_accuracy": 0.18922088891267777, "num_tokens": 23389872.0, "step": 13490 }, { "entropy": 5.481854724884033, "epoch": 1.0499513713285353, "grad_norm": 1.0546875, "learning_rate": 0.0004894253233611934, "loss": 5.0031, "mean_token_accuracy": 0.19523075222969055, "num_tokens": 23398226.0, "step": 13495 }, { "entropy": 5.505682039260864, "epoch": 1.0503404007002528, "grad_norm": 0.97265625, "learning_rate": 0.000489416924859948, "loss": 5.0467, "mean_token_accuracy": 0.19352334439754487, "num_tokens": 23406776.0, "step": 13500 }, { "entropy": 5.526216602325439, "epoch": 1.0507294300719705, "grad_norm": 1.046875, "learning_rate": 0.000489408523105267, "loss": 5.0972, "mean_token_accuracy": 0.190244422852993, "num_tokens": 23415034.0, "step": 13505 }, { "entropy": 5.51914610862732, "epoch": 1.051118459443688, "grad_norm": 0.98046875, "learning_rate": 0.0004894001180972779, "loss": 5.085, "mean_token_accuracy": 0.19196409583091736, "num_tokens": 23423826.0, "step": 13510 }, { "entropy": 5.446078491210938, "epoch": 1.0515074888154055, "grad_norm": 1.03125, "learning_rate": 0.0004893917098361082, "loss": 5.0212, "mean_token_accuracy": 0.19590983539819717, "num_tokens": 23432166.0, "step": 13515 }, { "entropy": 5.512406253814698, "epoch": 1.0518965181871232, "grad_norm": 1.0390625, "learning_rate": 0.0004893832983218856, "loss": 5.0693, "mean_token_accuracy": 0.1878315880894661, "num_tokens": 23441065.0, "step": 13520 }, { "entropy": 5.569066429138184, "epoch": 1.0522855475588406, "grad_norm": 1.015625, "learning_rate": 0.0004893748835547377, "loss": 5.1603, "mean_token_accuracy": 0.1871422678232193, "num_tokens": 23450514.0, "step": 13525 }, { "entropy": 5.566702365875244, "epoch": 1.0526745769305583, "grad_norm": 1.0, "learning_rate": 0.0004893664655347921, "loss": 5.1922, "mean_token_accuracy": 0.188896282017231, "num_tokens": 23459354.0, "step": 13530 }, { "entropy": 5.572860336303711, "epoch": 1.0530636063022758, "grad_norm": 1.0390625, "learning_rate": 0.0004893580442621767, "loss": 5.1441, "mean_token_accuracy": 0.18836628794670104, "num_tokens": 23468646.0, "step": 13535 }, { "entropy": 5.487472820281982, "epoch": 1.0534526356739935, "grad_norm": 1.09375, "learning_rate": 0.000489349619737019, "loss": 5.0201, "mean_token_accuracy": 0.19957176446914673, "num_tokens": 23477042.0, "step": 13540 }, { "entropy": 5.435347223281861, "epoch": 1.053841665045711, "grad_norm": 1.015625, "learning_rate": 0.000489341191959447, "loss": 5.0206, "mean_token_accuracy": 0.1936554104089737, "num_tokens": 23485760.0, "step": 13545 }, { "entropy": 5.4848167419433596, "epoch": 1.0542306944174284, "grad_norm": 1.109375, "learning_rate": 0.0004893327609295887, "loss": 5.1018, "mean_token_accuracy": 0.19138745069503785, "num_tokens": 23494425.0, "step": 13550 }, { "entropy": 5.550305509567261, "epoch": 1.0546197237891461, "grad_norm": 1.078125, "learning_rate": 0.0004893243266475719, "loss": 5.0901, "mean_token_accuracy": 0.18880690336227418, "num_tokens": 23502667.0, "step": 13555 }, { "entropy": 5.54180006980896, "epoch": 1.0550087531608636, "grad_norm": 1.109375, "learning_rate": 0.0004893158891135245, "loss": 5.119, "mean_token_accuracy": 0.19139880686998367, "num_tokens": 23511706.0, "step": 13560 }, { "entropy": 5.567579078674316, "epoch": 1.055397782532581, "grad_norm": 0.97265625, "learning_rate": 0.0004893074483275746, "loss": 5.1484, "mean_token_accuracy": 0.18930281102657318, "num_tokens": 23520678.0, "step": 13565 }, { "entropy": 5.519304895401001, "epoch": 1.0557868119042988, "grad_norm": 0.94140625, "learning_rate": 0.0004892990042898503, "loss": 5.0727, "mean_token_accuracy": 0.19876897037029267, "num_tokens": 23530246.0, "step": 13570 }, { "entropy": 5.493484115600586, "epoch": 1.0561758412760163, "grad_norm": 1.0234375, "learning_rate": 0.0004892905570004798, "loss": 5.0904, "mean_token_accuracy": 0.1881159260869026, "num_tokens": 23539128.0, "step": 13575 }, { "entropy": 5.518405485153198, "epoch": 1.056564870647734, "grad_norm": 1.0625, "learning_rate": 0.000489282106459591, "loss": 5.1833, "mean_token_accuracy": 0.1884162664413452, "num_tokens": 23548062.0, "step": 13580 }, { "entropy": 5.557589912414551, "epoch": 1.0569539000194514, "grad_norm": 1.09375, "learning_rate": 0.0004892736526673124, "loss": 5.2147, "mean_token_accuracy": 0.1793177217245102, "num_tokens": 23557148.0, "step": 13585 }, { "entropy": 5.481782865524292, "epoch": 1.0573429293911691, "grad_norm": 1.1640625, "learning_rate": 0.0004892651956237721, "loss": 5.0499, "mean_token_accuracy": 0.19795615524053572, "num_tokens": 23565949.0, "step": 13590 }, { "entropy": 5.520569801330566, "epoch": 1.0577319587628866, "grad_norm": 0.96875, "learning_rate": 0.0004892567353290986, "loss": 5.1014, "mean_token_accuracy": 0.1934608742594719, "num_tokens": 23574216.0, "step": 13595 }, { "entropy": 5.502425861358643, "epoch": 1.058120988134604, "grad_norm": 1.03125, "learning_rate": 0.0004892482717834201, "loss": 5.0402, "mean_token_accuracy": 0.19388829320669174, "num_tokens": 23582362.0, "step": 13600 }, { "entropy": 5.560519599914551, "epoch": 1.0585100175063218, "grad_norm": 1.0546875, "learning_rate": 0.0004892398049868651, "loss": 5.1594, "mean_token_accuracy": 0.18354610800743104, "num_tokens": 23591737.0, "step": 13605 }, { "entropy": 5.490676975250244, "epoch": 1.0588990468780393, "grad_norm": 1.078125, "learning_rate": 0.000489231334939562, "loss": 4.9882, "mean_token_accuracy": 0.19327364414930343, "num_tokens": 23600302.0, "step": 13610 }, { "entropy": 5.500968360900879, "epoch": 1.059288076249757, "grad_norm": 1.0625, "learning_rate": 0.0004892228616416395, "loss": 5.0961, "mean_token_accuracy": 0.18980936110019683, "num_tokens": 23609189.0, "step": 13615 }, { "entropy": 5.5319067478179935, "epoch": 1.0596771056214744, "grad_norm": 1.0390625, "learning_rate": 0.0004892143850932259, "loss": 5.1157, "mean_token_accuracy": 0.18929604291915894, "num_tokens": 23618174.0, "step": 13620 }, { "entropy": 5.481690263748169, "epoch": 1.060066134993192, "grad_norm": 0.99609375, "learning_rate": 0.00048920590529445, "loss": 5.0484, "mean_token_accuracy": 0.1978852465748787, "num_tokens": 23626908.0, "step": 13625 }, { "entropy": 5.532262134552002, "epoch": 1.0604551643649096, "grad_norm": 1.125, "learning_rate": 0.0004891974222454406, "loss": 5.0928, "mean_token_accuracy": 0.1863192781805992, "num_tokens": 23635379.0, "step": 13630 }, { "entropy": 5.529179573059082, "epoch": 1.060844193736627, "grad_norm": 1.1796875, "learning_rate": 0.0004891889359463261, "loss": 5.1171, "mean_token_accuracy": 0.18847307711839675, "num_tokens": 23644249.0, "step": 13635 }, { "entropy": 5.484790658950805, "epoch": 1.0612332231083448, "grad_norm": 1.0703125, "learning_rate": 0.0004891804463972354, "loss": 5.1008, "mean_token_accuracy": 0.18955399692058564, "num_tokens": 23652438.0, "step": 13640 }, { "entropy": 5.528585386276245, "epoch": 1.0616222524800623, "grad_norm": 1.109375, "learning_rate": 0.0004891719535982974, "loss": 5.014, "mean_token_accuracy": 0.1927129179239273, "num_tokens": 23660238.0, "step": 13645 }, { "entropy": 5.534489345550537, "epoch": 1.0620112818517797, "grad_norm": 1.1015625, "learning_rate": 0.0004891634575496408, "loss": 5.1427, "mean_token_accuracy": 0.19337467849254608, "num_tokens": 23669213.0, "step": 13650 }, { "entropy": 5.502006912231446, "epoch": 1.0624003112234974, "grad_norm": 1.0625, "learning_rate": 0.0004891549582513946, "loss": 5.2033, "mean_token_accuracy": 0.18002655804157258, "num_tokens": 23677941.0, "step": 13655 }, { "entropy": 5.54436297416687, "epoch": 1.062789340595215, "grad_norm": 1.4375, "learning_rate": 0.000489146455703688, "loss": 5.0857, "mean_token_accuracy": 0.195508873462677, "num_tokens": 23686407.0, "step": 13660 }, { "entropy": 5.571394634246826, "epoch": 1.0631783699669326, "grad_norm": 1.1875, "learning_rate": 0.0004891379499066495, "loss": 4.9981, "mean_token_accuracy": 0.19812499433755876, "num_tokens": 23694434.0, "step": 13665 }, { "entropy": 5.545417451858521, "epoch": 1.06356739933865, "grad_norm": 1.03125, "learning_rate": 0.0004891294408604087, "loss": 5.1021, "mean_token_accuracy": 0.19098694175481795, "num_tokens": 23702949.0, "step": 13670 }, { "entropy": 5.520367050170899, "epoch": 1.0639564287103676, "grad_norm": 1.0625, "learning_rate": 0.0004891209285650942, "loss": 5.0502, "mean_token_accuracy": 0.18994503170251847, "num_tokens": 23710888.0, "step": 13675 }, { "entropy": 5.497464275360107, "epoch": 1.0643454580820852, "grad_norm": 1.0390625, "learning_rate": 0.0004891124130208355, "loss": 5.049, "mean_token_accuracy": 0.20407042056322097, "num_tokens": 23718590.0, "step": 13680 }, { "entropy": 5.479694271087647, "epoch": 1.0647344874538027, "grad_norm": 1.1328125, "learning_rate": 0.0004891038942277618, "loss": 5.0606, "mean_token_accuracy": 0.19078048020601274, "num_tokens": 23726920.0, "step": 13685 }, { "entropy": 5.545700550079346, "epoch": 1.0651235168255204, "grad_norm": 0.99609375, "learning_rate": 0.0004890953721860022, "loss": 5.1105, "mean_token_accuracy": 0.18301011025905609, "num_tokens": 23735984.0, "step": 13690 }, { "entropy": 5.616705989837646, "epoch": 1.065512546197238, "grad_norm": 1.015625, "learning_rate": 0.0004890868468956862, "loss": 5.1735, "mean_token_accuracy": 0.18324353992938996, "num_tokens": 23745144.0, "step": 13695 }, { "entropy": 5.4905389785766605, "epoch": 1.0659015755689554, "grad_norm": 0.99609375, "learning_rate": 0.000489078318356943, "loss": 5.1052, "mean_token_accuracy": 0.18754354119300842, "num_tokens": 23753865.0, "step": 13700 }, { "entropy": 5.539251613616943, "epoch": 1.066290604940673, "grad_norm": 1.046875, "learning_rate": 0.0004890697865699021, "loss": 5.1249, "mean_token_accuracy": 0.18820196390151978, "num_tokens": 23762275.0, "step": 13705 }, { "entropy": 5.540315437316894, "epoch": 1.0666796343123905, "grad_norm": 1.0625, "learning_rate": 0.0004890612515346929, "loss": 5.059, "mean_token_accuracy": 0.1941820800304413, "num_tokens": 23770309.0, "step": 13710 }, { "entropy": 5.520441675186158, "epoch": 1.0670686636841082, "grad_norm": 1.1328125, "learning_rate": 0.0004890527132514448, "loss": 5.0897, "mean_token_accuracy": 0.18692035973072052, "num_tokens": 23778595.0, "step": 13715 }, { "entropy": 5.471551036834716, "epoch": 1.0674576930558257, "grad_norm": 1.0703125, "learning_rate": 0.0004890441717202876, "loss": 5.0251, "mean_token_accuracy": 0.19196586608886718, "num_tokens": 23787122.0, "step": 13720 }, { "entropy": 5.537634372711182, "epoch": 1.0678467224275432, "grad_norm": 1.0390625, "learning_rate": 0.0004890356269413507, "loss": 5.1219, "mean_token_accuracy": 0.18820492923259735, "num_tokens": 23795677.0, "step": 13725 }, { "entropy": 5.52154688835144, "epoch": 1.068235751799261, "grad_norm": 1.0703125, "learning_rate": 0.000489027078914764, "loss": 5.0499, "mean_token_accuracy": 0.19325429648160936, "num_tokens": 23803752.0, "step": 13730 }, { "entropy": 5.475596857070923, "epoch": 1.0686247811709784, "grad_norm": 0.98046875, "learning_rate": 0.0004890185276406569, "loss": 5.0365, "mean_token_accuracy": 0.19341997653245926, "num_tokens": 23812545.0, "step": 13735 }, { "entropy": 5.528506135940551, "epoch": 1.069013810542696, "grad_norm": 1.0546875, "learning_rate": 0.0004890099731191592, "loss": 5.1836, "mean_token_accuracy": 0.18966481387615203, "num_tokens": 23820971.0, "step": 13740 }, { "entropy": 5.569648599624633, "epoch": 1.0694028399144135, "grad_norm": 1.09375, "learning_rate": 0.000489001415350401, "loss": 5.1986, "mean_token_accuracy": 0.18508488982915877, "num_tokens": 23828987.0, "step": 13745 }, { "entropy": 5.510803890228272, "epoch": 1.069791869286131, "grad_norm": 1.046875, "learning_rate": 0.0004889928543345118, "loss": 5.0453, "mean_token_accuracy": 0.19472482055425644, "num_tokens": 23837399.0, "step": 13750 }, { "entropy": 5.562136173248291, "epoch": 1.0701808986578487, "grad_norm": 1.0859375, "learning_rate": 0.0004889842900716217, "loss": 5.1713, "mean_token_accuracy": 0.18426414132118224, "num_tokens": 23846654.0, "step": 13755 }, { "entropy": 5.56233434677124, "epoch": 1.0705699280295662, "grad_norm": 1.1015625, "learning_rate": 0.0004889757225618606, "loss": 5.1318, "mean_token_accuracy": 0.18338098675012587, "num_tokens": 23854961.0, "step": 13760 }, { "entropy": 5.567819309234619, "epoch": 1.0709589574012839, "grad_norm": 1.0625, "learning_rate": 0.0004889671518053584, "loss": 5.1543, "mean_token_accuracy": 0.1829996943473816, "num_tokens": 23864093.0, "step": 13765 }, { "entropy": 5.566392469406128, "epoch": 1.0713479867730014, "grad_norm": 1.078125, "learning_rate": 0.0004889585778022453, "loss": 5.1887, "mean_token_accuracy": 0.19020708352327348, "num_tokens": 23872287.0, "step": 13770 }, { "entropy": 5.534811067581177, "epoch": 1.0717370161447188, "grad_norm": 1.09375, "learning_rate": 0.0004889500005526514, "loss": 5.0455, "mean_token_accuracy": 0.19526924788951874, "num_tokens": 23880747.0, "step": 13775 }, { "entropy": 5.486981439590454, "epoch": 1.0721260455164365, "grad_norm": 1.0625, "learning_rate": 0.0004889414200567067, "loss": 5.1055, "mean_token_accuracy": 0.18355966061353685, "num_tokens": 23889374.0, "step": 13780 }, { "entropy": 5.609719848632812, "epoch": 1.072515074888154, "grad_norm": 1.046875, "learning_rate": 0.0004889328363145415, "loss": 5.234, "mean_token_accuracy": 0.1825035646557808, "num_tokens": 23898090.0, "step": 13785 }, { "entropy": 5.487572479248047, "epoch": 1.0729041042598717, "grad_norm": 1.1328125, "learning_rate": 0.0004889242493262859, "loss": 5.0385, "mean_token_accuracy": 0.19667478054761886, "num_tokens": 23906263.0, "step": 13790 }, { "entropy": 5.541490173339843, "epoch": 1.0732931336315892, "grad_norm": 1.1015625, "learning_rate": 0.0004889156590920704, "loss": 5.0638, "mean_token_accuracy": 0.19306663274765015, "num_tokens": 23914292.0, "step": 13795 }, { "entropy": 5.405428218841553, "epoch": 1.0736821630033067, "grad_norm": 0.97265625, "learning_rate": 0.0004889070656120253, "loss": 5.0645, "mean_token_accuracy": 0.19119308292865753, "num_tokens": 23923264.0, "step": 13800 }, { "entropy": 5.425667190551758, "epoch": 1.0740711923750244, "grad_norm": 0.99609375, "learning_rate": 0.0004888984688862809, "loss": 5.0231, "mean_token_accuracy": 0.19385481625795364, "num_tokens": 23932340.0, "step": 13805 }, { "entropy": 5.6034478664398195, "epoch": 1.0744602217467418, "grad_norm": 1.0546875, "learning_rate": 0.0004888898689149677, "loss": 5.1931, "mean_token_accuracy": 0.18485065251588823, "num_tokens": 23940843.0, "step": 13810 }, { "entropy": 5.498393535614014, "epoch": 1.0748492511184595, "grad_norm": 1.046875, "learning_rate": 0.0004888812656982162, "loss": 5.1886, "mean_token_accuracy": 0.18606418818235398, "num_tokens": 23949127.0, "step": 13815 }, { "entropy": 5.51581072807312, "epoch": 1.075238280490177, "grad_norm": 0.9609375, "learning_rate": 0.0004888726592361569, "loss": 5.2607, "mean_token_accuracy": 0.18363263010978698, "num_tokens": 23958218.0, "step": 13820 }, { "entropy": 5.608628940582276, "epoch": 1.0756273098618945, "grad_norm": 1.0703125, "learning_rate": 0.0004888640495289204, "loss": 5.0433, "mean_token_accuracy": 0.1902975246310234, "num_tokens": 23966330.0, "step": 13825 }, { "entropy": 5.58606538772583, "epoch": 1.0760163392336122, "grad_norm": 0.97265625, "learning_rate": 0.0004888554365766374, "loss": 5.1333, "mean_token_accuracy": 0.19019514918327332, "num_tokens": 23975719.0, "step": 13830 }, { "entropy": 5.454965353012085, "epoch": 1.0764053686053296, "grad_norm": 1.0078125, "learning_rate": 0.0004888468203794385, "loss": 5.056, "mean_token_accuracy": 0.19712476283311844, "num_tokens": 23984115.0, "step": 13835 }, { "entropy": 5.525501108169555, "epoch": 1.0767943979770473, "grad_norm": 0.9765625, "learning_rate": 0.0004888382009374545, "loss": 5.1039, "mean_token_accuracy": 0.18318722695112227, "num_tokens": 23993242.0, "step": 13840 }, { "entropy": 5.502299213409424, "epoch": 1.0771834273487648, "grad_norm": 1.0703125, "learning_rate": 0.0004888295782508161, "loss": 5.1299, "mean_token_accuracy": 0.19632060676813126, "num_tokens": 24001812.0, "step": 13845 }, { "entropy": 5.490289926528931, "epoch": 1.0775724567204823, "grad_norm": 1.0546875, "learning_rate": 0.0004888209523196542, "loss": 5.0503, "mean_token_accuracy": 0.19435303211212157, "num_tokens": 24010112.0, "step": 13850 }, { "entropy": 5.523157596588135, "epoch": 1.0779614860922, "grad_norm": 0.99609375, "learning_rate": 0.0004888123231440997, "loss": 5.1812, "mean_token_accuracy": 0.18417596817016602, "num_tokens": 24018067.0, "step": 13855 }, { "entropy": 5.510356330871582, "epoch": 1.0783505154639175, "grad_norm": 1.0625, "learning_rate": 0.0004888036907242834, "loss": 5.0869, "mean_token_accuracy": 0.18788596242666245, "num_tokens": 24026771.0, "step": 13860 }, { "entropy": 5.510292196273804, "epoch": 1.0787395448356352, "grad_norm": 1.046875, "learning_rate": 0.0004887950550603366, "loss": 5.0882, "mean_token_accuracy": 0.1890761062502861, "num_tokens": 24035322.0, "step": 13865 }, { "entropy": 5.62044243812561, "epoch": 1.0791285742073526, "grad_norm": 1.1015625, "learning_rate": 0.0004887864161523901, "loss": 5.1896, "mean_token_accuracy": 0.1821748599410057, "num_tokens": 24043871.0, "step": 13870 }, { "entropy": 5.522692108154297, "epoch": 1.0795176035790701, "grad_norm": 1.078125, "learning_rate": 0.0004887777740005749, "loss": 5.077, "mean_token_accuracy": 0.1976902648806572, "num_tokens": 24052807.0, "step": 13875 }, { "entropy": 5.466462421417236, "epoch": 1.0799066329507878, "grad_norm": 1.0234375, "learning_rate": 0.0004887691286050224, "loss": 5.0381, "mean_token_accuracy": 0.19799642860889435, "num_tokens": 24061201.0, "step": 13880 }, { "entropy": 5.520284986495971, "epoch": 1.0802956623225053, "grad_norm": 1.109375, "learning_rate": 0.0004887604799658635, "loss": 5.1241, "mean_token_accuracy": 0.19045908153057098, "num_tokens": 24070521.0, "step": 13885 }, { "entropy": 5.5125054836273195, "epoch": 1.080684691694223, "grad_norm": 1.0859375, "learning_rate": 0.0004887518280832295, "loss": 4.9854, "mean_token_accuracy": 0.1991085186600685, "num_tokens": 24079941.0, "step": 13890 }, { "entropy": 5.52765007019043, "epoch": 1.0810737210659405, "grad_norm": 1.0703125, "learning_rate": 0.0004887431729572519, "loss": 5.1109, "mean_token_accuracy": 0.193418750166893, "num_tokens": 24088696.0, "step": 13895 }, { "entropy": 5.477832651138305, "epoch": 1.081462750437658, "grad_norm": 0.953125, "learning_rate": 0.0004887345145880617, "loss": 5.023, "mean_token_accuracy": 0.19367682486772536, "num_tokens": 24098285.0, "step": 13900 }, { "entropy": 5.466937065124512, "epoch": 1.0818517798093756, "grad_norm": 1.09375, "learning_rate": 0.0004887258529757904, "loss": 5.004, "mean_token_accuracy": 0.19981971979141236, "num_tokens": 24107267.0, "step": 13905 }, { "entropy": 5.531937122344971, "epoch": 1.082240809181093, "grad_norm": 1.09375, "learning_rate": 0.0004887171881205696, "loss": 5.084, "mean_token_accuracy": 0.19397533237934111, "num_tokens": 24115755.0, "step": 13910 }, { "entropy": 5.511270236968994, "epoch": 1.0826298385528108, "grad_norm": 1.0703125, "learning_rate": 0.0004887085200225306, "loss": 5.0282, "mean_token_accuracy": 0.198336361348629, "num_tokens": 24124207.0, "step": 13915 }, { "entropy": 5.520353078842163, "epoch": 1.0830188679245283, "grad_norm": 1.140625, "learning_rate": 0.0004886998486818049, "loss": 5.1182, "mean_token_accuracy": 0.18697736114263536, "num_tokens": 24133771.0, "step": 13920 }, { "entropy": 5.495987892150879, "epoch": 1.083407897296246, "grad_norm": 1.0, "learning_rate": 0.0004886911740985242, "loss": 4.9972, "mean_token_accuracy": 0.19933753311634064, "num_tokens": 24142186.0, "step": 13925 }, { "entropy": 5.448917579650879, "epoch": 1.0837969266679635, "grad_norm": 1.0, "learning_rate": 0.00048868249627282, "loss": 5.0206, "mean_token_accuracy": 0.19557779431343078, "num_tokens": 24151073.0, "step": 13930 }, { "entropy": 5.5553436279296875, "epoch": 1.084185956039681, "grad_norm": 1.0078125, "learning_rate": 0.000488673815204824, "loss": 5.12, "mean_token_accuracy": 0.1866609275341034, "num_tokens": 24160092.0, "step": 13935 }, { "entropy": 5.532994174957276, "epoch": 1.0845749854113986, "grad_norm": 1.078125, "learning_rate": 0.0004886651308946681, "loss": 5.0581, "mean_token_accuracy": 0.19020156860351561, "num_tokens": 24167982.0, "step": 13940 }, { "entropy": 5.50459361076355, "epoch": 1.084964014783116, "grad_norm": 1.0859375, "learning_rate": 0.0004886564433424839, "loss": 5.1973, "mean_token_accuracy": 0.18243169486522676, "num_tokens": 24176753.0, "step": 13945 }, { "entropy": 5.500538301467896, "epoch": 1.0853530441548336, "grad_norm": 1.03125, "learning_rate": 0.0004886477525484032, "loss": 5.0944, "mean_token_accuracy": 0.18765871822834015, "num_tokens": 24185923.0, "step": 13950 }, { "entropy": 5.508293962478637, "epoch": 1.0857420735265513, "grad_norm": 1.0703125, "learning_rate": 0.0004886390585125579, "loss": 4.9888, "mean_token_accuracy": 0.19479743093252183, "num_tokens": 24194614.0, "step": 13955 }, { "entropy": 5.638990974426269, "epoch": 1.0861311028982688, "grad_norm": 1.09375, "learning_rate": 0.0004886303612350799, "loss": 5.1832, "mean_token_accuracy": 0.18542629182338716, "num_tokens": 24203623.0, "step": 13960 }, { "entropy": 5.4925895690917965, "epoch": 1.0865201322699864, "grad_norm": 1.0859375, "learning_rate": 0.0004886216607161013, "loss": 5.0056, "mean_token_accuracy": 0.20337249785661698, "num_tokens": 24211936.0, "step": 13965 }, { "entropy": 5.5153755187988285, "epoch": 1.086909161641704, "grad_norm": 1.0625, "learning_rate": 0.0004886129569557538, "loss": 5.025, "mean_token_accuracy": 0.195184426009655, "num_tokens": 24219944.0, "step": 13970 }, { "entropy": 5.510942554473877, "epoch": 1.0872981910134216, "grad_norm": 1.0390625, "learning_rate": 0.0004886042499541699, "loss": 5.1479, "mean_token_accuracy": 0.1842548057436943, "num_tokens": 24228911.0, "step": 13975 }, { "entropy": 5.561695909500122, "epoch": 1.087687220385139, "grad_norm": 1.1171875, "learning_rate": 0.0004885955397114813, "loss": 5.138, "mean_token_accuracy": 0.18774104565382005, "num_tokens": 24237997.0, "step": 13980 }, { "entropy": 5.528283786773682, "epoch": 1.0880762497568566, "grad_norm": 0.97265625, "learning_rate": 0.0004885868262278205, "loss": 5.0966, "mean_token_accuracy": 0.1936579316854477, "num_tokens": 24247099.0, "step": 13985 }, { "entropy": 5.500274753570556, "epoch": 1.0884652791285743, "grad_norm": 1.03125, "learning_rate": 0.0004885781095033195, "loss": 5.0585, "mean_token_accuracy": 0.1931614398956299, "num_tokens": 24255749.0, "step": 13990 }, { "entropy": 5.543603420257568, "epoch": 1.0888543085002917, "grad_norm": 1.0703125, "learning_rate": 0.0004885693895381108, "loss": 5.1707, "mean_token_accuracy": 0.18787231892347336, "num_tokens": 24263891.0, "step": 13995 }, { "entropy": 5.481777477264404, "epoch": 1.0892433378720092, "grad_norm": 0.99609375, "learning_rate": 0.0004885606663323263, "loss": 5.0286, "mean_token_accuracy": 0.19781796932220458, "num_tokens": 24272660.0, "step": 14000 }, { "entropy": 5.522601556777954, "epoch": 1.089632367243727, "grad_norm": 1.078125, "learning_rate": 0.0004885519398860987, "loss": 5.0201, "mean_token_accuracy": 0.2010129302740097, "num_tokens": 24280922.0, "step": 14005 }, { "entropy": 5.49679970741272, "epoch": 1.0900213966154444, "grad_norm": 0.96875, "learning_rate": 0.0004885432101995604, "loss": 5.137, "mean_token_accuracy": 0.18826484829187393, "num_tokens": 24289630.0, "step": 14010 }, { "entropy": 5.424733257293701, "epoch": 1.090410425987162, "grad_norm": 1.0078125, "learning_rate": 0.0004885344772728436, "loss": 5.0751, "mean_token_accuracy": 0.20214839428663253, "num_tokens": 24298310.0, "step": 14015 }, { "entropy": 5.439482021331787, "epoch": 1.0907994553588796, "grad_norm": 1.09375, "learning_rate": 0.0004885257411060812, "loss": 4.9583, "mean_token_accuracy": 0.19974494576454163, "num_tokens": 24306839.0, "step": 14020 }, { "entropy": 5.494307184219361, "epoch": 1.0911884847305973, "grad_norm": 1.1171875, "learning_rate": 0.0004885170016994053, "loss": 5.1582, "mean_token_accuracy": 0.18334333151578902, "num_tokens": 24315571.0, "step": 14025 }, { "entropy": 5.551033544540405, "epoch": 1.0915775141023147, "grad_norm": 1.0625, "learning_rate": 0.0004885082590529489, "loss": 5.1173, "mean_token_accuracy": 0.18992575258016586, "num_tokens": 24325137.0, "step": 14030 }, { "entropy": 5.584569787979126, "epoch": 1.0919665434740322, "grad_norm": 1.015625, "learning_rate": 0.0004884995131668445, "loss": 5.1448, "mean_token_accuracy": 0.18923401534557344, "num_tokens": 24333993.0, "step": 14035 }, { "entropy": 5.587527322769165, "epoch": 1.09235557284575, "grad_norm": 1.0859375, "learning_rate": 0.0004884907640412248, "loss": 5.2145, "mean_token_accuracy": 0.18532725423574448, "num_tokens": 24342488.0, "step": 14040 }, { "entropy": 5.5090875148773195, "epoch": 1.0927446022174674, "grad_norm": 1.09375, "learning_rate": 0.0004884820116762225, "loss": 4.9716, "mean_token_accuracy": 0.20387738943099976, "num_tokens": 24350250.0, "step": 14045 }, { "entropy": 5.491398191452026, "epoch": 1.093133631589185, "grad_norm": 1.046875, "learning_rate": 0.0004884732560719706, "loss": 5.0783, "mean_token_accuracy": 0.1878104627132416, "num_tokens": 24360375.0, "step": 14050 }, { "entropy": 5.509702062606811, "epoch": 1.0935226609609026, "grad_norm": 1.1015625, "learning_rate": 0.0004884644972286017, "loss": 5.1955, "mean_token_accuracy": 0.17976798117160797, "num_tokens": 24368410.0, "step": 14055 }, { "entropy": 5.541974592208862, "epoch": 1.09391169033262, "grad_norm": 1.03125, "learning_rate": 0.0004884557351462488, "loss": 5.0601, "mean_token_accuracy": 0.18985181152820588, "num_tokens": 24377618.0, "step": 14060 }, { "entropy": 5.567614793777466, "epoch": 1.0943007197043377, "grad_norm": 1.046875, "learning_rate": 0.0004884469698250449, "loss": 5.1331, "mean_token_accuracy": 0.19346515238285064, "num_tokens": 24385844.0, "step": 14065 }, { "entropy": 5.542163848876953, "epoch": 1.0946897490760552, "grad_norm": 1.078125, "learning_rate": 0.000488438201265123, "loss": 5.2029, "mean_token_accuracy": 0.18775518834590912, "num_tokens": 24394411.0, "step": 14070 }, { "entropy": 5.553159189224243, "epoch": 1.095078778447773, "grad_norm": 1.1015625, "learning_rate": 0.0004884294294666161, "loss": 5.1294, "mean_token_accuracy": 0.18309123814105988, "num_tokens": 24402791.0, "step": 14075 }, { "entropy": 5.495318078994751, "epoch": 1.0954678078194904, "grad_norm": 1.0625, "learning_rate": 0.0004884206544296573, "loss": 5.0503, "mean_token_accuracy": 0.19533255845308303, "num_tokens": 24411268.0, "step": 14080 }, { "entropy": 5.491215753555298, "epoch": 1.0958568371912079, "grad_norm": 1.0625, "learning_rate": 0.0004884118761543797, "loss": 5.0305, "mean_token_accuracy": 0.19949003010988237, "num_tokens": 24419417.0, "step": 14085 }, { "entropy": 5.546337699890136, "epoch": 1.0962458665629256, "grad_norm": 1.1171875, "learning_rate": 0.0004884030946409167, "loss": 5.0755, "mean_token_accuracy": 0.19459165632724762, "num_tokens": 24427417.0, "step": 14090 }, { "entropy": 5.599336719512939, "epoch": 1.096634895934643, "grad_norm": 1.09375, "learning_rate": 0.0004883943098894013, "loss": 5.0827, "mean_token_accuracy": 0.1938049465417862, "num_tokens": 24436061.0, "step": 14095 }, { "entropy": 5.514726066589356, "epoch": 1.0970239253063607, "grad_norm": 1.109375, "learning_rate": 0.000488385521899967, "loss": 5.1476, "mean_token_accuracy": 0.18713939636945726, "num_tokens": 24444313.0, "step": 14100 }, { "entropy": 5.514452648162842, "epoch": 1.0974129546780782, "grad_norm": 1.0390625, "learning_rate": 0.000488376730672747, "loss": 5.0743, "mean_token_accuracy": 0.18727093935012817, "num_tokens": 24452971.0, "step": 14105 }, { "entropy": 5.551153135299683, "epoch": 1.0978019840497957, "grad_norm": 0.98828125, "learning_rate": 0.0004883679362078746, "loss": 5.0969, "mean_token_accuracy": 0.1925017550587654, "num_tokens": 24461858.0, "step": 14110 }, { "entropy": 5.557491302490234, "epoch": 1.0981910134215134, "grad_norm": 1.078125, "learning_rate": 0.0004883591385054836, "loss": 5.0785, "mean_token_accuracy": 0.192092627286911, "num_tokens": 24470694.0, "step": 14115 }, { "entropy": 5.529823589324951, "epoch": 1.0985800427932308, "grad_norm": 1.0703125, "learning_rate": 0.0004883503375657072, "loss": 5.1721, "mean_token_accuracy": 0.1922311305999756, "num_tokens": 24479668.0, "step": 14120 }, { "entropy": 5.561577653884887, "epoch": 1.0989690721649485, "grad_norm": 1.078125, "learning_rate": 0.0004883415333886789, "loss": 5.1202, "mean_token_accuracy": 0.18860125690698623, "num_tokens": 24487604.0, "step": 14125 }, { "entropy": 5.573582363128662, "epoch": 1.099358101536666, "grad_norm": 0.9609375, "learning_rate": 0.0004883327259745325, "loss": 5.0542, "mean_token_accuracy": 0.19323680102825164, "num_tokens": 24496847.0, "step": 14130 }, { "entropy": 5.596796894073487, "epoch": 1.0997471309083835, "grad_norm": 1.0546875, "learning_rate": 0.0004883239153234015, "loss": 5.2221, "mean_token_accuracy": 0.1843985930085182, "num_tokens": 24505265.0, "step": 14135 }, { "entropy": 5.554666566848755, "epoch": 1.1001361602801012, "grad_norm": 1.046875, "learning_rate": 0.0004883151014354197, "loss": 5.1437, "mean_token_accuracy": 0.18750548511743545, "num_tokens": 24513772.0, "step": 14140 }, { "entropy": 5.519763469696045, "epoch": 1.1005251896518187, "grad_norm": 1.046875, "learning_rate": 0.0004883062843107207, "loss": 4.9834, "mean_token_accuracy": 0.1968691736459732, "num_tokens": 24521882.0, "step": 14145 }, { "entropy": 5.4848716259002686, "epoch": 1.1009142190235364, "grad_norm": 1.0234375, "learning_rate": 0.0004882974639494383, "loss": 5.0219, "mean_token_accuracy": 0.1945369452238083, "num_tokens": 24530876.0, "step": 14150 }, { "entropy": 5.395925569534302, "epoch": 1.1013032483952538, "grad_norm": 1.0078125, "learning_rate": 0.0004882886403517065, "loss": 4.9856, "mean_token_accuracy": 0.19821424633264542, "num_tokens": 24540829.0, "step": 14155 }, { "entropy": 5.50280237197876, "epoch": 1.1016922777669713, "grad_norm": 1.0859375, "learning_rate": 0.0004882798135176589, "loss": 5.088, "mean_token_accuracy": 0.19001563042402267, "num_tokens": 24549310.0, "step": 14160 }, { "entropy": 5.5018387794494625, "epoch": 1.102081307138689, "grad_norm": 0.97265625, "learning_rate": 0.00048827098344742973, "loss": 5.0411, "mean_token_accuracy": 0.19774002879858016, "num_tokens": 24558812.0, "step": 14165 }, { "entropy": 5.435721445083618, "epoch": 1.1024703365104065, "grad_norm": 1.125, "learning_rate": 0.0004882621501411528, "loss": 4.9819, "mean_token_accuracy": 0.19857096523046494, "num_tokens": 24567253.0, "step": 14170 }, { "entropy": 5.537141180038452, "epoch": 1.1028593658821242, "grad_norm": 1.109375, "learning_rate": 0.0004882533135989622, "loss": 5.1763, "mean_token_accuracy": 0.18676015585660935, "num_tokens": 24576090.0, "step": 14175 }, { "entropy": 5.558816766738891, "epoch": 1.1032483952538417, "grad_norm": 1.1015625, "learning_rate": 0.000488244473820992, "loss": 5.1129, "mean_token_accuracy": 0.18958090841770173, "num_tokens": 24584826.0, "step": 14180 }, { "entropy": 5.5177881717681885, "epoch": 1.1036374246255591, "grad_norm": 1.09375, "learning_rate": 0.00048823563080737634, "loss": 5.034, "mean_token_accuracy": 0.19506576508283616, "num_tokens": 24593363.0, "step": 14185 }, { "entropy": 5.480960512161255, "epoch": 1.1040264539972768, "grad_norm": 1.03125, "learning_rate": 0.0004882267845582493, "loss": 5.1193, "mean_token_accuracy": 0.19619522392749786, "num_tokens": 24602391.0, "step": 14190 }, { "entropy": 5.5346204280853275, "epoch": 1.1044154833689943, "grad_norm": 1.0546875, "learning_rate": 0.00048821793507374526, "loss": 5.1115, "mean_token_accuracy": 0.19084785282611846, "num_tokens": 24610986.0, "step": 14195 }, { "entropy": 5.446318674087524, "epoch": 1.104804512740712, "grad_norm": 1.125, "learning_rate": 0.0004882090823539984, "loss": 5.0766, "mean_token_accuracy": 0.19422779530286788, "num_tokens": 24620304.0, "step": 14200 }, { "entropy": 5.562791919708252, "epoch": 1.1051935421124295, "grad_norm": 1.03125, "learning_rate": 0.0004882002263991431, "loss": 5.1226, "mean_token_accuracy": 0.18928630352020265, "num_tokens": 24628867.0, "step": 14205 }, { "entropy": 5.5842968940734865, "epoch": 1.105582571484147, "grad_norm": 1.1328125, "learning_rate": 0.00048819136720931364, "loss": 5.0919, "mean_token_accuracy": 0.19019657671451567, "num_tokens": 24637428.0, "step": 14210 }, { "entropy": 5.553181123733521, "epoch": 1.1059716008558647, "grad_norm": 1.0390625, "learning_rate": 0.00048818250478464457, "loss": 5.0984, "mean_token_accuracy": 0.18389081805944443, "num_tokens": 24646065.0, "step": 14215 }, { "entropy": 5.577740955352783, "epoch": 1.1063606302275821, "grad_norm": 1.0546875, "learning_rate": 0.0004881736391252703, "loss": 5.0819, "mean_token_accuracy": 0.1892639711499214, "num_tokens": 24654118.0, "step": 14220 }, { "entropy": 5.494794130325317, "epoch": 1.1067496595992998, "grad_norm": 1.1015625, "learning_rate": 0.0004881647702313253, "loss": 5.0355, "mean_token_accuracy": 0.1982915908098221, "num_tokens": 24662127.0, "step": 14225 }, { "entropy": 5.41578426361084, "epoch": 1.1071386889710173, "grad_norm": 1.046875, "learning_rate": 0.00048815589810294427, "loss": 5.0136, "mean_token_accuracy": 0.19056423455476762, "num_tokens": 24671116.0, "step": 14230 }, { "entropy": 5.507541561126709, "epoch": 1.1075277183427348, "grad_norm": 1.0234375, "learning_rate": 0.00048814702274026174, "loss": 5.0676, "mean_token_accuracy": 0.1913096383213997, "num_tokens": 24679471.0, "step": 14235 }, { "entropy": 5.562342119216919, "epoch": 1.1079167477144525, "grad_norm": 1.078125, "learning_rate": 0.0004881381441434124, "loss": 5.1544, "mean_token_accuracy": 0.18864265829324722, "num_tokens": 24688575.0, "step": 14240 }, { "entropy": 5.494248342514038, "epoch": 1.10830577708617, "grad_norm": 1.0859375, "learning_rate": 0.000488129262312531, "loss": 5.048, "mean_token_accuracy": 0.2001872718334198, "num_tokens": 24696350.0, "step": 14245 }, { "entropy": 5.573805284500122, "epoch": 1.1086948064578876, "grad_norm": 1.0234375, "learning_rate": 0.00048812037724775217, "loss": 5.1692, "mean_token_accuracy": 0.19086775928735733, "num_tokens": 24705176.0, "step": 14250 }, { "entropy": 5.578050661087036, "epoch": 1.1090838358296051, "grad_norm": 1.0859375, "learning_rate": 0.0004881114889492109, "loss": 5.1382, "mean_token_accuracy": 0.19075945466756822, "num_tokens": 24714067.0, "step": 14255 }, { "entropy": 5.524376583099365, "epoch": 1.1094728652013226, "grad_norm": 1.0234375, "learning_rate": 0.00048810259741704197, "loss": 5.0547, "mean_token_accuracy": 0.19222726076841354, "num_tokens": 24722915.0, "step": 14260 }, { "entropy": 5.53132734298706, "epoch": 1.1098618945730403, "grad_norm": 1.0625, "learning_rate": 0.0004880937026513803, "loss": 5.0924, "mean_token_accuracy": 0.1966213896870613, "num_tokens": 24731359.0, "step": 14265 }, { "entropy": 5.512762928009034, "epoch": 1.1102509239447578, "grad_norm": 1.0390625, "learning_rate": 0.0004880848046523609, "loss": 5.1163, "mean_token_accuracy": 0.18796170353889466, "num_tokens": 24739537.0, "step": 14270 }, { "entropy": 5.535584163665772, "epoch": 1.1106399533164755, "grad_norm": 1.0546875, "learning_rate": 0.00048807590342011875, "loss": 5.1893, "mean_token_accuracy": 0.1853242114186287, "num_tokens": 24749257.0, "step": 14275 }, { "entropy": 5.547473621368408, "epoch": 1.111028982688193, "grad_norm": 1.125, "learning_rate": 0.00048806699895478895, "loss": 5.1087, "mean_token_accuracy": 0.19717821031808852, "num_tokens": 24757715.0, "step": 14280 }, { "entropy": 5.569555854797363, "epoch": 1.1114180120599104, "grad_norm": 1.046875, "learning_rate": 0.0004880580912565065, "loss": 5.0645, "mean_token_accuracy": 0.19177425354719163, "num_tokens": 24765974.0, "step": 14285 }, { "entropy": 5.572491836547852, "epoch": 1.1118070414316281, "grad_norm": 1.03125, "learning_rate": 0.0004880491803254067, "loss": 5.1092, "mean_token_accuracy": 0.1915055364370346, "num_tokens": 24774329.0, "step": 14290 }, { "entropy": 5.581033658981323, "epoch": 1.1121960708033456, "grad_norm": 1.0546875, "learning_rate": 0.0004880402661616246, "loss": 5.1389, "mean_token_accuracy": 0.18946656882762908, "num_tokens": 24782509.0, "step": 14295 }, { "entropy": 5.474265098571777, "epoch": 1.1125851001750633, "grad_norm": 1.0703125, "learning_rate": 0.0004880313487652956, "loss": 5.0067, "mean_token_accuracy": 0.19869548529386521, "num_tokens": 24790871.0, "step": 14300 }, { "entropy": 5.543883848190307, "epoch": 1.1129741295467808, "grad_norm": 1.0703125, "learning_rate": 0.00048802242813655503, "loss": 5.0773, "mean_token_accuracy": 0.19381869584321976, "num_tokens": 24799870.0, "step": 14305 }, { "entropy": 5.465011501312256, "epoch": 1.1133631589184985, "grad_norm": 1.109375, "learning_rate": 0.000488013504275538, "loss": 5.0125, "mean_token_accuracy": 0.19025528579950332, "num_tokens": 24809337.0, "step": 14310 }, { "entropy": 5.431163692474366, "epoch": 1.113752188290216, "grad_norm": 1.0546875, "learning_rate": 0.0004880045771823802, "loss": 5.0057, "mean_token_accuracy": 0.1957953691482544, "num_tokens": 24817724.0, "step": 14315 }, { "entropy": 5.535935258865356, "epoch": 1.1141412176619334, "grad_norm": 1.09375, "learning_rate": 0.00048799564685721695, "loss": 5.1214, "mean_token_accuracy": 0.19439117908477782, "num_tokens": 24826299.0, "step": 14320 }, { "entropy": 5.48707070350647, "epoch": 1.1145302470336511, "grad_norm": 0.96484375, "learning_rate": 0.0004879867133001837, "loss": 5.0793, "mean_token_accuracy": 0.195002917945385, "num_tokens": 24835371.0, "step": 14325 }, { "entropy": 5.538400602340698, "epoch": 1.1149192764053686, "grad_norm": 1.046875, "learning_rate": 0.0004879777765114162, "loss": 5.0665, "mean_token_accuracy": 0.1913912519812584, "num_tokens": 24843230.0, "step": 14330 }, { "entropy": 5.510708332061768, "epoch": 1.115308305777086, "grad_norm": 1.0625, "learning_rate": 0.00048796883649104996, "loss": 5.0203, "mean_token_accuracy": 0.19591016918420792, "num_tokens": 24852100.0, "step": 14335 }, { "entropy": 5.552013158798218, "epoch": 1.1156973351488038, "grad_norm": 0.9921875, "learning_rate": 0.0004879598932392206, "loss": 5.1574, "mean_token_accuracy": 0.18482344895601271, "num_tokens": 24860591.0, "step": 14340 }, { "entropy": 5.51492748260498, "epoch": 1.1160863645205212, "grad_norm": 1.0859375, "learning_rate": 0.00048795094675606364, "loss": 4.9946, "mean_token_accuracy": 0.1979513257741928, "num_tokens": 24868909.0, "step": 14345 }, { "entropy": 5.554353284835815, "epoch": 1.116475393892239, "grad_norm": 1.015625, "learning_rate": 0.0004879419970417152, "loss": 5.1306, "mean_token_accuracy": 0.18582761585712432, "num_tokens": 24877816.0, "step": 14350 }, { "entropy": 5.497121858596802, "epoch": 1.1168644232639564, "grad_norm": 1.1328125, "learning_rate": 0.00048793304409631077, "loss": 4.9659, "mean_token_accuracy": 0.1990955501794815, "num_tokens": 24885871.0, "step": 14355 }, { "entropy": 5.46532301902771, "epoch": 1.117253452635674, "grad_norm": 1.1171875, "learning_rate": 0.0004879240879199863, "loss": 5.1, "mean_token_accuracy": 0.19749603867530824, "num_tokens": 24894138.0, "step": 14360 }, { "entropy": 5.471949625015259, "epoch": 1.1176424820073916, "grad_norm": 1.0234375, "learning_rate": 0.00048791512851287786, "loss": 5.019, "mean_token_accuracy": 0.19310873597860337, "num_tokens": 24903174.0, "step": 14365 }, { "entropy": 5.552790880203247, "epoch": 1.118031511379109, "grad_norm": 1.1171875, "learning_rate": 0.00048790616587512107, "loss": 5.0366, "mean_token_accuracy": 0.19963193088769912, "num_tokens": 24911365.0, "step": 14370 }, { "entropy": 5.463595390319824, "epoch": 1.1184205407508268, "grad_norm": 1.1640625, "learning_rate": 0.0004878972000068521, "loss": 4.9731, "mean_token_accuracy": 0.1970108851790428, "num_tokens": 24919222.0, "step": 14375 }, { "entropy": 5.49577841758728, "epoch": 1.1188095701225442, "grad_norm": 1.03125, "learning_rate": 0.00048788823090820707, "loss": 5.1415, "mean_token_accuracy": 0.1958930015563965, "num_tokens": 24927548.0, "step": 14380 }, { "entropy": 5.601397943496704, "epoch": 1.1191985994942617, "grad_norm": 1.15625, "learning_rate": 0.00048787925857932194, "loss": 5.209, "mean_token_accuracy": 0.18764911592006683, "num_tokens": 24935888.0, "step": 14385 }, { "entropy": 5.59907078742981, "epoch": 1.1195876288659794, "grad_norm": 1.09375, "learning_rate": 0.00048787028302033287, "loss": 5.1799, "mean_token_accuracy": 0.1897195339202881, "num_tokens": 24944799.0, "step": 14390 }, { "entropy": 5.481232452392578, "epoch": 1.1199766582376969, "grad_norm": 1.1015625, "learning_rate": 0.00048786130423137606, "loss": 4.9976, "mean_token_accuracy": 0.198268386721611, "num_tokens": 24952748.0, "step": 14395 }, { "entropy": 5.533926057815552, "epoch": 1.1203656876094146, "grad_norm": 1.0390625, "learning_rate": 0.0004878523222125879, "loss": 5.0722, "mean_token_accuracy": 0.18734532296657563, "num_tokens": 24961293.0, "step": 14400 }, { "entropy": 5.504284906387329, "epoch": 1.120754716981132, "grad_norm": 1.078125, "learning_rate": 0.0004878433369641044, "loss": 5.1328, "mean_token_accuracy": 0.18297696411609649, "num_tokens": 24969192.0, "step": 14405 }, { "entropy": 5.4895867824554445, "epoch": 1.1211437463528497, "grad_norm": 1.125, "learning_rate": 0.0004878343484860621, "loss": 5.0646, "mean_token_accuracy": 0.19968957901000978, "num_tokens": 24976872.0, "step": 14410 }, { "entropy": 5.529160118103027, "epoch": 1.1215327757245672, "grad_norm": 1.0546875, "learning_rate": 0.0004878253567785972, "loss": 5.0849, "mean_token_accuracy": 0.19520883858203888, "num_tokens": 24984706.0, "step": 14415 }, { "entropy": 5.547358560562134, "epoch": 1.1219218050962847, "grad_norm": 1.0703125, "learning_rate": 0.00048781636184184644, "loss": 5.1134, "mean_token_accuracy": 0.19159133732318878, "num_tokens": 24993873.0, "step": 14420 }, { "entropy": 5.509705352783203, "epoch": 1.1223108344680024, "grad_norm": 1.140625, "learning_rate": 0.000487807363675946, "loss": 5.0921, "mean_token_accuracy": 0.1895897015929222, "num_tokens": 25002232.0, "step": 14425 }, { "entropy": 5.584260892868042, "epoch": 1.1226998638397199, "grad_norm": 1.0390625, "learning_rate": 0.0004877983622810326, "loss": 5.061, "mean_token_accuracy": 0.1898328498005867, "num_tokens": 25010530.0, "step": 14430 }, { "entropy": 5.56055703163147, "epoch": 1.1230888932114376, "grad_norm": 1.125, "learning_rate": 0.0004877893576572427, "loss": 5.0864, "mean_token_accuracy": 0.1903713434934616, "num_tokens": 25018740.0, "step": 14435 }, { "entropy": 5.508065414428711, "epoch": 1.123477922583155, "grad_norm": 1.0625, "learning_rate": 0.000487780349804713, "loss": 5.0187, "mean_token_accuracy": 0.1983823448419571, "num_tokens": 25026727.0, "step": 14440 }, { "entropy": 5.44137921333313, "epoch": 1.1238669519548725, "grad_norm": 1.078125, "learning_rate": 0.0004877713387235802, "loss": 4.9846, "mean_token_accuracy": 0.19495244920253754, "num_tokens": 25034496.0, "step": 14445 }, { "entropy": 5.482018232345581, "epoch": 1.1242559813265902, "grad_norm": 1.0703125, "learning_rate": 0.000487762324413981, "loss": 5.0776, "mean_token_accuracy": 0.1911689519882202, "num_tokens": 25043608.0, "step": 14450 }, { "entropy": 5.516173362731934, "epoch": 1.1246450106983077, "grad_norm": 1.0078125, "learning_rate": 0.00048775330687605213, "loss": 4.9934, "mean_token_accuracy": 0.1898203283548355, "num_tokens": 25052674.0, "step": 14455 }, { "entropy": 5.643764448165894, "epoch": 1.1250340400700254, "grad_norm": 1.109375, "learning_rate": 0.0004877442861099305, "loss": 5.1418, "mean_token_accuracy": 0.19075909554958342, "num_tokens": 25060881.0, "step": 14460 }, { "entropy": 5.497550773620605, "epoch": 1.1254230694417429, "grad_norm": 1.125, "learning_rate": 0.0004877352621157529, "loss": 5.0401, "mean_token_accuracy": 0.1964103415608406, "num_tokens": 25069319.0, "step": 14465 }, { "entropy": 5.584656429290772, "epoch": 1.1258120988134603, "grad_norm": 1.0859375, "learning_rate": 0.00048772623489365635, "loss": 5.189, "mean_token_accuracy": 0.18591021746397018, "num_tokens": 25077685.0, "step": 14470 }, { "entropy": 5.548371458053589, "epoch": 1.126201128185178, "grad_norm": 1.0234375, "learning_rate": 0.0004877172044437777, "loss": 5.1805, "mean_token_accuracy": 0.18713123202323914, "num_tokens": 25086978.0, "step": 14475 }, { "entropy": 5.602936792373657, "epoch": 1.1265901575568955, "grad_norm": 1.109375, "learning_rate": 0.00048770817076625416, "loss": 5.1232, "mean_token_accuracy": 0.1916776955127716, "num_tokens": 25095656.0, "step": 14480 }, { "entropy": 5.568920135498047, "epoch": 1.126979186928613, "grad_norm": 1.0859375, "learning_rate": 0.00048769913386122253, "loss": 5.0632, "mean_token_accuracy": 0.19699035584926605, "num_tokens": 25104458.0, "step": 14485 }, { "entropy": 5.4849803924560545, "epoch": 1.1273682163003307, "grad_norm": 1.078125, "learning_rate": 0.0004876900937288202, "loss": 5.0457, "mean_token_accuracy": 0.19261066913604735, "num_tokens": 25112302.0, "step": 14490 }, { "entropy": 5.535676288604736, "epoch": 1.1277572456720482, "grad_norm": 1.0625, "learning_rate": 0.00048768105036918426, "loss": 5.0762, "mean_token_accuracy": 0.19813272356987, "num_tokens": 25120463.0, "step": 14495 }, { "entropy": 5.435155057907105, "epoch": 1.1281462750437659, "grad_norm": 1.0234375, "learning_rate": 0.00048767200378245187, "loss": 5.077, "mean_token_accuracy": 0.18878049105405809, "num_tokens": 25128866.0, "step": 14500 }, { "entropy": 5.489331007003784, "epoch": 1.1285353044154833, "grad_norm": 1.1171875, "learning_rate": 0.00048766295396876025, "loss": 5.0897, "mean_token_accuracy": 0.19369358122348784, "num_tokens": 25136979.0, "step": 14505 }, { "entropy": 5.506005382537841, "epoch": 1.128924333787201, "grad_norm": 1.0234375, "learning_rate": 0.00048765390092824683, "loss": 4.9885, "mean_token_accuracy": 0.19709485918283462, "num_tokens": 25145901.0, "step": 14510 }, { "entropy": 5.545856523513794, "epoch": 1.1293133631589185, "grad_norm": 1.140625, "learning_rate": 0.000487644844661049, "loss": 5.04, "mean_token_accuracy": 0.1975775897502899, "num_tokens": 25155203.0, "step": 14515 }, { "entropy": 5.4466136455535885, "epoch": 1.129702392530636, "grad_norm": 1.0, "learning_rate": 0.000487635785167304, "loss": 5.0024, "mean_token_accuracy": 0.19326263815164565, "num_tokens": 25163529.0, "step": 14520 }, { "entropy": 5.4899390697479244, "epoch": 1.1300914219023537, "grad_norm": 1.0, "learning_rate": 0.00048762672244714953, "loss": 5.1353, "mean_token_accuracy": 0.1813514217734337, "num_tokens": 25172970.0, "step": 14525 }, { "entropy": 5.57536768913269, "epoch": 1.1304804512740712, "grad_norm": 1.1171875, "learning_rate": 0.0004876176565007229, "loss": 5.1238, "mean_token_accuracy": 0.18822799026966094, "num_tokens": 25182244.0, "step": 14530 }, { "entropy": 5.6030515193939205, "epoch": 1.1308694806457888, "grad_norm": 1.0859375, "learning_rate": 0.00048760858732816174, "loss": 5.1514, "mean_token_accuracy": 0.1858677849173546, "num_tokens": 25191589.0, "step": 14535 }, { "entropy": 5.468666648864746, "epoch": 1.1312585100175063, "grad_norm": 0.98046875, "learning_rate": 0.0004875995149296037, "loss": 5.0502, "mean_token_accuracy": 0.19213001430034637, "num_tokens": 25200156.0, "step": 14540 }, { "entropy": 5.51993145942688, "epoch": 1.1316475393892238, "grad_norm": 1.015625, "learning_rate": 0.0004875904393051864, "loss": 5.0902, "mean_token_accuracy": 0.19721226543188095, "num_tokens": 25208890.0, "step": 14545 }, { "entropy": 5.481405639648438, "epoch": 1.1320365687609415, "grad_norm": 1.1171875, "learning_rate": 0.0004875813604550476, "loss": 5.0943, "mean_token_accuracy": 0.19486669301986695, "num_tokens": 25218013.0, "step": 14550 }, { "entropy": 5.552138757705689, "epoch": 1.132425598132659, "grad_norm": 1.0625, "learning_rate": 0.00048757227837932494, "loss": 5.0593, "mean_token_accuracy": 0.19654567837715148, "num_tokens": 25226501.0, "step": 14555 }, { "entropy": 5.590053749084473, "epoch": 1.1328146275043767, "grad_norm": 1.0703125, "learning_rate": 0.0004875631930781563, "loss": 5.2439, "mean_token_accuracy": 0.17747534364461898, "num_tokens": 25235731.0, "step": 14560 }, { "entropy": 5.492092895507812, "epoch": 1.1332036568760941, "grad_norm": 1.1015625, "learning_rate": 0.00048755410455167967, "loss": 5.0663, "mean_token_accuracy": 0.1915368616580963, "num_tokens": 25243659.0, "step": 14565 }, { "entropy": 5.49891619682312, "epoch": 1.1335926862478116, "grad_norm": 1.03125, "learning_rate": 0.0004875450128000326, "loss": 5.0712, "mean_token_accuracy": 0.18761184364557265, "num_tokens": 25253013.0, "step": 14570 }, { "entropy": 5.55296835899353, "epoch": 1.1339817156195293, "grad_norm": 0.94921875, "learning_rate": 0.0004875359178233534, "loss": 5.0644, "mean_token_accuracy": 0.1903602510690689, "num_tokens": 25261491.0, "step": 14575 }, { "entropy": 5.390804100036621, "epoch": 1.1343707449912468, "grad_norm": 1.0625, "learning_rate": 0.00048752681962177985, "loss": 4.958, "mean_token_accuracy": 0.20374990552663802, "num_tokens": 25270323.0, "step": 14580 }, { "entropy": 5.497735023498535, "epoch": 1.1347597743629645, "grad_norm": 1.0078125, "learning_rate": 0.00048751771819545013, "loss": 5.0431, "mean_token_accuracy": 0.19499655961990356, "num_tokens": 25280070.0, "step": 14585 }, { "entropy": 5.582213020324707, "epoch": 1.135148803734682, "grad_norm": 1.0625, "learning_rate": 0.00048750861354450236, "loss": 5.1457, "mean_token_accuracy": 0.18367218375205993, "num_tokens": 25288849.0, "step": 14590 }, { "entropy": 5.525808238983155, "epoch": 1.1355378331063994, "grad_norm": 0.97265625, "learning_rate": 0.0004874995056690746, "loss": 5.0434, "mean_token_accuracy": 0.19305911511182786, "num_tokens": 25297198.0, "step": 14595 }, { "entropy": 5.52663221359253, "epoch": 1.1359268624781171, "grad_norm": 1.09375, "learning_rate": 0.000487490394569305, "loss": 5.167, "mean_token_accuracy": 0.19226615279912948, "num_tokens": 25306783.0, "step": 14600 }, { "entropy": 5.5615002632141115, "epoch": 1.1363158918498346, "grad_norm": 0.9921875, "learning_rate": 0.0004874812802453319, "loss": 5.1873, "mean_token_accuracy": 0.18378738462924957, "num_tokens": 25316042.0, "step": 14605 }, { "entropy": 5.561297082901001, "epoch": 1.1367049212215523, "grad_norm": 1.0703125, "learning_rate": 0.0004874721626972936, "loss": 5.1417, "mean_token_accuracy": 0.18660765290260314, "num_tokens": 25324969.0, "step": 14610 }, { "entropy": 5.522599697113037, "epoch": 1.1370939505932698, "grad_norm": 1.015625, "learning_rate": 0.0004874630419253284, "loss": 5.0667, "mean_token_accuracy": 0.1939899817109108, "num_tokens": 25334050.0, "step": 14615 }, { "entropy": 5.497210931777954, "epoch": 1.1374829799649873, "grad_norm": 1.109375, "learning_rate": 0.00048745391792957474, "loss": 5.0218, "mean_token_accuracy": 0.19273800253868104, "num_tokens": 25341517.0, "step": 14620 }, { "entropy": 5.521051263809204, "epoch": 1.137872009336705, "grad_norm": 1.046875, "learning_rate": 0.00048744479071017097, "loss": 5.1982, "mean_token_accuracy": 0.18015148341655732, "num_tokens": 25350252.0, "step": 14625 }, { "entropy": 5.506719064712525, "epoch": 1.1382610387084224, "grad_norm": 1.015625, "learning_rate": 0.0004874356602672556, "loss": 5.0303, "mean_token_accuracy": 0.19943147599697114, "num_tokens": 25359503.0, "step": 14630 }, { "entropy": 5.50998740196228, "epoch": 1.1386500680801401, "grad_norm": 1.1484375, "learning_rate": 0.0004874265266009673, "loss": 5.0482, "mean_token_accuracy": 0.1946001723408699, "num_tokens": 25368253.0, "step": 14635 }, { "entropy": 5.573533153533935, "epoch": 1.1390390974518576, "grad_norm": 1.03125, "learning_rate": 0.0004874173897114445, "loss": 5.1383, "mean_token_accuracy": 0.18823929131031036, "num_tokens": 25376468.0, "step": 14640 }, { "entropy": 5.545216035842896, "epoch": 1.1394281268235753, "grad_norm": 0.9609375, "learning_rate": 0.00048740824959882603, "loss": 5.1117, "mean_token_accuracy": 0.1903836101293564, "num_tokens": 25385760.0, "step": 14645 }, { "entropy": 5.499283361434936, "epoch": 1.1398171561952928, "grad_norm": 1.0859375, "learning_rate": 0.0004873991062632504, "loss": 5.1061, "mean_token_accuracy": 0.19080909192562104, "num_tokens": 25394485.0, "step": 14650 }, { "entropy": 5.566388416290283, "epoch": 1.1402061855670103, "grad_norm": 1.1796875, "learning_rate": 0.00048738995970485635, "loss": 5.0997, "mean_token_accuracy": 0.19277772754430772, "num_tokens": 25403485.0, "step": 14655 }, { "entropy": 5.5904418468475345, "epoch": 1.140595214938728, "grad_norm": 1.0078125, "learning_rate": 0.0004873808099237827, "loss": 5.0684, "mean_token_accuracy": 0.1894974336028099, "num_tokens": 25412254.0, "step": 14660 }, { "entropy": 5.496951055526734, "epoch": 1.1409842443104454, "grad_norm": 1.140625, "learning_rate": 0.0004873716569201684, "loss": 4.962, "mean_token_accuracy": 0.20020188689231871, "num_tokens": 25420353.0, "step": 14665 }, { "entropy": 5.473997735977173, "epoch": 1.141373273682163, "grad_norm": 1.0390625, "learning_rate": 0.00048736250069415213, "loss": 5.2298, "mean_token_accuracy": 0.18009419590234757, "num_tokens": 25429832.0, "step": 14670 }, { "entropy": 5.492134857177734, "epoch": 1.1417623030538806, "grad_norm": 1.03125, "learning_rate": 0.0004873533412458729, "loss": 5.0443, "mean_token_accuracy": 0.1943511724472046, "num_tokens": 25438484.0, "step": 14675 }, { "entropy": 5.558124208450318, "epoch": 1.142151332425598, "grad_norm": 0.96875, "learning_rate": 0.00048734417857546986, "loss": 5.1542, "mean_token_accuracy": 0.1868046596646309, "num_tokens": 25447602.0, "step": 14680 }, { "entropy": 5.526629161834717, "epoch": 1.1425403617973158, "grad_norm": 1.078125, "learning_rate": 0.0004873350126830818, "loss": 4.9571, "mean_token_accuracy": 0.2005312994122505, "num_tokens": 25455904.0, "step": 14685 }, { "entropy": 5.501600980758667, "epoch": 1.1429293911690332, "grad_norm": 1.078125, "learning_rate": 0.0004873258435688479, "loss": 5.1076, "mean_token_accuracy": 0.18971978574991227, "num_tokens": 25464170.0, "step": 14690 }, { "entropy": 5.480167007446289, "epoch": 1.143318420540751, "grad_norm": 1.046875, "learning_rate": 0.0004873166712329073, "loss": 5.0058, "mean_token_accuracy": 0.1964828848838806, "num_tokens": 25472940.0, "step": 14695 }, { "entropy": 5.54087381362915, "epoch": 1.1437074499124684, "grad_norm": 1.1015625, "learning_rate": 0.00048730749567539914, "loss": 5.052, "mean_token_accuracy": 0.19378894716501235, "num_tokens": 25481328.0, "step": 14700 }, { "entropy": 5.533055448532105, "epoch": 1.144096479284186, "grad_norm": 1.1171875, "learning_rate": 0.00048729831689646257, "loss": 5.0665, "mean_token_accuracy": 0.19425686299800873, "num_tokens": 25489547.0, "step": 14705 }, { "entropy": 5.445548486709595, "epoch": 1.1444855086559036, "grad_norm": 0.99609375, "learning_rate": 0.00048728913489623705, "loss": 5.0489, "mean_token_accuracy": 0.19614889919757844, "num_tokens": 25498433.0, "step": 14710 }, { "entropy": 5.532954549789428, "epoch": 1.144874538027621, "grad_norm": 1.0859375, "learning_rate": 0.0004872799496748618, "loss": 5.055, "mean_token_accuracy": 0.19378120601177215, "num_tokens": 25506646.0, "step": 14715 }, { "entropy": 5.468440103530884, "epoch": 1.1452635673993385, "grad_norm": 1.0234375, "learning_rate": 0.0004872707612324761, "loss": 5.001, "mean_token_accuracy": 0.19625376164913177, "num_tokens": 25515431.0, "step": 14720 }, { "entropy": 5.602016973495483, "epoch": 1.1456525967710562, "grad_norm": 1.1171875, "learning_rate": 0.0004872615695692196, "loss": 5.1749, "mean_token_accuracy": 0.18625230491161346, "num_tokens": 25524368.0, "step": 14725 }, { "entropy": 5.612739086151123, "epoch": 1.1460416261427737, "grad_norm": 1.140625, "learning_rate": 0.0004872523746852315, "loss": 5.1667, "mean_token_accuracy": 0.18316102921962737, "num_tokens": 25532694.0, "step": 14730 }, { "entropy": 5.47451639175415, "epoch": 1.1464306555144914, "grad_norm": 1.109375, "learning_rate": 0.00048724317658065146, "loss": 5.1449, "mean_token_accuracy": 0.19039965867996217, "num_tokens": 25541807.0, "step": 14735 }, { "entropy": 5.582694101333618, "epoch": 1.146819684886209, "grad_norm": 1.0625, "learning_rate": 0.00048723397525561916, "loss": 5.1101, "mean_token_accuracy": 0.18608397096395493, "num_tokens": 25549797.0, "step": 14740 }, { "entropy": 5.569544649124145, "epoch": 1.1472087142579266, "grad_norm": 1.0859375, "learning_rate": 0.00048722477071027394, "loss": 5.1297, "mean_token_accuracy": 0.1851296082139015, "num_tokens": 25558373.0, "step": 14745 }, { "entropy": 5.517207479476928, "epoch": 1.147597743629644, "grad_norm": 1.03125, "learning_rate": 0.00048721556294475574, "loss": 5.1073, "mean_token_accuracy": 0.19463250786066055, "num_tokens": 25566844.0, "step": 14750 }, { "entropy": 5.574475383758545, "epoch": 1.1479867730013615, "grad_norm": 1.109375, "learning_rate": 0.00048720635195920403, "loss": 5.1724, "mean_token_accuracy": 0.18665237426757814, "num_tokens": 25575074.0, "step": 14755 }, { "entropy": 5.53858208656311, "epoch": 1.1483758023730792, "grad_norm": 1.0546875, "learning_rate": 0.0004871971377537588, "loss": 5.047, "mean_token_accuracy": 0.20292440801858902, "num_tokens": 25584526.0, "step": 14760 }, { "entropy": 5.586027002334594, "epoch": 1.1487648317447967, "grad_norm": 1.0546875, "learning_rate": 0.0004871879203285597, "loss": 5.1472, "mean_token_accuracy": 0.18911695331335068, "num_tokens": 25592669.0, "step": 14765 }, { "entropy": 5.528279781341553, "epoch": 1.1491538611165142, "grad_norm": 1.0234375, "learning_rate": 0.00048717869968374655, "loss": 5.0824, "mean_token_accuracy": 0.18976491838693618, "num_tokens": 25600956.0, "step": 14770 }, { "entropy": 5.5058228969573975, "epoch": 1.1495428904882319, "grad_norm": 1.0234375, "learning_rate": 0.00048716947581945954, "loss": 5.0508, "mean_token_accuracy": 0.1943865403532982, "num_tokens": 25608757.0, "step": 14775 }, { "entropy": 5.53881516456604, "epoch": 1.1499319198599494, "grad_norm": 1.0390625, "learning_rate": 0.0004871602487358383, "loss": 5.103, "mean_token_accuracy": 0.18191706538200378, "num_tokens": 25618122.0, "step": 14780 }, { "entropy": 5.552245855331421, "epoch": 1.150320949231667, "grad_norm": 1.078125, "learning_rate": 0.000487151018433023, "loss": 5.1698, "mean_token_accuracy": 0.19088986963033677, "num_tokens": 25626692.0, "step": 14785 }, { "entropy": 5.565927457809448, "epoch": 1.1507099786033845, "grad_norm": 1.0, "learning_rate": 0.00048714178491115367, "loss": 5.0602, "mean_token_accuracy": 0.1899450972676277, "num_tokens": 25635263.0, "step": 14790 }, { "entropy": 5.527678823471069, "epoch": 1.1510990079751022, "grad_norm": 1.1328125, "learning_rate": 0.00048713254817037046, "loss": 5.0016, "mean_token_accuracy": 0.1933281034231186, "num_tokens": 25643050.0, "step": 14795 }, { "entropy": 5.482155656814575, "epoch": 1.1514880373468197, "grad_norm": 1.1484375, "learning_rate": 0.0004871233082108135, "loss": 4.9746, "mean_token_accuracy": 0.1943673387169838, "num_tokens": 25652294.0, "step": 14800 }, { "entropy": 5.582728528976441, "epoch": 1.1518770667185372, "grad_norm": 0.98828125, "learning_rate": 0.0004871140650326228, "loss": 5.2355, "mean_token_accuracy": 0.18144925087690353, "num_tokens": 25661563.0, "step": 14805 }, { "entropy": 5.558869361877441, "epoch": 1.1522660960902549, "grad_norm": 0.98828125, "learning_rate": 0.0004871048186359389, "loss": 5.1304, "mean_token_accuracy": 0.18788866549730301, "num_tokens": 25670353.0, "step": 14810 }, { "entropy": 5.597156715393067, "epoch": 1.1526551254619724, "grad_norm": 1.1328125, "learning_rate": 0.000487095569020902, "loss": 5.1809, "mean_token_accuracy": 0.18663873076438903, "num_tokens": 25678595.0, "step": 14815 }, { "entropy": 5.47860164642334, "epoch": 1.1530441548336898, "grad_norm": 1.015625, "learning_rate": 0.0004870863161876524, "loss": 4.9699, "mean_token_accuracy": 0.2055928647518158, "num_tokens": 25687901.0, "step": 14820 }, { "entropy": 5.49315299987793, "epoch": 1.1534331842054075, "grad_norm": 1.109375, "learning_rate": 0.0004870770601363305, "loss": 5.034, "mean_token_accuracy": 0.20184279680252076, "num_tokens": 25696600.0, "step": 14825 }, { "entropy": 5.424399566650391, "epoch": 1.153822213577125, "grad_norm": 1.0625, "learning_rate": 0.00048706780086707675, "loss": 4.9585, "mean_token_accuracy": 0.20356038063764573, "num_tokens": 25705633.0, "step": 14830 }, { "entropy": 5.471970176696777, "epoch": 1.1542112429488427, "grad_norm": 1.1328125, "learning_rate": 0.0004870585383800317, "loss": 4.9713, "mean_token_accuracy": 0.2049849361181259, "num_tokens": 25713835.0, "step": 14835 }, { "entropy": 5.5152259349823, "epoch": 1.1546002723205602, "grad_norm": 1.046875, "learning_rate": 0.00048704927267533585, "loss": 5.0316, "mean_token_accuracy": 0.19295763224363327, "num_tokens": 25721867.0, "step": 14840 }, { "entropy": 5.422769975662232, "epoch": 1.1549893016922779, "grad_norm": 1.046875, "learning_rate": 0.00048704000375312975, "loss": 5.1142, "mean_token_accuracy": 0.18979655355215072, "num_tokens": 25730221.0, "step": 14845 }, { "entropy": 5.514937686920166, "epoch": 1.1553783310639953, "grad_norm": 1.0390625, "learning_rate": 0.00048703073161355414, "loss": 5.0669, "mean_token_accuracy": 0.19476206749677658, "num_tokens": 25738427.0, "step": 14850 }, { "entropy": 5.5138355731964115, "epoch": 1.1557673604357128, "grad_norm": 1.0703125, "learning_rate": 0.0004870214562567497, "loss": 5.0396, "mean_token_accuracy": 0.19730647951364516, "num_tokens": 25746965.0, "step": 14855 }, { "entropy": 5.502241230010986, "epoch": 1.1561563898074305, "grad_norm": 1.125, "learning_rate": 0.000487012177682857, "loss": 5.0741, "mean_token_accuracy": 0.19906560480594634, "num_tokens": 25754999.0, "step": 14860 }, { "entropy": 5.539675855636597, "epoch": 1.156545419179148, "grad_norm": 1.0234375, "learning_rate": 0.0004870028958920171, "loss": 5.0965, "mean_token_accuracy": 0.18872542530298234, "num_tokens": 25763557.0, "step": 14865 }, { "entropy": 5.513170003890991, "epoch": 1.1569344485508655, "grad_norm": 1.0703125, "learning_rate": 0.0004869936108843706, "loss": 5.1025, "mean_token_accuracy": 0.19070142805576323, "num_tokens": 25772967.0, "step": 14870 }, { "entropy": 5.561624383926391, "epoch": 1.1573234779225832, "grad_norm": 0.94921875, "learning_rate": 0.00048698432266005854, "loss": 5.1983, "mean_token_accuracy": 0.18754016906023024, "num_tokens": 25783570.0, "step": 14875 }, { "entropy": 5.514008665084839, "epoch": 1.1577125072943006, "grad_norm": 1.0, "learning_rate": 0.0004869750312192217, "loss": 5.0639, "mean_token_accuracy": 0.1927780479192734, "num_tokens": 25793079.0, "step": 14880 }, { "entropy": 5.484844064712524, "epoch": 1.1581015366660183, "grad_norm": 1.046875, "learning_rate": 0.00048696573656200123, "loss": 4.9838, "mean_token_accuracy": 0.1981871247291565, "num_tokens": 25801821.0, "step": 14885 }, { "entropy": 5.407988882064819, "epoch": 1.1584905660377358, "grad_norm": 1.046875, "learning_rate": 0.00048695643868853806, "loss": 4.9721, "mean_token_accuracy": 0.19894556999206542, "num_tokens": 25810240.0, "step": 14890 }, { "entropy": 5.535338926315307, "epoch": 1.1588795954094535, "grad_norm": 1.140625, "learning_rate": 0.0004869471375989733, "loss": 5.0182, "mean_token_accuracy": 0.19438907653093337, "num_tokens": 25818058.0, "step": 14895 }, { "entropy": 5.511289024353028, "epoch": 1.159268624781171, "grad_norm": 1.015625, "learning_rate": 0.0004869378332934481, "loss": 5.0931, "mean_token_accuracy": 0.19097632467746734, "num_tokens": 25827529.0, "step": 14900 }, { "entropy": 5.558517074584961, "epoch": 1.1596576541528885, "grad_norm": 1.0390625, "learning_rate": 0.00048692852577210356, "loss": 5.1786, "mean_token_accuracy": 0.19371974021196364, "num_tokens": 25835765.0, "step": 14905 }, { "entropy": 5.466887092590332, "epoch": 1.1600466835246062, "grad_norm": 0.98828125, "learning_rate": 0.000486919215035081, "loss": 4.9638, "mean_token_accuracy": 0.20165580362081528, "num_tokens": 25844402.0, "step": 14910 }, { "entropy": 5.449689102172852, "epoch": 1.1604357128963236, "grad_norm": 1.0546875, "learning_rate": 0.0004869099010825217, "loss": 5.0133, "mean_token_accuracy": 0.1969584733247757, "num_tokens": 25853392.0, "step": 14915 }, { "entropy": 5.506316709518432, "epoch": 1.1608247422680413, "grad_norm": 1.109375, "learning_rate": 0.00048690058391456684, "loss": 5.1119, "mean_token_accuracy": 0.1921757459640503, "num_tokens": 25861274.0, "step": 14920 }, { "entropy": 5.465091943740845, "epoch": 1.1612137716397588, "grad_norm": 1.109375, "learning_rate": 0.0004868912635313579, "loss": 5.017, "mean_token_accuracy": 0.19121111631393434, "num_tokens": 25869570.0, "step": 14925 }, { "entropy": 5.492658567428589, "epoch": 1.1616028010114763, "grad_norm": 1.078125, "learning_rate": 0.0004868819399330364, "loss": 5.0609, "mean_token_accuracy": 0.20260507315397264, "num_tokens": 25877907.0, "step": 14930 }, { "entropy": 5.486486148834229, "epoch": 1.161991830383194, "grad_norm": 1.03125, "learning_rate": 0.0004868726131197436, "loss": 5.093, "mean_token_accuracy": 0.18671614676713943, "num_tokens": 25885817.0, "step": 14935 }, { "entropy": 5.486477613449097, "epoch": 1.1623808597549115, "grad_norm": 1.03125, "learning_rate": 0.0004868632830916212, "loss": 5.0899, "mean_token_accuracy": 0.19345428049564362, "num_tokens": 25894444.0, "step": 14940 }, { "entropy": 5.553924131393432, "epoch": 1.1627698891266292, "grad_norm": 1.09375, "learning_rate": 0.0004868539498488106, "loss": 5.1406, "mean_token_accuracy": 0.19124075025320053, "num_tokens": 25904116.0, "step": 14945 }, { "entropy": 5.657451200485229, "epoch": 1.1631589184983466, "grad_norm": 1.09375, "learning_rate": 0.0004868446133914536, "loss": 5.2665, "mean_token_accuracy": 0.18250771909952163, "num_tokens": 25913889.0, "step": 14950 }, { "entropy": 5.574344539642334, "epoch": 1.163547947870064, "grad_norm": 1.046875, "learning_rate": 0.00048683527371969185, "loss": 5.144, "mean_token_accuracy": 0.18110618591308594, "num_tokens": 25922674.0, "step": 14955 }, { "entropy": 5.468374824523925, "epoch": 1.1639369772417818, "grad_norm": 1.0234375, "learning_rate": 0.00048682593083366685, "loss": 5.0135, "mean_token_accuracy": 0.2038408786058426, "num_tokens": 25930919.0, "step": 14960 }, { "entropy": 5.515384340286255, "epoch": 1.1643260066134993, "grad_norm": 1.0625, "learning_rate": 0.00048681658473352055, "loss": 5.1198, "mean_token_accuracy": 0.19111277908086777, "num_tokens": 25939199.0, "step": 14965 }, { "entropy": 5.570595979690552, "epoch": 1.164715035985217, "grad_norm": 1.0078125, "learning_rate": 0.0004868072354193947, "loss": 5.1304, "mean_token_accuracy": 0.19237570762634276, "num_tokens": 25947990.0, "step": 14970 }, { "entropy": 5.534336185455322, "epoch": 1.1651040653569344, "grad_norm": 1.0390625, "learning_rate": 0.0004867978828914312, "loss": 5.0639, "mean_token_accuracy": 0.19478816539049149, "num_tokens": 25956479.0, "step": 14975 }, { "entropy": 5.478084421157837, "epoch": 1.165493094728652, "grad_norm": 1.03125, "learning_rate": 0.0004867885271497719, "loss": 5.0911, "mean_token_accuracy": 0.19069902449846268, "num_tokens": 25965487.0, "step": 14980 }, { "entropy": 5.547683763504028, "epoch": 1.1658821241003696, "grad_norm": 1.09375, "learning_rate": 0.0004867791681945588, "loss": 5.0758, "mean_token_accuracy": 0.19630294144153596, "num_tokens": 25974247.0, "step": 14985 }, { "entropy": 5.5134974956512455, "epoch": 1.166271153472087, "grad_norm": 1.0390625, "learning_rate": 0.00048676980602593395, "loss": 5.0993, "mean_token_accuracy": 0.1907958447933197, "num_tokens": 25983203.0, "step": 14990 }, { "entropy": 5.490906143188477, "epoch": 1.1666601828438048, "grad_norm": 1.03125, "learning_rate": 0.00048676044064403936, "loss": 5.1056, "mean_token_accuracy": 0.18912539929151534, "num_tokens": 25992635.0, "step": 14995 }, { "entropy": 5.538551568984985, "epoch": 1.1670492122155223, "grad_norm": 1.1640625, "learning_rate": 0.0004867510720490171, "loss": 5.1748, "mean_token_accuracy": 0.18411308974027635, "num_tokens": 26001144.0, "step": 15000 }, { "epoch": 1.1670492122155223, "eval_entropy": 5.365386801527829, "eval_loss": 5.178375244140625, "eval_mean_token_accuracy": 0.19709104069789174, "eval_num_tokens": 26001144.0, "eval_runtime": 21.938, "eval_samples_per_second": 1894.335, "eval_steps_per_second": 236.803, "step": 15000 }, { "entropy": 5.537917184829712, "epoch": 1.1674382415872397, "grad_norm": 1.0078125, "learning_rate": 0.0004867417002410094, "loss": 5.0497, "mean_token_accuracy": 0.19973308145999907, "num_tokens": 26009669.0, "step": 15005 }, { "entropy": 5.536905145645141, "epoch": 1.1678272709589574, "grad_norm": 1.125, "learning_rate": 0.00048673232522015845, "loss": 5.0723, "mean_token_accuracy": 0.1951049044728279, "num_tokens": 26017909.0, "step": 15010 }, { "entropy": 5.55702805519104, "epoch": 1.168216300330675, "grad_norm": 1.0703125, "learning_rate": 0.0004867229469866064, "loss": 5.0691, "mean_token_accuracy": 0.19209877103567125, "num_tokens": 26026417.0, "step": 15015 }, { "entropy": 5.510050106048584, "epoch": 1.1686053297023926, "grad_norm": 1.0703125, "learning_rate": 0.0004867135655404956, "loss": 5.1152, "mean_token_accuracy": 0.18961258977651596, "num_tokens": 26034879.0, "step": 15020 }, { "entropy": 5.583929824829101, "epoch": 1.16899435907411, "grad_norm": 1.0546875, "learning_rate": 0.00048670418088196844, "loss": 5.2206, "mean_token_accuracy": 0.18888526111841203, "num_tokens": 26044106.0, "step": 15025 }, { "entropy": 5.58198127746582, "epoch": 1.1693833884458276, "grad_norm": 1.0546875, "learning_rate": 0.0004866947930111674, "loss": 5.157, "mean_token_accuracy": 0.18726833760738373, "num_tokens": 26052338.0, "step": 15030 }, { "entropy": 5.584809017181397, "epoch": 1.1697724178175453, "grad_norm": 1.015625, "learning_rate": 0.00048668540192823467, "loss": 5.1519, "mean_token_accuracy": 0.1888921156525612, "num_tokens": 26061086.0, "step": 15035 }, { "entropy": 5.526157283782959, "epoch": 1.1701614471892627, "grad_norm": 1.046875, "learning_rate": 0.000486676007633313, "loss": 5.0437, "mean_token_accuracy": 0.19405822455883026, "num_tokens": 26070398.0, "step": 15040 }, { "entropy": 5.500879287719727, "epoch": 1.1705504765609804, "grad_norm": 1.0703125, "learning_rate": 0.0004866666101265448, "loss": 5.0459, "mean_token_accuracy": 0.19007622748613356, "num_tokens": 26078965.0, "step": 15045 }, { "entropy": 5.444583702087402, "epoch": 1.170939505932698, "grad_norm": 1.109375, "learning_rate": 0.00048665720940807274, "loss": 5.1299, "mean_token_accuracy": 0.18771238178014754, "num_tokens": 26087775.0, "step": 15050 }, { "entropy": 5.535777473449707, "epoch": 1.1713285353044154, "grad_norm": 1.0703125, "learning_rate": 0.00048664780547803935, "loss": 5.0371, "mean_token_accuracy": 0.19582536965608596, "num_tokens": 26096773.0, "step": 15055 }, { "entropy": 5.559192276000976, "epoch": 1.171717564676133, "grad_norm": 1.15625, "learning_rate": 0.0004866383983365873, "loss": 5.2004, "mean_token_accuracy": 0.18374485224485398, "num_tokens": 26105446.0, "step": 15060 }, { "entropy": 5.538025379180908, "epoch": 1.1721065940478506, "grad_norm": 1.0390625, "learning_rate": 0.00048662898798385956, "loss": 5.0876, "mean_token_accuracy": 0.1946607992053032, "num_tokens": 26114251.0, "step": 15065 }, { "entropy": 5.644707250595093, "epoch": 1.1724956234195683, "grad_norm": 1.0390625, "learning_rate": 0.00048661957441999875, "loss": 5.2213, "mean_token_accuracy": 0.18250214159488679, "num_tokens": 26123033.0, "step": 15070 }, { "entropy": 5.562620782852173, "epoch": 1.1728846527912857, "grad_norm": 1.0625, "learning_rate": 0.00048661015764514765, "loss": 5.0005, "mean_token_accuracy": 0.19505824893712997, "num_tokens": 26131729.0, "step": 15075 }, { "entropy": 5.584011459350586, "epoch": 1.1732736821630034, "grad_norm": 1.078125, "learning_rate": 0.00048660073765944927, "loss": 5.1383, "mean_token_accuracy": 0.18596526980400085, "num_tokens": 26140056.0, "step": 15080 }, { "entropy": 5.530083894729614, "epoch": 1.173662711534721, "grad_norm": 1.125, "learning_rate": 0.0004865913144630465, "loss": 5.1489, "mean_token_accuracy": 0.1988367572426796, "num_tokens": 26148947.0, "step": 15085 }, { "entropy": 5.582390546798706, "epoch": 1.1740517409064384, "grad_norm": 1.1484375, "learning_rate": 0.00048658188805608227, "loss": 5.1336, "mean_token_accuracy": 0.1842094600200653, "num_tokens": 26157485.0, "step": 15090 }, { "entropy": 5.547963809967041, "epoch": 1.174440770278156, "grad_norm": 1.0625, "learning_rate": 0.0004865724584386998, "loss": 5.0809, "mean_token_accuracy": 0.18905287683010102, "num_tokens": 26166554.0, "step": 15095 }, { "entropy": 5.55906229019165, "epoch": 1.1748297996498736, "grad_norm": 1.1015625, "learning_rate": 0.0004865630256110418, "loss": 5.0248, "mean_token_accuracy": 0.18985276073217391, "num_tokens": 26174398.0, "step": 15100 }, { "entropy": 5.498431825637818, "epoch": 1.175218829021591, "grad_norm": 1.03125, "learning_rate": 0.00048655358957325174, "loss": 5.0237, "mean_token_accuracy": 0.20197213143110276, "num_tokens": 26182885.0, "step": 15105 }, { "entropy": 5.477062559127807, "epoch": 1.1756078583933087, "grad_norm": 0.99609375, "learning_rate": 0.00048654415032547277, "loss": 5.0206, "mean_token_accuracy": 0.19032207876443863, "num_tokens": 26191400.0, "step": 15110 }, { "entropy": 5.50479154586792, "epoch": 1.1759968877650262, "grad_norm": 1.09375, "learning_rate": 0.00048653470786784794, "loss": 4.9706, "mean_token_accuracy": 0.20039502680301666, "num_tokens": 26200149.0, "step": 15115 }, { "entropy": 5.536980056762696, "epoch": 1.176385917136744, "grad_norm": 1.109375, "learning_rate": 0.0004865252622005206, "loss": 5.0632, "mean_token_accuracy": 0.19969607293605804, "num_tokens": 26209069.0, "step": 15120 }, { "entropy": 5.527573442459106, "epoch": 1.1767749465084614, "grad_norm": 1.140625, "learning_rate": 0.00048651581332363405, "loss": 5.1636, "mean_token_accuracy": 0.18913728147745132, "num_tokens": 26217740.0, "step": 15125 }, { "entropy": 5.466390323638916, "epoch": 1.177163975880179, "grad_norm": 1.0234375, "learning_rate": 0.00048650636123733176, "loss": 5.0123, "mean_token_accuracy": 0.19546746760606765, "num_tokens": 26226744.0, "step": 15130 }, { "entropy": 5.469076633453369, "epoch": 1.1775530052518965, "grad_norm": 1.1015625, "learning_rate": 0.0004864969059417571, "loss": 5.1015, "mean_token_accuracy": 0.19212812334299087, "num_tokens": 26234510.0, "step": 15135 }, { "entropy": 5.4968016147613525, "epoch": 1.177942034623614, "grad_norm": 1.8203125, "learning_rate": 0.0004864874474370534, "loss": 5.0646, "mean_token_accuracy": 0.20273134410381316, "num_tokens": 26244394.0, "step": 15140 }, { "entropy": 5.546889877319336, "epoch": 1.1783310639953317, "grad_norm": 1.09375, "learning_rate": 0.00048647798572336445, "loss": 4.9643, "mean_token_accuracy": 0.20582231432199477, "num_tokens": 26252562.0, "step": 15145 }, { "entropy": 5.591189289093018, "epoch": 1.1787200933670492, "grad_norm": 1.109375, "learning_rate": 0.00048646852080083355, "loss": 5.1621, "mean_token_accuracy": 0.18658907413482667, "num_tokens": 26261427.0, "step": 15150 }, { "entropy": 5.502444267272949, "epoch": 1.1791091227387667, "grad_norm": 1.046875, "learning_rate": 0.0004864590526696045, "loss": 5.1638, "mean_token_accuracy": 0.18148885369300843, "num_tokens": 26269714.0, "step": 15155 }, { "entropy": 5.547440719604492, "epoch": 1.1794981521104844, "grad_norm": 0.98828125, "learning_rate": 0.00048644958132982094, "loss": 5.1449, "mean_token_accuracy": 0.18680790960788726, "num_tokens": 26278846.0, "step": 15160 }, { "entropy": 5.514695453643799, "epoch": 1.1798871814822018, "grad_norm": 0.99609375, "learning_rate": 0.00048644010678162644, "loss": 5.0518, "mean_token_accuracy": 0.1944452002644539, "num_tokens": 26287564.0, "step": 15165 }, { "entropy": 5.552087593078613, "epoch": 1.1802762108539195, "grad_norm": 1.0546875, "learning_rate": 0.0004864306290251649, "loss": 5.1358, "mean_token_accuracy": 0.19395565539598464, "num_tokens": 26296204.0, "step": 15170 }, { "entropy": 5.529143190383911, "epoch": 1.180665240225637, "grad_norm": 1.09375, "learning_rate": 0.00048642114806058014, "loss": 5.0588, "mean_token_accuracy": 0.19301970005035402, "num_tokens": 26304697.0, "step": 15175 }, { "entropy": 5.452383518218994, "epoch": 1.1810542695973547, "grad_norm": 1.0703125, "learning_rate": 0.0004864116638880159, "loss": 5.0586, "mean_token_accuracy": 0.18893171548843385, "num_tokens": 26313670.0, "step": 15180 }, { "entropy": 5.483880567550659, "epoch": 1.1814432989690722, "grad_norm": 1.078125, "learning_rate": 0.0004864021765076162, "loss": 5.0416, "mean_token_accuracy": 0.19663384705781936, "num_tokens": 26322080.0, "step": 15185 }, { "entropy": 5.567835092544556, "epoch": 1.1818323283407897, "grad_norm": 1.1015625, "learning_rate": 0.00048639268591952494, "loss": 5.1124, "mean_token_accuracy": 0.18932854533195495, "num_tokens": 26330034.0, "step": 15190 }, { "entropy": 5.3948451519012455, "epoch": 1.1822213577125074, "grad_norm": 1.0234375, "learning_rate": 0.00048638319212388614, "loss": 4.9396, "mean_token_accuracy": 0.19961443394422532, "num_tokens": 26338126.0, "step": 15195 }, { "entropy": 5.509631872177124, "epoch": 1.1826103870842248, "grad_norm": 1.1328125, "learning_rate": 0.0004863736951208438, "loss": 5.0715, "mean_token_accuracy": 0.19103592336177827, "num_tokens": 26347005.0, "step": 15200 }, { "entropy": 5.58599328994751, "epoch": 1.1829994164559423, "grad_norm": 1.0859375, "learning_rate": 0.00048636419491054217, "loss": 5.172, "mean_token_accuracy": 0.1891467198729515, "num_tokens": 26356165.0, "step": 15205 }, { "entropy": 5.588860654830933, "epoch": 1.18338844582766, "grad_norm": 1.140625, "learning_rate": 0.0004863546914931252, "loss": 5.0896, "mean_token_accuracy": 0.19238228648900985, "num_tokens": 26363814.0, "step": 15210 }, { "entropy": 5.532528924942016, "epoch": 1.1837774751993775, "grad_norm": 1.1171875, "learning_rate": 0.0004863451848687373, "loss": 5.0145, "mean_token_accuracy": 0.20160799622535705, "num_tokens": 26371943.0, "step": 15215 }, { "entropy": 5.561339330673218, "epoch": 1.1841665045710952, "grad_norm": 0.98046875, "learning_rate": 0.00048633567503752253, "loss": 5.1389, "mean_token_accuracy": 0.18834577202796937, "num_tokens": 26382552.0, "step": 15220 }, { "entropy": 5.519689464569092, "epoch": 1.1845555339428127, "grad_norm": 1.0859375, "learning_rate": 0.0004863261619996253, "loss": 5.0917, "mean_token_accuracy": 0.1896722823381424, "num_tokens": 26391008.0, "step": 15225 }, { "entropy": 5.428038835525513, "epoch": 1.1849445633145304, "grad_norm": 1.0234375, "learning_rate": 0.0004863166457551899, "loss": 4.9085, "mean_token_accuracy": 0.20176288485527039, "num_tokens": 26399236.0, "step": 15230 }, { "entropy": 5.54332127571106, "epoch": 1.1853335926862478, "grad_norm": 1.0859375, "learning_rate": 0.0004863071263043608, "loss": 5.0505, "mean_token_accuracy": 0.1901614934206009, "num_tokens": 26407693.0, "step": 15235 }, { "entropy": 5.595538234710693, "epoch": 1.1857226220579653, "grad_norm": 1.015625, "learning_rate": 0.0004862976036472823, "loss": 5.1512, "mean_token_accuracy": 0.19004150629043579, "num_tokens": 26417082.0, "step": 15240 }, { "entropy": 5.603360319137574, "epoch": 1.186111651429683, "grad_norm": 1.3984375, "learning_rate": 0.00048628807778409907, "loss": 5.0997, "mean_token_accuracy": 0.19141340255737305, "num_tokens": 26426328.0, "step": 15245 }, { "entropy": 5.554902791976929, "epoch": 1.1865006808014005, "grad_norm": 1.125, "learning_rate": 0.0004862785487149555, "loss": 5.1651, "mean_token_accuracy": 0.18587993681430817, "num_tokens": 26435186.0, "step": 15250 }, { "entropy": 5.518285179138184, "epoch": 1.186889710173118, "grad_norm": 1.0546875, "learning_rate": 0.0004862690164399963, "loss": 5.0194, "mean_token_accuracy": 0.19702616333961487, "num_tokens": 26444661.0, "step": 15255 }, { "entropy": 5.4932496547698975, "epoch": 1.1872787395448356, "grad_norm": 1.046875, "learning_rate": 0.00048625948095936593, "loss": 4.9808, "mean_token_accuracy": 0.19817111045122146, "num_tokens": 26453620.0, "step": 15260 }, { "entropy": 5.428113603591919, "epoch": 1.1876677689165531, "grad_norm": 1.0078125, "learning_rate": 0.00048624994227320923, "loss": 4.9083, "mean_token_accuracy": 0.20008229911327363, "num_tokens": 26462327.0, "step": 15265 }, { "entropy": 5.459143352508545, "epoch": 1.1880567982882708, "grad_norm": 1.0703125, "learning_rate": 0.00048624040038167094, "loss": 5.0009, "mean_token_accuracy": 0.19366169422864915, "num_tokens": 26471104.0, "step": 15270 }, { "entropy": 5.554694700241089, "epoch": 1.1884458276599883, "grad_norm": 1.15625, "learning_rate": 0.00048623085528489584, "loss": 5.0244, "mean_token_accuracy": 0.19665573090314864, "num_tokens": 26479263.0, "step": 15275 }, { "entropy": 5.544868469238281, "epoch": 1.188834857031706, "grad_norm": 1.0546875, "learning_rate": 0.00048622130698302863, "loss": 5.1019, "mean_token_accuracy": 0.19141687154769899, "num_tokens": 26488036.0, "step": 15280 }, { "entropy": 5.519224071502686, "epoch": 1.1892238864034235, "grad_norm": 1.078125, "learning_rate": 0.00048621175547621426, "loss": 5.0681, "mean_token_accuracy": 0.20257239490747453, "num_tokens": 26496702.0, "step": 15285 }, { "entropy": 5.553879880905152, "epoch": 1.189612915775141, "grad_norm": 1.0625, "learning_rate": 0.0004862022007645978, "loss": 5.0926, "mean_token_accuracy": 0.1854624256491661, "num_tokens": 26505962.0, "step": 15290 }, { "entropy": 5.586704063415527, "epoch": 1.1900019451468586, "grad_norm": 1.0546875, "learning_rate": 0.00048619264284832403, "loss": 5.2026, "mean_token_accuracy": 0.18470224887132644, "num_tokens": 26515502.0, "step": 15295 }, { "entropy": 5.6221137046813965, "epoch": 1.1903909745185761, "grad_norm": 1.078125, "learning_rate": 0.00048618308172753804, "loss": 5.1306, "mean_token_accuracy": 0.1920813426375389, "num_tokens": 26524425.0, "step": 15300 }, { "entropy": 5.515850067138672, "epoch": 1.1907800038902936, "grad_norm": 1.03125, "learning_rate": 0.0004861735174023849, "loss": 5.1534, "mean_token_accuracy": 0.18629422187805175, "num_tokens": 26533314.0, "step": 15305 }, { "entropy": 5.563751888275147, "epoch": 1.1911690332620113, "grad_norm": 0.96875, "learning_rate": 0.00048616394987300985, "loss": 5.1393, "mean_token_accuracy": 0.18802347928285598, "num_tokens": 26542455.0, "step": 15310 }, { "entropy": 5.596159172058106, "epoch": 1.1915580626337288, "grad_norm": 1.1015625, "learning_rate": 0.0004861543791395579, "loss": 5.0575, "mean_token_accuracy": 0.19191517680883408, "num_tokens": 26551621.0, "step": 15315 }, { "entropy": 5.521759653091431, "epoch": 1.1919470920054465, "grad_norm": 1.140625, "learning_rate": 0.0004861448052021743, "loss": 4.9937, "mean_token_accuracy": 0.20019185543060303, "num_tokens": 26559979.0, "step": 15320 }, { "entropy": 5.505478048324585, "epoch": 1.192336121377164, "grad_norm": 1.046875, "learning_rate": 0.0004861352280610044, "loss": 5.1022, "mean_token_accuracy": 0.18678427040576934, "num_tokens": 26568923.0, "step": 15325 }, { "entropy": 5.520033931732177, "epoch": 1.1927251507488816, "grad_norm": 1.125, "learning_rate": 0.00048612564771619346, "loss": 5.0398, "mean_token_accuracy": 0.1987572655081749, "num_tokens": 26576867.0, "step": 15330 }, { "entropy": 5.546887540817261, "epoch": 1.193114180120599, "grad_norm": 1.0234375, "learning_rate": 0.00048611606416788686, "loss": 5.1638, "mean_token_accuracy": 0.18710995614528655, "num_tokens": 26585418.0, "step": 15335 }, { "entropy": 5.597817707061767, "epoch": 1.1935032094923166, "grad_norm": 1.078125, "learning_rate": 0.00048610647741622996, "loss": 5.1588, "mean_token_accuracy": 0.19065070301294326, "num_tokens": 26594262.0, "step": 15340 }, { "entropy": 5.527783679962158, "epoch": 1.1938922388640343, "grad_norm": 1.1015625, "learning_rate": 0.0004860968874613683, "loss": 5.0428, "mean_token_accuracy": 0.18844302743673325, "num_tokens": 26603086.0, "step": 15345 }, { "entropy": 5.547747945785522, "epoch": 1.1942812682357518, "grad_norm": 1.0625, "learning_rate": 0.0004860872943034474, "loss": 5.112, "mean_token_accuracy": 0.19713467955589295, "num_tokens": 26611622.0, "step": 15350 }, { "entropy": 5.475402450561523, "epoch": 1.1946702976074695, "grad_norm": 1.1484375, "learning_rate": 0.0004860776979426128, "loss": 4.9368, "mean_token_accuracy": 0.20340909212827682, "num_tokens": 26620159.0, "step": 15355 }, { "entropy": 5.583709573745727, "epoch": 1.195059326979187, "grad_norm": 1.0703125, "learning_rate": 0.0004860680983790101, "loss": 5.0618, "mean_token_accuracy": 0.18898301124572753, "num_tokens": 26628640.0, "step": 15360 }, { "entropy": 5.501337957382202, "epoch": 1.1954483563509044, "grad_norm": 1.0234375, "learning_rate": 0.0004860584956127849, "loss": 5.0483, "mean_token_accuracy": 0.1919516459107399, "num_tokens": 26637250.0, "step": 15365 }, { "entropy": 5.527614545822144, "epoch": 1.195837385722622, "grad_norm": 1.1328125, "learning_rate": 0.00048604888964408306, "loss": 5.1172, "mean_token_accuracy": 0.19156016558408737, "num_tokens": 26645199.0, "step": 15370 }, { "entropy": 5.4766936779022215, "epoch": 1.1962264150943396, "grad_norm": 1.046875, "learning_rate": 0.0004860392804730502, "loss": 4.9709, "mean_token_accuracy": 0.1978173866868019, "num_tokens": 26653315.0, "step": 15375 }, { "entropy": 5.450601053237915, "epoch": 1.1966154444660573, "grad_norm": 1.046875, "learning_rate": 0.00048602966809983204, "loss": 5.0117, "mean_token_accuracy": 0.19976484924554824, "num_tokens": 26662063.0, "step": 15380 }, { "entropy": 5.501540803909302, "epoch": 1.1970044738377748, "grad_norm": 1.0234375, "learning_rate": 0.0004860200525245746, "loss": 5.083, "mean_token_accuracy": 0.195105741918087, "num_tokens": 26671097.0, "step": 15385 }, { "entropy": 5.5723248481750485, "epoch": 1.1973935032094922, "grad_norm": 1.046875, "learning_rate": 0.0004860104337474239, "loss": 5.1317, "mean_token_accuracy": 0.1880512699484825, "num_tokens": 26678878.0, "step": 15390 }, { "entropy": 5.546806192398071, "epoch": 1.19778253258121, "grad_norm": 1.0390625, "learning_rate": 0.00048600081176852555, "loss": 5.0961, "mean_token_accuracy": 0.19119182080030442, "num_tokens": 26686743.0, "step": 15395 }, { "entropy": 5.429030323028565, "epoch": 1.1981715619529274, "grad_norm": 1.0625, "learning_rate": 0.00048599118658802575, "loss": 4.9535, "mean_token_accuracy": 0.20244764685630798, "num_tokens": 26695391.0, "step": 15400 }, { "entropy": 5.485673904418945, "epoch": 1.198560591324645, "grad_norm": 1.1953125, "learning_rate": 0.0004859815582060706, "loss": 5.0284, "mean_token_accuracy": 0.1951361984014511, "num_tokens": 26703980.0, "step": 15405 }, { "entropy": 5.5597252368927, "epoch": 1.1989496206963626, "grad_norm": 1.078125, "learning_rate": 0.0004859719266228061, "loss": 5.0748, "mean_token_accuracy": 0.187735615670681, "num_tokens": 26712514.0, "step": 15410 }, { "entropy": 5.5764378070831295, "epoch": 1.19933865006808, "grad_norm": 1.1171875, "learning_rate": 0.0004859622918383784, "loss": 5.0644, "mean_token_accuracy": 0.1921241745352745, "num_tokens": 26720576.0, "step": 15415 }, { "entropy": 5.555357980728149, "epoch": 1.1997276794397977, "grad_norm": 1.1328125, "learning_rate": 0.0004859526538529337, "loss": 5.1977, "mean_token_accuracy": 0.18107503801584243, "num_tokens": 26729319.0, "step": 15420 }, { "entropy": 5.53706202507019, "epoch": 1.2001167088115152, "grad_norm": 1.1640625, "learning_rate": 0.0004859430126666182, "loss": 5.0279, "mean_token_accuracy": 0.19322039633989335, "num_tokens": 26738073.0, "step": 15425 }, { "entropy": 5.540720129013062, "epoch": 1.200505738183233, "grad_norm": 1.0625, "learning_rate": 0.00048593336827957824, "loss": 5.1304, "mean_token_accuracy": 0.19256405979394914, "num_tokens": 26746341.0, "step": 15430 }, { "entropy": 5.464187717437744, "epoch": 1.2008947675549504, "grad_norm": 1.0546875, "learning_rate": 0.00048592372069196024, "loss": 5.0344, "mean_token_accuracy": 0.18831251412630082, "num_tokens": 26754844.0, "step": 15435 }, { "entropy": 5.575746154785156, "epoch": 1.2012837969266679, "grad_norm": 1.078125, "learning_rate": 0.0004859140699039104, "loss": 5.1131, "mean_token_accuracy": 0.1884491980075836, "num_tokens": 26763942.0, "step": 15440 }, { "entropy": 5.471569633483886, "epoch": 1.2016728262983856, "grad_norm": 0.94140625, "learning_rate": 0.00048590441591557526, "loss": 5.0417, "mean_token_accuracy": 0.19693680703639985, "num_tokens": 26773468.0, "step": 15445 }, { "entropy": 5.496414709091186, "epoch": 1.202061855670103, "grad_norm": 1.0546875, "learning_rate": 0.00048589475872710134, "loss": 5.0016, "mean_token_accuracy": 0.19465675503015517, "num_tokens": 26781707.0, "step": 15450 }, { "entropy": 5.543661880493164, "epoch": 1.2024508850418207, "grad_norm": 1.0703125, "learning_rate": 0.0004858850983386351, "loss": 5.1055, "mean_token_accuracy": 0.18679908514022828, "num_tokens": 26789992.0, "step": 15455 }, { "entropy": 5.576060676574707, "epoch": 1.2028399144135382, "grad_norm": 1.0390625, "learning_rate": 0.0004858754347503231, "loss": 5.1474, "mean_token_accuracy": 0.18643400222063064, "num_tokens": 26798959.0, "step": 15460 }, { "entropy": 5.607064580917358, "epoch": 1.203228943785256, "grad_norm": 1.078125, "learning_rate": 0.00048586576796231216, "loss": 5.1323, "mean_token_accuracy": 0.18768735826015473, "num_tokens": 26807498.0, "step": 15465 }, { "entropy": 5.537709760665893, "epoch": 1.2036179731569734, "grad_norm": 1.125, "learning_rate": 0.0004858560979747487, "loss": 5.0805, "mean_token_accuracy": 0.19618216753005982, "num_tokens": 26815931.0, "step": 15470 }, { "entropy": 5.483714389801025, "epoch": 1.2040070025286909, "grad_norm": 1.09375, "learning_rate": 0.00048584642478777967, "loss": 5.0569, "mean_token_accuracy": 0.20317025780677794, "num_tokens": 26824058.0, "step": 15475 }, { "entropy": 5.478203630447387, "epoch": 1.2043960319004086, "grad_norm": 1.03125, "learning_rate": 0.0004858367484015517, "loss": 5.0391, "mean_token_accuracy": 0.19507866501808166, "num_tokens": 26833351.0, "step": 15480 }, { "entropy": 5.526114416122437, "epoch": 1.204785061272126, "grad_norm": 1.1484375, "learning_rate": 0.00048582706881621166, "loss": 5.1005, "mean_token_accuracy": 0.18726721554994583, "num_tokens": 26842263.0, "step": 15485 }, { "entropy": 5.50456919670105, "epoch": 1.2051740906438435, "grad_norm": 1.0390625, "learning_rate": 0.0004858173860319063, "loss": 5.0146, "mean_token_accuracy": 0.20379763692617417, "num_tokens": 26850788.0, "step": 15490 }, { "entropy": 5.468435287475586, "epoch": 1.2055631200155612, "grad_norm": 0.96484375, "learning_rate": 0.00048580770004878277, "loss": 5.0582, "mean_token_accuracy": 0.19138407260179519, "num_tokens": 26859902.0, "step": 15495 }, { "entropy": 5.601291036605835, "epoch": 1.2059521493872787, "grad_norm": 1.09375, "learning_rate": 0.0004857980108669879, "loss": 5.1343, "mean_token_accuracy": 0.18124507814645768, "num_tokens": 26868079.0, "step": 15500 }, { "entropy": 5.554708671569824, "epoch": 1.2063411787589964, "grad_norm": 1.0078125, "learning_rate": 0.00048578831848666875, "loss": 5.1167, "mean_token_accuracy": 0.1846241757273674, "num_tokens": 26877403.0, "step": 15505 }, { "entropy": 5.547872114181518, "epoch": 1.2067302081307139, "grad_norm": 1.0546875, "learning_rate": 0.00048577862290797235, "loss": 5.1269, "mean_token_accuracy": 0.18569187074899673, "num_tokens": 26885858.0, "step": 15510 }, { "entropy": 5.571923780441284, "epoch": 1.2071192375024316, "grad_norm": 1.15625, "learning_rate": 0.00048576892413104586, "loss": 5.092, "mean_token_accuracy": 0.2029923602938652, "num_tokens": 26894525.0, "step": 15515 }, { "entropy": 5.605479574203491, "epoch": 1.207508266874149, "grad_norm": 1.09375, "learning_rate": 0.0004857592221560364, "loss": 5.1117, "mean_token_accuracy": 0.18453886210918427, "num_tokens": 26903197.0, "step": 15520 }, { "entropy": 5.57784481048584, "epoch": 1.2078972962458665, "grad_norm": 1.1171875, "learning_rate": 0.0004857495169830912, "loss": 5.2084, "mean_token_accuracy": 0.18588347136974334, "num_tokens": 26911770.0, "step": 15525 }, { "entropy": 5.5144754409790036, "epoch": 1.2082863256175842, "grad_norm": 1.0625, "learning_rate": 0.0004857398086123575, "loss": 4.9951, "mean_token_accuracy": 0.19654562920331956, "num_tokens": 26920753.0, "step": 15530 }, { "entropy": 5.532224559783936, "epoch": 1.2086753549893017, "grad_norm": 1.015625, "learning_rate": 0.0004857300970439827, "loss": 5.0933, "mean_token_accuracy": 0.18869938999414443, "num_tokens": 26930555.0, "step": 15535 }, { "entropy": 5.505837488174438, "epoch": 1.2090643843610192, "grad_norm": 1.109375, "learning_rate": 0.00048572038227811404, "loss": 5.0564, "mean_token_accuracy": 0.2005390927195549, "num_tokens": 26938841.0, "step": 15540 }, { "entropy": 5.499691152572632, "epoch": 1.2094534137327368, "grad_norm": 1.1015625, "learning_rate": 0.000485710664314899, "loss": 5.1689, "mean_token_accuracy": 0.19040360748767854, "num_tokens": 26947414.0, "step": 15545 }, { "entropy": 5.609728240966797, "epoch": 1.2098424431044543, "grad_norm": 1.15625, "learning_rate": 0.000485700943154485, "loss": 5.1322, "mean_token_accuracy": 0.1889816015958786, "num_tokens": 26955696.0, "step": 15550 }, { "entropy": 5.631604242324829, "epoch": 1.210231472476172, "grad_norm": 1.1015625, "learning_rate": 0.0004856912187970195, "loss": 5.1252, "mean_token_accuracy": 0.18986061960458755, "num_tokens": 26964030.0, "step": 15555 }, { "entropy": 5.497256278991699, "epoch": 1.2106205018478895, "grad_norm": 1.078125, "learning_rate": 0.0004856814912426502, "loss": 5.0743, "mean_token_accuracy": 0.19458989053964615, "num_tokens": 26972825.0, "step": 15560 }, { "entropy": 5.583717012405396, "epoch": 1.2110095312196072, "grad_norm": 1.0390625, "learning_rate": 0.0004856717604915245, "loss": 5.1685, "mean_token_accuracy": 0.18714942783117294, "num_tokens": 26982417.0, "step": 15565 }, { "entropy": 5.6811261653900145, "epoch": 1.2113985605913247, "grad_norm": 1.0390625, "learning_rate": 0.0004856620265437902, "loss": 5.2974, "mean_token_accuracy": 0.17627157568931578, "num_tokens": 26992241.0, "step": 15570 }, { "entropy": 5.633410787582397, "epoch": 1.2117875899630421, "grad_norm": 1.109375, "learning_rate": 0.000485652289399595, "loss": 5.167, "mean_token_accuracy": 0.18984016627073289, "num_tokens": 27000515.0, "step": 15575 }, { "entropy": 5.615796375274658, "epoch": 1.2121766193347598, "grad_norm": 1.0703125, "learning_rate": 0.00048564254905908655, "loss": 5.1906, "mean_token_accuracy": 0.18530738949775696, "num_tokens": 27009727.0, "step": 15580 }, { "entropy": 5.555057764053345, "epoch": 1.2125656487064773, "grad_norm": 0.9921875, "learning_rate": 0.00048563280552241266, "loss": 5.0994, "mean_token_accuracy": 0.18569034039974214, "num_tokens": 27020129.0, "step": 15585 }, { "entropy": 5.597054862976075, "epoch": 1.2129546780781948, "grad_norm": 1.078125, "learning_rate": 0.0004856230587897212, "loss": 5.178, "mean_token_accuracy": 0.18824368715286255, "num_tokens": 27028660.0, "step": 15590 }, { "entropy": 5.535981798171997, "epoch": 1.2133437074499125, "grad_norm": 1.078125, "learning_rate": 0.0004856133088611602, "loss": 5.0289, "mean_token_accuracy": 0.1891512930393219, "num_tokens": 27037168.0, "step": 15595 }, { "entropy": 5.487007713317871, "epoch": 1.21373273682163, "grad_norm": 1.1171875, "learning_rate": 0.0004856035557368773, "loss": 4.9959, "mean_token_accuracy": 0.19277766197919846, "num_tokens": 27045937.0, "step": 15600 }, { "entropy": 5.560944843292236, "epoch": 1.2141217661933477, "grad_norm": 1.1171875, "learning_rate": 0.00048559379941702074, "loss": 5.0557, "mean_token_accuracy": 0.19251652359962462, "num_tokens": 27054187.0, "step": 15605 }, { "entropy": 5.502214622497559, "epoch": 1.2145107955650651, "grad_norm": 1.0703125, "learning_rate": 0.00048558403990173844, "loss": 5.0462, "mean_token_accuracy": 0.19605625718832015, "num_tokens": 27062718.0, "step": 15610 }, { "entropy": 5.513731384277344, "epoch": 1.2148998249367828, "grad_norm": 1.046875, "learning_rate": 0.00048557427719117855, "loss": 5.0986, "mean_token_accuracy": 0.18849898278713226, "num_tokens": 27071946.0, "step": 15615 }, { "entropy": 5.525702619552613, "epoch": 1.2152888543085003, "grad_norm": 1.015625, "learning_rate": 0.0004855645112854891, "loss": 5.1118, "mean_token_accuracy": 0.18231558352708815, "num_tokens": 27080989.0, "step": 15620 }, { "entropy": 5.608476686477661, "epoch": 1.2156778836802178, "grad_norm": 1.0390625, "learning_rate": 0.0004855547421848184, "loss": 5.1626, "mean_token_accuracy": 0.1853901505470276, "num_tokens": 27090073.0, "step": 15625 }, { "entropy": 5.552972936630249, "epoch": 1.2160669130519355, "grad_norm": 1.0859375, "learning_rate": 0.00048554496988931456, "loss": 5.1602, "mean_token_accuracy": 0.1906544968485832, "num_tokens": 27098802.0, "step": 15630 }, { "entropy": 5.499906063079834, "epoch": 1.216455942423653, "grad_norm": 1.109375, "learning_rate": 0.00048553519439912597, "loss": 5.0705, "mean_token_accuracy": 0.18986087292432785, "num_tokens": 27107219.0, "step": 15635 }, { "entropy": 5.488286304473877, "epoch": 1.2168449717953704, "grad_norm": 1.09375, "learning_rate": 0.0004855254157144009, "loss": 5.0561, "mean_token_accuracy": 0.19102613627910614, "num_tokens": 27115836.0, "step": 15640 }, { "entropy": 5.551061010360717, "epoch": 1.2172340011670881, "grad_norm": 1.0390625, "learning_rate": 0.0004855156338352877, "loss": 5.036, "mean_token_accuracy": 0.1913347825407982, "num_tokens": 27125146.0, "step": 15645 }, { "entropy": 5.54945740699768, "epoch": 1.2176230305388056, "grad_norm": 1.0859375, "learning_rate": 0.00048550584876193493, "loss": 5.0708, "mean_token_accuracy": 0.20212605446577073, "num_tokens": 27133371.0, "step": 15650 }, { "entropy": 5.610711336135864, "epoch": 1.2180120599105233, "grad_norm": 1.0546875, "learning_rate": 0.00048549606049449085, "loss": 5.1473, "mean_token_accuracy": 0.18392594307661056, "num_tokens": 27142271.0, "step": 15655 }, { "entropy": 5.514962911605835, "epoch": 1.2184010892822408, "grad_norm": 1.09375, "learning_rate": 0.0004854862690331041, "loss": 5.0235, "mean_token_accuracy": 0.20161230713129044, "num_tokens": 27150455.0, "step": 15660 }, { "entropy": 5.497422552108764, "epoch": 1.2187901186539585, "grad_norm": 1.140625, "learning_rate": 0.00048547647437792327, "loss": 5.1256, "mean_token_accuracy": 0.1872053012251854, "num_tokens": 27159127.0, "step": 15665 }, { "entropy": 5.551613759994507, "epoch": 1.219179148025676, "grad_norm": 1.0625, "learning_rate": 0.000485466676529097, "loss": 5.1076, "mean_token_accuracy": 0.1880350723862648, "num_tokens": 27167909.0, "step": 15670 }, { "entropy": 5.564609670639038, "epoch": 1.2195681773973934, "grad_norm": 1.109375, "learning_rate": 0.00048545687548677373, "loss": 5.0667, "mean_token_accuracy": 0.19004094898700713, "num_tokens": 27177083.0, "step": 15675 }, { "entropy": 5.530086469650269, "epoch": 1.2199572067691111, "grad_norm": 1.1484375, "learning_rate": 0.0004854470712511025, "loss": 5.0334, "mean_token_accuracy": 0.19694966375827788, "num_tokens": 27185465.0, "step": 15680 }, { "entropy": 5.524537897109985, "epoch": 1.2203462361408286, "grad_norm": 1.0703125, "learning_rate": 0.00048543726382223193, "loss": 5.1025, "mean_token_accuracy": 0.18814062625169753, "num_tokens": 27194294.0, "step": 15685 }, { "entropy": 5.486384773254395, "epoch": 1.220735265512546, "grad_norm": 1.0234375, "learning_rate": 0.00048542745320031075, "loss": 5.1097, "mean_token_accuracy": 0.18863716274499892, "num_tokens": 27203949.0, "step": 15690 }, { "entropy": 5.590418434143066, "epoch": 1.2211242948842638, "grad_norm": 1.0625, "learning_rate": 0.00048541763938548795, "loss": 5.1489, "mean_token_accuracy": 0.18752705156803132, "num_tokens": 27213458.0, "step": 15695 }, { "entropy": 5.476040983200074, "epoch": 1.2215133242559812, "grad_norm": 1.046875, "learning_rate": 0.00048540782237791244, "loss": 4.9686, "mean_token_accuracy": 0.2018255189061165, "num_tokens": 27222328.0, "step": 15700 }, { "entropy": 5.500834941864014, "epoch": 1.221902353627699, "grad_norm": 1.0390625, "learning_rate": 0.00048539800217773293, "loss": 5.0282, "mean_token_accuracy": 0.18911173343658447, "num_tokens": 27231016.0, "step": 15705 }, { "entropy": 5.525045108795166, "epoch": 1.2222913829994164, "grad_norm": 1.0078125, "learning_rate": 0.0004853881787850988, "loss": 5.1459, "mean_token_accuracy": 0.197455695271492, "num_tokens": 27239785.0, "step": 15710 }, { "entropy": 5.603106689453125, "epoch": 1.2226804123711341, "grad_norm": 1.046875, "learning_rate": 0.00048537835220015886, "loss": 5.0594, "mean_token_accuracy": 0.19688236713409424, "num_tokens": 27248576.0, "step": 15715 }, { "entropy": 5.552882242202759, "epoch": 1.2230694417428516, "grad_norm": 1.0703125, "learning_rate": 0.0004853685224230623, "loss": 5.0225, "mean_token_accuracy": 0.19412660002708435, "num_tokens": 27257350.0, "step": 15720 }, { "entropy": 5.512541198730469, "epoch": 1.223458471114569, "grad_norm": 1.0078125, "learning_rate": 0.00048535868945395825, "loss": 5.1295, "mean_token_accuracy": 0.1878654718399048, "num_tokens": 27266455.0, "step": 15725 }, { "entropy": 5.578158807754517, "epoch": 1.2238475004862868, "grad_norm": 0.9765625, "learning_rate": 0.00048534885329299586, "loss": 5.1521, "mean_token_accuracy": 0.1926531031727791, "num_tokens": 27276423.0, "step": 15730 }, { "entropy": 5.578703117370606, "epoch": 1.2242365298580042, "grad_norm": 1.0859375, "learning_rate": 0.0004853390139403245, "loss": 5.1195, "mean_token_accuracy": 0.1875462681055069, "num_tokens": 27285131.0, "step": 15735 }, { "entropy": 5.533165121078492, "epoch": 1.224625559229722, "grad_norm": 1.0390625, "learning_rate": 0.00048532917139609334, "loss": 5.0784, "mean_token_accuracy": 0.19391572326421738, "num_tokens": 27293884.0, "step": 15740 }, { "entropy": 5.481677532196045, "epoch": 1.2250145886014394, "grad_norm": 1.015625, "learning_rate": 0.0004853193256604518, "loss": 5.0174, "mean_token_accuracy": 0.19720928817987443, "num_tokens": 27302416.0, "step": 15745 }, { "entropy": 5.603465795516968, "epoch": 1.2254036179731569, "grad_norm": 1.0859375, "learning_rate": 0.00048530947673354924, "loss": 5.1148, "mean_token_accuracy": 0.18776411265134813, "num_tokens": 27311144.0, "step": 15750 }, { "entropy": 5.490378952026367, "epoch": 1.2257926473448746, "grad_norm": 0.984375, "learning_rate": 0.0004852996246155351, "loss": 4.9788, "mean_token_accuracy": 0.20270612090826035, "num_tokens": 27319911.0, "step": 15755 }, { "entropy": 5.468423748016358, "epoch": 1.226181676716592, "grad_norm": 0.99609375, "learning_rate": 0.00048528976930655896, "loss": 5.0291, "mean_token_accuracy": 0.19342004656791686, "num_tokens": 27329591.0, "step": 15760 }, { "entropy": 5.576354360580444, "epoch": 1.2265707060883098, "grad_norm": 1.1328125, "learning_rate": 0.00048527991080677015, "loss": 5.1469, "mean_token_accuracy": 0.18709017634391784, "num_tokens": 27337915.0, "step": 15765 }, { "entropy": 5.477359771728516, "epoch": 1.2269597354600272, "grad_norm": 1.03125, "learning_rate": 0.00048527004911631843, "loss": 5.0422, "mean_token_accuracy": 0.1962601959705353, "num_tokens": 27346799.0, "step": 15770 }, { "entropy": 5.588991975784301, "epoch": 1.2273487648317447, "grad_norm": 1.1328125, "learning_rate": 0.0004852601842353534, "loss": 5.1389, "mean_token_accuracy": 0.19243317246437072, "num_tokens": 27355429.0, "step": 15775 }, { "entropy": 5.5116547584533695, "epoch": 1.2277377942034624, "grad_norm": 1.0078125, "learning_rate": 0.00048525031616402476, "loss": 4.9888, "mean_token_accuracy": 0.20260435193777085, "num_tokens": 27363895.0, "step": 15780 }, { "entropy": 5.510281229019165, "epoch": 1.2281268235751799, "grad_norm": 1.125, "learning_rate": 0.00048524044490248227, "loss": 5.0949, "mean_token_accuracy": 0.19600262343883515, "num_tokens": 27372593.0, "step": 15785 }, { "entropy": 5.467556715011597, "epoch": 1.2285158529468976, "grad_norm": 1.2265625, "learning_rate": 0.00048523057045087557, "loss": 4.9359, "mean_token_accuracy": 0.20544480830430983, "num_tokens": 27381574.0, "step": 15790 }, { "entropy": 5.555751180648803, "epoch": 1.228904882318615, "grad_norm": 1.0390625, "learning_rate": 0.00048522069280935466, "loss": 5.0761, "mean_token_accuracy": 0.19362273961305618, "num_tokens": 27390338.0, "step": 15795 }, { "entropy": 5.552414083480835, "epoch": 1.2292939116903325, "grad_norm": 1.046875, "learning_rate": 0.0004852108119780693, "loss": 5.0762, "mean_token_accuracy": 0.19301716685295106, "num_tokens": 27398843.0, "step": 15800 }, { "entropy": 5.557084274291992, "epoch": 1.2296829410620502, "grad_norm": 1.09375, "learning_rate": 0.0004852009279571694, "loss": 5.1137, "mean_token_accuracy": 0.19164892733097078, "num_tokens": 27407700.0, "step": 15805 }, { "entropy": 5.504955148696899, "epoch": 1.2300719704337677, "grad_norm": 1.03125, "learning_rate": 0.000485191040746805, "loss": 5.0618, "mean_token_accuracy": 0.1960111916065216, "num_tokens": 27416559.0, "step": 15810 }, { "entropy": 5.508121585845947, "epoch": 1.2304609998054854, "grad_norm": 1.0625, "learning_rate": 0.0004851811503471262, "loss": 4.9851, "mean_token_accuracy": 0.19695171415805818, "num_tokens": 27424655.0, "step": 15815 }, { "entropy": 5.497120332717896, "epoch": 1.2308500291772029, "grad_norm": 0.9921875, "learning_rate": 0.00048517125675828294, "loss": 5.0702, "mean_token_accuracy": 0.19357269406318664, "num_tokens": 27434090.0, "step": 15820 }, { "entropy": 5.54311170578003, "epoch": 1.2312390585489204, "grad_norm": 1.1796875, "learning_rate": 0.00048516135998042536, "loss": 5.0527, "mean_token_accuracy": 0.20452131927013398, "num_tokens": 27442555.0, "step": 15825 }, { "entropy": 5.50479474067688, "epoch": 1.231628087920638, "grad_norm": 1.0546875, "learning_rate": 0.0004851514600137037, "loss": 5.0526, "mean_token_accuracy": 0.19500044733285904, "num_tokens": 27451180.0, "step": 15830 }, { "entropy": 5.583836698532105, "epoch": 1.2320171172923555, "grad_norm": 1.15625, "learning_rate": 0.00048514155685826807, "loss": 5.2092, "mean_token_accuracy": 0.1813034236431122, "num_tokens": 27460847.0, "step": 15835 }, { "entropy": 5.557675361633301, "epoch": 1.2324061466640732, "grad_norm": 1.0859375, "learning_rate": 0.0004851316505142688, "loss": 5.0624, "mean_token_accuracy": 0.19568282812833787, "num_tokens": 27470102.0, "step": 15840 }, { "entropy": 5.547676277160645, "epoch": 1.2327951760357907, "grad_norm": 1.109375, "learning_rate": 0.00048512174098185615, "loss": 5.1123, "mean_token_accuracy": 0.19469647258520126, "num_tokens": 27479066.0, "step": 15845 }, { "entropy": 5.486546516418457, "epoch": 1.2331842054075082, "grad_norm": 1.0703125, "learning_rate": 0.00048511182826118055, "loss": 5.0311, "mean_token_accuracy": 0.1919628843665123, "num_tokens": 27487681.0, "step": 15850 }, { "entropy": 5.594352054595947, "epoch": 1.2335732347792259, "grad_norm": 1.0078125, "learning_rate": 0.00048510191235239246, "loss": 5.0529, "mean_token_accuracy": 0.19886396676301957, "num_tokens": 27496067.0, "step": 15855 }, { "entropy": 5.487336730957031, "epoch": 1.2339622641509433, "grad_norm": 1.09375, "learning_rate": 0.00048509199325564217, "loss": 4.9776, "mean_token_accuracy": 0.199818916618824, "num_tokens": 27503801.0, "step": 15860 }, { "entropy": 5.401217269897461, "epoch": 1.234351293522661, "grad_norm": 1.15625, "learning_rate": 0.0004850820709710803, "loss": 4.9646, "mean_token_accuracy": 0.1940133184194565, "num_tokens": 27512018.0, "step": 15865 }, { "entropy": 5.492809534072876, "epoch": 1.2347403228943785, "grad_norm": 1.859375, "learning_rate": 0.0004850721454988574, "loss": 4.9438, "mean_token_accuracy": 0.2061188891530037, "num_tokens": 27521632.0, "step": 15870 }, { "entropy": 5.630766487121582, "epoch": 1.235129352266096, "grad_norm": 0.9921875, "learning_rate": 0.00048506221683912405, "loss": 5.2134, "mean_token_accuracy": 0.190043905377388, "num_tokens": 27530439.0, "step": 15875 }, { "entropy": 5.523299932479858, "epoch": 1.2355183816378137, "grad_norm": 1.0390625, "learning_rate": 0.0004850522849920309, "loss": 5.0707, "mean_token_accuracy": 0.19871943145990373, "num_tokens": 27539079.0, "step": 15880 }, { "entropy": 5.505356311798096, "epoch": 1.2359074110095312, "grad_norm": 1.0546875, "learning_rate": 0.00048504234995772863, "loss": 5.01, "mean_token_accuracy": 0.19357948899269103, "num_tokens": 27547701.0, "step": 15885 }, { "entropy": 5.551141309738159, "epoch": 1.2362964403812489, "grad_norm": 1.109375, "learning_rate": 0.0004850324117363681, "loss": 5.0248, "mean_token_accuracy": 0.1950746789574623, "num_tokens": 27556094.0, "step": 15890 }, { "entropy": 5.557127046585083, "epoch": 1.2366854697529663, "grad_norm": 1.1484375, "learning_rate": 0.00048502247032809997, "loss": 5.091, "mean_token_accuracy": 0.19358098655939102, "num_tokens": 27564530.0, "step": 15895 }, { "entropy": 5.530200433731079, "epoch": 1.237074499124684, "grad_norm": 0.98046875, "learning_rate": 0.0004850125257330751, "loss": 5.0304, "mean_token_accuracy": 0.19774871468544006, "num_tokens": 27573467.0, "step": 15900 }, { "entropy": 5.535633325576782, "epoch": 1.2374635284964015, "grad_norm": 1.1171875, "learning_rate": 0.00048500257795144446, "loss": 5.1014, "mean_token_accuracy": 0.19193962216377258, "num_tokens": 27582170.0, "step": 15905 }, { "entropy": 5.59482159614563, "epoch": 1.237852557868119, "grad_norm": 1.1171875, "learning_rate": 0.000484992626983359, "loss": 5.1526, "mean_token_accuracy": 0.19181772768497468, "num_tokens": 27590887.0, "step": 15910 }, { "entropy": 5.565155458450318, "epoch": 1.2382415872398367, "grad_norm": 1.1328125, "learning_rate": 0.0004849826728289696, "loss": 5.1379, "mean_token_accuracy": 0.19272060841321945, "num_tokens": 27599761.0, "step": 15915 }, { "entropy": 5.630237627029419, "epoch": 1.2386306166115542, "grad_norm": 1.1171875, "learning_rate": 0.00048497271548842737, "loss": 5.2164, "mean_token_accuracy": 0.18394846916198732, "num_tokens": 27608583.0, "step": 15920 }, { "entropy": 5.530681800842285, "epoch": 1.2390196459832716, "grad_norm": 1.0703125, "learning_rate": 0.0004849627549618834, "loss": 4.9429, "mean_token_accuracy": 0.2033820405602455, "num_tokens": 27616899.0, "step": 15925 }, { "entropy": 5.509924697875976, "epoch": 1.2394086753549893, "grad_norm": 1.0625, "learning_rate": 0.00048495279124948886, "loss": 5.0329, "mean_token_accuracy": 0.1959036886692047, "num_tokens": 27625975.0, "step": 15930 }, { "entropy": 5.6516149044036865, "epoch": 1.2397977047267068, "grad_norm": 1.0546875, "learning_rate": 0.0004849428243513948, "loss": 5.26, "mean_token_accuracy": 0.18386876583099365, "num_tokens": 27634806.0, "step": 15935 }, { "entropy": 5.554934310913086, "epoch": 1.2401867340984245, "grad_norm": 1.0859375, "learning_rate": 0.00048493285426775255, "loss": 5.0542, "mean_token_accuracy": 0.1940790519118309, "num_tokens": 27643641.0, "step": 15940 }, { "entropy": 5.532153987884522, "epoch": 1.240575763470142, "grad_norm": 1.046875, "learning_rate": 0.0004849228809987135, "loss": 5.0966, "mean_token_accuracy": 0.19593401700258256, "num_tokens": 27652592.0, "step": 15945 }, { "entropy": 5.52583498954773, "epoch": 1.2409647928418597, "grad_norm": 1.03125, "learning_rate": 0.0004849129045444288, "loss": 5.0018, "mean_token_accuracy": 0.19533077329397203, "num_tokens": 27661205.0, "step": 15950 }, { "entropy": 5.489716577529907, "epoch": 1.2413538222135772, "grad_norm": 1.15625, "learning_rate": 0.0004849029249050498, "loss": 5.0205, "mean_token_accuracy": 0.1954821303486824, "num_tokens": 27669074.0, "step": 15955 }, { "entropy": 5.551987218856811, "epoch": 1.2417428515852946, "grad_norm": 1.1796875, "learning_rate": 0.00048489294208072805, "loss": 5.0574, "mean_token_accuracy": 0.19411068856716157, "num_tokens": 27676863.0, "step": 15960 }, { "entropy": 5.586891460418701, "epoch": 1.2421318809570123, "grad_norm": 1.0859375, "learning_rate": 0.00048488295607161495, "loss": 5.1189, "mean_token_accuracy": 0.19111596792936325, "num_tokens": 27686491.0, "step": 15965 }, { "entropy": 5.520835256576538, "epoch": 1.2425209103287298, "grad_norm": 1.1015625, "learning_rate": 0.0004848729668778621, "loss": 5.1323, "mean_token_accuracy": 0.19250125885009767, "num_tokens": 27694964.0, "step": 15970 }, { "entropy": 5.554769277572632, "epoch": 1.2429099397004473, "grad_norm": 1.0703125, "learning_rate": 0.0004848629744996211, "loss": 5.0451, "mean_token_accuracy": 0.1958884507417679, "num_tokens": 27703766.0, "step": 15975 }, { "entropy": 5.576978635787964, "epoch": 1.243298969072165, "grad_norm": 1.0234375, "learning_rate": 0.0004848529789370434, "loss": 5.0621, "mean_token_accuracy": 0.1917141407728195, "num_tokens": 27712773.0, "step": 15980 }, { "entropy": 5.5655499458312985, "epoch": 1.2436879984438824, "grad_norm": 1.0546875, "learning_rate": 0.0004848429801902808, "loss": 5.1631, "mean_token_accuracy": 0.19076957404613495, "num_tokens": 27721788.0, "step": 15985 }, { "entropy": 5.594088315963745, "epoch": 1.2440770278156001, "grad_norm": 0.9921875, "learning_rate": 0.00048483297825948485, "loss": 5.2075, "mean_token_accuracy": 0.18437306731939315, "num_tokens": 27731222.0, "step": 15990 }, { "entropy": 5.64353837966919, "epoch": 1.2444660571873176, "grad_norm": 1.0859375, "learning_rate": 0.00048482297314480756, "loss": 5.2343, "mean_token_accuracy": 0.18508951514959335, "num_tokens": 27740623.0, "step": 15995 }, { "entropy": 5.603208732604981, "epoch": 1.2448550865590353, "grad_norm": 1.078125, "learning_rate": 0.0004848129648464006, "loss": 5.1225, "mean_token_accuracy": 0.18544287979602814, "num_tokens": 27749272.0, "step": 16000 }, { "entropy": 5.5229521751403805, "epoch": 1.2452441159307528, "grad_norm": 1.0390625, "learning_rate": 0.0004848029533644159, "loss": 5.1666, "mean_token_accuracy": 0.1891465350985527, "num_tokens": 27758435.0, "step": 16005 }, { "entropy": 5.625425338745117, "epoch": 1.2456331453024703, "grad_norm": 1.1015625, "learning_rate": 0.0004847929386990052, "loss": 5.1292, "mean_token_accuracy": 0.18991667926311492, "num_tokens": 27767132.0, "step": 16010 }, { "entropy": 5.594956016540527, "epoch": 1.246022174674188, "grad_norm": 1.140625, "learning_rate": 0.00048478292085032065, "loss": 5.0701, "mean_token_accuracy": 0.19087830781936646, "num_tokens": 27775661.0, "step": 16015 }, { "entropy": 5.549164438247681, "epoch": 1.2464112040459054, "grad_norm": 1.0625, "learning_rate": 0.0004847728998185142, "loss": 5.0847, "mean_token_accuracy": 0.18831372410058975, "num_tokens": 27783819.0, "step": 16020 }, { "entropy": 5.4139440059661865, "epoch": 1.246800233417623, "grad_norm": 1.09375, "learning_rate": 0.00048476287560373786, "loss": 4.9038, "mean_token_accuracy": 0.1979458063840866, "num_tokens": 27792717.0, "step": 16025 }, { "entropy": 5.6446168422698975, "epoch": 1.2471892627893406, "grad_norm": 1.1328125, "learning_rate": 0.00048475284820614375, "loss": 5.2786, "mean_token_accuracy": 0.18445671051740647, "num_tokens": 27802314.0, "step": 16030 }, { "entropy": 5.595372104644776, "epoch": 1.247578292161058, "grad_norm": 1.1875, "learning_rate": 0.00048474281762588407, "loss": 5.1427, "mean_token_accuracy": 0.18943841755390167, "num_tokens": 27810837.0, "step": 16035 }, { "entropy": 5.55095100402832, "epoch": 1.2479673215327758, "grad_norm": 1.0703125, "learning_rate": 0.0004847327838631109, "loss": 5.112, "mean_token_accuracy": 0.18820951133966446, "num_tokens": 27819743.0, "step": 16040 }, { "entropy": 5.575311374664307, "epoch": 1.2483563509044933, "grad_norm": 1.09375, "learning_rate": 0.0004847227469179766, "loss": 5.1529, "mean_token_accuracy": 0.18688541352748872, "num_tokens": 27827982.0, "step": 16045 }, { "entropy": 5.582282161712646, "epoch": 1.248745380276211, "grad_norm": 1.0234375, "learning_rate": 0.0004847127067906334, "loss": 5.0933, "mean_token_accuracy": 0.19153002500534058, "num_tokens": 27836539.0, "step": 16050 }, { "entropy": 5.574767017364502, "epoch": 1.2491344096479284, "grad_norm": 1.2109375, "learning_rate": 0.00048470266348123365, "loss": 5.1072, "mean_token_accuracy": 0.18847111910581588, "num_tokens": 27844987.0, "step": 16055 }, { "entropy": 5.528655576705932, "epoch": 1.249523439019646, "grad_norm": 1.0546875, "learning_rate": 0.0004846926169899298, "loss": 5.0806, "mean_token_accuracy": 0.19213380068540573, "num_tokens": 27853517.0, "step": 16060 }, { "entropy": 5.520037317276001, "epoch": 1.2499124683913636, "grad_norm": 1.0859375, "learning_rate": 0.00048468256731687426, "loss": 5.0261, "mean_token_accuracy": 0.1991806611418724, "num_tokens": 27862107.0, "step": 16065 }, { "entropy": 5.535496664047241, "epoch": 1.250301497763081, "grad_norm": 1.03125, "learning_rate": 0.0004846725144622194, "loss": 5.0684, "mean_token_accuracy": 0.19231536686420442, "num_tokens": 27870611.0, "step": 16070 }, { "entropy": 5.539904069900513, "epoch": 1.2506905271347986, "grad_norm": 1.0625, "learning_rate": 0.000484662458426118, "loss": 5.0753, "mean_token_accuracy": 0.19335533827543258, "num_tokens": 27879520.0, "step": 16075 }, { "entropy": 5.457077407836914, "epoch": 1.2510795565065163, "grad_norm": 1.1640625, "learning_rate": 0.00048465239920872247, "loss": 4.994, "mean_token_accuracy": 0.1975537970662117, "num_tokens": 27888371.0, "step": 16080 }, { "entropy": 5.491286087036133, "epoch": 1.2514685858782337, "grad_norm": 1.09375, "learning_rate": 0.00048464233681018545, "loss": 4.9997, "mean_token_accuracy": 0.198992620408535, "num_tokens": 27896518.0, "step": 16085 }, { "entropy": 5.543295669555664, "epoch": 1.2518576152499514, "grad_norm": 1.03125, "learning_rate": 0.0004846322712306596, "loss": 5.0691, "mean_token_accuracy": 0.19242860823869706, "num_tokens": 27905397.0, "step": 16090 }, { "entropy": 5.520310974121093, "epoch": 1.252246644621669, "grad_norm": 1.046875, "learning_rate": 0.00048462220247029783, "loss": 4.9803, "mean_token_accuracy": 0.1944587618112564, "num_tokens": 27914057.0, "step": 16095 }, { "entropy": 5.4607775688171385, "epoch": 1.2526356739933866, "grad_norm": 1.0234375, "learning_rate": 0.00048461213052925265, "loss": 5.0103, "mean_token_accuracy": 0.19643427580595016, "num_tokens": 27922872.0, "step": 16100 }, { "entropy": 5.44712643623352, "epoch": 1.253024703365104, "grad_norm": 1.015625, "learning_rate": 0.0004846020554076771, "loss": 5.0531, "mean_token_accuracy": 0.1972901329398155, "num_tokens": 27931143.0, "step": 16105 }, { "entropy": 5.55177493095398, "epoch": 1.2534137327368216, "grad_norm": 1.1171875, "learning_rate": 0.0004845919771057239, "loss": 5.1455, "mean_token_accuracy": 0.18036955893039702, "num_tokens": 27939915.0, "step": 16110 }, { "entropy": 5.571521663665772, "epoch": 1.2538027621085392, "grad_norm": 1.0703125, "learning_rate": 0.0004845818956235462, "loss": 5.0214, "mean_token_accuracy": 0.19408749043941498, "num_tokens": 27948125.0, "step": 16115 }, { "entropy": 5.608725881576538, "epoch": 1.2541917914802567, "grad_norm": 1.0390625, "learning_rate": 0.00048457181096129664, "loss": 5.2325, "mean_token_accuracy": 0.178395639359951, "num_tokens": 27957288.0, "step": 16120 }, { "entropy": 5.5557608127594, "epoch": 1.2545808208519742, "grad_norm": 1.0625, "learning_rate": 0.0004845617231191285, "loss": 5.0675, "mean_token_accuracy": 0.1874172493815422, "num_tokens": 27965754.0, "step": 16125 }, { "entropy": 5.577339935302734, "epoch": 1.254969850223692, "grad_norm": 1.125, "learning_rate": 0.0004845516320971948, "loss": 5.0619, "mean_token_accuracy": 0.19957368224859237, "num_tokens": 27974060.0, "step": 16130 }, { "entropy": 5.5170361518859865, "epoch": 1.2553588795954094, "grad_norm": 1.0390625, "learning_rate": 0.0004845415378956486, "loss": 5.0488, "mean_token_accuracy": 0.1952352523803711, "num_tokens": 27983417.0, "step": 16135 }, { "entropy": 5.596839714050293, "epoch": 1.255747908967127, "grad_norm": 1.078125, "learning_rate": 0.000484531440514643, "loss": 5.1055, "mean_token_accuracy": 0.19414311796426773, "num_tokens": 27992425.0, "step": 16140 }, { "entropy": 5.580276107788086, "epoch": 1.2561369383388445, "grad_norm": 1.03125, "learning_rate": 0.00048452133995433136, "loss": 5.117, "mean_token_accuracy": 0.19307217597961426, "num_tokens": 28000711.0, "step": 16145 }, { "entropy": 5.508587265014649, "epoch": 1.2565259677105622, "grad_norm": 0.9765625, "learning_rate": 0.0004845112362148668, "loss": 5.0154, "mean_token_accuracy": 0.1945103660225868, "num_tokens": 28010193.0, "step": 16150 }, { "entropy": 5.534761381149292, "epoch": 1.2569149970822797, "grad_norm": 1.0546875, "learning_rate": 0.0004845011292964028, "loss": 5.1328, "mean_token_accuracy": 0.19204179495573043, "num_tokens": 28020030.0, "step": 16155 }, { "entropy": 5.507098436355591, "epoch": 1.2573040264539972, "grad_norm": 1.1328125, "learning_rate": 0.00048449101919909265, "loss": 5.003, "mean_token_accuracy": 0.19443392753601074, "num_tokens": 28028171.0, "step": 16160 }, { "entropy": 5.576512050628662, "epoch": 1.257693055825715, "grad_norm": 1.0390625, "learning_rate": 0.00048448090592308955, "loss": 5.0788, "mean_token_accuracy": 0.19209689199924468, "num_tokens": 28036652.0, "step": 16165 }, { "entropy": 5.599478340148925, "epoch": 1.2580820851974324, "grad_norm": 1.0234375, "learning_rate": 0.0004844707894685473, "loss": 5.0902, "mean_token_accuracy": 0.19421993792057038, "num_tokens": 28044691.0, "step": 16170 }, { "entropy": 5.524524068832397, "epoch": 1.2584711145691498, "grad_norm": 1.1015625, "learning_rate": 0.0004844606698356192, "loss": 5.1076, "mean_token_accuracy": 0.1873532310128212, "num_tokens": 28053186.0, "step": 16175 }, { "entropy": 5.597494888305664, "epoch": 1.2588601439408675, "grad_norm": 1.0625, "learning_rate": 0.0004844505470244588, "loss": 5.1473, "mean_token_accuracy": 0.19274385869503022, "num_tokens": 28061827.0, "step": 16180 }, { "entropy": 5.675650787353516, "epoch": 1.2592491733125852, "grad_norm": 1.1328125, "learning_rate": 0.0004844404210352197, "loss": 5.1563, "mean_token_accuracy": 0.19142398983240128, "num_tokens": 28070191.0, "step": 16185 }, { "entropy": 5.586566352844239, "epoch": 1.2596382026843027, "grad_norm": 1.109375, "learning_rate": 0.00048443029186805554, "loss": 5.1457, "mean_token_accuracy": 0.18605474084615709, "num_tokens": 28078502.0, "step": 16190 }, { "entropy": 5.532293891906738, "epoch": 1.2600272320560202, "grad_norm": 1.046875, "learning_rate": 0.0004844201595231201, "loss": 5.0561, "mean_token_accuracy": 0.19519804120063783, "num_tokens": 28086801.0, "step": 16195 }, { "entropy": 5.547823905944824, "epoch": 1.2604162614277379, "grad_norm": 1.03125, "learning_rate": 0.00048441002400056706, "loss": 5.1036, "mean_token_accuracy": 0.19093164801597595, "num_tokens": 28095184.0, "step": 16200 }, { "entropy": 5.508849096298218, "epoch": 1.2608052907994554, "grad_norm": 1.0390625, "learning_rate": 0.0004843998853005502, "loss": 5.0035, "mean_token_accuracy": 0.19692357033491134, "num_tokens": 28103571.0, "step": 16205 }, { "entropy": 5.6406043529510494, "epoch": 1.2611943201711728, "grad_norm": 1.046875, "learning_rate": 0.0004843897434232233, "loss": 5.271, "mean_token_accuracy": 0.1766631558537483, "num_tokens": 28113142.0, "step": 16210 }, { "entropy": 5.561850070953369, "epoch": 1.2615833495428905, "grad_norm": 1.125, "learning_rate": 0.00048437959836874047, "loss": 5.0677, "mean_token_accuracy": 0.19162545204162598, "num_tokens": 28121464.0, "step": 16215 }, { "entropy": 5.54154224395752, "epoch": 1.261972378914608, "grad_norm": 1.1015625, "learning_rate": 0.00048436945013725544, "loss": 5.0435, "mean_token_accuracy": 0.19706882238388063, "num_tokens": 28130384.0, "step": 16220 }, { "entropy": 5.495460128784179, "epoch": 1.2623614082863255, "grad_norm": 1.0625, "learning_rate": 0.00048435929872892226, "loss": 5.073, "mean_token_accuracy": 0.19532164931297302, "num_tokens": 28139030.0, "step": 16225 }, { "entropy": 5.531817436218262, "epoch": 1.2627504376580432, "grad_norm": 1.0546875, "learning_rate": 0.0004843491441438949, "loss": 4.9607, "mean_token_accuracy": 0.20064347088336945, "num_tokens": 28147228.0, "step": 16230 }, { "entropy": 5.566263914108276, "epoch": 1.2631394670297609, "grad_norm": 1.03125, "learning_rate": 0.00048433898638232755, "loss": 5.0214, "mean_token_accuracy": 0.1959443673491478, "num_tokens": 28156262.0, "step": 16235 }, { "entropy": 5.58278522491455, "epoch": 1.2635284964014784, "grad_norm": 1.1953125, "learning_rate": 0.0004843288254443742, "loss": 5.1261, "mean_token_accuracy": 0.1898317888379097, "num_tokens": 28165953.0, "step": 16240 }, { "entropy": 5.528287696838379, "epoch": 1.2639175257731958, "grad_norm": 1.109375, "learning_rate": 0.0004843186613301892, "loss": 5.0965, "mean_token_accuracy": 0.19257779270410538, "num_tokens": 28174362.0, "step": 16245 }, { "entropy": 5.4810363292694095, "epoch": 1.2643065551449135, "grad_norm": 1.109375, "learning_rate": 0.0004843084940399266, "loss": 4.9821, "mean_token_accuracy": 0.1989048331975937, "num_tokens": 28182657.0, "step": 16250 }, { "entropy": 5.542258167266846, "epoch": 1.264695584516631, "grad_norm": 1.0703125, "learning_rate": 0.0004842983235737408, "loss": 5.1158, "mean_token_accuracy": 0.19014571458101273, "num_tokens": 28191605.0, "step": 16255 }, { "entropy": 5.522048616409302, "epoch": 1.2650846138883485, "grad_norm": 1.0390625, "learning_rate": 0.0004842881499317861, "loss": 5.0592, "mean_token_accuracy": 0.19313347041606904, "num_tokens": 28200619.0, "step": 16260 }, { "entropy": 5.615197229385376, "epoch": 1.2654736432600662, "grad_norm": 1.1015625, "learning_rate": 0.0004842779731142168, "loss": 5.1031, "mean_token_accuracy": 0.1963601678609848, "num_tokens": 28208638.0, "step": 16265 }, { "entropy": 5.5232823371887205, "epoch": 1.2658626726317836, "grad_norm": 1.0703125, "learning_rate": 0.00048426779312118735, "loss": 5.0791, "mean_token_accuracy": 0.1896592378616333, "num_tokens": 28217221.0, "step": 16270 }, { "entropy": 5.545674133300781, "epoch": 1.2662517020035013, "grad_norm": 1.1640625, "learning_rate": 0.0004842576099528522, "loss": 5.1029, "mean_token_accuracy": 0.19116133600473403, "num_tokens": 28225498.0, "step": 16275 }, { "entropy": 5.45075421333313, "epoch": 1.2666407313752188, "grad_norm": 1.0859375, "learning_rate": 0.0004842474236093659, "loss": 5.0307, "mean_token_accuracy": 0.1960647389292717, "num_tokens": 28234264.0, "step": 16280 }, { "entropy": 5.539739370346069, "epoch": 1.2670297607469365, "grad_norm": 1.0859375, "learning_rate": 0.00048423723409088306, "loss": 5.1449, "mean_token_accuracy": 0.1962319254875183, "num_tokens": 28242850.0, "step": 16285 }, { "entropy": 5.572647619247436, "epoch": 1.267418790118654, "grad_norm": 1.4765625, "learning_rate": 0.0004842270413975582, "loss": 5.1651, "mean_token_accuracy": 0.18833777904510499, "num_tokens": 28251700.0, "step": 16290 }, { "entropy": 5.5048723220825195, "epoch": 1.2678078194903715, "grad_norm": 1.0625, "learning_rate": 0.000484216845529546, "loss": 5.0451, "mean_token_accuracy": 0.19177947640419007, "num_tokens": 28260448.0, "step": 16295 }, { "entropy": 5.540106010437012, "epoch": 1.2681968488620892, "grad_norm": 1.0625, "learning_rate": 0.00048420664648700113, "loss": 5.1429, "mean_token_accuracy": 0.18850154131650926, "num_tokens": 28269829.0, "step": 16300 }, { "entropy": 5.569955635070801, "epoch": 1.2685858782338066, "grad_norm": 1.1015625, "learning_rate": 0.0004841964442700784, "loss": 5.0576, "mean_token_accuracy": 0.19818419665098191, "num_tokens": 28278152.0, "step": 16305 }, { "entropy": 5.569440507888794, "epoch": 1.2689749076055241, "grad_norm": 1.046875, "learning_rate": 0.00048418623887893264, "loss": 5.1645, "mean_token_accuracy": 0.1920655518770218, "num_tokens": 28287184.0, "step": 16310 }, { "entropy": 5.521697616577148, "epoch": 1.2693639369772418, "grad_norm": 1.03125, "learning_rate": 0.00048417603031371867, "loss": 5.0866, "mean_token_accuracy": 0.1947348177433014, "num_tokens": 28295644.0, "step": 16315 }, { "entropy": 5.588948154449463, "epoch": 1.2697529663489593, "grad_norm": 1.0390625, "learning_rate": 0.0004841658185745913, "loss": 5.0991, "mean_token_accuracy": 0.18904222249984742, "num_tokens": 28304718.0, "step": 16320 }, { "entropy": 5.540207099914551, "epoch": 1.270141995720677, "grad_norm": 1.1015625, "learning_rate": 0.00048415560366170564, "loss": 5.0592, "mean_token_accuracy": 0.19663500487804414, "num_tokens": 28313190.0, "step": 16325 }, { "entropy": 5.521539163589478, "epoch": 1.2705310250923945, "grad_norm": 1.0234375, "learning_rate": 0.0004841453855752165, "loss": 5.122, "mean_token_accuracy": 0.1913640320301056, "num_tokens": 28322729.0, "step": 16330 }, { "entropy": 5.54754056930542, "epoch": 1.2709200544641122, "grad_norm": 1.1171875, "learning_rate": 0.0004841351643152791, "loss": 5.1772, "mean_token_accuracy": 0.1868587464094162, "num_tokens": 28331657.0, "step": 16335 }, { "entropy": 5.577137422561646, "epoch": 1.2713090838358296, "grad_norm": 1.0234375, "learning_rate": 0.0004841249398820485, "loss": 5.1122, "mean_token_accuracy": 0.19130265414714814, "num_tokens": 28340319.0, "step": 16340 }, { "entropy": 5.493728876113892, "epoch": 1.271698113207547, "grad_norm": 1.046875, "learning_rate": 0.0004841147122756797, "loss": 5.0468, "mean_token_accuracy": 0.19203629493713378, "num_tokens": 28349303.0, "step": 16345 }, { "entropy": 5.573841714859009, "epoch": 1.2720871425792648, "grad_norm": 1.109375, "learning_rate": 0.000484104481496328, "loss": 5.1118, "mean_token_accuracy": 0.189174884557724, "num_tokens": 28357811.0, "step": 16350 }, { "entropy": 5.605975866317749, "epoch": 1.2724761719509823, "grad_norm": 1.2109375, "learning_rate": 0.0004840942475441486, "loss": 5.1128, "mean_token_accuracy": 0.19020716696977616, "num_tokens": 28367155.0, "step": 16355 }, { "entropy": 5.502915096282959, "epoch": 1.2728652013226998, "grad_norm": 1.0859375, "learning_rate": 0.0004840840104192969, "loss": 4.9267, "mean_token_accuracy": 0.20211808979511262, "num_tokens": 28375213.0, "step": 16360 }, { "entropy": 5.518007755279541, "epoch": 1.2732542306944175, "grad_norm": 1.0234375, "learning_rate": 0.000484073770121928, "loss": 5.1104, "mean_token_accuracy": 0.18614376485347747, "num_tokens": 28384085.0, "step": 16365 }, { "entropy": 5.475695991516114, "epoch": 1.273643260066135, "grad_norm": 1.0234375, "learning_rate": 0.0004840635266521975, "loss": 4.9842, "mean_token_accuracy": 0.19675394594669343, "num_tokens": 28392725.0, "step": 16370 }, { "entropy": 5.478953552246094, "epoch": 1.2740322894378526, "grad_norm": 1.015625, "learning_rate": 0.0004840532800102607, "loss": 5.0836, "mean_token_accuracy": 0.1909507617354393, "num_tokens": 28401438.0, "step": 16375 }, { "entropy": 5.5330485820770265, "epoch": 1.27442131880957, "grad_norm": 1.078125, "learning_rate": 0.00048404303019627314, "loss": 5.0827, "mean_token_accuracy": 0.19418832212686538, "num_tokens": 28410703.0, "step": 16380 }, { "entropy": 5.527261877059937, "epoch": 1.2748103481812878, "grad_norm": 1.0, "learning_rate": 0.00048403277721039036, "loss": 4.971, "mean_token_accuracy": 0.20318710505962373, "num_tokens": 28419238.0, "step": 16385 }, { "entropy": 5.5728343486785885, "epoch": 1.2751993775530053, "grad_norm": 1.1640625, "learning_rate": 0.0004840225210527679, "loss": 5.0225, "mean_token_accuracy": 0.19700838774442672, "num_tokens": 28427124.0, "step": 16390 }, { "entropy": 5.537129497528076, "epoch": 1.2755884069247228, "grad_norm": 1.1171875, "learning_rate": 0.0004840122617235613, "loss": 5.0766, "mean_token_accuracy": 0.19507914632558823, "num_tokens": 28435605.0, "step": 16395 }, { "entropy": 5.4511305809021, "epoch": 1.2759774362964404, "grad_norm": 1.046875, "learning_rate": 0.0004840019992229263, "loss": 4.9673, "mean_token_accuracy": 0.20236364305019378, "num_tokens": 28443675.0, "step": 16400 }, { "entropy": 5.522972822189331, "epoch": 1.276366465668158, "grad_norm": 1.1015625, "learning_rate": 0.00048399173355101867, "loss": 5.0684, "mean_token_accuracy": 0.19576678723096846, "num_tokens": 28452337.0, "step": 16405 }, { "entropy": 5.532163143157959, "epoch": 1.2767554950398754, "grad_norm": 0.99609375, "learning_rate": 0.00048398146470799417, "loss": 5.0485, "mean_token_accuracy": 0.19529873728752137, "num_tokens": 28461933.0, "step": 16410 }, { "entropy": 5.6129436016082765, "epoch": 1.277144524411593, "grad_norm": 1.140625, "learning_rate": 0.00048397119269400846, "loss": 5.0915, "mean_token_accuracy": 0.19946979433298112, "num_tokens": 28469800.0, "step": 16415 }, { "entropy": 5.50711236000061, "epoch": 1.2775335537833106, "grad_norm": 1.109375, "learning_rate": 0.00048396091750921766, "loss": 5.0537, "mean_token_accuracy": 0.20323861837387086, "num_tokens": 28478149.0, "step": 16420 }, { "entropy": 5.503691339492798, "epoch": 1.2779225831550283, "grad_norm": 1.015625, "learning_rate": 0.0004839506391537774, "loss": 5.1239, "mean_token_accuracy": 0.18725541234016418, "num_tokens": 28487141.0, "step": 16425 }, { "entropy": 5.461289024353027, "epoch": 1.2783116125267457, "grad_norm": 1.140625, "learning_rate": 0.0004839403576278438, "loss": 4.9876, "mean_token_accuracy": 0.19375622719526292, "num_tokens": 28495611.0, "step": 16430 }, { "entropy": 5.597225713729858, "epoch": 1.2787006418984634, "grad_norm": 1.109375, "learning_rate": 0.0004839300729315729, "loss": 5.1774, "mean_token_accuracy": 0.19214192479848863, "num_tokens": 28504525.0, "step": 16435 }, { "entropy": 5.548247909545898, "epoch": 1.279089671270181, "grad_norm": 0.9765625, "learning_rate": 0.0004839197850651206, "loss": 5.0921, "mean_token_accuracy": 0.19279366880655288, "num_tokens": 28514208.0, "step": 16440 }, { "entropy": 5.570009851455689, "epoch": 1.2794787006418984, "grad_norm": 1.1015625, "learning_rate": 0.00048390949402864317, "loss": 5.1181, "mean_token_accuracy": 0.1943153277039528, "num_tokens": 28522424.0, "step": 16445 }, { "entropy": 5.617263650894165, "epoch": 1.279867730013616, "grad_norm": 1.140625, "learning_rate": 0.00048389919982229666, "loss": 5.0852, "mean_token_accuracy": 0.19810546785593033, "num_tokens": 28530809.0, "step": 16450 }, { "entropy": 5.553160810470581, "epoch": 1.2802567593853336, "grad_norm": 1.0703125, "learning_rate": 0.00048388890244623723, "loss": 5.0496, "mean_token_accuracy": 0.1919565513730049, "num_tokens": 28539665.0, "step": 16455 }, { "entropy": 5.47309193611145, "epoch": 1.280645788757051, "grad_norm": 1.1171875, "learning_rate": 0.0004838786019006213, "loss": 4.8897, "mean_token_accuracy": 0.2034697189927101, "num_tokens": 28547958.0, "step": 16460 }, { "entropy": 5.529098272323608, "epoch": 1.2810348181287687, "grad_norm": 1.03125, "learning_rate": 0.00048386829818560493, "loss": 5.0351, "mean_token_accuracy": 0.20221673995256423, "num_tokens": 28556917.0, "step": 16465 }, { "entropy": 5.605680274963379, "epoch": 1.2814238475004862, "grad_norm": 1.171875, "learning_rate": 0.00048385799130134464, "loss": 5.141, "mean_token_accuracy": 0.18426260501146316, "num_tokens": 28565807.0, "step": 16470 }, { "entropy": 5.5321591854095455, "epoch": 1.281812876872204, "grad_norm": 1.0234375, "learning_rate": 0.0004838476812479968, "loss": 5.0757, "mean_token_accuracy": 0.18770620077848435, "num_tokens": 28574321.0, "step": 16475 }, { "entropy": 5.4793863773345945, "epoch": 1.2822019062439214, "grad_norm": 1.1171875, "learning_rate": 0.00048383736802571774, "loss": 5.025, "mean_token_accuracy": 0.1971733957529068, "num_tokens": 28582691.0, "step": 16480 }, { "entropy": 5.488288259506225, "epoch": 1.282590935615639, "grad_norm": 1.1328125, "learning_rate": 0.000483827051634664, "loss": 5.0174, "mean_token_accuracy": 0.19521720111370086, "num_tokens": 28591039.0, "step": 16485 }, { "entropy": 5.580220890045166, "epoch": 1.2829799649873566, "grad_norm": 1.0078125, "learning_rate": 0.00048381673207499224, "loss": 5.1287, "mean_token_accuracy": 0.18587790727615355, "num_tokens": 28600217.0, "step": 16490 }, { "entropy": 5.52021369934082, "epoch": 1.283368994359074, "grad_norm": 1.1328125, "learning_rate": 0.0004838064093468588, "loss": 5.028, "mean_token_accuracy": 0.1940670058131218, "num_tokens": 28608275.0, "step": 16495 }, { "entropy": 5.501334381103516, "epoch": 1.2837580237307917, "grad_norm": 1.15625, "learning_rate": 0.0004837960834504206, "loss": 5.0768, "mean_token_accuracy": 0.19270583540201186, "num_tokens": 28616829.0, "step": 16500 }, { "entropy": 5.5097144603729244, "epoch": 1.2841470531025092, "grad_norm": 1.0625, "learning_rate": 0.0004837857543858341, "loss": 5.0551, "mean_token_accuracy": 0.1985089048743248, "num_tokens": 28625307.0, "step": 16505 }, { "entropy": 5.5988534450531, "epoch": 1.2845360824742267, "grad_norm": 1.0546875, "learning_rate": 0.0004837754221532561, "loss": 5.1793, "mean_token_accuracy": 0.18543199449777603, "num_tokens": 28634858.0, "step": 16510 }, { "entropy": 5.5542519092559814, "epoch": 1.2849251118459444, "grad_norm": 1.09375, "learning_rate": 0.00048376508675284334, "loss": 5.0569, "mean_token_accuracy": 0.1900027424097061, "num_tokens": 28642934.0, "step": 16515 }, { "entropy": 5.507322788238525, "epoch": 1.2853141412176619, "grad_norm": 1.09375, "learning_rate": 0.00048375474818475274, "loss": 5.0567, "mean_token_accuracy": 0.19527116268873215, "num_tokens": 28651410.0, "step": 16520 }, { "entropy": 5.476380777359009, "epoch": 1.2857031705893796, "grad_norm": 1.125, "learning_rate": 0.00048374440644914104, "loss": 5.0274, "mean_token_accuracy": 0.20037445574998855, "num_tokens": 28659969.0, "step": 16525 }, { "entropy": 5.5409753799438475, "epoch": 1.286092199961097, "grad_norm": 1.078125, "learning_rate": 0.00048373406154616523, "loss": 5.0921, "mean_token_accuracy": 0.19093319922685623, "num_tokens": 28668681.0, "step": 16530 }, { "entropy": 5.509018611907959, "epoch": 1.2864812293328147, "grad_norm": 1.0625, "learning_rate": 0.00048372371347598226, "loss": 5.0237, "mean_token_accuracy": 0.19172058254480362, "num_tokens": 28677369.0, "step": 16535 }, { "entropy": 5.521035289764404, "epoch": 1.2868702587045322, "grad_norm": 1.09375, "learning_rate": 0.00048371336223874923, "loss": 5.0511, "mean_token_accuracy": 0.19819203913211822, "num_tokens": 28685843.0, "step": 16540 }, { "entropy": 5.599702024459839, "epoch": 1.2872592880762497, "grad_norm": 1.0859375, "learning_rate": 0.000483703007834623, "loss": 5.1266, "mean_token_accuracy": 0.19013416320085524, "num_tokens": 28694382.0, "step": 16545 }, { "entropy": 5.573768949508667, "epoch": 1.2876483174479674, "grad_norm": 1.1875, "learning_rate": 0.0004836926502637609, "loss": 5.1299, "mean_token_accuracy": 0.19363074004650116, "num_tokens": 28702335.0, "step": 16550 }, { "entropy": 5.417899751663208, "epoch": 1.2880373468196848, "grad_norm": 1.078125, "learning_rate": 0.00048368228952632005, "loss": 4.8599, "mean_token_accuracy": 0.20722525119781493, "num_tokens": 28710302.0, "step": 16555 }, { "entropy": 5.554664039611817, "epoch": 1.2884263761914023, "grad_norm": 1.0234375, "learning_rate": 0.00048367192562245756, "loss": 5.1016, "mean_token_accuracy": 0.19354615062475206, "num_tokens": 28719523.0, "step": 16560 }, { "entropy": 5.615047264099121, "epoch": 1.28881540556312, "grad_norm": 1.09375, "learning_rate": 0.00048366155855233067, "loss": 5.1467, "mean_token_accuracy": 0.18935743868350982, "num_tokens": 28727919.0, "step": 16565 }, { "entropy": 5.571574306488037, "epoch": 1.2892044349348377, "grad_norm": 1.109375, "learning_rate": 0.0004836511883160968, "loss": 5.1189, "mean_token_accuracy": 0.1934323400259018, "num_tokens": 28735999.0, "step": 16570 }, { "entropy": 5.494749450683594, "epoch": 1.2895934643065552, "grad_norm": 1.0546875, "learning_rate": 0.0004836408149139133, "loss": 4.9159, "mean_token_accuracy": 0.1986479341983795, "num_tokens": 28745046.0, "step": 16575 }, { "entropy": 5.518639278411865, "epoch": 1.2899824936782727, "grad_norm": 1.1875, "learning_rate": 0.00048363043834593743, "loss": 5.0628, "mean_token_accuracy": 0.19155598282814026, "num_tokens": 28753464.0, "step": 16580 }, { "entropy": 5.437093019485474, "epoch": 1.2903715230499904, "grad_norm": 1.109375, "learning_rate": 0.0004836200586123268, "loss": 4.993, "mean_token_accuracy": 0.20200058817863464, "num_tokens": 28762153.0, "step": 16585 }, { "entropy": 5.541484737396241, "epoch": 1.2907605524217078, "grad_norm": 1.0625, "learning_rate": 0.00048360967571323875, "loss": 5.0393, "mean_token_accuracy": 0.1900661125779152, "num_tokens": 28771329.0, "step": 16590 }, { "entropy": 5.587620830535888, "epoch": 1.2911495817934253, "grad_norm": 1.203125, "learning_rate": 0.00048359928964883094, "loss": 5.1447, "mean_token_accuracy": 0.19094182252883912, "num_tokens": 28779882.0, "step": 16595 }, { "entropy": 5.512536239624024, "epoch": 1.291538611165143, "grad_norm": 1.0390625, "learning_rate": 0.000483588900419261, "loss": 5.1175, "mean_token_accuracy": 0.184048992395401, "num_tokens": 28788757.0, "step": 16600 }, { "entropy": 5.5078154563903805, "epoch": 1.2919276405368605, "grad_norm": 1.078125, "learning_rate": 0.0004835785080246864, "loss": 5.0308, "mean_token_accuracy": 0.20464495122432708, "num_tokens": 28797037.0, "step": 16605 }, { "entropy": 5.573528814315796, "epoch": 1.292316669908578, "grad_norm": 1.0546875, "learning_rate": 0.000483568112465265, "loss": 5.0778, "mean_token_accuracy": 0.19279929101467133, "num_tokens": 28805516.0, "step": 16610 }, { "entropy": 5.508523893356323, "epoch": 1.2927056992802957, "grad_norm": 1.1796875, "learning_rate": 0.00048355771374115436, "loss": 5.0534, "mean_token_accuracy": 0.1931885689496994, "num_tokens": 28813609.0, "step": 16615 }, { "entropy": 5.545459747314453, "epoch": 1.2930947286520134, "grad_norm": 1.015625, "learning_rate": 0.0004835473118525125, "loss": 5.0711, "mean_token_accuracy": 0.19255853146314622, "num_tokens": 28822156.0, "step": 16620 }, { "entropy": 5.493776941299439, "epoch": 1.2934837580237308, "grad_norm": 1.09375, "learning_rate": 0.0004835369067994971, "loss": 5.0736, "mean_token_accuracy": 0.19356129318475723, "num_tokens": 28830375.0, "step": 16625 }, { "entropy": 5.523644351959229, "epoch": 1.2938727873954483, "grad_norm": 1.125, "learning_rate": 0.000483526498582266, "loss": 5.1439, "mean_token_accuracy": 0.18733605444431306, "num_tokens": 28839144.0, "step": 16630 }, { "entropy": 5.594898414611817, "epoch": 1.294261816767166, "grad_norm": 1.0234375, "learning_rate": 0.00048351608720097715, "loss": 5.0949, "mean_token_accuracy": 0.18919123858213424, "num_tokens": 28847718.0, "step": 16635 }, { "entropy": 5.5137866020202635, "epoch": 1.2946508461388835, "grad_norm": 1.015625, "learning_rate": 0.00048350567265578867, "loss": 5.0625, "mean_token_accuracy": 0.1982119008898735, "num_tokens": 28856528.0, "step": 16640 }, { "entropy": 5.595721483230591, "epoch": 1.295039875510601, "grad_norm": 1.0390625, "learning_rate": 0.0004834952549468584, "loss": 5.1687, "mean_token_accuracy": 0.18531151562929155, "num_tokens": 28866328.0, "step": 16645 }, { "entropy": 5.538956260681152, "epoch": 1.2954289048823187, "grad_norm": 1.1015625, "learning_rate": 0.0004834848340743446, "loss": 5.0901, "mean_token_accuracy": 0.18923990726470946, "num_tokens": 28874977.0, "step": 16650 }, { "entropy": 5.486423826217651, "epoch": 1.2958179342540361, "grad_norm": 1.09375, "learning_rate": 0.0004834744100384052, "loss": 5.0044, "mean_token_accuracy": 0.20128463953733444, "num_tokens": 28883163.0, "step": 16655 }, { "entropy": 5.494342613220215, "epoch": 1.2962069636257538, "grad_norm": 1.09375, "learning_rate": 0.0004834639828391984, "loss": 5.0384, "mean_token_accuracy": 0.19653960615396499, "num_tokens": 28891730.0, "step": 16660 }, { "entropy": 5.592054986953736, "epoch": 1.2965959929974713, "grad_norm": 1.1015625, "learning_rate": 0.00048345355247688256, "loss": 5.2146, "mean_token_accuracy": 0.18622260987758638, "num_tokens": 28901065.0, "step": 16665 }, { "entropy": 5.531077241897583, "epoch": 1.296985022369189, "grad_norm": 1.0703125, "learning_rate": 0.0004834431189516158, "loss": 4.9931, "mean_token_accuracy": 0.19885778427124023, "num_tokens": 28909718.0, "step": 16670 }, { "entropy": 5.532374715805053, "epoch": 1.2973740517409065, "grad_norm": 1.1015625, "learning_rate": 0.0004834326822635565, "loss": 5.0966, "mean_token_accuracy": 0.19285767525434494, "num_tokens": 28918171.0, "step": 16675 }, { "entropy": 5.496357011795044, "epoch": 1.297763081112624, "grad_norm": 1.0625, "learning_rate": 0.00048342224241286296, "loss": 5.0109, "mean_token_accuracy": 0.20289627015590667, "num_tokens": 28926475.0, "step": 16680 }, { "entropy": 5.558602237701416, "epoch": 1.2981521104843416, "grad_norm": 1.140625, "learning_rate": 0.0004834117993996937, "loss": 5.1093, "mean_token_accuracy": 0.1954582676291466, "num_tokens": 28935521.0, "step": 16685 }, { "entropy": 5.514357852935791, "epoch": 1.2985411398560591, "grad_norm": 1.046875, "learning_rate": 0.0004834013532242071, "loss": 5.0421, "mean_token_accuracy": 0.18770486861467361, "num_tokens": 28943905.0, "step": 16690 }, { "entropy": 5.479977941513061, "epoch": 1.2989301692277766, "grad_norm": 1.1328125, "learning_rate": 0.0004833909038865616, "loss": 5.0845, "mean_token_accuracy": 0.1846332222223282, "num_tokens": 28952375.0, "step": 16695 }, { "entropy": 5.515368223190308, "epoch": 1.2993191985994943, "grad_norm": 1.09375, "learning_rate": 0.0004833804513869159, "loss": 5.0856, "mean_token_accuracy": 0.19784984439611436, "num_tokens": 28960640.0, "step": 16700 }, { "entropy": 5.525284051895142, "epoch": 1.2997082279712118, "grad_norm": 1.140625, "learning_rate": 0.0004833699957254284, "loss": 5.0684, "mean_token_accuracy": 0.19260049164295195, "num_tokens": 28969322.0, "step": 16705 }, { "entropy": 5.613003730773926, "epoch": 1.3000972573429295, "grad_norm": 0.97265625, "learning_rate": 0.000483359536902258, "loss": 5.1646, "mean_token_accuracy": 0.19030515998601913, "num_tokens": 28978471.0, "step": 16710 }, { "entropy": 5.500603294372558, "epoch": 1.300486286714647, "grad_norm": 1.203125, "learning_rate": 0.0004833490749175632, "loss": 4.9782, "mean_token_accuracy": 0.1997521013021469, "num_tokens": 28986627.0, "step": 16715 }, { "entropy": 5.485197257995606, "epoch": 1.3008753160863646, "grad_norm": 1.0546875, "learning_rate": 0.00048333860977150286, "loss": 5.0703, "mean_token_accuracy": 0.19697431474924088, "num_tokens": 28995647.0, "step": 16720 }, { "entropy": 5.6010294437408445, "epoch": 1.3012643454580821, "grad_norm": 1.125, "learning_rate": 0.00048332814146423566, "loss": 5.055, "mean_token_accuracy": 0.19352222979068756, "num_tokens": 29003591.0, "step": 16725 }, { "entropy": 5.499473285675049, "epoch": 1.3016533748297996, "grad_norm": 1.1328125, "learning_rate": 0.0004833176699959206, "loss": 4.9876, "mean_token_accuracy": 0.20607816129922868, "num_tokens": 29012150.0, "step": 16730 }, { "entropy": 5.501286172866822, "epoch": 1.3020424042015173, "grad_norm": 1.0625, "learning_rate": 0.00048330719536671633, "loss": 5.1095, "mean_token_accuracy": 0.19094256460666656, "num_tokens": 29020806.0, "step": 16735 }, { "entropy": 5.587902069091797, "epoch": 1.3024314335732348, "grad_norm": 1.0546875, "learning_rate": 0.000483296717576782, "loss": 5.1694, "mean_token_accuracy": 0.18659210205078125, "num_tokens": 29030074.0, "step": 16740 }, { "entropy": 5.5728682518005375, "epoch": 1.3028204629449522, "grad_norm": 1.0859375, "learning_rate": 0.0004832862366262765, "loss": 5.0753, "mean_token_accuracy": 0.1951389193534851, "num_tokens": 29038861.0, "step": 16745 }, { "entropy": 5.480522871017456, "epoch": 1.30320949231667, "grad_norm": 1.1875, "learning_rate": 0.00048327575251535886, "loss": 4.9338, "mean_token_accuracy": 0.20013366341590882, "num_tokens": 29046260.0, "step": 16750 }, { "entropy": 5.456730604171753, "epoch": 1.3035985216883874, "grad_norm": 1.125, "learning_rate": 0.0004832652652441883, "loss": 5.0021, "mean_token_accuracy": 0.19843949377536774, "num_tokens": 29054722.0, "step": 16755 }, { "entropy": 5.527504110336304, "epoch": 1.303987551060105, "grad_norm": 0.9921875, "learning_rate": 0.00048325477481292375, "loss": 5.0964, "mean_token_accuracy": 0.1871419832110405, "num_tokens": 29063700.0, "step": 16760 }, { "entropy": 5.522088956832886, "epoch": 1.3043765804318226, "grad_norm": 1.0390625, "learning_rate": 0.0004832442812217244, "loss": 4.9979, "mean_token_accuracy": 0.19686779230833054, "num_tokens": 29072254.0, "step": 16765 }, { "entropy": 5.524970865249633, "epoch": 1.3047656098035403, "grad_norm": 1.0625, "learning_rate": 0.0004832337844707496, "loss": 5.0952, "mean_token_accuracy": 0.19259236603975297, "num_tokens": 29081999.0, "step": 16770 }, { "entropy": 5.503440237045288, "epoch": 1.3051546391752578, "grad_norm": 1.078125, "learning_rate": 0.00048322328456015855, "loss": 5.0112, "mean_token_accuracy": 0.19622527211904525, "num_tokens": 29090493.0, "step": 16775 }, { "entropy": 5.571767854690552, "epoch": 1.3055436685469752, "grad_norm": 1.015625, "learning_rate": 0.00048321278149011053, "loss": 5.1075, "mean_token_accuracy": 0.19958551824092866, "num_tokens": 29099172.0, "step": 16780 }, { "entropy": 5.569439268112182, "epoch": 1.305932697918693, "grad_norm": 0.99609375, "learning_rate": 0.00048320227526076504, "loss": 5.1067, "mean_token_accuracy": 0.19150739014148713, "num_tokens": 29108234.0, "step": 16785 }, { "entropy": 5.576681232452392, "epoch": 1.3063217272904104, "grad_norm": 1.1015625, "learning_rate": 0.0004831917658722814, "loss": 5.1133, "mean_token_accuracy": 0.19355372190475464, "num_tokens": 29117307.0, "step": 16790 }, { "entropy": 5.555779218673706, "epoch": 1.3067107566621279, "grad_norm": 1.0546875, "learning_rate": 0.00048318125332481903, "loss": 5.1072, "mean_token_accuracy": 0.19167981594800948, "num_tokens": 29125552.0, "step": 16795 }, { "entropy": 5.531487274169922, "epoch": 1.3070997860338456, "grad_norm": 1.1171875, "learning_rate": 0.00048317073761853764, "loss": 4.9819, "mean_token_accuracy": 0.20302668809890748, "num_tokens": 29134559.0, "step": 16800 }, { "entropy": 5.574425792694091, "epoch": 1.307488815405563, "grad_norm": 1.0859375, "learning_rate": 0.0004831602187535965, "loss": 5.1536, "mean_token_accuracy": 0.18791132271289826, "num_tokens": 29143121.0, "step": 16805 }, { "entropy": 5.612791109085083, "epoch": 1.3078778447772808, "grad_norm": 1.0625, "learning_rate": 0.0004831496967301554, "loss": 5.165, "mean_token_accuracy": 0.18933375626802446, "num_tokens": 29153012.0, "step": 16810 }, { "entropy": 5.61829981803894, "epoch": 1.3082668741489982, "grad_norm": 1.171875, "learning_rate": 0.00048313917154837386, "loss": 5.0861, "mean_token_accuracy": 0.18930458575487136, "num_tokens": 29161451.0, "step": 16815 }, { "entropy": 5.496663665771484, "epoch": 1.308655903520716, "grad_norm": 1.0859375, "learning_rate": 0.0004831286432084118, "loss": 5.0673, "mean_token_accuracy": 0.1879603996872902, "num_tokens": 29170691.0, "step": 16820 }, { "entropy": 5.569409036636353, "epoch": 1.3090449328924334, "grad_norm": 1.1484375, "learning_rate": 0.0004831181117104289, "loss": 5.0409, "mean_token_accuracy": 0.19415445178747176, "num_tokens": 29179111.0, "step": 16825 }, { "entropy": 5.630125999450684, "epoch": 1.3094339622641509, "grad_norm": 1.109375, "learning_rate": 0.00048310757705458476, "loss": 5.1631, "mean_token_accuracy": 0.18859304636716842, "num_tokens": 29187444.0, "step": 16830 }, { "entropy": 5.504996013641358, "epoch": 1.3098229916358686, "grad_norm": 1.0390625, "learning_rate": 0.00048309703924103944, "loss": 5.0476, "mean_token_accuracy": 0.2017731711268425, "num_tokens": 29196830.0, "step": 16835 }, { "entropy": 5.459016180038452, "epoch": 1.310212021007586, "grad_norm": 1.109375, "learning_rate": 0.00048308649826995283, "loss": 5.0153, "mean_token_accuracy": 0.19524496495723725, "num_tokens": 29205587.0, "step": 16840 }, { "entropy": 5.538132858276367, "epoch": 1.3106010503793035, "grad_norm": 1.09375, "learning_rate": 0.00048307595414148475, "loss": 5.1125, "mean_token_accuracy": 0.1906437784433365, "num_tokens": 29213961.0, "step": 16845 }, { "entropy": 5.5479536056518555, "epoch": 1.3109900797510212, "grad_norm": 1.0546875, "learning_rate": 0.0004830654068557952, "loss": 5.1051, "mean_token_accuracy": 0.18761806339025497, "num_tokens": 29222744.0, "step": 16850 }, { "entropy": 5.5231012344360355, "epoch": 1.3113791091227387, "grad_norm": 1.140625, "learning_rate": 0.0004830548564130444, "loss": 5.0758, "mean_token_accuracy": 0.20277958512306213, "num_tokens": 29231378.0, "step": 16855 }, { "entropy": 5.511657762527466, "epoch": 1.3117681384944564, "grad_norm": 1.1796875, "learning_rate": 0.00048304430281339216, "loss": 5.0414, "mean_token_accuracy": 0.19683454036712647, "num_tokens": 29238909.0, "step": 16860 }, { "entropy": 5.457151556015015, "epoch": 1.3121571678661739, "grad_norm": 1.078125, "learning_rate": 0.0004830337460569989, "loss": 4.9761, "mean_token_accuracy": 0.2008628159761429, "num_tokens": 29247132.0, "step": 16865 }, { "entropy": 5.6079387187957765, "epoch": 1.3125461972378916, "grad_norm": 1.03125, "learning_rate": 0.0004830231861440246, "loss": 5.112, "mean_token_accuracy": 0.19339798837900163, "num_tokens": 29255322.0, "step": 16870 }, { "entropy": 5.635947132110596, "epoch": 1.312935226609609, "grad_norm": 1.046875, "learning_rate": 0.0004830126230746295, "loss": 5.1624, "mean_token_accuracy": 0.18725260496139526, "num_tokens": 29265000.0, "step": 16875 }, { "entropy": 5.538443183898925, "epoch": 1.3133242559813265, "grad_norm": 1.0859375, "learning_rate": 0.00048300205684897405, "loss": 5.0459, "mean_token_accuracy": 0.19440464824438095, "num_tokens": 29273139.0, "step": 16880 }, { "entropy": 5.567435216903687, "epoch": 1.3137132853530442, "grad_norm": 1.0859375, "learning_rate": 0.0004829914874672184, "loss": 5.1128, "mean_token_accuracy": 0.1865583539009094, "num_tokens": 29281734.0, "step": 16885 }, { "entropy": 5.5537354946136475, "epoch": 1.3141023147247617, "grad_norm": 1.015625, "learning_rate": 0.00048298091492952297, "loss": 5.0167, "mean_token_accuracy": 0.18811049163341523, "num_tokens": 29290296.0, "step": 16890 }, { "entropy": 5.614425373077393, "epoch": 1.3144913440964792, "grad_norm": 1.09375, "learning_rate": 0.0004829703392360482, "loss": 5.1712, "mean_token_accuracy": 0.19014693051576614, "num_tokens": 29298164.0, "step": 16895 }, { "entropy": 5.506893873214722, "epoch": 1.3148803734681969, "grad_norm": 1.109375, "learning_rate": 0.00048295976038695455, "loss": 4.9782, "mean_token_accuracy": 0.19886327683925628, "num_tokens": 29307420.0, "step": 16900 }, { "entropy": 5.579666471481323, "epoch": 1.3152694028399143, "grad_norm": 1.1171875, "learning_rate": 0.0004829491783824025, "loss": 5.1092, "mean_token_accuracy": 0.19567200541496277, "num_tokens": 29316041.0, "step": 16905 }, { "entropy": 5.520770645141601, "epoch": 1.315658432211632, "grad_norm": 1.2421875, "learning_rate": 0.00048293859322255276, "loss": 5.058, "mean_token_accuracy": 0.19597916156053544, "num_tokens": 29323750.0, "step": 16910 }, { "entropy": 5.471966791152954, "epoch": 1.3160474615833495, "grad_norm": 1.1171875, "learning_rate": 0.0004829280049075657, "loss": 4.9623, "mean_token_accuracy": 0.203752002120018, "num_tokens": 29333108.0, "step": 16915 }, { "entropy": 5.585264730453491, "epoch": 1.3164364909550672, "grad_norm": 1.0703125, "learning_rate": 0.00048291741343760216, "loss": 5.0947, "mean_token_accuracy": 0.19052098244428634, "num_tokens": 29341976.0, "step": 16920 }, { "entropy": 5.592809057235717, "epoch": 1.3168255203267847, "grad_norm": 1.109375, "learning_rate": 0.0004829068188128229, "loss": 5.0373, "mean_token_accuracy": 0.19758483469486238, "num_tokens": 29350517.0, "step": 16925 }, { "entropy": 5.584476661682129, "epoch": 1.3172145496985022, "grad_norm": 1.0703125, "learning_rate": 0.0004828962210333885, "loss": 5.1044, "mean_token_accuracy": 0.18689894825220107, "num_tokens": 29359410.0, "step": 16930 }, { "entropy": 5.537783575057984, "epoch": 1.3176035790702199, "grad_norm": 1.1953125, "learning_rate": 0.0004828856200994598, "loss": 4.9277, "mean_token_accuracy": 0.2034487783908844, "num_tokens": 29367164.0, "step": 16935 }, { "entropy": 5.539615249633789, "epoch": 1.3179926084419373, "grad_norm": 1.140625, "learning_rate": 0.0004828750160111978, "loss": 5.1279, "mean_token_accuracy": 0.19479843229055405, "num_tokens": 29375700.0, "step": 16940 }, { "entropy": 5.482031726837159, "epoch": 1.3183816378136548, "grad_norm": 1.09375, "learning_rate": 0.00048286440876876325, "loss": 4.9437, "mean_token_accuracy": 0.20310419648885727, "num_tokens": 29383953.0, "step": 16945 }, { "entropy": 5.452842140197754, "epoch": 1.3187706671853725, "grad_norm": 1.109375, "learning_rate": 0.00048285379837231714, "loss": 4.9269, "mean_token_accuracy": 0.20126338303089142, "num_tokens": 29391995.0, "step": 16950 }, { "entropy": 5.524240970611572, "epoch": 1.31915969655709, "grad_norm": 1.1875, "learning_rate": 0.0004828431848220205, "loss": 5.0205, "mean_token_accuracy": 0.19970037788152695, "num_tokens": 29400358.0, "step": 16955 }, { "entropy": 5.528271722793579, "epoch": 1.3195487259288077, "grad_norm": 1.0546875, "learning_rate": 0.0004828325681180343, "loss": 5.1426, "mean_token_accuracy": 0.1882537841796875, "num_tokens": 29408598.0, "step": 16960 }, { "entropy": 5.609574794769287, "epoch": 1.3199377553005252, "grad_norm": 1.125, "learning_rate": 0.0004828219482605197, "loss": 5.1898, "mean_token_accuracy": 0.18205541670322417, "num_tokens": 29416623.0, "step": 16965 }, { "entropy": 5.557714891433716, "epoch": 1.3203267846722428, "grad_norm": 1.125, "learning_rate": 0.00048281132524963786, "loss": 5.0657, "mean_token_accuracy": 0.20188557207584382, "num_tokens": 29424593.0, "step": 16970 }, { "entropy": 5.5288519859313965, "epoch": 1.3207158140439603, "grad_norm": 1.0390625, "learning_rate": 0.0004828006990855499, "loss": 5.0791, "mean_token_accuracy": 0.19430007934570312, "num_tokens": 29433405.0, "step": 16975 }, { "entropy": 5.528368854522705, "epoch": 1.3211048434156778, "grad_norm": 1.203125, "learning_rate": 0.00048279006976841704, "loss": 5.0546, "mean_token_accuracy": 0.1956000655889511, "num_tokens": 29441714.0, "step": 16980 }, { "entropy": 5.546284246444702, "epoch": 1.3214938727873955, "grad_norm": 1.1328125, "learning_rate": 0.0004827794372984007, "loss": 5.0004, "mean_token_accuracy": 0.20161654353141784, "num_tokens": 29450594.0, "step": 16985 }, { "entropy": 5.506742858886719, "epoch": 1.321882902159113, "grad_norm": 1.078125, "learning_rate": 0.000482768801675662, "loss": 5.0154, "mean_token_accuracy": 0.19701900482177734, "num_tokens": 29459208.0, "step": 16990 }, { "entropy": 5.556023168563843, "epoch": 1.3222719315308304, "grad_norm": 1.1171875, "learning_rate": 0.0004827581629003625, "loss": 5.1031, "mean_token_accuracy": 0.18960306495428086, "num_tokens": 29467766.0, "step": 16995 }, { "entropy": 5.583490800857544, "epoch": 1.3226609609025481, "grad_norm": 1.1015625, "learning_rate": 0.00048274752097266356, "loss": 5.0507, "mean_token_accuracy": 0.19262328445911409, "num_tokens": 29476732.0, "step": 17000 }, { "entropy": 5.605873012542725, "epoch": 1.3230499902742658, "grad_norm": 1.1015625, "learning_rate": 0.0004827368758927266, "loss": 5.1497, "mean_token_accuracy": 0.18411410748958587, "num_tokens": 29485199.0, "step": 17005 }, { "entropy": 5.537188386917114, "epoch": 1.3234390196459833, "grad_norm": 1.1328125, "learning_rate": 0.0004827262276607132, "loss": 5.0599, "mean_token_accuracy": 0.19417423605918885, "num_tokens": 29493039.0, "step": 17010 }, { "entropy": 5.56510009765625, "epoch": 1.3238280490177008, "grad_norm": 1.1171875, "learning_rate": 0.000482715576276785, "loss": 5.0585, "mean_token_accuracy": 0.19691295474767684, "num_tokens": 29501655.0, "step": 17015 }, { "entropy": 5.613816547393799, "epoch": 1.3242170783894185, "grad_norm": 1.109375, "learning_rate": 0.0004827049217411035, "loss": 5.111, "mean_token_accuracy": 0.1867526188492775, "num_tokens": 29510261.0, "step": 17020 }, { "entropy": 5.519961786270142, "epoch": 1.324606107761136, "grad_norm": 1.0625, "learning_rate": 0.00048269426405383043, "loss": 4.9453, "mean_token_accuracy": 0.2027512952685356, "num_tokens": 29518382.0, "step": 17025 }, { "entropy": 5.512136936187744, "epoch": 1.3249951371328534, "grad_norm": 1.1015625, "learning_rate": 0.00048268360321512745, "loss": 5.057, "mean_token_accuracy": 0.190300789475441, "num_tokens": 29526814.0, "step": 17030 }, { "entropy": 5.599355983734131, "epoch": 1.3253841665045711, "grad_norm": 1.1796875, "learning_rate": 0.0004826729392251564, "loss": 5.0943, "mean_token_accuracy": 0.19459279924631118, "num_tokens": 29535169.0, "step": 17035 }, { "entropy": 5.626461219787598, "epoch": 1.3257731958762886, "grad_norm": 1.0859375, "learning_rate": 0.000482662272084079, "loss": 5.1579, "mean_token_accuracy": 0.19368110597133636, "num_tokens": 29543368.0, "step": 17040 }, { "entropy": 5.597419738769531, "epoch": 1.326162225248006, "grad_norm": 1.0078125, "learning_rate": 0.0004826516017920571, "loss": 5.118, "mean_token_accuracy": 0.18922984153032302, "num_tokens": 29553042.0, "step": 17045 }, { "entropy": 5.6120974063873295, "epoch": 1.3265512546197238, "grad_norm": 1.078125, "learning_rate": 0.0004826409283492528, "loss": 5.1149, "mean_token_accuracy": 0.19020629227161406, "num_tokens": 29561787.0, "step": 17050 }, { "entropy": 5.544434881210327, "epoch": 1.3269402839914415, "grad_norm": 1.03125, "learning_rate": 0.00048263025175582783, "loss": 5.1137, "mean_token_accuracy": 0.1880372181534767, "num_tokens": 29570243.0, "step": 17055 }, { "entropy": 5.544651651382447, "epoch": 1.327329313363159, "grad_norm": 1.125, "learning_rate": 0.0004826195720119442, "loss": 5.0733, "mean_token_accuracy": 0.1981926068663597, "num_tokens": 29578560.0, "step": 17060 }, { "entropy": 5.598849821090698, "epoch": 1.3277183427348764, "grad_norm": 1.1328125, "learning_rate": 0.0004826088891177641, "loss": 5.1197, "mean_token_accuracy": 0.1871596395969391, "num_tokens": 29587441.0, "step": 17065 }, { "entropy": 5.5302722454071045, "epoch": 1.3281073721065941, "grad_norm": 1.1796875, "learning_rate": 0.00048259820307344954, "loss": 5.0239, "mean_token_accuracy": 0.19634164571762086, "num_tokens": 29596372.0, "step": 17070 }, { "entropy": 5.546082544326782, "epoch": 1.3284964014783116, "grad_norm": 1.0625, "learning_rate": 0.00048258751387916267, "loss": 5.0978, "mean_token_accuracy": 0.19748930633068085, "num_tokens": 29605263.0, "step": 17075 }, { "entropy": 5.537404870986938, "epoch": 1.328885430850029, "grad_norm": 1.046875, "learning_rate": 0.00048257682153506564, "loss": 5.1308, "mean_token_accuracy": 0.193301922082901, "num_tokens": 29614397.0, "step": 17080 }, { "entropy": 5.630432844161987, "epoch": 1.3292744602217468, "grad_norm": 1.1484375, "learning_rate": 0.0004825661260413208, "loss": 5.1837, "mean_token_accuracy": 0.18694810271263124, "num_tokens": 29622996.0, "step": 17085 }, { "entropy": 5.539497661590576, "epoch": 1.3296634895934643, "grad_norm": 1.046875, "learning_rate": 0.00048255542739809035, "loss": 4.9952, "mean_token_accuracy": 0.2008394867181778, "num_tokens": 29630960.0, "step": 17090 }, { "entropy": 5.59538164138794, "epoch": 1.330052518965182, "grad_norm": 1.1171875, "learning_rate": 0.00048254472560553665, "loss": 5.1535, "mean_token_accuracy": 0.18763921707868575, "num_tokens": 29639520.0, "step": 17095 }, { "entropy": 5.516068029403686, "epoch": 1.3304415483368994, "grad_norm": 1.0078125, "learning_rate": 0.00048253402066382207, "loss": 5.0172, "mean_token_accuracy": 0.19877759665250777, "num_tokens": 29648542.0, "step": 17100 }, { "entropy": 5.539023351669312, "epoch": 1.3308305777086171, "grad_norm": 1.1015625, "learning_rate": 0.0004825233125731091, "loss": 5.0227, "mean_token_accuracy": 0.18925854861736296, "num_tokens": 29657604.0, "step": 17105 }, { "entropy": 5.609941720962524, "epoch": 1.3312196070803346, "grad_norm": 1.140625, "learning_rate": 0.00048251260133356014, "loss": 5.1401, "mean_token_accuracy": 0.19245071709156036, "num_tokens": 29665811.0, "step": 17110 }, { "entropy": 5.503051328659057, "epoch": 1.331608636452052, "grad_norm": 1.0390625, "learning_rate": 0.00048250188694533774, "loss": 5.0506, "mean_token_accuracy": 0.18603211492300034, "num_tokens": 29674851.0, "step": 17115 }, { "entropy": 5.535083389282226, "epoch": 1.3319976658237698, "grad_norm": 1.1015625, "learning_rate": 0.0004824911694086044, "loss": 5.0187, "mean_token_accuracy": 0.19593706130981445, "num_tokens": 29683478.0, "step": 17120 }, { "entropy": 5.499434614181519, "epoch": 1.3323866951954872, "grad_norm": 1.046875, "learning_rate": 0.000482480448723523, "loss": 5.0219, "mean_token_accuracy": 0.19217196404933928, "num_tokens": 29691765.0, "step": 17125 }, { "entropy": 5.57268009185791, "epoch": 1.3327757245672047, "grad_norm": 1.0859375, "learning_rate": 0.00048246972489025586, "loss": 5.0339, "mean_token_accuracy": 0.19644560813903808, "num_tokens": 29700271.0, "step": 17130 }, { "entropy": 5.59065203666687, "epoch": 1.3331647539389224, "grad_norm": 1.0546875, "learning_rate": 0.00048245899790896597, "loss": 5.1107, "mean_token_accuracy": 0.19127732813358306, "num_tokens": 29709004.0, "step": 17135 }, { "entropy": 5.555433130264282, "epoch": 1.33355378331064, "grad_norm": 1.15625, "learning_rate": 0.0004824482677798159, "loss": 5.0459, "mean_token_accuracy": 0.19528018236160277, "num_tokens": 29717479.0, "step": 17140 }, { "entropy": 5.543634223937988, "epoch": 1.3339428126823576, "grad_norm": 1.1015625, "learning_rate": 0.00048243753450296863, "loss": 5.0705, "mean_token_accuracy": 0.19502720683813096, "num_tokens": 29725859.0, "step": 17145 }, { "entropy": 5.494951343536377, "epoch": 1.334331842054075, "grad_norm": 1.0859375, "learning_rate": 0.00048242679807858693, "loss": 5.0405, "mean_token_accuracy": 0.1928912043571472, "num_tokens": 29734201.0, "step": 17150 }, { "entropy": 5.561113882064819, "epoch": 1.3347208714257928, "grad_norm": 1.140625, "learning_rate": 0.00048241605850683365, "loss": 5.0449, "mean_token_accuracy": 0.1934991106390953, "num_tokens": 29742552.0, "step": 17155 }, { "entropy": 5.488109445571899, "epoch": 1.3351099007975102, "grad_norm": 1.046875, "learning_rate": 0.00048240531578787197, "loss": 5.0335, "mean_token_accuracy": 0.19432728886604309, "num_tokens": 29751297.0, "step": 17160 }, { "entropy": 5.496108865737915, "epoch": 1.3354989301692277, "grad_norm": 1.1015625, "learning_rate": 0.0004823945699218647, "loss": 5.113, "mean_token_accuracy": 0.19043429642915727, "num_tokens": 29759262.0, "step": 17165 }, { "entropy": 5.567288780212403, "epoch": 1.3358879595409454, "grad_norm": 1.0546875, "learning_rate": 0.0004823838209089749, "loss": 5.104, "mean_token_accuracy": 0.18988242894411086, "num_tokens": 29767428.0, "step": 17170 }, { "entropy": 5.628966188430786, "epoch": 1.3362769889126629, "grad_norm": 1.0703125, "learning_rate": 0.00048237306874936565, "loss": 5.0888, "mean_token_accuracy": 0.19549930542707444, "num_tokens": 29776252.0, "step": 17175 }, { "entropy": 5.540105962753296, "epoch": 1.3366660182843804, "grad_norm": 1.1328125, "learning_rate": 0.0004823623134432001, "loss": 5.0378, "mean_token_accuracy": 0.18961155712604522, "num_tokens": 29784520.0, "step": 17180 }, { "entropy": 5.551808071136475, "epoch": 1.337055047656098, "grad_norm": 1.1796875, "learning_rate": 0.00048235155499064166, "loss": 5.165, "mean_token_accuracy": 0.18573916852474212, "num_tokens": 29793452.0, "step": 17185 }, { "entropy": 5.497555875778199, "epoch": 1.3374440770278155, "grad_norm": 1.1171875, "learning_rate": 0.00048234079339185335, "loss": 5.0021, "mean_token_accuracy": 0.19956104457378387, "num_tokens": 29802278.0, "step": 17190 }, { "entropy": 5.6366273880004885, "epoch": 1.3378331063995332, "grad_norm": 1.1171875, "learning_rate": 0.00048233002864699856, "loss": 5.1621, "mean_token_accuracy": 0.1898314505815506, "num_tokens": 29811302.0, "step": 17195 }, { "entropy": 5.480880784988403, "epoch": 1.3382221357712507, "grad_norm": 1.125, "learning_rate": 0.0004823192607562405, "loss": 4.9221, "mean_token_accuracy": 0.20390674471855164, "num_tokens": 29819555.0, "step": 17200 }, { "entropy": 5.515711927413941, "epoch": 1.3386111651429684, "grad_norm": 1.0390625, "learning_rate": 0.00048230848971974265, "loss": 5.1968, "mean_token_accuracy": 0.18707700520753862, "num_tokens": 29828929.0, "step": 17205 }, { "entropy": 5.635153341293335, "epoch": 1.3390001945146859, "grad_norm": 1.1875, "learning_rate": 0.0004822977155376684, "loss": 5.184, "mean_token_accuracy": 0.1915266200900078, "num_tokens": 29837703.0, "step": 17210 }, { "entropy": 5.5148398876190186, "epoch": 1.3393892238864034, "grad_norm": 1.0859375, "learning_rate": 0.0004822869382101814, "loss": 4.9623, "mean_token_accuracy": 0.198391392827034, "num_tokens": 29846053.0, "step": 17215 }, { "entropy": 5.455366611480713, "epoch": 1.339778253258121, "grad_norm": 1.078125, "learning_rate": 0.0004822761577374449, "loss": 4.9895, "mean_token_accuracy": 0.204795441031456, "num_tokens": 29854970.0, "step": 17220 }, { "entropy": 5.545156049728393, "epoch": 1.3401672826298385, "grad_norm": 1.0234375, "learning_rate": 0.0004822653741196227, "loss": 5.0912, "mean_token_accuracy": 0.19040034115314483, "num_tokens": 29863835.0, "step": 17225 }, { "entropy": 5.541007852554321, "epoch": 1.340556312001556, "grad_norm": 1.046875, "learning_rate": 0.0004822545873568783, "loss": 5.0564, "mean_token_accuracy": 0.1968723341822624, "num_tokens": 29872149.0, "step": 17230 }, { "entropy": 5.551089239120484, "epoch": 1.3409453413732737, "grad_norm": 1.125, "learning_rate": 0.00048224379744937545, "loss": 5.0708, "mean_token_accuracy": 0.19499320685863494, "num_tokens": 29880503.0, "step": 17235 }, { "entropy": 5.506267499923706, "epoch": 1.3413343707449912, "grad_norm": 1.1171875, "learning_rate": 0.00048223300439727783, "loss": 5.1295, "mean_token_accuracy": 0.18950352370738982, "num_tokens": 29889090.0, "step": 17240 }, { "entropy": 5.558257341384888, "epoch": 1.3417234001167089, "grad_norm": 1.140625, "learning_rate": 0.00048222220820074926, "loss": 5.0083, "mean_token_accuracy": 0.19792360812425613, "num_tokens": 29897681.0, "step": 17245 }, { "entropy": 5.57754545211792, "epoch": 1.3421124294884264, "grad_norm": 1.140625, "learning_rate": 0.00048221140885995346, "loss": 5.1354, "mean_token_accuracy": 0.18972157388925553, "num_tokens": 29905415.0, "step": 17250 }, { "entropy": 5.565930652618408, "epoch": 1.342501458860144, "grad_norm": 1.0078125, "learning_rate": 0.0004822006063750543, "loss": 5.0502, "mean_token_accuracy": 0.19440682530403136, "num_tokens": 29914876.0, "step": 17255 }, { "entropy": 5.576021575927735, "epoch": 1.3428904882318615, "grad_norm": 1.1015625, "learning_rate": 0.00048218980074621575, "loss": 5.1366, "mean_token_accuracy": 0.18949638605117797, "num_tokens": 29923965.0, "step": 17260 }, { "entropy": 5.564385652542114, "epoch": 1.343279517603579, "grad_norm": 1.0625, "learning_rate": 0.00048217899197360183, "loss": 5.0582, "mean_token_accuracy": 0.19049679934978486, "num_tokens": 29932618.0, "step": 17265 }, { "entropy": 5.616783475875854, "epoch": 1.3436685469752967, "grad_norm": 1.015625, "learning_rate": 0.0004821681800573764, "loss": 5.1547, "mean_token_accuracy": 0.19399770945310593, "num_tokens": 29941314.0, "step": 17270 }, { "entropy": 5.609663391113282, "epoch": 1.3440575763470142, "grad_norm": 1.0703125, "learning_rate": 0.0004821573649977036, "loss": 5.1169, "mean_token_accuracy": 0.18683778196573259, "num_tokens": 29949808.0, "step": 17275 }, { "entropy": 5.537212228775024, "epoch": 1.3444466057187316, "grad_norm": 1.140625, "learning_rate": 0.00048214654679474753, "loss": 5.0833, "mean_token_accuracy": 0.1958432376384735, "num_tokens": 29959225.0, "step": 17280 }, { "entropy": 5.546075868606567, "epoch": 1.3448356350904493, "grad_norm": 1.0625, "learning_rate": 0.00048213572544867224, "loss": 5.1206, "mean_token_accuracy": 0.1891117811203003, "num_tokens": 29968668.0, "step": 17285 }, { "entropy": 5.535118865966797, "epoch": 1.3452246644621668, "grad_norm": 0.99609375, "learning_rate": 0.00048212490095964213, "loss": 5.1133, "mean_token_accuracy": 0.18940555453300476, "num_tokens": 29977502.0, "step": 17290 }, { "entropy": 5.488551950454712, "epoch": 1.3456136938338845, "grad_norm": 1.15625, "learning_rate": 0.0004821140733278212, "loss": 4.9988, "mean_token_accuracy": 0.19297264218330384, "num_tokens": 29986444.0, "step": 17295 }, { "entropy": 5.625052833557129, "epoch": 1.346002723205602, "grad_norm": 1.078125, "learning_rate": 0.0004821032425533739, "loss": 5.1628, "mean_token_accuracy": 0.1863955855369568, "num_tokens": 29995071.0, "step": 17300 }, { "entropy": 5.583033704757691, "epoch": 1.3463917525773197, "grad_norm": 1.0859375, "learning_rate": 0.0004820924086364646, "loss": 5.0707, "mean_token_accuracy": 0.18945569545030594, "num_tokens": 30003071.0, "step": 17305 }, { "entropy": 5.5127723693847654, "epoch": 1.3467807819490372, "grad_norm": 0.96875, "learning_rate": 0.00048208157157725756, "loss": 5.0573, "mean_token_accuracy": 0.19626446962356567, "num_tokens": 30011899.0, "step": 17310 }, { "entropy": 5.529442024230957, "epoch": 1.3471698113207546, "grad_norm": 1.1171875, "learning_rate": 0.00048207073137591726, "loss": 4.992, "mean_token_accuracy": 0.20535602569580078, "num_tokens": 30020454.0, "step": 17315 }, { "entropy": 5.515955877304077, "epoch": 1.3475588406924723, "grad_norm": 1.125, "learning_rate": 0.00048205988803260824, "loss": 5.053, "mean_token_accuracy": 0.19165019541978837, "num_tokens": 30028095.0, "step": 17320 }, { "entropy": 5.53240270614624, "epoch": 1.3479478700641898, "grad_norm": 1.0078125, "learning_rate": 0.00048204904154749496, "loss": 5.0828, "mean_token_accuracy": 0.1942714512348175, "num_tokens": 30037051.0, "step": 17325 }, { "entropy": 5.593975305557251, "epoch": 1.3483368994359073, "grad_norm": 1.109375, "learning_rate": 0.00048203819192074206, "loss": 5.061, "mean_token_accuracy": 0.19956636130809785, "num_tokens": 30045513.0, "step": 17330 }, { "entropy": 5.596064901351928, "epoch": 1.348725928807625, "grad_norm": 1.0703125, "learning_rate": 0.00048202733915251407, "loss": 5.1055, "mean_token_accuracy": 0.1856134831905365, "num_tokens": 30054132.0, "step": 17335 }, { "entropy": 5.548170518875122, "epoch": 1.3491149581793425, "grad_norm": 1.109375, "learning_rate": 0.00048201648324297573, "loss": 5.1711, "mean_token_accuracy": 0.19005759209394454, "num_tokens": 30062850.0, "step": 17340 }, { "entropy": 5.498459196090698, "epoch": 1.3495039875510602, "grad_norm": 1.1171875, "learning_rate": 0.00048200562419229185, "loss": 5.0305, "mean_token_accuracy": 0.1962674990296364, "num_tokens": 30072186.0, "step": 17345 }, { "entropy": 5.557011508941651, "epoch": 1.3498930169227776, "grad_norm": 1.0390625, "learning_rate": 0.000481994762000627, "loss": 5.052, "mean_token_accuracy": 0.1971317023038864, "num_tokens": 30080931.0, "step": 17350 }, { "entropy": 5.5418037414550785, "epoch": 1.3502820462944953, "grad_norm": 1.125, "learning_rate": 0.00048198389666814616, "loss": 5.0152, "mean_token_accuracy": 0.19672925770282745, "num_tokens": 30089607.0, "step": 17355 }, { "entropy": 5.583463191986084, "epoch": 1.3506710756662128, "grad_norm": 1.1171875, "learning_rate": 0.00048197302819501416, "loss": 5.1899, "mean_token_accuracy": 0.18593638986349106, "num_tokens": 30098893.0, "step": 17360 }, { "entropy": 5.629031991958618, "epoch": 1.3510601050379303, "grad_norm": 1.109375, "learning_rate": 0.00048196215658139586, "loss": 5.1011, "mean_token_accuracy": 0.19326601624488832, "num_tokens": 30107304.0, "step": 17365 }, { "entropy": 5.646771192550659, "epoch": 1.351449134409648, "grad_norm": 1.1015625, "learning_rate": 0.0004819512818274562, "loss": 5.1607, "mean_token_accuracy": 0.19044991135597228, "num_tokens": 30116196.0, "step": 17370 }, { "entropy": 5.5932622909545895, "epoch": 1.3518381637813655, "grad_norm": 1.0234375, "learning_rate": 0.0004819404039333603, "loss": 5.0905, "mean_token_accuracy": 0.18964900821447372, "num_tokens": 30124691.0, "step": 17375 }, { "entropy": 5.584123229980468, "epoch": 1.352227193153083, "grad_norm": 1.1484375, "learning_rate": 0.0004819295228992731, "loss": 5.0706, "mean_token_accuracy": 0.189251109957695, "num_tokens": 30133824.0, "step": 17380 }, { "entropy": 5.555778312683105, "epoch": 1.3526162225248006, "grad_norm": 1.171875, "learning_rate": 0.00048191863872535984, "loss": 5.0254, "mean_token_accuracy": 0.19817333221435546, "num_tokens": 30142327.0, "step": 17385 }, { "entropy": 5.572787523269653, "epoch": 1.3530052518965183, "grad_norm": 1.0703125, "learning_rate": 0.0004819077514117855, "loss": 5.0624, "mean_token_accuracy": 0.19490636140108109, "num_tokens": 30150774.0, "step": 17390 }, { "entropy": 5.510891914367676, "epoch": 1.3533942812682358, "grad_norm": 1.0859375, "learning_rate": 0.00048189686095871545, "loss": 4.9694, "mean_token_accuracy": 0.19359280169010162, "num_tokens": 30158593.0, "step": 17395 }, { "entropy": 5.5235076427459715, "epoch": 1.3537833106399533, "grad_norm": 1.109375, "learning_rate": 0.00048188596736631475, "loss": 5.0428, "mean_token_accuracy": 0.19750061333179475, "num_tokens": 30166556.0, "step": 17400 }, { "entropy": 5.499352025985718, "epoch": 1.354172340011671, "grad_norm": 1.0859375, "learning_rate": 0.00048187507063474885, "loss": 5.0143, "mean_token_accuracy": 0.19385875314474105, "num_tokens": 30175082.0, "step": 17405 }, { "entropy": 5.531732988357544, "epoch": 1.3545613693833884, "grad_norm": 1.15625, "learning_rate": 0.00048186417076418294, "loss": 5.1046, "mean_token_accuracy": 0.20032892972230912, "num_tokens": 30184024.0, "step": 17410 }, { "entropy": 5.597299003601075, "epoch": 1.354950398755106, "grad_norm": 1.0859375, "learning_rate": 0.00048185326775478256, "loss": 5.0382, "mean_token_accuracy": 0.19109995812177658, "num_tokens": 30192083.0, "step": 17415 }, { "entropy": 5.5226678371429445, "epoch": 1.3553394281268236, "grad_norm": 1.09375, "learning_rate": 0.00048184236160671306, "loss": 4.9534, "mean_token_accuracy": 0.20559277534484863, "num_tokens": 30199731.0, "step": 17420 }, { "entropy": 5.465492868423462, "epoch": 1.355728457498541, "grad_norm": 1.09375, "learning_rate": 0.00048183145232013995, "loss": 5.0636, "mean_token_accuracy": 0.1919456973671913, "num_tokens": 30207444.0, "step": 17425 }, { "entropy": 5.577214622497559, "epoch": 1.3561174868702586, "grad_norm": 1.1015625, "learning_rate": 0.00048182053989522883, "loss": 5.1771, "mean_token_accuracy": 0.18968395590782167, "num_tokens": 30215716.0, "step": 17430 }, { "entropy": 5.468042850494385, "epoch": 1.3565065162419763, "grad_norm": 1.0859375, "learning_rate": 0.00048180962433214515, "loss": 4.9319, "mean_token_accuracy": 0.2024299219250679, "num_tokens": 30223910.0, "step": 17435 }, { "entropy": 5.5320042133331295, "epoch": 1.356895545613694, "grad_norm": 1.09375, "learning_rate": 0.00048179870563105453, "loss": 5.0644, "mean_token_accuracy": 0.1996099129319191, "num_tokens": 30233234.0, "step": 17440 }, { "entropy": 5.501065111160278, "epoch": 1.3572845749854114, "grad_norm": 1.0625, "learning_rate": 0.0004817877837921228, "loss": 5.0286, "mean_token_accuracy": 0.19719744175672532, "num_tokens": 30242264.0, "step": 17445 }, { "entropy": 5.572187805175782, "epoch": 1.357673604357129, "grad_norm": 1.1640625, "learning_rate": 0.0004817768588155155, "loss": 5.0613, "mean_token_accuracy": 0.19251794666051864, "num_tokens": 30250606.0, "step": 17450 }, { "entropy": 5.611683988571167, "epoch": 1.3580626337288466, "grad_norm": 1.046875, "learning_rate": 0.00048176593070139865, "loss": 5.1933, "mean_token_accuracy": 0.18453987091779708, "num_tokens": 30259197.0, "step": 17455 }, { "entropy": 5.484611940383911, "epoch": 1.358451663100564, "grad_norm": 1.0078125, "learning_rate": 0.00048175499944993767, "loss": 4.9734, "mean_token_accuracy": 0.2062402233481407, "num_tokens": 30267896.0, "step": 17460 }, { "entropy": 5.57444429397583, "epoch": 1.3588406924722816, "grad_norm": 1.0234375, "learning_rate": 0.00048174406506129884, "loss": 5.108, "mean_token_accuracy": 0.1988934725522995, "num_tokens": 30277053.0, "step": 17465 }, { "entropy": 5.617016077041626, "epoch": 1.3592297218439993, "grad_norm": 1.21875, "learning_rate": 0.00048173312753564787, "loss": 5.117, "mean_token_accuracy": 0.19550347775220872, "num_tokens": 30286075.0, "step": 17470 }, { "entropy": 5.537977838516236, "epoch": 1.3596187512157167, "grad_norm": 1.0703125, "learning_rate": 0.0004817221868731506, "loss": 5.0981, "mean_token_accuracy": 0.19449779391288757, "num_tokens": 30295329.0, "step": 17475 }, { "entropy": 5.576938629150391, "epoch": 1.3600077805874344, "grad_norm": 1.0546875, "learning_rate": 0.00048171124307397334, "loss": 5.1429, "mean_token_accuracy": 0.19321171939373016, "num_tokens": 30303685.0, "step": 17480 }, { "entropy": 5.496486568450928, "epoch": 1.360396809959152, "grad_norm": 1.078125, "learning_rate": 0.0004817002961382819, "loss": 5.0076, "mean_token_accuracy": 0.1937185913324356, "num_tokens": 30312885.0, "step": 17485 }, { "entropy": 5.465707874298095, "epoch": 1.3607858393308696, "grad_norm": 1.1015625, "learning_rate": 0.00048168934606624255, "loss": 4.9154, "mean_token_accuracy": 0.20480719655752183, "num_tokens": 30321368.0, "step": 17490 }, { "entropy": 5.55322790145874, "epoch": 1.361174868702587, "grad_norm": 1.1484375, "learning_rate": 0.00048167839285802116, "loss": 4.9919, "mean_token_accuracy": 0.196986024081707, "num_tokens": 30330252.0, "step": 17495 }, { "entropy": 5.539842748641968, "epoch": 1.3615638980743046, "grad_norm": 1.0859375, "learning_rate": 0.0004816674365137843, "loss": 5.0809, "mean_token_accuracy": 0.19607275277376174, "num_tokens": 30340095.0, "step": 17500 }, { "entropy": 5.606916284561157, "epoch": 1.3619529274460223, "grad_norm": 1.09375, "learning_rate": 0.000481656477033698, "loss": 5.1293, "mean_token_accuracy": 0.1895449161529541, "num_tokens": 30348303.0, "step": 17505 }, { "entropy": 5.53062334060669, "epoch": 1.3623419568177397, "grad_norm": 1.09375, "learning_rate": 0.0004816455144179286, "loss": 5.0417, "mean_token_accuracy": 0.19066710770130157, "num_tokens": 30356309.0, "step": 17510 }, { "entropy": 5.622492408752441, "epoch": 1.3627309861894572, "grad_norm": 1.078125, "learning_rate": 0.0004816345486666424, "loss": 5.1551, "mean_token_accuracy": 0.18634538352489471, "num_tokens": 30365128.0, "step": 17515 }, { "entropy": 5.540809059143067, "epoch": 1.363120015561175, "grad_norm": 1.0546875, "learning_rate": 0.0004816235797800058, "loss": 5.1362, "mean_token_accuracy": 0.19195785969495774, "num_tokens": 30373656.0, "step": 17520 }, { "entropy": 5.525598764419556, "epoch": 1.3635090449328924, "grad_norm": 1.125, "learning_rate": 0.0004816126077581852, "loss": 5.1055, "mean_token_accuracy": 0.19161802679300308, "num_tokens": 30382612.0, "step": 17525 }, { "entropy": 5.506517553329468, "epoch": 1.36389807430461, "grad_norm": 1.0625, "learning_rate": 0.00048160163260134724, "loss": 5.1361, "mean_token_accuracy": 0.19014995843172072, "num_tokens": 30392060.0, "step": 17530 }, { "entropy": 5.554969024658203, "epoch": 1.3642871036763276, "grad_norm": 1.015625, "learning_rate": 0.0004815906543096583, "loss": 5.0205, "mean_token_accuracy": 0.20168478637933732, "num_tokens": 30400751.0, "step": 17535 }, { "entropy": 5.562521743774414, "epoch": 1.3646761330480452, "grad_norm": 1.046875, "learning_rate": 0.000481579672883285, "loss": 5.0643, "mean_token_accuracy": 0.19417935460805893, "num_tokens": 30409584.0, "step": 17540 }, { "entropy": 5.510841989517212, "epoch": 1.3650651624197627, "grad_norm": 1.15625, "learning_rate": 0.00048156868832239396, "loss": 5.0793, "mean_token_accuracy": 0.19371015280485154, "num_tokens": 30418433.0, "step": 17545 }, { "entropy": 5.571598148345947, "epoch": 1.3654541917914802, "grad_norm": 1.1484375, "learning_rate": 0.0004815577006271519, "loss": 5.0437, "mean_token_accuracy": 0.19983194172382354, "num_tokens": 30426943.0, "step": 17550 }, { "entropy": 5.563754415512085, "epoch": 1.365843221163198, "grad_norm": 1.0859375, "learning_rate": 0.00048154670979772555, "loss": 5.0905, "mean_token_accuracy": 0.18966715782880783, "num_tokens": 30435763.0, "step": 17555 }, { "entropy": 5.455461835861206, "epoch": 1.3662322505349154, "grad_norm": 1.0703125, "learning_rate": 0.0004815357158342815, "loss": 4.9735, "mean_token_accuracy": 0.20787291526794432, "num_tokens": 30444009.0, "step": 17560 }, { "entropy": 5.547334003448486, "epoch": 1.3666212799066328, "grad_norm": 1.09375, "learning_rate": 0.0004815247187369868, "loss": 5.0176, "mean_token_accuracy": 0.19565975666046143, "num_tokens": 30452652.0, "step": 17565 }, { "entropy": 5.539991283416748, "epoch": 1.3670103092783505, "grad_norm": 1.0703125, "learning_rate": 0.00048151371850600814, "loss": 5.0452, "mean_token_accuracy": 0.18872333765029908, "num_tokens": 30462129.0, "step": 17570 }, { "entropy": 5.515231370925903, "epoch": 1.367399338650068, "grad_norm": 1.0625, "learning_rate": 0.00048150271514151255, "loss": 5.0848, "mean_token_accuracy": 0.19493391811847688, "num_tokens": 30471264.0, "step": 17575 }, { "entropy": 5.461421155929566, "epoch": 1.3677883680217857, "grad_norm": 1.0546875, "learning_rate": 0.00048149170864366693, "loss": 5.0022, "mean_token_accuracy": 0.19715942144393922, "num_tokens": 30479524.0, "step": 17580 }, { "entropy": 5.6382089138031, "epoch": 1.3681773973935032, "grad_norm": 1.140625, "learning_rate": 0.00048148069901263836, "loss": 5.0658, "mean_token_accuracy": 0.1952446863055229, "num_tokens": 30487925.0, "step": 17585 }, { "entropy": 5.558881568908691, "epoch": 1.368566426765221, "grad_norm": 1.1171875, "learning_rate": 0.00048146968624859375, "loss": 5.0844, "mean_token_accuracy": 0.19245128631591796, "num_tokens": 30496543.0, "step": 17590 }, { "entropy": 5.481025171279907, "epoch": 1.3689554561369384, "grad_norm": 1.171875, "learning_rate": 0.0004814586703517003, "loss": 5.0107, "mean_token_accuracy": 0.1927877724170685, "num_tokens": 30504780.0, "step": 17595 }, { "entropy": 5.50847806930542, "epoch": 1.3693444855086558, "grad_norm": 1.09375, "learning_rate": 0.0004814476513221251, "loss": 5.0751, "mean_token_accuracy": 0.18846897631883622, "num_tokens": 30513355.0, "step": 17600 }, { "entropy": 5.4651679515838625, "epoch": 1.3697335148803735, "grad_norm": 0.99609375, "learning_rate": 0.00048143662916003545, "loss": 4.984, "mean_token_accuracy": 0.2010539010167122, "num_tokens": 30522445.0, "step": 17605 }, { "entropy": 5.514300918579101, "epoch": 1.370122544252091, "grad_norm": 1.09375, "learning_rate": 0.0004814256038655985, "loss": 5.0273, "mean_token_accuracy": 0.19752272665500642, "num_tokens": 30530506.0, "step": 17610 }, { "entropy": 5.613162565231323, "epoch": 1.3705115736238085, "grad_norm": 1.109375, "learning_rate": 0.0004814145754389816, "loss": 5.134, "mean_token_accuracy": 0.18942491710186005, "num_tokens": 30539032.0, "step": 17615 }, { "entropy": 5.5770402431488035, "epoch": 1.3709006029955262, "grad_norm": 1.15625, "learning_rate": 0.00048140354388035204, "loss": 5.0146, "mean_token_accuracy": 0.19519609957933426, "num_tokens": 30547052.0, "step": 17620 }, { "entropy": 5.516412734985352, "epoch": 1.3712896323672437, "grad_norm": 1.140625, "learning_rate": 0.0004813925091898772, "loss": 5.1268, "mean_token_accuracy": 0.19294073879718782, "num_tokens": 30556111.0, "step": 17625 }, { "entropy": 5.5713520526885985, "epoch": 1.3716786617389614, "grad_norm": 1.046875, "learning_rate": 0.0004813814713677246, "loss": 5.1106, "mean_token_accuracy": 0.190730719268322, "num_tokens": 30565021.0, "step": 17630 }, { "entropy": 5.608752107620239, "epoch": 1.3720676911106788, "grad_norm": 1.1484375, "learning_rate": 0.0004813704304140616, "loss": 5.0954, "mean_token_accuracy": 0.19582546651363372, "num_tokens": 30573411.0, "step": 17635 }, { "entropy": 5.617388725280762, "epoch": 1.3724567204823965, "grad_norm": 1.0078125, "learning_rate": 0.0004813593863290559, "loss": 5.1067, "mean_token_accuracy": 0.19124250262975692, "num_tokens": 30582929.0, "step": 17640 }, { "entropy": 5.6182581901550295, "epoch": 1.372845749854114, "grad_norm": 1.09375, "learning_rate": 0.0004813483391128748, "loss": 5.1021, "mean_token_accuracy": 0.19197334051132203, "num_tokens": 30592087.0, "step": 17645 }, { "entropy": 5.612645769119263, "epoch": 1.3732347792258315, "grad_norm": 1.1015625, "learning_rate": 0.0004813372887656862, "loss": 5.0965, "mean_token_accuracy": 0.1877231165766716, "num_tokens": 30600725.0, "step": 17650 }, { "entropy": 5.573830318450928, "epoch": 1.3736238085975492, "grad_norm": 1.15625, "learning_rate": 0.0004813262352876576, "loss": 5.0557, "mean_token_accuracy": 0.19162333011627197, "num_tokens": 30608345.0, "step": 17655 }, { "entropy": 5.530574798583984, "epoch": 1.3740128379692667, "grad_norm": 1.078125, "learning_rate": 0.00048131517867895684, "loss": 5.0583, "mean_token_accuracy": 0.19639256298542024, "num_tokens": 30616951.0, "step": 17660 }, { "entropy": 5.518606233596802, "epoch": 1.3744018673409841, "grad_norm": 1.1328125, "learning_rate": 0.00048130411893975155, "loss": 5.0423, "mean_token_accuracy": 0.19841305911540985, "num_tokens": 30625840.0, "step": 17665 }, { "entropy": 5.546737337112427, "epoch": 1.3747908967127018, "grad_norm": 1.0625, "learning_rate": 0.0004812930560702097, "loss": 4.9992, "mean_token_accuracy": 0.19794746190309526, "num_tokens": 30634473.0, "step": 17670 }, { "entropy": 5.505931329727173, "epoch": 1.3751799260844193, "grad_norm": 1.0078125, "learning_rate": 0.00048128199007049907, "loss": 5.0287, "mean_token_accuracy": 0.1972987785935402, "num_tokens": 30643324.0, "step": 17675 }, { "entropy": 5.539654970169067, "epoch": 1.375568955456137, "grad_norm": 1.078125, "learning_rate": 0.00048127092094078756, "loss": 5.0991, "mean_token_accuracy": 0.19085582494735717, "num_tokens": 30651681.0, "step": 17680 }, { "entropy": 5.5691431045532225, "epoch": 1.3759579848278545, "grad_norm": 1.1328125, "learning_rate": 0.00048125984868124317, "loss": 4.9936, "mean_token_accuracy": 0.20606574416160583, "num_tokens": 30660295.0, "step": 17685 }, { "entropy": 5.5411464214324955, "epoch": 1.3763470141995722, "grad_norm": 1.0703125, "learning_rate": 0.0004812487732920338, "loss": 4.9964, "mean_token_accuracy": 0.209442900121212, "num_tokens": 30668553.0, "step": 17690 }, { "entropy": 5.567028331756592, "epoch": 1.3767360435712896, "grad_norm": 1.0625, "learning_rate": 0.0004812376947733277, "loss": 5.0999, "mean_token_accuracy": 0.19114660173654557, "num_tokens": 30677378.0, "step": 17695 }, { "entropy": 5.546908235549926, "epoch": 1.3771250729430071, "grad_norm": 1.140625, "learning_rate": 0.00048122661312529263, "loss": 5.0894, "mean_token_accuracy": 0.19561887830495833, "num_tokens": 30686662.0, "step": 17700 }, { "entropy": 5.512117528915406, "epoch": 1.3775141023147248, "grad_norm": 1.0625, "learning_rate": 0.0004812155283480971, "loss": 4.989, "mean_token_accuracy": 0.2007271483540535, "num_tokens": 30695246.0, "step": 17705 }, { "entropy": 5.493115186691284, "epoch": 1.3779031316864423, "grad_norm": 1.03125, "learning_rate": 0.0004812044404419091, "loss": 5.0079, "mean_token_accuracy": 0.20013216882944107, "num_tokens": 30705275.0, "step": 17710 }, { "entropy": 5.582388925552368, "epoch": 1.3782921610581598, "grad_norm": 1.109375, "learning_rate": 0.000481193349406897, "loss": 5.113, "mean_token_accuracy": 0.18434123396873475, "num_tokens": 30713955.0, "step": 17715 }, { "entropy": 5.559508752822876, "epoch": 1.3786811904298775, "grad_norm": 1.1484375, "learning_rate": 0.000481182255243229, "loss": 5.1058, "mean_token_accuracy": 0.1919082671403885, "num_tokens": 30723213.0, "step": 17720 }, { "entropy": 5.534653377532959, "epoch": 1.379070219801595, "grad_norm": 1.0625, "learning_rate": 0.00048117115795107335, "loss": 5.0072, "mean_token_accuracy": 0.19736116677522658, "num_tokens": 30731643.0, "step": 17725 }, { "entropy": 5.5371589183807375, "epoch": 1.3794592491733126, "grad_norm": 1.0859375, "learning_rate": 0.0004811600575305987, "loss": 5.0405, "mean_token_accuracy": 0.19474658817052842, "num_tokens": 30740779.0, "step": 17730 }, { "entropy": 5.594646978378296, "epoch": 1.3798482785450301, "grad_norm": 1.109375, "learning_rate": 0.0004811489539819731, "loss": 5.1253, "mean_token_accuracy": 0.18977709710597992, "num_tokens": 30749685.0, "step": 17735 }, { "entropy": 5.532616472244262, "epoch": 1.3802373079167478, "grad_norm": 1.0859375, "learning_rate": 0.00048113784730536544, "loss": 5.0166, "mean_token_accuracy": 0.19858538508415222, "num_tokens": 30758193.0, "step": 17740 }, { "entropy": 5.583976173400879, "epoch": 1.3806263372884653, "grad_norm": 1.109375, "learning_rate": 0.00048112673750094396, "loss": 5.0641, "mean_token_accuracy": 0.19237576574087142, "num_tokens": 30766870.0, "step": 17745 }, { "entropy": 5.543646621704101, "epoch": 1.3810153666601828, "grad_norm": 1.078125, "learning_rate": 0.0004811156245688773, "loss": 5.0507, "mean_token_accuracy": 0.19869203567504884, "num_tokens": 30776547.0, "step": 17750 }, { "entropy": 5.516203737258911, "epoch": 1.3814043960319005, "grad_norm": 1.0390625, "learning_rate": 0.0004811045085093342, "loss": 4.9896, "mean_token_accuracy": 0.19963317960500718, "num_tokens": 30785579.0, "step": 17755 }, { "entropy": 5.5404270648956295, "epoch": 1.381793425403618, "grad_norm": 1.1015625, "learning_rate": 0.0004810933893224831, "loss": 5.1591, "mean_token_accuracy": 0.18658055663108825, "num_tokens": 30794075.0, "step": 17760 }, { "entropy": 5.591392564773559, "epoch": 1.3821824547753354, "grad_norm": 1.171875, "learning_rate": 0.00048108226700849287, "loss": 5.0522, "mean_token_accuracy": 0.19804604351520538, "num_tokens": 30802773.0, "step": 17765 }, { "entropy": 5.544975757598877, "epoch": 1.382571484147053, "grad_norm": 1.0234375, "learning_rate": 0.0004810711415675323, "loss": 5.0532, "mean_token_accuracy": 0.19035611748695375, "num_tokens": 30811588.0, "step": 17770 }, { "entropy": 5.554931879043579, "epoch": 1.3829605135187706, "grad_norm": 1.0625, "learning_rate": 0.0004810600129997702, "loss": 5.0553, "mean_token_accuracy": 0.19628656804561614, "num_tokens": 30820194.0, "step": 17775 }, { "entropy": 5.605623197555542, "epoch": 1.3833495428904883, "grad_norm": 1.078125, "learning_rate": 0.00048104888130537534, "loss": 5.1394, "mean_token_accuracy": 0.18814265131950378, "num_tokens": 30829145.0, "step": 17780 }, { "entropy": 5.555330991744995, "epoch": 1.3837385722622058, "grad_norm": 1.0625, "learning_rate": 0.00048103774648451664, "loss": 5.099, "mean_token_accuracy": 0.19463342875242234, "num_tokens": 30838158.0, "step": 17785 }, { "entropy": 5.524973964691162, "epoch": 1.3841276016339235, "grad_norm": 1.0390625, "learning_rate": 0.00048102660853736314, "loss": 5.0469, "mean_token_accuracy": 0.19589153081178665, "num_tokens": 30847134.0, "step": 17790 }, { "entropy": 5.5677228450775145, "epoch": 1.384516631005641, "grad_norm": 1.0703125, "learning_rate": 0.0004810154674640837, "loss": 5.1235, "mean_token_accuracy": 0.18678848445415497, "num_tokens": 30856815.0, "step": 17795 }, { "entropy": 5.590299987792969, "epoch": 1.3849056603773584, "grad_norm": 1.0234375, "learning_rate": 0.00048100432326484744, "loss": 5.0605, "mean_token_accuracy": 0.19653042256832123, "num_tokens": 30865485.0, "step": 17800 }, { "entropy": 5.545382833480835, "epoch": 1.385294689749076, "grad_norm": 1.0390625, "learning_rate": 0.0004809931759398235, "loss": 5.0518, "mean_token_accuracy": 0.19777002334594726, "num_tokens": 30873624.0, "step": 17805 }, { "entropy": 5.488943862915039, "epoch": 1.3856837191207936, "grad_norm": 1.09375, "learning_rate": 0.00048098202548918094, "loss": 4.9354, "mean_token_accuracy": 0.2004162162542343, "num_tokens": 30882059.0, "step": 17810 }, { "entropy": 5.566474342346192, "epoch": 1.386072748492511, "grad_norm": 1.0625, "learning_rate": 0.00048097087191308914, "loss": 5.1408, "mean_token_accuracy": 0.18473455756902696, "num_tokens": 30891408.0, "step": 17815 }, { "entropy": 5.645927000045776, "epoch": 1.3864617778642288, "grad_norm": 1.15625, "learning_rate": 0.0004809597152117171, "loss": 5.1008, "mean_token_accuracy": 0.192196324467659, "num_tokens": 30899832.0, "step": 17820 }, { "entropy": 5.553818655014038, "epoch": 1.3868508072359464, "grad_norm": 1.0234375, "learning_rate": 0.0004809485553852342, "loss": 5.0047, "mean_token_accuracy": 0.1986765444278717, "num_tokens": 30908393.0, "step": 17825 }, { "entropy": 5.532617235183716, "epoch": 1.387239836607664, "grad_norm": 1.078125, "learning_rate": 0.0004809373924338098, "loss": 5.047, "mean_token_accuracy": 0.19803311824798583, "num_tokens": 30917347.0, "step": 17830 }, { "entropy": 5.489804983139038, "epoch": 1.3876288659793814, "grad_norm": 1.1640625, "learning_rate": 0.00048092622635761316, "loss": 4.9195, "mean_token_accuracy": 0.2038021832704544, "num_tokens": 30926386.0, "step": 17835 }, { "entropy": 5.5997583866119385, "epoch": 1.388017895351099, "grad_norm": 1.046875, "learning_rate": 0.00048091505715681395, "loss": 5.2278, "mean_token_accuracy": 0.18122268915176393, "num_tokens": 30935047.0, "step": 17840 }, { "entropy": 5.6150205612182615, "epoch": 1.3884069247228166, "grad_norm": 1.0234375, "learning_rate": 0.0004809038848315814, "loss": 5.0968, "mean_token_accuracy": 0.1925975725054741, "num_tokens": 30943551.0, "step": 17845 }, { "entropy": 5.5871387958526615, "epoch": 1.388795954094534, "grad_norm": 1.1640625, "learning_rate": 0.0004808927093820851, "loss": 5.0114, "mean_token_accuracy": 0.20019707530736924, "num_tokens": 30950929.0, "step": 17850 }, { "entropy": 5.59451994895935, "epoch": 1.3891849834662517, "grad_norm": 1.09375, "learning_rate": 0.0004808815308084947, "loss": 5.2387, "mean_token_accuracy": 0.1828531175851822, "num_tokens": 30959678.0, "step": 17855 }, { "entropy": 5.534245538711548, "epoch": 1.3895740128379692, "grad_norm": 1.046875, "learning_rate": 0.0004808703491109798, "loss": 5.0392, "mean_token_accuracy": 0.19509243220090866, "num_tokens": 30968499.0, "step": 17860 }, { "entropy": 5.576900959014893, "epoch": 1.3899630422096867, "grad_norm": 1.109375, "learning_rate": 0.0004808591642897099, "loss": 5.1028, "mean_token_accuracy": 0.18686798214912415, "num_tokens": 30977146.0, "step": 17865 }, { "entropy": 5.48150897026062, "epoch": 1.3903520715814044, "grad_norm": 1.09375, "learning_rate": 0.000480847976344855, "loss": 4.8963, "mean_token_accuracy": 0.20184454321861267, "num_tokens": 30985285.0, "step": 17870 }, { "entropy": 5.502690601348877, "epoch": 1.390741100953122, "grad_norm": 1.0859375, "learning_rate": 0.00048083678527658465, "loss": 4.9679, "mean_token_accuracy": 0.20485545098781585, "num_tokens": 30993648.0, "step": 17875 }, { "entropy": 5.532558250427246, "epoch": 1.3911301303248396, "grad_norm": 1.1953125, "learning_rate": 0.0004808255910850687, "loss": 4.9632, "mean_token_accuracy": 0.20521898567676544, "num_tokens": 31002007.0, "step": 17880 }, { "entropy": 5.535276746749878, "epoch": 1.391519159696557, "grad_norm": 1.140625, "learning_rate": 0.0004808143937704769, "loss": 5.0483, "mean_token_accuracy": 0.19593747556209565, "num_tokens": 31010107.0, "step": 17885 }, { "entropy": 5.536030960083008, "epoch": 1.3919081890682747, "grad_norm": 1.1171875, "learning_rate": 0.00048080319333297937, "loss": 4.9839, "mean_token_accuracy": 0.20344551503658295, "num_tokens": 31018754.0, "step": 17890 }, { "entropy": 5.574505996704102, "epoch": 1.3922972184399922, "grad_norm": 1.0390625, "learning_rate": 0.00048079198977274597, "loss": 5.1426, "mean_token_accuracy": 0.18835900574922562, "num_tokens": 31027929.0, "step": 17895 }, { "entropy": 5.535457563400269, "epoch": 1.3926862478117097, "grad_norm": 1.125, "learning_rate": 0.00048078078308994666, "loss": 5.0969, "mean_token_accuracy": 0.18722502738237382, "num_tokens": 31037023.0, "step": 17900 }, { "entropy": 5.5400307178497314, "epoch": 1.3930752771834274, "grad_norm": 1.0625, "learning_rate": 0.0004807695732847515, "loss": 4.986, "mean_token_accuracy": 0.20118181705474852, "num_tokens": 31045483.0, "step": 17905 }, { "entropy": 5.520857477188111, "epoch": 1.3934643065551449, "grad_norm": 1.0625, "learning_rate": 0.00048075836035733053, "loss": 5.0322, "mean_token_accuracy": 0.19901844263076782, "num_tokens": 31053905.0, "step": 17910 }, { "entropy": 5.514943170547485, "epoch": 1.3938533359268626, "grad_norm": 1.09375, "learning_rate": 0.000480747144307854, "loss": 5.0844, "mean_token_accuracy": 0.1974051758646965, "num_tokens": 31062288.0, "step": 17915 }, { "entropy": 5.5517021179199215, "epoch": 1.39424236529858, "grad_norm": 1.1875, "learning_rate": 0.00048073592513649203, "loss": 5.0984, "mean_token_accuracy": 0.19578115791082382, "num_tokens": 31070165.0, "step": 17920 }, { "entropy": 5.599383115768433, "epoch": 1.3946313946702977, "grad_norm": 1.140625, "learning_rate": 0.0004807247028434148, "loss": 5.0557, "mean_token_accuracy": 0.19163752049207688, "num_tokens": 31078448.0, "step": 17925 }, { "entropy": 5.5500242710113525, "epoch": 1.3950204240420152, "grad_norm": 1.078125, "learning_rate": 0.0004807134774287927, "loss": 5.0984, "mean_token_accuracy": 0.19304633140563965, "num_tokens": 31087511.0, "step": 17930 }, { "entropy": 5.4819310188293455, "epoch": 1.3954094534137327, "grad_norm": 0.98828125, "learning_rate": 0.00048070224889279603, "loss": 5.0131, "mean_token_accuracy": 0.1946722760796547, "num_tokens": 31096893.0, "step": 17935 }, { "entropy": 5.555552053451538, "epoch": 1.3957984827854504, "grad_norm": 1.171875, "learning_rate": 0.00048069101723559505, "loss": 5.062, "mean_token_accuracy": 0.19403376579284667, "num_tokens": 31106111.0, "step": 17940 }, { "entropy": 5.494966077804565, "epoch": 1.3961875121571679, "grad_norm": 1.1015625, "learning_rate": 0.0004806797824573603, "loss": 4.917, "mean_token_accuracy": 0.2073436811566353, "num_tokens": 31114780.0, "step": 17945 }, { "entropy": 5.575967264175415, "epoch": 1.3965765415288853, "grad_norm": 1.1640625, "learning_rate": 0.0004806685445582624, "loss": 5.1495, "mean_token_accuracy": 0.18139443695545196, "num_tokens": 31123644.0, "step": 17950 }, { "entropy": 5.491543436050415, "epoch": 1.396965570900603, "grad_norm": 1.0390625, "learning_rate": 0.00048065730353847143, "loss": 5.0237, "mean_token_accuracy": 0.1960713803768158, "num_tokens": 31133133.0, "step": 17955 }, { "entropy": 5.528134346008301, "epoch": 1.3973546002723205, "grad_norm": 1.0859375, "learning_rate": 0.00048064605939815837, "loss": 5.0546, "mean_token_accuracy": 0.19731059819459915, "num_tokens": 31141545.0, "step": 17960 }, { "entropy": 5.553800916671753, "epoch": 1.3977436296440382, "grad_norm": 1.1640625, "learning_rate": 0.0004806348121374936, "loss": 5.0803, "mean_token_accuracy": 0.1949324280023575, "num_tokens": 31150689.0, "step": 17965 }, { "entropy": 5.62173752784729, "epoch": 1.3981326590157557, "grad_norm": 1.0390625, "learning_rate": 0.0004806235617566479, "loss": 5.1603, "mean_token_accuracy": 0.18845051676034927, "num_tokens": 31159114.0, "step": 17970 }, { "entropy": 5.564534091949463, "epoch": 1.3985216883874734, "grad_norm": 1.1640625, "learning_rate": 0.000480612308255792, "loss": 5.1594, "mean_token_accuracy": 0.19304109066724778, "num_tokens": 31167938.0, "step": 17975 }, { "entropy": 5.628028774261475, "epoch": 1.3989107177591908, "grad_norm": 1.203125, "learning_rate": 0.00048060105163509647, "loss": 5.1487, "mean_token_accuracy": 0.1874155655503273, "num_tokens": 31176653.0, "step": 17980 }, { "entropy": 5.574227619171142, "epoch": 1.3992997471309083, "grad_norm": 1.03125, "learning_rate": 0.0004805897918947323, "loss": 5.0521, "mean_token_accuracy": 0.19768701642751693, "num_tokens": 31185247.0, "step": 17985 }, { "entropy": 5.566842842102051, "epoch": 1.399688776502626, "grad_norm": 1.046875, "learning_rate": 0.0004805785290348702, "loss": 5.1667, "mean_token_accuracy": 0.19304127395153045, "num_tokens": 31194504.0, "step": 17990 }, { "entropy": 5.5727410316467285, "epoch": 1.4000778058743435, "grad_norm": 1.0859375, "learning_rate": 0.00048056726305568124, "loss": 5.0752, "mean_token_accuracy": 0.19094185531139374, "num_tokens": 31202668.0, "step": 17995 }, { "entropy": 5.58998384475708, "epoch": 1.400466835246061, "grad_norm": 1.0546875, "learning_rate": 0.00048055599395733617, "loss": 5.054, "mean_token_accuracy": 0.1926966652274132, "num_tokens": 31211165.0, "step": 18000 }, { "epoch": 1.400466835246061, "eval_entropy": 5.31877617115465, "eval_loss": 5.138509750366211, "eval_mean_token_accuracy": 0.20082474479718893, "eval_num_tokens": 31211165.0, "eval_runtime": 21.6844, "eval_samples_per_second": 1916.492, "eval_steps_per_second": 239.573, "step": 18000 }, { "entropy": 5.517045497894287, "epoch": 1.4008558646177787, "grad_norm": 1.1328125, "learning_rate": 0.00048054472174000615, "loss": 5.0191, "mean_token_accuracy": 0.19554646015167237, "num_tokens": 31220502.0, "step": 18005 }, { "entropy": 5.597953271865845, "epoch": 1.4012448939894961, "grad_norm": 1.125, "learning_rate": 0.00048053344640386207, "loss": 5.1631, "mean_token_accuracy": 0.18142991960048677, "num_tokens": 31228771.0, "step": 18010 }, { "entropy": 5.53455662727356, "epoch": 1.4016339233612138, "grad_norm": 1.0546875, "learning_rate": 0.00048052216794907505, "loss": 5.0517, "mean_token_accuracy": 0.19655922502279283, "num_tokens": 31237098.0, "step": 18015 }, { "entropy": 5.555712747573852, "epoch": 1.4020229527329313, "grad_norm": 1.0859375, "learning_rate": 0.00048051088637581624, "loss": 5.0849, "mean_token_accuracy": 0.18785118460655212, "num_tokens": 31245879.0, "step": 18020 }, { "entropy": 5.538217544555664, "epoch": 1.402411982104649, "grad_norm": 1.15625, "learning_rate": 0.000480499601684257, "loss": 5.0011, "mean_token_accuracy": 0.2021091639995575, "num_tokens": 31254041.0, "step": 18025 }, { "entropy": 5.507911491394043, "epoch": 1.4028010114763665, "grad_norm": 1.09375, "learning_rate": 0.0004804883138745682, "loss": 5.0151, "mean_token_accuracy": 0.19280405789613725, "num_tokens": 31262600.0, "step": 18030 }, { "entropy": 5.507891845703125, "epoch": 1.403190040848084, "grad_norm": 1.1171875, "learning_rate": 0.0004804770229469214, "loss": 4.9432, "mean_token_accuracy": 0.20524874180555344, "num_tokens": 31270844.0, "step": 18035 }, { "entropy": 5.521011781692505, "epoch": 1.4035790702198017, "grad_norm": 1.1171875, "learning_rate": 0.0004804657289014878, "loss": 5.0961, "mean_token_accuracy": 0.1872323974967003, "num_tokens": 31280104.0, "step": 18040 }, { "entropy": 5.5206633567810055, "epoch": 1.4039680995915191, "grad_norm": 1.109375, "learning_rate": 0.00048045443173843884, "loss": 4.9476, "mean_token_accuracy": 0.19926963299512862, "num_tokens": 31288280.0, "step": 18045 }, { "entropy": 5.456657648086548, "epoch": 1.4043571289632366, "grad_norm": 1.1640625, "learning_rate": 0.00048044313145794587, "loss": 4.8983, "mean_token_accuracy": 0.20874076336622238, "num_tokens": 31296806.0, "step": 18050 }, { "entropy": 5.6134788513183596, "epoch": 1.4047461583349543, "grad_norm": 1.125, "learning_rate": 0.00048043182806018034, "loss": 5.1547, "mean_token_accuracy": 0.1895008161664009, "num_tokens": 31305687.0, "step": 18055 }, { "entropy": 5.588626956939697, "epoch": 1.4051351877066718, "grad_norm": 1.125, "learning_rate": 0.00048042052154531384, "loss": 5.1634, "mean_token_accuracy": 0.19666950702667235, "num_tokens": 31314332.0, "step": 18060 }, { "entropy": 5.530027246475219, "epoch": 1.4055242170783895, "grad_norm": 1.1484375, "learning_rate": 0.0004804092119135179, "loss": 5.0739, "mean_token_accuracy": 0.2026395931839943, "num_tokens": 31322630.0, "step": 18065 }, { "entropy": 5.532639360427856, "epoch": 1.405913246450107, "grad_norm": 1.1015625, "learning_rate": 0.0004803978991649641, "loss": 5.0197, "mean_token_accuracy": 0.19600387960672377, "num_tokens": 31330778.0, "step": 18070 }, { "entropy": 5.505466270446777, "epoch": 1.4063022758218247, "grad_norm": 1.078125, "learning_rate": 0.00048038658329982404, "loss": 4.9998, "mean_token_accuracy": 0.19533978551626205, "num_tokens": 31339637.0, "step": 18075 }, { "entropy": 5.589492273330689, "epoch": 1.4066913051935421, "grad_norm": 1.171875, "learning_rate": 0.0004803752643182695, "loss": 5.1331, "mean_token_accuracy": 0.19073974341154099, "num_tokens": 31348255.0, "step": 18080 }, { "entropy": 5.494571590423584, "epoch": 1.4070803345652596, "grad_norm": 1.0390625, "learning_rate": 0.0004803639422204723, "loss": 5.0105, "mean_token_accuracy": 0.19242308139801026, "num_tokens": 31357027.0, "step": 18085 }, { "entropy": 5.502149343490601, "epoch": 1.4074693639369773, "grad_norm": 1.1484375, "learning_rate": 0.0004803526170066041, "loss": 5.0028, "mean_token_accuracy": 0.20116140991449355, "num_tokens": 31365475.0, "step": 18090 }, { "entropy": 5.561756181716919, "epoch": 1.4078583933086948, "grad_norm": 1.0546875, "learning_rate": 0.00048034128867683674, "loss": 5.0777, "mean_token_accuracy": 0.18987676799297332, "num_tokens": 31374459.0, "step": 18095 }, { "entropy": 5.613378047943115, "epoch": 1.4082474226804123, "grad_norm": 1.046875, "learning_rate": 0.0004803299572313422, "loss": 5.0308, "mean_token_accuracy": 0.19178077727556228, "num_tokens": 31382720.0, "step": 18100 }, { "entropy": 5.4810240268707275, "epoch": 1.40863645205213, "grad_norm": 1.171875, "learning_rate": 0.0004803186226702924, "loss": 5.0129, "mean_token_accuracy": 0.19117873758077622, "num_tokens": 31390543.0, "step": 18105 }, { "entropy": 5.560120725631714, "epoch": 1.4090254814238474, "grad_norm": 1.078125, "learning_rate": 0.0004803072849938592, "loss": 5.0776, "mean_token_accuracy": 0.19085932970046998, "num_tokens": 31399428.0, "step": 18110 }, { "entropy": 5.5510985374450685, "epoch": 1.4094145107955651, "grad_norm": 1.125, "learning_rate": 0.0004802959442022149, "loss": 5.0101, "mean_token_accuracy": 0.20323875695466995, "num_tokens": 31408287.0, "step": 18115 }, { "entropy": 5.580893611907959, "epoch": 1.4098035401672826, "grad_norm": 1.109375, "learning_rate": 0.00048028460029553126, "loss": 5.1082, "mean_token_accuracy": 0.19309157580137254, "num_tokens": 31417340.0, "step": 18120 }, { "entropy": 5.556183671951294, "epoch": 1.4101925695390003, "grad_norm": 1.1171875, "learning_rate": 0.00048027325327398065, "loss": 5.0771, "mean_token_accuracy": 0.19392092972993852, "num_tokens": 31426363.0, "step": 18125 }, { "entropy": 5.627390718460083, "epoch": 1.4105815989107178, "grad_norm": 1.046875, "learning_rate": 0.0004802619031377351, "loss": 5.1541, "mean_token_accuracy": 0.19699808657169343, "num_tokens": 31436107.0, "step": 18130 }, { "entropy": 5.562397909164429, "epoch": 1.4109706282824352, "grad_norm": 1.0703125, "learning_rate": 0.00048025054988696684, "loss": 5.0525, "mean_token_accuracy": 0.18827087581157684, "num_tokens": 31444899.0, "step": 18135 }, { "entropy": 5.576064205169677, "epoch": 1.411359657654153, "grad_norm": 1.078125, "learning_rate": 0.00048023919352184827, "loss": 5.0082, "mean_token_accuracy": 0.20217641592025756, "num_tokens": 31453130.0, "step": 18140 }, { "entropy": 5.52488489151001, "epoch": 1.4117486870258704, "grad_norm": 1.09375, "learning_rate": 0.00048022783404255156, "loss": 5.0272, "mean_token_accuracy": 0.19490601420402526, "num_tokens": 31461951.0, "step": 18145 }, { "entropy": 5.578972625732422, "epoch": 1.412137716397588, "grad_norm": 1.1171875, "learning_rate": 0.0004802164714492491, "loss": 5.0978, "mean_token_accuracy": 0.18536048084497453, "num_tokens": 31470487.0, "step": 18150 }, { "entropy": 5.574371242523194, "epoch": 1.4125267457693056, "grad_norm": 1.125, "learning_rate": 0.00048020510574211335, "loss": 5.0851, "mean_token_accuracy": 0.19663629531860352, "num_tokens": 31479067.0, "step": 18155 }, { "entropy": 5.545616245269775, "epoch": 1.412915775141023, "grad_norm": 1.015625, "learning_rate": 0.00048019373692131674, "loss": 5.0231, "mean_token_accuracy": 0.19367250949144363, "num_tokens": 31487993.0, "step": 18160 }, { "entropy": 5.531673336029053, "epoch": 1.4133048045127408, "grad_norm": 1.046875, "learning_rate": 0.00048018236498703176, "loss": 5.0319, "mean_token_accuracy": 0.19408976882696152, "num_tokens": 31496436.0, "step": 18165 }, { "entropy": 5.559005546569824, "epoch": 1.4136938338844582, "grad_norm": 1.125, "learning_rate": 0.00048017098993943097, "loss": 5.0698, "mean_token_accuracy": 0.2013227418065071, "num_tokens": 31504834.0, "step": 18170 }, { "entropy": 5.6224287986755375, "epoch": 1.414082863256176, "grad_norm": 1.109375, "learning_rate": 0.000480159611778687, "loss": 5.1492, "mean_token_accuracy": 0.18386515825986863, "num_tokens": 31513532.0, "step": 18175 }, { "entropy": 5.51333646774292, "epoch": 1.4144718926278934, "grad_norm": 1.03125, "learning_rate": 0.00048014823050497243, "loss": 5.0225, "mean_token_accuracy": 0.19553097188472748, "num_tokens": 31522291.0, "step": 18180 }, { "entropy": 5.5416069507598875, "epoch": 1.4148609219996109, "grad_norm": 1.1875, "learning_rate": 0.00048013684611846, "loss": 5.0431, "mean_token_accuracy": 0.1976754680275917, "num_tokens": 31530164.0, "step": 18185 }, { "entropy": 5.58240327835083, "epoch": 1.4152499513713286, "grad_norm": 1.15625, "learning_rate": 0.00048012545861932245, "loss": 5.0756, "mean_token_accuracy": 0.19078683108091354, "num_tokens": 31538690.0, "step": 18190 }, { "entropy": 5.478669261932373, "epoch": 1.415638980743046, "grad_norm": 1.0390625, "learning_rate": 0.0004801140680077325, "loss": 5.0051, "mean_token_accuracy": 0.20108330845832825, "num_tokens": 31547109.0, "step": 18195 }, { "entropy": 5.574164867401123, "epoch": 1.4160280101147635, "grad_norm": 1.1640625, "learning_rate": 0.0004801026742838631, "loss": 5.1092, "mean_token_accuracy": 0.1911427214741707, "num_tokens": 31555524.0, "step": 18200 }, { "entropy": 5.543385171890259, "epoch": 1.4164170394864812, "grad_norm": 1.09375, "learning_rate": 0.0004800912774478871, "loss": 5.0942, "mean_token_accuracy": 0.1923657551407814, "num_tokens": 31564093.0, "step": 18205 }, { "entropy": 5.51996078491211, "epoch": 1.416806068858199, "grad_norm": 1.1015625, "learning_rate": 0.0004800798774999773, "loss": 4.9959, "mean_token_accuracy": 0.19956326633691787, "num_tokens": 31572680.0, "step": 18210 }, { "entropy": 5.5452179431915285, "epoch": 1.4171950982299164, "grad_norm": 1.15625, "learning_rate": 0.00048006847444030686, "loss": 5.055, "mean_token_accuracy": 0.19761183261871337, "num_tokens": 31581537.0, "step": 18215 }, { "entropy": 5.600072002410888, "epoch": 1.4175841276016339, "grad_norm": 1.0390625, "learning_rate": 0.0004800570682690487, "loss": 5.0139, "mean_token_accuracy": 0.19170113950967788, "num_tokens": 31590151.0, "step": 18220 }, { "entropy": 5.548355340957642, "epoch": 1.4179731569733516, "grad_norm": 1.015625, "learning_rate": 0.0004800456589863759, "loss": 4.997, "mean_token_accuracy": 0.20166392922401427, "num_tokens": 31598600.0, "step": 18225 }, { "entropy": 5.650712776184082, "epoch": 1.418362186345069, "grad_norm": 1.109375, "learning_rate": 0.0004800342465924616, "loss": 5.1174, "mean_token_accuracy": 0.1892600730061531, "num_tokens": 31606357.0, "step": 18230 }, { "entropy": 5.593307065963745, "epoch": 1.4187512157167865, "grad_norm": 1.046875, "learning_rate": 0.000480022831087479, "loss": 5.1105, "mean_token_accuracy": 0.18833684623241426, "num_tokens": 31615794.0, "step": 18235 }, { "entropy": 5.583683109283447, "epoch": 1.4191402450885042, "grad_norm": 1.0625, "learning_rate": 0.0004800114124716012, "loss": 5.0555, "mean_token_accuracy": 0.19954750090837478, "num_tokens": 31624000.0, "step": 18240 }, { "entropy": 5.565824222564697, "epoch": 1.4195292744602217, "grad_norm": 1.0625, "learning_rate": 0.0004799999907450015, "loss": 5.0386, "mean_token_accuracy": 0.19955568462610246, "num_tokens": 31632762.0, "step": 18245 }, { "entropy": 5.553789377212524, "epoch": 1.4199183038319392, "grad_norm": 1.0859375, "learning_rate": 0.0004799885659078533, "loss": 5.0851, "mean_token_accuracy": 0.18759685754776, "num_tokens": 31641218.0, "step": 18250 }, { "entropy": 5.565247344970703, "epoch": 1.4203073332036569, "grad_norm": 1.03125, "learning_rate": 0.0004799771379603299, "loss": 5.0322, "mean_token_accuracy": 0.19457255601882933, "num_tokens": 31650765.0, "step": 18255 }, { "entropy": 5.540380191802979, "epoch": 1.4206963625753746, "grad_norm": 1.1171875, "learning_rate": 0.0004799657069026046, "loss": 5.0195, "mean_token_accuracy": 0.1982538804411888, "num_tokens": 31659139.0, "step": 18260 }, { "entropy": 5.564652585983277, "epoch": 1.421085391947092, "grad_norm": 1.125, "learning_rate": 0.00047995427273485097, "loss": 5.0906, "mean_token_accuracy": 0.19555256962776185, "num_tokens": 31667083.0, "step": 18265 }, { "entropy": 5.54394907951355, "epoch": 1.4214744213188095, "grad_norm": 1.078125, "learning_rate": 0.00047994283545724247, "loss": 4.9984, "mean_token_accuracy": 0.20335510075092317, "num_tokens": 31676409.0, "step": 18270 }, { "entropy": 5.5554248809814455, "epoch": 1.4218634506905272, "grad_norm": 1.2109375, "learning_rate": 0.00047993139506995273, "loss": 5.0019, "mean_token_accuracy": 0.19831628799438478, "num_tokens": 31684507.0, "step": 18275 }, { "entropy": 5.544463729858398, "epoch": 1.4222524800622447, "grad_norm": 1.125, "learning_rate": 0.0004799199515731551, "loss": 5.0401, "mean_token_accuracy": 0.20106517970561982, "num_tokens": 31693091.0, "step": 18280 }, { "entropy": 5.487980556488037, "epoch": 1.4226415094339622, "grad_norm": 1.21875, "learning_rate": 0.00047990850496702346, "loss": 5.0227, "mean_token_accuracy": 0.2041850432753563, "num_tokens": 31701486.0, "step": 18285 }, { "entropy": 5.583898591995239, "epoch": 1.4230305388056799, "grad_norm": 1.1484375, "learning_rate": 0.0004798970552517314, "loss": 5.1327, "mean_token_accuracy": 0.1941058397293091, "num_tokens": 31710107.0, "step": 18290 }, { "entropy": 5.650792407989502, "epoch": 1.4234195681773973, "grad_norm": 1.203125, "learning_rate": 0.00047988560242745264, "loss": 5.1157, "mean_token_accuracy": 0.19557671546936034, "num_tokens": 31718378.0, "step": 18295 }, { "entropy": 5.580296659469605, "epoch": 1.423808597549115, "grad_norm": 1.1796875, "learning_rate": 0.000479874146494361, "loss": 5.0715, "mean_token_accuracy": 0.19503856003284453, "num_tokens": 31726956.0, "step": 18300 }, { "entropy": 5.625977849960327, "epoch": 1.4241976269208325, "grad_norm": 1.1171875, "learning_rate": 0.0004798626874526302, "loss": 5.1388, "mean_token_accuracy": 0.19569528847932816, "num_tokens": 31735551.0, "step": 18305 }, { "entropy": 5.652529239654541, "epoch": 1.4245866562925502, "grad_norm": 0.98828125, "learning_rate": 0.00047985122530243426, "loss": 5.1974, "mean_token_accuracy": 0.17976532131433487, "num_tokens": 31744852.0, "step": 18310 }, { "entropy": 5.617678308486939, "epoch": 1.4249756856642677, "grad_norm": 1.0234375, "learning_rate": 0.000479839760043947, "loss": 5.1702, "mean_token_accuracy": 0.19166087210178376, "num_tokens": 31754204.0, "step": 18315 }, { "entropy": 5.610816764831543, "epoch": 1.4253647150359852, "grad_norm": 1.2421875, "learning_rate": 0.00047982829167734245, "loss": 5.0713, "mean_token_accuracy": 0.1953285202383995, "num_tokens": 31762478.0, "step": 18320 }, { "entropy": 5.559537601470947, "epoch": 1.4257537444077029, "grad_norm": 1.1640625, "learning_rate": 0.00047981682020279456, "loss": 5.055, "mean_token_accuracy": 0.1979062408208847, "num_tokens": 31770607.0, "step": 18325 }, { "entropy": 5.512546968460083, "epoch": 1.4261427737794203, "grad_norm": 1.109375, "learning_rate": 0.0004798053456204775, "loss": 5.0087, "mean_token_accuracy": 0.20497969835996627, "num_tokens": 31779441.0, "step": 18330 }, { "entropy": 5.553103923797607, "epoch": 1.4265318031511378, "grad_norm": 1.125, "learning_rate": 0.0004797938679305651, "loss": 5.1006, "mean_token_accuracy": 0.1929819479584694, "num_tokens": 31788686.0, "step": 18335 }, { "entropy": 5.605119752883911, "epoch": 1.4269208325228555, "grad_norm": 1.140625, "learning_rate": 0.00047978238713323193, "loss": 5.0253, "mean_token_accuracy": 0.1964220330119133, "num_tokens": 31796433.0, "step": 18340 }, { "entropy": 5.548340940475464, "epoch": 1.427309861894573, "grad_norm": 1.1328125, "learning_rate": 0.00047977090322865183, "loss": 5.0027, "mean_token_accuracy": 0.19998253732919694, "num_tokens": 31804700.0, "step": 18345 }, { "entropy": 5.479428672790528, "epoch": 1.4276988912662907, "grad_norm": 1.1171875, "learning_rate": 0.0004797594162169993, "loss": 5.0308, "mean_token_accuracy": 0.19349924027919768, "num_tokens": 31813441.0, "step": 18350 }, { "entropy": 5.5475023746490475, "epoch": 1.4280879206380082, "grad_norm": 1.078125, "learning_rate": 0.0004797479260984485, "loss": 5.0661, "mean_token_accuracy": 0.18988244384527206, "num_tokens": 31823553.0, "step": 18355 }, { "entropy": 5.585196876525879, "epoch": 1.4284769500097259, "grad_norm": 1.109375, "learning_rate": 0.00047973643287317386, "loss": 5.0642, "mean_token_accuracy": 0.19464348405599594, "num_tokens": 31832093.0, "step": 18360 }, { "entropy": 5.5267777919769285, "epoch": 1.4288659793814433, "grad_norm": 1.15625, "learning_rate": 0.00047972493654134963, "loss": 4.9879, "mean_token_accuracy": 0.20176289826631547, "num_tokens": 31840282.0, "step": 18365 }, { "entropy": 5.593541669845581, "epoch": 1.4292550087531608, "grad_norm": 1.0390625, "learning_rate": 0.00047971343710315043, "loss": 5.1343, "mean_token_accuracy": 0.19293663799762725, "num_tokens": 31849230.0, "step": 18370 }, { "entropy": 5.595777177810669, "epoch": 1.4296440381248785, "grad_norm": 1.078125, "learning_rate": 0.0004797019345587506, "loss": 5.0978, "mean_token_accuracy": 0.19061076194047927, "num_tokens": 31857965.0, "step": 18375 }, { "entropy": 5.595154047012329, "epoch": 1.430033067496596, "grad_norm": 1.09375, "learning_rate": 0.0004796904289083248, "loss": 5.0721, "mean_token_accuracy": 0.1981726586818695, "num_tokens": 31866188.0, "step": 18380 }, { "entropy": 5.550575160980225, "epoch": 1.4304220968683135, "grad_norm": 1.1015625, "learning_rate": 0.0004796789201520474, "loss": 5.1041, "mean_token_accuracy": 0.1944649651646614, "num_tokens": 31875024.0, "step": 18385 }, { "entropy": 5.4641077518463135, "epoch": 1.4308111262400312, "grad_norm": 1.1640625, "learning_rate": 0.00047966740829009333, "loss": 5.0328, "mean_token_accuracy": 0.19584709405899048, "num_tokens": 31883563.0, "step": 18390 }, { "entropy": 5.555887603759766, "epoch": 1.4312001556117486, "grad_norm": 1.171875, "learning_rate": 0.000479655893322637, "loss": 5.0894, "mean_token_accuracy": 0.18810806274414063, "num_tokens": 31891435.0, "step": 18395 }, { "entropy": 5.605862617492676, "epoch": 1.4315891849834663, "grad_norm": 1.1875, "learning_rate": 0.0004796443752498532, "loss": 5.066, "mean_token_accuracy": 0.19410179704427719, "num_tokens": 31899335.0, "step": 18400 }, { "entropy": 5.577321243286133, "epoch": 1.4319782143551838, "grad_norm": 1.109375, "learning_rate": 0.0004796328540719169, "loss": 5.2028, "mean_token_accuracy": 0.1899257257580757, "num_tokens": 31908101.0, "step": 18405 }, { "entropy": 5.554736852645874, "epoch": 1.4323672437269015, "grad_norm": 1.1015625, "learning_rate": 0.0004796213297890026, "loss": 5.0933, "mean_token_accuracy": 0.196576389670372, "num_tokens": 31916664.0, "step": 18410 }, { "entropy": 5.563580131530761, "epoch": 1.432756273098619, "grad_norm": 1.109375, "learning_rate": 0.0004796098024012853, "loss": 5.0161, "mean_token_accuracy": 0.2002794161438942, "num_tokens": 31924785.0, "step": 18415 }, { "entropy": 5.573451709747315, "epoch": 1.4331453024703364, "grad_norm": 1.109375, "learning_rate": 0.00047959827190894, "loss": 5.1971, "mean_token_accuracy": 0.18792109340429305, "num_tokens": 31933117.0, "step": 18420 }, { "entropy": 5.66439003944397, "epoch": 1.4335343318420541, "grad_norm": 1.1484375, "learning_rate": 0.00047958673831214157, "loss": 5.1479, "mean_token_accuracy": 0.18793282210826873, "num_tokens": 31941217.0, "step": 18425 }, { "entropy": 5.5384317398071286, "epoch": 1.4339233612137716, "grad_norm": 1.09375, "learning_rate": 0.00047957520161106496, "loss": 4.981, "mean_token_accuracy": 0.20418466329574586, "num_tokens": 31949749.0, "step": 18430 }, { "entropy": 5.553807973861694, "epoch": 1.434312390585489, "grad_norm": 1.1953125, "learning_rate": 0.0004795636618058853, "loss": 5.0618, "mean_token_accuracy": 0.1991420269012451, "num_tokens": 31957631.0, "step": 18435 }, { "entropy": 5.606360530853271, "epoch": 1.4347014199572068, "grad_norm": 1.109375, "learning_rate": 0.0004795521188967777, "loss": 5.1868, "mean_token_accuracy": 0.19741732478141785, "num_tokens": 31966453.0, "step": 18440 }, { "entropy": 5.547063541412354, "epoch": 1.4350904493289243, "grad_norm": 1.1328125, "learning_rate": 0.0004795405728839172, "loss": 5.0454, "mean_token_accuracy": 0.19225009232759477, "num_tokens": 31975487.0, "step": 18445 }, { "entropy": 5.5155597686767575, "epoch": 1.435479478700642, "grad_norm": 1.078125, "learning_rate": 0.0004795290237674792, "loss": 5.0402, "mean_token_accuracy": 0.19762931168079376, "num_tokens": 31984505.0, "step": 18450 }, { "entropy": 5.499327850341797, "epoch": 1.4358685080723594, "grad_norm": 1.1015625, "learning_rate": 0.00047951747154763866, "loss": 4.984, "mean_token_accuracy": 0.19115490168333055, "num_tokens": 31993555.0, "step": 18455 }, { "entropy": 5.601089572906494, "epoch": 1.4362575374440771, "grad_norm": 1.0390625, "learning_rate": 0.00047950591622457106, "loss": 5.1543, "mean_token_accuracy": 0.18501971513032914, "num_tokens": 32002950.0, "step": 18460 }, { "entropy": 5.5887593746185305, "epoch": 1.4366465668157946, "grad_norm": 1.1328125, "learning_rate": 0.00047949435779845174, "loss": 5.0973, "mean_token_accuracy": 0.19135268926620483, "num_tokens": 32011023.0, "step": 18465 }, { "entropy": 5.527636098861694, "epoch": 1.437035596187512, "grad_norm": 1.0859375, "learning_rate": 0.00047948279626945596, "loss": 4.9625, "mean_token_accuracy": 0.20359327048063278, "num_tokens": 32019498.0, "step": 18470 }, { "entropy": 5.461010265350342, "epoch": 1.4374246255592298, "grad_norm": 1.0078125, "learning_rate": 0.00047947123163775924, "loss": 4.9717, "mean_token_accuracy": 0.20667457729578018, "num_tokens": 32028211.0, "step": 18475 }, { "entropy": 5.583381652832031, "epoch": 1.4378136549309473, "grad_norm": 1.1875, "learning_rate": 0.000479459663903537, "loss": 5.1022, "mean_token_accuracy": 0.19352666288614273, "num_tokens": 32036378.0, "step": 18480 }, { "entropy": 5.567234659194947, "epoch": 1.4382026843026647, "grad_norm": 1.0, "learning_rate": 0.0004794480930669649, "loss": 5.0267, "mean_token_accuracy": 0.19825142472982407, "num_tokens": 32045492.0, "step": 18485 }, { "entropy": 5.653302383422852, "epoch": 1.4385917136743824, "grad_norm": 1.109375, "learning_rate": 0.0004794365191282183, "loss": 5.215, "mean_token_accuracy": 0.18451925367116928, "num_tokens": 32054297.0, "step": 18490 }, { "entropy": 5.574009704589844, "epoch": 1.4389807430461, "grad_norm": 1.1953125, "learning_rate": 0.00047942494208747297, "loss": 4.9892, "mean_token_accuracy": 0.19539348036050797, "num_tokens": 32062602.0, "step": 18495 }, { "entropy": 5.518990516662598, "epoch": 1.4393697724178176, "grad_norm": 1.0390625, "learning_rate": 0.0004794133619449045, "loss": 5.0882, "mean_token_accuracy": 0.18784102648496628, "num_tokens": 32071752.0, "step": 18500 }, { "entropy": 5.554832220077515, "epoch": 1.439758801789535, "grad_norm": 1.1015625, "learning_rate": 0.0004794017787006886, "loss": 5.0078, "mean_token_accuracy": 0.19152483344078064, "num_tokens": 32080519.0, "step": 18505 }, { "entropy": 5.6091086864471436, "epoch": 1.4401478311612528, "grad_norm": 1.1328125, "learning_rate": 0.000479390192355001, "loss": 5.1461, "mean_token_accuracy": 0.18657961040735244, "num_tokens": 32089489.0, "step": 18510 }, { "entropy": 5.6602137088775635, "epoch": 1.4405368605329703, "grad_norm": 1.0703125, "learning_rate": 0.0004793786029080176, "loss": 5.1068, "mean_token_accuracy": 0.1916726365685463, "num_tokens": 32098199.0, "step": 18515 }, { "entropy": 5.583471298217773, "epoch": 1.4409258899046877, "grad_norm": 1.0625, "learning_rate": 0.0004793670103599143, "loss": 5.022, "mean_token_accuracy": 0.19564177542924882, "num_tokens": 32107340.0, "step": 18520 }, { "entropy": 5.6067112445831295, "epoch": 1.4413149192764054, "grad_norm": 1.2109375, "learning_rate": 0.00047935541471086677, "loss": 5.0732, "mean_token_accuracy": 0.19028545618057252, "num_tokens": 32115697.0, "step": 18525 }, { "entropy": 5.545618915557862, "epoch": 1.441703948648123, "grad_norm": 1.0625, "learning_rate": 0.0004793438159610511, "loss": 5.0347, "mean_token_accuracy": 0.1952441543340683, "num_tokens": 32124801.0, "step": 18530 }, { "entropy": 5.583477449417114, "epoch": 1.4420929780198404, "grad_norm": 1.109375, "learning_rate": 0.00047933221411064334, "loss": 5.0231, "mean_token_accuracy": 0.20084090381860734, "num_tokens": 32132728.0, "step": 18535 }, { "entropy": 5.522182941436768, "epoch": 1.442482007391558, "grad_norm": 1.125, "learning_rate": 0.0004793206091598194, "loss": 5.1676, "mean_token_accuracy": 0.18840880692005157, "num_tokens": 32141325.0, "step": 18540 }, { "entropy": 5.529790925979614, "epoch": 1.4428710367632755, "grad_norm": 1.1171875, "learning_rate": 0.0004793090011087554, "loss": 4.9449, "mean_token_accuracy": 0.20645099878311157, "num_tokens": 32149352.0, "step": 18545 }, { "entropy": 5.514100646972656, "epoch": 1.4432600661349932, "grad_norm": 1.1484375, "learning_rate": 0.00047929738995762755, "loss": 5.0425, "mean_token_accuracy": 0.19252483546733856, "num_tokens": 32158010.0, "step": 18550 }, { "entropy": 5.54469633102417, "epoch": 1.4436490955067107, "grad_norm": 1.125, "learning_rate": 0.000479285775706612, "loss": 5.0958, "mean_token_accuracy": 0.19382050782442092, "num_tokens": 32166204.0, "step": 18555 }, { "entropy": 5.65263147354126, "epoch": 1.4440381248784284, "grad_norm": 1.2265625, "learning_rate": 0.00047927415835588496, "loss": 5.1061, "mean_token_accuracy": 0.1996418908238411, "num_tokens": 32175005.0, "step": 18560 }, { "entropy": 5.611942291259766, "epoch": 1.444427154250146, "grad_norm": 1.1015625, "learning_rate": 0.00047926253790562265, "loss": 5.0374, "mean_token_accuracy": 0.20101397186517717, "num_tokens": 32183529.0, "step": 18565 }, { "entropy": 5.585473251342774, "epoch": 1.4448161836218634, "grad_norm": 1.0390625, "learning_rate": 0.00047925091435600147, "loss": 5.1397, "mean_token_accuracy": 0.1907166585326195, "num_tokens": 32192164.0, "step": 18570 }, { "entropy": 5.592973327636718, "epoch": 1.445205212993581, "grad_norm": 1.0390625, "learning_rate": 0.00047923928770719776, "loss": 5.1469, "mean_token_accuracy": 0.1953514188528061, "num_tokens": 32201852.0, "step": 18575 }, { "entropy": 5.514042663574219, "epoch": 1.4455942423652985, "grad_norm": 1.171875, "learning_rate": 0.00047922765795938797, "loss": 4.9733, "mean_token_accuracy": 0.19660549312829972, "num_tokens": 32210501.0, "step": 18580 }, { "entropy": 5.47713270187378, "epoch": 1.445983271737016, "grad_norm": 1.046875, "learning_rate": 0.0004792160251127485, "loss": 4.9376, "mean_token_accuracy": 0.20381859242916106, "num_tokens": 32219365.0, "step": 18585 }, { "entropy": 5.547822523117065, "epoch": 1.4463723011087337, "grad_norm": 1.1015625, "learning_rate": 0.00047920438916745586, "loss": 5.0707, "mean_token_accuracy": 0.18996737897396088, "num_tokens": 32228599.0, "step": 18590 }, { "entropy": 5.578655481338501, "epoch": 1.4467613304804512, "grad_norm": 1.046875, "learning_rate": 0.0004791927501236866, "loss": 5.1538, "mean_token_accuracy": 0.1950696513056755, "num_tokens": 32237544.0, "step": 18595 }, { "entropy": 5.55748176574707, "epoch": 1.4471503598521689, "grad_norm": 1.1171875, "learning_rate": 0.00047918110798161754, "loss": 5.0052, "mean_token_accuracy": 0.20111645758152008, "num_tokens": 32245953.0, "step": 18600 }, { "entropy": 5.562480354309082, "epoch": 1.4475393892238864, "grad_norm": 1.1640625, "learning_rate": 0.00047916946274142503, "loss": 4.9964, "mean_token_accuracy": 0.2085634157061577, "num_tokens": 32254050.0, "step": 18605 }, { "entropy": 5.518645620346069, "epoch": 1.447928418595604, "grad_norm": 1.0546875, "learning_rate": 0.00047915781440328593, "loss": 5.0151, "mean_token_accuracy": 0.19770674854516984, "num_tokens": 32262732.0, "step": 18610 }, { "entropy": 5.501862096786499, "epoch": 1.4483174479673215, "grad_norm": 1.0390625, "learning_rate": 0.0004791461629673769, "loss": 4.9903, "mean_token_accuracy": 0.1996803566813469, "num_tokens": 32271026.0, "step": 18615 }, { "entropy": 5.55328483581543, "epoch": 1.448706477339039, "grad_norm": 1.03125, "learning_rate": 0.0004791345084338748, "loss": 5.1333, "mean_token_accuracy": 0.18838211745023728, "num_tokens": 32280500.0, "step": 18620 }, { "entropy": 5.597522735595703, "epoch": 1.4490955067107567, "grad_norm": 1.0703125, "learning_rate": 0.0004791228508029565, "loss": 5.0555, "mean_token_accuracy": 0.1952091410756111, "num_tokens": 32289652.0, "step": 18625 }, { "entropy": 5.559080457687378, "epoch": 1.4494845360824742, "grad_norm": 1.109375, "learning_rate": 0.00047911119007479873, "loss": 5.0331, "mean_token_accuracy": 0.1981078267097473, "num_tokens": 32297938.0, "step": 18630 }, { "entropy": 5.531543207168579, "epoch": 1.4498735654541917, "grad_norm": 1.1015625, "learning_rate": 0.00047909952624957866, "loss": 4.9535, "mean_token_accuracy": 0.21116172671318054, "num_tokens": 32306771.0, "step": 18635 }, { "entropy": 5.55816798210144, "epoch": 1.4502625948259094, "grad_norm": 1.09375, "learning_rate": 0.000479087859327473, "loss": 5.0901, "mean_token_accuracy": 0.1919173091650009, "num_tokens": 32315086.0, "step": 18640 }, { "entropy": 5.582638883590699, "epoch": 1.450651624197627, "grad_norm": 1.078125, "learning_rate": 0.000479076189308659, "loss": 5.0951, "mean_token_accuracy": 0.19438012987375258, "num_tokens": 32323763.0, "step": 18645 }, { "entropy": 5.568017435073853, "epoch": 1.4510406535693445, "grad_norm": 1.078125, "learning_rate": 0.00047906451619331364, "loss": 5.0924, "mean_token_accuracy": 0.18953520357608794, "num_tokens": 32332742.0, "step": 18650 }, { "entropy": 5.544163656234741, "epoch": 1.451429682941062, "grad_norm": 0.97265625, "learning_rate": 0.00047905283998161404, "loss": 5.1485, "mean_token_accuracy": 0.18568762838840486, "num_tokens": 32341598.0, "step": 18655 }, { "entropy": 5.5970807552337645, "epoch": 1.4518187123127797, "grad_norm": 1.09375, "learning_rate": 0.00047904116067373743, "loss": 5.0973, "mean_token_accuracy": 0.19539392441511155, "num_tokens": 32350468.0, "step": 18660 }, { "entropy": 5.565386629104614, "epoch": 1.4522077416844972, "grad_norm": 1.1328125, "learning_rate": 0.0004790294782698609, "loss": 5.0406, "mean_token_accuracy": 0.19747879803180696, "num_tokens": 32359569.0, "step": 18665 }, { "entropy": 5.561293315887451, "epoch": 1.4525967710562147, "grad_norm": 1.03125, "learning_rate": 0.0004790177927701618, "loss": 5.0712, "mean_token_accuracy": 0.19361127465963363, "num_tokens": 32368655.0, "step": 18670 }, { "entropy": 5.553066968917847, "epoch": 1.4529858004279324, "grad_norm": 1.0859375, "learning_rate": 0.0004790061041748174, "loss": 5.0351, "mean_token_accuracy": 0.1976610541343689, "num_tokens": 32377132.0, "step": 18675 }, { "entropy": 5.52764139175415, "epoch": 1.4533748297996498, "grad_norm": 1.0859375, "learning_rate": 0.0004789944124840051, "loss": 5.0422, "mean_token_accuracy": 0.19478783756494522, "num_tokens": 32385605.0, "step": 18680 }, { "entropy": 5.521400785446167, "epoch": 1.4537638591713673, "grad_norm": 1.09375, "learning_rate": 0.0004789827176979022, "loss": 5.0372, "mean_token_accuracy": 0.20212470591068268, "num_tokens": 32394195.0, "step": 18685 }, { "entropy": 5.598244857788086, "epoch": 1.454152888543085, "grad_norm": 1.078125, "learning_rate": 0.0004789710198166864, "loss": 5.1681, "mean_token_accuracy": 0.19377706348896026, "num_tokens": 32403278.0, "step": 18690 }, { "entropy": 5.592105197906494, "epoch": 1.4545419179148027, "grad_norm": 1.0859375, "learning_rate": 0.00047895931884053497, "loss": 5.0736, "mean_token_accuracy": 0.19358156770467758, "num_tokens": 32411388.0, "step": 18695 }, { "entropy": 5.5809712409973145, "epoch": 1.4549309472865202, "grad_norm": 1.1171875, "learning_rate": 0.00047894761476962547, "loss": 5.0025, "mean_token_accuracy": 0.19814395010471345, "num_tokens": 32420860.0, "step": 18700 }, { "entropy": 5.546928548812867, "epoch": 1.4553199766582376, "grad_norm": 1.203125, "learning_rate": 0.00047893590760413545, "loss": 5.0309, "mean_token_accuracy": 0.20104021281003953, "num_tokens": 32428914.0, "step": 18705 }, { "entropy": 5.511069917678833, "epoch": 1.4557090060299553, "grad_norm": 1.2734375, "learning_rate": 0.00047892419734424276, "loss": 5.0004, "mean_token_accuracy": 0.19954125583171844, "num_tokens": 32436704.0, "step": 18710 }, { "entropy": 5.522685098648071, "epoch": 1.4560980354016728, "grad_norm": 1.140625, "learning_rate": 0.00047891248399012495, "loss": 5.0706, "mean_token_accuracy": 0.1983110025525093, "num_tokens": 32444963.0, "step": 18715 }, { "entropy": 5.472441720962524, "epoch": 1.4564870647733903, "grad_norm": 1.0234375, "learning_rate": 0.0004789007675419597, "loss": 4.9568, "mean_token_accuracy": 0.2016046166419983, "num_tokens": 32454148.0, "step": 18720 }, { "entropy": 5.486963081359863, "epoch": 1.456876094145108, "grad_norm": 1.1328125, "learning_rate": 0.00047888904799992486, "loss": 4.9368, "mean_token_accuracy": 0.20393495857715607, "num_tokens": 32463084.0, "step": 18725 }, { "entropy": 5.511074876785278, "epoch": 1.4572651235168255, "grad_norm": 1.0625, "learning_rate": 0.00047887732536419826, "loss": 5.0189, "mean_token_accuracy": 0.19480252861976624, "num_tokens": 32471689.0, "step": 18730 }, { "entropy": 5.567481803894043, "epoch": 1.4576541528885432, "grad_norm": 1.0625, "learning_rate": 0.0004788655996349577, "loss": 5.0576, "mean_token_accuracy": 0.19184796810150145, "num_tokens": 32480243.0, "step": 18735 }, { "entropy": 5.492781686782837, "epoch": 1.4580431822602606, "grad_norm": 1.1171875, "learning_rate": 0.00047885387081238125, "loss": 4.9535, "mean_token_accuracy": 0.20447610318660736, "num_tokens": 32488782.0, "step": 18740 }, { "entropy": 5.530826997756958, "epoch": 1.4584322116319783, "grad_norm": 1.1328125, "learning_rate": 0.0004788421388966467, "loss": 5.0596, "mean_token_accuracy": 0.19475236684083938, "num_tokens": 32497692.0, "step": 18745 }, { "entropy": 5.5739185333251955, "epoch": 1.4588212410036958, "grad_norm": 1.0234375, "learning_rate": 0.00047883040388793207, "loss": 5.094, "mean_token_accuracy": 0.19232002198696135, "num_tokens": 32507046.0, "step": 18750 }, { "entropy": 5.682011318206787, "epoch": 1.4592102703754133, "grad_norm": 1.0703125, "learning_rate": 0.00047881866578641563, "loss": 5.1712, "mean_token_accuracy": 0.1911939039826393, "num_tokens": 32516602.0, "step": 18755 }, { "entropy": 5.600255727767944, "epoch": 1.459599299747131, "grad_norm": 1.0703125, "learning_rate": 0.0004788069245922753, "loss": 5.1044, "mean_token_accuracy": 0.1946917861700058, "num_tokens": 32524779.0, "step": 18760 }, { "entropy": 5.524578857421875, "epoch": 1.4599883291188485, "grad_norm": 1.109375, "learning_rate": 0.0004787951803056893, "loss": 4.9937, "mean_token_accuracy": 0.1964445099234581, "num_tokens": 32533207.0, "step": 18765 }, { "entropy": 5.5487542152404785, "epoch": 1.460377358490566, "grad_norm": 1.0625, "learning_rate": 0.0004787834329268358, "loss": 5.0084, "mean_token_accuracy": 0.20234522074460984, "num_tokens": 32542447.0, "step": 18770 }, { "entropy": 5.509467840194702, "epoch": 1.4607663878622836, "grad_norm": 1.0234375, "learning_rate": 0.000478771682455893, "loss": 4.9865, "mean_token_accuracy": 0.19997165501117706, "num_tokens": 32551888.0, "step": 18775 }, { "entropy": 5.55902214050293, "epoch": 1.461155417234001, "grad_norm": 1.1875, "learning_rate": 0.0004787599288930393, "loss": 5.0319, "mean_token_accuracy": 0.19427230209112167, "num_tokens": 32559639.0, "step": 18780 }, { "entropy": 5.567389869689942, "epoch": 1.4615444466057188, "grad_norm": 1.2734375, "learning_rate": 0.000478748172238453, "loss": 5.0578, "mean_token_accuracy": 0.19651602506637572, "num_tokens": 32567518.0, "step": 18785 }, { "entropy": 5.61395001411438, "epoch": 1.4619334759774363, "grad_norm": 1.0625, "learning_rate": 0.0004787364124923125, "loss": 5.09, "mean_token_accuracy": 0.20352420657873155, "num_tokens": 32576040.0, "step": 18790 }, { "entropy": 5.572337007522583, "epoch": 1.462322505349154, "grad_norm": 1.0234375, "learning_rate": 0.00047872464965479625, "loss": 5.075, "mean_token_accuracy": 0.19988814145326614, "num_tokens": 32584978.0, "step": 18795 }, { "entropy": 5.594401788711548, "epoch": 1.4627115347208715, "grad_norm": 1.125, "learning_rate": 0.0004787128837260826, "loss": 5.121, "mean_token_accuracy": 0.190612356364727, "num_tokens": 32593700.0, "step": 18800 }, { "entropy": 5.575336694717407, "epoch": 1.463100564092589, "grad_norm": 1.1484375, "learning_rate": 0.0004787011147063503, "loss": 5.1079, "mean_token_accuracy": 0.18457038551568986, "num_tokens": 32602509.0, "step": 18805 }, { "entropy": 5.61750636100769, "epoch": 1.4634895934643066, "grad_norm": 1.1328125, "learning_rate": 0.0004786893425957777, "loss": 5.0914, "mean_token_accuracy": 0.19278372526168824, "num_tokens": 32611740.0, "step": 18810 }, { "entropy": 5.54319748878479, "epoch": 1.463878622836024, "grad_norm": 2.0625, "learning_rate": 0.0004786775673945436, "loss": 5.0269, "mean_token_accuracy": 0.209192718565464, "num_tokens": 32621285.0, "step": 18815 }, { "entropy": 5.5690044403076175, "epoch": 1.4642676522077416, "grad_norm": 1.015625, "learning_rate": 0.00047866578910282656, "loss": 5.0156, "mean_token_accuracy": 0.19824934154748916, "num_tokens": 32629610.0, "step": 18820 }, { "entropy": 5.53894419670105, "epoch": 1.4646566815794593, "grad_norm": 1.078125, "learning_rate": 0.00047865400772080535, "loss": 4.9141, "mean_token_accuracy": 0.2051255449652672, "num_tokens": 32637907.0, "step": 18825 }, { "entropy": 5.488312768936157, "epoch": 1.4650457109511767, "grad_norm": 1.015625, "learning_rate": 0.00047864222324865875, "loss": 5.0358, "mean_token_accuracy": 0.19553977251052856, "num_tokens": 32646783.0, "step": 18830 }, { "entropy": 5.512218618392945, "epoch": 1.4654347403228944, "grad_norm": 1.1171875, "learning_rate": 0.0004786304356865655, "loss": 4.9635, "mean_token_accuracy": 0.20518088340759277, "num_tokens": 32655538.0, "step": 18835 }, { "entropy": 5.499580574035645, "epoch": 1.465823769694612, "grad_norm": 1.0859375, "learning_rate": 0.00047861864503470457, "loss": 4.9203, "mean_token_accuracy": 0.21253649592399598, "num_tokens": 32663683.0, "step": 18840 }, { "entropy": 5.554932737350464, "epoch": 1.4662127990663296, "grad_norm": 1.109375, "learning_rate": 0.0004786068512932547, "loss": 5.0646, "mean_token_accuracy": 0.19895505160093307, "num_tokens": 32671961.0, "step": 18845 }, { "entropy": 5.62546739578247, "epoch": 1.466601828438047, "grad_norm": 1.0703125, "learning_rate": 0.000478595054462395, "loss": 5.0978, "mean_token_accuracy": 0.19595526307821273, "num_tokens": 32680672.0, "step": 18850 }, { "entropy": 5.6233861446380615, "epoch": 1.4669908578097646, "grad_norm": 1.1484375, "learning_rate": 0.00047858325454230437, "loss": 5.153, "mean_token_accuracy": 0.18422453254461288, "num_tokens": 32690481.0, "step": 18855 }, { "entropy": 5.556326580047608, "epoch": 1.4673798871814823, "grad_norm": 1.078125, "learning_rate": 0.0004785714515331619, "loss": 5.0634, "mean_token_accuracy": 0.1886402979493141, "num_tokens": 32698956.0, "step": 18860 }, { "entropy": 5.609915733337402, "epoch": 1.4677689165531997, "grad_norm": 1.15625, "learning_rate": 0.00047855964543514666, "loss": 5.1192, "mean_token_accuracy": 0.18813333958387374, "num_tokens": 32707018.0, "step": 18865 }, { "entropy": 5.562416028976441, "epoch": 1.4681579459249172, "grad_norm": 1.0234375, "learning_rate": 0.00047854783624843786, "loss": 5.042, "mean_token_accuracy": 0.18667346686124803, "num_tokens": 32717278.0, "step": 18870 }, { "entropy": 5.550019550323486, "epoch": 1.468546975296635, "grad_norm": 1.046875, "learning_rate": 0.00047853602397321453, "loss": 5.0494, "mean_token_accuracy": 0.19212803840637208, "num_tokens": 32725778.0, "step": 18875 }, { "entropy": 5.541028261184692, "epoch": 1.4689360046683524, "grad_norm": 1.1171875, "learning_rate": 0.00047852420860965605, "loss": 5.0651, "mean_token_accuracy": 0.19158881306648254, "num_tokens": 32734457.0, "step": 18880 }, { "entropy": 5.532605409622192, "epoch": 1.46932503404007, "grad_norm": 1.125, "learning_rate": 0.00047851239015794166, "loss": 4.9764, "mean_token_accuracy": 0.19497962445020675, "num_tokens": 32742583.0, "step": 18885 }, { "entropy": 5.57095947265625, "epoch": 1.4697140634117876, "grad_norm": 1.109375, "learning_rate": 0.00047850056861825066, "loss": 5.0577, "mean_token_accuracy": 0.19372896403074263, "num_tokens": 32751273.0, "step": 18890 }, { "entropy": 5.522993087768555, "epoch": 1.4701030927835053, "grad_norm": 1.140625, "learning_rate": 0.00047848874399076245, "loss": 4.9468, "mean_token_accuracy": 0.19745635986328125, "num_tokens": 32759428.0, "step": 18895 }, { "entropy": 5.539993762969971, "epoch": 1.4704921221552227, "grad_norm": 1.1171875, "learning_rate": 0.0004784769162756563, "loss": 5.0546, "mean_token_accuracy": 0.20103904008865356, "num_tokens": 32768032.0, "step": 18900 }, { "entropy": 5.605464696884155, "epoch": 1.4708811515269402, "grad_norm": 1.0390625, "learning_rate": 0.000478465085473112, "loss": 5.124, "mean_token_accuracy": 0.19227155297994614, "num_tokens": 32777485.0, "step": 18905 }, { "entropy": 5.599140644073486, "epoch": 1.471270180898658, "grad_norm": 1.0546875, "learning_rate": 0.0004784532515833088, "loss": 5.213, "mean_token_accuracy": 0.17923856526613235, "num_tokens": 32785794.0, "step": 18910 }, { "entropy": 5.54658784866333, "epoch": 1.4716592102703754, "grad_norm": 1.1015625, "learning_rate": 0.00047844141460642636, "loss": 5.0358, "mean_token_accuracy": 0.19192324727773666, "num_tokens": 32794396.0, "step": 18915 }, { "entropy": 5.531925058364868, "epoch": 1.4720482396420929, "grad_norm": 1.2109375, "learning_rate": 0.00047842957454264425, "loss": 5.0122, "mean_token_accuracy": 0.19278449118137359, "num_tokens": 32802912.0, "step": 18920 }, { "entropy": 5.48994722366333, "epoch": 1.4724372690138106, "grad_norm": 1.0546875, "learning_rate": 0.00047841773139214213, "loss": 4.9667, "mean_token_accuracy": 0.20175158828496934, "num_tokens": 32811683.0, "step": 18925 }, { "entropy": 5.5172168731689455, "epoch": 1.472826298385528, "grad_norm": 0.9921875, "learning_rate": 0.0004784058851550997, "loss": 5.0274, "mean_token_accuracy": 0.19538899511098862, "num_tokens": 32821035.0, "step": 18930 }, { "entropy": 5.557153701782227, "epoch": 1.4732153277572457, "grad_norm": 1.1484375, "learning_rate": 0.0004783940358316967, "loss": 5.0081, "mean_token_accuracy": 0.19770071357488633, "num_tokens": 32829678.0, "step": 18935 }, { "entropy": 5.543934488296509, "epoch": 1.4736043571289632, "grad_norm": 1.1484375, "learning_rate": 0.00047838218342211296, "loss": 5.117, "mean_token_accuracy": 0.1937295228242874, "num_tokens": 32838048.0, "step": 18940 }, { "entropy": 5.4855937480926515, "epoch": 1.473993386500681, "grad_norm": 1.0390625, "learning_rate": 0.00047837032792652837, "loss": 4.9844, "mean_token_accuracy": 0.20186340659856797, "num_tokens": 32846380.0, "step": 18945 }, { "entropy": 5.6162858486175535, "epoch": 1.4743824158723984, "grad_norm": 1.0859375, "learning_rate": 0.0004783584693451226, "loss": 5.132, "mean_token_accuracy": 0.18568824827671052, "num_tokens": 32855318.0, "step": 18950 }, { "entropy": 5.654341459274292, "epoch": 1.4747714452441159, "grad_norm": 1.0078125, "learning_rate": 0.0004783466076780759, "loss": 5.1094, "mean_token_accuracy": 0.18727703541517257, "num_tokens": 32864494.0, "step": 18955 }, { "entropy": 5.577995157241821, "epoch": 1.4751604746158336, "grad_norm": 1.0703125, "learning_rate": 0.0004783347429255679, "loss": 4.9787, "mean_token_accuracy": 0.19697563350200653, "num_tokens": 32872770.0, "step": 18960 }, { "entropy": 5.515985774993896, "epoch": 1.475549503987551, "grad_norm": 1.1875, "learning_rate": 0.000478322875087779, "loss": 5.0694, "mean_token_accuracy": 0.19254512935876847, "num_tokens": 32881249.0, "step": 18965 }, { "entropy": 5.576406192779541, "epoch": 1.4759385333592685, "grad_norm": 1.125, "learning_rate": 0.00047831100416488906, "loss": 5.1155, "mean_token_accuracy": 0.19401678144931794, "num_tokens": 32890197.0, "step": 18970 }, { "entropy": 5.527444696426391, "epoch": 1.4763275627309862, "grad_norm": 1.171875, "learning_rate": 0.00047829913015707816, "loss": 5.0208, "mean_token_accuracy": 0.20043394416570665, "num_tokens": 32898424.0, "step": 18975 }, { "entropy": 5.536509990692139, "epoch": 1.4767165921027037, "grad_norm": 1.109375, "learning_rate": 0.00047828725306452657, "loss": 5.0216, "mean_token_accuracy": 0.1982140436768532, "num_tokens": 32906527.0, "step": 18980 }, { "entropy": 5.52204737663269, "epoch": 1.4771056214744214, "grad_norm": 1.1328125, "learning_rate": 0.00047827537288741453, "loss": 5.0231, "mean_token_accuracy": 0.19963836371898652, "num_tokens": 32914954.0, "step": 18985 }, { "entropy": 5.532572460174561, "epoch": 1.4774946508461388, "grad_norm": 1.0546875, "learning_rate": 0.0004782634896259222, "loss": 5.0581, "mean_token_accuracy": 0.19437048137187957, "num_tokens": 32923562.0, "step": 18990 }, { "entropy": 5.546833848953247, "epoch": 1.4778836802178565, "grad_norm": 1.0234375, "learning_rate": 0.00047825160328023, "loss": 5.0221, "mean_token_accuracy": 0.2039424732327461, "num_tokens": 32931735.0, "step": 18995 }, { "entropy": 5.585835981369018, "epoch": 1.478272709589574, "grad_norm": 1.125, "learning_rate": 0.0004782397138505181, "loss": 5.0452, "mean_token_accuracy": 0.1972127839922905, "num_tokens": 32940282.0, "step": 19000 }, { "entropy": 5.526833629608154, "epoch": 1.4786617389612915, "grad_norm": 1.1171875, "learning_rate": 0.00047822782133696715, "loss": 5.0178, "mean_token_accuracy": 0.18914930522441864, "num_tokens": 32948354.0, "step": 19005 }, { "entropy": 5.554025602340698, "epoch": 1.4790507683330092, "grad_norm": 1.0390625, "learning_rate": 0.0004782159257397574, "loss": 5.0473, "mean_token_accuracy": 0.1947380468249321, "num_tokens": 32957489.0, "step": 19010 }, { "entropy": 5.676969861984253, "epoch": 1.4794397977047267, "grad_norm": 1.1328125, "learning_rate": 0.00047820402705906953, "loss": 5.2671, "mean_token_accuracy": 0.17776482850313186, "num_tokens": 32967739.0, "step": 19015 }, { "entropy": 5.619980192184448, "epoch": 1.4798288270764441, "grad_norm": 1.15625, "learning_rate": 0.00047819212529508394, "loss": 5.1053, "mean_token_accuracy": 0.19449526816606522, "num_tokens": 32976131.0, "step": 19020 }, { "entropy": 5.613455104827881, "epoch": 1.4802178564481618, "grad_norm": 1.109375, "learning_rate": 0.0004781802204479812, "loss": 5.119, "mean_token_accuracy": 0.19957145750522615, "num_tokens": 32984678.0, "step": 19025 }, { "entropy": 5.530535078048706, "epoch": 1.4806068858198795, "grad_norm": 1.0859375, "learning_rate": 0.0004781683125179421, "loss": 4.9376, "mean_token_accuracy": 0.20044415444135666, "num_tokens": 32993117.0, "step": 19030 }, { "entropy": 5.5346996784210205, "epoch": 1.480995915191597, "grad_norm": 1.1875, "learning_rate": 0.0004781564015051472, "loss": 5.0229, "mean_token_accuracy": 0.2034488156437874, "num_tokens": 33002104.0, "step": 19035 }, { "entropy": 5.5476133823394775, "epoch": 1.4813849445633145, "grad_norm": 1.1171875, "learning_rate": 0.0004781444874097772, "loss": 4.9966, "mean_token_accuracy": 0.19342254102230072, "num_tokens": 33010515.0, "step": 19040 }, { "entropy": 5.609853649139405, "epoch": 1.4817739739350322, "grad_norm": 1.0625, "learning_rate": 0.00047813257023201307, "loss": 5.0851, "mean_token_accuracy": 0.19935715645551683, "num_tokens": 33019448.0, "step": 19045 }, { "entropy": 5.603008127212524, "epoch": 1.4821630033067497, "grad_norm": 1.1171875, "learning_rate": 0.0004781206499720354, "loss": 5.0694, "mean_token_accuracy": 0.19271350353956224, "num_tokens": 33027490.0, "step": 19050 }, { "entropy": 5.525425100326538, "epoch": 1.4825520326784671, "grad_norm": 1.0390625, "learning_rate": 0.00047810872663002523, "loss": 5.1014, "mean_token_accuracy": 0.19199770241975783, "num_tokens": 33036428.0, "step": 19055 }, { "entropy": 5.543790483474732, "epoch": 1.4829410620501848, "grad_norm": 1.109375, "learning_rate": 0.00047809680020616333, "loss": 5.0579, "mean_token_accuracy": 0.1909507155418396, "num_tokens": 33045366.0, "step": 19060 }, { "entropy": 5.60338864326477, "epoch": 1.4833300914219023, "grad_norm": 1.1328125, "learning_rate": 0.00047808487070063083, "loss": 5.005, "mean_token_accuracy": 0.20054623782634734, "num_tokens": 33054280.0, "step": 19065 }, { "entropy": 5.527318048477173, "epoch": 1.4837191207936198, "grad_norm": 1.109375, "learning_rate": 0.0004780729381136086, "loss": 5.0108, "mean_token_accuracy": 0.19764809012413026, "num_tokens": 33062935.0, "step": 19070 }, { "entropy": 5.542918300628662, "epoch": 1.4841081501653375, "grad_norm": 1.03125, "learning_rate": 0.0004780610024452778, "loss": 5.0178, "mean_token_accuracy": 0.20716737806797028, "num_tokens": 33071795.0, "step": 19075 }, { "entropy": 5.543208837509155, "epoch": 1.4844971795370552, "grad_norm": 1.1015625, "learning_rate": 0.00047804906369581954, "loss": 5.0316, "mean_token_accuracy": 0.19775291234254838, "num_tokens": 33080280.0, "step": 19080 }, { "entropy": 5.533397769927978, "epoch": 1.4848862089087727, "grad_norm": 1.109375, "learning_rate": 0.0004780371218654148, "loss": 5.0203, "mean_token_accuracy": 0.2004026934504509, "num_tokens": 33089125.0, "step": 19085 }, { "entropy": 5.469947862625122, "epoch": 1.4852752382804901, "grad_norm": 1.078125, "learning_rate": 0.00047802517695424496, "loss": 4.974, "mean_token_accuracy": 0.20168286710977554, "num_tokens": 33097632.0, "step": 19090 }, { "entropy": 5.632231855392456, "epoch": 1.4856642676522078, "grad_norm": 1.078125, "learning_rate": 0.0004780132289624913, "loss": 5.0795, "mean_token_accuracy": 0.19432080686092376, "num_tokens": 33106318.0, "step": 19095 }, { "entropy": 5.558058166503907, "epoch": 1.4860532970239253, "grad_norm": 1.1796875, "learning_rate": 0.0004780012778903349, "loss": 5.0393, "mean_token_accuracy": 0.20190412253141404, "num_tokens": 33115268.0, "step": 19100 }, { "entropy": 5.500111627578735, "epoch": 1.4864423263956428, "grad_norm": 1.0390625, "learning_rate": 0.00047798932373795724, "loss": 5.0698, "mean_token_accuracy": 0.19048128724098207, "num_tokens": 33123968.0, "step": 19105 }, { "entropy": 5.627884340286255, "epoch": 1.4868313557673605, "grad_norm": 1.0390625, "learning_rate": 0.00047797736650553977, "loss": 5.0829, "mean_token_accuracy": 0.20432619899511337, "num_tokens": 33132775.0, "step": 19110 }, { "entropy": 5.551082754135132, "epoch": 1.487220385139078, "grad_norm": 1.0859375, "learning_rate": 0.00047796540619326366, "loss": 4.9859, "mean_token_accuracy": 0.1998939499258995, "num_tokens": 33141319.0, "step": 19115 }, { "entropy": 5.514258337020874, "epoch": 1.4876094145107956, "grad_norm": 1.0859375, "learning_rate": 0.0004779534428013107, "loss": 5.0423, "mean_token_accuracy": 0.19480806738138198, "num_tokens": 33150175.0, "step": 19120 }, { "entropy": 5.49319634437561, "epoch": 1.4879984438825131, "grad_norm": 1.0625, "learning_rate": 0.00047794147632986223, "loss": 4.9903, "mean_token_accuracy": 0.19951022714376448, "num_tokens": 33159961.0, "step": 19125 }, { "entropy": 5.55402398109436, "epoch": 1.4883874732542308, "grad_norm": 1.0546875, "learning_rate": 0.0004779295067790999, "loss": 5.0472, "mean_token_accuracy": 0.19604973047971724, "num_tokens": 33168672.0, "step": 19130 }, { "entropy": 5.574004983901977, "epoch": 1.4887765026259483, "grad_norm": 1.1796875, "learning_rate": 0.0004779175341492053, "loss": 5.0091, "mean_token_accuracy": 0.19269197881221772, "num_tokens": 33177229.0, "step": 19135 }, { "entropy": 5.58456563949585, "epoch": 1.4891655319976658, "grad_norm": 1.0546875, "learning_rate": 0.0004779055584403601, "loss": 5.0828, "mean_token_accuracy": 0.18931804448366166, "num_tokens": 33185673.0, "step": 19140 }, { "entropy": 5.542715454101563, "epoch": 1.4895545613693835, "grad_norm": 1.09375, "learning_rate": 0.000477893579652746, "loss": 4.9757, "mean_token_accuracy": 0.20158514082431794, "num_tokens": 33194860.0, "step": 19145 }, { "entropy": 5.587748908996582, "epoch": 1.489943590741101, "grad_norm": 1.0859375, "learning_rate": 0.00047788159778654475, "loss": 5.0831, "mean_token_accuracy": 0.19882684648036958, "num_tokens": 33203205.0, "step": 19150 }, { "entropy": 5.54861536026001, "epoch": 1.4903326201128184, "grad_norm": 1.1484375, "learning_rate": 0.00047786961284193813, "loss": 5.0886, "mean_token_accuracy": 0.19064337462186814, "num_tokens": 33211359.0, "step": 19155 }, { "entropy": 5.617289638519287, "epoch": 1.4907216494845361, "grad_norm": 1.0703125, "learning_rate": 0.0004778576248191081, "loss": 5.0862, "mean_token_accuracy": 0.20279954075813295, "num_tokens": 33220176.0, "step": 19160 }, { "entropy": 5.479634475708008, "epoch": 1.4911106788562536, "grad_norm": 1.0625, "learning_rate": 0.0004778456337182365, "loss": 5.0193, "mean_token_accuracy": 0.2093699350953102, "num_tokens": 33228254.0, "step": 19165 }, { "entropy": 5.474156475067138, "epoch": 1.4914997082279713, "grad_norm": 1.1015625, "learning_rate": 0.0004778336395395052, "loss": 4.956, "mean_token_accuracy": 0.20219864696264267, "num_tokens": 33236411.0, "step": 19170 }, { "entropy": 5.525721693038941, "epoch": 1.4918887375996888, "grad_norm": 1.15625, "learning_rate": 0.00047782164228309636, "loss": 5.0878, "mean_token_accuracy": 0.19211238920688628, "num_tokens": 33244222.0, "step": 19175 }, { "entropy": 5.567611265182495, "epoch": 1.4922777669714065, "grad_norm": 1.046875, "learning_rate": 0.00047780964194919193, "loss": 5.0757, "mean_token_accuracy": 0.19291103333234788, "num_tokens": 33253609.0, "step": 19180 }, { "entropy": 5.602247667312622, "epoch": 1.492666796343124, "grad_norm": 1.0625, "learning_rate": 0.00047779763853797387, "loss": 5.0371, "mean_token_accuracy": 0.19836950898170472, "num_tokens": 33262002.0, "step": 19185 }, { "entropy": 5.561488008499145, "epoch": 1.4930558257148414, "grad_norm": 1.125, "learning_rate": 0.0004777856320496245, "loss": 5.0692, "mean_token_accuracy": 0.19719235748052596, "num_tokens": 33271185.0, "step": 19190 }, { "entropy": 5.534680128097534, "epoch": 1.493444855086559, "grad_norm": 1.046875, "learning_rate": 0.000477773622484326, "loss": 5.0577, "mean_token_accuracy": 0.19225019216537476, "num_tokens": 33280205.0, "step": 19195 }, { "entropy": 5.617606544494629, "epoch": 1.4938338844582766, "grad_norm": 1.25, "learning_rate": 0.0004777616098422604, "loss": 5.0831, "mean_token_accuracy": 0.19693068712949752, "num_tokens": 33288846.0, "step": 19200 }, { "entropy": 5.5117240905761715, "epoch": 1.494222913829994, "grad_norm": 1.1328125, "learning_rate": 0.00047774959412361014, "loss": 5.0209, "mean_token_accuracy": 0.19191986918449402, "num_tokens": 33297057.0, "step": 19205 }, { "entropy": 5.50296196937561, "epoch": 1.4946119432017118, "grad_norm": 1.2578125, "learning_rate": 0.0004777375753285575, "loss": 4.9524, "mean_token_accuracy": 0.20566382110118867, "num_tokens": 33305091.0, "step": 19210 }, { "entropy": 5.616590070724487, "epoch": 1.4950009725734292, "grad_norm": 1.203125, "learning_rate": 0.00047772555345728486, "loss": 5.1389, "mean_token_accuracy": 0.20009548217058182, "num_tokens": 33313383.0, "step": 19215 }, { "entropy": 5.551234436035156, "epoch": 1.495390001945147, "grad_norm": 1.140625, "learning_rate": 0.0004777135285099746, "loss": 5.0683, "mean_token_accuracy": 0.20243726521730424, "num_tokens": 33322521.0, "step": 19220 }, { "entropy": 5.602776145935058, "epoch": 1.4957790313168644, "grad_norm": 1.0703125, "learning_rate": 0.0004777015004868092, "loss": 5.2338, "mean_token_accuracy": 0.18354346603155136, "num_tokens": 33331474.0, "step": 19225 }, { "entropy": 5.6186521530151365, "epoch": 1.496168060688582, "grad_norm": 1.125, "learning_rate": 0.0004776894693879712, "loss": 5.0888, "mean_token_accuracy": 0.1937849074602127, "num_tokens": 33341354.0, "step": 19230 }, { "entropy": 5.526188516616822, "epoch": 1.4965570900602996, "grad_norm": 1.15625, "learning_rate": 0.0004776774352136431, "loss": 5.0076, "mean_token_accuracy": 0.20695056319236754, "num_tokens": 33349256.0, "step": 19235 }, { "entropy": 5.594116353988648, "epoch": 1.496946119432017, "grad_norm": 1.09375, "learning_rate": 0.00047766539796400756, "loss": 5.1141, "mean_token_accuracy": 0.19094278663396835, "num_tokens": 33358543.0, "step": 19240 }, { "entropy": 5.5897684574127195, "epoch": 1.4973351488037348, "grad_norm": 1.140625, "learning_rate": 0.0004776533576392471, "loss": 5.1171, "mean_token_accuracy": 0.19825131297111512, "num_tokens": 33366695.0, "step": 19245 }, { "entropy": 5.598502349853516, "epoch": 1.4977241781754522, "grad_norm": 1.0390625, "learning_rate": 0.0004776413142395445, "loss": 5.1075, "mean_token_accuracy": 0.19641636312007904, "num_tokens": 33375596.0, "step": 19250 }, { "entropy": 5.592920112609863, "epoch": 1.4981132075471697, "grad_norm": 1.0234375, "learning_rate": 0.00047762926776508244, "loss": 5.0582, "mean_token_accuracy": 0.19774041920900345, "num_tokens": 33385304.0, "step": 19255 }, { "entropy": 5.490079021453857, "epoch": 1.4985022369188874, "grad_norm": 1.0859375, "learning_rate": 0.00047761721821604387, "loss": 5.0022, "mean_token_accuracy": 0.19547391384840013, "num_tokens": 33394110.0, "step": 19260 }, { "entropy": 5.545273017883301, "epoch": 1.4988912662906049, "grad_norm": 1.0859375, "learning_rate": 0.0004776051655926115, "loss": 5.0182, "mean_token_accuracy": 0.19738116413354873, "num_tokens": 33403430.0, "step": 19265 }, { "entropy": 5.535129356384277, "epoch": 1.4992802956623226, "grad_norm": 1.125, "learning_rate": 0.00047759310989496813, "loss": 5.0819, "mean_token_accuracy": 0.20044422298669815, "num_tokens": 33411853.0, "step": 19270 }, { "entropy": 5.550904893875122, "epoch": 1.49966932503404, "grad_norm": 1.1640625, "learning_rate": 0.0004775810511232969, "loss": 5.0601, "mean_token_accuracy": 0.1886581525206566, "num_tokens": 33420579.0, "step": 19275 }, { "entropy": 5.528168821334839, "epoch": 1.5000583544057577, "grad_norm": 1.0625, "learning_rate": 0.00047756898927778056, "loss": 5.0109, "mean_token_accuracy": 0.2010014221072197, "num_tokens": 33429290.0, "step": 19280 }, { "entropy": 5.637648963928223, "epoch": 1.5004473837774752, "grad_norm": 1.0625, "learning_rate": 0.00047755692435860227, "loss": 5.1133, "mean_token_accuracy": 0.1969171106815338, "num_tokens": 33437962.0, "step": 19285 }, { "entropy": 5.618480014801025, "epoch": 1.5008364131491927, "grad_norm": 1.109375, "learning_rate": 0.000477544856365945, "loss": 5.119, "mean_token_accuracy": 0.19115120321512222, "num_tokens": 33446755.0, "step": 19290 }, { "entropy": 5.574110698699951, "epoch": 1.5012254425209104, "grad_norm": 1.140625, "learning_rate": 0.00047753278529999205, "loss": 5.0515, "mean_token_accuracy": 0.19534226953983308, "num_tokens": 33455223.0, "step": 19295 }, { "entropy": 5.584450054168701, "epoch": 1.5016144718926279, "grad_norm": 1.09375, "learning_rate": 0.00047752071116092637, "loss": 5.0471, "mean_token_accuracy": 0.19488006830215454, "num_tokens": 33463089.0, "step": 19300 }, { "entropy": 5.625916004180908, "epoch": 1.5020035012643453, "grad_norm": 1.1640625, "learning_rate": 0.0004775086339489312, "loss": 5.0369, "mean_token_accuracy": 0.1957094356417656, "num_tokens": 33470519.0, "step": 19305 }, { "entropy": 5.5653684616088865, "epoch": 1.502392530636063, "grad_norm": 1.078125, "learning_rate": 0.0004774965536641899, "loss": 5.081, "mean_token_accuracy": 0.190675051510334, "num_tokens": 33479256.0, "step": 19310 }, { "entropy": 5.551696348190307, "epoch": 1.5027815600077807, "grad_norm": 1.0625, "learning_rate": 0.00047748447030688575, "loss": 4.9625, "mean_token_accuracy": 0.2024025246500969, "num_tokens": 33487601.0, "step": 19315 }, { "entropy": 5.588086700439453, "epoch": 1.503170589379498, "grad_norm": 1.03125, "learning_rate": 0.00047747238387720194, "loss": 5.0459, "mean_token_accuracy": 0.19902506917715074, "num_tokens": 33497124.0, "step": 19320 }, { "entropy": 5.572511911392212, "epoch": 1.5035596187512157, "grad_norm": 1.109375, "learning_rate": 0.000477460294375322, "loss": 5.076, "mean_token_accuracy": 0.18755635917186736, "num_tokens": 33506022.0, "step": 19325 }, { "entropy": 5.500413179397583, "epoch": 1.5039486481229334, "grad_norm": 1.109375, "learning_rate": 0.00047744820180142935, "loss": 5.0323, "mean_token_accuracy": 0.1977880299091339, "num_tokens": 33514109.0, "step": 19330 }, { "entropy": 5.47395544052124, "epoch": 1.5043376774946509, "grad_norm": 1.046875, "learning_rate": 0.00047743610615570746, "loss": 5.0256, "mean_token_accuracy": 0.193344946205616, "num_tokens": 33523097.0, "step": 19335 }, { "entropy": 5.624269008636475, "epoch": 1.5047267068663683, "grad_norm": 1.2265625, "learning_rate": 0.00047742400743833993, "loss": 5.1276, "mean_token_accuracy": 0.18903702795505523, "num_tokens": 33531149.0, "step": 19340 }, { "entropy": 5.57778697013855, "epoch": 1.505115736238086, "grad_norm": 1.1953125, "learning_rate": 0.0004774119056495102, "loss": 5.0216, "mean_token_accuracy": 0.19675463140010835, "num_tokens": 33539974.0, "step": 19345 }, { "entropy": 5.554604578018188, "epoch": 1.5055047656098035, "grad_norm": 1.1875, "learning_rate": 0.00047739980078940206, "loss": 4.9862, "mean_token_accuracy": 0.193359899520874, "num_tokens": 33548670.0, "step": 19350 }, { "entropy": 5.600244569778442, "epoch": 1.505893794981521, "grad_norm": 1.1171875, "learning_rate": 0.00047738769285819894, "loss": 5.0968, "mean_token_accuracy": 0.19069682955741882, "num_tokens": 33556904.0, "step": 19355 }, { "entropy": 5.59004430770874, "epoch": 1.5062828243532387, "grad_norm": 1.140625, "learning_rate": 0.0004773755818560849, "loss": 5.1403, "mean_token_accuracy": 0.1927887663245201, "num_tokens": 33565583.0, "step": 19360 }, { "entropy": 5.5753296375274655, "epoch": 1.5066718537249564, "grad_norm": 1.15625, "learning_rate": 0.0004773634677832434, "loss": 5.035, "mean_token_accuracy": 0.19719114303588867, "num_tokens": 33573644.0, "step": 19365 }, { "entropy": 5.636075401306153, "epoch": 1.5070608830966739, "grad_norm": 1.0703125, "learning_rate": 0.0004773513506398584, "loss": 5.2082, "mean_token_accuracy": 0.18971898406744003, "num_tokens": 33582098.0, "step": 19370 }, { "entropy": 5.604250431060791, "epoch": 1.5074499124683913, "grad_norm": 1.0859375, "learning_rate": 0.0004773392304261137, "loss": 5.1552, "mean_token_accuracy": 0.1846052423119545, "num_tokens": 33591299.0, "step": 19375 }, { "entropy": 5.591132307052613, "epoch": 1.507838941840109, "grad_norm": 1.1640625, "learning_rate": 0.0004773271071421933, "loss": 5.0529, "mean_token_accuracy": 0.20295005589723586, "num_tokens": 33599442.0, "step": 19380 }, { "entropy": 5.60074520111084, "epoch": 1.5082279712118265, "grad_norm": 1.0859375, "learning_rate": 0.00047731498078828105, "loss": 5.1556, "mean_token_accuracy": 0.2008211374282837, "num_tokens": 33608445.0, "step": 19385 }, { "entropy": 5.578325176239014, "epoch": 1.508617000583544, "grad_norm": 1.125, "learning_rate": 0.000477302851364561, "loss": 5.1311, "mean_token_accuracy": 0.19358229488134385, "num_tokens": 33617025.0, "step": 19390 }, { "entropy": 5.5581684589385985, "epoch": 1.5090060299552617, "grad_norm": 1.1015625, "learning_rate": 0.00047729071887121717, "loss": 4.9983, "mean_token_accuracy": 0.20439456701278685, "num_tokens": 33625671.0, "step": 19395 }, { "entropy": 5.633315658569336, "epoch": 1.5093950593269791, "grad_norm": 1.109375, "learning_rate": 0.0004772785833084337, "loss": 5.1269, "mean_token_accuracy": 0.18746764957904816, "num_tokens": 33634672.0, "step": 19400 }, { "entropy": 5.607293319702149, "epoch": 1.5097840886986966, "grad_norm": 1.125, "learning_rate": 0.0004772664446763946, "loss": 5.1339, "mean_token_accuracy": 0.1864413097500801, "num_tokens": 33643810.0, "step": 19405 }, { "entropy": 5.548423528671265, "epoch": 1.5101731180704143, "grad_norm": 1.1328125, "learning_rate": 0.0004772543029752842, "loss": 4.8954, "mean_token_accuracy": 0.20861364156007767, "num_tokens": 33652638.0, "step": 19410 }, { "entropy": 5.5491053581237795, "epoch": 1.510562147442132, "grad_norm": 1.140625, "learning_rate": 0.00047724215820528666, "loss": 5.0843, "mean_token_accuracy": 0.1972549542784691, "num_tokens": 33660705.0, "step": 19415 }, { "entropy": 5.609587335586548, "epoch": 1.5109511768138495, "grad_norm": 1.0859375, "learning_rate": 0.0004772300103665863, "loss": 5.1282, "mean_token_accuracy": 0.19567057192325593, "num_tokens": 33669446.0, "step": 19420 }, { "entropy": 5.517504692077637, "epoch": 1.511340206185567, "grad_norm": 1.046875, "learning_rate": 0.00047721785945936733, "loss": 4.9778, "mean_token_accuracy": 0.20746591240167617, "num_tokens": 33678505.0, "step": 19425 }, { "entropy": 5.554972410202026, "epoch": 1.5117292355572847, "grad_norm": 1.078125, "learning_rate": 0.0004772057054838143, "loss": 5.0854, "mean_token_accuracy": 0.19702490717172622, "num_tokens": 33687213.0, "step": 19430 }, { "entropy": 5.541841506958008, "epoch": 1.5121182649290021, "grad_norm": 1.0859375, "learning_rate": 0.00047719354844011146, "loss": 5.0065, "mean_token_accuracy": 0.20011643767356874, "num_tokens": 33696040.0, "step": 19435 }, { "entropy": 5.610608100891113, "epoch": 1.5125072943007196, "grad_norm": 1.046875, "learning_rate": 0.0004771813883284434, "loss": 5.1297, "mean_token_accuracy": 0.18853561878204345, "num_tokens": 33705210.0, "step": 19440 }, { "entropy": 5.502421903610229, "epoch": 1.5128963236724373, "grad_norm": 1.1015625, "learning_rate": 0.00047716922514899455, "loss": 4.9336, "mean_token_accuracy": 0.20888576358556749, "num_tokens": 33714255.0, "step": 19445 }, { "entropy": 5.5027073383331295, "epoch": 1.5132853530441548, "grad_norm": 1.0859375, "learning_rate": 0.00047715705890194953, "loss": 5.003, "mean_token_accuracy": 0.20668907910585405, "num_tokens": 33723368.0, "step": 19450 }, { "entropy": 5.584422397613525, "epoch": 1.5136743824158723, "grad_norm": 1.0, "learning_rate": 0.00047714488958749285, "loss": 5.031, "mean_token_accuracy": 0.19946435540914537, "num_tokens": 33732743.0, "step": 19455 }, { "entropy": 5.59551477432251, "epoch": 1.51406341178759, "grad_norm": 1.1171875, "learning_rate": 0.00047713271720580924, "loss": 5.104, "mean_token_accuracy": 0.1872835174202919, "num_tokens": 33741744.0, "step": 19460 }, { "entropy": 5.548620271682739, "epoch": 1.5144524411593077, "grad_norm": 1.1640625, "learning_rate": 0.0004771205417570834, "loss": 4.9831, "mean_token_accuracy": 0.20384987890720369, "num_tokens": 33749646.0, "step": 19465 }, { "entropy": 5.554851531982422, "epoch": 1.5148414705310251, "grad_norm": 1.15625, "learning_rate": 0.00047710836324150004, "loss": 5.055, "mean_token_accuracy": 0.1971933737397194, "num_tokens": 33758031.0, "step": 19470 }, { "entropy": 5.52572865486145, "epoch": 1.5152304999027426, "grad_norm": 1.1171875, "learning_rate": 0.000477096181659244, "loss": 5.0019, "mean_token_accuracy": 0.19707555174827576, "num_tokens": 33766592.0, "step": 19475 }, { "entropy": 5.567147922515869, "epoch": 1.5156195292744603, "grad_norm": 1.046875, "learning_rate": 0.0004770839970105, "loss": 5.1863, "mean_token_accuracy": 0.18891493678092958, "num_tokens": 33775741.0, "step": 19480 }, { "entropy": 5.592911720275879, "epoch": 1.5160085586461778, "grad_norm": 0.98046875, "learning_rate": 0.00047707180929545295, "loss": 5.1022, "mean_token_accuracy": 0.193851974606514, "num_tokens": 33784551.0, "step": 19485 }, { "entropy": 5.598547410964966, "epoch": 1.5163975880178953, "grad_norm": 1.078125, "learning_rate": 0.00047705961851428786, "loss": 5.0984, "mean_token_accuracy": 0.19360142797231675, "num_tokens": 33793051.0, "step": 19490 }, { "entropy": 5.584777116775513, "epoch": 1.516786617389613, "grad_norm": 1.1328125, "learning_rate": 0.00047704742466718973, "loss": 5.0091, "mean_token_accuracy": 0.19565768986940385, "num_tokens": 33802016.0, "step": 19495 }, { "entropy": 5.538855981826782, "epoch": 1.5171756467613304, "grad_norm": 1.0625, "learning_rate": 0.00047703522775434354, "loss": 4.9847, "mean_token_accuracy": 0.1965561494231224, "num_tokens": 33810515.0, "step": 19500 }, { "entropy": 5.559140872955322, "epoch": 1.517564676133048, "grad_norm": 1.0625, "learning_rate": 0.00047702302777593425, "loss": 5.0577, "mean_token_accuracy": 0.19679870903491975, "num_tokens": 33820295.0, "step": 19505 }, { "entropy": 5.6061439037323, "epoch": 1.5179537055047656, "grad_norm": 1.09375, "learning_rate": 0.00047701082473214715, "loss": 5.0843, "mean_token_accuracy": 0.19542277455329896, "num_tokens": 33829124.0, "step": 19510 }, { "entropy": 5.552377939224243, "epoch": 1.5183427348764833, "grad_norm": 1.0859375, "learning_rate": 0.00047699861862316725, "loss": 5.0352, "mean_token_accuracy": 0.20136120021343232, "num_tokens": 33838575.0, "step": 19515 }, { "entropy": 5.579402780532837, "epoch": 1.5187317642482008, "grad_norm": 1.203125, "learning_rate": 0.0004769864094491798, "loss": 5.0671, "mean_token_accuracy": 0.19320601969957352, "num_tokens": 33847262.0, "step": 19520 }, { "entropy": 5.564948654174804, "epoch": 1.5191207936199183, "grad_norm": 1.0703125, "learning_rate": 0.0004769741972103702, "loss": 5.1213, "mean_token_accuracy": 0.19218202531337739, "num_tokens": 33856056.0, "step": 19525 }, { "entropy": 5.5473710060119625, "epoch": 1.519509822991636, "grad_norm": 1.0234375, "learning_rate": 0.00047696198190692353, "loss": 5.1129, "mean_token_accuracy": 0.19225240349769593, "num_tokens": 33865408.0, "step": 19530 }, { "entropy": 5.549135351181031, "epoch": 1.5198988523633534, "grad_norm": 1.1796875, "learning_rate": 0.0004769497635390253, "loss": 5.0188, "mean_token_accuracy": 0.20721402913331985, "num_tokens": 33873927.0, "step": 19535 }, { "entropy": 5.5910484790802, "epoch": 1.520287881735071, "grad_norm": 1.203125, "learning_rate": 0.0004769375421068608, "loss": 5.0683, "mean_token_accuracy": 0.18575547337532045, "num_tokens": 33881851.0, "step": 19540 }, { "entropy": 5.533737230300903, "epoch": 1.5206769111067886, "grad_norm": 1.171875, "learning_rate": 0.00047692531761061555, "loss": 4.9862, "mean_token_accuracy": 0.203743115067482, "num_tokens": 33890462.0, "step": 19545 }, { "entropy": 5.49003791809082, "epoch": 1.521065940478506, "grad_norm": 1.0859375, "learning_rate": 0.000476913090050475, "loss": 5.0525, "mean_token_accuracy": 0.19478340893983842, "num_tokens": 33899357.0, "step": 19550 }, { "entropy": 5.526320314407348, "epoch": 1.5214549698502235, "grad_norm": 1.109375, "learning_rate": 0.00047690085942662464, "loss": 5.0047, "mean_token_accuracy": 0.20074675232172012, "num_tokens": 33907451.0, "step": 19555 }, { "entropy": 5.57744779586792, "epoch": 1.5218439992219412, "grad_norm": 1.109375, "learning_rate": 0.00047688862573925015, "loss": 5.0611, "mean_token_accuracy": 0.19656474888324738, "num_tokens": 33915808.0, "step": 19560 }, { "entropy": 5.615764617919922, "epoch": 1.522233028593659, "grad_norm": 1.0546875, "learning_rate": 0.00047687638898853707, "loss": 5.1406, "mean_token_accuracy": 0.19714242815971375, "num_tokens": 33924317.0, "step": 19565 }, { "entropy": 5.577002143859863, "epoch": 1.5226220579653764, "grad_norm": 1.078125, "learning_rate": 0.0004768641491746711, "loss": 5.0843, "mean_token_accuracy": 0.1939859628677368, "num_tokens": 33932788.0, "step": 19570 }, { "entropy": 5.555511856079102, "epoch": 1.523011087337094, "grad_norm": 1.15625, "learning_rate": 0.000476851906297838, "loss": 5.0709, "mean_token_accuracy": 0.1965989425778389, "num_tokens": 33941358.0, "step": 19575 }, { "entropy": 5.547682857513427, "epoch": 1.5234001167088116, "grad_norm": 1.0625, "learning_rate": 0.00047683966035822346, "loss": 5.0142, "mean_token_accuracy": 0.1982572928071022, "num_tokens": 33950155.0, "step": 19580 }, { "entropy": 5.51738657951355, "epoch": 1.523789146080529, "grad_norm": 1.1640625, "learning_rate": 0.00047682741135601336, "loss": 5.0254, "mean_token_accuracy": 0.1976988285779953, "num_tokens": 33958559.0, "step": 19585 }, { "entropy": 5.578416204452514, "epoch": 1.5241781754522465, "grad_norm": 1.0390625, "learning_rate": 0.00047681515929139356, "loss": 5.0944, "mean_token_accuracy": 0.19835715293884276, "num_tokens": 33967215.0, "step": 19590 }, { "entropy": 5.570069932937622, "epoch": 1.5245672048239642, "grad_norm": 1.1328125, "learning_rate": 0.00047680290416454995, "loss": 5.0777, "mean_token_accuracy": 0.19689611792564393, "num_tokens": 33976248.0, "step": 19595 }, { "entropy": 5.622149324417114, "epoch": 1.524956234195682, "grad_norm": 1.1015625, "learning_rate": 0.0004767906459756684, "loss": 5.1914, "mean_token_accuracy": 0.18724040687084198, "num_tokens": 33985189.0, "step": 19600 }, { "entropy": 5.553195905685425, "epoch": 1.5253452635673992, "grad_norm": 1.2109375, "learning_rate": 0.00047677838472493504, "loss": 5.0559, "mean_token_accuracy": 0.19655317664146424, "num_tokens": 33993998.0, "step": 19605 }, { "entropy": 5.573758840560913, "epoch": 1.5257342929391169, "grad_norm": 1.09375, "learning_rate": 0.0004767661204125358, "loss": 4.9991, "mean_token_accuracy": 0.2049141451716423, "num_tokens": 34002366.0, "step": 19610 }, { "entropy": 5.587067031860352, "epoch": 1.5261233223108346, "grad_norm": 1.15625, "learning_rate": 0.0004767538530386569, "loss": 5.0128, "mean_token_accuracy": 0.20680000633001328, "num_tokens": 34011404.0, "step": 19615 }, { "entropy": 5.498363018035889, "epoch": 1.526512351682552, "grad_norm": 1.109375, "learning_rate": 0.00047674158260348437, "loss": 5.0027, "mean_token_accuracy": 0.19868876039981842, "num_tokens": 34020290.0, "step": 19620 }, { "entropy": 5.519731140136718, "epoch": 1.5269013810542695, "grad_norm": 1.1015625, "learning_rate": 0.00047672930910720436, "loss": 5.0653, "mean_token_accuracy": 0.1909203290939331, "num_tokens": 34029249.0, "step": 19625 }, { "entropy": 5.570719146728516, "epoch": 1.5272904104259872, "grad_norm": 1.0625, "learning_rate": 0.00047671703255000326, "loss": 5.0876, "mean_token_accuracy": 0.1951455295085907, "num_tokens": 34037640.0, "step": 19630 }, { "entropy": 5.509208345413208, "epoch": 1.5276794397977047, "grad_norm": 1.1328125, "learning_rate": 0.0004767047529320673, "loss": 5.0184, "mean_token_accuracy": 0.19293158799409865, "num_tokens": 34045779.0, "step": 19635 }, { "entropy": 5.548420190811157, "epoch": 1.5280684691694222, "grad_norm": 1.0, "learning_rate": 0.00047669247025358257, "loss": 5.0719, "mean_token_accuracy": 0.19421012103557586, "num_tokens": 34054888.0, "step": 19640 }, { "entropy": 5.580225849151612, "epoch": 1.5284574985411399, "grad_norm": 1.140625, "learning_rate": 0.00047668018451473584, "loss": 5.0426, "mean_token_accuracy": 0.2010911598801613, "num_tokens": 34063547.0, "step": 19645 }, { "entropy": 5.548436307907105, "epoch": 1.5288465279128576, "grad_norm": 1.0703125, "learning_rate": 0.0004766678957157132, "loss": 4.9829, "mean_token_accuracy": 0.19771626442670823, "num_tokens": 34072306.0, "step": 19650 }, { "entropy": 5.590692520141602, "epoch": 1.5292355572845748, "grad_norm": 1.203125, "learning_rate": 0.0004766556038567013, "loss": 5.0347, "mean_token_accuracy": 0.19475244581699372, "num_tokens": 34080335.0, "step": 19655 }, { "entropy": 5.565773963928223, "epoch": 1.5296245866562925, "grad_norm": 1.1640625, "learning_rate": 0.0004766433089378865, "loss": 4.9686, "mean_token_accuracy": 0.1977250635623932, "num_tokens": 34089083.0, "step": 19660 }, { "entropy": 5.5273607730865475, "epoch": 1.5300136160280102, "grad_norm": 1.1484375, "learning_rate": 0.00047663101095945544, "loss": 5.0136, "mean_token_accuracy": 0.20454098880290986, "num_tokens": 34097586.0, "step": 19665 }, { "entropy": 5.534102535247802, "epoch": 1.5304026453997277, "grad_norm": 0.99609375, "learning_rate": 0.00047661870992159476, "loss": 4.9985, "mean_token_accuracy": 0.1913001924753189, "num_tokens": 34106069.0, "step": 19670 }, { "entropy": 5.531040906906128, "epoch": 1.5307916747714452, "grad_norm": 1.078125, "learning_rate": 0.00047660640582449106, "loss": 4.9628, "mean_token_accuracy": 0.2074694126844406, "num_tokens": 34114804.0, "step": 19675 }, { "entropy": 5.542651510238647, "epoch": 1.5311807041431629, "grad_norm": 1.078125, "learning_rate": 0.00047659409866833104, "loss": 5.0196, "mean_token_accuracy": 0.20633669793605805, "num_tokens": 34123605.0, "step": 19680 }, { "entropy": 5.6436842918396, "epoch": 1.5315697335148803, "grad_norm": 1.1484375, "learning_rate": 0.0004765817884533014, "loss": 5.1347, "mean_token_accuracy": 0.18847558051347732, "num_tokens": 34132628.0, "step": 19685 }, { "entropy": 5.595562076568603, "epoch": 1.5319587628865978, "grad_norm": 1.03125, "learning_rate": 0.000476569475179589, "loss": 5.0492, "mean_token_accuracy": 0.19493800401687622, "num_tokens": 34141546.0, "step": 19690 }, { "entropy": 5.517737102508545, "epoch": 1.5323477922583155, "grad_norm": 1.1640625, "learning_rate": 0.00047655715884738074, "loss": 5.0527, "mean_token_accuracy": 0.20552916526794435, "num_tokens": 34150126.0, "step": 19695 }, { "entropy": 5.546139478683472, "epoch": 1.5327368216300332, "grad_norm": 1.09375, "learning_rate": 0.0004765448394568632, "loss": 5.0948, "mean_token_accuracy": 0.19115078896284105, "num_tokens": 34159598.0, "step": 19700 }, { "entropy": 5.55718674659729, "epoch": 1.5331258510017505, "grad_norm": 1.09375, "learning_rate": 0.0004765325170082237, "loss": 5.0345, "mean_token_accuracy": 0.19157752096652986, "num_tokens": 34168952.0, "step": 19705 }, { "entropy": 5.576296806335449, "epoch": 1.5335148803734682, "grad_norm": 1.1015625, "learning_rate": 0.000476520191501649, "loss": 5.1427, "mean_token_accuracy": 0.19357323050498962, "num_tokens": 34178409.0, "step": 19710 }, { "entropy": 5.645197629928589, "epoch": 1.5339039097451859, "grad_norm": 1.078125, "learning_rate": 0.00047650786293732607, "loss": 5.1164, "mean_token_accuracy": 0.18972488343715668, "num_tokens": 34187216.0, "step": 19715 }, { "entropy": 5.59799599647522, "epoch": 1.5342929391169033, "grad_norm": 1.0703125, "learning_rate": 0.0004764955313154421, "loss": 5.062, "mean_token_accuracy": 0.20320827066898345, "num_tokens": 34196184.0, "step": 19720 }, { "entropy": 5.528744316101074, "epoch": 1.5346819684886208, "grad_norm": 1.1171875, "learning_rate": 0.00047648319663618415, "loss": 5.0026, "mean_token_accuracy": 0.19944600909948348, "num_tokens": 34205016.0, "step": 19725 }, { "entropy": 5.555101156234741, "epoch": 1.5350709978603385, "grad_norm": 1.0625, "learning_rate": 0.00047647085889973936, "loss": 5.0705, "mean_token_accuracy": 0.1935126841068268, "num_tokens": 34213467.0, "step": 19730 }, { "entropy": 5.558152532577514, "epoch": 1.535460027232056, "grad_norm": 1.125, "learning_rate": 0.00047645851810629503, "loss": 5.0134, "mean_token_accuracy": 0.1996410682797432, "num_tokens": 34222009.0, "step": 19735 }, { "entropy": 5.585694360733032, "epoch": 1.5358490566037735, "grad_norm": 1.1953125, "learning_rate": 0.00047644617425603825, "loss": 5.0165, "mean_token_accuracy": 0.20683494806289673, "num_tokens": 34230160.0, "step": 19740 }, { "entropy": 5.567558336257934, "epoch": 1.5362380859754912, "grad_norm": 1.1875, "learning_rate": 0.0004764338273491565, "loss": 5.1049, "mean_token_accuracy": 0.18704537600278853, "num_tokens": 34237898.0, "step": 19745 }, { "entropy": 5.57094292640686, "epoch": 1.5366271153472089, "grad_norm": 1.171875, "learning_rate": 0.00047642147738583695, "loss": 5.036, "mean_token_accuracy": 0.19600681960582733, "num_tokens": 34246612.0, "step": 19750 }, { "entropy": 5.632332611083984, "epoch": 1.5370161447189261, "grad_norm": 1.1015625, "learning_rate": 0.0004764091243662671, "loss": 5.1443, "mean_token_accuracy": 0.1923511356115341, "num_tokens": 34254981.0, "step": 19755 }, { "entropy": 5.563598680496216, "epoch": 1.5374051740906438, "grad_norm": 1.0625, "learning_rate": 0.00047639676829063437, "loss": 4.9963, "mean_token_accuracy": 0.2003023460507393, "num_tokens": 34263834.0, "step": 19760 }, { "entropy": 5.567883014678955, "epoch": 1.5377942034623615, "grad_norm": 1.1484375, "learning_rate": 0.00047638440915912623, "loss": 5.1246, "mean_token_accuracy": 0.19422474652528762, "num_tokens": 34272451.0, "step": 19765 }, { "entropy": 5.567710447311401, "epoch": 1.538183232834079, "grad_norm": 1.078125, "learning_rate": 0.0004763720469719303, "loss": 5.1052, "mean_token_accuracy": 0.19952731877565383, "num_tokens": 34281363.0, "step": 19770 }, { "entropy": 5.57563362121582, "epoch": 1.5385722622057965, "grad_norm": 1.140625, "learning_rate": 0.000476359681729234, "loss": 5.0005, "mean_token_accuracy": 0.195310015976429, "num_tokens": 34290259.0, "step": 19775 }, { "entropy": 5.586501693725586, "epoch": 1.5389612915775142, "grad_norm": 1.1640625, "learning_rate": 0.000476347313431225, "loss": 5.078, "mean_token_accuracy": 0.1924600660800934, "num_tokens": 34298847.0, "step": 19780 }, { "entropy": 5.558987236022949, "epoch": 1.5393503209492316, "grad_norm": 1.03125, "learning_rate": 0.00047633494207809096, "loss": 5.0447, "mean_token_accuracy": 0.1966763436794281, "num_tokens": 34307937.0, "step": 19785 }, { "entropy": 5.557637453079224, "epoch": 1.539739350320949, "grad_norm": 1.1015625, "learning_rate": 0.00047632256767001977, "loss": 4.9972, "mean_token_accuracy": 0.2039127379655838, "num_tokens": 34316850.0, "step": 19790 }, { "entropy": 5.560368061065674, "epoch": 1.5401283796926668, "grad_norm": 1.1171875, "learning_rate": 0.000476310190207199, "loss": 5.0403, "mean_token_accuracy": 0.19783806651830674, "num_tokens": 34325247.0, "step": 19795 }, { "entropy": 5.533462238311768, "epoch": 1.5405174090643845, "grad_norm": 1.1796875, "learning_rate": 0.00047629780968981653, "loss": 4.9372, "mean_token_accuracy": 0.2166338473558426, "num_tokens": 34332789.0, "step": 19800 }, { "entropy": 5.587894105911255, "epoch": 1.540906438436102, "grad_norm": 1.1328125, "learning_rate": 0.00047628542611806007, "loss": 5.0929, "mean_token_accuracy": 0.1953209549188614, "num_tokens": 34340972.0, "step": 19805 }, { "entropy": 5.573417234420776, "epoch": 1.5412954678078195, "grad_norm": 1.1328125, "learning_rate": 0.00047627303949211773, "loss": 5.0337, "mean_token_accuracy": 0.1979909747838974, "num_tokens": 34349580.0, "step": 19810 }, { "entropy": 5.622489166259766, "epoch": 1.5416844971795371, "grad_norm": 1.0078125, "learning_rate": 0.0004762606498121774, "loss": 5.1555, "mean_token_accuracy": 0.1863750398159027, "num_tokens": 34358971.0, "step": 19815 }, { "entropy": 5.584664440155029, "epoch": 1.5420735265512546, "grad_norm": 1.1875, "learning_rate": 0.000476248257078427, "loss": 5.1277, "mean_token_accuracy": 0.19373337179422379, "num_tokens": 34368000.0, "step": 19820 }, { "entropy": 5.591545629501343, "epoch": 1.542462555922972, "grad_norm": 1.09375, "learning_rate": 0.0004762358612910547, "loss": 5.039, "mean_token_accuracy": 0.1960557371377945, "num_tokens": 34376745.0, "step": 19825 }, { "entropy": 5.652286100387573, "epoch": 1.5428515852946898, "grad_norm": 1.125, "learning_rate": 0.0004762234624502484, "loss": 5.0919, "mean_token_accuracy": 0.1887320265173912, "num_tokens": 34384635.0, "step": 19830 }, { "entropy": 5.637888097763062, "epoch": 1.5432406146664073, "grad_norm": 1.1796875, "learning_rate": 0.00047621106055619644, "loss": 5.1197, "mean_token_accuracy": 0.1959066942334175, "num_tokens": 34393394.0, "step": 19835 }, { "entropy": 5.561007070541382, "epoch": 1.5436296440381247, "grad_norm": 1.1953125, "learning_rate": 0.00047619865560908687, "loss": 5.1246, "mean_token_accuracy": 0.19618954062461852, "num_tokens": 34401343.0, "step": 19840 }, { "entropy": 5.597097635269165, "epoch": 1.5440186734098424, "grad_norm": 1.1640625, "learning_rate": 0.0004761862476091079, "loss": 5.0854, "mean_token_accuracy": 0.2001650422811508, "num_tokens": 34410096.0, "step": 19845 }, { "entropy": 5.617214775085449, "epoch": 1.5444077027815601, "grad_norm": 1.1171875, "learning_rate": 0.00047617383655644785, "loss": 5.177, "mean_token_accuracy": 0.18933719992637635, "num_tokens": 34418828.0, "step": 19850 }, { "entropy": 5.651484107971191, "epoch": 1.5447967321532776, "grad_norm": 1.0703125, "learning_rate": 0.0004761614224512951, "loss": 5.1213, "mean_token_accuracy": 0.19720311164855958, "num_tokens": 34428061.0, "step": 19855 }, { "entropy": 5.582531595230103, "epoch": 1.545185761524995, "grad_norm": 1.1953125, "learning_rate": 0.0004761490052938379, "loss": 5.0449, "mean_token_accuracy": 0.19460816085338592, "num_tokens": 34436866.0, "step": 19860 }, { "entropy": 5.5498675346374515, "epoch": 1.5455747908967128, "grad_norm": 1.1796875, "learning_rate": 0.0004761365850842646, "loss": 4.9827, "mean_token_accuracy": 0.1988269343972206, "num_tokens": 34445493.0, "step": 19865 }, { "entropy": 5.5747761726379395, "epoch": 1.5459638202684303, "grad_norm": 1.171875, "learning_rate": 0.0004761241618227639, "loss": 4.9896, "mean_token_accuracy": 0.2036134883761406, "num_tokens": 34454090.0, "step": 19870 }, { "entropy": 5.60131688117981, "epoch": 1.5463528496401477, "grad_norm": 1.0703125, "learning_rate": 0.00047611173550952414, "loss": 5.1151, "mean_token_accuracy": 0.1917569160461426, "num_tokens": 34462410.0, "step": 19875 }, { "entropy": 5.5870284080505375, "epoch": 1.5467418790118654, "grad_norm": 1.171875, "learning_rate": 0.00047609930614473387, "loss": 5.1235, "mean_token_accuracy": 0.1901540771126747, "num_tokens": 34471288.0, "step": 19880 }, { "entropy": 5.600883817672729, "epoch": 1.547130908383583, "grad_norm": 1.0234375, "learning_rate": 0.00047608687372858175, "loss": 5.0759, "mean_token_accuracy": 0.18993970155715942, "num_tokens": 34480250.0, "step": 19885 }, { "entropy": 5.634124612808227, "epoch": 1.5475199377553004, "grad_norm": 1.0546875, "learning_rate": 0.00047607443826125633, "loss": 5.0268, "mean_token_accuracy": 0.20465150028467177, "num_tokens": 34489182.0, "step": 19890 }, { "entropy": 5.526502323150635, "epoch": 1.547908967127018, "grad_norm": 1.1640625, "learning_rate": 0.00047606199974294637, "loss": 4.9655, "mean_token_accuracy": 0.20352284908294677, "num_tokens": 34497474.0, "step": 19895 }, { "entropy": 5.563107347488403, "epoch": 1.5482979964987358, "grad_norm": 1.1328125, "learning_rate": 0.0004760495581738406, "loss": 5.0936, "mean_token_accuracy": 0.19231471866369249, "num_tokens": 34505882.0, "step": 19900 }, { "entropy": 5.501498413085938, "epoch": 1.5486870258704533, "grad_norm": 1.0703125, "learning_rate": 0.0004760371135541278, "loss": 4.9596, "mean_token_accuracy": 0.20587319284677505, "num_tokens": 34514939.0, "step": 19905 }, { "entropy": 5.547081184387207, "epoch": 1.5490760552421707, "grad_norm": 1.046875, "learning_rate": 0.0004760246658839967, "loss": 5.0434, "mean_token_accuracy": 0.20251590013504028, "num_tokens": 34523314.0, "step": 19910 }, { "entropy": 5.4852393627166744, "epoch": 1.5494650846138884, "grad_norm": 1.0625, "learning_rate": 0.0004760122151636364, "loss": 4.972, "mean_token_accuracy": 0.20333033055067062, "num_tokens": 34532354.0, "step": 19915 }, { "entropy": 5.571914577484131, "epoch": 1.549854113985606, "grad_norm": 1.15625, "learning_rate": 0.0004759997613932356, "loss": 5.0736, "mean_token_accuracy": 0.18885176330804826, "num_tokens": 34541150.0, "step": 19920 }, { "entropy": 5.559107303619385, "epoch": 1.5502431433573234, "grad_norm": 1.0625, "learning_rate": 0.00047598730457298335, "loss": 5.0821, "mean_token_accuracy": 0.1940785378217697, "num_tokens": 34549859.0, "step": 19925 }, { "entropy": 5.658868312835693, "epoch": 1.550632172729041, "grad_norm": 1.0859375, "learning_rate": 0.00047597484470306866, "loss": 5.2006, "mean_token_accuracy": 0.18259195238351822, "num_tokens": 34558327.0, "step": 19930 }, { "entropy": 5.615940904617309, "epoch": 1.5510212021007586, "grad_norm": 1.078125, "learning_rate": 0.0004759623817836806, "loss": 5.1204, "mean_token_accuracy": 0.19350760132074357, "num_tokens": 34567275.0, "step": 19935 }, { "entropy": 5.594376468658448, "epoch": 1.551410231472476, "grad_norm": 1.1796875, "learning_rate": 0.0004759499158150082, "loss": 5.0135, "mean_token_accuracy": 0.20364888310432433, "num_tokens": 34575967.0, "step": 19940 }, { "entropy": 5.566449451446533, "epoch": 1.5517992608441937, "grad_norm": 1.1015625, "learning_rate": 0.00047593744679724076, "loss": 5.0053, "mean_token_accuracy": 0.19955439120531082, "num_tokens": 34583997.0, "step": 19945 }, { "entropy": 5.547320890426636, "epoch": 1.5521882902159114, "grad_norm": 1.109375, "learning_rate": 0.00047592497473056733, "loss": 4.9915, "mean_token_accuracy": 0.2116280660033226, "num_tokens": 34592468.0, "step": 19950 }, { "entropy": 5.554736089706421, "epoch": 1.552577319587629, "grad_norm": 1.0234375, "learning_rate": 0.00047591249961517724, "loss": 5.0494, "mean_token_accuracy": 0.19396212995052337, "num_tokens": 34601113.0, "step": 19955 }, { "entropy": 5.5614235401153564, "epoch": 1.5529663489593464, "grad_norm": 1.1015625, "learning_rate": 0.0004759000214512598, "loss": 5.1221, "mean_token_accuracy": 0.1922504112124443, "num_tokens": 34611027.0, "step": 19960 }, { "entropy": 5.505017948150635, "epoch": 1.553355378331064, "grad_norm": 1.1015625, "learning_rate": 0.0004758875402390042, "loss": 4.8549, "mean_token_accuracy": 0.21692269444465637, "num_tokens": 34619881.0, "step": 19965 }, { "entropy": 5.502843713760376, "epoch": 1.5537444077027815, "grad_norm": 1.0625, "learning_rate": 0.00047587505597859996, "loss": 4.9148, "mean_token_accuracy": 0.20295417606830596, "num_tokens": 34628770.0, "step": 19970 }, { "entropy": 5.5637979984283445, "epoch": 1.554133437074499, "grad_norm": 1.125, "learning_rate": 0.00047586256867023646, "loss": 5.0589, "mean_token_accuracy": 0.19705702364444733, "num_tokens": 34637014.0, "step": 19975 }, { "entropy": 5.537198495864868, "epoch": 1.5545224664462167, "grad_norm": 1.015625, "learning_rate": 0.0004758500783141032, "loss": 5.0664, "mean_token_accuracy": 0.19632147401571273, "num_tokens": 34646103.0, "step": 19980 }, { "entropy": 5.57470121383667, "epoch": 1.5549114958179344, "grad_norm": 1.1015625, "learning_rate": 0.0004758375849103897, "loss": 5.0286, "mean_token_accuracy": 0.1966407999396324, "num_tokens": 34654390.0, "step": 19985 }, { "entropy": 5.593024253845215, "epoch": 1.5553005251896517, "grad_norm": 1.109375, "learning_rate": 0.0004758250884592855, "loss": 5.1816, "mean_token_accuracy": 0.18332546353340148, "num_tokens": 34663076.0, "step": 19990 }, { "entropy": 5.612808704376221, "epoch": 1.5556895545613694, "grad_norm": 1.125, "learning_rate": 0.00047581258896098024, "loss": 5.167, "mean_token_accuracy": 0.18644006550312042, "num_tokens": 34671972.0, "step": 19995 }, { "entropy": 5.585372877120972, "epoch": 1.556078583933087, "grad_norm": 1.046875, "learning_rate": 0.0004758000864156636, "loss": 5.0413, "mean_token_accuracy": 0.19634005874395372, "num_tokens": 34681426.0, "step": 20000 }, { "entropy": 5.4840006828308105, "epoch": 1.5564676133048045, "grad_norm": 1.140625, "learning_rate": 0.00047578758082352527, "loss": 5.0045, "mean_token_accuracy": 0.1981190860271454, "num_tokens": 34690095.0, "step": 20005 }, { "entropy": 5.460370206832886, "epoch": 1.556856642676522, "grad_norm": 1.078125, "learning_rate": 0.00047577507218475487, "loss": 4.953, "mean_token_accuracy": 0.2045361429452896, "num_tokens": 34698177.0, "step": 20010 }, { "entropy": 5.607020425796509, "epoch": 1.5572456720482397, "grad_norm": 1.15625, "learning_rate": 0.00047576256049954236, "loss": 5.0711, "mean_token_accuracy": 0.19621413499116896, "num_tokens": 34706739.0, "step": 20015 }, { "entropy": 5.5696169376373295, "epoch": 1.5576347014199572, "grad_norm": 1.140625, "learning_rate": 0.0004757500457680776, "loss": 5.063, "mean_token_accuracy": 0.19199937880039214, "num_tokens": 34715531.0, "step": 20020 }, { "entropy": 5.572199583053589, "epoch": 1.5580237307916747, "grad_norm": 1.09375, "learning_rate": 0.0004757375279905504, "loss": 5.1033, "mean_token_accuracy": 0.1893068566918373, "num_tokens": 34724049.0, "step": 20025 }, { "entropy": 5.519538068771363, "epoch": 1.5584127601633924, "grad_norm": 1.09375, "learning_rate": 0.00047572500716715075, "loss": 4.8844, "mean_token_accuracy": 0.2084044635295868, "num_tokens": 34732612.0, "step": 20030 }, { "entropy": 5.5287535190582275, "epoch": 1.55880178953511, "grad_norm": 1.140625, "learning_rate": 0.00047571248329806855, "loss": 5.018, "mean_token_accuracy": 0.20132597535848618, "num_tokens": 34741500.0, "step": 20035 }, { "entropy": 5.53885293006897, "epoch": 1.5591908189068273, "grad_norm": 1.15625, "learning_rate": 0.00047569995638349383, "loss": 5.0433, "mean_token_accuracy": 0.19901140481233598, "num_tokens": 34749685.0, "step": 20040 }, { "entropy": 5.6017231941223145, "epoch": 1.559579848278545, "grad_norm": 1.0859375, "learning_rate": 0.0004756874264236168, "loss": 5.0128, "mean_token_accuracy": 0.1954830378293991, "num_tokens": 34758463.0, "step": 20045 }, { "entropy": 5.562734746932984, "epoch": 1.5599688776502627, "grad_norm": 1.1171875, "learning_rate": 0.00047567489341862753, "loss": 5.0287, "mean_token_accuracy": 0.20074363350868224, "num_tokens": 34767327.0, "step": 20050 }, { "entropy": 5.517592859268189, "epoch": 1.5603579070219802, "grad_norm": 1.1953125, "learning_rate": 0.00047566235736871607, "loss": 4.9575, "mean_token_accuracy": 0.20742545574903487, "num_tokens": 34775453.0, "step": 20055 }, { "entropy": 5.53900146484375, "epoch": 1.5607469363936977, "grad_norm": 1.1640625, "learning_rate": 0.00047564981827407277, "loss": 5.0303, "mean_token_accuracy": 0.19763220846652985, "num_tokens": 34784093.0, "step": 20060 }, { "entropy": 5.543224334716797, "epoch": 1.5611359657654154, "grad_norm": 1.109375, "learning_rate": 0.00047563727613488785, "loss": 5.106, "mean_token_accuracy": 0.1996412917971611, "num_tokens": 34793097.0, "step": 20065 }, { "entropy": 5.544621849060059, "epoch": 1.5615249951371328, "grad_norm": 1.1171875, "learning_rate": 0.00047562473095135154, "loss": 4.9726, "mean_token_accuracy": 0.20307688862085344, "num_tokens": 34801833.0, "step": 20070 }, { "entropy": 5.63671236038208, "epoch": 1.5619140245088503, "grad_norm": 1.09375, "learning_rate": 0.0004756121827236544, "loss": 5.0747, "mean_token_accuracy": 0.19739456176757814, "num_tokens": 34810816.0, "step": 20075 }, { "entropy": 5.62411413192749, "epoch": 1.562303053880568, "grad_norm": 1.140625, "learning_rate": 0.0004755996314519866, "loss": 5.0809, "mean_token_accuracy": 0.1944834604859352, "num_tokens": 34819523.0, "step": 20080 }, { "entropy": 5.595847320556641, "epoch": 1.5626920832522857, "grad_norm": 1.1796875, "learning_rate": 0.0004755870771365387, "loss": 5.0661, "mean_token_accuracy": 0.20002146810293198, "num_tokens": 34827422.0, "step": 20085 }, { "entropy": 5.557934379577636, "epoch": 1.563081112624003, "grad_norm": 1.1171875, "learning_rate": 0.00047557451977750113, "loss": 5.156, "mean_token_accuracy": 0.1901546373963356, "num_tokens": 34836474.0, "step": 20090 }, { "entropy": 5.506678915023803, "epoch": 1.5634701419957207, "grad_norm": 1.046875, "learning_rate": 0.0004755619593750645, "loss": 4.9239, "mean_token_accuracy": 0.20390913337469102, "num_tokens": 34845078.0, "step": 20095 }, { "entropy": 5.604987668991089, "epoch": 1.5638591713674383, "grad_norm": 1.1015625, "learning_rate": 0.0004755493959294194, "loss": 5.0692, "mean_token_accuracy": 0.19761287569999694, "num_tokens": 34854530.0, "step": 20100 }, { "entropy": 5.595241975784302, "epoch": 1.5642482007391558, "grad_norm": 1.09375, "learning_rate": 0.0004755368294407564, "loss": 5.0949, "mean_token_accuracy": 0.19602259993553162, "num_tokens": 34863925.0, "step": 20105 }, { "entropy": 5.593959379196167, "epoch": 1.5646372301108733, "grad_norm": 1.140625, "learning_rate": 0.0004755242599092662, "loss": 5.0382, "mean_token_accuracy": 0.19763870388269425, "num_tokens": 34872528.0, "step": 20110 }, { "entropy": 5.609878587722778, "epoch": 1.565026259482591, "grad_norm": 1.0703125, "learning_rate": 0.00047551168733513956, "loss": 5.03, "mean_token_accuracy": 0.19871195554733276, "num_tokens": 34881664.0, "step": 20115 }, { "entropy": 5.534467363357544, "epoch": 1.5654152888543085, "grad_norm": 1.015625, "learning_rate": 0.00047549911171856717, "loss": 5.0175, "mean_token_accuracy": 0.19365352392196655, "num_tokens": 34891128.0, "step": 20120 }, { "entropy": 5.557845592498779, "epoch": 1.565804318226026, "grad_norm": 1.2265625, "learning_rate": 0.0004754865330597398, "loss": 5.0209, "mean_token_accuracy": 0.19392119497060775, "num_tokens": 34900083.0, "step": 20125 }, { "entropy": 5.575722932815552, "epoch": 1.5661933475977436, "grad_norm": 1.015625, "learning_rate": 0.00047547395135884854, "loss": 4.9871, "mean_token_accuracy": 0.20190232247114182, "num_tokens": 34909339.0, "step": 20130 }, { "entropy": 5.584120464324951, "epoch": 1.5665823769694613, "grad_norm": 1.2421875, "learning_rate": 0.0004754613666160841, "loss": 4.9543, "mean_token_accuracy": 0.2002462163567543, "num_tokens": 34917350.0, "step": 20135 }, { "entropy": 5.579108667373657, "epoch": 1.5669714063411786, "grad_norm": 1.171875, "learning_rate": 0.00047544877883163753, "loss": 5.0259, "mean_token_accuracy": 0.19806021302938462, "num_tokens": 34925233.0, "step": 20140 }, { "entropy": 5.5688190937042235, "epoch": 1.5673604357128963, "grad_norm": 1.1171875, "learning_rate": 0.00047543618800569975, "loss": 5.0693, "mean_token_accuracy": 0.19202273041009904, "num_tokens": 34934102.0, "step": 20145 }, { "entropy": 5.640570211410522, "epoch": 1.567749465084614, "grad_norm": 1.0546875, "learning_rate": 0.00047542359413846184, "loss": 5.2059, "mean_token_accuracy": 0.1855194464325905, "num_tokens": 34943325.0, "step": 20150 }, { "entropy": 5.583875846862793, "epoch": 1.5681384944563315, "grad_norm": 1.2734375, "learning_rate": 0.0004754109972301149, "loss": 5.0601, "mean_token_accuracy": 0.19533329457044601, "num_tokens": 34951725.0, "step": 20155 }, { "entropy": 5.644171524047851, "epoch": 1.568527523828049, "grad_norm": 1.1640625, "learning_rate": 0.00047539839728085007, "loss": 5.1051, "mean_token_accuracy": 0.1893131360411644, "num_tokens": 34960068.0, "step": 20160 }, { "entropy": 5.604251289367676, "epoch": 1.5689165531997666, "grad_norm": 1.125, "learning_rate": 0.0004753857942908585, "loss": 5.0117, "mean_token_accuracy": 0.20191127061843872, "num_tokens": 34968400.0, "step": 20165 }, { "entropy": 5.571971130371094, "epoch": 1.5693055825714841, "grad_norm": 1.0703125, "learning_rate": 0.0004753731882603315, "loss": 5.0936, "mean_token_accuracy": 0.19202990680933, "num_tokens": 34976535.0, "step": 20170 }, { "entropy": 5.605853271484375, "epoch": 1.5696946119432016, "grad_norm": 1.140625, "learning_rate": 0.00047536057918946026, "loss": 5.1272, "mean_token_accuracy": 0.1929836764931679, "num_tokens": 34985652.0, "step": 20175 }, { "entropy": 5.580571174621582, "epoch": 1.5700836413149193, "grad_norm": 1.125, "learning_rate": 0.0004753479670784361, "loss": 5.0454, "mean_token_accuracy": 0.19444266259670256, "num_tokens": 34994045.0, "step": 20180 }, { "entropy": 5.6530585289001465, "epoch": 1.570472670686637, "grad_norm": 1.1015625, "learning_rate": 0.0004753353519274505, "loss": 5.0474, "mean_token_accuracy": 0.2003965273499489, "num_tokens": 35003143.0, "step": 20185 }, { "entropy": 5.601285219192505, "epoch": 1.5708617000583545, "grad_norm": 1.0078125, "learning_rate": 0.0004753227337366948, "loss": 5.0954, "mean_token_accuracy": 0.19261547923088074, "num_tokens": 35012330.0, "step": 20190 }, { "entropy": 5.573415613174438, "epoch": 1.571250729430072, "grad_norm": 1.09375, "learning_rate": 0.00047531011250636046, "loss": 5.0273, "mean_token_accuracy": 0.20100121647119523, "num_tokens": 35020753.0, "step": 20195 }, { "entropy": 5.567460346221924, "epoch": 1.5716397588017896, "grad_norm": 1.1015625, "learning_rate": 0.00047529748823663896, "loss": 4.9947, "mean_token_accuracy": 0.20820355117321016, "num_tokens": 35029574.0, "step": 20200 }, { "entropy": 5.642651557922363, "epoch": 1.572028788173507, "grad_norm": 1.1484375, "learning_rate": 0.0004752848609277219, "loss": 5.1604, "mean_token_accuracy": 0.18785342574119568, "num_tokens": 35038658.0, "step": 20205 }, { "entropy": 5.610845375061035, "epoch": 1.5724178175452246, "grad_norm": 1.09375, "learning_rate": 0.00047527223057980086, "loss": 5.0023, "mean_token_accuracy": 0.19252055734395981, "num_tokens": 35046958.0, "step": 20210 }, { "entropy": 5.667481374740601, "epoch": 1.5728068469169423, "grad_norm": 1.1796875, "learning_rate": 0.00047525959719306736, "loss": 5.118, "mean_token_accuracy": 0.1984435126185417, "num_tokens": 35054873.0, "step": 20215 }, { "entropy": 5.642356204986572, "epoch": 1.5731958762886598, "grad_norm": 1.2734375, "learning_rate": 0.0004752469607677134, "loss": 5.1113, "mean_token_accuracy": 0.1913568302989006, "num_tokens": 35064696.0, "step": 20220 }, { "entropy": 5.558316278457641, "epoch": 1.5735849056603772, "grad_norm": 1.0625, "learning_rate": 0.0004752343213039305, "loss": 5.1148, "mean_token_accuracy": 0.1941127747297287, "num_tokens": 35074107.0, "step": 20225 }, { "entropy": 5.588084173202515, "epoch": 1.573973935032095, "grad_norm": 1.1875, "learning_rate": 0.0004752216788019104, "loss": 5.0664, "mean_token_accuracy": 0.2007480412721634, "num_tokens": 35082583.0, "step": 20230 }, { "entropy": 5.595478248596192, "epoch": 1.5743629644038126, "grad_norm": 1.2421875, "learning_rate": 0.0004752090332618451, "loss": 5.0773, "mean_token_accuracy": 0.19921378940343856, "num_tokens": 35091225.0, "step": 20235 }, { "entropy": 5.583647346496582, "epoch": 1.57475199377553, "grad_norm": 1.125, "learning_rate": 0.0004751963846839263, "loss": 5.0048, "mean_token_accuracy": 0.19982710033655166, "num_tokens": 35099274.0, "step": 20240 }, { "entropy": 5.559940195083618, "epoch": 1.5751410231472476, "grad_norm": 1.15625, "learning_rate": 0.00047518373306834605, "loss": 5.0386, "mean_token_accuracy": 0.19410531967878342, "num_tokens": 35108515.0, "step": 20245 }, { "entropy": 5.620254039764404, "epoch": 1.5755300525189653, "grad_norm": 1.0390625, "learning_rate": 0.00047517107841529626, "loss": 5.1244, "mean_token_accuracy": 0.19127087593078612, "num_tokens": 35118141.0, "step": 20250 }, { "entropy": 5.6663134574890135, "epoch": 1.5759190818906827, "grad_norm": 1.1484375, "learning_rate": 0.000475158420724969, "loss": 5.0868, "mean_token_accuracy": 0.20318174809217454, "num_tokens": 35126731.0, "step": 20255 }, { "entropy": 5.578728818893433, "epoch": 1.5763081112624002, "grad_norm": 1.140625, "learning_rate": 0.00047514575999755627, "loss": 5.0587, "mean_token_accuracy": 0.19607993960380554, "num_tokens": 35135530.0, "step": 20260 }, { "entropy": 5.514973211288452, "epoch": 1.576697140634118, "grad_norm": 1.171875, "learning_rate": 0.00047513309623325024, "loss": 4.9514, "mean_token_accuracy": 0.20772783905267717, "num_tokens": 35143690.0, "step": 20265 }, { "entropy": 5.554438352584839, "epoch": 1.5770861700058354, "grad_norm": 1.078125, "learning_rate": 0.0004751204294322429, "loss": 5.032, "mean_token_accuracy": 0.19991711974143983, "num_tokens": 35152456.0, "step": 20270 }, { "entropy": 5.569545936584473, "epoch": 1.5774751993775529, "grad_norm": 1.2109375, "learning_rate": 0.00047510775959472675, "loss": 5.0159, "mean_token_accuracy": 0.1994073897600174, "num_tokens": 35160750.0, "step": 20275 }, { "entropy": 5.5645819187164305, "epoch": 1.5778642287492706, "grad_norm": 1.1171875, "learning_rate": 0.0004750950867208937, "loss": 5.0213, "mean_token_accuracy": 0.19553184509277344, "num_tokens": 35169928.0, "step": 20280 }, { "entropy": 5.492950677871704, "epoch": 1.5782532581209883, "grad_norm": 1.1171875, "learning_rate": 0.0004750824108109362, "loss": 4.9665, "mean_token_accuracy": 0.19902653843164445, "num_tokens": 35178187.0, "step": 20285 }, { "entropy": 5.551076364517212, "epoch": 1.5786422874927057, "grad_norm": 1.0625, "learning_rate": 0.0004750697318650466, "loss": 5.0093, "mean_token_accuracy": 0.19380830079317093, "num_tokens": 35186771.0, "step": 20290 }, { "entropy": 5.581680250167847, "epoch": 1.5790313168644232, "grad_norm": 1.171875, "learning_rate": 0.0004750570498834173, "loss": 5.0333, "mean_token_accuracy": 0.21059935092926024, "num_tokens": 35194687.0, "step": 20295 }, { "entropy": 5.547849559783936, "epoch": 1.579420346236141, "grad_norm": 1.078125, "learning_rate": 0.0004750443648662407, "loss": 5.0511, "mean_token_accuracy": 0.20247087627649307, "num_tokens": 35203529.0, "step": 20300 }, { "entropy": 5.561748743057251, "epoch": 1.5798093756078584, "grad_norm": 1.0859375, "learning_rate": 0.00047503167681370924, "loss": 5.1139, "mean_token_accuracy": 0.1913180723786354, "num_tokens": 35212016.0, "step": 20305 }, { "entropy": 5.47457857131958, "epoch": 1.5801984049795759, "grad_norm": 1.078125, "learning_rate": 0.0004750189857260154, "loss": 4.9405, "mean_token_accuracy": 0.20975393205881118, "num_tokens": 35219782.0, "step": 20310 }, { "entropy": 5.553012371063232, "epoch": 1.5805874343512936, "grad_norm": 1.140625, "learning_rate": 0.0004750062916033519, "loss": 5.0853, "mean_token_accuracy": 0.19093867093324662, "num_tokens": 35228051.0, "step": 20315 }, { "entropy": 5.600552368164062, "epoch": 1.580976463723011, "grad_norm": 1.1796875, "learning_rate": 0.0004749935944459113, "loss": 5.0722, "mean_token_accuracy": 0.19938493520021439, "num_tokens": 35236089.0, "step": 20320 }, { "entropy": 5.6133567810058596, "epoch": 1.5813654930947285, "grad_norm": 1.0078125, "learning_rate": 0.0004749808942538862, "loss": 5.1722, "mean_token_accuracy": 0.18891471177339553, "num_tokens": 35245123.0, "step": 20325 }, { "entropy": 5.611199522018433, "epoch": 1.5817545224664462, "grad_norm": 1.0390625, "learning_rate": 0.0004749681910274693, "loss": 5.0838, "mean_token_accuracy": 0.19618035107851028, "num_tokens": 35253697.0, "step": 20330 }, { "entropy": 5.632259035110474, "epoch": 1.582143551838164, "grad_norm": 1.140625, "learning_rate": 0.00047495548476685334, "loss": 5.0088, "mean_token_accuracy": 0.20494149774312972, "num_tokens": 35262359.0, "step": 20335 }, { "entropy": 5.558789253234863, "epoch": 1.5825325812098814, "grad_norm": 1.21875, "learning_rate": 0.00047494277547223125, "loss": 5.0193, "mean_token_accuracy": 0.20229747295379638, "num_tokens": 35271248.0, "step": 20340 }, { "entropy": 5.557511043548584, "epoch": 1.5829216105815989, "grad_norm": 1.109375, "learning_rate": 0.00047493006314379573, "loss": 5.1515, "mean_token_accuracy": 0.19013188481330873, "num_tokens": 35279641.0, "step": 20345 }, { "entropy": 5.630762004852295, "epoch": 1.5833106399533166, "grad_norm": 1.234375, "learning_rate": 0.00047491734778173976, "loss": 5.0751, "mean_token_accuracy": 0.18951729238033294, "num_tokens": 35288720.0, "step": 20350 }, { "entropy": 5.578945064544678, "epoch": 1.583699669325034, "grad_norm": 1.09375, "learning_rate": 0.00047490462938625617, "loss": 5.0171, "mean_token_accuracy": 0.20137051343917847, "num_tokens": 35296909.0, "step": 20355 }, { "entropy": 5.566259574890137, "epoch": 1.5840886986967515, "grad_norm": 1.0625, "learning_rate": 0.00047489190795753806, "loss": 5.0622, "mean_token_accuracy": 0.19862593710422516, "num_tokens": 35305764.0, "step": 20360 }, { "entropy": 5.543924856185913, "epoch": 1.5844777280684692, "grad_norm": 1.15625, "learning_rate": 0.0004748791834957784, "loss": 5.0347, "mean_token_accuracy": 0.19862818568944932, "num_tokens": 35314228.0, "step": 20365 }, { "entropy": 5.547152280807495, "epoch": 1.5848667574401867, "grad_norm": 1.1484375, "learning_rate": 0.00047486645600117037, "loss": 4.9426, "mean_token_accuracy": 0.20487884432077408, "num_tokens": 35321730.0, "step": 20370 }, { "entropy": 5.63907823562622, "epoch": 1.5852557868119042, "grad_norm": 1.09375, "learning_rate": 0.0004748537254739068, "loss": 5.1975, "mean_token_accuracy": 0.18654660135507584, "num_tokens": 35330895.0, "step": 20375 }, { "entropy": 5.520685911178589, "epoch": 1.5856448161836219, "grad_norm": 1.15625, "learning_rate": 0.0004748409919141812, "loss": 4.9482, "mean_token_accuracy": 0.2046720176935196, "num_tokens": 35339499.0, "step": 20380 }, { "entropy": 5.566541576385498, "epoch": 1.5860338455553395, "grad_norm": 1.1171875, "learning_rate": 0.0004748282553221865, "loss": 5.0466, "mean_token_accuracy": 0.19844391494989394, "num_tokens": 35347709.0, "step": 20385 }, { "entropy": 5.53077187538147, "epoch": 1.586422874927057, "grad_norm": 1.1328125, "learning_rate": 0.0004748155156981162, "loss": 4.9113, "mean_token_accuracy": 0.1977192670106888, "num_tokens": 35356203.0, "step": 20390 }, { "entropy": 5.5226222515106205, "epoch": 1.5868119042987745, "grad_norm": 1.09375, "learning_rate": 0.00047480277304216346, "loss": 5.0668, "mean_token_accuracy": 0.19889849722385405, "num_tokens": 35365850.0, "step": 20395 }, { "entropy": 5.529595851898193, "epoch": 1.5872009336704922, "grad_norm": 1.1796875, "learning_rate": 0.00047479002735452164, "loss": 5.0011, "mean_token_accuracy": 0.1998235747218132, "num_tokens": 35374428.0, "step": 20400 }, { "entropy": 5.540267276763916, "epoch": 1.5875899630422097, "grad_norm": 1.1171875, "learning_rate": 0.00047477727863538415, "loss": 5.0151, "mean_token_accuracy": 0.20316480994224548, "num_tokens": 35383012.0, "step": 20405 }, { "entropy": 5.629328107833862, "epoch": 1.5879789924139271, "grad_norm": 1.0390625, "learning_rate": 0.00047476452688494444, "loss": 5.0977, "mean_token_accuracy": 0.18049991577863694, "num_tokens": 35392462.0, "step": 20410 }, { "entropy": 5.627099800109863, "epoch": 1.5883680217856448, "grad_norm": 1.0859375, "learning_rate": 0.000474751772103396, "loss": 5.0667, "mean_token_accuracy": 0.19105274826288224, "num_tokens": 35400200.0, "step": 20415 }, { "entropy": 5.5756693363189695, "epoch": 1.5887570511573625, "grad_norm": 1.1328125, "learning_rate": 0.0004747390142909323, "loss": 5.0348, "mean_token_accuracy": 0.1954803615808487, "num_tokens": 35408272.0, "step": 20420 }, { "entropy": 5.589681243896484, "epoch": 1.5891460805290798, "grad_norm": 1.0859375, "learning_rate": 0.00047472625344774713, "loss": 5.0771, "mean_token_accuracy": 0.19289946258068086, "num_tokens": 35417796.0, "step": 20425 }, { "entropy": 5.576386022567749, "epoch": 1.5895351099007975, "grad_norm": 1.109375, "learning_rate": 0.00047471348957403374, "loss": 5.0616, "mean_token_accuracy": 0.1920172393321991, "num_tokens": 35426173.0, "step": 20430 }, { "entropy": 5.664482259750367, "epoch": 1.5899241392725152, "grad_norm": 1.3203125, "learning_rate": 0.0004747007226699862, "loss": 5.1295, "mean_token_accuracy": 0.1942828893661499, "num_tokens": 35434972.0, "step": 20435 }, { "entropy": 5.671311235427856, "epoch": 1.5903131686442327, "grad_norm": 1.125, "learning_rate": 0.00047468795273579803, "loss": 5.0549, "mean_token_accuracy": 0.19163405001163483, "num_tokens": 35442824.0, "step": 20440 }, { "entropy": 5.551054000854492, "epoch": 1.5907021980159501, "grad_norm": 1.078125, "learning_rate": 0.0004746751797716629, "loss": 5.0264, "mean_token_accuracy": 0.19766245782375336, "num_tokens": 35451519.0, "step": 20445 }, { "entropy": 5.568986129760742, "epoch": 1.5910912273876678, "grad_norm": 1.1796875, "learning_rate": 0.0004746624037777748, "loss": 5.0662, "mean_token_accuracy": 0.20214746594429017, "num_tokens": 35459473.0, "step": 20450 }, { "entropy": 5.5514037132263185, "epoch": 1.5914802567593853, "grad_norm": 1.1328125, "learning_rate": 0.00047464962475432754, "loss": 5.0925, "mean_token_accuracy": 0.19424415230751038, "num_tokens": 35468648.0, "step": 20455 }, { "entropy": 5.5837212085723875, "epoch": 1.5918692861311028, "grad_norm": 1.25, "learning_rate": 0.000474636842701515, "loss": 4.9846, "mean_token_accuracy": 0.20390194654464722, "num_tokens": 35477626.0, "step": 20460 }, { "entropy": 5.46216778755188, "epoch": 1.5922583155028205, "grad_norm": 1.1328125, "learning_rate": 0.0004746240576195311, "loss": 4.8704, "mean_token_accuracy": 0.2154863804578781, "num_tokens": 35486116.0, "step": 20465 }, { "entropy": 5.581904697418213, "epoch": 1.5926473448745382, "grad_norm": 1.046875, "learning_rate": 0.00047461126950856987, "loss": 5.0767, "mean_token_accuracy": 0.19188373684883117, "num_tokens": 35495860.0, "step": 20470 }, { "entropy": 5.582309436798096, "epoch": 1.5930363742462554, "grad_norm": 1.1796875, "learning_rate": 0.0004745984783688253, "loss": 5.0368, "mean_token_accuracy": 0.2064759075641632, "num_tokens": 35504306.0, "step": 20475 }, { "entropy": 5.574326372146606, "epoch": 1.5934254036179731, "grad_norm": 1.1484375, "learning_rate": 0.00047458568420049153, "loss": 5.0549, "mean_token_accuracy": 0.19911552220582962, "num_tokens": 35513585.0, "step": 20480 }, { "entropy": 5.532439565658569, "epoch": 1.5938144329896908, "grad_norm": 1.1171875, "learning_rate": 0.00047457288700376274, "loss": 4.999, "mean_token_accuracy": 0.19503778219223022, "num_tokens": 35521929.0, "step": 20485 }, { "entropy": 5.575844430923462, "epoch": 1.5942034623614083, "grad_norm": 1.0859375, "learning_rate": 0.00047456008677883304, "loss": 5.0978, "mean_token_accuracy": 0.20033130496740342, "num_tokens": 35530498.0, "step": 20490 }, { "entropy": 5.534327125549316, "epoch": 1.5945924917331258, "grad_norm": 1.1484375, "learning_rate": 0.0004745472835258966, "loss": 5.0053, "mean_token_accuracy": 0.2025996670126915, "num_tokens": 35538958.0, "step": 20495 }, { "entropy": 5.604906129837036, "epoch": 1.5949815211048435, "grad_norm": 1.0625, "learning_rate": 0.00047453447724514773, "loss": 5.1136, "mean_token_accuracy": 0.18190063238143922, "num_tokens": 35548488.0, "step": 20500 }, { "entropy": 5.652164602279663, "epoch": 1.595370550476561, "grad_norm": 1.0234375, "learning_rate": 0.0004745216679367808, "loss": 5.0965, "mean_token_accuracy": 0.19454507678747177, "num_tokens": 35557374.0, "step": 20505 }, { "entropy": 5.5773053646087645, "epoch": 1.5957595798482784, "grad_norm": 1.1171875, "learning_rate": 0.0004745088556009901, "loss": 5.0517, "mean_token_accuracy": 0.19406992048025132, "num_tokens": 35565521.0, "step": 20510 }, { "entropy": 5.519552707672119, "epoch": 1.5961486092199961, "grad_norm": 1.125, "learning_rate": 0.0004744960402379701, "loss": 5.0899, "mean_token_accuracy": 0.19322532862424852, "num_tokens": 35574833.0, "step": 20515 }, { "entropy": 5.550961446762085, "epoch": 1.5965376385917138, "grad_norm": 1.1796875, "learning_rate": 0.00047448322184791525, "loss": 5.0264, "mean_token_accuracy": 0.19596573561429978, "num_tokens": 35583226.0, "step": 20520 }, { "entropy": 5.583236217498779, "epoch": 1.596926667963431, "grad_norm": 1.1796875, "learning_rate": 0.00047447040043101994, "loss": 5.0054, "mean_token_accuracy": 0.2041420355439186, "num_tokens": 35591366.0, "step": 20525 }, { "entropy": 5.620168209075928, "epoch": 1.5973156973351488, "grad_norm": 1.1328125, "learning_rate": 0.00047445757598747886, "loss": 5.0667, "mean_token_accuracy": 0.1894078090786934, "num_tokens": 35599244.0, "step": 20530 }, { "entropy": 5.595584726333618, "epoch": 1.5977047267068665, "grad_norm": 1.0234375, "learning_rate": 0.0004744447485174864, "loss": 5.0731, "mean_token_accuracy": 0.1870184689760208, "num_tokens": 35608132.0, "step": 20535 }, { "entropy": 5.584169673919678, "epoch": 1.598093756078584, "grad_norm": 1.078125, "learning_rate": 0.00047443191802123746, "loss": 4.9882, "mean_token_accuracy": 0.19617429375648499, "num_tokens": 35616459.0, "step": 20540 }, { "entropy": 5.61034460067749, "epoch": 1.5984827854503014, "grad_norm": 1.109375, "learning_rate": 0.00047441908449892664, "loss": 5.0881, "mean_token_accuracy": 0.19541900753974914, "num_tokens": 35624802.0, "step": 20545 }, { "entropy": 5.600928783416748, "epoch": 1.5988718148220191, "grad_norm": 1.140625, "learning_rate": 0.00047440624795074855, "loss": 5.0514, "mean_token_accuracy": 0.19177628606557845, "num_tokens": 35632787.0, "step": 20550 }, { "entropy": 5.547068548202515, "epoch": 1.5992608441937366, "grad_norm": 1.015625, "learning_rate": 0.00047439340837689804, "loss": 5.0535, "mean_token_accuracy": 0.20551725924015046, "num_tokens": 35641848.0, "step": 20555 }, { "entropy": 5.56574239730835, "epoch": 1.599649873565454, "grad_norm": 1.03125, "learning_rate": 0.00047438056577756986, "loss": 5.0251, "mean_token_accuracy": 0.2022228553891182, "num_tokens": 35650502.0, "step": 20560 }, { "entropy": 5.5688553810119625, "epoch": 1.6000389029371718, "grad_norm": 1.171875, "learning_rate": 0.00047436772015295903, "loss": 4.9897, "mean_token_accuracy": 0.20269134640693665, "num_tokens": 35658454.0, "step": 20565 }, { "entropy": 5.583420276641846, "epoch": 1.6004279323088895, "grad_norm": 1.046875, "learning_rate": 0.00047435487150326036, "loss": 5.0964, "mean_token_accuracy": 0.19134222865104675, "num_tokens": 35667235.0, "step": 20570 }, { "entropy": 5.619916820526123, "epoch": 1.6008169616806067, "grad_norm": 1.0703125, "learning_rate": 0.0004743420198286688, "loss": 5.0745, "mean_token_accuracy": 0.2064508840441704, "num_tokens": 35675671.0, "step": 20575 }, { "entropy": 5.632651948928833, "epoch": 1.6012059910523244, "grad_norm": 1.0859375, "learning_rate": 0.00047432916512937936, "loss": 4.9693, "mean_token_accuracy": 0.2008173644542694, "num_tokens": 35684949.0, "step": 20580 }, { "entropy": 5.519704437255859, "epoch": 1.6015950204240421, "grad_norm": 1.1796875, "learning_rate": 0.0004743163074055871, "loss": 4.9976, "mean_token_accuracy": 0.19276344329118728, "num_tokens": 35693241.0, "step": 20585 }, { "entropy": 5.553729057312012, "epoch": 1.6019840497957596, "grad_norm": 1.046875, "learning_rate": 0.0004743034466574871, "loss": 5.077, "mean_token_accuracy": 0.1966675415635109, "num_tokens": 35702510.0, "step": 20590 }, { "entropy": 5.58604588508606, "epoch": 1.602373079167477, "grad_norm": 1.0859375, "learning_rate": 0.0004742905828852746, "loss": 5.0191, "mean_token_accuracy": 0.20207636058330536, "num_tokens": 35711779.0, "step": 20595 }, { "entropy": 5.607494735717774, "epoch": 1.6027621085391948, "grad_norm": 1.1875, "learning_rate": 0.0004742777160891447, "loss": 5.1423, "mean_token_accuracy": 0.1886927992105484, "num_tokens": 35719848.0, "step": 20600 }, { "entropy": 5.599776697158814, "epoch": 1.6031511379109122, "grad_norm": 1.21875, "learning_rate": 0.0004742648462692926, "loss": 5.1963, "mean_token_accuracy": 0.18366478979587555, "num_tokens": 35728762.0, "step": 20605 }, { "entropy": 5.565124034881592, "epoch": 1.6035401672826297, "grad_norm": 1.21875, "learning_rate": 0.00047425197342591363, "loss": 5.0374, "mean_token_accuracy": 0.20134300887584686, "num_tokens": 35737811.0, "step": 20610 }, { "entropy": 5.677921915054322, "epoch": 1.6039291966543474, "grad_norm": 1.1171875, "learning_rate": 0.0004742390975592031, "loss": 5.0639, "mean_token_accuracy": 0.19549560099840163, "num_tokens": 35746470.0, "step": 20615 }, { "entropy": 5.574686050415039, "epoch": 1.604318226026065, "grad_norm": 1.0625, "learning_rate": 0.00047422621866935645, "loss": 5.097, "mean_token_accuracy": 0.19594002962112428, "num_tokens": 35756000.0, "step": 20620 }, { "entropy": 5.50658483505249, "epoch": 1.6047072553977826, "grad_norm": 1.0546875, "learning_rate": 0.000474213336756569, "loss": 4.9779, "mean_token_accuracy": 0.20368831157684325, "num_tokens": 35764781.0, "step": 20625 }, { "entropy": 5.531512594223022, "epoch": 1.6050962847695, "grad_norm": 1.09375, "learning_rate": 0.0004742004518210362, "loss": 5.0002, "mean_token_accuracy": 0.19779135435819625, "num_tokens": 35772845.0, "step": 20630 }, { "entropy": 5.641934061050415, "epoch": 1.6054853141412178, "grad_norm": 1.1171875, "learning_rate": 0.0004741875638629536, "loss": 5.0794, "mean_token_accuracy": 0.19366559982299805, "num_tokens": 35781863.0, "step": 20635 }, { "entropy": 5.559184741973877, "epoch": 1.6058743435129352, "grad_norm": 1.0859375, "learning_rate": 0.0004741746728825168, "loss": 5.0043, "mean_token_accuracy": 0.20290449559688567, "num_tokens": 35791321.0, "step": 20640 }, { "entropy": 5.529626131057739, "epoch": 1.6062633728846527, "grad_norm": 1.125, "learning_rate": 0.0004741617788799213, "loss": 4.9243, "mean_token_accuracy": 0.20864196717739106, "num_tokens": 35799643.0, "step": 20645 }, { "entropy": 5.584804058074951, "epoch": 1.6066524022563704, "grad_norm": 1.0625, "learning_rate": 0.00047414888185536285, "loss": 5.0846, "mean_token_accuracy": 0.19097966849803924, "num_tokens": 35808382.0, "step": 20650 }, { "entropy": 5.566513156890869, "epoch": 1.6070414316280879, "grad_norm": 1.0625, "learning_rate": 0.0004741359818090371, "loss": 5.0207, "mean_token_accuracy": 0.1968013659119606, "num_tokens": 35817110.0, "step": 20655 }, { "entropy": 5.522380828857422, "epoch": 1.6074304609998054, "grad_norm": 1.2109375, "learning_rate": 0.00047412307874113976, "loss": 4.9319, "mean_token_accuracy": 0.21003714203834534, "num_tokens": 35824590.0, "step": 20660 }, { "entropy": 5.579947137832642, "epoch": 1.607819490371523, "grad_norm": 1.125, "learning_rate": 0.0004741101726518667, "loss": 5.0699, "mean_token_accuracy": 0.19348026365041732, "num_tokens": 35833391.0, "step": 20665 }, { "entropy": 5.62249755859375, "epoch": 1.6082085197432407, "grad_norm": 1.1796875, "learning_rate": 0.0004740972635414136, "loss": 5.1071, "mean_token_accuracy": 0.19125356674194335, "num_tokens": 35842586.0, "step": 20670 }, { "entropy": 5.572748422622681, "epoch": 1.6085975491149582, "grad_norm": 1.0546875, "learning_rate": 0.0004740843514099765, "loss": 5.062, "mean_token_accuracy": 0.1981152266263962, "num_tokens": 35850973.0, "step": 20675 }, { "entropy": 5.593725633621216, "epoch": 1.6089865784866757, "grad_norm": 1.015625, "learning_rate": 0.0004740714362577512, "loss": 5.0847, "mean_token_accuracy": 0.1918594181537628, "num_tokens": 35859686.0, "step": 20680 }, { "entropy": 5.577735090255738, "epoch": 1.6093756078583934, "grad_norm": 1.125, "learning_rate": 0.00047405851808493364, "loss": 5.0004, "mean_token_accuracy": 0.20335650593042373, "num_tokens": 35868161.0, "step": 20685 }, { "entropy": 5.5351881980896, "epoch": 1.6097646372301109, "grad_norm": 1.171875, "learning_rate": 0.00047404559689172006, "loss": 5.0324, "mean_token_accuracy": 0.1905168354511261, "num_tokens": 35876431.0, "step": 20690 }, { "entropy": 5.585420322418213, "epoch": 1.6101536666018283, "grad_norm": 1.09375, "learning_rate": 0.00047403267267830617, "loss": 5.0375, "mean_token_accuracy": 0.19040782153606414, "num_tokens": 35884598.0, "step": 20695 }, { "entropy": 5.669983386993408, "epoch": 1.610542695973546, "grad_norm": 1.1328125, "learning_rate": 0.00047401974544488844, "loss": 5.1467, "mean_token_accuracy": 0.18747070133686067, "num_tokens": 35893395.0, "step": 20700 }, { "entropy": 5.646161699295044, "epoch": 1.6109317253452635, "grad_norm": 1.15625, "learning_rate": 0.0004740068151916628, "loss": 5.0702, "mean_token_accuracy": 0.18957708925008773, "num_tokens": 35902043.0, "step": 20705 }, { "entropy": 5.638747978210449, "epoch": 1.611320754716981, "grad_norm": 1.109375, "learning_rate": 0.0004739938819188255, "loss": 5.1268, "mean_token_accuracy": 0.19207285791635514, "num_tokens": 35911514.0, "step": 20710 }, { "entropy": 5.643983602523804, "epoch": 1.6117097840886987, "grad_norm": 1.0703125, "learning_rate": 0.0004739809456265727, "loss": 5.0784, "mean_token_accuracy": 0.19706311523914338, "num_tokens": 35919777.0, "step": 20715 }, { "entropy": 5.62511420249939, "epoch": 1.6120988134604164, "grad_norm": 1.078125, "learning_rate": 0.0004739680063151008, "loss": 5.0269, "mean_token_accuracy": 0.20109447538852693, "num_tokens": 35929058.0, "step": 20720 }, { "entropy": 5.508691501617432, "epoch": 1.6124878428321339, "grad_norm": 1.1640625, "learning_rate": 0.0004739550639846061, "loss": 4.965, "mean_token_accuracy": 0.20061279684305192, "num_tokens": 35937855.0, "step": 20725 }, { "entropy": 5.5391318798065186, "epoch": 1.6128768722038513, "grad_norm": 1.1328125, "learning_rate": 0.00047394211863528496, "loss": 5.0956, "mean_token_accuracy": 0.19917786717414857, "num_tokens": 35946472.0, "step": 20730 }, { "entropy": 5.595883464813232, "epoch": 1.613265901575569, "grad_norm": 1.140625, "learning_rate": 0.0004739291702673338, "loss": 5.0615, "mean_token_accuracy": 0.19751307368278503, "num_tokens": 35954876.0, "step": 20735 }, { "entropy": 5.652703428268433, "epoch": 1.6136549309472865, "grad_norm": 1.140625, "learning_rate": 0.0004739162188809492, "loss": 5.1157, "mean_token_accuracy": 0.18689001202583314, "num_tokens": 35964525.0, "step": 20740 }, { "entropy": 5.570595741271973, "epoch": 1.614043960319004, "grad_norm": 1.1875, "learning_rate": 0.00047390326447632747, "loss": 5.1165, "mean_token_accuracy": 0.19348090291023254, "num_tokens": 35973172.0, "step": 20745 }, { "entropy": 5.643519687652588, "epoch": 1.6144329896907217, "grad_norm": 1.1484375, "learning_rate": 0.0004738903070536654, "loss": 5.1505, "mean_token_accuracy": 0.19644696712493898, "num_tokens": 35982181.0, "step": 20750 }, { "entropy": 5.641771078109741, "epoch": 1.6148220190624392, "grad_norm": 1.1484375, "learning_rate": 0.0004738773466131594, "loss": 5.1305, "mean_token_accuracy": 0.18445833325386046, "num_tokens": 35991511.0, "step": 20755 }, { "entropy": 5.634194564819336, "epoch": 1.6152110484341566, "grad_norm": 1.046875, "learning_rate": 0.0004738643831550063, "loss": 5.106, "mean_token_accuracy": 0.1961176335811615, "num_tokens": 36000798.0, "step": 20760 }, { "entropy": 5.570387887954712, "epoch": 1.6156000778058743, "grad_norm": 1.0390625, "learning_rate": 0.0004738514166794026, "loss": 4.9535, "mean_token_accuracy": 0.20635077208280564, "num_tokens": 36009779.0, "step": 20765 }, { "entropy": 5.61924557685852, "epoch": 1.615989107177592, "grad_norm": 1.203125, "learning_rate": 0.00047383844718654525, "loss": 5.06, "mean_token_accuracy": 0.1982255145907402, "num_tokens": 36017752.0, "step": 20770 }, { "entropy": 5.5329670906066895, "epoch": 1.6163781365493095, "grad_norm": 1.171875, "learning_rate": 0.0004738254746766309, "loss": 4.9464, "mean_token_accuracy": 0.20671554803848266, "num_tokens": 36026618.0, "step": 20775 }, { "entropy": 5.571297025680542, "epoch": 1.616767165921027, "grad_norm": 1.171875, "learning_rate": 0.0004738124991498565, "loss": 5.0272, "mean_token_accuracy": 0.19699340015649797, "num_tokens": 36035651.0, "step": 20780 }, { "entropy": 5.541163969039917, "epoch": 1.6171561952927447, "grad_norm": 1.1171875, "learning_rate": 0.00047379952060641866, "loss": 5.0274, "mean_token_accuracy": 0.19539180845022203, "num_tokens": 36044346.0, "step": 20785 }, { "entropy": 5.563560104370117, "epoch": 1.6175452246644622, "grad_norm": 1.1328125, "learning_rate": 0.00047378653904651475, "loss": 4.9572, "mean_token_accuracy": 0.20308210998773574, "num_tokens": 36052895.0, "step": 20790 }, { "entropy": 5.615769290924073, "epoch": 1.6179342540361796, "grad_norm": 1.1015625, "learning_rate": 0.00047377355447034136, "loss": 5.0307, "mean_token_accuracy": 0.1948792889714241, "num_tokens": 36061186.0, "step": 20795 }, { "entropy": 5.631786251068116, "epoch": 1.6183232834078973, "grad_norm": 1.0390625, "learning_rate": 0.0004737605668780958, "loss": 5.1442, "mean_token_accuracy": 0.1893509343266487, "num_tokens": 36069540.0, "step": 20800 }, { "entropy": 5.6162073612213135, "epoch": 1.618712312779615, "grad_norm": 1.1640625, "learning_rate": 0.00047374757626997494, "loss": 5.0386, "mean_token_accuracy": 0.19843841344118118, "num_tokens": 36078241.0, "step": 20805 }, { "entropy": 5.5599769115447994, "epoch": 1.6191013421513323, "grad_norm": 1.0703125, "learning_rate": 0.0004737345826461759, "loss": 5.0837, "mean_token_accuracy": 0.19560853242874146, "num_tokens": 36087253.0, "step": 20810 }, { "entropy": 5.569096565246582, "epoch": 1.61949037152305, "grad_norm": 1.0703125, "learning_rate": 0.0004737215860068959, "loss": 4.9007, "mean_token_accuracy": 0.2054625391960144, "num_tokens": 36095361.0, "step": 20815 }, { "entropy": 5.561181497573853, "epoch": 1.6198794008947677, "grad_norm": 1.0390625, "learning_rate": 0.00047370858635233223, "loss": 5.0364, "mean_token_accuracy": 0.19793290197849273, "num_tokens": 36104104.0, "step": 20820 }, { "entropy": 5.5188267707824705, "epoch": 1.6202684302664851, "grad_norm": 1.140625, "learning_rate": 0.00047369558368268194, "loss": 4.928, "mean_token_accuracy": 0.20316271930933, "num_tokens": 36112636.0, "step": 20825 }, { "entropy": 5.566997385025024, "epoch": 1.6206574596382026, "grad_norm": 1.140625, "learning_rate": 0.0004736825779981424, "loss": 4.9972, "mean_token_accuracy": 0.2044930264353752, "num_tokens": 36121458.0, "step": 20830 }, { "entropy": 5.592270135879517, "epoch": 1.6210464890099203, "grad_norm": 1.1171875, "learning_rate": 0.0004736695692989111, "loss": 5.0514, "mean_token_accuracy": 0.1944114461541176, "num_tokens": 36129541.0, "step": 20835 }, { "entropy": 5.530717897415161, "epoch": 1.6214355183816378, "grad_norm": 1.1015625, "learning_rate": 0.0004736565575851852, "loss": 5.0336, "mean_token_accuracy": 0.20032714903354645, "num_tokens": 36138118.0, "step": 20840 }, { "entropy": 5.646763706207276, "epoch": 1.6218245477533553, "grad_norm": 1.1796875, "learning_rate": 0.0004736435428571622, "loss": 5.1045, "mean_token_accuracy": 0.19243379682302475, "num_tokens": 36147107.0, "step": 20845 }, { "entropy": 5.565678977966309, "epoch": 1.622213577125073, "grad_norm": 1.15625, "learning_rate": 0.0004736305251150397, "loss": 5.0549, "mean_token_accuracy": 0.18922393918037414, "num_tokens": 36155353.0, "step": 20850 }, { "entropy": 5.610718870162964, "epoch": 1.6226026064967907, "grad_norm": 1.140625, "learning_rate": 0.0004736175043590151, "loss": 5.129, "mean_token_accuracy": 0.19976239502429963, "num_tokens": 36163928.0, "step": 20855 }, { "entropy": 5.5744835376739506, "epoch": 1.622991635868508, "grad_norm": 1.1796875, "learning_rate": 0.000473604480589286, "loss": 4.9268, "mean_token_accuracy": 0.20720416605472564, "num_tokens": 36172601.0, "step": 20860 }, { "entropy": 5.57391676902771, "epoch": 1.6233806652402256, "grad_norm": 1.0390625, "learning_rate": 0.00047359145380605007, "loss": 5.0217, "mean_token_accuracy": 0.1961013361811638, "num_tokens": 36182098.0, "step": 20865 }, { "entropy": 5.546414852142334, "epoch": 1.6237696946119433, "grad_norm": 1.0390625, "learning_rate": 0.0004735784240095049, "loss": 5.0241, "mean_token_accuracy": 0.20005569905042647, "num_tokens": 36191022.0, "step": 20870 }, { "entropy": 5.538806295394897, "epoch": 1.6241587239836608, "grad_norm": 1.1875, "learning_rate": 0.00047356539119984813, "loss": 5.0096, "mean_token_accuracy": 0.20235928297042846, "num_tokens": 36200229.0, "step": 20875 }, { "entropy": 5.567064332962036, "epoch": 1.6245477533553783, "grad_norm": 1.109375, "learning_rate": 0.0004735523553772777, "loss": 5.0873, "mean_token_accuracy": 0.196621435880661, "num_tokens": 36208660.0, "step": 20880 }, { "entropy": 5.539689397811889, "epoch": 1.624936782727096, "grad_norm": 1.1875, "learning_rate": 0.0004735393165419912, "loss": 5.0244, "mean_token_accuracy": 0.1990366369485855, "num_tokens": 36217034.0, "step": 20885 }, { "entropy": 5.601562881469727, "epoch": 1.6253258120988134, "grad_norm": 1.1796875, "learning_rate": 0.00047352627469418666, "loss": 5.0403, "mean_token_accuracy": 0.19395889043807985, "num_tokens": 36225653.0, "step": 20890 }, { "entropy": 5.593519020080566, "epoch": 1.625714841470531, "grad_norm": 1.046875, "learning_rate": 0.0004735132298340619, "loss": 4.9438, "mean_token_accuracy": 0.2052724242210388, "num_tokens": 36234449.0, "step": 20895 }, { "entropy": 5.544824314117432, "epoch": 1.6261038708422486, "grad_norm": 1.1015625, "learning_rate": 0.0004735001819618148, "loss": 4.9995, "mean_token_accuracy": 0.19994664937257767, "num_tokens": 36243565.0, "step": 20900 }, { "entropy": 5.598747253417969, "epoch": 1.6264929002139663, "grad_norm": 1.1015625, "learning_rate": 0.0004734871310776434, "loss": 5.0252, "mean_token_accuracy": 0.20233528912067414, "num_tokens": 36252848.0, "step": 20905 }, { "entropy": 5.553025960922241, "epoch": 1.6268819295856836, "grad_norm": 1.140625, "learning_rate": 0.0004734740771817457, "loss": 5.0318, "mean_token_accuracy": 0.19314651787281037, "num_tokens": 36262125.0, "step": 20910 }, { "entropy": 5.589990663528442, "epoch": 1.6272709589574013, "grad_norm": 1.0859375, "learning_rate": 0.0004734610202743198, "loss": 5.1331, "mean_token_accuracy": 0.1954658016562462, "num_tokens": 36271466.0, "step": 20915 }, { "entropy": 5.549453210830689, "epoch": 1.627659988329119, "grad_norm": 1.03125, "learning_rate": 0.0004734479603555638, "loss": 4.96, "mean_token_accuracy": 0.20164926052093507, "num_tokens": 36280207.0, "step": 20920 }, { "entropy": 5.617452001571655, "epoch": 1.6280490177008364, "grad_norm": 1.1328125, "learning_rate": 0.00047343489742567593, "loss": 5.1297, "mean_token_accuracy": 0.19514364004135132, "num_tokens": 36288343.0, "step": 20925 }, { "entropy": 5.6378966808319095, "epoch": 1.628438047072554, "grad_norm": 1.15625, "learning_rate": 0.00047342183148485424, "loss": 5.0164, "mean_token_accuracy": 0.19918595850467682, "num_tokens": 36296679.0, "step": 20930 }, { "entropy": 5.5936079025268555, "epoch": 1.6288270764442716, "grad_norm": 1.078125, "learning_rate": 0.00047340876253329706, "loss": 4.9874, "mean_token_accuracy": 0.19952846467494964, "num_tokens": 36305806.0, "step": 20935 }, { "entropy": 5.497388696670532, "epoch": 1.629216105815989, "grad_norm": 1.125, "learning_rate": 0.00047339569057120275, "loss": 4.9519, "mean_token_accuracy": 0.20910928696393966, "num_tokens": 36314861.0, "step": 20940 }, { "entropy": 5.59879059791565, "epoch": 1.6296051351877066, "grad_norm": 1.0703125, "learning_rate": 0.00047338261559876966, "loss": 5.0315, "mean_token_accuracy": 0.1960493341088295, "num_tokens": 36323611.0, "step": 20945 }, { "entropy": 5.633615779876709, "epoch": 1.6299941645594243, "grad_norm": 1.140625, "learning_rate": 0.00047336953761619604, "loss": 5.1141, "mean_token_accuracy": 0.1924738734960556, "num_tokens": 36331785.0, "step": 20950 }, { "entropy": 5.483160448074341, "epoch": 1.630383193931142, "grad_norm": 1.1015625, "learning_rate": 0.00047335645662368046, "loss": 4.954, "mean_token_accuracy": 0.20160435438156127, "num_tokens": 36340202.0, "step": 20955 }, { "entropy": 5.570060062408447, "epoch": 1.6307722233028592, "grad_norm": 1.203125, "learning_rate": 0.0004733433726214214, "loss": 5.0245, "mean_token_accuracy": 0.19779227375984193, "num_tokens": 36348227.0, "step": 20960 }, { "entropy": 5.600245332717895, "epoch": 1.631161252674577, "grad_norm": 1.109375, "learning_rate": 0.00047333028560961733, "loss": 5.0981, "mean_token_accuracy": 0.19460875391960145, "num_tokens": 36357801.0, "step": 20965 }, { "entropy": 5.590369367599488, "epoch": 1.6315502820462946, "grad_norm": 1.09375, "learning_rate": 0.00047331719558846687, "loss": 5.0686, "mean_token_accuracy": 0.20001079142093658, "num_tokens": 36366147.0, "step": 20970 }, { "entropy": 5.631360483169556, "epoch": 1.631939311418012, "grad_norm": 1.171875, "learning_rate": 0.00047330410255816863, "loss": 5.1153, "mean_token_accuracy": 0.1919443652033806, "num_tokens": 36374637.0, "step": 20975 }, { "entropy": 5.5797699928283695, "epoch": 1.6323283407897295, "grad_norm": 1.1484375, "learning_rate": 0.00047329100651892123, "loss": 5.0094, "mean_token_accuracy": 0.2002417951822281, "num_tokens": 36383911.0, "step": 20980 }, { "entropy": 5.637818908691406, "epoch": 1.6327173701614472, "grad_norm": 1.109375, "learning_rate": 0.0004732779074709234, "loss": 5.0247, "mean_token_accuracy": 0.19771524220705033, "num_tokens": 36392557.0, "step": 20985 }, { "entropy": 5.557787990570068, "epoch": 1.6331063995331647, "grad_norm": 1.1796875, "learning_rate": 0.000473264805414374, "loss": 4.9888, "mean_token_accuracy": 0.19780325442552565, "num_tokens": 36400845.0, "step": 20990 }, { "entropy": 5.521533870697022, "epoch": 1.6334954289048822, "grad_norm": 1.078125, "learning_rate": 0.00047325170034947167, "loss": 4.9716, "mean_token_accuracy": 0.20563892126083375, "num_tokens": 36409360.0, "step": 20995 }, { "entropy": 5.518873596191407, "epoch": 1.6338844582766, "grad_norm": 1.078125, "learning_rate": 0.00047323859227641537, "loss": 4.9416, "mean_token_accuracy": 0.2110530987381935, "num_tokens": 36418638.0, "step": 21000 }, { "epoch": 1.6338844582766, "eval_entropy": 5.358531058718082, "eval_loss": 5.107507705688477, "eval_mean_token_accuracy": 0.20434006118682627, "eval_num_tokens": 36418638.0, "eval_runtime": 21.6334, "eval_samples_per_second": 1921.01, "eval_steps_per_second": 240.138, "step": 21000 }, { "entropy": 5.5983349800109865, "epoch": 1.6342734876483176, "grad_norm": 1.1484375, "learning_rate": 0.00047322548119540397, "loss": 5.0845, "mean_token_accuracy": 0.19308139532804489, "num_tokens": 36427571.0, "step": 21005 }, { "entropy": 5.6030237674713135, "epoch": 1.634662517020035, "grad_norm": 1.0625, "learning_rate": 0.00047321236710663636, "loss": 5.0571, "mean_token_accuracy": 0.19659548997879028, "num_tokens": 36436694.0, "step": 21010 }, { "entropy": 5.554193592071533, "epoch": 1.6350515463917525, "grad_norm": 1.1171875, "learning_rate": 0.00047319925001031165, "loss": 4.9789, "mean_token_accuracy": 0.20792436599731445, "num_tokens": 36445318.0, "step": 21015 }, { "entropy": 5.5952190399169925, "epoch": 1.6354405757634702, "grad_norm": 1.109375, "learning_rate": 0.0004731861299066287, "loss": 5.0573, "mean_token_accuracy": 0.19558667838573457, "num_tokens": 36454116.0, "step": 21020 }, { "entropy": 5.531690549850464, "epoch": 1.6358296051351877, "grad_norm": 1.1328125, "learning_rate": 0.0004731730067957867, "loss": 4.9267, "mean_token_accuracy": 0.21292848736047745, "num_tokens": 36462937.0, "step": 21025 }, { "entropy": 5.567939949035645, "epoch": 1.6362186345069052, "grad_norm": 1.0703125, "learning_rate": 0.00047315988067798476, "loss": 4.9774, "mean_token_accuracy": 0.20617568790912627, "num_tokens": 36471650.0, "step": 21030 }, { "entropy": 5.619936609268189, "epoch": 1.6366076638786229, "grad_norm": 1.1640625, "learning_rate": 0.000473146751553422, "loss": 5.2007, "mean_token_accuracy": 0.1893467053771019, "num_tokens": 36480810.0, "step": 21035 }, { "entropy": 5.586515045166015, "epoch": 1.6369966932503404, "grad_norm": 1.0078125, "learning_rate": 0.0004731336194222978, "loss": 5.0017, "mean_token_accuracy": 0.1984693005681038, "num_tokens": 36489698.0, "step": 21040 }, { "entropy": 5.571409702301025, "epoch": 1.6373857226220578, "grad_norm": 1.09375, "learning_rate": 0.00047312048428481114, "loss": 4.9674, "mean_token_accuracy": 0.2075487717986107, "num_tokens": 36498868.0, "step": 21045 }, { "entropy": 5.487791252136231, "epoch": 1.6377747519937755, "grad_norm": 1.109375, "learning_rate": 0.00047310734614116153, "loss": 4.8893, "mean_token_accuracy": 0.205226269364357, "num_tokens": 36507447.0, "step": 21050 }, { "entropy": 5.577247571945191, "epoch": 1.6381637813654932, "grad_norm": 1.1171875, "learning_rate": 0.0004730942049915483, "loss": 5.1874, "mean_token_accuracy": 0.19133370071649553, "num_tokens": 36516299.0, "step": 21055 }, { "entropy": 5.631215286254883, "epoch": 1.6385528107372107, "grad_norm": 1.1796875, "learning_rate": 0.0004730810608361707, "loss": 5.0495, "mean_token_accuracy": 0.20634507685899733, "num_tokens": 36524426.0, "step": 21060 }, { "entropy": 5.679188013076782, "epoch": 1.6389418401089282, "grad_norm": 1.1015625, "learning_rate": 0.00047306791367522833, "loss": 5.1082, "mean_token_accuracy": 0.1926860511302948, "num_tokens": 36533566.0, "step": 21065 }, { "entropy": 5.637728071212768, "epoch": 1.6393308694806459, "grad_norm": 1.1484375, "learning_rate": 0.0004730547635089206, "loss": 5.1296, "mean_token_accuracy": 0.19646978080272676, "num_tokens": 36541728.0, "step": 21070 }, { "entropy": 5.610584163665772, "epoch": 1.6397198988523634, "grad_norm": 1.234375, "learning_rate": 0.00047304161033744714, "loss": 4.9975, "mean_token_accuracy": 0.20313474237918855, "num_tokens": 36549196.0, "step": 21075 }, { "entropy": 5.578542757034302, "epoch": 1.6401089282240808, "grad_norm": 1.1796875, "learning_rate": 0.0004730284541610075, "loss": 5.0508, "mean_token_accuracy": 0.20234542936086655, "num_tokens": 36557354.0, "step": 21080 }, { "entropy": 5.482127857208252, "epoch": 1.6404979575957985, "grad_norm": 1.1015625, "learning_rate": 0.0004730152949798012, "loss": 4.9798, "mean_token_accuracy": 0.20173519551754, "num_tokens": 36566657.0, "step": 21085 }, { "entropy": 5.587358236312866, "epoch": 1.640886986967516, "grad_norm": 1.1796875, "learning_rate": 0.00047300213279402787, "loss": 5.0342, "mean_token_accuracy": 0.20067018568515776, "num_tokens": 36574313.0, "step": 21090 }, { "entropy": 5.647541332244873, "epoch": 1.6412760163392335, "grad_norm": 1.1953125, "learning_rate": 0.00047298896760388745, "loss": 5.0074, "mean_token_accuracy": 0.20562151223421096, "num_tokens": 36582158.0, "step": 21095 }, { "entropy": 5.542970418930054, "epoch": 1.6416650457109512, "grad_norm": 1.0390625, "learning_rate": 0.0004729757994095796, "loss": 4.9903, "mean_token_accuracy": 0.20446429997682572, "num_tokens": 36590283.0, "step": 21100 }, { "entropy": 5.58388032913208, "epoch": 1.6420540750826689, "grad_norm": 1.046875, "learning_rate": 0.00047296262821130405, "loss": 5.0048, "mean_token_accuracy": 0.19780693650245668, "num_tokens": 36599571.0, "step": 21105 }, { "entropy": 5.628580713272095, "epoch": 1.6424431044543863, "grad_norm": 1.140625, "learning_rate": 0.00047294945400926065, "loss": 5.073, "mean_token_accuracy": 0.19892978221178054, "num_tokens": 36608177.0, "step": 21110 }, { "entropy": 5.587074708938599, "epoch": 1.6428321338261038, "grad_norm": 1.09375, "learning_rate": 0.0004729362768036494, "loss": 5.0731, "mean_token_accuracy": 0.1984366476535797, "num_tokens": 36617305.0, "step": 21115 }, { "entropy": 5.569946670532227, "epoch": 1.6432211631978215, "grad_norm": 1.1328125, "learning_rate": 0.00047292309659467024, "loss": 5.0201, "mean_token_accuracy": 0.2070159614086151, "num_tokens": 36625878.0, "step": 21120 }, { "entropy": 5.652110242843628, "epoch": 1.643610192569539, "grad_norm": 1.203125, "learning_rate": 0.0004729099133825231, "loss": 5.1062, "mean_token_accuracy": 0.1925281912088394, "num_tokens": 36635728.0, "step": 21125 }, { "entropy": 5.639533758163452, "epoch": 1.6439992219412565, "grad_norm": 1.09375, "learning_rate": 0.000472896727167408, "loss": 5.1501, "mean_token_accuracy": 0.19341049790382386, "num_tokens": 36644571.0, "step": 21130 }, { "entropy": 5.579378366470337, "epoch": 1.6443882513129742, "grad_norm": 1.09375, "learning_rate": 0.00047288353794952505, "loss": 4.9852, "mean_token_accuracy": 0.20377596318721772, "num_tokens": 36653582.0, "step": 21135 }, { "entropy": 5.579152631759643, "epoch": 1.6447772806846916, "grad_norm": 1.078125, "learning_rate": 0.0004728703457290744, "loss": 4.9827, "mean_token_accuracy": 0.20910850167274475, "num_tokens": 36662872.0, "step": 21140 }, { "entropy": 5.565367650985718, "epoch": 1.6451663100564091, "grad_norm": 1.078125, "learning_rate": 0.0004728571505062562, "loss": 4.9641, "mean_token_accuracy": 0.20111654400825502, "num_tokens": 36671952.0, "step": 21145 }, { "entropy": 5.67355489730835, "epoch": 1.6455553394281268, "grad_norm": 1.0859375, "learning_rate": 0.0004728439522812707, "loss": 5.1474, "mean_token_accuracy": 0.1883334219455719, "num_tokens": 36681262.0, "step": 21150 }, { "entropy": 5.592899942398072, "epoch": 1.6459443687998445, "grad_norm": 1.1328125, "learning_rate": 0.00047283075105431806, "loss": 4.9577, "mean_token_accuracy": 0.20872252136468888, "num_tokens": 36689094.0, "step": 21155 }, { "entropy": 5.517189407348633, "epoch": 1.646333398171562, "grad_norm": 1.0390625, "learning_rate": 0.0004728175468255987, "loss": 4.937, "mean_token_accuracy": 0.2046843022108078, "num_tokens": 36697043.0, "step": 21160 }, { "entropy": 5.588912153244019, "epoch": 1.6467224275432795, "grad_norm": 1.171875, "learning_rate": 0.00047280433959531287, "loss": 5.132, "mean_token_accuracy": 0.19324016124010085, "num_tokens": 36705561.0, "step": 21165 }, { "entropy": 5.629413270950318, "epoch": 1.6471114569149972, "grad_norm": 1.0390625, "learning_rate": 0.000472791129363661, "loss": 5.124, "mean_token_accuracy": 0.18882680535316468, "num_tokens": 36714973.0, "step": 21170 }, { "entropy": 5.626101970672607, "epoch": 1.6475004862867146, "grad_norm": 1.125, "learning_rate": 0.0004727779161308436, "loss": 5.1051, "mean_token_accuracy": 0.19349679499864578, "num_tokens": 36723218.0, "step": 21175 }, { "entropy": 5.617767095565796, "epoch": 1.6478895156584321, "grad_norm": 1.1328125, "learning_rate": 0.0004727646998970612, "loss": 5.0039, "mean_token_accuracy": 0.20967632234096528, "num_tokens": 36731883.0, "step": 21180 }, { "entropy": 5.591440582275391, "epoch": 1.6482785450301498, "grad_norm": 1.125, "learning_rate": 0.00047275148066251417, "loss": 5.0906, "mean_token_accuracy": 0.18939222246408463, "num_tokens": 36739984.0, "step": 21185 }, { "entropy": 5.511768817901611, "epoch": 1.6486675744018673, "grad_norm": 1.09375, "learning_rate": 0.0004727382584274032, "loss": 4.8607, "mean_token_accuracy": 0.2095464289188385, "num_tokens": 36748551.0, "step": 21190 }, { "entropy": 5.541029405593872, "epoch": 1.6490566037735848, "grad_norm": 1.109375, "learning_rate": 0.00047272503319192887, "loss": 5.0313, "mean_token_accuracy": 0.20105783194303511, "num_tokens": 36756982.0, "step": 21195 }, { "entropy": 5.585467529296875, "epoch": 1.6494456331453025, "grad_norm": 1.171875, "learning_rate": 0.0004727118049562919, "loss": 4.9806, "mean_token_accuracy": 0.19576646089553834, "num_tokens": 36765772.0, "step": 21200 }, { "entropy": 5.560279178619385, "epoch": 1.6498346625170202, "grad_norm": 1.0859375, "learning_rate": 0.000472698573720693, "loss": 4.9703, "mean_token_accuracy": 0.19757506400346755, "num_tokens": 36774718.0, "step": 21205 }, { "entropy": 5.582103443145752, "epoch": 1.6502236918887376, "grad_norm": 1.1875, "learning_rate": 0.0004726853394853329, "loss": 5.023, "mean_token_accuracy": 0.20149630755186082, "num_tokens": 36783575.0, "step": 21210 }, { "entropy": 5.62049822807312, "epoch": 1.650612721260455, "grad_norm": 1.0859375, "learning_rate": 0.00047267210225041234, "loss": 5.0936, "mean_token_accuracy": 0.19383912831544875, "num_tokens": 36792665.0, "step": 21215 }, { "entropy": 5.553858137130737, "epoch": 1.6510017506321728, "grad_norm": 1.1484375, "learning_rate": 0.00047265886201613234, "loss": 4.9734, "mean_token_accuracy": 0.2102370247244835, "num_tokens": 36800987.0, "step": 21220 }, { "entropy": 5.570660161972046, "epoch": 1.6513907800038903, "grad_norm": 1.078125, "learning_rate": 0.00047264561878269365, "loss": 4.9747, "mean_token_accuracy": 0.20491121411323548, "num_tokens": 36809652.0, "step": 21225 }, { "entropy": 5.591576957702637, "epoch": 1.6517798093756078, "grad_norm": 1.109375, "learning_rate": 0.0004726323725502973, "loss": 5.1277, "mean_token_accuracy": 0.19046802520751954, "num_tokens": 36818177.0, "step": 21230 }, { "entropy": 5.602564430236816, "epoch": 1.6521688387473255, "grad_norm": 1.0703125, "learning_rate": 0.0004726191233191443, "loss": 5.0795, "mean_token_accuracy": 0.19109975248575212, "num_tokens": 36828494.0, "step": 21235 }, { "entropy": 5.65405592918396, "epoch": 1.6525578681190431, "grad_norm": 1.1015625, "learning_rate": 0.0004726058710894357, "loss": 5.1372, "mean_token_accuracy": 0.19121405929327012, "num_tokens": 36836956.0, "step": 21240 }, { "entropy": 5.5333339214324955, "epoch": 1.6529468974907604, "grad_norm": 1.125, "learning_rate": 0.0004725926158613724, "loss": 5.0219, "mean_token_accuracy": 0.202458393573761, "num_tokens": 36845973.0, "step": 21245 }, { "entropy": 5.518373632431031, "epoch": 1.653335926862478, "grad_norm": 1.1484375, "learning_rate": 0.0004725793576351557, "loss": 4.9636, "mean_token_accuracy": 0.20332099348306656, "num_tokens": 36855090.0, "step": 21250 }, { "entropy": 5.590155410766601, "epoch": 1.6537249562341958, "grad_norm": 1.0625, "learning_rate": 0.0004725660964109867, "loss": 4.9858, "mean_token_accuracy": 0.2013632610440254, "num_tokens": 36864373.0, "step": 21255 }, { "entropy": 5.683975505828857, "epoch": 1.6541139856059133, "grad_norm": 1.1484375, "learning_rate": 0.00047255283218906673, "loss": 5.1092, "mean_token_accuracy": 0.19302762299776077, "num_tokens": 36872969.0, "step": 21260 }, { "entropy": 5.68102912902832, "epoch": 1.6545030149776307, "grad_norm": 1.078125, "learning_rate": 0.000472539564969597, "loss": 5.1071, "mean_token_accuracy": 0.2057632476091385, "num_tokens": 36880828.0, "step": 21265 }, { "entropy": 5.572316884994507, "epoch": 1.6548920443493484, "grad_norm": 1.125, "learning_rate": 0.00047252629475277863, "loss": 4.976, "mean_token_accuracy": 0.19926813691854478, "num_tokens": 36888766.0, "step": 21270 }, { "entropy": 5.529380512237549, "epoch": 1.655281073721066, "grad_norm": 1.15625, "learning_rate": 0.0004725130215388132, "loss": 4.9249, "mean_token_accuracy": 0.20514314919710158, "num_tokens": 36896623.0, "step": 21275 }, { "entropy": 5.6231659889221195, "epoch": 1.6556701030927834, "grad_norm": 1.1328125, "learning_rate": 0.0004724997453279021, "loss": 5.0474, "mean_token_accuracy": 0.1994338497519493, "num_tokens": 36904753.0, "step": 21280 }, { "entropy": 5.575541687011719, "epoch": 1.656059132464501, "grad_norm": 1.0859375, "learning_rate": 0.0004724864661202467, "loss": 4.9909, "mean_token_accuracy": 0.20546438843011855, "num_tokens": 36914260.0, "step": 21285 }, { "entropy": 5.549522113800049, "epoch": 1.6564481618362188, "grad_norm": 1.1484375, "learning_rate": 0.00047247318391604846, "loss": 4.8802, "mean_token_accuracy": 0.21007707715034485, "num_tokens": 36923114.0, "step": 21290 }, { "entropy": 5.505823945999145, "epoch": 1.656837191207936, "grad_norm": 1.015625, "learning_rate": 0.00047245989871550897, "loss": 5.0307, "mean_token_accuracy": 0.20518750846385955, "num_tokens": 36932042.0, "step": 21295 }, { "entropy": 5.621746158599853, "epoch": 1.6572262205796537, "grad_norm": 1.2109375, "learning_rate": 0.0004724466105188299, "loss": 5.0622, "mean_token_accuracy": 0.19626017659902573, "num_tokens": 36940522.0, "step": 21300 }, { "entropy": 5.620790195465088, "epoch": 1.6576152499513714, "grad_norm": 1.1484375, "learning_rate": 0.00047243331932621263, "loss": 5.0149, "mean_token_accuracy": 0.19953967332839967, "num_tokens": 36948757.0, "step": 21305 }, { "entropy": 5.543782043457031, "epoch": 1.658004279323089, "grad_norm": 1.0078125, "learning_rate": 0.0004724200251378591, "loss": 4.9189, "mean_token_accuracy": 0.20497383773326874, "num_tokens": 36957876.0, "step": 21310 }, { "entropy": 5.564902210235596, "epoch": 1.6583933086948064, "grad_norm": 1.09375, "learning_rate": 0.0004724067279539709, "loss": 5.0688, "mean_token_accuracy": 0.1940697655081749, "num_tokens": 36967109.0, "step": 21315 }, { "entropy": 5.601346731185913, "epoch": 1.658782338066524, "grad_norm": 1.1484375, "learning_rate": 0.00047239342777474975, "loss": 5.0205, "mean_token_accuracy": 0.20013927817344665, "num_tokens": 36975865.0, "step": 21320 }, { "entropy": 5.661682653427124, "epoch": 1.6591713674382416, "grad_norm": 1.15625, "learning_rate": 0.00047238012460039765, "loss": 5.0832, "mean_token_accuracy": 0.1947967678308487, "num_tokens": 36983847.0, "step": 21325 }, { "entropy": 5.558710050582886, "epoch": 1.659560396809959, "grad_norm": 1.1640625, "learning_rate": 0.0004723668184311162, "loss": 5.0374, "mean_token_accuracy": 0.20364061892032623, "num_tokens": 36991996.0, "step": 21330 }, { "entropy": 5.585368347167969, "epoch": 1.6599494261816767, "grad_norm": 1.0625, "learning_rate": 0.0004723535092671074, "loss": 5.0513, "mean_token_accuracy": 0.19752856940031052, "num_tokens": 37001075.0, "step": 21335 }, { "entropy": 5.654236507415772, "epoch": 1.6603384555533944, "grad_norm": 1.125, "learning_rate": 0.00047234019710857335, "loss": 5.0622, "mean_token_accuracy": 0.19622689336538315, "num_tokens": 37009352.0, "step": 21340 }, { "entropy": 5.613842535018921, "epoch": 1.6607274849251117, "grad_norm": 1.046875, "learning_rate": 0.0004723268819557158, "loss": 5.0465, "mean_token_accuracy": 0.2045325368642807, "num_tokens": 37017608.0, "step": 21345 }, { "entropy": 5.608464574813842, "epoch": 1.6611165142968294, "grad_norm": 1.0859375, "learning_rate": 0.00047231356380873687, "loss": 5.041, "mean_token_accuracy": 0.19824079424142838, "num_tokens": 37026288.0, "step": 21350 }, { "entropy": 5.645211029052734, "epoch": 1.661505543668547, "grad_norm": 1.1484375, "learning_rate": 0.0004723002426678388, "loss": 5.1715, "mean_token_accuracy": 0.1914190247654915, "num_tokens": 37034515.0, "step": 21355 }, { "entropy": 5.484783029556274, "epoch": 1.6618945730402646, "grad_norm": 1.046875, "learning_rate": 0.0004722869185332235, "loss": 4.9028, "mean_token_accuracy": 0.20960735976696016, "num_tokens": 37043048.0, "step": 21360 }, { "entropy": 5.567171382904053, "epoch": 1.662283602411982, "grad_norm": 1.09375, "learning_rate": 0.00047227359140509324, "loss": 5.0095, "mean_token_accuracy": 0.19764861464500427, "num_tokens": 37051458.0, "step": 21365 }, { "entropy": 5.594884204864502, "epoch": 1.6626726317836997, "grad_norm": 1.1171875, "learning_rate": 0.0004722602612836501, "loss": 4.9994, "mean_token_accuracy": 0.20250048339366913, "num_tokens": 37059685.0, "step": 21370 }, { "entropy": 5.549195003509522, "epoch": 1.6630616611554172, "grad_norm": 1.1328125, "learning_rate": 0.00047224692816909665, "loss": 5.0691, "mean_token_accuracy": 0.19346206188201903, "num_tokens": 37068568.0, "step": 21375 }, { "entropy": 5.576695823669434, "epoch": 1.6634506905271347, "grad_norm": 1.1171875, "learning_rate": 0.0004722335920616349, "loss": 4.9091, "mean_token_accuracy": 0.20346153378486634, "num_tokens": 37077018.0, "step": 21380 }, { "entropy": 5.56000657081604, "epoch": 1.6638397198988524, "grad_norm": 1.1640625, "learning_rate": 0.00047222025296146745, "loss": 4.9449, "mean_token_accuracy": 0.2047078639268875, "num_tokens": 37085177.0, "step": 21385 }, { "entropy": 5.596906995773315, "epoch": 1.66422874927057, "grad_norm": 1.09375, "learning_rate": 0.00047220691086879643, "loss": 5.0839, "mean_token_accuracy": 0.19844681322574614, "num_tokens": 37093788.0, "step": 21390 }, { "entropy": 5.650668573379517, "epoch": 1.6646177786422873, "grad_norm": 1.1796875, "learning_rate": 0.0004721935657838245, "loss": 5.0384, "mean_token_accuracy": 0.20089267194271088, "num_tokens": 37101766.0, "step": 21395 }, { "entropy": 5.5776196956634525, "epoch": 1.665006808014005, "grad_norm": 1.140625, "learning_rate": 0.000472180217706754, "loss": 5.0346, "mean_token_accuracy": 0.19905794262886048, "num_tokens": 37110259.0, "step": 21400 }, { "entropy": 5.558304786682129, "epoch": 1.6653958373857227, "grad_norm": 1.1484375, "learning_rate": 0.0004721668666377876, "loss": 4.9982, "mean_token_accuracy": 0.19484549760818481, "num_tokens": 37118898.0, "step": 21405 }, { "entropy": 5.6726305961608885, "epoch": 1.6657848667574402, "grad_norm": 1.109375, "learning_rate": 0.00047215351257712783, "loss": 5.1709, "mean_token_accuracy": 0.1889210447669029, "num_tokens": 37128022.0, "step": 21410 }, { "entropy": 5.64467568397522, "epoch": 1.6661738961291577, "grad_norm": 1.140625, "learning_rate": 0.00047214015552497735, "loss": 5.0984, "mean_token_accuracy": 0.19312608391046523, "num_tokens": 37136415.0, "step": 21415 }, { "entropy": 5.598124980926514, "epoch": 1.6665629255008754, "grad_norm": 1.1328125, "learning_rate": 0.00047212679548153867, "loss": 5.069, "mean_token_accuracy": 0.19460731297731398, "num_tokens": 37144548.0, "step": 21420 }, { "entropy": 5.525355625152588, "epoch": 1.6669519548725928, "grad_norm": 1.0703125, "learning_rate": 0.00047211343244701475, "loss": 4.9369, "mean_token_accuracy": 0.20387574136257172, "num_tokens": 37153425.0, "step": 21425 }, { "entropy": 5.57338433265686, "epoch": 1.6673409842443103, "grad_norm": 1.0234375, "learning_rate": 0.0004721000664216081, "loss": 5.0691, "mean_token_accuracy": 0.19300612956285476, "num_tokens": 37162618.0, "step": 21430 }, { "entropy": 5.594841718673706, "epoch": 1.667730013616028, "grad_norm": 1.078125, "learning_rate": 0.0004720866974055219, "loss": 5.0371, "mean_token_accuracy": 0.19377586394548416, "num_tokens": 37171684.0, "step": 21435 }, { "entropy": 5.6655463695526125, "epoch": 1.6681190429877457, "grad_norm": 1.109375, "learning_rate": 0.0004720733253989585, "loss": 5.1226, "mean_token_accuracy": 0.19757217764854432, "num_tokens": 37180305.0, "step": 21440 }, { "entropy": 5.603850269317627, "epoch": 1.6685080723594632, "grad_norm": 1.0625, "learning_rate": 0.00047205995040212114, "loss": 4.998, "mean_token_accuracy": 0.21022711247205733, "num_tokens": 37189475.0, "step": 21445 }, { "entropy": 5.612037706375122, "epoch": 1.6688971017311807, "grad_norm": 1.2265625, "learning_rate": 0.0004720465724152127, "loss": 5.0133, "mean_token_accuracy": 0.20796894133090973, "num_tokens": 37197607.0, "step": 21450 }, { "entropy": 5.597958898544311, "epoch": 1.6692861311028984, "grad_norm": 1.1015625, "learning_rate": 0.00047203319143843613, "loss": 4.98, "mean_token_accuracy": 0.20287234634160994, "num_tokens": 37206767.0, "step": 21455 }, { "entropy": 5.681886768341064, "epoch": 1.6696751604746158, "grad_norm": 1.09375, "learning_rate": 0.0004720198074719946, "loss": 5.1747, "mean_token_accuracy": 0.19210042506456376, "num_tokens": 37216009.0, "step": 21460 }, { "entropy": 5.6130759716033936, "epoch": 1.6700641898463333, "grad_norm": 1.0625, "learning_rate": 0.00047200642051609094, "loss": 5.0747, "mean_token_accuracy": 0.20040407180786132, "num_tokens": 37225670.0, "step": 21465 }, { "entropy": 5.6227034568786625, "epoch": 1.670453219218051, "grad_norm": 1.09375, "learning_rate": 0.0004719930305709285, "loss": 5.0272, "mean_token_accuracy": 0.2009032756090164, "num_tokens": 37233399.0, "step": 21470 }, { "entropy": 5.5497785091400145, "epoch": 1.6708422485897685, "grad_norm": 1.0546875, "learning_rate": 0.00047197963763671033, "loss": 5.056, "mean_token_accuracy": 0.19735658466815947, "num_tokens": 37242592.0, "step": 21475 }, { "entropy": 5.620804262161255, "epoch": 1.671231277961486, "grad_norm": 1.2265625, "learning_rate": 0.0004719662417136397, "loss": 5.0926, "mean_token_accuracy": 0.19097328782081605, "num_tokens": 37250489.0, "step": 21480 }, { "entropy": 5.653549718856811, "epoch": 1.6716203073332037, "grad_norm": 1.1015625, "learning_rate": 0.00047195284280191987, "loss": 5.1622, "mean_token_accuracy": 0.19715687334537507, "num_tokens": 37259223.0, "step": 21485 }, { "entropy": 5.627438974380493, "epoch": 1.6720093367049214, "grad_norm": 1.0703125, "learning_rate": 0.0004719394409017541, "loss": 5.1338, "mean_token_accuracy": 0.1968739703297615, "num_tokens": 37269017.0, "step": 21490 }, { "entropy": 5.681085062026978, "epoch": 1.6723983660766388, "grad_norm": 1.1953125, "learning_rate": 0.00047192603601334585, "loss": 5.0123, "mean_token_accuracy": 0.19787476658821107, "num_tokens": 37277314.0, "step": 21495 }, { "entropy": 5.695496034622193, "epoch": 1.6727873954483563, "grad_norm": 1.0859375, "learning_rate": 0.00047191262813689835, "loss": 5.1404, "mean_token_accuracy": 0.19638393223285674, "num_tokens": 37285878.0, "step": 21500 }, { "entropy": 5.590741777420044, "epoch": 1.673176424820074, "grad_norm": 1.2109375, "learning_rate": 0.0004718992172726152, "loss": 5.024, "mean_token_accuracy": 0.19646441489458083, "num_tokens": 37294993.0, "step": 21505 }, { "entropy": 5.606803512573242, "epoch": 1.6735654541917915, "grad_norm": 1.0625, "learning_rate": 0.00047188580342069983, "loss": 5.0832, "mean_token_accuracy": 0.19628289639949797, "num_tokens": 37303934.0, "step": 21510 }, { "entropy": 5.553181743621826, "epoch": 1.673954483563509, "grad_norm": 1.0859375, "learning_rate": 0.0004718723865813557, "loss": 5.0748, "mean_token_accuracy": 0.19753180593252181, "num_tokens": 37312082.0, "step": 21515 }, { "entropy": 5.5780189514160154, "epoch": 1.6743435129352267, "grad_norm": 1.0859375, "learning_rate": 0.0004718589667547865, "loss": 5.0778, "mean_token_accuracy": 0.19303230047225953, "num_tokens": 37320702.0, "step": 21520 }, { "entropy": 5.669962310791016, "epoch": 1.6747325423069441, "grad_norm": 1.1796875, "learning_rate": 0.0004718455439411958, "loss": 5.0127, "mean_token_accuracy": 0.20167287439107895, "num_tokens": 37328929.0, "step": 21525 }, { "entropy": 5.59612889289856, "epoch": 1.6751215716786616, "grad_norm": 1.1171875, "learning_rate": 0.0004718321181407873, "loss": 4.9824, "mean_token_accuracy": 0.2020670935511589, "num_tokens": 37337239.0, "step": 21530 }, { "entropy": 5.504689407348633, "epoch": 1.6755106010503793, "grad_norm": 1.171875, "learning_rate": 0.0004718186893537647, "loss": 4.9047, "mean_token_accuracy": 0.2045491650700569, "num_tokens": 37345541.0, "step": 21535 }, { "entropy": 5.604449939727783, "epoch": 1.675899630422097, "grad_norm": 1.1796875, "learning_rate": 0.0004718052575803318, "loss": 5.1325, "mean_token_accuracy": 0.1910080134868622, "num_tokens": 37354095.0, "step": 21540 }, { "entropy": 5.690257596969604, "epoch": 1.6762886597938145, "grad_norm": 1.2734375, "learning_rate": 0.0004717918228206923, "loss": 5.1376, "mean_token_accuracy": 0.20061299204826355, "num_tokens": 37362822.0, "step": 21545 }, { "entropy": 5.735221862792969, "epoch": 1.676677689165532, "grad_norm": 1.171875, "learning_rate": 0.0004717783850750501, "loss": 5.1844, "mean_token_accuracy": 0.19224259555339812, "num_tokens": 37371452.0, "step": 21550 }, { "entropy": 5.620316839218139, "epoch": 1.6770667185372496, "grad_norm": 1.15625, "learning_rate": 0.0004717649443436091, "loss": 4.9657, "mean_token_accuracy": 0.19309251606464387, "num_tokens": 37379922.0, "step": 21555 }, { "entropy": 5.545872640609741, "epoch": 1.6774557479089671, "grad_norm": 1.1015625, "learning_rate": 0.00047175150062657336, "loss": 4.9808, "mean_token_accuracy": 0.19941299557685851, "num_tokens": 37388480.0, "step": 21560 }, { "entropy": 5.59928560256958, "epoch": 1.6778447772806846, "grad_norm": 1.265625, "learning_rate": 0.00047173805392414664, "loss": 5.067, "mean_token_accuracy": 0.2005523055791855, "num_tokens": 37397621.0, "step": 21565 }, { "entropy": 5.607751655578613, "epoch": 1.6782338066524023, "grad_norm": 1.15625, "learning_rate": 0.0004717246042365332, "loss": 5.031, "mean_token_accuracy": 0.19792662858963012, "num_tokens": 37405654.0, "step": 21570 }, { "entropy": 5.598772382736206, "epoch": 1.6786228360241198, "grad_norm": 1.078125, "learning_rate": 0.00047171115156393695, "loss": 5.1142, "mean_token_accuracy": 0.191181543469429, "num_tokens": 37414775.0, "step": 21575 }, { "entropy": 5.589687967300415, "epoch": 1.6790118653958372, "grad_norm": 1.1171875, "learning_rate": 0.00047169769590656207, "loss": 5.0201, "mean_token_accuracy": 0.2001945346593857, "num_tokens": 37422990.0, "step": 21580 }, { "entropy": 5.565493774414063, "epoch": 1.679400894767555, "grad_norm": 1.2109375, "learning_rate": 0.00047168423726461273, "loss": 5.0157, "mean_token_accuracy": 0.1983790934085846, "num_tokens": 37431164.0, "step": 21585 }, { "entropy": 5.62465763092041, "epoch": 1.6797899241392726, "grad_norm": 1.140625, "learning_rate": 0.0004716707756382931, "loss": 5.0763, "mean_token_accuracy": 0.19347990900278092, "num_tokens": 37439958.0, "step": 21590 }, { "entropy": 5.6375532150268555, "epoch": 1.6801789535109901, "grad_norm": 1.2265625, "learning_rate": 0.00047165731102780757, "loss": 5.0026, "mean_token_accuracy": 0.2031334638595581, "num_tokens": 37448381.0, "step": 21595 }, { "entropy": 5.627219009399414, "epoch": 1.6805679828827076, "grad_norm": 1.125, "learning_rate": 0.00047164384343336037, "loss": 5.0612, "mean_token_accuracy": 0.19322516024112701, "num_tokens": 37456705.0, "step": 21600 }, { "entropy": 5.566686058044434, "epoch": 1.6809570122544253, "grad_norm": 1.109375, "learning_rate": 0.00047163037285515583, "loss": 5.1222, "mean_token_accuracy": 0.1980556443333626, "num_tokens": 37466323.0, "step": 21605 }, { "entropy": 5.5563271045684814, "epoch": 1.6813460416261428, "grad_norm": 1.078125, "learning_rate": 0.0004716168992933982, "loss": 5.017, "mean_token_accuracy": 0.19530599564313889, "num_tokens": 37475570.0, "step": 21610 }, { "entropy": 5.600547122955322, "epoch": 1.6817350709978602, "grad_norm": 1.15625, "learning_rate": 0.00047160342274829234, "loss": 5.0258, "mean_token_accuracy": 0.20107959508895873, "num_tokens": 37484724.0, "step": 21615 }, { "entropy": 5.688745212554932, "epoch": 1.682124100369578, "grad_norm": 1.078125, "learning_rate": 0.00047158994322004223, "loss": 5.1899, "mean_token_accuracy": 0.18916524201631546, "num_tokens": 37493747.0, "step": 21620 }, { "entropy": 5.540155506134033, "epoch": 1.6825131297412956, "grad_norm": 1.1953125, "learning_rate": 0.0004715764607088527, "loss": 4.8598, "mean_token_accuracy": 0.21754775792360306, "num_tokens": 37501557.0, "step": 21625 }, { "entropy": 5.523472118377685, "epoch": 1.6829021591130129, "grad_norm": 1.1171875, "learning_rate": 0.0004715629752149283, "loss": 5.0345, "mean_token_accuracy": 0.19737348556518555, "num_tokens": 37510231.0, "step": 21630 }, { "entropy": 5.597281408309937, "epoch": 1.6832911884847306, "grad_norm": 1.2578125, "learning_rate": 0.00047154948673847356, "loss": 5.0623, "mean_token_accuracy": 0.20183728635311127, "num_tokens": 37518038.0, "step": 21635 }, { "entropy": 5.657252788543701, "epoch": 1.6836802178564483, "grad_norm": 1.09375, "learning_rate": 0.0004715359952796933, "loss": 5.17, "mean_token_accuracy": 0.18862509727478027, "num_tokens": 37527519.0, "step": 21640 }, { "entropy": 5.640777444839477, "epoch": 1.6840692472281658, "grad_norm": 1.0703125, "learning_rate": 0.00047152250083879203, "loss": 5.1277, "mean_token_accuracy": 0.19194298684597016, "num_tokens": 37536291.0, "step": 21645 }, { "entropy": 5.619144582748413, "epoch": 1.6844582765998832, "grad_norm": 1.1484375, "learning_rate": 0.00047150900341597464, "loss": 5.0259, "mean_token_accuracy": 0.20478426218032836, "num_tokens": 37544343.0, "step": 21650 }, { "entropy": 5.511697912216187, "epoch": 1.684847305971601, "grad_norm": 1.140625, "learning_rate": 0.0004714955030114459, "loss": 5.0453, "mean_token_accuracy": 0.2022662118077278, "num_tokens": 37552013.0, "step": 21655 }, { "entropy": 5.537133836746216, "epoch": 1.6852363353433184, "grad_norm": 1.0625, "learning_rate": 0.00047148199962541065, "loss": 5.056, "mean_token_accuracy": 0.19037532657384873, "num_tokens": 37561044.0, "step": 21660 }, { "entropy": 5.61952805519104, "epoch": 1.6856253647150359, "grad_norm": 1.203125, "learning_rate": 0.0004714684932580738, "loss": 5.083, "mean_token_accuracy": 0.19459929913282395, "num_tokens": 37569459.0, "step": 21665 }, { "entropy": 5.593795824050903, "epoch": 1.6860143940867536, "grad_norm": 1.0234375, "learning_rate": 0.0004714549839096403, "loss": 4.9696, "mean_token_accuracy": 0.201733823120594, "num_tokens": 37578488.0, "step": 21670 }, { "entropy": 5.514795207977295, "epoch": 1.6864034234584713, "grad_norm": 1.109375, "learning_rate": 0.00047144147158031507, "loss": 4.9351, "mean_token_accuracy": 0.2076156571507454, "num_tokens": 37586761.0, "step": 21675 }, { "entropy": 5.595983552932739, "epoch": 1.6867924528301885, "grad_norm": 1.1640625, "learning_rate": 0.0004714279562703032, "loss": 5.0748, "mean_token_accuracy": 0.1959920972585678, "num_tokens": 37595267.0, "step": 21680 }, { "entropy": 5.585158729553223, "epoch": 1.6871814822019062, "grad_norm": 1.09375, "learning_rate": 0.0004714144379798098, "loss": 5.0014, "mean_token_accuracy": 0.2055351570248604, "num_tokens": 37603271.0, "step": 21685 }, { "entropy": 5.565847778320313, "epoch": 1.687570511573624, "grad_norm": 1.109375, "learning_rate": 0.00047140091670903986, "loss": 5.0816, "mean_token_accuracy": 0.19494160562753676, "num_tokens": 37611152.0, "step": 21690 }, { "entropy": 5.5498144149780275, "epoch": 1.6879595409453414, "grad_norm": 1.09375, "learning_rate": 0.00047138739245819857, "loss": 4.9834, "mean_token_accuracy": 0.20409328788518905, "num_tokens": 37619465.0, "step": 21695 }, { "entropy": 5.662761068344116, "epoch": 1.6883485703170589, "grad_norm": 1.1484375, "learning_rate": 0.00047137386522749124, "loss": 5.1824, "mean_token_accuracy": 0.1841244637966156, "num_tokens": 37628588.0, "step": 21700 }, { "entropy": 5.612898445129394, "epoch": 1.6887375996887766, "grad_norm": 1.0703125, "learning_rate": 0.0004713603350171231, "loss": 5.0797, "mean_token_accuracy": 0.20128399431705474, "num_tokens": 37638062.0, "step": 21705 }, { "entropy": 5.667411613464355, "epoch": 1.689126629060494, "grad_norm": 1.1796875, "learning_rate": 0.00047134680182729926, "loss": 5.0181, "mean_token_accuracy": 0.19881925582885743, "num_tokens": 37646968.0, "step": 21710 }, { "entropy": 5.675249099731445, "epoch": 1.6895156584322115, "grad_norm": 1.0390625, "learning_rate": 0.0004713332656582254, "loss": 5.0969, "mean_token_accuracy": 0.19076040685176848, "num_tokens": 37655893.0, "step": 21715 }, { "entropy": 5.6023155689239506, "epoch": 1.6899046878039292, "grad_norm": 1.0078125, "learning_rate": 0.0004713197265101066, "loss": 5.012, "mean_token_accuracy": 0.20391858518123626, "num_tokens": 37664638.0, "step": 21720 }, { "entropy": 5.555707502365112, "epoch": 1.690293717175647, "grad_norm": 1.0625, "learning_rate": 0.00047130618438314856, "loss": 5.0214, "mean_token_accuracy": 0.19854926615953444, "num_tokens": 37673582.0, "step": 21725 }, { "entropy": 5.6125373363494875, "epoch": 1.6906827465473642, "grad_norm": 1.1015625, "learning_rate": 0.0004712926392775565, "loss": 5.0863, "mean_token_accuracy": 0.1962234228849411, "num_tokens": 37682310.0, "step": 21730 }, { "entropy": 5.539216995239258, "epoch": 1.6910717759190819, "grad_norm": 1.1796875, "learning_rate": 0.0004712790911935362, "loss": 4.9873, "mean_token_accuracy": 0.20257582813501357, "num_tokens": 37690476.0, "step": 21735 }, { "entropy": 5.561210060119629, "epoch": 1.6914608052907996, "grad_norm": 1.1953125, "learning_rate": 0.000471265540131293, "loss": 5.0034, "mean_token_accuracy": 0.20281372219324112, "num_tokens": 37698965.0, "step": 21740 }, { "entropy": 5.6243896484375, "epoch": 1.691849834662517, "grad_norm": 1.1484375, "learning_rate": 0.00047125198609103267, "loss": 5.0936, "mean_token_accuracy": 0.20186861902475356, "num_tokens": 37707499.0, "step": 21745 }, { "entropy": 5.570200109481812, "epoch": 1.6922388640342345, "grad_norm": 1.125, "learning_rate": 0.0004712384290729607, "loss": 5.0375, "mean_token_accuracy": 0.19135928601026536, "num_tokens": 37716686.0, "step": 21750 }, { "entropy": 5.584670305252075, "epoch": 1.6926278934059522, "grad_norm": 1.109375, "learning_rate": 0.000471224869077283, "loss": 5.0814, "mean_token_accuracy": 0.19294968694448472, "num_tokens": 37725607.0, "step": 21755 }, { "entropy": 5.613400983810425, "epoch": 1.6930169227776697, "grad_norm": 1.1015625, "learning_rate": 0.00047121130610420527, "loss": 5.0243, "mean_token_accuracy": 0.20611340254545213, "num_tokens": 37734103.0, "step": 21760 }, { "entropy": 5.656982660293579, "epoch": 1.6934059521493872, "grad_norm": 1.1640625, "learning_rate": 0.00047119774015393323, "loss": 5.077, "mean_token_accuracy": 0.19648510366678237, "num_tokens": 37743078.0, "step": 21765 }, { "entropy": 5.56747407913208, "epoch": 1.6937949815211049, "grad_norm": 1.1484375, "learning_rate": 0.00047118417122667285, "loss": 4.9029, "mean_token_accuracy": 0.2093929097056389, "num_tokens": 37751550.0, "step": 21770 }, { "entropy": 5.628477954864502, "epoch": 1.6941840108928226, "grad_norm": 1.140625, "learning_rate": 0.0004711705993226298, "loss": 5.0711, "mean_token_accuracy": 0.19530853778123855, "num_tokens": 37759940.0, "step": 21775 }, { "entropy": 5.641937875747681, "epoch": 1.6945730402645398, "grad_norm": 1.1640625, "learning_rate": 0.0004711570244420102, "loss": 5.103, "mean_token_accuracy": 0.1924607828259468, "num_tokens": 37769191.0, "step": 21780 }, { "entropy": 5.511842393875122, "epoch": 1.6949620696362575, "grad_norm": 1.171875, "learning_rate": 0.0004711434465850199, "loss": 4.8949, "mean_token_accuracy": 0.21043619960546495, "num_tokens": 37777612.0, "step": 21785 }, { "entropy": 5.500446844100952, "epoch": 1.6953510990079752, "grad_norm": 1.15625, "learning_rate": 0.0004711298657518651, "loss": 5.0267, "mean_token_accuracy": 0.1994296759366989, "num_tokens": 37785963.0, "step": 21790 }, { "entropy": 5.539422512054443, "epoch": 1.6957401283796927, "grad_norm": 1.1484375, "learning_rate": 0.0004711162819427518, "loss": 4.9771, "mean_token_accuracy": 0.20120040327310562, "num_tokens": 37795546.0, "step": 21795 }, { "entropy": 5.651784181594849, "epoch": 1.6961291577514102, "grad_norm": 1.1328125, "learning_rate": 0.000471102695157886, "loss": 5.1738, "mean_token_accuracy": 0.189884053170681, "num_tokens": 37803955.0, "step": 21800 }, { "entropy": 5.588523626327515, "epoch": 1.6965181871231279, "grad_norm": 1.125, "learning_rate": 0.0004710891053974739, "loss": 5.0459, "mean_token_accuracy": 0.20582387149333953, "num_tokens": 37812659.0, "step": 21805 }, { "entropy": 5.577352476119995, "epoch": 1.6969072164948453, "grad_norm": 1.1328125, "learning_rate": 0.0004710755126617217, "loss": 5.0038, "mean_token_accuracy": 0.20160599648952485, "num_tokens": 37821064.0, "step": 21810 }, { "entropy": 5.659938669204712, "epoch": 1.6972962458665628, "grad_norm": 1.0859375, "learning_rate": 0.0004710619169508358, "loss": 5.1884, "mean_token_accuracy": 0.18609914034605027, "num_tokens": 37830353.0, "step": 21815 }, { "entropy": 5.611560869216919, "epoch": 1.6976852752382805, "grad_norm": 1.125, "learning_rate": 0.0004710483182650223, "loss": 5.1246, "mean_token_accuracy": 0.19963879883289337, "num_tokens": 37838927.0, "step": 21820 }, { "entropy": 5.545606517791748, "epoch": 1.6980743046099982, "grad_norm": 1.171875, "learning_rate": 0.00047103471660448767, "loss": 4.9917, "mean_token_accuracy": 0.2035693809390068, "num_tokens": 37847845.0, "step": 21825 }, { "entropy": 5.616822719573975, "epoch": 1.6984633339817157, "grad_norm": 1.1875, "learning_rate": 0.00047102111196943813, "loss": 5.0393, "mean_token_accuracy": 0.19011109918355942, "num_tokens": 37856065.0, "step": 21830 }, { "entropy": 5.5641180038452145, "epoch": 1.6988523633534331, "grad_norm": 1.09375, "learning_rate": 0.00047100750436008035, "loss": 5.0099, "mean_token_accuracy": 0.1980397328734398, "num_tokens": 37865262.0, "step": 21835 }, { "entropy": 5.539391803741455, "epoch": 1.6992413927251508, "grad_norm": 1.171875, "learning_rate": 0.00047099389377662054, "loss": 5.0108, "mean_token_accuracy": 0.20115655809640884, "num_tokens": 37873994.0, "step": 21840 }, { "entropy": 5.597001647949218, "epoch": 1.6996304220968683, "grad_norm": 1.1640625, "learning_rate": 0.0004709802802192654, "loss": 5.0656, "mean_token_accuracy": 0.19346749633550644, "num_tokens": 37882377.0, "step": 21845 }, { "entropy": 5.574456024169922, "epoch": 1.7000194514685858, "grad_norm": 1.046875, "learning_rate": 0.00047096666368822153, "loss": 4.9477, "mean_token_accuracy": 0.2068011835217476, "num_tokens": 37890793.0, "step": 21850 }, { "entropy": 5.584441995620727, "epoch": 1.7004084808403035, "grad_norm": 1.1796875, "learning_rate": 0.00047095304418369536, "loss": 5.0472, "mean_token_accuracy": 0.20109118521213531, "num_tokens": 37899464.0, "step": 21855 }, { "entropy": 5.552498531341553, "epoch": 1.700797510212021, "grad_norm": 1.109375, "learning_rate": 0.0004709394217058936, "loss": 5.0618, "mean_token_accuracy": 0.195765483379364, "num_tokens": 37907959.0, "step": 21860 }, { "entropy": 5.630438375473022, "epoch": 1.7011865395837384, "grad_norm": 1.125, "learning_rate": 0.0004709257962550231, "loss": 5.0744, "mean_token_accuracy": 0.19461337178945542, "num_tokens": 37916751.0, "step": 21865 }, { "entropy": 5.576208543777466, "epoch": 1.7015755689554561, "grad_norm": 1.0625, "learning_rate": 0.00047091216783129035, "loss": 5.0264, "mean_token_accuracy": 0.20160162448883057, "num_tokens": 37925538.0, "step": 21870 }, { "entropy": 5.577460813522339, "epoch": 1.7019645983271738, "grad_norm": 1.1328125, "learning_rate": 0.0004708985364349024, "loss": 5.0368, "mean_token_accuracy": 0.21036584973335265, "num_tokens": 37933770.0, "step": 21875 }, { "entropy": 5.606276893615723, "epoch": 1.7023536276988913, "grad_norm": 1.015625, "learning_rate": 0.00047088490206606586, "loss": 5.1114, "mean_token_accuracy": 0.1932048887014389, "num_tokens": 37943006.0, "step": 21880 }, { "entropy": 5.647562026977539, "epoch": 1.7027426570706088, "grad_norm": 1.1015625, "learning_rate": 0.00047087126472498785, "loss": 5.1559, "mean_token_accuracy": 0.19053927958011627, "num_tokens": 37951775.0, "step": 21885 }, { "entropy": 5.630889272689819, "epoch": 1.7031316864423265, "grad_norm": 1.1171875, "learning_rate": 0.000470857624411875, "loss": 5.0831, "mean_token_accuracy": 0.19639912247657776, "num_tokens": 37960301.0, "step": 21890 }, { "entropy": 5.5995525360107425, "epoch": 1.703520715814044, "grad_norm": 1.203125, "learning_rate": 0.00047084398112693456, "loss": 5.0686, "mean_token_accuracy": 0.20101989358663558, "num_tokens": 37969338.0, "step": 21895 }, { "entropy": 5.624325752258301, "epoch": 1.7039097451857614, "grad_norm": 1.09375, "learning_rate": 0.0004708303348703734, "loss": 5.1007, "mean_token_accuracy": 0.1889639377593994, "num_tokens": 37978114.0, "step": 21900 }, { "entropy": 5.680545282363892, "epoch": 1.7042987745574791, "grad_norm": 1.1953125, "learning_rate": 0.0004708166856423986, "loss": 5.115, "mean_token_accuracy": 0.19899093359708786, "num_tokens": 37986581.0, "step": 21905 }, { "entropy": 5.660883092880249, "epoch": 1.7046878039291966, "grad_norm": 1.1328125, "learning_rate": 0.00047080303344321727, "loss": 5.1037, "mean_token_accuracy": 0.1942038953304291, "num_tokens": 37995021.0, "step": 21910 }, { "entropy": 5.527478551864624, "epoch": 1.705076833300914, "grad_norm": 1.1484375, "learning_rate": 0.00047078937827303653, "loss": 4.9583, "mean_token_accuracy": 0.19997209757566453, "num_tokens": 38003240.0, "step": 21915 }, { "entropy": 5.58984146118164, "epoch": 1.7054658626726318, "grad_norm": 1.2109375, "learning_rate": 0.0004707757201320636, "loss": 5.0595, "mean_token_accuracy": 0.1986893370747566, "num_tokens": 38011416.0, "step": 21920 }, { "entropy": 5.5585814952850345, "epoch": 1.7058548920443495, "grad_norm": 1.0859375, "learning_rate": 0.00047076205902050577, "loss": 5.0494, "mean_token_accuracy": 0.2004631295800209, "num_tokens": 38020112.0, "step": 21925 }, { "entropy": 5.6159271717071535, "epoch": 1.706243921416067, "grad_norm": 1.109375, "learning_rate": 0.00047074839493857024, "loss": 5.1572, "mean_token_accuracy": 0.19398657977581024, "num_tokens": 38028935.0, "step": 21930 }, { "entropy": 5.556846761703492, "epoch": 1.7066329507877844, "grad_norm": 1.1171875, "learning_rate": 0.0004707347278864644, "loss": 5.0372, "mean_token_accuracy": 0.19305555522441864, "num_tokens": 38037618.0, "step": 21935 }, { "entropy": 5.520416879653931, "epoch": 1.7070219801595021, "grad_norm": 1.1015625, "learning_rate": 0.00047072105786439563, "loss": 5.0323, "mean_token_accuracy": 0.2003830000758171, "num_tokens": 38046853.0, "step": 21940 }, { "entropy": 5.625412464141846, "epoch": 1.7074110095312196, "grad_norm": 1.15625, "learning_rate": 0.00047070738487257137, "loss": 5.0349, "mean_token_accuracy": 0.20008161962032317, "num_tokens": 38056220.0, "step": 21945 }, { "entropy": 5.66451587677002, "epoch": 1.707800038902937, "grad_norm": 1.171875, "learning_rate": 0.00047069370891119895, "loss": 5.1694, "mean_token_accuracy": 0.19449239671230317, "num_tokens": 38064664.0, "step": 21950 }, { "entropy": 5.6162878513336185, "epoch": 1.7081890682746548, "grad_norm": 1.1171875, "learning_rate": 0.000470680029980486, "loss": 5.1353, "mean_token_accuracy": 0.18884495198726653, "num_tokens": 38072963.0, "step": 21955 }, { "entropy": 5.556479215621948, "epoch": 1.7085780976463723, "grad_norm": 1.0546875, "learning_rate": 0.00047066634808064006, "loss": 5.036, "mean_token_accuracy": 0.20238221883773805, "num_tokens": 38082320.0, "step": 21960 }, { "entropy": 5.580231142044068, "epoch": 1.7089671270180897, "grad_norm": 1.21875, "learning_rate": 0.00047065266321186873, "loss": 4.9288, "mean_token_accuracy": 0.20718733817338944, "num_tokens": 38091188.0, "step": 21965 }, { "entropy": 5.565281105041504, "epoch": 1.7093561563898074, "grad_norm": 1.1484375, "learning_rate": 0.0004706389753743797, "loss": 5.0556, "mean_token_accuracy": 0.19353399723768233, "num_tokens": 38099584.0, "step": 21970 }, { "entropy": 5.524546766281128, "epoch": 1.7097451857615251, "grad_norm": 1.125, "learning_rate": 0.0004706252845683805, "loss": 4.9645, "mean_token_accuracy": 0.20108680576086044, "num_tokens": 38108437.0, "step": 21975 }, { "entropy": 5.4553478240966795, "epoch": 1.7101342151332426, "grad_norm": 1.1171875, "learning_rate": 0.00047061159079407903, "loss": 4.9222, "mean_token_accuracy": 0.20326072871685028, "num_tokens": 38116822.0, "step": 21980 }, { "entropy": 5.604338073730469, "epoch": 1.71052324450496, "grad_norm": 1.1171875, "learning_rate": 0.000470597894051683, "loss": 5.1576, "mean_token_accuracy": 0.19169563949108123, "num_tokens": 38125800.0, "step": 21985 }, { "entropy": 5.577329444885254, "epoch": 1.7109122738766778, "grad_norm": 1.171875, "learning_rate": 0.0004705841943414003, "loss": 4.9233, "mean_token_accuracy": 0.2043044835329056, "num_tokens": 38134181.0, "step": 21990 }, { "entropy": 5.586867475509644, "epoch": 1.7113013032483952, "grad_norm": 1.1171875, "learning_rate": 0.00047057049166343876, "loss": 5.0472, "mean_token_accuracy": 0.1978023409843445, "num_tokens": 38142820.0, "step": 21995 }, { "entropy": 5.525862503051758, "epoch": 1.7116903326201127, "grad_norm": 1.1328125, "learning_rate": 0.00047055678601800623, "loss": 4.9866, "mean_token_accuracy": 0.20009258836507798, "num_tokens": 38150571.0, "step": 22000 }, { "entropy": 5.63078465461731, "epoch": 1.7120793619918304, "grad_norm": 1.109375, "learning_rate": 0.00047054307740531076, "loss": 5.1136, "mean_token_accuracy": 0.1940620943903923, "num_tokens": 38159308.0, "step": 22005 }, { "entropy": 5.577589082717895, "epoch": 1.712468391363548, "grad_norm": 1.0625, "learning_rate": 0.00047052936582556035, "loss": 5.007, "mean_token_accuracy": 0.20213858932256698, "num_tokens": 38167377.0, "step": 22010 }, { "entropy": 5.539031171798706, "epoch": 1.7128574207352654, "grad_norm": 1.1484375, "learning_rate": 0.00047051565127896307, "loss": 4.9472, "mean_token_accuracy": 0.19885500520467758, "num_tokens": 38175381.0, "step": 22015 }, { "entropy": 5.525089693069458, "epoch": 1.713246450106983, "grad_norm": 1.125, "learning_rate": 0.00047050193376572686, "loss": 4.9896, "mean_token_accuracy": 0.2042197361588478, "num_tokens": 38183821.0, "step": 22020 }, { "entropy": 5.55885763168335, "epoch": 1.7136354794787008, "grad_norm": 1.1484375, "learning_rate": 0.00047048821328606, "loss": 5.0451, "mean_token_accuracy": 0.19958675801753997, "num_tokens": 38192181.0, "step": 22025 }, { "entropy": 5.563112688064575, "epoch": 1.7140245088504182, "grad_norm": 1.1015625, "learning_rate": 0.0004704744898401708, "loss": 5.0534, "mean_token_accuracy": 0.19329515546560289, "num_tokens": 38200703.0, "step": 22030 }, { "entropy": 5.527504968643188, "epoch": 1.7144135382221357, "grad_norm": 1.1484375, "learning_rate": 0.0004704607634282672, "loss": 4.9223, "mean_token_accuracy": 0.2062011644244194, "num_tokens": 38209398.0, "step": 22035 }, { "entropy": 5.545182514190674, "epoch": 1.7148025675938534, "grad_norm": 1.09375, "learning_rate": 0.00047044703405055765, "loss": 4.984, "mean_token_accuracy": 0.20379881113767623, "num_tokens": 38217648.0, "step": 22040 }, { "entropy": 5.5601002216339115, "epoch": 1.7151915969655709, "grad_norm": 1.1640625, "learning_rate": 0.00047043330170725046, "loss": 5.0019, "mean_token_accuracy": 0.20455377250909806, "num_tokens": 38226113.0, "step": 22045 }, { "entropy": 5.5248548030853275, "epoch": 1.7155806263372884, "grad_norm": 1.0859375, "learning_rate": 0.00047041956639855406, "loss": 5.0006, "mean_token_accuracy": 0.1983527734875679, "num_tokens": 38234567.0, "step": 22050 }, { "entropy": 5.621897554397583, "epoch": 1.715969655709006, "grad_norm": 1.09375, "learning_rate": 0.0004704058281246766, "loss": 5.1779, "mean_token_accuracy": 0.19026656150817872, "num_tokens": 38243477.0, "step": 22055 }, { "entropy": 5.58515772819519, "epoch": 1.7163586850807238, "grad_norm": 1.0390625, "learning_rate": 0.0004703920868858268, "loss": 5.04, "mean_token_accuracy": 0.2020384907722473, "num_tokens": 38252008.0, "step": 22060 }, { "entropy": 5.58301043510437, "epoch": 1.716747714452441, "grad_norm": 1.125, "learning_rate": 0.00047037834268221315, "loss": 5.0508, "mean_token_accuracy": 0.19466104507446289, "num_tokens": 38260586.0, "step": 22065 }, { "entropy": 5.567405462265015, "epoch": 1.7171367438241587, "grad_norm": 1.0625, "learning_rate": 0.0004703645955140441, "loss": 5.1095, "mean_token_accuracy": 0.1923338919878006, "num_tokens": 38268970.0, "step": 22070 }, { "entropy": 5.621124935150147, "epoch": 1.7175257731958764, "grad_norm": 1.0703125, "learning_rate": 0.00047035084538152815, "loss": 5.0089, "mean_token_accuracy": 0.20104631632566453, "num_tokens": 38277633.0, "step": 22075 }, { "entropy": 5.555356025695801, "epoch": 1.7179148025675939, "grad_norm": 1.171875, "learning_rate": 0.0004703370922848742, "loss": 5.0344, "mean_token_accuracy": 0.20047130435705185, "num_tokens": 38286122.0, "step": 22080 }, { "entropy": 5.573940849304199, "epoch": 1.7183038319393114, "grad_norm": 1.15625, "learning_rate": 0.00047032333622429074, "loss": 5.0725, "mean_token_accuracy": 0.1988450363278389, "num_tokens": 38294060.0, "step": 22085 }, { "entropy": 5.55256667137146, "epoch": 1.718692861311029, "grad_norm": 1.09375, "learning_rate": 0.00047030957719998656, "loss": 5.0131, "mean_token_accuracy": 0.20489340275526047, "num_tokens": 38303446.0, "step": 22090 }, { "entropy": 5.586187505722046, "epoch": 1.7190818906827465, "grad_norm": 1.1484375, "learning_rate": 0.0004702958152121704, "loss": 4.9991, "mean_token_accuracy": 0.1966421827673912, "num_tokens": 38311995.0, "step": 22095 }, { "entropy": 5.4701214790344235, "epoch": 1.719470920054464, "grad_norm": 1.140625, "learning_rate": 0.0004702820502610511, "loss": 4.9408, "mean_token_accuracy": 0.19998539686203004, "num_tokens": 38320132.0, "step": 22100 }, { "entropy": 5.590481519699097, "epoch": 1.7198599494261817, "grad_norm": 1.0859375, "learning_rate": 0.0004702682823468375, "loss": 5.0309, "mean_token_accuracy": 0.19736093729734422, "num_tokens": 38328852.0, "step": 22105 }, { "entropy": 5.6275592803955075, "epoch": 1.7202489787978994, "grad_norm": 1.1640625, "learning_rate": 0.00047025451146973844, "loss": 5.0483, "mean_token_accuracy": 0.19381460249423982, "num_tokens": 38338142.0, "step": 22110 }, { "entropy": 5.595482015609742, "epoch": 1.7206380081696167, "grad_norm": 1.203125, "learning_rate": 0.00047024073762996305, "loss": 5.0402, "mean_token_accuracy": 0.19861653000116347, "num_tokens": 38346522.0, "step": 22115 }, { "entropy": 5.576451635360717, "epoch": 1.7210270375413343, "grad_norm": 1.078125, "learning_rate": 0.0004702269608277202, "loss": 5.054, "mean_token_accuracy": 0.20477451533079147, "num_tokens": 38355203.0, "step": 22120 }, { "entropy": 5.5563994407653805, "epoch": 1.721416066913052, "grad_norm": 1.125, "learning_rate": 0.0004702131810632189, "loss": 4.9947, "mean_token_accuracy": 0.19546187222003936, "num_tokens": 38363657.0, "step": 22125 }, { "entropy": 5.520972013473511, "epoch": 1.7218050962847695, "grad_norm": 1.0546875, "learning_rate": 0.00047019939833666837, "loss": 5.0162, "mean_token_accuracy": 0.19898925572633744, "num_tokens": 38372893.0, "step": 22130 }, { "entropy": 5.528195381164551, "epoch": 1.722194125656487, "grad_norm": 1.0859375, "learning_rate": 0.0004701856126482776, "loss": 4.994, "mean_token_accuracy": 0.2053616926074028, "num_tokens": 38381856.0, "step": 22135 }, { "entropy": 5.664301776885987, "epoch": 1.7225831550282047, "grad_norm": 1.0390625, "learning_rate": 0.0004701718239982559, "loss": 5.0886, "mean_token_accuracy": 0.18955252170562745, "num_tokens": 38390616.0, "step": 22140 }, { "entropy": 5.684468460083008, "epoch": 1.7229721843999222, "grad_norm": 1.2109375, "learning_rate": 0.00047015803238681234, "loss": 5.1443, "mean_token_accuracy": 0.1896022826433182, "num_tokens": 38399024.0, "step": 22145 }, { "entropy": 5.58506588935852, "epoch": 1.7233612137716396, "grad_norm": 1.1328125, "learning_rate": 0.0004701442378141563, "loss": 5.0031, "mean_token_accuracy": 0.20057838410139084, "num_tokens": 38407605.0, "step": 22150 }, { "entropy": 5.640168333053589, "epoch": 1.7237502431433573, "grad_norm": 1.1640625, "learning_rate": 0.000470130440280497, "loss": 5.1008, "mean_token_accuracy": 0.19637431502342223, "num_tokens": 38417228.0, "step": 22155 }, { "entropy": 5.653040266036987, "epoch": 1.724139272515075, "grad_norm": 1.2265625, "learning_rate": 0.0004701166397860439, "loss": 5.1071, "mean_token_accuracy": 0.18920597583055496, "num_tokens": 38425704.0, "step": 22160 }, { "entropy": 5.616227054595948, "epoch": 1.7245283018867923, "grad_norm": 1.171875, "learning_rate": 0.0004701028363310064, "loss": 5.0827, "mean_token_accuracy": 0.19233149737119676, "num_tokens": 38434143.0, "step": 22165 }, { "entropy": 5.637010192871093, "epoch": 1.72491733125851, "grad_norm": 1.109375, "learning_rate": 0.00047008902991559385, "loss": 5.0693, "mean_token_accuracy": 0.2015240713953972, "num_tokens": 38443708.0, "step": 22170 }, { "entropy": 5.613686370849609, "epoch": 1.7253063606302277, "grad_norm": 1.1328125, "learning_rate": 0.0004700752205400158, "loss": 5.0284, "mean_token_accuracy": 0.198075008392334, "num_tokens": 38452399.0, "step": 22175 }, { "entropy": 5.598971176147461, "epoch": 1.7256953900019452, "grad_norm": 1.15625, "learning_rate": 0.00047006140820448174, "loss": 5.043, "mean_token_accuracy": 0.1971168801188469, "num_tokens": 38460411.0, "step": 22180 }, { "entropy": 5.600412034988404, "epoch": 1.7260844193736626, "grad_norm": 1.15625, "learning_rate": 0.00047004759290920136, "loss": 5.0268, "mean_token_accuracy": 0.19836550056934357, "num_tokens": 38468542.0, "step": 22185 }, { "entropy": 5.567818975448608, "epoch": 1.7264734487453803, "grad_norm": 1.171875, "learning_rate": 0.0004700337746543841, "loss": 5.0138, "mean_token_accuracy": 0.1999722346663475, "num_tokens": 38477027.0, "step": 22190 }, { "entropy": 5.5693676471710205, "epoch": 1.7268624781170978, "grad_norm": 1.0625, "learning_rate": 0.0004700199534402398, "loss": 5.0196, "mean_token_accuracy": 0.19828347563743592, "num_tokens": 38485853.0, "step": 22195 }, { "entropy": 5.553265142440796, "epoch": 1.7272515074888153, "grad_norm": 1.109375, "learning_rate": 0.0004700061292669781, "loss": 5.051, "mean_token_accuracy": 0.20213208943605424, "num_tokens": 38494177.0, "step": 22200 }, { "entropy": 5.601232814788818, "epoch": 1.727640536860533, "grad_norm": 1.0078125, "learning_rate": 0.0004699923021348088, "loss": 5.0542, "mean_token_accuracy": 0.1949697732925415, "num_tokens": 38503313.0, "step": 22205 }, { "entropy": 5.66887731552124, "epoch": 1.7280295662322507, "grad_norm": 1.109375, "learning_rate": 0.00046997847204394166, "loss": 5.2177, "mean_token_accuracy": 0.18958215713500975, "num_tokens": 38511950.0, "step": 22210 }, { "entropy": 5.694172620773315, "epoch": 1.728418595603968, "grad_norm": 1.1171875, "learning_rate": 0.00046996463899458653, "loss": 5.1832, "mean_token_accuracy": 0.18583601713180542, "num_tokens": 38521331.0, "step": 22215 }, { "entropy": 5.533796930313111, "epoch": 1.7288076249756856, "grad_norm": 1.09375, "learning_rate": 0.0004699508029869533, "loss": 5.0162, "mean_token_accuracy": 0.19839344173669815, "num_tokens": 38529709.0, "step": 22220 }, { "entropy": 5.501419162750244, "epoch": 1.7291966543474033, "grad_norm": 1.1015625, "learning_rate": 0.00046993696402125205, "loss": 5.0819, "mean_token_accuracy": 0.20062572956085206, "num_tokens": 38538083.0, "step": 22225 }, { "entropy": 5.545303678512573, "epoch": 1.7295856837191208, "grad_norm": 1.0859375, "learning_rate": 0.0004699231220976925, "loss": 5.0518, "mean_token_accuracy": 0.2004787653684616, "num_tokens": 38547282.0, "step": 22230 }, { "entropy": 5.6089537143707275, "epoch": 1.7299747130908383, "grad_norm": 1.1796875, "learning_rate": 0.0004699092772164849, "loss": 5.038, "mean_token_accuracy": 0.1952192783355713, "num_tokens": 38555674.0, "step": 22235 }, { "entropy": 5.649447393417359, "epoch": 1.730363742462556, "grad_norm": 1.078125, "learning_rate": 0.0004698954293778392, "loss": 5.0555, "mean_token_accuracy": 0.1972043439745903, "num_tokens": 38564066.0, "step": 22240 }, { "entropy": 5.60773777961731, "epoch": 1.7307527718342735, "grad_norm": 1.0703125, "learning_rate": 0.00046988157858196555, "loss": 5.0867, "mean_token_accuracy": 0.19835591465234756, "num_tokens": 38573299.0, "step": 22245 }, { "entropy": 5.574977159500122, "epoch": 1.731141801205991, "grad_norm": 1.1796875, "learning_rate": 0.00046986772482907426, "loss": 5.0241, "mean_token_accuracy": 0.19898533076047897, "num_tokens": 38581565.0, "step": 22250 }, { "entropy": 5.59044041633606, "epoch": 1.7315308305777086, "grad_norm": 1.2265625, "learning_rate": 0.0004698538681193754, "loss": 5.0182, "mean_token_accuracy": 0.1994437500834465, "num_tokens": 38590192.0, "step": 22255 }, { "entropy": 5.560927104949951, "epoch": 1.7319198599494263, "grad_norm": 1.078125, "learning_rate": 0.00046984000845307907, "loss": 5.0449, "mean_token_accuracy": 0.1957292824983597, "num_tokens": 38599670.0, "step": 22260 }, { "entropy": 5.576747894287109, "epoch": 1.7323088893211438, "grad_norm": 1.140625, "learning_rate": 0.00046982614583039584, "loss": 4.9799, "mean_token_accuracy": 0.20853608548641206, "num_tokens": 38608432.0, "step": 22265 }, { "entropy": 5.654170179367066, "epoch": 1.7326979186928613, "grad_norm": 1.1328125, "learning_rate": 0.0004698122802515359, "loss": 5.032, "mean_token_accuracy": 0.20013358443975449, "num_tokens": 38617359.0, "step": 22270 }, { "entropy": 5.571622276306153, "epoch": 1.733086948064579, "grad_norm": 1.0625, "learning_rate": 0.0004697984117167097, "loss": 4.9969, "mean_token_accuracy": 0.19949166476726532, "num_tokens": 38626220.0, "step": 22275 }, { "entropy": 5.652535915374756, "epoch": 1.7334759774362964, "grad_norm": 1.140625, "learning_rate": 0.00046978454022612767, "loss": 5.0908, "mean_token_accuracy": 0.20276451855897903, "num_tokens": 38635441.0, "step": 22280 }, { "entropy": 5.57275619506836, "epoch": 1.733865006808014, "grad_norm": 1.09375, "learning_rate": 0.00046977066578000025, "loss": 4.9895, "mean_token_accuracy": 0.2012002944946289, "num_tokens": 38643948.0, "step": 22285 }, { "entropy": 5.568630933761597, "epoch": 1.7342540361797316, "grad_norm": 1.171875, "learning_rate": 0.00046975678837853806, "loss": 5.1181, "mean_token_accuracy": 0.19392989873886107, "num_tokens": 38652755.0, "step": 22290 }, { "entropy": 5.526766681671143, "epoch": 1.734643065551449, "grad_norm": 1.140625, "learning_rate": 0.00046974290802195156, "loss": 4.9002, "mean_token_accuracy": 0.21727294921875, "num_tokens": 38661020.0, "step": 22295 }, { "entropy": 5.678378868103027, "epoch": 1.7350320949231666, "grad_norm": 1.0078125, "learning_rate": 0.0004697290247104513, "loss": 5.1318, "mean_token_accuracy": 0.19324184358119964, "num_tokens": 38669628.0, "step": 22300 }, { "entropy": 5.612584018707276, "epoch": 1.7354211242948843, "grad_norm": 1.1015625, "learning_rate": 0.00046971513844424814, "loss": 5.0817, "mean_token_accuracy": 0.19404597133398055, "num_tokens": 38678861.0, "step": 22305 }, { "entropy": 5.60569314956665, "epoch": 1.735810153666602, "grad_norm": 1.1171875, "learning_rate": 0.00046970124922355265, "loss": 5.0166, "mean_token_accuracy": 0.20246932357549668, "num_tokens": 38688088.0, "step": 22310 }, { "entropy": 5.587804698944092, "epoch": 1.7361991830383194, "grad_norm": 1.140625, "learning_rate": 0.0004696873570485756, "loss": 5.0325, "mean_token_accuracy": 0.19735390245914458, "num_tokens": 38697226.0, "step": 22315 }, { "entropy": 5.656267547607422, "epoch": 1.736588212410037, "grad_norm": 1.1171875, "learning_rate": 0.0004696734619195278, "loss": 5.1087, "mean_token_accuracy": 0.19367065131664277, "num_tokens": 38705710.0, "step": 22320 }, { "entropy": 5.561840295791626, "epoch": 1.7369772417817546, "grad_norm": 1.1171875, "learning_rate": 0.00046965956383662, "loss": 4.9732, "mean_token_accuracy": 0.2156523659825325, "num_tokens": 38714230.0, "step": 22325 }, { "entropy": 5.487687873840332, "epoch": 1.737366271153472, "grad_norm": 1.2109375, "learning_rate": 0.0004696456628000632, "loss": 4.9961, "mean_token_accuracy": 0.20019209235906602, "num_tokens": 38723125.0, "step": 22330 }, { "entropy": 5.581688165664673, "epoch": 1.7377553005251896, "grad_norm": 1.171875, "learning_rate": 0.00046963175881006825, "loss": 5.0633, "mean_token_accuracy": 0.19233470112085344, "num_tokens": 38731436.0, "step": 22335 }, { "entropy": 5.666593027114868, "epoch": 1.7381443298969073, "grad_norm": 1.078125, "learning_rate": 0.0004696178518668462, "loss": 5.1458, "mean_token_accuracy": 0.2003820687532425, "num_tokens": 38740662.0, "step": 22340 }, { "entropy": 5.530299949645996, "epoch": 1.7385333592686247, "grad_norm": 1.15625, "learning_rate": 0.00046960394197060804, "loss": 4.9763, "mean_token_accuracy": 0.20850037932395935, "num_tokens": 38748931.0, "step": 22345 }, { "entropy": 5.584829330444336, "epoch": 1.7389223886403422, "grad_norm": 1.1484375, "learning_rate": 0.00046959002912156473, "loss": 4.9724, "mean_token_accuracy": 0.19814537912607194, "num_tokens": 38757884.0, "step": 22350 }, { "entropy": 5.662018775939941, "epoch": 1.73931141801206, "grad_norm": 1.1640625, "learning_rate": 0.0004695761133199275, "loss": 5.1488, "mean_token_accuracy": 0.19319060295820237, "num_tokens": 38766616.0, "step": 22355 }, { "entropy": 5.570777225494385, "epoch": 1.7397004473837776, "grad_norm": 1.09375, "learning_rate": 0.0004695621945659074, "loss": 4.9716, "mean_token_accuracy": 0.20946432203054427, "num_tokens": 38775470.0, "step": 22360 }, { "entropy": 5.523472929000855, "epoch": 1.740089476755495, "grad_norm": 1.078125, "learning_rate": 0.0004695482728597157, "loss": 4.9825, "mean_token_accuracy": 0.20536706894636153, "num_tokens": 38784566.0, "step": 22365 }, { "entropy": 5.5687579154968265, "epoch": 1.7404785061272126, "grad_norm": 1.2421875, "learning_rate": 0.00046953434820156363, "loss": 5.0288, "mean_token_accuracy": 0.2003973737359047, "num_tokens": 38792843.0, "step": 22370 }, { "entropy": 5.562903642654419, "epoch": 1.7408675354989303, "grad_norm": 1.203125, "learning_rate": 0.0004695204205916624, "loss": 4.9896, "mean_token_accuracy": 0.20416863709688188, "num_tokens": 38801425.0, "step": 22375 }, { "entropy": 5.578148078918457, "epoch": 1.7412565648706477, "grad_norm": 1.109375, "learning_rate": 0.0004695064900302235, "loss": 5.046, "mean_token_accuracy": 0.20185983031988144, "num_tokens": 38810263.0, "step": 22380 }, { "entropy": 5.624987459182739, "epoch": 1.7416455942423652, "grad_norm": 1.15625, "learning_rate": 0.0004694925565174581, "loss": 5.0627, "mean_token_accuracy": 0.19516354352235793, "num_tokens": 38818675.0, "step": 22385 }, { "entropy": 5.596960639953613, "epoch": 1.742034623614083, "grad_norm": 1.09375, "learning_rate": 0.00046947862005357777, "loss": 5.0378, "mean_token_accuracy": 0.19634397178888321, "num_tokens": 38827540.0, "step": 22390 }, { "entropy": 5.567427253723144, "epoch": 1.7424236529858004, "grad_norm": 1.0625, "learning_rate": 0.0004694646806387939, "loss": 4.8947, "mean_token_accuracy": 0.21020916998386383, "num_tokens": 38837420.0, "step": 22395 }, { "entropy": 5.5541100025177, "epoch": 1.7428126823575179, "grad_norm": 1.1796875, "learning_rate": 0.0004694507382733181, "loss": 4.8866, "mean_token_accuracy": 0.2062547743320465, "num_tokens": 38845604.0, "step": 22400 }, { "entropy": 5.515440130233765, "epoch": 1.7432017117292355, "grad_norm": 1.1796875, "learning_rate": 0.0004694367929573618, "loss": 4.9436, "mean_token_accuracy": 0.2048572689294815, "num_tokens": 38854382.0, "step": 22405 }, { "entropy": 5.560438013076782, "epoch": 1.7435907411009532, "grad_norm": 1.3046875, "learning_rate": 0.0004694228446911367, "loss": 4.9818, "mean_token_accuracy": 0.20275169163942336, "num_tokens": 38862889.0, "step": 22410 }, { "entropy": 5.6122509956359865, "epoch": 1.7439797704726707, "grad_norm": 1.140625, "learning_rate": 0.0004694088934748542, "loss": 5.0169, "mean_token_accuracy": 0.19653707891702651, "num_tokens": 38871640.0, "step": 22415 }, { "entropy": 5.523698997497559, "epoch": 1.7443687998443882, "grad_norm": 1.1640625, "learning_rate": 0.0004693949393087263, "loss": 4.9962, "mean_token_accuracy": 0.199367518723011, "num_tokens": 38880247.0, "step": 22420 }, { "entropy": 5.606223487854004, "epoch": 1.744757829216106, "grad_norm": 1.265625, "learning_rate": 0.0004693809821929647, "loss": 5.0338, "mean_token_accuracy": 0.2004812091588974, "num_tokens": 38888857.0, "step": 22425 }, { "entropy": 5.634707260131836, "epoch": 1.7451468585878234, "grad_norm": 1.296875, "learning_rate": 0.000469367022127781, "loss": 5.1443, "mean_token_accuracy": 0.19517911970615387, "num_tokens": 38897429.0, "step": 22430 }, { "entropy": 5.685098886489868, "epoch": 1.7455358879595408, "grad_norm": 1.1796875, "learning_rate": 0.00046935305911338703, "loss": 5.2118, "mean_token_accuracy": 0.18373043984174728, "num_tokens": 38906730.0, "step": 22435 }, { "entropy": 5.6158239364624025, "epoch": 1.7459249173312585, "grad_norm": 1.171875, "learning_rate": 0.0004693390931499948, "loss": 5.1343, "mean_token_accuracy": 0.1906909316778183, "num_tokens": 38916020.0, "step": 22440 }, { "entropy": 5.671753358840943, "epoch": 1.7463139467029762, "grad_norm": 1.2109375, "learning_rate": 0.0004693251242378162, "loss": 5.1038, "mean_token_accuracy": 0.19531947374343872, "num_tokens": 38925525.0, "step": 22445 }, { "entropy": 5.53682508468628, "epoch": 1.7467029760746935, "grad_norm": 1.0859375, "learning_rate": 0.00046931115237706304, "loss": 4.8989, "mean_token_accuracy": 0.20466281622648239, "num_tokens": 38934270.0, "step": 22450 }, { "entropy": 5.560032796859741, "epoch": 1.7470920054464112, "grad_norm": 1.0703125, "learning_rate": 0.0004692971775679475, "loss": 5.0517, "mean_token_accuracy": 0.1946267530322075, "num_tokens": 38943121.0, "step": 22455 }, { "entropy": 5.59547438621521, "epoch": 1.7474810348181289, "grad_norm": 1.1796875, "learning_rate": 0.00046928319981068154, "loss": 5.0493, "mean_token_accuracy": 0.19409110993146897, "num_tokens": 38952517.0, "step": 22460 }, { "entropy": 5.6408257484436035, "epoch": 1.7478700641898464, "grad_norm": 1.0859375, "learning_rate": 0.0004692692191054773, "loss": 5.1324, "mean_token_accuracy": 0.1910709708929062, "num_tokens": 38961124.0, "step": 22465 }, { "entropy": 5.613063097000122, "epoch": 1.7482590935615638, "grad_norm": 1.203125, "learning_rate": 0.0004692552354525468, "loss": 5.0413, "mean_token_accuracy": 0.1987176090478897, "num_tokens": 38969634.0, "step": 22470 }, { "entropy": 5.591943550109863, "epoch": 1.7486481229332815, "grad_norm": 1.078125, "learning_rate": 0.0004692412488521023, "loss": 5.0816, "mean_token_accuracy": 0.19891417920589446, "num_tokens": 38978488.0, "step": 22475 }, { "entropy": 5.553132152557373, "epoch": 1.749037152304999, "grad_norm": 1.0859375, "learning_rate": 0.000469227259304356, "loss": 4.9633, "mean_token_accuracy": 0.2062200576066971, "num_tokens": 38987012.0, "step": 22480 }, { "entropy": 5.595240259170533, "epoch": 1.7494261816767165, "grad_norm": 1.1953125, "learning_rate": 0.00046921326680952023, "loss": 5.0183, "mean_token_accuracy": 0.20488011091947556, "num_tokens": 38995254.0, "step": 22485 }, { "entropy": 5.6533815383911135, "epoch": 1.7498152110484342, "grad_norm": 1.2421875, "learning_rate": 0.0004691992713678072, "loss": 5.1596, "mean_token_accuracy": 0.18789693862199783, "num_tokens": 39003837.0, "step": 22490 }, { "entropy": 5.6098731517791744, "epoch": 1.7502042404201519, "grad_norm": 1.1796875, "learning_rate": 0.0004691852729794293, "loss": 4.9856, "mean_token_accuracy": 0.20639403462409972, "num_tokens": 39012079.0, "step": 22495 }, { "entropy": 5.58169379234314, "epoch": 1.7505932697918691, "grad_norm": 1.171875, "learning_rate": 0.0004691712716445991, "loss": 4.9848, "mean_token_accuracy": 0.20101028233766555, "num_tokens": 39021296.0, "step": 22500 }, { "entropy": 5.509814786911011, "epoch": 1.7509822991635868, "grad_norm": 1.1171875, "learning_rate": 0.0004691572673635288, "loss": 4.9508, "mean_token_accuracy": 0.20133056342601777, "num_tokens": 39029557.0, "step": 22505 }, { "entropy": 5.572682952880859, "epoch": 1.7513713285353045, "grad_norm": 1.1015625, "learning_rate": 0.000469143260136431, "loss": 5.0638, "mean_token_accuracy": 0.19646933376789094, "num_tokens": 39037983.0, "step": 22510 }, { "entropy": 5.629957103729248, "epoch": 1.751760357907022, "grad_norm": 1.1640625, "learning_rate": 0.0004691292499635183, "loss": 5.1327, "mean_token_accuracy": 0.1992638736963272, "num_tokens": 39046874.0, "step": 22515 }, { "entropy": 5.541609430313111, "epoch": 1.7521493872787395, "grad_norm": 1.15625, "learning_rate": 0.0004691152368450032, "loss": 4.9398, "mean_token_accuracy": 0.2066134050488472, "num_tokens": 39054848.0, "step": 22520 }, { "entropy": 5.581417608261108, "epoch": 1.7525384166504572, "grad_norm": 1.1484375, "learning_rate": 0.00046910122078109835, "loss": 5.1059, "mean_token_accuracy": 0.1915219321846962, "num_tokens": 39063946.0, "step": 22525 }, { "entropy": 5.659631681442261, "epoch": 1.7529274460221747, "grad_norm": 1.078125, "learning_rate": 0.0004690872017720163, "loss": 5.0392, "mean_token_accuracy": 0.20044841468334199, "num_tokens": 39072738.0, "step": 22530 }, { "entropy": 5.5723717212677, "epoch": 1.7533164753938921, "grad_norm": 1.0625, "learning_rate": 0.00046907317981797006, "loss": 4.9545, "mean_token_accuracy": 0.2027512699365616, "num_tokens": 39082449.0, "step": 22535 }, { "entropy": 5.5275407314300535, "epoch": 1.7537055047656098, "grad_norm": 1.15625, "learning_rate": 0.00046905915491917213, "loss": 5.0075, "mean_token_accuracy": 0.20208936035633088, "num_tokens": 39090892.0, "step": 22540 }, { "entropy": 5.630428457260132, "epoch": 1.7540945341373275, "grad_norm": 1.125, "learning_rate": 0.0004690451270758354, "loss": 5.0608, "mean_token_accuracy": 0.19849861562252044, "num_tokens": 39099489.0, "step": 22545 }, { "entropy": 5.556709480285645, "epoch": 1.7544835635090448, "grad_norm": 1.234375, "learning_rate": 0.00046903109628817276, "loss": 5.0567, "mean_token_accuracy": 0.1989297479391098, "num_tokens": 39108057.0, "step": 22550 }, { "entropy": 5.636240243911743, "epoch": 1.7548725928807625, "grad_norm": 1.109375, "learning_rate": 0.00046901706255639703, "loss": 5.1479, "mean_token_accuracy": 0.191128708422184, "num_tokens": 39116960.0, "step": 22555 }, { "entropy": 5.573104906082153, "epoch": 1.7552616222524802, "grad_norm": 1.1328125, "learning_rate": 0.0004690030258807212, "loss": 5.0212, "mean_token_accuracy": 0.19483115077018737, "num_tokens": 39126546.0, "step": 22560 }, { "entropy": 5.656208658218384, "epoch": 1.7556506516241976, "grad_norm": 1.1484375, "learning_rate": 0.00046898898626135827, "loss": 5.1531, "mean_token_accuracy": 0.19431264847517013, "num_tokens": 39135390.0, "step": 22565 }, { "entropy": 5.584502029418945, "epoch": 1.7560396809959151, "grad_norm": 1.171875, "learning_rate": 0.0004689749436985211, "loss": 4.9776, "mean_token_accuracy": 0.20115449279546738, "num_tokens": 39143182.0, "step": 22570 }, { "entropy": 5.635671520233155, "epoch": 1.7564287103676328, "grad_norm": 1.0703125, "learning_rate": 0.00046896089819242304, "loss": 5.0495, "mean_token_accuracy": 0.20134179294109344, "num_tokens": 39151525.0, "step": 22575 }, { "entropy": 5.608244276046753, "epoch": 1.7568177397393503, "grad_norm": 1.078125, "learning_rate": 0.0004689468497432771, "loss": 5.0974, "mean_token_accuracy": 0.19605673998594284, "num_tokens": 39160893.0, "step": 22580 }, { "entropy": 5.561341190338135, "epoch": 1.7572067691110678, "grad_norm": 1.09375, "learning_rate": 0.0004689327983512963, "loss": 4.9539, "mean_token_accuracy": 0.20230158120393754, "num_tokens": 39169682.0, "step": 22585 }, { "entropy": 5.635120582580567, "epoch": 1.7575957984827855, "grad_norm": 1.078125, "learning_rate": 0.00046891874401669404, "loss": 5.0598, "mean_token_accuracy": 0.19502562582492827, "num_tokens": 39178879.0, "step": 22590 }, { "entropy": 5.564996576309204, "epoch": 1.7579848278545032, "grad_norm": 1.140625, "learning_rate": 0.0004689046867396834, "loss": 4.9697, "mean_token_accuracy": 0.19909309297800065, "num_tokens": 39186611.0, "step": 22595 }, { "entropy": 5.628575706481934, "epoch": 1.7583738572262204, "grad_norm": 1.203125, "learning_rate": 0.0004688906265204779, "loss": 5.1428, "mean_token_accuracy": 0.18845791667699813, "num_tokens": 39195120.0, "step": 22600 }, { "entropy": 5.619038724899292, "epoch": 1.7587628865979381, "grad_norm": 1.203125, "learning_rate": 0.0004688765633592907, "loss": 5.0338, "mean_token_accuracy": 0.19604857712984086, "num_tokens": 39203263.0, "step": 22605 }, { "entropy": 5.618705940246582, "epoch": 1.7591519159696558, "grad_norm": 1.125, "learning_rate": 0.0004688624972563352, "loss": 5.0127, "mean_token_accuracy": 0.20032002329826354, "num_tokens": 39211486.0, "step": 22610 }, { "entropy": 5.524595928192139, "epoch": 1.7595409453413733, "grad_norm": 1.109375, "learning_rate": 0.0004688484282118249, "loss": 4.9488, "mean_token_accuracy": 0.20813057571649551, "num_tokens": 39220289.0, "step": 22615 }, { "entropy": 5.4896568775177, "epoch": 1.7599299747130908, "grad_norm": 1.0859375, "learning_rate": 0.0004688343562259732, "loss": 5.0326, "mean_token_accuracy": 0.2027808040380478, "num_tokens": 39229260.0, "step": 22620 }, { "entropy": 5.544314289093018, "epoch": 1.7603190040848085, "grad_norm": 1.1171875, "learning_rate": 0.0004688202812989937, "loss": 5.0238, "mean_token_accuracy": 0.196371690928936, "num_tokens": 39237249.0, "step": 22625 }, { "entropy": 5.5726415634155275, "epoch": 1.760708033456526, "grad_norm": 1.15625, "learning_rate": 0.0004688062034311, "loss": 5.003, "mean_token_accuracy": 0.2005815714597702, "num_tokens": 39245973.0, "step": 22630 }, { "entropy": 5.650463199615478, "epoch": 1.7610970628282434, "grad_norm": 1.1484375, "learning_rate": 0.00046879212262250546, "loss": 5.0747, "mean_token_accuracy": 0.19567357748746872, "num_tokens": 39254488.0, "step": 22635 }, { "entropy": 5.523935270309448, "epoch": 1.761486092199961, "grad_norm": 1.0546875, "learning_rate": 0.00046877803887342406, "loss": 5.0076, "mean_token_accuracy": 0.19874085783958434, "num_tokens": 39263596.0, "step": 22640 }, { "entropy": 5.576996278762818, "epoch": 1.7618751215716788, "grad_norm": 1.171875, "learning_rate": 0.0004687639521840693, "loss": 4.9992, "mean_token_accuracy": 0.201176418364048, "num_tokens": 39272687.0, "step": 22645 }, { "entropy": 5.576949119567871, "epoch": 1.7622641509433963, "grad_norm": 1.2578125, "learning_rate": 0.00046874986255465495, "loss": 4.9831, "mean_token_accuracy": 0.19851980060338975, "num_tokens": 39281128.0, "step": 22650 }, { "entropy": 5.633670949935913, "epoch": 1.7626531803151138, "grad_norm": 1.125, "learning_rate": 0.00046873576998539485, "loss": 5.1046, "mean_token_accuracy": 0.1974513500928879, "num_tokens": 39290239.0, "step": 22655 }, { "entropy": 5.623898839950561, "epoch": 1.7630422096868315, "grad_norm": 1.1875, "learning_rate": 0.0004687216744765028, "loss": 5.0781, "mean_token_accuracy": 0.19917575418949127, "num_tokens": 39299156.0, "step": 22660 }, { "entropy": 5.614734506607055, "epoch": 1.763431239058549, "grad_norm": 1.0703125, "learning_rate": 0.0004687075760281927, "loss": 5.0164, "mean_token_accuracy": 0.19556455910205842, "num_tokens": 39308081.0, "step": 22665 }, { "entropy": 5.589909458160401, "epoch": 1.7638202684302664, "grad_norm": 1.1171875, "learning_rate": 0.0004686934746406784, "loss": 5.0769, "mean_token_accuracy": 0.19757792353630066, "num_tokens": 39316219.0, "step": 22670 }, { "entropy": 5.593949937820435, "epoch": 1.764209297801984, "grad_norm": 1.125, "learning_rate": 0.00046867937031417397, "loss": 5.0519, "mean_token_accuracy": 0.19304109066724778, "num_tokens": 39324885.0, "step": 22675 }, { "entropy": 5.539704608917236, "epoch": 1.7645983271737016, "grad_norm": 1.0859375, "learning_rate": 0.0004686652630488933, "loss": 5.0324, "mean_token_accuracy": 0.20368342995643615, "num_tokens": 39333214.0, "step": 22680 }, { "entropy": 5.574097919464111, "epoch": 1.764987356545419, "grad_norm": 1.140625, "learning_rate": 0.00046865115284505063, "loss": 5.0583, "mean_token_accuracy": 0.1962554082274437, "num_tokens": 39342020.0, "step": 22685 }, { "entropy": 5.641817617416382, "epoch": 1.7653763859171367, "grad_norm": 1.03125, "learning_rate": 0.00046863703970285986, "loss": 5.061, "mean_token_accuracy": 0.19739140272140504, "num_tokens": 39351979.0, "step": 22690 }, { "entropy": 5.659980201721192, "epoch": 1.7657654152888544, "grad_norm": 1.1015625, "learning_rate": 0.0004686229236225352, "loss": 5.1027, "mean_token_accuracy": 0.19560504853725433, "num_tokens": 39360218.0, "step": 22695 }, { "entropy": 5.5705938816070555, "epoch": 1.766154444660572, "grad_norm": 1.078125, "learning_rate": 0.0004686088046042909, "loss": 5.058, "mean_token_accuracy": 0.1932186856865883, "num_tokens": 39369434.0, "step": 22700 }, { "entropy": 5.603907680511474, "epoch": 1.7665434740322894, "grad_norm": 1.1328125, "learning_rate": 0.00046859468264834114, "loss": 5.0041, "mean_token_accuracy": 0.20390002578496932, "num_tokens": 39377592.0, "step": 22705 }, { "entropy": 5.637730550765991, "epoch": 1.766932503404007, "grad_norm": 1.0, "learning_rate": 0.00046858055775490017, "loss": 5.0499, "mean_token_accuracy": 0.19977066665887833, "num_tokens": 39386792.0, "step": 22710 }, { "entropy": 5.622049856185913, "epoch": 1.7673215327757246, "grad_norm": 1.265625, "learning_rate": 0.0004685664299241825, "loss": 5.04, "mean_token_accuracy": 0.1985357165336609, "num_tokens": 39395199.0, "step": 22715 }, { "entropy": 5.627436590194702, "epoch": 1.767710562147442, "grad_norm": 1.1015625, "learning_rate": 0.0004685522991564022, "loss": 5.1177, "mean_token_accuracy": 0.19292464554309846, "num_tokens": 39404319.0, "step": 22720 }, { "entropy": 5.624041509628296, "epoch": 1.7680995915191597, "grad_norm": 1.0625, "learning_rate": 0.0004685381654517738, "loss": 5.1011, "mean_token_accuracy": 0.19326256364583969, "num_tokens": 39413567.0, "step": 22725 }, { "entropy": 5.591647815704346, "epoch": 1.7684886208908772, "grad_norm": 1.15625, "learning_rate": 0.0004685240288105119, "loss": 5.0221, "mean_token_accuracy": 0.20360135585069655, "num_tokens": 39422394.0, "step": 22730 }, { "entropy": 5.5141438961029055, "epoch": 1.7688776502625947, "grad_norm": 1.078125, "learning_rate": 0.00046850988923283085, "loss": 4.9114, "mean_token_accuracy": 0.20991896837949753, "num_tokens": 39432081.0, "step": 22735 }, { "entropy": 5.541791486740112, "epoch": 1.7692666796343124, "grad_norm": 1.140625, "learning_rate": 0.00046849574671894523, "loss": 4.9539, "mean_token_accuracy": 0.20038838684558868, "num_tokens": 39440477.0, "step": 22740 }, { "entropy": 5.593561267852783, "epoch": 1.76965570900603, "grad_norm": 1.125, "learning_rate": 0.00046848160126906956, "loss": 5.1371, "mean_token_accuracy": 0.19569425731897355, "num_tokens": 39449253.0, "step": 22745 }, { "entropy": 5.589076328277588, "epoch": 1.7700447383777476, "grad_norm": 1.1484375, "learning_rate": 0.0004684674528834186, "loss": 5.0174, "mean_token_accuracy": 0.19810190051794052, "num_tokens": 39457686.0, "step": 22750 }, { "entropy": 5.652772426605225, "epoch": 1.770433767749465, "grad_norm": 1.0546875, "learning_rate": 0.00046845330156220703, "loss": 5.1608, "mean_token_accuracy": 0.19582921862602234, "num_tokens": 39466198.0, "step": 22755 }, { "entropy": 5.59023003578186, "epoch": 1.7708227971211827, "grad_norm": 1.078125, "learning_rate": 0.0004684391473056495, "loss": 5.0355, "mean_token_accuracy": 0.19748512506484986, "num_tokens": 39475098.0, "step": 22760 }, { "entropy": 5.636324119567871, "epoch": 1.7712118264929002, "grad_norm": 1.1640625, "learning_rate": 0.00046842499011396076, "loss": 5.0118, "mean_token_accuracy": 0.20220395624637605, "num_tokens": 39483383.0, "step": 22765 }, { "entropy": 5.538096189498901, "epoch": 1.7716008558646177, "grad_norm": 1.1640625, "learning_rate": 0.00046841082998735575, "loss": 4.9733, "mean_token_accuracy": 0.20839557945728301, "num_tokens": 39492428.0, "step": 22770 }, { "entropy": 5.659812688827515, "epoch": 1.7719898852363354, "grad_norm": 1.0625, "learning_rate": 0.00046839666692604916, "loss": 5.1327, "mean_token_accuracy": 0.19164248257875444, "num_tokens": 39501390.0, "step": 22775 }, { "entropy": 5.589624881744385, "epoch": 1.7723789146080529, "grad_norm": 1.1640625, "learning_rate": 0.000468382500930256, "loss": 5.0458, "mean_token_accuracy": 0.19889655858278274, "num_tokens": 39509463.0, "step": 22780 }, { "entropy": 5.577083015441895, "epoch": 1.7727679439797703, "grad_norm": 1.109375, "learning_rate": 0.00046836833200019116, "loss": 4.994, "mean_token_accuracy": 0.2068038836121559, "num_tokens": 39518275.0, "step": 22785 }, { "entropy": 5.511835384368896, "epoch": 1.773156973351488, "grad_norm": 1.171875, "learning_rate": 0.0004683541601360697, "loss": 5.0269, "mean_token_accuracy": 0.20563874989748002, "num_tokens": 39527349.0, "step": 22790 }, { "entropy": 5.560085248947144, "epoch": 1.7735460027232057, "grad_norm": 1.203125, "learning_rate": 0.00046833998533810653, "loss": 5.007, "mean_token_accuracy": 0.20325085371732712, "num_tokens": 39535411.0, "step": 22795 }, { "entropy": 5.6095030307769775, "epoch": 1.7739350320949232, "grad_norm": 1.1328125, "learning_rate": 0.0004683258076065169, "loss": 5.0296, "mean_token_accuracy": 0.19274890124797822, "num_tokens": 39543927.0, "step": 22800 }, { "entropy": 5.5761925220489506, "epoch": 1.7743240614666407, "grad_norm": 1.21875, "learning_rate": 0.00046831162694151586, "loss": 4.9757, "mean_token_accuracy": 0.21392301917076112, "num_tokens": 39551782.0, "step": 22805 }, { "entropy": 5.58159122467041, "epoch": 1.7747130908383584, "grad_norm": 1.1015625, "learning_rate": 0.00046829744334331855, "loss": 5.1773, "mean_token_accuracy": 0.18794430494308473, "num_tokens": 39561369.0, "step": 22810 }, { "entropy": 5.5563068866729735, "epoch": 1.7751021202100759, "grad_norm": 1.1796875, "learning_rate": 0.00046828325681214013, "loss": 4.9781, "mean_token_accuracy": 0.19780379682779312, "num_tokens": 39569559.0, "step": 22815 }, { "entropy": 5.552534437179565, "epoch": 1.7754911495817933, "grad_norm": 1.171875, "learning_rate": 0.000468269067348196, "loss": 5.0462, "mean_token_accuracy": 0.20059692114591599, "num_tokens": 39578663.0, "step": 22820 }, { "entropy": 5.618351697921753, "epoch": 1.775880178953511, "grad_norm": 1.234375, "learning_rate": 0.0004682548749517014, "loss": 5.2523, "mean_token_accuracy": 0.18005671948194504, "num_tokens": 39588336.0, "step": 22825 }, { "entropy": 5.647833251953125, "epoch": 1.7762692083252287, "grad_norm": 1.1328125, "learning_rate": 0.00046824067962287163, "loss": 4.9938, "mean_token_accuracy": 0.20423362851142884, "num_tokens": 39596666.0, "step": 22830 }, { "entropy": 5.597459745407105, "epoch": 1.776658237696946, "grad_norm": 1.1875, "learning_rate": 0.0004682264813619221, "loss": 5.0481, "mean_token_accuracy": 0.19661538898944855, "num_tokens": 39604916.0, "step": 22835 }, { "entropy": 5.617653560638428, "epoch": 1.7770472670686637, "grad_norm": 1.140625, "learning_rate": 0.00046821228016906836, "loss": 5.1448, "mean_token_accuracy": 0.19308310151100158, "num_tokens": 39613808.0, "step": 22840 }, { "entropy": 5.571138143539429, "epoch": 1.7774362964403814, "grad_norm": 1.21875, "learning_rate": 0.0004681980760445257, "loss": 5.0378, "mean_token_accuracy": 0.19837915897369385, "num_tokens": 39622476.0, "step": 22845 }, { "entropy": 5.6759086608886715, "epoch": 1.7778253258120988, "grad_norm": 1.1328125, "learning_rate": 0.0004681838689885098, "loss": 5.0158, "mean_token_accuracy": 0.19964097142219545, "num_tokens": 39630626.0, "step": 22850 }, { "entropy": 5.560094547271729, "epoch": 1.7782143551838163, "grad_norm": 1.1015625, "learning_rate": 0.0004681696590012362, "loss": 5.0125, "mean_token_accuracy": 0.19630029797554016, "num_tokens": 39640067.0, "step": 22855 }, { "entropy": 5.559118461608887, "epoch": 1.778603384555534, "grad_norm": 0.99609375, "learning_rate": 0.00046815544608292043, "loss": 4.9623, "mean_token_accuracy": 0.2069356307387352, "num_tokens": 39649576.0, "step": 22860 }, { "entropy": 5.583879375457764, "epoch": 1.7789924139272515, "grad_norm": 1.09375, "learning_rate": 0.0004681412302337782, "loss": 4.9949, "mean_token_accuracy": 0.20486710965633392, "num_tokens": 39658286.0, "step": 22865 }, { "entropy": 5.607027578353882, "epoch": 1.779381443298969, "grad_norm": 1.171875, "learning_rate": 0.0004681270114540252, "loss": 5.0741, "mean_token_accuracy": 0.20192814320325853, "num_tokens": 39667147.0, "step": 22870 }, { "entropy": 5.504190874099732, "epoch": 1.7797704726706867, "grad_norm": 1.25, "learning_rate": 0.0004681127897438772, "loss": 4.9734, "mean_token_accuracy": 0.2061097353696823, "num_tokens": 39676069.0, "step": 22875 }, { "entropy": 5.598902893066406, "epoch": 1.7801595020424044, "grad_norm": 1.0703125, "learning_rate": 0.00046809856510355007, "loss": 5.0015, "mean_token_accuracy": 0.2045866534113884, "num_tokens": 39684378.0, "step": 22880 }, { "entropy": 5.598447513580322, "epoch": 1.7805485314141216, "grad_norm": 1.0546875, "learning_rate": 0.0004680843375332595, "loss": 5.1119, "mean_token_accuracy": 0.19898812770843505, "num_tokens": 39693808.0, "step": 22885 }, { "entropy": 5.609540128707886, "epoch": 1.7809375607858393, "grad_norm": 1.140625, "learning_rate": 0.00046807010703322143, "loss": 4.9882, "mean_token_accuracy": 0.20833540856838226, "num_tokens": 39702375.0, "step": 22890 }, { "entropy": 5.709212923049927, "epoch": 1.781326590157557, "grad_norm": 1.21875, "learning_rate": 0.0004680558736036518, "loss": 5.0902, "mean_token_accuracy": 0.19484387934207917, "num_tokens": 39711052.0, "step": 22895 }, { "entropy": 5.462477111816407, "epoch": 1.7817156195292745, "grad_norm": 1.1171875, "learning_rate": 0.0004680416372447666, "loss": 4.7844, "mean_token_accuracy": 0.21905156672000886, "num_tokens": 39718942.0, "step": 22900 }, { "entropy": 5.6332207202911375, "epoch": 1.782104648900992, "grad_norm": 1.078125, "learning_rate": 0.00046802739795678177, "loss": 5.1211, "mean_token_accuracy": 0.19188966304063798, "num_tokens": 39728048.0, "step": 22905 }, { "entropy": 5.552681255340576, "epoch": 1.7824936782727097, "grad_norm": 1.1875, "learning_rate": 0.00046801315573991346, "loss": 5.0024, "mean_token_accuracy": 0.2045807123184204, "num_tokens": 39736579.0, "step": 22910 }, { "entropy": 5.561276626586914, "epoch": 1.7828827076444271, "grad_norm": 1.1015625, "learning_rate": 0.00046799891059437764, "loss": 5.0199, "mean_token_accuracy": 0.19995367676019668, "num_tokens": 39744963.0, "step": 22915 }, { "entropy": 5.525426387786865, "epoch": 1.7832717370161446, "grad_norm": 1.1484375, "learning_rate": 0.00046798466252039056, "loss": 5.022, "mean_token_accuracy": 0.2055957704782486, "num_tokens": 39752880.0, "step": 22920 }, { "entropy": 5.540273427963257, "epoch": 1.7836607663878623, "grad_norm": 1.1484375, "learning_rate": 0.00046797041151816845, "loss": 4.9185, "mean_token_accuracy": 0.20775382071733475, "num_tokens": 39761069.0, "step": 22925 }, { "entropy": 5.672127723693848, "epoch": 1.78404979575958, "grad_norm": 1.125, "learning_rate": 0.00046795615758792747, "loss": 5.1242, "mean_token_accuracy": 0.19637293517589569, "num_tokens": 39769780.0, "step": 22930 }, { "entropy": 5.597632694244385, "epoch": 1.7844388251312973, "grad_norm": 1.1015625, "learning_rate": 0.0004679419007298839, "loss": 4.9609, "mean_token_accuracy": 0.20212045162916184, "num_tokens": 39778539.0, "step": 22935 }, { "entropy": 5.5482048988342285, "epoch": 1.784827854503015, "grad_norm": 1.125, "learning_rate": 0.0004679276409442541, "loss": 5.0083, "mean_token_accuracy": 0.19957920014858246, "num_tokens": 39787175.0, "step": 22940 }, { "entropy": 5.609476041793823, "epoch": 1.7852168838747327, "grad_norm": 1.0703125, "learning_rate": 0.0004679133782312544, "loss": 5.1294, "mean_token_accuracy": 0.1929687336087227, "num_tokens": 39795953.0, "step": 22945 }, { "entropy": 5.597094249725342, "epoch": 1.7856059132464501, "grad_norm": 1.15625, "learning_rate": 0.0004678991125911013, "loss": 4.9866, "mean_token_accuracy": 0.19987092167139053, "num_tokens": 39804858.0, "step": 22950 }, { "entropy": 5.608408117294312, "epoch": 1.7859949426181676, "grad_norm": 1.171875, "learning_rate": 0.0004678848440240111, "loss": 5.1099, "mean_token_accuracy": 0.18953849524259567, "num_tokens": 39813091.0, "step": 22955 }, { "entropy": 5.5701898574829105, "epoch": 1.7863839719898853, "grad_norm": 1.1015625, "learning_rate": 0.0004678705725302005, "loss": 5.0865, "mean_token_accuracy": 0.19091576784849168, "num_tokens": 39821489.0, "step": 22960 }, { "entropy": 5.623002290725708, "epoch": 1.7867730013616028, "grad_norm": 1.15625, "learning_rate": 0.0004678562981098859, "loss": 5.0613, "mean_token_accuracy": 0.19759983718395233, "num_tokens": 39830236.0, "step": 22965 }, { "entropy": 5.558730363845825, "epoch": 1.7871620307333203, "grad_norm": 1.1484375, "learning_rate": 0.00046784202076328394, "loss": 4.9909, "mean_token_accuracy": 0.20138382762670518, "num_tokens": 39839064.0, "step": 22970 }, { "entropy": 5.587292242050171, "epoch": 1.787551060105038, "grad_norm": 1.109375, "learning_rate": 0.00046782774049061124, "loss": 5.0454, "mean_token_accuracy": 0.19815467447042465, "num_tokens": 39848101.0, "step": 22975 }, { "entropy": 5.704869985580444, "epoch": 1.7879400894767556, "grad_norm": 1.1484375, "learning_rate": 0.0004678134572920845, "loss": 5.214, "mean_token_accuracy": 0.1935403600335121, "num_tokens": 39857053.0, "step": 22980 }, { "entropy": 5.629877281188965, "epoch": 1.788329118848473, "grad_norm": 1.078125, "learning_rate": 0.0004677991711679204, "loss": 5.1246, "mean_token_accuracy": 0.19663288593292236, "num_tokens": 39865278.0, "step": 22985 }, { "entropy": 5.589210939407349, "epoch": 1.7887181482201906, "grad_norm": 1.125, "learning_rate": 0.00046778488211833585, "loss": 5.0211, "mean_token_accuracy": 0.1959928184747696, "num_tokens": 39874296.0, "step": 22990 }, { "entropy": 5.509317874908447, "epoch": 1.7891071775919083, "grad_norm": 1.109375, "learning_rate": 0.0004677705901435475, "loss": 4.9337, "mean_token_accuracy": 0.209151254594326, "num_tokens": 39882867.0, "step": 22995 }, { "entropy": 5.560981607437133, "epoch": 1.7894962069636258, "grad_norm": 1.0390625, "learning_rate": 0.0004677562952437723, "loss": 5.0376, "mean_token_accuracy": 0.19653394669294358, "num_tokens": 39891782.0, "step": 23000 }, { "entropy": 5.602384281158447, "epoch": 1.7898852363353432, "grad_norm": 1.1953125, "learning_rate": 0.00046774199741922705, "loss": 5.087, "mean_token_accuracy": 0.20199912190437316, "num_tokens": 39899914.0, "step": 23005 }, { "entropy": 5.630718755722046, "epoch": 1.790274265707061, "grad_norm": 1.15625, "learning_rate": 0.00046772769667012884, "loss": 5.0478, "mean_token_accuracy": 0.19501936584711074, "num_tokens": 39909097.0, "step": 23010 }, { "entropy": 5.576741313934326, "epoch": 1.7906632950787784, "grad_norm": 1.0625, "learning_rate": 0.0004677133929966946, "loss": 4.9801, "mean_token_accuracy": 0.20243656039237976, "num_tokens": 39917922.0, "step": 23015 }, { "entropy": 5.590720558166504, "epoch": 1.791052324450496, "grad_norm": 1.1328125, "learning_rate": 0.00046769908639914134, "loss": 4.954, "mean_token_accuracy": 0.20219176411628723, "num_tokens": 39925675.0, "step": 23020 }, { "entropy": 5.617328739166259, "epoch": 1.7914413538222136, "grad_norm": 1.2109375, "learning_rate": 0.0004676847768776861, "loss": 5.0801, "mean_token_accuracy": 0.19463513940572738, "num_tokens": 39933693.0, "step": 23025 }, { "entropy": 5.614121198654175, "epoch": 1.7918303831939313, "grad_norm": 1.25, "learning_rate": 0.0004676704644325462, "loss": 5.0974, "mean_token_accuracy": 0.19787005186080933, "num_tokens": 39942137.0, "step": 23030 }, { "entropy": 5.638820219039917, "epoch": 1.7922194125656488, "grad_norm": 1.1484375, "learning_rate": 0.0004676561490639385, "loss": 5.0483, "mean_token_accuracy": 0.19255973100662233, "num_tokens": 39951268.0, "step": 23035 }, { "entropy": 5.569800138473511, "epoch": 1.7926084419373662, "grad_norm": 1.0859375, "learning_rate": 0.0004676418307720805, "loss": 4.9252, "mean_token_accuracy": 0.20710771083831786, "num_tokens": 39959930.0, "step": 23040 }, { "entropy": 5.470084762573242, "epoch": 1.792997471309084, "grad_norm": 1.203125, "learning_rate": 0.0004676275095571892, "loss": 4.8982, "mean_token_accuracy": 0.21053647696971894, "num_tokens": 39967694.0, "step": 23045 }, { "entropy": 5.554301786422729, "epoch": 1.7933865006808014, "grad_norm": 1.140625, "learning_rate": 0.00046761318541948215, "loss": 5.0359, "mean_token_accuracy": 0.20855779498815535, "num_tokens": 39976462.0, "step": 23050 }, { "entropy": 5.558436870574951, "epoch": 1.7937755300525189, "grad_norm": 1.0625, "learning_rate": 0.0004675988583591766, "loss": 4.9366, "mean_token_accuracy": 0.20703832060098648, "num_tokens": 39985089.0, "step": 23055 }, { "entropy": 5.628482103347778, "epoch": 1.7941645594242366, "grad_norm": 1.0390625, "learning_rate": 0.00046758452837648997, "loss": 5.1046, "mean_token_accuracy": 0.19303470999002456, "num_tokens": 39994635.0, "step": 23060 }, { "entropy": 5.672496795654297, "epoch": 1.794553588795954, "grad_norm": 1.1875, "learning_rate": 0.0004675701954716395, "loss": 5.0143, "mean_token_accuracy": 0.20060535222291948, "num_tokens": 40003474.0, "step": 23065 }, { "entropy": 5.623958158493042, "epoch": 1.7949426181676715, "grad_norm": 1.1875, "learning_rate": 0.00046755585964484286, "loss": 5.0568, "mean_token_accuracy": 0.2043328434228897, "num_tokens": 40012171.0, "step": 23070 }, { "entropy": 5.635309553146362, "epoch": 1.7953316475393892, "grad_norm": 1.15625, "learning_rate": 0.0004675415208963177, "loss": 5.0737, "mean_token_accuracy": 0.19803963005542755, "num_tokens": 40021101.0, "step": 23075 }, { "entropy": 5.5936370372772215, "epoch": 1.795720676911107, "grad_norm": 1.1796875, "learning_rate": 0.00046752717922628125, "loss": 4.9876, "mean_token_accuracy": 0.20822370797395706, "num_tokens": 40029699.0, "step": 23080 }, { "entropy": 5.627665090560913, "epoch": 1.7961097062828244, "grad_norm": 1.1171875, "learning_rate": 0.0004675128346349514, "loss": 5.0726, "mean_token_accuracy": 0.19998870342969893, "num_tokens": 40038443.0, "step": 23085 }, { "entropy": 5.580521821975708, "epoch": 1.7964987356545419, "grad_norm": 1.15625, "learning_rate": 0.00046749848712254554, "loss": 4.9619, "mean_token_accuracy": 0.20565702766180038, "num_tokens": 40046398.0, "step": 23090 }, { "entropy": 5.57363657951355, "epoch": 1.7968877650262596, "grad_norm": 1.2734375, "learning_rate": 0.00046748413668928164, "loss": 5.0242, "mean_token_accuracy": 0.19836025685071945, "num_tokens": 40054487.0, "step": 23095 }, { "entropy": 5.546409177780151, "epoch": 1.797276794397977, "grad_norm": 1.09375, "learning_rate": 0.0004674697833353774, "loss": 5.0161, "mean_token_accuracy": 0.1999297559261322, "num_tokens": 40063088.0, "step": 23100 }, { "entropy": 5.619241333007812, "epoch": 1.7976658237696945, "grad_norm": 1.0859375, "learning_rate": 0.00046745542706105045, "loss": 5.0609, "mean_token_accuracy": 0.19449102580547334, "num_tokens": 40071321.0, "step": 23105 }, { "entropy": 5.570852136611938, "epoch": 1.7980548531414122, "grad_norm": 1.0703125, "learning_rate": 0.00046744106786651875, "loss": 4.9657, "mean_token_accuracy": 0.2001722827553749, "num_tokens": 40080329.0, "step": 23110 }, { "entropy": 5.611421251296997, "epoch": 1.7984438825131297, "grad_norm": 1.1953125, "learning_rate": 0.0004674267057520001, "loss": 5.0002, "mean_token_accuracy": 0.20843944996595382, "num_tokens": 40088548.0, "step": 23115 }, { "entropy": 5.64282865524292, "epoch": 1.7988329118848472, "grad_norm": 1.1015625, "learning_rate": 0.0004674123407177125, "loss": 5.0917, "mean_token_accuracy": 0.19349610209465026, "num_tokens": 40096517.0, "step": 23120 }, { "entropy": 5.55327615737915, "epoch": 1.7992219412565649, "grad_norm": 1.1015625, "learning_rate": 0.00046739797276387394, "loss": 5.0315, "mean_token_accuracy": 0.20174278020858766, "num_tokens": 40104838.0, "step": 23125 }, { "entropy": 5.632558012008667, "epoch": 1.7996109706282826, "grad_norm": 1.203125, "learning_rate": 0.00046738360189070235, "loss": 5.0388, "mean_token_accuracy": 0.20199909061193466, "num_tokens": 40113095.0, "step": 23130 }, { "entropy": 5.570906782150269, "epoch": 1.8, "grad_norm": 1.1953125, "learning_rate": 0.0004673692280984157, "loss": 4.9732, "mean_token_accuracy": 0.20213625431060792, "num_tokens": 40121436.0, "step": 23135 }, { "entropy": 5.504435586929321, "epoch": 1.8003890293717175, "grad_norm": 1.1875, "learning_rate": 0.0004673548513872324, "loss": 4.9299, "mean_token_accuracy": 0.2140723541378975, "num_tokens": 40130495.0, "step": 23140 }, { "entropy": 5.61940565109253, "epoch": 1.8007780587434352, "grad_norm": 1.2265625, "learning_rate": 0.00046734047175737026, "loss": 4.9766, "mean_token_accuracy": 0.20216100364923478, "num_tokens": 40138456.0, "step": 23145 }, { "entropy": 5.553161573410034, "epoch": 1.8011670881151527, "grad_norm": 1.171875, "learning_rate": 0.00046732608920904754, "loss": 4.903, "mean_token_accuracy": 0.21437480300664902, "num_tokens": 40146898.0, "step": 23150 }, { "entropy": 5.53667311668396, "epoch": 1.8015561174868702, "grad_norm": 1.15625, "learning_rate": 0.0004673117037424827, "loss": 5.0302, "mean_token_accuracy": 0.19319395571947098, "num_tokens": 40155461.0, "step": 23155 }, { "entropy": 5.587999534606934, "epoch": 1.8019451468585879, "grad_norm": 1.1328125, "learning_rate": 0.00046729731535789375, "loss": 5.0201, "mean_token_accuracy": 0.196914441883564, "num_tokens": 40164111.0, "step": 23160 }, { "entropy": 5.645179700851441, "epoch": 1.8023341762303053, "grad_norm": 1.0703125, "learning_rate": 0.00046728292405549913, "loss": 5.0262, "mean_token_accuracy": 0.20021609514951705, "num_tokens": 40172306.0, "step": 23165 }, { "entropy": 5.590686893463134, "epoch": 1.8027232056020228, "grad_norm": 1.1015625, "learning_rate": 0.0004672685298355172, "loss": 5.0524, "mean_token_accuracy": 0.19998696446418762, "num_tokens": 40180720.0, "step": 23170 }, { "entropy": 5.51874475479126, "epoch": 1.8031122349737405, "grad_norm": 1.171875, "learning_rate": 0.0004672541326981664, "loss": 4.9055, "mean_token_accuracy": 0.2108146384358406, "num_tokens": 40189536.0, "step": 23175 }, { "entropy": 5.590334844589234, "epoch": 1.8035012643454582, "grad_norm": 1.1171875, "learning_rate": 0.000467239732643665, "loss": 5.0396, "mean_token_accuracy": 0.20336873084306717, "num_tokens": 40198510.0, "step": 23180 }, { "entropy": 5.6000707149505615, "epoch": 1.8038902937171757, "grad_norm": 1.078125, "learning_rate": 0.00046722532967223183, "loss": 5.0842, "mean_token_accuracy": 0.19700941443443298, "num_tokens": 40206959.0, "step": 23185 }, { "entropy": 5.623350000381469, "epoch": 1.8042793230888932, "grad_norm": 1.1796875, "learning_rate": 0.0004672109237840851, "loss": 5.0908, "mean_token_accuracy": 0.19866990000009538, "num_tokens": 40215661.0, "step": 23190 }, { "entropy": 5.597944211959839, "epoch": 1.8046683524606109, "grad_norm": 1.140625, "learning_rate": 0.00046719651497944355, "loss": 5.0658, "mean_token_accuracy": 0.19420279413461686, "num_tokens": 40223221.0, "step": 23195 }, { "entropy": 5.511111068725586, "epoch": 1.8050573818323283, "grad_norm": 1.171875, "learning_rate": 0.0004671821032585259, "loss": 4.9193, "mean_token_accuracy": 0.2047031491994858, "num_tokens": 40231846.0, "step": 23200 }, { "entropy": 5.5718762397766115, "epoch": 1.8054464112040458, "grad_norm": 1.140625, "learning_rate": 0.0004671676886215506, "loss": 5.0265, "mean_token_accuracy": 0.19999951422214507, "num_tokens": 40240538.0, "step": 23205 }, { "entropy": 5.612865829467774, "epoch": 1.8058354405757635, "grad_norm": 1.171875, "learning_rate": 0.0004671532710687365, "loss": 5.1311, "mean_token_accuracy": 0.19003996700048448, "num_tokens": 40249260.0, "step": 23210 }, { "entropy": 5.568214082717896, "epoch": 1.806224469947481, "grad_norm": 1.2421875, "learning_rate": 0.0004671388506003024, "loss": 4.9991, "mean_token_accuracy": 0.20145997256040574, "num_tokens": 40258458.0, "step": 23215 }, { "entropy": 5.585395479202271, "epoch": 1.8066134993191985, "grad_norm": 1.1171875, "learning_rate": 0.0004671244272164671, "loss": 5.0676, "mean_token_accuracy": 0.19343768507242204, "num_tokens": 40267304.0, "step": 23220 }, { "entropy": 5.575503826141357, "epoch": 1.8070025286909162, "grad_norm": 1.046875, "learning_rate": 0.00046711000091744935, "loss": 5.0564, "mean_token_accuracy": 0.19747590124607087, "num_tokens": 40276873.0, "step": 23225 }, { "entropy": 5.554568338394165, "epoch": 1.8073915580626339, "grad_norm": 1.171875, "learning_rate": 0.0004670955717034681, "loss": 4.9749, "mean_token_accuracy": 0.2034117043018341, "num_tokens": 40285003.0, "step": 23230 }, { "entropy": 5.527369594573974, "epoch": 1.8077805874343513, "grad_norm": 1.09375, "learning_rate": 0.00046708113957474233, "loss": 5.0258, "mean_token_accuracy": 0.203046777844429, "num_tokens": 40294462.0, "step": 23235 }, { "entropy": 5.604878377914429, "epoch": 1.8081696168060688, "grad_norm": 1.28125, "learning_rate": 0.000467066704531491, "loss": 5.0003, "mean_token_accuracy": 0.202876915037632, "num_tokens": 40303040.0, "step": 23240 }, { "entropy": 5.644914150238037, "epoch": 1.8085586461777865, "grad_norm": 1.15625, "learning_rate": 0.0004670522665739332, "loss": 5.0206, "mean_token_accuracy": 0.19444627612829207, "num_tokens": 40311490.0, "step": 23245 }, { "entropy": 5.661421155929565, "epoch": 1.808947675549504, "grad_norm": 1.171875, "learning_rate": 0.0004670378257022878, "loss": 5.104, "mean_token_accuracy": 0.19724383503198623, "num_tokens": 40319725.0, "step": 23250 }, { "entropy": 5.611379337310791, "epoch": 1.8093367049212215, "grad_norm": 1.2890625, "learning_rate": 0.00046702338191677414, "loss": 5.0328, "mean_token_accuracy": 0.20321171283721923, "num_tokens": 40328019.0, "step": 23255 }, { "entropy": 5.6197587013244625, "epoch": 1.8097257342929391, "grad_norm": 1.078125, "learning_rate": 0.0004670089352176113, "loss": 5.013, "mean_token_accuracy": 0.20126061588525773, "num_tokens": 40336857.0, "step": 23260 }, { "entropy": 5.552067136764526, "epoch": 1.8101147636646568, "grad_norm": 1.1015625, "learning_rate": 0.00046699448560501847, "loss": 5.0195, "mean_token_accuracy": 0.1964714601635933, "num_tokens": 40345367.0, "step": 23265 }, { "entropy": 5.634008169174194, "epoch": 1.810503793036374, "grad_norm": 1.1640625, "learning_rate": 0.0004669800330792149, "loss": 5.071, "mean_token_accuracy": 0.19731670916080474, "num_tokens": 40353899.0, "step": 23270 }, { "entropy": 5.634049606323242, "epoch": 1.8108928224080918, "grad_norm": 1.15625, "learning_rate": 0.00046696557764041994, "loss": 5.1067, "mean_token_accuracy": 0.19399033039808272, "num_tokens": 40362045.0, "step": 23275 }, { "entropy": 5.57297568321228, "epoch": 1.8112818517798095, "grad_norm": 1.1796875, "learning_rate": 0.0004669511192888528, "loss": 4.9418, "mean_token_accuracy": 0.20357016026973723, "num_tokens": 40370581.0, "step": 23280 }, { "entropy": 5.538308000564575, "epoch": 1.811670881151527, "grad_norm": 1.0625, "learning_rate": 0.00046693665802473294, "loss": 4.9214, "mean_token_accuracy": 0.21260672062635422, "num_tokens": 40379481.0, "step": 23285 }, { "entropy": 5.662737894058227, "epoch": 1.8120599105232444, "grad_norm": 1.09375, "learning_rate": 0.00046692219384827986, "loss": 5.1325, "mean_token_accuracy": 0.18956195712089538, "num_tokens": 40387839.0, "step": 23290 }, { "entropy": 5.625577545166015, "epoch": 1.8124489398949621, "grad_norm": 1.203125, "learning_rate": 0.0004669077267597129, "loss": 5.0074, "mean_token_accuracy": 0.1966658875346184, "num_tokens": 40396030.0, "step": 23295 }, { "entropy": 5.6442272663116455, "epoch": 1.8128379692666796, "grad_norm": 1.1484375, "learning_rate": 0.00046689325675925174, "loss": 5.0927, "mean_token_accuracy": 0.19145426899194717, "num_tokens": 40404413.0, "step": 23300 }, { "entropy": 5.595897483825683, "epoch": 1.813226998638397, "grad_norm": 1.03125, "learning_rate": 0.00046687878384711574, "loss": 5.0146, "mean_token_accuracy": 0.2019767388701439, "num_tokens": 40413474.0, "step": 23305 }, { "entropy": 5.522207307815552, "epoch": 1.8136160280101148, "grad_norm": 1.0703125, "learning_rate": 0.00046686430802352476, "loss": 5.0534, "mean_token_accuracy": 0.20177856534719468, "num_tokens": 40422564.0, "step": 23310 }, { "entropy": 5.5636693954467775, "epoch": 1.8140050573818325, "grad_norm": 1.1484375, "learning_rate": 0.0004668498292886982, "loss": 4.9771, "mean_token_accuracy": 0.20211093723773957, "num_tokens": 40430371.0, "step": 23315 }, { "entropy": 5.649656915664673, "epoch": 1.8143940867535497, "grad_norm": 1.078125, "learning_rate": 0.00046683534764285577, "loss": 5.1286, "mean_token_accuracy": 0.18882469236850738, "num_tokens": 40439346.0, "step": 23320 }, { "entropy": 5.720078229904175, "epoch": 1.8147831161252674, "grad_norm": 1.109375, "learning_rate": 0.00046682086308621725, "loss": 5.1482, "mean_token_accuracy": 0.19283961802721022, "num_tokens": 40449503.0, "step": 23325 }, { "entropy": 5.612382411956787, "epoch": 1.8151721454969851, "grad_norm": 1.2734375, "learning_rate": 0.0004668063756190026, "loss": 5.056, "mean_token_accuracy": 0.19769258052110672, "num_tokens": 40457372.0, "step": 23330 }, { "entropy": 5.6008195877075195, "epoch": 1.8155611748687026, "grad_norm": 1.0859375, "learning_rate": 0.00046679188524143136, "loss": 5.0643, "mean_token_accuracy": 0.19532227516174316, "num_tokens": 40465731.0, "step": 23335 }, { "entropy": 5.637818384170532, "epoch": 1.81595020424042, "grad_norm": 1.140625, "learning_rate": 0.0004667773919537235, "loss": 5.0968, "mean_token_accuracy": 0.1865835666656494, "num_tokens": 40473941.0, "step": 23340 }, { "entropy": 5.688023567199707, "epoch": 1.8163392336121378, "grad_norm": 1.1640625, "learning_rate": 0.00046676289575609914, "loss": 5.1647, "mean_token_accuracy": 0.19164917916059493, "num_tokens": 40482370.0, "step": 23345 }, { "entropy": 5.567803525924683, "epoch": 1.8167282629838553, "grad_norm": 1.1875, "learning_rate": 0.00046674839664877796, "loss": 4.9301, "mean_token_accuracy": 0.20602133572101594, "num_tokens": 40489975.0, "step": 23350 }, { "entropy": 5.624909067153931, "epoch": 1.8171172923555727, "grad_norm": 1.2421875, "learning_rate": 0.0004667338946319801, "loss": 5.1484, "mean_token_accuracy": 0.19751333743333815, "num_tokens": 40499294.0, "step": 23355 }, { "entropy": 5.648792171478272, "epoch": 1.8175063217272904, "grad_norm": 1.1796875, "learning_rate": 0.0004667193897059255, "loss": 5.1017, "mean_token_accuracy": 0.19113535135984422, "num_tokens": 40508087.0, "step": 23360 }, { "entropy": 5.674963140487671, "epoch": 1.8178953510990081, "grad_norm": 1.1484375, "learning_rate": 0.00046670488187083436, "loss": 5.0072, "mean_token_accuracy": 0.2037469670176506, "num_tokens": 40516054.0, "step": 23365 }, { "entropy": 5.590182161331176, "epoch": 1.8182843804707254, "grad_norm": 1.1015625, "learning_rate": 0.0004666903711269267, "loss": 5.0169, "mean_token_accuracy": 0.20195274651050568, "num_tokens": 40524640.0, "step": 23370 }, { "entropy": 5.525883722305298, "epoch": 1.818673409842443, "grad_norm": 1.1484375, "learning_rate": 0.0004666758574744228, "loss": 4.974, "mean_token_accuracy": 0.19963400512933732, "num_tokens": 40533255.0, "step": 23375 }, { "entropy": 5.552801179885864, "epoch": 1.8190624392141608, "grad_norm": 1.1328125, "learning_rate": 0.0004666613409135429, "loss": 5.0076, "mean_token_accuracy": 0.20008007884025575, "num_tokens": 40542137.0, "step": 23380 }, { "entropy": 5.623146343231201, "epoch": 1.8194514685858783, "grad_norm": 1.2265625, "learning_rate": 0.0004666468214445072, "loss": 5.0489, "mean_token_accuracy": 0.19393593072891235, "num_tokens": 40550577.0, "step": 23385 }, { "entropy": 5.57143201828003, "epoch": 1.8198404979575957, "grad_norm": 1.15625, "learning_rate": 0.00046663229906753595, "loss": 5.0091, "mean_token_accuracy": 0.2025732308626175, "num_tokens": 40559203.0, "step": 23390 }, { "entropy": 5.57795205116272, "epoch": 1.8202295273293134, "grad_norm": 1.125, "learning_rate": 0.00046661777378284965, "loss": 4.9417, "mean_token_accuracy": 0.20421261042356492, "num_tokens": 40568254.0, "step": 23395 }, { "entropy": 5.6695321559906, "epoch": 1.820618556701031, "grad_norm": 1.1640625, "learning_rate": 0.0004666032455906685, "loss": 5.1121, "mean_token_accuracy": 0.19353146851062775, "num_tokens": 40576659.0, "step": 23400 }, { "entropy": 5.6467445373535154, "epoch": 1.8210075860727484, "grad_norm": 1.125, "learning_rate": 0.00046658871449121325, "loss": 5.0274, "mean_token_accuracy": 0.20692488700151443, "num_tokens": 40585544.0, "step": 23405 }, { "entropy": 5.588854885101318, "epoch": 1.821396615444466, "grad_norm": 1.09375, "learning_rate": 0.0004665741804847041, "loss": 5.0241, "mean_token_accuracy": 0.20389530211687087, "num_tokens": 40594763.0, "step": 23410 }, { "entropy": 5.560424137115478, "epoch": 1.8217856448161838, "grad_norm": 1.125, "learning_rate": 0.00046655964357136164, "loss": 5.0337, "mean_token_accuracy": 0.20090416222810745, "num_tokens": 40604350.0, "step": 23415 }, { "entropy": 5.60378589630127, "epoch": 1.822174674187901, "grad_norm": 1.1796875, "learning_rate": 0.00046654510375140657, "loss": 5.0282, "mean_token_accuracy": 0.1935052141547203, "num_tokens": 40612799.0, "step": 23420 }, { "entropy": 5.675509071350097, "epoch": 1.8225637035596187, "grad_norm": 1.1015625, "learning_rate": 0.0004665305610250594, "loss": 5.1203, "mean_token_accuracy": 0.19847144633531572, "num_tokens": 40621390.0, "step": 23425 }, { "entropy": 5.672425317764282, "epoch": 1.8229527329313364, "grad_norm": 1.1796875, "learning_rate": 0.0004665160153925408, "loss": 5.0845, "mean_token_accuracy": 0.19245277792215348, "num_tokens": 40629953.0, "step": 23430 }, { "entropy": 5.61926908493042, "epoch": 1.823341762303054, "grad_norm": 1.1640625, "learning_rate": 0.00046650146685407154, "loss": 5.0405, "mean_token_accuracy": 0.19744528830051422, "num_tokens": 40638663.0, "step": 23435 }, { "entropy": 5.688778734207153, "epoch": 1.8237307916747714, "grad_norm": 1.21875, "learning_rate": 0.00046648691540987226, "loss": 5.0896, "mean_token_accuracy": 0.19857471734285354, "num_tokens": 40647693.0, "step": 23440 }, { "entropy": 5.629212284088135, "epoch": 1.824119821046489, "grad_norm": 1.1328125, "learning_rate": 0.00046647236106016387, "loss": 5.1158, "mean_token_accuracy": 0.19051593095064162, "num_tokens": 40656300.0, "step": 23445 }, { "entropy": 5.619501829147339, "epoch": 1.8245088504182065, "grad_norm": 1.1171875, "learning_rate": 0.0004664578038051672, "loss": 4.977, "mean_token_accuracy": 0.20272729992866517, "num_tokens": 40664085.0, "step": 23450 }, { "entropy": 5.618737316131591, "epoch": 1.824897879789924, "grad_norm": 1.15625, "learning_rate": 0.000466443243645103, "loss": 5.0154, "mean_token_accuracy": 0.20505328774452208, "num_tokens": 40672510.0, "step": 23455 }, { "entropy": 5.687450313568116, "epoch": 1.8252869091616417, "grad_norm": 1.09375, "learning_rate": 0.0004664286805801923, "loss": 5.1136, "mean_token_accuracy": 0.2021819159388542, "num_tokens": 40681273.0, "step": 23460 }, { "entropy": 5.585610818862915, "epoch": 1.8256759385333594, "grad_norm": 1.15625, "learning_rate": 0.0004664141146106562, "loss": 4.9892, "mean_token_accuracy": 0.20094319730997084, "num_tokens": 40689336.0, "step": 23465 }, { "entropy": 5.628610324859619, "epoch": 1.8260649679050769, "grad_norm": 1.1796875, "learning_rate": 0.00046639954573671547, "loss": 4.9596, "mean_token_accuracy": 0.20481908768415452, "num_tokens": 40697557.0, "step": 23470 }, { "entropy": 5.612027740478515, "epoch": 1.8264539972767944, "grad_norm": 1.1015625, "learning_rate": 0.00046638497395859127, "loss": 5.0228, "mean_token_accuracy": 0.20712563395500183, "num_tokens": 40706129.0, "step": 23475 }, { "entropy": 5.563867855072021, "epoch": 1.826843026648512, "grad_norm": 1.1640625, "learning_rate": 0.0004663703992765047, "loss": 5.0002, "mean_token_accuracy": 0.20928830951452254, "num_tokens": 40714837.0, "step": 23480 }, { "entropy": 5.567662477493286, "epoch": 1.8272320560202295, "grad_norm": 1.109375, "learning_rate": 0.00046635582169067693, "loss": 4.9489, "mean_token_accuracy": 0.20544512271881105, "num_tokens": 40723300.0, "step": 23485 }, { "entropy": 5.574252080917359, "epoch": 1.827621085391947, "grad_norm": 1.1484375, "learning_rate": 0.00046634124120132915, "loss": 4.9343, "mean_token_accuracy": 0.20527570992708205, "num_tokens": 40732337.0, "step": 23490 }, { "entropy": 5.680656671524048, "epoch": 1.8280101147636647, "grad_norm": 1.1015625, "learning_rate": 0.0004663266578086826, "loss": 5.0452, "mean_token_accuracy": 0.19928997308015822, "num_tokens": 40741130.0, "step": 23495 }, { "entropy": 5.619625473022461, "epoch": 1.8283991441353822, "grad_norm": 1.171875, "learning_rate": 0.0004663120715129585, "loss": 5.0613, "mean_token_accuracy": 0.2007047563791275, "num_tokens": 40749686.0, "step": 23500 }, { "entropy": 5.625330400466919, "epoch": 1.8287881735070997, "grad_norm": 1.1953125, "learning_rate": 0.0004662974823143783, "loss": 5.0606, "mean_token_accuracy": 0.1989281490445137, "num_tokens": 40758181.0, "step": 23505 }, { "entropy": 5.6340419292449955, "epoch": 1.8291772028788174, "grad_norm": 1.0, "learning_rate": 0.0004662828902131632, "loss": 5.0581, "mean_token_accuracy": 0.20022480487823485, "num_tokens": 40767688.0, "step": 23510 }, { "entropy": 5.626961421966553, "epoch": 1.829566232250535, "grad_norm": 1.1015625, "learning_rate": 0.0004662682952095348, "loss": 5.0009, "mean_token_accuracy": 0.19939922094345092, "num_tokens": 40776242.0, "step": 23515 }, { "entropy": 5.568482112884522, "epoch": 1.8299552616222525, "grad_norm": 1.0546875, "learning_rate": 0.00046625369730371436, "loss": 4.9624, "mean_token_accuracy": 0.2056102216243744, "num_tokens": 40784806.0, "step": 23520 }, { "entropy": 5.570433950424194, "epoch": 1.83034429099397, "grad_norm": 1.1328125, "learning_rate": 0.0004662390964959235, "loss": 5.01, "mean_token_accuracy": 0.20464001297950746, "num_tokens": 40793823.0, "step": 23525 }, { "entropy": 5.581672954559326, "epoch": 1.8307333203656877, "grad_norm": 1.1171875, "learning_rate": 0.00046622449278638375, "loss": 4.9175, "mean_token_accuracy": 0.20923811346292495, "num_tokens": 40802243.0, "step": 23530 }, { "entropy": 5.601703643798828, "epoch": 1.8311223497374052, "grad_norm": 1.21875, "learning_rate": 0.0004662098861753167, "loss": 5.0802, "mean_token_accuracy": 0.19091252982616425, "num_tokens": 40810641.0, "step": 23535 }, { "entropy": 5.541178274154663, "epoch": 1.8315113791091227, "grad_norm": 1.21875, "learning_rate": 0.00046619527666294394, "loss": 4.9164, "mean_token_accuracy": 0.20411177724599838, "num_tokens": 40818967.0, "step": 23540 }, { "entropy": 5.668802261352539, "epoch": 1.8319004084808403, "grad_norm": 1.1875, "learning_rate": 0.0004661806642494872, "loss": 5.0333, "mean_token_accuracy": 0.19938068985939025, "num_tokens": 40827603.0, "step": 23545 }, { "entropy": 5.52700023651123, "epoch": 1.8322894378525578, "grad_norm": 1.1484375, "learning_rate": 0.0004661660489351681, "loss": 4.9225, "mean_token_accuracy": 0.20315391570329666, "num_tokens": 40836314.0, "step": 23550 }, { "entropy": 5.621227979660034, "epoch": 1.8326784672242753, "grad_norm": 1.15625, "learning_rate": 0.0004661514307202086, "loss": 5.1486, "mean_token_accuracy": 0.19572524577379227, "num_tokens": 40845559.0, "step": 23555 }, { "entropy": 5.6129528999328615, "epoch": 1.833067496595993, "grad_norm": 1.171875, "learning_rate": 0.00046613680960483036, "loss": 5.0313, "mean_token_accuracy": 0.19726206958293915, "num_tokens": 40853616.0, "step": 23560 }, { "entropy": 5.598602199554444, "epoch": 1.8334565259677107, "grad_norm": 1.0546875, "learning_rate": 0.0004661221855892552, "loss": 5.0809, "mean_token_accuracy": 0.20465305596590042, "num_tokens": 40862919.0, "step": 23565 }, { "entropy": 5.568418836593628, "epoch": 1.8338455553394282, "grad_norm": 1.046875, "learning_rate": 0.00046610755867370506, "loss": 5.0039, "mean_token_accuracy": 0.20334067940711975, "num_tokens": 40872301.0, "step": 23570 }, { "entropy": 5.632410335540771, "epoch": 1.8342345847111456, "grad_norm": 2.15625, "learning_rate": 0.000466092928858402, "loss": 4.9236, "mean_token_accuracy": 0.21323545277118683, "num_tokens": 40881964.0, "step": 23575 }, { "entropy": 5.648987770080566, "epoch": 1.8346236140828633, "grad_norm": 1.2421875, "learning_rate": 0.00046607829614356787, "loss": 5.0348, "mean_token_accuracy": 0.19798095226287843, "num_tokens": 40890801.0, "step": 23580 }, { "entropy": 5.596552133560181, "epoch": 1.8350126434545808, "grad_norm": 1.1875, "learning_rate": 0.0004660636605294247, "loss": 4.935, "mean_token_accuracy": 0.207064488530159, "num_tokens": 40899993.0, "step": 23585 }, { "entropy": 5.594598960876465, "epoch": 1.8354016728262983, "grad_norm": 1.1484375, "learning_rate": 0.0004660490220161946, "loss": 4.9838, "mean_token_accuracy": 0.2030389666557312, "num_tokens": 40908329.0, "step": 23590 }, { "entropy": 5.586009550094604, "epoch": 1.835790702198016, "grad_norm": 1.1875, "learning_rate": 0.00046603438060409966, "loss": 5.0982, "mean_token_accuracy": 0.19534702152013778, "num_tokens": 40916269.0, "step": 23595 }, { "entropy": 5.527313375473023, "epoch": 1.8361797315697335, "grad_norm": 1.1953125, "learning_rate": 0.000466019736293362, "loss": 4.9573, "mean_token_accuracy": 0.21106261610984803, "num_tokens": 40924962.0, "step": 23600 }, { "entropy": 5.516798877716065, "epoch": 1.836568760941451, "grad_norm": 1.1015625, "learning_rate": 0.00046600508908420396, "loss": 4.9326, "mean_token_accuracy": 0.20647090822458267, "num_tokens": 40933682.0, "step": 23605 }, { "entropy": 5.687616491317749, "epoch": 1.8369577903131686, "grad_norm": 1.171875, "learning_rate": 0.00046599043897684766, "loss": 5.1482, "mean_token_accuracy": 0.19332049489021302, "num_tokens": 40943718.0, "step": 23610 }, { "entropy": 5.617151355743408, "epoch": 1.8373468196848863, "grad_norm": 1.1484375, "learning_rate": 0.0004659757859715155, "loss": 5.0339, "mean_token_accuracy": 0.19302555173635483, "num_tokens": 40952480.0, "step": 23615 }, { "entropy": 5.629652118682861, "epoch": 1.8377358490566038, "grad_norm": 1.21875, "learning_rate": 0.00046596113006842975, "loss": 5.095, "mean_token_accuracy": 0.19981483966112137, "num_tokens": 40961439.0, "step": 23620 }, { "entropy": 5.632921409606934, "epoch": 1.8381248784283213, "grad_norm": 1.1953125, "learning_rate": 0.0004659464712678128, "loss": 4.9771, "mean_token_accuracy": 0.2003880113363266, "num_tokens": 40969882.0, "step": 23625 }, { "entropy": 5.576944780349732, "epoch": 1.838513907800039, "grad_norm": 1.109375, "learning_rate": 0.0004659318095698871, "loss": 5.0086, "mean_token_accuracy": 0.19245371371507644, "num_tokens": 40978685.0, "step": 23630 }, { "entropy": 5.5869471549987795, "epoch": 1.8389029371717565, "grad_norm": 1.015625, "learning_rate": 0.000465917144974875, "loss": 5.0212, "mean_token_accuracy": 0.2001183420419693, "num_tokens": 40987476.0, "step": 23635 }, { "entropy": 5.570794582366943, "epoch": 1.839291966543474, "grad_norm": 1.2421875, "learning_rate": 0.0004659024774829992, "loss": 4.9838, "mean_token_accuracy": 0.20841701328754425, "num_tokens": 40995754.0, "step": 23640 }, { "entropy": 5.577577924728393, "epoch": 1.8396809959151916, "grad_norm": 1.078125, "learning_rate": 0.000465887807094482, "loss": 4.973, "mean_token_accuracy": 0.20319348722696304, "num_tokens": 41004178.0, "step": 23645 }, { "entropy": 5.585713720321655, "epoch": 1.8400700252869093, "grad_norm": 1.09375, "learning_rate": 0.00046587313380954635, "loss": 5.066, "mean_token_accuracy": 0.19207748770713806, "num_tokens": 41013211.0, "step": 23650 }, { "entropy": 5.667567539215088, "epoch": 1.8404590546586266, "grad_norm": 1.0703125, "learning_rate": 0.00046585845762841453, "loss": 5.1578, "mean_token_accuracy": 0.19035876393318177, "num_tokens": 41021870.0, "step": 23655 }, { "entropy": 5.705098628997803, "epoch": 1.8408480840303443, "grad_norm": 1.1796875, "learning_rate": 0.0004658437785513095, "loss": 5.2162, "mean_token_accuracy": 0.19650598764419555, "num_tokens": 41031647.0, "step": 23660 }, { "entropy": 5.610191679000854, "epoch": 1.841237113402062, "grad_norm": 1.0546875, "learning_rate": 0.0004658290965784539, "loss": 5.0645, "mean_token_accuracy": 0.19747078716754912, "num_tokens": 41041296.0, "step": 23665 }, { "entropy": 5.656903505325317, "epoch": 1.8416261427737795, "grad_norm": 1.0859375, "learning_rate": 0.0004658144117100704, "loss": 5.1736, "mean_token_accuracy": 0.18967496752738952, "num_tokens": 41050716.0, "step": 23670 }, { "entropy": 5.634930372238159, "epoch": 1.842015172145497, "grad_norm": 1.2109375, "learning_rate": 0.00046579972394638204, "loss": 5.0474, "mean_token_accuracy": 0.19532993733882903, "num_tokens": 41058777.0, "step": 23675 }, { "entropy": 5.6296008110046385, "epoch": 1.8424042015172146, "grad_norm": 1.1484375, "learning_rate": 0.00046578503328761146, "loss": 5.0492, "mean_token_accuracy": 0.19758632332086562, "num_tokens": 41067779.0, "step": 23680 }, { "entropy": 5.593875408172607, "epoch": 1.842793230888932, "grad_norm": 1.171875, "learning_rate": 0.00046577033973398173, "loss": 4.9714, "mean_token_accuracy": 0.20478224605321885, "num_tokens": 41075349.0, "step": 23685 }, { "entropy": 5.603654861450195, "epoch": 1.8431822602606496, "grad_norm": 1.0859375, "learning_rate": 0.0004657556432857157, "loss": 5.0504, "mean_token_accuracy": 0.19663824290037155, "num_tokens": 41084340.0, "step": 23690 }, { "entropy": 5.569454383850098, "epoch": 1.8435712896323673, "grad_norm": 1.15625, "learning_rate": 0.0004657409439430364, "loss": 4.9947, "mean_token_accuracy": 0.20277228504419326, "num_tokens": 41093018.0, "step": 23695 }, { "entropy": 5.597228908538819, "epoch": 1.843960319004085, "grad_norm": 1.171875, "learning_rate": 0.0004657262417061669, "loss": 5.0048, "mean_token_accuracy": 0.20528214871883393, "num_tokens": 41101492.0, "step": 23700 }, { "entropy": 5.569350385665894, "epoch": 1.8443493483758022, "grad_norm": 1.0625, "learning_rate": 0.0004657115365753302, "loss": 5.0094, "mean_token_accuracy": 0.19747061729431153, "num_tokens": 41110373.0, "step": 23705 }, { "entropy": 5.623968029022217, "epoch": 1.84473837774752, "grad_norm": 1.1796875, "learning_rate": 0.00046569682855074953, "loss": 5.0879, "mean_token_accuracy": 0.19229544550180436, "num_tokens": 41119383.0, "step": 23710 }, { "entropy": 5.60439624786377, "epoch": 1.8451274071192376, "grad_norm": 1.140625, "learning_rate": 0.00046568211763264796, "loss": 5.0063, "mean_token_accuracy": 0.19818878471851348, "num_tokens": 41127055.0, "step": 23715 }, { "entropy": 5.650721311569214, "epoch": 1.845516436490955, "grad_norm": 1.015625, "learning_rate": 0.0004656674038212488, "loss": 5.1171, "mean_token_accuracy": 0.1911420091986656, "num_tokens": 41136428.0, "step": 23720 }, { "entropy": 5.676035308837891, "epoch": 1.8459054658626726, "grad_norm": 1.078125, "learning_rate": 0.00046565268711677525, "loss": 5.0348, "mean_token_accuracy": 0.19619891196489334, "num_tokens": 41145723.0, "step": 23725 }, { "entropy": 5.592716884613037, "epoch": 1.8462944952343903, "grad_norm": 1.28125, "learning_rate": 0.00046563796751945065, "loss": 5.0427, "mean_token_accuracy": 0.19297757297754287, "num_tokens": 41153998.0, "step": 23730 }, { "entropy": 5.521500158309936, "epoch": 1.8466835246061077, "grad_norm": 1.203125, "learning_rate": 0.00046562324502949834, "loss": 5.0099, "mean_token_accuracy": 0.20525648891925813, "num_tokens": 41162443.0, "step": 23735 }, { "entropy": 5.545340299606323, "epoch": 1.8470725539778252, "grad_norm": 1.125, "learning_rate": 0.0004656085196471416, "loss": 4.9173, "mean_token_accuracy": 0.20413196831941605, "num_tokens": 41171267.0, "step": 23740 }, { "entropy": 5.68914828300476, "epoch": 1.847461583349543, "grad_norm": 1.140625, "learning_rate": 0.00046559379137260404, "loss": 5.0937, "mean_token_accuracy": 0.1971474274992943, "num_tokens": 41179944.0, "step": 23745 }, { "entropy": 5.643242263793946, "epoch": 1.8478506127212606, "grad_norm": 1.1328125, "learning_rate": 0.000465579060206109, "loss": 5.0783, "mean_token_accuracy": 0.19258589148521424, "num_tokens": 41189038.0, "step": 23750 }, { "entropy": 5.706858205795288, "epoch": 1.8482396420929779, "grad_norm": 1.15625, "learning_rate": 0.00046556432614788015, "loss": 5.1096, "mean_token_accuracy": 0.19299572706222534, "num_tokens": 41197166.0, "step": 23755 }, { "entropy": 5.607342386245728, "epoch": 1.8486286714646956, "grad_norm": 1.15625, "learning_rate": 0.0004655495891981409, "loss": 4.9693, "mean_token_accuracy": 0.1990988716483116, "num_tokens": 41205708.0, "step": 23760 }, { "entropy": 5.673098468780518, "epoch": 1.8490177008364133, "grad_norm": 1.1484375, "learning_rate": 0.000465534849357115, "loss": 5.0947, "mean_token_accuracy": 0.19573987573385238, "num_tokens": 41214195.0, "step": 23765 }, { "entropy": 5.601473951339722, "epoch": 1.8494067302081307, "grad_norm": 1.0859375, "learning_rate": 0.00046552010662502595, "loss": 5.0233, "mean_token_accuracy": 0.1977492779493332, "num_tokens": 41223203.0, "step": 23770 }, { "entropy": 5.6286139488220215, "epoch": 1.8497957595798482, "grad_norm": 1.171875, "learning_rate": 0.0004655053610020976, "loss": 5.0373, "mean_token_accuracy": 0.20184979736804962, "num_tokens": 41231982.0, "step": 23775 }, { "entropy": 5.59403772354126, "epoch": 1.850184788951566, "grad_norm": 1.1328125, "learning_rate": 0.0004654906124885535, "loss": 5.0484, "mean_token_accuracy": 0.20151068717241288, "num_tokens": 41241355.0, "step": 23780 }, { "entropy": 5.711835527420044, "epoch": 1.8505738183232834, "grad_norm": 1.171875, "learning_rate": 0.0004654758610846176, "loss": 5.1699, "mean_token_accuracy": 0.18628573566675186, "num_tokens": 41250272.0, "step": 23785 }, { "entropy": 5.631198883056641, "epoch": 1.8509628476950009, "grad_norm": 1.1015625, "learning_rate": 0.0004654611067905137, "loss": 5.0412, "mean_token_accuracy": 0.19747087210416794, "num_tokens": 41258831.0, "step": 23790 }, { "entropy": 5.710073089599609, "epoch": 1.8513518770667186, "grad_norm": 1.15625, "learning_rate": 0.00046544634960646563, "loss": 5.1284, "mean_token_accuracy": 0.19221454560756684, "num_tokens": 41267344.0, "step": 23795 }, { "entropy": 5.658873653411865, "epoch": 1.8517409064384363, "grad_norm": 1.125, "learning_rate": 0.0004654315895326974, "loss": 5.0635, "mean_token_accuracy": 0.1972479298710823, "num_tokens": 41276207.0, "step": 23800 }, { "entropy": 5.616982269287109, "epoch": 1.8521299358101535, "grad_norm": 1.15625, "learning_rate": 0.0004654168265694328, "loss": 5.029, "mean_token_accuracy": 0.19278495907783508, "num_tokens": 41284286.0, "step": 23805 }, { "entropy": 5.600574016571045, "epoch": 1.8525189651818712, "grad_norm": 1.1640625, "learning_rate": 0.000465402060716896, "loss": 5.049, "mean_token_accuracy": 0.20046378672122955, "num_tokens": 41292998.0, "step": 23810 }, { "entropy": 5.623632287979126, "epoch": 1.852907994553589, "grad_norm": 1.171875, "learning_rate": 0.000465387291975311, "loss": 5.0264, "mean_token_accuracy": 0.20010250210762023, "num_tokens": 41301188.0, "step": 23815 }, { "entropy": 5.599987888336182, "epoch": 1.8532970239253064, "grad_norm": 1.1796875, "learning_rate": 0.00046537252034490185, "loss": 5.0315, "mean_token_accuracy": 0.19491710066795348, "num_tokens": 41310225.0, "step": 23820 }, { "entropy": 5.66416916847229, "epoch": 1.8536860532970239, "grad_norm": 1.125, "learning_rate": 0.00046535774582589275, "loss": 5.0299, "mean_token_accuracy": 0.19920175075531005, "num_tokens": 41319692.0, "step": 23825 }, { "entropy": 5.668254375457764, "epoch": 1.8540750826687415, "grad_norm": 1.1328125, "learning_rate": 0.00046534296841850776, "loss": 5.0604, "mean_token_accuracy": 0.20260425060987472, "num_tokens": 41327840.0, "step": 23830 }, { "entropy": 5.547959518432617, "epoch": 1.854464112040459, "grad_norm": 1.0859375, "learning_rate": 0.00046532818812297124, "loss": 5.0595, "mean_token_accuracy": 0.1955566644668579, "num_tokens": 41337734.0, "step": 23835 }, { "entropy": 5.573527574539185, "epoch": 1.8548531414121765, "grad_norm": 1.1171875, "learning_rate": 0.0004653134049395074, "loss": 5.0401, "mean_token_accuracy": 0.20796550810337067, "num_tokens": 41346237.0, "step": 23840 }, { "entropy": 5.601950645446777, "epoch": 1.8552421707838942, "grad_norm": 1.109375, "learning_rate": 0.0004652986188683406, "loss": 5.0068, "mean_token_accuracy": 0.20794565975666046, "num_tokens": 41355500.0, "step": 23845 }, { "entropy": 5.616783714294433, "epoch": 1.855631200155612, "grad_norm": 1.1875, "learning_rate": 0.00046528382990969504, "loss": 5.0416, "mean_token_accuracy": 0.1937785655260086, "num_tokens": 41364710.0, "step": 23850 }, { "entropy": 5.6291553497314455, "epoch": 1.8560202295273294, "grad_norm": 1.2890625, "learning_rate": 0.0004652690380637953, "loss": 5.022, "mean_token_accuracy": 0.20264870822429656, "num_tokens": 41372397.0, "step": 23855 }, { "entropy": 5.590443181991577, "epoch": 1.8564092588990468, "grad_norm": 1.0859375, "learning_rate": 0.0004652542433308657, "loss": 4.9535, "mean_token_accuracy": 0.20663865357637407, "num_tokens": 41381079.0, "step": 23860 }, { "entropy": 5.653665494918823, "epoch": 1.8567982882707645, "grad_norm": 1.1171875, "learning_rate": 0.0004652394457111309, "loss": 5.0623, "mean_token_accuracy": 0.20100135505199432, "num_tokens": 41390453.0, "step": 23865 }, { "entropy": 5.694218111038208, "epoch": 1.857187317642482, "grad_norm": 1.1640625, "learning_rate": 0.00046522464520481517, "loss": 5.0883, "mean_token_accuracy": 0.18989461958408355, "num_tokens": 41398971.0, "step": 23870 }, { "entropy": 5.648893737792969, "epoch": 1.8575763470141995, "grad_norm": 1.3515625, "learning_rate": 0.00046520984181214333, "loss": 5.0055, "mean_token_accuracy": 0.20288860946893691, "num_tokens": 41407459.0, "step": 23875 }, { "entropy": 5.566096591949463, "epoch": 1.8579653763859172, "grad_norm": 1.140625, "learning_rate": 0.0004651950355333398, "loss": 4.9911, "mean_token_accuracy": 0.19916386306285858, "num_tokens": 41416465.0, "step": 23880 }, { "entropy": 5.621599817276001, "epoch": 1.8583544057576347, "grad_norm": 1.140625, "learning_rate": 0.0004651802263686294, "loss": 5.1178, "mean_token_accuracy": 0.19879331439733505, "num_tokens": 41425362.0, "step": 23885 }, { "entropy": 5.588563394546509, "epoch": 1.8587434351293521, "grad_norm": 1.1796875, "learning_rate": 0.0004651654143182367, "loss": 5.0274, "mean_token_accuracy": 0.2020531788468361, "num_tokens": 41433758.0, "step": 23890 }, { "entropy": 5.5273370265960695, "epoch": 1.8591324645010698, "grad_norm": 1.125, "learning_rate": 0.0004651505993823866, "loss": 5.0124, "mean_token_accuracy": 0.20331908166408538, "num_tokens": 41442357.0, "step": 23895 }, { "entropy": 5.623252630233765, "epoch": 1.8595214938727875, "grad_norm": 1.140625, "learning_rate": 0.00046513578156130383, "loss": 4.9768, "mean_token_accuracy": 0.20437546372413634, "num_tokens": 41451257.0, "step": 23900 }, { "entropy": 5.624139404296875, "epoch": 1.859910523244505, "grad_norm": 1.09375, "learning_rate": 0.0004651209608552131, "loss": 5.0145, "mean_token_accuracy": 0.19945389479398729, "num_tokens": 41460499.0, "step": 23905 }, { "entropy": 5.669059467315674, "epoch": 1.8602995526162225, "grad_norm": 1.1328125, "learning_rate": 0.00046510613726433945, "loss": 5.0375, "mean_token_accuracy": 0.19725742936134338, "num_tokens": 41468365.0, "step": 23910 }, { "entropy": 5.695423650741577, "epoch": 1.8606885819879402, "grad_norm": 1.2421875, "learning_rate": 0.0004650913107889078, "loss": 5.0573, "mean_token_accuracy": 0.20205554515123367, "num_tokens": 41476538.0, "step": 23915 }, { "entropy": 5.642839622497559, "epoch": 1.8610776113596577, "grad_norm": 1.1015625, "learning_rate": 0.000465076481429143, "loss": 5.0917, "mean_token_accuracy": 0.188010773062706, "num_tokens": 41486310.0, "step": 23920 }, { "entropy": 5.61181869506836, "epoch": 1.8614666407313751, "grad_norm": 1.1640625, "learning_rate": 0.0004650616491852701, "loss": 5.0636, "mean_token_accuracy": 0.19182274341583253, "num_tokens": 41495015.0, "step": 23925 }, { "entropy": 5.651263618469239, "epoch": 1.8618556701030928, "grad_norm": 1.0546875, "learning_rate": 0.00046504681405751426, "loss": 5.1085, "mean_token_accuracy": 0.1996583253145218, "num_tokens": 41504440.0, "step": 23930 }, { "entropy": 5.569432735443115, "epoch": 1.8622446994748103, "grad_norm": 1.0703125, "learning_rate": 0.00046503197604610047, "loss": 4.9102, "mean_token_accuracy": 0.21530550420284272, "num_tokens": 41513143.0, "step": 23935 }, { "entropy": 5.642820930480957, "epoch": 1.8626337288465278, "grad_norm": 1.09375, "learning_rate": 0.00046501713515125393, "loss": 5.0334, "mean_token_accuracy": 0.20182627141475679, "num_tokens": 41522164.0, "step": 23940 }, { "entropy": 5.605938148498535, "epoch": 1.8630227582182455, "grad_norm": 1.3125, "learning_rate": 0.0004650022913731998, "loss": 5.0469, "mean_token_accuracy": 0.2042882576584816, "num_tokens": 41529456.0, "step": 23945 }, { "entropy": 5.512390041351319, "epoch": 1.8634117875899632, "grad_norm": 1.140625, "learning_rate": 0.00046498744471216335, "loss": 4.9696, "mean_token_accuracy": 0.202773018181324, "num_tokens": 41538536.0, "step": 23950 }, { "entropy": 5.6517863273620605, "epoch": 1.8638008169616807, "grad_norm": 1.09375, "learning_rate": 0.00046497259516836974, "loss": 5.053, "mean_token_accuracy": 0.20335968136787413, "num_tokens": 41547514.0, "step": 23955 }, { "entropy": 5.656624460220337, "epoch": 1.8641898463333981, "grad_norm": 1.1484375, "learning_rate": 0.00046495774274204446, "loss": 5.0365, "mean_token_accuracy": 0.19922229051589965, "num_tokens": 41555845.0, "step": 23960 }, { "entropy": 5.639614677429199, "epoch": 1.8645788757051158, "grad_norm": 1.0859375, "learning_rate": 0.0004649428874334127, "loss": 5.0114, "mean_token_accuracy": 0.2031002938747406, "num_tokens": 41565007.0, "step": 23965 }, { "entropy": 5.600994729995728, "epoch": 1.8649679050768333, "grad_norm": 1.125, "learning_rate": 0.0004649280292427, "loss": 4.992, "mean_token_accuracy": 0.19983874559402465, "num_tokens": 41574346.0, "step": 23970 }, { "entropy": 5.623596286773681, "epoch": 1.8653569344485508, "grad_norm": 1.1015625, "learning_rate": 0.0004649131681701318, "loss": 5.0753, "mean_token_accuracy": 0.19635965526103974, "num_tokens": 41583945.0, "step": 23975 }, { "entropy": 5.567094850540161, "epoch": 1.8657459638202685, "grad_norm": 1.1328125, "learning_rate": 0.00046489830421593347, "loss": 5.0142, "mean_token_accuracy": 0.20169115960597991, "num_tokens": 41591987.0, "step": 23980 }, { "entropy": 5.632329893112183, "epoch": 1.866134993191986, "grad_norm": 1.171875, "learning_rate": 0.0004648834373803307, "loss": 5.0588, "mean_token_accuracy": 0.1927157998085022, "num_tokens": 41600533.0, "step": 23985 }, { "entropy": 5.637715196609497, "epoch": 1.8665240225637034, "grad_norm": 1.296875, "learning_rate": 0.00046486856766354893, "loss": 4.9913, "mean_token_accuracy": 0.20404044538736343, "num_tokens": 41608567.0, "step": 23990 }, { "entropy": 5.6085264682769775, "epoch": 1.8669130519354211, "grad_norm": 1.1953125, "learning_rate": 0.00046485369506581387, "loss": 5.0178, "mean_token_accuracy": 0.19657496958971024, "num_tokens": 41616940.0, "step": 23995 }, { "entropy": 5.652847623825073, "epoch": 1.8673020813071388, "grad_norm": 1.1875, "learning_rate": 0.00046483881958735124, "loss": 5.0764, "mean_token_accuracy": 0.19929840117692948, "num_tokens": 41625230.0, "step": 24000 }, { "epoch": 1.8673020813071388, "eval_entropy": 5.375226250649416, "eval_loss": 5.086186408996582, "eval_mean_token_accuracy": 0.20648816128237185, "eval_num_tokens": 41625230.0, "eval_runtime": 21.7518, "eval_samples_per_second": 1910.558, "eval_steps_per_second": 238.831, "step": 24000 }, { "entropy": 5.575991296768189, "epoch": 1.8676911106788563, "grad_norm": 1.234375, "learning_rate": 0.00046482394122838663, "loss": 4.9779, "mean_token_accuracy": 0.19728079289197922, "num_tokens": 41634068.0, "step": 24005 }, { "entropy": 5.540875625610352, "epoch": 1.8680801400505738, "grad_norm": 1.21875, "learning_rate": 0.00046480905998914587, "loss": 4.9391, "mean_token_accuracy": 0.2106352776288986, "num_tokens": 41642512.0, "step": 24010 }, { "entropy": 5.5621195316314695, "epoch": 1.8684691694222915, "grad_norm": 1.1328125, "learning_rate": 0.0004647941758698547, "loss": 4.9989, "mean_token_accuracy": 0.2007884830236435, "num_tokens": 41651398.0, "step": 24015 }, { "entropy": 5.616655254364014, "epoch": 1.868858198794009, "grad_norm": 1.0546875, "learning_rate": 0.000464779288870739, "loss": 4.9799, "mean_token_accuracy": 0.20005956888198853, "num_tokens": 41661007.0, "step": 24020 }, { "entropy": 5.582627820968628, "epoch": 1.8692472281657264, "grad_norm": 1.0703125, "learning_rate": 0.00046476439899202464, "loss": 4.9766, "mean_token_accuracy": 0.20378190875053406, "num_tokens": 41669334.0, "step": 24025 }, { "entropy": 5.582896280288696, "epoch": 1.8696362575374441, "grad_norm": 1.140625, "learning_rate": 0.00046474950623393756, "loss": 5.0657, "mean_token_accuracy": 0.20612671971321106, "num_tokens": 41678061.0, "step": 24030 }, { "entropy": 5.62394642829895, "epoch": 1.8700252869091616, "grad_norm": 1.109375, "learning_rate": 0.0004647346105967038, "loss": 5.0657, "mean_token_accuracy": 0.19432123750448227, "num_tokens": 41687073.0, "step": 24035 }, { "entropy": 5.611329221725464, "epoch": 1.870414316280879, "grad_norm": 1.1953125, "learning_rate": 0.0004647197120805493, "loss": 5.0081, "mean_token_accuracy": 0.199280446767807, "num_tokens": 41694952.0, "step": 24040 }, { "entropy": 5.605014133453369, "epoch": 1.8708033456525968, "grad_norm": 1.234375, "learning_rate": 0.00046470481068570013, "loss": 5.0103, "mean_token_accuracy": 0.19463880956172944, "num_tokens": 41703621.0, "step": 24045 }, { "entropy": 5.5716217994689945, "epoch": 1.8711923750243145, "grad_norm": 1.1171875, "learning_rate": 0.0004646899064123824, "loss": 4.988, "mean_token_accuracy": 0.20291805118322373, "num_tokens": 41712811.0, "step": 24050 }, { "entropy": 5.567281818389892, "epoch": 1.871581404396032, "grad_norm": 1.140625, "learning_rate": 0.0004646749992608223, "loss": 4.973, "mean_token_accuracy": 0.19884432703256608, "num_tokens": 41721774.0, "step": 24055 }, { "entropy": 5.528051042556763, "epoch": 1.8719704337677494, "grad_norm": 1.2109375, "learning_rate": 0.0004646600892312459, "loss": 4.963, "mean_token_accuracy": 0.19842429906129838, "num_tokens": 41729928.0, "step": 24060 }, { "entropy": 5.520887613296509, "epoch": 1.872359463139467, "grad_norm": 1.0703125, "learning_rate": 0.0004646451763238796, "loss": 4.9289, "mean_token_accuracy": 0.2041843444108963, "num_tokens": 41738946.0, "step": 24065 }, { "entropy": 5.6467499256134035, "epoch": 1.8727484925111846, "grad_norm": 1.1171875, "learning_rate": 0.0004646302605389496, "loss": 4.9915, "mean_token_accuracy": 0.2024302214384079, "num_tokens": 41747184.0, "step": 24070 }, { "entropy": 5.548565769195557, "epoch": 1.873137521882902, "grad_norm": 1.0546875, "learning_rate": 0.0004646153418766822, "loss": 4.9504, "mean_token_accuracy": 0.20846169888973237, "num_tokens": 41756231.0, "step": 24075 }, { "entropy": 5.602645683288574, "epoch": 1.8735265512546198, "grad_norm": 1.1171875, "learning_rate": 0.00046460042033730377, "loss": 5.1428, "mean_token_accuracy": 0.19349369555711746, "num_tokens": 41765870.0, "step": 24080 }, { "entropy": 5.5710245132446286, "epoch": 1.8739155806263375, "grad_norm": 1.1328125, "learning_rate": 0.0004645854959210408, "loss": 4.9378, "mean_token_accuracy": 0.209228079020977, "num_tokens": 41774443.0, "step": 24085 }, { "entropy": 5.575962257385254, "epoch": 1.8743046099980547, "grad_norm": 1.1953125, "learning_rate": 0.00046457056862811956, "loss": 4.9311, "mean_token_accuracy": 0.2094591960310936, "num_tokens": 41782925.0, "step": 24090 }, { "entropy": 5.604145479202271, "epoch": 1.8746936393697724, "grad_norm": 1.203125, "learning_rate": 0.0004645556384587668, "loss": 5.0379, "mean_token_accuracy": 0.20371678620576858, "num_tokens": 41791293.0, "step": 24095 }, { "entropy": 5.598045349121094, "epoch": 1.87508266874149, "grad_norm": 1.2890625, "learning_rate": 0.0004645407054132089, "loss": 4.902, "mean_token_accuracy": 0.2176859363913536, "num_tokens": 41800122.0, "step": 24100 }, { "entropy": 5.640039300918579, "epoch": 1.8754716981132076, "grad_norm": 1.2265625, "learning_rate": 0.0004645257694916725, "loss": 5.069, "mean_token_accuracy": 0.20053231120109558, "num_tokens": 41808426.0, "step": 24105 }, { "entropy": 5.61688494682312, "epoch": 1.875860727484925, "grad_norm": 1.0703125, "learning_rate": 0.0004645108306943842, "loss": 5.0046, "mean_token_accuracy": 0.1989349290728569, "num_tokens": 41817228.0, "step": 24110 }, { "entropy": 5.575835752487182, "epoch": 1.8762497568566427, "grad_norm": 1.09375, "learning_rate": 0.0004644958890215707, "loss": 5.0102, "mean_token_accuracy": 0.2041890040040016, "num_tokens": 41825711.0, "step": 24115 }, { "entropy": 5.675631189346314, "epoch": 1.8766387862283602, "grad_norm": 1.2109375, "learning_rate": 0.0004644809444734586, "loss": 5.0984, "mean_token_accuracy": 0.18770757913589478, "num_tokens": 41833976.0, "step": 24120 }, { "entropy": 5.611126375198364, "epoch": 1.8770278156000777, "grad_norm": 1.1484375, "learning_rate": 0.00046446599705027487, "loss": 5.0187, "mean_token_accuracy": 0.20637762397527695, "num_tokens": 41842180.0, "step": 24125 }, { "entropy": 5.583420848846435, "epoch": 1.8774168449717954, "grad_norm": 1.234375, "learning_rate": 0.00046445104675224607, "loss": 4.9956, "mean_token_accuracy": 0.20120240449905397, "num_tokens": 41850470.0, "step": 24130 }, { "entropy": 5.542023801803589, "epoch": 1.877805874343513, "grad_norm": 1.2109375, "learning_rate": 0.0004644360935795993, "loss": 4.9891, "mean_token_accuracy": 0.2058403104543686, "num_tokens": 41859036.0, "step": 24135 }, { "entropy": 5.68872857093811, "epoch": 1.8781949037152303, "grad_norm": 1.1953125, "learning_rate": 0.00046442113753256126, "loss": 5.0977, "mean_token_accuracy": 0.19448558390140533, "num_tokens": 41867918.0, "step": 24140 }, { "entropy": 5.619909763336182, "epoch": 1.878583933086948, "grad_norm": 1.171875, "learning_rate": 0.00046440617861135905, "loss": 5.0744, "mean_token_accuracy": 0.19753012657165528, "num_tokens": 41877281.0, "step": 24145 }, { "entropy": 5.544361972808838, "epoch": 1.8789729624586657, "grad_norm": 1.03125, "learning_rate": 0.0004643912168162194, "loss": 5.0084, "mean_token_accuracy": 0.20197461545467377, "num_tokens": 41885991.0, "step": 24150 }, { "entropy": 5.638756275177002, "epoch": 1.8793619918303832, "grad_norm": 1.125, "learning_rate": 0.0004643762521473696, "loss": 5.0686, "mean_token_accuracy": 0.1996283620595932, "num_tokens": 41894318.0, "step": 24155 }, { "entropy": 5.665662097930908, "epoch": 1.8797510212021007, "grad_norm": 1.1328125, "learning_rate": 0.0004643612846050366, "loss": 5.0835, "mean_token_accuracy": 0.20223896354436874, "num_tokens": 41902026.0, "step": 24160 }, { "entropy": 5.609949350357056, "epoch": 1.8801400505738184, "grad_norm": 1.140625, "learning_rate": 0.00046434631418944744, "loss": 5.126, "mean_token_accuracy": 0.1919356033205986, "num_tokens": 41910210.0, "step": 24165 }, { "entropy": 5.678350877761841, "epoch": 1.8805290799455359, "grad_norm": 1.21875, "learning_rate": 0.0004643313409008294, "loss": 5.007, "mean_token_accuracy": 0.20774077475070954, "num_tokens": 41917959.0, "step": 24170 }, { "entropy": 5.641670989990234, "epoch": 1.8809181093172533, "grad_norm": 1.1875, "learning_rate": 0.00046431636473940956, "loss": 5.0862, "mean_token_accuracy": 0.19739083647727967, "num_tokens": 41928079.0, "step": 24175 }, { "entropy": 5.648298740386963, "epoch": 1.881307138688971, "grad_norm": 1.078125, "learning_rate": 0.0004643013857054152, "loss": 5.0316, "mean_token_accuracy": 0.20122355967760086, "num_tokens": 41936681.0, "step": 24180 }, { "entropy": 5.6649078845977785, "epoch": 1.8816961680606887, "grad_norm": 1.0703125, "learning_rate": 0.00046428640379907367, "loss": 5.0976, "mean_token_accuracy": 0.19612004309892656, "num_tokens": 41945013.0, "step": 24185 }, { "entropy": 5.569679069519043, "epoch": 1.882085197432406, "grad_norm": 1.171875, "learning_rate": 0.00046427141902061225, "loss": 4.9987, "mean_token_accuracy": 0.19731379449367523, "num_tokens": 41953753.0, "step": 24190 }, { "entropy": 5.589600372314453, "epoch": 1.8824742268041237, "grad_norm": 1.1015625, "learning_rate": 0.0004642564313702582, "loss": 5.0121, "mean_token_accuracy": 0.19985999912023544, "num_tokens": 41962755.0, "step": 24195 }, { "entropy": 5.557780790328979, "epoch": 1.8828632561758414, "grad_norm": 1.2109375, "learning_rate": 0.00046424144084823916, "loss": 4.8907, "mean_token_accuracy": 0.2116768553853035, "num_tokens": 41970648.0, "step": 24200 }, { "entropy": 5.623630952835083, "epoch": 1.8832522855475589, "grad_norm": 1.1015625, "learning_rate": 0.0004642264474547824, "loss": 4.9874, "mean_token_accuracy": 0.20694733858108522, "num_tokens": 41978805.0, "step": 24205 }, { "entropy": 5.587182569503784, "epoch": 1.8836413149192763, "grad_norm": 1.234375, "learning_rate": 0.00046421145119011556, "loss": 4.9849, "mean_token_accuracy": 0.20310329049825668, "num_tokens": 41987076.0, "step": 24210 }, { "entropy": 5.660914564132691, "epoch": 1.884030344290994, "grad_norm": 1.1484375, "learning_rate": 0.000464196452054466, "loss": 5.045, "mean_token_accuracy": 0.19886306822299957, "num_tokens": 41996316.0, "step": 24215 }, { "entropy": 5.670384454727173, "epoch": 1.8844193736627115, "grad_norm": 1.1171875, "learning_rate": 0.0004641814500480615, "loss": 5.0568, "mean_token_accuracy": 0.20068604201078416, "num_tokens": 42005058.0, "step": 24220 }, { "entropy": 5.6745490550994875, "epoch": 1.884808403034429, "grad_norm": 1.1796875, "learning_rate": 0.0004641664451711296, "loss": 4.9586, "mean_token_accuracy": 0.20423104614019394, "num_tokens": 42013355.0, "step": 24225 }, { "entropy": 5.663799095153808, "epoch": 1.8851974324061467, "grad_norm": 1.296875, "learning_rate": 0.00046415143742389793, "loss": 5.1233, "mean_token_accuracy": 0.19698395282030107, "num_tokens": 42021346.0, "step": 24230 }, { "entropy": 5.599025392532349, "epoch": 1.8855864617778644, "grad_norm": 1.015625, "learning_rate": 0.0004641364268065943, "loss": 5.0619, "mean_token_accuracy": 0.19144562929868697, "num_tokens": 42030407.0, "step": 24235 }, { "entropy": 5.6245129108428955, "epoch": 1.8859754911495816, "grad_norm": 1.0546875, "learning_rate": 0.00046412141331944644, "loss": 4.9939, "mean_token_accuracy": 0.1960299700498581, "num_tokens": 42038933.0, "step": 24240 }, { "entropy": 5.727528047561646, "epoch": 1.8863645205212993, "grad_norm": 1.140625, "learning_rate": 0.00046410639696268206, "loss": 5.0785, "mean_token_accuracy": 0.19513828605413436, "num_tokens": 42047395.0, "step": 24245 }, { "entropy": 5.635821294784546, "epoch": 1.886753549893017, "grad_norm": 1.1484375, "learning_rate": 0.0004640913777365292, "loss": 5.1239, "mean_token_accuracy": 0.19163146167993544, "num_tokens": 42056141.0, "step": 24250 }, { "entropy": 5.666148948669433, "epoch": 1.8871425792647345, "grad_norm": 1.1640625, "learning_rate": 0.00046407635564121565, "loss": 5.0576, "mean_token_accuracy": 0.19990883469581605, "num_tokens": 42064059.0, "step": 24255 }, { "entropy": 5.700064468383789, "epoch": 1.887531608636452, "grad_norm": 1.1171875, "learning_rate": 0.00046406133067696936, "loss": 5.1453, "mean_token_accuracy": 0.1920527085661888, "num_tokens": 42073350.0, "step": 24260 }, { "entropy": 5.653461551666259, "epoch": 1.8879206380081697, "grad_norm": 1.171875, "learning_rate": 0.0004640463028440182, "loss": 5.0762, "mean_token_accuracy": 0.19621252864599228, "num_tokens": 42082033.0, "step": 24265 }, { "entropy": 5.594650316238403, "epoch": 1.8883096673798871, "grad_norm": 1.09375, "learning_rate": 0.0004640312721425904, "loss": 5.0198, "mean_token_accuracy": 0.20000164657831193, "num_tokens": 42090974.0, "step": 24270 }, { "entropy": 5.715928459167481, "epoch": 1.8886986967516046, "grad_norm": 1.171875, "learning_rate": 0.0004640162385729139, "loss": 5.0918, "mean_token_accuracy": 0.19750449508428575, "num_tokens": 42100605.0, "step": 24275 }, { "entropy": 5.645242691040039, "epoch": 1.8890877261233223, "grad_norm": 1.1953125, "learning_rate": 0.0004640012021352168, "loss": 4.9234, "mean_token_accuracy": 0.209676830470562, "num_tokens": 42108892.0, "step": 24280 }, { "entropy": 5.60062346458435, "epoch": 1.88947675549504, "grad_norm": 1.125, "learning_rate": 0.0004639861628297273, "loss": 5.028, "mean_token_accuracy": 0.19674924463033677, "num_tokens": 42117706.0, "step": 24285 }, { "entropy": 5.6008713722229, "epoch": 1.8898657848667575, "grad_norm": 1.09375, "learning_rate": 0.00046397112065667354, "loss": 5.1059, "mean_token_accuracy": 0.19407981634140015, "num_tokens": 42127194.0, "step": 24290 }, { "entropy": 5.576604509353638, "epoch": 1.890254814238475, "grad_norm": 1.125, "learning_rate": 0.00046395607561628387, "loss": 5.0109, "mean_token_accuracy": 0.1982605293393135, "num_tokens": 42135349.0, "step": 24295 }, { "entropy": 5.613498401641846, "epoch": 1.8906438436101927, "grad_norm": 1.140625, "learning_rate": 0.00046394102770878643, "loss": 4.9845, "mean_token_accuracy": 0.19908467233181, "num_tokens": 42144173.0, "step": 24300 }, { "entropy": 5.540602731704712, "epoch": 1.8910328729819101, "grad_norm": 1.1640625, "learning_rate": 0.00046392597693440974, "loss": 4.9816, "mean_token_accuracy": 0.2097703531384468, "num_tokens": 42153076.0, "step": 24305 }, { "entropy": 5.570808410644531, "epoch": 1.8914219023536276, "grad_norm": 1.1796875, "learning_rate": 0.0004639109232933819, "loss": 4.9725, "mean_token_accuracy": 0.20130694210529326, "num_tokens": 42161821.0, "step": 24310 }, { "entropy": 5.55162034034729, "epoch": 1.8918109317253453, "grad_norm": 1.1484375, "learning_rate": 0.0004638958667859316, "loss": 4.9291, "mean_token_accuracy": 0.20706473290920258, "num_tokens": 42170892.0, "step": 24315 }, { "entropy": 5.6717630386352536, "epoch": 1.8921999610970628, "grad_norm": 1.296875, "learning_rate": 0.0004638808074122872, "loss": 5.1098, "mean_token_accuracy": 0.18956306278705598, "num_tokens": 42180084.0, "step": 24320 }, { "entropy": 5.6500293731689455, "epoch": 1.8925889904687803, "grad_norm": 1.1171875, "learning_rate": 0.0004638657451726771, "loss": 5.0162, "mean_token_accuracy": 0.20576262027025222, "num_tokens": 42188992.0, "step": 24325 }, { "entropy": 5.674073171615601, "epoch": 1.892978019840498, "grad_norm": 1.0546875, "learning_rate": 0.00046385068006732995, "loss": 5.0518, "mean_token_accuracy": 0.20046926587820052, "num_tokens": 42197833.0, "step": 24330 }, { "entropy": 5.6073997020721436, "epoch": 1.8933670492122157, "grad_norm": 1.1640625, "learning_rate": 0.00046383561209647437, "loss": 4.9573, "mean_token_accuracy": 0.21329436004161834, "num_tokens": 42206599.0, "step": 24335 }, { "entropy": 5.535683059692383, "epoch": 1.8937560785839331, "grad_norm": 1.1640625, "learning_rate": 0.00046382054126033884, "loss": 4.9792, "mean_token_accuracy": 0.20395016819238662, "num_tokens": 42214673.0, "step": 24340 }, { "entropy": 5.561068916320801, "epoch": 1.8941451079556506, "grad_norm": 1.28125, "learning_rate": 0.0004638054675591523, "loss": 4.9802, "mean_token_accuracy": 0.2017168954014778, "num_tokens": 42223848.0, "step": 24345 }, { "entropy": 5.628382444381714, "epoch": 1.8945341373273683, "grad_norm": 1.1484375, "learning_rate": 0.0004637903909931432, "loss": 5.0092, "mean_token_accuracy": 0.20288896709680557, "num_tokens": 42232548.0, "step": 24350 }, { "entropy": 5.660288667678833, "epoch": 1.8949231666990858, "grad_norm": 1.1875, "learning_rate": 0.0004637753115625404, "loss": 5.0325, "mean_token_accuracy": 0.2049438863992691, "num_tokens": 42240882.0, "step": 24355 }, { "entropy": 5.604740142822266, "epoch": 1.8953121960708033, "grad_norm": 1.1328125, "learning_rate": 0.0004637602292675726, "loss": 5.0086, "mean_token_accuracy": 0.2000296786427498, "num_tokens": 42249487.0, "step": 24360 }, { "entropy": 5.607293033599854, "epoch": 1.895701225442521, "grad_norm": 1.1015625, "learning_rate": 0.0004637451441084689, "loss": 5.0783, "mean_token_accuracy": 0.199790620803833, "num_tokens": 42258859.0, "step": 24365 }, { "entropy": 5.671412420272827, "epoch": 1.8960902548142384, "grad_norm": 1.1015625, "learning_rate": 0.0004637300560854581, "loss": 5.1093, "mean_token_accuracy": 0.19099180400371552, "num_tokens": 42267492.0, "step": 24370 }, { "entropy": 5.604776525497437, "epoch": 1.896479284185956, "grad_norm": 1.140625, "learning_rate": 0.000463714965198769, "loss": 5.0206, "mean_token_accuracy": 0.19726796597242355, "num_tokens": 42276046.0, "step": 24375 }, { "entropy": 5.629160737991333, "epoch": 1.8968683135576736, "grad_norm": 1.109375, "learning_rate": 0.0004636998714486307, "loss": 5.0052, "mean_token_accuracy": 0.19947371631860733, "num_tokens": 42284992.0, "step": 24380 }, { "entropy": 5.611885356903076, "epoch": 1.8972573429293913, "grad_norm": 1.0859375, "learning_rate": 0.00046368477483527224, "loss": 5.034, "mean_token_accuracy": 0.19951482117176056, "num_tokens": 42294803.0, "step": 24385 }, { "entropy": 5.661969327926636, "epoch": 1.8976463723011088, "grad_norm": 1.109375, "learning_rate": 0.0004636696753589226, "loss": 5.0406, "mean_token_accuracy": 0.1995529517531395, "num_tokens": 42303329.0, "step": 24390 }, { "entropy": 5.623769617080688, "epoch": 1.8980354016728263, "grad_norm": 1.1328125, "learning_rate": 0.0004636545730198109, "loss": 5.0048, "mean_token_accuracy": 0.20047936737537383, "num_tokens": 42311745.0, "step": 24395 }, { "entropy": 5.6326172828674315, "epoch": 1.898424431044544, "grad_norm": 1.1484375, "learning_rate": 0.00046363946781816643, "loss": 5.0758, "mean_token_accuracy": 0.19763122946023942, "num_tokens": 42320295.0, "step": 24400 }, { "entropy": 5.674953889846802, "epoch": 1.8988134604162614, "grad_norm": 1.25, "learning_rate": 0.00046362435975421816, "loss": 5.0594, "mean_token_accuracy": 0.20674734562635422, "num_tokens": 42328703.0, "step": 24405 }, { "entropy": 5.597205543518067, "epoch": 1.899202489787979, "grad_norm": 1.109375, "learning_rate": 0.00046360924882819554, "loss": 5.0166, "mean_token_accuracy": 0.20198270082473754, "num_tokens": 42338338.0, "step": 24410 }, { "entropy": 5.693012475967407, "epoch": 1.8995915191596966, "grad_norm": 1.1484375, "learning_rate": 0.0004635941350403277, "loss": 5.0654, "mean_token_accuracy": 0.19830695986747743, "num_tokens": 42347223.0, "step": 24415 }, { "entropy": 5.640581035614014, "epoch": 1.899980548531414, "grad_norm": 1.1953125, "learning_rate": 0.0004635790183908442, "loss": 5.0113, "mean_token_accuracy": 0.2077213779091835, "num_tokens": 42355827.0, "step": 24420 }, { "entropy": 5.623261165618897, "epoch": 1.9003695779031315, "grad_norm": 1.0859375, "learning_rate": 0.00046356389887997415, "loss": 5.0494, "mean_token_accuracy": 0.19702430367469786, "num_tokens": 42363985.0, "step": 24425 }, { "entropy": 5.669466257095337, "epoch": 1.9007586072748492, "grad_norm": 1.234375, "learning_rate": 0.00046354877650794707, "loss": 5.0734, "mean_token_accuracy": 0.20064836144447326, "num_tokens": 42372280.0, "step": 24430 }, { "entropy": 5.654238843917847, "epoch": 1.901147636646567, "grad_norm": 1.09375, "learning_rate": 0.00046353365127499235, "loss": 5.0991, "mean_token_accuracy": 0.18549738079309464, "num_tokens": 42381238.0, "step": 24435 }, { "entropy": 5.634921932220459, "epoch": 1.9015366660182844, "grad_norm": 1.1875, "learning_rate": 0.0004635185231813396, "loss": 5.0581, "mean_token_accuracy": 0.1985452026128769, "num_tokens": 42389609.0, "step": 24440 }, { "entropy": 5.658938264846801, "epoch": 1.901925695390002, "grad_norm": 1.2421875, "learning_rate": 0.0004635033922272183, "loss": 4.9751, "mean_token_accuracy": 0.20129372775554658, "num_tokens": 42397502.0, "step": 24445 }, { "entropy": 5.687984323501587, "epoch": 1.9023147247617196, "grad_norm": 1.2578125, "learning_rate": 0.00046348825841285813, "loss": 5.084, "mean_token_accuracy": 0.1942368522286415, "num_tokens": 42405566.0, "step": 24450 }, { "entropy": 5.605263757705688, "epoch": 1.902703754133437, "grad_norm": 1.0078125, "learning_rate": 0.0004634731217384886, "loss": 5.1049, "mean_token_accuracy": 0.19701357334852218, "num_tokens": 42414367.0, "step": 24455 }, { "entropy": 5.649328947067261, "epoch": 1.9030927835051545, "grad_norm": 1.1875, "learning_rate": 0.0004634579822043394, "loss": 5.0998, "mean_token_accuracy": 0.19335432797670365, "num_tokens": 42422889.0, "step": 24460 }, { "entropy": 5.672682046890259, "epoch": 1.9034818128768722, "grad_norm": 1.09375, "learning_rate": 0.00046344283981064035, "loss": 5.0852, "mean_token_accuracy": 0.19481225311756134, "num_tokens": 42432069.0, "step": 24465 }, { "entropy": 5.622801160812378, "epoch": 1.90387084224859, "grad_norm": 1.125, "learning_rate": 0.00046342769455762114, "loss": 5.0373, "mean_token_accuracy": 0.19998427778482436, "num_tokens": 42440509.0, "step": 24470 }, { "entropy": 5.598542499542236, "epoch": 1.9042598716203072, "grad_norm": 1.1640625, "learning_rate": 0.0004634125464455116, "loss": 5.0293, "mean_token_accuracy": 0.19778774976730346, "num_tokens": 42448889.0, "step": 24475 }, { "entropy": 5.525557136535644, "epoch": 1.9046489009920249, "grad_norm": 1.109375, "learning_rate": 0.00046339739547454146, "loss": 4.8921, "mean_token_accuracy": 0.21493522673845292, "num_tokens": 42457379.0, "step": 24480 }, { "entropy": 5.668351411819458, "epoch": 1.9050379303637426, "grad_norm": 1.1796875, "learning_rate": 0.00046338224164494074, "loss": 5.0915, "mean_token_accuracy": 0.19329685866832733, "num_tokens": 42466114.0, "step": 24485 }, { "entropy": 5.648586416244507, "epoch": 1.90542695973546, "grad_norm": 1.125, "learning_rate": 0.00046336708495693933, "loss": 5.0332, "mean_token_accuracy": 0.1925637423992157, "num_tokens": 42475734.0, "step": 24490 }, { "entropy": 5.554257822036743, "epoch": 1.9058159891071775, "grad_norm": 1.1640625, "learning_rate": 0.00046335192541076725, "loss": 4.9196, "mean_token_accuracy": 0.21054467111825942, "num_tokens": 42484007.0, "step": 24495 }, { "entropy": 5.51367220878601, "epoch": 1.9062050184788952, "grad_norm": 1.125, "learning_rate": 0.0004633367630066545, "loss": 4.9637, "mean_token_accuracy": 0.20452889651060105, "num_tokens": 42493157.0, "step": 24500 }, { "entropy": 5.658606243133545, "epoch": 1.9065940478506127, "grad_norm": 1.15625, "learning_rate": 0.00046332159774483116, "loss": 5.023, "mean_token_accuracy": 0.20212386250495912, "num_tokens": 42501389.0, "step": 24505 }, { "entropy": 5.618350076675415, "epoch": 1.9069830772223302, "grad_norm": 1.1484375, "learning_rate": 0.0004633064296255273, "loss": 5.0224, "mean_token_accuracy": 0.20227981209754944, "num_tokens": 42509624.0, "step": 24510 }, { "entropy": 5.607503604888916, "epoch": 1.9073721065940479, "grad_norm": 1.140625, "learning_rate": 0.00046329125864897307, "loss": 5.0619, "mean_token_accuracy": 0.19819847792387008, "num_tokens": 42518193.0, "step": 24515 }, { "entropy": 5.607752513885498, "epoch": 1.9077611359657656, "grad_norm": 1.3046875, "learning_rate": 0.0004632760848153987, "loss": 5.03, "mean_token_accuracy": 0.2017349973320961, "num_tokens": 42526641.0, "step": 24520 }, { "entropy": 5.611910963058472, "epoch": 1.9081501653374828, "grad_norm": 1.125, "learning_rate": 0.0004632609081250345, "loss": 5.1167, "mean_token_accuracy": 0.19755523204803466, "num_tokens": 42535263.0, "step": 24525 }, { "entropy": 5.710028553009034, "epoch": 1.9085391947092005, "grad_norm": 1.1953125, "learning_rate": 0.00046324572857811054, "loss": 5.0929, "mean_token_accuracy": 0.2026426076889038, "num_tokens": 42544465.0, "step": 24530 }, { "entropy": 5.65536789894104, "epoch": 1.9089282240809182, "grad_norm": 1.109375, "learning_rate": 0.0004632305461748573, "loss": 5.1013, "mean_token_accuracy": 0.19924804717302322, "num_tokens": 42553198.0, "step": 24535 }, { "entropy": 5.589033555984497, "epoch": 1.9093172534526357, "grad_norm": 1.1875, "learning_rate": 0.00046321536091550517, "loss": 4.9221, "mean_token_accuracy": 0.21182842403650284, "num_tokens": 42562014.0, "step": 24540 }, { "entropy": 5.62154746055603, "epoch": 1.9097062828243532, "grad_norm": 1.171875, "learning_rate": 0.0004632001728002845, "loss": 4.9597, "mean_token_accuracy": 0.2019475668668747, "num_tokens": 42570966.0, "step": 24545 }, { "entropy": 5.645296335220337, "epoch": 1.9100953121960709, "grad_norm": 1.2109375, "learning_rate": 0.0004631849818294257, "loss": 5.0565, "mean_token_accuracy": 0.20051083862781524, "num_tokens": 42579939.0, "step": 24550 }, { "entropy": 5.600928401947021, "epoch": 1.9104843415677883, "grad_norm": 1.1953125, "learning_rate": 0.00046316978800315934, "loss": 5.0037, "mean_token_accuracy": 0.1961117386817932, "num_tokens": 42588874.0, "step": 24555 }, { "entropy": 5.583487272262573, "epoch": 1.9108733709395058, "grad_norm": 1.0625, "learning_rate": 0.000463154591321716, "loss": 4.987, "mean_token_accuracy": 0.20640987008810044, "num_tokens": 42597632.0, "step": 24560 }, { "entropy": 5.536374187469482, "epoch": 1.9112624003112235, "grad_norm": 1.0703125, "learning_rate": 0.00046313939178532624, "loss": 4.8972, "mean_token_accuracy": 0.20970050543546676, "num_tokens": 42606240.0, "step": 24565 }, { "entropy": 5.6503900527954105, "epoch": 1.9116514296829412, "grad_norm": 1.1640625, "learning_rate": 0.0004631241893942206, "loss": 5.0129, "mean_token_accuracy": 0.20256012231111525, "num_tokens": 42614713.0, "step": 24570 }, { "entropy": 5.574986600875855, "epoch": 1.9120404590546585, "grad_norm": 1.1328125, "learning_rate": 0.00046310898414862983, "loss": 4.9537, "mean_token_accuracy": 0.20438385903835296, "num_tokens": 42623123.0, "step": 24575 }, { "entropy": 5.627835702896118, "epoch": 1.9124294884263762, "grad_norm": 1.109375, "learning_rate": 0.0004630937760487847, "loss": 5.1357, "mean_token_accuracy": 0.19106125831604004, "num_tokens": 42632056.0, "step": 24580 }, { "entropy": 5.592078924179077, "epoch": 1.9128185177980939, "grad_norm": 1.109375, "learning_rate": 0.0004630785650949158, "loss": 5.0172, "mean_token_accuracy": 0.19737221598625182, "num_tokens": 42640809.0, "step": 24585 }, { "entropy": 5.578227186203003, "epoch": 1.9132075471698113, "grad_norm": 1.1015625, "learning_rate": 0.0004630633512872541, "loss": 4.9613, "mean_token_accuracy": 0.1996218129992485, "num_tokens": 42649378.0, "step": 24590 }, { "entropy": 5.618298625946045, "epoch": 1.9135965765415288, "grad_norm": 1.1015625, "learning_rate": 0.00046304813462603035, "loss": 4.9946, "mean_token_accuracy": 0.20309585332870483, "num_tokens": 42658895.0, "step": 24595 }, { "entropy": 5.599772930145264, "epoch": 1.9139856059132465, "grad_norm": 1.1640625, "learning_rate": 0.0004630329151114754, "loss": 4.9477, "mean_token_accuracy": 0.20456584095954894, "num_tokens": 42666867.0, "step": 24600 }, { "entropy": 5.573085784912109, "epoch": 1.914374635284964, "grad_norm": 1.1015625, "learning_rate": 0.00046301769274382034, "loss": 5.0896, "mean_token_accuracy": 0.18964345306158065, "num_tokens": 42676101.0, "step": 24605 }, { "entropy": 5.696787357330322, "epoch": 1.9147636646566815, "grad_norm": 1.140625, "learning_rate": 0.0004630024675232961, "loss": 5.1144, "mean_token_accuracy": 0.1930241495370865, "num_tokens": 42685773.0, "step": 24610 }, { "entropy": 5.679801988601684, "epoch": 1.9151526940283992, "grad_norm": 1.09375, "learning_rate": 0.00046298723945013354, "loss": 5.0123, "mean_token_accuracy": 0.21010109633207322, "num_tokens": 42694640.0, "step": 24615 }, { "entropy": 5.659233236312867, "epoch": 1.9155417234001169, "grad_norm": 1.171875, "learning_rate": 0.0004629720085245639, "loss": 5.0655, "mean_token_accuracy": 0.19480959922075272, "num_tokens": 42703883.0, "step": 24620 }, { "entropy": 5.59961838722229, "epoch": 1.9159307527718341, "grad_norm": 1.1796875, "learning_rate": 0.0004629567747468182, "loss": 4.9725, "mean_token_accuracy": 0.20743289589881897, "num_tokens": 42712623.0, "step": 24625 }, { "entropy": 5.598846530914306, "epoch": 1.9163197821435518, "grad_norm": 1.171875, "learning_rate": 0.0004629415381171276, "loss": 5.0353, "mean_token_accuracy": 0.2015077769756317, "num_tokens": 42721052.0, "step": 24630 }, { "entropy": 5.65079550743103, "epoch": 1.9167088115152695, "grad_norm": 1.1171875, "learning_rate": 0.00046292629863572325, "loss": 5.0222, "mean_token_accuracy": 0.20417391061782836, "num_tokens": 42729866.0, "step": 24635 }, { "entropy": 5.679056167602539, "epoch": 1.917097840886987, "grad_norm": 1.0703125, "learning_rate": 0.0004629110563028365, "loss": 5.1825, "mean_token_accuracy": 0.19206285923719407, "num_tokens": 42740127.0, "step": 24640 }, { "entropy": 5.646302986145019, "epoch": 1.9174868702587045, "grad_norm": 1.1328125, "learning_rate": 0.0004628958111186985, "loss": 5.0623, "mean_token_accuracy": 0.1969013601541519, "num_tokens": 42748427.0, "step": 24645 }, { "entropy": 5.6928942680358885, "epoch": 1.9178758996304222, "grad_norm": 1.2734375, "learning_rate": 0.0004628805630835407, "loss": 5.1357, "mean_token_accuracy": 0.19276100099086763, "num_tokens": 42756864.0, "step": 24650 }, { "entropy": 5.66128454208374, "epoch": 1.9182649290021396, "grad_norm": 1.109375, "learning_rate": 0.0004628653121975944, "loss": 5.0796, "mean_token_accuracy": 0.1954493835568428, "num_tokens": 42765636.0, "step": 24655 }, { "entropy": 5.636631441116333, "epoch": 1.918653958373857, "grad_norm": 1.109375, "learning_rate": 0.000462850058461091, "loss": 5.0311, "mean_token_accuracy": 0.20000417828559874, "num_tokens": 42774486.0, "step": 24660 }, { "entropy": 5.630409049987793, "epoch": 1.9190429877455748, "grad_norm": 1.09375, "learning_rate": 0.0004628348018742619, "loss": 4.9785, "mean_token_accuracy": 0.20318261831998824, "num_tokens": 42783281.0, "step": 24665 }, { "entropy": 5.593532705307007, "epoch": 1.9194320171172925, "grad_norm": 1.1953125, "learning_rate": 0.0004628195424373387, "loss": 4.9994, "mean_token_accuracy": 0.20536266416311263, "num_tokens": 42791710.0, "step": 24670 }, { "entropy": 5.554297256469726, "epoch": 1.91982104648901, "grad_norm": 1.1796875, "learning_rate": 0.00046280428015055286, "loss": 5.0257, "mean_token_accuracy": 0.19954635798931122, "num_tokens": 42799670.0, "step": 24675 }, { "entropy": 5.599506759643555, "epoch": 1.9202100758607274, "grad_norm": 1.171875, "learning_rate": 0.00046278901501413606, "loss": 5.077, "mean_token_accuracy": 0.19978390336036683, "num_tokens": 42808279.0, "step": 24680 }, { "entropy": 5.65127272605896, "epoch": 1.9205991052324451, "grad_norm": 1.15625, "learning_rate": 0.00046277374702831983, "loss": 5.0154, "mean_token_accuracy": 0.19719365239143372, "num_tokens": 42816818.0, "step": 24685 }, { "entropy": 5.658857011795044, "epoch": 1.9209881346041626, "grad_norm": 1.1015625, "learning_rate": 0.00046275847619333576, "loss": 5.058, "mean_token_accuracy": 0.19376415610313416, "num_tokens": 42826270.0, "step": 24690 }, { "entropy": 5.704193162918091, "epoch": 1.92137716397588, "grad_norm": 1.171875, "learning_rate": 0.00046274320250941576, "loss": 5.1144, "mean_token_accuracy": 0.19637055695056915, "num_tokens": 42835396.0, "step": 24695 }, { "entropy": 5.6632579326629635, "epoch": 1.9217661933475978, "grad_norm": 1.1796875, "learning_rate": 0.00046272792597679146, "loss": 5.0483, "mean_token_accuracy": 0.19475603997707366, "num_tokens": 42844184.0, "step": 24700 }, { "entropy": 5.637825059890747, "epoch": 1.9221552227193153, "grad_norm": 1.2265625, "learning_rate": 0.00046271264659569474, "loss": 5.0561, "mean_token_accuracy": 0.19995171427726746, "num_tokens": 42852323.0, "step": 24705 }, { "entropy": 5.5610185146331785, "epoch": 1.9225442520910327, "grad_norm": 1.2109375, "learning_rate": 0.0004626973643663573, "loss": 4.8911, "mean_token_accuracy": 0.21082558184862138, "num_tokens": 42860843.0, "step": 24710 }, { "entropy": 5.6457319259643555, "epoch": 1.9229332814627504, "grad_norm": 1.09375, "learning_rate": 0.0004626820792890112, "loss": 5.0098, "mean_token_accuracy": 0.19838268756866456, "num_tokens": 42869508.0, "step": 24715 }, { "entropy": 5.583624267578125, "epoch": 1.9233223108344681, "grad_norm": 1.1484375, "learning_rate": 0.0004626667913638882, "loss": 4.9511, "mean_token_accuracy": 0.20015075355768203, "num_tokens": 42878142.0, "step": 24720 }, { "entropy": 5.627728891372681, "epoch": 1.9237113402061856, "grad_norm": 1.140625, "learning_rate": 0.0004626515005912203, "loss": 4.9801, "mean_token_accuracy": 0.20185617357492447, "num_tokens": 42886562.0, "step": 24725 }, { "entropy": 5.618095016479492, "epoch": 1.924100369577903, "grad_norm": 1.1171875, "learning_rate": 0.0004626362069712397, "loss": 5.0237, "mean_token_accuracy": 0.2044566586613655, "num_tokens": 42895243.0, "step": 24730 }, { "entropy": 5.551434087753296, "epoch": 1.9244893989496208, "grad_norm": 1.1328125, "learning_rate": 0.0004626209105041782, "loss": 4.9499, "mean_token_accuracy": 0.20748575329780578, "num_tokens": 42904129.0, "step": 24735 }, { "entropy": 5.486058139801026, "epoch": 1.9248784283213383, "grad_norm": 1.09375, "learning_rate": 0.000462605611190268, "loss": 4.8695, "mean_token_accuracy": 0.2155091032385826, "num_tokens": 42913053.0, "step": 24740 }, { "entropy": 5.582480573654175, "epoch": 1.9252674576930557, "grad_norm": 1.09375, "learning_rate": 0.00046259030902974133, "loss": 5.0416, "mean_token_accuracy": 0.20138343870639802, "num_tokens": 42921925.0, "step": 24745 }, { "entropy": 5.618669700622559, "epoch": 1.9256564870647734, "grad_norm": 1.0859375, "learning_rate": 0.0004625750040228302, "loss": 5.0175, "mean_token_accuracy": 0.20188248455524443, "num_tokens": 42931225.0, "step": 24750 }, { "entropy": 5.654020166397094, "epoch": 1.926045516436491, "grad_norm": 1.125, "learning_rate": 0.00046255969616976704, "loss": 5.069, "mean_token_accuracy": 0.19711742848157882, "num_tokens": 42940594.0, "step": 24755 }, { "entropy": 5.573828268051147, "epoch": 1.9264345458082084, "grad_norm": 1.1875, "learning_rate": 0.000462544385470784, "loss": 4.9478, "mean_token_accuracy": 0.20198239982128144, "num_tokens": 42948883.0, "step": 24760 }, { "entropy": 5.606162881851196, "epoch": 1.926823575179926, "grad_norm": 1.1875, "learning_rate": 0.0004625290719261134, "loss": 5.0523, "mean_token_accuracy": 0.19790069460868837, "num_tokens": 42957315.0, "step": 24765 }, { "entropy": 5.620489501953125, "epoch": 1.9272126045516438, "grad_norm": 1.109375, "learning_rate": 0.0004625137555359876, "loss": 4.9901, "mean_token_accuracy": 0.20735580027103423, "num_tokens": 42966460.0, "step": 24770 }, { "entropy": 5.6660316467285154, "epoch": 1.9276016339233613, "grad_norm": 1.1953125, "learning_rate": 0.00046249843630063905, "loss": 5.1326, "mean_token_accuracy": 0.18913318514823912, "num_tokens": 42975177.0, "step": 24775 }, { "entropy": 5.648400783538818, "epoch": 1.9279906632950787, "grad_norm": 1.2578125, "learning_rate": 0.0004624831142203001, "loss": 5.0563, "mean_token_accuracy": 0.1988622546195984, "num_tokens": 42983456.0, "step": 24780 }, { "entropy": 5.6128623485565186, "epoch": 1.9283796926667964, "grad_norm": 1.1875, "learning_rate": 0.00046246778929520346, "loss": 5.0012, "mean_token_accuracy": 0.20673609524965286, "num_tokens": 42992398.0, "step": 24785 }, { "entropy": 5.549891948699951, "epoch": 1.928768722038514, "grad_norm": 1.1640625, "learning_rate": 0.0004624524615255814, "loss": 4.828, "mean_token_accuracy": 0.21897414922714234, "num_tokens": 43000630.0, "step": 24790 }, { "entropy": 5.581707286834717, "epoch": 1.9291577514102314, "grad_norm": 1.15625, "learning_rate": 0.00046243713091166655, "loss": 5.0911, "mean_token_accuracy": 0.19989578574895858, "num_tokens": 43009166.0, "step": 24795 }, { "entropy": 5.588793134689331, "epoch": 1.929546780781949, "grad_norm": 1.296875, "learning_rate": 0.0004624217974536916, "loss": 5.0149, "mean_token_accuracy": 0.20191770941019058, "num_tokens": 43017152.0, "step": 24800 }, { "entropy": 5.6290717124938965, "epoch": 1.9299358101536666, "grad_norm": 1.1484375, "learning_rate": 0.00046240646115188925, "loss": 5.0167, "mean_token_accuracy": 0.20349715203046798, "num_tokens": 43026161.0, "step": 24805 }, { "entropy": 5.694434785842896, "epoch": 1.930324839525384, "grad_norm": 1.2421875, "learning_rate": 0.0004623911220064921, "loss": 5.0834, "mean_token_accuracy": 0.19844716936349868, "num_tokens": 43034257.0, "step": 24810 }, { "entropy": 5.555358982086181, "epoch": 1.9307138688971017, "grad_norm": 1.0859375, "learning_rate": 0.00046237578001773297, "loss": 4.9361, "mean_token_accuracy": 0.20811618864536285, "num_tokens": 43043842.0, "step": 24815 }, { "entropy": 5.623932981491089, "epoch": 1.9311028982688194, "grad_norm": 1.125, "learning_rate": 0.00046236043518584454, "loss": 5.0534, "mean_token_accuracy": 0.205864380300045, "num_tokens": 43052479.0, "step": 24820 }, { "entropy": 5.652993249893188, "epoch": 1.931491927640537, "grad_norm": 1.125, "learning_rate": 0.0004623450875110597, "loss": 5.0616, "mean_token_accuracy": 0.19825852513313294, "num_tokens": 43061948.0, "step": 24825 }, { "entropy": 5.599682140350342, "epoch": 1.9318809570122544, "grad_norm": 1.1328125, "learning_rate": 0.00046232973699361147, "loss": 5.0048, "mean_token_accuracy": 0.19991534501314162, "num_tokens": 43070395.0, "step": 24830 }, { "entropy": 5.505357885360718, "epoch": 1.932269986383972, "grad_norm": 1.2265625, "learning_rate": 0.0004623143836337326, "loss": 4.9256, "mean_token_accuracy": 0.1985604152083397, "num_tokens": 43079209.0, "step": 24835 }, { "entropy": 5.612361907958984, "epoch": 1.9326590157556895, "grad_norm": 1.1484375, "learning_rate": 0.00046229902743165607, "loss": 5.1397, "mean_token_accuracy": 0.19236479550600052, "num_tokens": 43088275.0, "step": 24840 }, { "entropy": 5.656156206130982, "epoch": 1.933048045127407, "grad_norm": 1.125, "learning_rate": 0.0004622836683876149, "loss": 5.0424, "mean_token_accuracy": 0.19812537729740143, "num_tokens": 43097239.0, "step": 24845 }, { "entropy": 5.651016807556152, "epoch": 1.9334370744991247, "grad_norm": 1.109375, "learning_rate": 0.0004622683065018422, "loss": 5.1077, "mean_token_accuracy": 0.18665484338998795, "num_tokens": 43106081.0, "step": 24850 }, { "entropy": 5.597801923751831, "epoch": 1.9338261038708422, "grad_norm": 1.0703125, "learning_rate": 0.00046225294177457105, "loss": 5.0693, "mean_token_accuracy": 0.19591110348701476, "num_tokens": 43116056.0, "step": 24855 }, { "entropy": 5.671476554870606, "epoch": 1.9342151332425597, "grad_norm": 1.0859375, "learning_rate": 0.00046223757420603445, "loss": 4.9952, "mean_token_accuracy": 0.208236400783062, "num_tokens": 43124945.0, "step": 24860 }, { "entropy": 5.681667423248291, "epoch": 1.9346041626142774, "grad_norm": 1.1171875, "learning_rate": 0.0004622222037964658, "loss": 5.0241, "mean_token_accuracy": 0.20116529762744903, "num_tokens": 43134038.0, "step": 24865 }, { "entropy": 5.598711442947388, "epoch": 1.934993191985995, "grad_norm": 1.1640625, "learning_rate": 0.00046220683054609815, "loss": 4.9636, "mean_token_accuracy": 0.20030059814453124, "num_tokens": 43142296.0, "step": 24870 }, { "entropy": 5.623720264434814, "epoch": 1.9353822213577125, "grad_norm": 1.0703125, "learning_rate": 0.00046219145445516483, "loss": 4.9603, "mean_token_accuracy": 0.20603508055210112, "num_tokens": 43151789.0, "step": 24875 }, { "entropy": 5.649555778503418, "epoch": 1.93577125072943, "grad_norm": 1.09375, "learning_rate": 0.00046217607552389905, "loss": 5.1087, "mean_token_accuracy": 0.19947748631238937, "num_tokens": 43160876.0, "step": 24880 }, { "entropy": 5.654290628433228, "epoch": 1.9361602801011477, "grad_norm": 1.28125, "learning_rate": 0.00046216069375253435, "loss": 5.0046, "mean_token_accuracy": 0.20651188790798186, "num_tokens": 43169377.0, "step": 24885 }, { "entropy": 5.593468856811524, "epoch": 1.9365493094728652, "grad_norm": 1.2265625, "learning_rate": 0.000462145309141304, "loss": 4.9978, "mean_token_accuracy": 0.20554946660995482, "num_tokens": 43177468.0, "step": 24890 }, { "entropy": 5.615224456787109, "epoch": 1.9369383388445827, "grad_norm": 1.140625, "learning_rate": 0.0004621299216904414, "loss": 4.998, "mean_token_accuracy": 0.20471084266901016, "num_tokens": 43186350.0, "step": 24895 }, { "entropy": 5.551385688781738, "epoch": 1.9373273682163004, "grad_norm": 1.1484375, "learning_rate": 0.00046211453140018006, "loss": 4.9913, "mean_token_accuracy": 0.1963523030281067, "num_tokens": 43195124.0, "step": 24900 }, { "entropy": 5.591964149475098, "epoch": 1.937716397588018, "grad_norm": 1.1484375, "learning_rate": 0.0004620991382707537, "loss": 4.9955, "mean_token_accuracy": 0.20457567572593688, "num_tokens": 43203617.0, "step": 24905 }, { "entropy": 5.529897975921631, "epoch": 1.9381054269597353, "grad_norm": 1.1796875, "learning_rate": 0.00046208374230239556, "loss": 4.8769, "mean_token_accuracy": 0.2080569237470627, "num_tokens": 43212790.0, "step": 24910 }, { "entropy": 5.630673265457153, "epoch": 1.938494456331453, "grad_norm": 1.203125, "learning_rate": 0.0004620683434953394, "loss": 5.0345, "mean_token_accuracy": 0.20583195686340333, "num_tokens": 43221185.0, "step": 24915 }, { "entropy": 5.6958580493927, "epoch": 1.9388834857031707, "grad_norm": 1.2578125, "learning_rate": 0.00046205294184981896, "loss": 5.1428, "mean_token_accuracy": 0.1950034096837044, "num_tokens": 43230524.0, "step": 24920 }, { "entropy": 5.632674741744995, "epoch": 1.9392725150748882, "grad_norm": 1.15625, "learning_rate": 0.00046203753736606787, "loss": 5.0027, "mean_token_accuracy": 0.2101844295859337, "num_tokens": 43239171.0, "step": 24925 }, { "entropy": 5.556626272201538, "epoch": 1.9396615444466057, "grad_norm": 1.1484375, "learning_rate": 0.0004620221300443197, "loss": 4.9993, "mean_token_accuracy": 0.20043401271104813, "num_tokens": 43247553.0, "step": 24930 }, { "entropy": 5.534998607635498, "epoch": 1.9400505738183234, "grad_norm": 1.0703125, "learning_rate": 0.0004620067198848086, "loss": 4.9513, "mean_token_accuracy": 0.2006531447172165, "num_tokens": 43256127.0, "step": 24935 }, { "entropy": 5.611560201644897, "epoch": 1.9404396031900408, "grad_norm": 1.1171875, "learning_rate": 0.00046199130688776805, "loss": 5.0549, "mean_token_accuracy": 0.19863448590040206, "num_tokens": 43264959.0, "step": 24940 }, { "entropy": 5.609650468826294, "epoch": 1.9408286325617583, "grad_norm": 1.15625, "learning_rate": 0.00046197589105343204, "loss": 5.0083, "mean_token_accuracy": 0.2046726554632187, "num_tokens": 43273465.0, "step": 24945 }, { "entropy": 5.642408752441407, "epoch": 1.941217661933476, "grad_norm": 1.1171875, "learning_rate": 0.0004619604723820345, "loss": 4.9922, "mean_token_accuracy": 0.2026524692773819, "num_tokens": 43282027.0, "step": 24950 }, { "entropy": 5.635498428344727, "epoch": 1.9416066913051937, "grad_norm": 1.109375, "learning_rate": 0.0004619450508738094, "loss": 4.9941, "mean_token_accuracy": 0.19632991552352905, "num_tokens": 43291202.0, "step": 24955 }, { "entropy": 5.678465080261231, "epoch": 1.941995720676911, "grad_norm": 1.1484375, "learning_rate": 0.00046192962652899056, "loss": 5.0316, "mean_token_accuracy": 0.20204724222421647, "num_tokens": 43299594.0, "step": 24960 }, { "entropy": 5.506816720962524, "epoch": 1.9423847500486286, "grad_norm": 1.2265625, "learning_rate": 0.00046191419934781236, "loss": 4.8516, "mean_token_accuracy": 0.21347858160734176, "num_tokens": 43307775.0, "step": 24965 }, { "entropy": 5.594444942474365, "epoch": 1.9427737794203463, "grad_norm": 1.109375, "learning_rate": 0.0004618987693305086, "loss": 5.0052, "mean_token_accuracy": 0.19163881987333298, "num_tokens": 43316737.0, "step": 24970 }, { "entropy": 5.585969686508179, "epoch": 1.9431628087920638, "grad_norm": 1.09375, "learning_rate": 0.0004618833364773135, "loss": 4.8849, "mean_token_accuracy": 0.21105848848819733, "num_tokens": 43325220.0, "step": 24975 }, { "entropy": 5.672573614120483, "epoch": 1.9435518381637813, "grad_norm": 1.140625, "learning_rate": 0.00046186790078846127, "loss": 5.0727, "mean_token_accuracy": 0.19802486896514893, "num_tokens": 43333957.0, "step": 24980 }, { "entropy": 5.6479820728302, "epoch": 1.943940867535499, "grad_norm": 1.109375, "learning_rate": 0.00046185246226418603, "loss": 5.0444, "mean_token_accuracy": 0.1979891300201416, "num_tokens": 43342668.0, "step": 24985 }, { "entropy": 5.573852252960205, "epoch": 1.9443298969072165, "grad_norm": 1.0546875, "learning_rate": 0.00046183702090472206, "loss": 5.0239, "mean_token_accuracy": 0.20102375745773315, "num_tokens": 43351805.0, "step": 24990 }, { "entropy": 5.583888339996338, "epoch": 1.944718926278934, "grad_norm": 1.09375, "learning_rate": 0.0004618215767103037, "loss": 4.9774, "mean_token_accuracy": 0.1992226868867874, "num_tokens": 43360184.0, "step": 24995 }, { "entropy": 5.58269853591919, "epoch": 1.9451079556506516, "grad_norm": 1.140625, "learning_rate": 0.0004618061296811653, "loss": 5.0696, "mean_token_accuracy": 0.19429562240839005, "num_tokens": 43368576.0, "step": 25000 }, { "entropy": 5.619055843353271, "epoch": 1.9454969850223693, "grad_norm": 1.1640625, "learning_rate": 0.00046179067981754124, "loss": 4.9834, "mean_token_accuracy": 0.1975250646471977, "num_tokens": 43377561.0, "step": 25005 }, { "entropy": 5.576317691802979, "epoch": 1.9458860143940866, "grad_norm": 1.15625, "learning_rate": 0.00046177522711966584, "loss": 5.0159, "mean_token_accuracy": 0.20405238270759582, "num_tokens": 43386276.0, "step": 25010 }, { "entropy": 5.57113561630249, "epoch": 1.9462750437658043, "grad_norm": 1.1953125, "learning_rate": 0.00046175977158777377, "loss": 4.9919, "mean_token_accuracy": 0.19586019963026047, "num_tokens": 43394753.0, "step": 25015 }, { "entropy": 5.554373025894165, "epoch": 1.946664073137522, "grad_norm": 1.1875, "learning_rate": 0.0004617443132220993, "loss": 4.9446, "mean_token_accuracy": 0.21379523128271102, "num_tokens": 43403462.0, "step": 25020 }, { "entropy": 5.654671144485474, "epoch": 1.9470531025092395, "grad_norm": 1.0859375, "learning_rate": 0.00046172885202287717, "loss": 4.9907, "mean_token_accuracy": 0.19641466289758683, "num_tokens": 43412192.0, "step": 25025 }, { "entropy": 5.642926788330078, "epoch": 1.947442131880957, "grad_norm": 1.1328125, "learning_rate": 0.00046171338799034194, "loss": 5.0438, "mean_token_accuracy": 0.20044593662023544, "num_tokens": 43421273.0, "step": 25030 }, { "entropy": 5.694089794158936, "epoch": 1.9478311612526746, "grad_norm": 1.140625, "learning_rate": 0.0004616979211247282, "loss": 5.1391, "mean_token_accuracy": 0.19465840756893157, "num_tokens": 43430257.0, "step": 25035 }, { "entropy": 5.630743789672851, "epoch": 1.9482201906243921, "grad_norm": 1.203125, "learning_rate": 0.00046168245142627065, "loss": 5.0433, "mean_token_accuracy": 0.19577836841344834, "num_tokens": 43438258.0, "step": 25040 }, { "entropy": 5.649375867843628, "epoch": 1.9486092199961096, "grad_norm": 1.140625, "learning_rate": 0.0004616669788952041, "loss": 4.9692, "mean_token_accuracy": 0.2058025762438774, "num_tokens": 43447221.0, "step": 25045 }, { "entropy": 5.599972152709961, "epoch": 1.9489982493678273, "grad_norm": 1.203125, "learning_rate": 0.00046165150353176315, "loss": 4.9486, "mean_token_accuracy": 0.20481569468975067, "num_tokens": 43455909.0, "step": 25050 }, { "entropy": 5.6341465473175045, "epoch": 1.949387278739545, "grad_norm": 1.125, "learning_rate": 0.0004616360253361828, "loss": 5.1049, "mean_token_accuracy": 0.19357359260320664, "num_tokens": 43464262.0, "step": 25055 }, { "entropy": 5.647072744369507, "epoch": 1.9497763081112622, "grad_norm": 1.34375, "learning_rate": 0.00046162054430869777, "loss": 4.9725, "mean_token_accuracy": 0.20909491926431656, "num_tokens": 43472897.0, "step": 25060 }, { "entropy": 5.699408292770386, "epoch": 1.95016533748298, "grad_norm": 1.2109375, "learning_rate": 0.000461605060449543, "loss": 5.1164, "mean_token_accuracy": 0.19576744139194488, "num_tokens": 43481714.0, "step": 25065 }, { "entropy": 5.520859909057617, "epoch": 1.9505543668546976, "grad_norm": 1.15625, "learning_rate": 0.00046158957375895353, "loss": 4.9541, "mean_token_accuracy": 0.20298203229904174, "num_tokens": 43490032.0, "step": 25070 }, { "entropy": 5.580363702774048, "epoch": 1.950943396226415, "grad_norm": 1.1171875, "learning_rate": 0.0004615740842371643, "loss": 5.0228, "mean_token_accuracy": 0.1948147863149643, "num_tokens": 43498466.0, "step": 25075 }, { "entropy": 5.639126348495483, "epoch": 1.9513324255981326, "grad_norm": 1.125, "learning_rate": 0.00046155859188441023, "loss": 5.0295, "mean_token_accuracy": 0.2060020700097084, "num_tokens": 43506874.0, "step": 25080 }, { "entropy": 5.59894871711731, "epoch": 1.9517214549698503, "grad_norm": 1.109375, "learning_rate": 0.0004615430967009265, "loss": 4.9828, "mean_token_accuracy": 0.20507294535636902, "num_tokens": 43515657.0, "step": 25085 }, { "entropy": 5.603897523880005, "epoch": 1.9521104843415678, "grad_norm": 1.1875, "learning_rate": 0.00046152759868694815, "loss": 5.0331, "mean_token_accuracy": 0.20148796439170838, "num_tokens": 43524934.0, "step": 25090 }, { "entropy": 5.669860076904297, "epoch": 1.9524995137132852, "grad_norm": 1.0625, "learning_rate": 0.0004615120978427104, "loss": 5.0674, "mean_token_accuracy": 0.19333964139223098, "num_tokens": 43533988.0, "step": 25095 }, { "entropy": 5.677996635437012, "epoch": 1.952888543085003, "grad_norm": 1.0859375, "learning_rate": 0.0004614965941684485, "loss": 5.0298, "mean_token_accuracy": 0.2044929727911949, "num_tokens": 43542868.0, "step": 25100 }, { "entropy": 5.674543476104736, "epoch": 1.9532775724567206, "grad_norm": 1.171875, "learning_rate": 0.0004614810876643975, "loss": 5.119, "mean_token_accuracy": 0.19272132813930512, "num_tokens": 43552577.0, "step": 25105 }, { "entropy": 5.6838987350463865, "epoch": 1.953666601828438, "grad_norm": 1.046875, "learning_rate": 0.00046146557833079286, "loss": 5.0709, "mean_token_accuracy": 0.1969879686832428, "num_tokens": 43562088.0, "step": 25110 }, { "entropy": 5.641274070739746, "epoch": 1.9540556312001556, "grad_norm": 1.1953125, "learning_rate": 0.0004614500661678698, "loss": 5.0629, "mean_token_accuracy": 0.19834199249744416, "num_tokens": 43570268.0, "step": 25115 }, { "entropy": 5.647603845596313, "epoch": 1.9544446605718733, "grad_norm": 1.1640625, "learning_rate": 0.0004614345511758639, "loss": 5.0524, "mean_token_accuracy": 0.20309446901082992, "num_tokens": 43578751.0, "step": 25120 }, { "entropy": 5.6244651794433596, "epoch": 1.9548336899435907, "grad_norm": 1.1875, "learning_rate": 0.00046141903335501034, "loss": 4.957, "mean_token_accuracy": 0.2006782680749893, "num_tokens": 43588229.0, "step": 25125 }, { "entropy": 5.557975769042969, "epoch": 1.9552227193153082, "grad_norm": 1.15625, "learning_rate": 0.0004614035127055447, "loss": 4.961, "mean_token_accuracy": 0.20105046033859253, "num_tokens": 43596623.0, "step": 25130 }, { "entropy": 5.530763149261475, "epoch": 1.955611748687026, "grad_norm": 1.1015625, "learning_rate": 0.0004613879892277024, "loss": 4.9027, "mean_token_accuracy": 0.20824336707592012, "num_tokens": 43605954.0, "step": 25135 }, { "entropy": 5.614673089981079, "epoch": 1.9560007780587434, "grad_norm": 1.1640625, "learning_rate": 0.000461372462921719, "loss": 5.0139, "mean_token_accuracy": 0.1966230183839798, "num_tokens": 43613822.0, "step": 25140 }, { "entropy": 5.577919960021973, "epoch": 1.9563898074304609, "grad_norm": 1.1328125, "learning_rate": 0.0004613569337878302, "loss": 4.9182, "mean_token_accuracy": 0.21031264662742616, "num_tokens": 43622602.0, "step": 25145 }, { "entropy": 5.645202732086181, "epoch": 1.9567788368021786, "grad_norm": 1.2734375, "learning_rate": 0.0004613414018262715, "loss": 5.0612, "mean_token_accuracy": 0.19623580276966096, "num_tokens": 43630820.0, "step": 25150 }, { "entropy": 5.595655250549316, "epoch": 1.9571678661738963, "grad_norm": 1.1171875, "learning_rate": 0.0004613258670372786, "loss": 5.0231, "mean_token_accuracy": 0.20416345000267028, "num_tokens": 43638571.0, "step": 25155 }, { "entropy": 5.586620426177978, "epoch": 1.9575568955456137, "grad_norm": 1.03125, "learning_rate": 0.0004613103294210873, "loss": 5.0578, "mean_token_accuracy": 0.19677623063325883, "num_tokens": 43648575.0, "step": 25160 }, { "entropy": 5.610661840438842, "epoch": 1.9579459249173312, "grad_norm": 1.1484375, "learning_rate": 0.00046129478897793323, "loss": 4.9412, "mean_token_accuracy": 0.20606261640787124, "num_tokens": 43656241.0, "step": 25165 }, { "entropy": 5.750542020797729, "epoch": 1.958334954289049, "grad_norm": 1.1171875, "learning_rate": 0.00046127924570805236, "loss": 5.144, "mean_token_accuracy": 0.19841453731060027, "num_tokens": 43665023.0, "step": 25170 }, { "entropy": 5.588088846206665, "epoch": 1.9587239836607664, "grad_norm": 1.1328125, "learning_rate": 0.0004612636996116803, "loss": 5.0531, "mean_token_accuracy": 0.20586448013782502, "num_tokens": 43673455.0, "step": 25175 }, { "entropy": 5.635645914077759, "epoch": 1.9591130130324839, "grad_norm": 1.1953125, "learning_rate": 0.0004612481506890532, "loss": 5.0304, "mean_token_accuracy": 0.19816944748163223, "num_tokens": 43681679.0, "step": 25180 }, { "entropy": 5.681969785690308, "epoch": 1.9595020424042016, "grad_norm": 1.1875, "learning_rate": 0.00046123259894040677, "loss": 5.0225, "mean_token_accuracy": 0.1994195356965065, "num_tokens": 43690062.0, "step": 25185 }, { "entropy": 5.6451390266418455, "epoch": 1.959891071775919, "grad_norm": 1.203125, "learning_rate": 0.000461217044365977, "loss": 5.0453, "mean_token_accuracy": 0.19377863854169847, "num_tokens": 43698301.0, "step": 25190 }, { "entropy": 5.645369052886963, "epoch": 1.9602801011476365, "grad_norm": 1.1640625, "learning_rate": 0.0004612014869660002, "loss": 5.0778, "mean_token_accuracy": 0.19743055999279022, "num_tokens": 43707221.0, "step": 25195 }, { "entropy": 5.622927141189575, "epoch": 1.9606691305193542, "grad_norm": 1.046875, "learning_rate": 0.00046118592674071197, "loss": 5.0389, "mean_token_accuracy": 0.19979306012392045, "num_tokens": 43716552.0, "step": 25200 }, { "entropy": 5.652859354019165, "epoch": 1.961058159891072, "grad_norm": 1.1796875, "learning_rate": 0.0004611703636903488, "loss": 4.9869, "mean_token_accuracy": 0.19607416540384293, "num_tokens": 43725296.0, "step": 25205 }, { "entropy": 5.711751651763916, "epoch": 1.9614471892627894, "grad_norm": 1.1796875, "learning_rate": 0.0004611547978151466, "loss": 5.1173, "mean_token_accuracy": 0.1953204721212387, "num_tokens": 43733398.0, "step": 25210 }, { "entropy": 5.559988403320313, "epoch": 1.9618362186345069, "grad_norm": 1.1484375, "learning_rate": 0.00046113922911534167, "loss": 4.987, "mean_token_accuracy": 0.20678746253252028, "num_tokens": 43741679.0, "step": 25215 }, { "entropy": 5.636204862594605, "epoch": 1.9622252480062246, "grad_norm": 1.1875, "learning_rate": 0.0004611236575911702, "loss": 5.0414, "mean_token_accuracy": 0.19247227311134338, "num_tokens": 43750734.0, "step": 25220 }, { "entropy": 5.681608963012695, "epoch": 1.962614277377942, "grad_norm": 1.2578125, "learning_rate": 0.00046110808324286844, "loss": 5.0719, "mean_token_accuracy": 0.19714713394641875, "num_tokens": 43759885.0, "step": 25225 }, { "entropy": 5.6347908020019535, "epoch": 1.9630033067496595, "grad_norm": 1.2265625, "learning_rate": 0.00046109250607067275, "loss": 5.0051, "mean_token_accuracy": 0.19859375357627868, "num_tokens": 43769199.0, "step": 25230 }, { "entropy": 5.651576519012451, "epoch": 1.9633923361213772, "grad_norm": 1.140625, "learning_rate": 0.0004610769260748196, "loss": 4.9831, "mean_token_accuracy": 0.20084545016288757, "num_tokens": 43777930.0, "step": 25235 }, { "entropy": 5.648206329345703, "epoch": 1.9637813654930947, "grad_norm": 1.2265625, "learning_rate": 0.0004610613432555451, "loss": 5.0683, "mean_token_accuracy": 0.19863332957029342, "num_tokens": 43786297.0, "step": 25240 }, { "entropy": 5.577006053924561, "epoch": 1.9641703948648122, "grad_norm": 1.140625, "learning_rate": 0.00046104575761308597, "loss": 4.9739, "mean_token_accuracy": 0.2059046134352684, "num_tokens": 43794157.0, "step": 25245 }, { "entropy": 5.628083324432373, "epoch": 1.9645594242365298, "grad_norm": 1.1640625, "learning_rate": 0.0004610301691476786, "loss": 5.0922, "mean_token_accuracy": 0.20064326226711274, "num_tokens": 43802926.0, "step": 25250 }, { "entropy": 5.618759679794311, "epoch": 1.9649484536082475, "grad_norm": 1.078125, "learning_rate": 0.0004610145778595594, "loss": 4.9761, "mean_token_accuracy": 0.1999736100435257, "num_tokens": 43811446.0, "step": 25255 }, { "entropy": 5.708820438385009, "epoch": 1.965337482979965, "grad_norm": 1.1875, "learning_rate": 0.0004609989837489651, "loss": 5.0395, "mean_token_accuracy": 0.19431572258472443, "num_tokens": 43819851.0, "step": 25260 }, { "entropy": 5.647942113876343, "epoch": 1.9657265123516825, "grad_norm": 1.1171875, "learning_rate": 0.00046098338681613234, "loss": 5.0439, "mean_token_accuracy": 0.20012189149856568, "num_tokens": 43828763.0, "step": 25265 }, { "entropy": 5.594118595123291, "epoch": 1.9661155417234002, "grad_norm": 1.1484375, "learning_rate": 0.0004609677870612976, "loss": 5.0512, "mean_token_accuracy": 0.20427397787570953, "num_tokens": 43837151.0, "step": 25270 }, { "entropy": 5.635504579544067, "epoch": 1.9665045710951177, "grad_norm": 1.203125, "learning_rate": 0.0004609521844846978, "loss": 5.0268, "mean_token_accuracy": 0.19738633334636688, "num_tokens": 43845823.0, "step": 25275 }, { "entropy": 5.581147527694702, "epoch": 1.9668936004668351, "grad_norm": 1.171875, "learning_rate": 0.0004609365790865695, "loss": 4.9162, "mean_token_accuracy": 0.21498498618602752, "num_tokens": 43854551.0, "step": 25280 }, { "entropy": 5.669602489471435, "epoch": 1.9672826298385528, "grad_norm": 1.203125, "learning_rate": 0.00046092097086714956, "loss": 5.0608, "mean_token_accuracy": 0.1942002832889557, "num_tokens": 43863839.0, "step": 25285 }, { "entropy": 5.607984638214111, "epoch": 1.9676716592102705, "grad_norm": 1.15625, "learning_rate": 0.00046090535982667486, "loss": 5.092, "mean_token_accuracy": 0.19586304277181626, "num_tokens": 43872401.0, "step": 25290 }, { "entropy": 5.6260762214660645, "epoch": 1.9680606885819878, "grad_norm": 1.2109375, "learning_rate": 0.00046088974596538216, "loss": 5.0234, "mean_token_accuracy": 0.19866797775030137, "num_tokens": 43881378.0, "step": 25295 }, { "entropy": 5.772875547409058, "epoch": 1.9684497179537055, "grad_norm": 1.0703125, "learning_rate": 0.0004608741292835085, "loss": 5.2449, "mean_token_accuracy": 0.1882839471101761, "num_tokens": 43891047.0, "step": 25300 }, { "entropy": 5.70738844871521, "epoch": 1.9688387473254232, "grad_norm": 1.25, "learning_rate": 0.0004608585097812907, "loss": 5.148, "mean_token_accuracy": 0.18614716529846193, "num_tokens": 43898844.0, "step": 25305 }, { "entropy": 5.642058801651001, "epoch": 1.9692277766971407, "grad_norm": 1.265625, "learning_rate": 0.0004608428874589659, "loss": 5.0613, "mean_token_accuracy": 0.2027621313929558, "num_tokens": 43907398.0, "step": 25310 }, { "entropy": 5.659902667999267, "epoch": 1.9696168060688581, "grad_norm": 1.203125, "learning_rate": 0.0004608272623167711, "loss": 5.0271, "mean_token_accuracy": 0.20097365826368332, "num_tokens": 43915184.0, "step": 25315 }, { "entropy": 5.651368856430054, "epoch": 1.9700058354405758, "grad_norm": 1.1953125, "learning_rate": 0.00046081163435494335, "loss": 4.9868, "mean_token_accuracy": 0.20818507075309753, "num_tokens": 43923496.0, "step": 25320 }, { "entropy": 5.6052039623260494, "epoch": 1.9703948648122933, "grad_norm": 1.09375, "learning_rate": 0.0004607960035737198, "loss": 4.8938, "mean_token_accuracy": 0.2096571519970894, "num_tokens": 43931435.0, "step": 25325 }, { "entropy": 5.606964159011841, "epoch": 1.9707838941840108, "grad_norm": 1.1640625, "learning_rate": 0.0004607803699733376, "loss": 5.0992, "mean_token_accuracy": 0.20533965080976485, "num_tokens": 43939644.0, "step": 25330 }, { "entropy": 5.624517822265625, "epoch": 1.9711729235557285, "grad_norm": 1.2578125, "learning_rate": 0.000460764733554034, "loss": 4.9985, "mean_token_accuracy": 0.204326094686985, "num_tokens": 43947611.0, "step": 25335 }, { "entropy": 5.59662275314331, "epoch": 1.9715619529274462, "grad_norm": 1.1328125, "learning_rate": 0.00046074909431604623, "loss": 5.0026, "mean_token_accuracy": 0.20859443098306657, "num_tokens": 43956876.0, "step": 25340 }, { "entropy": 5.556484842300415, "epoch": 1.9719509822991634, "grad_norm": 1.171875, "learning_rate": 0.0004607334522596116, "loss": 4.9704, "mean_token_accuracy": 0.20653315484523774, "num_tokens": 43965573.0, "step": 25345 }, { "entropy": 5.641865873336792, "epoch": 1.9723400116708811, "grad_norm": 1.1171875, "learning_rate": 0.0004607178073849675, "loss": 5.0999, "mean_token_accuracy": 0.19097919762134552, "num_tokens": 43974937.0, "step": 25350 }, { "entropy": 5.690134334564209, "epoch": 1.9727290410425988, "grad_norm": 1.15625, "learning_rate": 0.0004607021596923512, "loss": 4.9765, "mean_token_accuracy": 0.20773436725139618, "num_tokens": 43983629.0, "step": 25355 }, { "entropy": 5.625349760055542, "epoch": 1.9731180704143163, "grad_norm": 1.109375, "learning_rate": 0.0004606865091820003, "loss": 5.0748, "mean_token_accuracy": 0.19699892699718474, "num_tokens": 43992655.0, "step": 25360 }, { "entropy": 5.591175127029419, "epoch": 1.9735070997860338, "grad_norm": 1.25, "learning_rate": 0.0004606708558541521, "loss": 5.0249, "mean_token_accuracy": 0.20070958584547044, "num_tokens": 44001789.0, "step": 25365 }, { "entropy": 5.523272371292114, "epoch": 1.9738961291577515, "grad_norm": 1.1171875, "learning_rate": 0.0004606551997090442, "loss": 4.8909, "mean_token_accuracy": 0.20621975958347322, "num_tokens": 44010940.0, "step": 25370 }, { "entropy": 5.655936861038208, "epoch": 1.974285158529469, "grad_norm": 1.078125, "learning_rate": 0.0004606395407469141, "loss": 5.1015, "mean_token_accuracy": 0.19859305322170256, "num_tokens": 44019207.0, "step": 25375 }, { "entropy": 5.615401029586792, "epoch": 1.9746741879011864, "grad_norm": 1.2578125, "learning_rate": 0.0004606238789679995, "loss": 5.0561, "mean_token_accuracy": 0.19314056485891343, "num_tokens": 44027529.0, "step": 25380 }, { "entropy": 5.595882844924927, "epoch": 1.9750632172729041, "grad_norm": 1.1875, "learning_rate": 0.0004606082143725381, "loss": 4.98, "mean_token_accuracy": 0.20304424166679383, "num_tokens": 44036036.0, "step": 25385 }, { "entropy": 5.684293556213379, "epoch": 1.9754522466446218, "grad_norm": 1.265625, "learning_rate": 0.0004605925469607673, "loss": 5.0972, "mean_token_accuracy": 0.19621259421110154, "num_tokens": 44044211.0, "step": 25390 }, { "entropy": 5.601698780059815, "epoch": 1.975841276016339, "grad_norm": 1.15625, "learning_rate": 0.00046057687673292506, "loss": 5.0508, "mean_token_accuracy": 0.20113127678632736, "num_tokens": 44052735.0, "step": 25395 }, { "entropy": 5.55897011756897, "epoch": 1.9762303053880568, "grad_norm": 1.2109375, "learning_rate": 0.00046056120368924907, "loss": 4.9673, "mean_token_accuracy": 0.2016784057021141, "num_tokens": 44061629.0, "step": 25400 }, { "entropy": 5.632994365692139, "epoch": 1.9766193347597745, "grad_norm": 1.1015625, "learning_rate": 0.0004605455278299772, "loss": 5.0662, "mean_token_accuracy": 0.2004440262913704, "num_tokens": 44070381.0, "step": 25405 }, { "entropy": 5.6185524463653564, "epoch": 1.977008364131492, "grad_norm": 1.125, "learning_rate": 0.0004605298491553472, "loss": 5.0488, "mean_token_accuracy": 0.20301635712385177, "num_tokens": 44078609.0, "step": 25410 }, { "entropy": 5.531156730651856, "epoch": 1.9773973935032094, "grad_norm": 1.1015625, "learning_rate": 0.0004605141676655971, "loss": 4.934, "mean_token_accuracy": 0.20573256015777588, "num_tokens": 44087151.0, "step": 25415 }, { "entropy": 5.585275793075562, "epoch": 1.9777864228749271, "grad_norm": 1.1171875, "learning_rate": 0.00046049848336096485, "loss": 4.9716, "mean_token_accuracy": 0.20254035145044327, "num_tokens": 44095658.0, "step": 25420 }, { "entropy": 5.601599407196045, "epoch": 1.9781754522466446, "grad_norm": 1.21875, "learning_rate": 0.0004604827962416883, "loss": 5.028, "mean_token_accuracy": 0.20641974061727525, "num_tokens": 44103789.0, "step": 25425 }, { "entropy": 5.627568531036377, "epoch": 1.978564481618362, "grad_norm": 1.0625, "learning_rate": 0.0004604671063080055, "loss": 5.055, "mean_token_accuracy": 0.19585973471403123, "num_tokens": 44113082.0, "step": 25430 }, { "entropy": 5.656610202789307, "epoch": 1.9789535109900798, "grad_norm": 1.203125, "learning_rate": 0.0004604514135601546, "loss": 5.0093, "mean_token_accuracy": 0.20328574478626252, "num_tokens": 44121338.0, "step": 25435 }, { "entropy": 5.638218402862549, "epoch": 1.9793425403617975, "grad_norm": 1.15625, "learning_rate": 0.0004604357179983736, "loss": 5.0411, "mean_token_accuracy": 0.20142284482717515, "num_tokens": 44130551.0, "step": 25440 }, { "entropy": 5.608001661300659, "epoch": 1.9797315697335147, "grad_norm": 1.1015625, "learning_rate": 0.0004604200196229009, "loss": 5.0651, "mean_token_accuracy": 0.19927018880844116, "num_tokens": 44139138.0, "step": 25445 }, { "entropy": 5.578807973861695, "epoch": 1.9801205991052324, "grad_norm": 1.1015625, "learning_rate": 0.0004604043184339744, "loss": 5.0865, "mean_token_accuracy": 0.20072684735059737, "num_tokens": 44148123.0, "step": 25450 }, { "entropy": 5.536021137237549, "epoch": 1.9805096284769501, "grad_norm": 1.078125, "learning_rate": 0.0004603886144318325, "loss": 4.866, "mean_token_accuracy": 0.2106361582875252, "num_tokens": 44156062.0, "step": 25455 }, { "entropy": 5.563628053665161, "epoch": 1.9808986578486676, "grad_norm": 1.171875, "learning_rate": 0.00046037290761671346, "loss": 4.9985, "mean_token_accuracy": 0.20518584847450255, "num_tokens": 44165049.0, "step": 25460 }, { "entropy": 5.6947657585144045, "epoch": 1.981287687220385, "grad_norm": 1.203125, "learning_rate": 0.0004603571979888556, "loss": 5.1269, "mean_token_accuracy": 0.19949647337198256, "num_tokens": 44173774.0, "step": 25465 }, { "entropy": 5.665951538085937, "epoch": 1.9816767165921028, "grad_norm": 1.1953125, "learning_rate": 0.0004603414855484973, "loss": 5.0454, "mean_token_accuracy": 0.2025372326374054, "num_tokens": 44182933.0, "step": 25470 }, { "entropy": 5.683129930496216, "epoch": 1.9820657459638202, "grad_norm": 1.15625, "learning_rate": 0.000460325770295877, "loss": 5.055, "mean_token_accuracy": 0.20221837610006332, "num_tokens": 44190952.0, "step": 25475 }, { "entropy": 5.711680173873901, "epoch": 1.9824547753355377, "grad_norm": 1.171875, "learning_rate": 0.00046031005223123297, "loss": 5.1092, "mean_token_accuracy": 0.20273138880729674, "num_tokens": 44199625.0, "step": 25480 }, { "entropy": 5.616965675354004, "epoch": 1.9828438047072554, "grad_norm": 1.1328125, "learning_rate": 0.000460294331354804, "loss": 5.0164, "mean_token_accuracy": 0.1987301617860794, "num_tokens": 44207948.0, "step": 25485 }, { "entropy": 5.666461372375489, "epoch": 1.983232834078973, "grad_norm": 1.15625, "learning_rate": 0.0004602786076668283, "loss": 5.209, "mean_token_accuracy": 0.18254822492599487, "num_tokens": 44217120.0, "step": 25490 }, { "entropy": 5.726787948608399, "epoch": 1.9836218634506906, "grad_norm": 1.1796875, "learning_rate": 0.00046026288116754477, "loss": 5.1129, "mean_token_accuracy": 0.19329866915941238, "num_tokens": 44226099.0, "step": 25495 }, { "entropy": 5.69171290397644, "epoch": 1.984010892822408, "grad_norm": 1.125, "learning_rate": 0.0004602471518571919, "loss": 4.9837, "mean_token_accuracy": 0.20420074760913848, "num_tokens": 44234256.0, "step": 25500 }, { "entropy": 5.613227462768554, "epoch": 1.9843999221941258, "grad_norm": 1.234375, "learning_rate": 0.0004602314197360083, "loss": 4.9903, "mean_token_accuracy": 0.2008064717054367, "num_tokens": 44242283.0, "step": 25505 }, { "entropy": 5.549334335327148, "epoch": 1.9847889515658432, "grad_norm": 1.09375, "learning_rate": 0.0004602156848042328, "loss": 4.9333, "mean_token_accuracy": 0.2041727513074875, "num_tokens": 44251057.0, "step": 25510 }, { "entropy": 5.644768190383911, "epoch": 1.9851779809375607, "grad_norm": 1.140625, "learning_rate": 0.000460199947062104, "loss": 5.1038, "mean_token_accuracy": 0.1953382283449173, "num_tokens": 44259726.0, "step": 25515 }, { "entropy": 5.717181539535522, "epoch": 1.9855670103092784, "grad_norm": 1.0703125, "learning_rate": 0.00046018420650986074, "loss": 5.0974, "mean_token_accuracy": 0.1979443073272705, "num_tokens": 44268995.0, "step": 25520 }, { "entropy": 5.606896495819091, "epoch": 1.9859560396809959, "grad_norm": 1.1015625, "learning_rate": 0.000460168463147742, "loss": 4.9552, "mean_token_accuracy": 0.20048964768648148, "num_tokens": 44277598.0, "step": 25525 }, { "entropy": 5.586391592025757, "epoch": 1.9863450690527134, "grad_norm": 1.1171875, "learning_rate": 0.0004601527169759865, "loss": 5.0098, "mean_token_accuracy": 0.20657315701246262, "num_tokens": 44286233.0, "step": 25530 }, { "entropy": 5.571649360656738, "epoch": 1.986734098424431, "grad_norm": 1.203125, "learning_rate": 0.0004601369679948333, "loss": 4.95, "mean_token_accuracy": 0.2089812859892845, "num_tokens": 44295078.0, "step": 25535 }, { "entropy": 5.561828470230102, "epoch": 1.9871231277961487, "grad_norm": 1.125, "learning_rate": 0.00046012121620452127, "loss": 4.9803, "mean_token_accuracy": 0.20704407691955568, "num_tokens": 44304050.0, "step": 25540 }, { "entropy": 5.689087533950806, "epoch": 1.9875121571678662, "grad_norm": 1.171875, "learning_rate": 0.0004601054616052893, "loss": 5.0889, "mean_token_accuracy": 0.19555749297142028, "num_tokens": 44313025.0, "step": 25545 }, { "entropy": 5.590252542495728, "epoch": 1.9879011865395837, "grad_norm": 1.1796875, "learning_rate": 0.00046008970419737674, "loss": 4.9406, "mean_token_accuracy": 0.20949381738901138, "num_tokens": 44322295.0, "step": 25550 }, { "entropy": 5.559688234329224, "epoch": 1.9882902159113014, "grad_norm": 1.1796875, "learning_rate": 0.0004600739439810225, "loss": 4.925, "mean_token_accuracy": 0.20875637233257294, "num_tokens": 44329865.0, "step": 25555 }, { "entropy": 5.625823545455932, "epoch": 1.9886792452830189, "grad_norm": 1.28125, "learning_rate": 0.00046005818095646564, "loss": 5.0544, "mean_token_accuracy": 0.2057286873459816, "num_tokens": 44338124.0, "step": 25560 }, { "entropy": 5.546399831771851, "epoch": 1.9890682746547363, "grad_norm": 1.09375, "learning_rate": 0.00046004241512394544, "loss": 5.0131, "mean_token_accuracy": 0.20488054156303406, "num_tokens": 44346841.0, "step": 25565 }, { "entropy": 5.536183309555054, "epoch": 1.989457304026454, "grad_norm": 1.2265625, "learning_rate": 0.0004600266464837012, "loss": 5.0017, "mean_token_accuracy": 0.20167540907859802, "num_tokens": 44355677.0, "step": 25570 }, { "entropy": 5.664252805709839, "epoch": 1.9898463333981715, "grad_norm": 1.140625, "learning_rate": 0.0004600108750359721, "loss": 4.9826, "mean_token_accuracy": 0.19899121671915054, "num_tokens": 44363916.0, "step": 25575 }, { "entropy": 5.659473419189453, "epoch": 1.990235362769889, "grad_norm": 1.125, "learning_rate": 0.00045999510078099736, "loss": 5.0541, "mean_token_accuracy": 0.19745057970285415, "num_tokens": 44372770.0, "step": 25580 }, { "entropy": 5.70248064994812, "epoch": 1.9906243921416067, "grad_norm": 1.2265625, "learning_rate": 0.00045997932371901645, "loss": 5.0982, "mean_token_accuracy": 0.1969503492116928, "num_tokens": 44380724.0, "step": 25585 }, { "entropy": 5.582770252227784, "epoch": 1.9910134215133244, "grad_norm": 1.171875, "learning_rate": 0.0004599635438502687, "loss": 5.0038, "mean_token_accuracy": 0.20297805219888687, "num_tokens": 44389915.0, "step": 25590 }, { "entropy": 5.557068634033203, "epoch": 1.9914024508850419, "grad_norm": 1.28125, "learning_rate": 0.00045994776117499363, "loss": 4.9063, "mean_token_accuracy": 0.21086338460445403, "num_tokens": 44398297.0, "step": 25595 }, { "entropy": 5.649922037124634, "epoch": 1.9917914802567593, "grad_norm": 1.0703125, "learning_rate": 0.00045993197569343063, "loss": 5.1657, "mean_token_accuracy": 0.19753341376781464, "num_tokens": 44407713.0, "step": 25600 }, { "entropy": 5.645587825775147, "epoch": 1.992180509628477, "grad_norm": 1.2109375, "learning_rate": 0.00045991618740581926, "loss": 5.0122, "mean_token_accuracy": 0.2027626022696495, "num_tokens": 44416422.0, "step": 25605 }, { "entropy": 5.596484375, "epoch": 1.9925695390001945, "grad_norm": 1.1171875, "learning_rate": 0.0004599003963123991, "loss": 5.0696, "mean_token_accuracy": 0.1974819779396057, "num_tokens": 44425899.0, "step": 25610 }, { "entropy": 5.636276721954346, "epoch": 1.992958568371912, "grad_norm": 1.1796875, "learning_rate": 0.00045988460241340966, "loss": 4.9858, "mean_token_accuracy": 0.2004519060254097, "num_tokens": 44434233.0, "step": 25615 }, { "entropy": 5.612360525131225, "epoch": 1.9933475977436297, "grad_norm": 1.203125, "learning_rate": 0.00045986880570909075, "loss": 5.0615, "mean_token_accuracy": 0.19459983259439467, "num_tokens": 44443082.0, "step": 25620 }, { "entropy": 5.629563474655152, "epoch": 1.9937366271153472, "grad_norm": 1.2734375, "learning_rate": 0.00045985300619968186, "loss": 5.0304, "mean_token_accuracy": 0.20334535986185073, "num_tokens": 44451482.0, "step": 25625 }, { "entropy": 5.614025545120239, "epoch": 1.9941256564870646, "grad_norm": 1.171875, "learning_rate": 0.00045983720388542286, "loss": 5.0726, "mean_token_accuracy": 0.20137010216712953, "num_tokens": 44460264.0, "step": 25630 }, { "entropy": 5.530329751968384, "epoch": 1.9945146858587823, "grad_norm": 1.1796875, "learning_rate": 0.0004598213987665535, "loss": 4.9065, "mean_token_accuracy": 0.21302837878465652, "num_tokens": 44468686.0, "step": 25635 }, { "entropy": 5.577920961380005, "epoch": 1.9949037152305, "grad_norm": 1.1796875, "learning_rate": 0.00045980559084331354, "loss": 4.9533, "mean_token_accuracy": 0.20338212251663207, "num_tokens": 44476835.0, "step": 25640 }, { "entropy": 5.576545095443725, "epoch": 1.9952927446022175, "grad_norm": 1.0703125, "learning_rate": 0.000459789780115943, "loss": 5.0343, "mean_token_accuracy": 0.20248454809188843, "num_tokens": 44485626.0, "step": 25645 }, { "entropy": 5.696612119674683, "epoch": 1.995681773973935, "grad_norm": 1.1015625, "learning_rate": 0.00045977396658468156, "loss": 5.0878, "mean_token_accuracy": 0.19952531307935714, "num_tokens": 44494590.0, "step": 25650 }, { "entropy": 5.691667652130127, "epoch": 1.9960708033456527, "grad_norm": 1.140625, "learning_rate": 0.0004597581502497693, "loss": 5.0952, "mean_token_accuracy": 0.20225452184677123, "num_tokens": 44503115.0, "step": 25655 }, { "entropy": 5.642867755889893, "epoch": 1.9964598327173702, "grad_norm": 1.171875, "learning_rate": 0.0004597423311114462, "loss": 5.0698, "mean_token_accuracy": 0.20246998518705367, "num_tokens": 44511416.0, "step": 25660 }, { "entropy": 5.594935321807862, "epoch": 1.9968488620890876, "grad_norm": 1.1171875, "learning_rate": 0.0004597265091699522, "loss": 4.9952, "mean_token_accuracy": 0.2004894495010376, "num_tokens": 44519978.0, "step": 25665 }, { "entropy": 5.538840579986572, "epoch": 1.9972378914608053, "grad_norm": 1.2109375, "learning_rate": 0.0004597106844255276, "loss": 4.9514, "mean_token_accuracy": 0.19916902631521224, "num_tokens": 44528438.0, "step": 25670 }, { "entropy": 5.594379615783692, "epoch": 1.9976269208325228, "grad_norm": 1.140625, "learning_rate": 0.00045969485687841227, "loss": 5.0812, "mean_token_accuracy": 0.1987212598323822, "num_tokens": 44537126.0, "step": 25675 }, { "entropy": 5.575970268249511, "epoch": 1.9980159502042403, "grad_norm": 1.140625, "learning_rate": 0.00045967902652884645, "loss": 4.9194, "mean_token_accuracy": 0.20549869984388353, "num_tokens": 44545874.0, "step": 25680 }, { "entropy": 5.587207365036011, "epoch": 1.998404979575958, "grad_norm": 1.0625, "learning_rate": 0.0004596631933770704, "loss": 4.9887, "mean_token_accuracy": 0.2029881000518799, "num_tokens": 44554515.0, "step": 25685 }, { "entropy": 5.64042444229126, "epoch": 1.9987940089476757, "grad_norm": 1.1484375, "learning_rate": 0.00045964735742332427, "loss": 5.01, "mean_token_accuracy": 0.20413050055503845, "num_tokens": 44562902.0, "step": 25690 }, { "entropy": 5.67670168876648, "epoch": 1.9991830383193931, "grad_norm": 1.1171875, "learning_rate": 0.0004596315186678484, "loss": 5.0792, "mean_token_accuracy": 0.20368304550647737, "num_tokens": 44571482.0, "step": 25695 }, { "entropy": 5.6492283821105955, "epoch": 1.9995720676911106, "grad_norm": 1.1484375, "learning_rate": 0.00045961567711088307, "loss": 4.9851, "mean_token_accuracy": 0.2074311524629593, "num_tokens": 44580686.0, "step": 25700 }, { "entropy": 5.616321229934693, "epoch": 1.9999610970628283, "grad_norm": 1.234375, "learning_rate": 0.00045959983275266873, "loss": 5.0629, "mean_token_accuracy": 0.20075726956129075, "num_tokens": 44588317.0, "step": 25705 }, { "entropy": 5.6290525860256615, "epoch": 2.000311223497374, "grad_norm": 1.125, "learning_rate": 0.00045958398559344573, "loss": 5.0312, "mean_token_accuracy": 0.1971252593729231, "num_tokens": 44596453.0, "step": 25710 }, { "entropy": 5.65076699256897, "epoch": 2.0007002528690916, "grad_norm": 1.078125, "learning_rate": 0.00045956813563345454, "loss": 4.9459, "mean_token_accuracy": 0.2115452006459236, "num_tokens": 44605444.0, "step": 25715 }, { "entropy": 5.680522727966308, "epoch": 2.0010892822408093, "grad_norm": 1.171875, "learning_rate": 0.0004595522828729357, "loss": 4.9758, "mean_token_accuracy": 0.20203300714492797, "num_tokens": 44614156.0, "step": 25720 }, { "entropy": 5.534897184371948, "epoch": 2.0014783116125265, "grad_norm": 1.2578125, "learning_rate": 0.0004595364273121296, "loss": 4.9117, "mean_token_accuracy": 0.21203378289937974, "num_tokens": 44622413.0, "step": 25725 }, { "entropy": 5.502642726898193, "epoch": 2.0018673409842442, "grad_norm": 1.125, "learning_rate": 0.0004595205689512771, "loss": 4.8756, "mean_token_accuracy": 0.2178743526339531, "num_tokens": 44630940.0, "step": 25730 }, { "entropy": 5.640612983703614, "epoch": 2.002256370355962, "grad_norm": 1.1484375, "learning_rate": 0.00045950470779061855, "loss": 5.0311, "mean_token_accuracy": 0.20280055999755858, "num_tokens": 44640951.0, "step": 25735 }, { "entropy": 5.620240211486816, "epoch": 2.0026453997276796, "grad_norm": 1.1484375, "learning_rate": 0.00045948884383039475, "loss": 4.951, "mean_token_accuracy": 0.2117963433265686, "num_tokens": 44650054.0, "step": 25740 }, { "entropy": 5.628820610046387, "epoch": 2.003034429099397, "grad_norm": 1.1484375, "learning_rate": 0.00045947297707084637, "loss": 4.9361, "mean_token_accuracy": 0.2045560970902443, "num_tokens": 44658018.0, "step": 25745 }, { "entropy": 5.634444332122802, "epoch": 2.0034234584711146, "grad_norm": 1.1953125, "learning_rate": 0.0004594571075122142, "loss": 5.0183, "mean_token_accuracy": 0.20544345825910568, "num_tokens": 44666310.0, "step": 25750 }, { "entropy": 5.577261018753052, "epoch": 2.0038124878428323, "grad_norm": 1.171875, "learning_rate": 0.00045944123515473905, "loss": 4.9506, "mean_token_accuracy": 0.20551505833864211, "num_tokens": 44675008.0, "step": 25755 }, { "entropy": 5.643285036087036, "epoch": 2.0042015172145495, "grad_norm": 1.15625, "learning_rate": 0.00045942535999866175, "loss": 4.9787, "mean_token_accuracy": 0.2027924671769142, "num_tokens": 44683504.0, "step": 25760 }, { "entropy": 5.667280483245849, "epoch": 2.0045905465862672, "grad_norm": 1.1015625, "learning_rate": 0.0004594094820442231, "loss": 5.092, "mean_token_accuracy": 0.1969456344842911, "num_tokens": 44692079.0, "step": 25765 }, { "entropy": 5.637122344970703, "epoch": 2.004979575957985, "grad_norm": 1.1796875, "learning_rate": 0.000459393601291664, "loss": 4.9966, "mean_token_accuracy": 0.20347248017787933, "num_tokens": 44700256.0, "step": 25770 }, { "entropy": 5.600408840179443, "epoch": 2.005368605329702, "grad_norm": 1.15625, "learning_rate": 0.00045937771774122563, "loss": 4.9664, "mean_token_accuracy": 0.20849878638982772, "num_tokens": 44708597.0, "step": 25775 }, { "entropy": 5.715204954147339, "epoch": 2.00575763470142, "grad_norm": 1.171875, "learning_rate": 0.0004593618313931488, "loss": 4.9897, "mean_token_accuracy": 0.20541465282440186, "num_tokens": 44717583.0, "step": 25780 }, { "entropy": 5.626265573501587, "epoch": 2.0061466640731376, "grad_norm": 1.125, "learning_rate": 0.00045934594224767463, "loss": 5.0061, "mean_token_accuracy": 0.20146530419588088, "num_tokens": 44725661.0, "step": 25785 }, { "entropy": 5.509394884109497, "epoch": 2.0065356934448553, "grad_norm": 1.1328125, "learning_rate": 0.00045933005030504424, "loss": 4.8999, "mean_token_accuracy": 0.2073071628808975, "num_tokens": 44735045.0, "step": 25790 }, { "entropy": 5.624396085739136, "epoch": 2.0069247228165725, "grad_norm": 1.1875, "learning_rate": 0.00045931415556549863, "loss": 4.8654, "mean_token_accuracy": 0.21229027807712555, "num_tokens": 44743307.0, "step": 25795 }, { "entropy": 5.623622894287109, "epoch": 2.0073137521882902, "grad_norm": 1.15625, "learning_rate": 0.0004592982580292792, "loss": 4.9956, "mean_token_accuracy": 0.20081831514835358, "num_tokens": 44751895.0, "step": 25800 }, { "entropy": 5.585944366455078, "epoch": 2.007702781560008, "grad_norm": 1.1640625, "learning_rate": 0.00045928235769662697, "loss": 4.9251, "mean_token_accuracy": 0.2034072086215019, "num_tokens": 44760801.0, "step": 25805 }, { "entropy": 5.663759231567383, "epoch": 2.008091810931725, "grad_norm": 1.234375, "learning_rate": 0.00045926645456778327, "loss": 5.089, "mean_token_accuracy": 0.19501139223575592, "num_tokens": 44769634.0, "step": 25810 }, { "entropy": 5.6328671932220455, "epoch": 2.008480840303443, "grad_norm": 1.1875, "learning_rate": 0.00045925054864298946, "loss": 4.9755, "mean_token_accuracy": 0.20681709051132202, "num_tokens": 44778856.0, "step": 25815 }, { "entropy": 5.622316932678222, "epoch": 2.0088698696751606, "grad_norm": 1.1484375, "learning_rate": 0.00045923463992248684, "loss": 5.0206, "mean_token_accuracy": 0.21183178275823594, "num_tokens": 44787750.0, "step": 25820 }, { "entropy": 5.622903490066529, "epoch": 2.009258899046878, "grad_norm": 1.0859375, "learning_rate": 0.00045921872840651675, "loss": 4.9565, "mean_token_accuracy": 0.2046786367893219, "num_tokens": 44796021.0, "step": 25825 }, { "entropy": 5.6192786693573, "epoch": 2.0096479284185955, "grad_norm": 1.15625, "learning_rate": 0.00045920281409532064, "loss": 4.9565, "mean_token_accuracy": 0.2015443727374077, "num_tokens": 44804247.0, "step": 25830 }, { "entropy": 5.674878549575806, "epoch": 2.010036957790313, "grad_norm": 1.15625, "learning_rate": 0.0004591868969891401, "loss": 5.0134, "mean_token_accuracy": 0.19631267935037613, "num_tokens": 44813591.0, "step": 25835 }, { "entropy": 5.62251648902893, "epoch": 2.010425987162031, "grad_norm": 1.1953125, "learning_rate": 0.0004591709770882165, "loss": 4.9446, "mean_token_accuracy": 0.20036744624376296, "num_tokens": 44821722.0, "step": 25840 }, { "entropy": 5.646756935119629, "epoch": 2.010815016533748, "grad_norm": 1.1171875, "learning_rate": 0.0004591550543927915, "loss": 4.9723, "mean_token_accuracy": 0.20686585307121277, "num_tokens": 44830022.0, "step": 25845 }, { "entropy": 5.546005964279175, "epoch": 2.011204045905466, "grad_norm": 1.2109375, "learning_rate": 0.0004591391289031067, "loss": 4.8999, "mean_token_accuracy": 0.21528953313827515, "num_tokens": 44838804.0, "step": 25850 }, { "entropy": 5.571292352676392, "epoch": 2.0115930752771836, "grad_norm": 1.140625, "learning_rate": 0.0004591232006194036, "loss": 4.9392, "mean_token_accuracy": 0.2109516128897667, "num_tokens": 44847585.0, "step": 25855 }, { "entropy": 5.634805011749267, "epoch": 2.011982104648901, "grad_norm": 1.125, "learning_rate": 0.00045910726954192404, "loss": 5.0129, "mean_token_accuracy": 0.19733098149299622, "num_tokens": 44857107.0, "step": 25860 }, { "entropy": 5.624984169006348, "epoch": 2.0123711340206185, "grad_norm": 1.1328125, "learning_rate": 0.0004590913356709097, "loss": 4.974, "mean_token_accuracy": 0.20323953181505203, "num_tokens": 44866233.0, "step": 25865 }, { "entropy": 5.627806806564331, "epoch": 2.012760163392336, "grad_norm": 1.234375, "learning_rate": 0.00045907539900660237, "loss": 4.9903, "mean_token_accuracy": 0.19578027576208115, "num_tokens": 44874944.0, "step": 25870 }, { "entropy": 5.6209249019622805, "epoch": 2.013149192764054, "grad_norm": 1.078125, "learning_rate": 0.0004590594595492438, "loss": 4.8545, "mean_token_accuracy": 0.22061439752578735, "num_tokens": 44884118.0, "step": 25875 }, { "entropy": 5.5893186092376705, "epoch": 2.013538222135771, "grad_norm": 1.234375, "learning_rate": 0.00045904351729907593, "loss": 4.9215, "mean_token_accuracy": 0.2095783069729805, "num_tokens": 44893101.0, "step": 25880 }, { "entropy": 5.573078918457031, "epoch": 2.013927251507489, "grad_norm": 1.2109375, "learning_rate": 0.00045902757225634066, "loss": 4.8527, "mean_token_accuracy": 0.21072138845920563, "num_tokens": 44901188.0, "step": 25885 }, { "entropy": 5.577827882766724, "epoch": 2.0143162808792066, "grad_norm": 1.2890625, "learning_rate": 0.0004590116244212799, "loss": 4.8855, "mean_token_accuracy": 0.20304518640041352, "num_tokens": 44909667.0, "step": 25890 }, { "entropy": 5.609911394119263, "epoch": 2.014705310250924, "grad_norm": 1.15625, "learning_rate": 0.0004589956737941355, "loss": 5.0054, "mean_token_accuracy": 0.20266708731651306, "num_tokens": 44918112.0, "step": 25895 }, { "entropy": 5.585029077529907, "epoch": 2.0150943396226415, "grad_norm": 1.140625, "learning_rate": 0.0004589797203751497, "loss": 4.8888, "mean_token_accuracy": 0.2067651018500328, "num_tokens": 44927556.0, "step": 25900 }, { "entropy": 5.608692741394043, "epoch": 2.015483368994359, "grad_norm": 1.109375, "learning_rate": 0.0004589637641645645, "loss": 4.9532, "mean_token_accuracy": 0.20604204386472702, "num_tokens": 44936789.0, "step": 25905 }, { "entropy": 5.603762435913086, "epoch": 2.0158723983660765, "grad_norm": 1.1328125, "learning_rate": 0.00045894780516262193, "loss": 4.9366, "mean_token_accuracy": 0.19604863971471786, "num_tokens": 44945515.0, "step": 25910 }, { "entropy": 5.578456878662109, "epoch": 2.016261427737794, "grad_norm": 1.1875, "learning_rate": 0.0004589318433695642, "loss": 4.956, "mean_token_accuracy": 0.20684794187545777, "num_tokens": 44953789.0, "step": 25915 }, { "entropy": 5.59338903427124, "epoch": 2.016650457109512, "grad_norm": 1.2265625, "learning_rate": 0.0004589158787856336, "loss": 4.9125, "mean_token_accuracy": 0.21449631303548813, "num_tokens": 44961874.0, "step": 25920 }, { "entropy": 5.6510570526123045, "epoch": 2.0170394864812295, "grad_norm": 1.2265625, "learning_rate": 0.0004588999114110721, "loss": 4.9482, "mean_token_accuracy": 0.2030657410621643, "num_tokens": 44969955.0, "step": 25925 }, { "entropy": 5.685905981063843, "epoch": 2.017428515852947, "grad_norm": 1.15625, "learning_rate": 0.0004588839412461223, "loss": 4.9377, "mean_token_accuracy": 0.2103424459695816, "num_tokens": 44978514.0, "step": 25930 }, { "entropy": 5.577225112915039, "epoch": 2.0178175452246645, "grad_norm": 1.0859375, "learning_rate": 0.0004588679682910264, "loss": 4.9287, "mean_token_accuracy": 0.20726794749498367, "num_tokens": 44986650.0, "step": 25935 }, { "entropy": 5.535041856765747, "epoch": 2.018206574596382, "grad_norm": 1.0703125, "learning_rate": 0.0004588519925460266, "loss": 4.9635, "mean_token_accuracy": 0.20004806369543077, "num_tokens": 44996175.0, "step": 25940 }, { "entropy": 5.625651454925537, "epoch": 2.0185956039680995, "grad_norm": 1.2265625, "learning_rate": 0.0004588360140113655, "loss": 4.9671, "mean_token_accuracy": 0.20398198664188386, "num_tokens": 45005557.0, "step": 25945 }, { "entropy": 5.625854253768921, "epoch": 2.018984633339817, "grad_norm": 1.21875, "learning_rate": 0.0004588200326872855, "loss": 4.8912, "mean_token_accuracy": 0.19530292600393295, "num_tokens": 45013780.0, "step": 25950 }, { "entropy": 5.51806263923645, "epoch": 2.019373662711535, "grad_norm": 1.1484375, "learning_rate": 0.0004588040485740291, "loss": 4.9247, "mean_token_accuracy": 0.20801512598991395, "num_tokens": 45023255.0, "step": 25955 }, { "entropy": 5.647888612747193, "epoch": 2.019762692083252, "grad_norm": 1.125, "learning_rate": 0.0004587880616718387, "loss": 5.0884, "mean_token_accuracy": 0.1914384514093399, "num_tokens": 45032901.0, "step": 25960 }, { "entropy": 5.715079116821289, "epoch": 2.02015172145497, "grad_norm": 1.171875, "learning_rate": 0.0004587720719809572, "loss": 4.9547, "mean_token_accuracy": 0.21030139923095703, "num_tokens": 45040943.0, "step": 25965 }, { "entropy": 5.714957761764526, "epoch": 2.0205407508266875, "grad_norm": 1.21875, "learning_rate": 0.0004587560795016269, "loss": 5.0422, "mean_token_accuracy": 0.19679745733737947, "num_tokens": 45049802.0, "step": 25970 }, { "entropy": 5.595868062973023, "epoch": 2.020929780198405, "grad_norm": 1.1328125, "learning_rate": 0.0004587400842340905, "loss": 4.9091, "mean_token_accuracy": 0.21422239691019057, "num_tokens": 45058759.0, "step": 25975 }, { "entropy": 5.667203426361084, "epoch": 2.0213188095701224, "grad_norm": 1.21875, "learning_rate": 0.00045872408617859083, "loss": 5.0434, "mean_token_accuracy": 0.19054094851016998, "num_tokens": 45067403.0, "step": 25980 }, { "entropy": 5.633752489089966, "epoch": 2.02170783894184, "grad_norm": 1.265625, "learning_rate": 0.00045870808533537066, "loss": 4.9616, "mean_token_accuracy": 0.20937184393405914, "num_tokens": 45076157.0, "step": 25985 }, { "entropy": 5.634929227828979, "epoch": 2.022096868313558, "grad_norm": 1.1640625, "learning_rate": 0.00045869208170467256, "loss": 4.9803, "mean_token_accuracy": 0.20683026909828187, "num_tokens": 45084253.0, "step": 25990 }, { "entropy": 5.591089916229248, "epoch": 2.022485897685275, "grad_norm": 1.15625, "learning_rate": 0.0004586760752867396, "loss": 4.9461, "mean_token_accuracy": 0.20789675116539003, "num_tokens": 45092609.0, "step": 25995 }, { "entropy": 5.573893022537232, "epoch": 2.022874927056993, "grad_norm": 1.1640625, "learning_rate": 0.00045866006608181456, "loss": 4.8957, "mean_token_accuracy": 0.21681669503450393, "num_tokens": 45101122.0, "step": 26000 }, { "entropy": 5.705096435546875, "epoch": 2.0232639564287105, "grad_norm": 1.15625, "learning_rate": 0.0004586440540901403, "loss": 5.0559, "mean_token_accuracy": 0.19834366142749787, "num_tokens": 45110279.0, "step": 26005 }, { "entropy": 5.661575365066528, "epoch": 2.0236529858004277, "grad_norm": 1.21875, "learning_rate": 0.00045862803931195976, "loss": 4.9496, "mean_token_accuracy": 0.20676905661821365, "num_tokens": 45119449.0, "step": 26010 }, { "entropy": 5.656465673446656, "epoch": 2.0240420151721454, "grad_norm": 1.1640625, "learning_rate": 0.0004586120217475161, "loss": 4.8985, "mean_token_accuracy": 0.21528079062700273, "num_tokens": 45128336.0, "step": 26015 }, { "entropy": 5.599501466751098, "epoch": 2.024431044543863, "grad_norm": 1.1484375, "learning_rate": 0.0004585960013970522, "loss": 4.9494, "mean_token_accuracy": 0.2026561364531517, "num_tokens": 45136577.0, "step": 26020 }, { "entropy": 5.595861148834229, "epoch": 2.024820073915581, "grad_norm": 1.109375, "learning_rate": 0.0004585799782608112, "loss": 5.0036, "mean_token_accuracy": 0.20043786019086837, "num_tokens": 45145058.0, "step": 26025 }, { "entropy": 5.604718017578125, "epoch": 2.025209103287298, "grad_norm": 1.2421875, "learning_rate": 0.00045856395233903624, "loss": 4.9152, "mean_token_accuracy": 0.2063464865088463, "num_tokens": 45153791.0, "step": 26030 }, { "entropy": 5.582047748565674, "epoch": 2.025598132659016, "grad_norm": 1.25, "learning_rate": 0.0004585479236319705, "loss": 4.8942, "mean_token_accuracy": 0.21511571258306503, "num_tokens": 45162228.0, "step": 26035 }, { "entropy": 5.581586074829102, "epoch": 2.0259871620307335, "grad_norm": 1.078125, "learning_rate": 0.00045853189213985714, "loss": 4.9414, "mean_token_accuracy": 0.21080451756715773, "num_tokens": 45170601.0, "step": 26040 }, { "entropy": 5.625035142898559, "epoch": 2.0263761914024507, "grad_norm": 1.140625, "learning_rate": 0.00045851585786293943, "loss": 5.0527, "mean_token_accuracy": 0.1987909957766533, "num_tokens": 45179602.0, "step": 26045 }, { "entropy": 5.733458471298218, "epoch": 2.0267652207741684, "grad_norm": 1.2109375, "learning_rate": 0.00045849982080146067, "loss": 5.0742, "mean_token_accuracy": 0.19620684385299683, "num_tokens": 45188366.0, "step": 26050 }, { "entropy": 5.641735410690307, "epoch": 2.027154250145886, "grad_norm": 1.203125, "learning_rate": 0.0004584837809556642, "loss": 4.9449, "mean_token_accuracy": 0.2043984740972519, "num_tokens": 45196861.0, "step": 26055 }, { "entropy": 5.6144720077514645, "epoch": 2.0275432795176034, "grad_norm": 1.125, "learning_rate": 0.00045846773832579346, "loss": 4.9444, "mean_token_accuracy": 0.20786049515008925, "num_tokens": 45205176.0, "step": 26060 }, { "entropy": 5.6016723155975345, "epoch": 2.027932308889321, "grad_norm": 1.25, "learning_rate": 0.00045845169291209176, "loss": 4.9695, "mean_token_accuracy": 0.19751398265361786, "num_tokens": 45213876.0, "step": 26065 }, { "entropy": 5.6475670337677, "epoch": 2.0283213382610388, "grad_norm": 1.1875, "learning_rate": 0.00045843564471480263, "loss": 4.9476, "mean_token_accuracy": 0.21228935569524765, "num_tokens": 45223035.0, "step": 26070 }, { "entropy": 5.584300184249878, "epoch": 2.0287103676327565, "grad_norm": 1.203125, "learning_rate": 0.0004584195937341695, "loss": 4.9347, "mean_token_accuracy": 0.20869850367307663, "num_tokens": 45232018.0, "step": 26075 }, { "entropy": 5.553749418258667, "epoch": 2.0290993970044737, "grad_norm": 1.1640625, "learning_rate": 0.00045840353997043606, "loss": 4.9493, "mean_token_accuracy": 0.21031275093555452, "num_tokens": 45240618.0, "step": 26080 }, { "entropy": 5.566223382949829, "epoch": 2.0294884263761914, "grad_norm": 1.140625, "learning_rate": 0.0004583874834238458, "loss": 4.9062, "mean_token_accuracy": 0.2119940012693405, "num_tokens": 45249537.0, "step": 26085 }, { "entropy": 5.5970603942871096, "epoch": 2.029877455747909, "grad_norm": 1.2109375, "learning_rate": 0.0004583714240946423, "loss": 4.9623, "mean_token_accuracy": 0.20785782039165496, "num_tokens": 45258114.0, "step": 26090 }, { "entropy": 5.540555715560913, "epoch": 2.0302664851196264, "grad_norm": 1.109375, "learning_rate": 0.00045835536198306936, "loss": 4.9011, "mean_token_accuracy": 0.21585020720958709, "num_tokens": 45266502.0, "step": 26095 }, { "entropy": 5.551183223724365, "epoch": 2.030655514491344, "grad_norm": 1.1875, "learning_rate": 0.00045833929708937067, "loss": 4.9116, "mean_token_accuracy": 0.2054360881447792, "num_tokens": 45275312.0, "step": 26100 }, { "entropy": 5.543352174758911, "epoch": 2.0310445438630618, "grad_norm": 1.1484375, "learning_rate": 0.0004583232294137899, "loss": 4.8888, "mean_token_accuracy": 0.20975821763277053, "num_tokens": 45283588.0, "step": 26105 }, { "entropy": 5.635727405548096, "epoch": 2.031433573234779, "grad_norm": 1.21875, "learning_rate": 0.0004583071589565709, "loss": 4.9954, "mean_token_accuracy": 0.20056421756744386, "num_tokens": 45292601.0, "step": 26110 }, { "entropy": 5.59704475402832, "epoch": 2.0318226026064967, "grad_norm": 1.234375, "learning_rate": 0.0004582910857179576, "loss": 4.8714, "mean_token_accuracy": 0.21467458605766296, "num_tokens": 45300712.0, "step": 26115 }, { "entropy": 5.565234231948852, "epoch": 2.0322116319782144, "grad_norm": 1.296875, "learning_rate": 0.0004582750096981938, "loss": 4.9165, "mean_token_accuracy": 0.20175865888595582, "num_tokens": 45308102.0, "step": 26120 }, { "entropy": 5.558914136886597, "epoch": 2.032600661349932, "grad_norm": 1.140625, "learning_rate": 0.0004582589308975234, "loss": 4.9304, "mean_token_accuracy": 0.21172445267438889, "num_tokens": 45316586.0, "step": 26125 }, { "entropy": 5.576681280136109, "epoch": 2.0329896907216494, "grad_norm": 1.15625, "learning_rate": 0.00045824284931619044, "loss": 4.9519, "mean_token_accuracy": 0.20456379354000093, "num_tokens": 45325926.0, "step": 26130 }, { "entropy": 5.586765909194947, "epoch": 2.033378720093367, "grad_norm": 1.15625, "learning_rate": 0.00045822676495443893, "loss": 4.8962, "mean_token_accuracy": 0.20778916478157045, "num_tokens": 45334514.0, "step": 26135 }, { "entropy": 5.612622261047363, "epoch": 2.0337677494650848, "grad_norm": 1.296875, "learning_rate": 0.00045821067781251284, "loss": 4.9978, "mean_token_accuracy": 0.2005477160215378, "num_tokens": 45342933.0, "step": 26140 }, { "entropy": 5.595442295074463, "epoch": 2.034156778836802, "grad_norm": 1.0625, "learning_rate": 0.00045819458789065633, "loss": 4.8961, "mean_token_accuracy": 0.204743829369545, "num_tokens": 45351747.0, "step": 26145 }, { "entropy": 5.6030536651611325, "epoch": 2.0345458082085197, "grad_norm": 1.140625, "learning_rate": 0.0004581784951891135, "loss": 4.9726, "mean_token_accuracy": 0.20552002340555192, "num_tokens": 45360220.0, "step": 26150 }, { "entropy": 5.546155309677124, "epoch": 2.0349348375802374, "grad_norm": 1.203125, "learning_rate": 0.0004581623997081286, "loss": 4.9448, "mean_token_accuracy": 0.20708168298006058, "num_tokens": 45368619.0, "step": 26155 }, { "entropy": 5.61648588180542, "epoch": 2.0353238669519547, "grad_norm": 1.1875, "learning_rate": 0.0004581463014479459, "loss": 4.967, "mean_token_accuracy": 0.20813992321491243, "num_tokens": 45376528.0, "step": 26160 }, { "entropy": 5.616622877120972, "epoch": 2.0357128963236724, "grad_norm": 1.09375, "learning_rate": 0.0004581302004088095, "loss": 4.9012, "mean_token_accuracy": 0.20849689692258835, "num_tokens": 45385391.0, "step": 26165 }, { "entropy": 5.54474835395813, "epoch": 2.03610192569539, "grad_norm": 1.234375, "learning_rate": 0.0004581140965909638, "loss": 4.8606, "mean_token_accuracy": 0.22134160548448562, "num_tokens": 45393029.0, "step": 26170 }, { "entropy": 5.612124729156494, "epoch": 2.0364909550671078, "grad_norm": 1.21875, "learning_rate": 0.0004580979899946531, "loss": 4.9403, "mean_token_accuracy": 0.2041140988469124, "num_tokens": 45401602.0, "step": 26175 }, { "entropy": 5.64312515258789, "epoch": 2.036879984438825, "grad_norm": 1.234375, "learning_rate": 0.0004580818806201219, "loss": 5.0203, "mean_token_accuracy": 0.19860402941703797, "num_tokens": 45410589.0, "step": 26180 }, { "entropy": 5.72422194480896, "epoch": 2.0372690138105427, "grad_norm": 1.125, "learning_rate": 0.00045806576846761453, "loss": 5.0854, "mean_token_accuracy": 0.20496964901685716, "num_tokens": 45419932.0, "step": 26185 }, { "entropy": 5.652226829528809, "epoch": 2.0376580431822604, "grad_norm": 1.171875, "learning_rate": 0.00045804965353737556, "loss": 4.9644, "mean_token_accuracy": 0.20599112808704376, "num_tokens": 45428696.0, "step": 26190 }, { "entropy": 5.696899366378784, "epoch": 2.0380470725539777, "grad_norm": 1.25, "learning_rate": 0.0004580335358296494, "loss": 5.0859, "mean_token_accuracy": 0.2029459908604622, "num_tokens": 45437236.0, "step": 26195 }, { "entropy": 5.692737579345703, "epoch": 2.0384361019256954, "grad_norm": 1.1875, "learning_rate": 0.00045801741534468065, "loss": 5.0582, "mean_token_accuracy": 0.20233915895223617, "num_tokens": 45445989.0, "step": 26200 }, { "entropy": 5.64029541015625, "epoch": 2.038825131297413, "grad_norm": 1.1171875, "learning_rate": 0.0004580012920827139, "loss": 5.0155, "mean_token_accuracy": 0.21099424511194229, "num_tokens": 45455100.0, "step": 26205 }, { "entropy": 5.606807899475098, "epoch": 2.0392141606691303, "grad_norm": 1.21875, "learning_rate": 0.0004579851660439939, "loss": 4.9183, "mean_token_accuracy": 0.2062552571296692, "num_tokens": 45463302.0, "step": 26210 }, { "entropy": 5.628108501434326, "epoch": 2.039603190040848, "grad_norm": 1.2109375, "learning_rate": 0.00045796903722876523, "loss": 5.0209, "mean_token_accuracy": 0.20065639317035674, "num_tokens": 45472181.0, "step": 26215 }, { "entropy": 5.719865608215332, "epoch": 2.0399922194125657, "grad_norm": 1.203125, "learning_rate": 0.0004579529056372726, "loss": 5.056, "mean_token_accuracy": 0.2014218434691429, "num_tokens": 45480878.0, "step": 26220 }, { "entropy": 5.697950172424316, "epoch": 2.0403812487842834, "grad_norm": 1.2421875, "learning_rate": 0.0004579367712697609, "loss": 4.9781, "mean_token_accuracy": 0.19562004059553145, "num_tokens": 45489826.0, "step": 26225 }, { "entropy": 5.636931133270264, "epoch": 2.0407702781560006, "grad_norm": 1.203125, "learning_rate": 0.00045792063412647475, "loss": 5.0324, "mean_token_accuracy": 0.1990480378270149, "num_tokens": 45498467.0, "step": 26230 }, { "entropy": 5.584613609313965, "epoch": 2.0411593075277183, "grad_norm": 1.234375, "learning_rate": 0.00045790449420765925, "loss": 4.8816, "mean_token_accuracy": 0.20481869727373123, "num_tokens": 45507221.0, "step": 26235 }, { "entropy": 5.663542079925537, "epoch": 2.041548336899436, "grad_norm": 1.0859375, "learning_rate": 0.00045788835151355914, "loss": 4.9737, "mean_token_accuracy": 0.20287013351917266, "num_tokens": 45516291.0, "step": 26240 }, { "entropy": 5.607553195953369, "epoch": 2.0419373662711533, "grad_norm": 1.140625, "learning_rate": 0.00045787220604441933, "loss": 4.9487, "mean_token_accuracy": 0.21028766483068467, "num_tokens": 45524210.0, "step": 26245 }, { "entropy": 5.6377815246582035, "epoch": 2.042326395642871, "grad_norm": 1.1796875, "learning_rate": 0.00045785605780048497, "loss": 4.977, "mean_token_accuracy": 0.2052060216665268, "num_tokens": 45533113.0, "step": 26250 }, { "entropy": 5.573250675201416, "epoch": 2.0427154250145887, "grad_norm": 1.140625, "learning_rate": 0.00045783990678200086, "loss": 4.8522, "mean_token_accuracy": 0.21622478365898132, "num_tokens": 45542139.0, "step": 26255 }, { "entropy": 5.680645942687988, "epoch": 2.043104454386306, "grad_norm": 1.140625, "learning_rate": 0.00045782375298921227, "loss": 5.0089, "mean_token_accuracy": 0.19603093415498735, "num_tokens": 45550780.0, "step": 26260 }, { "entropy": 5.668607378005982, "epoch": 2.0434934837580236, "grad_norm": 1.1796875, "learning_rate": 0.0004578075964223642, "loss": 4.9574, "mean_token_accuracy": 0.20450927317142487, "num_tokens": 45559263.0, "step": 26265 }, { "entropy": 5.636191987991333, "epoch": 2.0438825131297413, "grad_norm": 1.140625, "learning_rate": 0.0004577914370817018, "loss": 4.9857, "mean_token_accuracy": 0.21452201902866364, "num_tokens": 45567346.0, "step": 26270 }, { "entropy": 5.545056867599487, "epoch": 2.044271542501459, "grad_norm": 1.1796875, "learning_rate": 0.00045777527496747034, "loss": 4.9555, "mean_token_accuracy": 0.20835826247930528, "num_tokens": 45575580.0, "step": 26275 }, { "entropy": 5.621274709701538, "epoch": 2.0446605718731763, "grad_norm": 1.1796875, "learning_rate": 0.00045775911007991493, "loss": 4.9767, "mean_token_accuracy": 0.20811544209718705, "num_tokens": 45583939.0, "step": 26280 }, { "entropy": 5.758362817764282, "epoch": 2.045049601244894, "grad_norm": 1.125, "learning_rate": 0.00045774294241928093, "loss": 5.0629, "mean_token_accuracy": 0.1999020665884018, "num_tokens": 45592232.0, "step": 26285 }, { "entropy": 5.691959619522095, "epoch": 2.0454386306166117, "grad_norm": 1.09375, "learning_rate": 0.0004577267719858137, "loss": 4.9737, "mean_token_accuracy": 0.20723421573638917, "num_tokens": 45600775.0, "step": 26290 }, { "entropy": 5.59557614326477, "epoch": 2.045827659988329, "grad_norm": 1.1796875, "learning_rate": 0.00045771059877975853, "loss": 4.9438, "mean_token_accuracy": 0.20963931530714036, "num_tokens": 45610068.0, "step": 26295 }, { "entropy": 5.643482494354248, "epoch": 2.0462166893600466, "grad_norm": 1.1953125, "learning_rate": 0.0004576944228013608, "loss": 4.9452, "mean_token_accuracy": 0.2099675253033638, "num_tokens": 45618480.0, "step": 26300 }, { "entropy": 5.692978477478027, "epoch": 2.0466057187317643, "grad_norm": 1.1875, "learning_rate": 0.000457678244050866, "loss": 5.0633, "mean_token_accuracy": 0.19626158922910691, "num_tokens": 45627534.0, "step": 26305 }, { "entropy": 5.5980347156524655, "epoch": 2.046994748103482, "grad_norm": 1.21875, "learning_rate": 0.0004576620625285196, "loss": 4.9837, "mean_token_accuracy": 0.2055788069963455, "num_tokens": 45636450.0, "step": 26310 }, { "entropy": 5.646435880661011, "epoch": 2.0473837774751993, "grad_norm": 1.078125, "learning_rate": 0.00045764587823456717, "loss": 4.9878, "mean_token_accuracy": 0.2107054904103279, "num_tokens": 45646000.0, "step": 26315 }, { "entropy": 5.708975839614868, "epoch": 2.047772806846917, "grad_norm": 1.1328125, "learning_rate": 0.00045762969116925424, "loss": 5.0134, "mean_token_accuracy": 0.19655341655015945, "num_tokens": 45655211.0, "step": 26320 }, { "entropy": 5.6566015720367435, "epoch": 2.0481618362186347, "grad_norm": 1.2890625, "learning_rate": 0.00045761350133282643, "loss": 5.065, "mean_token_accuracy": 0.2012076810002327, "num_tokens": 45664397.0, "step": 26325 }, { "entropy": 5.629683303833008, "epoch": 2.048550865590352, "grad_norm": 1.4765625, "learning_rate": 0.00045759730872552937, "loss": 4.9895, "mean_token_accuracy": 0.20859864354133606, "num_tokens": 45672734.0, "step": 26330 }, { "entropy": 5.610647535324096, "epoch": 2.0489398949620696, "grad_norm": 1.1796875, "learning_rate": 0.0004575811133476088, "loss": 4.9792, "mean_token_accuracy": 0.19796843081712723, "num_tokens": 45681386.0, "step": 26335 }, { "entropy": 5.688955879211425, "epoch": 2.0493289243337873, "grad_norm": 1.15625, "learning_rate": 0.00045756491519931047, "loss": 5.0273, "mean_token_accuracy": 0.19835065305233002, "num_tokens": 45690726.0, "step": 26340 }, { "entropy": 5.648142910003662, "epoch": 2.0497179537055046, "grad_norm": 1.328125, "learning_rate": 0.0004575487142808801, "loss": 4.9431, "mean_token_accuracy": 0.2047296866774559, "num_tokens": 45699438.0, "step": 26345 }, { "entropy": 5.646206378936768, "epoch": 2.0501069830772223, "grad_norm": 1.2890625, "learning_rate": 0.0004575325105925636, "loss": 4.9412, "mean_token_accuracy": 0.20050771832466124, "num_tokens": 45708446.0, "step": 26350 }, { "entropy": 5.722958421707153, "epoch": 2.05049601244894, "grad_norm": 1.1484375, "learning_rate": 0.00045751630413460665, "loss": 5.1405, "mean_token_accuracy": 0.1967083990573883, "num_tokens": 45717667.0, "step": 26355 }, { "entropy": 5.585675859451294, "epoch": 2.0508850418206577, "grad_norm": 1.3046875, "learning_rate": 0.0004575000949072554, "loss": 4.9102, "mean_token_accuracy": 0.2119559094309807, "num_tokens": 45727066.0, "step": 26360 }, { "entropy": 5.663078689575196, "epoch": 2.051274071192375, "grad_norm": 1.203125, "learning_rate": 0.0004574838829107557, "loss": 5.0041, "mean_token_accuracy": 0.20177053660154343, "num_tokens": 45735091.0, "step": 26365 }, { "entropy": 5.610561656951904, "epoch": 2.0516631005640926, "grad_norm": 1.2265625, "learning_rate": 0.0004574676681453535, "loss": 4.905, "mean_token_accuracy": 0.21462469249963761, "num_tokens": 45743715.0, "step": 26370 }, { "entropy": 5.604492425918579, "epoch": 2.0520521299358103, "grad_norm": 1.1640625, "learning_rate": 0.00045745145061129485, "loss": 4.9083, "mean_token_accuracy": 0.20644875466823578, "num_tokens": 45751906.0, "step": 26375 }, { "entropy": 5.589149808883667, "epoch": 2.0524411593075276, "grad_norm": 1.1640625, "learning_rate": 0.00045743523030882584, "loss": 4.9457, "mean_token_accuracy": 0.20341716408729554, "num_tokens": 45760627.0, "step": 26380 }, { "entropy": 5.579925012588501, "epoch": 2.0528301886792453, "grad_norm": 1.203125, "learning_rate": 0.0004574190072381926, "loss": 4.9798, "mean_token_accuracy": 0.2025664135813713, "num_tokens": 45769249.0, "step": 26385 }, { "entropy": 5.540699195861817, "epoch": 2.053219218050963, "grad_norm": 1.25, "learning_rate": 0.0004574027813996413, "loss": 4.8746, "mean_token_accuracy": 0.2093506082892418, "num_tokens": 45776914.0, "step": 26390 }, { "entropy": 5.6074995517730715, "epoch": 2.05360824742268, "grad_norm": 1.078125, "learning_rate": 0.0004573865527934181, "loss": 4.9506, "mean_token_accuracy": 0.20277193188667297, "num_tokens": 45785978.0, "step": 26395 }, { "entropy": 5.672599411010742, "epoch": 2.053997276794398, "grad_norm": 1.1953125, "learning_rate": 0.0004573703214197692, "loss": 5.035, "mean_token_accuracy": 0.20061203241348266, "num_tokens": 45794477.0, "step": 26400 }, { "entropy": 5.732485771179199, "epoch": 2.0543863061661156, "grad_norm": 1.2265625, "learning_rate": 0.00045735408727894095, "loss": 5.05, "mean_token_accuracy": 0.200111548602581, "num_tokens": 45803223.0, "step": 26405 }, { "entropy": 5.62385516166687, "epoch": 2.0547753355378333, "grad_norm": 1.140625, "learning_rate": 0.00045733785037117977, "loss": 4.93, "mean_token_accuracy": 0.20855015516281128, "num_tokens": 45812357.0, "step": 26410 }, { "entropy": 5.629200458526611, "epoch": 2.0551643649095506, "grad_norm": 1.1875, "learning_rate": 0.0004573216106967319, "loss": 4.9492, "mean_token_accuracy": 0.20995305180549623, "num_tokens": 45821443.0, "step": 26415 }, { "entropy": 5.696522998809814, "epoch": 2.0555533942812683, "grad_norm": 1.1171875, "learning_rate": 0.00045730536825584365, "loss": 5.0333, "mean_token_accuracy": 0.19735227227211, "num_tokens": 45829730.0, "step": 26420 }, { "entropy": 5.646669578552246, "epoch": 2.055942423652986, "grad_norm": 1.1875, "learning_rate": 0.00045728912304876176, "loss": 5.0185, "mean_token_accuracy": 0.20214956104755402, "num_tokens": 45839221.0, "step": 26425 }, { "entropy": 5.616559982299805, "epoch": 2.056331453024703, "grad_norm": 1.1640625, "learning_rate": 0.0004572728750757326, "loss": 4.969, "mean_token_accuracy": 0.20486962497234346, "num_tokens": 45848385.0, "step": 26430 }, { "entropy": 5.6246153831481935, "epoch": 2.056720482396421, "grad_norm": 1.21875, "learning_rate": 0.0004572566243370025, "loss": 4.8406, "mean_token_accuracy": 0.21495334208011627, "num_tokens": 45856443.0, "step": 26435 }, { "entropy": 5.575373697280884, "epoch": 2.0571095117681386, "grad_norm": 1.1796875, "learning_rate": 0.0004572403708328183, "loss": 4.9213, "mean_token_accuracy": 0.2129769966006279, "num_tokens": 45864797.0, "step": 26440 }, { "entropy": 5.560120296478272, "epoch": 2.057498541139856, "grad_norm": 1.1484375, "learning_rate": 0.0004572241145634266, "loss": 4.9464, "mean_token_accuracy": 0.2054147630929947, "num_tokens": 45873266.0, "step": 26445 }, { "entropy": 5.543383550643921, "epoch": 2.0578875705115736, "grad_norm": 1.1484375, "learning_rate": 0.000457207855529074, "loss": 4.9395, "mean_token_accuracy": 0.2077618733048439, "num_tokens": 45881496.0, "step": 26450 }, { "entropy": 5.4915107727050785, "epoch": 2.0582765998832913, "grad_norm": 1.171875, "learning_rate": 0.00045719159373000713, "loss": 4.8341, "mean_token_accuracy": 0.217554672062397, "num_tokens": 45889638.0, "step": 26455 }, { "entropy": 5.5725353240966795, "epoch": 2.058665629255009, "grad_norm": 1.1796875, "learning_rate": 0.0004571753291664729, "loss": 4.9076, "mean_token_accuracy": 0.21190561801195146, "num_tokens": 45898137.0, "step": 26460 }, { "entropy": 5.649677515029907, "epoch": 2.059054658626726, "grad_norm": 1.1953125, "learning_rate": 0.0004571590618387179, "loss": 5.0177, "mean_token_accuracy": 0.2069894477725029, "num_tokens": 45906533.0, "step": 26465 }, { "entropy": 5.646552848815918, "epoch": 2.059443687998444, "grad_norm": 1.1953125, "learning_rate": 0.0004571427917469892, "loss": 4.9384, "mean_token_accuracy": 0.2084255263209343, "num_tokens": 45915497.0, "step": 26470 }, { "entropy": 5.6400614261627195, "epoch": 2.0598327173701616, "grad_norm": 1.1640625, "learning_rate": 0.00045712651889153345, "loss": 5.0352, "mean_token_accuracy": 0.20079196542501448, "num_tokens": 45924883.0, "step": 26475 }, { "entropy": 5.6329563617706295, "epoch": 2.060221746741879, "grad_norm": 1.1875, "learning_rate": 0.00045711024327259764, "loss": 4.9941, "mean_token_accuracy": 0.20458641052246093, "num_tokens": 45933038.0, "step": 26480 }, { "entropy": 5.641636180877685, "epoch": 2.0606107761135966, "grad_norm": 1.2265625, "learning_rate": 0.00045709396489042884, "loss": 5.0195, "mean_token_accuracy": 0.20292631089687346, "num_tokens": 45941191.0, "step": 26485 }, { "entropy": 5.622003221511841, "epoch": 2.0609998054853143, "grad_norm": 1.1484375, "learning_rate": 0.00045707768374527385, "loss": 4.9707, "mean_token_accuracy": 0.20311365276575089, "num_tokens": 45949957.0, "step": 26490 }, { "entropy": 5.630477571487427, "epoch": 2.0613888348570315, "grad_norm": 1.3203125, "learning_rate": 0.0004570613998373799, "loss": 5.0323, "mean_token_accuracy": 0.20093651860952377, "num_tokens": 45958104.0, "step": 26495 }, { "entropy": 5.637386274337769, "epoch": 2.061777864228749, "grad_norm": 1.2578125, "learning_rate": 0.00045704511316699395, "loss": 4.9921, "mean_token_accuracy": 0.2030844047665596, "num_tokens": 45966651.0, "step": 26500 }, { "entropy": 5.671005725860596, "epoch": 2.062166893600467, "grad_norm": 1.1640625, "learning_rate": 0.00045702882373436317, "loss": 4.9582, "mean_token_accuracy": 0.2016158476471901, "num_tokens": 45975352.0, "step": 26505 }, { "entropy": 5.560907793045044, "epoch": 2.0625559229721846, "grad_norm": 1.1796875, "learning_rate": 0.0004570125315397347, "loss": 4.8993, "mean_token_accuracy": 0.21164680868387223, "num_tokens": 45983844.0, "step": 26510 }, { "entropy": 5.684816455841064, "epoch": 2.062944952343902, "grad_norm": 1.203125, "learning_rate": 0.0004569962365833558, "loss": 5.0177, "mean_token_accuracy": 0.1996267929673195, "num_tokens": 45992871.0, "step": 26515 }, { "entropy": 5.547699213027954, "epoch": 2.0633339817156195, "grad_norm": 1.1640625, "learning_rate": 0.00045697993886547374, "loss": 4.8711, "mean_token_accuracy": 0.21368182003498076, "num_tokens": 46001984.0, "step": 26520 }, { "entropy": 5.599789476394653, "epoch": 2.0637230110873372, "grad_norm": 1.3046875, "learning_rate": 0.00045696363838633566, "loss": 4.9499, "mean_token_accuracy": 0.20727853626012802, "num_tokens": 46010075.0, "step": 26525 }, { "entropy": 5.6519876480102536, "epoch": 2.0641120404590545, "grad_norm": 1.1484375, "learning_rate": 0.00045694733514618904, "loss": 5.0149, "mean_token_accuracy": 0.20114164650440217, "num_tokens": 46019597.0, "step": 26530 }, { "entropy": 5.653260564804077, "epoch": 2.064501069830772, "grad_norm": 1.0859375, "learning_rate": 0.0004569310291452812, "loss": 4.9807, "mean_token_accuracy": 0.20401397049427034, "num_tokens": 46027973.0, "step": 26535 }, { "entropy": 5.612961626052856, "epoch": 2.06489009920249, "grad_norm": 1.265625, "learning_rate": 0.0004569147203838595, "loss": 4.9743, "mean_token_accuracy": 0.20062805265188216, "num_tokens": 46037675.0, "step": 26540 }, { "entropy": 5.702121210098267, "epoch": 2.065279128574207, "grad_norm": 1.1875, "learning_rate": 0.00045689840886217157, "loss": 5.0487, "mean_token_accuracy": 0.19459159225225447, "num_tokens": 46046281.0, "step": 26545 }, { "entropy": 5.680599355697632, "epoch": 2.065668157945925, "grad_norm": 1.1484375, "learning_rate": 0.00045688209458046475, "loss": 4.8931, "mean_token_accuracy": 0.2129101499915123, "num_tokens": 46054920.0, "step": 26550 }, { "entropy": 5.556121110916138, "epoch": 2.0660571873176425, "grad_norm": 1.2109375, "learning_rate": 0.00045686577753898663, "loss": 4.9129, "mean_token_accuracy": 0.21250634640455246, "num_tokens": 46063023.0, "step": 26555 }, { "entropy": 5.591476535797119, "epoch": 2.0664462166893602, "grad_norm": 1.1484375, "learning_rate": 0.00045684945773798483, "loss": 4.9259, "mean_token_accuracy": 0.2085109308362007, "num_tokens": 46071912.0, "step": 26560 }, { "entropy": 5.620500135421753, "epoch": 2.0668352460610775, "grad_norm": 1.2421875, "learning_rate": 0.000456833135177707, "loss": 4.9545, "mean_token_accuracy": 0.20158397555351257, "num_tokens": 46080703.0, "step": 26565 }, { "entropy": 5.63456883430481, "epoch": 2.067224275432795, "grad_norm": 1.1796875, "learning_rate": 0.0004568168098584007, "loss": 4.9846, "mean_token_accuracy": 0.2025320664048195, "num_tokens": 46088761.0, "step": 26570 }, { "entropy": 5.59713191986084, "epoch": 2.067613304804513, "grad_norm": 1.0859375, "learning_rate": 0.0004568004817803137, "loss": 5.019, "mean_token_accuracy": 0.2018290713429451, "num_tokens": 46097509.0, "step": 26575 }, { "entropy": 5.612489461898804, "epoch": 2.06800233417623, "grad_norm": 1.2578125, "learning_rate": 0.0004567841509436937, "loss": 4.9069, "mean_token_accuracy": 0.20884002447128297, "num_tokens": 46105836.0, "step": 26580 }, { "entropy": 5.535917901992798, "epoch": 2.068391363547948, "grad_norm": 1.140625, "learning_rate": 0.0004567678173487887, "loss": 4.923, "mean_token_accuracy": 0.20524317920207977, "num_tokens": 46114771.0, "step": 26585 }, { "entropy": 5.651635551452637, "epoch": 2.0687803929196655, "grad_norm": 1.125, "learning_rate": 0.0004567514809958462, "loss": 5.0806, "mean_token_accuracy": 0.19648711681365966, "num_tokens": 46122702.0, "step": 26590 }, { "entropy": 5.632438468933105, "epoch": 2.069169422291383, "grad_norm": 1.15625, "learning_rate": 0.0004567351418851144, "loss": 4.9751, "mean_token_accuracy": 0.20312962532043458, "num_tokens": 46131134.0, "step": 26595 }, { "entropy": 5.658031606674195, "epoch": 2.0695584516631005, "grad_norm": 1.1640625, "learning_rate": 0.00045671880001684113, "loss": 4.9637, "mean_token_accuracy": 0.20567927211523057, "num_tokens": 46140558.0, "step": 26600 }, { "entropy": 5.64303731918335, "epoch": 2.069947481034818, "grad_norm": 1.2109375, "learning_rate": 0.00045670245539127413, "loss": 5.0102, "mean_token_accuracy": 0.2022929459810257, "num_tokens": 46148886.0, "step": 26605 }, { "entropy": 5.622505712509155, "epoch": 2.070336510406536, "grad_norm": 1.1484375, "learning_rate": 0.00045668610800866173, "loss": 4.9949, "mean_token_accuracy": 0.20936911106109618, "num_tokens": 46158011.0, "step": 26610 }, { "entropy": 5.476855373382568, "epoch": 2.070725539778253, "grad_norm": 1.078125, "learning_rate": 0.00045666975786925177, "loss": 4.7649, "mean_token_accuracy": 0.21348540335893632, "num_tokens": 46166510.0, "step": 26615 }, { "entropy": 5.5634912014007565, "epoch": 2.071114569149971, "grad_norm": 1.3046875, "learning_rate": 0.0004566534049732923, "loss": 4.8375, "mean_token_accuracy": 0.21540530622005463, "num_tokens": 46174857.0, "step": 26620 }, { "entropy": 5.510746145248413, "epoch": 2.0715035985216885, "grad_norm": 1.1875, "learning_rate": 0.00045663704932103166, "loss": 4.8922, "mean_token_accuracy": 0.2111956536769867, "num_tokens": 46183221.0, "step": 26625 }, { "entropy": 5.590742206573486, "epoch": 2.071892627893406, "grad_norm": 1.125, "learning_rate": 0.00045662069091271785, "loss": 5.0047, "mean_token_accuracy": 0.20554569810628892, "num_tokens": 46192941.0, "step": 26630 }, { "entropy": 5.6010912418365475, "epoch": 2.0722816572651235, "grad_norm": 1.15625, "learning_rate": 0.00045660432974859924, "loss": 4.9397, "mean_token_accuracy": 0.2066770911216736, "num_tokens": 46201900.0, "step": 26635 }, { "entropy": 5.595024251937867, "epoch": 2.072670686636841, "grad_norm": 1.203125, "learning_rate": 0.00045658796582892383, "loss": 4.8666, "mean_token_accuracy": 0.21004868894815446, "num_tokens": 46209952.0, "step": 26640 }, { "entropy": 5.651596975326538, "epoch": 2.073059716008559, "grad_norm": 1.2109375, "learning_rate": 0.00045657159915394013, "loss": 5.0795, "mean_token_accuracy": 0.20071132481098175, "num_tokens": 46218434.0, "step": 26645 }, { "entropy": 5.626325225830078, "epoch": 2.073448745380276, "grad_norm": 1.171875, "learning_rate": 0.0004565552297238964, "loss": 4.9646, "mean_token_accuracy": 0.20503720939159392, "num_tokens": 46226712.0, "step": 26650 }, { "entropy": 5.5914007186889645, "epoch": 2.073837774751994, "grad_norm": 1.125, "learning_rate": 0.000456538857539041, "loss": 4.9224, "mean_token_accuracy": 0.20591310858726503, "num_tokens": 46236006.0, "step": 26655 }, { "entropy": 5.616474294662476, "epoch": 2.0742268041237115, "grad_norm": 1.265625, "learning_rate": 0.00045652248259962254, "loss": 4.9785, "mean_token_accuracy": 0.2052401304244995, "num_tokens": 46244666.0, "step": 26660 }, { "entropy": 5.616417694091797, "epoch": 2.0746158334954288, "grad_norm": 1.1953125, "learning_rate": 0.0004565061049058892, "loss": 4.9743, "mean_token_accuracy": 0.20762315690517424, "num_tokens": 46252816.0, "step": 26665 }, { "entropy": 5.612368202209472, "epoch": 2.0750048628671465, "grad_norm": 1.078125, "learning_rate": 0.00045648972445808963, "loss": 4.9822, "mean_token_accuracy": 0.20806040316820146, "num_tokens": 46261912.0, "step": 26670 }, { "entropy": 5.544836044311523, "epoch": 2.075393892238864, "grad_norm": 1.15625, "learning_rate": 0.00045647334125647235, "loss": 4.842, "mean_token_accuracy": 0.2208395704627037, "num_tokens": 46270702.0, "step": 26675 }, { "entropy": 5.585010814666748, "epoch": 2.0757829216105814, "grad_norm": 1.21875, "learning_rate": 0.000456456955301286, "loss": 4.8794, "mean_token_accuracy": 0.2122930943965912, "num_tokens": 46279590.0, "step": 26680 }, { "entropy": 5.589020919799805, "epoch": 2.076171950982299, "grad_norm": 1.3203125, "learning_rate": 0.0004564405665927791, "loss": 4.9885, "mean_token_accuracy": 0.20397457629442214, "num_tokens": 46287330.0, "step": 26685 }, { "entropy": 5.633216619491577, "epoch": 2.076560980354017, "grad_norm": 1.171875, "learning_rate": 0.00045642417513120043, "loss": 5.0145, "mean_token_accuracy": 0.20234276354312897, "num_tokens": 46297048.0, "step": 26690 }, { "entropy": 5.5670215606689455, "epoch": 2.076950009725734, "grad_norm": 1.2421875, "learning_rate": 0.00045640778091679876, "loss": 4.8905, "mean_token_accuracy": 0.2078715980052948, "num_tokens": 46305554.0, "step": 26695 }, { "entropy": 5.608142423629761, "epoch": 2.0773390390974518, "grad_norm": 1.2734375, "learning_rate": 0.0004563913839498226, "loss": 4.9968, "mean_token_accuracy": 0.1995532065629959, "num_tokens": 46315592.0, "step": 26700 }, { "entropy": 5.570044755935669, "epoch": 2.0777280684691695, "grad_norm": 1.1875, "learning_rate": 0.000456374984230521, "loss": 4.8951, "mean_token_accuracy": 0.21533555686473846, "num_tokens": 46323686.0, "step": 26705 }, { "entropy": 5.6297022819519045, "epoch": 2.078117097840887, "grad_norm": 1.140625, "learning_rate": 0.0004563585817591427, "loss": 4.9286, "mean_token_accuracy": 0.2044871598482132, "num_tokens": 46332954.0, "step": 26710 }, { "entropy": 5.5705564498901365, "epoch": 2.0785061272126044, "grad_norm": 1.25, "learning_rate": 0.0004563421765359365, "loss": 4.9592, "mean_token_accuracy": 0.21645950376987458, "num_tokens": 46341126.0, "step": 26715 }, { "entropy": 5.634419870376587, "epoch": 2.078895156584322, "grad_norm": 1.1640625, "learning_rate": 0.00045632576856115156, "loss": 5.0474, "mean_token_accuracy": 0.19495265930891037, "num_tokens": 46349981.0, "step": 26720 }, { "entropy": 5.646301364898681, "epoch": 2.07928418595604, "grad_norm": 1.171875, "learning_rate": 0.00045630935783503657, "loss": 4.9135, "mean_token_accuracy": 0.21006859391927718, "num_tokens": 46358238.0, "step": 26725 }, { "entropy": 5.649518871307373, "epoch": 2.079673215327757, "grad_norm": 1.140625, "learning_rate": 0.0004562929443578407, "loss": 5.0142, "mean_token_accuracy": 0.2064436599612236, "num_tokens": 46367283.0, "step": 26730 }, { "entropy": 5.58906307220459, "epoch": 2.0800622446994748, "grad_norm": 1.171875, "learning_rate": 0.0004562765281298129, "loss": 4.9379, "mean_token_accuracy": 0.2081178531050682, "num_tokens": 46375622.0, "step": 26735 }, { "entropy": 5.641617631912231, "epoch": 2.0804512740711925, "grad_norm": 1.2109375, "learning_rate": 0.0004562601091512024, "loss": 4.9605, "mean_token_accuracy": 0.21279183477163316, "num_tokens": 46384106.0, "step": 26740 }, { "entropy": 5.6219072341918945, "epoch": 2.08084030344291, "grad_norm": 1.1484375, "learning_rate": 0.0004562436874222582, "loss": 4.9885, "mean_token_accuracy": 0.20291046500205995, "num_tokens": 46392731.0, "step": 26745 }, { "entropy": 5.602282905578614, "epoch": 2.0812293328146274, "grad_norm": 1.1796875, "learning_rate": 0.00045622726294322955, "loss": 5.0797, "mean_token_accuracy": 0.1947156846523285, "num_tokens": 46402474.0, "step": 26750 }, { "entropy": 5.699810266494751, "epoch": 2.081618362186345, "grad_norm": 1.0703125, "learning_rate": 0.00045621083571436563, "loss": 5.0486, "mean_token_accuracy": 0.19503010660409928, "num_tokens": 46411994.0, "step": 26755 }, { "entropy": 5.666330194473266, "epoch": 2.082007391558063, "grad_norm": 1.1640625, "learning_rate": 0.0004561944057359157, "loss": 4.9332, "mean_token_accuracy": 0.20660813450813292, "num_tokens": 46420926.0, "step": 26760 }, { "entropy": 5.609892272949219, "epoch": 2.08239642092978, "grad_norm": 1.2265625, "learning_rate": 0.0004561779730081291, "loss": 5.0232, "mean_token_accuracy": 0.20208125412464142, "num_tokens": 46429432.0, "step": 26765 }, { "entropy": 5.512168979644775, "epoch": 2.0827854503014978, "grad_norm": 1.125, "learning_rate": 0.0004561615375312551, "loss": 4.8878, "mean_token_accuracy": 0.20943790972232817, "num_tokens": 46437882.0, "step": 26770 }, { "entropy": 5.683145666122437, "epoch": 2.0831744796732155, "grad_norm": 1.21875, "learning_rate": 0.00045614509930554304, "loss": 5.0258, "mean_token_accuracy": 0.2025373548269272, "num_tokens": 46446856.0, "step": 26775 }, { "entropy": 5.70679874420166, "epoch": 2.0835635090449327, "grad_norm": 1.09375, "learning_rate": 0.00045612865833124253, "loss": 5.0373, "mean_token_accuracy": 0.19571487307548524, "num_tokens": 46456424.0, "step": 26780 }, { "entropy": 5.607332324981689, "epoch": 2.0839525384166504, "grad_norm": 1.1875, "learning_rate": 0.0004561122146086029, "loss": 4.9493, "mean_token_accuracy": 0.20983870923519135, "num_tokens": 46465082.0, "step": 26785 }, { "entropy": 5.630939245223999, "epoch": 2.084341567788368, "grad_norm": 1.171875, "learning_rate": 0.0004560957681378737, "loss": 5.0802, "mean_token_accuracy": 0.19562057703733443, "num_tokens": 46474502.0, "step": 26790 }, { "entropy": 5.642990779876709, "epoch": 2.084730597160086, "grad_norm": 1.296875, "learning_rate": 0.00045607931891930445, "loss": 4.9487, "mean_token_accuracy": 0.20131320655345916, "num_tokens": 46483582.0, "step": 26795 }, { "entropy": 5.626100778579712, "epoch": 2.085119626531803, "grad_norm": 1.234375, "learning_rate": 0.0004560628669531447, "loss": 5.0114, "mean_token_accuracy": 0.20313573479652405, "num_tokens": 46492193.0, "step": 26800 }, { "entropy": 5.681998872756958, "epoch": 2.0855086559035207, "grad_norm": 1.1640625, "learning_rate": 0.00045604641223964416, "loss": 5.024, "mean_token_accuracy": 0.20447239577770232, "num_tokens": 46499771.0, "step": 26805 }, { "entropy": 5.646428012847901, "epoch": 2.0858976852752384, "grad_norm": 1.1015625, "learning_rate": 0.00045602995477905247, "loss": 4.9586, "mean_token_accuracy": 0.20567684173583983, "num_tokens": 46508792.0, "step": 26810 }, { "entropy": 5.636980104446411, "epoch": 2.0862867146469557, "grad_norm": 1.2578125, "learning_rate": 0.0004560134945716194, "loss": 4.989, "mean_token_accuracy": 0.2018295094370842, "num_tokens": 46516384.0, "step": 26815 }, { "entropy": 5.618140983581543, "epoch": 2.0866757440186734, "grad_norm": 1.125, "learning_rate": 0.00045599703161759464, "loss": 5.0216, "mean_token_accuracy": 0.19898437708616257, "num_tokens": 46525663.0, "step": 26820 }, { "entropy": 5.727896118164063, "epoch": 2.087064773390391, "grad_norm": 1.15625, "learning_rate": 0.00045598056591722805, "loss": 4.9714, "mean_token_accuracy": 0.2045079290866852, "num_tokens": 46534284.0, "step": 26825 }, { "entropy": 5.648638486862183, "epoch": 2.0874538027621083, "grad_norm": 1.1484375, "learning_rate": 0.00045596409747076936, "loss": 4.9328, "mean_token_accuracy": 0.21205185800790788, "num_tokens": 46542695.0, "step": 26830 }, { "entropy": 5.646912145614624, "epoch": 2.087842832133826, "grad_norm": 1.1640625, "learning_rate": 0.0004559476262784686, "loss": 5.0588, "mean_token_accuracy": 0.20022041201591492, "num_tokens": 46552098.0, "step": 26835 }, { "entropy": 5.621468210220337, "epoch": 2.0882318615055437, "grad_norm": 1.21875, "learning_rate": 0.0004559311523405755, "loss": 4.9764, "mean_token_accuracy": 0.21050500273704528, "num_tokens": 46560434.0, "step": 26840 }, { "entropy": 5.582331609725952, "epoch": 2.0886208908772614, "grad_norm": 1.125, "learning_rate": 0.0004559146756573402, "loss": 4.9235, "mean_token_accuracy": 0.205746790766716, "num_tokens": 46569015.0, "step": 26845 }, { "entropy": 5.627817106246948, "epoch": 2.0890099202489787, "grad_norm": 1.1875, "learning_rate": 0.00045589819622901274, "loss": 5.0357, "mean_token_accuracy": 0.2004441276192665, "num_tokens": 46578220.0, "step": 26850 }, { "entropy": 5.63268551826477, "epoch": 2.0893989496206964, "grad_norm": 1.328125, "learning_rate": 0.000455881714055843, "loss": 4.9088, "mean_token_accuracy": 0.21371953934431076, "num_tokens": 46587449.0, "step": 26855 }, { "entropy": 5.575710153579712, "epoch": 2.089787978992414, "grad_norm": 1.09375, "learning_rate": 0.00045586522913808114, "loss": 4.9196, "mean_token_accuracy": 0.2046692430973053, "num_tokens": 46596150.0, "step": 26860 }, { "entropy": 5.618714475631714, "epoch": 2.0901770083641313, "grad_norm": 1.1484375, "learning_rate": 0.0004558487414759773, "loss": 4.9664, "mean_token_accuracy": 0.20941583663225175, "num_tokens": 46604382.0, "step": 26865 }, { "entropy": 5.6272753238677975, "epoch": 2.090566037735849, "grad_norm": 1.2421875, "learning_rate": 0.00045583225106978175, "loss": 4.9987, "mean_token_accuracy": 0.20499735623598098, "num_tokens": 46613247.0, "step": 26870 }, { "entropy": 5.554845571517944, "epoch": 2.0909550671075667, "grad_norm": 1.15625, "learning_rate": 0.0004558157579197446, "loss": 4.9378, "mean_token_accuracy": 0.20878576934337617, "num_tokens": 46621537.0, "step": 26875 }, { "entropy": 5.635019111633301, "epoch": 2.091344096479284, "grad_norm": 1.25, "learning_rate": 0.00045579926202611603, "loss": 4.9554, "mean_token_accuracy": 0.2066166251897812, "num_tokens": 46629434.0, "step": 26880 }, { "entropy": 5.632823944091797, "epoch": 2.0917331258510017, "grad_norm": 1.2109375, "learning_rate": 0.0004557827633891465, "loss": 5.0004, "mean_token_accuracy": 0.20207550525665283, "num_tokens": 46637331.0, "step": 26885 }, { "entropy": 5.540047597885132, "epoch": 2.0921221552227194, "grad_norm": 1.1484375, "learning_rate": 0.0004557662620090863, "loss": 4.8861, "mean_token_accuracy": 0.21149309277534484, "num_tokens": 46646176.0, "step": 26890 }, { "entropy": 5.5788984298706055, "epoch": 2.092511184594437, "grad_norm": 1.2734375, "learning_rate": 0.00045574975788618564, "loss": 4.8631, "mean_token_accuracy": 0.21030667573213577, "num_tokens": 46653785.0, "step": 26895 }, { "entropy": 5.508225631713867, "epoch": 2.0929002139661543, "grad_norm": 1.125, "learning_rate": 0.0004557332510206953, "loss": 4.8816, "mean_token_accuracy": 0.21081152707338333, "num_tokens": 46662457.0, "step": 26900 }, { "entropy": 5.550087594985962, "epoch": 2.093289243337872, "grad_norm": 1.2421875, "learning_rate": 0.0004557167414128654, "loss": 4.9469, "mean_token_accuracy": 0.20769478529691696, "num_tokens": 46670894.0, "step": 26905 }, { "entropy": 5.657681179046631, "epoch": 2.0936782727095897, "grad_norm": 1.1484375, "learning_rate": 0.0004557002290629467, "loss": 4.9748, "mean_token_accuracy": 0.203441846370697, "num_tokens": 46679128.0, "step": 26910 }, { "entropy": 5.584599018096924, "epoch": 2.094067302081307, "grad_norm": 1.1171875, "learning_rate": 0.00045568371397118954, "loss": 4.9504, "mean_token_accuracy": 0.2040469229221344, "num_tokens": 46688453.0, "step": 26915 }, { "entropy": 5.694149827957153, "epoch": 2.0944563314530247, "grad_norm": 1.2578125, "learning_rate": 0.0004556671961378446, "loss": 5.0916, "mean_token_accuracy": 0.19881702363491058, "num_tokens": 46697591.0, "step": 26920 }, { "entropy": 5.623454189300537, "epoch": 2.0948453608247424, "grad_norm": 1.1484375, "learning_rate": 0.00045565067556316264, "loss": 4.8942, "mean_token_accuracy": 0.2112753227353096, "num_tokens": 46706308.0, "step": 26925 }, { "entropy": 5.610533094406128, "epoch": 2.0952343901964596, "grad_norm": 1.125, "learning_rate": 0.0004556341522473941, "loss": 4.8543, "mean_token_accuracy": 0.2164320319890976, "num_tokens": 46714739.0, "step": 26930 }, { "entropy": 5.651600122451782, "epoch": 2.0956234195681773, "grad_norm": 1.109375, "learning_rate": 0.0004556176261907899, "loss": 5.0348, "mean_token_accuracy": 0.20308492034673692, "num_tokens": 46723586.0, "step": 26935 }, { "entropy": 5.674388742446899, "epoch": 2.096012448939895, "grad_norm": 1.2109375, "learning_rate": 0.0004556010973936006, "loss": 5.0148, "mean_token_accuracy": 0.20166873782873154, "num_tokens": 46732519.0, "step": 26940 }, { "entropy": 5.644387435913086, "epoch": 2.0964014783116127, "grad_norm": 1.125, "learning_rate": 0.0004555845658560772, "loss": 5.0033, "mean_token_accuracy": 0.20382509678602218, "num_tokens": 46741002.0, "step": 26945 }, { "entropy": 5.585394954681396, "epoch": 2.09679050768333, "grad_norm": 1.15625, "learning_rate": 0.00045556803157847036, "loss": 4.9162, "mean_token_accuracy": 0.21128481328487397, "num_tokens": 46749466.0, "step": 26950 }, { "entropy": 5.631072950363159, "epoch": 2.0971795370550477, "grad_norm": 1.140625, "learning_rate": 0.00045555149456103113, "loss": 4.876, "mean_token_accuracy": 0.20800571143627167, "num_tokens": 46758981.0, "step": 26955 }, { "entropy": 5.588720035552979, "epoch": 2.0975685664267654, "grad_norm": 1.1328125, "learning_rate": 0.0004555349548040102, "loss": 4.8884, "mean_token_accuracy": 0.20364405065774918, "num_tokens": 46767574.0, "step": 26960 }, { "entropy": 5.664254474639892, "epoch": 2.0979575957984826, "grad_norm": 1.1640625, "learning_rate": 0.0004555184123076589, "loss": 4.974, "mean_token_accuracy": 0.21018045991659165, "num_tokens": 46775804.0, "step": 26965 }, { "entropy": 5.630028343200683, "epoch": 2.0983466251702003, "grad_norm": 1.296875, "learning_rate": 0.00045550186707222785, "loss": 4.9511, "mean_token_accuracy": 0.21176621615886687, "num_tokens": 46784195.0, "step": 26970 }, { "entropy": 5.613404607772827, "epoch": 2.098735654541918, "grad_norm": 1.2421875, "learning_rate": 0.0004554853190979683, "loss": 4.9424, "mean_token_accuracy": 0.20522339642047882, "num_tokens": 46793430.0, "step": 26975 }, { "entropy": 5.620491981506348, "epoch": 2.0991246839136353, "grad_norm": 1.1796875, "learning_rate": 0.00045546876838513134, "loss": 4.946, "mean_token_accuracy": 0.20572441518306733, "num_tokens": 46802111.0, "step": 26980 }, { "entropy": 5.602687644958496, "epoch": 2.099513713285353, "grad_norm": 1.125, "learning_rate": 0.00045545221493396805, "loss": 4.9818, "mean_token_accuracy": 0.20563649982213975, "num_tokens": 46811301.0, "step": 26985 }, { "entropy": 5.620456218719482, "epoch": 2.0999027426570707, "grad_norm": 1.125, "learning_rate": 0.00045543565874472963, "loss": 5.0019, "mean_token_accuracy": 0.20078134536743164, "num_tokens": 46819957.0, "step": 26990 }, { "entropy": 5.613553619384765, "epoch": 2.1002917720287884, "grad_norm": 1.265625, "learning_rate": 0.00045541909981766725, "loss": 4.9588, "mean_token_accuracy": 0.2068886324763298, "num_tokens": 46828493.0, "step": 26995 }, { "entropy": 5.676879501342773, "epoch": 2.1006808014005056, "grad_norm": 1.21875, "learning_rate": 0.0004554025381530322, "loss": 4.9912, "mean_token_accuracy": 0.20754093378782273, "num_tokens": 46837213.0, "step": 27000 }, { "epoch": 2.1006808014005056, "eval_entropy": 5.3621790708775015, "eval_loss": 5.075078010559082, "eval_mean_token_accuracy": 0.2092321919049634, "eval_num_tokens": 46837213.0, "eval_runtime": 21.6549, "eval_samples_per_second": 1919.102, "eval_steps_per_second": 239.899, "step": 27000 }, { "entropy": 5.676884889602661, "epoch": 2.1010698307722233, "grad_norm": 1.265625, "learning_rate": 0.0004553859737510758, "loss": 5.0935, "mean_token_accuracy": 0.20030743926763533, "num_tokens": 46845439.0, "step": 27005 }, { "entropy": 5.616102695465088, "epoch": 2.101458860143941, "grad_norm": 1.1640625, "learning_rate": 0.0004553694066120493, "loss": 4.9857, "mean_token_accuracy": 0.19951392263174056, "num_tokens": 46853940.0, "step": 27010 }, { "entropy": 5.628016185760498, "epoch": 2.1018478895156583, "grad_norm": 1.171875, "learning_rate": 0.00045535283673620426, "loss": 4.913, "mean_token_accuracy": 0.20974893271923065, "num_tokens": 46862031.0, "step": 27015 }, { "entropy": 5.658685255050659, "epoch": 2.102236918887376, "grad_norm": 1.1484375, "learning_rate": 0.00045533626412379194, "loss": 5.0287, "mean_token_accuracy": 0.19469947516918182, "num_tokens": 46871290.0, "step": 27020 }, { "entropy": 5.625765323638916, "epoch": 2.1026259482590937, "grad_norm": 1.2109375, "learning_rate": 0.0004553196887750638, "loss": 4.9264, "mean_token_accuracy": 0.2120487928390503, "num_tokens": 46880071.0, "step": 27025 }, { "entropy": 5.67730941772461, "epoch": 2.103014977630811, "grad_norm": 1.28125, "learning_rate": 0.0004553031106902714, "loss": 4.9237, "mean_token_accuracy": 0.2056495279073715, "num_tokens": 46888686.0, "step": 27030 }, { "entropy": 5.634192752838135, "epoch": 2.1034040070025286, "grad_norm": 1.0625, "learning_rate": 0.00045528652986966627, "loss": 5.1111, "mean_token_accuracy": 0.19219001978635789, "num_tokens": 46897498.0, "step": 27035 }, { "entropy": 5.578342533111572, "epoch": 2.1037930363742463, "grad_norm": 1.1796875, "learning_rate": 0.00045526994631350006, "loss": 4.8808, "mean_token_accuracy": 0.21497553884983062, "num_tokens": 46905668.0, "step": 27040 }, { "entropy": 5.697851610183716, "epoch": 2.104182065745964, "grad_norm": 1.265625, "learning_rate": 0.0004552533600220243, "loss": 4.9974, "mean_token_accuracy": 0.20828325748443605, "num_tokens": 46913934.0, "step": 27045 }, { "entropy": 5.575703144073486, "epoch": 2.1045710951176813, "grad_norm": 1.1875, "learning_rate": 0.00045523677099549073, "loss": 4.8646, "mean_token_accuracy": 0.21362457871437074, "num_tokens": 46922598.0, "step": 27050 }, { "entropy": 5.567189359664917, "epoch": 2.104960124489399, "grad_norm": 1.0703125, "learning_rate": 0.000455220179234151, "loss": 5.0028, "mean_token_accuracy": 0.20393268913030624, "num_tokens": 46931654.0, "step": 27055 }, { "entropy": 5.637973260879517, "epoch": 2.1053491538611167, "grad_norm": 1.2734375, "learning_rate": 0.0004552035847382569, "loss": 4.9711, "mean_token_accuracy": 0.211558236181736, "num_tokens": 46940799.0, "step": 27060 }, { "entropy": 5.6942976951599125, "epoch": 2.105738183232834, "grad_norm": 1.25, "learning_rate": 0.00045518698750806024, "loss": 4.9909, "mean_token_accuracy": 0.21091592013835908, "num_tokens": 46948646.0, "step": 27065 }, { "entropy": 5.607877779006958, "epoch": 2.1061272126045516, "grad_norm": 1.1875, "learning_rate": 0.00045517038754381287, "loss": 4.9354, "mean_token_accuracy": 0.20234255194664003, "num_tokens": 46957631.0, "step": 27070 }, { "entropy": 5.593134546279908, "epoch": 2.1065162419762693, "grad_norm": 1.15625, "learning_rate": 0.0004551537848457666, "loss": 5.0024, "mean_token_accuracy": 0.19777540862560272, "num_tokens": 46965937.0, "step": 27075 }, { "entropy": 5.679655456542969, "epoch": 2.106905271347987, "grad_norm": 1.15625, "learning_rate": 0.0004551371794141734, "loss": 5.0397, "mean_token_accuracy": 0.19979262202978135, "num_tokens": 46974439.0, "step": 27080 }, { "entropy": 5.669306755065918, "epoch": 2.1072943007197042, "grad_norm": 1.1328125, "learning_rate": 0.0004551205712492852, "loss": 5.0403, "mean_token_accuracy": 0.20294493138790132, "num_tokens": 46982787.0, "step": 27085 }, { "entropy": 5.597129440307617, "epoch": 2.107683330091422, "grad_norm": 1.1484375, "learning_rate": 0.0004551039603513541, "loss": 4.9593, "mean_token_accuracy": 0.206158410012722, "num_tokens": 46990904.0, "step": 27090 }, { "entropy": 5.5969585418701175, "epoch": 2.1080723594631396, "grad_norm": 1.1171875, "learning_rate": 0.00045508734672063204, "loss": 4.9379, "mean_token_accuracy": 0.2105418398976326, "num_tokens": 47000332.0, "step": 27095 }, { "entropy": 5.603137636184693, "epoch": 2.108461388834857, "grad_norm": 1.265625, "learning_rate": 0.0004550707303573711, "loss": 4.9531, "mean_token_accuracy": 0.20705873519182205, "num_tokens": 47008618.0, "step": 27100 }, { "entropy": 5.615599060058594, "epoch": 2.1088504182065746, "grad_norm": 1.2109375, "learning_rate": 0.00045505411126182347, "loss": 4.9517, "mean_token_accuracy": 0.20357646644115449, "num_tokens": 47017022.0, "step": 27105 }, { "entropy": 5.664198160171509, "epoch": 2.1092394475782923, "grad_norm": 1.0859375, "learning_rate": 0.0004550374894342412, "loss": 5.0491, "mean_token_accuracy": 0.19924866110086442, "num_tokens": 47025720.0, "step": 27110 }, { "entropy": 5.724512434005737, "epoch": 2.1096284769500095, "grad_norm": 1.1640625, "learning_rate": 0.0004550208648748767, "loss": 5.0059, "mean_token_accuracy": 0.20419651567935942, "num_tokens": 47034762.0, "step": 27115 }, { "entropy": 5.635872459411621, "epoch": 2.1100175063217272, "grad_norm": 1.1640625, "learning_rate": 0.000455004237583982, "loss": 4.9243, "mean_token_accuracy": 0.21029621064662934, "num_tokens": 47043382.0, "step": 27120 }, { "entropy": 5.638763189315796, "epoch": 2.110406535693445, "grad_norm": 1.1796875, "learning_rate": 0.0004549876075618096, "loss": 5.014, "mean_token_accuracy": 0.2040812373161316, "num_tokens": 47052028.0, "step": 27125 }, { "entropy": 5.5754478931427, "epoch": 2.110795565065162, "grad_norm": 1.1875, "learning_rate": 0.0004549709748086117, "loss": 4.8929, "mean_token_accuracy": 0.21414296478033065, "num_tokens": 47060762.0, "step": 27130 }, { "entropy": 5.678235340118408, "epoch": 2.11118459443688, "grad_norm": 1.140625, "learning_rate": 0.00045495433932464063, "loss": 5.0874, "mean_token_accuracy": 0.19485669881105422, "num_tokens": 47068547.0, "step": 27135 }, { "entropy": 5.675933408737182, "epoch": 2.1115736238085976, "grad_norm": 1.203125, "learning_rate": 0.000454937701110149, "loss": 5.0141, "mean_token_accuracy": 0.20014180094003678, "num_tokens": 47077083.0, "step": 27140 }, { "entropy": 5.585717058181762, "epoch": 2.1119626531803153, "grad_norm": 1.1171875, "learning_rate": 0.00045492106016538917, "loss": 4.9083, "mean_token_accuracy": 0.21279843300580978, "num_tokens": 47085337.0, "step": 27145 }, { "entropy": 5.603982400894165, "epoch": 2.1123516825520325, "grad_norm": 1.25, "learning_rate": 0.00045490441649061354, "loss": 4.9373, "mean_token_accuracy": 0.20592147409915923, "num_tokens": 47093931.0, "step": 27150 }, { "entropy": 5.599470376968384, "epoch": 2.1127407119237502, "grad_norm": 1.3046875, "learning_rate": 0.0004548877700860747, "loss": 4.898, "mean_token_accuracy": 0.2149114191532135, "num_tokens": 47102572.0, "step": 27155 }, { "entropy": 5.6060785293579105, "epoch": 2.113129741295468, "grad_norm": 1.1640625, "learning_rate": 0.00045487112095202544, "loss": 4.8835, "mean_token_accuracy": 0.2082992136478424, "num_tokens": 47111015.0, "step": 27160 }, { "entropy": 5.6501974105834964, "epoch": 2.113518770667185, "grad_norm": 1.1953125, "learning_rate": 0.0004548544690887181, "loss": 4.9466, "mean_token_accuracy": 0.205793097615242, "num_tokens": 47120538.0, "step": 27165 }, { "entropy": 5.7110669136047365, "epoch": 2.113907800038903, "grad_norm": 1.15625, "learning_rate": 0.0004548378144964054, "loss": 4.9574, "mean_token_accuracy": 0.20797051042318343, "num_tokens": 47129414.0, "step": 27170 }, { "entropy": 5.563403987884522, "epoch": 2.1142968294106206, "grad_norm": 1.15625, "learning_rate": 0.00045482115717534024, "loss": 4.9059, "mean_token_accuracy": 0.20198312997817994, "num_tokens": 47137720.0, "step": 27175 }, { "entropy": 5.681821537017822, "epoch": 2.1146858587823383, "grad_norm": 1.296875, "learning_rate": 0.0004548044971257752, "loss": 5.0204, "mean_token_accuracy": 0.200797139108181, "num_tokens": 47145842.0, "step": 27180 }, { "entropy": 5.636719131469727, "epoch": 2.1150748881540555, "grad_norm": 1.2265625, "learning_rate": 0.00045478783434796307, "loss": 4.9403, "mean_token_accuracy": 0.20943872034549713, "num_tokens": 47154101.0, "step": 27185 }, { "entropy": 5.557391595840454, "epoch": 2.1154639175257732, "grad_norm": 1.1875, "learning_rate": 0.00045477116884215675, "loss": 4.8759, "mean_token_accuracy": 0.20752248167991638, "num_tokens": 47162497.0, "step": 27190 }, { "entropy": 5.59216570854187, "epoch": 2.115852946897491, "grad_norm": 1.2265625, "learning_rate": 0.000454754500608609, "loss": 4.9466, "mean_token_accuracy": 0.20809964686632157, "num_tokens": 47170825.0, "step": 27195 }, { "entropy": 5.6206718444824215, "epoch": 2.116241976269208, "grad_norm": 1.2734375, "learning_rate": 0.0004547378296475729, "loss": 4.9673, "mean_token_accuracy": 0.20670367926359176, "num_tokens": 47178908.0, "step": 27200 }, { "entropy": 5.5832719802856445, "epoch": 2.116631005640926, "grad_norm": 1.1796875, "learning_rate": 0.00045472115595930124, "loss": 4.9458, "mean_token_accuracy": 0.2054883599281311, "num_tokens": 47187939.0, "step": 27205 }, { "entropy": 5.635928297042847, "epoch": 2.1170200350126436, "grad_norm": 1.1328125, "learning_rate": 0.00045470447954404716, "loss": 4.9644, "mean_token_accuracy": 0.20308625549077988, "num_tokens": 47197670.0, "step": 27210 }, { "entropy": 5.682624244689942, "epoch": 2.117409064384361, "grad_norm": 1.234375, "learning_rate": 0.00045468780040206364, "loss": 4.9114, "mean_token_accuracy": 0.2145197197794914, "num_tokens": 47206927.0, "step": 27215 }, { "entropy": 5.675573253631592, "epoch": 2.1177980937560785, "grad_norm": 1.21875, "learning_rate": 0.0004546711185336037, "loss": 4.983, "mean_token_accuracy": 0.19844935685396195, "num_tokens": 47215645.0, "step": 27220 }, { "entropy": 5.620171451568604, "epoch": 2.1181871231277962, "grad_norm": 1.2734375, "learning_rate": 0.00045465443393892047, "loss": 5.0166, "mean_token_accuracy": 0.21145660281181336, "num_tokens": 47225184.0, "step": 27225 }, { "entropy": 5.579754495620728, "epoch": 2.118576152499514, "grad_norm": 1.2421875, "learning_rate": 0.0004546377466182673, "loss": 5.0201, "mean_token_accuracy": 0.20013754814863205, "num_tokens": 47234701.0, "step": 27230 }, { "entropy": 5.704707050323487, "epoch": 2.118965181871231, "grad_norm": 1.1640625, "learning_rate": 0.0004546210565718972, "loss": 4.976, "mean_token_accuracy": 0.20020591020584105, "num_tokens": 47243186.0, "step": 27235 }, { "entropy": 5.673367738723755, "epoch": 2.119354211242949, "grad_norm": 1.2421875, "learning_rate": 0.00045460436380006337, "loss": 4.9147, "mean_token_accuracy": 0.20959510356187822, "num_tokens": 47252320.0, "step": 27240 }, { "entropy": 5.630733489990234, "epoch": 2.1197432406146666, "grad_norm": 1.1796875, "learning_rate": 0.0004545876683030192, "loss": 4.939, "mean_token_accuracy": 0.21444210410118103, "num_tokens": 47261084.0, "step": 27245 }, { "entropy": 5.645307207107544, "epoch": 2.120132269986384, "grad_norm": 1.15625, "learning_rate": 0.0004545709700810181, "loss": 5.038, "mean_token_accuracy": 0.2060595542192459, "num_tokens": 47269819.0, "step": 27250 }, { "entropy": 5.694859218597412, "epoch": 2.1205212993581015, "grad_norm": 1.265625, "learning_rate": 0.0004545542691343133, "loss": 5.0124, "mean_token_accuracy": 0.20177240669727325, "num_tokens": 47278100.0, "step": 27255 }, { "entropy": 5.6194438457489015, "epoch": 2.120910328729819, "grad_norm": 1.2421875, "learning_rate": 0.0004545375654631582, "loss": 4.9556, "mean_token_accuracy": 0.20483158081769942, "num_tokens": 47286113.0, "step": 27260 }, { "entropy": 5.601614999771118, "epoch": 2.1212993581015365, "grad_norm": 1.1796875, "learning_rate": 0.00045452085906780645, "loss": 4.9737, "mean_token_accuracy": 0.2053009897470474, "num_tokens": 47294445.0, "step": 27265 }, { "entropy": 5.58880581855774, "epoch": 2.121688387473254, "grad_norm": 1.140625, "learning_rate": 0.00045450414994851123, "loss": 4.9326, "mean_token_accuracy": 0.20819024592638016, "num_tokens": 47304785.0, "step": 27270 }, { "entropy": 5.598636245727539, "epoch": 2.122077416844972, "grad_norm": 1.0546875, "learning_rate": 0.00045448743810552636, "loss": 4.9368, "mean_token_accuracy": 0.2141011968255043, "num_tokens": 47313561.0, "step": 27275 }, { "entropy": 5.617367601394653, "epoch": 2.1224664462166896, "grad_norm": 1.1328125, "learning_rate": 0.00045447072353910537, "loss": 4.9545, "mean_token_accuracy": 0.20897779613733292, "num_tokens": 47321870.0, "step": 27280 }, { "entropy": 5.618071460723877, "epoch": 2.122855475588407, "grad_norm": 1.15625, "learning_rate": 0.0004544540062495016, "loss": 5.0084, "mean_token_accuracy": 0.19870543330907822, "num_tokens": 47331208.0, "step": 27285 }, { "entropy": 5.581287431716919, "epoch": 2.1232445049601245, "grad_norm": 1.2109375, "learning_rate": 0.00045443728623696905, "loss": 5.0081, "mean_token_accuracy": 0.19968386143445968, "num_tokens": 47339680.0, "step": 27290 }, { "entropy": 5.715861701965332, "epoch": 2.123633534331842, "grad_norm": 1.1171875, "learning_rate": 0.00045442056350176123, "loss": 5.0402, "mean_token_accuracy": 0.1966221109032631, "num_tokens": 47348912.0, "step": 27295 }, { "entropy": 5.759345293045044, "epoch": 2.1240225637035595, "grad_norm": 1.15625, "learning_rate": 0.000454403838044132, "loss": 5.0754, "mean_token_accuracy": 0.19589758068323135, "num_tokens": 47357990.0, "step": 27300 }, { "entropy": 5.67279896736145, "epoch": 2.124411593075277, "grad_norm": 1.265625, "learning_rate": 0.000454387109864335, "loss": 4.9502, "mean_token_accuracy": 0.20262227803468705, "num_tokens": 47366233.0, "step": 27305 }, { "entropy": 5.653172779083252, "epoch": 2.124800622446995, "grad_norm": 1.2890625, "learning_rate": 0.00045437037896262425, "loss": 5.0107, "mean_token_accuracy": 0.19377756267786025, "num_tokens": 47374916.0, "step": 27310 }, { "entropy": 5.645000791549682, "epoch": 2.125189651818712, "grad_norm": 1.1875, "learning_rate": 0.0004543536453392534, "loss": 5.0147, "mean_token_accuracy": 0.19965385645627975, "num_tokens": 47383456.0, "step": 27315 }, { "entropy": 5.6308996200561525, "epoch": 2.12557868119043, "grad_norm": 1.2421875, "learning_rate": 0.00045433690899447643, "loss": 4.9514, "mean_token_accuracy": 0.20442797988653183, "num_tokens": 47391633.0, "step": 27320 }, { "entropy": 5.521139812469483, "epoch": 2.1259677105621475, "grad_norm": 1.0546875, "learning_rate": 0.00045432016992854734, "loss": 4.9074, "mean_token_accuracy": 0.2119564265012741, "num_tokens": 47400155.0, "step": 27325 }, { "entropy": 5.587801933288574, "epoch": 2.126356739933865, "grad_norm": 1.1796875, "learning_rate": 0.0004543034281417201, "loss": 4.9083, "mean_token_accuracy": 0.20598985403776168, "num_tokens": 47408884.0, "step": 27330 }, { "entropy": 5.652851152420044, "epoch": 2.1267457693055825, "grad_norm": 1.078125, "learning_rate": 0.0004542866836342488, "loss": 4.9654, "mean_token_accuracy": 0.20189899802207947, "num_tokens": 47417981.0, "step": 27335 }, { "entropy": 5.643093061447144, "epoch": 2.1271347986773, "grad_norm": 1.171875, "learning_rate": 0.0004542699364063873, "loss": 4.9254, "mean_token_accuracy": 0.2064901441335678, "num_tokens": 47426718.0, "step": 27340 }, { "entropy": 5.708825302124024, "epoch": 2.127523828049018, "grad_norm": 1.1640625, "learning_rate": 0.0004542531864583899, "loss": 4.9871, "mean_token_accuracy": 0.20488932132720947, "num_tokens": 47434831.0, "step": 27345 }, { "entropy": 5.650969696044922, "epoch": 2.127912857420735, "grad_norm": 1.1640625, "learning_rate": 0.0004542364337905108, "loss": 4.9965, "mean_token_accuracy": 0.2045737162232399, "num_tokens": 47443638.0, "step": 27350 }, { "entropy": 5.610740423202515, "epoch": 2.128301886792453, "grad_norm": 1.140625, "learning_rate": 0.00045421967840300403, "loss": 4.9498, "mean_token_accuracy": 0.20466667264699936, "num_tokens": 47452622.0, "step": 27355 }, { "entropy": 5.625663948059082, "epoch": 2.1286909161641705, "grad_norm": 1.0859375, "learning_rate": 0.0004542029202961239, "loss": 4.9119, "mean_token_accuracy": 0.20957971960306168, "num_tokens": 47461675.0, "step": 27360 }, { "entropy": 5.6109191417694095, "epoch": 2.1290799455358878, "grad_norm": 1.1796875, "learning_rate": 0.00045418615947012464, "loss": 5.0951, "mean_token_accuracy": 0.1980179712176323, "num_tokens": 47470229.0, "step": 27365 }, { "entropy": 5.611227750778198, "epoch": 2.1294689749076054, "grad_norm": 1.1796875, "learning_rate": 0.0004541693959252607, "loss": 5.0107, "mean_token_accuracy": 0.20363456010818481, "num_tokens": 47479387.0, "step": 27370 }, { "entropy": 5.608771562576294, "epoch": 2.129858004279323, "grad_norm": 1.125, "learning_rate": 0.00045415262966178635, "loss": 4.9139, "mean_token_accuracy": 0.21077269464731216, "num_tokens": 47488674.0, "step": 27375 }, { "entropy": 5.646748161315918, "epoch": 2.130247033651041, "grad_norm": 1.125, "learning_rate": 0.0004541358606799559, "loss": 5.0221, "mean_token_accuracy": 0.20020621120929719, "num_tokens": 47496626.0, "step": 27380 }, { "entropy": 5.606435632705688, "epoch": 2.130636063022758, "grad_norm": 1.125, "learning_rate": 0.000454119088980024, "loss": 4.9526, "mean_token_accuracy": 0.20396506637334824, "num_tokens": 47505735.0, "step": 27385 }, { "entropy": 5.676372766494751, "epoch": 2.131025092394476, "grad_norm": 1.125, "learning_rate": 0.0004541023145622449, "loss": 4.9641, "mean_token_accuracy": 0.20978566259145737, "num_tokens": 47514082.0, "step": 27390 }, { "entropy": 5.633269596099853, "epoch": 2.1314141217661935, "grad_norm": 1.15625, "learning_rate": 0.00045408553742687336, "loss": 4.9669, "mean_token_accuracy": 0.21442373245954513, "num_tokens": 47523383.0, "step": 27395 }, { "entropy": 5.607184934616089, "epoch": 2.1318031511379107, "grad_norm": 1.171875, "learning_rate": 0.0004540687575741638, "loss": 5.0017, "mean_token_accuracy": 0.21150895655155183, "num_tokens": 47532546.0, "step": 27400 }, { "entropy": 5.582590532302857, "epoch": 2.1321921805096284, "grad_norm": 1.15625, "learning_rate": 0.00045405197500437077, "loss": 4.9282, "mean_token_accuracy": 0.21065830439329147, "num_tokens": 47541238.0, "step": 27405 }, { "entropy": 5.61484317779541, "epoch": 2.132581209881346, "grad_norm": 1.296875, "learning_rate": 0.00045403518971774915, "loss": 4.9457, "mean_token_accuracy": 0.19634849578142166, "num_tokens": 47549822.0, "step": 27410 }, { "entropy": 5.657980680465698, "epoch": 2.132970239253064, "grad_norm": 1.21875, "learning_rate": 0.00045401840171455343, "loss": 4.9661, "mean_token_accuracy": 0.20605187863111496, "num_tokens": 47558669.0, "step": 27415 }, { "entropy": 5.673924493789673, "epoch": 2.133359268624781, "grad_norm": 1.2421875, "learning_rate": 0.0004540016109950384, "loss": 5.0558, "mean_token_accuracy": 0.19639279395341874, "num_tokens": 47566894.0, "step": 27420 }, { "entropy": 5.6893524646759035, "epoch": 2.133748297996499, "grad_norm": 1.1796875, "learning_rate": 0.0004539848175594589, "loss": 5.012, "mean_token_accuracy": 0.20483334064483644, "num_tokens": 47575859.0, "step": 27425 }, { "entropy": 5.654035806655884, "epoch": 2.1341373273682165, "grad_norm": 1.2109375, "learning_rate": 0.0004539680214080695, "loss": 5.0606, "mean_token_accuracy": 0.19311740398406982, "num_tokens": 47584408.0, "step": 27430 }, { "entropy": 5.649634456634521, "epoch": 2.1345263567399337, "grad_norm": 1.1484375, "learning_rate": 0.00045395122254112536, "loss": 4.928, "mean_token_accuracy": 0.20387642383575438, "num_tokens": 47593243.0, "step": 27435 }, { "entropy": 5.7537096500396725, "epoch": 2.1349153861116514, "grad_norm": 1.203125, "learning_rate": 0.0004539344209588812, "loss": 5.0471, "mean_token_accuracy": 0.19927849918603896, "num_tokens": 47602343.0, "step": 27440 }, { "entropy": 5.698724699020386, "epoch": 2.135304415483369, "grad_norm": 1.15625, "learning_rate": 0.00045391761666159204, "loss": 5.0859, "mean_token_accuracy": 0.197279192507267, "num_tokens": 47612617.0, "step": 27445 }, { "entropy": 5.698676013946534, "epoch": 2.1356934448550864, "grad_norm": 1.1640625, "learning_rate": 0.00045390080964951294, "loss": 5.0576, "mean_token_accuracy": 0.18966654539108277, "num_tokens": 47621764.0, "step": 27450 }, { "entropy": 5.652096700668335, "epoch": 2.136082474226804, "grad_norm": 1.1484375, "learning_rate": 0.00045388399992289864, "loss": 4.942, "mean_token_accuracy": 0.20775261521339417, "num_tokens": 47630910.0, "step": 27455 }, { "entropy": 5.697013235092163, "epoch": 2.136471503598522, "grad_norm": 1.203125, "learning_rate": 0.00045386718748200436, "loss": 4.9695, "mean_token_accuracy": 0.20340099781751633, "num_tokens": 47639794.0, "step": 27460 }, { "entropy": 5.653557300567627, "epoch": 2.136860532970239, "grad_norm": 1.2265625, "learning_rate": 0.00045385037232708534, "loss": 4.985, "mean_token_accuracy": 0.19947068840265275, "num_tokens": 47648326.0, "step": 27465 }, { "entropy": 5.603629064559937, "epoch": 2.1372495623419567, "grad_norm": 1.125, "learning_rate": 0.0004538335544583964, "loss": 4.9755, "mean_token_accuracy": 0.20340578854084015, "num_tokens": 47657974.0, "step": 27470 }, { "entropy": 5.61540994644165, "epoch": 2.1376385917136744, "grad_norm": 1.09375, "learning_rate": 0.00045381673387619306, "loss": 4.8966, "mean_token_accuracy": 0.20648950934410096, "num_tokens": 47666521.0, "step": 27475 }, { "entropy": 5.6765398502349855, "epoch": 2.138027621085392, "grad_norm": 1.1015625, "learning_rate": 0.00045379991058073035, "loss": 5.004, "mean_token_accuracy": 0.20573042929172516, "num_tokens": 47675723.0, "step": 27480 }, { "entropy": 5.674753618240357, "epoch": 2.1384166504571094, "grad_norm": 1.2265625, "learning_rate": 0.0004537830845722636, "loss": 4.9354, "mean_token_accuracy": 0.20032002478837968, "num_tokens": 47684594.0, "step": 27485 }, { "entropy": 5.680707550048828, "epoch": 2.138805679828827, "grad_norm": 1.1328125, "learning_rate": 0.0004537662558510481, "loss": 4.9907, "mean_token_accuracy": 0.20203856378793716, "num_tokens": 47694145.0, "step": 27490 }, { "entropy": 5.683885765075684, "epoch": 2.1391947092005448, "grad_norm": 1.234375, "learning_rate": 0.00045374942441733925, "loss": 5.0349, "mean_token_accuracy": 0.20480004996061324, "num_tokens": 47702448.0, "step": 27495 }, { "entropy": 5.691501665115356, "epoch": 2.139583738572262, "grad_norm": 1.09375, "learning_rate": 0.0004537325902713923, "loss": 5.0029, "mean_token_accuracy": 0.1962115943431854, "num_tokens": 47711624.0, "step": 27500 }, { "entropy": 5.676574325561523, "epoch": 2.1399727679439797, "grad_norm": 1.125, "learning_rate": 0.0004537157534134629, "loss": 5.0585, "mean_token_accuracy": 0.20001849234104158, "num_tokens": 47720374.0, "step": 27505 }, { "entropy": 5.725689840316773, "epoch": 2.1403617973156974, "grad_norm": 1.203125, "learning_rate": 0.00045369891384380623, "loss": 5.1007, "mean_token_accuracy": 0.19410979747772217, "num_tokens": 47729656.0, "step": 27510 }, { "entropy": 5.6624054431915285, "epoch": 2.140750826687415, "grad_norm": 1.3046875, "learning_rate": 0.0004536820715626781, "loss": 4.9957, "mean_token_accuracy": 0.20551721900701522, "num_tokens": 47738357.0, "step": 27515 }, { "entropy": 5.674378967285156, "epoch": 2.1411398560591324, "grad_norm": 1.15625, "learning_rate": 0.00045366522657033385, "loss": 5.0166, "mean_token_accuracy": 0.19888090789318086, "num_tokens": 47747110.0, "step": 27520 }, { "entropy": 5.659598875045776, "epoch": 2.14152888543085, "grad_norm": 1.2421875, "learning_rate": 0.00045364837886702924, "loss": 4.9677, "mean_token_accuracy": 0.20608027428388595, "num_tokens": 47756571.0, "step": 27525 }, { "entropy": 5.695581436157227, "epoch": 2.1419179148025678, "grad_norm": 1.1640625, "learning_rate": 0.0004536315284530198, "loss": 4.9467, "mean_token_accuracy": 0.20389514565467834, "num_tokens": 47765327.0, "step": 27530 }, { "entropy": 5.605331373214722, "epoch": 2.142306944174285, "grad_norm": 1.1484375, "learning_rate": 0.0004536146753285612, "loss": 4.8994, "mean_token_accuracy": 0.20527543425559996, "num_tokens": 47774091.0, "step": 27535 }, { "entropy": 5.632266998291016, "epoch": 2.1426959735460027, "grad_norm": 1.234375, "learning_rate": 0.0004535978194939093, "loss": 4.9923, "mean_token_accuracy": 0.20189673751592635, "num_tokens": 47781908.0, "step": 27540 }, { "entropy": 5.61867356300354, "epoch": 2.1430850029177204, "grad_norm": 1.1796875, "learning_rate": 0.00045358096094931966, "loss": 4.9115, "mean_token_accuracy": 0.21373921930789946, "num_tokens": 47791845.0, "step": 27545 }, { "entropy": 5.565458154678344, "epoch": 2.1434740322894377, "grad_norm": 1.15625, "learning_rate": 0.0004535640996950482, "loss": 4.889, "mean_token_accuracy": 0.20583549290895461, "num_tokens": 47800200.0, "step": 27550 }, { "entropy": 5.667959499359131, "epoch": 2.1438630616611554, "grad_norm": 1.2109375, "learning_rate": 0.0004535472357313507, "loss": 5.0096, "mean_token_accuracy": 0.20027893036603928, "num_tokens": 47808459.0, "step": 27555 }, { "entropy": 5.67978801727295, "epoch": 2.144252091032873, "grad_norm": 1.1953125, "learning_rate": 0.00045353036905848316, "loss": 4.9283, "mean_token_accuracy": 0.20958651155233382, "num_tokens": 47816495.0, "step": 27560 }, { "entropy": 5.687069845199585, "epoch": 2.1446411204045903, "grad_norm": 1.1875, "learning_rate": 0.0004535134996767014, "loss": 4.9865, "mean_token_accuracy": 0.20812389701604844, "num_tokens": 47825452.0, "step": 27565 }, { "entropy": 5.651744222640991, "epoch": 2.145030149776308, "grad_norm": 1.1796875, "learning_rate": 0.0004534966275862614, "loss": 4.9522, "mean_token_accuracy": 0.2072868376970291, "num_tokens": 47834003.0, "step": 27570 }, { "entropy": 5.625974845886231, "epoch": 2.1454191791480257, "grad_norm": 1.1640625, "learning_rate": 0.0004534797527874192, "loss": 4.9406, "mean_token_accuracy": 0.20492086857557296, "num_tokens": 47842499.0, "step": 27575 }, { "entropy": 5.603460788726807, "epoch": 2.1458082085197434, "grad_norm": 1.1171875, "learning_rate": 0.00045346287528043083, "loss": 5.0123, "mean_token_accuracy": 0.20081672370433806, "num_tokens": 47851835.0, "step": 27580 }, { "entropy": 5.726094198226929, "epoch": 2.1461972378914607, "grad_norm": 1.1953125, "learning_rate": 0.00045344599506555244, "loss": 5.0645, "mean_token_accuracy": 0.20083667784929277, "num_tokens": 47861070.0, "step": 27585 }, { "entropy": 5.650775194168091, "epoch": 2.1465862672631784, "grad_norm": 1.2109375, "learning_rate": 0.00045342911214304, "loss": 4.9574, "mean_token_accuracy": 0.2102648690342903, "num_tokens": 47869852.0, "step": 27590 }, { "entropy": 5.643073511123657, "epoch": 2.146975296634896, "grad_norm": 1.25, "learning_rate": 0.0004534122265131498, "loss": 4.8924, "mean_token_accuracy": 0.20403113067150117, "num_tokens": 47878395.0, "step": 27595 }, { "entropy": 5.635064888000488, "epoch": 2.1473643260066133, "grad_norm": 1.2109375, "learning_rate": 0.00045339533817613807, "loss": 4.9645, "mean_token_accuracy": 0.21321532279253005, "num_tokens": 47887314.0, "step": 27600 }, { "entropy": 5.670640325546264, "epoch": 2.147753355378331, "grad_norm": 1.2734375, "learning_rate": 0.00045337844713226106, "loss": 5.0286, "mean_token_accuracy": 0.1950090542435646, "num_tokens": 47896872.0, "step": 27605 }, { "entropy": 5.637800312042236, "epoch": 2.1481423847500487, "grad_norm": 1.1796875, "learning_rate": 0.00045336155338177497, "loss": 4.8725, "mean_token_accuracy": 0.21361474096775054, "num_tokens": 47905291.0, "step": 27610 }, { "entropy": 5.678752422332764, "epoch": 2.1485314141217664, "grad_norm": 1.3671875, "learning_rate": 0.0004533446569249362, "loss": 5.0454, "mean_token_accuracy": 0.19896254390478135, "num_tokens": 47913872.0, "step": 27615 }, { "entropy": 5.617026662826538, "epoch": 2.1489204434934837, "grad_norm": 1.2421875, "learning_rate": 0.00045332775776200116, "loss": 4.8788, "mean_token_accuracy": 0.21164336204528808, "num_tokens": 47921066.0, "step": 27620 }, { "entropy": 5.648990964889526, "epoch": 2.1493094728652014, "grad_norm": 1.1484375, "learning_rate": 0.00045331085589322626, "loss": 5.0484, "mean_token_accuracy": 0.2014581799507141, "num_tokens": 47930060.0, "step": 27625 }, { "entropy": 5.705538272857666, "epoch": 2.149698502236919, "grad_norm": 1.25, "learning_rate": 0.0004532939513188679, "loss": 5.0475, "mean_token_accuracy": 0.19529576152563094, "num_tokens": 47938299.0, "step": 27630 }, { "entropy": 5.677837085723877, "epoch": 2.1500875316086363, "grad_norm": 1.15625, "learning_rate": 0.0004532770440391826, "loss": 4.9363, "mean_token_accuracy": 0.2057972565293312, "num_tokens": 47947552.0, "step": 27635 }, { "entropy": 5.647033452987671, "epoch": 2.150476560980354, "grad_norm": 1.1640625, "learning_rate": 0.0004532601340544269, "loss": 4.9722, "mean_token_accuracy": 0.20253120511770248, "num_tokens": 47957064.0, "step": 27640 }, { "entropy": 5.733011865615845, "epoch": 2.1508655903520717, "grad_norm": 1.1953125, "learning_rate": 0.0004532432213648574, "loss": 5.1128, "mean_token_accuracy": 0.19407415390014648, "num_tokens": 47966310.0, "step": 27645 }, { "entropy": 5.66233606338501, "epoch": 2.151254619723789, "grad_norm": 1.2109375, "learning_rate": 0.00045322630597073067, "loss": 4.9537, "mean_token_accuracy": 0.2051491215825081, "num_tokens": 47975136.0, "step": 27650 }, { "entropy": 5.72068772315979, "epoch": 2.1516436490955066, "grad_norm": 1.1328125, "learning_rate": 0.00045320938787230355, "loss": 5.062, "mean_token_accuracy": 0.19990981072187425, "num_tokens": 47984386.0, "step": 27655 }, { "entropy": 5.582844495773315, "epoch": 2.1520326784672243, "grad_norm": 1.1484375, "learning_rate": 0.00045319246706983257, "loss": 4.9282, "mean_token_accuracy": 0.20640043914318085, "num_tokens": 47993297.0, "step": 27660 }, { "entropy": 5.683313035964966, "epoch": 2.152421707838942, "grad_norm": 1.203125, "learning_rate": 0.00045317554356357446, "loss": 4.9732, "mean_token_accuracy": 0.21300583928823472, "num_tokens": 48001489.0, "step": 27665 }, { "entropy": 5.68531289100647, "epoch": 2.1528107372106593, "grad_norm": 1.1171875, "learning_rate": 0.00045315861735378615, "loss": 5.0068, "mean_token_accuracy": 0.20370992869138718, "num_tokens": 48010041.0, "step": 27670 }, { "entropy": 5.686743545532226, "epoch": 2.153199766582377, "grad_norm": 1.1875, "learning_rate": 0.00045314168844072435, "loss": 4.9837, "mean_token_accuracy": 0.20503681749105454, "num_tokens": 48018551.0, "step": 27675 }, { "entropy": 5.693939065933227, "epoch": 2.1535887959540947, "grad_norm": 1.1328125, "learning_rate": 0.00045312475682464604, "loss": 5.0623, "mean_token_accuracy": 0.19794443100690842, "num_tokens": 48026471.0, "step": 27680 }, { "entropy": 5.628991746902466, "epoch": 2.153977825325812, "grad_norm": 1.046875, "learning_rate": 0.00045310782250580794, "loss": 5.0334, "mean_token_accuracy": 0.2054133117198944, "num_tokens": 48036241.0, "step": 27685 }, { "entropy": 5.57493486404419, "epoch": 2.1543668546975296, "grad_norm": 1.2265625, "learning_rate": 0.0004530908854844672, "loss": 4.8772, "mean_token_accuracy": 0.20684104561805725, "num_tokens": 48044730.0, "step": 27690 }, { "entropy": 5.68789005279541, "epoch": 2.1547558840692473, "grad_norm": 1.2890625, "learning_rate": 0.00045307394576088076, "loss": 5.0031, "mean_token_accuracy": 0.19947132617235183, "num_tokens": 48052784.0, "step": 27695 }, { "entropy": 5.719441509246826, "epoch": 2.1551449134409646, "grad_norm": 1.234375, "learning_rate": 0.0004530570033353056, "loss": 5.028, "mean_token_accuracy": 0.20202393531799318, "num_tokens": 48061741.0, "step": 27700 }, { "entropy": 5.687761831283569, "epoch": 2.1555339428126823, "grad_norm": 1.25, "learning_rate": 0.00045304005820799874, "loss": 5.0013, "mean_token_accuracy": 0.2039281979203224, "num_tokens": 48070704.0, "step": 27705 }, { "entropy": 5.571134233474732, "epoch": 2.1559229721844, "grad_norm": 1.1484375, "learning_rate": 0.0004530231103792175, "loss": 4.9057, "mean_token_accuracy": 0.2129618600010872, "num_tokens": 48079475.0, "step": 27710 }, { "entropy": 5.600165891647339, "epoch": 2.1563120015561177, "grad_norm": 1.1796875, "learning_rate": 0.0004530061598492188, "loss": 4.9047, "mean_token_accuracy": 0.2139853447675705, "num_tokens": 48088574.0, "step": 27715 }, { "entropy": 5.670781517028809, "epoch": 2.156701030927835, "grad_norm": 1.1484375, "learning_rate": 0.00045298920661826004, "loss": 4.952, "mean_token_accuracy": 0.20930106341838836, "num_tokens": 48097203.0, "step": 27720 }, { "entropy": 5.6631760597229, "epoch": 2.1570900602995526, "grad_norm": 1.234375, "learning_rate": 0.0004529722506865984, "loss": 4.9457, "mean_token_accuracy": 0.20853367447853088, "num_tokens": 48105950.0, "step": 27725 }, { "entropy": 5.613159990310669, "epoch": 2.1574790896712703, "grad_norm": 1.140625, "learning_rate": 0.000452955292054491, "loss": 4.9915, "mean_token_accuracy": 0.1985842227935791, "num_tokens": 48115034.0, "step": 27730 }, { "entropy": 5.6286862850189205, "epoch": 2.1578681190429876, "grad_norm": 1.15625, "learning_rate": 0.00045293833072219535, "loss": 4.989, "mean_token_accuracy": 0.20423654168844224, "num_tokens": 48124317.0, "step": 27735 }, { "entropy": 5.70945897102356, "epoch": 2.1582571484147053, "grad_norm": 1.2109375, "learning_rate": 0.00045292136668996876, "loss": 4.9944, "mean_token_accuracy": 0.202090260386467, "num_tokens": 48133075.0, "step": 27740 }, { "entropy": 5.650589370727539, "epoch": 2.158646177786423, "grad_norm": 1.2265625, "learning_rate": 0.0004529043999580686, "loss": 4.9754, "mean_token_accuracy": 0.2035435453057289, "num_tokens": 48142565.0, "step": 27745 }, { "entropy": 5.662950706481934, "epoch": 2.1590352071581402, "grad_norm": 1.3125, "learning_rate": 0.00045288743052675234, "loss": 4.9443, "mean_token_accuracy": 0.20915111899375916, "num_tokens": 48150560.0, "step": 27750 }, { "entropy": 5.604933214187622, "epoch": 2.159424236529858, "grad_norm": 1.09375, "learning_rate": 0.00045287045839627744, "loss": 4.9293, "mean_token_accuracy": 0.2056383028626442, "num_tokens": 48159512.0, "step": 27755 }, { "entropy": 5.677662992477417, "epoch": 2.1598132659015756, "grad_norm": 1.1875, "learning_rate": 0.00045285348356690155, "loss": 4.9691, "mean_token_accuracy": 0.2051140174269676, "num_tokens": 48167774.0, "step": 27760 }, { "entropy": 5.641291570663452, "epoch": 2.1602022952732933, "grad_norm": 1.1640625, "learning_rate": 0.000452836506038882, "loss": 5.024, "mean_token_accuracy": 0.2028786465525627, "num_tokens": 48176441.0, "step": 27765 }, { "entropy": 5.706268978118897, "epoch": 2.1605913246450106, "grad_norm": 1.2734375, "learning_rate": 0.00045281952581247654, "loss": 5.008, "mean_token_accuracy": 0.21060073673725127, "num_tokens": 48184515.0, "step": 27770 }, { "entropy": 5.658855247497558, "epoch": 2.1609803540167283, "grad_norm": 1.1875, "learning_rate": 0.00045280254288794286, "loss": 4.9779, "mean_token_accuracy": 0.19504284709692002, "num_tokens": 48192825.0, "step": 27775 }, { "entropy": 5.5917449474334715, "epoch": 2.161369383388446, "grad_norm": 1.203125, "learning_rate": 0.00045278555726553855, "loss": 4.9265, "mean_token_accuracy": 0.20929719060659407, "num_tokens": 48200665.0, "step": 27780 }, { "entropy": 5.64736852645874, "epoch": 2.1617584127601632, "grad_norm": 1.25, "learning_rate": 0.00045276856894552143, "loss": 5.011, "mean_token_accuracy": 0.21266822069883345, "num_tokens": 48209097.0, "step": 27785 }, { "entropy": 5.58549542427063, "epoch": 2.162147442131881, "grad_norm": 1.2578125, "learning_rate": 0.0004527515779281492, "loss": 4.8222, "mean_token_accuracy": 0.21826852411031722, "num_tokens": 48217699.0, "step": 27790 }, { "entropy": 5.604995489120483, "epoch": 2.1625364715035986, "grad_norm": 1.25, "learning_rate": 0.00045273458421367976, "loss": 4.8703, "mean_token_accuracy": 0.2111889749765396, "num_tokens": 48225461.0, "step": 27795 }, { "entropy": 5.638203573226929, "epoch": 2.162925500875316, "grad_norm": 1.171875, "learning_rate": 0.0004527175878023708, "loss": 5.0479, "mean_token_accuracy": 0.1999452829360962, "num_tokens": 48234371.0, "step": 27800 }, { "entropy": 5.65357723236084, "epoch": 2.1633145302470336, "grad_norm": 1.1953125, "learning_rate": 0.0004527005886944803, "loss": 4.9608, "mean_token_accuracy": 0.2018502250313759, "num_tokens": 48243095.0, "step": 27805 }, { "entropy": 5.648229312896729, "epoch": 2.1637035596187513, "grad_norm": 1.171875, "learning_rate": 0.00045268358689026626, "loss": 4.9444, "mean_token_accuracy": 0.20550282001495362, "num_tokens": 48251293.0, "step": 27810 }, { "entropy": 5.516548347473145, "epoch": 2.164092588990469, "grad_norm": 1.2734375, "learning_rate": 0.0004526665823899866, "loss": 4.8364, "mean_token_accuracy": 0.2094391867518425, "num_tokens": 48260021.0, "step": 27815 }, { "entropy": 5.563632202148438, "epoch": 2.164481618362186, "grad_norm": 1.1015625, "learning_rate": 0.00045264957519389936, "loss": 4.9021, "mean_token_accuracy": 0.21243079453706742, "num_tokens": 48268370.0, "step": 27820 }, { "entropy": 5.70854868888855, "epoch": 2.164870647733904, "grad_norm": 1.1640625, "learning_rate": 0.00045263256530226253, "loss": 5.0801, "mean_token_accuracy": 0.20449393689632417, "num_tokens": 48277623.0, "step": 27825 }, { "entropy": 5.73487434387207, "epoch": 2.1652596771056216, "grad_norm": 1.1953125, "learning_rate": 0.0004526155527153343, "loss": 5.05, "mean_token_accuracy": 0.1914417713880539, "num_tokens": 48286555.0, "step": 27830 }, { "entropy": 5.641337156295776, "epoch": 2.165648706477339, "grad_norm": 1.1640625, "learning_rate": 0.0004525985374333727, "loss": 4.8874, "mean_token_accuracy": 0.2129783645272255, "num_tokens": 48295312.0, "step": 27835 }, { "entropy": 5.681504487991333, "epoch": 2.1660377358490566, "grad_norm": 1.296875, "learning_rate": 0.000452581519456636, "loss": 5.0494, "mean_token_accuracy": 0.2011671707034111, "num_tokens": 48304061.0, "step": 27840 }, { "entropy": 5.6578826904296875, "epoch": 2.1664267652207743, "grad_norm": 1.1875, "learning_rate": 0.00045256449878538243, "loss": 4.956, "mean_token_accuracy": 0.20110211074352263, "num_tokens": 48311935.0, "step": 27845 }, { "entropy": 5.636744213104248, "epoch": 2.166815794592492, "grad_norm": 1.203125, "learning_rate": 0.00045254747541987017, "loss": 5.0488, "mean_token_accuracy": 0.20137927830219268, "num_tokens": 48320298.0, "step": 27850 }, { "entropy": 5.590518283843994, "epoch": 2.167204823964209, "grad_norm": 1.203125, "learning_rate": 0.0004525304493603576, "loss": 4.9169, "mean_token_accuracy": 0.21312302649021148, "num_tokens": 48328729.0, "step": 27855 }, { "entropy": 5.659118127822876, "epoch": 2.167593853335927, "grad_norm": 1.2109375, "learning_rate": 0.00045251342060710295, "loss": 5.0389, "mean_token_accuracy": 0.2011456772685051, "num_tokens": 48336935.0, "step": 27860 }, { "entropy": 5.624445629119873, "epoch": 2.1679828827076446, "grad_norm": 1.25, "learning_rate": 0.0004524963891603647, "loss": 4.9705, "mean_token_accuracy": 0.21389816999435424, "num_tokens": 48345553.0, "step": 27865 }, { "entropy": 5.568893194198608, "epoch": 2.168371912079362, "grad_norm": 1.1484375, "learning_rate": 0.00045247935502040136, "loss": 4.8826, "mean_token_accuracy": 0.2226459190249443, "num_tokens": 48354209.0, "step": 27870 }, { "entropy": 5.60405912399292, "epoch": 2.1687609414510796, "grad_norm": 1.1953125, "learning_rate": 0.0004524623181874712, "loss": 4.99, "mean_token_accuracy": 0.20411522090435028, "num_tokens": 48362612.0, "step": 27875 }, { "entropy": 5.66093339920044, "epoch": 2.1691499708227973, "grad_norm": 1.1953125, "learning_rate": 0.0004524452786618329, "loss": 4.9528, "mean_token_accuracy": 0.20321442186832428, "num_tokens": 48371089.0, "step": 27880 }, { "entropy": 5.5390753746032715, "epoch": 2.1695390001945145, "grad_norm": 1.1796875, "learning_rate": 0.00045242823644374484, "loss": 4.8443, "mean_token_accuracy": 0.21588192582130433, "num_tokens": 48379883.0, "step": 27885 }, { "entropy": 5.585571765899658, "epoch": 2.169928029566232, "grad_norm": 1.1328125, "learning_rate": 0.0004524111915334658, "loss": 4.9858, "mean_token_accuracy": 0.201564721763134, "num_tokens": 48388742.0, "step": 27890 }, { "entropy": 5.6676877498626705, "epoch": 2.17031705893795, "grad_norm": 1.1171875, "learning_rate": 0.00045239414393125424, "loss": 5.0127, "mean_token_accuracy": 0.19953570067882537, "num_tokens": 48398563.0, "step": 27895 }, { "entropy": 5.671126985549927, "epoch": 2.170706088309667, "grad_norm": 1.1875, "learning_rate": 0.0004523770936373689, "loss": 5.0498, "mean_token_accuracy": 0.19919685870409012, "num_tokens": 48407558.0, "step": 27900 }, { "entropy": 5.745979928970337, "epoch": 2.171095117681385, "grad_norm": 1.265625, "learning_rate": 0.0004523600406520685, "loss": 5.033, "mean_token_accuracy": 0.20019682198762895, "num_tokens": 48416139.0, "step": 27905 }, { "entropy": 5.660734415054321, "epoch": 2.1714841470531026, "grad_norm": 1.1875, "learning_rate": 0.0004523429849756118, "loss": 4.9429, "mean_token_accuracy": 0.20504415333271026, "num_tokens": 48425096.0, "step": 27910 }, { "entropy": 5.5979372501373295, "epoch": 2.1718731764248203, "grad_norm": 1.2109375, "learning_rate": 0.0004523259266082576, "loss": 4.919, "mean_token_accuracy": 0.19872606098651885, "num_tokens": 48433890.0, "step": 27915 }, { "entropy": 5.577544355392456, "epoch": 2.1722622057965375, "grad_norm": 1.1953125, "learning_rate": 0.00045230886555026455, "loss": 4.9358, "mean_token_accuracy": 0.20766192078590393, "num_tokens": 48442456.0, "step": 27920 }, { "entropy": 5.665525913238525, "epoch": 2.172651235168255, "grad_norm": 1.2265625, "learning_rate": 0.00045229180180189176, "loss": 4.9687, "mean_token_accuracy": 0.2067467004060745, "num_tokens": 48450374.0, "step": 27925 }, { "entropy": 5.733412551879883, "epoch": 2.173040264539973, "grad_norm": 1.1640625, "learning_rate": 0.00045227473536339817, "loss": 5.0713, "mean_token_accuracy": 0.19755268841981888, "num_tokens": 48459026.0, "step": 27930 }, { "entropy": 5.645839405059815, "epoch": 2.17342929391169, "grad_norm": 1.203125, "learning_rate": 0.0004522576662350425, "loss": 5.0521, "mean_token_accuracy": 0.20401676297187804, "num_tokens": 48467953.0, "step": 27935 }, { "entropy": 5.724455976486206, "epoch": 2.173818323283408, "grad_norm": 1.234375, "learning_rate": 0.000452240594417084, "loss": 4.9892, "mean_token_accuracy": 0.20372615605592728, "num_tokens": 48476460.0, "step": 27940 }, { "entropy": 5.694390916824341, "epoch": 2.1742073526551255, "grad_norm": 1.2265625, "learning_rate": 0.0004522235199097815, "loss": 5.0259, "mean_token_accuracy": 0.2027232229709625, "num_tokens": 48484945.0, "step": 27945 }, { "entropy": 5.652435398101806, "epoch": 2.1745963820268432, "grad_norm": 1.2109375, "learning_rate": 0.0004522064427133942, "loss": 4.9128, "mean_token_accuracy": 0.2093926340341568, "num_tokens": 48492891.0, "step": 27950 }, { "entropy": 5.602068710327148, "epoch": 2.1749854113985605, "grad_norm": 1.109375, "learning_rate": 0.00045218936282818116, "loss": 4.8595, "mean_token_accuracy": 0.2158997103571892, "num_tokens": 48501370.0, "step": 27955 }, { "entropy": 5.569188213348388, "epoch": 2.175374440770278, "grad_norm": 1.09375, "learning_rate": 0.0004521722802544016, "loss": 4.9651, "mean_token_accuracy": 0.20702164024114608, "num_tokens": 48510518.0, "step": 27960 }, { "entropy": 5.760787773132324, "epoch": 2.175763470141996, "grad_norm": 1.2109375, "learning_rate": 0.00045215519499231465, "loss": 5.1139, "mean_token_accuracy": 0.19750125110149383, "num_tokens": 48520173.0, "step": 27965 }, { "entropy": 5.744514274597168, "epoch": 2.176152499513713, "grad_norm": 1.15625, "learning_rate": 0.00045213810704217963, "loss": 5.056, "mean_token_accuracy": 0.19875043034553527, "num_tokens": 48529486.0, "step": 27970 }, { "entropy": 5.649371767044068, "epoch": 2.176541528885431, "grad_norm": 1.2265625, "learning_rate": 0.0004521210164042557, "loss": 5.0093, "mean_token_accuracy": 0.20206229388713837, "num_tokens": 48538725.0, "step": 27975 }, { "entropy": 5.618534326553345, "epoch": 2.1769305582571485, "grad_norm": 1.109375, "learning_rate": 0.0004521039230788024, "loss": 5.0204, "mean_token_accuracy": 0.19740262925624846, "num_tokens": 48547578.0, "step": 27980 }, { "entropy": 5.572231674194336, "epoch": 2.177319587628866, "grad_norm": 1.078125, "learning_rate": 0.0004520868270660789, "loss": 4.8956, "mean_token_accuracy": 0.209757524728775, "num_tokens": 48556011.0, "step": 27985 }, { "entropy": 5.622557783126831, "epoch": 2.1777086170005835, "grad_norm": 1.1875, "learning_rate": 0.0004520697283663446, "loss": 4.9501, "mean_token_accuracy": 0.20390485525131224, "num_tokens": 48564844.0, "step": 27990 }, { "entropy": 5.555831050872802, "epoch": 2.178097646372301, "grad_norm": 1.1484375, "learning_rate": 0.00045205262697985897, "loss": 4.9268, "mean_token_accuracy": 0.20634517520666124, "num_tokens": 48574079.0, "step": 27995 }, { "entropy": 5.652505159378052, "epoch": 2.1784866757440184, "grad_norm": 1.1484375, "learning_rate": 0.0004520355229068816, "loss": 4.9918, "mean_token_accuracy": 0.20242383182048798, "num_tokens": 48584357.0, "step": 28000 }, { "entropy": 5.568860960006714, "epoch": 2.178875705115736, "grad_norm": 1.140625, "learning_rate": 0.00045201841614767203, "loss": 4.9607, "mean_token_accuracy": 0.19928446263074875, "num_tokens": 48593001.0, "step": 28005 }, { "entropy": 5.630989360809326, "epoch": 2.179264734487454, "grad_norm": 1.171875, "learning_rate": 0.00045200130670248974, "loss": 4.9178, "mean_token_accuracy": 0.2104955717921257, "num_tokens": 48601883.0, "step": 28010 }, { "entropy": 5.573348617553711, "epoch": 2.1796537638591715, "grad_norm": 1.1875, "learning_rate": 0.00045198419457159424, "loss": 4.9358, "mean_token_accuracy": 0.211085906624794, "num_tokens": 48610765.0, "step": 28015 }, { "entropy": 5.627802467346191, "epoch": 2.180042793230889, "grad_norm": 1.15625, "learning_rate": 0.0004519670797552453, "loss": 4.9738, "mean_token_accuracy": 0.2113234966993332, "num_tokens": 48618950.0, "step": 28020 }, { "entropy": 5.713563108444214, "epoch": 2.1804318226026065, "grad_norm": 1.2734375, "learning_rate": 0.00045194996225370266, "loss": 5.0978, "mean_token_accuracy": 0.19300964176654817, "num_tokens": 48627654.0, "step": 28025 }, { "entropy": 5.695786428451538, "epoch": 2.180820851974324, "grad_norm": 1.2265625, "learning_rate": 0.00045193284206722595, "loss": 4.9604, "mean_token_accuracy": 0.20657435953617095, "num_tokens": 48636295.0, "step": 28030 }, { "entropy": 5.673643779754639, "epoch": 2.1812098813460414, "grad_norm": 1.15625, "learning_rate": 0.0004519157191960749, "loss": 4.9294, "mean_token_accuracy": 0.21093812137842177, "num_tokens": 48644543.0, "step": 28035 }, { "entropy": 5.652819108963013, "epoch": 2.181598910717759, "grad_norm": 1.1484375, "learning_rate": 0.0004518985936405096, "loss": 4.9467, "mean_token_accuracy": 0.20411646366119385, "num_tokens": 48653873.0, "step": 28040 }, { "entropy": 5.581996870040894, "epoch": 2.181987940089477, "grad_norm": 1.1875, "learning_rate": 0.0004518814654007896, "loss": 4.867, "mean_token_accuracy": 0.21281438171863556, "num_tokens": 48663083.0, "step": 28045 }, { "entropy": 5.672663784027099, "epoch": 2.1823769694611945, "grad_norm": 1.203125, "learning_rate": 0.00045186433447717486, "loss": 5.0178, "mean_token_accuracy": 0.19615076333284379, "num_tokens": 48671093.0, "step": 28050 }, { "entropy": 5.551146984100342, "epoch": 2.182765998832912, "grad_norm": 1.1484375, "learning_rate": 0.00045184720086992536, "loss": 4.8826, "mean_token_accuracy": 0.2087004467844963, "num_tokens": 48680410.0, "step": 28055 }, { "entropy": 5.637509107589722, "epoch": 2.1831550282046295, "grad_norm": 1.1328125, "learning_rate": 0.00045183006457930107, "loss": 4.9366, "mean_token_accuracy": 0.19815604984760285, "num_tokens": 48688928.0, "step": 28060 }, { "entropy": 5.6413867473602295, "epoch": 2.183544057576347, "grad_norm": 1.1953125, "learning_rate": 0.0004518129256055621, "loss": 5.0263, "mean_token_accuracy": 0.20229238867759705, "num_tokens": 48697462.0, "step": 28065 }, { "entropy": 5.636691904067993, "epoch": 2.1839330869480644, "grad_norm": 1.1875, "learning_rate": 0.0004517957839489683, "loss": 5.0121, "mean_token_accuracy": 0.21011649072170258, "num_tokens": 48706234.0, "step": 28070 }, { "entropy": 5.6010349750518795, "epoch": 2.184322116319782, "grad_norm": 1.2421875, "learning_rate": 0.00045177863960977986, "loss": 4.9684, "mean_token_accuracy": 0.2107345014810562, "num_tokens": 48714694.0, "step": 28075 }, { "entropy": 5.688062858581543, "epoch": 2.1847111456915, "grad_norm": 1.1875, "learning_rate": 0.000451761492588257, "loss": 4.9589, "mean_token_accuracy": 0.20155843943357468, "num_tokens": 48722762.0, "step": 28080 }, { "entropy": 5.690778017044067, "epoch": 2.185100175063217, "grad_norm": 1.1796875, "learning_rate": 0.00045174434288465986, "loss": 5.0323, "mean_token_accuracy": 0.19827434569597244, "num_tokens": 48731986.0, "step": 28085 }, { "entropy": 5.666117525100708, "epoch": 2.1854892044349348, "grad_norm": 1.203125, "learning_rate": 0.0004517271904992486, "loss": 5.0166, "mean_token_accuracy": 0.204315946996212, "num_tokens": 48741740.0, "step": 28090 }, { "entropy": 5.6096426486969, "epoch": 2.1858782338066525, "grad_norm": 1.203125, "learning_rate": 0.0004517100354322835, "loss": 4.939, "mean_token_accuracy": 0.20826371759176254, "num_tokens": 48751043.0, "step": 28095 }, { "entropy": 5.6830010414123535, "epoch": 2.18626726317837, "grad_norm": 1.171875, "learning_rate": 0.00045169287768402497, "loss": 4.9842, "mean_token_accuracy": 0.20770698934793472, "num_tokens": 48760004.0, "step": 28100 }, { "entropy": 5.671423816680909, "epoch": 2.1866562925500874, "grad_norm": 1.1796875, "learning_rate": 0.0004516757172547331, "loss": 5.0329, "mean_token_accuracy": 0.20075724720954896, "num_tokens": 48768829.0, "step": 28105 }, { "entropy": 5.726738739013672, "epoch": 2.187045321921805, "grad_norm": 1.1796875, "learning_rate": 0.0004516585541446685, "loss": 5.0822, "mean_token_accuracy": 0.19186793863773347, "num_tokens": 48777508.0, "step": 28110 }, { "entropy": 5.729541301727295, "epoch": 2.187434351293523, "grad_norm": 1.21875, "learning_rate": 0.00045164138835409153, "loss": 4.9979, "mean_token_accuracy": 0.2060468852519989, "num_tokens": 48785809.0, "step": 28115 }, { "entropy": 5.685092926025391, "epoch": 2.18782338066524, "grad_norm": 1.25, "learning_rate": 0.00045162421988326266, "loss": 4.9879, "mean_token_accuracy": 0.20507350713014602, "num_tokens": 48795078.0, "step": 28120 }, { "entropy": 5.60854206085205, "epoch": 2.1882124100369578, "grad_norm": 1.21875, "learning_rate": 0.0004516070487324424, "loss": 4.9928, "mean_token_accuracy": 0.2087715446949005, "num_tokens": 48803699.0, "step": 28125 }, { "entropy": 5.646251440048218, "epoch": 2.1886014394086755, "grad_norm": 1.1484375, "learning_rate": 0.00045158987490189124, "loss": 4.9662, "mean_token_accuracy": 0.20338423550128937, "num_tokens": 48811738.0, "step": 28130 }, { "entropy": 5.644844913482666, "epoch": 2.1889904687803927, "grad_norm": 1.1875, "learning_rate": 0.0004515726983918697, "loss": 4.9583, "mean_token_accuracy": 0.2185904413461685, "num_tokens": 48819386.0, "step": 28135 }, { "entropy": 5.675701761245728, "epoch": 2.1893794981521104, "grad_norm": 1.1171875, "learning_rate": 0.00045155551920263864, "loss": 4.9879, "mean_token_accuracy": 0.20035598874092103, "num_tokens": 48827862.0, "step": 28140 }, { "entropy": 5.597946262359619, "epoch": 2.189768527523828, "grad_norm": 1.125, "learning_rate": 0.00045153833733445857, "loss": 4.9175, "mean_token_accuracy": 0.20790434926748275, "num_tokens": 48836423.0, "step": 28145 }, { "entropy": 5.646891975402832, "epoch": 2.190157556895546, "grad_norm": 1.234375, "learning_rate": 0.0004515211527875903, "loss": 4.9773, "mean_token_accuracy": 0.20711836367845535, "num_tokens": 48844572.0, "step": 28150 }, { "entropy": 5.658052921295166, "epoch": 2.190546586267263, "grad_norm": 1.203125, "learning_rate": 0.0004515039655622943, "loss": 5.0197, "mean_token_accuracy": 0.1975495085120201, "num_tokens": 48853632.0, "step": 28155 }, { "entropy": 5.574565029144287, "epoch": 2.1909356156389808, "grad_norm": 1.1484375, "learning_rate": 0.00045148677565883167, "loss": 4.8674, "mean_token_accuracy": 0.21655509024858474, "num_tokens": 48862306.0, "step": 28160 }, { "entropy": 5.64834508895874, "epoch": 2.1913246450106985, "grad_norm": 1.203125, "learning_rate": 0.0004514695830774631, "loss": 4.9715, "mean_token_accuracy": 0.20402767062187194, "num_tokens": 48870749.0, "step": 28165 }, { "entropy": 5.657930946350097, "epoch": 2.1917136743824157, "grad_norm": 1.15625, "learning_rate": 0.00045145238781844953, "loss": 4.968, "mean_token_accuracy": 0.20569077581167222, "num_tokens": 48879622.0, "step": 28170 }, { "entropy": 5.56830062866211, "epoch": 2.1921027037541334, "grad_norm": 1.21875, "learning_rate": 0.00045143518988205184, "loss": 4.9304, "mean_token_accuracy": 0.20317641645669937, "num_tokens": 48889766.0, "step": 28175 }, { "entropy": 5.662889671325684, "epoch": 2.192491733125851, "grad_norm": 1.2421875, "learning_rate": 0.00045141798926853094, "loss": 5.0422, "mean_token_accuracy": 0.19983337670564652, "num_tokens": 48898791.0, "step": 28180 }, { "entropy": 5.652655935287475, "epoch": 2.1928807624975684, "grad_norm": 1.125, "learning_rate": 0.0004514007859781478, "loss": 4.9523, "mean_token_accuracy": 0.20582958906888962, "num_tokens": 48907418.0, "step": 28185 }, { "entropy": 5.595499563217163, "epoch": 2.193269791869286, "grad_norm": 1.234375, "learning_rate": 0.0004513835800111635, "loss": 4.9092, "mean_token_accuracy": 0.2061915174126625, "num_tokens": 48915510.0, "step": 28190 }, { "entropy": 5.5971923828125, "epoch": 2.1936588212410038, "grad_norm": 1.1953125, "learning_rate": 0.0004513663713678392, "loss": 4.9811, "mean_token_accuracy": 0.19574748128652572, "num_tokens": 48924067.0, "step": 28195 }, { "entropy": 5.6234969139099125, "epoch": 2.1940478506127215, "grad_norm": 1.109375, "learning_rate": 0.00045134916004843596, "loss": 4.9186, "mean_token_accuracy": 0.20731496661901475, "num_tokens": 48932587.0, "step": 28200 }, { "entropy": 5.6360002040863035, "epoch": 2.1944368799844387, "grad_norm": 1.15625, "learning_rate": 0.0004513319460532148, "loss": 4.9086, "mean_token_accuracy": 0.21174990385770798, "num_tokens": 48941237.0, "step": 28205 }, { "entropy": 5.656458759307862, "epoch": 2.1948259093561564, "grad_norm": 1.2578125, "learning_rate": 0.00045131472938243707, "loss": 5.0313, "mean_token_accuracy": 0.2062858909368515, "num_tokens": 48949982.0, "step": 28210 }, { "entropy": 5.613702964782715, "epoch": 2.195214938727874, "grad_norm": 1.1484375, "learning_rate": 0.0004512975100363639, "loss": 5.0148, "mean_token_accuracy": 0.19961462020874024, "num_tokens": 48959039.0, "step": 28215 }, { "entropy": 5.686495351791382, "epoch": 2.1956039680995914, "grad_norm": 1.0703125, "learning_rate": 0.00045128028801525675, "loss": 4.9109, "mean_token_accuracy": 0.21068979650735856, "num_tokens": 48968743.0, "step": 28220 }, { "entropy": 5.741949653625488, "epoch": 2.195992997471309, "grad_norm": 1.2265625, "learning_rate": 0.00045126306331937674, "loss": 5.0264, "mean_token_accuracy": 0.19319188445806504, "num_tokens": 48976723.0, "step": 28225 }, { "entropy": 5.690803527832031, "epoch": 2.1963820268430267, "grad_norm": 1.234375, "learning_rate": 0.0004512458359489853, "loss": 5.039, "mean_token_accuracy": 0.20466383993625642, "num_tokens": 48985362.0, "step": 28230 }, { "entropy": 5.587969875335693, "epoch": 2.196771056214744, "grad_norm": 1.171875, "learning_rate": 0.0004512286059043437, "loss": 4.9731, "mean_token_accuracy": 0.21002357602119445, "num_tokens": 48993838.0, "step": 28235 }, { "entropy": 5.658978128433228, "epoch": 2.1971600855864617, "grad_norm": 1.2734375, "learning_rate": 0.00045121137318571364, "loss": 4.9614, "mean_token_accuracy": 0.20257118046283723, "num_tokens": 49002054.0, "step": 28240 }, { "entropy": 5.717769050598145, "epoch": 2.1975491149581794, "grad_norm": 1.2109375, "learning_rate": 0.00045119413779335645, "loss": 4.9742, "mean_token_accuracy": 0.19996379762887956, "num_tokens": 49010345.0, "step": 28245 }, { "entropy": 5.537086296081543, "epoch": 2.197938144329897, "grad_norm": 1.3125, "learning_rate": 0.0004511768997275336, "loss": 4.8652, "mean_token_accuracy": 0.21713197976350784, "num_tokens": 49018152.0, "step": 28250 }, { "entropy": 5.584592485427857, "epoch": 2.1983271737016143, "grad_norm": 1.1796875, "learning_rate": 0.0004511596589885068, "loss": 4.932, "mean_token_accuracy": 0.20973170101642608, "num_tokens": 49027876.0, "step": 28255 }, { "entropy": 5.681524658203125, "epoch": 2.198716203073332, "grad_norm": 1.1015625, "learning_rate": 0.0004511424155765375, "loss": 4.9452, "mean_token_accuracy": 0.20627468675374985, "num_tokens": 49036048.0, "step": 28260 }, { "entropy": 5.704376173019409, "epoch": 2.1991052324450497, "grad_norm": 1.15625, "learning_rate": 0.00045112516949188735, "loss": 4.9608, "mean_token_accuracy": 0.21067523807287217, "num_tokens": 49044705.0, "step": 28265 }, { "entropy": 5.588010978698731, "epoch": 2.199494261816767, "grad_norm": 1.234375, "learning_rate": 0.0004511079207348182, "loss": 4.898, "mean_token_accuracy": 0.2084199532866478, "num_tokens": 49053281.0, "step": 28270 }, { "entropy": 5.582923078536988, "epoch": 2.1998832911884847, "grad_norm": 1.234375, "learning_rate": 0.0004510906693055916, "loss": 4.9088, "mean_token_accuracy": 0.21140260249376297, "num_tokens": 49061681.0, "step": 28275 }, { "entropy": 5.572782945632935, "epoch": 2.2002723205602024, "grad_norm": 1.3359375, "learning_rate": 0.0004510734152044694, "loss": 4.8133, "mean_token_accuracy": 0.21331465393304824, "num_tokens": 49069671.0, "step": 28280 }, { "entropy": 5.664387369155884, "epoch": 2.20066134993192, "grad_norm": 1.265625, "learning_rate": 0.00045105615843171336, "loss": 5.0752, "mean_token_accuracy": 0.19430896788835525, "num_tokens": 49078190.0, "step": 28285 }, { "entropy": 5.67475848197937, "epoch": 2.2010503793036373, "grad_norm": 1.109375, "learning_rate": 0.00045103889898758534, "loss": 5.0473, "mean_token_accuracy": 0.2026989832520485, "num_tokens": 49087525.0, "step": 28290 }, { "entropy": 5.679633522033692, "epoch": 2.201439408675355, "grad_norm": 1.234375, "learning_rate": 0.0004510216368723472, "loss": 4.9548, "mean_token_accuracy": 0.2060781016945839, "num_tokens": 49095992.0, "step": 28295 }, { "entropy": 5.706890678405761, "epoch": 2.2018284380470727, "grad_norm": 1.2109375, "learning_rate": 0.00045100437208626086, "loss": 5.0849, "mean_token_accuracy": 0.1951887995004654, "num_tokens": 49104195.0, "step": 28300 }, { "entropy": 5.624286413192749, "epoch": 2.20221746741879, "grad_norm": 1.1328125, "learning_rate": 0.00045098710462958844, "loss": 4.9603, "mean_token_accuracy": 0.20303198099136352, "num_tokens": 49113070.0, "step": 28305 }, { "entropy": 5.571534967422485, "epoch": 2.2026064967905077, "grad_norm": 1.1953125, "learning_rate": 0.00045096983450259166, "loss": 4.941, "mean_token_accuracy": 0.2074427217245102, "num_tokens": 49121686.0, "step": 28310 }, { "entropy": 5.6869526386260985, "epoch": 2.2029955261622254, "grad_norm": 1.1953125, "learning_rate": 0.00045095256170553285, "loss": 5.0524, "mean_token_accuracy": 0.1975306436419487, "num_tokens": 49129920.0, "step": 28315 }, { "entropy": 5.696602821350098, "epoch": 2.2033845555339426, "grad_norm": 1.28125, "learning_rate": 0.00045093528623867384, "loss": 5.028, "mean_token_accuracy": 0.2024422511458397, "num_tokens": 49138314.0, "step": 28320 }, { "entropy": 5.669262170791626, "epoch": 2.2037735849056603, "grad_norm": 1.25, "learning_rate": 0.00045091800810227706, "loss": 4.9245, "mean_token_accuracy": 0.20495891571044922, "num_tokens": 49146689.0, "step": 28325 }, { "entropy": 5.628743314743042, "epoch": 2.204162614277378, "grad_norm": 1.2890625, "learning_rate": 0.0004509007272966044, "loss": 4.9409, "mean_token_accuracy": 0.20222798138856887, "num_tokens": 49155374.0, "step": 28330 }, { "entropy": 5.640137338638306, "epoch": 2.2045516436490953, "grad_norm": 1.171875, "learning_rate": 0.0004508834438219182, "loss": 4.9793, "mean_token_accuracy": 0.20476195067167283, "num_tokens": 49163535.0, "step": 28335 }, { "entropy": 5.631760120391846, "epoch": 2.204940673020813, "grad_norm": 1.21875, "learning_rate": 0.0004508661576784807, "loss": 4.929, "mean_token_accuracy": 0.20172805190086365, "num_tokens": 49171970.0, "step": 28340 }, { "entropy": 5.62496657371521, "epoch": 2.2053297023925307, "grad_norm": 1.21875, "learning_rate": 0.0004508488688665541, "loss": 5.0261, "mean_token_accuracy": 0.1935613453388214, "num_tokens": 49180232.0, "step": 28345 }, { "entropy": 5.614452266693116, "epoch": 2.2057187317642484, "grad_norm": 1.171875, "learning_rate": 0.0004508315773864009, "loss": 4.9062, "mean_token_accuracy": 0.21733712553977966, "num_tokens": 49188611.0, "step": 28350 }, { "entropy": 5.632849931716919, "epoch": 2.2061077611359656, "grad_norm": 1.265625, "learning_rate": 0.00045081428323828337, "loss": 4.9508, "mean_token_accuracy": 0.20272507518529892, "num_tokens": 49197143.0, "step": 28355 }, { "entropy": 5.600899505615234, "epoch": 2.2064967905076833, "grad_norm": 1.2265625, "learning_rate": 0.0004507969864224639, "loss": 4.9819, "mean_token_accuracy": 0.21393770277500151, "num_tokens": 49205672.0, "step": 28360 }, { "entropy": 5.596367454528808, "epoch": 2.206885819879401, "grad_norm": 1.1953125, "learning_rate": 0.000450779686939205, "loss": 4.9109, "mean_token_accuracy": 0.21028747856616975, "num_tokens": 49214917.0, "step": 28365 }, { "entropy": 5.651163816452026, "epoch": 2.2072748492511183, "grad_norm": 1.203125, "learning_rate": 0.00045076238478876916, "loss": 5.0383, "mean_token_accuracy": 0.2006843537092209, "num_tokens": 49223768.0, "step": 28370 }, { "entropy": 5.663599252700806, "epoch": 2.207663878622836, "grad_norm": 1.234375, "learning_rate": 0.0004507450799714188, "loss": 5.0025, "mean_token_accuracy": 0.20090432465076447, "num_tokens": 49232075.0, "step": 28375 }, { "entropy": 5.613945341110229, "epoch": 2.2080529079945537, "grad_norm": 1.1796875, "learning_rate": 0.00045072777248741664, "loss": 4.8916, "mean_token_accuracy": 0.2083156570792198, "num_tokens": 49240266.0, "step": 28380 }, { "entropy": 5.67335844039917, "epoch": 2.2084419373662714, "grad_norm": 1.25, "learning_rate": 0.0004507104623370252, "loss": 4.9888, "mean_token_accuracy": 0.20498573184013366, "num_tokens": 49248308.0, "step": 28385 }, { "entropy": 5.683750581741333, "epoch": 2.2088309667379886, "grad_norm": 1.140625, "learning_rate": 0.0004506931495205072, "loss": 5.0354, "mean_token_accuracy": 0.19959783554077148, "num_tokens": 49257353.0, "step": 28390 }, { "entropy": 5.715412044525147, "epoch": 2.2092199961097063, "grad_norm": 1.2265625, "learning_rate": 0.0004506758340381253, "loss": 5.0086, "mean_token_accuracy": 0.19767916798591614, "num_tokens": 49266652.0, "step": 28395 }, { "entropy": 5.578192234039307, "epoch": 2.209609025481424, "grad_norm": 1.2421875, "learning_rate": 0.0004506585158901422, "loss": 4.8424, "mean_token_accuracy": 0.2168688878417015, "num_tokens": 49274512.0, "step": 28400 }, { "entropy": 5.5548155307769775, "epoch": 2.2099980548531413, "grad_norm": 1.2265625, "learning_rate": 0.0004506411950768207, "loss": 5.0143, "mean_token_accuracy": 0.2097577691078186, "num_tokens": 49282734.0, "step": 28405 }, { "entropy": 5.574290227890015, "epoch": 2.210387084224859, "grad_norm": 1.140625, "learning_rate": 0.00045062387159842363, "loss": 4.8699, "mean_token_accuracy": 0.21610298454761506, "num_tokens": 49291615.0, "step": 28410 }, { "entropy": 5.743170738220215, "epoch": 2.2107761135965767, "grad_norm": 1.234375, "learning_rate": 0.00045060654545521386, "loss": 5.0958, "mean_token_accuracy": 0.20171353071928025, "num_tokens": 49300865.0, "step": 28415 }, { "entropy": 5.651709794998169, "epoch": 2.211165142968294, "grad_norm": 1.21875, "learning_rate": 0.00045058921664745436, "loss": 4.9501, "mean_token_accuracy": 0.21062974333763124, "num_tokens": 49309118.0, "step": 28420 }, { "entropy": 5.6253408908844, "epoch": 2.2115541723400116, "grad_norm": 1.15625, "learning_rate": 0.00045057188517540783, "loss": 5.0241, "mean_token_accuracy": 0.2016489878296852, "num_tokens": 49317954.0, "step": 28425 }, { "entropy": 5.692108821868897, "epoch": 2.2119432017117293, "grad_norm": 1.3203125, "learning_rate": 0.0004505545510393374, "loss": 5.0321, "mean_token_accuracy": 0.19788238853216172, "num_tokens": 49327629.0, "step": 28430 }, { "entropy": 5.719353246688843, "epoch": 2.2123322310834466, "grad_norm": 1.34375, "learning_rate": 0.00045053721423950617, "loss": 4.9881, "mean_token_accuracy": 0.20825668424367905, "num_tokens": 49336149.0, "step": 28435 }, { "entropy": 5.623496770858765, "epoch": 2.2127212604551643, "grad_norm": 1.265625, "learning_rate": 0.0004505198747761771, "loss": 4.9163, "mean_token_accuracy": 0.206802037358284, "num_tokens": 49343801.0, "step": 28440 }, { "entropy": 5.57391209602356, "epoch": 2.213110289826882, "grad_norm": 1.15625, "learning_rate": 0.0004505025326496132, "loss": 4.9413, "mean_token_accuracy": 0.21114057451486587, "num_tokens": 49352095.0, "step": 28445 }, { "entropy": 5.665153932571411, "epoch": 2.2134993191985997, "grad_norm": 1.1953125, "learning_rate": 0.00045048518786007784, "loss": 5.0456, "mean_token_accuracy": 0.20099566727876664, "num_tokens": 49361313.0, "step": 28450 }, { "entropy": 5.692573308944702, "epoch": 2.213888348570317, "grad_norm": 1.21875, "learning_rate": 0.00045046784040783395, "loss": 4.982, "mean_token_accuracy": 0.2068189024925232, "num_tokens": 49369143.0, "step": 28455 }, { "entropy": 5.639870023727417, "epoch": 2.2142773779420346, "grad_norm": 1.09375, "learning_rate": 0.000450450490293145, "loss": 5.0071, "mean_token_accuracy": 0.2033908486366272, "num_tokens": 49378070.0, "step": 28460 }, { "entropy": 5.700644636154175, "epoch": 2.2146664073137523, "grad_norm": 1.15625, "learning_rate": 0.000450433137516274, "loss": 5.0696, "mean_token_accuracy": 0.19819185584783555, "num_tokens": 49387384.0, "step": 28465 }, { "entropy": 5.530457878112793, "epoch": 2.2150554366854696, "grad_norm": 1.1484375, "learning_rate": 0.0004504157820774844, "loss": 4.8428, "mean_token_accuracy": 0.21621347665786744, "num_tokens": 49395963.0, "step": 28470 }, { "entropy": 5.590002822875976, "epoch": 2.2154444660571873, "grad_norm": 1.21875, "learning_rate": 0.0004503984239770396, "loss": 4.9684, "mean_token_accuracy": 0.205004546046257, "num_tokens": 49404319.0, "step": 28475 }, { "entropy": 5.607525634765625, "epoch": 2.215833495428905, "grad_norm": 1.203125, "learning_rate": 0.0004503810632152028, "loss": 4.9301, "mean_token_accuracy": 0.20632750540971756, "num_tokens": 49413492.0, "step": 28480 }, { "entropy": 5.603136157989502, "epoch": 2.2162225248006227, "grad_norm": 1.2421875, "learning_rate": 0.0004503636997922375, "loss": 4.9654, "mean_token_accuracy": 0.20214542150497436, "num_tokens": 49422272.0, "step": 28485 }, { "entropy": 5.6705221176147464, "epoch": 2.21661155417234, "grad_norm": 1.2109375, "learning_rate": 0.0004503463337084072, "loss": 4.9887, "mean_token_accuracy": 0.2098117232322693, "num_tokens": 49430987.0, "step": 28490 }, { "entropy": 5.5846397399902346, "epoch": 2.2170005835440576, "grad_norm": 1.25, "learning_rate": 0.0004503289649639754, "loss": 4.8532, "mean_token_accuracy": 0.2093619167804718, "num_tokens": 49439951.0, "step": 28495 }, { "entropy": 5.635721492767334, "epoch": 2.2173896129157753, "grad_norm": 1.2578125, "learning_rate": 0.0004503115935592056, "loss": 5.0157, "mean_token_accuracy": 0.20393471270799637, "num_tokens": 49448619.0, "step": 28500 }, { "entropy": 5.645308876037598, "epoch": 2.2177786422874926, "grad_norm": 1.15625, "learning_rate": 0.0004502942194943614, "loss": 5.0157, "mean_token_accuracy": 0.20709340125322342, "num_tokens": 49458492.0, "step": 28505 }, { "entropy": 5.675280618667602, "epoch": 2.2181676716592102, "grad_norm": 1.1875, "learning_rate": 0.00045027684276970645, "loss": 4.9146, "mean_token_accuracy": 0.2071888968348503, "num_tokens": 49467022.0, "step": 28510 }, { "entropy": 5.642430019378662, "epoch": 2.218556701030928, "grad_norm": 1.2265625, "learning_rate": 0.00045025946338550434, "loss": 4.9832, "mean_token_accuracy": 0.20372161120176316, "num_tokens": 49475494.0, "step": 28515 }, { "entropy": 5.6486741065979, "epoch": 2.218945730402645, "grad_norm": 1.21875, "learning_rate": 0.0004502420813420189, "loss": 4.9825, "mean_token_accuracy": 0.21352628022432327, "num_tokens": 49484124.0, "step": 28520 }, { "entropy": 5.640975856781006, "epoch": 2.219334759774363, "grad_norm": 1.1796875, "learning_rate": 0.0004502246966395137, "loss": 5.0012, "mean_token_accuracy": 0.20186113715171813, "num_tokens": 49493584.0, "step": 28525 }, { "entropy": 5.64012131690979, "epoch": 2.2197237891460806, "grad_norm": 1.1953125, "learning_rate": 0.00045020730927825274, "loss": 4.9669, "mean_token_accuracy": 0.2090249627828598, "num_tokens": 49502635.0, "step": 28530 }, { "entropy": 5.743996047973633, "epoch": 2.2201128185177983, "grad_norm": 1.25, "learning_rate": 0.0004501899192584997, "loss": 4.9443, "mean_token_accuracy": 0.2103131338953972, "num_tokens": 49512166.0, "step": 28535 }, { "entropy": 5.652443504333496, "epoch": 2.2205018478895155, "grad_norm": 1.1015625, "learning_rate": 0.0004501725265805185, "loss": 4.9986, "mean_token_accuracy": 0.20215335190296174, "num_tokens": 49521141.0, "step": 28540 }, { "entropy": 5.664021062850952, "epoch": 2.2208908772612332, "grad_norm": 1.234375, "learning_rate": 0.00045015513124457303, "loss": 4.9876, "mean_token_accuracy": 0.20159000605344773, "num_tokens": 49530516.0, "step": 28545 }, { "entropy": 5.620539855957031, "epoch": 2.221279906632951, "grad_norm": 1.265625, "learning_rate": 0.0004501377332509272, "loss": 4.9022, "mean_token_accuracy": 0.21058933138847352, "num_tokens": 49538235.0, "step": 28550 }, { "entropy": 5.618322372436523, "epoch": 2.221668936004668, "grad_norm": 1.1484375, "learning_rate": 0.00045012033259984494, "loss": 4.9352, "mean_token_accuracy": 0.20981960743665695, "num_tokens": 49547303.0, "step": 28555 }, { "entropy": 5.655894804000854, "epoch": 2.222057965376386, "grad_norm": 1.2265625, "learning_rate": 0.0004501029292915905, "loss": 4.9358, "mean_token_accuracy": 0.20866496711969376, "num_tokens": 49555280.0, "step": 28560 }, { "entropy": 5.733003616333008, "epoch": 2.2224469947481036, "grad_norm": 1.2890625, "learning_rate": 0.00045008552332642774, "loss": 5.0638, "mean_token_accuracy": 0.19714297652244567, "num_tokens": 49563673.0, "step": 28565 }, { "entropy": 5.650975513458252, "epoch": 2.222836024119821, "grad_norm": 1.203125, "learning_rate": 0.00045006811470462083, "loss": 4.9547, "mean_token_accuracy": 0.2033947378396988, "num_tokens": 49572253.0, "step": 28570 }, { "entropy": 5.613274669647216, "epoch": 2.2232250534915385, "grad_norm": 1.234375, "learning_rate": 0.000450050703426434, "loss": 4.9079, "mean_token_accuracy": 0.20420370101928711, "num_tokens": 49580780.0, "step": 28575 }, { "entropy": 5.698044395446777, "epoch": 2.2236140828632562, "grad_norm": 1.3046875, "learning_rate": 0.0004500332894921313, "loss": 4.9878, "mean_token_accuracy": 0.21119306832551957, "num_tokens": 49589516.0, "step": 28580 }, { "entropy": 5.705364418029785, "epoch": 2.224003112234974, "grad_norm": 1.1796875, "learning_rate": 0.0004500158729019771, "loss": 5.0673, "mean_token_accuracy": 0.20327957570552826, "num_tokens": 49597893.0, "step": 28585 }, { "entropy": 5.687286424636841, "epoch": 2.224392141606691, "grad_norm": 1.1171875, "learning_rate": 0.0004499984536562355, "loss": 5.0107, "mean_token_accuracy": 0.2004205361008644, "num_tokens": 49606367.0, "step": 28590 }, { "entropy": 5.693738412857056, "epoch": 2.224781170978409, "grad_norm": 1.1328125, "learning_rate": 0.000449981031755171, "loss": 4.964, "mean_token_accuracy": 0.20433780401945115, "num_tokens": 49615121.0, "step": 28595 }, { "entropy": 5.671412086486816, "epoch": 2.2251702003501266, "grad_norm": 1.203125, "learning_rate": 0.00044996360719904777, "loss": 4.9535, "mean_token_accuracy": 0.20793501734733583, "num_tokens": 49623977.0, "step": 28600 }, { "entropy": 5.637563228607178, "epoch": 2.225559229721844, "grad_norm": 1.125, "learning_rate": 0.0004499461799881303, "loss": 5.0492, "mean_token_accuracy": 0.19995869547128678, "num_tokens": 49633398.0, "step": 28605 }, { "entropy": 5.705842447280884, "epoch": 2.2259482590935615, "grad_norm": 1.1875, "learning_rate": 0.0004499287501226831, "loss": 5.0484, "mean_token_accuracy": 0.2065889835357666, "num_tokens": 49641930.0, "step": 28610 }, { "entropy": 5.656173992156982, "epoch": 2.2263372884652792, "grad_norm": 1.1484375, "learning_rate": 0.00044991131760297045, "loss": 4.961, "mean_token_accuracy": 0.20247951447963713, "num_tokens": 49650769.0, "step": 28615 }, { "entropy": 5.579816913604736, "epoch": 2.226726317836997, "grad_norm": 1.3203125, "learning_rate": 0.00044989388242925693, "loss": 4.9742, "mean_token_accuracy": 0.2084539234638214, "num_tokens": 49659057.0, "step": 28620 }, { "entropy": 5.602654314041137, "epoch": 2.227115347208714, "grad_norm": 1.171875, "learning_rate": 0.0004498764446018073, "loss": 4.9691, "mean_token_accuracy": 0.20144496262073516, "num_tokens": 49668016.0, "step": 28625 }, { "entropy": 5.745183086395263, "epoch": 2.227504376580432, "grad_norm": 1.15625, "learning_rate": 0.0004498590041208857, "loss": 5.0869, "mean_token_accuracy": 0.20160751193761825, "num_tokens": 49676822.0, "step": 28630 }, { "entropy": 5.671241044998169, "epoch": 2.2278934059521496, "grad_norm": 1.2890625, "learning_rate": 0.0004498415609867572, "loss": 4.9246, "mean_token_accuracy": 0.20989976078271866, "num_tokens": 49685654.0, "step": 28635 }, { "entropy": 5.718523693084717, "epoch": 2.228282435323867, "grad_norm": 1.2578125, "learning_rate": 0.00044982411519968625, "loss": 5.0904, "mean_token_accuracy": 0.20201894491910935, "num_tokens": 49694216.0, "step": 28640 }, { "entropy": 5.597354698181152, "epoch": 2.2286714646955845, "grad_norm": 1.1953125, "learning_rate": 0.0004498066667599377, "loss": 4.974, "mean_token_accuracy": 0.2120068445801735, "num_tokens": 49702149.0, "step": 28645 }, { "entropy": 5.630117893218994, "epoch": 2.2290604940673022, "grad_norm": 1.25, "learning_rate": 0.00044978921566777604, "loss": 4.9161, "mean_token_accuracy": 0.20473225861787797, "num_tokens": 49710137.0, "step": 28650 }, { "entropy": 5.587685823440552, "epoch": 2.2294495234390195, "grad_norm": 1.140625, "learning_rate": 0.0004497717619234664, "loss": 4.9171, "mean_token_accuracy": 0.2163330614566803, "num_tokens": 49719577.0, "step": 28655 }, { "entropy": 5.569232845306397, "epoch": 2.229838552810737, "grad_norm": 1.25, "learning_rate": 0.00044975430552727337, "loss": 4.9032, "mean_token_accuracy": 0.2144857317209244, "num_tokens": 49728126.0, "step": 28660 }, { "entropy": 5.643462800979615, "epoch": 2.230227582182455, "grad_norm": 1.25, "learning_rate": 0.0004497368464794619, "loss": 4.9763, "mean_token_accuracy": 0.20651634484529496, "num_tokens": 49736641.0, "step": 28665 }, { "entropy": 5.689315986633301, "epoch": 2.230616611554172, "grad_norm": 1.203125, "learning_rate": 0.00044971938478029693, "loss": 4.984, "mean_token_accuracy": 0.2026783674955368, "num_tokens": 49745090.0, "step": 28670 }, { "entropy": 5.72116436958313, "epoch": 2.23100564092589, "grad_norm": 1.203125, "learning_rate": 0.00044970192043004343, "loss": 5.024, "mean_token_accuracy": 0.1980004832148552, "num_tokens": 49753014.0, "step": 28675 }, { "entropy": 5.594558191299439, "epoch": 2.2313946702976075, "grad_norm": 1.1171875, "learning_rate": 0.0004496844534289663, "loss": 4.9308, "mean_token_accuracy": 0.203846837580204, "num_tokens": 49761301.0, "step": 28680 }, { "entropy": 5.650203609466553, "epoch": 2.231783699669325, "grad_norm": 1.1640625, "learning_rate": 0.00044966698377733064, "loss": 5.0168, "mean_token_accuracy": 0.2100025087594986, "num_tokens": 49770004.0, "step": 28685 }, { "entropy": 5.638822555541992, "epoch": 2.2321727290410425, "grad_norm": 1.2421875, "learning_rate": 0.0004496495114754015, "loss": 4.9254, "mean_token_accuracy": 0.2113855615258217, "num_tokens": 49778229.0, "step": 28690 }, { "entropy": 5.644185256958008, "epoch": 2.23256175841276, "grad_norm": 1.1640625, "learning_rate": 0.00044963203652344404, "loss": 4.9897, "mean_token_accuracy": 0.20220270454883577, "num_tokens": 49786624.0, "step": 28695 }, { "entropy": 5.610005474090576, "epoch": 2.232950787784478, "grad_norm": 1.21875, "learning_rate": 0.0004496145589217234, "loss": 4.861, "mean_token_accuracy": 0.2151682272553444, "num_tokens": 49794487.0, "step": 28700 }, { "entropy": 5.6170085906982425, "epoch": 2.233339817156195, "grad_norm": 1.25, "learning_rate": 0.00044959707867050467, "loss": 4.9069, "mean_token_accuracy": 0.20929718017578125, "num_tokens": 49803141.0, "step": 28705 }, { "entropy": 5.606162405014038, "epoch": 2.233728846527913, "grad_norm": 1.2265625, "learning_rate": 0.0004495795957700532, "loss": 4.9401, "mean_token_accuracy": 0.20854750871658326, "num_tokens": 49811539.0, "step": 28710 }, { "entropy": 5.554507923126221, "epoch": 2.2341178758996305, "grad_norm": 1.09375, "learning_rate": 0.00044956211022063424, "loss": 4.868, "mean_token_accuracy": 0.20275925546884538, "num_tokens": 49820539.0, "step": 28715 }, { "entropy": 5.623787307739258, "epoch": 2.234506905271348, "grad_norm": 1.140625, "learning_rate": 0.00044954462202251316, "loss": 4.9118, "mean_token_accuracy": 0.21089418828487397, "num_tokens": 49829256.0, "step": 28720 }, { "entropy": 5.67448844909668, "epoch": 2.2348959346430655, "grad_norm": 1.28125, "learning_rate": 0.00044952713117595516, "loss": 5.0286, "mean_token_accuracy": 0.19897452741861343, "num_tokens": 49837631.0, "step": 28725 }, { "entropy": 5.6379838466644285, "epoch": 2.235284964014783, "grad_norm": 1.2890625, "learning_rate": 0.00044950963768122576, "loss": 5.0177, "mean_token_accuracy": 0.19833195954561234, "num_tokens": 49846431.0, "step": 28730 }, { "entropy": 5.675135946273803, "epoch": 2.235673993386501, "grad_norm": 1.1484375, "learning_rate": 0.0004494921415385905, "loss": 5.005, "mean_token_accuracy": 0.20128373205661773, "num_tokens": 49855346.0, "step": 28735 }, { "entropy": 5.706869983673096, "epoch": 2.236063022758218, "grad_norm": 1.140625, "learning_rate": 0.00044947464274831464, "loss": 4.9806, "mean_token_accuracy": 0.20038591772317887, "num_tokens": 49863993.0, "step": 28740 }, { "entropy": 5.6477807521820065, "epoch": 2.236452052129936, "grad_norm": 1.2734375, "learning_rate": 0.0004494571413106637, "loss": 4.9011, "mean_token_accuracy": 0.20405910462141036, "num_tokens": 49872028.0, "step": 28745 }, { "entropy": 5.5834815979003904, "epoch": 2.2368410815016535, "grad_norm": 1.1640625, "learning_rate": 0.00044943963722590344, "loss": 4.9339, "mean_token_accuracy": 0.2086910605430603, "num_tokens": 49880684.0, "step": 28750 }, { "entropy": 5.640209341049195, "epoch": 2.2372301108733708, "grad_norm": 1.3515625, "learning_rate": 0.00044942213049429917, "loss": 4.9739, "mean_token_accuracy": 0.2111585557460785, "num_tokens": 49888818.0, "step": 28755 }, { "entropy": 5.676238918304444, "epoch": 2.2376191402450885, "grad_norm": 1.125, "learning_rate": 0.00044940462111611685, "loss": 4.9998, "mean_token_accuracy": 0.20719074308872223, "num_tokens": 49897558.0, "step": 28760 }, { "entropy": 5.656907081604004, "epoch": 2.238008169616806, "grad_norm": 1.2265625, "learning_rate": 0.00044938710909162195, "loss": 4.9487, "mean_token_accuracy": 0.20505982488393784, "num_tokens": 49905652.0, "step": 28765 }, { "entropy": 5.579398202896118, "epoch": 2.2383971989885234, "grad_norm": 1.265625, "learning_rate": 0.0004493695944210802, "loss": 4.964, "mean_token_accuracy": 0.2014552906155586, "num_tokens": 49913911.0, "step": 28770 }, { "entropy": 5.615656137466431, "epoch": 2.238786228360241, "grad_norm": 1.1875, "learning_rate": 0.0004493520771047574, "loss": 4.9387, "mean_token_accuracy": 0.2068767264485359, "num_tokens": 49921794.0, "step": 28775 }, { "entropy": 5.6582183837890625, "epoch": 2.239175257731959, "grad_norm": 1.171875, "learning_rate": 0.00044933455714291944, "loss": 4.9943, "mean_token_accuracy": 0.19129490554332734, "num_tokens": 49930230.0, "step": 28780 }, { "entropy": 5.682102489471435, "epoch": 2.2395642871036765, "grad_norm": 1.3046875, "learning_rate": 0.00044931703453583195, "loss": 4.9233, "mean_token_accuracy": 0.21289683729410172, "num_tokens": 49937995.0, "step": 28785 }, { "entropy": 5.688552188873291, "epoch": 2.2399533164753938, "grad_norm": 1.21875, "learning_rate": 0.00044929950928376095, "loss": 5.0124, "mean_token_accuracy": 0.20415483862161637, "num_tokens": 49945456.0, "step": 28790 }, { "entropy": 5.594967460632324, "epoch": 2.2403423458471114, "grad_norm": 1.21875, "learning_rate": 0.0004492819813869723, "loss": 4.964, "mean_token_accuracy": 0.20929117500782013, "num_tokens": 49953679.0, "step": 28795 }, { "entropy": 5.625983047485351, "epoch": 2.240731375218829, "grad_norm": 1.28125, "learning_rate": 0.00044926445084573206, "loss": 4.8969, "mean_token_accuracy": 0.21350717097520827, "num_tokens": 49961771.0, "step": 28800 }, { "entropy": 5.655473279953003, "epoch": 2.2411204045905464, "grad_norm": 1.21875, "learning_rate": 0.000449246917660306, "loss": 4.91, "mean_token_accuracy": 0.2106430396437645, "num_tokens": 49970157.0, "step": 28805 }, { "entropy": 5.706585121154785, "epoch": 2.241509433962264, "grad_norm": 1.2734375, "learning_rate": 0.0004492293818309604, "loss": 5.0368, "mean_token_accuracy": 0.19362106621265412, "num_tokens": 49978586.0, "step": 28810 }, { "entropy": 5.573245573043823, "epoch": 2.241898463333982, "grad_norm": 1.078125, "learning_rate": 0.0004492118433579613, "loss": 4.9438, "mean_token_accuracy": 0.20379832088947297, "num_tokens": 49987686.0, "step": 28815 }, { "entropy": 5.663925743103027, "epoch": 2.2422874927056995, "grad_norm": 1.15625, "learning_rate": 0.00044919430224157463, "loss": 4.9507, "mean_token_accuracy": 0.20690799206495286, "num_tokens": 49996529.0, "step": 28820 }, { "entropy": 5.709371519088745, "epoch": 2.2426765220774167, "grad_norm": 1.125, "learning_rate": 0.00044917675848206684, "loss": 5.0599, "mean_token_accuracy": 0.20729530453681946, "num_tokens": 50005506.0, "step": 28825 }, { "entropy": 5.634599018096924, "epoch": 2.2430655514491344, "grad_norm": 1.2421875, "learning_rate": 0.00044915921207970387, "loss": 4.8846, "mean_token_accuracy": 0.21217499375343324, "num_tokens": 50013424.0, "step": 28830 }, { "entropy": 5.633788967132569, "epoch": 2.243454580820852, "grad_norm": 1.25, "learning_rate": 0.00044914166303475206, "loss": 4.9338, "mean_token_accuracy": 0.20475925505161285, "num_tokens": 50021702.0, "step": 28835 }, { "entropy": 5.630589437484741, "epoch": 2.2438436101925694, "grad_norm": 1.1796875, "learning_rate": 0.00044912411134747764, "loss": 4.9288, "mean_token_accuracy": 0.20542633384466172, "num_tokens": 50030722.0, "step": 28840 }, { "entropy": 5.695249700546265, "epoch": 2.244232639564287, "grad_norm": 1.3203125, "learning_rate": 0.00044910655701814705, "loss": 4.9332, "mean_token_accuracy": 0.2023451194167137, "num_tokens": 50038829.0, "step": 28845 }, { "entropy": 5.706965208053589, "epoch": 2.244621668936005, "grad_norm": 1.21875, "learning_rate": 0.0004490890000470266, "loss": 4.9453, "mean_token_accuracy": 0.20820437520742416, "num_tokens": 50046461.0, "step": 28850 }, { "entropy": 5.59414849281311, "epoch": 2.245010698307722, "grad_norm": 1.171875, "learning_rate": 0.00044907144043438265, "loss": 4.9531, "mean_token_accuracy": 0.20457579791545868, "num_tokens": 50055087.0, "step": 28855 }, { "entropy": 5.6637248516082765, "epoch": 2.2453997276794397, "grad_norm": 1.1015625, "learning_rate": 0.0004490538781804816, "loss": 4.9722, "mean_token_accuracy": 0.20287902355194093, "num_tokens": 50064802.0, "step": 28860 }, { "entropy": 5.721163654327393, "epoch": 2.2457887570511574, "grad_norm": 1.15625, "learning_rate": 0.00044903631328559, "loss": 5.0728, "mean_token_accuracy": 0.19541071802377702, "num_tokens": 50073617.0, "step": 28865 }, { "entropy": 5.642386865615845, "epoch": 2.246177786422875, "grad_norm": 1.1796875, "learning_rate": 0.00044901874574997444, "loss": 4.9164, "mean_token_accuracy": 0.21159314215183259, "num_tokens": 50081705.0, "step": 28870 }, { "entropy": 5.57199912071228, "epoch": 2.2465668157945924, "grad_norm": 1.1171875, "learning_rate": 0.00044900117557390137, "loss": 4.9109, "mean_token_accuracy": 0.21109004318714142, "num_tokens": 50089982.0, "step": 28875 }, { "entropy": 5.612879991531372, "epoch": 2.24695584516631, "grad_norm": 1.1484375, "learning_rate": 0.00044898360275763733, "loss": 4.9246, "mean_token_accuracy": 0.21332501769065856, "num_tokens": 50098837.0, "step": 28880 }, { "entropy": 5.695000505447387, "epoch": 2.247344874538028, "grad_norm": 1.296875, "learning_rate": 0.00044896602730144905, "loss": 5.022, "mean_token_accuracy": 0.1956079587340355, "num_tokens": 50108109.0, "step": 28885 }, { "entropy": 5.612943506240844, "epoch": 2.247733903909745, "grad_norm": 1.1796875, "learning_rate": 0.00044894844920560323, "loss": 4.9309, "mean_token_accuracy": 0.20680210292339324, "num_tokens": 50116758.0, "step": 28890 }, { "entropy": 5.6531096458435055, "epoch": 2.2481229332814627, "grad_norm": 1.203125, "learning_rate": 0.0004489308684703666, "loss": 4.948, "mean_token_accuracy": 0.20964026898145677, "num_tokens": 50125014.0, "step": 28895 }, { "entropy": 5.715013647079468, "epoch": 2.2485119626531804, "grad_norm": 1.3359375, "learning_rate": 0.0004489132850960059, "loss": 5.1055, "mean_token_accuracy": 0.1944926053285599, "num_tokens": 50132829.0, "step": 28900 }, { "entropy": 5.635134077072143, "epoch": 2.2489009920248977, "grad_norm": 1.2578125, "learning_rate": 0.0004488956990827878, "loss": 4.9421, "mean_token_accuracy": 0.20699441879987718, "num_tokens": 50141161.0, "step": 28905 }, { "entropy": 5.635026216506958, "epoch": 2.2492900213966154, "grad_norm": 1.0859375, "learning_rate": 0.0004488781104309793, "loss": 4.9433, "mean_token_accuracy": 0.20617321878671646, "num_tokens": 50150356.0, "step": 28910 }, { "entropy": 5.608652782440186, "epoch": 2.249679050768333, "grad_norm": 1.1796875, "learning_rate": 0.00044886051914084726, "loss": 4.9222, "mean_token_accuracy": 0.21375665813684464, "num_tokens": 50159235.0, "step": 28915 }, { "entropy": 5.655436229705811, "epoch": 2.2500680801400508, "grad_norm": 1.0859375, "learning_rate": 0.00044884292521265846, "loss": 4.9654, "mean_token_accuracy": 0.2000218391418457, "num_tokens": 50168420.0, "step": 28920 }, { "entropy": 5.648804759979248, "epoch": 2.250457109511768, "grad_norm": 1.171875, "learning_rate": 0.0004488253286466801, "loss": 4.9116, "mean_token_accuracy": 0.21292107850313186, "num_tokens": 50177432.0, "step": 28925 }, { "entropy": 5.763665866851807, "epoch": 2.2508461388834857, "grad_norm": 1.28125, "learning_rate": 0.00044880772944317905, "loss": 5.042, "mean_token_accuracy": 0.20566439330577851, "num_tokens": 50185610.0, "step": 28930 }, { "entropy": 5.688184309005737, "epoch": 2.2512351682552034, "grad_norm": 1.25, "learning_rate": 0.00044879012760242224, "loss": 4.9857, "mean_token_accuracy": 0.2054459571838379, "num_tokens": 50194129.0, "step": 28935 }, { "entropy": 5.6408792495727536, "epoch": 2.2516241976269207, "grad_norm": 1.234375, "learning_rate": 0.00044877252312467694, "loss": 4.9673, "mean_token_accuracy": 0.20717571973800658, "num_tokens": 50202732.0, "step": 28940 }, { "entropy": 5.6717921733856205, "epoch": 2.2520132269986384, "grad_norm": 1.171875, "learning_rate": 0.0004487549160102101, "loss": 5.0398, "mean_token_accuracy": 0.1972149655222893, "num_tokens": 50211060.0, "step": 28945 }, { "entropy": 5.733799839019776, "epoch": 2.252402256370356, "grad_norm": 1.2109375, "learning_rate": 0.00044873730625928914, "loss": 5.097, "mean_token_accuracy": 0.20007816702127457, "num_tokens": 50220664.0, "step": 28950 }, { "entropy": 5.737061309814453, "epoch": 2.2527912857420738, "grad_norm": 1.203125, "learning_rate": 0.00044871969387218094, "loss": 4.9267, "mean_token_accuracy": 0.2076158806681633, "num_tokens": 50229425.0, "step": 28955 }, { "entropy": 5.674380588531494, "epoch": 2.253180315113791, "grad_norm": 1.234375, "learning_rate": 0.000448702078849153, "loss": 5.0508, "mean_token_accuracy": 0.1962573930621147, "num_tokens": 50237992.0, "step": 28960 }, { "entropy": 5.5988188743591305, "epoch": 2.2535693444855087, "grad_norm": 1.109375, "learning_rate": 0.00044868446119047234, "loss": 4.9725, "mean_token_accuracy": 0.20356984585523605, "num_tokens": 50246480.0, "step": 28965 }, { "entropy": 5.6960889339447025, "epoch": 2.253958373857226, "grad_norm": 1.2109375, "learning_rate": 0.0004486668408964065, "loss": 4.9935, "mean_token_accuracy": 0.19714525938034058, "num_tokens": 50256250.0, "step": 28970 }, { "entropy": 5.63188591003418, "epoch": 2.2543474032289437, "grad_norm": 1.234375, "learning_rate": 0.0004486492179672228, "loss": 5.0057, "mean_token_accuracy": 0.2085650682449341, "num_tokens": 50265126.0, "step": 28975 }, { "entropy": 5.625449132919312, "epoch": 2.2547364326006614, "grad_norm": 1.2265625, "learning_rate": 0.00044863159240318863, "loss": 4.931, "mean_token_accuracy": 0.20666096955537797, "num_tokens": 50273636.0, "step": 28980 }, { "entropy": 5.72828860282898, "epoch": 2.255125461972379, "grad_norm": 1.28125, "learning_rate": 0.0004486139642045714, "loss": 5.0726, "mean_token_accuracy": 0.1994878277182579, "num_tokens": 50281971.0, "step": 28985 }, { "entropy": 5.707199335098267, "epoch": 2.2555144913440963, "grad_norm": 1.21875, "learning_rate": 0.0004485963333716385, "loss": 4.9699, "mean_token_accuracy": 0.2053772211074829, "num_tokens": 50291108.0, "step": 28990 }, { "entropy": 5.700412845611572, "epoch": 2.255903520715814, "grad_norm": 1.1640625, "learning_rate": 0.0004485786999046576, "loss": 5.0021, "mean_token_accuracy": 0.2057879537343979, "num_tokens": 50300153.0, "step": 28995 }, { "entropy": 5.652979230880737, "epoch": 2.2562925500875317, "grad_norm": 1.1640625, "learning_rate": 0.00044856106380389624, "loss": 4.9619, "mean_token_accuracy": 0.20744085013866426, "num_tokens": 50308887.0, "step": 29000 }, { "entropy": 5.597199583053589, "epoch": 2.256681579459249, "grad_norm": 1.203125, "learning_rate": 0.000448543425069622, "loss": 4.9208, "mean_token_accuracy": 0.21122995316982268, "num_tokens": 50316774.0, "step": 29005 }, { "entropy": 5.669611978530884, "epoch": 2.2570706088309667, "grad_norm": 1.1484375, "learning_rate": 0.0004485257837021025, "loss": 5.0513, "mean_token_accuracy": 0.20373129546642305, "num_tokens": 50325943.0, "step": 29010 }, { "entropy": 5.706617116928101, "epoch": 2.2574596382026844, "grad_norm": 1.171875, "learning_rate": 0.00044850813970160534, "loss": 5.0214, "mean_token_accuracy": 0.20829411447048188, "num_tokens": 50335043.0, "step": 29015 }, { "entropy": 5.726704168319702, "epoch": 2.257848667574402, "grad_norm": 1.25, "learning_rate": 0.0004484904930683984, "loss": 4.9993, "mean_token_accuracy": 0.2086644947528839, "num_tokens": 50343108.0, "step": 29020 }, { "entropy": 5.619496583938599, "epoch": 2.2582376969461193, "grad_norm": 1.21875, "learning_rate": 0.0004484728438027494, "loss": 4.9575, "mean_token_accuracy": 0.20237225592136382, "num_tokens": 50352177.0, "step": 29025 }, { "entropy": 5.659099388122558, "epoch": 2.258626726317837, "grad_norm": 1.2421875, "learning_rate": 0.0004484551919049261, "loss": 4.9141, "mean_token_accuracy": 0.21082679629325868, "num_tokens": 50360986.0, "step": 29030 }, { "entropy": 5.731006336212158, "epoch": 2.2590157556895547, "grad_norm": 1.2578125, "learning_rate": 0.00044843753737519625, "loss": 5.0435, "mean_token_accuracy": 0.194256229698658, "num_tokens": 50369871.0, "step": 29035 }, { "entropy": 5.6692193984985355, "epoch": 2.259404785061272, "grad_norm": 1.234375, "learning_rate": 0.0004484198802138279, "loss": 4.9722, "mean_token_accuracy": 0.20525528341531754, "num_tokens": 50378482.0, "step": 29040 }, { "entropy": 5.658724546432495, "epoch": 2.2597938144329897, "grad_norm": 1.25, "learning_rate": 0.0004484022204210889, "loss": 4.9432, "mean_token_accuracy": 0.21005659848451613, "num_tokens": 50387343.0, "step": 29045 }, { "entropy": 5.583187532424927, "epoch": 2.2601828438047074, "grad_norm": 1.140625, "learning_rate": 0.00044838455799724717, "loss": 4.8885, "mean_token_accuracy": 0.20845258235931396, "num_tokens": 50395704.0, "step": 29050 }, { "entropy": 5.701115083694458, "epoch": 2.260571873176425, "grad_norm": 1.25, "learning_rate": 0.00044836689294257075, "loss": 4.9946, "mean_token_accuracy": 0.2048500195145607, "num_tokens": 50404719.0, "step": 29055 }, { "entropy": 5.6695143699646, "epoch": 2.2609609025481423, "grad_norm": 1.171875, "learning_rate": 0.0004483492252573276, "loss": 4.9334, "mean_token_accuracy": 0.20412212312221528, "num_tokens": 50413167.0, "step": 29060 }, { "entropy": 5.718425273895264, "epoch": 2.26134993191986, "grad_norm": 1.1640625, "learning_rate": 0.000448331554941786, "loss": 5.1356, "mean_token_accuracy": 0.19580833613872528, "num_tokens": 50422609.0, "step": 29065 }, { "entropy": 5.665090751647949, "epoch": 2.2617389612915777, "grad_norm": 1.140625, "learning_rate": 0.00044831388199621385, "loss": 4.9969, "mean_token_accuracy": 0.20689670294523238, "num_tokens": 50431841.0, "step": 29070 }, { "entropy": 5.632295608520508, "epoch": 2.262127990663295, "grad_norm": 1.1875, "learning_rate": 0.00044829620642087946, "loss": 4.966, "mean_token_accuracy": 0.20480636209249498, "num_tokens": 50440625.0, "step": 29075 }, { "entropy": 5.6660562515258786, "epoch": 2.2625170200350126, "grad_norm": 1.1796875, "learning_rate": 0.0004482785282160509, "loss": 5.0191, "mean_token_accuracy": 0.19362804740667344, "num_tokens": 50449577.0, "step": 29080 }, { "entropy": 5.714691209793091, "epoch": 2.2629060494067303, "grad_norm": 1.2421875, "learning_rate": 0.00044826084738199657, "loss": 5.022, "mean_token_accuracy": 0.20577373206615449, "num_tokens": 50457817.0, "step": 29085 }, { "entropy": 5.6106161117553714, "epoch": 2.2632950787784476, "grad_norm": 1.1484375, "learning_rate": 0.00044824316391898464, "loss": 4.9614, "mean_token_accuracy": 0.20961310863494872, "num_tokens": 50466215.0, "step": 29090 }, { "entropy": 5.609082794189453, "epoch": 2.2636841081501653, "grad_norm": 1.2109375, "learning_rate": 0.00044822547782728334, "loss": 5.0231, "mean_token_accuracy": 0.2073902204632759, "num_tokens": 50475415.0, "step": 29095 }, { "entropy": 5.6919639110565186, "epoch": 2.264073137521883, "grad_norm": 1.15625, "learning_rate": 0.0004482077891071612, "loss": 4.992, "mean_token_accuracy": 0.20399350970983504, "num_tokens": 50483883.0, "step": 29100 }, { "entropy": 5.669452810287476, "epoch": 2.2644621668936002, "grad_norm": 1.1484375, "learning_rate": 0.00044819009775888655, "loss": 4.9117, "mean_token_accuracy": 0.21183478087186813, "num_tokens": 50493541.0, "step": 29105 }, { "entropy": 5.636380529403686, "epoch": 2.264851196265318, "grad_norm": 1.25, "learning_rate": 0.00044817240378272784, "loss": 5.0321, "mean_token_accuracy": 0.20962298810482025, "num_tokens": 50502063.0, "step": 29110 }, { "entropy": 5.623637008666992, "epoch": 2.2652402256370356, "grad_norm": 1.140625, "learning_rate": 0.00044815470717895345, "loss": 4.8656, "mean_token_accuracy": 0.21597001999616622, "num_tokens": 50510956.0, "step": 29115 }, { "entropy": 5.716809415817261, "epoch": 2.2656292550087533, "grad_norm": 1.3125, "learning_rate": 0.0004481370079478321, "loss": 5.0081, "mean_token_accuracy": 0.20452577769756317, "num_tokens": 50519383.0, "step": 29120 }, { "entropy": 5.662494039535522, "epoch": 2.2660182843804706, "grad_norm": 1.1484375, "learning_rate": 0.0004481193060896322, "loss": 4.977, "mean_token_accuracy": 0.20429450422525405, "num_tokens": 50528172.0, "step": 29125 }, { "entropy": 5.639087343215943, "epoch": 2.2664073137521883, "grad_norm": 1.1640625, "learning_rate": 0.0004481016016046223, "loss": 4.9787, "mean_token_accuracy": 0.20446632504463197, "num_tokens": 50536720.0, "step": 29130 }, { "entropy": 5.616045141220093, "epoch": 2.266796343123906, "grad_norm": 1.2265625, "learning_rate": 0.0004480838944930712, "loss": 4.9111, "mean_token_accuracy": 0.20678861141204835, "num_tokens": 50545502.0, "step": 29135 }, { "entropy": 5.62020354270935, "epoch": 2.2671853724956232, "grad_norm": 1.2734375, "learning_rate": 0.0004480661847552474, "loss": 4.9237, "mean_token_accuracy": 0.20732140988111497, "num_tokens": 50553262.0, "step": 29140 }, { "entropy": 5.594115591049194, "epoch": 2.267574401867341, "grad_norm": 1.203125, "learning_rate": 0.0004480484723914198, "loss": 4.9535, "mean_token_accuracy": 0.20471178293228148, "num_tokens": 50562153.0, "step": 29145 }, { "entropy": 5.653083038330078, "epoch": 2.2679634312390586, "grad_norm": 1.1875, "learning_rate": 0.0004480307574018571, "loss": 4.9439, "mean_token_accuracy": 0.20297963470220565, "num_tokens": 50571476.0, "step": 29150 }, { "entropy": 5.69712381362915, "epoch": 2.2683524606107763, "grad_norm": 1.171875, "learning_rate": 0.000448013039786828, "loss": 5.0734, "mean_token_accuracy": 0.19496839493513107, "num_tokens": 50579371.0, "step": 29155 }, { "entropy": 5.624006080627441, "epoch": 2.2687414899824936, "grad_norm": 1.3046875, "learning_rate": 0.00044799531954660133, "loss": 4.9465, "mean_token_accuracy": 0.20544691979885102, "num_tokens": 50588214.0, "step": 29160 }, { "entropy": 5.592681980133056, "epoch": 2.2691305193542113, "grad_norm": 1.1484375, "learning_rate": 0.0004479775966814461, "loss": 5.0273, "mean_token_accuracy": 0.20001684725284577, "num_tokens": 50596686.0, "step": 29165 }, { "entropy": 5.658980464935302, "epoch": 2.269519548725929, "grad_norm": 1.2421875, "learning_rate": 0.00044795987119163115, "loss": 4.9093, "mean_token_accuracy": 0.20652946084737778, "num_tokens": 50604843.0, "step": 29170 }, { "entropy": 5.701581954956055, "epoch": 2.2699085780976462, "grad_norm": 1.265625, "learning_rate": 0.0004479421430774255, "loss": 4.9794, "mean_token_accuracy": 0.20385261625051498, "num_tokens": 50613722.0, "step": 29175 }, { "entropy": 5.6947612285614015, "epoch": 2.270297607469364, "grad_norm": 1.15625, "learning_rate": 0.0004479244123390981, "loss": 5.0301, "mean_token_accuracy": 0.2040952757000923, "num_tokens": 50622708.0, "step": 29180 }, { "entropy": 5.654938077926635, "epoch": 2.2706866368410816, "grad_norm": 1.1640625, "learning_rate": 0.00044790667897691796, "loss": 4.9177, "mean_token_accuracy": 0.20391227900981904, "num_tokens": 50630516.0, "step": 29185 }, { "entropy": 5.6324304103851315, "epoch": 2.271075666212799, "grad_norm": 1.203125, "learning_rate": 0.00044788894299115415, "loss": 4.9281, "mean_token_accuracy": 0.2124847486615181, "num_tokens": 50639695.0, "step": 29190 }, { "entropy": 5.646047687530517, "epoch": 2.2714646955845166, "grad_norm": 1.234375, "learning_rate": 0.0004478712043820758, "loss": 5.0083, "mean_token_accuracy": 0.2068116158246994, "num_tokens": 50648600.0, "step": 29195 }, { "entropy": 5.626090240478516, "epoch": 2.2718537249562343, "grad_norm": 1.3125, "learning_rate": 0.0004478534631499521, "loss": 4.9176, "mean_token_accuracy": 0.21525303274393082, "num_tokens": 50657020.0, "step": 29200 }, { "entropy": 5.687259197235107, "epoch": 2.2722427543279515, "grad_norm": 1.21875, "learning_rate": 0.00044783571929505223, "loss": 4.9624, "mean_token_accuracy": 0.2123490482568741, "num_tokens": 50665909.0, "step": 29205 }, { "entropy": 5.61186146736145, "epoch": 2.2726317836996692, "grad_norm": 1.140625, "learning_rate": 0.0004478179728176454, "loss": 4.8718, "mean_token_accuracy": 0.21285301595926284, "num_tokens": 50674152.0, "step": 29210 }, { "entropy": 5.576617860794068, "epoch": 2.273020813071387, "grad_norm": 1.21875, "learning_rate": 0.0004478002237180009, "loss": 4.8613, "mean_token_accuracy": 0.21440641582012177, "num_tokens": 50682447.0, "step": 29215 }, { "entropy": 5.603819513320923, "epoch": 2.2734098424431046, "grad_norm": 1.1640625, "learning_rate": 0.000447782471996388, "loss": 4.9679, "mean_token_accuracy": 0.2060973435640335, "num_tokens": 50691253.0, "step": 29220 }, { "entropy": 5.606770277023315, "epoch": 2.273798871814822, "grad_norm": 1.203125, "learning_rate": 0.0004477647176530762, "loss": 4.999, "mean_token_accuracy": 0.20557631999254228, "num_tokens": 50700336.0, "step": 29225 }, { "entropy": 5.6338193893432615, "epoch": 2.2741879011865396, "grad_norm": 1.2421875, "learning_rate": 0.0004477469606883347, "loss": 4.906, "mean_token_accuracy": 0.21142034381628036, "num_tokens": 50709231.0, "step": 29230 }, { "entropy": 5.604260683059692, "epoch": 2.2745769305582573, "grad_norm": 1.15625, "learning_rate": 0.0004477292011024331, "loss": 4.8738, "mean_token_accuracy": 0.21137246787548064, "num_tokens": 50718604.0, "step": 29235 }, { "entropy": 5.643488550186158, "epoch": 2.2749659599299745, "grad_norm": 1.1328125, "learning_rate": 0.00044771143889564075, "loss": 4.9567, "mean_token_accuracy": 0.20687718987464904, "num_tokens": 50727146.0, "step": 29240 }, { "entropy": 5.58636245727539, "epoch": 2.275354989301692, "grad_norm": 1.1328125, "learning_rate": 0.00044769367406822727, "loss": 4.9617, "mean_token_accuracy": 0.2096048563718796, "num_tokens": 50736672.0, "step": 29245 }, { "entropy": 5.627687692642212, "epoch": 2.27574401867341, "grad_norm": 1.1875, "learning_rate": 0.0004476759066204621, "loss": 4.9716, "mean_token_accuracy": 0.20254482328891754, "num_tokens": 50744609.0, "step": 29250 }, { "entropy": 5.6986829280853275, "epoch": 2.2761330480451276, "grad_norm": 1.1875, "learning_rate": 0.0004476581365526149, "loss": 4.9078, "mean_token_accuracy": 0.21126613169908523, "num_tokens": 50753286.0, "step": 29255 }, { "entropy": 5.65384612083435, "epoch": 2.276522077416845, "grad_norm": 1.265625, "learning_rate": 0.0004476403638649553, "loss": 5.0104, "mean_token_accuracy": 0.19101709872484207, "num_tokens": 50761554.0, "step": 29260 }, { "entropy": 5.584729909896851, "epoch": 2.2769111067885626, "grad_norm": 1.1953125, "learning_rate": 0.00044762258855775294, "loss": 4.9505, "mean_token_accuracy": 0.20428793728351594, "num_tokens": 50770628.0, "step": 29265 }, { "entropy": 5.658384323120117, "epoch": 2.2773001361602803, "grad_norm": 1.140625, "learning_rate": 0.00044760481063127754, "loss": 4.9178, "mean_token_accuracy": 0.2094045490026474, "num_tokens": 50779159.0, "step": 29270 }, { "entropy": 5.748681259155274, "epoch": 2.2776891655319975, "grad_norm": 1.328125, "learning_rate": 0.000447587030085799, "loss": 4.9944, "mean_token_accuracy": 0.20831007957458497, "num_tokens": 50787192.0, "step": 29275 }, { "entropy": 5.594430685043335, "epoch": 2.278078194903715, "grad_norm": 1.1796875, "learning_rate": 0.00044756924692158684, "loss": 4.8096, "mean_token_accuracy": 0.21871258318424225, "num_tokens": 50795441.0, "step": 29280 }, { "entropy": 5.689841413497925, "epoch": 2.278467224275433, "grad_norm": 1.3515625, "learning_rate": 0.0004475514611389111, "loss": 4.9386, "mean_token_accuracy": 0.2078137919306755, "num_tokens": 50804178.0, "step": 29285 }, { "entropy": 5.732893085479736, "epoch": 2.2788562536471506, "grad_norm": 1.2109375, "learning_rate": 0.0004475336727380415, "loss": 5.0765, "mean_token_accuracy": 0.20614046454429627, "num_tokens": 50813155.0, "step": 29290 }, { "entropy": 5.688362884521484, "epoch": 2.279245283018868, "grad_norm": 1.203125, "learning_rate": 0.0004475158817192481, "loss": 4.9577, "mean_token_accuracy": 0.21584997624158858, "num_tokens": 50822131.0, "step": 29295 }, { "entropy": 5.6883501529693605, "epoch": 2.2796343123905856, "grad_norm": 1.0859375, "learning_rate": 0.00044749808808280077, "loss": 5.0131, "mean_token_accuracy": 0.2065530776977539, "num_tokens": 50830821.0, "step": 29300 }, { "entropy": 5.641874074935913, "epoch": 2.280023341762303, "grad_norm": 1.21875, "learning_rate": 0.00044748029182896956, "loss": 4.9918, "mean_token_accuracy": 0.20067632496356963, "num_tokens": 50839928.0, "step": 29305 }, { "entropy": 5.659412860870361, "epoch": 2.2804123711340205, "grad_norm": 1.1640625, "learning_rate": 0.0004474624929580243, "loss": 4.9177, "mean_token_accuracy": 0.21475536227226258, "num_tokens": 50848674.0, "step": 29310 }, { "entropy": 5.6953552722930905, "epoch": 2.280801400505738, "grad_norm": 1.1484375, "learning_rate": 0.0004474446914702354, "loss": 5.018, "mean_token_accuracy": 0.20654019713401794, "num_tokens": 50857376.0, "step": 29315 }, { "entropy": 5.715448474884033, "epoch": 2.281190429877456, "grad_norm": 1.2109375, "learning_rate": 0.0004474268873658727, "loss": 5.0755, "mean_token_accuracy": 0.1939623937010765, "num_tokens": 50866214.0, "step": 29320 }, { "entropy": 5.663600587844849, "epoch": 2.281579459249173, "grad_norm": 1.25, "learning_rate": 0.0004474090806452064, "loss": 4.9256, "mean_token_accuracy": 0.21003350764513015, "num_tokens": 50875151.0, "step": 29325 }, { "entropy": 5.6557701587677, "epoch": 2.281968488620891, "grad_norm": 1.2890625, "learning_rate": 0.00044739127130850675, "loss": 4.9208, "mean_token_accuracy": 0.20873579978942872, "num_tokens": 50882600.0, "step": 29330 }, { "entropy": 5.628037929534912, "epoch": 2.2823575179926086, "grad_norm": 1.1171875, "learning_rate": 0.00044737345935604397, "loss": 4.9408, "mean_token_accuracy": 0.20092481672763823, "num_tokens": 50891348.0, "step": 29335 }, { "entropy": 5.602987289428711, "epoch": 2.282746547364326, "grad_norm": 1.203125, "learning_rate": 0.0004473556447880883, "loss": 4.9183, "mean_token_accuracy": 0.20732947140932084, "num_tokens": 50900452.0, "step": 29340 }, { "entropy": 5.644867181777954, "epoch": 2.2831355767360435, "grad_norm": 1.15625, "learning_rate": 0.00044733782760490997, "loss": 4.99, "mean_token_accuracy": 0.2038433775305748, "num_tokens": 50909599.0, "step": 29345 }, { "entropy": 5.652254295349121, "epoch": 2.283524606107761, "grad_norm": 1.2109375, "learning_rate": 0.0004473200078067795, "loss": 4.9377, "mean_token_accuracy": 0.20353127717971803, "num_tokens": 50918864.0, "step": 29350 }, { "entropy": 5.649256896972656, "epoch": 2.283913635479479, "grad_norm": 1.1171875, "learning_rate": 0.00044730218539396717, "loss": 5.0462, "mean_token_accuracy": 0.20378716737031938, "num_tokens": 50927851.0, "step": 29355 }, { "entropy": 5.664357137680054, "epoch": 2.284302664851196, "grad_norm": 1.15625, "learning_rate": 0.0004472843603667434, "loss": 4.9851, "mean_token_accuracy": 0.21372474133968353, "num_tokens": 50936974.0, "step": 29360 }, { "entropy": 5.757056379318238, "epoch": 2.284691694222914, "grad_norm": 1.1171875, "learning_rate": 0.00044726653272537866, "loss": 5.0563, "mean_token_accuracy": 0.2000075623393059, "num_tokens": 50945482.0, "step": 29365 }, { "entropy": 5.760507822036743, "epoch": 2.2850807235946315, "grad_norm": 1.3515625, "learning_rate": 0.0004472487024701435, "loss": 5.0858, "mean_token_accuracy": 0.19825949221849443, "num_tokens": 50954961.0, "step": 29370 }, { "entropy": 5.688434171676636, "epoch": 2.285469752966349, "grad_norm": 1.234375, "learning_rate": 0.0004472308696013085, "loss": 4.9357, "mean_token_accuracy": 0.20900008380413054, "num_tokens": 50963666.0, "step": 29375 }, { "entropy": 5.65955286026001, "epoch": 2.2858587823380665, "grad_norm": 1.1328125, "learning_rate": 0.0004472130341191441, "loss": 4.9269, "mean_token_accuracy": 0.20942501574754716, "num_tokens": 50972761.0, "step": 29380 }, { "entropy": 5.676043176651001, "epoch": 2.286247811709784, "grad_norm": 1.1328125, "learning_rate": 0.0004471951960239211, "loss": 4.9731, "mean_token_accuracy": 0.21027719229459763, "num_tokens": 50981755.0, "step": 29385 }, { "entropy": 5.696746730804444, "epoch": 2.286636841081502, "grad_norm": 1.1953125, "learning_rate": 0.00044717735531591, "loss": 4.9661, "mean_token_accuracy": 0.20573717653751372, "num_tokens": 50990381.0, "step": 29390 }, { "entropy": 5.638506841659546, "epoch": 2.287025870453219, "grad_norm": 1.1796875, "learning_rate": 0.00044715951199538156, "loss": 4.9512, "mean_token_accuracy": 0.20613723546266555, "num_tokens": 50999076.0, "step": 29395 }, { "entropy": 5.62277045249939, "epoch": 2.287414899824937, "grad_norm": 1.1015625, "learning_rate": 0.00044714166606260657, "loss": 4.9192, "mean_token_accuracy": 0.21194605976343156, "num_tokens": 51007626.0, "step": 29400 }, { "entropy": 5.630076932907104, "epoch": 2.2878039291966545, "grad_norm": 1.1875, "learning_rate": 0.0004471238175178559, "loss": 4.9331, "mean_token_accuracy": 0.20930130779743195, "num_tokens": 51016120.0, "step": 29405 }, { "entropy": 5.646851444244385, "epoch": 2.288192958568372, "grad_norm": 1.2265625, "learning_rate": 0.0004471059663614002, "loss": 4.9807, "mean_token_accuracy": 0.20247174054384232, "num_tokens": 51024558.0, "step": 29410 }, { "entropy": 5.611168098449707, "epoch": 2.2885819879400895, "grad_norm": 1.3984375, "learning_rate": 0.0004470881125935103, "loss": 4.9049, "mean_token_accuracy": 0.21367865204811096, "num_tokens": 51032828.0, "step": 29415 }, { "entropy": 5.690545320510864, "epoch": 2.288971017311807, "grad_norm": 1.15625, "learning_rate": 0.00044707025621445735, "loss": 5.0497, "mean_token_accuracy": 0.2052918031811714, "num_tokens": 51040966.0, "step": 29420 }, { "entropy": 5.6816990852355955, "epoch": 2.2893600466835244, "grad_norm": 1.2265625, "learning_rate": 0.00044705239722451194, "loss": 5.033, "mean_token_accuracy": 0.20240819454193115, "num_tokens": 51049611.0, "step": 29425 }, { "entropy": 5.6392981052398685, "epoch": 2.289749076055242, "grad_norm": 1.1328125, "learning_rate": 0.00044703453562394544, "loss": 4.929, "mean_token_accuracy": 0.20599979013204575, "num_tokens": 51058446.0, "step": 29430 }, { "entropy": 5.776081323623657, "epoch": 2.29013810542696, "grad_norm": 1.2734375, "learning_rate": 0.0004470166714130286, "loss": 5.0831, "mean_token_accuracy": 0.19447289854288102, "num_tokens": 51067526.0, "step": 29435 }, { "entropy": 5.692907476425171, "epoch": 2.290527134798677, "grad_norm": 1.1875, "learning_rate": 0.00044699880459203264, "loss": 5.0141, "mean_token_accuracy": 0.2093735709786415, "num_tokens": 51076154.0, "step": 29440 }, { "entropy": 5.692427301406861, "epoch": 2.290916164170395, "grad_norm": 1.1796875, "learning_rate": 0.00044698093516122844, "loss": 5.0559, "mean_token_accuracy": 0.20358216911554336, "num_tokens": 51084845.0, "step": 29445 }, { "entropy": 5.655909681320191, "epoch": 2.2913051935421125, "grad_norm": 1.203125, "learning_rate": 0.0004469630631208874, "loss": 4.9634, "mean_token_accuracy": 0.20862861573696137, "num_tokens": 51093436.0, "step": 29450 }, { "entropy": 5.664717054367065, "epoch": 2.29169422291383, "grad_norm": 1.21875, "learning_rate": 0.0004469451884712805, "loss": 4.9677, "mean_token_accuracy": 0.20271194726228714, "num_tokens": 51102369.0, "step": 29455 }, { "entropy": 5.658638286590576, "epoch": 2.2920832522855474, "grad_norm": 1.2265625, "learning_rate": 0.0004469273112126791, "loss": 4.98, "mean_token_accuracy": 0.20381619781255722, "num_tokens": 51111335.0, "step": 29460 }, { "entropy": 5.6795759201049805, "epoch": 2.292472281657265, "grad_norm": 1.2890625, "learning_rate": 0.00044690943134535445, "loss": 5.0297, "mean_token_accuracy": 0.1995371997356415, "num_tokens": 51120161.0, "step": 29465 }, { "entropy": 5.633863067626953, "epoch": 2.292861311028983, "grad_norm": 1.203125, "learning_rate": 0.0004468915488695777, "loss": 4.962, "mean_token_accuracy": 0.2028233990073204, "num_tokens": 51128840.0, "step": 29470 }, { "entropy": 5.674533987045288, "epoch": 2.2932503404007, "grad_norm": 1.1796875, "learning_rate": 0.00044687366378562036, "loss": 4.9086, "mean_token_accuracy": 0.21068734675645828, "num_tokens": 51137321.0, "step": 29475 }, { "entropy": 5.722371530532837, "epoch": 2.293639369772418, "grad_norm": 1.2421875, "learning_rate": 0.00044685577609375373, "loss": 5.063, "mean_token_accuracy": 0.19566056728363038, "num_tokens": 51145564.0, "step": 29480 }, { "entropy": 5.658788681030273, "epoch": 2.2940283991441355, "grad_norm": 1.3046875, "learning_rate": 0.0004468378857942492, "loss": 5.0314, "mean_token_accuracy": 0.2070489838719368, "num_tokens": 51153983.0, "step": 29485 }, { "entropy": 5.598476409912109, "epoch": 2.294417428515853, "grad_norm": 1.140625, "learning_rate": 0.00044681999288737826, "loss": 4.9658, "mean_token_accuracy": 0.20144178420305253, "num_tokens": 51162547.0, "step": 29490 }, { "entropy": 5.642254495620728, "epoch": 2.2948064578875704, "grad_norm": 1.1953125, "learning_rate": 0.00044680209737341244, "loss": 4.9447, "mean_token_accuracy": 0.20773879289627076, "num_tokens": 51171268.0, "step": 29495 }, { "entropy": 5.664510345458984, "epoch": 2.295195487259288, "grad_norm": 1.1796875, "learning_rate": 0.0004467841992526233, "loss": 4.9941, "mean_token_accuracy": 0.2022454023361206, "num_tokens": 51179807.0, "step": 29500 }, { "entropy": 5.63982195854187, "epoch": 2.295584516631006, "grad_norm": 1.3359375, "learning_rate": 0.00044676629852528226, "loss": 4.9841, "mean_token_accuracy": 0.20074319690465928, "num_tokens": 51187670.0, "step": 29505 }, { "entropy": 5.728522253036499, "epoch": 2.295973546002723, "grad_norm": 1.2421875, "learning_rate": 0.00044674839519166104, "loss": 5.0883, "mean_token_accuracy": 0.1998781830072403, "num_tokens": 51196512.0, "step": 29510 }, { "entropy": 5.652633762359619, "epoch": 2.2963625753744408, "grad_norm": 1.265625, "learning_rate": 0.00044673048925203136, "loss": 4.8892, "mean_token_accuracy": 0.20725188553333282, "num_tokens": 51204985.0, "step": 29515 }, { "entropy": 5.6189874649047855, "epoch": 2.2967516047461585, "grad_norm": 1.171875, "learning_rate": 0.00044671258070666476, "loss": 4.977, "mean_token_accuracy": 0.20666809678077697, "num_tokens": 51214472.0, "step": 29520 }, { "entropy": 5.729306030273437, "epoch": 2.2971406341178757, "grad_norm": 1.1328125, "learning_rate": 0.0004466946695558331, "loss": 5.1343, "mean_token_accuracy": 0.19044889360666276, "num_tokens": 51223836.0, "step": 29525 }, { "entropy": 5.632682037353516, "epoch": 2.2975296634895934, "grad_norm": 1.34375, "learning_rate": 0.00044667675579980817, "loss": 4.9601, "mean_token_accuracy": 0.20354359745979309, "num_tokens": 51232060.0, "step": 29530 }, { "entropy": 5.621022653579712, "epoch": 2.297918692861311, "grad_norm": 1.2578125, "learning_rate": 0.0004466588394388616, "loss": 4.9336, "mean_token_accuracy": 0.2084936812520027, "num_tokens": 51240273.0, "step": 29535 }, { "entropy": 5.655084705352783, "epoch": 2.2983077222330284, "grad_norm": 1.265625, "learning_rate": 0.0004466409204732654, "loss": 4.8421, "mean_token_accuracy": 0.21260540932416916, "num_tokens": 51248892.0, "step": 29540 }, { "entropy": 5.671745109558105, "epoch": 2.298696751604746, "grad_norm": 1.1875, "learning_rate": 0.00044662299890329144, "loss": 4.9598, "mean_token_accuracy": 0.2111931025981903, "num_tokens": 51258028.0, "step": 29545 }, { "entropy": 5.627292537689209, "epoch": 2.2990857809764638, "grad_norm": 1.1328125, "learning_rate": 0.0004466050747292116, "loss": 4.9282, "mean_token_accuracy": 0.20538226068019866, "num_tokens": 51266624.0, "step": 29550 }, { "entropy": 5.6389298915863035, "epoch": 2.2994748103481815, "grad_norm": 1.2890625, "learning_rate": 0.000446587147951298, "loss": 5.0144, "mean_token_accuracy": 0.19966224431991578, "num_tokens": 51275094.0, "step": 29555 }, { "entropy": 5.625348806381226, "epoch": 2.2998638397198987, "grad_norm": 1.203125, "learning_rate": 0.0004465692185698224, "loss": 5.0159, "mean_token_accuracy": 0.20186548084020614, "num_tokens": 51283675.0, "step": 29560 }, { "entropy": 5.69339075088501, "epoch": 2.3002528690916164, "grad_norm": 1.140625, "learning_rate": 0.00044655128658505717, "loss": 5.0085, "mean_token_accuracy": 0.20369889587163925, "num_tokens": 51292208.0, "step": 29565 }, { "entropy": 5.613300418853759, "epoch": 2.300641898463334, "grad_norm": 1.15625, "learning_rate": 0.0004465333519972741, "loss": 4.9162, "mean_token_accuracy": 0.2135475441813469, "num_tokens": 51301055.0, "step": 29570 }, { "entropy": 5.693405961990356, "epoch": 2.3010309278350514, "grad_norm": 1.1875, "learning_rate": 0.0004465154148067454, "loss": 5.0851, "mean_token_accuracy": 0.19638503938913346, "num_tokens": 51310207.0, "step": 29575 }, { "entropy": 5.601260423660278, "epoch": 2.301419957206769, "grad_norm": 1.15625, "learning_rate": 0.00044649747501374336, "loss": 4.8714, "mean_token_accuracy": 0.20818833708763124, "num_tokens": 51319284.0, "step": 29580 }, { "entropy": 5.764244794845581, "epoch": 2.3018089865784868, "grad_norm": 1.1875, "learning_rate": 0.0004464795326185401, "loss": 5.0513, "mean_token_accuracy": 0.19652780890464783, "num_tokens": 51328217.0, "step": 29585 }, { "entropy": 5.7103053569793705, "epoch": 2.3021980159502045, "grad_norm": 1.21875, "learning_rate": 0.0004464615876214078, "loss": 5.0098, "mean_token_accuracy": 0.2044257253408432, "num_tokens": 51336517.0, "step": 29590 }, { "entropy": 5.627273750305176, "epoch": 2.3025870453219217, "grad_norm": 1.2578125, "learning_rate": 0.0004464436400226188, "loss": 5.0052, "mean_token_accuracy": 0.20412445664405823, "num_tokens": 51344776.0, "step": 29595 }, { "entropy": 5.557971334457397, "epoch": 2.3029760746936394, "grad_norm": 1.1875, "learning_rate": 0.0004464256898224455, "loss": 4.8922, "mean_token_accuracy": 0.21170520931482315, "num_tokens": 51353315.0, "step": 29600 }, { "entropy": 5.643322706222534, "epoch": 2.303365104065357, "grad_norm": 1.2734375, "learning_rate": 0.0004464077370211602, "loss": 4.9977, "mean_token_accuracy": 0.20326978862285613, "num_tokens": 51362204.0, "step": 29605 }, { "entropy": 5.572416639328003, "epoch": 2.3037541334370744, "grad_norm": 1.171875, "learning_rate": 0.00044638978161903533, "loss": 4.825, "mean_token_accuracy": 0.20783982127904893, "num_tokens": 51370869.0, "step": 29610 }, { "entropy": 5.634156799316406, "epoch": 2.304143162808792, "grad_norm": 1.1328125, "learning_rate": 0.0004463718236163433, "loss": 4.9527, "mean_token_accuracy": 0.20529302060604096, "num_tokens": 51379548.0, "step": 29615 }, { "entropy": 5.677594804763794, "epoch": 2.3045321921805098, "grad_norm": 1.1796875, "learning_rate": 0.00044635386301335666, "loss": 5.0307, "mean_token_accuracy": 0.19620249122381211, "num_tokens": 51388095.0, "step": 29620 }, { "entropy": 5.676456451416016, "epoch": 2.304921221552227, "grad_norm": 1.2578125, "learning_rate": 0.0004463358998103478, "loss": 4.9876, "mean_token_accuracy": 0.19870616495609283, "num_tokens": 51397195.0, "step": 29625 }, { "entropy": 5.715763235092163, "epoch": 2.3053102509239447, "grad_norm": 1.21875, "learning_rate": 0.0004463179340075894, "loss": 5.0451, "mean_token_accuracy": 0.2000088080763817, "num_tokens": 51406012.0, "step": 29630 }, { "entropy": 5.664521884918213, "epoch": 2.3056992802956624, "grad_norm": 1.171875, "learning_rate": 0.0004462999656053541, "loss": 4.8836, "mean_token_accuracy": 0.22030634433031082, "num_tokens": 51414059.0, "step": 29635 }, { "entropy": 5.625604963302612, "epoch": 2.3060883096673797, "grad_norm": 1.2109375, "learning_rate": 0.00044628199460391445, "loss": 4.9937, "mean_token_accuracy": 0.20533144026994704, "num_tokens": 51422444.0, "step": 29640 }, { "entropy": 5.589230680465699, "epoch": 2.3064773390390974, "grad_norm": 1.1484375, "learning_rate": 0.00044626402100354307, "loss": 4.926, "mean_token_accuracy": 0.19999572932720183, "num_tokens": 51431858.0, "step": 29645 }, { "entropy": 5.615210771560669, "epoch": 2.306866368410815, "grad_norm": 1.2109375, "learning_rate": 0.0004462460448045129, "loss": 4.8829, "mean_token_accuracy": 0.21358368545770645, "num_tokens": 51440295.0, "step": 29650 }, { "entropy": 5.67876935005188, "epoch": 2.3072553977825327, "grad_norm": 1.1953125, "learning_rate": 0.00044622806600709645, "loss": 4.9951, "mean_token_accuracy": 0.20233010798692702, "num_tokens": 51448949.0, "step": 29655 }, { "entropy": 5.6314489364624025, "epoch": 2.30764442715425, "grad_norm": 1.265625, "learning_rate": 0.0004462100846115667, "loss": 4.9437, "mean_token_accuracy": 0.20391274988651276, "num_tokens": 51458228.0, "step": 29660 }, { "entropy": 5.618000316619873, "epoch": 2.3080334565259677, "grad_norm": 1.359375, "learning_rate": 0.0004461921006181964, "loss": 4.9385, "mean_token_accuracy": 0.20904507786035537, "num_tokens": 51466348.0, "step": 29665 }, { "entropy": 5.608206748962402, "epoch": 2.3084224858976854, "grad_norm": 1.1796875, "learning_rate": 0.0004461741140272584, "loss": 4.891, "mean_token_accuracy": 0.21404290050268174, "num_tokens": 51474854.0, "step": 29670 }, { "entropy": 5.726217031478882, "epoch": 2.3088115152694026, "grad_norm": 1.203125, "learning_rate": 0.0004461561248390257, "loss": 5.1439, "mean_token_accuracy": 0.19199473410844803, "num_tokens": 51483677.0, "step": 29675 }, { "entropy": 5.671559381484985, "epoch": 2.3092005446411203, "grad_norm": 1.1796875, "learning_rate": 0.0004461381330537713, "loss": 5.0254, "mean_token_accuracy": 0.20263229608535765, "num_tokens": 51493068.0, "step": 29680 }, { "entropy": 5.740030002593994, "epoch": 2.309589574012838, "grad_norm": 1.2421875, "learning_rate": 0.000446120138671768, "loss": 4.9693, "mean_token_accuracy": 0.20346267521381378, "num_tokens": 51501299.0, "step": 29685 }, { "entropy": 5.760293626785279, "epoch": 2.3099786033845557, "grad_norm": 1.2109375, "learning_rate": 0.00044610214169328913, "loss": 5.0282, "mean_token_accuracy": 0.20377151519060135, "num_tokens": 51509806.0, "step": 29690 }, { "entropy": 5.629344701766968, "epoch": 2.310367632756273, "grad_norm": 1.1953125, "learning_rate": 0.0004460841421186075, "loss": 4.9511, "mean_token_accuracy": 0.20478152334690095, "num_tokens": 51518573.0, "step": 29695 }, { "entropy": 5.69682502746582, "epoch": 2.3107566621279907, "grad_norm": 1.1484375, "learning_rate": 0.0004460661399479963, "loss": 4.9867, "mean_token_accuracy": 0.2121780261397362, "num_tokens": 51527370.0, "step": 29700 }, { "entropy": 5.661144971847534, "epoch": 2.3111456914997084, "grad_norm": 1.1484375, "learning_rate": 0.00044604813518172876, "loss": 4.97, "mean_token_accuracy": 0.20920703709125518, "num_tokens": 51536325.0, "step": 29705 }, { "entropy": 5.737629318237305, "epoch": 2.3115347208714256, "grad_norm": 1.2421875, "learning_rate": 0.00044603012782007796, "loss": 5.0514, "mean_token_accuracy": 0.20193764120340346, "num_tokens": 51544447.0, "step": 29710 }, { "entropy": 5.644625568389893, "epoch": 2.3119237502431433, "grad_norm": 1.265625, "learning_rate": 0.0004460121178633172, "loss": 4.9458, "mean_token_accuracy": 0.20472848862409593, "num_tokens": 51552345.0, "step": 29715 }, { "entropy": 5.661270332336426, "epoch": 2.312312779614861, "grad_norm": 1.21875, "learning_rate": 0.00044599410531171986, "loss": 4.9584, "mean_token_accuracy": 0.2083461180329323, "num_tokens": 51560905.0, "step": 29720 }, { "entropy": 5.701903486251831, "epoch": 2.3127018089865787, "grad_norm": 1.2265625, "learning_rate": 0.000445976090165559, "loss": 4.9822, "mean_token_accuracy": 0.20884294509887696, "num_tokens": 51569857.0, "step": 29725 }, { "entropy": 5.6133476257324215, "epoch": 2.313090838358296, "grad_norm": 1.1015625, "learning_rate": 0.0004459580724251082, "loss": 4.8991, "mean_token_accuracy": 0.20771622955799102, "num_tokens": 51578921.0, "step": 29730 }, { "entropy": 5.629269027709961, "epoch": 2.3134798677300137, "grad_norm": 1.21875, "learning_rate": 0.00044594005209064064, "loss": 4.9215, "mean_token_accuracy": 0.21207161843776703, "num_tokens": 51587607.0, "step": 29735 }, { "entropy": 5.707592391967774, "epoch": 2.313868897101731, "grad_norm": 1.203125, "learning_rate": 0.00044592202916243003, "loss": 5.0513, "mean_token_accuracy": 0.20030743777751922, "num_tokens": 51597064.0, "step": 29740 }, { "entropy": 5.688130807876587, "epoch": 2.3142579264734486, "grad_norm": 1.203125, "learning_rate": 0.0004459040036407495, "loss": 4.9589, "mean_token_accuracy": 0.20587556362152098, "num_tokens": 51606063.0, "step": 29745 }, { "entropy": 5.758700799942017, "epoch": 2.3146469558451663, "grad_norm": 1.234375, "learning_rate": 0.0004458859755258729, "loss": 5.1159, "mean_token_accuracy": 0.1978215217590332, "num_tokens": 51615555.0, "step": 29750 }, { "entropy": 5.715987873077393, "epoch": 2.315035985216884, "grad_norm": 1.21875, "learning_rate": 0.00044586794481807357, "loss": 5.0201, "mean_token_accuracy": 0.2007552281022072, "num_tokens": 51624223.0, "step": 29755 }, { "entropy": 5.734735298156738, "epoch": 2.3154250145886013, "grad_norm": 1.328125, "learning_rate": 0.00044584991151762506, "loss": 4.9653, "mean_token_accuracy": 0.21247360706329346, "num_tokens": 51633216.0, "step": 29760 }, { "entropy": 5.647370100021362, "epoch": 2.315814043960319, "grad_norm": 1.328125, "learning_rate": 0.0004458318756248011, "loss": 4.9113, "mean_token_accuracy": 0.20937916338443757, "num_tokens": 51641105.0, "step": 29765 }, { "entropy": 5.656595849990845, "epoch": 2.3162030733320367, "grad_norm": 1.2109375, "learning_rate": 0.00044581383713987547, "loss": 4.9626, "mean_token_accuracy": 0.20464709401130676, "num_tokens": 51649452.0, "step": 29770 }, { "entropy": 5.687713479995727, "epoch": 2.316592102703754, "grad_norm": 1.1796875, "learning_rate": 0.0004457957960631216, "loss": 5.0227, "mean_token_accuracy": 0.19888788163661958, "num_tokens": 51658268.0, "step": 29775 }, { "entropy": 5.600648593902588, "epoch": 2.3169811320754716, "grad_norm": 1.21875, "learning_rate": 0.0004457777523948134, "loss": 4.801, "mean_token_accuracy": 0.21936177015304564, "num_tokens": 51666465.0, "step": 29780 }, { "entropy": 5.59742431640625, "epoch": 2.3173701614471893, "grad_norm": 1.21875, "learning_rate": 0.0004457597061352247, "loss": 4.9263, "mean_token_accuracy": 0.2092460572719574, "num_tokens": 51674912.0, "step": 29785 }, { "entropy": 5.610591554641724, "epoch": 2.317759190818907, "grad_norm": 1.2578125, "learning_rate": 0.0004457416572846291, "loss": 4.9497, "mean_token_accuracy": 0.19611132740974427, "num_tokens": 51683496.0, "step": 29790 }, { "entropy": 5.714025926589966, "epoch": 2.3181482201906243, "grad_norm": 1.2265625, "learning_rate": 0.0004457236058433008, "loss": 4.9764, "mean_token_accuracy": 0.20570492893457412, "num_tokens": 51692414.0, "step": 29795 }, { "entropy": 5.628353071212769, "epoch": 2.318537249562342, "grad_norm": 1.1640625, "learning_rate": 0.00044570555181151333, "loss": 4.9518, "mean_token_accuracy": 0.20527004152536393, "num_tokens": 51700643.0, "step": 29800 }, { "entropy": 5.637428283691406, "epoch": 2.3189262789340597, "grad_norm": 1.15625, "learning_rate": 0.000445687495189541, "loss": 4.9925, "mean_token_accuracy": 0.20438080728054048, "num_tokens": 51708882.0, "step": 29805 }, { "entropy": 5.7315562725067135, "epoch": 2.319315308305777, "grad_norm": 1.1953125, "learning_rate": 0.00044566943597765745, "loss": 5.0478, "mean_token_accuracy": 0.2012246295809746, "num_tokens": 51718191.0, "step": 29810 }, { "entropy": 5.748530101776123, "epoch": 2.3197043376774946, "grad_norm": 1.1328125, "learning_rate": 0.00044565137417613694, "loss": 5.006, "mean_token_accuracy": 0.21281303018331527, "num_tokens": 51726622.0, "step": 29815 }, { "entropy": 5.605900621414184, "epoch": 2.3200933670492123, "grad_norm": 1.296875, "learning_rate": 0.0004456333097852534, "loss": 4.8929, "mean_token_accuracy": 0.21654877215623855, "num_tokens": 51734544.0, "step": 29820 }, { "entropy": 5.63562707901001, "epoch": 2.32048239642093, "grad_norm": 1.171875, "learning_rate": 0.00044561524280528104, "loss": 4.9812, "mean_token_accuracy": 0.19827888906002045, "num_tokens": 51743481.0, "step": 29825 }, { "entropy": 5.668291759490967, "epoch": 2.3208714257926473, "grad_norm": 1.1875, "learning_rate": 0.00044559717323649383, "loss": 4.9772, "mean_token_accuracy": 0.20335174202919007, "num_tokens": 51752365.0, "step": 29830 }, { "entropy": 5.809470129013062, "epoch": 2.321260455164365, "grad_norm": 1.15625, "learning_rate": 0.0004455791010791662, "loss": 5.1298, "mean_token_accuracy": 0.1978054478764534, "num_tokens": 51760729.0, "step": 29835 }, { "entropy": 5.648795032501221, "epoch": 2.3216494845360827, "grad_norm": 1.1640625, "learning_rate": 0.0004455610263335721, "loss": 4.8918, "mean_token_accuracy": 0.2135866940021515, "num_tokens": 51769250.0, "step": 29840 }, { "entropy": 5.667315816879272, "epoch": 2.3220385139078, "grad_norm": 1.34375, "learning_rate": 0.0004455429489999859, "loss": 5.0299, "mean_token_accuracy": 0.20472099930047988, "num_tokens": 51778206.0, "step": 29845 }, { "entropy": 5.63917727470398, "epoch": 2.3224275432795176, "grad_norm": 1.234375, "learning_rate": 0.00044552486907868194, "loss": 4.9615, "mean_token_accuracy": 0.2087121069431305, "num_tokens": 51786364.0, "step": 29850 }, { "entropy": 5.615413999557495, "epoch": 2.3228165726512353, "grad_norm": 1.21875, "learning_rate": 0.00044550678656993454, "loss": 4.9522, "mean_token_accuracy": 0.20492195188999177, "num_tokens": 51794907.0, "step": 29855 }, { "entropy": 5.642756843566895, "epoch": 2.3232056020229526, "grad_norm": 1.1953125, "learning_rate": 0.000445488701474018, "loss": 4.9016, "mean_token_accuracy": 0.20731325149536134, "num_tokens": 51803290.0, "step": 29860 }, { "entropy": 5.679126167297364, "epoch": 2.3235946313946703, "grad_norm": 1.2421875, "learning_rate": 0.0004454706137912067, "loss": 4.9768, "mean_token_accuracy": 0.20499469041824342, "num_tokens": 51812065.0, "step": 29865 }, { "entropy": 5.641716766357422, "epoch": 2.323983660766388, "grad_norm": 1.1796875, "learning_rate": 0.0004454525235217753, "loss": 4.8641, "mean_token_accuracy": 0.208302541077137, "num_tokens": 51819811.0, "step": 29870 }, { "entropy": 5.638849258422852, "epoch": 2.324372690138105, "grad_norm": 1.1640625, "learning_rate": 0.00044543443066599807, "loss": 4.9484, "mean_token_accuracy": 0.21464349925518036, "num_tokens": 51828373.0, "step": 29875 }, { "entropy": 5.645402526855468, "epoch": 2.324761719509823, "grad_norm": 1.1953125, "learning_rate": 0.0004454163352241498, "loss": 5.0132, "mean_token_accuracy": 0.20826891660690308, "num_tokens": 51836922.0, "step": 29880 }, { "entropy": 5.726996326446534, "epoch": 2.3251507488815406, "grad_norm": 1.21875, "learning_rate": 0.00044539823719650463, "loss": 5.0468, "mean_token_accuracy": 0.2015913337469101, "num_tokens": 51846550.0, "step": 29885 }, { "entropy": 5.640140867233276, "epoch": 2.3255397782532583, "grad_norm": 1.2421875, "learning_rate": 0.0004453801365833376, "loss": 4.9615, "mean_token_accuracy": 0.2092990681529045, "num_tokens": 51854807.0, "step": 29890 }, { "entropy": 5.639181280136109, "epoch": 2.3259288076249756, "grad_norm": 1.21875, "learning_rate": 0.00044536203338492317, "loss": 4.9244, "mean_token_accuracy": 0.21344771683216096, "num_tokens": 51863723.0, "step": 29895 }, { "entropy": 5.606798124313355, "epoch": 2.3263178369966933, "grad_norm": 1.125, "learning_rate": 0.00044534392760153596, "loss": 4.9699, "mean_token_accuracy": 0.20845917165279387, "num_tokens": 51872545.0, "step": 29900 }, { "entropy": 5.640400981903076, "epoch": 2.326706866368411, "grad_norm": 1.1015625, "learning_rate": 0.0004453258192334508, "loss": 4.9087, "mean_token_accuracy": 0.2058084636926651, "num_tokens": 51880669.0, "step": 29905 }, { "entropy": 5.695552778244019, "epoch": 2.327095895740128, "grad_norm": 1.1640625, "learning_rate": 0.0004453077082809425, "loss": 5.0769, "mean_token_accuracy": 0.20020557790994645, "num_tokens": 51888851.0, "step": 29910 }, { "entropy": 5.586156034469605, "epoch": 2.327484925111846, "grad_norm": 1.1953125, "learning_rate": 0.00044528959474428575, "loss": 4.913, "mean_token_accuracy": 0.2036057949066162, "num_tokens": 51897502.0, "step": 29915 }, { "entropy": 5.63563175201416, "epoch": 2.3278739544835636, "grad_norm": 1.1640625, "learning_rate": 0.0004452714786237555, "loss": 4.9935, "mean_token_accuracy": 0.20563496947288512, "num_tokens": 51906087.0, "step": 29920 }, { "entropy": 5.635730838775634, "epoch": 2.3282629838552813, "grad_norm": 1.234375, "learning_rate": 0.0004452533599196265, "loss": 4.8868, "mean_token_accuracy": 0.2064405471086502, "num_tokens": 51914610.0, "step": 29925 }, { "entropy": 5.645227384567261, "epoch": 2.3286520132269986, "grad_norm": 1.1875, "learning_rate": 0.00044523523863217374, "loss": 4.9056, "mean_token_accuracy": 0.20647140890359877, "num_tokens": 51922914.0, "step": 29930 }, { "entropy": 5.5913698196411135, "epoch": 2.3290410425987162, "grad_norm": 1.2109375, "learning_rate": 0.0004452171147616723, "loss": 4.8632, "mean_token_accuracy": 0.21464110910892487, "num_tokens": 51931589.0, "step": 29935 }, { "entropy": 5.599503660202027, "epoch": 2.329430071970434, "grad_norm": 1.2265625, "learning_rate": 0.000445198988308397, "loss": 4.8757, "mean_token_accuracy": 0.21458784192800523, "num_tokens": 51939110.0, "step": 29940 }, { "entropy": 5.658889722824097, "epoch": 2.329819101342151, "grad_norm": 1.2578125, "learning_rate": 0.00044518085927262293, "loss": 4.9363, "mean_token_accuracy": 0.20441262871026994, "num_tokens": 51946850.0, "step": 29945 }, { "entropy": 5.687842178344726, "epoch": 2.330208130713869, "grad_norm": 1.1484375, "learning_rate": 0.0004451627276546252, "loss": 4.9806, "mean_token_accuracy": 0.20744600743055344, "num_tokens": 51955458.0, "step": 29950 }, { "entropy": 5.627331018447876, "epoch": 2.3305971600855866, "grad_norm": 1.265625, "learning_rate": 0.000445144593454679, "loss": 4.9402, "mean_token_accuracy": 0.20958840250968933, "num_tokens": 51964462.0, "step": 29955 }, { "entropy": 5.671924495697022, "epoch": 2.330986189457304, "grad_norm": 1.0703125, "learning_rate": 0.0004451264566730593, "loss": 4.9797, "mean_token_accuracy": 0.19699678868055343, "num_tokens": 51973309.0, "step": 29960 }, { "entropy": 5.733008098602295, "epoch": 2.3313752188290215, "grad_norm": 1.265625, "learning_rate": 0.00044510831731004146, "loss": 5.0992, "mean_token_accuracy": 0.19489036947488786, "num_tokens": 51980938.0, "step": 29965 }, { "entropy": 5.630222606658935, "epoch": 2.3317642482007392, "grad_norm": 1.296875, "learning_rate": 0.0004450901753659007, "loss": 4.9313, "mean_token_accuracy": 0.21468451321125032, "num_tokens": 51989104.0, "step": 29970 }, { "entropy": 5.554630374908447, "epoch": 2.3321532775724565, "grad_norm": 1.2109375, "learning_rate": 0.00044507203084091215, "loss": 4.8958, "mean_token_accuracy": 0.21130727380514144, "num_tokens": 51997968.0, "step": 29975 }, { "entropy": 5.790522289276123, "epoch": 2.332542306944174, "grad_norm": 1.2421875, "learning_rate": 0.0004450538837353513, "loss": 5.1142, "mean_token_accuracy": 0.20107235312461852, "num_tokens": 52005972.0, "step": 29980 }, { "entropy": 5.747951793670654, "epoch": 2.332931336315892, "grad_norm": 1.1953125, "learning_rate": 0.00044503573404949343, "loss": 5.113, "mean_token_accuracy": 0.19359252750873565, "num_tokens": 52015178.0, "step": 29985 }, { "entropy": 5.669077062606812, "epoch": 2.3333203656876096, "grad_norm": 1.2578125, "learning_rate": 0.0004450175817836139, "loss": 4.9575, "mean_token_accuracy": 0.20522669851779937, "num_tokens": 52023186.0, "step": 29990 }, { "entropy": 5.726346206665039, "epoch": 2.333709395059327, "grad_norm": 1.296875, "learning_rate": 0.00044499942693798823, "loss": 5.0683, "mean_token_accuracy": 0.19782310128211975, "num_tokens": 52031432.0, "step": 29995 }, { "entropy": 5.627503681182861, "epoch": 2.3340984244310445, "grad_norm": 1.2265625, "learning_rate": 0.0004449812695128918, "loss": 4.8796, "mean_token_accuracy": 0.20966476202011108, "num_tokens": 52039499.0, "step": 30000 }, { "epoch": 2.3340984244310445, "eval_entropy": 5.444319304740693, "eval_loss": 5.0652756690979, "eval_mean_token_accuracy": 0.2104744389065191, "eval_num_tokens": 52039499.0, "eval_runtime": 21.7118, "eval_samples_per_second": 1914.075, "eval_steps_per_second": 239.271, "step": 30000 }, { "entropy": 5.6786071300506595, "epoch": 2.3344874538027622, "grad_norm": 1.2578125, "learning_rate": 0.00044496310950860015, "loss": 4.8857, "mean_token_accuracy": 0.217248597741127, "num_tokens": 52047532.0, "step": 30005 }, { "entropy": 5.665977573394775, "epoch": 2.3348764831744795, "grad_norm": 1.3046875, "learning_rate": 0.00044494494692538886, "loss": 5.0979, "mean_token_accuracy": 0.19900950640439988, "num_tokens": 52056504.0, "step": 30010 }, { "entropy": 5.624105548858642, "epoch": 2.335265512546197, "grad_norm": 1.2109375, "learning_rate": 0.00044492678176353347, "loss": 4.8937, "mean_token_accuracy": 0.21607339531183242, "num_tokens": 52065048.0, "step": 30015 }, { "entropy": 5.688593816757202, "epoch": 2.335654541917915, "grad_norm": 1.2421875, "learning_rate": 0.00044490861402330967, "loss": 4.9641, "mean_token_accuracy": 0.20257134288549422, "num_tokens": 52073794.0, "step": 30020 }, { "entropy": 5.671488475799561, "epoch": 2.3360435712896326, "grad_norm": 1.2265625, "learning_rate": 0.0004448904437049931, "loss": 5.0428, "mean_token_accuracy": 0.1986183390021324, "num_tokens": 52083193.0, "step": 30025 }, { "entropy": 5.62253885269165, "epoch": 2.33643260066135, "grad_norm": 1.15625, "learning_rate": 0.0004448722708088594, "loss": 4.9207, "mean_token_accuracy": 0.21247195601463317, "num_tokens": 52091297.0, "step": 30030 }, { "entropy": 5.5956658840179445, "epoch": 2.3368216300330675, "grad_norm": 1.125, "learning_rate": 0.0004448540953351844, "loss": 4.9186, "mean_token_accuracy": 0.21328657120466232, "num_tokens": 52099846.0, "step": 30035 }, { "entropy": 5.668247175216675, "epoch": 2.3372106594047852, "grad_norm": 1.2890625, "learning_rate": 0.0004448359172842439, "loss": 4.9376, "mean_token_accuracy": 0.2038309469819069, "num_tokens": 52108291.0, "step": 30040 }, { "entropy": 5.639101457595825, "epoch": 2.3375996887765025, "grad_norm": 1.203125, "learning_rate": 0.00044481773665631355, "loss": 4.8594, "mean_token_accuracy": 0.2141914486885071, "num_tokens": 52116419.0, "step": 30045 }, { "entropy": 5.705658102035523, "epoch": 2.33798871814822, "grad_norm": 1.234375, "learning_rate": 0.0004447995534516695, "loss": 4.9247, "mean_token_accuracy": 0.20504148155450821, "num_tokens": 52124820.0, "step": 30050 }, { "entropy": 5.709504318237305, "epoch": 2.338377747519938, "grad_norm": 1.21875, "learning_rate": 0.00044478136767058733, "loss": 5.0463, "mean_token_accuracy": 0.2011807456612587, "num_tokens": 52134092.0, "step": 30055 }, { "entropy": 5.589872646331787, "epoch": 2.338766776891655, "grad_norm": 1.078125, "learning_rate": 0.0004447631793133432, "loss": 4.9284, "mean_token_accuracy": 0.21291635930538177, "num_tokens": 52143013.0, "step": 30060 }, { "entropy": 5.609470176696777, "epoch": 2.339155806263373, "grad_norm": 1.1484375, "learning_rate": 0.0004447449883802131, "loss": 4.9037, "mean_token_accuracy": 0.20822709202766418, "num_tokens": 52152115.0, "step": 30065 }, { "entropy": 5.7298084735870365, "epoch": 2.3395448356350905, "grad_norm": 1.2421875, "learning_rate": 0.00044472679487147295, "loss": 5.0653, "mean_token_accuracy": 0.19188129305839538, "num_tokens": 52161066.0, "step": 30070 }, { "entropy": 5.7496367454528805, "epoch": 2.339933865006808, "grad_norm": 1.1640625, "learning_rate": 0.00044470859878739877, "loss": 5.0693, "mean_token_accuracy": 0.1954355791211128, "num_tokens": 52169904.0, "step": 30075 }, { "entropy": 5.6612138748168945, "epoch": 2.3403228943785255, "grad_norm": 1.1484375, "learning_rate": 0.00044469040012826676, "loss": 4.9133, "mean_token_accuracy": 0.20932124704122543, "num_tokens": 52178179.0, "step": 30080 }, { "entropy": 5.660474348068237, "epoch": 2.340711923750243, "grad_norm": 1.203125, "learning_rate": 0.00044467219889435304, "loss": 4.9343, "mean_token_accuracy": 0.20955818444490432, "num_tokens": 52187025.0, "step": 30085 }, { "entropy": 5.668624544143677, "epoch": 2.341100953121961, "grad_norm": 1.171875, "learning_rate": 0.0004446539950859337, "loss": 5.0482, "mean_token_accuracy": 0.19847813844680787, "num_tokens": 52196019.0, "step": 30090 }, { "entropy": 5.700398015975952, "epoch": 2.341489982493678, "grad_norm": 1.15625, "learning_rate": 0.00044463578870328506, "loss": 5.0448, "mean_token_accuracy": 0.20149759352207183, "num_tokens": 52204403.0, "step": 30095 }, { "entropy": 5.706373071670532, "epoch": 2.341879011865396, "grad_norm": 1.140625, "learning_rate": 0.0004446175797466834, "loss": 4.9697, "mean_token_accuracy": 0.20962212979793549, "num_tokens": 52213425.0, "step": 30100 }, { "entropy": 5.620306015014648, "epoch": 2.3422680412371135, "grad_norm": 1.3359375, "learning_rate": 0.00044459936821640485, "loss": 4.8802, "mean_token_accuracy": 0.21124411821365358, "num_tokens": 52222454.0, "step": 30105 }, { "entropy": 5.607381200790405, "epoch": 2.3426570706088308, "grad_norm": 1.1953125, "learning_rate": 0.0004445811541127258, "loss": 4.9653, "mean_token_accuracy": 0.20756374299526215, "num_tokens": 52230994.0, "step": 30110 }, { "entropy": 5.647941398620605, "epoch": 2.3430460999805485, "grad_norm": 1.1484375, "learning_rate": 0.00044456293743592274, "loss": 4.9741, "mean_token_accuracy": 0.2015425145626068, "num_tokens": 52240532.0, "step": 30115 }, { "entropy": 5.706516933441162, "epoch": 2.343435129352266, "grad_norm": 1.0859375, "learning_rate": 0.00044454471818627196, "loss": 5.0134, "mean_token_accuracy": 0.20278163254261017, "num_tokens": 52249461.0, "step": 30120 }, { "entropy": 5.643615436553955, "epoch": 2.343824158723984, "grad_norm": 1.0546875, "learning_rate": 0.00044452649636404995, "loss": 4.909, "mean_token_accuracy": 0.21659154891967775, "num_tokens": 52258982.0, "step": 30125 }, { "entropy": 5.643262481689453, "epoch": 2.344213188095701, "grad_norm": 1.1953125, "learning_rate": 0.0004445082719695332, "loss": 4.97, "mean_token_accuracy": 0.2056376412510872, "num_tokens": 52267856.0, "step": 30130 }, { "entropy": 5.588414287567138, "epoch": 2.344602217467419, "grad_norm": 1.171875, "learning_rate": 0.00044449004500299815, "loss": 4.8659, "mean_token_accuracy": 0.21830131709575654, "num_tokens": 52275936.0, "step": 30135 }, { "entropy": 5.652890920639038, "epoch": 2.3449912468391365, "grad_norm": 1.25, "learning_rate": 0.00044447181546472146, "loss": 4.9937, "mean_token_accuracy": 0.20313683152198792, "num_tokens": 52284323.0, "step": 30140 }, { "entropy": 5.669830656051635, "epoch": 2.3453802762108538, "grad_norm": 1.203125, "learning_rate": 0.00044445358335497975, "loss": 4.958, "mean_token_accuracy": 0.20942258834838867, "num_tokens": 52293155.0, "step": 30145 }, { "entropy": 5.6569417953491214, "epoch": 2.3457693055825715, "grad_norm": 1.078125, "learning_rate": 0.0004444353486740496, "loss": 5.0319, "mean_token_accuracy": 0.20260220021009445, "num_tokens": 52302613.0, "step": 30150 }, { "entropy": 5.629034996032715, "epoch": 2.346158334954289, "grad_norm": 1.1953125, "learning_rate": 0.0004444171114222078, "loss": 4.892, "mean_token_accuracy": 0.2092030167579651, "num_tokens": 52311418.0, "step": 30155 }, { "entropy": 5.650941228866577, "epoch": 2.346547364326007, "grad_norm": 1.2578125, "learning_rate": 0.00044439887159973096, "loss": 4.9699, "mean_token_accuracy": 0.2035482719540596, "num_tokens": 52319688.0, "step": 30160 }, { "entropy": 5.607905149459839, "epoch": 2.346936393697724, "grad_norm": 1.1875, "learning_rate": 0.0004443806292068958, "loss": 4.9062, "mean_token_accuracy": 0.20824539214372634, "num_tokens": 52328373.0, "step": 30165 }, { "entropy": 5.655202198028564, "epoch": 2.347325423069442, "grad_norm": 1.25, "learning_rate": 0.0004443623842439792, "loss": 5.0168, "mean_token_accuracy": 0.2034092739224434, "num_tokens": 52336822.0, "step": 30170 }, { "entropy": 5.717740154266357, "epoch": 2.347714452441159, "grad_norm": 1.15625, "learning_rate": 0.000444344136711258, "loss": 4.9898, "mean_token_accuracy": 0.20717599987983704, "num_tokens": 52345420.0, "step": 30175 }, { "entropy": 5.69046573638916, "epoch": 2.3481034818128768, "grad_norm": 1.15625, "learning_rate": 0.00044432588660900905, "loss": 5.0102, "mean_token_accuracy": 0.20402906686067582, "num_tokens": 52353959.0, "step": 30180 }, { "entropy": 5.588909435272217, "epoch": 2.3484925111845945, "grad_norm": 1.25, "learning_rate": 0.0004443076339375093, "loss": 4.9374, "mean_token_accuracy": 0.20628469437360764, "num_tokens": 52362904.0, "step": 30185 }, { "entropy": 5.642540836334229, "epoch": 2.348881540556312, "grad_norm": 1.125, "learning_rate": 0.00044428937869703575, "loss": 4.9881, "mean_token_accuracy": 0.20060611367225648, "num_tokens": 52371587.0, "step": 30190 }, { "entropy": 5.624602794647217, "epoch": 2.3492705699280294, "grad_norm": 1.3046875, "learning_rate": 0.00044427112088786525, "loss": 4.8125, "mean_token_accuracy": 0.21473609358072282, "num_tokens": 52380603.0, "step": 30195 }, { "entropy": 5.6211175441741945, "epoch": 2.349659599299747, "grad_norm": 1.1796875, "learning_rate": 0.0004442528605102749, "loss": 4.9654, "mean_token_accuracy": 0.20671709775924682, "num_tokens": 52389477.0, "step": 30200 }, { "entropy": 5.630314207077026, "epoch": 2.350048628671465, "grad_norm": 1.21875, "learning_rate": 0.0004442345975645418, "loss": 4.9163, "mean_token_accuracy": 0.20832363963127137, "num_tokens": 52398039.0, "step": 30205 }, { "entropy": 5.656469392776489, "epoch": 2.350437658043182, "grad_norm": 1.15625, "learning_rate": 0.0004442163320509431, "loss": 4.9495, "mean_token_accuracy": 0.21114147007465361, "num_tokens": 52406358.0, "step": 30210 }, { "entropy": 5.609855699539184, "epoch": 2.3508266874148998, "grad_norm": 1.1328125, "learning_rate": 0.0004441980639697558, "loss": 4.9707, "mean_token_accuracy": 0.20978487581014632, "num_tokens": 52414873.0, "step": 30215 }, { "entropy": 5.685354566574096, "epoch": 2.3512157167866174, "grad_norm": 1.203125, "learning_rate": 0.0004441797933212573, "loss": 5.0106, "mean_token_accuracy": 0.20147286355495453, "num_tokens": 52423848.0, "step": 30220 }, { "entropy": 5.658399772644043, "epoch": 2.351604746158335, "grad_norm": 1.15625, "learning_rate": 0.0004441615201057247, "loss": 5.0003, "mean_token_accuracy": 0.20537327229976654, "num_tokens": 52432153.0, "step": 30225 }, { "entropy": 5.670348072052002, "epoch": 2.3519937755300524, "grad_norm": 1.125, "learning_rate": 0.0004441432443234352, "loss": 5.0425, "mean_token_accuracy": 0.20375650823116304, "num_tokens": 52440810.0, "step": 30230 }, { "entropy": 5.643746376037598, "epoch": 2.35238280490177, "grad_norm": 1.2421875, "learning_rate": 0.00044412496597466626, "loss": 4.9418, "mean_token_accuracy": 0.21075344532728196, "num_tokens": 52449544.0, "step": 30235 }, { "entropy": 5.674884033203125, "epoch": 2.352771834273488, "grad_norm": 1.1328125, "learning_rate": 0.0004441066850596951, "loss": 4.972, "mean_token_accuracy": 0.2112704262137413, "num_tokens": 52457903.0, "step": 30240 }, { "entropy": 5.6133363246917725, "epoch": 2.353160863645205, "grad_norm": 1.25, "learning_rate": 0.0004440884015787992, "loss": 4.9667, "mean_token_accuracy": 0.21285447478294373, "num_tokens": 52466336.0, "step": 30245 }, { "entropy": 5.722786998748779, "epoch": 2.3535498930169227, "grad_norm": 1.1640625, "learning_rate": 0.0004440701155322558, "loss": 5.0656, "mean_token_accuracy": 0.19681797325611114, "num_tokens": 52475535.0, "step": 30250 }, { "entropy": 5.696746444702148, "epoch": 2.3539389223886404, "grad_norm": 1.125, "learning_rate": 0.0004440518269203427, "loss": 4.9329, "mean_token_accuracy": 0.20951234847307204, "num_tokens": 52483929.0, "step": 30255 }, { "entropy": 5.660293912887573, "epoch": 2.354327951760358, "grad_norm": 1.28125, "learning_rate": 0.00044403353574333715, "loss": 4.9199, "mean_token_accuracy": 0.20590932965278624, "num_tokens": 52493559.0, "step": 30260 }, { "entropy": 5.593469333648682, "epoch": 2.3547169811320754, "grad_norm": 1.3203125, "learning_rate": 0.00044401524200151667, "loss": 4.902, "mean_token_accuracy": 0.2048324391245842, "num_tokens": 52502256.0, "step": 30265 }, { "entropy": 5.735697507858276, "epoch": 2.355106010503793, "grad_norm": 1.2734375, "learning_rate": 0.00044399694569515895, "loss": 5.0752, "mean_token_accuracy": 0.2027621239423752, "num_tokens": 52510572.0, "step": 30270 }, { "entropy": 5.714899110794067, "epoch": 2.355495039875511, "grad_norm": 1.125, "learning_rate": 0.00044397864682454156, "loss": 4.9578, "mean_token_accuracy": 0.20717235654592514, "num_tokens": 52518908.0, "step": 30275 }, { "entropy": 5.716857385635376, "epoch": 2.355884069247228, "grad_norm": 1.28125, "learning_rate": 0.0004439603453899421, "loss": 5.1162, "mean_token_accuracy": 0.195631705224514, "num_tokens": 52527471.0, "step": 30280 }, { "entropy": 5.622205352783203, "epoch": 2.3562730986189457, "grad_norm": 1.109375, "learning_rate": 0.0004439420413916384, "loss": 4.939, "mean_token_accuracy": 0.2113445907831192, "num_tokens": 52536873.0, "step": 30285 }, { "entropy": 5.759760141372681, "epoch": 2.3566621279906634, "grad_norm": 1.1875, "learning_rate": 0.00044392373482990817, "loss": 4.9985, "mean_token_accuracy": 0.20190776139497757, "num_tokens": 52545322.0, "step": 30290 }, { "entropy": 5.685457944869995, "epoch": 2.3570511573623807, "grad_norm": 1.2265625, "learning_rate": 0.0004439054257050291, "loss": 4.9794, "mean_token_accuracy": 0.2067481592297554, "num_tokens": 52553870.0, "step": 30295 }, { "entropy": 5.611184120178223, "epoch": 2.3574401867340984, "grad_norm": 1.15625, "learning_rate": 0.0004438871140172789, "loss": 5.0069, "mean_token_accuracy": 0.20768812596797942, "num_tokens": 52563362.0, "step": 30300 }, { "entropy": 5.629876804351807, "epoch": 2.357829216105816, "grad_norm": 1.2265625, "learning_rate": 0.0004438687997669357, "loss": 4.9618, "mean_token_accuracy": 0.20594909340143203, "num_tokens": 52571456.0, "step": 30305 }, { "entropy": 5.602367687225342, "epoch": 2.3582182454775333, "grad_norm": 1.2578125, "learning_rate": 0.00044385048295427724, "loss": 4.9499, "mean_token_accuracy": 0.2070243775844574, "num_tokens": 52580555.0, "step": 30310 }, { "entropy": 5.733325433731079, "epoch": 2.358607274849251, "grad_norm": 1.234375, "learning_rate": 0.0004438321635795814, "loss": 5.0455, "mean_token_accuracy": 0.19958677589893342, "num_tokens": 52588641.0, "step": 30315 }, { "entropy": 5.837975072860718, "epoch": 2.3589963042209687, "grad_norm": 1.1953125, "learning_rate": 0.0004438138416431262, "loss": 5.1711, "mean_token_accuracy": 0.19127443581819534, "num_tokens": 52597501.0, "step": 30320 }, { "entropy": 5.743187475204468, "epoch": 2.3593853335926864, "grad_norm": 1.21875, "learning_rate": 0.00044379551714518966, "loss": 4.9709, "mean_token_accuracy": 0.21107970625162126, "num_tokens": 52605639.0, "step": 30325 }, { "entropy": 5.664077949523926, "epoch": 2.3597743629644037, "grad_norm": 1.265625, "learning_rate": 0.00044377719008604984, "loss": 4.9727, "mean_token_accuracy": 0.2055906116962433, "num_tokens": 52614120.0, "step": 30330 }, { "entropy": 5.66447958946228, "epoch": 2.3601633923361214, "grad_norm": 1.25, "learning_rate": 0.0004437588604659848, "loss": 4.9955, "mean_token_accuracy": 0.210799939930439, "num_tokens": 52622782.0, "step": 30335 }, { "entropy": 5.7443195343017575, "epoch": 2.360552421707839, "grad_norm": 1.1796875, "learning_rate": 0.0004437405282852726, "loss": 5.0584, "mean_token_accuracy": 0.20217103362083436, "num_tokens": 52631563.0, "step": 30340 }, { "entropy": 5.670605230331421, "epoch": 2.3609414510795563, "grad_norm": 1.2890625, "learning_rate": 0.00044372219354419154, "loss": 4.9028, "mean_token_accuracy": 0.21183837950229645, "num_tokens": 52639776.0, "step": 30345 }, { "entropy": 5.654925060272217, "epoch": 2.361330480451274, "grad_norm": 1.21875, "learning_rate": 0.0004437038562430197, "loss": 4.9332, "mean_token_accuracy": 0.20609361678361893, "num_tokens": 52648361.0, "step": 30350 }, { "entropy": 5.602179718017578, "epoch": 2.3617195098229917, "grad_norm": 1.0703125, "learning_rate": 0.00044368551638203536, "loss": 4.9111, "mean_token_accuracy": 0.20823199152946473, "num_tokens": 52656609.0, "step": 30355 }, { "entropy": 5.692745113372803, "epoch": 2.3621085391947094, "grad_norm": 1.1640625, "learning_rate": 0.0004436671739615168, "loss": 4.9735, "mean_token_accuracy": 0.2051967278122902, "num_tokens": 52665294.0, "step": 30360 }, { "entropy": 5.699210119247437, "epoch": 2.3624975685664267, "grad_norm": 1.265625, "learning_rate": 0.00044364882898174235, "loss": 4.9664, "mean_token_accuracy": 0.21391389071941375, "num_tokens": 52673647.0, "step": 30365 }, { "entropy": 5.644039678573608, "epoch": 2.3628865979381444, "grad_norm": 1.203125, "learning_rate": 0.0004436304814429903, "loss": 5.0011, "mean_token_accuracy": 0.20067928582429886, "num_tokens": 52683010.0, "step": 30370 }, { "entropy": 5.654058361053467, "epoch": 2.363275627309862, "grad_norm": 1.1484375, "learning_rate": 0.0004436121313455391, "loss": 4.9587, "mean_token_accuracy": 0.20631351619958876, "num_tokens": 52692045.0, "step": 30375 }, { "entropy": 5.66507511138916, "epoch": 2.3636646566815793, "grad_norm": 1.2421875, "learning_rate": 0.0004435937786896673, "loss": 4.8217, "mean_token_accuracy": 0.21593714207410813, "num_tokens": 52700246.0, "step": 30380 }, { "entropy": 5.689355087280274, "epoch": 2.364053686053297, "grad_norm": 1.296875, "learning_rate": 0.00044357542347565323, "loss": 5.0755, "mean_token_accuracy": 0.20187070369720458, "num_tokens": 52708748.0, "step": 30385 }, { "entropy": 5.592563676834106, "epoch": 2.3644427154250147, "grad_norm": 1.1328125, "learning_rate": 0.0004435570657037753, "loss": 4.9158, "mean_token_accuracy": 0.20747235268354416, "num_tokens": 52717586.0, "step": 30390 }, { "entropy": 5.614567470550537, "epoch": 2.364831744796732, "grad_norm": 1.2421875, "learning_rate": 0.0004435387053743123, "loss": 4.9614, "mean_token_accuracy": 0.2057468995451927, "num_tokens": 52726301.0, "step": 30395 }, { "entropy": 5.669002962112427, "epoch": 2.3652207741684497, "grad_norm": 1.1875, "learning_rate": 0.00044352034248754265, "loss": 4.9541, "mean_token_accuracy": 0.2103371039032936, "num_tokens": 52734082.0, "step": 30400 }, { "entropy": 5.7148209571838375, "epoch": 2.3656098035401674, "grad_norm": 1.2890625, "learning_rate": 0.000443501977043745, "loss": 5.0143, "mean_token_accuracy": 0.2054022178053856, "num_tokens": 52742379.0, "step": 30405 }, { "entropy": 5.64781551361084, "epoch": 2.3659988329118846, "grad_norm": 1.2265625, "learning_rate": 0.0004434836090431981, "loss": 4.9133, "mean_token_accuracy": 0.21018406003713608, "num_tokens": 52751339.0, "step": 30410 }, { "entropy": 5.602663230895996, "epoch": 2.3663878622836023, "grad_norm": 1.234375, "learning_rate": 0.0004434652384861806, "loss": 4.9012, "mean_token_accuracy": 0.20308338850736618, "num_tokens": 52760665.0, "step": 30415 }, { "entropy": 5.6194983959198, "epoch": 2.36677689165532, "grad_norm": 1.234375, "learning_rate": 0.0004434468653729712, "loss": 4.9166, "mean_token_accuracy": 0.21178395599126815, "num_tokens": 52769650.0, "step": 30420 }, { "entropy": 5.728986597061157, "epoch": 2.3671659210270377, "grad_norm": 1.34375, "learning_rate": 0.00044342848970384876, "loss": 5.0077, "mean_token_accuracy": 0.2053503543138504, "num_tokens": 52779258.0, "step": 30425 }, { "entropy": 5.743943595886231, "epoch": 2.367554950398755, "grad_norm": 1.2734375, "learning_rate": 0.00044341011147909206, "loss": 4.9885, "mean_token_accuracy": 0.205703067779541, "num_tokens": 52788067.0, "step": 30430 }, { "entropy": 5.650100517272949, "epoch": 2.3679439797704727, "grad_norm": 1.328125, "learning_rate": 0.00044339173069897996, "loss": 4.9892, "mean_token_accuracy": 0.20623218417167663, "num_tokens": 52797135.0, "step": 30435 }, { "entropy": 5.615898323059082, "epoch": 2.3683330091421904, "grad_norm": 1.125, "learning_rate": 0.00044337334736379143, "loss": 4.9867, "mean_token_accuracy": 0.2009732633829117, "num_tokens": 52805854.0, "step": 30440 }, { "entropy": 5.723448181152344, "epoch": 2.3687220385139076, "grad_norm": 1.1953125, "learning_rate": 0.0004433549614738053, "loss": 4.9934, "mean_token_accuracy": 0.19996853172779083, "num_tokens": 52814711.0, "step": 30445 }, { "entropy": 5.717904090881348, "epoch": 2.3691110678856253, "grad_norm": 1.1484375, "learning_rate": 0.00044333657302930056, "loss": 4.9195, "mean_token_accuracy": 0.20715565830469132, "num_tokens": 52824399.0, "step": 30450 }, { "entropy": 5.621094799041748, "epoch": 2.369500097257343, "grad_norm": 1.203125, "learning_rate": 0.0004433181820305564, "loss": 4.9126, "mean_token_accuracy": 0.21408006995916368, "num_tokens": 52833089.0, "step": 30455 }, { "entropy": 5.652538013458252, "epoch": 2.3698891266290607, "grad_norm": 1.2109375, "learning_rate": 0.00044329978847785156, "loss": 4.9767, "mean_token_accuracy": 0.20665470957756044, "num_tokens": 52841546.0, "step": 30460 }, { "entropy": 5.671103525161743, "epoch": 2.370278156000778, "grad_norm": 1.125, "learning_rate": 0.0004432813923714654, "loss": 4.9819, "mean_token_accuracy": 0.19868847578763962, "num_tokens": 52851011.0, "step": 30465 }, { "entropy": 5.673946046829224, "epoch": 2.3706671853724957, "grad_norm": 1.15625, "learning_rate": 0.00044326299371167695, "loss": 4.9254, "mean_token_accuracy": 0.20656031668186187, "num_tokens": 52859276.0, "step": 30470 }, { "entropy": 5.764700937271118, "epoch": 2.3710562147442134, "grad_norm": 1.296875, "learning_rate": 0.00044324459249876536, "loss": 5.1552, "mean_token_accuracy": 0.19544880092144012, "num_tokens": 52867759.0, "step": 30475 }, { "entropy": 5.6534895420074465, "epoch": 2.3714452441159306, "grad_norm": 1.171875, "learning_rate": 0.0004432261887330099, "loss": 4.9321, "mean_token_accuracy": 0.20658342391252518, "num_tokens": 52876275.0, "step": 30480 }, { "entropy": 5.5898336410522464, "epoch": 2.3718342734876483, "grad_norm": 1.203125, "learning_rate": 0.0004432077824146898, "loss": 4.9641, "mean_token_accuracy": 0.2036968305706978, "num_tokens": 52884768.0, "step": 30485 }, { "entropy": 5.735194396972656, "epoch": 2.372223302859366, "grad_norm": 1.265625, "learning_rate": 0.0004431893735440843, "loss": 5.1262, "mean_token_accuracy": 0.20098817497491836, "num_tokens": 52893040.0, "step": 30490 }, { "entropy": 5.70246434211731, "epoch": 2.3726123322310833, "grad_norm": 1.21875, "learning_rate": 0.0004431709621214727, "loss": 4.9736, "mean_token_accuracy": 0.2072102516889572, "num_tokens": 52901411.0, "step": 30495 }, { "entropy": 5.579111766815186, "epoch": 2.373001361602801, "grad_norm": 1.15625, "learning_rate": 0.00044315254814713455, "loss": 4.9204, "mean_token_accuracy": 0.21395539194345475, "num_tokens": 52909751.0, "step": 30500 }, { "entropy": 5.600125932693482, "epoch": 2.3733903909745186, "grad_norm": 1.21875, "learning_rate": 0.00044313413162134894, "loss": 4.9517, "mean_token_accuracy": 0.2086743801832199, "num_tokens": 52919022.0, "step": 30505 }, { "entropy": 5.706230688095093, "epoch": 2.373779420346236, "grad_norm": 1.1796875, "learning_rate": 0.0004431157125443958, "loss": 4.9506, "mean_token_accuracy": 0.2137885183095932, "num_tokens": 52927927.0, "step": 30510 }, { "entropy": 5.723325490951538, "epoch": 2.3741684497179536, "grad_norm": 1.2734375, "learning_rate": 0.000443097290916554, "loss": 5.0494, "mean_token_accuracy": 0.2002118319272995, "num_tokens": 52936170.0, "step": 30515 }, { "entropy": 5.623728513717651, "epoch": 2.3745574790896713, "grad_norm": 1.15625, "learning_rate": 0.0004430788667381035, "loss": 4.9738, "mean_token_accuracy": 0.20719371289014815, "num_tokens": 52946007.0, "step": 30520 }, { "entropy": 5.652911758422851, "epoch": 2.374946508461389, "grad_norm": 1.1484375, "learning_rate": 0.00044306044000932374, "loss": 4.9412, "mean_token_accuracy": 0.2021512970328331, "num_tokens": 52955286.0, "step": 30525 }, { "entropy": 5.6979272842407225, "epoch": 2.3753355378331062, "grad_norm": 1.1953125, "learning_rate": 0.0004430420107304943, "loss": 4.9519, "mean_token_accuracy": 0.20396287143230438, "num_tokens": 52963608.0, "step": 30530 }, { "entropy": 5.663862562179565, "epoch": 2.375724567204824, "grad_norm": 1.046875, "learning_rate": 0.00044302357890189475, "loss": 4.9581, "mean_token_accuracy": 0.20785980373620988, "num_tokens": 52973068.0, "step": 30535 }, { "entropy": 5.660850906372071, "epoch": 2.3761135965765416, "grad_norm": 1.1953125, "learning_rate": 0.0004430051445238049, "loss": 4.9782, "mean_token_accuracy": 0.20919410586357118, "num_tokens": 52981571.0, "step": 30540 }, { "entropy": 5.66081657409668, "epoch": 2.376502625948259, "grad_norm": 1.25, "learning_rate": 0.00044298670759650426, "loss": 4.9886, "mean_token_accuracy": 0.20958238542079927, "num_tokens": 52990298.0, "step": 30545 }, { "entropy": 5.6958517074584964, "epoch": 2.3768916553199766, "grad_norm": 1.203125, "learning_rate": 0.0004429682681202728, "loss": 5.012, "mean_token_accuracy": 0.20475508272647858, "num_tokens": 52999270.0, "step": 30550 }, { "entropy": 5.665611314773559, "epoch": 2.3772806846916943, "grad_norm": 1.140625, "learning_rate": 0.00044294982609539027, "loss": 5.0164, "mean_token_accuracy": 0.20332012325525284, "num_tokens": 53008278.0, "step": 30555 }, { "entropy": 5.707945156097412, "epoch": 2.377669714063412, "grad_norm": 1.2890625, "learning_rate": 0.0004429313815221363, "loss": 4.9939, "mean_token_accuracy": 0.20458045601844788, "num_tokens": 53016992.0, "step": 30560 }, { "entropy": 5.712107086181641, "epoch": 2.3780587434351292, "grad_norm": 1.203125, "learning_rate": 0.00044291293440079107, "loss": 4.9737, "mean_token_accuracy": 0.20201164931058885, "num_tokens": 53025470.0, "step": 30565 }, { "entropy": 5.652855348587036, "epoch": 2.378447772806847, "grad_norm": 1.203125, "learning_rate": 0.0004428944847316342, "loss": 4.9933, "mean_token_accuracy": 0.2060358628630638, "num_tokens": 53034588.0, "step": 30570 }, { "entropy": 5.648515415191651, "epoch": 2.3788368021785646, "grad_norm": 1.1875, "learning_rate": 0.0004428760325149458, "loss": 4.9084, "mean_token_accuracy": 0.21969860345125197, "num_tokens": 53043312.0, "step": 30575 }, { "entropy": 5.692320394515991, "epoch": 2.379225831550282, "grad_norm": 1.2578125, "learning_rate": 0.00044285757775100584, "loss": 4.9549, "mean_token_accuracy": 0.2106770619750023, "num_tokens": 53051242.0, "step": 30580 }, { "entropy": 5.6462421894073485, "epoch": 2.3796148609219996, "grad_norm": 1.2109375, "learning_rate": 0.00044283912044009436, "loss": 4.9624, "mean_token_accuracy": 0.20744537562131882, "num_tokens": 53060595.0, "step": 30585 }, { "entropy": 5.678337907791137, "epoch": 2.3800038902937173, "grad_norm": 1.1484375, "learning_rate": 0.00044282066058249123, "loss": 4.9762, "mean_token_accuracy": 0.2067235067486763, "num_tokens": 53068920.0, "step": 30590 }, { "entropy": 5.641405010223389, "epoch": 2.380392919665435, "grad_norm": 1.1484375, "learning_rate": 0.0004428021981784768, "loss": 4.981, "mean_token_accuracy": 0.2094552829861641, "num_tokens": 53077161.0, "step": 30595 }, { "entropy": 5.6245434284210205, "epoch": 2.3807819490371522, "grad_norm": 1.1484375, "learning_rate": 0.00044278373322833106, "loss": 5.0001, "mean_token_accuracy": 0.20450412333011628, "num_tokens": 53085959.0, "step": 30600 }, { "entropy": 5.69985146522522, "epoch": 2.38117097840887, "grad_norm": 1.328125, "learning_rate": 0.00044276526573233416, "loss": 5.0117, "mean_token_accuracy": 0.2057655557990074, "num_tokens": 53094117.0, "step": 30605 }, { "entropy": 5.679349088668824, "epoch": 2.381560007780587, "grad_norm": 1.1875, "learning_rate": 0.0004427467956907664, "loss": 5.1018, "mean_token_accuracy": 0.1885227456688881, "num_tokens": 53103122.0, "step": 30610 }, { "entropy": 5.649148321151733, "epoch": 2.381949037152305, "grad_norm": 1.09375, "learning_rate": 0.00044272832310390814, "loss": 4.9567, "mean_token_accuracy": 0.20275744050741196, "num_tokens": 53111780.0, "step": 30615 }, { "entropy": 5.741524076461792, "epoch": 2.3823380665240226, "grad_norm": 1.15625, "learning_rate": 0.0004427098479720394, "loss": 5.0201, "mean_token_accuracy": 0.2011920064687729, "num_tokens": 53120146.0, "step": 30620 }, { "entropy": 5.685014152526856, "epoch": 2.3827270958957403, "grad_norm": 1.1015625, "learning_rate": 0.00044269137029544073, "loss": 4.9439, "mean_token_accuracy": 0.2088218078017235, "num_tokens": 53129431.0, "step": 30625 }, { "entropy": 5.6351847648620605, "epoch": 2.3831161252674575, "grad_norm": 1.1875, "learning_rate": 0.0004426728900743924, "loss": 4.9518, "mean_token_accuracy": 0.20892640352249145, "num_tokens": 53138324.0, "step": 30630 }, { "entropy": 5.647952604293823, "epoch": 2.3835051546391752, "grad_norm": 1.203125, "learning_rate": 0.00044265440730917484, "loss": 5.0005, "mean_token_accuracy": 0.2047274276614189, "num_tokens": 53147249.0, "step": 30635 }, { "entropy": 5.704998445510864, "epoch": 2.383894184010893, "grad_norm": 1.2890625, "learning_rate": 0.00044263592200006845, "loss": 5.0613, "mean_token_accuracy": 0.19914232343435287, "num_tokens": 53156126.0, "step": 30640 }, { "entropy": 5.61530876159668, "epoch": 2.38428321338261, "grad_norm": 1.1328125, "learning_rate": 0.00044261743414735383, "loss": 4.9203, "mean_token_accuracy": 0.21479441076517106, "num_tokens": 53164959.0, "step": 30645 }, { "entropy": 5.7180884838104244, "epoch": 2.384672242754328, "grad_norm": 1.296875, "learning_rate": 0.0004425989437513114, "loss": 5.0177, "mean_token_accuracy": 0.20787761062383653, "num_tokens": 53173885.0, "step": 30650 }, { "entropy": 5.667928981781006, "epoch": 2.3850612721260456, "grad_norm": 1.265625, "learning_rate": 0.0004425804508122218, "loss": 4.9543, "mean_token_accuracy": 0.20738785415887834, "num_tokens": 53182618.0, "step": 30655 }, { "entropy": 5.608526420593262, "epoch": 2.3854503014977633, "grad_norm": 1.109375, "learning_rate": 0.00044256195533036566, "loss": 4.9662, "mean_token_accuracy": 0.20353079885244368, "num_tokens": 53191130.0, "step": 30660 }, { "entropy": 5.673959255218506, "epoch": 2.3858393308694805, "grad_norm": 1.28125, "learning_rate": 0.00044254345730602345, "loss": 4.9938, "mean_token_accuracy": 0.2100020706653595, "num_tokens": 53199480.0, "step": 30665 }, { "entropy": 5.674824523925781, "epoch": 2.386228360241198, "grad_norm": 1.2421875, "learning_rate": 0.0004425249567394759, "loss": 5.0603, "mean_token_accuracy": 0.20057784467935563, "num_tokens": 53207912.0, "step": 30670 }, { "entropy": 5.738715600967407, "epoch": 2.386617389612916, "grad_norm": 1.2265625, "learning_rate": 0.00044250645363100386, "loss": 5.0751, "mean_token_accuracy": 0.19629358649253845, "num_tokens": 53216905.0, "step": 30675 }, { "entropy": 5.71388840675354, "epoch": 2.387006418984633, "grad_norm": 1.203125, "learning_rate": 0.00044248794798088805, "loss": 4.9973, "mean_token_accuracy": 0.20913136154413223, "num_tokens": 53225657.0, "step": 30680 }, { "entropy": 5.692236280441284, "epoch": 2.387395448356351, "grad_norm": 1.1171875, "learning_rate": 0.0004424694397894091, "loss": 5.0342, "mean_token_accuracy": 0.20300091654062272, "num_tokens": 53234637.0, "step": 30685 }, { "entropy": 5.619132614135742, "epoch": 2.3877844777280686, "grad_norm": 1.296875, "learning_rate": 0.00044245092905684794, "loss": 5.0257, "mean_token_accuracy": 0.19566274136304856, "num_tokens": 53243047.0, "step": 30690 }, { "entropy": 5.693881702423096, "epoch": 2.3881735070997863, "grad_norm": 1.2109375, "learning_rate": 0.00044243241578348553, "loss": 5.0234, "mean_token_accuracy": 0.20847547203302383, "num_tokens": 53251955.0, "step": 30695 }, { "entropy": 5.753620052337647, "epoch": 2.3885625364715035, "grad_norm": 1.1875, "learning_rate": 0.0004424138999696027, "loss": 5.0678, "mean_token_accuracy": 0.19815507382154465, "num_tokens": 53260745.0, "step": 30700 }, { "entropy": 5.734772109985352, "epoch": 2.388951565843221, "grad_norm": 1.15625, "learning_rate": 0.0004423953816154804, "loss": 5.0909, "mean_token_accuracy": 0.1996892660856247, "num_tokens": 53270324.0, "step": 30705 }, { "entropy": 5.623935508728027, "epoch": 2.389340595214939, "grad_norm": 1.1953125, "learning_rate": 0.00044237686072139967, "loss": 4.9398, "mean_token_accuracy": 0.20358007699251174, "num_tokens": 53279785.0, "step": 30710 }, { "entropy": 5.685362148284912, "epoch": 2.389729624586656, "grad_norm": 1.1015625, "learning_rate": 0.0004423583372876414, "loss": 5.0399, "mean_token_accuracy": 0.1991894066333771, "num_tokens": 53289685.0, "step": 30715 }, { "entropy": 5.679453325271607, "epoch": 2.390118653958374, "grad_norm": 1.15625, "learning_rate": 0.00044233981131448677, "loss": 4.9806, "mean_token_accuracy": 0.19991449415683746, "num_tokens": 53298165.0, "step": 30720 }, { "entropy": 5.706236934661865, "epoch": 2.3905076833300916, "grad_norm": 1.2890625, "learning_rate": 0.00044232128280221683, "loss": 5.0747, "mean_token_accuracy": 0.195381698012352, "num_tokens": 53307009.0, "step": 30725 }, { "entropy": 5.640836954116821, "epoch": 2.390896712701809, "grad_norm": 1.296875, "learning_rate": 0.0004423027517511128, "loss": 4.9771, "mean_token_accuracy": 0.19873403161764144, "num_tokens": 53315686.0, "step": 30730 }, { "entropy": 5.721861267089844, "epoch": 2.3912857420735265, "grad_norm": 1.1328125, "learning_rate": 0.00044228421816145573, "loss": 5.0164, "mean_token_accuracy": 0.20062563419342042, "num_tokens": 53325261.0, "step": 30735 }, { "entropy": 5.68454942703247, "epoch": 2.391674771445244, "grad_norm": 1.3046875, "learning_rate": 0.00044226568203352694, "loss": 4.9204, "mean_token_accuracy": 0.21012009382247926, "num_tokens": 53333492.0, "step": 30740 }, { "entropy": 5.6638720512390135, "epoch": 2.3920638008169615, "grad_norm": 1.1875, "learning_rate": 0.00044224714336760766, "loss": 5.0027, "mean_token_accuracy": 0.20526371151208878, "num_tokens": 53342205.0, "step": 30745 }, { "entropy": 5.703261137008667, "epoch": 2.392452830188679, "grad_norm": 1.203125, "learning_rate": 0.0004422286021639792, "loss": 5.093, "mean_token_accuracy": 0.19288440197706222, "num_tokens": 53350564.0, "step": 30750 }, { "entropy": 5.615387582778931, "epoch": 2.392841859560397, "grad_norm": 1.125, "learning_rate": 0.0004422100584229228, "loss": 4.8819, "mean_token_accuracy": 0.20881712883710862, "num_tokens": 53359330.0, "step": 30755 }, { "entropy": 5.601603555679321, "epoch": 2.3932308889321146, "grad_norm": 1.109375, "learning_rate": 0.00044219151214472, "loss": 4.96, "mean_token_accuracy": 0.20350924432277678, "num_tokens": 53367841.0, "step": 30760 }, { "entropy": 5.657927083969116, "epoch": 2.393619918303832, "grad_norm": 1.203125, "learning_rate": 0.0004421729633296521, "loss": 5.0639, "mean_token_accuracy": 0.19894129484891893, "num_tokens": 53376108.0, "step": 30765 }, { "entropy": 5.691621971130371, "epoch": 2.3940089476755495, "grad_norm": 1.2890625, "learning_rate": 0.00044215441197800054, "loss": 4.9263, "mean_token_accuracy": 0.20938316583633423, "num_tokens": 53384637.0, "step": 30770 }, { "entropy": 5.641753721237182, "epoch": 2.394397977047267, "grad_norm": 1.4296875, "learning_rate": 0.00044213585809004685, "loss": 4.8731, "mean_token_accuracy": 0.21489685773849487, "num_tokens": 53393874.0, "step": 30775 }, { "entropy": 5.713113737106323, "epoch": 2.3947870064189845, "grad_norm": 1.234375, "learning_rate": 0.0004421173016660725, "loss": 5.0892, "mean_token_accuracy": 0.2009956121444702, "num_tokens": 53402171.0, "step": 30780 }, { "entropy": 5.68362979888916, "epoch": 2.395176035790702, "grad_norm": 1.15625, "learning_rate": 0.0004420987427063592, "loss": 4.9587, "mean_token_accuracy": 0.20414253771305085, "num_tokens": 53410889.0, "step": 30785 }, { "entropy": 5.728204393386841, "epoch": 2.39556506516242, "grad_norm": 1.15625, "learning_rate": 0.00044208018121118833, "loss": 4.9993, "mean_token_accuracy": 0.20620881170034408, "num_tokens": 53418943.0, "step": 30790 }, { "entropy": 5.64262056350708, "epoch": 2.3959540945341375, "grad_norm": 1.1484375, "learning_rate": 0.00044206161718084164, "loss": 4.889, "mean_token_accuracy": 0.2118679851293564, "num_tokens": 53427997.0, "step": 30795 }, { "entropy": 5.603597784042359, "epoch": 2.396343123905855, "grad_norm": 1.2109375, "learning_rate": 0.0004420430506156009, "loss": 4.9453, "mean_token_accuracy": 0.2154457911849022, "num_tokens": 53436403.0, "step": 30800 }, { "entropy": 5.71500415802002, "epoch": 2.3967321532775725, "grad_norm": 1.21875, "learning_rate": 0.00044202448151574764, "loss": 5.0336, "mean_token_accuracy": 0.20594595819711686, "num_tokens": 53444690.0, "step": 30805 }, { "entropy": 5.71856803894043, "epoch": 2.39712118264929, "grad_norm": 1.1171875, "learning_rate": 0.0004420059098815638, "loss": 4.9805, "mean_token_accuracy": 0.20345345735549927, "num_tokens": 53453807.0, "step": 30810 }, { "entropy": 5.676197338104248, "epoch": 2.3975102120210074, "grad_norm": 1.125, "learning_rate": 0.0004419873357133311, "loss": 4.9929, "mean_token_accuracy": 0.20212040096521378, "num_tokens": 53462702.0, "step": 30815 }, { "entropy": 5.689618158340454, "epoch": 2.397899241392725, "grad_norm": 1.2890625, "learning_rate": 0.0004419687590113313, "loss": 4.9847, "mean_token_accuracy": 0.1965423196554184, "num_tokens": 53471851.0, "step": 30820 }, { "entropy": 5.669615268707275, "epoch": 2.398288270764443, "grad_norm": 1.171875, "learning_rate": 0.00044195017977584637, "loss": 4.9909, "mean_token_accuracy": 0.205000664293766, "num_tokens": 53480844.0, "step": 30825 }, { "entropy": 5.660860157012939, "epoch": 2.39867730013616, "grad_norm": 1.28125, "learning_rate": 0.00044193159800715823, "loss": 4.9798, "mean_token_accuracy": 0.20751722007989884, "num_tokens": 53489600.0, "step": 30830 }, { "entropy": 5.655732583999634, "epoch": 2.399066329507878, "grad_norm": 1.3046875, "learning_rate": 0.00044191301370554874, "loss": 4.9677, "mean_token_accuracy": 0.21011210530996322, "num_tokens": 53498008.0, "step": 30835 }, { "entropy": 5.661489582061767, "epoch": 2.3994553588795955, "grad_norm": 1.3125, "learning_rate": 0.00044189442687129994, "loss": 4.9387, "mean_token_accuracy": 0.20694252997636794, "num_tokens": 53506769.0, "step": 30840 }, { "entropy": 5.721233749389649, "epoch": 2.3998443882513127, "grad_norm": 1.671875, "learning_rate": 0.0004418758375046939, "loss": 4.9479, "mean_token_accuracy": 0.21174127459526063, "num_tokens": 53515311.0, "step": 30845 }, { "entropy": 5.618696975708008, "epoch": 2.4002334176230304, "grad_norm": 1.296875, "learning_rate": 0.00044185724560601267, "loss": 4.88, "mean_token_accuracy": 0.21530278772115707, "num_tokens": 53523644.0, "step": 30850 }, { "entropy": 5.644580745697022, "epoch": 2.400622446994748, "grad_norm": 1.2109375, "learning_rate": 0.0004418386511755382, "loss": 4.9594, "mean_token_accuracy": 0.20411509573459624, "num_tokens": 53532171.0, "step": 30855 }, { "entropy": 5.686641788482666, "epoch": 2.401011476366466, "grad_norm": 1.28125, "learning_rate": 0.0004418200542135528, "loss": 4.965, "mean_token_accuracy": 0.19877372682094574, "num_tokens": 53540389.0, "step": 30860 }, { "entropy": 5.701204442977906, "epoch": 2.401400505738183, "grad_norm": 1.296875, "learning_rate": 0.0004418014547203386, "loss": 4.9649, "mean_token_accuracy": 0.21128827333450317, "num_tokens": 53548473.0, "step": 30865 }, { "entropy": 5.664282274246216, "epoch": 2.401789535109901, "grad_norm": 1.296875, "learning_rate": 0.0004417828526961778, "loss": 5.0085, "mean_token_accuracy": 0.19700499773025512, "num_tokens": 53557149.0, "step": 30870 }, { "entropy": 5.658229684829712, "epoch": 2.4021785644816185, "grad_norm": 1.2578125, "learning_rate": 0.00044176424814135266, "loss": 4.9265, "mean_token_accuracy": 0.20826603174209596, "num_tokens": 53565385.0, "step": 30875 }, { "entropy": 5.576272439956665, "epoch": 2.4025675938533357, "grad_norm": 1.1875, "learning_rate": 0.0004417456410561455, "loss": 4.9249, "mean_token_accuracy": 0.21350942850112914, "num_tokens": 53573458.0, "step": 30880 }, { "entropy": 5.628418493270874, "epoch": 2.4029566232250534, "grad_norm": 1.265625, "learning_rate": 0.0004417270314408387, "loss": 5.084, "mean_token_accuracy": 0.19646272659301758, "num_tokens": 53582465.0, "step": 30885 }, { "entropy": 5.6883800506591795, "epoch": 2.403345652596771, "grad_norm": 1.2890625, "learning_rate": 0.00044170841929571454, "loss": 4.9778, "mean_token_accuracy": 0.20823460519313813, "num_tokens": 53591028.0, "step": 30890 }, { "entropy": 5.762244367599488, "epoch": 2.403734681968489, "grad_norm": 1.140625, "learning_rate": 0.00044168980462105543, "loss": 5.094, "mean_token_accuracy": 0.1965422660112381, "num_tokens": 53600401.0, "step": 30895 }, { "entropy": 5.762526988983154, "epoch": 2.404123711340206, "grad_norm": 1.2734375, "learning_rate": 0.0004416711874171439, "loss": 5.0726, "mean_token_accuracy": 0.19669243693351746, "num_tokens": 53608605.0, "step": 30900 }, { "entropy": 5.666051626205444, "epoch": 2.404512740711924, "grad_norm": 1.171875, "learning_rate": 0.0004416525676842624, "loss": 4.9998, "mean_token_accuracy": 0.2089785650372505, "num_tokens": 53617499.0, "step": 30905 }, { "entropy": 5.680056190490722, "epoch": 2.4049017700836415, "grad_norm": 1.1875, "learning_rate": 0.0004416339454226933, "loss": 4.9372, "mean_token_accuracy": 0.208861742913723, "num_tokens": 53625545.0, "step": 30910 }, { "entropy": 5.699866247177124, "epoch": 2.4052907994553587, "grad_norm": 1.203125, "learning_rate": 0.0004416153206327194, "loss": 5.0527, "mean_token_accuracy": 0.20193272233009338, "num_tokens": 53634515.0, "step": 30915 }, { "entropy": 5.646988010406494, "epoch": 2.4056798288270764, "grad_norm": 1.1875, "learning_rate": 0.00044159669331462326, "loss": 4.9214, "mean_token_accuracy": 0.21122800409793854, "num_tokens": 53642999.0, "step": 30920 }, { "entropy": 5.6742918491363525, "epoch": 2.406068858198794, "grad_norm": 1.2421875, "learning_rate": 0.00044157806346868737, "loss": 4.91, "mean_token_accuracy": 0.21074799150228501, "num_tokens": 53651921.0, "step": 30925 }, { "entropy": 5.756227922439575, "epoch": 2.406457887570512, "grad_norm": 1.3515625, "learning_rate": 0.00044155943109519454, "loss": 5.0018, "mean_token_accuracy": 0.20670194774866105, "num_tokens": 53660411.0, "step": 30930 }, { "entropy": 5.657260513305664, "epoch": 2.406846916942229, "grad_norm": 1.2578125, "learning_rate": 0.0004415407961944274, "loss": 4.9723, "mean_token_accuracy": 0.20527012795209884, "num_tokens": 53668240.0, "step": 30935 }, { "entropy": 5.616481161117553, "epoch": 2.4072359463139468, "grad_norm": 1.2109375, "learning_rate": 0.00044152215876666883, "loss": 4.9774, "mean_token_accuracy": 0.20727506875991822, "num_tokens": 53677193.0, "step": 30940 }, { "entropy": 5.697905206680298, "epoch": 2.407624975685664, "grad_norm": 1.1484375, "learning_rate": 0.0004415035188122016, "loss": 5.0187, "mean_token_accuracy": 0.20443903505802155, "num_tokens": 53686747.0, "step": 30945 }, { "entropy": 5.751395225524902, "epoch": 2.4080140050573817, "grad_norm": 1.3203125, "learning_rate": 0.00044148487633130837, "loss": 4.9742, "mean_token_accuracy": 0.2018015757203102, "num_tokens": 53695566.0, "step": 30950 }, { "entropy": 5.605574083328247, "epoch": 2.4084030344290994, "grad_norm": 1.1015625, "learning_rate": 0.00044146623132427213, "loss": 4.8888, "mean_token_accuracy": 0.21648793816566467, "num_tokens": 53704659.0, "step": 30955 }, { "entropy": 5.633669376373291, "epoch": 2.408792063800817, "grad_norm": 1.1640625, "learning_rate": 0.00044144758379137584, "loss": 4.9366, "mean_token_accuracy": 0.21182724535465242, "num_tokens": 53713908.0, "step": 30960 }, { "entropy": 5.641108703613281, "epoch": 2.4091810931725344, "grad_norm": 1.28125, "learning_rate": 0.00044142893373290236, "loss": 4.944, "mean_token_accuracy": 0.20871031433343887, "num_tokens": 53722038.0, "step": 30965 }, { "entropy": 5.653949308395386, "epoch": 2.409570122544252, "grad_norm": 1.203125, "learning_rate": 0.0004414102811491348, "loss": 5.0895, "mean_token_accuracy": 0.19648343175649643, "num_tokens": 53730658.0, "step": 30970 }, { "entropy": 5.665880298614502, "epoch": 2.4099591519159698, "grad_norm": 1.265625, "learning_rate": 0.00044139162604035597, "loss": 4.9035, "mean_token_accuracy": 0.20740678906440735, "num_tokens": 53738999.0, "step": 30975 }, { "entropy": 5.701525115966797, "epoch": 2.410348181287687, "grad_norm": 1.2109375, "learning_rate": 0.00044137296840684917, "loss": 4.9916, "mean_token_accuracy": 0.20206726491451263, "num_tokens": 53747448.0, "step": 30980 }, { "entropy": 5.75875039100647, "epoch": 2.4107372106594047, "grad_norm": 1.296875, "learning_rate": 0.0004413543082488973, "loss": 5.0352, "mean_token_accuracy": 0.20116353183984756, "num_tokens": 53756022.0, "step": 30985 }, { "entropy": 5.683370637893677, "epoch": 2.4111262400311224, "grad_norm": 1.3203125, "learning_rate": 0.0004413356455667836, "loss": 5.0072, "mean_token_accuracy": 0.2081265226006508, "num_tokens": 53764105.0, "step": 30990 }, { "entropy": 5.573893976211548, "epoch": 2.41151526940284, "grad_norm": 1.234375, "learning_rate": 0.0004413169803607913, "loss": 4.8931, "mean_token_accuracy": 0.21975770592689514, "num_tokens": 53772692.0, "step": 30995 }, { "entropy": 5.699776601791382, "epoch": 2.4119042987745574, "grad_norm": 1.2109375, "learning_rate": 0.00044129831263120344, "loss": 5.0234, "mean_token_accuracy": 0.20483534038066864, "num_tokens": 53781432.0, "step": 31000 }, { "entropy": 5.696863889694214, "epoch": 2.412293328146275, "grad_norm": 1.21875, "learning_rate": 0.0004412796423783034, "loss": 5.0139, "mean_token_accuracy": 0.20291151702404023, "num_tokens": 53789685.0, "step": 31005 }, { "entropy": 5.668190383911133, "epoch": 2.4126823575179928, "grad_norm": 1.1953125, "learning_rate": 0.0004412609696023745, "loss": 4.9953, "mean_token_accuracy": 0.2071694925427437, "num_tokens": 53798383.0, "step": 31010 }, { "entropy": 5.71931562423706, "epoch": 2.41307138688971, "grad_norm": 1.3046875, "learning_rate": 0.0004412422943037, "loss": 4.9488, "mean_token_accuracy": 0.21233827620744705, "num_tokens": 53805841.0, "step": 31015 }, { "entropy": 5.684670782089233, "epoch": 2.4134604162614277, "grad_norm": 1.125, "learning_rate": 0.00044122361648256327, "loss": 4.9602, "mean_token_accuracy": 0.21262180656194687, "num_tokens": 53814949.0, "step": 31020 }, { "entropy": 5.645623826980591, "epoch": 2.4138494456331454, "grad_norm": 1.140625, "learning_rate": 0.00044120493613924766, "loss": 4.9288, "mean_token_accuracy": 0.21578270941972733, "num_tokens": 53823421.0, "step": 31025 }, { "entropy": 5.663108015060425, "epoch": 2.414238475004863, "grad_norm": 1.2265625, "learning_rate": 0.00044118625327403677, "loss": 4.957, "mean_token_accuracy": 0.21846263706684113, "num_tokens": 53831678.0, "step": 31030 }, { "entropy": 5.693938207626343, "epoch": 2.4146275043765804, "grad_norm": 1.2265625, "learning_rate": 0.000441167567887214, "loss": 5.0654, "mean_token_accuracy": 0.195979742705822, "num_tokens": 53840696.0, "step": 31035 }, { "entropy": 5.7445894241333, "epoch": 2.415016533748298, "grad_norm": 1.1640625, "learning_rate": 0.0004411488799790629, "loss": 4.9543, "mean_token_accuracy": 0.20039933919906616, "num_tokens": 53849054.0, "step": 31040 }, { "entropy": 5.685613679885864, "epoch": 2.4154055631200158, "grad_norm": 1.234375, "learning_rate": 0.00044113018954986693, "loss": 4.9874, "mean_token_accuracy": 0.2040001779794693, "num_tokens": 53857754.0, "step": 31045 }, { "entropy": 5.690042161941529, "epoch": 2.415794592491733, "grad_norm": 1.21875, "learning_rate": 0.0004411114965999098, "loss": 4.9611, "mean_token_accuracy": 0.2036678746342659, "num_tokens": 53866522.0, "step": 31050 }, { "entropy": 5.615806722640992, "epoch": 2.4161836218634507, "grad_norm": 1.1953125, "learning_rate": 0.000441092801129475, "loss": 4.8934, "mean_token_accuracy": 0.20919670164585114, "num_tokens": 53874654.0, "step": 31055 }, { "entropy": 5.648542213439941, "epoch": 2.4165726512351684, "grad_norm": 1.3046875, "learning_rate": 0.00044107410313884643, "loss": 4.9507, "mean_token_accuracy": 0.2074056699872017, "num_tokens": 53882918.0, "step": 31060 }, { "entropy": 5.648423290252685, "epoch": 2.4169616806068857, "grad_norm": 1.2265625, "learning_rate": 0.00044105540262830763, "loss": 4.9378, "mean_token_accuracy": 0.2030644878745079, "num_tokens": 53891334.0, "step": 31065 }, { "entropy": 5.63470778465271, "epoch": 2.4173507099786034, "grad_norm": 1.2109375, "learning_rate": 0.0004410366995981424, "loss": 4.9587, "mean_token_accuracy": 0.21252783089876176, "num_tokens": 53900047.0, "step": 31070 }, { "entropy": 5.61437726020813, "epoch": 2.417739739350321, "grad_norm": 1.2109375, "learning_rate": 0.00044101799404863457, "loss": 4.9983, "mean_token_accuracy": 0.20459308922290803, "num_tokens": 53908764.0, "step": 31075 }, { "entropy": 5.7168478012084964, "epoch": 2.4181287687220383, "grad_norm": 1.1796875, "learning_rate": 0.0004409992859800679, "loss": 5.0152, "mean_token_accuracy": 0.20090483874082565, "num_tokens": 53916634.0, "step": 31080 }, { "entropy": 5.7492564678192135, "epoch": 2.418517798093756, "grad_norm": 1.140625, "learning_rate": 0.0004409805753927263, "loss": 5.0294, "mean_token_accuracy": 0.1995559811592102, "num_tokens": 53925458.0, "step": 31085 }, { "entropy": 5.687049198150635, "epoch": 2.4189068274654737, "grad_norm": 1.140625, "learning_rate": 0.0004409618622868936, "loss": 4.9928, "mean_token_accuracy": 0.20529905408620835, "num_tokens": 53934385.0, "step": 31090 }, { "entropy": 5.652777099609375, "epoch": 2.4192958568371914, "grad_norm": 1.1875, "learning_rate": 0.00044094314666285385, "loss": 4.952, "mean_token_accuracy": 0.2059738501906395, "num_tokens": 53943674.0, "step": 31095 }, { "entropy": 5.681382846832276, "epoch": 2.4196848862089086, "grad_norm": 1.2734375, "learning_rate": 0.00044092442852089095, "loss": 5.0142, "mean_token_accuracy": 0.2024369552731514, "num_tokens": 53952455.0, "step": 31100 }, { "entropy": 5.641343498229981, "epoch": 2.4200739155806263, "grad_norm": 1.1875, "learning_rate": 0.0004409057078612889, "loss": 4.8743, "mean_token_accuracy": 0.2159601241350174, "num_tokens": 53961344.0, "step": 31105 }, { "entropy": 5.680008125305176, "epoch": 2.420462944952344, "grad_norm": 1.1484375, "learning_rate": 0.00044088698468433194, "loss": 4.9495, "mean_token_accuracy": 0.2131201907992363, "num_tokens": 53969277.0, "step": 31110 }, { "entropy": 5.635416030883789, "epoch": 2.4208519743240613, "grad_norm": 1.21875, "learning_rate": 0.00044086825899030383, "loss": 4.946, "mean_token_accuracy": 0.20070736855268478, "num_tokens": 53977830.0, "step": 31115 }, { "entropy": 5.648839902877808, "epoch": 2.421241003695779, "grad_norm": 1.1953125, "learning_rate": 0.000440849530779489, "loss": 4.9516, "mean_token_accuracy": 0.20884760320186616, "num_tokens": 53986273.0, "step": 31120 }, { "entropy": 5.675412130355835, "epoch": 2.4216300330674967, "grad_norm": 1.265625, "learning_rate": 0.0004408308000521715, "loss": 4.9569, "mean_token_accuracy": 0.20781175345182418, "num_tokens": 53994064.0, "step": 31125 }, { "entropy": 5.601336336135864, "epoch": 2.4220190624392144, "grad_norm": 1.2734375, "learning_rate": 0.00044081206680863556, "loss": 4.9857, "mean_token_accuracy": 0.2104591101408005, "num_tokens": 54003516.0, "step": 31130 }, { "entropy": 5.643300151824951, "epoch": 2.4224080918109316, "grad_norm": 1.2578125, "learning_rate": 0.00044079333104916554, "loss": 5.0207, "mean_token_accuracy": 0.20369343757629393, "num_tokens": 54012503.0, "step": 31135 }, { "entropy": 5.718322515487671, "epoch": 2.4227971211826493, "grad_norm": 1.234375, "learning_rate": 0.0004407745927740454, "loss": 4.9926, "mean_token_accuracy": 0.2048995554447174, "num_tokens": 54021170.0, "step": 31140 }, { "entropy": 5.666590833663941, "epoch": 2.423186150554367, "grad_norm": 1.171875, "learning_rate": 0.0004407558519835598, "loss": 5.027, "mean_token_accuracy": 0.20990532636642456, "num_tokens": 54030520.0, "step": 31145 }, { "entropy": 5.716016054153442, "epoch": 2.4235751799260843, "grad_norm": 1.203125, "learning_rate": 0.00044073710867799295, "loss": 5.0012, "mean_token_accuracy": 0.21078892946243286, "num_tokens": 54039625.0, "step": 31150 }, { "entropy": 5.60653133392334, "epoch": 2.423964209297802, "grad_norm": 1.1640625, "learning_rate": 0.0004407183628576293, "loss": 4.9221, "mean_token_accuracy": 0.2164502814412117, "num_tokens": 54047756.0, "step": 31155 }, { "entropy": 5.636724233627319, "epoch": 2.4243532386695197, "grad_norm": 1.1875, "learning_rate": 0.0004406996145227532, "loss": 5.0264, "mean_token_accuracy": 0.20057591199874877, "num_tokens": 54056051.0, "step": 31160 }, { "entropy": 5.73341212272644, "epoch": 2.424742268041237, "grad_norm": 1.28125, "learning_rate": 0.0004406808636736492, "loss": 5.0097, "mean_token_accuracy": 0.2039689764380455, "num_tokens": 54065454.0, "step": 31165 }, { "entropy": 5.656882286071777, "epoch": 2.4251312974129546, "grad_norm": 1.265625, "learning_rate": 0.00044066211031060183, "loss": 4.9536, "mean_token_accuracy": 0.2052305519580841, "num_tokens": 54073501.0, "step": 31170 }, { "entropy": 5.658548355102539, "epoch": 2.4255203267846723, "grad_norm": 1.3125, "learning_rate": 0.0004406433544338956, "loss": 4.9986, "mean_token_accuracy": 0.20272246748209, "num_tokens": 54082314.0, "step": 31175 }, { "entropy": 5.594903087615966, "epoch": 2.4259093561563896, "grad_norm": 1.2734375, "learning_rate": 0.0004406245960438151, "loss": 4.9158, "mean_token_accuracy": 0.21184185147285461, "num_tokens": 54090590.0, "step": 31180 }, { "entropy": 5.686072492599488, "epoch": 2.4262983855281073, "grad_norm": 1.15625, "learning_rate": 0.000440605835140645, "loss": 4.9851, "mean_token_accuracy": 0.20533467233181, "num_tokens": 54100366.0, "step": 31185 }, { "entropy": 5.629287910461426, "epoch": 2.426687414899825, "grad_norm": 1.21875, "learning_rate": 0.0004405870717246699, "loss": 4.8778, "mean_token_accuracy": 0.2146964594721794, "num_tokens": 54109007.0, "step": 31190 }, { "entropy": 5.645850419998169, "epoch": 2.4270764442715427, "grad_norm": 1.140625, "learning_rate": 0.00044056830579617464, "loss": 4.9601, "mean_token_accuracy": 0.2113846704363823, "num_tokens": 54117696.0, "step": 31195 }, { "entropy": 5.5990081310272215, "epoch": 2.42746547364326, "grad_norm": 1.3515625, "learning_rate": 0.00044054953735544376, "loss": 4.9527, "mean_token_accuracy": 0.2097751021385193, "num_tokens": 54125955.0, "step": 31200 }, { "entropy": 5.643500423431396, "epoch": 2.4278545030149776, "grad_norm": 1.3515625, "learning_rate": 0.0004405307664027622, "loss": 4.9814, "mean_token_accuracy": 0.20560961216688156, "num_tokens": 54134311.0, "step": 31205 }, { "entropy": 5.64795331954956, "epoch": 2.4282435323866953, "grad_norm": 1.2421875, "learning_rate": 0.0004405119929384147, "loss": 4.9771, "mean_token_accuracy": 0.20884929448366166, "num_tokens": 54144080.0, "step": 31210 }, { "entropy": 5.714404773712158, "epoch": 2.4286325617584126, "grad_norm": 1.3046875, "learning_rate": 0.0004404932169626862, "loss": 5.0872, "mean_token_accuracy": 0.19786328673362732, "num_tokens": 54152860.0, "step": 31215 }, { "entropy": 5.649265241622925, "epoch": 2.4290215911301303, "grad_norm": 1.234375, "learning_rate": 0.0004404744384758615, "loss": 4.9324, "mean_token_accuracy": 0.20750968307256698, "num_tokens": 54162049.0, "step": 31220 }, { "entropy": 5.638836669921875, "epoch": 2.429410620501848, "grad_norm": 1.1953125, "learning_rate": 0.0004404556574782256, "loss": 4.903, "mean_token_accuracy": 0.20597613900899886, "num_tokens": 54170321.0, "step": 31225 }, { "entropy": 5.6488649368286135, "epoch": 2.4297996498735657, "grad_norm": 1.1640625, "learning_rate": 0.00044043687397006336, "loss": 4.9624, "mean_token_accuracy": 0.2103401854634285, "num_tokens": 54179381.0, "step": 31230 }, { "entropy": 5.745428991317749, "epoch": 2.430188679245283, "grad_norm": 1.328125, "learning_rate": 0.00044041808795166, "loss": 4.9766, "mean_token_accuracy": 0.20150024741888045, "num_tokens": 54188416.0, "step": 31235 }, { "entropy": 5.650040149688721, "epoch": 2.4305777086170006, "grad_norm": 1.171875, "learning_rate": 0.0004403992994233004, "loss": 4.912, "mean_token_accuracy": 0.21094109416007994, "num_tokens": 54196483.0, "step": 31240 }, { "entropy": 5.6612834453582765, "epoch": 2.4309667379887183, "grad_norm": 1.171875, "learning_rate": 0.00044038050838526974, "loss": 4.9672, "mean_token_accuracy": 0.194662643969059, "num_tokens": 54205782.0, "step": 31245 }, { "entropy": 5.604939270019531, "epoch": 2.4313557673604356, "grad_norm": 1.2109375, "learning_rate": 0.000440361714837853, "loss": 4.9936, "mean_token_accuracy": 0.203917196393013, "num_tokens": 54214014.0, "step": 31250 }, { "entropy": 5.647617292404175, "epoch": 2.4317447967321533, "grad_norm": 1.28125, "learning_rate": 0.0004403429187813355, "loss": 4.9191, "mean_token_accuracy": 0.21088347882032393, "num_tokens": 54222018.0, "step": 31255 }, { "entropy": 5.672516536712647, "epoch": 2.432133826103871, "grad_norm": 1.1953125, "learning_rate": 0.0004403241202160024, "loss": 4.9747, "mean_token_accuracy": 0.20752330869436264, "num_tokens": 54231549.0, "step": 31260 }, { "entropy": 5.599980163574219, "epoch": 2.432522855475588, "grad_norm": 1.2578125, "learning_rate": 0.0004403053191421388, "loss": 4.9539, "mean_token_accuracy": 0.20914627909660338, "num_tokens": 54240605.0, "step": 31265 }, { "entropy": 5.673921918869018, "epoch": 2.432911884847306, "grad_norm": 1.21875, "learning_rate": 0.0004402865155600302, "loss": 4.9581, "mean_token_accuracy": 0.20804419815540315, "num_tokens": 54249201.0, "step": 31270 }, { "entropy": 5.6475982666015625, "epoch": 2.4333009142190236, "grad_norm": 1.1953125, "learning_rate": 0.00044026770946996183, "loss": 4.932, "mean_token_accuracy": 0.2089228630065918, "num_tokens": 54258039.0, "step": 31275 }, { "entropy": 5.707819271087646, "epoch": 2.433689943590741, "grad_norm": 1.203125, "learning_rate": 0.00044024890087221896, "loss": 4.9769, "mean_token_accuracy": 0.20197538286447525, "num_tokens": 54266242.0, "step": 31280 }, { "entropy": 5.649300765991211, "epoch": 2.4340789729624586, "grad_norm": 1.21875, "learning_rate": 0.00044023008976708705, "loss": 4.9447, "mean_token_accuracy": 0.2095598727464676, "num_tokens": 54274838.0, "step": 31285 }, { "entropy": 5.634437084197998, "epoch": 2.4344680023341763, "grad_norm": 1.2421875, "learning_rate": 0.0004402112761548515, "loss": 4.9178, "mean_token_accuracy": 0.20656898319721223, "num_tokens": 54283633.0, "step": 31290 }, { "entropy": 5.624357223510742, "epoch": 2.434857031705894, "grad_norm": 1.1953125, "learning_rate": 0.00044019246003579776, "loss": 4.9778, "mean_token_accuracy": 0.20720132291316987, "num_tokens": 54291656.0, "step": 31295 }, { "entropy": 5.641462230682373, "epoch": 2.435246061077611, "grad_norm": 1.2421875, "learning_rate": 0.0004401736414102115, "loss": 4.9087, "mean_token_accuracy": 0.20748155415058137, "num_tokens": 54300353.0, "step": 31300 }, { "entropy": 5.707808780670166, "epoch": 2.435635090449329, "grad_norm": 1.1875, "learning_rate": 0.000440154820278378, "loss": 4.9923, "mean_token_accuracy": 0.2048929288983345, "num_tokens": 54308771.0, "step": 31305 }, { "entropy": 5.682120227813721, "epoch": 2.4360241198210466, "grad_norm": 1.2109375, "learning_rate": 0.0004401359966405831, "loss": 4.9896, "mean_token_accuracy": 0.20163409560918807, "num_tokens": 54318069.0, "step": 31310 }, { "entropy": 5.626701736450196, "epoch": 2.436413149192764, "grad_norm": 1.2265625, "learning_rate": 0.00044011717049711216, "loss": 4.9599, "mean_token_accuracy": 0.20719880014657974, "num_tokens": 54326363.0, "step": 31315 }, { "entropy": 5.662750864028931, "epoch": 2.4368021785644816, "grad_norm": 1.3125, "learning_rate": 0.00044009834184825103, "loss": 5.031, "mean_token_accuracy": 0.20478837043046952, "num_tokens": 54334439.0, "step": 31320 }, { "entropy": 5.694104242324829, "epoch": 2.4371912079361993, "grad_norm": 1.0625, "learning_rate": 0.0004400795106942853, "loss": 5.0129, "mean_token_accuracy": 0.20656394511461257, "num_tokens": 54343799.0, "step": 31325 }, { "entropy": 5.714408111572266, "epoch": 2.437580237307917, "grad_norm": 1.265625, "learning_rate": 0.00044006067703550083, "loss": 5.0594, "mean_token_accuracy": 0.1996875137090683, "num_tokens": 54351382.0, "step": 31330 }, { "entropy": 5.729832124710083, "epoch": 2.437969266679634, "grad_norm": 1.1640625, "learning_rate": 0.0004400418408721833, "loss": 5.0146, "mean_token_accuracy": 0.20484249889850617, "num_tokens": 54360803.0, "step": 31335 }, { "entropy": 5.745359659194946, "epoch": 2.438358296051352, "grad_norm": 1.21875, "learning_rate": 0.00044002300220461843, "loss": 5.0368, "mean_token_accuracy": 0.20131905525922775, "num_tokens": 54369540.0, "step": 31340 }, { "entropy": 5.709685945510865, "epoch": 2.4387473254230696, "grad_norm": 1.296875, "learning_rate": 0.0004400041610330922, "loss": 5.0364, "mean_token_accuracy": 0.19478348791599273, "num_tokens": 54378585.0, "step": 31345 }, { "entropy": 5.669918060302734, "epoch": 2.439136354794787, "grad_norm": 1.2109375, "learning_rate": 0.0004399853173578905, "loss": 4.913, "mean_token_accuracy": 0.21886730045080185, "num_tokens": 54387477.0, "step": 31350 }, { "entropy": 5.693781042098999, "epoch": 2.4395253841665046, "grad_norm": 1.171875, "learning_rate": 0.00043996647117929916, "loss": 4.9648, "mean_token_accuracy": 0.21326095312833787, "num_tokens": 54396599.0, "step": 31355 }, { "entropy": 5.783183670043945, "epoch": 2.4399144135382222, "grad_norm": 1.2890625, "learning_rate": 0.0004399476224976043, "loss": 5.1434, "mean_token_accuracy": 0.19120818078517915, "num_tokens": 54406302.0, "step": 31360 }, { "entropy": 5.695734453201294, "epoch": 2.44030344290994, "grad_norm": 1.21875, "learning_rate": 0.00043992877131309165, "loss": 5.0249, "mean_token_accuracy": 0.20827574282884598, "num_tokens": 54414467.0, "step": 31365 }, { "entropy": 5.627566194534301, "epoch": 2.440692472281657, "grad_norm": 1.1171875, "learning_rate": 0.0004399099176260475, "loss": 4.9807, "mean_token_accuracy": 0.20642670542001723, "num_tokens": 54423699.0, "step": 31370 }, { "entropy": 5.636210489273071, "epoch": 2.441081501653375, "grad_norm": 1.234375, "learning_rate": 0.0004398910614367579, "loss": 4.9827, "mean_token_accuracy": 0.19866613000631334, "num_tokens": 54432617.0, "step": 31375 }, { "entropy": 5.70959849357605, "epoch": 2.441470531025092, "grad_norm": 1.1484375, "learning_rate": 0.00043987220274550876, "loss": 4.9638, "mean_token_accuracy": 0.20565340369939805, "num_tokens": 54441748.0, "step": 31380 }, { "entropy": 5.672737121582031, "epoch": 2.44185956039681, "grad_norm": 1.234375, "learning_rate": 0.00043985334155258643, "loss": 5.0206, "mean_token_accuracy": 0.2008816972374916, "num_tokens": 54450785.0, "step": 31385 }, { "entropy": 5.662129259109497, "epoch": 2.4422485897685275, "grad_norm": 1.2265625, "learning_rate": 0.000439834477858277, "loss": 4.9837, "mean_token_accuracy": 0.20017824620008468, "num_tokens": 54459967.0, "step": 31390 }, { "entropy": 5.749491453170776, "epoch": 2.4426376191402452, "grad_norm": 1.296875, "learning_rate": 0.00043981561166286676, "loss": 5.0866, "mean_token_accuracy": 0.20291004180908204, "num_tokens": 54469066.0, "step": 31395 }, { "entropy": 5.7649617195129395, "epoch": 2.4430266485119625, "grad_norm": 1.1796875, "learning_rate": 0.000439796742966642, "loss": 4.9813, "mean_token_accuracy": 0.20544808059930803, "num_tokens": 54477985.0, "step": 31400 }, { "entropy": 5.615476655960083, "epoch": 2.44341567788368, "grad_norm": 1.1953125, "learning_rate": 0.00043977787176988884, "loss": 4.8897, "mean_token_accuracy": 0.21326467394828796, "num_tokens": 54486223.0, "step": 31405 }, { "entropy": 5.644390821456909, "epoch": 2.443804707255398, "grad_norm": 1.171875, "learning_rate": 0.0004397589980728938, "loss": 4.9206, "mean_token_accuracy": 0.20813342332839965, "num_tokens": 54494237.0, "step": 31410 }, { "entropy": 5.7613929271697994, "epoch": 2.444193736627115, "grad_norm": 1.1484375, "learning_rate": 0.00043974012187594324, "loss": 5.037, "mean_token_accuracy": 0.20038892179727555, "num_tokens": 54503405.0, "step": 31415 }, { "entropy": 5.710390186309814, "epoch": 2.444582765998833, "grad_norm": 1.3359375, "learning_rate": 0.0004397212431793235, "loss": 4.9478, "mean_token_accuracy": 0.2032597243785858, "num_tokens": 54511417.0, "step": 31420 }, { "entropy": 5.646000671386719, "epoch": 2.4449717953705505, "grad_norm": 1.265625, "learning_rate": 0.00043970236198332107, "loss": 4.9951, "mean_token_accuracy": 0.203825244307518, "num_tokens": 54519548.0, "step": 31425 }, { "entropy": 5.570358180999756, "epoch": 2.4453608247422682, "grad_norm": 1.203125, "learning_rate": 0.00043968347828822246, "loss": 4.8782, "mean_token_accuracy": 0.21202671229839326, "num_tokens": 54528102.0, "step": 31430 }, { "entropy": 5.667199993133545, "epoch": 2.4457498541139855, "grad_norm": 1.34375, "learning_rate": 0.0004396645920943142, "loss": 4.9617, "mean_token_accuracy": 0.20727344900369643, "num_tokens": 54536619.0, "step": 31435 }, { "entropy": 5.649351930618286, "epoch": 2.446138883485703, "grad_norm": 1.21875, "learning_rate": 0.0004396457034018828, "loss": 4.9068, "mean_token_accuracy": 0.21250502169132232, "num_tokens": 54545091.0, "step": 31440 }, { "entropy": 5.681482362747192, "epoch": 2.446527912857421, "grad_norm": 1.1953125, "learning_rate": 0.000439626812211215, "loss": 5.0098, "mean_token_accuracy": 0.20347914695739747, "num_tokens": 54554055.0, "step": 31445 }, { "entropy": 5.700871372222901, "epoch": 2.446916942229138, "grad_norm": 1.203125, "learning_rate": 0.00043960791852259735, "loss": 5.0197, "mean_token_accuracy": 0.19463416188955307, "num_tokens": 54562629.0, "step": 31450 }, { "entropy": 5.7141071319580075, "epoch": 2.447305971600856, "grad_norm": 1.203125, "learning_rate": 0.0004395890223363165, "loss": 4.9699, "mean_token_accuracy": 0.20914117991924286, "num_tokens": 54570929.0, "step": 31455 }, { "entropy": 5.598820304870605, "epoch": 2.4476950009725735, "grad_norm": 1.296875, "learning_rate": 0.00043957012365265915, "loss": 4.8804, "mean_token_accuracy": 0.21017364114522935, "num_tokens": 54579344.0, "step": 31460 }, { "entropy": 5.6737250804901125, "epoch": 2.4480840303442912, "grad_norm": 1.203125, "learning_rate": 0.00043955122247191214, "loss": 5.0644, "mean_token_accuracy": 0.2017744317650795, "num_tokens": 54588364.0, "step": 31465 }, { "entropy": 5.680770635604858, "epoch": 2.4484730597160085, "grad_norm": 1.140625, "learning_rate": 0.0004395323187943623, "loss": 5.0598, "mean_token_accuracy": 0.1996506780385971, "num_tokens": 54597071.0, "step": 31470 }, { "entropy": 5.6994743824005125, "epoch": 2.448862089087726, "grad_norm": 1.25, "learning_rate": 0.0004395134126202964, "loss": 4.9981, "mean_token_accuracy": 0.201479409635067, "num_tokens": 54605625.0, "step": 31475 }, { "entropy": 5.691399240493775, "epoch": 2.449251118459444, "grad_norm": 1.1640625, "learning_rate": 0.0004394945039500012, "loss": 5.0248, "mean_token_accuracy": 0.19991101026535035, "num_tokens": 54614883.0, "step": 31480 }, { "entropy": 5.739169692993164, "epoch": 2.449640147831161, "grad_norm": 1.1640625, "learning_rate": 0.00043947559278376385, "loss": 5.0619, "mean_token_accuracy": 0.20442538261413573, "num_tokens": 54624689.0, "step": 31485 }, { "entropy": 5.6834924697875975, "epoch": 2.450029177202879, "grad_norm": 1.1953125, "learning_rate": 0.00043945667912187117, "loss": 4.9968, "mean_token_accuracy": 0.2078772231936455, "num_tokens": 54633111.0, "step": 31490 }, { "entropy": 5.717809963226318, "epoch": 2.4504182065745965, "grad_norm": 1.1640625, "learning_rate": 0.0004394377629646101, "loss": 4.9724, "mean_token_accuracy": 0.2059326723217964, "num_tokens": 54642250.0, "step": 31495 }, { "entropy": 5.695753526687622, "epoch": 2.4508072359463138, "grad_norm": 1.2890625, "learning_rate": 0.00043941884431226763, "loss": 4.9967, "mean_token_accuracy": 0.20664994418621063, "num_tokens": 54652025.0, "step": 31500 }, { "entropy": 5.714011907577515, "epoch": 2.4511962653180315, "grad_norm": 1.28125, "learning_rate": 0.000439399923165131, "loss": 4.9601, "mean_token_accuracy": 0.2069253772497177, "num_tokens": 54659535.0, "step": 31505 }, { "entropy": 5.68516526222229, "epoch": 2.451585294689749, "grad_norm": 1.2109375, "learning_rate": 0.0004393809995234872, "loss": 4.9447, "mean_token_accuracy": 0.20886108726263047, "num_tokens": 54667986.0, "step": 31510 }, { "entropy": 5.684633541107178, "epoch": 2.4519743240614664, "grad_norm": 1.2734375, "learning_rate": 0.0004393620733876233, "loss": 5.0134, "mean_token_accuracy": 0.20059615075588227, "num_tokens": 54676867.0, "step": 31515 }, { "entropy": 5.630230808258057, "epoch": 2.452363353433184, "grad_norm": 1.25, "learning_rate": 0.0004393431447578267, "loss": 4.885, "mean_token_accuracy": 0.22034584879875183, "num_tokens": 54685458.0, "step": 31520 }, { "entropy": 5.594038009643555, "epoch": 2.452752382804902, "grad_norm": 1.34375, "learning_rate": 0.00043932421363438427, "loss": 4.9045, "mean_token_accuracy": 0.2083751529455185, "num_tokens": 54694453.0, "step": 31525 }, { "entropy": 5.641142320632935, "epoch": 2.4531414121766195, "grad_norm": 1.25, "learning_rate": 0.0004393052800175835, "loss": 4.9296, "mean_token_accuracy": 0.20773604065179824, "num_tokens": 54702241.0, "step": 31530 }, { "entropy": 5.7276038646698, "epoch": 2.4535304415483368, "grad_norm": 1.1953125, "learning_rate": 0.00043928634390771166, "loss": 4.9453, "mean_token_accuracy": 0.20741995573043823, "num_tokens": 54710823.0, "step": 31535 }, { "entropy": 5.598044776916504, "epoch": 2.4539194709200545, "grad_norm": 1.1796875, "learning_rate": 0.00043926740530505603, "loss": 4.9491, "mean_token_accuracy": 0.20602016746997834, "num_tokens": 54718982.0, "step": 31540 }, { "entropy": 5.68038592338562, "epoch": 2.454308500291772, "grad_norm": 1.2578125, "learning_rate": 0.000439248464209904, "loss": 4.9614, "mean_token_accuracy": 0.2081098586320877, "num_tokens": 54728685.0, "step": 31545 }, { "entropy": 5.667522716522217, "epoch": 2.4546975296634894, "grad_norm": 1.1953125, "learning_rate": 0.000439229520622543, "loss": 4.9744, "mean_token_accuracy": 0.20258067101240157, "num_tokens": 54737090.0, "step": 31550 }, { "entropy": 5.672182607650757, "epoch": 2.455086559035207, "grad_norm": 1.15625, "learning_rate": 0.0004392105745432603, "loss": 5.0345, "mean_token_accuracy": 0.2025071620941162, "num_tokens": 54746059.0, "step": 31555 }, { "entropy": 5.625269746780395, "epoch": 2.455475588406925, "grad_norm": 1.2109375, "learning_rate": 0.0004391916259723436, "loss": 4.8928, "mean_token_accuracy": 0.21703445613384248, "num_tokens": 54754577.0, "step": 31560 }, { "entropy": 5.686138677597046, "epoch": 2.4558646177786425, "grad_norm": 1.1328125, "learning_rate": 0.00043917267491008023, "loss": 5.0015, "mean_token_accuracy": 0.20145866721868516, "num_tokens": 54763065.0, "step": 31565 }, { "entropy": 5.729212284088135, "epoch": 2.4562536471503598, "grad_norm": 1.21875, "learning_rate": 0.0004391537213567579, "loss": 4.9895, "mean_token_accuracy": 0.20111447423696518, "num_tokens": 54771189.0, "step": 31570 }, { "entropy": 5.64577350616455, "epoch": 2.4566426765220775, "grad_norm": 1.2421875, "learning_rate": 0.0004391347653126641, "loss": 4.9071, "mean_token_accuracy": 0.21296558082103728, "num_tokens": 54779141.0, "step": 31575 }, { "entropy": 5.665112113952636, "epoch": 2.457031705893795, "grad_norm": 1.1875, "learning_rate": 0.00043911580677808646, "loss": 4.962, "mean_token_accuracy": 0.2039460927248001, "num_tokens": 54787684.0, "step": 31580 }, { "entropy": 5.683018016815185, "epoch": 2.4574207352655124, "grad_norm": 1.203125, "learning_rate": 0.00043909684575331264, "loss": 5.0296, "mean_token_accuracy": 0.20838956981897355, "num_tokens": 54795831.0, "step": 31585 }, { "entropy": 5.657744884490967, "epoch": 2.45780976463723, "grad_norm": 1.171875, "learning_rate": 0.0004390778822386304, "loss": 4.9473, "mean_token_accuracy": 0.20842453688383103, "num_tokens": 54804500.0, "step": 31590 }, { "entropy": 5.716184806823731, "epoch": 2.458198794008948, "grad_norm": 1.25, "learning_rate": 0.00043905891623432754, "loss": 5.0443, "mean_token_accuracy": 0.20390603691339493, "num_tokens": 54812802.0, "step": 31595 }, { "entropy": 5.730127000808716, "epoch": 2.458587823380665, "grad_norm": 1.1796875, "learning_rate": 0.00043903994774069165, "loss": 4.994, "mean_token_accuracy": 0.20891667157411575, "num_tokens": 54821699.0, "step": 31600 }, { "entropy": 5.7126106262207035, "epoch": 2.4589768527523828, "grad_norm": 1.2421875, "learning_rate": 0.0004390209767580107, "loss": 4.982, "mean_token_accuracy": 0.2106185659766197, "num_tokens": 54830808.0, "step": 31605 }, { "entropy": 5.61960735321045, "epoch": 2.4593658821241005, "grad_norm": 1.2421875, "learning_rate": 0.0004390020032865725, "loss": 4.9978, "mean_token_accuracy": 0.2042613595724106, "num_tokens": 54839226.0, "step": 31610 }, { "entropy": 5.764332294464111, "epoch": 2.4597549114958177, "grad_norm": 1.25, "learning_rate": 0.0004389830273266649, "loss": 4.9931, "mean_token_accuracy": 0.20466790348291397, "num_tokens": 54847538.0, "step": 31615 }, { "entropy": 5.716181373596191, "epoch": 2.4601439408675354, "grad_norm": 1.234375, "learning_rate": 0.00043896404887857596, "loss": 5.066, "mean_token_accuracy": 0.19339053630828856, "num_tokens": 54855697.0, "step": 31620 }, { "entropy": 5.6145366668701175, "epoch": 2.460532970239253, "grad_norm": 1.171875, "learning_rate": 0.0004389450679425935, "loss": 4.9242, "mean_token_accuracy": 0.22149752378463744, "num_tokens": 54865044.0, "step": 31625 }, { "entropy": 5.692435026168823, "epoch": 2.460921999610971, "grad_norm": 1.1328125, "learning_rate": 0.0004389260845190055, "loss": 4.9921, "mean_token_accuracy": 0.21142982542514802, "num_tokens": 54874559.0, "step": 31630 }, { "entropy": 5.677493333816528, "epoch": 2.461311028982688, "grad_norm": 1.234375, "learning_rate": 0.00043890709860810014, "loss": 4.9342, "mean_token_accuracy": 0.21648336052894593, "num_tokens": 54882412.0, "step": 31635 }, { "entropy": 5.611321926116943, "epoch": 2.4617000583544058, "grad_norm": 1.234375, "learning_rate": 0.00043888811021016545, "loss": 4.8608, "mean_token_accuracy": 0.2200280860066414, "num_tokens": 54890762.0, "step": 31640 }, { "entropy": 5.6379204273223875, "epoch": 2.4620890877261234, "grad_norm": 1.1953125, "learning_rate": 0.00043886911932548953, "loss": 4.9421, "mean_token_accuracy": 0.21045771837234498, "num_tokens": 54899098.0, "step": 31645 }, { "entropy": 5.655600547790527, "epoch": 2.4624781170978407, "grad_norm": 1.1875, "learning_rate": 0.0004388501259543605, "loss": 4.9764, "mean_token_accuracy": 0.21452776938676835, "num_tokens": 54907471.0, "step": 31650 }, { "entropy": 5.672487068176269, "epoch": 2.4628671464695584, "grad_norm": 1.171875, "learning_rate": 0.0004388311300970667, "loss": 4.9539, "mean_token_accuracy": 0.21161340922117233, "num_tokens": 54915957.0, "step": 31655 }, { "entropy": 5.6851075172424315, "epoch": 2.463256175841276, "grad_norm": 1.2109375, "learning_rate": 0.0004388121317538962, "loss": 4.9243, "mean_token_accuracy": 0.20780953168869018, "num_tokens": 54924850.0, "step": 31660 }, { "entropy": 5.687220239639283, "epoch": 2.463645205212994, "grad_norm": 1.1953125, "learning_rate": 0.0004387931309251374, "loss": 5.0127, "mean_token_accuracy": 0.19894726127386092, "num_tokens": 54933839.0, "step": 31665 }, { "entropy": 5.713906621932983, "epoch": 2.464034234584711, "grad_norm": 1.2421875, "learning_rate": 0.0004387741276110785, "loss": 5.0569, "mean_token_accuracy": 0.20014604479074477, "num_tokens": 54942152.0, "step": 31670 }, { "entropy": 5.702347946166992, "epoch": 2.4644232639564287, "grad_norm": 1.1875, "learning_rate": 0.00043875512181200784, "loss": 5.0384, "mean_token_accuracy": 0.2082337036728859, "num_tokens": 54951597.0, "step": 31675 }, { "entropy": 5.670708847045899, "epoch": 2.4648122933281464, "grad_norm": 1.203125, "learning_rate": 0.0004387361135282139, "loss": 4.9055, "mean_token_accuracy": 0.21602654904127122, "num_tokens": 54960507.0, "step": 31680 }, { "entropy": 5.7032946109771725, "epoch": 2.4652013226998637, "grad_norm": 1.1875, "learning_rate": 0.00043871710275998507, "loss": 5.056, "mean_token_accuracy": 0.19846072942018508, "num_tokens": 54969897.0, "step": 31685 }, { "entropy": 5.735730981826782, "epoch": 2.4655903520715814, "grad_norm": 1.1484375, "learning_rate": 0.0004386980895076097, "loss": 4.9964, "mean_token_accuracy": 0.20097761154174804, "num_tokens": 54978418.0, "step": 31690 }, { "entropy": 5.688509225845337, "epoch": 2.465979381443299, "grad_norm": 1.2265625, "learning_rate": 0.00043867907377137646, "loss": 4.8673, "mean_token_accuracy": 0.2146831378340721, "num_tokens": 54987011.0, "step": 31695 }, { "entropy": 5.635149621963501, "epoch": 2.4663684108150163, "grad_norm": 1.234375, "learning_rate": 0.00043866005555157376, "loss": 4.9547, "mean_token_accuracy": 0.20898949056863786, "num_tokens": 54995402.0, "step": 31700 }, { "entropy": 5.605459976196289, "epoch": 2.466757440186734, "grad_norm": 1.3203125, "learning_rate": 0.0004386410348484903, "loss": 4.9196, "mean_token_accuracy": 0.21309436708688737, "num_tokens": 55003842.0, "step": 31705 }, { "entropy": 5.681981468200684, "epoch": 2.4671464695584517, "grad_norm": 1.2265625, "learning_rate": 0.0004386220116624145, "loss": 4.9936, "mean_token_accuracy": 0.20375392884016036, "num_tokens": 55012213.0, "step": 31710 }, { "entropy": 5.6612461566925045, "epoch": 2.467535498930169, "grad_norm": 1.21875, "learning_rate": 0.00043860298599363506, "loss": 4.9945, "mean_token_accuracy": 0.2041635125875473, "num_tokens": 55021247.0, "step": 31715 }, { "entropy": 5.6500404357910154, "epoch": 2.4679245283018867, "grad_norm": 1.1875, "learning_rate": 0.0004385839578424408, "loss": 4.97, "mean_token_accuracy": 0.2060944050550461, "num_tokens": 55030336.0, "step": 31720 }, { "entropy": 5.639929103851318, "epoch": 2.4683135576736044, "grad_norm": 1.203125, "learning_rate": 0.00043856492720912037, "loss": 4.9456, "mean_token_accuracy": 0.20423865914344788, "num_tokens": 55038551.0, "step": 31725 }, { "entropy": 5.66362361907959, "epoch": 2.468702587045322, "grad_norm": 1.1953125, "learning_rate": 0.0004385458940939624, "loss": 5.0125, "mean_token_accuracy": 0.20334839224815368, "num_tokens": 55047417.0, "step": 31730 }, { "entropy": 5.7419641494750975, "epoch": 2.4690916164170393, "grad_norm": 1.3046875, "learning_rate": 0.0004385268584972559, "loss": 5.0109, "mean_token_accuracy": 0.19610781967639923, "num_tokens": 55055396.0, "step": 31735 }, { "entropy": 5.675347375869751, "epoch": 2.469480645788757, "grad_norm": 1.2734375, "learning_rate": 0.0004385078204192896, "loss": 4.9269, "mean_token_accuracy": 0.2113894298672676, "num_tokens": 55063697.0, "step": 31740 }, { "entropy": 5.666456413269043, "epoch": 2.4698696751604747, "grad_norm": 1.15625, "learning_rate": 0.0004384887798603523, "loss": 5.0027, "mean_token_accuracy": 0.20795352905988693, "num_tokens": 55072697.0, "step": 31745 }, { "entropy": 5.59608907699585, "epoch": 2.470258704532192, "grad_norm": 1.2109375, "learning_rate": 0.000438469736820733, "loss": 4.8748, "mean_token_accuracy": 0.21329332143068314, "num_tokens": 55081077.0, "step": 31750 }, { "entropy": 5.69738359451294, "epoch": 2.4706477339039097, "grad_norm": 1.28125, "learning_rate": 0.00043845069130072067, "loss": 4.9913, "mean_token_accuracy": 0.19986434727907182, "num_tokens": 55089915.0, "step": 31755 }, { "entropy": 5.720067119598388, "epoch": 2.4710367632756274, "grad_norm": 1.15625, "learning_rate": 0.0004384316433006043, "loss": 5.0259, "mean_token_accuracy": 0.19812064617872238, "num_tokens": 55099536.0, "step": 31760 }, { "entropy": 5.730847692489624, "epoch": 2.471425792647345, "grad_norm": 1.25, "learning_rate": 0.00043841259282067276, "loss": 5.0388, "mean_token_accuracy": 0.19697016030550002, "num_tokens": 55108350.0, "step": 31765 }, { "entropy": 5.786119604110718, "epoch": 2.4718148220190623, "grad_norm": 1.296875, "learning_rate": 0.00043839353986121533, "loss": 5.0592, "mean_token_accuracy": 0.20507774800062178, "num_tokens": 55117134.0, "step": 31770 }, { "entropy": 5.710341167449951, "epoch": 2.47220385139078, "grad_norm": 1.2578125, "learning_rate": 0.0004383744844225209, "loss": 4.9746, "mean_token_accuracy": 0.2017264649271965, "num_tokens": 55125821.0, "step": 31775 }, { "entropy": 5.707550477981568, "epoch": 2.4725928807624977, "grad_norm": 1.234375, "learning_rate": 0.00043835542650487875, "loss": 4.9685, "mean_token_accuracy": 0.20483948141336442, "num_tokens": 55135373.0, "step": 31780 }, { "entropy": 5.694150733947754, "epoch": 2.472981910134215, "grad_norm": 1.203125, "learning_rate": 0.0004383363661085781, "loss": 5.0143, "mean_token_accuracy": 0.19905594885349273, "num_tokens": 55144166.0, "step": 31785 }, { "entropy": 5.676385927200317, "epoch": 2.4733709395059327, "grad_norm": 1.3125, "learning_rate": 0.0004383173032339079, "loss": 4.946, "mean_token_accuracy": 0.20544901341199875, "num_tokens": 55152983.0, "step": 31790 }, { "entropy": 5.664535570144653, "epoch": 2.4737599688776504, "grad_norm": 1.25, "learning_rate": 0.0004382982378811577, "loss": 4.8291, "mean_token_accuracy": 0.2129627525806427, "num_tokens": 55160954.0, "step": 31795 }, { "entropy": 5.64508056640625, "epoch": 2.474148998249368, "grad_norm": 1.2734375, "learning_rate": 0.0004382791700506166, "loss": 4.966, "mean_token_accuracy": 0.20942001789808273, "num_tokens": 55169393.0, "step": 31800 }, { "entropy": 5.63147006034851, "epoch": 2.4745380276210853, "grad_norm": 1.171875, "learning_rate": 0.000438260099742574, "loss": 5.0215, "mean_token_accuracy": 0.19730190932750702, "num_tokens": 55178301.0, "step": 31805 }, { "entropy": 5.6634947776794435, "epoch": 2.474927056992803, "grad_norm": 1.15625, "learning_rate": 0.0004382410269573192, "loss": 4.9625, "mean_token_accuracy": 0.2072368323802948, "num_tokens": 55186717.0, "step": 31810 }, { "entropy": 5.6114266872406, "epoch": 2.4753160863645203, "grad_norm": 1.1328125, "learning_rate": 0.00043822195169514167, "loss": 4.8261, "mean_token_accuracy": 0.2229962721467018, "num_tokens": 55195457.0, "step": 31815 }, { "entropy": 5.757020568847656, "epoch": 2.475705115736238, "grad_norm": 1.2890625, "learning_rate": 0.00043820287395633086, "loss": 5.0539, "mean_token_accuracy": 0.20305736511945724, "num_tokens": 55204623.0, "step": 31820 }, { "entropy": 5.654867315292359, "epoch": 2.4760941451079557, "grad_norm": 1.2734375, "learning_rate": 0.0004381837937411761, "loss": 5.0144, "mean_token_accuracy": 0.19713883846998215, "num_tokens": 55213396.0, "step": 31825 }, { "entropy": 5.671772384643555, "epoch": 2.4764831744796734, "grad_norm": 1.203125, "learning_rate": 0.00043816471104996706, "loss": 5.0389, "mean_token_accuracy": 0.20379563719034194, "num_tokens": 55222364.0, "step": 31830 }, { "entropy": 5.6942222118377686, "epoch": 2.4768722038513906, "grad_norm": 1.203125, "learning_rate": 0.0004381456258829933, "loss": 4.9958, "mean_token_accuracy": 0.21020497679710387, "num_tokens": 55230907.0, "step": 31835 }, { "entropy": 5.67466459274292, "epoch": 2.4772612332231083, "grad_norm": 1.2734375, "learning_rate": 0.00043812653824054426, "loss": 4.9878, "mean_token_accuracy": 0.2102232500910759, "num_tokens": 55240047.0, "step": 31840 }, { "entropy": 5.667136096954346, "epoch": 2.477650262594826, "grad_norm": 1.1875, "learning_rate": 0.0004381074481229097, "loss": 4.9281, "mean_token_accuracy": 0.20815111100673675, "num_tokens": 55248631.0, "step": 31845 }, { "entropy": 5.645478439331055, "epoch": 2.4780392919665433, "grad_norm": 1.21875, "learning_rate": 0.0004380883555303791, "loss": 4.93, "mean_token_accuracy": 0.20750757157802582, "num_tokens": 55256785.0, "step": 31850 }, { "entropy": 5.624342727661133, "epoch": 2.478428321338261, "grad_norm": 1.1328125, "learning_rate": 0.0004380692604632424, "loss": 4.9123, "mean_token_accuracy": 0.21617498248815536, "num_tokens": 55265904.0, "step": 31855 }, { "entropy": 5.601974201202393, "epoch": 2.4788173507099787, "grad_norm": 1.2734375, "learning_rate": 0.00043805016292178923, "loss": 4.9088, "mean_token_accuracy": 0.2072703942656517, "num_tokens": 55274223.0, "step": 31860 }, { "entropy": 5.629825401306152, "epoch": 2.4792063800816964, "grad_norm": 1.1875, "learning_rate": 0.0004380310629063094, "loss": 4.9137, "mean_token_accuracy": 0.21248839795589447, "num_tokens": 55282667.0, "step": 31865 }, { "entropy": 5.6558802127838135, "epoch": 2.4795954094534136, "grad_norm": 1.234375, "learning_rate": 0.0004380119604170925, "loss": 5.0206, "mean_token_accuracy": 0.19753156155347823, "num_tokens": 55291207.0, "step": 31870 }, { "entropy": 5.6954515933990475, "epoch": 2.4799844388251313, "grad_norm": 1.171875, "learning_rate": 0.00043799285545442876, "loss": 4.9378, "mean_token_accuracy": 0.2024501919746399, "num_tokens": 55299828.0, "step": 31875 }, { "entropy": 5.772912406921387, "epoch": 2.480373468196849, "grad_norm": 1.28125, "learning_rate": 0.0004379737480186078, "loss": 5.0427, "mean_token_accuracy": 0.19498128443956375, "num_tokens": 55308056.0, "step": 31880 }, { "entropy": 5.731743907928466, "epoch": 2.4807624975685663, "grad_norm": 1.15625, "learning_rate": 0.00043795463810991956, "loss": 5.0808, "mean_token_accuracy": 0.19635724872350693, "num_tokens": 55316888.0, "step": 31885 }, { "entropy": 5.672018194198609, "epoch": 2.481151526940284, "grad_norm": 1.1953125, "learning_rate": 0.0004379355257286541, "loss": 4.9552, "mean_token_accuracy": 0.20273196548223496, "num_tokens": 55325797.0, "step": 31890 }, { "entropy": 5.7102738380432125, "epoch": 2.4815405563120017, "grad_norm": 1.2265625, "learning_rate": 0.00043791641087510136, "loss": 4.9437, "mean_token_accuracy": 0.20762696862220764, "num_tokens": 55335071.0, "step": 31895 }, { "entropy": 5.752525854110718, "epoch": 2.4819295856837194, "grad_norm": 1.234375, "learning_rate": 0.0004378972935495514, "loss": 5.0322, "mean_token_accuracy": 0.2034935846924782, "num_tokens": 55343718.0, "step": 31900 }, { "entropy": 5.656074571609497, "epoch": 2.4823186150554366, "grad_norm": 1.125, "learning_rate": 0.0004378781737522943, "loss": 4.9792, "mean_token_accuracy": 0.20646874159574508, "num_tokens": 55353122.0, "step": 31905 }, { "entropy": 5.6390049934387205, "epoch": 2.4827076444271543, "grad_norm": 1.1640625, "learning_rate": 0.00043785905148362007, "loss": 4.9824, "mean_token_accuracy": 0.20813973546028136, "num_tokens": 55362494.0, "step": 31910 }, { "entropy": 5.775249004364014, "epoch": 2.483096673798872, "grad_norm": 1.3046875, "learning_rate": 0.00043783992674381903, "loss": 5.0456, "mean_token_accuracy": 0.20909199267625808, "num_tokens": 55371383.0, "step": 31915 }, { "entropy": 5.704949378967285, "epoch": 2.4834857031705893, "grad_norm": 1.2421875, "learning_rate": 0.00043782079953318126, "loss": 4.9489, "mean_token_accuracy": 0.2141811117529869, "num_tokens": 55380086.0, "step": 31920 }, { "entropy": 5.586907196044922, "epoch": 2.483874732542307, "grad_norm": 1.1796875, "learning_rate": 0.0004378016698519971, "loss": 4.9311, "mean_token_accuracy": 0.20430454164743422, "num_tokens": 55388971.0, "step": 31925 }, { "entropy": 5.6551319599151615, "epoch": 2.4842637619140246, "grad_norm": 1.2265625, "learning_rate": 0.00043778253770055666, "loss": 4.9261, "mean_token_accuracy": 0.20904773473739624, "num_tokens": 55396820.0, "step": 31930 }, { "entropy": 5.60729284286499, "epoch": 2.484652791285742, "grad_norm": 1.1796875, "learning_rate": 0.00043776340307915033, "loss": 4.8811, "mean_token_accuracy": 0.20773734152317047, "num_tokens": 55405653.0, "step": 31935 }, { "entropy": 5.677891397476197, "epoch": 2.4850418206574596, "grad_norm": 1.1953125, "learning_rate": 0.0004377442659880684, "loss": 4.9746, "mean_token_accuracy": 0.2077256605029106, "num_tokens": 55414397.0, "step": 31940 }, { "entropy": 5.74730110168457, "epoch": 2.4854308500291773, "grad_norm": 1.3125, "learning_rate": 0.0004377251264276013, "loss": 5.0364, "mean_token_accuracy": 0.20087112933397294, "num_tokens": 55422057.0, "step": 31945 }, { "entropy": 5.6124410152435305, "epoch": 2.4858198794008945, "grad_norm": 1.359375, "learning_rate": 0.00043770598439803936, "loss": 4.894, "mean_token_accuracy": 0.21265334039926528, "num_tokens": 55430084.0, "step": 31950 }, { "entropy": 5.731271886825562, "epoch": 2.4862089087726122, "grad_norm": 1.375, "learning_rate": 0.00043768683989967304, "loss": 5.0498, "mean_token_accuracy": 0.20552590638399124, "num_tokens": 55438551.0, "step": 31955 }, { "entropy": 5.608238935470581, "epoch": 2.48659793814433, "grad_norm": 1.2734375, "learning_rate": 0.00043766769293279294, "loss": 4.7725, "mean_token_accuracy": 0.21722216308116912, "num_tokens": 55446862.0, "step": 31960 }, { "entropy": 5.644069194793701, "epoch": 2.4869869675160476, "grad_norm": 1.3203125, "learning_rate": 0.00043764854349768957, "loss": 4.9436, "mean_token_accuracy": 0.21209183931350709, "num_tokens": 55455254.0, "step": 31965 }, { "entropy": 5.680535554885864, "epoch": 2.487375996887765, "grad_norm": 1.2734375, "learning_rate": 0.00043762939159465333, "loss": 5.0136, "mean_token_accuracy": 0.20971533954143523, "num_tokens": 55463426.0, "step": 31970 }, { "entropy": 5.711111688613892, "epoch": 2.4877650262594826, "grad_norm": 1.2578125, "learning_rate": 0.00043761023722397495, "loss": 4.9939, "mean_token_accuracy": 0.2080627664923668, "num_tokens": 55471543.0, "step": 31975 }, { "entropy": 5.7546099662780765, "epoch": 2.4881540556312003, "grad_norm": 1.1953125, "learning_rate": 0.000437591080385945, "loss": 5.0565, "mean_token_accuracy": 0.19794660955667495, "num_tokens": 55480118.0, "step": 31980 }, { "entropy": 5.644216823577881, "epoch": 2.4885430850029175, "grad_norm": 1.2578125, "learning_rate": 0.0004375719210808543, "loss": 4.852, "mean_token_accuracy": 0.21419955044984818, "num_tokens": 55488818.0, "step": 31985 }, { "entropy": 5.740829229354858, "epoch": 2.4889321143746352, "grad_norm": 1.359375, "learning_rate": 0.0004375527593089934, "loss": 5.0001, "mean_token_accuracy": 0.2065274953842163, "num_tokens": 55497576.0, "step": 31990 }, { "entropy": 5.767935514450073, "epoch": 2.489321143746353, "grad_norm": 1.2890625, "learning_rate": 0.0004375335950706531, "loss": 5.0826, "mean_token_accuracy": 0.2017228290438652, "num_tokens": 55505892.0, "step": 31995 }, { "entropy": 5.681882572174072, "epoch": 2.4897101731180706, "grad_norm": 1.328125, "learning_rate": 0.0004375144283661242, "loss": 4.9457, "mean_token_accuracy": 0.20213755667209626, "num_tokens": 55514595.0, "step": 32000 }, { "entropy": 5.66088171005249, "epoch": 2.490099202489788, "grad_norm": 1.265625, "learning_rate": 0.0004374952591956975, "loss": 5.005, "mean_token_accuracy": 0.19875537902116774, "num_tokens": 55523681.0, "step": 32005 }, { "entropy": 5.684203815460205, "epoch": 2.4904882318615056, "grad_norm": 1.2578125, "learning_rate": 0.00043747608755966396, "loss": 4.9178, "mean_token_accuracy": 0.21048945039510727, "num_tokens": 55532368.0, "step": 32010 }, { "entropy": 5.655999422073364, "epoch": 2.4908772612332233, "grad_norm": 1.1796875, "learning_rate": 0.0004374569134583143, "loss": 4.9837, "mean_token_accuracy": 0.20949650853872298, "num_tokens": 55541873.0, "step": 32015 }, { "entropy": 5.695771932601929, "epoch": 2.4912662906049405, "grad_norm": 1.9921875, "learning_rate": 0.0004374377368919396, "loss": 4.9884, "mean_token_accuracy": 0.20825198143720627, "num_tokens": 55551094.0, "step": 32020 }, { "entropy": 5.713011074066162, "epoch": 2.4916553199766582, "grad_norm": 1.21875, "learning_rate": 0.00043741855786083085, "loss": 4.9271, "mean_token_accuracy": 0.21307261735200883, "num_tokens": 55559378.0, "step": 32025 }, { "entropy": 5.692988538742066, "epoch": 2.492044349348376, "grad_norm": 1.203125, "learning_rate": 0.00043739937636527894, "loss": 5.0975, "mean_token_accuracy": 0.1969159349799156, "num_tokens": 55568134.0, "step": 32030 }, { "entropy": 5.7495428085327145, "epoch": 2.492433378720093, "grad_norm": 1.203125, "learning_rate": 0.00043738019240557494, "loss": 5.025, "mean_token_accuracy": 0.19781984239816666, "num_tokens": 55576962.0, "step": 32035 }, { "entropy": 5.746601200103759, "epoch": 2.492822408091811, "grad_norm": 1.21875, "learning_rate": 0.00043736100598201, "loss": 4.9801, "mean_token_accuracy": 0.20618593990802764, "num_tokens": 55585944.0, "step": 32040 }, { "entropy": 5.657977342605591, "epoch": 2.4932114374635286, "grad_norm": 1.2109375, "learning_rate": 0.0004373418170948752, "loss": 4.9888, "mean_token_accuracy": 0.2016979292035103, "num_tokens": 55594964.0, "step": 32045 }, { "entropy": 5.671987819671631, "epoch": 2.493600466835246, "grad_norm": 1.2421875, "learning_rate": 0.0004373226257444617, "loss": 4.9593, "mean_token_accuracy": 0.20406342148780823, "num_tokens": 55604344.0, "step": 32050 }, { "entropy": 5.66226806640625, "epoch": 2.4939894962069635, "grad_norm": 1.21875, "learning_rate": 0.0004373034319310608, "loss": 4.9294, "mean_token_accuracy": 0.20238882601261138, "num_tokens": 55612146.0, "step": 32055 }, { "entropy": 5.633600187301636, "epoch": 2.4943785255786812, "grad_norm": 1.1328125, "learning_rate": 0.00043728423565496367, "loss": 4.9587, "mean_token_accuracy": 0.19904157221317292, "num_tokens": 55621070.0, "step": 32060 }, { "entropy": 5.631651878356934, "epoch": 2.494767554950399, "grad_norm": 1.1796875, "learning_rate": 0.0004372650369164615, "loss": 4.944, "mean_token_accuracy": 0.21302301585674285, "num_tokens": 55629541.0, "step": 32065 }, { "entropy": 5.735749244689941, "epoch": 2.495156584322116, "grad_norm": 1.2109375, "learning_rate": 0.00043724583571584565, "loss": 4.9637, "mean_token_accuracy": 0.21011031419038773, "num_tokens": 55637915.0, "step": 32070 }, { "entropy": 5.684532880783081, "epoch": 2.495545613693834, "grad_norm": 1.203125, "learning_rate": 0.00043722663205340753, "loss": 4.9288, "mean_token_accuracy": 0.2060002028942108, "num_tokens": 55645832.0, "step": 32075 }, { "entropy": 5.640752172470092, "epoch": 2.4959346430655516, "grad_norm": 1.1796875, "learning_rate": 0.0004372074259294384, "loss": 4.8776, "mean_token_accuracy": 0.21371103078126907, "num_tokens": 55654035.0, "step": 32080 }, { "entropy": 5.649341630935669, "epoch": 2.496323672437269, "grad_norm": 1.203125, "learning_rate": 0.0004371882173442299, "loss": 5.0314, "mean_token_accuracy": 0.19378727823495864, "num_tokens": 55663520.0, "step": 32085 }, { "entropy": 5.737103891372681, "epoch": 2.4967127018089865, "grad_norm": 1.1484375, "learning_rate": 0.00043716900629807323, "loss": 5.021, "mean_token_accuracy": 0.2035091519355774, "num_tokens": 55672448.0, "step": 32090 }, { "entropy": 5.755094003677368, "epoch": 2.497101731180704, "grad_norm": 1.109375, "learning_rate": 0.00043714979279126006, "loss": 4.9929, "mean_token_accuracy": 0.20535364300012587, "num_tokens": 55681389.0, "step": 32095 }, { "entropy": 5.7384827613830565, "epoch": 2.497490760552422, "grad_norm": 1.1796875, "learning_rate": 0.0004371305768240818, "loss": 5.048, "mean_token_accuracy": 0.20075265616178511, "num_tokens": 55690143.0, "step": 32100 }, { "entropy": 5.699243593215942, "epoch": 2.497879789924139, "grad_norm": 1.2421875, "learning_rate": 0.0004371113583968302, "loss": 4.9845, "mean_token_accuracy": 0.20367400199174882, "num_tokens": 55698097.0, "step": 32105 }, { "entropy": 5.661271381378174, "epoch": 2.498268819295857, "grad_norm": 1.15625, "learning_rate": 0.0004370921375097967, "loss": 4.9911, "mean_token_accuracy": 0.20679828971624375, "num_tokens": 55706570.0, "step": 32110 }, { "entropy": 5.686183166503906, "epoch": 2.4986578486675746, "grad_norm": 1.2578125, "learning_rate": 0.00043707291416327307, "loss": 4.8858, "mean_token_accuracy": 0.20662733167409897, "num_tokens": 55715926.0, "step": 32115 }, { "entropy": 5.648556137084961, "epoch": 2.499046878039292, "grad_norm": 1.21875, "learning_rate": 0.0004370536883575509, "loss": 4.882, "mean_token_accuracy": 0.2083893224596977, "num_tokens": 55724313.0, "step": 32120 }, { "entropy": 5.66943621635437, "epoch": 2.4994359074110095, "grad_norm": 1.2578125, "learning_rate": 0.0004370344600929219, "loss": 5.031, "mean_token_accuracy": 0.20136660039424897, "num_tokens": 55732197.0, "step": 32125 }, { "entropy": 5.598745918273925, "epoch": 2.499824936782727, "grad_norm": 1.265625, "learning_rate": 0.0004370152293696779, "loss": 4.882, "mean_token_accuracy": 0.21106997281312942, "num_tokens": 55740428.0, "step": 32130 }, { "entropy": 5.648098611831665, "epoch": 2.500213966154445, "grad_norm": 1.2109375, "learning_rate": 0.0004369959961881107, "loss": 4.9341, "mean_token_accuracy": 0.20415072590112687, "num_tokens": 55748832.0, "step": 32135 }, { "entropy": 5.725146150588989, "epoch": 2.500602995526162, "grad_norm": 1.3828125, "learning_rate": 0.000436976760548512, "loss": 5.0285, "mean_token_accuracy": 0.2077835977077484, "num_tokens": 55757717.0, "step": 32140 }, { "entropy": 5.625393867492676, "epoch": 2.50099202489788, "grad_norm": 1.28125, "learning_rate": 0.00043695752245117393, "loss": 4.9447, "mean_token_accuracy": 0.20914046913385392, "num_tokens": 55765763.0, "step": 32145 }, { "entropy": 5.7464649200439455, "epoch": 2.501381054269597, "grad_norm": 1.171875, "learning_rate": 0.0004369382818963882, "loss": 5.0761, "mean_token_accuracy": 0.205593079328537, "num_tokens": 55774683.0, "step": 32150 }, { "entropy": 5.690613555908203, "epoch": 2.501770083641315, "grad_norm": 1.2265625, "learning_rate": 0.0004369190388844467, "loss": 4.9595, "mean_token_accuracy": 0.20448861867189408, "num_tokens": 55782998.0, "step": 32155 }, { "entropy": 5.681671905517578, "epoch": 2.5021591130130325, "grad_norm": 1.1796875, "learning_rate": 0.00043689979341564154, "loss": 4.9503, "mean_token_accuracy": 0.21488549709320068, "num_tokens": 55791411.0, "step": 32160 }, { "entropy": 5.651175880432129, "epoch": 2.50254814238475, "grad_norm": 1.234375, "learning_rate": 0.0004368805454902648, "loss": 4.9569, "mean_token_accuracy": 0.20857308357954024, "num_tokens": 55800169.0, "step": 32165 }, { "entropy": 5.646779727935791, "epoch": 2.5029371717564675, "grad_norm": 1.140625, "learning_rate": 0.00043686129510860826, "loss": 4.9692, "mean_token_accuracy": 0.20576000809669495, "num_tokens": 55809168.0, "step": 32170 }, { "entropy": 5.6551258087158205, "epoch": 2.503326201128185, "grad_norm": 1.3359375, "learning_rate": 0.00043684204227096435, "loss": 4.9526, "mean_token_accuracy": 0.20671856999397278, "num_tokens": 55817824.0, "step": 32175 }, { "entropy": 5.670963907241822, "epoch": 2.503715230499903, "grad_norm": 1.2578125, "learning_rate": 0.000436822786977625, "loss": 4.9601, "mean_token_accuracy": 0.2034686878323555, "num_tokens": 55825851.0, "step": 32180 }, { "entropy": 5.583332586288452, "epoch": 2.50410425987162, "grad_norm": 1.1484375, "learning_rate": 0.00043680352922888244, "loss": 4.8411, "mean_token_accuracy": 0.2108028545975685, "num_tokens": 55834862.0, "step": 32185 }, { "entropy": 5.655129384994507, "epoch": 2.504493289243338, "grad_norm": 1.2265625, "learning_rate": 0.0004367842690250288, "loss": 4.9305, "mean_token_accuracy": 0.2119355618953705, "num_tokens": 55843267.0, "step": 32190 }, { "entropy": 5.60051908493042, "epoch": 2.5048823186150555, "grad_norm": 1.28125, "learning_rate": 0.0004367650063663565, "loss": 4.9135, "mean_token_accuracy": 0.20874572098255156, "num_tokens": 55851458.0, "step": 32195 }, { "entropy": 5.7406857967376705, "epoch": 2.505271347986773, "grad_norm": 1.296875, "learning_rate": 0.0004367457412531576, "loss": 5.1316, "mean_token_accuracy": 0.1927231252193451, "num_tokens": 55860271.0, "step": 32200 }, { "entropy": 5.656378126144409, "epoch": 2.5056603773584905, "grad_norm": 1.3125, "learning_rate": 0.0004367264736857245, "loss": 4.9159, "mean_token_accuracy": 0.20747559368610383, "num_tokens": 55868695.0, "step": 32205 }, { "entropy": 5.706352233886719, "epoch": 2.506049406730208, "grad_norm": 1.2578125, "learning_rate": 0.0004367072036643497, "loss": 4.9222, "mean_token_accuracy": 0.207609324157238, "num_tokens": 55877166.0, "step": 32210 }, { "entropy": 5.708856582641602, "epoch": 2.506438436101926, "grad_norm": 1.2265625, "learning_rate": 0.00043668793118932536, "loss": 5.0376, "mean_token_accuracy": 0.20696360021829605, "num_tokens": 55886129.0, "step": 32215 }, { "entropy": 5.723817920684814, "epoch": 2.506827465473643, "grad_norm": 1.2890625, "learning_rate": 0.00043666865626094405, "loss": 4.9569, "mean_token_accuracy": 0.20683227628469467, "num_tokens": 55895090.0, "step": 32220 }, { "entropy": 5.776579809188843, "epoch": 2.507216494845361, "grad_norm": 1.2265625, "learning_rate": 0.00043664937887949825, "loss": 5.0311, "mean_token_accuracy": 0.202361561357975, "num_tokens": 55903231.0, "step": 32225 }, { "entropy": 5.640281772613525, "epoch": 2.5076055242170785, "grad_norm": 1.21875, "learning_rate": 0.0004366300990452803, "loss": 4.9052, "mean_token_accuracy": 0.21507373899221421, "num_tokens": 55912282.0, "step": 32230 }, { "entropy": 5.634460210800171, "epoch": 2.507994553588796, "grad_norm": 1.2109375, "learning_rate": 0.00043661081675858295, "loss": 4.9878, "mean_token_accuracy": 0.2084139883518219, "num_tokens": 55920871.0, "step": 32235 }, { "entropy": 5.752755355834961, "epoch": 2.5083835829605134, "grad_norm": 1.1328125, "learning_rate": 0.00043659153201969865, "loss": 5.0595, "mean_token_accuracy": 0.20084677189588546, "num_tokens": 55929787.0, "step": 32240 }, { "entropy": 5.796993684768677, "epoch": 2.508772612332231, "grad_norm": 1.2734375, "learning_rate": 0.0004365722448289201, "loss": 5.0384, "mean_token_accuracy": 0.2032591298222542, "num_tokens": 55938747.0, "step": 32245 }, { "entropy": 5.760586738586426, "epoch": 2.5091616417039484, "grad_norm": 1.3125, "learning_rate": 0.0004365529551865399, "loss": 4.9834, "mean_token_accuracy": 0.20517097413539886, "num_tokens": 55947063.0, "step": 32250 }, { "entropy": 5.653596687316894, "epoch": 2.509550671075666, "grad_norm": 1.2109375, "learning_rate": 0.00043653366309285066, "loss": 4.9701, "mean_token_accuracy": 0.20922656655311583, "num_tokens": 55955871.0, "step": 32255 }, { "entropy": 5.6612584590911865, "epoch": 2.509939700447384, "grad_norm": 1.3046875, "learning_rate": 0.0004365143685481452, "loss": 4.8564, "mean_token_accuracy": 0.21618293970823288, "num_tokens": 55965018.0, "step": 32260 }, { "entropy": 5.657132244110107, "epoch": 2.5103287298191015, "grad_norm": 1.1796875, "learning_rate": 0.0004364950715527164, "loss": 4.9132, "mean_token_accuracy": 0.21198441386222838, "num_tokens": 55973687.0, "step": 32265 }, { "entropy": 5.658427333831787, "epoch": 2.5107177591908187, "grad_norm": 1.2578125, "learning_rate": 0.0004364757721068568, "loss": 4.8577, "mean_token_accuracy": 0.2087695762515068, "num_tokens": 55981783.0, "step": 32270 }, { "entropy": 5.726798152923584, "epoch": 2.5111067885625364, "grad_norm": 1.2421875, "learning_rate": 0.00043645647021085945, "loss": 5.1571, "mean_token_accuracy": 0.1963214322924614, "num_tokens": 55990266.0, "step": 32275 }, { "entropy": 5.685345983505249, "epoch": 2.511495817934254, "grad_norm": 1.2109375, "learning_rate": 0.00043643716586501706, "loss": 4.9528, "mean_token_accuracy": 0.20877471566200256, "num_tokens": 55998788.0, "step": 32280 }, { "entropy": 5.705431699752808, "epoch": 2.5118848473059714, "grad_norm": 1.1484375, "learning_rate": 0.00043641785906962276, "loss": 5.0009, "mean_token_accuracy": 0.20321722477674484, "num_tokens": 56007835.0, "step": 32285 }, { "entropy": 5.636080074310303, "epoch": 2.512273876677689, "grad_norm": 1.265625, "learning_rate": 0.0004363985498249693, "loss": 4.8876, "mean_token_accuracy": 0.21303538084030152, "num_tokens": 56016008.0, "step": 32290 }, { "entropy": 5.654402208328247, "epoch": 2.512662906049407, "grad_norm": 1.140625, "learning_rate": 0.00043637923813134974, "loss": 4.9636, "mean_token_accuracy": 0.21099064499139786, "num_tokens": 56025231.0, "step": 32295 }, { "entropy": 5.716175270080567, "epoch": 2.5130519354211245, "grad_norm": 1.1875, "learning_rate": 0.00043635992398905713, "loss": 4.9576, "mean_token_accuracy": 0.20109148919582367, "num_tokens": 56033471.0, "step": 32300 }, { "entropy": 5.69792742729187, "epoch": 2.5134409647928417, "grad_norm": 1.15625, "learning_rate": 0.0004363406073983844, "loss": 4.9316, "mean_token_accuracy": 0.2071823701262474, "num_tokens": 56041729.0, "step": 32305 }, { "entropy": 5.7276369571685795, "epoch": 2.5138299941645594, "grad_norm": 1.140625, "learning_rate": 0.00043632128835962485, "loss": 5.0065, "mean_token_accuracy": 0.2059928610920906, "num_tokens": 56051055.0, "step": 32310 }, { "entropy": 5.737316274642945, "epoch": 2.514219023536277, "grad_norm": 1.296875, "learning_rate": 0.00043630196687307156, "loss": 4.9655, "mean_token_accuracy": 0.20673743188381194, "num_tokens": 56059629.0, "step": 32315 }, { "entropy": 5.6228334426879885, "epoch": 2.5146080529079944, "grad_norm": 1.296875, "learning_rate": 0.0004362826429390176, "loss": 4.9465, "mean_token_accuracy": 0.20814375281333924, "num_tokens": 56069334.0, "step": 32320 }, { "entropy": 5.714158201217652, "epoch": 2.514997082279712, "grad_norm": 1.1953125, "learning_rate": 0.00043626331655775624, "loss": 5.0098, "mean_token_accuracy": 0.2045416310429573, "num_tokens": 56078113.0, "step": 32325 }, { "entropy": 5.661888170242309, "epoch": 2.51538611165143, "grad_norm": 1.2265625, "learning_rate": 0.00043624398772958075, "loss": 4.921, "mean_token_accuracy": 0.21139978021383285, "num_tokens": 56086378.0, "step": 32330 }, { "entropy": 5.700076389312744, "epoch": 2.5157751410231475, "grad_norm": 1.1953125, "learning_rate": 0.0004362246564547844, "loss": 4.9781, "mean_token_accuracy": 0.2089908853173256, "num_tokens": 56095126.0, "step": 32335 }, { "entropy": 5.673971509933471, "epoch": 2.5161641703948647, "grad_norm": 1.09375, "learning_rate": 0.00043620532273366044, "loss": 5.0322, "mean_token_accuracy": 0.20550710409879686, "num_tokens": 56105130.0, "step": 32340 }, { "entropy": 5.675560808181762, "epoch": 2.5165531997665824, "grad_norm": 1.1328125, "learning_rate": 0.0004361859865665024, "loss": 4.9589, "mean_token_accuracy": 0.209336294233799, "num_tokens": 56113925.0, "step": 32345 }, { "entropy": 5.6971235275268555, "epoch": 2.5169422291382997, "grad_norm": 1.3203125, "learning_rate": 0.00043616664795360346, "loss": 4.938, "mean_token_accuracy": 0.20908759385347367, "num_tokens": 56121961.0, "step": 32350 }, { "entropy": 5.627387857437133, "epoch": 2.5173312585100174, "grad_norm": 1.2109375, "learning_rate": 0.00043614730689525716, "loss": 4.895, "mean_token_accuracy": 0.20576364248991014, "num_tokens": 56129809.0, "step": 32355 }, { "entropy": 5.641656875610352, "epoch": 2.517720287881735, "grad_norm": 1.1875, "learning_rate": 0.00043612796339175707, "loss": 4.938, "mean_token_accuracy": 0.21156662404537202, "num_tokens": 56139118.0, "step": 32360 }, { "entropy": 5.711101531982422, "epoch": 2.5181093172534528, "grad_norm": 1.3515625, "learning_rate": 0.00043610861744339653, "loss": 4.9473, "mean_token_accuracy": 0.20853212773799895, "num_tokens": 56148134.0, "step": 32365 }, { "entropy": 5.714322710037232, "epoch": 2.5184983466251705, "grad_norm": 1.265625, "learning_rate": 0.0004360892690504692, "loss": 5.0432, "mean_token_accuracy": 0.20284264385700226, "num_tokens": 56157207.0, "step": 32370 }, { "entropy": 5.626499605178833, "epoch": 2.5188873759968877, "grad_norm": 1.2890625, "learning_rate": 0.0004360699182132685, "loss": 4.9737, "mean_token_accuracy": 0.21440672427415847, "num_tokens": 56165510.0, "step": 32375 }, { "entropy": 5.652453136444092, "epoch": 2.5192764053686054, "grad_norm": 1.1953125, "learning_rate": 0.00043605056493208825, "loss": 4.8664, "mean_token_accuracy": 0.213122221827507, "num_tokens": 56174151.0, "step": 32380 }, { "entropy": 5.689515781402588, "epoch": 2.5196654347403227, "grad_norm": 1.2109375, "learning_rate": 0.000436031209207222, "loss": 4.9583, "mean_token_accuracy": 0.21207275092601777, "num_tokens": 56183834.0, "step": 32385 }, { "entropy": 5.722074127197265, "epoch": 2.5200544641120404, "grad_norm": 1.15625, "learning_rate": 0.00043601185103896346, "loss": 4.9901, "mean_token_accuracy": 0.2123647764325142, "num_tokens": 56192492.0, "step": 32390 }, { "entropy": 5.622499179840088, "epoch": 2.520443493483758, "grad_norm": 1.1171875, "learning_rate": 0.00043599249042760636, "loss": 4.8951, "mean_token_accuracy": 0.2121364563703537, "num_tokens": 56201795.0, "step": 32395 }, { "entropy": 5.699419593811035, "epoch": 2.5208325228554758, "grad_norm": 1.1953125, "learning_rate": 0.00043597312737344446, "loss": 5.0688, "mean_token_accuracy": 0.20700410157442092, "num_tokens": 56210586.0, "step": 32400 }, { "entropy": 5.743770503997803, "epoch": 2.521221552227193, "grad_norm": 1.25, "learning_rate": 0.00043595376187677157, "loss": 5.0538, "mean_token_accuracy": 0.19940631985664367, "num_tokens": 56219512.0, "step": 32405 }, { "entropy": 5.7590395450592045, "epoch": 2.5216105815989107, "grad_norm": 1.203125, "learning_rate": 0.00043593439393788147, "loss": 4.9602, "mean_token_accuracy": 0.20781890600919722, "num_tokens": 56228709.0, "step": 32410 }, { "entropy": 5.638609838485718, "epoch": 2.5219996109706284, "grad_norm": 1.1171875, "learning_rate": 0.0004359150235570682, "loss": 5.0092, "mean_token_accuracy": 0.2033781334757805, "num_tokens": 56238071.0, "step": 32415 }, { "entropy": 5.6474395275115965, "epoch": 2.5223886403423457, "grad_norm": 1.2421875, "learning_rate": 0.0004358956507346255, "loss": 4.9463, "mean_token_accuracy": 0.20622272789478302, "num_tokens": 56246818.0, "step": 32420 }, { "entropy": 5.819520139694214, "epoch": 2.5227776697140634, "grad_norm": 1.2890625, "learning_rate": 0.0004358762754708474, "loss": 5.0734, "mean_token_accuracy": 0.20656449794769288, "num_tokens": 56255330.0, "step": 32425 }, { "entropy": 5.701710987091064, "epoch": 2.523166699085781, "grad_norm": 1.3359375, "learning_rate": 0.00043585689776602795, "loss": 4.9373, "mean_token_accuracy": 0.20782554447650908, "num_tokens": 56264482.0, "step": 32430 }, { "entropy": 5.726718854904175, "epoch": 2.5235557284574988, "grad_norm": 1.140625, "learning_rate": 0.00043583751762046104, "loss": 5.0149, "mean_token_accuracy": 0.20012907534837723, "num_tokens": 56273230.0, "step": 32435 }, { "entropy": 5.682690954208374, "epoch": 2.523944757829216, "grad_norm": 1.2109375, "learning_rate": 0.0004358181350344408, "loss": 4.9106, "mean_token_accuracy": 0.21130677312612534, "num_tokens": 56281639.0, "step": 32440 }, { "entropy": 5.621569442749023, "epoch": 2.5243337872009337, "grad_norm": 1.203125, "learning_rate": 0.0004357987500082613, "loss": 4.9278, "mean_token_accuracy": 0.2043316885828972, "num_tokens": 56289680.0, "step": 32445 }, { "entropy": 5.635527753829956, "epoch": 2.524722816572651, "grad_norm": 1.1640625, "learning_rate": 0.00043577936254221675, "loss": 4.9388, "mean_token_accuracy": 0.21374280452728273, "num_tokens": 56298091.0, "step": 32450 }, { "entropy": 5.7402314186096195, "epoch": 2.5251118459443687, "grad_norm": 1.21875, "learning_rate": 0.0004357599726366013, "loss": 5.0298, "mean_token_accuracy": 0.19726824015378952, "num_tokens": 56307662.0, "step": 32455 }, { "entropy": 5.755006980895996, "epoch": 2.5255008753160864, "grad_norm": 1.2734375, "learning_rate": 0.0004357405802917091, "loss": 4.9867, "mean_token_accuracy": 0.2072552040219307, "num_tokens": 56316147.0, "step": 32460 }, { "entropy": 5.654056167602539, "epoch": 2.525889904687804, "grad_norm": 1.265625, "learning_rate": 0.0004357211855078345, "loss": 5.0311, "mean_token_accuracy": 0.20124156326055526, "num_tokens": 56324270.0, "step": 32465 }, { "entropy": 5.696562385559082, "epoch": 2.5262789340595218, "grad_norm": 1.28125, "learning_rate": 0.00043570178828527157, "loss": 5.0262, "mean_token_accuracy": 0.19444778859615325, "num_tokens": 56333209.0, "step": 32470 }, { "entropy": 5.695141315460205, "epoch": 2.526667963431239, "grad_norm": 1.21875, "learning_rate": 0.0004356823886243149, "loss": 4.92, "mean_token_accuracy": 0.21222498416900634, "num_tokens": 56341784.0, "step": 32475 }, { "entropy": 5.714824151992798, "epoch": 2.5270569928029567, "grad_norm": 1.203125, "learning_rate": 0.00043566298652525875, "loss": 4.9896, "mean_token_accuracy": 0.1996238797903061, "num_tokens": 56350607.0, "step": 32480 }, { "entropy": 5.6874607563018795, "epoch": 2.527446022174674, "grad_norm": 1.234375, "learning_rate": 0.00043564358198839746, "loss": 5.006, "mean_token_accuracy": 0.20309099406003953, "num_tokens": 56359135.0, "step": 32485 }, { "entropy": 5.71419768333435, "epoch": 2.5278350515463917, "grad_norm": 1.21875, "learning_rate": 0.0004356241750140256, "loss": 5.0156, "mean_token_accuracy": 0.207475246489048, "num_tokens": 56367524.0, "step": 32490 }, { "entropy": 5.666716527938843, "epoch": 2.5282240809181094, "grad_norm": 1.1953125, "learning_rate": 0.00043560476560243743, "loss": 4.9542, "mean_token_accuracy": 0.2057400956749916, "num_tokens": 56376976.0, "step": 32495 }, { "entropy": 5.669465637207031, "epoch": 2.528613110289827, "grad_norm": 1.1015625, "learning_rate": 0.0004355853537539276, "loss": 5.0016, "mean_token_accuracy": 0.20162253230810165, "num_tokens": 56385576.0, "step": 32500 }, { "entropy": 5.760670804977417, "epoch": 2.5290021396615443, "grad_norm": 1.171875, "learning_rate": 0.0004355659394687906, "loss": 5.0202, "mean_token_accuracy": 0.21134088337421417, "num_tokens": 56395144.0, "step": 32505 }, { "entropy": 5.742590379714966, "epoch": 2.529391169033262, "grad_norm": 1.328125, "learning_rate": 0.0004355465227473211, "loss": 4.9856, "mean_token_accuracy": 0.20283859521150588, "num_tokens": 56403779.0, "step": 32510 }, { "entropy": 5.694804859161377, "epoch": 2.5297801984049797, "grad_norm": 1.2109375, "learning_rate": 0.0004355271035898136, "loss": 5.0084, "mean_token_accuracy": 0.19875340461730956, "num_tokens": 56413389.0, "step": 32515 }, { "entropy": 5.7027078628540036, "epoch": 2.530169227776697, "grad_norm": 1.15625, "learning_rate": 0.0004355076819965628, "loss": 5.007, "mean_token_accuracy": 0.2044414237141609, "num_tokens": 56421475.0, "step": 32520 }, { "entropy": 5.731250762939453, "epoch": 2.5305582571484146, "grad_norm": 1.2734375, "learning_rate": 0.00043548825796786353, "loss": 4.9674, "mean_token_accuracy": 0.2083599954843521, "num_tokens": 56429590.0, "step": 32525 }, { "entropy": 5.640769052505493, "epoch": 2.5309472865201323, "grad_norm": 1.1953125, "learning_rate": 0.00043546883150401023, "loss": 4.9511, "mean_token_accuracy": 0.21199076175689696, "num_tokens": 56438572.0, "step": 32530 }, { "entropy": 5.651857995986939, "epoch": 2.53133631589185, "grad_norm": 1.21875, "learning_rate": 0.00043544940260529787, "loss": 4.9107, "mean_token_accuracy": 0.2105289801955223, "num_tokens": 56446939.0, "step": 32535 }, { "entropy": 5.719775915145874, "epoch": 2.5317253452635673, "grad_norm": 1.203125, "learning_rate": 0.0004354299712720213, "loss": 4.9146, "mean_token_accuracy": 0.20464773178100587, "num_tokens": 56456178.0, "step": 32540 }, { "entropy": 5.701127624511718, "epoch": 2.532114374635285, "grad_norm": 1.25, "learning_rate": 0.0004354105375044752, "loss": 4.9883, "mean_token_accuracy": 0.2014423966407776, "num_tokens": 56464847.0, "step": 32545 }, { "entropy": 5.698019886016846, "epoch": 2.5325034040070027, "grad_norm": 1.3046875, "learning_rate": 0.00043539110130295445, "loss": 4.9591, "mean_token_accuracy": 0.2068748027086258, "num_tokens": 56473416.0, "step": 32550 }, { "entropy": 5.652522420883178, "epoch": 2.53289243337872, "grad_norm": 1.1953125, "learning_rate": 0.00043537166266775405, "loss": 5.0004, "mean_token_accuracy": 0.20531934052705764, "num_tokens": 56481756.0, "step": 32555 }, { "entropy": 5.7069353580474855, "epoch": 2.5332814627504376, "grad_norm": 1.2265625, "learning_rate": 0.000435352221599169, "loss": 5.0086, "mean_token_accuracy": 0.20639286935329437, "num_tokens": 56490384.0, "step": 32560 }, { "entropy": 5.7193603515625, "epoch": 2.5336704921221553, "grad_norm": 1.203125, "learning_rate": 0.0004353327780974941, "loss": 4.9694, "mean_token_accuracy": 0.20970795303583145, "num_tokens": 56498858.0, "step": 32565 }, { "entropy": 5.717054939270019, "epoch": 2.534059521493873, "grad_norm": 1.265625, "learning_rate": 0.0004353133321630246, "loss": 5.0235, "mean_token_accuracy": 0.2046177104115486, "num_tokens": 56507182.0, "step": 32570 }, { "entropy": 5.655843496322632, "epoch": 2.5344485508655903, "grad_norm": 1.2265625, "learning_rate": 0.0004352938837960554, "loss": 4.9393, "mean_token_accuracy": 0.20523628890514373, "num_tokens": 56515912.0, "step": 32575 }, { "entropy": 5.662250518798828, "epoch": 2.534837580237308, "grad_norm": 1.296875, "learning_rate": 0.00043527443299688166, "loss": 4.9548, "mean_token_accuracy": 0.21039534062147142, "num_tokens": 56523888.0, "step": 32580 }, { "entropy": 5.764285850524902, "epoch": 2.5352266096090252, "grad_norm": 1.25, "learning_rate": 0.00043525497976579843, "loss": 5.0283, "mean_token_accuracy": 0.20337315350770951, "num_tokens": 56533117.0, "step": 32585 }, { "entropy": 5.672673940658569, "epoch": 2.535615638980743, "grad_norm": 1.234375, "learning_rate": 0.000435235524103101, "loss": 4.9455, "mean_token_accuracy": 0.20398035198450087, "num_tokens": 56541633.0, "step": 32590 }, { "entropy": 5.716252565383911, "epoch": 2.5360046683524606, "grad_norm": 1.2421875, "learning_rate": 0.0004352160660090846, "loss": 4.964, "mean_token_accuracy": 0.20609863400459288, "num_tokens": 56551123.0, "step": 32595 }, { "entropy": 5.677213954925537, "epoch": 2.5363936977241783, "grad_norm": 1.2421875, "learning_rate": 0.0004351966054840443, "loss": 4.9078, "mean_token_accuracy": 0.21039691865444182, "num_tokens": 56559096.0, "step": 32600 }, { "entropy": 5.637770748138427, "epoch": 2.5367827270958956, "grad_norm": 1.1796875, "learning_rate": 0.00043517714252827556, "loss": 4.8885, "mean_token_accuracy": 0.21334285885095597, "num_tokens": 56567401.0, "step": 32605 }, { "entropy": 5.702492904663086, "epoch": 2.5371717564676133, "grad_norm": 1.25, "learning_rate": 0.0004351576771420737, "loss": 4.9448, "mean_token_accuracy": 0.20664068758487703, "num_tokens": 56575456.0, "step": 32610 }, { "entropy": 5.742669725418091, "epoch": 2.537560785839331, "grad_norm": 1.171875, "learning_rate": 0.0004351382093257339, "loss": 4.9689, "mean_token_accuracy": 0.21570178121328354, "num_tokens": 56583810.0, "step": 32615 }, { "entropy": 5.663485383987426, "epoch": 2.5379498152110482, "grad_norm": 1.28125, "learning_rate": 0.0004351187390795517, "loss": 4.9343, "mean_token_accuracy": 0.20849667340517045, "num_tokens": 56592748.0, "step": 32620 }, { "entropy": 5.662202167510986, "epoch": 2.538338844582766, "grad_norm": 2.296875, "learning_rate": 0.00043509926640382244, "loss": 4.8182, "mean_token_accuracy": 0.2230575293302536, "num_tokens": 56601461.0, "step": 32625 }, { "entropy": 5.644738578796387, "epoch": 2.5387278739544836, "grad_norm": 1.1328125, "learning_rate": 0.0004350797912988417, "loss": 4.94, "mean_token_accuracy": 0.20806770026683807, "num_tokens": 56610227.0, "step": 32630 }, { "entropy": 5.701452827453613, "epoch": 2.5391169033262013, "grad_norm": 1.2265625, "learning_rate": 0.0004350603137649049, "loss": 5.0303, "mean_token_accuracy": 0.2069085046648979, "num_tokens": 56619236.0, "step": 32635 }, { "entropy": 5.689003038406372, "epoch": 2.5395059326979186, "grad_norm": 1.1953125, "learning_rate": 0.0004350408338023075, "loss": 4.8982, "mean_token_accuracy": 0.21578714549541472, "num_tokens": 56628022.0, "step": 32640 }, { "entropy": 5.777026653289795, "epoch": 2.5398949620696363, "grad_norm": 1.1953125, "learning_rate": 0.0004350213514113453, "loss": 5.048, "mean_token_accuracy": 0.20260293632745743, "num_tokens": 56637191.0, "step": 32645 }, { "entropy": 5.731728506088257, "epoch": 2.540283991441354, "grad_norm": 1.2578125, "learning_rate": 0.00043500186659231377, "loss": 4.9546, "mean_token_accuracy": 0.20533868819475173, "num_tokens": 56646395.0, "step": 32650 }, { "entropy": 5.647430086135865, "epoch": 2.5406730208130712, "grad_norm": 1.1953125, "learning_rate": 0.0004349823793455086, "loss": 4.8803, "mean_token_accuracy": 0.21665948778390884, "num_tokens": 56655325.0, "step": 32655 }, { "entropy": 5.639145088195801, "epoch": 2.541062050184789, "grad_norm": 1.1953125, "learning_rate": 0.00043496288967122547, "loss": 4.9692, "mean_token_accuracy": 0.20423408448696137, "num_tokens": 56664470.0, "step": 32660 }, { "entropy": 5.747791528701782, "epoch": 2.5414510795565066, "grad_norm": 1.2890625, "learning_rate": 0.00043494339756976007, "loss": 4.9319, "mean_token_accuracy": 0.20249375700950623, "num_tokens": 56671883.0, "step": 32665 }, { "entropy": 5.749244356155396, "epoch": 2.5418401089282243, "grad_norm": 1.15625, "learning_rate": 0.0004349239030414082, "loss": 5.0183, "mean_token_accuracy": 0.20322106331586837, "num_tokens": 56680877.0, "step": 32670 }, { "entropy": 5.686707925796509, "epoch": 2.5422291382999416, "grad_norm": 1.2734375, "learning_rate": 0.00043490440608646557, "loss": 4.9564, "mean_token_accuracy": 0.2049104690551758, "num_tokens": 56689143.0, "step": 32675 }, { "entropy": 5.688883447647095, "epoch": 2.5426181676716593, "grad_norm": 1.3515625, "learning_rate": 0.00043488490670522817, "loss": 4.9338, "mean_token_accuracy": 0.21230608522891997, "num_tokens": 56698696.0, "step": 32680 }, { "entropy": 5.6704846858978275, "epoch": 2.5430071970433765, "grad_norm": 1.2265625, "learning_rate": 0.0004348654048979918, "loss": 4.9525, "mean_token_accuracy": 0.20557556301355362, "num_tokens": 56707805.0, "step": 32685 }, { "entropy": 5.697279977798462, "epoch": 2.543396226415094, "grad_norm": 1.3125, "learning_rate": 0.0004348459006650523, "loss": 4.9575, "mean_token_accuracy": 0.2059640809893608, "num_tokens": 56716341.0, "step": 32690 }, { "entropy": 5.7409766674041744, "epoch": 2.543785255786812, "grad_norm": 1.296875, "learning_rate": 0.00043482639400670576, "loss": 5.1121, "mean_token_accuracy": 0.19511549472808837, "num_tokens": 56725296.0, "step": 32695 }, { "entropy": 5.760735893249512, "epoch": 2.5441742851585296, "grad_norm": 1.203125, "learning_rate": 0.000434806884923248, "loss": 5.0579, "mean_token_accuracy": 0.19755200296640396, "num_tokens": 56735118.0, "step": 32700 }, { "entropy": 5.721780824661255, "epoch": 2.5445633145302473, "grad_norm": 1.2109375, "learning_rate": 0.0004347873734149752, "loss": 4.9435, "mean_token_accuracy": 0.21299345344305037, "num_tokens": 56743880.0, "step": 32705 }, { "entropy": 5.7009447574615475, "epoch": 2.5449523439019646, "grad_norm": 1.203125, "learning_rate": 0.00043476785948218325, "loss": 4.9872, "mean_token_accuracy": 0.2028905615210533, "num_tokens": 56751945.0, "step": 32710 }, { "entropy": 5.619579887390136, "epoch": 2.5453413732736823, "grad_norm": 1.2265625, "learning_rate": 0.00043474834312516835, "loss": 4.9005, "mean_token_accuracy": 0.20717936456203462, "num_tokens": 56760645.0, "step": 32715 }, { "entropy": 5.762608289718628, "epoch": 2.5457304026453995, "grad_norm": 1.140625, "learning_rate": 0.0004347288243442266, "loss": 5.0465, "mean_token_accuracy": 0.20624287873506547, "num_tokens": 56769496.0, "step": 32720 }, { "entropy": 5.68577299118042, "epoch": 2.546119432017117, "grad_norm": 1.15625, "learning_rate": 0.0004347093031396543, "loss": 4.8918, "mean_token_accuracy": 0.20478617995977402, "num_tokens": 56778313.0, "step": 32725 }, { "entropy": 5.7061316013336185, "epoch": 2.546508461388835, "grad_norm": 1.203125, "learning_rate": 0.0004346897795117474, "loss": 5.0347, "mean_token_accuracy": 0.2017899841070175, "num_tokens": 56786210.0, "step": 32730 }, { "entropy": 5.691309309005737, "epoch": 2.5468974907605526, "grad_norm": 1.1484375, "learning_rate": 0.0004346702534608023, "loss": 4.9981, "mean_token_accuracy": 0.20654103606939317, "num_tokens": 56795641.0, "step": 32735 }, { "entropy": 5.722550964355468, "epoch": 2.54728652013227, "grad_norm": 1.265625, "learning_rate": 0.0004346507249871153, "loss": 5.0708, "mean_token_accuracy": 0.19576369673013688, "num_tokens": 56804625.0, "step": 32740 }, { "entropy": 5.700703859329224, "epoch": 2.5476755495039876, "grad_norm": 1.2265625, "learning_rate": 0.0004346311940909826, "loss": 4.9123, "mean_token_accuracy": 0.20989010035991668, "num_tokens": 56812835.0, "step": 32745 }, { "entropy": 5.689013433456421, "epoch": 2.5480645788757053, "grad_norm": 1.296875, "learning_rate": 0.00043461166077270056, "loss": 4.9719, "mean_token_accuracy": 0.20878061801195144, "num_tokens": 56822005.0, "step": 32750 }, { "entropy": 5.697546815872192, "epoch": 2.5484536082474225, "grad_norm": 1.1640625, "learning_rate": 0.00043459212503256566, "loss": 4.9707, "mean_token_accuracy": 0.21193284541368484, "num_tokens": 56830490.0, "step": 32755 }, { "entropy": 5.735522079467773, "epoch": 2.54884263761914, "grad_norm": 1.21875, "learning_rate": 0.0004345725868708743, "loss": 4.9823, "mean_token_accuracy": 0.20693827271461487, "num_tokens": 56839699.0, "step": 32760 }, { "entropy": 5.707082605361938, "epoch": 2.549231666990858, "grad_norm": 1.1484375, "learning_rate": 0.00043455304628792294, "loss": 5.0217, "mean_token_accuracy": 0.2002649948000908, "num_tokens": 56848664.0, "step": 32765 }, { "entropy": 5.735581731796264, "epoch": 2.5496206963625756, "grad_norm": 1.2578125, "learning_rate": 0.000434533503284008, "loss": 5.0033, "mean_token_accuracy": 0.20198367685079574, "num_tokens": 56856567.0, "step": 32770 }, { "entropy": 5.799953413009644, "epoch": 2.550009725734293, "grad_norm": 1.2578125, "learning_rate": 0.0004345139578594261, "loss": 5.0604, "mean_token_accuracy": 0.19971122741699218, "num_tokens": 56864479.0, "step": 32775 }, { "entropy": 5.762111473083496, "epoch": 2.5503987551060106, "grad_norm": 1.296875, "learning_rate": 0.0004344944100144738, "loss": 5.1018, "mean_token_accuracy": 0.19957056790590286, "num_tokens": 56872976.0, "step": 32780 }, { "entropy": 5.741881942749023, "epoch": 2.550787784477728, "grad_norm": 1.1796875, "learning_rate": 0.00043447485974944765, "loss": 4.9622, "mean_token_accuracy": 0.20680367350578308, "num_tokens": 56882146.0, "step": 32785 }, { "entropy": 5.699673795700074, "epoch": 2.5511768138494455, "grad_norm": 1.2734375, "learning_rate": 0.00043445530706464437, "loss": 4.928, "mean_token_accuracy": 0.2110580861568451, "num_tokens": 56890267.0, "step": 32790 }, { "entropy": 5.609733295440674, "epoch": 2.551565843221163, "grad_norm": 1.2734375, "learning_rate": 0.0004344357519603606, "loss": 4.9019, "mean_token_accuracy": 0.21562192738056182, "num_tokens": 56897887.0, "step": 32795 }, { "entropy": 5.678753471374511, "epoch": 2.551954872592881, "grad_norm": 1.34375, "learning_rate": 0.0004344161944368931, "loss": 5.0536, "mean_token_accuracy": 0.19957194328308106, "num_tokens": 56906396.0, "step": 32800 }, { "entropy": 5.737152433395385, "epoch": 2.5523439019645986, "grad_norm": 1.296875, "learning_rate": 0.0004343966344945385, "loss": 4.9773, "mean_token_accuracy": 0.20492859780788422, "num_tokens": 56914552.0, "step": 32805 }, { "entropy": 5.657803535461426, "epoch": 2.552732931336316, "grad_norm": 1.3203125, "learning_rate": 0.00043437707213359375, "loss": 4.8858, "mean_token_accuracy": 0.20682284235954285, "num_tokens": 56921976.0, "step": 32810 }, { "entropy": 5.674916791915893, "epoch": 2.5531219607080335, "grad_norm": 1.203125, "learning_rate": 0.00043435750735435554, "loss": 5.0288, "mean_token_accuracy": 0.19863365441560746, "num_tokens": 56930518.0, "step": 32815 }, { "entropy": 5.727136039733887, "epoch": 2.553510990079751, "grad_norm": 1.15625, "learning_rate": 0.00043433794015712085, "loss": 5.0393, "mean_token_accuracy": 0.20179325193166733, "num_tokens": 56939742.0, "step": 32820 }, { "entropy": 5.704491424560547, "epoch": 2.5539000194514685, "grad_norm": 1.2421875, "learning_rate": 0.0004343183705421865, "loss": 4.9341, "mean_token_accuracy": 0.20859729647636413, "num_tokens": 56947925.0, "step": 32825 }, { "entropy": 5.676928091049194, "epoch": 2.554289048823186, "grad_norm": 1.140625, "learning_rate": 0.0004342987985098495, "loss": 4.9802, "mean_token_accuracy": 0.20821321457624437, "num_tokens": 56956546.0, "step": 32830 }, { "entropy": 5.708922672271728, "epoch": 2.554678078194904, "grad_norm": 1.171875, "learning_rate": 0.00043427922406040676, "loss": 5.0502, "mean_token_accuracy": 0.19950754642486573, "num_tokens": 56965323.0, "step": 32835 }, { "entropy": 5.775407505035401, "epoch": 2.555067107566621, "grad_norm": 1.15625, "learning_rate": 0.00043425964719415525, "loss": 5.0329, "mean_token_accuracy": 0.20044715702533722, "num_tokens": 56974566.0, "step": 32840 }, { "entropy": 5.671373128890991, "epoch": 2.555456136938339, "grad_norm": 1.2421875, "learning_rate": 0.00043424006791139213, "loss": 4.994, "mean_token_accuracy": 0.21012261956930162, "num_tokens": 56983565.0, "step": 32845 }, { "entropy": 5.631256484985352, "epoch": 2.5558451663100565, "grad_norm": 1.140625, "learning_rate": 0.00043422048621241443, "loss": 4.8757, "mean_token_accuracy": 0.21466976404190063, "num_tokens": 56992011.0, "step": 32850 }, { "entropy": 5.70928168296814, "epoch": 2.556234195681774, "grad_norm": 1.359375, "learning_rate": 0.00043420090209751933, "loss": 4.9684, "mean_token_accuracy": 0.2065294861793518, "num_tokens": 57001012.0, "step": 32855 }, { "entropy": 5.754943895339966, "epoch": 2.5566232250534915, "grad_norm": 1.2578125, "learning_rate": 0.0004341813155670039, "loss": 4.9744, "mean_token_accuracy": 0.21120057702064515, "num_tokens": 57009572.0, "step": 32860 }, { "entropy": 5.725535202026367, "epoch": 2.557012254425209, "grad_norm": 1.25, "learning_rate": 0.0004341617266211654, "loss": 4.9699, "mean_token_accuracy": 0.20633513629436492, "num_tokens": 57018173.0, "step": 32865 }, { "entropy": 5.614037418365479, "epoch": 2.557401283796927, "grad_norm": 1.140625, "learning_rate": 0.000434142135260301, "loss": 4.9603, "mean_token_accuracy": 0.20994732081890105, "num_tokens": 57027565.0, "step": 32870 }, { "entropy": 5.733452415466308, "epoch": 2.557790313168644, "grad_norm": 1.28125, "learning_rate": 0.000434122541484708, "loss": 5.0075, "mean_token_accuracy": 0.20279324501752855, "num_tokens": 57036660.0, "step": 32875 }, { "entropy": 5.733560180664062, "epoch": 2.558179342540362, "grad_norm": 1.15625, "learning_rate": 0.0004341029452946837, "loss": 5.0217, "mean_token_accuracy": 0.20620784312486648, "num_tokens": 57045461.0, "step": 32880 }, { "entropy": 5.733819437026978, "epoch": 2.558568371912079, "grad_norm": 1.3046875, "learning_rate": 0.0004340833466905254, "loss": 5.021, "mean_token_accuracy": 0.20758386552333832, "num_tokens": 57053566.0, "step": 32885 }, { "entropy": 5.681113862991333, "epoch": 2.558957401283797, "grad_norm": 1.1328125, "learning_rate": 0.00043406374567253055, "loss": 5.0221, "mean_token_accuracy": 0.19690076112747193, "num_tokens": 57061530.0, "step": 32890 }, { "entropy": 5.596763801574707, "epoch": 2.5593464306555145, "grad_norm": 1.3515625, "learning_rate": 0.0004340441422409965, "loss": 4.7902, "mean_token_accuracy": 0.2219374492764473, "num_tokens": 57069645.0, "step": 32895 }, { "entropy": 5.663645696640015, "epoch": 2.559735460027232, "grad_norm": 1.1015625, "learning_rate": 0.0004340245363962209, "loss": 5.0035, "mean_token_accuracy": 0.21029461771249772, "num_tokens": 57078998.0, "step": 32900 }, { "entropy": 5.719699048995972, "epoch": 2.56012448939895, "grad_norm": 1.2578125, "learning_rate": 0.00043400492813850083, "loss": 4.9601, "mean_token_accuracy": 0.2050677388906479, "num_tokens": 57087363.0, "step": 32905 }, { "entropy": 5.732450151443482, "epoch": 2.560513518770667, "grad_norm": 1.1328125, "learning_rate": 0.00043398531746813426, "loss": 5.0143, "mean_token_accuracy": 0.20135474056005478, "num_tokens": 57096242.0, "step": 32910 }, { "entropy": 5.68996114730835, "epoch": 2.560902548142385, "grad_norm": 1.28125, "learning_rate": 0.00043396570438541845, "loss": 4.9675, "mean_token_accuracy": 0.20162001699209214, "num_tokens": 57104791.0, "step": 32915 }, { "entropy": 5.713347291946411, "epoch": 2.561291577514102, "grad_norm": 1.1328125, "learning_rate": 0.0004339460888906512, "loss": 4.9949, "mean_token_accuracy": 0.2021369069814682, "num_tokens": 57113170.0, "step": 32920 }, { "entropy": 5.712580060958862, "epoch": 2.5616806068858198, "grad_norm": 1.171875, "learning_rate": 0.0004339264709841299, "loss": 5.0134, "mean_token_accuracy": 0.20526072680950164, "num_tokens": 57121746.0, "step": 32925 }, { "entropy": 5.724859285354614, "epoch": 2.5620696362575375, "grad_norm": 1.2734375, "learning_rate": 0.00043390685066615244, "loss": 4.9934, "mean_token_accuracy": 0.21671376675367354, "num_tokens": 57130347.0, "step": 32930 }, { "entropy": 5.683323574066162, "epoch": 2.562458665629255, "grad_norm": 1.234375, "learning_rate": 0.0004338872279370164, "loss": 4.952, "mean_token_accuracy": 0.20928529798984527, "num_tokens": 57138370.0, "step": 32935 }, { "entropy": 5.721246576309204, "epoch": 2.5628476950009724, "grad_norm": 1.1171875, "learning_rate": 0.0004338676027970196, "loss": 5.0429, "mean_token_accuracy": 0.2026049852371216, "num_tokens": 57147582.0, "step": 32940 }, { "entropy": 5.725758504867554, "epoch": 2.56323672437269, "grad_norm": 1.25, "learning_rate": 0.00043384797524645977, "loss": 4.973, "mean_token_accuracy": 0.20203132778406144, "num_tokens": 57156477.0, "step": 32945 }, { "entropy": 5.6618485927581785, "epoch": 2.563625753744408, "grad_norm": 1.234375, "learning_rate": 0.0004338283452856348, "loss": 4.8953, "mean_token_accuracy": 0.20873745828866958, "num_tokens": 57164463.0, "step": 32950 }, { "entropy": 5.666740083694458, "epoch": 2.564014783116125, "grad_norm": 1.1171875, "learning_rate": 0.0004338087129148425, "loss": 5.0006, "mean_token_accuracy": 0.2036084160208702, "num_tokens": 57173640.0, "step": 32955 }, { "entropy": 5.723639822006225, "epoch": 2.5644038124878428, "grad_norm": 1.3359375, "learning_rate": 0.00043378907813438066, "loss": 5.0605, "mean_token_accuracy": 0.19265889078378678, "num_tokens": 57182239.0, "step": 32960 }, { "entropy": 5.7019875049591064, "epoch": 2.5647928418595605, "grad_norm": 1.203125, "learning_rate": 0.00043376944094454734, "loss": 4.9808, "mean_token_accuracy": 0.20237672030925752, "num_tokens": 57192411.0, "step": 32965 }, { "entropy": 5.79729437828064, "epoch": 2.565181871231278, "grad_norm": 1.265625, "learning_rate": 0.00043374980134564044, "loss": 4.9473, "mean_token_accuracy": 0.21248824894428253, "num_tokens": 57200888.0, "step": 32970 }, { "entropy": 5.722712993621826, "epoch": 2.5655709006029954, "grad_norm": 1.203125, "learning_rate": 0.00043373015933795804, "loss": 4.999, "mean_token_accuracy": 0.2108399361371994, "num_tokens": 57209816.0, "step": 32975 }, { "entropy": 5.619099569320679, "epoch": 2.565959929974713, "grad_norm": 1.2109375, "learning_rate": 0.0004337105149217981, "loss": 4.905, "mean_token_accuracy": 0.2130533903837204, "num_tokens": 57218190.0, "step": 32980 }, { "entropy": 5.648235940933228, "epoch": 2.566348959346431, "grad_norm": 1.234375, "learning_rate": 0.00043369086809745875, "loss": 4.9796, "mean_token_accuracy": 0.20216379314661026, "num_tokens": 57226697.0, "step": 32985 }, { "entropy": 5.712060499191284, "epoch": 2.566737988718148, "grad_norm": 1.21875, "learning_rate": 0.00043367121886523795, "loss": 4.9806, "mean_token_accuracy": 0.20425665825605394, "num_tokens": 57235058.0, "step": 32990 }, { "entropy": 5.678001022338867, "epoch": 2.5671270180898658, "grad_norm": 1.171875, "learning_rate": 0.000433651567225434, "loss": 4.9521, "mean_token_accuracy": 0.20356193482875823, "num_tokens": 57244344.0, "step": 32995 }, { "entropy": 5.737708473205567, "epoch": 2.5675160474615835, "grad_norm": 1.21875, "learning_rate": 0.0004336319131783451, "loss": 5.0078, "mean_token_accuracy": 0.20553993582725524, "num_tokens": 57253502.0, "step": 33000 }, { "epoch": 2.5675160474615835, "eval_entropy": 5.458543120632961, "eval_loss": 5.062242031097412, "eval_mean_token_accuracy": 0.21182624165029681, "eval_num_tokens": 57253502.0, "eval_runtime": 21.9341, "eval_samples_per_second": 1894.672, "eval_steps_per_second": 236.845, "step": 33000 }, { "entropy": 5.678699731826782, "epoch": 2.567905076833301, "grad_norm": 1.2890625, "learning_rate": 0.00043361225672426933, "loss": 4.927, "mean_token_accuracy": 0.211125884950161, "num_tokens": 57262552.0, "step": 33005 }, { "entropy": 5.7359199047088625, "epoch": 2.5682941062050184, "grad_norm": 1.1796875, "learning_rate": 0.0004335925978635051, "loss": 5.0173, "mean_token_accuracy": 0.20972345769405365, "num_tokens": 57271608.0, "step": 33010 }, { "entropy": 5.747376298904419, "epoch": 2.568683135576736, "grad_norm": 1.34375, "learning_rate": 0.00043357293659635057, "loss": 4.9859, "mean_token_accuracy": 0.2043384149670601, "num_tokens": 57280112.0, "step": 33015 }, { "entropy": 5.703431558609009, "epoch": 2.5690721649484534, "grad_norm": 1.171875, "learning_rate": 0.0004335532729231041, "loss": 4.9561, "mean_token_accuracy": 0.19906243234872817, "num_tokens": 57289565.0, "step": 33020 }, { "entropy": 5.782798433303833, "epoch": 2.569461194320171, "grad_norm": 1.1875, "learning_rate": 0.00043353360684406415, "loss": 5.08, "mean_token_accuracy": 0.19317682534456254, "num_tokens": 57298879.0, "step": 33025 }, { "entropy": 5.687327432632446, "epoch": 2.5698502236918888, "grad_norm": 1.21875, "learning_rate": 0.000433513938359529, "loss": 4.9491, "mean_token_accuracy": 0.20716072320938111, "num_tokens": 57307508.0, "step": 33030 }, { "entropy": 5.716709232330322, "epoch": 2.5702392530636065, "grad_norm": 1.3125, "learning_rate": 0.0004334942674697971, "loss": 4.9885, "mean_token_accuracy": 0.20679048746824263, "num_tokens": 57316187.0, "step": 33035 }, { "entropy": 5.689046382904053, "epoch": 2.5706282824353237, "grad_norm": 1.1640625, "learning_rate": 0.00043347459417516696, "loss": 4.9026, "mean_token_accuracy": 0.21230379343032837, "num_tokens": 57325025.0, "step": 33040 }, { "entropy": 5.709733676910401, "epoch": 2.5710173118070414, "grad_norm": 1.3515625, "learning_rate": 0.0004334549184759371, "loss": 4.9723, "mean_token_accuracy": 0.20071024894714357, "num_tokens": 57333427.0, "step": 33045 }, { "entropy": 5.687884521484375, "epoch": 2.571406341178759, "grad_norm": 1.3046875, "learning_rate": 0.0004334352403724062, "loss": 4.9672, "mean_token_accuracy": 0.21026103645563127, "num_tokens": 57342088.0, "step": 33050 }, { "entropy": 5.788322496414184, "epoch": 2.5717953705504764, "grad_norm": 1.3515625, "learning_rate": 0.00043341555986487254, "loss": 5.0427, "mean_token_accuracy": 0.20250421166419982, "num_tokens": 57350075.0, "step": 33055 }, { "entropy": 5.691873407363891, "epoch": 2.572184399922194, "grad_norm": 1.1953125, "learning_rate": 0.0004333958769536349, "loss": 4.9093, "mean_token_accuracy": 0.2098337396979332, "num_tokens": 57358517.0, "step": 33060 }, { "entropy": 5.680976438522339, "epoch": 2.5725734292939118, "grad_norm": 1.1953125, "learning_rate": 0.0004333761916389921, "loss": 5.0313, "mean_token_accuracy": 0.20166352540254592, "num_tokens": 57367980.0, "step": 33065 }, { "entropy": 5.774142694473267, "epoch": 2.5729624586656294, "grad_norm": 1.296875, "learning_rate": 0.0004333565039212425, "loss": 4.9851, "mean_token_accuracy": 0.2047487825155258, "num_tokens": 57376575.0, "step": 33070 }, { "entropy": 5.737471961975098, "epoch": 2.5733514880373467, "grad_norm": 1.28125, "learning_rate": 0.0004333368138006851, "loss": 4.9825, "mean_token_accuracy": 0.2064204216003418, "num_tokens": 57384950.0, "step": 33075 }, { "entropy": 5.711123847961426, "epoch": 2.5737405174090644, "grad_norm": 1.109375, "learning_rate": 0.0004333171212776185, "loss": 5.0207, "mean_token_accuracy": 0.2065430536866188, "num_tokens": 57393895.0, "step": 33080 }, { "entropy": 5.732526874542236, "epoch": 2.574129546780782, "grad_norm": 1.2421875, "learning_rate": 0.0004332974263523416, "loss": 5.0183, "mean_token_accuracy": 0.2021734520792961, "num_tokens": 57403579.0, "step": 33085 }, { "entropy": 5.723679494857788, "epoch": 2.5745185761524993, "grad_norm": 1.3203125, "learning_rate": 0.00043327772902515327, "loss": 5.0164, "mean_token_accuracy": 0.20182851552963257, "num_tokens": 57411975.0, "step": 33090 }, { "entropy": 5.703841257095337, "epoch": 2.574907605524217, "grad_norm": 1.2109375, "learning_rate": 0.0004332580292963523, "loss": 4.9554, "mean_token_accuracy": 0.2088599056005478, "num_tokens": 57419876.0, "step": 33095 }, { "entropy": 5.6517270565032955, "epoch": 2.5752966348959347, "grad_norm": 1.28125, "learning_rate": 0.0004332383271662376, "loss": 4.9272, "mean_token_accuracy": 0.2118717223405838, "num_tokens": 57428842.0, "step": 33100 }, { "entropy": 5.655807828903198, "epoch": 2.5756856642676524, "grad_norm": 1.2890625, "learning_rate": 0.00043321862263510816, "loss": 4.8904, "mean_token_accuracy": 0.21277089267969132, "num_tokens": 57437239.0, "step": 33105 }, { "entropy": 5.7198327541351315, "epoch": 2.5760746936393697, "grad_norm": 1.203125, "learning_rate": 0.0004331989157032629, "loss": 4.9883, "mean_token_accuracy": 0.20722661167383194, "num_tokens": 57446172.0, "step": 33110 }, { "entropy": 5.699471426010132, "epoch": 2.5764637230110874, "grad_norm": 1.3359375, "learning_rate": 0.00043317920637100097, "loss": 4.8637, "mean_token_accuracy": 0.2135789304971695, "num_tokens": 57454907.0, "step": 33115 }, { "entropy": 5.628232955932617, "epoch": 2.5768527523828046, "grad_norm": 1.234375, "learning_rate": 0.0004331594946386213, "loss": 4.9576, "mean_token_accuracy": 0.20341273993253708, "num_tokens": 57464309.0, "step": 33120 }, { "entropy": 5.702980327606201, "epoch": 2.5772417817545223, "grad_norm": 1.2109375, "learning_rate": 0.00043313978050642303, "loss": 4.9913, "mean_token_accuracy": 0.21044119000434874, "num_tokens": 57472920.0, "step": 33125 }, { "entropy": 5.791906118392944, "epoch": 2.57763081112624, "grad_norm": 1.2421875, "learning_rate": 0.0004331200639747053, "loss": 5.0226, "mean_token_accuracy": 0.20145918428897858, "num_tokens": 57481608.0, "step": 33130 }, { "entropy": 5.67944302558899, "epoch": 2.5780198404979577, "grad_norm": 1.1875, "learning_rate": 0.0004331003450437674, "loss": 4.8894, "mean_token_accuracy": 0.20856887102127075, "num_tokens": 57490373.0, "step": 33135 }, { "entropy": 5.664708471298217, "epoch": 2.5784088698696754, "grad_norm": 1.1328125, "learning_rate": 0.0004330806237139083, "loss": 4.9553, "mean_token_accuracy": 0.20704852491617204, "num_tokens": 57499224.0, "step": 33140 }, { "entropy": 5.672581577301026, "epoch": 2.5787978992413927, "grad_norm": 1.21875, "learning_rate": 0.0004330608999854273, "loss": 5.0242, "mean_token_accuracy": 0.20406946241855622, "num_tokens": 57508496.0, "step": 33145 }, { "entropy": 5.7370223045349125, "epoch": 2.5791869286131104, "grad_norm": 1.1484375, "learning_rate": 0.0004330411738586238, "loss": 4.9237, "mean_token_accuracy": 0.2168922543525696, "num_tokens": 57517348.0, "step": 33150 }, { "entropy": 5.731233692169189, "epoch": 2.5795759579848276, "grad_norm": 1.3046875, "learning_rate": 0.000433021445333797, "loss": 4.9771, "mean_token_accuracy": 0.2071181669831276, "num_tokens": 57525511.0, "step": 33155 }, { "entropy": 5.734325408935547, "epoch": 2.5799649873565453, "grad_norm": 1.2734375, "learning_rate": 0.00043300171441124633, "loss": 5.0524, "mean_token_accuracy": 0.20513100028038025, "num_tokens": 57534445.0, "step": 33160 }, { "entropy": 5.681735706329346, "epoch": 2.580354016728263, "grad_norm": 1.28125, "learning_rate": 0.0004329819810912711, "loss": 4.9122, "mean_token_accuracy": 0.2070796549320221, "num_tokens": 57542543.0, "step": 33165 }, { "entropy": 5.743970775604248, "epoch": 2.5807430460999807, "grad_norm": 1.2265625, "learning_rate": 0.00043296224537417075, "loss": 5.0512, "mean_token_accuracy": 0.20299624353647233, "num_tokens": 57551407.0, "step": 33170 }, { "entropy": 5.675380754470825, "epoch": 2.581132075471698, "grad_norm": 1.234375, "learning_rate": 0.00043294250726024473, "loss": 4.8817, "mean_token_accuracy": 0.21594064086675643, "num_tokens": 57559576.0, "step": 33175 }, { "entropy": 5.673430109024048, "epoch": 2.5815211048434157, "grad_norm": 1.2578125, "learning_rate": 0.0004329227667497926, "loss": 4.9203, "mean_token_accuracy": 0.2143855422735214, "num_tokens": 57567893.0, "step": 33180 }, { "entropy": 5.696310329437256, "epoch": 2.5819101342151334, "grad_norm": 1.265625, "learning_rate": 0.00043290302384311373, "loss": 4.9273, "mean_token_accuracy": 0.21030088365077973, "num_tokens": 57576168.0, "step": 33185 }, { "entropy": 5.710881757736206, "epoch": 2.5822991635868506, "grad_norm": 1.234375, "learning_rate": 0.00043288327854050794, "loss": 4.9564, "mean_token_accuracy": 0.20549533665180206, "num_tokens": 57584540.0, "step": 33190 }, { "entropy": 5.710496234893799, "epoch": 2.5826881929585683, "grad_norm": 1.28125, "learning_rate": 0.00043286353084227467, "loss": 4.9498, "mean_token_accuracy": 0.2025822803378105, "num_tokens": 57592315.0, "step": 33195 }, { "entropy": 5.592957592010498, "epoch": 2.583077222330286, "grad_norm": 1.234375, "learning_rate": 0.00043284378074871354, "loss": 4.8778, "mean_token_accuracy": 0.20903212130069732, "num_tokens": 57600362.0, "step": 33200 }, { "entropy": 5.701590967178345, "epoch": 2.5834662517020037, "grad_norm": 1.28125, "learning_rate": 0.0004328240282601243, "loss": 4.9844, "mean_token_accuracy": 0.19968596398830413, "num_tokens": 57608852.0, "step": 33205 }, { "entropy": 5.688631963729859, "epoch": 2.583855281073721, "grad_norm": 1.2109375, "learning_rate": 0.0004328042733768066, "loss": 4.982, "mean_token_accuracy": 0.2107900321483612, "num_tokens": 57617081.0, "step": 33210 }, { "entropy": 5.7073366165161135, "epoch": 2.5842443104454387, "grad_norm": 1.2109375, "learning_rate": 0.00043278451609906027, "loss": 4.9313, "mean_token_accuracy": 0.21303458958864213, "num_tokens": 57625378.0, "step": 33215 }, { "entropy": 5.6871226787567135, "epoch": 2.584633339817156, "grad_norm": 1.171875, "learning_rate": 0.00043276475642718503, "loss": 4.9832, "mean_token_accuracy": 0.2021857351064682, "num_tokens": 57634025.0, "step": 33220 }, { "entropy": 5.638347482681274, "epoch": 2.5850223691888736, "grad_norm": 1.0859375, "learning_rate": 0.0004327449943614808, "loss": 4.8974, "mean_token_accuracy": 0.21259480118751525, "num_tokens": 57642794.0, "step": 33225 }, { "entropy": 5.678907871246338, "epoch": 2.5854113985605913, "grad_norm": 1.1875, "learning_rate": 0.00043272522990224727, "loss": 4.9623, "mean_token_accuracy": 0.20482416003942489, "num_tokens": 57651330.0, "step": 33230 }, { "entropy": 5.720505142211914, "epoch": 2.585800427932309, "grad_norm": 1.1796875, "learning_rate": 0.0004327054630497844, "loss": 4.9964, "mean_token_accuracy": 0.20163153111934662, "num_tokens": 57660673.0, "step": 33235 }, { "entropy": 5.680821514129638, "epoch": 2.5861894573040267, "grad_norm": 1.25, "learning_rate": 0.00043268569380439223, "loss": 4.9319, "mean_token_accuracy": 0.21334424912929534, "num_tokens": 57669349.0, "step": 33240 }, { "entropy": 5.7376665592193605, "epoch": 2.586578486675744, "grad_norm": 1.2421875, "learning_rate": 0.0004326659221663705, "loss": 5.0829, "mean_token_accuracy": 0.19897127896547318, "num_tokens": 57678904.0, "step": 33245 }, { "entropy": 5.75347375869751, "epoch": 2.5869675160474617, "grad_norm": 1.21875, "learning_rate": 0.0004326461481360194, "loss": 5.0295, "mean_token_accuracy": 0.20304772406816482, "num_tokens": 57686957.0, "step": 33250 }, { "entropy": 5.6729227066040036, "epoch": 2.587356545419179, "grad_norm": 1.1875, "learning_rate": 0.00043262637171363906, "loss": 4.9635, "mean_token_accuracy": 0.21375613063573837, "num_tokens": 57695201.0, "step": 33255 }, { "entropy": 5.750540733337402, "epoch": 2.5877455747908966, "grad_norm": 1.1796875, "learning_rate": 0.00043260659289952926, "loss": 5.0157, "mean_token_accuracy": 0.2031563937664032, "num_tokens": 57703638.0, "step": 33260 }, { "entropy": 5.748252725601196, "epoch": 2.5881346041626143, "grad_norm": 1.15625, "learning_rate": 0.00043258681169399034, "loss": 5.0361, "mean_token_accuracy": 0.20177083015441893, "num_tokens": 57713427.0, "step": 33265 }, { "entropy": 5.758066654205322, "epoch": 2.588523633534332, "grad_norm": 1.1171875, "learning_rate": 0.00043256702809732234, "loss": 4.9969, "mean_token_accuracy": 0.20760197937488556, "num_tokens": 57721953.0, "step": 33270 }, { "entropy": 5.773918676376343, "epoch": 2.5889126629060493, "grad_norm": 1.21875, "learning_rate": 0.0004325472421098255, "loss": 5.0367, "mean_token_accuracy": 0.19845963269472122, "num_tokens": 57730913.0, "step": 33275 }, { "entropy": 5.628821468353271, "epoch": 2.589301692277767, "grad_norm": 1.140625, "learning_rate": 0.00043252745373180006, "loss": 4.8992, "mean_token_accuracy": 0.2092765063047409, "num_tokens": 57739959.0, "step": 33280 }, { "entropy": 5.695522499084473, "epoch": 2.5896907216494847, "grad_norm": 1.25, "learning_rate": 0.0004325076629635462, "loss": 4.9023, "mean_token_accuracy": 0.21130251437425612, "num_tokens": 57748226.0, "step": 33285 }, { "entropy": 5.659872817993164, "epoch": 2.590079751021202, "grad_norm": 1.2265625, "learning_rate": 0.00043248786980536424, "loss": 4.9669, "mean_token_accuracy": 0.2050025463104248, "num_tokens": 57756521.0, "step": 33290 }, { "entropy": 5.737359952926636, "epoch": 2.5904687803929196, "grad_norm": 1.28125, "learning_rate": 0.0004324680742575545, "loss": 4.9779, "mean_token_accuracy": 0.20454122871160507, "num_tokens": 57765402.0, "step": 33295 }, { "entropy": 5.636382102966309, "epoch": 2.5908578097646373, "grad_norm": 1.2578125, "learning_rate": 0.00043244827632041744, "loss": 4.9083, "mean_token_accuracy": 0.20721125453710557, "num_tokens": 57773645.0, "step": 33300 }, { "entropy": 5.749105024337768, "epoch": 2.591246839136355, "grad_norm": 1.296875, "learning_rate": 0.0004324284759942534, "loss": 5.0899, "mean_token_accuracy": 0.19986154437065123, "num_tokens": 57781735.0, "step": 33305 }, { "entropy": 5.683712577819824, "epoch": 2.5916358685080723, "grad_norm": 1.25, "learning_rate": 0.0004324086732793627, "loss": 4.9596, "mean_token_accuracy": 0.20780885815620423, "num_tokens": 57790046.0, "step": 33310 }, { "entropy": 5.667308282852173, "epoch": 2.59202489787979, "grad_norm": 1.2421875, "learning_rate": 0.00043238886817604605, "loss": 4.9932, "mean_token_accuracy": 0.21017854362726213, "num_tokens": 57799069.0, "step": 33315 }, { "entropy": 5.735767030715943, "epoch": 2.5924139272515077, "grad_norm": 1.3046875, "learning_rate": 0.0004323690606846039, "loss": 5.0754, "mean_token_accuracy": 0.20101184397935867, "num_tokens": 57808292.0, "step": 33320 }, { "entropy": 5.702739429473877, "epoch": 2.592802956623225, "grad_norm": 1.2890625, "learning_rate": 0.00043234925080533657, "loss": 4.9881, "mean_token_accuracy": 0.19922055453062057, "num_tokens": 57816373.0, "step": 33325 }, { "entropy": 5.7166204929351805, "epoch": 2.5931919859949426, "grad_norm": 1.1484375, "learning_rate": 0.0004323294385385448, "loss": 5.0049, "mean_token_accuracy": 0.2023086205124855, "num_tokens": 57825564.0, "step": 33330 }, { "entropy": 5.665809106826782, "epoch": 2.5935810153666603, "grad_norm": 1.2421875, "learning_rate": 0.0004323096238845293, "loss": 4.9934, "mean_token_accuracy": 0.1973897024989128, "num_tokens": 57834664.0, "step": 33335 }, { "entropy": 5.6826859474182125, "epoch": 2.593970044738378, "grad_norm": 1.2265625, "learning_rate": 0.0004322898068435906, "loss": 5.0209, "mean_token_accuracy": 0.20228078961372375, "num_tokens": 57842910.0, "step": 33340 }, { "entropy": 5.689031314849854, "epoch": 2.5943590741100953, "grad_norm": 1.15625, "learning_rate": 0.0004322699874160294, "loss": 4.8738, "mean_token_accuracy": 0.20522424280643464, "num_tokens": 57852038.0, "step": 33345 }, { "entropy": 5.75601167678833, "epoch": 2.594748103481813, "grad_norm": 1.1953125, "learning_rate": 0.00043225016560214654, "loss": 4.9876, "mean_token_accuracy": 0.20295971482992173, "num_tokens": 57860578.0, "step": 33350 }, { "entropy": 5.719333791732788, "epoch": 2.59513713285353, "grad_norm": 1.265625, "learning_rate": 0.00043223034140224266, "loss": 4.9852, "mean_token_accuracy": 0.20018404126167297, "num_tokens": 57869124.0, "step": 33355 }, { "entropy": 5.690766048431397, "epoch": 2.595526162225248, "grad_norm": 1.3046875, "learning_rate": 0.0004322105148166187, "loss": 4.8617, "mean_token_accuracy": 0.21584379822015762, "num_tokens": 57877771.0, "step": 33360 }, { "entropy": 5.634674549102783, "epoch": 2.5959151915969656, "grad_norm": 1.21875, "learning_rate": 0.00043219068584557526, "loss": 4.9055, "mean_token_accuracy": 0.20817106068134308, "num_tokens": 57885883.0, "step": 33365 }, { "entropy": 5.6868212699890135, "epoch": 2.5963042209686833, "grad_norm": 1.2421875, "learning_rate": 0.0004321708544894134, "loss": 4.94, "mean_token_accuracy": 0.20734603106975555, "num_tokens": 57894287.0, "step": 33370 }, { "entropy": 5.754468965530395, "epoch": 2.5966932503404005, "grad_norm": 1.265625, "learning_rate": 0.00043215102074843403, "loss": 5.007, "mean_token_accuracy": 0.2059357762336731, "num_tokens": 57902046.0, "step": 33375 }, { "entropy": 5.7047460079193115, "epoch": 2.5970822797121182, "grad_norm": 1.203125, "learning_rate": 0.00043213118462293796, "loss": 4.9544, "mean_token_accuracy": 0.20955901145935057, "num_tokens": 57910776.0, "step": 33380 }, { "entropy": 5.750837087631226, "epoch": 2.597471309083836, "grad_norm": 1.2109375, "learning_rate": 0.0004321113461132264, "loss": 5.1002, "mean_token_accuracy": 0.19460802674293518, "num_tokens": 57920242.0, "step": 33385 }, { "entropy": 5.686353969573974, "epoch": 2.597860338455553, "grad_norm": 1.25, "learning_rate": 0.00043209150521960016, "loss": 4.9501, "mean_token_accuracy": 0.20909306555986404, "num_tokens": 57928902.0, "step": 33390 }, { "entropy": 5.6704418659210205, "epoch": 2.598249367827271, "grad_norm": 1.234375, "learning_rate": 0.00043207166194236037, "loss": 4.9071, "mean_token_accuracy": 0.2170700505375862, "num_tokens": 57937660.0, "step": 33395 }, { "entropy": 5.679188251495361, "epoch": 2.5986383971989886, "grad_norm": 1.3203125, "learning_rate": 0.0004320518162818082, "loss": 4.9984, "mean_token_accuracy": 0.19788794219493866, "num_tokens": 57946483.0, "step": 33400 }, { "entropy": 5.6116539478302006, "epoch": 2.5990274265707063, "grad_norm": 1.2734375, "learning_rate": 0.0004320319682382445, "loss": 4.9692, "mean_token_accuracy": 0.2063265785574913, "num_tokens": 57955963.0, "step": 33405 }, { "entropy": 5.683806324005127, "epoch": 2.5994164559424235, "grad_norm": 1.2265625, "learning_rate": 0.00043201211781197075, "loss": 4.9478, "mean_token_accuracy": 0.20308968275785447, "num_tokens": 57963750.0, "step": 33410 }, { "entropy": 5.714489126205445, "epoch": 2.5998054853141412, "grad_norm": 1.1484375, "learning_rate": 0.00043199226500328805, "loss": 4.978, "mean_token_accuracy": 0.20906989127397538, "num_tokens": 57972884.0, "step": 33415 }, { "entropy": 5.754586982727051, "epoch": 2.600194514685859, "grad_norm": 1.1796875, "learning_rate": 0.0004319724098124975, "loss": 5.0405, "mean_token_accuracy": 0.2036917746067047, "num_tokens": 57982143.0, "step": 33420 }, { "entropy": 5.732813024520874, "epoch": 2.600583544057576, "grad_norm": 1.28125, "learning_rate": 0.00043195255223990055, "loss": 4.9563, "mean_token_accuracy": 0.21198856085538864, "num_tokens": 57990954.0, "step": 33425 }, { "entropy": 5.74173583984375, "epoch": 2.600972573429294, "grad_norm": 1.265625, "learning_rate": 0.0004319326922857984, "loss": 5.0284, "mean_token_accuracy": 0.19902270138263703, "num_tokens": 57998662.0, "step": 33430 }, { "entropy": 5.759254884719849, "epoch": 2.6013616028010116, "grad_norm": 1.296875, "learning_rate": 0.0004319128299504925, "loss": 4.958, "mean_token_accuracy": 0.2119678348302841, "num_tokens": 58006956.0, "step": 33435 }, { "entropy": 5.703525257110596, "epoch": 2.6017506321727293, "grad_norm": 1.21875, "learning_rate": 0.00043189296523428407, "loss": 4.9632, "mean_token_accuracy": 0.20530094504356383, "num_tokens": 58015390.0, "step": 33440 }, { "entropy": 5.6485944271087645, "epoch": 2.6021396615444465, "grad_norm": 1.265625, "learning_rate": 0.00043187309813747464, "loss": 4.9215, "mean_token_accuracy": 0.20642916560173036, "num_tokens": 58024285.0, "step": 33445 }, { "entropy": 5.683557987213135, "epoch": 2.6025286909161642, "grad_norm": 1.265625, "learning_rate": 0.00043185322866036565, "loss": 4.9818, "mean_token_accuracy": 0.2070930927991867, "num_tokens": 58032411.0, "step": 33450 }, { "entropy": 5.694254636764526, "epoch": 2.6029177202878815, "grad_norm": 1.1953125, "learning_rate": 0.00043183335680325866, "loss": 4.9023, "mean_token_accuracy": 0.2118395522236824, "num_tokens": 58041815.0, "step": 33455 }, { "entropy": 5.7016747951507565, "epoch": 2.603306749659599, "grad_norm": 1.2421875, "learning_rate": 0.00043181348256645497, "loss": 4.9442, "mean_token_accuracy": 0.2078417256474495, "num_tokens": 58050046.0, "step": 33460 }, { "entropy": 5.686977815628052, "epoch": 2.603695779031317, "grad_norm": 1.265625, "learning_rate": 0.00043179360595025637, "loss": 5.0493, "mean_token_accuracy": 0.2010343924164772, "num_tokens": 58058582.0, "step": 33465 }, { "entropy": 5.7467793941497805, "epoch": 2.6040848084030346, "grad_norm": 1.2421875, "learning_rate": 0.0004317737269549643, "loss": 5.0599, "mean_token_accuracy": 0.20324262082576752, "num_tokens": 58067543.0, "step": 33470 }, { "entropy": 5.74483699798584, "epoch": 2.604473837774752, "grad_norm": 1.1796875, "learning_rate": 0.0004317538455808805, "loss": 4.9714, "mean_token_accuracy": 0.21242719888687134, "num_tokens": 58076882.0, "step": 33475 }, { "entropy": 5.719075679779053, "epoch": 2.6048628671464695, "grad_norm": 1.296875, "learning_rate": 0.0004317339618283065, "loss": 5.0026, "mean_token_accuracy": 0.21096653044223784, "num_tokens": 58085775.0, "step": 33480 }, { "entropy": 5.705637693405151, "epoch": 2.6052518965181872, "grad_norm": 1.265625, "learning_rate": 0.0004317140756975442, "loss": 4.9591, "mean_token_accuracy": 0.21007921993732454, "num_tokens": 58094488.0, "step": 33485 }, { "entropy": 5.681598377227783, "epoch": 2.6056409258899045, "grad_norm": 1.28125, "learning_rate": 0.0004316941871888951, "loss": 4.9455, "mean_token_accuracy": 0.20398151576519014, "num_tokens": 58103385.0, "step": 33490 }, { "entropy": 5.672256135940552, "epoch": 2.606029955261622, "grad_norm": 1.328125, "learning_rate": 0.00043167429630266134, "loss": 4.9328, "mean_token_accuracy": 0.21057169735431672, "num_tokens": 58111047.0, "step": 33495 }, { "entropy": 5.671245288848877, "epoch": 2.60641898463334, "grad_norm": 1.3046875, "learning_rate": 0.0004316544030391444, "loss": 4.9023, "mean_token_accuracy": 0.20500483065843583, "num_tokens": 58119676.0, "step": 33500 }, { "entropy": 5.607272672653198, "epoch": 2.6068080140050576, "grad_norm": 1.3125, "learning_rate": 0.0004316345073986461, "loss": 4.9323, "mean_token_accuracy": 0.20581505298614503, "num_tokens": 58128513.0, "step": 33505 }, { "entropy": 5.752149677276611, "epoch": 2.607197043376775, "grad_norm": 1.1875, "learning_rate": 0.0004316146093814686, "loss": 5.0527, "mean_token_accuracy": 0.19899842888116837, "num_tokens": 58137859.0, "step": 33510 }, { "entropy": 5.791234254837036, "epoch": 2.6075860727484925, "grad_norm": 1.1640625, "learning_rate": 0.0004315947089879137, "loss": 5.0059, "mean_token_accuracy": 0.20264592617750168, "num_tokens": 58147314.0, "step": 33515 }, { "entropy": 5.664511585235596, "epoch": 2.60797510212021, "grad_norm": 1.21875, "learning_rate": 0.00043157480621828327, "loss": 4.9706, "mean_token_accuracy": 0.20773538202047348, "num_tokens": 58156299.0, "step": 33520 }, { "entropy": 5.7481142520904545, "epoch": 2.6083641314919275, "grad_norm": 1.2578125, "learning_rate": 0.00043155490107287935, "loss": 5.0527, "mean_token_accuracy": 0.2047212690114975, "num_tokens": 58164799.0, "step": 33525 }, { "entropy": 5.75290207862854, "epoch": 2.608753160863645, "grad_norm": 1.21875, "learning_rate": 0.0004315349935520041, "loss": 5.1345, "mean_token_accuracy": 0.19438305348157883, "num_tokens": 58173901.0, "step": 33530 }, { "entropy": 5.658109855651856, "epoch": 2.609142190235363, "grad_norm": 1.2265625, "learning_rate": 0.0004315150836559594, "loss": 4.9201, "mean_token_accuracy": 0.20487455129623414, "num_tokens": 58183178.0, "step": 33535 }, { "entropy": 5.736638736724854, "epoch": 2.6095312196070806, "grad_norm": 1.265625, "learning_rate": 0.0004314951713850474, "loss": 4.9787, "mean_token_accuracy": 0.2029966190457344, "num_tokens": 58191556.0, "step": 33540 }, { "entropy": 5.67273097038269, "epoch": 2.609920248978798, "grad_norm": 1.171875, "learning_rate": 0.00043147525673957026, "loss": 4.929, "mean_token_accuracy": 0.21210908591747285, "num_tokens": 58200720.0, "step": 33545 }, { "entropy": 5.6656747341156, "epoch": 2.6103092783505155, "grad_norm": 1.265625, "learning_rate": 0.00043145533971983025, "loss": 4.9825, "mean_token_accuracy": 0.2079576373100281, "num_tokens": 58209635.0, "step": 33550 }, { "entropy": 5.733290386199951, "epoch": 2.6106983077222328, "grad_norm": 1.2578125, "learning_rate": 0.00043143542032612935, "loss": 4.954, "mean_token_accuracy": 0.21250915229320527, "num_tokens": 58217926.0, "step": 33555 }, { "entropy": 5.678271389007568, "epoch": 2.6110873370939505, "grad_norm": 1.1328125, "learning_rate": 0.0004314154985587701, "loss": 4.9463, "mean_token_accuracy": 0.2145895317196846, "num_tokens": 58227086.0, "step": 33560 }, { "entropy": 5.696404838562012, "epoch": 2.611476366465668, "grad_norm": 1.1875, "learning_rate": 0.00043139557441805457, "loss": 5.0569, "mean_token_accuracy": 0.20539588034152984, "num_tokens": 58236110.0, "step": 33565 }, { "entropy": 5.670447063446045, "epoch": 2.611865395837386, "grad_norm": 1.21875, "learning_rate": 0.00043137564790428503, "loss": 4.9004, "mean_token_accuracy": 0.2063648819923401, "num_tokens": 58244643.0, "step": 33570 }, { "entropy": 5.644930124282837, "epoch": 2.6122544252091036, "grad_norm": 1.2421875, "learning_rate": 0.00043135571901776397, "loss": 4.8991, "mean_token_accuracy": 0.21398013681173325, "num_tokens": 58252700.0, "step": 33575 }, { "entropy": 5.692533731460571, "epoch": 2.612643454580821, "grad_norm": 1.2265625, "learning_rate": 0.0004313357877587937, "loss": 5.0014, "mean_token_accuracy": 0.20700304806232453, "num_tokens": 58261274.0, "step": 33580 }, { "entropy": 5.76711802482605, "epoch": 2.6130324839525385, "grad_norm": 1.25, "learning_rate": 0.0004313158541276768, "loss": 5.0455, "mean_token_accuracy": 0.19952981173992157, "num_tokens": 58270957.0, "step": 33585 }, { "entropy": 5.719300222396851, "epoch": 2.6134215133242558, "grad_norm": 1.21875, "learning_rate": 0.0004312959181247156, "loss": 4.9578, "mean_token_accuracy": 0.20843596011400223, "num_tokens": 58279454.0, "step": 33590 }, { "entropy": 5.705104827880859, "epoch": 2.6138105426959735, "grad_norm": 1.1875, "learning_rate": 0.0004312759797502126, "loss": 4.9704, "mean_token_accuracy": 0.20996173918247224, "num_tokens": 58289085.0, "step": 33595 }, { "entropy": 5.699274921417237, "epoch": 2.614199572067691, "grad_norm": 1.328125, "learning_rate": 0.00043125603900447026, "loss": 5.0732, "mean_token_accuracy": 0.20572656244039536, "num_tokens": 58297901.0, "step": 33600 }, { "entropy": 5.730238533020019, "epoch": 2.614588601439409, "grad_norm": 1.1953125, "learning_rate": 0.0004312360958877913, "loss": 4.9895, "mean_token_accuracy": 0.20761232674121857, "num_tokens": 58307045.0, "step": 33605 }, { "entropy": 5.755982208251953, "epoch": 2.614977630811126, "grad_norm": 1.1953125, "learning_rate": 0.0004312161504004782, "loss": 5.0727, "mean_token_accuracy": 0.19465955197811127, "num_tokens": 58315767.0, "step": 33610 }, { "entropy": 5.766023921966553, "epoch": 2.615366660182844, "grad_norm": 1.2734375, "learning_rate": 0.00043119620254283375, "loss": 5.0064, "mean_token_accuracy": 0.20591259598731995, "num_tokens": 58324405.0, "step": 33615 }, { "entropy": 5.670374727249145, "epoch": 2.6157556895545615, "grad_norm": 1.2109375, "learning_rate": 0.00043117625231516054, "loss": 4.9099, "mean_token_accuracy": 0.21567057222127914, "num_tokens": 58332944.0, "step": 33620 }, { "entropy": 5.653215122222901, "epoch": 2.6161447189262788, "grad_norm": 1.2578125, "learning_rate": 0.0004311562997177612, "loss": 4.9828, "mean_token_accuracy": 0.20514826625585555, "num_tokens": 58341569.0, "step": 33625 }, { "entropy": 5.677874994277954, "epoch": 2.6165337482979965, "grad_norm": 1.2265625, "learning_rate": 0.0004311363447509386, "loss": 5.0936, "mean_token_accuracy": 0.20138383209705352, "num_tokens": 58350636.0, "step": 33630 }, { "entropy": 5.744486618041992, "epoch": 2.616922777669714, "grad_norm": 1.21875, "learning_rate": 0.0004311163874149955, "loss": 5.0148, "mean_token_accuracy": 0.2077670142054558, "num_tokens": 58359756.0, "step": 33635 }, { "entropy": 5.670916986465454, "epoch": 2.617311807041432, "grad_norm": 1.265625, "learning_rate": 0.00043109642771023464, "loss": 4.8948, "mean_token_accuracy": 0.20582329332828522, "num_tokens": 58368086.0, "step": 33640 }, { "entropy": 5.727845144271851, "epoch": 2.617700836413149, "grad_norm": 1.1640625, "learning_rate": 0.0004310764656369591, "loss": 5.0315, "mean_token_accuracy": 0.2002275764942169, "num_tokens": 58377597.0, "step": 33645 }, { "entropy": 5.704433441162109, "epoch": 2.618089865784867, "grad_norm": 1.1640625, "learning_rate": 0.0004310565011954715, "loss": 4.9264, "mean_token_accuracy": 0.2091353043913841, "num_tokens": 58385910.0, "step": 33650 }, { "entropy": 5.7768150806427006, "epoch": 2.618478895156584, "grad_norm": 1.1953125, "learning_rate": 0.0004310365343860748, "loss": 5.0384, "mean_token_accuracy": 0.1979433074593544, "num_tokens": 58394879.0, "step": 33655 }, { "entropy": 5.658612442016602, "epoch": 2.6188679245283017, "grad_norm": 1.1640625, "learning_rate": 0.00043101656520907225, "loss": 5.0216, "mean_token_accuracy": 0.2037658676505089, "num_tokens": 58403600.0, "step": 33660 }, { "entropy": 5.611598157882691, "epoch": 2.6192569539000194, "grad_norm": 1.203125, "learning_rate": 0.0004309965936647665, "loss": 4.7898, "mean_token_accuracy": 0.22781807482242583, "num_tokens": 58412470.0, "step": 33665 }, { "entropy": 5.588254594802857, "epoch": 2.619645983271737, "grad_norm": 1.1796875, "learning_rate": 0.0004309766197534608, "loss": 4.9013, "mean_token_accuracy": 0.2120668888092041, "num_tokens": 58421331.0, "step": 33670 }, { "entropy": 5.684003305435181, "epoch": 2.620035012643455, "grad_norm": 1.3203125, "learning_rate": 0.00043095664347545816, "loss": 4.9661, "mean_token_accuracy": 0.2020118221640587, "num_tokens": 58429387.0, "step": 33675 }, { "entropy": 5.726310777664184, "epoch": 2.620424042015172, "grad_norm": 1.21875, "learning_rate": 0.0004309366648310616, "loss": 5.0145, "mean_token_accuracy": 0.20813866555690766, "num_tokens": 58438724.0, "step": 33680 }, { "entropy": 5.734375858306885, "epoch": 2.62081307138689, "grad_norm": 1.2734375, "learning_rate": 0.00043091668382057443, "loss": 4.9852, "mean_token_accuracy": 0.20983607769012452, "num_tokens": 58448217.0, "step": 33685 }, { "entropy": 5.711432981491089, "epoch": 2.621202100758607, "grad_norm": 1.2890625, "learning_rate": 0.00043089670044429973, "loss": 5.0144, "mean_token_accuracy": 0.21108884513378143, "num_tokens": 58457572.0, "step": 33690 }, { "entropy": 5.690261316299439, "epoch": 2.6215911301303247, "grad_norm": 1.2109375, "learning_rate": 0.00043087671470254076, "loss": 4.9463, "mean_token_accuracy": 0.20680274516344072, "num_tokens": 58466403.0, "step": 33695 }, { "entropy": 5.660318851470947, "epoch": 2.6219801595020424, "grad_norm": 1.2421875, "learning_rate": 0.00043085672659560077, "loss": 4.7873, "mean_token_accuracy": 0.21833567768335344, "num_tokens": 58475435.0, "step": 33700 }, { "entropy": 5.689179372787476, "epoch": 2.62236918887376, "grad_norm": 1.3125, "learning_rate": 0.00043083673612378295, "loss": 4.9859, "mean_token_accuracy": 0.20444071739912034, "num_tokens": 58483564.0, "step": 33705 }, { "entropy": 5.600613689422607, "epoch": 2.6227582182454774, "grad_norm": 1.265625, "learning_rate": 0.00043081674328739066, "loss": 4.902, "mean_token_accuracy": 0.21259290874004363, "num_tokens": 58491991.0, "step": 33710 }, { "entropy": 5.660284423828125, "epoch": 2.623147247617195, "grad_norm": 1.25, "learning_rate": 0.00043079674808672744, "loss": 4.9853, "mean_token_accuracy": 0.20495769381523132, "num_tokens": 58500452.0, "step": 33715 }, { "entropy": 5.720640802383423, "epoch": 2.623536276988913, "grad_norm": 1.2265625, "learning_rate": 0.0004307767505220964, "loss": 4.9554, "mean_token_accuracy": 0.21203888207674026, "num_tokens": 58509124.0, "step": 33720 }, { "entropy": 5.699628162384033, "epoch": 2.62392530636063, "grad_norm": 1.3046875, "learning_rate": 0.0004307567505938012, "loss": 4.9607, "mean_token_accuracy": 0.20883955508470536, "num_tokens": 58516902.0, "step": 33725 }, { "entropy": 5.646574592590332, "epoch": 2.6243143357323477, "grad_norm": 1.375, "learning_rate": 0.0004307367483021452, "loss": 4.9198, "mean_token_accuracy": 0.2091030552983284, "num_tokens": 58525401.0, "step": 33730 }, { "entropy": 5.787299871444702, "epoch": 2.6247033651040654, "grad_norm": 1.125, "learning_rate": 0.000430716743647432, "loss": 5.1049, "mean_token_accuracy": 0.20118573158979416, "num_tokens": 58534473.0, "step": 33735 }, { "entropy": 5.655651378631592, "epoch": 2.625092394475783, "grad_norm": 1.1953125, "learning_rate": 0.000430696736629965, "loss": 4.7877, "mean_token_accuracy": 0.22510315775871276, "num_tokens": 58543137.0, "step": 33740 }, { "entropy": 5.634085607528687, "epoch": 2.6254814238475004, "grad_norm": 1.34375, "learning_rate": 0.0004306767272500478, "loss": 4.8773, "mean_token_accuracy": 0.21139079481363296, "num_tokens": 58551260.0, "step": 33745 }, { "entropy": 5.629272842407227, "epoch": 2.625870453219218, "grad_norm": 1.2890625, "learning_rate": 0.00043065671550798415, "loss": 4.9033, "mean_token_accuracy": 0.209025838971138, "num_tokens": 58559428.0, "step": 33750 }, { "entropy": 5.6439038753509525, "epoch": 2.626259482590936, "grad_norm": 1.1640625, "learning_rate": 0.00043063670140407753, "loss": 4.9178, "mean_token_accuracy": 0.2089892089366913, "num_tokens": 58568153.0, "step": 33755 }, { "entropy": 5.7283501625061035, "epoch": 2.626648511962653, "grad_norm": 1.1484375, "learning_rate": 0.0004306166849386317, "loss": 5.0459, "mean_token_accuracy": 0.2047397866845131, "num_tokens": 58577432.0, "step": 33760 }, { "entropy": 5.739789247512817, "epoch": 2.6270375413343707, "grad_norm": 1.3046875, "learning_rate": 0.00043059666611195037, "loss": 5.0883, "mean_token_accuracy": 0.19985555857419968, "num_tokens": 58586988.0, "step": 33765 }, { "entropy": 5.743124294281006, "epoch": 2.6274265707060884, "grad_norm": 1.25, "learning_rate": 0.0004305766449243372, "loss": 4.8876, "mean_token_accuracy": 0.22166897505521774, "num_tokens": 58595094.0, "step": 33770 }, { "entropy": 5.655226945877075, "epoch": 2.627815600077806, "grad_norm": 1.25, "learning_rate": 0.0004305566213760962, "loss": 4.9218, "mean_token_accuracy": 0.21146383434534072, "num_tokens": 58603927.0, "step": 33775 }, { "entropy": 5.719522190093994, "epoch": 2.6282046294495234, "grad_norm": 1.1796875, "learning_rate": 0.00043053659546753094, "loss": 5.0671, "mean_token_accuracy": 0.19773264974355698, "num_tokens": 58612497.0, "step": 33780 }, { "entropy": 5.7501390933990475, "epoch": 2.628593658821241, "grad_norm": 1.234375, "learning_rate": 0.0004305165671989455, "loss": 4.9731, "mean_token_accuracy": 0.20600755661725997, "num_tokens": 58621814.0, "step": 33785 }, { "entropy": 5.766373348236084, "epoch": 2.6289826881929583, "grad_norm": 1.1875, "learning_rate": 0.0004304965365706437, "loss": 4.9653, "mean_token_accuracy": 0.20424779802560805, "num_tokens": 58630215.0, "step": 33790 }, { "entropy": 5.6639776706695555, "epoch": 2.629371717564676, "grad_norm": 1.1953125, "learning_rate": 0.0004304765035829294, "loss": 5.0239, "mean_token_accuracy": 0.2028355360031128, "num_tokens": 58638710.0, "step": 33795 }, { "entropy": 5.686469793319702, "epoch": 2.6297607469363937, "grad_norm": 1.265625, "learning_rate": 0.00043045646823610664, "loss": 4.9598, "mean_token_accuracy": 0.201075978577137, "num_tokens": 58647119.0, "step": 33800 }, { "entropy": 5.746336984634399, "epoch": 2.6301497763081114, "grad_norm": 1.2421875, "learning_rate": 0.00043043643053047935, "loss": 5.0267, "mean_token_accuracy": 0.1985120490193367, "num_tokens": 58655669.0, "step": 33805 }, { "entropy": 5.73438868522644, "epoch": 2.6305388056798287, "grad_norm": 1.2734375, "learning_rate": 0.0004304163904663517, "loss": 5.0183, "mean_token_accuracy": 0.19953179806470872, "num_tokens": 58664249.0, "step": 33810 }, { "entropy": 5.69872407913208, "epoch": 2.6309278350515464, "grad_norm": 1.15625, "learning_rate": 0.00043039634804402767, "loss": 5.0326, "mean_token_accuracy": 0.20161376148462296, "num_tokens": 58672823.0, "step": 33815 }, { "entropy": 5.713734197616577, "epoch": 2.631316864423264, "grad_norm": 1.2265625, "learning_rate": 0.0004303763032638114, "loss": 5.0043, "mean_token_accuracy": 0.20238484740257262, "num_tokens": 58681430.0, "step": 33820 }, { "entropy": 5.687529611587524, "epoch": 2.6317058937949813, "grad_norm": 1.109375, "learning_rate": 0.0004303562561260071, "loss": 4.9964, "mean_token_accuracy": 0.21030967980623244, "num_tokens": 58690388.0, "step": 33825 }, { "entropy": 5.674468851089477, "epoch": 2.632094923166699, "grad_norm": 1.3515625, "learning_rate": 0.00043033620663091883, "loss": 4.959, "mean_token_accuracy": 0.21134776324033738, "num_tokens": 58698651.0, "step": 33830 }, { "entropy": 5.769495248794556, "epoch": 2.6324839525384167, "grad_norm": 1.171875, "learning_rate": 0.0004303161547788509, "loss": 5.03, "mean_token_accuracy": 0.2049405574798584, "num_tokens": 58707951.0, "step": 33835 }, { "entropy": 5.70444884300232, "epoch": 2.6328729819101344, "grad_norm": 1.3125, "learning_rate": 0.0004302961005701074, "loss": 4.9105, "mean_token_accuracy": 0.2088685691356659, "num_tokens": 58716220.0, "step": 33840 }, { "entropy": 5.7517335414886475, "epoch": 2.6332620112818517, "grad_norm": 1.1875, "learning_rate": 0.00043027604400499295, "loss": 4.9952, "mean_token_accuracy": 0.20654278099536896, "num_tokens": 58725534.0, "step": 33845 }, { "entropy": 5.714947652816773, "epoch": 2.6336510406535694, "grad_norm": 1.265625, "learning_rate": 0.00043025598508381155, "loss": 4.8576, "mean_token_accuracy": 0.21352887153625488, "num_tokens": 58733725.0, "step": 33850 }, { "entropy": 5.656706809997559, "epoch": 2.634040070025287, "grad_norm": 1.234375, "learning_rate": 0.0004302359238068677, "loss": 5.0068, "mean_token_accuracy": 0.2101040467619896, "num_tokens": 58742483.0, "step": 33855 }, { "entropy": 5.688205194473267, "epoch": 2.6344290993970043, "grad_norm": 1.28125, "learning_rate": 0.00043021586017446585, "loss": 4.9616, "mean_token_accuracy": 0.20769460946321489, "num_tokens": 58750442.0, "step": 33860 }, { "entropy": 5.731773853302002, "epoch": 2.634818128768722, "grad_norm": 1.2578125, "learning_rate": 0.00043019579418691027, "loss": 5.0065, "mean_token_accuracy": 0.19845550060272216, "num_tokens": 58759640.0, "step": 33865 }, { "entropy": 5.671589183807373, "epoch": 2.6352071581404397, "grad_norm": 1.15625, "learning_rate": 0.0004301757258445056, "loss": 4.8321, "mean_token_accuracy": 0.21180316656827927, "num_tokens": 58768241.0, "step": 33870 }, { "entropy": 5.693029546737671, "epoch": 2.6355961875121574, "grad_norm": 1.1875, "learning_rate": 0.0004301556551475563, "loss": 5.0091, "mean_token_accuracy": 0.20384200364351274, "num_tokens": 58777125.0, "step": 33875 }, { "entropy": 5.726770401000977, "epoch": 2.6359852168838747, "grad_norm": 1.2109375, "learning_rate": 0.0004301355820963669, "loss": 5.0091, "mean_token_accuracy": 0.210397107899189, "num_tokens": 58785855.0, "step": 33880 }, { "entropy": 5.748571586608887, "epoch": 2.6363742462555924, "grad_norm": 1.1328125, "learning_rate": 0.0004301155066912419, "loss": 5.0416, "mean_token_accuracy": 0.20423906594514846, "num_tokens": 58795235.0, "step": 33885 }, { "entropy": 5.620795965194702, "epoch": 2.6367632756273096, "grad_norm": 1.3046875, "learning_rate": 0.000430095428932486, "loss": 4.9055, "mean_token_accuracy": 0.20913298577070236, "num_tokens": 58803434.0, "step": 33890 }, { "entropy": 5.701079559326172, "epoch": 2.6371523049990273, "grad_norm": 1.1328125, "learning_rate": 0.00043007534882040385, "loss": 5.0433, "mean_token_accuracy": 0.19801911413669587, "num_tokens": 58811995.0, "step": 33895 }, { "entropy": 5.7786987781524655, "epoch": 2.637541334370745, "grad_norm": 1.28125, "learning_rate": 0.0004300552663553001, "loss": 5.0452, "mean_token_accuracy": 0.20190469920635223, "num_tokens": 58820035.0, "step": 33900 }, { "entropy": 5.714387607574463, "epoch": 2.6379303637424627, "grad_norm": 1.34375, "learning_rate": 0.0004300351815374795, "loss": 4.9201, "mean_token_accuracy": 0.20515310615301133, "num_tokens": 58829322.0, "step": 33905 }, { "entropy": 5.624718236923218, "epoch": 2.63831939311418, "grad_norm": 1.234375, "learning_rate": 0.0004300150943672467, "loss": 5.0119, "mean_token_accuracy": 0.2068459451198578, "num_tokens": 58838227.0, "step": 33910 }, { "entropy": 5.734870576858521, "epoch": 2.6387084224858977, "grad_norm": 1.1796875, "learning_rate": 0.0004299950048449067, "loss": 5.0624, "mean_token_accuracy": 0.20370962023735045, "num_tokens": 58847118.0, "step": 33915 }, { "entropy": 5.67009129524231, "epoch": 2.6390974518576154, "grad_norm": 1.25, "learning_rate": 0.0004299749129707641, "loss": 4.9085, "mean_token_accuracy": 0.2081275314092636, "num_tokens": 58855211.0, "step": 33920 }, { "entropy": 5.693898296356201, "epoch": 2.6394864812293326, "grad_norm": 1.203125, "learning_rate": 0.0004299548187451239, "loss": 5.0339, "mean_token_accuracy": 0.20446945279836654, "num_tokens": 58864412.0, "step": 33925 }, { "entropy": 5.674614906311035, "epoch": 2.6398755106010503, "grad_norm": 1.234375, "learning_rate": 0.00042993472216829097, "loss": 5.0135, "mean_token_accuracy": 0.20582833439111708, "num_tokens": 58873102.0, "step": 33930 }, { "entropy": 5.777045440673828, "epoch": 2.640264539972768, "grad_norm": 1.1796875, "learning_rate": 0.00042991462324057025, "loss": 5.0768, "mean_token_accuracy": 0.20361398607492448, "num_tokens": 58881974.0, "step": 33935 }, { "entropy": 5.701866626739502, "epoch": 2.6406535693444857, "grad_norm": 1.359375, "learning_rate": 0.0004298945219622667, "loss": 4.992, "mean_token_accuracy": 0.21201558858156205, "num_tokens": 58890906.0, "step": 33940 }, { "entropy": 5.6590558052062985, "epoch": 2.641042598716203, "grad_norm": 1.21875, "learning_rate": 0.00042987441833368525, "loss": 4.9716, "mean_token_accuracy": 0.20415595173835754, "num_tokens": 58900368.0, "step": 33945 }, { "entropy": 5.7435822010040285, "epoch": 2.6414316280879206, "grad_norm": 1.2734375, "learning_rate": 0.00042985431235513104, "loss": 5.0726, "mean_token_accuracy": 0.19571671038866043, "num_tokens": 58910023.0, "step": 33950 }, { "entropy": 5.717715883255005, "epoch": 2.6418206574596383, "grad_norm": 1.234375, "learning_rate": 0.00042983420402690917, "loss": 4.9589, "mean_token_accuracy": 0.20852474272251129, "num_tokens": 58918451.0, "step": 33955 }, { "entropy": 5.629948568344116, "epoch": 2.6422096868313556, "grad_norm": 1.265625, "learning_rate": 0.00042981409334932457, "loss": 4.9187, "mean_token_accuracy": 0.20955066084861756, "num_tokens": 58927017.0, "step": 33960 }, { "entropy": 5.6800707340240475, "epoch": 2.6425987162030733, "grad_norm": 1.25, "learning_rate": 0.0004297939803226826, "loss": 4.905, "mean_token_accuracy": 0.2099366456270218, "num_tokens": 58935438.0, "step": 33965 }, { "entropy": 5.688488292694092, "epoch": 2.642987745574791, "grad_norm": 1.3125, "learning_rate": 0.0004297738649472884, "loss": 4.9798, "mean_token_accuracy": 0.20595991909503936, "num_tokens": 58943806.0, "step": 33970 }, { "entropy": 5.759329032897949, "epoch": 2.6433767749465087, "grad_norm": 1.2109375, "learning_rate": 0.00042975374722344713, "loss": 5.0402, "mean_token_accuracy": 0.2057760939002037, "num_tokens": 58952997.0, "step": 33975 }, { "entropy": 5.655094146728516, "epoch": 2.643765804318226, "grad_norm": 1.2109375, "learning_rate": 0.00042973362715146397, "loss": 4.944, "mean_token_accuracy": 0.21307116448879243, "num_tokens": 58961820.0, "step": 33980 }, { "entropy": 5.756137752532959, "epoch": 2.6441548336899436, "grad_norm": 1.203125, "learning_rate": 0.0004297135047316444, "loss": 5.0276, "mean_token_accuracy": 0.1944836527109146, "num_tokens": 58969856.0, "step": 33985 }, { "entropy": 5.650730228424072, "epoch": 2.644543863061661, "grad_norm": 1.2109375, "learning_rate": 0.0004296933799642936, "loss": 4.8743, "mean_token_accuracy": 0.21194353997707366, "num_tokens": 58978341.0, "step": 33990 }, { "entropy": 5.708328342437744, "epoch": 2.6449328924333786, "grad_norm": 1.234375, "learning_rate": 0.000429673252849717, "loss": 4.961, "mean_token_accuracy": 0.20882129073143005, "num_tokens": 58987468.0, "step": 33995 }, { "entropy": 5.6675660610198975, "epoch": 2.6453219218050963, "grad_norm": 1.25, "learning_rate": 0.00042965312338822005, "loss": 4.9604, "mean_token_accuracy": 0.20905167758464813, "num_tokens": 58995824.0, "step": 34000 }, { "entropy": 5.643595409393311, "epoch": 2.645710951176814, "grad_norm": 1.28125, "learning_rate": 0.000429632991580108, "loss": 4.93, "mean_token_accuracy": 0.20923031866550446, "num_tokens": 59005209.0, "step": 34005 }, { "entropy": 5.674721527099609, "epoch": 2.6460999805485317, "grad_norm": 1.1328125, "learning_rate": 0.0004296128574256864, "loss": 4.9957, "mean_token_accuracy": 0.20790353119373323, "num_tokens": 59013675.0, "step": 34010 }, { "entropy": 5.6995950698852536, "epoch": 2.646489009920249, "grad_norm": 1.265625, "learning_rate": 0.00042959272092526086, "loss": 4.9594, "mean_token_accuracy": 0.2089621603488922, "num_tokens": 59022237.0, "step": 34015 }, { "entropy": 5.662182998657227, "epoch": 2.6468780392919666, "grad_norm": 1.25, "learning_rate": 0.00042957258207913687, "loss": 4.873, "mean_token_accuracy": 0.21584845036268235, "num_tokens": 59030442.0, "step": 34020 }, { "entropy": 5.659041070938111, "epoch": 2.647267068663684, "grad_norm": 1.28125, "learning_rate": 0.00042955244088761985, "loss": 4.9175, "mean_token_accuracy": 0.2088031530380249, "num_tokens": 59038160.0, "step": 34025 }, { "entropy": 5.7612823963165285, "epoch": 2.6476560980354016, "grad_norm": 1.2265625, "learning_rate": 0.0004295322973510156, "loss": 5.0586, "mean_token_accuracy": 0.2021506905555725, "num_tokens": 59047083.0, "step": 34030 }, { "entropy": 5.701892423629761, "epoch": 2.6480451274071193, "grad_norm": 1.1875, "learning_rate": 0.0004295121514696297, "loss": 5.0014, "mean_token_accuracy": 0.20804806649684907, "num_tokens": 59055161.0, "step": 34035 }, { "entropy": 5.756841325759888, "epoch": 2.648434156778837, "grad_norm": 1.1953125, "learning_rate": 0.00042949200324376784, "loss": 5.0031, "mean_token_accuracy": 0.20500402599573136, "num_tokens": 59063870.0, "step": 34040 }, { "entropy": 5.614480018615723, "epoch": 2.6488231861505542, "grad_norm": 1.28125, "learning_rate": 0.0004294718526737357, "loss": 4.9114, "mean_token_accuracy": 0.21204107850790024, "num_tokens": 59072577.0, "step": 34045 }, { "entropy": 5.677929353713989, "epoch": 2.649212215522272, "grad_norm": 1.1640625, "learning_rate": 0.0004294516997598391, "loss": 4.9674, "mean_token_accuracy": 0.20653841346502305, "num_tokens": 59081764.0, "step": 34050 }, { "entropy": 5.740802335739136, "epoch": 2.6496012448939896, "grad_norm": 1.296875, "learning_rate": 0.0004294315445023838, "loss": 4.9332, "mean_token_accuracy": 0.20827574282884598, "num_tokens": 59090494.0, "step": 34055 }, { "entropy": 5.712126922607422, "epoch": 2.649990274265707, "grad_norm": 1.171875, "learning_rate": 0.00042941138690167556, "loss": 4.9311, "mean_token_accuracy": 0.209780690073967, "num_tokens": 59099357.0, "step": 34060 }, { "entropy": 5.690656995773315, "epoch": 2.6503793036374246, "grad_norm": 1.265625, "learning_rate": 0.0004293912269580204, "loss": 4.9749, "mean_token_accuracy": 0.21206434220075607, "num_tokens": 59108377.0, "step": 34065 }, { "entropy": 5.666376733779908, "epoch": 2.6507683330091423, "grad_norm": 1.3359375, "learning_rate": 0.000429371064671724, "loss": 4.9231, "mean_token_accuracy": 0.21006055623292924, "num_tokens": 59116621.0, "step": 34070 }, { "entropy": 5.730780506134034, "epoch": 2.65115736238086, "grad_norm": 1.2265625, "learning_rate": 0.00042935090004309247, "loss": 5.0215, "mean_token_accuracy": 0.20594560354948044, "num_tokens": 59124886.0, "step": 34075 }, { "entropy": 5.708247232437134, "epoch": 2.6515463917525772, "grad_norm": 1.2265625, "learning_rate": 0.00042933073307243165, "loss": 4.9383, "mean_token_accuracy": 0.2122181162238121, "num_tokens": 59133315.0, "step": 34080 }, { "entropy": 5.733900547027588, "epoch": 2.651935421124295, "grad_norm": 1.2421875, "learning_rate": 0.00042931056376004767, "loss": 4.9445, "mean_token_accuracy": 0.214688478410244, "num_tokens": 59141906.0, "step": 34085 }, { "entropy": 5.752964639663697, "epoch": 2.652324450496012, "grad_norm": 1.21875, "learning_rate": 0.0004292903921062465, "loss": 4.9964, "mean_token_accuracy": 0.20351265966892243, "num_tokens": 59150072.0, "step": 34090 }, { "entropy": 5.698544263839722, "epoch": 2.65271347986773, "grad_norm": 1.15625, "learning_rate": 0.00042927021811133416, "loss": 4.9728, "mean_token_accuracy": 0.20696386247873305, "num_tokens": 59158798.0, "step": 34095 }, { "entropy": 5.651756477355957, "epoch": 2.6531025092394476, "grad_norm": 1.296875, "learning_rate": 0.0004292500417756167, "loss": 4.9694, "mean_token_accuracy": 0.21073096990585327, "num_tokens": 59167327.0, "step": 34100 }, { "entropy": 5.752778005599976, "epoch": 2.6534915386111653, "grad_norm": 1.2109375, "learning_rate": 0.00042922986309940054, "loss": 5.0066, "mean_token_accuracy": 0.2058023437857628, "num_tokens": 59176113.0, "step": 34105 }, { "entropy": 5.769353532791138, "epoch": 2.653880567982883, "grad_norm": 1.2265625, "learning_rate": 0.00042920968208299165, "loss": 4.9606, "mean_token_accuracy": 0.2041608363389969, "num_tokens": 59184410.0, "step": 34110 }, { "entropy": 5.681175279617309, "epoch": 2.6542695973546, "grad_norm": 1.171875, "learning_rate": 0.0004291894987266963, "loss": 5.0146, "mean_token_accuracy": 0.2078913688659668, "num_tokens": 59193540.0, "step": 34115 }, { "entropy": 5.741752624511719, "epoch": 2.654658626726318, "grad_norm": 1.2578125, "learning_rate": 0.00042916931303082064, "loss": 5.0098, "mean_token_accuracy": 0.20146892219781876, "num_tokens": 59202219.0, "step": 34120 }, { "entropy": 5.754435062408447, "epoch": 2.655047656098035, "grad_norm": 1.203125, "learning_rate": 0.00042914912499567113, "loss": 5.0448, "mean_token_accuracy": 0.20359433591365814, "num_tokens": 59211469.0, "step": 34125 }, { "entropy": 5.726271629333496, "epoch": 2.655436685469753, "grad_norm": 1.2109375, "learning_rate": 0.00042912893462155395, "loss": 4.9238, "mean_token_accuracy": 0.21012914478778838, "num_tokens": 59220276.0, "step": 34130 }, { "entropy": 5.745905876159668, "epoch": 2.6558257148414706, "grad_norm": 1.1484375, "learning_rate": 0.00042910874190877545, "loss": 4.9804, "mean_token_accuracy": 0.20637679398059844, "num_tokens": 59229412.0, "step": 34135 }, { "entropy": 5.751666498184204, "epoch": 2.6562147442131883, "grad_norm": 1.125, "learning_rate": 0.0004290885468576422, "loss": 4.8737, "mean_token_accuracy": 0.21003971695899964, "num_tokens": 59237442.0, "step": 34140 }, { "entropy": 5.72420744895935, "epoch": 2.6566037735849055, "grad_norm": 1.2578125, "learning_rate": 0.0004290683494684604, "loss": 4.9606, "mean_token_accuracy": 0.2018063485622406, "num_tokens": 59245964.0, "step": 34145 }, { "entropy": 5.714412879943848, "epoch": 2.656992802956623, "grad_norm": 1.2890625, "learning_rate": 0.0004290481497415367, "loss": 4.9893, "mean_token_accuracy": 0.20915480703115463, "num_tokens": 59254456.0, "step": 34150 }, { "entropy": 5.641820478439331, "epoch": 2.657381832328341, "grad_norm": 1.3125, "learning_rate": 0.0004290279476771775, "loss": 4.9379, "mean_token_accuracy": 0.20672687590122224, "num_tokens": 59262550.0, "step": 34155 }, { "entropy": 5.64005823135376, "epoch": 2.657770861700058, "grad_norm": 1.25, "learning_rate": 0.0004290077432756894, "loss": 4.9074, "mean_token_accuracy": 0.21478297114372252, "num_tokens": 59271877.0, "step": 34160 }, { "entropy": 5.729611587524414, "epoch": 2.658159891071776, "grad_norm": 1.2421875, "learning_rate": 0.0004289875365373788, "loss": 4.9254, "mean_token_accuracy": 0.21334144920110704, "num_tokens": 59280991.0, "step": 34165 }, { "entropy": 5.71203351020813, "epoch": 2.6585489204434936, "grad_norm": 1.1640625, "learning_rate": 0.00042896732746255256, "loss": 4.8875, "mean_token_accuracy": 0.2146846041083336, "num_tokens": 59289508.0, "step": 34170 }, { "entropy": 5.642649745941162, "epoch": 2.6589379498152113, "grad_norm": 1.2109375, "learning_rate": 0.00042894711605151714, "loss": 4.8933, "mean_token_accuracy": 0.211956287920475, "num_tokens": 59298084.0, "step": 34175 }, { "entropy": 5.682379913330078, "epoch": 2.6593269791869285, "grad_norm": 1.203125, "learning_rate": 0.00042892690230457924, "loss": 4.969, "mean_token_accuracy": 0.21003276258707046, "num_tokens": 59306846.0, "step": 34180 }, { "entropy": 5.677598667144776, "epoch": 2.659716008558646, "grad_norm": 1.25, "learning_rate": 0.00042890668622204566, "loss": 4.8789, "mean_token_accuracy": 0.20794605016708373, "num_tokens": 59315086.0, "step": 34185 }, { "entropy": 5.68616509437561, "epoch": 2.660105037930364, "grad_norm": 1.1640625, "learning_rate": 0.000428886467804223, "loss": 4.9373, "mean_token_accuracy": 0.20802532285451888, "num_tokens": 59323699.0, "step": 34190 }, { "entropy": 5.694668388366699, "epoch": 2.660494067302081, "grad_norm": 1.3046875, "learning_rate": 0.00042886624705141825, "loss": 4.9699, "mean_token_accuracy": 0.20793934017419816, "num_tokens": 59332444.0, "step": 34195 }, { "entropy": 5.648365497589111, "epoch": 2.660883096673799, "grad_norm": 1.2578125, "learning_rate": 0.00042884602396393796, "loss": 4.9538, "mean_token_accuracy": 0.20524705350399017, "num_tokens": 59340980.0, "step": 34200 }, { "entropy": 5.727013778686524, "epoch": 2.6612721260455166, "grad_norm": 1.28125, "learning_rate": 0.0004288257985420892, "loss": 4.9701, "mean_token_accuracy": 0.21216763854026793, "num_tokens": 59348937.0, "step": 34205 }, { "entropy": 5.702333259582519, "epoch": 2.6616611554172342, "grad_norm": 1.2734375, "learning_rate": 0.0004288055707861788, "loss": 5.052, "mean_token_accuracy": 0.19866923242807388, "num_tokens": 59356936.0, "step": 34210 }, { "entropy": 5.741358995437622, "epoch": 2.6620501847889515, "grad_norm": 1.2265625, "learning_rate": 0.00042878534069651364, "loss": 5.052, "mean_token_accuracy": 0.19417907148599625, "num_tokens": 59366052.0, "step": 34215 }, { "entropy": 5.687316513061523, "epoch": 2.662439214160669, "grad_norm": 1.28125, "learning_rate": 0.0004287651082734007, "loss": 4.9662, "mean_token_accuracy": 0.20594962537288666, "num_tokens": 59374607.0, "step": 34220 }, { "entropy": 5.68810453414917, "epoch": 2.6628282435323865, "grad_norm": 1.1953125, "learning_rate": 0.000428744873517147, "loss": 5.0529, "mean_token_accuracy": 0.19593643695116042, "num_tokens": 59383607.0, "step": 34225 }, { "entropy": 5.707661867141724, "epoch": 2.663217272904104, "grad_norm": 1.234375, "learning_rate": 0.0004287246364280596, "loss": 4.9275, "mean_token_accuracy": 0.2139095664024353, "num_tokens": 59391472.0, "step": 34230 }, { "entropy": 5.682311487197876, "epoch": 2.663606302275822, "grad_norm": 1.2265625, "learning_rate": 0.0004287043970064455, "loss": 4.9281, "mean_token_accuracy": 0.21063620448112488, "num_tokens": 59400185.0, "step": 34235 }, { "entropy": 5.6669997215271, "epoch": 2.6639953316475395, "grad_norm": 1.234375, "learning_rate": 0.0004286841552526118, "loss": 5.0055, "mean_token_accuracy": 0.20499003678560257, "num_tokens": 59408188.0, "step": 34240 }, { "entropy": 5.7498384475708, "epoch": 2.664384361019257, "grad_norm": 1.1171875, "learning_rate": 0.00042866391116686567, "loss": 5.0477, "mean_token_accuracy": 0.20273904651403427, "num_tokens": 59417302.0, "step": 34245 }, { "entropy": 5.761425495147705, "epoch": 2.6647733903909745, "grad_norm": 1.2265625, "learning_rate": 0.0004286436647495142, "loss": 4.9456, "mean_token_accuracy": 0.20874613970518113, "num_tokens": 59425913.0, "step": 34250 }, { "entropy": 5.666897487640381, "epoch": 2.665162419762692, "grad_norm": 1.3046875, "learning_rate": 0.00042862341600086477, "loss": 4.9271, "mean_token_accuracy": 0.2113860309123993, "num_tokens": 59434325.0, "step": 34255 }, { "entropy": 5.661088848114014, "epoch": 2.6655514491344094, "grad_norm": 1.21875, "learning_rate": 0.00042860316492122447, "loss": 4.9361, "mean_token_accuracy": 0.21041697561740874, "num_tokens": 59443280.0, "step": 34260 }, { "entropy": 5.755367374420166, "epoch": 2.665940478506127, "grad_norm": 1.1484375, "learning_rate": 0.0004285829115109006, "loss": 5.038, "mean_token_accuracy": 0.20381179749965667, "num_tokens": 59452498.0, "step": 34265 }, { "entropy": 5.799960088729859, "epoch": 2.666329507877845, "grad_norm": 1.1484375, "learning_rate": 0.0004285626557702005, "loss": 5.091, "mean_token_accuracy": 0.19749799519777297, "num_tokens": 59461629.0, "step": 34270 }, { "entropy": 5.742047739028931, "epoch": 2.6667185372495625, "grad_norm": 1.28125, "learning_rate": 0.0004285423976994316, "loss": 4.9701, "mean_token_accuracy": 0.20312186628580092, "num_tokens": 59470835.0, "step": 34275 }, { "entropy": 5.674464464187622, "epoch": 2.66710756662128, "grad_norm": 1.2578125, "learning_rate": 0.00042852213729890117, "loss": 4.9549, "mean_token_accuracy": 0.2139824390411377, "num_tokens": 59479102.0, "step": 34280 }, { "entropy": 5.798505115509033, "epoch": 2.6674965959929975, "grad_norm": 1.3515625, "learning_rate": 0.0004285018745689166, "loss": 5.0904, "mean_token_accuracy": 0.2040783166885376, "num_tokens": 59487622.0, "step": 34285 }, { "entropy": 5.692944669723511, "epoch": 2.667885625364715, "grad_norm": 1.1796875, "learning_rate": 0.0004284816095097855, "loss": 4.9678, "mean_token_accuracy": 0.20580867379903794, "num_tokens": 59496038.0, "step": 34290 }, { "entropy": 5.7193889141082765, "epoch": 2.6682746547364324, "grad_norm": 1.2109375, "learning_rate": 0.0004284613421218152, "loss": 5.0119, "mean_token_accuracy": 0.20729649513959886, "num_tokens": 59504214.0, "step": 34295 }, { "entropy": 5.6824049949646, "epoch": 2.66866368410815, "grad_norm": 1.2578125, "learning_rate": 0.00042844107240531324, "loss": 5.0014, "mean_token_accuracy": 0.20677757412195205, "num_tokens": 59512478.0, "step": 34300 }, { "entropy": 5.695660638809204, "epoch": 2.669052713479868, "grad_norm": 1.2421875, "learning_rate": 0.0004284208003605873, "loss": 4.9802, "mean_token_accuracy": 0.2104514554142952, "num_tokens": 59520528.0, "step": 34305 }, { "entropy": 5.661789226531982, "epoch": 2.6694417428515855, "grad_norm": 1.25, "learning_rate": 0.000428400525987945, "loss": 4.9793, "mean_token_accuracy": 0.2099365249276161, "num_tokens": 59529011.0, "step": 34310 }, { "entropy": 5.618891906738281, "epoch": 2.669830772223303, "grad_norm": 1.234375, "learning_rate": 0.00042838024928769375, "loss": 4.8466, "mean_token_accuracy": 0.2162046879529953, "num_tokens": 59537361.0, "step": 34315 }, { "entropy": 5.685580587387085, "epoch": 2.6702198015950205, "grad_norm": 1.328125, "learning_rate": 0.00042835997026014145, "loss": 4.938, "mean_token_accuracy": 0.20677391737699508, "num_tokens": 59545154.0, "step": 34320 }, { "entropy": 5.639438247680664, "epoch": 2.6706088309667377, "grad_norm": 1.2421875, "learning_rate": 0.0004283396889055957, "loss": 4.9723, "mean_token_accuracy": 0.2005898490548134, "num_tokens": 59553415.0, "step": 34325 }, { "entropy": 5.689557504653931, "epoch": 2.6709978603384554, "grad_norm": 1.25, "learning_rate": 0.0004283194052243641, "loss": 4.9459, "mean_token_accuracy": 0.20871423482894896, "num_tokens": 59561128.0, "step": 34330 }, { "entropy": 5.779829120635986, "epoch": 2.671386889710173, "grad_norm": 1.140625, "learning_rate": 0.00042829911921675456, "loss": 5.0376, "mean_token_accuracy": 0.2086014539003372, "num_tokens": 59570223.0, "step": 34335 }, { "entropy": 5.7249342918396, "epoch": 2.671775919081891, "grad_norm": 1.2421875, "learning_rate": 0.000428278830883075, "loss": 4.9379, "mean_token_accuracy": 0.20448742359876632, "num_tokens": 59578643.0, "step": 34340 }, { "entropy": 5.693987083435059, "epoch": 2.6721649484536085, "grad_norm": 1.2265625, "learning_rate": 0.00042825854022363307, "loss": 4.9649, "mean_token_accuracy": 0.2049323335289955, "num_tokens": 59587640.0, "step": 34345 }, { "entropy": 5.7125767230987545, "epoch": 2.6725539778253258, "grad_norm": 1.2265625, "learning_rate": 0.00042823824723873676, "loss": 5.011, "mean_token_accuracy": 0.2052415132522583, "num_tokens": 59596146.0, "step": 34350 }, { "entropy": 5.684187602996826, "epoch": 2.6729430071970435, "grad_norm": 1.28125, "learning_rate": 0.00042821795192869407, "loss": 4.8514, "mean_token_accuracy": 0.21603763103485107, "num_tokens": 59604774.0, "step": 34355 }, { "entropy": 5.715900039672851, "epoch": 2.6733320365687607, "grad_norm": 1.28125, "learning_rate": 0.0004281976542938127, "loss": 4.9342, "mean_token_accuracy": 0.20937345921993256, "num_tokens": 59613241.0, "step": 34360 }, { "entropy": 5.6809711933135985, "epoch": 2.6737210659404784, "grad_norm": 1.2109375, "learning_rate": 0.00042817735433440076, "loss": 4.9397, "mean_token_accuracy": 0.20062430649995805, "num_tokens": 59621844.0, "step": 34365 }, { "entropy": 5.717845869064331, "epoch": 2.674110095312196, "grad_norm": 1.2578125, "learning_rate": 0.0004281570520507663, "loss": 4.9406, "mean_token_accuracy": 0.2075674444437027, "num_tokens": 59630596.0, "step": 34370 }, { "entropy": 5.701227521896362, "epoch": 2.674499124683914, "grad_norm": 1.2890625, "learning_rate": 0.00042813674744321737, "loss": 4.9909, "mean_token_accuracy": 0.20935696512460708, "num_tokens": 59638830.0, "step": 34375 }, { "entropy": 5.646785163879395, "epoch": 2.674888154055631, "grad_norm": 1.3125, "learning_rate": 0.000428116440512062, "loss": 4.8799, "mean_token_accuracy": 0.20783390551805497, "num_tokens": 59647425.0, "step": 34380 }, { "entropy": 5.753915023803711, "epoch": 2.6752771834273488, "grad_norm": 1.234375, "learning_rate": 0.0004280961312576084, "loss": 5.0107, "mean_token_accuracy": 0.20373741090297698, "num_tokens": 59655369.0, "step": 34385 }, { "entropy": 5.68843297958374, "epoch": 2.6756662127990665, "grad_norm": 1.3359375, "learning_rate": 0.0004280758196801646, "loss": 5.0077, "mean_token_accuracy": 0.2136740803718567, "num_tokens": 59663843.0, "step": 34390 }, { "entropy": 5.687620639801025, "epoch": 2.6760552421707837, "grad_norm": 1.3203125, "learning_rate": 0.00042805550578003894, "loss": 4.8684, "mean_token_accuracy": 0.21488696932792664, "num_tokens": 59672115.0, "step": 34395 }, { "entropy": 5.663598251342774, "epoch": 2.6764442715425014, "grad_norm": 1.1640625, "learning_rate": 0.0004280351895575396, "loss": 4.8888, "mean_token_accuracy": 0.2170512318611145, "num_tokens": 59680884.0, "step": 34400 }, { "entropy": 5.6509974002838135, "epoch": 2.676833300914219, "grad_norm": 1.1953125, "learning_rate": 0.0004280148710129748, "loss": 4.9268, "mean_token_accuracy": 0.21847243309020997, "num_tokens": 59689213.0, "step": 34405 }, { "entropy": 5.698428344726563, "epoch": 2.677222330285937, "grad_norm": 1.1796875, "learning_rate": 0.00042799455014665296, "loss": 4.9674, "mean_token_accuracy": 0.20648182928562164, "num_tokens": 59698508.0, "step": 34410 }, { "entropy": 5.738311386108398, "epoch": 2.677611359657654, "grad_norm": 1.2265625, "learning_rate": 0.00042797422695888226, "loss": 4.9902, "mean_token_accuracy": 0.20802370607852935, "num_tokens": 59706568.0, "step": 34415 }, { "entropy": 5.766266775131226, "epoch": 2.6780003890293718, "grad_norm": 1.078125, "learning_rate": 0.0004279539014499712, "loss": 5.0332, "mean_token_accuracy": 0.20134620368480682, "num_tokens": 59715933.0, "step": 34420 }, { "entropy": 5.725120401382446, "epoch": 2.678389418401089, "grad_norm": 1.15625, "learning_rate": 0.0004279335736202281, "loss": 4.9761, "mean_token_accuracy": 0.20476993173360825, "num_tokens": 59724498.0, "step": 34425 }, { "entropy": 5.73232626914978, "epoch": 2.6787784477728067, "grad_norm": 1.28125, "learning_rate": 0.0004279132434699615, "loss": 5.0013, "mean_token_accuracy": 0.2089187815785408, "num_tokens": 59733489.0, "step": 34430 }, { "entropy": 5.7201393127441404, "epoch": 2.6791674771445244, "grad_norm": 1.2890625, "learning_rate": 0.0004278929109994798, "loss": 4.9007, "mean_token_accuracy": 0.21600978821516037, "num_tokens": 59741915.0, "step": 34435 }, { "entropy": 5.755215406417847, "epoch": 2.679556506516242, "grad_norm": 1.203125, "learning_rate": 0.00042787257620909144, "loss": 5.0044, "mean_token_accuracy": 0.20344263762235643, "num_tokens": 59750058.0, "step": 34440 }, { "entropy": 5.795769166946411, "epoch": 2.67994553588796, "grad_norm": 1.265625, "learning_rate": 0.00042785223909910515, "loss": 5.0304, "mean_token_accuracy": 0.201067653298378, "num_tokens": 59758849.0, "step": 34445 }, { "entropy": 5.783490324020386, "epoch": 2.680334565259677, "grad_norm": 1.359375, "learning_rate": 0.0004278318996698294, "loss": 5.0645, "mean_token_accuracy": 0.2044227570295334, "num_tokens": 59768088.0, "step": 34450 }, { "entropy": 5.734393835067749, "epoch": 2.6807235946313948, "grad_norm": 1.171875, "learning_rate": 0.0004278115579215728, "loss": 4.9452, "mean_token_accuracy": 0.21135684102773666, "num_tokens": 59776677.0, "step": 34455 }, { "entropy": 5.645063018798828, "epoch": 2.681112624003112, "grad_norm": 1.2109375, "learning_rate": 0.0004277912138546441, "loss": 4.9388, "mean_token_accuracy": 0.20521750748157502, "num_tokens": 59785737.0, "step": 34460 }, { "entropy": 5.716525030136109, "epoch": 2.6815016533748297, "grad_norm": 1.3515625, "learning_rate": 0.0004277708674693519, "loss": 4.9409, "mean_token_accuracy": 0.21365132927894592, "num_tokens": 59794075.0, "step": 34465 }, { "entropy": 5.795771932601928, "epoch": 2.6818906827465474, "grad_norm": 1.2109375, "learning_rate": 0.00042775051876600483, "loss": 4.9815, "mean_token_accuracy": 0.20844742208719252, "num_tokens": 59803150.0, "step": 34470 }, { "entropy": 5.721402835845947, "epoch": 2.682279712118265, "grad_norm": 1.2109375, "learning_rate": 0.0004277301677449119, "loss": 5.0082, "mean_token_accuracy": 0.20386959314346315, "num_tokens": 59811423.0, "step": 34475 }, { "entropy": 5.76378870010376, "epoch": 2.6826687414899824, "grad_norm": 1.2578125, "learning_rate": 0.0004277098144063818, "loss": 4.9497, "mean_token_accuracy": 0.2123885542154312, "num_tokens": 59820566.0, "step": 34480 }, { "entropy": 5.689324903488159, "epoch": 2.6830577708617, "grad_norm": 1.34375, "learning_rate": 0.00042768945875072326, "loss": 4.9157, "mean_token_accuracy": 0.21122681349515915, "num_tokens": 59829340.0, "step": 34485 }, { "entropy": 5.6613836765289305, "epoch": 2.6834468002334178, "grad_norm": 1.265625, "learning_rate": 0.0004276691007782451, "loss": 4.926, "mean_token_accuracy": 0.20438716411590577, "num_tokens": 59837796.0, "step": 34490 }, { "entropy": 5.718779277801514, "epoch": 2.683835829605135, "grad_norm": 1.171875, "learning_rate": 0.0004276487404892565, "loss": 5.0516, "mean_token_accuracy": 0.20124615877866744, "num_tokens": 59846467.0, "step": 34495 }, { "entropy": 5.713428688049317, "epoch": 2.6842248589768527, "grad_norm": 1.1953125, "learning_rate": 0.00042762837788406615, "loss": 4.9058, "mean_token_accuracy": 0.21138769686222075, "num_tokens": 59855127.0, "step": 34500 }, { "entropy": 5.754569339752197, "epoch": 2.6846138883485704, "grad_norm": 1.2578125, "learning_rate": 0.0004276080129629831, "loss": 4.9245, "mean_token_accuracy": 0.21079697757959365, "num_tokens": 59863020.0, "step": 34505 }, { "entropy": 5.691145133972168, "epoch": 2.685002917720288, "grad_norm": 1.359375, "learning_rate": 0.00042758764572631644, "loss": 5.0536, "mean_token_accuracy": 0.20498876571655272, "num_tokens": 59872136.0, "step": 34510 }, { "entropy": 5.7243153095245365, "epoch": 2.6853919470920053, "grad_norm": 1.6640625, "learning_rate": 0.00042756727617437504, "loss": 4.9926, "mean_token_accuracy": 0.2030166357755661, "num_tokens": 59880955.0, "step": 34515 }, { "entropy": 5.675222682952881, "epoch": 2.685780976463723, "grad_norm": 1.203125, "learning_rate": 0.00042754690430746805, "loss": 4.8125, "mean_token_accuracy": 0.22288704961538314, "num_tokens": 59889260.0, "step": 34520 }, { "entropy": 5.559013366699219, "epoch": 2.6861700058354403, "grad_norm": 1.2578125, "learning_rate": 0.0004275265301259046, "loss": 4.8095, "mean_token_accuracy": 0.2229264885187149, "num_tokens": 59897808.0, "step": 34525 }, { "entropy": 5.6939507007598875, "epoch": 2.686559035207158, "grad_norm": 1.375, "learning_rate": 0.00042750615362999395, "loss": 4.9547, "mean_token_accuracy": 0.21014904826879502, "num_tokens": 59906333.0, "step": 34530 }, { "entropy": 5.664986896514892, "epoch": 2.6869480645788757, "grad_norm": 1.1953125, "learning_rate": 0.00042748577482004495, "loss": 4.9277, "mean_token_accuracy": 0.20926148146390916, "num_tokens": 59914812.0, "step": 34535 }, { "entropy": 5.700321197509766, "epoch": 2.6873370939505934, "grad_norm": 1.15625, "learning_rate": 0.00042746539369636715, "loss": 4.9853, "mean_token_accuracy": 0.20648254752159118, "num_tokens": 59924235.0, "step": 34540 }, { "entropy": 5.765041780471802, "epoch": 2.687726123322311, "grad_norm": 1.203125, "learning_rate": 0.00042744501025926966, "loss": 5.0374, "mean_token_accuracy": 0.20751434415578843, "num_tokens": 59932643.0, "step": 34545 }, { "entropy": 5.683780193328857, "epoch": 2.6881151526940283, "grad_norm": 1.328125, "learning_rate": 0.0004274246245090618, "loss": 4.8857, "mean_token_accuracy": 0.20909959971904754, "num_tokens": 59941380.0, "step": 34550 }, { "entropy": 5.6958390235900875, "epoch": 2.688504182065746, "grad_norm": 1.2578125, "learning_rate": 0.0004274042364460529, "loss": 4.9852, "mean_token_accuracy": 0.20385556071996688, "num_tokens": 59950167.0, "step": 34555 }, { "entropy": 5.67959623336792, "epoch": 2.6888932114374633, "grad_norm": 1.21875, "learning_rate": 0.00042738384607055214, "loss": 4.9887, "mean_token_accuracy": 0.20975787490606307, "num_tokens": 59959057.0, "step": 34560 }, { "entropy": 5.6308681011199955, "epoch": 2.689282240809181, "grad_norm": 1.2734375, "learning_rate": 0.00042736345338286917, "loss": 4.8289, "mean_token_accuracy": 0.21492743790149688, "num_tokens": 59967605.0, "step": 34565 }, { "entropy": 5.752499294281006, "epoch": 2.6896712701808987, "grad_norm": 1.1640625, "learning_rate": 0.0004273430583833133, "loss": 4.9634, "mean_token_accuracy": 0.2016143783926964, "num_tokens": 59976208.0, "step": 34570 }, { "entropy": 5.667640590667725, "epoch": 2.6900602995526164, "grad_norm": 1.234375, "learning_rate": 0.000427322661072194, "loss": 4.9312, "mean_token_accuracy": 0.20445919930934905, "num_tokens": 59984431.0, "step": 34575 }, { "entropy": 5.648494291305542, "epoch": 2.6904493289243336, "grad_norm": 1.2578125, "learning_rate": 0.0004273022614498208, "loss": 4.8862, "mean_token_accuracy": 0.21284218579530717, "num_tokens": 59993414.0, "step": 34580 }, { "entropy": 5.691666889190674, "epoch": 2.6908383582960513, "grad_norm": 1.2734375, "learning_rate": 0.0004272818595165031, "loss": 4.9062, "mean_token_accuracy": 0.2066776990890503, "num_tokens": 60002140.0, "step": 34585 }, { "entropy": 5.7191328525543215, "epoch": 2.691227387667769, "grad_norm": 1.25, "learning_rate": 0.0004272614552725506, "loss": 5.0463, "mean_token_accuracy": 0.19787559062242507, "num_tokens": 60009954.0, "step": 34590 }, { "entropy": 5.664065647125244, "epoch": 2.6916164170394863, "grad_norm": 1.2109375, "learning_rate": 0.00042724104871827293, "loss": 4.9838, "mean_token_accuracy": 0.20897474139928818, "num_tokens": 60018754.0, "step": 34595 }, { "entropy": 5.698142147064209, "epoch": 2.692005446411204, "grad_norm": 1.25, "learning_rate": 0.0004272206398539795, "loss": 4.94, "mean_token_accuracy": 0.2032383933663368, "num_tokens": 60027795.0, "step": 34600 }, { "entropy": 5.697566509246826, "epoch": 2.6923944757829217, "grad_norm": 1.21875, "learning_rate": 0.00042720022867998026, "loss": 4.9174, "mean_token_accuracy": 0.20928091406822205, "num_tokens": 60037764.0, "step": 34605 }, { "entropy": 5.590538597106933, "epoch": 2.6927835051546394, "grad_norm": 1.2890625, "learning_rate": 0.0004271798151965848, "loss": 4.7777, "mean_token_accuracy": 0.21928421407938004, "num_tokens": 60045325.0, "step": 34610 }, { "entropy": 5.694454193115234, "epoch": 2.6931725345263566, "grad_norm": 1.34375, "learning_rate": 0.0004271593994041029, "loss": 4.982, "mean_token_accuracy": 0.206500281393528, "num_tokens": 60053536.0, "step": 34615 }, { "entropy": 5.744762706756592, "epoch": 2.6935615638980743, "grad_norm": 1.234375, "learning_rate": 0.0004271389813028443, "loss": 5.0335, "mean_token_accuracy": 0.20599687248468398, "num_tokens": 60062003.0, "step": 34620 }, { "entropy": 5.714696884155273, "epoch": 2.693950593269792, "grad_norm": 1.21875, "learning_rate": 0.0004271185608931187, "loss": 4.9483, "mean_token_accuracy": 0.21346332877874374, "num_tokens": 60070633.0, "step": 34625 }, { "entropy": 5.718768548965454, "epoch": 2.6943396226415093, "grad_norm": 1.25, "learning_rate": 0.00042709813817523617, "loss": 4.9891, "mean_token_accuracy": 0.21596226394176482, "num_tokens": 60079202.0, "step": 34630 }, { "entropy": 5.681667518615723, "epoch": 2.694728652013227, "grad_norm": 1.234375, "learning_rate": 0.00042707771314950645, "loss": 4.8968, "mean_token_accuracy": 0.22034886330366135, "num_tokens": 60087676.0, "step": 34635 }, { "entropy": 5.752464771270752, "epoch": 2.6951176813849447, "grad_norm": 1.265625, "learning_rate": 0.00042705728581623944, "loss": 5.008, "mean_token_accuracy": 0.20564533025026321, "num_tokens": 60096968.0, "step": 34640 }, { "entropy": 5.727945280075073, "epoch": 2.6955067107566624, "grad_norm": 1.3828125, "learning_rate": 0.0004270368561757452, "loss": 4.9403, "mean_token_accuracy": 0.21356792747974396, "num_tokens": 60105751.0, "step": 34645 }, { "entropy": 5.739959621429444, "epoch": 2.6958957401283796, "grad_norm": 1.2734375, "learning_rate": 0.0004270164242283336, "loss": 5.0709, "mean_token_accuracy": 0.20289001613855362, "num_tokens": 60114957.0, "step": 34650 }, { "entropy": 5.774513626098633, "epoch": 2.6962847695000973, "grad_norm": 1.2109375, "learning_rate": 0.0004269959899743148, "loss": 5.0568, "mean_token_accuracy": 0.203794626891613, "num_tokens": 60123734.0, "step": 34655 }, { "entropy": 5.7639899253845215, "epoch": 2.6966737988718146, "grad_norm": 1.2265625, "learning_rate": 0.0004269755534139987, "loss": 5.0362, "mean_token_accuracy": 0.20050682723522187, "num_tokens": 60132178.0, "step": 34660 }, { "entropy": 5.777216100692749, "epoch": 2.6970628282435323, "grad_norm": 1.296875, "learning_rate": 0.00042695511454769557, "loss": 5.0675, "mean_token_accuracy": 0.19938138276338577, "num_tokens": 60140436.0, "step": 34665 }, { "entropy": 5.748891162872314, "epoch": 2.69745185761525, "grad_norm": 1.28125, "learning_rate": 0.00042693467337571534, "loss": 4.9916, "mean_token_accuracy": 0.2088001400232315, "num_tokens": 60149154.0, "step": 34670 }, { "entropy": 5.715223979949951, "epoch": 2.6978408869869677, "grad_norm": 1.1875, "learning_rate": 0.0004269142298983684, "loss": 4.9955, "mean_token_accuracy": 0.20135734528303145, "num_tokens": 60158054.0, "step": 34675 }, { "entropy": 5.765547370910644, "epoch": 2.698229916358685, "grad_norm": 1.2734375, "learning_rate": 0.00042689378411596467, "loss": 5.0203, "mean_token_accuracy": 0.20037845373153687, "num_tokens": 60166924.0, "step": 34680 }, { "entropy": 5.692225599288941, "epoch": 2.6986189457304026, "grad_norm": 1.2265625, "learning_rate": 0.0004268733360288146, "loss": 4.9252, "mean_token_accuracy": 0.21295427531003952, "num_tokens": 60175223.0, "step": 34685 }, { "entropy": 5.736296939849853, "epoch": 2.6990079751021203, "grad_norm": 1.265625, "learning_rate": 0.00042685288563722835, "loss": 5.0525, "mean_token_accuracy": 0.20365485846996306, "num_tokens": 60184158.0, "step": 34690 }, { "entropy": 5.778026342391968, "epoch": 2.6993970044738376, "grad_norm": 1.25, "learning_rate": 0.0004268324329415163, "loss": 5.0518, "mean_token_accuracy": 0.20334272235631942, "num_tokens": 60192816.0, "step": 34695 }, { "entropy": 5.772414684295654, "epoch": 2.6997860338455553, "grad_norm": 1.1796875, "learning_rate": 0.0004268119779419887, "loss": 4.9518, "mean_token_accuracy": 0.210853473842144, "num_tokens": 60200985.0, "step": 34700 }, { "entropy": 5.6309410572052006, "epoch": 2.700175063217273, "grad_norm": 1.265625, "learning_rate": 0.00042679152063895603, "loss": 4.8727, "mean_token_accuracy": 0.20996491909027098, "num_tokens": 60208892.0, "step": 34705 }, { "entropy": 5.590454864501953, "epoch": 2.7005640925889907, "grad_norm": 1.265625, "learning_rate": 0.00042677106103272867, "loss": 4.8288, "mean_token_accuracy": 0.22113702148199083, "num_tokens": 60216946.0, "step": 34710 }, { "entropy": 5.618599462509155, "epoch": 2.700953121960708, "grad_norm": 1.25, "learning_rate": 0.000426750599123617, "loss": 4.8962, "mean_token_accuracy": 0.2169335663318634, "num_tokens": 60224973.0, "step": 34715 }, { "entropy": 5.699407243728638, "epoch": 2.7013421513324256, "grad_norm": 1.21875, "learning_rate": 0.00042673013491193145, "loss": 5.0673, "mean_token_accuracy": 0.2064083769917488, "num_tokens": 60232841.0, "step": 34720 }, { "entropy": 5.6886077404022215, "epoch": 2.7017311807041433, "grad_norm": 1.1640625, "learning_rate": 0.00042670966839798263, "loss": 4.9631, "mean_token_accuracy": 0.20922969430685043, "num_tokens": 60242162.0, "step": 34725 }, { "entropy": 5.7533472061157225, "epoch": 2.7021202100758606, "grad_norm": 1.28125, "learning_rate": 0.0004266891995820811, "loss": 5.0683, "mean_token_accuracy": 0.195574551820755, "num_tokens": 60250924.0, "step": 34730 }, { "entropy": 5.788560676574707, "epoch": 2.7025092394475783, "grad_norm": 1.1484375, "learning_rate": 0.00042666872846453734, "loss": 5.0898, "mean_token_accuracy": 0.20068838745355605, "num_tokens": 60260012.0, "step": 34735 }, { "entropy": 5.702512884140015, "epoch": 2.702898268819296, "grad_norm": 1.203125, "learning_rate": 0.00042664825504566206, "loss": 4.8943, "mean_token_accuracy": 0.20823795050382615, "num_tokens": 60268172.0, "step": 34740 }, { "entropy": 5.621559906005859, "epoch": 2.7032872981910137, "grad_norm": 1.2265625, "learning_rate": 0.000426627779325766, "loss": 4.8855, "mean_token_accuracy": 0.21660529673099518, "num_tokens": 60276753.0, "step": 34745 }, { "entropy": 5.641514921188355, "epoch": 2.703676327562731, "grad_norm": 1.265625, "learning_rate": 0.0004266073013051595, "loss": 4.9514, "mean_token_accuracy": 0.21847340166568757, "num_tokens": 60286388.0, "step": 34750 }, { "entropy": 5.669678497314453, "epoch": 2.7040653569344486, "grad_norm": 1.28125, "learning_rate": 0.0004265868209841537, "loss": 4.8679, "mean_token_accuracy": 0.21334236562252046, "num_tokens": 60294672.0, "step": 34755 }, { "entropy": 5.719014310836792, "epoch": 2.704454386306166, "grad_norm": 1.2265625, "learning_rate": 0.0004265663383630591, "loss": 4.971, "mean_token_accuracy": 0.20974157899618148, "num_tokens": 60303293.0, "step": 34760 }, { "entropy": 5.683840942382813, "epoch": 2.7048434156778836, "grad_norm": 1.2421875, "learning_rate": 0.00042654585344218657, "loss": 4.9643, "mean_token_accuracy": 0.20707135647535324, "num_tokens": 60312123.0, "step": 34765 }, { "entropy": 5.6957923412323, "epoch": 2.7052324450496013, "grad_norm": 1.2578125, "learning_rate": 0.0004265253662218469, "loss": 4.9374, "mean_token_accuracy": 0.21450020372867584, "num_tokens": 60320774.0, "step": 34770 }, { "entropy": 5.634758806228637, "epoch": 2.705621474421319, "grad_norm": 1.3359375, "learning_rate": 0.00042650487670235093, "loss": 4.8152, "mean_token_accuracy": 0.21598894745111466, "num_tokens": 60329536.0, "step": 34775 }, { "entropy": 5.705045890808106, "epoch": 2.7060105037930366, "grad_norm": 1.3984375, "learning_rate": 0.0004264843848840097, "loss": 5.0136, "mean_token_accuracy": 0.20317461490631103, "num_tokens": 60338333.0, "step": 34780 }, { "entropy": 5.76559419631958, "epoch": 2.706399533164754, "grad_norm": 1.1640625, "learning_rate": 0.000426463890767134, "loss": 5.0567, "mean_token_accuracy": 0.20530707985162736, "num_tokens": 60347653.0, "step": 34785 }, { "entropy": 5.765258359909057, "epoch": 2.7067885625364716, "grad_norm": 1.2421875, "learning_rate": 0.0004264433943520349, "loss": 5.0329, "mean_token_accuracy": 0.20013868063688278, "num_tokens": 60355548.0, "step": 34790 }, { "entropy": 5.723854351043701, "epoch": 2.707177591908189, "grad_norm": 1.2421875, "learning_rate": 0.00042642289563902326, "loss": 5.0076, "mean_token_accuracy": 0.2061668485403061, "num_tokens": 60364486.0, "step": 34795 }, { "entropy": 5.673714590072632, "epoch": 2.7075666212799065, "grad_norm": 1.234375, "learning_rate": 0.00042640239462841023, "loss": 4.9835, "mean_token_accuracy": 0.20432132929563523, "num_tokens": 60372919.0, "step": 34800 }, { "entropy": 5.680074262619018, "epoch": 2.7079556506516242, "grad_norm": 1.3203125, "learning_rate": 0.00042638189132050675, "loss": 4.9065, "mean_token_accuracy": 0.21110885590314865, "num_tokens": 60382721.0, "step": 34805 }, { "entropy": 5.71739239692688, "epoch": 2.708344680023342, "grad_norm": 1.1796875, "learning_rate": 0.00042636138571562415, "loss": 4.9091, "mean_token_accuracy": 0.21098169684410095, "num_tokens": 60391478.0, "step": 34810 }, { "entropy": 5.745327806472778, "epoch": 2.708733709395059, "grad_norm": 1.328125, "learning_rate": 0.00042634087781407337, "loss": 4.9206, "mean_token_accuracy": 0.21791640520095826, "num_tokens": 60399724.0, "step": 34815 }, { "entropy": 5.737909030914307, "epoch": 2.709122738766777, "grad_norm": 1.2734375, "learning_rate": 0.00042632036761616564, "loss": 5.0751, "mean_token_accuracy": 0.20079292804002763, "num_tokens": 60408505.0, "step": 34820 }, { "entropy": 5.729704666137695, "epoch": 2.7095117681384946, "grad_norm": 1.25, "learning_rate": 0.00042629985512221224, "loss": 5.0513, "mean_token_accuracy": 0.20355501621961594, "num_tokens": 60417713.0, "step": 34825 }, { "entropy": 5.719590330123902, "epoch": 2.709900797510212, "grad_norm": 1.2109375, "learning_rate": 0.0004262793403325243, "loss": 4.9716, "mean_token_accuracy": 0.21108058393001555, "num_tokens": 60426508.0, "step": 34830 }, { "entropy": 5.739744424819946, "epoch": 2.7102898268819295, "grad_norm": 1.2421875, "learning_rate": 0.00042625882324741316, "loss": 4.981, "mean_token_accuracy": 0.20599597096443176, "num_tokens": 60435500.0, "step": 34835 }, { "entropy": 5.824837589263916, "epoch": 2.7106788562536472, "grad_norm": 1.1796875, "learning_rate": 0.0004262383038671902, "loss": 5.0877, "mean_token_accuracy": 0.19558206349611282, "num_tokens": 60444036.0, "step": 34840 }, { "entropy": 5.765301084518432, "epoch": 2.711067885625365, "grad_norm": 1.2578125, "learning_rate": 0.0004262177821921666, "loss": 5.0127, "mean_token_accuracy": 0.2045507475733757, "num_tokens": 60453369.0, "step": 34845 }, { "entropy": 5.733113622665405, "epoch": 2.711456914997082, "grad_norm": 1.2734375, "learning_rate": 0.00042619725822265394, "loss": 5.0202, "mean_token_accuracy": 0.20741942524909973, "num_tokens": 60462232.0, "step": 34850 }, { "entropy": 5.741755437850952, "epoch": 2.7118459443688, "grad_norm": 1.34375, "learning_rate": 0.00042617673195896345, "loss": 4.994, "mean_token_accuracy": 0.20558920353651047, "num_tokens": 60471337.0, "step": 34855 }, { "entropy": 5.823948764801026, "epoch": 2.712234973740517, "grad_norm": 1.2578125, "learning_rate": 0.00042615620340140674, "loss": 5.0881, "mean_token_accuracy": 0.19707985818386078, "num_tokens": 60480676.0, "step": 34860 }, { "entropy": 5.68254337310791, "epoch": 2.712624003112235, "grad_norm": 1.21875, "learning_rate": 0.00042613567255029525, "loss": 5.0337, "mean_token_accuracy": 0.206841878592968, "num_tokens": 60489727.0, "step": 34865 }, { "entropy": 5.731939506530762, "epoch": 2.7130130324839525, "grad_norm": 1.296875, "learning_rate": 0.00042611513940594037, "loss": 4.9534, "mean_token_accuracy": 0.2060682937502861, "num_tokens": 60497859.0, "step": 34870 }, { "entropy": 5.708287000656128, "epoch": 2.7134020618556702, "grad_norm": 1.2421875, "learning_rate": 0.0004260946039686539, "loss": 5.0377, "mean_token_accuracy": 0.20529041439294815, "num_tokens": 60506948.0, "step": 34875 }, { "entropy": 5.662458038330078, "epoch": 2.713791091227388, "grad_norm": 1.2109375, "learning_rate": 0.00042607406623874726, "loss": 4.9888, "mean_token_accuracy": 0.20289556682109833, "num_tokens": 60515414.0, "step": 34880 }, { "entropy": 5.6291773319244385, "epoch": 2.714180120599105, "grad_norm": 1.234375, "learning_rate": 0.0004260535262165322, "loss": 4.8369, "mean_token_accuracy": 0.21740337312221528, "num_tokens": 60523644.0, "step": 34885 }, { "entropy": 5.688690996170044, "epoch": 2.714569149970823, "grad_norm": 1.3125, "learning_rate": 0.00042603298390232015, "loss": 4.9788, "mean_token_accuracy": 0.20565861761569976, "num_tokens": 60531760.0, "step": 34890 }, { "entropy": 5.80579833984375, "epoch": 2.71495817934254, "grad_norm": 1.2734375, "learning_rate": 0.00042601243929642305, "loss": 5.0776, "mean_token_accuracy": 0.20386364459991455, "num_tokens": 60540919.0, "step": 34895 }, { "entropy": 5.815211439132691, "epoch": 2.715347208714258, "grad_norm": 1.203125, "learning_rate": 0.00042599189239915253, "loss": 5.0726, "mean_token_accuracy": 0.20082654058933258, "num_tokens": 60549607.0, "step": 34900 }, { "entropy": 5.668854188919068, "epoch": 2.7157362380859755, "grad_norm": 1.1484375, "learning_rate": 0.0004259713432108204, "loss": 4.8606, "mean_token_accuracy": 0.21700717657804489, "num_tokens": 60557926.0, "step": 34905 }, { "entropy": 5.616941356658936, "epoch": 2.7161252674576932, "grad_norm": 1.3046875, "learning_rate": 0.0004259507917317384, "loss": 4.9481, "mean_token_accuracy": 0.20468156188726425, "num_tokens": 60567490.0, "step": 34910 }, { "entropy": 5.711208486557007, "epoch": 2.7165142968294105, "grad_norm": 1.2421875, "learning_rate": 0.00042593023796221843, "loss": 5.0311, "mean_token_accuracy": 0.20440669655799865, "num_tokens": 60576279.0, "step": 34915 }, { "entropy": 5.768986415863037, "epoch": 2.716903326201128, "grad_norm": 1.2578125, "learning_rate": 0.0004259096819025723, "loss": 4.9843, "mean_token_accuracy": 0.21294366717338561, "num_tokens": 60585856.0, "step": 34920 }, { "entropy": 5.74533486366272, "epoch": 2.717292355572846, "grad_norm": 1.296875, "learning_rate": 0.00042588912355311196, "loss": 4.9803, "mean_token_accuracy": 0.20219914019107818, "num_tokens": 60594139.0, "step": 34925 }, { "entropy": 5.717974281311035, "epoch": 2.717681384944563, "grad_norm": 1.15625, "learning_rate": 0.00042586856291414925, "loss": 5.0559, "mean_token_accuracy": 0.1986674815416336, "num_tokens": 60602951.0, "step": 34930 }, { "entropy": 5.79165096282959, "epoch": 2.718070414316281, "grad_norm": 1.3515625, "learning_rate": 0.00042584799998599633, "loss": 5.0195, "mean_token_accuracy": 0.20919229984283447, "num_tokens": 60611417.0, "step": 34935 }, { "entropy": 5.776333808898926, "epoch": 2.7184594436879985, "grad_norm": 1.1953125, "learning_rate": 0.0004258274347689651, "loss": 4.9959, "mean_token_accuracy": 0.20613384395837783, "num_tokens": 60620419.0, "step": 34940 }, { "entropy": 5.7965678691864015, "epoch": 2.718848473059716, "grad_norm": 1.3046875, "learning_rate": 0.00042580686726336766, "loss": 5.1083, "mean_token_accuracy": 0.1974281683564186, "num_tokens": 60630029.0, "step": 34945 }, { "entropy": 5.612726163864136, "epoch": 2.7192375024314335, "grad_norm": 1.203125, "learning_rate": 0.00042578629746951597, "loss": 4.8569, "mean_token_accuracy": 0.21830385327339172, "num_tokens": 60638331.0, "step": 34950 }, { "entropy": 5.811482667922974, "epoch": 2.719626531803151, "grad_norm": 1.1171875, "learning_rate": 0.0004257657253877222, "loss": 5.127, "mean_token_accuracy": 0.19877810627222062, "num_tokens": 60647645.0, "step": 34955 }, { "entropy": 5.7216551303863525, "epoch": 2.720015561174869, "grad_norm": 1.296875, "learning_rate": 0.00042574515101829856, "loss": 4.9332, "mean_token_accuracy": 0.2120066374540329, "num_tokens": 60656639.0, "step": 34960 }, { "entropy": 5.688572692871094, "epoch": 2.720404590546586, "grad_norm": 1.453125, "learning_rate": 0.00042572457436155717, "loss": 4.8295, "mean_token_accuracy": 0.2090499445796013, "num_tokens": 60665358.0, "step": 34965 }, { "entropy": 5.695967435836792, "epoch": 2.720793619918304, "grad_norm": 1.1953125, "learning_rate": 0.00042570399541781023, "loss": 5.016, "mean_token_accuracy": 0.2105242446064949, "num_tokens": 60673998.0, "step": 34970 }, { "entropy": 5.7359638690948485, "epoch": 2.7211826492900215, "grad_norm": 1.25, "learning_rate": 0.00042568341418737016, "loss": 4.9638, "mean_token_accuracy": 0.1989905506372452, "num_tokens": 60682125.0, "step": 34975 }, { "entropy": 5.766455507278442, "epoch": 2.721571678661739, "grad_norm": 1.2734375, "learning_rate": 0.000425662830670549, "loss": 5.0373, "mean_token_accuracy": 0.20355624407529832, "num_tokens": 60690941.0, "step": 34980 }, { "entropy": 5.750086116790771, "epoch": 2.7219607080334565, "grad_norm": 1.265625, "learning_rate": 0.00042564224486765925, "loss": 5.0019, "mean_token_accuracy": 0.20628662407398224, "num_tokens": 60700353.0, "step": 34985 }, { "entropy": 5.6956874370574955, "epoch": 2.722349737405174, "grad_norm": 1.1875, "learning_rate": 0.0004256216567790131, "loss": 4.921, "mean_token_accuracy": 0.21118637472391127, "num_tokens": 60709081.0, "step": 34990 }, { "entropy": 5.783931589126587, "epoch": 2.7227387667768914, "grad_norm": 1.2890625, "learning_rate": 0.0004256010664049232, "loss": 5.0015, "mean_token_accuracy": 0.20907147824764252, "num_tokens": 60717670.0, "step": 34995 }, { "entropy": 5.653836441040039, "epoch": 2.723127796148609, "grad_norm": 1.1796875, "learning_rate": 0.0004255804737457017, "loss": 4.8972, "mean_token_accuracy": 0.21085964441299437, "num_tokens": 60725856.0, "step": 35000 }, { "entropy": 5.63736481666565, "epoch": 2.723516825520327, "grad_norm": 1.234375, "learning_rate": 0.00042555987880166127, "loss": 4.928, "mean_token_accuracy": 0.20989930182695388, "num_tokens": 60734590.0, "step": 35005 }, { "entropy": 5.731264686584472, "epoch": 2.7239058548920445, "grad_norm": 1.265625, "learning_rate": 0.0004255392815731142, "loss": 5.0071, "mean_token_accuracy": 0.2059839740395546, "num_tokens": 60743885.0, "step": 35010 }, { "entropy": 5.776842403411865, "epoch": 2.7242948842637618, "grad_norm": 1.2890625, "learning_rate": 0.00042551868206037324, "loss": 4.994, "mean_token_accuracy": 0.19641777575016023, "num_tokens": 60752212.0, "step": 35015 }, { "entropy": 5.721878433227539, "epoch": 2.7246839136354795, "grad_norm": 1.21875, "learning_rate": 0.00042549808026375084, "loss": 4.9341, "mean_token_accuracy": 0.20972406268119811, "num_tokens": 60760392.0, "step": 35020 }, { "entropy": 5.747177839279175, "epoch": 2.725072943007197, "grad_norm": 1.2109375, "learning_rate": 0.00042547747618355966, "loss": 5.0506, "mean_token_accuracy": 0.19544049203395844, "num_tokens": 60769650.0, "step": 35025 }, { "entropy": 5.75801944732666, "epoch": 2.7254619723789144, "grad_norm": 1.1953125, "learning_rate": 0.0004254568698201122, "loss": 4.9339, "mean_token_accuracy": 0.2140042945742607, "num_tokens": 60778376.0, "step": 35030 }, { "entropy": 5.759399843215943, "epoch": 2.725851001750632, "grad_norm": 1.25, "learning_rate": 0.00042543626117372133, "loss": 5.0085, "mean_token_accuracy": 0.20363978594541549, "num_tokens": 60786612.0, "step": 35035 }, { "entropy": 5.723813438415528, "epoch": 2.72624003112235, "grad_norm": 1.2578125, "learning_rate": 0.00042541565024469945, "loss": 5.0134, "mean_token_accuracy": 0.2095305249094963, "num_tokens": 60795054.0, "step": 35040 }, { "entropy": 5.718794584274292, "epoch": 2.7266290604940675, "grad_norm": 1.2890625, "learning_rate": 0.00042539503703335963, "loss": 4.9851, "mean_token_accuracy": 0.20630062371492386, "num_tokens": 60803343.0, "step": 35045 }, { "entropy": 5.688753080368042, "epoch": 2.7270180898657848, "grad_norm": 1.28125, "learning_rate": 0.00042537442154001455, "loss": 4.9196, "mean_token_accuracy": 0.21088998764753342, "num_tokens": 60811688.0, "step": 35050 }, { "entropy": 5.720266389846802, "epoch": 2.7274071192375025, "grad_norm": 1.28125, "learning_rate": 0.00042535380376497684, "loss": 4.8935, "mean_token_accuracy": 0.21079623252153395, "num_tokens": 60820763.0, "step": 35055 }, { "entropy": 5.655383968353272, "epoch": 2.72779614860922, "grad_norm": 1.1171875, "learning_rate": 0.0004253331837085595, "loss": 4.9608, "mean_token_accuracy": 0.20842889249324797, "num_tokens": 60829512.0, "step": 35060 }, { "entropy": 5.649409532546997, "epoch": 2.7281851779809374, "grad_norm": 1.25, "learning_rate": 0.00042531256137107545, "loss": 4.9096, "mean_token_accuracy": 0.21113201677799226, "num_tokens": 60838081.0, "step": 35065 }, { "entropy": 5.75114164352417, "epoch": 2.728574207352655, "grad_norm": 1.1953125, "learning_rate": 0.0004252919367528375, "loss": 5.0371, "mean_token_accuracy": 0.2037801593542099, "num_tokens": 60847249.0, "step": 35070 }, { "entropy": 5.827528953552246, "epoch": 2.728963236724373, "grad_norm": 1.359375, "learning_rate": 0.00042527130985415857, "loss": 5.0422, "mean_token_accuracy": 0.20022119283676149, "num_tokens": 60855786.0, "step": 35075 }, { "entropy": 5.703303956985474, "epoch": 2.7293522660960905, "grad_norm": 1.2109375, "learning_rate": 0.0004252506806753517, "loss": 4.8634, "mean_token_accuracy": 0.21019433587789535, "num_tokens": 60864911.0, "step": 35080 }, { "entropy": 5.818068313598633, "epoch": 2.7297412954678077, "grad_norm": 1.28125, "learning_rate": 0.00042523004921673, "loss": 4.9571, "mean_token_accuracy": 0.2087898448109627, "num_tokens": 60872837.0, "step": 35085 }, { "entropy": 5.723009014129639, "epoch": 2.7301303248395254, "grad_norm": 1.328125, "learning_rate": 0.0004252094154786063, "loss": 4.9815, "mean_token_accuracy": 0.2039785251021385, "num_tokens": 60880470.0, "step": 35090 }, { "entropy": 5.659205484390259, "epoch": 2.7305193542112427, "grad_norm": 1.28125, "learning_rate": 0.0004251887794612939, "loss": 4.9669, "mean_token_accuracy": 0.20906025320291519, "num_tokens": 60889763.0, "step": 35095 }, { "entropy": 5.732339763641358, "epoch": 2.7309083835829604, "grad_norm": 1.2265625, "learning_rate": 0.0004251681411651057, "loss": 5.0294, "mean_token_accuracy": 0.21472941040992738, "num_tokens": 60898745.0, "step": 35100 }, { "entropy": 5.728853702545166, "epoch": 2.731297412954678, "grad_norm": 1.25, "learning_rate": 0.00042514750059035504, "loss": 4.9962, "mean_token_accuracy": 0.20048222094774246, "num_tokens": 60907171.0, "step": 35105 }, { "entropy": 5.612569093704224, "epoch": 2.731686442326396, "grad_norm": 1.1953125, "learning_rate": 0.0004251268577373551, "loss": 4.8948, "mean_token_accuracy": 0.21187941282987593, "num_tokens": 60915837.0, "step": 35110 }, { "entropy": 5.70489501953125, "epoch": 2.732075471698113, "grad_norm": 1.234375, "learning_rate": 0.000425106212606419, "loss": 4.9354, "mean_token_accuracy": 0.21067481935024263, "num_tokens": 60924705.0, "step": 35115 }, { "entropy": 5.6612220287323, "epoch": 2.7324645010698307, "grad_norm": 1.1328125, "learning_rate": 0.00042508556519786004, "loss": 4.8823, "mean_token_accuracy": 0.21275871247053146, "num_tokens": 60934175.0, "step": 35120 }, { "entropy": 5.703955221176147, "epoch": 2.7328535304415484, "grad_norm": 1.25, "learning_rate": 0.0004250649155119915, "loss": 5.0507, "mean_token_accuracy": 0.20019659847021104, "num_tokens": 60943099.0, "step": 35125 }, { "entropy": 5.757194566726684, "epoch": 2.7332425598132657, "grad_norm": 1.1953125, "learning_rate": 0.00042504426354912666, "loss": 5.0426, "mean_token_accuracy": 0.20433209985494613, "num_tokens": 60952346.0, "step": 35130 }, { "entropy": 5.71891598701477, "epoch": 2.7336315891849834, "grad_norm": 1.2734375, "learning_rate": 0.00042502360930957904, "loss": 4.9671, "mean_token_accuracy": 0.20493173152208327, "num_tokens": 60960285.0, "step": 35135 }, { "entropy": 5.780902862548828, "epoch": 2.734020618556701, "grad_norm": 1.2265625, "learning_rate": 0.00042500295279366196, "loss": 5.0663, "mean_token_accuracy": 0.19962110072374345, "num_tokens": 60969358.0, "step": 35140 }, { "entropy": 5.655981254577637, "epoch": 2.734409647928419, "grad_norm": 1.34375, "learning_rate": 0.00042498229400168874, "loss": 4.8988, "mean_token_accuracy": 0.2122568517923355, "num_tokens": 60977229.0, "step": 35145 }, { "entropy": 5.728889131546021, "epoch": 2.734798677300136, "grad_norm": 1.2578125, "learning_rate": 0.000424961632933973, "loss": 5.0854, "mean_token_accuracy": 0.2002171039581299, "num_tokens": 60986846.0, "step": 35150 }, { "entropy": 5.739418363571167, "epoch": 2.7351877066718537, "grad_norm": 1.28125, "learning_rate": 0.0004249409695908281, "loss": 5.0082, "mean_token_accuracy": 0.1983056530356407, "num_tokens": 60995021.0, "step": 35155 }, { "entropy": 5.7087007522583, "epoch": 2.7355767360435714, "grad_norm": 1.328125, "learning_rate": 0.0004249203039725677, "loss": 4.9056, "mean_token_accuracy": 0.21663795709609984, "num_tokens": 61003219.0, "step": 35160 }, { "entropy": 5.664568758010864, "epoch": 2.7359657654152887, "grad_norm": 1.2421875, "learning_rate": 0.00042489963607950527, "loss": 5.0097, "mean_token_accuracy": 0.20622797608375548, "num_tokens": 61011918.0, "step": 35165 }, { "entropy": 5.6633445739746096, "epoch": 2.7363547947870064, "grad_norm": 1.15625, "learning_rate": 0.00042487896591195454, "loss": 5.0268, "mean_token_accuracy": 0.1982610896229744, "num_tokens": 61021224.0, "step": 35170 }, { "entropy": 5.719748640060425, "epoch": 2.736743824158724, "grad_norm": 1.171875, "learning_rate": 0.00042485829347022893, "loss": 4.9627, "mean_token_accuracy": 0.20518887042999268, "num_tokens": 61030660.0, "step": 35175 }, { "entropy": 5.750778293609619, "epoch": 2.737132853530442, "grad_norm": 1.21875, "learning_rate": 0.00042483761875464226, "loss": 4.9666, "mean_token_accuracy": 0.2122131645679474, "num_tokens": 61038542.0, "step": 35180 }, { "entropy": 5.697680044174194, "epoch": 2.737521882902159, "grad_norm": 1.171875, "learning_rate": 0.00042481694176550825, "loss": 4.9736, "mean_token_accuracy": 0.2069752186536789, "num_tokens": 61047175.0, "step": 35185 }, { "entropy": 5.692663669586182, "epoch": 2.7379109122738767, "grad_norm": 1.15625, "learning_rate": 0.00042479626250314066, "loss": 4.8787, "mean_token_accuracy": 0.2124638557434082, "num_tokens": 61056053.0, "step": 35190 }, { "entropy": 5.729515314102173, "epoch": 2.738299941645594, "grad_norm": 1.1875, "learning_rate": 0.00042477558096785316, "loss": 5.0188, "mean_token_accuracy": 0.2009968489408493, "num_tokens": 61064389.0, "step": 35195 }, { "entropy": 5.720431280136109, "epoch": 2.7386889710173117, "grad_norm": 1.2265625, "learning_rate": 0.00042475489715995956, "loss": 4.918, "mean_token_accuracy": 0.21390856802463531, "num_tokens": 61072155.0, "step": 35200 }, { "entropy": 5.683716344833374, "epoch": 2.7390780003890294, "grad_norm": 1.1171875, "learning_rate": 0.00042473421107977385, "loss": 4.9512, "mean_token_accuracy": 0.20617857724428176, "num_tokens": 61081644.0, "step": 35205 }, { "entropy": 5.796208381652832, "epoch": 2.739467029760747, "grad_norm": 1.2109375, "learning_rate": 0.00042471352272760974, "loss": 4.9626, "mean_token_accuracy": 0.2070917844772339, "num_tokens": 61089392.0, "step": 35210 }, { "entropy": 5.762926340103149, "epoch": 2.7398560591324648, "grad_norm": 1.2421875, "learning_rate": 0.0004246928321037813, "loss": 5.0413, "mean_token_accuracy": 0.206692673265934, "num_tokens": 61098541.0, "step": 35215 }, { "entropy": 5.7560523509979244, "epoch": 2.740245088504182, "grad_norm": 1.2578125, "learning_rate": 0.0004246721392086023, "loss": 4.9771, "mean_token_accuracy": 0.2055869072675705, "num_tokens": 61106759.0, "step": 35220 }, { "entropy": 5.736579942703247, "epoch": 2.7406341178758997, "grad_norm": 1.140625, "learning_rate": 0.00042465144404238686, "loss": 4.9313, "mean_token_accuracy": 0.21012219339609145, "num_tokens": 61115273.0, "step": 35225 }, { "entropy": 5.714414119720459, "epoch": 2.741023147247617, "grad_norm": 1.15625, "learning_rate": 0.00042463074660544897, "loss": 5.0659, "mean_token_accuracy": 0.20555173009634017, "num_tokens": 61124889.0, "step": 35230 }, { "entropy": 5.775128173828125, "epoch": 2.7414121766193347, "grad_norm": 1.1796875, "learning_rate": 0.0004246100468981026, "loss": 5.0613, "mean_token_accuracy": 0.19887160807847976, "num_tokens": 61134137.0, "step": 35235 }, { "entropy": 5.700501298904419, "epoch": 2.7418012059910524, "grad_norm": 1.234375, "learning_rate": 0.000424589344920662, "loss": 4.9572, "mean_token_accuracy": 0.20897936969995498, "num_tokens": 61142974.0, "step": 35240 }, { "entropy": 5.741481637954712, "epoch": 2.74219023536277, "grad_norm": 1.2578125, "learning_rate": 0.0004245686406734411, "loss": 5.0237, "mean_token_accuracy": 0.20410853028297424, "num_tokens": 61151469.0, "step": 35245 }, { "entropy": 5.804116821289062, "epoch": 2.7425792647344873, "grad_norm": 1.359375, "learning_rate": 0.0004245479341567541, "loss": 5.0693, "mean_token_accuracy": 0.19618377983570098, "num_tokens": 61160221.0, "step": 35250 }, { "entropy": 5.775238466262818, "epoch": 2.742968294106205, "grad_norm": 1.21875, "learning_rate": 0.0004245272253709154, "loss": 5.0103, "mean_token_accuracy": 0.20609673708677292, "num_tokens": 61168509.0, "step": 35255 }, { "entropy": 5.661110782623291, "epoch": 2.7433573234779227, "grad_norm": 1.3515625, "learning_rate": 0.0004245065143162389, "loss": 4.9149, "mean_token_accuracy": 0.21041444987058638, "num_tokens": 61176774.0, "step": 35260 }, { "entropy": 5.6296485424041744, "epoch": 2.74374635284964, "grad_norm": 1.2734375, "learning_rate": 0.00042448580099303904, "loss": 4.8548, "mean_token_accuracy": 0.2123877674341202, "num_tokens": 61185846.0, "step": 35265 }, { "entropy": 5.7228316307067875, "epoch": 2.7441353822213577, "grad_norm": 1.375, "learning_rate": 0.00042446508540163017, "loss": 4.9642, "mean_token_accuracy": 0.2124114528298378, "num_tokens": 61194284.0, "step": 35270 }, { "entropy": 5.725844669342041, "epoch": 2.7445244115930754, "grad_norm": 1.328125, "learning_rate": 0.0004244443675423264, "loss": 5.0209, "mean_token_accuracy": 0.20283122211694718, "num_tokens": 61203119.0, "step": 35275 }, { "entropy": 5.713010597229004, "epoch": 2.744913440964793, "grad_norm": 1.234375, "learning_rate": 0.00042442364741544227, "loss": 4.8987, "mean_token_accuracy": 0.2141757935285568, "num_tokens": 61211866.0, "step": 35280 }, { "entropy": 5.717109203338623, "epoch": 2.7453024703365103, "grad_norm": 1.328125, "learning_rate": 0.00042440292502129214, "loss": 5.0258, "mean_token_accuracy": 0.20491950809955597, "num_tokens": 61220837.0, "step": 35285 }, { "entropy": 5.694370889663697, "epoch": 2.745691499708228, "grad_norm": 1.1953125, "learning_rate": 0.0004243822003601904, "loss": 4.962, "mean_token_accuracy": 0.20951741486787795, "num_tokens": 61229474.0, "step": 35290 }, { "entropy": 5.69015736579895, "epoch": 2.7460805290799453, "grad_norm": 1.28125, "learning_rate": 0.0004243614734324515, "loss": 4.8676, "mean_token_accuracy": 0.211755108833313, "num_tokens": 61238271.0, "step": 35295 }, { "entropy": 5.733093929290772, "epoch": 2.746469558451663, "grad_norm": 1.2734375, "learning_rate": 0.0004243407442383901, "loss": 4.9667, "mean_token_accuracy": 0.20911089032888414, "num_tokens": 61246621.0, "step": 35300 }, { "entropy": 5.727267837524414, "epoch": 2.7468585878233807, "grad_norm": 1.1953125, "learning_rate": 0.00042432001277832045, "loss": 5.0328, "mean_token_accuracy": 0.19624968320131303, "num_tokens": 61255945.0, "step": 35305 }, { "entropy": 5.69983229637146, "epoch": 2.7472476171950984, "grad_norm": 1.2265625, "learning_rate": 0.0004242992790525573, "loss": 4.8993, "mean_token_accuracy": 0.20778922140598297, "num_tokens": 61264432.0, "step": 35310 }, { "entropy": 5.725306177139283, "epoch": 2.747636646566816, "grad_norm": 1.3046875, "learning_rate": 0.0004242785430614154, "loss": 4.9255, "mean_token_accuracy": 0.20870424509048463, "num_tokens": 61272955.0, "step": 35315 }, { "entropy": 5.775846481323242, "epoch": 2.7480256759385333, "grad_norm": 1.328125, "learning_rate": 0.00042425780480520906, "loss": 4.9803, "mean_token_accuracy": 0.21643990874290467, "num_tokens": 61281224.0, "step": 35320 }, { "entropy": 5.657282018661499, "epoch": 2.748414705310251, "grad_norm": 1.1796875, "learning_rate": 0.00042423706428425305, "loss": 4.8819, "mean_token_accuracy": 0.21579451709985734, "num_tokens": 61290149.0, "step": 35325 }, { "entropy": 5.688134384155274, "epoch": 2.7488037346819683, "grad_norm": 1.296875, "learning_rate": 0.0004242163214988622, "loss": 4.982, "mean_token_accuracy": 0.19995140433311462, "num_tokens": 61299107.0, "step": 35330 }, { "entropy": 5.635414028167725, "epoch": 2.749192764053686, "grad_norm": 1.2890625, "learning_rate": 0.0004241955764493512, "loss": 4.869, "mean_token_accuracy": 0.21385025829076768, "num_tokens": 61308053.0, "step": 35335 }, { "entropy": 5.770064067840576, "epoch": 2.7495817934254037, "grad_norm": 1.1484375, "learning_rate": 0.00042417482913603477, "loss": 5.0552, "mean_token_accuracy": 0.20388067215681077, "num_tokens": 61317224.0, "step": 35340 }, { "entropy": 5.719659471511841, "epoch": 2.7499708227971214, "grad_norm": 1.234375, "learning_rate": 0.00042415407955922774, "loss": 4.9876, "mean_token_accuracy": 0.20206313729286193, "num_tokens": 61326073.0, "step": 35345 }, { "entropy": 5.712783575057983, "epoch": 2.7503598521688386, "grad_norm": 1.171875, "learning_rate": 0.00042413332771924496, "loss": 4.9263, "mean_token_accuracy": 0.2130627527832985, "num_tokens": 61334615.0, "step": 35350 }, { "entropy": 5.710699558258057, "epoch": 2.7507488815405563, "grad_norm": 1.21875, "learning_rate": 0.0004241125736164013, "loss": 4.9449, "mean_token_accuracy": 0.2085053250193596, "num_tokens": 61342875.0, "step": 35355 }, { "entropy": 5.688929271697998, "epoch": 2.751137910912274, "grad_norm": 1.296875, "learning_rate": 0.0004240918172510117, "loss": 4.9132, "mean_token_accuracy": 0.2135462284088135, "num_tokens": 61351355.0, "step": 35360 }, { "entropy": 5.681088972091675, "epoch": 2.7515269402839913, "grad_norm": 1.2421875, "learning_rate": 0.000424071058623391, "loss": 4.9325, "mean_token_accuracy": 0.20771088749170302, "num_tokens": 61359793.0, "step": 35365 }, { "entropy": 5.786489963531494, "epoch": 2.751915969655709, "grad_norm": 1.2578125, "learning_rate": 0.0004240502977338543, "loss": 5.1078, "mean_token_accuracy": 0.2048235386610031, "num_tokens": 61369302.0, "step": 35370 }, { "entropy": 5.820939588546753, "epoch": 2.7523049990274266, "grad_norm": 1.1875, "learning_rate": 0.0004240295345827166, "loss": 5.0565, "mean_token_accuracy": 0.19990177154541017, "num_tokens": 61377753.0, "step": 35375 }, { "entropy": 5.73698320388794, "epoch": 2.7526940283991443, "grad_norm": 1.1875, "learning_rate": 0.0004240087691702929, "loss": 4.997, "mean_token_accuracy": 0.20807427763938904, "num_tokens": 61386977.0, "step": 35380 }, { "entropy": 5.7078382015228275, "epoch": 2.7530830577708616, "grad_norm": 1.203125, "learning_rate": 0.0004239880014968983, "loss": 5.0668, "mean_token_accuracy": 0.20457228720188142, "num_tokens": 61395756.0, "step": 35385 }, { "entropy": 5.6951357364654545, "epoch": 2.7534720871425793, "grad_norm": 1.203125, "learning_rate": 0.00042396723156284786, "loss": 4.8751, "mean_token_accuracy": 0.2087944209575653, "num_tokens": 61404622.0, "step": 35390 }, { "entropy": 5.751816177368164, "epoch": 2.753861116514297, "grad_norm": 1.203125, "learning_rate": 0.0004239464593684568, "loss": 5.0351, "mean_token_accuracy": 0.20451211780309678, "num_tokens": 61412685.0, "step": 35395 }, { "entropy": 5.648649644851685, "epoch": 2.7542501458860142, "grad_norm": 1.125, "learning_rate": 0.00042392568491404043, "loss": 4.8484, "mean_token_accuracy": 0.21240620613098143, "num_tokens": 61421069.0, "step": 35400 }, { "entropy": 5.629816675186158, "epoch": 2.754639175257732, "grad_norm": 1.2109375, "learning_rate": 0.00042390490819991367, "loss": 4.8589, "mean_token_accuracy": 0.21290070712566375, "num_tokens": 61430349.0, "step": 35405 }, { "entropy": 5.737220096588135, "epoch": 2.7550282046294496, "grad_norm": 1.2734375, "learning_rate": 0.000423884129226392, "loss": 5.0113, "mean_token_accuracy": 0.20736957341432571, "num_tokens": 61439125.0, "step": 35410 }, { "entropy": 5.630013513565063, "epoch": 2.7554172340011673, "grad_norm": 1.2109375, "learning_rate": 0.0004238633479937906, "loss": 4.886, "mean_token_accuracy": 0.21245695501565934, "num_tokens": 61447649.0, "step": 35415 }, { "entropy": 5.65569953918457, "epoch": 2.7558062633728846, "grad_norm": 1.2578125, "learning_rate": 0.0004238425645024249, "loss": 4.9536, "mean_token_accuracy": 0.21050097048282623, "num_tokens": 61455990.0, "step": 35420 }, { "entropy": 5.712196159362793, "epoch": 2.7561952927446023, "grad_norm": 1.3203125, "learning_rate": 0.0004238217787526102, "loss": 5.0257, "mean_token_accuracy": 0.19362433552742003, "num_tokens": 61464793.0, "step": 35425 }, { "entropy": 5.6828032493591305, "epoch": 2.7565843221163195, "grad_norm": 1.3359375, "learning_rate": 0.0004238009907446618, "loss": 4.9677, "mean_token_accuracy": 0.20889329314231872, "num_tokens": 61474072.0, "step": 35430 }, { "entropy": 5.693464088439941, "epoch": 2.7569733514880372, "grad_norm": 1.28125, "learning_rate": 0.00042378020047889527, "loss": 4.9211, "mean_token_accuracy": 0.21002658754587172, "num_tokens": 61483518.0, "step": 35435 }, { "entropy": 5.7235311508178714, "epoch": 2.757362380859755, "grad_norm": 1.203125, "learning_rate": 0.00042375940795562594, "loss": 4.9858, "mean_token_accuracy": 0.20611643195152282, "num_tokens": 61491967.0, "step": 35440 }, { "entropy": 5.803478050231933, "epoch": 2.7577514102314726, "grad_norm": 1.34375, "learning_rate": 0.00042373861317516944, "loss": 5.0692, "mean_token_accuracy": 0.20099324882030487, "num_tokens": 61501184.0, "step": 35445 }, { "entropy": 5.796035718917847, "epoch": 2.75814043960319, "grad_norm": 1.2265625, "learning_rate": 0.0004237178161378412, "loss": 5.0417, "mean_token_accuracy": 0.20037172138690948, "num_tokens": 61509716.0, "step": 35450 }, { "entropy": 5.732233142852783, "epoch": 2.7585294689749076, "grad_norm": 1.25, "learning_rate": 0.0004236970168439568, "loss": 5.0023, "mean_token_accuracy": 0.20371731817722322, "num_tokens": 61518267.0, "step": 35455 }, { "entropy": 5.654461622238159, "epoch": 2.7589184983466253, "grad_norm": 1.1484375, "learning_rate": 0.00042367621529383186, "loss": 4.8828, "mean_token_accuracy": 0.21106842011213303, "num_tokens": 61527204.0, "step": 35460 }, { "entropy": 5.6929707527160645, "epoch": 2.7593075277183425, "grad_norm": 1.234375, "learning_rate": 0.00042365541148778205, "loss": 4.9503, "mean_token_accuracy": 0.2074694573879242, "num_tokens": 61535888.0, "step": 35465 }, { "entropy": 5.701891756057739, "epoch": 2.7596965570900602, "grad_norm": 1.2421875, "learning_rate": 0.00042363460542612285, "loss": 4.9625, "mean_token_accuracy": 0.20828531682491302, "num_tokens": 61544570.0, "step": 35470 }, { "entropy": 5.780369234085083, "epoch": 2.760085586461778, "grad_norm": 1.296875, "learning_rate": 0.0004236137971091702, "loss": 5.0664, "mean_token_accuracy": 0.20018284171819686, "num_tokens": 61553450.0, "step": 35475 }, { "entropy": 5.709358787536621, "epoch": 2.7604746158334956, "grad_norm": 1.2421875, "learning_rate": 0.00042359298653723963, "loss": 4.8936, "mean_token_accuracy": 0.21125064939260482, "num_tokens": 61562063.0, "step": 35480 }, { "entropy": 5.760407876968384, "epoch": 2.760863645205213, "grad_norm": 1.1796875, "learning_rate": 0.0004235721737106471, "loss": 5.0416, "mean_token_accuracy": 0.19726235121488572, "num_tokens": 61570962.0, "step": 35485 }, { "entropy": 5.729723215103149, "epoch": 2.7612526745769306, "grad_norm": 1.2421875, "learning_rate": 0.0004235513586297082, "loss": 4.9792, "mean_token_accuracy": 0.20766578018665313, "num_tokens": 61579070.0, "step": 35490 }, { "entropy": 5.749112558364868, "epoch": 2.7616417039486483, "grad_norm": 1.2578125, "learning_rate": 0.00042353054129473894, "loss": 4.8855, "mean_token_accuracy": 0.20797699838876724, "num_tokens": 61587573.0, "step": 35495 }, { "entropy": 5.667645025253296, "epoch": 2.7620307333203655, "grad_norm": 1.3125, "learning_rate": 0.0004235097217060552, "loss": 4.9528, "mean_token_accuracy": 0.20631778091192246, "num_tokens": 61596242.0, "step": 35500 }, { "entropy": 5.622595405578613, "epoch": 2.7624197626920832, "grad_norm": 1.2890625, "learning_rate": 0.0004234888998639727, "loss": 4.9474, "mean_token_accuracy": 0.2085738644003868, "num_tokens": 61604529.0, "step": 35505 }, { "entropy": 5.677980232238769, "epoch": 2.762808792063801, "grad_norm": 1.1953125, "learning_rate": 0.0004234680757688076, "loss": 4.9884, "mean_token_accuracy": 0.19754796326160431, "num_tokens": 61612600.0, "step": 35510 }, { "entropy": 5.761327028274536, "epoch": 2.7631978214355186, "grad_norm": 1.2265625, "learning_rate": 0.00042344724942087564, "loss": 4.9377, "mean_token_accuracy": 0.2115863710641861, "num_tokens": 61621267.0, "step": 35515 }, { "entropy": 5.772805881500244, "epoch": 2.763586850807236, "grad_norm": 1.265625, "learning_rate": 0.000423426420820493, "loss": 4.9947, "mean_token_accuracy": 0.20608966797590256, "num_tokens": 61630010.0, "step": 35520 }, { "entropy": 5.659929895401001, "epoch": 2.7639758801789536, "grad_norm": 1.1640625, "learning_rate": 0.00042340558996797564, "loss": 4.9661, "mean_token_accuracy": 0.2056085631251335, "num_tokens": 61638118.0, "step": 35525 }, { "entropy": 5.716986083984375, "epoch": 2.764364909550671, "grad_norm": 1.2890625, "learning_rate": 0.00042338475686363964, "loss": 5.0057, "mean_token_accuracy": 0.208828803896904, "num_tokens": 61646895.0, "step": 35530 }, { "entropy": 5.736470317840576, "epoch": 2.7647539389223885, "grad_norm": 1.1328125, "learning_rate": 0.0004233639215078012, "loss": 5.0227, "mean_token_accuracy": 0.20760715305805205, "num_tokens": 61655285.0, "step": 35535 }, { "entropy": 5.779675054550171, "epoch": 2.765142968294106, "grad_norm": 1.234375, "learning_rate": 0.00042334308390077637, "loss": 4.9438, "mean_token_accuracy": 0.20602003633975982, "num_tokens": 61663910.0, "step": 35540 }, { "entropy": 5.682765626907349, "epoch": 2.765531997665824, "grad_norm": 1.3515625, "learning_rate": 0.0004233222440428814, "loss": 5.003, "mean_token_accuracy": 0.20733555108308793, "num_tokens": 61673241.0, "step": 35545 }, { "entropy": 5.6576752185821535, "epoch": 2.765921027037541, "grad_norm": 1.1328125, "learning_rate": 0.0004233014019344324, "loss": 4.8955, "mean_token_accuracy": 0.21079717427492142, "num_tokens": 61683171.0, "step": 35550 }, { "entropy": 5.722889804840088, "epoch": 2.766310056409259, "grad_norm": 1.2421875, "learning_rate": 0.0004232805575757457, "loss": 4.9606, "mean_token_accuracy": 0.20943217873573303, "num_tokens": 61691100.0, "step": 35555 }, { "entropy": 5.722838687896728, "epoch": 2.7666990857809766, "grad_norm": 1.2109375, "learning_rate": 0.0004232597109671375, "loss": 5.011, "mean_token_accuracy": 0.205571249127388, "num_tokens": 61699658.0, "step": 35560 }, { "entropy": 5.675302743911743, "epoch": 2.767088115152694, "grad_norm": 1.1171875, "learning_rate": 0.0004232388621089242, "loss": 5.0366, "mean_token_accuracy": 0.20427283346652986, "num_tokens": 61708461.0, "step": 35565 }, { "entropy": 5.692220735549927, "epoch": 2.7674771445244115, "grad_norm": 1.2421875, "learning_rate": 0.00042321801100142216, "loss": 4.9119, "mean_token_accuracy": 0.21660492122173308, "num_tokens": 61717114.0, "step": 35570 }, { "entropy": 5.6809436798095705, "epoch": 2.767866173896129, "grad_norm": 1.1953125, "learning_rate": 0.00042319715764494765, "loss": 5.0362, "mean_token_accuracy": 0.20016030520200728, "num_tokens": 61725746.0, "step": 35575 }, { "entropy": 5.739760828018189, "epoch": 2.768255203267847, "grad_norm": 1.3359375, "learning_rate": 0.00042317630203981714, "loss": 4.9614, "mean_token_accuracy": 0.2071981683373451, "num_tokens": 61733875.0, "step": 35580 }, { "entropy": 5.779660940170288, "epoch": 2.768644232639564, "grad_norm": 1.2578125, "learning_rate": 0.00042315544418634714, "loss": 5.068, "mean_token_accuracy": 0.2075582906603813, "num_tokens": 61742009.0, "step": 35585 }, { "entropy": 5.663666772842407, "epoch": 2.769033262011282, "grad_norm": 1.2734375, "learning_rate": 0.00042313458408485414, "loss": 4.9767, "mean_token_accuracy": 0.21615182608366013, "num_tokens": 61750723.0, "step": 35590 }, { "entropy": 5.7175534725189205, "epoch": 2.7694222913829996, "grad_norm": 1.140625, "learning_rate": 0.00042311372173565456, "loss": 5.0157, "mean_token_accuracy": 0.1982097789645195, "num_tokens": 61760468.0, "step": 35595 }, { "entropy": 5.663492345809937, "epoch": 2.769811320754717, "grad_norm": 1.1875, "learning_rate": 0.000423092857139065, "loss": 4.8942, "mean_token_accuracy": 0.21069636791944504, "num_tokens": 61769225.0, "step": 35600 }, { "entropy": 5.698661518096924, "epoch": 2.7702003501264345, "grad_norm": 1.21875, "learning_rate": 0.000423071990295402, "loss": 4.9811, "mean_token_accuracy": 0.20075487792491914, "num_tokens": 61777585.0, "step": 35605 }, { "entropy": 5.693813514709473, "epoch": 2.770589379498152, "grad_norm": 1.2890625, "learning_rate": 0.0004230511212049822, "loss": 4.9709, "mean_token_accuracy": 0.20372925698757172, "num_tokens": 61785816.0, "step": 35610 }, { "entropy": 5.749909496307373, "epoch": 2.77097840886987, "grad_norm": 1.1875, "learning_rate": 0.0004230302498681224, "loss": 4.9997, "mean_token_accuracy": 0.20659043937921523, "num_tokens": 61794929.0, "step": 35615 }, { "entropy": 5.6977935314178465, "epoch": 2.771367438241587, "grad_norm": 1.1875, "learning_rate": 0.0004230093762851392, "loss": 4.9531, "mean_token_accuracy": 0.21018249839544295, "num_tokens": 61803607.0, "step": 35620 }, { "entropy": 5.657301187515259, "epoch": 2.771756467613305, "grad_norm": 1.2421875, "learning_rate": 0.0004229885004563491, "loss": 4.9397, "mean_token_accuracy": 0.20955567806959152, "num_tokens": 61812595.0, "step": 35625 }, { "entropy": 5.657483673095703, "epoch": 2.772145496985022, "grad_norm": 1.25, "learning_rate": 0.0004229676223820692, "loss": 4.8842, "mean_token_accuracy": 0.21038243174552917, "num_tokens": 61820474.0, "step": 35630 }, { "entropy": 5.70485634803772, "epoch": 2.77253452635674, "grad_norm": 1.2421875, "learning_rate": 0.00042294674206261616, "loss": 5.0068, "mean_token_accuracy": 0.2030025079846382, "num_tokens": 61829784.0, "step": 35635 }, { "entropy": 5.714876699447632, "epoch": 2.7729235557284575, "grad_norm": 1.2109375, "learning_rate": 0.0004229258594983067, "loss": 4.9433, "mean_token_accuracy": 0.20952286720275878, "num_tokens": 61839316.0, "step": 35640 }, { "entropy": 5.697353458404541, "epoch": 2.773312585100175, "grad_norm": 1.265625, "learning_rate": 0.0004229049746894578, "loss": 4.9965, "mean_token_accuracy": 0.2109530121088028, "num_tokens": 61847705.0, "step": 35645 }, { "entropy": 5.711152839660644, "epoch": 2.773701614471893, "grad_norm": 1.21875, "learning_rate": 0.0004228840876363864, "loss": 4.9937, "mean_token_accuracy": 0.2050390660762787, "num_tokens": 61856028.0, "step": 35650 }, { "entropy": 5.803388404846191, "epoch": 2.77409064384361, "grad_norm": 1.2265625, "learning_rate": 0.0004228631983394093, "loss": 5.0955, "mean_token_accuracy": 0.20413737446069719, "num_tokens": 61864836.0, "step": 35655 }, { "entropy": 5.68941102027893, "epoch": 2.774479673215328, "grad_norm": 1.15625, "learning_rate": 0.0004228423067988434, "loss": 4.9534, "mean_token_accuracy": 0.20565738528966904, "num_tokens": 61873179.0, "step": 35660 }, { "entropy": 5.7224853515625, "epoch": 2.774868702587045, "grad_norm": 1.28125, "learning_rate": 0.00042282141301500597, "loss": 5.044, "mean_token_accuracy": 0.20796093493700027, "num_tokens": 61881068.0, "step": 35665 }, { "entropy": 5.668208265304566, "epoch": 2.775257731958763, "grad_norm": 1.2578125, "learning_rate": 0.0004228005169882138, "loss": 4.9366, "mean_token_accuracy": 0.2157965287566185, "num_tokens": 61889640.0, "step": 35670 }, { "entropy": 5.708583879470825, "epoch": 2.7756467613304805, "grad_norm": 1.234375, "learning_rate": 0.00042277961871878413, "loss": 5.0447, "mean_token_accuracy": 0.19970574527978896, "num_tokens": 61898267.0, "step": 35675 }, { "entropy": 5.707902479171753, "epoch": 2.776035790702198, "grad_norm": 1.1640625, "learning_rate": 0.0004227587182070338, "loss": 4.9419, "mean_token_accuracy": 0.21368465274572374, "num_tokens": 61906166.0, "step": 35680 }, { "entropy": 5.64837007522583, "epoch": 2.7764248200739154, "grad_norm": 1.4140625, "learning_rate": 0.0004227378154532802, "loss": 4.9067, "mean_token_accuracy": 0.21473677307367325, "num_tokens": 61915335.0, "step": 35685 }, { "entropy": 5.655986642837524, "epoch": 2.776813849445633, "grad_norm": 1.1171875, "learning_rate": 0.0004227169104578404, "loss": 4.9548, "mean_token_accuracy": 0.2053390085697174, "num_tokens": 61924969.0, "step": 35690 }, { "entropy": 5.758424377441406, "epoch": 2.777202878817351, "grad_norm": 1.2265625, "learning_rate": 0.00042269600322103164, "loss": 4.9595, "mean_token_accuracy": 0.21231439411640168, "num_tokens": 61933817.0, "step": 35695 }, { "entropy": 5.74832673072815, "epoch": 2.777591908189068, "grad_norm": 1.34375, "learning_rate": 0.000422675093743171, "loss": 4.9901, "mean_token_accuracy": 0.1953140988945961, "num_tokens": 61941870.0, "step": 35700 }, { "entropy": 5.715137577056884, "epoch": 2.777980937560786, "grad_norm": 1.25, "learning_rate": 0.00042265418202457603, "loss": 4.9531, "mean_token_accuracy": 0.2094820261001587, "num_tokens": 61950559.0, "step": 35705 }, { "entropy": 5.650943994522095, "epoch": 2.7783699669325035, "grad_norm": 1.203125, "learning_rate": 0.0004226332680655637, "loss": 4.9542, "mean_token_accuracy": 0.20223014950752258, "num_tokens": 61960138.0, "step": 35710 }, { "entropy": 5.752165842056274, "epoch": 2.778758996304221, "grad_norm": 1.28125, "learning_rate": 0.0004226123518664516, "loss": 4.9378, "mean_token_accuracy": 0.2023313581943512, "num_tokens": 61968555.0, "step": 35715 }, { "entropy": 5.743624353408814, "epoch": 2.7791480256759384, "grad_norm": 1.3515625, "learning_rate": 0.0004225914334275569, "loss": 5.009, "mean_token_accuracy": 0.20128106325864792, "num_tokens": 61976572.0, "step": 35720 }, { "entropy": 5.657948112487793, "epoch": 2.779537055047656, "grad_norm": 1.1796875, "learning_rate": 0.0004225705127491972, "loss": 4.9205, "mean_token_accuracy": 0.2100988283753395, "num_tokens": 61984479.0, "step": 35725 }, { "entropy": 5.729463958740235, "epoch": 2.7799260844193734, "grad_norm": 1.265625, "learning_rate": 0.0004225495898316899, "loss": 5.022, "mean_token_accuracy": 0.20638817995786668, "num_tokens": 61993098.0, "step": 35730 }, { "entropy": 5.774903917312622, "epoch": 2.780315113791091, "grad_norm": 1.4765625, "learning_rate": 0.00042252866467535233, "loss": 4.9735, "mean_token_accuracy": 0.20686670392751694, "num_tokens": 62001244.0, "step": 35735 }, { "entropy": 5.684518432617187, "epoch": 2.780704143162809, "grad_norm": 1.2578125, "learning_rate": 0.00042250773728050214, "loss": 4.9001, "mean_token_accuracy": 0.2281483843922615, "num_tokens": 62010121.0, "step": 35740 }, { "entropy": 5.719108390808105, "epoch": 2.7810931725345265, "grad_norm": 1.2734375, "learning_rate": 0.0004224868076474568, "loss": 4.9662, "mean_token_accuracy": 0.20883809477090837, "num_tokens": 62018668.0, "step": 35745 }, { "entropy": 5.748516178131103, "epoch": 2.781482201906244, "grad_norm": 1.2890625, "learning_rate": 0.00042246587577653394, "loss": 4.9961, "mean_token_accuracy": 0.20620885342359543, "num_tokens": 62027198.0, "step": 35750 }, { "entropy": 5.839861679077148, "epoch": 2.7818712312779614, "grad_norm": 1.2421875, "learning_rate": 0.0004224449416680511, "loss": 5.0716, "mean_token_accuracy": 0.20140437930822372, "num_tokens": 62037359.0, "step": 35755 }, { "entropy": 5.723645544052124, "epoch": 2.782260260649679, "grad_norm": 1.203125, "learning_rate": 0.00042242400532232593, "loss": 4.9379, "mean_token_accuracy": 0.20908773988485335, "num_tokens": 62046110.0, "step": 35760 }, { "entropy": 5.693311262130737, "epoch": 2.7826492900213964, "grad_norm": 1.203125, "learning_rate": 0.00042240306673967614, "loss": 4.9137, "mean_token_accuracy": 0.212683741748333, "num_tokens": 62055265.0, "step": 35765 }, { "entropy": 5.706912231445313, "epoch": 2.783038319393114, "grad_norm": 1.28125, "learning_rate": 0.00042238212592041945, "loss": 4.8709, "mean_token_accuracy": 0.21394198387861252, "num_tokens": 62063406.0, "step": 35770 }, { "entropy": 5.6545721054077145, "epoch": 2.7834273487648318, "grad_norm": 1.234375, "learning_rate": 0.00042236118286487364, "loss": 4.8938, "mean_token_accuracy": 0.21695060431957244, "num_tokens": 62071998.0, "step": 35775 }, { "entropy": 5.6538702011108395, "epoch": 2.7838163781365495, "grad_norm": 1.25, "learning_rate": 0.00042234023757335633, "loss": 4.91, "mean_token_accuracy": 0.2060961663722992, "num_tokens": 62081007.0, "step": 35780 }, { "entropy": 5.787205791473388, "epoch": 2.7842054075082667, "grad_norm": 1.3359375, "learning_rate": 0.00042231929004618547, "loss": 4.999, "mean_token_accuracy": 0.20946573615074157, "num_tokens": 62089164.0, "step": 35785 }, { "entropy": 5.699540138244629, "epoch": 2.7845944368799844, "grad_norm": 1.2421875, "learning_rate": 0.0004222983402836789, "loss": 4.892, "mean_token_accuracy": 0.2104268491268158, "num_tokens": 62098300.0, "step": 35790 }, { "entropy": 5.799757480621338, "epoch": 2.784983466251702, "grad_norm": 1.421875, "learning_rate": 0.00042227738828615435, "loss": 5.0257, "mean_token_accuracy": 0.2022045522928238, "num_tokens": 62106384.0, "step": 35795 }, { "entropy": 5.671920871734619, "epoch": 2.7853724956234194, "grad_norm": 1.15625, "learning_rate": 0.00042225643405392993, "loss": 5.0103, "mean_token_accuracy": 0.20571552217006683, "num_tokens": 62114988.0, "step": 35800 }, { "entropy": 5.740653562545776, "epoch": 2.785761524995137, "grad_norm": 1.390625, "learning_rate": 0.00042223547758732356, "loss": 4.9827, "mean_token_accuracy": 0.20759759545326234, "num_tokens": 62123316.0, "step": 35805 }, { "entropy": 5.717961215972901, "epoch": 2.7861505543668548, "grad_norm": 1.1484375, "learning_rate": 0.00042221451888665307, "loss": 4.9021, "mean_token_accuracy": 0.21416011303663254, "num_tokens": 62132034.0, "step": 35810 }, { "entropy": 5.720687198638916, "epoch": 2.7865395837385725, "grad_norm": 1.2265625, "learning_rate": 0.00042219355795223657, "loss": 4.9717, "mean_token_accuracy": 0.20303915143013002, "num_tokens": 62140671.0, "step": 35815 }, { "entropy": 5.787706518173218, "epoch": 2.7869286131102897, "grad_norm": 1.1640625, "learning_rate": 0.00042217259478439216, "loss": 5.0551, "mean_token_accuracy": 0.20567448139190675, "num_tokens": 62149581.0, "step": 35820 }, { "entropy": 5.77656741142273, "epoch": 2.7873176424820074, "grad_norm": 1.1953125, "learning_rate": 0.0004221516293834379, "loss": 4.9271, "mean_token_accuracy": 0.20878140777349471, "num_tokens": 62157618.0, "step": 35825 }, { "entropy": 5.738287925720215, "epoch": 2.787706671853725, "grad_norm": 1.3046875, "learning_rate": 0.00042213066174969177, "loss": 5.0036, "mean_token_accuracy": 0.20463876128196717, "num_tokens": 62166508.0, "step": 35830 }, { "entropy": 5.669754219055176, "epoch": 2.7880957012254424, "grad_norm": 1.2734375, "learning_rate": 0.00042210969188347217, "loss": 4.9962, "mean_token_accuracy": 0.20245258659124374, "num_tokens": 62174804.0, "step": 35835 }, { "entropy": 5.654208517074585, "epoch": 2.78848473059716, "grad_norm": 1.21875, "learning_rate": 0.0004220887197850971, "loss": 4.8823, "mean_token_accuracy": 0.21587610989809036, "num_tokens": 62183071.0, "step": 35840 }, { "entropy": 5.7013321876525875, "epoch": 2.7888737599688778, "grad_norm": 1.25, "learning_rate": 0.00042206774545488476, "loss": 4.8737, "mean_token_accuracy": 0.21504210829734802, "num_tokens": 62191595.0, "step": 35845 }, { "entropy": 5.748844242095947, "epoch": 2.7892627893405955, "grad_norm": 1.28125, "learning_rate": 0.0004220467688931535, "loss": 4.9438, "mean_token_accuracy": 0.21111344397068024, "num_tokens": 62200552.0, "step": 35850 }, { "entropy": 5.69690203666687, "epoch": 2.7896518187123127, "grad_norm": 1.234375, "learning_rate": 0.0004220257901002216, "loss": 5.0303, "mean_token_accuracy": 0.20231180489063263, "num_tokens": 62209492.0, "step": 35855 }, { "entropy": 5.720066785812378, "epoch": 2.7900408480840304, "grad_norm": 1.2734375, "learning_rate": 0.0004220048090764073, "loss": 5.0521, "mean_token_accuracy": 0.20598178058862687, "num_tokens": 62218697.0, "step": 35860 }, { "entropy": 5.788217353820801, "epoch": 2.7904298774557477, "grad_norm": 1.25, "learning_rate": 0.00042198382582202905, "loss": 5.0089, "mean_token_accuracy": 0.20639549642801286, "num_tokens": 62227216.0, "step": 35865 }, { "entropy": 5.76427116394043, "epoch": 2.7908189068274654, "grad_norm": 1.15625, "learning_rate": 0.0004219628403374052, "loss": 4.9767, "mean_token_accuracy": 0.2036355823278427, "num_tokens": 62235782.0, "step": 35870 }, { "entropy": 5.690377855300904, "epoch": 2.791207936199183, "grad_norm": 1.28125, "learning_rate": 0.0004219418526228541, "loss": 5.01, "mean_token_accuracy": 0.208826544880867, "num_tokens": 62244873.0, "step": 35875 }, { "entropy": 5.632970905303955, "epoch": 2.7915969655709008, "grad_norm": 1.203125, "learning_rate": 0.0004219208626786943, "loss": 4.8512, "mean_token_accuracy": 0.21261836290359498, "num_tokens": 62253053.0, "step": 35880 }, { "entropy": 5.775230979919433, "epoch": 2.791985994942618, "grad_norm": 1.296875, "learning_rate": 0.0004218998705052443, "loss": 5.0576, "mean_token_accuracy": 0.19887065440416335, "num_tokens": 62261107.0, "step": 35885 }, { "entropy": 5.751078319549561, "epoch": 2.7923750243143357, "grad_norm": 1.3125, "learning_rate": 0.00042187887610282255, "loss": 5.0823, "mean_token_accuracy": 0.19353830963373184, "num_tokens": 62269722.0, "step": 35890 }, { "entropy": 5.7680480003356935, "epoch": 2.7927640536860534, "grad_norm": 1.171875, "learning_rate": 0.0004218578794717476, "loss": 5.0302, "mean_token_accuracy": 0.2026605099439621, "num_tokens": 62278396.0, "step": 35895 }, { "entropy": 5.759116315841675, "epoch": 2.7931530830577707, "grad_norm": 1.2578125, "learning_rate": 0.00042183688061233813, "loss": 4.9413, "mean_token_accuracy": 0.21301019042730332, "num_tokens": 62286652.0, "step": 35900 }, { "entropy": 5.651119422912598, "epoch": 2.7935421124294884, "grad_norm": 1.1875, "learning_rate": 0.00042181587952491267, "loss": 4.8258, "mean_token_accuracy": 0.22090516686439515, "num_tokens": 62294252.0, "step": 35905 }, { "entropy": 5.645628356933594, "epoch": 2.793931141801206, "grad_norm": 1.1171875, "learning_rate": 0.00042179487620978997, "loss": 4.9665, "mean_token_accuracy": 0.2145445540547371, "num_tokens": 62303222.0, "step": 35910 }, { "entropy": 5.763366746902466, "epoch": 2.7943201711729238, "grad_norm": 1.28125, "learning_rate": 0.0004217738706672886, "loss": 5.0164, "mean_token_accuracy": 0.21124972701072692, "num_tokens": 62311537.0, "step": 35915 }, { "entropy": 5.638851881027222, "epoch": 2.794709200544641, "grad_norm": 1.140625, "learning_rate": 0.00042175286289772746, "loss": 4.8121, "mean_token_accuracy": 0.212005515396595, "num_tokens": 62320073.0, "step": 35920 }, { "entropy": 5.679330682754516, "epoch": 2.7950982299163587, "grad_norm": 1.2421875, "learning_rate": 0.0004217318529014251, "loss": 4.8991, "mean_token_accuracy": 0.213081257045269, "num_tokens": 62328253.0, "step": 35925 }, { "entropy": 5.745542716979981, "epoch": 2.7954872592880764, "grad_norm": 1.1796875, "learning_rate": 0.0004217108406787005, "loss": 5.0024, "mean_token_accuracy": 0.20184246748685836, "num_tokens": 62337127.0, "step": 35930 }, { "entropy": 5.764872026443482, "epoch": 2.7958762886597937, "grad_norm": 1.234375, "learning_rate": 0.0004216898262298724, "loss": 4.9184, "mean_token_accuracy": 0.2094544991850853, "num_tokens": 62345353.0, "step": 35935 }, { "entropy": 5.67405252456665, "epoch": 2.7962653180315113, "grad_norm": 1.1796875, "learning_rate": 0.0004216688095552596, "loss": 4.9036, "mean_token_accuracy": 0.20869094133377075, "num_tokens": 62354319.0, "step": 35940 }, { "entropy": 5.628344535827637, "epoch": 2.796654347403229, "grad_norm": 1.296875, "learning_rate": 0.0004216477906551811, "loss": 4.8801, "mean_token_accuracy": 0.215924035012722, "num_tokens": 62363056.0, "step": 35945 }, { "entropy": 5.703462934494018, "epoch": 2.7970433767749467, "grad_norm": 1.28125, "learning_rate": 0.00042162676952995585, "loss": 4.9135, "mean_token_accuracy": 0.21067634969949722, "num_tokens": 62370999.0, "step": 35950 }, { "entropy": 5.74155559539795, "epoch": 2.797432406146664, "grad_norm": 1.375, "learning_rate": 0.00042160574617990267, "loss": 5.052, "mean_token_accuracy": 0.2084408476948738, "num_tokens": 62379021.0, "step": 35955 }, { "entropy": 5.708321475982666, "epoch": 2.7978214355183817, "grad_norm": 1.328125, "learning_rate": 0.00042158472060534066, "loss": 4.9317, "mean_token_accuracy": 0.20339378118515014, "num_tokens": 62387223.0, "step": 35960 }, { "entropy": 5.725368881225586, "epoch": 2.798210464890099, "grad_norm": 1.1640625, "learning_rate": 0.00042156369280658886, "loss": 4.9641, "mean_token_accuracy": 0.20852207243442536, "num_tokens": 62396702.0, "step": 35965 }, { "entropy": 5.778937292098999, "epoch": 2.7985994942618166, "grad_norm": 1.2109375, "learning_rate": 0.0004215426627839662, "loss": 5.1522, "mean_token_accuracy": 0.19808615893125534, "num_tokens": 62405778.0, "step": 35970 }, { "entropy": 5.724852848052978, "epoch": 2.7989885236335343, "grad_norm": 1.2421875, "learning_rate": 0.00042152163053779196, "loss": 4.9992, "mean_token_accuracy": 0.20039259791374206, "num_tokens": 62413882.0, "step": 35975 }, { "entropy": 5.725995206832886, "epoch": 2.799377553005252, "grad_norm": 1.265625, "learning_rate": 0.0004215005960683852, "loss": 4.9154, "mean_token_accuracy": 0.2115092784166336, "num_tokens": 62422142.0, "step": 35980 }, { "entropy": 5.626158285140991, "epoch": 2.7997665823769697, "grad_norm": 1.1875, "learning_rate": 0.0004214795593760651, "loss": 4.8665, "mean_token_accuracy": 0.21968503743410112, "num_tokens": 62430902.0, "step": 35985 }, { "entropy": 5.7147032737731935, "epoch": 2.800155611748687, "grad_norm": 1.28125, "learning_rate": 0.0004214585204611508, "loss": 5.0853, "mean_token_accuracy": 0.20075087249279022, "num_tokens": 62440205.0, "step": 35990 }, { "entropy": 5.730164194107056, "epoch": 2.8005446411204047, "grad_norm": 1.265625, "learning_rate": 0.00042143747932396153, "loss": 4.8634, "mean_token_accuracy": 0.2176876559853554, "num_tokens": 62448730.0, "step": 35995 }, { "entropy": 5.714774942398071, "epoch": 2.800933670492122, "grad_norm": 1.265625, "learning_rate": 0.0004214164359648166, "loss": 4.9516, "mean_token_accuracy": 0.2043631926178932, "num_tokens": 62457323.0, "step": 36000 }, { "epoch": 2.800933670492122, "eval_entropy": 5.429411687199259, "eval_loss": 5.05598783493042, "eval_mean_token_accuracy": 0.21343226708450264, "eval_num_tokens": 62457323.0, "eval_runtime": 21.6577, "eval_samples_per_second": 1918.858, "eval_steps_per_second": 239.869, "step": 36000 }, { "entropy": 5.791463422775268, "epoch": 2.8013226998638396, "grad_norm": 1.3203125, "learning_rate": 0.00042139539038403535, "loss": 5.165, "mean_token_accuracy": 0.19221772253513336, "num_tokens": 62466328.0, "step": 36005 }, { "entropy": 5.803160095214844, "epoch": 2.8017117292355573, "grad_norm": 1.234375, "learning_rate": 0.000421374342581937, "loss": 5.0757, "mean_token_accuracy": 0.20249293595552445, "num_tokens": 62475063.0, "step": 36010 }, { "entropy": 5.7295591831207275, "epoch": 2.802100758607275, "grad_norm": 1.2578125, "learning_rate": 0.00042135329255884105, "loss": 4.8642, "mean_token_accuracy": 0.21261500120162963, "num_tokens": 62483027.0, "step": 36015 }, { "entropy": 5.677012729644775, "epoch": 2.8024897879789923, "grad_norm": 1.296875, "learning_rate": 0.0004213322403150668, "loss": 4.8569, "mean_token_accuracy": 0.2160395175218582, "num_tokens": 62491762.0, "step": 36020 }, { "entropy": 5.730729246139527, "epoch": 2.80287881735071, "grad_norm": 1.2734375, "learning_rate": 0.0004213111858509337, "loss": 4.947, "mean_token_accuracy": 0.21364181041717528, "num_tokens": 62500340.0, "step": 36025 }, { "entropy": 5.767397356033325, "epoch": 2.8032678467224277, "grad_norm": 1.234375, "learning_rate": 0.0004212901291667612, "loss": 4.9995, "mean_token_accuracy": 0.20482261925935746, "num_tokens": 62508580.0, "step": 36030 }, { "entropy": 5.642378950119019, "epoch": 2.803656876094145, "grad_norm": 1.2109375, "learning_rate": 0.00042126907026286887, "loss": 4.9234, "mean_token_accuracy": 0.2144310876727104, "num_tokens": 62516790.0, "step": 36035 }, { "entropy": 5.7141297340393065, "epoch": 2.8040459054658626, "grad_norm": 1.375, "learning_rate": 0.00042124800913957624, "loss": 4.9972, "mean_token_accuracy": 0.20203347951173783, "num_tokens": 62525525.0, "step": 36040 }, { "entropy": 5.7222494125366214, "epoch": 2.8044349348375803, "grad_norm": 1.265625, "learning_rate": 0.0004212269457972028, "loss": 5.0537, "mean_token_accuracy": 0.20563951283693313, "num_tokens": 62535948.0, "step": 36045 }, { "entropy": 5.6770265102386475, "epoch": 2.804823964209298, "grad_norm": 1.2421875, "learning_rate": 0.0004212058802360682, "loss": 4.8554, "mean_token_accuracy": 0.2170703276991844, "num_tokens": 62544663.0, "step": 36050 }, { "entropy": 5.758439588546753, "epoch": 2.8052129935810153, "grad_norm": 1.2578125, "learning_rate": 0.0004211848124564922, "loss": 5.0331, "mean_token_accuracy": 0.197563074529171, "num_tokens": 62553017.0, "step": 36055 }, { "entropy": 5.758427858352661, "epoch": 2.805602022952733, "grad_norm": 1.8046875, "learning_rate": 0.0004211637424587942, "loss": 4.8917, "mean_token_accuracy": 0.22168685644865035, "num_tokens": 62561311.0, "step": 36060 }, { "entropy": 5.781798505783081, "epoch": 2.8059910523244502, "grad_norm": 1.3125, "learning_rate": 0.0004211426702432941, "loss": 5.0574, "mean_token_accuracy": 0.20180109292268752, "num_tokens": 62569387.0, "step": 36065 }, { "entropy": 5.731270790100098, "epoch": 2.806380081696168, "grad_norm": 1.2109375, "learning_rate": 0.0004211215958103116, "loss": 5.0604, "mean_token_accuracy": 0.20723959654569626, "num_tokens": 62579250.0, "step": 36070 }, { "entropy": 5.709207820892334, "epoch": 2.8067691110678856, "grad_norm": 1.2890625, "learning_rate": 0.00042110051916016645, "loss": 4.9485, "mean_token_accuracy": 0.20611853450536727, "num_tokens": 62587848.0, "step": 36075 }, { "entropy": 5.713175868988037, "epoch": 2.8071581404396033, "grad_norm": 1.2578125, "learning_rate": 0.0004210794402931785, "loss": 4.9842, "mean_token_accuracy": 0.21044569313526154, "num_tokens": 62596476.0, "step": 36080 }, { "entropy": 5.76529450416565, "epoch": 2.807547169811321, "grad_norm": 1.265625, "learning_rate": 0.0004210583592096675, "loss": 5.0252, "mean_token_accuracy": 0.20681067556142807, "num_tokens": 62604785.0, "step": 36085 }, { "entropy": 5.798939323425293, "epoch": 2.8079361991830383, "grad_norm": 1.3203125, "learning_rate": 0.0004210372759099534, "loss": 5.0236, "mean_token_accuracy": 0.20493322014808654, "num_tokens": 62612963.0, "step": 36090 }, { "entropy": 5.768968534469605, "epoch": 2.808325228554756, "grad_norm": 1.21875, "learning_rate": 0.000421016190394356, "loss": 4.9941, "mean_token_accuracy": 0.2029451459646225, "num_tokens": 62621504.0, "step": 36095 }, { "entropy": 5.869975519180298, "epoch": 2.8087142579264732, "grad_norm": 1.2109375, "learning_rate": 0.00042099510266319545, "loss": 5.1654, "mean_token_accuracy": 0.19004778265953065, "num_tokens": 62630475.0, "step": 36100 }, { "entropy": 5.712640905380249, "epoch": 2.809103287298191, "grad_norm": 1.15625, "learning_rate": 0.0004209740127167915, "loss": 4.9202, "mean_token_accuracy": 0.20918382406234742, "num_tokens": 62639241.0, "step": 36105 }, { "entropy": 5.698992586135864, "epoch": 2.8094923166699086, "grad_norm": 1.21875, "learning_rate": 0.0004209529205554643, "loss": 4.9185, "mean_token_accuracy": 0.20782988667488098, "num_tokens": 62648073.0, "step": 36110 }, { "entropy": 5.671531391143799, "epoch": 2.8098813460416263, "grad_norm": 1.265625, "learning_rate": 0.0004209318261795339, "loss": 4.9603, "mean_token_accuracy": 0.21369728296995164, "num_tokens": 62657455.0, "step": 36115 }, { "entropy": 5.728784275054932, "epoch": 2.8102703754133436, "grad_norm": 1.21875, "learning_rate": 0.0004209107295893202, "loss": 4.9584, "mean_token_accuracy": 0.20220387279987334, "num_tokens": 62665795.0, "step": 36120 }, { "entropy": 5.7702690124511715, "epoch": 2.8106594047850613, "grad_norm": 1.21875, "learning_rate": 0.00042088963078514344, "loss": 5.0101, "mean_token_accuracy": 0.20522227883338928, "num_tokens": 62674095.0, "step": 36125 }, { "entropy": 5.742775821685791, "epoch": 2.811048434156779, "grad_norm": 1.375, "learning_rate": 0.0004208685297673238, "loss": 4.9481, "mean_token_accuracy": 0.20825452357530594, "num_tokens": 62683195.0, "step": 36130 }, { "entropy": 5.754679727554321, "epoch": 2.811437463528496, "grad_norm": 1.21875, "learning_rate": 0.0004208474265361813, "loss": 5.0454, "mean_token_accuracy": 0.19705945551395415, "num_tokens": 62692135.0, "step": 36135 }, { "entropy": 5.735333490371704, "epoch": 2.811826492900214, "grad_norm": 1.390625, "learning_rate": 0.00042082632109203627, "loss": 4.9302, "mean_token_accuracy": 0.21691171824932098, "num_tokens": 62700417.0, "step": 36140 }, { "entropy": 5.625975322723389, "epoch": 2.8122155222719316, "grad_norm": 1.234375, "learning_rate": 0.000420805213435209, "loss": 4.8797, "mean_token_accuracy": 0.21859325021505355, "num_tokens": 62708995.0, "step": 36145 }, { "entropy": 5.696475839614868, "epoch": 2.8126045516436493, "grad_norm": 1.25, "learning_rate": 0.0004207841035660196, "loss": 5.02, "mean_token_accuracy": 0.1998225823044777, "num_tokens": 62718798.0, "step": 36150 }, { "entropy": 5.794991970062256, "epoch": 2.8129935810153666, "grad_norm": 1.2734375, "learning_rate": 0.0004207629914847885, "loss": 5.0192, "mean_token_accuracy": 0.20139726251363754, "num_tokens": 62726916.0, "step": 36155 }, { "entropy": 5.784782934188843, "epoch": 2.8133826103870843, "grad_norm": 1.3046875, "learning_rate": 0.000420741877191836, "loss": 5.0417, "mean_token_accuracy": 0.20129092782735825, "num_tokens": 62735644.0, "step": 36160 }, { "entropy": 5.72823395729065, "epoch": 2.8137716397588015, "grad_norm": 1.28125, "learning_rate": 0.0004207207606874825, "loss": 5.0134, "mean_token_accuracy": 0.20797159522771835, "num_tokens": 62743743.0, "step": 36165 }, { "entropy": 5.794711542129517, "epoch": 2.814160669130519, "grad_norm": 1.2109375, "learning_rate": 0.0004206996419720484, "loss": 5.112, "mean_token_accuracy": 0.19558885991573333, "num_tokens": 62753181.0, "step": 36170 }, { "entropy": 5.749361419677735, "epoch": 2.814549698502237, "grad_norm": 1.1015625, "learning_rate": 0.0004206785210458541, "loss": 5.0607, "mean_token_accuracy": 0.2063676342368126, "num_tokens": 62763284.0, "step": 36175 }, { "entropy": 5.824263048171997, "epoch": 2.8149387278739546, "grad_norm": 1.2421875, "learning_rate": 0.0004206573979092202, "loss": 4.9961, "mean_token_accuracy": 0.2060114935040474, "num_tokens": 62772051.0, "step": 36180 }, { "entropy": 5.833756780624389, "epoch": 2.8153277572456723, "grad_norm": 1.2890625, "learning_rate": 0.00042063627256246706, "loss": 4.9766, "mean_token_accuracy": 0.2109333708882332, "num_tokens": 62781067.0, "step": 36185 }, { "entropy": 5.736289548873901, "epoch": 2.8157167866173896, "grad_norm": 1.1171875, "learning_rate": 0.0004206151450059153, "loss": 5.0706, "mean_token_accuracy": 0.20158449709415435, "num_tokens": 62789902.0, "step": 36190 }, { "entropy": 5.734937381744385, "epoch": 2.8161058159891073, "grad_norm": 1.21875, "learning_rate": 0.00042059401523988546, "loss": 5.0163, "mean_token_accuracy": 0.20438360571861267, "num_tokens": 62799239.0, "step": 36195 }, { "entropy": 5.77956714630127, "epoch": 2.8164948453608245, "grad_norm": 1.2890625, "learning_rate": 0.0004205728832646982, "loss": 5.0617, "mean_token_accuracy": 0.20546602755784987, "num_tokens": 62808060.0, "step": 36200 }, { "entropy": 5.71492748260498, "epoch": 2.816883874732542, "grad_norm": 1.3203125, "learning_rate": 0.00042055174908067414, "loss": 4.8684, "mean_token_accuracy": 0.222498819231987, "num_tokens": 62816638.0, "step": 36205 }, { "entropy": 5.75117039680481, "epoch": 2.81727290410426, "grad_norm": 1.25, "learning_rate": 0.00042053061268813397, "loss": 4.9654, "mean_token_accuracy": 0.20772894620895385, "num_tokens": 62824895.0, "step": 36210 }, { "entropy": 5.730296993255616, "epoch": 2.8176619334759776, "grad_norm": 1.2734375, "learning_rate": 0.00042050947408739836, "loss": 4.9704, "mean_token_accuracy": 0.20445550084114075, "num_tokens": 62834404.0, "step": 36215 }, { "entropy": 5.799823331832886, "epoch": 2.818050962847695, "grad_norm": 1.1328125, "learning_rate": 0.0004204883332787881, "loss": 5.0055, "mean_token_accuracy": 0.20492597222328185, "num_tokens": 62842857.0, "step": 36220 }, { "entropy": 5.7177904605865475, "epoch": 2.8184399922194125, "grad_norm": 1.3671875, "learning_rate": 0.00042046719026262396, "loss": 4.9365, "mean_token_accuracy": 0.21294744610786437, "num_tokens": 62850845.0, "step": 36225 }, { "entropy": 5.773021268844604, "epoch": 2.8188290215911302, "grad_norm": 1.3671875, "learning_rate": 0.00042044604503922674, "loss": 5.08, "mean_token_accuracy": 0.20209589898586272, "num_tokens": 62859164.0, "step": 36230 }, { "entropy": 5.796916866302491, "epoch": 2.8192180509628475, "grad_norm": 1.3046875, "learning_rate": 0.0004204248976089173, "loss": 5.0269, "mean_token_accuracy": 0.2073966830968857, "num_tokens": 62868001.0, "step": 36235 }, { "entropy": 5.776257467269898, "epoch": 2.819607080334565, "grad_norm": 1.234375, "learning_rate": 0.0004204037479720165, "loss": 5.0096, "mean_token_accuracy": 0.20102550834417343, "num_tokens": 62877626.0, "step": 36240 }, { "entropy": 5.783353662490844, "epoch": 2.819996109706283, "grad_norm": 1.203125, "learning_rate": 0.00042038259612884514, "loss": 4.9771, "mean_token_accuracy": 0.21136777549982072, "num_tokens": 62886376.0, "step": 36245 }, { "entropy": 5.724270057678223, "epoch": 2.8203851390780006, "grad_norm": 1.2734375, "learning_rate": 0.00042036144207972445, "loss": 4.9683, "mean_token_accuracy": 0.20730339288711547, "num_tokens": 62895001.0, "step": 36250 }, { "entropy": 5.683387088775635, "epoch": 2.820774168449718, "grad_norm": 1.2578125, "learning_rate": 0.0004203402858249752, "loss": 4.999, "mean_token_accuracy": 0.20336652249097825, "num_tokens": 62903425.0, "step": 36255 }, { "entropy": 5.746587467193604, "epoch": 2.8211631978214355, "grad_norm": 1.2890625, "learning_rate": 0.0004203191273649184, "loss": 4.9047, "mean_token_accuracy": 0.21540874987840652, "num_tokens": 62911904.0, "step": 36260 }, { "entropy": 5.734385871887207, "epoch": 2.8215522271931532, "grad_norm": 1.265625, "learning_rate": 0.00042029796669987513, "loss": 4.9872, "mean_token_accuracy": 0.20774740725755692, "num_tokens": 62920576.0, "step": 36265 }, { "entropy": 5.72759370803833, "epoch": 2.8219412565648705, "grad_norm": 1.3125, "learning_rate": 0.0004202768038301665, "loss": 5.0054, "mean_token_accuracy": 0.21235346645116807, "num_tokens": 62929381.0, "step": 36270 }, { "entropy": 5.728389263153076, "epoch": 2.822330285936588, "grad_norm": 1.1953125, "learning_rate": 0.00042025563875611367, "loss": 4.9659, "mean_token_accuracy": 0.20625995546579362, "num_tokens": 62937903.0, "step": 36275 }, { "entropy": 5.71770830154419, "epoch": 2.822719315308306, "grad_norm": 1.1875, "learning_rate": 0.0004202344714780376, "loss": 5.0377, "mean_token_accuracy": 0.20706982910633087, "num_tokens": 62946630.0, "step": 36280 }, { "entropy": 5.759347295761108, "epoch": 2.8231083446800236, "grad_norm": 1.28125, "learning_rate": 0.00042021330199625966, "loss": 4.9813, "mean_token_accuracy": 0.21002335697412491, "num_tokens": 62954788.0, "step": 36285 }, { "entropy": 5.859901714324951, "epoch": 2.823497374051741, "grad_norm": 1.21875, "learning_rate": 0.00042019213031110105, "loss": 5.1072, "mean_token_accuracy": 0.19550697207450868, "num_tokens": 62964091.0, "step": 36290 }, { "entropy": 5.770223808288574, "epoch": 2.8238864034234585, "grad_norm": 1.3828125, "learning_rate": 0.0004201709564228829, "loss": 5.0347, "mean_token_accuracy": 0.20188231766223907, "num_tokens": 62972372.0, "step": 36295 }, { "entropy": 5.76106743812561, "epoch": 2.824275432795176, "grad_norm": 1.2890625, "learning_rate": 0.00042014978033192655, "loss": 5.0056, "mean_token_accuracy": 0.20466916412115096, "num_tokens": 62981065.0, "step": 36300 }, { "entropy": 5.801694440841675, "epoch": 2.8246644621668935, "grad_norm": 1.2734375, "learning_rate": 0.00042012860203855337, "loss": 5.0523, "mean_token_accuracy": 0.20249920934438706, "num_tokens": 62989363.0, "step": 36305 }, { "entropy": 5.687857389450073, "epoch": 2.825053491538611, "grad_norm": 2.40625, "learning_rate": 0.00042010742154308453, "loss": 4.8626, "mean_token_accuracy": 0.2207600951194763, "num_tokens": 62998454.0, "step": 36310 }, { "entropy": 5.810584354400635, "epoch": 2.825442520910329, "grad_norm": 1.25, "learning_rate": 0.00042008623884584167, "loss": 5.0968, "mean_token_accuracy": 0.20089921057224275, "num_tokens": 63007089.0, "step": 36315 }, { "entropy": 5.6966633796691895, "epoch": 2.825831550282046, "grad_norm": 1.2265625, "learning_rate": 0.00042006505394714597, "loss": 4.9673, "mean_token_accuracy": 0.20338371843099595, "num_tokens": 63016702.0, "step": 36320 }, { "entropy": 5.687336874008179, "epoch": 2.826220579653764, "grad_norm": 1.296875, "learning_rate": 0.00042004386684731896, "loss": 4.9695, "mean_token_accuracy": 0.20911576896905898, "num_tokens": 63024917.0, "step": 36325 }, { "entropy": 5.785512065887451, "epoch": 2.8266096090254815, "grad_norm": 1.1640625, "learning_rate": 0.00042002267754668216, "loss": 5.0639, "mean_token_accuracy": 0.20397927463054658, "num_tokens": 63034527.0, "step": 36330 }, { "entropy": 5.659380483627319, "epoch": 2.826998638397199, "grad_norm": 1.15625, "learning_rate": 0.000420001486045557, "loss": 4.9062, "mean_token_accuracy": 0.21329390704631807, "num_tokens": 63043214.0, "step": 36335 }, { "entropy": 5.735488557815552, "epoch": 2.8273876677689165, "grad_norm": 1.34375, "learning_rate": 0.0004199802923442652, "loss": 4.9652, "mean_token_accuracy": 0.20599957555532455, "num_tokens": 63052494.0, "step": 36340 }, { "entropy": 5.794697856903076, "epoch": 2.827776697140634, "grad_norm": 1.3203125, "learning_rate": 0.0004199590964431282, "loss": 4.9721, "mean_token_accuracy": 0.2032136246562004, "num_tokens": 63060543.0, "step": 36345 }, { "entropy": 5.773991823196411, "epoch": 2.828165726512352, "grad_norm": 1.25, "learning_rate": 0.0004199378983424676, "loss": 5.0519, "mean_token_accuracy": 0.2013360008597374, "num_tokens": 63069498.0, "step": 36350 }, { "entropy": 5.7104329586029055, "epoch": 2.828554755884069, "grad_norm": 1.28125, "learning_rate": 0.00041991669804260505, "loss": 4.9496, "mean_token_accuracy": 0.20889620780944823, "num_tokens": 63077887.0, "step": 36355 }, { "entropy": 5.761520767211914, "epoch": 2.828943785255787, "grad_norm": 1.328125, "learning_rate": 0.0004198954955438623, "loss": 5.0433, "mean_token_accuracy": 0.20222052931785583, "num_tokens": 63086131.0, "step": 36360 }, { "entropy": 5.7471414566040036, "epoch": 2.8293328146275045, "grad_norm": 1.3125, "learning_rate": 0.000419874290846561, "loss": 5.0145, "mean_token_accuracy": 0.20410784035921098, "num_tokens": 63094609.0, "step": 36365 }, { "entropy": 5.684627103805542, "epoch": 2.8297218439992218, "grad_norm": 1.2421875, "learning_rate": 0.00041985308395102303, "loss": 4.9508, "mean_token_accuracy": 0.21429855674505233, "num_tokens": 63103953.0, "step": 36370 }, { "entropy": 5.805222797393799, "epoch": 2.8301108733709395, "grad_norm": 1.265625, "learning_rate": 0.00041983187485756997, "loss": 5.0726, "mean_token_accuracy": 0.19919697642326356, "num_tokens": 63112450.0, "step": 36375 }, { "entropy": 5.746405601501465, "epoch": 2.830499902742657, "grad_norm": 1.3671875, "learning_rate": 0.00041981066356652373, "loss": 4.9635, "mean_token_accuracy": 0.2076180547475815, "num_tokens": 63120475.0, "step": 36380 }, { "entropy": 5.734838628768921, "epoch": 2.830888932114375, "grad_norm": 1.3984375, "learning_rate": 0.00041978945007820626, "loss": 5.013, "mean_token_accuracy": 0.20328641235828399, "num_tokens": 63128957.0, "step": 36385 }, { "entropy": 5.671457099914551, "epoch": 2.831277961486092, "grad_norm": 1.2890625, "learning_rate": 0.00041976823439293925, "loss": 4.9168, "mean_token_accuracy": 0.2095578968524933, "num_tokens": 63138060.0, "step": 36390 }, { "entropy": 5.797523546218872, "epoch": 2.83166699085781, "grad_norm": 1.3828125, "learning_rate": 0.0004197470165110447, "loss": 5.0866, "mean_token_accuracy": 0.19969479739665985, "num_tokens": 63146829.0, "step": 36395 }, { "entropy": 5.738124752044678, "epoch": 2.832056020229527, "grad_norm": 1.25, "learning_rate": 0.0004197257964328446, "loss": 4.9643, "mean_token_accuracy": 0.20790702998638153, "num_tokens": 63155456.0, "step": 36400 }, { "entropy": 5.750972318649292, "epoch": 2.8324450496012448, "grad_norm": 1.1796875, "learning_rate": 0.0004197045741586609, "loss": 5.0152, "mean_token_accuracy": 0.201012921333313, "num_tokens": 63164725.0, "step": 36405 }, { "entropy": 5.69929838180542, "epoch": 2.8328340789729625, "grad_norm": 1.2421875, "learning_rate": 0.0004196833496888156, "loss": 4.8887, "mean_token_accuracy": 0.218691910803318, "num_tokens": 63173538.0, "step": 36410 }, { "entropy": 5.764781904220581, "epoch": 2.83322310834468, "grad_norm": 1.2265625, "learning_rate": 0.0004196621230236308, "loss": 5.0704, "mean_token_accuracy": 0.20636032670736312, "num_tokens": 63183579.0, "step": 36415 }, { "entropy": 5.722826623916626, "epoch": 2.833612137716398, "grad_norm": 1.25, "learning_rate": 0.00041964089416342845, "loss": 4.9847, "mean_token_accuracy": 0.20294328182935714, "num_tokens": 63192820.0, "step": 36420 }, { "entropy": 5.73057746887207, "epoch": 2.834001167088115, "grad_norm": 1.2734375, "learning_rate": 0.0004196196631085308, "loss": 4.9337, "mean_token_accuracy": 0.20626851171255112, "num_tokens": 63201140.0, "step": 36425 }, { "entropy": 5.662766361236573, "epoch": 2.834390196459833, "grad_norm": 1.2890625, "learning_rate": 0.00041959842985925987, "loss": 4.8914, "mean_token_accuracy": 0.2086496114730835, "num_tokens": 63210036.0, "step": 36430 }, { "entropy": 5.76242733001709, "epoch": 2.83477922583155, "grad_norm": 1.3046875, "learning_rate": 0.000419577194415938, "loss": 5.0216, "mean_token_accuracy": 0.20027022957801818, "num_tokens": 63219318.0, "step": 36435 }, { "entropy": 5.853606271743774, "epoch": 2.8351682552032678, "grad_norm": 1.328125, "learning_rate": 0.00041955595677888735, "loss": 5.0789, "mean_token_accuracy": 0.20167972296476364, "num_tokens": 63228343.0, "step": 36440 }, { "entropy": 5.7254638671875, "epoch": 2.8355572845749855, "grad_norm": 1.203125, "learning_rate": 0.0004195347169484301, "loss": 4.9326, "mean_token_accuracy": 0.21235917657613754, "num_tokens": 63237365.0, "step": 36445 }, { "entropy": 5.658693838119507, "epoch": 2.835946313946703, "grad_norm": 1.34375, "learning_rate": 0.0004195134749248886, "loss": 4.8399, "mean_token_accuracy": 0.20872615575790404, "num_tokens": 63245706.0, "step": 36450 }, { "entropy": 5.730026388168335, "epoch": 2.8363353433184204, "grad_norm": 1.265625, "learning_rate": 0.0004194922307085851, "loss": 4.982, "mean_token_accuracy": 0.20654136538505555, "num_tokens": 63254487.0, "step": 36455 }, { "entropy": 5.760679006576538, "epoch": 2.836724372690138, "grad_norm": 1.2109375, "learning_rate": 0.0004194709842998419, "loss": 5.0382, "mean_token_accuracy": 0.2080386370420456, "num_tokens": 63263196.0, "step": 36460 }, { "entropy": 5.744549036026001, "epoch": 2.837113402061856, "grad_norm": 1.171875, "learning_rate": 0.00041944973569898157, "loss": 4.9555, "mean_token_accuracy": 0.21010482013225557, "num_tokens": 63271812.0, "step": 36465 }, { "entropy": 5.680595779418946, "epoch": 2.837502431433573, "grad_norm": 1.296875, "learning_rate": 0.0004194284849063265, "loss": 4.9635, "mean_token_accuracy": 0.2081234112381935, "num_tokens": 63280423.0, "step": 36470 }, { "entropy": 5.695953369140625, "epoch": 2.8378914608052908, "grad_norm": 1.1796875, "learning_rate": 0.0004194072319221989, "loss": 4.9967, "mean_token_accuracy": 0.20743531435728074, "num_tokens": 63289565.0, "step": 36475 }, { "entropy": 5.777735948562622, "epoch": 2.8382804901770085, "grad_norm": 1.1640625, "learning_rate": 0.0004193859767469214, "loss": 5.0094, "mean_token_accuracy": 0.2080550014972687, "num_tokens": 63298542.0, "step": 36480 }, { "entropy": 5.75899658203125, "epoch": 2.838669519548726, "grad_norm": 1.2109375, "learning_rate": 0.00041936471938081667, "loss": 5.037, "mean_token_accuracy": 0.20003886818885802, "num_tokens": 63307541.0, "step": 36485 }, { "entropy": 5.690267181396484, "epoch": 2.8390585489204434, "grad_norm": 1.203125, "learning_rate": 0.00041934345982420695, "loss": 4.9408, "mean_token_accuracy": 0.20870667248964309, "num_tokens": 63316470.0, "step": 36490 }, { "entropy": 5.74273362159729, "epoch": 2.839447578292161, "grad_norm": 1.21875, "learning_rate": 0.000419322198077415, "loss": 4.9187, "mean_token_accuracy": 0.21208949089050294, "num_tokens": 63325458.0, "step": 36495 }, { "entropy": 5.657659482955933, "epoch": 2.8398366076638784, "grad_norm": 1.1796875, "learning_rate": 0.00041930093414076344, "loss": 4.9243, "mean_token_accuracy": 0.21417147070169448, "num_tokens": 63334287.0, "step": 36500 }, { "entropy": 5.693455219268799, "epoch": 2.840225637035596, "grad_norm": 1.3125, "learning_rate": 0.00041927966801457486, "loss": 4.9003, "mean_token_accuracy": 0.21681063622236252, "num_tokens": 63342980.0, "step": 36505 }, { "entropy": 5.7105707168579105, "epoch": 2.8406146664073137, "grad_norm": 1.3359375, "learning_rate": 0.000419258399699172, "loss": 4.9181, "mean_token_accuracy": 0.21078926473855972, "num_tokens": 63351479.0, "step": 36510 }, { "entropy": 5.708147573471069, "epoch": 2.8410036957790314, "grad_norm": 1.171875, "learning_rate": 0.0004192371291948775, "loss": 4.9534, "mean_token_accuracy": 0.20328305214643477, "num_tokens": 63360010.0, "step": 36515 }, { "entropy": 5.74080605506897, "epoch": 2.841392725150749, "grad_norm": 1.296875, "learning_rate": 0.00041921585650201413, "loss": 5.0259, "mean_token_accuracy": 0.19890889823436736, "num_tokens": 63369522.0, "step": 36520 }, { "entropy": 5.8027712345123295, "epoch": 2.8417817545224664, "grad_norm": 1.2109375, "learning_rate": 0.0004191945816209047, "loss": 5.0468, "mean_token_accuracy": 0.20152828395366668, "num_tokens": 63379365.0, "step": 36525 }, { "entropy": 5.754071569442749, "epoch": 2.842170783894184, "grad_norm": 1.28125, "learning_rate": 0.00041917330455187195, "loss": 4.9727, "mean_token_accuracy": 0.21570038050413132, "num_tokens": 63387837.0, "step": 36530 }, { "entropy": 5.652082347869873, "epoch": 2.8425598132659013, "grad_norm": 1.265625, "learning_rate": 0.00041915202529523894, "loss": 4.9083, "mean_token_accuracy": 0.21188283264636992, "num_tokens": 63396583.0, "step": 36535 }, { "entropy": 5.7183265209198, "epoch": 2.842948842637619, "grad_norm": 1.2734375, "learning_rate": 0.0004191307438513283, "loss": 4.9582, "mean_token_accuracy": 0.2099013641476631, "num_tokens": 63405542.0, "step": 36540 }, { "entropy": 5.784355211257934, "epoch": 2.8433378720093367, "grad_norm": 1.3125, "learning_rate": 0.000419109460220463, "loss": 5.0266, "mean_token_accuracy": 0.20915253460407257, "num_tokens": 63414482.0, "step": 36545 }, { "entropy": 5.6849198818206785, "epoch": 2.8437269013810544, "grad_norm": 1.1953125, "learning_rate": 0.00041908817440296605, "loss": 4.9349, "mean_token_accuracy": 0.21275498420000077, "num_tokens": 63423928.0, "step": 36550 }, { "entropy": 5.705389785766601, "epoch": 2.8441159307527717, "grad_norm": 1.3046875, "learning_rate": 0.00041906688639916035, "loss": 4.9821, "mean_token_accuracy": 0.20450742691755294, "num_tokens": 63432186.0, "step": 36555 }, { "entropy": 5.640087652206421, "epoch": 2.8445049601244894, "grad_norm": 1.3828125, "learning_rate": 0.0004190455962093689, "loss": 4.8586, "mean_token_accuracy": 0.22283801734447478, "num_tokens": 63439630.0, "step": 36560 }, { "entropy": 5.6778799533844, "epoch": 2.844893989496207, "grad_norm": 1.234375, "learning_rate": 0.00041902430383391494, "loss": 4.9742, "mean_token_accuracy": 0.21052723228931428, "num_tokens": 63448121.0, "step": 36565 }, { "entropy": 5.6989398956298825, "epoch": 2.8452830188679243, "grad_norm": 1.28125, "learning_rate": 0.0004190030092731214, "loss": 4.8142, "mean_token_accuracy": 0.2197665184736252, "num_tokens": 63455937.0, "step": 36570 }, { "entropy": 5.677034711837768, "epoch": 2.845672048239642, "grad_norm": 1.203125, "learning_rate": 0.0004189817125273113, "loss": 5.0105, "mean_token_accuracy": 0.20383487939834594, "num_tokens": 63464851.0, "step": 36575 }, { "entropy": 5.704415225982666, "epoch": 2.8460610776113597, "grad_norm": 1.3203125, "learning_rate": 0.00041896041359680797, "loss": 4.9104, "mean_token_accuracy": 0.21304958760738374, "num_tokens": 63473535.0, "step": 36580 }, { "entropy": 5.760348224639893, "epoch": 2.8464501069830774, "grad_norm": 1.1953125, "learning_rate": 0.00041893911248193437, "loss": 5.0418, "mean_token_accuracy": 0.20645393133163453, "num_tokens": 63482755.0, "step": 36585 }, { "entropy": 5.704601144790649, "epoch": 2.8468391363547947, "grad_norm": 1.21875, "learning_rate": 0.000418917809183014, "loss": 4.9418, "mean_token_accuracy": 0.21195828467607497, "num_tokens": 63491481.0, "step": 36590 }, { "entropy": 5.754874897003174, "epoch": 2.8472281657265124, "grad_norm": 1.1328125, "learning_rate": 0.00041889650370036986, "loss": 4.9953, "mean_token_accuracy": 0.20547961741685866, "num_tokens": 63500876.0, "step": 36595 }, { "entropy": 5.743144273757935, "epoch": 2.84761719509823, "grad_norm": 1.2421875, "learning_rate": 0.0004188751960343253, "loss": 4.9757, "mean_token_accuracy": 0.21147698312997817, "num_tokens": 63508119.0, "step": 36600 }, { "entropy": 5.787603521347046, "epoch": 2.8480062244699473, "grad_norm": 1.3203125, "learning_rate": 0.0004188538861852037, "loss": 5.0782, "mean_token_accuracy": 0.20377288907766342, "num_tokens": 63516078.0, "step": 36605 }, { "entropy": 5.736608552932739, "epoch": 2.848395253841665, "grad_norm": 1.234375, "learning_rate": 0.0004188325741533283, "loss": 5.0347, "mean_token_accuracy": 0.20324206799268724, "num_tokens": 63524687.0, "step": 36610 }, { "entropy": 5.728704929351807, "epoch": 2.8487842832133827, "grad_norm": 1.1953125, "learning_rate": 0.0004188112599390225, "loss": 5.0595, "mean_token_accuracy": 0.19933152496814727, "num_tokens": 63534496.0, "step": 36615 }, { "entropy": 5.761440134048462, "epoch": 2.8491733125851004, "grad_norm": 1.21875, "learning_rate": 0.0004187899435426098, "loss": 4.9866, "mean_token_accuracy": 0.21075938194990157, "num_tokens": 63542890.0, "step": 36620 }, { "entropy": 5.856949710845948, "epoch": 2.8495623419568177, "grad_norm": 1.3203125, "learning_rate": 0.00041876862496441347, "loss": 4.9997, "mean_token_accuracy": 0.20125951766967773, "num_tokens": 63550942.0, "step": 36625 }, { "entropy": 5.76570234298706, "epoch": 2.8499513713285354, "grad_norm": 1.2421875, "learning_rate": 0.00041874730420475716, "loss": 5.0691, "mean_token_accuracy": 0.19709621369838715, "num_tokens": 63559077.0, "step": 36630 }, { "entropy": 5.701242113113404, "epoch": 2.8503404007002526, "grad_norm": 1.234375, "learning_rate": 0.00041872598126396434, "loss": 4.9915, "mean_token_accuracy": 0.2118488684296608, "num_tokens": 63567837.0, "step": 36635 }, { "entropy": 5.715847158432007, "epoch": 2.8507294300719703, "grad_norm": 1.1640625, "learning_rate": 0.00041870465614235843, "loss": 4.8609, "mean_token_accuracy": 0.20970326513051987, "num_tokens": 63576688.0, "step": 36640 }, { "entropy": 5.702781295776367, "epoch": 2.851118459443688, "grad_norm": 1.3125, "learning_rate": 0.00041868332884026317, "loss": 4.9503, "mean_token_accuracy": 0.2198580250144005, "num_tokens": 63585027.0, "step": 36645 }, { "entropy": 5.733483409881591, "epoch": 2.8515074888154057, "grad_norm": 1.1953125, "learning_rate": 0.0004186619993580021, "loss": 5.0045, "mean_token_accuracy": 0.20151478052139282, "num_tokens": 63594560.0, "step": 36650 }, { "entropy": 5.725176858901977, "epoch": 2.851896518187123, "grad_norm": 1.2578125, "learning_rate": 0.00041864066769589875, "loss": 5.0097, "mean_token_accuracy": 0.20282082259655, "num_tokens": 63603301.0, "step": 36655 }, { "entropy": 5.761955881118775, "epoch": 2.8522855475588407, "grad_norm": 1.2890625, "learning_rate": 0.00041861933385427697, "loss": 5.0278, "mean_token_accuracy": 0.20372612476348878, "num_tokens": 63612310.0, "step": 36660 }, { "entropy": 5.776137018203736, "epoch": 2.8526745769305584, "grad_norm": 1.203125, "learning_rate": 0.0004185979978334604, "loss": 5.0795, "mean_token_accuracy": 0.20261527895927428, "num_tokens": 63620736.0, "step": 36665 }, { "entropy": 5.7731468200683596, "epoch": 2.8530636063022756, "grad_norm": 1.2734375, "learning_rate": 0.0004185766596337727, "loss": 5.0193, "mean_token_accuracy": 0.19952816069126128, "num_tokens": 63629182.0, "step": 36670 }, { "entropy": 5.712402439117431, "epoch": 2.8534526356739933, "grad_norm": 1.1171875, "learning_rate": 0.00041855531925553773, "loss": 4.875, "mean_token_accuracy": 0.2137434408068657, "num_tokens": 63638197.0, "step": 36675 }, { "entropy": 5.7052281379699705, "epoch": 2.853841665045711, "grad_norm": 1.2890625, "learning_rate": 0.0004185339766990794, "loss": 5.0477, "mean_token_accuracy": 0.20401182025671005, "num_tokens": 63647461.0, "step": 36680 }, { "entropy": 5.689260625839234, "epoch": 2.8542306944174287, "grad_norm": 1.3125, "learning_rate": 0.0004185126319647213, "loss": 4.9935, "mean_token_accuracy": 0.2039366379380226, "num_tokens": 63655402.0, "step": 36685 }, { "entropy": 5.74499626159668, "epoch": 2.854619723789146, "grad_norm": 1.171875, "learning_rate": 0.0004184912850527875, "loss": 4.9301, "mean_token_accuracy": 0.21402277499437333, "num_tokens": 63663650.0, "step": 36690 }, { "entropy": 5.73839430809021, "epoch": 2.8550087531608637, "grad_norm": 1.2578125, "learning_rate": 0.0004184699359636018, "loss": 4.9412, "mean_token_accuracy": 0.20440115928649902, "num_tokens": 63672403.0, "step": 36695 }, { "entropy": 5.697465991973877, "epoch": 2.8553977825325814, "grad_norm": 1.203125, "learning_rate": 0.0004184485846974882, "loss": 4.879, "mean_token_accuracy": 0.21389620304107665, "num_tokens": 63681669.0, "step": 36700 }, { "entropy": 5.725019121170044, "epoch": 2.8557868119042986, "grad_norm": 1.296875, "learning_rate": 0.0004184272312547706, "loss": 4.9337, "mean_token_accuracy": 0.20902230441570283, "num_tokens": 63690190.0, "step": 36705 }, { "entropy": 5.722491216659546, "epoch": 2.8561758412760163, "grad_norm": 1.1796875, "learning_rate": 0.00041840587563577315, "loss": 4.9845, "mean_token_accuracy": 0.2070932000875473, "num_tokens": 63699389.0, "step": 36710 }, { "entropy": 5.758575105667115, "epoch": 2.856564870647734, "grad_norm": 1.25, "learning_rate": 0.0004183845178408197, "loss": 4.9839, "mean_token_accuracy": 0.20925637781620027, "num_tokens": 63708314.0, "step": 36715 }, { "entropy": 5.669419670104981, "epoch": 2.8569539000194517, "grad_norm": 1.359375, "learning_rate": 0.00041836315787023456, "loss": 4.8541, "mean_token_accuracy": 0.2185925707221031, "num_tokens": 63716732.0, "step": 36720 }, { "entropy": 5.627235031127929, "epoch": 2.857342929391169, "grad_norm": 1.25, "learning_rate": 0.00041834179572434153, "loss": 4.9341, "mean_token_accuracy": 0.2085905358195305, "num_tokens": 63725143.0, "step": 36725 }, { "entropy": 5.666985368728637, "epoch": 2.8577319587628867, "grad_norm": 1.2109375, "learning_rate": 0.00041832043140346495, "loss": 4.8924, "mean_token_accuracy": 0.21844515204429626, "num_tokens": 63732534.0, "step": 36730 }, { "entropy": 5.779353380203247, "epoch": 2.858120988134604, "grad_norm": 1.203125, "learning_rate": 0.0004182990649079289, "loss": 4.9744, "mean_token_accuracy": 0.20122582018375396, "num_tokens": 63740540.0, "step": 36735 }, { "entropy": 5.726066732406617, "epoch": 2.8585100175063216, "grad_norm": 1.2734375, "learning_rate": 0.0004182776962380577, "loss": 5.0922, "mean_token_accuracy": 0.1952139765024185, "num_tokens": 63749364.0, "step": 36740 }, { "entropy": 5.734862899780273, "epoch": 2.8588990468780393, "grad_norm": 1.2734375, "learning_rate": 0.00041825632539417546, "loss": 4.9768, "mean_token_accuracy": 0.20269803553819657, "num_tokens": 63758309.0, "step": 36745 }, { "entropy": 5.755665588378906, "epoch": 2.859288076249757, "grad_norm": 1.2109375, "learning_rate": 0.0004182349523766065, "loss": 4.9514, "mean_token_accuracy": 0.2120609849691391, "num_tokens": 63766882.0, "step": 36750 }, { "entropy": 5.683825206756592, "epoch": 2.8596771056214743, "grad_norm": 1.1796875, "learning_rate": 0.00041821357718567514, "loss": 4.9476, "mean_token_accuracy": 0.21510414630174637, "num_tokens": 63775108.0, "step": 36755 }, { "entropy": 5.6861590385437015, "epoch": 2.860066134993192, "grad_norm": 1.2578125, "learning_rate": 0.0004181921998217057, "loss": 4.9336, "mean_token_accuracy": 0.20744120180606843, "num_tokens": 63783674.0, "step": 36760 }, { "entropy": 5.729680061340332, "epoch": 2.8604551643649097, "grad_norm": 1.1875, "learning_rate": 0.0004181708202850225, "loss": 5.085, "mean_token_accuracy": 0.20357842296361922, "num_tokens": 63793068.0, "step": 36765 }, { "entropy": 5.675493001937866, "epoch": 2.860844193736627, "grad_norm": 1.25, "learning_rate": 0.00041814943857595, "loss": 4.9312, "mean_token_accuracy": 0.21113720387220383, "num_tokens": 63801845.0, "step": 36770 }, { "entropy": 5.7200864315032955, "epoch": 2.8612332231083446, "grad_norm": 1.25, "learning_rate": 0.0004181280546948127, "loss": 5.0385, "mean_token_accuracy": 0.20181134343147278, "num_tokens": 63810107.0, "step": 36775 }, { "entropy": 5.670366382598877, "epoch": 2.8616222524800623, "grad_norm": 1.25, "learning_rate": 0.0004181066686419349, "loss": 4.8998, "mean_token_accuracy": 0.20974615812301636, "num_tokens": 63818420.0, "step": 36780 }, { "entropy": 5.713176679611206, "epoch": 2.86201128185178, "grad_norm": 1.3203125, "learning_rate": 0.00041808528041764115, "loss": 4.9167, "mean_token_accuracy": 0.2074020028114319, "num_tokens": 63826947.0, "step": 36785 }, { "entropy": 5.67804799079895, "epoch": 2.8624003112234973, "grad_norm": 1.1875, "learning_rate": 0.0004180638900222561, "loss": 4.934, "mean_token_accuracy": 0.21596689373254777, "num_tokens": 63835483.0, "step": 36790 }, { "entropy": 5.639019918441773, "epoch": 2.862789340595215, "grad_norm": 1.265625, "learning_rate": 0.0004180424974561042, "loss": 4.8805, "mean_token_accuracy": 0.2096621200442314, "num_tokens": 63843983.0, "step": 36795 }, { "entropy": 5.73206901550293, "epoch": 2.8631783699669326, "grad_norm": 1.265625, "learning_rate": 0.00041802110271951, "loss": 4.9501, "mean_token_accuracy": 0.21251205056905748, "num_tokens": 63852478.0, "step": 36800 }, { "entropy": 5.758202600479126, "epoch": 2.86356739933865, "grad_norm": 1.3046875, "learning_rate": 0.0004179997058127983, "loss": 5.0216, "mean_token_accuracy": 0.20636558532714844, "num_tokens": 63860684.0, "step": 36805 }, { "entropy": 5.729201030731201, "epoch": 2.8639564287103676, "grad_norm": 1.2578125, "learning_rate": 0.0004179783067362936, "loss": 4.9509, "mean_token_accuracy": 0.2049630403518677, "num_tokens": 63869033.0, "step": 36810 }, { "entropy": 5.751136302947998, "epoch": 2.8643454580820853, "grad_norm": 1.1875, "learning_rate": 0.0004179569054903207, "loss": 4.9562, "mean_token_accuracy": 0.2036151483654976, "num_tokens": 63877645.0, "step": 36815 }, { "entropy": 5.741723918914795, "epoch": 2.864734487453803, "grad_norm": 1.3046875, "learning_rate": 0.00041793550207520436, "loss": 4.9606, "mean_token_accuracy": 0.21337577253580092, "num_tokens": 63886168.0, "step": 36820 }, { "entropy": 5.705454874038696, "epoch": 2.8651235168255202, "grad_norm": 1.1640625, "learning_rate": 0.0004179140964912692, "loss": 4.9876, "mean_token_accuracy": 0.20757579058408737, "num_tokens": 63895110.0, "step": 36825 }, { "entropy": 5.746557235717773, "epoch": 2.865512546197238, "grad_norm": 1.25, "learning_rate": 0.0004178926887388401, "loss": 4.9314, "mean_token_accuracy": 0.20682869404554366, "num_tokens": 63903002.0, "step": 36830 }, { "entropy": 5.698002052307129, "epoch": 2.865901575568955, "grad_norm": 1.2890625, "learning_rate": 0.00041787127881824193, "loss": 4.9293, "mean_token_accuracy": 0.2142242893576622, "num_tokens": 63911011.0, "step": 36835 }, { "entropy": 5.70913987159729, "epoch": 2.866290604940673, "grad_norm": 1.2578125, "learning_rate": 0.00041784986672979945, "loss": 5.0031, "mean_token_accuracy": 0.20738430172204972, "num_tokens": 63919667.0, "step": 36840 }, { "entropy": 5.733752107620239, "epoch": 2.8666796343123906, "grad_norm": 1.1171875, "learning_rate": 0.00041782845247383767, "loss": 4.959, "mean_token_accuracy": 0.2086784988641739, "num_tokens": 63929445.0, "step": 36845 }, { "entropy": 5.738183450698853, "epoch": 2.8670686636841083, "grad_norm": 1.21875, "learning_rate": 0.00041780703605068145, "loss": 4.9304, "mean_token_accuracy": 0.2168579801917076, "num_tokens": 63937730.0, "step": 36850 }, { "entropy": 5.706082773208618, "epoch": 2.867457693055826, "grad_norm": 1.203125, "learning_rate": 0.0004177856174606558, "loss": 4.9309, "mean_token_accuracy": 0.21206885129213332, "num_tokens": 63945877.0, "step": 36855 }, { "entropy": 5.743387174606323, "epoch": 2.8678467224275432, "grad_norm": 1.3125, "learning_rate": 0.0004177641967040856, "loss": 5.0112, "mean_token_accuracy": 0.2078859806060791, "num_tokens": 63953861.0, "step": 36860 }, { "entropy": 5.726610088348389, "epoch": 2.868235751799261, "grad_norm": 1.1953125, "learning_rate": 0.00041774277378129595, "loss": 4.9715, "mean_token_accuracy": 0.2078307017683983, "num_tokens": 63962622.0, "step": 36865 }, { "entropy": 5.778795194625855, "epoch": 2.868624781170978, "grad_norm": 1.3203125, "learning_rate": 0.00041772134869261186, "loss": 5.0226, "mean_token_accuracy": 0.2049886092543602, "num_tokens": 63971100.0, "step": 36870 }, { "entropy": 5.644616508483887, "epoch": 2.869013810542696, "grad_norm": 1.171875, "learning_rate": 0.0004176999214383585, "loss": 4.9364, "mean_token_accuracy": 0.2086598828434944, "num_tokens": 63979763.0, "step": 36875 }, { "entropy": 5.682045221328735, "epoch": 2.8694028399144136, "grad_norm": 1.3828125, "learning_rate": 0.00041767849201886103, "loss": 4.9199, "mean_token_accuracy": 0.21428375393152238, "num_tokens": 63988383.0, "step": 36880 }, { "entropy": 5.6884088039398195, "epoch": 2.8697918692861313, "grad_norm": 1.21875, "learning_rate": 0.0004176570604344445, "loss": 5.0185, "mean_token_accuracy": 0.20352015793323516, "num_tokens": 63996578.0, "step": 36885 }, { "entropy": 5.671725559234619, "epoch": 2.8701808986578485, "grad_norm": 1.3046875, "learning_rate": 0.00041763562668543415, "loss": 4.8808, "mean_token_accuracy": 0.21336551904678344, "num_tokens": 64004755.0, "step": 36890 }, { "entropy": 5.677460145950318, "epoch": 2.8705699280295662, "grad_norm": 1.1953125, "learning_rate": 0.0004176141907721552, "loss": 5.0013, "mean_token_accuracy": 0.20429760813713074, "num_tokens": 64013937.0, "step": 36895 }, { "entropy": 5.802621793746948, "epoch": 2.870958957401284, "grad_norm": 1.4375, "learning_rate": 0.0004175927526949329, "loss": 5.0725, "mean_token_accuracy": 0.20770859569311143, "num_tokens": 64022464.0, "step": 36900 }, { "entropy": 5.817018508911133, "epoch": 2.871347986773001, "grad_norm": 1.3203125, "learning_rate": 0.0004175713124540925, "loss": 5.0244, "mean_token_accuracy": 0.20416144877672196, "num_tokens": 64031023.0, "step": 36905 }, { "entropy": 5.814526224136353, "epoch": 2.871737016144719, "grad_norm": 1.2421875, "learning_rate": 0.00041754987004995935, "loss": 5.0224, "mean_token_accuracy": 0.20754458457231523, "num_tokens": 64039740.0, "step": 36910 }, { "entropy": 5.7939453125, "epoch": 2.8721260455164366, "grad_norm": 1.2578125, "learning_rate": 0.00041752842548285887, "loss": 4.9691, "mean_token_accuracy": 0.20747753381729125, "num_tokens": 64048638.0, "step": 36915 }, { "entropy": 5.7803596496582035, "epoch": 2.8725150748881543, "grad_norm": 1.203125, "learning_rate": 0.0004175069787531163, "loss": 4.9969, "mean_token_accuracy": 0.20558423846960067, "num_tokens": 64058068.0, "step": 36920 }, { "entropy": 5.723847818374634, "epoch": 2.8729041042598715, "grad_norm": 1.296875, "learning_rate": 0.00041748552986105726, "loss": 4.9456, "mean_token_accuracy": 0.2158821403980255, "num_tokens": 64066881.0, "step": 36925 }, { "entropy": 5.829465436935425, "epoch": 2.8732931336315892, "grad_norm": 1.28125, "learning_rate": 0.000417464078807007, "loss": 5.0641, "mean_token_accuracy": 0.19796052724123, "num_tokens": 64076020.0, "step": 36930 }, { "entropy": 5.722281551361084, "epoch": 2.8736821630033065, "grad_norm": 1.3046875, "learning_rate": 0.0004174426255912912, "loss": 4.8519, "mean_token_accuracy": 0.21289380490779877, "num_tokens": 64083940.0, "step": 36935 }, { "entropy": 5.731930494308472, "epoch": 2.874071192375024, "grad_norm": 1.3203125, "learning_rate": 0.0004174211702142352, "loss": 5.0137, "mean_token_accuracy": 0.208070370554924, "num_tokens": 64091385.0, "step": 36940 }, { "entropy": 5.665528917312622, "epoch": 2.874460221746742, "grad_norm": 1.265625, "learning_rate": 0.00041739971267616466, "loss": 4.9295, "mean_token_accuracy": 0.20756968706846238, "num_tokens": 64099797.0, "step": 36945 }, { "entropy": 5.797987031936645, "epoch": 2.8748492511184596, "grad_norm": 1.2578125, "learning_rate": 0.0004173782529774051, "loss": 5.0618, "mean_token_accuracy": 0.20333696603775026, "num_tokens": 64107790.0, "step": 36950 }, { "entropy": 5.754706525802613, "epoch": 2.8752382804901773, "grad_norm": 1.3671875, "learning_rate": 0.00041735679111828223, "loss": 4.8864, "mean_token_accuracy": 0.21378969252109528, "num_tokens": 64115090.0, "step": 36955 }, { "entropy": 5.654418325424194, "epoch": 2.8756273098618945, "grad_norm": 1.2265625, "learning_rate": 0.00041733532709912157, "loss": 4.9294, "mean_token_accuracy": 0.2107856512069702, "num_tokens": 64124039.0, "step": 36960 }, { "entropy": 5.71700758934021, "epoch": 2.876016339233612, "grad_norm": 1.296875, "learning_rate": 0.00041731386092024893, "loss": 4.9352, "mean_token_accuracy": 0.20919185280799865, "num_tokens": 64132343.0, "step": 36965 }, { "entropy": 5.7032561779022215, "epoch": 2.8764053686053295, "grad_norm": 1.1953125, "learning_rate": 0.00041729239258198996, "loss": 4.8725, "mean_token_accuracy": 0.21915805339813232, "num_tokens": 64140742.0, "step": 36970 }, { "entropy": 5.771155309677124, "epoch": 2.876794397977047, "grad_norm": 1.3671875, "learning_rate": 0.00041727092208467036, "loss": 5.0528, "mean_token_accuracy": 0.21050880402326583, "num_tokens": 64148822.0, "step": 36975 }, { "entropy": 5.705517673492432, "epoch": 2.877183427348765, "grad_norm": 1.2890625, "learning_rate": 0.00041724944942861603, "loss": 4.9091, "mean_token_accuracy": 0.21073877364397048, "num_tokens": 64157724.0, "step": 36980 }, { "entropy": 5.708099842071533, "epoch": 2.8775724567204826, "grad_norm": 1.3359375, "learning_rate": 0.00041722797461415267, "loss": 4.9473, "mean_token_accuracy": 0.20981355905532836, "num_tokens": 64165895.0, "step": 36985 }, { "entropy": 5.744191312789917, "epoch": 2.8779614860922, "grad_norm": 1.2734375, "learning_rate": 0.0004172064976416062, "loss": 4.9189, "mean_token_accuracy": 0.2090353786945343, "num_tokens": 64174015.0, "step": 36990 }, { "entropy": 5.660231018066407, "epoch": 2.8783505154639175, "grad_norm": 1.2265625, "learning_rate": 0.0004171850185113024, "loss": 4.8677, "mean_token_accuracy": 0.21418857872486113, "num_tokens": 64182560.0, "step": 36995 }, { "entropy": 5.73729100227356, "epoch": 2.878739544835635, "grad_norm": 1.25, "learning_rate": 0.00041716353722356735, "loss": 5.0096, "mean_token_accuracy": 0.20412824898958207, "num_tokens": 64190999.0, "step": 37000 }, { "entropy": 5.7428975105285645, "epoch": 2.8791285742073525, "grad_norm": 1.203125, "learning_rate": 0.0004171420537787269, "loss": 5.0051, "mean_token_accuracy": 0.19977980405092238, "num_tokens": 64200073.0, "step": 37005 }, { "entropy": 5.804224061965942, "epoch": 2.87951760357907, "grad_norm": 1.265625, "learning_rate": 0.00041712056817710697, "loss": 5.0151, "mean_token_accuracy": 0.21008194386959075, "num_tokens": 64208079.0, "step": 37010 }, { "entropy": 5.725548791885376, "epoch": 2.879906632950788, "grad_norm": 1.265625, "learning_rate": 0.0004170990804190337, "loss": 4.9592, "mean_token_accuracy": 0.20500696897506715, "num_tokens": 64216321.0, "step": 37015 }, { "entropy": 5.817561388015747, "epoch": 2.8802956623225056, "grad_norm": 1.2265625, "learning_rate": 0.00041707759050483304, "loss": 5.0888, "mean_token_accuracy": 0.20466277450323106, "num_tokens": 64224804.0, "step": 37020 }, { "entropy": 5.801752805709839, "epoch": 2.880684691694223, "grad_norm": 1.1796875, "learning_rate": 0.000417056098434831, "loss": 5.0227, "mean_token_accuracy": 0.20028270334005355, "num_tokens": 64234022.0, "step": 37025 }, { "entropy": 5.742588806152344, "epoch": 2.8810737210659405, "grad_norm": 1.3125, "learning_rate": 0.0004170346042093538, "loss": 4.9361, "mean_token_accuracy": 0.20720379054546356, "num_tokens": 64241913.0, "step": 37030 }, { "entropy": 5.765771102905274, "epoch": 2.881462750437658, "grad_norm": 1.28125, "learning_rate": 0.0004170131078287276, "loss": 5.0332, "mean_token_accuracy": 0.21175179183483123, "num_tokens": 64249494.0, "step": 37035 }, { "entropy": 5.709988403320312, "epoch": 2.8818517798093755, "grad_norm": 1.296875, "learning_rate": 0.0004169916092932785, "loss": 4.9926, "mean_token_accuracy": 0.20719997137784957, "num_tokens": 64257540.0, "step": 37040 }, { "entropy": 5.702971124649048, "epoch": 2.882240809181093, "grad_norm": 1.15625, "learning_rate": 0.0004169701086033327, "loss": 4.8613, "mean_token_accuracy": 0.2179891437292099, "num_tokens": 64266583.0, "step": 37045 }, { "entropy": 5.710389232635498, "epoch": 2.882629838552811, "grad_norm": 1.171875, "learning_rate": 0.00041694860575921654, "loss": 4.946, "mean_token_accuracy": 0.2072391539812088, "num_tokens": 64275313.0, "step": 37050 }, { "entropy": 5.80691237449646, "epoch": 2.8830188679245285, "grad_norm": 1.1796875, "learning_rate": 0.00041692710076125615, "loss": 5.1159, "mean_token_accuracy": 0.20386543571949006, "num_tokens": 64284160.0, "step": 37055 }, { "entropy": 5.688087701797485, "epoch": 2.883407897296246, "grad_norm": 1.1640625, "learning_rate": 0.000416905593609778, "loss": 4.9247, "mean_token_accuracy": 0.2115530326962471, "num_tokens": 64293010.0, "step": 37060 }, { "entropy": 5.726702356338501, "epoch": 2.8837969266679635, "grad_norm": 1.3984375, "learning_rate": 0.00041688408430510827, "loss": 5.019, "mean_token_accuracy": 0.19847943186759948, "num_tokens": 64301728.0, "step": 37065 }, { "entropy": 5.748627710342407, "epoch": 2.8841859560396808, "grad_norm": 1.25, "learning_rate": 0.0004168625728475734, "loss": 4.9891, "mean_token_accuracy": 0.21035687923431395, "num_tokens": 64310056.0, "step": 37070 }, { "entropy": 5.746639060974121, "epoch": 2.8845749854113985, "grad_norm": 1.2578125, "learning_rate": 0.00041684105923749977, "loss": 4.93, "mean_token_accuracy": 0.21742263287305832, "num_tokens": 64320016.0, "step": 37075 }, { "entropy": 5.71370677947998, "epoch": 2.884964014783116, "grad_norm": 1.328125, "learning_rate": 0.0004168195434752139, "loss": 4.886, "mean_token_accuracy": 0.20994980335235597, "num_tokens": 64327763.0, "step": 37080 }, { "entropy": 5.686677932739258, "epoch": 2.885353044154834, "grad_norm": 1.203125, "learning_rate": 0.00041679802556104207, "loss": 4.8897, "mean_token_accuracy": 0.21090674996376038, "num_tokens": 64336190.0, "step": 37085 }, { "entropy": 5.672700071334839, "epoch": 2.885742073526551, "grad_norm": 1.2734375, "learning_rate": 0.00041677650549531097, "loss": 4.9675, "mean_token_accuracy": 0.2125129446387291, "num_tokens": 64345329.0, "step": 37090 }, { "entropy": 5.75876088142395, "epoch": 2.886131102898269, "grad_norm": 1.21875, "learning_rate": 0.00041675498327834706, "loss": 4.9765, "mean_token_accuracy": 0.20023034065961837, "num_tokens": 64353272.0, "step": 37095 }, { "entropy": 5.760937929153442, "epoch": 2.8865201322699865, "grad_norm": 1.234375, "learning_rate": 0.00041673345891047686, "loss": 5.0096, "mean_token_accuracy": 0.19787791818380357, "num_tokens": 64361866.0, "step": 37100 }, { "entropy": 5.771781349182129, "epoch": 2.8869091616417037, "grad_norm": 1.3125, "learning_rate": 0.0004167119323920271, "loss": 5.0706, "mean_token_accuracy": 0.19937632232904434, "num_tokens": 64371294.0, "step": 37105 }, { "entropy": 5.7344911098480225, "epoch": 2.8872981910134214, "grad_norm": 1.25, "learning_rate": 0.0004166904037233243, "loss": 4.9647, "mean_token_accuracy": 0.21333439350128175, "num_tokens": 64379166.0, "step": 37110 }, { "entropy": 5.711657857894897, "epoch": 2.887687220385139, "grad_norm": 1.203125, "learning_rate": 0.00041666887290469506, "loss": 5.0276, "mean_token_accuracy": 0.20718881934881211, "num_tokens": 64389092.0, "step": 37115 }, { "entropy": 5.703644847869873, "epoch": 2.888076249756857, "grad_norm": 1.2421875, "learning_rate": 0.0004166473399364663, "loss": 4.8769, "mean_token_accuracy": 0.22060548812150954, "num_tokens": 64397423.0, "step": 37120 }, { "entropy": 5.764362335205078, "epoch": 2.888465279128574, "grad_norm": 1.28125, "learning_rate": 0.00041662580481896446, "loss": 5.0099, "mean_token_accuracy": 0.20971526801586152, "num_tokens": 64406291.0, "step": 37125 }, { "entropy": 5.703642320632935, "epoch": 2.888854308500292, "grad_norm": 1.2265625, "learning_rate": 0.0004166042675525165, "loss": 4.9961, "mean_token_accuracy": 0.20622216314077377, "num_tokens": 64414737.0, "step": 37130 }, { "entropy": 5.721449518203736, "epoch": 2.8892433378720095, "grad_norm": 1.234375, "learning_rate": 0.00041658272813744924, "loss": 4.9739, "mean_token_accuracy": 0.20735889077186584, "num_tokens": 64423737.0, "step": 37135 }, { "entropy": 5.786657905578613, "epoch": 2.8896323672437267, "grad_norm": 1.1328125, "learning_rate": 0.0004165611865740894, "loss": 5.0364, "mean_token_accuracy": 0.2021647334098816, "num_tokens": 64432295.0, "step": 37140 }, { "entropy": 5.851624059677124, "epoch": 2.8900213966154444, "grad_norm": 1.203125, "learning_rate": 0.0004165396428627638, "loss": 5.1035, "mean_token_accuracy": 0.20253732353448867, "num_tokens": 64441090.0, "step": 37145 }, { "entropy": 5.813965129852295, "epoch": 2.890410425987162, "grad_norm": 1.2734375, "learning_rate": 0.00041651809700379947, "loss": 4.9819, "mean_token_accuracy": 0.2010728284716606, "num_tokens": 64450186.0, "step": 37150 }, { "entropy": 5.71786904335022, "epoch": 2.89079945535888, "grad_norm": 1.3125, "learning_rate": 0.00041649654899752326, "loss": 4.9347, "mean_token_accuracy": 0.21107727140188218, "num_tokens": 64458519.0, "step": 37155 }, { "entropy": 5.656841897964478, "epoch": 2.891188484730597, "grad_norm": 1.1796875, "learning_rate": 0.0004164749988442621, "loss": 4.8943, "mean_token_accuracy": 0.2085729017853737, "num_tokens": 64467941.0, "step": 37160 }, { "entropy": 5.7249034404754635, "epoch": 2.891577514102315, "grad_norm": 1.3203125, "learning_rate": 0.000416453446544343, "loss": 4.9975, "mean_token_accuracy": 0.2036920368671417, "num_tokens": 64476811.0, "step": 37165 }, { "entropy": 5.759035205841064, "epoch": 2.891966543474032, "grad_norm": 1.1640625, "learning_rate": 0.0004164318920980931, "loss": 4.9733, "mean_token_accuracy": 0.21390917748212815, "num_tokens": 64485905.0, "step": 37170 }, { "entropy": 5.7777036190032955, "epoch": 2.8923555728457497, "grad_norm": 1.2578125, "learning_rate": 0.0004164103355058393, "loss": 5.0998, "mean_token_accuracy": 0.19965046942234038, "num_tokens": 64495157.0, "step": 37175 }, { "entropy": 5.721639823913574, "epoch": 2.8927446022174674, "grad_norm": 1.3515625, "learning_rate": 0.0004163887767679087, "loss": 4.912, "mean_token_accuracy": 0.21985400915145875, "num_tokens": 64503598.0, "step": 37180 }, { "entropy": 5.772041988372803, "epoch": 2.893133631589185, "grad_norm": 1.328125, "learning_rate": 0.0004163672158846285, "loss": 4.9398, "mean_token_accuracy": 0.20617058277130126, "num_tokens": 64511753.0, "step": 37185 }, { "entropy": 5.784866380691528, "epoch": 2.8935226609609024, "grad_norm": 1.328125, "learning_rate": 0.00041634565285632573, "loss": 5.0607, "mean_token_accuracy": 0.20023715645074844, "num_tokens": 64521011.0, "step": 37190 }, { "entropy": 5.756584596633911, "epoch": 2.89391169033262, "grad_norm": 1.3359375, "learning_rate": 0.00041632408768332776, "loss": 4.9842, "mean_token_accuracy": 0.2042479172348976, "num_tokens": 64529716.0, "step": 37195 }, { "entropy": 5.755605554580688, "epoch": 2.8943007197043378, "grad_norm": 1.34375, "learning_rate": 0.00041630252036596165, "loss": 4.9946, "mean_token_accuracy": 0.20901148468255998, "num_tokens": 64538673.0, "step": 37200 }, { "entropy": 5.694317817687988, "epoch": 2.894689749076055, "grad_norm": 1.15625, "learning_rate": 0.0004162809509045547, "loss": 4.9595, "mean_token_accuracy": 0.2105732575058937, "num_tokens": 64546399.0, "step": 37205 }, { "entropy": 5.749301195144653, "epoch": 2.8950787784477727, "grad_norm": 1.3515625, "learning_rate": 0.00041625937929943424, "loss": 5.0485, "mean_token_accuracy": 0.20357396006584166, "num_tokens": 64554412.0, "step": 37210 }, { "entropy": 5.7358551025390625, "epoch": 2.8954678078194904, "grad_norm": 1.3203125, "learning_rate": 0.00041623780555092747, "loss": 4.9092, "mean_token_accuracy": 0.2126569226384163, "num_tokens": 64562630.0, "step": 37215 }, { "entropy": 5.7939635753631595, "epoch": 2.895856837191208, "grad_norm": 1.234375, "learning_rate": 0.0004162162296593618, "loss": 5.1112, "mean_token_accuracy": 0.1941658228635788, "num_tokens": 64572492.0, "step": 37220 }, { "entropy": 5.73642897605896, "epoch": 2.8962458665629254, "grad_norm": 1.359375, "learning_rate": 0.00041619465162506466, "loss": 4.9693, "mean_token_accuracy": 0.211011666059494, "num_tokens": 64580964.0, "step": 37225 }, { "entropy": 5.7402819156646725, "epoch": 2.896634895934643, "grad_norm": 1.234375, "learning_rate": 0.0004161730714483633, "loss": 4.9381, "mean_token_accuracy": 0.2097105413675308, "num_tokens": 64589513.0, "step": 37230 }, { "entropy": 5.718275165557861, "epoch": 2.8970239253063608, "grad_norm": 1.3359375, "learning_rate": 0.0004161514891295854, "loss": 4.9943, "mean_token_accuracy": 0.20621182918548583, "num_tokens": 64597462.0, "step": 37235 }, { "entropy": 5.7098325252532955, "epoch": 2.897412954678078, "grad_norm": 1.3203125, "learning_rate": 0.00041612990466905825, "loss": 4.8834, "mean_token_accuracy": 0.2118037074804306, "num_tokens": 64604908.0, "step": 37240 }, { "entropy": 5.711767482757568, "epoch": 2.8978019840497957, "grad_norm": 1.21875, "learning_rate": 0.00041610831806710954, "loss": 4.9242, "mean_token_accuracy": 0.21341390311717987, "num_tokens": 64613983.0, "step": 37245 }, { "entropy": 5.668642330169678, "epoch": 2.8981910134215134, "grad_norm": 1.34375, "learning_rate": 0.00041608672932406666, "loss": 4.883, "mean_token_accuracy": 0.21553361117839814, "num_tokens": 64622620.0, "step": 37250 }, { "entropy": 5.756299734115601, "epoch": 2.898580042793231, "grad_norm": 1.21875, "learning_rate": 0.00041606513844025716, "loss": 4.9734, "mean_token_accuracy": 0.2071797162294388, "num_tokens": 64631204.0, "step": 37255 }, { "entropy": 5.72422423362732, "epoch": 2.8989690721649484, "grad_norm": 1.1953125, "learning_rate": 0.0004160435454160087, "loss": 4.9451, "mean_token_accuracy": 0.20564515590667726, "num_tokens": 64639904.0, "step": 37260 }, { "entropy": 5.768924236297607, "epoch": 2.899358101536666, "grad_norm": 1.3515625, "learning_rate": 0.000416021950251649, "loss": 5.0025, "mean_token_accuracy": 0.20210411846637727, "num_tokens": 64649011.0, "step": 37265 }, { "entropy": 5.719493865966797, "epoch": 2.8997471309083833, "grad_norm": 1.2421875, "learning_rate": 0.0004160003529475057, "loss": 4.9648, "mean_token_accuracy": 0.20151309072971343, "num_tokens": 64658174.0, "step": 37270 }, { "entropy": 5.722173118591309, "epoch": 2.900136160280101, "grad_norm": 1.203125, "learning_rate": 0.0004159787535039064, "loss": 4.9483, "mean_token_accuracy": 0.20730003118515014, "num_tokens": 64667301.0, "step": 37275 }, { "entropy": 5.793070363998413, "epoch": 2.9005251896518187, "grad_norm": 1.234375, "learning_rate": 0.0004159571519211789, "loss": 5.057, "mean_token_accuracy": 0.20257613360881804, "num_tokens": 64676087.0, "step": 37280 }, { "entropy": 5.77973575592041, "epoch": 2.9009142190235364, "grad_norm": 1.2421875, "learning_rate": 0.000415935548199651, "loss": 5.098, "mean_token_accuracy": 0.20026143491268159, "num_tokens": 64684990.0, "step": 37285 }, { "entropy": 5.889983367919922, "epoch": 2.901303248395254, "grad_norm": 1.3046875, "learning_rate": 0.0004159139423396504, "loss": 5.1194, "mean_token_accuracy": 0.1953114628791809, "num_tokens": 64693291.0, "step": 37290 }, { "entropy": 5.810815382003784, "epoch": 2.9016922777669714, "grad_norm": 1.2109375, "learning_rate": 0.0004158923343415051, "loss": 4.9997, "mean_token_accuracy": 0.2033628612756729, "num_tokens": 64701922.0, "step": 37295 }, { "entropy": 5.744422340393067, "epoch": 2.902081307138689, "grad_norm": 1.3046875, "learning_rate": 0.0004158707242055429, "loss": 5.0106, "mean_token_accuracy": 0.20656122863292695, "num_tokens": 64710782.0, "step": 37300 }, { "entropy": 5.817006635665893, "epoch": 2.9024703365104063, "grad_norm": 1.3046875, "learning_rate": 0.00041584911193209167, "loss": 5.0311, "mean_token_accuracy": 0.2097572147846222, "num_tokens": 64719285.0, "step": 37305 }, { "entropy": 5.752814102172851, "epoch": 2.902859365882124, "grad_norm": 1.25, "learning_rate": 0.0004158274975214794, "loss": 4.9534, "mean_token_accuracy": 0.2083319365978241, "num_tokens": 64727683.0, "step": 37310 }, { "entropy": 5.710377359390259, "epoch": 2.9032483952538417, "grad_norm": 1.3046875, "learning_rate": 0.00041580588097403384, "loss": 4.9469, "mean_token_accuracy": 0.20366083830595016, "num_tokens": 64736812.0, "step": 37315 }, { "entropy": 5.746654224395752, "epoch": 2.9036374246255594, "grad_norm": 1.2578125, "learning_rate": 0.00041578426229008325, "loss": 4.9606, "mean_token_accuracy": 0.20517215132713318, "num_tokens": 64745858.0, "step": 37320 }, { "entropy": 5.787350845336914, "epoch": 2.9040264539972767, "grad_norm": 1.2578125, "learning_rate": 0.00041576264146995557, "loss": 5.0389, "mean_token_accuracy": 0.19533346146345137, "num_tokens": 64754851.0, "step": 37325 }, { "entropy": 5.764447212219238, "epoch": 2.9044154833689944, "grad_norm": 1.328125, "learning_rate": 0.00041574101851397883, "loss": 5.058, "mean_token_accuracy": 0.19854519963264466, "num_tokens": 64764028.0, "step": 37330 }, { "entropy": 5.718879508972168, "epoch": 2.904804512740712, "grad_norm": 1.265625, "learning_rate": 0.0004157193934224811, "loss": 4.8766, "mean_token_accuracy": 0.2128916084766388, "num_tokens": 64773269.0, "step": 37335 }, { "entropy": 5.736349058151245, "epoch": 2.9051935421124293, "grad_norm": 1.2890625, "learning_rate": 0.0004156977661957906, "loss": 4.943, "mean_token_accuracy": 0.2111997589468956, "num_tokens": 64781867.0, "step": 37340 }, { "entropy": 5.732470941543579, "epoch": 2.905582571484147, "grad_norm": 1.171875, "learning_rate": 0.0004156761368342355, "loss": 4.8929, "mean_token_accuracy": 0.2104508176445961, "num_tokens": 64791109.0, "step": 37345 }, { "entropy": 5.717786979675293, "epoch": 2.9059716008558647, "grad_norm": 1.2421875, "learning_rate": 0.00041565450533814384, "loss": 4.8975, "mean_token_accuracy": 0.22144932746887208, "num_tokens": 64799122.0, "step": 37350 }, { "entropy": 5.725673198699951, "epoch": 2.9063606302275824, "grad_norm": 1.21875, "learning_rate": 0.00041563287170784396, "loss": 5.0152, "mean_token_accuracy": 0.2024384170770645, "num_tokens": 64806936.0, "step": 37355 }, { "entropy": 5.69240026473999, "epoch": 2.9067496595992997, "grad_norm": 1.25, "learning_rate": 0.0004156112359436641, "loss": 4.9523, "mean_token_accuracy": 0.20318218916654587, "num_tokens": 64815633.0, "step": 37360 }, { "entropy": 5.699302911758423, "epoch": 2.9071386889710173, "grad_norm": 1.234375, "learning_rate": 0.00041558959804593255, "loss": 4.9495, "mean_token_accuracy": 0.21420224606990815, "num_tokens": 64824064.0, "step": 37365 }, { "entropy": 5.679358196258545, "epoch": 2.9075277183427346, "grad_norm": 1.3203125, "learning_rate": 0.00041556795801497766, "loss": 4.9449, "mean_token_accuracy": 0.210280342400074, "num_tokens": 64831970.0, "step": 37370 }, { "entropy": 5.693839168548584, "epoch": 2.9079167477144523, "grad_norm": 1.2109375, "learning_rate": 0.0004155463158511277, "loss": 4.951, "mean_token_accuracy": 0.20558794289827348, "num_tokens": 64840524.0, "step": 37375 }, { "entropy": 5.810556697845459, "epoch": 2.90830577708617, "grad_norm": 1.3828125, "learning_rate": 0.00041552467155471105, "loss": 5.0485, "mean_token_accuracy": 0.19923983365297318, "num_tokens": 64849039.0, "step": 37380 }, { "entropy": 5.783484172821045, "epoch": 2.9086948064578877, "grad_norm": 1.3671875, "learning_rate": 0.0004155030251260563, "loss": 4.987, "mean_token_accuracy": 0.20251857340335847, "num_tokens": 64858172.0, "step": 37385 }, { "entropy": 5.711177396774292, "epoch": 2.9090838358296054, "grad_norm": 1.1796875, "learning_rate": 0.00041548137656549167, "loss": 4.9548, "mean_token_accuracy": 0.21165110170841217, "num_tokens": 64866108.0, "step": 37390 }, { "entropy": 5.763345050811767, "epoch": 2.9094728652013226, "grad_norm": 1.3046875, "learning_rate": 0.0004154597258733457, "loss": 5.0564, "mean_token_accuracy": 0.2029396876692772, "num_tokens": 64874451.0, "step": 37395 }, { "entropy": 5.7915647506713865, "epoch": 2.9098618945730403, "grad_norm": 1.34375, "learning_rate": 0.0004154380730499472, "loss": 5.0079, "mean_token_accuracy": 0.209265798330307, "num_tokens": 64882354.0, "step": 37400 }, { "entropy": 5.760558986663819, "epoch": 2.9102509239447576, "grad_norm": 1.25, "learning_rate": 0.00041541641809562425, "loss": 4.9805, "mean_token_accuracy": 0.2126854658126831, "num_tokens": 64890716.0, "step": 37405 }, { "entropy": 5.628662061691284, "epoch": 2.9106399533164753, "grad_norm": 1.3046875, "learning_rate": 0.0004153947610107057, "loss": 4.8742, "mean_token_accuracy": 0.2148878365755081, "num_tokens": 64899629.0, "step": 37410 }, { "entropy": 5.756655597686768, "epoch": 2.911028982688193, "grad_norm": 1.2265625, "learning_rate": 0.00041537310179552017, "loss": 4.9762, "mean_token_accuracy": 0.1973027065396309, "num_tokens": 64908539.0, "step": 37415 }, { "entropy": 5.7430816173553465, "epoch": 2.9114180120599107, "grad_norm": 1.21875, "learning_rate": 0.0004153514404503962, "loss": 4.9485, "mean_token_accuracy": 0.2137985572218895, "num_tokens": 64917751.0, "step": 37420 }, { "entropy": 5.717655897140503, "epoch": 2.911807041431628, "grad_norm": 1.265625, "learning_rate": 0.0004153297769756625, "loss": 5.0085, "mean_token_accuracy": 0.2057817056775093, "num_tokens": 64925591.0, "step": 37425 }, { "entropy": 5.765898847579956, "epoch": 2.9121960708033456, "grad_norm": 1.3828125, "learning_rate": 0.0004153081113716478, "loss": 4.9747, "mean_token_accuracy": 0.20899815559387208, "num_tokens": 64934512.0, "step": 37430 }, { "entropy": 5.711842012405396, "epoch": 2.9125851001750633, "grad_norm": 1.203125, "learning_rate": 0.00041528644363868087, "loss": 4.9408, "mean_token_accuracy": 0.21274943351745607, "num_tokens": 64942682.0, "step": 37435 }, { "entropy": 5.7020327091217045, "epoch": 2.9129741295467806, "grad_norm": 1.1875, "learning_rate": 0.0004152647737770904, "loss": 4.9774, "mean_token_accuracy": 0.20841173678636551, "num_tokens": 64950961.0, "step": 37440 }, { "entropy": 5.737736415863037, "epoch": 2.9133631589184983, "grad_norm": 1.3046875, "learning_rate": 0.0004152431017872053, "loss": 5.0088, "mean_token_accuracy": 0.20696523189544677, "num_tokens": 64959392.0, "step": 37445 }, { "entropy": 5.736891603469848, "epoch": 2.913752188290216, "grad_norm": 1.2578125, "learning_rate": 0.00041522142766935426, "loss": 4.9776, "mean_token_accuracy": 0.21029538065195083, "num_tokens": 64967786.0, "step": 37450 }, { "entropy": 5.792594385147095, "epoch": 2.9141412176619337, "grad_norm": 1.2890625, "learning_rate": 0.00041519975142386627, "loss": 4.9659, "mean_token_accuracy": 0.2075514629483223, "num_tokens": 64975987.0, "step": 37455 }, { "entropy": 5.722790670394898, "epoch": 2.914530247033651, "grad_norm": 1.3125, "learning_rate": 0.0004151780730510702, "loss": 4.9334, "mean_token_accuracy": 0.2087882548570633, "num_tokens": 64984134.0, "step": 37460 }, { "entropy": 5.696947526931763, "epoch": 2.9149192764053686, "grad_norm": 1.28125, "learning_rate": 0.00041515639255129504, "loss": 4.9208, "mean_token_accuracy": 0.20955941826105118, "num_tokens": 64992346.0, "step": 37465 }, { "entropy": 5.765525770187378, "epoch": 2.9153083057770863, "grad_norm": 1.390625, "learning_rate": 0.0004151347099248697, "loss": 4.9951, "mean_token_accuracy": 0.21498361229896545, "num_tokens": 65001029.0, "step": 37470 }, { "entropy": 5.761052417755127, "epoch": 2.9156973351488036, "grad_norm": 1.3125, "learning_rate": 0.0004151130251721231, "loss": 5.0458, "mean_token_accuracy": 0.20264137983322145, "num_tokens": 65008932.0, "step": 37475 }, { "entropy": 5.7972806930542, "epoch": 2.9160863645205213, "grad_norm": 1.21875, "learning_rate": 0.00041509133829338454, "loss": 5.0071, "mean_token_accuracy": 0.21167746484279631, "num_tokens": 65017774.0, "step": 37480 }, { "entropy": 5.804692983627319, "epoch": 2.916475393892239, "grad_norm": 1.1953125, "learning_rate": 0.0004150696492889827, "loss": 5.0033, "mean_token_accuracy": 0.20427973866462706, "num_tokens": 65026641.0, "step": 37485 }, { "entropy": 5.742819976806641, "epoch": 2.9168644232639567, "grad_norm": 1.203125, "learning_rate": 0.00041504795815924697, "loss": 4.9273, "mean_token_accuracy": 0.20865918397903443, "num_tokens": 65035123.0, "step": 37490 }, { "entropy": 5.7964515209198, "epoch": 2.917253452635674, "grad_norm": 1.1875, "learning_rate": 0.00041502626490450635, "loss": 5.0434, "mean_token_accuracy": 0.2015484243631363, "num_tokens": 65043553.0, "step": 37495 }, { "entropy": 5.746234893798828, "epoch": 2.9176424820073916, "grad_norm": 1.2109375, "learning_rate": 0.0004150045695250901, "loss": 4.9921, "mean_token_accuracy": 0.20630771964788436, "num_tokens": 65052267.0, "step": 37500 }, { "entropy": 5.7275035858154295, "epoch": 2.918031511379109, "grad_norm": 1.34375, "learning_rate": 0.0004149828720213272, "loss": 4.9883, "mean_token_accuracy": 0.21291425228118896, "num_tokens": 65060667.0, "step": 37505 }, { "entropy": 5.670481014251709, "epoch": 2.9184205407508266, "grad_norm": 1.25, "learning_rate": 0.0004149611723935472, "loss": 4.8784, "mean_token_accuracy": 0.21938779354095458, "num_tokens": 65069194.0, "step": 37510 }, { "entropy": 5.746001195907593, "epoch": 2.9188095701225443, "grad_norm": 1.2578125, "learning_rate": 0.0004149394706420791, "loss": 4.9647, "mean_token_accuracy": 0.20571626126766204, "num_tokens": 65077873.0, "step": 37515 }, { "entropy": 5.721691083908081, "epoch": 2.919198599494262, "grad_norm": 1.3203125, "learning_rate": 0.00041491776676725223, "loss": 4.964, "mean_token_accuracy": 0.2102587938308716, "num_tokens": 65087503.0, "step": 37520 }, { "entropy": 5.755048942565918, "epoch": 2.9195876288659792, "grad_norm": 1.203125, "learning_rate": 0.0004148960607693961, "loss": 5.0249, "mean_token_accuracy": 0.19768452644348145, "num_tokens": 65096520.0, "step": 37525 }, { "entropy": 5.7073980331420895, "epoch": 2.919976658237697, "grad_norm": 1.28125, "learning_rate": 0.00041487435264883974, "loss": 4.9281, "mean_token_accuracy": 0.21284224689006806, "num_tokens": 65105323.0, "step": 37530 }, { "entropy": 5.844447946548462, "epoch": 2.9203656876094146, "grad_norm": 1.296875, "learning_rate": 0.0004148526424059128, "loss": 5.1139, "mean_token_accuracy": 0.19298322200775148, "num_tokens": 65114412.0, "step": 37535 }, { "entropy": 5.7610949039459225, "epoch": 2.920754716981132, "grad_norm": 1.3984375, "learning_rate": 0.0004148309300409446, "loss": 4.9351, "mean_token_accuracy": 0.2147040292620659, "num_tokens": 65122285.0, "step": 37540 }, { "entropy": 5.705696487426758, "epoch": 2.9211437463528496, "grad_norm": 1.21875, "learning_rate": 0.0004148092155542646, "loss": 4.9997, "mean_token_accuracy": 0.20700423866510392, "num_tokens": 65131812.0, "step": 37545 }, { "entropy": 5.756667184829712, "epoch": 2.9215327757245673, "grad_norm": 1.3046875, "learning_rate": 0.0004147874989462023, "loss": 4.9812, "mean_token_accuracy": 0.21198780089616776, "num_tokens": 65140187.0, "step": 37550 }, { "entropy": 5.749834871292114, "epoch": 2.921921805096285, "grad_norm": 1.2578125, "learning_rate": 0.0004147657802170871, "loss": 4.9402, "mean_token_accuracy": 0.2109106034040451, "num_tokens": 65149510.0, "step": 37555 }, { "entropy": 5.7667945384979244, "epoch": 2.922310834468002, "grad_norm": 1.2421875, "learning_rate": 0.00041474405936724873, "loss": 5.0104, "mean_token_accuracy": 0.2069396808743477, "num_tokens": 65157889.0, "step": 37560 }, { "entropy": 5.726014423370361, "epoch": 2.92269986383972, "grad_norm": 1.265625, "learning_rate": 0.0004147223363970166, "loss": 4.9, "mean_token_accuracy": 0.21077440232038497, "num_tokens": 65166233.0, "step": 37565 }, { "entropy": 5.804691314697266, "epoch": 2.9230888932114376, "grad_norm": 1.328125, "learning_rate": 0.0004147006113067205, "loss": 5.0425, "mean_token_accuracy": 0.2060772731900215, "num_tokens": 65174093.0, "step": 37570 }, { "entropy": 5.805622673034668, "epoch": 2.923477922583155, "grad_norm": 1.2890625, "learning_rate": 0.0004146788840966901, "loss": 5.0189, "mean_token_accuracy": 0.21100467145442964, "num_tokens": 65183059.0, "step": 37575 }, { "entropy": 5.7412818431854244, "epoch": 2.9238669519548726, "grad_norm": 1.2734375, "learning_rate": 0.0004146571547672548, "loss": 4.9269, "mean_token_accuracy": 0.21339647471904755, "num_tokens": 65191412.0, "step": 37580 }, { "entropy": 5.733124160766602, "epoch": 2.9242559813265903, "grad_norm": 1.375, "learning_rate": 0.00041463542331874443, "loss": 5.0111, "mean_token_accuracy": 0.2081962689757347, "num_tokens": 65200401.0, "step": 37585 }, { "entropy": 5.710060405731201, "epoch": 2.924645010698308, "grad_norm": 1.1796875, "learning_rate": 0.00041461368975148876, "loss": 4.9971, "mean_token_accuracy": 0.20566997528076172, "num_tokens": 65208987.0, "step": 37590 }, { "entropy": 5.767377090454102, "epoch": 2.925034040070025, "grad_norm": 1.1640625, "learning_rate": 0.00041459195406581763, "loss": 4.961, "mean_token_accuracy": 0.21061062961816787, "num_tokens": 65217449.0, "step": 37595 }, { "entropy": 5.761460828781128, "epoch": 2.925423069441743, "grad_norm": 1.296875, "learning_rate": 0.0004145702162620608, "loss": 4.9547, "mean_token_accuracy": 0.2089443564414978, "num_tokens": 65225922.0, "step": 37600 }, { "entropy": 5.706326341629028, "epoch": 2.92581209881346, "grad_norm": 1.265625, "learning_rate": 0.00041454847634054805, "loss": 4.9398, "mean_token_accuracy": 0.209811007976532, "num_tokens": 65233777.0, "step": 37605 }, { "entropy": 5.693035745620728, "epoch": 2.926201128185178, "grad_norm": 1.2578125, "learning_rate": 0.00041452673430160923, "loss": 4.9396, "mean_token_accuracy": 0.20394111424684525, "num_tokens": 65242140.0, "step": 37610 }, { "entropy": 5.783765268325806, "epoch": 2.9265901575568956, "grad_norm": 1.171875, "learning_rate": 0.0004145049901455744, "loss": 4.9867, "mean_token_accuracy": 0.20083435177803038, "num_tokens": 65251166.0, "step": 37615 }, { "entropy": 5.7911255836486815, "epoch": 2.9269791869286133, "grad_norm": 1.1640625, "learning_rate": 0.00041448324387277337, "loss": 4.9126, "mean_token_accuracy": 0.20130646973848343, "num_tokens": 65260099.0, "step": 37620 }, { "entropy": 5.790359830856323, "epoch": 2.927368216300331, "grad_norm": 1.2734375, "learning_rate": 0.00041446149548353606, "loss": 5.0741, "mean_token_accuracy": 0.20328816622495652, "num_tokens": 65270450.0, "step": 37625 }, { "entropy": 5.735617208480835, "epoch": 2.927757245672048, "grad_norm": 1.28125, "learning_rate": 0.0004144397449781926, "loss": 4.9915, "mean_token_accuracy": 0.20121398121118544, "num_tokens": 65279298.0, "step": 37630 }, { "entropy": 5.736426067352295, "epoch": 2.928146275043766, "grad_norm": 1.265625, "learning_rate": 0.0004144179923570729, "loss": 4.9064, "mean_token_accuracy": 0.2144026577472687, "num_tokens": 65287015.0, "step": 37635 }, { "entropy": 5.7527649879455565, "epoch": 2.928535304415483, "grad_norm": 1.21875, "learning_rate": 0.0004143962376205071, "loss": 4.9749, "mean_token_accuracy": 0.21055516004562377, "num_tokens": 65295300.0, "step": 37640 }, { "entropy": 5.746245956420898, "epoch": 2.928924333787201, "grad_norm": 1.234375, "learning_rate": 0.00041437448076882526, "loss": 4.9288, "mean_token_accuracy": 0.21496892720460892, "num_tokens": 65304040.0, "step": 37645 }, { "entropy": 5.7900513172149655, "epoch": 2.9293133631589185, "grad_norm": 1.3515625, "learning_rate": 0.00041435272180235757, "loss": 4.9823, "mean_token_accuracy": 0.2090310588479042, "num_tokens": 65311519.0, "step": 37650 }, { "entropy": 5.716901779174805, "epoch": 2.9297023925306362, "grad_norm": 1.2578125, "learning_rate": 0.000414330960721434, "loss": 4.8858, "mean_token_accuracy": 0.2211376830935478, "num_tokens": 65319864.0, "step": 37655 }, { "entropy": 5.7015259742736815, "epoch": 2.9300914219023535, "grad_norm": 1.2734375, "learning_rate": 0.00041430919752638497, "loss": 4.9878, "mean_token_accuracy": 0.2035437747836113, "num_tokens": 65328884.0, "step": 37660 }, { "entropy": 5.726526832580566, "epoch": 2.930480451274071, "grad_norm": 1.1640625, "learning_rate": 0.0004142874322175406, "loss": 4.9402, "mean_token_accuracy": 0.20868986397981643, "num_tokens": 65337507.0, "step": 37665 }, { "entropy": 5.7860719680786135, "epoch": 2.930869480645789, "grad_norm": 1.25, "learning_rate": 0.00041426566479523116, "loss": 4.934, "mean_token_accuracy": 0.20682337880134583, "num_tokens": 65345564.0, "step": 37670 }, { "entropy": 5.749407577514648, "epoch": 2.931258510017506, "grad_norm": 1.2109375, "learning_rate": 0.00041424389525978683, "loss": 5.042, "mean_token_accuracy": 0.2043719246983528, "num_tokens": 65354736.0, "step": 37675 }, { "entropy": 5.749319934844971, "epoch": 2.931647539389224, "grad_norm": 1.25, "learning_rate": 0.0004142221236115381, "loss": 4.9741, "mean_token_accuracy": 0.20675768256187438, "num_tokens": 65363551.0, "step": 37680 }, { "entropy": 5.835529756546021, "epoch": 2.9320365687609415, "grad_norm": 1.296875, "learning_rate": 0.0004142003498508152, "loss": 5.1094, "mean_token_accuracy": 0.20293712317943574, "num_tokens": 65372394.0, "step": 37685 }, { "entropy": 5.852826690673828, "epoch": 2.9324255981326592, "grad_norm": 1.2421875, "learning_rate": 0.0004141785739779486, "loss": 5.1173, "mean_token_accuracy": 0.19799267798662185, "num_tokens": 65381732.0, "step": 37690 }, { "entropy": 5.711467647552491, "epoch": 2.9328146275043765, "grad_norm": 1.1484375, "learning_rate": 0.00041415679599326853, "loss": 5.0492, "mean_token_accuracy": 0.19774440973997115, "num_tokens": 65390718.0, "step": 37695 }, { "entropy": 5.723369026184082, "epoch": 2.933203656876094, "grad_norm": 1.2734375, "learning_rate": 0.00041413501589710567, "loss": 4.9037, "mean_token_accuracy": 0.21028241217136384, "num_tokens": 65399340.0, "step": 37700 }, { "entropy": 5.746189212799072, "epoch": 2.9335926862478114, "grad_norm": 1.2890625, "learning_rate": 0.0004141132336897904, "loss": 5.0223, "mean_token_accuracy": 0.20540821254253389, "num_tokens": 65408911.0, "step": 37705 }, { "entropy": 5.73016095161438, "epoch": 2.933981715619529, "grad_norm": 1.28125, "learning_rate": 0.0004140914493716533, "loss": 5.0081, "mean_token_accuracy": 0.20626921057701111, "num_tokens": 65418496.0, "step": 37710 }, { "entropy": 5.71728024482727, "epoch": 2.934370744991247, "grad_norm": 1.2578125, "learning_rate": 0.0004140696629430248, "loss": 4.9029, "mean_token_accuracy": 0.21261151134967804, "num_tokens": 65426791.0, "step": 37715 }, { "entropy": 5.854611253738403, "epoch": 2.9347597743629645, "grad_norm": 1.3515625, "learning_rate": 0.00041404787440423534, "loss": 5.067, "mean_token_accuracy": 0.20267720222473146, "num_tokens": 65435513.0, "step": 37720 }, { "entropy": 5.782723808288575, "epoch": 2.9351488037346822, "grad_norm": 1.2890625, "learning_rate": 0.00041402608375561595, "loss": 5.031, "mean_token_accuracy": 0.20125727504491805, "num_tokens": 65444132.0, "step": 37725 }, { "entropy": 5.744702339172363, "epoch": 2.9355378331063995, "grad_norm": 1.3125, "learning_rate": 0.00041400429099749687, "loss": 5.0105, "mean_token_accuracy": 0.21486452519893645, "num_tokens": 65452313.0, "step": 37730 }, { "entropy": 5.765815258026123, "epoch": 2.935926862478117, "grad_norm": 1.3046875, "learning_rate": 0.000413982496130209, "loss": 4.9975, "mean_token_accuracy": 0.20691528171300888, "num_tokens": 65460724.0, "step": 37735 }, { "entropy": 5.736054420471191, "epoch": 2.9363158918498344, "grad_norm": 1.2578125, "learning_rate": 0.00041396069915408294, "loss": 4.9443, "mean_token_accuracy": 0.21830601543188094, "num_tokens": 65468902.0, "step": 37740 }, { "entropy": 5.749852323532105, "epoch": 2.936704921221552, "grad_norm": 1.421875, "learning_rate": 0.00041393890006944945, "loss": 4.9965, "mean_token_accuracy": 0.21082276552915574, "num_tokens": 65477614.0, "step": 37745 }, { "entropy": 5.746755647659302, "epoch": 2.93709395059327, "grad_norm": 1.265625, "learning_rate": 0.0004139170988766393, "loss": 4.9869, "mean_token_accuracy": 0.20665867626667023, "num_tokens": 65486369.0, "step": 37750 }, { "entropy": 5.809875011444092, "epoch": 2.9374829799649875, "grad_norm": 1.2890625, "learning_rate": 0.0004138952955759833, "loss": 5.0458, "mean_token_accuracy": 0.20460011959075927, "num_tokens": 65495235.0, "step": 37755 }, { "entropy": 5.745532989501953, "epoch": 2.937872009336705, "grad_norm": 1.203125, "learning_rate": 0.00041387349016781225, "loss": 4.981, "mean_token_accuracy": 0.21481469124555588, "num_tokens": 65504499.0, "step": 37760 }, { "entropy": 5.789349555969238, "epoch": 2.9382610387084225, "grad_norm": 1.203125, "learning_rate": 0.000413851682652457, "loss": 5.0835, "mean_token_accuracy": 0.1930072009563446, "num_tokens": 65512612.0, "step": 37765 }, { "entropy": 5.679971551895141, "epoch": 2.93865006808014, "grad_norm": 1.2578125, "learning_rate": 0.0004138298730302485, "loss": 4.8064, "mean_token_accuracy": 0.22338423430919646, "num_tokens": 65521129.0, "step": 37770 }, { "entropy": 5.696767711639405, "epoch": 2.9390390974518574, "grad_norm": 1.3203125, "learning_rate": 0.0004138080613015176, "loss": 4.9837, "mean_token_accuracy": 0.20711466670036316, "num_tokens": 65529547.0, "step": 37775 }, { "entropy": 5.679032468795777, "epoch": 2.939428126823575, "grad_norm": 1.265625, "learning_rate": 0.00041378624746659536, "loss": 4.9806, "mean_token_accuracy": 0.208369180560112, "num_tokens": 65538106.0, "step": 37780 }, { "entropy": 5.763957357406616, "epoch": 2.939817156195293, "grad_norm": 1.2578125, "learning_rate": 0.00041376443152581265, "loss": 4.9747, "mean_token_accuracy": 0.2051646366715431, "num_tokens": 65546718.0, "step": 37785 }, { "entropy": 5.754372310638428, "epoch": 2.9402061855670105, "grad_norm": 1.140625, "learning_rate": 0.00041374261347950064, "loss": 4.9729, "mean_token_accuracy": 0.20824459046125413, "num_tokens": 65555484.0, "step": 37790 }, { "entropy": 5.646736478805542, "epoch": 2.9405952149387278, "grad_norm": 1.3203125, "learning_rate": 0.0004137207933279903, "loss": 4.8955, "mean_token_accuracy": 0.21545591354370117, "num_tokens": 65563285.0, "step": 37795 }, { "entropy": 5.632595872879028, "epoch": 2.9409842443104455, "grad_norm": 1.2421875, "learning_rate": 0.00041369897107161266, "loss": 4.8061, "mean_token_accuracy": 0.22062060683965684, "num_tokens": 65571702.0, "step": 37800 }, { "entropy": 5.701446962356568, "epoch": 2.941373273682163, "grad_norm": 1.2265625, "learning_rate": 0.00041367714671069897, "loss": 4.9573, "mean_token_accuracy": 0.21719106435775756, "num_tokens": 65580380.0, "step": 37805 }, { "entropy": 5.71339111328125, "epoch": 2.9417623030538804, "grad_norm": 1.234375, "learning_rate": 0.00041365532024558024, "loss": 5.0342, "mean_token_accuracy": 0.19979556351900102, "num_tokens": 65589218.0, "step": 37810 }, { "entropy": 5.731223392486572, "epoch": 2.942151332425598, "grad_norm": 1.2421875, "learning_rate": 0.0004136334916765877, "loss": 4.9067, "mean_token_accuracy": 0.2182898238301277, "num_tokens": 65598020.0, "step": 37815 }, { "entropy": 5.808727169036866, "epoch": 2.942540361797316, "grad_norm": 1.1953125, "learning_rate": 0.00041361166100405264, "loss": 5.0781, "mean_token_accuracy": 0.20625956505537033, "num_tokens": 65606591.0, "step": 37820 }, { "entropy": 5.780256223678589, "epoch": 2.9429293911690335, "grad_norm": 1.296875, "learning_rate": 0.0004135898282283062, "loss": 5.0249, "mean_token_accuracy": 0.2016656830906868, "num_tokens": 65614597.0, "step": 37825 }, { "entropy": 5.695263767242432, "epoch": 2.9433184205407508, "grad_norm": 1.2421875, "learning_rate": 0.0004135679933496797, "loss": 4.9346, "mean_token_accuracy": 0.20670516043901443, "num_tokens": 65623092.0, "step": 37830 }, { "entropy": 5.789718103408814, "epoch": 2.9437074499124685, "grad_norm": 1.203125, "learning_rate": 0.0004135461563685045, "loss": 5.0186, "mean_token_accuracy": 0.19989261478185655, "num_tokens": 65632623.0, "step": 37835 }, { "entropy": 5.800095653533935, "epoch": 2.9440964792841857, "grad_norm": 1.1875, "learning_rate": 0.00041352431728511194, "loss": 4.9861, "mean_token_accuracy": 0.20626098215579985, "num_tokens": 65641049.0, "step": 37840 }, { "entropy": 5.792394161224365, "epoch": 2.9444855086559034, "grad_norm": 1.15625, "learning_rate": 0.0004135024760998333, "loss": 5.0549, "mean_token_accuracy": 0.20023055970668793, "num_tokens": 65649928.0, "step": 37845 }, { "entropy": 5.783151388168335, "epoch": 2.944874538027621, "grad_norm": 1.3203125, "learning_rate": 0.00041348063281299995, "loss": 5.0465, "mean_token_accuracy": 0.2002826750278473, "num_tokens": 65658597.0, "step": 37850 }, { "entropy": 5.725397109985352, "epoch": 2.945263567399339, "grad_norm": 1.234375, "learning_rate": 0.00041345878742494346, "loss": 4.9636, "mean_token_accuracy": 0.207400144636631, "num_tokens": 65667532.0, "step": 37855 }, { "entropy": 5.702459907531738, "epoch": 2.945652596771056, "grad_norm": 1.265625, "learning_rate": 0.00041343693993599535, "loss": 4.9834, "mean_token_accuracy": 0.20669802129268647, "num_tokens": 65676209.0, "step": 37860 }, { "entropy": 5.757857036590576, "epoch": 2.9460416261427738, "grad_norm": 1.1875, "learning_rate": 0.0004134150903464869, "loss": 4.9923, "mean_token_accuracy": 0.20346804857254028, "num_tokens": 65684372.0, "step": 37865 }, { "entropy": 5.73091607093811, "epoch": 2.9464306555144915, "grad_norm": 1.25, "learning_rate": 0.0004133932386567498, "loss": 4.9599, "mean_token_accuracy": 0.21479010730981826, "num_tokens": 65692386.0, "step": 37870 }, { "entropy": 5.752978181838989, "epoch": 2.9468196848862087, "grad_norm": 1.25, "learning_rate": 0.0004133713848671156, "loss": 5.0366, "mean_token_accuracy": 0.2064836710691452, "num_tokens": 65700707.0, "step": 37875 }, { "entropy": 5.787127494812012, "epoch": 2.9472087142579264, "grad_norm": 1.21875, "learning_rate": 0.0004133495289779159, "loss": 5.0289, "mean_token_accuracy": 0.20602697432041167, "num_tokens": 65710166.0, "step": 37880 }, { "entropy": 5.73648157119751, "epoch": 2.947597743629644, "grad_norm": 1.296875, "learning_rate": 0.0004133276709894823, "loss": 4.9542, "mean_token_accuracy": 0.21024233400821685, "num_tokens": 65718900.0, "step": 37885 }, { "entropy": 5.789086151123047, "epoch": 2.947986773001362, "grad_norm": 1.28125, "learning_rate": 0.0004133058109021464, "loss": 5.0493, "mean_token_accuracy": 0.20787284821271895, "num_tokens": 65727882.0, "step": 37890 }, { "entropy": 5.710661458969116, "epoch": 2.948375802373079, "grad_norm": 1.28125, "learning_rate": 0.00041328394871624003, "loss": 4.8575, "mean_token_accuracy": 0.212934772670269, "num_tokens": 65736681.0, "step": 37895 }, { "entropy": 5.805316829681397, "epoch": 2.9487648317447968, "grad_norm": 1.3125, "learning_rate": 0.0004132620844320948, "loss": 5.0019, "mean_token_accuracy": 0.20582326352596284, "num_tokens": 65745002.0, "step": 37900 }, { "entropy": 5.776008653640747, "epoch": 2.9491538611165145, "grad_norm": 1.2421875, "learning_rate": 0.0004132402180500425, "loss": 5.03, "mean_token_accuracy": 0.20382364243268966, "num_tokens": 65753918.0, "step": 37905 }, { "entropy": 5.7881636142730715, "epoch": 2.9495428904882317, "grad_norm": 1.3046875, "learning_rate": 0.0004132183495704149, "loss": 5.0042, "mean_token_accuracy": 0.20378240197896957, "num_tokens": 65762659.0, "step": 37910 }, { "entropy": 5.7585508823394775, "epoch": 2.9499319198599494, "grad_norm": 1.2265625, "learning_rate": 0.0004131964789935439, "loss": 5.0507, "mean_token_accuracy": 0.20291766077280043, "num_tokens": 65771464.0, "step": 37915 }, { "entropy": 5.709188461303711, "epoch": 2.950320949231667, "grad_norm": 1.2734375, "learning_rate": 0.0004131746063197612, "loss": 4.9218, "mean_token_accuracy": 0.21291617006063462, "num_tokens": 65779628.0, "step": 37920 }, { "entropy": 5.745810508728027, "epoch": 2.950709978603385, "grad_norm": 1.265625, "learning_rate": 0.0004131527315493989, "loss": 5.0284, "mean_token_accuracy": 0.20372420251369477, "num_tokens": 65788210.0, "step": 37925 }, { "entropy": 5.774693965911865, "epoch": 2.951099007975102, "grad_norm": 1.296875, "learning_rate": 0.00041313085468278873, "loss": 4.9786, "mean_token_accuracy": 0.2062986209988594, "num_tokens": 65796295.0, "step": 37930 }, { "entropy": 5.780889272689819, "epoch": 2.9514880373468197, "grad_norm": 1.2578125, "learning_rate": 0.0004131089757202627, "loss": 5.0184, "mean_token_accuracy": 0.20742080807685853, "num_tokens": 65805670.0, "step": 37935 }, { "entropy": 5.749173402786255, "epoch": 2.951877066718537, "grad_norm": 1.2734375, "learning_rate": 0.00041308709466215276, "loss": 4.9503, "mean_token_accuracy": 0.20759862959384917, "num_tokens": 65814835.0, "step": 37940 }, { "entropy": 5.726490116119384, "epoch": 2.9522660960902547, "grad_norm": 1.21875, "learning_rate": 0.000413065211508791, "loss": 4.9155, "mean_token_accuracy": 0.21502220928668975, "num_tokens": 65823405.0, "step": 37945 }, { "entropy": 5.846900892257691, "epoch": 2.9526551254619724, "grad_norm": 1.3125, "learning_rate": 0.00041304332626050937, "loss": 5.0645, "mean_token_accuracy": 0.2012569412589073, "num_tokens": 65832127.0, "step": 37950 }, { "entropy": 5.782841920852661, "epoch": 2.95304415483369, "grad_norm": 1.203125, "learning_rate": 0.00041302143891764, "loss": 5.0191, "mean_token_accuracy": 0.20871592611074447, "num_tokens": 65840690.0, "step": 37955 }, { "entropy": 5.732952451705932, "epoch": 2.9534331842054073, "grad_norm": 1.1953125, "learning_rate": 0.000412999549480515, "loss": 4.968, "mean_token_accuracy": 0.20852576792240143, "num_tokens": 65849252.0, "step": 37960 }, { "entropy": 5.762992668151855, "epoch": 2.953822213577125, "grad_norm": 1.234375, "learning_rate": 0.0004129776579494665, "loss": 4.8944, "mean_token_accuracy": 0.21150533407926558, "num_tokens": 65857872.0, "step": 37965 }, { "entropy": 5.7629297256469725, "epoch": 2.9542112429488427, "grad_norm": 1.296875, "learning_rate": 0.0004129557643248265, "loss": 4.9227, "mean_token_accuracy": 0.2112600699067116, "num_tokens": 65866378.0, "step": 37970 }, { "entropy": 5.707042026519775, "epoch": 2.95460027232056, "grad_norm": 1.21875, "learning_rate": 0.0004129338686069276, "loss": 4.9576, "mean_token_accuracy": 0.2069742888212204, "num_tokens": 65875578.0, "step": 37975 }, { "entropy": 5.768731880187988, "epoch": 2.9549893016922777, "grad_norm": 1.21875, "learning_rate": 0.0004129119707961016, "loss": 5.028, "mean_token_accuracy": 0.19839782863855362, "num_tokens": 65884794.0, "step": 37980 }, { "entropy": 5.7582066535949705, "epoch": 2.9553783310639954, "grad_norm": 1.328125, "learning_rate": 0.000412890070892681, "loss": 4.92, "mean_token_accuracy": 0.2103092908859253, "num_tokens": 65893239.0, "step": 37985 }, { "entropy": 5.811394929885864, "epoch": 2.955767360435713, "grad_norm": 1.2109375, "learning_rate": 0.000412868168896998, "loss": 5.0453, "mean_token_accuracy": 0.2042123109102249, "num_tokens": 65902420.0, "step": 37990 }, { "entropy": 5.758172035217285, "epoch": 2.9561563898074303, "grad_norm": 1.2265625, "learning_rate": 0.0004128462648093851, "loss": 4.9945, "mean_token_accuracy": 0.20114406645298005, "num_tokens": 65911238.0, "step": 37995 }, { "entropy": 5.7628344058990475, "epoch": 2.956545419179148, "grad_norm": 1.2578125, "learning_rate": 0.0004128243586301745, "loss": 4.9507, "mean_token_accuracy": 0.21276420056819917, "num_tokens": 65920366.0, "step": 38000 }, { "entropy": 5.684243249893188, "epoch": 2.9569344485508657, "grad_norm": 1.359375, "learning_rate": 0.0004128024503596986, "loss": 4.9601, "mean_token_accuracy": 0.20868742018938063, "num_tokens": 65929753.0, "step": 38005 }, { "entropy": 5.783647251129151, "epoch": 2.957323477922583, "grad_norm": 1.28125, "learning_rate": 0.00041278053999828986, "loss": 5.0014, "mean_token_accuracy": 0.2072565257549286, "num_tokens": 65938387.0, "step": 38010 }, { "entropy": 5.8046647071838375, "epoch": 2.9577125072943007, "grad_norm": 1.25, "learning_rate": 0.0004127586275462806, "loss": 4.9617, "mean_token_accuracy": 0.21438101530075074, "num_tokens": 65946522.0, "step": 38015 }, { "entropy": 5.718218278884888, "epoch": 2.9581015366660184, "grad_norm": 1.3671875, "learning_rate": 0.00041273671300400363, "loss": 4.8579, "mean_token_accuracy": 0.21954718381166458, "num_tokens": 65954387.0, "step": 38020 }, { "entropy": 5.683928394317627, "epoch": 2.958490566037736, "grad_norm": 1.28125, "learning_rate": 0.00041271479637179116, "loss": 4.9729, "mean_token_accuracy": 0.20769625902175903, "num_tokens": 65962103.0, "step": 38025 }, { "entropy": 5.742477083206177, "epoch": 2.9588795954094533, "grad_norm": 1.1796875, "learning_rate": 0.0004126928776499759, "loss": 5.0451, "mean_token_accuracy": 0.19920091927051545, "num_tokens": 65971045.0, "step": 38030 }, { "entropy": 5.813068103790283, "epoch": 2.959268624781171, "grad_norm": 1.265625, "learning_rate": 0.0004126709568388903, "loss": 4.9648, "mean_token_accuracy": 0.20825294703245162, "num_tokens": 65979927.0, "step": 38035 }, { "entropy": 5.816789865493774, "epoch": 2.9596576541528883, "grad_norm": 1.2421875, "learning_rate": 0.0004126490339388672, "loss": 5.0482, "mean_token_accuracy": 0.2035070091485977, "num_tokens": 65988955.0, "step": 38040 }, { "entropy": 5.806856679916382, "epoch": 2.960046683524606, "grad_norm": 1.3125, "learning_rate": 0.000412627108950239, "loss": 5.084, "mean_token_accuracy": 0.19557463377714157, "num_tokens": 65997731.0, "step": 38045 }, { "entropy": 5.764254188537597, "epoch": 2.9604357128963237, "grad_norm": 1.2890625, "learning_rate": 0.0004126051818733385, "loss": 4.9038, "mean_token_accuracy": 0.21491411477327346, "num_tokens": 66006425.0, "step": 38050 }, { "entropy": 5.756955909729004, "epoch": 2.9608247422680414, "grad_norm": 1.265625, "learning_rate": 0.0004125832527084984, "loss": 5.0084, "mean_token_accuracy": 0.20675763487815857, "num_tokens": 66014849.0, "step": 38055 }, { "entropy": 5.698051977157593, "epoch": 2.961213771639759, "grad_norm": 1.125, "learning_rate": 0.00041256132145605143, "loss": 4.9856, "mean_token_accuracy": 0.20604703575372696, "num_tokens": 66024036.0, "step": 38060 }, { "entropy": 5.816127157211303, "epoch": 2.9616028010114763, "grad_norm": 1.2265625, "learning_rate": 0.0004125393881163304, "loss": 4.9762, "mean_token_accuracy": 0.2077329471707344, "num_tokens": 66032583.0, "step": 38065 }, { "entropy": 5.830139398574829, "epoch": 2.961991830383194, "grad_norm": 1.2734375, "learning_rate": 0.00041251745268966797, "loss": 5.0647, "mean_token_accuracy": 0.1952809676527977, "num_tokens": 66041369.0, "step": 38070 }, { "entropy": 5.720626974105835, "epoch": 2.9623808597549113, "grad_norm": 1.3125, "learning_rate": 0.0004124955151763971, "loss": 4.9979, "mean_token_accuracy": 0.20653744041919708, "num_tokens": 66049608.0, "step": 38075 }, { "entropy": 5.747635841369629, "epoch": 2.962769889126629, "grad_norm": 1.296875, "learning_rate": 0.0004124735755768506, "loss": 5.071, "mean_token_accuracy": 0.20562667548656463, "num_tokens": 66057612.0, "step": 38080 }, { "entropy": 5.747008991241455, "epoch": 2.9631589184983467, "grad_norm": 1.328125, "learning_rate": 0.0004124516338913615, "loss": 4.9495, "mean_token_accuracy": 0.21280138790607453, "num_tokens": 66065687.0, "step": 38085 }, { "entropy": 5.7730419635772705, "epoch": 2.9635479478700644, "grad_norm": 1.25, "learning_rate": 0.0004124296901202626, "loss": 5.0023, "mean_token_accuracy": 0.21259047985076904, "num_tokens": 66074117.0, "step": 38090 }, { "entropy": 5.7326483726501465, "epoch": 2.9639369772417816, "grad_norm": 1.296875, "learning_rate": 0.00041240774426388685, "loss": 4.902, "mean_token_accuracy": 0.2179764449596405, "num_tokens": 66083022.0, "step": 38095 }, { "entropy": 5.731894874572754, "epoch": 2.9643260066134993, "grad_norm": 1.1953125, "learning_rate": 0.0004123857963225673, "loss": 4.8893, "mean_token_accuracy": 0.22280168384313584, "num_tokens": 66091453.0, "step": 38100 }, { "entropy": 5.714373826980591, "epoch": 2.964715035985217, "grad_norm": 1.3359375, "learning_rate": 0.000412363846296637, "loss": 4.8961, "mean_token_accuracy": 0.21985155194997788, "num_tokens": 66099279.0, "step": 38105 }, { "entropy": 5.748297500610351, "epoch": 2.9651040653569343, "grad_norm": 1.25, "learning_rate": 0.000412341894186429, "loss": 5.0503, "mean_token_accuracy": 0.2076827511191368, "num_tokens": 66107224.0, "step": 38110 }, { "entropy": 5.765652322769165, "epoch": 2.965493094728652, "grad_norm": 1.3125, "learning_rate": 0.0004123199399922763, "loss": 4.9568, "mean_token_accuracy": 0.20541047900915146, "num_tokens": 66115719.0, "step": 38115 }, { "entropy": 5.833788061141968, "epoch": 2.9658821241003697, "grad_norm": 1.3671875, "learning_rate": 0.00041229798371451203, "loss": 4.9704, "mean_token_accuracy": 0.20798690617084503, "num_tokens": 66123744.0, "step": 38120 }, { "entropy": 5.693296670913696, "epoch": 2.9662711534720874, "grad_norm": 1.359375, "learning_rate": 0.0004122760253534695, "loss": 4.8704, "mean_token_accuracy": 0.21448576152324678, "num_tokens": 66131929.0, "step": 38125 }, { "entropy": 5.849803447723389, "epoch": 2.9666601828438046, "grad_norm": 1.171875, "learning_rate": 0.0004122540649094817, "loss": 5.1211, "mean_token_accuracy": 0.2034429654479027, "num_tokens": 66141185.0, "step": 38130 }, { "entropy": 5.719653654098511, "epoch": 2.9670492122155223, "grad_norm": 1.3515625, "learning_rate": 0.00041223210238288196, "loss": 4.875, "mean_token_accuracy": 0.21359510272741317, "num_tokens": 66150139.0, "step": 38135 }, { "entropy": 5.68509955406189, "epoch": 2.9674382415872396, "grad_norm": 1.1953125, "learning_rate": 0.0004122101377740035, "loss": 4.8809, "mean_token_accuracy": 0.2157800778746605, "num_tokens": 66158650.0, "step": 38140 }, { "entropy": 5.719266366958618, "epoch": 2.9678272709589573, "grad_norm": 1.3984375, "learning_rate": 0.0004121881710831796, "loss": 5.0049, "mean_token_accuracy": 0.20459336936473846, "num_tokens": 66166683.0, "step": 38145 }, { "entropy": 5.818162155151367, "epoch": 2.968216300330675, "grad_norm": 1.2890625, "learning_rate": 0.0004121662023107435, "loss": 5.0389, "mean_token_accuracy": 0.19992193430662156, "num_tokens": 66175100.0, "step": 38150 }, { "entropy": 5.783654689788818, "epoch": 2.9686053297023927, "grad_norm": 1.1640625, "learning_rate": 0.0004121442314570286, "loss": 4.963, "mean_token_accuracy": 0.20806353986263276, "num_tokens": 66183764.0, "step": 38155 }, { "entropy": 5.785940217971802, "epoch": 2.9689943590741104, "grad_norm": 1.3046875, "learning_rate": 0.00041212225852236834, "loss": 5.0751, "mean_token_accuracy": 0.2015123963356018, "num_tokens": 66192177.0, "step": 38160 }, { "entropy": 5.77645092010498, "epoch": 2.9693833884458276, "grad_norm": 1.2421875, "learning_rate": 0.0004121002835070961, "loss": 4.9519, "mean_token_accuracy": 0.21003472656011582, "num_tokens": 66200685.0, "step": 38165 }, { "entropy": 5.813252544403076, "epoch": 2.9697724178175453, "grad_norm": 1.2421875, "learning_rate": 0.0004120783064115452, "loss": 5.028, "mean_token_accuracy": 0.20306553244590758, "num_tokens": 66209558.0, "step": 38170 }, { "entropy": 5.789865398406983, "epoch": 2.9701614471892626, "grad_norm": 1.2265625, "learning_rate": 0.0004120563272360492, "loss": 5.0295, "mean_token_accuracy": 0.20890484303236007, "num_tokens": 66218352.0, "step": 38175 }, { "entropy": 5.830019950866699, "epoch": 2.9705504765609803, "grad_norm": 1.2265625, "learning_rate": 0.0004120343459809416, "loss": 5.0144, "mean_token_accuracy": 0.20792610198259354, "num_tokens": 66226771.0, "step": 38180 }, { "entropy": 5.725120162963867, "epoch": 2.970939505932698, "grad_norm": 1.265625, "learning_rate": 0.0004120123626465559, "loss": 4.8806, "mean_token_accuracy": 0.21828744262456895, "num_tokens": 66234950.0, "step": 38185 }, { "entropy": 5.689775991439819, "epoch": 2.9713285353044157, "grad_norm": 1.3125, "learning_rate": 0.00041199037723322566, "loss": 5.0108, "mean_token_accuracy": 0.20742257088422775, "num_tokens": 66243619.0, "step": 38190 }, { "entropy": 5.716256761550904, "epoch": 2.971717564676133, "grad_norm": 1.2421875, "learning_rate": 0.00041196838974128446, "loss": 4.9495, "mean_token_accuracy": 0.20376623868942262, "num_tokens": 66252411.0, "step": 38195 }, { "entropy": 5.801603841781616, "epoch": 2.9721065940478506, "grad_norm": 1.25, "learning_rate": 0.000411946400171066, "loss": 4.9287, "mean_token_accuracy": 0.20895910859107972, "num_tokens": 66260660.0, "step": 38200 }, { "entropy": 5.761641025543213, "epoch": 2.9724956234195683, "grad_norm": 1.1640625, "learning_rate": 0.00041192440852290385, "loss": 5.0559, "mean_token_accuracy": 0.20128608494997025, "num_tokens": 66270072.0, "step": 38205 }, { "entropy": 5.76371169090271, "epoch": 2.9728846527912856, "grad_norm": 1.21875, "learning_rate": 0.0004119024147971318, "loss": 4.9787, "mean_token_accuracy": 0.21514695137739182, "num_tokens": 66278971.0, "step": 38210 }, { "entropy": 5.717041921615601, "epoch": 2.9732736821630033, "grad_norm": 1.265625, "learning_rate": 0.00041188041899408345, "loss": 4.8183, "mean_token_accuracy": 0.21387315392494202, "num_tokens": 66287118.0, "step": 38215 }, { "entropy": 5.714354705810547, "epoch": 2.973662711534721, "grad_norm": 1.25, "learning_rate": 0.0004118584211140926, "loss": 4.9225, "mean_token_accuracy": 0.2153848022222519, "num_tokens": 66296041.0, "step": 38220 }, { "entropy": 5.812448358535766, "epoch": 2.9740517409064386, "grad_norm": 1.296875, "learning_rate": 0.00041183642115749316, "loss": 5.0293, "mean_token_accuracy": 0.21117728054523469, "num_tokens": 66304478.0, "step": 38225 }, { "entropy": 5.749567651748658, "epoch": 2.974440770278156, "grad_norm": 1.265625, "learning_rate": 0.00041181441912461873, "loss": 4.9855, "mean_token_accuracy": 0.2033123105764389, "num_tokens": 66313175.0, "step": 38230 }, { "entropy": 5.796424102783203, "epoch": 2.9748297996498736, "grad_norm": 1.3203125, "learning_rate": 0.0004117924150158032, "loss": 4.9942, "mean_token_accuracy": 0.20990918278694154, "num_tokens": 66322102.0, "step": 38235 }, { "entropy": 5.750087738037109, "epoch": 2.9752188290215913, "grad_norm": 1.1953125, "learning_rate": 0.00041177040883138064, "loss": 4.9715, "mean_token_accuracy": 0.2057881996035576, "num_tokens": 66330930.0, "step": 38240 }, { "entropy": 5.734534645080567, "epoch": 2.9756078583933085, "grad_norm": 1.3671875, "learning_rate": 0.00041174840057168474, "loss": 5.0656, "mean_token_accuracy": 0.20691406726837158, "num_tokens": 66339161.0, "step": 38245 }, { "entropy": 5.777521228790283, "epoch": 2.9759968877650262, "grad_norm": 1.2421875, "learning_rate": 0.0004117263902370495, "loss": 5.0331, "mean_token_accuracy": 0.2043324500322342, "num_tokens": 66347498.0, "step": 38250 }, { "entropy": 5.7785851001739506, "epoch": 2.976385917136744, "grad_norm": 1.1953125, "learning_rate": 0.00041170437782780896, "loss": 4.9793, "mean_token_accuracy": 0.2072884812951088, "num_tokens": 66356848.0, "step": 38255 }, { "entropy": 5.7322922706604, "epoch": 2.9767749465084616, "grad_norm": 1.375, "learning_rate": 0.000411682363344297, "loss": 4.9691, "mean_token_accuracy": 0.20564228892326356, "num_tokens": 66365104.0, "step": 38260 }, { "entropy": 5.742816638946533, "epoch": 2.977163975880179, "grad_norm": 1.25, "learning_rate": 0.00041166034678684777, "loss": 4.9701, "mean_token_accuracy": 0.21110543757677078, "num_tokens": 66373984.0, "step": 38265 }, { "entropy": 5.761313772201538, "epoch": 2.9775530052518966, "grad_norm": 1.3984375, "learning_rate": 0.0004116383281557953, "loss": 5.0075, "mean_token_accuracy": 0.20297882407903672, "num_tokens": 66383187.0, "step": 38270 }, { "entropy": 5.749477815628052, "epoch": 2.977942034623614, "grad_norm": 1.25, "learning_rate": 0.00041161630745147374, "loss": 4.9827, "mean_token_accuracy": 0.2054951921105385, "num_tokens": 66392134.0, "step": 38275 }, { "entropy": 5.7860331535339355, "epoch": 2.9783310639953315, "grad_norm": 1.2109375, "learning_rate": 0.0004115942846742171, "loss": 4.9871, "mean_token_accuracy": 0.20382155925035478, "num_tokens": 66400782.0, "step": 38280 }, { "entropy": 5.743750047683716, "epoch": 2.9787200933670492, "grad_norm": 1.3359375, "learning_rate": 0.0004115722598243596, "loss": 4.9037, "mean_token_accuracy": 0.21231495589017868, "num_tokens": 66409185.0, "step": 38285 }, { "entropy": 5.710330152511597, "epoch": 2.979109122738767, "grad_norm": 1.2265625, "learning_rate": 0.00041155023290223537, "loss": 4.9959, "mean_token_accuracy": 0.20607083886861802, "num_tokens": 66417841.0, "step": 38290 }, { "entropy": 5.719877433776856, "epoch": 2.979498152110484, "grad_norm": 1.1875, "learning_rate": 0.0004115282039081788, "loss": 4.9592, "mean_token_accuracy": 0.20610310435295104, "num_tokens": 66426882.0, "step": 38295 }, { "entropy": 5.779862880706787, "epoch": 2.979887181482202, "grad_norm": 1.34375, "learning_rate": 0.00041150617284252405, "loss": 5.0104, "mean_token_accuracy": 0.21625621765851974, "num_tokens": 66434943.0, "step": 38300 }, { "entropy": 5.750674390792847, "epoch": 2.9802762108539196, "grad_norm": 1.1484375, "learning_rate": 0.0004114841397056053, "loss": 5.0535, "mean_token_accuracy": 0.204359333217144, "num_tokens": 66444260.0, "step": 38305 }, { "entropy": 5.760622024536133, "epoch": 2.980665240225637, "grad_norm": 1.125, "learning_rate": 0.00041146210449775704, "loss": 4.886, "mean_token_accuracy": 0.2185773506760597, "num_tokens": 66453603.0, "step": 38310 }, { "entropy": 5.744404077529907, "epoch": 2.9810542695973545, "grad_norm": 1.3125, "learning_rate": 0.0004114400672193136, "loss": 5.0182, "mean_token_accuracy": 0.20099300146102905, "num_tokens": 66462613.0, "step": 38315 }, { "entropy": 5.712764644622803, "epoch": 2.9814432989690722, "grad_norm": 1.375, "learning_rate": 0.00041141802787060923, "loss": 4.8678, "mean_token_accuracy": 0.21373123675584793, "num_tokens": 66470405.0, "step": 38320 }, { "entropy": 5.681039810180664, "epoch": 2.98183232834079, "grad_norm": 1.1796875, "learning_rate": 0.0004113959864519784, "loss": 4.9459, "mean_token_accuracy": 0.21051537096500397, "num_tokens": 66479298.0, "step": 38325 }, { "entropy": 5.668348550796509, "epoch": 2.982221357712507, "grad_norm": 1.171875, "learning_rate": 0.0004113739429637556, "loss": 4.8647, "mean_token_accuracy": 0.21617803275585173, "num_tokens": 66487939.0, "step": 38330 }, { "entropy": 5.642125415802002, "epoch": 2.982610387084225, "grad_norm": 1.296875, "learning_rate": 0.0004113518974062753, "loss": 4.8524, "mean_token_accuracy": 0.21952768862247468, "num_tokens": 66496864.0, "step": 38335 }, { "entropy": 5.743410253524781, "epoch": 2.9829994164559426, "grad_norm": 1.25, "learning_rate": 0.000411329849779872, "loss": 5.0324, "mean_token_accuracy": 0.20322478264570237, "num_tokens": 66505512.0, "step": 38340 }, { "entropy": 5.714822483062744, "epoch": 2.98338844582766, "grad_norm": 1.203125, "learning_rate": 0.00041130780008488015, "loss": 4.901, "mean_token_accuracy": 0.21103117763996124, "num_tokens": 66513972.0, "step": 38345 }, { "entropy": 5.776326084136963, "epoch": 2.9837774751993775, "grad_norm": 1.171875, "learning_rate": 0.0004112857483216344, "loss": 5.0067, "mean_token_accuracy": 0.2057521626353264, "num_tokens": 66523032.0, "step": 38350 }, { "entropy": 5.768940258026123, "epoch": 2.9841665045710952, "grad_norm": 1.2421875, "learning_rate": 0.00041126369449046935, "loss": 5.0177, "mean_token_accuracy": 0.21044726073741912, "num_tokens": 66531693.0, "step": 38355 }, { "entropy": 5.771009826660157, "epoch": 2.984555533942813, "grad_norm": 1.2734375, "learning_rate": 0.00041124163859171967, "loss": 5.0688, "mean_token_accuracy": 0.20415421575307846, "num_tokens": 66540834.0, "step": 38360 }, { "entropy": 5.8024513721466064, "epoch": 2.98494456331453, "grad_norm": 1.359375, "learning_rate": 0.0004112195806257199, "loss": 4.978, "mean_token_accuracy": 0.21123577058315277, "num_tokens": 66549189.0, "step": 38365 }, { "entropy": 5.741639852523804, "epoch": 2.985333592686248, "grad_norm": 1.3046875, "learning_rate": 0.0004111975205928049, "loss": 4.9813, "mean_token_accuracy": 0.21631405651569366, "num_tokens": 66558169.0, "step": 38370 }, { "entropy": 5.804769659042359, "epoch": 2.985722622057965, "grad_norm": 1.3046875, "learning_rate": 0.00041117545849330924, "loss": 5.0569, "mean_token_accuracy": 0.19624873399734497, "num_tokens": 66567036.0, "step": 38375 }, { "entropy": 5.803778457641601, "epoch": 2.986111651429683, "grad_norm": 1.25, "learning_rate": 0.00041115339432756776, "loss": 5.0537, "mean_token_accuracy": 0.19827789813280106, "num_tokens": 66575990.0, "step": 38380 }, { "entropy": 5.8171892166137695, "epoch": 2.9865006808014005, "grad_norm": 1.3125, "learning_rate": 0.0004111313280959152, "loss": 5.0158, "mean_token_accuracy": 0.2033352717757225, "num_tokens": 66584675.0, "step": 38385 }, { "entropy": 5.766924571990967, "epoch": 2.986889710173118, "grad_norm": 1.21875, "learning_rate": 0.00041110925979868647, "loss": 5.0693, "mean_token_accuracy": 0.2044031873345375, "num_tokens": 66593938.0, "step": 38390 }, { "entropy": 5.772219467163086, "epoch": 2.9872787395448355, "grad_norm": 1.3203125, "learning_rate": 0.0004110871894362163, "loss": 4.9346, "mean_token_accuracy": 0.21301252394914627, "num_tokens": 66602043.0, "step": 38395 }, { "entropy": 5.797375917434692, "epoch": 2.987667768916553, "grad_norm": 1.2890625, "learning_rate": 0.00041106511700883975, "loss": 5.0243, "mean_token_accuracy": 0.2050095722079277, "num_tokens": 66610376.0, "step": 38400 }, { "entropy": 5.739901971817017, "epoch": 2.988056798288271, "grad_norm": 1.3359375, "learning_rate": 0.00041104304251689147, "loss": 4.9501, "mean_token_accuracy": 0.2035106137394905, "num_tokens": 66619253.0, "step": 38405 }, { "entropy": 5.813145399093628, "epoch": 2.988445827659988, "grad_norm": 1.1484375, "learning_rate": 0.00041102096596070666, "loss": 4.9741, "mean_token_accuracy": 0.20244687497615815, "num_tokens": 66627983.0, "step": 38410 }, { "entropy": 5.757772302627563, "epoch": 2.988834857031706, "grad_norm": 1.375, "learning_rate": 0.00041099888734062013, "loss": 4.9347, "mean_token_accuracy": 0.21422244012355804, "num_tokens": 66635629.0, "step": 38415 }, { "entropy": 5.813073825836182, "epoch": 2.9892238864034235, "grad_norm": 1.1796875, "learning_rate": 0.000410976806656967, "loss": 5.1356, "mean_token_accuracy": 0.19308022856712342, "num_tokens": 66643960.0, "step": 38420 }, { "entropy": 5.7791276454925535, "epoch": 2.989612915775141, "grad_norm": 1.2734375, "learning_rate": 0.0004109547239100822, "loss": 4.9921, "mean_token_accuracy": 0.20786335170269013, "num_tokens": 66652252.0, "step": 38425 }, { "entropy": 5.716545104980469, "epoch": 2.9900019451468585, "grad_norm": 1.2265625, "learning_rate": 0.0004109326391003009, "loss": 4.9578, "mean_token_accuracy": 0.20923302620649337, "num_tokens": 66660773.0, "step": 38430 }, { "entropy": 5.786676692962646, "epoch": 2.990390974518576, "grad_norm": 1.25, "learning_rate": 0.00041091055222795814, "loss": 4.9898, "mean_token_accuracy": 0.20908840596675873, "num_tokens": 66668681.0, "step": 38435 }, { "entropy": 5.722526264190674, "epoch": 2.990780003890294, "grad_norm": 1.2578125, "learning_rate": 0.0004108884632933891, "loss": 4.9517, "mean_token_accuracy": 0.2074008494615555, "num_tokens": 66678971.0, "step": 38440 }, { "entropy": 5.814666414260865, "epoch": 2.991169033262011, "grad_norm": 1.3203125, "learning_rate": 0.00041086637229692893, "loss": 5.0762, "mean_token_accuracy": 0.20274681597948074, "num_tokens": 66687217.0, "step": 38445 }, { "entropy": 5.755166864395141, "epoch": 2.991558062633729, "grad_norm": 1.2109375, "learning_rate": 0.00041084427923891275, "loss": 4.9118, "mean_token_accuracy": 0.2109092652797699, "num_tokens": 66696020.0, "step": 38450 }, { "entropy": 5.784342670440674, "epoch": 2.9919470920054465, "grad_norm": 1.3125, "learning_rate": 0.00041082218411967586, "loss": 5.0289, "mean_token_accuracy": 0.20709141194820405, "num_tokens": 66704652.0, "step": 38455 }, { "entropy": 5.765918159484864, "epoch": 2.992336121377164, "grad_norm": 1.171875, "learning_rate": 0.00041080008693955355, "loss": 5.0065, "mean_token_accuracy": 0.21026127338409423, "num_tokens": 66713803.0, "step": 38460 }, { "entropy": 5.732566833496094, "epoch": 2.9927251507488815, "grad_norm": 1.2109375, "learning_rate": 0.0004107779876988811, "loss": 4.8838, "mean_token_accuracy": 0.21865480542182922, "num_tokens": 66722102.0, "step": 38465 }, { "entropy": 5.733516454696655, "epoch": 2.993114180120599, "grad_norm": 1.3515625, "learning_rate": 0.00041075588639799375, "loss": 4.963, "mean_token_accuracy": 0.21237993240356445, "num_tokens": 66729951.0, "step": 38470 }, { "entropy": 5.697514390945434, "epoch": 2.9935032094923164, "grad_norm": 1.328125, "learning_rate": 0.0004107337830372269, "loss": 4.9372, "mean_token_accuracy": 0.20656849890947343, "num_tokens": 66738737.0, "step": 38475 }, { "entropy": 5.769795513153076, "epoch": 2.993892238864034, "grad_norm": 1.2265625, "learning_rate": 0.000410711677616916, "loss": 4.9783, "mean_token_accuracy": 0.20565010309219361, "num_tokens": 66747436.0, "step": 38480 }, { "entropy": 5.805146980285644, "epoch": 2.994281268235752, "grad_norm": 1.25, "learning_rate": 0.0004106895701373963, "loss": 5.0378, "mean_token_accuracy": 0.2061385065317154, "num_tokens": 66756274.0, "step": 38485 }, { "entropy": 5.71694049835205, "epoch": 2.9946702976074695, "grad_norm": 1.3828125, "learning_rate": 0.00041066746059900336, "loss": 4.915, "mean_token_accuracy": 0.21304097920656204, "num_tokens": 66765002.0, "step": 38490 }, { "entropy": 5.711454439163208, "epoch": 2.995059326979187, "grad_norm": 1.28125, "learning_rate": 0.0004106453490020727, "loss": 4.9663, "mean_token_accuracy": 0.20740969330072404, "num_tokens": 66773478.0, "step": 38495 }, { "entropy": 5.763480615615845, "epoch": 2.9954483563509045, "grad_norm": 1.28125, "learning_rate": 0.00041062323534693973, "loss": 5.0176, "mean_token_accuracy": 0.20974729657173158, "num_tokens": 66781694.0, "step": 38500 }, { "entropy": 5.7504345893859865, "epoch": 2.995837385722622, "grad_norm": 1.1875, "learning_rate": 0.00041060111963394004, "loss": 4.9875, "mean_token_accuracy": 0.20956162959337235, "num_tokens": 66790513.0, "step": 38505 }, { "entropy": 5.720385456085205, "epoch": 2.9962264150943394, "grad_norm": 1.2578125, "learning_rate": 0.00041057900186340917, "loss": 4.8819, "mean_token_accuracy": 0.21445202231407165, "num_tokens": 66798661.0, "step": 38510 }, { "entropy": 5.744590139389038, "epoch": 2.996615444466057, "grad_norm": 1.25, "learning_rate": 0.00041055688203568274, "loss": 5.0166, "mean_token_accuracy": 0.20719115436077118, "num_tokens": 66807516.0, "step": 38515 }, { "entropy": 5.707797813415527, "epoch": 2.997004473837775, "grad_norm": 1.2890625, "learning_rate": 0.0004105347601510964, "loss": 4.8012, "mean_token_accuracy": 0.22146872878074647, "num_tokens": 66816753.0, "step": 38520 }, { "entropy": 5.746677684783935, "epoch": 2.9973935032094925, "grad_norm": 1.1953125, "learning_rate": 0.0004105126362099859, "loss": 4.9792, "mean_token_accuracy": 0.21039930284023284, "num_tokens": 66825313.0, "step": 38525 }, { "entropy": 5.774389600753784, "epoch": 2.9977825325812097, "grad_norm": 1.2265625, "learning_rate": 0.0004104905102126867, "loss": 5.0607, "mean_token_accuracy": 0.19798608422279357, "num_tokens": 66833899.0, "step": 38530 }, { "entropy": 5.7406891822814945, "epoch": 2.9981715619529274, "grad_norm": 1.2734375, "learning_rate": 0.0004104683821595347, "loss": 4.965, "mean_token_accuracy": 0.20784751027822496, "num_tokens": 66842515.0, "step": 38535 }, { "entropy": 5.7687653541564945, "epoch": 2.998560591324645, "grad_norm": 1.171875, "learning_rate": 0.00041044625205086566, "loss": 4.9371, "mean_token_accuracy": 0.20992920100688933, "num_tokens": 66851112.0, "step": 38540 }, { "entropy": 5.69510407447815, "epoch": 2.9989496206963624, "grad_norm": 1.1953125, "learning_rate": 0.00041042411988701535, "loss": 4.9466, "mean_token_accuracy": 0.21230171918869017, "num_tokens": 66860163.0, "step": 38545 }, { "entropy": 5.75424108505249, "epoch": 2.99933865006808, "grad_norm": 1.1953125, "learning_rate": 0.00041040198566831944, "loss": 4.992, "mean_token_accuracy": 0.2104624703526497, "num_tokens": 66868532.0, "step": 38550 }, { "entropy": 5.69028058052063, "epoch": 2.999727679439798, "grad_norm": 1.3203125, "learning_rate": 0.0004103798493951141, "loss": 4.9551, "mean_token_accuracy": 0.2060410648584366, "num_tokens": 66877524.0, "step": 38555 }, { "entropy": 5.710945765177409, "epoch": 3.0000778058743434, "grad_norm": 1.2421875, "learning_rate": 0.00041035771106773483, "loss": 4.8941, "mean_token_accuracy": 0.21177851491504246, "num_tokens": 66884807.0, "step": 38560 }, { "entropy": 5.791142559051513, "epoch": 3.000466835246061, "grad_norm": 1.1953125, "learning_rate": 0.0004103355706865179, "loss": 4.9455, "mean_token_accuracy": 0.21445183157920839, "num_tokens": 66894200.0, "step": 38565 }, { "entropy": 5.686918258666992, "epoch": 3.0008558646177788, "grad_norm": 1.171875, "learning_rate": 0.000410313428251799, "loss": 4.9508, "mean_token_accuracy": 0.21561605483293533, "num_tokens": 66903302.0, "step": 38570 }, { "entropy": 5.7380280017852785, "epoch": 3.001244893989496, "grad_norm": 1.2578125, "learning_rate": 0.00041029128376391424, "loss": 4.9301, "mean_token_accuracy": 0.20791093111038209, "num_tokens": 66911441.0, "step": 38575 }, { "entropy": 5.720616292953491, "epoch": 3.0016339233612137, "grad_norm": 1.390625, "learning_rate": 0.00041026913722319954, "loss": 4.9311, "mean_token_accuracy": 0.2156571090221405, "num_tokens": 66920167.0, "step": 38580 }, { "entropy": 5.7749182224273685, "epoch": 3.0020229527329314, "grad_norm": 1.203125, "learning_rate": 0.000410246988629991, "loss": 4.9806, "mean_token_accuracy": 0.20120503902435302, "num_tokens": 66928839.0, "step": 38585 }, { "entropy": 5.754401540756225, "epoch": 3.002411982104649, "grad_norm": 1.25, "learning_rate": 0.00041022483798462466, "loss": 4.9812, "mean_token_accuracy": 0.2106250911951065, "num_tokens": 66937779.0, "step": 38590 }, { "entropy": 5.764439344406128, "epoch": 3.0028010114763664, "grad_norm": 1.2265625, "learning_rate": 0.0004102026852874367, "loss": 4.9333, "mean_token_accuracy": 0.213492488861084, "num_tokens": 66946059.0, "step": 38595 }, { "entropy": 5.786048173904419, "epoch": 3.003190040848084, "grad_norm": 1.2265625, "learning_rate": 0.00041018053053876316, "loss": 4.9617, "mean_token_accuracy": 0.20981108546257018, "num_tokens": 66955201.0, "step": 38600 }, { "entropy": 5.797392463684082, "epoch": 3.0035790702198017, "grad_norm": 2.03125, "learning_rate": 0.0004101583737389402, "loss": 4.896, "mean_token_accuracy": 0.21738944351673126, "num_tokens": 66963529.0, "step": 38605 }, { "entropy": 5.820156097412109, "epoch": 3.003968099591519, "grad_norm": 1.25, "learning_rate": 0.00041013621488830406, "loss": 5.0322, "mean_token_accuracy": 0.1968762382864952, "num_tokens": 66972224.0, "step": 38610 }, { "entropy": 5.825885152816772, "epoch": 3.0043571289632367, "grad_norm": 1.3046875, "learning_rate": 0.00041011405398719096, "loss": 5.0059, "mean_token_accuracy": 0.20220792293548584, "num_tokens": 66981036.0, "step": 38615 }, { "entropy": 5.800108289718628, "epoch": 3.0047461583349544, "grad_norm": 1.28125, "learning_rate": 0.00041009189103593716, "loss": 4.9448, "mean_token_accuracy": 0.20585397332906724, "num_tokens": 66989511.0, "step": 38620 }, { "entropy": 5.782093048095703, "epoch": 3.0051351877066717, "grad_norm": 1.25, "learning_rate": 0.0004100697260348789, "loss": 4.9217, "mean_token_accuracy": 0.20810072124004364, "num_tokens": 66998521.0, "step": 38625 }, { "entropy": 5.716224718093872, "epoch": 3.0055242170783893, "grad_norm": 1.28125, "learning_rate": 0.00041004755898435254, "loss": 4.8177, "mean_token_accuracy": 0.22549835741519927, "num_tokens": 67007173.0, "step": 38630 }, { "entropy": 5.71312403678894, "epoch": 3.005913246450107, "grad_norm": 1.34375, "learning_rate": 0.0004100253898846945, "loss": 4.9672, "mean_token_accuracy": 0.20299778431653975, "num_tokens": 67015671.0, "step": 38635 }, { "entropy": 5.72544641494751, "epoch": 3.0063022758218247, "grad_norm": 1.34375, "learning_rate": 0.000410003218736241, "loss": 4.9355, "mean_token_accuracy": 0.21171251982450484, "num_tokens": 67023501.0, "step": 38640 }, { "entropy": 5.8085489749908445, "epoch": 3.006691305193542, "grad_norm": 1.2265625, "learning_rate": 0.00040998104553932856, "loss": 5.031, "mean_token_accuracy": 0.20339032411575317, "num_tokens": 67032409.0, "step": 38645 }, { "entropy": 5.84272141456604, "epoch": 3.0070803345652597, "grad_norm": 1.46875, "learning_rate": 0.0004099588702942936, "loss": 5.0034, "mean_token_accuracy": 0.20583265274763107, "num_tokens": 67041128.0, "step": 38650 }, { "entropy": 5.770159339904785, "epoch": 3.0074693639369774, "grad_norm": 1.3359375, "learning_rate": 0.00040993669300147257, "loss": 4.951, "mean_token_accuracy": 0.21565534323453903, "num_tokens": 67050000.0, "step": 38655 }, { "entropy": 5.763939285278321, "epoch": 3.0078583933086946, "grad_norm": 1.265625, "learning_rate": 0.00040991451366120205, "loss": 4.9468, "mean_token_accuracy": 0.20793238431215286, "num_tokens": 67059064.0, "step": 38660 }, { "entropy": 5.752371501922608, "epoch": 3.0082474226804123, "grad_norm": 1.2578125, "learning_rate": 0.0004098923322738185, "loss": 4.9442, "mean_token_accuracy": 0.21327605843544006, "num_tokens": 67067710.0, "step": 38665 }, { "entropy": 5.740877294540406, "epoch": 3.00863645205213, "grad_norm": 1.3359375, "learning_rate": 0.00040987014883965843, "loss": 4.9194, "mean_token_accuracy": 0.21167029440402985, "num_tokens": 67075709.0, "step": 38670 }, { "entropy": 5.824728918075562, "epoch": 3.0090254814238473, "grad_norm": 1.328125, "learning_rate": 0.00040984796335905867, "loss": 4.9979, "mean_token_accuracy": 0.20370995998382568, "num_tokens": 67084509.0, "step": 38675 }, { "entropy": 5.788042640686035, "epoch": 3.009414510795565, "grad_norm": 1.265625, "learning_rate": 0.0004098257758323556, "loss": 4.9589, "mean_token_accuracy": 0.2113847702741623, "num_tokens": 67092826.0, "step": 38680 }, { "entropy": 5.756755399703979, "epoch": 3.0098035401672827, "grad_norm": 1.21875, "learning_rate": 0.0004098035862598859, "loss": 4.9216, "mean_token_accuracy": 0.210196353495121, "num_tokens": 67101379.0, "step": 38685 }, { "entropy": 5.796127796173096, "epoch": 3.0101925695390004, "grad_norm": 1.296875, "learning_rate": 0.0004097813946419865, "loss": 5.0113, "mean_token_accuracy": 0.2040318638086319, "num_tokens": 67110550.0, "step": 38690 }, { "entropy": 5.735618782043457, "epoch": 3.0105815989107176, "grad_norm": 1.2421875, "learning_rate": 0.0004097592009789939, "loss": 4.8391, "mean_token_accuracy": 0.22018862068653106, "num_tokens": 67119183.0, "step": 38695 }, { "entropy": 5.815178442001343, "epoch": 3.0109706282824353, "grad_norm": 1.2421875, "learning_rate": 0.00040973700527124494, "loss": 4.9564, "mean_token_accuracy": 0.20765087008476257, "num_tokens": 67127765.0, "step": 38700 }, { "entropy": 5.847450208663941, "epoch": 3.011359657654153, "grad_norm": 1.21875, "learning_rate": 0.00040971480751907633, "loss": 5.0975, "mean_token_accuracy": 0.20357577949762345, "num_tokens": 67136395.0, "step": 38705 }, { "entropy": 5.769359302520752, "epoch": 3.0117486870258703, "grad_norm": 1.375, "learning_rate": 0.00040969260772282494, "loss": 4.8919, "mean_token_accuracy": 0.21423709094524385, "num_tokens": 67144458.0, "step": 38710 }, { "entropy": 5.804913568496704, "epoch": 3.012137716397588, "grad_norm": 1.3046875, "learning_rate": 0.0004096704058828277, "loss": 4.9811, "mean_token_accuracy": 0.20918814241886138, "num_tokens": 67153363.0, "step": 38715 }, { "entropy": 5.781003999710083, "epoch": 3.0125267457693057, "grad_norm": 1.2578125, "learning_rate": 0.00040964820199942135, "loss": 4.9008, "mean_token_accuracy": 0.21344236582517623, "num_tokens": 67162231.0, "step": 38720 }, { "entropy": 5.741076421737671, "epoch": 3.012915775141023, "grad_norm": 1.25, "learning_rate": 0.0004096259960729428, "loss": 4.8992, "mean_token_accuracy": 0.21578937768936157, "num_tokens": 67170726.0, "step": 38725 }, { "entropy": 5.777537107467651, "epoch": 3.0133048045127406, "grad_norm": 1.21875, "learning_rate": 0.00040960378810372906, "loss": 5.0008, "mean_token_accuracy": 0.20782314836978913, "num_tokens": 67179617.0, "step": 38730 }, { "entropy": 5.746387720108032, "epoch": 3.0136938338844583, "grad_norm": 1.1796875, "learning_rate": 0.0004095815780921171, "loss": 4.931, "mean_token_accuracy": 0.2181040182709694, "num_tokens": 67187990.0, "step": 38735 }, { "entropy": 5.805026531219482, "epoch": 3.014082863256176, "grad_norm": 1.328125, "learning_rate": 0.0004095593660384439, "loss": 4.9047, "mean_token_accuracy": 0.21347876638174057, "num_tokens": 67196549.0, "step": 38740 }, { "entropy": 5.810295677185058, "epoch": 3.0144718926278933, "grad_norm": 1.2578125, "learning_rate": 0.0004095371519430465, "loss": 4.9648, "mean_token_accuracy": 0.20977624654769897, "num_tokens": 67205206.0, "step": 38745 }, { "entropy": 5.82351393699646, "epoch": 3.014860921999611, "grad_norm": 1.25, "learning_rate": 0.00040951493580626195, "loss": 5.1021, "mean_token_accuracy": 0.19830751270055771, "num_tokens": 67213582.0, "step": 38750 }, { "entropy": 5.7222741603851315, "epoch": 3.0152499513713287, "grad_norm": 1.2890625, "learning_rate": 0.0004094927176284273, "loss": 4.8982, "mean_token_accuracy": 0.21655819267034532, "num_tokens": 67222300.0, "step": 38755 }, { "entropy": 5.736434507369995, "epoch": 3.015638980743046, "grad_norm": 1.2578125, "learning_rate": 0.00040947049740987977, "loss": 4.8332, "mean_token_accuracy": 0.2174398720264435, "num_tokens": 67230794.0, "step": 38760 }, { "entropy": 5.782102012634278, "epoch": 3.0160280101147636, "grad_norm": 1.296875, "learning_rate": 0.0004094482751509565, "loss": 5.0031, "mean_token_accuracy": 0.20948062241077423, "num_tokens": 67239134.0, "step": 38765 }, { "entropy": 5.779600763320923, "epoch": 3.0164170394864813, "grad_norm": 1.1875, "learning_rate": 0.0004094260508519947, "loss": 4.9529, "mean_token_accuracy": 0.20633677691221236, "num_tokens": 67247929.0, "step": 38770 }, { "entropy": 5.835150527954101, "epoch": 3.0168060688581986, "grad_norm": 1.3125, "learning_rate": 0.00040940382451333144, "loss": 5.0377, "mean_token_accuracy": 0.19676806926727294, "num_tokens": 67255649.0, "step": 38775 }, { "entropy": 5.749681997299194, "epoch": 3.0171950982299163, "grad_norm": 1.3203125, "learning_rate": 0.00040938159613530405, "loss": 4.8784, "mean_token_accuracy": 0.21579378992319107, "num_tokens": 67264004.0, "step": 38780 }, { "entropy": 5.729515218734742, "epoch": 3.017584127601634, "grad_norm": 1.1875, "learning_rate": 0.0004093593657182499, "loss": 4.9211, "mean_token_accuracy": 0.2167251303792, "num_tokens": 67273081.0, "step": 38785 }, { "entropy": 5.780004978179932, "epoch": 3.0179731569733517, "grad_norm": 1.4765625, "learning_rate": 0.0004093371332625062, "loss": 4.9442, "mean_token_accuracy": 0.21318065822124482, "num_tokens": 67282414.0, "step": 38790 }, { "entropy": 5.810172986984253, "epoch": 3.018362186345069, "grad_norm": 1.1953125, "learning_rate": 0.0004093148987684103, "loss": 4.9406, "mean_token_accuracy": 0.20979322195053102, "num_tokens": 67291630.0, "step": 38795 }, { "entropy": 5.781027126312256, "epoch": 3.0187512157167866, "grad_norm": 1.2734375, "learning_rate": 0.00040929266223629966, "loss": 4.9368, "mean_token_accuracy": 0.21050905287265778, "num_tokens": 67300429.0, "step": 38800 }, { "entropy": 5.771558094024658, "epoch": 3.0191402450885043, "grad_norm": 1.2890625, "learning_rate": 0.00040927042366651164, "loss": 4.9169, "mean_token_accuracy": 0.22085565477609634, "num_tokens": 67309374.0, "step": 38805 }, { "entropy": 5.7766424179077145, "epoch": 3.0195292744602216, "grad_norm": 1.21875, "learning_rate": 0.00040924818305938354, "loss": 4.8696, "mean_token_accuracy": 0.21970000118017197, "num_tokens": 67317706.0, "step": 38810 }, { "entropy": 5.692120313644409, "epoch": 3.0199183038319393, "grad_norm": 1.34375, "learning_rate": 0.00040922594041525303, "loss": 4.9114, "mean_token_accuracy": 0.21240868866443635, "num_tokens": 67326754.0, "step": 38815 }, { "entropy": 5.815887069702148, "epoch": 3.020307333203657, "grad_norm": 1.1953125, "learning_rate": 0.0004092036957344574, "loss": 4.9862, "mean_token_accuracy": 0.20628483593463898, "num_tokens": 67336138.0, "step": 38820 }, { "entropy": 5.873916149139404, "epoch": 3.0206963625753747, "grad_norm": 1.2109375, "learning_rate": 0.00040918144901733443, "loss": 5.0219, "mean_token_accuracy": 0.20660205334424972, "num_tokens": 67344712.0, "step": 38825 }, { "entropy": 5.753109359741211, "epoch": 3.021085391947092, "grad_norm": 1.3046875, "learning_rate": 0.0004091592002642215, "loss": 4.8589, "mean_token_accuracy": 0.2241586908698082, "num_tokens": 67352662.0, "step": 38830 }, { "entropy": 5.70209002494812, "epoch": 3.0214744213188096, "grad_norm": 1.3125, "learning_rate": 0.0004091369494754562, "loss": 4.8527, "mean_token_accuracy": 0.2190609261393547, "num_tokens": 67361489.0, "step": 38835 }, { "entropy": 5.7553094863891605, "epoch": 3.0218634506905273, "grad_norm": 1.234375, "learning_rate": 0.0004091146966513763, "loss": 4.8744, "mean_token_accuracy": 0.2175418958067894, "num_tokens": 67369592.0, "step": 38840 }, { "entropy": 5.7961039543151855, "epoch": 3.0222524800622446, "grad_norm": 1.1953125, "learning_rate": 0.00040909244179231926, "loss": 4.9385, "mean_token_accuracy": 0.21575529426336287, "num_tokens": 67378761.0, "step": 38845 }, { "entropy": 5.7453117847442625, "epoch": 3.0226415094339623, "grad_norm": 1.265625, "learning_rate": 0.0004090701848986229, "loss": 4.9039, "mean_token_accuracy": 0.2171661913394928, "num_tokens": 67387574.0, "step": 38850 }, { "entropy": 5.7421118259429935, "epoch": 3.02303053880568, "grad_norm": 1.2734375, "learning_rate": 0.0004090479259706247, "loss": 4.8517, "mean_token_accuracy": 0.22144483625888825, "num_tokens": 67395665.0, "step": 38855 }, { "entropy": 5.819369459152222, "epoch": 3.023419568177397, "grad_norm": 1.2421875, "learning_rate": 0.0004090256650086628, "loss": 4.9614, "mean_token_accuracy": 0.21103609651327132, "num_tokens": 67403480.0, "step": 38860 }, { "entropy": 5.781932306289673, "epoch": 3.023808597549115, "grad_norm": 1.3046875, "learning_rate": 0.00040900340201307475, "loss": 4.9684, "mean_token_accuracy": 0.20906000286340715, "num_tokens": 67411876.0, "step": 38865 }, { "entropy": 5.762634515762329, "epoch": 3.0241976269208326, "grad_norm": 1.2734375, "learning_rate": 0.00040898113698419823, "loss": 4.8831, "mean_token_accuracy": 0.2084784358739853, "num_tokens": 67420267.0, "step": 38870 }, { "entropy": 5.753719615936279, "epoch": 3.0245866562925503, "grad_norm": 1.2890625, "learning_rate": 0.0004089588699223713, "loss": 4.9061, "mean_token_accuracy": 0.2112307146191597, "num_tokens": 67428707.0, "step": 38875 }, { "entropy": 5.790412855148316, "epoch": 3.0249756856642676, "grad_norm": 1.265625, "learning_rate": 0.00040893660082793167, "loss": 4.9883, "mean_token_accuracy": 0.20740681886672974, "num_tokens": 67437061.0, "step": 38880 }, { "entropy": 5.782514524459839, "epoch": 3.0253647150359853, "grad_norm": 1.3828125, "learning_rate": 0.00040891432970121736, "loss": 4.967, "mean_token_accuracy": 0.20520188361406327, "num_tokens": 67445270.0, "step": 38885 }, { "entropy": 5.739250564575196, "epoch": 3.025753744407703, "grad_norm": 1.265625, "learning_rate": 0.00040889205654256615, "loss": 4.9629, "mean_token_accuracy": 0.20400436818599701, "num_tokens": 67453960.0, "step": 38890 }, { "entropy": 5.835293865203857, "epoch": 3.02614277377942, "grad_norm": 1.2109375, "learning_rate": 0.00040886978135231625, "loss": 5.0049, "mean_token_accuracy": 0.2024360179901123, "num_tokens": 67462124.0, "step": 38895 }, { "entropy": 5.746919250488281, "epoch": 3.026531803151138, "grad_norm": 1.2109375, "learning_rate": 0.00040884750413080535, "loss": 4.8568, "mean_token_accuracy": 0.21170284152030944, "num_tokens": 67470762.0, "step": 38900 }, { "entropy": 5.7531877040863035, "epoch": 3.0269208325228556, "grad_norm": 1.2578125, "learning_rate": 0.00040882522487837176, "loss": 4.9116, "mean_token_accuracy": 0.21013229340314865, "num_tokens": 67479363.0, "step": 38905 }, { "entropy": 5.752018785476684, "epoch": 3.027309861894573, "grad_norm": 1.25, "learning_rate": 0.00040880294359535327, "loss": 4.9264, "mean_token_accuracy": 0.21446655243635177, "num_tokens": 67487803.0, "step": 38910 }, { "entropy": 5.794632196426392, "epoch": 3.0276988912662905, "grad_norm": 1.328125, "learning_rate": 0.00040878066028208804, "loss": 5.0275, "mean_token_accuracy": 0.2022012948989868, "num_tokens": 67496524.0, "step": 38915 }, { "entropy": 5.712293338775635, "epoch": 3.0280879206380082, "grad_norm": 1.25, "learning_rate": 0.00040875837493891434, "loss": 4.9233, "mean_token_accuracy": 0.20832296162843705, "num_tokens": 67505327.0, "step": 38920 }, { "entropy": 5.712574481964111, "epoch": 3.028476950009726, "grad_norm": 1.2421875, "learning_rate": 0.0004087360875661701, "loss": 4.8732, "mean_token_accuracy": 0.216759617626667, "num_tokens": 67514216.0, "step": 38925 }, { "entropy": 5.749611568450928, "epoch": 3.028865979381443, "grad_norm": 1.3203125, "learning_rate": 0.00040871379816419376, "loss": 4.9555, "mean_token_accuracy": 0.21068477183580397, "num_tokens": 67522957.0, "step": 38930 }, { "entropy": 5.728671646118164, "epoch": 3.029255008753161, "grad_norm": 1.203125, "learning_rate": 0.0004086915067333232, "loss": 4.9216, "mean_token_accuracy": 0.21332569420337677, "num_tokens": 67532013.0, "step": 38935 }, { "entropy": 5.649725866317749, "epoch": 3.0296440381248786, "grad_norm": 1.1953125, "learning_rate": 0.0004086692132738968, "loss": 4.8191, "mean_token_accuracy": 0.21994998008012773, "num_tokens": 67540683.0, "step": 38940 }, { "entropy": 5.86691689491272, "epoch": 3.030033067496596, "grad_norm": 1.2109375, "learning_rate": 0.000408646917786253, "loss": 5.0591, "mean_token_accuracy": 0.20109203904867173, "num_tokens": 67549697.0, "step": 38945 }, { "entropy": 5.739890289306641, "epoch": 3.0304220968683135, "grad_norm": 1.3359375, "learning_rate": 0.0004086246202707298, "loss": 4.871, "mean_token_accuracy": 0.21212777942419053, "num_tokens": 67557335.0, "step": 38950 }, { "entropy": 5.70845947265625, "epoch": 3.0308111262400312, "grad_norm": 1.2265625, "learning_rate": 0.00040860232072766577, "loss": 4.9246, "mean_token_accuracy": 0.2063554972410202, "num_tokens": 67565542.0, "step": 38955 }, { "entropy": 5.7423272132873535, "epoch": 3.0312001556117485, "grad_norm": 1.3828125, "learning_rate": 0.0004085800191573991, "loss": 4.8836, "mean_token_accuracy": 0.2126782938838005, "num_tokens": 67573413.0, "step": 38960 }, { "entropy": 5.718665933609008, "epoch": 3.031589184983466, "grad_norm": 1.3203125, "learning_rate": 0.0004085577155602683, "loss": 4.7558, "mean_token_accuracy": 0.22742581963539124, "num_tokens": 67581912.0, "step": 38965 }, { "entropy": 5.743589782714844, "epoch": 3.031978214355184, "grad_norm": 1.3203125, "learning_rate": 0.00040853540993661175, "loss": 4.8965, "mean_token_accuracy": 0.21669421195983887, "num_tokens": 67591344.0, "step": 38970 }, { "entropy": 5.779635334014893, "epoch": 3.0323672437269016, "grad_norm": 1.296875, "learning_rate": 0.00040851310228676787, "loss": 4.9981, "mean_token_accuracy": 0.2045698031783104, "num_tokens": 67599680.0, "step": 38975 }, { "entropy": 5.785592937469483, "epoch": 3.032756273098619, "grad_norm": 1.34375, "learning_rate": 0.0004084907926110752, "loss": 4.9215, "mean_token_accuracy": 0.20775238126516343, "num_tokens": 67608420.0, "step": 38980 }, { "entropy": 5.756100225448608, "epoch": 3.0331453024703365, "grad_norm": 1.2578125, "learning_rate": 0.0004084684809098722, "loss": 4.9658, "mean_token_accuracy": 0.20475578159093857, "num_tokens": 67617174.0, "step": 38985 }, { "entropy": 5.787242794036866, "epoch": 3.0335343318420542, "grad_norm": 1.3984375, "learning_rate": 0.00040844616718349743, "loss": 4.9729, "mean_token_accuracy": 0.2028190091252327, "num_tokens": 67625273.0, "step": 38990 }, { "entropy": 5.828755283355713, "epoch": 3.0339233612137715, "grad_norm": 1.25, "learning_rate": 0.00040842385143228946, "loss": 5.0022, "mean_token_accuracy": 0.20483621656894685, "num_tokens": 67633982.0, "step": 38995 }, { "entropy": 5.816717910766601, "epoch": 3.034312390585489, "grad_norm": 1.3125, "learning_rate": 0.00040840153365658693, "loss": 4.979, "mean_token_accuracy": 0.20942473262548447, "num_tokens": 67642739.0, "step": 39000 }, { "epoch": 3.034312390585489, "eval_entropy": 5.502825894966162, "eval_loss": 5.049113750457764, "eval_mean_token_accuracy": 0.21488728179480734, "eval_num_tokens": 67642739.0, "eval_runtime": 21.6709, "eval_samples_per_second": 1917.688, "eval_steps_per_second": 239.723, "step": 39000 }, { "entropy": 5.760551691055298, "epoch": 3.034701419957207, "grad_norm": 1.1484375, "learning_rate": 0.00040837921385672855, "loss": 5.0207, "mean_token_accuracy": 0.2050407648086548, "num_tokens": 67652025.0, "step": 39005 }, { "entropy": 5.814124059677124, "epoch": 3.035090449328924, "grad_norm": 1.2734375, "learning_rate": 0.00040835689203305275, "loss": 4.9969, "mean_token_accuracy": 0.2020278975367546, "num_tokens": 67660521.0, "step": 39010 }, { "entropy": 5.786734199523925, "epoch": 3.035479478700642, "grad_norm": 1.34375, "learning_rate": 0.00040833456818589845, "loss": 4.9353, "mean_token_accuracy": 0.20891972333192826, "num_tokens": 67668590.0, "step": 39015 }, { "entropy": 5.720639610290528, "epoch": 3.0358685080723595, "grad_norm": 1.2890625, "learning_rate": 0.00040831224231560424, "loss": 4.904, "mean_token_accuracy": 0.211442469060421, "num_tokens": 67676815.0, "step": 39020 }, { "entropy": 5.724521923065185, "epoch": 3.0362575374440772, "grad_norm": 1.2578125, "learning_rate": 0.000408289914422509, "loss": 4.8891, "mean_token_accuracy": 0.21161848306655884, "num_tokens": 67685417.0, "step": 39025 }, { "entropy": 5.698367500305176, "epoch": 3.0366465668157945, "grad_norm": 1.296875, "learning_rate": 0.0004082675845069515, "loss": 4.8637, "mean_token_accuracy": 0.21829329878091813, "num_tokens": 67693758.0, "step": 39030 }, { "entropy": 5.797330713272094, "epoch": 3.037035596187512, "grad_norm": 1.3203125, "learning_rate": 0.0004082452525692704, "loss": 4.9764, "mean_token_accuracy": 0.20921367257833481, "num_tokens": 67701762.0, "step": 39035 }, { "entropy": 5.715843391418457, "epoch": 3.03742462555923, "grad_norm": 1.3203125, "learning_rate": 0.00040822291860980484, "loss": 4.8741, "mean_token_accuracy": 0.2157423198223114, "num_tokens": 67710786.0, "step": 39040 }, { "entropy": 5.773695564270019, "epoch": 3.037813654930947, "grad_norm": 1.2890625, "learning_rate": 0.00040820058262889343, "loss": 4.9844, "mean_token_accuracy": 0.20783009082078935, "num_tokens": 67718902.0, "step": 39045 }, { "entropy": 5.786623859405518, "epoch": 3.038202684302665, "grad_norm": 1.34375, "learning_rate": 0.00040817824462687516, "loss": 4.9162, "mean_token_accuracy": 0.21336370706558228, "num_tokens": 67727194.0, "step": 39050 }, { "entropy": 5.804684638977051, "epoch": 3.0385917136743825, "grad_norm": 1.265625, "learning_rate": 0.00040815590460408906, "loss": 4.9354, "mean_token_accuracy": 0.21190279722213745, "num_tokens": 67735463.0, "step": 39055 }, { "entropy": 5.715198373794555, "epoch": 3.0389807430460998, "grad_norm": 1.296875, "learning_rate": 0.00040813356256087395, "loss": 4.8629, "mean_token_accuracy": 0.21835399568080902, "num_tokens": 67744505.0, "step": 39060 }, { "entropy": 5.734085321426392, "epoch": 3.0393697724178175, "grad_norm": 1.328125, "learning_rate": 0.0004081112184975691, "loss": 4.9641, "mean_token_accuracy": 0.20090840011835098, "num_tokens": 67753709.0, "step": 39065 }, { "entropy": 5.7642467498779295, "epoch": 3.039758801789535, "grad_norm": 1.3203125, "learning_rate": 0.0004080888724145132, "loss": 4.9461, "mean_token_accuracy": 0.20791601538658142, "num_tokens": 67761659.0, "step": 39070 }, { "entropy": 5.7474609375, "epoch": 3.040147831161253, "grad_norm": 1.2890625, "learning_rate": 0.0004080665243120456, "loss": 4.9459, "mean_token_accuracy": 0.2097438782453537, "num_tokens": 67769644.0, "step": 39075 }, { "entropy": 5.761591815948487, "epoch": 3.04053686053297, "grad_norm": 1.2578125, "learning_rate": 0.0004080441741905053, "loss": 4.9978, "mean_token_accuracy": 0.20149799585342407, "num_tokens": 67779208.0, "step": 39080 }, { "entropy": 5.816317176818847, "epoch": 3.040925889904688, "grad_norm": 1.2109375, "learning_rate": 0.0004080218220502314, "loss": 5.013, "mean_token_accuracy": 0.21056080013513565, "num_tokens": 67788542.0, "step": 39085 }, { "entropy": 5.768927907943725, "epoch": 3.0413149192764055, "grad_norm": 1.390625, "learning_rate": 0.00040799946789156304, "loss": 4.9581, "mean_token_accuracy": 0.20755518227815628, "num_tokens": 67796863.0, "step": 39090 }, { "entropy": 5.77177586555481, "epoch": 3.0417039486481228, "grad_norm": 1.296875, "learning_rate": 0.00040797711171483954, "loss": 4.988, "mean_token_accuracy": 0.2144743651151657, "num_tokens": 67805860.0, "step": 39095 }, { "entropy": 5.726226186752319, "epoch": 3.0420929780198405, "grad_norm": 1.2890625, "learning_rate": 0.0004079547535203999, "loss": 4.8772, "mean_token_accuracy": 0.21508204191923141, "num_tokens": 67814110.0, "step": 39100 }, { "entropy": 5.769148826599121, "epoch": 3.042482007391558, "grad_norm": 1.3125, "learning_rate": 0.0004079323933085836, "loss": 4.9477, "mean_token_accuracy": 0.20873139202594757, "num_tokens": 67822460.0, "step": 39105 }, { "entropy": 5.816865062713623, "epoch": 3.0428710367632754, "grad_norm": 1.328125, "learning_rate": 0.00040791003107972976, "loss": 5.0464, "mean_token_accuracy": 0.2106510728597641, "num_tokens": 67830833.0, "step": 39110 }, { "entropy": 5.741622066497802, "epoch": 3.043260066134993, "grad_norm": 1.2265625, "learning_rate": 0.0004078876668341778, "loss": 4.9036, "mean_token_accuracy": 0.21480145901441575, "num_tokens": 67839009.0, "step": 39115 }, { "entropy": 5.748734474182129, "epoch": 3.043649095506711, "grad_norm": 1.2265625, "learning_rate": 0.0004078653005722669, "loss": 4.9741, "mean_token_accuracy": 0.2128509223461151, "num_tokens": 67847589.0, "step": 39120 }, { "entropy": 5.72815899848938, "epoch": 3.0440381248784285, "grad_norm": 1.234375, "learning_rate": 0.0004078429322943366, "loss": 4.9102, "mean_token_accuracy": 0.2067059949040413, "num_tokens": 67856516.0, "step": 39125 }, { "entropy": 5.745333528518676, "epoch": 3.0444271542501458, "grad_norm": 1.28125, "learning_rate": 0.00040782056200072627, "loss": 4.9728, "mean_token_accuracy": 0.2099539279937744, "num_tokens": 67864877.0, "step": 39130 }, { "entropy": 5.730934095382691, "epoch": 3.0448161836218635, "grad_norm": 1.171875, "learning_rate": 0.00040779818969177527, "loss": 4.9225, "mean_token_accuracy": 0.20815183818340302, "num_tokens": 67873437.0, "step": 39135 }, { "entropy": 5.812160301208496, "epoch": 3.045205212993581, "grad_norm": 1.203125, "learning_rate": 0.00040777581536782315, "loss": 4.9663, "mean_token_accuracy": 0.21979974061250687, "num_tokens": 67882222.0, "step": 39140 }, { "entropy": 5.725315904617309, "epoch": 3.0455942423652984, "grad_norm": 1.2578125, "learning_rate": 0.0004077534390292093, "loss": 4.9319, "mean_token_accuracy": 0.21306637674570084, "num_tokens": 67890886.0, "step": 39145 }, { "entropy": 5.764017820358276, "epoch": 3.045983271737016, "grad_norm": 1.25, "learning_rate": 0.00040773106067627335, "loss": 4.9605, "mean_token_accuracy": 0.21176708489656448, "num_tokens": 67899239.0, "step": 39150 }, { "entropy": 5.785585546493531, "epoch": 3.046372301108734, "grad_norm": 1.2265625, "learning_rate": 0.00040770868030935486, "loss": 4.9147, "mean_token_accuracy": 0.2149684578180313, "num_tokens": 67907679.0, "step": 39155 }, { "entropy": 5.771771049499511, "epoch": 3.046761330480451, "grad_norm": 1.375, "learning_rate": 0.00040768629792879344, "loss": 4.9548, "mean_token_accuracy": 0.2076895222067833, "num_tokens": 67916437.0, "step": 39160 }, { "entropy": 5.752957105636597, "epoch": 3.0471503598521688, "grad_norm": 1.3046875, "learning_rate": 0.0004076639135349284, "loss": 4.964, "mean_token_accuracy": 0.2052147164940834, "num_tokens": 67924961.0, "step": 39165 }, { "entropy": 5.7660839557647705, "epoch": 3.0475393892238865, "grad_norm": 1.2265625, "learning_rate": 0.00040764152712809983, "loss": 4.8513, "mean_token_accuracy": 0.2262889638543129, "num_tokens": 67933854.0, "step": 39170 }, { "entropy": 5.732032632827758, "epoch": 3.047928418595604, "grad_norm": 1.4375, "learning_rate": 0.0004076191387086472, "loss": 4.9022, "mean_token_accuracy": 0.2152099698781967, "num_tokens": 67942904.0, "step": 39175 }, { "entropy": 5.761520338058472, "epoch": 3.0483174479673214, "grad_norm": 1.21875, "learning_rate": 0.00040759674827691014, "loss": 5.0027, "mean_token_accuracy": 0.2117391973733902, "num_tokens": 67951861.0, "step": 39180 }, { "entropy": 5.761766386032105, "epoch": 3.048706477339039, "grad_norm": 1.140625, "learning_rate": 0.0004075743558332285, "loss": 4.9035, "mean_token_accuracy": 0.21096070408821105, "num_tokens": 67960644.0, "step": 39185 }, { "entropy": 5.815056562423706, "epoch": 3.049095506710757, "grad_norm": 1.234375, "learning_rate": 0.000407551961377942, "loss": 4.9944, "mean_token_accuracy": 0.20504214018583297, "num_tokens": 67969290.0, "step": 39190 }, { "entropy": 5.6987669467926025, "epoch": 3.049484536082474, "grad_norm": 1.21875, "learning_rate": 0.0004075295649113905, "loss": 4.8955, "mean_token_accuracy": 0.2137141615152359, "num_tokens": 67978305.0, "step": 39195 }, { "entropy": 5.801343536376953, "epoch": 3.0498735654541917, "grad_norm": 1.3203125, "learning_rate": 0.00040750716643391384, "loss": 4.9516, "mean_token_accuracy": 0.2107463374733925, "num_tokens": 67986861.0, "step": 39200 }, { "entropy": 5.805468416213989, "epoch": 3.0502625948259094, "grad_norm": 1.2578125, "learning_rate": 0.0004074847659458518, "loss": 4.9586, "mean_token_accuracy": 0.21327392607927323, "num_tokens": 67996003.0, "step": 39205 }, { "entropy": 5.704204988479614, "epoch": 3.050651624197627, "grad_norm": 1.28125, "learning_rate": 0.00040746236344754423, "loss": 4.8129, "mean_token_accuracy": 0.2238614171743393, "num_tokens": 68004398.0, "step": 39210 }, { "entropy": 5.712455177307129, "epoch": 3.0510406535693444, "grad_norm": 1.265625, "learning_rate": 0.0004074399589393312, "loss": 4.9924, "mean_token_accuracy": 0.21066251546144485, "num_tokens": 68013386.0, "step": 39215 }, { "entropy": 5.7345024108886715, "epoch": 3.051429682941062, "grad_norm": 1.2421875, "learning_rate": 0.0004074175524215526, "loss": 4.9274, "mean_token_accuracy": 0.21313873827457427, "num_tokens": 68022541.0, "step": 39220 }, { "entropy": 5.7668561935424805, "epoch": 3.05181871231278, "grad_norm": 1.2890625, "learning_rate": 0.0004073951438945484, "loss": 4.9197, "mean_token_accuracy": 0.21823297441005707, "num_tokens": 68031690.0, "step": 39225 }, { "entropy": 5.80838532447815, "epoch": 3.052207741684497, "grad_norm": 1.2890625, "learning_rate": 0.00040737273335865866, "loss": 5.0344, "mean_token_accuracy": 0.20372162163257598, "num_tokens": 68040863.0, "step": 39230 }, { "entropy": 5.8584551334381105, "epoch": 3.0525967710562147, "grad_norm": 1.2734375, "learning_rate": 0.00040735032081422334, "loss": 4.9702, "mean_token_accuracy": 0.20700934529304504, "num_tokens": 68049066.0, "step": 39235 }, { "entropy": 5.832453966140747, "epoch": 3.0529858004279324, "grad_norm": 1.234375, "learning_rate": 0.00040732790626158257, "loss": 4.9097, "mean_token_accuracy": 0.21329862624406815, "num_tokens": 68057791.0, "step": 39240 }, { "entropy": 5.7638932228088375, "epoch": 3.0533748297996497, "grad_norm": 1.21875, "learning_rate": 0.00040730548970107646, "loss": 5.0012, "mean_token_accuracy": 0.2072589322924614, "num_tokens": 68066587.0, "step": 39245 }, { "entropy": 5.793990182876587, "epoch": 3.0537638591713674, "grad_norm": 1.28125, "learning_rate": 0.0004072830711330451, "loss": 5.0047, "mean_token_accuracy": 0.21428415626287461, "num_tokens": 68074952.0, "step": 39250 }, { "entropy": 5.7308127880096436, "epoch": 3.054152888543085, "grad_norm": 1.34375, "learning_rate": 0.0004072606505578287, "loss": 4.963, "mean_token_accuracy": 0.2153785228729248, "num_tokens": 68084091.0, "step": 39255 }, { "entropy": 5.7604108333587645, "epoch": 3.054541917914803, "grad_norm": 1.3203125, "learning_rate": 0.00040723822797576737, "loss": 4.8893, "mean_token_accuracy": 0.21375963389873504, "num_tokens": 68091968.0, "step": 39260 }, { "entropy": 5.751478052139282, "epoch": 3.05493094728652, "grad_norm": 1.3125, "learning_rate": 0.0004072158033872015, "loss": 4.9955, "mean_token_accuracy": 0.1976011410355568, "num_tokens": 68100925.0, "step": 39265 }, { "entropy": 5.768335294723511, "epoch": 3.0553199766582377, "grad_norm": 1.25, "learning_rate": 0.0004071933767924713, "loss": 4.9734, "mean_token_accuracy": 0.21290189623832703, "num_tokens": 68109518.0, "step": 39270 }, { "entropy": 5.7704774856567385, "epoch": 3.0557090060299554, "grad_norm": 1.328125, "learning_rate": 0.00040717094819191685, "loss": 4.9836, "mean_token_accuracy": 0.20619669407606125, "num_tokens": 68118261.0, "step": 39275 }, { "entropy": 5.761379766464233, "epoch": 3.0560980354016727, "grad_norm": 1.3359375, "learning_rate": 0.00040714851758587875, "loss": 4.9629, "mean_token_accuracy": 0.21849191784858704, "num_tokens": 68126919.0, "step": 39280 }, { "entropy": 5.765096235275268, "epoch": 3.0564870647733904, "grad_norm": 1.3671875, "learning_rate": 0.00040712608497469715, "loss": 4.9517, "mean_token_accuracy": 0.21525786221027374, "num_tokens": 68135157.0, "step": 39285 }, { "entropy": 5.82550277709961, "epoch": 3.056876094145108, "grad_norm": 1.2421875, "learning_rate": 0.0004071036503587126, "loss": 5.1522, "mean_token_accuracy": 0.19806270599365233, "num_tokens": 68145043.0, "step": 39290 }, { "entropy": 5.763582324981689, "epoch": 3.0572651235168253, "grad_norm": 1.265625, "learning_rate": 0.0004070812137382654, "loss": 4.8751, "mean_token_accuracy": 0.21207141876220703, "num_tokens": 68154637.0, "step": 39295 }, { "entropy": 5.7778510570526125, "epoch": 3.057654152888543, "grad_norm": 1.28125, "learning_rate": 0.000407058775113696, "loss": 4.9774, "mean_token_accuracy": 0.21008999794721603, "num_tokens": 68163511.0, "step": 39300 }, { "entropy": 5.750403881072998, "epoch": 3.0580431822602607, "grad_norm": 1.171875, "learning_rate": 0.0004070363344853449, "loss": 4.9375, "mean_token_accuracy": 0.20594925284385682, "num_tokens": 68172108.0, "step": 39305 }, { "entropy": 5.717688846588135, "epoch": 3.0584322116319784, "grad_norm": 1.265625, "learning_rate": 0.00040701389185355256, "loss": 4.8598, "mean_token_accuracy": 0.21840772330760955, "num_tokens": 68180937.0, "step": 39310 }, { "entropy": 5.717485618591309, "epoch": 3.0588212410036957, "grad_norm": 1.3203125, "learning_rate": 0.0004069914472186595, "loss": 4.8042, "mean_token_accuracy": 0.22489549964666367, "num_tokens": 68189588.0, "step": 39315 }, { "entropy": 5.732551908493042, "epoch": 3.0592102703754134, "grad_norm": 1.296875, "learning_rate": 0.0004069690005810063, "loss": 4.8282, "mean_token_accuracy": 0.22416229099035262, "num_tokens": 68198051.0, "step": 39320 }, { "entropy": 5.691645717620849, "epoch": 3.059599299747131, "grad_norm": 1.3203125, "learning_rate": 0.00040694655194093365, "loss": 4.9083, "mean_token_accuracy": 0.21503009647130966, "num_tokens": 68205967.0, "step": 39325 }, { "entropy": 5.777645063400269, "epoch": 3.0599883291188483, "grad_norm": 1.28125, "learning_rate": 0.00040692410129878205, "loss": 4.9777, "mean_token_accuracy": 0.2034858375787735, "num_tokens": 68213773.0, "step": 39330 }, { "entropy": 5.719740581512451, "epoch": 3.060377358490566, "grad_norm": 1.3515625, "learning_rate": 0.0004069016486548922, "loss": 4.9251, "mean_token_accuracy": 0.21305294930934907, "num_tokens": 68222361.0, "step": 39335 }, { "entropy": 5.776933908462524, "epoch": 3.0607663878622837, "grad_norm": 1.28125, "learning_rate": 0.0004068791940096048, "loss": 4.9372, "mean_token_accuracy": 0.2090112641453743, "num_tokens": 68230797.0, "step": 39340 }, { "entropy": 5.771874284744262, "epoch": 3.061155417234001, "grad_norm": 1.28125, "learning_rate": 0.00040685673736326044, "loss": 4.9373, "mean_token_accuracy": 0.21527090817689895, "num_tokens": 68239147.0, "step": 39345 }, { "entropy": 5.723786163330078, "epoch": 3.0615444466057187, "grad_norm": 1.2421875, "learning_rate": 0.0004068342787162001, "loss": 4.8822, "mean_token_accuracy": 0.213077574968338, "num_tokens": 68247988.0, "step": 39350 }, { "entropy": 5.7855321884155275, "epoch": 3.0619334759774364, "grad_norm": 1.21875, "learning_rate": 0.00040681181806876435, "loss": 5.0066, "mean_token_accuracy": 0.20819674730300902, "num_tokens": 68257024.0, "step": 39355 }, { "entropy": 5.789840221405029, "epoch": 3.062322505349154, "grad_norm": 1.40625, "learning_rate": 0.000406789355421294, "loss": 4.9234, "mean_token_accuracy": 0.20716043710708618, "num_tokens": 68265875.0, "step": 39360 }, { "entropy": 5.734454679489136, "epoch": 3.0627115347208713, "grad_norm": 1.328125, "learning_rate": 0.0004067668907741301, "loss": 4.98, "mean_token_accuracy": 0.20469937175512315, "num_tokens": 68274104.0, "step": 39365 }, { "entropy": 5.748278427124023, "epoch": 3.063100564092589, "grad_norm": 1.2734375, "learning_rate": 0.0004067444241276132, "loss": 4.9298, "mean_token_accuracy": 0.21483258455991744, "num_tokens": 68282831.0, "step": 39370 }, { "entropy": 5.786056184768677, "epoch": 3.0634895934643067, "grad_norm": 1.4375, "learning_rate": 0.00040672195548208443, "loss": 4.9635, "mean_token_accuracy": 0.20488976091146469, "num_tokens": 68291062.0, "step": 39375 }, { "entropy": 5.780897188186645, "epoch": 3.063878622836024, "grad_norm": 1.296875, "learning_rate": 0.0004066994848378846, "loss": 4.9343, "mean_token_accuracy": 0.20997628718614578, "num_tokens": 68300490.0, "step": 39380 }, { "entropy": 5.713163757324219, "epoch": 3.0642676522077417, "grad_norm": 1.265625, "learning_rate": 0.00040667701219535473, "loss": 4.8246, "mean_token_accuracy": 0.21923534870147704, "num_tokens": 68309451.0, "step": 39385 }, { "entropy": 5.774997568130493, "epoch": 3.0646566815794594, "grad_norm": 1.390625, "learning_rate": 0.0004066545375548358, "loss": 4.9537, "mean_token_accuracy": 0.21101301163434982, "num_tokens": 68317822.0, "step": 39390 }, { "entropy": 5.769029951095581, "epoch": 3.0650457109511766, "grad_norm": 1.3125, "learning_rate": 0.0004066320609166689, "loss": 4.9953, "mean_token_accuracy": 0.20862487256526946, "num_tokens": 68326732.0, "step": 39395 }, { "entropy": 5.864382553100586, "epoch": 3.0654347403228943, "grad_norm": 1.3359375, "learning_rate": 0.0004066095822811949, "loss": 5.0808, "mean_token_accuracy": 0.19868389517068863, "num_tokens": 68335082.0, "step": 39400 }, { "entropy": 5.782797908782959, "epoch": 3.065823769694612, "grad_norm": 1.2109375, "learning_rate": 0.000406587101648755, "loss": 4.9024, "mean_token_accuracy": 0.21629954725503922, "num_tokens": 68344331.0, "step": 39405 }, { "entropy": 5.734326553344727, "epoch": 3.0662127990663297, "grad_norm": 1.3359375, "learning_rate": 0.0004065646190196902, "loss": 4.9695, "mean_token_accuracy": 0.20621538013219834, "num_tokens": 68353204.0, "step": 39410 }, { "entropy": 5.76788215637207, "epoch": 3.066601828438047, "grad_norm": 1.1875, "learning_rate": 0.0004065421343943417, "loss": 4.9611, "mean_token_accuracy": 0.20831728130578994, "num_tokens": 68362125.0, "step": 39415 }, { "entropy": 5.755284929275513, "epoch": 3.0669908578097647, "grad_norm": 1.3046875, "learning_rate": 0.00040651964777305074, "loss": 4.7834, "mean_token_accuracy": 0.21968006193637848, "num_tokens": 68370916.0, "step": 39420 }, { "entropy": 5.753920269012451, "epoch": 3.0673798871814824, "grad_norm": 1.3125, "learning_rate": 0.0004064971591561585, "loss": 4.9515, "mean_token_accuracy": 0.21481657028198242, "num_tokens": 68379955.0, "step": 39425 }, { "entropy": 5.67555341720581, "epoch": 3.0677689165531996, "grad_norm": 1.3359375, "learning_rate": 0.00040647466854400606, "loss": 4.8259, "mean_token_accuracy": 0.21728423684835435, "num_tokens": 68388698.0, "step": 39430 }, { "entropy": 5.776620817184448, "epoch": 3.0681579459249173, "grad_norm": 1.3359375, "learning_rate": 0.0004064521759369349, "loss": 4.9991, "mean_token_accuracy": 0.20366449654102325, "num_tokens": 68398304.0, "step": 39435 }, { "entropy": 5.69122462272644, "epoch": 3.068546975296635, "grad_norm": 1.203125, "learning_rate": 0.00040642968133528613, "loss": 4.8471, "mean_token_accuracy": 0.22800374031066895, "num_tokens": 68406605.0, "step": 39440 }, { "entropy": 5.789189863204956, "epoch": 3.0689360046683523, "grad_norm": 1.265625, "learning_rate": 0.0004064071847394012, "loss": 4.9866, "mean_token_accuracy": 0.21518452763557433, "num_tokens": 68415621.0, "step": 39445 }, { "entropy": 5.7972753047943115, "epoch": 3.06932503404007, "grad_norm": 1.234375, "learning_rate": 0.0004063846861496213, "loss": 4.8933, "mean_token_accuracy": 0.21743236631155013, "num_tokens": 68424571.0, "step": 39450 }, { "entropy": 5.711740207672119, "epoch": 3.0697140634117877, "grad_norm": 1.3359375, "learning_rate": 0.000406362185566288, "loss": 4.9219, "mean_token_accuracy": 0.21436226963996888, "num_tokens": 68433584.0, "step": 39455 }, { "entropy": 5.702483177185059, "epoch": 3.0701030927835053, "grad_norm": 1.2578125, "learning_rate": 0.0004063396829897426, "loss": 4.8993, "mean_token_accuracy": 0.21232127100229264, "num_tokens": 68441801.0, "step": 39460 }, { "entropy": 5.716058015823364, "epoch": 3.0704921221552226, "grad_norm": 1.2890625, "learning_rate": 0.0004063171784203265, "loss": 4.8526, "mean_token_accuracy": 0.21208134442567825, "num_tokens": 68449838.0, "step": 39465 }, { "entropy": 5.680799055099487, "epoch": 3.0708811515269403, "grad_norm": 1.3046875, "learning_rate": 0.0004062946718583813, "loss": 4.8053, "mean_token_accuracy": 0.2202177032828331, "num_tokens": 68458335.0, "step": 39470 }, { "entropy": 5.65205659866333, "epoch": 3.071270180898658, "grad_norm": 1.234375, "learning_rate": 0.00040627216330424844, "loss": 4.898, "mean_token_accuracy": 0.22518338561058043, "num_tokens": 68466851.0, "step": 39475 }, { "entropy": 5.680207872390747, "epoch": 3.0716592102703753, "grad_norm": 1.28125, "learning_rate": 0.0004062496527582694, "loss": 4.8863, "mean_token_accuracy": 0.2032962843775749, "num_tokens": 68475220.0, "step": 39480 }, { "entropy": 5.759002017974853, "epoch": 3.072048239642093, "grad_norm": 1.3515625, "learning_rate": 0.0004062271402207858, "loss": 4.9357, "mean_token_accuracy": 0.2181516781449318, "num_tokens": 68484190.0, "step": 39485 }, { "entropy": 5.839335012435913, "epoch": 3.0724372690138106, "grad_norm": 1.4140625, "learning_rate": 0.0004062046256921391, "loss": 5.0078, "mean_token_accuracy": 0.20833667367696762, "num_tokens": 68493102.0, "step": 39490 }, { "entropy": 5.7938965320587155, "epoch": 3.072826298385528, "grad_norm": 1.2890625, "learning_rate": 0.00040618210917267117, "loss": 4.9609, "mean_token_accuracy": 0.21431828737258912, "num_tokens": 68501650.0, "step": 39495 }, { "entropy": 5.710832405090332, "epoch": 3.0732153277572456, "grad_norm": 1.3125, "learning_rate": 0.00040615959066272355, "loss": 4.8148, "mean_token_accuracy": 0.22192294001579285, "num_tokens": 68509487.0, "step": 39500 }, { "entropy": 5.734316492080689, "epoch": 3.0736043571289633, "grad_norm": 1.4375, "learning_rate": 0.0004061370701626379, "loss": 4.9115, "mean_token_accuracy": 0.21724549382925035, "num_tokens": 68517644.0, "step": 39505 }, { "entropy": 5.765217208862305, "epoch": 3.073993386500681, "grad_norm": 1.234375, "learning_rate": 0.0004061145476727559, "loss": 4.9154, "mean_token_accuracy": 0.21897059977054595, "num_tokens": 68526217.0, "step": 39510 }, { "entropy": 5.7855064392089846, "epoch": 3.0743824158723982, "grad_norm": 1.2265625, "learning_rate": 0.0004060920231934193, "loss": 4.8944, "mean_token_accuracy": 0.21419646888971328, "num_tokens": 68534778.0, "step": 39515 }, { "entropy": 5.819291400909424, "epoch": 3.074771445244116, "grad_norm": 1.3125, "learning_rate": 0.0004060694967249699, "loss": 4.9952, "mean_token_accuracy": 0.20562713146209716, "num_tokens": 68543043.0, "step": 39520 }, { "entropy": 5.76445894241333, "epoch": 3.0751604746158336, "grad_norm": 1.421875, "learning_rate": 0.0004060469682677496, "loss": 4.9429, "mean_token_accuracy": 0.20815117955207824, "num_tokens": 68551391.0, "step": 39525 }, { "entropy": 5.7462221622467045, "epoch": 3.075549503987551, "grad_norm": 1.375, "learning_rate": 0.00040602443782210003, "loss": 4.9241, "mean_token_accuracy": 0.212738299369812, "num_tokens": 68560251.0, "step": 39530 }, { "entropy": 5.761011791229248, "epoch": 3.0759385333592686, "grad_norm": 1.3125, "learning_rate": 0.0004060019053883632, "loss": 4.9133, "mean_token_accuracy": 0.20744238942861556, "num_tokens": 68568974.0, "step": 39535 }, { "entropy": 5.714836597442627, "epoch": 3.0763275627309863, "grad_norm": 1.1953125, "learning_rate": 0.000405979370966881, "loss": 4.8007, "mean_token_accuracy": 0.21903826743364335, "num_tokens": 68577280.0, "step": 39540 }, { "entropy": 5.735162353515625, "epoch": 3.0767165921027035, "grad_norm": 1.2890625, "learning_rate": 0.0004059568345579953, "loss": 5.0093, "mean_token_accuracy": 0.20670411586761475, "num_tokens": 68586102.0, "step": 39545 }, { "entropy": 5.692688417434693, "epoch": 3.0771056214744212, "grad_norm": 1.1953125, "learning_rate": 0.00040593429616204806, "loss": 4.9102, "mean_token_accuracy": 0.21331096738576888, "num_tokens": 68594420.0, "step": 39550 }, { "entropy": 5.865401697158814, "epoch": 3.077494650846139, "grad_norm": 1.25, "learning_rate": 0.00040591175577938125, "loss": 5.0346, "mean_token_accuracy": 0.20152995437383653, "num_tokens": 68603760.0, "step": 39555 }, { "entropy": 5.85372838973999, "epoch": 3.0778836802178566, "grad_norm": 1.28125, "learning_rate": 0.00040588921341033697, "loss": 4.9996, "mean_token_accuracy": 0.20572633892297745, "num_tokens": 68612039.0, "step": 39560 }, { "entropy": 5.782596683502197, "epoch": 3.078272709589574, "grad_norm": 1.34375, "learning_rate": 0.0004058666690552572, "loss": 5.0084, "mean_token_accuracy": 0.20787141472101212, "num_tokens": 68620452.0, "step": 39565 }, { "entropy": 5.805132341384888, "epoch": 3.0786617389612916, "grad_norm": 1.2890625, "learning_rate": 0.00040584412271448407, "loss": 4.9797, "mean_token_accuracy": 0.2142111137509346, "num_tokens": 68628526.0, "step": 39570 }, { "entropy": 5.775401639938354, "epoch": 3.0790507683330093, "grad_norm": 1.3125, "learning_rate": 0.0004058215743883595, "loss": 4.8885, "mean_token_accuracy": 0.21455609947443008, "num_tokens": 68636342.0, "step": 39575 }, { "entropy": 5.731519889831543, "epoch": 3.0794397977047265, "grad_norm": 1.3203125, "learning_rate": 0.0004057990240772259, "loss": 4.9347, "mean_token_accuracy": 0.22391967326402665, "num_tokens": 68645333.0, "step": 39580 }, { "entropy": 5.801797533035279, "epoch": 3.0798288270764442, "grad_norm": 1.28125, "learning_rate": 0.00040577647178142523, "loss": 4.9638, "mean_token_accuracy": 0.21127763390541077, "num_tokens": 68653114.0, "step": 39585 }, { "entropy": 5.767221832275391, "epoch": 3.080217856448162, "grad_norm": 1.2890625, "learning_rate": 0.0004057539175012998, "loss": 4.9374, "mean_token_accuracy": 0.210533107817173, "num_tokens": 68661789.0, "step": 39590 }, { "entropy": 5.766764163970947, "epoch": 3.080606885819879, "grad_norm": 1.203125, "learning_rate": 0.00040573136123719174, "loss": 4.9321, "mean_token_accuracy": 0.21174464523792266, "num_tokens": 68670481.0, "step": 39595 }, { "entropy": 5.819529008865357, "epoch": 3.080995915191597, "grad_norm": 1.2734375, "learning_rate": 0.00040570880298944334, "loss": 4.972, "mean_token_accuracy": 0.2124832347035408, "num_tokens": 68679270.0, "step": 39600 }, { "entropy": 5.801679372787476, "epoch": 3.0813849445633146, "grad_norm": 1.4453125, "learning_rate": 0.0004056862427583969, "loss": 5.0281, "mean_token_accuracy": 0.20382715463638307, "num_tokens": 68688301.0, "step": 39605 }, { "entropy": 5.729549789428711, "epoch": 3.0817739739350323, "grad_norm": 1.328125, "learning_rate": 0.0004056636805443948, "loss": 4.9485, "mean_token_accuracy": 0.2161804050207138, "num_tokens": 68696382.0, "step": 39610 }, { "entropy": 5.699559593200684, "epoch": 3.0821630033067495, "grad_norm": 1.203125, "learning_rate": 0.00040564111634777927, "loss": 4.8229, "mean_token_accuracy": 0.22478315234184265, "num_tokens": 68705552.0, "step": 39615 }, { "entropy": 5.814018774032593, "epoch": 3.0825520326784672, "grad_norm": 1.2421875, "learning_rate": 0.00040561855016889276, "loss": 5.0391, "mean_token_accuracy": 0.20430726557970047, "num_tokens": 68714125.0, "step": 39620 }, { "entropy": 5.74969449043274, "epoch": 3.082941062050185, "grad_norm": 1.328125, "learning_rate": 0.00040559598200807763, "loss": 4.8223, "mean_token_accuracy": 0.21761805266141893, "num_tokens": 68722119.0, "step": 39625 }, { "entropy": 5.803784656524658, "epoch": 3.083330091421902, "grad_norm": 1.1640625, "learning_rate": 0.0004055734118656764, "loss": 4.9672, "mean_token_accuracy": 0.21198455542325972, "num_tokens": 68730745.0, "step": 39630 }, { "entropy": 5.823920869827271, "epoch": 3.08371912079362, "grad_norm": 1.265625, "learning_rate": 0.0004055508397420314, "loss": 5.0454, "mean_token_accuracy": 0.20396374613046647, "num_tokens": 68739747.0, "step": 39635 }, { "entropy": 5.7832857131958, "epoch": 3.0841081501653376, "grad_norm": 1.3046875, "learning_rate": 0.00040552826563748526, "loss": 4.868, "mean_token_accuracy": 0.21842247992753983, "num_tokens": 68748703.0, "step": 39640 }, { "entropy": 5.777443742752075, "epoch": 3.0844971795370553, "grad_norm": 1.2890625, "learning_rate": 0.0004055056895523804, "loss": 4.8771, "mean_token_accuracy": 0.22148414701223373, "num_tokens": 68757412.0, "step": 39645 }, { "entropy": 5.737195587158203, "epoch": 3.0848862089087725, "grad_norm": 1.2421875, "learning_rate": 0.00040548311148705943, "loss": 4.9541, "mean_token_accuracy": 0.20679867416620254, "num_tokens": 68765680.0, "step": 39650 }, { "entropy": 5.808868169784546, "epoch": 3.08527523828049, "grad_norm": 1.3515625, "learning_rate": 0.0004054605314418649, "loss": 4.98, "mean_token_accuracy": 0.2045988067984581, "num_tokens": 68773931.0, "step": 39655 }, { "entropy": 5.801799392700195, "epoch": 3.085664267652208, "grad_norm": 1.265625, "learning_rate": 0.00040543794941713944, "loss": 4.9047, "mean_token_accuracy": 0.2091333508491516, "num_tokens": 68781854.0, "step": 39660 }, { "entropy": 5.735847854614258, "epoch": 3.086053297023925, "grad_norm": 1.3515625, "learning_rate": 0.0004054153654132258, "loss": 4.9571, "mean_token_accuracy": 0.20761697739362717, "num_tokens": 68790384.0, "step": 39665 }, { "entropy": 5.7697385311126705, "epoch": 3.086442326395643, "grad_norm": 1.25, "learning_rate": 0.0004053927794304665, "loss": 4.9727, "mean_token_accuracy": 0.20599237233400344, "num_tokens": 68798899.0, "step": 39670 }, { "entropy": 5.768698740005493, "epoch": 3.0868313557673606, "grad_norm": 1.296875, "learning_rate": 0.0004053701914692043, "loss": 4.8882, "mean_token_accuracy": 0.21541758328676225, "num_tokens": 68807567.0, "step": 39675 }, { "entropy": 5.772577381134033, "epoch": 3.087220385139078, "grad_norm": 1.3359375, "learning_rate": 0.000405347601529782, "loss": 4.9491, "mean_token_accuracy": 0.2147700846195221, "num_tokens": 68816039.0, "step": 39680 }, { "entropy": 5.732383060455322, "epoch": 3.0876094145107955, "grad_norm": 1.3046875, "learning_rate": 0.0004053250096125423, "loss": 4.9312, "mean_token_accuracy": 0.21486999839544296, "num_tokens": 68825185.0, "step": 39685 }, { "entropy": 5.7795319080352785, "epoch": 3.087998443882513, "grad_norm": 1.375, "learning_rate": 0.0004053024157178281, "loss": 5.0724, "mean_token_accuracy": 0.20260193347930908, "num_tokens": 68833757.0, "step": 39690 }, { "entropy": 5.726060438156128, "epoch": 3.088387473254231, "grad_norm": 1.375, "learning_rate": 0.000405279819845982, "loss": 4.8059, "mean_token_accuracy": 0.22234226763248444, "num_tokens": 68843155.0, "step": 39695 }, { "entropy": 5.785486030578613, "epoch": 3.088776502625948, "grad_norm": 1.25, "learning_rate": 0.00040525722199734706, "loss": 4.9069, "mean_token_accuracy": 0.21966517716646194, "num_tokens": 68852183.0, "step": 39700 }, { "entropy": 5.679362869262695, "epoch": 3.089165531997666, "grad_norm": 1.2265625, "learning_rate": 0.0004052346221722661, "loss": 4.8502, "mean_token_accuracy": 0.22701964080333709, "num_tokens": 68861003.0, "step": 39705 }, { "entropy": 5.752509498596192, "epoch": 3.0895545613693836, "grad_norm": 1.34375, "learning_rate": 0.00040521202037108205, "loss": 4.9137, "mean_token_accuracy": 0.21492766737937927, "num_tokens": 68869657.0, "step": 39710 }, { "entropy": 5.724474096298218, "epoch": 3.089943590741101, "grad_norm": 1.2890625, "learning_rate": 0.0004051894165941378, "loss": 4.9117, "mean_token_accuracy": 0.22146259993314743, "num_tokens": 68878747.0, "step": 39715 }, { "entropy": 5.74120945930481, "epoch": 3.0903326201128185, "grad_norm": 1.2421875, "learning_rate": 0.00040516681084177636, "loss": 4.8208, "mean_token_accuracy": 0.22383075803518296, "num_tokens": 68887460.0, "step": 39720 }, { "entropy": 5.787602186203003, "epoch": 3.090721649484536, "grad_norm": 1.4140625, "learning_rate": 0.00040514420311434085, "loss": 4.9848, "mean_token_accuracy": 0.2022153690457344, "num_tokens": 68896129.0, "step": 39725 }, { "entropy": 5.810035943984985, "epoch": 3.0911106788562535, "grad_norm": 1.28125, "learning_rate": 0.00040512159341217415, "loss": 4.907, "mean_token_accuracy": 0.21366390734910964, "num_tokens": 68904235.0, "step": 39730 }, { "entropy": 5.7596197605133055, "epoch": 3.091499708227971, "grad_norm": 1.3515625, "learning_rate": 0.00040509898173561934, "loss": 4.8809, "mean_token_accuracy": 0.21626016497612, "num_tokens": 68912161.0, "step": 39735 }, { "entropy": 5.6932618618011475, "epoch": 3.091888737599689, "grad_norm": 1.3125, "learning_rate": 0.0004050763680850196, "loss": 4.9527, "mean_token_accuracy": 0.2093872532248497, "num_tokens": 68920316.0, "step": 39740 }, { "entropy": 5.652742910385132, "epoch": 3.0922777669714065, "grad_norm": 1.2734375, "learning_rate": 0.0004050537524607179, "loss": 4.8435, "mean_token_accuracy": 0.2189144864678383, "num_tokens": 68929374.0, "step": 39745 }, { "entropy": 5.6921648502349855, "epoch": 3.092666796343124, "grad_norm": 1.34375, "learning_rate": 0.00040503113486305766, "loss": 4.8114, "mean_token_accuracy": 0.2253242090344429, "num_tokens": 68936997.0, "step": 39750 }, { "entropy": 5.731439161300659, "epoch": 3.0930558257148415, "grad_norm": 1.2890625, "learning_rate": 0.00040500851529238184, "loss": 4.8369, "mean_token_accuracy": 0.2232477769255638, "num_tokens": 68945773.0, "step": 39755 }, { "entropy": 5.747562026977539, "epoch": 3.093444855086559, "grad_norm": 1.3203125, "learning_rate": 0.0004049858937490337, "loss": 4.8997, "mean_token_accuracy": 0.21028582453727723, "num_tokens": 68954226.0, "step": 39760 }, { "entropy": 5.7482147216796875, "epoch": 3.0938338844582765, "grad_norm": 1.3203125, "learning_rate": 0.0004049632702333566, "loss": 4.9239, "mean_token_accuracy": 0.21002336889505385, "num_tokens": 68962510.0, "step": 39765 }, { "entropy": 5.823799753189087, "epoch": 3.094222913829994, "grad_norm": 1.296875, "learning_rate": 0.00040494064474569375, "loss": 5.0502, "mean_token_accuracy": 0.20402777940034866, "num_tokens": 68971531.0, "step": 39770 }, { "entropy": 5.821825456619263, "epoch": 3.094611943201712, "grad_norm": 1.3671875, "learning_rate": 0.00040491801728638835, "loss": 5.0062, "mean_token_accuracy": 0.21250158846378325, "num_tokens": 68980217.0, "step": 39775 }, { "entropy": 5.756355237960816, "epoch": 3.095000972573429, "grad_norm": 1.203125, "learning_rate": 0.00040489538785578385, "loss": 4.9986, "mean_token_accuracy": 0.20372197180986404, "num_tokens": 68989243.0, "step": 39780 }, { "entropy": 5.798519897460937, "epoch": 3.095390001945147, "grad_norm": 1.296875, "learning_rate": 0.00040487275645422356, "loss": 4.954, "mean_token_accuracy": 0.20905472487211227, "num_tokens": 68997102.0, "step": 39785 }, { "entropy": 5.771003293991089, "epoch": 3.0957790313168645, "grad_norm": 1.390625, "learning_rate": 0.000404850123082051, "loss": 4.9637, "mean_token_accuracy": 0.20962756723165513, "num_tokens": 69006230.0, "step": 39790 }, { "entropy": 5.850861501693726, "epoch": 3.096168060688582, "grad_norm": 1.234375, "learning_rate": 0.0004048274877396094, "loss": 5.009, "mean_token_accuracy": 0.2072341784834862, "num_tokens": 69015303.0, "step": 39795 }, { "entropy": 5.835467147827148, "epoch": 3.0965570900602994, "grad_norm": 1.265625, "learning_rate": 0.0004048048504272424, "loss": 4.8409, "mean_token_accuracy": 0.21624854058027268, "num_tokens": 69023434.0, "step": 39800 }, { "entropy": 5.837031364440918, "epoch": 3.096946119432017, "grad_norm": 1.2890625, "learning_rate": 0.0004047822111452933, "loss": 5.0601, "mean_token_accuracy": 0.19899210929870606, "num_tokens": 69031694.0, "step": 39805 }, { "entropy": 5.725315713882447, "epoch": 3.097335148803735, "grad_norm": 1.3515625, "learning_rate": 0.00040475956989410584, "loss": 4.9372, "mean_token_accuracy": 0.21067645996809006, "num_tokens": 69040191.0, "step": 39810 }, { "entropy": 5.750631952285767, "epoch": 3.097724178175452, "grad_norm": 1.28125, "learning_rate": 0.0004047369266740233, "loss": 5.0059, "mean_token_accuracy": 0.20805785655975342, "num_tokens": 69049277.0, "step": 39815 }, { "entropy": 5.76277117729187, "epoch": 3.09811320754717, "grad_norm": 1.21875, "learning_rate": 0.00040471428148538944, "loss": 4.9626, "mean_token_accuracy": 0.2096048802137375, "num_tokens": 69057483.0, "step": 39820 }, { "entropy": 5.751685047149659, "epoch": 3.0985022369188875, "grad_norm": 1.171875, "learning_rate": 0.0004046916343285479, "loss": 4.9104, "mean_token_accuracy": 0.2135115757584572, "num_tokens": 69066055.0, "step": 39825 }, { "entropy": 5.778376770019531, "epoch": 3.0988912662906047, "grad_norm": 1.3671875, "learning_rate": 0.00040466898520384213, "loss": 5.0135, "mean_token_accuracy": 0.20746229887008666, "num_tokens": 69074774.0, "step": 39830 }, { "entropy": 5.7578864097595215, "epoch": 3.0992802956623224, "grad_norm": 1.296875, "learning_rate": 0.000404646334111616, "loss": 5.0022, "mean_token_accuracy": 0.20425669401884078, "num_tokens": 69083307.0, "step": 39835 }, { "entropy": 5.76624493598938, "epoch": 3.09966932503404, "grad_norm": 1.359375, "learning_rate": 0.0004046236810522131, "loss": 4.8915, "mean_token_accuracy": 0.2219396010041237, "num_tokens": 69091528.0, "step": 39840 }, { "entropy": 5.683811473846435, "epoch": 3.100058354405758, "grad_norm": 1.3828125, "learning_rate": 0.0004046010260259771, "loss": 4.875, "mean_token_accuracy": 0.21084967404603958, "num_tokens": 69100562.0, "step": 39845 }, { "entropy": 5.807650423049926, "epoch": 3.100447383777475, "grad_norm": 1.2265625, "learning_rate": 0.00040457836903325177, "loss": 4.9466, "mean_token_accuracy": 0.20812997221946716, "num_tokens": 69108629.0, "step": 39850 }, { "entropy": 5.7626721382141115, "epoch": 3.100836413149193, "grad_norm": 1.2734375, "learning_rate": 0.00040455571007438104, "loss": 4.8129, "mean_token_accuracy": 0.21863297373056412, "num_tokens": 69117694.0, "step": 39855 }, { "entropy": 5.773023557662964, "epoch": 3.1012254425209105, "grad_norm": 1.28125, "learning_rate": 0.0004045330491497085, "loss": 4.9976, "mean_token_accuracy": 0.19849037230014802, "num_tokens": 69126318.0, "step": 39860 }, { "entropy": 5.758947277069092, "epoch": 3.1016144718926277, "grad_norm": 1.2890625, "learning_rate": 0.00040451038625957827, "loss": 4.9191, "mean_token_accuracy": 0.20600378662347793, "num_tokens": 69135041.0, "step": 39865 }, { "entropy": 5.7290044784545895, "epoch": 3.1020035012643454, "grad_norm": 1.34375, "learning_rate": 0.0004044877214043339, "loss": 4.8415, "mean_token_accuracy": 0.2137392982840538, "num_tokens": 69143906.0, "step": 39870 }, { "entropy": 5.735186529159546, "epoch": 3.102392530636063, "grad_norm": 1.3515625, "learning_rate": 0.0004044650545843196, "loss": 4.8138, "mean_token_accuracy": 0.2151723623275757, "num_tokens": 69152204.0, "step": 39875 }, { "entropy": 5.711070394515991, "epoch": 3.1027815600077804, "grad_norm": 1.359375, "learning_rate": 0.000404442385799879, "loss": 4.9242, "mean_token_accuracy": 0.21677784621715546, "num_tokens": 69161097.0, "step": 39880 }, { "entropy": 5.711878776550293, "epoch": 3.103170589379498, "grad_norm": 1.3125, "learning_rate": 0.0004044197150513564, "loss": 4.913, "mean_token_accuracy": 0.20440458357334138, "num_tokens": 69169545.0, "step": 39885 }, { "entropy": 5.780318641662598, "epoch": 3.1035596187512158, "grad_norm": 1.2421875, "learning_rate": 0.0004043970423390955, "loss": 5.0165, "mean_token_accuracy": 0.19606248438358306, "num_tokens": 69178188.0, "step": 39890 }, { "entropy": 5.816859388351441, "epoch": 3.1039486481229335, "grad_norm": 1.2265625, "learning_rate": 0.0004043743676634405, "loss": 4.8951, "mean_token_accuracy": 0.21090450137853622, "num_tokens": 69187361.0, "step": 39895 }, { "entropy": 5.7644054889678955, "epoch": 3.1043376774946507, "grad_norm": 1.25, "learning_rate": 0.0004043516910247353, "loss": 4.8545, "mean_token_accuracy": 0.22059257924556733, "num_tokens": 69196115.0, "step": 39900 }, { "entropy": 5.68728609085083, "epoch": 3.1047267068663684, "grad_norm": 1.25, "learning_rate": 0.0004043290124233242, "loss": 4.8677, "mean_token_accuracy": 0.22214387059211732, "num_tokens": 69204937.0, "step": 39905 }, { "entropy": 5.683556747436524, "epoch": 3.105115736238086, "grad_norm": 1.34375, "learning_rate": 0.0004043063318595511, "loss": 4.8697, "mean_token_accuracy": 0.21619418859481812, "num_tokens": 69213067.0, "step": 39910 }, { "entropy": 5.722344779968262, "epoch": 3.1055047656098034, "grad_norm": 1.3515625, "learning_rate": 0.0004042836493337603, "loss": 4.9589, "mean_token_accuracy": 0.20884758234024048, "num_tokens": 69221069.0, "step": 39915 }, { "entropy": 5.711345052719116, "epoch": 3.105893794981521, "grad_norm": 1.2890625, "learning_rate": 0.0004042609648462959, "loss": 4.8807, "mean_token_accuracy": 0.21115671396255492, "num_tokens": 69229269.0, "step": 39920 }, { "entropy": 5.777154111862183, "epoch": 3.1062828243532388, "grad_norm": 1.1796875, "learning_rate": 0.000404238278397502, "loss": 4.9712, "mean_token_accuracy": 0.20809506326913835, "num_tokens": 69237782.0, "step": 39925 }, { "entropy": 5.76377501487732, "epoch": 3.106671853724956, "grad_norm": 1.3125, "learning_rate": 0.00040421558998772293, "loss": 4.8774, "mean_token_accuracy": 0.21217077374458312, "num_tokens": 69245673.0, "step": 39930 }, { "entropy": 5.817785310745239, "epoch": 3.1070608830966737, "grad_norm": 1.1875, "learning_rate": 0.000404192899617303, "loss": 5.0355, "mean_token_accuracy": 0.2041858285665512, "num_tokens": 69254161.0, "step": 39935 }, { "entropy": 5.731550788879394, "epoch": 3.1074499124683914, "grad_norm": 1.2890625, "learning_rate": 0.0004041702072865864, "loss": 4.9016, "mean_token_accuracy": 0.20450989454984664, "num_tokens": 69263053.0, "step": 39940 }, { "entropy": 5.8307147979736325, "epoch": 3.107838941840109, "grad_norm": 1.328125, "learning_rate": 0.0004041475129959176, "loss": 4.9915, "mean_token_accuracy": 0.20861730426549913, "num_tokens": 69271016.0, "step": 39945 }, { "entropy": 5.8108643054962155, "epoch": 3.1082279712118264, "grad_norm": 1.359375, "learning_rate": 0.0004041248167456408, "loss": 4.9082, "mean_token_accuracy": 0.20639184713363648, "num_tokens": 69279238.0, "step": 39950 }, { "entropy": 5.778442239761352, "epoch": 3.108617000583544, "grad_norm": 1.3125, "learning_rate": 0.0004041021185361004, "loss": 5.02, "mean_token_accuracy": 0.2051006719470024, "num_tokens": 69288599.0, "step": 39955 }, { "entropy": 5.730287647247314, "epoch": 3.1090060299552618, "grad_norm": 1.2421875, "learning_rate": 0.0004040794183676409, "loss": 4.8599, "mean_token_accuracy": 0.21562488824129106, "num_tokens": 69297255.0, "step": 39960 }, { "entropy": 5.70685043334961, "epoch": 3.109395059326979, "grad_norm": 1.2421875, "learning_rate": 0.0004040567162406066, "loss": 4.8977, "mean_token_accuracy": 0.22491381466388702, "num_tokens": 69306252.0, "step": 39965 }, { "entropy": 5.712982654571533, "epoch": 3.1097840886986967, "grad_norm": 1.265625, "learning_rate": 0.0004040340121553421, "loss": 4.8417, "mean_token_accuracy": 0.2170789659023285, "num_tokens": 69314513.0, "step": 39970 }, { "entropy": 5.734579133987427, "epoch": 3.1101731180704144, "grad_norm": 1.3671875, "learning_rate": 0.0004040113061121918, "loss": 4.9798, "mean_token_accuracy": 0.20679136216640473, "num_tokens": 69323537.0, "step": 39975 }, { "entropy": 5.769730186462402, "epoch": 3.110562147442132, "grad_norm": 1.28125, "learning_rate": 0.00040398859811150036, "loss": 4.9311, "mean_token_accuracy": 0.21523208916187286, "num_tokens": 69331677.0, "step": 39980 }, { "entropy": 5.777107810974121, "epoch": 3.1109511768138494, "grad_norm": 1.328125, "learning_rate": 0.0004039658881536122, "loss": 4.9588, "mean_token_accuracy": 0.2144148275256157, "num_tokens": 69340317.0, "step": 39985 }, { "entropy": 5.751975774765015, "epoch": 3.111340206185567, "grad_norm": 1.2578125, "learning_rate": 0.0004039431762388719, "loss": 4.8826, "mean_token_accuracy": 0.21805571466684343, "num_tokens": 69349412.0, "step": 39990 }, { "entropy": 5.777456331253052, "epoch": 3.1117292355572848, "grad_norm": 1.3359375, "learning_rate": 0.0004039204623676242, "loss": 5.0065, "mean_token_accuracy": 0.20605419874191283, "num_tokens": 69357717.0, "step": 39995 }, { "entropy": 5.728319311141968, "epoch": 3.112118264929002, "grad_norm": 1.3671875, "learning_rate": 0.00040389774654021367, "loss": 4.9376, "mean_token_accuracy": 0.21150212585926056, "num_tokens": 69365858.0, "step": 40000 }, { "entropy": 5.826995992660523, "epoch": 3.1125072943007197, "grad_norm": 1.5625, "learning_rate": 0.000403875028756985, "loss": 5.0217, "mean_token_accuracy": 0.20935767590999604, "num_tokens": 69374535.0, "step": 40005 }, { "entropy": 5.808182907104492, "epoch": 3.1128963236724374, "grad_norm": 1.3203125, "learning_rate": 0.0004038523090182829, "loss": 5.0142, "mean_token_accuracy": 0.20947306603193283, "num_tokens": 69383051.0, "step": 40010 }, { "entropy": 5.838730335235596, "epoch": 3.1132853530441547, "grad_norm": 1.2890625, "learning_rate": 0.000403829587324452, "loss": 5.0075, "mean_token_accuracy": 0.19739585667848586, "num_tokens": 69390876.0, "step": 40015 }, { "entropy": 5.850389289855957, "epoch": 3.1136743824158724, "grad_norm": 1.21875, "learning_rate": 0.0004038068636758373, "loss": 5.0005, "mean_token_accuracy": 0.21325714588165284, "num_tokens": 69399887.0, "step": 40020 }, { "entropy": 5.710236215591431, "epoch": 3.11406341178759, "grad_norm": 1.234375, "learning_rate": 0.0004037841380727834, "loss": 4.9758, "mean_token_accuracy": 0.20272131115198136, "num_tokens": 69407859.0, "step": 40025 }, { "entropy": 5.7235105514526365, "epoch": 3.1144524411593073, "grad_norm": 1.3125, "learning_rate": 0.0004037614105156352, "loss": 4.9444, "mean_token_accuracy": 0.20799121558666228, "num_tokens": 69416157.0, "step": 40030 }, { "entropy": 5.883564233779907, "epoch": 3.114841470531025, "grad_norm": 1.3203125, "learning_rate": 0.0004037386810047376, "loss": 5.0492, "mean_token_accuracy": 0.20723860263824462, "num_tokens": 69423784.0, "step": 40035 }, { "entropy": 5.745909070968628, "epoch": 3.1152304999027427, "grad_norm": 1.359375, "learning_rate": 0.0004037159495404354, "loss": 4.9304, "mean_token_accuracy": 0.21909126490354539, "num_tokens": 69432358.0, "step": 40040 }, { "entropy": 5.744107818603515, "epoch": 3.1156195292744604, "grad_norm": 1.375, "learning_rate": 0.00040369321612307343, "loss": 4.9886, "mean_token_accuracy": 0.21131176948547364, "num_tokens": 69440173.0, "step": 40045 }, { "entropy": 5.855760192871093, "epoch": 3.1160085586461777, "grad_norm": 1.3203125, "learning_rate": 0.00040367048075299684, "loss": 5.1037, "mean_token_accuracy": 0.19977132678031922, "num_tokens": 69449302.0, "step": 40050 }, { "entropy": 5.849479484558105, "epoch": 3.1163975880178953, "grad_norm": 1.21875, "learning_rate": 0.0004036477434305505, "loss": 4.9142, "mean_token_accuracy": 0.21182374358177186, "num_tokens": 69458284.0, "step": 40055 }, { "entropy": 5.7925519943237305, "epoch": 3.116786617389613, "grad_norm": 1.3671875, "learning_rate": 0.0004036250041560794, "loss": 4.9771, "mean_token_accuracy": 0.21010270118713378, "num_tokens": 69466960.0, "step": 40060 }, { "entropy": 5.688681364059448, "epoch": 3.1171756467613303, "grad_norm": 1.3515625, "learning_rate": 0.0004036022629299286, "loss": 4.8598, "mean_token_accuracy": 0.22311098426580428, "num_tokens": 69476096.0, "step": 40065 }, { "entropy": 5.748182344436645, "epoch": 3.117564676133048, "grad_norm": 1.515625, "learning_rate": 0.0004035795197524431, "loss": 4.9039, "mean_token_accuracy": 0.2214929446578026, "num_tokens": 69484754.0, "step": 40070 }, { "entropy": 5.773387002944946, "epoch": 3.1179537055047657, "grad_norm": 1.328125, "learning_rate": 0.0004035567746239681, "loss": 4.9465, "mean_token_accuracy": 0.20690796077251433, "num_tokens": 69494149.0, "step": 40075 }, { "entropy": 5.796993970870972, "epoch": 3.1183427348764834, "grad_norm": 1.3203125, "learning_rate": 0.00040353402754484866, "loss": 4.9263, "mean_token_accuracy": 0.21049665212631224, "num_tokens": 69502833.0, "step": 40080 }, { "entropy": 5.751757526397705, "epoch": 3.1187317642482006, "grad_norm": 1.2421875, "learning_rate": 0.0004035112785154299, "loss": 4.8804, "mean_token_accuracy": 0.21231265962123871, "num_tokens": 69510995.0, "step": 40085 }, { "entropy": 5.7674877643585205, "epoch": 3.1191207936199183, "grad_norm": 1.328125, "learning_rate": 0.00040348852753605707, "loss": 4.9345, "mean_token_accuracy": 0.21192436814308166, "num_tokens": 69519126.0, "step": 40090 }, { "entropy": 5.772055625915527, "epoch": 3.119509822991636, "grad_norm": 1.25, "learning_rate": 0.00040346577460707535, "loss": 4.9161, "mean_token_accuracy": 0.21388096809387208, "num_tokens": 69527621.0, "step": 40095 }, { "entropy": 5.794259834289551, "epoch": 3.1198988523633533, "grad_norm": 1.3359375, "learning_rate": 0.00040344301972882997, "loss": 4.9476, "mean_token_accuracy": 0.21082728654146193, "num_tokens": 69536549.0, "step": 40100 }, { "entropy": 5.803535842895508, "epoch": 3.120287881735071, "grad_norm": 1.3046875, "learning_rate": 0.0004034202629016662, "loss": 4.9669, "mean_token_accuracy": 0.2132548451423645, "num_tokens": 69546148.0, "step": 40105 }, { "entropy": 5.67745189666748, "epoch": 3.1206769111067887, "grad_norm": 1.265625, "learning_rate": 0.00040339750412592937, "loss": 4.985, "mean_token_accuracy": 0.20287290066480637, "num_tokens": 69555875.0, "step": 40110 }, { "entropy": 5.784997606277466, "epoch": 3.121065940478506, "grad_norm": 1.265625, "learning_rate": 0.0004033747434019647, "loss": 5.0138, "mean_token_accuracy": 0.20895988643169403, "num_tokens": 69564561.0, "step": 40115 }, { "entropy": 5.777000141143799, "epoch": 3.1214549698502236, "grad_norm": 1.3046875, "learning_rate": 0.00040335198073011765, "loss": 4.9734, "mean_token_accuracy": 0.20545304715633392, "num_tokens": 69573122.0, "step": 40120 }, { "entropy": 5.822106981277466, "epoch": 3.1218439992219413, "grad_norm": 1.3828125, "learning_rate": 0.0004033292161107336, "loss": 4.9204, "mean_token_accuracy": 0.2115643173456192, "num_tokens": 69582229.0, "step": 40125 }, { "entropy": 5.747476959228516, "epoch": 3.122233028593659, "grad_norm": 1.2109375, "learning_rate": 0.00040330644954415795, "loss": 4.9801, "mean_token_accuracy": 0.2123159259557724, "num_tokens": 69591055.0, "step": 40130 }, { "entropy": 5.784395599365235, "epoch": 3.1226220579653763, "grad_norm": 1.28125, "learning_rate": 0.0004032836810307362, "loss": 4.9469, "mean_token_accuracy": 0.21085905730724336, "num_tokens": 69599342.0, "step": 40135 }, { "entropy": 5.82467827796936, "epoch": 3.123011087337094, "grad_norm": 1.2109375, "learning_rate": 0.0004032609105708137, "loss": 5.0516, "mean_token_accuracy": 0.20202109068632126, "num_tokens": 69609011.0, "step": 40140 }, { "entropy": 5.774012851715088, "epoch": 3.1234001167088117, "grad_norm": 1.296875, "learning_rate": 0.00040323813816473604, "loss": 4.9197, "mean_token_accuracy": 0.21122611314058304, "num_tokens": 69618167.0, "step": 40145 }, { "entropy": 5.851735830307007, "epoch": 3.123789146080529, "grad_norm": 1.25, "learning_rate": 0.0004032153638128488, "loss": 4.9869, "mean_token_accuracy": 0.21043165773153305, "num_tokens": 69627109.0, "step": 40150 }, { "entropy": 5.688071632385254, "epoch": 3.1241781754522466, "grad_norm": 1.3125, "learning_rate": 0.00040319258751549743, "loss": 4.7898, "mean_token_accuracy": 0.2140660509467125, "num_tokens": 69635806.0, "step": 40155 }, { "entropy": 5.687273120880127, "epoch": 3.1245672048239643, "grad_norm": 1.28125, "learning_rate": 0.00040316980927302765, "loss": 4.9171, "mean_token_accuracy": 0.21587437987327576, "num_tokens": 69644437.0, "step": 40160 }, { "entropy": 5.8111467361450195, "epoch": 3.1249562341956816, "grad_norm": 1.1953125, "learning_rate": 0.00040314702908578496, "loss": 5.0964, "mean_token_accuracy": 0.20002802908420564, "num_tokens": 69653747.0, "step": 40165 }, { "entropy": 5.777410840988159, "epoch": 3.1253452635673993, "grad_norm": 1.1171875, "learning_rate": 0.0004031242469541151, "loss": 4.8733, "mean_token_accuracy": 0.20874358862638473, "num_tokens": 69662291.0, "step": 40170 }, { "entropy": 5.7479095458984375, "epoch": 3.125734292939117, "grad_norm": 1.34375, "learning_rate": 0.00040310146287836373, "loss": 4.8919, "mean_token_accuracy": 0.21335157752037048, "num_tokens": 69670680.0, "step": 40175 }, { "entropy": 5.694083547592163, "epoch": 3.1261233223108347, "grad_norm": 1.3046875, "learning_rate": 0.00040307867685887653, "loss": 4.9065, "mean_token_accuracy": 0.2189897119998932, "num_tokens": 69679351.0, "step": 40180 }, { "entropy": 5.724062299728393, "epoch": 3.126512351682552, "grad_norm": 1.375, "learning_rate": 0.00040305588889599927, "loss": 4.8968, "mean_token_accuracy": 0.21566104143857956, "num_tokens": 69687678.0, "step": 40185 }, { "entropy": 5.770704507827759, "epoch": 3.1269013810542696, "grad_norm": 1.296875, "learning_rate": 0.0004030330989900777, "loss": 4.9047, "mean_token_accuracy": 0.21533187478780746, "num_tokens": 69696940.0, "step": 40190 }, { "entropy": 5.695532131195068, "epoch": 3.1272904104259873, "grad_norm": 1.203125, "learning_rate": 0.00040301030714145764, "loss": 4.904, "mean_token_accuracy": 0.20965037047863005, "num_tokens": 69706220.0, "step": 40195 }, { "entropy": 5.803440570831299, "epoch": 3.1276794397977046, "grad_norm": 1.2578125, "learning_rate": 0.000402987513350485, "loss": 5.0211, "mean_token_accuracy": 0.2105756014585495, "num_tokens": 69715163.0, "step": 40200 }, { "entropy": 5.788340663909912, "epoch": 3.1280684691694223, "grad_norm": 1.40625, "learning_rate": 0.0004029647176175055, "loss": 4.8568, "mean_token_accuracy": 0.2197499841451645, "num_tokens": 69723677.0, "step": 40205 }, { "entropy": 5.695401573181153, "epoch": 3.12845749854114, "grad_norm": 1.3046875, "learning_rate": 0.00040294191994286513, "loss": 4.8961, "mean_token_accuracy": 0.21331340670585633, "num_tokens": 69732483.0, "step": 40210 }, { "entropy": 5.6678542137146, "epoch": 3.1288465279128572, "grad_norm": 1.34375, "learning_rate": 0.00040291912032690963, "loss": 4.7857, "mean_token_accuracy": 0.2228936403989792, "num_tokens": 69740844.0, "step": 40215 }, { "entropy": 5.743181467056274, "epoch": 3.129235557284575, "grad_norm": 1.28125, "learning_rate": 0.0004028963187699852, "loss": 4.907, "mean_token_accuracy": 0.21609598845243455, "num_tokens": 69749426.0, "step": 40220 }, { "entropy": 5.790025854110718, "epoch": 3.1296245866562926, "grad_norm": 1.25, "learning_rate": 0.0004028735152724377, "loss": 5.0022, "mean_token_accuracy": 0.1997210755944252, "num_tokens": 69758581.0, "step": 40225 }, { "entropy": 5.76169753074646, "epoch": 3.1300136160280103, "grad_norm": 1.3671875, "learning_rate": 0.00040285070983461313, "loss": 5.0197, "mean_token_accuracy": 0.20568263232707978, "num_tokens": 69767444.0, "step": 40230 }, { "entropy": 5.740632581710815, "epoch": 3.1304026453997276, "grad_norm": 1.2734375, "learning_rate": 0.00040282790245685753, "loss": 4.8957, "mean_token_accuracy": 0.20835064649581908, "num_tokens": 69776726.0, "step": 40235 }, { "entropy": 5.795553493499756, "epoch": 3.1307916747714453, "grad_norm": 1.34375, "learning_rate": 0.000402805093139517, "loss": 4.9533, "mean_token_accuracy": 0.2087833270430565, "num_tokens": 69785341.0, "step": 40240 }, { "entropy": 5.679021787643433, "epoch": 3.131180704143163, "grad_norm": 1.296875, "learning_rate": 0.0004027822818829375, "loss": 4.8477, "mean_token_accuracy": 0.21551962643861772, "num_tokens": 69793515.0, "step": 40245 }, { "entropy": 5.727423810958863, "epoch": 3.13156973351488, "grad_norm": 1.4453125, "learning_rate": 0.0004027594686874653, "loss": 4.9441, "mean_token_accuracy": 0.2085217460989952, "num_tokens": 69801861.0, "step": 40250 }, { "entropy": 5.740774488449096, "epoch": 3.131958762886598, "grad_norm": 1.265625, "learning_rate": 0.00040273665355344655, "loss": 4.9108, "mean_token_accuracy": 0.22003409117460251, "num_tokens": 69811662.0, "step": 40255 }, { "entropy": 5.718981409072876, "epoch": 3.1323477922583156, "grad_norm": 1.328125, "learning_rate": 0.0004027138364812274, "loss": 4.8568, "mean_token_accuracy": 0.21883145570755005, "num_tokens": 69820107.0, "step": 40260 }, { "entropy": 5.844197463989258, "epoch": 3.132736821630033, "grad_norm": 1.234375, "learning_rate": 0.0004026910174711541, "loss": 5.0335, "mean_token_accuracy": 0.19858429133892058, "num_tokens": 69829279.0, "step": 40265 }, { "entropy": 5.8277181625366214, "epoch": 3.1331258510017506, "grad_norm": 1.3046875, "learning_rate": 0.00040266819652357266, "loss": 4.9709, "mean_token_accuracy": 0.2079933390021324, "num_tokens": 69837649.0, "step": 40270 }, { "entropy": 5.789802122116089, "epoch": 3.1335148803734683, "grad_norm": 1.3203125, "learning_rate": 0.00040264537363882976, "loss": 4.9576, "mean_token_accuracy": 0.21123535186052322, "num_tokens": 69845557.0, "step": 40275 }, { "entropy": 5.73231725692749, "epoch": 3.133903909745186, "grad_norm": 1.3203125, "learning_rate": 0.00040262254881727135, "loss": 4.8784, "mean_token_accuracy": 0.2229197785258293, "num_tokens": 69855854.0, "step": 40280 }, { "entropy": 5.776639842987061, "epoch": 3.134292939116903, "grad_norm": 1.421875, "learning_rate": 0.00040259972205924395, "loss": 4.9068, "mean_token_accuracy": 0.21475390195846558, "num_tokens": 69864420.0, "step": 40285 }, { "entropy": 5.791183042526245, "epoch": 3.134681968488621, "grad_norm": 1.2734375, "learning_rate": 0.00040257689336509385, "loss": 4.944, "mean_token_accuracy": 0.21120575964450836, "num_tokens": 69873399.0, "step": 40290 }, { "entropy": 5.80324969291687, "epoch": 3.1350709978603386, "grad_norm": 1.359375, "learning_rate": 0.0004025540627351675, "loss": 5.0597, "mean_token_accuracy": 0.20177256762981416, "num_tokens": 69882908.0, "step": 40295 }, { "entropy": 5.760149192810059, "epoch": 3.135460027232056, "grad_norm": 1.296875, "learning_rate": 0.0004025312301698112, "loss": 4.9907, "mean_token_accuracy": 0.20189143121242523, "num_tokens": 69892603.0, "step": 40300 }, { "entropy": 5.7924097061157225, "epoch": 3.1358490566037736, "grad_norm": 1.265625, "learning_rate": 0.0004025083956693715, "loss": 4.8909, "mean_token_accuracy": 0.21391555070877075, "num_tokens": 69901008.0, "step": 40305 }, { "entropy": 5.902125453948974, "epoch": 3.1362380859754913, "grad_norm": 1.390625, "learning_rate": 0.0004024855592341948, "loss": 5.0021, "mean_token_accuracy": 0.20328429043293, "num_tokens": 69909726.0, "step": 40310 }, { "entropy": 5.713063144683838, "epoch": 3.136627115347209, "grad_norm": 1.421875, "learning_rate": 0.0004024627208646277, "loss": 4.9114, "mean_token_accuracy": 0.219138403236866, "num_tokens": 69919073.0, "step": 40315 }, { "entropy": 5.7250877857208256, "epoch": 3.137016144718926, "grad_norm": 1.5078125, "learning_rate": 0.00040243988056101667, "loss": 4.9272, "mean_token_accuracy": 0.20709774494171143, "num_tokens": 69927627.0, "step": 40320 }, { "entropy": 5.770431661605835, "epoch": 3.137405174090644, "grad_norm": 1.2890625, "learning_rate": 0.0004024170383237083, "loss": 4.947, "mean_token_accuracy": 0.21090989112854003, "num_tokens": 69935842.0, "step": 40325 }, { "entropy": 5.783553695678711, "epoch": 3.1377942034623616, "grad_norm": 1.2890625, "learning_rate": 0.0004023941941530492, "loss": 4.9756, "mean_token_accuracy": 0.2062254801392555, "num_tokens": 69944530.0, "step": 40330 }, { "entropy": 5.6843461990356445, "epoch": 3.138183232834079, "grad_norm": 1.2890625, "learning_rate": 0.000402371348049386, "loss": 4.8612, "mean_token_accuracy": 0.2142156332731247, "num_tokens": 69952908.0, "step": 40335 }, { "entropy": 5.850854110717774, "epoch": 3.1385722622057965, "grad_norm": 1.296875, "learning_rate": 0.0004023485000130653, "loss": 5.049, "mean_token_accuracy": 0.1994370773434639, "num_tokens": 69960905.0, "step": 40340 }, { "entropy": 5.793711423873901, "epoch": 3.1389612915775142, "grad_norm": 1.203125, "learning_rate": 0.00040232565004443373, "loss": 4.9558, "mean_token_accuracy": 0.2108398362994194, "num_tokens": 69969648.0, "step": 40345 }, { "entropy": 5.717907238006592, "epoch": 3.1393503209492315, "grad_norm": 1.34375, "learning_rate": 0.0004023027981438382, "loss": 4.8545, "mean_token_accuracy": 0.21686673611402513, "num_tokens": 69978006.0, "step": 40350 }, { "entropy": 5.739992141723633, "epoch": 3.139739350320949, "grad_norm": 1.25, "learning_rate": 0.00040227994431162517, "loss": 4.9483, "mean_token_accuracy": 0.21215471476316453, "num_tokens": 69986862.0, "step": 40355 }, { "entropy": 5.756698513031006, "epoch": 3.140128379692667, "grad_norm": 1.21875, "learning_rate": 0.00040225708854814174, "loss": 4.9512, "mean_token_accuracy": 0.20926265716552733, "num_tokens": 69996066.0, "step": 40360 }, { "entropy": 5.769553184509277, "epoch": 3.140517409064384, "grad_norm": 1.359375, "learning_rate": 0.0004022342308537345, "loss": 4.9207, "mean_token_accuracy": 0.2225148320198059, "num_tokens": 70004394.0, "step": 40365 }, { "entropy": 5.784255886077881, "epoch": 3.140906438436102, "grad_norm": 1.2734375, "learning_rate": 0.0004022113712287503, "loss": 5.0153, "mean_token_accuracy": 0.20053702145814895, "num_tokens": 70014298.0, "step": 40370 }, { "entropy": 5.803610134124756, "epoch": 3.1412954678078195, "grad_norm": 1.2890625, "learning_rate": 0.000402188509673536, "loss": 4.9719, "mean_token_accuracy": 0.2066754400730133, "num_tokens": 70022006.0, "step": 40375 }, { "entropy": 5.851156902313233, "epoch": 3.1416844971795372, "grad_norm": 1.2578125, "learning_rate": 0.00040216564618843854, "loss": 4.9939, "mean_token_accuracy": 0.2005156770348549, "num_tokens": 70031100.0, "step": 40380 }, { "entropy": 5.85844407081604, "epoch": 3.1420735265512545, "grad_norm": 1.1640625, "learning_rate": 0.0004021427807738048, "loss": 4.9992, "mean_token_accuracy": 0.20618006139993666, "num_tokens": 70039830.0, "step": 40385 }, { "entropy": 5.679624891281128, "epoch": 3.142462555922972, "grad_norm": 1.34375, "learning_rate": 0.0004021199134299817, "loss": 4.8964, "mean_token_accuracy": 0.21236151307821274, "num_tokens": 70048187.0, "step": 40390 }, { "entropy": 5.828287172317505, "epoch": 3.14285158529469, "grad_norm": 1.3203125, "learning_rate": 0.00040209704415731623, "loss": 5.0423, "mean_token_accuracy": 0.20655807256698608, "num_tokens": 70056432.0, "step": 40395 }, { "entropy": 5.8425600051879885, "epoch": 3.143240614666407, "grad_norm": 1.375, "learning_rate": 0.00040207417295615546, "loss": 4.9867, "mean_token_accuracy": 0.20687542110681534, "num_tokens": 70065720.0, "step": 40400 }, { "entropy": 5.813409948348999, "epoch": 3.143629644038125, "grad_norm": 1.3125, "learning_rate": 0.00040205129982684635, "loss": 4.9132, "mean_token_accuracy": 0.21038702130317688, "num_tokens": 70074030.0, "step": 40405 }, { "entropy": 5.788703870773316, "epoch": 3.1440186734098425, "grad_norm": 1.296875, "learning_rate": 0.00040202842476973606, "loss": 4.93, "mean_token_accuracy": 0.2102228358387947, "num_tokens": 70082703.0, "step": 40410 }, { "entropy": 5.700043392181397, "epoch": 3.1444077027815602, "grad_norm": 1.359375, "learning_rate": 0.00040200554778517154, "loss": 4.8643, "mean_token_accuracy": 0.22261289656162261, "num_tokens": 70091221.0, "step": 40415 }, { "entropy": 5.763620471954345, "epoch": 3.1447967321532775, "grad_norm": 1.2421875, "learning_rate": 0.00040198266887349994, "loss": 4.9825, "mean_token_accuracy": 0.20276841819286345, "num_tokens": 70100197.0, "step": 40420 }, { "entropy": 5.789965057373047, "epoch": 3.145185761524995, "grad_norm": 1.2421875, "learning_rate": 0.00040195978803506853, "loss": 4.9466, "mean_token_accuracy": 0.2111675336956978, "num_tokens": 70108759.0, "step": 40425 }, { "entropy": 5.81311993598938, "epoch": 3.145574790896713, "grad_norm": 1.1875, "learning_rate": 0.00040193690527022443, "loss": 4.9649, "mean_token_accuracy": 0.20730699151754378, "num_tokens": 70117881.0, "step": 40430 }, { "entropy": 5.765024662017822, "epoch": 3.14596382026843, "grad_norm": 1.2109375, "learning_rate": 0.00040191402057931474, "loss": 4.9507, "mean_token_accuracy": 0.21044069826602935, "num_tokens": 70127700.0, "step": 40435 }, { "entropy": 5.75165696144104, "epoch": 3.146352849640148, "grad_norm": 1.2734375, "learning_rate": 0.0004018911339626869, "loss": 4.9769, "mean_token_accuracy": 0.2049643650650978, "num_tokens": 70136234.0, "step": 40440 }, { "entropy": 5.74533257484436, "epoch": 3.1467418790118655, "grad_norm": 1.265625, "learning_rate": 0.000401868245420688, "loss": 4.9163, "mean_token_accuracy": 0.21151627004146575, "num_tokens": 70144940.0, "step": 40445 }, { "entropy": 5.772161912918091, "epoch": 3.147130908383583, "grad_norm": 1.296875, "learning_rate": 0.00040184535495366543, "loss": 4.9118, "mean_token_accuracy": 0.21127618998289108, "num_tokens": 70154628.0, "step": 40450 }, { "entropy": 5.812704563140869, "epoch": 3.1475199377553005, "grad_norm": 1.390625, "learning_rate": 0.0004018224625619664, "loss": 4.9363, "mean_token_accuracy": 0.2111609622836113, "num_tokens": 70163207.0, "step": 40455 }, { "entropy": 5.735611534118652, "epoch": 3.147908967127018, "grad_norm": 1.3359375, "learning_rate": 0.00040179956824593847, "loss": 4.9247, "mean_token_accuracy": 0.2170082852244377, "num_tokens": 70172103.0, "step": 40460 }, { "entropy": 5.87116265296936, "epoch": 3.1482979964987354, "grad_norm": 1.3046875, "learning_rate": 0.00040177667200592894, "loss": 5.0433, "mean_token_accuracy": 0.20277344435453415, "num_tokens": 70180646.0, "step": 40465 }, { "entropy": 5.784483098983765, "epoch": 3.148687025870453, "grad_norm": 1.3984375, "learning_rate": 0.0004017537738422852, "loss": 4.911, "mean_token_accuracy": 0.21171634942293166, "num_tokens": 70188614.0, "step": 40470 }, { "entropy": 5.737367296218872, "epoch": 3.149076055242171, "grad_norm": 1.25, "learning_rate": 0.00040173087375535457, "loss": 4.8969, "mean_token_accuracy": 0.21053340584039687, "num_tokens": 70196959.0, "step": 40475 }, { "entropy": 5.767529439926148, "epoch": 3.1494650846138885, "grad_norm": 1.234375, "learning_rate": 0.00040170797174548476, "loss": 4.9843, "mean_token_accuracy": 0.208919021487236, "num_tokens": 70205763.0, "step": 40480 }, { "entropy": 5.7736616134643555, "epoch": 3.1498541139856058, "grad_norm": 1.34375, "learning_rate": 0.00040168506781302303, "loss": 4.9276, "mean_token_accuracy": 0.2041158750653267, "num_tokens": 70214586.0, "step": 40485 }, { "entropy": 5.759898519515991, "epoch": 3.1502431433573235, "grad_norm": 1.265625, "learning_rate": 0.0004016621619583171, "loss": 4.9412, "mean_token_accuracy": 0.2169592037796974, "num_tokens": 70223334.0, "step": 40490 }, { "entropy": 5.735036182403564, "epoch": 3.150632172729041, "grad_norm": 1.2734375, "learning_rate": 0.00040163925418171454, "loss": 4.8946, "mean_token_accuracy": 0.21174300462007523, "num_tokens": 70232395.0, "step": 40495 }, { "entropy": 5.791286039352417, "epoch": 3.1510212021007584, "grad_norm": 1.453125, "learning_rate": 0.0004016163444835628, "loss": 4.9683, "mean_token_accuracy": 0.20765730887651443, "num_tokens": 70241658.0, "step": 40500 }, { "entropy": 5.706120109558105, "epoch": 3.151410231472476, "grad_norm": 1.2421875, "learning_rate": 0.0004015934328642096, "loss": 4.8834, "mean_token_accuracy": 0.21409650892019272, "num_tokens": 70250468.0, "step": 40505 }, { "entropy": 5.732951688766479, "epoch": 3.151799260844194, "grad_norm": 1.21875, "learning_rate": 0.00040157051932400244, "loss": 4.9007, "mean_token_accuracy": 0.20881550759077072, "num_tokens": 70259440.0, "step": 40510 }, { "entropy": 5.794725465774536, "epoch": 3.1521882902159115, "grad_norm": 1.28125, "learning_rate": 0.0004015476038632892, "loss": 4.9153, "mean_token_accuracy": 0.21785697489976882, "num_tokens": 70268848.0, "step": 40515 }, { "entropy": 5.869899797439575, "epoch": 3.1525773195876288, "grad_norm": 1.203125, "learning_rate": 0.0004015246864824175, "loss": 5.0245, "mean_token_accuracy": 0.20374394953250885, "num_tokens": 70278470.0, "step": 40520 }, { "entropy": 5.787311649322509, "epoch": 3.1529663489593465, "grad_norm": 1.1640625, "learning_rate": 0.00040150176718173504, "loss": 4.9877, "mean_token_accuracy": 0.20901406705379486, "num_tokens": 70288712.0, "step": 40525 }, { "entropy": 5.808365726470948, "epoch": 3.153355378331064, "grad_norm": 1.3125, "learning_rate": 0.0004014788459615896, "loss": 4.9682, "mean_token_accuracy": 0.20850373059511185, "num_tokens": 70297848.0, "step": 40530 }, { "entropy": 5.82039852142334, "epoch": 3.1537444077027814, "grad_norm": 1.25, "learning_rate": 0.0004014559228223291, "loss": 4.9537, "mean_token_accuracy": 0.20202360302209854, "num_tokens": 70306313.0, "step": 40535 }, { "entropy": 5.744287300109863, "epoch": 3.154133437074499, "grad_norm": 1.3203125, "learning_rate": 0.00040143299776430115, "loss": 4.8944, "mean_token_accuracy": 0.21507159769535064, "num_tokens": 70315002.0, "step": 40540 }, { "entropy": 5.745880508422852, "epoch": 3.154522466446217, "grad_norm": 1.234375, "learning_rate": 0.0004014100707878536, "loss": 4.929, "mean_token_accuracy": 0.21719609946012497, "num_tokens": 70323878.0, "step": 40545 }, { "entropy": 5.778616189956665, "epoch": 3.154911495817934, "grad_norm": 1.25, "learning_rate": 0.00040138714189333455, "loss": 4.8685, "mean_token_accuracy": 0.2140916809439659, "num_tokens": 70332592.0, "step": 40550 }, { "entropy": 5.767165279388427, "epoch": 3.1553005251896518, "grad_norm": 1.3984375, "learning_rate": 0.00040136421108109176, "loss": 4.8963, "mean_token_accuracy": 0.20752975791692735, "num_tokens": 70340057.0, "step": 40555 }, { "entropy": 5.743940353393555, "epoch": 3.1556895545613695, "grad_norm": 1.25, "learning_rate": 0.0004013412783514732, "loss": 4.947, "mean_token_accuracy": 0.20901575386524202, "num_tokens": 70348501.0, "step": 40560 }, { "entropy": 5.781447839736939, "epoch": 3.156078583933087, "grad_norm": 1.2109375, "learning_rate": 0.0004013183437048268, "loss": 4.9208, "mean_token_accuracy": 0.2125971570611, "num_tokens": 70358110.0, "step": 40565 }, { "entropy": 5.800413608551025, "epoch": 3.1564676133048044, "grad_norm": 1.2421875, "learning_rate": 0.00040129540714150066, "loss": 5.0098, "mean_token_accuracy": 0.20313268154859543, "num_tokens": 70366683.0, "step": 40570 }, { "entropy": 5.829809951782226, "epoch": 3.156856642676522, "grad_norm": 1.28125, "learning_rate": 0.0004012724686618427, "loss": 5.0295, "mean_token_accuracy": 0.2037683606147766, "num_tokens": 70375418.0, "step": 40575 }, { "entropy": 5.821298885345459, "epoch": 3.15724567204824, "grad_norm": 1.328125, "learning_rate": 0.000401249528266201, "loss": 4.9799, "mean_token_accuracy": 0.20957402437925338, "num_tokens": 70384168.0, "step": 40580 }, { "entropy": 5.841653299331665, "epoch": 3.157634701419957, "grad_norm": 1.2890625, "learning_rate": 0.00040122658595492366, "loss": 5.0239, "mean_token_accuracy": 0.2039206475019455, "num_tokens": 70392304.0, "step": 40585 }, { "entropy": 5.7030939102172855, "epoch": 3.1580237307916748, "grad_norm": 1.2578125, "learning_rate": 0.0004012036417283588, "loss": 4.9469, "mean_token_accuracy": 0.21099811941385269, "num_tokens": 70401186.0, "step": 40590 }, { "entropy": 5.680010175704956, "epoch": 3.1584127601633925, "grad_norm": 1.25, "learning_rate": 0.00040118069558685456, "loss": 4.7865, "mean_token_accuracy": 0.223158797621727, "num_tokens": 70409304.0, "step": 40595 }, { "entropy": 5.786808872222901, "epoch": 3.1588017895351097, "grad_norm": 1.265625, "learning_rate": 0.00040115774753075905, "loss": 4.8583, "mean_token_accuracy": 0.2181577280163765, "num_tokens": 70417206.0, "step": 40600 }, { "entropy": 5.714131927490234, "epoch": 3.1591908189068274, "grad_norm": 1.421875, "learning_rate": 0.0004011347975604206, "loss": 4.9801, "mean_token_accuracy": 0.21172747611999512, "num_tokens": 70425573.0, "step": 40605 }, { "entropy": 5.761755800247192, "epoch": 3.159579848278545, "grad_norm": 1.3515625, "learning_rate": 0.0004011118456761873, "loss": 4.9902, "mean_token_accuracy": 0.21218641102313995, "num_tokens": 70434415.0, "step": 40610 }, { "entropy": 5.82722430229187, "epoch": 3.159968877650263, "grad_norm": 1.25, "learning_rate": 0.0004010888918784075, "loss": 4.9665, "mean_token_accuracy": 0.2189266249537468, "num_tokens": 70443033.0, "step": 40615 }, { "entropy": 5.762420606613159, "epoch": 3.16035790702198, "grad_norm": 1.3125, "learning_rate": 0.0004010659361674294, "loss": 4.942, "mean_token_accuracy": 0.21072487831115722, "num_tokens": 70451740.0, "step": 40620 }, { "entropy": 5.838847351074219, "epoch": 3.1607469363936977, "grad_norm": 1.4296875, "learning_rate": 0.00040104297854360145, "loss": 5.022, "mean_token_accuracy": 0.20983533263206483, "num_tokens": 70459893.0, "step": 40625 }, { "entropy": 5.815574836730957, "epoch": 3.1611359657654154, "grad_norm": 1.1640625, "learning_rate": 0.0004010200190072719, "loss": 4.9731, "mean_token_accuracy": 0.21154980063438417, "num_tokens": 70468852.0, "step": 40630 }, { "entropy": 5.797278022766113, "epoch": 3.1615249951371327, "grad_norm": 1.3671875, "learning_rate": 0.0004009970575587891, "loss": 4.9803, "mean_token_accuracy": 0.20951933711767196, "num_tokens": 70477418.0, "step": 40635 }, { "entropy": 5.836968851089478, "epoch": 3.1619140245088504, "grad_norm": 1.3984375, "learning_rate": 0.0004009740941985016, "loss": 5.0137, "mean_token_accuracy": 0.20803424566984177, "num_tokens": 70486368.0, "step": 40640 }, { "entropy": 5.7701764583587645, "epoch": 3.162303053880568, "grad_norm": 1.3203125, "learning_rate": 0.0004009511289267576, "loss": 5.0632, "mean_token_accuracy": 0.20609866082668304, "num_tokens": 70495097.0, "step": 40645 }, { "entropy": 5.773818111419677, "epoch": 3.1626920832522853, "grad_norm": 1.2578125, "learning_rate": 0.0004009281617439058, "loss": 4.9374, "mean_token_accuracy": 0.21256339848041533, "num_tokens": 70503684.0, "step": 40650 }, { "entropy": 5.859715986251831, "epoch": 3.163081112624003, "grad_norm": 1.359375, "learning_rate": 0.0004009051926502945, "loss": 4.9724, "mean_token_accuracy": 0.20651036947965623, "num_tokens": 70511917.0, "step": 40655 }, { "entropy": 5.706477928161621, "epoch": 3.1634701419957207, "grad_norm": 1.2734375, "learning_rate": 0.00040088222164627233, "loss": 4.8733, "mean_token_accuracy": 0.21568609029054642, "num_tokens": 70521074.0, "step": 40660 }, { "entropy": 5.883972930908203, "epoch": 3.1638591713674384, "grad_norm": 1.359375, "learning_rate": 0.00040085924873218783, "loss": 5.0365, "mean_token_accuracy": 0.20678069442510605, "num_tokens": 70530261.0, "step": 40665 }, { "entropy": 5.774124050140381, "epoch": 3.1642482007391557, "grad_norm": 1.3046875, "learning_rate": 0.0004008362739083895, "loss": 4.9088, "mean_token_accuracy": 0.21366457343101503, "num_tokens": 70539125.0, "step": 40670 }, { "entropy": 5.766443824768066, "epoch": 3.1646372301108734, "grad_norm": 1.28125, "learning_rate": 0.000400813297175226, "loss": 4.9235, "mean_token_accuracy": 0.2173941671848297, "num_tokens": 70547420.0, "step": 40675 }, { "entropy": 5.72861967086792, "epoch": 3.165026259482591, "grad_norm": 1.375, "learning_rate": 0.000400790318533046, "loss": 4.9303, "mean_token_accuracy": 0.21090103387832643, "num_tokens": 70556307.0, "step": 40680 }, { "entropy": 5.746558952331543, "epoch": 3.1654152888543083, "grad_norm": 1.2890625, "learning_rate": 0.00040076733798219817, "loss": 4.9066, "mean_token_accuracy": 0.21188623011112212, "num_tokens": 70565275.0, "step": 40685 }, { "entropy": 5.924573564529419, "epoch": 3.165804318226026, "grad_norm": 1.2890625, "learning_rate": 0.0004007443555230312, "loss": 5.0958, "mean_token_accuracy": 0.20019012540578843, "num_tokens": 70574038.0, "step": 40690 }, { "entropy": 5.834783601760864, "epoch": 3.1661933475977437, "grad_norm": 1.21875, "learning_rate": 0.00040072137115589366, "loss": 4.9962, "mean_token_accuracy": 0.20957378298044205, "num_tokens": 70582118.0, "step": 40695 }, { "entropy": 5.746265983581543, "epoch": 3.166582376969461, "grad_norm": 1.3828125, "learning_rate": 0.0004006983848811345, "loss": 4.8774, "mean_token_accuracy": 0.21890666484832763, "num_tokens": 70590569.0, "step": 40700 }, { "entropy": 5.714414501190186, "epoch": 3.1669714063411787, "grad_norm": 1.3046875, "learning_rate": 0.00040067539669910235, "loss": 4.943, "mean_token_accuracy": 0.21356316655874252, "num_tokens": 70599518.0, "step": 40705 }, { "entropy": 5.686338996887207, "epoch": 3.1673604357128964, "grad_norm": 1.1953125, "learning_rate": 0.0004006524066101461, "loss": 4.8605, "mean_token_accuracy": 0.21602620482444762, "num_tokens": 70607638.0, "step": 40710 }, { "entropy": 5.773846817016602, "epoch": 3.167749465084614, "grad_norm": 1.46875, "learning_rate": 0.0004006294146146146, "loss": 4.9767, "mean_token_accuracy": 0.20743745863437651, "num_tokens": 70616260.0, "step": 40715 }, { "entropy": 5.831448078155518, "epoch": 3.1681384944563313, "grad_norm": 1.25, "learning_rate": 0.0004006064207128567, "loss": 4.9366, "mean_token_accuracy": 0.20551228672266006, "num_tokens": 70624654.0, "step": 40720 }, { "entropy": 5.821302461624145, "epoch": 3.168527523828049, "grad_norm": 1.3515625, "learning_rate": 0.00040058342490522134, "loss": 5.0073, "mean_token_accuracy": 0.20598124116659164, "num_tokens": 70633141.0, "step": 40725 }, { "entropy": 5.767334985733032, "epoch": 3.1689165531997667, "grad_norm": 1.3515625, "learning_rate": 0.0004005604271920573, "loss": 4.9141, "mean_token_accuracy": 0.2146398216485977, "num_tokens": 70641701.0, "step": 40730 }, { "entropy": 5.775250101089478, "epoch": 3.169305582571484, "grad_norm": 1.3046875, "learning_rate": 0.00040053742757371365, "loss": 4.9341, "mean_token_accuracy": 0.20857871621847152, "num_tokens": 70650566.0, "step": 40735 }, { "entropy": 5.761979579925537, "epoch": 3.1696946119432017, "grad_norm": 1.21875, "learning_rate": 0.0004005144260505394, "loss": 4.9244, "mean_token_accuracy": 0.21092050820589064, "num_tokens": 70660127.0, "step": 40740 }, { "entropy": 5.839926862716675, "epoch": 3.1700836413149194, "grad_norm": 1.3125, "learning_rate": 0.0004004914226228834, "loss": 5.0167, "mean_token_accuracy": 0.20587404519319535, "num_tokens": 70669324.0, "step": 40745 }, { "entropy": 5.804857778549194, "epoch": 3.170472670686637, "grad_norm": 1.3046875, "learning_rate": 0.0004004684172910949, "loss": 4.957, "mean_token_accuracy": 0.2088740274310112, "num_tokens": 70678590.0, "step": 40750 }, { "entropy": 5.822592401504517, "epoch": 3.1708617000583543, "grad_norm": 1.25, "learning_rate": 0.0004004454100555229, "loss": 4.985, "mean_token_accuracy": 0.20957597345113754, "num_tokens": 70687348.0, "step": 40755 }, { "entropy": 5.735289144515991, "epoch": 3.171250729430072, "grad_norm": 1.296875, "learning_rate": 0.00040042240091651645, "loss": 4.8156, "mean_token_accuracy": 0.22941847741603852, "num_tokens": 70695066.0, "step": 40760 }, { "entropy": 5.760897207260132, "epoch": 3.1716397588017897, "grad_norm": 1.34375, "learning_rate": 0.00040039938987442464, "loss": 4.9264, "mean_token_accuracy": 0.21118153035640716, "num_tokens": 70703026.0, "step": 40765 }, { "entropy": 5.79872579574585, "epoch": 3.172028788173507, "grad_norm": 1.3359375, "learning_rate": 0.00040037637692959667, "loss": 5.0308, "mean_token_accuracy": 0.20884792059659957, "num_tokens": 70712046.0, "step": 40770 }, { "entropy": 5.791887044906616, "epoch": 3.1724178175452247, "grad_norm": 1.3515625, "learning_rate": 0.00040035336208238176, "loss": 4.9693, "mean_token_accuracy": 0.2116324558854103, "num_tokens": 70720860.0, "step": 40775 }, { "entropy": 5.775736665725708, "epoch": 3.1728068469169424, "grad_norm": 1.3046875, "learning_rate": 0.00040033034533312913, "loss": 4.8298, "mean_token_accuracy": 0.21768372356891633, "num_tokens": 70729805.0, "step": 40780 }, { "entropy": 5.766955280303955, "epoch": 3.1731958762886596, "grad_norm": 1.3828125, "learning_rate": 0.000400307326682188, "loss": 5.0193, "mean_token_accuracy": 0.20681175738573074, "num_tokens": 70738960.0, "step": 40785 }, { "entropy": 5.811338138580322, "epoch": 3.1735849056603773, "grad_norm": 1.3515625, "learning_rate": 0.00040028430612990755, "loss": 4.9507, "mean_token_accuracy": 0.21198581606149675, "num_tokens": 70747715.0, "step": 40790 }, { "entropy": 5.816431856155395, "epoch": 3.173973935032095, "grad_norm": 1.3203125, "learning_rate": 0.00040026128367663726, "loss": 4.9253, "mean_token_accuracy": 0.20980679243803024, "num_tokens": 70756573.0, "step": 40795 }, { "entropy": 5.849886560440064, "epoch": 3.1743629644038123, "grad_norm": 1.4140625, "learning_rate": 0.00040023825932272635, "loss": 5.1007, "mean_token_accuracy": 0.19771260470151902, "num_tokens": 70766161.0, "step": 40800 }, { "entropy": 5.798144292831421, "epoch": 3.17475199377553, "grad_norm": 1.25, "learning_rate": 0.00040021523306852416, "loss": 4.958, "mean_token_accuracy": 0.2085500717163086, "num_tokens": 70775252.0, "step": 40805 }, { "entropy": 5.800560998916626, "epoch": 3.1751410231472477, "grad_norm": 1.3125, "learning_rate": 0.00040019220491438007, "loss": 4.9949, "mean_token_accuracy": 0.20991758704185487, "num_tokens": 70783429.0, "step": 40810 }, { "entropy": 5.741214942932129, "epoch": 3.1755300525189654, "grad_norm": 1.390625, "learning_rate": 0.0004001691748606436, "loss": 4.917, "mean_token_accuracy": 0.21538470983505248, "num_tokens": 70792008.0, "step": 40815 }, { "entropy": 5.751021814346314, "epoch": 3.1759190818906826, "grad_norm": 1.2734375, "learning_rate": 0.0004001461429076641, "loss": 4.8905, "mean_token_accuracy": 0.21819397509098054, "num_tokens": 70800190.0, "step": 40820 }, { "entropy": 5.692185926437378, "epoch": 3.1763081112624003, "grad_norm": 1.28125, "learning_rate": 0.0004001231090557912, "loss": 4.8147, "mean_token_accuracy": 0.22185861468315124, "num_tokens": 70808148.0, "step": 40825 }, { "entropy": 5.826910495758057, "epoch": 3.176697140634118, "grad_norm": 1.2734375, "learning_rate": 0.00040010007330537405, "loss": 5.1216, "mean_token_accuracy": 0.19750313758850097, "num_tokens": 70817848.0, "step": 40830 }, { "entropy": 5.803548812866211, "epoch": 3.1770861700058353, "grad_norm": 1.28125, "learning_rate": 0.00040007703565676263, "loss": 4.9688, "mean_token_accuracy": 0.20751919001340866, "num_tokens": 70826737.0, "step": 40835 }, { "entropy": 5.801681280136108, "epoch": 3.177475199377553, "grad_norm": 1.3671875, "learning_rate": 0.00040005399611030615, "loss": 4.8999, "mean_token_accuracy": 0.21708332002162933, "num_tokens": 70835478.0, "step": 40840 }, { "entropy": 5.81149377822876, "epoch": 3.1778642287492707, "grad_norm": 1.2265625, "learning_rate": 0.0004000309546663543, "loss": 4.9393, "mean_token_accuracy": 0.21244437992572784, "num_tokens": 70844752.0, "step": 40845 }, { "entropy": 5.712144136428833, "epoch": 3.1782532581209884, "grad_norm": 1.265625, "learning_rate": 0.00040000791132525676, "loss": 4.913, "mean_token_accuracy": 0.20900585651397705, "num_tokens": 70852634.0, "step": 40850 }, { "entropy": 5.804977226257324, "epoch": 3.1786422874927056, "grad_norm": 1.34375, "learning_rate": 0.00039998486608736305, "loss": 4.9618, "mean_token_accuracy": 0.21162612736225128, "num_tokens": 70860225.0, "step": 40855 }, { "entropy": 5.784864377975464, "epoch": 3.1790313168644233, "grad_norm": 1.296875, "learning_rate": 0.0003999618189530231, "loss": 4.9473, "mean_token_accuracy": 0.20207290053367616, "num_tokens": 70868320.0, "step": 40860 }, { "entropy": 5.7427009582519535, "epoch": 3.179420346236141, "grad_norm": 1.3046875, "learning_rate": 0.0003999387699225863, "loss": 4.9112, "mean_token_accuracy": 0.21753208339214325, "num_tokens": 70876830.0, "step": 40865 }, { "entropy": 5.8179154872894285, "epoch": 3.1798093756078583, "grad_norm": 1.25, "learning_rate": 0.0003999157189964026, "loss": 4.9555, "mean_token_accuracy": 0.20854505002498627, "num_tokens": 70885952.0, "step": 40870 }, { "entropy": 5.786499166488648, "epoch": 3.180198404979576, "grad_norm": 1.34375, "learning_rate": 0.0003998926661748217, "loss": 4.9178, "mean_token_accuracy": 0.21354981511831284, "num_tokens": 70894237.0, "step": 40875 }, { "entropy": 5.725682020187378, "epoch": 3.1805874343512937, "grad_norm": 1.1953125, "learning_rate": 0.0003998696114581933, "loss": 4.9937, "mean_token_accuracy": 0.2086714819073677, "num_tokens": 70903542.0, "step": 40880 }, { "entropy": 5.740878772735596, "epoch": 3.180976463723011, "grad_norm": 1.1484375, "learning_rate": 0.0003998465548468674, "loss": 4.8532, "mean_token_accuracy": 0.21615061312913894, "num_tokens": 70913305.0, "step": 40885 }, { "entropy": 5.796900033950806, "epoch": 3.1813654930947286, "grad_norm": 1.2734375, "learning_rate": 0.0003998234963411936, "loss": 4.9603, "mean_token_accuracy": 0.2117125943303108, "num_tokens": 70922061.0, "step": 40890 }, { "entropy": 5.756347608566284, "epoch": 3.1817545224664463, "grad_norm": 1.296875, "learning_rate": 0.0003998004359415221, "loss": 4.9308, "mean_token_accuracy": 0.2064922034740448, "num_tokens": 70930653.0, "step": 40895 }, { "entropy": 5.853744602203369, "epoch": 3.1821435518381636, "grad_norm": 1.2421875, "learning_rate": 0.00039977737364820247, "loss": 5.0537, "mean_token_accuracy": 0.20538506507873536, "num_tokens": 70939549.0, "step": 40900 }, { "entropy": 5.781472301483154, "epoch": 3.1825325812098813, "grad_norm": 1.25, "learning_rate": 0.00039975430946158493, "loss": 4.9053, "mean_token_accuracy": 0.20559643357992172, "num_tokens": 70948349.0, "step": 40905 }, { "entropy": 5.8041548252105715, "epoch": 3.182921610581599, "grad_norm": 1.2421875, "learning_rate": 0.0003997312433820192, "loss": 4.9825, "mean_token_accuracy": 0.20969062745571138, "num_tokens": 70957619.0, "step": 40910 }, { "entropy": 5.850238370895386, "epoch": 3.1833106399533166, "grad_norm": 1.3828125, "learning_rate": 0.00039970817540985545, "loss": 5.0741, "mean_token_accuracy": 0.20132511407136916, "num_tokens": 70966408.0, "step": 40915 }, { "entropy": 5.804398012161255, "epoch": 3.183699669325034, "grad_norm": 1.3828125, "learning_rate": 0.0003996851055454436, "loss": 4.976, "mean_token_accuracy": 0.2054872542619705, "num_tokens": 70975023.0, "step": 40920 }, { "entropy": 5.769306421279907, "epoch": 3.1840886986967516, "grad_norm": 1.2890625, "learning_rate": 0.0003996620337891337, "loss": 4.9592, "mean_token_accuracy": 0.20351338982582093, "num_tokens": 70983495.0, "step": 40925 }, { "entropy": 5.749544477462768, "epoch": 3.1844777280684693, "grad_norm": 1.2265625, "learning_rate": 0.000399638960141276, "loss": 4.8859, "mean_token_accuracy": 0.21251570284366608, "num_tokens": 70992284.0, "step": 40930 }, { "entropy": 5.767158031463623, "epoch": 3.1848667574401865, "grad_norm": 1.34375, "learning_rate": 0.00039961588460222033, "loss": 4.9167, "mean_token_accuracy": 0.21640600860118867, "num_tokens": 71000334.0, "step": 40935 }, { "entropy": 5.742600297927856, "epoch": 3.1852557868119042, "grad_norm": 1.3359375, "learning_rate": 0.000399592807172317, "loss": 4.8474, "mean_token_accuracy": 0.21630490124225615, "num_tokens": 71008694.0, "step": 40940 }, { "entropy": 5.818905067443848, "epoch": 3.185644816183622, "grad_norm": 1.34375, "learning_rate": 0.00039956972785191606, "loss": 4.9299, "mean_token_accuracy": 0.21220496147871018, "num_tokens": 71016702.0, "step": 40945 }, { "entropy": 5.742748260498047, "epoch": 3.1860338455553396, "grad_norm": 1.3984375, "learning_rate": 0.00039954664664136787, "loss": 4.877, "mean_token_accuracy": 0.21565277874469757, "num_tokens": 71025088.0, "step": 40950 }, { "entropy": 5.724049806594849, "epoch": 3.186422874927057, "grad_norm": 1.2734375, "learning_rate": 0.0003995235635410225, "loss": 4.964, "mean_token_accuracy": 0.20990327447652818, "num_tokens": 71034382.0, "step": 40955 }, { "entropy": 5.736189651489258, "epoch": 3.1868119042987746, "grad_norm": 1.2890625, "learning_rate": 0.0003995004785512302, "loss": 4.8683, "mean_token_accuracy": 0.22395765632390977, "num_tokens": 71043464.0, "step": 40960 }, { "entropy": 5.800384044647217, "epoch": 3.1872009336704923, "grad_norm": 1.265625, "learning_rate": 0.0003994773916723414, "loss": 4.9847, "mean_token_accuracy": 0.20932624191045762, "num_tokens": 71052207.0, "step": 40965 }, { "entropy": 5.699514389038086, "epoch": 3.1875899630422095, "grad_norm": 1.359375, "learning_rate": 0.0003994543029047063, "loss": 4.9924, "mean_token_accuracy": 0.20477917194366455, "num_tokens": 71060965.0, "step": 40970 }, { "entropy": 5.780302095413208, "epoch": 3.1879789924139272, "grad_norm": 1.2109375, "learning_rate": 0.0003994312122486752, "loss": 4.9501, "mean_token_accuracy": 0.21124306619167327, "num_tokens": 71070171.0, "step": 40975 }, { "entropy": 5.823684978485107, "epoch": 3.188368021785645, "grad_norm": 1.3125, "learning_rate": 0.0003994081197045985, "loss": 5.0116, "mean_token_accuracy": 0.2028563901782036, "num_tokens": 71078440.0, "step": 40980 }, { "entropy": 5.821783590316772, "epoch": 3.188757051157362, "grad_norm": 1.3203125, "learning_rate": 0.0003993850252728267, "loss": 4.9499, "mean_token_accuracy": 0.2088819921016693, "num_tokens": 71086903.0, "step": 40985 }, { "entropy": 5.727171421051025, "epoch": 3.18914608052908, "grad_norm": 1.21875, "learning_rate": 0.00039936192895371006, "loss": 4.9512, "mean_token_accuracy": 0.21178353875875472, "num_tokens": 71095950.0, "step": 40990 }, { "entropy": 5.759453010559082, "epoch": 3.1895351099007976, "grad_norm": 1.3046875, "learning_rate": 0.000399338830747599, "loss": 4.9523, "mean_token_accuracy": 0.21065323501825334, "num_tokens": 71103762.0, "step": 40995 }, { "entropy": 5.784603500366211, "epoch": 3.1899241392725153, "grad_norm": 1.34375, "learning_rate": 0.0003993157306548442, "loss": 5.0418, "mean_token_accuracy": 0.19890278428792954, "num_tokens": 71112994.0, "step": 41000 }, { "entropy": 5.721879339218139, "epoch": 3.1903131686442325, "grad_norm": 1.203125, "learning_rate": 0.00039929262867579603, "loss": 4.9153, "mean_token_accuracy": 0.21019052267074584, "num_tokens": 71122140.0, "step": 41005 }, { "entropy": 5.76257209777832, "epoch": 3.1907021980159502, "grad_norm": 1.3671875, "learning_rate": 0.00039926952481080495, "loss": 4.9083, "mean_token_accuracy": 0.20683010220527648, "num_tokens": 71130300.0, "step": 41010 }, { "entropy": 5.8049383640289305, "epoch": 3.191091227387668, "grad_norm": 1.21875, "learning_rate": 0.00039924641906022176, "loss": 4.9994, "mean_token_accuracy": 0.2043612703680992, "num_tokens": 71139524.0, "step": 41015 }, { "entropy": 5.840487241744995, "epoch": 3.191480256759385, "grad_norm": 1.34375, "learning_rate": 0.0003992233114243969, "loss": 5.0416, "mean_token_accuracy": 0.21030060052871705, "num_tokens": 71148626.0, "step": 41020 }, { "entropy": 5.787528944015503, "epoch": 3.191869286131103, "grad_norm": 1.2734375, "learning_rate": 0.000399200201903681, "loss": 5.0032, "mean_token_accuracy": 0.20657522231340408, "num_tokens": 71157592.0, "step": 41025 }, { "entropy": 5.765617179870605, "epoch": 3.1922583155028206, "grad_norm": 1.1796875, "learning_rate": 0.0003991770904984247, "loss": 4.8633, "mean_token_accuracy": 0.20911939889192582, "num_tokens": 71165953.0, "step": 41030 }, { "entropy": 5.68063645362854, "epoch": 3.192647344874538, "grad_norm": 1.265625, "learning_rate": 0.0003991539772089787, "loss": 4.829, "mean_token_accuracy": 0.22162360399961473, "num_tokens": 71174581.0, "step": 41035 }, { "entropy": 5.682666206359864, "epoch": 3.1930363742462555, "grad_norm": 1.2578125, "learning_rate": 0.00039913086203569373, "loss": 4.882, "mean_token_accuracy": 0.21956687718629836, "num_tokens": 71182950.0, "step": 41040 }, { "entropy": 5.74949541091919, "epoch": 3.1934254036179732, "grad_norm": 1.3984375, "learning_rate": 0.00039910774497892046, "loss": 5.0074, "mean_token_accuracy": 0.20348596423864365, "num_tokens": 71192115.0, "step": 41045 }, { "entropy": 5.870685052871704, "epoch": 3.193814432989691, "grad_norm": 1.34375, "learning_rate": 0.00039908462603900977, "loss": 5.0375, "mean_token_accuracy": 0.20360516607761384, "num_tokens": 71200401.0, "step": 41050 }, { "entropy": 5.782311916351318, "epoch": 3.194203462361408, "grad_norm": 1.296875, "learning_rate": 0.0003990615052163123, "loss": 4.9563, "mean_token_accuracy": 0.21607262194156646, "num_tokens": 71209705.0, "step": 41055 }, { "entropy": 5.6553199768066404, "epoch": 3.194592491733126, "grad_norm": 1.34375, "learning_rate": 0.000399038382511179, "loss": 4.8547, "mean_token_accuracy": 0.2232244998216629, "num_tokens": 71218738.0, "step": 41060 }, { "entropy": 5.777820348739624, "epoch": 3.1949815211048436, "grad_norm": 1.421875, "learning_rate": 0.0003990152579239607, "loss": 4.8955, "mean_token_accuracy": 0.21410251557826995, "num_tokens": 71226454.0, "step": 41065 }, { "entropy": 5.8642816066741945, "epoch": 3.195370550476561, "grad_norm": 1.3046875, "learning_rate": 0.00039899213145500815, "loss": 5.042, "mean_token_accuracy": 0.20737990587949753, "num_tokens": 71235764.0, "step": 41070 }, { "entropy": 5.773732042312622, "epoch": 3.1957595798482785, "grad_norm": 1.2109375, "learning_rate": 0.00039896900310467244, "loss": 4.9988, "mean_token_accuracy": 0.20989206433296204, "num_tokens": 71244417.0, "step": 41075 }, { "entropy": 5.792234706878662, "epoch": 3.196148609219996, "grad_norm": 1.3046875, "learning_rate": 0.00039894587287330434, "loss": 4.9562, "mean_token_accuracy": 0.21305650919675828, "num_tokens": 71252866.0, "step": 41080 }, { "entropy": 5.839225482940674, "epoch": 3.1965376385917135, "grad_norm": 1.265625, "learning_rate": 0.00039892274076125503, "loss": 4.9981, "mean_token_accuracy": 0.20738569945096968, "num_tokens": 71262376.0, "step": 41085 }, { "entropy": 5.786189699172974, "epoch": 3.196926667963431, "grad_norm": 1.3203125, "learning_rate": 0.0003988996067688753, "loss": 4.8782, "mean_token_accuracy": 0.20995887219905854, "num_tokens": 71270690.0, "step": 41090 }, { "entropy": 5.7922484397888185, "epoch": 3.197315697335149, "grad_norm": 1.2578125, "learning_rate": 0.0003988764708965163, "loss": 4.9974, "mean_token_accuracy": 0.20728829652070999, "num_tokens": 71279474.0, "step": 41095 }, { "entropy": 5.702958679199218, "epoch": 3.1977047267068666, "grad_norm": 1.2421875, "learning_rate": 0.000398853333144529, "loss": 4.9206, "mean_token_accuracy": 0.21458377242088317, "num_tokens": 71288907.0, "step": 41100 }, { "entropy": 5.872563648223877, "epoch": 3.198093756078584, "grad_norm": 1.34375, "learning_rate": 0.00039883019351326447, "loss": 4.9814, "mean_token_accuracy": 0.21636772900819778, "num_tokens": 71296788.0, "step": 41105 }, { "entropy": 5.789545249938965, "epoch": 3.1984827854503015, "grad_norm": 1.3203125, "learning_rate": 0.00039880705200307377, "loss": 4.895, "mean_token_accuracy": 0.21370198726654052, "num_tokens": 71305131.0, "step": 41110 }, { "entropy": 5.716982364654541, "epoch": 3.198871814822019, "grad_norm": 1.265625, "learning_rate": 0.0003987839086143083, "loss": 4.8757, "mean_token_accuracy": 0.21180029064416886, "num_tokens": 71313333.0, "step": 41115 }, { "entropy": 5.712088632583618, "epoch": 3.1992608441937365, "grad_norm": 1.265625, "learning_rate": 0.00039876076334731885, "loss": 4.9295, "mean_token_accuracy": 0.20944864749908448, "num_tokens": 71321852.0, "step": 41120 }, { "entropy": 5.76860818862915, "epoch": 3.199649873565454, "grad_norm": 1.2265625, "learning_rate": 0.000398737616202457, "loss": 4.9441, "mean_token_accuracy": 0.20839363038539888, "num_tokens": 71330905.0, "step": 41125 }, { "entropy": 5.811459112167358, "epoch": 3.200038902937172, "grad_norm": 1.3984375, "learning_rate": 0.00039871446718007364, "loss": 5.004, "mean_token_accuracy": 0.20433032512664795, "num_tokens": 71339479.0, "step": 41130 }, { "entropy": 5.768079233169556, "epoch": 3.200427932308889, "grad_norm": 1.515625, "learning_rate": 0.0003986913162805201, "loss": 4.9203, "mean_token_accuracy": 0.2148787721991539, "num_tokens": 71348921.0, "step": 41135 }, { "entropy": 5.797590494155884, "epoch": 3.200816961680607, "grad_norm": 1.234375, "learning_rate": 0.00039866816350414786, "loss": 4.9201, "mean_token_accuracy": 0.21401213258504867, "num_tokens": 71357695.0, "step": 41140 }, { "entropy": 5.751787900924683, "epoch": 3.2012059910523245, "grad_norm": 1.3125, "learning_rate": 0.000398645008851308, "loss": 4.9118, "mean_token_accuracy": 0.2225073590874672, "num_tokens": 71365780.0, "step": 41145 }, { "entropy": 5.739987754821778, "epoch": 3.201595020424042, "grad_norm": 1.3203125, "learning_rate": 0.00039862185232235196, "loss": 4.8271, "mean_token_accuracy": 0.21892186403274536, "num_tokens": 71374219.0, "step": 41150 }, { "entropy": 5.748920440673828, "epoch": 3.2019840497957595, "grad_norm": 1.265625, "learning_rate": 0.0003985986939176311, "loss": 4.9226, "mean_token_accuracy": 0.2083059936761856, "num_tokens": 71382438.0, "step": 41155 }, { "entropy": 5.7911077499389645, "epoch": 3.202373079167477, "grad_norm": 1.359375, "learning_rate": 0.00039857553363749674, "loss": 4.9598, "mean_token_accuracy": 0.20821693241596223, "num_tokens": 71390989.0, "step": 41160 }, { "entropy": 5.7301229476928714, "epoch": 3.202762108539195, "grad_norm": 1.3515625, "learning_rate": 0.00039855237148230026, "loss": 4.9024, "mean_token_accuracy": 0.21288724541664122, "num_tokens": 71398914.0, "step": 41165 }, { "entropy": 5.8240100860595705, "epoch": 3.203151137910912, "grad_norm": 1.2890625, "learning_rate": 0.00039852920745239343, "loss": 4.9757, "mean_token_accuracy": 0.2073565348982811, "num_tokens": 71407638.0, "step": 41170 }, { "entropy": 5.780116128921509, "epoch": 3.20354016728263, "grad_norm": 1.2890625, "learning_rate": 0.00039850604154812727, "loss": 4.9454, "mean_token_accuracy": 0.2129078611731529, "num_tokens": 71417123.0, "step": 41175 }, { "entropy": 5.848075723648071, "epoch": 3.2039291966543475, "grad_norm": 1.3359375, "learning_rate": 0.0003984828737698536, "loss": 5.0605, "mean_token_accuracy": 0.20647359937429427, "num_tokens": 71425975.0, "step": 41180 }, { "entropy": 5.844686555862427, "epoch": 3.204318226026065, "grad_norm": 1.2265625, "learning_rate": 0.00039845970411792384, "loss": 4.9909, "mean_token_accuracy": 0.20550137460231782, "num_tokens": 71435290.0, "step": 41185 }, { "entropy": 5.754124689102173, "epoch": 3.2047072553977825, "grad_norm": 1.421875, "learning_rate": 0.0003984365325926896, "loss": 4.8529, "mean_token_accuracy": 0.22372455447912215, "num_tokens": 71444305.0, "step": 41190 }, { "entropy": 5.7936595439910885, "epoch": 3.2050962847695, "grad_norm": 1.28125, "learning_rate": 0.00039841335919450245, "loss": 4.9343, "mean_token_accuracy": 0.21301029473543168, "num_tokens": 71453007.0, "step": 41195 }, { "entropy": 5.795546531677246, "epoch": 3.205485314141218, "grad_norm": 1.3203125, "learning_rate": 0.00039839018392371397, "loss": 4.9805, "mean_token_accuracy": 0.2130945309996605, "num_tokens": 71461233.0, "step": 41200 }, { "entropy": 5.7807258605957035, "epoch": 3.205874343512935, "grad_norm": 1.34375, "learning_rate": 0.0003983670067806759, "loss": 4.9018, "mean_token_accuracy": 0.2127334013581276, "num_tokens": 71469206.0, "step": 41205 }, { "entropy": 5.762767362594604, "epoch": 3.206263372884653, "grad_norm": 1.3203125, "learning_rate": 0.0003983438277657398, "loss": 4.8802, "mean_token_accuracy": 0.21214614063501358, "num_tokens": 71477143.0, "step": 41210 }, { "entropy": 5.75270037651062, "epoch": 3.2066524022563705, "grad_norm": 1.2734375, "learning_rate": 0.0003983206468792575, "loss": 4.985, "mean_token_accuracy": 0.20365626215934754, "num_tokens": 71485485.0, "step": 41215 }, { "entropy": 5.747783422470093, "epoch": 3.2070414316280877, "grad_norm": 1.2578125, "learning_rate": 0.0003982974641215806, "loss": 4.9115, "mean_token_accuracy": 0.2188277378678322, "num_tokens": 71494713.0, "step": 41220 }, { "entropy": 5.739676809310913, "epoch": 3.2074304609998054, "grad_norm": 1.3203125, "learning_rate": 0.000398274279493061, "loss": 4.9304, "mean_token_accuracy": 0.21351024359464646, "num_tokens": 71503036.0, "step": 41225 }, { "entropy": 5.808224439620972, "epoch": 3.207819490371523, "grad_norm": 1.296875, "learning_rate": 0.00039825109299405036, "loss": 5.0112, "mean_token_accuracy": 0.2051343321800232, "num_tokens": 71511749.0, "step": 41230 }, { "entropy": 5.771705865859985, "epoch": 3.2082085197432404, "grad_norm": 1.3046875, "learning_rate": 0.0003982279046249006, "loss": 4.8985, "mean_token_accuracy": 0.22007878571748735, "num_tokens": 71519623.0, "step": 41235 }, { "entropy": 5.81016845703125, "epoch": 3.208597549114958, "grad_norm": 1.359375, "learning_rate": 0.00039820471438596346, "loss": 4.9859, "mean_token_accuracy": 0.20677320063114166, "num_tokens": 71528121.0, "step": 41240 }, { "entropy": 5.78837513923645, "epoch": 3.208986578486676, "grad_norm": 1.2890625, "learning_rate": 0.00039818152227759097, "loss": 5.0249, "mean_token_accuracy": 0.20611997395753862, "num_tokens": 71537529.0, "step": 41245 }, { "entropy": 5.851659488677979, "epoch": 3.2093756078583935, "grad_norm": 1.3671875, "learning_rate": 0.0003981583283001349, "loss": 5.0514, "mean_token_accuracy": 0.20417221635580063, "num_tokens": 71545624.0, "step": 41250 }, { "entropy": 5.8009765625, "epoch": 3.2097646372301107, "grad_norm": 1.28125, "learning_rate": 0.0003981351324539472, "loss": 4.9892, "mean_token_accuracy": 0.20762692987918854, "num_tokens": 71554578.0, "step": 41255 }, { "entropy": 5.8128331184387205, "epoch": 3.2101536666018284, "grad_norm": 1.234375, "learning_rate": 0.0003981119347393799, "loss": 4.9145, "mean_token_accuracy": 0.20966263562440873, "num_tokens": 71563669.0, "step": 41260 }, { "entropy": 5.835852813720703, "epoch": 3.210542695973546, "grad_norm": 1.3046875, "learning_rate": 0.00039808873515678495, "loss": 5.0219, "mean_token_accuracy": 0.20888498723506926, "num_tokens": 71572254.0, "step": 41265 }, { "entropy": 5.727073669433594, "epoch": 3.2109317253452634, "grad_norm": 1.2734375, "learning_rate": 0.0003980655337065144, "loss": 4.9319, "mean_token_accuracy": 0.2171695873141289, "num_tokens": 71580329.0, "step": 41270 }, { "entropy": 5.8484110832214355, "epoch": 3.211320754716981, "grad_norm": 1.3359375, "learning_rate": 0.0003980423303889201, "loss": 4.9839, "mean_token_accuracy": 0.20728642791509627, "num_tokens": 71588818.0, "step": 41275 }, { "entropy": 5.799424743652343, "epoch": 3.211709784088699, "grad_norm": 1.28125, "learning_rate": 0.00039801912520435437, "loss": 4.9854, "mean_token_accuracy": 0.2101706326007843, "num_tokens": 71597018.0, "step": 41280 }, { "entropy": 5.755481290817261, "epoch": 3.2120988134604165, "grad_norm": 1.2890625, "learning_rate": 0.0003979959181531692, "loss": 4.8652, "mean_token_accuracy": 0.21490960717201232, "num_tokens": 71605508.0, "step": 41285 }, { "entropy": 5.819076347351074, "epoch": 3.2124878428321337, "grad_norm": 1.25, "learning_rate": 0.00039797270923571683, "loss": 5.0263, "mean_token_accuracy": 0.19907890856266022, "num_tokens": 71615034.0, "step": 41290 }, { "entropy": 5.727461624145508, "epoch": 3.2128768722038514, "grad_norm": 1.3203125, "learning_rate": 0.00039794949845234925, "loss": 4.9523, "mean_token_accuracy": 0.20956735610961913, "num_tokens": 71623745.0, "step": 41295 }, { "entropy": 5.773867511749268, "epoch": 3.213265901575569, "grad_norm": 1.296875, "learning_rate": 0.00039792628580341874, "loss": 4.8701, "mean_token_accuracy": 0.2133917659521103, "num_tokens": 71632009.0, "step": 41300 }, { "entropy": 5.680625057220459, "epoch": 3.2136549309472864, "grad_norm": 1.2421875, "learning_rate": 0.00039790307128927745, "loss": 4.8187, "mean_token_accuracy": 0.2185284599661827, "num_tokens": 71640982.0, "step": 41305 }, { "entropy": 5.767665147781372, "epoch": 3.214043960319004, "grad_norm": 1.3828125, "learning_rate": 0.00039787985491027773, "loss": 4.9638, "mean_token_accuracy": 0.2144096463918686, "num_tokens": 71649556.0, "step": 41310 }, { "entropy": 5.76659893989563, "epoch": 3.2144329896907218, "grad_norm": 1.328125, "learning_rate": 0.00039785663666677175, "loss": 4.9503, "mean_token_accuracy": 0.21351449936628342, "num_tokens": 71657691.0, "step": 41315 }, { "entropy": 5.865299940109253, "epoch": 3.214822019062439, "grad_norm": 1.34375, "learning_rate": 0.00039783341655911185, "loss": 5.0074, "mean_token_accuracy": 0.20650093257427216, "num_tokens": 71666050.0, "step": 41320 }, { "entropy": 5.800711059570313, "epoch": 3.2152110484341567, "grad_norm": 1.265625, "learning_rate": 0.0003978101945876504, "loss": 4.8402, "mean_token_accuracy": 0.22236639112234116, "num_tokens": 71675225.0, "step": 41325 }, { "entropy": 5.745185422897339, "epoch": 3.2156000778058744, "grad_norm": 1.296875, "learning_rate": 0.00039778697075273977, "loss": 4.9695, "mean_token_accuracy": 0.21332037895917894, "num_tokens": 71683929.0, "step": 41330 }, { "entropy": 5.8070821285247805, "epoch": 3.2159891071775917, "grad_norm": 1.3046875, "learning_rate": 0.00039776374505473224, "loss": 4.9404, "mean_token_accuracy": 0.21182017773389816, "num_tokens": 71692192.0, "step": 41335 }, { "entropy": 5.827668762207031, "epoch": 3.2163781365493094, "grad_norm": 1.2890625, "learning_rate": 0.0003977405174939803, "loss": 5.012, "mean_token_accuracy": 0.20461510717868805, "num_tokens": 71701091.0, "step": 41340 }, { "entropy": 5.81718807220459, "epoch": 3.216767165921027, "grad_norm": 1.3046875, "learning_rate": 0.00039771728807083635, "loss": 4.9897, "mean_token_accuracy": 0.20473780632019042, "num_tokens": 71710271.0, "step": 41345 }, { "entropy": 5.7647322654724125, "epoch": 3.2171561952927448, "grad_norm": 1.34375, "learning_rate": 0.00039769405678565287, "loss": 4.8971, "mean_token_accuracy": 0.2156020849943161, "num_tokens": 71719238.0, "step": 41350 }, { "entropy": 5.8681073665618895, "epoch": 3.217545224664462, "grad_norm": 1.2578125, "learning_rate": 0.00039767082363878237, "loss": 4.9807, "mean_token_accuracy": 0.21010494232177734, "num_tokens": 71728144.0, "step": 41355 }, { "entropy": 5.833740711212158, "epoch": 3.2179342540361797, "grad_norm": 1.328125, "learning_rate": 0.0003976475886305774, "loss": 4.9761, "mean_token_accuracy": 0.21396714597940444, "num_tokens": 71736724.0, "step": 41360 }, { "entropy": 5.7121439456939695, "epoch": 3.2183232834078974, "grad_norm": 1.2890625, "learning_rate": 0.0003976243517613904, "loss": 4.9447, "mean_token_accuracy": 0.20895344018936157, "num_tokens": 71745672.0, "step": 41365 }, { "entropy": 5.7311968326568605, "epoch": 3.2187123127796147, "grad_norm": 1.375, "learning_rate": 0.00039760111303157415, "loss": 5.0437, "mean_token_accuracy": 0.21089872866868972, "num_tokens": 71754401.0, "step": 41370 }, { "entropy": 5.7750989437103275, "epoch": 3.2191013421513324, "grad_norm": 1.3515625, "learning_rate": 0.000397577872441481, "loss": 4.9959, "mean_token_accuracy": 0.19995273500680924, "num_tokens": 71763273.0, "step": 41375 }, { "entropy": 5.847412347793579, "epoch": 3.21949037152305, "grad_norm": 1.359375, "learning_rate": 0.0003975546299914639, "loss": 4.9422, "mean_token_accuracy": 0.2096270963549614, "num_tokens": 71772239.0, "step": 41380 }, { "entropy": 5.795411729812622, "epoch": 3.2198794008947678, "grad_norm": 1.21875, "learning_rate": 0.0003975313856818753, "loss": 4.9277, "mean_token_accuracy": 0.2073624074459076, "num_tokens": 71780900.0, "step": 41385 }, { "entropy": 5.8129322052001955, "epoch": 3.220268430266485, "grad_norm": 1.234375, "learning_rate": 0.0003975081395130679, "loss": 4.9052, "mean_token_accuracy": 0.2234566479921341, "num_tokens": 71788490.0, "step": 41390 }, { "entropy": 5.770750570297241, "epoch": 3.2206574596382027, "grad_norm": 1.2109375, "learning_rate": 0.0003974848914853946, "loss": 4.9288, "mean_token_accuracy": 0.20513194054365158, "num_tokens": 71796960.0, "step": 41395 }, { "entropy": 5.767718553543091, "epoch": 3.2210464890099204, "grad_norm": 1.234375, "learning_rate": 0.00039746164159920795, "loss": 5.0021, "mean_token_accuracy": 0.21339890062808992, "num_tokens": 71805694.0, "step": 41400 }, { "entropy": 5.782075643539429, "epoch": 3.2214355183816377, "grad_norm": 1.3046875, "learning_rate": 0.00039743838985486075, "loss": 4.9433, "mean_token_accuracy": 0.21322095394134521, "num_tokens": 71814505.0, "step": 41405 }, { "entropy": 5.868829822540283, "epoch": 3.2218245477533554, "grad_norm": 1.3125, "learning_rate": 0.0003974151362527059, "loss": 5.0879, "mean_token_accuracy": 0.20288662165403365, "num_tokens": 71822950.0, "step": 41410 }, { "entropy": 5.732941198348999, "epoch": 3.222213577125073, "grad_norm": 1.375, "learning_rate": 0.00039739188079309626, "loss": 4.799, "mean_token_accuracy": 0.23948272168636323, "num_tokens": 71831681.0, "step": 41415 }, { "entropy": 5.766956758499146, "epoch": 3.2226026064967903, "grad_norm": 1.3359375, "learning_rate": 0.0003973686234763846, "loss": 4.9662, "mean_token_accuracy": 0.20776891857385635, "num_tokens": 71839678.0, "step": 41420 }, { "entropy": 5.750882816314697, "epoch": 3.222991635868508, "grad_norm": 1.2265625, "learning_rate": 0.0003973453643029239, "loss": 4.9466, "mean_token_accuracy": 0.20962336510419846, "num_tokens": 71848667.0, "step": 41425 }, { "entropy": 5.751950359344482, "epoch": 3.2233806652402257, "grad_norm": 1.5, "learning_rate": 0.0003973221032730669, "loss": 4.9211, "mean_token_accuracy": 0.21663199812173844, "num_tokens": 71858117.0, "step": 41430 }, { "entropy": 5.784395933151245, "epoch": 3.2237696946119434, "grad_norm": 1.3125, "learning_rate": 0.0003972988403871668, "loss": 5.0054, "mean_token_accuracy": 0.21016646027565003, "num_tokens": 71866870.0, "step": 41435 }, { "entropy": 5.750413799285889, "epoch": 3.2241587239836607, "grad_norm": 1.3515625, "learning_rate": 0.0003972755756455764, "loss": 4.8969, "mean_token_accuracy": 0.2143656611442566, "num_tokens": 71875228.0, "step": 41440 }, { "entropy": 5.750663232803345, "epoch": 3.2245477533553784, "grad_norm": 1.3359375, "learning_rate": 0.0003972523090486487, "loss": 5.0088, "mean_token_accuracy": 0.21038378328084945, "num_tokens": 71883489.0, "step": 41445 }, { "entropy": 5.761793088912964, "epoch": 3.224936782727096, "grad_norm": 1.375, "learning_rate": 0.0003972290405967369, "loss": 4.9474, "mean_token_accuracy": 0.21483329236507415, "num_tokens": 71891968.0, "step": 41450 }, { "entropy": 5.730778932571411, "epoch": 3.2253258120988133, "grad_norm": 1.3203125, "learning_rate": 0.0003972057702901939, "loss": 4.9211, "mean_token_accuracy": 0.2081231579184532, "num_tokens": 71900249.0, "step": 41455 }, { "entropy": 5.800330972671508, "epoch": 3.225714841470531, "grad_norm": 1.3828125, "learning_rate": 0.0003971824981293729, "loss": 4.9626, "mean_token_accuracy": 0.21230370700359344, "num_tokens": 71908379.0, "step": 41460 }, { "entropy": 5.805521774291992, "epoch": 3.2261038708422487, "grad_norm": 1.2265625, "learning_rate": 0.0003971592241146269, "loss": 5.033, "mean_token_accuracy": 0.2092769369482994, "num_tokens": 71917112.0, "step": 41465 }, { "entropy": 5.7395017623901365, "epoch": 3.226492900213966, "grad_norm": 1.171875, "learning_rate": 0.0003971359482463092, "loss": 4.8859, "mean_token_accuracy": 0.2077142998576164, "num_tokens": 71926353.0, "step": 41470 }, { "entropy": 5.804167938232422, "epoch": 3.2268819295856837, "grad_norm": 1.3515625, "learning_rate": 0.0003971126705247727, "loss": 4.9751, "mean_token_accuracy": 0.2055477738380432, "num_tokens": 71934948.0, "step": 41475 }, { "entropy": 5.74941349029541, "epoch": 3.2272709589574013, "grad_norm": 1.28125, "learning_rate": 0.0003970893909503709, "loss": 4.9487, "mean_token_accuracy": 0.21023307293653487, "num_tokens": 71943264.0, "step": 41480 }, { "entropy": 5.733584022521972, "epoch": 3.227659988329119, "grad_norm": 1.2890625, "learning_rate": 0.000397066109523457, "loss": 4.8775, "mean_token_accuracy": 0.2171202689409256, "num_tokens": 71951785.0, "step": 41485 }, { "entropy": 5.806576919555664, "epoch": 3.2280490177008363, "grad_norm": 1.3359375, "learning_rate": 0.0003970428262443842, "loss": 5.0799, "mean_token_accuracy": 0.19907734990119935, "num_tokens": 71960994.0, "step": 41490 }, { "entropy": 5.807471847534179, "epoch": 3.228438047072554, "grad_norm": 1.34375, "learning_rate": 0.00039701954111350565, "loss": 4.9392, "mean_token_accuracy": 0.21206496506929398, "num_tokens": 71970077.0, "step": 41495 }, { "entropy": 5.839105749130249, "epoch": 3.2288270764442717, "grad_norm": 1.28125, "learning_rate": 0.0003969962541311748, "loss": 4.9891, "mean_token_accuracy": 0.2114150419831276, "num_tokens": 71978605.0, "step": 41500 }, { "entropy": 5.780712509155274, "epoch": 3.229216105815989, "grad_norm": 1.296875, "learning_rate": 0.00039697296529774494, "loss": 4.9948, "mean_token_accuracy": 0.2058292031288147, "num_tokens": 71986707.0, "step": 41505 }, { "entropy": 5.735283231735229, "epoch": 3.2296051351877066, "grad_norm": 1.3046875, "learning_rate": 0.00039694967461356944, "loss": 4.9289, "mean_token_accuracy": 0.22236113250255585, "num_tokens": 71994857.0, "step": 41510 }, { "entropy": 5.709937334060669, "epoch": 3.2299941645594243, "grad_norm": 1.2265625, "learning_rate": 0.00039692638207900177, "loss": 4.8675, "mean_token_accuracy": 0.21237671822309495, "num_tokens": 72004049.0, "step": 41515 }, { "entropy": 5.795295572280883, "epoch": 3.2303831939311416, "grad_norm": 1.3515625, "learning_rate": 0.0003969030876943954, "loss": 4.9045, "mean_token_accuracy": 0.219709812104702, "num_tokens": 72012401.0, "step": 41520 }, { "entropy": 5.745581388473511, "epoch": 3.2307722233028593, "grad_norm": 1.328125, "learning_rate": 0.00039687979146010367, "loss": 4.924, "mean_token_accuracy": 0.2079921320080757, "num_tokens": 72020789.0, "step": 41525 }, { "entropy": 5.711466264724732, "epoch": 3.231161252674577, "grad_norm": 1.3515625, "learning_rate": 0.00039685649337648, "loss": 4.8992, "mean_token_accuracy": 0.21568625718355178, "num_tokens": 72028446.0, "step": 41530 }, { "entropy": 5.694146299362183, "epoch": 3.2315502820462947, "grad_norm": 1.328125, "learning_rate": 0.00039683319344387813, "loss": 4.8871, "mean_token_accuracy": 0.2188536375761032, "num_tokens": 72036741.0, "step": 41535 }, { "entropy": 5.722387886047363, "epoch": 3.231939311418012, "grad_norm": 1.3828125, "learning_rate": 0.00039680989166265135, "loss": 4.9295, "mean_token_accuracy": 0.21364345401525497, "num_tokens": 72045618.0, "step": 41540 }, { "entropy": 5.824947786331177, "epoch": 3.2323283407897296, "grad_norm": 1.234375, "learning_rate": 0.00039678658803315336, "loss": 4.9907, "mean_token_accuracy": 0.2030959501862526, "num_tokens": 72054643.0, "step": 41545 }, { "entropy": 5.760968732833862, "epoch": 3.2327173701614473, "grad_norm": 1.3125, "learning_rate": 0.00039676328255573777, "loss": 4.9339, "mean_token_accuracy": 0.21390660256147384, "num_tokens": 72062721.0, "step": 41550 }, { "entropy": 5.689414119720459, "epoch": 3.2331063995331646, "grad_norm": 1.4765625, "learning_rate": 0.00039673997523075825, "loss": 4.9067, "mean_token_accuracy": 0.20879996418952942, "num_tokens": 72071640.0, "step": 41555 }, { "entropy": 5.754532766342163, "epoch": 3.2334954289048823, "grad_norm": 1.375, "learning_rate": 0.00039671666605856825, "loss": 4.851, "mean_token_accuracy": 0.22473989129066468, "num_tokens": 72080022.0, "step": 41560 }, { "entropy": 5.78931827545166, "epoch": 3.2338844582766, "grad_norm": 1.2578125, "learning_rate": 0.00039669335503952165, "loss": 4.9867, "mean_token_accuracy": 0.20165071338415147, "num_tokens": 72088035.0, "step": 41565 }, { "entropy": 5.841640663146973, "epoch": 3.2342734876483172, "grad_norm": 1.2265625, "learning_rate": 0.00039667004217397206, "loss": 5.0186, "mean_token_accuracy": 0.20210168063640593, "num_tokens": 72096427.0, "step": 41570 }, { "entropy": 5.790648555755615, "epoch": 3.234662517020035, "grad_norm": 1.375, "learning_rate": 0.00039664672746227326, "loss": 4.9924, "mean_token_accuracy": 0.2093882143497467, "num_tokens": 72105207.0, "step": 41575 }, { "entropy": 5.761158800125122, "epoch": 3.2350515463917526, "grad_norm": 1.25, "learning_rate": 0.0003966234109047789, "loss": 4.8404, "mean_token_accuracy": 0.22233157455921174, "num_tokens": 72113963.0, "step": 41580 }, { "entropy": 5.729147052764892, "epoch": 3.2354405757634703, "grad_norm": 1.375, "learning_rate": 0.000396600092501843, "loss": 4.9744, "mean_token_accuracy": 0.21021894067525865, "num_tokens": 72122585.0, "step": 41585 }, { "entropy": 5.781980037689209, "epoch": 3.2358296051351876, "grad_norm": 1.390625, "learning_rate": 0.00039657677225381915, "loss": 4.9402, "mean_token_accuracy": 0.21595092862844467, "num_tokens": 72131349.0, "step": 41590 }, { "entropy": 5.806960344314575, "epoch": 3.2362186345069053, "grad_norm": 1.1953125, "learning_rate": 0.0003965534501610613, "loss": 5.0188, "mean_token_accuracy": 0.21161748021841048, "num_tokens": 72140960.0, "step": 41595 }, { "entropy": 5.832040166854858, "epoch": 3.236607663878623, "grad_norm": 1.234375, "learning_rate": 0.0003965301262239234, "loss": 4.923, "mean_token_accuracy": 0.21271607428789138, "num_tokens": 72150126.0, "step": 41600 }, { "entropy": 5.733131742477417, "epoch": 3.2369966932503402, "grad_norm": 1.3359375, "learning_rate": 0.0003965068004427591, "loss": 4.9054, "mean_token_accuracy": 0.21350779384374619, "num_tokens": 72158909.0, "step": 41605 }, { "entropy": 5.89306116104126, "epoch": 3.237385722622058, "grad_norm": 1.375, "learning_rate": 0.0003964834728179226, "loss": 5.0707, "mean_token_accuracy": 0.20242188274860382, "num_tokens": 72168409.0, "step": 41610 }, { "entropy": 5.780468416213989, "epoch": 3.2377747519937756, "grad_norm": 1.375, "learning_rate": 0.00039646014334976783, "loss": 4.8875, "mean_token_accuracy": 0.20918132215738297, "num_tokens": 72176366.0, "step": 41615 }, { "entropy": 5.7993604183197025, "epoch": 3.2381637813654933, "grad_norm": 1.2421875, "learning_rate": 0.00039643681203864863, "loss": 4.9854, "mean_token_accuracy": 0.20882545858621598, "num_tokens": 72185905.0, "step": 41620 }, { "entropy": 5.770069408416748, "epoch": 3.2385528107372106, "grad_norm": 1.3515625, "learning_rate": 0.00039641347888491905, "loss": 4.9041, "mean_token_accuracy": 0.21048083901405334, "num_tokens": 72195108.0, "step": 41625 }, { "entropy": 5.792064476013183, "epoch": 3.2389418401089283, "grad_norm": 1.3828125, "learning_rate": 0.00039639014388893337, "loss": 4.9407, "mean_token_accuracy": 0.20949421226978301, "num_tokens": 72204218.0, "step": 41630 }, { "entropy": 5.80674729347229, "epoch": 3.239330869480646, "grad_norm": 1.296875, "learning_rate": 0.0003963668070510453, "loss": 4.9522, "mean_token_accuracy": 0.21359972208738326, "num_tokens": 72212658.0, "step": 41635 }, { "entropy": 5.749911785125732, "epoch": 3.2397198988523632, "grad_norm": 1.390625, "learning_rate": 0.0003963434683716091, "loss": 4.936, "mean_token_accuracy": 0.2147606998682022, "num_tokens": 72221167.0, "step": 41640 }, { "entropy": 5.794390344619751, "epoch": 3.240108928224081, "grad_norm": 1.3125, "learning_rate": 0.0003963201278509789, "loss": 4.9408, "mean_token_accuracy": 0.20405421704053878, "num_tokens": 72230254.0, "step": 41645 }, { "entropy": 5.860540533065796, "epoch": 3.2404979575957986, "grad_norm": 1.234375, "learning_rate": 0.0003962967854895089, "loss": 5.0716, "mean_token_accuracy": 0.20366933345794677, "num_tokens": 72239203.0, "step": 41650 }, { "entropy": 5.775693750381469, "epoch": 3.240886986967516, "grad_norm": 1.296875, "learning_rate": 0.0003962734412875533, "loss": 5.0143, "mean_token_accuracy": 0.20404946208000183, "num_tokens": 72247506.0, "step": 41655 }, { "entropy": 5.8076694965362545, "epoch": 3.2412760163392336, "grad_norm": 1.2890625, "learning_rate": 0.0003962500952454662, "loss": 4.9824, "mean_token_accuracy": 0.21339436024427413, "num_tokens": 72256251.0, "step": 41660 }, { "entropy": 5.776844024658203, "epoch": 3.2416650457109513, "grad_norm": 1.3046875, "learning_rate": 0.00039622674736360195, "loss": 4.9238, "mean_token_accuracy": 0.211805360019207, "num_tokens": 72264674.0, "step": 41665 }, { "entropy": 5.742752456665039, "epoch": 3.2420540750826685, "grad_norm": 1.2265625, "learning_rate": 0.00039620339764231467, "loss": 4.8552, "mean_token_accuracy": 0.21759113818407058, "num_tokens": 72273547.0, "step": 41670 }, { "entropy": 5.815679931640625, "epoch": 3.242443104454386, "grad_norm": 1.359375, "learning_rate": 0.00039618004608195877, "loss": 4.9326, "mean_token_accuracy": 0.21539129316806793, "num_tokens": 72281947.0, "step": 41675 }, { "entropy": 5.715179824829102, "epoch": 3.242832133826104, "grad_norm": 1.4140625, "learning_rate": 0.00039615669268288863, "loss": 4.8832, "mean_token_accuracy": 0.21577232033014299, "num_tokens": 72290420.0, "step": 41680 }, { "entropy": 5.717205476760864, "epoch": 3.2432211631978216, "grad_norm": 1.4140625, "learning_rate": 0.00039613333744545836, "loss": 4.9256, "mean_token_accuracy": 0.21262929886579512, "num_tokens": 72299300.0, "step": 41685 }, { "entropy": 5.77725887298584, "epoch": 3.243610192569539, "grad_norm": 1.2890625, "learning_rate": 0.0003961099803700226, "loss": 4.9858, "mean_token_accuracy": 0.20263432562351227, "num_tokens": 72307217.0, "step": 41690 }, { "entropy": 5.790657091140747, "epoch": 3.2439992219412566, "grad_norm": 1.34375, "learning_rate": 0.0003960866214569357, "loss": 4.9057, "mean_token_accuracy": 0.21433602422475814, "num_tokens": 72315304.0, "step": 41695 }, { "entropy": 5.732626628875733, "epoch": 3.2443882513129743, "grad_norm": 1.2734375, "learning_rate": 0.00039606326070655204, "loss": 4.9827, "mean_token_accuracy": 0.2085035353899002, "num_tokens": 72323661.0, "step": 41700 }, { "entropy": 5.750534582138061, "epoch": 3.2447772806846915, "grad_norm": 1.296875, "learning_rate": 0.00039603989811922596, "loss": 4.9252, "mean_token_accuracy": 0.20845236629247665, "num_tokens": 72332159.0, "step": 41705 }, { "entropy": 5.785015964508057, "epoch": 3.245166310056409, "grad_norm": 1.3359375, "learning_rate": 0.0003960165336953122, "loss": 4.9616, "mean_token_accuracy": 0.21324131190776824, "num_tokens": 72340509.0, "step": 41710 }, { "entropy": 5.788167428970337, "epoch": 3.245555339428127, "grad_norm": 1.2421875, "learning_rate": 0.0003959931674351651, "loss": 4.8849, "mean_token_accuracy": 0.21773664206266402, "num_tokens": 72349687.0, "step": 41715 }, { "entropy": 5.775322484970093, "epoch": 3.2459443687998446, "grad_norm": 1.3359375, "learning_rate": 0.0003959697993391393, "loss": 4.9034, "mean_token_accuracy": 0.2127616822719574, "num_tokens": 72358341.0, "step": 41720 }, { "entropy": 5.8342207908630375, "epoch": 3.246333398171562, "grad_norm": 1.2734375, "learning_rate": 0.00039594642940758934, "loss": 4.972, "mean_token_accuracy": 0.20729655027389526, "num_tokens": 72367346.0, "step": 41725 }, { "entropy": 5.757956266403198, "epoch": 3.2467224275432796, "grad_norm": 1.3828125, "learning_rate": 0.00039592305764086984, "loss": 4.8859, "mean_token_accuracy": 0.2115914151072502, "num_tokens": 72375603.0, "step": 41730 }, { "entropy": 5.791325902938842, "epoch": 3.2471114569149973, "grad_norm": 1.3515625, "learning_rate": 0.00039589968403933533, "loss": 4.9322, "mean_token_accuracy": 0.21353906989097596, "num_tokens": 72383920.0, "step": 41735 }, { "entropy": 5.777887630462646, "epoch": 3.2475004862867145, "grad_norm": 1.296875, "learning_rate": 0.0003958763086033406, "loss": 4.9992, "mean_token_accuracy": 0.21097012460231782, "num_tokens": 72392764.0, "step": 41740 }, { "entropy": 5.777517414093017, "epoch": 3.247889515658432, "grad_norm": 1.234375, "learning_rate": 0.0003958529313332403, "loss": 4.8654, "mean_token_accuracy": 0.21646185368299484, "num_tokens": 72401358.0, "step": 41745 }, { "entropy": 5.871073246002197, "epoch": 3.24827854503015, "grad_norm": 1.2734375, "learning_rate": 0.0003958295522293891, "loss": 5.0444, "mean_token_accuracy": 0.20554718226194382, "num_tokens": 72410039.0, "step": 41750 }, { "entropy": 5.797944164276123, "epoch": 3.248667574401867, "grad_norm": 1.2578125, "learning_rate": 0.0003958061712921417, "loss": 4.9837, "mean_token_accuracy": 0.20827229917049409, "num_tokens": 72418858.0, "step": 41755 }, { "entropy": 5.7297399044036865, "epoch": 3.249056603773585, "grad_norm": 1.3359375, "learning_rate": 0.000395782788521853, "loss": 4.9558, "mean_token_accuracy": 0.2091977372765541, "num_tokens": 72426897.0, "step": 41760 }, { "entropy": 5.709538459777832, "epoch": 3.2494456331453025, "grad_norm": 1.2109375, "learning_rate": 0.0003957594039188778, "loss": 4.8581, "mean_token_accuracy": 0.21671053916215896, "num_tokens": 72436305.0, "step": 41765 }, { "entropy": 5.758968114852905, "epoch": 3.24983466251702, "grad_norm": 1.265625, "learning_rate": 0.0003957360174835708, "loss": 4.9327, "mean_token_accuracy": 0.21369852870702744, "num_tokens": 72444845.0, "step": 41770 }, { "entropy": 5.754583883285522, "epoch": 3.2502236918887375, "grad_norm": 1.3203125, "learning_rate": 0.0003957126292162868, "loss": 4.8984, "mean_token_accuracy": 0.21952549517154693, "num_tokens": 72452926.0, "step": 41775 }, { "entropy": 5.758207082748413, "epoch": 3.250612721260455, "grad_norm": 1.3671875, "learning_rate": 0.0003956892391173809, "loss": 5.032, "mean_token_accuracy": 0.20759376883506775, "num_tokens": 72460934.0, "step": 41780 }, { "entropy": 5.741777992248535, "epoch": 3.251001750632173, "grad_norm": 1.1796875, "learning_rate": 0.00039566584718720793, "loss": 4.9121, "mean_token_accuracy": 0.21809347867965698, "num_tokens": 72470443.0, "step": 41785 }, { "entropy": 5.849734210968018, "epoch": 3.25139078000389, "grad_norm": 1.2578125, "learning_rate": 0.0003956424534261227, "loss": 4.9661, "mean_token_accuracy": 0.2082554891705513, "num_tokens": 72478948.0, "step": 41790 }, { "entropy": 5.799407339096069, "epoch": 3.251779809375608, "grad_norm": 1.28125, "learning_rate": 0.00039561905783448025, "loss": 4.9113, "mean_token_accuracy": 0.2126250982284546, "num_tokens": 72488298.0, "step": 41795 }, { "entropy": 5.737770032882691, "epoch": 3.2521688387473255, "grad_norm": 1.3515625, "learning_rate": 0.00039559566041263565, "loss": 4.9833, "mean_token_accuracy": 0.20783808678388596, "num_tokens": 72497048.0, "step": 41800 }, { "entropy": 5.785961532592774, "epoch": 3.252557868119043, "grad_norm": 1.3046875, "learning_rate": 0.0003955722611609438, "loss": 4.8979, "mean_token_accuracy": 0.2136231318116188, "num_tokens": 72505460.0, "step": 41805 }, { "entropy": 5.7440896987915036, "epoch": 3.2529468974907605, "grad_norm": 1.3671875, "learning_rate": 0.00039554886007975976, "loss": 4.9613, "mean_token_accuracy": 0.21886239796876908, "num_tokens": 72513838.0, "step": 41810 }, { "entropy": 5.7780615329742435, "epoch": 3.253335926862478, "grad_norm": 1.3515625, "learning_rate": 0.00039552545716943873, "loss": 4.9765, "mean_token_accuracy": 0.20057988315820693, "num_tokens": 72522087.0, "step": 41815 }, { "entropy": 5.769866800308227, "epoch": 3.253724956234196, "grad_norm": 1.1484375, "learning_rate": 0.0003955020524303358, "loss": 4.9703, "mean_token_accuracy": 0.2101208359003067, "num_tokens": 72530950.0, "step": 41820 }, { "entropy": 5.849100875854492, "epoch": 3.254113985605913, "grad_norm": 1.2890625, "learning_rate": 0.00039547864586280583, "loss": 4.9945, "mean_token_accuracy": 0.21138802766799927, "num_tokens": 72539916.0, "step": 41825 }, { "entropy": 5.83349642753601, "epoch": 3.254503014977631, "grad_norm": 1.421875, "learning_rate": 0.0003954552374672042, "loss": 4.9418, "mean_token_accuracy": 0.2174818307161331, "num_tokens": 72548193.0, "step": 41830 }, { "entropy": 5.7442240715026855, "epoch": 3.2548920443493485, "grad_norm": 1.3125, "learning_rate": 0.0003954318272438862, "loss": 4.852, "mean_token_accuracy": 0.22028546780347824, "num_tokens": 72557512.0, "step": 41835 }, { "entropy": 5.781580018997192, "epoch": 3.255281073721066, "grad_norm": 1.3046875, "learning_rate": 0.0003954084151932067, "loss": 4.9802, "mean_token_accuracy": 0.21178440898656845, "num_tokens": 72566127.0, "step": 41840 }, { "entropy": 5.745047235488892, "epoch": 3.2556701030927835, "grad_norm": 1.296875, "learning_rate": 0.0003953850013155214, "loss": 4.8829, "mean_token_accuracy": 0.21666940599679946, "num_tokens": 72574823.0, "step": 41845 }, { "entropy": 5.785233354568481, "epoch": 3.256059132464501, "grad_norm": 1.2109375, "learning_rate": 0.0003953615856111852, "loss": 4.978, "mean_token_accuracy": 0.2044033706188202, "num_tokens": 72583664.0, "step": 41850 }, { "entropy": 5.81323652267456, "epoch": 3.256448161836219, "grad_norm": 1.328125, "learning_rate": 0.00039533816808055345, "loss": 5.0857, "mean_token_accuracy": 0.2029036581516266, "num_tokens": 72591844.0, "step": 41855 }, { "entropy": 5.745996809005737, "epoch": 3.256837191207936, "grad_norm": 1.3125, "learning_rate": 0.00039531474872398165, "loss": 4.8479, "mean_token_accuracy": 0.218050953745842, "num_tokens": 72599389.0, "step": 41860 }, { "entropy": 5.730141687393188, "epoch": 3.257226220579654, "grad_norm": 1.3203125, "learning_rate": 0.000395291327541825, "loss": 4.8887, "mean_token_accuracy": 0.21986958682537078, "num_tokens": 72608041.0, "step": 41865 }, { "entropy": 5.773430490493775, "epoch": 3.257615249951371, "grad_norm": 1.234375, "learning_rate": 0.00039526790453443887, "loss": 4.9446, "mean_token_accuracy": 0.21381855756044388, "num_tokens": 72617394.0, "step": 41870 }, { "entropy": 5.75916166305542, "epoch": 3.258004279323089, "grad_norm": 1.3125, "learning_rate": 0.00039524447970217875, "loss": 4.8852, "mean_token_accuracy": 0.21833214312791824, "num_tokens": 72626827.0, "step": 41875 }, { "entropy": 5.775624084472656, "epoch": 3.2583933086948065, "grad_norm": 1.265625, "learning_rate": 0.00039522105304540007, "loss": 4.9641, "mean_token_accuracy": 0.21388145834207534, "num_tokens": 72634777.0, "step": 41880 }, { "entropy": 5.758747529983521, "epoch": 3.258782338066524, "grad_norm": 1.3359375, "learning_rate": 0.0003951976245644582, "loss": 4.9114, "mean_token_accuracy": 0.21434588432312013, "num_tokens": 72643440.0, "step": 41885 }, { "entropy": 5.812613010406494, "epoch": 3.2591713674382414, "grad_norm": 1.3515625, "learning_rate": 0.0003951741942597087, "loss": 4.9793, "mean_token_accuracy": 0.21094197928905487, "num_tokens": 72651353.0, "step": 41890 }, { "entropy": 5.613944387435913, "epoch": 3.259560396809959, "grad_norm": 1.34375, "learning_rate": 0.00039515076213150714, "loss": 4.7704, "mean_token_accuracy": 0.21638057976961136, "num_tokens": 72659676.0, "step": 41895 }, { "entropy": 5.7297060012817385, "epoch": 3.259949426181677, "grad_norm": 1.2890625, "learning_rate": 0.00039512732818020903, "loss": 5.0193, "mean_token_accuracy": 0.20869381576776505, "num_tokens": 72668470.0, "step": 41900 }, { "entropy": 5.667131805419922, "epoch": 3.260338455553394, "grad_norm": 1.296875, "learning_rate": 0.0003951038924061698, "loss": 4.8038, "mean_token_accuracy": 0.22569464445114135, "num_tokens": 72677455.0, "step": 41905 }, { "entropy": 5.758939456939697, "epoch": 3.2607274849251118, "grad_norm": 1.28125, "learning_rate": 0.00039508045480974517, "loss": 4.8642, "mean_token_accuracy": 0.22165038287639618, "num_tokens": 72686405.0, "step": 41910 }, { "entropy": 5.673498630523682, "epoch": 3.2611165142968295, "grad_norm": 1.21875, "learning_rate": 0.00039505701539129087, "loss": 4.9044, "mean_token_accuracy": 0.21268380135297776, "num_tokens": 72695281.0, "step": 41915 }, { "entropy": 5.7695831775665285, "epoch": 3.261505543668547, "grad_norm": 1.3828125, "learning_rate": 0.00039503357415116236, "loss": 4.9827, "mean_token_accuracy": 0.2100575789809227, "num_tokens": 72703310.0, "step": 41920 }, { "entropy": 5.757158851623535, "epoch": 3.2618945730402644, "grad_norm": 1.296875, "learning_rate": 0.00039501013108971547, "loss": 4.91, "mean_token_accuracy": 0.21165044903755187, "num_tokens": 72711756.0, "step": 41925 }, { "entropy": 5.791324043273926, "epoch": 3.262283602411982, "grad_norm": 1.25, "learning_rate": 0.0003949866862073059, "loss": 4.966, "mean_token_accuracy": 0.21065959483385086, "num_tokens": 72720569.0, "step": 41930 }, { "entropy": 5.76608419418335, "epoch": 3.2626726317837, "grad_norm": 1.234375, "learning_rate": 0.00039496323950428925, "loss": 5.0089, "mean_token_accuracy": 0.2075114980340004, "num_tokens": 72729245.0, "step": 41935 }, { "entropy": 5.785895967483521, "epoch": 3.263061661155417, "grad_norm": 1.328125, "learning_rate": 0.0003949397909810213, "loss": 4.9857, "mean_token_accuracy": 0.20666667073965073, "num_tokens": 72737727.0, "step": 41940 }, { "entropy": 5.867413711547852, "epoch": 3.2634506905271348, "grad_norm": 1.359375, "learning_rate": 0.00039491634063785813, "loss": 5.1081, "mean_token_accuracy": 0.200570809841156, "num_tokens": 72746090.0, "step": 41945 }, { "entropy": 5.739043235778809, "epoch": 3.2638397198988525, "grad_norm": 1.3046875, "learning_rate": 0.00039489288847515525, "loss": 4.8519, "mean_token_accuracy": 0.21741611063480376, "num_tokens": 72755457.0, "step": 41950 }, { "entropy": 5.678177833557129, "epoch": 3.26422874927057, "grad_norm": 1.28125, "learning_rate": 0.0003948694344932687, "loss": 4.8905, "mean_token_accuracy": 0.21455446481704712, "num_tokens": 72764551.0, "step": 41955 }, { "entropy": 5.827851247787476, "epoch": 3.2646177786422874, "grad_norm": 1.375, "learning_rate": 0.0003948459786925542, "loss": 4.9175, "mean_token_accuracy": 0.22083588540554047, "num_tokens": 72773672.0, "step": 41960 }, { "entropy": 5.862974500656128, "epoch": 3.265006808014005, "grad_norm": 1.359375, "learning_rate": 0.0003948225210733677, "loss": 5.0227, "mean_token_accuracy": 0.20921988040208817, "num_tokens": 72782479.0, "step": 41965 }, { "entropy": 5.867896556854248, "epoch": 3.265395837385723, "grad_norm": 1.359375, "learning_rate": 0.0003947990616360652, "loss": 5.0371, "mean_token_accuracy": 0.20904160141944886, "num_tokens": 72790711.0, "step": 41970 }, { "entropy": 5.780977535247803, "epoch": 3.26578486675744, "grad_norm": 1.296875, "learning_rate": 0.0003947756003810026, "loss": 4.9847, "mean_token_accuracy": 0.20842327326536178, "num_tokens": 72798684.0, "step": 41975 }, { "entropy": 5.752422523498535, "epoch": 3.2661738961291578, "grad_norm": 1.375, "learning_rate": 0.0003947521373085359, "loss": 4.9126, "mean_token_accuracy": 0.2103138878941536, "num_tokens": 72806536.0, "step": 41980 }, { "entropy": 5.711889553070068, "epoch": 3.2665629255008755, "grad_norm": 1.3671875, "learning_rate": 0.0003947286724190212, "loss": 4.8445, "mean_token_accuracy": 0.22313413619995118, "num_tokens": 72815221.0, "step": 41985 }, { "entropy": 5.75643310546875, "epoch": 3.2669519548725927, "grad_norm": 1.1875, "learning_rate": 0.00039470520571281443, "loss": 4.8934, "mean_token_accuracy": 0.2182526633143425, "num_tokens": 72824072.0, "step": 41990 }, { "entropy": 5.8090746879577635, "epoch": 3.2673409842443104, "grad_norm": 1.2578125, "learning_rate": 0.00039468173719027163, "loss": 4.9825, "mean_token_accuracy": 0.2027595967054367, "num_tokens": 72831999.0, "step": 41995 }, { "entropy": 5.704808378219605, "epoch": 3.267730013616028, "grad_norm": 1.296875, "learning_rate": 0.0003946582668517491, "loss": 4.8012, "mean_token_accuracy": 0.22482135742902756, "num_tokens": 72840318.0, "step": 42000 }, { "epoch": 3.267730013616028, "eval_entropy": 5.443689430115657, "eval_loss": 5.05501651763916, "eval_mean_token_accuracy": 0.21525507361643353, "eval_num_tokens": 72840318.0, "eval_runtime": 21.6833, "eval_samples_per_second": 1916.59, "eval_steps_per_second": 239.585, "step": 42000 }, { "entropy": 5.7062944889068605, "epoch": 3.2681190429877454, "grad_norm": 1.2421875, "learning_rate": 0.0003946347946976026, "loss": 4.8533, "mean_token_accuracy": 0.21965285241603852, "num_tokens": 72848414.0, "step": 42005 }, { "entropy": 5.814571762084961, "epoch": 3.268508072359463, "grad_norm": 1.3125, "learning_rate": 0.0003946113207281887, "loss": 5.0009, "mean_token_accuracy": 0.2102390006184578, "num_tokens": 72857008.0, "step": 42010 }, { "entropy": 5.85265588760376, "epoch": 3.2688971017311808, "grad_norm": 1.203125, "learning_rate": 0.00039458784494386337, "loss": 4.9819, "mean_token_accuracy": 0.21561134308576585, "num_tokens": 72865017.0, "step": 42015 }, { "entropy": 5.744094276428223, "epoch": 3.2692861311028985, "grad_norm": 1.3359375, "learning_rate": 0.00039456436734498275, "loss": 4.9462, "mean_token_accuracy": 0.20419999808073044, "num_tokens": 72873812.0, "step": 42020 }, { "entropy": 5.749226427078247, "epoch": 3.2696751604746157, "grad_norm": 1.3984375, "learning_rate": 0.00039454088793190316, "loss": 4.8538, "mean_token_accuracy": 0.21655545979738236, "num_tokens": 72882514.0, "step": 42025 }, { "entropy": 5.797271776199341, "epoch": 3.2700641898463334, "grad_norm": 1.296875, "learning_rate": 0.00039451740670498094, "loss": 5.0303, "mean_token_accuracy": 0.20221734344959258, "num_tokens": 72891205.0, "step": 42030 }, { "entropy": 5.77302656173706, "epoch": 3.270453219218051, "grad_norm": 1.3125, "learning_rate": 0.0003944939236645723, "loss": 4.8764, "mean_token_accuracy": 0.21493741124868393, "num_tokens": 72899679.0, "step": 42035 }, { "entropy": 5.811156415939331, "epoch": 3.2708422485897684, "grad_norm": 1.234375, "learning_rate": 0.0003944704388110335, "loss": 4.9816, "mean_token_accuracy": 0.20956346690654754, "num_tokens": 72908518.0, "step": 42040 }, { "entropy": 5.881707239151001, "epoch": 3.271231277961486, "grad_norm": 1.3828125, "learning_rate": 0.000394446952144721, "loss": 5.0791, "mean_token_accuracy": 0.2081236720085144, "num_tokens": 72916967.0, "step": 42045 }, { "entropy": 5.797267723083496, "epoch": 3.2716203073332037, "grad_norm": 1.25, "learning_rate": 0.0003944234636659911, "loss": 4.8589, "mean_token_accuracy": 0.21798156946897507, "num_tokens": 72925539.0, "step": 42050 }, { "entropy": 5.773934936523437, "epoch": 3.2720093367049214, "grad_norm": 1.3671875, "learning_rate": 0.0003943999733752003, "loss": 4.9437, "mean_token_accuracy": 0.21244845688343048, "num_tokens": 72933918.0, "step": 42055 }, { "entropy": 5.7244730472564695, "epoch": 3.2723983660766387, "grad_norm": 1.3671875, "learning_rate": 0.0003943764812727048, "loss": 5.0114, "mean_token_accuracy": 0.2057717874646187, "num_tokens": 72942472.0, "step": 42060 }, { "entropy": 5.7699785232543945, "epoch": 3.2727873954483564, "grad_norm": 1.1953125, "learning_rate": 0.00039435298735886133, "loss": 4.9298, "mean_token_accuracy": 0.2112285777926445, "num_tokens": 72951972.0, "step": 42065 }, { "entropy": 5.802233362197876, "epoch": 3.273176424820074, "grad_norm": 1.2578125, "learning_rate": 0.0003943294916340261, "loss": 4.9969, "mean_token_accuracy": 0.21212680339813234, "num_tokens": 72960182.0, "step": 42070 }, { "entropy": 5.803643703460693, "epoch": 3.2735654541917913, "grad_norm": 1.25, "learning_rate": 0.0003943059940985559, "loss": 4.9781, "mean_token_accuracy": 0.20378346592187882, "num_tokens": 72968627.0, "step": 42075 }, { "entropy": 5.731094932556152, "epoch": 3.273954483563509, "grad_norm": 1.28125, "learning_rate": 0.00039428249475280706, "loss": 4.8814, "mean_token_accuracy": 0.21912231147289277, "num_tokens": 72977847.0, "step": 42080 }, { "entropy": 5.691620492935181, "epoch": 3.2743435129352267, "grad_norm": 1.3828125, "learning_rate": 0.0003942589935971363, "loss": 4.8005, "mean_token_accuracy": 0.22511896789073943, "num_tokens": 72985956.0, "step": 42085 }, { "entropy": 5.7404550075531, "epoch": 3.274732542306944, "grad_norm": 1.2890625, "learning_rate": 0.0003942354906319001, "loss": 4.8834, "mean_token_accuracy": 0.21594283431768418, "num_tokens": 72994630.0, "step": 42090 }, { "entropy": 5.749108219146729, "epoch": 3.2751215716786617, "grad_norm": 1.4296875, "learning_rate": 0.0003942119858574551, "loss": 4.919, "mean_token_accuracy": 0.21988788098096848, "num_tokens": 73003093.0, "step": 42095 }, { "entropy": 5.716646480560303, "epoch": 3.2755106010503794, "grad_norm": 1.296875, "learning_rate": 0.000394188479274158, "loss": 4.9606, "mean_token_accuracy": 0.2143036335706711, "num_tokens": 73011835.0, "step": 42100 }, { "entropy": 5.764347743988037, "epoch": 3.2758996304220966, "grad_norm": 1.34375, "learning_rate": 0.00039416497088236535, "loss": 5.0077, "mean_token_accuracy": 0.20877723544836044, "num_tokens": 73020226.0, "step": 42105 }, { "entropy": 5.818635654449463, "epoch": 3.2762886597938143, "grad_norm": 1.296875, "learning_rate": 0.000394141460682434, "loss": 4.9592, "mean_token_accuracy": 0.20762919783592224, "num_tokens": 73028508.0, "step": 42110 }, { "entropy": 5.769434976577759, "epoch": 3.276677689165532, "grad_norm": 1.390625, "learning_rate": 0.0003941179486747206, "loss": 4.9365, "mean_token_accuracy": 0.2116596519947052, "num_tokens": 73038138.0, "step": 42115 }, { "entropy": 5.699726295471192, "epoch": 3.2770667185372497, "grad_norm": 1.453125, "learning_rate": 0.0003940944348595819, "loss": 4.8852, "mean_token_accuracy": 0.21338316053152084, "num_tokens": 73046520.0, "step": 42120 }, { "entropy": 5.793140506744384, "epoch": 3.277455747908967, "grad_norm": 1.265625, "learning_rate": 0.00039407091923737475, "loss": 5.0161, "mean_token_accuracy": 0.20282937586307526, "num_tokens": 73055615.0, "step": 42125 }, { "entropy": 5.759832096099854, "epoch": 3.2778447772806847, "grad_norm": 1.2734375, "learning_rate": 0.00039404740180845594, "loss": 4.9433, "mean_token_accuracy": 0.21197818219661713, "num_tokens": 73064563.0, "step": 42130 }, { "entropy": 5.721374082565307, "epoch": 3.2782338066524024, "grad_norm": 1.34375, "learning_rate": 0.00039402388257318236, "loss": 4.9416, "mean_token_accuracy": 0.216379514336586, "num_tokens": 73073105.0, "step": 42135 }, { "entropy": 5.811513042449951, "epoch": 3.2786228360241196, "grad_norm": 1.171875, "learning_rate": 0.0003940003615319106, "loss": 5.0376, "mean_token_accuracy": 0.20713454335927964, "num_tokens": 73081976.0, "step": 42140 }, { "entropy": 5.801881170272827, "epoch": 3.2790118653958373, "grad_norm": 1.3125, "learning_rate": 0.00039397683868499784, "loss": 4.9072, "mean_token_accuracy": 0.21783215552568436, "num_tokens": 73090596.0, "step": 42145 }, { "entropy": 5.776477384567261, "epoch": 3.279400894767555, "grad_norm": 1.328125, "learning_rate": 0.000393953314032801, "loss": 4.9604, "mean_token_accuracy": 0.21627363860607146, "num_tokens": 73099348.0, "step": 42150 }, { "entropy": 5.753832530975342, "epoch": 3.2797899241392727, "grad_norm": 1.3671875, "learning_rate": 0.0003939297875756769, "loss": 4.8993, "mean_token_accuracy": 0.21850076764822007, "num_tokens": 73107513.0, "step": 42155 }, { "entropy": 5.813546371459961, "epoch": 3.28017895351099, "grad_norm": 1.2734375, "learning_rate": 0.0003939062593139825, "loss": 4.9688, "mean_token_accuracy": 0.20741217881441115, "num_tokens": 73115608.0, "step": 42160 }, { "entropy": 5.785907125473022, "epoch": 3.2805679828827077, "grad_norm": 1.3203125, "learning_rate": 0.000393882729248075, "loss": 4.9449, "mean_token_accuracy": 0.2119610533118248, "num_tokens": 73124734.0, "step": 42165 }, { "entropy": 5.781655597686767, "epoch": 3.2809570122544254, "grad_norm": 1.2890625, "learning_rate": 0.00039385919737831127, "loss": 4.9481, "mean_token_accuracy": 0.20915319323539733, "num_tokens": 73133826.0, "step": 42170 }, { "entropy": 5.78559250831604, "epoch": 3.2813460416261426, "grad_norm": 1.3984375, "learning_rate": 0.00039383566370504837, "loss": 4.8936, "mean_token_accuracy": 0.21931619495153426, "num_tokens": 73142418.0, "step": 42175 }, { "entropy": 5.773282289505005, "epoch": 3.2817350709978603, "grad_norm": 1.453125, "learning_rate": 0.0003938121282286434, "loss": 4.9506, "mean_token_accuracy": 0.21043350994586946, "num_tokens": 73150993.0, "step": 42180 }, { "entropy": 5.797844696044922, "epoch": 3.282124100369578, "grad_norm": 1.2890625, "learning_rate": 0.00039378859094945366, "loss": 5.0725, "mean_token_accuracy": 0.201751047372818, "num_tokens": 73160930.0, "step": 42185 }, { "entropy": 5.757339572906494, "epoch": 3.2825131297412953, "grad_norm": 1.28125, "learning_rate": 0.0003937650518678359, "loss": 4.9484, "mean_token_accuracy": 0.2122027099132538, "num_tokens": 73169917.0, "step": 42190 }, { "entropy": 5.797887468338013, "epoch": 3.282902159113013, "grad_norm": 1.296875, "learning_rate": 0.0003937415109841476, "loss": 4.9282, "mean_token_accuracy": 0.21199240088462828, "num_tokens": 73178309.0, "step": 42195 }, { "entropy": 5.739905166625976, "epoch": 3.2832911884847307, "grad_norm": 1.2734375, "learning_rate": 0.0003937179682987459, "loss": 4.832, "mean_token_accuracy": 0.21589563190937042, "num_tokens": 73186885.0, "step": 42200 }, { "entropy": 5.688966751098633, "epoch": 3.283680217856448, "grad_norm": 1.3125, "learning_rate": 0.00039369442381198793, "loss": 4.9035, "mean_token_accuracy": 0.2184841126203537, "num_tokens": 73195202.0, "step": 42205 }, { "entropy": 5.735539102554322, "epoch": 3.2840692472281656, "grad_norm": 1.296875, "learning_rate": 0.000393670877524231, "loss": 4.9174, "mean_token_accuracy": 0.20495409220457078, "num_tokens": 73203370.0, "step": 42210 }, { "entropy": 5.801749897003174, "epoch": 3.2844582765998833, "grad_norm": 1.3125, "learning_rate": 0.0003936473294358325, "loss": 5.0214, "mean_token_accuracy": 0.20448965728282928, "num_tokens": 73211878.0, "step": 42215 }, { "entropy": 5.791033315658569, "epoch": 3.284847305971601, "grad_norm": 1.3125, "learning_rate": 0.0003936237795471495, "loss": 4.9137, "mean_token_accuracy": 0.20994094908237457, "num_tokens": 73219756.0, "step": 42220 }, { "entropy": 5.728539085388183, "epoch": 3.2852363353433183, "grad_norm": 1.40625, "learning_rate": 0.00039360022785853957, "loss": 4.8957, "mean_token_accuracy": 0.2162775620818138, "num_tokens": 73227940.0, "step": 42225 }, { "entropy": 5.762232398986816, "epoch": 3.285625364715036, "grad_norm": 1.3671875, "learning_rate": 0.0003935766743703599, "loss": 4.9033, "mean_token_accuracy": 0.21071567982435227, "num_tokens": 73236933.0, "step": 42230 }, { "entropy": 5.815197610855103, "epoch": 3.2860143940867537, "grad_norm": 1.2265625, "learning_rate": 0.00039355311908296787, "loss": 4.9593, "mean_token_accuracy": 0.20968196392059327, "num_tokens": 73246198.0, "step": 42235 }, { "entropy": 5.799543952941894, "epoch": 3.286403423458471, "grad_norm": 1.3203125, "learning_rate": 0.000393529561996721, "loss": 4.9162, "mean_token_accuracy": 0.220100037753582, "num_tokens": 73255199.0, "step": 42240 }, { "entropy": 5.727614641189575, "epoch": 3.2867924528301886, "grad_norm": 1.1953125, "learning_rate": 0.00039350600311197667, "loss": 4.88, "mean_token_accuracy": 0.21420133858919144, "num_tokens": 73263986.0, "step": 42245 }, { "entropy": 5.720384168624878, "epoch": 3.2871814822019063, "grad_norm": 1.3671875, "learning_rate": 0.00039348244242909234, "loss": 4.9267, "mean_token_accuracy": 0.20655566751956939, "num_tokens": 73273474.0, "step": 42250 }, { "entropy": 5.708976316452026, "epoch": 3.287570511573624, "grad_norm": 1.25, "learning_rate": 0.00039345887994842566, "loss": 4.8714, "mean_token_accuracy": 0.21687986850738525, "num_tokens": 73281881.0, "step": 42255 }, { "entropy": 5.779132127761841, "epoch": 3.2879595409453413, "grad_norm": 1.2890625, "learning_rate": 0.0003934353156703339, "loss": 4.9267, "mean_token_accuracy": 0.21020979434251785, "num_tokens": 73290589.0, "step": 42260 }, { "entropy": 5.773817682266236, "epoch": 3.288348570317059, "grad_norm": 1.359375, "learning_rate": 0.0003934117495951748, "loss": 5.0507, "mean_token_accuracy": 0.2052561655640602, "num_tokens": 73298669.0, "step": 42265 }, { "entropy": 5.664301538467408, "epoch": 3.2887375996887767, "grad_norm": 1.3828125, "learning_rate": 0.0003933881817233058, "loss": 4.8364, "mean_token_accuracy": 0.21965772211551665, "num_tokens": 73307622.0, "step": 42270 }, { "entropy": 5.8861607074737545, "epoch": 3.289126629060494, "grad_norm": 1.3125, "learning_rate": 0.00039336461205508456, "loss": 4.9967, "mean_token_accuracy": 0.20995798259973525, "num_tokens": 73315888.0, "step": 42275 }, { "entropy": 5.845155525207519, "epoch": 3.2895156584322116, "grad_norm": 1.3046875, "learning_rate": 0.0003933410405908689, "loss": 5.0325, "mean_token_accuracy": 0.20566961020231248, "num_tokens": 73324999.0, "step": 42280 }, { "entropy": 5.779226636886596, "epoch": 3.2899046878039293, "grad_norm": 1.3828125, "learning_rate": 0.00039331746733101613, "loss": 4.896, "mean_token_accuracy": 0.21289982199668883, "num_tokens": 73332907.0, "step": 42285 }, { "entropy": 5.758332872390747, "epoch": 3.290293717175647, "grad_norm": 1.359375, "learning_rate": 0.00039329389227588416, "loss": 4.9259, "mean_token_accuracy": 0.21108102947473525, "num_tokens": 73341202.0, "step": 42290 }, { "entropy": 5.754832744598389, "epoch": 3.2906827465473643, "grad_norm": 1.40625, "learning_rate": 0.00039327031542583067, "loss": 4.9487, "mean_token_accuracy": 0.20636945068836213, "num_tokens": 73350162.0, "step": 42295 }, { "entropy": 5.824967861175537, "epoch": 3.291071775919082, "grad_norm": 1.2421875, "learning_rate": 0.00039324673678121344, "loss": 4.9775, "mean_token_accuracy": 0.2101506069302559, "num_tokens": 73358701.0, "step": 42300 }, { "entropy": 5.759915542602539, "epoch": 3.291460805290799, "grad_norm": 1.25, "learning_rate": 0.0003932231563423901, "loss": 5.0121, "mean_token_accuracy": 0.20313595086336136, "num_tokens": 73367445.0, "step": 42305 }, { "entropy": 5.809169626235962, "epoch": 3.291849834662517, "grad_norm": 1.4375, "learning_rate": 0.0003931995741097186, "loss": 4.9799, "mean_token_accuracy": 0.2095741406083107, "num_tokens": 73376105.0, "step": 42310 }, { "entropy": 5.754014396667481, "epoch": 3.2922388640342346, "grad_norm": 1.3671875, "learning_rate": 0.00039317599008355665, "loss": 4.9406, "mean_token_accuracy": 0.21127452105283737, "num_tokens": 73384382.0, "step": 42315 }, { "entropy": 5.775046491622925, "epoch": 3.2926278934059523, "grad_norm": 1.328125, "learning_rate": 0.0003931524042642622, "loss": 4.9024, "mean_token_accuracy": 0.21664304435253143, "num_tokens": 73393725.0, "step": 42320 }, { "entropy": 5.7508354663848875, "epoch": 3.2930169227776696, "grad_norm": 1.3203125, "learning_rate": 0.0003931288166521931, "loss": 4.852, "mean_token_accuracy": 0.2169520989060402, "num_tokens": 73402070.0, "step": 42325 }, { "entropy": 5.717920732498169, "epoch": 3.2934059521493873, "grad_norm": 1.25, "learning_rate": 0.00039310522724770713, "loss": 4.9105, "mean_token_accuracy": 0.2174407109618187, "num_tokens": 73411414.0, "step": 42330 }, { "entropy": 5.809507560729981, "epoch": 3.293794981521105, "grad_norm": 1.2734375, "learning_rate": 0.00039308163605116235, "loss": 5.0531, "mean_token_accuracy": 0.20932976007461548, "num_tokens": 73420187.0, "step": 42335 }, { "entropy": 5.783754110336304, "epoch": 3.294184010892822, "grad_norm": 1.4140625, "learning_rate": 0.0003930580430629167, "loss": 4.9259, "mean_token_accuracy": 0.2143746107816696, "num_tokens": 73428316.0, "step": 42340 }, { "entropy": 5.7673805236816404, "epoch": 3.29457304026454, "grad_norm": 1.3125, "learning_rate": 0.0003930344482833281, "loss": 4.9532, "mean_token_accuracy": 0.2082654669880867, "num_tokens": 73437069.0, "step": 42345 }, { "entropy": 5.73949236869812, "epoch": 3.2949620696362576, "grad_norm": 1.453125, "learning_rate": 0.00039301085171275475, "loss": 4.8973, "mean_token_accuracy": 0.21958001852035522, "num_tokens": 73445044.0, "step": 42350 }, { "entropy": 5.752908182144165, "epoch": 3.2953510990079753, "grad_norm": 1.375, "learning_rate": 0.0003929872533515545, "loss": 4.9526, "mean_token_accuracy": 0.20624818801879882, "num_tokens": 73453085.0, "step": 42355 }, { "entropy": 5.729835462570191, "epoch": 3.2957401283796925, "grad_norm": 1.2421875, "learning_rate": 0.00039296365320008546, "loss": 4.9317, "mean_token_accuracy": 0.20765060633420945, "num_tokens": 73462103.0, "step": 42360 }, { "entropy": 5.723503255844117, "epoch": 3.2961291577514102, "grad_norm": 1.2890625, "learning_rate": 0.00039294005125870576, "loss": 4.8519, "mean_token_accuracy": 0.2199642613530159, "num_tokens": 73471347.0, "step": 42365 }, { "entropy": 5.829682016372681, "epoch": 3.296518187123128, "grad_norm": 1.4140625, "learning_rate": 0.00039291644752777346, "loss": 5.0249, "mean_token_accuracy": 0.20506861358880996, "num_tokens": 73479673.0, "step": 42370 }, { "entropy": 5.830968189239502, "epoch": 3.296907216494845, "grad_norm": 1.296875, "learning_rate": 0.00039289284200764676, "loss": 4.9947, "mean_token_accuracy": 0.20436266660690308, "num_tokens": 73488760.0, "step": 42375 }, { "entropy": 5.782667589187622, "epoch": 3.297296245866563, "grad_norm": 1.328125, "learning_rate": 0.0003928692346986839, "loss": 4.9574, "mean_token_accuracy": 0.21267121136188508, "num_tokens": 73497700.0, "step": 42380 }, { "entropy": 5.7757350444793705, "epoch": 3.2976852752382806, "grad_norm": 1.2890625, "learning_rate": 0.00039284562560124297, "loss": 4.8981, "mean_token_accuracy": 0.21625377833843232, "num_tokens": 73505952.0, "step": 42385 }, { "entropy": 5.768964576721191, "epoch": 3.2980743046099983, "grad_norm": 1.1484375, "learning_rate": 0.0003928220147156822, "loss": 4.9218, "mean_token_accuracy": 0.20911584049463272, "num_tokens": 73515068.0, "step": 42390 }, { "entropy": 5.852684020996094, "epoch": 3.2984633339817155, "grad_norm": 1.3671875, "learning_rate": 0.00039279840204235994, "loss": 4.9512, "mean_token_accuracy": 0.21259979605674745, "num_tokens": 73524520.0, "step": 42395 }, { "entropy": 5.792552947998047, "epoch": 3.2988523633534332, "grad_norm": 1.3359375, "learning_rate": 0.00039277478758163443, "loss": 4.9001, "mean_token_accuracy": 0.21308257728815078, "num_tokens": 73533067.0, "step": 42400 }, { "entropy": 5.770245742797852, "epoch": 3.299241392725151, "grad_norm": 1.34375, "learning_rate": 0.000392751171333864, "loss": 5.0035, "mean_token_accuracy": 0.20173162072896958, "num_tokens": 73541550.0, "step": 42405 }, { "entropy": 5.663273334503174, "epoch": 3.299630422096868, "grad_norm": 1.1796875, "learning_rate": 0.00039272755329940683, "loss": 4.8581, "mean_token_accuracy": 0.22782112658023834, "num_tokens": 73550645.0, "step": 42410 }, { "entropy": 5.754573154449463, "epoch": 3.300019451468586, "grad_norm": 1.296875, "learning_rate": 0.00039270393347862155, "loss": 4.9507, "mean_token_accuracy": 0.2059642568230629, "num_tokens": 73559005.0, "step": 42415 }, { "entropy": 5.859376001358032, "epoch": 3.3004084808403036, "grad_norm": 1.3515625, "learning_rate": 0.00039268031187186635, "loss": 4.9759, "mean_token_accuracy": 0.20948057621717453, "num_tokens": 73567335.0, "step": 42420 }, { "entropy": 5.840239763259888, "epoch": 3.300797510212021, "grad_norm": 1.3359375, "learning_rate": 0.00039265668847949977, "loss": 4.9079, "mean_token_accuracy": 0.21448366343975067, "num_tokens": 73575788.0, "step": 42425 }, { "entropy": 5.763343048095703, "epoch": 3.3011865395837385, "grad_norm": 1.3203125, "learning_rate": 0.0003926330633018802, "loss": 4.9383, "mean_token_accuracy": 0.20963292866945266, "num_tokens": 73584430.0, "step": 42430 }, { "entropy": 5.871312189102173, "epoch": 3.3015755689554562, "grad_norm": 1.375, "learning_rate": 0.00039260943633936615, "loss": 5.076, "mean_token_accuracy": 0.20629605352878572, "num_tokens": 73593725.0, "step": 42435 }, { "entropy": 5.753225803375244, "epoch": 3.3019645983271735, "grad_norm": 1.2578125, "learning_rate": 0.00039258580759231603, "loss": 4.93, "mean_token_accuracy": 0.2107033759355545, "num_tokens": 73602028.0, "step": 42440 }, { "entropy": 5.7495622634887695, "epoch": 3.302353627698891, "grad_norm": 1.3203125, "learning_rate": 0.0003925621770610885, "loss": 4.8737, "mean_token_accuracy": 0.21666236966848373, "num_tokens": 73610002.0, "step": 42445 }, { "entropy": 5.759077405929565, "epoch": 3.302742657070609, "grad_norm": 1.3828125, "learning_rate": 0.000392538544746042, "loss": 4.9964, "mean_token_accuracy": 0.2135808452963829, "num_tokens": 73618943.0, "step": 42450 }, { "entropy": 5.838293409347534, "epoch": 3.3031316864423266, "grad_norm": 1.34375, "learning_rate": 0.00039251491064753525, "loss": 5.0597, "mean_token_accuracy": 0.20381409227848052, "num_tokens": 73627381.0, "step": 42455 }, { "entropy": 5.839942836761475, "epoch": 3.303520715814044, "grad_norm": 1.2890625, "learning_rate": 0.0003924912747659267, "loss": 4.9907, "mean_token_accuracy": 0.21090895384550096, "num_tokens": 73636434.0, "step": 42460 }, { "entropy": 5.863178396224976, "epoch": 3.3039097451857615, "grad_norm": 1.4921875, "learning_rate": 0.00039246763710157513, "loss": 5.1187, "mean_token_accuracy": 0.20052160769701005, "num_tokens": 73644939.0, "step": 42465 }, { "entropy": 5.780732536315918, "epoch": 3.3042987745574792, "grad_norm": 1.3125, "learning_rate": 0.0003924439976548391, "loss": 4.8799, "mean_token_accuracy": 0.21577879786491394, "num_tokens": 73653284.0, "step": 42470 }, { "entropy": 5.737558174133301, "epoch": 3.3046878039291965, "grad_norm": 1.3046875, "learning_rate": 0.00039242035642607733, "loss": 4.8416, "mean_token_accuracy": 0.22135815918445587, "num_tokens": 73661883.0, "step": 42475 }, { "entropy": 5.706303930282592, "epoch": 3.305076833300914, "grad_norm": 1.2890625, "learning_rate": 0.0003923967134156486, "loss": 4.8914, "mean_token_accuracy": 0.20873292535543442, "num_tokens": 73670564.0, "step": 42480 }, { "entropy": 5.713171911239624, "epoch": 3.305465862672632, "grad_norm": 1.25, "learning_rate": 0.0003923730686239115, "loss": 4.9826, "mean_token_accuracy": 0.21192733347415924, "num_tokens": 73679219.0, "step": 42485 }, { "entropy": 5.778691196441651, "epoch": 3.3058548920443496, "grad_norm": 1.3125, "learning_rate": 0.0003923494220512249, "loss": 4.9635, "mean_token_accuracy": 0.21103958338499068, "num_tokens": 73688358.0, "step": 42490 }, { "entropy": 5.888421297073364, "epoch": 3.306243921416067, "grad_norm": 1.3046875, "learning_rate": 0.0003923257736979476, "loss": 5.0146, "mean_token_accuracy": 0.21228283345699311, "num_tokens": 73696761.0, "step": 42495 }, { "entropy": 5.857212781906128, "epoch": 3.3066329507877845, "grad_norm": 1.4375, "learning_rate": 0.00039230212356443855, "loss": 4.9947, "mean_token_accuracy": 0.20153977423906327, "num_tokens": 73704549.0, "step": 42500 }, { "entropy": 5.743925857543945, "epoch": 3.307021980159502, "grad_norm": 1.21875, "learning_rate": 0.00039227847165105635, "loss": 5.0349, "mean_token_accuracy": 0.20347167253494264, "num_tokens": 73713533.0, "step": 42505 }, { "entropy": 5.780810260772705, "epoch": 3.3074110095312195, "grad_norm": 1.234375, "learning_rate": 0.00039225481795816016, "loss": 4.8648, "mean_token_accuracy": 0.22428275346755983, "num_tokens": 73722628.0, "step": 42510 }, { "entropy": 5.7934410572052, "epoch": 3.307800038902937, "grad_norm": 1.3046875, "learning_rate": 0.0003922311624861086, "loss": 4.8666, "mean_token_accuracy": 0.22024836391210556, "num_tokens": 73730286.0, "step": 42515 }, { "entropy": 5.672967338562012, "epoch": 3.308189068274655, "grad_norm": 1.3046875, "learning_rate": 0.0003922075052352608, "loss": 4.9348, "mean_token_accuracy": 0.21009422838687897, "num_tokens": 73738893.0, "step": 42520 }, { "entropy": 5.783132266998291, "epoch": 3.308578097646372, "grad_norm": 1.3984375, "learning_rate": 0.0003921838462059756, "loss": 5.0162, "mean_token_accuracy": 0.20755598247051238, "num_tokens": 73747249.0, "step": 42525 }, { "entropy": 5.713928604125977, "epoch": 3.30896712701809, "grad_norm": 1.28125, "learning_rate": 0.00039216018539861217, "loss": 4.8938, "mean_token_accuracy": 0.21549345254898072, "num_tokens": 73755828.0, "step": 42530 }, { "entropy": 5.798518371582031, "epoch": 3.3093561563898075, "grad_norm": 1.2890625, "learning_rate": 0.0003921365228135293, "loss": 4.9724, "mean_token_accuracy": 0.21458789259195327, "num_tokens": 73763913.0, "step": 42535 }, { "entropy": 5.735788726806641, "epoch": 3.3097451857615248, "grad_norm": 1.2734375, "learning_rate": 0.00039211285845108617, "loss": 4.88, "mean_token_accuracy": 0.20903635770082474, "num_tokens": 73772394.0, "step": 42540 }, { "entropy": 5.79608645439148, "epoch": 3.3101342151332425, "grad_norm": 1.265625, "learning_rate": 0.0003920891923116418, "loss": 5.0125, "mean_token_accuracy": 0.200534188747406, "num_tokens": 73782004.0, "step": 42545 }, { "entropy": 5.751929378509521, "epoch": 3.31052324450496, "grad_norm": 1.1953125, "learning_rate": 0.00039206552439555544, "loss": 4.929, "mean_token_accuracy": 0.21120332777500153, "num_tokens": 73790482.0, "step": 42550 }, { "entropy": 5.814033317565918, "epoch": 3.310912273876678, "grad_norm": 1.3515625, "learning_rate": 0.0003920418547031859, "loss": 4.961, "mean_token_accuracy": 0.21484753787517546, "num_tokens": 73799054.0, "step": 42555 }, { "entropy": 5.786821174621582, "epoch": 3.311301303248395, "grad_norm": 1.21875, "learning_rate": 0.0003920181832348926, "loss": 4.92, "mean_token_accuracy": 0.21317008435726165, "num_tokens": 73807873.0, "step": 42560 }, { "entropy": 5.727629280090332, "epoch": 3.311690332620113, "grad_norm": 1.3359375, "learning_rate": 0.0003919945099910346, "loss": 4.9157, "mean_token_accuracy": 0.21818889826536178, "num_tokens": 73816625.0, "step": 42565 }, { "entropy": 5.801596927642822, "epoch": 3.3120793619918305, "grad_norm": 1.3046875, "learning_rate": 0.00039197083497197107, "loss": 4.902, "mean_token_accuracy": 0.21404514610767364, "num_tokens": 73825411.0, "step": 42570 }, { "entropy": 5.807532691955567, "epoch": 3.3124683913635478, "grad_norm": 1.2734375, "learning_rate": 0.0003919471581780613, "loss": 5.0297, "mean_token_accuracy": 0.20387880951166154, "num_tokens": 73834594.0, "step": 42575 }, { "entropy": 5.779193687438965, "epoch": 3.3128574207352655, "grad_norm": 1.359375, "learning_rate": 0.0003919234796096646, "loss": 4.8997, "mean_token_accuracy": 0.21007105261087416, "num_tokens": 73842928.0, "step": 42580 }, { "entropy": 5.751088237762451, "epoch": 3.313246450106983, "grad_norm": 1.390625, "learning_rate": 0.0003918997992671402, "loss": 4.9126, "mean_token_accuracy": 0.21497204452753066, "num_tokens": 73851639.0, "step": 42585 }, { "entropy": 5.754175090789795, "epoch": 3.313635479478701, "grad_norm": 1.328125, "learning_rate": 0.0003918761171508475, "loss": 5.0079, "mean_token_accuracy": 0.2101210594177246, "num_tokens": 73860618.0, "step": 42590 }, { "entropy": 5.748440313339233, "epoch": 3.314024508850418, "grad_norm": 1.328125, "learning_rate": 0.0003918524332611456, "loss": 4.8827, "mean_token_accuracy": 0.21692682802677155, "num_tokens": 73869140.0, "step": 42595 }, { "entropy": 5.769749402999878, "epoch": 3.314413538222136, "grad_norm": 1.2734375, "learning_rate": 0.0003918287475983941, "loss": 4.9351, "mean_token_accuracy": 0.208855564892292, "num_tokens": 73878248.0, "step": 42600 }, { "entropy": 5.722035121917725, "epoch": 3.3148025675938535, "grad_norm": 1.3359375, "learning_rate": 0.00039180506016295226, "loss": 4.9037, "mean_token_accuracy": 0.20788008719682693, "num_tokens": 73886743.0, "step": 42605 }, { "entropy": 5.833974456787109, "epoch": 3.3151915969655708, "grad_norm": 1.3046875, "learning_rate": 0.00039178137095517956, "loss": 5.0116, "mean_token_accuracy": 0.20891356766223906, "num_tokens": 73895941.0, "step": 42610 }, { "entropy": 5.812851810455323, "epoch": 3.3155806263372885, "grad_norm": 1.3984375, "learning_rate": 0.0003917576799754354, "loss": 5.0416, "mean_token_accuracy": 0.19819609224796295, "num_tokens": 73904794.0, "step": 42615 }, { "entropy": 5.802658891677856, "epoch": 3.315969655709006, "grad_norm": 1.21875, "learning_rate": 0.0003917339872240793, "loss": 5.0342, "mean_token_accuracy": 0.20312890261411667, "num_tokens": 73913727.0, "step": 42620 }, { "entropy": 5.773225545883179, "epoch": 3.3163586850807234, "grad_norm": 1.2578125, "learning_rate": 0.0003917102927014708, "loss": 5.0405, "mean_token_accuracy": 0.20601338744163514, "num_tokens": 73923036.0, "step": 42625 }, { "entropy": 5.861292743682862, "epoch": 3.316747714452441, "grad_norm": 1.1875, "learning_rate": 0.0003916865964079694, "loss": 5.0126, "mean_token_accuracy": 0.21079111695289612, "num_tokens": 73932036.0, "step": 42630 }, { "entropy": 5.849609899520874, "epoch": 3.317136743824159, "grad_norm": 1.2578125, "learning_rate": 0.0003916628983439345, "loss": 5.0467, "mean_token_accuracy": 0.19445690065622329, "num_tokens": 73941515.0, "step": 42635 }, { "entropy": 5.737329816818237, "epoch": 3.317525773195876, "grad_norm": 1.3515625, "learning_rate": 0.00039163919850972585, "loss": 4.8797, "mean_token_accuracy": 0.21279737502336502, "num_tokens": 73949767.0, "step": 42640 }, { "entropy": 5.763401746749878, "epoch": 3.3179148025675937, "grad_norm": 1.4140625, "learning_rate": 0.0003916154969057031, "loss": 4.9572, "mean_token_accuracy": 0.21319681406021118, "num_tokens": 73958687.0, "step": 42645 }, { "entropy": 5.751964521408081, "epoch": 3.3183038319393114, "grad_norm": 1.2265625, "learning_rate": 0.00039159179353222566, "loss": 4.9583, "mean_token_accuracy": 0.21392656713724137, "num_tokens": 73967935.0, "step": 42650 }, { "entropy": 5.822303056716919, "epoch": 3.318692861311029, "grad_norm": 1.421875, "learning_rate": 0.00039156808838965336, "loss": 4.9355, "mean_token_accuracy": 0.21493997126817704, "num_tokens": 73976230.0, "step": 42655 }, { "entropy": 5.800126695632935, "epoch": 3.3190818906827464, "grad_norm": 1.328125, "learning_rate": 0.00039154438147834595, "loss": 4.856, "mean_token_accuracy": 0.221036858856678, "num_tokens": 73984412.0, "step": 42660 }, { "entropy": 5.754728937149048, "epoch": 3.319470920054464, "grad_norm": 1.3828125, "learning_rate": 0.00039152067279866294, "loss": 4.8687, "mean_token_accuracy": 0.2092828407883644, "num_tokens": 73993114.0, "step": 42665 }, { "entropy": 5.718155765533448, "epoch": 3.319859949426182, "grad_norm": 1.234375, "learning_rate": 0.0003914969623509643, "loss": 4.9288, "mean_token_accuracy": 0.20733820050954818, "num_tokens": 74002423.0, "step": 42670 }, { "entropy": 5.807724809646606, "epoch": 3.320248978797899, "grad_norm": 1.328125, "learning_rate": 0.0003914732501356096, "loss": 4.914, "mean_token_accuracy": 0.2104165256023407, "num_tokens": 74011094.0, "step": 42675 }, { "entropy": 5.826362991333008, "epoch": 3.3206380081696167, "grad_norm": 1.2265625, "learning_rate": 0.00039144953615295877, "loss": 4.9897, "mean_token_accuracy": 0.20615897923707963, "num_tokens": 74019054.0, "step": 42680 }, { "entropy": 5.782886743545532, "epoch": 3.3210270375413344, "grad_norm": 1.3515625, "learning_rate": 0.00039142582040337147, "loss": 4.9656, "mean_token_accuracy": 0.20404196977615358, "num_tokens": 74027970.0, "step": 42685 }, { "entropy": 5.730244541168213, "epoch": 3.321416066913052, "grad_norm": 1.3671875, "learning_rate": 0.0003914021028872077, "loss": 4.9901, "mean_token_accuracy": 0.21534445136785507, "num_tokens": 74036919.0, "step": 42690 }, { "entropy": 5.79663987159729, "epoch": 3.3218050962847694, "grad_norm": 1.3828125, "learning_rate": 0.0003913783836048274, "loss": 4.9187, "mean_token_accuracy": 0.21359802782535553, "num_tokens": 74045707.0, "step": 42695 }, { "entropy": 5.819616651535034, "epoch": 3.322194125656487, "grad_norm": 1.3671875, "learning_rate": 0.0003913546625565902, "loss": 5.055, "mean_token_accuracy": 0.20681966543197633, "num_tokens": 74054858.0, "step": 42700 }, { "entropy": 5.844473028182984, "epoch": 3.322583155028205, "grad_norm": 1.28125, "learning_rate": 0.00039133093974285635, "loss": 5.0549, "mean_token_accuracy": 0.2052426278591156, "num_tokens": 74064253.0, "step": 42705 }, { "entropy": 5.809714412689209, "epoch": 3.322972184399922, "grad_norm": 1.359375, "learning_rate": 0.00039130721516398556, "loss": 4.937, "mean_token_accuracy": 0.21493516117334366, "num_tokens": 74072824.0, "step": 42710 }, { "entropy": 5.821947002410889, "epoch": 3.3233612137716397, "grad_norm": 1.2109375, "learning_rate": 0.0003912834888203379, "loss": 5.0498, "mean_token_accuracy": 0.20406683385372162, "num_tokens": 74082082.0, "step": 42715 }, { "entropy": 5.824991273880005, "epoch": 3.3237502431433574, "grad_norm": 1.3046875, "learning_rate": 0.0003912597607122734, "loss": 4.9165, "mean_token_accuracy": 0.21919937878847123, "num_tokens": 74090748.0, "step": 42720 }, { "entropy": 5.851564073562622, "epoch": 3.324139272515075, "grad_norm": 1.25, "learning_rate": 0.00039123603084015204, "loss": 5.0578, "mean_token_accuracy": 0.2002374231815338, "num_tokens": 74099645.0, "step": 42725 }, { "entropy": 5.75317349433899, "epoch": 3.3245283018867924, "grad_norm": 1.265625, "learning_rate": 0.00039121229920433394, "loss": 4.8766, "mean_token_accuracy": 0.21946839094161988, "num_tokens": 74108572.0, "step": 42730 }, { "entropy": 5.816953945159912, "epoch": 3.32491733125851, "grad_norm": 1.359375, "learning_rate": 0.0003911885658051792, "loss": 4.8947, "mean_token_accuracy": 0.2089310795068741, "num_tokens": 74116567.0, "step": 42735 }, { "entropy": 5.829708480834961, "epoch": 3.3253063606302278, "grad_norm": 1.4140625, "learning_rate": 0.00039116483064304794, "loss": 4.9552, "mean_token_accuracy": 0.21370429247617723, "num_tokens": 74126086.0, "step": 42740 }, { "entropy": 5.7831205368042, "epoch": 3.325695390001945, "grad_norm": 1.3203125, "learning_rate": 0.0003911410937183002, "loss": 4.9847, "mean_token_accuracy": 0.20667790472507477, "num_tokens": 74135160.0, "step": 42745 }, { "entropy": 5.835002470016479, "epoch": 3.3260844193736627, "grad_norm": 1.234375, "learning_rate": 0.00039111735503129626, "loss": 5.0104, "mean_token_accuracy": 0.2073177367448807, "num_tokens": 74143540.0, "step": 42750 }, { "entropy": 5.7581315517425535, "epoch": 3.3264734487453804, "grad_norm": 1.2109375, "learning_rate": 0.0003910936145823962, "loss": 4.947, "mean_token_accuracy": 0.21322102844715118, "num_tokens": 74152542.0, "step": 42755 }, { "entropy": 5.789960527420044, "epoch": 3.3268624781170977, "grad_norm": 1.1484375, "learning_rate": 0.0003910698723719604, "loss": 4.907, "mean_token_accuracy": 0.21263383626937865, "num_tokens": 74161008.0, "step": 42760 }, { "entropy": 5.730138301849365, "epoch": 3.3272515074888154, "grad_norm": 1.28125, "learning_rate": 0.00039104612840034904, "loss": 4.9571, "mean_token_accuracy": 0.2155284494161606, "num_tokens": 74169637.0, "step": 42765 }, { "entropy": 5.788354206085205, "epoch": 3.327640536860533, "grad_norm": 1.2890625, "learning_rate": 0.00039102238266792234, "loss": 4.937, "mean_token_accuracy": 0.20898367315530778, "num_tokens": 74178868.0, "step": 42770 }, { "entropy": 5.8141467571258545, "epoch": 3.3280295662322503, "grad_norm": 1.296875, "learning_rate": 0.00039099863517504064, "loss": 4.9969, "mean_token_accuracy": 0.21088891327381135, "num_tokens": 74187935.0, "step": 42775 }, { "entropy": 5.8787782192230225, "epoch": 3.328418595603968, "grad_norm": 1.3828125, "learning_rate": 0.0003909748859220644, "loss": 5.0074, "mean_token_accuracy": 0.20401460379362107, "num_tokens": 74197448.0, "step": 42780 }, { "entropy": 5.824393558502197, "epoch": 3.3288076249756857, "grad_norm": 1.3203125, "learning_rate": 0.00039095113490935377, "loss": 4.9996, "mean_token_accuracy": 0.2054844617843628, "num_tokens": 74206188.0, "step": 42785 }, { "entropy": 5.802308082580566, "epoch": 3.3291966543474034, "grad_norm": 1.34375, "learning_rate": 0.0003909273821372692, "loss": 4.9135, "mean_token_accuracy": 0.21174070835113526, "num_tokens": 74214765.0, "step": 42790 }, { "entropy": 5.737492656707763, "epoch": 3.3295856837191207, "grad_norm": 1.375, "learning_rate": 0.00039090362760617114, "loss": 4.9097, "mean_token_accuracy": 0.21215202659368515, "num_tokens": 74223461.0, "step": 42795 }, { "entropy": 5.773314666748047, "epoch": 3.3299747130908384, "grad_norm": 1.2421875, "learning_rate": 0.00039087987131642, "loss": 4.9079, "mean_token_accuracy": 0.21124511808156968, "num_tokens": 74232486.0, "step": 42800 }, { "entropy": 5.788905239105224, "epoch": 3.330363742462556, "grad_norm": 1.2265625, "learning_rate": 0.0003908561132683762, "loss": 4.9972, "mean_token_accuracy": 0.20450852513313295, "num_tokens": 74241256.0, "step": 42805 }, { "entropy": 5.869234561920166, "epoch": 3.3307527718342733, "grad_norm": 1.3828125, "learning_rate": 0.00039083235346240044, "loss": 5.057, "mean_token_accuracy": 0.20581034421920777, "num_tokens": 74249661.0, "step": 42810 }, { "entropy": 5.763320875167847, "epoch": 3.331141801205991, "grad_norm": 1.171875, "learning_rate": 0.000390808591898853, "loss": 4.9104, "mean_token_accuracy": 0.21130876392126083, "num_tokens": 74258719.0, "step": 42815 }, { "entropy": 5.80388650894165, "epoch": 3.3315308305777087, "grad_norm": 1.359375, "learning_rate": 0.0003907848285780945, "loss": 4.982, "mean_token_accuracy": 0.20749324113130568, "num_tokens": 74267181.0, "step": 42820 }, { "entropy": 5.865523338317871, "epoch": 3.3319198599494264, "grad_norm": 1.375, "learning_rate": 0.00039076106350048557, "loss": 4.9763, "mean_token_accuracy": 0.20920634567737578, "num_tokens": 74275498.0, "step": 42825 }, { "entropy": 5.74682207107544, "epoch": 3.3323088893211437, "grad_norm": 1.265625, "learning_rate": 0.0003907372966663867, "loss": 4.9027, "mean_token_accuracy": 0.21665335744619368, "num_tokens": 74284090.0, "step": 42830 }, { "entropy": 5.790553426742553, "epoch": 3.3326979186928614, "grad_norm": 1.4453125, "learning_rate": 0.0003907135280761585, "loss": 4.8672, "mean_token_accuracy": 0.21534194201231002, "num_tokens": 74292333.0, "step": 42835 }, { "entropy": 5.731353616714477, "epoch": 3.333086948064579, "grad_norm": 1.3671875, "learning_rate": 0.0003906897577301618, "loss": 4.8933, "mean_token_accuracy": 0.21302371323108674, "num_tokens": 74301131.0, "step": 42840 }, { "entropy": 5.726293325424194, "epoch": 3.3334759774362963, "grad_norm": 1.3046875, "learning_rate": 0.0003906659856287571, "loss": 5.0353, "mean_token_accuracy": 0.20427053421735764, "num_tokens": 74310340.0, "step": 42845 }, { "entropy": 5.788184356689453, "epoch": 3.333865006808014, "grad_norm": 1.2265625, "learning_rate": 0.00039064221177230517, "loss": 5.0213, "mean_token_accuracy": 0.2026902750134468, "num_tokens": 74318919.0, "step": 42850 }, { "entropy": 5.79738039970398, "epoch": 3.3342540361797317, "grad_norm": 1.2265625, "learning_rate": 0.00039061843616116683, "loss": 4.8834, "mean_token_accuracy": 0.21613091081380845, "num_tokens": 74327909.0, "step": 42855 }, { "entropy": 5.832695627212525, "epoch": 3.334643065551449, "grad_norm": 1.140625, "learning_rate": 0.00039059465879570264, "loss": 5.0437, "mean_token_accuracy": 0.209121373295784, "num_tokens": 74337017.0, "step": 42860 }, { "entropy": 5.790581130981446, "epoch": 3.3350320949231667, "grad_norm": 1.3671875, "learning_rate": 0.0003905708796762736, "loss": 4.9872, "mean_token_accuracy": 0.20273246020078659, "num_tokens": 74345962.0, "step": 42865 }, { "entropy": 5.801639795303345, "epoch": 3.3354211242948844, "grad_norm": 1.1640625, "learning_rate": 0.0003905470988032403, "loss": 4.9565, "mean_token_accuracy": 0.2052523449063301, "num_tokens": 74355214.0, "step": 42870 }, { "entropy": 5.82442193031311, "epoch": 3.3358101536666016, "grad_norm": 1.2265625, "learning_rate": 0.0003905233161769637, "loss": 5.0146, "mean_token_accuracy": 0.2013792410492897, "num_tokens": 74364892.0, "step": 42875 }, { "entropy": 5.730095148086548, "epoch": 3.3361991830383193, "grad_norm": 1.296875, "learning_rate": 0.0003904995317978048, "loss": 4.8157, "mean_token_accuracy": 0.21565012335777284, "num_tokens": 74373022.0, "step": 42880 }, { "entropy": 5.718376779556275, "epoch": 3.336588212410037, "grad_norm": 1.359375, "learning_rate": 0.00039047574566612416, "loss": 4.9331, "mean_token_accuracy": 0.21584296822547913, "num_tokens": 74381419.0, "step": 42885 }, { "entropy": 5.701881361007691, "epoch": 3.3369772417817547, "grad_norm": 1.265625, "learning_rate": 0.00039045195778228295, "loss": 4.9119, "mean_token_accuracy": 0.21503207683563233, "num_tokens": 74390131.0, "step": 42890 }, { "entropy": 5.840640544891357, "epoch": 3.337366271153472, "grad_norm": 1.3203125, "learning_rate": 0.0003904281681466421, "loss": 5.066, "mean_token_accuracy": 0.20779961943626404, "num_tokens": 74399401.0, "step": 42895 }, { "entropy": 5.750869941711426, "epoch": 3.3377553005251897, "grad_norm": 1.3125, "learning_rate": 0.0003904043767595624, "loss": 4.8425, "mean_token_accuracy": 0.21412189304828644, "num_tokens": 74408301.0, "step": 42900 }, { "entropy": 5.767932891845703, "epoch": 3.3381443298969073, "grad_norm": 1.21875, "learning_rate": 0.00039038058362140507, "loss": 4.9575, "mean_token_accuracy": 0.20647684782743453, "num_tokens": 74417718.0, "step": 42905 }, { "entropy": 5.735597467422485, "epoch": 3.3385333592686246, "grad_norm": 1.2734375, "learning_rate": 0.00039035678873253096, "loss": 4.9116, "mean_token_accuracy": 0.2115159809589386, "num_tokens": 74427168.0, "step": 42910 }, { "entropy": 5.721801710128784, "epoch": 3.3389223886403423, "grad_norm": 1.265625, "learning_rate": 0.0003903329920933012, "loss": 4.8782, "mean_token_accuracy": 0.22096198052167892, "num_tokens": 74436135.0, "step": 42915 }, { "entropy": 5.7768796443939205, "epoch": 3.33931141801206, "grad_norm": 1.328125, "learning_rate": 0.0003903091937040769, "loss": 4.9047, "mean_token_accuracy": 0.21123828291893004, "num_tokens": 74444532.0, "step": 42920 }, { "entropy": 5.725009727478027, "epoch": 3.3397004473837777, "grad_norm": 1.265625, "learning_rate": 0.0003902853935652191, "loss": 4.8562, "mean_token_accuracy": 0.22060043066740037, "num_tokens": 74452513.0, "step": 42925 }, { "entropy": 5.752758932113648, "epoch": 3.340089476755495, "grad_norm": 1.265625, "learning_rate": 0.0003902615916770889, "loss": 4.9811, "mean_token_accuracy": 0.20614133179187774, "num_tokens": 74461561.0, "step": 42930 }, { "entropy": 5.774969625473022, "epoch": 3.3404785061272126, "grad_norm": 1.234375, "learning_rate": 0.00039023778804004753, "loss": 4.9463, "mean_token_accuracy": 0.21234968006610871, "num_tokens": 74471371.0, "step": 42935 }, { "entropy": 5.809992074966431, "epoch": 3.3408675354989303, "grad_norm": 1.25, "learning_rate": 0.00039021398265445616, "loss": 4.9633, "mean_token_accuracy": 0.20803303718566896, "num_tokens": 74480299.0, "step": 42940 }, { "entropy": 5.823718404769897, "epoch": 3.3412565648706476, "grad_norm": 1.359375, "learning_rate": 0.000390190175520676, "loss": 4.9915, "mean_token_accuracy": 0.20968054831027985, "num_tokens": 74489511.0, "step": 42945 }, { "entropy": 5.811713218688965, "epoch": 3.3416455942423653, "grad_norm": 1.296875, "learning_rate": 0.0003901663666390683, "loss": 4.9691, "mean_token_accuracy": 0.2028544142842293, "num_tokens": 74497542.0, "step": 42950 }, { "entropy": 5.848036861419677, "epoch": 3.342034623614083, "grad_norm": 1.25, "learning_rate": 0.0003901425560099943, "loss": 5.0571, "mean_token_accuracy": 0.20871859639883042, "num_tokens": 74506906.0, "step": 42955 }, { "entropy": 5.75065050125122, "epoch": 3.3424236529858002, "grad_norm": 1.3125, "learning_rate": 0.00039011874363381523, "loss": 4.9425, "mean_token_accuracy": 0.20543222278356552, "num_tokens": 74515688.0, "step": 42960 }, { "entropy": 5.773118877410889, "epoch": 3.342812682357518, "grad_norm": 1.234375, "learning_rate": 0.00039009492951089236, "loss": 4.936, "mean_token_accuracy": 0.20458152890205383, "num_tokens": 74524405.0, "step": 42965 }, { "entropy": 5.803256464004517, "epoch": 3.3432017117292356, "grad_norm": 1.296875, "learning_rate": 0.0003900711136415873, "loss": 4.8881, "mean_token_accuracy": 0.22878348082304, "num_tokens": 74532438.0, "step": 42970 }, { "entropy": 5.784336566925049, "epoch": 3.343590741100953, "grad_norm": 1.328125, "learning_rate": 0.0003900472960262611, "loss": 4.9292, "mean_token_accuracy": 0.2126283273100853, "num_tokens": 74540979.0, "step": 42975 }, { "entropy": 5.747698736190796, "epoch": 3.3439797704726706, "grad_norm": 1.2578125, "learning_rate": 0.00039002347666527537, "loss": 4.8606, "mean_token_accuracy": 0.22063359171152114, "num_tokens": 74549752.0, "step": 42980 }, { "entropy": 5.811239099502563, "epoch": 3.3443687998443883, "grad_norm": 1.359375, "learning_rate": 0.00038999965555899145, "loss": 4.9496, "mean_token_accuracy": 0.21068868041038513, "num_tokens": 74557861.0, "step": 42985 }, { "entropy": 5.80413293838501, "epoch": 3.344757829216106, "grad_norm": 1.21875, "learning_rate": 0.0003899758327077709, "loss": 4.9794, "mean_token_accuracy": 0.21017554849386216, "num_tokens": 74566024.0, "step": 42990 }, { "entropy": 5.73810715675354, "epoch": 3.3451468585878232, "grad_norm": 1.234375, "learning_rate": 0.00038995200811197496, "loss": 4.9256, "mean_token_accuracy": 0.2104707956314087, "num_tokens": 74574311.0, "step": 42995 }, { "entropy": 5.798538875579834, "epoch": 3.345535887959541, "grad_norm": 1.234375, "learning_rate": 0.00038992818177196526, "loss": 4.9476, "mean_token_accuracy": 0.21518526822328568, "num_tokens": 74582955.0, "step": 43000 }, { "entropy": 5.781771039962768, "epoch": 3.3459249173312586, "grad_norm": 1.3984375, "learning_rate": 0.0003899043536881034, "loss": 4.8952, "mean_token_accuracy": 0.21596520841121675, "num_tokens": 74591132.0, "step": 43005 }, { "entropy": 5.744034194946289, "epoch": 3.346313946702976, "grad_norm": 1.4375, "learning_rate": 0.00038988052386075084, "loss": 4.8925, "mean_token_accuracy": 0.2144334524869919, "num_tokens": 74598904.0, "step": 43010 }, { "entropy": 5.699103784561157, "epoch": 3.3467029760746936, "grad_norm": 1.375, "learning_rate": 0.00038985669229026917, "loss": 4.8863, "mean_token_accuracy": 0.2130567416548729, "num_tokens": 74606774.0, "step": 43015 }, { "entropy": 5.817168283462524, "epoch": 3.3470920054464113, "grad_norm": 1.21875, "learning_rate": 0.00038983285897702005, "loss": 5.0259, "mean_token_accuracy": 0.21002042144536973, "num_tokens": 74614932.0, "step": 43020 }, { "entropy": 5.83107008934021, "epoch": 3.347481034818129, "grad_norm": 1.328125, "learning_rate": 0.00038980902392136496, "loss": 4.9845, "mean_token_accuracy": 0.2087450295686722, "num_tokens": 74623148.0, "step": 43025 }, { "entropy": 5.865071153640747, "epoch": 3.3478700641898462, "grad_norm": 1.4296875, "learning_rate": 0.0003897851871236657, "loss": 5.0427, "mean_token_accuracy": 0.19660421311855317, "num_tokens": 74631910.0, "step": 43030 }, { "entropy": 5.778626251220703, "epoch": 3.348259093561564, "grad_norm": 1.3125, "learning_rate": 0.00038976134858428397, "loss": 4.89, "mean_token_accuracy": 0.22158281803131102, "num_tokens": 74640067.0, "step": 43035 }, { "entropy": 5.753057050704956, "epoch": 3.3486481229332816, "grad_norm": 1.375, "learning_rate": 0.00038973750830358144, "loss": 4.9578, "mean_token_accuracy": 0.20895665436983107, "num_tokens": 74648375.0, "step": 43040 }, { "entropy": 5.704550457000733, "epoch": 3.349037152304999, "grad_norm": 1.21875, "learning_rate": 0.00038971366628191986, "loss": 4.829, "mean_token_accuracy": 0.21641192734241485, "num_tokens": 74657078.0, "step": 43045 }, { "entropy": 5.848461055755616, "epoch": 3.3494261816767166, "grad_norm": 1.3671875, "learning_rate": 0.000389689822519661, "loss": 5.0355, "mean_token_accuracy": 0.20600672960281372, "num_tokens": 74666024.0, "step": 43050 }, { "entropy": 5.893258571624756, "epoch": 3.3498152110484343, "grad_norm": 1.3125, "learning_rate": 0.00038966597701716653, "loss": 5.0662, "mean_token_accuracy": 0.20516044348478318, "num_tokens": 74674750.0, "step": 43055 }, { "entropy": 5.725406217575073, "epoch": 3.350204240420152, "grad_norm": 1.3203125, "learning_rate": 0.0003896421297747985, "loss": 4.8844, "mean_token_accuracy": 0.21399151980876924, "num_tokens": 74683069.0, "step": 43060 }, { "entropy": 5.747315406799316, "epoch": 3.350593269791869, "grad_norm": 1.2109375, "learning_rate": 0.0003896182807929185, "loss": 4.9628, "mean_token_accuracy": 0.20986505448818207, "num_tokens": 74692351.0, "step": 43065 }, { "entropy": 5.772113943099976, "epoch": 3.350982299163587, "grad_norm": 1.359375, "learning_rate": 0.0003895944300718885, "loss": 4.8989, "mean_token_accuracy": 0.21815911382436753, "num_tokens": 74700646.0, "step": 43070 }, { "entropy": 5.768545532226563, "epoch": 3.351371328535304, "grad_norm": 1.40625, "learning_rate": 0.00038957057761207053, "loss": 4.9877, "mean_token_accuracy": 0.209941466152668, "num_tokens": 74709364.0, "step": 43075 }, { "entropy": 5.833791351318359, "epoch": 3.351760357907022, "grad_norm": 1.28125, "learning_rate": 0.00038954672341382635, "loss": 5.0221, "mean_token_accuracy": 0.20199767649173736, "num_tokens": 74717905.0, "step": 43080 }, { "entropy": 5.792632913589477, "epoch": 3.3521493872787396, "grad_norm": 1.3203125, "learning_rate": 0.000389522867477518, "loss": 4.8859, "mean_token_accuracy": 0.22230317145586015, "num_tokens": 74726648.0, "step": 43085 }, { "entropy": 5.856190013885498, "epoch": 3.3525384166504573, "grad_norm": 1.3359375, "learning_rate": 0.0003894990098035074, "loss": 5.0452, "mean_token_accuracy": 0.20897010415792466, "num_tokens": 74735362.0, "step": 43090 }, { "entropy": 5.838282346725464, "epoch": 3.3529274460221745, "grad_norm": 1.3359375, "learning_rate": 0.0003894751503921566, "loss": 4.9099, "mean_token_accuracy": 0.21451593637466432, "num_tokens": 74744560.0, "step": 43095 }, { "entropy": 5.771103429794311, "epoch": 3.353316475393892, "grad_norm": 1.375, "learning_rate": 0.0003894512892438275, "loss": 4.8728, "mean_token_accuracy": 0.23024735301733018, "num_tokens": 74752951.0, "step": 43100 }, { "entropy": 5.764113473892212, "epoch": 3.35370550476561, "grad_norm": 1.2734375, "learning_rate": 0.00038942742635888236, "loss": 4.9575, "mean_token_accuracy": 0.21502251625061036, "num_tokens": 74761664.0, "step": 43105 }, { "entropy": 5.764804983139038, "epoch": 3.354094534137327, "grad_norm": 1.4453125, "learning_rate": 0.00038940356173768303, "loss": 4.849, "mean_token_accuracy": 0.21943265646696092, "num_tokens": 74770031.0, "step": 43110 }, { "entropy": 5.675157165527343, "epoch": 3.354483563509045, "grad_norm": 1.3359375, "learning_rate": 0.0003893796953805919, "loss": 4.8261, "mean_token_accuracy": 0.22137391716241836, "num_tokens": 74778425.0, "step": 43115 }, { "entropy": 5.738363647460938, "epoch": 3.3548725928807626, "grad_norm": 1.25, "learning_rate": 0.00038935582728797085, "loss": 4.9708, "mean_token_accuracy": 0.20903128981590272, "num_tokens": 74787039.0, "step": 43120 }, { "entropy": 5.8077332973480225, "epoch": 3.3552616222524803, "grad_norm": 1.390625, "learning_rate": 0.00038933195746018213, "loss": 4.9426, "mean_token_accuracy": 0.2160432368516922, "num_tokens": 74795458.0, "step": 43125 }, { "entropy": 5.761938142776489, "epoch": 3.3556506516241975, "grad_norm": 1.3828125, "learning_rate": 0.00038930808589758797, "loss": 4.9359, "mean_token_accuracy": 0.21908112317323686, "num_tokens": 74803922.0, "step": 43130 }, { "entropy": 5.819369506835938, "epoch": 3.356039680995915, "grad_norm": 1.25, "learning_rate": 0.0003892842126005506, "loss": 5.0092, "mean_token_accuracy": 0.20671227276325227, "num_tokens": 74813199.0, "step": 43135 }, { "entropy": 5.788135099411011, "epoch": 3.356428710367633, "grad_norm": 1.3046875, "learning_rate": 0.0003892603375694321, "loss": 4.9376, "mean_token_accuracy": 0.21227660328149794, "num_tokens": 74822052.0, "step": 43140 }, { "entropy": 5.898581552505493, "epoch": 3.35681773973935, "grad_norm": 1.453125, "learning_rate": 0.00038923646080459484, "loss": 5.1211, "mean_token_accuracy": 0.1966175228357315, "num_tokens": 74829771.0, "step": 43145 }, { "entropy": 5.831902885437012, "epoch": 3.357206769111068, "grad_norm": 1.3046875, "learning_rate": 0.00038921258230640123, "loss": 5.0102, "mean_token_accuracy": 0.20399683862924575, "num_tokens": 74839054.0, "step": 43150 }, { "entropy": 5.822342777252198, "epoch": 3.3575957984827856, "grad_norm": 1.3046875, "learning_rate": 0.00038918870207521334, "loss": 4.9668, "mean_token_accuracy": 0.20010855197906494, "num_tokens": 74847830.0, "step": 43155 }, { "entropy": 5.83560700416565, "epoch": 3.3579848278545033, "grad_norm": 1.21875, "learning_rate": 0.00038916482011139373, "loss": 4.9948, "mean_token_accuracy": 0.21636561304330826, "num_tokens": 74856621.0, "step": 43160 }, { "entropy": 5.731892108917236, "epoch": 3.3583738572262205, "grad_norm": 1.2734375, "learning_rate": 0.0003891409364153047, "loss": 4.8912, "mean_token_accuracy": 0.21556456387043, "num_tokens": 74865094.0, "step": 43165 }, { "entropy": 5.7617998123168945, "epoch": 3.358762886597938, "grad_norm": 1.296875, "learning_rate": 0.0003891170509873086, "loss": 4.9803, "mean_token_accuracy": 0.20563586801290512, "num_tokens": 74874821.0, "step": 43170 }, { "entropy": 5.828053045272827, "epoch": 3.359151915969656, "grad_norm": 1.5546875, "learning_rate": 0.00038909316382776784, "loss": 4.9564, "mean_token_accuracy": 0.21250070184469222, "num_tokens": 74883047.0, "step": 43175 }, { "entropy": 5.790762996673584, "epoch": 3.359540945341373, "grad_norm": 1.2109375, "learning_rate": 0.0003890692749370449, "loss": 4.9573, "mean_token_accuracy": 0.20824091881513596, "num_tokens": 74892462.0, "step": 43180 }, { "entropy": 5.683311462402344, "epoch": 3.359929974713091, "grad_norm": 1.328125, "learning_rate": 0.00038904538431550235, "loss": 4.8154, "mean_token_accuracy": 0.21600456684827804, "num_tokens": 74900584.0, "step": 43185 }, { "entropy": 5.7048932075500485, "epoch": 3.3603190040848085, "grad_norm": 1.3203125, "learning_rate": 0.0003890214919635026, "loss": 4.8484, "mean_token_accuracy": 0.2169600933790207, "num_tokens": 74909300.0, "step": 43190 }, { "entropy": 5.736833190917968, "epoch": 3.360708033456526, "grad_norm": 1.3046875, "learning_rate": 0.0003889975978814082, "loss": 5.0115, "mean_token_accuracy": 0.21156176924705505, "num_tokens": 74917781.0, "step": 43195 }, { "entropy": 5.778401470184326, "epoch": 3.3610970628282435, "grad_norm": 1.3671875, "learning_rate": 0.0003889737020695817, "loss": 4.8883, "mean_token_accuracy": 0.21896960586309433, "num_tokens": 74926566.0, "step": 43200 }, { "entropy": 5.763939428329468, "epoch": 3.361486092199961, "grad_norm": 1.2578125, "learning_rate": 0.00038894980452838573, "loss": 4.9324, "mean_token_accuracy": 0.22024949938058852, "num_tokens": 74934956.0, "step": 43205 }, { "entropy": 5.767733192443847, "epoch": 3.3618751215716784, "grad_norm": 1.3125, "learning_rate": 0.0003889259052581828, "loss": 4.941, "mean_token_accuracy": 0.21761380434036254, "num_tokens": 74943491.0, "step": 43210 }, { "entropy": 5.859687948226929, "epoch": 3.362264150943396, "grad_norm": 1.3359375, "learning_rate": 0.00038890200425933545, "loss": 4.9956, "mean_token_accuracy": 0.21021403074264527, "num_tokens": 74952486.0, "step": 43215 }, { "entropy": 5.793098735809326, "epoch": 3.362653180315114, "grad_norm": 1.375, "learning_rate": 0.0003888781015322067, "loss": 4.968, "mean_token_accuracy": 0.21527902334928511, "num_tokens": 74960563.0, "step": 43220 }, { "entropy": 5.731127071380615, "epoch": 3.3630422096868315, "grad_norm": 1.3046875, "learning_rate": 0.00038885419707715885, "loss": 4.8783, "mean_token_accuracy": 0.21830789744853973, "num_tokens": 74968974.0, "step": 43225 }, { "entropy": 5.883921480178833, "epoch": 3.363431239058549, "grad_norm": 1.4140625, "learning_rate": 0.00038883029089455487, "loss": 5.0751, "mean_token_accuracy": 0.20537883043289185, "num_tokens": 74976905.0, "step": 43230 }, { "entropy": 5.861655044555664, "epoch": 3.3638202684302665, "grad_norm": 1.640625, "learning_rate": 0.0003888063829847574, "loss": 5.0417, "mean_token_accuracy": 0.20276482701301574, "num_tokens": 74986112.0, "step": 43235 }, { "entropy": 5.804697275161743, "epoch": 3.364209297801984, "grad_norm": 1.2890625, "learning_rate": 0.0003887824733481292, "loss": 4.9735, "mean_token_accuracy": 0.21133866906166077, "num_tokens": 74994951.0, "step": 43240 }, { "entropy": 5.855419063568116, "epoch": 3.3645983271737014, "grad_norm": 1.234375, "learning_rate": 0.00038875856198503306, "loss": 5.0128, "mean_token_accuracy": 0.2072945088148117, "num_tokens": 75003266.0, "step": 43245 }, { "entropy": 5.797330617904663, "epoch": 3.364987356545419, "grad_norm": 1.3359375, "learning_rate": 0.00038873464889583177, "loss": 4.9765, "mean_token_accuracy": 0.20561964809894562, "num_tokens": 75012619.0, "step": 43250 }, { "entropy": 5.7820902347564695, "epoch": 3.365376385917137, "grad_norm": 1.4140625, "learning_rate": 0.00038871073408088826, "loss": 4.9388, "mean_token_accuracy": 0.20851636976003646, "num_tokens": 75021269.0, "step": 43255 }, { "entropy": 5.840204572677612, "epoch": 3.3657654152888545, "grad_norm": 1.3515625, "learning_rate": 0.0003886868175405653, "loss": 5.0197, "mean_token_accuracy": 0.20724011063575745, "num_tokens": 75029944.0, "step": 43260 }, { "entropy": 5.877769851684571, "epoch": 3.366154444660572, "grad_norm": 1.2734375, "learning_rate": 0.0003886628992752259, "loss": 4.9845, "mean_token_accuracy": 0.21159321814775467, "num_tokens": 75038884.0, "step": 43265 }, { "entropy": 5.8844305038452145, "epoch": 3.3665434740322895, "grad_norm": 1.3671875, "learning_rate": 0.0003886389792852329, "loss": 5.009, "mean_token_accuracy": 0.21310233771800996, "num_tokens": 75047101.0, "step": 43270 }, { "entropy": 5.737908792495728, "epoch": 3.366932503404007, "grad_norm": 1.3359375, "learning_rate": 0.00038861505757094923, "loss": 4.9025, "mean_token_accuracy": 0.21620312184095383, "num_tokens": 75055778.0, "step": 43275 }, { "entropy": 5.771483755111694, "epoch": 3.3673215327757244, "grad_norm": 1.34375, "learning_rate": 0.0003885911341327379, "loss": 4.9462, "mean_token_accuracy": 0.21473979204893112, "num_tokens": 75065329.0, "step": 43280 }, { "entropy": 5.77823805809021, "epoch": 3.367710562147442, "grad_norm": 1.28125, "learning_rate": 0.000388567208970962, "loss": 4.9885, "mean_token_accuracy": 0.20329664051532745, "num_tokens": 75074319.0, "step": 43285 }, { "entropy": 5.690600967407226, "epoch": 3.36809959151916, "grad_norm": 1.2578125, "learning_rate": 0.0003885432820859844, "loss": 4.8415, "mean_token_accuracy": 0.21449536085128784, "num_tokens": 75083134.0, "step": 43290 }, { "entropy": 5.814583015441895, "epoch": 3.368488620890877, "grad_norm": 1.3046875, "learning_rate": 0.00038851935347816827, "loss": 5.0034, "mean_token_accuracy": 0.20102193355560302, "num_tokens": 75090511.0, "step": 43295 }, { "entropy": 5.801841068267822, "epoch": 3.368877650262595, "grad_norm": 1.3046875, "learning_rate": 0.0003884954231478764, "loss": 4.9541, "mean_token_accuracy": 0.20990679562091827, "num_tokens": 75100398.0, "step": 43300 }, { "entropy": 5.787739181518555, "epoch": 3.3692666796343125, "grad_norm": 1.2890625, "learning_rate": 0.0003884714910954724, "loss": 5.0514, "mean_token_accuracy": 0.20340281575918198, "num_tokens": 75109565.0, "step": 43305 }, { "entropy": 5.742578744888306, "epoch": 3.3696557090060297, "grad_norm": 1.328125, "learning_rate": 0.000388447557321319, "loss": 4.92, "mean_token_accuracy": 0.21569794714450835, "num_tokens": 75117906.0, "step": 43310 }, { "entropy": 5.854322052001953, "epoch": 3.3700447383777474, "grad_norm": 1.2421875, "learning_rate": 0.0003884236218257795, "loss": 4.9671, "mean_token_accuracy": 0.21277662962675095, "num_tokens": 75126880.0, "step": 43315 }, { "entropy": 5.863040161132813, "epoch": 3.370433767749465, "grad_norm": 1.2734375, "learning_rate": 0.0003883996846092171, "loss": 4.9715, "mean_token_accuracy": 0.2069724142551422, "num_tokens": 75135235.0, "step": 43320 }, { "entropy": 5.788700342178345, "epoch": 3.370822797121183, "grad_norm": 1.328125, "learning_rate": 0.000388375745671995, "loss": 4.9741, "mean_token_accuracy": 0.2088899463415146, "num_tokens": 75144340.0, "step": 43325 }, { "entropy": 5.778656625747681, "epoch": 3.3712118264929, "grad_norm": 1.265625, "learning_rate": 0.00038835180501447646, "loss": 4.9476, "mean_token_accuracy": 0.20824449509382248, "num_tokens": 75152473.0, "step": 43330 }, { "entropy": 5.912785816192627, "epoch": 3.3716008558646178, "grad_norm": 1.375, "learning_rate": 0.0003883278626370245, "loss": 5.0259, "mean_token_accuracy": 0.20538419038057326, "num_tokens": 75161326.0, "step": 43335 }, { "entropy": 5.818997764587403, "epoch": 3.3719898852363355, "grad_norm": 1.4453125, "learning_rate": 0.00038830391854000285, "loss": 4.9874, "mean_token_accuracy": 0.2076309710741043, "num_tokens": 75169798.0, "step": 43340 }, { "entropy": 5.793631076812744, "epoch": 3.3723789146080527, "grad_norm": 1.34375, "learning_rate": 0.00038827997272377447, "loss": 5.0199, "mean_token_accuracy": 0.21255874037742614, "num_tokens": 75178678.0, "step": 43345 }, { "entropy": 5.77736005783081, "epoch": 3.3727679439797704, "grad_norm": 1.3046875, "learning_rate": 0.00038825602518870276, "loss": 5.0682, "mean_token_accuracy": 0.2014079809188843, "num_tokens": 75187639.0, "step": 43350 }, { "entropy": 5.82472791671753, "epoch": 3.373156973351488, "grad_norm": 1.375, "learning_rate": 0.0003882320759351512, "loss": 4.9585, "mean_token_accuracy": 0.20840444266796113, "num_tokens": 75195822.0, "step": 43355 }, { "entropy": 5.828814554214477, "epoch": 3.373546002723206, "grad_norm": 1.3984375, "learning_rate": 0.00038820812496348305, "loss": 5.0604, "mean_token_accuracy": 0.2051539972424507, "num_tokens": 75205303.0, "step": 43360 }, { "entropy": 5.79276967048645, "epoch": 3.373935032094923, "grad_norm": 1.2421875, "learning_rate": 0.00038818417227406185, "loss": 4.9065, "mean_token_accuracy": 0.2132664516568184, "num_tokens": 75214159.0, "step": 43365 }, { "entropy": 5.788076639175415, "epoch": 3.3743240614666408, "grad_norm": 1.3671875, "learning_rate": 0.00038816021786725096, "loss": 4.9437, "mean_token_accuracy": 0.21185071468353273, "num_tokens": 75222822.0, "step": 43370 }, { "entropy": 5.836170244216919, "epoch": 3.3747130908383585, "grad_norm": 1.390625, "learning_rate": 0.00038813626174341386, "loss": 5.0058, "mean_token_accuracy": 0.20198375284671782, "num_tokens": 75230832.0, "step": 43375 }, { "entropy": 5.815476608276367, "epoch": 3.3751021202100757, "grad_norm": 1.2265625, "learning_rate": 0.0003881123039029141, "loss": 4.9863, "mean_token_accuracy": 0.20886081457138062, "num_tokens": 75239752.0, "step": 43380 }, { "entropy": 5.842246627807617, "epoch": 3.3754911495817934, "grad_norm": 1.3359375, "learning_rate": 0.0003880883443461152, "loss": 5.0418, "mean_token_accuracy": 0.20313954055309297, "num_tokens": 75248380.0, "step": 43385 }, { "entropy": 5.823566102981568, "epoch": 3.375880178953511, "grad_norm": 1.2265625, "learning_rate": 0.0003880643830733806, "loss": 4.9656, "mean_token_accuracy": 0.2168781951069832, "num_tokens": 75257082.0, "step": 43390 }, { "entropy": 5.789053821563721, "epoch": 3.3762692083252284, "grad_norm": 1.4375, "learning_rate": 0.00038804042008507396, "loss": 4.9565, "mean_token_accuracy": 0.21087796986103058, "num_tokens": 75266097.0, "step": 43395 }, { "entropy": 5.757659959793091, "epoch": 3.376658237696946, "grad_norm": 1.265625, "learning_rate": 0.00038801645538155883, "loss": 4.9343, "mean_token_accuracy": 0.21146950274705886, "num_tokens": 75274658.0, "step": 43400 }, { "entropy": 5.805580949783325, "epoch": 3.3770472670686638, "grad_norm": 1.40625, "learning_rate": 0.00038799248896319896, "loss": 4.9416, "mean_token_accuracy": 0.2117716059088707, "num_tokens": 75283222.0, "step": 43405 }, { "entropy": 5.813009357452392, "epoch": 3.377436296440381, "grad_norm": 1.34375, "learning_rate": 0.00038796852083035794, "loss": 4.9395, "mean_token_accuracy": 0.21019311398267745, "num_tokens": 75291091.0, "step": 43410 }, { "entropy": 5.742338037490844, "epoch": 3.3778253258120987, "grad_norm": 1.3359375, "learning_rate": 0.0003879445509833993, "loss": 4.8641, "mean_token_accuracy": 0.2218306541442871, "num_tokens": 75299468.0, "step": 43415 }, { "entropy": 5.854673242568969, "epoch": 3.3782143551838164, "grad_norm": 1.421875, "learning_rate": 0.000387920579422687, "loss": 5.0264, "mean_token_accuracy": 0.21270017921924592, "num_tokens": 75308213.0, "step": 43420 }, { "entropy": 5.820257043838501, "epoch": 3.378603384555534, "grad_norm": 1.3359375, "learning_rate": 0.0003878966061485845, "loss": 4.9559, "mean_token_accuracy": 0.21120356917381286, "num_tokens": 75317290.0, "step": 43425 }, { "entropy": 5.8295081615447994, "epoch": 3.3789924139272514, "grad_norm": 1.296875, "learning_rate": 0.00038787263116145577, "loss": 4.893, "mean_token_accuracy": 0.21402274668216706, "num_tokens": 75326100.0, "step": 43430 }, { "entropy": 5.727777767181396, "epoch": 3.379381443298969, "grad_norm": 1.3515625, "learning_rate": 0.00038784865446166454, "loss": 4.807, "mean_token_accuracy": 0.22277100384235382, "num_tokens": 75334418.0, "step": 43435 }, { "entropy": 5.706051635742187, "epoch": 3.3797704726706868, "grad_norm": 1.4296875, "learning_rate": 0.00038782467604957455, "loss": 4.8734, "mean_token_accuracy": 0.22450652867555618, "num_tokens": 75342760.0, "step": 43440 }, { "entropy": 5.686639785766602, "epoch": 3.380159502042404, "grad_norm": 1.265625, "learning_rate": 0.00038780069592554977, "loss": 4.9433, "mean_token_accuracy": 0.20826275050640106, "num_tokens": 75351440.0, "step": 43445 }, { "entropy": 5.777030277252197, "epoch": 3.3805485314141217, "grad_norm": 1.2890625, "learning_rate": 0.0003877767140899539, "loss": 4.9399, "mean_token_accuracy": 0.20552217811346055, "num_tokens": 75359594.0, "step": 43450 }, { "entropy": 5.931403970718383, "epoch": 3.3809375607858394, "grad_norm": 1.3515625, "learning_rate": 0.00038775273054315087, "loss": 5.1189, "mean_token_accuracy": 0.20903530567884446, "num_tokens": 75368281.0, "step": 43455 }, { "entropy": 5.703004980087281, "epoch": 3.381326590157557, "grad_norm": 1.390625, "learning_rate": 0.0003877287452855046, "loss": 4.8548, "mean_token_accuracy": 0.21662104427814483, "num_tokens": 75376584.0, "step": 43460 }, { "entropy": 5.776071834564209, "epoch": 3.3817156195292744, "grad_norm": 1.34375, "learning_rate": 0.00038770475831737905, "loss": 5.0258, "mean_token_accuracy": 0.2007954850792885, "num_tokens": 75385041.0, "step": 43465 }, { "entropy": 5.736465740203857, "epoch": 3.382104648900992, "grad_norm": 1.3671875, "learning_rate": 0.00038768076963913823, "loss": 4.8884, "mean_token_accuracy": 0.21868306994438172, "num_tokens": 75393885.0, "step": 43470 }, { "entropy": 5.768190526962281, "epoch": 3.3824936782727097, "grad_norm": 1.3203125, "learning_rate": 0.00038765677925114614, "loss": 4.9897, "mean_token_accuracy": 0.20529239773750305, "num_tokens": 75402199.0, "step": 43475 }, { "entropy": 5.7986400604248045, "epoch": 3.382882707644427, "grad_norm": 1.3671875, "learning_rate": 0.0003876327871537667, "loss": 4.9525, "mean_token_accuracy": 0.21075936257839203, "num_tokens": 75411073.0, "step": 43480 }, { "entropy": 5.83245620727539, "epoch": 3.3832717370161447, "grad_norm": 1.28125, "learning_rate": 0.00038760879334736394, "loss": 5.0249, "mean_token_accuracy": 0.21377402395009995, "num_tokens": 75420245.0, "step": 43485 }, { "entropy": 5.799361371994019, "epoch": 3.3836607663878624, "grad_norm": 1.28125, "learning_rate": 0.00038758479783230197, "loss": 4.9704, "mean_token_accuracy": 0.21208999156951905, "num_tokens": 75428945.0, "step": 43490 }, { "entropy": 5.761487579345703, "epoch": 3.38404979575958, "grad_norm": 1.359375, "learning_rate": 0.0003875608006089449, "loss": 4.9202, "mean_token_accuracy": 0.21865946650505066, "num_tokens": 75437054.0, "step": 43495 }, { "entropy": 5.7555159568786625, "epoch": 3.3844388251312973, "grad_norm": 1.3828125, "learning_rate": 0.0003875368016776569, "loss": 4.9021, "mean_token_accuracy": 0.214740751683712, "num_tokens": 75445774.0, "step": 43500 }, { "entropy": 5.851074934005737, "epoch": 3.384827854503015, "grad_norm": 1.28125, "learning_rate": 0.000387512801038802, "loss": 5.0577, "mean_token_accuracy": 0.20817840248346328, "num_tokens": 75454358.0, "step": 43505 }, { "entropy": 5.758426237106323, "epoch": 3.3852168838747323, "grad_norm": 1.2578125, "learning_rate": 0.0003874887986927444, "loss": 4.9029, "mean_token_accuracy": 0.21534413993358612, "num_tokens": 75463422.0, "step": 43510 }, { "entropy": 5.714532136917114, "epoch": 3.38560591324645, "grad_norm": 1.25, "learning_rate": 0.0003874647946398484, "loss": 4.9298, "mean_token_accuracy": 0.21564772129058837, "num_tokens": 75472592.0, "step": 43515 }, { "entropy": 5.76764931678772, "epoch": 3.3859949426181677, "grad_norm": 1.265625, "learning_rate": 0.0003874407888804781, "loss": 5.0006, "mean_token_accuracy": 0.21047221273183822, "num_tokens": 75481164.0, "step": 43520 }, { "entropy": 5.920309352874756, "epoch": 3.3863839719898854, "grad_norm": 1.4296875, "learning_rate": 0.00038741678141499783, "loss": 5.0395, "mean_token_accuracy": 0.20157782286405562, "num_tokens": 75491061.0, "step": 43525 }, { "entropy": 5.842792272567749, "epoch": 3.3867730013616026, "grad_norm": 1.3125, "learning_rate": 0.0003873927722437718, "loss": 4.9787, "mean_token_accuracy": 0.21324381828308106, "num_tokens": 75499791.0, "step": 43530 }, { "entropy": 5.832587337493896, "epoch": 3.3871620307333203, "grad_norm": 1.46875, "learning_rate": 0.0003873687613671643, "loss": 4.9636, "mean_token_accuracy": 0.21257290095090867, "num_tokens": 75509380.0, "step": 43535 }, { "entropy": 5.769758033752441, "epoch": 3.387551060105038, "grad_norm": 1.21875, "learning_rate": 0.0003873447487855398, "loss": 4.9052, "mean_token_accuracy": 0.21691685169935226, "num_tokens": 75519333.0, "step": 43540 }, { "entropy": 5.731731176376343, "epoch": 3.3879400894767553, "grad_norm": 1.2734375, "learning_rate": 0.00038732073449926244, "loss": 4.8621, "mean_token_accuracy": 0.22346869707107545, "num_tokens": 75527736.0, "step": 43545 }, { "entropy": 5.742165184020996, "epoch": 3.388329118848473, "grad_norm": 1.3515625, "learning_rate": 0.0003872967185086968, "loss": 4.9186, "mean_token_accuracy": 0.20924646705389022, "num_tokens": 75536877.0, "step": 43550 }, { "entropy": 5.817529249191284, "epoch": 3.3887181482201907, "grad_norm": 1.375, "learning_rate": 0.0003872727008142072, "loss": 4.9477, "mean_token_accuracy": 0.21145665198564528, "num_tokens": 75544887.0, "step": 43555 }, { "entropy": 5.852278757095337, "epoch": 3.3891071775919084, "grad_norm": 1.40625, "learning_rate": 0.00038724868141615807, "loss": 4.9884, "mean_token_accuracy": 0.2157441794872284, "num_tokens": 75552951.0, "step": 43560 }, { "entropy": 5.724443864822388, "epoch": 3.3894962069636256, "grad_norm": 1.328125, "learning_rate": 0.0003872246603149138, "loss": 4.904, "mean_token_accuracy": 0.21671249568462372, "num_tokens": 75561828.0, "step": 43565 }, { "entropy": 5.78367247581482, "epoch": 3.3898852363353433, "grad_norm": 1.3046875, "learning_rate": 0.0003872006375108389, "loss": 4.959, "mean_token_accuracy": 0.2085007384419441, "num_tokens": 75570552.0, "step": 43570 }, { "entropy": 5.7697676658630375, "epoch": 3.390274265707061, "grad_norm": 1.3359375, "learning_rate": 0.000387176613004298, "loss": 4.9072, "mean_token_accuracy": 0.21136243939399718, "num_tokens": 75579324.0, "step": 43575 }, { "entropy": 5.7815851211547855, "epoch": 3.3906632950787783, "grad_norm": 1.4453125, "learning_rate": 0.0003871525867956555, "loss": 4.8994, "mean_token_accuracy": 0.2158256486058235, "num_tokens": 75588027.0, "step": 43580 }, { "entropy": 5.809529876708984, "epoch": 3.391052324450496, "grad_norm": 1.328125, "learning_rate": 0.00038712855888527604, "loss": 5.0251, "mean_token_accuracy": 0.20674671828746796, "num_tokens": 75596374.0, "step": 43585 }, { "entropy": 5.797618103027344, "epoch": 3.3914413538222137, "grad_norm": 1.3046875, "learning_rate": 0.00038710452927352414, "loss": 4.968, "mean_token_accuracy": 0.2059774398803711, "num_tokens": 75605820.0, "step": 43590 }, { "entropy": 5.724615859985351, "epoch": 3.3918303831939314, "grad_norm": 1.1875, "learning_rate": 0.0003870804979607645, "loss": 4.9067, "mean_token_accuracy": 0.21301112025976182, "num_tokens": 75615822.0, "step": 43595 }, { "entropy": 5.809083032608032, "epoch": 3.3922194125656486, "grad_norm": 1.3046875, "learning_rate": 0.00038705646494736163, "loss": 4.9211, "mean_token_accuracy": 0.21521904021501542, "num_tokens": 75624409.0, "step": 43600 }, { "entropy": 5.8270384788513185, "epoch": 3.3926084419373663, "grad_norm": 1.390625, "learning_rate": 0.0003870324302336802, "loss": 4.9758, "mean_token_accuracy": 0.2111015722155571, "num_tokens": 75632190.0, "step": 43605 }, { "entropy": 5.81065731048584, "epoch": 3.392997471309084, "grad_norm": 1.34375, "learning_rate": 0.0003870083938200851, "loss": 4.9695, "mean_token_accuracy": 0.20971662551164627, "num_tokens": 75640033.0, "step": 43610 }, { "entropy": 5.784988355636597, "epoch": 3.3933865006808013, "grad_norm": 1.3125, "learning_rate": 0.00038698435570694084, "loss": 4.9466, "mean_token_accuracy": 0.2114199310541153, "num_tokens": 75648598.0, "step": 43615 }, { "entropy": 5.806748485565185, "epoch": 3.393775530052519, "grad_norm": 1.40625, "learning_rate": 0.0003869603158946122, "loss": 4.9696, "mean_token_accuracy": 0.2127452477812767, "num_tokens": 75656841.0, "step": 43620 }, { "entropy": 5.76475157737732, "epoch": 3.3941645594242367, "grad_norm": 1.296875, "learning_rate": 0.000386936274383464, "loss": 4.8734, "mean_token_accuracy": 0.22006040066480637, "num_tokens": 75664918.0, "step": 43625 }, { "entropy": 5.770832586288452, "epoch": 3.394553588795954, "grad_norm": 1.265625, "learning_rate": 0.000386912231173861, "loss": 4.865, "mean_token_accuracy": 0.21892206370830536, "num_tokens": 75672800.0, "step": 43630 }, { "entropy": 5.753575038909912, "epoch": 3.3949426181676716, "grad_norm": 1.234375, "learning_rate": 0.000386888186266168, "loss": 4.9895, "mean_token_accuracy": 0.20871349722146987, "num_tokens": 75681669.0, "step": 43635 }, { "entropy": 5.861952304840088, "epoch": 3.3953316475393893, "grad_norm": 1.34375, "learning_rate": 0.0003868641396607499, "loss": 4.9185, "mean_token_accuracy": 0.2131394699215889, "num_tokens": 75690109.0, "step": 43640 }, { "entropy": 5.759485483169556, "epoch": 3.3957206769111066, "grad_norm": 1.296875, "learning_rate": 0.0003868400913579715, "loss": 4.8899, "mean_token_accuracy": 0.21360743939876556, "num_tokens": 75698395.0, "step": 43645 }, { "entropy": 5.79687533378601, "epoch": 3.3961097062828243, "grad_norm": 1.375, "learning_rate": 0.00038681604135819774, "loss": 4.9227, "mean_token_accuracy": 0.21640504747629166, "num_tokens": 75707515.0, "step": 43650 }, { "entropy": 5.754794311523438, "epoch": 3.396498735654542, "grad_norm": 1.3046875, "learning_rate": 0.00038679198966179353, "loss": 4.8289, "mean_token_accuracy": 0.22756207585334778, "num_tokens": 75715725.0, "step": 43655 }, { "entropy": 5.739500331878662, "epoch": 3.3968877650262597, "grad_norm": 1.25, "learning_rate": 0.00038676793626912375, "loss": 4.9269, "mean_token_accuracy": 0.2099432736635208, "num_tokens": 75723969.0, "step": 43660 }, { "entropy": 5.804638814926148, "epoch": 3.397276794397977, "grad_norm": 1.34375, "learning_rate": 0.00038674388118055354, "loss": 5.0012, "mean_token_accuracy": 0.20546324849128722, "num_tokens": 75732185.0, "step": 43665 }, { "entropy": 5.861702108383179, "epoch": 3.3976658237696946, "grad_norm": 1.28125, "learning_rate": 0.0003867198243964477, "loss": 4.9742, "mean_token_accuracy": 0.21136565804481505, "num_tokens": 75740523.0, "step": 43670 }, { "entropy": 5.770979356765747, "epoch": 3.3980548531414123, "grad_norm": 1.2734375, "learning_rate": 0.0003866957659171714, "loss": 4.9135, "mean_token_accuracy": 0.2189035475254059, "num_tokens": 75749478.0, "step": 43675 }, { "entropy": 5.730063629150391, "epoch": 3.3984438825131296, "grad_norm": 1.28125, "learning_rate": 0.0003866717057430896, "loss": 4.9871, "mean_token_accuracy": 0.21349195688962935, "num_tokens": 75758202.0, "step": 43680 }, { "entropy": 5.8633922100067135, "epoch": 3.3988329118848473, "grad_norm": 1.3125, "learning_rate": 0.0003866476438745675, "loss": 5.0236, "mean_token_accuracy": 0.20707566291093826, "num_tokens": 75766304.0, "step": 43685 }, { "entropy": 5.818242788314819, "epoch": 3.399221941256565, "grad_norm": 1.5234375, "learning_rate": 0.00038662358031197, "loss": 4.9345, "mean_token_accuracy": 0.21161001473665236, "num_tokens": 75774140.0, "step": 43690 }, { "entropy": 5.830604982376099, "epoch": 3.3996109706282827, "grad_norm": 1.3671875, "learning_rate": 0.0003865995150556624, "loss": 4.9933, "mean_token_accuracy": 0.21068360209465026, "num_tokens": 75783055.0, "step": 43695 }, { "entropy": 5.7711621761322025, "epoch": 3.4, "grad_norm": 1.21875, "learning_rate": 0.00038657544810600966, "loss": 4.8836, "mean_token_accuracy": 0.2177087351679802, "num_tokens": 75791158.0, "step": 43700 }, { "entropy": 5.779644727706909, "epoch": 3.4003890293717176, "grad_norm": 1.2265625, "learning_rate": 0.0003865513794633773, "loss": 4.9761, "mean_token_accuracy": 0.20983498692512512, "num_tokens": 75800254.0, "step": 43705 }, { "entropy": 5.792922496795654, "epoch": 3.4007780587434353, "grad_norm": 1.1953125, "learning_rate": 0.0003865273091281301, "loss": 4.9511, "mean_token_accuracy": 0.2085151955485344, "num_tokens": 75808782.0, "step": 43710 }, { "entropy": 5.797131443023682, "epoch": 3.4011670881151526, "grad_norm": 1.2578125, "learning_rate": 0.0003865032371006336, "loss": 4.9258, "mean_token_accuracy": 0.21661184281110762, "num_tokens": 75817767.0, "step": 43715 }, { "entropy": 5.747809410095215, "epoch": 3.4015561174868703, "grad_norm": 1.375, "learning_rate": 0.000386479163381253, "loss": 4.8949, "mean_token_accuracy": 0.2166934937238693, "num_tokens": 75826052.0, "step": 43720 }, { "entropy": 5.7999084949493405, "epoch": 3.401945146858588, "grad_norm": 1.28125, "learning_rate": 0.00038645508797035345, "loss": 5.0423, "mean_token_accuracy": 0.20328622311353683, "num_tokens": 75835189.0, "step": 43725 }, { "entropy": 5.849588632583618, "epoch": 3.402334176230305, "grad_norm": 1.3359375, "learning_rate": 0.00038643101086830036, "loss": 4.967, "mean_token_accuracy": 0.21421560347080232, "num_tokens": 75843933.0, "step": 43730 }, { "entropy": 5.737955379486084, "epoch": 3.402723205602023, "grad_norm": 1.4765625, "learning_rate": 0.000386406932075459, "loss": 4.8445, "mean_token_accuracy": 0.22456381916999818, "num_tokens": 75852155.0, "step": 43735 }, { "entropy": 5.7874391078948975, "epoch": 3.4031122349737406, "grad_norm": 1.375, "learning_rate": 0.0003863828515921948, "loss": 4.962, "mean_token_accuracy": 0.2121907502412796, "num_tokens": 75861104.0, "step": 43740 }, { "entropy": 5.825198173522949, "epoch": 3.403501264345458, "grad_norm": 1.3515625, "learning_rate": 0.0003863587694188732, "loss": 4.9822, "mean_token_accuracy": 0.21612623780965806, "num_tokens": 75869831.0, "step": 43745 }, { "entropy": 5.820079755783081, "epoch": 3.4038902937171756, "grad_norm": 1.421875, "learning_rate": 0.00038633468555585943, "loss": 5.054, "mean_token_accuracy": 0.20010418742895125, "num_tokens": 75878202.0, "step": 43750 }, { "entropy": 5.778425455093384, "epoch": 3.4042793230888932, "grad_norm": 1.3984375, "learning_rate": 0.0003863106000035191, "loss": 4.9505, "mean_token_accuracy": 0.21483632326126098, "num_tokens": 75886730.0, "step": 43755 }, { "entropy": 5.815909767150879, "epoch": 3.404668352460611, "grad_norm": 1.265625, "learning_rate": 0.0003862865127622175, "loss": 4.9843, "mean_token_accuracy": 0.20829276293516158, "num_tokens": 75895389.0, "step": 43760 }, { "entropy": 5.876795053482056, "epoch": 3.405057381832328, "grad_norm": 1.2734375, "learning_rate": 0.0003862624238323201, "loss": 4.9838, "mean_token_accuracy": 0.20841635167598724, "num_tokens": 75904177.0, "step": 43765 }, { "entropy": 5.826126766204834, "epoch": 3.405446411204046, "grad_norm": 1.4375, "learning_rate": 0.0003862383332141927, "loss": 4.9721, "mean_token_accuracy": 0.20877449363470077, "num_tokens": 75913150.0, "step": 43770 }, { "entropy": 5.831707000732422, "epoch": 3.4058354405757636, "grad_norm": 1.265625, "learning_rate": 0.0003862142409082006, "loss": 4.9794, "mean_token_accuracy": 0.20937421321868896, "num_tokens": 75921801.0, "step": 43775 }, { "entropy": 5.812568235397339, "epoch": 3.406224469947481, "grad_norm": 1.296875, "learning_rate": 0.0003861901469147093, "loss": 4.9943, "mean_token_accuracy": 0.2069947674870491, "num_tokens": 75930261.0, "step": 43780 }, { "entropy": 5.8466959476470945, "epoch": 3.4066134993191985, "grad_norm": 1.34375, "learning_rate": 0.00038616605123408464, "loss": 5.0237, "mean_token_accuracy": 0.20563859790563582, "num_tokens": 75938168.0, "step": 43785 }, { "entropy": 5.800450944900513, "epoch": 3.4070025286909162, "grad_norm": 1.3203125, "learning_rate": 0.00038614195386669207, "loss": 4.9802, "mean_token_accuracy": 0.20323264300823213, "num_tokens": 75947095.0, "step": 43790 }, { "entropy": 5.708704042434692, "epoch": 3.407391558062634, "grad_norm": 1.3671875, "learning_rate": 0.0003861178548128972, "loss": 4.8204, "mean_token_accuracy": 0.22108725011348723, "num_tokens": 75955546.0, "step": 43795 }, { "entropy": 5.74482741355896, "epoch": 3.407780587434351, "grad_norm": 1.28125, "learning_rate": 0.00038609375407306566, "loss": 5.0345, "mean_token_accuracy": 0.20377250462770463, "num_tokens": 75964434.0, "step": 43800 }, { "entropy": 5.834991407394409, "epoch": 3.408169616806069, "grad_norm": 1.2734375, "learning_rate": 0.00038606965164756334, "loss": 4.9317, "mean_token_accuracy": 0.20649501085281372, "num_tokens": 75972657.0, "step": 43805 }, { "entropy": 5.867269802093506, "epoch": 3.4085586461777866, "grad_norm": 1.203125, "learning_rate": 0.00038604554753675585, "loss": 4.9892, "mean_token_accuracy": 0.2048252433538437, "num_tokens": 75981488.0, "step": 43810 }, { "entropy": 5.820777320861817, "epoch": 3.408947675549504, "grad_norm": 1.34375, "learning_rate": 0.0003860214417410089, "loss": 4.943, "mean_token_accuracy": 0.21125797033309937, "num_tokens": 75989901.0, "step": 43815 }, { "entropy": 5.823960685729981, "epoch": 3.4093367049212215, "grad_norm": 1.2890625, "learning_rate": 0.00038599733426068826, "loss": 4.9809, "mean_token_accuracy": 0.2114304259419441, "num_tokens": 75999248.0, "step": 43820 }, { "entropy": 5.798661184310913, "epoch": 3.4097257342929392, "grad_norm": 1.375, "learning_rate": 0.00038597322509615977, "loss": 4.9621, "mean_token_accuracy": 0.2157400667667389, "num_tokens": 76007635.0, "step": 43825 }, { "entropy": 5.797388315200806, "epoch": 3.4101147636646565, "grad_norm": 1.265625, "learning_rate": 0.00038594911424778925, "loss": 4.9296, "mean_token_accuracy": 0.21505948901176453, "num_tokens": 76016135.0, "step": 43830 }, { "entropy": 5.738279581069946, "epoch": 3.410503793036374, "grad_norm": 1.328125, "learning_rate": 0.00038592500171594245, "loss": 4.8321, "mean_token_accuracy": 0.22323838770389556, "num_tokens": 76024934.0, "step": 43835 }, { "entropy": 5.7914186954498295, "epoch": 3.410892822408092, "grad_norm": 1.21875, "learning_rate": 0.00038590088750098536, "loss": 4.9901, "mean_token_accuracy": 0.21057940870523453, "num_tokens": 76034242.0, "step": 43840 }, { "entropy": 5.734814834594727, "epoch": 3.411281851779809, "grad_norm": 1.3828125, "learning_rate": 0.00038587677160328377, "loss": 4.9225, "mean_token_accuracy": 0.21776286661624908, "num_tokens": 76043352.0, "step": 43845 }, { "entropy": 5.782661199569702, "epoch": 3.411670881151527, "grad_norm": 1.3203125, "learning_rate": 0.0003858526540232037, "loss": 4.9064, "mean_token_accuracy": 0.21871993392705918, "num_tokens": 76051890.0, "step": 43850 }, { "entropy": 5.753050851821899, "epoch": 3.4120599105232445, "grad_norm": 1.3515625, "learning_rate": 0.00038582853476111094, "loss": 4.9876, "mean_token_accuracy": 0.2132248669862747, "num_tokens": 76061325.0, "step": 43855 }, { "entropy": 5.779659128189087, "epoch": 3.4124489398949622, "grad_norm": 1.3203125, "learning_rate": 0.0003858044138173717, "loss": 4.9766, "mean_token_accuracy": 0.20771912783384322, "num_tokens": 76070337.0, "step": 43860 }, { "entropy": 5.847348594665528, "epoch": 3.4128379692666795, "grad_norm": 1.3359375, "learning_rate": 0.00038578029119235176, "loss": 4.9882, "mean_token_accuracy": 0.2039801672101021, "num_tokens": 76078745.0, "step": 43865 }, { "entropy": 5.858489656448365, "epoch": 3.413226998638397, "grad_norm": 1.3046875, "learning_rate": 0.00038575616688641724, "loss": 4.984, "mean_token_accuracy": 0.2068471074104309, "num_tokens": 76086253.0, "step": 43870 }, { "entropy": 5.742902517318726, "epoch": 3.413616028010115, "grad_norm": 1.2421875, "learning_rate": 0.0003857320408999342, "loss": 4.8874, "mean_token_accuracy": 0.22225331515073776, "num_tokens": 76094902.0, "step": 43875 }, { "entropy": 5.8470234870910645, "epoch": 3.414005057381832, "grad_norm": 1.3203125, "learning_rate": 0.0003857079132332687, "loss": 5.0586, "mean_token_accuracy": 0.20211324244737625, "num_tokens": 76103341.0, "step": 43880 }, { "entropy": 5.769184160232544, "epoch": 3.41439408675355, "grad_norm": 1.328125, "learning_rate": 0.00038568378388678675, "loss": 4.8751, "mean_token_accuracy": 0.2213097870349884, "num_tokens": 76111286.0, "step": 43885 }, { "entropy": 5.769033145904541, "epoch": 3.4147831161252675, "grad_norm": 1.3125, "learning_rate": 0.0003856596528608546, "loss": 4.9656, "mean_token_accuracy": 0.20674742460250856, "num_tokens": 76120022.0, "step": 43890 }, { "entropy": 5.756644821166992, "epoch": 3.4151721454969852, "grad_norm": 1.4609375, "learning_rate": 0.0003856355201558384, "loss": 4.8774, "mean_token_accuracy": 0.21620626896619796, "num_tokens": 76128225.0, "step": 43895 }, { "entropy": 5.8343840599060055, "epoch": 3.4155611748687025, "grad_norm": 1.3515625, "learning_rate": 0.00038561138577210426, "loss": 4.9456, "mean_token_accuracy": 0.21019227504730226, "num_tokens": 76136521.0, "step": 43900 }, { "entropy": 5.909796667098999, "epoch": 3.41595020424042, "grad_norm": 1.3359375, "learning_rate": 0.00038558724971001835, "loss": 4.9675, "mean_token_accuracy": 0.21115416884422303, "num_tokens": 76145206.0, "step": 43905 }, { "entropy": 5.827983808517456, "epoch": 3.416339233612138, "grad_norm": 1.2578125, "learning_rate": 0.000385563111969947, "loss": 4.9978, "mean_token_accuracy": 0.20574368834495543, "num_tokens": 76154617.0, "step": 43910 }, { "entropy": 5.78784761428833, "epoch": 3.416728262983855, "grad_norm": 1.2890625, "learning_rate": 0.00038553897255225633, "loss": 4.9918, "mean_token_accuracy": 0.20978382229804993, "num_tokens": 76163403.0, "step": 43915 }, { "entropy": 5.854395627975464, "epoch": 3.417117292355573, "grad_norm": 1.484375, "learning_rate": 0.00038551483145731277, "loss": 5.0518, "mean_token_accuracy": 0.20514819622039795, "num_tokens": 76171919.0, "step": 43920 }, { "entropy": 5.824197626113891, "epoch": 3.4175063217272905, "grad_norm": 1.2890625, "learning_rate": 0.0003854906886854825, "loss": 4.9317, "mean_token_accuracy": 0.20727615803480148, "num_tokens": 76180295.0, "step": 43925 }, { "entropy": 5.75875449180603, "epoch": 3.417895351099008, "grad_norm": 1.3515625, "learning_rate": 0.00038546654423713187, "loss": 4.9033, "mean_token_accuracy": 0.2146226942539215, "num_tokens": 76188853.0, "step": 43930 }, { "entropy": 5.734459161758423, "epoch": 3.4182843804707255, "grad_norm": 1.3671875, "learning_rate": 0.0003854423981126273, "loss": 4.9595, "mean_token_accuracy": 0.20724107325077057, "num_tokens": 76196557.0, "step": 43935 }, { "entropy": 5.78241229057312, "epoch": 3.418673409842443, "grad_norm": 1.2890625, "learning_rate": 0.0003854182503123351, "loss": 4.996, "mean_token_accuracy": 0.20995033234357835, "num_tokens": 76205653.0, "step": 43940 }, { "entropy": 5.781963777542114, "epoch": 3.4190624392141604, "grad_norm": 1.3046875, "learning_rate": 0.00038539410083662166, "loss": 4.8824, "mean_token_accuracy": 0.21272823065519333, "num_tokens": 76213713.0, "step": 43945 }, { "entropy": 5.811822462081909, "epoch": 3.419451468585878, "grad_norm": 1.34375, "learning_rate": 0.00038536994968585355, "loss": 5.0034, "mean_token_accuracy": 0.20943650007247924, "num_tokens": 76222088.0, "step": 43950 }, { "entropy": 5.79152479171753, "epoch": 3.419840497957596, "grad_norm": 1.3359375, "learning_rate": 0.00038534579686039705, "loss": 4.9039, "mean_token_accuracy": 0.21332916468381882, "num_tokens": 76231028.0, "step": 43955 }, { "entropy": 5.852616500854492, "epoch": 3.4202295273293135, "grad_norm": 1.3828125, "learning_rate": 0.00038532164236061874, "loss": 5.0444, "mean_token_accuracy": 0.21388441622257232, "num_tokens": 76239961.0, "step": 43960 }, { "entropy": 5.838753080368042, "epoch": 3.4206185567010308, "grad_norm": 1.3203125, "learning_rate": 0.000385297486186885, "loss": 5.0005, "mean_token_accuracy": 0.20876551419496536, "num_tokens": 76248495.0, "step": 43965 }, { "entropy": 5.786052417755127, "epoch": 3.4210075860727485, "grad_norm": 1.3359375, "learning_rate": 0.0003852733283395626, "loss": 4.9216, "mean_token_accuracy": 0.21540594100952148, "num_tokens": 76257075.0, "step": 43970 }, { "entropy": 5.752816915512085, "epoch": 3.421396615444466, "grad_norm": 1.328125, "learning_rate": 0.000385249168819018, "loss": 4.8686, "mean_token_accuracy": 0.21494379192590712, "num_tokens": 76265429.0, "step": 43975 }, { "entropy": 5.842991924285888, "epoch": 3.4217856448161834, "grad_norm": 1.34375, "learning_rate": 0.0003852250076256177, "loss": 5.0192, "mean_token_accuracy": 0.20217147171497346, "num_tokens": 76273813.0, "step": 43980 }, { "entropy": 5.736404752731323, "epoch": 3.422174674187901, "grad_norm": 1.40625, "learning_rate": 0.0003852008447597283, "loss": 4.8792, "mean_token_accuracy": 0.21831849813461304, "num_tokens": 76282425.0, "step": 43985 }, { "entropy": 5.795290613174439, "epoch": 3.422563703559619, "grad_norm": 1.34375, "learning_rate": 0.00038517668022171656, "loss": 5.0148, "mean_token_accuracy": 0.20497841984033585, "num_tokens": 76290884.0, "step": 43990 }, { "entropy": 5.814934396743775, "epoch": 3.4229527329313365, "grad_norm": 1.4609375, "learning_rate": 0.0003851525140119489, "loss": 5.0002, "mean_token_accuracy": 0.2025263398885727, "num_tokens": 76300377.0, "step": 43995 }, { "entropy": 5.787289571762085, "epoch": 3.4233417623030538, "grad_norm": 1.28125, "learning_rate": 0.00038512834613079226, "loss": 4.9785, "mean_token_accuracy": 0.20442370027303697, "num_tokens": 76308728.0, "step": 44000 }, { "entropy": 5.746721458435059, "epoch": 3.4237307916747715, "grad_norm": 1.234375, "learning_rate": 0.0003851041765786133, "loss": 4.9231, "mean_token_accuracy": 0.21452730745077134, "num_tokens": 76317259.0, "step": 44005 }, { "entropy": 5.770110654830932, "epoch": 3.424119821046489, "grad_norm": 1.4296875, "learning_rate": 0.00038508000535577864, "loss": 4.9513, "mean_token_accuracy": 0.21386731863021852, "num_tokens": 76325774.0, "step": 44010 }, { "entropy": 5.75904107093811, "epoch": 3.4245088504182064, "grad_norm": 1.34375, "learning_rate": 0.0003850558324626552, "loss": 4.9111, "mean_token_accuracy": 0.21252703964710234, "num_tokens": 76333875.0, "step": 44015 }, { "entropy": 5.792487621307373, "epoch": 3.424897879789924, "grad_norm": 1.265625, "learning_rate": 0.0003850316578996096, "loss": 4.9337, "mean_token_accuracy": 0.21473785638809204, "num_tokens": 76343598.0, "step": 44020 }, { "entropy": 5.764108657836914, "epoch": 3.425286909161642, "grad_norm": 1.28125, "learning_rate": 0.0003850074816670087, "loss": 4.8873, "mean_token_accuracy": 0.2128181591629982, "num_tokens": 76351436.0, "step": 44025 }, { "entropy": 5.778263807296753, "epoch": 3.4256759385333595, "grad_norm": 1.34375, "learning_rate": 0.00038498330376521945, "loss": 4.89, "mean_token_accuracy": 0.2126704692840576, "num_tokens": 76359992.0, "step": 44030 }, { "entropy": 5.805085563659668, "epoch": 3.4260649679050768, "grad_norm": 1.3671875, "learning_rate": 0.0003849591241946085, "loss": 4.9571, "mean_token_accuracy": 0.2104354113340378, "num_tokens": 76368066.0, "step": 44035 }, { "entropy": 5.715711641311645, "epoch": 3.4264539972767944, "grad_norm": 1.40625, "learning_rate": 0.000384934942955543, "loss": 4.9188, "mean_token_accuracy": 0.22145914435386657, "num_tokens": 76376462.0, "step": 44040 }, { "entropy": 5.813705253601074, "epoch": 3.426843026648512, "grad_norm": 1.453125, "learning_rate": 0.00038491076004838965, "loss": 4.9344, "mean_token_accuracy": 0.21307809054851531, "num_tokens": 76385420.0, "step": 44045 }, { "entropy": 5.808110761642456, "epoch": 3.4272320560202294, "grad_norm": 1.375, "learning_rate": 0.00038488657547351544, "loss": 4.9046, "mean_token_accuracy": 0.2159888356924057, "num_tokens": 76393636.0, "step": 44050 }, { "entropy": 5.692878484725952, "epoch": 3.427621085391947, "grad_norm": 1.28125, "learning_rate": 0.0003848623892312874, "loss": 4.9018, "mean_token_accuracy": 0.21461812406778336, "num_tokens": 76401879.0, "step": 44055 }, { "entropy": 5.735193729400635, "epoch": 3.428010114763665, "grad_norm": 1.34375, "learning_rate": 0.0003848382013220725, "loss": 4.9358, "mean_token_accuracy": 0.21041683852672577, "num_tokens": 76410316.0, "step": 44060 }, { "entropy": 5.762240028381347, "epoch": 3.428399144135382, "grad_norm": 1.359375, "learning_rate": 0.0003848140117462376, "loss": 4.8274, "mean_token_accuracy": 0.21778357177972793, "num_tokens": 76418623.0, "step": 44065 }, { "entropy": 5.739213180541992, "epoch": 3.4287881735070997, "grad_norm": 1.3203125, "learning_rate": 0.0003847898205041499, "loss": 4.9487, "mean_token_accuracy": 0.21151988208293915, "num_tokens": 76426890.0, "step": 44070 }, { "entropy": 5.806094551086426, "epoch": 3.4291772028788174, "grad_norm": 1.2265625, "learning_rate": 0.00038476562759617644, "loss": 4.9788, "mean_token_accuracy": 0.20648994892835618, "num_tokens": 76435728.0, "step": 44075 }, { "entropy": 5.779249954223633, "epoch": 3.4295662322505347, "grad_norm": 1.2578125, "learning_rate": 0.00038474143302268425, "loss": 4.9667, "mean_token_accuracy": 0.20930425971746444, "num_tokens": 76444381.0, "step": 44080 }, { "entropy": 5.7651347637176515, "epoch": 3.4299552616222524, "grad_norm": 1.2109375, "learning_rate": 0.0003847172367840406, "loss": 4.922, "mean_token_accuracy": 0.21533828377723693, "num_tokens": 76452812.0, "step": 44085 }, { "entropy": 5.695934104919433, "epoch": 3.43034429099397, "grad_norm": 1.3359375, "learning_rate": 0.0003846930388806124, "loss": 4.8477, "mean_token_accuracy": 0.214813894033432, "num_tokens": 76461650.0, "step": 44090 }, { "entropy": 5.795609331130981, "epoch": 3.430733320365688, "grad_norm": 1.3203125, "learning_rate": 0.00038466883931276703, "loss": 4.9483, "mean_token_accuracy": 0.20852570980787277, "num_tokens": 76470868.0, "step": 44095 }, { "entropy": 5.888917303085327, "epoch": 3.431122349737405, "grad_norm": 1.2734375, "learning_rate": 0.00038464463808087146, "loss": 5.0003, "mean_token_accuracy": 0.21069361567497252, "num_tokens": 76479027.0, "step": 44100 }, { "entropy": 5.781145238876343, "epoch": 3.4315113791091227, "grad_norm": 1.3125, "learning_rate": 0.0003846204351852931, "loss": 4.8975, "mean_token_accuracy": 0.21569590866565705, "num_tokens": 76487745.0, "step": 44105 }, { "entropy": 5.8028566360473635, "epoch": 3.4319004084808404, "grad_norm": 1.3671875, "learning_rate": 0.00038459623062639907, "loss": 5.044, "mean_token_accuracy": 0.20022841095924376, "num_tokens": 76496298.0, "step": 44110 }, { "entropy": 5.823739290237427, "epoch": 3.4322894378525577, "grad_norm": 1.2109375, "learning_rate": 0.00038457202440455673, "loss": 4.9424, "mean_token_accuracy": 0.2100173130631447, "num_tokens": 76505041.0, "step": 44115 }, { "entropy": 5.862679672241211, "epoch": 3.4326784672242754, "grad_norm": 1.328125, "learning_rate": 0.0003845478165201333, "loss": 5.0342, "mean_token_accuracy": 0.199405337870121, "num_tokens": 76513265.0, "step": 44120 }, { "entropy": 5.815752553939819, "epoch": 3.433067496595993, "grad_norm": 1.296875, "learning_rate": 0.00038452360697349615, "loss": 4.9348, "mean_token_accuracy": 0.21243662685155867, "num_tokens": 76522084.0, "step": 44125 }, { "entropy": 5.79075927734375, "epoch": 3.433456525967711, "grad_norm": 1.3125, "learning_rate": 0.0003844993957650125, "loss": 4.9819, "mean_token_accuracy": 0.21269137412309647, "num_tokens": 76529931.0, "step": 44130 }, { "entropy": 5.856421089172363, "epoch": 3.433845555339428, "grad_norm": 1.3984375, "learning_rate": 0.0003844751828950499, "loss": 5.0171, "mean_token_accuracy": 0.19944206923246383, "num_tokens": 76538431.0, "step": 44135 }, { "entropy": 5.804907751083374, "epoch": 3.4342345847111457, "grad_norm": 1.3125, "learning_rate": 0.00038445096836397564, "loss": 5.0942, "mean_token_accuracy": 0.2018522709608078, "num_tokens": 76547124.0, "step": 44140 }, { "entropy": 5.748795032501221, "epoch": 3.4346236140828634, "grad_norm": 1.2734375, "learning_rate": 0.00038442675217215713, "loss": 4.8833, "mean_token_accuracy": 0.21910492330789566, "num_tokens": 76555812.0, "step": 44145 }, { "entropy": 5.874452733993531, "epoch": 3.4350126434545807, "grad_norm": 1.265625, "learning_rate": 0.00038440253431996175, "loss": 5.0478, "mean_token_accuracy": 0.20251107662916185, "num_tokens": 76564607.0, "step": 44150 }, { "entropy": 5.70741024017334, "epoch": 3.4354016728262984, "grad_norm": 1.3203125, "learning_rate": 0.00038437831480775717, "loss": 4.8257, "mean_token_accuracy": 0.21325997710227967, "num_tokens": 76573482.0, "step": 44155 }, { "entropy": 5.757980680465698, "epoch": 3.435790702198016, "grad_norm": 1.2421875, "learning_rate": 0.00038435409363591066, "loss": 4.9048, "mean_token_accuracy": 0.21582754254341124, "num_tokens": 76582816.0, "step": 44160 }, { "entropy": 5.747077512741089, "epoch": 3.4361797315697333, "grad_norm": 1.2734375, "learning_rate": 0.00038432987080478986, "loss": 4.8648, "mean_token_accuracy": 0.22242543399333953, "num_tokens": 76591398.0, "step": 44165 }, { "entropy": 5.812362003326416, "epoch": 3.436568760941451, "grad_norm": 1.28125, "learning_rate": 0.0003843056463147623, "loss": 4.916, "mean_token_accuracy": 0.21590739339590073, "num_tokens": 76600308.0, "step": 44170 }, { "entropy": 5.840604782104492, "epoch": 3.4369577903131687, "grad_norm": 1.5, "learning_rate": 0.00038428142016619555, "loss": 4.9451, "mean_token_accuracy": 0.21056755632162094, "num_tokens": 76608381.0, "step": 44175 }, { "entropy": 5.747580575942993, "epoch": 3.437346819684886, "grad_norm": 1.3046875, "learning_rate": 0.0003842571923594572, "loss": 4.8682, "mean_token_accuracy": 0.2201557293534279, "num_tokens": 76616909.0, "step": 44180 }, { "entropy": 5.779032230377197, "epoch": 3.4377358490566037, "grad_norm": 1.40625, "learning_rate": 0.00038423296289491477, "loss": 4.9203, "mean_token_accuracy": 0.21385540813207626, "num_tokens": 76625414.0, "step": 44185 }, { "entropy": 5.7763725280761715, "epoch": 3.4381248784283214, "grad_norm": 1.3125, "learning_rate": 0.00038420873177293606, "loss": 4.9668, "mean_token_accuracy": 0.21221420913934708, "num_tokens": 76634081.0, "step": 44190 }, { "entropy": 5.8521315574646, "epoch": 3.438513907800039, "grad_norm": 1.3828125, "learning_rate": 0.0003841844989938886, "loss": 4.9731, "mean_token_accuracy": 0.21607901751995087, "num_tokens": 76643054.0, "step": 44195 }, { "entropy": 5.909198760986328, "epoch": 3.4389029371717563, "grad_norm": 1.40625, "learning_rate": 0.0003841602645581402, "loss": 5.0752, "mean_token_accuracy": 0.20387353152036666, "num_tokens": 76651465.0, "step": 44200 }, { "entropy": 5.819275903701782, "epoch": 3.439291966543474, "grad_norm": 1.3125, "learning_rate": 0.00038413602846605854, "loss": 4.9535, "mean_token_accuracy": 0.2122614338994026, "num_tokens": 76660371.0, "step": 44205 }, { "entropy": 5.745811653137207, "epoch": 3.4396809959151917, "grad_norm": 1.2734375, "learning_rate": 0.0003841117907180114, "loss": 4.9354, "mean_token_accuracy": 0.22047587037086486, "num_tokens": 76668969.0, "step": 44210 }, { "entropy": 5.8007739067077635, "epoch": 3.440070025286909, "grad_norm": 1.265625, "learning_rate": 0.00038408755131436647, "loss": 4.9817, "mean_token_accuracy": 0.21058215200901031, "num_tokens": 76677096.0, "step": 44215 }, { "entropy": 5.861566209793091, "epoch": 3.4404590546586267, "grad_norm": 1.359375, "learning_rate": 0.00038406331025549157, "loss": 5.048, "mean_token_accuracy": 0.20430290848016738, "num_tokens": 76685761.0, "step": 44220 }, { "entropy": 5.8328831672668455, "epoch": 3.4408480840303444, "grad_norm": 1.3515625, "learning_rate": 0.0003840390675417545, "loss": 4.9429, "mean_token_accuracy": 0.2104451537132263, "num_tokens": 76694606.0, "step": 44225 }, { "entropy": 5.767729187011719, "epoch": 3.441237113402062, "grad_norm": 1.3125, "learning_rate": 0.0003840148231735231, "loss": 4.8645, "mean_token_accuracy": 0.21345752775669097, "num_tokens": 76702814.0, "step": 44230 }, { "entropy": 5.733599996566772, "epoch": 3.4416261427737793, "grad_norm": 1.375, "learning_rate": 0.00038399057715116536, "loss": 4.8412, "mean_token_accuracy": 0.22345227003097534, "num_tokens": 76711182.0, "step": 44235 }, { "entropy": 5.821080255508423, "epoch": 3.442015172145497, "grad_norm": 1.3125, "learning_rate": 0.00038396632947504904, "loss": 5.0453, "mean_token_accuracy": 0.20831616818904877, "num_tokens": 76720198.0, "step": 44240 }, { "entropy": 5.835020446777344, "epoch": 3.4424042015172147, "grad_norm": 1.2890625, "learning_rate": 0.0003839420801455422, "loss": 4.8991, "mean_token_accuracy": 0.21948946863412858, "num_tokens": 76728195.0, "step": 44245 }, { "entropy": 5.821912384033203, "epoch": 3.442793230888932, "grad_norm": 1.2578125, "learning_rate": 0.0003839178291630126, "loss": 4.9166, "mean_token_accuracy": 0.2109248787164688, "num_tokens": 76736921.0, "step": 44250 }, { "entropy": 5.7910377979278564, "epoch": 3.4431822602606497, "grad_norm": 1.28125, "learning_rate": 0.00038389357652782836, "loss": 4.9668, "mean_token_accuracy": 0.20408324748277665, "num_tokens": 76745326.0, "step": 44255 }, { "entropy": 5.70452880859375, "epoch": 3.4435712896323674, "grad_norm": 1.3203125, "learning_rate": 0.00038386932224035734, "loss": 4.8819, "mean_token_accuracy": 0.218246129155159, "num_tokens": 76753795.0, "step": 44260 }, { "entropy": 5.756911182403565, "epoch": 3.443960319004085, "grad_norm": 1.2578125, "learning_rate": 0.00038384506630096765, "loss": 4.8623, "mean_token_accuracy": 0.2205243691802025, "num_tokens": 76762466.0, "step": 44265 }, { "entropy": 5.773748779296875, "epoch": 3.4443493483758023, "grad_norm": 1.4296875, "learning_rate": 0.0003838208087100274, "loss": 4.9579, "mean_token_accuracy": 0.21056657731533052, "num_tokens": 76770753.0, "step": 44270 }, { "entropy": 5.814641380310059, "epoch": 3.44473837774752, "grad_norm": 1.3359375, "learning_rate": 0.0003837965494679045, "loss": 5.042, "mean_token_accuracy": 0.2045855239033699, "num_tokens": 76779328.0, "step": 44275 }, { "entropy": 5.859599351882935, "epoch": 3.4451274071192373, "grad_norm": 1.1875, "learning_rate": 0.0003837722885749672, "loss": 5.0394, "mean_token_accuracy": 0.20345864593982696, "num_tokens": 76788588.0, "step": 44280 }, { "entropy": 5.815992212295532, "epoch": 3.445516436490955, "grad_norm": 1.3828125, "learning_rate": 0.0003837480260315835, "loss": 4.8583, "mean_token_accuracy": 0.21789378374814988, "num_tokens": 76796452.0, "step": 44285 }, { "entropy": 5.738669776916504, "epoch": 3.4459054658626727, "grad_norm": 1.3203125, "learning_rate": 0.00038372376183812165, "loss": 4.8832, "mean_token_accuracy": 0.21622634977102279, "num_tokens": 76804773.0, "step": 44290 }, { "entropy": 5.796259117126465, "epoch": 3.4462944952343904, "grad_norm": 1.3359375, "learning_rate": 0.0003836994959949497, "loss": 4.9728, "mean_token_accuracy": 0.20387348532676697, "num_tokens": 76813077.0, "step": 44295 }, { "entropy": 5.796672630310058, "epoch": 3.4466835246061076, "grad_norm": 1.3203125, "learning_rate": 0.00038367522850243593, "loss": 4.9646, "mean_token_accuracy": 0.2122795417904854, "num_tokens": 76821148.0, "step": 44300 }, { "entropy": 5.791253757476807, "epoch": 3.4470725539778253, "grad_norm": 1.2265625, "learning_rate": 0.00038365095936094857, "loss": 4.9579, "mean_token_accuracy": 0.2096623808145523, "num_tokens": 76830494.0, "step": 44305 }, { "entropy": 5.903387928009034, "epoch": 3.447461583349543, "grad_norm": 1.3046875, "learning_rate": 0.0003836266885708558, "loss": 4.9881, "mean_token_accuracy": 0.2095757320523262, "num_tokens": 76838597.0, "step": 44310 }, { "entropy": 5.865663385391235, "epoch": 3.4478506127212603, "grad_norm": 1.359375, "learning_rate": 0.00038360241613252593, "loss": 5.0357, "mean_token_accuracy": 0.20870259404182434, "num_tokens": 76846427.0, "step": 44315 }, { "entropy": 5.882029104232788, "epoch": 3.448239642092978, "grad_norm": 1.3203125, "learning_rate": 0.0003835781420463273, "loss": 5.0711, "mean_token_accuracy": 0.20079626888036728, "num_tokens": 76855275.0, "step": 44320 }, { "entropy": 5.775842809677124, "epoch": 3.4486286714646956, "grad_norm": 1.484375, "learning_rate": 0.0003835538663126282, "loss": 4.916, "mean_token_accuracy": 0.21536944508552552, "num_tokens": 76863315.0, "step": 44325 }, { "entropy": 5.749256277084351, "epoch": 3.4490177008364133, "grad_norm": 1.3515625, "learning_rate": 0.0003835295889317969, "loss": 4.8617, "mean_token_accuracy": 0.22435604631900788, "num_tokens": 76871532.0, "step": 44330 }, { "entropy": 5.791563415527344, "epoch": 3.4494067302081306, "grad_norm": 1.25, "learning_rate": 0.00038350530990420177, "loss": 4.9142, "mean_token_accuracy": 0.22398627251386644, "num_tokens": 76880235.0, "step": 44335 }, { "entropy": 5.845034790039063, "epoch": 3.4497957595798483, "grad_norm": 1.4140625, "learning_rate": 0.0003834810292302114, "loss": 4.9622, "mean_token_accuracy": 0.2070550188422203, "num_tokens": 76888518.0, "step": 44340 }, { "entropy": 5.769588804244995, "epoch": 3.450184788951566, "grad_norm": 1.3046875, "learning_rate": 0.000383456746910194, "loss": 4.9017, "mean_token_accuracy": 0.21496809273958206, "num_tokens": 76897294.0, "step": 44345 }, { "entropy": 5.7947005271911625, "epoch": 3.4505738183232832, "grad_norm": 1.21875, "learning_rate": 0.0003834324629445182, "loss": 5.057, "mean_token_accuracy": 0.20971240550279618, "num_tokens": 76906321.0, "step": 44350 }, { "entropy": 5.821798419952392, "epoch": 3.450962847695001, "grad_norm": 1.28125, "learning_rate": 0.0003834081773335522, "loss": 4.8579, "mean_token_accuracy": 0.21301292777061462, "num_tokens": 76914967.0, "step": 44355 }, { "entropy": 5.872678422927857, "epoch": 3.4513518770667186, "grad_norm": 1.421875, "learning_rate": 0.00038338389007766473, "loss": 4.9643, "mean_token_accuracy": 0.20938342660665513, "num_tokens": 76923983.0, "step": 44360 }, { "entropy": 5.754303312301635, "epoch": 3.4517409064384363, "grad_norm": 1.25, "learning_rate": 0.0003833596011772242, "loss": 4.9444, "mean_token_accuracy": 0.2105577141046524, "num_tokens": 76932749.0, "step": 44365 }, { "entropy": 5.767071485519409, "epoch": 3.4521299358101536, "grad_norm": 1.25, "learning_rate": 0.0003833353106325993, "loss": 4.923, "mean_token_accuracy": 0.21365894079208375, "num_tokens": 76943077.0, "step": 44370 }, { "entropy": 5.831573724746704, "epoch": 3.4525189651818713, "grad_norm": 1.3125, "learning_rate": 0.0003833110184441584, "loss": 4.895, "mean_token_accuracy": 0.21671973317861556, "num_tokens": 76951895.0, "step": 44375 }, { "entropy": 5.806667900085449, "epoch": 3.452907994553589, "grad_norm": 1.3125, "learning_rate": 0.00038328672461227024, "loss": 4.9764, "mean_token_accuracy": 0.2082356631755829, "num_tokens": 76961605.0, "step": 44380 }, { "entropy": 5.754713296890259, "epoch": 3.4532970239253062, "grad_norm": 1.421875, "learning_rate": 0.0003832624291373034, "loss": 4.9059, "mean_token_accuracy": 0.2128053665161133, "num_tokens": 76971262.0, "step": 44385 }, { "entropy": 5.750529718399048, "epoch": 3.453686053297024, "grad_norm": 1.296875, "learning_rate": 0.00038323813201962645, "loss": 4.8414, "mean_token_accuracy": 0.22074589878320694, "num_tokens": 76979411.0, "step": 44390 }, { "entropy": 5.792137336730957, "epoch": 3.4540750826687416, "grad_norm": 1.34375, "learning_rate": 0.00038321383325960816, "loss": 5.0165, "mean_token_accuracy": 0.2003355875611305, "num_tokens": 76987957.0, "step": 44395 }, { "entropy": 5.795413684844971, "epoch": 3.454464112040459, "grad_norm": 1.25, "learning_rate": 0.0003831895328576172, "loss": 4.899, "mean_token_accuracy": 0.20986563414335252, "num_tokens": 76996355.0, "step": 44400 }, { "entropy": 5.799166584014893, "epoch": 3.4548531414121766, "grad_norm": 1.3203125, "learning_rate": 0.0003831652308140223, "loss": 4.9642, "mean_token_accuracy": 0.20917538106441497, "num_tokens": 77004795.0, "step": 44405 }, { "entropy": 5.846941232681274, "epoch": 3.4552421707838943, "grad_norm": 1.34375, "learning_rate": 0.0003831409271291921, "loss": 4.959, "mean_token_accuracy": 0.2070248991250992, "num_tokens": 77013617.0, "step": 44410 }, { "entropy": 5.738839149475098, "epoch": 3.4556312001556115, "grad_norm": 1.4453125, "learning_rate": 0.00038311662180349554, "loss": 4.881, "mean_token_accuracy": 0.21584440469741822, "num_tokens": 77022144.0, "step": 44415 }, { "entropy": 5.763363552093506, "epoch": 3.4560202295273292, "grad_norm": 1.484375, "learning_rate": 0.00038309231483730133, "loss": 4.836, "mean_token_accuracy": 0.22297521382570268, "num_tokens": 77030079.0, "step": 44420 }, { "entropy": 5.804884195327759, "epoch": 3.456409258899047, "grad_norm": 1.390625, "learning_rate": 0.0003830680062309782, "loss": 4.994, "mean_token_accuracy": 0.20454201251268386, "num_tokens": 77038551.0, "step": 44425 }, { "entropy": 5.790785455703736, "epoch": 3.4567982882707646, "grad_norm": 1.2109375, "learning_rate": 0.00038304369598489516, "loss": 4.9694, "mean_token_accuracy": 0.2085963547229767, "num_tokens": 77047113.0, "step": 44430 }, { "entropy": 5.8198432445526125, "epoch": 3.457187317642482, "grad_norm": 1.2421875, "learning_rate": 0.000383019384099421, "loss": 4.9635, "mean_token_accuracy": 0.20834286212921144, "num_tokens": 77055789.0, "step": 44435 }, { "entropy": 5.838001680374146, "epoch": 3.4575763470141996, "grad_norm": 1.40625, "learning_rate": 0.0003829950705749246, "loss": 4.9118, "mean_token_accuracy": 0.22010788321495056, "num_tokens": 77064065.0, "step": 44440 }, { "entropy": 5.757308006286621, "epoch": 3.4579653763859173, "grad_norm": 1.28125, "learning_rate": 0.00038297075541177496, "loss": 4.9072, "mean_token_accuracy": 0.2182082548737526, "num_tokens": 77072927.0, "step": 44445 }, { "entropy": 5.8023107051849365, "epoch": 3.4583544057576345, "grad_norm": 1.3046875, "learning_rate": 0.00038294643861034087, "loss": 4.9051, "mean_token_accuracy": 0.21366448402404786, "num_tokens": 77081384.0, "step": 44450 }, { "entropy": 5.849637985229492, "epoch": 3.4587434351293522, "grad_norm": 1.2578125, "learning_rate": 0.0003829221201709914, "loss": 4.9812, "mean_token_accuracy": 0.20686790049076081, "num_tokens": 77089642.0, "step": 44455 }, { "entropy": 5.798729133605957, "epoch": 3.45913246450107, "grad_norm": 1.28125, "learning_rate": 0.0003828978000940955, "loss": 4.9614, "mean_token_accuracy": 0.19910217374563216, "num_tokens": 77098218.0, "step": 44460 }, { "entropy": 5.778178882598877, "epoch": 3.4595214938727876, "grad_norm": 1.3046875, "learning_rate": 0.0003828734783800223, "loss": 4.9344, "mean_token_accuracy": 0.2029196575284004, "num_tokens": 77106651.0, "step": 44465 }, { "entropy": 5.792030906677246, "epoch": 3.459910523244505, "grad_norm": 1.328125, "learning_rate": 0.0003828491550291408, "loss": 4.9986, "mean_token_accuracy": 0.20978539437055588, "num_tokens": 77115378.0, "step": 44470 }, { "entropy": 5.770162868499756, "epoch": 3.4602995526162226, "grad_norm": 1.296875, "learning_rate": 0.0003828248300418199, "loss": 4.9248, "mean_token_accuracy": 0.20963781774044038, "num_tokens": 77124339.0, "step": 44475 }, { "entropy": 5.849606037139893, "epoch": 3.4606885819879403, "grad_norm": 1.328125, "learning_rate": 0.00038280050341842894, "loss": 5.0541, "mean_token_accuracy": 0.20149501115083696, "num_tokens": 77133344.0, "step": 44480 }, { "entropy": 5.834320306777954, "epoch": 3.4610776113596575, "grad_norm": 1.3125, "learning_rate": 0.0003827761751593369, "loss": 4.9635, "mean_token_accuracy": 0.21177805215120316, "num_tokens": 77142321.0, "step": 44485 }, { "entropy": 5.794275760650635, "epoch": 3.461466640731375, "grad_norm": 1.3125, "learning_rate": 0.0003827518452649129, "loss": 4.8746, "mean_token_accuracy": 0.22131069451570512, "num_tokens": 77150675.0, "step": 44490 }, { "entropy": 5.807435035705566, "epoch": 3.461855670103093, "grad_norm": 1.453125, "learning_rate": 0.0003827275137355261, "loss": 4.92, "mean_token_accuracy": 0.21479563415050507, "num_tokens": 77158878.0, "step": 44495 }, { "entropy": 5.8161623001098635, "epoch": 3.46224469947481, "grad_norm": 1.234375, "learning_rate": 0.0003827031805715458, "loss": 5.011, "mean_token_accuracy": 0.20662875920534135, "num_tokens": 77167783.0, "step": 44500 }, { "entropy": 5.829071569442749, "epoch": 3.462633728846528, "grad_norm": 1.2734375, "learning_rate": 0.00038267884577334124, "loss": 4.955, "mean_token_accuracy": 0.20680856555700303, "num_tokens": 77176524.0, "step": 44505 }, { "entropy": 5.880359077453614, "epoch": 3.4630227582182456, "grad_norm": 1.3828125, "learning_rate": 0.0003826545093412815, "loss": 4.9657, "mean_token_accuracy": 0.21376874446868896, "num_tokens": 77184574.0, "step": 44510 }, { "entropy": 5.8537132263183596, "epoch": 3.463411787589963, "grad_norm": 1.2265625, "learning_rate": 0.00038263017127573596, "loss": 5.0603, "mean_token_accuracy": 0.21018934845924378, "num_tokens": 77194389.0, "step": 44515 }, { "entropy": 5.83266921043396, "epoch": 3.4638008169616805, "grad_norm": 1.4765625, "learning_rate": 0.0003826058315770739, "loss": 5.0133, "mean_token_accuracy": 0.2026475504040718, "num_tokens": 77202581.0, "step": 44520 }, { "entropy": 5.864630794525146, "epoch": 3.464189846333398, "grad_norm": 1.2265625, "learning_rate": 0.00038258149024566465, "loss": 5.0013, "mean_token_accuracy": 0.19995850920677186, "num_tokens": 77211496.0, "step": 44525 }, { "entropy": 5.83262939453125, "epoch": 3.464578875705116, "grad_norm": 1.2265625, "learning_rate": 0.0003825571472818774, "loss": 5.0109, "mean_token_accuracy": 0.21005446016788482, "num_tokens": 77220656.0, "step": 44530 }, { "entropy": 5.840118646621704, "epoch": 3.464967905076833, "grad_norm": 1.2734375, "learning_rate": 0.0003825328026860817, "loss": 5.0251, "mean_token_accuracy": 0.20953383892774582, "num_tokens": 77230138.0, "step": 44535 }, { "entropy": 5.861305856704712, "epoch": 3.465356934448551, "grad_norm": 1.3359375, "learning_rate": 0.00038250845645864686, "loss": 5.0591, "mean_token_accuracy": 0.2010301470756531, "num_tokens": 77238745.0, "step": 44540 }, { "entropy": 5.7308878898620605, "epoch": 3.4657459638202686, "grad_norm": 1.296875, "learning_rate": 0.0003824841085999423, "loss": 4.8498, "mean_token_accuracy": 0.22596123665571213, "num_tokens": 77248246.0, "step": 44545 }, { "entropy": 5.8202677249908445, "epoch": 3.466134993191986, "grad_norm": 1.3984375, "learning_rate": 0.0003824597591103375, "loss": 4.9318, "mean_token_accuracy": 0.20280381590127944, "num_tokens": 77256504.0, "step": 44550 }, { "entropy": 5.778558683395386, "epoch": 3.4665240225637035, "grad_norm": 1.3125, "learning_rate": 0.00038243540799020193, "loss": 4.9423, "mean_token_accuracy": 0.20651733726263047, "num_tokens": 77265041.0, "step": 44555 }, { "entropy": 5.841511249542236, "epoch": 3.466913051935421, "grad_norm": 1.328125, "learning_rate": 0.00038241105523990497, "loss": 4.9997, "mean_token_accuracy": 0.21325500011444093, "num_tokens": 77273437.0, "step": 44560 }, { "entropy": 5.7816211700439455, "epoch": 3.467302081307139, "grad_norm": 1.40625, "learning_rate": 0.0003823867008598163, "loss": 4.9503, "mean_token_accuracy": 0.21341925859451294, "num_tokens": 77281228.0, "step": 44565 }, { "entropy": 5.854672145843506, "epoch": 3.467691110678856, "grad_norm": 1.3046875, "learning_rate": 0.00038236234485030524, "loss": 4.9553, "mean_token_accuracy": 0.21599425375461578, "num_tokens": 77289855.0, "step": 44570 }, { "entropy": 5.799074125289917, "epoch": 3.468080140050574, "grad_norm": 1.390625, "learning_rate": 0.00038233798721174156, "loss": 4.9445, "mean_token_accuracy": 0.21770044714212416, "num_tokens": 77298437.0, "step": 44575 }, { "entropy": 5.780996465682984, "epoch": 3.4684691694222916, "grad_norm": 1.3125, "learning_rate": 0.0003823136279444948, "loss": 4.9634, "mean_token_accuracy": 0.2085756853222847, "num_tokens": 77307336.0, "step": 44580 }, { "entropy": 5.824058771133423, "epoch": 3.468858198794009, "grad_norm": 1.3203125, "learning_rate": 0.0003822892670489345, "loss": 4.981, "mean_token_accuracy": 0.20721845775842668, "num_tokens": 77315661.0, "step": 44585 }, { "entropy": 5.748181676864624, "epoch": 3.4692472281657265, "grad_norm": 1.3359375, "learning_rate": 0.00038226490452543036, "loss": 4.8896, "mean_token_accuracy": 0.2182508274912834, "num_tokens": 77324599.0, "step": 44590 }, { "entropy": 5.798062133789062, "epoch": 3.469636257537444, "grad_norm": 1.25, "learning_rate": 0.000382240540374352, "loss": 5.0191, "mean_token_accuracy": 0.2092011034488678, "num_tokens": 77333177.0, "step": 44595 }, { "entropy": 5.797426223754883, "epoch": 3.4700252869091615, "grad_norm": 1.3671875, "learning_rate": 0.0003822161745960691, "loss": 4.9609, "mean_token_accuracy": 0.20942093431949615, "num_tokens": 77342356.0, "step": 44600 }, { "entropy": 5.865619754791259, "epoch": 3.470414316280879, "grad_norm": 1.296875, "learning_rate": 0.0003821918071909515, "loss": 4.9642, "mean_token_accuracy": 0.2107903927564621, "num_tokens": 77351476.0, "step": 44605 }, { "entropy": 5.816127157211303, "epoch": 3.470803345652597, "grad_norm": 1.3203125, "learning_rate": 0.0003821674381593687, "loss": 4.9583, "mean_token_accuracy": 0.2110590949654579, "num_tokens": 77359887.0, "step": 44610 }, { "entropy": 5.77136378288269, "epoch": 3.471192375024314, "grad_norm": 1.484375, "learning_rate": 0.0003821430675016907, "loss": 4.8833, "mean_token_accuracy": 0.22130513340234756, "num_tokens": 77368550.0, "step": 44615 }, { "entropy": 5.769488000869751, "epoch": 3.471581404396032, "grad_norm": 1.421875, "learning_rate": 0.00038211869521828716, "loss": 4.9282, "mean_token_accuracy": 0.21810704320669175, "num_tokens": 77378034.0, "step": 44620 }, { "entropy": 5.781516075134277, "epoch": 3.4719704337677495, "grad_norm": 1.3359375, "learning_rate": 0.000382094321309528, "loss": 4.9364, "mean_token_accuracy": 0.21590566635131836, "num_tokens": 77387126.0, "step": 44625 }, { "entropy": 5.763752126693726, "epoch": 3.472359463139467, "grad_norm": 1.34375, "learning_rate": 0.0003820699457757829, "loss": 4.9108, "mean_token_accuracy": 0.2101902797818184, "num_tokens": 77395580.0, "step": 44630 }, { "entropy": 5.788371181488037, "epoch": 3.4727484925111844, "grad_norm": 1.2890625, "learning_rate": 0.0003820455686174218, "loss": 4.988, "mean_token_accuracy": 0.2118326798081398, "num_tokens": 77404488.0, "step": 44635 }, { "entropy": 5.784642887115479, "epoch": 3.473137521882902, "grad_norm": 1.359375, "learning_rate": 0.00038202118983481456, "loss": 4.9891, "mean_token_accuracy": 0.20658906251192094, "num_tokens": 77413002.0, "step": 44640 }, { "entropy": 5.76349105834961, "epoch": 3.47352655125462, "grad_norm": 1.296875, "learning_rate": 0.0003819968094283311, "loss": 4.9439, "mean_token_accuracy": 0.21147411018610002, "num_tokens": 77421831.0, "step": 44645 }, { "entropy": 5.77415828704834, "epoch": 3.473915580626337, "grad_norm": 1.28125, "learning_rate": 0.0003819724273983414, "loss": 4.9126, "mean_token_accuracy": 0.2157002329826355, "num_tokens": 77430039.0, "step": 44650 }, { "entropy": 5.7870402336120605, "epoch": 3.474304609998055, "grad_norm": 1.2734375, "learning_rate": 0.00038194804374521536, "loss": 4.9518, "mean_token_accuracy": 0.207393878698349, "num_tokens": 77439469.0, "step": 44655 }, { "entropy": 5.700403547286987, "epoch": 3.4746936393697725, "grad_norm": 1.296875, "learning_rate": 0.0003819236584693229, "loss": 4.8921, "mean_token_accuracy": 0.21747809797525405, "num_tokens": 77448294.0, "step": 44660 }, { "entropy": 5.7471400737762455, "epoch": 3.47508266874149, "grad_norm": 1.2734375, "learning_rate": 0.00038189927157103427, "loss": 4.845, "mean_token_accuracy": 0.2215729162096977, "num_tokens": 77456410.0, "step": 44665 }, { "entropy": 5.7760978698730465, "epoch": 3.4754716981132074, "grad_norm": 1.21875, "learning_rate": 0.0003818748830507192, "loss": 4.9741, "mean_token_accuracy": 0.20822336971759797, "num_tokens": 77466081.0, "step": 44670 }, { "entropy": 5.860675859451294, "epoch": 3.475860727484925, "grad_norm": 1.3359375, "learning_rate": 0.000381850492908748, "loss": 4.9957, "mean_token_accuracy": 0.2087363764643669, "num_tokens": 77474020.0, "step": 44675 }, { "entropy": 5.840505170822143, "epoch": 3.476249756856643, "grad_norm": 1.2890625, "learning_rate": 0.00038182610114549057, "loss": 4.968, "mean_token_accuracy": 0.2097627580165863, "num_tokens": 77483573.0, "step": 44680 }, { "entropy": 5.766376590728759, "epoch": 3.47663878622836, "grad_norm": 1.2578125, "learning_rate": 0.00038180170776131714, "loss": 5.0085, "mean_token_accuracy": 0.20373685508966446, "num_tokens": 77492493.0, "step": 44685 }, { "entropy": 5.765184450149536, "epoch": 3.477027815600078, "grad_norm": 1.265625, "learning_rate": 0.0003817773127565977, "loss": 4.8676, "mean_token_accuracy": 0.21918345838785172, "num_tokens": 77501293.0, "step": 44690 }, { "entropy": 5.809802293777466, "epoch": 3.4774168449717955, "grad_norm": 1.3984375, "learning_rate": 0.00038175291613170247, "loss": 4.9008, "mean_token_accuracy": 0.21846579015254974, "num_tokens": 77509795.0, "step": 44695 }, { "entropy": 5.786846017837524, "epoch": 3.477805874343513, "grad_norm": 1.3828125, "learning_rate": 0.00038172851788700174, "loss": 4.8786, "mean_token_accuracy": 0.2156926214694977, "num_tokens": 77518737.0, "step": 44700 }, { "entropy": 5.768040990829467, "epoch": 3.4781949037152304, "grad_norm": 1.265625, "learning_rate": 0.0003817041180228657, "loss": 4.967, "mean_token_accuracy": 0.20817156434059142, "num_tokens": 77527642.0, "step": 44705 }, { "entropy": 5.740696763992309, "epoch": 3.478583933086948, "grad_norm": 1.34375, "learning_rate": 0.0003816797165396643, "loss": 4.8768, "mean_token_accuracy": 0.22349030673503875, "num_tokens": 77535930.0, "step": 44710 }, { "entropy": 5.758592510223389, "epoch": 3.4789729624586654, "grad_norm": 1.296875, "learning_rate": 0.00038165531343776815, "loss": 4.8861, "mean_token_accuracy": 0.21824156492948532, "num_tokens": 77544627.0, "step": 44715 }, { "entropy": 5.7554105758667, "epoch": 3.479361991830383, "grad_norm": 1.3515625, "learning_rate": 0.0003816309087175474, "loss": 4.906, "mean_token_accuracy": 0.21835257709026337, "num_tokens": 77553426.0, "step": 44720 }, { "entropy": 5.787427139282227, "epoch": 3.479751021202101, "grad_norm": 1.34375, "learning_rate": 0.00038160650237937225, "loss": 4.983, "mean_token_accuracy": 0.21358553767204286, "num_tokens": 77561604.0, "step": 44725 }, { "entropy": 5.825679779052734, "epoch": 3.4801400505738185, "grad_norm": 1.2734375, "learning_rate": 0.0003815820944236131, "loss": 5.0707, "mean_token_accuracy": 0.20345656126737593, "num_tokens": 77570220.0, "step": 44730 }, { "entropy": 5.780223751068116, "epoch": 3.4805290799455357, "grad_norm": 1.4140625, "learning_rate": 0.00038155768485064037, "loss": 4.9252, "mean_token_accuracy": 0.21499868482351303, "num_tokens": 77578913.0, "step": 44735 }, { "entropy": 5.843073225021362, "epoch": 3.4809181093172534, "grad_norm": 1.2890625, "learning_rate": 0.00038153327366082434, "loss": 4.983, "mean_token_accuracy": 0.20757836997509002, "num_tokens": 77587649.0, "step": 44740 }, { "entropy": 5.8268921852111815, "epoch": 3.481307138688971, "grad_norm": 1.2734375, "learning_rate": 0.00038150886085453546, "loss": 4.9312, "mean_token_accuracy": 0.21480244696140288, "num_tokens": 77596241.0, "step": 44745 }, { "entropy": 5.822463798522949, "epoch": 3.4816961680606884, "grad_norm": 1.296875, "learning_rate": 0.00038148444643214415, "loss": 4.9915, "mean_token_accuracy": 0.19850883036851882, "num_tokens": 77604641.0, "step": 44750 }, { "entropy": 5.806487321853638, "epoch": 3.482085197432406, "grad_norm": 1.2734375, "learning_rate": 0.0003814600303940208, "loss": 4.918, "mean_token_accuracy": 0.20962276607751845, "num_tokens": 77613199.0, "step": 44755 }, { "entropy": 5.792320013046265, "epoch": 3.4824742268041238, "grad_norm": 1.2421875, "learning_rate": 0.000381435612740536, "loss": 4.9771, "mean_token_accuracy": 0.2104360803961754, "num_tokens": 77622037.0, "step": 44760 }, { "entropy": 5.78350248336792, "epoch": 3.4828632561758415, "grad_norm": 1.3125, "learning_rate": 0.00038141119347206016, "loss": 4.9225, "mean_token_accuracy": 0.21449425220489501, "num_tokens": 77630541.0, "step": 44765 }, { "entropy": 5.832579469680786, "epoch": 3.4832522855475587, "grad_norm": 1.4140625, "learning_rate": 0.00038138677258896383, "loss": 4.9912, "mean_token_accuracy": 0.2060764640569687, "num_tokens": 77638668.0, "step": 44770 }, { "entropy": 5.807975149154663, "epoch": 3.4836413149192764, "grad_norm": 1.375, "learning_rate": 0.0003813623500916176, "loss": 4.9932, "mean_token_accuracy": 0.214507095515728, "num_tokens": 77648123.0, "step": 44775 }, { "entropy": 5.873371601104736, "epoch": 3.484030344290994, "grad_norm": 1.265625, "learning_rate": 0.00038133792598039196, "loss": 5.0105, "mean_token_accuracy": 0.2119548037648201, "num_tokens": 77657368.0, "step": 44780 }, { "entropy": 5.92892107963562, "epoch": 3.4844193736627114, "grad_norm": 1.4296875, "learning_rate": 0.0003813135002556575, "loss": 5.0552, "mean_token_accuracy": 0.20314472913742065, "num_tokens": 77666567.0, "step": 44785 }, { "entropy": 5.847765970230102, "epoch": 3.484808403034429, "grad_norm": 1.3359375, "learning_rate": 0.00038128907291778497, "loss": 5.0106, "mean_token_accuracy": 0.20605779588222503, "num_tokens": 77674431.0, "step": 44790 }, { "entropy": 5.747258424758911, "epoch": 3.4851974324061468, "grad_norm": 1.3203125, "learning_rate": 0.00038126464396714494, "loss": 4.9027, "mean_token_accuracy": 0.21758346855640412, "num_tokens": 77682753.0, "step": 44795 }, { "entropy": 5.771861457824707, "epoch": 3.4855864617778645, "grad_norm": 1.2890625, "learning_rate": 0.00038124021340410795, "loss": 4.9094, "mean_token_accuracy": 0.21649012118577957, "num_tokens": 77691072.0, "step": 44800 }, { "entropy": 5.750421571731567, "epoch": 3.4859754911495817, "grad_norm": 1.2734375, "learning_rate": 0.00038121578122904496, "loss": 4.8491, "mean_token_accuracy": 0.21606859415769578, "num_tokens": 77699401.0, "step": 44805 }, { "entropy": 5.769607210159302, "epoch": 3.4863645205212994, "grad_norm": 1.1640625, "learning_rate": 0.0003811913474423265, "loss": 4.9273, "mean_token_accuracy": 0.21280055791139602, "num_tokens": 77708565.0, "step": 44810 }, { "entropy": 5.812613105773925, "epoch": 3.486753549893017, "grad_norm": 1.3125, "learning_rate": 0.0003811669120443234, "loss": 5.0056, "mean_token_accuracy": 0.2088782250881195, "num_tokens": 77718497.0, "step": 44815 }, { "entropy": 5.785005235671997, "epoch": 3.4871425792647344, "grad_norm": 1.40625, "learning_rate": 0.0003811424750354063, "loss": 4.9784, "mean_token_accuracy": 0.211370812356472, "num_tokens": 77727673.0, "step": 44820 }, { "entropy": 5.748118162155151, "epoch": 3.487531608636452, "grad_norm": 1.40625, "learning_rate": 0.0003811180364159462, "loss": 4.9021, "mean_token_accuracy": 0.2068103924393654, "num_tokens": 77735813.0, "step": 44825 }, { "entropy": 5.755158758163452, "epoch": 3.4879206380081698, "grad_norm": 1.359375, "learning_rate": 0.00038109359618631374, "loss": 4.8702, "mean_token_accuracy": 0.2209985613822937, "num_tokens": 77743529.0, "step": 44830 }, { "entropy": 5.702675676345825, "epoch": 3.488309667379887, "grad_norm": 1.4609375, "learning_rate": 0.00038106915434687983, "loss": 4.8698, "mean_token_accuracy": 0.212717667222023, "num_tokens": 77751251.0, "step": 44835 }, { "entropy": 5.730726289749145, "epoch": 3.4886986967516047, "grad_norm": 1.359375, "learning_rate": 0.0003810447108980153, "loss": 4.8961, "mean_token_accuracy": 0.21905719935894014, "num_tokens": 77759857.0, "step": 44840 }, { "entropy": 5.8087592124938965, "epoch": 3.4890877261233224, "grad_norm": 1.3046875, "learning_rate": 0.0003810202658400911, "loss": 5.0401, "mean_token_accuracy": 0.2116159975528717, "num_tokens": 77769109.0, "step": 44845 }, { "entropy": 5.798792839050293, "epoch": 3.4894767554950397, "grad_norm": 1.25, "learning_rate": 0.0003809958191734781, "loss": 4.9832, "mean_token_accuracy": 0.2070462718605995, "num_tokens": 77778795.0, "step": 44850 }, { "entropy": 5.8452733039855955, "epoch": 3.4898657848667574, "grad_norm": 1.3984375, "learning_rate": 0.00038097137089854725, "loss": 4.9784, "mean_token_accuracy": 0.21140459775924683, "num_tokens": 77786901.0, "step": 44855 }, { "entropy": 5.723187685012817, "epoch": 3.490254814238475, "grad_norm": 1.296875, "learning_rate": 0.00038094692101566955, "loss": 4.8709, "mean_token_accuracy": 0.2157171845436096, "num_tokens": 77795998.0, "step": 44860 }, { "entropy": 5.805377674102783, "epoch": 3.4906438436101928, "grad_norm": 1.359375, "learning_rate": 0.0003809224695252159, "loss": 5.0281, "mean_token_accuracy": 0.20783466547727586, "num_tokens": 77805995.0, "step": 44865 }, { "entropy": 5.854003143310547, "epoch": 3.49103287298191, "grad_norm": 1.34375, "learning_rate": 0.00038089801642755746, "loss": 5.0103, "mean_token_accuracy": 0.2087114691734314, "num_tokens": 77814476.0, "step": 44870 }, { "entropy": 5.732790470123291, "epoch": 3.4914219023536277, "grad_norm": 1.296875, "learning_rate": 0.00038087356172306514, "loss": 4.8183, "mean_token_accuracy": 0.22181419134140015, "num_tokens": 77822960.0, "step": 44875 }, { "entropy": 5.752075242996216, "epoch": 3.4918109317253454, "grad_norm": 1.28125, "learning_rate": 0.00038084910541211, "loss": 4.9816, "mean_token_accuracy": 0.21005307585000993, "num_tokens": 77832008.0, "step": 44880 }, { "entropy": 5.75865068435669, "epoch": 3.4921999610970627, "grad_norm": 1.515625, "learning_rate": 0.00038082464749506314, "loss": 4.943, "mean_token_accuracy": 0.20378140956163407, "num_tokens": 77840752.0, "step": 44885 }, { "entropy": 5.779946041107178, "epoch": 3.4925889904687804, "grad_norm": 1.234375, "learning_rate": 0.00038080018797229576, "loss": 4.9456, "mean_token_accuracy": 0.21439186930656434, "num_tokens": 77849122.0, "step": 44890 }, { "entropy": 5.828277349472046, "epoch": 3.492978019840498, "grad_norm": 1.3125, "learning_rate": 0.0003807757268441789, "loss": 4.9106, "mean_token_accuracy": 0.2160893365740776, "num_tokens": 77857114.0, "step": 44895 }, { "entropy": 5.797470378875732, "epoch": 3.4933670492122157, "grad_norm": 1.3515625, "learning_rate": 0.00038075126411108367, "loss": 4.9115, "mean_token_accuracy": 0.21657972335815429, "num_tokens": 77866088.0, "step": 44900 }, { "entropy": 5.798373603820801, "epoch": 3.493756078583933, "grad_norm": 1.3125, "learning_rate": 0.00038072679977338143, "loss": 4.995, "mean_token_accuracy": 0.20964398980140686, "num_tokens": 77874161.0, "step": 44905 }, { "entropy": 5.846614837646484, "epoch": 3.4941451079556507, "grad_norm": 1.3828125, "learning_rate": 0.00038070233383144324, "loss": 5.0142, "mean_token_accuracy": 0.20935287624597548, "num_tokens": 77882604.0, "step": 44910 }, { "entropy": 5.890738821029663, "epoch": 3.4945341373273684, "grad_norm": 1.3125, "learning_rate": 0.0003806778662856404, "loss": 4.9976, "mean_token_accuracy": 0.21055128425359726, "num_tokens": 77890944.0, "step": 44915 }, { "entropy": 5.778139114379883, "epoch": 3.4949231666990856, "grad_norm": 1.3828125, "learning_rate": 0.0003806533971363441, "loss": 4.9564, "mean_token_accuracy": 0.21126247197389603, "num_tokens": 77899541.0, "step": 44920 }, { "entropy": 5.784995174407959, "epoch": 3.4953121960708033, "grad_norm": 1.3046875, "learning_rate": 0.0003806289263839257, "loss": 4.9534, "mean_token_accuracy": 0.2076089009642601, "num_tokens": 77908200.0, "step": 44925 }, { "entropy": 5.812356042861938, "epoch": 3.495701225442521, "grad_norm": 1.296875, "learning_rate": 0.0003806044540287564, "loss": 4.914, "mean_token_accuracy": 0.21760586351156236, "num_tokens": 77916149.0, "step": 44930 }, { "entropy": 5.792283630371093, "epoch": 3.4960902548142383, "grad_norm": 1.4140625, "learning_rate": 0.00038057998007120776, "loss": 4.8935, "mean_token_accuracy": 0.2139286980032921, "num_tokens": 77924717.0, "step": 44935 }, { "entropy": 5.736800622940064, "epoch": 3.496479284185956, "grad_norm": 1.1796875, "learning_rate": 0.00038055550451165086, "loss": 4.9674, "mean_token_accuracy": 0.21067046076059343, "num_tokens": 77933449.0, "step": 44940 }, { "entropy": 5.719511079788208, "epoch": 3.4968683135576737, "grad_norm": 1.328125, "learning_rate": 0.0003805310273504572, "loss": 4.9317, "mean_token_accuracy": 0.21083937883377074, "num_tokens": 77942446.0, "step": 44945 }, { "entropy": 5.831179094314575, "epoch": 3.497257342929391, "grad_norm": 1.4375, "learning_rate": 0.0003805065485879982, "loss": 5.0232, "mean_token_accuracy": 0.20888094305992128, "num_tokens": 77949781.0, "step": 44950 }, { "entropy": 5.803176975250244, "epoch": 3.4976463723011086, "grad_norm": 1.4375, "learning_rate": 0.00038048206822464514, "loss": 4.9808, "mean_token_accuracy": 0.20000501126050949, "num_tokens": 77958638.0, "step": 44955 }, { "entropy": 5.823805046081543, "epoch": 3.4980354016728263, "grad_norm": 1.3125, "learning_rate": 0.00038045758626076965, "loss": 5.0141, "mean_token_accuracy": 0.21090339869260788, "num_tokens": 77967840.0, "step": 44960 }, { "entropy": 5.7874127388000485, "epoch": 3.498424431044544, "grad_norm": 1.296875, "learning_rate": 0.0003804331026967432, "loss": 4.9559, "mean_token_accuracy": 0.20924318283796312, "num_tokens": 77976946.0, "step": 44965 }, { "entropy": 5.797838592529297, "epoch": 3.4988134604162613, "grad_norm": 1.3515625, "learning_rate": 0.0003804086175329372, "loss": 5.0766, "mean_token_accuracy": 0.20023139268159867, "num_tokens": 77985644.0, "step": 44970 }, { "entropy": 5.804594087600708, "epoch": 3.499202489787979, "grad_norm": 1.328125, "learning_rate": 0.0003803841307697232, "loss": 4.9516, "mean_token_accuracy": 0.2115913838148117, "num_tokens": 77994118.0, "step": 44975 }, { "entropy": 5.817593336105347, "epoch": 3.4995915191596967, "grad_norm": 1.25, "learning_rate": 0.00038035964240747274, "loss": 4.9134, "mean_token_accuracy": 0.21989504992961884, "num_tokens": 78003281.0, "step": 44980 }, { "entropy": 5.821882581710815, "epoch": 3.499980548531414, "grad_norm": 1.3125, "learning_rate": 0.0003803351524465574, "loss": 5.0102, "mean_token_accuracy": 0.20938853472471236, "num_tokens": 78012075.0, "step": 44985 }, { "entropy": 5.794003582000732, "epoch": 3.5003695779031316, "grad_norm": 1.390625, "learning_rate": 0.00038031066088734883, "loss": 4.9006, "mean_token_accuracy": 0.22007423788309097, "num_tokens": 78020722.0, "step": 44990 }, { "entropy": 5.778456544876098, "epoch": 3.5007586072748493, "grad_norm": 1.359375, "learning_rate": 0.0003802861677302185, "loss": 4.9601, "mean_token_accuracy": 0.21949015855789183, "num_tokens": 78029798.0, "step": 44995 }, { "entropy": 5.799038314819336, "epoch": 3.501147636646567, "grad_norm": 1.296875, "learning_rate": 0.00038026167297553826, "loss": 4.892, "mean_token_accuracy": 0.21535504311323167, "num_tokens": 78038362.0, "step": 45000 }, { "epoch": 3.501147636646567, "eval_entropy": 5.546584152280424, "eval_loss": 5.047752380371094, "eval_mean_token_accuracy": 0.21673591212370397, "eval_num_tokens": 78038362.0, "eval_runtime": 21.7257, "eval_samples_per_second": 1912.853, "eval_steps_per_second": 239.118, "step": 45000 }, { "entropy": 5.81340069770813, "epoch": 3.5015366660182843, "grad_norm": 1.2890625, "learning_rate": 0.00038023717662367956, "loss": 4.9167, "mean_token_accuracy": 0.21115302443504333, "num_tokens": 78047711.0, "step": 45005 }, { "entropy": 5.77935938835144, "epoch": 3.501925695390002, "grad_norm": 1.265625, "learning_rate": 0.0003802126786750143, "loss": 4.9229, "mean_token_accuracy": 0.21077784299850463, "num_tokens": 78056556.0, "step": 45010 }, { "entropy": 5.793754768371582, "epoch": 3.5023147247617192, "grad_norm": 1.375, "learning_rate": 0.00038018817912991413, "loss": 4.8889, "mean_token_accuracy": 0.20750444233417512, "num_tokens": 78064481.0, "step": 45015 }, { "entropy": 5.72855281829834, "epoch": 3.502703754133437, "grad_norm": 1.3671875, "learning_rate": 0.00038016367798875074, "loss": 4.9064, "mean_token_accuracy": 0.2189100444316864, "num_tokens": 78073310.0, "step": 45020 }, { "entropy": 5.824944257736206, "epoch": 3.5030927835051546, "grad_norm": 1.3203125, "learning_rate": 0.0003801391752518959, "loss": 5.0036, "mean_token_accuracy": 0.20958982706069945, "num_tokens": 78082053.0, "step": 45025 }, { "entropy": 5.7840088367462155, "epoch": 3.5034818128768723, "grad_norm": 1.3046875, "learning_rate": 0.00038011467091972134, "loss": 5.016, "mean_token_accuracy": 0.21146827042102814, "num_tokens": 78090733.0, "step": 45030 }, { "entropy": 5.829059267044068, "epoch": 3.50387084224859, "grad_norm": 1.2890625, "learning_rate": 0.0003800901649925991, "loss": 5.0142, "mean_token_accuracy": 0.2097789004445076, "num_tokens": 78099757.0, "step": 45035 }, { "entropy": 5.841159343719482, "epoch": 3.5042598716203073, "grad_norm": 1.3046875, "learning_rate": 0.00038006565747090076, "loss": 4.9152, "mean_token_accuracy": 0.2133435606956482, "num_tokens": 78107876.0, "step": 45040 }, { "entropy": 5.790940427780152, "epoch": 3.504648900992025, "grad_norm": 1.40625, "learning_rate": 0.00038004114835499833, "loss": 4.9744, "mean_token_accuracy": 0.21235191076993942, "num_tokens": 78116109.0, "step": 45045 }, { "entropy": 5.763064384460449, "epoch": 3.5050379303637422, "grad_norm": 1.3359375, "learning_rate": 0.00038001663764526374, "loss": 4.9634, "mean_token_accuracy": 0.2085259214043617, "num_tokens": 78124312.0, "step": 45050 }, { "entropy": 5.811946058273316, "epoch": 3.50542695973546, "grad_norm": 1.4140625, "learning_rate": 0.00037999212534206876, "loss": 4.9095, "mean_token_accuracy": 0.2181302696466446, "num_tokens": 78132624.0, "step": 45055 }, { "entropy": 5.784480428695678, "epoch": 3.5058159891071776, "grad_norm": 1.3125, "learning_rate": 0.0003799676114457853, "loss": 4.9352, "mean_token_accuracy": 0.21810988634824752, "num_tokens": 78141020.0, "step": 45060 }, { "entropy": 5.824211931228637, "epoch": 3.5062050184788953, "grad_norm": 1.375, "learning_rate": 0.00037994309595678553, "loss": 5.0777, "mean_token_accuracy": 0.20995987951755524, "num_tokens": 78149937.0, "step": 45065 }, { "entropy": 5.850016927719116, "epoch": 3.5065940478506126, "grad_norm": 1.3515625, "learning_rate": 0.0003799185788754413, "loss": 4.9548, "mean_token_accuracy": 0.21601422727108002, "num_tokens": 78158542.0, "step": 45070 }, { "entropy": 5.806027221679687, "epoch": 3.5069830772223303, "grad_norm": 1.3046875, "learning_rate": 0.0003798940602021247, "loss": 4.9299, "mean_token_accuracy": 0.21137935668230057, "num_tokens": 78167752.0, "step": 45075 }, { "entropy": 5.759720230102539, "epoch": 3.507372106594048, "grad_norm": 1.34375, "learning_rate": 0.0003798695399372076, "loss": 4.9553, "mean_token_accuracy": 0.21406469941139222, "num_tokens": 78176782.0, "step": 45080 }, { "entropy": 5.874069452285767, "epoch": 3.507761135965765, "grad_norm": 1.3984375, "learning_rate": 0.0003798450180810621, "loss": 5.0464, "mean_token_accuracy": 0.20323964208364487, "num_tokens": 78185087.0, "step": 45085 }, { "entropy": 5.756486320495606, "epoch": 3.508150165337483, "grad_norm": 1.34375, "learning_rate": 0.00037982049463406044, "loss": 4.8396, "mean_token_accuracy": 0.22313541620969773, "num_tokens": 78193159.0, "step": 45090 }, { "entropy": 5.806555128097534, "epoch": 3.5085391947092006, "grad_norm": 1.375, "learning_rate": 0.0003797959695965745, "loss": 5.0454, "mean_token_accuracy": 0.20570686608552932, "num_tokens": 78202015.0, "step": 45095 }, { "entropy": 5.75159010887146, "epoch": 3.5089282240809183, "grad_norm": 1.3515625, "learning_rate": 0.00037977144296897665, "loss": 4.9003, "mean_token_accuracy": 0.20878394097089767, "num_tokens": 78209644.0, "step": 45100 }, { "entropy": 5.749531650543213, "epoch": 3.5093172534526356, "grad_norm": 1.3984375, "learning_rate": 0.0003797469147516388, "loss": 4.9772, "mean_token_accuracy": 0.2039717838168144, "num_tokens": 78218298.0, "step": 45105 }, { "entropy": 5.760928678512573, "epoch": 3.5097062828243533, "grad_norm": 1.21875, "learning_rate": 0.00037972238494493333, "loss": 4.896, "mean_token_accuracy": 0.21357928216457367, "num_tokens": 78227547.0, "step": 45110 }, { "entropy": 5.7835602283477785, "epoch": 3.510095312196071, "grad_norm": 1.25, "learning_rate": 0.0003796978535492323, "loss": 4.9174, "mean_token_accuracy": 0.21705976724624634, "num_tokens": 78236379.0, "step": 45115 }, { "entropy": 5.685134410858154, "epoch": 3.510484341567788, "grad_norm": 1.34375, "learning_rate": 0.000379673320564908, "loss": 4.8698, "mean_token_accuracy": 0.21963596493005752, "num_tokens": 78244672.0, "step": 45120 }, { "entropy": 5.8113706588745115, "epoch": 3.510873370939506, "grad_norm": 1.3515625, "learning_rate": 0.00037964878599233264, "loss": 5.0888, "mean_token_accuracy": 0.20796138644218445, "num_tokens": 78253298.0, "step": 45125 }, { "entropy": 5.904376888275147, "epoch": 3.5112624003112236, "grad_norm": 1.265625, "learning_rate": 0.00037962424983187856, "loss": 5.0137, "mean_token_accuracy": 0.20265062749385834, "num_tokens": 78262801.0, "step": 45130 }, { "entropy": 5.903958797454834, "epoch": 3.5116514296829413, "grad_norm": 1.3125, "learning_rate": 0.000379599712083918, "loss": 5.02, "mean_token_accuracy": 0.21402884721755983, "num_tokens": 78271415.0, "step": 45135 }, { "entropy": 5.777164649963379, "epoch": 3.5120404590546586, "grad_norm": 1.2265625, "learning_rate": 0.0003795751727488233, "loss": 4.9563, "mean_token_accuracy": 0.2071382150053978, "num_tokens": 78279982.0, "step": 45140 }, { "entropy": 5.740121793746948, "epoch": 3.5124294884263763, "grad_norm": 1.375, "learning_rate": 0.00037955063182696676, "loss": 4.913, "mean_token_accuracy": 0.2113765373826027, "num_tokens": 78288042.0, "step": 45145 }, { "entropy": 5.758187961578369, "epoch": 3.5128185177980935, "grad_norm": 1.21875, "learning_rate": 0.00037952608931872086, "loss": 4.8803, "mean_token_accuracy": 0.21545160859823226, "num_tokens": 78296587.0, "step": 45150 }, { "entropy": 5.863168621063233, "epoch": 3.513207547169811, "grad_norm": 1.34375, "learning_rate": 0.00037950154522445784, "loss": 5.0448, "mean_token_accuracy": 0.2093970939517021, "num_tokens": 78305851.0, "step": 45155 }, { "entropy": 5.791566991806031, "epoch": 3.513596576541529, "grad_norm": 1.3359375, "learning_rate": 0.0003794769995445502, "loss": 4.967, "mean_token_accuracy": 0.21096333861351013, "num_tokens": 78314188.0, "step": 45160 }, { "entropy": 5.713402271270752, "epoch": 3.5139856059132466, "grad_norm": 1.2890625, "learning_rate": 0.0003794524522793705, "loss": 4.9134, "mean_token_accuracy": 0.2207271248102188, "num_tokens": 78322885.0, "step": 45165 }, { "entropy": 5.806624507904052, "epoch": 3.514374635284964, "grad_norm": 1.3671875, "learning_rate": 0.00037942790342929106, "loss": 4.9279, "mean_token_accuracy": 0.21395778506994248, "num_tokens": 78330672.0, "step": 45170 }, { "entropy": 5.81657657623291, "epoch": 3.5147636646566816, "grad_norm": 1.3671875, "learning_rate": 0.00037940335299468437, "loss": 4.9036, "mean_token_accuracy": 0.21521449834108353, "num_tokens": 78338853.0, "step": 45175 }, { "entropy": 5.829462194442749, "epoch": 3.5151526940283992, "grad_norm": 1.4140625, "learning_rate": 0.00037937880097592294, "loss": 4.9667, "mean_token_accuracy": 0.20758809745311738, "num_tokens": 78346890.0, "step": 45180 }, { "entropy": 5.740259647369385, "epoch": 3.5155417234001165, "grad_norm": 1.3359375, "learning_rate": 0.00037935424737337936, "loss": 4.9101, "mean_token_accuracy": 0.21210171580314635, "num_tokens": 78355187.0, "step": 45185 }, { "entropy": 5.793754768371582, "epoch": 3.515930752771834, "grad_norm": 1.234375, "learning_rate": 0.00037932969218742616, "loss": 5.0169, "mean_token_accuracy": 0.19935035854578018, "num_tokens": 78365023.0, "step": 45190 }, { "entropy": 5.814436721801758, "epoch": 3.516319782143552, "grad_norm": 1.28125, "learning_rate": 0.00037930513541843593, "loss": 4.8891, "mean_token_accuracy": 0.21419403403997422, "num_tokens": 78373662.0, "step": 45195 }, { "entropy": 5.847895812988281, "epoch": 3.5167088115152696, "grad_norm": 1.3671875, "learning_rate": 0.00037928057706678136, "loss": 5.0496, "mean_token_accuracy": 0.1986975774168968, "num_tokens": 78382161.0, "step": 45200 }, { "entropy": 5.78133454322815, "epoch": 3.517097840886987, "grad_norm": 1.34375, "learning_rate": 0.00037925601713283504, "loss": 4.9572, "mean_token_accuracy": 0.20672025680541992, "num_tokens": 78391165.0, "step": 45205 }, { "entropy": 5.77205810546875, "epoch": 3.5174868702587045, "grad_norm": 1.375, "learning_rate": 0.0003792314556169695, "loss": 4.8809, "mean_token_accuracy": 0.21259001195430755, "num_tokens": 78399432.0, "step": 45210 }, { "entropy": 5.7366846084594725, "epoch": 3.5178758996304222, "grad_norm": 1.3046875, "learning_rate": 0.0003792068925195576, "loss": 4.8786, "mean_token_accuracy": 0.21429156959056855, "num_tokens": 78408138.0, "step": 45215 }, { "entropy": 5.727474498748779, "epoch": 3.5182649290021395, "grad_norm": 1.3046875, "learning_rate": 0.0003791823278409719, "loss": 4.8179, "mean_token_accuracy": 0.22176957726478577, "num_tokens": 78417684.0, "step": 45220 }, { "entropy": 5.766147708892822, "epoch": 3.518653958373857, "grad_norm": 1.2421875, "learning_rate": 0.00037915776158158515, "loss": 4.9071, "mean_token_accuracy": 0.21191220134496688, "num_tokens": 78426922.0, "step": 45225 }, { "entropy": 5.722482681274414, "epoch": 3.519042987745575, "grad_norm": 1.3515625, "learning_rate": 0.0003791331937417703, "loss": 4.8671, "mean_token_accuracy": 0.21339316815137863, "num_tokens": 78434735.0, "step": 45230 }, { "entropy": 5.799945211410522, "epoch": 3.5194320171172926, "grad_norm": 1.3046875, "learning_rate": 0.00037910862432189986, "loss": 4.9193, "mean_token_accuracy": 0.21255179345607758, "num_tokens": 78443263.0, "step": 45235 }, { "entropy": 5.779786920547485, "epoch": 3.51982104648901, "grad_norm": 1.265625, "learning_rate": 0.0003790840533223467, "loss": 4.9899, "mean_token_accuracy": 0.21179632544517518, "num_tokens": 78451498.0, "step": 45240 }, { "entropy": 5.791426801681519, "epoch": 3.5202100758607275, "grad_norm": 1.3515625, "learning_rate": 0.00037905948074348387, "loss": 4.966, "mean_token_accuracy": 0.21130308359861374, "num_tokens": 78460097.0, "step": 45245 }, { "entropy": 5.760264778137207, "epoch": 3.520599105232445, "grad_norm": 1.375, "learning_rate": 0.000379034906585684, "loss": 4.8884, "mean_token_accuracy": 0.2094319701194763, "num_tokens": 78468828.0, "step": 45250 }, { "entropy": 5.787218904495239, "epoch": 3.5209881346041625, "grad_norm": 1.34375, "learning_rate": 0.00037901033084932, "loss": 4.9497, "mean_token_accuracy": 0.21003708839416504, "num_tokens": 78477930.0, "step": 45255 }, { "entropy": 5.7490333080291744, "epoch": 3.52137716397588, "grad_norm": 1.3359375, "learning_rate": 0.0003789857535347648, "loss": 4.9027, "mean_token_accuracy": 0.22550841718912124, "num_tokens": 78486828.0, "step": 45260 }, { "entropy": 5.76067967414856, "epoch": 3.521766193347598, "grad_norm": 1.375, "learning_rate": 0.0003789611746423912, "loss": 4.9139, "mean_token_accuracy": 0.2135714128613472, "num_tokens": 78495316.0, "step": 45265 }, { "entropy": 5.76439528465271, "epoch": 3.5221552227193156, "grad_norm": 1.46875, "learning_rate": 0.00037893659417257233, "loss": 4.8569, "mean_token_accuracy": 0.2190175399184227, "num_tokens": 78503669.0, "step": 45270 }, { "entropy": 5.837789916992188, "epoch": 3.522544252091033, "grad_norm": 1.3359375, "learning_rate": 0.00037891201212568107, "loss": 4.9616, "mean_token_accuracy": 0.21249043941497803, "num_tokens": 78512135.0, "step": 45275 }, { "entropy": 5.744658613204956, "epoch": 3.5229332814627505, "grad_norm": 1.2421875, "learning_rate": 0.00037888742850209037, "loss": 4.9986, "mean_token_accuracy": 0.19927141964435577, "num_tokens": 78521537.0, "step": 45280 }, { "entropy": 5.798999977111817, "epoch": 3.523322310834468, "grad_norm": 1.28125, "learning_rate": 0.0003788628433021733, "loss": 5.008, "mean_token_accuracy": 0.20074418187141418, "num_tokens": 78530281.0, "step": 45285 }, { "entropy": 5.857459592819214, "epoch": 3.5237113402061855, "grad_norm": 1.328125, "learning_rate": 0.000378838256526303, "loss": 5.0111, "mean_token_accuracy": 0.20343895703554155, "num_tokens": 78538998.0, "step": 45290 }, { "entropy": 5.809850072860717, "epoch": 3.524100369577903, "grad_norm": 1.40625, "learning_rate": 0.0003788136681748523, "loss": 4.9981, "mean_token_accuracy": 0.20568218529224397, "num_tokens": 78547539.0, "step": 45295 }, { "entropy": 5.785545063018799, "epoch": 3.524489398949621, "grad_norm": 1.2421875, "learning_rate": 0.0003787890782481945, "loss": 4.9191, "mean_token_accuracy": 0.2147335574030876, "num_tokens": 78556248.0, "step": 45300 }, { "entropy": 5.762953424453736, "epoch": 3.524878428321338, "grad_norm": 1.4296875, "learning_rate": 0.0003787644867467026, "loss": 4.9378, "mean_token_accuracy": 0.2135144516825676, "num_tokens": 78564710.0, "step": 45305 }, { "entropy": 5.79889178276062, "epoch": 3.525267457693056, "grad_norm": 1.3046875, "learning_rate": 0.00037873989367074977, "loss": 5.02, "mean_token_accuracy": 0.2098018780350685, "num_tokens": 78573213.0, "step": 45310 }, { "entropy": 5.817741346359253, "epoch": 3.5256564870647735, "grad_norm": 1.2421875, "learning_rate": 0.00037871529902070924, "loss": 5.0173, "mean_token_accuracy": 0.20570724904537202, "num_tokens": 78581308.0, "step": 45315 }, { "entropy": 5.679773616790771, "epoch": 3.526045516436491, "grad_norm": 1.296875, "learning_rate": 0.00037869070279695404, "loss": 4.811, "mean_token_accuracy": 0.2176008015871048, "num_tokens": 78590621.0, "step": 45320 }, { "entropy": 5.79523606300354, "epoch": 3.5264345458082085, "grad_norm": 1.25, "learning_rate": 0.00037866610499985755, "loss": 4.9506, "mean_token_accuracy": 0.21145097017288209, "num_tokens": 78599726.0, "step": 45325 }, { "entropy": 5.793423414230347, "epoch": 3.526823575179926, "grad_norm": 1.2421875, "learning_rate": 0.0003786415056297929, "loss": 4.9335, "mean_token_accuracy": 0.21301053762435912, "num_tokens": 78609203.0, "step": 45330 }, { "entropy": 5.855488729476929, "epoch": 3.527212604551644, "grad_norm": 1.390625, "learning_rate": 0.0003786169046871333, "loss": 4.9597, "mean_token_accuracy": 0.20950528532266616, "num_tokens": 78617717.0, "step": 45335 }, { "entropy": 5.858923387527466, "epoch": 3.527601633923361, "grad_norm": 1.4921875, "learning_rate": 0.0003785923021722521, "loss": 5.0613, "mean_token_accuracy": 0.20441949218511582, "num_tokens": 78626252.0, "step": 45340 }, { "entropy": 5.804244184494019, "epoch": 3.527990663295079, "grad_norm": 1.3046875, "learning_rate": 0.00037856769808552267, "loss": 4.9388, "mean_token_accuracy": 0.20624428391456603, "num_tokens": 78634641.0, "step": 45345 }, { "entropy": 5.759949588775635, "epoch": 3.528379692666796, "grad_norm": 1.296875, "learning_rate": 0.0003785430924273182, "loss": 4.9507, "mean_token_accuracy": 0.20903297364711762, "num_tokens": 78642765.0, "step": 45350 }, { "entropy": 5.769619417190552, "epoch": 3.5287687220385138, "grad_norm": 1.3515625, "learning_rate": 0.00037851848519801214, "loss": 4.9261, "mean_token_accuracy": 0.2049776777625084, "num_tokens": 78652111.0, "step": 45355 }, { "entropy": 5.737068748474121, "epoch": 3.5291577514102315, "grad_norm": 1.25, "learning_rate": 0.0003784938763979778, "loss": 4.9043, "mean_token_accuracy": 0.21464954763650895, "num_tokens": 78661836.0, "step": 45360 }, { "entropy": 5.800971794128418, "epoch": 3.529546780781949, "grad_norm": 1.203125, "learning_rate": 0.0003784692660275886, "loss": 4.9678, "mean_token_accuracy": 0.20863155126571656, "num_tokens": 78670309.0, "step": 45365 }, { "entropy": 5.741023349761963, "epoch": 3.529935810153667, "grad_norm": 1.34375, "learning_rate": 0.0003784446540872181, "loss": 4.9092, "mean_token_accuracy": 0.2188849076628685, "num_tokens": 78678741.0, "step": 45370 }, { "entropy": 5.765968370437622, "epoch": 3.530324839525384, "grad_norm": 1.3828125, "learning_rate": 0.00037842004057723957, "loss": 4.8843, "mean_token_accuracy": 0.21803620010614394, "num_tokens": 78686924.0, "step": 45375 }, { "entropy": 5.817259311676025, "epoch": 3.530713868897102, "grad_norm": 1.3046875, "learning_rate": 0.0003783954254980265, "loss": 4.9287, "mean_token_accuracy": 0.21121784597635268, "num_tokens": 78695636.0, "step": 45380 }, { "entropy": 5.821703195571899, "epoch": 3.531102898268819, "grad_norm": 1.4140625, "learning_rate": 0.0003783708088499524, "loss": 4.926, "mean_token_accuracy": 0.21488721221685408, "num_tokens": 78704375.0, "step": 45385 }, { "entropy": 5.734186315536499, "epoch": 3.5314919276405368, "grad_norm": 1.484375, "learning_rate": 0.00037834619063339085, "loss": 4.9125, "mean_token_accuracy": 0.21422878354787828, "num_tokens": 78712752.0, "step": 45390 }, { "entropy": 5.862602949142456, "epoch": 3.5318809570122545, "grad_norm": 1.1953125, "learning_rate": 0.0003783215708487153, "loss": 5.1272, "mean_token_accuracy": 0.20130405873060225, "num_tokens": 78721310.0, "step": 45395 }, { "entropy": 5.746823120117187, "epoch": 3.532269986383972, "grad_norm": 1.3125, "learning_rate": 0.0003782969494962994, "loss": 4.8659, "mean_token_accuracy": 0.22157032638788224, "num_tokens": 78730081.0, "step": 45400 }, { "entropy": 5.8301092147827145, "epoch": 3.5326590157556894, "grad_norm": 1.34375, "learning_rate": 0.0003782723265765167, "loss": 5.0403, "mean_token_accuracy": 0.20498277842998505, "num_tokens": 78738253.0, "step": 45405 }, { "entropy": 5.807328748703003, "epoch": 3.533048045127407, "grad_norm": 1.421875, "learning_rate": 0.00037824770208974085, "loss": 4.8864, "mean_token_accuracy": 0.22100546807050706, "num_tokens": 78746524.0, "step": 45410 }, { "entropy": 5.778104591369629, "epoch": 3.533437074499125, "grad_norm": 1.3125, "learning_rate": 0.0003782230760363454, "loss": 4.8433, "mean_token_accuracy": 0.2119320124387741, "num_tokens": 78755923.0, "step": 45415 }, { "entropy": 5.763756561279297, "epoch": 3.533826103870842, "grad_norm": 1.375, "learning_rate": 0.00037819844841670416, "loss": 4.9219, "mean_token_accuracy": 0.21955807656049728, "num_tokens": 78764862.0, "step": 45420 }, { "entropy": 5.760458374023438, "epoch": 3.5342151332425598, "grad_norm": 1.2421875, "learning_rate": 0.0003781738192311906, "loss": 4.9498, "mean_token_accuracy": 0.20425319373607637, "num_tokens": 78774314.0, "step": 45425 }, { "entropy": 5.805817747116089, "epoch": 3.5346041626142775, "grad_norm": 1.4296875, "learning_rate": 0.00037814918848017855, "loss": 4.9172, "mean_token_accuracy": 0.21271311193704606, "num_tokens": 78783071.0, "step": 45430 }, { "entropy": 5.790188598632812, "epoch": 3.534993191985995, "grad_norm": 1.328125, "learning_rate": 0.0003781245561640418, "loss": 4.983, "mean_token_accuracy": 0.2084636002779007, "num_tokens": 78791405.0, "step": 45435 }, { "entropy": 5.6832047462463375, "epoch": 3.5353822213577124, "grad_norm": 1.375, "learning_rate": 0.0003780999222831541, "loss": 4.9165, "mean_token_accuracy": 0.21687202602624894, "num_tokens": 78800999.0, "step": 45440 }, { "entropy": 5.845284557342529, "epoch": 3.53577125072943, "grad_norm": 1.3828125, "learning_rate": 0.0003780752868378892, "loss": 5.0775, "mean_token_accuracy": 0.2008301094174385, "num_tokens": 78809866.0, "step": 45445 }, { "entropy": 5.799866247177124, "epoch": 3.536160280101148, "grad_norm": 1.359375, "learning_rate": 0.00037805064982862076, "loss": 4.9103, "mean_token_accuracy": 0.21867633163928984, "num_tokens": 78817988.0, "step": 45450 }, { "entropy": 5.866790246963501, "epoch": 3.536549309472865, "grad_norm": 1.3046875, "learning_rate": 0.0003780260112557228, "loss": 5.0193, "mean_token_accuracy": 0.20827557891607285, "num_tokens": 78827649.0, "step": 45455 }, { "entropy": 5.800807619094849, "epoch": 3.5369383388445828, "grad_norm": 1.3046875, "learning_rate": 0.00037800137111956904, "loss": 4.9189, "mean_token_accuracy": 0.21047433167696, "num_tokens": 78836234.0, "step": 45460 }, { "entropy": 5.800545072555542, "epoch": 3.5373273682163004, "grad_norm": 1.4140625, "learning_rate": 0.00037797672942053344, "loss": 4.9603, "mean_token_accuracy": 0.20911024063825606, "num_tokens": 78844348.0, "step": 45465 }, { "entropy": 5.843839883804321, "epoch": 3.537716397588018, "grad_norm": 1.4140625, "learning_rate": 0.00037795208615898997, "loss": 4.9954, "mean_token_accuracy": 0.20615206956863402, "num_tokens": 78853111.0, "step": 45470 }, { "entropy": 5.757743406295776, "epoch": 3.5381054269597354, "grad_norm": 1.2890625, "learning_rate": 0.0003779274413353124, "loss": 4.8934, "mean_token_accuracy": 0.21294367164373398, "num_tokens": 78861846.0, "step": 45475 }, { "entropy": 5.686294889450073, "epoch": 3.538494456331453, "grad_norm": 1.4140625, "learning_rate": 0.00037790279494987475, "loss": 4.8115, "mean_token_accuracy": 0.2280538097023964, "num_tokens": 78870246.0, "step": 45480 }, { "entropy": 5.8200407981872555, "epoch": 3.5388834857031704, "grad_norm": 1.375, "learning_rate": 0.00037787814700305096, "loss": 4.9616, "mean_token_accuracy": 0.21546923220157624, "num_tokens": 78878768.0, "step": 45485 }, { "entropy": 5.77594404220581, "epoch": 3.539272515074888, "grad_norm": 1.2109375, "learning_rate": 0.000377853497495215, "loss": 4.9214, "mean_token_accuracy": 0.21517941504716873, "num_tokens": 78887647.0, "step": 45490 }, { "entropy": 5.8217391014099125, "epoch": 3.5396615444466057, "grad_norm": 1.4921875, "learning_rate": 0.00037782884642674085, "loss": 5.0348, "mean_token_accuracy": 0.21062049716711045, "num_tokens": 78896298.0, "step": 45495 }, { "entropy": 5.816534185409546, "epoch": 3.5400505738183234, "grad_norm": 1.3359375, "learning_rate": 0.0003778041937980028, "loss": 4.9147, "mean_token_accuracy": 0.21762277334928512, "num_tokens": 78905075.0, "step": 45500 }, { "entropy": 5.904707956314087, "epoch": 3.5404396031900407, "grad_norm": 1.375, "learning_rate": 0.00037777953960937467, "loss": 4.986, "mean_token_accuracy": 0.2139839395880699, "num_tokens": 78913151.0, "step": 45505 }, { "entropy": 5.825656795501709, "epoch": 3.5408286325617584, "grad_norm": 1.234375, "learning_rate": 0.00037775488386123057, "loss": 4.9402, "mean_token_accuracy": 0.2101698026061058, "num_tokens": 78922400.0, "step": 45510 }, { "entropy": 5.80955753326416, "epoch": 3.541217661933476, "grad_norm": 1.3125, "learning_rate": 0.00037773022655394466, "loss": 4.9043, "mean_token_accuracy": 0.21352670788764955, "num_tokens": 78930481.0, "step": 45515 }, { "entropy": 5.794823932647705, "epoch": 3.5416066913051933, "grad_norm": 1.421875, "learning_rate": 0.00037770556768789115, "loss": 4.9049, "mean_token_accuracy": 0.2177618607878685, "num_tokens": 78939479.0, "step": 45520 }, { "entropy": 5.773702907562256, "epoch": 3.541995720676911, "grad_norm": 1.3125, "learning_rate": 0.00037768090726344414, "loss": 4.9744, "mean_token_accuracy": 0.20782580673694612, "num_tokens": 78948645.0, "step": 45525 }, { "entropy": 5.803742504119873, "epoch": 3.5423847500486287, "grad_norm": 1.40625, "learning_rate": 0.0003776562452809777, "loss": 4.9022, "mean_token_accuracy": 0.21798108220100404, "num_tokens": 78957361.0, "step": 45530 }, { "entropy": 5.894098424911499, "epoch": 3.5427737794203464, "grad_norm": 1.375, "learning_rate": 0.00037763158174086616, "loss": 4.9921, "mean_token_accuracy": 0.20802320688962936, "num_tokens": 78965187.0, "step": 45535 }, { "entropy": 5.784253835678101, "epoch": 3.5431628087920637, "grad_norm": 1.2890625, "learning_rate": 0.00037760691664348367, "loss": 4.9375, "mean_token_accuracy": 0.2132331058382988, "num_tokens": 78973821.0, "step": 45540 }, { "entropy": 5.797422933578491, "epoch": 3.5435518381637814, "grad_norm": 1.2890625, "learning_rate": 0.0003775822499892046, "loss": 5.0279, "mean_token_accuracy": 0.2042221650481224, "num_tokens": 78982760.0, "step": 45545 }, { "entropy": 5.756853437423706, "epoch": 3.543940867535499, "grad_norm": 1.25, "learning_rate": 0.0003775575817784032, "loss": 4.908, "mean_token_accuracy": 0.2076610505580902, "num_tokens": 78991472.0, "step": 45550 }, { "entropy": 5.846407890319824, "epoch": 3.5443298969072163, "grad_norm": 1.3046875, "learning_rate": 0.00037753291201145375, "loss": 4.9677, "mean_token_accuracy": 0.21355193555355073, "num_tokens": 79000160.0, "step": 45555 }, { "entropy": 5.820409059524536, "epoch": 3.544718926278934, "grad_norm": 1.28125, "learning_rate": 0.0003775082406887305, "loss": 4.9415, "mean_token_accuracy": 0.2084915593266487, "num_tokens": 79008774.0, "step": 45560 }, { "entropy": 5.851904296875, "epoch": 3.5451079556506517, "grad_norm": 1.328125, "learning_rate": 0.00037748356781060785, "loss": 5.0045, "mean_token_accuracy": 0.2060219332575798, "num_tokens": 79017463.0, "step": 45565 }, { "entropy": 5.87205319404602, "epoch": 3.5454969850223694, "grad_norm": 1.453125, "learning_rate": 0.0003774588933774602, "loss": 4.9893, "mean_token_accuracy": 0.21046599000692368, "num_tokens": 79026102.0, "step": 45570 }, { "entropy": 5.739949131011963, "epoch": 3.5458860143940867, "grad_norm": 1.2734375, "learning_rate": 0.0003774342173896619, "loss": 4.8557, "mean_token_accuracy": 0.21847089976072312, "num_tokens": 79034829.0, "step": 45575 }, { "entropy": 5.780197668075561, "epoch": 3.5462750437658044, "grad_norm": 1.2734375, "learning_rate": 0.00037740953984758736, "loss": 5.0232, "mean_token_accuracy": 0.20312078297138214, "num_tokens": 79045120.0, "step": 45580 }, { "entropy": 5.7990889072418215, "epoch": 3.5466640731375216, "grad_norm": 1.2890625, "learning_rate": 0.0003773848607516111, "loss": 4.902, "mean_token_accuracy": 0.21447841376066207, "num_tokens": 79054176.0, "step": 45585 }, { "entropy": 5.778203344345092, "epoch": 3.5470531025092393, "grad_norm": 1.390625, "learning_rate": 0.0003773601801021075, "loss": 4.926, "mean_token_accuracy": 0.21013979166746138, "num_tokens": 79063117.0, "step": 45590 }, { "entropy": 5.824786949157715, "epoch": 3.547442131880957, "grad_norm": 1.3046875, "learning_rate": 0.0003773354978994512, "loss": 5.0832, "mean_token_accuracy": 0.20406679511070253, "num_tokens": 79071680.0, "step": 45595 }, { "entropy": 5.773075962066651, "epoch": 3.5478311612526747, "grad_norm": 1.515625, "learning_rate": 0.00037731081414401653, "loss": 4.8245, "mean_token_accuracy": 0.21982985138893127, "num_tokens": 79080629.0, "step": 45600 }, { "entropy": 5.787632799148559, "epoch": 3.548220190624392, "grad_norm": 1.34375, "learning_rate": 0.00037728612883617806, "loss": 4.9758, "mean_token_accuracy": 0.21303411722183227, "num_tokens": 79088677.0, "step": 45605 }, { "entropy": 5.734530448913574, "epoch": 3.5486092199961097, "grad_norm": 1.2578125, "learning_rate": 0.0003772614419763104, "loss": 4.8513, "mean_token_accuracy": 0.21452268064022065, "num_tokens": 79096835.0, "step": 45610 }, { "entropy": 5.813053321838379, "epoch": 3.5489982493678274, "grad_norm": 1.34375, "learning_rate": 0.0003772367535647882, "loss": 5.0174, "mean_token_accuracy": 0.2075965777039528, "num_tokens": 79105546.0, "step": 45615 }, { "entropy": 5.830370473861694, "epoch": 3.5493872787395446, "grad_norm": 1.40625, "learning_rate": 0.00037721206360198596, "loss": 4.9983, "mean_token_accuracy": 0.21154278814792632, "num_tokens": 79114033.0, "step": 45620 }, { "entropy": 5.792943716049194, "epoch": 3.5497763081112623, "grad_norm": 1.3359375, "learning_rate": 0.0003771873720882783, "loss": 4.8676, "mean_token_accuracy": 0.22482145428657532, "num_tokens": 79122536.0, "step": 45625 }, { "entropy": 5.761644983291626, "epoch": 3.55016533748298, "grad_norm": 1.4140625, "learning_rate": 0.00037716267902403996, "loss": 4.85, "mean_token_accuracy": 0.22303423136472703, "num_tokens": 79130752.0, "step": 45630 }, { "entropy": 5.722925901412964, "epoch": 3.5505543668546977, "grad_norm": 1.265625, "learning_rate": 0.0003771379844096456, "loss": 4.9255, "mean_token_accuracy": 0.21498579531908035, "num_tokens": 79139552.0, "step": 45635 }, { "entropy": 5.832061767578125, "epoch": 3.550943396226415, "grad_norm": 1.3515625, "learning_rate": 0.0003771132882454698, "loss": 4.9336, "mean_token_accuracy": 0.2147759258747101, "num_tokens": 79147739.0, "step": 45640 }, { "entropy": 5.822508811950684, "epoch": 3.5513324255981327, "grad_norm": 1.3046875, "learning_rate": 0.0003770885905318874, "loss": 5.0367, "mean_token_accuracy": 0.20304062217473984, "num_tokens": 79157035.0, "step": 45645 }, { "entropy": 5.753520679473877, "epoch": 3.5517214549698504, "grad_norm": 1.359375, "learning_rate": 0.0003770638912692732, "loss": 4.8464, "mean_token_accuracy": 0.2147069215774536, "num_tokens": 79165888.0, "step": 45650 }, { "entropy": 5.757738876342773, "epoch": 3.5521104843415676, "grad_norm": 1.453125, "learning_rate": 0.0003770391904580019, "loss": 4.8627, "mean_token_accuracy": 0.21802772730588912, "num_tokens": 79173908.0, "step": 45655 }, { "entropy": 5.733634424209595, "epoch": 3.5524995137132853, "grad_norm": 1.4921875, "learning_rate": 0.0003770144880984482, "loss": 4.9561, "mean_token_accuracy": 0.21057008057832718, "num_tokens": 79182667.0, "step": 45660 }, { "entropy": 5.72923846244812, "epoch": 3.552888543085003, "grad_norm": 1.328125, "learning_rate": 0.00037698978419098704, "loss": 4.9604, "mean_token_accuracy": 0.2093519002199173, "num_tokens": 79191947.0, "step": 45665 }, { "entropy": 5.790074062347412, "epoch": 3.5532775724567207, "grad_norm": 1.2421875, "learning_rate": 0.00037696507873599336, "loss": 4.9173, "mean_token_accuracy": 0.21332127302885057, "num_tokens": 79200903.0, "step": 45670 }, { "entropy": 5.894024753570557, "epoch": 3.553666601828438, "grad_norm": 1.2421875, "learning_rate": 0.00037694037173384177, "loss": 5.0276, "mean_token_accuracy": 0.2059596449136734, "num_tokens": 79209804.0, "step": 45675 }, { "entropy": 5.819315671920776, "epoch": 3.5540556312001557, "grad_norm": 1.265625, "learning_rate": 0.0003769156631849074, "loss": 4.9713, "mean_token_accuracy": 0.20824913382530214, "num_tokens": 79219023.0, "step": 45680 }, { "entropy": 5.776279592514038, "epoch": 3.554444660571873, "grad_norm": 1.296875, "learning_rate": 0.000376890953089565, "loss": 4.9125, "mean_token_accuracy": 0.2251773178577423, "num_tokens": 79227903.0, "step": 45685 }, { "entropy": 5.73232421875, "epoch": 3.5548336899435906, "grad_norm": 1.3125, "learning_rate": 0.0003768662414481895, "loss": 4.9276, "mean_token_accuracy": 0.2159269168972969, "num_tokens": 79236656.0, "step": 45690 }, { "entropy": 5.778097867965698, "epoch": 3.5552227193153083, "grad_norm": 1.265625, "learning_rate": 0.00037684152826115595, "loss": 4.8366, "mean_token_accuracy": 0.21674580872058868, "num_tokens": 79244506.0, "step": 45695 }, { "entropy": 5.792387914657593, "epoch": 3.555611748687026, "grad_norm": 1.3046875, "learning_rate": 0.0003768168135288394, "loss": 4.9895, "mean_token_accuracy": 0.21014923751354217, "num_tokens": 79253434.0, "step": 45700 }, { "entropy": 5.805368041992187, "epoch": 3.5560007780587437, "grad_norm": 1.34375, "learning_rate": 0.0003767920972516147, "loss": 4.9366, "mean_token_accuracy": 0.21195675432682037, "num_tokens": 79261465.0, "step": 45705 }, { "entropy": 5.7188272953033445, "epoch": 3.556389807430461, "grad_norm": 1.2578125, "learning_rate": 0.00037676737942985697, "loss": 4.8315, "mean_token_accuracy": 0.2209422320127487, "num_tokens": 79270588.0, "step": 45710 }, { "entropy": 5.867591524124146, "epoch": 3.5567788368021787, "grad_norm": 1.4375, "learning_rate": 0.00037674266006394123, "loss": 4.9708, "mean_token_accuracy": 0.2134295329451561, "num_tokens": 79279531.0, "step": 45715 }, { "entropy": 5.814846706390381, "epoch": 3.557167866173896, "grad_norm": 1.359375, "learning_rate": 0.00037671793915424254, "loss": 4.9433, "mean_token_accuracy": 0.21679361164569855, "num_tokens": 79288625.0, "step": 45720 }, { "entropy": 5.7889608383178714, "epoch": 3.5575568955456136, "grad_norm": 1.34375, "learning_rate": 0.000376693216701136, "loss": 4.9611, "mean_token_accuracy": 0.2124807357788086, "num_tokens": 79296632.0, "step": 45725 }, { "entropy": 5.830271911621094, "epoch": 3.5579459249173313, "grad_norm": 1.3359375, "learning_rate": 0.0003766684927049968, "loss": 4.9315, "mean_token_accuracy": 0.20963082313537598, "num_tokens": 79305275.0, "step": 45730 }, { "entropy": 5.865696859359741, "epoch": 3.558334954289049, "grad_norm": 1.2421875, "learning_rate": 0.0003766437671662, "loss": 5.0015, "mean_token_accuracy": 0.20421169102191924, "num_tokens": 79314686.0, "step": 45735 }, { "entropy": 5.7749182224273685, "epoch": 3.5587239836607663, "grad_norm": 1.328125, "learning_rate": 0.0003766190400851209, "loss": 4.8982, "mean_token_accuracy": 0.21576780676841736, "num_tokens": 79323594.0, "step": 45740 }, { "entropy": 5.864116764068603, "epoch": 3.559113013032484, "grad_norm": 1.265625, "learning_rate": 0.0003765943114621345, "loss": 5.0364, "mean_token_accuracy": 0.204942087829113, "num_tokens": 79332762.0, "step": 45745 }, { "entropy": 5.870150136947632, "epoch": 3.5595020424042016, "grad_norm": 1.3203125, "learning_rate": 0.00037656958129761626, "loss": 4.9982, "mean_token_accuracy": 0.20333393961191176, "num_tokens": 79341827.0, "step": 45750 }, { "entropy": 5.818808889389038, "epoch": 3.559891071775919, "grad_norm": 1.375, "learning_rate": 0.00037654484959194126, "loss": 4.8997, "mean_token_accuracy": 0.21051836609840394, "num_tokens": 79350109.0, "step": 45755 }, { "entropy": 5.7596488952636715, "epoch": 3.5602801011476366, "grad_norm": 1.3515625, "learning_rate": 0.00037652011634548466, "loss": 4.9363, "mean_token_accuracy": 0.21303477138280869, "num_tokens": 79359115.0, "step": 45760 }, { "entropy": 5.820421552658081, "epoch": 3.5606691305193543, "grad_norm": 1.3359375, "learning_rate": 0.000376495381558622, "loss": 5.0108, "mean_token_accuracy": 0.20028353333473206, "num_tokens": 79368472.0, "step": 45765 }, { "entropy": 5.787241458892822, "epoch": 3.561058159891072, "grad_norm": 1.4375, "learning_rate": 0.0003764706452317284, "loss": 4.8963, "mean_token_accuracy": 0.21225079596042634, "num_tokens": 79376988.0, "step": 45770 }, { "entropy": 5.823366594314575, "epoch": 3.5614471892627892, "grad_norm": 1.359375, "learning_rate": 0.00037644590736517935, "loss": 4.9787, "mean_token_accuracy": 0.2112113356590271, "num_tokens": 79385913.0, "step": 45775 }, { "entropy": 5.790377998352051, "epoch": 3.561836218634507, "grad_norm": 1.34375, "learning_rate": 0.0003764211679593501, "loss": 4.9001, "mean_token_accuracy": 0.2151399791240692, "num_tokens": 79393777.0, "step": 45780 }, { "entropy": 5.743767356872558, "epoch": 3.562225248006224, "grad_norm": 1.28125, "learning_rate": 0.00037639642701461603, "loss": 4.7995, "mean_token_accuracy": 0.22624871581792833, "num_tokens": 79402150.0, "step": 45785 }, { "entropy": 5.779432916641236, "epoch": 3.562614277377942, "grad_norm": 1.3203125, "learning_rate": 0.0003763716845313526, "loss": 4.9922, "mean_token_accuracy": 0.2091594621539116, "num_tokens": 79410836.0, "step": 45790 }, { "entropy": 5.760116815567017, "epoch": 3.5630033067496596, "grad_norm": 1.3203125, "learning_rate": 0.0003763469405099352, "loss": 4.986, "mean_token_accuracy": 0.20372284799814225, "num_tokens": 79419638.0, "step": 45795 }, { "entropy": 5.757781267166138, "epoch": 3.5633923361213773, "grad_norm": 1.3203125, "learning_rate": 0.0003763221949507392, "loss": 4.9403, "mean_token_accuracy": 0.2117021605372429, "num_tokens": 79427749.0, "step": 45800 }, { "entropy": 5.719192981719971, "epoch": 3.563781365493095, "grad_norm": 1.4765625, "learning_rate": 0.00037629744785414027, "loss": 4.8782, "mean_token_accuracy": 0.21410184800624849, "num_tokens": 79436647.0, "step": 45805 }, { "entropy": 5.757330465316772, "epoch": 3.5641703948648122, "grad_norm": 1.34375, "learning_rate": 0.00037627269922051377, "loss": 4.9283, "mean_token_accuracy": 0.2202155828475952, "num_tokens": 79445599.0, "step": 45810 }, { "entropy": 5.873253726959229, "epoch": 3.56455942423653, "grad_norm": 1.1875, "learning_rate": 0.00037624794905023523, "loss": 4.9884, "mean_token_accuracy": 0.20748904943466187, "num_tokens": 79454606.0, "step": 45815 }, { "entropy": 5.791073656082153, "epoch": 3.564948453608247, "grad_norm": 1.3046875, "learning_rate": 0.0003762231973436802, "loss": 4.8984, "mean_token_accuracy": 0.2182355135679245, "num_tokens": 79463543.0, "step": 45820 }, { "entropy": 5.767453861236572, "epoch": 3.565337482979965, "grad_norm": 1.4140625, "learning_rate": 0.0003761984441012243, "loss": 4.9959, "mean_token_accuracy": 0.21109696626663207, "num_tokens": 79472161.0, "step": 45825 }, { "entropy": 5.81695327758789, "epoch": 3.5657265123516826, "grad_norm": 1.3671875, "learning_rate": 0.0003761736893232431, "loss": 4.9628, "mean_token_accuracy": 0.2139684170484543, "num_tokens": 79481300.0, "step": 45830 }, { "entropy": 5.878881740570068, "epoch": 3.5661155417234003, "grad_norm": 1.34375, "learning_rate": 0.00037614893301011223, "loss": 5.0965, "mean_token_accuracy": 0.2033648356795311, "num_tokens": 79490371.0, "step": 45835 }, { "entropy": 5.818865776062012, "epoch": 3.5665045710951175, "grad_norm": 1.3125, "learning_rate": 0.0003761241751622072, "loss": 5.0025, "mean_token_accuracy": 0.21251972168684005, "num_tokens": 79499510.0, "step": 45840 }, { "entropy": 5.811166286468506, "epoch": 3.5668936004668352, "grad_norm": 1.3515625, "learning_rate": 0.0003760994157799038, "loss": 5.0193, "mean_token_accuracy": 0.20051506608724595, "num_tokens": 79508705.0, "step": 45845 }, { "entropy": 5.747090435028076, "epoch": 3.567282629838553, "grad_norm": 1.3671875, "learning_rate": 0.0003760746548635777, "loss": 4.8417, "mean_token_accuracy": 0.21802288442850112, "num_tokens": 79517351.0, "step": 45850 }, { "entropy": 5.786408805847168, "epoch": 3.56767165921027, "grad_norm": 1.375, "learning_rate": 0.0003760498924136046, "loss": 4.9629, "mean_token_accuracy": 0.2140167236328125, "num_tokens": 79525542.0, "step": 45855 }, { "entropy": 5.806455945968628, "epoch": 3.568060688581988, "grad_norm": 1.265625, "learning_rate": 0.00037602512843036025, "loss": 4.9609, "mean_token_accuracy": 0.21734960079193116, "num_tokens": 79534293.0, "step": 45860 }, { "entropy": 5.904753828048706, "epoch": 3.5684497179537056, "grad_norm": 1.359375, "learning_rate": 0.0003760003629142203, "loss": 5.082, "mean_token_accuracy": 0.19663709849119188, "num_tokens": 79542588.0, "step": 45865 }, { "entropy": 5.792313575744629, "epoch": 3.5688387473254233, "grad_norm": 1.265625, "learning_rate": 0.00037597559586556063, "loss": 4.9469, "mean_token_accuracy": 0.2166554644703865, "num_tokens": 79551651.0, "step": 45870 }, { "entropy": 5.88037805557251, "epoch": 3.5692277766971405, "grad_norm": 1.3671875, "learning_rate": 0.000375950827284757, "loss": 5.0683, "mean_token_accuracy": 0.20535512268543243, "num_tokens": 79560752.0, "step": 45875 }, { "entropy": 5.853493785858154, "epoch": 3.5696168060688582, "grad_norm": 1.3125, "learning_rate": 0.00037592605717218523, "loss": 4.9053, "mean_token_accuracy": 0.2127401977777481, "num_tokens": 79569655.0, "step": 45880 }, { "entropy": 5.831473731994629, "epoch": 3.570005835440576, "grad_norm": 1.296875, "learning_rate": 0.00037590128552822123, "loss": 4.8866, "mean_token_accuracy": 0.21507970690727235, "num_tokens": 79578070.0, "step": 45885 }, { "entropy": 5.787441635131836, "epoch": 3.570394864812293, "grad_norm": 1.265625, "learning_rate": 0.0003758765123532407, "loss": 4.9225, "mean_token_accuracy": 0.2134702533483505, "num_tokens": 79587444.0, "step": 45890 }, { "entropy": 5.787675142288208, "epoch": 3.570783894184011, "grad_norm": 1.265625, "learning_rate": 0.0003758517376476198, "loss": 4.963, "mean_token_accuracy": 0.21039333194494247, "num_tokens": 79596259.0, "step": 45895 }, { "entropy": 5.8233551502227785, "epoch": 3.5711729235557286, "grad_norm": 1.4375, "learning_rate": 0.00037582696141173435, "loss": 5.0194, "mean_token_accuracy": 0.20775807052850723, "num_tokens": 79604984.0, "step": 45900 }, { "entropy": 5.802441740036011, "epoch": 3.5715619529274463, "grad_norm": 1.328125, "learning_rate": 0.00037580218364596015, "loss": 4.9383, "mean_token_accuracy": 0.21516277492046357, "num_tokens": 79613445.0, "step": 45905 }, { "entropy": 5.684372806549073, "epoch": 3.5719509822991635, "grad_norm": 1.3046875, "learning_rate": 0.00037577740435067327, "loss": 4.7679, "mean_token_accuracy": 0.2205743357539177, "num_tokens": 79621879.0, "step": 45910 }, { "entropy": 5.727406454086304, "epoch": 3.572340011670881, "grad_norm": 1.328125, "learning_rate": 0.00037575262352624965, "loss": 4.9186, "mean_token_accuracy": 0.21073272675275803, "num_tokens": 79630139.0, "step": 45915 }, { "entropy": 5.7289306163787845, "epoch": 3.5727290410425985, "grad_norm": 1.21875, "learning_rate": 0.00037572784117306535, "loss": 4.8986, "mean_token_accuracy": 0.21883398294448853, "num_tokens": 79638890.0, "step": 45920 }, { "entropy": 5.7716775894165036, "epoch": 3.573118070414316, "grad_norm": 1.2734375, "learning_rate": 0.0003757030572914963, "loss": 4.9628, "mean_token_accuracy": 0.216367968916893, "num_tokens": 79647913.0, "step": 45925 }, { "entropy": 5.735942554473877, "epoch": 3.573507099786034, "grad_norm": 1.3046875, "learning_rate": 0.0003756782718819188, "loss": 4.8367, "mean_token_accuracy": 0.23060536831617356, "num_tokens": 79656119.0, "step": 45930 }, { "entropy": 5.724011373519898, "epoch": 3.5738961291577516, "grad_norm": 1.3359375, "learning_rate": 0.00037565348494470873, "loss": 4.8608, "mean_token_accuracy": 0.21499150097370148, "num_tokens": 79664223.0, "step": 45935 }, { "entropy": 5.7903515815734865, "epoch": 3.574285158529469, "grad_norm": 1.2109375, "learning_rate": 0.0003756286964802422, "loss": 5.0824, "mean_token_accuracy": 0.20209017246961594, "num_tokens": 79673227.0, "step": 45940 }, { "entropy": 5.784465646743774, "epoch": 3.5746741879011865, "grad_norm": 1.359375, "learning_rate": 0.0003756039064888954, "loss": 4.9115, "mean_token_accuracy": 0.21951641738414765, "num_tokens": 79682107.0, "step": 45945 }, { "entropy": 5.764537525177002, "epoch": 3.575063217272904, "grad_norm": 1.3359375, "learning_rate": 0.0003755791149710444, "loss": 4.8682, "mean_token_accuracy": 0.21879131644964217, "num_tokens": 79690231.0, "step": 45950 }, { "entropy": 5.7277425765991214, "epoch": 3.5754522466446215, "grad_norm": 1.4453125, "learning_rate": 0.00037555432192706547, "loss": 4.9403, "mean_token_accuracy": 0.2179669439792633, "num_tokens": 79698117.0, "step": 45955 }, { "entropy": 5.797821521759033, "epoch": 3.575841276016339, "grad_norm": 1.34375, "learning_rate": 0.00037552952735733466, "loss": 4.918, "mean_token_accuracy": 0.22032899558544158, "num_tokens": 79707301.0, "step": 45960 }, { "entropy": 5.8143998146057125, "epoch": 3.576230305388057, "grad_norm": 1.375, "learning_rate": 0.0003755047312622283, "loss": 5.0272, "mean_token_accuracy": 0.2020946428179741, "num_tokens": 79715547.0, "step": 45965 }, { "entropy": 5.782806491851806, "epoch": 3.5766193347597746, "grad_norm": 1.296875, "learning_rate": 0.00037547993364212267, "loss": 4.9266, "mean_token_accuracy": 0.2154175654053688, "num_tokens": 79724244.0, "step": 45970 }, { "entropy": 5.845580196380615, "epoch": 3.577008364131492, "grad_norm": 1.3203125, "learning_rate": 0.000375455134497394, "loss": 4.991, "mean_token_accuracy": 0.2138822227716446, "num_tokens": 79733001.0, "step": 45975 }, { "entropy": 5.725759267807007, "epoch": 3.5773973935032095, "grad_norm": 1.3125, "learning_rate": 0.0003754303338284186, "loss": 4.8818, "mean_token_accuracy": 0.21847364604473113, "num_tokens": 79741821.0, "step": 45980 }, { "entropy": 5.740760374069214, "epoch": 3.577786422874927, "grad_norm": 1.2734375, "learning_rate": 0.00037540553163557263, "loss": 4.8798, "mean_token_accuracy": 0.21876145750284196, "num_tokens": 79750729.0, "step": 45985 }, { "entropy": 5.732310247421265, "epoch": 3.5781754522466445, "grad_norm": 1.359375, "learning_rate": 0.00037538072791923257, "loss": 4.8623, "mean_token_accuracy": 0.21169619411230087, "num_tokens": 79759597.0, "step": 45990 }, { "entropy": 5.813152408599853, "epoch": 3.578564481618362, "grad_norm": 1.3828125, "learning_rate": 0.00037535592267977467, "loss": 4.9701, "mean_token_accuracy": 0.20453510135412217, "num_tokens": 79768500.0, "step": 45995 }, { "entropy": 5.885359573364258, "epoch": 3.57895351099008, "grad_norm": 1.3046875, "learning_rate": 0.0003753311159175754, "loss": 5.1016, "mean_token_accuracy": 0.20771556198596955, "num_tokens": 79777747.0, "step": 46000 }, { "entropy": 5.835975074768067, "epoch": 3.5793425403617976, "grad_norm": 1.453125, "learning_rate": 0.00037530630763301113, "loss": 4.9331, "mean_token_accuracy": 0.2184900552034378, "num_tokens": 79786033.0, "step": 46005 }, { "entropy": 5.719406032562256, "epoch": 3.579731569733515, "grad_norm": 1.34375, "learning_rate": 0.0003752814978264584, "loss": 4.9088, "mean_token_accuracy": 0.21667373776435853, "num_tokens": 79795143.0, "step": 46010 }, { "entropy": 5.752248096466064, "epoch": 3.5801205991052325, "grad_norm": 1.3984375, "learning_rate": 0.0003752566864982934, "loss": 4.9587, "mean_token_accuracy": 0.21427129209041595, "num_tokens": 79804110.0, "step": 46015 }, { "entropy": 5.740458011627197, "epoch": 3.5805096284769498, "grad_norm": 1.3828125, "learning_rate": 0.00037523187364889293, "loss": 4.7865, "mean_token_accuracy": 0.22562515288591384, "num_tokens": 79812538.0, "step": 46020 }, { "entropy": 5.798637962341308, "epoch": 3.5808986578486675, "grad_norm": 1.328125, "learning_rate": 0.0003752070592786332, "loss": 4.9725, "mean_token_accuracy": 0.21472149193286896, "num_tokens": 79821730.0, "step": 46025 }, { "entropy": 5.778572511672974, "epoch": 3.581287687220385, "grad_norm": 1.3671875, "learning_rate": 0.00037518224338789084, "loss": 4.9169, "mean_token_accuracy": 0.21569084376096725, "num_tokens": 79829950.0, "step": 46030 }, { "entropy": 5.79010124206543, "epoch": 3.581676716592103, "grad_norm": 1.25, "learning_rate": 0.0003751574259770424, "loss": 4.9647, "mean_token_accuracy": 0.2083486169576645, "num_tokens": 79838723.0, "step": 46035 }, { "entropy": 5.841555213928222, "epoch": 3.58206574596382, "grad_norm": 1.4296875, "learning_rate": 0.0003751326070464645, "loss": 4.9667, "mean_token_accuracy": 0.20630229115486146, "num_tokens": 79846908.0, "step": 46040 }, { "entropy": 5.781336641311645, "epoch": 3.582454775335538, "grad_norm": 1.328125, "learning_rate": 0.0003751077865965337, "loss": 4.8723, "mean_token_accuracy": 0.21865664124488832, "num_tokens": 79855127.0, "step": 46045 }, { "entropy": 5.890072345733643, "epoch": 3.5828438047072555, "grad_norm": 1.3515625, "learning_rate": 0.00037508296462762647, "loss": 5.0222, "mean_token_accuracy": 0.2119183599948883, "num_tokens": 79864144.0, "step": 46050 }, { "entropy": 5.747876214981079, "epoch": 3.5832328340789728, "grad_norm": 1.3828125, "learning_rate": 0.00037505814114011956, "loss": 4.8865, "mean_token_accuracy": 0.22217923402786255, "num_tokens": 79872325.0, "step": 46055 }, { "entropy": 5.749766731262207, "epoch": 3.5836218634506904, "grad_norm": 1.359375, "learning_rate": 0.00037503331613438965, "loss": 4.8844, "mean_token_accuracy": 0.2188735008239746, "num_tokens": 79880787.0, "step": 46060 }, { "entropy": 5.77577772140503, "epoch": 3.584010892822408, "grad_norm": 1.34375, "learning_rate": 0.00037500848961081334, "loss": 4.9413, "mean_token_accuracy": 0.21478435397148132, "num_tokens": 79889320.0, "step": 46065 }, { "entropy": 5.784390830993653, "epoch": 3.584399922194126, "grad_norm": 1.265625, "learning_rate": 0.00037498366156976746, "loss": 4.9133, "mean_token_accuracy": 0.2137455403804779, "num_tokens": 79898187.0, "step": 46070 }, { "entropy": 5.769625329971314, "epoch": 3.584788951565843, "grad_norm": 1.2890625, "learning_rate": 0.00037495883201162854, "loss": 4.9368, "mean_token_accuracy": 0.20776156187057496, "num_tokens": 79907490.0, "step": 46075 }, { "entropy": 5.721699857711792, "epoch": 3.585177980937561, "grad_norm": 1.28125, "learning_rate": 0.0003749340009367736, "loss": 4.8246, "mean_token_accuracy": 0.22321154773235322, "num_tokens": 79915644.0, "step": 46080 }, { "entropy": 5.814938879013061, "epoch": 3.5855670103092785, "grad_norm": 1.296875, "learning_rate": 0.00037490916834557916, "loss": 4.8992, "mean_token_accuracy": 0.21523074358701705, "num_tokens": 79923991.0, "step": 46085 }, { "entropy": 5.799943971633911, "epoch": 3.5859560396809957, "grad_norm": 1.3671875, "learning_rate": 0.0003748843342384221, "loss": 4.9969, "mean_token_accuracy": 0.20668514221906661, "num_tokens": 79932727.0, "step": 46090 }, { "entropy": 5.8021032333374025, "epoch": 3.5863450690527134, "grad_norm": 1.359375, "learning_rate": 0.00037485949861567925, "loss": 4.9435, "mean_token_accuracy": 0.21377895772457123, "num_tokens": 79941978.0, "step": 46095 }, { "entropy": 5.813357210159301, "epoch": 3.586734098424431, "grad_norm": 1.40625, "learning_rate": 0.0003748346614777275, "loss": 5.0185, "mean_token_accuracy": 0.20584224164485931, "num_tokens": 79951050.0, "step": 46100 }, { "entropy": 5.801635789871216, "epoch": 3.587123127796149, "grad_norm": 1.3203125, "learning_rate": 0.0003748098228249437, "loss": 5.0346, "mean_token_accuracy": 0.204413565993309, "num_tokens": 79960361.0, "step": 46105 }, { "entropy": 5.771216678619385, "epoch": 3.587512157167866, "grad_norm": 1.375, "learning_rate": 0.00037478498265770463, "loss": 4.9994, "mean_token_accuracy": 0.21523209512233735, "num_tokens": 79969399.0, "step": 46110 }, { "entropy": 5.85726752281189, "epoch": 3.587901186539584, "grad_norm": 1.3203125, "learning_rate": 0.0003747601409763872, "loss": 4.9715, "mean_token_accuracy": 0.20794013738632203, "num_tokens": 79977587.0, "step": 46115 }, { "entropy": 5.785594463348389, "epoch": 3.588290215911301, "grad_norm": 1.4375, "learning_rate": 0.00037473529778136853, "loss": 4.8531, "mean_token_accuracy": 0.21455038338899612, "num_tokens": 79985875.0, "step": 46120 }, { "entropy": 5.763126373291016, "epoch": 3.5886792452830187, "grad_norm": 1.40625, "learning_rate": 0.00037471045307302544, "loss": 4.9662, "mean_token_accuracy": 0.21076056361198425, "num_tokens": 79994002.0, "step": 46125 }, { "entropy": 5.746276187896728, "epoch": 3.5890682746547364, "grad_norm": 1.4140625, "learning_rate": 0.00037468560685173497, "loss": 4.8628, "mean_token_accuracy": 0.2198118105530739, "num_tokens": 80002008.0, "step": 46130 }, { "entropy": 5.790261840820312, "epoch": 3.589457304026454, "grad_norm": 1.3046875, "learning_rate": 0.000374660759117874, "loss": 4.8908, "mean_token_accuracy": 0.22141229957342148, "num_tokens": 80010684.0, "step": 46135 }, { "entropy": 5.870513439178467, "epoch": 3.589846333398172, "grad_norm": 1.1875, "learning_rate": 0.00037463590987181966, "loss": 5.0369, "mean_token_accuracy": 0.21402999013662338, "num_tokens": 80019700.0, "step": 46140 }, { "entropy": 5.7605870246887205, "epoch": 3.590235362769889, "grad_norm": 1.234375, "learning_rate": 0.00037461105911394904, "loss": 4.8443, "mean_token_accuracy": 0.21756132543087006, "num_tokens": 80028175.0, "step": 46145 }, { "entropy": 5.790295743942261, "epoch": 3.590624392141607, "grad_norm": 1.328125, "learning_rate": 0.00037458620684463907, "loss": 4.9516, "mean_token_accuracy": 0.21332819014787674, "num_tokens": 80037149.0, "step": 46150 }, { "entropy": 5.7860071659088135, "epoch": 3.591013421513324, "grad_norm": 1.2890625, "learning_rate": 0.00037456135306426693, "loss": 4.8941, "mean_token_accuracy": 0.21168828159570693, "num_tokens": 80045007.0, "step": 46155 }, { "entropy": 5.768174266815185, "epoch": 3.5914024508850417, "grad_norm": 1.296875, "learning_rate": 0.0003745364977732097, "loss": 4.9674, "mean_token_accuracy": 0.208631631731987, "num_tokens": 80053514.0, "step": 46160 }, { "entropy": 5.832877159118652, "epoch": 3.5917914802567594, "grad_norm": 1.375, "learning_rate": 0.0003745116409718446, "loss": 4.9879, "mean_token_accuracy": 0.2064157873392105, "num_tokens": 80062645.0, "step": 46165 }, { "entropy": 5.830390596389771, "epoch": 3.592180509628477, "grad_norm": 1.3046875, "learning_rate": 0.0003744867826605488, "loss": 4.9273, "mean_token_accuracy": 0.2099575400352478, "num_tokens": 80070427.0, "step": 46170 }, { "entropy": 5.877482509613037, "epoch": 3.5925695390001944, "grad_norm": 1.3125, "learning_rate": 0.0003744619228396993, "loss": 5.0762, "mean_token_accuracy": 0.20259436070919037, "num_tokens": 80079355.0, "step": 46175 }, { "entropy": 5.768975687026978, "epoch": 3.592958568371912, "grad_norm": 1.34375, "learning_rate": 0.0003744370615096734, "loss": 4.9024, "mean_token_accuracy": 0.21251513361930846, "num_tokens": 80087906.0, "step": 46180 }, { "entropy": 5.8231452941894535, "epoch": 3.5933475977436298, "grad_norm": 1.21875, "learning_rate": 0.0003744121986708485, "loss": 5.0125, "mean_token_accuracy": 0.20305330455303192, "num_tokens": 80096179.0, "step": 46185 }, { "entropy": 5.848571395874023, "epoch": 3.593736627115347, "grad_norm": 1.2265625, "learning_rate": 0.00037438733432360163, "loss": 4.9774, "mean_token_accuracy": 0.20679403096437454, "num_tokens": 80104539.0, "step": 46190 }, { "entropy": 5.7761305809021, "epoch": 3.5941256564870647, "grad_norm": 1.3203125, "learning_rate": 0.0003743624684683102, "loss": 4.9714, "mean_token_accuracy": 0.20879078209400176, "num_tokens": 80112798.0, "step": 46195 }, { "entropy": 5.845119619369507, "epoch": 3.5945146858587824, "grad_norm": 1.4765625, "learning_rate": 0.0003743376011053514, "loss": 5.1072, "mean_token_accuracy": 0.1998143896460533, "num_tokens": 80121480.0, "step": 46200 }, { "entropy": 5.869574928283692, "epoch": 3.5949037152305, "grad_norm": 1.375, "learning_rate": 0.00037431273223510265, "loss": 4.9507, "mean_token_accuracy": 0.2079964682459831, "num_tokens": 80130068.0, "step": 46205 }, { "entropy": 5.776275157928467, "epoch": 3.5952927446022174, "grad_norm": 1.2578125, "learning_rate": 0.0003742878618579413, "loss": 4.9072, "mean_token_accuracy": 0.21802653074264527, "num_tokens": 80139434.0, "step": 46210 }, { "entropy": 5.861506366729737, "epoch": 3.595681773973935, "grad_norm": 1.2734375, "learning_rate": 0.0003742629899742446, "loss": 5.0803, "mean_token_accuracy": 0.19995256960392, "num_tokens": 80147858.0, "step": 46215 }, { "entropy": 5.795623922348023, "epoch": 3.5960708033456523, "grad_norm": 1.3125, "learning_rate": 0.00037423811658439014, "loss": 4.9442, "mean_token_accuracy": 0.21821559518575667, "num_tokens": 80156803.0, "step": 46220 }, { "entropy": 5.767368984222412, "epoch": 3.59645983271737, "grad_norm": 1.25, "learning_rate": 0.00037421324168875503, "loss": 4.8406, "mean_token_accuracy": 0.2240346223115921, "num_tokens": 80165464.0, "step": 46225 }, { "entropy": 5.825710248947144, "epoch": 3.5968488620890877, "grad_norm": 1.2421875, "learning_rate": 0.000374188365287717, "loss": 4.9907, "mean_token_accuracy": 0.20965728759765626, "num_tokens": 80173875.0, "step": 46230 }, { "entropy": 5.733244323730469, "epoch": 3.5972378914608054, "grad_norm": 1.2421875, "learning_rate": 0.0003741634873816534, "loss": 4.7986, "mean_token_accuracy": 0.22824711352586746, "num_tokens": 80183263.0, "step": 46235 }, { "entropy": 5.837101697921753, "epoch": 3.597626920832523, "grad_norm": 1.2109375, "learning_rate": 0.00037413860797094175, "loss": 5.041, "mean_token_accuracy": 0.2051907867193222, "num_tokens": 80192295.0, "step": 46240 }, { "entropy": 5.759378290176391, "epoch": 3.5980159502042404, "grad_norm": 1.328125, "learning_rate": 0.00037411372705595947, "loss": 4.9451, "mean_token_accuracy": 0.21273817718029023, "num_tokens": 80200397.0, "step": 46245 }, { "entropy": 5.7736897468566895, "epoch": 3.598404979575958, "grad_norm": 1.265625, "learning_rate": 0.0003740888446370842, "loss": 4.9042, "mean_token_accuracy": 0.2153225377202034, "num_tokens": 80209150.0, "step": 46250 }, { "entropy": 5.872681665420532, "epoch": 3.5987940089476753, "grad_norm": 1.2578125, "learning_rate": 0.0003740639607146933, "loss": 5.0626, "mean_token_accuracy": 0.2034439653158188, "num_tokens": 80218218.0, "step": 46255 }, { "entropy": 5.824189853668213, "epoch": 3.599183038319393, "grad_norm": 1.4296875, "learning_rate": 0.00037403907528916455, "loss": 4.9307, "mean_token_accuracy": 0.22059766799211503, "num_tokens": 80226811.0, "step": 46260 }, { "entropy": 5.884413957595825, "epoch": 3.5995720676911107, "grad_norm": 1.515625, "learning_rate": 0.0003740141883608755, "loss": 5.0436, "mean_token_accuracy": 0.20581759810447692, "num_tokens": 80234802.0, "step": 46265 }, { "entropy": 5.770146417617798, "epoch": 3.5999610970628284, "grad_norm": 1.3671875, "learning_rate": 0.0003739892999302037, "loss": 4.8616, "mean_token_accuracy": 0.22219782918691636, "num_tokens": 80243216.0, "step": 46270 }, { "entropy": 5.80918869972229, "epoch": 3.6003501264345457, "grad_norm": 1.421875, "learning_rate": 0.0003739644099975269, "loss": 4.9092, "mean_token_accuracy": 0.21303130686283112, "num_tokens": 80251293.0, "step": 46275 }, { "entropy": 5.729293251037598, "epoch": 3.6007391558062634, "grad_norm": 1.34375, "learning_rate": 0.00037393951856322263, "loss": 4.907, "mean_token_accuracy": 0.21701274812221527, "num_tokens": 80259455.0, "step": 46280 }, { "entropy": 5.732075881958008, "epoch": 3.601128185177981, "grad_norm": 1.3515625, "learning_rate": 0.0003739146256276686, "loss": 4.8861, "mean_token_accuracy": 0.21778518259525298, "num_tokens": 80268207.0, "step": 46285 }, { "entropy": 5.814977931976318, "epoch": 3.6015172145496983, "grad_norm": 1.421875, "learning_rate": 0.00037388973119124267, "loss": 4.946, "mean_token_accuracy": 0.20817862302064896, "num_tokens": 80276700.0, "step": 46290 }, { "entropy": 5.728993129730225, "epoch": 3.601906243921416, "grad_norm": 1.2890625, "learning_rate": 0.0003738648352543224, "loss": 4.8725, "mean_token_accuracy": 0.2171982377767563, "num_tokens": 80285322.0, "step": 46295 }, { "entropy": 5.8055178165435795, "epoch": 3.6022952732931337, "grad_norm": 1.3046875, "learning_rate": 0.0003738399378172856, "loss": 5.0332, "mean_token_accuracy": 0.20672914385795593, "num_tokens": 80295593.0, "step": 46300 }, { "entropy": 5.906806087493896, "epoch": 3.6026843026648514, "grad_norm": 1.375, "learning_rate": 0.0003738150388805101, "loss": 5.0472, "mean_token_accuracy": 0.2043824702501297, "num_tokens": 80305576.0, "step": 46305 }, { "entropy": 5.850510978698731, "epoch": 3.6030733320365687, "grad_norm": 1.34375, "learning_rate": 0.00037379013844437373, "loss": 4.9294, "mean_token_accuracy": 0.2131205677986145, "num_tokens": 80314181.0, "step": 46310 }, { "entropy": 5.814906215667724, "epoch": 3.6034623614082864, "grad_norm": 1.3515625, "learning_rate": 0.00037376523650925415, "loss": 4.9525, "mean_token_accuracy": 0.2077443853020668, "num_tokens": 80322637.0, "step": 46315 }, { "entropy": 5.843758392333984, "epoch": 3.603851390780004, "grad_norm": 1.3125, "learning_rate": 0.0003737403330755293, "loss": 4.9425, "mean_token_accuracy": 0.21473028212785722, "num_tokens": 80331331.0, "step": 46320 }, { "entropy": 5.756258726119995, "epoch": 3.6042404201517213, "grad_norm": 1.4140625, "learning_rate": 0.0003737154281435771, "loss": 4.8858, "mean_token_accuracy": 0.22059810608625413, "num_tokens": 80340171.0, "step": 46325 }, { "entropy": 5.827457904815674, "epoch": 3.604629449523439, "grad_norm": 1.28125, "learning_rate": 0.00037369052171377535, "loss": 5.0418, "mean_token_accuracy": 0.2057574838399887, "num_tokens": 80349226.0, "step": 46330 }, { "entropy": 5.794615602493286, "epoch": 3.6050184788951567, "grad_norm": 1.3203125, "learning_rate": 0.0003736656137865021, "loss": 4.8668, "mean_token_accuracy": 0.21670107245445253, "num_tokens": 80358383.0, "step": 46335 }, { "entropy": 5.857770729064941, "epoch": 3.6054075082668744, "grad_norm": 1.3828125, "learning_rate": 0.00037364070436213514, "loss": 4.9362, "mean_token_accuracy": 0.2167468249797821, "num_tokens": 80366644.0, "step": 46340 }, { "entropy": 5.82479419708252, "epoch": 3.6057965376385916, "grad_norm": 1.5703125, "learning_rate": 0.0003736157934410525, "loss": 4.9673, "mean_token_accuracy": 0.21104977726936341, "num_tokens": 80375775.0, "step": 46345 }, { "entropy": 5.8596940517425535, "epoch": 3.6061855670103093, "grad_norm": 1.3828125, "learning_rate": 0.0003735908810236322, "loss": 5.0588, "mean_token_accuracy": 0.2055319294333458, "num_tokens": 80384505.0, "step": 46350 }, { "entropy": 5.839061737060547, "epoch": 3.6065745963820266, "grad_norm": 1.4296875, "learning_rate": 0.00037356596711025214, "loss": 4.9508, "mean_token_accuracy": 0.21295370161533356, "num_tokens": 80392538.0, "step": 46355 }, { "entropy": 5.797332906723023, "epoch": 3.6069636257537443, "grad_norm": 1.3828125, "learning_rate": 0.0003735410517012905, "loss": 4.874, "mean_token_accuracy": 0.21232632398605347, "num_tokens": 80400811.0, "step": 46360 }, { "entropy": 5.8124675273895265, "epoch": 3.607352655125462, "grad_norm": 1.265625, "learning_rate": 0.0003735161347971252, "loss": 5.0085, "mean_token_accuracy": 0.203411203622818, "num_tokens": 80409812.0, "step": 46365 }, { "entropy": 5.812157917022705, "epoch": 3.6077416844971797, "grad_norm": 1.3515625, "learning_rate": 0.0003734912163981344, "loss": 4.996, "mean_token_accuracy": 0.2093289688229561, "num_tokens": 80418325.0, "step": 46370 }, { "entropy": 5.795334959030152, "epoch": 3.608130713868897, "grad_norm": 1.2890625, "learning_rate": 0.00037346629650469605, "loss": 4.9825, "mean_token_accuracy": 0.20568234324455262, "num_tokens": 80427318.0, "step": 46375 }, { "entropy": 5.833534145355225, "epoch": 3.6085197432406146, "grad_norm": 1.2578125, "learning_rate": 0.00037344137511718847, "loss": 5.0673, "mean_token_accuracy": 0.19779324680566787, "num_tokens": 80437238.0, "step": 46380 }, { "entropy": 5.821755218505859, "epoch": 3.6089087726123323, "grad_norm": 1.25, "learning_rate": 0.00037341645223598965, "loss": 4.9746, "mean_token_accuracy": 0.21192000806331635, "num_tokens": 80446497.0, "step": 46385 }, { "entropy": 5.837676858901977, "epoch": 3.6092978019840496, "grad_norm": 1.296875, "learning_rate": 0.00037339152786147777, "loss": 4.9706, "mean_token_accuracy": 0.21191132962703704, "num_tokens": 80455115.0, "step": 46390 }, { "entropy": 5.7890965938568115, "epoch": 3.6096868313557673, "grad_norm": 1.3046875, "learning_rate": 0.00037336660199403115, "loss": 4.9457, "mean_token_accuracy": 0.2142543151974678, "num_tokens": 80463596.0, "step": 46395 }, { "entropy": 5.801033592224121, "epoch": 3.610075860727485, "grad_norm": 1.328125, "learning_rate": 0.0003733416746340279, "loss": 4.8983, "mean_token_accuracy": 0.21460147053003312, "num_tokens": 80472160.0, "step": 46400 }, { "entropy": 5.806341648101807, "epoch": 3.6104648900992027, "grad_norm": 1.3515625, "learning_rate": 0.0003733167457818463, "loss": 4.9481, "mean_token_accuracy": 0.2136998549103737, "num_tokens": 80481317.0, "step": 46405 }, { "entropy": 5.790742540359497, "epoch": 3.61085391947092, "grad_norm": 1.265625, "learning_rate": 0.0003732918154378645, "loss": 4.9007, "mean_token_accuracy": 0.2175969362258911, "num_tokens": 80489977.0, "step": 46410 }, { "entropy": 5.809862804412842, "epoch": 3.6112429488426376, "grad_norm": 1.2109375, "learning_rate": 0.00037326688360246087, "loss": 4.9504, "mean_token_accuracy": 0.20882742702960969, "num_tokens": 80499109.0, "step": 46415 }, { "entropy": 5.770439004898071, "epoch": 3.6116319782143553, "grad_norm": 1.2734375, "learning_rate": 0.0003732419502760137, "loss": 4.8753, "mean_token_accuracy": 0.2172260493040085, "num_tokens": 80506981.0, "step": 46420 }, { "entropy": 5.835809659957886, "epoch": 3.6120210075860726, "grad_norm": 1.3046875, "learning_rate": 0.00037321701545890126, "loss": 4.9403, "mean_token_accuracy": 0.21650746315717698, "num_tokens": 80515572.0, "step": 46425 }, { "entropy": 5.811970329284668, "epoch": 3.6124100369577903, "grad_norm": 1.28125, "learning_rate": 0.0003731920791515019, "loss": 4.9458, "mean_token_accuracy": 0.20466053932905198, "num_tokens": 80525196.0, "step": 46430 }, { "entropy": 5.825013113021851, "epoch": 3.612799066329508, "grad_norm": 1.2734375, "learning_rate": 0.0003731671413541942, "loss": 4.9231, "mean_token_accuracy": 0.21387933194637299, "num_tokens": 80533358.0, "step": 46435 }, { "entropy": 5.812676525115966, "epoch": 3.6131880957012257, "grad_norm": 1.5390625, "learning_rate": 0.00037314220206735626, "loss": 4.9515, "mean_token_accuracy": 0.2093340665102005, "num_tokens": 80541632.0, "step": 46440 }, { "entropy": 5.790643358230591, "epoch": 3.613577125072943, "grad_norm": 1.40625, "learning_rate": 0.00037311726129136665, "loss": 5.0993, "mean_token_accuracy": 0.19837437719106674, "num_tokens": 80550134.0, "step": 46445 }, { "entropy": 5.828024578094483, "epoch": 3.6139661544446606, "grad_norm": 1.3125, "learning_rate": 0.0003730923190266038, "loss": 4.9828, "mean_token_accuracy": 0.2096709728240967, "num_tokens": 80558892.0, "step": 46450 }, { "entropy": 5.934130716323852, "epoch": 3.614355183816378, "grad_norm": 1.28125, "learning_rate": 0.000373067375273446, "loss": 5.04, "mean_token_accuracy": 0.20332380533218383, "num_tokens": 80568613.0, "step": 46455 }, { "entropy": 5.8389081954956055, "epoch": 3.6147442131880956, "grad_norm": 1.2265625, "learning_rate": 0.00037304243003227197, "loss": 4.8952, "mean_token_accuracy": 0.21990666836500167, "num_tokens": 80577741.0, "step": 46460 }, { "entropy": 5.8367085456848145, "epoch": 3.6151332425598133, "grad_norm": 1.3515625, "learning_rate": 0.0003730174833034601, "loss": 5.0096, "mean_token_accuracy": 0.2102118343114853, "num_tokens": 80586524.0, "step": 46465 }, { "entropy": 5.8092326641082765, "epoch": 3.615522271931531, "grad_norm": 1.328125, "learning_rate": 0.00037299253508738894, "loss": 4.9718, "mean_token_accuracy": 0.2141026183962822, "num_tokens": 80595592.0, "step": 46470 }, { "entropy": 5.820678234100342, "epoch": 3.6159113013032487, "grad_norm": 1.34375, "learning_rate": 0.00037296758538443703, "loss": 4.8972, "mean_token_accuracy": 0.22017295509576798, "num_tokens": 80603632.0, "step": 46475 }, { "entropy": 5.775794172286988, "epoch": 3.616300330674966, "grad_norm": 1.2734375, "learning_rate": 0.00037294263419498295, "loss": 4.9003, "mean_token_accuracy": 0.21951792985200883, "num_tokens": 80612255.0, "step": 46480 }, { "entropy": 5.749066114425659, "epoch": 3.6166893600466836, "grad_norm": 1.2890625, "learning_rate": 0.0003729176815194053, "loss": 4.8748, "mean_token_accuracy": 0.2234942778944969, "num_tokens": 80621073.0, "step": 46485 }, { "entropy": 5.854146099090576, "epoch": 3.617078389418401, "grad_norm": 1.4375, "learning_rate": 0.00037289272735808267, "loss": 5.031, "mean_token_accuracy": 0.21090429723262788, "num_tokens": 80629376.0, "step": 46490 }, { "entropy": 5.817367744445801, "epoch": 3.6174674187901186, "grad_norm": 1.3515625, "learning_rate": 0.0003728677717113936, "loss": 5.0071, "mean_token_accuracy": 0.20798057317733765, "num_tokens": 80637608.0, "step": 46495 }, { "entropy": 5.774727249145508, "epoch": 3.6178564481618363, "grad_norm": 1.2890625, "learning_rate": 0.00037284281457971707, "loss": 4.9139, "mean_token_accuracy": 0.21471129208803177, "num_tokens": 80646361.0, "step": 46500 }, { "entropy": 5.810741806030274, "epoch": 3.618245477533554, "grad_norm": 1.328125, "learning_rate": 0.0003728178559634315, "loss": 4.9311, "mean_token_accuracy": 0.20924106240272522, "num_tokens": 80654894.0, "step": 46505 }, { "entropy": 5.846448659896851, "epoch": 3.618634506905271, "grad_norm": 1.328125, "learning_rate": 0.0003727928958629156, "loss": 4.9665, "mean_token_accuracy": 0.2095610722899437, "num_tokens": 80664088.0, "step": 46510 }, { "entropy": 5.810062742233276, "epoch": 3.619023536276989, "grad_norm": 1.4296875, "learning_rate": 0.00037276793427854817, "loss": 4.8939, "mean_token_accuracy": 0.2112276256084442, "num_tokens": 80672173.0, "step": 46515 }, { "entropy": 5.858865880966187, "epoch": 3.6194125656487066, "grad_norm": 1.3671875, "learning_rate": 0.00037274297121070796, "loss": 5.0572, "mean_token_accuracy": 0.20318731665611267, "num_tokens": 80681744.0, "step": 46520 }, { "entropy": 5.840253829956055, "epoch": 3.619801595020424, "grad_norm": 1.46875, "learning_rate": 0.0003727180066597737, "loss": 4.9656, "mean_token_accuracy": 0.21166423261165618, "num_tokens": 80690443.0, "step": 46525 }, { "entropy": 5.848503541946411, "epoch": 3.6201906243921416, "grad_norm": 1.5546875, "learning_rate": 0.0003726930406261243, "loss": 5.0658, "mean_token_accuracy": 0.20456180721521378, "num_tokens": 80698472.0, "step": 46530 }, { "entropy": 5.82731032371521, "epoch": 3.6205796537638593, "grad_norm": 1.3203125, "learning_rate": 0.0003726680731101385, "loss": 4.9626, "mean_token_accuracy": 0.2101417139172554, "num_tokens": 80706757.0, "step": 46535 }, { "entropy": 5.811495351791382, "epoch": 3.620968683135577, "grad_norm": 1.2578125, "learning_rate": 0.0003726431041121951, "loss": 4.9648, "mean_token_accuracy": 0.2114171028137207, "num_tokens": 80716612.0, "step": 46540 }, { "entropy": 5.778885364532471, "epoch": 3.621357712507294, "grad_norm": 1.2734375, "learning_rate": 0.000372618133632673, "loss": 4.8574, "mean_token_accuracy": 0.2181735798716545, "num_tokens": 80725380.0, "step": 46545 }, { "entropy": 5.865681314468384, "epoch": 3.621746741879012, "grad_norm": 1.3671875, "learning_rate": 0.0003725931616719511, "loss": 5.0425, "mean_token_accuracy": 0.2019834965467453, "num_tokens": 80733916.0, "step": 46550 }, { "entropy": 5.837443494796753, "epoch": 3.622135771250729, "grad_norm": 1.40625, "learning_rate": 0.0003725681882304084, "loss": 5.0009, "mean_token_accuracy": 0.21284728944301606, "num_tokens": 80742702.0, "step": 46555 }, { "entropy": 5.77176456451416, "epoch": 3.622524800622447, "grad_norm": 1.34375, "learning_rate": 0.0003725432133084237, "loss": 4.8815, "mean_token_accuracy": 0.2161381021142006, "num_tokens": 80751422.0, "step": 46560 }, { "entropy": 5.832637548446655, "epoch": 3.6229138299941646, "grad_norm": 1.359375, "learning_rate": 0.0003725182369063759, "loss": 4.95, "mean_token_accuracy": 0.2158133402466774, "num_tokens": 80760147.0, "step": 46565 }, { "entropy": 5.769155550003052, "epoch": 3.6233028593658823, "grad_norm": 1.28125, "learning_rate": 0.0003724932590246441, "loss": 4.9055, "mean_token_accuracy": 0.21189437955617904, "num_tokens": 80768509.0, "step": 46570 }, { "entropy": 5.785255479812622, "epoch": 3.6236918887376, "grad_norm": 1.34375, "learning_rate": 0.0003724682796636073, "loss": 4.9683, "mean_token_accuracy": 0.21475027799606322, "num_tokens": 80777226.0, "step": 46575 }, { "entropy": 5.8462152004241945, "epoch": 3.624080918109317, "grad_norm": 1.2890625, "learning_rate": 0.0003724432988236445, "loss": 4.9848, "mean_token_accuracy": 0.209323488175869, "num_tokens": 80786029.0, "step": 46580 }, { "entropy": 5.816490936279297, "epoch": 3.624469947481035, "grad_norm": 1.3359375, "learning_rate": 0.0003724183165051347, "loss": 4.9845, "mean_token_accuracy": 0.2037944883108139, "num_tokens": 80794524.0, "step": 46585 }, { "entropy": 5.821278858184814, "epoch": 3.624858976852752, "grad_norm": 1.3359375, "learning_rate": 0.00037239333270845714, "loss": 4.975, "mean_token_accuracy": 0.20882696509361268, "num_tokens": 80802994.0, "step": 46590 }, { "entropy": 5.765382909774781, "epoch": 3.62524800622447, "grad_norm": 1.3125, "learning_rate": 0.0003723683474339907, "loss": 4.8962, "mean_token_accuracy": 0.21575449258089066, "num_tokens": 80811907.0, "step": 46595 }, { "entropy": 5.844417858123779, "epoch": 3.6256370355961876, "grad_norm": 1.4453125, "learning_rate": 0.0003723433606821145, "loss": 4.9837, "mean_token_accuracy": 0.20974897593259811, "num_tokens": 80820709.0, "step": 46600 }, { "entropy": 5.849398946762085, "epoch": 3.6260260649679052, "grad_norm": 1.2578125, "learning_rate": 0.00037231837245320777, "loss": 4.9651, "mean_token_accuracy": 0.20678347647190093, "num_tokens": 80829940.0, "step": 46605 }, { "entropy": 5.849050045013428, "epoch": 3.6264150943396225, "grad_norm": 1.328125, "learning_rate": 0.00037229338274764965, "loss": 4.9111, "mean_token_accuracy": 0.21531798541545868, "num_tokens": 80838863.0, "step": 46610 }, { "entropy": 5.8440194606781, "epoch": 3.62680412371134, "grad_norm": 1.265625, "learning_rate": 0.0003722683915658193, "loss": 4.9472, "mean_token_accuracy": 0.214973084628582, "num_tokens": 80847508.0, "step": 46615 }, { "entropy": 5.74535117149353, "epoch": 3.627193153083058, "grad_norm": 1.3984375, "learning_rate": 0.00037224339890809587, "loss": 4.9773, "mean_token_accuracy": 0.20429691225290297, "num_tokens": 80856738.0, "step": 46620 }, { "entropy": 5.8455548763275145, "epoch": 3.627582182454775, "grad_norm": 1.265625, "learning_rate": 0.0003722184047748587, "loss": 4.9656, "mean_token_accuracy": 0.20881297588348388, "num_tokens": 80864985.0, "step": 46625 }, { "entropy": 5.833503866195679, "epoch": 3.627971211826493, "grad_norm": 1.3046875, "learning_rate": 0.00037219340916648703, "loss": 5.1145, "mean_token_accuracy": 0.2035933554172516, "num_tokens": 80874025.0, "step": 46630 }, { "entropy": 5.837823963165283, "epoch": 3.6283602411982105, "grad_norm": 1.3125, "learning_rate": 0.00037216841208336, "loss": 4.9959, "mean_token_accuracy": 0.20978901386260987, "num_tokens": 80882410.0, "step": 46635 }, { "entropy": 5.865505695343018, "epoch": 3.6287492705699282, "grad_norm": 1.375, "learning_rate": 0.00037214341352585697, "loss": 5.0016, "mean_token_accuracy": 0.2062186524271965, "num_tokens": 80890776.0, "step": 46640 }, { "entropy": 5.856614828109741, "epoch": 3.6291382999416455, "grad_norm": 1.3203125, "learning_rate": 0.0003721184134943573, "loss": 4.9787, "mean_token_accuracy": 0.2127270370721817, "num_tokens": 80898985.0, "step": 46645 }, { "entropy": 5.761981201171875, "epoch": 3.629527329313363, "grad_norm": 1.421875, "learning_rate": 0.00037209341198924024, "loss": 4.8514, "mean_token_accuracy": 0.21824664175510405, "num_tokens": 80907046.0, "step": 46650 }, { "entropy": 5.753596830368042, "epoch": 3.6299163586850804, "grad_norm": 1.328125, "learning_rate": 0.0003720684090108852, "loss": 4.9444, "mean_token_accuracy": 0.21290538012981414, "num_tokens": 80915764.0, "step": 46655 }, { "entropy": 5.745474147796631, "epoch": 3.630305388056798, "grad_norm": 1.3046875, "learning_rate": 0.0003720434045596716, "loss": 4.8859, "mean_token_accuracy": 0.22011713087558746, "num_tokens": 80925049.0, "step": 46660 }, { "entropy": 5.852899742126465, "epoch": 3.630694417428516, "grad_norm": 1.5078125, "learning_rate": 0.0003720183986359788, "loss": 5.07, "mean_token_accuracy": 0.20584283620119095, "num_tokens": 80934928.0, "step": 46665 }, { "entropy": 5.889201545715332, "epoch": 3.6310834468002335, "grad_norm": 1.25, "learning_rate": 0.0003719933912401862, "loss": 5.0798, "mean_token_accuracy": 0.20568465143442155, "num_tokens": 80943388.0, "step": 46670 }, { "entropy": 5.850353002548218, "epoch": 3.6314724761719512, "grad_norm": 1.28125, "learning_rate": 0.0003719683823726732, "loss": 4.9355, "mean_token_accuracy": 0.21384547054767608, "num_tokens": 80952887.0, "step": 46675 }, { "entropy": 5.830696296691895, "epoch": 3.6318615055436685, "grad_norm": 1.3125, "learning_rate": 0.00037194337203381945, "loss": 4.939, "mean_token_accuracy": 0.21464853733778, "num_tokens": 80961284.0, "step": 46680 }, { "entropy": 5.799163579940796, "epoch": 3.632250534915386, "grad_norm": 1.3515625, "learning_rate": 0.00037191836022400427, "loss": 4.9597, "mean_token_accuracy": 0.21478018313646316, "num_tokens": 80969963.0, "step": 46685 }, { "entropy": 5.737101221084595, "epoch": 3.6326395642871034, "grad_norm": 1.3125, "learning_rate": 0.00037189334694360724, "loss": 4.9664, "mean_token_accuracy": 0.21506072133779525, "num_tokens": 80978556.0, "step": 46690 }, { "entropy": 5.805430173873901, "epoch": 3.633028593658821, "grad_norm": 1.2890625, "learning_rate": 0.0003718683321930079, "loss": 4.9439, "mean_token_accuracy": 0.207755409181118, "num_tokens": 80987615.0, "step": 46695 }, { "entropy": 5.752237701416016, "epoch": 3.633417623030539, "grad_norm": 1.3515625, "learning_rate": 0.0003718433159725857, "loss": 4.8305, "mean_token_accuracy": 0.21764546483755112, "num_tokens": 80995729.0, "step": 46700 }, { "entropy": 5.801904582977295, "epoch": 3.6338066524022565, "grad_norm": 1.4453125, "learning_rate": 0.0003718182982827205, "loss": 4.9776, "mean_token_accuracy": 0.20688237100839615, "num_tokens": 81004388.0, "step": 46705 }, { "entropy": 5.824491167068482, "epoch": 3.634195681773974, "grad_norm": 1.21875, "learning_rate": 0.00037179327912379166, "loss": 4.9925, "mean_token_accuracy": 0.20476346611976623, "num_tokens": 81013216.0, "step": 46710 }, { "entropy": 5.8132306098937985, "epoch": 3.6345847111456915, "grad_norm": 1.3203125, "learning_rate": 0.00037176825849617886, "loss": 5.0562, "mean_token_accuracy": 0.20231568664312363, "num_tokens": 81022829.0, "step": 46715 }, { "entropy": 5.7514279842376705, "epoch": 3.634973740517409, "grad_norm": 1.34375, "learning_rate": 0.00037174323640026173, "loss": 4.8763, "mean_token_accuracy": 0.22047660648822784, "num_tokens": 81031673.0, "step": 46720 }, { "entropy": 5.824792766571045, "epoch": 3.6353627698891264, "grad_norm": 1.4609375, "learning_rate": 0.00037171821283642003, "loss": 4.9686, "mean_token_accuracy": 0.20837238132953645, "num_tokens": 81040368.0, "step": 46725 }, { "entropy": 5.818299913406372, "epoch": 3.635751799260844, "grad_norm": 1.3046875, "learning_rate": 0.0003716931878050334, "loss": 4.9576, "mean_token_accuracy": 0.21674778908491135, "num_tokens": 81048436.0, "step": 46730 }, { "entropy": 5.747476387023926, "epoch": 3.636140828632562, "grad_norm": 1.21875, "learning_rate": 0.00037166816130648143, "loss": 4.9388, "mean_token_accuracy": 0.20761585980653763, "num_tokens": 81056487.0, "step": 46735 }, { "entropy": 5.80538854598999, "epoch": 3.6365298580042795, "grad_norm": 1.28125, "learning_rate": 0.00037164313334114407, "loss": 5.0494, "mean_token_accuracy": 0.20182126611471177, "num_tokens": 81064723.0, "step": 46740 }, { "entropy": 5.747455835342407, "epoch": 3.636918887375997, "grad_norm": 1.375, "learning_rate": 0.000371618103909401, "loss": 4.8531, "mean_token_accuracy": 0.22290216833353044, "num_tokens": 81072937.0, "step": 46745 }, { "entropy": 5.766287040710449, "epoch": 3.6373079167477145, "grad_norm": 1.40625, "learning_rate": 0.000371593073011632, "loss": 4.8558, "mean_token_accuracy": 0.22555731534957885, "num_tokens": 81081141.0, "step": 46750 }, { "entropy": 5.765855979919434, "epoch": 3.637696946119432, "grad_norm": 1.390625, "learning_rate": 0.00037156804064821674, "loss": 4.8661, "mean_token_accuracy": 0.22879180908203126, "num_tokens": 81089605.0, "step": 46755 }, { "entropy": 5.799998474121094, "epoch": 3.6380859754911494, "grad_norm": 1.375, "learning_rate": 0.00037154300681953523, "loss": 4.9011, "mean_token_accuracy": 0.22236431390047073, "num_tokens": 81098071.0, "step": 46760 }, { "entropy": 5.89683575630188, "epoch": 3.638475004862867, "grad_norm": 1.3203125, "learning_rate": 0.0003715179715259673, "loss": 5.0669, "mean_token_accuracy": 0.21241187006235124, "num_tokens": 81107309.0, "step": 46765 }, { "entropy": 5.848139715194702, "epoch": 3.638864034234585, "grad_norm": 1.296875, "learning_rate": 0.00037149293476789277, "loss": 4.9127, "mean_token_accuracy": 0.20824284553527833, "num_tokens": 81116435.0, "step": 46770 }, { "entropy": 5.858426666259765, "epoch": 3.6392530636063025, "grad_norm": 1.40625, "learning_rate": 0.0003714678965456915, "loss": 4.954, "mean_token_accuracy": 0.21721839010715485, "num_tokens": 81125046.0, "step": 46775 }, { "entropy": 5.802610874176025, "epoch": 3.6396420929780198, "grad_norm": 1.28125, "learning_rate": 0.00037144285685974346, "loss": 4.981, "mean_token_accuracy": 0.2169325828552246, "num_tokens": 81133625.0, "step": 46780 }, { "entropy": 5.76959638595581, "epoch": 3.6400311223497375, "grad_norm": 1.3828125, "learning_rate": 0.00037141781571042854, "loss": 4.9199, "mean_token_accuracy": 0.21787395626306533, "num_tokens": 81142461.0, "step": 46785 }, { "entropy": 5.824368953704834, "epoch": 3.6404201517214547, "grad_norm": 1.3359375, "learning_rate": 0.00037139277309812676, "loss": 4.9935, "mean_token_accuracy": 0.21122116595506668, "num_tokens": 81151641.0, "step": 46790 }, { "entropy": 5.821697854995728, "epoch": 3.6408091810931724, "grad_norm": 1.3203125, "learning_rate": 0.0003713677290232181, "loss": 4.9461, "mean_token_accuracy": 0.2204246327280998, "num_tokens": 81160238.0, "step": 46795 }, { "entropy": 5.803835105895996, "epoch": 3.64119821046489, "grad_norm": 1.359375, "learning_rate": 0.00037134268348608255, "loss": 4.9124, "mean_token_accuracy": 0.2115943983197212, "num_tokens": 81168597.0, "step": 46800 }, { "entropy": 5.851180076599121, "epoch": 3.641587239836608, "grad_norm": 1.25, "learning_rate": 0.00037131763648710003, "loss": 5.0148, "mean_token_accuracy": 0.20664757788181304, "num_tokens": 81177410.0, "step": 46805 }, { "entropy": 5.836679410934448, "epoch": 3.641976269208325, "grad_norm": 1.2578125, "learning_rate": 0.00037129258802665076, "loss": 4.9208, "mean_token_accuracy": 0.21516994535923004, "num_tokens": 81186710.0, "step": 46810 }, { "entropy": 5.818358469009399, "epoch": 3.6423652985800428, "grad_norm": 1.171875, "learning_rate": 0.0003712675381051147, "loss": 4.9068, "mean_token_accuracy": 0.21652372181415558, "num_tokens": 81195723.0, "step": 46815 }, { "entropy": 5.786525535583496, "epoch": 3.6427543279517605, "grad_norm": 1.421875, "learning_rate": 0.000371242486722872, "loss": 4.9189, "mean_token_accuracy": 0.21702964305877687, "num_tokens": 81203633.0, "step": 46820 }, { "entropy": 5.816823196411133, "epoch": 3.6431433573234777, "grad_norm": 1.3984375, "learning_rate": 0.0003712174338803027, "loss": 4.9984, "mean_token_accuracy": 0.2111393243074417, "num_tokens": 81212829.0, "step": 46825 }, { "entropy": 5.826301336288452, "epoch": 3.6435323866951954, "grad_norm": 1.40625, "learning_rate": 0.000371192379577787, "loss": 5.0223, "mean_token_accuracy": 0.2041080489754677, "num_tokens": 81222283.0, "step": 46830 }, { "entropy": 5.820410823822021, "epoch": 3.643921416066913, "grad_norm": 1.2734375, "learning_rate": 0.0003711673238157051, "loss": 4.9174, "mean_token_accuracy": 0.21179766803979874, "num_tokens": 81231202.0, "step": 46835 }, { "entropy": 5.870889377593994, "epoch": 3.644310445438631, "grad_norm": 1.234375, "learning_rate": 0.00037114226659443704, "loss": 5.0216, "mean_token_accuracy": 0.20778151899576186, "num_tokens": 81239888.0, "step": 46840 }, { "entropy": 5.8597077369689945, "epoch": 3.644699474810348, "grad_norm": 1.3359375, "learning_rate": 0.0003711172079143632, "loss": 5.0121, "mean_token_accuracy": 0.21262629181146622, "num_tokens": 81248529.0, "step": 46845 }, { "entropy": 5.826645469665527, "epoch": 3.6450885041820658, "grad_norm": 1.4140625, "learning_rate": 0.0003710921477758637, "loss": 4.9418, "mean_token_accuracy": 0.21287637650966645, "num_tokens": 81257328.0, "step": 46850 }, { "entropy": 5.791141986846924, "epoch": 3.6454775335537835, "grad_norm": 1.28125, "learning_rate": 0.0003710670861793187, "loss": 4.909, "mean_token_accuracy": 0.21809132993221284, "num_tokens": 81265979.0, "step": 46855 }, { "entropy": 5.766604089736939, "epoch": 3.6458665629255007, "grad_norm": 1.28125, "learning_rate": 0.0003710420231251087, "loss": 4.9791, "mean_token_accuracy": 0.2081373229622841, "num_tokens": 81275465.0, "step": 46860 }, { "entropy": 5.819505834579468, "epoch": 3.6462555922972184, "grad_norm": 1.25, "learning_rate": 0.00037101695861361384, "loss": 4.9942, "mean_token_accuracy": 0.2100534051656723, "num_tokens": 81284368.0, "step": 46865 }, { "entropy": 5.82471718788147, "epoch": 3.646644621668936, "grad_norm": 1.3125, "learning_rate": 0.00037099189264521446, "loss": 4.9816, "mean_token_accuracy": 0.20753067582845688, "num_tokens": 81293213.0, "step": 46870 }, { "entropy": 5.760712003707885, "epoch": 3.647033651040654, "grad_norm": 1.3515625, "learning_rate": 0.0003709668252202909, "loss": 4.9107, "mean_token_accuracy": 0.2113695353269577, "num_tokens": 81302597.0, "step": 46875 }, { "entropy": 5.763605070114136, "epoch": 3.647422680412371, "grad_norm": 1.4765625, "learning_rate": 0.0003709417563392235, "loss": 4.9048, "mean_token_accuracy": 0.2164827972650528, "num_tokens": 81311275.0, "step": 46880 }, { "entropy": 5.824728488922119, "epoch": 3.6478117097840888, "grad_norm": 1.2421875, "learning_rate": 0.0003709166860023926, "loss": 4.9939, "mean_token_accuracy": 0.20988756716251372, "num_tokens": 81320596.0, "step": 46885 }, { "entropy": 5.7455894470214846, "epoch": 3.648200739155806, "grad_norm": 1.203125, "learning_rate": 0.00037089161421017874, "loss": 4.9028, "mean_token_accuracy": 0.2112080305814743, "num_tokens": 81329579.0, "step": 46890 }, { "entropy": 5.800625371932983, "epoch": 3.6485897685275237, "grad_norm": 1.25, "learning_rate": 0.00037086654096296217, "loss": 4.9105, "mean_token_accuracy": 0.21128155738115312, "num_tokens": 81338386.0, "step": 46895 }, { "entropy": 5.852547454833984, "epoch": 3.6489787978992414, "grad_norm": 1.359375, "learning_rate": 0.0003708414662611235, "loss": 4.9406, "mean_token_accuracy": 0.2144833594560623, "num_tokens": 81347276.0, "step": 46900 }, { "entropy": 5.84384503364563, "epoch": 3.649367827270959, "grad_norm": 1.1875, "learning_rate": 0.0003708163901050432, "loss": 4.9212, "mean_token_accuracy": 0.20830274671316146, "num_tokens": 81356935.0, "step": 46905 }, { "entropy": 5.791039943695068, "epoch": 3.649756856642677, "grad_norm": 1.375, "learning_rate": 0.00037079131249510155, "loss": 4.897, "mean_token_accuracy": 0.21775818318128587, "num_tokens": 81364974.0, "step": 46910 }, { "entropy": 5.727745056152344, "epoch": 3.650145886014394, "grad_norm": 1.46875, "learning_rate": 0.0003707662334316793, "loss": 4.8353, "mean_token_accuracy": 0.21688156127929686, "num_tokens": 81373747.0, "step": 46915 }, { "entropy": 5.886320686340332, "epoch": 3.6505349153861117, "grad_norm": 1.515625, "learning_rate": 0.0003707411529151568, "loss": 4.961, "mean_token_accuracy": 0.2144709125161171, "num_tokens": 81381914.0, "step": 46920 }, { "entropy": 5.816075563430786, "epoch": 3.650923944757829, "grad_norm": 1.28125, "learning_rate": 0.0003707160709459147, "loss": 4.9835, "mean_token_accuracy": 0.21262144148349763, "num_tokens": 81390750.0, "step": 46925 }, { "entropy": 5.837540006637573, "epoch": 3.6513129741295467, "grad_norm": 1.421875, "learning_rate": 0.0003706909875243336, "loss": 4.9842, "mean_token_accuracy": 0.20285696983337403, "num_tokens": 81400046.0, "step": 46930 }, { "entropy": 5.833046245574951, "epoch": 3.6517020035012644, "grad_norm": 1.3203125, "learning_rate": 0.000370665902650794, "loss": 4.9368, "mean_token_accuracy": 0.21483127772808075, "num_tokens": 81408985.0, "step": 46935 }, { "entropy": 5.792379999160767, "epoch": 3.652091032872982, "grad_norm": 1.3359375, "learning_rate": 0.00037064081632567675, "loss": 4.9586, "mean_token_accuracy": 0.21099597960710526, "num_tokens": 81417467.0, "step": 46940 }, { "entropy": 5.812753534317016, "epoch": 3.6524800622446993, "grad_norm": 1.359375, "learning_rate": 0.00037061572854936225, "loss": 5.0443, "mean_token_accuracy": 0.19999421238899232, "num_tokens": 81426054.0, "step": 46945 }, { "entropy": 5.774464750289917, "epoch": 3.652869091616417, "grad_norm": 1.3203125, "learning_rate": 0.0003705906393222313, "loss": 4.9196, "mean_token_accuracy": 0.21604742258787155, "num_tokens": 81435476.0, "step": 46950 }, { "entropy": 5.858021879196167, "epoch": 3.6532581209881347, "grad_norm": 1.3515625, "learning_rate": 0.0003705655486446645, "loss": 4.9775, "mean_token_accuracy": 0.21023108810186386, "num_tokens": 81444613.0, "step": 46955 }, { "entropy": 5.82696270942688, "epoch": 3.653647150359852, "grad_norm": 1.3203125, "learning_rate": 0.0003705404565170426, "loss": 4.8977, "mean_token_accuracy": 0.21793434619903565, "num_tokens": 81452995.0, "step": 46960 }, { "entropy": 5.833832693099976, "epoch": 3.6540361797315697, "grad_norm": 1.3828125, "learning_rate": 0.0003705153629397463, "loss": 4.9206, "mean_token_accuracy": 0.21767951399087906, "num_tokens": 81461063.0, "step": 46965 }, { "entropy": 5.823679637908936, "epoch": 3.6544252091032874, "grad_norm": 1.3046875, "learning_rate": 0.00037049026791315646, "loss": 4.9628, "mean_token_accuracy": 0.21506234258413315, "num_tokens": 81469835.0, "step": 46970 }, { "entropy": 5.73599648475647, "epoch": 3.654814238475005, "grad_norm": 1.328125, "learning_rate": 0.0003704651714376538, "loss": 4.8535, "mean_token_accuracy": 0.22173629254102706, "num_tokens": 81478372.0, "step": 46975 }, { "entropy": 5.781663465499878, "epoch": 3.6552032678467223, "grad_norm": 1.3515625, "learning_rate": 0.0003704400735136191, "loss": 4.9823, "mean_token_accuracy": 0.2134254664182663, "num_tokens": 81486870.0, "step": 46980 }, { "entropy": 5.776082515716553, "epoch": 3.65559229721844, "grad_norm": 1.328125, "learning_rate": 0.0003704149741414332, "loss": 4.9115, "mean_token_accuracy": 0.21472052186727525, "num_tokens": 81495566.0, "step": 46985 }, { "entropy": 5.880384731292724, "epoch": 3.6559813265901573, "grad_norm": 1.3828125, "learning_rate": 0.0003703898733214769, "loss": 5.0305, "mean_token_accuracy": 0.21047959923744203, "num_tokens": 81503823.0, "step": 46990 }, { "entropy": 5.842616271972656, "epoch": 3.656370355961875, "grad_norm": 1.375, "learning_rate": 0.0003703647710541311, "loss": 5.0011, "mean_token_accuracy": 0.2037819281220436, "num_tokens": 81511870.0, "step": 46995 }, { "entropy": 5.799547004699707, "epoch": 3.6567593853335927, "grad_norm": 1.25, "learning_rate": 0.0003703396673397768, "loss": 4.8962, "mean_token_accuracy": 0.20831857919692992, "num_tokens": 81519959.0, "step": 47000 }, { "entropy": 5.785780715942383, "epoch": 3.6571484147053104, "grad_norm": 1.328125, "learning_rate": 0.0003703145621787947, "loss": 5.0042, "mean_token_accuracy": 0.21140255481004716, "num_tokens": 81529401.0, "step": 47005 }, { "entropy": 5.830147218704224, "epoch": 3.657537444077028, "grad_norm": 1.421875, "learning_rate": 0.00037028945557156587, "loss": 4.9299, "mean_token_accuracy": 0.21307274997234343, "num_tokens": 81538561.0, "step": 47010 }, { "entropy": 5.813931083679199, "epoch": 3.6579264734487453, "grad_norm": 1.2734375, "learning_rate": 0.00037026434751847117, "loss": 4.972, "mean_token_accuracy": 0.21551993787288665, "num_tokens": 81547168.0, "step": 47015 }, { "entropy": 5.776926803588867, "epoch": 3.658315502820463, "grad_norm": 1.2890625, "learning_rate": 0.00037023923801989163, "loss": 4.9369, "mean_token_accuracy": 0.21327387392520905, "num_tokens": 81556094.0, "step": 47020 }, { "entropy": 5.869414758682251, "epoch": 3.6587045321921803, "grad_norm": 1.3359375, "learning_rate": 0.0003702141270762083, "loss": 4.942, "mean_token_accuracy": 0.2172440081834793, "num_tokens": 81564032.0, "step": 47025 }, { "entropy": 5.7849891662597654, "epoch": 3.659093561563898, "grad_norm": 1.28125, "learning_rate": 0.00037018901468780207, "loss": 4.988, "mean_token_accuracy": 0.21380701363086702, "num_tokens": 81572622.0, "step": 47030 }, { "entropy": 5.7666566371917725, "epoch": 3.6594825909356157, "grad_norm": 1.28125, "learning_rate": 0.0003701639008550541, "loss": 4.9108, "mean_token_accuracy": 0.2166245996952057, "num_tokens": 81581800.0, "step": 47035 }, { "entropy": 5.763534212112427, "epoch": 3.6598716203073334, "grad_norm": 1.3203125, "learning_rate": 0.0003701387855783454, "loss": 4.8703, "mean_token_accuracy": 0.22018159180879593, "num_tokens": 81590420.0, "step": 47040 }, { "entropy": 5.83518352508545, "epoch": 3.6602606496790506, "grad_norm": 1.3125, "learning_rate": 0.000370113668858057, "loss": 5.0156, "mean_token_accuracy": 0.2100249260663986, "num_tokens": 81598243.0, "step": 47045 }, { "entropy": 5.817593193054199, "epoch": 3.6606496790507683, "grad_norm": 1.328125, "learning_rate": 0.0003700885506945701, "loss": 4.8946, "mean_token_accuracy": 0.21202801167964935, "num_tokens": 81607061.0, "step": 47050 }, { "entropy": 5.76728572845459, "epoch": 3.661038708422486, "grad_norm": 1.390625, "learning_rate": 0.0003700634310882658, "loss": 4.8892, "mean_token_accuracy": 0.20724625140428543, "num_tokens": 81614899.0, "step": 47055 }, { "entropy": 5.815124988555908, "epoch": 3.6614277377942033, "grad_norm": 1.28125, "learning_rate": 0.00037003831003952525, "loss": 4.9332, "mean_token_accuracy": 0.21611706912517548, "num_tokens": 81623819.0, "step": 47060 }, { "entropy": 5.909911203384399, "epoch": 3.661816767165921, "grad_norm": 1.28125, "learning_rate": 0.00037001318754872957, "loss": 5.1141, "mean_token_accuracy": 0.19993706941604614, "num_tokens": 81632852.0, "step": 47065 }, { "entropy": 5.871212339401245, "epoch": 3.6622057965376387, "grad_norm": 1.2734375, "learning_rate": 0.00036998806361626, "loss": 5.0267, "mean_token_accuracy": 0.20822747200727462, "num_tokens": 81642098.0, "step": 47070 }, { "entropy": 5.855953168869019, "epoch": 3.6625948259093564, "grad_norm": 1.390625, "learning_rate": 0.0003699629382424979, "loss": 5.0486, "mean_token_accuracy": 0.20244466811418532, "num_tokens": 81651065.0, "step": 47075 }, { "entropy": 5.774432182312012, "epoch": 3.6629838552810736, "grad_norm": 1.2890625, "learning_rate": 0.00036993781142782416, "loss": 4.8808, "mean_token_accuracy": 0.2162814751267433, "num_tokens": 81659503.0, "step": 47080 }, { "entropy": 5.7778722763061525, "epoch": 3.6633728846527913, "grad_norm": 1.34375, "learning_rate": 0.00036991268317262033, "loss": 4.9605, "mean_token_accuracy": 0.2121458038687706, "num_tokens": 81667501.0, "step": 47085 }, { "entropy": 5.766786575317383, "epoch": 3.663761914024509, "grad_norm": 1.40625, "learning_rate": 0.00036988755347726766, "loss": 4.8919, "mean_token_accuracy": 0.22252424955368041, "num_tokens": 81676285.0, "step": 47090 }, { "entropy": 5.813645935058593, "epoch": 3.6641509433962263, "grad_norm": 1.3515625, "learning_rate": 0.00036986242234214736, "loss": 4.9401, "mean_token_accuracy": 0.20978277325630187, "num_tokens": 81685449.0, "step": 47095 }, { "entropy": 5.781049203872681, "epoch": 3.664539972767944, "grad_norm": 1.34375, "learning_rate": 0.00036983728976764074, "loss": 4.9475, "mean_token_accuracy": 0.2149082750082016, "num_tokens": 81694615.0, "step": 47100 }, { "entropy": 5.8065492630004885, "epoch": 3.6649290021396617, "grad_norm": 1.3515625, "learning_rate": 0.00036981215575412923, "loss": 4.8901, "mean_token_accuracy": 0.21141926050186158, "num_tokens": 81703105.0, "step": 47105 }, { "entropy": 5.834767293930054, "epoch": 3.6653180315113794, "grad_norm": 1.2421875, "learning_rate": 0.0003697870203019942, "loss": 4.9476, "mean_token_accuracy": 0.2184969365596771, "num_tokens": 81711414.0, "step": 47110 }, { "entropy": 5.806837129592895, "epoch": 3.6657070608830966, "grad_norm": 1.390625, "learning_rate": 0.00036976188341161694, "loss": 5.0447, "mean_token_accuracy": 0.20865327417850493, "num_tokens": 81719196.0, "step": 47115 }, { "entropy": 5.821295118331909, "epoch": 3.6660960902548143, "grad_norm": 1.3203125, "learning_rate": 0.0003697367450833789, "loss": 5.0076, "mean_token_accuracy": 0.2094178780913353, "num_tokens": 81727604.0, "step": 47120 }, { "entropy": 5.873674011230468, "epoch": 3.6664851196265316, "grad_norm": 1.390625, "learning_rate": 0.00036971160531766155, "loss": 5.0411, "mean_token_accuracy": 0.21362105160951614, "num_tokens": 81735373.0, "step": 47125 }, { "entropy": 5.828206729888916, "epoch": 3.6668741489982493, "grad_norm": 1.4375, "learning_rate": 0.0003696864641148465, "loss": 4.929, "mean_token_accuracy": 0.2094999670982361, "num_tokens": 81743086.0, "step": 47130 }, { "entropy": 5.873082256317138, "epoch": 3.667263178369967, "grad_norm": 1.40625, "learning_rate": 0.00036966132147531487, "loss": 4.9861, "mean_token_accuracy": 0.21130361407995224, "num_tokens": 81751665.0, "step": 47135 }, { "entropy": 5.807980918884278, "epoch": 3.6676522077416847, "grad_norm": 1.3828125, "learning_rate": 0.00036963617739944844, "loss": 4.8862, "mean_token_accuracy": 0.21728401631116867, "num_tokens": 81760056.0, "step": 47140 }, { "entropy": 5.705516386032104, "epoch": 3.668041237113402, "grad_norm": 1.2890625, "learning_rate": 0.00036961103188762866, "loss": 4.812, "mean_token_accuracy": 0.22518517971038818, "num_tokens": 81768417.0, "step": 47145 }, { "entropy": 5.801606273651123, "epoch": 3.6684302664851196, "grad_norm": 1.4140625, "learning_rate": 0.00036958588494023705, "loss": 4.9268, "mean_token_accuracy": 0.21837680488824845, "num_tokens": 81777543.0, "step": 47150 }, { "entropy": 5.83249683380127, "epoch": 3.6688192958568373, "grad_norm": 1.390625, "learning_rate": 0.0003695607365576551, "loss": 4.9514, "mean_token_accuracy": 0.20461459904909135, "num_tokens": 81786456.0, "step": 47155 }, { "entropy": 5.8173939228057865, "epoch": 3.6692083252285546, "grad_norm": 1.359375, "learning_rate": 0.0003695355867402646, "loss": 4.9536, "mean_token_accuracy": 0.21113619059324265, "num_tokens": 81795093.0, "step": 47160 }, { "entropy": 5.740402030944824, "epoch": 3.6695973546002723, "grad_norm": 1.2734375, "learning_rate": 0.000369510435488447, "loss": 4.9036, "mean_token_accuracy": 0.2270841419696808, "num_tokens": 81803488.0, "step": 47165 }, { "entropy": 5.812555599212646, "epoch": 3.66998638397199, "grad_norm": 1.234375, "learning_rate": 0.000369485282802584, "loss": 4.9145, "mean_token_accuracy": 0.21281418353319168, "num_tokens": 81811955.0, "step": 47170 }, { "entropy": 5.857449960708618, "epoch": 3.6703754133437076, "grad_norm": 1.2578125, "learning_rate": 0.00036946012868305716, "loss": 4.9865, "mean_token_accuracy": 0.2120029702782631, "num_tokens": 81820336.0, "step": 47175 }, { "entropy": 5.850074911117554, "epoch": 3.670764442715425, "grad_norm": 1.3046875, "learning_rate": 0.0003694349731302483, "loss": 4.96, "mean_token_accuracy": 0.2119382306933403, "num_tokens": 81828614.0, "step": 47180 }, { "entropy": 5.759307909011841, "epoch": 3.6711534720871426, "grad_norm": 1.3203125, "learning_rate": 0.0003694098161445389, "loss": 4.9088, "mean_token_accuracy": 0.20689031034708022, "num_tokens": 81838092.0, "step": 47185 }, { "entropy": 5.825156879425049, "epoch": 3.6715425014588603, "grad_norm": 1.2578125, "learning_rate": 0.0003693846577263109, "loss": 4.9962, "mean_token_accuracy": 0.21866116523742676, "num_tokens": 81846894.0, "step": 47190 }, { "entropy": 5.845710325241089, "epoch": 3.6719315308305776, "grad_norm": 1.34375, "learning_rate": 0.0003693594978759459, "loss": 4.8842, "mean_token_accuracy": 0.21923942267894744, "num_tokens": 81855762.0, "step": 47195 }, { "entropy": 5.898674821853637, "epoch": 3.6723205602022952, "grad_norm": 1.3203125, "learning_rate": 0.00036933433659382575, "loss": 5.0598, "mean_token_accuracy": 0.20316316187381744, "num_tokens": 81864977.0, "step": 47200 }, { "entropy": 5.804606676101685, "epoch": 3.672709589574013, "grad_norm": 1.40625, "learning_rate": 0.0003693091738803322, "loss": 4.9553, "mean_token_accuracy": 0.21092488169670104, "num_tokens": 81873892.0, "step": 47205 }, { "entropy": 5.8472809314727785, "epoch": 3.6730986189457306, "grad_norm": 1.4375, "learning_rate": 0.000369284009735847, "loss": 4.9964, "mean_token_accuracy": 0.20889775604009628, "num_tokens": 81882146.0, "step": 47210 }, { "entropy": 5.799028730392456, "epoch": 3.673487648317448, "grad_norm": 1.2890625, "learning_rate": 0.0003692588441607521, "loss": 4.932, "mean_token_accuracy": 0.21479109823703765, "num_tokens": 81891342.0, "step": 47215 }, { "entropy": 5.8101013660430905, "epoch": 3.6738766776891656, "grad_norm": 1.3359375, "learning_rate": 0.00036923367715542923, "loss": 4.9769, "mean_token_accuracy": 0.21038652062416077, "num_tokens": 81900132.0, "step": 47220 }, { "entropy": 5.762343025207519, "epoch": 3.674265707060883, "grad_norm": 1.3359375, "learning_rate": 0.00036920850872026025, "loss": 4.907, "mean_token_accuracy": 0.2103940427303314, "num_tokens": 81908014.0, "step": 47225 }, { "entropy": 5.811326885223389, "epoch": 3.6746547364326005, "grad_norm": 1.3203125, "learning_rate": 0.0003691833388556272, "loss": 5.0022, "mean_token_accuracy": 0.20806120336055756, "num_tokens": 81916352.0, "step": 47230 }, { "entropy": 5.786103916168213, "epoch": 3.6750437658043182, "grad_norm": 1.4453125, "learning_rate": 0.0003691581675619118, "loss": 4.9174, "mean_token_accuracy": 0.20671167820692063, "num_tokens": 81925071.0, "step": 47235 }, { "entropy": 5.8208764553070065, "epoch": 3.675432795176036, "grad_norm": 1.3515625, "learning_rate": 0.0003691329948394961, "loss": 5.016, "mean_token_accuracy": 0.20420427322387696, "num_tokens": 81933734.0, "step": 47240 }, { "entropy": 5.795684909820556, "epoch": 3.675821824547753, "grad_norm": 1.5234375, "learning_rate": 0.00036910782068876204, "loss": 4.9184, "mean_token_accuracy": 0.2142811670899391, "num_tokens": 81942369.0, "step": 47245 }, { "entropy": 5.731361722946167, "epoch": 3.676210853919471, "grad_norm": 1.3515625, "learning_rate": 0.00036908264511009155, "loss": 4.8222, "mean_token_accuracy": 0.21289105713367462, "num_tokens": 81951128.0, "step": 47250 }, { "entropy": 5.756579828262329, "epoch": 3.6765998832911886, "grad_norm": 1.546875, "learning_rate": 0.0003690574681038667, "loss": 4.9391, "mean_token_accuracy": 0.21294140070676804, "num_tokens": 81959643.0, "step": 47255 }, { "entropy": 5.845918989181518, "epoch": 3.676988912662906, "grad_norm": 1.359375, "learning_rate": 0.00036903228967046946, "loss": 4.9563, "mean_token_accuracy": 0.21151593774557115, "num_tokens": 81968383.0, "step": 47260 }, { "entropy": 5.917092800140381, "epoch": 3.6773779420346235, "grad_norm": 1.3046875, "learning_rate": 0.0003690071098102819, "loss": 4.9618, "mean_token_accuracy": 0.21381414532661439, "num_tokens": 81976917.0, "step": 47265 }, { "entropy": 5.841108942031861, "epoch": 3.6777669714063412, "grad_norm": 1.2578125, "learning_rate": 0.0003689819285236861, "loss": 4.955, "mean_token_accuracy": 0.21099216789007186, "num_tokens": 81985437.0, "step": 47270 }, { "entropy": 5.793349123001098, "epoch": 3.678156000778059, "grad_norm": 1.296875, "learning_rate": 0.00036895674581106415, "loss": 5.0365, "mean_token_accuracy": 0.20784006416797637, "num_tokens": 81994024.0, "step": 47275 }, { "entropy": 5.773847198486328, "epoch": 3.678545030149776, "grad_norm": 1.28125, "learning_rate": 0.00036893156167279803, "loss": 4.9045, "mean_token_accuracy": 0.21197226643562317, "num_tokens": 82002394.0, "step": 47280 }, { "entropy": 5.862196779251098, "epoch": 3.678934059521494, "grad_norm": 1.4140625, "learning_rate": 0.0003689063761092701, "loss": 4.9371, "mean_token_accuracy": 0.2083805188536644, "num_tokens": 82010986.0, "step": 47285 }, { "entropy": 5.770857858657837, "epoch": 3.6793230888932116, "grad_norm": 1.3828125, "learning_rate": 0.00036888118912086225, "loss": 4.928, "mean_token_accuracy": 0.2211802124977112, "num_tokens": 82019272.0, "step": 47290 }, { "entropy": 5.834083986282349, "epoch": 3.679712118264929, "grad_norm": 1.421875, "learning_rate": 0.0003688560007079569, "loss": 4.9958, "mean_token_accuracy": 0.20346547216176986, "num_tokens": 82028293.0, "step": 47295 }, { "entropy": 5.748589372634887, "epoch": 3.6801011476366465, "grad_norm": 1.21875, "learning_rate": 0.000368830810870936, "loss": 4.8886, "mean_token_accuracy": 0.21349053531885148, "num_tokens": 82037787.0, "step": 47300 }, { "entropy": 5.785828018188477, "epoch": 3.6804901770083642, "grad_norm": 1.5390625, "learning_rate": 0.000368805619610182, "loss": 4.8319, "mean_token_accuracy": 0.2179153397679329, "num_tokens": 82046511.0, "step": 47305 }, { "entropy": 5.835928916931152, "epoch": 3.680879206380082, "grad_norm": 1.2734375, "learning_rate": 0.00036878042692607693, "loss": 4.9497, "mean_token_accuracy": 0.21626491844654083, "num_tokens": 82055472.0, "step": 47310 }, { "entropy": 5.75044846534729, "epoch": 3.681268235751799, "grad_norm": 1.3828125, "learning_rate": 0.00036875523281900324, "loss": 4.8642, "mean_token_accuracy": 0.21525147557258606, "num_tokens": 82063597.0, "step": 47315 }, { "entropy": 5.765591287612915, "epoch": 3.681657265123517, "grad_norm": 1.40625, "learning_rate": 0.0003687300372893431, "loss": 4.8104, "mean_token_accuracy": 0.21649996042251587, "num_tokens": 82071459.0, "step": 47320 }, { "entropy": 5.771722793579102, "epoch": 3.682046294495234, "grad_norm": 1.3359375, "learning_rate": 0.00036870484033747883, "loss": 4.9858, "mean_token_accuracy": 0.2039597749710083, "num_tokens": 82080657.0, "step": 47325 }, { "entropy": 5.8430564403533936, "epoch": 3.682435323866952, "grad_norm": 1.296875, "learning_rate": 0.00036867964196379274, "loss": 4.9444, "mean_token_accuracy": 0.2116810441017151, "num_tokens": 82090460.0, "step": 47330 }, { "entropy": 5.888584947586059, "epoch": 3.6828243532386695, "grad_norm": 1.421875, "learning_rate": 0.0003686544421686672, "loss": 4.9697, "mean_token_accuracy": 0.2205468013882637, "num_tokens": 82098463.0, "step": 47335 }, { "entropy": 5.849266242980957, "epoch": 3.683213382610387, "grad_norm": 1.3828125, "learning_rate": 0.00036862924095248457, "loss": 5.0048, "mean_token_accuracy": 0.19971213936805726, "num_tokens": 82106857.0, "step": 47340 }, { "entropy": 5.753557538986206, "epoch": 3.683602411982105, "grad_norm": 1.328125, "learning_rate": 0.00036860403831562717, "loss": 4.9683, "mean_token_accuracy": 0.2093684807419777, "num_tokens": 82115849.0, "step": 47345 }, { "entropy": 5.775167560577392, "epoch": 3.683991441353822, "grad_norm": 1.390625, "learning_rate": 0.0003685788342584775, "loss": 4.8663, "mean_token_accuracy": 0.2207179382443428, "num_tokens": 82124280.0, "step": 47350 }, { "entropy": 5.744949293136597, "epoch": 3.68438047072554, "grad_norm": 1.265625, "learning_rate": 0.000368553628781418, "loss": 4.9041, "mean_token_accuracy": 0.21289092749357225, "num_tokens": 82133440.0, "step": 47355 }, { "entropy": 5.850086498260498, "epoch": 3.684769500097257, "grad_norm": 1.296875, "learning_rate": 0.0003685284218848311, "loss": 4.9436, "mean_token_accuracy": 0.2131542980670929, "num_tokens": 82142307.0, "step": 47360 }, { "entropy": 5.833224105834961, "epoch": 3.685158529468975, "grad_norm": 1.34375, "learning_rate": 0.00036850321356909926, "loss": 5.049, "mean_token_accuracy": 0.19619062095880507, "num_tokens": 82151359.0, "step": 47365 }, { "entropy": 5.792849206924439, "epoch": 3.6855475588406925, "grad_norm": 1.34375, "learning_rate": 0.00036847800383460493, "loss": 5.0205, "mean_token_accuracy": 0.20540768951177596, "num_tokens": 82160337.0, "step": 47370 }, { "entropy": 5.782108354568481, "epoch": 3.68593658821241, "grad_norm": 1.3515625, "learning_rate": 0.00036845279268173076, "loss": 4.9498, "mean_token_accuracy": 0.21384851336479188, "num_tokens": 82168721.0, "step": 47375 }, { "entropy": 5.828218221664429, "epoch": 3.6863256175841275, "grad_norm": 1.265625, "learning_rate": 0.00036842758011085914, "loss": 4.955, "mean_token_accuracy": 0.21160003244876863, "num_tokens": 82177738.0, "step": 47380 }, { "entropy": 5.886498498916626, "epoch": 3.686714646955845, "grad_norm": 1.2578125, "learning_rate": 0.0003684023661223727, "loss": 4.9789, "mean_token_accuracy": 0.21420596688985824, "num_tokens": 82186726.0, "step": 47385 }, { "entropy": 5.803761529922485, "epoch": 3.687103676327563, "grad_norm": 1.421875, "learning_rate": 0.00036837715071665403, "loss": 4.9002, "mean_token_accuracy": 0.21785073280334472, "num_tokens": 82194742.0, "step": 47390 }, { "entropy": 5.793007230758667, "epoch": 3.68749270569928, "grad_norm": 1.359375, "learning_rate": 0.0003683519338940857, "loss": 4.9734, "mean_token_accuracy": 0.21439505666494368, "num_tokens": 82203513.0, "step": 47395 }, { "entropy": 5.7156675338745115, "epoch": 3.687881735070998, "grad_norm": 1.3828125, "learning_rate": 0.00036832671565505045, "loss": 4.9125, "mean_token_accuracy": 0.21286508589982986, "num_tokens": 82211963.0, "step": 47400 }, { "entropy": 5.8609624862670895, "epoch": 3.6882707644427155, "grad_norm": 1.40625, "learning_rate": 0.0003683014959999307, "loss": 4.9699, "mean_token_accuracy": 0.20385728627443314, "num_tokens": 82220399.0, "step": 47405 }, { "entropy": 5.782517290115356, "epoch": 3.688659793814433, "grad_norm": 1.34375, "learning_rate": 0.0003682762749291094, "loss": 4.8805, "mean_token_accuracy": 0.216788911819458, "num_tokens": 82228393.0, "step": 47410 }, { "entropy": 5.847663021087646, "epoch": 3.6890488231861505, "grad_norm": 1.328125, "learning_rate": 0.000368251052442969, "loss": 4.999, "mean_token_accuracy": 0.20513266026973725, "num_tokens": 82237289.0, "step": 47415 }, { "entropy": 5.834073400497436, "epoch": 3.689437852557868, "grad_norm": 1.234375, "learning_rate": 0.00036822582854189234, "loss": 4.9749, "mean_token_accuracy": 0.21279284507036209, "num_tokens": 82246744.0, "step": 47420 }, { "entropy": 5.811693382263184, "epoch": 3.6898268819295854, "grad_norm": 1.359375, "learning_rate": 0.000368200603226262, "loss": 4.8894, "mean_token_accuracy": 0.20954977124929428, "num_tokens": 82255467.0, "step": 47425 }, { "entropy": 5.790075016021729, "epoch": 3.690215911301303, "grad_norm": 1.3359375, "learning_rate": 0.000368175376496461, "loss": 4.932, "mean_token_accuracy": 0.2191600665450096, "num_tokens": 82264891.0, "step": 47430 }, { "entropy": 5.76919116973877, "epoch": 3.690604940673021, "grad_norm": 1.2734375, "learning_rate": 0.0003681501483528719, "loss": 4.8318, "mean_token_accuracy": 0.22253467440605162, "num_tokens": 82274490.0, "step": 47435 }, { "entropy": 5.80750150680542, "epoch": 3.6909939700447385, "grad_norm": 1.296875, "learning_rate": 0.0003681249187958776, "loss": 4.9158, "mean_token_accuracy": 0.21334189623594285, "num_tokens": 82282934.0, "step": 47440 }, { "entropy": 5.707493591308594, "epoch": 3.691382999416456, "grad_norm": 1.3828125, "learning_rate": 0.00036809968782586087, "loss": 4.8401, "mean_token_accuracy": 0.22531289458274842, "num_tokens": 82291443.0, "step": 47445 }, { "entropy": 5.782946062088013, "epoch": 3.6917720287881735, "grad_norm": 1.3984375, "learning_rate": 0.0003680744554432045, "loss": 4.9695, "mean_token_accuracy": 0.21603130251169206, "num_tokens": 82299366.0, "step": 47450 }, { "entropy": 5.80762128829956, "epoch": 3.692161058159891, "grad_norm": 1.3203125, "learning_rate": 0.00036804922164829153, "loss": 4.9232, "mean_token_accuracy": 0.21761046946048737, "num_tokens": 82308000.0, "step": 47455 }, { "entropy": 5.759347629547119, "epoch": 3.6925500875316084, "grad_norm": 1.2734375, "learning_rate": 0.0003680239864415046, "loss": 4.9503, "mean_token_accuracy": 0.20667369961738585, "num_tokens": 82317417.0, "step": 47460 }, { "entropy": 5.742478942871093, "epoch": 3.692939116903326, "grad_norm": 1.2734375, "learning_rate": 0.0003679987498232268, "loss": 4.8942, "mean_token_accuracy": 0.21475998908281327, "num_tokens": 82325640.0, "step": 47465 }, { "entropy": 5.841833257675171, "epoch": 3.693328146275044, "grad_norm": 1.359375, "learning_rate": 0.000367973511793841, "loss": 5.0378, "mean_token_accuracy": 0.2009960815310478, "num_tokens": 82334586.0, "step": 47470 }, { "entropy": 5.800191926956177, "epoch": 3.6937171756467615, "grad_norm": 1.3515625, "learning_rate": 0.00036794827235373006, "loss": 4.863, "mean_token_accuracy": 0.21664305478334428, "num_tokens": 82343094.0, "step": 47475 }, { "entropy": 5.844036674499511, "epoch": 3.6941062050184788, "grad_norm": 1.421875, "learning_rate": 0.0003679230315032772, "loss": 5.0673, "mean_token_accuracy": 0.20197262167930602, "num_tokens": 82352116.0, "step": 47480 }, { "entropy": 5.831503915786743, "epoch": 3.6944952343901964, "grad_norm": 1.296875, "learning_rate": 0.0003678977892428651, "loss": 4.9764, "mean_token_accuracy": 0.210683174431324, "num_tokens": 82361075.0, "step": 47485 }, { "entropy": 5.733933305740356, "epoch": 3.694884263761914, "grad_norm": 1.34375, "learning_rate": 0.0003678725455728769, "loss": 4.9245, "mean_token_accuracy": 0.21111406087875367, "num_tokens": 82369655.0, "step": 47490 }, { "entropy": 5.8596940517425535, "epoch": 3.6952732931336314, "grad_norm": 1.15625, "learning_rate": 0.00036784730049369577, "loss": 5.0334, "mean_token_accuracy": 0.20121372491121292, "num_tokens": 82378790.0, "step": 47495 }, { "entropy": 5.8146710872650145, "epoch": 3.695662322505349, "grad_norm": 1.390625, "learning_rate": 0.0003678220540057045, "loss": 4.9387, "mean_token_accuracy": 0.21261062622070312, "num_tokens": 82387876.0, "step": 47500 }, { "entropy": 5.816575050354004, "epoch": 3.696051351877067, "grad_norm": 1.4609375, "learning_rate": 0.00036779680610928635, "loss": 4.9387, "mean_token_accuracy": 0.21852627992630005, "num_tokens": 82395701.0, "step": 47505 }, { "entropy": 5.89095139503479, "epoch": 3.6964403812487845, "grad_norm": 1.3125, "learning_rate": 0.0003677715568048244, "loss": 5.0663, "mean_token_accuracy": 0.20266327857971192, "num_tokens": 82404664.0, "step": 47510 }, { "entropy": 5.822957277297974, "epoch": 3.6968294106205017, "grad_norm": 1.359375, "learning_rate": 0.00036774630609270165, "loss": 4.9956, "mean_token_accuracy": 0.21211827546358109, "num_tokens": 82413854.0, "step": 47515 }, { "entropy": 5.882249927520752, "epoch": 3.6972184399922194, "grad_norm": 1.4921875, "learning_rate": 0.00036772105397330147, "loss": 5.0331, "mean_token_accuracy": 0.21250219643115997, "num_tokens": 82422119.0, "step": 47520 }, { "entropy": 5.836722946166992, "epoch": 3.697607469363937, "grad_norm": 1.390625, "learning_rate": 0.0003676958004470067, "loss": 4.9413, "mean_token_accuracy": 0.2110415741801262, "num_tokens": 82429877.0, "step": 47525 }, { "entropy": 5.779804229736328, "epoch": 3.6979964987356544, "grad_norm": 1.3515625, "learning_rate": 0.0003676705455142009, "loss": 4.9495, "mean_token_accuracy": 0.20790804773569108, "num_tokens": 82438902.0, "step": 47530 }, { "entropy": 5.830459880828857, "epoch": 3.698385528107372, "grad_norm": 1.390625, "learning_rate": 0.0003676452891752669, "loss": 4.9917, "mean_token_accuracy": 0.2086479678750038, "num_tokens": 82447786.0, "step": 47535 }, { "entropy": 5.844129133224487, "epoch": 3.69877455747909, "grad_norm": 1.34375, "learning_rate": 0.0003676200314305882, "loss": 4.9881, "mean_token_accuracy": 0.20550404489040375, "num_tokens": 82457349.0, "step": 47540 }, { "entropy": 5.881977796554565, "epoch": 3.6991635868508075, "grad_norm": 1.3515625, "learning_rate": 0.0003675947722805479, "loss": 4.9695, "mean_token_accuracy": 0.20824549943208695, "num_tokens": 82465823.0, "step": 47545 }, { "entropy": 5.787006473541259, "epoch": 3.6995526162225247, "grad_norm": 1.234375, "learning_rate": 0.0003675695117255293, "loss": 4.9121, "mean_token_accuracy": 0.20989816784858703, "num_tokens": 82475567.0, "step": 47550 }, { "entropy": 5.793598747253418, "epoch": 3.6999416455942424, "grad_norm": 1.3515625, "learning_rate": 0.0003675442497659157, "loss": 4.8816, "mean_token_accuracy": 0.218390853703022, "num_tokens": 82483938.0, "step": 47555 }, { "entropy": 5.777826404571533, "epoch": 3.7003306749659597, "grad_norm": 1.3828125, "learning_rate": 0.0003675189864020905, "loss": 4.9349, "mean_token_accuracy": 0.21615647971630098, "num_tokens": 82491962.0, "step": 47560 }, { "entropy": 5.808918380737305, "epoch": 3.7007197043376774, "grad_norm": 1.2890625, "learning_rate": 0.0003674937216344368, "loss": 4.9351, "mean_token_accuracy": 0.21517158299684525, "num_tokens": 82500856.0, "step": 47565 }, { "entropy": 5.895078659057617, "epoch": 3.701108733709395, "grad_norm": 1.3203125, "learning_rate": 0.0003674684554633382, "loss": 5.0015, "mean_token_accuracy": 0.20611666589975358, "num_tokens": 82509305.0, "step": 47570 }, { "entropy": 5.856377649307251, "epoch": 3.701497763081113, "grad_norm": 1.40625, "learning_rate": 0.0003674431878891779, "loss": 4.9604, "mean_token_accuracy": 0.2118248850107193, "num_tokens": 82517872.0, "step": 47575 }, { "entropy": 5.838798856735229, "epoch": 3.70188679245283, "grad_norm": 1.28125, "learning_rate": 0.0003674179189123393, "loss": 4.9676, "mean_token_accuracy": 0.20874841511249542, "num_tokens": 82526172.0, "step": 47580 }, { "entropy": 5.816642808914184, "epoch": 3.7022758218245477, "grad_norm": 1.3046875, "learning_rate": 0.00036739264853320606, "loss": 4.9514, "mean_token_accuracy": 0.2117399051785469, "num_tokens": 82535139.0, "step": 47585 }, { "entropy": 5.848377370834351, "epoch": 3.7026648511962654, "grad_norm": 1.2421875, "learning_rate": 0.00036736737675216127, "loss": 5.0326, "mean_token_accuracy": 0.20246654748916626, "num_tokens": 82545229.0, "step": 47590 }, { "entropy": 5.9037832736969, "epoch": 3.7030538805679827, "grad_norm": 1.34375, "learning_rate": 0.0003673421035695887, "loss": 5.1049, "mean_token_accuracy": 0.2042330399155617, "num_tokens": 82554516.0, "step": 47595 }, { "entropy": 5.791474485397339, "epoch": 3.7034429099397004, "grad_norm": 1.59375, "learning_rate": 0.0003673168289858716, "loss": 4.9159, "mean_token_accuracy": 0.22097381055355073, "num_tokens": 82562652.0, "step": 47600 }, { "entropy": 5.77741961479187, "epoch": 3.703831939311418, "grad_norm": 1.3359375, "learning_rate": 0.0003672915530013936, "loss": 4.9773, "mean_token_accuracy": 0.2128673940896988, "num_tokens": 82570803.0, "step": 47605 }, { "entropy": 5.83367657661438, "epoch": 3.7042209686831358, "grad_norm": 1.34375, "learning_rate": 0.00036726627561653815, "loss": 4.9624, "mean_token_accuracy": 0.2143327221274376, "num_tokens": 82578882.0, "step": 47610 }, { "entropy": 5.9022942066192625, "epoch": 3.704609998054853, "grad_norm": 1.3046875, "learning_rate": 0.0003672409968316888, "loss": 5.0471, "mean_token_accuracy": 0.2032284140586853, "num_tokens": 82587371.0, "step": 47615 }, { "entropy": 5.92920618057251, "epoch": 3.7049990274265707, "grad_norm": 1.390625, "learning_rate": 0.00036721571664722914, "loss": 4.9972, "mean_token_accuracy": 0.21020781397819518, "num_tokens": 82595889.0, "step": 47620 }, { "entropy": 5.845452213287354, "epoch": 3.7053880567982884, "grad_norm": 1.234375, "learning_rate": 0.0003671904350635428, "loss": 5.0066, "mean_token_accuracy": 0.21320783346891403, "num_tokens": 82604921.0, "step": 47625 }, { "entropy": 5.785266256332397, "epoch": 3.7057770861700057, "grad_norm": 1.359375, "learning_rate": 0.00036716515208101334, "loss": 4.9278, "mean_token_accuracy": 0.21173641830682755, "num_tokens": 82613393.0, "step": 47630 }, { "entropy": 5.801237726211548, "epoch": 3.7061661155417234, "grad_norm": 1.2578125, "learning_rate": 0.0003671398677000244, "loss": 4.8631, "mean_token_accuracy": 0.22240647822618484, "num_tokens": 82623122.0, "step": 47635 }, { "entropy": 5.798791074752808, "epoch": 3.706555144913441, "grad_norm": 1.3828125, "learning_rate": 0.0003671145819209596, "loss": 4.8841, "mean_token_accuracy": 0.21643069088459016, "num_tokens": 82631747.0, "step": 47640 }, { "entropy": 5.867663717269897, "epoch": 3.7069441742851588, "grad_norm": 1.421875, "learning_rate": 0.0003670892947442026, "loss": 4.9836, "mean_token_accuracy": 0.21093566566705704, "num_tokens": 82640690.0, "step": 47645 }, { "entropy": 5.804168462753296, "epoch": 3.707333203656876, "grad_norm": 1.3828125, "learning_rate": 0.0003670640061701371, "loss": 4.9932, "mean_token_accuracy": 0.22058282047510147, "num_tokens": 82649032.0, "step": 47650 }, { "entropy": 5.839563941955566, "epoch": 3.7077222330285937, "grad_norm": 1.375, "learning_rate": 0.0003670387161991469, "loss": 4.9733, "mean_token_accuracy": 0.21046100109815596, "num_tokens": 82657970.0, "step": 47655 }, { "entropy": 5.842561721801758, "epoch": 3.708111262400311, "grad_norm": 1.328125, "learning_rate": 0.0003670134248316157, "loss": 4.9243, "mean_token_accuracy": 0.21391931623220445, "num_tokens": 82666534.0, "step": 47660 }, { "entropy": 5.868252182006836, "epoch": 3.7085002917720287, "grad_norm": 1.2890625, "learning_rate": 0.00036698813206792724, "loss": 5.009, "mean_token_accuracy": 0.21215423196554184, "num_tokens": 82675015.0, "step": 47665 }, { "entropy": 5.903868913650513, "epoch": 3.7088893211437464, "grad_norm": 1.421875, "learning_rate": 0.00036696283790846524, "loss": 4.9951, "mean_token_accuracy": 0.20647107809782028, "num_tokens": 82683431.0, "step": 47670 }, { "entropy": 5.8910339832305905, "epoch": 3.709278350515464, "grad_norm": 1.3515625, "learning_rate": 0.00036693754235361364, "loss": 5.0455, "mean_token_accuracy": 0.20200192034244538, "num_tokens": 82691466.0, "step": 47675 }, { "entropy": 5.858867597579956, "epoch": 3.7096673798871818, "grad_norm": 1.375, "learning_rate": 0.0003669122454037561, "loss": 4.8955, "mean_token_accuracy": 0.21845878064632415, "num_tokens": 82700071.0, "step": 47680 }, { "entropy": 5.823124694824219, "epoch": 3.710056409258899, "grad_norm": 1.3046875, "learning_rate": 0.0003668869470592765, "loss": 4.9133, "mean_token_accuracy": 0.2068781226873398, "num_tokens": 82709164.0, "step": 47685 }, { "entropy": 5.826355123519898, "epoch": 3.7104454386306167, "grad_norm": 1.2734375, "learning_rate": 0.00036686164732055876, "loss": 4.9958, "mean_token_accuracy": 0.20407401770353317, "num_tokens": 82718119.0, "step": 47690 }, { "entropy": 5.833717632293701, "epoch": 3.710834468002334, "grad_norm": 1.453125, "learning_rate": 0.00036683634618798675, "loss": 4.9212, "mean_token_accuracy": 0.21623031198978424, "num_tokens": 82725932.0, "step": 47695 }, { "entropy": 5.784215021133423, "epoch": 3.7112234973740517, "grad_norm": 1.3984375, "learning_rate": 0.0003668110436619443, "loss": 4.9042, "mean_token_accuracy": 0.21834779530763626, "num_tokens": 82734183.0, "step": 47700 }, { "entropy": 5.788884782791138, "epoch": 3.7116125267457694, "grad_norm": 1.3125, "learning_rate": 0.00036678573974281546, "loss": 5.0057, "mean_token_accuracy": 0.21046918481588364, "num_tokens": 82742434.0, "step": 47705 }, { "entropy": 5.865456199645996, "epoch": 3.712001556117487, "grad_norm": 1.2734375, "learning_rate": 0.0003667604344309841, "loss": 5.01, "mean_token_accuracy": 0.20261069238185883, "num_tokens": 82751859.0, "step": 47710 }, { "entropy": 5.804358005523682, "epoch": 3.7123905854892043, "grad_norm": 1.3515625, "learning_rate": 0.00036673512772683424, "loss": 4.8862, "mean_token_accuracy": 0.2154978707432747, "num_tokens": 82760633.0, "step": 47715 }, { "entropy": 5.848613119125366, "epoch": 3.712779614860922, "grad_norm": 1.3828125, "learning_rate": 0.0003667098196307498, "loss": 4.9626, "mean_token_accuracy": 0.21573690921068192, "num_tokens": 82769408.0, "step": 47720 }, { "entropy": 5.737537002563476, "epoch": 3.7131686442326397, "grad_norm": 1.4453125, "learning_rate": 0.00036668451014311475, "loss": 4.8944, "mean_token_accuracy": 0.22020492553710938, "num_tokens": 82778565.0, "step": 47725 }, { "entropy": 5.771137428283692, "epoch": 3.713557673604357, "grad_norm": 1.4375, "learning_rate": 0.00036665919926431325, "loss": 4.9086, "mean_token_accuracy": 0.22024179995059967, "num_tokens": 82787322.0, "step": 47730 }, { "entropy": 5.8310027599334715, "epoch": 3.7139467029760747, "grad_norm": 1.5, "learning_rate": 0.0003666338869947293, "loss": 4.9309, "mean_token_accuracy": 0.21158193051815033, "num_tokens": 82794763.0, "step": 47735 }, { "entropy": 5.8416440963745115, "epoch": 3.7143357323477924, "grad_norm": 1.3671875, "learning_rate": 0.0003666085733347469, "loss": 4.9892, "mean_token_accuracy": 0.21041932702064514, "num_tokens": 82803651.0, "step": 47740 }, { "entropy": 5.915333652496338, "epoch": 3.71472476171951, "grad_norm": 1.359375, "learning_rate": 0.00036658325828475033, "loss": 5.0058, "mean_token_accuracy": 0.20295648127794266, "num_tokens": 82812064.0, "step": 47745 }, { "entropy": 5.844149208068847, "epoch": 3.7151137910912273, "grad_norm": 1.2890625, "learning_rate": 0.0003665579418451235, "loss": 4.8818, "mean_token_accuracy": 0.21924808174371718, "num_tokens": 82821157.0, "step": 47750 }, { "entropy": 5.813853740692139, "epoch": 3.715502820462945, "grad_norm": 1.375, "learning_rate": 0.0003665326240162506, "loss": 4.9872, "mean_token_accuracy": 0.20995181053876877, "num_tokens": 82829875.0, "step": 47755 }, { "entropy": 5.827734899520874, "epoch": 3.7158918498346623, "grad_norm": 1.4140625, "learning_rate": 0.00036650730479851593, "loss": 4.8555, "mean_token_accuracy": 0.22218545377254487, "num_tokens": 82838371.0, "step": 47760 }, { "entropy": 5.842835426330566, "epoch": 3.71628087920638, "grad_norm": 1.359375, "learning_rate": 0.00036648198419230344, "loss": 5.0751, "mean_token_accuracy": 0.20970909148454667, "num_tokens": 82846823.0, "step": 47765 }, { "entropy": 5.772879886627197, "epoch": 3.7166699085780976, "grad_norm": 1.375, "learning_rate": 0.00036645666219799753, "loss": 4.9312, "mean_token_accuracy": 0.21171149164438247, "num_tokens": 82855548.0, "step": 47770 }, { "entropy": 5.868474054336548, "epoch": 3.7170589379498153, "grad_norm": 1.390625, "learning_rate": 0.0003664313388159823, "loss": 4.928, "mean_token_accuracy": 0.21526189148426056, "num_tokens": 82864313.0, "step": 47775 }, { "entropy": 5.806881332397461, "epoch": 3.717447967321533, "grad_norm": 1.3125, "learning_rate": 0.000366406014046642, "loss": 4.8863, "mean_token_accuracy": 0.2130802184343338, "num_tokens": 82872603.0, "step": 47780 }, { "entropy": 5.842578983306884, "epoch": 3.7178369966932503, "grad_norm": 1.609375, "learning_rate": 0.000366380687890361, "loss": 5.0167, "mean_token_accuracy": 0.2084202989935875, "num_tokens": 82880962.0, "step": 47785 }, { "entropy": 5.831890678405761, "epoch": 3.718226026064968, "grad_norm": 1.234375, "learning_rate": 0.0003663553603475235, "loss": 4.9614, "mean_token_accuracy": 0.22131507396697997, "num_tokens": 82889876.0, "step": 47790 }, { "entropy": 5.786353397369385, "epoch": 3.7186150554366852, "grad_norm": 1.3203125, "learning_rate": 0.00036633003141851373, "loss": 4.9511, "mean_token_accuracy": 0.21048336923122407, "num_tokens": 82899083.0, "step": 47795 }, { "entropy": 5.859846448898315, "epoch": 3.719004084808403, "grad_norm": 1.359375, "learning_rate": 0.0003663047011037162, "loss": 4.935, "mean_token_accuracy": 0.2125890538096428, "num_tokens": 82907207.0, "step": 47800 }, { "entropy": 5.820394468307495, "epoch": 3.7193931141801206, "grad_norm": 1.3046875, "learning_rate": 0.0003662793694035151, "loss": 4.9236, "mean_token_accuracy": 0.21446046531200408, "num_tokens": 82915979.0, "step": 47805 }, { "entropy": 5.851028919219971, "epoch": 3.7197821435518383, "grad_norm": 1.2890625, "learning_rate": 0.0003662540363182949, "loss": 4.9828, "mean_token_accuracy": 0.20357959121465682, "num_tokens": 82924668.0, "step": 47810 }, { "entropy": 5.770662593841553, "epoch": 3.7201711729235556, "grad_norm": 1.296875, "learning_rate": 0.0003662287018484398, "loss": 4.9193, "mean_token_accuracy": 0.21677715182304383, "num_tokens": 82933065.0, "step": 47815 }, { "entropy": 5.770005512237549, "epoch": 3.7205602022952733, "grad_norm": 1.34375, "learning_rate": 0.0003662033659943345, "loss": 4.9541, "mean_token_accuracy": 0.2144200697541237, "num_tokens": 82942270.0, "step": 47820 }, { "entropy": 5.790526533126831, "epoch": 3.720949231666991, "grad_norm": 1.2578125, "learning_rate": 0.00036617802875636333, "loss": 4.8943, "mean_token_accuracy": 0.21514707505702974, "num_tokens": 82950774.0, "step": 47825 }, { "entropy": 5.812875175476075, "epoch": 3.7213382610387082, "grad_norm": 1.265625, "learning_rate": 0.0003661526901349106, "loss": 4.9002, "mean_token_accuracy": 0.22173648774623872, "num_tokens": 82959444.0, "step": 47830 }, { "entropy": 5.82558650970459, "epoch": 3.721727290410426, "grad_norm": 1.3828125, "learning_rate": 0.00036612735013036085, "loss": 5.0056, "mean_token_accuracy": 0.2146499365568161, "num_tokens": 82968217.0, "step": 47835 }, { "entropy": 5.801222276687622, "epoch": 3.7221163197821436, "grad_norm": 1.25, "learning_rate": 0.0003661020087430987, "loss": 4.9359, "mean_token_accuracy": 0.213276706635952, "num_tokens": 82977320.0, "step": 47840 }, { "entropy": 5.894186878204346, "epoch": 3.7225053491538613, "grad_norm": 1.2890625, "learning_rate": 0.0003660766659735086, "loss": 5.0599, "mean_token_accuracy": 0.2083798199892044, "num_tokens": 82986517.0, "step": 47845 }, { "entropy": 5.939667654037476, "epoch": 3.7228943785255786, "grad_norm": 1.53125, "learning_rate": 0.0003660513218219749, "loss": 4.9613, "mean_token_accuracy": 0.22739367485046386, "num_tokens": 82995419.0, "step": 47850 }, { "entropy": 5.814560270309448, "epoch": 3.7232834078972963, "grad_norm": 1.3203125, "learning_rate": 0.0003660259762888824, "loss": 4.954, "mean_token_accuracy": 0.21166229099035264, "num_tokens": 83003459.0, "step": 47855 }, { "entropy": 5.811594676971436, "epoch": 3.7236724372690135, "grad_norm": 1.390625, "learning_rate": 0.0003660006293746156, "loss": 5.0061, "mean_token_accuracy": 0.21104368716478347, "num_tokens": 83011974.0, "step": 47860 }, { "entropy": 5.858108282089233, "epoch": 3.7240614666407312, "grad_norm": 1.3125, "learning_rate": 0.00036597528107955914, "loss": 4.9742, "mean_token_accuracy": 0.21286963522434235, "num_tokens": 83021124.0, "step": 47865 }, { "entropy": 5.829787969589233, "epoch": 3.724450496012449, "grad_norm": 1.3125, "learning_rate": 0.00036594993140409753, "loss": 4.9397, "mean_token_accuracy": 0.2185853362083435, "num_tokens": 83029667.0, "step": 47870 }, { "entropy": 5.831813716888428, "epoch": 3.7248395253841666, "grad_norm": 1.375, "learning_rate": 0.0003659245803486155, "loss": 4.8859, "mean_token_accuracy": 0.22004348486661912, "num_tokens": 83038610.0, "step": 47875 }, { "entropy": 5.863837337493896, "epoch": 3.7252285547558843, "grad_norm": 1.328125, "learning_rate": 0.0003658992279134977, "loss": 5.0567, "mean_token_accuracy": 0.20435242503881454, "num_tokens": 83047280.0, "step": 47880 }, { "entropy": 5.8509824752807615, "epoch": 3.7256175841276016, "grad_norm": 1.34375, "learning_rate": 0.0003658738740991287, "loss": 4.9779, "mean_token_accuracy": 0.21018191277980805, "num_tokens": 83057411.0, "step": 47885 }, { "entropy": 5.854897737503052, "epoch": 3.7260066134993193, "grad_norm": 1.34375, "learning_rate": 0.00036584851890589335, "loss": 5.0514, "mean_token_accuracy": 0.2017844706773758, "num_tokens": 83066224.0, "step": 47890 }, { "entropy": 5.742435312271118, "epoch": 3.7263956428710365, "grad_norm": 1.3203125, "learning_rate": 0.00036582316233417636, "loss": 4.8993, "mean_token_accuracy": 0.21097672134637832, "num_tokens": 83075261.0, "step": 47895 }, { "entropy": 5.8045735359191895, "epoch": 3.7267846722427542, "grad_norm": 1.3359375, "learning_rate": 0.00036579780438436246, "loss": 4.9345, "mean_token_accuracy": 0.20901874601840972, "num_tokens": 83083796.0, "step": 47900 }, { "entropy": 5.80733003616333, "epoch": 3.727173701614472, "grad_norm": 1.265625, "learning_rate": 0.0003657724450568363, "loss": 4.9824, "mean_token_accuracy": 0.2082891583442688, "num_tokens": 83093349.0, "step": 47905 }, { "entropy": 5.862991809844971, "epoch": 3.7275627309861896, "grad_norm": 1.3203125, "learning_rate": 0.0003657470843519829, "loss": 5.0359, "mean_token_accuracy": 0.2059582069516182, "num_tokens": 83102377.0, "step": 47910 }, { "entropy": 5.741253471374511, "epoch": 3.727951760357907, "grad_norm": 1.3046875, "learning_rate": 0.0003657217222701868, "loss": 4.8564, "mean_token_accuracy": 0.22305884659290315, "num_tokens": 83110720.0, "step": 47915 }, { "entropy": 5.665694618225098, "epoch": 3.7283407897296246, "grad_norm": 1.2265625, "learning_rate": 0.000365696358811833, "loss": 4.814, "mean_token_accuracy": 0.21523180603981018, "num_tokens": 83120765.0, "step": 47920 }, { "entropy": 5.699869918823242, "epoch": 3.7287298191013423, "grad_norm": 1.25, "learning_rate": 0.00036567099397730635, "loss": 4.8336, "mean_token_accuracy": 0.21737933903932571, "num_tokens": 83129100.0, "step": 47925 }, { "entropy": 5.762078189849854, "epoch": 3.7291188484730595, "grad_norm": 1.3359375, "learning_rate": 0.0003656456277669917, "loss": 4.884, "mean_token_accuracy": 0.2194640800356865, "num_tokens": 83137918.0, "step": 47930 }, { "entropy": 5.898148870468139, "epoch": 3.729507877844777, "grad_norm": 1.3125, "learning_rate": 0.00036562026018127386, "loss": 5.0387, "mean_token_accuracy": 0.21034625321626663, "num_tokens": 83147227.0, "step": 47935 }, { "entropy": 5.8558440685272215, "epoch": 3.729896907216495, "grad_norm": 1.328125, "learning_rate": 0.00036559489122053786, "loss": 4.91, "mean_token_accuracy": 0.2174339398741722, "num_tokens": 83156019.0, "step": 47940 }, { "entropy": 5.7728844165802, "epoch": 3.7302859365882126, "grad_norm": 1.3984375, "learning_rate": 0.0003655695208851686, "loss": 4.8343, "mean_token_accuracy": 0.22914837449789047, "num_tokens": 83164510.0, "step": 47945 }, { "entropy": 5.855320596694947, "epoch": 3.73067496595993, "grad_norm": 1.484375, "learning_rate": 0.00036554414917555096, "loss": 4.9943, "mean_token_accuracy": 0.20583319962024688, "num_tokens": 83173095.0, "step": 47950 }, { "entropy": 5.822858762741089, "epoch": 3.7310639953316476, "grad_norm": 1.265625, "learning_rate": 0.00036551877609207, "loss": 4.9143, "mean_token_accuracy": 0.21741992980241776, "num_tokens": 83181884.0, "step": 47955 }, { "entropy": 5.847262907028198, "epoch": 3.7314530247033653, "grad_norm": 1.2421875, "learning_rate": 0.0003654934016351107, "loss": 4.9714, "mean_token_accuracy": 0.2216199517250061, "num_tokens": 83190039.0, "step": 47960 }, { "entropy": 5.8938483715057375, "epoch": 3.7318420540750825, "grad_norm": 1.3046875, "learning_rate": 0.00036546802580505805, "loss": 5.1191, "mean_token_accuracy": 0.19443112462759018, "num_tokens": 83198757.0, "step": 47965 }, { "entropy": 5.829267740249634, "epoch": 3.7322310834468, "grad_norm": 1.2578125, "learning_rate": 0.0003654426486022971, "loss": 4.9531, "mean_token_accuracy": 0.20871175527572633, "num_tokens": 83208304.0, "step": 47970 }, { "entropy": 5.867332983016968, "epoch": 3.732620112818518, "grad_norm": 1.3984375, "learning_rate": 0.0003654172700272129, "loss": 4.9832, "mean_token_accuracy": 0.2139279291033745, "num_tokens": 83216702.0, "step": 47975 }, { "entropy": 5.868944406509399, "epoch": 3.7330091421902356, "grad_norm": 1.4140625, "learning_rate": 0.0003653918900801905, "loss": 4.9198, "mean_token_accuracy": 0.2257342129945755, "num_tokens": 83225248.0, "step": 47980 }, { "entropy": 5.809030055999756, "epoch": 3.733398171561953, "grad_norm": 1.2734375, "learning_rate": 0.00036536650876161514, "loss": 4.8832, "mean_token_accuracy": 0.22110605090856553, "num_tokens": 83233861.0, "step": 47985 }, { "entropy": 5.834697532653808, "epoch": 3.7337872009336706, "grad_norm": 1.375, "learning_rate": 0.0003653411260718718, "loss": 4.9898, "mean_token_accuracy": 0.20974529832601546, "num_tokens": 83242950.0, "step": 47990 }, { "entropy": 5.8395123958587645, "epoch": 3.734176230305388, "grad_norm": 1.3515625, "learning_rate": 0.0003653157420113457, "loss": 5.0451, "mean_token_accuracy": 0.20678835809230806, "num_tokens": 83250917.0, "step": 47995 }, { "entropy": 5.871608018875122, "epoch": 3.7345652596771055, "grad_norm": 1.4296875, "learning_rate": 0.0003652903565804219, "loss": 4.924, "mean_token_accuracy": 0.21541347056627275, "num_tokens": 83259282.0, "step": 48000 }, { "epoch": 3.7345652596771055, "eval_entropy": 5.5707257245112425, "eval_loss": 5.04781436920166, "eval_mean_token_accuracy": 0.21727151325881425, "eval_num_tokens": 83259282.0, "eval_runtime": 21.9914, "eval_samples_per_second": 1889.736, "eval_steps_per_second": 236.228, "step": 48000 }, { "entropy": 5.839330005645752, "epoch": 3.734954289048823, "grad_norm": 1.3984375, "learning_rate": 0.00036526496977948574, "loss": 5.0314, "mean_token_accuracy": 0.210779544711113, "num_tokens": 83267674.0, "step": 48005 }, { "entropy": 5.798641347885132, "epoch": 3.735343318420541, "grad_norm": 1.3125, "learning_rate": 0.00036523958160892227, "loss": 4.9566, "mean_token_accuracy": 0.21812812089920045, "num_tokens": 83276084.0, "step": 48010 }, { "entropy": 5.771815443038941, "epoch": 3.735732347792258, "grad_norm": 1.375, "learning_rate": 0.00036521419206911684, "loss": 4.8999, "mean_token_accuracy": 0.21293993890285492, "num_tokens": 83284608.0, "step": 48015 }, { "entropy": 5.852262496948242, "epoch": 3.736121377163976, "grad_norm": 1.2734375, "learning_rate": 0.0003651888011604545, "loss": 4.9721, "mean_token_accuracy": 0.20959798544645308, "num_tokens": 83293099.0, "step": 48020 }, { "entropy": 5.832505416870117, "epoch": 3.7365104065356936, "grad_norm": 1.2890625, "learning_rate": 0.00036516340888332076, "loss": 5.0145, "mean_token_accuracy": 0.21204451322555543, "num_tokens": 83302225.0, "step": 48025 }, { "entropy": 5.821444845199585, "epoch": 3.736899435907411, "grad_norm": 1.3359375, "learning_rate": 0.00036513801523810075, "loss": 4.9294, "mean_token_accuracy": 0.2141224205493927, "num_tokens": 83311070.0, "step": 48030 }, { "entropy": 5.803778886795044, "epoch": 3.7372884652791285, "grad_norm": 1.296875, "learning_rate": 0.0003651126202251799, "loss": 4.8887, "mean_token_accuracy": 0.2212057366967201, "num_tokens": 83319391.0, "step": 48035 }, { "entropy": 5.879584169387817, "epoch": 3.737677494650846, "grad_norm": 1.3359375, "learning_rate": 0.0003650872238449434, "loss": 5.054, "mean_token_accuracy": 0.19815609157085418, "num_tokens": 83329011.0, "step": 48040 }, { "entropy": 5.830575084686279, "epoch": 3.738066524022564, "grad_norm": 1.4375, "learning_rate": 0.0003650618260977767, "loss": 4.9596, "mean_token_accuracy": 0.216921828687191, "num_tokens": 83336464.0, "step": 48045 }, { "entropy": 5.802900934219361, "epoch": 3.738455553394281, "grad_norm": 1.3671875, "learning_rate": 0.0003650364269840651, "loss": 4.9227, "mean_token_accuracy": 0.21421520560979843, "num_tokens": 83344023.0, "step": 48050 }, { "entropy": 5.7968555927276615, "epoch": 3.738844582765999, "grad_norm": 1.2578125, "learning_rate": 0.0003650110265041941, "loss": 4.9204, "mean_token_accuracy": 0.2138715237379074, "num_tokens": 83353397.0, "step": 48055 }, { "entropy": 5.8274883270263675, "epoch": 3.7392336121377165, "grad_norm": 1.234375, "learning_rate": 0.00036498562465854897, "loss": 4.9138, "mean_token_accuracy": 0.22371768653392793, "num_tokens": 83361579.0, "step": 48060 }, { "entropy": 5.810103559494019, "epoch": 3.739622641509434, "grad_norm": 1.3671875, "learning_rate": 0.0003649602214475152, "loss": 4.9322, "mean_token_accuracy": 0.21632397323846816, "num_tokens": 83370253.0, "step": 48065 }, { "entropy": 5.817929744720459, "epoch": 3.7400116708811515, "grad_norm": 1.25, "learning_rate": 0.00036493481687147836, "loss": 4.9604, "mean_token_accuracy": 0.20656620413064958, "num_tokens": 83379021.0, "step": 48070 }, { "entropy": 5.9248076438903805, "epoch": 3.740400700252869, "grad_norm": 1.3203125, "learning_rate": 0.0003649094109308237, "loss": 5.0913, "mean_token_accuracy": 0.20106624960899352, "num_tokens": 83387285.0, "step": 48075 }, { "entropy": 5.784343814849853, "epoch": 3.740789729624587, "grad_norm": 1.25, "learning_rate": 0.00036488400362593695, "loss": 4.867, "mean_token_accuracy": 0.21599290668964385, "num_tokens": 83396541.0, "step": 48080 }, { "entropy": 5.806223726272583, "epoch": 3.741178758996304, "grad_norm": 1.3125, "learning_rate": 0.00036485859495720337, "loss": 4.9747, "mean_token_accuracy": 0.20569291859865188, "num_tokens": 83404766.0, "step": 48085 }, { "entropy": 5.865656423568725, "epoch": 3.741567788368022, "grad_norm": 1.3046875, "learning_rate": 0.00036483318492500875, "loss": 4.9817, "mean_token_accuracy": 0.21017386317253112, "num_tokens": 83413162.0, "step": 48090 }, { "entropy": 5.798042058944702, "epoch": 3.741956817739739, "grad_norm": 1.2734375, "learning_rate": 0.00036480777352973856, "loss": 4.8656, "mean_token_accuracy": 0.2187887981534004, "num_tokens": 83422386.0, "step": 48095 }, { "entropy": 5.7904381275177, "epoch": 3.742345847111457, "grad_norm": 1.2734375, "learning_rate": 0.00036478236077177825, "loss": 4.871, "mean_token_accuracy": 0.21698054820299148, "num_tokens": 83431144.0, "step": 48100 }, { "entropy": 5.79972276687622, "epoch": 3.7427348764831745, "grad_norm": 1.359375, "learning_rate": 0.00036475694665151357, "loss": 5.003, "mean_token_accuracy": 0.2111394315958023, "num_tokens": 83440372.0, "step": 48105 }, { "entropy": 5.830613231658935, "epoch": 3.743123905854892, "grad_norm": 1.390625, "learning_rate": 0.00036473153116933007, "loss": 4.938, "mean_token_accuracy": 0.21442829221487045, "num_tokens": 83448753.0, "step": 48110 }, { "entropy": 5.891182279586792, "epoch": 3.74351293522661, "grad_norm": 1.3359375, "learning_rate": 0.00036470611432561334, "loss": 5.0144, "mean_token_accuracy": 0.21135952025651933, "num_tokens": 83457620.0, "step": 48115 }, { "entropy": 5.872762441635132, "epoch": 3.743901964598327, "grad_norm": 1.21875, "learning_rate": 0.0003646806961207492, "loss": 5.0122, "mean_token_accuracy": 0.20905730575323106, "num_tokens": 83467260.0, "step": 48120 }, { "entropy": 5.787105512619019, "epoch": 3.744290993970045, "grad_norm": 1.3515625, "learning_rate": 0.00036465527655512323, "loss": 4.9201, "mean_token_accuracy": 0.21314291208982467, "num_tokens": 83476372.0, "step": 48125 }, { "entropy": 5.780849504470825, "epoch": 3.744680023341762, "grad_norm": 1.4921875, "learning_rate": 0.0003646298556291211, "loss": 4.9797, "mean_token_accuracy": 0.2075783520936966, "num_tokens": 83484561.0, "step": 48130 }, { "entropy": 5.8040581226348875, "epoch": 3.74506905271348, "grad_norm": 1.328125, "learning_rate": 0.00036460443334312867, "loss": 4.9086, "mean_token_accuracy": 0.216504967212677, "num_tokens": 83493476.0, "step": 48135 }, { "entropy": 5.822963523864746, "epoch": 3.7454580820851975, "grad_norm": 1.375, "learning_rate": 0.0003645790096975315, "loss": 4.9498, "mean_token_accuracy": 0.21128910928964614, "num_tokens": 83501964.0, "step": 48140 }, { "entropy": 5.7914581298828125, "epoch": 3.745847111456915, "grad_norm": 1.2734375, "learning_rate": 0.00036455358469271546, "loss": 5.0374, "mean_token_accuracy": 0.20687039345502853, "num_tokens": 83511336.0, "step": 48145 }, { "entropy": 5.8398580074310305, "epoch": 3.7462361408286324, "grad_norm": 1.3984375, "learning_rate": 0.00036452815832906625, "loss": 5.0421, "mean_token_accuracy": 0.21009505838155745, "num_tokens": 83519171.0, "step": 48150 }, { "entropy": 5.877081251144409, "epoch": 3.74662517020035, "grad_norm": 1.359375, "learning_rate": 0.00036450273060696984, "loss": 5.0054, "mean_token_accuracy": 0.21030834764242173, "num_tokens": 83527359.0, "step": 48155 }, { "entropy": 5.832540607452392, "epoch": 3.747014199572068, "grad_norm": 1.3984375, "learning_rate": 0.0003644773015268118, "loss": 4.8763, "mean_token_accuracy": 0.21326199620962144, "num_tokens": 83535746.0, "step": 48160 }, { "entropy": 5.790484046936035, "epoch": 3.747403228943785, "grad_norm": 1.453125, "learning_rate": 0.00036445187108897825, "loss": 4.9043, "mean_token_accuracy": 0.21852574348449708, "num_tokens": 83544109.0, "step": 48165 }, { "entropy": 5.864397096633911, "epoch": 3.747792258315503, "grad_norm": 1.296875, "learning_rate": 0.0003644264392938549, "loss": 5.1022, "mean_token_accuracy": 0.20583832114934922, "num_tokens": 83553099.0, "step": 48170 }, { "entropy": 5.926620674133301, "epoch": 3.7481812876872205, "grad_norm": 1.390625, "learning_rate": 0.00036440100614182775, "loss": 5.0416, "mean_token_accuracy": 0.2067590445280075, "num_tokens": 83561998.0, "step": 48175 }, { "entropy": 5.865017080307007, "epoch": 3.748570317058938, "grad_norm": 1.34375, "learning_rate": 0.00036437557163328255, "loss": 4.974, "mean_token_accuracy": 0.20464721620082854, "num_tokens": 83570896.0, "step": 48180 }, { "entropy": 5.858434343338013, "epoch": 3.7489593464306554, "grad_norm": 1.2890625, "learning_rate": 0.0003643501357686053, "loss": 5.0173, "mean_token_accuracy": 0.20509726852178572, "num_tokens": 83579043.0, "step": 48185 }, { "entropy": 5.772554063796997, "epoch": 3.749348375802373, "grad_norm": 1.3828125, "learning_rate": 0.00036432469854818194, "loss": 4.8664, "mean_token_accuracy": 0.21594008356332778, "num_tokens": 83587929.0, "step": 48190 }, { "entropy": 5.80068564414978, "epoch": 3.7497374051740904, "grad_norm": 1.328125, "learning_rate": 0.0003642992599723985, "loss": 4.882, "mean_token_accuracy": 0.21864021867513656, "num_tokens": 83596428.0, "step": 48195 }, { "entropy": 5.839773941040039, "epoch": 3.750126434545808, "grad_norm": 1.359375, "learning_rate": 0.0003642738200416409, "loss": 4.961, "mean_token_accuracy": 0.2149035930633545, "num_tokens": 83606247.0, "step": 48200 }, { "entropy": 5.863554239273071, "epoch": 3.7505154639175258, "grad_norm": 1.3046875, "learning_rate": 0.00036424837875629517, "loss": 4.9797, "mean_token_accuracy": 0.2164909467101097, "num_tokens": 83615056.0, "step": 48205 }, { "entropy": 5.836910820007324, "epoch": 3.7509044932892435, "grad_norm": 1.390625, "learning_rate": 0.00036422293611674736, "loss": 4.8925, "mean_token_accuracy": 0.2165834367275238, "num_tokens": 83623452.0, "step": 48210 }, { "entropy": 5.776988887786866, "epoch": 3.751293522660961, "grad_norm": 1.28125, "learning_rate": 0.00036419749212338346, "loss": 4.9489, "mean_token_accuracy": 0.2041123941540718, "num_tokens": 83631727.0, "step": 48215 }, { "entropy": 5.815929985046386, "epoch": 3.7516825520326784, "grad_norm": 1.265625, "learning_rate": 0.0003641720467765897, "loss": 4.8657, "mean_token_accuracy": 0.21736502200365065, "num_tokens": 83639644.0, "step": 48220 }, { "entropy": 5.765953302383423, "epoch": 3.752071581404396, "grad_norm": 1.46875, "learning_rate": 0.000364146600076752, "loss": 4.9145, "mean_token_accuracy": 0.2102223426103592, "num_tokens": 83648291.0, "step": 48225 }, { "entropy": 5.746558046340942, "epoch": 3.7524606107761134, "grad_norm": 1.3359375, "learning_rate": 0.0003641211520242565, "loss": 4.9184, "mean_token_accuracy": 0.22728172242641448, "num_tokens": 83657482.0, "step": 48230 }, { "entropy": 5.775856351852417, "epoch": 3.752849640147831, "grad_norm": 1.2578125, "learning_rate": 0.00036409570261948943, "loss": 4.8659, "mean_token_accuracy": 0.21271939277648927, "num_tokens": 83666264.0, "step": 48235 }, { "entropy": 5.868864679336548, "epoch": 3.7532386695195488, "grad_norm": 1.3046875, "learning_rate": 0.0003640702518628369, "loss": 5.0534, "mean_token_accuracy": 0.2034298449754715, "num_tokens": 83675552.0, "step": 48240 }, { "entropy": 5.863110494613648, "epoch": 3.7536276988912665, "grad_norm": 1.375, "learning_rate": 0.000364044799754685, "loss": 5.0011, "mean_token_accuracy": 0.20900235027074815, "num_tokens": 83684018.0, "step": 48245 }, { "entropy": 5.824972486495971, "epoch": 3.7540167282629837, "grad_norm": 1.375, "learning_rate": 0.00036401934629542, "loss": 4.8266, "mean_token_accuracy": 0.2145191565155983, "num_tokens": 83691769.0, "step": 48250 }, { "entropy": 5.771638345718384, "epoch": 3.7544057576347014, "grad_norm": 1.234375, "learning_rate": 0.00036399389148542813, "loss": 4.9459, "mean_token_accuracy": 0.2163345918059349, "num_tokens": 83700741.0, "step": 48255 }, { "entropy": 5.775435209274292, "epoch": 3.754794787006419, "grad_norm": 1.2890625, "learning_rate": 0.00036396843532509563, "loss": 4.9363, "mean_token_accuracy": 0.20917914062738419, "num_tokens": 83710345.0, "step": 48260 }, { "entropy": 5.86752758026123, "epoch": 3.7551838163781364, "grad_norm": 1.296875, "learning_rate": 0.0003639429778148087, "loss": 4.9689, "mean_token_accuracy": 0.21330667585134505, "num_tokens": 83719106.0, "step": 48265 }, { "entropy": 5.874535322189331, "epoch": 3.755572845749854, "grad_norm": 1.3203125, "learning_rate": 0.0003639175189549536, "loss": 5.0032, "mean_token_accuracy": 0.2030404344201088, "num_tokens": 83727842.0, "step": 48270 }, { "entropy": 5.837495374679565, "epoch": 3.7559618751215718, "grad_norm": 1.3359375, "learning_rate": 0.00036389205874591676, "loss": 4.98, "mean_token_accuracy": 0.20765695720911026, "num_tokens": 83736664.0, "step": 48275 }, { "entropy": 5.808910131454468, "epoch": 3.7563509044932895, "grad_norm": 1.2578125, "learning_rate": 0.00036386659718808437, "loss": 5.0688, "mean_token_accuracy": 0.20215073227882385, "num_tokens": 83745257.0, "step": 48280 }, { "entropy": 5.863513708114624, "epoch": 3.7567399338650067, "grad_norm": 1.28125, "learning_rate": 0.00036384113428184286, "loss": 4.9721, "mean_token_accuracy": 0.21522438377141953, "num_tokens": 83754073.0, "step": 48285 }, { "entropy": 5.839964866638184, "epoch": 3.7571289632367244, "grad_norm": 1.3984375, "learning_rate": 0.0003638156700275784, "loss": 4.9909, "mean_token_accuracy": 0.20508417189121247, "num_tokens": 83763348.0, "step": 48290 }, { "entropy": 5.871837472915649, "epoch": 3.757517992608442, "grad_norm": 1.6640625, "learning_rate": 0.0003637902044256777, "loss": 4.9651, "mean_token_accuracy": 0.2066944047808647, "num_tokens": 83772325.0, "step": 48295 }, { "entropy": 5.77579550743103, "epoch": 3.7579070219801594, "grad_norm": 1.3046875, "learning_rate": 0.0003637647374765269, "loss": 4.9539, "mean_token_accuracy": 0.21407010406255722, "num_tokens": 83780991.0, "step": 48300 }, { "entropy": 5.792299604415893, "epoch": 3.758296051351877, "grad_norm": 1.296875, "learning_rate": 0.00036373926918051243, "loss": 4.9066, "mean_token_accuracy": 0.21621909290552138, "num_tokens": 83789447.0, "step": 48305 }, { "entropy": 5.808613872528076, "epoch": 3.7586850807235948, "grad_norm": 1.34375, "learning_rate": 0.00036371379953802085, "loss": 4.921, "mean_token_accuracy": 0.21481148898601532, "num_tokens": 83797508.0, "step": 48310 }, { "entropy": 5.857865858078003, "epoch": 3.7590741100953124, "grad_norm": 1.4921875, "learning_rate": 0.00036368832854943856, "loss": 4.954, "mean_token_accuracy": 0.20573668777942658, "num_tokens": 83805861.0, "step": 48315 }, { "entropy": 5.8401069164276125, "epoch": 3.7594631394670297, "grad_norm": 1.4296875, "learning_rate": 0.00036366285621515206, "loss": 5.0116, "mean_token_accuracy": 0.20917888432741166, "num_tokens": 83814921.0, "step": 48320 }, { "entropy": 5.761917924880981, "epoch": 3.7598521688387474, "grad_norm": 1.4296875, "learning_rate": 0.0003636373825355478, "loss": 4.7837, "mean_token_accuracy": 0.2338728591799736, "num_tokens": 83823143.0, "step": 48325 }, { "entropy": 5.799488592147827, "epoch": 3.7602411982104647, "grad_norm": 1.359375, "learning_rate": 0.0003636119075110124, "loss": 4.9034, "mean_token_accuracy": 0.21674566417932511, "num_tokens": 83831407.0, "step": 48330 }, { "entropy": 5.805618572235107, "epoch": 3.7606302275821823, "grad_norm": 1.265625, "learning_rate": 0.0003635864311419323, "loss": 4.9308, "mean_token_accuracy": 0.2212614268064499, "num_tokens": 83840477.0, "step": 48335 }, { "entropy": 5.723220157623291, "epoch": 3.7610192569539, "grad_norm": 1.28125, "learning_rate": 0.00036356095342869414, "loss": 4.7901, "mean_token_accuracy": 0.22120074778795243, "num_tokens": 83849158.0, "step": 48340 }, { "entropy": 5.7741968631744385, "epoch": 3.7614082863256177, "grad_norm": 1.2734375, "learning_rate": 0.0003635354743716844, "loss": 4.9175, "mean_token_accuracy": 0.2144678607583046, "num_tokens": 83857400.0, "step": 48345 }, { "entropy": 5.901990365982056, "epoch": 3.761797315697335, "grad_norm": 1.4765625, "learning_rate": 0.0003635099939712898, "loss": 5.1012, "mean_token_accuracy": 0.19687193781137466, "num_tokens": 83866694.0, "step": 48350 }, { "entropy": 5.873877239227295, "epoch": 3.7621863450690527, "grad_norm": 1.25, "learning_rate": 0.00036348451222789694, "loss": 4.9708, "mean_token_accuracy": 0.21617410629987716, "num_tokens": 83875592.0, "step": 48355 }, { "entropy": 5.8364586353302, "epoch": 3.7625753744407704, "grad_norm": 1.3671875, "learning_rate": 0.00036345902914189246, "loss": 4.9679, "mean_token_accuracy": 0.2168629601597786, "num_tokens": 83883582.0, "step": 48360 }, { "entropy": 5.82803316116333, "epoch": 3.7629644038124876, "grad_norm": 1.421875, "learning_rate": 0.000363433544713663, "loss": 5.004, "mean_token_accuracy": 0.21136520355939864, "num_tokens": 83891607.0, "step": 48365 }, { "entropy": 5.795352220535278, "epoch": 3.7633534331842053, "grad_norm": 1.296875, "learning_rate": 0.00036340805894359524, "loss": 4.892, "mean_token_accuracy": 0.2167914777994156, "num_tokens": 83900186.0, "step": 48370 }, { "entropy": 5.8208897590637205, "epoch": 3.763742462555923, "grad_norm": 1.3125, "learning_rate": 0.00036338257183207587, "loss": 4.9641, "mean_token_accuracy": 0.21317292451858522, "num_tokens": 83909271.0, "step": 48375 }, { "entropy": 5.79356017112732, "epoch": 3.7641314919276407, "grad_norm": 1.3828125, "learning_rate": 0.00036335708337949165, "loss": 4.9883, "mean_token_accuracy": 0.21069495677947997, "num_tokens": 83917780.0, "step": 48380 }, { "entropy": 5.825481700897217, "epoch": 3.764520521299358, "grad_norm": 1.28125, "learning_rate": 0.0003633315935862293, "loss": 4.9922, "mean_token_accuracy": 0.21167555898427964, "num_tokens": 83926528.0, "step": 48385 }, { "entropy": 5.8778587818145756, "epoch": 3.7649095506710757, "grad_norm": 1.328125, "learning_rate": 0.0003633061024526757, "loss": 5.0136, "mean_token_accuracy": 0.21000041514635087, "num_tokens": 83935838.0, "step": 48390 }, { "entropy": 5.779851818084717, "epoch": 3.7652985800427934, "grad_norm": 1.3515625, "learning_rate": 0.0003632806099792175, "loss": 4.8901, "mean_token_accuracy": 0.2177865669131279, "num_tokens": 83944716.0, "step": 48395 }, { "entropy": 5.772506618499756, "epoch": 3.7656876094145106, "grad_norm": 1.375, "learning_rate": 0.00036325511616624155, "loss": 4.9266, "mean_token_accuracy": 0.2156564399600029, "num_tokens": 83952615.0, "step": 48400 }, { "entropy": 5.7676185131072994, "epoch": 3.7660766387862283, "grad_norm": 1.5, "learning_rate": 0.0003632296210141348, "loss": 4.8624, "mean_token_accuracy": 0.21846913993358613, "num_tokens": 83960834.0, "step": 48405 }, { "entropy": 5.740039110183716, "epoch": 3.766465668157946, "grad_norm": 1.2734375, "learning_rate": 0.00036320412452328383, "loss": 4.8823, "mean_token_accuracy": 0.21922811418771743, "num_tokens": 83969085.0, "step": 48410 }, { "entropy": 5.760934162139892, "epoch": 3.7668546975296637, "grad_norm": 1.4140625, "learning_rate": 0.0003631786266940757, "loss": 4.8945, "mean_token_accuracy": 0.22029993385076524, "num_tokens": 83978541.0, "step": 48415 }, { "entropy": 5.871448659896851, "epoch": 3.767243726901381, "grad_norm": 1.3046875, "learning_rate": 0.00036315312752689726, "loss": 5.0166, "mean_token_accuracy": 0.20716084837913512, "num_tokens": 83987439.0, "step": 48420 }, { "entropy": 5.825130367279053, "epoch": 3.7676327562730987, "grad_norm": 1.3828125, "learning_rate": 0.0003631276270221354, "loss": 4.9628, "mean_token_accuracy": 0.2123594656586647, "num_tokens": 83995901.0, "step": 48425 }, { "entropy": 5.925189447402954, "epoch": 3.768021785644816, "grad_norm": 1.359375, "learning_rate": 0.00036310212518017717, "loss": 4.9925, "mean_token_accuracy": 0.21028683036565782, "num_tokens": 84004248.0, "step": 48430 }, { "entropy": 5.846250009536743, "epoch": 3.7684108150165336, "grad_norm": 1.390625, "learning_rate": 0.00036307662200140935, "loss": 4.9945, "mean_token_accuracy": 0.20550352483987808, "num_tokens": 84012365.0, "step": 48435 }, { "entropy": 5.834045314788819, "epoch": 3.7687998443882513, "grad_norm": 1.359375, "learning_rate": 0.0003630511174862189, "loss": 5.1294, "mean_token_accuracy": 0.20488521903753282, "num_tokens": 84020286.0, "step": 48440 }, { "entropy": 5.823097133636475, "epoch": 3.769188873759969, "grad_norm": 1.2109375, "learning_rate": 0.0003630256116349931, "loss": 5.0163, "mean_token_accuracy": 0.21173248440027237, "num_tokens": 84029632.0, "step": 48445 }, { "entropy": 5.875268268585205, "epoch": 3.7695779031316863, "grad_norm": 1.4140625, "learning_rate": 0.0003630001044481186, "loss": 4.9626, "mean_token_accuracy": 0.2124560609459877, "num_tokens": 84037953.0, "step": 48450 }, { "entropy": 5.8263468742370605, "epoch": 3.769966932503404, "grad_norm": 1.328125, "learning_rate": 0.00036297459592598256, "loss": 4.9195, "mean_token_accuracy": 0.21769519299268722, "num_tokens": 84046860.0, "step": 48455 }, { "entropy": 5.806731557846069, "epoch": 3.7703559618751217, "grad_norm": 1.3515625, "learning_rate": 0.0003629490860689721, "loss": 4.9727, "mean_token_accuracy": 0.2066218838095665, "num_tokens": 84055306.0, "step": 48460 }, { "entropy": 5.797434568405151, "epoch": 3.770744991246839, "grad_norm": 1.3125, "learning_rate": 0.00036292357487747426, "loss": 4.8931, "mean_token_accuracy": 0.21063714772462844, "num_tokens": 84064407.0, "step": 48465 }, { "entropy": 5.821697235107422, "epoch": 3.7711340206185566, "grad_norm": 1.3125, "learning_rate": 0.00036289806235187606, "loss": 4.9718, "mean_token_accuracy": 0.21471987068653106, "num_tokens": 84072812.0, "step": 48470 }, { "entropy": 5.7669425964355465, "epoch": 3.7715230499902743, "grad_norm": 1.4140625, "learning_rate": 0.0003628725484925647, "loss": 4.9372, "mean_token_accuracy": 0.21202560216188432, "num_tokens": 84081514.0, "step": 48475 }, { "entropy": 5.8390062808990475, "epoch": 3.771912079361992, "grad_norm": 1.359375, "learning_rate": 0.00036284703329992734, "loss": 5.0177, "mean_token_accuracy": 0.2095906600356102, "num_tokens": 84089945.0, "step": 48480 }, { "entropy": 5.883571338653565, "epoch": 3.7723011087337093, "grad_norm": 1.34375, "learning_rate": 0.000362821516774351, "loss": 4.9937, "mean_token_accuracy": 0.20647194534540175, "num_tokens": 84098328.0, "step": 48485 }, { "entropy": 5.8289751529693605, "epoch": 3.772690138105427, "grad_norm": 1.2421875, "learning_rate": 0.00036279599891622297, "loss": 4.9844, "mean_token_accuracy": 0.20670776963233947, "num_tokens": 84106688.0, "step": 48490 }, { "entropy": 5.736328792572022, "epoch": 3.7730791674771447, "grad_norm": 1.2734375, "learning_rate": 0.00036277047972593036, "loss": 4.9294, "mean_token_accuracy": 0.21784191578626633, "num_tokens": 84115568.0, "step": 48495 }, { "entropy": 5.877501106262207, "epoch": 3.773468196848862, "grad_norm": 1.4140625, "learning_rate": 0.0003627449592038604, "loss": 4.9871, "mean_token_accuracy": 0.2130642667412758, "num_tokens": 84123824.0, "step": 48500 }, { "entropy": 5.830891561508179, "epoch": 3.7738572262205796, "grad_norm": 1.4296875, "learning_rate": 0.0003627194373504004, "loss": 4.9137, "mean_token_accuracy": 0.2125416100025177, "num_tokens": 84131927.0, "step": 48505 }, { "entropy": 5.845138502120972, "epoch": 3.7742462555922973, "grad_norm": 1.4140625, "learning_rate": 0.00036269391416593753, "loss": 4.9404, "mean_token_accuracy": 0.21750535517930986, "num_tokens": 84139855.0, "step": 48510 }, { "entropy": 5.773061227798462, "epoch": 3.774635284964015, "grad_norm": 1.3359375, "learning_rate": 0.0003626683896508591, "loss": 4.8662, "mean_token_accuracy": 0.21444876492023468, "num_tokens": 84147705.0, "step": 48515 }, { "entropy": 5.831519031524659, "epoch": 3.7750243143357323, "grad_norm": 1.4921875, "learning_rate": 0.0003626428638055524, "loss": 4.9904, "mean_token_accuracy": 0.20024812519550322, "num_tokens": 84156662.0, "step": 48520 }, { "entropy": 5.806011009216308, "epoch": 3.77541334370745, "grad_norm": 1.3046875, "learning_rate": 0.00036261733663040473, "loss": 4.9788, "mean_token_accuracy": 0.20691410154104234, "num_tokens": 84165828.0, "step": 48525 }, { "entropy": 5.800295829772949, "epoch": 3.775802373079167, "grad_norm": 1.296875, "learning_rate": 0.00036259180812580347, "loss": 4.8999, "mean_token_accuracy": 0.21730743646621703, "num_tokens": 84174680.0, "step": 48530 }, { "entropy": 5.794473123550415, "epoch": 3.776191402450885, "grad_norm": 1.296875, "learning_rate": 0.00036256627829213585, "loss": 4.8736, "mean_token_accuracy": 0.22008173912763596, "num_tokens": 84183530.0, "step": 48535 }, { "entropy": 5.811361169815063, "epoch": 3.7765804318226026, "grad_norm": 1.2578125, "learning_rate": 0.00036254074712978947, "loss": 4.95, "mean_token_accuracy": 0.2191836878657341, "num_tokens": 84191856.0, "step": 48540 }, { "entropy": 5.853907203674316, "epoch": 3.7769694611943203, "grad_norm": 1.3671875, "learning_rate": 0.00036251521463915144, "loss": 4.9942, "mean_token_accuracy": 0.20507093220949174, "num_tokens": 84199789.0, "step": 48545 }, { "entropy": 5.82916226387024, "epoch": 3.777358490566038, "grad_norm": 1.4453125, "learning_rate": 0.0003624896808206093, "loss": 4.9191, "mean_token_accuracy": 0.21761843115091323, "num_tokens": 84207539.0, "step": 48550 }, { "entropy": 5.836031150817871, "epoch": 3.7777475199377553, "grad_norm": 1.25, "learning_rate": 0.0003624641456745507, "loss": 4.9825, "mean_token_accuracy": 0.21326977759599686, "num_tokens": 84216478.0, "step": 48555 }, { "entropy": 5.794806385040284, "epoch": 3.778136549309473, "grad_norm": 1.2265625, "learning_rate": 0.00036243860920136283, "loss": 4.9155, "mean_token_accuracy": 0.21193195581436158, "num_tokens": 84225452.0, "step": 48560 }, { "entropy": 5.826672124862671, "epoch": 3.77852557868119, "grad_norm": 1.265625, "learning_rate": 0.00036241307140143323, "loss": 4.8803, "mean_token_accuracy": 0.2282642036676407, "num_tokens": 84235015.0, "step": 48565 }, { "entropy": 5.781571722030639, "epoch": 3.778914608052908, "grad_norm": 1.2890625, "learning_rate": 0.00036238753227514934, "loss": 4.9611, "mean_token_accuracy": 0.2117591917514801, "num_tokens": 84243694.0, "step": 48570 }, { "entropy": 5.857712507247925, "epoch": 3.7793036374246256, "grad_norm": 1.3203125, "learning_rate": 0.00036236199182289883, "loss": 5.0754, "mean_token_accuracy": 0.2028741329908371, "num_tokens": 84252338.0, "step": 48575 }, { "entropy": 5.793635034561158, "epoch": 3.7796926667963433, "grad_norm": 1.390625, "learning_rate": 0.000362336450045069, "loss": 4.8414, "mean_token_accuracy": 0.22171851992607117, "num_tokens": 84260963.0, "step": 48580 }, { "entropy": 5.890757751464844, "epoch": 3.7800816961680606, "grad_norm": 1.34375, "learning_rate": 0.00036231090694204763, "loss": 5.0667, "mean_token_accuracy": 0.20527772307395936, "num_tokens": 84270012.0, "step": 48585 }, { "entropy": 5.789273738861084, "epoch": 3.7804707255397783, "grad_norm": 1.453125, "learning_rate": 0.00036228536251422226, "loss": 4.9521, "mean_token_accuracy": 0.20600617974996566, "num_tokens": 84278301.0, "step": 48590 }, { "entropy": 5.862462854385376, "epoch": 3.780859754911496, "grad_norm": 1.3671875, "learning_rate": 0.00036225981676198045, "loss": 5.0169, "mean_token_accuracy": 0.20666330307722092, "num_tokens": 84287382.0, "step": 48595 }, { "entropy": 5.847435426712036, "epoch": 3.781248784283213, "grad_norm": 1.3359375, "learning_rate": 0.0003622342696857098, "loss": 4.9668, "mean_token_accuracy": 0.21007767021656037, "num_tokens": 84296358.0, "step": 48600 }, { "entropy": 5.848305511474609, "epoch": 3.781637813654931, "grad_norm": 1.4765625, "learning_rate": 0.0003622087212857979, "loss": 4.9524, "mean_token_accuracy": 0.22253683358430862, "num_tokens": 84304638.0, "step": 48605 }, { "entropy": 5.772209024429321, "epoch": 3.7820268430266486, "grad_norm": 1.2734375, "learning_rate": 0.0003621831715626325, "loss": 4.9186, "mean_token_accuracy": 0.21041425168514252, "num_tokens": 84313884.0, "step": 48610 }, { "entropy": 5.899036407470703, "epoch": 3.7824158723983663, "grad_norm": 1.3671875, "learning_rate": 0.00036215762051660115, "loss": 4.9959, "mean_token_accuracy": 0.20718845427036287, "num_tokens": 84322937.0, "step": 48615 }, { "entropy": 5.8359044075012205, "epoch": 3.7828049017700835, "grad_norm": 1.328125, "learning_rate": 0.00036213206814809175, "loss": 4.9614, "mean_token_accuracy": 0.21275405138731002, "num_tokens": 84331603.0, "step": 48620 }, { "entropy": 5.8694957256317135, "epoch": 3.7831939311418012, "grad_norm": 1.34375, "learning_rate": 0.0003621065144574919, "loss": 5.023, "mean_token_accuracy": 0.2151937574148178, "num_tokens": 84339948.0, "step": 48625 }, { "entropy": 5.853318548202514, "epoch": 3.7835829605135185, "grad_norm": 1.328125, "learning_rate": 0.0003620809594451893, "loss": 4.962, "mean_token_accuracy": 0.20590658485889435, "num_tokens": 84348489.0, "step": 48630 }, { "entropy": 5.850880098342896, "epoch": 3.783971989885236, "grad_norm": 1.375, "learning_rate": 0.0003620554031115718, "loss": 4.9474, "mean_token_accuracy": 0.2095250517129898, "num_tokens": 84357267.0, "step": 48635 }, { "entropy": 5.835837459564209, "epoch": 3.784361019256954, "grad_norm": 1.3046875, "learning_rate": 0.0003620298454570271, "loss": 4.9752, "mean_token_accuracy": 0.20703328996896744, "num_tokens": 84366189.0, "step": 48640 }, { "entropy": 5.874964904785156, "epoch": 3.7847500486286716, "grad_norm": 1.359375, "learning_rate": 0.0003620042864819429, "loss": 5.0078, "mean_token_accuracy": 0.20731819570064544, "num_tokens": 84375327.0, "step": 48645 }, { "entropy": 5.849944305419922, "epoch": 3.7851390780003893, "grad_norm": 1.296875, "learning_rate": 0.0003619787261867072, "loss": 4.9295, "mean_token_accuracy": 0.20880162566900254, "num_tokens": 84384152.0, "step": 48650 }, { "entropy": 5.854048776626587, "epoch": 3.7855281073721065, "grad_norm": 1.34375, "learning_rate": 0.0003619531645717078, "loss": 5.0256, "mean_token_accuracy": 0.2010303795337677, "num_tokens": 84392700.0, "step": 48655 }, { "entropy": 5.8048155307769775, "epoch": 3.7859171367438242, "grad_norm": 1.34375, "learning_rate": 0.0003619276016373325, "loss": 5.0098, "mean_token_accuracy": 0.20672389268875122, "num_tokens": 84401310.0, "step": 48660 }, { "entropy": 5.780894184112549, "epoch": 3.7863061661155415, "grad_norm": 1.2890625, "learning_rate": 0.0003619020373839693, "loss": 4.9679, "mean_token_accuracy": 0.20631978213787078, "num_tokens": 84410028.0, "step": 48665 }, { "entropy": 5.9214768409729, "epoch": 3.786695195487259, "grad_norm": 1.28125, "learning_rate": 0.0003618764718120059, "loss": 5.0124, "mean_token_accuracy": 0.21580541133880615, "num_tokens": 84419015.0, "step": 48670 }, { "entropy": 5.910969066619873, "epoch": 3.787084224858977, "grad_norm": 1.25, "learning_rate": 0.0003618509049218304, "loss": 5.0651, "mean_token_accuracy": 0.21167200654745102, "num_tokens": 84427148.0, "step": 48675 }, { "entropy": 5.869602155685425, "epoch": 3.7874732542306946, "grad_norm": 1.359375, "learning_rate": 0.00036182533671383056, "loss": 4.9842, "mean_token_accuracy": 0.2114063784480095, "num_tokens": 84436058.0, "step": 48680 }, { "entropy": 5.870849466323852, "epoch": 3.787862283602412, "grad_norm": 1.3828125, "learning_rate": 0.0003617997671883944, "loss": 4.9654, "mean_token_accuracy": 0.209538996219635, "num_tokens": 84444494.0, "step": 48685 }, { "entropy": 5.908856010437011, "epoch": 3.7882513129741295, "grad_norm": 1.34375, "learning_rate": 0.00036177419634591, "loss": 5.0215, "mean_token_accuracy": 0.2145876795053482, "num_tokens": 84453558.0, "step": 48690 }, { "entropy": 5.833027124404907, "epoch": 3.7886403423458472, "grad_norm": 1.3203125, "learning_rate": 0.0003617486241867654, "loss": 4.9869, "mean_token_accuracy": 0.2108340248465538, "num_tokens": 84462636.0, "step": 48695 }, { "entropy": 5.871826171875, "epoch": 3.7890293717175645, "grad_norm": 1.375, "learning_rate": 0.0003617230507113483, "loss": 4.9901, "mean_token_accuracy": 0.20720430612564086, "num_tokens": 84471559.0, "step": 48700 }, { "entropy": 5.85174674987793, "epoch": 3.789418401089282, "grad_norm": 1.3203125, "learning_rate": 0.00036169747592004704, "loss": 4.9619, "mean_token_accuracy": 0.21520561277866362, "num_tokens": 84479976.0, "step": 48705 }, { "entropy": 5.842283535003662, "epoch": 3.789807430461, "grad_norm": 1.3359375, "learning_rate": 0.00036167189981324956, "loss": 4.9735, "mean_token_accuracy": 0.21144671440124513, "num_tokens": 84488890.0, "step": 48710 }, { "entropy": 5.799002933502197, "epoch": 3.7901964598327176, "grad_norm": 1.46875, "learning_rate": 0.000361646322391344, "loss": 4.9205, "mean_token_accuracy": 0.21397174745798112, "num_tokens": 84496816.0, "step": 48715 }, { "entropy": 5.779604768753051, "epoch": 3.790585489204435, "grad_norm": 1.359375, "learning_rate": 0.0003616207436547183, "loss": 4.9507, "mean_token_accuracy": 0.20795523077249528, "num_tokens": 84505078.0, "step": 48720 }, { "entropy": 5.7595446586608885, "epoch": 3.7909745185761525, "grad_norm": 1.3984375, "learning_rate": 0.00036159516360376084, "loss": 4.9872, "mean_token_accuracy": 0.2111603155732155, "num_tokens": 84513448.0, "step": 48725 }, { "entropy": 5.791185522079468, "epoch": 3.7913635479478702, "grad_norm": 1.3046875, "learning_rate": 0.00036156958223885945, "loss": 4.9576, "mean_token_accuracy": 0.21237398386001588, "num_tokens": 84522267.0, "step": 48730 }, { "entropy": 5.83224663734436, "epoch": 3.7917525773195875, "grad_norm": 1.359375, "learning_rate": 0.0003615439995604025, "loss": 4.9287, "mean_token_accuracy": 0.2129225179553032, "num_tokens": 84530757.0, "step": 48735 }, { "entropy": 5.823274564743042, "epoch": 3.792141606691305, "grad_norm": 1.3203125, "learning_rate": 0.0003615184155687781, "loss": 5.0519, "mean_token_accuracy": 0.20139263570308685, "num_tokens": 84539332.0, "step": 48740 }, { "entropy": 5.822123432159424, "epoch": 3.792530636063023, "grad_norm": 1.34375, "learning_rate": 0.00036149283026437444, "loss": 4.8864, "mean_token_accuracy": 0.2194872885942459, "num_tokens": 84547983.0, "step": 48745 }, { "entropy": 5.8502130031585695, "epoch": 3.7929196654347406, "grad_norm": 1.3515625, "learning_rate": 0.00036146724364757984, "loss": 4.9589, "mean_token_accuracy": 0.21135388314723969, "num_tokens": 84556037.0, "step": 48750 }, { "entropy": 5.792223930358887, "epoch": 3.793308694806458, "grad_norm": 1.359375, "learning_rate": 0.00036144165571878233, "loss": 4.9658, "mean_token_accuracy": 0.21213280707597731, "num_tokens": 84564819.0, "step": 48755 }, { "entropy": 5.829569482803345, "epoch": 3.7936977241781755, "grad_norm": 1.2734375, "learning_rate": 0.0003614160664783703, "loss": 4.9702, "mean_token_accuracy": 0.20574671179056167, "num_tokens": 84573768.0, "step": 48760 }, { "entropy": 5.8744720935821535, "epoch": 3.7940867535498928, "grad_norm": 1.3046875, "learning_rate": 0.000361390475926732, "loss": 5.0394, "mean_token_accuracy": 0.20789277851581572, "num_tokens": 84582710.0, "step": 48765 }, { "entropy": 5.911956739425659, "epoch": 3.7944757829216105, "grad_norm": 1.3359375, "learning_rate": 0.0003613648840642558, "loss": 5.0395, "mean_token_accuracy": 0.20781103074550628, "num_tokens": 84592285.0, "step": 48770 }, { "entropy": 5.9221021175384525, "epoch": 3.794864812293328, "grad_norm": 1.421875, "learning_rate": 0.0003613392908913299, "loss": 5.0601, "mean_token_accuracy": 0.20861401110887529, "num_tokens": 84600885.0, "step": 48775 }, { "entropy": 5.883755731582641, "epoch": 3.795253841665046, "grad_norm": 1.390625, "learning_rate": 0.0003613136964083427, "loss": 4.9751, "mean_token_accuracy": 0.21648920327425003, "num_tokens": 84609775.0, "step": 48780 }, { "entropy": 5.877562570571899, "epoch": 3.795642871036763, "grad_norm": 1.3828125, "learning_rate": 0.0003612881006156826, "loss": 5.0133, "mean_token_accuracy": 0.20732762068510055, "num_tokens": 84618636.0, "step": 48785 }, { "entropy": 5.850293970108032, "epoch": 3.796031900408481, "grad_norm": 1.5, "learning_rate": 0.00036126250351373786, "loss": 4.9307, "mean_token_accuracy": 0.21516039222478867, "num_tokens": 84626950.0, "step": 48790 }, { "entropy": 5.774712181091308, "epoch": 3.7964209297801985, "grad_norm": 1.265625, "learning_rate": 0.00036123690510289684, "loss": 4.8975, "mean_token_accuracy": 0.22077593058347703, "num_tokens": 84635551.0, "step": 48795 }, { "entropy": 5.792155408859253, "epoch": 3.7968099591519158, "grad_norm": 1.4140625, "learning_rate": 0.0003612113053835482, "loss": 4.8793, "mean_token_accuracy": 0.20960229486227036, "num_tokens": 84643626.0, "step": 48800 }, { "entropy": 5.874011707305908, "epoch": 3.7971989885236335, "grad_norm": 1.3828125, "learning_rate": 0.0003611857043560801, "loss": 4.9859, "mean_token_accuracy": 0.21501094549894334, "num_tokens": 84651891.0, "step": 48805 }, { "entropy": 5.810036563873291, "epoch": 3.797588017895351, "grad_norm": 1.2734375, "learning_rate": 0.0003611601020208812, "loss": 4.9484, "mean_token_accuracy": 0.21245778650045394, "num_tokens": 84660501.0, "step": 48810 }, { "entropy": 5.746427822113037, "epoch": 3.797977047267069, "grad_norm": 1.21875, "learning_rate": 0.0003611344983783398, "loss": 4.8398, "mean_token_accuracy": 0.2225646361708641, "num_tokens": 84669134.0, "step": 48815 }, { "entropy": 5.803394508361817, "epoch": 3.798366076638786, "grad_norm": 1.515625, "learning_rate": 0.0003611088934288445, "loss": 4.9549, "mean_token_accuracy": 0.20939016342163086, "num_tokens": 84677241.0, "step": 48820 }, { "entropy": 5.808235502243042, "epoch": 3.798755106010504, "grad_norm": 1.3984375, "learning_rate": 0.00036108328717278387, "loss": 4.9273, "mean_token_accuracy": 0.21756461560726165, "num_tokens": 84686244.0, "step": 48825 }, { "entropy": 5.727559757232666, "epoch": 3.7991441353822215, "grad_norm": 1.453125, "learning_rate": 0.00036105767961054636, "loss": 4.8527, "mean_token_accuracy": 0.21468983888626098, "num_tokens": 84694570.0, "step": 48830 }, { "entropy": 5.779499912261963, "epoch": 3.7995331647539388, "grad_norm": 1.3671875, "learning_rate": 0.0003610320707425205, "loss": 4.9252, "mean_token_accuracy": 0.2171340510249138, "num_tokens": 84703322.0, "step": 48835 }, { "entropy": 5.896618223190307, "epoch": 3.7999221941256565, "grad_norm": 1.2890625, "learning_rate": 0.000361006460569095, "loss": 4.969, "mean_token_accuracy": 0.21632780283689498, "num_tokens": 84711960.0, "step": 48840 }, { "entropy": 5.835455751419067, "epoch": 3.800311223497374, "grad_norm": 1.3984375, "learning_rate": 0.00036098084909065814, "loss": 4.9328, "mean_token_accuracy": 0.2144725054502487, "num_tokens": 84720956.0, "step": 48845 }, { "entropy": 5.813449048995972, "epoch": 3.800700252869092, "grad_norm": 1.28125, "learning_rate": 0.0003609552363075989, "loss": 4.9839, "mean_token_accuracy": 0.21158041805028915, "num_tokens": 84729829.0, "step": 48850 }, { "entropy": 5.803310871124268, "epoch": 3.801089282240809, "grad_norm": 1.390625, "learning_rate": 0.00036092962222030573, "loss": 4.9683, "mean_token_accuracy": 0.21511098891496658, "num_tokens": 84738314.0, "step": 48855 }, { "entropy": 5.819625806808472, "epoch": 3.801478311612527, "grad_norm": 1.3359375, "learning_rate": 0.0003609040068291673, "loss": 4.8519, "mean_token_accuracy": 0.21624375134706497, "num_tokens": 84746868.0, "step": 48860 }, { "entropy": 5.841644620895385, "epoch": 3.801867340984244, "grad_norm": 1.3125, "learning_rate": 0.0003608783901345724, "loss": 4.9333, "mean_token_accuracy": 0.21290566623210908, "num_tokens": 84755679.0, "step": 48865 }, { "entropy": 5.842495250701904, "epoch": 3.8022563703559618, "grad_norm": 1.265625, "learning_rate": 0.00036085277213690947, "loss": 5.015, "mean_token_accuracy": 0.21089762300252915, "num_tokens": 84764653.0, "step": 48870 }, { "entropy": 5.767722654342651, "epoch": 3.8026453997276795, "grad_norm": 1.375, "learning_rate": 0.0003608271528365675, "loss": 4.8441, "mean_token_accuracy": 0.2155345693230629, "num_tokens": 84773090.0, "step": 48875 }, { "entropy": 5.806365013122559, "epoch": 3.803034429099397, "grad_norm": 1.40625, "learning_rate": 0.000360801532233935, "loss": 4.9465, "mean_token_accuracy": 0.21938023269176482, "num_tokens": 84783203.0, "step": 48880 }, { "entropy": 5.8141663551330565, "epoch": 3.8034234584711144, "grad_norm": 1.3125, "learning_rate": 0.0003607759103294008, "loss": 4.939, "mean_token_accuracy": 0.2217843621969223, "num_tokens": 84791800.0, "step": 48885 }, { "entropy": 5.8646800994873045, "epoch": 3.803812487842832, "grad_norm": 1.4140625, "learning_rate": 0.0003607502871233538, "loss": 4.9553, "mean_token_accuracy": 0.21114450991153716, "num_tokens": 84800791.0, "step": 48890 }, { "entropy": 5.841810178756714, "epoch": 3.80420151721455, "grad_norm": 1.421875, "learning_rate": 0.0003607246626161826, "loss": 4.9325, "mean_token_accuracy": 0.21599150002002715, "num_tokens": 84808879.0, "step": 48895 }, { "entropy": 5.8505676746368405, "epoch": 3.804590546586267, "grad_norm": 1.2890625, "learning_rate": 0.000360699036808276, "loss": 4.9771, "mean_token_accuracy": 0.2027676895260811, "num_tokens": 84817388.0, "step": 48900 }, { "entropy": 5.907699871063232, "epoch": 3.8049795759579847, "grad_norm": 1.265625, "learning_rate": 0.0003606734097000231, "loss": 5.0018, "mean_token_accuracy": 0.21445808857679366, "num_tokens": 84826044.0, "step": 48905 }, { "entropy": 5.838197898864746, "epoch": 3.8053686053297024, "grad_norm": 1.34375, "learning_rate": 0.0003606477812918125, "loss": 4.9288, "mean_token_accuracy": 0.21153876930475235, "num_tokens": 84834293.0, "step": 48910 }, { "entropy": 5.784072160720825, "epoch": 3.80575763470142, "grad_norm": 1.640625, "learning_rate": 0.0003606221515840331, "loss": 4.9859, "mean_token_accuracy": 0.21273598074913025, "num_tokens": 84842441.0, "step": 48915 }, { "entropy": 5.870151329040527, "epoch": 3.8061466640731374, "grad_norm": 1.2890625, "learning_rate": 0.00036059652057707394, "loss": 4.976, "mean_token_accuracy": 0.21800754368305206, "num_tokens": 84851284.0, "step": 48920 }, { "entropy": 5.876770496368408, "epoch": 3.806535693444855, "grad_norm": 1.34375, "learning_rate": 0.0003605708882713237, "loss": 4.9386, "mean_token_accuracy": 0.21358221620321274, "num_tokens": 84859491.0, "step": 48925 }, { "entropy": 5.754761362075806, "epoch": 3.806924722816573, "grad_norm": 1.296875, "learning_rate": 0.00036054525466717145, "loss": 4.9299, "mean_token_accuracy": 0.21173783540725707, "num_tokens": 84868087.0, "step": 48930 }, { "entropy": 5.712821769714355, "epoch": 3.80731375218829, "grad_norm": 1.3046875, "learning_rate": 0.0003605196197650062, "loss": 4.8316, "mean_token_accuracy": 0.22236887216567994, "num_tokens": 84876449.0, "step": 48935 }, { "entropy": 5.900254392623902, "epoch": 3.8077027815600077, "grad_norm": 1.3828125, "learning_rate": 0.0003604939835652167, "loss": 4.9838, "mean_token_accuracy": 0.20556507557630538, "num_tokens": 84884643.0, "step": 48940 }, { "entropy": 5.747515487670898, "epoch": 3.8080918109317254, "grad_norm": 1.390625, "learning_rate": 0.00036046834606819224, "loss": 4.8442, "mean_token_accuracy": 0.2212585911154747, "num_tokens": 84892865.0, "step": 48945 }, { "entropy": 5.881759214401245, "epoch": 3.808480840303443, "grad_norm": 1.3671875, "learning_rate": 0.0003604427072743216, "loss": 5.0627, "mean_token_accuracy": 0.209686079621315, "num_tokens": 84901810.0, "step": 48950 }, { "entropy": 5.8210920810699465, "epoch": 3.8088698696751604, "grad_norm": 1.3828125, "learning_rate": 0.00036041706718399386, "loss": 4.8774, "mean_token_accuracy": 0.22214832454919814, "num_tokens": 84909914.0, "step": 48955 }, { "entropy": 5.835501480102539, "epoch": 3.809258899046878, "grad_norm": 1.28125, "learning_rate": 0.000360391425797598, "loss": 4.9214, "mean_token_accuracy": 0.22583719938993455, "num_tokens": 84919417.0, "step": 48960 }, { "entropy": 5.774426889419556, "epoch": 3.8096479284185953, "grad_norm": 1.40625, "learning_rate": 0.0003603657831155233, "loss": 4.82, "mean_token_accuracy": 0.22366142719984056, "num_tokens": 84927987.0, "step": 48965 }, { "entropy": 5.772368240356445, "epoch": 3.810036957790313, "grad_norm": 1.28125, "learning_rate": 0.0003603401391381587, "loss": 4.8971, "mean_token_accuracy": 0.2263113334774971, "num_tokens": 84937220.0, "step": 48970 }, { "entropy": 5.837231636047363, "epoch": 3.8104259871620307, "grad_norm": 1.6015625, "learning_rate": 0.00036031449386589326, "loss": 4.9344, "mean_token_accuracy": 0.21509986668825148, "num_tokens": 84945886.0, "step": 48975 }, { "entropy": 5.876586389541626, "epoch": 3.8108150165337484, "grad_norm": 1.390625, "learning_rate": 0.0003602888472991162, "loss": 5.0588, "mean_token_accuracy": 0.2041503444314003, "num_tokens": 84954834.0, "step": 48980 }, { "entropy": 5.802380037307739, "epoch": 3.811204045905466, "grad_norm": 1.2421875, "learning_rate": 0.00036026319943821664, "loss": 4.8967, "mean_token_accuracy": 0.2128758653998375, "num_tokens": 84963321.0, "step": 48985 }, { "entropy": 5.888273668289185, "epoch": 3.8115930752771834, "grad_norm": 1.4609375, "learning_rate": 0.0003602375502835837, "loss": 4.9962, "mean_token_accuracy": 0.2080211877822876, "num_tokens": 84971350.0, "step": 48990 }, { "entropy": 5.786940431594848, "epoch": 3.811982104648901, "grad_norm": 1.4609375, "learning_rate": 0.00036021189983560667, "loss": 4.9599, "mean_token_accuracy": 0.21136770099401475, "num_tokens": 84979753.0, "step": 48995 }, { "entropy": 5.791334009170532, "epoch": 3.8123711340206183, "grad_norm": 1.3203125, "learning_rate": 0.00036018624809467466, "loss": 4.9026, "mean_token_accuracy": 0.20939179956912995, "num_tokens": 84988568.0, "step": 49000 }, { "entropy": 5.840465354919433, "epoch": 3.812760163392336, "grad_norm": 1.4609375, "learning_rate": 0.00036016059506117687, "loss": 5.0095, "mean_token_accuracy": 0.21386846154928207, "num_tokens": 84996778.0, "step": 49005 }, { "entropy": 5.862120580673218, "epoch": 3.8131491927640537, "grad_norm": 1.5078125, "learning_rate": 0.0003601349407355027, "loss": 5.0296, "mean_token_accuracy": 0.2073841243982315, "num_tokens": 85006043.0, "step": 49010 }, { "entropy": 5.919520711898803, "epoch": 3.8135382221357714, "grad_norm": 1.40625, "learning_rate": 0.0003601092851180412, "loss": 4.9512, "mean_token_accuracy": 0.2122909277677536, "num_tokens": 85013893.0, "step": 49015 }, { "entropy": 5.817442989349365, "epoch": 3.8139272515074887, "grad_norm": 1.4453125, "learning_rate": 0.00036008362820918186, "loss": 4.9516, "mean_token_accuracy": 0.21655259728431703, "num_tokens": 85022091.0, "step": 49020 }, { "entropy": 5.8478844165802, "epoch": 3.8143162808792064, "grad_norm": 1.265625, "learning_rate": 0.0003600579700093138, "loss": 4.9183, "mean_token_accuracy": 0.20790481865406035, "num_tokens": 85030896.0, "step": 49025 }, { "entropy": 5.83958740234375, "epoch": 3.814705310250924, "grad_norm": 1.28125, "learning_rate": 0.00036003231051882646, "loss": 4.8665, "mean_token_accuracy": 0.2212885871529579, "num_tokens": 85039862.0, "step": 49030 }, { "entropy": 5.8776469230651855, "epoch": 3.8150943396226413, "grad_norm": 1.3828125, "learning_rate": 0.00036000664973810914, "loss": 4.997, "mean_token_accuracy": 0.2119227886199951, "num_tokens": 85048509.0, "step": 49035 }, { "entropy": 5.891389942169189, "epoch": 3.815483368994359, "grad_norm": 1.4375, "learning_rate": 0.0003599809876675513, "loss": 4.9492, "mean_token_accuracy": 0.2092523992061615, "num_tokens": 85056678.0, "step": 49040 }, { "entropy": 5.853326606750488, "epoch": 3.8158723983660767, "grad_norm": 1.2734375, "learning_rate": 0.00035995532430754205, "loss": 4.9383, "mean_token_accuracy": 0.21691081821918487, "num_tokens": 85066123.0, "step": 49045 }, { "entropy": 5.853999423980713, "epoch": 3.8162614277377944, "grad_norm": 1.2890625, "learning_rate": 0.0003599296596584711, "loss": 5.0695, "mean_token_accuracy": 0.20025967061519623, "num_tokens": 85075391.0, "step": 49050 }, { "entropy": 5.836101484298706, "epoch": 3.8166504571095117, "grad_norm": 1.4375, "learning_rate": 0.0003599039937207278, "loss": 4.9673, "mean_token_accuracy": 0.21228709816932678, "num_tokens": 85083831.0, "step": 49055 }, { "entropy": 5.837673091888428, "epoch": 3.8170394864812294, "grad_norm": 1.3203125, "learning_rate": 0.0003598783264947015, "loss": 4.9448, "mean_token_accuracy": 0.2147866517305374, "num_tokens": 85093086.0, "step": 49060 }, { "entropy": 5.827676248550415, "epoch": 3.8174285158529466, "grad_norm": 1.265625, "learning_rate": 0.00035985265798078165, "loss": 4.9414, "mean_token_accuracy": 0.21358412653207778, "num_tokens": 85101635.0, "step": 49065 }, { "entropy": 5.818188285827636, "epoch": 3.8178175452246643, "grad_norm": 1.390625, "learning_rate": 0.00035982698817935783, "loss": 4.9162, "mean_token_accuracy": 0.22016266286373137, "num_tokens": 85110208.0, "step": 49070 }, { "entropy": 5.860749673843384, "epoch": 3.818206574596382, "grad_norm": 1.3125, "learning_rate": 0.0003598013170908194, "loss": 5.0122, "mean_token_accuracy": 0.20144019424915313, "num_tokens": 85118667.0, "step": 49075 }, { "entropy": 5.800343227386475, "epoch": 3.8185956039680997, "grad_norm": 1.3203125, "learning_rate": 0.0003597756447155559, "loss": 4.8877, "mean_token_accuracy": 0.21839531362056733, "num_tokens": 85127457.0, "step": 49080 }, { "entropy": 5.817784309387207, "epoch": 3.8189846333398174, "grad_norm": 1.2578125, "learning_rate": 0.00035974997105395705, "loss": 4.9062, "mean_token_accuracy": 0.21559182554483414, "num_tokens": 85136216.0, "step": 49085 }, { "entropy": 5.842554521560669, "epoch": 3.8193736627115347, "grad_norm": 1.2421875, "learning_rate": 0.00035972429610641224, "loss": 4.9495, "mean_token_accuracy": 0.21449165493249894, "num_tokens": 85145168.0, "step": 49090 }, { "entropy": 5.853761959075928, "epoch": 3.8197626920832524, "grad_norm": 1.4375, "learning_rate": 0.00035969861987331114, "loss": 4.9381, "mean_token_accuracy": 0.21083917915821077, "num_tokens": 85153859.0, "step": 49095 }, { "entropy": 5.753165769577026, "epoch": 3.8201517214549696, "grad_norm": 1.4453125, "learning_rate": 0.0003596729423550433, "loss": 4.8967, "mean_token_accuracy": 0.2162601724267006, "num_tokens": 85162460.0, "step": 49100 }, { "entropy": 5.717614603042603, "epoch": 3.8205407508266873, "grad_norm": 1.421875, "learning_rate": 0.0003596472635519983, "loss": 4.8014, "mean_token_accuracy": 0.2199389949440956, "num_tokens": 85170602.0, "step": 49105 }, { "entropy": 5.798894214630127, "epoch": 3.820929780198405, "grad_norm": 1.25, "learning_rate": 0.0003596215834645657, "loss": 4.9295, "mean_token_accuracy": 0.21284208297729493, "num_tokens": 85179127.0, "step": 49110 }, { "entropy": 5.784889221191406, "epoch": 3.8213188095701227, "grad_norm": 1.3359375, "learning_rate": 0.00035959590209313537, "loss": 4.8573, "mean_token_accuracy": 0.22739548981189728, "num_tokens": 85187486.0, "step": 49115 }, { "entropy": 5.848506164550781, "epoch": 3.82170783894184, "grad_norm": 1.296875, "learning_rate": 0.0003595702194380968, "loss": 5.0541, "mean_token_accuracy": 0.20802140980958939, "num_tokens": 85196272.0, "step": 49120 }, { "entropy": 5.881946134567261, "epoch": 3.8220968683135577, "grad_norm": 1.4921875, "learning_rate": 0.00035954453549983984, "loss": 5.0357, "mean_token_accuracy": 0.20911688953638077, "num_tokens": 85204459.0, "step": 49125 }, { "entropy": 5.916932773590088, "epoch": 3.8224858976852754, "grad_norm": 1.328125, "learning_rate": 0.00035951885027875406, "loss": 4.9621, "mean_token_accuracy": 0.22024523913860322, "num_tokens": 85212985.0, "step": 49130 }, { "entropy": 5.815216112136841, "epoch": 3.8228749270569926, "grad_norm": 1.2421875, "learning_rate": 0.00035949316377522934, "loss": 4.9567, "mean_token_accuracy": 0.217891925573349, "num_tokens": 85222295.0, "step": 49135 }, { "entropy": 5.847072505950928, "epoch": 3.8232639564287103, "grad_norm": 1.3671875, "learning_rate": 0.0003594674759896553, "loss": 5.0153, "mean_token_accuracy": 0.20961818397045134, "num_tokens": 85231072.0, "step": 49140 }, { "entropy": 5.853895235061645, "epoch": 3.823652985800428, "grad_norm": 1.4296875, "learning_rate": 0.0003594417869224217, "loss": 4.9486, "mean_token_accuracy": 0.20720356106758117, "num_tokens": 85239568.0, "step": 49145 }, { "entropy": 5.936257696151733, "epoch": 3.8240420151721457, "grad_norm": 1.3203125, "learning_rate": 0.00035941609657391845, "loss": 5.0988, "mean_token_accuracy": 0.19757563322782518, "num_tokens": 85248029.0, "step": 49150 }, { "entropy": 5.853573322296143, "epoch": 3.824431044543863, "grad_norm": 1.28125, "learning_rate": 0.0003593904049445353, "loss": 4.9934, "mean_token_accuracy": 0.20667776614427566, "num_tokens": 85256385.0, "step": 49155 }, { "entropy": 5.78083381652832, "epoch": 3.8248200739155807, "grad_norm": 1.3984375, "learning_rate": 0.00035936471203466206, "loss": 4.8947, "mean_token_accuracy": 0.2153155103325844, "num_tokens": 85264727.0, "step": 49160 }, { "entropy": 5.8222626686096195, "epoch": 3.8252091032872984, "grad_norm": 1.3515625, "learning_rate": 0.0003593390178446886, "loss": 4.9753, "mean_token_accuracy": 0.20932394862174988, "num_tokens": 85272906.0, "step": 49165 }, { "entropy": 5.832112121582031, "epoch": 3.8255981326590156, "grad_norm": 1.28125, "learning_rate": 0.0003593133223750047, "loss": 4.9676, "mean_token_accuracy": 0.21281614899635315, "num_tokens": 85281923.0, "step": 49170 }, { "entropy": 5.790166139602661, "epoch": 3.8259871620307333, "grad_norm": 1.3515625, "learning_rate": 0.0003592876256260004, "loss": 5.0243, "mean_token_accuracy": 0.20927174538373947, "num_tokens": 85290246.0, "step": 49175 }, { "entropy": 5.850388908386231, "epoch": 3.826376191402451, "grad_norm": 1.28125, "learning_rate": 0.0003592619275980656, "loss": 5.0491, "mean_token_accuracy": 0.2081973597407341, "num_tokens": 85298901.0, "step": 49180 }, { "entropy": 5.809437894821167, "epoch": 3.8267652207741687, "grad_norm": 1.3671875, "learning_rate": 0.00035923622829159014, "loss": 4.924, "mean_token_accuracy": 0.21125389635562897, "num_tokens": 85307477.0, "step": 49185 }, { "entropy": 5.78082242012024, "epoch": 3.827154250145886, "grad_norm": 1.3359375, "learning_rate": 0.0003592105277069639, "loss": 4.8819, "mean_token_accuracy": 0.22233271598815918, "num_tokens": 85316400.0, "step": 49190 }, { "entropy": 5.829493999481201, "epoch": 3.8275432795176036, "grad_norm": 1.421875, "learning_rate": 0.000359184825844577, "loss": 4.9145, "mean_token_accuracy": 0.2128453552722931, "num_tokens": 85324651.0, "step": 49195 }, { "entropy": 5.745706605911255, "epoch": 3.827932308889321, "grad_norm": 1.359375, "learning_rate": 0.00035915912270481935, "loss": 4.8608, "mean_token_accuracy": 0.21970924735069275, "num_tokens": 85333361.0, "step": 49200 }, { "entropy": 5.768571853637695, "epoch": 3.8283213382610386, "grad_norm": 1.3046875, "learning_rate": 0.000359133418288081, "loss": 4.8782, "mean_token_accuracy": 0.21183487325906752, "num_tokens": 85341928.0, "step": 49205 }, { "entropy": 5.8108744621276855, "epoch": 3.8287103676327563, "grad_norm": 1.3828125, "learning_rate": 0.00035910771259475187, "loss": 4.9246, "mean_token_accuracy": 0.21959973722696305, "num_tokens": 85350261.0, "step": 49210 }, { "entropy": 5.844123125076294, "epoch": 3.829099397004474, "grad_norm": 1.296875, "learning_rate": 0.0003590820056252222, "loss": 4.9383, "mean_token_accuracy": 0.21411115378141404, "num_tokens": 85358778.0, "step": 49215 }, { "entropy": 5.799669933319092, "epoch": 3.8294884263761912, "grad_norm": 1.3671875, "learning_rate": 0.0003590562973798818, "loss": 4.9441, "mean_token_accuracy": 0.21377661675214768, "num_tokens": 85367935.0, "step": 49220 }, { "entropy": 5.8212902545928955, "epoch": 3.829877455747909, "grad_norm": 1.3828125, "learning_rate": 0.0003590305878591209, "loss": 4.9217, "mean_token_accuracy": 0.21365402042865753, "num_tokens": 85376961.0, "step": 49225 }, { "entropy": 5.90946946144104, "epoch": 3.8302664851196266, "grad_norm": 1.2421875, "learning_rate": 0.00035900487706332963, "loss": 4.9926, "mean_token_accuracy": 0.20869186520576477, "num_tokens": 85386106.0, "step": 49230 }, { "entropy": 5.8505762100219725, "epoch": 3.830655514491344, "grad_norm": 1.3828125, "learning_rate": 0.000358979164992898, "loss": 5.0068, "mean_token_accuracy": 0.21031726151704788, "num_tokens": 85396315.0, "step": 49235 }, { "entropy": 5.78671441078186, "epoch": 3.8310445438630616, "grad_norm": 1.3359375, "learning_rate": 0.00035895345164821624, "loss": 4.9276, "mean_token_accuracy": 0.21571587324142455, "num_tokens": 85405210.0, "step": 49240 }, { "entropy": 5.762450265884399, "epoch": 3.8314335732347793, "grad_norm": 1.3046875, "learning_rate": 0.0003589277370296745, "loss": 4.9841, "mean_token_accuracy": 0.2093357890844345, "num_tokens": 85413661.0, "step": 49245 }, { "entropy": 5.79524245262146, "epoch": 3.831822602606497, "grad_norm": 1.234375, "learning_rate": 0.00035890202113766283, "loss": 4.9449, "mean_token_accuracy": 0.21650041788816451, "num_tokens": 85423043.0, "step": 49250 }, { "entropy": 5.9207408905029295, "epoch": 3.8322116319782142, "grad_norm": 1.375, "learning_rate": 0.00035887630397257167, "loss": 4.985, "mean_token_accuracy": 0.20888074040412902, "num_tokens": 85431918.0, "step": 49255 }, { "entropy": 5.811710691452026, "epoch": 3.832600661349932, "grad_norm": 1.4140625, "learning_rate": 0.000358850585534791, "loss": 4.8662, "mean_token_accuracy": 0.21720490008592605, "num_tokens": 85441108.0, "step": 49260 }, { "entropy": 5.811617469787597, "epoch": 3.8329896907216496, "grad_norm": 1.390625, "learning_rate": 0.00035882486582471124, "loss": 4.9593, "mean_token_accuracy": 0.21214938312768936, "num_tokens": 85449637.0, "step": 49265 }, { "entropy": 5.807532787322998, "epoch": 3.833378720093367, "grad_norm": 1.3125, "learning_rate": 0.0003587991448427225, "loss": 4.9822, "mean_token_accuracy": 0.21026830822229386, "num_tokens": 85458268.0, "step": 49270 }, { "entropy": 5.824789667129517, "epoch": 3.8337677494650846, "grad_norm": 1.25, "learning_rate": 0.00035877342258921514, "loss": 4.9133, "mean_token_accuracy": 0.21495382487773895, "num_tokens": 85467198.0, "step": 49275 }, { "entropy": 5.836228609085083, "epoch": 3.8341567788368023, "grad_norm": 1.3125, "learning_rate": 0.00035874769906457936, "loss": 4.917, "mean_token_accuracy": 0.21399617791175843, "num_tokens": 85475445.0, "step": 49280 }, { "entropy": 5.879547023773194, "epoch": 3.83454580820852, "grad_norm": 1.296875, "learning_rate": 0.00035872197426920567, "loss": 4.9882, "mean_token_accuracy": 0.20564845502376555, "num_tokens": 85484475.0, "step": 49285 }, { "entropy": 5.82730073928833, "epoch": 3.8349348375802372, "grad_norm": 1.453125, "learning_rate": 0.0003586962482034842, "loss": 4.9221, "mean_token_accuracy": 0.21386825889348984, "num_tokens": 85492220.0, "step": 49290 }, { "entropy": 5.836488580703735, "epoch": 3.835323866951955, "grad_norm": 1.328125, "learning_rate": 0.00035867052086780544, "loss": 4.9867, "mean_token_accuracy": 0.2090174674987793, "num_tokens": 85501302.0, "step": 49295 }, { "entropy": 5.8463907718658445, "epoch": 3.835712896323672, "grad_norm": 1.453125, "learning_rate": 0.0003586447922625596, "loss": 5.0065, "mean_token_accuracy": 0.21112343817949294, "num_tokens": 85509229.0, "step": 49300 }, { "entropy": 5.7910332679748535, "epoch": 3.83610192569539, "grad_norm": 1.359375, "learning_rate": 0.00035861906238813726, "loss": 4.9319, "mean_token_accuracy": 0.20873789638280868, "num_tokens": 85518139.0, "step": 49305 }, { "entropy": 5.824616384506226, "epoch": 3.8364909550671076, "grad_norm": 1.40625, "learning_rate": 0.00035859333124492866, "loss": 4.945, "mean_token_accuracy": 0.21742900013923644, "num_tokens": 85526787.0, "step": 49310 }, { "entropy": 5.846977472305298, "epoch": 3.8368799844388253, "grad_norm": 1.4140625, "learning_rate": 0.0003585675988333244, "loss": 4.9926, "mean_token_accuracy": 0.21198030114173888, "num_tokens": 85534537.0, "step": 49315 }, { "entropy": 5.866365766525268, "epoch": 3.837269013810543, "grad_norm": 1.3203125, "learning_rate": 0.0003585418651537147, "loss": 4.9807, "mean_token_accuracy": 0.2069234535098076, "num_tokens": 85543568.0, "step": 49320 }, { "entropy": 5.758477115631104, "epoch": 3.8376580431822602, "grad_norm": 1.296875, "learning_rate": 0.00035851613020649036, "loss": 4.8226, "mean_token_accuracy": 0.23072248995304107, "num_tokens": 85552201.0, "step": 49325 }, { "entropy": 5.853129434585571, "epoch": 3.838047072553978, "grad_norm": 1.4453125, "learning_rate": 0.00035849039399204157, "loss": 4.9358, "mean_token_accuracy": 0.2178171992301941, "num_tokens": 85560534.0, "step": 49330 }, { "entropy": 5.862930583953857, "epoch": 3.838436101925695, "grad_norm": 1.390625, "learning_rate": 0.00035846465651075897, "loss": 5.0443, "mean_token_accuracy": 0.2111928343772888, "num_tokens": 85569720.0, "step": 49335 }, { "entropy": 5.7834405422210695, "epoch": 3.838825131297413, "grad_norm": 1.2265625, "learning_rate": 0.00035843891776303304, "loss": 4.9562, "mean_token_accuracy": 0.2101634606719017, "num_tokens": 85578864.0, "step": 49340 }, { "entropy": 5.853238677978515, "epoch": 3.8392141606691306, "grad_norm": 1.375, "learning_rate": 0.0003584131777492543, "loss": 5.0104, "mean_token_accuracy": 0.20767427533864974, "num_tokens": 85588025.0, "step": 49345 }, { "entropy": 5.909740543365478, "epoch": 3.8396031900408483, "grad_norm": 1.453125, "learning_rate": 0.0003583874364698134, "loss": 4.959, "mean_token_accuracy": 0.21199358850717545, "num_tokens": 85596064.0, "step": 49350 }, { "entropy": 5.829646396636963, "epoch": 3.8399922194125655, "grad_norm": 1.3359375, "learning_rate": 0.0003583616939251009, "loss": 4.961, "mean_token_accuracy": 0.21160644441843032, "num_tokens": 85604309.0, "step": 49355 }, { "entropy": 5.782168197631836, "epoch": 3.840381248784283, "grad_norm": 1.3515625, "learning_rate": 0.0003583359501155073, "loss": 4.9555, "mean_token_accuracy": 0.21318109929561616, "num_tokens": 85612531.0, "step": 49360 }, { "entropy": 5.7845906734466555, "epoch": 3.840770278156001, "grad_norm": 1.28125, "learning_rate": 0.0003583102050414234, "loss": 4.8821, "mean_token_accuracy": 0.22119367271661758, "num_tokens": 85620736.0, "step": 49365 }, { "entropy": 5.866454076766968, "epoch": 3.841159307527718, "grad_norm": 1.4375, "learning_rate": 0.00035828445870323967, "loss": 5.0005, "mean_token_accuracy": 0.2062646508216858, "num_tokens": 85629062.0, "step": 49370 }, { "entropy": 5.7712372779846195, "epoch": 3.841548336899436, "grad_norm": 1.359375, "learning_rate": 0.0003582587111013469, "loss": 4.8397, "mean_token_accuracy": 0.21636093258857728, "num_tokens": 85637165.0, "step": 49375 }, { "entropy": 5.855878734588623, "epoch": 3.8419373662711536, "grad_norm": 1.40625, "learning_rate": 0.0003582329622361356, "loss": 4.9651, "mean_token_accuracy": 0.21684902012348176, "num_tokens": 85647161.0, "step": 49380 }, { "entropy": 5.857995796203613, "epoch": 3.8423263956428713, "grad_norm": 1.375, "learning_rate": 0.0003582072121079966, "loss": 4.9943, "mean_token_accuracy": 0.20402364134788514, "num_tokens": 85655554.0, "step": 49385 }, { "entropy": 5.830580615997315, "epoch": 3.8427154250145885, "grad_norm": 1.328125, "learning_rate": 0.00035818146071732064, "loss": 4.9552, "mean_token_accuracy": 0.20660951882600784, "num_tokens": 85664087.0, "step": 49390 }, { "entropy": 5.84796724319458, "epoch": 3.843104454386306, "grad_norm": 1.2734375, "learning_rate": 0.00035815570806449845, "loss": 5.012, "mean_token_accuracy": 0.2118282586336136, "num_tokens": 85672607.0, "step": 49395 }, { "entropy": 5.94596266746521, "epoch": 3.8434934837580235, "grad_norm": 1.3984375, "learning_rate": 0.00035812995414992075, "loss": 4.9935, "mean_token_accuracy": 0.20967138409614564, "num_tokens": 85681431.0, "step": 49400 }, { "entropy": 5.898207759857177, "epoch": 3.843882513129741, "grad_norm": 1.40625, "learning_rate": 0.00035810419897397823, "loss": 4.9946, "mean_token_accuracy": 0.21092324256896972, "num_tokens": 85689751.0, "step": 49405 }, { "entropy": 5.83615550994873, "epoch": 3.844271542501459, "grad_norm": 1.359375, "learning_rate": 0.0003580784425370618, "loss": 4.9702, "mean_token_accuracy": 0.2151494264602661, "num_tokens": 85697995.0, "step": 49410 }, { "entropy": 5.865628242492676, "epoch": 3.8446605718731766, "grad_norm": 1.3515625, "learning_rate": 0.0003580526848395622, "loss": 4.9592, "mean_token_accuracy": 0.21529837399721147, "num_tokens": 85706695.0, "step": 49415 }, { "entropy": 5.870561265945435, "epoch": 3.8450496012448943, "grad_norm": 1.40625, "learning_rate": 0.00035802692588187036, "loss": 4.9633, "mean_token_accuracy": 0.21456843763589858, "num_tokens": 85714918.0, "step": 49420 }, { "entropy": 5.876997184753418, "epoch": 3.8454386306166115, "grad_norm": 1.3046875, "learning_rate": 0.000358001165664377, "loss": 5.0172, "mean_token_accuracy": 0.20575084239244462, "num_tokens": 85723602.0, "step": 49425 }, { "entropy": 5.904080247879028, "epoch": 3.845827659988329, "grad_norm": 1.2578125, "learning_rate": 0.0003579754041874731, "loss": 5.1205, "mean_token_accuracy": 0.2040577307343483, "num_tokens": 85732838.0, "step": 49430 }, { "entropy": 5.823508453369141, "epoch": 3.8462166893600465, "grad_norm": 1.3125, "learning_rate": 0.0003579496414515495, "loss": 4.9057, "mean_token_accuracy": 0.21526552140712737, "num_tokens": 85741814.0, "step": 49435 }, { "entropy": 5.830187892913818, "epoch": 3.846605718731764, "grad_norm": 1.3203125, "learning_rate": 0.00035792387745699715, "loss": 4.9543, "mean_token_accuracy": 0.213832351565361, "num_tokens": 85750922.0, "step": 49440 }, { "entropy": 5.842682313919068, "epoch": 3.846994748103482, "grad_norm": 1.4296875, "learning_rate": 0.0003578981122042069, "loss": 5.0434, "mean_token_accuracy": 0.20521206259727479, "num_tokens": 85758702.0, "step": 49445 }, { "entropy": 5.81285662651062, "epoch": 3.8473837774751996, "grad_norm": 1.296875, "learning_rate": 0.0003578723456935698, "loss": 4.8833, "mean_token_accuracy": 0.21340780705213547, "num_tokens": 85767027.0, "step": 49450 }, { "entropy": 5.865794658660889, "epoch": 3.847772806846917, "grad_norm": 1.3203125, "learning_rate": 0.0003578465779254768, "loss": 4.9689, "mean_token_accuracy": 0.20797560065984727, "num_tokens": 85776043.0, "step": 49455 }, { "entropy": 5.862898492813111, "epoch": 3.8481618362186345, "grad_norm": 1.3359375, "learning_rate": 0.00035782080890031876, "loss": 5.0584, "mean_token_accuracy": 0.20264691412448882, "num_tokens": 85785253.0, "step": 49460 }, { "entropy": 5.857070589065552, "epoch": 3.848550865590352, "grad_norm": 1.390625, "learning_rate": 0.00035779503861848677, "loss": 4.9594, "mean_token_accuracy": 0.21203736811876298, "num_tokens": 85793516.0, "step": 49465 }, { "entropy": 5.8103954792022705, "epoch": 3.8489398949620695, "grad_norm": 1.40625, "learning_rate": 0.0003577692670803719, "loss": 4.8647, "mean_token_accuracy": 0.2175431340932846, "num_tokens": 85801852.0, "step": 49470 }, { "entropy": 5.713435697555542, "epoch": 3.849328924333787, "grad_norm": 1.4609375, "learning_rate": 0.0003577434942863651, "loss": 4.8395, "mean_token_accuracy": 0.2161745622754097, "num_tokens": 85809857.0, "step": 49475 }, { "entropy": 5.742236804962158, "epoch": 3.849717953705505, "grad_norm": 1.4609375, "learning_rate": 0.0003577177202368575, "loss": 4.8813, "mean_token_accuracy": 0.2152144655585289, "num_tokens": 85817999.0, "step": 49480 }, { "entropy": 5.796640682220459, "epoch": 3.8501069830772225, "grad_norm": 1.21875, "learning_rate": 0.00035769194493224014, "loss": 4.9929, "mean_token_accuracy": 0.20778066515922547, "num_tokens": 85827670.0, "step": 49485 }, { "entropy": 5.795357036590576, "epoch": 3.85049601244894, "grad_norm": 1.2890625, "learning_rate": 0.00035766616837290413, "loss": 4.9343, "mean_token_accuracy": 0.2112990066409111, "num_tokens": 85836659.0, "step": 49490 }, { "entropy": 5.91450080871582, "epoch": 3.8508850418206575, "grad_norm": 1.390625, "learning_rate": 0.0003576403905592406, "loss": 5.0291, "mean_token_accuracy": 0.20775260031223297, "num_tokens": 85845250.0, "step": 49495 }, { "entropy": 5.89643030166626, "epoch": 3.8512740711923747, "grad_norm": 1.3203125, "learning_rate": 0.00035761461149164066, "loss": 5.0646, "mean_token_accuracy": 0.201773239672184, "num_tokens": 85854175.0, "step": 49500 }, { "entropy": 5.944066143035888, "epoch": 3.8516631005640924, "grad_norm": 1.3203125, "learning_rate": 0.00035758883117049543, "loss": 5.0719, "mean_token_accuracy": 0.21372891068458558, "num_tokens": 85863493.0, "step": 49505 }, { "entropy": 5.885462856292724, "epoch": 3.85205212993581, "grad_norm": 1.34375, "learning_rate": 0.0003575630495961962, "loss": 4.9326, "mean_token_accuracy": 0.21525711566209793, "num_tokens": 85872798.0, "step": 49510 }, { "entropy": 5.818344926834106, "epoch": 3.852441159307528, "grad_norm": 1.3125, "learning_rate": 0.00035753726676913413, "loss": 4.9255, "mean_token_accuracy": 0.21522509902715684, "num_tokens": 85881355.0, "step": 49515 }, { "entropy": 5.756139183044434, "epoch": 3.8528301886792455, "grad_norm": 1.2578125, "learning_rate": 0.00035751148268970046, "loss": 4.8346, "mean_token_accuracy": 0.22025304138660431, "num_tokens": 85890384.0, "step": 49520 }, { "entropy": 5.915133094787597, "epoch": 3.853219218050963, "grad_norm": 1.3515625, "learning_rate": 0.0003574856973582863, "loss": 4.9605, "mean_token_accuracy": 0.21780066043138505, "num_tokens": 85898965.0, "step": 49525 }, { "entropy": 5.838275003433227, "epoch": 3.8536082474226805, "grad_norm": 1.3828125, "learning_rate": 0.00035745991077528296, "loss": 4.9257, "mean_token_accuracy": 0.2217951700091362, "num_tokens": 85907582.0, "step": 49530 }, { "entropy": 5.766354942321778, "epoch": 3.8539972767943977, "grad_norm": 1.2421875, "learning_rate": 0.00035743412294108175, "loss": 4.9182, "mean_token_accuracy": 0.21845375150442123, "num_tokens": 85916343.0, "step": 49535 }, { "entropy": 5.795911359786987, "epoch": 3.8543863061661154, "grad_norm": 1.3828125, "learning_rate": 0.0003574083338560739, "loss": 4.9572, "mean_token_accuracy": 0.21283060908317566, "num_tokens": 85925390.0, "step": 49540 }, { "entropy": 5.779561758041382, "epoch": 3.854775335537833, "grad_norm": 1.34375, "learning_rate": 0.00035738254352065074, "loss": 4.9081, "mean_token_accuracy": 0.2168794736266136, "num_tokens": 85934238.0, "step": 49545 }, { "entropy": 5.851829290390015, "epoch": 3.855164364909551, "grad_norm": 1.359375, "learning_rate": 0.00035735675193520364, "loss": 4.9833, "mean_token_accuracy": 0.21351455003023148, "num_tokens": 85942903.0, "step": 49550 }, { "entropy": 5.835073518753052, "epoch": 3.855553394281268, "grad_norm": 1.3359375, "learning_rate": 0.0003573309591001239, "loss": 4.9629, "mean_token_accuracy": 0.21498206555843352, "num_tokens": 85951174.0, "step": 49555 }, { "entropy": 5.777992248535156, "epoch": 3.855942423652986, "grad_norm": 1.3828125, "learning_rate": 0.000357305165015803, "loss": 4.9608, "mean_token_accuracy": 0.20714259147644043, "num_tokens": 85960685.0, "step": 49560 }, { "entropy": 5.878385829925537, "epoch": 3.8563314530247035, "grad_norm": 1.3828125, "learning_rate": 0.00035727936968263206, "loss": 5.0031, "mean_token_accuracy": 0.2124515578150749, "num_tokens": 85968969.0, "step": 49565 }, { "entropy": 5.88637146949768, "epoch": 3.8567204823964207, "grad_norm": 1.3046875, "learning_rate": 0.0003572535731010028, "loss": 5.0345, "mean_token_accuracy": 0.20684645175933838, "num_tokens": 85977576.0, "step": 49570 }, { "entropy": 5.736698961257934, "epoch": 3.8571095117681384, "grad_norm": 1.375, "learning_rate": 0.0003572277752713063, "loss": 4.833, "mean_token_accuracy": 0.22170543521642685, "num_tokens": 85986433.0, "step": 49575 }, { "entropy": 5.847989511489868, "epoch": 3.857498541139856, "grad_norm": 1.328125, "learning_rate": 0.0003572019761939343, "loss": 4.9766, "mean_token_accuracy": 0.2104301556944847, "num_tokens": 85995178.0, "step": 49580 }, { "entropy": 5.800891923904419, "epoch": 3.857887570511574, "grad_norm": 1.2734375, "learning_rate": 0.00035717617586927814, "loss": 4.9465, "mean_token_accuracy": 0.21178001016378403, "num_tokens": 86004164.0, "step": 49585 }, { "entropy": 5.906930732727051, "epoch": 3.858276599883291, "grad_norm": 1.3359375, "learning_rate": 0.00035715037429772935, "loss": 5.0144, "mean_token_accuracy": 0.2081627756357193, "num_tokens": 86012435.0, "step": 49590 }, { "entropy": 5.831538152694702, "epoch": 3.8586656292550088, "grad_norm": 1.34375, "learning_rate": 0.0003571245714796793, "loss": 4.9461, "mean_token_accuracy": 0.21529198288917542, "num_tokens": 86021646.0, "step": 49595 }, { "entropy": 5.77029595375061, "epoch": 3.8590546586267265, "grad_norm": 1.359375, "learning_rate": 0.0003570987674155197, "loss": 4.8298, "mean_token_accuracy": 0.22439627796411515, "num_tokens": 86029746.0, "step": 49600 }, { "entropy": 5.803494644165039, "epoch": 3.8594436879984437, "grad_norm": 1.3515625, "learning_rate": 0.0003570729621056419, "loss": 4.9576, "mean_token_accuracy": 0.2105042576789856, "num_tokens": 86038652.0, "step": 49605 }, { "entropy": 5.826426553726196, "epoch": 3.8598327173701614, "grad_norm": 1.3046875, "learning_rate": 0.00035704715555043753, "loss": 5.0172, "mean_token_accuracy": 0.20146183669567108, "num_tokens": 86048321.0, "step": 49610 }, { "entropy": 5.879402446746826, "epoch": 3.860221746741879, "grad_norm": 1.34375, "learning_rate": 0.00035702134775029813, "loss": 5.0096, "mean_token_accuracy": 0.20516550093889235, "num_tokens": 86057064.0, "step": 49615 }, { "entropy": 5.917349481582642, "epoch": 3.860610776113597, "grad_norm": 1.375, "learning_rate": 0.0003569955387056154, "loss": 5.0464, "mean_token_accuracy": 0.21385532170534133, "num_tokens": 86065436.0, "step": 49620 }, { "entropy": 5.7958574295043945, "epoch": 3.860999805485314, "grad_norm": 1.3671875, "learning_rate": 0.00035696972841678094, "loss": 4.9187, "mean_token_accuracy": 0.21523911654949188, "num_tokens": 86074107.0, "step": 49625 }, { "entropy": 5.712298393249512, "epoch": 3.8613888348570318, "grad_norm": 1.359375, "learning_rate": 0.0003569439168841862, "loss": 4.8318, "mean_token_accuracy": 0.22960321009159088, "num_tokens": 86082822.0, "step": 49630 }, { "entropy": 5.8852170467376705, "epoch": 3.861777864228749, "grad_norm": 1.359375, "learning_rate": 0.00035691810410822303, "loss": 5.0425, "mean_token_accuracy": 0.2132394328713417, "num_tokens": 86092106.0, "step": 49635 }, { "entropy": 5.834230661392212, "epoch": 3.8621668936004667, "grad_norm": 1.28125, "learning_rate": 0.00035689229008928304, "loss": 4.9169, "mean_token_accuracy": 0.21115613877773284, "num_tokens": 86100583.0, "step": 49640 }, { "entropy": 5.84580020904541, "epoch": 3.8625559229721844, "grad_norm": 1.3359375, "learning_rate": 0.00035686647482775774, "loss": 4.9668, "mean_token_accuracy": 0.20675680935382842, "num_tokens": 86109257.0, "step": 49645 }, { "entropy": 5.838174200057983, "epoch": 3.862944952343902, "grad_norm": 1.3515625, "learning_rate": 0.00035684065832403903, "loss": 4.9162, "mean_token_accuracy": 0.21273557394742965, "num_tokens": 86118731.0, "step": 49650 }, { "entropy": 5.787800264358521, "epoch": 3.8633339817156194, "grad_norm": 1.3359375, "learning_rate": 0.0003568148405785187, "loss": 4.8195, "mean_token_accuracy": 0.21997503489255904, "num_tokens": 86127602.0, "step": 49655 }, { "entropy": 5.7841590404510494, "epoch": 3.863723011087337, "grad_norm": 1.421875, "learning_rate": 0.0003567890215915883, "loss": 4.901, "mean_token_accuracy": 0.22047497630119323, "num_tokens": 86135487.0, "step": 49660 }, { "entropy": 5.791139459609985, "epoch": 3.8641120404590548, "grad_norm": 1.28125, "learning_rate": 0.00035676320136363975, "loss": 4.8992, "mean_token_accuracy": 0.2100493147969246, "num_tokens": 86144252.0, "step": 49665 }, { "entropy": 5.866192579269409, "epoch": 3.864501069830772, "grad_norm": 1.34375, "learning_rate": 0.0003567373798950647, "loss": 5.0085, "mean_token_accuracy": 0.20873358547687532, "num_tokens": 86153311.0, "step": 49670 }, { "entropy": 5.913035249710083, "epoch": 3.8648900992024897, "grad_norm": 1.28125, "learning_rate": 0.00035671155718625504, "loss": 5.042, "mean_token_accuracy": 0.20286408960819244, "num_tokens": 86161616.0, "step": 49675 }, { "entropy": 5.806729364395141, "epoch": 3.8652791285742074, "grad_norm": 1.34375, "learning_rate": 0.0003566857332376025, "loss": 4.9477, "mean_token_accuracy": 0.21394679695367813, "num_tokens": 86170213.0, "step": 49680 }, { "entropy": 5.81158561706543, "epoch": 3.865668157945925, "grad_norm": 1.390625, "learning_rate": 0.00035665990804949904, "loss": 4.9433, "mean_token_accuracy": 0.21919670104980468, "num_tokens": 86178459.0, "step": 49685 }, { "entropy": 5.822028255462646, "epoch": 3.8660571873176424, "grad_norm": 1.3515625, "learning_rate": 0.0003566340816223364, "loss": 4.9871, "mean_token_accuracy": 0.209971883893013, "num_tokens": 86186540.0, "step": 49690 }, { "entropy": 5.814668464660644, "epoch": 3.86644621668936, "grad_norm": 1.3203125, "learning_rate": 0.0003566082539565066, "loss": 4.9763, "mean_token_accuracy": 0.20956696271896363, "num_tokens": 86195831.0, "step": 49695 }, { "entropy": 5.9142174243927, "epoch": 3.8668352460610778, "grad_norm": 1.421875, "learning_rate": 0.0003565824250524013, "loss": 5.0153, "mean_token_accuracy": 0.2060056820511818, "num_tokens": 86204767.0, "step": 49700 }, { "entropy": 5.864923763275146, "epoch": 3.867224275432795, "grad_norm": 1.3046875, "learning_rate": 0.00035655659491041266, "loss": 4.933, "mean_token_accuracy": 0.21373645663261415, "num_tokens": 86213375.0, "step": 49705 }, { "entropy": 5.843689632415772, "epoch": 3.8676133048045127, "grad_norm": 1.34375, "learning_rate": 0.0003565307635309325, "loss": 4.945, "mean_token_accuracy": 0.21380660086870193, "num_tokens": 86222378.0, "step": 49710 }, { "entropy": 5.807613754272461, "epoch": 3.8680023341762304, "grad_norm": 1.265625, "learning_rate": 0.0003565049309143527, "loss": 4.8567, "mean_token_accuracy": 0.2259746238589287, "num_tokens": 86230519.0, "step": 49715 }, { "entropy": 5.793789386749268, "epoch": 3.868391363547948, "grad_norm": 1.3828125, "learning_rate": 0.00035647909706106533, "loss": 4.9556, "mean_token_accuracy": 0.2155417487025261, "num_tokens": 86238536.0, "step": 49720 }, { "entropy": 5.800478172302246, "epoch": 3.8687803929196654, "grad_norm": 1.296875, "learning_rate": 0.0003564532619714624, "loss": 5.025, "mean_token_accuracy": 0.21009330302476883, "num_tokens": 86247309.0, "step": 49725 }, { "entropy": 5.840622186660767, "epoch": 3.869169422291383, "grad_norm": 1.375, "learning_rate": 0.0003564274256459358, "loss": 4.9721, "mean_token_accuracy": 0.20948131531476974, "num_tokens": 86255549.0, "step": 49730 }, { "entropy": 5.976945447921753, "epoch": 3.8695584516631003, "grad_norm": 1.3203125, "learning_rate": 0.0003564015880848777, "loss": 5.1805, "mean_token_accuracy": 0.19420605152845383, "num_tokens": 86265868.0, "step": 49735 }, { "entropy": 5.928374910354615, "epoch": 3.869947481034818, "grad_norm": 1.3046875, "learning_rate": 0.00035637574928867996, "loss": 5.0559, "mean_token_accuracy": 0.20456474721431733, "num_tokens": 86274504.0, "step": 49740 }, { "entropy": 5.807053136825561, "epoch": 3.8703365104065357, "grad_norm": 1.359375, "learning_rate": 0.00035634990925773475, "loss": 4.8787, "mean_token_accuracy": 0.2152481719851494, "num_tokens": 86283782.0, "step": 49745 }, { "entropy": 5.812450551986695, "epoch": 3.8707255397782534, "grad_norm": 1.375, "learning_rate": 0.0003563240679924342, "loss": 4.8945, "mean_token_accuracy": 0.21476317048072815, "num_tokens": 86292100.0, "step": 49750 }, { "entropy": 5.8804114818572994, "epoch": 3.871114569149971, "grad_norm": 1.3359375, "learning_rate": 0.0003562982254931704, "loss": 5.0469, "mean_token_accuracy": 0.20753551870584488, "num_tokens": 86300854.0, "step": 49755 }, { "entropy": 5.855142402648926, "epoch": 3.8715035985216883, "grad_norm": 1.265625, "learning_rate": 0.0003562723817603354, "loss": 5.0247, "mean_token_accuracy": 0.2071542352437973, "num_tokens": 86309297.0, "step": 49760 }, { "entropy": 5.798274564743042, "epoch": 3.871892627893406, "grad_norm": 1.2578125, "learning_rate": 0.00035624653679432135, "loss": 4.9124, "mean_token_accuracy": 0.2090733528137207, "num_tokens": 86317820.0, "step": 49765 }, { "entropy": 5.833049011230469, "epoch": 3.8722816572651233, "grad_norm": 1.5078125, "learning_rate": 0.00035622069059552036, "loss": 4.8965, "mean_token_accuracy": 0.21946779489517212, "num_tokens": 86326393.0, "step": 49770 }, { "entropy": 5.9085118770599365, "epoch": 3.872670686636841, "grad_norm": 1.2578125, "learning_rate": 0.0003561948431643247, "loss": 5.0192, "mean_token_accuracy": 0.21040442138910292, "num_tokens": 86334947.0, "step": 49775 }, { "entropy": 5.831426286697388, "epoch": 3.8730597160085587, "grad_norm": 1.34375, "learning_rate": 0.00035616899450112655, "loss": 4.9698, "mean_token_accuracy": 0.21110423952341079, "num_tokens": 86343842.0, "step": 49780 }, { "entropy": 5.814009189605713, "epoch": 3.8734487453802764, "grad_norm": 1.3671875, "learning_rate": 0.00035614314460631814, "loss": 5.0598, "mean_token_accuracy": 0.20741496682167054, "num_tokens": 86352549.0, "step": 49785 }, { "entropy": 5.8714313983917235, "epoch": 3.8738377747519936, "grad_norm": 1.3203125, "learning_rate": 0.0003561172934802917, "loss": 4.9593, "mean_token_accuracy": 0.21098192483186723, "num_tokens": 86361826.0, "step": 49790 }, { "entropy": 5.818069553375244, "epoch": 3.8742268041237113, "grad_norm": 1.359375, "learning_rate": 0.0003560914411234393, "loss": 4.8461, "mean_token_accuracy": 0.21626058518886565, "num_tokens": 86370072.0, "step": 49795 }, { "entropy": 5.81378436088562, "epoch": 3.874615833495429, "grad_norm": 1.328125, "learning_rate": 0.0003560655875361535, "loss": 4.9441, "mean_token_accuracy": 0.21843957304954528, "num_tokens": 86379061.0, "step": 49800 }, { "entropy": 5.923106050491333, "epoch": 3.8750048628671463, "grad_norm": 1.40625, "learning_rate": 0.0003560397327188263, "loss": 4.9809, "mean_token_accuracy": 0.21071067005395888, "num_tokens": 86387704.0, "step": 49805 }, { "entropy": 5.844855308532715, "epoch": 3.875393892238864, "grad_norm": 1.3125, "learning_rate": 0.0003560138766718502, "loss": 4.9505, "mean_token_accuracy": 0.21367107033729554, "num_tokens": 86396740.0, "step": 49810 }, { "entropy": 5.879264211654663, "epoch": 3.8757829216105817, "grad_norm": 1.2265625, "learning_rate": 0.00035598801939561755, "loss": 4.9503, "mean_token_accuracy": 0.21177878379821777, "num_tokens": 86405863.0, "step": 49815 }, { "entropy": 5.875940370559692, "epoch": 3.8761719509822994, "grad_norm": 1.3828125, "learning_rate": 0.00035596216089052045, "loss": 4.9705, "mean_token_accuracy": 0.21486801505088807, "num_tokens": 86414696.0, "step": 49820 }, { "entropy": 5.76637830734253, "epoch": 3.8765609803540166, "grad_norm": 1.328125, "learning_rate": 0.00035593630115695154, "loss": 4.8875, "mean_token_accuracy": 0.21385105401277543, "num_tokens": 86423566.0, "step": 49825 }, { "entropy": 5.822409439086914, "epoch": 3.8769500097257343, "grad_norm": 1.2421875, "learning_rate": 0.0003559104401953031, "loss": 4.9797, "mean_token_accuracy": 0.20398910492658615, "num_tokens": 86431917.0, "step": 49830 }, { "entropy": 5.838342523574829, "epoch": 3.8773390390974516, "grad_norm": 1.3125, "learning_rate": 0.00035588457800596747, "loss": 5.032, "mean_token_accuracy": 0.2066277638077736, "num_tokens": 86440259.0, "step": 49835 }, { "entropy": 5.8199059009552006, "epoch": 3.8777280684691693, "grad_norm": 1.28125, "learning_rate": 0.0003558587145893371, "loss": 4.9915, "mean_token_accuracy": 0.21519631296396255, "num_tokens": 86448873.0, "step": 49840 }, { "entropy": 5.890364503860473, "epoch": 3.878117097840887, "grad_norm": 1.4453125, "learning_rate": 0.0003558328499458044, "loss": 5.0248, "mean_token_accuracy": 0.20627732276916505, "num_tokens": 86457551.0, "step": 49845 }, { "entropy": 5.881229066848755, "epoch": 3.8785061272126047, "grad_norm": 1.3359375, "learning_rate": 0.0003558069840757619, "loss": 5.0217, "mean_token_accuracy": 0.20850950628519058, "num_tokens": 86467197.0, "step": 49850 }, { "entropy": 5.875233125686646, "epoch": 3.8788951565843224, "grad_norm": 1.453125, "learning_rate": 0.000355781116979602, "loss": 4.9937, "mean_token_accuracy": 0.20769979059696198, "num_tokens": 86476635.0, "step": 49855 }, { "entropy": 5.94115834236145, "epoch": 3.8792841859560396, "grad_norm": 1.3203125, "learning_rate": 0.0003557552486577173, "loss": 5.0374, "mean_token_accuracy": 0.20534246414899826, "num_tokens": 86485759.0, "step": 49860 }, { "entropy": 5.848342227935791, "epoch": 3.8796732153277573, "grad_norm": 1.421875, "learning_rate": 0.0003557293791105002, "loss": 4.9536, "mean_token_accuracy": 0.2171229287981987, "num_tokens": 86494165.0, "step": 49865 }, { "entropy": 5.801510810852051, "epoch": 3.8800622446994746, "grad_norm": 1.296875, "learning_rate": 0.00035570350833834334, "loss": 4.8494, "mean_token_accuracy": 0.22595129311084747, "num_tokens": 86502146.0, "step": 49870 }, { "entropy": 5.769648122787475, "epoch": 3.8804512740711923, "grad_norm": 1.4140625, "learning_rate": 0.00035567763634163904, "loss": 4.8293, "mean_token_accuracy": 0.2161725491285324, "num_tokens": 86510570.0, "step": 49875 }, { "entropy": 5.769085693359375, "epoch": 3.88084030344291, "grad_norm": 1.328125, "learning_rate": 0.0003556517631207802, "loss": 4.8987, "mean_token_accuracy": 0.21662116497755052, "num_tokens": 86519124.0, "step": 49880 }, { "entropy": 5.870197677612305, "epoch": 3.8812293328146277, "grad_norm": 1.359375, "learning_rate": 0.00035562588867615907, "loss": 5.0164, "mean_token_accuracy": 0.20443173944950105, "num_tokens": 86527754.0, "step": 49885 }, { "entropy": 5.871813535690308, "epoch": 3.881618362186345, "grad_norm": 1.3125, "learning_rate": 0.00035560001300816846, "loss": 4.9868, "mean_token_accuracy": 0.21121466606855394, "num_tokens": 86536265.0, "step": 49890 }, { "entropy": 5.76010046005249, "epoch": 3.8820073915580626, "grad_norm": 1.2734375, "learning_rate": 0.00035557413611720095, "loss": 4.912, "mean_token_accuracy": 0.21914926618337632, "num_tokens": 86545845.0, "step": 49895 }, { "entropy": 5.783774185180664, "epoch": 3.8823964209297803, "grad_norm": 1.2734375, "learning_rate": 0.00035554825800364917, "loss": 4.8197, "mean_token_accuracy": 0.2215958297252655, "num_tokens": 86554291.0, "step": 49900 }, { "entropy": 5.831540632247925, "epoch": 3.8827854503014976, "grad_norm": 1.375, "learning_rate": 0.0003555223786679058, "loss": 4.9714, "mean_token_accuracy": 0.21128492206335067, "num_tokens": 86562913.0, "step": 49905 }, { "entropy": 5.859705209732056, "epoch": 3.8831744796732153, "grad_norm": 1.3046875, "learning_rate": 0.00035549649811036346, "loss": 4.9863, "mean_token_accuracy": 0.20787952840328217, "num_tokens": 86571958.0, "step": 49910 }, { "entropy": 5.83790602684021, "epoch": 3.883563509044933, "grad_norm": 1.421875, "learning_rate": 0.00035547061633141487, "loss": 4.8856, "mean_token_accuracy": 0.22153096944093703, "num_tokens": 86580528.0, "step": 49915 }, { "entropy": 5.853646564483642, "epoch": 3.8839525384166507, "grad_norm": 1.2734375, "learning_rate": 0.00035544473333145275, "loss": 4.9711, "mean_token_accuracy": 0.21165041178464888, "num_tokens": 86589777.0, "step": 49920 }, { "entropy": 5.9176534652709964, "epoch": 3.884341567788368, "grad_norm": 1.3359375, "learning_rate": 0.0003554188491108699, "loss": 5.0219, "mean_token_accuracy": 0.21207495629787446, "num_tokens": 86598802.0, "step": 49925 }, { "entropy": 5.848093891143799, "epoch": 3.8847305971600856, "grad_norm": 1.328125, "learning_rate": 0.000355392963670059, "loss": 5.0175, "mean_token_accuracy": 0.2093747541308403, "num_tokens": 86607353.0, "step": 49930 }, { "entropy": 5.931631755828858, "epoch": 3.8851196265318033, "grad_norm": 1.3125, "learning_rate": 0.0003553670770094129, "loss": 5.0663, "mean_token_accuracy": 0.2058657705783844, "num_tokens": 86616891.0, "step": 49935 }, { "entropy": 5.911854600906372, "epoch": 3.8855086559035206, "grad_norm": 1.3671875, "learning_rate": 0.00035534118912932425, "loss": 5.022, "mean_token_accuracy": 0.2115153044462204, "num_tokens": 86626813.0, "step": 49940 }, { "entropy": 5.932025384902954, "epoch": 3.8858976852752383, "grad_norm": 1.3359375, "learning_rate": 0.00035531530003018584, "loss": 5.0475, "mean_token_accuracy": 0.20784884989261626, "num_tokens": 86635641.0, "step": 49945 }, { "entropy": 5.8615058898925785, "epoch": 3.886286714646956, "grad_norm": 1.375, "learning_rate": 0.0003552894097123907, "loss": 4.9502, "mean_token_accuracy": 0.20857900977134705, "num_tokens": 86644127.0, "step": 49950 }, { "entropy": 5.8826335906982425, "epoch": 3.8866757440186737, "grad_norm": 1.328125, "learning_rate": 0.00035526351817633157, "loss": 4.9358, "mean_token_accuracy": 0.21575309187173844, "num_tokens": 86652516.0, "step": 49955 }, { "entropy": 5.838472032546997, "epoch": 3.887064773390391, "grad_norm": 1.3984375, "learning_rate": 0.0003552376254224013, "loss": 5.0289, "mean_token_accuracy": 0.21493494063615798, "num_tokens": 86661004.0, "step": 49960 }, { "entropy": 5.828317022323608, "epoch": 3.8874538027621086, "grad_norm": 1.3125, "learning_rate": 0.0003552117314509928, "loss": 5.0173, "mean_token_accuracy": 0.21164486706256866, "num_tokens": 86669533.0, "step": 49965 }, { "entropy": 5.882344341278076, "epoch": 3.887842832133826, "grad_norm": 1.2734375, "learning_rate": 0.0003551858362624989, "loss": 4.8659, "mean_token_accuracy": 0.2237582191824913, "num_tokens": 86677476.0, "step": 49970 }, { "entropy": 5.883181428909301, "epoch": 3.8882318615055436, "grad_norm": 1.34375, "learning_rate": 0.0003551599398573125, "loss": 4.9974, "mean_token_accuracy": 0.21064640134572982, "num_tokens": 86685271.0, "step": 49975 }, { "entropy": 5.835028791427613, "epoch": 3.8886208908772613, "grad_norm": 1.3828125, "learning_rate": 0.00035513404223582666, "loss": 5.0112, "mean_token_accuracy": 0.20722855180501937, "num_tokens": 86694015.0, "step": 49980 }, { "entropy": 5.8857497215271, "epoch": 3.889009920248979, "grad_norm": 1.265625, "learning_rate": 0.00035510814339843427, "loss": 5.0084, "mean_token_accuracy": 0.20730988532304764, "num_tokens": 86702436.0, "step": 49985 }, { "entropy": 5.832481861114502, "epoch": 3.889398949620696, "grad_norm": 1.359375, "learning_rate": 0.00035508224334552835, "loss": 4.9665, "mean_token_accuracy": 0.20712581276893616, "num_tokens": 86711090.0, "step": 49990 }, { "entropy": 5.804567146301269, "epoch": 3.889787978992414, "grad_norm": 1.359375, "learning_rate": 0.0003550563420775018, "loss": 4.9385, "mean_token_accuracy": 0.2130318194627762, "num_tokens": 86720532.0, "step": 49995 }, { "entropy": 5.815111875534058, "epoch": 3.8901770083641316, "grad_norm": 1.25, "learning_rate": 0.00035503043959474775, "loss": 4.8791, "mean_token_accuracy": 0.22177657186985017, "num_tokens": 86728998.0, "step": 50000 }, { "entropy": 5.836471271514893, "epoch": 3.890566037735849, "grad_norm": 1.4140625, "learning_rate": 0.00035500453589765906, "loss": 4.9064, "mean_token_accuracy": 0.21311963945627213, "num_tokens": 86737186.0, "step": 50005 }, { "entropy": 5.760082578659057, "epoch": 3.8909550671075666, "grad_norm": 1.28125, "learning_rate": 0.00035497863098662893, "loss": 4.9186, "mean_token_accuracy": 0.21197385489940643, "num_tokens": 86745453.0, "step": 50010 }, { "entropy": 5.791597080230713, "epoch": 3.8913440964792843, "grad_norm": 1.328125, "learning_rate": 0.00035495272486205033, "loss": 4.9742, "mean_token_accuracy": 0.21475330442190171, "num_tokens": 86754463.0, "step": 50015 }, { "entropy": 5.876528978347778, "epoch": 3.891733125851002, "grad_norm": 1.2421875, "learning_rate": 0.0003549268175243165, "loss": 4.987, "mean_token_accuracy": 0.21643628776073456, "num_tokens": 86763159.0, "step": 50020 }, { "entropy": 5.815583324432373, "epoch": 3.892122155222719, "grad_norm": 1.2734375, "learning_rate": 0.0003549009089738204, "loss": 4.9026, "mean_token_accuracy": 0.2105148121714592, "num_tokens": 86772194.0, "step": 50025 }, { "entropy": 5.835250902175903, "epoch": 3.892511184594437, "grad_norm": 1.3125, "learning_rate": 0.0003548749992109551, "loss": 4.8854, "mean_token_accuracy": 0.2166237637400627, "num_tokens": 86780508.0, "step": 50030 }, { "entropy": 5.881607151031494, "epoch": 3.8929002139661546, "grad_norm": 1.390625, "learning_rate": 0.0003548490882361139, "loss": 4.9919, "mean_token_accuracy": 0.21138374507427216, "num_tokens": 86788793.0, "step": 50035 }, { "entropy": 5.81362566947937, "epoch": 3.893289243337872, "grad_norm": 1.34375, "learning_rate": 0.0003548231760496898, "loss": 5.0065, "mean_token_accuracy": 0.20768265575170516, "num_tokens": 86797947.0, "step": 50040 }, { "entropy": 5.862573957443237, "epoch": 3.8936782727095895, "grad_norm": 1.3125, "learning_rate": 0.00035479726265207604, "loss": 5.0118, "mean_token_accuracy": 0.2016950234770775, "num_tokens": 86807325.0, "step": 50045 }, { "entropy": 5.825527191162109, "epoch": 3.8940673020813072, "grad_norm": 1.3828125, "learning_rate": 0.0003547713480436659, "loss": 4.9418, "mean_token_accuracy": 0.21670743077993393, "num_tokens": 86816436.0, "step": 50050 }, { "entropy": 5.880147171020508, "epoch": 3.894456331453025, "grad_norm": 1.40625, "learning_rate": 0.00035474543222485254, "loss": 4.9973, "mean_token_accuracy": 0.2096487522125244, "num_tokens": 86824554.0, "step": 50055 }, { "entropy": 5.827675914764404, "epoch": 3.894845360824742, "grad_norm": 1.328125, "learning_rate": 0.00035471951519602926, "loss": 4.9178, "mean_token_accuracy": 0.2171166568994522, "num_tokens": 86833096.0, "step": 50060 }, { "entropy": 5.865033435821533, "epoch": 3.89523439019646, "grad_norm": 1.296875, "learning_rate": 0.00035469359695758905, "loss": 4.9824, "mean_token_accuracy": 0.2047283336520195, "num_tokens": 86841921.0, "step": 50065 }, { "entropy": 5.794017601013183, "epoch": 3.895623419568177, "grad_norm": 1.328125, "learning_rate": 0.0003546676775099254, "loss": 4.8617, "mean_token_accuracy": 0.21783996522426605, "num_tokens": 86850244.0, "step": 50070 }, { "entropy": 5.799462699890137, "epoch": 3.896012448939895, "grad_norm": 1.375, "learning_rate": 0.0003546417568534315, "loss": 4.8946, "mean_token_accuracy": 0.21636681854724885, "num_tokens": 86858445.0, "step": 50075 }, { "entropy": 5.752597284317017, "epoch": 3.8964014783116125, "grad_norm": 1.4296875, "learning_rate": 0.00035461583498850083, "loss": 4.8692, "mean_token_accuracy": 0.22186903208494185, "num_tokens": 86867496.0, "step": 50080 }, { "entropy": 5.77060112953186, "epoch": 3.8967905076833302, "grad_norm": 1.3125, "learning_rate": 0.0003545899119155265, "loss": 4.8359, "mean_token_accuracy": 0.21478314101696014, "num_tokens": 86876756.0, "step": 50085 }, { "entropy": 5.845057678222656, "epoch": 3.8971795370550475, "grad_norm": 1.3671875, "learning_rate": 0.00035456398763490193, "loss": 4.9752, "mean_token_accuracy": 0.21137607842683792, "num_tokens": 86886125.0, "step": 50090 }, { "entropy": 5.7446348667144775, "epoch": 3.897568566426765, "grad_norm": 1.2734375, "learning_rate": 0.0003545380621470205, "loss": 4.8277, "mean_token_accuracy": 0.2297294795513153, "num_tokens": 86895032.0, "step": 50095 }, { "entropy": 5.869444561004639, "epoch": 3.897957595798483, "grad_norm": 1.390625, "learning_rate": 0.0003545121354522756, "loss": 5.0701, "mean_token_accuracy": 0.1998348355293274, "num_tokens": 86904050.0, "step": 50100 }, { "entropy": 5.8282702445983885, "epoch": 3.8983466251702, "grad_norm": 1.4140625, "learning_rate": 0.00035448620755106064, "loss": 4.974, "mean_token_accuracy": 0.2116552010178566, "num_tokens": 86912603.0, "step": 50105 }, { "entropy": 5.848015546798706, "epoch": 3.898735654541918, "grad_norm": 1.2890625, "learning_rate": 0.0003544602784437689, "loss": 4.946, "mean_token_accuracy": 0.2169031336903572, "num_tokens": 86921693.0, "step": 50110 }, { "entropy": 5.829853057861328, "epoch": 3.8991246839136355, "grad_norm": 1.3125, "learning_rate": 0.00035443434813079393, "loss": 4.9879, "mean_token_accuracy": 0.2153860241174698, "num_tokens": 86929975.0, "step": 50115 }, { "entropy": 5.789067792892456, "epoch": 3.8995137132853532, "grad_norm": 1.46875, "learning_rate": 0.0003544084166125292, "loss": 4.8805, "mean_token_accuracy": 0.22021604180336, "num_tokens": 86938184.0, "step": 50120 }, { "entropy": 5.870650959014893, "epoch": 3.8999027426570705, "grad_norm": 1.3984375, "learning_rate": 0.0003543824838893682, "loss": 5.0118, "mean_token_accuracy": 0.20872282981872559, "num_tokens": 86946849.0, "step": 50125 }, { "entropy": 5.852821922302246, "epoch": 3.900291772028788, "grad_norm": 1.3984375, "learning_rate": 0.00035435654996170417, "loss": 5.0082, "mean_token_accuracy": 0.20393765419721605, "num_tokens": 86954911.0, "step": 50130 }, { "entropy": 5.817497587203979, "epoch": 3.900680801400506, "grad_norm": 1.28125, "learning_rate": 0.000354330614829931, "loss": 4.9606, "mean_token_accuracy": 0.20945875644683837, "num_tokens": 86963270.0, "step": 50135 }, { "entropy": 5.853619337081909, "epoch": 3.901069830772223, "grad_norm": 1.4375, "learning_rate": 0.0003543046784944419, "loss": 4.8793, "mean_token_accuracy": 0.22207652330398558, "num_tokens": 86971600.0, "step": 50140 }, { "entropy": 5.853485584259033, "epoch": 3.901458860143941, "grad_norm": 1.390625, "learning_rate": 0.00035427874095563054, "loss": 4.969, "mean_token_accuracy": 0.2131533905863762, "num_tokens": 86979743.0, "step": 50145 }, { "entropy": 5.894322061538697, "epoch": 3.9018478895156585, "grad_norm": 1.2734375, "learning_rate": 0.0003542528022138905, "loss": 5.0338, "mean_token_accuracy": 0.21634818017482757, "num_tokens": 86988652.0, "step": 50150 }, { "entropy": 5.873696374893188, "epoch": 3.9022369188873762, "grad_norm": 1.3203125, "learning_rate": 0.0003542268622696153, "loss": 5.0254, "mean_token_accuracy": 0.20724546015262604, "num_tokens": 86997070.0, "step": 50155 }, { "entropy": 5.736970710754394, "epoch": 3.9026259482590935, "grad_norm": 1.3046875, "learning_rate": 0.0003542009211231986, "loss": 4.9086, "mean_token_accuracy": 0.21894647777080536, "num_tokens": 87005765.0, "step": 50160 }, { "entropy": 5.836826181411743, "epoch": 3.903014977630811, "grad_norm": 1.2578125, "learning_rate": 0.00035417497877503396, "loss": 4.9811, "mean_token_accuracy": 0.2072973892092705, "num_tokens": 87014506.0, "step": 50165 }, { "entropy": 5.8156575679779055, "epoch": 3.9034040070025284, "grad_norm": 1.265625, "learning_rate": 0.00035414903522551505, "loss": 4.9385, "mean_token_accuracy": 0.21120989471673965, "num_tokens": 87023666.0, "step": 50170 }, { "entropy": 5.852911376953125, "epoch": 3.903793036374246, "grad_norm": 1.3515625, "learning_rate": 0.00035412309047503553, "loss": 4.9367, "mean_token_accuracy": 0.2155543938279152, "num_tokens": 87031942.0, "step": 50175 }, { "entropy": 5.815826177597046, "epoch": 3.904182065745964, "grad_norm": 1.328125, "learning_rate": 0.000354097144523989, "loss": 4.9161, "mean_token_accuracy": 0.21862224787473677, "num_tokens": 87041029.0, "step": 50180 }, { "entropy": 5.835499382019043, "epoch": 3.9045710951176815, "grad_norm": 1.4296875, "learning_rate": 0.0003540711973727693, "loss": 5.019, "mean_token_accuracy": 0.20608026832342147, "num_tokens": 87050329.0, "step": 50185 }, { "entropy": 5.859791564941406, "epoch": 3.904960124489399, "grad_norm": 1.3359375, "learning_rate": 0.0003540452490217699, "loss": 4.9748, "mean_token_accuracy": 0.21054288148880004, "num_tokens": 87059092.0, "step": 50190 }, { "entropy": 5.857463598251343, "epoch": 3.9053491538611165, "grad_norm": 1.34375, "learning_rate": 0.0003540192994713847, "loss": 4.9895, "mean_token_accuracy": 0.207786463201046, "num_tokens": 87067514.0, "step": 50195 }, { "entropy": 5.852554178237915, "epoch": 3.905738183232834, "grad_norm": 1.171875, "learning_rate": 0.00035399334872200747, "loss": 5.0545, "mean_token_accuracy": 0.20145612061023713, "num_tokens": 87077404.0, "step": 50200 }, { "entropy": 5.887202501296997, "epoch": 3.9061272126045514, "grad_norm": 1.4765625, "learning_rate": 0.0003539673967740318, "loss": 4.9758, "mean_token_accuracy": 0.20996606796979905, "num_tokens": 87086406.0, "step": 50205 }, { "entropy": 5.797400045394897, "epoch": 3.906516241976269, "grad_norm": 1.328125, "learning_rate": 0.0003539414436278516, "loss": 4.8319, "mean_token_accuracy": 0.21830499768257142, "num_tokens": 87095029.0, "step": 50210 }, { "entropy": 5.882325077056885, "epoch": 3.906905271347987, "grad_norm": 1.3359375, "learning_rate": 0.00035391548928386077, "loss": 4.9769, "mean_token_accuracy": 0.21221245527267457, "num_tokens": 87104412.0, "step": 50215 }, { "entropy": 5.824559354782105, "epoch": 3.9072943007197045, "grad_norm": 1.3828125, "learning_rate": 0.0003538895337424529, "loss": 4.9514, "mean_token_accuracy": 0.21592774242162704, "num_tokens": 87113383.0, "step": 50220 }, { "entropy": 5.864041423797607, "epoch": 3.9076833300914218, "grad_norm": 1.4140625, "learning_rate": 0.00035386357700402187, "loss": 4.9673, "mean_token_accuracy": 0.21227518916130067, "num_tokens": 87121150.0, "step": 50225 }, { "entropy": 5.762804794311523, "epoch": 3.9080723594631395, "grad_norm": 1.2265625, "learning_rate": 0.0003538376190689616, "loss": 4.913, "mean_token_accuracy": 0.21356281489133835, "num_tokens": 87129828.0, "step": 50230 }, { "entropy": 5.8977819919586185, "epoch": 3.908461388834857, "grad_norm": 1.3125, "learning_rate": 0.0003538116599376661, "loss": 5.0118, "mean_token_accuracy": 0.2103077471256256, "num_tokens": 87138618.0, "step": 50235 }, { "entropy": 5.85614857673645, "epoch": 3.9088504182065744, "grad_norm": 1.3671875, "learning_rate": 0.00035378569961052887, "loss": 4.9593, "mean_token_accuracy": 0.20946453064680098, "num_tokens": 87147576.0, "step": 50240 }, { "entropy": 5.867601442337036, "epoch": 3.909239447578292, "grad_norm": 1.375, "learning_rate": 0.00035375973808794416, "loss": 4.8995, "mean_token_accuracy": 0.21714259684085846, "num_tokens": 87156067.0, "step": 50245 }, { "entropy": 5.840759706497193, "epoch": 3.90962847695001, "grad_norm": 1.3671875, "learning_rate": 0.0003537337753703058, "loss": 4.9441, "mean_token_accuracy": 0.21185347586870193, "num_tokens": 87164127.0, "step": 50250 }, { "entropy": 5.812650203704834, "epoch": 3.9100175063217275, "grad_norm": 1.4296875, "learning_rate": 0.0003537078114580077, "loss": 4.9577, "mean_token_accuracy": 0.21386137008666992, "num_tokens": 87172143.0, "step": 50255 }, { "entropy": 5.770189428329468, "epoch": 3.9104065356934448, "grad_norm": 1.453125, "learning_rate": 0.0003536818463514438, "loss": 4.9703, "mean_token_accuracy": 0.20575565695762635, "num_tokens": 87180565.0, "step": 50260 }, { "entropy": 5.838504695892334, "epoch": 3.9107955650651625, "grad_norm": 1.265625, "learning_rate": 0.00035365588005100817, "loss": 4.9634, "mean_token_accuracy": 0.21423009932041168, "num_tokens": 87189589.0, "step": 50265 }, { "entropy": 5.818747806549072, "epoch": 3.9111845944368797, "grad_norm": 1.3203125, "learning_rate": 0.0003536299125570947, "loss": 4.947, "mean_token_accuracy": 0.2088731735944748, "num_tokens": 87197730.0, "step": 50270 }, { "entropy": 5.784960031509399, "epoch": 3.9115736238085974, "grad_norm": 1.28125, "learning_rate": 0.0003536039438700975, "loss": 4.987, "mean_token_accuracy": 0.2069752722978592, "num_tokens": 87206558.0, "step": 50275 }, { "entropy": 5.819164180755616, "epoch": 3.911962653180315, "grad_norm": 1.3828125, "learning_rate": 0.00035357797399041056, "loss": 4.9172, "mean_token_accuracy": 0.21423240900039672, "num_tokens": 87215250.0, "step": 50280 }, { "entropy": 5.852763366699219, "epoch": 3.912351682552033, "grad_norm": 1.3515625, "learning_rate": 0.0003535520029184279, "loss": 5.0218, "mean_token_accuracy": 0.20311967581510543, "num_tokens": 87223964.0, "step": 50285 }, { "entropy": 5.8105058670043945, "epoch": 3.9127407119237505, "grad_norm": 1.3828125, "learning_rate": 0.0003535260306545437, "loss": 4.9399, "mean_token_accuracy": 0.20938710123300552, "num_tokens": 87232988.0, "step": 50290 }, { "entropy": 5.865932607650757, "epoch": 3.9131297412954678, "grad_norm": 1.4375, "learning_rate": 0.00035350005719915196, "loss": 4.9782, "mean_token_accuracy": 0.21497756540775298, "num_tokens": 87241582.0, "step": 50295 }, { "entropy": 5.822469711303711, "epoch": 3.9135187706671855, "grad_norm": 1.3671875, "learning_rate": 0.00035347408255264674, "loss": 4.9638, "mean_token_accuracy": 0.2128775492310524, "num_tokens": 87249963.0, "step": 50300 }, { "entropy": 5.847865104675293, "epoch": 3.9139078000389027, "grad_norm": 1.296875, "learning_rate": 0.0003534481067154223, "loss": 5.0532, "mean_token_accuracy": 0.2028522565960884, "num_tokens": 87258825.0, "step": 50305 }, { "entropy": 5.795261812210083, "epoch": 3.9142968294106204, "grad_norm": 1.2109375, "learning_rate": 0.0003534221296878726, "loss": 4.878, "mean_token_accuracy": 0.21622084677219391, "num_tokens": 87268335.0, "step": 50310 }, { "entropy": 5.879649639129639, "epoch": 3.914685858782338, "grad_norm": 1.3515625, "learning_rate": 0.00035339615147039196, "loss": 5.0171, "mean_token_accuracy": 0.20854121595621108, "num_tokens": 87276404.0, "step": 50315 }, { "entropy": 5.885884141921997, "epoch": 3.915074888154056, "grad_norm": 1.25, "learning_rate": 0.00035337017206337444, "loss": 5.0359, "mean_token_accuracy": 0.20820137709379197, "num_tokens": 87285735.0, "step": 50320 }, { "entropy": 5.913195037841797, "epoch": 3.915463917525773, "grad_norm": 1.40625, "learning_rate": 0.0003533441914672144, "loss": 5.0593, "mean_token_accuracy": 0.20526523292064666, "num_tokens": 87295030.0, "step": 50325 }, { "entropy": 5.867482900619507, "epoch": 3.9158529468974907, "grad_norm": 1.375, "learning_rate": 0.00035331820968230595, "loss": 5.0191, "mean_token_accuracy": 0.20309984236955642, "num_tokens": 87303530.0, "step": 50330 }, { "entropy": 5.854580640792847, "epoch": 3.9162419762692084, "grad_norm": 1.296875, "learning_rate": 0.00035329222670904325, "loss": 4.9694, "mean_token_accuracy": 0.21145646423101425, "num_tokens": 87312484.0, "step": 50335 }, { "entropy": 5.817336988449097, "epoch": 3.9166310056409257, "grad_norm": 2.1875, "learning_rate": 0.0003532662425478206, "loss": 4.8774, "mean_token_accuracy": 0.22226296365261078, "num_tokens": 87321978.0, "step": 50340 }, { "entropy": 5.814772844314575, "epoch": 3.9170200350126434, "grad_norm": 1.4140625, "learning_rate": 0.00035324025719903236, "loss": 4.9372, "mean_token_accuracy": 0.21494407951831818, "num_tokens": 87330819.0, "step": 50345 }, { "entropy": 5.8816934585571286, "epoch": 3.917409064384361, "grad_norm": 1.4296875, "learning_rate": 0.00035321427066307276, "loss": 4.9787, "mean_token_accuracy": 0.20901056081056596, "num_tokens": 87338799.0, "step": 50350 }, { "entropy": 5.838096761703492, "epoch": 3.917798093756079, "grad_norm": 1.3359375, "learning_rate": 0.0003531882829403361, "loss": 4.9575, "mean_token_accuracy": 0.21320050954818726, "num_tokens": 87347317.0, "step": 50355 }, { "entropy": 5.799908828735352, "epoch": 3.918187123127796, "grad_norm": 1.328125, "learning_rate": 0.00035316229403121666, "loss": 4.9025, "mean_token_accuracy": 0.21220894753932953, "num_tokens": 87355742.0, "step": 50360 }, { "entropy": 5.805998086929321, "epoch": 3.9185761524995137, "grad_norm": 1.3828125, "learning_rate": 0.0003531363039361088, "loss": 4.8938, "mean_token_accuracy": 0.21865929216146468, "num_tokens": 87364774.0, "step": 50365 }, { "entropy": 5.8032721996307375, "epoch": 3.9189651818712314, "grad_norm": 1.3125, "learning_rate": 0.00035311031265540695, "loss": 4.9218, "mean_token_accuracy": 0.21041710972785949, "num_tokens": 87373799.0, "step": 50370 }, { "entropy": 5.887723827362061, "epoch": 3.9193542112429487, "grad_norm": 1.3203125, "learning_rate": 0.00035308432018950537, "loss": 4.9935, "mean_token_accuracy": 0.20953630656003952, "num_tokens": 87382732.0, "step": 50375 }, { "entropy": 5.859270477294922, "epoch": 3.9197432406146664, "grad_norm": 1.328125, "learning_rate": 0.00035305832653879856, "loss": 4.9407, "mean_token_accuracy": 0.20847305357456208, "num_tokens": 87391452.0, "step": 50380 }, { "entropy": 5.837453317642212, "epoch": 3.920132269986384, "grad_norm": 1.265625, "learning_rate": 0.00035303233170368083, "loss": 4.8687, "mean_token_accuracy": 0.21647530794143677, "num_tokens": 87399998.0, "step": 50385 }, { "entropy": 5.877296352386475, "epoch": 3.920521299358102, "grad_norm": 1.3671875, "learning_rate": 0.00035300633568454673, "loss": 4.9357, "mean_token_accuracy": 0.2190970942378044, "num_tokens": 87408558.0, "step": 50390 }, { "entropy": 5.798892831802368, "epoch": 3.920910328729819, "grad_norm": 1.3671875, "learning_rate": 0.00035298033848179064, "loss": 4.9063, "mean_token_accuracy": 0.21400791704654692, "num_tokens": 87416715.0, "step": 50395 }, { "entropy": 5.84766263961792, "epoch": 3.9212993581015367, "grad_norm": 1.3828125, "learning_rate": 0.000352954340095807, "loss": 4.9888, "mean_token_accuracy": 0.2022629678249359, "num_tokens": 87425036.0, "step": 50400 }, { "entropy": 5.789225673675537, "epoch": 3.921688387473254, "grad_norm": 1.2578125, "learning_rate": 0.00035292834052699036, "loss": 4.9156, "mean_token_accuracy": 0.21825195401906966, "num_tokens": 87433732.0, "step": 50405 }, { "entropy": 5.8573681831359865, "epoch": 3.9220774168449717, "grad_norm": 1.2578125, "learning_rate": 0.0003529023397757351, "loss": 4.9736, "mean_token_accuracy": 0.2049235463142395, "num_tokens": 87443088.0, "step": 50410 }, { "entropy": 5.773188209533691, "epoch": 3.9224664462166894, "grad_norm": 1.375, "learning_rate": 0.00035287633784243595, "loss": 4.9659, "mean_token_accuracy": 0.21383998841047286, "num_tokens": 87452568.0, "step": 50415 }, { "entropy": 5.8922370910644535, "epoch": 3.922855475588407, "grad_norm": 1.5546875, "learning_rate": 0.00035285033472748725, "loss": 4.9548, "mean_token_accuracy": 0.2167195722460747, "num_tokens": 87460524.0, "step": 50420 }, { "entropy": 5.813318347930908, "epoch": 3.9232445049601243, "grad_norm": 1.3125, "learning_rate": 0.0003528243304312837, "loss": 4.9089, "mean_token_accuracy": 0.2119239166378975, "num_tokens": 87469863.0, "step": 50425 }, { "entropy": 5.826010227203369, "epoch": 3.923633534331842, "grad_norm": 1.359375, "learning_rate": 0.0003527983249542197, "loss": 5.0001, "mean_token_accuracy": 0.1991504520177841, "num_tokens": 87478026.0, "step": 50430 }, { "entropy": 5.810401248931885, "epoch": 3.9240225637035597, "grad_norm": 1.1796875, "learning_rate": 0.00035277231829669006, "loss": 4.8978, "mean_token_accuracy": 0.21176282465457916, "num_tokens": 87487267.0, "step": 50435 }, { "entropy": 5.8285423755645756, "epoch": 3.924411593075277, "grad_norm": 1.3203125, "learning_rate": 0.0003527463104590892, "loss": 4.9647, "mean_token_accuracy": 0.20723945796489715, "num_tokens": 87496393.0, "step": 50440 }, { "entropy": 5.887448120117187, "epoch": 3.9248006224469947, "grad_norm": 1.4140625, "learning_rate": 0.0003527203014418119, "loss": 4.9683, "mean_token_accuracy": 0.2097357526421547, "num_tokens": 87504214.0, "step": 50445 }, { "entropy": 5.826976919174195, "epoch": 3.9251896518187124, "grad_norm": 1.359375, "learning_rate": 0.0003526942912452526, "loss": 4.9776, "mean_token_accuracy": 0.20684325098991393, "num_tokens": 87512837.0, "step": 50450 }, { "entropy": 5.834858798980713, "epoch": 3.92557868119043, "grad_norm": 1.28125, "learning_rate": 0.0003526682798698062, "loss": 4.9615, "mean_token_accuracy": 0.2075273260474205, "num_tokens": 87521107.0, "step": 50455 }, { "entropy": 5.838110637664795, "epoch": 3.9259677105621473, "grad_norm": 1.28125, "learning_rate": 0.0003526422673158673, "loss": 4.9259, "mean_token_accuracy": 0.21361607015132905, "num_tokens": 87530089.0, "step": 50460 }, { "entropy": 5.773072004318237, "epoch": 3.926356739933865, "grad_norm": 1.453125, "learning_rate": 0.0003526162535838305, "loss": 4.9683, "mean_token_accuracy": 0.21209748834371567, "num_tokens": 87539038.0, "step": 50465 }, { "entropy": 5.831792163848877, "epoch": 3.9267457693055827, "grad_norm": 1.4296875, "learning_rate": 0.00035259023867409065, "loss": 4.9793, "mean_token_accuracy": 0.2101265773177147, "num_tokens": 87547760.0, "step": 50470 }, { "entropy": 5.754550457000732, "epoch": 3.9271347986773, "grad_norm": 1.4296875, "learning_rate": 0.0003525642225870423, "loss": 4.8682, "mean_token_accuracy": 0.222468826174736, "num_tokens": 87556366.0, "step": 50475 }, { "entropy": 5.7899620056152346, "epoch": 3.9275238280490177, "grad_norm": 1.296875, "learning_rate": 0.00035253820532308043, "loss": 4.9172, "mean_token_accuracy": 0.21100423932075502, "num_tokens": 87564411.0, "step": 50480 }, { "entropy": 5.842006349563599, "epoch": 3.9279128574207354, "grad_norm": 1.3828125, "learning_rate": 0.0003525121868825997, "loss": 5.0058, "mean_token_accuracy": 0.20795863419771193, "num_tokens": 87572635.0, "step": 50485 }, { "entropy": 5.9257489204406735, "epoch": 3.928301886792453, "grad_norm": 1.3515625, "learning_rate": 0.0003524861672659949, "loss": 5.0312, "mean_token_accuracy": 0.2089160516858101, "num_tokens": 87580969.0, "step": 50490 }, { "entropy": 5.932268857955933, "epoch": 3.9286909161641703, "grad_norm": 1.359375, "learning_rate": 0.0003524601464736609, "loss": 5.0162, "mean_token_accuracy": 0.21564121544361115, "num_tokens": 87589477.0, "step": 50495 }, { "entropy": 5.909557342529297, "epoch": 3.929079945535888, "grad_norm": 1.328125, "learning_rate": 0.0003524341245059924, "loss": 5.0139, "mean_token_accuracy": 0.20403924137353896, "num_tokens": 87598047.0, "step": 50500 }, { "entropy": 5.802220392227173, "epoch": 3.9294689749076053, "grad_norm": 1.4140625, "learning_rate": 0.0003524081013633843, "loss": 4.9247, "mean_token_accuracy": 0.21648037880659105, "num_tokens": 87606591.0, "step": 50505 }, { "entropy": 5.840164756774902, "epoch": 3.929858004279323, "grad_norm": 1.3046875, "learning_rate": 0.00035238207704623147, "loss": 4.9596, "mean_token_accuracy": 0.21136913895606996, "num_tokens": 87615087.0, "step": 50510 }, { "entropy": 5.82448525428772, "epoch": 3.9302470336510407, "grad_norm": 1.2578125, "learning_rate": 0.00035235605155492885, "loss": 4.8848, "mean_token_accuracy": 0.21746322959661485, "num_tokens": 87623397.0, "step": 50515 }, { "entropy": 5.880098628997803, "epoch": 3.9306360630227584, "grad_norm": 1.53125, "learning_rate": 0.00035233002488987123, "loss": 4.9754, "mean_token_accuracy": 0.2122628077864647, "num_tokens": 87632064.0, "step": 50520 }, { "entropy": 5.851122140884399, "epoch": 3.9310250923944756, "grad_norm": 1.3828125, "learning_rate": 0.00035230399705145365, "loss": 4.9461, "mean_token_accuracy": 0.21467628628015517, "num_tokens": 87640300.0, "step": 50525 }, { "entropy": 5.811364603042603, "epoch": 3.9314141217661933, "grad_norm": 1.3203125, "learning_rate": 0.0003522779680400709, "loss": 4.9273, "mean_token_accuracy": 0.21206727623939514, "num_tokens": 87648691.0, "step": 50530 }, { "entropy": 5.875855159759522, "epoch": 3.931803151137911, "grad_norm": 1.3125, "learning_rate": 0.00035225193785611795, "loss": 4.9949, "mean_token_accuracy": 0.2076011285185814, "num_tokens": 87657306.0, "step": 50535 }, { "entropy": 5.79010648727417, "epoch": 3.9321921805096283, "grad_norm": 1.4453125, "learning_rate": 0.0003522259064999898, "loss": 4.9033, "mean_token_accuracy": 0.2164313480257988, "num_tokens": 87666347.0, "step": 50540 }, { "entropy": 5.793262100219726, "epoch": 3.932581209881346, "grad_norm": 1.4140625, "learning_rate": 0.00035219987397208137, "loss": 4.8634, "mean_token_accuracy": 0.22563455104827881, "num_tokens": 87674328.0, "step": 50545 }, { "entropy": 5.8699572563171385, "epoch": 3.9329702392530637, "grad_norm": 1.4375, "learning_rate": 0.0003521738402727878, "loss": 5.0051, "mean_token_accuracy": 0.2102842926979065, "num_tokens": 87682769.0, "step": 50550 }, { "entropy": 5.823321056365967, "epoch": 3.9333592686247814, "grad_norm": 1.3671875, "learning_rate": 0.0003521478054025041, "loss": 4.9078, "mean_token_accuracy": 0.21355315595865249, "num_tokens": 87691732.0, "step": 50555 }, { "entropy": 5.896574354171753, "epoch": 3.9337482979964986, "grad_norm": 1.40625, "learning_rate": 0.00035212176936162524, "loss": 5.0449, "mean_token_accuracy": 0.2064281240105629, "num_tokens": 87699634.0, "step": 50560 }, { "entropy": 5.846316003799439, "epoch": 3.9341373273682163, "grad_norm": 1.203125, "learning_rate": 0.0003520957321505462, "loss": 4.9539, "mean_token_accuracy": 0.21642001271247863, "num_tokens": 87708807.0, "step": 50565 }, { "entropy": 5.855564022064209, "epoch": 3.934526356739934, "grad_norm": 1.3828125, "learning_rate": 0.00035206969376966226, "loss": 5.0036, "mean_token_accuracy": 0.2092100828886032, "num_tokens": 87717338.0, "step": 50570 }, { "entropy": 5.821547269821167, "epoch": 3.9349153861116513, "grad_norm": 1.3671875, "learning_rate": 0.00035204365421936826, "loss": 4.9653, "mean_token_accuracy": 0.2109060063958168, "num_tokens": 87726021.0, "step": 50575 }, { "entropy": 5.825818395614624, "epoch": 3.935304415483369, "grad_norm": 1.34375, "learning_rate": 0.0003520176135000594, "loss": 4.8797, "mean_token_accuracy": 0.22389100044965743, "num_tokens": 87735023.0, "step": 50580 }, { "entropy": 5.858525514602661, "epoch": 3.9356934448550867, "grad_norm": 1.3828125, "learning_rate": 0.0003519915716121309, "loss": 4.9995, "mean_token_accuracy": 0.20615150034427643, "num_tokens": 87743220.0, "step": 50585 }, { "entropy": 5.860691785812378, "epoch": 3.9360824742268044, "grad_norm": 1.359375, "learning_rate": 0.0003519655285559779, "loss": 5.0217, "mean_token_accuracy": 0.21434687823057175, "num_tokens": 87751772.0, "step": 50590 }, { "entropy": 5.844260120391846, "epoch": 3.9364715035985216, "grad_norm": 1.34375, "learning_rate": 0.00035193948433199547, "loss": 4.9377, "mean_token_accuracy": 0.21392036229372025, "num_tokens": 87760518.0, "step": 50595 }, { "entropy": 5.929533338546753, "epoch": 3.9368605329702393, "grad_norm": 1.359375, "learning_rate": 0.00035191343894057885, "loss": 5.0612, "mean_token_accuracy": 0.20459677129983903, "num_tokens": 87768649.0, "step": 50600 }, { "entropy": 5.845632839202881, "epoch": 3.9372495623419566, "grad_norm": 1.3828125, "learning_rate": 0.00035188739238212316, "loss": 4.9321, "mean_token_accuracy": 0.21569954305887223, "num_tokens": 87776908.0, "step": 50605 }, { "entropy": 5.882026147842407, "epoch": 3.9376385917136743, "grad_norm": 1.375, "learning_rate": 0.0003518613446570237, "loss": 4.9991, "mean_token_accuracy": 0.21475882828235626, "num_tokens": 87785271.0, "step": 50610 }, { "entropy": 5.785317039489746, "epoch": 3.938027621085392, "grad_norm": 1.3125, "learning_rate": 0.00035183529576567567, "loss": 4.9539, "mean_token_accuracy": 0.21779724955558777, "num_tokens": 87794290.0, "step": 50615 }, { "entropy": 5.853997850418091, "epoch": 3.9384166504571096, "grad_norm": 1.359375, "learning_rate": 0.0003518092457084743, "loss": 4.9478, "mean_token_accuracy": 0.21409939974546432, "num_tokens": 87802574.0, "step": 50620 }, { "entropy": 5.883027219772339, "epoch": 3.9388056798288273, "grad_norm": 1.3984375, "learning_rate": 0.0003517831944858149, "loss": 4.9666, "mean_token_accuracy": 0.2075902223587036, "num_tokens": 87810825.0, "step": 50625 }, { "entropy": 5.745425367355347, "epoch": 3.9391947092005446, "grad_norm": 1.3125, "learning_rate": 0.00035175714209809275, "loss": 4.8943, "mean_token_accuracy": 0.2138733074069023, "num_tokens": 87818624.0, "step": 50630 }, { "entropy": 5.77688889503479, "epoch": 3.9395837385722623, "grad_norm": 1.4296875, "learning_rate": 0.0003517310885457032, "loss": 4.8889, "mean_token_accuracy": 0.2247217983007431, "num_tokens": 87826973.0, "step": 50635 }, { "entropy": 5.823399353027344, "epoch": 3.9399727679439795, "grad_norm": 1.2578125, "learning_rate": 0.0003517050338290414, "loss": 4.9444, "mean_token_accuracy": 0.21422916352748872, "num_tokens": 87835381.0, "step": 50640 }, { "entropy": 5.8388830661773685, "epoch": 3.9403617973156972, "grad_norm": 1.2890625, "learning_rate": 0.00035167897794850285, "loss": 4.9114, "mean_token_accuracy": 0.22009167373180388, "num_tokens": 87843898.0, "step": 50645 }, { "entropy": 5.817836713790894, "epoch": 3.940750826687415, "grad_norm": 1.4453125, "learning_rate": 0.00035165292090448287, "loss": 4.9428, "mean_token_accuracy": 0.20568664371967316, "num_tokens": 87852600.0, "step": 50650 }, { "entropy": 5.856058406829834, "epoch": 3.9411398560591326, "grad_norm": 1.4609375, "learning_rate": 0.00035162686269737676, "loss": 5.0387, "mean_token_accuracy": 0.2120719626545906, "num_tokens": 87860472.0, "step": 50655 }, { "entropy": 5.886384105682373, "epoch": 3.94152888543085, "grad_norm": 1.3125, "learning_rate": 0.00035160080332758006, "loss": 4.9335, "mean_token_accuracy": 0.20827173739671706, "num_tokens": 87869259.0, "step": 50660 }, { "entropy": 5.846927118301392, "epoch": 3.9419179148025676, "grad_norm": 1.390625, "learning_rate": 0.000351574742795488, "loss": 4.9936, "mean_token_accuracy": 0.21357918679714202, "num_tokens": 87877971.0, "step": 50665 }, { "entropy": 5.815457153320312, "epoch": 3.9423069441742853, "grad_norm": 1.3046875, "learning_rate": 0.0003515486811014962, "loss": 4.9619, "mean_token_accuracy": 0.20273015201091765, "num_tokens": 87886837.0, "step": 50670 }, { "entropy": 5.88142580986023, "epoch": 3.9426959735460025, "grad_norm": 1.4453125, "learning_rate": 0.0003515226182459999, "loss": 5.036, "mean_token_accuracy": 0.2064157798886299, "num_tokens": 87895971.0, "step": 50675 }, { "entropy": 5.8253381729125975, "epoch": 3.9430850029177202, "grad_norm": 1.28125, "learning_rate": 0.00035149655422939477, "loss": 4.9592, "mean_token_accuracy": 0.21240597665309907, "num_tokens": 87905096.0, "step": 50680 }, { "entropy": 5.88958511352539, "epoch": 3.943474032289438, "grad_norm": 1.3671875, "learning_rate": 0.0003514704890520761, "loss": 4.9882, "mean_token_accuracy": 0.2108414053916931, "num_tokens": 87914093.0, "step": 50685 }, { "entropy": 5.900439119338989, "epoch": 3.9438630616611556, "grad_norm": 1.3828125, "learning_rate": 0.0003514444227144395, "loss": 5.0498, "mean_token_accuracy": 0.2029083713889122, "num_tokens": 87922724.0, "step": 50690 }, { "entropy": 5.897398471832275, "epoch": 3.944252091032873, "grad_norm": 1.34375, "learning_rate": 0.0003514183552168804, "loss": 5.0551, "mean_token_accuracy": 0.20852955430746078, "num_tokens": 87932478.0, "step": 50695 }, { "entropy": 5.761565446853638, "epoch": 3.9446411204045906, "grad_norm": 1.4453125, "learning_rate": 0.00035139228655979457, "loss": 4.8826, "mean_token_accuracy": 0.22171662598848343, "num_tokens": 87941437.0, "step": 50700 }, { "entropy": 5.876450252532959, "epoch": 3.945030149776308, "grad_norm": 1.359375, "learning_rate": 0.00035136621674357717, "loss": 5.0052, "mean_token_accuracy": 0.2115311086177826, "num_tokens": 87950317.0, "step": 50705 }, { "entropy": 5.824373006820679, "epoch": 3.9454191791480255, "grad_norm": 1.3203125, "learning_rate": 0.0003513401457686242, "loss": 4.9719, "mean_token_accuracy": 0.21268172711133956, "num_tokens": 87958589.0, "step": 50710 }, { "entropy": 5.90805492401123, "epoch": 3.9458082085197432, "grad_norm": 1.3515625, "learning_rate": 0.00035131407363533083, "loss": 5.1167, "mean_token_accuracy": 0.20842700749635695, "num_tokens": 87967270.0, "step": 50715 }, { "entropy": 5.875395727157593, "epoch": 3.946197237891461, "grad_norm": 1.3046875, "learning_rate": 0.0003512880003440929, "loss": 4.9923, "mean_token_accuracy": 0.21161873489618302, "num_tokens": 87975460.0, "step": 50720 }, { "entropy": 5.888176345825196, "epoch": 3.9465862672631786, "grad_norm": 1.359375, "learning_rate": 0.0003512619258953061, "loss": 4.9786, "mean_token_accuracy": 0.21477845013141633, "num_tokens": 87984030.0, "step": 50725 }, { "entropy": 5.881440544128418, "epoch": 3.946975296634896, "grad_norm": 1.359375, "learning_rate": 0.0003512358502893658, "loss": 4.99, "mean_token_accuracy": 0.21567239612340927, "num_tokens": 87992080.0, "step": 50730 }, { "entropy": 5.86673936843872, "epoch": 3.9473643260066136, "grad_norm": 1.359375, "learning_rate": 0.000351209773526668, "loss": 4.9808, "mean_token_accuracy": 0.21959900557994844, "num_tokens": 88000718.0, "step": 50735 }, { "entropy": 5.8251190185546875, "epoch": 3.947753355378331, "grad_norm": 1.3046875, "learning_rate": 0.000351183695607608, "loss": 4.9109, "mean_token_accuracy": 0.2126056283712387, "num_tokens": 88008977.0, "step": 50740 }, { "entropy": 5.798488569259644, "epoch": 3.9481423847500485, "grad_norm": 1.421875, "learning_rate": 0.00035115761653258177, "loss": 4.9064, "mean_token_accuracy": 0.21691323816776276, "num_tokens": 88017071.0, "step": 50745 }, { "entropy": 5.8743188858032225, "epoch": 3.9485314141217662, "grad_norm": 1.3359375, "learning_rate": 0.00035113153630198494, "loss": 4.9985, "mean_token_accuracy": 0.20694128572940826, "num_tokens": 88025946.0, "step": 50750 }, { "entropy": 5.82512903213501, "epoch": 3.948920443493484, "grad_norm": 1.34375, "learning_rate": 0.0003511054549162132, "loss": 4.9184, "mean_token_accuracy": 0.2145151063799858, "num_tokens": 88033980.0, "step": 50755 }, { "entropy": 5.841487073898316, "epoch": 3.949309472865201, "grad_norm": 1.40625, "learning_rate": 0.00035107937237566233, "loss": 4.9732, "mean_token_accuracy": 0.20970526933670045, "num_tokens": 88043875.0, "step": 50760 }, { "entropy": 5.828063344955444, "epoch": 3.949698502236919, "grad_norm": 1.4375, "learning_rate": 0.0003510532886807281, "loss": 4.8797, "mean_token_accuracy": 0.21726407408714293, "num_tokens": 88052663.0, "step": 50765 }, { "entropy": 5.871134281158447, "epoch": 3.9500875316086366, "grad_norm": 1.3671875, "learning_rate": 0.0003510272038318062, "loss": 5.0092, "mean_token_accuracy": 0.20958467423915864, "num_tokens": 88061570.0, "step": 50770 }, { "entropy": 5.861721229553223, "epoch": 3.950476560980354, "grad_norm": 1.46875, "learning_rate": 0.0003510011178292925, "loss": 4.9322, "mean_token_accuracy": 0.21702828407287597, "num_tokens": 88069376.0, "step": 50775 }, { "entropy": 5.798763942718506, "epoch": 3.9508655903520715, "grad_norm": 1.328125, "learning_rate": 0.0003509750306735828, "loss": 4.8607, "mean_token_accuracy": 0.22440604716539383, "num_tokens": 88077433.0, "step": 50780 }, { "entropy": 5.8551311016082765, "epoch": 3.951254619723789, "grad_norm": 1.2734375, "learning_rate": 0.000350948942365073, "loss": 4.8696, "mean_token_accuracy": 0.22142754793167113, "num_tokens": 88086584.0, "step": 50785 }, { "entropy": 5.820428514480591, "epoch": 3.951643649095507, "grad_norm": 1.2890625, "learning_rate": 0.00035092285290415885, "loss": 5.0007, "mean_token_accuracy": 0.21440511345863342, "num_tokens": 88095409.0, "step": 50790 }, { "entropy": 5.791308927536011, "epoch": 3.952032678467224, "grad_norm": 1.4140625, "learning_rate": 0.0003508967622912362, "loss": 4.888, "mean_token_accuracy": 0.21174540966749192, "num_tokens": 88103396.0, "step": 50795 }, { "entropy": 5.850898122787475, "epoch": 3.952421707838942, "grad_norm": 1.2734375, "learning_rate": 0.00035087067052670115, "loss": 4.9974, "mean_token_accuracy": 0.21026038080453874, "num_tokens": 88112810.0, "step": 50800 }, { "entropy": 5.793637466430664, "epoch": 3.9528107372106596, "grad_norm": 1.40625, "learning_rate": 0.00035084457761094925, "loss": 4.9748, "mean_token_accuracy": 0.21419971585273742, "num_tokens": 88120363.0, "step": 50805 }, { "entropy": 5.80784912109375, "epoch": 3.953199766582377, "grad_norm": 1.328125, "learning_rate": 0.0003508184835443766, "loss": 4.8753, "mean_token_accuracy": 0.21590973436832428, "num_tokens": 88129397.0, "step": 50810 }, { "entropy": 5.898810005187988, "epoch": 3.9535887959540945, "grad_norm": 1.3125, "learning_rate": 0.00035079238832737926, "loss": 4.9813, "mean_token_accuracy": 0.21472312808036803, "num_tokens": 88137712.0, "step": 50815 }, { "entropy": 5.810152053833008, "epoch": 3.953977825325812, "grad_norm": 1.3359375, "learning_rate": 0.000350766291960353, "loss": 4.9382, "mean_token_accuracy": 0.21627353876829147, "num_tokens": 88146521.0, "step": 50820 }, { "entropy": 5.8618003845214846, "epoch": 3.95436685469753, "grad_norm": 1.2890625, "learning_rate": 0.0003507401944436939, "loss": 5.0563, "mean_token_accuracy": 0.20671270787715912, "num_tokens": 88155775.0, "step": 50825 }, { "entropy": 5.827570152282715, "epoch": 3.954755884069247, "grad_norm": 1.34375, "learning_rate": 0.0003507140957777979, "loss": 4.9578, "mean_token_accuracy": 0.21178185790777207, "num_tokens": 88164613.0, "step": 50830 }, { "entropy": 5.823754549026489, "epoch": 3.955144913440965, "grad_norm": 1.2734375, "learning_rate": 0.00035068799596306096, "loss": 4.9583, "mean_token_accuracy": 0.2201443701982498, "num_tokens": 88174014.0, "step": 50835 }, { "entropy": 5.851794815063476, "epoch": 3.955533942812682, "grad_norm": 1.3671875, "learning_rate": 0.0003506618949998791, "loss": 4.9953, "mean_token_accuracy": 0.20700625479221343, "num_tokens": 88182348.0, "step": 50840 }, { "entropy": 5.834593820571899, "epoch": 3.9559229721844, "grad_norm": 1.3203125, "learning_rate": 0.00035063579288864853, "loss": 4.9351, "mean_token_accuracy": 0.21633678823709487, "num_tokens": 88190754.0, "step": 50845 }, { "entropy": 5.796058416366577, "epoch": 3.9563120015561175, "grad_norm": 1.3046875, "learning_rate": 0.0003506096896297651, "loss": 4.9479, "mean_token_accuracy": 0.2126050278544426, "num_tokens": 88200008.0, "step": 50850 }, { "entropy": 5.721543169021606, "epoch": 3.956701030927835, "grad_norm": 1.34375, "learning_rate": 0.00035058358522362505, "loss": 4.8738, "mean_token_accuracy": 0.2185722529888153, "num_tokens": 88208597.0, "step": 50855 }, { "entropy": 5.759484052658081, "epoch": 3.9570900602995525, "grad_norm": 1.296875, "learning_rate": 0.00035055747967062433, "loss": 4.9323, "mean_token_accuracy": 0.20800039023160935, "num_tokens": 88218243.0, "step": 50860 }, { "entropy": 5.749777841567993, "epoch": 3.95747908967127, "grad_norm": 1.3515625, "learning_rate": 0.0003505313729711592, "loss": 4.8045, "mean_token_accuracy": 0.22602923214435577, "num_tokens": 88227028.0, "step": 50865 }, { "entropy": 5.873627519607544, "epoch": 3.957868119042988, "grad_norm": 1.21875, "learning_rate": 0.00035050526512562564, "loss": 5.0661, "mean_token_accuracy": 0.21386022865772247, "num_tokens": 88236294.0, "step": 50870 }, { "entropy": 5.831891632080078, "epoch": 3.958257148414705, "grad_norm": 1.3046875, "learning_rate": 0.0003504791561344199, "loss": 5.0251, "mean_token_accuracy": 0.1973951056599617, "num_tokens": 88245067.0, "step": 50875 }, { "entropy": 5.776224040985108, "epoch": 3.958646177786423, "grad_norm": 1.2734375, "learning_rate": 0.00035045304599793807, "loss": 4.9065, "mean_token_accuracy": 0.2153935581445694, "num_tokens": 88253913.0, "step": 50880 }, { "entropy": 5.8396214008331295, "epoch": 3.9590352071581405, "grad_norm": 1.3359375, "learning_rate": 0.00035042693471657637, "loss": 5.0111, "mean_token_accuracy": 0.20966139286756516, "num_tokens": 88262574.0, "step": 50885 }, { "entropy": 5.8632604598999025, "epoch": 3.959424236529858, "grad_norm": 1.4453125, "learning_rate": 0.00035040082229073096, "loss": 5.0547, "mean_token_accuracy": 0.20820428431034088, "num_tokens": 88271128.0, "step": 50890 }, { "entropy": 5.744044399261474, "epoch": 3.9598132659015755, "grad_norm": 1.25, "learning_rate": 0.0003503747087207981, "loss": 4.8029, "mean_token_accuracy": 0.22177897691726683, "num_tokens": 88280087.0, "step": 50895 }, { "entropy": 5.844356918334961, "epoch": 3.960202295273293, "grad_norm": 1.421875, "learning_rate": 0.00035034859400717407, "loss": 4.8844, "mean_token_accuracy": 0.22156779170036317, "num_tokens": 88289816.0, "step": 50900 }, { "entropy": 5.845784282684326, "epoch": 3.960591324645011, "grad_norm": 1.265625, "learning_rate": 0.00035032247815025504, "loss": 5.0221, "mean_token_accuracy": 0.2092660114169121, "num_tokens": 88298985.0, "step": 50905 }, { "entropy": 5.849870586395264, "epoch": 3.960980354016728, "grad_norm": 1.3828125, "learning_rate": 0.00035029636115043724, "loss": 4.9329, "mean_token_accuracy": 0.2189180448651314, "num_tokens": 88307978.0, "step": 50910 }, { "entropy": 5.835524415969848, "epoch": 3.961369383388446, "grad_norm": 1.3046875, "learning_rate": 0.00035027024300811707, "loss": 4.951, "mean_token_accuracy": 0.21559546887874603, "num_tokens": 88317177.0, "step": 50915 }, { "entropy": 5.939777755737305, "epoch": 3.9617584127601635, "grad_norm": 1.4609375, "learning_rate": 0.0003502441237236907, "loss": 5.0607, "mean_token_accuracy": 0.20750205218791962, "num_tokens": 88326490.0, "step": 50920 }, { "entropy": 5.945244836807251, "epoch": 3.962147442131881, "grad_norm": 1.2890625, "learning_rate": 0.0003502180032975545, "loss": 5.0363, "mean_token_accuracy": 0.20755604952573775, "num_tokens": 88335282.0, "step": 50925 }, { "entropy": 5.916828536987305, "epoch": 3.9625364715035984, "grad_norm": 1.375, "learning_rate": 0.0003501918817301049, "loss": 5.0725, "mean_token_accuracy": 0.20322464108467103, "num_tokens": 88343982.0, "step": 50930 }, { "entropy": 5.867155504226685, "epoch": 3.962925500875316, "grad_norm": 1.2578125, "learning_rate": 0.00035016575902173814, "loss": 4.9577, "mean_token_accuracy": 0.2092261791229248, "num_tokens": 88352961.0, "step": 50935 }, { "entropy": 5.860633707046508, "epoch": 3.9633145302470334, "grad_norm": 1.328125, "learning_rate": 0.00035013963517285064, "loss": 4.9606, "mean_token_accuracy": 0.21924693137407303, "num_tokens": 88361493.0, "step": 50940 }, { "entropy": 5.921890068054199, "epoch": 3.963703559618751, "grad_norm": 1.4765625, "learning_rate": 0.00035011351018383874, "loss": 5.1032, "mean_token_accuracy": 0.20723384767770767, "num_tokens": 88370028.0, "step": 50945 }, { "entropy": 5.808373165130615, "epoch": 3.964092588990469, "grad_norm": 1.3671875, "learning_rate": 0.0003500873840550989, "loss": 4.9968, "mean_token_accuracy": 0.21157557219266893, "num_tokens": 88378898.0, "step": 50950 }, { "entropy": 5.7234419822692875, "epoch": 3.9644816183621865, "grad_norm": 1.328125, "learning_rate": 0.00035006125678702755, "loss": 4.8368, "mean_token_accuracy": 0.2266736462712288, "num_tokens": 88388156.0, "step": 50955 }, { "entropy": 5.824250221252441, "epoch": 3.964870647733904, "grad_norm": 1.421875, "learning_rate": 0.00035003512838002103, "loss": 4.9467, "mean_token_accuracy": 0.2126452937722206, "num_tokens": 88396719.0, "step": 50960 }, { "entropy": 5.896205711364746, "epoch": 3.9652596771056214, "grad_norm": 1.421875, "learning_rate": 0.0003500089988344759, "loss": 4.9801, "mean_token_accuracy": 0.20772356688976287, "num_tokens": 88405182.0, "step": 50965 }, { "entropy": 5.828327083587647, "epoch": 3.965648706477339, "grad_norm": 1.3359375, "learning_rate": 0.00034998286815078855, "loss": 4.8909, "mean_token_accuracy": 0.20948072522878647, "num_tokens": 88413217.0, "step": 50970 }, { "entropy": 5.8466249942779545, "epoch": 3.9660377358490564, "grad_norm": 1.390625, "learning_rate": 0.00034995673632935557, "loss": 4.9951, "mean_token_accuracy": 0.21243406534194947, "num_tokens": 88421969.0, "step": 50975 }, { "entropy": 5.885087728500366, "epoch": 3.966426765220774, "grad_norm": 1.4375, "learning_rate": 0.0003499306033705735, "loss": 5.0333, "mean_token_accuracy": 0.20867812633514404, "num_tokens": 88430160.0, "step": 50980 }, { "entropy": 5.783443927764893, "epoch": 3.966815794592492, "grad_norm": 1.3515625, "learning_rate": 0.00034990446927483877, "loss": 4.9474, "mean_token_accuracy": 0.21522145718336105, "num_tokens": 88437890.0, "step": 50985 }, { "entropy": 5.796192073822022, "epoch": 3.9672048239642095, "grad_norm": 1.3125, "learning_rate": 0.0003498783340425479, "loss": 4.9999, "mean_token_accuracy": 0.21186937242746354, "num_tokens": 88446697.0, "step": 50990 }, { "entropy": 5.7997900485992435, "epoch": 3.9675938533359267, "grad_norm": 1.2421875, "learning_rate": 0.00034985219767409747, "loss": 4.8731, "mean_token_accuracy": 0.21808050572872162, "num_tokens": 88455925.0, "step": 50995 }, { "entropy": 5.873678588867188, "epoch": 3.9679828827076444, "grad_norm": 1.40625, "learning_rate": 0.00034982606016988407, "loss": 5.0077, "mean_token_accuracy": 0.21324298679828643, "num_tokens": 88464534.0, "step": 51000 }, { "epoch": 3.9679828827076444, "eval_entropy": 5.547831045009404, "eval_loss": 5.045764923095703, "eval_mean_token_accuracy": 0.2179427005085266, "eval_num_tokens": 88464534.0, "eval_runtime": 21.6407, "eval_samples_per_second": 1920.36, "eval_steps_per_second": 240.057, "step": 51000 }, { "entropy": 5.849541330337525, "epoch": 3.968371912079362, "grad_norm": 1.390625, "learning_rate": 0.00034979992153030424, "loss": 4.9207, "mean_token_accuracy": 0.21181644648313522, "num_tokens": 88471931.0, "step": 51005 }, { "entropy": 5.824969100952148, "epoch": 3.9687609414510794, "grad_norm": 1.3359375, "learning_rate": 0.0003497737817557548, "loss": 4.9322, "mean_token_accuracy": 0.21495094746351243, "num_tokens": 88480075.0, "step": 51010 }, { "entropy": 5.772866535186767, "epoch": 3.969149970822797, "grad_norm": 1.328125, "learning_rate": 0.00034974764084663213, "loss": 4.9332, "mean_token_accuracy": 0.2108161985874176, "num_tokens": 88488309.0, "step": 51015 }, { "entropy": 5.741270637512207, "epoch": 3.9695390001945148, "grad_norm": 1.3203125, "learning_rate": 0.00034972149880333316, "loss": 4.8304, "mean_token_accuracy": 0.21947142034769057, "num_tokens": 88497224.0, "step": 51020 }, { "entropy": 5.799672842025757, "epoch": 3.9699280295662325, "grad_norm": 1.234375, "learning_rate": 0.0003496953556262542, "loss": 4.9255, "mean_token_accuracy": 0.2100339263677597, "num_tokens": 88505980.0, "step": 51025 }, { "entropy": 5.834133958816528, "epoch": 3.9703170589379497, "grad_norm": 1.3125, "learning_rate": 0.00034966921131579216, "loss": 5.05, "mean_token_accuracy": 0.20662824511528016, "num_tokens": 88514904.0, "step": 51030 }, { "entropy": 5.711294794082642, "epoch": 3.9707060883096674, "grad_norm": 1.2734375, "learning_rate": 0.00034964306587234367, "loss": 4.8592, "mean_token_accuracy": 0.22056640535593033, "num_tokens": 88523456.0, "step": 51035 }, { "entropy": 5.768588924407959, "epoch": 3.9710951176813847, "grad_norm": 1.296875, "learning_rate": 0.00034961691929630544, "loss": 4.8825, "mean_token_accuracy": 0.22635228782892228, "num_tokens": 88532668.0, "step": 51040 }, { "entropy": 5.914878892898559, "epoch": 3.9714841470531024, "grad_norm": 1.390625, "learning_rate": 0.0003495907715880743, "loss": 5.0818, "mean_token_accuracy": 0.205003023147583, "num_tokens": 88541476.0, "step": 51045 }, { "entropy": 5.837304162979126, "epoch": 3.97187317642482, "grad_norm": 1.3828125, "learning_rate": 0.0003495646227480469, "loss": 4.9667, "mean_token_accuracy": 0.21270519942045213, "num_tokens": 88549166.0, "step": 51050 }, { "entropy": 5.848220109939575, "epoch": 3.9722622057965378, "grad_norm": 1.265625, "learning_rate": 0.00034953847277662, "loss": 4.9031, "mean_token_accuracy": 0.21996228992938996, "num_tokens": 88557380.0, "step": 51055 }, { "entropy": 5.85033278465271, "epoch": 3.9726512351682555, "grad_norm": 1.3984375, "learning_rate": 0.00034951232167419044, "loss": 4.9964, "mean_token_accuracy": 0.210194730758667, "num_tokens": 88565574.0, "step": 51060 }, { "entropy": 5.776845073699951, "epoch": 3.9730402645399727, "grad_norm": 1.234375, "learning_rate": 0.00034948616944115504, "loss": 4.8866, "mean_token_accuracy": 0.21639368534088135, "num_tokens": 88574590.0, "step": 51065 }, { "entropy": 5.806481075286865, "epoch": 3.9734292939116904, "grad_norm": 1.296875, "learning_rate": 0.0003494600160779105, "loss": 4.8774, "mean_token_accuracy": 0.22332187443971635, "num_tokens": 88583399.0, "step": 51070 }, { "entropy": 5.835177087783814, "epoch": 3.9738183232834077, "grad_norm": 1.3125, "learning_rate": 0.0003494338615848537, "loss": 4.9835, "mean_token_accuracy": 0.2042484775185585, "num_tokens": 88592204.0, "step": 51075 }, { "entropy": 5.836013412475586, "epoch": 3.9742073526551254, "grad_norm": 1.359375, "learning_rate": 0.0003494077059623816, "loss": 4.9478, "mean_token_accuracy": 0.2080878034234047, "num_tokens": 88600813.0, "step": 51080 }, { "entropy": 5.792112112045288, "epoch": 3.974596382026843, "grad_norm": 1.21875, "learning_rate": 0.00034938154921089097, "loss": 4.8856, "mean_token_accuracy": 0.21374749690294265, "num_tokens": 88609053.0, "step": 51085 }, { "entropy": 5.754729080200195, "epoch": 3.9749854113985608, "grad_norm": 1.203125, "learning_rate": 0.0003493553913307788, "loss": 4.8783, "mean_token_accuracy": 0.21573700606822968, "num_tokens": 88618058.0, "step": 51090 }, { "entropy": 5.799743604660034, "epoch": 3.975374440770278, "grad_norm": 1.4375, "learning_rate": 0.00034932923232244183, "loss": 4.9082, "mean_token_accuracy": 0.21854064017534255, "num_tokens": 88626379.0, "step": 51095 }, { "entropy": 5.839680814743042, "epoch": 3.9757634701419957, "grad_norm": 1.3984375, "learning_rate": 0.00034930307218627706, "loss": 5.0634, "mean_token_accuracy": 0.2054445654153824, "num_tokens": 88635140.0, "step": 51100 }, { "entropy": 5.861330127716064, "epoch": 3.9761524995137134, "grad_norm": 1.4140625, "learning_rate": 0.0003492769109226815, "loss": 4.9926, "mean_token_accuracy": 0.2038085028529167, "num_tokens": 88643409.0, "step": 51105 }, { "entropy": 5.843652009963989, "epoch": 3.9765415288854307, "grad_norm": 1.4609375, "learning_rate": 0.00034925074853205194, "loss": 4.9551, "mean_token_accuracy": 0.21273493468761445, "num_tokens": 88651945.0, "step": 51110 }, { "entropy": 5.7568892478942875, "epoch": 3.9769305582571484, "grad_norm": 1.3515625, "learning_rate": 0.00034922458501478556, "loss": 4.9276, "mean_token_accuracy": 0.21843539029359818, "num_tokens": 88660251.0, "step": 51115 }, { "entropy": 5.8088569164276125, "epoch": 3.977319587628866, "grad_norm": 1.3359375, "learning_rate": 0.0003491984203712792, "loss": 5.0079, "mean_token_accuracy": 0.21132795065641402, "num_tokens": 88669873.0, "step": 51120 }, { "entropy": 5.8370973587036135, "epoch": 3.9777086170005838, "grad_norm": 1.3359375, "learning_rate": 0.0003491722546019299, "loss": 4.9454, "mean_token_accuracy": 0.21427838057279586, "num_tokens": 88678242.0, "step": 51125 }, { "entropy": 5.857473087310791, "epoch": 3.978097646372301, "grad_norm": 1.3359375, "learning_rate": 0.0003491460877071347, "loss": 5.0085, "mean_token_accuracy": 0.20006311535835267, "num_tokens": 88687719.0, "step": 51130 }, { "entropy": 5.845373916625976, "epoch": 3.9784866757440187, "grad_norm": 1.3359375, "learning_rate": 0.0003491199196872906, "loss": 4.9986, "mean_token_accuracy": 0.20765304565429688, "num_tokens": 88696404.0, "step": 51135 }, { "entropy": 5.792873334884644, "epoch": 3.978875705115736, "grad_norm": 1.234375, "learning_rate": 0.0003490937505427947, "loss": 4.9297, "mean_token_accuracy": 0.21261902898550034, "num_tokens": 88705093.0, "step": 51140 }, { "entropy": 5.858883810043335, "epoch": 3.9792647344874537, "grad_norm": 1.234375, "learning_rate": 0.0003490675802740441, "loss": 4.9714, "mean_token_accuracy": 0.214150370657444, "num_tokens": 88713856.0, "step": 51145 }, { "entropy": 5.805819511413574, "epoch": 3.9796537638591714, "grad_norm": 1.359375, "learning_rate": 0.0003490414088814359, "loss": 4.9489, "mean_token_accuracy": 0.2161180078983307, "num_tokens": 88722146.0, "step": 51150 }, { "entropy": 5.8179765224456785, "epoch": 3.980042793230889, "grad_norm": 1.359375, "learning_rate": 0.0003490152363653671, "loss": 4.9973, "mean_token_accuracy": 0.213023342192173, "num_tokens": 88730406.0, "step": 51155 }, { "entropy": 5.7867677211761475, "epoch": 3.9804318226026068, "grad_norm": 1.296875, "learning_rate": 0.0003489890627262349, "loss": 4.79, "mean_token_accuracy": 0.22346812784671782, "num_tokens": 88738859.0, "step": 51160 }, { "entropy": 5.862732648849487, "epoch": 3.980820851974324, "grad_norm": 1.3515625, "learning_rate": 0.00034896288796443654, "loss": 5.0144, "mean_token_accuracy": 0.2084744542837143, "num_tokens": 88748111.0, "step": 51165 }, { "entropy": 5.875566244125366, "epoch": 3.9812098813460417, "grad_norm": 1.3046875, "learning_rate": 0.00034893671208036895, "loss": 5.0262, "mean_token_accuracy": 0.20833839178085328, "num_tokens": 88757127.0, "step": 51170 }, { "entropy": 5.926524829864502, "epoch": 3.981598910717759, "grad_norm": 1.4296875, "learning_rate": 0.00034891053507442944, "loss": 4.9819, "mean_token_accuracy": 0.2051755055785179, "num_tokens": 88765245.0, "step": 51175 }, { "entropy": 5.910472059249878, "epoch": 3.9819879400894767, "grad_norm": 1.4375, "learning_rate": 0.0003488843569470153, "loss": 5.0258, "mean_token_accuracy": 0.21403139382600783, "num_tokens": 88773482.0, "step": 51180 }, { "entropy": 5.906291532516479, "epoch": 3.9823769694611943, "grad_norm": 1.359375, "learning_rate": 0.00034885817769852355, "loss": 4.9854, "mean_token_accuracy": 0.21241040527820587, "num_tokens": 88782460.0, "step": 51185 }, { "entropy": 5.846720504760742, "epoch": 3.982765998832912, "grad_norm": 1.4140625, "learning_rate": 0.00034883199732935156, "loss": 4.9434, "mean_token_accuracy": 0.21643432825803757, "num_tokens": 88790713.0, "step": 51190 }, { "entropy": 5.855817794799805, "epoch": 3.9831550282046293, "grad_norm": 1.34375, "learning_rate": 0.00034880581583989655, "loss": 4.9404, "mean_token_accuracy": 0.21255779266357422, "num_tokens": 88800064.0, "step": 51195 }, { "entropy": 5.846401739120483, "epoch": 3.983544057576347, "grad_norm": 1.359375, "learning_rate": 0.0003487796332305557, "loss": 4.8919, "mean_token_accuracy": 0.22346543222665788, "num_tokens": 88808748.0, "step": 51200 }, { "entropy": 5.925779676437378, "epoch": 3.9839330869480647, "grad_norm": 1.2734375, "learning_rate": 0.00034875344950172635, "loss": 5.0065, "mean_token_accuracy": 0.20597105324268342, "num_tokens": 88817344.0, "step": 51205 }, { "entropy": 5.814324617385864, "epoch": 3.984322116319782, "grad_norm": 1.3515625, "learning_rate": 0.0003487272646538058, "loss": 4.959, "mean_token_accuracy": 0.2189730554819107, "num_tokens": 88825916.0, "step": 51210 }, { "entropy": 5.813282012939453, "epoch": 3.9847111456914996, "grad_norm": 1.4375, "learning_rate": 0.00034870107868719135, "loss": 4.9704, "mean_token_accuracy": 0.2130565568804741, "num_tokens": 88834607.0, "step": 51215 }, { "entropy": 5.831885623931885, "epoch": 3.9851001750632173, "grad_norm": 1.375, "learning_rate": 0.0003486748916022804, "loss": 4.9298, "mean_token_accuracy": 0.2152194157242775, "num_tokens": 88843224.0, "step": 51220 }, { "entropy": 5.807802295684814, "epoch": 3.985489204434935, "grad_norm": 1.40625, "learning_rate": 0.0003486487033994702, "loss": 4.9392, "mean_token_accuracy": 0.22114470452070237, "num_tokens": 88851732.0, "step": 51225 }, { "entropy": 5.792023754119873, "epoch": 3.9858782338066523, "grad_norm": 1.3046875, "learning_rate": 0.00034862251407915813, "loss": 4.9359, "mean_token_accuracy": 0.22244195342063905, "num_tokens": 88861017.0, "step": 51230 }, { "entropy": 5.797367858886719, "epoch": 3.98626726317837, "grad_norm": 1.4375, "learning_rate": 0.00034859632364174167, "loss": 4.9899, "mean_token_accuracy": 0.21483972817659377, "num_tokens": 88869731.0, "step": 51235 }, { "entropy": 5.911698627471924, "epoch": 3.9866562925500877, "grad_norm": 1.2421875, "learning_rate": 0.000348570132087618, "loss": 4.9737, "mean_token_accuracy": 0.21292393803596496, "num_tokens": 88878627.0, "step": 51240 }, { "entropy": 5.930258083343506, "epoch": 3.987045321921805, "grad_norm": 1.328125, "learning_rate": 0.0003485439394171847, "loss": 5.0029, "mean_token_accuracy": 0.21175676286220552, "num_tokens": 88887473.0, "step": 51245 }, { "entropy": 5.842200040817261, "epoch": 3.9874343512935226, "grad_norm": 1.390625, "learning_rate": 0.00034851774563083925, "loss": 4.9987, "mean_token_accuracy": 0.21061163097620011, "num_tokens": 88896140.0, "step": 51250 }, { "entropy": 5.814928674697876, "epoch": 3.9878233806652403, "grad_norm": 1.40625, "learning_rate": 0.0003484915507289791, "loss": 4.9508, "mean_token_accuracy": 0.21731790006160737, "num_tokens": 88904630.0, "step": 51255 }, { "entropy": 5.8075474262237545, "epoch": 3.988212410036958, "grad_norm": 1.3125, "learning_rate": 0.00034846535471200153, "loss": 4.9087, "mean_token_accuracy": 0.21364985406398773, "num_tokens": 88913632.0, "step": 51260 }, { "entropy": 5.873779535293579, "epoch": 3.9886014394086753, "grad_norm": 1.390625, "learning_rate": 0.0003484391575803041, "loss": 4.9594, "mean_token_accuracy": 0.21179973036050798, "num_tokens": 88922574.0, "step": 51265 }, { "entropy": 5.79934287071228, "epoch": 3.988990468780393, "grad_norm": 1.3671875, "learning_rate": 0.0003484129593342844, "loss": 4.881, "mean_token_accuracy": 0.21969355195760726, "num_tokens": 88930820.0, "step": 51270 }, { "entropy": 5.844461917877197, "epoch": 3.9893794981521102, "grad_norm": 1.328125, "learning_rate": 0.00034838675997433987, "loss": 5.0086, "mean_token_accuracy": 0.21297162920236587, "num_tokens": 88938925.0, "step": 51275 }, { "entropy": 5.843235874176026, "epoch": 3.989768527523828, "grad_norm": 1.3515625, "learning_rate": 0.0003483605595008681, "loss": 4.9356, "mean_token_accuracy": 0.20793224424123763, "num_tokens": 88947825.0, "step": 51280 }, { "entropy": 5.923256683349609, "epoch": 3.9901575568955456, "grad_norm": 1.25, "learning_rate": 0.00034833435791426653, "loss": 5.1128, "mean_token_accuracy": 0.19983021169900894, "num_tokens": 88957583.0, "step": 51285 }, { "entropy": 5.970640420913696, "epoch": 3.9905465862672633, "grad_norm": 1.484375, "learning_rate": 0.00034830815521493295, "loss": 5.0432, "mean_token_accuracy": 0.21258684247732162, "num_tokens": 88966514.0, "step": 51290 }, { "entropy": 5.907920408248901, "epoch": 3.9909356156389806, "grad_norm": 1.46875, "learning_rate": 0.0003482819514032647, "loss": 5.0441, "mean_token_accuracy": 0.21122399419546128, "num_tokens": 88974580.0, "step": 51295 }, { "entropy": 5.755581712722778, "epoch": 3.9913246450106983, "grad_norm": 1.3828125, "learning_rate": 0.00034825574647965945, "loss": 4.8729, "mean_token_accuracy": 0.2242751345038414, "num_tokens": 88983892.0, "step": 51300 }, { "entropy": 5.872069263458252, "epoch": 3.991713674382416, "grad_norm": 1.3203125, "learning_rate": 0.00034822954044451485, "loss": 5.0635, "mean_token_accuracy": 0.20567660480737687, "num_tokens": 88993421.0, "step": 51305 }, { "entropy": 5.896870374679565, "epoch": 3.9921027037541332, "grad_norm": 1.4140625, "learning_rate": 0.0003482033332982286, "loss": 4.9546, "mean_token_accuracy": 0.2138390138745308, "num_tokens": 89002246.0, "step": 51310 }, { "entropy": 5.9058653831481935, "epoch": 3.992491733125851, "grad_norm": 1.203125, "learning_rate": 0.0003481771250411982, "loss": 4.9968, "mean_token_accuracy": 0.2144250527024269, "num_tokens": 89012280.0, "step": 51315 }, { "entropy": 5.8697309494018555, "epoch": 3.9928807624975686, "grad_norm": 1.3359375, "learning_rate": 0.0003481509156738214, "loss": 5.0387, "mean_token_accuracy": 0.20556814223527908, "num_tokens": 89020776.0, "step": 51320 }, { "entropy": 5.7874444961547855, "epoch": 3.9932697918692863, "grad_norm": 1.4453125, "learning_rate": 0.00034812470519649593, "loss": 4.8414, "mean_token_accuracy": 0.22216229736804963, "num_tokens": 89028559.0, "step": 51325 }, { "entropy": 5.847426652908325, "epoch": 3.9936588212410036, "grad_norm": 1.4453125, "learning_rate": 0.0003480984936096194, "loss": 4.9083, "mean_token_accuracy": 0.21203238964080812, "num_tokens": 89037093.0, "step": 51330 }, { "entropy": 5.826626396179199, "epoch": 3.9940478506127213, "grad_norm": 1.3046875, "learning_rate": 0.00034807228091358964, "loss": 5.0001, "mean_token_accuracy": 0.21483483165502548, "num_tokens": 89046953.0, "step": 51335 }, { "entropy": 5.838588619232178, "epoch": 3.994436879984439, "grad_norm": 1.4609375, "learning_rate": 0.0003480460671088043, "loss": 4.9232, "mean_token_accuracy": 0.21679116636514664, "num_tokens": 89055067.0, "step": 51340 }, { "entropy": 5.866257047653198, "epoch": 3.9948259093561562, "grad_norm": 1.296875, "learning_rate": 0.00034801985219566124, "loss": 5.0132, "mean_token_accuracy": 0.2068975806236267, "num_tokens": 89063965.0, "step": 51345 }, { "entropy": 5.869564390182495, "epoch": 3.995214938727874, "grad_norm": 1.4140625, "learning_rate": 0.000347993636174558, "loss": 5.0019, "mean_token_accuracy": 0.20556047111749648, "num_tokens": 89072541.0, "step": 51350 }, { "entropy": 5.820171260833741, "epoch": 3.9956039680995916, "grad_norm": 1.2890625, "learning_rate": 0.00034796741904589263, "loss": 4.8789, "mean_token_accuracy": 0.22106898128986358, "num_tokens": 89081063.0, "step": 51355 }, { "entropy": 5.83446307182312, "epoch": 3.9959929974713093, "grad_norm": 1.3515625, "learning_rate": 0.00034794120081006275, "loss": 4.957, "mean_token_accuracy": 0.21530717015266418, "num_tokens": 89090028.0, "step": 51360 }, { "entropy": 5.742966747283935, "epoch": 3.9963820268430266, "grad_norm": 1.3828125, "learning_rate": 0.0003479149814674663, "loss": 4.8769, "mean_token_accuracy": 0.2136027619242668, "num_tokens": 89098596.0, "step": 51365 }, { "entropy": 5.865492486953736, "epoch": 3.9967710562147443, "grad_norm": 1.40625, "learning_rate": 0.000347888761018501, "loss": 4.9846, "mean_token_accuracy": 0.21574797332286835, "num_tokens": 89106756.0, "step": 51370 }, { "entropy": 5.747814273834228, "epoch": 3.9971600855864615, "grad_norm": 1.34375, "learning_rate": 0.0003478625394635648, "loss": 4.9796, "mean_token_accuracy": 0.2053950011730194, "num_tokens": 89115477.0, "step": 51375 }, { "entropy": 5.817495393753052, "epoch": 3.997549114958179, "grad_norm": 1.3984375, "learning_rate": 0.00034783631680305554, "loss": 4.9747, "mean_token_accuracy": 0.21318839788436889, "num_tokens": 89123667.0, "step": 51380 }, { "entropy": 5.811772441864013, "epoch": 3.997938144329897, "grad_norm": 1.4375, "learning_rate": 0.0003478100930373711, "loss": 4.9304, "mean_token_accuracy": 0.21976623684167862, "num_tokens": 89132453.0, "step": 51385 }, { "entropy": 5.906843137741089, "epoch": 3.9983271737016146, "grad_norm": 1.3125, "learning_rate": 0.0003477838681669094, "loss": 4.9927, "mean_token_accuracy": 0.2093352645635605, "num_tokens": 89141214.0, "step": 51390 }, { "entropy": 5.920486831665039, "epoch": 3.9987162030733323, "grad_norm": 1.2734375, "learning_rate": 0.0003477576421920682, "loss": 5.0498, "mean_token_accuracy": 0.20425763875246047, "num_tokens": 89149769.0, "step": 51395 }, { "entropy": 5.789428806304931, "epoch": 3.9991052324450496, "grad_norm": 1.3828125, "learning_rate": 0.0003477314151132458, "loss": 4.9092, "mean_token_accuracy": 0.21738403886556626, "num_tokens": 89157951.0, "step": 51400 }, { "entropy": 5.904246759414673, "epoch": 3.9994942618167673, "grad_norm": 1.3828125, "learning_rate": 0.00034770518693083986, "loss": 4.9896, "mean_token_accuracy": 0.21435455977916718, "num_tokens": 89166697.0, "step": 51405 }, { "entropy": 5.90903787612915, "epoch": 3.9998832911884845, "grad_norm": 1.4375, "learning_rate": 0.00034767895764524845, "loss": 4.9192, "mean_token_accuracy": 0.22087946236133577, "num_tokens": 89175359.0, "step": 51410 }, { "entropy": 5.8504725032382545, "epoch": 4.000233417623031, "grad_norm": 1.3046875, "learning_rate": 0.00034765272725686947, "loss": 4.9986, "mean_token_accuracy": 0.21506953239440918, "num_tokens": 89182872.0, "step": 51415 }, { "entropy": 5.843354368209839, "epoch": 4.000622446994748, "grad_norm": 1.3125, "learning_rate": 0.00034762649576610105, "loss": 4.9776, "mean_token_accuracy": 0.2120300754904747, "num_tokens": 89191308.0, "step": 51420 }, { "entropy": 5.83942289352417, "epoch": 4.0010114763664655, "grad_norm": 1.328125, "learning_rate": 0.00034760026317334113, "loss": 4.8918, "mean_token_accuracy": 0.2227887511253357, "num_tokens": 89199177.0, "step": 51425 }, { "entropy": 5.904194116592407, "epoch": 4.001400505738183, "grad_norm": 1.4140625, "learning_rate": 0.0003475740294789878, "loss": 4.992, "mean_token_accuracy": 0.21009704917669297, "num_tokens": 89207684.0, "step": 51430 }, { "entropy": 5.784019088745117, "epoch": 4.001789535109901, "grad_norm": 1.4296875, "learning_rate": 0.000347547794683439, "loss": 4.9037, "mean_token_accuracy": 0.22087557166814803, "num_tokens": 89216591.0, "step": 51435 }, { "entropy": 5.923308944702148, "epoch": 4.002178564481619, "grad_norm": 1.3671875, "learning_rate": 0.0003475215587870929, "loss": 5.0079, "mean_token_accuracy": 0.20841668099164962, "num_tokens": 89225337.0, "step": 51440 }, { "entropy": 5.829972934722901, "epoch": 4.002567593853336, "grad_norm": 1.328125, "learning_rate": 0.0003474953217903477, "loss": 4.8939, "mean_token_accuracy": 0.21679709404706954, "num_tokens": 89234241.0, "step": 51445 }, { "entropy": 5.810553169250488, "epoch": 4.002956623225053, "grad_norm": 1.28125, "learning_rate": 0.0003474690836936013, "loss": 4.8809, "mean_token_accuracy": 0.22037444710731507, "num_tokens": 89243658.0, "step": 51450 }, { "entropy": 5.863436031341553, "epoch": 4.003345652596771, "grad_norm": 1.3125, "learning_rate": 0.0003474428444972519, "loss": 4.9019, "mean_token_accuracy": 0.22006140202283858, "num_tokens": 89253161.0, "step": 51455 }, { "entropy": 5.808107376098633, "epoch": 4.0037346819684885, "grad_norm": 1.2734375, "learning_rate": 0.0003474166042016977, "loss": 4.8656, "mean_token_accuracy": 0.2114116370677948, "num_tokens": 89262376.0, "step": 51460 }, { "entropy": 5.880016088485718, "epoch": 4.004123711340206, "grad_norm": 1.5390625, "learning_rate": 0.00034739036280733674, "loss": 4.9436, "mean_token_accuracy": 0.21360787600278855, "num_tokens": 89270219.0, "step": 51465 }, { "entropy": 5.864965343475342, "epoch": 4.004512740711924, "grad_norm": 1.40625, "learning_rate": 0.00034736412031456714, "loss": 4.9213, "mean_token_accuracy": 0.2257390648126602, "num_tokens": 89278734.0, "step": 51470 }, { "entropy": 5.869487380981445, "epoch": 4.004901770083642, "grad_norm": 1.328125, "learning_rate": 0.00034733787672378734, "loss": 4.9168, "mean_token_accuracy": 0.21515712141990662, "num_tokens": 89288043.0, "step": 51475 }, { "entropy": 5.819180536270141, "epoch": 4.005290799455359, "grad_norm": 1.3046875, "learning_rate": 0.0003473116320353953, "loss": 4.8868, "mean_token_accuracy": 0.22581062614917755, "num_tokens": 89296482.0, "step": 51480 }, { "entropy": 5.788719749450683, "epoch": 4.005679828827076, "grad_norm": 1.4453125, "learning_rate": 0.0003472853862497895, "loss": 4.8722, "mean_token_accuracy": 0.2311222493648529, "num_tokens": 89304703.0, "step": 51485 }, { "entropy": 5.891383314132691, "epoch": 4.006068858198794, "grad_norm": 1.3671875, "learning_rate": 0.0003472591393673679, "loss": 5.0674, "mean_token_accuracy": 0.20446013361215593, "num_tokens": 89312953.0, "step": 51490 }, { "entropy": 5.745553731918335, "epoch": 4.0064578875705115, "grad_norm": 1.3046875, "learning_rate": 0.00034723289138852885, "loss": 4.8317, "mean_token_accuracy": 0.222431980073452, "num_tokens": 89321727.0, "step": 51495 }, { "entropy": 5.7577221393585205, "epoch": 4.006846916942229, "grad_norm": 1.4375, "learning_rate": 0.0003472066423136707, "loss": 4.8628, "mean_token_accuracy": 0.22814445197582245, "num_tokens": 89330180.0, "step": 51500 }, { "entropy": 5.7535247802734375, "epoch": 4.007235946313947, "grad_norm": 1.3125, "learning_rate": 0.0003471803921431917, "loss": 4.9254, "mean_token_accuracy": 0.20446530729532242, "num_tokens": 89338600.0, "step": 51505 }, { "entropy": 5.868578243255615, "epoch": 4.007624975685665, "grad_norm": 1.3828125, "learning_rate": 0.00034715414087749003, "loss": 4.9881, "mean_token_accuracy": 0.20912158787250518, "num_tokens": 89347408.0, "step": 51510 }, { "entropy": 5.792420148849487, "epoch": 4.008014005057382, "grad_norm": 1.3046875, "learning_rate": 0.0003471278885169642, "loss": 4.8385, "mean_token_accuracy": 0.22065535485744475, "num_tokens": 89356309.0, "step": 51515 }, { "entropy": 5.825910377502441, "epoch": 4.008403034429099, "grad_norm": 1.3359375, "learning_rate": 0.00034710163506201247, "loss": 4.9139, "mean_token_accuracy": 0.21985791474580765, "num_tokens": 89365014.0, "step": 51520 }, { "entropy": 5.921168804168701, "epoch": 4.008792063800817, "grad_norm": 1.453125, "learning_rate": 0.00034707538051303316, "loss": 4.9234, "mean_token_accuracy": 0.2117210805416107, "num_tokens": 89374137.0, "step": 51525 }, { "entropy": 5.875305604934693, "epoch": 4.0091810931725345, "grad_norm": 1.375, "learning_rate": 0.0003470491248704247, "loss": 4.9325, "mean_token_accuracy": 0.21245753467082978, "num_tokens": 89382398.0, "step": 51530 }, { "entropy": 5.854421234130859, "epoch": 4.009570122544252, "grad_norm": 1.3828125, "learning_rate": 0.00034702286813458543, "loss": 4.9464, "mean_token_accuracy": 0.21743429750204085, "num_tokens": 89391320.0, "step": 51535 }, { "entropy": 5.757168817520141, "epoch": 4.00995915191597, "grad_norm": 1.390625, "learning_rate": 0.00034699661030591374, "loss": 4.9183, "mean_token_accuracy": 0.21566785275936126, "num_tokens": 89400204.0, "step": 51540 }, { "entropy": 5.808652591705322, "epoch": 4.0103481812876876, "grad_norm": 1.5, "learning_rate": 0.0003469703513848081, "loss": 4.9374, "mean_token_accuracy": 0.22021826207637787, "num_tokens": 89408217.0, "step": 51545 }, { "entropy": 5.83072714805603, "epoch": 4.010737210659404, "grad_norm": 1.3125, "learning_rate": 0.000346944091371667, "loss": 4.8628, "mean_token_accuracy": 0.21939108073711394, "num_tokens": 89417677.0, "step": 51550 }, { "entropy": 5.796425247192383, "epoch": 4.011126240031122, "grad_norm": 1.3671875, "learning_rate": 0.0003469178302668888, "loss": 4.8615, "mean_token_accuracy": 0.2207345873117447, "num_tokens": 89426275.0, "step": 51555 }, { "entropy": 5.924442338943481, "epoch": 4.01151526940284, "grad_norm": 1.375, "learning_rate": 0.0003468915680708719, "loss": 5.0323, "mean_token_accuracy": 0.20831306874752045, "num_tokens": 89434855.0, "step": 51560 }, { "entropy": 5.875079393386841, "epoch": 4.0119042987745575, "grad_norm": 1.3203125, "learning_rate": 0.000346865304784015, "loss": 4.987, "mean_token_accuracy": 0.20980384796857834, "num_tokens": 89443317.0, "step": 51565 }, { "entropy": 5.791081666946411, "epoch": 4.012293328146275, "grad_norm": 1.3984375, "learning_rate": 0.0003468390404067164, "loss": 4.8616, "mean_token_accuracy": 0.22150207161903382, "num_tokens": 89452181.0, "step": 51570 }, { "entropy": 5.912380981445312, "epoch": 4.012682357517993, "grad_norm": 1.4140625, "learning_rate": 0.0003468127749393747, "loss": 4.98, "mean_token_accuracy": 0.2057015597820282, "num_tokens": 89460997.0, "step": 51575 }, { "entropy": 5.891068410873413, "epoch": 4.0130713868897105, "grad_norm": 1.328125, "learning_rate": 0.0003467865083823885, "loss": 4.9884, "mean_token_accuracy": 0.2083483874797821, "num_tokens": 89469431.0, "step": 51580 }, { "entropy": 5.881328153610229, "epoch": 4.013460416261427, "grad_norm": 1.3671875, "learning_rate": 0.0003467602407361563, "loss": 4.941, "mean_token_accuracy": 0.20990949422121047, "num_tokens": 89477372.0, "step": 51585 }, { "entropy": 5.867156028747559, "epoch": 4.013849445633145, "grad_norm": 1.3203125, "learning_rate": 0.00034673397200107663, "loss": 4.9791, "mean_token_accuracy": 0.210368350148201, "num_tokens": 89485542.0, "step": 51590 }, { "entropy": 5.7216509819030765, "epoch": 4.014238475004863, "grad_norm": 1.3828125, "learning_rate": 0.0003467077021775481, "loss": 4.811, "mean_token_accuracy": 0.22827076613903047, "num_tokens": 89494041.0, "step": 51595 }, { "entropy": 5.88072566986084, "epoch": 4.0146275043765804, "grad_norm": 1.4921875, "learning_rate": 0.00034668143126596933, "loss": 5.037, "mean_token_accuracy": 0.21217611134052278, "num_tokens": 89502749.0, "step": 51600 }, { "entropy": 5.807913208007813, "epoch": 4.015016533748298, "grad_norm": 1.46875, "learning_rate": 0.00034665515926673903, "loss": 4.8417, "mean_token_accuracy": 0.22049765288829803, "num_tokens": 89510981.0, "step": 51605 }, { "entropy": 5.855193996429444, "epoch": 4.015405563120016, "grad_norm": 1.3203125, "learning_rate": 0.0003466288861802556, "loss": 4.9735, "mean_token_accuracy": 0.21269351243972778, "num_tokens": 89519926.0, "step": 51610 }, { "entropy": 5.909092617034912, "epoch": 4.0157945924917335, "grad_norm": 1.2734375, "learning_rate": 0.0003466026120069179, "loss": 4.9182, "mean_token_accuracy": 0.21776532381772995, "num_tokens": 89528547.0, "step": 51615 }, { "entropy": 5.82960057258606, "epoch": 4.01618362186345, "grad_norm": 1.3828125, "learning_rate": 0.0003465763367471245, "loss": 4.9318, "mean_token_accuracy": 0.21412865966558456, "num_tokens": 89536691.0, "step": 51620 }, { "entropy": 5.791877031326294, "epoch": 4.016572651235168, "grad_norm": 1.328125, "learning_rate": 0.00034655006040127415, "loss": 4.853, "mean_token_accuracy": 0.21744546443223953, "num_tokens": 89545484.0, "step": 51625 }, { "entropy": 5.829100608825684, "epoch": 4.016961680606886, "grad_norm": 1.46875, "learning_rate": 0.0003465237829697655, "loss": 4.872, "mean_token_accuracy": 0.22078536897897721, "num_tokens": 89554295.0, "step": 51630 }, { "entropy": 5.746594667434692, "epoch": 4.017350709978603, "grad_norm": 1.328125, "learning_rate": 0.00034649750445299725, "loss": 4.8084, "mean_token_accuracy": 0.22994038909673692, "num_tokens": 89562633.0, "step": 51635 }, { "entropy": 5.8266387462615965, "epoch": 4.017739739350321, "grad_norm": 1.3984375, "learning_rate": 0.0003464712248513682, "loss": 5.0239, "mean_token_accuracy": 0.20847724974155427, "num_tokens": 89571081.0, "step": 51640 }, { "entropy": 5.814377546310425, "epoch": 4.018128768722039, "grad_norm": 1.28125, "learning_rate": 0.0003464449441652771, "loss": 4.9093, "mean_token_accuracy": 0.22242127358913422, "num_tokens": 89579960.0, "step": 51645 }, { "entropy": 5.872315168380737, "epoch": 4.018517798093756, "grad_norm": 1.484375, "learning_rate": 0.0003464186623951227, "loss": 5.0046, "mean_token_accuracy": 0.21494875103235245, "num_tokens": 89589092.0, "step": 51650 }, { "entropy": 5.885835409164429, "epoch": 4.018906827465473, "grad_norm": 1.375, "learning_rate": 0.0003463923795413037, "loss": 5.0213, "mean_token_accuracy": 0.2062897801399231, "num_tokens": 89599430.0, "step": 51655 }, { "entropy": 5.832208776473999, "epoch": 4.019295856837191, "grad_norm": 1.390625, "learning_rate": 0.00034636609560421906, "loss": 4.903, "mean_token_accuracy": 0.21794089525938035, "num_tokens": 89607850.0, "step": 51660 }, { "entropy": 5.812400674819946, "epoch": 4.019684886208909, "grad_norm": 1.2265625, "learning_rate": 0.00034633981058426744, "loss": 4.8916, "mean_token_accuracy": 0.2187441498041153, "num_tokens": 89617433.0, "step": 51665 }, { "entropy": 5.819549322128296, "epoch": 4.020073915580626, "grad_norm": 1.3984375, "learning_rate": 0.0003463135244818477, "loss": 4.8861, "mean_token_accuracy": 0.22183749973773956, "num_tokens": 89625730.0, "step": 51670 }, { "entropy": 5.830978536605835, "epoch": 4.020462944952344, "grad_norm": 1.234375, "learning_rate": 0.0003462872372973588, "loss": 4.9824, "mean_token_accuracy": 0.21887386590242386, "num_tokens": 89634827.0, "step": 51675 }, { "entropy": 5.808528566360474, "epoch": 4.020851974324062, "grad_norm": 1.328125, "learning_rate": 0.0003462609490311996, "loss": 4.9235, "mean_token_accuracy": 0.20965302735567093, "num_tokens": 89643564.0, "step": 51680 }, { "entropy": 5.839132404327392, "epoch": 4.021241003695779, "grad_norm": 1.34375, "learning_rate": 0.0003462346596837689, "loss": 4.8681, "mean_token_accuracy": 0.21772970408201217, "num_tokens": 89651529.0, "step": 51685 }, { "entropy": 5.8134575366973875, "epoch": 4.021630033067496, "grad_norm": 1.4609375, "learning_rate": 0.0003462083692554655, "loss": 4.8951, "mean_token_accuracy": 0.21801274865865708, "num_tokens": 89659139.0, "step": 51690 }, { "entropy": 5.769798469543457, "epoch": 4.022019062439214, "grad_norm": 1.40625, "learning_rate": 0.00034618207774668854, "loss": 4.8433, "mean_token_accuracy": 0.22245918959379196, "num_tokens": 89667060.0, "step": 51695 }, { "entropy": 5.759919548034668, "epoch": 4.022408091810932, "grad_norm": 1.390625, "learning_rate": 0.00034615578515783687, "loss": 4.8672, "mean_token_accuracy": 0.21999125480651854, "num_tokens": 89675179.0, "step": 51700 }, { "entropy": 5.909809303283692, "epoch": 4.022797121182649, "grad_norm": 1.265625, "learning_rate": 0.00034612949148930935, "loss": 5.0484, "mean_token_accuracy": 0.2021441251039505, "num_tokens": 89684661.0, "step": 51705 }, { "entropy": 5.941668605804443, "epoch": 4.023186150554367, "grad_norm": 1.4140625, "learning_rate": 0.000346103196741505, "loss": 5.064, "mean_token_accuracy": 0.20643474906682968, "num_tokens": 89693179.0, "step": 51710 }, { "entropy": 5.8753660202026365, "epoch": 4.023575179926085, "grad_norm": 1.5, "learning_rate": 0.00034607690091482284, "loss": 4.9082, "mean_token_accuracy": 0.2115110471844673, "num_tokens": 89702045.0, "step": 51715 }, { "entropy": 5.825630521774292, "epoch": 4.023964209297802, "grad_norm": 1.421875, "learning_rate": 0.0003460506040096619, "loss": 4.9177, "mean_token_accuracy": 0.21676555275917053, "num_tokens": 89710564.0, "step": 51720 }, { "entropy": 5.794694185256958, "epoch": 4.024353238669519, "grad_norm": 1.25, "learning_rate": 0.0003460243060264211, "loss": 4.9364, "mean_token_accuracy": 0.2198055401444435, "num_tokens": 89719555.0, "step": 51725 }, { "entropy": 5.7684431076049805, "epoch": 4.024742268041237, "grad_norm": 1.328125, "learning_rate": 0.00034599800696549944, "loss": 4.9364, "mean_token_accuracy": 0.21602105498313903, "num_tokens": 89728142.0, "step": 51730 }, { "entropy": 5.892065572738647, "epoch": 4.025131297412955, "grad_norm": 1.3984375, "learning_rate": 0.000345971706827296, "loss": 4.9109, "mean_token_accuracy": 0.2167395234107971, "num_tokens": 89736682.0, "step": 51735 }, { "entropy": 5.79404501914978, "epoch": 4.025520326784672, "grad_norm": 1.421875, "learning_rate": 0.00034594540561221, "loss": 4.9116, "mean_token_accuracy": 0.21187314242124558, "num_tokens": 89745330.0, "step": 51740 }, { "entropy": 5.797719860076905, "epoch": 4.02590935615639, "grad_norm": 1.3203125, "learning_rate": 0.00034591910332064027, "loss": 4.918, "mean_token_accuracy": 0.2186532959342003, "num_tokens": 89753891.0, "step": 51745 }, { "entropy": 5.771295022964478, "epoch": 4.026298385528108, "grad_norm": 1.3125, "learning_rate": 0.0003458927999529861, "loss": 4.9068, "mean_token_accuracy": 0.21554160565137864, "num_tokens": 89762562.0, "step": 51750 }, { "entropy": 5.828758001327515, "epoch": 4.026687414899825, "grad_norm": 1.4453125, "learning_rate": 0.00034586649550964656, "loss": 4.943, "mean_token_accuracy": 0.2146461248397827, "num_tokens": 89771576.0, "step": 51755 }, { "entropy": 5.848482942581176, "epoch": 4.027076444271542, "grad_norm": 1.21875, "learning_rate": 0.00034584018999102073, "loss": 4.9112, "mean_token_accuracy": 0.22008802592754365, "num_tokens": 89780702.0, "step": 51760 }, { "entropy": 5.84187912940979, "epoch": 4.02746547364326, "grad_norm": 1.2890625, "learning_rate": 0.00034581388339750775, "loss": 4.8844, "mean_token_accuracy": 0.215875343978405, "num_tokens": 89789580.0, "step": 51765 }, { "entropy": 5.830805730819702, "epoch": 4.027854503014978, "grad_norm": 1.4609375, "learning_rate": 0.0003457875757295067, "loss": 4.9329, "mean_token_accuracy": 0.21076501458883284, "num_tokens": 89797726.0, "step": 51770 }, { "entropy": 5.8494651317596436, "epoch": 4.028243532386695, "grad_norm": 1.375, "learning_rate": 0.00034576126698741697, "loss": 4.9599, "mean_token_accuracy": 0.21786351054906844, "num_tokens": 89805771.0, "step": 51775 }, { "entropy": 5.837840461730957, "epoch": 4.028632561758413, "grad_norm": 1.265625, "learning_rate": 0.0003457349571716376, "loss": 4.9521, "mean_token_accuracy": 0.2136189341545105, "num_tokens": 89814424.0, "step": 51780 }, { "entropy": 5.822020673751831, "epoch": 4.02902159113013, "grad_norm": 1.453125, "learning_rate": 0.00034570864628256795, "loss": 4.9664, "mean_token_accuracy": 0.20662281066179275, "num_tokens": 89823030.0, "step": 51785 }, { "entropy": 5.7909704685211185, "epoch": 4.029410620501848, "grad_norm": 1.28125, "learning_rate": 0.00034568233432060705, "loss": 4.8936, "mean_token_accuracy": 0.21905582696199416, "num_tokens": 89831000.0, "step": 51790 }, { "entropy": 5.902061414718628, "epoch": 4.029799649873565, "grad_norm": 1.4453125, "learning_rate": 0.0003456560212861543, "loss": 5.005, "mean_token_accuracy": 0.20877033919095994, "num_tokens": 89839454.0, "step": 51795 }, { "entropy": 5.801869440078735, "epoch": 4.030188679245283, "grad_norm": 1.3125, "learning_rate": 0.0003456297071796087, "loss": 4.8793, "mean_token_accuracy": 0.2097836822271347, "num_tokens": 89848442.0, "step": 51800 }, { "entropy": 5.7670753479003904, "epoch": 4.030577708617001, "grad_norm": 1.4609375, "learning_rate": 0.00034560339200136983, "loss": 4.8642, "mean_token_accuracy": 0.2213040381669998, "num_tokens": 89857249.0, "step": 51805 }, { "entropy": 5.835820722579956, "epoch": 4.030966737988718, "grad_norm": 1.3125, "learning_rate": 0.00034557707575183684, "loss": 4.8822, "mean_token_accuracy": 0.21813945472240448, "num_tokens": 89865523.0, "step": 51810 }, { "entropy": 5.827543020248413, "epoch": 4.031355767360436, "grad_norm": 1.3125, "learning_rate": 0.00034555075843140917, "loss": 4.9778, "mean_token_accuracy": 0.21498481184244156, "num_tokens": 89874555.0, "step": 51815 }, { "entropy": 5.876661872863769, "epoch": 4.031744796732153, "grad_norm": 1.4609375, "learning_rate": 0.00034552444004048587, "loss": 4.944, "mean_token_accuracy": 0.21540486365556716, "num_tokens": 89882661.0, "step": 51820 }, { "entropy": 5.7983136653900145, "epoch": 4.032133826103871, "grad_norm": 1.3203125, "learning_rate": 0.00034549812057946657, "loss": 4.902, "mean_token_accuracy": 0.22543672770261763, "num_tokens": 89892111.0, "step": 51825 }, { "entropy": 5.829182910919189, "epoch": 4.032522855475588, "grad_norm": 1.4375, "learning_rate": 0.0003454718000487505, "loss": 4.9036, "mean_token_accuracy": 0.21223197281360626, "num_tokens": 89900688.0, "step": 51830 }, { "entropy": 5.821658325195313, "epoch": 4.032911884847306, "grad_norm": 1.34375, "learning_rate": 0.0003454454784487369, "loss": 4.9689, "mean_token_accuracy": 0.2086763098835945, "num_tokens": 89909855.0, "step": 51835 }, { "entropy": 5.849876594543457, "epoch": 4.033300914219024, "grad_norm": 1.4453125, "learning_rate": 0.0003454191557798254, "loss": 4.9024, "mean_token_accuracy": 0.21780864596366883, "num_tokens": 89918221.0, "step": 51840 }, { "entropy": 5.816346311569214, "epoch": 4.033689943590741, "grad_norm": 1.4375, "learning_rate": 0.00034539283204241525, "loss": 4.886, "mean_token_accuracy": 0.22041191756725312, "num_tokens": 89926898.0, "step": 51845 }, { "entropy": 5.864366483688355, "epoch": 4.034078972962459, "grad_norm": 1.3984375, "learning_rate": 0.00034536650723690596, "loss": 4.9637, "mean_token_accuracy": 0.21079951971769334, "num_tokens": 89935555.0, "step": 51850 }, { "entropy": 5.842814254760742, "epoch": 4.034468002334176, "grad_norm": 1.375, "learning_rate": 0.00034534018136369687, "loss": 4.9826, "mean_token_accuracy": 0.20815846174955369, "num_tokens": 89944465.0, "step": 51855 }, { "entropy": 5.832459545135498, "epoch": 4.034857031705894, "grad_norm": 1.3515625, "learning_rate": 0.0003453138544231875, "loss": 4.9039, "mean_token_accuracy": 0.2216557517647743, "num_tokens": 89952825.0, "step": 51860 }, { "entropy": 5.903737354278564, "epoch": 4.035246061077611, "grad_norm": 1.53125, "learning_rate": 0.0003452875264157774, "loss": 4.9456, "mean_token_accuracy": 0.21432709246873854, "num_tokens": 89960786.0, "step": 51865 }, { "entropy": 5.821130037307739, "epoch": 4.035635090449329, "grad_norm": 1.2421875, "learning_rate": 0.00034526119734186586, "loss": 4.9384, "mean_token_accuracy": 0.21836579889059066, "num_tokens": 89970485.0, "step": 51870 }, { "entropy": 5.814679098129273, "epoch": 4.036024119821047, "grad_norm": 1.328125, "learning_rate": 0.00034523486720185246, "loss": 4.8482, "mean_token_accuracy": 0.22205869108438492, "num_tokens": 89979060.0, "step": 51875 }, { "entropy": 5.8419653415679935, "epoch": 4.036413149192764, "grad_norm": 1.390625, "learning_rate": 0.00034520853599613675, "loss": 4.9245, "mean_token_accuracy": 0.21774656027555467, "num_tokens": 89987105.0, "step": 51880 }, { "entropy": 5.805672454833984, "epoch": 4.036802178564481, "grad_norm": 1.3671875, "learning_rate": 0.00034518220372511835, "loss": 4.912, "mean_token_accuracy": 0.214341701567173, "num_tokens": 89995799.0, "step": 51885 }, { "entropy": 5.7886709690094, "epoch": 4.037191207936199, "grad_norm": 1.390625, "learning_rate": 0.0003451558703891967, "loss": 4.911, "mean_token_accuracy": 0.21123124063014984, "num_tokens": 90003906.0, "step": 51890 }, { "entropy": 5.758745527267456, "epoch": 4.037580237307917, "grad_norm": 1.515625, "learning_rate": 0.0003451295359887713, "loss": 4.884, "mean_token_accuracy": 0.21914792358875274, "num_tokens": 90012884.0, "step": 51895 }, { "entropy": 5.791924142837525, "epoch": 4.037969266679634, "grad_norm": 1.3515625, "learning_rate": 0.0003451032005242418, "loss": 4.9426, "mean_token_accuracy": 0.21860792934894563, "num_tokens": 90021875.0, "step": 51900 }, { "entropy": 5.82041335105896, "epoch": 4.038358296051352, "grad_norm": 1.296875, "learning_rate": 0.00034507686399600786, "loss": 4.871, "mean_token_accuracy": 0.21730118691921235, "num_tokens": 90030187.0, "step": 51905 }, { "entropy": 5.876274061203003, "epoch": 4.03874732542307, "grad_norm": 1.4296875, "learning_rate": 0.00034505052640446907, "loss": 5.0356, "mean_token_accuracy": 0.2063641294836998, "num_tokens": 90038904.0, "step": 51910 }, { "entropy": 5.782050466537475, "epoch": 4.039136354794787, "grad_norm": 1.2578125, "learning_rate": 0.000345024187750025, "loss": 4.869, "mean_token_accuracy": 0.2273107334971428, "num_tokens": 90047933.0, "step": 51915 }, { "entropy": 5.768761110305786, "epoch": 4.039525384166504, "grad_norm": 1.3984375, "learning_rate": 0.00034499784803307534, "loss": 4.9361, "mean_token_accuracy": 0.22211536020040512, "num_tokens": 90056901.0, "step": 51920 }, { "entropy": 5.778373289108276, "epoch": 4.039914413538222, "grad_norm": 1.3203125, "learning_rate": 0.0003449715072540198, "loss": 4.7921, "mean_token_accuracy": 0.2246643289923668, "num_tokens": 90065755.0, "step": 51925 }, { "entropy": 5.8750319480896, "epoch": 4.04030344290994, "grad_norm": 1.3125, "learning_rate": 0.00034494516541325795, "loss": 5.0292, "mean_token_accuracy": 0.20744441896677018, "num_tokens": 90075039.0, "step": 51930 }, { "entropy": 5.8306890487670895, "epoch": 4.040692472281657, "grad_norm": 1.34375, "learning_rate": 0.0003449188225111895, "loss": 5.0159, "mean_token_accuracy": 0.2039992779493332, "num_tokens": 90083435.0, "step": 51935 }, { "entropy": 5.867086601257324, "epoch": 4.041081501653375, "grad_norm": 1.3984375, "learning_rate": 0.00034489247854821426, "loss": 4.9867, "mean_token_accuracy": 0.21878828704357148, "num_tokens": 90092559.0, "step": 51940 }, { "entropy": 5.823929500579834, "epoch": 4.041470531025093, "grad_norm": 1.3203125, "learning_rate": 0.00034486613352473195, "loss": 4.92, "mean_token_accuracy": 0.2125306621193886, "num_tokens": 90101623.0, "step": 51945 }, { "entropy": 5.87227692604065, "epoch": 4.04185956039681, "grad_norm": 1.40625, "learning_rate": 0.00034483978744114224, "loss": 4.9194, "mean_token_accuracy": 0.21183342337608338, "num_tokens": 90109497.0, "step": 51950 }, { "entropy": 5.887918949127197, "epoch": 4.042248589768527, "grad_norm": 1.2890625, "learning_rate": 0.0003448134402978449, "loss": 4.9676, "mean_token_accuracy": 0.2148037686944008, "num_tokens": 90118113.0, "step": 51955 }, { "entropy": 5.887177276611328, "epoch": 4.042637619140245, "grad_norm": 1.328125, "learning_rate": 0.00034478709209523974, "loss": 5.0189, "mean_token_accuracy": 0.2037634715437889, "num_tokens": 90126996.0, "step": 51960 }, { "entropy": 5.870947980880738, "epoch": 4.043026648511963, "grad_norm": 1.3125, "learning_rate": 0.0003447607428337265, "loss": 4.9716, "mean_token_accuracy": 0.21998502910137177, "num_tokens": 90136265.0, "step": 51965 }, { "entropy": 5.854250383377075, "epoch": 4.04341567788368, "grad_norm": 1.3359375, "learning_rate": 0.00034473439251370505, "loss": 4.9719, "mean_token_accuracy": 0.2173912599682808, "num_tokens": 90145452.0, "step": 51970 }, { "entropy": 5.81551570892334, "epoch": 4.043804707255398, "grad_norm": 1.375, "learning_rate": 0.0003447080411355752, "loss": 4.9468, "mean_token_accuracy": 0.2147714078426361, "num_tokens": 90154305.0, "step": 51975 }, { "entropy": 5.8714135646820065, "epoch": 4.044193736627116, "grad_norm": 1.359375, "learning_rate": 0.00034468168869973673, "loss": 4.9475, "mean_token_accuracy": 0.20947336703538894, "num_tokens": 90162839.0, "step": 51980 }, { "entropy": 5.816893243789673, "epoch": 4.0445827659988325, "grad_norm": 1.34375, "learning_rate": 0.00034465533520658967, "loss": 4.8724, "mean_token_accuracy": 0.2175579071044922, "num_tokens": 90171935.0, "step": 51985 }, { "entropy": 5.856818675994873, "epoch": 4.04497179537055, "grad_norm": 1.375, "learning_rate": 0.00034462898065653366, "loss": 4.9799, "mean_token_accuracy": 0.21408382505178453, "num_tokens": 90180963.0, "step": 51990 }, { "entropy": 5.907380199432373, "epoch": 4.045360824742268, "grad_norm": 1.2578125, "learning_rate": 0.0003446026250499687, "loss": 4.9744, "mean_token_accuracy": 0.20971859842538834, "num_tokens": 90189146.0, "step": 51995 }, { "entropy": 5.843783235549926, "epoch": 4.045749854113986, "grad_norm": 1.46875, "learning_rate": 0.0003445762683872946, "loss": 4.8959, "mean_token_accuracy": 0.2196521818637848, "num_tokens": 90197107.0, "step": 52000 }, { "entropy": 5.8998040676116945, "epoch": 4.046138883485703, "grad_norm": 1.34375, "learning_rate": 0.0003445499106689115, "loss": 5.0216, "mean_token_accuracy": 0.20930359065532683, "num_tokens": 90205389.0, "step": 52005 }, { "entropy": 5.87999792098999, "epoch": 4.046527912857421, "grad_norm": 1.3046875, "learning_rate": 0.00034452355189521915, "loss": 4.9266, "mean_token_accuracy": 0.21960538774728774, "num_tokens": 90214119.0, "step": 52010 }, { "entropy": 5.85208306312561, "epoch": 4.046916942229139, "grad_norm": 1.3203125, "learning_rate": 0.0003444971920666176, "loss": 4.9415, "mean_token_accuracy": 0.2189662501215935, "num_tokens": 90222019.0, "step": 52015 }, { "entropy": 5.852917146682739, "epoch": 4.0473059716008555, "grad_norm": 1.390625, "learning_rate": 0.0003444708311835068, "loss": 4.9031, "mean_token_accuracy": 0.21542755663394927, "num_tokens": 90230150.0, "step": 52020 }, { "entropy": 5.814383840560913, "epoch": 4.047695000972573, "grad_norm": 1.4609375, "learning_rate": 0.00034444446924628664, "loss": 4.8517, "mean_token_accuracy": 0.2231388047337532, "num_tokens": 90238320.0, "step": 52025 }, { "entropy": 5.858529663085937, "epoch": 4.048084030344291, "grad_norm": 1.2890625, "learning_rate": 0.00034441810625535725, "loss": 4.9767, "mean_token_accuracy": 0.2090259611606598, "num_tokens": 90247695.0, "step": 52030 }, { "entropy": 5.8809877872467045, "epoch": 4.048473059716009, "grad_norm": 1.3125, "learning_rate": 0.0003443917422111185, "loss": 5.0071, "mean_token_accuracy": 0.2172122120857239, "num_tokens": 90257006.0, "step": 52035 }, { "entropy": 5.88595609664917, "epoch": 4.048862089087726, "grad_norm": 1.4453125, "learning_rate": 0.00034436537711397054, "loss": 4.9731, "mean_token_accuracy": 0.2106809437274933, "num_tokens": 90265869.0, "step": 52040 }, { "entropy": 5.912539863586426, "epoch": 4.049251118459444, "grad_norm": 1.4375, "learning_rate": 0.0003443390109643134, "loss": 5.0053, "mean_token_accuracy": 0.20577946305274963, "num_tokens": 90274370.0, "step": 52045 }, { "entropy": 5.832812643051147, "epoch": 4.049640147831162, "grad_norm": 1.3828125, "learning_rate": 0.0003443126437625472, "loss": 4.9413, "mean_token_accuracy": 0.2231080561876297, "num_tokens": 90282626.0, "step": 52050 }, { "entropy": 5.892820358276367, "epoch": 4.0500291772028785, "grad_norm": 1.3671875, "learning_rate": 0.0003442862755090719, "loss": 4.904, "mean_token_accuracy": 0.22122337967157363, "num_tokens": 90290874.0, "step": 52055 }, { "entropy": 5.781940221786499, "epoch": 4.050418206574596, "grad_norm": 1.3671875, "learning_rate": 0.00034425990620428763, "loss": 4.8049, "mean_token_accuracy": 0.22734990566968918, "num_tokens": 90299486.0, "step": 52060 }, { "entropy": 5.878848695755005, "epoch": 4.050807235946314, "grad_norm": 1.3515625, "learning_rate": 0.0003442335358485946, "loss": 4.9287, "mean_token_accuracy": 0.2167822912335396, "num_tokens": 90307971.0, "step": 52065 }, { "entropy": 5.816729354858398, "epoch": 4.051196265318032, "grad_norm": 1.34375, "learning_rate": 0.0003442071644423928, "loss": 4.9019, "mean_token_accuracy": 0.21419641524553298, "num_tokens": 90316622.0, "step": 52070 }, { "entropy": 5.863480186462402, "epoch": 4.051585294689749, "grad_norm": 1.4609375, "learning_rate": 0.0003441807919860824, "loss": 5.0052, "mean_token_accuracy": 0.21321547776460648, "num_tokens": 90325434.0, "step": 52075 }, { "entropy": 5.8772166728973385, "epoch": 4.051974324061467, "grad_norm": 1.4765625, "learning_rate": 0.00034415441848006364, "loss": 4.9929, "mean_token_accuracy": 0.20999720692634583, "num_tokens": 90333927.0, "step": 52080 }, { "entropy": 5.833747434616089, "epoch": 4.052363353433184, "grad_norm": 1.3671875, "learning_rate": 0.00034412804392473665, "loss": 4.9152, "mean_token_accuracy": 0.2228098377585411, "num_tokens": 90342203.0, "step": 52085 }, { "entropy": 5.857844018936158, "epoch": 4.0527523828049015, "grad_norm": 1.3828125, "learning_rate": 0.0003441016683205016, "loss": 4.8949, "mean_token_accuracy": 0.22196027338504792, "num_tokens": 90350176.0, "step": 52090 }, { "entropy": 5.881503534317017, "epoch": 4.053141412176619, "grad_norm": 1.4375, "learning_rate": 0.00034407529166775874, "loss": 5.0023, "mean_token_accuracy": 0.2073973923921585, "num_tokens": 90358919.0, "step": 52095 }, { "entropy": 5.856105184555053, "epoch": 4.053530441548337, "grad_norm": 1.515625, "learning_rate": 0.0003440489139669083, "loss": 4.9445, "mean_token_accuracy": 0.21496287882328033, "num_tokens": 90367544.0, "step": 52100 }, { "entropy": 5.833160543441773, "epoch": 4.053919470920055, "grad_norm": 1.296875, "learning_rate": 0.00034402253521835036, "loss": 4.9776, "mean_token_accuracy": 0.21351415365934373, "num_tokens": 90377428.0, "step": 52105 }, { "entropy": 5.915317058563232, "epoch": 4.054308500291772, "grad_norm": 1.3671875, "learning_rate": 0.0003439961554224855, "loss": 4.9777, "mean_token_accuracy": 0.21403395831584932, "num_tokens": 90385816.0, "step": 52110 }, { "entropy": 5.827901792526245, "epoch": 4.05469752966349, "grad_norm": 1.3671875, "learning_rate": 0.0003439697745797137, "loss": 4.8675, "mean_token_accuracy": 0.22619945406913758, "num_tokens": 90394273.0, "step": 52115 }, { "entropy": 5.7623570442199705, "epoch": 4.055086559035207, "grad_norm": 1.4609375, "learning_rate": 0.00034394339269043533, "loss": 4.8073, "mean_token_accuracy": 0.22323550581932067, "num_tokens": 90402561.0, "step": 52120 }, { "entropy": 5.791211462020874, "epoch": 4.0554755884069245, "grad_norm": 1.34375, "learning_rate": 0.0003439170097550507, "loss": 4.976, "mean_token_accuracy": 0.2046961486339569, "num_tokens": 90410834.0, "step": 52125 }, { "entropy": 5.875929498672486, "epoch": 4.055864617778642, "grad_norm": 1.34375, "learning_rate": 0.0003438906257739602, "loss": 4.8931, "mean_token_accuracy": 0.22148752063512803, "num_tokens": 90419938.0, "step": 52130 }, { "entropy": 5.905559349060058, "epoch": 4.05625364715036, "grad_norm": 1.4453125, "learning_rate": 0.0003438642407475641, "loss": 4.9633, "mean_token_accuracy": 0.21299238204956056, "num_tokens": 90427980.0, "step": 52135 }, { "entropy": 5.866780853271484, "epoch": 4.0566426765220776, "grad_norm": 1.5859375, "learning_rate": 0.0003438378546762627, "loss": 4.9543, "mean_token_accuracy": 0.21856786012649537, "num_tokens": 90435816.0, "step": 52140 }, { "entropy": 5.864970064163208, "epoch": 4.057031705893795, "grad_norm": 1.3984375, "learning_rate": 0.0003438114675604565, "loss": 4.9363, "mean_token_accuracy": 0.21690584272146224, "num_tokens": 90444456.0, "step": 52145 }, { "entropy": 5.792308568954468, "epoch": 4.057420735265513, "grad_norm": 1.3828125, "learning_rate": 0.0003437850794005457, "loss": 4.8823, "mean_token_accuracy": 0.21493453681468963, "num_tokens": 90453773.0, "step": 52150 }, { "entropy": 5.811292600631714, "epoch": 4.05780976463723, "grad_norm": 1.359375, "learning_rate": 0.0003437586901969309, "loss": 5.0166, "mean_token_accuracy": 0.2103012889623642, "num_tokens": 90462970.0, "step": 52155 }, { "entropy": 5.84728102684021, "epoch": 4.0581987940089475, "grad_norm": 1.4140625, "learning_rate": 0.0003437322999500124, "loss": 4.935, "mean_token_accuracy": 0.21935613602399825, "num_tokens": 90471799.0, "step": 52160 }, { "entropy": 5.833136463165284, "epoch": 4.058587823380665, "grad_norm": 1.2890625, "learning_rate": 0.00034370590866019063, "loss": 4.88, "mean_token_accuracy": 0.2238041177392006, "num_tokens": 90480032.0, "step": 52165 }, { "entropy": 5.842194938659668, "epoch": 4.058976852752383, "grad_norm": 1.4375, "learning_rate": 0.000343679516327866, "loss": 4.8896, "mean_token_accuracy": 0.21448867172002792, "num_tokens": 90488216.0, "step": 52170 }, { "entropy": 5.831223821640014, "epoch": 4.0593658821241005, "grad_norm": 1.4921875, "learning_rate": 0.0003436531229534391, "loss": 4.984, "mean_token_accuracy": 0.21151898205280303, "num_tokens": 90497209.0, "step": 52175 }, { "entropy": 5.886144065856934, "epoch": 4.059754911495818, "grad_norm": 1.40625, "learning_rate": 0.0003436267285373103, "loss": 4.9563, "mean_token_accuracy": 0.2138896703720093, "num_tokens": 90505255.0, "step": 52180 }, { "entropy": 5.850253963470459, "epoch": 4.060143940867536, "grad_norm": 1.2578125, "learning_rate": 0.00034360033307988014, "loss": 4.8415, "mean_token_accuracy": 0.22359334230422973, "num_tokens": 90513508.0, "step": 52185 }, { "entropy": 5.768360900878906, "epoch": 4.060532970239253, "grad_norm": 1.34375, "learning_rate": 0.00034357393658154914, "loss": 4.8852, "mean_token_accuracy": 0.2197498008608818, "num_tokens": 90522482.0, "step": 52190 }, { "entropy": 5.777441596984863, "epoch": 4.0609219996109704, "grad_norm": 1.2109375, "learning_rate": 0.0003435475390427178, "loss": 4.974, "mean_token_accuracy": 0.21254347115755082, "num_tokens": 90532024.0, "step": 52195 }, { "entropy": 5.776740837097168, "epoch": 4.061311028982688, "grad_norm": 1.40625, "learning_rate": 0.00034352114046378655, "loss": 4.8347, "mean_token_accuracy": 0.22101172804832458, "num_tokens": 90540403.0, "step": 52200 }, { "entropy": 5.869071531295776, "epoch": 4.061700058354406, "grad_norm": 1.453125, "learning_rate": 0.00034349474084515607, "loss": 4.8846, "mean_token_accuracy": 0.21936811208724977, "num_tokens": 90548840.0, "step": 52205 }, { "entropy": 5.831562757492065, "epoch": 4.0620890877261235, "grad_norm": 1.40625, "learning_rate": 0.00034346834018722706, "loss": 4.9013, "mean_token_accuracy": 0.2122933954000473, "num_tokens": 90557145.0, "step": 52210 }, { "entropy": 5.919728803634643, "epoch": 4.062478117097841, "grad_norm": 1.3828125, "learning_rate": 0.00034344193849039997, "loss": 5.0021, "mean_token_accuracy": 0.20833453983068467, "num_tokens": 90566109.0, "step": 52215 }, { "entropy": 5.8889837741851805, "epoch": 4.062867146469558, "grad_norm": 1.3828125, "learning_rate": 0.0003434155357550753, "loss": 4.9724, "mean_token_accuracy": 0.21623438894748687, "num_tokens": 90574652.0, "step": 52220 }, { "entropy": 5.855609655380249, "epoch": 4.063256175841276, "grad_norm": 1.359375, "learning_rate": 0.00034338913198165373, "loss": 4.9285, "mean_token_accuracy": 0.21853173971176149, "num_tokens": 90582723.0, "step": 52225 }, { "entropy": 5.920698833465576, "epoch": 4.063645205212993, "grad_norm": 1.3671875, "learning_rate": 0.000343362727170536, "loss": 5.0102, "mean_token_accuracy": 0.21547368317842483, "num_tokens": 90591844.0, "step": 52230 }, { "entropy": 5.81311001777649, "epoch": 4.064034234584711, "grad_norm": 1.421875, "learning_rate": 0.0003433363213221227, "loss": 4.8241, "mean_token_accuracy": 0.22275959551334382, "num_tokens": 90600102.0, "step": 52235 }, { "entropy": 5.826549291610718, "epoch": 4.064423263956429, "grad_norm": 1.4453125, "learning_rate": 0.00034330991443681444, "loss": 4.8712, "mean_token_accuracy": 0.21934038251638413, "num_tokens": 90607909.0, "step": 52240 }, { "entropy": 5.7224109172821045, "epoch": 4.0648122933281465, "grad_norm": 1.421875, "learning_rate": 0.000343283506515012, "loss": 4.8349, "mean_token_accuracy": 0.22111040204763413, "num_tokens": 90616110.0, "step": 52245 }, { "entropy": 5.8070876121521, "epoch": 4.065201322699864, "grad_norm": 1.53125, "learning_rate": 0.00034325709755711606, "loss": 4.9153, "mean_token_accuracy": 0.22416778951883315, "num_tokens": 90625096.0, "step": 52250 }, { "entropy": 5.842015647888184, "epoch": 4.065590352071581, "grad_norm": 1.359375, "learning_rate": 0.00034323068756352725, "loss": 4.9138, "mean_token_accuracy": 0.21566929668188095, "num_tokens": 90633369.0, "step": 52255 }, { "entropy": 5.822929334640503, "epoch": 4.065979381443299, "grad_norm": 1.375, "learning_rate": 0.0003432042765346464, "loss": 4.8732, "mean_token_accuracy": 0.21982914358377456, "num_tokens": 90641414.0, "step": 52260 }, { "entropy": 5.868851995468139, "epoch": 4.066368410815016, "grad_norm": 1.4140625, "learning_rate": 0.0003431778644708742, "loss": 4.9578, "mean_token_accuracy": 0.21670421212911606, "num_tokens": 90649403.0, "step": 52265 }, { "entropy": 5.830531406402588, "epoch": 4.066757440186734, "grad_norm": 1.4296875, "learning_rate": 0.0003431514513726114, "loss": 4.9394, "mean_token_accuracy": 0.2148990511894226, "num_tokens": 90657590.0, "step": 52270 }, { "entropy": 5.8385009765625, "epoch": 4.067146469558452, "grad_norm": 1.4765625, "learning_rate": 0.0003431250372402588, "loss": 4.9379, "mean_token_accuracy": 0.2237924724817276, "num_tokens": 90666448.0, "step": 52275 }, { "entropy": 5.7893718719482425, "epoch": 4.0675354989301695, "grad_norm": 1.3984375, "learning_rate": 0.00034309862207421724, "loss": 4.9054, "mean_token_accuracy": 0.2164943262934685, "num_tokens": 90675452.0, "step": 52280 }, { "entropy": 5.836388397216797, "epoch": 4.067924528301887, "grad_norm": 1.3828125, "learning_rate": 0.00034307220587488743, "loss": 4.9342, "mean_token_accuracy": 0.21053467243909835, "num_tokens": 90684446.0, "step": 52285 }, { "entropy": 5.850708770751953, "epoch": 4.068313557673604, "grad_norm": 1.4296875, "learning_rate": 0.00034304578864267026, "loss": 4.867, "mean_token_accuracy": 0.2224138155579567, "num_tokens": 90693348.0, "step": 52290 }, { "entropy": 5.810446786880493, "epoch": 4.068702587045322, "grad_norm": 1.4453125, "learning_rate": 0.00034301937037796654, "loss": 4.9426, "mean_token_accuracy": 0.21514556407928467, "num_tokens": 90701611.0, "step": 52295 }, { "entropy": 5.857712507247925, "epoch": 4.069091616417039, "grad_norm": 1.4375, "learning_rate": 0.00034299295108117716, "loss": 5.0566, "mean_token_accuracy": 0.20824792832136155, "num_tokens": 90710992.0, "step": 52300 }, { "entropy": 5.85392279624939, "epoch": 4.069480645788757, "grad_norm": 1.3828125, "learning_rate": 0.00034296653075270296, "loss": 4.9522, "mean_token_accuracy": 0.21850242465734482, "num_tokens": 90719684.0, "step": 52305 }, { "entropy": 5.811822557449341, "epoch": 4.069869675160475, "grad_norm": 1.3125, "learning_rate": 0.00034294010939294486, "loss": 4.87, "mean_token_accuracy": 0.2256393924355507, "num_tokens": 90728579.0, "step": 52310 }, { "entropy": 5.803230047225952, "epoch": 4.0702587045321925, "grad_norm": 1.5, "learning_rate": 0.00034291368700230376, "loss": 4.847, "mean_token_accuracy": 0.2259753942489624, "num_tokens": 90736044.0, "step": 52315 }, { "entropy": 5.7889467716217045, "epoch": 4.070647733903909, "grad_norm": 1.328125, "learning_rate": 0.0003428872635811804, "loss": 4.9412, "mean_token_accuracy": 0.21657328605651854, "num_tokens": 90745388.0, "step": 52320 }, { "entropy": 5.802664136886596, "epoch": 4.071036763275627, "grad_norm": 1.359375, "learning_rate": 0.000342860839129976, "loss": 4.9552, "mean_token_accuracy": 0.2154616117477417, "num_tokens": 90753321.0, "step": 52325 }, { "entropy": 5.79578127861023, "epoch": 4.071425792647345, "grad_norm": 1.4453125, "learning_rate": 0.0003428344136490914, "loss": 4.8648, "mean_token_accuracy": 0.22226570546627045, "num_tokens": 90762196.0, "step": 52330 }, { "entropy": 5.868144464492798, "epoch": 4.071814822019062, "grad_norm": 1.2578125, "learning_rate": 0.00034280798713892744, "loss": 4.9471, "mean_token_accuracy": 0.21248525381088257, "num_tokens": 90770892.0, "step": 52335 }, { "entropy": 5.8818295955657955, "epoch": 4.07220385139078, "grad_norm": 1.3828125, "learning_rate": 0.0003427815595998853, "loss": 4.9868, "mean_token_accuracy": 0.21553434580564498, "num_tokens": 90779457.0, "step": 52340 }, { "entropy": 5.846967172622681, "epoch": 4.072592880762498, "grad_norm": 1.359375, "learning_rate": 0.0003427551310323658, "loss": 4.9023, "mean_token_accuracy": 0.21872878670692444, "num_tokens": 90787945.0, "step": 52345 }, { "entropy": 5.8519257545471195, "epoch": 4.0729819101342155, "grad_norm": 1.4375, "learning_rate": 0.00034272870143677015, "loss": 4.9417, "mean_token_accuracy": 0.20986691415309905, "num_tokens": 90796613.0, "step": 52350 }, { "entropy": 5.8603569030761715, "epoch": 4.073370939505932, "grad_norm": 1.4296875, "learning_rate": 0.00034270227081349913, "loss": 4.9689, "mean_token_accuracy": 0.21690395921468736, "num_tokens": 90805175.0, "step": 52355 }, { "entropy": 5.795033168792725, "epoch": 4.07375996887765, "grad_norm": 1.4375, "learning_rate": 0.000342675839162954, "loss": 4.8329, "mean_token_accuracy": 0.21831076592206955, "num_tokens": 90813686.0, "step": 52360 }, { "entropy": 5.787351274490357, "epoch": 4.074148998249368, "grad_norm": 1.3828125, "learning_rate": 0.00034264940648553565, "loss": 4.9432, "mean_token_accuracy": 0.21448871195316316, "num_tokens": 90822692.0, "step": 52365 }, { "entropy": 5.84473819732666, "epoch": 4.074538027621085, "grad_norm": 1.34375, "learning_rate": 0.0003426229727816453, "loss": 4.9563, "mean_token_accuracy": 0.21837498098611832, "num_tokens": 90831191.0, "step": 52370 }, { "entropy": 5.788085842132569, "epoch": 4.074927056992803, "grad_norm": 1.4609375, "learning_rate": 0.0003425965380516839, "loss": 4.9154, "mean_token_accuracy": 0.22172005772590636, "num_tokens": 90839597.0, "step": 52375 }, { "entropy": 5.8115699768066404, "epoch": 4.075316086364521, "grad_norm": 1.4609375, "learning_rate": 0.0003425701022960527, "loss": 4.9112, "mean_token_accuracy": 0.2167083814740181, "num_tokens": 90848208.0, "step": 52380 }, { "entropy": 5.785486364364624, "epoch": 4.0757051157362385, "grad_norm": 1.3828125, "learning_rate": 0.00034254366551515276, "loss": 4.8159, "mean_token_accuracy": 0.22201936244964598, "num_tokens": 90856747.0, "step": 52385 }, { "entropy": 5.829539489746094, "epoch": 4.076094145107955, "grad_norm": 1.375, "learning_rate": 0.0003425172277093852, "loss": 4.8783, "mean_token_accuracy": 0.2162596568465233, "num_tokens": 90864908.0, "step": 52390 }, { "entropy": 5.720896911621094, "epoch": 4.076483174479673, "grad_norm": 1.4921875, "learning_rate": 0.000342490788879151, "loss": 4.8306, "mean_token_accuracy": 0.22386638671159745, "num_tokens": 90873950.0, "step": 52395 }, { "entropy": 5.786791610717773, "epoch": 4.076872203851391, "grad_norm": 1.40625, "learning_rate": 0.00034246434902485156, "loss": 4.9545, "mean_token_accuracy": 0.21612803041934966, "num_tokens": 90882418.0, "step": 52400 }, { "entropy": 5.888134098052978, "epoch": 4.077261233223108, "grad_norm": 1.359375, "learning_rate": 0.00034243790814688816, "loss": 5.0075, "mean_token_accuracy": 0.20419965088367462, "num_tokens": 90892109.0, "step": 52405 }, { "entropy": 5.920904970169067, "epoch": 4.077650262594826, "grad_norm": 1.421875, "learning_rate": 0.00034241146624566175, "loss": 4.927, "mean_token_accuracy": 0.21371452808380126, "num_tokens": 90899949.0, "step": 52410 }, { "entropy": 5.929858922958374, "epoch": 4.078039291966544, "grad_norm": 1.6953125, "learning_rate": 0.0003423850233215737, "loss": 4.9964, "mean_token_accuracy": 0.21624796837568283, "num_tokens": 90909302.0, "step": 52415 }, { "entropy": 5.855721855163575, "epoch": 4.078428321338261, "grad_norm": 1.328125, "learning_rate": 0.0003423585793750251, "loss": 4.965, "mean_token_accuracy": 0.21351767033338548, "num_tokens": 90918394.0, "step": 52420 }, { "entropy": 5.828109312057495, "epoch": 4.078817350709978, "grad_norm": 1.3515625, "learning_rate": 0.00034233213440641724, "loss": 4.877, "mean_token_accuracy": 0.2179236575961113, "num_tokens": 90926495.0, "step": 52425 }, { "entropy": 5.786381816864013, "epoch": 4.079206380081696, "grad_norm": 1.3203125, "learning_rate": 0.00034230568841615145, "loss": 4.914, "mean_token_accuracy": 0.22172889709472657, "num_tokens": 90935036.0, "step": 52430 }, { "entropy": 5.8707057476043705, "epoch": 4.079595409453414, "grad_norm": 1.4140625, "learning_rate": 0.000342279241404629, "loss": 4.9849, "mean_token_accuracy": 0.2085822969675064, "num_tokens": 90943304.0, "step": 52435 }, { "entropy": 5.8498293399810795, "epoch": 4.079984438825131, "grad_norm": 1.4375, "learning_rate": 0.00034225279337225106, "loss": 4.9428, "mean_token_accuracy": 0.21728845238685607, "num_tokens": 90953310.0, "step": 52440 }, { "entropy": 5.793787288665771, "epoch": 4.080373468196849, "grad_norm": 1.265625, "learning_rate": 0.0003422263443194191, "loss": 4.8503, "mean_token_accuracy": 0.2220021277666092, "num_tokens": 90961621.0, "step": 52445 }, { "entropy": 5.833256816864013, "epoch": 4.080762497568567, "grad_norm": 1.46875, "learning_rate": 0.0003421998942465344, "loss": 4.986, "mean_token_accuracy": 0.20948358327150346, "num_tokens": 90970196.0, "step": 52450 }, { "entropy": 5.797112321853637, "epoch": 4.081151526940284, "grad_norm": 1.3046875, "learning_rate": 0.00034217344315399823, "loss": 4.9239, "mean_token_accuracy": 0.21189952939748763, "num_tokens": 90978855.0, "step": 52455 }, { "entropy": 5.8323376178741455, "epoch": 4.081540556312001, "grad_norm": 1.4296875, "learning_rate": 0.000342146991042212, "loss": 4.8868, "mean_token_accuracy": 0.21682592779397963, "num_tokens": 90986890.0, "step": 52460 }, { "entropy": 5.841513729095459, "epoch": 4.081929585683719, "grad_norm": 1.3046875, "learning_rate": 0.00034212053791157695, "loss": 4.9295, "mean_token_accuracy": 0.2155874952673912, "num_tokens": 90995791.0, "step": 52465 }, { "entropy": 5.802629375457764, "epoch": 4.082318615055437, "grad_norm": 1.4140625, "learning_rate": 0.00034209408376249464, "loss": 4.8921, "mean_token_accuracy": 0.22121082693338395, "num_tokens": 91003719.0, "step": 52470 }, { "entropy": 5.809089231491089, "epoch": 4.082707644427154, "grad_norm": 1.3359375, "learning_rate": 0.0003420676285953664, "loss": 4.8653, "mean_token_accuracy": 0.2166763037443161, "num_tokens": 91012330.0, "step": 52475 }, { "entropy": 5.815928411483765, "epoch": 4.083096673798872, "grad_norm": 1.421875, "learning_rate": 0.0003420411724105937, "loss": 4.9316, "mean_token_accuracy": 0.2213539496064186, "num_tokens": 91020945.0, "step": 52480 }, { "entropy": 5.89399905204773, "epoch": 4.08348570317059, "grad_norm": 1.359375, "learning_rate": 0.00034201471520857793, "loss": 4.9735, "mean_token_accuracy": 0.2155792385339737, "num_tokens": 91030602.0, "step": 52485 }, { "entropy": 5.796461153030395, "epoch": 4.083874732542307, "grad_norm": 1.3671875, "learning_rate": 0.0003419882569897204, "loss": 4.8883, "mean_token_accuracy": 0.22210535705089568, "num_tokens": 91039429.0, "step": 52490 }, { "entropy": 5.78185625076294, "epoch": 4.084263761914024, "grad_norm": 1.4765625, "learning_rate": 0.00034196179775442274, "loss": 4.8713, "mean_token_accuracy": 0.21495497673749925, "num_tokens": 91047332.0, "step": 52495 }, { "entropy": 5.819876766204834, "epoch": 4.084652791285742, "grad_norm": 1.328125, "learning_rate": 0.0003419353375030864, "loss": 4.8977, "mean_token_accuracy": 0.2224995404481888, "num_tokens": 91055883.0, "step": 52500 }, { "entropy": 5.852490949630737, "epoch": 4.08504182065746, "grad_norm": 1.34375, "learning_rate": 0.0003419088762361128, "loss": 4.9585, "mean_token_accuracy": 0.21160476803779601, "num_tokens": 91065520.0, "step": 52505 }, { "entropy": 5.8193052291870115, "epoch": 4.085430850029177, "grad_norm": 1.421875, "learning_rate": 0.0003418824139539035, "loss": 4.9235, "mean_token_accuracy": 0.2181520029902458, "num_tokens": 91074182.0, "step": 52510 }, { "entropy": 5.860599184036255, "epoch": 4.085819879400895, "grad_norm": 1.25, "learning_rate": 0.0003418559506568601, "loss": 4.9796, "mean_token_accuracy": 0.2113502189517021, "num_tokens": 91083721.0, "step": 52515 }, { "entropy": 5.891854381561279, "epoch": 4.086208908772612, "grad_norm": 1.3046875, "learning_rate": 0.00034182948634538403, "loss": 4.95, "mean_token_accuracy": 0.2084916740655899, "num_tokens": 91091986.0, "step": 52520 }, { "entropy": 5.857538032531738, "epoch": 4.08659793814433, "grad_norm": 1.3671875, "learning_rate": 0.0003418030210198769, "loss": 4.919, "mean_token_accuracy": 0.21881368160247802, "num_tokens": 91101183.0, "step": 52525 }, { "entropy": 5.908865976333618, "epoch": 4.086986967516047, "grad_norm": 1.3828125, "learning_rate": 0.00034177655468074027, "loss": 5.0355, "mean_token_accuracy": 0.20624226182699204, "num_tokens": 91109574.0, "step": 52530 }, { "entropy": 5.851313781738281, "epoch": 4.087375996887765, "grad_norm": 1.4453125, "learning_rate": 0.0003417500873283756, "loss": 4.9145, "mean_token_accuracy": 0.20936193615198134, "num_tokens": 91117820.0, "step": 52535 }, { "entropy": 5.890816116333008, "epoch": 4.087765026259483, "grad_norm": 1.3671875, "learning_rate": 0.0003417236189631846, "loss": 4.9891, "mean_token_accuracy": 0.2096324861049652, "num_tokens": 91126958.0, "step": 52540 }, { "entropy": 5.79441466331482, "epoch": 4.0881540556312, "grad_norm": 1.390625, "learning_rate": 0.000341697149585569, "loss": 4.8656, "mean_token_accuracy": 0.2166468933224678, "num_tokens": 91135727.0, "step": 52545 }, { "entropy": 5.777029800415039, "epoch": 4.088543085002918, "grad_norm": 1.453125, "learning_rate": 0.0003416706791959302, "loss": 4.9535, "mean_token_accuracy": 0.2108830139040947, "num_tokens": 91145284.0, "step": 52550 }, { "entropy": 5.861325740814209, "epoch": 4.088932114374635, "grad_norm": 1.375, "learning_rate": 0.00034164420779467003, "loss": 4.9606, "mean_token_accuracy": 0.21862999200820923, "num_tokens": 91154106.0, "step": 52555 }, { "entropy": 5.905989265441894, "epoch": 4.089321143746353, "grad_norm": 1.421875, "learning_rate": 0.0003416177353821901, "loss": 4.9791, "mean_token_accuracy": 0.21375168412923812, "num_tokens": 91162936.0, "step": 52560 }, { "entropy": 5.840847778320312, "epoch": 4.08971017311807, "grad_norm": 1.421875, "learning_rate": 0.000341591261958892, "loss": 4.9161, "mean_token_accuracy": 0.213680000603199, "num_tokens": 91171902.0, "step": 52565 }, { "entropy": 5.8928282260894775, "epoch": 4.090099202489788, "grad_norm": 1.3671875, "learning_rate": 0.00034156478752517754, "loss": 4.9514, "mean_token_accuracy": 0.21248565018177032, "num_tokens": 91180398.0, "step": 52570 }, { "entropy": 5.865040969848633, "epoch": 4.090488231861506, "grad_norm": 1.4296875, "learning_rate": 0.00034153831208144837, "loss": 4.8577, "mean_token_accuracy": 0.22061435729265214, "num_tokens": 91188433.0, "step": 52575 }, { "entropy": 5.881752681732178, "epoch": 4.090877261233223, "grad_norm": 1.4140625, "learning_rate": 0.0003415118356281062, "loss": 5.0708, "mean_token_accuracy": 0.19840618073940278, "num_tokens": 91196578.0, "step": 52580 }, { "entropy": 5.881213617324829, "epoch": 4.091266290604941, "grad_norm": 1.3203125, "learning_rate": 0.0003414853581655528, "loss": 5.0081, "mean_token_accuracy": 0.21125536262989045, "num_tokens": 91206085.0, "step": 52585 }, { "entropy": 5.86044979095459, "epoch": 4.091655319976658, "grad_norm": 1.296875, "learning_rate": 0.00034145887969419, "loss": 4.9352, "mean_token_accuracy": 0.21598075330257416, "num_tokens": 91215222.0, "step": 52590 }, { "entropy": 5.841968297958374, "epoch": 4.092044349348376, "grad_norm": 1.4375, "learning_rate": 0.00034143240021441935, "loss": 4.9457, "mean_token_accuracy": 0.20829401463270186, "num_tokens": 91224249.0, "step": 52595 }, { "entropy": 5.835330533981323, "epoch": 4.092433378720093, "grad_norm": 1.265625, "learning_rate": 0.0003414059197266428, "loss": 4.8636, "mean_token_accuracy": 0.22637263387441636, "num_tokens": 91233157.0, "step": 52600 }, { "entropy": 5.890692520141601, "epoch": 4.092822408091811, "grad_norm": 1.3125, "learning_rate": 0.00034137943823126215, "loss": 5.0108, "mean_token_accuracy": 0.21913779079914092, "num_tokens": 91242639.0, "step": 52605 }, { "entropy": 5.812398147583008, "epoch": 4.093211437463529, "grad_norm": 1.3828125, "learning_rate": 0.0003413529557286792, "loss": 4.9123, "mean_token_accuracy": 0.21963949948549272, "num_tokens": 91251642.0, "step": 52610 }, { "entropy": 5.894945478439331, "epoch": 4.093600466835246, "grad_norm": 1.390625, "learning_rate": 0.0003413264722192957, "loss": 4.9971, "mean_token_accuracy": 0.2151159882545471, "num_tokens": 91260706.0, "step": 52615 }, { "entropy": 5.966597080230713, "epoch": 4.093989496206964, "grad_norm": 1.4609375, "learning_rate": 0.0003412999877035136, "loss": 5.0469, "mean_token_accuracy": 0.20358191132545472, "num_tokens": 91269840.0, "step": 52620 }, { "entropy": 5.872618293762207, "epoch": 4.094378525578681, "grad_norm": 1.3828125, "learning_rate": 0.00034127350218173463, "loss": 4.9888, "mean_token_accuracy": 0.20761465430259704, "num_tokens": 91278379.0, "step": 52625 }, { "entropy": 5.867011070251465, "epoch": 4.094767554950399, "grad_norm": 1.359375, "learning_rate": 0.00034124701565436076, "loss": 5.0401, "mean_token_accuracy": 0.20673823356628418, "num_tokens": 91286620.0, "step": 52630 }, { "entropy": 5.81561770439148, "epoch": 4.095156584322116, "grad_norm": 1.4140625, "learning_rate": 0.000341220528121794, "loss": 4.8915, "mean_token_accuracy": 0.2230576291680336, "num_tokens": 91294559.0, "step": 52635 }, { "entropy": 5.863329744338989, "epoch": 4.095545613693834, "grad_norm": 1.4921875, "learning_rate": 0.000341194039584436, "loss": 4.9615, "mean_token_accuracy": 0.21729220002889632, "num_tokens": 91302807.0, "step": 52640 }, { "entropy": 5.84819917678833, "epoch": 4.095934643065552, "grad_norm": 1.4609375, "learning_rate": 0.0003411675500426888, "loss": 4.9754, "mean_token_accuracy": 0.2161501467227936, "num_tokens": 91310903.0, "step": 52645 }, { "entropy": 5.84290041923523, "epoch": 4.096323672437269, "grad_norm": 1.265625, "learning_rate": 0.00034114105949695445, "loss": 4.9629, "mean_token_accuracy": 0.21008631438016892, "num_tokens": 91320037.0, "step": 52650 }, { "entropy": 5.822517442703247, "epoch": 4.096712701808986, "grad_norm": 1.3671875, "learning_rate": 0.0003411145679476347, "loss": 4.9113, "mean_token_accuracy": 0.21835718899965287, "num_tokens": 91329257.0, "step": 52655 }, { "entropy": 5.842272329330444, "epoch": 4.097101731180704, "grad_norm": 1.3203125, "learning_rate": 0.0003410880753951317, "loss": 4.8609, "mean_token_accuracy": 0.22420183420181275, "num_tokens": 91337225.0, "step": 52660 }, { "entropy": 5.834420108795166, "epoch": 4.097490760552422, "grad_norm": 1.4140625, "learning_rate": 0.0003410615818398473, "loss": 4.8929, "mean_token_accuracy": 0.21519297808408738, "num_tokens": 91346009.0, "step": 52665 }, { "entropy": 5.885254049301148, "epoch": 4.097879789924139, "grad_norm": 1.453125, "learning_rate": 0.0003410350872821835, "loss": 5.0042, "mean_token_accuracy": 0.2128468245267868, "num_tokens": 91356050.0, "step": 52670 }, { "entropy": 5.888118314743042, "epoch": 4.098268819295857, "grad_norm": 1.3359375, "learning_rate": 0.00034100859172254245, "loss": 4.9868, "mean_token_accuracy": 0.20906075984239578, "num_tokens": 91364926.0, "step": 52675 }, { "entropy": 5.81418080329895, "epoch": 4.098657848667575, "grad_norm": 1.4609375, "learning_rate": 0.00034098209516132607, "loss": 4.8532, "mean_token_accuracy": 0.2179558113217354, "num_tokens": 91374129.0, "step": 52680 }, { "entropy": 5.833598470687866, "epoch": 4.099046878039292, "grad_norm": 1.28125, "learning_rate": 0.0003409555975989363, "loss": 4.9497, "mean_token_accuracy": 0.2185434028506279, "num_tokens": 91383201.0, "step": 52685 }, { "entropy": 5.757265233993531, "epoch": 4.099435907411009, "grad_norm": 1.359375, "learning_rate": 0.00034092909903577547, "loss": 4.8752, "mean_token_accuracy": 0.21811351031064988, "num_tokens": 91391979.0, "step": 52690 }, { "entropy": 5.852102565765381, "epoch": 4.099824936782727, "grad_norm": 1.28125, "learning_rate": 0.0003409025994722454, "loss": 4.9466, "mean_token_accuracy": 0.2155961886048317, "num_tokens": 91400127.0, "step": 52695 }, { "entropy": 5.852536296844482, "epoch": 4.100213966154445, "grad_norm": 1.359375, "learning_rate": 0.0003408760989087482, "loss": 4.848, "mean_token_accuracy": 0.22196063846349717, "num_tokens": 91408329.0, "step": 52700 }, { "entropy": 5.772577476501465, "epoch": 4.100602995526162, "grad_norm": 1.4140625, "learning_rate": 0.00034084959734568616, "loss": 4.8612, "mean_token_accuracy": 0.22442913800477982, "num_tokens": 91417156.0, "step": 52705 }, { "entropy": 5.815363454818725, "epoch": 4.10099202489788, "grad_norm": 1.34375, "learning_rate": 0.00034082309478346127, "loss": 4.8499, "mean_token_accuracy": 0.21924446672201156, "num_tokens": 91425776.0, "step": 52710 }, { "entropy": 5.819711780548095, "epoch": 4.101381054269598, "grad_norm": 1.4296875, "learning_rate": 0.00034079659122247574, "loss": 4.9007, "mean_token_accuracy": 0.2179477781057358, "num_tokens": 91435178.0, "step": 52715 }, { "entropy": 5.822615003585815, "epoch": 4.101770083641315, "grad_norm": 1.3828125, "learning_rate": 0.0003407700866631317, "loss": 4.9955, "mean_token_accuracy": 0.2139988884329796, "num_tokens": 91445104.0, "step": 52720 }, { "entropy": 5.878048610687256, "epoch": 4.102159113013032, "grad_norm": 1.390625, "learning_rate": 0.0003407435811058312, "loss": 4.9279, "mean_token_accuracy": 0.2178898572921753, "num_tokens": 91453221.0, "step": 52725 }, { "entropy": 5.807293891906738, "epoch": 4.10254814238475, "grad_norm": 1.34375, "learning_rate": 0.0003407170745509764, "loss": 4.8794, "mean_token_accuracy": 0.22158105075359344, "num_tokens": 91462157.0, "step": 52730 }, { "entropy": 5.839710664749146, "epoch": 4.1029371717564675, "grad_norm": 1.390625, "learning_rate": 0.00034069056699896974, "loss": 5.0137, "mean_token_accuracy": 0.2061545416712761, "num_tokens": 91471070.0, "step": 52735 }, { "entropy": 5.849022912979126, "epoch": 4.103326201128185, "grad_norm": 1.40625, "learning_rate": 0.0003406640584502132, "loss": 4.9417, "mean_token_accuracy": 0.21637336760759354, "num_tokens": 91480388.0, "step": 52740 }, { "entropy": 5.8086577415466305, "epoch": 4.103715230499903, "grad_norm": 1.4296875, "learning_rate": 0.0003406375489051091, "loss": 4.8236, "mean_token_accuracy": 0.22090755105018617, "num_tokens": 91488498.0, "step": 52745 }, { "entropy": 5.81243052482605, "epoch": 4.104104259871621, "grad_norm": 1.3359375, "learning_rate": 0.0003406110383640597, "loss": 4.9598, "mean_token_accuracy": 0.218596975505352, "num_tokens": 91497273.0, "step": 52750 }, { "entropy": 5.856308794021606, "epoch": 4.1044932892433375, "grad_norm": 1.3984375, "learning_rate": 0.00034058452682746734, "loss": 4.955, "mean_token_accuracy": 0.20881213247776031, "num_tokens": 91505727.0, "step": 52755 }, { "entropy": 5.784570407867432, "epoch": 4.104882318615055, "grad_norm": 1.296875, "learning_rate": 0.000340558014295734, "loss": 4.8833, "mean_token_accuracy": 0.22463632076978685, "num_tokens": 91514551.0, "step": 52760 }, { "entropy": 5.824643325805664, "epoch": 4.105271347986773, "grad_norm": 1.546875, "learning_rate": 0.00034053150076926214, "loss": 4.9033, "mean_token_accuracy": 0.22397587299346924, "num_tokens": 91522709.0, "step": 52765 }, { "entropy": 5.775627279281617, "epoch": 4.1056603773584905, "grad_norm": 1.5078125, "learning_rate": 0.0003405049862484541, "loss": 4.8748, "mean_token_accuracy": 0.21368742138147354, "num_tokens": 91531187.0, "step": 52770 }, { "entropy": 5.852588653564453, "epoch": 4.106049406730208, "grad_norm": 1.4765625, "learning_rate": 0.0003404784707337122, "loss": 4.9571, "mean_token_accuracy": 0.21157725900411606, "num_tokens": 91539698.0, "step": 52775 }, { "entropy": 5.884338665008545, "epoch": 4.106438436101926, "grad_norm": 1.40625, "learning_rate": 0.00034045195422543865, "loss": 4.9113, "mean_token_accuracy": 0.21355078518390655, "num_tokens": 91548391.0, "step": 52780 }, { "entropy": 5.812026166915894, "epoch": 4.106827465473644, "grad_norm": 1.3515625, "learning_rate": 0.00034042543672403594, "loss": 4.8823, "mean_token_accuracy": 0.22040676772594453, "num_tokens": 91556680.0, "step": 52785 }, { "entropy": 5.799113702774048, "epoch": 4.10721649484536, "grad_norm": 1.359375, "learning_rate": 0.00034039891822990634, "loss": 4.9654, "mean_token_accuracy": 0.2183515578508377, "num_tokens": 91566899.0, "step": 52790 }, { "entropy": 5.853789854049682, "epoch": 4.107605524217078, "grad_norm": 1.2890625, "learning_rate": 0.0003403723987434523, "loss": 4.9336, "mean_token_accuracy": 0.20488266795873641, "num_tokens": 91575271.0, "step": 52795 }, { "entropy": 5.898279905319214, "epoch": 4.107994553588796, "grad_norm": 1.421875, "learning_rate": 0.00034034587826507604, "loss": 4.9332, "mean_token_accuracy": 0.21194139420986174, "num_tokens": 91583580.0, "step": 52800 }, { "entropy": 5.819307041168213, "epoch": 4.1083835829605135, "grad_norm": 1.3125, "learning_rate": 0.00034031935679518016, "loss": 4.8945, "mean_token_accuracy": 0.2176297202706337, "num_tokens": 91592565.0, "step": 52805 }, { "entropy": 5.794135808944702, "epoch": 4.108772612332231, "grad_norm": 1.4140625, "learning_rate": 0.000340292834334167, "loss": 4.9758, "mean_token_accuracy": 0.20166356563568116, "num_tokens": 91600873.0, "step": 52810 }, { "entropy": 5.812370872497558, "epoch": 4.109161641703949, "grad_norm": 1.3984375, "learning_rate": 0.000340266310882439, "loss": 4.9108, "mean_token_accuracy": 0.2180996611714363, "num_tokens": 91609761.0, "step": 52815 }, { "entropy": 5.839925146102905, "epoch": 4.109550671075667, "grad_norm": 1.4375, "learning_rate": 0.00034023978644039864, "loss": 4.888, "mean_token_accuracy": 0.22318151891231536, "num_tokens": 91619498.0, "step": 52820 }, { "entropy": 5.888211393356324, "epoch": 4.109939700447383, "grad_norm": 1.3828125, "learning_rate": 0.0003402132610084483, "loss": 4.9572, "mean_token_accuracy": 0.21416703313589097, "num_tokens": 91628665.0, "step": 52825 }, { "entropy": 5.901396226882935, "epoch": 4.110328729819101, "grad_norm": 1.40625, "learning_rate": 0.00034018673458699055, "loss": 5.0252, "mean_token_accuracy": 0.21156488060951234, "num_tokens": 91636850.0, "step": 52830 }, { "entropy": 5.801259517669678, "epoch": 4.110717759190819, "grad_norm": 1.421875, "learning_rate": 0.0003401602071764279, "loss": 4.9503, "mean_token_accuracy": 0.22276766151189803, "num_tokens": 91646142.0, "step": 52835 }, { "entropy": 5.783494472503662, "epoch": 4.1111067885625365, "grad_norm": 1.3203125, "learning_rate": 0.00034013367877716284, "loss": 4.9077, "mean_token_accuracy": 0.2112602949142456, "num_tokens": 91654637.0, "step": 52840 }, { "entropy": 5.84419994354248, "epoch": 4.111495817934254, "grad_norm": 1.390625, "learning_rate": 0.0003401071493895977, "loss": 4.9383, "mean_token_accuracy": 0.21010540425777435, "num_tokens": 91663208.0, "step": 52845 }, { "entropy": 5.796760320663452, "epoch": 4.111884847305972, "grad_norm": 1.3515625, "learning_rate": 0.0003400806190141354, "loss": 4.8287, "mean_token_accuracy": 0.2216264098882675, "num_tokens": 91671530.0, "step": 52850 }, { "entropy": 5.82997145652771, "epoch": 4.112273876677689, "grad_norm": 1.421875, "learning_rate": 0.00034005408765117815, "loss": 4.8779, "mean_token_accuracy": 0.21789925247430803, "num_tokens": 91680056.0, "step": 52855 }, { "entropy": 5.852447462081909, "epoch": 4.112662906049406, "grad_norm": 1.40625, "learning_rate": 0.00034002755530112877, "loss": 4.9672, "mean_token_accuracy": 0.21510377377271653, "num_tokens": 91688501.0, "step": 52860 }, { "entropy": 5.803278923034668, "epoch": 4.113051935421124, "grad_norm": 1.3359375, "learning_rate": 0.0003400010219643897, "loss": 4.8682, "mean_token_accuracy": 0.21593920290470123, "num_tokens": 91696869.0, "step": 52865 }, { "entropy": 5.804745626449585, "epoch": 4.113440964792842, "grad_norm": 1.28125, "learning_rate": 0.0003399744876413636, "loss": 4.9197, "mean_token_accuracy": 0.22157642394304275, "num_tokens": 91705300.0, "step": 52870 }, { "entropy": 5.850197887420654, "epoch": 4.1138299941645595, "grad_norm": 1.40625, "learning_rate": 0.000339947952332453, "loss": 4.9912, "mean_token_accuracy": 0.21330345273017884, "num_tokens": 91714218.0, "step": 52875 }, { "entropy": 5.88608341217041, "epoch": 4.114219023536277, "grad_norm": 1.5, "learning_rate": 0.00033992141603806064, "loss": 4.9665, "mean_token_accuracy": 0.2196979805827141, "num_tokens": 91723185.0, "step": 52880 }, { "entropy": 5.9192382335662845, "epoch": 4.114608052907995, "grad_norm": 1.4296875, "learning_rate": 0.00033989487875858915, "loss": 5.0434, "mean_token_accuracy": 0.20224591046571733, "num_tokens": 91732035.0, "step": 52885 }, { "entropy": 5.860176038742066, "epoch": 4.114997082279712, "grad_norm": 1.4140625, "learning_rate": 0.00033986834049444113, "loss": 4.8915, "mean_token_accuracy": 0.2140567734837532, "num_tokens": 91740657.0, "step": 52890 }, { "entropy": 5.8893311500549315, "epoch": 4.115386111651429, "grad_norm": 1.375, "learning_rate": 0.00033984180124601936, "loss": 5.0292, "mean_token_accuracy": 0.20481197088956832, "num_tokens": 91749894.0, "step": 52895 }, { "entropy": 5.7940216064453125, "epoch": 4.115775141023147, "grad_norm": 1.578125, "learning_rate": 0.00033981526101372635, "loss": 4.8671, "mean_token_accuracy": 0.21960383653640747, "num_tokens": 91759132.0, "step": 52900 }, { "entropy": 5.851868295669556, "epoch": 4.116164170394865, "grad_norm": 1.5703125, "learning_rate": 0.000339788719797965, "loss": 4.9795, "mean_token_accuracy": 0.20549817979335785, "num_tokens": 91767589.0, "step": 52905 }, { "entropy": 5.840805578231811, "epoch": 4.1165531997665825, "grad_norm": 1.5859375, "learning_rate": 0.0003397621775991379, "loss": 4.9402, "mean_token_accuracy": 0.21690140217542647, "num_tokens": 91776444.0, "step": 52910 }, { "entropy": 5.921496200561523, "epoch": 4.1169422291383, "grad_norm": 1.5, "learning_rate": 0.0003397356344176479, "loss": 5.0591, "mean_token_accuracy": 0.20775261521339417, "num_tokens": 91785332.0, "step": 52915 }, { "entropy": 5.834307241439819, "epoch": 4.117331258510018, "grad_norm": 1.4765625, "learning_rate": 0.0003397090902538976, "loss": 4.876, "mean_token_accuracy": 0.22727614492177964, "num_tokens": 91793798.0, "step": 52920 }, { "entropy": 5.8834545612335205, "epoch": 4.117720287881735, "grad_norm": 1.4375, "learning_rate": 0.00033968254510828995, "loss": 5.0275, "mean_token_accuracy": 0.21723342537879944, "num_tokens": 91802517.0, "step": 52925 }, { "entropy": 5.841442966461182, "epoch": 4.118109317253452, "grad_norm": 1.4140625, "learning_rate": 0.0003396559989812275, "loss": 4.8866, "mean_token_accuracy": 0.2159962922334671, "num_tokens": 91811038.0, "step": 52930 }, { "entropy": 5.872584390640259, "epoch": 4.11849834662517, "grad_norm": 1.265625, "learning_rate": 0.0003396294518731133, "loss": 4.9502, "mean_token_accuracy": 0.2143898382782936, "num_tokens": 91819987.0, "step": 52935 }, { "entropy": 5.782623529434204, "epoch": 4.118887375996888, "grad_norm": 1.453125, "learning_rate": 0.00033960290378435, "loss": 4.9766, "mean_token_accuracy": 0.21360776871442794, "num_tokens": 91827919.0, "step": 52940 }, { "entropy": 5.840401887893677, "epoch": 4.1192764053686055, "grad_norm": 1.3203125, "learning_rate": 0.00033957635471534045, "loss": 4.8846, "mean_token_accuracy": 0.2157055541872978, "num_tokens": 91836162.0, "step": 52945 }, { "entropy": 5.884769773483276, "epoch": 4.119665434740323, "grad_norm": 1.359375, "learning_rate": 0.0003395498046664875, "loss": 4.9905, "mean_token_accuracy": 0.21341006755828856, "num_tokens": 91844968.0, "step": 52950 }, { "entropy": 5.871742391586304, "epoch": 4.120054464112041, "grad_norm": 1.4453125, "learning_rate": 0.000339523253638194, "loss": 4.9383, "mean_token_accuracy": 0.2136014521121979, "num_tokens": 91852993.0, "step": 52955 }, { "entropy": 5.879800844192505, "epoch": 4.120443493483758, "grad_norm": 1.375, "learning_rate": 0.0003394967016308629, "loss": 4.9636, "mean_token_accuracy": 0.21868855357170106, "num_tokens": 91861435.0, "step": 52960 }, { "entropy": 5.829244995117188, "epoch": 4.120832522855475, "grad_norm": 1.4609375, "learning_rate": 0.0003394701486448968, "loss": 4.9001, "mean_token_accuracy": 0.21847460120916368, "num_tokens": 91870149.0, "step": 52965 }, { "entropy": 5.793951511383057, "epoch": 4.121221552227193, "grad_norm": 1.3046875, "learning_rate": 0.00033944359468069903, "loss": 4.9434, "mean_token_accuracy": 0.21318036913871766, "num_tokens": 91879110.0, "step": 52970 }, { "entropy": 5.837325763702393, "epoch": 4.121610581598911, "grad_norm": 1.40625, "learning_rate": 0.00033941703973867216, "loss": 4.8379, "mean_token_accuracy": 0.21839770227670668, "num_tokens": 91887433.0, "step": 52975 }, { "entropy": 5.832529211044312, "epoch": 4.1219996109706285, "grad_norm": 1.3671875, "learning_rate": 0.00033939048381921935, "loss": 4.9125, "mean_token_accuracy": 0.21573232263326644, "num_tokens": 91896251.0, "step": 52980 }, { "entropy": 5.783792018890381, "epoch": 4.122388640342346, "grad_norm": 1.3671875, "learning_rate": 0.0003393639269227434, "loss": 4.8874, "mean_token_accuracy": 0.22016567289829253, "num_tokens": 91905153.0, "step": 52985 }, { "entropy": 5.831999397277832, "epoch": 4.122777669714063, "grad_norm": 1.296875, "learning_rate": 0.0003393373690496473, "loss": 4.9378, "mean_token_accuracy": 0.2128165066242218, "num_tokens": 91913695.0, "step": 52990 }, { "entropy": 5.802449178695679, "epoch": 4.123166699085781, "grad_norm": 1.3515625, "learning_rate": 0.000339310810200334, "loss": 4.8517, "mean_token_accuracy": 0.21917189955711364, "num_tokens": 91922308.0, "step": 52995 }, { "entropy": 5.891654968261719, "epoch": 4.123555728457498, "grad_norm": 1.375, "learning_rate": 0.00033928425037520643, "loss": 5.0158, "mean_token_accuracy": 0.2106761395931244, "num_tokens": 91931267.0, "step": 53000 }, { "entropy": 5.847154569625855, "epoch": 4.123944757829216, "grad_norm": 1.3984375, "learning_rate": 0.0003392576895746678, "loss": 4.9718, "mean_token_accuracy": 0.21056586056947707, "num_tokens": 91939943.0, "step": 53005 }, { "entropy": 5.763431549072266, "epoch": 4.124333787200934, "grad_norm": 1.3984375, "learning_rate": 0.0003392311277991209, "loss": 4.8918, "mean_token_accuracy": 0.2137506499886513, "num_tokens": 91947886.0, "step": 53010 }, { "entropy": 5.874006557464599, "epoch": 4.1247228165726515, "grad_norm": 1.34375, "learning_rate": 0.00033920456504896895, "loss": 5.0738, "mean_token_accuracy": 0.20958210229873658, "num_tokens": 91956917.0, "step": 53015 }, { "entropy": 5.866233777999878, "epoch": 4.125111845944369, "grad_norm": 1.3984375, "learning_rate": 0.00033917800132461493, "loss": 4.8788, "mean_token_accuracy": 0.21473198384046555, "num_tokens": 91965798.0, "step": 53020 }, { "entropy": 5.835514640808105, "epoch": 4.125500875316086, "grad_norm": 1.2734375, "learning_rate": 0.0003391514366264619, "loss": 4.9086, "mean_token_accuracy": 0.22021978050470353, "num_tokens": 91974625.0, "step": 53025 }, { "entropy": 5.740242862701416, "epoch": 4.125889904687804, "grad_norm": 1.3828125, "learning_rate": 0.0003391248709549129, "loss": 4.8734, "mean_token_accuracy": 0.22300089448690413, "num_tokens": 91983090.0, "step": 53030 }, { "entropy": 5.753971099853516, "epoch": 4.126278934059521, "grad_norm": 1.4609375, "learning_rate": 0.0003390983043103711, "loss": 4.9304, "mean_token_accuracy": 0.21649895012378692, "num_tokens": 91991558.0, "step": 53035 }, { "entropy": 5.847105312347412, "epoch": 4.126667963431239, "grad_norm": 1.40625, "learning_rate": 0.0003390717366932395, "loss": 4.9775, "mean_token_accuracy": 0.21226462721824646, "num_tokens": 91999892.0, "step": 53040 }, { "entropy": 5.902355432510376, "epoch": 4.127056992802957, "grad_norm": 1.375, "learning_rate": 0.0003390451681039212, "loss": 5.0005, "mean_token_accuracy": 0.21563661396503447, "num_tokens": 92008562.0, "step": 53045 }, { "entropy": 5.829295825958252, "epoch": 4.1274460221746745, "grad_norm": 1.3828125, "learning_rate": 0.00033901859854281954, "loss": 4.9037, "mean_token_accuracy": 0.21464522927999496, "num_tokens": 92017217.0, "step": 53050 }, { "entropy": 5.85615234375, "epoch": 4.127835051546391, "grad_norm": 1.4296875, "learning_rate": 0.0003389920280103375, "loss": 4.972, "mean_token_accuracy": 0.2147740587592125, "num_tokens": 92025940.0, "step": 53055 }, { "entropy": 5.780269813537598, "epoch": 4.128224080918109, "grad_norm": 1.4375, "learning_rate": 0.00033896545650687824, "loss": 4.896, "mean_token_accuracy": 0.2167141169309616, "num_tokens": 92034884.0, "step": 53060 }, { "entropy": 5.881720399856567, "epoch": 4.128613110289827, "grad_norm": 1.40625, "learning_rate": 0.0003389388840328451, "loss": 4.9786, "mean_token_accuracy": 0.21618855744600296, "num_tokens": 92043934.0, "step": 53065 }, { "entropy": 5.862233018875122, "epoch": 4.129002139661544, "grad_norm": 1.40625, "learning_rate": 0.0003389123105886411, "loss": 4.951, "mean_token_accuracy": 0.2094405084848404, "num_tokens": 92052078.0, "step": 53070 }, { "entropy": 5.812042331695556, "epoch": 4.129391169033262, "grad_norm": 1.3046875, "learning_rate": 0.0003388857361746695, "loss": 4.9505, "mean_token_accuracy": 0.21577164232730867, "num_tokens": 92061054.0, "step": 53075 }, { "entropy": 5.903557538986206, "epoch": 4.12978019840498, "grad_norm": 1.265625, "learning_rate": 0.00033885916079133354, "loss": 5.056, "mean_token_accuracy": 0.20536187291145325, "num_tokens": 92069911.0, "step": 53080 }, { "entropy": 5.873223447799683, "epoch": 4.1301692277766975, "grad_norm": 1.3671875, "learning_rate": 0.00033883258443903646, "loss": 4.8505, "mean_token_accuracy": 0.21839212775230407, "num_tokens": 92078450.0, "step": 53085 }, { "entropy": 5.727860069274902, "epoch": 4.130558257148414, "grad_norm": 1.5, "learning_rate": 0.00033880600711818157, "loss": 4.901, "mean_token_accuracy": 0.21819747984409332, "num_tokens": 92087438.0, "step": 53090 }, { "entropy": 5.841617298126221, "epoch": 4.130947286520132, "grad_norm": 1.3125, "learning_rate": 0.00033877942882917203, "loss": 4.9705, "mean_token_accuracy": 0.22281511425971984, "num_tokens": 92095921.0, "step": 53095 }, { "entropy": 5.857618188858032, "epoch": 4.13133631589185, "grad_norm": 1.3046875, "learning_rate": 0.00033875284957241117, "loss": 4.9499, "mean_token_accuracy": 0.2091695934534073, "num_tokens": 92104579.0, "step": 53100 }, { "entropy": 5.778086519241333, "epoch": 4.131725345263567, "grad_norm": 1.375, "learning_rate": 0.0003387262693483023, "loss": 4.8318, "mean_token_accuracy": 0.22095065712928771, "num_tokens": 92112749.0, "step": 53105 }, { "entropy": 5.85557336807251, "epoch": 4.132114374635285, "grad_norm": 1.4375, "learning_rate": 0.00033869968815724866, "loss": 4.9063, "mean_token_accuracy": 0.2153204619884491, "num_tokens": 92120977.0, "step": 53110 }, { "entropy": 5.7384131908416744, "epoch": 4.132503404007003, "grad_norm": 1.4609375, "learning_rate": 0.0003386731059996537, "loss": 4.8043, "mean_token_accuracy": 0.2297930747270584, "num_tokens": 92129086.0, "step": 53115 }, { "entropy": 5.82343111038208, "epoch": 4.1328924333787205, "grad_norm": 1.3828125, "learning_rate": 0.00033864652287592074, "loss": 4.9389, "mean_token_accuracy": 0.2170750230550766, "num_tokens": 92137831.0, "step": 53120 }, { "entropy": 5.889012670516967, "epoch": 4.133281462750437, "grad_norm": 1.40625, "learning_rate": 0.00033861993878645305, "loss": 4.9604, "mean_token_accuracy": 0.21085717529058456, "num_tokens": 92146441.0, "step": 53125 }, { "entropy": 5.912505626678467, "epoch": 4.133670492122155, "grad_norm": 1.2734375, "learning_rate": 0.000338593353731654, "loss": 4.9352, "mean_token_accuracy": 0.218081296980381, "num_tokens": 92154775.0, "step": 53130 }, { "entropy": 5.955947637557983, "epoch": 4.134059521493873, "grad_norm": 1.3828125, "learning_rate": 0.0003385667677119271, "loss": 5.0529, "mean_token_accuracy": 0.2031143769621849, "num_tokens": 92163870.0, "step": 53135 }, { "entropy": 5.8521833419799805, "epoch": 4.13444855086559, "grad_norm": 1.3671875, "learning_rate": 0.00033854018072767574, "loss": 4.9121, "mean_token_accuracy": 0.22268462181091309, "num_tokens": 92173265.0, "step": 53140 }, { "entropy": 5.943776416778564, "epoch": 4.134837580237308, "grad_norm": 1.546875, "learning_rate": 0.00033851359277930316, "loss": 5.0131, "mean_token_accuracy": 0.20918085277080536, "num_tokens": 92182459.0, "step": 53145 }, { "entropy": 5.883854532241822, "epoch": 4.135226609609026, "grad_norm": 1.3359375, "learning_rate": 0.0003384870038672129, "loss": 4.9533, "mean_token_accuracy": 0.21723269820213317, "num_tokens": 92191414.0, "step": 53150 }, { "entropy": 5.88086199760437, "epoch": 4.1356156389807435, "grad_norm": 1.375, "learning_rate": 0.0003384604139918085, "loss": 5.0016, "mean_token_accuracy": 0.21233344972133636, "num_tokens": 92199926.0, "step": 53155 }, { "entropy": 5.876166868209839, "epoch": 4.13600466835246, "grad_norm": 1.5078125, "learning_rate": 0.00033843382315349325, "loss": 4.9832, "mean_token_accuracy": 0.21622217148542405, "num_tokens": 92208399.0, "step": 53160 }, { "entropy": 5.8664548873901365, "epoch": 4.136393697724178, "grad_norm": 1.3828125, "learning_rate": 0.00033840723135267073, "loss": 5.0804, "mean_token_accuracy": 0.20267845541238785, "num_tokens": 92218110.0, "step": 53165 }, { "entropy": 5.852568054199219, "epoch": 4.136782727095896, "grad_norm": 1.359375, "learning_rate": 0.00033838063858974434, "loss": 4.9694, "mean_token_accuracy": 0.20983310788869858, "num_tokens": 92227322.0, "step": 53170 }, { "entropy": 5.847979640960693, "epoch": 4.137171756467613, "grad_norm": 1.40625, "learning_rate": 0.0003383540448651177, "loss": 4.8757, "mean_token_accuracy": 0.22001961320638658, "num_tokens": 92235459.0, "step": 53175 }, { "entropy": 5.867280101776123, "epoch": 4.137560785839331, "grad_norm": 1.390625, "learning_rate": 0.00033832745017919424, "loss": 5.0072, "mean_token_accuracy": 0.20514819175004959, "num_tokens": 92244930.0, "step": 53180 }, { "entropy": 5.833106660842896, "epoch": 4.137949815211049, "grad_norm": 1.328125, "learning_rate": 0.00033830085453237757, "loss": 5.0017, "mean_token_accuracy": 0.2099720448255539, "num_tokens": 92254199.0, "step": 53185 }, { "entropy": 5.843534708023071, "epoch": 4.138338844582766, "grad_norm": 1.34375, "learning_rate": 0.0003382742579250712, "loss": 4.9443, "mean_token_accuracy": 0.2092881605029106, "num_tokens": 92262762.0, "step": 53190 }, { "entropy": 5.8687989711761475, "epoch": 4.138727873954483, "grad_norm": 1.3671875, "learning_rate": 0.0003382476603576785, "loss": 4.9325, "mean_token_accuracy": 0.21518648266792298, "num_tokens": 92270705.0, "step": 53195 }, { "entropy": 5.862856388092041, "epoch": 4.139116903326201, "grad_norm": 1.34375, "learning_rate": 0.0003382210618306034, "loss": 4.9166, "mean_token_accuracy": 0.2125919371843338, "num_tokens": 92279778.0, "step": 53200 }, { "entropy": 5.827776861190796, "epoch": 4.139505932697919, "grad_norm": 1.34375, "learning_rate": 0.0003381944623442492, "loss": 4.8957, "mean_token_accuracy": 0.21817974001169205, "num_tokens": 92288317.0, "step": 53205 }, { "entropy": 5.887194871902466, "epoch": 4.139894962069636, "grad_norm": 1.3671875, "learning_rate": 0.0003381678618990197, "loss": 5.0076, "mean_token_accuracy": 0.21382184624671935, "num_tokens": 92297206.0, "step": 53210 }, { "entropy": 5.90402307510376, "epoch": 4.140283991441354, "grad_norm": 1.2734375, "learning_rate": 0.0003381412604953185, "loss": 4.9711, "mean_token_accuracy": 0.2074090749025345, "num_tokens": 92306240.0, "step": 53215 }, { "entropy": 5.826938009262085, "epoch": 4.140673020813072, "grad_norm": 1.40625, "learning_rate": 0.0003381146581335491, "loss": 4.7797, "mean_token_accuracy": 0.22848791629076004, "num_tokens": 92314241.0, "step": 53220 }, { "entropy": 5.827952575683594, "epoch": 4.141062050184789, "grad_norm": 1.390625, "learning_rate": 0.0003380880548141152, "loss": 4.9549, "mean_token_accuracy": 0.20842324793338776, "num_tokens": 92323071.0, "step": 53225 }, { "entropy": 5.799980163574219, "epoch": 4.141451079556506, "grad_norm": 1.375, "learning_rate": 0.00033806145053742043, "loss": 4.9071, "mean_token_accuracy": 0.21716368943452835, "num_tokens": 92331993.0, "step": 53230 }, { "entropy": 5.869219350814819, "epoch": 4.141840108928224, "grad_norm": 1.5390625, "learning_rate": 0.0003380348453038686, "loss": 4.9276, "mean_token_accuracy": 0.21501462012529374, "num_tokens": 92340335.0, "step": 53235 }, { "entropy": 5.835952425003052, "epoch": 4.142229138299942, "grad_norm": 1.359375, "learning_rate": 0.0003380082391138633, "loss": 4.9164, "mean_token_accuracy": 0.2227776825428009, "num_tokens": 92348668.0, "step": 53240 }, { "entropy": 5.820970630645752, "epoch": 4.142618167671659, "grad_norm": 1.2578125, "learning_rate": 0.0003379816319678083, "loss": 4.911, "mean_token_accuracy": 0.2181873142719269, "num_tokens": 92358153.0, "step": 53245 }, { "entropy": 5.857251453399658, "epoch": 4.143007197043377, "grad_norm": 1.4609375, "learning_rate": 0.0003379550238661072, "loss": 4.9244, "mean_token_accuracy": 0.21793729960918426, "num_tokens": 92367441.0, "step": 53250 }, { "entropy": 5.860657596588135, "epoch": 4.143396226415095, "grad_norm": 1.359375, "learning_rate": 0.00033792841480916394, "loss": 4.953, "mean_token_accuracy": 0.21567545533180238, "num_tokens": 92375784.0, "step": 53255 }, { "entropy": 5.806259632110596, "epoch": 4.143785255786812, "grad_norm": 1.4140625, "learning_rate": 0.00033790180479738205, "loss": 4.8568, "mean_token_accuracy": 0.22313224375247956, "num_tokens": 92383776.0, "step": 53260 }, { "entropy": 5.77839617729187, "epoch": 4.144174285158529, "grad_norm": 1.4375, "learning_rate": 0.0003378751938311654, "loss": 4.9161, "mean_token_accuracy": 0.2058481901884079, "num_tokens": 92393482.0, "step": 53265 }, { "entropy": 5.9274969577789305, "epoch": 4.144563314530247, "grad_norm": 1.328125, "learning_rate": 0.0003378485819109177, "loss": 5.0833, "mean_token_accuracy": 0.2126658946275711, "num_tokens": 92401991.0, "step": 53270 }, { "entropy": 5.938638067245483, "epoch": 4.144952343901965, "grad_norm": 1.40625, "learning_rate": 0.00033782196903704286, "loss": 5.0164, "mean_token_accuracy": 0.2131844937801361, "num_tokens": 92410624.0, "step": 53275 }, { "entropy": 5.848576784133911, "epoch": 4.145341373273682, "grad_norm": 1.3359375, "learning_rate": 0.0003377953552099447, "loss": 4.9714, "mean_token_accuracy": 0.21264789253473282, "num_tokens": 92419846.0, "step": 53280 }, { "entropy": 5.705717468261719, "epoch": 4.1457304026454, "grad_norm": 1.328125, "learning_rate": 0.0003377687404300269, "loss": 4.815, "mean_token_accuracy": 0.2155806988477707, "num_tokens": 92428361.0, "step": 53285 }, { "entropy": 5.77975549697876, "epoch": 4.146119432017118, "grad_norm": 1.359375, "learning_rate": 0.0003377421246976934, "loss": 4.8401, "mean_token_accuracy": 0.21758217960596085, "num_tokens": 92437587.0, "step": 53290 }, { "entropy": 5.871543312072754, "epoch": 4.1465084613888346, "grad_norm": 1.328125, "learning_rate": 0.00033771550801334806, "loss": 4.9641, "mean_token_accuracy": 0.20645171403884888, "num_tokens": 92447374.0, "step": 53295 }, { "entropy": 5.9529203414917, "epoch": 4.146897490760552, "grad_norm": 1.390625, "learning_rate": 0.00033768889037739464, "loss": 4.9899, "mean_token_accuracy": 0.2081824541091919, "num_tokens": 92456308.0, "step": 53300 }, { "entropy": 5.830790996551514, "epoch": 4.14728652013227, "grad_norm": 1.359375, "learning_rate": 0.00033766227179023704, "loss": 4.9122, "mean_token_accuracy": 0.22505487203598024, "num_tokens": 92465416.0, "step": 53305 }, { "entropy": 5.833309507369995, "epoch": 4.147675549503988, "grad_norm": 1.46875, "learning_rate": 0.00033763565225227934, "loss": 4.8229, "mean_token_accuracy": 0.22772733867168427, "num_tokens": 92473622.0, "step": 53310 }, { "entropy": 5.884306383132935, "epoch": 4.148064578875705, "grad_norm": 1.4296875, "learning_rate": 0.0003376090317639252, "loss": 5.0015, "mean_token_accuracy": 0.2079775735735893, "num_tokens": 92482122.0, "step": 53315 }, { "entropy": 5.866298246383667, "epoch": 4.148453608247423, "grad_norm": 1.5234375, "learning_rate": 0.00033758241032557875, "loss": 4.9932, "mean_token_accuracy": 0.2140104964375496, "num_tokens": 92490241.0, "step": 53320 }, { "entropy": 5.837467527389526, "epoch": 4.14884263761914, "grad_norm": 1.4453125, "learning_rate": 0.00033755578793764375, "loss": 4.8492, "mean_token_accuracy": 0.2124623104929924, "num_tokens": 92498176.0, "step": 53325 }, { "entropy": 5.752054166793823, "epoch": 4.1492316669908575, "grad_norm": 1.265625, "learning_rate": 0.0003375291646005243, "loss": 4.8523, "mean_token_accuracy": 0.21876205652952194, "num_tokens": 92506767.0, "step": 53330 }, { "entropy": 5.856043767929077, "epoch": 4.149620696362575, "grad_norm": 1.390625, "learning_rate": 0.00033750254031462425, "loss": 4.8965, "mean_token_accuracy": 0.22181223779916764, "num_tokens": 92515942.0, "step": 53335 }, { "entropy": 5.8891524314880375, "epoch": 4.150009725734293, "grad_norm": 1.359375, "learning_rate": 0.00033747591508034765, "loss": 4.9615, "mean_token_accuracy": 0.21169962584972382, "num_tokens": 92524135.0, "step": 53340 }, { "entropy": 5.751809406280517, "epoch": 4.150398755106011, "grad_norm": 1.375, "learning_rate": 0.0003374492888980985, "loss": 4.7557, "mean_token_accuracy": 0.22829776853322983, "num_tokens": 92532445.0, "step": 53345 }, { "entropy": 5.756174373626709, "epoch": 4.150787784477728, "grad_norm": 1.5234375, "learning_rate": 0.00033742266176828073, "loss": 4.8737, "mean_token_accuracy": 0.22552729547023773, "num_tokens": 92540901.0, "step": 53350 }, { "entropy": 5.767401456832886, "epoch": 4.151176813849446, "grad_norm": 1.4140625, "learning_rate": 0.00033739603369129846, "loss": 4.8856, "mean_token_accuracy": 0.22306810617446898, "num_tokens": 92548858.0, "step": 53355 }, { "entropy": 5.886229419708252, "epoch": 4.151565843221163, "grad_norm": 1.3359375, "learning_rate": 0.00033736940466755566, "loss": 4.9914, "mean_token_accuracy": 0.20706396996974946, "num_tokens": 92558068.0, "step": 53360 }, { "entropy": 5.9186217308044435, "epoch": 4.1519548725928805, "grad_norm": 1.375, "learning_rate": 0.00033734277469745644, "loss": 4.9299, "mean_token_accuracy": 0.21656395345926285, "num_tokens": 92567736.0, "step": 53365 }, { "entropy": 5.851899719238281, "epoch": 4.152343901964598, "grad_norm": 1.2578125, "learning_rate": 0.0003373161437814049, "loss": 4.8962, "mean_token_accuracy": 0.21408206075429917, "num_tokens": 92576994.0, "step": 53370 }, { "entropy": 5.824721336364746, "epoch": 4.152732931336316, "grad_norm": 1.5546875, "learning_rate": 0.00033728951191980505, "loss": 4.9184, "mean_token_accuracy": 0.20799511224031447, "num_tokens": 92585228.0, "step": 53375 }, { "entropy": 5.797149753570556, "epoch": 4.153121960708034, "grad_norm": 1.4296875, "learning_rate": 0.00033726287911306095, "loss": 4.9384, "mean_token_accuracy": 0.2187606394290924, "num_tokens": 92593754.0, "step": 53380 }, { "entropy": 5.902160882949829, "epoch": 4.153510990079751, "grad_norm": 1.5, "learning_rate": 0.0003372362453615768, "loss": 4.9727, "mean_token_accuracy": 0.21380991190671922, "num_tokens": 92603502.0, "step": 53385 }, { "entropy": 5.911434316635132, "epoch": 4.153900019451468, "grad_norm": 1.7734375, "learning_rate": 0.0003372096106657566, "loss": 5.0838, "mean_token_accuracy": 0.2103756234049797, "num_tokens": 92613639.0, "step": 53390 }, { "entropy": 5.918667030334473, "epoch": 4.154289048823186, "grad_norm": 1.453125, "learning_rate": 0.00033718297502600465, "loss": 5.0381, "mean_token_accuracy": 0.19921103864908218, "num_tokens": 92622846.0, "step": 53395 }, { "entropy": 5.882130098342896, "epoch": 4.1546780781949035, "grad_norm": 1.5234375, "learning_rate": 0.00033715633844272504, "loss": 4.9, "mean_token_accuracy": 0.220849846303463, "num_tokens": 92631592.0, "step": 53400 }, { "entropy": 5.858701992034912, "epoch": 4.155067107566621, "grad_norm": 1.421875, "learning_rate": 0.00033712970091632187, "loss": 4.9622, "mean_token_accuracy": 0.21262859106063842, "num_tokens": 92640152.0, "step": 53405 }, { "entropy": 5.824657392501831, "epoch": 4.155456136938339, "grad_norm": 1.46875, "learning_rate": 0.00033710306244719954, "loss": 4.9191, "mean_token_accuracy": 0.21695710122585296, "num_tokens": 92648018.0, "step": 53410 }, { "entropy": 5.841556406021118, "epoch": 4.155845166310057, "grad_norm": 1.3671875, "learning_rate": 0.0003370764230357619, "loss": 4.9436, "mean_token_accuracy": 0.21142674535512923, "num_tokens": 92656426.0, "step": 53415 }, { "entropy": 5.778595590591431, "epoch": 4.156234195681774, "grad_norm": 1.3984375, "learning_rate": 0.0003370497826824134, "loss": 4.8769, "mean_token_accuracy": 0.2120707780122757, "num_tokens": 92665694.0, "step": 53420 }, { "entropy": 5.841378927230835, "epoch": 4.156623225053491, "grad_norm": 1.359375, "learning_rate": 0.0003370231413875582, "loss": 4.9589, "mean_token_accuracy": 0.21781778037548066, "num_tokens": 92674970.0, "step": 53425 }, { "entropy": 5.833185625076294, "epoch": 4.157012254425209, "grad_norm": 1.46875, "learning_rate": 0.00033699649915160053, "loss": 4.8613, "mean_token_accuracy": 0.22101002782583237, "num_tokens": 92682490.0, "step": 53430 }, { "entropy": 5.814183712005615, "epoch": 4.1574012837969265, "grad_norm": 1.40625, "learning_rate": 0.00033696985597494474, "loss": 4.917, "mean_token_accuracy": 0.21510798037052153, "num_tokens": 92690499.0, "step": 53435 }, { "entropy": 5.803383541107178, "epoch": 4.157790313168644, "grad_norm": 1.53125, "learning_rate": 0.000336943211857995, "loss": 4.9234, "mean_token_accuracy": 0.21198660284280776, "num_tokens": 92698457.0, "step": 53440 }, { "entropy": 5.864917325973511, "epoch": 4.158179342540362, "grad_norm": 1.453125, "learning_rate": 0.0003369165668011556, "loss": 5.0628, "mean_token_accuracy": 0.20996655970811845, "num_tokens": 92707621.0, "step": 53445 }, { "entropy": 5.914461469650268, "epoch": 4.15856837191208, "grad_norm": 1.3203125, "learning_rate": 0.0003368899208048308, "loss": 5.0407, "mean_token_accuracy": 0.2060912072658539, "num_tokens": 92716667.0, "step": 53450 }, { "entropy": 5.856558322906494, "epoch": 4.158957401283797, "grad_norm": 1.3203125, "learning_rate": 0.00033686327386942504, "loss": 4.92, "mean_token_accuracy": 0.21002083122730256, "num_tokens": 92725243.0, "step": 53455 }, { "entropy": 5.888833332061767, "epoch": 4.159346430655514, "grad_norm": 1.328125, "learning_rate": 0.0003368366259953425, "loss": 5.0208, "mean_token_accuracy": 0.20744064450263977, "num_tokens": 92733849.0, "step": 53460 }, { "entropy": 5.922597503662109, "epoch": 4.159735460027232, "grad_norm": 1.4140625, "learning_rate": 0.00033680997718298756, "loss": 5.037, "mean_token_accuracy": 0.20525020658969878, "num_tokens": 92742348.0, "step": 53465 }, { "entropy": 5.891862154006958, "epoch": 4.1601244893989495, "grad_norm": 1.3359375, "learning_rate": 0.00033678332743276466, "loss": 4.9286, "mean_token_accuracy": 0.21823608726263047, "num_tokens": 92751362.0, "step": 53470 }, { "entropy": 5.818622303009033, "epoch": 4.160513518770667, "grad_norm": 1.328125, "learning_rate": 0.0003367566767450781, "loss": 4.8695, "mean_token_accuracy": 0.2180062174797058, "num_tokens": 92760352.0, "step": 53475 }, { "entropy": 5.76175537109375, "epoch": 4.160902548142385, "grad_norm": 1.4609375, "learning_rate": 0.00033673002512033223, "loss": 4.8802, "mean_token_accuracy": 0.21987295001745225, "num_tokens": 92768638.0, "step": 53480 }, { "entropy": 5.748768043518067, "epoch": 4.161291577514103, "grad_norm": 1.3828125, "learning_rate": 0.0003367033725589315, "loss": 4.8453, "mean_token_accuracy": 0.22255823761224747, "num_tokens": 92777457.0, "step": 53485 }, { "entropy": 5.822329187393189, "epoch": 4.16168060688582, "grad_norm": 1.3984375, "learning_rate": 0.0003366767190612804, "loss": 4.9415, "mean_token_accuracy": 0.2154759496450424, "num_tokens": 92786385.0, "step": 53490 }, { "entropy": 5.909303045272827, "epoch": 4.162069636257537, "grad_norm": 1.359375, "learning_rate": 0.0003366500646277831, "loss": 4.976, "mean_token_accuracy": 0.21173890084028243, "num_tokens": 92794724.0, "step": 53495 }, { "entropy": 5.850612163543701, "epoch": 4.162458665629255, "grad_norm": 1.40625, "learning_rate": 0.0003366234092588443, "loss": 4.9512, "mean_token_accuracy": 0.2123957246541977, "num_tokens": 92803229.0, "step": 53500 }, { "entropy": 5.851525974273682, "epoch": 4.1628476950009725, "grad_norm": 1.421875, "learning_rate": 0.00033659675295486826, "loss": 4.9671, "mean_token_accuracy": 0.2129154920578003, "num_tokens": 92812285.0, "step": 53505 }, { "entropy": 5.821687316894531, "epoch": 4.16323672437269, "grad_norm": 1.4453125, "learning_rate": 0.00033657009571625964, "loss": 4.9259, "mean_token_accuracy": 0.21083459705114366, "num_tokens": 92820751.0, "step": 53510 }, { "entropy": 5.8375657081604, "epoch": 4.163625753744408, "grad_norm": 1.3671875, "learning_rate": 0.0003365434375434227, "loss": 4.8919, "mean_token_accuracy": 0.2214834585785866, "num_tokens": 92829160.0, "step": 53515 }, { "entropy": 5.817561769485474, "epoch": 4.164014783116126, "grad_norm": 1.328125, "learning_rate": 0.00033651677843676213, "loss": 4.9551, "mean_token_accuracy": 0.2109537184238434, "num_tokens": 92838260.0, "step": 53520 }, { "entropy": 5.748615646362305, "epoch": 4.164403812487842, "grad_norm": 1.3515625, "learning_rate": 0.0003364901183966824, "loss": 4.8011, "mean_token_accuracy": 0.22379323840141296, "num_tokens": 92847272.0, "step": 53525 }, { "entropy": 5.83947434425354, "epoch": 4.16479284185956, "grad_norm": 1.4140625, "learning_rate": 0.0003364634574235879, "loss": 4.882, "mean_token_accuracy": 0.21802281737327575, "num_tokens": 92856038.0, "step": 53530 }, { "entropy": 5.888909864425659, "epoch": 4.165181871231278, "grad_norm": 1.453125, "learning_rate": 0.00033643679551788325, "loss": 4.9212, "mean_token_accuracy": 0.2189861997961998, "num_tokens": 92864038.0, "step": 53535 }, { "entropy": 5.846358776092529, "epoch": 4.1655709006029955, "grad_norm": 1.3671875, "learning_rate": 0.00033641013267997317, "loss": 5.052, "mean_token_accuracy": 0.21188123673200607, "num_tokens": 92872312.0, "step": 53540 }, { "entropy": 5.820207262039185, "epoch": 4.165959929974713, "grad_norm": 1.3515625, "learning_rate": 0.00033638346891026196, "loss": 4.9714, "mean_token_accuracy": 0.20977292209863663, "num_tokens": 92881193.0, "step": 53545 }, { "entropy": 5.9242878437042235, "epoch": 4.166348959346431, "grad_norm": 1.4140625, "learning_rate": 0.00033635680420915424, "loss": 4.9907, "mean_token_accuracy": 0.216770438849926, "num_tokens": 92889482.0, "step": 53550 }, { "entropy": 5.883403730392456, "epoch": 4.166737988718149, "grad_norm": 1.4375, "learning_rate": 0.0003363301385770548, "loss": 5.0182, "mean_token_accuracy": 0.21447993367910384, "num_tokens": 92899155.0, "step": 53555 }, { "entropy": 5.877398204803467, "epoch": 4.167127018089865, "grad_norm": 1.3515625, "learning_rate": 0.00033630347201436806, "loss": 4.9845, "mean_token_accuracy": 0.21235758513212205, "num_tokens": 92907379.0, "step": 53560 }, { "entropy": 5.901299476623535, "epoch": 4.167516047461583, "grad_norm": 1.3671875, "learning_rate": 0.00033627680452149873, "loss": 4.9603, "mean_token_accuracy": 0.2131791114807129, "num_tokens": 92916456.0, "step": 53565 }, { "entropy": 5.876926708221435, "epoch": 4.167905076833301, "grad_norm": 1.375, "learning_rate": 0.0003362501360988514, "loss": 4.9328, "mean_token_accuracy": 0.21066430807113648, "num_tokens": 92925005.0, "step": 53570 }, { "entropy": 5.880606460571289, "epoch": 4.1682941062050185, "grad_norm": 1.4140625, "learning_rate": 0.0003362234667468308, "loss": 4.9638, "mean_token_accuracy": 0.20902488082647325, "num_tokens": 92934126.0, "step": 53575 }, { "entropy": 5.873444843292236, "epoch": 4.168683135576736, "grad_norm": 1.390625, "learning_rate": 0.0003361967964658415, "loss": 4.9446, "mean_token_accuracy": 0.21513715237379075, "num_tokens": 92943366.0, "step": 53580 }, { "entropy": 5.86112756729126, "epoch": 4.169072164948454, "grad_norm": 1.390625, "learning_rate": 0.0003361701252562882, "loss": 4.9331, "mean_token_accuracy": 0.2103131115436554, "num_tokens": 92952471.0, "step": 53585 }, { "entropy": 5.863969707489014, "epoch": 4.169461194320172, "grad_norm": 1.3828125, "learning_rate": 0.00033614345311857566, "loss": 4.9607, "mean_token_accuracy": 0.21950817853212357, "num_tokens": 92960830.0, "step": 53590 }, { "entropy": 5.849753427505493, "epoch": 4.169850223691888, "grad_norm": 1.5, "learning_rate": 0.0003361167800531085, "loss": 4.9097, "mean_token_accuracy": 0.2255066379904747, "num_tokens": 92969387.0, "step": 53595 }, { "entropy": 5.79392442703247, "epoch": 4.170239253063606, "grad_norm": 1.296875, "learning_rate": 0.0003360901060602915, "loss": 4.8627, "mean_token_accuracy": 0.2176664113998413, "num_tokens": 92977928.0, "step": 53600 }, { "entropy": 5.836771059036255, "epoch": 4.170628282435324, "grad_norm": 1.5625, "learning_rate": 0.00033606343114052936, "loss": 4.9312, "mean_token_accuracy": 0.20728082954883575, "num_tokens": 92986233.0, "step": 53605 }, { "entropy": 5.819192743301391, "epoch": 4.1710173118070415, "grad_norm": 1.34375, "learning_rate": 0.00033603675529422685, "loss": 4.8731, "mean_token_accuracy": 0.21623292565345764, "num_tokens": 92995324.0, "step": 53610 }, { "entropy": 5.824749898910523, "epoch": 4.171406341178759, "grad_norm": 1.40625, "learning_rate": 0.0003360100785217887, "loss": 4.8937, "mean_token_accuracy": 0.21251485049724578, "num_tokens": 93003475.0, "step": 53615 }, { "entropy": 5.81056022644043, "epoch": 4.171795370550477, "grad_norm": 1.4765625, "learning_rate": 0.0003359834008236198, "loss": 4.9395, "mean_token_accuracy": 0.2147168517112732, "num_tokens": 93011999.0, "step": 53620 }, { "entropy": 5.798842906951904, "epoch": 4.172184399922194, "grad_norm": 1.3125, "learning_rate": 0.0003359567222001248, "loss": 4.8517, "mean_token_accuracy": 0.21532589197158813, "num_tokens": 93021188.0, "step": 53625 }, { "entropy": 5.849372529983521, "epoch": 4.172573429293911, "grad_norm": 1.390625, "learning_rate": 0.0003359300426517085, "loss": 4.9466, "mean_token_accuracy": 0.2131170317530632, "num_tokens": 93029861.0, "step": 53630 }, { "entropy": 5.838745927810669, "epoch": 4.172962458665629, "grad_norm": 1.359375, "learning_rate": 0.0003359033621787759, "loss": 4.9403, "mean_token_accuracy": 0.2125028043985367, "num_tokens": 93037657.0, "step": 53635 }, { "entropy": 5.845746946334839, "epoch": 4.173351488037347, "grad_norm": 1.421875, "learning_rate": 0.0003358766807817317, "loss": 4.9827, "mean_token_accuracy": 0.2090184882283211, "num_tokens": 93046295.0, "step": 53640 }, { "entropy": 5.898080682754516, "epoch": 4.1737405174090645, "grad_norm": 1.5, "learning_rate": 0.0003358499984609807, "loss": 4.956, "mean_token_accuracy": 0.21833345144987107, "num_tokens": 93053831.0, "step": 53645 }, { "entropy": 5.8439373016357425, "epoch": 4.174129546780782, "grad_norm": 1.328125, "learning_rate": 0.0003358233152169278, "loss": 4.9091, "mean_token_accuracy": 0.21727929413318633, "num_tokens": 93062580.0, "step": 53650 }, { "entropy": 5.838990926742554, "epoch": 4.1745185761525, "grad_norm": 1.3828125, "learning_rate": 0.00033579663104997803, "loss": 4.9557, "mean_token_accuracy": 0.21563037484884262, "num_tokens": 93072090.0, "step": 53655 }, { "entropy": 5.8875500679016115, "epoch": 4.174907605524217, "grad_norm": 1.3359375, "learning_rate": 0.00033576994596053606, "loss": 4.9913, "mean_token_accuracy": 0.2098407581448555, "num_tokens": 93080363.0, "step": 53660 }, { "entropy": 5.866995143890381, "epoch": 4.175296634895934, "grad_norm": 1.4609375, "learning_rate": 0.0003357432599490069, "loss": 4.9375, "mean_token_accuracy": 0.21835999488830565, "num_tokens": 93088648.0, "step": 53665 }, { "entropy": 5.8161375522613525, "epoch": 4.175685664267652, "grad_norm": 1.28125, "learning_rate": 0.00033571657301579547, "loss": 4.8174, "mean_token_accuracy": 0.22200871706008912, "num_tokens": 93097534.0, "step": 53670 }, { "entropy": 5.8168755054473875, "epoch": 4.17607469363937, "grad_norm": 1.34375, "learning_rate": 0.0003356898851613067, "loss": 4.9147, "mean_token_accuracy": 0.20999386608600618, "num_tokens": 93106902.0, "step": 53675 }, { "entropy": 5.8229578018188475, "epoch": 4.1764637230110875, "grad_norm": 1.34375, "learning_rate": 0.0003356631963859455, "loss": 4.9123, "mean_token_accuracy": 0.22281166166067123, "num_tokens": 93115208.0, "step": 53680 }, { "entropy": 5.844051837921143, "epoch": 4.176852752382805, "grad_norm": 1.2890625, "learning_rate": 0.0003356365066901168, "loss": 4.8675, "mean_token_accuracy": 0.2190563216805458, "num_tokens": 93124493.0, "step": 53685 }, { "entropy": 5.785353279113769, "epoch": 4.177241781754523, "grad_norm": 1.296875, "learning_rate": 0.00033560981607422567, "loss": 4.9511, "mean_token_accuracy": 0.21268073171377183, "num_tokens": 93133984.0, "step": 53690 }, { "entropy": 5.8772913932800295, "epoch": 4.17763081112624, "grad_norm": 1.3671875, "learning_rate": 0.00033558312453867703, "loss": 5.03, "mean_token_accuracy": 0.20563017427921296, "num_tokens": 93143134.0, "step": 53695 }, { "entropy": 5.890900993347168, "epoch": 4.178019840497957, "grad_norm": 1.4765625, "learning_rate": 0.00033555643208387593, "loss": 4.9803, "mean_token_accuracy": 0.21998907774686813, "num_tokens": 93151192.0, "step": 53700 }, { "entropy": 5.853398942947388, "epoch": 4.178408869869675, "grad_norm": 1.234375, "learning_rate": 0.00033552973871022737, "loss": 4.9172, "mean_token_accuracy": 0.21735426783561707, "num_tokens": 93160300.0, "step": 53705 }, { "entropy": 5.776984214782715, "epoch": 4.178797899241393, "grad_norm": 1.359375, "learning_rate": 0.00033550304441813634, "loss": 4.8891, "mean_token_accuracy": 0.21758211851119996, "num_tokens": 93169441.0, "step": 53710 }, { "entropy": 5.827760553359985, "epoch": 4.1791869286131105, "grad_norm": 1.3515625, "learning_rate": 0.0003354763492080079, "loss": 4.9237, "mean_token_accuracy": 0.2240286648273468, "num_tokens": 93177763.0, "step": 53715 }, { "entropy": 5.885996770858765, "epoch": 4.179575957984828, "grad_norm": 1.4296875, "learning_rate": 0.0003354496530802472, "loss": 4.9618, "mean_token_accuracy": 0.21505932062864302, "num_tokens": 93186665.0, "step": 53720 }, { "entropy": 5.764900779724121, "epoch": 4.179964987356545, "grad_norm": 1.4296875, "learning_rate": 0.0003354229560352592, "loss": 4.8688, "mean_token_accuracy": 0.21828958094120027, "num_tokens": 93195574.0, "step": 53725 }, { "entropy": 5.7927014350891115, "epoch": 4.180354016728263, "grad_norm": 1.421875, "learning_rate": 0.0003353962580734489, "loss": 4.9386, "mean_token_accuracy": 0.21195422261953353, "num_tokens": 93204933.0, "step": 53730 }, { "entropy": 5.844230031967163, "epoch": 4.18074304609998, "grad_norm": 1.390625, "learning_rate": 0.00033536955919522167, "loss": 4.8303, "mean_token_accuracy": 0.22718557417392732, "num_tokens": 93212644.0, "step": 53735 }, { "entropy": 5.81821608543396, "epoch": 4.181132075471698, "grad_norm": 1.4609375, "learning_rate": 0.0003353428594009824, "loss": 4.9322, "mean_token_accuracy": 0.21441629230976106, "num_tokens": 93221094.0, "step": 53740 }, { "entropy": 5.878925609588623, "epoch": 4.181521104843416, "grad_norm": 1.453125, "learning_rate": 0.00033531615869113624, "loss": 5.0097, "mean_token_accuracy": 0.20636970698833465, "num_tokens": 93229681.0, "step": 53745 }, { "entropy": 5.784231042861938, "epoch": 4.1819101342151335, "grad_norm": 1.34375, "learning_rate": 0.00033528945706608844, "loss": 4.9076, "mean_token_accuracy": 0.2103512853384018, "num_tokens": 93237976.0, "step": 53750 }, { "entropy": 5.887962770462036, "epoch": 4.182299163586851, "grad_norm": 1.484375, "learning_rate": 0.00033526275452624407, "loss": 4.9214, "mean_token_accuracy": 0.21543764770030976, "num_tokens": 93245614.0, "step": 53755 }, { "entropy": 5.811726379394531, "epoch": 4.182688192958568, "grad_norm": 1.5234375, "learning_rate": 0.00033523605107200826, "loss": 4.9205, "mean_token_accuracy": 0.2218205988407135, "num_tokens": 93253715.0, "step": 53760 }, { "entropy": 5.850217676162719, "epoch": 4.183077222330286, "grad_norm": 1.5078125, "learning_rate": 0.00033520934670378634, "loss": 4.9566, "mean_token_accuracy": 0.2168344721198082, "num_tokens": 93262166.0, "step": 53765 }, { "entropy": 5.802445268630981, "epoch": 4.183466251702003, "grad_norm": 1.4375, "learning_rate": 0.00033518264142198335, "loss": 4.8783, "mean_token_accuracy": 0.22215252965688706, "num_tokens": 93271440.0, "step": 53770 }, { "entropy": 5.739235734939575, "epoch": 4.183855281073721, "grad_norm": 1.46875, "learning_rate": 0.0003351559352270047, "loss": 4.8661, "mean_token_accuracy": 0.21989529579877853, "num_tokens": 93279910.0, "step": 53775 }, { "entropy": 5.7950512886047365, "epoch": 4.184244310445439, "grad_norm": 1.390625, "learning_rate": 0.00033512922811925535, "loss": 4.8824, "mean_token_accuracy": 0.21518078297376633, "num_tokens": 93288099.0, "step": 53780 }, { "entropy": 5.851618766784668, "epoch": 4.1846333398171565, "grad_norm": 1.3203125, "learning_rate": 0.0003351025200991406, "loss": 4.9686, "mean_token_accuracy": 0.2104900985956192, "num_tokens": 93297029.0, "step": 53785 }, { "entropy": 5.880706071853638, "epoch": 4.185022369188874, "grad_norm": 1.3046875, "learning_rate": 0.0003350758111670659, "loss": 4.9717, "mean_token_accuracy": 0.20797078162431717, "num_tokens": 93305763.0, "step": 53790 }, { "entropy": 5.823510599136353, "epoch": 4.185411398560591, "grad_norm": 1.46875, "learning_rate": 0.0003350491013234364, "loss": 4.8776, "mean_token_accuracy": 0.21601666510105133, "num_tokens": 93314445.0, "step": 53795 }, { "entropy": 5.7323085308074955, "epoch": 4.185800427932309, "grad_norm": 1.3671875, "learning_rate": 0.0003350223905686573, "loss": 4.7976, "mean_token_accuracy": 0.2247539058327675, "num_tokens": 93323260.0, "step": 53800 }, { "entropy": 5.8788743019104, "epoch": 4.186189457304026, "grad_norm": 1.4765625, "learning_rate": 0.000334995678903134, "loss": 5.0045, "mean_token_accuracy": 0.20845166742801666, "num_tokens": 93331084.0, "step": 53805 }, { "entropy": 5.795471429824829, "epoch": 4.186578486675744, "grad_norm": 1.421875, "learning_rate": 0.0003349689663272718, "loss": 4.8596, "mean_token_accuracy": 0.22532219886779786, "num_tokens": 93339653.0, "step": 53810 }, { "entropy": 5.774336051940918, "epoch": 4.186967516047462, "grad_norm": 1.390625, "learning_rate": 0.0003349422528414759, "loss": 4.9404, "mean_token_accuracy": 0.21584501266479492, "num_tokens": 93349169.0, "step": 53815 }, { "entropy": 5.8463050365448, "epoch": 4.1873565454191795, "grad_norm": 1.4296875, "learning_rate": 0.0003349155384461517, "loss": 4.9738, "mean_token_accuracy": 0.213828244805336, "num_tokens": 93358152.0, "step": 53820 }, { "entropy": 5.807898378372192, "epoch": 4.187745574790897, "grad_norm": 1.28125, "learning_rate": 0.00033488882314170463, "loss": 4.906, "mean_token_accuracy": 0.2142057090997696, "num_tokens": 93366388.0, "step": 53825 }, { "entropy": 5.788700866699219, "epoch": 4.188134604162614, "grad_norm": 1.4921875, "learning_rate": 0.00033486210692854, "loss": 4.8506, "mean_token_accuracy": 0.22182716727256774, "num_tokens": 93374984.0, "step": 53830 }, { "entropy": 5.8824609279632565, "epoch": 4.188523633534332, "grad_norm": 1.390625, "learning_rate": 0.0003348353898070631, "loss": 5.0558, "mean_token_accuracy": 0.21138239353895188, "num_tokens": 93383588.0, "step": 53835 }, { "entropy": 5.854922437667847, "epoch": 4.188912662906049, "grad_norm": 1.46875, "learning_rate": 0.0003348086717776795, "loss": 4.8491, "mean_token_accuracy": 0.21564164608716965, "num_tokens": 93392161.0, "step": 53840 }, { "entropy": 5.853561544418335, "epoch": 4.189301692277767, "grad_norm": 1.3671875, "learning_rate": 0.00033478195284079447, "loss": 4.9682, "mean_token_accuracy": 0.211666975915432, "num_tokens": 93400934.0, "step": 53845 }, { "entropy": 5.79205732345581, "epoch": 4.189690721649485, "grad_norm": 1.28125, "learning_rate": 0.0003347552329968134, "loss": 4.9269, "mean_token_accuracy": 0.21470278054475783, "num_tokens": 93409780.0, "step": 53850 }, { "entropy": 5.804937744140625, "epoch": 4.1900797510212024, "grad_norm": 1.3828125, "learning_rate": 0.0003347285122461419, "loss": 4.8716, "mean_token_accuracy": 0.2191269114613533, "num_tokens": 93418407.0, "step": 53855 }, { "entropy": 5.899067497253418, "epoch": 4.190468780392919, "grad_norm": 1.4296875, "learning_rate": 0.0003347017905891852, "loss": 4.9894, "mean_token_accuracy": 0.20703840404748916, "num_tokens": 93426526.0, "step": 53860 }, { "entropy": 5.889360523223877, "epoch": 4.190857809764637, "grad_norm": 1.421875, "learning_rate": 0.0003346750680263488, "loss": 4.9291, "mean_token_accuracy": 0.21740897595882416, "num_tokens": 93434826.0, "step": 53865 }, { "entropy": 5.747199249267578, "epoch": 4.191246839136355, "grad_norm": 1.3671875, "learning_rate": 0.0003346483445580384, "loss": 4.7996, "mean_token_accuracy": 0.22174112796783446, "num_tokens": 93443702.0, "step": 53870 }, { "entropy": 5.894687080383301, "epoch": 4.191635868508072, "grad_norm": 1.328125, "learning_rate": 0.00033462162018465917, "loss": 5.0564, "mean_token_accuracy": 0.2039017528295517, "num_tokens": 93452477.0, "step": 53875 }, { "entropy": 5.895621204376221, "epoch": 4.19202489787979, "grad_norm": 1.375, "learning_rate": 0.00033459489490661676, "loss": 4.956, "mean_token_accuracy": 0.210696217417717, "num_tokens": 93460752.0, "step": 53880 }, { "entropy": 5.920444965362549, "epoch": 4.192413927251508, "grad_norm": 1.40625, "learning_rate": 0.00033456816872431673, "loss": 5.054, "mean_token_accuracy": 0.20734283328056335, "num_tokens": 93469917.0, "step": 53885 }, { "entropy": 5.853944730758667, "epoch": 4.192802956623225, "grad_norm": 1.40625, "learning_rate": 0.0003345414416381645, "loss": 4.9334, "mean_token_accuracy": 0.21851826310157776, "num_tokens": 93478530.0, "step": 53890 }, { "entropy": 5.820482778549194, "epoch": 4.193191985994942, "grad_norm": 1.3046875, "learning_rate": 0.00033451471364856565, "loss": 4.9232, "mean_token_accuracy": 0.2198634549975395, "num_tokens": 93487137.0, "step": 53895 }, { "entropy": 5.793654251098633, "epoch": 4.19358101536666, "grad_norm": 1.3984375, "learning_rate": 0.00033448798475592585, "loss": 4.9012, "mean_token_accuracy": 0.2114912375807762, "num_tokens": 93495163.0, "step": 53900 }, { "entropy": 5.816314220428467, "epoch": 4.193970044738378, "grad_norm": 1.375, "learning_rate": 0.0003344612549606505, "loss": 4.882, "mean_token_accuracy": 0.22631251364946364, "num_tokens": 93503652.0, "step": 53905 }, { "entropy": 5.8094501972198485, "epoch": 4.194359074110095, "grad_norm": 1.4140625, "learning_rate": 0.0003344345242631453, "loss": 4.8786, "mean_token_accuracy": 0.22077007889747619, "num_tokens": 93512869.0, "step": 53910 }, { "entropy": 5.807117223739624, "epoch": 4.194748103481813, "grad_norm": 1.3828125, "learning_rate": 0.0003344077926638157, "loss": 4.8917, "mean_token_accuracy": 0.21143667846918107, "num_tokens": 93521658.0, "step": 53915 }, { "entropy": 5.848456764221192, "epoch": 4.195137132853531, "grad_norm": 1.5, "learning_rate": 0.00033438106016306753, "loss": 4.9869, "mean_token_accuracy": 0.21177508383989335, "num_tokens": 93530113.0, "step": 53920 }, { "entropy": 5.87568941116333, "epoch": 4.195526162225248, "grad_norm": 1.484375, "learning_rate": 0.0003343543267613062, "loss": 4.965, "mean_token_accuracy": 0.21584281772375108, "num_tokens": 93539052.0, "step": 53925 }, { "entropy": 5.9074928760528564, "epoch": 4.195915191596965, "grad_norm": 1.3515625, "learning_rate": 0.0003343275924589374, "loss": 4.9007, "mean_token_accuracy": 0.21203228682279587, "num_tokens": 93547113.0, "step": 53930 }, { "entropy": 5.797955131530761, "epoch": 4.196304220968683, "grad_norm": 1.3359375, "learning_rate": 0.00033430085725636685, "loss": 4.9146, "mean_token_accuracy": 0.2186915934085846, "num_tokens": 93556126.0, "step": 53935 }, { "entropy": 5.866074848175049, "epoch": 4.196693250340401, "grad_norm": 1.3984375, "learning_rate": 0.0003342741211540002, "loss": 4.9365, "mean_token_accuracy": 0.2220117300748825, "num_tokens": 93564407.0, "step": 53940 }, { "entropy": 5.875904321670532, "epoch": 4.197082279712118, "grad_norm": 1.359375, "learning_rate": 0.0003342473841522431, "loss": 4.9498, "mean_token_accuracy": 0.21630416363477706, "num_tokens": 93572980.0, "step": 53945 }, { "entropy": 5.834396934509277, "epoch": 4.197471309083836, "grad_norm": 1.390625, "learning_rate": 0.00033422064625150124, "loss": 4.9606, "mean_token_accuracy": 0.21560702621936798, "num_tokens": 93581996.0, "step": 53950 }, { "entropy": 5.848588275909424, "epoch": 4.197860338455554, "grad_norm": 1.2734375, "learning_rate": 0.0003341939074521804, "loss": 4.9451, "mean_token_accuracy": 0.21536921113729476, "num_tokens": 93590812.0, "step": 53955 }, { "entropy": 5.886680364608765, "epoch": 4.1982493678272705, "grad_norm": 1.390625, "learning_rate": 0.0003341671677546861, "loss": 4.8966, "mean_token_accuracy": 0.22141322791576384, "num_tokens": 93599306.0, "step": 53960 }, { "entropy": 5.8576418399810795, "epoch": 4.198638397198988, "grad_norm": 1.453125, "learning_rate": 0.00033414042715942423, "loss": 4.9877, "mean_token_accuracy": 0.21486985832452773, "num_tokens": 93607384.0, "step": 53965 }, { "entropy": 5.804290103912353, "epoch": 4.199027426570706, "grad_norm": 1.375, "learning_rate": 0.0003341136856668005, "loss": 4.9825, "mean_token_accuracy": 0.2213495120406151, "num_tokens": 93615502.0, "step": 53970 }, { "entropy": 5.855285263061523, "epoch": 4.199416455942424, "grad_norm": 1.578125, "learning_rate": 0.0003340869432772207, "loss": 4.9427, "mean_token_accuracy": 0.22057077735662461, "num_tokens": 93623672.0, "step": 53975 }, { "entropy": 5.828197956085205, "epoch": 4.199805485314141, "grad_norm": 1.34375, "learning_rate": 0.00033406019999109065, "loss": 4.9484, "mean_token_accuracy": 0.21406349241733552, "num_tokens": 93632061.0, "step": 53980 }, { "entropy": 5.918289756774902, "epoch": 4.200194514685859, "grad_norm": 1.359375, "learning_rate": 0.00033403345580881606, "loss": 4.9979, "mean_token_accuracy": 0.21302729547023774, "num_tokens": 93641307.0, "step": 53985 }, { "entropy": 5.768211746215821, "epoch": 4.200583544057577, "grad_norm": 1.3046875, "learning_rate": 0.00033400671073080274, "loss": 4.8767, "mean_token_accuracy": 0.2144381284713745, "num_tokens": 93650152.0, "step": 53990 }, { "entropy": 5.823934841156006, "epoch": 4.2009725734292935, "grad_norm": 1.2890625, "learning_rate": 0.0003339799647574564, "loss": 4.9235, "mean_token_accuracy": 0.21355070918798447, "num_tokens": 93659102.0, "step": 53995 }, { "entropy": 5.858927488327026, "epoch": 4.201361602801011, "grad_norm": 1.4921875, "learning_rate": 0.0003339532178891831, "loss": 4.8952, "mean_token_accuracy": 0.21594687551259995, "num_tokens": 93667620.0, "step": 54000 }, { "epoch": 4.201361602801011, "eval_entropy": 5.596676927810684, "eval_loss": 5.047396659851074, "eval_mean_token_accuracy": 0.21937320121959267, "eval_num_tokens": 93667620.0, "eval_runtime": 21.6731, "eval_samples_per_second": 1917.494, "eval_steps_per_second": 239.698, "step": 54000 }, { "entropy": 5.971887111663818, "epoch": 4.201750632172729, "grad_norm": 1.40625, "learning_rate": 0.0003339264701263885, "loss": 5.0756, "mean_token_accuracy": 0.2112485021352768, "num_tokens": 93676315.0, "step": 54005 }, { "entropy": 5.739187479019165, "epoch": 4.202139661544447, "grad_norm": 1.2734375, "learning_rate": 0.0003338997214694784, "loss": 4.8139, "mean_token_accuracy": 0.22412844598293305, "num_tokens": 93685095.0, "step": 54010 }, { "entropy": 5.790797233581543, "epoch": 4.202528690916164, "grad_norm": 1.4140625, "learning_rate": 0.00033387297191885896, "loss": 4.9286, "mean_token_accuracy": 0.21456769853830338, "num_tokens": 93693831.0, "step": 54015 }, { "entropy": 5.89804310798645, "epoch": 4.202917720287882, "grad_norm": 1.4296875, "learning_rate": 0.0003338462214749358, "loss": 4.9612, "mean_token_accuracy": 0.20885361284017562, "num_tokens": 93703015.0, "step": 54020 }, { "entropy": 5.83752818107605, "epoch": 4.2033067496596, "grad_norm": 1.3671875, "learning_rate": 0.0003338194701381148, "loss": 4.8376, "mean_token_accuracy": 0.21939356476068497, "num_tokens": 93711004.0, "step": 54025 }, { "entropy": 5.787057828903198, "epoch": 4.2036957790313165, "grad_norm": 1.4765625, "learning_rate": 0.00033379271790880203, "loss": 4.8779, "mean_token_accuracy": 0.22041780650615692, "num_tokens": 93718887.0, "step": 54030 }, { "entropy": 5.727867174148559, "epoch": 4.204084808403034, "grad_norm": 1.34375, "learning_rate": 0.0003337659647874034, "loss": 4.794, "mean_token_accuracy": 0.22765171378850937, "num_tokens": 93727216.0, "step": 54035 }, { "entropy": 5.814126300811767, "epoch": 4.204473837774752, "grad_norm": 1.5390625, "learning_rate": 0.0003337392107743248, "loss": 4.8892, "mean_token_accuracy": 0.22085388749837875, "num_tokens": 93736193.0, "step": 54040 }, { "entropy": 5.786495018005371, "epoch": 4.20486286714647, "grad_norm": 1.3515625, "learning_rate": 0.0003337124558699721, "loss": 4.7835, "mean_token_accuracy": 0.2273172467947006, "num_tokens": 93743946.0, "step": 54045 }, { "entropy": 5.882463884353638, "epoch": 4.205251896518187, "grad_norm": 1.3203125, "learning_rate": 0.00033368570007475133, "loss": 4.9974, "mean_token_accuracy": 0.21057265549898146, "num_tokens": 93752802.0, "step": 54050 }, { "entropy": 5.762263774871826, "epoch": 4.205640925889905, "grad_norm": 1.328125, "learning_rate": 0.0003336589433890685, "loss": 4.9098, "mean_token_accuracy": 0.21930093467235565, "num_tokens": 93761933.0, "step": 54055 }, { "entropy": 5.8612583637237545, "epoch": 4.206029955261622, "grad_norm": 1.484375, "learning_rate": 0.00033363218581332956, "loss": 4.9771, "mean_token_accuracy": 0.21067806631326674, "num_tokens": 93770665.0, "step": 54060 }, { "entropy": 5.825173997879029, "epoch": 4.2064189846333395, "grad_norm": 1.34375, "learning_rate": 0.0003336054273479405, "loss": 4.912, "mean_token_accuracy": 0.21339046508073806, "num_tokens": 93780162.0, "step": 54065 }, { "entropy": 5.822549486160279, "epoch": 4.206808014005057, "grad_norm": 1.421875, "learning_rate": 0.00033357866799330743, "loss": 4.8851, "mean_token_accuracy": 0.21630495488643647, "num_tokens": 93788281.0, "step": 54070 }, { "entropy": 5.83717794418335, "epoch": 4.207197043376775, "grad_norm": 1.375, "learning_rate": 0.00033355190774983626, "loss": 4.9595, "mean_token_accuracy": 0.21329033374786377, "num_tokens": 93796980.0, "step": 54075 }, { "entropy": 5.84740948677063, "epoch": 4.207586072748493, "grad_norm": 1.3984375, "learning_rate": 0.00033352514661793306, "loss": 4.9951, "mean_token_accuracy": 0.21021244972944259, "num_tokens": 93806048.0, "step": 54080 }, { "entropy": 5.873120880126953, "epoch": 4.20797510212021, "grad_norm": 1.421875, "learning_rate": 0.00033349838459800394, "loss": 4.9405, "mean_token_accuracy": 0.21483903974294663, "num_tokens": 93814203.0, "step": 54085 }, { "entropy": 5.8491216659545895, "epoch": 4.208364131491928, "grad_norm": 1.40625, "learning_rate": 0.000333471621690455, "loss": 5.0091, "mean_token_accuracy": 0.21548207402229308, "num_tokens": 93822652.0, "step": 54090 }, { "entropy": 5.810828733444214, "epoch": 4.208753160863645, "grad_norm": 1.4296875, "learning_rate": 0.0003334448578956921, "loss": 4.8523, "mean_token_accuracy": 0.222181935608387, "num_tokens": 93831173.0, "step": 54095 }, { "entropy": 5.826335382461548, "epoch": 4.2091421902353625, "grad_norm": 1.34375, "learning_rate": 0.0003334180932141217, "loss": 4.861, "mean_token_accuracy": 0.22131213843822478, "num_tokens": 93840248.0, "step": 54100 }, { "entropy": 5.791978406906128, "epoch": 4.20953121960708, "grad_norm": 1.453125, "learning_rate": 0.0003333913276461497, "loss": 4.8951, "mean_token_accuracy": 0.21856824457645416, "num_tokens": 93848714.0, "step": 54105 }, { "entropy": 5.809845972061157, "epoch": 4.209920248978798, "grad_norm": 1.421875, "learning_rate": 0.00033336456119218214, "loss": 4.9287, "mean_token_accuracy": 0.2125195473432541, "num_tokens": 93857433.0, "step": 54110 }, { "entropy": 5.887536907196045, "epoch": 4.210309278350516, "grad_norm": 1.421875, "learning_rate": 0.00033333779385262525, "loss": 4.9357, "mean_token_accuracy": 0.21444258689880372, "num_tokens": 93865586.0, "step": 54115 }, { "entropy": 5.776325321197509, "epoch": 4.210698307722233, "grad_norm": 1.3046875, "learning_rate": 0.00033331102562788527, "loss": 4.8739, "mean_token_accuracy": 0.21979486793279648, "num_tokens": 93874566.0, "step": 54120 }, { "entropy": 5.839349937438965, "epoch": 4.211087337093951, "grad_norm": 1.4765625, "learning_rate": 0.0003332842565183682, "loss": 4.9617, "mean_token_accuracy": 0.21956595331430434, "num_tokens": 93883187.0, "step": 54125 }, { "entropy": 5.892572021484375, "epoch": 4.211476366465668, "grad_norm": 1.28125, "learning_rate": 0.00033325748652448037, "loss": 4.9407, "mean_token_accuracy": 0.21716114580631257, "num_tokens": 93891281.0, "step": 54130 }, { "entropy": 5.89418306350708, "epoch": 4.2118653958373855, "grad_norm": 1.3515625, "learning_rate": 0.00033323071564662796, "loss": 5.0127, "mean_token_accuracy": 0.21288414299488068, "num_tokens": 93900281.0, "step": 54135 }, { "entropy": 5.865328788757324, "epoch": 4.212254425209103, "grad_norm": 1.421875, "learning_rate": 0.00033320394388521707, "loss": 4.9507, "mean_token_accuracy": 0.21161502301692964, "num_tokens": 93908937.0, "step": 54140 }, { "entropy": 5.8832580089569095, "epoch": 4.212643454580821, "grad_norm": 1.484375, "learning_rate": 0.000333177171240654, "loss": 4.9105, "mean_token_accuracy": 0.21832273602485658, "num_tokens": 93916471.0, "step": 54145 }, { "entropy": 5.833485841751099, "epoch": 4.213032483952539, "grad_norm": 1.328125, "learning_rate": 0.00033315039771334494, "loss": 5.0155, "mean_token_accuracy": 0.20712808817625045, "num_tokens": 93926163.0, "step": 54150 }, { "entropy": 5.883976888656616, "epoch": 4.213421513324256, "grad_norm": 1.390625, "learning_rate": 0.0003331236233036961, "loss": 5.007, "mean_token_accuracy": 0.21158347129821778, "num_tokens": 93934405.0, "step": 54155 }, { "entropy": 5.876963949203491, "epoch": 4.213810542695974, "grad_norm": 1.4140625, "learning_rate": 0.0003330968480121138, "loss": 4.9326, "mean_token_accuracy": 0.217067751288414, "num_tokens": 93943108.0, "step": 54160 }, { "entropy": 5.871871280670166, "epoch": 4.214199572067691, "grad_norm": 1.4609375, "learning_rate": 0.0003330700718390043, "loss": 4.9726, "mean_token_accuracy": 0.21251060515642167, "num_tokens": 93951624.0, "step": 54165 }, { "entropy": 5.850645875930786, "epoch": 4.2145886014394085, "grad_norm": 1.453125, "learning_rate": 0.00033304329478477395, "loss": 4.9789, "mean_token_accuracy": 0.21017044484615327, "num_tokens": 93960232.0, "step": 54170 }, { "entropy": 5.924334859848022, "epoch": 4.214977630811126, "grad_norm": 1.4375, "learning_rate": 0.00033301651684982894, "loss": 4.9726, "mean_token_accuracy": 0.2110401511192322, "num_tokens": 93968362.0, "step": 54175 }, { "entropy": 5.832405662536621, "epoch": 4.215366660182844, "grad_norm": 1.5390625, "learning_rate": 0.0003329897380345757, "loss": 4.9094, "mean_token_accuracy": 0.2140204504132271, "num_tokens": 93977767.0, "step": 54180 }, { "entropy": 5.817509889602661, "epoch": 4.215755689554562, "grad_norm": 1.3359375, "learning_rate": 0.0003329629583394204, "loss": 4.8536, "mean_token_accuracy": 0.2231801137328148, "num_tokens": 93986371.0, "step": 54185 }, { "entropy": 5.889754056930542, "epoch": 4.216144718926279, "grad_norm": 1.3984375, "learning_rate": 0.0003329361777647695, "loss": 5.0133, "mean_token_accuracy": 0.20866560488939284, "num_tokens": 93995883.0, "step": 54190 }, { "entropy": 5.942185258865356, "epoch": 4.216533748297996, "grad_norm": 1.4140625, "learning_rate": 0.0003329093963110293, "loss": 4.9308, "mean_token_accuracy": 0.21899665296077728, "num_tokens": 94003846.0, "step": 54195 }, { "entropy": 5.902861738204956, "epoch": 4.216922777669714, "grad_norm": 1.3046875, "learning_rate": 0.00033288261397860613, "loss": 5.0193, "mean_token_accuracy": 0.21024268865585327, "num_tokens": 94013427.0, "step": 54200 }, { "entropy": 5.818203353881836, "epoch": 4.2173118070414315, "grad_norm": 1.3515625, "learning_rate": 0.00033285583076790646, "loss": 4.8575, "mean_token_accuracy": 0.22237660735845566, "num_tokens": 94021856.0, "step": 54205 }, { "entropy": 5.849095249176026, "epoch": 4.217700836413149, "grad_norm": 1.34375, "learning_rate": 0.00033282904667933675, "loss": 4.9741, "mean_token_accuracy": 0.2067559391260147, "num_tokens": 94029865.0, "step": 54210 }, { "entropy": 5.825262498855591, "epoch": 4.218089865784867, "grad_norm": 1.328125, "learning_rate": 0.0003328022617133032, "loss": 4.9154, "mean_token_accuracy": 0.2172183394432068, "num_tokens": 94038961.0, "step": 54215 }, { "entropy": 5.857781028747558, "epoch": 4.218478895156585, "grad_norm": 1.375, "learning_rate": 0.0003327754758702124, "loss": 4.9469, "mean_token_accuracy": 0.21627720296382905, "num_tokens": 94048184.0, "step": 54220 }, { "entropy": 5.8971795558929445, "epoch": 4.218867924528302, "grad_norm": 1.40625, "learning_rate": 0.00033274868915047064, "loss": 4.9801, "mean_token_accuracy": 0.2094110742211342, "num_tokens": 94056098.0, "step": 54225 }, { "entropy": 5.843860530853272, "epoch": 4.219256953900019, "grad_norm": 1.4140625, "learning_rate": 0.00033272190155448446, "loss": 4.9089, "mean_token_accuracy": 0.21378776729106902, "num_tokens": 94064744.0, "step": 54230 }, { "entropy": 5.81847653388977, "epoch": 4.219645983271737, "grad_norm": 1.359375, "learning_rate": 0.0003326951130826603, "loss": 4.9509, "mean_token_accuracy": 0.21451397538185119, "num_tokens": 94074039.0, "step": 54235 }, { "entropy": 5.832022619247437, "epoch": 4.2200350126434545, "grad_norm": 1.34375, "learning_rate": 0.00033266832373540463, "loss": 4.9748, "mean_token_accuracy": 0.2155937671661377, "num_tokens": 94082455.0, "step": 54240 }, { "entropy": 5.9056727409362795, "epoch": 4.220424042015172, "grad_norm": 1.3671875, "learning_rate": 0.0003326415335131239, "loss": 5.0103, "mean_token_accuracy": 0.20685748755931854, "num_tokens": 94091456.0, "step": 54245 }, { "entropy": 5.800530099868775, "epoch": 4.22081307138689, "grad_norm": 1.3046875, "learning_rate": 0.00033261474241622475, "loss": 4.8951, "mean_token_accuracy": 0.22232575416564943, "num_tokens": 94100054.0, "step": 54250 }, { "entropy": 5.909888124465942, "epoch": 4.221202100758608, "grad_norm": 1.6171875, "learning_rate": 0.0003325879504451135, "loss": 4.9576, "mean_token_accuracy": 0.21943352818489076, "num_tokens": 94107582.0, "step": 54255 }, { "entropy": 5.875159072875976, "epoch": 4.221591130130324, "grad_norm": 1.46875, "learning_rate": 0.00033256115760019677, "loss": 4.8972, "mean_token_accuracy": 0.21664048731327057, "num_tokens": 94116146.0, "step": 54260 }, { "entropy": 5.796509170532227, "epoch": 4.221980159502042, "grad_norm": 1.4140625, "learning_rate": 0.00033253436388188106, "loss": 4.8458, "mean_token_accuracy": 0.21939308047294617, "num_tokens": 94124159.0, "step": 54265 }, { "entropy": 5.8165966987609865, "epoch": 4.22236918887376, "grad_norm": 1.3125, "learning_rate": 0.000332507569290573, "loss": 4.9352, "mean_token_accuracy": 0.20942832827568053, "num_tokens": 94133942.0, "step": 54270 }, { "entropy": 5.81131010055542, "epoch": 4.2227582182454775, "grad_norm": 1.453125, "learning_rate": 0.00033248077382667913, "loss": 4.8685, "mean_token_accuracy": 0.2225460335612297, "num_tokens": 94142617.0, "step": 54275 }, { "entropy": 5.9180214405059814, "epoch": 4.223147247617195, "grad_norm": 1.4453125, "learning_rate": 0.000332453977490606, "loss": 4.9582, "mean_token_accuracy": 0.21270446181297303, "num_tokens": 94151159.0, "step": 54280 }, { "entropy": 5.931451845169067, "epoch": 4.223536276988913, "grad_norm": 1.375, "learning_rate": 0.0003324271802827602, "loss": 4.9759, "mean_token_accuracy": 0.2201889857649803, "num_tokens": 94160174.0, "step": 54285 }, { "entropy": 5.8430641174316404, "epoch": 4.223925306360631, "grad_norm": 1.359375, "learning_rate": 0.0003324003822035483, "loss": 4.9293, "mean_token_accuracy": 0.21524726897478103, "num_tokens": 94169155.0, "step": 54290 }, { "entropy": 5.827041721343994, "epoch": 4.224314335732347, "grad_norm": 1.5, "learning_rate": 0.0003323735832533771, "loss": 4.9386, "mean_token_accuracy": 0.21363459825515746, "num_tokens": 94177706.0, "step": 54295 }, { "entropy": 5.862002277374268, "epoch": 4.224703365104065, "grad_norm": 1.4296875, "learning_rate": 0.00033234678343265297, "loss": 4.9208, "mean_token_accuracy": 0.2212420240044594, "num_tokens": 94186175.0, "step": 54300 }, { "entropy": 5.832858610153198, "epoch": 4.225092394475783, "grad_norm": 1.3203125, "learning_rate": 0.0003323199827417827, "loss": 4.9588, "mean_token_accuracy": 0.21001080870628358, "num_tokens": 94194583.0, "step": 54305 }, { "entropy": 5.852217102050782, "epoch": 4.2254814238475005, "grad_norm": 1.2578125, "learning_rate": 0.00033229318118117293, "loss": 4.9593, "mean_token_accuracy": 0.2111903816461563, "num_tokens": 94203932.0, "step": 54310 }, { "entropy": 5.9370091438293455, "epoch": 4.225870453219218, "grad_norm": 1.53125, "learning_rate": 0.00033226637875123026, "loss": 5.0466, "mean_token_accuracy": 0.2143762394785881, "num_tokens": 94212230.0, "step": 54315 }, { "entropy": 5.851756381988525, "epoch": 4.226259482590936, "grad_norm": 1.3984375, "learning_rate": 0.00033223957545236156, "loss": 4.9473, "mean_token_accuracy": 0.2104286327958107, "num_tokens": 94221062.0, "step": 54320 }, { "entropy": 5.857554817199707, "epoch": 4.226648511962654, "grad_norm": 1.484375, "learning_rate": 0.0003322127712849733, "loss": 4.8689, "mean_token_accuracy": 0.21470119059085846, "num_tokens": 94229527.0, "step": 54325 }, { "entropy": 5.888439178466797, "epoch": 4.22703754133437, "grad_norm": 1.328125, "learning_rate": 0.0003321859662494724, "loss": 4.9914, "mean_token_accuracy": 0.2110230416059494, "num_tokens": 94238179.0, "step": 54330 }, { "entropy": 5.734419822692871, "epoch": 4.227426570706088, "grad_norm": 1.3671875, "learning_rate": 0.0003321591603462654, "loss": 4.8107, "mean_token_accuracy": 0.22955417186021804, "num_tokens": 94246200.0, "step": 54335 }, { "entropy": 5.805563831329346, "epoch": 4.227815600077806, "grad_norm": 1.5, "learning_rate": 0.0003321323535757592, "loss": 4.95, "mean_token_accuracy": 0.20972746908664702, "num_tokens": 94254446.0, "step": 54340 }, { "entropy": 5.875521230697632, "epoch": 4.2282046294495235, "grad_norm": 1.296875, "learning_rate": 0.0003321055459383604, "loss": 4.9608, "mean_token_accuracy": 0.21168266087770463, "num_tokens": 94263122.0, "step": 54345 }, { "entropy": 5.9250740051269535, "epoch": 4.228593658821241, "grad_norm": 1.3828125, "learning_rate": 0.00033207873743447587, "loss": 4.9372, "mean_token_accuracy": 0.2156611755490303, "num_tokens": 94271386.0, "step": 54350 }, { "entropy": 5.8797022819519045, "epoch": 4.228982688192959, "grad_norm": 1.4296875, "learning_rate": 0.00033205192806451227, "loss": 4.9259, "mean_token_accuracy": 0.2231452763080597, "num_tokens": 94280336.0, "step": 54355 }, { "entropy": 5.824539470672607, "epoch": 4.229371717564677, "grad_norm": 1.359375, "learning_rate": 0.00033202511782887655, "loss": 4.907, "mean_token_accuracy": 0.21747318059206008, "num_tokens": 94289049.0, "step": 54360 }, { "entropy": 5.847026348114014, "epoch": 4.229760746936393, "grad_norm": 1.5078125, "learning_rate": 0.00033199830672797545, "loss": 4.9768, "mean_token_accuracy": 0.20996737778186797, "num_tokens": 94296947.0, "step": 54365 }, { "entropy": 5.823387336730957, "epoch": 4.230149776308111, "grad_norm": 1.3671875, "learning_rate": 0.0003319714947622157, "loss": 4.8585, "mean_token_accuracy": 0.2210083469748497, "num_tokens": 94307121.0, "step": 54370 }, { "entropy": 5.862875127792359, "epoch": 4.230538805679829, "grad_norm": 1.3671875, "learning_rate": 0.0003319446819320043, "loss": 4.9257, "mean_token_accuracy": 0.21987499594688414, "num_tokens": 94316770.0, "step": 54375 }, { "entropy": 5.868021774291992, "epoch": 4.2309278350515465, "grad_norm": 1.328125, "learning_rate": 0.0003319178682377479, "loss": 4.8867, "mean_token_accuracy": 0.21835479587316514, "num_tokens": 94325324.0, "step": 54380 }, { "entropy": 5.827633810043335, "epoch": 4.231316864423264, "grad_norm": 1.3359375, "learning_rate": 0.00033189105367985343, "loss": 4.9812, "mean_token_accuracy": 0.21604911535978316, "num_tokens": 94334273.0, "step": 54385 }, { "entropy": 5.789850807189941, "epoch": 4.231705893794982, "grad_norm": 1.5625, "learning_rate": 0.00033186423825872787, "loss": 4.8392, "mean_token_accuracy": 0.22379010170698166, "num_tokens": 94342380.0, "step": 54390 }, { "entropy": 5.874048900604248, "epoch": 4.232094923166699, "grad_norm": 1.34375, "learning_rate": 0.0003318374219747779, "loss": 4.9164, "mean_token_accuracy": 0.22113455086946487, "num_tokens": 94350728.0, "step": 54395 }, { "entropy": 5.873372411727905, "epoch": 4.232483952538416, "grad_norm": 1.40625, "learning_rate": 0.00033181060482841054, "loss": 4.947, "mean_token_accuracy": 0.2182196781039238, "num_tokens": 94359016.0, "step": 54400 }, { "entropy": 5.87741985321045, "epoch": 4.232872981910134, "grad_norm": 1.5078125, "learning_rate": 0.0003317837868200327, "loss": 4.8842, "mean_token_accuracy": 0.22041266411542892, "num_tokens": 94367652.0, "step": 54405 }, { "entropy": 5.858276844024658, "epoch": 4.233262011281852, "grad_norm": 1.3515625, "learning_rate": 0.00033175696795005133, "loss": 4.9045, "mean_token_accuracy": 0.21588704586029053, "num_tokens": 94376318.0, "step": 54410 }, { "entropy": 5.8965339183807375, "epoch": 4.2336510406535695, "grad_norm": 1.453125, "learning_rate": 0.0003317301482188732, "loss": 5.0032, "mean_token_accuracy": 0.2077641174197197, "num_tokens": 94384967.0, "step": 54415 }, { "entropy": 5.900251245498657, "epoch": 4.234040070025287, "grad_norm": 1.4765625, "learning_rate": 0.0003317033276269054, "loss": 4.8967, "mean_token_accuracy": 0.21918740421533583, "num_tokens": 94393258.0, "step": 54420 }, { "entropy": 5.835453128814697, "epoch": 4.234429099397005, "grad_norm": 1.2890625, "learning_rate": 0.00033167650617455484, "loss": 4.818, "mean_token_accuracy": 0.22985647469758988, "num_tokens": 94402232.0, "step": 54425 }, { "entropy": 5.88439793586731, "epoch": 4.234818128768722, "grad_norm": 1.4375, "learning_rate": 0.00033164968386222856, "loss": 4.9985, "mean_token_accuracy": 0.20924014896154403, "num_tokens": 94411234.0, "step": 54430 }, { "entropy": 5.837527704238892, "epoch": 4.235207158140439, "grad_norm": 1.375, "learning_rate": 0.0003316228606903334, "loss": 4.8734, "mean_token_accuracy": 0.2272052139043808, "num_tokens": 94420048.0, "step": 54435 }, { "entropy": 5.802836990356445, "epoch": 4.235596187512157, "grad_norm": 1.328125, "learning_rate": 0.00033159603665927655, "loss": 4.8794, "mean_token_accuracy": 0.21734994500875474, "num_tokens": 94428999.0, "step": 54440 }, { "entropy": 5.834684228897094, "epoch": 4.235985216883875, "grad_norm": 1.5390625, "learning_rate": 0.00033156921176946496, "loss": 4.8897, "mean_token_accuracy": 0.21609367728233336, "num_tokens": 94436796.0, "step": 54445 }, { "entropy": 5.811357593536377, "epoch": 4.2363742462555924, "grad_norm": 1.4140625, "learning_rate": 0.0003315423860213057, "loss": 4.9286, "mean_token_accuracy": 0.21386505514383317, "num_tokens": 94445477.0, "step": 54450 }, { "entropy": 5.854596090316773, "epoch": 4.23676327562731, "grad_norm": 1.34375, "learning_rate": 0.0003315155594152055, "loss": 4.9439, "mean_token_accuracy": 0.2135547861456871, "num_tokens": 94454828.0, "step": 54455 }, { "entropy": 5.876994609832764, "epoch": 4.237152304999028, "grad_norm": 1.5390625, "learning_rate": 0.0003314887319515717, "loss": 4.9654, "mean_token_accuracy": 0.21273151487112046, "num_tokens": 94463549.0, "step": 54460 }, { "entropy": 5.872981882095337, "epoch": 4.237541334370745, "grad_norm": 1.4375, "learning_rate": 0.0003314619036308113, "loss": 4.8749, "mean_token_accuracy": 0.21386970281600953, "num_tokens": 94471581.0, "step": 54465 }, { "entropy": 5.89142861366272, "epoch": 4.237930363742462, "grad_norm": 1.3828125, "learning_rate": 0.00033143507445333145, "loss": 5.0125, "mean_token_accuracy": 0.20487603545188904, "num_tokens": 94480230.0, "step": 54470 }, { "entropy": 5.853812265396118, "epoch": 4.23831939311418, "grad_norm": 1.4453125, "learning_rate": 0.00033140824441953913, "loss": 4.9152, "mean_token_accuracy": 0.21911082416772842, "num_tokens": 94488726.0, "step": 54475 }, { "entropy": 5.829182386398315, "epoch": 4.238708422485898, "grad_norm": 1.328125, "learning_rate": 0.00033138141352984145, "loss": 4.9033, "mean_token_accuracy": 0.2204552710056305, "num_tokens": 94497381.0, "step": 54480 }, { "entropy": 5.759686803817749, "epoch": 4.239097451857615, "grad_norm": 1.3359375, "learning_rate": 0.00033135458178464565, "loss": 4.8755, "mean_token_accuracy": 0.21797899305820465, "num_tokens": 94505780.0, "step": 54485 }, { "entropy": 5.861319160461425, "epoch": 4.239486481229333, "grad_norm": 1.3046875, "learning_rate": 0.0003313277491843587, "loss": 4.9552, "mean_token_accuracy": 0.21102966815233232, "num_tokens": 94514539.0, "step": 54490 }, { "entropy": 5.878709363937378, "epoch": 4.239875510601051, "grad_norm": 1.3828125, "learning_rate": 0.00033130091572938786, "loss": 4.8879, "mean_token_accuracy": 0.21624512672424318, "num_tokens": 94523067.0, "step": 54495 }, { "entropy": 5.8554362773895265, "epoch": 4.240264539972768, "grad_norm": 1.421875, "learning_rate": 0.0003312740814201402, "loss": 5.0055, "mean_token_accuracy": 0.21569064557552337, "num_tokens": 94532030.0, "step": 54500 }, { "entropy": 5.911686134338379, "epoch": 4.240653569344485, "grad_norm": 1.4140625, "learning_rate": 0.0003312472462570229, "loss": 5.0431, "mean_token_accuracy": 0.21060900688171386, "num_tokens": 94540838.0, "step": 54505 }, { "entropy": 5.839062595367432, "epoch": 4.241042598716203, "grad_norm": 1.296875, "learning_rate": 0.00033122041024044325, "loss": 4.9246, "mean_token_accuracy": 0.21736403107643126, "num_tokens": 94549603.0, "step": 54510 }, { "entropy": 5.779233646392822, "epoch": 4.241431628087921, "grad_norm": 1.375, "learning_rate": 0.00033119357337080827, "loss": 4.824, "mean_token_accuracy": 0.23067578822374343, "num_tokens": 94558246.0, "step": 54515 }, { "entropy": 5.796691370010376, "epoch": 4.241820657459638, "grad_norm": 1.6484375, "learning_rate": 0.0003311667356485253, "loss": 4.9402, "mean_token_accuracy": 0.2093515843153, "num_tokens": 94567293.0, "step": 54520 }, { "entropy": 5.911427974700928, "epoch": 4.242209686831356, "grad_norm": 1.3671875, "learning_rate": 0.0003311398970740015, "loss": 4.9923, "mean_token_accuracy": 0.21720293015241623, "num_tokens": 94576249.0, "step": 54525 }, { "entropy": 5.851956176757812, "epoch": 4.242598716203073, "grad_norm": 1.453125, "learning_rate": 0.0003311130576476441, "loss": 4.919, "mean_token_accuracy": 0.22292238771915435, "num_tokens": 94584206.0, "step": 54530 }, { "entropy": 5.853858757019043, "epoch": 4.242987745574791, "grad_norm": 1.3828125, "learning_rate": 0.0003310862173698604, "loss": 4.9016, "mean_token_accuracy": 0.22328370809555054, "num_tokens": 94592962.0, "step": 54535 }, { "entropy": 5.785601949691772, "epoch": 4.243376774946508, "grad_norm": 1.515625, "learning_rate": 0.0003310593762410576, "loss": 4.8609, "mean_token_accuracy": 0.2257447674870491, "num_tokens": 94601305.0, "step": 54540 }, { "entropy": 5.824986934661865, "epoch": 4.243765804318226, "grad_norm": 1.3984375, "learning_rate": 0.000331032534261643, "loss": 4.9926, "mean_token_accuracy": 0.2049812361598015, "num_tokens": 94609844.0, "step": 54545 }, { "entropy": 5.8097621440887455, "epoch": 4.244154833689944, "grad_norm": 1.4140625, "learning_rate": 0.0003310056914320239, "loss": 4.947, "mean_token_accuracy": 0.21114800721406937, "num_tokens": 94618068.0, "step": 54550 }, { "entropy": 5.797760915756226, "epoch": 4.244543863061661, "grad_norm": 1.28125, "learning_rate": 0.00033097884775260754, "loss": 4.9105, "mean_token_accuracy": 0.22113310396671296, "num_tokens": 94627140.0, "step": 54555 }, { "entropy": 5.863585996627807, "epoch": 4.244932892433379, "grad_norm": 1.2890625, "learning_rate": 0.00033095200322380124, "loss": 4.8959, "mean_token_accuracy": 0.21619660407304764, "num_tokens": 94636416.0, "step": 54560 }, { "entropy": 5.8374744892120365, "epoch": 4.245321921805096, "grad_norm": 1.375, "learning_rate": 0.00033092515784601245, "loss": 4.9701, "mean_token_accuracy": 0.2134205147624016, "num_tokens": 94645268.0, "step": 54565 }, { "entropy": 5.916219091415405, "epoch": 4.245710951176814, "grad_norm": 1.3671875, "learning_rate": 0.0003308983116196483, "loss": 4.9163, "mean_token_accuracy": 0.21586241871118544, "num_tokens": 94653868.0, "step": 54570 }, { "entropy": 5.899639844894409, "epoch": 4.246099980548531, "grad_norm": 1.3515625, "learning_rate": 0.0003308714645451163, "loss": 4.9072, "mean_token_accuracy": 0.21756876558065413, "num_tokens": 94662274.0, "step": 54575 }, { "entropy": 5.896301174163819, "epoch": 4.246489009920249, "grad_norm": 1.421875, "learning_rate": 0.0003308446166228237, "loss": 4.9782, "mean_token_accuracy": 0.21535287350416182, "num_tokens": 94670313.0, "step": 54580 }, { "entropy": 5.81079421043396, "epoch": 4.246878039291967, "grad_norm": 1.421875, "learning_rate": 0.00033081776785317803, "loss": 4.9254, "mean_token_accuracy": 0.21901050359010696, "num_tokens": 94679733.0, "step": 54585 }, { "entropy": 5.780589532852173, "epoch": 4.247267068663684, "grad_norm": 1.3984375, "learning_rate": 0.00033079091823658645, "loss": 4.8294, "mean_token_accuracy": 0.224543260037899, "num_tokens": 94688081.0, "step": 54590 }, { "entropy": 5.92640700340271, "epoch": 4.247656098035401, "grad_norm": 1.3984375, "learning_rate": 0.0003307640677734566, "loss": 5.0488, "mean_token_accuracy": 0.2048206701874733, "num_tokens": 94696852.0, "step": 54595 }, { "entropy": 5.8876622200012205, "epoch": 4.248045127407119, "grad_norm": 1.34375, "learning_rate": 0.0003307372164641957, "loss": 4.9151, "mean_token_accuracy": 0.21751775443553925, "num_tokens": 94706195.0, "step": 54600 }, { "entropy": 5.82441930770874, "epoch": 4.248434156778837, "grad_norm": 1.3828125, "learning_rate": 0.00033071036430921133, "loss": 4.9088, "mean_token_accuracy": 0.21767239272594452, "num_tokens": 94714514.0, "step": 54605 }, { "entropy": 5.869266605377197, "epoch": 4.248823186150554, "grad_norm": 1.6171875, "learning_rate": 0.00033068351130891076, "loss": 4.8513, "mean_token_accuracy": 0.22421156615018845, "num_tokens": 94722898.0, "step": 54610 }, { "entropy": 5.94199504852295, "epoch": 4.249212215522272, "grad_norm": 1.4609375, "learning_rate": 0.0003306566574637016, "loss": 5.0748, "mean_token_accuracy": 0.20383311063051224, "num_tokens": 94731266.0, "step": 54615 }, { "entropy": 5.834261131286621, "epoch": 4.24960124489399, "grad_norm": 1.421875, "learning_rate": 0.00033062980277399125, "loss": 4.9582, "mean_token_accuracy": 0.21068195104599, "num_tokens": 94740317.0, "step": 54620 }, { "entropy": 5.828776121139526, "epoch": 4.249990274265707, "grad_norm": 1.34375, "learning_rate": 0.0003306029472401871, "loss": 4.9466, "mean_token_accuracy": 0.21891319751739502, "num_tokens": 94749388.0, "step": 54625 }, { "entropy": 5.784021377563477, "epoch": 4.250379303637424, "grad_norm": 1.4453125, "learning_rate": 0.0003305760908626968, "loss": 4.8661, "mean_token_accuracy": 0.22689557522535325, "num_tokens": 94758357.0, "step": 54630 }, { "entropy": 5.996087217330933, "epoch": 4.250768333009142, "grad_norm": 1.4296875, "learning_rate": 0.0003305492336419277, "loss": 5.0637, "mean_token_accuracy": 0.20431413650512695, "num_tokens": 94767045.0, "step": 54635 }, { "entropy": 5.8504119396209715, "epoch": 4.25115736238086, "grad_norm": 1.3984375, "learning_rate": 0.00033052237557828763, "loss": 4.9391, "mean_token_accuracy": 0.21591024547815324, "num_tokens": 94776322.0, "step": 54640 }, { "entropy": 5.76273021697998, "epoch": 4.251546391752577, "grad_norm": 1.296875, "learning_rate": 0.0003304955166721837, "loss": 4.7768, "mean_token_accuracy": 0.2248910188674927, "num_tokens": 94785512.0, "step": 54645 }, { "entropy": 5.84410548210144, "epoch": 4.251935421124295, "grad_norm": 1.40625, "learning_rate": 0.0003304686569240237, "loss": 4.9036, "mean_token_accuracy": 0.2198322057723999, "num_tokens": 94794792.0, "step": 54650 }, { "entropy": 5.836422872543335, "epoch": 4.252324450496013, "grad_norm": 1.3125, "learning_rate": 0.000330441796334215, "loss": 4.9731, "mean_token_accuracy": 0.215606252849102, "num_tokens": 94803810.0, "step": 54655 }, { "entropy": 5.878294897079468, "epoch": 4.25271347986773, "grad_norm": 1.3828125, "learning_rate": 0.0003304149349031653, "loss": 4.9078, "mean_token_accuracy": 0.22142995297908782, "num_tokens": 94812516.0, "step": 54660 }, { "entropy": 5.866740751266479, "epoch": 4.253102509239447, "grad_norm": 1.421875, "learning_rate": 0.0003303880726312822, "loss": 4.9607, "mean_token_accuracy": 0.21123270690441132, "num_tokens": 94821296.0, "step": 54665 }, { "entropy": 5.905311250686646, "epoch": 4.253491538611165, "grad_norm": 1.4609375, "learning_rate": 0.00033036120951897334, "loss": 4.985, "mean_token_accuracy": 0.2080875962972641, "num_tokens": 94830201.0, "step": 54670 }, { "entropy": 5.845305442810059, "epoch": 4.253880567982883, "grad_norm": 1.4609375, "learning_rate": 0.0003303343455666462, "loss": 4.9068, "mean_token_accuracy": 0.21716515570878983, "num_tokens": 94838797.0, "step": 54675 }, { "entropy": 5.7114630222320555, "epoch": 4.2542695973546, "grad_norm": 1.453125, "learning_rate": 0.00033030748077470846, "loss": 4.7326, "mean_token_accuracy": 0.23398550152778624, "num_tokens": 94848090.0, "step": 54680 }, { "entropy": 5.813529300689697, "epoch": 4.254658626726318, "grad_norm": 1.4140625, "learning_rate": 0.00033028061514356766, "loss": 4.952, "mean_token_accuracy": 0.2135101556777954, "num_tokens": 94856238.0, "step": 54685 }, { "entropy": 5.866329479217529, "epoch": 4.255047656098036, "grad_norm": 1.328125, "learning_rate": 0.0003302537486736315, "loss": 4.9417, "mean_token_accuracy": 0.2133047863841057, "num_tokens": 94864950.0, "step": 54690 }, { "entropy": 5.741536426544189, "epoch": 4.255436685469753, "grad_norm": 1.3984375, "learning_rate": 0.0003302268813653077, "loss": 4.8527, "mean_token_accuracy": 0.22160002887248992, "num_tokens": 94873616.0, "step": 54695 }, { "entropy": 5.8455893993377686, "epoch": 4.25582571484147, "grad_norm": 1.3046875, "learning_rate": 0.0003302000132190039, "loss": 4.9893, "mean_token_accuracy": 0.21261759400367736, "num_tokens": 94882568.0, "step": 54700 }, { "entropy": 5.877289628982544, "epoch": 4.256214744213188, "grad_norm": 1.390625, "learning_rate": 0.0003301731442351277, "loss": 4.9314, "mean_token_accuracy": 0.21729569137096405, "num_tokens": 94891079.0, "step": 54705 }, { "entropy": 5.892396116256714, "epoch": 4.256603773584906, "grad_norm": 1.40625, "learning_rate": 0.0003301462744140869, "loss": 5.0, "mean_token_accuracy": 0.2129331946372986, "num_tokens": 94900342.0, "step": 54710 }, { "entropy": 5.777550172805786, "epoch": 4.256992802956623, "grad_norm": 1.3828125, "learning_rate": 0.0003301194037562892, "loss": 4.8434, "mean_token_accuracy": 0.22190909832715988, "num_tokens": 94908580.0, "step": 54715 }, { "entropy": 5.835763549804687, "epoch": 4.257381832328341, "grad_norm": 1.3046875, "learning_rate": 0.0003300925322621422, "loss": 4.9446, "mean_token_accuracy": 0.22201373875141145, "num_tokens": 94917166.0, "step": 54720 }, { "entropy": 5.843785047531128, "epoch": 4.257770861700059, "grad_norm": 1.5078125, "learning_rate": 0.0003300656599320537, "loss": 4.9295, "mean_token_accuracy": 0.21539368480443954, "num_tokens": 94925761.0, "step": 54725 }, { "entropy": 5.81359224319458, "epoch": 4.2581598910717755, "grad_norm": 1.4296875, "learning_rate": 0.0003300387867664315, "loss": 4.8611, "mean_token_accuracy": 0.21661551296710968, "num_tokens": 94934037.0, "step": 54730 }, { "entropy": 5.816027736663818, "epoch": 4.258548920443493, "grad_norm": 1.2734375, "learning_rate": 0.0003300119127656833, "loss": 4.923, "mean_token_accuracy": 0.21549272388219834, "num_tokens": 94942414.0, "step": 54735 }, { "entropy": 5.809495496749878, "epoch": 4.258937949815211, "grad_norm": 1.421875, "learning_rate": 0.00032998503793021694, "loss": 4.8496, "mean_token_accuracy": 0.22374883145093918, "num_tokens": 94950666.0, "step": 54740 }, { "entropy": 5.798728942871094, "epoch": 4.259326979186929, "grad_norm": 1.4375, "learning_rate": 0.0003299581622604401, "loss": 4.9519, "mean_token_accuracy": 0.2106999233365059, "num_tokens": 94959266.0, "step": 54745 }, { "entropy": 5.836488485336304, "epoch": 4.259716008558646, "grad_norm": 1.3515625, "learning_rate": 0.00032993128575676064, "loss": 5.0074, "mean_token_accuracy": 0.20847178846597672, "num_tokens": 94967991.0, "step": 54750 }, { "entropy": 5.846051216125488, "epoch": 4.260105037930364, "grad_norm": 1.390625, "learning_rate": 0.00032990440841958635, "loss": 4.935, "mean_token_accuracy": 0.21453418880701064, "num_tokens": 94976881.0, "step": 54755 }, { "entropy": 5.79466757774353, "epoch": 4.260494067302082, "grad_norm": 1.2890625, "learning_rate": 0.000329877530249325, "loss": 4.8789, "mean_token_accuracy": 0.22567687481641768, "num_tokens": 94985651.0, "step": 54760 }, { "entropy": 5.784200859069824, "epoch": 4.2608830966737985, "grad_norm": 1.4296875, "learning_rate": 0.0003298506512463845, "loss": 4.9296, "mean_token_accuracy": 0.21447030305862427, "num_tokens": 94994355.0, "step": 54765 }, { "entropy": 5.791024589538575, "epoch": 4.261272126045516, "grad_norm": 1.296875, "learning_rate": 0.0003298237714111727, "loss": 4.9198, "mean_token_accuracy": 0.21618910878896713, "num_tokens": 95003747.0, "step": 54770 }, { "entropy": 5.85491533279419, "epoch": 4.261661155417234, "grad_norm": 1.2578125, "learning_rate": 0.0003297968907440974, "loss": 4.9504, "mean_token_accuracy": 0.21203519105911256, "num_tokens": 95012285.0, "step": 54775 }, { "entropy": 5.813201189041138, "epoch": 4.262050184788952, "grad_norm": 1.3671875, "learning_rate": 0.0003297700092455665, "loss": 4.9578, "mean_token_accuracy": 0.21497584581375123, "num_tokens": 95020372.0, "step": 54780 }, { "entropy": 5.874746894836425, "epoch": 4.262439214160669, "grad_norm": 1.375, "learning_rate": 0.00032974312691598794, "loss": 4.9177, "mean_token_accuracy": 0.20970916301012038, "num_tokens": 95028489.0, "step": 54785 }, { "entropy": 5.851466083526612, "epoch": 4.262828243532387, "grad_norm": 1.4140625, "learning_rate": 0.00032971624375576956, "loss": 4.8297, "mean_token_accuracy": 0.22772799879312516, "num_tokens": 95036014.0, "step": 54790 }, { "entropy": 5.7969505310058596, "epoch": 4.263217272904104, "grad_norm": 1.5078125, "learning_rate": 0.0003296893597653192, "loss": 4.9261, "mean_token_accuracy": 0.22391374558210372, "num_tokens": 95044544.0, "step": 54795 }, { "entropy": 5.805670213699341, "epoch": 4.2636063022758215, "grad_norm": 1.453125, "learning_rate": 0.0003296624749450448, "loss": 4.9401, "mean_token_accuracy": 0.2121354177594185, "num_tokens": 95053307.0, "step": 54800 }, { "entropy": 5.813626003265381, "epoch": 4.263995331647539, "grad_norm": 1.328125, "learning_rate": 0.0003296355892953545, "loss": 4.9802, "mean_token_accuracy": 0.2173500806093216, "num_tokens": 95061900.0, "step": 54805 }, { "entropy": 5.8369749069213865, "epoch": 4.264384361019257, "grad_norm": 1.53125, "learning_rate": 0.000329608702816656, "loss": 4.9011, "mean_token_accuracy": 0.21374083906412125, "num_tokens": 95070077.0, "step": 54810 }, { "entropy": 5.78107213973999, "epoch": 4.264773390390975, "grad_norm": 1.3046875, "learning_rate": 0.0003295818155093574, "loss": 4.9466, "mean_token_accuracy": 0.2171681985259056, "num_tokens": 95078921.0, "step": 54815 }, { "entropy": 5.762372064590454, "epoch": 4.265162419762692, "grad_norm": 1.5546875, "learning_rate": 0.00032955492737386663, "loss": 4.8218, "mean_token_accuracy": 0.23465891927480698, "num_tokens": 95086666.0, "step": 54820 }, { "entropy": 5.8002910137176515, "epoch": 4.26555144913441, "grad_norm": 1.40625, "learning_rate": 0.0003295280384105916, "loss": 4.98, "mean_token_accuracy": 0.21793352961540222, "num_tokens": 95095383.0, "step": 54825 }, { "entropy": 5.8189630031585695, "epoch": 4.265940478506128, "grad_norm": 1.4765625, "learning_rate": 0.00032950114861994047, "loss": 4.9243, "mean_token_accuracy": 0.22275084555149077, "num_tokens": 95103934.0, "step": 54830 }, { "entropy": 5.881512451171875, "epoch": 4.2663295078778445, "grad_norm": 1.2734375, "learning_rate": 0.00032947425800232107, "loss": 5.0225, "mean_token_accuracy": 0.2168121337890625, "num_tokens": 95113373.0, "step": 54835 }, { "entropy": 5.881409502029419, "epoch": 4.266718537249562, "grad_norm": 1.375, "learning_rate": 0.0003294473665581415, "loss": 4.9277, "mean_token_accuracy": 0.21540509909391403, "num_tokens": 95121780.0, "step": 54840 }, { "entropy": 5.849076986312866, "epoch": 4.26710756662128, "grad_norm": 1.4921875, "learning_rate": 0.00032942047428780985, "loss": 4.9954, "mean_token_accuracy": 0.20862145274877547, "num_tokens": 95130257.0, "step": 54845 }, { "entropy": 5.862047529220581, "epoch": 4.267496595992998, "grad_norm": 1.5234375, "learning_rate": 0.0003293935811917342, "loss": 4.9181, "mean_token_accuracy": 0.21740685850381852, "num_tokens": 95138505.0, "step": 54850 }, { "entropy": 5.738326501846314, "epoch": 4.267885625364715, "grad_norm": 1.4375, "learning_rate": 0.0003293666872703224, "loss": 4.8598, "mean_token_accuracy": 0.22058558315038682, "num_tokens": 95147514.0, "step": 54855 }, { "entropy": 5.788561248779297, "epoch": 4.268274654736433, "grad_norm": 1.2109375, "learning_rate": 0.0003293397925239827, "loss": 4.8698, "mean_token_accuracy": 0.21905076503753662, "num_tokens": 95156613.0, "step": 54860 }, { "entropy": 5.883743333816528, "epoch": 4.26866368410815, "grad_norm": 1.2265625, "learning_rate": 0.0003293128969531231, "loss": 5.011, "mean_token_accuracy": 0.21260046809911728, "num_tokens": 95165522.0, "step": 54865 }, { "entropy": 5.934041738510132, "epoch": 4.2690527134798675, "grad_norm": 1.296875, "learning_rate": 0.0003292860005581518, "loss": 4.9354, "mean_token_accuracy": 0.21669624596834183, "num_tokens": 95174159.0, "step": 54870 }, { "entropy": 5.838985824584961, "epoch": 4.269441742851585, "grad_norm": 1.5078125, "learning_rate": 0.00032925910333947694, "loss": 4.9119, "mean_token_accuracy": 0.21921789199113845, "num_tokens": 95182500.0, "step": 54875 }, { "entropy": 5.7371663570404055, "epoch": 4.269830772223303, "grad_norm": 1.3984375, "learning_rate": 0.0003292322052975064, "loss": 4.8663, "mean_token_accuracy": 0.2208938866853714, "num_tokens": 95191297.0, "step": 54880 }, { "entropy": 5.8271307945251465, "epoch": 4.270219801595021, "grad_norm": 1.484375, "learning_rate": 0.0003292053064326485, "loss": 4.9499, "mean_token_accuracy": 0.21705079972743987, "num_tokens": 95199716.0, "step": 54885 }, { "entropy": 5.924205541610718, "epoch": 4.270608830966738, "grad_norm": 1.4140625, "learning_rate": 0.0003291784067453114, "loss": 5.0553, "mean_token_accuracy": 0.20631819367408752, "num_tokens": 95208700.0, "step": 54890 }, { "entropy": 5.8480369567871096, "epoch": 4.270997860338456, "grad_norm": 1.390625, "learning_rate": 0.00032915150623590304, "loss": 4.8686, "mean_token_accuracy": 0.21619944274425507, "num_tokens": 95217242.0, "step": 54895 }, { "entropy": 5.893847894668579, "epoch": 4.271386889710173, "grad_norm": 1.40625, "learning_rate": 0.00032912460490483193, "loss": 4.9849, "mean_token_accuracy": 0.21353087127208709, "num_tokens": 95225969.0, "step": 54900 }, { "entropy": 5.855908823013306, "epoch": 4.2717759190818905, "grad_norm": 1.3046875, "learning_rate": 0.0003290977027525061, "loss": 4.9519, "mean_token_accuracy": 0.21352205127477647, "num_tokens": 95234804.0, "step": 54905 }, { "entropy": 5.883644962310791, "epoch": 4.272164948453608, "grad_norm": 1.4296875, "learning_rate": 0.00032907079977933373, "loss": 5.0043, "mean_token_accuracy": 0.20870378166437148, "num_tokens": 95243012.0, "step": 54910 }, { "entropy": 5.883186101913452, "epoch": 4.272553977825326, "grad_norm": 1.625, "learning_rate": 0.00032904389598572295, "loss": 4.9344, "mean_token_accuracy": 0.22056670486927032, "num_tokens": 95251099.0, "step": 54915 }, { "entropy": 5.911118698120117, "epoch": 4.272943007197044, "grad_norm": 1.3984375, "learning_rate": 0.00032901699137208215, "loss": 5.0038, "mean_token_accuracy": 0.20982222259044647, "num_tokens": 95259357.0, "step": 54920 }, { "entropy": 5.891458415985108, "epoch": 4.273332036568761, "grad_norm": 1.390625, "learning_rate": 0.0003289900859388194, "loss": 5.0124, "mean_token_accuracy": 0.20951216965913771, "num_tokens": 95268407.0, "step": 54925 }, { "entropy": 5.868859481811524, "epoch": 4.273721065940478, "grad_norm": 1.4375, "learning_rate": 0.00032896317968634305, "loss": 4.9929, "mean_token_accuracy": 0.21499414145946502, "num_tokens": 95277452.0, "step": 54930 }, { "entropy": 5.810532426834106, "epoch": 4.274110095312196, "grad_norm": 1.359375, "learning_rate": 0.0003289362726150614, "loss": 4.9187, "mean_token_accuracy": 0.22041234523057937, "num_tokens": 95287306.0, "step": 54935 }, { "entropy": 5.81248288154602, "epoch": 4.2744991246839135, "grad_norm": 1.59375, "learning_rate": 0.00032890936472538255, "loss": 4.8512, "mean_token_accuracy": 0.22181656807661057, "num_tokens": 95296384.0, "step": 54940 }, { "entropy": 5.877361869812011, "epoch": 4.274888154055631, "grad_norm": 1.5078125, "learning_rate": 0.000328882456017715, "loss": 4.9552, "mean_token_accuracy": 0.22213151305913925, "num_tokens": 95304818.0, "step": 54945 }, { "entropy": 5.833614683151245, "epoch": 4.275277183427349, "grad_norm": 1.484375, "learning_rate": 0.00032885554649246697, "loss": 4.9618, "mean_token_accuracy": 0.21347809582948685, "num_tokens": 95313333.0, "step": 54950 }, { "entropy": 5.894190835952759, "epoch": 4.275666212799067, "grad_norm": 1.4765625, "learning_rate": 0.0003288286361500467, "loss": 4.9742, "mean_token_accuracy": 0.21490027606487275, "num_tokens": 95321504.0, "step": 54955 }, { "entropy": 5.892676830291748, "epoch": 4.276055242170784, "grad_norm": 1.46875, "learning_rate": 0.00032880172499086247, "loss": 4.9315, "mean_token_accuracy": 0.21883108615875244, "num_tokens": 95329874.0, "step": 54960 }, { "entropy": 5.88817458152771, "epoch": 4.276444271542501, "grad_norm": 1.390625, "learning_rate": 0.0003287748130153228, "loss": 4.9872, "mean_token_accuracy": 0.20791219621896745, "num_tokens": 95338273.0, "step": 54965 }, { "entropy": 5.822776746749878, "epoch": 4.276833300914219, "grad_norm": 1.4375, "learning_rate": 0.0003287479002238359, "loss": 4.8928, "mean_token_accuracy": 0.22205694764852524, "num_tokens": 95346945.0, "step": 54970 }, { "entropy": 5.81406421661377, "epoch": 4.2772223302859365, "grad_norm": 1.4296875, "learning_rate": 0.0003287209866168102, "loss": 4.8527, "mean_token_accuracy": 0.22102379202842712, "num_tokens": 95355828.0, "step": 54975 }, { "entropy": 5.9019030094146725, "epoch": 4.277611359657654, "grad_norm": 1.34375, "learning_rate": 0.000328694072194654, "loss": 4.9645, "mean_token_accuracy": 0.20816127359867095, "num_tokens": 95364379.0, "step": 54980 }, { "entropy": 5.859149408340454, "epoch": 4.278000389029372, "grad_norm": 1.296875, "learning_rate": 0.00032866715695777565, "loss": 4.9143, "mean_token_accuracy": 0.21812351793050766, "num_tokens": 95373290.0, "step": 54985 }, { "entropy": 5.827863502502441, "epoch": 4.2783894184010896, "grad_norm": 1.515625, "learning_rate": 0.0003286402409065837, "loss": 4.9335, "mean_token_accuracy": 0.21077560931444167, "num_tokens": 95381641.0, "step": 54990 }, { "entropy": 5.798708152770996, "epoch": 4.278778447772807, "grad_norm": 1.3359375, "learning_rate": 0.00032861332404148647, "loss": 4.9181, "mean_token_accuracy": 0.2138545662164688, "num_tokens": 95390428.0, "step": 54995 }, { "entropy": 5.855465984344482, "epoch": 4.279167477144524, "grad_norm": 1.3984375, "learning_rate": 0.00032858640636289235, "loss": 4.8809, "mean_token_accuracy": 0.22131982296705247, "num_tokens": 95398677.0, "step": 55000 }, { "entropy": 5.918880271911621, "epoch": 4.279556506516242, "grad_norm": 1.3984375, "learning_rate": 0.0003285594878712098, "loss": 5.0107, "mean_token_accuracy": 0.2090146228671074, "num_tokens": 95406890.0, "step": 55005 }, { "entropy": 5.8172605514526365, "epoch": 4.2799455358879595, "grad_norm": 1.390625, "learning_rate": 0.0003285325685668473, "loss": 4.8707, "mean_token_accuracy": 0.21443295776844024, "num_tokens": 95415937.0, "step": 55010 }, { "entropy": 5.761719846725464, "epoch": 4.280334565259677, "grad_norm": 1.40625, "learning_rate": 0.00032850564845021327, "loss": 4.8825, "mean_token_accuracy": 0.22111608386039733, "num_tokens": 95424509.0, "step": 55015 }, { "entropy": 5.829315090179444, "epoch": 4.280723594631395, "grad_norm": 1.4609375, "learning_rate": 0.00032847872752171615, "loss": 4.8952, "mean_token_accuracy": 0.21944970339536668, "num_tokens": 95432776.0, "step": 55020 }, { "entropy": 5.950258588790893, "epoch": 4.2811126240031125, "grad_norm": 1.2890625, "learning_rate": 0.00032845180578176456, "loss": 5.0044, "mean_token_accuracy": 0.20795313864946366, "num_tokens": 95442632.0, "step": 55025 }, { "entropy": 5.8630283832550045, "epoch": 4.28150165337483, "grad_norm": 1.390625, "learning_rate": 0.00032842488323076675, "loss": 4.8926, "mean_token_accuracy": 0.21726803928613664, "num_tokens": 95450883.0, "step": 55030 }, { "entropy": 5.755566215515136, "epoch": 4.281890682746547, "grad_norm": 1.4140625, "learning_rate": 0.00032839795986913146, "loss": 4.8274, "mean_token_accuracy": 0.2193460702896118, "num_tokens": 95459596.0, "step": 55035 }, { "entropy": 5.899817848205567, "epoch": 4.282279712118265, "grad_norm": 1.375, "learning_rate": 0.00032837103569726713, "loss": 5.0532, "mean_token_accuracy": 0.20928156822919847, "num_tokens": 95468601.0, "step": 55040 }, { "entropy": 5.846908044815064, "epoch": 4.2826687414899824, "grad_norm": 1.34375, "learning_rate": 0.0003283441107155822, "loss": 4.9153, "mean_token_accuracy": 0.2145295336842537, "num_tokens": 95477596.0, "step": 55045 }, { "entropy": 5.800001430511474, "epoch": 4.2830577708617, "grad_norm": 1.3125, "learning_rate": 0.0003283171849244854, "loss": 4.8221, "mean_token_accuracy": 0.22546463012695311, "num_tokens": 95486895.0, "step": 55050 }, { "entropy": 5.744867897033691, "epoch": 4.283446800233418, "grad_norm": 1.3203125, "learning_rate": 0.00032829025832438507, "loss": 4.7902, "mean_token_accuracy": 0.23085368424654007, "num_tokens": 95495302.0, "step": 55055 }, { "entropy": 5.832707357406616, "epoch": 4.2838358296051355, "grad_norm": 1.5546875, "learning_rate": 0.00032826333091569, "loss": 4.9666, "mean_token_accuracy": 0.21548306196928024, "num_tokens": 95504284.0, "step": 55060 }, { "entropy": 5.801221084594727, "epoch": 4.284224858976852, "grad_norm": 1.3515625, "learning_rate": 0.0003282364026988087, "loss": 4.8651, "mean_token_accuracy": 0.22157531827688218, "num_tokens": 95512990.0, "step": 55065 }, { "entropy": 5.841635894775391, "epoch": 4.28461388834857, "grad_norm": 1.359375, "learning_rate": 0.00032820947367414953, "loss": 4.9941, "mean_token_accuracy": 0.20947542786598206, "num_tokens": 95521742.0, "step": 55070 }, { "entropy": 5.80087628364563, "epoch": 4.285002917720288, "grad_norm": 1.5546875, "learning_rate": 0.0003281825438421215, "loss": 4.8804, "mean_token_accuracy": 0.2205156445503235, "num_tokens": 95529680.0, "step": 55075 }, { "entropy": 5.791516065597534, "epoch": 4.285391947092005, "grad_norm": 1.3671875, "learning_rate": 0.00032815561320313286, "loss": 4.9031, "mean_token_accuracy": 0.22506801933050155, "num_tokens": 95538102.0, "step": 55080 }, { "entropy": 5.843248748779297, "epoch": 4.285780976463723, "grad_norm": 1.3671875, "learning_rate": 0.00032812868175759245, "loss": 4.9126, "mean_token_accuracy": 0.2143519103527069, "num_tokens": 95547149.0, "step": 55085 }, { "entropy": 5.883685350418091, "epoch": 4.286170005835441, "grad_norm": 1.25, "learning_rate": 0.0003281017495059088, "loss": 4.9777, "mean_token_accuracy": 0.2152955412864685, "num_tokens": 95555670.0, "step": 55090 }, { "entropy": 5.923160791397095, "epoch": 4.2865590352071585, "grad_norm": 1.328125, "learning_rate": 0.0003280748164484907, "loss": 5.0063, "mean_token_accuracy": 0.20940128415822984, "num_tokens": 95565080.0, "step": 55095 }, { "entropy": 5.7549244403839115, "epoch": 4.286948064578875, "grad_norm": 1.28125, "learning_rate": 0.0003280478825857468, "loss": 4.9028, "mean_token_accuracy": 0.220510533452034, "num_tokens": 95574563.0, "step": 55100 }, { "entropy": 5.853540134429932, "epoch": 4.287337093950593, "grad_norm": 1.5390625, "learning_rate": 0.00032802094791808565, "loss": 4.9213, "mean_token_accuracy": 0.21017315834760666, "num_tokens": 95583149.0, "step": 55105 }, { "entropy": 5.8665729522705075, "epoch": 4.287726123322311, "grad_norm": 1.328125, "learning_rate": 0.000327994012445916, "loss": 4.9251, "mean_token_accuracy": 0.21795314252376558, "num_tokens": 95591921.0, "step": 55110 }, { "entropy": 5.920933103561401, "epoch": 4.288115152694028, "grad_norm": 1.359375, "learning_rate": 0.0003279670761696465, "loss": 5.0063, "mean_token_accuracy": 0.21067111641168595, "num_tokens": 95601421.0, "step": 55115 }, { "entropy": 5.879787349700928, "epoch": 4.288504182065746, "grad_norm": 1.375, "learning_rate": 0.00032794013908968593, "loss": 4.8971, "mean_token_accuracy": 0.2180783972144127, "num_tokens": 95610362.0, "step": 55120 }, { "entropy": 5.790458726882934, "epoch": 4.288893211437464, "grad_norm": 1.515625, "learning_rate": 0.0003279132012064431, "loss": 4.8517, "mean_token_accuracy": 0.2208317667245865, "num_tokens": 95618432.0, "step": 55125 }, { "entropy": 5.862422513961792, "epoch": 4.289282240809181, "grad_norm": 1.4453125, "learning_rate": 0.0003278862625203266, "loss": 4.9726, "mean_token_accuracy": 0.21313380897045137, "num_tokens": 95626563.0, "step": 55130 }, { "entropy": 5.866970586776733, "epoch": 4.289671270180898, "grad_norm": 1.4140625, "learning_rate": 0.00032785932303174524, "loss": 4.8808, "mean_token_accuracy": 0.2146655187010765, "num_tokens": 95635589.0, "step": 55135 }, { "entropy": 5.830287027359009, "epoch": 4.290060299552616, "grad_norm": 1.375, "learning_rate": 0.00032783238274110787, "loss": 4.8509, "mean_token_accuracy": 0.22286026328802108, "num_tokens": 95643841.0, "step": 55140 }, { "entropy": 5.8444130420684814, "epoch": 4.290449328924334, "grad_norm": 1.484375, "learning_rate": 0.00032780544164882317, "loss": 4.996, "mean_token_accuracy": 0.2208150401711464, "num_tokens": 95652059.0, "step": 55145 }, { "entropy": 5.858502531051636, "epoch": 4.290838358296051, "grad_norm": 1.359375, "learning_rate": 0.0003277784997552999, "loss": 5.0079, "mean_token_accuracy": 0.21006468534469605, "num_tokens": 95661424.0, "step": 55150 }, { "entropy": 5.877637815475464, "epoch": 4.291227387667769, "grad_norm": 1.34375, "learning_rate": 0.00032775155706094684, "loss": 4.9006, "mean_token_accuracy": 0.21560871750116348, "num_tokens": 95669617.0, "step": 55155 }, { "entropy": 5.873055934906006, "epoch": 4.291616417039487, "grad_norm": 1.3203125, "learning_rate": 0.0003277246135661729, "loss": 4.8807, "mean_token_accuracy": 0.22072556614875793, "num_tokens": 95677831.0, "step": 55160 }, { "entropy": 5.880334711074829, "epoch": 4.2920054464112045, "grad_norm": 1.375, "learning_rate": 0.0003276976692713869, "loss": 4.9633, "mean_token_accuracy": 0.2101071372628212, "num_tokens": 95686320.0, "step": 55165 }, { "entropy": 5.796175861358643, "epoch": 4.292394475782921, "grad_norm": 1.4375, "learning_rate": 0.0003276707241769976, "loss": 4.8349, "mean_token_accuracy": 0.22798438519239425, "num_tokens": 95694504.0, "step": 55170 }, { "entropy": 5.911861562728882, "epoch": 4.292783505154639, "grad_norm": 1.3984375, "learning_rate": 0.000327643778283414, "loss": 5.0123, "mean_token_accuracy": 0.2051316499710083, "num_tokens": 95702981.0, "step": 55175 }, { "entropy": 5.85449481010437, "epoch": 4.293172534526357, "grad_norm": 1.34375, "learning_rate": 0.00032761683159104475, "loss": 4.9084, "mean_token_accuracy": 0.22112558782100677, "num_tokens": 95711447.0, "step": 55180 }, { "entropy": 5.861120986938476, "epoch": 4.293561563898074, "grad_norm": 1.359375, "learning_rate": 0.0003275898841002989, "loss": 4.8729, "mean_token_accuracy": 0.21780747622251512, "num_tokens": 95719539.0, "step": 55185 }, { "entropy": 5.7952686786651615, "epoch": 4.293950593269792, "grad_norm": 1.4453125, "learning_rate": 0.00032756293581158517, "loss": 4.9111, "mean_token_accuracy": 0.220981465280056, "num_tokens": 95728512.0, "step": 55190 }, { "entropy": 5.832409524917603, "epoch": 4.29433962264151, "grad_norm": 1.4921875, "learning_rate": 0.0003275359867253127, "loss": 4.9637, "mean_token_accuracy": 0.21669438779354094, "num_tokens": 95737153.0, "step": 55195 }, { "entropy": 5.942195701599121, "epoch": 4.294728652013227, "grad_norm": 1.390625, "learning_rate": 0.0003275090368418901, "loss": 5.0014, "mean_token_accuracy": 0.21149560660123826, "num_tokens": 95745942.0, "step": 55200 }, { "entropy": 5.83469409942627, "epoch": 4.295117681384944, "grad_norm": 1.3359375, "learning_rate": 0.0003274820861617265, "loss": 4.9728, "mean_token_accuracy": 0.21120262295007705, "num_tokens": 95755074.0, "step": 55205 }, { "entropy": 5.833517169952392, "epoch": 4.295506710756662, "grad_norm": 1.4140625, "learning_rate": 0.0003274551346852308, "loss": 4.951, "mean_token_accuracy": 0.21271960139274598, "num_tokens": 95763590.0, "step": 55210 }, { "entropy": 5.851959848403931, "epoch": 4.29589574012838, "grad_norm": 1.359375, "learning_rate": 0.0003274281824128119, "loss": 4.9432, "mean_token_accuracy": 0.20896997600793837, "num_tokens": 95772036.0, "step": 55215 }, { "entropy": 5.856668901443482, "epoch": 4.296284769500097, "grad_norm": 1.4375, "learning_rate": 0.00032740122934487876, "loss": 4.9018, "mean_token_accuracy": 0.22545751333236694, "num_tokens": 95780559.0, "step": 55220 }, { "entropy": 5.852445363998413, "epoch": 4.296673798871815, "grad_norm": 1.34375, "learning_rate": 0.0003273742754818405, "loss": 4.9533, "mean_token_accuracy": 0.21392373144626617, "num_tokens": 95789022.0, "step": 55225 }, { "entropy": 5.821959590911865, "epoch": 4.297062828243533, "grad_norm": 1.3203125, "learning_rate": 0.0003273473208241058, "loss": 4.8769, "mean_token_accuracy": 0.2134683445096016, "num_tokens": 95797341.0, "step": 55230 }, { "entropy": 5.795345497131348, "epoch": 4.29745185761525, "grad_norm": 1.4140625, "learning_rate": 0.00032732036537208386, "loss": 4.8916, "mean_token_accuracy": 0.2209555670619011, "num_tokens": 95805961.0, "step": 55235 }, { "entropy": 5.831258630752563, "epoch": 4.297840886986967, "grad_norm": 1.453125, "learning_rate": 0.0003272934091261837, "loss": 4.9543, "mean_token_accuracy": 0.21515632718801497, "num_tokens": 95814429.0, "step": 55240 }, { "entropy": 5.843974351882935, "epoch": 4.298229916358685, "grad_norm": 1.3984375, "learning_rate": 0.00032726645208681427, "loss": 4.9365, "mean_token_accuracy": 0.2207690268754959, "num_tokens": 95822612.0, "step": 55245 }, { "entropy": 5.80584020614624, "epoch": 4.298618945730403, "grad_norm": 1.40625, "learning_rate": 0.00032723949425438465, "loss": 4.828, "mean_token_accuracy": 0.2241604059934616, "num_tokens": 95830957.0, "step": 55250 }, { "entropy": 5.865558004379272, "epoch": 4.29900797510212, "grad_norm": 1.4453125, "learning_rate": 0.00032721253562930383, "loss": 4.9605, "mean_token_accuracy": 0.21349277794361116, "num_tokens": 95839676.0, "step": 55255 }, { "entropy": 5.878401517868042, "epoch": 4.299397004473838, "grad_norm": 1.3359375, "learning_rate": 0.00032718557621198087, "loss": 4.9225, "mean_token_accuracy": 0.21890877932310104, "num_tokens": 95848093.0, "step": 55260 }, { "entropy": 5.878016233444214, "epoch": 4.299786033845555, "grad_norm": 1.34375, "learning_rate": 0.0003271586160028249, "loss": 5.0342, "mean_token_accuracy": 0.2076333001255989, "num_tokens": 95856971.0, "step": 55265 }, { "entropy": 5.793928527832032, "epoch": 4.300175063217273, "grad_norm": 1.453125, "learning_rate": 0.0003271316550022449, "loss": 4.9634, "mean_token_accuracy": 0.21493091583251953, "num_tokens": 95865978.0, "step": 55270 }, { "entropy": 5.864184379577637, "epoch": 4.30056409258899, "grad_norm": 1.3671875, "learning_rate": 0.00032710469321065, "loss": 4.9742, "mean_token_accuracy": 0.21658277213573457, "num_tokens": 95874605.0, "step": 55275 }, { "entropy": 5.891385459899903, "epoch": 4.300953121960708, "grad_norm": 1.4296875, "learning_rate": 0.0003270777306284493, "loss": 4.9255, "mean_token_accuracy": 0.2117101162672043, "num_tokens": 95883460.0, "step": 55280 }, { "entropy": 5.942352914810181, "epoch": 4.301342151332426, "grad_norm": 1.40625, "learning_rate": 0.000327050767256052, "loss": 5.063, "mean_token_accuracy": 0.20868974924087524, "num_tokens": 95892500.0, "step": 55285 }, { "entropy": 5.908770275115967, "epoch": 4.301731180704143, "grad_norm": 1.3671875, "learning_rate": 0.00032702380309386714, "loss": 4.999, "mean_token_accuracy": 0.20895248055458068, "num_tokens": 95902154.0, "step": 55290 }, { "entropy": 5.867869567871094, "epoch": 4.302120210075861, "grad_norm": 1.40625, "learning_rate": 0.00032699683814230385, "loss": 4.931, "mean_token_accuracy": 0.21977607607841493, "num_tokens": 95910809.0, "step": 55295 }, { "entropy": 5.8903004169464115, "epoch": 4.302509239447578, "grad_norm": 1.3359375, "learning_rate": 0.0003269698724017713, "loss": 5.0403, "mean_token_accuracy": 0.2052719384431839, "num_tokens": 95919194.0, "step": 55300 }, { "entropy": 5.8414942741394045, "epoch": 4.302898268819296, "grad_norm": 1.4140625, "learning_rate": 0.00032694290587267867, "loss": 4.8946, "mean_token_accuracy": 0.22431287169456482, "num_tokens": 95927202.0, "step": 55305 }, { "entropy": 5.853916597366333, "epoch": 4.303287298191013, "grad_norm": 1.375, "learning_rate": 0.0003269159385554352, "loss": 4.9419, "mean_token_accuracy": 0.22306456714868544, "num_tokens": 95935821.0, "step": 55310 }, { "entropy": 5.834225225448608, "epoch": 4.303676327562731, "grad_norm": 1.3125, "learning_rate": 0.0003268889704504499, "loss": 4.875, "mean_token_accuracy": 0.21587986797094344, "num_tokens": 95944863.0, "step": 55315 }, { "entropy": 5.890927362442016, "epoch": 4.304065356934449, "grad_norm": 1.4296875, "learning_rate": 0.00032686200155813196, "loss": 4.9179, "mean_token_accuracy": 0.21670316606760026, "num_tokens": 95953250.0, "step": 55320 }, { "entropy": 5.849037837982178, "epoch": 4.304454386306166, "grad_norm": 1.4296875, "learning_rate": 0.0003268350318788908, "loss": 4.9737, "mean_token_accuracy": 0.2110270231962204, "num_tokens": 95961679.0, "step": 55325 }, { "entropy": 5.842361927032471, "epoch": 4.304843415677884, "grad_norm": 1.4296875, "learning_rate": 0.0003268080614131356, "loss": 4.9238, "mean_token_accuracy": 0.21862058937549592, "num_tokens": 95969599.0, "step": 55330 }, { "entropy": 5.806553792953491, "epoch": 4.305232445049601, "grad_norm": 1.421875, "learning_rate": 0.0003267810901612754, "loss": 4.8428, "mean_token_accuracy": 0.22767717838287355, "num_tokens": 95977954.0, "step": 55335 }, { "entropy": 5.857578992843628, "epoch": 4.305621474421319, "grad_norm": 1.3828125, "learning_rate": 0.00032675411812371975, "loss": 4.9641, "mean_token_accuracy": 0.2134447365999222, "num_tokens": 95986720.0, "step": 55340 }, { "entropy": 5.777856397628784, "epoch": 4.306010503793036, "grad_norm": 1.390625, "learning_rate": 0.00032672714530087763, "loss": 4.8271, "mean_token_accuracy": 0.21485936194658278, "num_tokens": 95995053.0, "step": 55345 }, { "entropy": 5.859212827682495, "epoch": 4.306399533164754, "grad_norm": 1.40625, "learning_rate": 0.00032670017169315836, "loss": 5.0131, "mean_token_accuracy": 0.2090982601046562, "num_tokens": 96004074.0, "step": 55350 }, { "entropy": 5.8185442924499515, "epoch": 4.306788562536472, "grad_norm": 1.3515625, "learning_rate": 0.0003266731973009713, "loss": 4.8594, "mean_token_accuracy": 0.21759750843048095, "num_tokens": 96012845.0, "step": 55355 }, { "entropy": 5.865191221237183, "epoch": 4.307177591908189, "grad_norm": 1.375, "learning_rate": 0.0003266462221247257, "loss": 4.8861, "mean_token_accuracy": 0.22414237409830093, "num_tokens": 96021089.0, "step": 55360 }, { "entropy": 5.862734460830689, "epoch": 4.307566621279907, "grad_norm": 1.3671875, "learning_rate": 0.000326619246164831, "loss": 4.9471, "mean_token_accuracy": 0.21296327114105223, "num_tokens": 96029587.0, "step": 55365 }, { "entropy": 5.829333353042602, "epoch": 4.307955650651624, "grad_norm": 1.3671875, "learning_rate": 0.0003265922694216963, "loss": 4.9564, "mean_token_accuracy": 0.21202111840248108, "num_tokens": 96039476.0, "step": 55370 }, { "entropy": 5.829576539993286, "epoch": 4.308344680023342, "grad_norm": 1.421875, "learning_rate": 0.00032656529189573107, "loss": 4.8997, "mean_token_accuracy": 0.21287769228219985, "num_tokens": 96047621.0, "step": 55375 }, { "entropy": 5.771330118179321, "epoch": 4.308733709395059, "grad_norm": 1.4296875, "learning_rate": 0.0003265383135873446, "loss": 4.7708, "mean_token_accuracy": 0.2302372932434082, "num_tokens": 96056876.0, "step": 55380 }, { "entropy": 5.831834125518799, "epoch": 4.309122738766777, "grad_norm": 1.46875, "learning_rate": 0.0003265113344969462, "loss": 4.9643, "mean_token_accuracy": 0.21584170758724214, "num_tokens": 96065126.0, "step": 55385 }, { "entropy": 5.745485115051269, "epoch": 4.309511768138495, "grad_norm": 1.3515625, "learning_rate": 0.0003264843546249453, "loss": 4.869, "mean_token_accuracy": 0.21964472234249116, "num_tokens": 96074316.0, "step": 55390 }, { "entropy": 5.882855653762817, "epoch": 4.309900797510212, "grad_norm": 1.421875, "learning_rate": 0.00032645737397175135, "loss": 4.9203, "mean_token_accuracy": 0.21389081627130507, "num_tokens": 96082227.0, "step": 55395 }, { "entropy": 5.8174365043640135, "epoch": 4.310289826881929, "grad_norm": 1.4140625, "learning_rate": 0.00032643039253777356, "loss": 4.8789, "mean_token_accuracy": 0.22587417513132096, "num_tokens": 96091385.0, "step": 55400 }, { "entropy": 5.859004831314087, "epoch": 4.310678856253647, "grad_norm": 1.5546875, "learning_rate": 0.00032640341032342147, "loss": 5.0405, "mean_token_accuracy": 0.21065380275249482, "num_tokens": 96099551.0, "step": 55405 }, { "entropy": 5.726630544662475, "epoch": 4.311067885625365, "grad_norm": 1.4453125, "learning_rate": 0.00032637642732910447, "loss": 4.8583, "mean_token_accuracy": 0.23032439202070237, "num_tokens": 96107801.0, "step": 55410 }, { "entropy": 5.8536440372467045, "epoch": 4.311456914997082, "grad_norm": 1.3203125, "learning_rate": 0.00032634944355523196, "loss": 5.0039, "mean_token_accuracy": 0.20518322587013244, "num_tokens": 96116917.0, "step": 55415 }, { "entropy": 5.808343935012817, "epoch": 4.3118459443688, "grad_norm": 1.4140625, "learning_rate": 0.0003263224590022133, "loss": 4.8379, "mean_token_accuracy": 0.2260502591729164, "num_tokens": 96124970.0, "step": 55420 }, { "entropy": 5.862708806991577, "epoch": 4.312234973740518, "grad_norm": 1.3046875, "learning_rate": 0.00032629547367045805, "loss": 4.9488, "mean_token_accuracy": 0.21923464834690093, "num_tokens": 96133956.0, "step": 55425 }, { "entropy": 5.907765054702759, "epoch": 4.312624003112235, "grad_norm": 1.2890625, "learning_rate": 0.00032626848756037565, "loss": 4.998, "mean_token_accuracy": 0.2063562273979187, "num_tokens": 96142182.0, "step": 55430 }, { "entropy": 5.8354353427886965, "epoch": 4.313013032483952, "grad_norm": 1.5390625, "learning_rate": 0.00032624150067237553, "loss": 4.8773, "mean_token_accuracy": 0.22208960205316544, "num_tokens": 96150501.0, "step": 55435 }, { "entropy": 5.911330461502075, "epoch": 4.31340206185567, "grad_norm": 1.5390625, "learning_rate": 0.0003262145130068672, "loss": 4.9374, "mean_token_accuracy": 0.21903022527694702, "num_tokens": 96159386.0, "step": 55440 }, { "entropy": 5.906987905502319, "epoch": 4.313791091227388, "grad_norm": 1.3515625, "learning_rate": 0.00032618752456426017, "loss": 5.0147, "mean_token_accuracy": 0.20584727376699447, "num_tokens": 96167313.0, "step": 55445 }, { "entropy": 5.829735803604126, "epoch": 4.314180120599105, "grad_norm": 1.2734375, "learning_rate": 0.00032616053534496387, "loss": 4.8552, "mean_token_accuracy": 0.22804607450962067, "num_tokens": 96176120.0, "step": 55450 }, { "entropy": 5.890226078033447, "epoch": 4.314569149970823, "grad_norm": 1.4140625, "learning_rate": 0.0003261335453493879, "loss": 5.0102, "mean_token_accuracy": 0.20846241265535354, "num_tokens": 96185088.0, "step": 55455 }, { "entropy": 5.872335958480835, "epoch": 4.314958179342541, "grad_norm": 1.4453125, "learning_rate": 0.00032610655457794184, "loss": 4.9418, "mean_token_accuracy": 0.21268551796674728, "num_tokens": 96193136.0, "step": 55460 }, { "entropy": 5.860608768463135, "epoch": 4.3153472087142575, "grad_norm": 1.453125, "learning_rate": 0.00032607956303103516, "loss": 4.969, "mean_token_accuracy": 0.21453715413808822, "num_tokens": 96202141.0, "step": 55465 }, { "entropy": 5.7723511219024655, "epoch": 4.315736238085975, "grad_norm": 1.421875, "learning_rate": 0.00032605257070907734, "loss": 4.8288, "mean_token_accuracy": 0.2237903133034706, "num_tokens": 96210523.0, "step": 55470 }, { "entropy": 5.753247880935669, "epoch": 4.316125267457693, "grad_norm": 1.34375, "learning_rate": 0.00032602557761247805, "loss": 4.8388, "mean_token_accuracy": 0.2269977569580078, "num_tokens": 96218771.0, "step": 55475 }, { "entropy": 5.824993562698364, "epoch": 4.316514296829411, "grad_norm": 1.421875, "learning_rate": 0.0003259985837416468, "loss": 4.9788, "mean_token_accuracy": 0.2155532106757164, "num_tokens": 96227488.0, "step": 55480 }, { "entropy": 5.849914407730102, "epoch": 4.316903326201128, "grad_norm": 1.3515625, "learning_rate": 0.0003259715890969932, "loss": 5.0362, "mean_token_accuracy": 0.20835191160440444, "num_tokens": 96236119.0, "step": 55485 }, { "entropy": 5.874361991882324, "epoch": 4.317292355572846, "grad_norm": 1.453125, "learning_rate": 0.0003259445936789269, "loss": 4.9835, "mean_token_accuracy": 0.21514023691415787, "num_tokens": 96244027.0, "step": 55490 }, { "entropy": 5.792952823638916, "epoch": 4.317681384944564, "grad_norm": 1.453125, "learning_rate": 0.00032591759748785753, "loss": 4.8974, "mean_token_accuracy": 0.22385378330945968, "num_tokens": 96252442.0, "step": 55495 }, { "entropy": 5.808651161193848, "epoch": 4.3180704143162805, "grad_norm": 1.3828125, "learning_rate": 0.0003258906005241946, "loss": 4.8882, "mean_token_accuracy": 0.21964877396821975, "num_tokens": 96260818.0, "step": 55500 }, { "entropy": 5.786374568939209, "epoch": 4.318459443687998, "grad_norm": 1.3828125, "learning_rate": 0.0003258636027883478, "loss": 4.8449, "mean_token_accuracy": 0.2192978248000145, "num_tokens": 96268914.0, "step": 55505 }, { "entropy": 5.829056453704834, "epoch": 4.318848473059716, "grad_norm": 1.390625, "learning_rate": 0.0003258366042807269, "loss": 4.9289, "mean_token_accuracy": 0.21526458114385605, "num_tokens": 96277438.0, "step": 55510 }, { "entropy": 5.818345212936402, "epoch": 4.319237502431434, "grad_norm": 1.453125, "learning_rate": 0.0003258096050017413, "loss": 4.8486, "mean_token_accuracy": 0.2207943320274353, "num_tokens": 96286088.0, "step": 55515 }, { "entropy": 5.863838529586792, "epoch": 4.319626531803151, "grad_norm": 1.4453125, "learning_rate": 0.0003257826049518008, "loss": 5.0148, "mean_token_accuracy": 0.21066470742225646, "num_tokens": 96294741.0, "step": 55520 }, { "entropy": 5.790809535980225, "epoch": 4.320015561174869, "grad_norm": 1.3359375, "learning_rate": 0.0003257556041313153, "loss": 4.906, "mean_token_accuracy": 0.21563355326652528, "num_tokens": 96303689.0, "step": 55525 }, { "entropy": 5.771593523025513, "epoch": 4.320404590546587, "grad_norm": 1.484375, "learning_rate": 0.0003257286025406941, "loss": 4.9165, "mean_token_accuracy": 0.2159102663397789, "num_tokens": 96312140.0, "step": 55530 }, { "entropy": 5.879526901245117, "epoch": 4.3207936199183035, "grad_norm": 1.5234375, "learning_rate": 0.00032570160018034717, "loss": 4.986, "mean_token_accuracy": 0.21532522439956664, "num_tokens": 96321161.0, "step": 55535 }, { "entropy": 5.886573123931885, "epoch": 4.321182649290021, "grad_norm": 1.4296875, "learning_rate": 0.00032567459705068415, "loss": 4.9602, "mean_token_accuracy": 0.21237818747758866, "num_tokens": 96330290.0, "step": 55540 }, { "entropy": 5.823737335205078, "epoch": 4.321571678661739, "grad_norm": 1.296875, "learning_rate": 0.00032564759315211475, "loss": 4.9347, "mean_token_accuracy": 0.21561281234025956, "num_tokens": 96338998.0, "step": 55545 }, { "entropy": 5.84109582901001, "epoch": 4.3219607080334566, "grad_norm": 1.40625, "learning_rate": 0.00032562058848504877, "loss": 4.9436, "mean_token_accuracy": 0.2147877961397171, "num_tokens": 96348528.0, "step": 55550 }, { "entropy": 5.835260105133057, "epoch": 4.322349737405174, "grad_norm": 1.390625, "learning_rate": 0.0003255935830498959, "loss": 4.8967, "mean_token_accuracy": 0.2194436490535736, "num_tokens": 96357323.0, "step": 55555 }, { "entropy": 5.910776138305664, "epoch": 4.322738766776892, "grad_norm": 1.421875, "learning_rate": 0.000325566576847066, "loss": 4.985, "mean_token_accuracy": 0.21233998686075212, "num_tokens": 96366099.0, "step": 55560 }, { "entropy": 5.890255451202393, "epoch": 4.32312779614861, "grad_norm": 1.3359375, "learning_rate": 0.0003255395698769687, "loss": 4.9291, "mean_token_accuracy": 0.2212217330932617, "num_tokens": 96374093.0, "step": 55565 }, { "entropy": 5.859545803070068, "epoch": 4.3235168255203265, "grad_norm": 1.421875, "learning_rate": 0.0003255125621400139, "loss": 4.9575, "mean_token_accuracy": 0.21254828125238417, "num_tokens": 96382641.0, "step": 55570 }, { "entropy": 5.822468185424805, "epoch": 4.323905854892044, "grad_norm": 1.484375, "learning_rate": 0.0003254855536366114, "loss": 4.9112, "mean_token_accuracy": 0.215688656270504, "num_tokens": 96391504.0, "step": 55575 }, { "entropy": 5.791967153549194, "epoch": 4.324294884263762, "grad_norm": 1.359375, "learning_rate": 0.000325458544367171, "loss": 4.9442, "mean_token_accuracy": 0.21149833351373673, "num_tokens": 96400437.0, "step": 55580 }, { "entropy": 5.887205123901367, "epoch": 4.3246839136354795, "grad_norm": 1.3046875, "learning_rate": 0.00032543153433210243, "loss": 4.9944, "mean_token_accuracy": 0.20876852571964263, "num_tokens": 96408632.0, "step": 55585 }, { "entropy": 5.8072288036346436, "epoch": 4.325072943007197, "grad_norm": 1.40625, "learning_rate": 0.0003254045235318156, "loss": 4.8633, "mean_token_accuracy": 0.21757478564977645, "num_tokens": 96417307.0, "step": 55590 }, { "entropy": 5.825234270095825, "epoch": 4.325461972378915, "grad_norm": 1.4140625, "learning_rate": 0.00032537751196672033, "loss": 4.9111, "mean_token_accuracy": 0.22347909063100815, "num_tokens": 96426209.0, "step": 55595 }, { "entropy": 5.844443893432617, "epoch": 4.325851001750632, "grad_norm": 1.3984375, "learning_rate": 0.0003253504996372266, "loss": 4.9592, "mean_token_accuracy": 0.21933119893074035, "num_tokens": 96435119.0, "step": 55600 }, { "entropy": 5.8342437744140625, "epoch": 4.3262400311223494, "grad_norm": 1.3671875, "learning_rate": 0.0003253234865437442, "loss": 4.8845, "mean_token_accuracy": 0.2195989653468132, "num_tokens": 96443940.0, "step": 55605 }, { "entropy": 5.846450567245483, "epoch": 4.326629060494067, "grad_norm": 1.265625, "learning_rate": 0.0003252964726866829, "loss": 4.9618, "mean_token_accuracy": 0.21730911135673522, "num_tokens": 96452791.0, "step": 55610 }, { "entropy": 5.860593366622925, "epoch": 4.327018089865785, "grad_norm": 1.5234375, "learning_rate": 0.00032526945806645265, "loss": 5.0128, "mean_token_accuracy": 0.20944087505340575, "num_tokens": 96461210.0, "step": 55615 }, { "entropy": 5.869510269165039, "epoch": 4.3274071192375025, "grad_norm": 1.578125, "learning_rate": 0.0003252424426834634, "loss": 4.906, "mean_token_accuracy": 0.22268157601356506, "num_tokens": 96469331.0, "step": 55620 }, { "entropy": 5.871769523620605, "epoch": 4.32779614860922, "grad_norm": 1.40625, "learning_rate": 0.0003252154265381251, "loss": 5.0466, "mean_token_accuracy": 0.21273259371519088, "num_tokens": 96478114.0, "step": 55625 }, { "entropy": 5.881192541122436, "epoch": 4.328185177980938, "grad_norm": 1.4765625, "learning_rate": 0.0003251884096308476, "loss": 4.9782, "mean_token_accuracy": 0.21525080054998397, "num_tokens": 96486884.0, "step": 55630 }, { "entropy": 5.8102458953857425, "epoch": 4.328574207352655, "grad_norm": 1.4453125, "learning_rate": 0.00032516139196204087, "loss": 4.9787, "mean_token_accuracy": 0.2091996043920517, "num_tokens": 96495584.0, "step": 55635 }, { "entropy": 5.840975666046143, "epoch": 4.328963236724372, "grad_norm": 1.4296875, "learning_rate": 0.00032513437353211483, "loss": 4.9557, "mean_token_accuracy": 0.21153714656829833, "num_tokens": 96504241.0, "step": 55640 }, { "entropy": 5.884627962112427, "epoch": 4.32935226609609, "grad_norm": 1.3984375, "learning_rate": 0.0003251073543414796, "loss": 4.9663, "mean_token_accuracy": 0.21262812465429307, "num_tokens": 96512859.0, "step": 55645 }, { "entropy": 5.8136622428894045, "epoch": 4.329741295467808, "grad_norm": 1.2734375, "learning_rate": 0.00032508033439054493, "loss": 4.9396, "mean_token_accuracy": 0.21529333293437958, "num_tokens": 96521866.0, "step": 55650 }, { "entropy": 5.810681343078613, "epoch": 4.3301303248395255, "grad_norm": 1.2734375, "learning_rate": 0.0003250533136797208, "loss": 4.9529, "mean_token_accuracy": 0.2122107371687889, "num_tokens": 96530422.0, "step": 55655 }, { "entropy": 5.732446622848511, "epoch": 4.330519354211243, "grad_norm": 1.4296875, "learning_rate": 0.00032502629220941743, "loss": 4.7787, "mean_token_accuracy": 0.23482239246368408, "num_tokens": 96538785.0, "step": 55660 }, { "entropy": 5.826683759689331, "epoch": 4.33090838358296, "grad_norm": 1.4296875, "learning_rate": 0.00032499926998004464, "loss": 4.9221, "mean_token_accuracy": 0.21832953989505768, "num_tokens": 96546942.0, "step": 55665 }, { "entropy": 5.88804407119751, "epoch": 4.331297412954678, "grad_norm": 1.3828125, "learning_rate": 0.0003249722469920126, "loss": 5.0484, "mean_token_accuracy": 0.20886122435331345, "num_tokens": 96555864.0, "step": 55670 }, { "entropy": 5.8177087783813475, "epoch": 4.331686442326395, "grad_norm": 1.34375, "learning_rate": 0.0003249452232457312, "loss": 4.8916, "mean_token_accuracy": 0.21929075419902802, "num_tokens": 96564493.0, "step": 55675 }, { "entropy": 5.802357912063599, "epoch": 4.332075471698113, "grad_norm": 1.4375, "learning_rate": 0.00032491819874161046, "loss": 4.8747, "mean_token_accuracy": 0.22094125300645828, "num_tokens": 96572580.0, "step": 55680 }, { "entropy": 5.774946880340576, "epoch": 4.332464501069831, "grad_norm": 1.2890625, "learning_rate": 0.0003248911734800606, "loss": 4.9051, "mean_token_accuracy": 0.21621127277612687, "num_tokens": 96580837.0, "step": 55685 }, { "entropy": 5.88614821434021, "epoch": 4.3328535304415485, "grad_norm": 1.390625, "learning_rate": 0.00032486414746149154, "loss": 5.0254, "mean_token_accuracy": 0.20757483094930648, "num_tokens": 96590177.0, "step": 55690 }, { "entropy": 5.812265825271607, "epoch": 4.333242559813266, "grad_norm": 1.453125, "learning_rate": 0.00032483712068631345, "loss": 4.8436, "mean_token_accuracy": 0.2200772926211357, "num_tokens": 96597656.0, "step": 55695 }, { "entropy": 5.867917490005493, "epoch": 4.333631589184984, "grad_norm": 1.484375, "learning_rate": 0.0003248100931549364, "loss": 4.933, "mean_token_accuracy": 0.2085030570626259, "num_tokens": 96606118.0, "step": 55700 }, { "entropy": 5.859596872329712, "epoch": 4.334020618556701, "grad_norm": 1.4921875, "learning_rate": 0.00032478306486777037, "loss": 4.9825, "mean_token_accuracy": 0.21006937175989152, "num_tokens": 96615088.0, "step": 55705 }, { "entropy": 5.875917863845825, "epoch": 4.334409647928418, "grad_norm": 1.375, "learning_rate": 0.0003247560358252256, "loss": 4.921, "mean_token_accuracy": 0.21881041973829268, "num_tokens": 96624024.0, "step": 55710 }, { "entropy": 5.834152698516846, "epoch": 4.334798677300136, "grad_norm": 1.40625, "learning_rate": 0.00032472900602771224, "loss": 4.9134, "mean_token_accuracy": 0.2217002436518669, "num_tokens": 96633002.0, "step": 55715 }, { "entropy": 5.839703130722046, "epoch": 4.335187706671854, "grad_norm": 1.375, "learning_rate": 0.00032470197547564036, "loss": 5.0117, "mean_token_accuracy": 0.2131392017006874, "num_tokens": 96641587.0, "step": 55720 }, { "entropy": 5.759793376922607, "epoch": 4.3355767360435715, "grad_norm": 1.390625, "learning_rate": 0.00032467494416942006, "loss": 4.8628, "mean_token_accuracy": 0.21641114801168443, "num_tokens": 96650279.0, "step": 55725 }, { "entropy": 5.8337469577789305, "epoch": 4.335965765415289, "grad_norm": 1.390625, "learning_rate": 0.0003246479121094616, "loss": 4.933, "mean_token_accuracy": 0.21473925411701203, "num_tokens": 96659261.0, "step": 55730 }, { "entropy": 5.841267442703247, "epoch": 4.336354794787006, "grad_norm": 1.3125, "learning_rate": 0.000324620879296175, "loss": 4.9284, "mean_token_accuracy": 0.2109975442290306, "num_tokens": 96668064.0, "step": 55735 }, { "entropy": 5.839495658874512, "epoch": 4.336743824158724, "grad_norm": 1.5859375, "learning_rate": 0.0003245938457299706, "loss": 4.8955, "mean_token_accuracy": 0.21071844398975373, "num_tokens": 96676442.0, "step": 55740 }, { "entropy": 5.790213346481323, "epoch": 4.337132853530441, "grad_norm": 1.5234375, "learning_rate": 0.00032456681141125853, "loss": 4.8821, "mean_token_accuracy": 0.2237157866358757, "num_tokens": 96684752.0, "step": 55745 }, { "entropy": 5.824897193908692, "epoch": 4.337521882902159, "grad_norm": 1.5625, "learning_rate": 0.000324539776340449, "loss": 4.9346, "mean_token_accuracy": 0.21848150342702866, "num_tokens": 96693179.0, "step": 55750 }, { "entropy": 5.842472410202026, "epoch": 4.337910912273877, "grad_norm": 1.375, "learning_rate": 0.0003245127405179522, "loss": 4.9964, "mean_token_accuracy": 0.21417265385389328, "num_tokens": 96702139.0, "step": 55755 }, { "entropy": 5.836424827575684, "epoch": 4.3382999416455945, "grad_norm": 1.421875, "learning_rate": 0.0003244857039441784, "loss": 4.9315, "mean_token_accuracy": 0.22030932009220122, "num_tokens": 96710372.0, "step": 55760 }, { "entropy": 5.879325819015503, "epoch": 4.338688971017312, "grad_norm": 1.421875, "learning_rate": 0.00032445866661953774, "loss": 4.9714, "mean_token_accuracy": 0.2103179484605789, "num_tokens": 96718514.0, "step": 55765 }, { "entropy": 5.799934577941895, "epoch": 4.339078000389029, "grad_norm": 1.421875, "learning_rate": 0.00032443162854444064, "loss": 4.9152, "mean_token_accuracy": 0.21605355441570281, "num_tokens": 96727014.0, "step": 55770 }, { "entropy": 5.85666069984436, "epoch": 4.339467029760747, "grad_norm": 1.3984375, "learning_rate": 0.0003244045897192972, "loss": 4.9785, "mean_token_accuracy": 0.21584648340940477, "num_tokens": 96735590.0, "step": 55775 }, { "entropy": 5.889454555511475, "epoch": 4.339856059132464, "grad_norm": 1.5546875, "learning_rate": 0.00032437755014451777, "loss": 4.9955, "mean_token_accuracy": 0.20983894169330597, "num_tokens": 96745155.0, "step": 55780 }, { "entropy": 5.837863826751709, "epoch": 4.340245088504182, "grad_norm": 1.3046875, "learning_rate": 0.00032435050982051246, "loss": 4.9101, "mean_token_accuracy": 0.21393893510103226, "num_tokens": 96754412.0, "step": 55785 }, { "entropy": 5.863303279876709, "epoch": 4.3406341178759, "grad_norm": 1.390625, "learning_rate": 0.00032432346874769187, "loss": 4.8908, "mean_token_accuracy": 0.22138460576534272, "num_tokens": 96763058.0, "step": 55790 }, { "entropy": 5.909774303436279, "epoch": 4.3410231472476175, "grad_norm": 1.3828125, "learning_rate": 0.00032429642692646614, "loss": 5.0162, "mean_token_accuracy": 0.21747536659240724, "num_tokens": 96771403.0, "step": 55795 }, { "entropy": 5.857864141464233, "epoch": 4.341412176619334, "grad_norm": 1.34375, "learning_rate": 0.00032426938435724554, "loss": 4.9332, "mean_token_accuracy": 0.21226586252450944, "num_tokens": 96780305.0, "step": 55800 }, { "entropy": 5.820909643173218, "epoch": 4.341801205991052, "grad_norm": 1.5078125, "learning_rate": 0.00032424234104044055, "loss": 4.8497, "mean_token_accuracy": 0.2312459871172905, "num_tokens": 96788536.0, "step": 55805 }, { "entropy": 5.7993567943572994, "epoch": 4.34219023536277, "grad_norm": 1.2890625, "learning_rate": 0.0003242152969764613, "loss": 4.8487, "mean_token_accuracy": 0.2197882816195488, "num_tokens": 96797078.0, "step": 55810 }, { "entropy": 5.8345277309417725, "epoch": 4.342579264734487, "grad_norm": 1.3671875, "learning_rate": 0.0003241882521657183, "loss": 4.9062, "mean_token_accuracy": 0.21311198621988298, "num_tokens": 96805781.0, "step": 55815 }, { "entropy": 5.918642377853393, "epoch": 4.342968294106205, "grad_norm": 1.4921875, "learning_rate": 0.00032416120660862187, "loss": 5.027, "mean_token_accuracy": 0.21792485415935517, "num_tokens": 96814382.0, "step": 55820 }, { "entropy": 5.948053693771362, "epoch": 4.343357323477923, "grad_norm": 1.3125, "learning_rate": 0.0003241341603055823, "loss": 5.0227, "mean_token_accuracy": 0.21166738420724868, "num_tokens": 96823775.0, "step": 55825 }, { "entropy": 5.806930923461914, "epoch": 4.3437463528496405, "grad_norm": 1.4296875, "learning_rate": 0.0003241071132570101, "loss": 4.8451, "mean_token_accuracy": 0.22760902494192123, "num_tokens": 96831952.0, "step": 55830 }, { "entropy": 5.846064662933349, "epoch": 4.344135382221357, "grad_norm": 1.4453125, "learning_rate": 0.0003240800654633157, "loss": 4.9393, "mean_token_accuracy": 0.2155827060341835, "num_tokens": 96839848.0, "step": 55835 }, { "entropy": 5.896370077133179, "epoch": 4.344524411593075, "grad_norm": 1.359375, "learning_rate": 0.0003240530169249094, "loss": 5.0132, "mean_token_accuracy": 0.20939721465110778, "num_tokens": 96849282.0, "step": 55840 }, { "entropy": 5.838213300704956, "epoch": 4.344913440964793, "grad_norm": 1.265625, "learning_rate": 0.0003240259676422016, "loss": 4.9687, "mean_token_accuracy": 0.21659334003925323, "num_tokens": 96858917.0, "step": 55845 }, { "entropy": 5.906603908538818, "epoch": 4.34530247033651, "grad_norm": 1.4453125, "learning_rate": 0.00032399891761560274, "loss": 4.9834, "mean_token_accuracy": 0.20922621488571166, "num_tokens": 96867921.0, "step": 55850 }, { "entropy": 5.824683475494385, "epoch": 4.345691499708228, "grad_norm": 1.3046875, "learning_rate": 0.0003239718668455233, "loss": 4.8215, "mean_token_accuracy": 0.2167795106768608, "num_tokens": 96876886.0, "step": 55855 }, { "entropy": 5.836410808563232, "epoch": 4.346080529079946, "grad_norm": 1.34375, "learning_rate": 0.0003239448153323737, "loss": 4.8277, "mean_token_accuracy": 0.22197705060243605, "num_tokens": 96885596.0, "step": 55860 }, { "entropy": 5.877079486846924, "epoch": 4.3464695584516635, "grad_norm": 1.28125, "learning_rate": 0.00032391776307656456, "loss": 4.9827, "mean_token_accuracy": 0.214811247587204, "num_tokens": 96894440.0, "step": 55865 }, { "entropy": 5.870606994628906, "epoch": 4.34685858782338, "grad_norm": 1.3671875, "learning_rate": 0.00032389071007850616, "loss": 4.9532, "mean_token_accuracy": 0.21951773017644882, "num_tokens": 96902533.0, "step": 55870 }, { "entropy": 5.880166006088257, "epoch": 4.347247617195098, "grad_norm": 1.4140625, "learning_rate": 0.00032386365633860914, "loss": 5.0609, "mean_token_accuracy": 0.20984472334384918, "num_tokens": 96910737.0, "step": 55875 }, { "entropy": 5.800865364074707, "epoch": 4.347636646566816, "grad_norm": 1.421875, "learning_rate": 0.0003238366018572838, "loss": 4.8108, "mean_token_accuracy": 0.22650467604398727, "num_tokens": 96918922.0, "step": 55880 }, { "entropy": 5.826118135452271, "epoch": 4.348025675938533, "grad_norm": 1.4375, "learning_rate": 0.0003238095466349407, "loss": 4.8674, "mean_token_accuracy": 0.22437690943479538, "num_tokens": 96927846.0, "step": 55885 }, { "entropy": 5.913286352157593, "epoch": 4.348414705310251, "grad_norm": 1.3984375, "learning_rate": 0.0003237824906719905, "loss": 4.9754, "mean_token_accuracy": 0.2076628565788269, "num_tokens": 96936701.0, "step": 55890 }, { "entropy": 5.9072033882141115, "epoch": 4.348803734681969, "grad_norm": 1.5390625, "learning_rate": 0.00032375543396884367, "loss": 4.9454, "mean_token_accuracy": 0.2198356032371521, "num_tokens": 96944519.0, "step": 55895 }, { "entropy": 5.917604446411133, "epoch": 4.3491927640536865, "grad_norm": 1.4296875, "learning_rate": 0.0003237283765259107, "loss": 4.9334, "mean_token_accuracy": 0.21468027234077453, "num_tokens": 96953142.0, "step": 55900 }, { "entropy": 5.836408567428589, "epoch": 4.349581793425403, "grad_norm": 1.46875, "learning_rate": 0.00032370131834360215, "loss": 4.8936, "mean_token_accuracy": 0.22414413541555406, "num_tokens": 96961373.0, "step": 55905 }, { "entropy": 5.904293441772461, "epoch": 4.349970822797121, "grad_norm": 1.40625, "learning_rate": 0.0003236742594223287, "loss": 4.9408, "mean_token_accuracy": 0.2133316859602928, "num_tokens": 96969578.0, "step": 55910 }, { "entropy": 5.8716898441314695, "epoch": 4.350359852168839, "grad_norm": 1.3984375, "learning_rate": 0.0003236471997625008, "loss": 4.9224, "mean_token_accuracy": 0.21582414954900742, "num_tokens": 96977990.0, "step": 55915 }, { "entropy": 5.866220140457154, "epoch": 4.350748881540556, "grad_norm": 1.5234375, "learning_rate": 0.0003236201393645291, "loss": 4.979, "mean_token_accuracy": 0.21179738491773606, "num_tokens": 96986190.0, "step": 55920 }, { "entropy": 5.93839921951294, "epoch": 4.351137910912274, "grad_norm": 1.3125, "learning_rate": 0.00032359307822882403, "loss": 5.0161, "mean_token_accuracy": 0.2060386836528778, "num_tokens": 96995315.0, "step": 55925 }, { "entropy": 5.8783282279968265, "epoch": 4.351526940283992, "grad_norm": 1.375, "learning_rate": 0.00032356601635579645, "loss": 4.9749, "mean_token_accuracy": 0.21778611689805985, "num_tokens": 97004439.0, "step": 55930 }, { "entropy": 5.915272045135498, "epoch": 4.351915969655709, "grad_norm": 1.453125, "learning_rate": 0.0003235389537458569, "loss": 4.9308, "mean_token_accuracy": 0.20804882049560547, "num_tokens": 97013075.0, "step": 55935 }, { "entropy": 5.891468811035156, "epoch": 4.352304999027426, "grad_norm": 1.4453125, "learning_rate": 0.00032351189039941594, "loss": 5.1259, "mean_token_accuracy": 0.20207825899124146, "num_tokens": 97022193.0, "step": 55940 }, { "entropy": 5.83633975982666, "epoch": 4.352694028399144, "grad_norm": 1.4296875, "learning_rate": 0.00032348482631688424, "loss": 4.9469, "mean_token_accuracy": 0.22220561504364014, "num_tokens": 97030869.0, "step": 55945 }, { "entropy": 5.936500978469849, "epoch": 4.353083057770862, "grad_norm": 1.3125, "learning_rate": 0.0003234577614986725, "loss": 5.0011, "mean_token_accuracy": 0.21085729002952575, "num_tokens": 97040182.0, "step": 55950 }, { "entropy": 5.949840784072876, "epoch": 4.353472087142579, "grad_norm": 1.3046875, "learning_rate": 0.0003234306959451914, "loss": 5.0636, "mean_token_accuracy": 0.20338288992643355, "num_tokens": 97049141.0, "step": 55955 }, { "entropy": 5.924427223205567, "epoch": 4.353861116514297, "grad_norm": 1.4453125, "learning_rate": 0.00032340362965685145, "loss": 4.9714, "mean_token_accuracy": 0.20897796601057053, "num_tokens": 97058007.0, "step": 55960 }, { "entropy": 5.907434177398682, "epoch": 4.354250145886015, "grad_norm": 1.3828125, "learning_rate": 0.0003233765626340636, "loss": 4.9426, "mean_token_accuracy": 0.21701187193393706, "num_tokens": 97066548.0, "step": 55965 }, { "entropy": 5.945518493652344, "epoch": 4.354639175257732, "grad_norm": 1.3515625, "learning_rate": 0.0003233494948772384, "loss": 5.022, "mean_token_accuracy": 0.21225260347127914, "num_tokens": 97075639.0, "step": 55970 }, { "entropy": 5.813122272491455, "epoch": 4.355028204629449, "grad_norm": 1.34375, "learning_rate": 0.00032332242638678647, "loss": 4.8728, "mean_token_accuracy": 0.22090377062559127, "num_tokens": 97084351.0, "step": 55975 }, { "entropy": 5.820841979980469, "epoch": 4.355417234001167, "grad_norm": 1.40625, "learning_rate": 0.0003232953571631187, "loss": 4.9298, "mean_token_accuracy": 0.22026506066322327, "num_tokens": 97093117.0, "step": 55980 }, { "entropy": 5.82263503074646, "epoch": 4.355806263372885, "grad_norm": 1.2578125, "learning_rate": 0.0003232682872066457, "loss": 4.8704, "mean_token_accuracy": 0.21631211340427398, "num_tokens": 97101535.0, "step": 55985 }, { "entropy": 5.8013170719146725, "epoch": 4.356195292744602, "grad_norm": 1.4453125, "learning_rate": 0.0003232412165177783, "loss": 4.913, "mean_token_accuracy": 0.21891602873802185, "num_tokens": 97109999.0, "step": 55990 }, { "entropy": 5.8168340682983395, "epoch": 4.35658432211632, "grad_norm": 1.3359375, "learning_rate": 0.00032321414509692726, "loss": 4.9345, "mean_token_accuracy": 0.21818098276853562, "num_tokens": 97119535.0, "step": 55995 }, { "entropy": 5.9090711116790775, "epoch": 4.356973351488037, "grad_norm": 1.3515625, "learning_rate": 0.00032318707294450326, "loss": 4.9334, "mean_token_accuracy": 0.21734316498041154, "num_tokens": 97128357.0, "step": 56000 }, { "entropy": 5.853480482101441, "epoch": 4.357362380859755, "grad_norm": 1.359375, "learning_rate": 0.0003231600000609171, "loss": 4.9254, "mean_token_accuracy": 0.2131370037794113, "num_tokens": 97137317.0, "step": 56005 }, { "entropy": 5.905597352981568, "epoch": 4.357751410231472, "grad_norm": 1.375, "learning_rate": 0.00032313292644657967, "loss": 5.001, "mean_token_accuracy": 0.21472050249576569, "num_tokens": 97146169.0, "step": 56010 }, { "entropy": 5.877661991119385, "epoch": 4.35814043960319, "grad_norm": 1.453125, "learning_rate": 0.0003231058521019017, "loss": 4.9524, "mean_token_accuracy": 0.2174597918987274, "num_tokens": 97155287.0, "step": 56015 }, { "entropy": 5.9289172172546385, "epoch": 4.358529468974908, "grad_norm": 1.375, "learning_rate": 0.0003230787770272939, "loss": 5.0104, "mean_token_accuracy": 0.21362903714179993, "num_tokens": 97163578.0, "step": 56020 }, { "entropy": 5.846210098266601, "epoch": 4.358918498346625, "grad_norm": 1.3671875, "learning_rate": 0.0003230517012231673, "loss": 4.9238, "mean_token_accuracy": 0.21311804056167602, "num_tokens": 97172167.0, "step": 56025 }, { "entropy": 5.756001234054565, "epoch": 4.359307527718343, "grad_norm": 1.53125, "learning_rate": 0.00032302462468993253, "loss": 4.795, "mean_token_accuracy": 0.22805336117744446, "num_tokens": 97181464.0, "step": 56030 }, { "entropy": 5.841710710525513, "epoch": 4.359696557090061, "grad_norm": 1.453125, "learning_rate": 0.0003229975474280006, "loss": 4.9665, "mean_token_accuracy": 0.21403897553682327, "num_tokens": 97190820.0, "step": 56035 }, { "entropy": 5.9227015495300295, "epoch": 4.360085586461778, "grad_norm": 1.421875, "learning_rate": 0.00032297046943778216, "loss": 5.0238, "mean_token_accuracy": 0.20482743233442308, "num_tokens": 97200083.0, "step": 56040 }, { "entropy": 5.854891681671143, "epoch": 4.360474615833495, "grad_norm": 1.3203125, "learning_rate": 0.00032294339071968833, "loss": 4.8558, "mean_token_accuracy": 0.21929155588150023, "num_tokens": 97208703.0, "step": 56045 }, { "entropy": 5.851736307144165, "epoch": 4.360863645205213, "grad_norm": 1.421875, "learning_rate": 0.00032291631127412976, "loss": 4.9477, "mean_token_accuracy": 0.21540368795394899, "num_tokens": 97217887.0, "step": 56050 }, { "entropy": 5.890554714202881, "epoch": 4.361252674576931, "grad_norm": 1.4140625, "learning_rate": 0.0003228892311015174, "loss": 5.0486, "mean_token_accuracy": 0.2004201427102089, "num_tokens": 97227858.0, "step": 56055 }, { "entropy": 5.8876978874206545, "epoch": 4.361641703948648, "grad_norm": 1.484375, "learning_rate": 0.00032286215020226224, "loss": 4.9187, "mean_token_accuracy": 0.21921341568231584, "num_tokens": 97235772.0, "step": 56060 }, { "entropy": 5.905483961105347, "epoch": 4.362030733320366, "grad_norm": 1.3125, "learning_rate": 0.00032283506857677517, "loss": 4.926, "mean_token_accuracy": 0.21788364052772521, "num_tokens": 97245068.0, "step": 56065 }, { "entropy": 5.857646560668945, "epoch": 4.362419762692083, "grad_norm": 1.4609375, "learning_rate": 0.0003228079862254671, "loss": 4.9414, "mean_token_accuracy": 0.2192860350012779, "num_tokens": 97254595.0, "step": 56070 }, { "entropy": 5.799866962432861, "epoch": 4.362808792063801, "grad_norm": 1.4453125, "learning_rate": 0.00032278090314874887, "loss": 4.9412, "mean_token_accuracy": 0.21131557375192642, "num_tokens": 97263133.0, "step": 56075 }, { "entropy": 5.8625412940979, "epoch": 4.363197821435518, "grad_norm": 1.4765625, "learning_rate": 0.00032275381934703147, "loss": 4.9547, "mean_token_accuracy": 0.21828479319810867, "num_tokens": 97271429.0, "step": 56080 }, { "entropy": 5.85198860168457, "epoch": 4.363586850807236, "grad_norm": 1.421875, "learning_rate": 0.0003227267348207258, "loss": 4.8769, "mean_token_accuracy": 0.21717992424964905, "num_tokens": 97280018.0, "step": 56085 }, { "entropy": 5.873661613464355, "epoch": 4.363975880178954, "grad_norm": 1.375, "learning_rate": 0.00032269964957024305, "loss": 4.9305, "mean_token_accuracy": 0.21584324091672896, "num_tokens": 97288552.0, "step": 56090 }, { "entropy": 5.8466979503631595, "epoch": 4.364364909550671, "grad_norm": 1.3203125, "learning_rate": 0.00032267256359599396, "loss": 4.9304, "mean_token_accuracy": 0.21991046518087387, "num_tokens": 97297684.0, "step": 56095 }, { "entropy": 5.8576733589172365, "epoch": 4.364753938922389, "grad_norm": 1.453125, "learning_rate": 0.00032264547689838963, "loss": 4.8868, "mean_token_accuracy": 0.21063765734434128, "num_tokens": 97306312.0, "step": 56100 }, { "entropy": 5.974688577651977, "epoch": 4.365142968294106, "grad_norm": 1.3515625, "learning_rate": 0.00032261838947784103, "loss": 5.086, "mean_token_accuracy": 0.1932907819747925, "num_tokens": 97315566.0, "step": 56105 }, { "entropy": 5.82246618270874, "epoch": 4.365531997665824, "grad_norm": 1.2890625, "learning_rate": 0.0003225913013347591, "loss": 4.8839, "mean_token_accuracy": 0.21617152243852616, "num_tokens": 97324359.0, "step": 56110 }, { "entropy": 5.89462513923645, "epoch": 4.365921027037541, "grad_norm": 1.4453125, "learning_rate": 0.00032256421246955504, "loss": 4.9452, "mean_token_accuracy": 0.21327568888664244, "num_tokens": 97333377.0, "step": 56115 }, { "entropy": 5.8266651153564455, "epoch": 4.366310056409259, "grad_norm": 1.3984375, "learning_rate": 0.0003225371228826396, "loss": 4.8699, "mean_token_accuracy": 0.22158707082271575, "num_tokens": 97342468.0, "step": 56120 }, { "entropy": 5.827818870544434, "epoch": 4.366699085780977, "grad_norm": 1.453125, "learning_rate": 0.0003225100325744241, "loss": 4.8946, "mean_token_accuracy": 0.22071681916713715, "num_tokens": 97350667.0, "step": 56125 }, { "entropy": 5.831667375564575, "epoch": 4.367088115152694, "grad_norm": 1.296875, "learning_rate": 0.0003224829415453194, "loss": 4.9503, "mean_token_accuracy": 0.2136904314160347, "num_tokens": 97359652.0, "step": 56130 }, { "entropy": 5.885065650939941, "epoch": 4.367477144524411, "grad_norm": 1.328125, "learning_rate": 0.0003224558497957367, "loss": 4.9877, "mean_token_accuracy": 0.20652298182249068, "num_tokens": 97368891.0, "step": 56135 }, { "entropy": 5.853997993469238, "epoch": 4.367866173896129, "grad_norm": 1.359375, "learning_rate": 0.00032242875732608697, "loss": 4.9167, "mean_token_accuracy": 0.21902762055397035, "num_tokens": 97377597.0, "step": 56140 }, { "entropy": 5.827123689651489, "epoch": 4.3682552032678466, "grad_norm": 1.34375, "learning_rate": 0.0003224016641367814, "loss": 4.9039, "mean_token_accuracy": 0.21403760761022567, "num_tokens": 97386465.0, "step": 56145 }, { "entropy": 5.860655355453491, "epoch": 4.368644232639564, "grad_norm": 1.5859375, "learning_rate": 0.00032237457022823095, "loss": 4.8831, "mean_token_accuracy": 0.22551157474517822, "num_tokens": 97394780.0, "step": 56150 }, { "entropy": 5.845815134048462, "epoch": 4.369033262011282, "grad_norm": 1.2890625, "learning_rate": 0.00032234747560084675, "loss": 4.9352, "mean_token_accuracy": 0.21327877044677734, "num_tokens": 97404276.0, "step": 56155 }, { "entropy": 5.85503830909729, "epoch": 4.369422291383, "grad_norm": 1.4140625, "learning_rate": 0.00032232038025504015, "loss": 4.933, "mean_token_accuracy": 0.22126472294330596, "num_tokens": 97412543.0, "step": 56160 }, { "entropy": 5.898508834838867, "epoch": 4.369811320754717, "grad_norm": 1.4296875, "learning_rate": 0.00032229328419122196, "loss": 5.048, "mean_token_accuracy": 0.20882613360881805, "num_tokens": 97421886.0, "step": 56165 }, { "entropy": 5.81612639427185, "epoch": 4.370200350126434, "grad_norm": 1.4375, "learning_rate": 0.0003222661874098035, "loss": 4.8571, "mean_token_accuracy": 0.22832584232091904, "num_tokens": 97429910.0, "step": 56170 }, { "entropy": 5.797959804534912, "epoch": 4.370589379498152, "grad_norm": 1.546875, "learning_rate": 0.0003222390899111959, "loss": 4.9157, "mean_token_accuracy": 0.2189633756875992, "num_tokens": 97438658.0, "step": 56175 }, { "entropy": 5.84496374130249, "epoch": 4.3709784088698695, "grad_norm": 1.5, "learning_rate": 0.0003222119916958103, "loss": 4.956, "mean_token_accuracy": 0.21665065437555314, "num_tokens": 97446968.0, "step": 56180 }, { "entropy": 5.876144599914551, "epoch": 4.371367438241587, "grad_norm": 1.28125, "learning_rate": 0.00032218489276405777, "loss": 4.9688, "mean_token_accuracy": 0.20748453438282013, "num_tokens": 97455849.0, "step": 56185 }, { "entropy": 5.908208656311035, "epoch": 4.371756467613305, "grad_norm": 1.3203125, "learning_rate": 0.00032215779311634967, "loss": 4.9345, "mean_token_accuracy": 0.2177588775753975, "num_tokens": 97464826.0, "step": 56190 }, { "entropy": 5.881191682815552, "epoch": 4.372145496985023, "grad_norm": 1.359375, "learning_rate": 0.00032213069275309714, "loss": 4.9649, "mean_token_accuracy": 0.21201578080654143, "num_tokens": 97473276.0, "step": 56195 }, { "entropy": 5.910405015945434, "epoch": 4.37253452635674, "grad_norm": 1.390625, "learning_rate": 0.00032210359167471136, "loss": 4.9832, "mean_token_accuracy": 0.2102323964238167, "num_tokens": 97482153.0, "step": 56200 }, { "entropy": 5.86022162437439, "epoch": 4.372923555728457, "grad_norm": 1.4140625, "learning_rate": 0.0003220764898816035, "loss": 4.9037, "mean_token_accuracy": 0.21128607541322708, "num_tokens": 97490539.0, "step": 56205 }, { "entropy": 5.8533628463745115, "epoch": 4.373312585100175, "grad_norm": 1.4140625, "learning_rate": 0.00032204938737418495, "loss": 4.9375, "mean_token_accuracy": 0.22005994766950607, "num_tokens": 97500700.0, "step": 56210 }, { "entropy": 5.831777334213257, "epoch": 4.3737016144718925, "grad_norm": 1.375, "learning_rate": 0.00032202228415286664, "loss": 4.9427, "mean_token_accuracy": 0.21296179592609404, "num_tokens": 97509562.0, "step": 56215 }, { "entropy": 5.905174303054809, "epoch": 4.37409064384361, "grad_norm": 1.3046875, "learning_rate": 0.0003219951802180602, "loss": 5.0441, "mean_token_accuracy": 0.20478034466505052, "num_tokens": 97518349.0, "step": 56220 }, { "entropy": 5.889245843887329, "epoch": 4.374479673215328, "grad_norm": 1.40625, "learning_rate": 0.0003219680755701766, "loss": 4.9434, "mean_token_accuracy": 0.21924894750118257, "num_tokens": 97526731.0, "step": 56225 }, { "entropy": 5.891793298721313, "epoch": 4.374868702587046, "grad_norm": 1.3515625, "learning_rate": 0.00032194097020962726, "loss": 4.9126, "mean_token_accuracy": 0.2152174636721611, "num_tokens": 97535392.0, "step": 56230 }, { "entropy": 5.844496631622315, "epoch": 4.375257731958763, "grad_norm": 1.390625, "learning_rate": 0.0003219138641368234, "loss": 4.9642, "mean_token_accuracy": 0.21058496981859207, "num_tokens": 97544196.0, "step": 56235 }, { "entropy": 5.839735603332519, "epoch": 4.37564676133048, "grad_norm": 1.515625, "learning_rate": 0.00032188675735217627, "loss": 4.9199, "mean_token_accuracy": 0.22158660590648652, "num_tokens": 97551944.0, "step": 56240 }, { "entropy": 5.707260942459106, "epoch": 4.376035790702198, "grad_norm": 1.4375, "learning_rate": 0.0003218596498560973, "loss": 4.8369, "mean_token_accuracy": 0.22087912559509276, "num_tokens": 97560508.0, "step": 56245 }, { "entropy": 5.800538778305054, "epoch": 4.3764248200739155, "grad_norm": 1.4140625, "learning_rate": 0.0003218325416489976, "loss": 4.8685, "mean_token_accuracy": 0.22747107297182084, "num_tokens": 97568602.0, "step": 56250 }, { "entropy": 5.854131507873535, "epoch": 4.376813849445633, "grad_norm": 1.4140625, "learning_rate": 0.0003218054327312888, "loss": 4.8896, "mean_token_accuracy": 0.22329197376966475, "num_tokens": 97576886.0, "step": 56255 }, { "entropy": 5.911349487304688, "epoch": 4.377202878817351, "grad_norm": 1.3828125, "learning_rate": 0.00032177832310338193, "loss": 4.9729, "mean_token_accuracy": 0.21256973445415497, "num_tokens": 97586213.0, "step": 56260 }, { "entropy": 5.789101219177246, "epoch": 4.377591908189069, "grad_norm": 1.34375, "learning_rate": 0.00032175121276568853, "loss": 4.8717, "mean_token_accuracy": 0.22243961989879607, "num_tokens": 97595135.0, "step": 56265 }, { "entropy": 5.847576236724853, "epoch": 4.377980937560785, "grad_norm": 1.546875, "learning_rate": 0.00032172410171861987, "loss": 4.9692, "mean_token_accuracy": 0.2027269646525383, "num_tokens": 97603048.0, "step": 56270 }, { "entropy": 5.841759777069091, "epoch": 4.378369966932503, "grad_norm": 1.3515625, "learning_rate": 0.00032169698996258733, "loss": 4.9106, "mean_token_accuracy": 0.2188049167394638, "num_tokens": 97612090.0, "step": 56275 }, { "entropy": 5.892730665206909, "epoch": 4.378758996304221, "grad_norm": 1.3828125, "learning_rate": 0.0003216698774980023, "loss": 4.894, "mean_token_accuracy": 0.21872354447841644, "num_tokens": 97621035.0, "step": 56280 }, { "entropy": 5.84887580871582, "epoch": 4.3791480256759385, "grad_norm": 1.5625, "learning_rate": 0.00032164276432527605, "loss": 4.9202, "mean_token_accuracy": 0.21724647879600525, "num_tokens": 97630066.0, "step": 56285 }, { "entropy": 5.862901878356934, "epoch": 4.379537055047656, "grad_norm": 1.34375, "learning_rate": 0.0003216156504448202, "loss": 4.9455, "mean_token_accuracy": 0.22048344165086747, "num_tokens": 97638797.0, "step": 56290 }, { "entropy": 5.931183385848999, "epoch": 4.379926084419374, "grad_norm": 1.3046875, "learning_rate": 0.0003215885358570461, "loss": 5.0724, "mean_token_accuracy": 0.20555678606033326, "num_tokens": 97648429.0, "step": 56295 }, { "entropy": 5.844251728057861, "epoch": 4.380315113791092, "grad_norm": 1.5625, "learning_rate": 0.0003215614205623651, "loss": 4.8726, "mean_token_accuracy": 0.21135499328374863, "num_tokens": 97656954.0, "step": 56300 }, { "entropy": 5.844804430007935, "epoch": 4.380704143162808, "grad_norm": 1.3359375, "learning_rate": 0.0003215343045611886, "loss": 4.9014, "mean_token_accuracy": 0.22130008041858673, "num_tokens": 97665564.0, "step": 56305 }, { "entropy": 5.849834012985229, "epoch": 4.381093172534526, "grad_norm": 1.3359375, "learning_rate": 0.0003215071878539281, "loss": 4.956, "mean_token_accuracy": 0.21724940687417985, "num_tokens": 97674921.0, "step": 56310 }, { "entropy": 5.819569492340088, "epoch": 4.381482201906244, "grad_norm": 1.390625, "learning_rate": 0.00032148007044099507, "loss": 4.907, "mean_token_accuracy": 0.21422570049762726, "num_tokens": 97683564.0, "step": 56315 }, { "entropy": 5.865578985214233, "epoch": 4.3818712312779615, "grad_norm": 1.3984375, "learning_rate": 0.0003214529523228009, "loss": 5.0173, "mean_token_accuracy": 0.21091562360525132, "num_tokens": 97693093.0, "step": 56320 }, { "entropy": 5.911924982070923, "epoch": 4.382260260649679, "grad_norm": 1.421875, "learning_rate": 0.0003214258334997572, "loss": 5.0035, "mean_token_accuracy": 0.2039350226521492, "num_tokens": 97701392.0, "step": 56325 }, { "entropy": 5.958255004882813, "epoch": 4.382649290021397, "grad_norm": 1.421875, "learning_rate": 0.0003213987139722753, "loss": 5.0512, "mean_token_accuracy": 0.21343532353639602, "num_tokens": 97710705.0, "step": 56330 }, { "entropy": 5.893885087966919, "epoch": 4.383038319393114, "grad_norm": 1.46875, "learning_rate": 0.00032137159374076693, "loss": 4.8867, "mean_token_accuracy": 0.2197265714406967, "num_tokens": 97719169.0, "step": 56335 }, { "entropy": 5.918248796463013, "epoch": 4.383427348764831, "grad_norm": 1.4609375, "learning_rate": 0.0003213444728056432, "loss": 5.047, "mean_token_accuracy": 0.20918984115123748, "num_tokens": 97728444.0, "step": 56340 }, { "entropy": 5.849329137802124, "epoch": 4.383816378136549, "grad_norm": 1.5703125, "learning_rate": 0.00032131735116731604, "loss": 4.9507, "mean_token_accuracy": 0.21768296658992767, "num_tokens": 97736892.0, "step": 56345 }, { "entropy": 5.939564943313599, "epoch": 4.384205407508267, "grad_norm": 1.421875, "learning_rate": 0.0003212902288261966, "loss": 5.0037, "mean_token_accuracy": 0.21214178055524827, "num_tokens": 97746297.0, "step": 56350 }, { "entropy": 5.824271249771118, "epoch": 4.3845944368799845, "grad_norm": 1.4296875, "learning_rate": 0.0003212631057826968, "loss": 4.8179, "mean_token_accuracy": 0.22800871282815932, "num_tokens": 97754599.0, "step": 56355 }, { "entropy": 5.909377765655518, "epoch": 4.384983466251702, "grad_norm": 1.4296875, "learning_rate": 0.00032123598203722786, "loss": 4.9821, "mean_token_accuracy": 0.21736262887716293, "num_tokens": 97763256.0, "step": 56360 }, { "entropy": 5.883335733413697, "epoch": 4.38537249562342, "grad_norm": 1.4453125, "learning_rate": 0.0003212088575902016, "loss": 4.9672, "mean_token_accuracy": 0.21353209316730498, "num_tokens": 97772492.0, "step": 56365 }, { "entropy": 5.832557678222656, "epoch": 4.385761524995137, "grad_norm": 1.34375, "learning_rate": 0.00032118173244202947, "loss": 4.8196, "mean_token_accuracy": 0.23123684376478196, "num_tokens": 97781112.0, "step": 56370 }, { "entropy": 5.87379641532898, "epoch": 4.386150554366854, "grad_norm": 1.3125, "learning_rate": 0.00032115460659312304, "loss": 5.0187, "mean_token_accuracy": 0.2102784365415573, "num_tokens": 97790175.0, "step": 56375 }, { "entropy": 5.843015861511231, "epoch": 4.386539583738572, "grad_norm": 1.453125, "learning_rate": 0.0003211274800438939, "loss": 4.9263, "mean_token_accuracy": 0.21313754618167877, "num_tokens": 97799789.0, "step": 56380 }, { "entropy": 5.891910076141357, "epoch": 4.38692861311029, "grad_norm": 1.453125, "learning_rate": 0.0003211003527947537, "loss": 4.8514, "mean_token_accuracy": 0.22333042919635773, "num_tokens": 97807999.0, "step": 56385 }, { "entropy": 5.777862024307251, "epoch": 4.3873176424820075, "grad_norm": 1.3359375, "learning_rate": 0.00032107322484611396, "loss": 4.7535, "mean_token_accuracy": 0.23310523927211763, "num_tokens": 97817133.0, "step": 56390 }, { "entropy": 5.952195167541504, "epoch": 4.387706671853725, "grad_norm": 1.4453125, "learning_rate": 0.00032104609619838635, "loss": 4.9961, "mean_token_accuracy": 0.21147679686546325, "num_tokens": 97825427.0, "step": 56395 }, { "entropy": 5.886843824386597, "epoch": 4.388095701225443, "grad_norm": 1.4140625, "learning_rate": 0.0003210189668519826, "loss": 4.954, "mean_token_accuracy": 0.21574897915124894, "num_tokens": 97834247.0, "step": 56400 }, { "entropy": 5.880003309249878, "epoch": 4.38848473059716, "grad_norm": 1.59375, "learning_rate": 0.0003209918368073143, "loss": 5.0064, "mean_token_accuracy": 0.21588183790445328, "num_tokens": 97842282.0, "step": 56405 }, { "entropy": 5.832932567596435, "epoch": 4.388873759968877, "grad_norm": 1.4140625, "learning_rate": 0.000320964706064793, "loss": 4.9147, "mean_token_accuracy": 0.2160721391439438, "num_tokens": 97851554.0, "step": 56410 }, { "entropy": 5.851925325393677, "epoch": 4.389262789340595, "grad_norm": 1.3515625, "learning_rate": 0.00032093757462483055, "loss": 4.8118, "mean_token_accuracy": 0.2203413039445877, "num_tokens": 97859941.0, "step": 56415 }, { "entropy": 5.823663234710693, "epoch": 4.389651818712313, "grad_norm": 1.34375, "learning_rate": 0.00032091044248783835, "loss": 4.8669, "mean_token_accuracy": 0.21934882551431656, "num_tokens": 97868265.0, "step": 56420 }, { "entropy": 5.816927766799926, "epoch": 4.3900408480840305, "grad_norm": 1.3359375, "learning_rate": 0.00032088330965422836, "loss": 4.9745, "mean_token_accuracy": 0.21490378677845, "num_tokens": 97877750.0, "step": 56425 }, { "entropy": 5.9270195960998535, "epoch": 4.390429877455748, "grad_norm": 1.5078125, "learning_rate": 0.00032085617612441215, "loss": 5.0044, "mean_token_accuracy": 0.2037125915288925, "num_tokens": 97886086.0, "step": 56430 }, { "entropy": 5.8997749328613285, "epoch": 4.390818906827466, "grad_norm": 1.390625, "learning_rate": 0.0003208290418988015, "loss": 5.0256, "mean_token_accuracy": 0.20419949144124985, "num_tokens": 97894761.0, "step": 56435 }, { "entropy": 5.839312744140625, "epoch": 4.391207936199183, "grad_norm": 1.3828125, "learning_rate": 0.000320801906977808, "loss": 4.952, "mean_token_accuracy": 0.21340329796075821, "num_tokens": 97903796.0, "step": 56440 }, { "entropy": 5.789989185333252, "epoch": 4.3915969655709, "grad_norm": 1.453125, "learning_rate": 0.00032077477136184356, "loss": 4.9166, "mean_token_accuracy": 0.220957413315773, "num_tokens": 97912641.0, "step": 56445 }, { "entropy": 5.8472254276275635, "epoch": 4.391985994942618, "grad_norm": 1.34375, "learning_rate": 0.0003207476350513198, "loss": 4.921, "mean_token_accuracy": 0.21988424509763718, "num_tokens": 97921745.0, "step": 56450 }, { "entropy": 5.851008605957031, "epoch": 4.392375024314336, "grad_norm": 1.3984375, "learning_rate": 0.0003207204980466485, "loss": 4.9063, "mean_token_accuracy": 0.2166115790605545, "num_tokens": 97930988.0, "step": 56455 }, { "entropy": 5.912194442749024, "epoch": 4.3927640536860535, "grad_norm": 1.3984375, "learning_rate": 0.00032069336034824136, "loss": 4.9577, "mean_token_accuracy": 0.21005015224218368, "num_tokens": 97939907.0, "step": 56460 }, { "entropy": 5.827771139144898, "epoch": 4.393153083057771, "grad_norm": 1.375, "learning_rate": 0.00032066622195651024, "loss": 4.8628, "mean_token_accuracy": 0.22490894943475723, "num_tokens": 97948568.0, "step": 56465 }, { "entropy": 5.788376522064209, "epoch": 4.393542112429488, "grad_norm": 1.328125, "learning_rate": 0.00032063908287186687, "loss": 4.9028, "mean_token_accuracy": 0.21487530916929246, "num_tokens": 97956564.0, "step": 56470 }, { "entropy": 5.897263622283935, "epoch": 4.393931141801206, "grad_norm": 1.515625, "learning_rate": 0.00032061194309472314, "loss": 5.0487, "mean_token_accuracy": 0.20413736999034882, "num_tokens": 97965094.0, "step": 56475 }, { "entropy": 5.787479877471924, "epoch": 4.394320171172923, "grad_norm": 1.3828125, "learning_rate": 0.00032058480262549065, "loss": 4.8825, "mean_token_accuracy": 0.2195443630218506, "num_tokens": 97973938.0, "step": 56480 }, { "entropy": 5.876153993606567, "epoch": 4.394709200544641, "grad_norm": 1.3984375, "learning_rate": 0.0003205576614645814, "loss": 5.0189, "mean_token_accuracy": 0.21140616685152053, "num_tokens": 97982531.0, "step": 56485 }, { "entropy": 5.86994891166687, "epoch": 4.395098229916359, "grad_norm": 1.5703125, "learning_rate": 0.00032053051961240716, "loss": 4.9172, "mean_token_accuracy": 0.21883551478385926, "num_tokens": 97992147.0, "step": 56490 }, { "entropy": 5.899713516235352, "epoch": 4.3954872592880765, "grad_norm": 1.4375, "learning_rate": 0.0003205033770693797, "loss": 4.9383, "mean_token_accuracy": 0.21747009009122847, "num_tokens": 98000738.0, "step": 56495 }, { "entropy": 5.829110145568848, "epoch": 4.395876288659794, "grad_norm": 1.2734375, "learning_rate": 0.000320476233835911, "loss": 4.8581, "mean_token_accuracy": 0.2207776740193367, "num_tokens": 98009158.0, "step": 56500 }, { "entropy": 5.834641456604004, "epoch": 4.396265318031511, "grad_norm": 1.4609375, "learning_rate": 0.00032044908991241274, "loss": 4.8964, "mean_token_accuracy": 0.21917135864496232, "num_tokens": 98017795.0, "step": 56505 }, { "entropy": 5.832931852340698, "epoch": 4.396654347403229, "grad_norm": 1.4296875, "learning_rate": 0.00032042194529929694, "loss": 4.8586, "mean_token_accuracy": 0.2251078560948372, "num_tokens": 98026390.0, "step": 56510 }, { "entropy": 5.883548212051392, "epoch": 4.397043376774946, "grad_norm": 1.2578125, "learning_rate": 0.00032039479999697545, "loss": 4.9656, "mean_token_accuracy": 0.21211181581020355, "num_tokens": 98035506.0, "step": 56515 }, { "entropy": 5.824854040145874, "epoch": 4.397432406146664, "grad_norm": 1.2109375, "learning_rate": 0.00032036765400586005, "loss": 4.952, "mean_token_accuracy": 0.20762148052453994, "num_tokens": 98044228.0, "step": 56520 }, { "entropy": 5.897710466384888, "epoch": 4.397821435518382, "grad_norm": 1.3125, "learning_rate": 0.00032034050732636274, "loss": 5.0049, "mean_token_accuracy": 0.21851904690265656, "num_tokens": 98053209.0, "step": 56525 }, { "entropy": 5.899632835388184, "epoch": 4.3982104648900995, "grad_norm": 1.296875, "learning_rate": 0.0003203133599588954, "loss": 4.8994, "mean_token_accuracy": 0.21904546320438384, "num_tokens": 98061892.0, "step": 56530 }, { "entropy": 5.919186353683472, "epoch": 4.398599494261817, "grad_norm": 1.3671875, "learning_rate": 0.00032028621190386997, "loss": 4.9326, "mean_token_accuracy": 0.21228469908237457, "num_tokens": 98071401.0, "step": 56535 }, { "entropy": 5.870324993133545, "epoch": 4.398988523633534, "grad_norm": 1.4375, "learning_rate": 0.00032025906316169835, "loss": 4.8803, "mean_token_accuracy": 0.22455044388771056, "num_tokens": 98080488.0, "step": 56540 }, { "entropy": 5.8134973526000975, "epoch": 4.399377553005252, "grad_norm": 1.4609375, "learning_rate": 0.0003202319137327924, "loss": 4.8569, "mean_token_accuracy": 0.2194547787308693, "num_tokens": 98089290.0, "step": 56545 }, { "entropy": 5.8483567237854, "epoch": 4.399766582376969, "grad_norm": 1.421875, "learning_rate": 0.00032020476361756424, "loss": 5.0029, "mean_token_accuracy": 0.20757050961256027, "num_tokens": 98097870.0, "step": 56550 }, { "entropy": 5.862218570709229, "epoch": 4.400155611748687, "grad_norm": 1.4375, "learning_rate": 0.00032017761281642564, "loss": 4.9266, "mean_token_accuracy": 0.2244698330760002, "num_tokens": 98107466.0, "step": 56555 }, { "entropy": 5.88328185081482, "epoch": 4.400544641120405, "grad_norm": 1.4453125, "learning_rate": 0.0003201504613297888, "loss": 4.9571, "mean_token_accuracy": 0.21545010507106782, "num_tokens": 98115745.0, "step": 56560 }, { "entropy": 5.803183126449585, "epoch": 4.4009336704921225, "grad_norm": 1.421875, "learning_rate": 0.00032012330915806553, "loss": 4.8604, "mean_token_accuracy": 0.21407920569181443, "num_tokens": 98124516.0, "step": 56565 }, { "entropy": 5.783963632583618, "epoch": 4.40132269986384, "grad_norm": 1.3046875, "learning_rate": 0.00032009615630166786, "loss": 4.8323, "mean_token_accuracy": 0.2261909008026123, "num_tokens": 98132966.0, "step": 56570 }, { "entropy": 5.807172060012817, "epoch": 4.401711729235557, "grad_norm": 1.4921875, "learning_rate": 0.0003200690027610078, "loss": 4.8961, "mean_token_accuracy": 0.219764444231987, "num_tokens": 98141311.0, "step": 56575 }, { "entropy": 5.932420969009399, "epoch": 4.402100758607275, "grad_norm": 1.3828125, "learning_rate": 0.0003200418485364974, "loss": 4.9981, "mean_token_accuracy": 0.21174367219209672, "num_tokens": 98150649.0, "step": 56580 }, { "entropy": 5.930697250366211, "epoch": 4.402489787978992, "grad_norm": 1.375, "learning_rate": 0.0003200146936285485, "loss": 5.0443, "mean_token_accuracy": 0.2116548776626587, "num_tokens": 98159282.0, "step": 56585 }, { "entropy": 5.894499158859253, "epoch": 4.40287881735071, "grad_norm": 1.421875, "learning_rate": 0.0003199875380375734, "loss": 4.9139, "mean_token_accuracy": 0.22053225040435792, "num_tokens": 98167752.0, "step": 56590 }, { "entropy": 5.903307867050171, "epoch": 4.403267846722428, "grad_norm": 1.5, "learning_rate": 0.000319960381763984, "loss": 4.9464, "mean_token_accuracy": 0.21734940260648727, "num_tokens": 98176219.0, "step": 56595 }, { "entropy": 5.829818964004517, "epoch": 4.4036568760941455, "grad_norm": 1.4375, "learning_rate": 0.0003199332248081923, "loss": 4.8922, "mean_token_accuracy": 0.21353796124458313, "num_tokens": 98185210.0, "step": 56600 }, { "entropy": 5.839684915542603, "epoch": 4.404045905465862, "grad_norm": 1.4765625, "learning_rate": 0.00031990606717061055, "loss": 4.8856, "mean_token_accuracy": 0.22315371930599212, "num_tokens": 98193512.0, "step": 56605 }, { "entropy": 5.8309722423553465, "epoch": 4.40443493483758, "grad_norm": 1.5, "learning_rate": 0.0003198789088516506, "loss": 4.9737, "mean_token_accuracy": 0.21393875926733016, "num_tokens": 98201714.0, "step": 56610 }, { "entropy": 5.965172147750854, "epoch": 4.404823964209298, "grad_norm": 1.5625, "learning_rate": 0.00031985174985172467, "loss": 5.1237, "mean_token_accuracy": 0.2046158269047737, "num_tokens": 98210464.0, "step": 56615 }, { "entropy": 5.8819815158844, "epoch": 4.405212993581015, "grad_norm": 1.421875, "learning_rate": 0.0003198245901712449, "loss": 4.9388, "mean_token_accuracy": 0.21772871166467667, "num_tokens": 98219142.0, "step": 56620 }, { "entropy": 5.859474945068359, "epoch": 4.405602022952733, "grad_norm": 1.28125, "learning_rate": 0.0003197974298106232, "loss": 4.9543, "mean_token_accuracy": 0.21113801002502441, "num_tokens": 98228424.0, "step": 56625 }, { "entropy": 5.828237295150757, "epoch": 4.405991052324451, "grad_norm": 1.3515625, "learning_rate": 0.00031977026877027186, "loss": 4.9411, "mean_token_accuracy": 0.21250246912240983, "num_tokens": 98236919.0, "step": 56630 }, { "entropy": 5.849480485916137, "epoch": 4.4063800816961685, "grad_norm": 1.390625, "learning_rate": 0.00031974310705060297, "loss": 4.9054, "mean_token_accuracy": 0.21812291145324708, "num_tokens": 98245449.0, "step": 56635 }, { "entropy": 5.910617446899414, "epoch": 4.406769111067885, "grad_norm": 1.3125, "learning_rate": 0.0003197159446520286, "loss": 4.9582, "mean_token_accuracy": 0.21278473138809204, "num_tokens": 98254425.0, "step": 56640 }, { "entropy": 5.856750535964966, "epoch": 4.407158140439603, "grad_norm": 1.4375, "learning_rate": 0.00031968878157496105, "loss": 4.9424, "mean_token_accuracy": 0.21639953553676605, "num_tokens": 98262273.0, "step": 56645 }, { "entropy": 5.82481541633606, "epoch": 4.407547169811321, "grad_norm": 1.2890625, "learning_rate": 0.00031966161781981224, "loss": 4.9146, "mean_token_accuracy": 0.21603998839855193, "num_tokens": 98271310.0, "step": 56650 }, { "entropy": 5.853538846969604, "epoch": 4.407936199183038, "grad_norm": 1.4375, "learning_rate": 0.00031963445338699446, "loss": 4.9232, "mean_token_accuracy": 0.2187110036611557, "num_tokens": 98280066.0, "step": 56655 }, { "entropy": 5.891941928863526, "epoch": 4.408325228554756, "grad_norm": 1.4296875, "learning_rate": 0.00031960728827692, "loss": 4.9189, "mean_token_accuracy": 0.21383574604988098, "num_tokens": 98288067.0, "step": 56660 }, { "entropy": 5.821548318862915, "epoch": 4.408714257926474, "grad_norm": 1.3671875, "learning_rate": 0.0003195801224900009, "loss": 4.8719, "mean_token_accuracy": 0.22011714726686477, "num_tokens": 98296872.0, "step": 56665 }, { "entropy": 5.795499610900879, "epoch": 4.409103287298191, "grad_norm": 1.3125, "learning_rate": 0.00031955295602664936, "loss": 4.898, "mean_token_accuracy": 0.2184193029999733, "num_tokens": 98306982.0, "step": 56670 }, { "entropy": 5.894588756561279, "epoch": 4.409492316669908, "grad_norm": 1.3828125, "learning_rate": 0.00031952578888727763, "loss": 4.9658, "mean_token_accuracy": 0.21749274879693986, "num_tokens": 98315162.0, "step": 56675 }, { "entropy": 5.887330961227417, "epoch": 4.409881346041626, "grad_norm": 1.484375, "learning_rate": 0.00031949862107229796, "loss": 4.9525, "mean_token_accuracy": 0.2089128702878952, "num_tokens": 98324127.0, "step": 56680 }, { "entropy": 5.908437919616699, "epoch": 4.410270375413344, "grad_norm": 1.3359375, "learning_rate": 0.0003194714525821225, "loss": 4.909, "mean_token_accuracy": 0.2215150073170662, "num_tokens": 98332288.0, "step": 56685 }, { "entropy": 5.883612632751465, "epoch": 4.410659404785061, "grad_norm": 1.46875, "learning_rate": 0.0003194442834171636, "loss": 4.9914, "mean_token_accuracy": 0.21089410781860352, "num_tokens": 98340840.0, "step": 56690 }, { "entropy": 5.882678604125976, "epoch": 4.411048434156779, "grad_norm": 1.34375, "learning_rate": 0.0003194171135778334, "loss": 4.9034, "mean_token_accuracy": 0.2185919240117073, "num_tokens": 98349571.0, "step": 56695 }, { "entropy": 5.825513076782227, "epoch": 4.411437463528497, "grad_norm": 1.390625, "learning_rate": 0.0003193899430645442, "loss": 4.9591, "mean_token_accuracy": 0.2139182761311531, "num_tokens": 98358397.0, "step": 56700 }, { "entropy": 5.891409492492675, "epoch": 4.411826492900214, "grad_norm": 1.390625, "learning_rate": 0.00031936277187770824, "loss": 4.9225, "mean_token_accuracy": 0.2214018478989601, "num_tokens": 98366841.0, "step": 56705 }, { "entropy": 5.8951863765716555, "epoch": 4.412215522271931, "grad_norm": 1.3984375, "learning_rate": 0.0003193356000177378, "loss": 4.9834, "mean_token_accuracy": 0.2132929176092148, "num_tokens": 98376704.0, "step": 56710 }, { "entropy": 5.846710062026977, "epoch": 4.412604551643649, "grad_norm": 1.40625, "learning_rate": 0.0003193084274850453, "loss": 4.9498, "mean_token_accuracy": 0.22187179177999497, "num_tokens": 98385998.0, "step": 56715 }, { "entropy": 5.856969881057739, "epoch": 4.412993581015367, "grad_norm": 1.3671875, "learning_rate": 0.00031928125428004286, "loss": 4.9928, "mean_token_accuracy": 0.21258797496557236, "num_tokens": 98394646.0, "step": 56720 }, { "entropy": 5.8773726463317875, "epoch": 4.413382610387084, "grad_norm": 1.453125, "learning_rate": 0.0003192540804031429, "loss": 4.9641, "mean_token_accuracy": 0.20959641486406327, "num_tokens": 98403245.0, "step": 56725 }, { "entropy": 5.803283548355102, "epoch": 4.413771639758802, "grad_norm": 1.4140625, "learning_rate": 0.0003192269058547577, "loss": 4.9033, "mean_token_accuracy": 0.21666603684425353, "num_tokens": 98411258.0, "step": 56730 }, { "entropy": 5.870910120010376, "epoch": 4.41416066913052, "grad_norm": 1.4609375, "learning_rate": 0.0003191997306352996, "loss": 4.9249, "mean_token_accuracy": 0.21379794776439667, "num_tokens": 98419792.0, "step": 56735 }, { "entropy": 5.847129487991333, "epoch": 4.4145496985022366, "grad_norm": 1.4296875, "learning_rate": 0.000319172554745181, "loss": 4.8987, "mean_token_accuracy": 0.21521052718162537, "num_tokens": 98428255.0, "step": 56740 }, { "entropy": 5.838669538497925, "epoch": 4.414938727873954, "grad_norm": 1.4609375, "learning_rate": 0.00031914537818481404, "loss": 4.8683, "mean_token_accuracy": 0.22185811549425125, "num_tokens": 98436790.0, "step": 56745 }, { "entropy": 5.819364261627197, "epoch": 4.415327757245672, "grad_norm": 1.59375, "learning_rate": 0.0003191182009546113, "loss": 4.9574, "mean_token_accuracy": 0.21401439905166625, "num_tokens": 98445340.0, "step": 56750 }, { "entropy": 5.792689466476441, "epoch": 4.41571678661739, "grad_norm": 1.3984375, "learning_rate": 0.00031909102305498514, "loss": 4.8972, "mean_token_accuracy": 0.21458850651979447, "num_tokens": 98453757.0, "step": 56755 }, { "entropy": 5.85263671875, "epoch": 4.416105815989107, "grad_norm": 1.5078125, "learning_rate": 0.00031906384448634784, "loss": 4.9061, "mean_token_accuracy": 0.21871923804283142, "num_tokens": 98462901.0, "step": 56760 }, { "entropy": 5.82844910621643, "epoch": 4.416494845360825, "grad_norm": 1.3359375, "learning_rate": 0.00031903666524911185, "loss": 4.9004, "mean_token_accuracy": 0.21574854999780654, "num_tokens": 98470819.0, "step": 56765 }, { "entropy": 5.887957286834717, "epoch": 4.416883874732543, "grad_norm": 1.2421875, "learning_rate": 0.00031900948534368954, "loss": 5.0529, "mean_token_accuracy": 0.20411421358585358, "num_tokens": 98479793.0, "step": 56770 }, { "entropy": 5.862755250930786, "epoch": 4.4172729041042595, "grad_norm": 1.453125, "learning_rate": 0.00031898230477049334, "loss": 4.8753, "mean_token_accuracy": 0.22058097869157792, "num_tokens": 98487868.0, "step": 56775 }, { "entropy": 5.905448579788208, "epoch": 4.417661933475977, "grad_norm": 1.375, "learning_rate": 0.0003189551235299357, "loss": 5.0265, "mean_token_accuracy": 0.21030450016260147, "num_tokens": 98496974.0, "step": 56780 }, { "entropy": 5.8414782047271725, "epoch": 4.418050962847695, "grad_norm": 1.3984375, "learning_rate": 0.0003189279416224289, "loss": 4.9039, "mean_token_accuracy": 0.21415306329727174, "num_tokens": 98505507.0, "step": 56785 }, { "entropy": 5.858120632171631, "epoch": 4.418439992219413, "grad_norm": 1.40625, "learning_rate": 0.00031890075904838556, "loss": 4.9731, "mean_token_accuracy": 0.20258676558732985, "num_tokens": 98513568.0, "step": 56790 }, { "entropy": 5.867345476150513, "epoch": 4.41882902159113, "grad_norm": 1.4296875, "learning_rate": 0.00031887357580821817, "loss": 5.0029, "mean_token_accuracy": 0.21429697126150132, "num_tokens": 98523175.0, "step": 56795 }, { "entropy": 5.945668315887451, "epoch": 4.419218050962848, "grad_norm": 1.4296875, "learning_rate": 0.00031884639190233905, "loss": 5.0647, "mean_token_accuracy": 0.20742809623479844, "num_tokens": 98532046.0, "step": 56800 }, { "entropy": 5.878271961212159, "epoch": 4.419607080334565, "grad_norm": 1.46875, "learning_rate": 0.0003188192073311608, "loss": 4.9736, "mean_token_accuracy": 0.21098416596651076, "num_tokens": 98539816.0, "step": 56805 }, { "entropy": 5.893303394317627, "epoch": 4.4199961097062825, "grad_norm": 1.453125, "learning_rate": 0.00031879202209509564, "loss": 4.9419, "mean_token_accuracy": 0.21036721765995026, "num_tokens": 98548364.0, "step": 56810 }, { "entropy": 5.812397146224976, "epoch": 4.420385139078, "grad_norm": 1.3515625, "learning_rate": 0.00031876483619455633, "loss": 4.9352, "mean_token_accuracy": 0.2119004338979721, "num_tokens": 98557073.0, "step": 56815 }, { "entropy": 5.818601179122925, "epoch": 4.420774168449718, "grad_norm": 1.421875, "learning_rate": 0.0003187376496299553, "loss": 4.9024, "mean_token_accuracy": 0.21506871283054352, "num_tokens": 98565573.0, "step": 56820 }, { "entropy": 5.821877574920654, "epoch": 4.421163197821436, "grad_norm": 1.515625, "learning_rate": 0.000318710462401705, "loss": 4.9404, "mean_token_accuracy": 0.22211057543754578, "num_tokens": 98573992.0, "step": 56825 }, { "entropy": 5.869712829589844, "epoch": 4.421552227193153, "grad_norm": 1.3515625, "learning_rate": 0.00031868327451021816, "loss": 4.9405, "mean_token_accuracy": 0.21982790380716324, "num_tokens": 98582469.0, "step": 56830 }, { "entropy": 5.88722071647644, "epoch": 4.421941256564871, "grad_norm": 1.359375, "learning_rate": 0.00031865608595590706, "loss": 4.9097, "mean_token_accuracy": 0.21432303190231322, "num_tokens": 98590975.0, "step": 56835 }, { "entropy": 5.894414663314819, "epoch": 4.422330285936588, "grad_norm": 1.390625, "learning_rate": 0.00031862889673918437, "loss": 4.9447, "mean_token_accuracy": 0.21839074790477753, "num_tokens": 98600228.0, "step": 56840 }, { "entropy": 5.881117820739746, "epoch": 4.4227193153083055, "grad_norm": 1.34375, "learning_rate": 0.0003186017068604626, "loss": 4.9328, "mean_token_accuracy": 0.2199365735054016, "num_tokens": 98609272.0, "step": 56845 }, { "entropy": 5.911862707138061, "epoch": 4.423108344680023, "grad_norm": 1.46875, "learning_rate": 0.0003185745163201543, "loss": 4.9349, "mean_token_accuracy": 0.21343216001987458, "num_tokens": 98617435.0, "step": 56850 }, { "entropy": 5.916994953155518, "epoch": 4.423497374051741, "grad_norm": 1.3828125, "learning_rate": 0.0003185473251186721, "loss": 5.0998, "mean_token_accuracy": 0.2078026279807091, "num_tokens": 98626158.0, "step": 56855 }, { "entropy": 5.828356790542602, "epoch": 4.423886403423459, "grad_norm": 1.4375, "learning_rate": 0.0003185201332564285, "loss": 4.9072, "mean_token_accuracy": 0.22055112570524216, "num_tokens": 98634632.0, "step": 56860 }, { "entropy": 5.913850259780884, "epoch": 4.424275432795176, "grad_norm": 1.34375, "learning_rate": 0.0003184929407338362, "loss": 5.0131, "mean_token_accuracy": 0.20998370945453643, "num_tokens": 98644170.0, "step": 56865 }, { "entropy": 5.924437570571899, "epoch": 4.424664462166893, "grad_norm": 1.390625, "learning_rate": 0.00031846574755130773, "loss": 4.9185, "mean_token_accuracy": 0.21071734875440598, "num_tokens": 98652628.0, "step": 56870 }, { "entropy": 5.923933982849121, "epoch": 4.425053491538611, "grad_norm": 1.40625, "learning_rate": 0.00031843855370925574, "loss": 4.9865, "mean_token_accuracy": 0.2147386386990547, "num_tokens": 98661544.0, "step": 56875 }, { "entropy": 5.932667541503906, "epoch": 4.4254425209103285, "grad_norm": 1.515625, "learning_rate": 0.00031841135920809285, "loss": 5.01, "mean_token_accuracy": 0.20742432177066802, "num_tokens": 98670504.0, "step": 56880 }, { "entropy": 5.8265820980072025, "epoch": 4.425831550282046, "grad_norm": 1.421875, "learning_rate": 0.0003183841640482316, "loss": 4.9032, "mean_token_accuracy": 0.21314030438661574, "num_tokens": 98679001.0, "step": 56885 }, { "entropy": 5.8722243309021, "epoch": 4.426220579653764, "grad_norm": 1.3984375, "learning_rate": 0.00031835696823008476, "loss": 4.9881, "mean_token_accuracy": 0.21235791891813277, "num_tokens": 98687461.0, "step": 56890 }, { "entropy": 5.9026154518127445, "epoch": 4.426609609025482, "grad_norm": 1.4609375, "learning_rate": 0.00031832977175406496, "loss": 4.9073, "mean_token_accuracy": 0.21525291949510575, "num_tokens": 98696429.0, "step": 56895 }, { "entropy": 5.852021598815918, "epoch": 4.426998638397199, "grad_norm": 1.34375, "learning_rate": 0.0003183025746205848, "loss": 4.9459, "mean_token_accuracy": 0.21543249040842055, "num_tokens": 98704876.0, "step": 56900 }, { "entropy": 5.802906560897827, "epoch": 4.427387667768917, "grad_norm": 1.34375, "learning_rate": 0.0003182753768300571, "loss": 4.9234, "mean_token_accuracy": 0.22039939016103743, "num_tokens": 98714268.0, "step": 56905 }, { "entropy": 5.912241983413696, "epoch": 4.427776697140634, "grad_norm": 1.4609375, "learning_rate": 0.0003182481783828943, "loss": 5.0163, "mean_token_accuracy": 0.21047123819589614, "num_tokens": 98722243.0, "step": 56910 }, { "entropy": 5.851761293411255, "epoch": 4.4281657265123515, "grad_norm": 1.3359375, "learning_rate": 0.00031822097927950934, "loss": 4.8429, "mean_token_accuracy": 0.21856610625982284, "num_tokens": 98731212.0, "step": 56915 }, { "entropy": 5.868413925170898, "epoch": 4.428554755884069, "grad_norm": 1.4375, "learning_rate": 0.00031819377952031476, "loss": 4.9246, "mean_token_accuracy": 0.2150653198361397, "num_tokens": 98739982.0, "step": 56920 }, { "entropy": 5.906727743148804, "epoch": 4.428943785255787, "grad_norm": 1.453125, "learning_rate": 0.00031816657910572327, "loss": 4.9667, "mean_token_accuracy": 0.20531667917966842, "num_tokens": 98748413.0, "step": 56925 }, { "entropy": 5.946642684936523, "epoch": 4.429332814627505, "grad_norm": 1.3359375, "learning_rate": 0.00031813937803614774, "loss": 4.9399, "mean_token_accuracy": 0.21544319689273833, "num_tokens": 98757813.0, "step": 56930 }, { "entropy": 5.8511651992797855, "epoch": 4.429721843999222, "grad_norm": 1.359375, "learning_rate": 0.0003181121763120008, "loss": 4.8891, "mean_token_accuracy": 0.21692366451025008, "num_tokens": 98766231.0, "step": 56935 }, { "entropy": 5.907589435577393, "epoch": 4.430110873370939, "grad_norm": 1.4765625, "learning_rate": 0.0003180849739336952, "loss": 5.0841, "mean_token_accuracy": 0.2045784994959831, "num_tokens": 98774583.0, "step": 56940 }, { "entropy": 5.813856506347657, "epoch": 4.430499902742657, "grad_norm": 1.421875, "learning_rate": 0.00031805777090164364, "loss": 4.8887, "mean_token_accuracy": 0.22220973670482635, "num_tokens": 98782885.0, "step": 56945 }, { "entropy": 5.844394159317017, "epoch": 4.4308889321143745, "grad_norm": 1.3203125, "learning_rate": 0.000318030567216259, "loss": 4.8965, "mean_token_accuracy": 0.21852237582206727, "num_tokens": 98792046.0, "step": 56950 }, { "entropy": 5.885601329803467, "epoch": 4.431277961486092, "grad_norm": 1.3828125, "learning_rate": 0.00031800336287795395, "loss": 4.8849, "mean_token_accuracy": 0.21839630901813506, "num_tokens": 98800334.0, "step": 56955 }, { "entropy": 5.878577709197998, "epoch": 4.43166699085781, "grad_norm": 1.4296875, "learning_rate": 0.00031797615788714133, "loss": 4.91, "mean_token_accuracy": 0.20704471468925476, "num_tokens": 98808647.0, "step": 56960 }, { "entropy": 5.854475116729736, "epoch": 4.432056020229528, "grad_norm": 1.3828125, "learning_rate": 0.00031794895224423396, "loss": 4.9417, "mean_token_accuracy": 0.21235888302326203, "num_tokens": 98818112.0, "step": 56965 }, { "entropy": 5.89456992149353, "epoch": 4.432445049601245, "grad_norm": 1.53125, "learning_rate": 0.0003179217459496446, "loss": 4.8709, "mean_token_accuracy": 0.21699755936861037, "num_tokens": 98826893.0, "step": 56970 }, { "entropy": 5.856910753250122, "epoch": 4.432834078972962, "grad_norm": 1.3671875, "learning_rate": 0.000317894539003786, "loss": 4.8891, "mean_token_accuracy": 0.22007119953632354, "num_tokens": 98834484.0, "step": 56975 }, { "entropy": 5.888616418838501, "epoch": 4.43322310834468, "grad_norm": 1.4765625, "learning_rate": 0.000317867331407071, "loss": 5.0816, "mean_token_accuracy": 0.20982526540756224, "num_tokens": 98843661.0, "step": 56980 }, { "entropy": 5.896297788619995, "epoch": 4.4336121377163975, "grad_norm": 1.3828125, "learning_rate": 0.0003178401231599126, "loss": 4.9938, "mean_token_accuracy": 0.20927424728870392, "num_tokens": 98852215.0, "step": 56985 }, { "entropy": 5.926761817932129, "epoch": 4.434001167088115, "grad_norm": 1.2890625, "learning_rate": 0.00031781291426272347, "loss": 5.0149, "mean_token_accuracy": 0.21763289123773574, "num_tokens": 98862057.0, "step": 56990 }, { "entropy": 5.867588329315185, "epoch": 4.434390196459833, "grad_norm": 1.6015625, "learning_rate": 0.0003177857047159165, "loss": 4.8279, "mean_token_accuracy": 0.22957581728696824, "num_tokens": 98870215.0, "step": 56995 }, { "entropy": 5.8454266548156735, "epoch": 4.434779225831551, "grad_norm": 1.4140625, "learning_rate": 0.0003177584945199046, "loss": 4.9165, "mean_token_accuracy": 0.22669149041175843, "num_tokens": 98878176.0, "step": 57000 }, { "epoch": 4.434779225831551, "eval_entropy": 5.538972745019731, "eval_loss": 5.043375492095947, "eval_mean_token_accuracy": 0.2201015628365167, "eval_num_tokens": 98878176.0, "eval_runtime": 21.6483, "eval_samples_per_second": 1919.688, "eval_steps_per_second": 239.973, "step": 57000 }, { "entropy": 5.865025615692138, "epoch": 4.435168255203267, "grad_norm": 1.4453125, "learning_rate": 0.0003177312836751005, "loss": 5.013, "mean_token_accuracy": 0.20777997374534607, "num_tokens": 98886995.0, "step": 57005 }, { "entropy": 5.855606412887573, "epoch": 4.435557284574985, "grad_norm": 1.421875, "learning_rate": 0.00031770407218191727, "loss": 5.0117, "mean_token_accuracy": 0.2042378544807434, "num_tokens": 98895385.0, "step": 57010 }, { "entropy": 5.83737154006958, "epoch": 4.435946313946703, "grad_norm": 1.34375, "learning_rate": 0.0003176768600407677, "loss": 4.8564, "mean_token_accuracy": 0.22667513638734818, "num_tokens": 98903871.0, "step": 57015 }, { "entropy": 5.853383159637451, "epoch": 4.4363353433184205, "grad_norm": 1.2890625, "learning_rate": 0.0003176496472520647, "loss": 4.8618, "mean_token_accuracy": 0.21446166634559632, "num_tokens": 98911989.0, "step": 57020 }, { "entropy": 5.859633207321167, "epoch": 4.436724372690138, "grad_norm": 1.546875, "learning_rate": 0.0003176224338162212, "loss": 4.9592, "mean_token_accuracy": 0.20999007672071457, "num_tokens": 98920618.0, "step": 57025 }, { "entropy": 5.802068614959717, "epoch": 4.437113402061856, "grad_norm": 1.453125, "learning_rate": 0.00031759521973365006, "loss": 4.8537, "mean_token_accuracy": 0.21882838159799575, "num_tokens": 98929179.0, "step": 57030 }, { "entropy": 5.9125776290893555, "epoch": 4.437502431433574, "grad_norm": 1.359375, "learning_rate": 0.00031756800500476435, "loss": 4.8972, "mean_token_accuracy": 0.22074341922998428, "num_tokens": 98937900.0, "step": 57035 }, { "entropy": 5.866281270980835, "epoch": 4.43789146080529, "grad_norm": 1.3046875, "learning_rate": 0.00031754078962997686, "loss": 4.9318, "mean_token_accuracy": 0.21960435211658477, "num_tokens": 98947310.0, "step": 57040 }, { "entropy": 5.937146997451782, "epoch": 4.438280490177008, "grad_norm": 1.390625, "learning_rate": 0.0003175135736097006, "loss": 4.9913, "mean_token_accuracy": 0.21295321136713027, "num_tokens": 98956203.0, "step": 57045 }, { "entropy": 5.849953508377075, "epoch": 4.438669519548726, "grad_norm": 1.3515625, "learning_rate": 0.00031748635694434844, "loss": 4.8847, "mean_token_accuracy": 0.21855379194021224, "num_tokens": 98964690.0, "step": 57050 }, { "entropy": 5.866893243789673, "epoch": 4.4390585489204435, "grad_norm": 1.46875, "learning_rate": 0.0003174591396343336, "loss": 4.9822, "mean_token_accuracy": 0.2147304967045784, "num_tokens": 98974195.0, "step": 57055 }, { "entropy": 5.889646577835083, "epoch": 4.439447578292161, "grad_norm": 1.4140625, "learning_rate": 0.0003174319216800688, "loss": 4.9904, "mean_token_accuracy": 0.21202975511550903, "num_tokens": 98982457.0, "step": 57060 }, { "entropy": 5.886439514160156, "epoch": 4.439836607663879, "grad_norm": 1.421875, "learning_rate": 0.00031740470308196724, "loss": 4.927, "mean_token_accuracy": 0.21616315543651582, "num_tokens": 98991449.0, "step": 57065 }, { "entropy": 5.932275867462158, "epoch": 4.440225637035597, "grad_norm": 1.3984375, "learning_rate": 0.0003173774838404417, "loss": 4.9924, "mean_token_accuracy": 0.2162795975804329, "num_tokens": 99000472.0, "step": 57070 }, { "entropy": 5.864894866943359, "epoch": 4.440614666407313, "grad_norm": 1.5078125, "learning_rate": 0.00031735026395590535, "loss": 4.8777, "mean_token_accuracy": 0.22521155923604966, "num_tokens": 99008642.0, "step": 57075 }, { "entropy": 5.896076250076294, "epoch": 4.441003695779031, "grad_norm": 1.34375, "learning_rate": 0.000317323043428771, "loss": 4.9931, "mean_token_accuracy": 0.21135891526937484, "num_tokens": 99017504.0, "step": 57080 }, { "entropy": 5.887834787368774, "epoch": 4.441392725150749, "grad_norm": 1.3359375, "learning_rate": 0.0003172958222594519, "loss": 4.9394, "mean_token_accuracy": 0.20695120990276336, "num_tokens": 99026132.0, "step": 57085 }, { "entropy": 5.903744506835937, "epoch": 4.4417817545224665, "grad_norm": 1.578125, "learning_rate": 0.0003172686004483611, "loss": 4.9197, "mean_token_accuracy": 0.2157866969704628, "num_tokens": 99034535.0, "step": 57090 }, { "entropy": 5.864254474639893, "epoch": 4.442170783894184, "grad_norm": 1.2890625, "learning_rate": 0.00031724137799591154, "loss": 4.9356, "mean_token_accuracy": 0.2082432672381401, "num_tokens": 99044591.0, "step": 57095 }, { "entropy": 5.84340615272522, "epoch": 4.442559813265902, "grad_norm": 1.3515625, "learning_rate": 0.00031721415490251634, "loss": 4.944, "mean_token_accuracy": 0.2154535621404648, "num_tokens": 99052570.0, "step": 57100 }, { "entropy": 5.8699816226959225, "epoch": 4.44294884263762, "grad_norm": 1.390625, "learning_rate": 0.0003171869311685885, "loss": 4.9354, "mean_token_accuracy": 0.21432520896196366, "num_tokens": 99061533.0, "step": 57105 }, { "entropy": 5.94688458442688, "epoch": 4.443337872009336, "grad_norm": 1.5234375, "learning_rate": 0.0003171597067945411, "loss": 5.0094, "mean_token_accuracy": 0.20566207766532899, "num_tokens": 99070214.0, "step": 57110 }, { "entropy": 5.942174959182739, "epoch": 4.443726901381054, "grad_norm": 1.3984375, "learning_rate": 0.00031713248178078717, "loss": 4.9231, "mean_token_accuracy": 0.22151853740215302, "num_tokens": 99077968.0, "step": 57115 }, { "entropy": 5.850817346572876, "epoch": 4.444115930752772, "grad_norm": 1.328125, "learning_rate": 0.00031710525612774, "loss": 4.9179, "mean_token_accuracy": 0.21422065049409866, "num_tokens": 99087398.0, "step": 57120 }, { "entropy": 5.950133466720581, "epoch": 4.4445049601244895, "grad_norm": 1.40625, "learning_rate": 0.0003170780298358126, "loss": 5.0048, "mean_token_accuracy": 0.21400618851184844, "num_tokens": 99096057.0, "step": 57125 }, { "entropy": 5.897212123870849, "epoch": 4.444893989496207, "grad_norm": 1.359375, "learning_rate": 0.00031705080290541797, "loss": 4.9623, "mean_token_accuracy": 0.2148256331682205, "num_tokens": 99105034.0, "step": 57130 }, { "entropy": 5.836870241165161, "epoch": 4.445283018867925, "grad_norm": 1.4453125, "learning_rate": 0.00031702357533696946, "loss": 4.8875, "mean_token_accuracy": 0.21777815371751785, "num_tokens": 99113992.0, "step": 57135 }, { "entropy": 5.915919494628906, "epoch": 4.445672048239642, "grad_norm": 1.3828125, "learning_rate": 0.00031699634713088, "loss": 4.9493, "mean_token_accuracy": 0.2166342630982399, "num_tokens": 99122380.0, "step": 57140 }, { "entropy": 5.845082092285156, "epoch": 4.446061077611359, "grad_norm": 1.375, "learning_rate": 0.0003169691182875628, "loss": 4.9373, "mean_token_accuracy": 0.20962347984313964, "num_tokens": 99131759.0, "step": 57145 }, { "entropy": 5.856068515777588, "epoch": 4.446450106983077, "grad_norm": 1.421875, "learning_rate": 0.0003169418888074311, "loss": 4.9054, "mean_token_accuracy": 0.21535201817750932, "num_tokens": 99140172.0, "step": 57150 }, { "entropy": 5.8785929679870605, "epoch": 4.446839136354795, "grad_norm": 1.34375, "learning_rate": 0.00031691465869089795, "loss": 4.9338, "mean_token_accuracy": 0.21584688425064086, "num_tokens": 99149071.0, "step": 57155 }, { "entropy": 5.889718437194825, "epoch": 4.4472281657265125, "grad_norm": 1.4375, "learning_rate": 0.0003168874279383766, "loss": 4.9734, "mean_token_accuracy": 0.22119763791561126, "num_tokens": 99158266.0, "step": 57160 }, { "entropy": 5.795144748687744, "epoch": 4.44761719509823, "grad_norm": 1.40625, "learning_rate": 0.0003168601965502802, "loss": 4.8623, "mean_token_accuracy": 0.21960606724023818, "num_tokens": 99166707.0, "step": 57165 }, { "entropy": 5.829557609558106, "epoch": 4.448006224469948, "grad_norm": 1.3203125, "learning_rate": 0.0003168329645270219, "loss": 4.9115, "mean_token_accuracy": 0.21763397008180618, "num_tokens": 99175694.0, "step": 57170 }, { "entropy": 5.90287561416626, "epoch": 4.448395253841665, "grad_norm": 1.34375, "learning_rate": 0.000316805731869015, "loss": 4.9935, "mean_token_accuracy": 0.20850178599357605, "num_tokens": 99184318.0, "step": 57175 }, { "entropy": 5.830742454528808, "epoch": 4.448784283213382, "grad_norm": 1.4296875, "learning_rate": 0.00031677849857667266, "loss": 4.867, "mean_token_accuracy": 0.2167402520775795, "num_tokens": 99192280.0, "step": 57180 }, { "entropy": 5.905914831161499, "epoch": 4.4491733125851, "grad_norm": 1.5234375, "learning_rate": 0.0003167512646504081, "loss": 5.002, "mean_token_accuracy": 0.21043099761009215, "num_tokens": 99200067.0, "step": 57185 }, { "entropy": 5.917875862121582, "epoch": 4.449562341956818, "grad_norm": 1.3671875, "learning_rate": 0.0003167240300906345, "loss": 4.9631, "mean_token_accuracy": 0.2167690858244896, "num_tokens": 99209130.0, "step": 57190 }, { "entropy": 5.893340921401977, "epoch": 4.4499513713285355, "grad_norm": 1.3671875, "learning_rate": 0.0003166967948977652, "loss": 4.9144, "mean_token_accuracy": 0.21695596277713775, "num_tokens": 99218211.0, "step": 57195 }, { "entropy": 5.83864574432373, "epoch": 4.450340400700253, "grad_norm": 1.421875, "learning_rate": 0.0003166695590722134, "loss": 4.9052, "mean_token_accuracy": 0.22346220165491104, "num_tokens": 99226640.0, "step": 57200 }, { "entropy": 5.834119844436645, "epoch": 4.45072943007197, "grad_norm": 1.390625, "learning_rate": 0.00031664232261439235, "loss": 4.9641, "mean_token_accuracy": 0.21484889686107636, "num_tokens": 99235825.0, "step": 57205 }, { "entropy": 5.813468503952026, "epoch": 4.451118459443688, "grad_norm": 1.3125, "learning_rate": 0.0003166150855247153, "loss": 4.9325, "mean_token_accuracy": 0.2157994493842125, "num_tokens": 99244206.0, "step": 57210 }, { "entropy": 5.939279174804687, "epoch": 4.451507488815405, "grad_norm": 1.4375, "learning_rate": 0.0003165878478035956, "loss": 4.9828, "mean_token_accuracy": 0.21667672246694564, "num_tokens": 99252625.0, "step": 57215 }, { "entropy": 5.92590446472168, "epoch": 4.451896518187123, "grad_norm": 1.34375, "learning_rate": 0.0003165606094514465, "loss": 4.9519, "mean_token_accuracy": 0.21139894425868988, "num_tokens": 99261998.0, "step": 57220 }, { "entropy": 5.89979772567749, "epoch": 4.452285547558841, "grad_norm": 1.40625, "learning_rate": 0.00031653337046868137, "loss": 5.0373, "mean_token_accuracy": 0.20884698629379272, "num_tokens": 99271381.0, "step": 57225 }, { "entropy": 5.8654149055480955, "epoch": 4.4526745769305585, "grad_norm": 1.328125, "learning_rate": 0.00031650613085571334, "loss": 4.9455, "mean_token_accuracy": 0.2065042957663536, "num_tokens": 99280198.0, "step": 57230 }, { "entropy": 5.870070171356201, "epoch": 4.453063606302276, "grad_norm": 1.375, "learning_rate": 0.0003164788906129559, "loss": 4.9081, "mean_token_accuracy": 0.22015132158994674, "num_tokens": 99288713.0, "step": 57235 }, { "entropy": 5.867806339263916, "epoch": 4.453452635673994, "grad_norm": 1.375, "learning_rate": 0.0003164516497408223, "loss": 4.8685, "mean_token_accuracy": 0.2219562217593193, "num_tokens": 99297038.0, "step": 57240 }, { "entropy": 5.814713859558106, "epoch": 4.453841665045711, "grad_norm": 1.359375, "learning_rate": 0.0003164244082397259, "loss": 4.7863, "mean_token_accuracy": 0.21988977789878844, "num_tokens": 99305802.0, "step": 57245 }, { "entropy": 5.86818265914917, "epoch": 4.454230694417428, "grad_norm": 1.4375, "learning_rate": 0.00031639716611008, "loss": 4.9555, "mean_token_accuracy": 0.2170003518462181, "num_tokens": 99313841.0, "step": 57250 }, { "entropy": 5.922854900360107, "epoch": 4.454619723789146, "grad_norm": 1.40625, "learning_rate": 0.0003163699233522981, "loss": 5.0389, "mean_token_accuracy": 0.20481980443000794, "num_tokens": 99322002.0, "step": 57255 }, { "entropy": 5.85435266494751, "epoch": 4.455008753160864, "grad_norm": 1.265625, "learning_rate": 0.0003163426799667934, "loss": 4.9055, "mean_token_accuracy": 0.21833187937736512, "num_tokens": 99331299.0, "step": 57260 }, { "entropy": 5.873106908798218, "epoch": 4.4553977825325815, "grad_norm": 1.3125, "learning_rate": 0.0003163154359539793, "loss": 4.9707, "mean_token_accuracy": 0.21037367433309556, "num_tokens": 99340816.0, "step": 57265 }, { "entropy": 5.860009860992432, "epoch": 4.455786811904299, "grad_norm": 1.5546875, "learning_rate": 0.00031628819131426924, "loss": 4.9246, "mean_token_accuracy": 0.216504068672657, "num_tokens": 99350438.0, "step": 57270 }, { "entropy": 5.8602807998657225, "epoch": 4.456175841276016, "grad_norm": 1.375, "learning_rate": 0.0003162609460480766, "loss": 4.9126, "mean_token_accuracy": 0.2088914096355438, "num_tokens": 99358430.0, "step": 57275 }, { "entropy": 5.8631589889526365, "epoch": 4.456564870647734, "grad_norm": 1.5078125, "learning_rate": 0.0003162337001558147, "loss": 4.9391, "mean_token_accuracy": 0.213034550845623, "num_tokens": 99366479.0, "step": 57280 }, { "entropy": 5.8362242698669435, "epoch": 4.456953900019451, "grad_norm": 1.4296875, "learning_rate": 0.00031620645363789713, "loss": 4.9618, "mean_token_accuracy": 0.21070931106805801, "num_tokens": 99375119.0, "step": 57285 }, { "entropy": 5.858323192596435, "epoch": 4.457342929391169, "grad_norm": 1.375, "learning_rate": 0.0003161792064947372, "loss": 4.9573, "mean_token_accuracy": 0.21583871692419052, "num_tokens": 99385216.0, "step": 57290 }, { "entropy": 5.887515449523926, "epoch": 4.457731958762887, "grad_norm": 1.53125, "learning_rate": 0.00031615195872674836, "loss": 4.9998, "mean_token_accuracy": 0.21943702101707457, "num_tokens": 99393805.0, "step": 57295 }, { "entropy": 5.92804479598999, "epoch": 4.4581209881346044, "grad_norm": 1.4609375, "learning_rate": 0.00031612471033434406, "loss": 5.009, "mean_token_accuracy": 0.21036478132009506, "num_tokens": 99403022.0, "step": 57300 }, { "entropy": 5.846676301956177, "epoch": 4.458510017506322, "grad_norm": 1.3984375, "learning_rate": 0.0003160974613179377, "loss": 4.8964, "mean_token_accuracy": 0.21861130595207215, "num_tokens": 99412125.0, "step": 57305 }, { "entropy": 5.884039783477784, "epoch": 4.458899046878039, "grad_norm": 1.421875, "learning_rate": 0.0003160702116779428, "loss": 4.9316, "mean_token_accuracy": 0.2202650487422943, "num_tokens": 99420040.0, "step": 57310 }, { "entropy": 5.854933214187622, "epoch": 4.459288076249757, "grad_norm": 1.40625, "learning_rate": 0.0003160429614147727, "loss": 4.9402, "mean_token_accuracy": 0.21159075498580932, "num_tokens": 99428266.0, "step": 57315 }, { "entropy": 5.853244066238403, "epoch": 4.459677105621474, "grad_norm": 1.515625, "learning_rate": 0.00031601571052884117, "loss": 4.9123, "mean_token_accuracy": 0.22534742057323456, "num_tokens": 99436428.0, "step": 57320 }, { "entropy": 5.842436408996582, "epoch": 4.460066134993192, "grad_norm": 1.4296875, "learning_rate": 0.0003159884590205613, "loss": 4.9495, "mean_token_accuracy": 0.21692524552345277, "num_tokens": 99445257.0, "step": 57325 }, { "entropy": 5.926843166351318, "epoch": 4.46045516436491, "grad_norm": 1.40625, "learning_rate": 0.000315961206890347, "loss": 4.9438, "mean_token_accuracy": 0.21319303214550017, "num_tokens": 99453884.0, "step": 57330 }, { "entropy": 5.84315938949585, "epoch": 4.460844193736627, "grad_norm": 1.2734375, "learning_rate": 0.0003159339541386115, "loss": 4.9391, "mean_token_accuracy": 0.21765826940536498, "num_tokens": 99462877.0, "step": 57335 }, { "entropy": 5.871442651748657, "epoch": 4.461233223108344, "grad_norm": 1.375, "learning_rate": 0.00031590670076576846, "loss": 4.9153, "mean_token_accuracy": 0.21479899883270265, "num_tokens": 99470955.0, "step": 57340 }, { "entropy": 5.883690738677979, "epoch": 4.461622252480062, "grad_norm": 1.375, "learning_rate": 0.00031587944677223133, "loss": 5.0247, "mean_token_accuracy": 0.20781624168157578, "num_tokens": 99479301.0, "step": 57345 }, { "entropy": 5.9074622631073, "epoch": 4.46201128185178, "grad_norm": 1.453125, "learning_rate": 0.0003158521921584136, "loss": 4.9295, "mean_token_accuracy": 0.22121800482273102, "num_tokens": 99488049.0, "step": 57350 }, { "entropy": 5.91347975730896, "epoch": 4.462400311223497, "grad_norm": 1.40625, "learning_rate": 0.00031582493692472886, "loss": 4.9692, "mean_token_accuracy": 0.2150060147047043, "num_tokens": 99496209.0, "step": 57355 }, { "entropy": 6.0034631252288815, "epoch": 4.462789340595215, "grad_norm": 1.3125, "learning_rate": 0.0003157976810715907, "loss": 5.0612, "mean_token_accuracy": 0.20692339688539504, "num_tokens": 99505474.0, "step": 57360 }, { "entropy": 5.913968420028686, "epoch": 4.463178369966933, "grad_norm": 1.4140625, "learning_rate": 0.00031577042459941275, "loss": 4.9141, "mean_token_accuracy": 0.21789529770612717, "num_tokens": 99513708.0, "step": 57365 }, { "entropy": 5.860549449920654, "epoch": 4.46356739933865, "grad_norm": 1.3671875, "learning_rate": 0.00031574316750860844, "loss": 4.9506, "mean_token_accuracy": 0.21666476279497146, "num_tokens": 99521954.0, "step": 57370 }, { "entropy": 5.821752595901489, "epoch": 4.463956428710367, "grad_norm": 1.4296875, "learning_rate": 0.0003157159097995914, "loss": 4.9063, "mean_token_accuracy": 0.21571887135505677, "num_tokens": 99530559.0, "step": 57375 }, { "entropy": 5.937926197052002, "epoch": 4.464345458082085, "grad_norm": 1.3203125, "learning_rate": 0.00031568865147277525, "loss": 5.0621, "mean_token_accuracy": 0.20940686613321305, "num_tokens": 99540568.0, "step": 57380 }, { "entropy": 5.921345281600952, "epoch": 4.464734487453803, "grad_norm": 1.3671875, "learning_rate": 0.00031566139252857357, "loss": 4.9137, "mean_token_accuracy": 0.21525816321372987, "num_tokens": 99548868.0, "step": 57385 }, { "entropy": 5.8123210906982425, "epoch": 4.46512351682552, "grad_norm": 1.515625, "learning_rate": 0.0003156341329674, "loss": 4.8775, "mean_token_accuracy": 0.22649578005075455, "num_tokens": 99556817.0, "step": 57390 }, { "entropy": 5.884624767303467, "epoch": 4.465512546197238, "grad_norm": 1.5703125, "learning_rate": 0.0003156068727896681, "loss": 4.9586, "mean_token_accuracy": 0.2171418473124504, "num_tokens": 99564962.0, "step": 57395 }, { "entropy": 5.84985032081604, "epoch": 4.465901575568956, "grad_norm": 1.4921875, "learning_rate": 0.0003155796119957915, "loss": 4.9934, "mean_token_accuracy": 0.206262943148613, "num_tokens": 99574341.0, "step": 57400 }, { "entropy": 5.943967294692993, "epoch": 4.466290604940673, "grad_norm": 1.40625, "learning_rate": 0.00031555235058618403, "loss": 4.9915, "mean_token_accuracy": 0.2141242116689682, "num_tokens": 99583079.0, "step": 57405 }, { "entropy": 5.877442169189453, "epoch": 4.46667963431239, "grad_norm": 1.5, "learning_rate": 0.00031552508856125906, "loss": 4.8939, "mean_token_accuracy": 0.21482914984226226, "num_tokens": 99591055.0, "step": 57410 }, { "entropy": 5.806022214889526, "epoch": 4.467068663684108, "grad_norm": 1.3515625, "learning_rate": 0.0003154978259214304, "loss": 4.8441, "mean_token_accuracy": 0.2130469262599945, "num_tokens": 99600438.0, "step": 57415 }, { "entropy": 5.844544219970703, "epoch": 4.467457693055826, "grad_norm": 1.421875, "learning_rate": 0.00031547056266711173, "loss": 4.9623, "mean_token_accuracy": 0.21391918808221816, "num_tokens": 99608541.0, "step": 57420 }, { "entropy": 5.829662656784057, "epoch": 4.467846722427543, "grad_norm": 1.3828125, "learning_rate": 0.0003154432987987166, "loss": 4.9238, "mean_token_accuracy": 0.21896325945854186, "num_tokens": 99617013.0, "step": 57425 }, { "entropy": 5.910103893280029, "epoch": 4.468235751799261, "grad_norm": 1.390625, "learning_rate": 0.0003154160343166589, "loss": 4.952, "mean_token_accuracy": 0.20986531376838685, "num_tokens": 99625957.0, "step": 57430 }, { "entropy": 5.824017143249511, "epoch": 4.468624781170979, "grad_norm": 1.3203125, "learning_rate": 0.00031538876922135214, "loss": 4.9157, "mean_token_accuracy": 0.21520230323076248, "num_tokens": 99635783.0, "step": 57435 }, { "entropy": 5.9219707489013675, "epoch": 4.469013810542696, "grad_norm": 1.390625, "learning_rate": 0.0003153615035132101, "loss": 5.0107, "mean_token_accuracy": 0.21304901242256163, "num_tokens": 99644066.0, "step": 57440 }, { "entropy": 5.896878862380982, "epoch": 4.469402839914413, "grad_norm": 1.375, "learning_rate": 0.00031533423719264645, "loss": 5.0355, "mean_token_accuracy": 0.2126910164952278, "num_tokens": 99653194.0, "step": 57445 }, { "entropy": 5.792404460906982, "epoch": 4.469791869286131, "grad_norm": 1.4140625, "learning_rate": 0.000315306970260075, "loss": 4.8958, "mean_token_accuracy": 0.21507944017648697, "num_tokens": 99661332.0, "step": 57450 }, { "entropy": 5.832111120223999, "epoch": 4.470180898657849, "grad_norm": 1.390625, "learning_rate": 0.0003152797027159094, "loss": 4.8685, "mean_token_accuracy": 0.22227553576231002, "num_tokens": 99670163.0, "step": 57455 }, { "entropy": 5.877451467514038, "epoch": 4.470569928029566, "grad_norm": 1.4140625, "learning_rate": 0.00031525243456056345, "loss": 4.904, "mean_token_accuracy": 0.22223387360572816, "num_tokens": 99678174.0, "step": 57460 }, { "entropy": 5.8917945384979244, "epoch": 4.470958957401284, "grad_norm": 1.375, "learning_rate": 0.0003152251657944509, "loss": 4.9578, "mean_token_accuracy": 0.2077690988779068, "num_tokens": 99686364.0, "step": 57465 }, { "entropy": 5.798991107940674, "epoch": 4.471347986773002, "grad_norm": 1.53125, "learning_rate": 0.0003151978964179854, "loss": 4.843, "mean_token_accuracy": 0.21934892237186432, "num_tokens": 99694752.0, "step": 57470 }, { "entropy": 5.84685525894165, "epoch": 4.4717370161447185, "grad_norm": 1.421875, "learning_rate": 0.00031517062643158085, "loss": 4.9679, "mean_token_accuracy": 0.2121386244893074, "num_tokens": 99703819.0, "step": 57475 }, { "entropy": 5.836417388916016, "epoch": 4.472126045516436, "grad_norm": 1.3203125, "learning_rate": 0.00031514335583565097, "loss": 4.9006, "mean_token_accuracy": 0.21812244206666948, "num_tokens": 99711908.0, "step": 57480 }, { "entropy": 5.853615951538086, "epoch": 4.472515074888154, "grad_norm": 1.4140625, "learning_rate": 0.00031511608463060954, "loss": 4.8381, "mean_token_accuracy": 0.22978344261646272, "num_tokens": 99720356.0, "step": 57485 }, { "entropy": 5.936135721206665, "epoch": 4.472904104259872, "grad_norm": 1.5, "learning_rate": 0.00031508881281687044, "loss": 4.9954, "mean_token_accuracy": 0.2159103512763977, "num_tokens": 99729408.0, "step": 57490 }, { "entropy": 5.865327167510986, "epoch": 4.473293133631589, "grad_norm": 1.390625, "learning_rate": 0.00031506154039484736, "loss": 4.8713, "mean_token_accuracy": 0.22066086828708648, "num_tokens": 99738819.0, "step": 57495 }, { "entropy": 5.840186691284179, "epoch": 4.473682163003307, "grad_norm": 1.3828125, "learning_rate": 0.00031503426736495424, "loss": 4.8969, "mean_token_accuracy": 0.22595804929733276, "num_tokens": 99747474.0, "step": 57500 }, { "entropy": 5.823077535629272, "epoch": 4.474071192375025, "grad_norm": 1.4765625, "learning_rate": 0.00031500699372760476, "loss": 4.856, "mean_token_accuracy": 0.22064838707447051, "num_tokens": 99756541.0, "step": 57505 }, { "entropy": 5.794564199447632, "epoch": 4.4744602217467415, "grad_norm": 1.3828125, "learning_rate": 0.00031497971948321287, "loss": 4.8915, "mean_token_accuracy": 0.21672210991382598, "num_tokens": 99765688.0, "step": 57510 }, { "entropy": 5.79774580001831, "epoch": 4.474849251118459, "grad_norm": 1.390625, "learning_rate": 0.0003149524446321923, "loss": 4.9061, "mean_token_accuracy": 0.2188581258058548, "num_tokens": 99774139.0, "step": 57515 }, { "entropy": 5.806543207168579, "epoch": 4.475238280490177, "grad_norm": 1.46875, "learning_rate": 0.000314925169174957, "loss": 4.8724, "mean_token_accuracy": 0.2278507649898529, "num_tokens": 99782429.0, "step": 57520 }, { "entropy": 5.878740215301514, "epoch": 4.475627309861895, "grad_norm": 1.4453125, "learning_rate": 0.00031489789311192086, "loss": 4.9725, "mean_token_accuracy": 0.21509101390838622, "num_tokens": 99790901.0, "step": 57525 }, { "entropy": 5.8573215961456295, "epoch": 4.476016339233612, "grad_norm": 1.515625, "learning_rate": 0.0003148706164434977, "loss": 4.9069, "mean_token_accuracy": 0.2241940677165985, "num_tokens": 99799441.0, "step": 57530 }, { "entropy": 5.797119045257569, "epoch": 4.47640536860533, "grad_norm": 1.4375, "learning_rate": 0.0003148433391701014, "loss": 4.8923, "mean_token_accuracy": 0.2258593961596489, "num_tokens": 99808590.0, "step": 57535 }, { "entropy": 5.87029800415039, "epoch": 4.476794397977047, "grad_norm": 1.5, "learning_rate": 0.0003148160612921457, "loss": 4.9587, "mean_token_accuracy": 0.2087582215666771, "num_tokens": 99817098.0, "step": 57540 }, { "entropy": 5.887494516372681, "epoch": 4.4771834273487645, "grad_norm": 1.59375, "learning_rate": 0.00031478878281004474, "loss": 4.899, "mean_token_accuracy": 0.2140077456831932, "num_tokens": 99825282.0, "step": 57545 }, { "entropy": 5.912522459030152, "epoch": 4.477572456720482, "grad_norm": 1.421875, "learning_rate": 0.00031476150372421234, "loss": 5.0236, "mean_token_accuracy": 0.20480482131242753, "num_tokens": 99833883.0, "step": 57550 }, { "entropy": 5.866175365447998, "epoch": 4.4779614860922, "grad_norm": 1.5078125, "learning_rate": 0.0003147342240350625, "loss": 4.8907, "mean_token_accuracy": 0.21857628524303435, "num_tokens": 99842533.0, "step": 57555 }, { "entropy": 5.822031784057617, "epoch": 4.478350515463918, "grad_norm": 1.5625, "learning_rate": 0.0003147069437430089, "loss": 4.8627, "mean_token_accuracy": 0.2231131374835968, "num_tokens": 99851212.0, "step": 57560 }, { "entropy": 5.916667890548706, "epoch": 4.478739544835635, "grad_norm": 1.3515625, "learning_rate": 0.00031467966284846573, "loss": 5.0476, "mean_token_accuracy": 0.21020474880933762, "num_tokens": 99860135.0, "step": 57565 }, { "entropy": 5.900613403320312, "epoch": 4.479128574207353, "grad_norm": 1.484375, "learning_rate": 0.0003146523813518468, "loss": 4.9215, "mean_token_accuracy": 0.21814577877521515, "num_tokens": 99868387.0, "step": 57570 }, { "entropy": 5.831220865249634, "epoch": 4.47951760357907, "grad_norm": 1.4140625, "learning_rate": 0.00031462509925356616, "loss": 4.9402, "mean_token_accuracy": 0.216188283264637, "num_tokens": 99877579.0, "step": 57575 }, { "entropy": 5.828810310363769, "epoch": 4.4799066329507875, "grad_norm": 1.421875, "learning_rate": 0.00031459781655403756, "loss": 4.9181, "mean_token_accuracy": 0.2165072366595268, "num_tokens": 99886167.0, "step": 57580 }, { "entropy": 5.8717223644256595, "epoch": 4.480295662322505, "grad_norm": 1.40625, "learning_rate": 0.0003145705332536752, "loss": 4.8439, "mean_token_accuracy": 0.22159151434898378, "num_tokens": 99894914.0, "step": 57585 }, { "entropy": 5.813878536224365, "epoch": 4.480684691694223, "grad_norm": 1.2890625, "learning_rate": 0.000314543249352893, "loss": 4.8574, "mean_token_accuracy": 0.21957215517759324, "num_tokens": 99904275.0, "step": 57590 }, { "entropy": 5.838156652450562, "epoch": 4.481073721065941, "grad_norm": 1.34375, "learning_rate": 0.00031451596485210486, "loss": 4.941, "mean_token_accuracy": 0.21323951631784438, "num_tokens": 99913566.0, "step": 57595 }, { "entropy": 5.875422048568725, "epoch": 4.481462750437658, "grad_norm": 1.453125, "learning_rate": 0.00031448867975172493, "loss": 4.9415, "mean_token_accuracy": 0.21095221638679504, "num_tokens": 99922582.0, "step": 57600 }, { "entropy": 5.827519512176513, "epoch": 4.481851779809376, "grad_norm": 1.5546875, "learning_rate": 0.00031446139405216713, "loss": 4.9452, "mean_token_accuracy": 0.2075935795903206, "num_tokens": 99931426.0, "step": 57605 }, { "entropy": 5.852397537231445, "epoch": 4.482240809181093, "grad_norm": 1.3828125, "learning_rate": 0.0003144341077538455, "loss": 4.9701, "mean_token_accuracy": 0.20843301713466644, "num_tokens": 99939726.0, "step": 57610 }, { "entropy": 5.807204532623291, "epoch": 4.4826298385528105, "grad_norm": 1.3359375, "learning_rate": 0.000314406820857174, "loss": 4.8686, "mean_token_accuracy": 0.2199338734149933, "num_tokens": 99948492.0, "step": 57615 }, { "entropy": 5.860810708999634, "epoch": 4.483018867924528, "grad_norm": 1.5, "learning_rate": 0.00031437953336256667, "loss": 4.8823, "mean_token_accuracy": 0.22088005393743515, "num_tokens": 99956577.0, "step": 57620 }, { "entropy": 5.841447496414185, "epoch": 4.483407897296246, "grad_norm": 1.46875, "learning_rate": 0.0003143522452704377, "loss": 5.0245, "mean_token_accuracy": 0.2072474867105484, "num_tokens": 99964896.0, "step": 57625 }, { "entropy": 5.960890388488769, "epoch": 4.483796926667964, "grad_norm": 1.359375, "learning_rate": 0.000314324956581201, "loss": 5.0066, "mean_token_accuracy": 0.20996006727218627, "num_tokens": 99973703.0, "step": 57630 }, { "entropy": 5.815118598937988, "epoch": 4.484185956039681, "grad_norm": 1.421875, "learning_rate": 0.0003142976672952707, "loss": 4.9094, "mean_token_accuracy": 0.21597819030284882, "num_tokens": 99982258.0, "step": 57635 }, { "entropy": 5.890868425369263, "epoch": 4.484574985411399, "grad_norm": 1.609375, "learning_rate": 0.00031427037741306083, "loss": 4.9341, "mean_token_accuracy": 0.2126392215490341, "num_tokens": 99990848.0, "step": 57640 }, { "entropy": 5.768831014633179, "epoch": 4.484964014783116, "grad_norm": 1.453125, "learning_rate": 0.0003142430869349855, "loss": 4.9124, "mean_token_accuracy": 0.21923135817050934, "num_tokens": 99999694.0, "step": 57645 }, { "entropy": 5.797782230377197, "epoch": 4.4853530441548335, "grad_norm": 1.296875, "learning_rate": 0.0003142157958614588, "loss": 4.951, "mean_token_accuracy": 0.2093740686774254, "num_tokens": 100008473.0, "step": 57650 }, { "entropy": 5.921360969543457, "epoch": 4.485742073526551, "grad_norm": 1.4375, "learning_rate": 0.0003141885041928948, "loss": 4.9171, "mean_token_accuracy": 0.21632418483495713, "num_tokens": 100016331.0, "step": 57655 }, { "entropy": 5.79804105758667, "epoch": 4.486131102898269, "grad_norm": 1.3984375, "learning_rate": 0.00031416121192970754, "loss": 4.8047, "mean_token_accuracy": 0.22692911475896835, "num_tokens": 100024506.0, "step": 57660 }, { "entropy": 5.799439525604248, "epoch": 4.486520132269987, "grad_norm": 1.5078125, "learning_rate": 0.00031413391907231133, "loss": 4.9335, "mean_token_accuracy": 0.21350111216306686, "num_tokens": 100032585.0, "step": 57665 }, { "entropy": 5.770336437225342, "epoch": 4.486909161641704, "grad_norm": 1.5078125, "learning_rate": 0.00031410662562112015, "loss": 4.8595, "mean_token_accuracy": 0.2197784185409546, "num_tokens": 100040763.0, "step": 57670 }, { "entropy": 5.905692672729492, "epoch": 4.487298191013421, "grad_norm": 1.4765625, "learning_rate": 0.00031407933157654816, "loss": 4.9824, "mean_token_accuracy": 0.2058960035443306, "num_tokens": 100049826.0, "step": 57675 }, { "entropy": 5.910783910751343, "epoch": 4.487687220385139, "grad_norm": 1.40625, "learning_rate": 0.0003140520369390095, "loss": 4.9403, "mean_token_accuracy": 0.21953096687793733, "num_tokens": 100058462.0, "step": 57680 }, { "entropy": 5.865838050842285, "epoch": 4.4880762497568565, "grad_norm": 1.5625, "learning_rate": 0.0003140247417089184, "loss": 4.957, "mean_token_accuracy": 0.21213608235120773, "num_tokens": 100067091.0, "step": 57685 }, { "entropy": 5.871687269210815, "epoch": 4.488465279128574, "grad_norm": 1.375, "learning_rate": 0.0003139974458866889, "loss": 5.0358, "mean_token_accuracy": 0.20642295926809312, "num_tokens": 100076272.0, "step": 57690 }, { "entropy": 5.903164196014404, "epoch": 4.488854308500292, "grad_norm": 1.328125, "learning_rate": 0.0003139701494727353, "loss": 5.0369, "mean_token_accuracy": 0.20966168940067292, "num_tokens": 100085333.0, "step": 57695 }, { "entropy": 5.855655145645142, "epoch": 4.48924333787201, "grad_norm": 1.421875, "learning_rate": 0.0003139428524674716, "loss": 4.8973, "mean_token_accuracy": 0.2242722675204277, "num_tokens": 100093768.0, "step": 57700 }, { "entropy": 5.860012245178223, "epoch": 4.489632367243727, "grad_norm": 1.390625, "learning_rate": 0.0003139155548713122, "loss": 5.011, "mean_token_accuracy": 0.2080511197447777, "num_tokens": 100102452.0, "step": 57705 }, { "entropy": 5.884925842285156, "epoch": 4.490021396615444, "grad_norm": 1.390625, "learning_rate": 0.00031388825668467115, "loss": 4.9207, "mean_token_accuracy": 0.21219970434904098, "num_tokens": 100110864.0, "step": 57710 }, { "entropy": 5.910635328292846, "epoch": 4.490410425987162, "grad_norm": 1.2734375, "learning_rate": 0.00031386095790796265, "loss": 5.0148, "mean_token_accuracy": 0.20813288539648056, "num_tokens": 100120772.0, "step": 57715 }, { "entropy": 5.914453172683716, "epoch": 4.4907994553588795, "grad_norm": 1.3828125, "learning_rate": 0.00031383365854160104, "loss": 4.973, "mean_token_accuracy": 0.21915349662303923, "num_tokens": 100129100.0, "step": 57720 }, { "entropy": 5.85779767036438, "epoch": 4.491188484730597, "grad_norm": 1.359375, "learning_rate": 0.0003138063585860005, "loss": 4.9304, "mean_token_accuracy": 0.21512189954519273, "num_tokens": 100137992.0, "step": 57725 }, { "entropy": 5.840049743652344, "epoch": 4.491577514102315, "grad_norm": 1.359375, "learning_rate": 0.0003137790580415752, "loss": 4.9349, "mean_token_accuracy": 0.21135170757770538, "num_tokens": 100146608.0, "step": 57730 }, { "entropy": 5.951354694366455, "epoch": 4.491966543474033, "grad_norm": 1.375, "learning_rate": 0.00031375175690873943, "loss": 5.0228, "mean_token_accuracy": 0.20399457067251206, "num_tokens": 100155050.0, "step": 57735 }, { "entropy": 5.857372570037842, "epoch": 4.49235557284575, "grad_norm": 1.4296875, "learning_rate": 0.00031372445518790737, "loss": 4.9309, "mean_token_accuracy": 0.2183433786034584, "num_tokens": 100164496.0, "step": 57740 }, { "entropy": 5.856878089904785, "epoch": 4.492744602217467, "grad_norm": 1.4453125, "learning_rate": 0.00031369715287949334, "loss": 5.0005, "mean_token_accuracy": 0.21057049036026002, "num_tokens": 100173076.0, "step": 57745 }, { "entropy": 5.834941577911377, "epoch": 4.493133631589185, "grad_norm": 1.4140625, "learning_rate": 0.00031366984998391163, "loss": 4.8842, "mean_token_accuracy": 0.22243731021881102, "num_tokens": 100181972.0, "step": 57750 }, { "entropy": 5.851762056350708, "epoch": 4.4935226609609025, "grad_norm": 1.28125, "learning_rate": 0.00031364254650157646, "loss": 4.9319, "mean_token_accuracy": 0.21694232672452926, "num_tokens": 100191017.0, "step": 57755 }, { "entropy": 5.813315439224243, "epoch": 4.49391169033262, "grad_norm": 1.421875, "learning_rate": 0.0003136152424329023, "loss": 4.7759, "mean_token_accuracy": 0.23202947229146959, "num_tokens": 100198852.0, "step": 57760 }, { "entropy": 5.823428201675415, "epoch": 4.494300719704338, "grad_norm": 1.4609375, "learning_rate": 0.0003135879377783032, "loss": 4.9751, "mean_token_accuracy": 0.20778681784868241, "num_tokens": 100207477.0, "step": 57765 }, { "entropy": 5.880980491638184, "epoch": 4.494689749076056, "grad_norm": 1.5390625, "learning_rate": 0.00031356063253819354, "loss": 4.9548, "mean_token_accuracy": 0.2158778950572014, "num_tokens": 100215426.0, "step": 57770 }, { "entropy": 5.814322519302368, "epoch": 4.495078778447773, "grad_norm": 1.7890625, "learning_rate": 0.0003135333267129877, "loss": 4.8701, "mean_token_accuracy": 0.22320742011070252, "num_tokens": 100224511.0, "step": 57775 }, { "entropy": 5.777116870880127, "epoch": 4.49546780781949, "grad_norm": 1.328125, "learning_rate": 0.0003135060203030999, "loss": 4.8868, "mean_token_accuracy": 0.2197798252105713, "num_tokens": 100232925.0, "step": 57780 }, { "entropy": 5.888576507568359, "epoch": 4.495856837191208, "grad_norm": 1.3515625, "learning_rate": 0.00031347871330894464, "loss": 5.0391, "mean_token_accuracy": 0.20857494324445724, "num_tokens": 100242140.0, "step": 57785 }, { "entropy": 5.909078788757324, "epoch": 4.4962458665629255, "grad_norm": 1.4375, "learning_rate": 0.000313451405730936, "loss": 4.9672, "mean_token_accuracy": 0.2109681785106659, "num_tokens": 100250431.0, "step": 57790 }, { "entropy": 5.920571422576904, "epoch": 4.496634895934643, "grad_norm": 1.4609375, "learning_rate": 0.0003134240975694886, "loss": 5.0172, "mean_token_accuracy": 0.21439069211483003, "num_tokens": 100259117.0, "step": 57795 }, { "entropy": 5.883169174194336, "epoch": 4.497023925306361, "grad_norm": 1.4140625, "learning_rate": 0.00031339678882501667, "loss": 4.9425, "mean_token_accuracy": 0.21548188328742982, "num_tokens": 100267273.0, "step": 57800 }, { "entropy": 5.883789873123169, "epoch": 4.497412954678079, "grad_norm": 1.5546875, "learning_rate": 0.00031336947949793455, "loss": 4.9058, "mean_token_accuracy": 0.2193266823887825, "num_tokens": 100276091.0, "step": 57805 }, { "entropy": 5.893096494674682, "epoch": 4.497801984049795, "grad_norm": 1.359375, "learning_rate": 0.00031334216958865663, "loss": 4.8374, "mean_token_accuracy": 0.22568663954734802, "num_tokens": 100284697.0, "step": 57810 }, { "entropy": 5.89234504699707, "epoch": 4.498191013421513, "grad_norm": 1.4140625, "learning_rate": 0.00031331485909759734, "loss": 4.8698, "mean_token_accuracy": 0.21942313611507416, "num_tokens": 100292851.0, "step": 57815 }, { "entropy": 5.892862367630005, "epoch": 4.498580042793231, "grad_norm": 1.3828125, "learning_rate": 0.000313287548025171, "loss": 5.0352, "mean_token_accuracy": 0.2093367725610733, "num_tokens": 100301708.0, "step": 57820 }, { "entropy": 5.857749319076538, "epoch": 4.4989690721649485, "grad_norm": 1.265625, "learning_rate": 0.0003132602363717921, "loss": 4.9425, "mean_token_accuracy": 0.2124334454536438, "num_tokens": 100311203.0, "step": 57825 }, { "entropy": 5.845761299133301, "epoch": 4.499358101536666, "grad_norm": 1.46875, "learning_rate": 0.00031323292413787504, "loss": 4.918, "mean_token_accuracy": 0.22336983382701875, "num_tokens": 100320186.0, "step": 57830 }, { "entropy": 5.888300800323487, "epoch": 4.499747130908384, "grad_norm": 1.265625, "learning_rate": 0.0003132056113238341, "loss": 4.9609, "mean_token_accuracy": 0.21514641046524047, "num_tokens": 100329427.0, "step": 57835 }, { "entropy": 5.930241107940674, "epoch": 4.5001361602801015, "grad_norm": 1.3984375, "learning_rate": 0.00031317829793008403, "loss": 4.9834, "mean_token_accuracy": 0.21478995233774184, "num_tokens": 100338147.0, "step": 57840 }, { "entropy": 5.768954944610596, "epoch": 4.500525189651818, "grad_norm": 1.515625, "learning_rate": 0.0003131509839570389, "loss": 4.8572, "mean_token_accuracy": 0.21769253611564637, "num_tokens": 100346762.0, "step": 57845 }, { "entropy": 5.85191125869751, "epoch": 4.500914219023536, "grad_norm": 1.421875, "learning_rate": 0.00031312366940511327, "loss": 4.9584, "mean_token_accuracy": 0.21671951860189437, "num_tokens": 100355302.0, "step": 57850 }, { "entropy": 5.923528051376342, "epoch": 4.501303248395254, "grad_norm": 1.4296875, "learning_rate": 0.0003130963542747217, "loss": 4.947, "mean_token_accuracy": 0.21806734204292297, "num_tokens": 100363595.0, "step": 57855 }, { "entropy": 5.815790891647339, "epoch": 4.5016922777669715, "grad_norm": 1.3515625, "learning_rate": 0.00031306903856627866, "loss": 4.8827, "mean_token_accuracy": 0.21580542623996735, "num_tokens": 100372885.0, "step": 57860 }, { "entropy": 5.863810682296753, "epoch": 4.502081307138689, "grad_norm": 1.4765625, "learning_rate": 0.00031304172228019845, "loss": 4.8957, "mean_token_accuracy": 0.22517270147800444, "num_tokens": 100380829.0, "step": 57865 }, { "entropy": 5.842498636245727, "epoch": 4.502470336510407, "grad_norm": 1.3046875, "learning_rate": 0.00031301440541689577, "loss": 4.9372, "mean_token_accuracy": 0.21981606781482696, "num_tokens": 100390282.0, "step": 57870 }, { "entropy": 5.81997389793396, "epoch": 4.502859365882124, "grad_norm": 1.4765625, "learning_rate": 0.0003129870879767849, "loss": 4.8859, "mean_token_accuracy": 0.2159394919872284, "num_tokens": 100398544.0, "step": 57875 }, { "entropy": 5.907523727416992, "epoch": 4.503248395253841, "grad_norm": 1.390625, "learning_rate": 0.0003129597699602804, "loss": 5.0198, "mean_token_accuracy": 0.2165328413248062, "num_tokens": 100407420.0, "step": 57880 }, { "entropy": 5.7998692989349365, "epoch": 4.503637424625559, "grad_norm": 1.234375, "learning_rate": 0.0003129324513677969, "loss": 4.8335, "mean_token_accuracy": 0.22802205234766007, "num_tokens": 100416691.0, "step": 57885 }, { "entropy": 5.889222192764282, "epoch": 4.504026453997277, "grad_norm": 1.4765625, "learning_rate": 0.00031290513219974875, "loss": 4.8931, "mean_token_accuracy": 0.21896199136972427, "num_tokens": 100424459.0, "step": 57890 }, { "entropy": 5.893585872650147, "epoch": 4.504415483368994, "grad_norm": 1.375, "learning_rate": 0.00031287781245655064, "loss": 4.9854, "mean_token_accuracy": 0.21434388905763627, "num_tokens": 100432437.0, "step": 57895 }, { "entropy": 5.874051189422607, "epoch": 4.504804512740712, "grad_norm": 1.375, "learning_rate": 0.000312850492138617, "loss": 4.9736, "mean_token_accuracy": 0.21271952390670776, "num_tokens": 100441726.0, "step": 57900 }, { "entropy": 5.899984645843506, "epoch": 4.50519354211243, "grad_norm": 1.421875, "learning_rate": 0.0003128231712463623, "loss": 5.0104, "mean_token_accuracy": 0.21008401811122895, "num_tokens": 100450181.0, "step": 57905 }, { "entropy": 5.790151739120484, "epoch": 4.5055825714841475, "grad_norm": 1.3359375, "learning_rate": 0.0003127958497802012, "loss": 4.8227, "mean_token_accuracy": 0.2153690680861473, "num_tokens": 100458693.0, "step": 57910 }, { "entropy": 5.904143285751343, "epoch": 4.505971600855864, "grad_norm": 1.4375, "learning_rate": 0.0003127685277405483, "loss": 5.0409, "mean_token_accuracy": 0.20803707391023635, "num_tokens": 100467163.0, "step": 57915 }, { "entropy": 5.925388622283935, "epoch": 4.506360630227582, "grad_norm": 1.5546875, "learning_rate": 0.00031274120512781806, "loss": 4.9972, "mean_token_accuracy": 0.21088217496871947, "num_tokens": 100475546.0, "step": 57920 }, { "entropy": 5.924038553237915, "epoch": 4.5067496595993, "grad_norm": 1.375, "learning_rate": 0.0003127138819424252, "loss": 4.9877, "mean_token_accuracy": 0.21048192530870438, "num_tokens": 100484075.0, "step": 57925 }, { "entropy": 5.977309274673462, "epoch": 4.507138688971017, "grad_norm": 1.453125, "learning_rate": 0.0003126865581847841, "loss": 5.0834, "mean_token_accuracy": 0.20048573911190032, "num_tokens": 100492630.0, "step": 57930 }, { "entropy": 5.898220586776733, "epoch": 4.507527718342735, "grad_norm": 1.5, "learning_rate": 0.00031265923385530943, "loss": 4.9748, "mean_token_accuracy": 0.213223372399807, "num_tokens": 100501389.0, "step": 57935 }, { "entropy": 5.859931516647339, "epoch": 4.507916747714452, "grad_norm": 1.375, "learning_rate": 0.0003126319089544159, "loss": 4.8861, "mean_token_accuracy": 0.22059128135442735, "num_tokens": 100510070.0, "step": 57940 }, { "entropy": 5.926222324371338, "epoch": 4.50830577708617, "grad_norm": 1.3984375, "learning_rate": 0.000312604583482518, "loss": 4.9975, "mean_token_accuracy": 0.21741771697998047, "num_tokens": 100518421.0, "step": 57945 }, { "entropy": 5.856549072265625, "epoch": 4.508694806457887, "grad_norm": 1.3828125, "learning_rate": 0.0003125772574400305, "loss": 4.9934, "mean_token_accuracy": 0.21920562535524368, "num_tokens": 100527314.0, "step": 57950 }, { "entropy": 5.854361581802368, "epoch": 4.509083835829605, "grad_norm": 1.3984375, "learning_rate": 0.0003125499308273679, "loss": 4.9185, "mean_token_accuracy": 0.21409669071435927, "num_tokens": 100535737.0, "step": 57955 }, { "entropy": 5.855248212814331, "epoch": 4.509472865201323, "grad_norm": 1.40625, "learning_rate": 0.00031252260364494477, "loss": 4.9078, "mean_token_accuracy": 0.21924584954977036, "num_tokens": 100543867.0, "step": 57960 }, { "entropy": 5.871595096588135, "epoch": 4.50986189457304, "grad_norm": 1.5078125, "learning_rate": 0.00031249527589317596, "loss": 5.0094, "mean_token_accuracy": 0.21125365793704987, "num_tokens": 100552633.0, "step": 57965 }, { "entropy": 5.8907605648040775, "epoch": 4.510250923944758, "grad_norm": 1.4921875, "learning_rate": 0.0003124679475724759, "loss": 4.9913, "mean_token_accuracy": 0.2145391270518303, "num_tokens": 100561842.0, "step": 57970 }, { "entropy": 5.914718246459961, "epoch": 4.510639953316476, "grad_norm": 1.6484375, "learning_rate": 0.0003124406186832595, "loss": 4.8969, "mean_token_accuracy": 0.22656373977661132, "num_tokens": 100569988.0, "step": 57975 }, { "entropy": 5.921739387512207, "epoch": 4.511028982688193, "grad_norm": 1.5078125, "learning_rate": 0.0003124132892259412, "loss": 4.9868, "mean_token_accuracy": 0.22258254289627075, "num_tokens": 100577795.0, "step": 57980 }, { "entropy": 5.802115869522095, "epoch": 4.51141801205991, "grad_norm": 1.3203125, "learning_rate": 0.00031238595920093584, "loss": 4.8594, "mean_token_accuracy": 0.21999442726373672, "num_tokens": 100586359.0, "step": 57985 }, { "entropy": 5.843461799621582, "epoch": 4.511807041431628, "grad_norm": 1.484375, "learning_rate": 0.00031235862860865807, "loss": 4.9569, "mean_token_accuracy": 0.21094732880592346, "num_tokens": 100595062.0, "step": 57990 }, { "entropy": 5.854473304748535, "epoch": 4.512196070803346, "grad_norm": 1.3984375, "learning_rate": 0.0003123312974495226, "loss": 4.9216, "mean_token_accuracy": 0.21433429121971131, "num_tokens": 100603606.0, "step": 57995 }, { "entropy": 5.92282509803772, "epoch": 4.512585100175063, "grad_norm": 1.3671875, "learning_rate": 0.00031230396572394406, "loss": 4.9302, "mean_token_accuracy": 0.2174785777926445, "num_tokens": 100611696.0, "step": 58000 }, { "entropy": 5.910829830169678, "epoch": 4.512974129546781, "grad_norm": 1.3125, "learning_rate": 0.0003122766334323372, "loss": 4.9439, "mean_token_accuracy": 0.22018830925226213, "num_tokens": 100620917.0, "step": 58005 }, { "entropy": 5.8818563461303714, "epoch": 4.513363158918498, "grad_norm": 1.390625, "learning_rate": 0.00031224930057511673, "loss": 4.9584, "mean_token_accuracy": 0.2209864839911461, "num_tokens": 100629226.0, "step": 58010 }, { "entropy": 5.779057312011719, "epoch": 4.513752188290216, "grad_norm": 1.4296875, "learning_rate": 0.0003122219671526974, "loss": 4.8105, "mean_token_accuracy": 0.22236605286598204, "num_tokens": 100637322.0, "step": 58015 }, { "entropy": 5.827506732940674, "epoch": 4.514141217661933, "grad_norm": 1.46875, "learning_rate": 0.00031219463316549406, "loss": 4.9098, "mean_token_accuracy": 0.22250427454710006, "num_tokens": 100646509.0, "step": 58020 }, { "entropy": 5.883781909942627, "epoch": 4.514530247033651, "grad_norm": 1.3125, "learning_rate": 0.00031216729861392137, "loss": 4.8986, "mean_token_accuracy": 0.21526462882757186, "num_tokens": 100654447.0, "step": 58025 }, { "entropy": 5.9213831424713135, "epoch": 4.514919276405369, "grad_norm": 1.4375, "learning_rate": 0.0003121399634983941, "loss": 5.0771, "mean_token_accuracy": 0.2094537302851677, "num_tokens": 100663228.0, "step": 58030 }, { "entropy": 5.806017160415649, "epoch": 4.515308305777086, "grad_norm": 1.421875, "learning_rate": 0.00031211262781932693, "loss": 4.9033, "mean_token_accuracy": 0.2223345384001732, "num_tokens": 100671533.0, "step": 58035 }, { "entropy": 5.860323190689087, "epoch": 4.515697335148804, "grad_norm": 1.3984375, "learning_rate": 0.00031208529157713465, "loss": 4.9489, "mean_token_accuracy": 0.2130352959036827, "num_tokens": 100679749.0, "step": 58040 }, { "entropy": 5.859959983825684, "epoch": 4.516086364520521, "grad_norm": 1.3984375, "learning_rate": 0.00031205795477223217, "loss": 4.911, "mean_token_accuracy": 0.21736120879650117, "num_tokens": 100688483.0, "step": 58045 }, { "entropy": 5.8430839538574215, "epoch": 4.516475393892239, "grad_norm": 1.3984375, "learning_rate": 0.00031203061740503414, "loss": 4.894, "mean_token_accuracy": 0.21769499778747559, "num_tokens": 100696747.0, "step": 58050 }, { "entropy": 5.885718297958374, "epoch": 4.516864423263956, "grad_norm": 1.421875, "learning_rate": 0.0003120032794759555, "loss": 4.9744, "mean_token_accuracy": 0.2181092843413353, "num_tokens": 100704900.0, "step": 58055 }, { "entropy": 5.87092080116272, "epoch": 4.517253452635674, "grad_norm": 1.3984375, "learning_rate": 0.000311975940985411, "loss": 4.9521, "mean_token_accuracy": 0.2041421115398407, "num_tokens": 100713745.0, "step": 58060 }, { "entropy": 5.85022292137146, "epoch": 4.517642482007392, "grad_norm": 1.40625, "learning_rate": 0.0003119486019338154, "loss": 4.9156, "mean_token_accuracy": 0.21923898607492448, "num_tokens": 100722537.0, "step": 58065 }, { "entropy": 5.905551958084106, "epoch": 4.518031511379109, "grad_norm": 1.375, "learning_rate": 0.00031192126232158367, "loss": 4.9669, "mean_token_accuracy": 0.21927570104598998, "num_tokens": 100730748.0, "step": 58070 }, { "entropy": 5.9061685562133786, "epoch": 4.518420540750826, "grad_norm": 1.4140625, "learning_rate": 0.0003118939221491305, "loss": 4.9887, "mean_token_accuracy": 0.20452854484319688, "num_tokens": 100738999.0, "step": 58075 }, { "entropy": 5.9243992328643795, "epoch": 4.518809570122544, "grad_norm": 1.4453125, "learning_rate": 0.0003118665814168707, "loss": 4.9786, "mean_token_accuracy": 0.2107895314693451, "num_tokens": 100747729.0, "step": 58080 }, { "entropy": 5.893810701370239, "epoch": 4.519198599494262, "grad_norm": 1.390625, "learning_rate": 0.00031183924012521925, "loss": 4.9789, "mean_token_accuracy": 0.21545276045799255, "num_tokens": 100755779.0, "step": 58085 }, { "entropy": 5.803054618835449, "epoch": 4.519587628865979, "grad_norm": 1.3359375, "learning_rate": 0.000311811898274591, "loss": 4.8425, "mean_token_accuracy": 0.22326964735984803, "num_tokens": 100764372.0, "step": 58090 }, { "entropy": 5.808957719802857, "epoch": 4.519976658237697, "grad_norm": 1.328125, "learning_rate": 0.00031178455586540076, "loss": 4.9499, "mean_token_accuracy": 0.21837408244609832, "num_tokens": 100773884.0, "step": 58095 }, { "entropy": 5.823459625244141, "epoch": 4.520365687609415, "grad_norm": 1.40625, "learning_rate": 0.00031175721289806345, "loss": 4.8644, "mean_token_accuracy": 0.2216634601354599, "num_tokens": 100783175.0, "step": 58100 }, { "entropy": 5.828511095046997, "epoch": 4.520754716981132, "grad_norm": 1.375, "learning_rate": 0.00031172986937299396, "loss": 4.9291, "mean_token_accuracy": 0.2161809489130974, "num_tokens": 100791956.0, "step": 58105 }, { "entropy": 5.881030082702637, "epoch": 4.52114374635285, "grad_norm": 1.4609375, "learning_rate": 0.00031170252529060715, "loss": 4.9297, "mean_token_accuracy": 0.21496340483427048, "num_tokens": 100800197.0, "step": 58110 }, { "entropy": 5.895401811599731, "epoch": 4.521532775724567, "grad_norm": 1.5390625, "learning_rate": 0.0003116751806513179, "loss": 4.9943, "mean_token_accuracy": 0.21107156276702882, "num_tokens": 100808658.0, "step": 58115 }, { "entropy": 5.806486654281616, "epoch": 4.521921805096285, "grad_norm": 1.421875, "learning_rate": 0.0003116478354555412, "loss": 4.8481, "mean_token_accuracy": 0.22433369755744934, "num_tokens": 100817640.0, "step": 58120 }, { "entropy": 5.956994295120239, "epoch": 4.522310834468002, "grad_norm": 1.625, "learning_rate": 0.00031162048970369196, "loss": 5.0734, "mean_token_accuracy": 0.21367547810077667, "num_tokens": 100826550.0, "step": 58125 }, { "entropy": 5.92390079498291, "epoch": 4.52269986383972, "grad_norm": 1.421875, "learning_rate": 0.000311593143396185, "loss": 4.9229, "mean_token_accuracy": 0.2167952075600624, "num_tokens": 100835725.0, "step": 58130 }, { "entropy": 5.744177436828613, "epoch": 4.523088893211438, "grad_norm": 1.3828125, "learning_rate": 0.00031156579653343543, "loss": 4.7396, "mean_token_accuracy": 0.22516141533851625, "num_tokens": 100843926.0, "step": 58135 }, { "entropy": 5.796554851531982, "epoch": 4.523477922583155, "grad_norm": 1.484375, "learning_rate": 0.000311538449115858, "loss": 4.8387, "mean_token_accuracy": 0.22058198153972625, "num_tokens": 100852580.0, "step": 58140 }, { "entropy": 5.855263614654541, "epoch": 4.523866951954872, "grad_norm": 1.40625, "learning_rate": 0.0003115111011438678, "loss": 4.8849, "mean_token_accuracy": 0.22500666230916977, "num_tokens": 100861026.0, "step": 58145 }, { "entropy": 5.872681951522827, "epoch": 4.52425598132659, "grad_norm": 1.546875, "learning_rate": 0.0003114837526178797, "loss": 4.9179, "mean_token_accuracy": 0.21567706018686295, "num_tokens": 100869959.0, "step": 58150 }, { "entropy": 5.924702453613281, "epoch": 4.524645010698308, "grad_norm": 1.390625, "learning_rate": 0.0003114564035383088, "loss": 5.0541, "mean_token_accuracy": 0.20988839566707612, "num_tokens": 100879448.0, "step": 58155 }, { "entropy": 5.837143516540527, "epoch": 4.525034040070025, "grad_norm": 1.359375, "learning_rate": 0.00031142905390556995, "loss": 4.862, "mean_token_accuracy": 0.22447603046894074, "num_tokens": 100888111.0, "step": 58160 }, { "entropy": 5.785494661331176, "epoch": 4.525423069441743, "grad_norm": 1.421875, "learning_rate": 0.0003114017037200782, "loss": 4.8625, "mean_token_accuracy": 0.21931740641593933, "num_tokens": 100897305.0, "step": 58165 }, { "entropy": 5.793621397018432, "epoch": 4.525812098813461, "grad_norm": 1.421875, "learning_rate": 0.00031137435298224863, "loss": 4.8859, "mean_token_accuracy": 0.22509240806102754, "num_tokens": 100906239.0, "step": 58170 }, { "entropy": 5.8638897895812985, "epoch": 4.526201128185178, "grad_norm": 1.375, "learning_rate": 0.0003113470016924961, "loss": 4.8742, "mean_token_accuracy": 0.22280639857053758, "num_tokens": 100914579.0, "step": 58175 }, { "entropy": 5.882165050506591, "epoch": 4.526590157556895, "grad_norm": 1.4140625, "learning_rate": 0.00031131964985123555, "loss": 4.8692, "mean_token_accuracy": 0.21803976595401764, "num_tokens": 100923291.0, "step": 58180 }, { "entropy": 5.8413878917694095, "epoch": 4.526979186928613, "grad_norm": 1.3046875, "learning_rate": 0.0003112922974588822, "loss": 4.8776, "mean_token_accuracy": 0.21793405413627626, "num_tokens": 100932077.0, "step": 58185 }, { "entropy": 5.954155731201172, "epoch": 4.527368216300331, "grad_norm": 1.3359375, "learning_rate": 0.000311264944515851, "loss": 5.0522, "mean_token_accuracy": 0.20982412695884706, "num_tokens": 100941565.0, "step": 58190 }, { "entropy": 5.9046008586883545, "epoch": 4.527757245672048, "grad_norm": 1.3984375, "learning_rate": 0.00031123759102255714, "loss": 4.9816, "mean_token_accuracy": 0.21635877043008805, "num_tokens": 100950098.0, "step": 58195 }, { "entropy": 5.829088258743286, "epoch": 4.528146275043766, "grad_norm": 1.4453125, "learning_rate": 0.0003112102369794153, "loss": 4.8684, "mean_token_accuracy": 0.22055758833885192, "num_tokens": 100958496.0, "step": 58200 }, { "entropy": 5.762178134918213, "epoch": 4.528535304415484, "grad_norm": 1.4375, "learning_rate": 0.00031118288238684086, "loss": 4.8808, "mean_token_accuracy": 0.21818768382072448, "num_tokens": 100967592.0, "step": 58205 }, { "entropy": 5.9116922378540036, "epoch": 4.5289243337872005, "grad_norm": 1.5625, "learning_rate": 0.0003111555272452486, "loss": 5.0417, "mean_token_accuracy": 0.2124434843659401, "num_tokens": 100976404.0, "step": 58210 }, { "entropy": 5.920695972442627, "epoch": 4.529313363158918, "grad_norm": 1.3828125, "learning_rate": 0.00031112817155505394, "loss": 4.9825, "mean_token_accuracy": 0.2096927985548973, "num_tokens": 100984499.0, "step": 58215 }, { "entropy": 5.871499395370483, "epoch": 4.529702392530636, "grad_norm": 1.375, "learning_rate": 0.00031110081531667184, "loss": 4.8426, "mean_token_accuracy": 0.2221081241965294, "num_tokens": 100993420.0, "step": 58220 }, { "entropy": 5.783553838729858, "epoch": 4.530091421902354, "grad_norm": 1.3203125, "learning_rate": 0.00031107345853051714, "loss": 4.836, "mean_token_accuracy": 0.21702542454004287, "num_tokens": 101003108.0, "step": 58225 }, { "entropy": 5.860838937759399, "epoch": 4.530480451274071, "grad_norm": 1.3046875, "learning_rate": 0.00031104610119700525, "loss": 4.9881, "mean_token_accuracy": 0.20956325381994248, "num_tokens": 101012103.0, "step": 58230 }, { "entropy": 5.913282775878907, "epoch": 4.530869480645789, "grad_norm": 1.28125, "learning_rate": 0.0003110187433165511, "loss": 5.0122, "mean_token_accuracy": 0.21530283838510514, "num_tokens": 101021529.0, "step": 58235 }, { "entropy": 5.947418117523194, "epoch": 4.531258510017507, "grad_norm": 1.4921875, "learning_rate": 0.0003109913848895699, "loss": 5.0044, "mean_token_accuracy": 0.21252587884664537, "num_tokens": 101030657.0, "step": 58240 }, { "entropy": 5.779807233810425, "epoch": 4.531647539389224, "grad_norm": 1.4140625, "learning_rate": 0.0003109640259164766, "loss": 4.8009, "mean_token_accuracy": 0.22678810209035874, "num_tokens": 101038715.0, "step": 58245 }, { "entropy": 5.758349227905273, "epoch": 4.532036568760941, "grad_norm": 1.359375, "learning_rate": 0.00031093666639768654, "loss": 4.9245, "mean_token_accuracy": 0.2178892970085144, "num_tokens": 101047318.0, "step": 58250 }, { "entropy": 5.817065334320068, "epoch": 4.532425598132659, "grad_norm": 1.46875, "learning_rate": 0.0003109093063336147, "loss": 4.7798, "mean_token_accuracy": 0.2341475874185562, "num_tokens": 101056677.0, "step": 58255 }, { "entropy": 5.911284446716309, "epoch": 4.532814627504377, "grad_norm": 1.453125, "learning_rate": 0.0003108819457246764, "loss": 4.9936, "mean_token_accuracy": 0.21537545472383499, "num_tokens": 101065734.0, "step": 58260 }, { "entropy": 5.863009214401245, "epoch": 4.533203656876094, "grad_norm": 1.328125, "learning_rate": 0.00031085458457128667, "loss": 4.8929, "mean_token_accuracy": 0.21274728327989578, "num_tokens": 101074795.0, "step": 58265 }, { "entropy": 5.855525636672974, "epoch": 4.533592686247812, "grad_norm": 1.3984375, "learning_rate": 0.00031082722287386065, "loss": 4.9572, "mean_token_accuracy": 0.21365399211645125, "num_tokens": 101083872.0, "step": 58270 }, { "entropy": 5.8965256690979, "epoch": 4.533981715619529, "grad_norm": 1.515625, "learning_rate": 0.0003107998606328135, "loss": 4.9886, "mean_token_accuracy": 0.20651938766241074, "num_tokens": 101091928.0, "step": 58275 }, { "entropy": 5.81881742477417, "epoch": 4.5343707449912465, "grad_norm": 1.484375, "learning_rate": 0.00031077249784856057, "loss": 4.8699, "mean_token_accuracy": 0.2182957038283348, "num_tokens": 101100740.0, "step": 58280 }, { "entropy": 5.7834474563598635, "epoch": 4.534759774362964, "grad_norm": 1.390625, "learning_rate": 0.00031074513452151683, "loss": 4.9055, "mean_token_accuracy": 0.21734257489442826, "num_tokens": 101108766.0, "step": 58285 }, { "entropy": 5.812333297729492, "epoch": 4.535148803734682, "grad_norm": 1.4453125, "learning_rate": 0.0003107177706520975, "loss": 4.9386, "mean_token_accuracy": 0.22147903442382813, "num_tokens": 101118491.0, "step": 58290 }, { "entropy": 5.835483551025391, "epoch": 4.5355378331064, "grad_norm": 1.4921875, "learning_rate": 0.000310690406240718, "loss": 4.884, "mean_token_accuracy": 0.21727225184440613, "num_tokens": 101126550.0, "step": 58295 }, { "entropy": 5.880503463745117, "epoch": 4.535926862478117, "grad_norm": 1.359375, "learning_rate": 0.00031066304128779336, "loss": 4.9846, "mean_token_accuracy": 0.2176012232899666, "num_tokens": 101134812.0, "step": 58300 }, { "entropy": 5.8562592506408695, "epoch": 4.536315891849835, "grad_norm": 1.4921875, "learning_rate": 0.00031063567579373876, "loss": 4.9836, "mean_token_accuracy": 0.21185854971408843, "num_tokens": 101142845.0, "step": 58305 }, { "entropy": 5.884139347076416, "epoch": 4.536704921221553, "grad_norm": 1.4609375, "learning_rate": 0.00031060830975896954, "loss": 4.9788, "mean_token_accuracy": 0.20779469460248948, "num_tokens": 101151540.0, "step": 58310 }, { "entropy": 5.84848985671997, "epoch": 4.5370939505932695, "grad_norm": 1.3359375, "learning_rate": 0.00031058094318390085, "loss": 4.9289, "mean_token_accuracy": 0.21699528396129608, "num_tokens": 101159764.0, "step": 58315 }, { "entropy": 5.923594760894775, "epoch": 4.537482979964987, "grad_norm": 1.46875, "learning_rate": 0.00031055357606894806, "loss": 5.0297, "mean_token_accuracy": 0.21065307408571243, "num_tokens": 101168054.0, "step": 58320 }, { "entropy": 5.869775056838989, "epoch": 4.537872009336705, "grad_norm": 1.390625, "learning_rate": 0.0003105262084145263, "loss": 4.9883, "mean_token_accuracy": 0.20964918434619903, "num_tokens": 101176815.0, "step": 58325 }, { "entropy": 5.883952856063843, "epoch": 4.538261038708423, "grad_norm": 1.3671875, "learning_rate": 0.0003104988402210509, "loss": 4.9029, "mean_token_accuracy": 0.21768493205308914, "num_tokens": 101185484.0, "step": 58330 }, { "entropy": 5.8145444869995115, "epoch": 4.53865006808014, "grad_norm": 1.2109375, "learning_rate": 0.0003104714714889371, "loss": 4.8643, "mean_token_accuracy": 0.21995907872915268, "num_tokens": 101194905.0, "step": 58335 }, { "entropy": 5.899773979187012, "epoch": 4.539039097451858, "grad_norm": 1.515625, "learning_rate": 0.00031044410221860017, "loss": 5.0468, "mean_token_accuracy": 0.21202611029148102, "num_tokens": 101203421.0, "step": 58340 }, { "entropy": 5.83873815536499, "epoch": 4.539428126823575, "grad_norm": 1.328125, "learning_rate": 0.0003104167324104553, "loss": 4.9298, "mean_token_accuracy": 0.21335465759038924, "num_tokens": 101212394.0, "step": 58345 }, { "entropy": 5.903724908828735, "epoch": 4.5398171561952925, "grad_norm": 1.3359375, "learning_rate": 0.00031038936206491803, "loss": 5.0442, "mean_token_accuracy": 0.2073572799563408, "num_tokens": 101221824.0, "step": 58350 }, { "entropy": 5.88370156288147, "epoch": 4.54020618556701, "grad_norm": 1.40625, "learning_rate": 0.0003103619911824035, "loss": 5.0673, "mean_token_accuracy": 0.20669754445552826, "num_tokens": 101230585.0, "step": 58355 }, { "entropy": 5.91273865699768, "epoch": 4.540595214938728, "grad_norm": 1.40625, "learning_rate": 0.000310334619763327, "loss": 4.9095, "mean_token_accuracy": 0.218979874253273, "num_tokens": 101239414.0, "step": 58360 }, { "entropy": 5.826918506622315, "epoch": 4.540984244310446, "grad_norm": 1.296875, "learning_rate": 0.00031030724780810385, "loss": 4.8559, "mean_token_accuracy": 0.21990637481212616, "num_tokens": 101248737.0, "step": 58365 }, { "entropy": 5.830650472640992, "epoch": 4.541373273682163, "grad_norm": 1.328125, "learning_rate": 0.00031027987531714944, "loss": 4.9243, "mean_token_accuracy": 0.21583479195833205, "num_tokens": 101258072.0, "step": 58370 }, { "entropy": 5.823217821121216, "epoch": 4.541762303053881, "grad_norm": 1.3828125, "learning_rate": 0.00031025250229087915, "loss": 4.8503, "mean_token_accuracy": 0.21941641718149185, "num_tokens": 101266313.0, "step": 58375 }, { "entropy": 5.86814603805542, "epoch": 4.542151332425598, "grad_norm": 1.4375, "learning_rate": 0.00031022512872970823, "loss": 4.9207, "mean_token_accuracy": 0.21568110287189485, "num_tokens": 101276048.0, "step": 58380 }, { "entropy": 5.962202501296997, "epoch": 4.5425403617973155, "grad_norm": 1.4765625, "learning_rate": 0.000310197754634052, "loss": 4.9726, "mean_token_accuracy": 0.2142393782734871, "num_tokens": 101284069.0, "step": 58385 }, { "entropy": 5.776888036727906, "epoch": 4.542929391169033, "grad_norm": 1.359375, "learning_rate": 0.0003101703800043258, "loss": 4.8433, "mean_token_accuracy": 0.22271857410669327, "num_tokens": 101292383.0, "step": 58390 }, { "entropy": 5.8698859214782715, "epoch": 4.543318420540751, "grad_norm": 1.3828125, "learning_rate": 0.00031014300484094516, "loss": 4.9379, "mean_token_accuracy": 0.22114599943161012, "num_tokens": 101300862.0, "step": 58395 }, { "entropy": 5.8967043399810795, "epoch": 4.5437074499124686, "grad_norm": 1.4765625, "learning_rate": 0.0003101156291443254, "loss": 5.0344, "mean_token_accuracy": 0.2017960414290428, "num_tokens": 101309583.0, "step": 58400 }, { "entropy": 5.927649784088135, "epoch": 4.544096479284186, "grad_norm": 1.328125, "learning_rate": 0.0003100882529148817, "loss": 5.0131, "mean_token_accuracy": 0.2143144354224205, "num_tokens": 101318568.0, "step": 58405 }, { "entropy": 5.848814487457275, "epoch": 4.544485508655903, "grad_norm": 1.3984375, "learning_rate": 0.00031006087615302976, "loss": 4.9438, "mean_token_accuracy": 0.21811138838529587, "num_tokens": 101326871.0, "step": 58410 }, { "entropy": 5.844626140594483, "epoch": 4.544874538027621, "grad_norm": 1.421875, "learning_rate": 0.00031003349885918473, "loss": 4.9505, "mean_token_accuracy": 0.2105268955230713, "num_tokens": 101334943.0, "step": 58415 }, { "entropy": 5.824334621429443, "epoch": 4.5452635673993385, "grad_norm": 1.578125, "learning_rate": 0.00031000612103376226, "loss": 4.9566, "mean_token_accuracy": 0.2158386752009392, "num_tokens": 101343905.0, "step": 58420 }, { "entropy": 5.823037719726562, "epoch": 4.545652596771056, "grad_norm": 1.4296875, "learning_rate": 0.0003099787426771775, "loss": 4.8978, "mean_token_accuracy": 0.21887197643518447, "num_tokens": 101352665.0, "step": 58425 }, { "entropy": 5.871459054946899, "epoch": 4.546041626142774, "grad_norm": 1.640625, "learning_rate": 0.000309951363789846, "loss": 4.8906, "mean_token_accuracy": 0.2206596091389656, "num_tokens": 101360802.0, "step": 58430 }, { "entropy": 5.933388710021973, "epoch": 4.5464306555144915, "grad_norm": 1.3046875, "learning_rate": 0.00030992398437218314, "loss": 5.0291, "mean_token_accuracy": 0.2085282415151596, "num_tokens": 101370641.0, "step": 58435 }, { "entropy": 5.924195146560669, "epoch": 4.546819684886209, "grad_norm": 1.4375, "learning_rate": 0.0003098966044246045, "loss": 4.9619, "mean_token_accuracy": 0.21781107932329177, "num_tokens": 101378409.0, "step": 58440 }, { "entropy": 5.879655599594116, "epoch": 4.547208714257927, "grad_norm": 1.4296875, "learning_rate": 0.00030986922394752534, "loss": 4.8941, "mean_token_accuracy": 0.22063378393650054, "num_tokens": 101387563.0, "step": 58445 }, { "entropy": 5.816765165328979, "epoch": 4.547597743629644, "grad_norm": 1.4609375, "learning_rate": 0.00030984184294136134, "loss": 4.9116, "mean_token_accuracy": 0.21616096794605255, "num_tokens": 101395863.0, "step": 58450 }, { "entropy": 5.831791639328003, "epoch": 4.5479867730013614, "grad_norm": 1.328125, "learning_rate": 0.00030981446140652773, "loss": 4.9985, "mean_token_accuracy": 0.2230788916349411, "num_tokens": 101405409.0, "step": 58455 }, { "entropy": 5.846444511413575, "epoch": 4.548375802373079, "grad_norm": 1.5234375, "learning_rate": 0.00030978707934344014, "loss": 4.8939, "mean_token_accuracy": 0.22271572798490524, "num_tokens": 101412966.0, "step": 58460 }, { "entropy": 5.908572196960449, "epoch": 4.548764831744797, "grad_norm": 1.5390625, "learning_rate": 0.000309759696752514, "loss": 4.9921, "mean_token_accuracy": 0.21496331095695495, "num_tokens": 101421467.0, "step": 58465 }, { "entropy": 5.913785934448242, "epoch": 4.5491538611165145, "grad_norm": 1.6015625, "learning_rate": 0.0003097323136341647, "loss": 5.0362, "mean_token_accuracy": 0.20597818344831467, "num_tokens": 101429895.0, "step": 58470 }, { "entropy": 5.818385791778565, "epoch": 4.549542890488232, "grad_norm": 1.2734375, "learning_rate": 0.0003097049299888078, "loss": 4.8966, "mean_token_accuracy": 0.21868670284748076, "num_tokens": 101438558.0, "step": 58475 }, { "entropy": 5.898043584823609, "epoch": 4.549931919859949, "grad_norm": 1.421875, "learning_rate": 0.0003096775458168589, "loss": 4.9827, "mean_token_accuracy": 0.21208728104829788, "num_tokens": 101448008.0, "step": 58480 }, { "entropy": 5.8980213642120365, "epoch": 4.550320949231667, "grad_norm": 1.4609375, "learning_rate": 0.00030965016111873345, "loss": 4.9563, "mean_token_accuracy": 0.22232669740915298, "num_tokens": 101456341.0, "step": 58485 }, { "entropy": 5.859683179855347, "epoch": 4.550709978603384, "grad_norm": 1.4140625, "learning_rate": 0.00030962277589484697, "loss": 4.9169, "mean_token_accuracy": 0.21831205040216445, "num_tokens": 101464511.0, "step": 58490 }, { "entropy": 5.844459676742554, "epoch": 4.551099007975102, "grad_norm": 1.390625, "learning_rate": 0.00030959539014561494, "loss": 5.005, "mean_token_accuracy": 0.21357445865869523, "num_tokens": 101473691.0, "step": 58495 }, { "entropy": 5.9011626720428465, "epoch": 4.55148803734682, "grad_norm": 1.3359375, "learning_rate": 0.00030956800387145294, "loss": 4.9824, "mean_token_accuracy": 0.20818631649017333, "num_tokens": 101482450.0, "step": 58500 }, { "entropy": 5.88055272102356, "epoch": 4.5518770667185375, "grad_norm": 1.453125, "learning_rate": 0.00030954061707277647, "loss": 4.9505, "mean_token_accuracy": 0.21042079478502274, "num_tokens": 101490787.0, "step": 58505 }, { "entropy": 5.886212587356567, "epoch": 4.552266096090255, "grad_norm": 1.359375, "learning_rate": 0.0003095132297500011, "loss": 4.9936, "mean_token_accuracy": 0.2148319289088249, "num_tokens": 101499006.0, "step": 58510 }, { "entropy": 5.8386070251464846, "epoch": 4.552655125461972, "grad_norm": 1.5078125, "learning_rate": 0.00030948584190354246, "loss": 4.9277, "mean_token_accuracy": 0.22053608298301697, "num_tokens": 101506893.0, "step": 58515 }, { "entropy": 5.845263576507568, "epoch": 4.55304415483369, "grad_norm": 1.390625, "learning_rate": 0.000309458453533816, "loss": 4.8576, "mean_token_accuracy": 0.2227756932377815, "num_tokens": 101515957.0, "step": 58520 }, { "entropy": 5.9075737476348875, "epoch": 4.553433184205407, "grad_norm": 1.390625, "learning_rate": 0.00030943106464123744, "loss": 4.9077, "mean_token_accuracy": 0.22161872535943986, "num_tokens": 101524835.0, "step": 58525 }, { "entropy": 5.857297801971436, "epoch": 4.553822213577125, "grad_norm": 1.3359375, "learning_rate": 0.00030940367522622224, "loss": 4.9141, "mean_token_accuracy": 0.21938364654779435, "num_tokens": 101533991.0, "step": 58530 }, { "entropy": 5.831418991088867, "epoch": 4.554211242948843, "grad_norm": 1.3671875, "learning_rate": 0.000309376285289186, "loss": 4.9165, "mean_token_accuracy": 0.2176990404725075, "num_tokens": 101542523.0, "step": 58535 }, { "entropy": 5.82796277999878, "epoch": 4.5546002723205605, "grad_norm": 1.4296875, "learning_rate": 0.00030934889483054433, "loss": 4.88, "mean_token_accuracy": 0.21640689224004744, "num_tokens": 101551030.0, "step": 58540 }, { "entropy": 5.849790096282959, "epoch": 4.554989301692277, "grad_norm": 1.390625, "learning_rate": 0.0003093215038507129, "loss": 4.9027, "mean_token_accuracy": 0.21625176668167115, "num_tokens": 101559585.0, "step": 58545 }, { "entropy": 5.870621824264527, "epoch": 4.555378331063995, "grad_norm": 1.46875, "learning_rate": 0.0003092941123501073, "loss": 4.9913, "mean_token_accuracy": 0.20585683286190032, "num_tokens": 101568463.0, "step": 58550 }, { "entropy": 5.83058123588562, "epoch": 4.555767360435713, "grad_norm": 1.2578125, "learning_rate": 0.00030926672032914306, "loss": 4.8617, "mean_token_accuracy": 0.2217983588576317, "num_tokens": 101578634.0, "step": 58555 }, { "entropy": 5.841203069686889, "epoch": 4.55615638980743, "grad_norm": 1.3046875, "learning_rate": 0.0003092393277882359, "loss": 4.9818, "mean_token_accuracy": 0.2127270519733429, "num_tokens": 101587824.0, "step": 58560 }, { "entropy": 5.861948871612549, "epoch": 4.556545419179148, "grad_norm": 1.4140625, "learning_rate": 0.00030921193472780144, "loss": 4.9084, "mean_token_accuracy": 0.21374761462211608, "num_tokens": 101596282.0, "step": 58565 }, { "entropy": 5.853651762008667, "epoch": 4.556934448550866, "grad_norm": 1.3203125, "learning_rate": 0.0003091845411482554, "loss": 4.9516, "mean_token_accuracy": 0.21788102388381958, "num_tokens": 101604948.0, "step": 58570 }, { "entropy": 5.943635511398315, "epoch": 4.5573234779225835, "grad_norm": 1.578125, "learning_rate": 0.00030915714705001323, "loss": 5.0307, "mean_token_accuracy": 0.20734666138887406, "num_tokens": 101612956.0, "step": 58575 }, { "entropy": 5.853701496124268, "epoch": 4.557712507294301, "grad_norm": 1.390625, "learning_rate": 0.0003091297524334908, "loss": 4.8699, "mean_token_accuracy": 0.21971311122179032, "num_tokens": 101621286.0, "step": 58580 }, { "entropy": 5.862766361236572, "epoch": 4.558101536666018, "grad_norm": 1.359375, "learning_rate": 0.0003091023572991036, "loss": 4.9373, "mean_token_accuracy": 0.20889503955841066, "num_tokens": 101630604.0, "step": 58585 }, { "entropy": 5.803920936584473, "epoch": 4.558490566037736, "grad_norm": 1.4140625, "learning_rate": 0.0003090749616472675, "loss": 4.878, "mean_token_accuracy": 0.21854050308465958, "num_tokens": 101639565.0, "step": 58590 }, { "entropy": 5.86069769859314, "epoch": 4.558879595409453, "grad_norm": 1.4921875, "learning_rate": 0.0003090475654783981, "loss": 4.9273, "mean_token_accuracy": 0.21249102354049682, "num_tokens": 101647865.0, "step": 58595 }, { "entropy": 5.913677930831909, "epoch": 4.559268624781171, "grad_norm": 1.390625, "learning_rate": 0.0003090201687929111, "loss": 5.02, "mean_token_accuracy": 0.20735414922237397, "num_tokens": 101656092.0, "step": 58600 }, { "entropy": 5.9105278015136715, "epoch": 4.559657654152889, "grad_norm": 1.4765625, "learning_rate": 0.00030899277159122213, "loss": 4.9382, "mean_token_accuracy": 0.21936075538396835, "num_tokens": 101664373.0, "step": 58605 }, { "entropy": 5.836515426635742, "epoch": 4.560046683524606, "grad_norm": 1.5625, "learning_rate": 0.00030896537387374703, "loss": 4.8513, "mean_token_accuracy": 0.22492991238832474, "num_tokens": 101672986.0, "step": 58610 }, { "entropy": 5.8848377704620365, "epoch": 4.560435712896323, "grad_norm": 1.5, "learning_rate": 0.00030893797564090136, "loss": 5.0616, "mean_token_accuracy": 0.20651084035634995, "num_tokens": 101682447.0, "step": 58615 }, { "entropy": 5.895258045196533, "epoch": 4.560824742268041, "grad_norm": 1.375, "learning_rate": 0.00030891057689310097, "loss": 4.9156, "mean_token_accuracy": 0.2162498876452446, "num_tokens": 101691511.0, "step": 58620 }, { "entropy": 5.971049690246582, "epoch": 4.561213771639759, "grad_norm": 1.390625, "learning_rate": 0.0003088831776307616, "loss": 4.9916, "mean_token_accuracy": 0.2121991589665413, "num_tokens": 101701148.0, "step": 58625 }, { "entropy": 5.910030889511108, "epoch": 4.561602801011476, "grad_norm": 1.375, "learning_rate": 0.00030885577785429885, "loss": 4.8905, "mean_token_accuracy": 0.22642982453107835, "num_tokens": 101709855.0, "step": 58630 }, { "entropy": 5.785369396209717, "epoch": 4.561991830383194, "grad_norm": 1.5390625, "learning_rate": 0.0003088283775641286, "loss": 4.9167, "mean_token_accuracy": 0.21749065369367598, "num_tokens": 101717944.0, "step": 58635 }, { "entropy": 5.833381319046021, "epoch": 4.562380859754912, "grad_norm": 1.4296875, "learning_rate": 0.00030880097676066646, "loss": 4.8852, "mean_token_accuracy": 0.2256601259112358, "num_tokens": 101726274.0, "step": 58640 }, { "entropy": 5.956249046325683, "epoch": 4.5627698891266295, "grad_norm": 1.3828125, "learning_rate": 0.0003087735754443285, "loss": 5.0507, "mean_token_accuracy": 0.2046538695693016, "num_tokens": 101735321.0, "step": 58645 }, { "entropy": 5.872423791885376, "epoch": 4.563158918498346, "grad_norm": 1.3046875, "learning_rate": 0.0003087461736155301, "loss": 4.927, "mean_token_accuracy": 0.2163055270910263, "num_tokens": 101744404.0, "step": 58650 }, { "entropy": 5.86171441078186, "epoch": 4.563547947870064, "grad_norm": 1.5703125, "learning_rate": 0.0003087187712746873, "loss": 4.8761, "mean_token_accuracy": 0.2203898772597313, "num_tokens": 101752459.0, "step": 58655 }, { "entropy": 5.908582544326782, "epoch": 4.563936977241782, "grad_norm": 1.390625, "learning_rate": 0.0003086913684222159, "loss": 4.9334, "mean_token_accuracy": 0.22251377254724503, "num_tokens": 101760777.0, "step": 58660 }, { "entropy": 5.871193695068359, "epoch": 4.564326006613499, "grad_norm": 1.4609375, "learning_rate": 0.0003086639650585315, "loss": 4.9336, "mean_token_accuracy": 0.21429730504751204, "num_tokens": 101769261.0, "step": 58665 }, { "entropy": 5.84931321144104, "epoch": 4.564715035985217, "grad_norm": 1.5078125, "learning_rate": 0.00030863656118405007, "loss": 4.941, "mean_token_accuracy": 0.20725203901529313, "num_tokens": 101777118.0, "step": 58670 }, { "entropy": 5.902321863174438, "epoch": 4.565104065356935, "grad_norm": 1.53125, "learning_rate": 0.00030860915679918724, "loss": 4.9518, "mean_token_accuracy": 0.21448885947465895, "num_tokens": 101785235.0, "step": 58675 }, { "entropy": 5.8392579555511475, "epoch": 4.565493094728652, "grad_norm": 1.421875, "learning_rate": 0.00030858175190435913, "loss": 4.9114, "mean_token_accuracy": 0.21795457303524018, "num_tokens": 101794107.0, "step": 58680 }, { "entropy": 5.907673931121826, "epoch": 4.565882124100369, "grad_norm": 1.4453125, "learning_rate": 0.0003085543464999813, "loss": 5.0277, "mean_token_accuracy": 0.20416492968797684, "num_tokens": 101802985.0, "step": 58685 }, { "entropy": 5.903494453430175, "epoch": 4.566271153472087, "grad_norm": 1.2890625, "learning_rate": 0.0003085269405864697, "loss": 4.9976, "mean_token_accuracy": 0.22158308029174806, "num_tokens": 101811441.0, "step": 58690 }, { "entropy": 5.856951332092285, "epoch": 4.566660182843805, "grad_norm": 1.2578125, "learning_rate": 0.0003084995341642401, "loss": 4.9286, "mean_token_accuracy": 0.21690763980150224, "num_tokens": 101820506.0, "step": 58695 }, { "entropy": 5.885605716705323, "epoch": 4.567049212215522, "grad_norm": 1.390625, "learning_rate": 0.0003084721272337084, "loss": 4.896, "mean_token_accuracy": 0.21254095882177354, "num_tokens": 101828854.0, "step": 58700 }, { "entropy": 5.923724222183227, "epoch": 4.56743824158724, "grad_norm": 1.484375, "learning_rate": 0.0003084447197952904, "loss": 5.0132, "mean_token_accuracy": 0.20872527360916138, "num_tokens": 101837891.0, "step": 58705 }, { "entropy": 5.939090156555176, "epoch": 4.567827270958958, "grad_norm": 1.3125, "learning_rate": 0.00030841731184940205, "loss": 4.9468, "mean_token_accuracy": 0.20979532301425935, "num_tokens": 101847000.0, "step": 58710 }, { "entropy": 5.933237743377686, "epoch": 4.568216300330675, "grad_norm": 1.5, "learning_rate": 0.00030838990339645915, "loss": 4.9828, "mean_token_accuracy": 0.21373697072267533, "num_tokens": 101855029.0, "step": 58715 }, { "entropy": 5.869204568862915, "epoch": 4.568605329702392, "grad_norm": 1.59375, "learning_rate": 0.00030836249443687774, "loss": 4.9967, "mean_token_accuracy": 0.22325721830129625, "num_tokens": 101864025.0, "step": 58720 }, { "entropy": 5.8278093338012695, "epoch": 4.56899435907411, "grad_norm": 1.421875, "learning_rate": 0.00030833508497107344, "loss": 4.8239, "mean_token_accuracy": 0.22656758278608322, "num_tokens": 101873051.0, "step": 58725 }, { "entropy": 5.887861919403076, "epoch": 4.569383388445828, "grad_norm": 1.59375, "learning_rate": 0.0003083076749994623, "loss": 4.8708, "mean_token_accuracy": 0.2163386896252632, "num_tokens": 101880745.0, "step": 58730 }, { "entropy": 5.941604471206665, "epoch": 4.569772417817545, "grad_norm": 1.5625, "learning_rate": 0.0003082802645224603, "loss": 4.9584, "mean_token_accuracy": 0.2195088595151901, "num_tokens": 101889026.0, "step": 58735 }, { "entropy": 5.922458124160767, "epoch": 4.570161447189263, "grad_norm": 1.4453125, "learning_rate": 0.0003082528535404832, "loss": 5.051, "mean_token_accuracy": 0.20273622274398803, "num_tokens": 101898511.0, "step": 58740 }, { "entropy": 5.926009750366211, "epoch": 4.57055047656098, "grad_norm": 1.390625, "learning_rate": 0.00030822544205394686, "loss": 5.0658, "mean_token_accuracy": 0.19863147288560867, "num_tokens": 101907416.0, "step": 58745 }, { "entropy": 5.93998155593872, "epoch": 4.570939505932698, "grad_norm": 1.3984375, "learning_rate": 0.00030819803006326745, "loss": 4.926, "mean_token_accuracy": 0.21361775547266007, "num_tokens": 101915927.0, "step": 58750 }, { "entropy": 5.9243086814880375, "epoch": 4.571328535304415, "grad_norm": 1.390625, "learning_rate": 0.00030817061756886077, "loss": 4.9783, "mean_token_accuracy": 0.20720042437314987, "num_tokens": 101924289.0, "step": 58755 }, { "entropy": 5.889846467971802, "epoch": 4.571717564676133, "grad_norm": 1.4140625, "learning_rate": 0.00030814320457114283, "loss": 4.9286, "mean_token_accuracy": 0.22068875432014465, "num_tokens": 101932718.0, "step": 58760 }, { "entropy": 5.846908950805664, "epoch": 4.572106594047851, "grad_norm": 1.4609375, "learning_rate": 0.00030811579107052937, "loss": 4.951, "mean_token_accuracy": 0.21074649095535278, "num_tokens": 101941263.0, "step": 58765 }, { "entropy": 5.858176612854004, "epoch": 4.572495623419568, "grad_norm": 1.4375, "learning_rate": 0.00030808837706743666, "loss": 4.9833, "mean_token_accuracy": 0.20837116092443467, "num_tokens": 101950444.0, "step": 58770 }, { "entropy": 5.958907604217529, "epoch": 4.572884652791286, "grad_norm": 1.4453125, "learning_rate": 0.0003080609625622803, "loss": 4.999, "mean_token_accuracy": 0.21396692991256713, "num_tokens": 101958783.0, "step": 58775 }, { "entropy": 5.916350412368774, "epoch": 4.573273682163004, "grad_norm": 1.3515625, "learning_rate": 0.00030803354755547653, "loss": 4.9237, "mean_token_accuracy": 0.2147844448685646, "num_tokens": 101967487.0, "step": 58780 }, { "entropy": 5.944613361358643, "epoch": 4.573662711534721, "grad_norm": 1.328125, "learning_rate": 0.0003080061320474412, "loss": 4.9827, "mean_token_accuracy": 0.2104666382074356, "num_tokens": 101976271.0, "step": 58785 }, { "entropy": 5.881683444976806, "epoch": 4.574051740906438, "grad_norm": 1.5546875, "learning_rate": 0.0003079787160385905, "loss": 4.9691, "mean_token_accuracy": 0.2149528980255127, "num_tokens": 101985468.0, "step": 58790 }, { "entropy": 5.913859033584595, "epoch": 4.574440770278156, "grad_norm": 1.390625, "learning_rate": 0.0003079512995293402, "loss": 5.0129, "mean_token_accuracy": 0.21033175736665727, "num_tokens": 101995729.0, "step": 58795 }, { "entropy": 5.978483486175537, "epoch": 4.574829799649874, "grad_norm": 1.3984375, "learning_rate": 0.0003079238825201064, "loss": 5.0345, "mean_token_accuracy": 0.2190748929977417, "num_tokens": 102005180.0, "step": 58800 }, { "entropy": 5.938677263259888, "epoch": 4.575218829021591, "grad_norm": 1.3984375, "learning_rate": 0.000307896465011305, "loss": 4.9673, "mean_token_accuracy": 0.2222595825791359, "num_tokens": 102013559.0, "step": 58805 }, { "entropy": 5.864674234390259, "epoch": 4.575607858393309, "grad_norm": 1.3125, "learning_rate": 0.00030786904700335217, "loss": 4.987, "mean_token_accuracy": 0.21454003751277922, "num_tokens": 102022108.0, "step": 58810 }, { "entropy": 5.82264666557312, "epoch": 4.575996887765026, "grad_norm": 1.453125, "learning_rate": 0.0003078416284966639, "loss": 4.9334, "mean_token_accuracy": 0.22037604302167893, "num_tokens": 102030658.0, "step": 58815 }, { "entropy": 5.842310857772827, "epoch": 4.576385917136744, "grad_norm": 1.5234375, "learning_rate": 0.00030781420949165607, "loss": 4.9182, "mean_token_accuracy": 0.21530407369136811, "num_tokens": 102038621.0, "step": 58820 }, { "entropy": 5.894441032409668, "epoch": 4.576774946508461, "grad_norm": 1.3515625, "learning_rate": 0.00030778678998874494, "loss": 4.8963, "mean_token_accuracy": 0.2160593420267105, "num_tokens": 102047389.0, "step": 58825 }, { "entropy": 5.812646675109863, "epoch": 4.577163975880179, "grad_norm": 1.53125, "learning_rate": 0.0003077593699883465, "loss": 4.8637, "mean_token_accuracy": 0.2259732738137245, "num_tokens": 102056114.0, "step": 58830 }, { "entropy": 5.846849966049194, "epoch": 4.577553005251897, "grad_norm": 1.4140625, "learning_rate": 0.00030773194949087665, "loss": 4.9174, "mean_token_accuracy": 0.22081035524606704, "num_tokens": 102063989.0, "step": 58835 }, { "entropy": 5.849257135391236, "epoch": 4.577942034623614, "grad_norm": 1.375, "learning_rate": 0.0003077045284967516, "loss": 4.9577, "mean_token_accuracy": 0.21161885559558868, "num_tokens": 102073348.0, "step": 58840 }, { "entropy": 5.860109615325928, "epoch": 4.578331063995332, "grad_norm": 1.4296875, "learning_rate": 0.0003076771070063874, "loss": 4.9244, "mean_token_accuracy": 0.21194933354854584, "num_tokens": 102081909.0, "step": 58845 }, { "entropy": 5.805100584030152, "epoch": 4.578720093367049, "grad_norm": 1.4765625, "learning_rate": 0.0003076496850202001, "loss": 4.8636, "mean_token_accuracy": 0.2220703884959221, "num_tokens": 102090577.0, "step": 58850 }, { "entropy": 5.826902675628662, "epoch": 4.579109122738767, "grad_norm": 1.3203125, "learning_rate": 0.00030762226253860584, "loss": 4.95, "mean_token_accuracy": 0.21301692724227905, "num_tokens": 102099415.0, "step": 58855 }, { "entropy": 5.890769100189209, "epoch": 4.579498152110484, "grad_norm": 1.3984375, "learning_rate": 0.0003075948395620206, "loss": 4.9204, "mean_token_accuracy": 0.21587304174900054, "num_tokens": 102107631.0, "step": 58860 }, { "entropy": 5.88065185546875, "epoch": 4.579887181482202, "grad_norm": 1.3828125, "learning_rate": 0.00030756741609086057, "loss": 4.9041, "mean_token_accuracy": 0.21585996448993683, "num_tokens": 102115710.0, "step": 58865 }, { "entropy": 5.871667098999024, "epoch": 4.58027621085392, "grad_norm": 1.40625, "learning_rate": 0.00030753999212554183, "loss": 5.0015, "mean_token_accuracy": 0.21258566826581954, "num_tokens": 102124170.0, "step": 58870 }, { "entropy": 5.869603967666626, "epoch": 4.580665240225637, "grad_norm": 1.4453125, "learning_rate": 0.0003075125676664806, "loss": 4.8523, "mean_token_accuracy": 0.22603644877672197, "num_tokens": 102133129.0, "step": 58875 }, { "entropy": 5.867083501815796, "epoch": 4.581054269597354, "grad_norm": 1.4765625, "learning_rate": 0.0003074851427140928, "loss": 4.9106, "mean_token_accuracy": 0.21744220554828644, "num_tokens": 102141976.0, "step": 58880 }, { "entropy": 5.849081516265869, "epoch": 4.581443298969072, "grad_norm": 1.5, "learning_rate": 0.00030745771726879467, "loss": 4.9337, "mean_token_accuracy": 0.21621257811784744, "num_tokens": 102150268.0, "step": 58885 }, { "entropy": 5.852190589904785, "epoch": 4.58183232834079, "grad_norm": 1.3046875, "learning_rate": 0.0003074302913310024, "loss": 5.0334, "mean_token_accuracy": 0.21267012804746627, "num_tokens": 102160689.0, "step": 58890 }, { "entropy": 5.850932693481445, "epoch": 4.582221357712507, "grad_norm": 1.4921875, "learning_rate": 0.000307402864901132, "loss": 4.9431, "mean_token_accuracy": 0.21642930954694747, "num_tokens": 102168975.0, "step": 58895 }, { "entropy": 5.905531549453736, "epoch": 4.582610387084225, "grad_norm": 1.453125, "learning_rate": 0.0003073754379795998, "loss": 4.9982, "mean_token_accuracy": 0.2070916086435318, "num_tokens": 102177802.0, "step": 58900 }, { "entropy": 5.887684869766235, "epoch": 4.582999416455943, "grad_norm": 1.2890625, "learning_rate": 0.00030734801056682176, "loss": 4.9494, "mean_token_accuracy": 0.20766782909631729, "num_tokens": 102186735.0, "step": 58905 }, { "entropy": 5.869570350646972, "epoch": 4.58338844582766, "grad_norm": 1.4140625, "learning_rate": 0.00030732058266321415, "loss": 4.9191, "mean_token_accuracy": 0.21863806694746019, "num_tokens": 102194420.0, "step": 58910 }, { "entropy": 5.833641624450683, "epoch": 4.583777475199377, "grad_norm": 1.6015625, "learning_rate": 0.0003072931542691932, "loss": 4.8719, "mean_token_accuracy": 0.221488294005394, "num_tokens": 102202242.0, "step": 58915 }, { "entropy": 5.907086658477783, "epoch": 4.584166504571095, "grad_norm": 1.390625, "learning_rate": 0.000307265725385175, "loss": 5.0137, "mean_token_accuracy": 0.2124616503715515, "num_tokens": 102210551.0, "step": 58920 }, { "entropy": 5.916331768035889, "epoch": 4.584555533942813, "grad_norm": 1.3203125, "learning_rate": 0.0003072382960115758, "loss": 4.9847, "mean_token_accuracy": 0.21628174930810928, "num_tokens": 102219451.0, "step": 58925 }, { "entropy": 5.9182024002075195, "epoch": 4.58494456331453, "grad_norm": 1.4453125, "learning_rate": 0.00030721086614881183, "loss": 4.9518, "mean_token_accuracy": 0.22097554802894592, "num_tokens": 102228349.0, "step": 58930 }, { "entropy": 5.898470830917359, "epoch": 4.585333592686248, "grad_norm": 1.4453125, "learning_rate": 0.0003071834357972991, "loss": 5.0293, "mean_token_accuracy": 0.2110875979065895, "num_tokens": 102236781.0, "step": 58935 }, { "entropy": 5.851024436950683, "epoch": 4.585722622057966, "grad_norm": 1.4765625, "learning_rate": 0.000307156004957454, "loss": 4.9045, "mean_token_accuracy": 0.2165671855211258, "num_tokens": 102244802.0, "step": 58940 }, { "entropy": 5.8414661407470705, "epoch": 4.5861116514296825, "grad_norm": 1.4453125, "learning_rate": 0.0003071285736296928, "loss": 4.8531, "mean_token_accuracy": 0.2158154532313347, "num_tokens": 102253404.0, "step": 58945 }, { "entropy": 5.887237644195556, "epoch": 4.5865006808014, "grad_norm": 1.5078125, "learning_rate": 0.0003071011418144315, "loss": 4.8593, "mean_token_accuracy": 0.2183360457420349, "num_tokens": 102261688.0, "step": 58950 }, { "entropy": 5.893262767791748, "epoch": 4.586889710173118, "grad_norm": 1.484375, "learning_rate": 0.00030707370951208655, "loss": 5.0458, "mean_token_accuracy": 0.20909756273031235, "num_tokens": 102270294.0, "step": 58955 }, { "entropy": 5.955899906158447, "epoch": 4.587278739544836, "grad_norm": 1.5390625, "learning_rate": 0.0003070462767230741, "loss": 5.064, "mean_token_accuracy": 0.20277651399374008, "num_tokens": 102279475.0, "step": 58960 }, { "entropy": 5.856693506240845, "epoch": 4.587667768916553, "grad_norm": 1.484375, "learning_rate": 0.0003070188434478104, "loss": 4.9122, "mean_token_accuracy": 0.21719721108675002, "num_tokens": 102288630.0, "step": 58965 }, { "entropy": 5.88286771774292, "epoch": 4.588056798288271, "grad_norm": 1.3984375, "learning_rate": 0.0003069914096867117, "loss": 4.8804, "mean_token_accuracy": 0.22452909946441652, "num_tokens": 102297701.0, "step": 58970 }, { "entropy": 5.867024230957031, "epoch": 4.588445827659989, "grad_norm": 1.3984375, "learning_rate": 0.0003069639754401942, "loss": 4.9417, "mean_token_accuracy": 0.2168638899922371, "num_tokens": 102306665.0, "step": 58975 }, { "entropy": 5.7701804637908936, "epoch": 4.588834857031706, "grad_norm": 1.390625, "learning_rate": 0.0003069365407086744, "loss": 4.8429, "mean_token_accuracy": 0.22183576971292496, "num_tokens": 102315411.0, "step": 58980 }, { "entropy": 5.880029582977295, "epoch": 4.589223886403423, "grad_norm": 1.453125, "learning_rate": 0.00030690910549256836, "loss": 4.9615, "mean_token_accuracy": 0.2167092427611351, "num_tokens": 102324218.0, "step": 58985 }, { "entropy": 5.880406522750855, "epoch": 4.589612915775141, "grad_norm": 1.3828125, "learning_rate": 0.0003068816697922925, "loss": 4.8873, "mean_token_accuracy": 0.21933809518814087, "num_tokens": 102332604.0, "step": 58990 }, { "entropy": 5.913788557052612, "epoch": 4.5900019451468586, "grad_norm": 1.53125, "learning_rate": 0.0003068542336082629, "loss": 4.9129, "mean_token_accuracy": 0.2153335005044937, "num_tokens": 102341092.0, "step": 58995 }, { "entropy": 5.900165462493897, "epoch": 4.590390974518576, "grad_norm": 1.375, "learning_rate": 0.00030682679694089615, "loss": 4.9392, "mean_token_accuracy": 0.22295089662075043, "num_tokens": 102349084.0, "step": 59000 }, { "entropy": 5.873656558990478, "epoch": 4.590780003890294, "grad_norm": 1.328125, "learning_rate": 0.0003067993597906083, "loss": 4.9934, "mean_token_accuracy": 0.21173078417778016, "num_tokens": 102357678.0, "step": 59005 }, { "entropy": 5.870819330215454, "epoch": 4.591169033262012, "grad_norm": 1.515625, "learning_rate": 0.0003067719221578158, "loss": 4.8852, "mean_token_accuracy": 0.2165520265698433, "num_tokens": 102365645.0, "step": 59010 }, { "entropy": 5.86516375541687, "epoch": 4.5915580626337285, "grad_norm": 1.40625, "learning_rate": 0.000306744484042935, "loss": 4.9375, "mean_token_accuracy": 0.21901046633720397, "num_tokens": 102373853.0, "step": 59015 }, { "entropy": 5.796182632446289, "epoch": 4.591947092005446, "grad_norm": 1.3203125, "learning_rate": 0.0003067170454463822, "loss": 4.8729, "mean_token_accuracy": 0.21695795208215712, "num_tokens": 102383027.0, "step": 59020 }, { "entropy": 5.837488508224487, "epoch": 4.592336121377164, "grad_norm": 1.421875, "learning_rate": 0.00030668960636857364, "loss": 4.9355, "mean_token_accuracy": 0.21978914141654968, "num_tokens": 102392114.0, "step": 59025 }, { "entropy": 5.764454889297485, "epoch": 4.5927251507488815, "grad_norm": 1.3125, "learning_rate": 0.0003066621668099258, "loss": 4.7553, "mean_token_accuracy": 0.2269095927476883, "num_tokens": 102400294.0, "step": 59030 }, { "entropy": 5.894205570220947, "epoch": 4.593114180120599, "grad_norm": 1.3359375, "learning_rate": 0.00030663472677085494, "loss": 4.9792, "mean_token_accuracy": 0.2098499581217766, "num_tokens": 102408777.0, "step": 59035 }, { "entropy": 5.8207268714904785, "epoch": 4.593503209492317, "grad_norm": 1.359375, "learning_rate": 0.00030660728625177746, "loss": 4.866, "mean_token_accuracy": 0.2188152179121971, "num_tokens": 102417451.0, "step": 59040 }, { "entropy": 5.816992902755738, "epoch": 4.593892238864035, "grad_norm": 1.3984375, "learning_rate": 0.0003065798452531097, "loss": 4.8858, "mean_token_accuracy": 0.2179120421409607, "num_tokens": 102425697.0, "step": 59045 }, { "entropy": 5.842831754684449, "epoch": 4.5942812682357514, "grad_norm": 1.3671875, "learning_rate": 0.00030655240377526813, "loss": 4.9582, "mean_token_accuracy": 0.21867853552103042, "num_tokens": 102434112.0, "step": 59050 }, { "entropy": 5.877425193786621, "epoch": 4.594670297607469, "grad_norm": 1.3828125, "learning_rate": 0.000306524961818669, "loss": 4.9872, "mean_token_accuracy": 0.20932792872190475, "num_tokens": 102442649.0, "step": 59055 }, { "entropy": 5.93512864112854, "epoch": 4.595059326979187, "grad_norm": 1.46875, "learning_rate": 0.0003064975193837287, "loss": 4.9852, "mean_token_accuracy": 0.21120850145816802, "num_tokens": 102451181.0, "step": 59060 }, { "entropy": 5.836515712738037, "epoch": 4.5954483563509045, "grad_norm": 1.390625, "learning_rate": 0.0003064700764708638, "loss": 4.8069, "mean_token_accuracy": 0.22665199190378188, "num_tokens": 102459453.0, "step": 59065 }, { "entropy": 5.785112762451172, "epoch": 4.595837385722622, "grad_norm": 1.390625, "learning_rate": 0.00030644263308049046, "loss": 4.8842, "mean_token_accuracy": 0.22357717603445054, "num_tokens": 102468677.0, "step": 59070 }, { "entropy": 5.891535949707031, "epoch": 4.59622641509434, "grad_norm": 1.3671875, "learning_rate": 0.0003064151892130252, "loss": 4.9619, "mean_token_accuracy": 0.20587226748466492, "num_tokens": 102477821.0, "step": 59075 }, { "entropy": 5.836864376068116, "epoch": 4.596615444466057, "grad_norm": 1.4375, "learning_rate": 0.0003063877448688846, "loss": 4.9236, "mean_token_accuracy": 0.21815500557422637, "num_tokens": 102486054.0, "step": 59080 }, { "entropy": 5.833251476287842, "epoch": 4.597004473837774, "grad_norm": 1.3828125, "learning_rate": 0.0003063603000484848, "loss": 4.9021, "mean_token_accuracy": 0.22125181555747986, "num_tokens": 102495587.0, "step": 59085 }, { "entropy": 5.954069471359253, "epoch": 4.597393503209492, "grad_norm": 1.53125, "learning_rate": 0.00030633285475224244, "loss": 4.9958, "mean_token_accuracy": 0.2236172154545784, "num_tokens": 102504335.0, "step": 59090 }, { "entropy": 5.741567325592041, "epoch": 4.59778253258121, "grad_norm": 1.390625, "learning_rate": 0.00030630540898057384, "loss": 4.8488, "mean_token_accuracy": 0.2208258554339409, "num_tokens": 102512550.0, "step": 59095 }, { "entropy": 5.834440755844116, "epoch": 4.5981715619529275, "grad_norm": 1.40625, "learning_rate": 0.00030627796273389546, "loss": 4.9024, "mean_token_accuracy": 0.2116864249110222, "num_tokens": 102521003.0, "step": 59100 }, { "entropy": 5.870408916473389, "epoch": 4.598560591324645, "grad_norm": 1.5, "learning_rate": 0.00030625051601262384, "loss": 4.922, "mean_token_accuracy": 0.2147119790315628, "num_tokens": 102529857.0, "step": 59105 }, { "entropy": 5.9364570617675785, "epoch": 4.598949620696363, "grad_norm": 1.3515625, "learning_rate": 0.0003062230688171753, "loss": 4.9912, "mean_token_accuracy": 0.20949615389108658, "num_tokens": 102539965.0, "step": 59110 }, { "entropy": 5.874440145492554, "epoch": 4.599338650068081, "grad_norm": 1.375, "learning_rate": 0.0003061956211479665, "loss": 4.8847, "mean_token_accuracy": 0.2263513445854187, "num_tokens": 102548538.0, "step": 59115 }, { "entropy": 5.848804712295532, "epoch": 4.599727679439797, "grad_norm": 1.3046875, "learning_rate": 0.0003061681730054137, "loss": 4.9853, "mean_token_accuracy": 0.21431005150079727, "num_tokens": 102556242.0, "step": 59120 }, { "entropy": 5.741528558731079, "epoch": 4.600116708811515, "grad_norm": 1.375, "learning_rate": 0.0003061407243899335, "loss": 4.8302, "mean_token_accuracy": 0.2299483373761177, "num_tokens": 102565014.0, "step": 59125 }, { "entropy": 5.899964475631714, "epoch": 4.600505738183233, "grad_norm": 1.4375, "learning_rate": 0.00030611327530194243, "loss": 5.0076, "mean_token_accuracy": 0.2143373653292656, "num_tokens": 102573487.0, "step": 59130 }, { "entropy": 5.935739803314209, "epoch": 4.6008947675549505, "grad_norm": 1.390625, "learning_rate": 0.0003060858257418569, "loss": 4.9516, "mean_token_accuracy": 0.21495617181062698, "num_tokens": 102582541.0, "step": 59135 }, { "entropy": 5.947629022598266, "epoch": 4.601283796926668, "grad_norm": 1.4453125, "learning_rate": 0.0003060583757100934, "loss": 5.0381, "mean_token_accuracy": 0.2080756828188896, "num_tokens": 102591486.0, "step": 59140 }, { "entropy": 5.864669990539551, "epoch": 4.601672826298385, "grad_norm": 1.4453125, "learning_rate": 0.0003060309252070685, "loss": 4.9496, "mean_token_accuracy": 0.20636269450187683, "num_tokens": 102599544.0, "step": 59145 }, { "entropy": 5.93262243270874, "epoch": 4.602061855670103, "grad_norm": 1.5234375, "learning_rate": 0.0003060034742331987, "loss": 4.994, "mean_token_accuracy": 0.20986106097698212, "num_tokens": 102608303.0, "step": 59150 }, { "entropy": 5.930326128005982, "epoch": 4.60245088504182, "grad_norm": 1.4296875, "learning_rate": 0.0003059760227889006, "loss": 4.9877, "mean_token_accuracy": 0.214130038022995, "num_tokens": 102616541.0, "step": 59155 }, { "entropy": 5.808360147476196, "epoch": 4.602839914413538, "grad_norm": 1.3359375, "learning_rate": 0.0003059485708745906, "loss": 4.876, "mean_token_accuracy": 0.21648477911949157, "num_tokens": 102625125.0, "step": 59160 }, { "entropy": 5.8889275074005125, "epoch": 4.603228943785256, "grad_norm": 1.4296875, "learning_rate": 0.0003059211184906853, "loss": 5.0112, "mean_token_accuracy": 0.21307700425386428, "num_tokens": 102633826.0, "step": 59165 }, { "entropy": 5.8947694301605225, "epoch": 4.6036179731569735, "grad_norm": 1.5234375, "learning_rate": 0.00030589366563760125, "loss": 4.9906, "mean_token_accuracy": 0.21525832861661912, "num_tokens": 102642155.0, "step": 59170 }, { "entropy": 5.786149692535401, "epoch": 4.604007002528691, "grad_norm": 1.4453125, "learning_rate": 0.00030586621231575494, "loss": 4.8128, "mean_token_accuracy": 0.22814300805330276, "num_tokens": 102650884.0, "step": 59175 }, { "entropy": 5.873524522781372, "epoch": 4.604396031900409, "grad_norm": 1.375, "learning_rate": 0.000305838758525563, "loss": 4.8999, "mean_token_accuracy": 0.22748121619224548, "num_tokens": 102659828.0, "step": 59180 }, { "entropy": 5.928497219085694, "epoch": 4.604785061272126, "grad_norm": 1.6328125, "learning_rate": 0.0003058113042674421, "loss": 5.0798, "mean_token_accuracy": 0.20461203902959824, "num_tokens": 102668192.0, "step": 59185 }, { "entropy": 5.843136310577393, "epoch": 4.605174090643843, "grad_norm": 1.3671875, "learning_rate": 0.00030578384954180866, "loss": 4.9258, "mean_token_accuracy": 0.21692436635494233, "num_tokens": 102677772.0, "step": 59190 }, { "entropy": 5.889706373214722, "epoch": 4.605563120015561, "grad_norm": 1.4140625, "learning_rate": 0.0003057563943490792, "loss": 4.9278, "mean_token_accuracy": 0.2171032801270485, "num_tokens": 102687216.0, "step": 59195 }, { "entropy": 5.972531414031982, "epoch": 4.605952149387279, "grad_norm": 1.5703125, "learning_rate": 0.00030572893868967044, "loss": 5.0273, "mean_token_accuracy": 0.21264603585004807, "num_tokens": 102695458.0, "step": 59200 }, { "entropy": 5.896920442581177, "epoch": 4.6063411787589965, "grad_norm": 1.46875, "learning_rate": 0.000305701482563999, "loss": 5.0028, "mean_token_accuracy": 0.21012648195028305, "num_tokens": 102704472.0, "step": 59205 }, { "entropy": 5.843772840499878, "epoch": 4.606730208130714, "grad_norm": 1.2890625, "learning_rate": 0.0003056740259724814, "loss": 4.8847, "mean_token_accuracy": 0.22023798376321793, "num_tokens": 102713267.0, "step": 59210 }, { "entropy": 5.798350381851196, "epoch": 4.607119237502431, "grad_norm": 1.4140625, "learning_rate": 0.0003056465689155342, "loss": 4.7345, "mean_token_accuracy": 0.23019516468048096, "num_tokens": 102721961.0, "step": 59215 }, { "entropy": 5.87944598197937, "epoch": 4.607508266874149, "grad_norm": 1.4453125, "learning_rate": 0.00030561911139357424, "loss": 4.9354, "mean_token_accuracy": 0.21837567389011384, "num_tokens": 102731079.0, "step": 59220 }, { "entropy": 5.8833984375, "epoch": 4.607897296245866, "grad_norm": 1.40625, "learning_rate": 0.00030559165340701797, "loss": 4.9767, "mean_token_accuracy": 0.21630579233169556, "num_tokens": 102739480.0, "step": 59225 }, { "entropy": 5.875898599624634, "epoch": 4.608286325617584, "grad_norm": 1.375, "learning_rate": 0.000305564194956282, "loss": 4.9581, "mean_token_accuracy": 0.21165303885936737, "num_tokens": 102748190.0, "step": 59230 }, { "entropy": 5.846229124069214, "epoch": 4.608675354989302, "grad_norm": 1.484375, "learning_rate": 0.00030553673604178305, "loss": 4.8954, "mean_token_accuracy": 0.22021922767162322, "num_tokens": 102757254.0, "step": 59235 }, { "entropy": 5.832178068161011, "epoch": 4.6090643843610195, "grad_norm": 1.2578125, "learning_rate": 0.00030550927666393767, "loss": 5.0034, "mean_token_accuracy": 0.21254366189241408, "num_tokens": 102766550.0, "step": 59240 }, { "entropy": 5.906805515289307, "epoch": 4.609453413732737, "grad_norm": 1.578125, "learning_rate": 0.00030548181682316263, "loss": 4.9848, "mean_token_accuracy": 0.20864721536636352, "num_tokens": 102774671.0, "step": 59245 }, { "entropy": 5.903750991821289, "epoch": 4.609842443104454, "grad_norm": 1.3046875, "learning_rate": 0.00030545435651987453, "loss": 5.0097, "mean_token_accuracy": 0.21501947194337845, "num_tokens": 102783640.0, "step": 59250 }, { "entropy": 5.844103813171387, "epoch": 4.610231472476172, "grad_norm": 1.3125, "learning_rate": 0.0003054268957544901, "loss": 4.9251, "mean_token_accuracy": 0.2175658717751503, "num_tokens": 102792912.0, "step": 59255 }, { "entropy": 5.917260932922363, "epoch": 4.610620501847889, "grad_norm": 1.3046875, "learning_rate": 0.00030539943452742585, "loss": 4.9368, "mean_token_accuracy": 0.21579167544841765, "num_tokens": 102801364.0, "step": 59260 }, { "entropy": 5.872364139556884, "epoch": 4.611009531219607, "grad_norm": 1.4453125, "learning_rate": 0.00030537197283909875, "loss": 4.9759, "mean_token_accuracy": 0.21178903728723525, "num_tokens": 102810275.0, "step": 59265 }, { "entropy": 5.828303813934326, "epoch": 4.611398560591325, "grad_norm": 1.4296875, "learning_rate": 0.00030534451068992506, "loss": 4.98, "mean_token_accuracy": 0.20569159388542174, "num_tokens": 102818724.0, "step": 59270 }, { "entropy": 5.841092729568482, "epoch": 4.6117875899630425, "grad_norm": 1.453125, "learning_rate": 0.00030531704808032183, "loss": 4.9619, "mean_token_accuracy": 0.21710328310728072, "num_tokens": 102826776.0, "step": 59275 }, { "entropy": 5.861355590820312, "epoch": 4.612176619334759, "grad_norm": 1.4140625, "learning_rate": 0.0003052895850107057, "loss": 4.9147, "mean_token_accuracy": 0.2189507082104683, "num_tokens": 102835089.0, "step": 59280 }, { "entropy": 5.964153909683228, "epoch": 4.612565648706477, "grad_norm": 1.4921875, "learning_rate": 0.00030526212148149326, "loss": 4.9559, "mean_token_accuracy": 0.2129327431321144, "num_tokens": 102843877.0, "step": 59285 }, { "entropy": 5.879856061935425, "epoch": 4.612954678078195, "grad_norm": 1.6171875, "learning_rate": 0.0003052346574931013, "loss": 4.9855, "mean_token_accuracy": 0.2112683594226837, "num_tokens": 102852354.0, "step": 59290 }, { "entropy": 5.893152236938477, "epoch": 4.613343707449912, "grad_norm": 1.3984375, "learning_rate": 0.0003052071930459465, "loss": 4.9507, "mean_token_accuracy": 0.21701678037643432, "num_tokens": 102860618.0, "step": 59295 }, { "entropy": 5.835953426361084, "epoch": 4.61373273682163, "grad_norm": 1.5078125, "learning_rate": 0.0003051797281404457, "loss": 4.8972, "mean_token_accuracy": 0.21912211179733276, "num_tokens": 102868969.0, "step": 59300 }, { "entropy": 5.8892443656921385, "epoch": 4.614121766193348, "grad_norm": 1.421875, "learning_rate": 0.00030515226277701553, "loss": 5.0123, "mean_token_accuracy": 0.2104501709342003, "num_tokens": 102877367.0, "step": 59305 }, { "entropy": 5.896457147598267, "epoch": 4.6145107955650655, "grad_norm": 1.421875, "learning_rate": 0.0003051247969560728, "loss": 4.9599, "mean_token_accuracy": 0.2165166512131691, "num_tokens": 102885606.0, "step": 59310 }, { "entropy": 5.921051454544068, "epoch": 4.614899824936783, "grad_norm": 1.40625, "learning_rate": 0.0003050973306780342, "loss": 5.0093, "mean_token_accuracy": 0.20715464949607848, "num_tokens": 102894110.0, "step": 59315 }, { "entropy": 5.910792589187622, "epoch": 4.6152888543085, "grad_norm": 1.375, "learning_rate": 0.00030506986394331656, "loss": 5.004, "mean_token_accuracy": 0.21027127504348755, "num_tokens": 102903584.0, "step": 59320 }, { "entropy": 5.885996627807617, "epoch": 4.615677883680218, "grad_norm": 1.375, "learning_rate": 0.00030504239675233655, "loss": 4.9822, "mean_token_accuracy": 0.21193112283945084, "num_tokens": 102911651.0, "step": 59325 }, { "entropy": 5.8978838443756105, "epoch": 4.616066913051935, "grad_norm": 1.53125, "learning_rate": 0.00030501492910551094, "loss": 5.0135, "mean_token_accuracy": 0.21014205664396285, "num_tokens": 102920108.0, "step": 59330 }, { "entropy": 5.863290214538575, "epoch": 4.616455942423653, "grad_norm": 1.4453125, "learning_rate": 0.00030498746100325656, "loss": 4.8932, "mean_token_accuracy": 0.21925996243953705, "num_tokens": 102928749.0, "step": 59335 }, { "entropy": 5.881446838378906, "epoch": 4.616844971795371, "grad_norm": 1.4296875, "learning_rate": 0.0003049599924459903, "loss": 4.9523, "mean_token_accuracy": 0.21116265207529067, "num_tokens": 102936568.0, "step": 59340 }, { "entropy": 5.928707838058472, "epoch": 4.6172340011670885, "grad_norm": 1.40625, "learning_rate": 0.0003049325234341287, "loss": 5.0082, "mean_token_accuracy": 0.2097833499312401, "num_tokens": 102945390.0, "step": 59345 }, { "entropy": 5.972243738174439, "epoch": 4.617623030538805, "grad_norm": 1.4140625, "learning_rate": 0.00030490505396808874, "loss": 5.0463, "mean_token_accuracy": 0.2131298691034317, "num_tokens": 102954251.0, "step": 59350 }, { "entropy": 5.926200914382934, "epoch": 4.618012059910523, "grad_norm": 1.28125, "learning_rate": 0.0003048775840482873, "loss": 4.9908, "mean_token_accuracy": 0.20811918675899505, "num_tokens": 102963142.0, "step": 59355 }, { "entropy": 5.8684648990631105, "epoch": 4.618401089282241, "grad_norm": 1.453125, "learning_rate": 0.000304850113675141, "loss": 4.9651, "mean_token_accuracy": 0.2231759712100029, "num_tokens": 102971750.0, "step": 59360 }, { "entropy": 5.945009756088257, "epoch": 4.618790118653958, "grad_norm": 1.40625, "learning_rate": 0.0003048226428490666, "loss": 4.9749, "mean_token_accuracy": 0.21635287255048752, "num_tokens": 102980283.0, "step": 59365 }, { "entropy": 5.867023563385009, "epoch": 4.619179148025676, "grad_norm": 1.4609375, "learning_rate": 0.00030479517157048125, "loss": 4.9451, "mean_token_accuracy": 0.21406133323907853, "num_tokens": 102988763.0, "step": 59370 }, { "entropy": 5.818175411224365, "epoch": 4.619568177397394, "grad_norm": 1.4765625, "learning_rate": 0.0003047676998398015, "loss": 4.881, "mean_token_accuracy": 0.22367904633283614, "num_tokens": 102997105.0, "step": 59375 }, { "entropy": 5.867564868927002, "epoch": 4.6199572067691115, "grad_norm": 1.359375, "learning_rate": 0.00030474022765744434, "loss": 4.9696, "mean_token_accuracy": 0.21720581352710724, "num_tokens": 103005400.0, "step": 59380 }, { "entropy": 5.909547948837281, "epoch": 4.620346236140828, "grad_norm": 1.3984375, "learning_rate": 0.00030471275502382656, "loss": 4.9975, "mean_token_accuracy": 0.21065307706594466, "num_tokens": 103013432.0, "step": 59385 }, { "entropy": 5.89455018043518, "epoch": 4.620735265512546, "grad_norm": 1.3984375, "learning_rate": 0.000304685281939365, "loss": 4.9091, "mean_token_accuracy": 0.2205229550600052, "num_tokens": 103022113.0, "step": 59390 }, { "entropy": 5.7813561916351315, "epoch": 4.621124294884264, "grad_norm": 1.2890625, "learning_rate": 0.0003046578084044765, "loss": 4.8415, "mean_token_accuracy": 0.2236254781484604, "num_tokens": 103030417.0, "step": 59395 }, { "entropy": 5.811742782592773, "epoch": 4.621513324255981, "grad_norm": 1.3671875, "learning_rate": 0.000304630334419578, "loss": 4.9838, "mean_token_accuracy": 0.20927574038505553, "num_tokens": 103039652.0, "step": 59400 }, { "entropy": 5.814849853515625, "epoch": 4.621902353627699, "grad_norm": 1.4609375, "learning_rate": 0.0003046028599850863, "loss": 4.884, "mean_token_accuracy": 0.2254044905304909, "num_tokens": 103048035.0, "step": 59405 }, { "entropy": 5.85345230102539, "epoch": 4.622291382999417, "grad_norm": 1.3828125, "learning_rate": 0.0003045753851014184, "loss": 4.8905, "mean_token_accuracy": 0.22276206016540528, "num_tokens": 103056548.0, "step": 59410 }, { "entropy": 6.000073099136353, "epoch": 4.622680412371134, "grad_norm": 1.484375, "learning_rate": 0.00030454790976899105, "loss": 5.0872, "mean_token_accuracy": 0.20840395092964173, "num_tokens": 103065016.0, "step": 59415 }, { "entropy": 5.926330184936523, "epoch": 4.623069441742851, "grad_norm": 1.453125, "learning_rate": 0.0003045204339882212, "loss": 4.9805, "mean_token_accuracy": 0.21499303728342056, "num_tokens": 103073421.0, "step": 59420 }, { "entropy": 5.849353313446045, "epoch": 4.623458471114569, "grad_norm": 1.3125, "learning_rate": 0.0003044929577595257, "loss": 4.9151, "mean_token_accuracy": 0.2161320775747299, "num_tokens": 103082874.0, "step": 59425 }, { "entropy": 5.887893772125244, "epoch": 4.623847500486287, "grad_norm": 1.359375, "learning_rate": 0.00030446548108332164, "loss": 4.9391, "mean_token_accuracy": 0.21998862773180008, "num_tokens": 103091698.0, "step": 59430 }, { "entropy": 5.908675765991211, "epoch": 4.624236529858004, "grad_norm": 1.3984375, "learning_rate": 0.00030443800396002575, "loss": 4.9567, "mean_token_accuracy": 0.21434952914714814, "num_tokens": 103100841.0, "step": 59435 }, { "entropy": 5.831303501129151, "epoch": 4.624625559229722, "grad_norm": 1.4921875, "learning_rate": 0.0003044105263900549, "loss": 4.8917, "mean_token_accuracy": 0.2217041254043579, "num_tokens": 103109589.0, "step": 59440 }, { "entropy": 5.861938190460205, "epoch": 4.62501458860144, "grad_norm": 1.359375, "learning_rate": 0.0003043830483738262, "loss": 5.0079, "mean_token_accuracy": 0.21454712599515915, "num_tokens": 103118454.0, "step": 59445 }, { "entropy": 5.839293813705444, "epoch": 4.6254036179731575, "grad_norm": 1.4921875, "learning_rate": 0.0003043555699117565, "loss": 4.9905, "mean_token_accuracy": 0.21116624325513839, "num_tokens": 103127144.0, "step": 59450 }, { "entropy": 5.800412178039551, "epoch": 4.625792647344874, "grad_norm": 1.234375, "learning_rate": 0.00030432809100426286, "loss": 4.8754, "mean_token_accuracy": 0.2210872069001198, "num_tokens": 103136130.0, "step": 59455 }, { "entropy": 5.8798499584198, "epoch": 4.626181676716592, "grad_norm": 1.390625, "learning_rate": 0.0003043006116517619, "loss": 4.9542, "mean_token_accuracy": 0.21400593668222428, "num_tokens": 103144147.0, "step": 59460 }, { "entropy": 5.9121373176574705, "epoch": 4.62657070608831, "grad_norm": 1.4140625, "learning_rate": 0.00030427313185467104, "loss": 4.9794, "mean_token_accuracy": 0.20629697293043137, "num_tokens": 103153486.0, "step": 59465 }, { "entropy": 5.82157416343689, "epoch": 4.626959735460027, "grad_norm": 1.359375, "learning_rate": 0.0003042456516134068, "loss": 4.8519, "mean_token_accuracy": 0.2262937232851982, "num_tokens": 103162236.0, "step": 59470 }, { "entropy": 5.822551965713501, "epoch": 4.627348764831745, "grad_norm": 1.5625, "learning_rate": 0.00030421817092838644, "loss": 4.9119, "mean_token_accuracy": 0.22314469665288925, "num_tokens": 103169729.0, "step": 59475 }, { "entropy": 5.805689430236816, "epoch": 4.627737794203462, "grad_norm": 1.4375, "learning_rate": 0.0003041906898000268, "loss": 4.9809, "mean_token_accuracy": 0.213431479036808, "num_tokens": 103178429.0, "step": 59480 }, { "entropy": 5.9601325511932375, "epoch": 4.62812682357518, "grad_norm": 1.484375, "learning_rate": 0.0003041632082287449, "loss": 5.0513, "mean_token_accuracy": 0.20514727830886842, "num_tokens": 103186676.0, "step": 59485 }, { "entropy": 5.950713348388672, "epoch": 4.628515852946897, "grad_norm": 1.4296875, "learning_rate": 0.0003041357262149577, "loss": 4.9942, "mean_token_accuracy": 0.21832729279994964, "num_tokens": 103195620.0, "step": 59490 }, { "entropy": 5.888232088088989, "epoch": 4.628904882318615, "grad_norm": 1.453125, "learning_rate": 0.0003041082437590824, "loss": 4.8861, "mean_token_accuracy": 0.2219439461827278, "num_tokens": 103204212.0, "step": 59495 }, { "entropy": 5.752078723907471, "epoch": 4.629293911690333, "grad_norm": 1.4921875, "learning_rate": 0.00030408076086153575, "loss": 4.8507, "mean_token_accuracy": 0.21823230981826783, "num_tokens": 103212593.0, "step": 59500 }, { "entropy": 5.889556884765625, "epoch": 4.62968294106205, "grad_norm": 1.453125, "learning_rate": 0.0003040532775227347, "loss": 4.9621, "mean_token_accuracy": 0.21064398288726807, "num_tokens": 103220869.0, "step": 59505 }, { "entropy": 5.886502647399903, "epoch": 4.630071970433768, "grad_norm": 1.4453125, "learning_rate": 0.00030402579374309656, "loss": 4.9951, "mean_token_accuracy": 0.2119506523013115, "num_tokens": 103229247.0, "step": 59510 }, { "entropy": 5.859588670730591, "epoch": 4.630460999805486, "grad_norm": 1.46875, "learning_rate": 0.00030399830952303815, "loss": 4.916, "mean_token_accuracy": 0.21957392245531082, "num_tokens": 103238190.0, "step": 59515 }, { "entropy": 5.866318035125732, "epoch": 4.630850029177203, "grad_norm": 1.3359375, "learning_rate": 0.00030397082486297657, "loss": 4.9287, "mean_token_accuracy": 0.21058034896850586, "num_tokens": 103247284.0, "step": 59520 }, { "entropy": 6.020378589630127, "epoch": 4.63123905854892, "grad_norm": 1.5234375, "learning_rate": 0.0003039433397633288, "loss": 5.1131, "mean_token_accuracy": 0.20766572058200836, "num_tokens": 103255015.0, "step": 59525 }, { "entropy": 5.910651063919067, "epoch": 4.631628087920638, "grad_norm": 1.3984375, "learning_rate": 0.00030391585422451196, "loss": 4.9162, "mean_token_accuracy": 0.22275150716304778, "num_tokens": 103264129.0, "step": 59530 }, { "entropy": 5.86256594657898, "epoch": 4.632017117292356, "grad_norm": 1.3203125, "learning_rate": 0.00030388836824694307, "loss": 4.9893, "mean_token_accuracy": 0.20690262615680693, "num_tokens": 103273268.0, "step": 59535 }, { "entropy": 5.925336599349976, "epoch": 4.632406146664073, "grad_norm": 1.6484375, "learning_rate": 0.0003038608818310391, "loss": 4.996, "mean_token_accuracy": 0.212839475274086, "num_tokens": 103281627.0, "step": 59540 }, { "entropy": 5.851765584945679, "epoch": 4.632795176035791, "grad_norm": 1.34375, "learning_rate": 0.00030383339497721726, "loss": 4.9667, "mean_token_accuracy": 0.21303091943264008, "num_tokens": 103290122.0, "step": 59545 }, { "entropy": 5.929911708831787, "epoch": 4.633184205407508, "grad_norm": 1.328125, "learning_rate": 0.0003038059076858944, "loss": 5.0033, "mean_token_accuracy": 0.2119682639837265, "num_tokens": 103298791.0, "step": 59550 }, { "entropy": 5.972873973846435, "epoch": 4.633573234779226, "grad_norm": 1.4609375, "learning_rate": 0.0003037784199574879, "loss": 5.0341, "mean_token_accuracy": 0.20924840569496156, "num_tokens": 103307724.0, "step": 59555 }, { "entropy": 5.8803058624267575, "epoch": 4.633962264150943, "grad_norm": 1.3203125, "learning_rate": 0.00030375093179241464, "loss": 4.8886, "mean_token_accuracy": 0.21784429550170897, "num_tokens": 103316371.0, "step": 59560 }, { "entropy": 5.891194152832031, "epoch": 4.634351293522661, "grad_norm": 1.296875, "learning_rate": 0.00030372344319109173, "loss": 4.9235, "mean_token_accuracy": 0.2247490480542183, "num_tokens": 103325152.0, "step": 59565 }, { "entropy": 5.885935068130493, "epoch": 4.634740322894379, "grad_norm": 1.3203125, "learning_rate": 0.0003036959541539363, "loss": 4.9727, "mean_token_accuracy": 0.2193233400583267, "num_tokens": 103333424.0, "step": 59570 }, { "entropy": 5.900493431091308, "epoch": 4.635129352266096, "grad_norm": 1.390625, "learning_rate": 0.00030366846468136543, "loss": 4.9356, "mean_token_accuracy": 0.2165011942386627, "num_tokens": 103341913.0, "step": 59575 }, { "entropy": 5.946571397781372, "epoch": 4.635518381637814, "grad_norm": 1.4140625, "learning_rate": 0.0003036409747737963, "loss": 5.0442, "mean_token_accuracy": 0.21058931201696396, "num_tokens": 103351629.0, "step": 59580 }, { "entropy": 5.913263416290283, "epoch": 4.635907411009531, "grad_norm": 1.3984375, "learning_rate": 0.00030361348443164583, "loss": 4.945, "mean_token_accuracy": 0.21255773454904556, "num_tokens": 103359616.0, "step": 59585 }, { "entropy": 5.86098804473877, "epoch": 4.6362964403812486, "grad_norm": 1.5390625, "learning_rate": 0.0003035859936553314, "loss": 4.9258, "mean_token_accuracy": 0.22009864151477815, "num_tokens": 103368579.0, "step": 59590 }, { "entropy": 5.898982954025269, "epoch": 4.636685469752966, "grad_norm": 1.515625, "learning_rate": 0.00030355850244527, "loss": 4.9126, "mean_token_accuracy": 0.21819094717502593, "num_tokens": 103377608.0, "step": 59595 }, { "entropy": 5.943006277084351, "epoch": 4.637074499124684, "grad_norm": 1.359375, "learning_rate": 0.0003035310108018787, "loss": 5.0429, "mean_token_accuracy": 0.21568890064954757, "num_tokens": 103386672.0, "step": 59600 }, { "entropy": 5.874470329284668, "epoch": 4.637463528496402, "grad_norm": 1.3515625, "learning_rate": 0.0003035035187255748, "loss": 4.9645, "mean_token_accuracy": 0.21962076127529145, "num_tokens": 103395447.0, "step": 59605 }, { "entropy": 5.894077253341675, "epoch": 4.637852557868119, "grad_norm": 1.4296875, "learning_rate": 0.00030347602621677534, "loss": 4.9245, "mean_token_accuracy": 0.2055039197206497, "num_tokens": 103404518.0, "step": 59610 }, { "entropy": 5.85761194229126, "epoch": 4.638241587239836, "grad_norm": 1.4375, "learning_rate": 0.0003034485332758975, "loss": 4.8713, "mean_token_accuracy": 0.2192122980952263, "num_tokens": 103412910.0, "step": 59615 }, { "entropy": 5.900339794158936, "epoch": 4.638630616611554, "grad_norm": 1.453125, "learning_rate": 0.00030342103990335846, "loss": 4.9269, "mean_token_accuracy": 0.21875500828027725, "num_tokens": 103420753.0, "step": 59620 }, { "entropy": 5.816905355453491, "epoch": 4.6390196459832715, "grad_norm": 1.4140625, "learning_rate": 0.00030339354609957545, "loss": 4.9298, "mean_token_accuracy": 0.2137668773531914, "num_tokens": 103429320.0, "step": 59625 }, { "entropy": 5.76717586517334, "epoch": 4.639408675354989, "grad_norm": 1.4375, "learning_rate": 0.00030336605186496546, "loss": 4.7888, "mean_token_accuracy": 0.22623176127672195, "num_tokens": 103437458.0, "step": 59630 }, { "entropy": 5.865260934829712, "epoch": 4.639797704726707, "grad_norm": 1.484375, "learning_rate": 0.00030333855719994585, "loss": 4.9918, "mean_token_accuracy": 0.21199748665094376, "num_tokens": 103445296.0, "step": 59635 }, { "entropy": 5.808672857284546, "epoch": 4.640186734098425, "grad_norm": 1.4921875, "learning_rate": 0.0003033110621049336, "loss": 4.8576, "mean_token_accuracy": 0.2220495641231537, "num_tokens": 103453974.0, "step": 59640 }, { "entropy": 5.748056364059448, "epoch": 4.640575763470142, "grad_norm": 1.4609375, "learning_rate": 0.00030328356658034623, "loss": 4.8517, "mean_token_accuracy": 0.21672202795743942, "num_tokens": 103462706.0, "step": 59645 }, { "entropy": 5.810504055023193, "epoch": 4.64096479284186, "grad_norm": 1.5, "learning_rate": 0.00030325607062660066, "loss": 4.8562, "mean_token_accuracy": 0.22149689942598344, "num_tokens": 103471316.0, "step": 59650 }, { "entropy": 5.904333305358887, "epoch": 4.641353822213577, "grad_norm": 1.390625, "learning_rate": 0.0003032285742441143, "loss": 4.879, "mean_token_accuracy": 0.2216821238398552, "num_tokens": 103480198.0, "step": 59655 }, { "entropy": 5.882955265045166, "epoch": 4.6417428515852945, "grad_norm": 1.203125, "learning_rate": 0.0003032010774333041, "loss": 4.9226, "mean_token_accuracy": 0.21834102720022203, "num_tokens": 103489888.0, "step": 59660 }, { "entropy": 5.879792261123657, "epoch": 4.642131880957012, "grad_norm": 1.4296875, "learning_rate": 0.00030317358019458753, "loss": 5.002, "mean_token_accuracy": 0.20893792808055878, "num_tokens": 103498722.0, "step": 59665 }, { "entropy": 5.922170925140381, "epoch": 4.64252091032873, "grad_norm": 1.4296875, "learning_rate": 0.0003031460825283817, "loss": 5.0058, "mean_token_accuracy": 0.20604243278503417, "num_tokens": 103507790.0, "step": 59670 }, { "entropy": 5.853675270080567, "epoch": 4.642909939700448, "grad_norm": 1.5390625, "learning_rate": 0.00030311858443510383, "loss": 4.9146, "mean_token_accuracy": 0.21847673505544662, "num_tokens": 103516452.0, "step": 59675 }, { "entropy": 5.857326364517212, "epoch": 4.643298969072165, "grad_norm": 1.53125, "learning_rate": 0.0003030910859151712, "loss": 4.896, "mean_token_accuracy": 0.22030945420265197, "num_tokens": 103524330.0, "step": 59680 }, { "entropy": 5.888177299499512, "epoch": 4.643687998443882, "grad_norm": 1.390625, "learning_rate": 0.00030306358696900114, "loss": 4.9502, "mean_token_accuracy": 0.21369877755641936, "num_tokens": 103533202.0, "step": 59685 }, { "entropy": 5.909259223937989, "epoch": 4.6440770278156, "grad_norm": 1.421875, "learning_rate": 0.00030303608759701077, "loss": 4.9344, "mean_token_accuracy": 0.21647596955299378, "num_tokens": 103542036.0, "step": 59690 }, { "entropy": 5.859219217300415, "epoch": 4.6444660571873175, "grad_norm": 1.3984375, "learning_rate": 0.0003030085877996174, "loss": 4.9061, "mean_token_accuracy": 0.21241712868213652, "num_tokens": 103551187.0, "step": 59695 }, { "entropy": 5.833377981185913, "epoch": 4.644855086559035, "grad_norm": 1.4921875, "learning_rate": 0.00030298108757723823, "loss": 4.8963, "mean_token_accuracy": 0.21887923926115035, "num_tokens": 103559112.0, "step": 59700 }, { "entropy": 5.849860572814942, "epoch": 4.645244115930753, "grad_norm": 1.4140625, "learning_rate": 0.0003029535869302906, "loss": 4.8744, "mean_token_accuracy": 0.22058966159820556, "num_tokens": 103566897.0, "step": 59705 }, { "entropy": 5.885828447341919, "epoch": 4.645633145302471, "grad_norm": 1.375, "learning_rate": 0.00030292608585919185, "loss": 4.9382, "mean_token_accuracy": 0.2080690383911133, "num_tokens": 103576638.0, "step": 59710 }, { "entropy": 5.858506679534912, "epoch": 4.646022174674188, "grad_norm": 1.4140625, "learning_rate": 0.00030289858436435916, "loss": 4.9986, "mean_token_accuracy": 0.21105299293994903, "num_tokens": 103586086.0, "step": 59715 }, { "entropy": 5.856296491622925, "epoch": 4.646411204045905, "grad_norm": 1.390625, "learning_rate": 0.00030287108244620993, "loss": 4.9144, "mean_token_accuracy": 0.21640200167894363, "num_tokens": 103594686.0, "step": 59720 }, { "entropy": 5.859839391708374, "epoch": 4.646800233417623, "grad_norm": 1.3671875, "learning_rate": 0.00030284358010516135, "loss": 4.9404, "mean_token_accuracy": 0.21841688454151154, "num_tokens": 103603657.0, "step": 59725 }, { "entropy": 5.868320512771606, "epoch": 4.6471892627893405, "grad_norm": 1.3984375, "learning_rate": 0.0003028160773416307, "loss": 4.9862, "mean_token_accuracy": 0.21776659339666365, "num_tokens": 103612431.0, "step": 59730 }, { "entropy": 5.774597644805908, "epoch": 4.647578292161058, "grad_norm": 1.3984375, "learning_rate": 0.00030278857415603534, "loss": 4.8327, "mean_token_accuracy": 0.22534109801054, "num_tokens": 103621552.0, "step": 59735 }, { "entropy": 5.827893161773682, "epoch": 4.647967321532776, "grad_norm": 1.3828125, "learning_rate": 0.00030276107054879263, "loss": 4.8537, "mean_token_accuracy": 0.21908195018768312, "num_tokens": 103629751.0, "step": 59740 }, { "entropy": 5.848880863189697, "epoch": 4.648356350904494, "grad_norm": 1.4609375, "learning_rate": 0.00030273356652031993, "loss": 4.8996, "mean_token_accuracy": 0.2170646533370018, "num_tokens": 103638759.0, "step": 59745 }, { "entropy": 5.895599365234375, "epoch": 4.64874538027621, "grad_norm": 1.4375, "learning_rate": 0.0003027060620710344, "loss": 5.0026, "mean_token_accuracy": 0.21032555103302003, "num_tokens": 103647234.0, "step": 59750 }, { "entropy": 5.914074182510376, "epoch": 4.649134409647928, "grad_norm": 1.4921875, "learning_rate": 0.00030267855720135343, "loss": 4.8875, "mean_token_accuracy": 0.22329861372709275, "num_tokens": 103655494.0, "step": 59755 }, { "entropy": 5.839802598953247, "epoch": 4.649523439019646, "grad_norm": 1.4375, "learning_rate": 0.0003026510519116946, "loss": 4.9505, "mean_token_accuracy": 0.2151003360748291, "num_tokens": 103664704.0, "step": 59760 }, { "entropy": 5.908935022354126, "epoch": 4.6499124683913635, "grad_norm": 1.5546875, "learning_rate": 0.000302623546202475, "loss": 5.005, "mean_token_accuracy": 0.21299708038568496, "num_tokens": 103673324.0, "step": 59765 }, { "entropy": 5.890066051483155, "epoch": 4.650301497763081, "grad_norm": 1.5078125, "learning_rate": 0.0003025960400741119, "loss": 4.9449, "mean_token_accuracy": 0.21138421595096588, "num_tokens": 103682047.0, "step": 59770 }, { "entropy": 5.842965936660766, "epoch": 4.650690527134799, "grad_norm": 1.421875, "learning_rate": 0.000302568533527023, "loss": 4.9352, "mean_token_accuracy": 0.21679498106241227, "num_tokens": 103689988.0, "step": 59775 }, { "entropy": 5.801271057128906, "epoch": 4.651079556506517, "grad_norm": 1.3828125, "learning_rate": 0.0003025410265616254, "loss": 4.9212, "mean_token_accuracy": 0.21567331552505492, "num_tokens": 103698760.0, "step": 59780 }, { "entropy": 5.840758562088013, "epoch": 4.651468585878233, "grad_norm": 1.546875, "learning_rate": 0.0003025135191783366, "loss": 4.8826, "mean_token_accuracy": 0.22327022701501847, "num_tokens": 103706984.0, "step": 59785 }, { "entropy": 5.895548534393311, "epoch": 4.651857615249951, "grad_norm": 1.359375, "learning_rate": 0.00030248601137757394, "loss": 4.9389, "mean_token_accuracy": 0.21195153445005416, "num_tokens": 103715555.0, "step": 59790 }, { "entropy": 5.93115234375, "epoch": 4.652246644621669, "grad_norm": 1.40625, "learning_rate": 0.0003024585031597547, "loss": 4.9865, "mean_token_accuracy": 0.22227016985416412, "num_tokens": 103723859.0, "step": 59795 }, { "entropy": 5.823552131652832, "epoch": 4.6526356739933865, "grad_norm": 1.390625, "learning_rate": 0.0003024309945252965, "loss": 4.8988, "mean_token_accuracy": 0.22826244682073593, "num_tokens": 103732978.0, "step": 59800 }, { "entropy": 5.88531756401062, "epoch": 4.653024703365104, "grad_norm": 1.5859375, "learning_rate": 0.00030240348547461653, "loss": 4.9291, "mean_token_accuracy": 0.21223229318857192, "num_tokens": 103741148.0, "step": 59805 }, { "entropy": 5.87237958908081, "epoch": 4.653413732736822, "grad_norm": 1.453125, "learning_rate": 0.00030237597600813235, "loss": 5.0025, "mean_token_accuracy": 0.21004888713359832, "num_tokens": 103749997.0, "step": 59810 }, { "entropy": 5.845847129821777, "epoch": 4.653802762108539, "grad_norm": 1.453125, "learning_rate": 0.0003023484661262613, "loss": 4.9241, "mean_token_accuracy": 0.21808658093214034, "num_tokens": 103758177.0, "step": 59815 }, { "entropy": 5.876063966751099, "epoch": 4.654191791480256, "grad_norm": 1.453125, "learning_rate": 0.0003023209558294208, "loss": 4.9123, "mean_token_accuracy": 0.22040603309869766, "num_tokens": 103766319.0, "step": 59820 }, { "entropy": 5.918611764907837, "epoch": 4.654580820851974, "grad_norm": 1.4140625, "learning_rate": 0.00030229344511802824, "loss": 5.0253, "mean_token_accuracy": 0.2104274719953537, "num_tokens": 103776294.0, "step": 59825 }, { "entropy": 5.940850305557251, "epoch": 4.654969850223692, "grad_norm": 1.359375, "learning_rate": 0.00030226593399250114, "loss": 5.001, "mean_token_accuracy": 0.20811597406864166, "num_tokens": 103785456.0, "step": 59830 }, { "entropy": 5.89050407409668, "epoch": 4.6553588795954095, "grad_norm": 1.4375, "learning_rate": 0.00030223842245325687, "loss": 4.9073, "mean_token_accuracy": 0.22222172021865844, "num_tokens": 103793944.0, "step": 59835 }, { "entropy": 5.8901543617248535, "epoch": 4.655747908967127, "grad_norm": 1.3671875, "learning_rate": 0.00030221091050071293, "loss": 4.9797, "mean_token_accuracy": 0.21411545127630233, "num_tokens": 103803394.0, "step": 59840 }, { "entropy": 5.874813079833984, "epoch": 4.656136938338845, "grad_norm": 1.46875, "learning_rate": 0.00030218339813528665, "loss": 4.9091, "mean_token_accuracy": 0.22128608971834182, "num_tokens": 103812649.0, "step": 59845 }, { "entropy": 5.839220762252808, "epoch": 4.656525967710563, "grad_norm": 1.4375, "learning_rate": 0.0003021558853573957, "loss": 4.8865, "mean_token_accuracy": 0.21868777126073838, "num_tokens": 103820774.0, "step": 59850 }, { "entropy": 5.794312763214111, "epoch": 4.656914997082279, "grad_norm": 1.4765625, "learning_rate": 0.0003021283721674573, "loss": 4.8946, "mean_token_accuracy": 0.22236402779817582, "num_tokens": 103828996.0, "step": 59855 }, { "entropy": 5.8107929706573485, "epoch": 4.657304026453997, "grad_norm": 1.5234375, "learning_rate": 0.0003021008585658891, "loss": 4.8558, "mean_token_accuracy": 0.22290112376213073, "num_tokens": 103836833.0, "step": 59860 }, { "entropy": 5.824314928054809, "epoch": 4.657693055825715, "grad_norm": 1.3515625, "learning_rate": 0.00030207334455310846, "loss": 4.949, "mean_token_accuracy": 0.21553080081939696, "num_tokens": 103845433.0, "step": 59865 }, { "entropy": 5.868732643127442, "epoch": 4.6580820851974325, "grad_norm": 1.5, "learning_rate": 0.0003020458301295329, "loss": 4.9743, "mean_token_accuracy": 0.21500066220760344, "num_tokens": 103853613.0, "step": 59870 }, { "entropy": 5.92473578453064, "epoch": 4.65847111456915, "grad_norm": 1.3359375, "learning_rate": 0.00030201831529557994, "loss": 5.0254, "mean_token_accuracy": 0.20314482748508453, "num_tokens": 103861773.0, "step": 59875 }, { "entropy": 5.962489461898803, "epoch": 4.658860143940868, "grad_norm": 1.5390625, "learning_rate": 0.0003019908000516671, "loss": 5.0633, "mean_token_accuracy": 0.20798769295215608, "num_tokens": 103870432.0, "step": 59880 }, { "entropy": 5.951323175430298, "epoch": 4.659249173312585, "grad_norm": 1.359375, "learning_rate": 0.0003019632843982117, "loss": 4.918, "mean_token_accuracy": 0.2205438047647476, "num_tokens": 103879169.0, "step": 59885 }, { "entropy": 5.848997926712036, "epoch": 4.659638202684302, "grad_norm": 1.40625, "learning_rate": 0.00030193576833563153, "loss": 4.8894, "mean_token_accuracy": 0.22047965079545975, "num_tokens": 103887441.0, "step": 59890 }, { "entropy": 5.871990203857422, "epoch": 4.66002723205602, "grad_norm": 1.34375, "learning_rate": 0.0003019082518643438, "loss": 4.9959, "mean_token_accuracy": 0.2075105756521225, "num_tokens": 103895986.0, "step": 59895 }, { "entropy": 5.78333101272583, "epoch": 4.660416261427738, "grad_norm": 1.4609375, "learning_rate": 0.00030188073498476633, "loss": 4.8346, "mean_token_accuracy": 0.21951931565999985, "num_tokens": 103904623.0, "step": 59900 }, { "entropy": 5.832269382476807, "epoch": 4.6608052907994555, "grad_norm": 1.3359375, "learning_rate": 0.0003018532176973163, "loss": 4.9149, "mean_token_accuracy": 0.21452962458133698, "num_tokens": 103913553.0, "step": 59905 }, { "entropy": 5.887924242019653, "epoch": 4.661194320171173, "grad_norm": 1.4765625, "learning_rate": 0.00030182570000241154, "loss": 4.9651, "mean_token_accuracy": 0.21840872019529342, "num_tokens": 103922199.0, "step": 59910 }, { "entropy": 5.8273358821868895, "epoch": 4.661583349542891, "grad_norm": 1.4296875, "learning_rate": 0.0003017981819004696, "loss": 4.8968, "mean_token_accuracy": 0.218083156645298, "num_tokens": 103930607.0, "step": 59915 }, { "entropy": 5.941971492767334, "epoch": 4.661972378914608, "grad_norm": 1.4609375, "learning_rate": 0.0003017706633919078, "loss": 5.0277, "mean_token_accuracy": 0.21708817034959793, "num_tokens": 103938710.0, "step": 59920 }, { "entropy": 5.796772909164429, "epoch": 4.662361408286325, "grad_norm": 1.5390625, "learning_rate": 0.0003017431444771437, "loss": 4.8996, "mean_token_accuracy": 0.21933989226818085, "num_tokens": 103947666.0, "step": 59925 }, { "entropy": 5.855378532409668, "epoch": 4.662750437658043, "grad_norm": 1.5078125, "learning_rate": 0.00030171562515659504, "loss": 4.904, "mean_token_accuracy": 0.21859604865312576, "num_tokens": 103955611.0, "step": 59930 }, { "entropy": 5.831744956970215, "epoch": 4.663139467029761, "grad_norm": 1.40625, "learning_rate": 0.0003016881054306793, "loss": 4.8929, "mean_token_accuracy": 0.22010291814804078, "num_tokens": 103964418.0, "step": 59935 }, { "entropy": 5.906565189361572, "epoch": 4.6635284964014785, "grad_norm": 1.53125, "learning_rate": 0.0003016605852998139, "loss": 4.9425, "mean_token_accuracy": 0.2218442365527153, "num_tokens": 103973089.0, "step": 59940 }, { "entropy": 5.946289825439453, "epoch": 4.663917525773196, "grad_norm": 1.390625, "learning_rate": 0.00030163306476441675, "loss": 4.9176, "mean_token_accuracy": 0.21418512016534805, "num_tokens": 103981508.0, "step": 59945 }, { "entropy": 5.847855567932129, "epoch": 4.664306555144913, "grad_norm": 1.4765625, "learning_rate": 0.0003016055438249051, "loss": 4.8829, "mean_token_accuracy": 0.22297352701425552, "num_tokens": 103990493.0, "step": 59950 }, { "entropy": 5.881373739242553, "epoch": 4.664695584516631, "grad_norm": 1.40625, "learning_rate": 0.0003015780224816968, "loss": 5.0082, "mean_token_accuracy": 0.21325118690729142, "num_tokens": 103998816.0, "step": 59955 }, { "entropy": 5.901629066467285, "epoch": 4.665084613888348, "grad_norm": 1.4375, "learning_rate": 0.0003015505007352093, "loss": 4.8895, "mean_token_accuracy": 0.2207338735461235, "num_tokens": 104007243.0, "step": 59960 }, { "entropy": 5.947420215606689, "epoch": 4.665473643260066, "grad_norm": 1.4453125, "learning_rate": 0.00030152297858586016, "loss": 4.9417, "mean_token_accuracy": 0.21228749454021453, "num_tokens": 104016457.0, "step": 59965 }, { "entropy": 5.92833948135376, "epoch": 4.665862672631784, "grad_norm": 1.4296875, "learning_rate": 0.00030149545603406694, "loss": 4.9223, "mean_token_accuracy": 0.21832142025232315, "num_tokens": 104024599.0, "step": 59970 }, { "entropy": 5.837838459014892, "epoch": 4.6662517020035015, "grad_norm": 1.421875, "learning_rate": 0.0003014679330802474, "loss": 4.8524, "mean_token_accuracy": 0.21554409712553024, "num_tokens": 104033142.0, "step": 59975 }, { "entropy": 5.723985815048218, "epoch": 4.666640731375219, "grad_norm": 1.3828125, "learning_rate": 0.00030144040972481916, "loss": 4.8339, "mean_token_accuracy": 0.22220911532640458, "num_tokens": 104041843.0, "step": 59980 }, { "entropy": 5.850904226303101, "epoch": 4.667029760746937, "grad_norm": 1.40625, "learning_rate": 0.00030141288596819977, "loss": 4.9141, "mean_token_accuracy": 0.22250752598047258, "num_tokens": 104050085.0, "step": 59985 }, { "entropy": 5.791503143310547, "epoch": 4.667418790118654, "grad_norm": 1.4375, "learning_rate": 0.00030138536181080683, "loss": 4.9237, "mean_token_accuracy": 0.21352809071540832, "num_tokens": 104058199.0, "step": 59990 }, { "entropy": 5.93329005241394, "epoch": 4.667807819490371, "grad_norm": 1.53125, "learning_rate": 0.00030135783725305815, "loss": 4.9681, "mean_token_accuracy": 0.2120254695415497, "num_tokens": 104066829.0, "step": 59995 }, { "entropy": 5.912546014785766, "epoch": 4.668196848862089, "grad_norm": 1.515625, "learning_rate": 0.0003013303122953712, "loss": 5.0379, "mean_token_accuracy": 0.2081070736050606, "num_tokens": 104075253.0, "step": 60000 }, { "epoch": 4.668196848862089, "eval_entropy": 5.548210504768672, "eval_loss": 5.039699077606201, "eval_mean_token_accuracy": 0.22027882334558407, "eval_num_tokens": 104075253.0, "eval_runtime": 21.9223, "eval_samples_per_second": 1895.695, "eval_steps_per_second": 236.973, "step": 60000 }, { "entropy": 5.8073512554168705, "epoch": 4.668585878233807, "grad_norm": 1.3515625, "learning_rate": 0.0003013027869381635, "loss": 4.8123, "mean_token_accuracy": 0.22235798686742783, "num_tokens": 104083591.0, "step": 60005 }, { "entropy": 5.875702381134033, "epoch": 4.6689749076055245, "grad_norm": 1.3828125, "learning_rate": 0.000301275261181853, "loss": 5.0009, "mean_token_accuracy": 0.21182302832603456, "num_tokens": 104092390.0, "step": 60010 }, { "entropy": 5.885676527023316, "epoch": 4.669363936977242, "grad_norm": 1.5234375, "learning_rate": 0.0003012477350268572, "loss": 4.9737, "mean_token_accuracy": 0.21051882654428483, "num_tokens": 104100720.0, "step": 60015 }, { "entropy": 5.825570344924927, "epoch": 4.669752966348959, "grad_norm": 1.421875, "learning_rate": 0.00030122020847359385, "loss": 4.8634, "mean_token_accuracy": 0.2248877614736557, "num_tokens": 104109067.0, "step": 60020 }, { "entropy": 5.911455535888672, "epoch": 4.670141995720677, "grad_norm": 1.3203125, "learning_rate": 0.0003011926815224805, "loss": 5.0711, "mean_token_accuracy": 0.20712292492389678, "num_tokens": 104118615.0, "step": 60025 }, { "entropy": 5.8828950881958, "epoch": 4.670531025092394, "grad_norm": 1.4296875, "learning_rate": 0.00030116515417393495, "loss": 4.9948, "mean_token_accuracy": 0.20596571564674376, "num_tokens": 104126491.0, "step": 60030 }, { "entropy": 5.882551479339599, "epoch": 4.670920054464112, "grad_norm": 1.4375, "learning_rate": 0.00030113762642837487, "loss": 4.9067, "mean_token_accuracy": 0.21406277716159822, "num_tokens": 104135116.0, "step": 60035 }, { "entropy": 5.839541912078857, "epoch": 4.67130908383583, "grad_norm": 1.4453125, "learning_rate": 0.00030111009828621786, "loss": 4.8869, "mean_token_accuracy": 0.23054458051919938, "num_tokens": 104143581.0, "step": 60040 }, { "entropy": 5.85173716545105, "epoch": 4.6716981132075475, "grad_norm": 1.40625, "learning_rate": 0.0003010825697478817, "loss": 4.9295, "mean_token_accuracy": 0.21227352023124696, "num_tokens": 104152425.0, "step": 60045 }, { "entropy": 5.832494926452637, "epoch": 4.672087142579265, "grad_norm": 1.4140625, "learning_rate": 0.000301055040813784, "loss": 4.9888, "mean_token_accuracy": 0.2069002076983452, "num_tokens": 104160947.0, "step": 60050 }, { "entropy": 5.869179582595825, "epoch": 4.672476171950982, "grad_norm": 1.3125, "learning_rate": 0.00030102751148434255, "loss": 4.8987, "mean_token_accuracy": 0.208969384431839, "num_tokens": 104170012.0, "step": 60055 }, { "entropy": 5.961619329452515, "epoch": 4.6728652013227, "grad_norm": 1.3984375, "learning_rate": 0.000300999981759975, "loss": 4.9812, "mean_token_accuracy": 0.21854636669158936, "num_tokens": 104179331.0, "step": 60060 }, { "entropy": 5.918593215942383, "epoch": 4.673254230694417, "grad_norm": 1.40625, "learning_rate": 0.0003009724516410992, "loss": 4.9508, "mean_token_accuracy": 0.21699300557374954, "num_tokens": 104188411.0, "step": 60065 }, { "entropy": 5.825111150741577, "epoch": 4.673643260066135, "grad_norm": 1.421875, "learning_rate": 0.0003009449211281328, "loss": 4.8691, "mean_token_accuracy": 0.22157978713512422, "num_tokens": 104196805.0, "step": 60070 }, { "entropy": 5.943280172348023, "epoch": 4.674032289437853, "grad_norm": 1.3359375, "learning_rate": 0.0003009173902214934, "loss": 5.0332, "mean_token_accuracy": 0.20735466927289964, "num_tokens": 104204877.0, "step": 60075 }, { "entropy": 5.87695574760437, "epoch": 4.6744213188095705, "grad_norm": 1.3984375, "learning_rate": 0.0003008898589215989, "loss": 4.9117, "mean_token_accuracy": 0.2152958557009697, "num_tokens": 104213263.0, "step": 60080 }, { "entropy": 5.893117046356201, "epoch": 4.674810348181287, "grad_norm": 1.421875, "learning_rate": 0.00030086232722886704, "loss": 4.9218, "mean_token_accuracy": 0.22272181510925293, "num_tokens": 104221646.0, "step": 60085 }, { "entropy": 5.938587808609009, "epoch": 4.675199377553005, "grad_norm": 1.3046875, "learning_rate": 0.00030083479514371545, "loss": 5.0169, "mean_token_accuracy": 0.2050196722149849, "num_tokens": 104230691.0, "step": 60090 }, { "entropy": 5.905352163314819, "epoch": 4.675588406924723, "grad_norm": 1.375, "learning_rate": 0.00030080726266656205, "loss": 4.9599, "mean_token_accuracy": 0.21153706014156343, "num_tokens": 104239718.0, "step": 60095 }, { "entropy": 5.952654886245727, "epoch": 4.67597743629644, "grad_norm": 1.5390625, "learning_rate": 0.0003007797297978245, "loss": 5.14, "mean_token_accuracy": 0.20426367223262787, "num_tokens": 104249312.0, "step": 60100 }, { "entropy": 5.9503316402435305, "epoch": 4.676366465668158, "grad_norm": 1.4375, "learning_rate": 0.0003007521965379206, "loss": 4.9955, "mean_token_accuracy": 0.21429689973592758, "num_tokens": 104258499.0, "step": 60105 }, { "entropy": 5.914454317092895, "epoch": 4.676755495039876, "grad_norm": 1.3359375, "learning_rate": 0.000300724662887268, "loss": 4.891, "mean_token_accuracy": 0.22587245404720308, "num_tokens": 104266870.0, "step": 60110 }, { "entropy": 5.904830837249756, "epoch": 4.6771445244115935, "grad_norm": 1.3046875, "learning_rate": 0.00030069712884628477, "loss": 4.9227, "mean_token_accuracy": 0.21844279021024704, "num_tokens": 104275633.0, "step": 60115 }, { "entropy": 5.868472003936768, "epoch": 4.67753355378331, "grad_norm": 1.6015625, "learning_rate": 0.0003006695944153883, "loss": 4.9191, "mean_token_accuracy": 0.21609628200531006, "num_tokens": 104283115.0, "step": 60120 }, { "entropy": 5.834436655044556, "epoch": 4.677922583155028, "grad_norm": 1.4296875, "learning_rate": 0.0003006420595949967, "loss": 4.8739, "mean_token_accuracy": 0.21145954430103303, "num_tokens": 104291948.0, "step": 60125 }, { "entropy": 5.863365221023559, "epoch": 4.678311612526746, "grad_norm": 1.4453125, "learning_rate": 0.00030061452438552767, "loss": 4.8993, "mean_token_accuracy": 0.21550666242837907, "num_tokens": 104300617.0, "step": 60130 }, { "entropy": 5.924694585800171, "epoch": 4.678700641898463, "grad_norm": 1.3359375, "learning_rate": 0.000300586988787399, "loss": 4.981, "mean_token_accuracy": 0.21485516726970671, "num_tokens": 104310159.0, "step": 60135 }, { "entropy": 5.884992265701294, "epoch": 4.679089671270181, "grad_norm": 1.4453125, "learning_rate": 0.00030055945280102844, "loss": 4.9947, "mean_token_accuracy": 0.2185334011912346, "num_tokens": 104319116.0, "step": 60140 }, { "entropy": 5.815712308883667, "epoch": 4.679478700641899, "grad_norm": 1.21875, "learning_rate": 0.00030053191642683393, "loss": 4.9279, "mean_token_accuracy": 0.21108656376600266, "num_tokens": 104328702.0, "step": 60145 }, { "entropy": 5.915642166137696, "epoch": 4.679867730013616, "grad_norm": 1.40625, "learning_rate": 0.0003005043796652332, "loss": 4.9228, "mean_token_accuracy": 0.220018470287323, "num_tokens": 104337962.0, "step": 60150 }, { "entropy": 5.943922519683838, "epoch": 4.680256759385333, "grad_norm": 1.3671875, "learning_rate": 0.00030047684251664417, "loss": 5.0259, "mean_token_accuracy": 0.21268443614244462, "num_tokens": 104347018.0, "step": 60155 }, { "entropy": 5.738276100158691, "epoch": 4.680645788757051, "grad_norm": 1.3828125, "learning_rate": 0.0003004493049814845, "loss": 4.8402, "mean_token_accuracy": 0.21763478070497513, "num_tokens": 104355741.0, "step": 60160 }, { "entropy": 5.8864391326904295, "epoch": 4.681034818128769, "grad_norm": 1.3046875, "learning_rate": 0.00030042176706017215, "loss": 4.9682, "mean_token_accuracy": 0.2185603216290474, "num_tokens": 104364003.0, "step": 60165 }, { "entropy": 5.9038321018219, "epoch": 4.681423847500486, "grad_norm": 1.46875, "learning_rate": 0.00030039422875312495, "loss": 4.9112, "mean_token_accuracy": 0.22179186791181565, "num_tokens": 104372611.0, "step": 60170 }, { "entropy": 5.821865177154541, "epoch": 4.681812876872204, "grad_norm": 1.46875, "learning_rate": 0.00030036669006076075, "loss": 4.819, "mean_token_accuracy": 0.22382308542728424, "num_tokens": 104380372.0, "step": 60175 }, { "entropy": 5.827333641052246, "epoch": 4.682201906243922, "grad_norm": 1.359375, "learning_rate": 0.00030033915098349746, "loss": 4.8978, "mean_token_accuracy": 0.2279147431254387, "num_tokens": 104388874.0, "step": 60180 }, { "entropy": 5.8256481170654295, "epoch": 4.682590935615639, "grad_norm": 1.375, "learning_rate": 0.0003003116115217529, "loss": 4.9145, "mean_token_accuracy": 0.21989302933216096, "num_tokens": 104397446.0, "step": 60185 }, { "entropy": 5.918598175048828, "epoch": 4.682979964987356, "grad_norm": 1.3203125, "learning_rate": 0.00030028407167594486, "loss": 5.0024, "mean_token_accuracy": 0.21145930290222167, "num_tokens": 104406242.0, "step": 60190 }, { "entropy": 5.849095964431763, "epoch": 4.683368994359074, "grad_norm": 1.5390625, "learning_rate": 0.0003002565314464913, "loss": 4.9666, "mean_token_accuracy": 0.2099806025624275, "num_tokens": 104415110.0, "step": 60195 }, { "entropy": 5.855722332000733, "epoch": 4.683758023730792, "grad_norm": 1.40625, "learning_rate": 0.00030022899083381006, "loss": 4.9451, "mean_token_accuracy": 0.2184421554207802, "num_tokens": 104423903.0, "step": 60200 }, { "entropy": 5.841151905059815, "epoch": 4.684147053102509, "grad_norm": 1.3359375, "learning_rate": 0.000300201449838319, "loss": 4.8831, "mean_token_accuracy": 0.2301768481731415, "num_tokens": 104432273.0, "step": 60205 }, { "entropy": 5.92961277961731, "epoch": 4.684536082474227, "grad_norm": 1.328125, "learning_rate": 0.0003001739084604361, "loss": 5.0054, "mean_token_accuracy": 0.2135171189904213, "num_tokens": 104441579.0, "step": 60210 }, { "entropy": 5.8498612403869625, "epoch": 4.684925111845945, "grad_norm": 1.4921875, "learning_rate": 0.00030014636670057913, "loss": 4.9364, "mean_token_accuracy": 0.22165418416261673, "num_tokens": 104450501.0, "step": 60215 }, { "entropy": 5.8545387268066404, "epoch": 4.6853141412176615, "grad_norm": 1.375, "learning_rate": 0.0003001188245591662, "loss": 5.0332, "mean_token_accuracy": 0.21163256615400314, "num_tokens": 104458422.0, "step": 60220 }, { "entropy": 5.9001185417175295, "epoch": 4.685703170589379, "grad_norm": 1.453125, "learning_rate": 0.0003000912820366151, "loss": 4.8853, "mean_token_accuracy": 0.22065775394439696, "num_tokens": 104466567.0, "step": 60225 }, { "entropy": 5.862979888916016, "epoch": 4.686092199961097, "grad_norm": 1.546875, "learning_rate": 0.00030006373913334366, "loss": 4.945, "mean_token_accuracy": 0.21588771939277648, "num_tokens": 104474720.0, "step": 60230 }, { "entropy": 5.919897222518921, "epoch": 4.686481229332815, "grad_norm": 1.5, "learning_rate": 0.0003000361958497699, "loss": 4.9432, "mean_token_accuracy": 0.21423268169164658, "num_tokens": 104483759.0, "step": 60235 }, { "entropy": 5.828099393844605, "epoch": 4.686870258704532, "grad_norm": 1.4453125, "learning_rate": 0.0003000086521863116, "loss": 4.8788, "mean_token_accuracy": 0.2241627112030983, "num_tokens": 104492807.0, "step": 60240 }, { "entropy": 5.856683921813965, "epoch": 4.68725928807625, "grad_norm": 1.4609375, "learning_rate": 0.000299981108143387, "loss": 5.0408, "mean_token_accuracy": 0.20561813563108444, "num_tokens": 104500776.0, "step": 60245 }, { "entropy": 5.905717182159424, "epoch": 4.687648317447968, "grad_norm": 1.453125, "learning_rate": 0.00029995356372141367, "loss": 4.9935, "mean_token_accuracy": 0.21272501200437546, "num_tokens": 104509686.0, "step": 60250 }, { "entropy": 5.953820657730103, "epoch": 4.6880373468196845, "grad_norm": 1.421875, "learning_rate": 0.0002999260189208098, "loss": 5.0104, "mean_token_accuracy": 0.21152054220438005, "num_tokens": 104518021.0, "step": 60255 }, { "entropy": 5.888211107254028, "epoch": 4.688426376191402, "grad_norm": 1.3671875, "learning_rate": 0.00029989847374199333, "loss": 4.941, "mean_token_accuracy": 0.22456591874361037, "num_tokens": 104527786.0, "step": 60260 }, { "entropy": 5.855815982818603, "epoch": 4.68881540556312, "grad_norm": 1.46875, "learning_rate": 0.00029987092818538217, "loss": 4.9316, "mean_token_accuracy": 0.2200021490454674, "num_tokens": 104536591.0, "step": 60265 }, { "entropy": 5.918423986434936, "epoch": 4.689204434934838, "grad_norm": 1.4375, "learning_rate": 0.00029984338225139405, "loss": 4.9931, "mean_token_accuracy": 0.2107619822025299, "num_tokens": 104544836.0, "step": 60270 }, { "entropy": 5.874045085906983, "epoch": 4.689593464306555, "grad_norm": 1.3515625, "learning_rate": 0.0002998158359404473, "loss": 4.9036, "mean_token_accuracy": 0.2178718402981758, "num_tokens": 104554190.0, "step": 60275 }, { "entropy": 5.819086599349975, "epoch": 4.689982493678273, "grad_norm": 1.4375, "learning_rate": 0.0002997882892529597, "loss": 4.9219, "mean_token_accuracy": 0.21803646683692932, "num_tokens": 104562263.0, "step": 60280 }, { "entropy": 5.8563450336456295, "epoch": 4.69037152304999, "grad_norm": 1.359375, "learning_rate": 0.0002997607421893493, "loss": 5.015, "mean_token_accuracy": 0.2000938430428505, "num_tokens": 104570839.0, "step": 60285 }, { "entropy": 5.84790267944336, "epoch": 4.6907605524217075, "grad_norm": 1.5078125, "learning_rate": 0.000299733194750034, "loss": 4.8578, "mean_token_accuracy": 0.22848785072565078, "num_tokens": 104579455.0, "step": 60290 }, { "entropy": 5.936744451522827, "epoch": 4.691149581793425, "grad_norm": 1.328125, "learning_rate": 0.0002997056469354319, "loss": 5.0743, "mean_token_accuracy": 0.2031017690896988, "num_tokens": 104588583.0, "step": 60295 }, { "entropy": 5.9411803722381595, "epoch": 4.691538611165143, "grad_norm": 1.4140625, "learning_rate": 0.0002996780987459609, "loss": 4.984, "mean_token_accuracy": 0.20797375589609146, "num_tokens": 104596976.0, "step": 60300 }, { "entropy": 5.933562898635865, "epoch": 4.691927640536861, "grad_norm": 1.375, "learning_rate": 0.0002996505501820391, "loss": 5.0374, "mean_token_accuracy": 0.21112194508314133, "num_tokens": 104606063.0, "step": 60305 }, { "entropy": 5.808654403686523, "epoch": 4.692316669908578, "grad_norm": 1.4296875, "learning_rate": 0.0002996230012440843, "loss": 4.8829, "mean_token_accuracy": 0.2211732879281044, "num_tokens": 104614388.0, "step": 60310 }, { "entropy": 5.861419153213501, "epoch": 4.692705699280296, "grad_norm": 1.4921875, "learning_rate": 0.00029959545193251473, "loss": 4.9447, "mean_token_accuracy": 0.21734175682067872, "num_tokens": 104622704.0, "step": 60315 }, { "entropy": 5.970580816268921, "epoch": 4.693094728652014, "grad_norm": 1.5625, "learning_rate": 0.00029956790224774834, "loss": 4.9843, "mean_token_accuracy": 0.21356920897960663, "num_tokens": 104630796.0, "step": 60320 }, { "entropy": 5.870044803619384, "epoch": 4.6934837580237305, "grad_norm": 1.375, "learning_rate": 0.00029954035219020305, "loss": 4.8771, "mean_token_accuracy": 0.22100441455841063, "num_tokens": 104638984.0, "step": 60325 }, { "entropy": 5.874324369430542, "epoch": 4.693872787395448, "grad_norm": 1.2890625, "learning_rate": 0.00029951280176029703, "loss": 4.9814, "mean_token_accuracy": 0.21020882576704025, "num_tokens": 104647583.0, "step": 60330 }, { "entropy": 5.865918684005737, "epoch": 4.694261816767166, "grad_norm": 1.5390625, "learning_rate": 0.00029948525095844825, "loss": 4.9125, "mean_token_accuracy": 0.21297832876443862, "num_tokens": 104655664.0, "step": 60335 }, { "entropy": 5.8987079620361325, "epoch": 4.694650846138884, "grad_norm": 1.3984375, "learning_rate": 0.0002994576997850748, "loss": 4.8992, "mean_token_accuracy": 0.21728408485651016, "num_tokens": 104664081.0, "step": 60340 }, { "entropy": 5.811340999603272, "epoch": 4.695039875510601, "grad_norm": 1.46875, "learning_rate": 0.0002994301482405946, "loss": 4.8748, "mean_token_accuracy": 0.22392659336328508, "num_tokens": 104672751.0, "step": 60345 }, { "entropy": 5.898687076568604, "epoch": 4.695428904882318, "grad_norm": 1.421875, "learning_rate": 0.0002994025963254259, "loss": 4.9471, "mean_token_accuracy": 0.21644185483455658, "num_tokens": 104681957.0, "step": 60350 }, { "entropy": 5.830059385299682, "epoch": 4.695817934254036, "grad_norm": 1.3125, "learning_rate": 0.0002993750440399866, "loss": 4.8742, "mean_token_accuracy": 0.22976184338331224, "num_tokens": 104690563.0, "step": 60355 }, { "entropy": 5.882805109024048, "epoch": 4.6962069636257535, "grad_norm": 1.3671875, "learning_rate": 0.0002993474913846948, "loss": 5.0025, "mean_token_accuracy": 0.21103659719228746, "num_tokens": 104699228.0, "step": 60360 }, { "entropy": 5.903840780258179, "epoch": 4.696595992997471, "grad_norm": 1.390625, "learning_rate": 0.0002993199383599685, "loss": 5.0011, "mean_token_accuracy": 0.21501701921224595, "num_tokens": 104708942.0, "step": 60365 }, { "entropy": 5.9156616687774655, "epoch": 4.696985022369189, "grad_norm": 1.6015625, "learning_rate": 0.0002992923849662259, "loss": 4.9054, "mean_token_accuracy": 0.22286065816879272, "num_tokens": 104717345.0, "step": 60370 }, { "entropy": 5.877993631362915, "epoch": 4.697374051740907, "grad_norm": 1.3359375, "learning_rate": 0.00029926483120388506, "loss": 5.0098, "mean_token_accuracy": 0.2032250866293907, "num_tokens": 104726076.0, "step": 60375 }, { "entropy": 5.856709432601929, "epoch": 4.697763081112624, "grad_norm": 1.21875, "learning_rate": 0.000299237277073364, "loss": 4.9176, "mean_token_accuracy": 0.2181733474135399, "num_tokens": 104735370.0, "step": 60380 }, { "entropy": 5.961450147628784, "epoch": 4.698152110484342, "grad_norm": 1.3828125, "learning_rate": 0.0002992097225750808, "loss": 4.9735, "mean_token_accuracy": 0.21041541844606398, "num_tokens": 104744383.0, "step": 60385 }, { "entropy": 5.90102105140686, "epoch": 4.698541139856059, "grad_norm": 1.4140625, "learning_rate": 0.00029918216770945363, "loss": 4.9334, "mean_token_accuracy": 0.21675359606742858, "num_tokens": 104752880.0, "step": 60390 }, { "entropy": 5.936983203887939, "epoch": 4.6989301692277765, "grad_norm": 1.578125, "learning_rate": 0.0002991546124769005, "loss": 4.9954, "mean_token_accuracy": 0.2115202873945236, "num_tokens": 104761937.0, "step": 60395 }, { "entropy": 5.923001098632812, "epoch": 4.699319198599494, "grad_norm": 1.390625, "learning_rate": 0.0002991270568778396, "loss": 4.9122, "mean_token_accuracy": 0.21578485667705535, "num_tokens": 104770384.0, "step": 60400 }, { "entropy": 5.868461084365845, "epoch": 4.699708227971212, "grad_norm": 1.53125, "learning_rate": 0.0002990995009126891, "loss": 4.9732, "mean_token_accuracy": 0.2171441912651062, "num_tokens": 104780270.0, "step": 60405 }, { "entropy": 5.903707456588745, "epoch": 4.70009725734293, "grad_norm": 1.5234375, "learning_rate": 0.0002990719445818669, "loss": 4.8661, "mean_token_accuracy": 0.23120139837265014, "num_tokens": 104788444.0, "step": 60410 }, { "entropy": 5.900070762634277, "epoch": 4.700486286714647, "grad_norm": 1.2890625, "learning_rate": 0.0002990443878857914, "loss": 4.962, "mean_token_accuracy": 0.21701265424489974, "num_tokens": 104798218.0, "step": 60415 }, { "entropy": 5.870543384552002, "epoch": 4.700875316086364, "grad_norm": 1.53125, "learning_rate": 0.00029901683082488045, "loss": 4.9139, "mean_token_accuracy": 0.22498452365398408, "num_tokens": 104806044.0, "step": 60420 }, { "entropy": 5.828421020507813, "epoch": 4.701264345458082, "grad_norm": 1.3828125, "learning_rate": 0.0002989892733995524, "loss": 4.9002, "mean_token_accuracy": 0.21173701733350753, "num_tokens": 104814169.0, "step": 60425 }, { "entropy": 5.844472074508667, "epoch": 4.7016533748297995, "grad_norm": 1.453125, "learning_rate": 0.0002989617156102253, "loss": 4.9137, "mean_token_accuracy": 0.22543649822473527, "num_tokens": 104822677.0, "step": 60430 }, { "entropy": 5.8164306640625, "epoch": 4.702042404201517, "grad_norm": 1.4453125, "learning_rate": 0.0002989341574573172, "loss": 4.8029, "mean_token_accuracy": 0.2268856331706047, "num_tokens": 104831069.0, "step": 60435 }, { "entropy": 5.771519899368286, "epoch": 4.702431433573235, "grad_norm": 1.2578125, "learning_rate": 0.00029890659894124647, "loss": 4.8228, "mean_token_accuracy": 0.22566627115011215, "num_tokens": 104839935.0, "step": 60440 }, { "entropy": 5.851961517333985, "epoch": 4.702820462944953, "grad_norm": 1.4140625, "learning_rate": 0.0002988790400624312, "loss": 4.9649, "mean_token_accuracy": 0.21278622895479202, "num_tokens": 104849475.0, "step": 60445 }, { "entropy": 5.838829231262207, "epoch": 4.70320949231667, "grad_norm": 1.3828125, "learning_rate": 0.0002988514808212894, "loss": 4.9119, "mean_token_accuracy": 0.22033341526985167, "num_tokens": 104858269.0, "step": 60450 }, { "entropy": 5.923729372024536, "epoch": 4.703598521688387, "grad_norm": 1.484375, "learning_rate": 0.0002988239212182394, "loss": 4.9866, "mean_token_accuracy": 0.20864265114068986, "num_tokens": 104866811.0, "step": 60455 }, { "entropy": 5.976103067398071, "epoch": 4.703987551060105, "grad_norm": 1.640625, "learning_rate": 0.0002987963612536993, "loss": 4.9921, "mean_token_accuracy": 0.20870812088251114, "num_tokens": 104874762.0, "step": 60460 }, { "entropy": 5.79053840637207, "epoch": 4.7043765804318225, "grad_norm": 1.3984375, "learning_rate": 0.00029876880092808724, "loss": 4.7658, "mean_token_accuracy": 0.23350853472948074, "num_tokens": 104883594.0, "step": 60465 }, { "entropy": 5.905982589721679, "epoch": 4.70476560980354, "grad_norm": 1.484375, "learning_rate": 0.0002987412402418215, "loss": 5.012, "mean_token_accuracy": 0.22236628383398055, "num_tokens": 104892228.0, "step": 60470 }, { "entropy": 5.810678339004516, "epoch": 4.705154639175258, "grad_norm": 1.4140625, "learning_rate": 0.00029871367919532014, "loss": 4.9468, "mean_token_accuracy": 0.21275557577610016, "num_tokens": 104900639.0, "step": 60475 }, { "entropy": 5.803120183944702, "epoch": 4.705543668546976, "grad_norm": 1.4375, "learning_rate": 0.0002986861177890016, "loss": 4.8166, "mean_token_accuracy": 0.2304033651947975, "num_tokens": 104908110.0, "step": 60480 }, { "entropy": 5.869299411773682, "epoch": 4.705932697918692, "grad_norm": 1.4296875, "learning_rate": 0.0002986585560232838, "loss": 4.9235, "mean_token_accuracy": 0.22337280958890915, "num_tokens": 104916769.0, "step": 60485 }, { "entropy": 5.917542314529419, "epoch": 4.70632172729041, "grad_norm": 1.4921875, "learning_rate": 0.00029863099389858516, "loss": 4.952, "mean_token_accuracy": 0.2155241310596466, "num_tokens": 104925219.0, "step": 60490 }, { "entropy": 5.9612648487091064, "epoch": 4.706710756662128, "grad_norm": 1.53125, "learning_rate": 0.0002986034314153238, "loss": 5.0208, "mean_token_accuracy": 0.2075718328356743, "num_tokens": 104933786.0, "step": 60495 }, { "entropy": 5.896211624145508, "epoch": 4.7070997860338455, "grad_norm": 1.484375, "learning_rate": 0.00029857586857391796, "loss": 4.979, "mean_token_accuracy": 0.21739242672920228, "num_tokens": 104943261.0, "step": 60500 }, { "entropy": 5.884463262557984, "epoch": 4.707488815405563, "grad_norm": 1.53125, "learning_rate": 0.00029854830537478567, "loss": 4.8426, "mean_token_accuracy": 0.23152933418750762, "num_tokens": 104951031.0, "step": 60505 }, { "entropy": 5.917943286895752, "epoch": 4.707877844777281, "grad_norm": 1.4765625, "learning_rate": 0.00029852074181834545, "loss": 5.0359, "mean_token_accuracy": 0.21525523960590362, "num_tokens": 104959502.0, "step": 60510 }, { "entropy": 5.8966912746429445, "epoch": 4.708266874148999, "grad_norm": 1.4296875, "learning_rate": 0.00029849317790501536, "loss": 4.9392, "mean_token_accuracy": 0.21382590383291245, "num_tokens": 104967753.0, "step": 60515 }, { "entropy": 5.833817863464356, "epoch": 4.708655903520716, "grad_norm": 1.328125, "learning_rate": 0.00029846561363521375, "loss": 4.9056, "mean_token_accuracy": 0.21644620299339296, "num_tokens": 104976546.0, "step": 60520 }, { "entropy": 5.922440385818481, "epoch": 4.709044932892433, "grad_norm": 1.4375, "learning_rate": 0.0002984380490093588, "loss": 4.9974, "mean_token_accuracy": 0.21363983303308487, "num_tokens": 104984895.0, "step": 60525 }, { "entropy": 5.85637845993042, "epoch": 4.709433962264151, "grad_norm": 1.359375, "learning_rate": 0.0002984104840278687, "loss": 4.9644, "mean_token_accuracy": 0.2120603382587433, "num_tokens": 104993994.0, "step": 60530 }, { "entropy": 5.874888753890991, "epoch": 4.7098229916358685, "grad_norm": 1.375, "learning_rate": 0.0002983829186911618, "loss": 4.9576, "mean_token_accuracy": 0.21609596759080887, "num_tokens": 105003174.0, "step": 60535 }, { "entropy": 5.868549633026123, "epoch": 4.710212021007586, "grad_norm": 1.4140625, "learning_rate": 0.00029835535299965635, "loss": 4.8478, "mean_token_accuracy": 0.2201039507985115, "num_tokens": 105011734.0, "step": 60540 }, { "entropy": 5.906525182723999, "epoch": 4.710601050379304, "grad_norm": 1.234375, "learning_rate": 0.00029832778695377057, "loss": 4.9757, "mean_token_accuracy": 0.21255347579717637, "num_tokens": 105021656.0, "step": 60545 }, { "entropy": 5.872804784774781, "epoch": 4.710990079751022, "grad_norm": 1.375, "learning_rate": 0.00029830022055392277, "loss": 4.9292, "mean_token_accuracy": 0.2164387285709381, "num_tokens": 105030061.0, "step": 60550 }, { "entropy": 5.880702829360962, "epoch": 4.711379109122738, "grad_norm": 1.6640625, "learning_rate": 0.00029827265380053116, "loss": 4.984, "mean_token_accuracy": 0.20973785370588302, "num_tokens": 105038047.0, "step": 60555 }, { "entropy": 5.926590442657471, "epoch": 4.711768138494456, "grad_norm": 1.4296875, "learning_rate": 0.0002982450866940141, "loss": 5.0745, "mean_token_accuracy": 0.2051724448800087, "num_tokens": 105046691.0, "step": 60560 }, { "entropy": 5.77610592842102, "epoch": 4.712157167866174, "grad_norm": 1.453125, "learning_rate": 0.0002982175192347899, "loss": 4.8, "mean_token_accuracy": 0.21941739618778228, "num_tokens": 105054897.0, "step": 60565 }, { "entropy": 5.8982954025268555, "epoch": 4.7125461972378915, "grad_norm": 1.46875, "learning_rate": 0.0002981899514232767, "loss": 4.9566, "mean_token_accuracy": 0.21923065483570098, "num_tokens": 105063554.0, "step": 60570 }, { "entropy": 5.974019479751587, "epoch": 4.712935226609609, "grad_norm": 1.40625, "learning_rate": 0.000298162383259893, "loss": 5.0774, "mean_token_accuracy": 0.20524168759584427, "num_tokens": 105072555.0, "step": 60575 }, { "entropy": 5.83348536491394, "epoch": 4.713324255981327, "grad_norm": 1.3359375, "learning_rate": 0.00029813481474505693, "loss": 4.9033, "mean_token_accuracy": 0.21284767240285873, "num_tokens": 105081712.0, "step": 60580 }, { "entropy": 5.925499773025512, "epoch": 4.713713285353045, "grad_norm": 1.4140625, "learning_rate": 0.00029810724587918684, "loss": 4.9975, "mean_token_accuracy": 0.2083306059241295, "num_tokens": 105089963.0, "step": 60585 }, { "entropy": 5.906161069869995, "epoch": 4.714102314724761, "grad_norm": 1.5234375, "learning_rate": 0.0002980796766627012, "loss": 4.981, "mean_token_accuracy": 0.21710223108530044, "num_tokens": 105098584.0, "step": 60590 }, { "entropy": 5.8503645896911625, "epoch": 4.714491344096479, "grad_norm": 1.3046875, "learning_rate": 0.0002980521070960181, "loss": 4.9521, "mean_token_accuracy": 0.21807724833488465, "num_tokens": 105107042.0, "step": 60595 }, { "entropy": 5.890273332595825, "epoch": 4.714880373468197, "grad_norm": 1.5, "learning_rate": 0.00029802453717955597, "loss": 4.976, "mean_token_accuracy": 0.2159767359495163, "num_tokens": 105115323.0, "step": 60600 }, { "entropy": 5.928406715393066, "epoch": 4.7152694028399145, "grad_norm": 1.421875, "learning_rate": 0.0002979969669137332, "loss": 5.0427, "mean_token_accuracy": 0.20628589987754822, "num_tokens": 105124838.0, "step": 60605 }, { "entropy": 5.938727807998657, "epoch": 4.715658432211632, "grad_norm": 1.3671875, "learning_rate": 0.000297969396298968, "loss": 5.0011, "mean_token_accuracy": 0.20809753239154816, "num_tokens": 105133407.0, "step": 60610 }, { "entropy": 5.926307535171508, "epoch": 4.71604746158335, "grad_norm": 1.4375, "learning_rate": 0.0002979418253356788, "loss": 4.9517, "mean_token_accuracy": 0.21411479264497757, "num_tokens": 105142310.0, "step": 60615 }, { "entropy": 5.864467144012451, "epoch": 4.716436490955067, "grad_norm": 1.4609375, "learning_rate": 0.0002979142540242839, "loss": 4.9474, "mean_token_accuracy": 0.21570830345153807, "num_tokens": 105150536.0, "step": 60620 }, { "entropy": 5.798748922348023, "epoch": 4.716825520326784, "grad_norm": 1.53125, "learning_rate": 0.00029788668236520164, "loss": 4.8295, "mean_token_accuracy": 0.22521100342273712, "num_tokens": 105159543.0, "step": 60625 }, { "entropy": 5.854570579528809, "epoch": 4.717214549698502, "grad_norm": 1.3359375, "learning_rate": 0.00029785911035885046, "loss": 4.9045, "mean_token_accuracy": 0.2218244731426239, "num_tokens": 105168204.0, "step": 60630 }, { "entropy": 5.8912147045135494, "epoch": 4.71760357907022, "grad_norm": 1.40625, "learning_rate": 0.00029783153800564863, "loss": 4.9589, "mean_token_accuracy": 0.22351886034011842, "num_tokens": 105177523.0, "step": 60635 }, { "entropy": 5.899677467346192, "epoch": 4.7179926084419375, "grad_norm": 1.671875, "learning_rate": 0.00029780396530601456, "loss": 4.9615, "mean_token_accuracy": 0.22080015987157822, "num_tokens": 105186087.0, "step": 60640 }, { "entropy": 5.890599584579467, "epoch": 4.718381637813655, "grad_norm": 1.34375, "learning_rate": 0.00029777639226036663, "loss": 4.9741, "mean_token_accuracy": 0.21785981208086014, "num_tokens": 105195423.0, "step": 60645 }, { "entropy": 5.924311256408691, "epoch": 4.718770667185373, "grad_norm": 1.4765625, "learning_rate": 0.0002977488188691232, "loss": 4.9141, "mean_token_accuracy": 0.2132745146751404, "num_tokens": 105204275.0, "step": 60650 }, { "entropy": 5.89634952545166, "epoch": 4.7191596965570906, "grad_norm": 1.46875, "learning_rate": 0.0002977212451327026, "loss": 4.9565, "mean_token_accuracy": 0.21226166635751725, "num_tokens": 105212685.0, "step": 60655 }, { "entropy": 5.841070938110351, "epoch": 4.719548725928807, "grad_norm": 1.4296875, "learning_rate": 0.0002976936710515233, "loss": 4.891, "mean_token_accuracy": 0.2180558279156685, "num_tokens": 105221645.0, "step": 60660 }, { "entropy": 5.833380794525146, "epoch": 4.719937755300525, "grad_norm": 1.3984375, "learning_rate": 0.00029766609662600367, "loss": 4.9475, "mean_token_accuracy": 0.22205691784620285, "num_tokens": 105229681.0, "step": 60665 }, { "entropy": 5.8945780277252195, "epoch": 4.720326784672243, "grad_norm": 1.4609375, "learning_rate": 0.00029763852185656206, "loss": 4.9134, "mean_token_accuracy": 0.2138862729072571, "num_tokens": 105238150.0, "step": 60670 }, { "entropy": 5.90069842338562, "epoch": 4.7207158140439605, "grad_norm": 1.453125, "learning_rate": 0.00029761094674361695, "loss": 4.8965, "mean_token_accuracy": 0.21595190167427064, "num_tokens": 105246334.0, "step": 60675 }, { "entropy": 5.892250108718872, "epoch": 4.721104843415678, "grad_norm": 1.375, "learning_rate": 0.00029758337128758675, "loss": 4.9947, "mean_token_accuracy": 0.21278634816408157, "num_tokens": 105254796.0, "step": 60680 }, { "entropy": 5.87995867729187, "epoch": 4.721493872787395, "grad_norm": 1.390625, "learning_rate": 0.0002975557954888898, "loss": 4.931, "mean_token_accuracy": 0.22121565490961076, "num_tokens": 105263718.0, "step": 60685 }, { "entropy": 5.906523656845093, "epoch": 4.721882902159113, "grad_norm": 1.4453125, "learning_rate": 0.00029752821934794457, "loss": 4.9557, "mean_token_accuracy": 0.21669235825538635, "num_tokens": 105271947.0, "step": 60690 }, { "entropy": 5.870176506042481, "epoch": 4.72227193153083, "grad_norm": 1.40625, "learning_rate": 0.00029750064286516943, "loss": 5.0009, "mean_token_accuracy": 0.2086670830845833, "num_tokens": 105280660.0, "step": 60695 }, { "entropy": 5.896756505966186, "epoch": 4.722660960902548, "grad_norm": 1.3515625, "learning_rate": 0.0002974730660409828, "loss": 4.9167, "mean_token_accuracy": 0.21602464020252227, "num_tokens": 105289604.0, "step": 60700 }, { "entropy": 5.940533113479614, "epoch": 4.723049990274266, "grad_norm": 1.515625, "learning_rate": 0.00029744548887580325, "loss": 4.9944, "mean_token_accuracy": 0.21379899382591247, "num_tokens": 105298112.0, "step": 60705 }, { "entropy": 5.904570865631103, "epoch": 4.7234390196459834, "grad_norm": 1.546875, "learning_rate": 0.00029741791137004916, "loss": 4.9459, "mean_token_accuracy": 0.2108463779091835, "num_tokens": 105306065.0, "step": 60710 }, { "entropy": 5.887718439102173, "epoch": 4.723828049017701, "grad_norm": 1.40625, "learning_rate": 0.00029739033352413883, "loss": 4.9635, "mean_token_accuracy": 0.21735145300626754, "num_tokens": 105315107.0, "step": 60715 }, { "entropy": 5.841065502166748, "epoch": 4.724217078389419, "grad_norm": 1.4375, "learning_rate": 0.00029736275533849094, "loss": 4.9287, "mean_token_accuracy": 0.216402131319046, "num_tokens": 105323470.0, "step": 60720 }, { "entropy": 5.831031560897827, "epoch": 4.724606107761136, "grad_norm": 1.4609375, "learning_rate": 0.0002973351768135239, "loss": 4.8952, "mean_token_accuracy": 0.22297154366970062, "num_tokens": 105332644.0, "step": 60725 }, { "entropy": 5.870612335205078, "epoch": 4.724995137132853, "grad_norm": 1.40625, "learning_rate": 0.00029730759794965595, "loss": 4.8832, "mean_token_accuracy": 0.22400619685649872, "num_tokens": 105341672.0, "step": 60730 }, { "entropy": 5.819486904144287, "epoch": 4.725384166504571, "grad_norm": 1.3984375, "learning_rate": 0.0002972800187473057, "loss": 4.8607, "mean_token_accuracy": 0.2211390644311905, "num_tokens": 105349958.0, "step": 60735 }, { "entropy": 5.855258178710938, "epoch": 4.725773195876289, "grad_norm": 1.2890625, "learning_rate": 0.00029725243920689163, "loss": 4.944, "mean_token_accuracy": 0.21145863085985184, "num_tokens": 105359069.0, "step": 60740 }, { "entropy": 5.900996685028076, "epoch": 4.726162225248006, "grad_norm": 1.359375, "learning_rate": 0.00029722485932883233, "loss": 4.9796, "mean_token_accuracy": 0.21387088894844056, "num_tokens": 105367779.0, "step": 60745 }, { "entropy": 5.842031049728393, "epoch": 4.726551254619724, "grad_norm": 1.4765625, "learning_rate": 0.00029719727911354604, "loss": 4.8767, "mean_token_accuracy": 0.21801753342151642, "num_tokens": 105376135.0, "step": 60750 }, { "entropy": 5.885424089431763, "epoch": 4.726940283991441, "grad_norm": 1.484375, "learning_rate": 0.00029716969856145143, "loss": 4.9819, "mean_token_accuracy": 0.217241770029068, "num_tokens": 105384934.0, "step": 60755 }, { "entropy": 5.891575145721435, "epoch": 4.727329313363159, "grad_norm": 1.4609375, "learning_rate": 0.00029714211767296693, "loss": 5.0151, "mean_token_accuracy": 0.2055464580655098, "num_tokens": 105393238.0, "step": 60760 }, { "entropy": 5.858783817291259, "epoch": 4.727718342734876, "grad_norm": 1.359375, "learning_rate": 0.0002971145364485111, "loss": 4.9557, "mean_token_accuracy": 0.2132525160908699, "num_tokens": 105402772.0, "step": 60765 }, { "entropy": 5.902745056152344, "epoch": 4.728107372106594, "grad_norm": 1.453125, "learning_rate": 0.0002970869548885023, "loss": 4.96, "mean_token_accuracy": 0.21192507743835448, "num_tokens": 105411578.0, "step": 60770 }, { "entropy": 5.8758580684661865, "epoch": 4.728496401478312, "grad_norm": 1.46875, "learning_rate": 0.0002970593729933591, "loss": 4.9254, "mean_token_accuracy": 0.21759480237960815, "num_tokens": 105420397.0, "step": 60775 }, { "entropy": 5.875942850112915, "epoch": 4.728885430850029, "grad_norm": 1.3828125, "learning_rate": 0.00029703179076350005, "loss": 4.9007, "mean_token_accuracy": 0.2245413213968277, "num_tokens": 105429087.0, "step": 60780 }, { "entropy": 5.860939407348633, "epoch": 4.729274460221747, "grad_norm": 1.4765625, "learning_rate": 0.00029700420819934363, "loss": 4.9498, "mean_token_accuracy": 0.21735534220933914, "num_tokens": 105436900.0, "step": 60785 }, { "entropy": 5.866411828994751, "epoch": 4.729663489593464, "grad_norm": 1.375, "learning_rate": 0.00029697662530130836, "loss": 4.9697, "mean_token_accuracy": 0.21231728941202163, "num_tokens": 105445740.0, "step": 60790 }, { "entropy": 5.8576117038726805, "epoch": 4.730052518965182, "grad_norm": 1.46875, "learning_rate": 0.0002969490420698129, "loss": 4.9453, "mean_token_accuracy": 0.21322918683290482, "num_tokens": 105454754.0, "step": 60795 }, { "entropy": 5.798538255691528, "epoch": 4.730441548336899, "grad_norm": 1.4375, "learning_rate": 0.00029692145850527553, "loss": 4.8304, "mean_token_accuracy": 0.22737499177455903, "num_tokens": 105463237.0, "step": 60800 }, { "entropy": 5.845492172241211, "epoch": 4.730830577708617, "grad_norm": 1.3984375, "learning_rate": 0.00029689387460811494, "loss": 4.912, "mean_token_accuracy": 0.2192944496870041, "num_tokens": 105472459.0, "step": 60805 }, { "entropy": 5.922378253936768, "epoch": 4.731219607080335, "grad_norm": 1.390625, "learning_rate": 0.0002968662903787497, "loss": 4.9549, "mean_token_accuracy": 0.22024778574705123, "num_tokens": 105481528.0, "step": 60810 }, { "entropy": 5.852470350265503, "epoch": 4.731608636452052, "grad_norm": 1.390625, "learning_rate": 0.0002968387058175983, "loss": 4.8445, "mean_token_accuracy": 0.22382921129465103, "num_tokens": 105490317.0, "step": 60815 }, { "entropy": 5.833373403549194, "epoch": 4.731997665823769, "grad_norm": 1.421875, "learning_rate": 0.0002968111209250792, "loss": 4.8715, "mean_token_accuracy": 0.22285645008087157, "num_tokens": 105499039.0, "step": 60820 }, { "entropy": 5.813837385177612, "epoch": 4.732386695195487, "grad_norm": 1.2890625, "learning_rate": 0.00029678353570161117, "loss": 4.8584, "mean_token_accuracy": 0.22093296200037002, "num_tokens": 105508233.0, "step": 60825 }, { "entropy": 5.869218873977661, "epoch": 4.732775724567205, "grad_norm": 1.3828125, "learning_rate": 0.0002967559501476126, "loss": 4.9863, "mean_token_accuracy": 0.21013854295015336, "num_tokens": 105516867.0, "step": 60830 }, { "entropy": 5.836968660354614, "epoch": 4.733164753938922, "grad_norm": 1.4140625, "learning_rate": 0.00029672836426350213, "loss": 4.9042, "mean_token_accuracy": 0.2240413397550583, "num_tokens": 105525305.0, "step": 60835 }, { "entropy": 5.888692474365234, "epoch": 4.73355378331064, "grad_norm": 1.4453125, "learning_rate": 0.00029670077804969835, "loss": 4.9133, "mean_token_accuracy": 0.21696747690439225, "num_tokens": 105533488.0, "step": 60840 }, { "entropy": 5.835903549194336, "epoch": 4.733942812682358, "grad_norm": 1.4375, "learning_rate": 0.00029667319150661976, "loss": 4.9043, "mean_token_accuracy": 0.21555159538984298, "num_tokens": 105542768.0, "step": 60845 }, { "entropy": 5.818588972091675, "epoch": 4.734331842054075, "grad_norm": 1.421875, "learning_rate": 0.000296645604634685, "loss": 4.8265, "mean_token_accuracy": 0.2333204284310341, "num_tokens": 105551097.0, "step": 60850 }, { "entropy": 5.855669832229614, "epoch": 4.734720871425793, "grad_norm": 1.3515625, "learning_rate": 0.0002966180174343127, "loss": 4.8817, "mean_token_accuracy": 0.2197147622704506, "num_tokens": 105559846.0, "step": 60855 }, { "entropy": 5.854354572296143, "epoch": 4.73510990079751, "grad_norm": 1.4609375, "learning_rate": 0.00029659042990592125, "loss": 4.9663, "mean_token_accuracy": 0.2156075954437256, "num_tokens": 105568697.0, "step": 60860 }, { "entropy": 5.9596349716186525, "epoch": 4.735498930169228, "grad_norm": 1.5546875, "learning_rate": 0.0002965628420499295, "loss": 5.0032, "mean_token_accuracy": 0.2051233634352684, "num_tokens": 105577139.0, "step": 60865 }, { "entropy": 5.928594923019409, "epoch": 4.735887959540945, "grad_norm": 1.40625, "learning_rate": 0.0002965352538667559, "loss": 4.894, "mean_token_accuracy": 0.22407492101192475, "num_tokens": 105585557.0, "step": 60870 }, { "entropy": 5.798439168930054, "epoch": 4.736276988912663, "grad_norm": 1.5859375, "learning_rate": 0.00029650766535681917, "loss": 4.8091, "mean_token_accuracy": 0.22160778641700746, "num_tokens": 105593671.0, "step": 60875 }, { "entropy": 5.81412148475647, "epoch": 4.736666018284381, "grad_norm": 1.3359375, "learning_rate": 0.00029648007652053774, "loss": 4.8639, "mean_token_accuracy": 0.219798743724823, "num_tokens": 105602668.0, "step": 60880 }, { "entropy": 5.82104640007019, "epoch": 4.737055047656098, "grad_norm": 1.421875, "learning_rate": 0.00029645248735833045, "loss": 4.9038, "mean_token_accuracy": 0.22374660074710845, "num_tokens": 105610727.0, "step": 60885 }, { "entropy": 5.878356313705444, "epoch": 4.737444077027815, "grad_norm": 1.375, "learning_rate": 0.00029642489787061574, "loss": 4.9559, "mean_token_accuracy": 0.217888905107975, "num_tokens": 105619050.0, "step": 60890 }, { "entropy": 5.877041959762574, "epoch": 4.737833106399533, "grad_norm": 1.3125, "learning_rate": 0.0002963973080578123, "loss": 4.9319, "mean_token_accuracy": 0.21296107172966003, "num_tokens": 105628065.0, "step": 60895 }, { "entropy": 5.826031637191773, "epoch": 4.738222135771251, "grad_norm": 1.4453125, "learning_rate": 0.00029636971792033873, "loss": 4.8715, "mean_token_accuracy": 0.2174631893634796, "num_tokens": 105636838.0, "step": 60900 }, { "entropy": 5.88527512550354, "epoch": 4.738611165142968, "grad_norm": 1.3984375, "learning_rate": 0.0002963421274586138, "loss": 4.9687, "mean_token_accuracy": 0.213816037774086, "num_tokens": 105645739.0, "step": 60905 }, { "entropy": 5.954970264434815, "epoch": 4.739000194514686, "grad_norm": 1.4921875, "learning_rate": 0.00029631453667305603, "loss": 4.9736, "mean_token_accuracy": 0.21654482632875444, "num_tokens": 105654077.0, "step": 60910 }, { "entropy": 5.875184440612793, "epoch": 4.739389223886404, "grad_norm": 1.421875, "learning_rate": 0.0002962869455640841, "loss": 4.9215, "mean_token_accuracy": 0.2197732463479042, "num_tokens": 105662274.0, "step": 60915 }, { "entropy": 5.933502244949341, "epoch": 4.739778253258121, "grad_norm": 1.5546875, "learning_rate": 0.0002962593541321167, "loss": 4.9638, "mean_token_accuracy": 0.20897582173347473, "num_tokens": 105670153.0, "step": 60920 }, { "entropy": 5.919316577911377, "epoch": 4.740167282629838, "grad_norm": 1.5, "learning_rate": 0.0002962317623775723, "loss": 5.0135, "mean_token_accuracy": 0.21574748158454896, "num_tokens": 105679801.0, "step": 60925 }, { "entropy": 5.876159715652466, "epoch": 4.740556312001556, "grad_norm": 1.328125, "learning_rate": 0.00029620417030086976, "loss": 4.9475, "mean_token_accuracy": 0.21289939284324647, "num_tokens": 105688944.0, "step": 60930 }, { "entropy": 5.914960241317749, "epoch": 4.740945341373274, "grad_norm": 1.4140625, "learning_rate": 0.00029617657790242767, "loss": 4.9039, "mean_token_accuracy": 0.2156111091375351, "num_tokens": 105697368.0, "step": 60935 }, { "entropy": 5.844474363327026, "epoch": 4.741334370744991, "grad_norm": 1.3671875, "learning_rate": 0.00029614898518266476, "loss": 4.8668, "mean_token_accuracy": 0.21742608398199081, "num_tokens": 105706068.0, "step": 60940 }, { "entropy": 5.815180540084839, "epoch": 4.741723400116709, "grad_norm": 1.453125, "learning_rate": 0.0002961213921419997, "loss": 4.9162, "mean_token_accuracy": 0.21509056091308593, "num_tokens": 105714178.0, "step": 60945 }, { "entropy": 5.944170331954956, "epoch": 4.742112429488427, "grad_norm": 1.40625, "learning_rate": 0.000296093798780851, "loss": 4.9628, "mean_token_accuracy": 0.21122508496046066, "num_tokens": 105722628.0, "step": 60950 }, { "entropy": 5.92220630645752, "epoch": 4.7425014588601435, "grad_norm": 1.3515625, "learning_rate": 0.0002960662050996377, "loss": 5.0124, "mean_token_accuracy": 0.21475653797388078, "num_tokens": 105732024.0, "step": 60955 }, { "entropy": 5.824908971786499, "epoch": 4.742890488231861, "grad_norm": 1.375, "learning_rate": 0.00029603861109877807, "loss": 4.8744, "mean_token_accuracy": 0.21619491875171662, "num_tokens": 105740612.0, "step": 60960 }, { "entropy": 5.9146082401275635, "epoch": 4.743279517603579, "grad_norm": 1.328125, "learning_rate": 0.00029601101677869106, "loss": 4.888, "mean_token_accuracy": 0.2171686753630638, "num_tokens": 105750014.0, "step": 60965 }, { "entropy": 5.887810802459716, "epoch": 4.743668546975297, "grad_norm": 1.2890625, "learning_rate": 0.0002959834221397952, "loss": 4.9307, "mean_token_accuracy": 0.21673284769058226, "num_tokens": 105759272.0, "step": 60970 }, { "entropy": 5.790692472457886, "epoch": 4.744057576347014, "grad_norm": 1.3125, "learning_rate": 0.00029595582718250954, "loss": 4.9265, "mean_token_accuracy": 0.21436749249696732, "num_tokens": 105767630.0, "step": 60975 }, { "entropy": 5.903926086425781, "epoch": 4.744446605718732, "grad_norm": 1.3984375, "learning_rate": 0.0002959282319072524, "loss": 5.0893, "mean_token_accuracy": 0.20204175859689713, "num_tokens": 105775823.0, "step": 60980 }, { "entropy": 5.906321620941162, "epoch": 4.74483563509045, "grad_norm": 1.5, "learning_rate": 0.0002959006363144427, "loss": 4.9059, "mean_token_accuracy": 0.2183700829744339, "num_tokens": 105784565.0, "step": 60985 }, { "entropy": 5.900314664840698, "epoch": 4.7452246644621665, "grad_norm": 1.3125, "learning_rate": 0.0002958730404044991, "loss": 4.9289, "mean_token_accuracy": 0.21297525465488434, "num_tokens": 105793944.0, "step": 60990 }, { "entropy": 5.846686172485351, "epoch": 4.745613693833884, "grad_norm": 1.4609375, "learning_rate": 0.0002958454441778403, "loss": 4.9146, "mean_token_accuracy": 0.21707866936922074, "num_tokens": 105802416.0, "step": 60995 }, { "entropy": 5.896412372589111, "epoch": 4.746002723205602, "grad_norm": 1.4453125, "learning_rate": 0.00029581784763488506, "loss": 4.9279, "mean_token_accuracy": 0.21247471123933792, "num_tokens": 105811648.0, "step": 61000 }, { "entropy": 5.95093355178833, "epoch": 4.74639175257732, "grad_norm": 1.625, "learning_rate": 0.0002957902507760522, "loss": 4.9407, "mean_token_accuracy": 0.2138322576880455, "num_tokens": 105819458.0, "step": 61005 }, { "entropy": 5.885247898101807, "epoch": 4.746780781949037, "grad_norm": 1.5, "learning_rate": 0.0002957626536017603, "loss": 4.9196, "mean_token_accuracy": 0.21853520423173906, "num_tokens": 105828178.0, "step": 61010 }, { "entropy": 5.844181871414184, "epoch": 4.747169811320755, "grad_norm": 1.4296875, "learning_rate": 0.0002957350561124282, "loss": 4.877, "mean_token_accuracy": 0.21989412009716033, "num_tokens": 105836548.0, "step": 61015 }, { "entropy": 5.882378959655762, "epoch": 4.747558840692472, "grad_norm": 1.4453125, "learning_rate": 0.0002957074583084747, "loss": 4.9515, "mean_token_accuracy": 0.21192325949668883, "num_tokens": 105845374.0, "step": 61020 }, { "entropy": 5.810941076278686, "epoch": 4.7479478700641895, "grad_norm": 1.4140625, "learning_rate": 0.0002956798601903184, "loss": 4.8262, "mean_token_accuracy": 0.22525006532669067, "num_tokens": 105854294.0, "step": 61025 }, { "entropy": 5.903068161010742, "epoch": 4.748336899435907, "grad_norm": 1.5703125, "learning_rate": 0.00029565226175837814, "loss": 4.9398, "mean_token_accuracy": 0.22202681601047516, "num_tokens": 105863019.0, "step": 61030 }, { "entropy": 5.853875780105591, "epoch": 4.748725928807625, "grad_norm": 1.515625, "learning_rate": 0.0002956246630130727, "loss": 4.9105, "mean_token_accuracy": 0.2194087728857994, "num_tokens": 105871233.0, "step": 61035 }, { "entropy": 5.893203639984131, "epoch": 4.749114958179343, "grad_norm": 1.453125, "learning_rate": 0.00029559706395482075, "loss": 4.9618, "mean_token_accuracy": 0.21711246222257613, "num_tokens": 105880005.0, "step": 61040 }, { "entropy": 5.8818943977355955, "epoch": 4.74950398755106, "grad_norm": 1.6015625, "learning_rate": 0.00029556946458404124, "loss": 4.96, "mean_token_accuracy": 0.21537002176046371, "num_tokens": 105888578.0, "step": 61045 }, { "entropy": 5.876488065719604, "epoch": 4.749893016922778, "grad_norm": 1.5, "learning_rate": 0.00029554186490115284, "loss": 4.957, "mean_token_accuracy": 0.21126961410045625, "num_tokens": 105896842.0, "step": 61050 }, { "entropy": 5.934459972381592, "epoch": 4.750282046294496, "grad_norm": 1.4921875, "learning_rate": 0.0002955142649065743, "loss": 5.0112, "mean_token_accuracy": 0.21262956857681276, "num_tokens": 105904722.0, "step": 61055 }, { "entropy": 5.91472430229187, "epoch": 4.7506710756662125, "grad_norm": 1.5546875, "learning_rate": 0.0002954866646007244, "loss": 5.006, "mean_token_accuracy": 0.21256323903799057, "num_tokens": 105913118.0, "step": 61060 }, { "entropy": 5.912500667572021, "epoch": 4.75106010503793, "grad_norm": 1.4375, "learning_rate": 0.00029545906398402205, "loss": 4.9799, "mean_token_accuracy": 0.2017812982201576, "num_tokens": 105921798.0, "step": 61065 }, { "entropy": 5.881893348693848, "epoch": 4.751449134409648, "grad_norm": 1.375, "learning_rate": 0.00029543146305688594, "loss": 4.9419, "mean_token_accuracy": 0.21557374447584152, "num_tokens": 105930914.0, "step": 61070 }, { "entropy": 5.882312774658203, "epoch": 4.751838163781366, "grad_norm": 1.375, "learning_rate": 0.0002954038618197349, "loss": 4.9655, "mean_token_accuracy": 0.21585414707660674, "num_tokens": 105940266.0, "step": 61075 }, { "entropy": 5.922711801528931, "epoch": 4.752227193153083, "grad_norm": 1.5546875, "learning_rate": 0.0002953762602729877, "loss": 4.9741, "mean_token_accuracy": 0.22216977775096894, "num_tokens": 105948221.0, "step": 61080 }, { "entropy": 5.843612098693848, "epoch": 4.752616222524801, "grad_norm": 1.4140625, "learning_rate": 0.00029534865841706324, "loss": 4.9285, "mean_token_accuracy": 0.21978115886449814, "num_tokens": 105956864.0, "step": 61085 }, { "entropy": 5.926437187194824, "epoch": 4.753005251896518, "grad_norm": 1.390625, "learning_rate": 0.0002953210562523803, "loss": 4.9989, "mean_token_accuracy": 0.22348757982254028, "num_tokens": 105965926.0, "step": 61090 }, { "entropy": 5.898807048797607, "epoch": 4.7533942812682355, "grad_norm": 1.359375, "learning_rate": 0.0002952934537793576, "loss": 4.969, "mean_token_accuracy": 0.21146332323551179, "num_tokens": 105975510.0, "step": 61095 }, { "entropy": 5.8703193187713625, "epoch": 4.753783310639953, "grad_norm": 1.4375, "learning_rate": 0.00029526585099841395, "loss": 4.9711, "mean_token_accuracy": 0.2104182481765747, "num_tokens": 105984408.0, "step": 61100 }, { "entropy": 5.844713973999023, "epoch": 4.754172340011671, "grad_norm": 1.25, "learning_rate": 0.00029523824790996845, "loss": 4.8655, "mean_token_accuracy": 0.22372340708971022, "num_tokens": 105993496.0, "step": 61105 }, { "entropy": 5.900966358184815, "epoch": 4.754561369383389, "grad_norm": 1.359375, "learning_rate": 0.00029521064451443966, "loss": 4.9579, "mean_token_accuracy": 0.22201010435819626, "num_tokens": 106002040.0, "step": 61110 }, { "entropy": 5.889397668838501, "epoch": 4.754950398755106, "grad_norm": 1.328125, "learning_rate": 0.00029518304081224656, "loss": 4.95, "mean_token_accuracy": 0.20875708609819413, "num_tokens": 106010510.0, "step": 61115 }, { "entropy": 5.921111154556274, "epoch": 4.755339428126824, "grad_norm": 1.3515625, "learning_rate": 0.00029515543680380793, "loss": 4.9238, "mean_token_accuracy": 0.221443372964859, "num_tokens": 106019258.0, "step": 61120 }, { "entropy": 5.907075500488281, "epoch": 4.755728457498541, "grad_norm": 1.421875, "learning_rate": 0.00029512783248954253, "loss": 4.9862, "mean_token_accuracy": 0.21693806648254393, "num_tokens": 106027947.0, "step": 61125 }, { "entropy": 5.889995861053467, "epoch": 4.7561174868702585, "grad_norm": 1.40625, "learning_rate": 0.0002951002278698695, "loss": 4.9049, "mean_token_accuracy": 0.21608293652534485, "num_tokens": 106036141.0, "step": 61130 }, { "entropy": 5.852833032608032, "epoch": 4.756506516241976, "grad_norm": 1.4765625, "learning_rate": 0.00029507262294520726, "loss": 4.9408, "mean_token_accuracy": 0.22119842916727067, "num_tokens": 106044821.0, "step": 61135 }, { "entropy": 5.835148906707763, "epoch": 4.756895545613694, "grad_norm": 1.40625, "learning_rate": 0.0002950450177159751, "loss": 4.9556, "mean_token_accuracy": 0.2211356058716774, "num_tokens": 106052910.0, "step": 61140 }, { "entropy": 5.8114612102508545, "epoch": 4.757284574985412, "grad_norm": 1.40625, "learning_rate": 0.00029501741218259167, "loss": 4.8665, "mean_token_accuracy": 0.22332770079374314, "num_tokens": 106062025.0, "step": 61145 }, { "entropy": 5.902966547012329, "epoch": 4.757673604357129, "grad_norm": 1.4609375, "learning_rate": 0.00029498980634547585, "loss": 4.9577, "mean_token_accuracy": 0.21825567185878753, "num_tokens": 106070075.0, "step": 61150 }, { "entropy": 5.8145452499389645, "epoch": 4.758062633728846, "grad_norm": 1.2734375, "learning_rate": 0.00029496220020504656, "loss": 4.8902, "mean_token_accuracy": 0.2161939799785614, "num_tokens": 106079225.0, "step": 61155 }, { "entropy": 5.7966302871704105, "epoch": 4.758451663100564, "grad_norm": 1.3984375, "learning_rate": 0.00029493459376172263, "loss": 4.7493, "mean_token_accuracy": 0.2272977724671364, "num_tokens": 106087767.0, "step": 61160 }, { "entropy": 5.896937036514283, "epoch": 4.7588406924722815, "grad_norm": 1.4140625, "learning_rate": 0.0002949069870159229, "loss": 4.9038, "mean_token_accuracy": 0.22175297141075134, "num_tokens": 106096670.0, "step": 61165 }, { "entropy": 5.860300159454345, "epoch": 4.759229721843999, "grad_norm": 1.40625, "learning_rate": 0.00029487937996806635, "loss": 4.9299, "mean_token_accuracy": 0.2171230733394623, "num_tokens": 106105768.0, "step": 61170 }, { "entropy": 5.8539710521698, "epoch": 4.759618751215717, "grad_norm": 1.4453125, "learning_rate": 0.00029485177261857193, "loss": 4.843, "mean_token_accuracy": 0.22562188357114793, "num_tokens": 106113831.0, "step": 61175 }, { "entropy": 5.832643127441406, "epoch": 4.760007780587435, "grad_norm": 1.5859375, "learning_rate": 0.0002948241649678584, "loss": 4.8569, "mean_token_accuracy": 0.22861818075180054, "num_tokens": 106121814.0, "step": 61180 }, { "entropy": 5.928608083724976, "epoch": 4.760396809959152, "grad_norm": 1.5, "learning_rate": 0.0002947965570163448, "loss": 4.9921, "mean_token_accuracy": 0.21545332968235015, "num_tokens": 106130983.0, "step": 61185 }, { "entropy": 5.892875099182129, "epoch": 4.76078583933087, "grad_norm": 1.3671875, "learning_rate": 0.0002947689487644499, "loss": 4.9433, "mean_token_accuracy": 0.21343118101358413, "num_tokens": 106139983.0, "step": 61190 }, { "entropy": 5.837586879730225, "epoch": 4.761174868702587, "grad_norm": 1.4765625, "learning_rate": 0.0002947413402125927, "loss": 4.8853, "mean_token_accuracy": 0.21965064257383346, "num_tokens": 106148132.0, "step": 61195 }, { "entropy": 5.859208774566651, "epoch": 4.7615638980743045, "grad_norm": 1.375, "learning_rate": 0.0002947137313611919, "loss": 4.9687, "mean_token_accuracy": 0.21253736466169357, "num_tokens": 106156481.0, "step": 61200 }, { "entropy": 5.870739603042603, "epoch": 4.761952927446022, "grad_norm": 1.296875, "learning_rate": 0.00029468612221066683, "loss": 5.0031, "mean_token_accuracy": 0.20898440182209016, "num_tokens": 106165815.0, "step": 61205 }, { "entropy": 5.874511480331421, "epoch": 4.76234195681774, "grad_norm": 1.4140625, "learning_rate": 0.0002946585127614361, "loss": 4.8604, "mean_token_accuracy": 0.2184752941131592, "num_tokens": 106174073.0, "step": 61210 }, { "entropy": 5.883990669250489, "epoch": 4.762730986189458, "grad_norm": 1.4140625, "learning_rate": 0.0002946309030139188, "loss": 4.9496, "mean_token_accuracy": 0.21315957009792327, "num_tokens": 106182788.0, "step": 61215 }, { "entropy": 5.9313554763793945, "epoch": 4.763120015561174, "grad_norm": 1.5234375, "learning_rate": 0.0002946032929685337, "loss": 4.9535, "mean_token_accuracy": 0.20816124230623245, "num_tokens": 106191640.0, "step": 61220 }, { "entropy": 5.851598787307739, "epoch": 4.763509044932892, "grad_norm": 1.5078125, "learning_rate": 0.0002945756826256999, "loss": 4.9138, "mean_token_accuracy": 0.2108073502779007, "num_tokens": 106200341.0, "step": 61225 }, { "entropy": 5.8882745742797855, "epoch": 4.76389807430461, "grad_norm": 1.453125, "learning_rate": 0.0002945480719858363, "loss": 4.8864, "mean_token_accuracy": 0.2329368844628334, "num_tokens": 106208246.0, "step": 61230 }, { "entropy": 5.972222948074341, "epoch": 4.7642871036763275, "grad_norm": 1.421875, "learning_rate": 0.0002945204610493617, "loss": 5.0993, "mean_token_accuracy": 0.20270868092775346, "num_tokens": 106216917.0, "step": 61235 }, { "entropy": 5.8756755828857425, "epoch": 4.764676133048045, "grad_norm": 1.3828125, "learning_rate": 0.00029449284981669524, "loss": 4.9114, "mean_token_accuracy": 0.21971877813339233, "num_tokens": 106225049.0, "step": 61240 }, { "entropy": 5.854177093505859, "epoch": 4.765065162419763, "grad_norm": 1.453125, "learning_rate": 0.00029446523828825577, "loss": 4.9077, "mean_token_accuracy": 0.22476483285427093, "num_tokens": 106233066.0, "step": 61245 }, { "entropy": 5.871186065673828, "epoch": 4.7654541917914806, "grad_norm": 1.453125, "learning_rate": 0.0002944376264644624, "loss": 4.9431, "mean_token_accuracy": 0.21867943853139876, "num_tokens": 106242107.0, "step": 61250 }, { "entropy": 5.9037737369537355, "epoch": 4.765843221163198, "grad_norm": 1.4375, "learning_rate": 0.0002944100143457339, "loss": 4.9083, "mean_token_accuracy": 0.21939605474472046, "num_tokens": 106250571.0, "step": 61255 }, { "entropy": 5.963947486877442, "epoch": 4.766232250534915, "grad_norm": 1.4765625, "learning_rate": 0.0002943824019324893, "loss": 5.0496, "mean_token_accuracy": 0.20453084707260133, "num_tokens": 106259069.0, "step": 61260 }, { "entropy": 5.926756048202515, "epoch": 4.766621279906633, "grad_norm": 1.375, "learning_rate": 0.0002943547892251476, "loss": 4.9096, "mean_token_accuracy": 0.2270295113325119, "num_tokens": 106267971.0, "step": 61265 }, { "entropy": 5.915213584899902, "epoch": 4.7670103092783505, "grad_norm": 1.390625, "learning_rate": 0.00029432717622412784, "loss": 4.9004, "mean_token_accuracy": 0.21815563142299652, "num_tokens": 106275972.0, "step": 61270 }, { "entropy": 5.8746179103851315, "epoch": 4.767399338650068, "grad_norm": 1.515625, "learning_rate": 0.00029429956292984893, "loss": 4.9181, "mean_token_accuracy": 0.21695407778024672, "num_tokens": 106284292.0, "step": 61275 }, { "entropy": 5.806115579605103, "epoch": 4.767788368021786, "grad_norm": 1.3984375, "learning_rate": 0.0002942719493427299, "loss": 4.8801, "mean_token_accuracy": 0.21529111713171006, "num_tokens": 106292909.0, "step": 61280 }, { "entropy": 5.8449324607849125, "epoch": 4.7681773973935035, "grad_norm": 1.46875, "learning_rate": 0.0002942443354631897, "loss": 4.8688, "mean_token_accuracy": 0.21771973967552186, "num_tokens": 106301724.0, "step": 61285 }, { "entropy": 5.903324270248413, "epoch": 4.76856642676522, "grad_norm": 1.3671875, "learning_rate": 0.00029421672129164726, "loss": 4.9972, "mean_token_accuracy": 0.21339768320322036, "num_tokens": 106310818.0, "step": 61290 }, { "entropy": 5.9232923030853275, "epoch": 4.768955456136938, "grad_norm": 1.4453125, "learning_rate": 0.00029418910682852176, "loss": 4.9655, "mean_token_accuracy": 0.21534694284200667, "num_tokens": 106318929.0, "step": 61295 }, { "entropy": 5.9295577049255375, "epoch": 4.769344485508656, "grad_norm": 1.4140625, "learning_rate": 0.00029416149207423203, "loss": 4.9684, "mean_token_accuracy": 0.2113225743174553, "num_tokens": 106327502.0, "step": 61300 }, { "entropy": 5.870498418807983, "epoch": 4.7697335148803734, "grad_norm": 1.453125, "learning_rate": 0.00029413387702919723, "loss": 4.9087, "mean_token_accuracy": 0.21916650980710983, "num_tokens": 106335882.0, "step": 61305 }, { "entropy": 5.96025333404541, "epoch": 4.770122544252091, "grad_norm": 1.46875, "learning_rate": 0.00029410626169383623, "loss": 5.0731, "mean_token_accuracy": 0.20890649408102036, "num_tokens": 106344593.0, "step": 61310 }, { "entropy": 5.8693946361541744, "epoch": 4.770511573623809, "grad_norm": 1.3359375, "learning_rate": 0.00029407864606856814, "loss": 4.9185, "mean_token_accuracy": 0.22215885072946548, "num_tokens": 106352930.0, "step": 61315 }, { "entropy": 5.849253797531128, "epoch": 4.7709006029955265, "grad_norm": 1.5078125, "learning_rate": 0.000294051030153812, "loss": 4.9357, "mean_token_accuracy": 0.21666816920042037, "num_tokens": 106360826.0, "step": 61320 }, { "entropy": 5.877149248123169, "epoch": 4.771289632367243, "grad_norm": 1.4140625, "learning_rate": 0.0002940234139499868, "loss": 4.8855, "mean_token_accuracy": 0.2249186173081398, "num_tokens": 106369752.0, "step": 61325 }, { "entropy": 5.8540667533874515, "epoch": 4.771678661738961, "grad_norm": 1.3828125, "learning_rate": 0.00029399579745751156, "loss": 4.8883, "mean_token_accuracy": 0.22689461410045625, "num_tokens": 106377632.0, "step": 61330 }, { "entropy": 5.826297426223755, "epoch": 4.772067691110679, "grad_norm": 1.375, "learning_rate": 0.00029396818067680525, "loss": 4.9066, "mean_token_accuracy": 0.21397999823093414, "num_tokens": 106386159.0, "step": 61335 }, { "entropy": 5.804233169555664, "epoch": 4.772456720482396, "grad_norm": 1.34375, "learning_rate": 0.00029394056360828707, "loss": 4.852, "mean_token_accuracy": 0.21680935323238373, "num_tokens": 106395529.0, "step": 61340 }, { "entropy": 5.92691559791565, "epoch": 4.772845749854114, "grad_norm": 1.5390625, "learning_rate": 0.00029391294625237595, "loss": 4.992, "mean_token_accuracy": 0.2062061011791229, "num_tokens": 106404178.0, "step": 61345 }, { "entropy": 5.847654914855957, "epoch": 4.773234779225832, "grad_norm": 1.328125, "learning_rate": 0.0002938853286094911, "loss": 4.9163, "mean_token_accuracy": 0.220000958442688, "num_tokens": 106412750.0, "step": 61350 }, { "entropy": 5.83144850730896, "epoch": 4.773623808597549, "grad_norm": 1.390625, "learning_rate": 0.00029385771068005123, "loss": 4.898, "mean_token_accuracy": 0.21834155470132827, "num_tokens": 106421972.0, "step": 61355 }, { "entropy": 5.821387815475464, "epoch": 4.774012837969266, "grad_norm": 1.515625, "learning_rate": 0.0002938300924644757, "loss": 4.8807, "mean_token_accuracy": 0.2178368330001831, "num_tokens": 106430702.0, "step": 61360 }, { "entropy": 5.906731176376343, "epoch": 4.774401867340984, "grad_norm": 1.3671875, "learning_rate": 0.00029380247396318355, "loss": 4.9357, "mean_token_accuracy": 0.21817118376493455, "num_tokens": 106439543.0, "step": 61365 }, { "entropy": 5.827312231063843, "epoch": 4.774790896712702, "grad_norm": 1.390625, "learning_rate": 0.0002937748551765937, "loss": 4.8737, "mean_token_accuracy": 0.2267797663807869, "num_tokens": 106448361.0, "step": 61370 }, { "entropy": 5.914904022216797, "epoch": 4.775179926084419, "grad_norm": 1.46875, "learning_rate": 0.0002937472361051254, "loss": 4.9676, "mean_token_accuracy": 0.21219406574964522, "num_tokens": 106456448.0, "step": 61375 }, { "entropy": 5.8572954654693605, "epoch": 4.775568955456137, "grad_norm": 1.515625, "learning_rate": 0.0002937196167491976, "loss": 4.8202, "mean_token_accuracy": 0.22672727108001708, "num_tokens": 106464347.0, "step": 61380 }, { "entropy": 5.796436500549317, "epoch": 4.775957984827855, "grad_norm": 1.4453125, "learning_rate": 0.00029369199710922944, "loss": 4.8835, "mean_token_accuracy": 0.21994436234235765, "num_tokens": 106472755.0, "step": 61385 }, { "entropy": 5.839485120773316, "epoch": 4.7763470141995725, "grad_norm": 1.4453125, "learning_rate": 0.00029366437718563994, "loss": 4.9324, "mean_token_accuracy": 0.21521196514368057, "num_tokens": 106481382.0, "step": 61390 }, { "entropy": 5.930896759033203, "epoch": 4.776736043571289, "grad_norm": 1.4140625, "learning_rate": 0.0002936367569788482, "loss": 4.9936, "mean_token_accuracy": 0.21474696397781373, "num_tokens": 106490230.0, "step": 61395 }, { "entropy": 5.923521709442139, "epoch": 4.777125072943007, "grad_norm": 1.421875, "learning_rate": 0.0002936091364892733, "loss": 4.9599, "mean_token_accuracy": 0.21415612399578093, "num_tokens": 106498242.0, "step": 61400 }, { "entropy": 5.9067620754241945, "epoch": 4.777514102314725, "grad_norm": 1.5390625, "learning_rate": 0.00029358151571733446, "loss": 4.9269, "mean_token_accuracy": 0.21870145499706267, "num_tokens": 106506362.0, "step": 61405 }, { "entropy": 5.831527853012085, "epoch": 4.777903131686442, "grad_norm": 1.359375, "learning_rate": 0.00029355389466345064, "loss": 4.8602, "mean_token_accuracy": 0.21716355234384538, "num_tokens": 106515022.0, "step": 61410 }, { "entropy": 5.883844423294067, "epoch": 4.77829216105816, "grad_norm": 1.4375, "learning_rate": 0.00029352627332804104, "loss": 4.9038, "mean_token_accuracy": 0.22303903698921204, "num_tokens": 106522932.0, "step": 61415 }, { "entropy": 5.883833217620849, "epoch": 4.778681190429878, "grad_norm": 1.390625, "learning_rate": 0.00029349865171152475, "loss": 4.9494, "mean_token_accuracy": 0.21399435102939607, "num_tokens": 106532123.0, "step": 61420 }, { "entropy": 5.85845160484314, "epoch": 4.779070219801595, "grad_norm": 1.5234375, "learning_rate": 0.00029347102981432084, "loss": 4.88, "mean_token_accuracy": 0.22085824459791184, "num_tokens": 106540222.0, "step": 61425 }, { "entropy": 5.895369338989258, "epoch": 4.779459249173312, "grad_norm": 1.390625, "learning_rate": 0.0002934434076368484, "loss": 4.9179, "mean_token_accuracy": 0.22770921289920806, "num_tokens": 106548530.0, "step": 61430 }, { "entropy": 5.830578851699829, "epoch": 4.77984827854503, "grad_norm": 1.421875, "learning_rate": 0.0002934157851795266, "loss": 4.9534, "mean_token_accuracy": 0.21685124188661575, "num_tokens": 106557032.0, "step": 61435 }, { "entropy": 5.83912467956543, "epoch": 4.780237307916748, "grad_norm": 1.3671875, "learning_rate": 0.0002933881624427746, "loss": 4.908, "mean_token_accuracy": 0.21519740521907807, "num_tokens": 106565323.0, "step": 61440 }, { "entropy": 5.896981048583984, "epoch": 4.780626337288465, "grad_norm": 1.4609375, "learning_rate": 0.0002933605394270116, "loss": 4.9589, "mean_token_accuracy": 0.21188769787549971, "num_tokens": 106574018.0, "step": 61445 }, { "entropy": 5.897304534912109, "epoch": 4.781015366660183, "grad_norm": 1.515625, "learning_rate": 0.0002933329161326565, "loss": 4.984, "mean_token_accuracy": 0.2137632817029953, "num_tokens": 106583050.0, "step": 61450 }, { "entropy": 5.917555809020996, "epoch": 4.781404396031901, "grad_norm": 1.4453125, "learning_rate": 0.00029330529256012863, "loss": 4.992, "mean_token_accuracy": 0.2110005423426628, "num_tokens": 106592013.0, "step": 61455 }, { "entropy": 5.883837556838989, "epoch": 4.781793425403618, "grad_norm": 1.3984375, "learning_rate": 0.00029327766870984714, "loss": 4.8613, "mean_token_accuracy": 0.224580579996109, "num_tokens": 106600497.0, "step": 61460 }, { "entropy": 5.867414331436157, "epoch": 4.782182454775335, "grad_norm": 1.3359375, "learning_rate": 0.00029325004458223097, "loss": 4.8523, "mean_token_accuracy": 0.2242203563451767, "num_tokens": 106609615.0, "step": 61465 }, { "entropy": 5.961280727386475, "epoch": 4.782571484147053, "grad_norm": 1.5234375, "learning_rate": 0.00029322242017769954, "loss": 5.0496, "mean_token_accuracy": 0.20489207953214644, "num_tokens": 106618777.0, "step": 61470 }, { "entropy": 5.932095003128052, "epoch": 4.782960513518771, "grad_norm": 1.453125, "learning_rate": 0.00029319479549667183, "loss": 4.9591, "mean_token_accuracy": 0.21638449281454086, "num_tokens": 106626672.0, "step": 61475 }, { "entropy": 5.930276107788086, "epoch": 4.783349542890488, "grad_norm": 1.3828125, "learning_rate": 0.0002931671705395671, "loss": 4.9592, "mean_token_accuracy": 0.2155462995171547, "num_tokens": 106635469.0, "step": 61480 }, { "entropy": 5.836870765686035, "epoch": 4.783738572262206, "grad_norm": 1.515625, "learning_rate": 0.00029313954530680447, "loss": 4.8473, "mean_token_accuracy": 0.2218319967389107, "num_tokens": 106644042.0, "step": 61485 }, { "entropy": 5.853882646560669, "epoch": 4.784127601633923, "grad_norm": 1.453125, "learning_rate": 0.00029311191979880313, "loss": 4.9895, "mean_token_accuracy": 0.20881106555461884, "num_tokens": 106653187.0, "step": 61490 }, { "entropy": 5.936031293869019, "epoch": 4.784516631005641, "grad_norm": 1.46875, "learning_rate": 0.0002930842940159822, "loss": 4.9496, "mean_token_accuracy": 0.21924409568309783, "num_tokens": 106662120.0, "step": 61495 }, { "entropy": 5.955626344680786, "epoch": 4.784905660377358, "grad_norm": 1.4765625, "learning_rate": 0.00029305666795876093, "loss": 4.9765, "mean_token_accuracy": 0.2199181228876114, "num_tokens": 106670964.0, "step": 61500 }, { "entropy": 5.919579792022705, "epoch": 4.785294689749076, "grad_norm": 1.4609375, "learning_rate": 0.00029302904162755843, "loss": 4.9922, "mean_token_accuracy": 0.20902244448661805, "num_tokens": 106679264.0, "step": 61505 }, { "entropy": 5.914316034317016, "epoch": 4.785683719120794, "grad_norm": 1.3359375, "learning_rate": 0.00029300141502279395, "loss": 5.0628, "mean_token_accuracy": 0.21200062781572343, "num_tokens": 106687842.0, "step": 61510 }, { "entropy": 5.920604610443116, "epoch": 4.786072748492511, "grad_norm": 1.4140625, "learning_rate": 0.00029297378814488657, "loss": 4.9639, "mean_token_accuracy": 0.2144693613052368, "num_tokens": 106696585.0, "step": 61515 }, { "entropy": 5.907338857650757, "epoch": 4.786461777864229, "grad_norm": 1.3984375, "learning_rate": 0.00029294616099425556, "loss": 4.9998, "mean_token_accuracy": 0.21135954111814498, "num_tokens": 106705841.0, "step": 61520 }, { "entropy": 5.881907272338867, "epoch": 4.786850807235947, "grad_norm": 1.296875, "learning_rate": 0.0002929185335713202, "loss": 4.9235, "mean_token_accuracy": 0.22044856250286102, "num_tokens": 106714674.0, "step": 61525 }, { "entropy": 5.87093596458435, "epoch": 4.787239836607664, "grad_norm": 1.3984375, "learning_rate": 0.00029289090587649965, "loss": 4.9314, "mean_token_accuracy": 0.2189219117164612, "num_tokens": 106723498.0, "step": 61530 }, { "entropy": 5.9294881343841555, "epoch": 4.787628865979381, "grad_norm": 1.34375, "learning_rate": 0.000292863277910213, "loss": 4.9605, "mean_token_accuracy": 0.21484384536743165, "num_tokens": 106732502.0, "step": 61535 }, { "entropy": 5.920049142837525, "epoch": 4.788017895351099, "grad_norm": 1.5, "learning_rate": 0.0002928356496728796, "loss": 4.9672, "mean_token_accuracy": 0.21666008681058885, "num_tokens": 106741217.0, "step": 61540 }, { "entropy": 5.88206672668457, "epoch": 4.788406924722817, "grad_norm": 1.3671875, "learning_rate": 0.00029280802116491854, "loss": 4.9207, "mean_token_accuracy": 0.21823852360248566, "num_tokens": 106749753.0, "step": 61545 }, { "entropy": 5.857629060745239, "epoch": 4.788795954094534, "grad_norm": 1.296875, "learning_rate": 0.00029278039238674915, "loss": 4.9467, "mean_token_accuracy": 0.21169043928384781, "num_tokens": 106758699.0, "step": 61550 }, { "entropy": 5.940484046936035, "epoch": 4.789184983466251, "grad_norm": 1.4296875, "learning_rate": 0.0002927527633387906, "loss": 4.9999, "mean_token_accuracy": 0.20772104561328888, "num_tokens": 106767796.0, "step": 61555 }, { "entropy": 5.931923770904541, "epoch": 4.789574012837969, "grad_norm": 1.46875, "learning_rate": 0.00029272513402146203, "loss": 4.9618, "mean_token_accuracy": 0.20842180997133256, "num_tokens": 106776969.0, "step": 61560 }, { "entropy": 5.833198118209839, "epoch": 4.789963042209687, "grad_norm": 1.296875, "learning_rate": 0.0002926975044351828, "loss": 4.9523, "mean_token_accuracy": 0.21857596039772034, "num_tokens": 106786679.0, "step": 61565 }, { "entropy": 5.93925838470459, "epoch": 4.790352071581404, "grad_norm": 1.375, "learning_rate": 0.0002926698745803723, "loss": 5.0198, "mean_token_accuracy": 0.21423836350440978, "num_tokens": 106794964.0, "step": 61570 }, { "entropy": 5.908381557464599, "epoch": 4.790741100953122, "grad_norm": 1.375, "learning_rate": 0.00029264224445744937, "loss": 4.9095, "mean_token_accuracy": 0.21793148964643477, "num_tokens": 106803823.0, "step": 61575 }, { "entropy": 5.926155996322632, "epoch": 4.79113013032484, "grad_norm": 1.3203125, "learning_rate": 0.00029261461406683353, "loss": 4.9617, "mean_token_accuracy": 0.21640522927045822, "num_tokens": 106812380.0, "step": 61580 }, { "entropy": 5.845181846618653, "epoch": 4.791519159696557, "grad_norm": 1.34375, "learning_rate": 0.00029258698340894397, "loss": 4.8666, "mean_token_accuracy": 0.22322425246238708, "num_tokens": 106821528.0, "step": 61585 }, { "entropy": 5.887009239196777, "epoch": 4.791908189068275, "grad_norm": 1.5234375, "learning_rate": 0.00029255935248419983, "loss": 4.9641, "mean_token_accuracy": 0.21669257581233978, "num_tokens": 106829925.0, "step": 61590 }, { "entropy": 5.854901552200317, "epoch": 4.792297218439992, "grad_norm": 1.40625, "learning_rate": 0.0002925317212930206, "loss": 4.9482, "mean_token_accuracy": 0.213443423807621, "num_tokens": 106838555.0, "step": 61595 }, { "entropy": 5.839565277099609, "epoch": 4.79268624781171, "grad_norm": 1.390625, "learning_rate": 0.00029250408983582527, "loss": 4.9194, "mean_token_accuracy": 0.2237298846244812, "num_tokens": 106847047.0, "step": 61600 }, { "entropy": 5.862899684906006, "epoch": 4.793075277183427, "grad_norm": 1.359375, "learning_rate": 0.0002924764581130333, "loss": 4.8433, "mean_token_accuracy": 0.23150792568922043, "num_tokens": 106855111.0, "step": 61605 }, { "entropy": 5.907291221618652, "epoch": 4.793464306555145, "grad_norm": 1.5546875, "learning_rate": 0.000292448826125064, "loss": 4.9584, "mean_token_accuracy": 0.21615599989891052, "num_tokens": 106864170.0, "step": 61610 }, { "entropy": 5.850291967391968, "epoch": 4.793853335926863, "grad_norm": 1.40625, "learning_rate": 0.0002924211938723364, "loss": 4.8629, "mean_token_accuracy": 0.21678697913885117, "num_tokens": 106873482.0, "step": 61615 }, { "entropy": 5.88385329246521, "epoch": 4.79424236529858, "grad_norm": 1.4921875, "learning_rate": 0.00029239356135526994, "loss": 4.9565, "mean_token_accuracy": 0.21475729942321778, "num_tokens": 106881776.0, "step": 61620 }, { "entropy": 5.90189938545227, "epoch": 4.794631394670297, "grad_norm": 1.3828125, "learning_rate": 0.000292365928574284, "loss": 5.0522, "mean_token_accuracy": 0.20489224642515183, "num_tokens": 106890405.0, "step": 61625 }, { "entropy": 5.914997673034668, "epoch": 4.795020424042015, "grad_norm": 1.3984375, "learning_rate": 0.0002923382955297975, "loss": 4.9263, "mean_token_accuracy": 0.2186702683568001, "num_tokens": 106899611.0, "step": 61630 }, { "entropy": 5.869638967514038, "epoch": 4.795409453413733, "grad_norm": 1.375, "learning_rate": 0.0002923106622222301, "loss": 4.8726, "mean_token_accuracy": 0.22128242552280425, "num_tokens": 106909273.0, "step": 61635 }, { "entropy": 5.782846450805664, "epoch": 4.79579848278545, "grad_norm": 1.4296875, "learning_rate": 0.0002922830286520009, "loss": 4.8551, "mean_token_accuracy": 0.22206541746854783, "num_tokens": 106917531.0, "step": 61640 }, { "entropy": 5.896895551681519, "epoch": 4.796187512157168, "grad_norm": 1.5625, "learning_rate": 0.00029225539481952934, "loss": 4.971, "mean_token_accuracy": 0.220217502117157, "num_tokens": 106926355.0, "step": 61645 }, { "entropy": 5.8039137840271, "epoch": 4.796576541528886, "grad_norm": 1.515625, "learning_rate": 0.0002922277607252346, "loss": 4.8239, "mean_token_accuracy": 0.22635396122932433, "num_tokens": 106934836.0, "step": 61650 }, { "entropy": 5.942328929901123, "epoch": 4.796965570900603, "grad_norm": 1.359375, "learning_rate": 0.000292200126369536, "loss": 5.008, "mean_token_accuracy": 0.20458555817604065, "num_tokens": 106944078.0, "step": 61655 }, { "entropy": 5.8109241962432865, "epoch": 4.79735460027232, "grad_norm": 1.390625, "learning_rate": 0.00029217249175285284, "loss": 4.8112, "mean_token_accuracy": 0.22997771799564362, "num_tokens": 106952545.0, "step": 61660 }, { "entropy": 5.857165670394897, "epoch": 4.797743629644038, "grad_norm": 1.5234375, "learning_rate": 0.00029214485687560437, "loss": 4.9209, "mean_token_accuracy": 0.22011952400207518, "num_tokens": 106962181.0, "step": 61665 }, { "entropy": 5.75851674079895, "epoch": 4.798132659015756, "grad_norm": 1.34375, "learning_rate": 0.0002921172217382101, "loss": 4.8238, "mean_token_accuracy": 0.2260972961783409, "num_tokens": 106970780.0, "step": 61670 }, { "entropy": 5.870467567443848, "epoch": 4.798521688387473, "grad_norm": 1.453125, "learning_rate": 0.00029208958634108917, "loss": 4.9918, "mean_token_accuracy": 0.21760610789060592, "num_tokens": 106980037.0, "step": 61675 }, { "entropy": 5.861391830444336, "epoch": 4.798910717759191, "grad_norm": 1.453125, "learning_rate": 0.000292061950684661, "loss": 4.8825, "mean_token_accuracy": 0.2221352756023407, "num_tokens": 106988822.0, "step": 61680 }, { "entropy": 5.905781555175781, "epoch": 4.799299747130909, "grad_norm": 1.3984375, "learning_rate": 0.00029203431476934496, "loss": 4.9642, "mean_token_accuracy": 0.22204350531101227, "num_tokens": 106996696.0, "step": 61685 }, { "entropy": 5.935604572296143, "epoch": 4.7996887765026255, "grad_norm": 1.34375, "learning_rate": 0.00029200667859556026, "loss": 5.061, "mean_token_accuracy": 0.20652461796998978, "num_tokens": 107005530.0, "step": 61690 }, { "entropy": 5.828819656372071, "epoch": 4.800077805874343, "grad_norm": 1.3984375, "learning_rate": 0.0002919790421637262, "loss": 4.8198, "mean_token_accuracy": 0.22885854542255402, "num_tokens": 107013779.0, "step": 61695 }, { "entropy": 5.8279221534729, "epoch": 4.800466835246061, "grad_norm": 1.3515625, "learning_rate": 0.0002919514054742622, "loss": 4.8475, "mean_token_accuracy": 0.2204282596707344, "num_tokens": 107022397.0, "step": 61700 }, { "entropy": 5.774351596832275, "epoch": 4.800855864617779, "grad_norm": 1.484375, "learning_rate": 0.00029192376852758774, "loss": 4.9133, "mean_token_accuracy": 0.21601344048976898, "num_tokens": 107031213.0, "step": 61705 }, { "entropy": 5.9311291694641115, "epoch": 4.801244893989496, "grad_norm": 1.1953125, "learning_rate": 0.0002918961313241219, "loss": 5.051, "mean_token_accuracy": 0.2075706511735916, "num_tokens": 107040369.0, "step": 61710 }, { "entropy": 6.012514877319336, "epoch": 4.801633923361214, "grad_norm": 1.5234375, "learning_rate": 0.0002918684938642842, "loss": 5.089, "mean_token_accuracy": 0.20581374168395997, "num_tokens": 107049303.0, "step": 61715 }, { "entropy": 5.846624231338501, "epoch": 4.802022952732932, "grad_norm": 1.375, "learning_rate": 0.00029184085614849403, "loss": 4.9282, "mean_token_accuracy": 0.21580785512924194, "num_tokens": 107057860.0, "step": 61720 }, { "entropy": 5.853810501098633, "epoch": 4.802411982104649, "grad_norm": 1.390625, "learning_rate": 0.0002918132181771706, "loss": 5.0002, "mean_token_accuracy": 0.20705979764461518, "num_tokens": 107066318.0, "step": 61725 }, { "entropy": 5.869130706787109, "epoch": 4.802801011476366, "grad_norm": 1.46875, "learning_rate": 0.00029178557995073335, "loss": 4.8662, "mean_token_accuracy": 0.23005930036306382, "num_tokens": 107075183.0, "step": 61730 }, { "entropy": 5.802637434005737, "epoch": 4.803190040848084, "grad_norm": 1.3515625, "learning_rate": 0.0002917579414696017, "loss": 4.8278, "mean_token_accuracy": 0.22055953443050386, "num_tokens": 107083375.0, "step": 61735 }, { "entropy": 5.8412333011627195, "epoch": 4.803579070219802, "grad_norm": 1.453125, "learning_rate": 0.00029173030273419484, "loss": 4.9122, "mean_token_accuracy": 0.22183843553066254, "num_tokens": 107091990.0, "step": 61740 }, { "entropy": 5.882032775878907, "epoch": 4.803968099591519, "grad_norm": 1.484375, "learning_rate": 0.0002917026637449323, "loss": 4.9735, "mean_token_accuracy": 0.2129744365811348, "num_tokens": 107101196.0, "step": 61745 }, { "entropy": 5.8227927684783936, "epoch": 4.804357128963237, "grad_norm": 1.609375, "learning_rate": 0.0002916750245022335, "loss": 4.8417, "mean_token_accuracy": 0.21931996643543245, "num_tokens": 107109379.0, "step": 61750 }, { "entropy": 5.837630367279052, "epoch": 4.804746158334955, "grad_norm": 1.40625, "learning_rate": 0.0002916473850065177, "loss": 4.8946, "mean_token_accuracy": 0.2231481820344925, "num_tokens": 107118635.0, "step": 61755 }, { "entropy": 5.827294969558716, "epoch": 4.8051351877066715, "grad_norm": 1.5390625, "learning_rate": 0.00029161974525820434, "loss": 4.8909, "mean_token_accuracy": 0.2166684478521347, "num_tokens": 107126170.0, "step": 61760 }, { "entropy": 5.836792850494385, "epoch": 4.805524217078389, "grad_norm": 1.328125, "learning_rate": 0.0002915921052577127, "loss": 4.9629, "mean_token_accuracy": 0.20916857868432998, "num_tokens": 107134406.0, "step": 61765 }, { "entropy": 5.9114978313446045, "epoch": 4.805913246450107, "grad_norm": 1.4765625, "learning_rate": 0.00029156446500546243, "loss": 4.9829, "mean_token_accuracy": 0.21086731255054475, "num_tokens": 107143577.0, "step": 61770 }, { "entropy": 5.910972023010254, "epoch": 4.806302275821825, "grad_norm": 1.484375, "learning_rate": 0.00029153682450187265, "loss": 5.0038, "mean_token_accuracy": 0.21004211157560349, "num_tokens": 107151908.0, "step": 61775 }, { "entropy": 5.916540241241455, "epoch": 4.806691305193542, "grad_norm": 1.4140625, "learning_rate": 0.00029150918374736294, "loss": 4.9879, "mean_token_accuracy": 0.21713487654924393, "num_tokens": 107159924.0, "step": 61780 }, { "entropy": 5.9685547828674315, "epoch": 4.80708033456526, "grad_norm": 1.546875, "learning_rate": 0.0002914815427423526, "loss": 4.9615, "mean_token_accuracy": 0.21994968205690385, "num_tokens": 107167962.0, "step": 61785 }, { "entropy": 5.875788593292237, "epoch": 4.807469363936978, "grad_norm": 1.453125, "learning_rate": 0.0002914539014872612, "loss": 4.9123, "mean_token_accuracy": 0.21743139028549194, "num_tokens": 107177760.0, "step": 61790 }, { "entropy": 5.85589632987976, "epoch": 4.8078583933086945, "grad_norm": 1.4453125, "learning_rate": 0.00029142625998250786, "loss": 4.9042, "mean_token_accuracy": 0.21955206096172333, "num_tokens": 107186369.0, "step": 61795 }, { "entropy": 5.909440326690674, "epoch": 4.808247422680412, "grad_norm": 1.46875, "learning_rate": 0.00029139861822851233, "loss": 4.9782, "mean_token_accuracy": 0.21461800187826158, "num_tokens": 107194526.0, "step": 61800 }, { "entropy": 5.915717697143554, "epoch": 4.80863645205213, "grad_norm": 1.4921875, "learning_rate": 0.00029137097622569376, "loss": 4.9587, "mean_token_accuracy": 0.20820139050483705, "num_tokens": 107202350.0, "step": 61805 }, { "entropy": 5.904705333709717, "epoch": 4.809025481423848, "grad_norm": 1.390625, "learning_rate": 0.0002913433339744718, "loss": 4.9767, "mean_token_accuracy": 0.21579258739948273, "num_tokens": 107211227.0, "step": 61810 }, { "entropy": 5.852851867675781, "epoch": 4.809414510795565, "grad_norm": 1.4453125, "learning_rate": 0.0002913156914752656, "loss": 4.9494, "mean_token_accuracy": 0.21095031201839448, "num_tokens": 107219909.0, "step": 61815 }, { "entropy": 5.8806154251098635, "epoch": 4.809803540167283, "grad_norm": 1.3671875, "learning_rate": 0.0002912880487284948, "loss": 4.9984, "mean_token_accuracy": 0.2206324964761734, "num_tokens": 107228065.0, "step": 61820 }, { "entropy": 5.838554716110229, "epoch": 4.810192569539, "grad_norm": 1.4140625, "learning_rate": 0.00029126040573457886, "loss": 4.8363, "mean_token_accuracy": 0.2244905337691307, "num_tokens": 107236730.0, "step": 61825 }, { "entropy": 5.9198075294494625, "epoch": 4.8105815989107175, "grad_norm": 1.4765625, "learning_rate": 0.00029123276249393707, "loss": 4.9292, "mean_token_accuracy": 0.2163254514336586, "num_tokens": 107245491.0, "step": 61830 }, { "entropy": 5.849360990524292, "epoch": 4.810970628282435, "grad_norm": 1.421875, "learning_rate": 0.00029120511900698894, "loss": 4.9127, "mean_token_accuracy": 0.21540557146072387, "num_tokens": 107254428.0, "step": 61835 }, { "entropy": 5.965359830856324, "epoch": 4.811359657654153, "grad_norm": 1.4609375, "learning_rate": 0.000291177475274154, "loss": 5.0839, "mean_token_accuracy": 0.2058124929666519, "num_tokens": 107263070.0, "step": 61840 }, { "entropy": 5.96596131324768, "epoch": 4.8117486870258706, "grad_norm": 1.296875, "learning_rate": 0.0002911498312958516, "loss": 4.9735, "mean_token_accuracy": 0.21580142974853517, "num_tokens": 107271779.0, "step": 61845 }, { "entropy": 5.8652587890625, "epoch": 4.812137716397588, "grad_norm": 1.3671875, "learning_rate": 0.00029112218707250115, "loss": 4.7786, "mean_token_accuracy": 0.2264339178800583, "num_tokens": 107280489.0, "step": 61850 }, { "entropy": 5.847153425216675, "epoch": 4.812526745769306, "grad_norm": 1.4296875, "learning_rate": 0.00029109454260452223, "loss": 4.9396, "mean_token_accuracy": 0.2139160230755806, "num_tokens": 107289536.0, "step": 61855 }, { "entropy": 5.895623350143433, "epoch": 4.812915775141024, "grad_norm": 1.4296875, "learning_rate": 0.00029106689789233425, "loss": 4.9337, "mean_token_accuracy": 0.2089979588985443, "num_tokens": 107298082.0, "step": 61860 }, { "entropy": 5.9282997131347654, "epoch": 4.8133048045127405, "grad_norm": 1.40625, "learning_rate": 0.0002910392529363566, "loss": 4.9899, "mean_token_accuracy": 0.20948233753442763, "num_tokens": 107306769.0, "step": 61865 }, { "entropy": 5.947876596450806, "epoch": 4.813693833884458, "grad_norm": 1.3828125, "learning_rate": 0.00029101160773700887, "loss": 4.9923, "mean_token_accuracy": 0.21442489624023436, "num_tokens": 107315122.0, "step": 61870 }, { "entropy": 5.910910940170288, "epoch": 4.814082863256176, "grad_norm": 1.609375, "learning_rate": 0.0002909839622947104, "loss": 4.9616, "mean_token_accuracy": 0.21395664364099504, "num_tokens": 107323182.0, "step": 61875 }, { "entropy": 5.893836450576782, "epoch": 4.8144718926278935, "grad_norm": 1.4375, "learning_rate": 0.0002909563166098809, "loss": 4.9278, "mean_token_accuracy": 0.22578376829624175, "num_tokens": 107331502.0, "step": 61880 }, { "entropy": 5.842210292816162, "epoch": 4.814860921999611, "grad_norm": 1.5, "learning_rate": 0.00029092867068293966, "loss": 4.9275, "mean_token_accuracy": 0.21833933740854264, "num_tokens": 107340440.0, "step": 61885 }, { "entropy": 5.9327116966247555, "epoch": 4.815249951371328, "grad_norm": 1.5625, "learning_rate": 0.0002909010245143061, "loss": 4.9901, "mean_token_accuracy": 0.218713741004467, "num_tokens": 107348983.0, "step": 61890 }, { "entropy": 5.935223054885864, "epoch": 4.815638980743046, "grad_norm": 1.390625, "learning_rate": 0.0002908733781043998, "loss": 4.9675, "mean_token_accuracy": 0.21698195040225982, "num_tokens": 107358209.0, "step": 61895 }, { "entropy": 5.80257363319397, "epoch": 4.8160280101147634, "grad_norm": 1.3828125, "learning_rate": 0.0002908457314536403, "loss": 4.8188, "mean_token_accuracy": 0.21979471296072006, "num_tokens": 107366901.0, "step": 61900 }, { "entropy": 5.881351661682129, "epoch": 4.816417039486481, "grad_norm": 1.5078125, "learning_rate": 0.00029081808456244703, "loss": 4.9089, "mean_token_accuracy": 0.2138473644852638, "num_tokens": 107374742.0, "step": 61905 }, { "entropy": 5.865342998504639, "epoch": 4.816806068858199, "grad_norm": 1.4140625, "learning_rate": 0.00029079043743123953, "loss": 4.9112, "mean_token_accuracy": 0.21983760893344878, "num_tokens": 107383608.0, "step": 61910 }, { "entropy": 5.864350700378418, "epoch": 4.8171950982299165, "grad_norm": 1.3359375, "learning_rate": 0.00029076279006043723, "loss": 5.0073, "mean_token_accuracy": 0.21005658507347108, "num_tokens": 107392453.0, "step": 61915 }, { "entropy": 5.918496370315552, "epoch": 4.817584127601634, "grad_norm": 1.3984375, "learning_rate": 0.0002907351424504597, "loss": 4.9835, "mean_token_accuracy": 0.21348755061626434, "num_tokens": 107401114.0, "step": 61920 }, { "entropy": 5.893487405776978, "epoch": 4.817973156973352, "grad_norm": 1.46875, "learning_rate": 0.0002907074946017265, "loss": 4.9421, "mean_token_accuracy": 0.21582500487565995, "num_tokens": 107409630.0, "step": 61925 }, { "entropy": 5.875457620620727, "epoch": 4.818362186345069, "grad_norm": 1.5234375, "learning_rate": 0.000290679846514657, "loss": 4.9613, "mean_token_accuracy": 0.2117021158337593, "num_tokens": 107418404.0, "step": 61930 }, { "entropy": 5.861436128616333, "epoch": 4.818751215716786, "grad_norm": 1.4375, "learning_rate": 0.00029065219818967075, "loss": 4.9215, "mean_token_accuracy": 0.2218944564461708, "num_tokens": 107427094.0, "step": 61935 }, { "entropy": 5.884388065338134, "epoch": 4.819140245088504, "grad_norm": 1.46875, "learning_rate": 0.00029062454962718736, "loss": 4.9421, "mean_token_accuracy": 0.21704270243644713, "num_tokens": 107436407.0, "step": 61940 }, { "entropy": 5.93908724784851, "epoch": 4.819529274460222, "grad_norm": 1.3203125, "learning_rate": 0.0002905969008276263, "loss": 5.0393, "mean_token_accuracy": 0.20738417506217957, "num_tokens": 107444647.0, "step": 61945 }, { "entropy": 5.917088031768799, "epoch": 4.8199183038319395, "grad_norm": 1.5625, "learning_rate": 0.0002905692517914071, "loss": 4.9204, "mean_token_accuracy": 0.2218498021364212, "num_tokens": 107453212.0, "step": 61950 }, { "entropy": 5.909564018249512, "epoch": 4.820307333203657, "grad_norm": 1.4375, "learning_rate": 0.00029054160251894924, "loss": 5.0197, "mean_token_accuracy": 0.21248814165592195, "num_tokens": 107462870.0, "step": 61955 }, { "entropy": 5.898371696472168, "epoch": 4.820696362575374, "grad_norm": 1.4921875, "learning_rate": 0.0002905139530106724, "loss": 4.9287, "mean_token_accuracy": 0.21813525706529618, "num_tokens": 107470483.0, "step": 61960 }, { "entropy": 5.899685001373291, "epoch": 4.821085391947092, "grad_norm": 1.3125, "learning_rate": 0.00029048630326699594, "loss": 4.9073, "mean_token_accuracy": 0.22235707193613052, "num_tokens": 107478720.0, "step": 61965 }, { "entropy": 5.830667734146118, "epoch": 4.821474421318809, "grad_norm": 1.4296875, "learning_rate": 0.00029045865328833944, "loss": 4.8847, "mean_token_accuracy": 0.22177153676748276, "num_tokens": 107487304.0, "step": 61970 }, { "entropy": 5.917517948150635, "epoch": 4.821863450690527, "grad_norm": 1.421875, "learning_rate": 0.00029043100307512247, "loss": 4.9347, "mean_token_accuracy": 0.21476486027240754, "num_tokens": 107495716.0, "step": 61975 }, { "entropy": 5.9309529781341555, "epoch": 4.822252480062245, "grad_norm": 1.4453125, "learning_rate": 0.00029040335262776467, "loss": 4.8879, "mean_token_accuracy": 0.22576336413621903, "num_tokens": 107504884.0, "step": 61980 }, { "entropy": 5.879701709747314, "epoch": 4.8226415094339625, "grad_norm": 1.4140625, "learning_rate": 0.0002903757019466855, "loss": 4.9461, "mean_token_accuracy": 0.22229569107294084, "num_tokens": 107513756.0, "step": 61985 }, { "entropy": 5.869576168060303, "epoch": 4.82303053880568, "grad_norm": 1.46875, "learning_rate": 0.00029034805103230453, "loss": 4.8949, "mean_token_accuracy": 0.2164277881383896, "num_tokens": 107521768.0, "step": 61990 }, { "entropy": 5.94304461479187, "epoch": 4.823419568177397, "grad_norm": 1.375, "learning_rate": 0.00029032039988504126, "loss": 5.0502, "mean_token_accuracy": 0.20650026351213455, "num_tokens": 107530454.0, "step": 61995 }, { "entropy": 5.8508758544921875, "epoch": 4.823808597549115, "grad_norm": 1.484375, "learning_rate": 0.00029029274850531534, "loss": 4.84, "mean_token_accuracy": 0.2179330751299858, "num_tokens": 107539114.0, "step": 62000 }, { "entropy": 5.839717197418213, "epoch": 4.824197626920832, "grad_norm": 1.28125, "learning_rate": 0.00029026509689354635, "loss": 4.8778, "mean_token_accuracy": 0.22520221024751663, "num_tokens": 107548698.0, "step": 62005 }, { "entropy": 5.8696778297424315, "epoch": 4.82458665629255, "grad_norm": 1.34375, "learning_rate": 0.00029023744505015373, "loss": 4.9514, "mean_token_accuracy": 0.21642776280641557, "num_tokens": 107558391.0, "step": 62010 }, { "entropy": 5.96497163772583, "epoch": 4.824975685664268, "grad_norm": 1.4921875, "learning_rate": 0.00029020979297555717, "loss": 4.9614, "mean_token_accuracy": 0.21327578276395798, "num_tokens": 107567640.0, "step": 62015 }, { "entropy": 5.906280183792115, "epoch": 4.8253647150359855, "grad_norm": 1.4375, "learning_rate": 0.00029018214067017624, "loss": 4.8958, "mean_token_accuracy": 0.22210168540477754, "num_tokens": 107576394.0, "step": 62020 }, { "entropy": 5.871028280258178, "epoch": 4.825753744407702, "grad_norm": 1.5078125, "learning_rate": 0.0002901544881344305, "loss": 4.9234, "mean_token_accuracy": 0.2147579684853554, "num_tokens": 107584957.0, "step": 62025 }, { "entropy": 5.935571813583374, "epoch": 4.82614277377942, "grad_norm": 1.40625, "learning_rate": 0.0002901268353687394, "loss": 4.9853, "mean_token_accuracy": 0.21331010162830352, "num_tokens": 107593712.0, "step": 62030 }, { "entropy": 5.837939119338989, "epoch": 4.826531803151138, "grad_norm": 1.53125, "learning_rate": 0.00029009918237352274, "loss": 4.9058, "mean_token_accuracy": 0.21637653261423112, "num_tokens": 107602169.0, "step": 62035 }, { "entropy": 5.931995868682861, "epoch": 4.826920832522855, "grad_norm": 1.484375, "learning_rate": 0.0002900715291492, "loss": 4.9839, "mean_token_accuracy": 0.2193202033638954, "num_tokens": 107610610.0, "step": 62040 }, { "entropy": 5.86958794593811, "epoch": 4.827309861894573, "grad_norm": 1.3359375, "learning_rate": 0.0002900438756961908, "loss": 4.8537, "mean_token_accuracy": 0.21837698817253112, "num_tokens": 107619181.0, "step": 62045 }, { "entropy": 5.84639892578125, "epoch": 4.827698891266291, "grad_norm": 1.453125, "learning_rate": 0.0002900162220149148, "loss": 4.9221, "mean_token_accuracy": 0.22707315236330033, "num_tokens": 107627577.0, "step": 62050 }, { "entropy": 5.829078149795532, "epoch": 4.8280879206380085, "grad_norm": 1.421875, "learning_rate": 0.00028998856810579144, "loss": 4.911, "mean_token_accuracy": 0.21625610440969467, "num_tokens": 107635967.0, "step": 62055 }, { "entropy": 5.844146728515625, "epoch": 4.828476950009726, "grad_norm": 1.3828125, "learning_rate": 0.0002899609139692405, "loss": 4.9155, "mean_token_accuracy": 0.21824893206357956, "num_tokens": 107644736.0, "step": 62060 }, { "entropy": 5.8452691555023195, "epoch": 4.828865979381443, "grad_norm": 1.296875, "learning_rate": 0.00028993325960568133, "loss": 4.9507, "mean_token_accuracy": 0.21232314258813859, "num_tokens": 107654182.0, "step": 62065 }, { "entropy": 5.905589818954468, "epoch": 4.829255008753161, "grad_norm": 1.578125, "learning_rate": 0.0002899056050155339, "loss": 4.9265, "mean_token_accuracy": 0.22382637113332748, "num_tokens": 107662261.0, "step": 62070 }, { "entropy": 5.861131191253662, "epoch": 4.829644038124878, "grad_norm": 1.46875, "learning_rate": 0.0002898779501992176, "loss": 4.9597, "mean_token_accuracy": 0.2151722565293312, "num_tokens": 107670633.0, "step": 62075 }, { "entropy": 5.851321506500244, "epoch": 4.830033067496596, "grad_norm": 1.296875, "learning_rate": 0.000289850295157152, "loss": 4.9341, "mean_token_accuracy": 0.2192945286631584, "num_tokens": 107679627.0, "step": 62080 }, { "entropy": 5.939016580581665, "epoch": 4.830422096868314, "grad_norm": 1.390625, "learning_rate": 0.00028982263988975687, "loss": 4.8973, "mean_token_accuracy": 0.22275057733058928, "num_tokens": 107688051.0, "step": 62085 }, { "entropy": 5.886831331253052, "epoch": 4.8308111262400315, "grad_norm": 1.5546875, "learning_rate": 0.0002897949843974518, "loss": 4.8907, "mean_token_accuracy": 0.21942337453365326, "num_tokens": 107696611.0, "step": 62090 }, { "entropy": 5.863000106811524, "epoch": 4.831200155611748, "grad_norm": 1.421875, "learning_rate": 0.0002897673286806562, "loss": 4.8384, "mean_token_accuracy": 0.2208089277148247, "num_tokens": 107705236.0, "step": 62095 }, { "entropy": 5.877387380599975, "epoch": 4.831589184983466, "grad_norm": 1.40625, "learning_rate": 0.0002897396727397901, "loss": 4.9103, "mean_token_accuracy": 0.22393605709075928, "num_tokens": 107713500.0, "step": 62100 }, { "entropy": 5.846330165863037, "epoch": 4.831978214355184, "grad_norm": 1.4375, "learning_rate": 0.0002897120165752729, "loss": 4.9103, "mean_token_accuracy": 0.22097325325012207, "num_tokens": 107722855.0, "step": 62105 }, { "entropy": 5.910072708129883, "epoch": 4.832367243726901, "grad_norm": 1.453125, "learning_rate": 0.0002896843601875243, "loss": 4.9475, "mean_token_accuracy": 0.21377041488885878, "num_tokens": 107731818.0, "step": 62110 }, { "entropy": 5.89212007522583, "epoch": 4.832756273098619, "grad_norm": 1.375, "learning_rate": 0.00028965670357696384, "loss": 4.9307, "mean_token_accuracy": 0.2159130722284317, "num_tokens": 107741008.0, "step": 62115 }, { "entropy": 5.885447549819946, "epoch": 4.833145302470337, "grad_norm": 1.46875, "learning_rate": 0.00028962904674401124, "loss": 4.8813, "mean_token_accuracy": 0.2212527334690094, "num_tokens": 107750172.0, "step": 62120 }, { "entropy": 5.874864006042481, "epoch": 4.8335343318420545, "grad_norm": 1.5703125, "learning_rate": 0.0002896013896890862, "loss": 4.9819, "mean_token_accuracy": 0.21130937486886978, "num_tokens": 107759152.0, "step": 62125 }, { "entropy": 5.874926233291626, "epoch": 4.833923361213771, "grad_norm": 1.46875, "learning_rate": 0.00028957373241260816, "loss": 4.9169, "mean_token_accuracy": 0.22224509119987487, "num_tokens": 107767636.0, "step": 62130 }, { "entropy": 5.849129486083984, "epoch": 4.834312390585489, "grad_norm": 1.4140625, "learning_rate": 0.000289546074914997, "loss": 4.9387, "mean_token_accuracy": 0.2185625210404396, "num_tokens": 107776771.0, "step": 62135 }, { "entropy": 5.8795229434967045, "epoch": 4.834701419957207, "grad_norm": 1.421875, "learning_rate": 0.0002895184171966724, "loss": 4.9697, "mean_token_accuracy": 0.20924233496189118, "num_tokens": 107785498.0, "step": 62140 }, { "entropy": 5.895925521850586, "epoch": 4.835090449328924, "grad_norm": 1.390625, "learning_rate": 0.0002894907592580538, "loss": 4.9041, "mean_token_accuracy": 0.2157543942332268, "num_tokens": 107794407.0, "step": 62145 }, { "entropy": 5.870306348800659, "epoch": 4.835479478700642, "grad_norm": 1.453125, "learning_rate": 0.00028946310109956107, "loss": 4.8593, "mean_token_accuracy": 0.22420860081911087, "num_tokens": 107803570.0, "step": 62150 }, { "entropy": 5.91444845199585, "epoch": 4.83586850807236, "grad_norm": 1.484375, "learning_rate": 0.0002894354427216138, "loss": 5.0017, "mean_token_accuracy": 0.21051058173179626, "num_tokens": 107811908.0, "step": 62155 }, { "entropy": 5.81254768371582, "epoch": 4.836257537444077, "grad_norm": 1.25, "learning_rate": 0.00028940778412463164, "loss": 4.8944, "mean_token_accuracy": 0.22054685652256012, "num_tokens": 107820819.0, "step": 62160 }, { "entropy": 5.869008541107178, "epoch": 4.836646566815794, "grad_norm": 1.4296875, "learning_rate": 0.00028938012530903425, "loss": 4.8903, "mean_token_accuracy": 0.22547455877065659, "num_tokens": 107829583.0, "step": 62165 }, { "entropy": 5.9023009777069095, "epoch": 4.837035596187512, "grad_norm": 1.328125, "learning_rate": 0.0002893524662752414, "loss": 4.9533, "mean_token_accuracy": 0.2111619770526886, "num_tokens": 107838880.0, "step": 62170 }, { "entropy": 5.981964874267578, "epoch": 4.83742462555923, "grad_norm": 1.4296875, "learning_rate": 0.00028932480702367264, "loss": 5.0481, "mean_token_accuracy": 0.21153555661439896, "num_tokens": 107848646.0, "step": 62175 }, { "entropy": 5.875278520584106, "epoch": 4.837813654930947, "grad_norm": 1.4453125, "learning_rate": 0.0002892971475547478, "loss": 4.8676, "mean_token_accuracy": 0.21869334429502488, "num_tokens": 107856629.0, "step": 62180 }, { "entropy": 5.901328420639038, "epoch": 4.838202684302665, "grad_norm": 1.4765625, "learning_rate": 0.00028926948786888655, "loss": 4.9987, "mean_token_accuracy": 0.21563210636377333, "num_tokens": 107865219.0, "step": 62185 }, { "entropy": 5.866179275512695, "epoch": 4.838591713674383, "grad_norm": 1.4140625, "learning_rate": 0.00028924182796650854, "loss": 4.8821, "mean_token_accuracy": 0.22186527103185655, "num_tokens": 107873448.0, "step": 62190 }, { "entropy": 5.861680412292481, "epoch": 4.8389807430461, "grad_norm": 1.4375, "learning_rate": 0.00028921416784803336, "loss": 4.9429, "mean_token_accuracy": 0.2125310942530632, "num_tokens": 107881355.0, "step": 62195 }, { "entropy": 5.8479033470153805, "epoch": 4.839369772417817, "grad_norm": 1.4609375, "learning_rate": 0.0002891865075138809, "loss": 4.9425, "mean_token_accuracy": 0.21401943117380143, "num_tokens": 107890112.0, "step": 62200 }, { "entropy": 5.917454433441162, "epoch": 4.839758801789535, "grad_norm": 1.4765625, "learning_rate": 0.00028915884696447064, "loss": 4.959, "mean_token_accuracy": 0.21557158827781678, "num_tokens": 107898764.0, "step": 62205 }, { "entropy": 5.882563066482544, "epoch": 4.840147831161253, "grad_norm": 1.453125, "learning_rate": 0.0002891311862002225, "loss": 4.9355, "mean_token_accuracy": 0.21420456767082213, "num_tokens": 107907895.0, "step": 62210 }, { "entropy": 5.9254903316497805, "epoch": 4.84053686053297, "grad_norm": 1.6015625, "learning_rate": 0.0002891035252215561, "loss": 4.954, "mean_token_accuracy": 0.21492969840765, "num_tokens": 107916083.0, "step": 62215 }, { "entropy": 5.941675806045533, "epoch": 4.840925889904688, "grad_norm": 1.4453125, "learning_rate": 0.00028907586402889115, "loss": 5.0056, "mean_token_accuracy": 0.209830379486084, "num_tokens": 107925783.0, "step": 62220 }, { "entropy": 5.952735042572021, "epoch": 4.841314919276405, "grad_norm": 1.390625, "learning_rate": 0.0002890482026226473, "loss": 5.0017, "mean_token_accuracy": 0.21599783301353453, "num_tokens": 107934579.0, "step": 62225 }, { "entropy": 5.813460826873779, "epoch": 4.841703948648123, "grad_norm": 1.3046875, "learning_rate": 0.00028902054100324445, "loss": 4.8213, "mean_token_accuracy": 0.2246412843465805, "num_tokens": 107944067.0, "step": 62230 }, { "entropy": 5.925602626800537, "epoch": 4.84209297801984, "grad_norm": 1.5390625, "learning_rate": 0.00028899287917110214, "loss": 4.9817, "mean_token_accuracy": 0.20910331159830092, "num_tokens": 107952787.0, "step": 62235 }, { "entropy": 5.856427478790283, "epoch": 4.842482007391558, "grad_norm": 1.4296875, "learning_rate": 0.0002889652171266402, "loss": 4.8965, "mean_token_accuracy": 0.22313415110111237, "num_tokens": 107961628.0, "step": 62240 }, { "entropy": 5.853416967391968, "epoch": 4.842871036763276, "grad_norm": 1.5234375, "learning_rate": 0.00028893755487027827, "loss": 4.9351, "mean_token_accuracy": 0.22663459330797195, "num_tokens": 107969885.0, "step": 62245 }, { "entropy": 5.887207508087158, "epoch": 4.843260066134993, "grad_norm": 1.375, "learning_rate": 0.00028890989240243614, "loss": 4.8676, "mean_token_accuracy": 0.21991741955280303, "num_tokens": 107978018.0, "step": 62250 }, { "entropy": 5.914603614807129, "epoch": 4.843649095506711, "grad_norm": 1.4921875, "learning_rate": 0.00028888222972353356, "loss": 4.9247, "mean_token_accuracy": 0.2128503367304802, "num_tokens": 107986267.0, "step": 62255 }, { "entropy": 5.900496578216552, "epoch": 4.844038124878429, "grad_norm": 1.3984375, "learning_rate": 0.00028885456683399024, "loss": 4.99, "mean_token_accuracy": 0.21534063816070556, "num_tokens": 107995083.0, "step": 62260 }, { "entropy": 5.81304030418396, "epoch": 4.844427154250146, "grad_norm": 1.5625, "learning_rate": 0.00028882690373422586, "loss": 4.9032, "mean_token_accuracy": 0.22105390727519988, "num_tokens": 108003616.0, "step": 62265 }, { "entropy": 5.815735864639282, "epoch": 4.844816183621863, "grad_norm": 1.5, "learning_rate": 0.0002887992404246603, "loss": 4.876, "mean_token_accuracy": 0.2197629228234291, "num_tokens": 108012429.0, "step": 62270 }, { "entropy": 5.922047805786133, "epoch": 4.845205212993581, "grad_norm": 1.3671875, "learning_rate": 0.0002887715769057132, "loss": 4.963, "mean_token_accuracy": 0.20835772901773453, "num_tokens": 108021436.0, "step": 62275 }, { "entropy": 5.876093435287475, "epoch": 4.845594242365299, "grad_norm": 1.421875, "learning_rate": 0.00028874391317780437, "loss": 4.8938, "mean_token_accuracy": 0.21242813915014266, "num_tokens": 108030677.0, "step": 62280 }, { "entropy": 5.882072877883911, "epoch": 4.845983271737016, "grad_norm": 1.53125, "learning_rate": 0.0002887162492413534, "loss": 4.9634, "mean_token_accuracy": 0.2163059875369072, "num_tokens": 108038922.0, "step": 62285 }, { "entropy": 5.910499477386475, "epoch": 4.846372301108734, "grad_norm": 1.421875, "learning_rate": 0.0002886885850967803, "loss": 4.9686, "mean_token_accuracy": 0.21437685936689377, "num_tokens": 108048279.0, "step": 62290 }, { "entropy": 5.887196159362793, "epoch": 4.846761330480451, "grad_norm": 1.3359375, "learning_rate": 0.00028866092074450467, "loss": 4.8937, "mean_token_accuracy": 0.2174646556377411, "num_tokens": 108057875.0, "step": 62295 }, { "entropy": 5.822545433044434, "epoch": 4.847150359852169, "grad_norm": 1.421875, "learning_rate": 0.0002886332561849464, "loss": 4.7654, "mean_token_accuracy": 0.2337066188454628, "num_tokens": 108066056.0, "step": 62300 }, { "entropy": 5.803968811035157, "epoch": 4.847539389223886, "grad_norm": 1.4765625, "learning_rate": 0.00028860559141852504, "loss": 4.8275, "mean_token_accuracy": 0.22822553813457488, "num_tokens": 108074641.0, "step": 62305 }, { "entropy": 5.7953619956970215, "epoch": 4.847928418595604, "grad_norm": 1.3515625, "learning_rate": 0.00028857792644566057, "loss": 4.8308, "mean_token_accuracy": 0.22146357148885726, "num_tokens": 108083433.0, "step": 62310 }, { "entropy": 5.840663242340088, "epoch": 4.848317447967322, "grad_norm": 1.4140625, "learning_rate": 0.0002885502612667727, "loss": 4.8686, "mean_token_accuracy": 0.21989228278398515, "num_tokens": 108092191.0, "step": 62315 }, { "entropy": 5.849950981140137, "epoch": 4.848706477339039, "grad_norm": 1.40625, "learning_rate": 0.00028852259588228106, "loss": 4.8582, "mean_token_accuracy": 0.22538453787565232, "num_tokens": 108100141.0, "step": 62320 }, { "entropy": 5.882545518875122, "epoch": 4.849095506710757, "grad_norm": 1.3359375, "learning_rate": 0.00028849493029260573, "loss": 4.9576, "mean_token_accuracy": 0.21220564544200898, "num_tokens": 108108863.0, "step": 62325 }, { "entropy": 5.91484751701355, "epoch": 4.849484536082474, "grad_norm": 1.328125, "learning_rate": 0.0002884672644981661, "loss": 4.9607, "mean_token_accuracy": 0.20958262383937837, "num_tokens": 108117708.0, "step": 62330 }, { "entropy": 5.92452712059021, "epoch": 4.849873565454192, "grad_norm": 1.3828125, "learning_rate": 0.0002884395984993823, "loss": 4.9678, "mean_token_accuracy": 0.21214203238487245, "num_tokens": 108126739.0, "step": 62335 }, { "entropy": 5.844645929336548, "epoch": 4.850262594825909, "grad_norm": 1.421875, "learning_rate": 0.000288411932296674, "loss": 4.8237, "mean_token_accuracy": 0.22675587832927704, "num_tokens": 108135173.0, "step": 62340 }, { "entropy": 5.85316481590271, "epoch": 4.850651624197627, "grad_norm": 1.3515625, "learning_rate": 0.0002883842658904609, "loss": 4.812, "mean_token_accuracy": 0.24071256667375565, "num_tokens": 108144225.0, "step": 62345 }, { "entropy": 5.793784236907959, "epoch": 4.851040653569345, "grad_norm": 1.3828125, "learning_rate": 0.0002883565992811629, "loss": 4.8657, "mean_token_accuracy": 0.2242927297949791, "num_tokens": 108152701.0, "step": 62350 }, { "entropy": 5.846787691116333, "epoch": 4.851429682941062, "grad_norm": 1.375, "learning_rate": 0.0002883289324691998, "loss": 4.9286, "mean_token_accuracy": 0.2189866080880165, "num_tokens": 108161467.0, "step": 62355 }, { "entropy": 5.904319477081299, "epoch": 4.851818712312779, "grad_norm": 1.4296875, "learning_rate": 0.0002883012654549913, "loss": 4.9176, "mean_token_accuracy": 0.21888498067855836, "num_tokens": 108170725.0, "step": 62360 }, { "entropy": 5.919288396835327, "epoch": 4.852207741684497, "grad_norm": 1.4140625, "learning_rate": 0.00028827359823895726, "loss": 5.0157, "mean_token_accuracy": 0.21134620159864426, "num_tokens": 108179173.0, "step": 62365 }, { "entropy": 5.925215387344361, "epoch": 4.852596771056215, "grad_norm": 1.4609375, "learning_rate": 0.00028824593082151754, "loss": 4.9115, "mean_token_accuracy": 0.22222490906715392, "num_tokens": 108187976.0, "step": 62370 }, { "entropy": 5.916512823104858, "epoch": 4.852985800427932, "grad_norm": 1.421875, "learning_rate": 0.0002882182632030919, "loss": 5.0126, "mean_token_accuracy": 0.21128493249416352, "num_tokens": 108196272.0, "step": 62375 }, { "entropy": 5.852432107925415, "epoch": 4.85337482979965, "grad_norm": 1.34375, "learning_rate": 0.0002881905953841002, "loss": 4.9033, "mean_token_accuracy": 0.21789026260375977, "num_tokens": 108204715.0, "step": 62380 }, { "entropy": 5.91992678642273, "epoch": 4.853763859171368, "grad_norm": 1.4765625, "learning_rate": 0.0002881629273649621, "loss": 4.9247, "mean_token_accuracy": 0.21823257803916932, "num_tokens": 108213122.0, "step": 62385 }, { "entropy": 5.866619634628296, "epoch": 4.854152888543085, "grad_norm": 1.5, "learning_rate": 0.00028813525914609767, "loss": 4.9262, "mean_token_accuracy": 0.21817003488540648, "num_tokens": 108221792.0, "step": 62390 }, { "entropy": 5.913182544708252, "epoch": 4.854541917914803, "grad_norm": 1.390625, "learning_rate": 0.00028810759072792644, "loss": 4.9484, "mean_token_accuracy": 0.21674841940402984, "num_tokens": 108231542.0, "step": 62395 }, { "entropy": 5.900798654556274, "epoch": 4.85493094728652, "grad_norm": 1.40625, "learning_rate": 0.0002880799221108684, "loss": 5.0144, "mean_token_accuracy": 0.20791709572076797, "num_tokens": 108240565.0, "step": 62400 }, { "entropy": 5.951684856414795, "epoch": 4.855319976658238, "grad_norm": 1.5234375, "learning_rate": 0.0002880522532953435, "loss": 5.0492, "mean_token_accuracy": 0.20978060662746428, "num_tokens": 108249058.0, "step": 62405 }, { "entropy": 5.896510744094849, "epoch": 4.855709006029955, "grad_norm": 1.484375, "learning_rate": 0.0002880245842817713, "loss": 4.8479, "mean_token_accuracy": 0.22688811123371125, "num_tokens": 108256659.0, "step": 62410 }, { "entropy": 5.859241056442261, "epoch": 4.856098035401673, "grad_norm": 1.421875, "learning_rate": 0.0002879969150705718, "loss": 4.8644, "mean_token_accuracy": 0.22180895507335663, "num_tokens": 108265230.0, "step": 62415 }, { "entropy": 5.9231500148773195, "epoch": 4.856487064773391, "grad_norm": 1.515625, "learning_rate": 0.0002879692456621649, "loss": 5.0401, "mean_token_accuracy": 0.20798333436250688, "num_tokens": 108273563.0, "step": 62420 }, { "entropy": 5.845493125915527, "epoch": 4.8568760941451075, "grad_norm": 1.578125, "learning_rate": 0.0002879415760569702, "loss": 4.8982, "mean_token_accuracy": 0.2185686230659485, "num_tokens": 108281746.0, "step": 62425 }, { "entropy": 5.91968002319336, "epoch": 4.857265123516825, "grad_norm": 1.375, "learning_rate": 0.0002879139062554077, "loss": 4.9855, "mean_token_accuracy": 0.2107301712036133, "num_tokens": 108290066.0, "step": 62430 }, { "entropy": 5.938291072845459, "epoch": 4.857654152888543, "grad_norm": 1.4921875, "learning_rate": 0.00028788623625789725, "loss": 4.9832, "mean_token_accuracy": 0.2107479214668274, "num_tokens": 108298984.0, "step": 62435 }, { "entropy": 5.920580101013184, "epoch": 4.8580431822602606, "grad_norm": 1.359375, "learning_rate": 0.0002878585660648587, "loss": 4.9159, "mean_token_accuracy": 0.21830906271934508, "num_tokens": 108308101.0, "step": 62440 }, { "entropy": 5.932555055618286, "epoch": 4.858432211631978, "grad_norm": 1.359375, "learning_rate": 0.0002878308956767118, "loss": 4.9679, "mean_token_accuracy": 0.2188437357544899, "num_tokens": 108316679.0, "step": 62445 }, { "entropy": 5.871972560882568, "epoch": 4.858821241003696, "grad_norm": 1.453125, "learning_rate": 0.0002878032250938766, "loss": 4.9082, "mean_token_accuracy": 0.225163072347641, "num_tokens": 108325751.0, "step": 62450 }, { "entropy": 5.90297498703003, "epoch": 4.859210270375414, "grad_norm": 1.421875, "learning_rate": 0.00028777555431677276, "loss": 4.9335, "mean_token_accuracy": 0.2088163435459137, "num_tokens": 108335000.0, "step": 62455 }, { "entropy": 5.814658689498901, "epoch": 4.859599299747131, "grad_norm": 1.375, "learning_rate": 0.00028774788334582025, "loss": 4.8945, "mean_token_accuracy": 0.21545420140028, "num_tokens": 108343862.0, "step": 62460 }, { "entropy": 5.900244331359863, "epoch": 4.859988329118848, "grad_norm": 1.34375, "learning_rate": 0.0002877202121814389, "loss": 5.0139, "mean_token_accuracy": 0.20971643477678298, "num_tokens": 108353521.0, "step": 62465 }, { "entropy": 5.820962142944336, "epoch": 4.860377358490566, "grad_norm": 1.421875, "learning_rate": 0.0002876925408240485, "loss": 4.8955, "mean_token_accuracy": 0.22710434049367906, "num_tokens": 108362633.0, "step": 62470 }, { "entropy": 5.8281372547149655, "epoch": 4.8607663878622835, "grad_norm": 1.4375, "learning_rate": 0.0002876648692740691, "loss": 4.8014, "mean_token_accuracy": 0.2258273482322693, "num_tokens": 108371376.0, "step": 62475 }, { "entropy": 5.847288322448731, "epoch": 4.861155417234001, "grad_norm": 1.4765625, "learning_rate": 0.00028763719753192044, "loss": 4.8819, "mean_token_accuracy": 0.2301265612244606, "num_tokens": 108379107.0, "step": 62480 }, { "entropy": 5.9092645168304445, "epoch": 4.861544446605719, "grad_norm": 1.5078125, "learning_rate": 0.0002876095255980224, "loss": 4.9983, "mean_token_accuracy": 0.20798783153295516, "num_tokens": 108387001.0, "step": 62485 }, { "entropy": 5.927778720855713, "epoch": 4.861933475977437, "grad_norm": 1.4375, "learning_rate": 0.00028758185347279485, "loss": 4.9452, "mean_token_accuracy": 0.219222030043602, "num_tokens": 108395513.0, "step": 62490 }, { "entropy": 5.903514719009399, "epoch": 4.8623225053491534, "grad_norm": 1.4140625, "learning_rate": 0.0002875541811566578, "loss": 4.928, "mean_token_accuracy": 0.21933302879333497, "num_tokens": 108404304.0, "step": 62495 }, { "entropy": 5.872148609161377, "epoch": 4.862711534720871, "grad_norm": 1.390625, "learning_rate": 0.0002875265086500309, "loss": 4.929, "mean_token_accuracy": 0.21544578224420546, "num_tokens": 108412610.0, "step": 62500 }, { "entropy": 5.844034910202026, "epoch": 4.863100564092589, "grad_norm": 1.4296875, "learning_rate": 0.00028749883595333424, "loss": 4.8393, "mean_token_accuracy": 0.2292870834469795, "num_tokens": 108421007.0, "step": 62505 }, { "entropy": 5.792699527740479, "epoch": 4.8634895934643065, "grad_norm": 1.4140625, "learning_rate": 0.0002874711630669876, "loss": 4.8988, "mean_token_accuracy": 0.2186249554157257, "num_tokens": 108429574.0, "step": 62510 }, { "entropy": 5.840561819076538, "epoch": 4.863878622836024, "grad_norm": 1.546875, "learning_rate": 0.000287443489991411, "loss": 4.825, "mean_token_accuracy": 0.22579430490732194, "num_tokens": 108438097.0, "step": 62515 }, { "entropy": 5.861608505249023, "epoch": 4.864267652207742, "grad_norm": 1.421875, "learning_rate": 0.0002874158167270242, "loss": 4.9513, "mean_token_accuracy": 0.2143292471766472, "num_tokens": 108447014.0, "step": 62520 }, { "entropy": 5.870207262039185, "epoch": 4.86465668157946, "grad_norm": 1.3828125, "learning_rate": 0.00028738814327424714, "loss": 4.9529, "mean_token_accuracy": 0.219376839697361, "num_tokens": 108456094.0, "step": 62525 }, { "entropy": 5.91980390548706, "epoch": 4.865045710951176, "grad_norm": 1.40625, "learning_rate": 0.0002873604696334997, "loss": 4.9705, "mean_token_accuracy": 0.2123442217707634, "num_tokens": 108464799.0, "step": 62530 }, { "entropy": 5.878115320205689, "epoch": 4.865434740322894, "grad_norm": 1.3984375, "learning_rate": 0.00028733279580520185, "loss": 4.8639, "mean_token_accuracy": 0.2252853259444237, "num_tokens": 108472677.0, "step": 62535 }, { "entropy": 5.8735191822052, "epoch": 4.865823769694612, "grad_norm": 1.4609375, "learning_rate": 0.00028730512178977343, "loss": 4.988, "mean_token_accuracy": 0.21094561517238616, "num_tokens": 108481589.0, "step": 62540 }, { "entropy": 5.9461023807525635, "epoch": 4.8662127990663295, "grad_norm": 1.375, "learning_rate": 0.00028727744758763434, "loss": 5.0486, "mean_token_accuracy": 0.21543501764535905, "num_tokens": 108490485.0, "step": 62545 }, { "entropy": 5.969494009017945, "epoch": 4.866601828438047, "grad_norm": 1.390625, "learning_rate": 0.00028724977319920453, "loss": 5.0163, "mean_token_accuracy": 0.21681982576847075, "num_tokens": 108499154.0, "step": 62550 }, { "entropy": 5.932147884368897, "epoch": 4.866990857809765, "grad_norm": 1.5234375, "learning_rate": 0.00028722209862490393, "loss": 4.9918, "mean_token_accuracy": 0.20581575781106948, "num_tokens": 108507210.0, "step": 62555 }, { "entropy": 5.943839168548584, "epoch": 4.867379887181482, "grad_norm": 1.4375, "learning_rate": 0.00028719442386515245, "loss": 5.0553, "mean_token_accuracy": 0.21154083013534547, "num_tokens": 108515696.0, "step": 62560 }, { "entropy": 5.842122554779053, "epoch": 4.867768916553199, "grad_norm": 1.4375, "learning_rate": 0.00028716674892036994, "loss": 4.8509, "mean_token_accuracy": 0.2205411598086357, "num_tokens": 108524554.0, "step": 62565 }, { "entropy": 5.907657814025879, "epoch": 4.868157945924917, "grad_norm": 1.40625, "learning_rate": 0.0002871390737909765, "loss": 4.885, "mean_token_accuracy": 0.21514279246330262, "num_tokens": 108533284.0, "step": 62570 }, { "entropy": 5.942115449905396, "epoch": 4.868546975296635, "grad_norm": 1.453125, "learning_rate": 0.00028711139847739187, "loss": 4.9757, "mean_token_accuracy": 0.21199230402708052, "num_tokens": 108541629.0, "step": 62575 }, { "entropy": 5.877481079101562, "epoch": 4.8689360046683525, "grad_norm": 1.6171875, "learning_rate": 0.00028708372298003607, "loss": 4.9362, "mean_token_accuracy": 0.2135868862271309, "num_tokens": 108549879.0, "step": 62580 }, { "entropy": 5.92747745513916, "epoch": 4.86932503404007, "grad_norm": 1.4921875, "learning_rate": 0.00028705604729932895, "loss": 5.0239, "mean_token_accuracy": 0.211185921728611, "num_tokens": 108557902.0, "step": 62585 }, { "entropy": 5.870274257659912, "epoch": 4.869714063411788, "grad_norm": 1.453125, "learning_rate": 0.00028702837143569057, "loss": 4.8705, "mean_token_accuracy": 0.22543398886919022, "num_tokens": 108566354.0, "step": 62590 }, { "entropy": 5.8789654731750485, "epoch": 4.870103092783506, "grad_norm": 1.3671875, "learning_rate": 0.00028700069538954064, "loss": 4.971, "mean_token_accuracy": 0.21002316176891328, "num_tokens": 108574844.0, "step": 62595 }, { "entropy": 5.8980919361114506, "epoch": 4.870492122155222, "grad_norm": 1.3828125, "learning_rate": 0.00028697301916129944, "loss": 4.893, "mean_token_accuracy": 0.21198370009660722, "num_tokens": 108583284.0, "step": 62600 }, { "entropy": 5.835699987411499, "epoch": 4.87088115152694, "grad_norm": 1.4296875, "learning_rate": 0.0002869453427513866, "loss": 4.9332, "mean_token_accuracy": 0.21970461308956146, "num_tokens": 108592005.0, "step": 62605 }, { "entropy": 5.809485197067261, "epoch": 4.871270180898658, "grad_norm": 1.53125, "learning_rate": 0.00028691766616022234, "loss": 4.8088, "mean_token_accuracy": 0.2306772992014885, "num_tokens": 108601516.0, "step": 62610 }, { "entropy": 5.911069059371949, "epoch": 4.8716592102703755, "grad_norm": 1.4453125, "learning_rate": 0.0002868899893882264, "loss": 4.9375, "mean_token_accuracy": 0.214309224486351, "num_tokens": 108610794.0, "step": 62615 }, { "entropy": 5.914481258392334, "epoch": 4.872048239642093, "grad_norm": 1.453125, "learning_rate": 0.00028686231243581873, "loss": 4.9384, "mean_token_accuracy": 0.22024333477020264, "num_tokens": 108619508.0, "step": 62620 }, { "entropy": 5.858764934539795, "epoch": 4.872437269013811, "grad_norm": 1.4453125, "learning_rate": 0.00028683463530341944, "loss": 4.9097, "mean_token_accuracy": 0.22517129480838777, "num_tokens": 108627667.0, "step": 62625 }, { "entropy": 5.9410676002502445, "epoch": 4.872826298385528, "grad_norm": 1.453125, "learning_rate": 0.0002868069579914483, "loss": 4.9949, "mean_token_accuracy": 0.21013107448816298, "num_tokens": 108636756.0, "step": 62630 }, { "entropy": 5.864767074584961, "epoch": 4.873215327757245, "grad_norm": 1.453125, "learning_rate": 0.00028677928050032547, "loss": 4.8759, "mean_token_accuracy": 0.22185056507587433, "num_tokens": 108645388.0, "step": 62635 }, { "entropy": 5.844821405410767, "epoch": 4.873604357128963, "grad_norm": 1.34375, "learning_rate": 0.00028675160283047073, "loss": 4.9415, "mean_token_accuracy": 0.22035716325044633, "num_tokens": 108655406.0, "step": 62640 }, { "entropy": 5.888237762451172, "epoch": 4.873993386500681, "grad_norm": 1.5703125, "learning_rate": 0.00028672392498230414, "loss": 4.9096, "mean_token_accuracy": 0.21594117432832718, "num_tokens": 108663733.0, "step": 62645 }, { "entropy": 5.8950825214385985, "epoch": 4.8743824158723985, "grad_norm": 1.5234375, "learning_rate": 0.00028669624695624573, "loss": 4.9013, "mean_token_accuracy": 0.21335013210773468, "num_tokens": 108671914.0, "step": 62650 }, { "entropy": 5.861316728591919, "epoch": 4.874771445244116, "grad_norm": 1.7109375, "learning_rate": 0.00028666856875271535, "loss": 4.966, "mean_token_accuracy": 0.21195148676633835, "num_tokens": 108679940.0, "step": 62655 }, { "entropy": 5.871832656860351, "epoch": 4.875160474615834, "grad_norm": 1.484375, "learning_rate": 0.0002866408903721329, "loss": 4.9434, "mean_token_accuracy": 0.21383584290742874, "num_tokens": 108688297.0, "step": 62660 }, { "entropy": 5.943823051452637, "epoch": 4.875549503987551, "grad_norm": 1.421875, "learning_rate": 0.00028661321181491854, "loss": 5.0531, "mean_token_accuracy": 0.21138908714056015, "num_tokens": 108697422.0, "step": 62665 }, { "entropy": 5.888514804840088, "epoch": 4.875938533359268, "grad_norm": 1.40625, "learning_rate": 0.0002865855330814922, "loss": 4.9924, "mean_token_accuracy": 0.2148138016462326, "num_tokens": 108706342.0, "step": 62670 }, { "entropy": 5.856881523132325, "epoch": 4.876327562730986, "grad_norm": 1.3671875, "learning_rate": 0.0002865578541722738, "loss": 4.8498, "mean_token_accuracy": 0.2264973357319832, "num_tokens": 108715406.0, "step": 62675 }, { "entropy": 5.91471791267395, "epoch": 4.876716592102704, "grad_norm": 1.34375, "learning_rate": 0.0002865301750876834, "loss": 4.9522, "mean_token_accuracy": 0.21009822487831115, "num_tokens": 108725137.0, "step": 62680 }, { "entropy": 5.924348592758179, "epoch": 4.8771056214744215, "grad_norm": 1.375, "learning_rate": 0.0002865024958281409, "loss": 5.0197, "mean_token_accuracy": 0.21461839675903321, "num_tokens": 108733243.0, "step": 62685 }, { "entropy": 5.925912666320801, "epoch": 4.877494650846139, "grad_norm": 1.3515625, "learning_rate": 0.00028647481639406644, "loss": 5.0546, "mean_token_accuracy": 0.20848291218280793, "num_tokens": 108742242.0, "step": 62690 }, { "entropy": 5.940831995010376, "epoch": 4.877883680217856, "grad_norm": 1.4140625, "learning_rate": 0.00028644713678587983, "loss": 4.98, "mean_token_accuracy": 0.21553827822208405, "num_tokens": 108750736.0, "step": 62695 }, { "entropy": 5.905335569381714, "epoch": 4.878272709589574, "grad_norm": 1.3828125, "learning_rate": 0.00028641945700400104, "loss": 4.9368, "mean_token_accuracy": 0.22155216038227082, "num_tokens": 108759229.0, "step": 62700 }, { "entropy": 5.861728858947754, "epoch": 4.878661738961291, "grad_norm": 1.4296875, "learning_rate": 0.00028639177704885033, "loss": 4.9149, "mean_token_accuracy": 0.21700639724731446, "num_tokens": 108767805.0, "step": 62705 }, { "entropy": 5.920863962173462, "epoch": 4.879050768333009, "grad_norm": 1.46875, "learning_rate": 0.00028636409692084743, "loss": 4.9811, "mean_token_accuracy": 0.21157653480768204, "num_tokens": 108776529.0, "step": 62710 }, { "entropy": 5.849791193008423, "epoch": 4.879439797704727, "grad_norm": 1.3828125, "learning_rate": 0.0002863364166204125, "loss": 4.8498, "mean_token_accuracy": 0.2203465700149536, "num_tokens": 108784944.0, "step": 62715 }, { "entropy": 5.8636078357696535, "epoch": 4.8798288270764445, "grad_norm": 1.4296875, "learning_rate": 0.00028630873614796543, "loss": 4.8544, "mean_token_accuracy": 0.21947544813156128, "num_tokens": 108793225.0, "step": 62720 }, { "entropy": 5.858047103881836, "epoch": 4.880217856448162, "grad_norm": 1.4609375, "learning_rate": 0.00028628105550392637, "loss": 4.9483, "mean_token_accuracy": 0.21337395608425141, "num_tokens": 108801794.0, "step": 62725 }, { "entropy": 5.830312776565552, "epoch": 4.88060688581988, "grad_norm": 1.453125, "learning_rate": 0.0002862533746887152, "loss": 4.9289, "mean_token_accuracy": 0.21703822314739227, "num_tokens": 108810938.0, "step": 62730 }, { "entropy": 5.887650823593139, "epoch": 4.880995915191597, "grad_norm": 1.4140625, "learning_rate": 0.00028622569370275196, "loss": 4.8952, "mean_token_accuracy": 0.22171899676322937, "num_tokens": 108820160.0, "step": 62735 }, { "entropy": 5.889841079711914, "epoch": 4.881384944563314, "grad_norm": 1.5703125, "learning_rate": 0.00028619801254645675, "loss": 4.9529, "mean_token_accuracy": 0.2191880688071251, "num_tokens": 108828929.0, "step": 62740 }, { "entropy": 5.828569221496582, "epoch": 4.881773973935032, "grad_norm": 1.3828125, "learning_rate": 0.0002861703312202495, "loss": 4.9234, "mean_token_accuracy": 0.21420105397701264, "num_tokens": 108837543.0, "step": 62745 }, { "entropy": 5.824690675735473, "epoch": 4.88216300330675, "grad_norm": 1.34375, "learning_rate": 0.00028614264972455023, "loss": 4.8918, "mean_token_accuracy": 0.21821432262659074, "num_tokens": 108847109.0, "step": 62750 }, { "entropy": 5.909644985198975, "epoch": 4.8825520326784675, "grad_norm": 1.3515625, "learning_rate": 0.00028611496805977906, "loss": 4.9559, "mean_token_accuracy": 0.22138262838125228, "num_tokens": 108856350.0, "step": 62755 }, { "entropy": 5.805631113052368, "epoch": 4.882941062050184, "grad_norm": 1.359375, "learning_rate": 0.00028608728622635585, "loss": 4.7841, "mean_token_accuracy": 0.22793570756912232, "num_tokens": 108864709.0, "step": 62760 }, { "entropy": 5.87542576789856, "epoch": 4.883330091421902, "grad_norm": 1.3515625, "learning_rate": 0.00028605960422470073, "loss": 4.9524, "mean_token_accuracy": 0.21415722668170928, "num_tokens": 108873876.0, "step": 62765 }, { "entropy": 5.8209922313690186, "epoch": 4.88371912079362, "grad_norm": 1.421875, "learning_rate": 0.0002860319220552338, "loss": 4.9099, "mean_token_accuracy": 0.22071389555931092, "num_tokens": 108882408.0, "step": 62770 }, { "entropy": 5.823239850997925, "epoch": 4.884108150165337, "grad_norm": 1.5625, "learning_rate": 0.00028600423971837484, "loss": 4.849, "mean_token_accuracy": 0.2264445975422859, "num_tokens": 108890548.0, "step": 62775 }, { "entropy": 5.882374000549317, "epoch": 4.884497179537055, "grad_norm": 1.4375, "learning_rate": 0.00028597655721454427, "loss": 4.8862, "mean_token_accuracy": 0.21895410269498825, "num_tokens": 108898690.0, "step": 62780 }, { "entropy": 5.850329065322876, "epoch": 4.884886208908773, "grad_norm": 1.484375, "learning_rate": 0.00028594887454416176, "loss": 4.9171, "mean_token_accuracy": 0.2171856239438057, "num_tokens": 108907198.0, "step": 62785 }, { "entropy": 5.883897304534912, "epoch": 4.8852752382804905, "grad_norm": 1.4140625, "learning_rate": 0.0002859211917076476, "loss": 4.9077, "mean_token_accuracy": 0.2156778246164322, "num_tokens": 108916451.0, "step": 62790 }, { "entropy": 5.89300856590271, "epoch": 4.885664267652208, "grad_norm": 1.40625, "learning_rate": 0.00028589350870542165, "loss": 4.9337, "mean_token_accuracy": 0.21836104542016982, "num_tokens": 108924975.0, "step": 62795 }, { "entropy": 5.872204732894898, "epoch": 4.886053297023925, "grad_norm": 1.546875, "learning_rate": 0.0002858658255379041, "loss": 5.0133, "mean_token_accuracy": 0.21131481230258942, "num_tokens": 108933114.0, "step": 62800 }, { "entropy": 5.786011171340943, "epoch": 4.886442326395643, "grad_norm": 1.375, "learning_rate": 0.00028583814220551495, "loss": 4.812, "mean_token_accuracy": 0.2269524872303009, "num_tokens": 108941429.0, "step": 62805 }, { "entropy": 5.931719589233398, "epoch": 4.88683135576736, "grad_norm": 1.4140625, "learning_rate": 0.0002858104587086742, "loss": 5.0076, "mean_token_accuracy": 0.21086300015449524, "num_tokens": 108949762.0, "step": 62810 }, { "entropy": 5.8741038799285885, "epoch": 4.887220385139078, "grad_norm": 1.3828125, "learning_rate": 0.000285782775047802, "loss": 4.9009, "mean_token_accuracy": 0.21982812881469727, "num_tokens": 108958488.0, "step": 62815 }, { "entropy": 5.839327335357666, "epoch": 4.887609414510796, "grad_norm": 1.453125, "learning_rate": 0.0002857550912233183, "loss": 4.8863, "mean_token_accuracy": 0.2202258974313736, "num_tokens": 108966976.0, "step": 62820 }, { "entropy": 5.793496131896973, "epoch": 4.8879984438825135, "grad_norm": 1.3125, "learning_rate": 0.0002857274072356432, "loss": 4.8581, "mean_token_accuracy": 0.21851739883422852, "num_tokens": 108975435.0, "step": 62825 }, { "entropy": 5.843374538421631, "epoch": 4.88838747325423, "grad_norm": 1.40625, "learning_rate": 0.00028569972308519674, "loss": 4.8818, "mean_token_accuracy": 0.22015581876039506, "num_tokens": 108983721.0, "step": 62830 }, { "entropy": 5.894990301132202, "epoch": 4.888776502625948, "grad_norm": 1.390625, "learning_rate": 0.00028567203877239914, "loss": 4.9592, "mean_token_accuracy": 0.21833908706903457, "num_tokens": 108992376.0, "step": 62835 }, { "entropy": 5.89663872718811, "epoch": 4.889165531997666, "grad_norm": 1.4296875, "learning_rate": 0.00028564435429767035, "loss": 4.9629, "mean_token_accuracy": 0.21532341837882996, "num_tokens": 109001049.0, "step": 62840 }, { "entropy": 5.926431035995483, "epoch": 4.889554561369383, "grad_norm": 1.46875, "learning_rate": 0.0002856166696614303, "loss": 4.9454, "mean_token_accuracy": 0.2161971688270569, "num_tokens": 109009859.0, "step": 62845 }, { "entropy": 5.923861694335938, "epoch": 4.889943590741101, "grad_norm": 1.40625, "learning_rate": 0.0002855889848640992, "loss": 5.0266, "mean_token_accuracy": 0.21285324841737746, "num_tokens": 109018491.0, "step": 62850 }, { "entropy": 5.834464120864868, "epoch": 4.890332620112819, "grad_norm": 1.53125, "learning_rate": 0.0002855612999060971, "loss": 4.911, "mean_token_accuracy": 0.21825989484786987, "num_tokens": 109026702.0, "step": 62855 }, { "entropy": 5.880823802947998, "epoch": 4.8907216494845365, "grad_norm": 1.5234375, "learning_rate": 0.0002855336147878442, "loss": 5.0304, "mean_token_accuracy": 0.21308285892009735, "num_tokens": 109036382.0, "step": 62860 }, { "entropy": 5.898878145217895, "epoch": 4.891110678856253, "grad_norm": 1.390625, "learning_rate": 0.00028550592950976036, "loss": 4.9508, "mean_token_accuracy": 0.20910721719264985, "num_tokens": 109045149.0, "step": 62865 }, { "entropy": 5.913369846343994, "epoch": 4.891499708227971, "grad_norm": 1.3125, "learning_rate": 0.00028547824407226574, "loss": 4.9896, "mean_token_accuracy": 0.21461388021707534, "num_tokens": 109053937.0, "step": 62870 }, { "entropy": 5.891812181472778, "epoch": 4.891888737599689, "grad_norm": 1.3671875, "learning_rate": 0.0002854505584757805, "loss": 4.9713, "mean_token_accuracy": 0.22122907638549805, "num_tokens": 109062812.0, "step": 62875 }, { "entropy": 5.91003189086914, "epoch": 4.892277766971406, "grad_norm": 1.5, "learning_rate": 0.00028542287272072475, "loss": 4.8683, "mean_token_accuracy": 0.22089508920907974, "num_tokens": 109072335.0, "step": 62880 }, { "entropy": 5.890327262878418, "epoch": 4.892666796343124, "grad_norm": 1.328125, "learning_rate": 0.0002853951868075184, "loss": 4.9568, "mean_token_accuracy": 0.20583431720733641, "num_tokens": 109081334.0, "step": 62885 }, { "entropy": 5.91676959991455, "epoch": 4.893055825714842, "grad_norm": 1.5078125, "learning_rate": 0.0002853675007365816, "loss": 4.9491, "mean_token_accuracy": 0.21861480176448822, "num_tokens": 109089995.0, "step": 62890 }, { "entropy": 5.963656425476074, "epoch": 4.893444855086559, "grad_norm": 1.546875, "learning_rate": 0.0002853398145083345, "loss": 5.0465, "mean_token_accuracy": 0.20463999807834626, "num_tokens": 109097791.0, "step": 62895 }, { "entropy": 5.839676713943481, "epoch": 4.893833884458276, "grad_norm": 1.4375, "learning_rate": 0.00028531212812319724, "loss": 4.9014, "mean_token_accuracy": 0.2175234168767929, "num_tokens": 109106256.0, "step": 62900 }, { "entropy": 5.891665363311768, "epoch": 4.894222913829994, "grad_norm": 1.40625, "learning_rate": 0.0002852844415815898, "loss": 4.9981, "mean_token_accuracy": 0.21448959559202194, "num_tokens": 109115862.0, "step": 62905 }, { "entropy": 5.84844217300415, "epoch": 4.894611943201712, "grad_norm": 1.3828125, "learning_rate": 0.00028525675488393234, "loss": 4.9182, "mean_token_accuracy": 0.21901315003633498, "num_tokens": 109124127.0, "step": 62910 }, { "entropy": 5.9595317363739015, "epoch": 4.895000972573429, "grad_norm": 1.609375, "learning_rate": 0.00028522906803064494, "loss": 5.1128, "mean_token_accuracy": 0.20333793759346008, "num_tokens": 109132975.0, "step": 62915 }, { "entropy": 5.950059700012207, "epoch": 4.895390001945147, "grad_norm": 1.3828125, "learning_rate": 0.0002852013810221477, "loss": 5.0098, "mean_token_accuracy": 0.21391311883926392, "num_tokens": 109142398.0, "step": 62920 }, { "entropy": 5.888796710968018, "epoch": 4.895779031316865, "grad_norm": 1.4453125, "learning_rate": 0.0002851736938588607, "loss": 4.8998, "mean_token_accuracy": 0.22038516104221345, "num_tokens": 109151043.0, "step": 62925 }, { "entropy": 5.88486270904541, "epoch": 4.8961680606885825, "grad_norm": 1.4375, "learning_rate": 0.0002851460065412042, "loss": 4.903, "mean_token_accuracy": 0.21586000621318818, "num_tokens": 109159671.0, "step": 62930 }, { "entropy": 5.867138004302978, "epoch": 4.896557090060299, "grad_norm": 1.3828125, "learning_rate": 0.0002851183190695981, "loss": 4.9089, "mean_token_accuracy": 0.22196243405342103, "num_tokens": 109168358.0, "step": 62935 }, { "entropy": 5.909192276000977, "epoch": 4.896946119432017, "grad_norm": 1.421875, "learning_rate": 0.0002850906314444627, "loss": 4.9509, "mean_token_accuracy": 0.21271082907915115, "num_tokens": 109176698.0, "step": 62940 }, { "entropy": 5.829588842391968, "epoch": 4.897335148803735, "grad_norm": 1.3984375, "learning_rate": 0.00028506294366621796, "loss": 4.864, "mean_token_accuracy": 0.2202983409166336, "num_tokens": 109185362.0, "step": 62945 }, { "entropy": 5.941349935531616, "epoch": 4.897724178175452, "grad_norm": 1.3359375, "learning_rate": 0.00028503525573528413, "loss": 5.0275, "mean_token_accuracy": 0.20749955326318742, "num_tokens": 109193719.0, "step": 62950 }, { "entropy": 5.968068075180054, "epoch": 4.89811320754717, "grad_norm": 1.46875, "learning_rate": 0.0002850075676520812, "loss": 5.0505, "mean_token_accuracy": 0.21175200194120408, "num_tokens": 109202138.0, "step": 62955 }, { "entropy": 5.898190927505493, "epoch": 4.898502236918888, "grad_norm": 1.4140625, "learning_rate": 0.0002849798794170294, "loss": 4.9679, "mean_token_accuracy": 0.2161297544836998, "num_tokens": 109211065.0, "step": 62960 }, { "entropy": 5.943305397033692, "epoch": 4.898891266290605, "grad_norm": 1.4765625, "learning_rate": 0.0002849521910305488, "loss": 4.9737, "mean_token_accuracy": 0.2180306151509285, "num_tokens": 109219292.0, "step": 62965 }, { "entropy": 5.882408285140992, "epoch": 4.899280295662322, "grad_norm": 1.3671875, "learning_rate": 0.00028492450249305957, "loss": 4.9103, "mean_token_accuracy": 0.22348613291978836, "num_tokens": 109228332.0, "step": 62970 }, { "entropy": 5.845983409881592, "epoch": 4.89966932503404, "grad_norm": 1.4921875, "learning_rate": 0.00028489681380498177, "loss": 4.8235, "mean_token_accuracy": 0.22201534807682038, "num_tokens": 109237299.0, "step": 62975 }, { "entropy": 5.895946931838989, "epoch": 4.900058354405758, "grad_norm": 1.59375, "learning_rate": 0.00028486912496673557, "loss": 4.9576, "mean_token_accuracy": 0.22163930386304856, "num_tokens": 109245301.0, "step": 62980 }, { "entropy": 5.824560880661011, "epoch": 4.900447383777475, "grad_norm": 1.46875, "learning_rate": 0.00028484143597874115, "loss": 4.9484, "mean_token_accuracy": 0.21273715198040008, "num_tokens": 109253695.0, "step": 62985 }, { "entropy": 5.84009485244751, "epoch": 4.900836413149193, "grad_norm": 1.390625, "learning_rate": 0.0002848137468414186, "loss": 4.9393, "mean_token_accuracy": 0.211474047601223, "num_tokens": 109262381.0, "step": 62990 }, { "entropy": 5.886327314376831, "epoch": 4.901225442520911, "grad_norm": 1.4921875, "learning_rate": 0.000284786057555188, "loss": 4.9212, "mean_token_accuracy": 0.21678577363491058, "num_tokens": 109270765.0, "step": 62995 }, { "entropy": 5.915979814529419, "epoch": 4.9016144718926276, "grad_norm": 1.46875, "learning_rate": 0.0002847583681204696, "loss": 4.8599, "mean_token_accuracy": 0.2226930856704712, "num_tokens": 109278719.0, "step": 63000 }, { "epoch": 4.9016144718926276, "eval_entropy": 5.592337388781198, "eval_loss": 5.036297798156738, "eval_mean_token_accuracy": 0.2212241230559418, "eval_num_tokens": 109278719.0, "eval_runtime": 22.0294, "eval_samples_per_second": 1886.482, "eval_steps_per_second": 235.822, "step": 63000 }, { "entropy": 5.845660972595215, "epoch": 4.902003501264345, "grad_norm": 1.421875, "learning_rate": 0.00028473067853768347, "loss": 4.8916, "mean_token_accuracy": 0.21708036661148072, "num_tokens": 109287000.0, "step": 63005 }, { "entropy": 5.947008657455444, "epoch": 4.902392530636063, "grad_norm": 1.359375, "learning_rate": 0.00028470298880724985, "loss": 5.0595, "mean_token_accuracy": 0.2071488693356514, "num_tokens": 109296029.0, "step": 63010 }, { "entropy": 5.861974382400513, "epoch": 4.902781560007781, "grad_norm": 1.421875, "learning_rate": 0.0002846752989295888, "loss": 4.9591, "mean_token_accuracy": 0.21617467552423478, "num_tokens": 109303990.0, "step": 63015 }, { "entropy": 5.922281980514526, "epoch": 4.903170589379498, "grad_norm": 1.4296875, "learning_rate": 0.0002846476089051204, "loss": 5.0132, "mean_token_accuracy": 0.21947211176156997, "num_tokens": 109312922.0, "step": 63020 }, { "entropy": 5.831495952606201, "epoch": 4.903559618751216, "grad_norm": 1.4453125, "learning_rate": 0.00028461991873426494, "loss": 4.9081, "mean_token_accuracy": 0.2157473534345627, "num_tokens": 109321296.0, "step": 63025 }, { "entropy": 5.933815956115723, "epoch": 4.903948648122933, "grad_norm": 1.4765625, "learning_rate": 0.0002845922284174426, "loss": 5.0178, "mean_token_accuracy": 0.2108047276735306, "num_tokens": 109329541.0, "step": 63030 }, { "entropy": 5.900624561309814, "epoch": 4.9043376774946505, "grad_norm": 1.4453125, "learning_rate": 0.00028456453795507335, "loss": 4.9151, "mean_token_accuracy": 0.2303169399499893, "num_tokens": 109338054.0, "step": 63035 }, { "entropy": 5.882947683334351, "epoch": 4.904726706866368, "grad_norm": 1.5390625, "learning_rate": 0.0002845368473475776, "loss": 4.8945, "mean_token_accuracy": 0.225942961871624, "num_tokens": 109346216.0, "step": 63040 }, { "entropy": 5.8657355308532715, "epoch": 4.905115736238086, "grad_norm": 1.3125, "learning_rate": 0.00028450915659537524, "loss": 4.9634, "mean_token_accuracy": 0.21595780402421952, "num_tokens": 109355033.0, "step": 63045 }, { "entropy": 5.864536285400391, "epoch": 4.905504765609804, "grad_norm": 1.4453125, "learning_rate": 0.0002844814656988866, "loss": 4.8879, "mean_token_accuracy": 0.2164296329021454, "num_tokens": 109363515.0, "step": 63050 }, { "entropy": 5.975519323348999, "epoch": 4.905893794981521, "grad_norm": 1.3359375, "learning_rate": 0.00028445377465853176, "loss": 5.0908, "mean_token_accuracy": 0.20222811847925187, "num_tokens": 109373063.0, "step": 63055 }, { "entropy": 5.861296272277832, "epoch": 4.906282824353239, "grad_norm": 1.625, "learning_rate": 0.00028442608347473093, "loss": 4.8597, "mean_token_accuracy": 0.21710907518863679, "num_tokens": 109380781.0, "step": 63060 }, { "entropy": 5.787471628189087, "epoch": 4.906671853724957, "grad_norm": 1.4296875, "learning_rate": 0.00028439839214790437, "loss": 4.8892, "mean_token_accuracy": 0.2307184636592865, "num_tokens": 109389222.0, "step": 63065 }, { "entropy": 5.92974820137024, "epoch": 4.9070608830966735, "grad_norm": 1.5, "learning_rate": 0.0002843707006784722, "loss": 5.0294, "mean_token_accuracy": 0.21363822668790816, "num_tokens": 109398101.0, "step": 63070 }, { "entropy": 5.906003093719482, "epoch": 4.907449912468391, "grad_norm": 1.3671875, "learning_rate": 0.0002843430090668545, "loss": 4.9213, "mean_token_accuracy": 0.2221415624022484, "num_tokens": 109406508.0, "step": 63075 }, { "entropy": 5.955307722091675, "epoch": 4.907838941840109, "grad_norm": 1.3984375, "learning_rate": 0.00028431531731347155, "loss": 5.0506, "mean_token_accuracy": 0.20807292610406875, "num_tokens": 109414943.0, "step": 63080 }, { "entropy": 5.856168031692505, "epoch": 4.908227971211827, "grad_norm": 1.390625, "learning_rate": 0.0002842876254187434, "loss": 4.9644, "mean_token_accuracy": 0.2138863116502762, "num_tokens": 109424438.0, "step": 63085 }, { "entropy": 5.892143487930298, "epoch": 4.908617000583544, "grad_norm": 1.390625, "learning_rate": 0.00028425993338309036, "loss": 5.0116, "mean_token_accuracy": 0.21412809789180756, "num_tokens": 109433108.0, "step": 63090 }, { "entropy": 5.917541027069092, "epoch": 4.909006029955261, "grad_norm": 1.2890625, "learning_rate": 0.0002842322412069325, "loss": 4.9857, "mean_token_accuracy": 0.20951674431562423, "num_tokens": 109442019.0, "step": 63095 }, { "entropy": 5.926276397705078, "epoch": 4.909395059326979, "grad_norm": 1.46875, "learning_rate": 0.0002842045488906902, "loss": 4.9763, "mean_token_accuracy": 0.217173233628273, "num_tokens": 109450819.0, "step": 63100 }, { "entropy": 5.943784236907959, "epoch": 4.9097840886986965, "grad_norm": 1.515625, "learning_rate": 0.00028417685643478347, "loss": 4.9932, "mean_token_accuracy": 0.2140013337135315, "num_tokens": 109459551.0, "step": 63105 }, { "entropy": 5.902006053924561, "epoch": 4.910173118070414, "grad_norm": 1.4609375, "learning_rate": 0.00028414916383963265, "loss": 4.944, "mean_token_accuracy": 0.2118055507540703, "num_tokens": 109468351.0, "step": 63110 }, { "entropy": 5.859724617004394, "epoch": 4.910562147442132, "grad_norm": 1.4375, "learning_rate": 0.0002841214711056577, "loss": 4.9004, "mean_token_accuracy": 0.2193540558218956, "num_tokens": 109477951.0, "step": 63115 }, { "entropy": 5.843268775939942, "epoch": 4.91095117681385, "grad_norm": 1.421875, "learning_rate": 0.000284093778233279, "loss": 4.9012, "mean_token_accuracy": 0.22145945578813553, "num_tokens": 109486113.0, "step": 63120 }, { "entropy": 5.892044973373413, "epoch": 4.911340206185567, "grad_norm": 1.4765625, "learning_rate": 0.0002840660852229166, "loss": 4.9902, "mean_token_accuracy": 0.21553106009960174, "num_tokens": 109494566.0, "step": 63125 }, { "entropy": 5.869701814651489, "epoch": 4.911729235557285, "grad_norm": 1.359375, "learning_rate": 0.0002840383920749908, "loss": 4.9734, "mean_token_accuracy": 0.21697404533624648, "num_tokens": 109503738.0, "step": 63130 }, { "entropy": 5.853439426422119, "epoch": 4.912118264929002, "grad_norm": 1.4609375, "learning_rate": 0.0002840106987899219, "loss": 4.8802, "mean_token_accuracy": 0.22182758450508117, "num_tokens": 109512155.0, "step": 63135 }, { "entropy": 5.955921268463134, "epoch": 4.9125072943007195, "grad_norm": 1.4140625, "learning_rate": 0.0002839830053681299, "loss": 5.0119, "mean_token_accuracy": 0.20780492275953294, "num_tokens": 109521206.0, "step": 63140 }, { "entropy": 5.8957914352417, "epoch": 4.912896323672437, "grad_norm": 1.3515625, "learning_rate": 0.00028395531181003516, "loss": 4.9328, "mean_token_accuracy": 0.22184519916772844, "num_tokens": 109529486.0, "step": 63145 }, { "entropy": 5.876897954940796, "epoch": 4.913285353044155, "grad_norm": 1.515625, "learning_rate": 0.0002839276181160577, "loss": 4.9293, "mean_token_accuracy": 0.21965682357549668, "num_tokens": 109538152.0, "step": 63150 }, { "entropy": 5.852418088912964, "epoch": 4.913674382415873, "grad_norm": 1.4140625, "learning_rate": 0.000283899924286618, "loss": 4.9464, "mean_token_accuracy": 0.21349960565567017, "num_tokens": 109546828.0, "step": 63155 }, { "entropy": 5.874808931350708, "epoch": 4.91406341178759, "grad_norm": 1.421875, "learning_rate": 0.000283872230322136, "loss": 4.89, "mean_token_accuracy": 0.21371839195489883, "num_tokens": 109555378.0, "step": 63160 }, { "entropy": 5.88665189743042, "epoch": 4.914452441159307, "grad_norm": 1.4375, "learning_rate": 0.00028384453622303207, "loss": 4.9472, "mean_token_accuracy": 0.21079155057668686, "num_tokens": 109564290.0, "step": 63165 }, { "entropy": 5.81317629814148, "epoch": 4.914841470531025, "grad_norm": 1.4921875, "learning_rate": 0.00028381684198972636, "loss": 4.8976, "mean_token_accuracy": 0.21897746175527572, "num_tokens": 109572958.0, "step": 63170 }, { "entropy": 5.888412618637085, "epoch": 4.9152304999027425, "grad_norm": 1.4453125, "learning_rate": 0.00028378914762263905, "loss": 4.9037, "mean_token_accuracy": 0.21928623914718628, "num_tokens": 109581669.0, "step": 63175 }, { "entropy": 5.766787719726563, "epoch": 4.91561952927446, "grad_norm": 1.3515625, "learning_rate": 0.00028376145312219054, "loss": 4.8252, "mean_token_accuracy": 0.22201623767614365, "num_tokens": 109589890.0, "step": 63180 }, { "entropy": 5.937801933288574, "epoch": 4.916008558646178, "grad_norm": 1.515625, "learning_rate": 0.0002837337584888009, "loss": 5.0596, "mean_token_accuracy": 0.1991310551762581, "num_tokens": 109598522.0, "step": 63185 }, { "entropy": 5.882436895370484, "epoch": 4.916397588017896, "grad_norm": 1.4296875, "learning_rate": 0.0002837060637228903, "loss": 4.8609, "mean_token_accuracy": 0.22643204480409623, "num_tokens": 109606527.0, "step": 63190 }, { "entropy": 5.930106925964355, "epoch": 4.916786617389613, "grad_norm": 1.375, "learning_rate": 0.00028367836882487905, "loss": 4.9809, "mean_token_accuracy": 0.20324242860078812, "num_tokens": 109615498.0, "step": 63195 }, { "entropy": 5.893737125396728, "epoch": 4.91717564676133, "grad_norm": 1.390625, "learning_rate": 0.0002836506737951875, "loss": 4.9871, "mean_token_accuracy": 0.20879970639944076, "num_tokens": 109624624.0, "step": 63200 }, { "entropy": 5.880253648757934, "epoch": 4.917564676133048, "grad_norm": 1.40625, "learning_rate": 0.0002836229786342356, "loss": 4.901, "mean_token_accuracy": 0.216366009414196, "num_tokens": 109633076.0, "step": 63205 }, { "entropy": 5.933247661590576, "epoch": 4.9179537055047655, "grad_norm": 1.4296875, "learning_rate": 0.0002835952833424438, "loss": 4.9056, "mean_token_accuracy": 0.22866974025964737, "num_tokens": 109640869.0, "step": 63210 }, { "entropy": 5.843147325515747, "epoch": 4.918342734876483, "grad_norm": 1.4296875, "learning_rate": 0.00028356758792023217, "loss": 4.9348, "mean_token_accuracy": 0.21429307609796525, "num_tokens": 109649485.0, "step": 63215 }, { "entropy": 5.848204898834228, "epoch": 4.918731764248201, "grad_norm": 1.421875, "learning_rate": 0.00028353989236802114, "loss": 4.8848, "mean_token_accuracy": 0.2213117867708206, "num_tokens": 109658440.0, "step": 63220 }, { "entropy": 5.8321432113647464, "epoch": 4.919120793619919, "grad_norm": 1.4609375, "learning_rate": 0.00028351219668623076, "loss": 4.899, "mean_token_accuracy": 0.2190529078245163, "num_tokens": 109667325.0, "step": 63225 }, { "entropy": 5.925417041778564, "epoch": 4.919509822991635, "grad_norm": 1.390625, "learning_rate": 0.0002834845008752813, "loss": 5.0001, "mean_token_accuracy": 0.2156813845038414, "num_tokens": 109675348.0, "step": 63230 }, { "entropy": 5.870559978485107, "epoch": 4.919898852363353, "grad_norm": 1.4453125, "learning_rate": 0.00028345680493559313, "loss": 4.8891, "mean_token_accuracy": 0.22022017389535903, "num_tokens": 109683884.0, "step": 63235 }, { "entropy": 5.856965637207031, "epoch": 4.920287881735071, "grad_norm": 1.4765625, "learning_rate": 0.0002834291088675864, "loss": 4.9643, "mean_token_accuracy": 0.21265001296997071, "num_tokens": 109692499.0, "step": 63240 }, { "entropy": 5.889193487167359, "epoch": 4.9206769111067885, "grad_norm": 1.5, "learning_rate": 0.00028340141267168135, "loss": 4.9118, "mean_token_accuracy": 0.2175105705857277, "num_tokens": 109700700.0, "step": 63245 }, { "entropy": 5.92943844795227, "epoch": 4.921065940478506, "grad_norm": 1.4453125, "learning_rate": 0.00028337371634829824, "loss": 5.0025, "mean_token_accuracy": 0.21137484312057495, "num_tokens": 109709062.0, "step": 63250 }, { "entropy": 5.888901472091675, "epoch": 4.921454969850224, "grad_norm": 1.40625, "learning_rate": 0.0002833460198978573, "loss": 4.9127, "mean_token_accuracy": 0.2244207516312599, "num_tokens": 109718229.0, "step": 63255 }, { "entropy": 5.854289865493774, "epoch": 4.921843999221942, "grad_norm": 1.390625, "learning_rate": 0.0002833183233207788, "loss": 4.8716, "mean_token_accuracy": 0.21974745988845826, "num_tokens": 109726449.0, "step": 63260 }, { "entropy": 5.829619312286377, "epoch": 4.922233028593659, "grad_norm": 1.4375, "learning_rate": 0.00028329062661748295, "loss": 4.8328, "mean_token_accuracy": 0.21937422454357147, "num_tokens": 109734279.0, "step": 63265 }, { "entropy": 5.77800726890564, "epoch": 4.922622057965376, "grad_norm": 1.5234375, "learning_rate": 0.00028326292978839005, "loss": 4.8499, "mean_token_accuracy": 0.22635478973388673, "num_tokens": 109742795.0, "step": 63270 }, { "entropy": 5.9006123542785645, "epoch": 4.923011087337094, "grad_norm": 1.375, "learning_rate": 0.00028323523283392034, "loss": 4.9624, "mean_token_accuracy": 0.2135780856013298, "num_tokens": 109752009.0, "step": 63275 }, { "entropy": 5.891555690765381, "epoch": 4.9234001167088115, "grad_norm": 1.3828125, "learning_rate": 0.00028320753575449415, "loss": 4.8945, "mean_token_accuracy": 0.21826127171516418, "num_tokens": 109760716.0, "step": 63280 }, { "entropy": 5.894096612930298, "epoch": 4.923789146080529, "grad_norm": 1.3515625, "learning_rate": 0.0002831798385505316, "loss": 4.8926, "mean_token_accuracy": 0.22058100551366805, "num_tokens": 109769649.0, "step": 63285 }, { "entropy": 5.9327469825744625, "epoch": 4.924178175452247, "grad_norm": 1.5390625, "learning_rate": 0.00028315214122245295, "loss": 4.9073, "mean_token_accuracy": 0.2197945550084114, "num_tokens": 109778058.0, "step": 63290 }, { "entropy": 5.903349828720093, "epoch": 4.924567204823965, "grad_norm": 1.3984375, "learning_rate": 0.0002831244437706786, "loss": 4.9672, "mean_token_accuracy": 0.21896747797727584, "num_tokens": 109786100.0, "step": 63295 }, { "entropy": 5.893560600280762, "epoch": 4.924956234195681, "grad_norm": 1.390625, "learning_rate": 0.0002830967461956288, "loss": 5.0039, "mean_token_accuracy": 0.21065692454576493, "num_tokens": 109794736.0, "step": 63300 }, { "entropy": 5.852028703689575, "epoch": 4.925345263567399, "grad_norm": 1.421875, "learning_rate": 0.00028306904849772374, "loss": 4.8621, "mean_token_accuracy": 0.21240765750408172, "num_tokens": 109803293.0, "step": 63305 }, { "entropy": 5.904577350616455, "epoch": 4.925734292939117, "grad_norm": 1.4296875, "learning_rate": 0.0002830413506773837, "loss": 4.9482, "mean_token_accuracy": 0.21251896470785142, "num_tokens": 109811639.0, "step": 63310 }, { "entropy": 5.8953687191009525, "epoch": 4.9261233223108345, "grad_norm": 1.4140625, "learning_rate": 0.000283013652735029, "loss": 4.9205, "mean_token_accuracy": 0.22485243380069733, "num_tokens": 109820048.0, "step": 63315 }, { "entropy": 5.95179328918457, "epoch": 4.926512351682552, "grad_norm": 1.453125, "learning_rate": 0.00028298595467107985, "loss": 4.9767, "mean_token_accuracy": 0.22567200660705566, "num_tokens": 109828600.0, "step": 63320 }, { "entropy": 5.842519903182984, "epoch": 4.92690138105427, "grad_norm": 1.390625, "learning_rate": 0.0002829582564859565, "loss": 4.8616, "mean_token_accuracy": 0.2174249142408371, "num_tokens": 109837774.0, "step": 63325 }, { "entropy": 5.868889951705933, "epoch": 4.927290410425988, "grad_norm": 1.4453125, "learning_rate": 0.0002829305581800793, "loss": 4.8775, "mean_token_accuracy": 0.22109757363796234, "num_tokens": 109846506.0, "step": 63330 }, { "entropy": 5.861656284332275, "epoch": 4.927679439797704, "grad_norm": 1.40625, "learning_rate": 0.0002829028597538685, "loss": 4.9285, "mean_token_accuracy": 0.2178611069917679, "num_tokens": 109855314.0, "step": 63335 }, { "entropy": 5.942794275283814, "epoch": 4.928068469169422, "grad_norm": 1.390625, "learning_rate": 0.00028287516120774445, "loss": 5.0052, "mean_token_accuracy": 0.20927295833826065, "num_tokens": 109863768.0, "step": 63340 }, { "entropy": 5.878686857223511, "epoch": 4.92845749854114, "grad_norm": 1.6328125, "learning_rate": 0.0002828474625421273, "loss": 4.9372, "mean_token_accuracy": 0.21473852246999742, "num_tokens": 109871634.0, "step": 63345 }, { "entropy": 5.87903208732605, "epoch": 4.9288465279128575, "grad_norm": 1.4921875, "learning_rate": 0.0002828197637574374, "loss": 4.9594, "mean_token_accuracy": 0.21939936876296998, "num_tokens": 109880846.0, "step": 63350 }, { "entropy": 5.796025371551513, "epoch": 4.929235557284575, "grad_norm": 1.2890625, "learning_rate": 0.00028279206485409505, "loss": 4.8851, "mean_token_accuracy": 0.22162344604730605, "num_tokens": 109889614.0, "step": 63355 }, { "entropy": 5.9180442810058596, "epoch": 4.929624586656293, "grad_norm": 1.5390625, "learning_rate": 0.0002827643658325205, "loss": 4.9499, "mean_token_accuracy": 0.21627540290355682, "num_tokens": 109897846.0, "step": 63360 }, { "entropy": 5.87094259262085, "epoch": 4.93001361602801, "grad_norm": 1.421875, "learning_rate": 0.000282736666693134, "loss": 4.8162, "mean_token_accuracy": 0.22752740532159804, "num_tokens": 109905893.0, "step": 63365 }, { "entropy": 5.847710752487183, "epoch": 4.930402645399727, "grad_norm": 1.4453125, "learning_rate": 0.0002827089674363559, "loss": 4.9635, "mean_token_accuracy": 0.21025339066982268, "num_tokens": 109914137.0, "step": 63370 }, { "entropy": 5.863405323028564, "epoch": 4.930791674771445, "grad_norm": 1.3515625, "learning_rate": 0.0002826812680626066, "loss": 4.9091, "mean_token_accuracy": 0.21870004534721374, "num_tokens": 109923113.0, "step": 63375 }, { "entropy": 5.925350284576416, "epoch": 4.931180704143163, "grad_norm": 1.5078125, "learning_rate": 0.0002826535685723062, "loss": 4.9717, "mean_token_accuracy": 0.21588694006204606, "num_tokens": 109932165.0, "step": 63380 }, { "entropy": 5.938417577743531, "epoch": 4.9315697335148805, "grad_norm": 1.328125, "learning_rate": 0.00028262586896587517, "loss": 4.9752, "mean_token_accuracy": 0.21277597397565842, "num_tokens": 109941069.0, "step": 63385 }, { "entropy": 5.89747953414917, "epoch": 4.931958762886598, "grad_norm": 1.4296875, "learning_rate": 0.0002825981692437336, "loss": 4.9826, "mean_token_accuracy": 0.2161966383457184, "num_tokens": 109950096.0, "step": 63390 }, { "entropy": 5.821556282043457, "epoch": 4.932347792258316, "grad_norm": 1.46875, "learning_rate": 0.00028257046940630197, "loss": 4.8358, "mean_token_accuracy": 0.2238988146185875, "num_tokens": 109959217.0, "step": 63395 }, { "entropy": 5.899184799194336, "epoch": 4.932736821630033, "grad_norm": 1.4765625, "learning_rate": 0.00028254276945400056, "loss": 4.9641, "mean_token_accuracy": 0.2146111771464348, "num_tokens": 109967242.0, "step": 63400 }, { "entropy": 5.865417194366455, "epoch": 4.93312585100175, "grad_norm": 1.546875, "learning_rate": 0.00028251506938724953, "loss": 4.912, "mean_token_accuracy": 0.2243200033903122, "num_tokens": 109976243.0, "step": 63405 }, { "entropy": 5.954142713546753, "epoch": 4.933514880373468, "grad_norm": 1.375, "learning_rate": 0.00028248736920646927, "loss": 5.0091, "mean_token_accuracy": 0.2075088992714882, "num_tokens": 109984980.0, "step": 63410 }, { "entropy": 5.907082653045654, "epoch": 4.933903909745186, "grad_norm": 1.4375, "learning_rate": 0.00028245966891208017, "loss": 5.0159, "mean_token_accuracy": 0.21756117641925812, "num_tokens": 109994070.0, "step": 63415 }, { "entropy": 5.858321905136108, "epoch": 4.9342929391169035, "grad_norm": 1.4609375, "learning_rate": 0.0002824319685045025, "loss": 4.8979, "mean_token_accuracy": 0.21705792397260665, "num_tokens": 110002689.0, "step": 63420 }, { "entropy": 5.824409008026123, "epoch": 4.934681968488621, "grad_norm": 1.3046875, "learning_rate": 0.00028240426798415645, "loss": 4.8097, "mean_token_accuracy": 0.22267137467861176, "num_tokens": 110011615.0, "step": 63425 }, { "entropy": 5.857821273803711, "epoch": 4.935070997860338, "grad_norm": 1.3515625, "learning_rate": 0.0002823765673514625, "loss": 4.9544, "mean_token_accuracy": 0.21611316204071046, "num_tokens": 110020556.0, "step": 63430 }, { "entropy": 5.880559682846069, "epoch": 4.935460027232056, "grad_norm": 1.359375, "learning_rate": 0.00028234886660684084, "loss": 5.0017, "mean_token_accuracy": 0.2092095583677292, "num_tokens": 110029629.0, "step": 63435 }, { "entropy": 5.93054428100586, "epoch": 4.935849056603773, "grad_norm": 1.4453125, "learning_rate": 0.0002823211657507118, "loss": 5.0166, "mean_token_accuracy": 0.2157832056283951, "num_tokens": 110039476.0, "step": 63440 }, { "entropy": 5.906149530410767, "epoch": 4.936238085975491, "grad_norm": 1.3515625, "learning_rate": 0.0002822934647834958, "loss": 4.9258, "mean_token_accuracy": 0.21256107985973358, "num_tokens": 110048235.0, "step": 63445 }, { "entropy": 5.859096527099609, "epoch": 4.936627115347209, "grad_norm": 1.5078125, "learning_rate": 0.00028226576370561304, "loss": 4.8725, "mean_token_accuracy": 0.22193579375743866, "num_tokens": 110056703.0, "step": 63450 }, { "entropy": 5.832886219024658, "epoch": 4.9370161447189265, "grad_norm": 1.4140625, "learning_rate": 0.00028223806251748384, "loss": 4.9548, "mean_token_accuracy": 0.21847161501646042, "num_tokens": 110064932.0, "step": 63455 }, { "entropy": 5.904750871658325, "epoch": 4.937405174090644, "grad_norm": 1.4453125, "learning_rate": 0.0002822103612195286, "loss": 4.9899, "mean_token_accuracy": 0.21442256569862367, "num_tokens": 110073715.0, "step": 63460 }, { "entropy": 5.901986694335937, "epoch": 4.937794203462362, "grad_norm": 1.4921875, "learning_rate": 0.0002821826598121676, "loss": 5.0334, "mean_token_accuracy": 0.20750907063484192, "num_tokens": 110082626.0, "step": 63465 }, { "entropy": 5.890605354309082, "epoch": 4.938183232834079, "grad_norm": 1.5234375, "learning_rate": 0.0002821549582958212, "loss": 4.9169, "mean_token_accuracy": 0.21418662816286088, "num_tokens": 110091768.0, "step": 63470 }, { "entropy": 5.9705322265625, "epoch": 4.938572262205796, "grad_norm": 1.5, "learning_rate": 0.0002821272566709096, "loss": 5.049, "mean_token_accuracy": 0.21606716960668565, "num_tokens": 110100372.0, "step": 63475 }, { "entropy": 5.9737039566040036, "epoch": 4.938961291577514, "grad_norm": 1.359375, "learning_rate": 0.00028209955493785333, "loss": 5.0414, "mean_token_accuracy": 0.21236948668956757, "num_tokens": 110109045.0, "step": 63480 }, { "entropy": 5.839304780960083, "epoch": 4.939350320949232, "grad_norm": 1.3828125, "learning_rate": 0.0002820718530970726, "loss": 4.9503, "mean_token_accuracy": 0.21627112627029418, "num_tokens": 110117612.0, "step": 63485 }, { "entropy": 5.838115119934082, "epoch": 4.9397393503209495, "grad_norm": 1.484375, "learning_rate": 0.00028204415114898765, "loss": 4.8599, "mean_token_accuracy": 0.21942494213581085, "num_tokens": 110126068.0, "step": 63490 }, { "entropy": 5.938824796676636, "epoch": 4.940128379692667, "grad_norm": 1.484375, "learning_rate": 0.00028201644909401903, "loss": 5.0546, "mean_token_accuracy": 0.2052411526441574, "num_tokens": 110134742.0, "step": 63495 }, { "entropy": 5.977343559265137, "epoch": 4.940517409064384, "grad_norm": 1.453125, "learning_rate": 0.00028198874693258696, "loss": 5.0425, "mean_token_accuracy": 0.2094852313399315, "num_tokens": 110143065.0, "step": 63500 }, { "entropy": 5.854104995727539, "epoch": 4.940906438436102, "grad_norm": 1.3671875, "learning_rate": 0.0002819610446651117, "loss": 4.8842, "mean_token_accuracy": 0.22552470862865448, "num_tokens": 110151605.0, "step": 63505 }, { "entropy": 5.869261837005615, "epoch": 4.941295467807819, "grad_norm": 1.421875, "learning_rate": 0.00028193334229201374, "loss": 4.9568, "mean_token_accuracy": 0.21594999432563783, "num_tokens": 110160645.0, "step": 63510 }, { "entropy": 5.722666692733765, "epoch": 4.941684497179537, "grad_norm": 1.5078125, "learning_rate": 0.00028190563981371334, "loss": 4.7748, "mean_token_accuracy": 0.2226237028837204, "num_tokens": 110169058.0, "step": 63515 }, { "entropy": 5.8366954803466795, "epoch": 4.942073526551255, "grad_norm": 1.4765625, "learning_rate": 0.0002818779372306308, "loss": 4.8795, "mean_token_accuracy": 0.22498802095651627, "num_tokens": 110177274.0, "step": 63520 }, { "entropy": 5.81015944480896, "epoch": 4.9424625559229725, "grad_norm": 1.5078125, "learning_rate": 0.00028185023454318646, "loss": 4.8714, "mean_token_accuracy": 0.22174597680568695, "num_tokens": 110186254.0, "step": 63525 }, { "entropy": 5.8742513179779055, "epoch": 4.94285158529469, "grad_norm": 1.4375, "learning_rate": 0.00028182253175180084, "loss": 4.8762, "mean_token_accuracy": 0.21548761874437333, "num_tokens": 110194993.0, "step": 63530 }, { "entropy": 5.856391954421997, "epoch": 4.943240614666407, "grad_norm": 1.53125, "learning_rate": 0.0002817948288568942, "loss": 4.8688, "mean_token_accuracy": 0.22460591197013854, "num_tokens": 110203330.0, "step": 63535 }, { "entropy": 5.849644517898559, "epoch": 4.943629644038125, "grad_norm": 1.359375, "learning_rate": 0.0002817671258588868, "loss": 4.9279, "mean_token_accuracy": 0.2171579509973526, "num_tokens": 110213092.0, "step": 63540 }, { "entropy": 5.905259609222412, "epoch": 4.944018673409842, "grad_norm": 1.5234375, "learning_rate": 0.0002817394227581989, "loss": 4.9408, "mean_token_accuracy": 0.21379088908433913, "num_tokens": 110221575.0, "step": 63545 }, { "entropy": 5.986494016647339, "epoch": 4.94440770278156, "grad_norm": 1.453125, "learning_rate": 0.0002817117195552511, "loss": 5.0466, "mean_token_accuracy": 0.2128536194562912, "num_tokens": 110231010.0, "step": 63550 }, { "entropy": 5.903822040557861, "epoch": 4.944796732153278, "grad_norm": 1.4140625, "learning_rate": 0.00028168401625046363, "loss": 4.9404, "mean_token_accuracy": 0.21209092289209366, "num_tokens": 110239681.0, "step": 63555 }, { "entropy": 5.857723140716553, "epoch": 4.9451857615249954, "grad_norm": 1.453125, "learning_rate": 0.0002816563128442568, "loss": 4.8909, "mean_token_accuracy": 0.21939959973096848, "num_tokens": 110248190.0, "step": 63560 }, { "entropy": 5.851400423049927, "epoch": 4.945574790896712, "grad_norm": 1.4375, "learning_rate": 0.00028162860933705105, "loss": 4.8717, "mean_token_accuracy": 0.22191061079502106, "num_tokens": 110257651.0, "step": 63565 }, { "entropy": 5.877963018417359, "epoch": 4.94596382026843, "grad_norm": 1.515625, "learning_rate": 0.0002816009057292667, "loss": 4.927, "mean_token_accuracy": 0.22086296677589418, "num_tokens": 110265539.0, "step": 63570 }, { "entropy": 5.96783766746521, "epoch": 4.946352849640148, "grad_norm": 1.4453125, "learning_rate": 0.00028157320202132417, "loss": 5.0825, "mean_token_accuracy": 0.21048882901668547, "num_tokens": 110273727.0, "step": 63575 }, { "entropy": 5.87131667137146, "epoch": 4.946741879011865, "grad_norm": 1.296875, "learning_rate": 0.00028154549821364375, "loss": 4.8798, "mean_token_accuracy": 0.2216145411133766, "num_tokens": 110282451.0, "step": 63580 }, { "entropy": 5.7974076747894285, "epoch": 4.947130908383583, "grad_norm": 1.3671875, "learning_rate": 0.00028151779430664575, "loss": 4.8927, "mean_token_accuracy": 0.21319199353456497, "num_tokens": 110291447.0, "step": 63585 }, { "entropy": 5.8686034202575685, "epoch": 4.947519937755301, "grad_norm": 1.53125, "learning_rate": 0.00028149009030075056, "loss": 4.9452, "mean_token_accuracy": 0.21626957207918168, "num_tokens": 110299422.0, "step": 63590 }, { "entropy": 5.802679395675659, "epoch": 4.947908967127018, "grad_norm": 1.34375, "learning_rate": 0.00028146238619637865, "loss": 4.8588, "mean_token_accuracy": 0.22541553825139998, "num_tokens": 110308811.0, "step": 63595 }, { "entropy": 5.90958948135376, "epoch": 4.948297996498736, "grad_norm": 1.46875, "learning_rate": 0.00028143468199395036, "loss": 4.9498, "mean_token_accuracy": 0.2138850599527359, "num_tokens": 110317970.0, "step": 63600 }, { "entropy": 5.90444049835205, "epoch": 4.948687025870453, "grad_norm": 1.4453125, "learning_rate": 0.00028140697769388597, "loss": 4.9168, "mean_token_accuracy": 0.22285108864307404, "num_tokens": 110326932.0, "step": 63605 }, { "entropy": 5.913523387908936, "epoch": 4.949076055242171, "grad_norm": 1.3828125, "learning_rate": 0.0002813792732966059, "loss": 5.0436, "mean_token_accuracy": 0.20508617162704468, "num_tokens": 110335407.0, "step": 63610 }, { "entropy": 5.923509120941162, "epoch": 4.949465084613888, "grad_norm": 1.4921875, "learning_rate": 0.0002813515688025305, "loss": 4.9611, "mean_token_accuracy": 0.20967944711446762, "num_tokens": 110343118.0, "step": 63615 }, { "entropy": 5.891967058181763, "epoch": 4.949854113985606, "grad_norm": 1.5703125, "learning_rate": 0.0002813238642120802, "loss": 4.9406, "mean_token_accuracy": 0.21591049879789354, "num_tokens": 110351922.0, "step": 63620 }, { "entropy": 5.950574922561645, "epoch": 4.950243143357324, "grad_norm": 1.328125, "learning_rate": 0.00028129615952567517, "loss": 4.9609, "mean_token_accuracy": 0.2166236624121666, "num_tokens": 110360893.0, "step": 63625 }, { "entropy": 5.842494344711303, "epoch": 4.9506321727290405, "grad_norm": 1.359375, "learning_rate": 0.0002812684547437361, "loss": 4.8962, "mean_token_accuracy": 0.22448484003543853, "num_tokens": 110368947.0, "step": 63630 }, { "entropy": 5.845922470092773, "epoch": 4.951021202100758, "grad_norm": 1.578125, "learning_rate": 0.0002812407498666831, "loss": 4.9555, "mean_token_accuracy": 0.21805597692728043, "num_tokens": 110377710.0, "step": 63635 }, { "entropy": 5.849162197113037, "epoch": 4.951410231472476, "grad_norm": 1.40625, "learning_rate": 0.0002812130448949367, "loss": 4.912, "mean_token_accuracy": 0.216579432785511, "num_tokens": 110385969.0, "step": 63640 }, { "entropy": 5.92461142539978, "epoch": 4.951799260844194, "grad_norm": 1.484375, "learning_rate": 0.00028118533982891727, "loss": 4.935, "mean_token_accuracy": 0.21646480709314347, "num_tokens": 110394935.0, "step": 63645 }, { "entropy": 5.8492515087127686, "epoch": 4.952188290215911, "grad_norm": 1.3984375, "learning_rate": 0.0002811576346690451, "loss": 4.8494, "mean_token_accuracy": 0.22742342650890351, "num_tokens": 110403459.0, "step": 63650 }, { "entropy": 5.797526550292969, "epoch": 4.952577319587629, "grad_norm": 1.609375, "learning_rate": 0.00028112992941574074, "loss": 4.9096, "mean_token_accuracy": 0.22081702053546906, "num_tokens": 110411908.0, "step": 63655 }, { "entropy": 5.842470121383667, "epoch": 4.952966348959347, "grad_norm": 1.3984375, "learning_rate": 0.00028110222406942424, "loss": 4.9176, "mean_token_accuracy": 0.21674100458621978, "num_tokens": 110419831.0, "step": 63660 }, { "entropy": 5.857442426681518, "epoch": 4.953355378331064, "grad_norm": 1.4765625, "learning_rate": 0.0002810745186305164, "loss": 4.9217, "mean_token_accuracy": 0.22223664075136185, "num_tokens": 110428111.0, "step": 63665 }, { "entropy": 5.820807266235351, "epoch": 4.953744407702781, "grad_norm": 1.453125, "learning_rate": 0.0002810468130994373, "loss": 4.8987, "mean_token_accuracy": 0.22213053703308105, "num_tokens": 110437478.0, "step": 63670 }, { "entropy": 5.893518400192261, "epoch": 4.954133437074499, "grad_norm": 1.53125, "learning_rate": 0.00028101910747660745, "loss": 4.9069, "mean_token_accuracy": 0.21988317370414734, "num_tokens": 110445196.0, "step": 63675 }, { "entropy": 5.836811923980713, "epoch": 4.954522466446217, "grad_norm": 1.3984375, "learning_rate": 0.0002809914017624472, "loss": 4.9314, "mean_token_accuracy": 0.21533963978290557, "num_tokens": 110453633.0, "step": 63680 }, { "entropy": 5.867154264450074, "epoch": 4.954911495817934, "grad_norm": 1.359375, "learning_rate": 0.0002809636959573771, "loss": 4.9751, "mean_token_accuracy": 0.22303626090288162, "num_tokens": 110462607.0, "step": 63685 }, { "entropy": 5.887663888931274, "epoch": 4.955300525189652, "grad_norm": 1.5078125, "learning_rate": 0.0002809359900618173, "loss": 4.9183, "mean_token_accuracy": 0.21666764169931413, "num_tokens": 110471738.0, "step": 63690 }, { "entropy": 5.862070989608765, "epoch": 4.95568955456137, "grad_norm": 1.4609375, "learning_rate": 0.00028090828407618837, "loss": 4.9122, "mean_token_accuracy": 0.2147664099931717, "num_tokens": 110480133.0, "step": 63695 }, { "entropy": 5.877325487136841, "epoch": 4.9560785839330865, "grad_norm": 1.6171875, "learning_rate": 0.00028088057800091054, "loss": 4.9161, "mean_token_accuracy": 0.21376505494117737, "num_tokens": 110489331.0, "step": 63700 }, { "entropy": 5.858159685134888, "epoch": 4.956467613304804, "grad_norm": 1.4296875, "learning_rate": 0.0002808528718364043, "loss": 4.9388, "mean_token_accuracy": 0.21441205441951752, "num_tokens": 110497872.0, "step": 63705 }, { "entropy": 5.857069206237793, "epoch": 4.956856642676522, "grad_norm": 1.390625, "learning_rate": 0.00028082516558309005, "loss": 4.871, "mean_token_accuracy": 0.22673405408859254, "num_tokens": 110506602.0, "step": 63710 }, { "entropy": 5.887046957015992, "epoch": 4.95724567204824, "grad_norm": 1.6015625, "learning_rate": 0.0002807974592413883, "loss": 4.9363, "mean_token_accuracy": 0.21468460857868193, "num_tokens": 110514714.0, "step": 63715 }, { "entropy": 5.9019293785095215, "epoch": 4.957634701419957, "grad_norm": 1.453125, "learning_rate": 0.00028076975281171926, "loss": 4.9544, "mean_token_accuracy": 0.2109535276889801, "num_tokens": 110523103.0, "step": 63720 }, { "entropy": 5.869557857513428, "epoch": 4.958023730791675, "grad_norm": 1.4921875, "learning_rate": 0.00028074204629450334, "loss": 4.8989, "mean_token_accuracy": 0.22498640418052673, "num_tokens": 110532123.0, "step": 63725 }, { "entropy": 5.817840909957885, "epoch": 4.958412760163393, "grad_norm": 1.4921875, "learning_rate": 0.0002807143396901611, "loss": 4.9011, "mean_token_accuracy": 0.21906392723321916, "num_tokens": 110540507.0, "step": 63730 }, { "entropy": 5.901196622848511, "epoch": 4.9588017895351095, "grad_norm": 1.7578125, "learning_rate": 0.00028068663299911286, "loss": 4.9364, "mean_token_accuracy": 0.21583758443593978, "num_tokens": 110549254.0, "step": 63735 }, { "entropy": 5.85047721862793, "epoch": 4.959190818906827, "grad_norm": 1.4375, "learning_rate": 0.0002806589262217789, "loss": 4.865, "mean_token_accuracy": 0.22236533761024474, "num_tokens": 110557192.0, "step": 63740 }, { "entropy": 5.853070449829102, "epoch": 4.959579848278545, "grad_norm": 1.3984375, "learning_rate": 0.00028063121935857985, "loss": 4.9189, "mean_token_accuracy": 0.219621379673481, "num_tokens": 110565888.0, "step": 63745 }, { "entropy": 5.897838306427002, "epoch": 4.959968877650263, "grad_norm": 1.4609375, "learning_rate": 0.0002806035124099359, "loss": 4.932, "mean_token_accuracy": 0.21701975762844086, "num_tokens": 110575366.0, "step": 63750 }, { "entropy": 5.969503688812256, "epoch": 4.96035790702198, "grad_norm": 1.34375, "learning_rate": 0.00028057580537626766, "loss": 5.0497, "mean_token_accuracy": 0.20820772051811218, "num_tokens": 110585223.0, "step": 63755 }, { "entropy": 5.926539516448974, "epoch": 4.960746936393698, "grad_norm": 1.4296875, "learning_rate": 0.00028054809825799537, "loss": 4.9663, "mean_token_accuracy": 0.2113854169845581, "num_tokens": 110593799.0, "step": 63760 }, { "entropy": 5.911235094070435, "epoch": 4.961135965765415, "grad_norm": 1.328125, "learning_rate": 0.00028052039105553965, "loss": 4.9335, "mean_token_accuracy": 0.2192264422774315, "num_tokens": 110603853.0, "step": 63765 }, { "entropy": 5.8950474739074705, "epoch": 4.9615249951371325, "grad_norm": 1.546875, "learning_rate": 0.0002804926837693207, "loss": 5.0076, "mean_token_accuracy": 0.20988713651895524, "num_tokens": 110612243.0, "step": 63770 }, { "entropy": 5.897330856323242, "epoch": 4.96191402450885, "grad_norm": 1.40625, "learning_rate": 0.000280464976399759, "loss": 4.9524, "mean_token_accuracy": 0.21213668584823608, "num_tokens": 110621570.0, "step": 63775 }, { "entropy": 5.922954130172729, "epoch": 4.962303053880568, "grad_norm": 1.390625, "learning_rate": 0.000280437268947275, "loss": 4.983, "mean_token_accuracy": 0.20959360748529435, "num_tokens": 110630508.0, "step": 63780 }, { "entropy": 5.900032663345337, "epoch": 4.962692083252286, "grad_norm": 1.3671875, "learning_rate": 0.0002804095614122891, "loss": 4.984, "mean_token_accuracy": 0.21195309460163117, "num_tokens": 110639028.0, "step": 63785 }, { "entropy": 5.903289794921875, "epoch": 4.963081112624003, "grad_norm": 1.4453125, "learning_rate": 0.00028038185379522176, "loss": 4.9263, "mean_token_accuracy": 0.21936021447181703, "num_tokens": 110647467.0, "step": 63790 }, { "entropy": 5.852658939361572, "epoch": 4.963470141995721, "grad_norm": 1.4375, "learning_rate": 0.00028035414609649327, "loss": 4.9047, "mean_token_accuracy": 0.21426823139190673, "num_tokens": 110656074.0, "step": 63795 }, { "entropy": 5.873316431045533, "epoch": 4.963859171367439, "grad_norm": 1.3515625, "learning_rate": 0.00028032643831652415, "loss": 4.9111, "mean_token_accuracy": 0.21776635348796844, "num_tokens": 110665156.0, "step": 63800 }, { "entropy": 5.925295400619507, "epoch": 4.9642482007391555, "grad_norm": 1.453125, "learning_rate": 0.0002802987304557349, "loss": 4.9683, "mean_token_accuracy": 0.2102704167366028, "num_tokens": 110673784.0, "step": 63805 }, { "entropy": 5.909707069396973, "epoch": 4.964637230110873, "grad_norm": 1.3203125, "learning_rate": 0.0002802710225145458, "loss": 4.9619, "mean_token_accuracy": 0.21142228692770004, "num_tokens": 110682745.0, "step": 63810 }, { "entropy": 5.9285131931304935, "epoch": 4.965026259482591, "grad_norm": 1.390625, "learning_rate": 0.00028024331449337726, "loss": 4.9791, "mean_token_accuracy": 0.21819272339344026, "num_tokens": 110691350.0, "step": 63815 }, { "entropy": 5.826099920272827, "epoch": 4.965415288854309, "grad_norm": 1.453125, "learning_rate": 0.00028021560639264985, "loss": 4.9247, "mean_token_accuracy": 0.21952420175075532, "num_tokens": 110700569.0, "step": 63820 }, { "entropy": 5.853891658782959, "epoch": 4.965804318226026, "grad_norm": 1.5078125, "learning_rate": 0.0002801878982127838, "loss": 5.0107, "mean_token_accuracy": 0.21637140214443207, "num_tokens": 110709251.0, "step": 63825 }, { "entropy": 5.810581398010254, "epoch": 4.966193347597744, "grad_norm": 1.4140625, "learning_rate": 0.0002801601899541998, "loss": 4.823, "mean_token_accuracy": 0.2268988698720932, "num_tokens": 110717416.0, "step": 63830 }, { "entropy": 5.900151777267456, "epoch": 4.966582376969461, "grad_norm": 1.453125, "learning_rate": 0.000280132481617318, "loss": 4.9865, "mean_token_accuracy": 0.21254925429821014, "num_tokens": 110725887.0, "step": 63835 }, { "entropy": 5.909772491455078, "epoch": 4.9669714063411785, "grad_norm": 1.5, "learning_rate": 0.00028010477320255904, "loss": 4.9177, "mean_token_accuracy": 0.22225174605846404, "num_tokens": 110734292.0, "step": 63840 }, { "entropy": 5.925844430923462, "epoch": 4.967360435712896, "grad_norm": 1.4609375, "learning_rate": 0.0002800770647103433, "loss": 4.8753, "mean_token_accuracy": 0.2203982502222061, "num_tokens": 110743414.0, "step": 63845 }, { "entropy": 5.961088085174561, "epoch": 4.967749465084614, "grad_norm": 1.5703125, "learning_rate": 0.0002800493561410911, "loss": 5.0325, "mean_token_accuracy": 0.20802550613880158, "num_tokens": 110752009.0, "step": 63850 }, { "entropy": 5.86592435836792, "epoch": 4.968138494456332, "grad_norm": 1.4296875, "learning_rate": 0.000280021647495223, "loss": 4.9649, "mean_token_accuracy": 0.21360279768705367, "num_tokens": 110760685.0, "step": 63855 }, { "entropy": 5.89526596069336, "epoch": 4.968527523828049, "grad_norm": 1.3671875, "learning_rate": 0.00027999393877315944, "loss": 4.9579, "mean_token_accuracy": 0.21093704253435136, "num_tokens": 110770134.0, "step": 63860 }, { "entropy": 5.865665483474731, "epoch": 4.968916553199767, "grad_norm": 1.3984375, "learning_rate": 0.0002799662299753207, "loss": 4.9147, "mean_token_accuracy": 0.21159274131059647, "num_tokens": 110778337.0, "step": 63865 }, { "entropy": 5.771656465530396, "epoch": 4.969305582571484, "grad_norm": 1.3515625, "learning_rate": 0.00027993852110212735, "loss": 4.7746, "mean_token_accuracy": 0.22371368259191513, "num_tokens": 110786509.0, "step": 63870 }, { "entropy": 5.857584142684937, "epoch": 4.9696946119432015, "grad_norm": 1.3671875, "learning_rate": 0.0002799108121539999, "loss": 4.9405, "mean_token_accuracy": 0.2185181826353073, "num_tokens": 110795093.0, "step": 63875 }, { "entropy": 5.877140188217163, "epoch": 4.970083641314919, "grad_norm": 1.421875, "learning_rate": 0.00027988310313135857, "loss": 4.9258, "mean_token_accuracy": 0.22066117227077484, "num_tokens": 110803959.0, "step": 63880 }, { "entropy": 5.899916124343872, "epoch": 4.970472670686637, "grad_norm": 1.4375, "learning_rate": 0.00027985539403462407, "loss": 4.8871, "mean_token_accuracy": 0.22463965713977813, "num_tokens": 110812567.0, "step": 63885 }, { "entropy": 5.9445148468017575, "epoch": 4.970861700058355, "grad_norm": 1.453125, "learning_rate": 0.00027982768486421657, "loss": 5.0562, "mean_token_accuracy": 0.20831960886716844, "num_tokens": 110820944.0, "step": 63890 }, { "entropy": 5.77889723777771, "epoch": 4.971250729430072, "grad_norm": 1.3671875, "learning_rate": 0.00027979997562055663, "loss": 4.8362, "mean_token_accuracy": 0.2226160928606987, "num_tokens": 110830361.0, "step": 63895 }, { "entropy": 5.922188758850098, "epoch": 4.971639758801789, "grad_norm": 1.5390625, "learning_rate": 0.00027977226630406476, "loss": 5.0991, "mean_token_accuracy": 0.20399985313415528, "num_tokens": 110839832.0, "step": 63900 }, { "entropy": 5.940261173248291, "epoch": 4.972028788173507, "grad_norm": 1.5, "learning_rate": 0.0002797445569151613, "loss": 4.9705, "mean_token_accuracy": 0.21473704725503923, "num_tokens": 110848693.0, "step": 63905 }, { "entropy": 5.954789876937866, "epoch": 4.9724178175452245, "grad_norm": 1.421875, "learning_rate": 0.0002797168474542668, "loss": 5.0764, "mean_token_accuracy": 0.20703244507312774, "num_tokens": 110857347.0, "step": 63910 }, { "entropy": 5.815934705734253, "epoch": 4.972806846916942, "grad_norm": 1.4609375, "learning_rate": 0.00027968913792180154, "loss": 4.8685, "mean_token_accuracy": 0.21862866580486298, "num_tokens": 110866141.0, "step": 63915 }, { "entropy": 5.8908562660217285, "epoch": 4.97319587628866, "grad_norm": 1.421875, "learning_rate": 0.0002796614283181862, "loss": 4.923, "mean_token_accuracy": 0.22083892524242402, "num_tokens": 110874875.0, "step": 63920 }, { "entropy": 5.857335996627808, "epoch": 4.973584905660378, "grad_norm": 1.453125, "learning_rate": 0.000279633718643841, "loss": 4.9126, "mean_token_accuracy": 0.21625324040651323, "num_tokens": 110884045.0, "step": 63925 }, { "entropy": 5.847949552536011, "epoch": 4.973973935032095, "grad_norm": 1.4375, "learning_rate": 0.00027960600889918657, "loss": 4.882, "mean_token_accuracy": 0.22922610342502595, "num_tokens": 110892751.0, "step": 63930 }, { "entropy": 5.786898183822632, "epoch": 4.974362964403813, "grad_norm": 1.40625, "learning_rate": 0.0002795782990846433, "loss": 4.8652, "mean_token_accuracy": 0.22101684808731079, "num_tokens": 110901929.0, "step": 63935 }, { "entropy": 5.891020250320435, "epoch": 4.97475199377553, "grad_norm": 1.5390625, "learning_rate": 0.0002795505892006316, "loss": 4.9193, "mean_token_accuracy": 0.21833216398954391, "num_tokens": 110911162.0, "step": 63940 }, { "entropy": 5.870971250534057, "epoch": 4.9751410231472475, "grad_norm": 1.4375, "learning_rate": 0.0002795228792475719, "loss": 4.9085, "mean_token_accuracy": 0.21584829837083816, "num_tokens": 110919811.0, "step": 63945 }, { "entropy": 5.8591306686401365, "epoch": 4.975530052518965, "grad_norm": 1.484375, "learning_rate": 0.0002794951692258848, "loss": 4.9279, "mean_token_accuracy": 0.2223811626434326, "num_tokens": 110928452.0, "step": 63950 }, { "entropy": 5.9334807872772215, "epoch": 4.975919081890683, "grad_norm": 1.3828125, "learning_rate": 0.0002794674591359906, "loss": 5.0131, "mean_token_accuracy": 0.20930658131837845, "num_tokens": 110937911.0, "step": 63955 }, { "entropy": 5.831922960281372, "epoch": 4.976308111262401, "grad_norm": 1.5, "learning_rate": 0.0002794397489783098, "loss": 4.8666, "mean_token_accuracy": 0.2260296165943146, "num_tokens": 110946960.0, "step": 63960 }, { "entropy": 5.8928529739379885, "epoch": 4.976697140634117, "grad_norm": 1.3359375, "learning_rate": 0.0002794120387532629, "loss": 4.9536, "mean_token_accuracy": 0.20918354243040085, "num_tokens": 110955512.0, "step": 63965 }, { "entropy": 5.895640468597412, "epoch": 4.977086170005835, "grad_norm": 1.4375, "learning_rate": 0.0002793843284612703, "loss": 5.0293, "mean_token_accuracy": 0.20898516327142716, "num_tokens": 110964372.0, "step": 63970 }, { "entropy": 5.899881362915039, "epoch": 4.977475199377553, "grad_norm": 1.375, "learning_rate": 0.0002793566181027526, "loss": 4.9574, "mean_token_accuracy": 0.21969883590936662, "num_tokens": 110972707.0, "step": 63975 }, { "entropy": 5.904075384140015, "epoch": 4.9778642287492705, "grad_norm": 1.5, "learning_rate": 0.00027932890767813005, "loss": 4.9403, "mean_token_accuracy": 0.2184451162815094, "num_tokens": 110981943.0, "step": 63980 }, { "entropy": 5.909880685806274, "epoch": 4.978253258120988, "grad_norm": 1.453125, "learning_rate": 0.0002793011971878233, "loss": 4.9862, "mean_token_accuracy": 0.21889750510454178, "num_tokens": 110990826.0, "step": 63985 }, { "entropy": 5.936341285705566, "epoch": 4.978642287492706, "grad_norm": 1.4296875, "learning_rate": 0.0002792734866322526, "loss": 5.0989, "mean_token_accuracy": 0.20118037462234498, "num_tokens": 111000580.0, "step": 63990 }, { "entropy": 5.924557876586914, "epoch": 4.979031316864424, "grad_norm": 1.453125, "learning_rate": 0.0002792457760118387, "loss": 4.9644, "mean_token_accuracy": 0.21293821781873704, "num_tokens": 111009587.0, "step": 63995 }, { "entropy": 5.89310507774353, "epoch": 4.979420346236141, "grad_norm": 1.4375, "learning_rate": 0.00027921806532700186, "loss": 4.9009, "mean_token_accuracy": 0.21938625276088713, "num_tokens": 111017654.0, "step": 64000 }, { "entropy": 5.826642799377441, "epoch": 4.979809375607858, "grad_norm": 1.4453125, "learning_rate": 0.0002791903545781625, "loss": 4.8352, "mean_token_accuracy": 0.23218424171209334, "num_tokens": 111026629.0, "step": 64005 }, { "entropy": 5.881484317779541, "epoch": 4.980198404979576, "grad_norm": 1.4765625, "learning_rate": 0.00027916264376574124, "loss": 4.9042, "mean_token_accuracy": 0.21525414735078813, "num_tokens": 111035627.0, "step": 64010 }, { "entropy": 5.866163682937622, "epoch": 4.9805874343512935, "grad_norm": 1.390625, "learning_rate": 0.00027913493289015857, "loss": 4.9233, "mean_token_accuracy": 0.21798885017633438, "num_tokens": 111043802.0, "step": 64015 }, { "entropy": 5.9055314540863035, "epoch": 4.980976463723011, "grad_norm": 1.3671875, "learning_rate": 0.00027910722195183474, "loss": 5.0198, "mean_token_accuracy": 0.21158768832683564, "num_tokens": 111052814.0, "step": 64020 }, { "entropy": 5.907416486740113, "epoch": 4.981365493094729, "grad_norm": 1.4765625, "learning_rate": 0.0002790795109511904, "loss": 4.9955, "mean_token_accuracy": 0.21356550306081773, "num_tokens": 111061437.0, "step": 64025 }, { "entropy": 5.990430068969727, "epoch": 4.981754522466447, "grad_norm": 1.4140625, "learning_rate": 0.00027905179988864593, "loss": 5.0705, "mean_token_accuracy": 0.2072521209716797, "num_tokens": 111069877.0, "step": 64030 }, { "entropy": 5.952732086181641, "epoch": 4.982143551838163, "grad_norm": 1.4296875, "learning_rate": 0.0002790240887646219, "loss": 5.0031, "mean_token_accuracy": 0.21191806793212892, "num_tokens": 111078501.0, "step": 64035 }, { "entropy": 5.907199239730835, "epoch": 4.982532581209881, "grad_norm": 1.515625, "learning_rate": 0.00027899637757953876, "loss": 4.8677, "mean_token_accuracy": 0.22508083879947663, "num_tokens": 111086461.0, "step": 64040 }, { "entropy": 5.876067113876343, "epoch": 4.982921610581599, "grad_norm": 1.3515625, "learning_rate": 0.00027896866633381694, "loss": 4.9076, "mean_token_accuracy": 0.22683394700288773, "num_tokens": 111095277.0, "step": 64045 }, { "entropy": 5.808910751342774, "epoch": 4.9833106399533165, "grad_norm": 1.421875, "learning_rate": 0.0002789409550278769, "loss": 4.8629, "mean_token_accuracy": 0.2256898507475853, "num_tokens": 111104304.0, "step": 64050 }, { "entropy": 5.812211751937866, "epoch": 4.983699669325034, "grad_norm": 1.390625, "learning_rate": 0.0002789132436621391, "loss": 4.9152, "mean_token_accuracy": 0.22071948349475862, "num_tokens": 111113110.0, "step": 64055 }, { "entropy": 5.883360910415649, "epoch": 4.984088698696752, "grad_norm": 1.515625, "learning_rate": 0.0002788855322370241, "loss": 4.9032, "mean_token_accuracy": 0.21941233277320862, "num_tokens": 111120856.0, "step": 64060 }, { "entropy": 5.986951446533203, "epoch": 4.98447772806847, "grad_norm": 1.4453125, "learning_rate": 0.00027885782075295234, "loss": 5.0981, "mean_token_accuracy": 0.20592739135026933, "num_tokens": 111130061.0, "step": 64065 }, { "entropy": 5.860374784469604, "epoch": 4.984866757440186, "grad_norm": 1.390625, "learning_rate": 0.0002788301092103443, "loss": 4.8359, "mean_token_accuracy": 0.22496977895498277, "num_tokens": 111139596.0, "step": 64070 }, { "entropy": 5.972198724746704, "epoch": 4.985255786811904, "grad_norm": 1.5859375, "learning_rate": 0.00027880239760962044, "loss": 4.9361, "mean_token_accuracy": 0.21518083661794662, "num_tokens": 111147288.0, "step": 64075 }, { "entropy": 5.873819017410279, "epoch": 4.985644816183622, "grad_norm": 1.3359375, "learning_rate": 0.00027877468595120125, "loss": 4.8955, "mean_token_accuracy": 0.2185990557074547, "num_tokens": 111155940.0, "step": 64080 }, { "entropy": 5.917134761810303, "epoch": 4.9860338455553395, "grad_norm": 1.3359375, "learning_rate": 0.0002787469742355072, "loss": 4.9882, "mean_token_accuracy": 0.21209343075752257, "num_tokens": 111164165.0, "step": 64085 }, { "entropy": 5.8869551658630375, "epoch": 4.986422874927057, "grad_norm": 1.59375, "learning_rate": 0.0002787192624629587, "loss": 4.9173, "mean_token_accuracy": 0.2152844175696373, "num_tokens": 111171979.0, "step": 64090 }, { "entropy": 5.881446075439453, "epoch": 4.986811904298775, "grad_norm": 1.34375, "learning_rate": 0.0002786915506339764, "loss": 5.0193, "mean_token_accuracy": 0.2103766083717346, "num_tokens": 111180816.0, "step": 64095 }, { "entropy": 5.845865392684937, "epoch": 4.987200933670492, "grad_norm": 1.5234375, "learning_rate": 0.0002786638387489807, "loss": 4.8877, "mean_token_accuracy": 0.2204076200723648, "num_tokens": 111189294.0, "step": 64100 }, { "entropy": 5.914604711532593, "epoch": 4.987589963042209, "grad_norm": 1.5, "learning_rate": 0.00027863612680839204, "loss": 4.9483, "mean_token_accuracy": 0.21569467335939407, "num_tokens": 111197741.0, "step": 64105 }, { "entropy": 5.906512928009033, "epoch": 4.987978992413927, "grad_norm": 1.4453125, "learning_rate": 0.000278608414812631, "loss": 4.9149, "mean_token_accuracy": 0.22186311930418015, "num_tokens": 111206080.0, "step": 64110 }, { "entropy": 5.920551872253418, "epoch": 4.988368021785645, "grad_norm": 1.3828125, "learning_rate": 0.00027858070276211804, "loss": 4.9538, "mean_token_accuracy": 0.21341196447610855, "num_tokens": 111214589.0, "step": 64115 }, { "entropy": 5.870954513549805, "epoch": 4.9887570511573625, "grad_norm": 1.5234375, "learning_rate": 0.0002785529906572735, "loss": 4.9624, "mean_token_accuracy": 0.21427757740020753, "num_tokens": 111223956.0, "step": 64120 }, { "entropy": 5.9437885761260985, "epoch": 4.98914608052908, "grad_norm": 1.4296875, "learning_rate": 0.000278525278498518, "loss": 5.1113, "mean_token_accuracy": 0.20386583507061004, "num_tokens": 111232985.0, "step": 64125 }, { "entropy": 5.96984372138977, "epoch": 4.989535109900798, "grad_norm": 1.515625, "learning_rate": 0.00027849756628627205, "loss": 4.9296, "mean_token_accuracy": 0.21732331216335296, "num_tokens": 111241557.0, "step": 64130 }, { "entropy": 5.903753709793091, "epoch": 4.9899241392725155, "grad_norm": 1.4609375, "learning_rate": 0.0002784698540209561, "loss": 4.8784, "mean_token_accuracy": 0.22474494576454163, "num_tokens": 111249832.0, "step": 64135 }, { "entropy": 5.835906219482422, "epoch": 4.990313168644232, "grad_norm": 1.3984375, "learning_rate": 0.00027844214170299065, "loss": 4.9902, "mean_token_accuracy": 0.21527326107025146, "num_tokens": 111258017.0, "step": 64140 }, { "entropy": 5.769734239578247, "epoch": 4.99070219801595, "grad_norm": 1.3984375, "learning_rate": 0.00027841442933279614, "loss": 4.8414, "mean_token_accuracy": 0.22111235857009887, "num_tokens": 111266774.0, "step": 64145 }, { "entropy": 5.875031614303589, "epoch": 4.991091227387668, "grad_norm": 1.40625, "learning_rate": 0.00027838671691079314, "loss": 4.9585, "mean_token_accuracy": 0.21523204296827317, "num_tokens": 111275994.0, "step": 64150 }, { "entropy": 5.8610505104064945, "epoch": 4.9914802567593854, "grad_norm": 1.609375, "learning_rate": 0.0002783590044374021, "loss": 4.8941, "mean_token_accuracy": 0.21947066038846968, "num_tokens": 111283752.0, "step": 64155 }, { "entropy": 5.826385879516602, "epoch": 4.991869286131103, "grad_norm": 1.453125, "learning_rate": 0.0002783312919130435, "loss": 4.9495, "mean_token_accuracy": 0.22135344594717027, "num_tokens": 111292217.0, "step": 64160 }, { "entropy": 5.854293918609619, "epoch": 4.992258315502821, "grad_norm": 1.4296875, "learning_rate": 0.0002783035793381378, "loss": 5.0118, "mean_token_accuracy": 0.2152214005589485, "num_tokens": 111300649.0, "step": 64165 }, { "entropy": 5.941743993759156, "epoch": 4.992647344874538, "grad_norm": 1.4453125, "learning_rate": 0.00027827586671310556, "loss": 4.9333, "mean_token_accuracy": 0.22137117385864258, "num_tokens": 111309132.0, "step": 64170 }, { "entropy": 5.81886773109436, "epoch": 4.993036374246255, "grad_norm": 1.5390625, "learning_rate": 0.0002782481540383673, "loss": 4.7981, "mean_token_accuracy": 0.23413552343845367, "num_tokens": 111317089.0, "step": 64175 }, { "entropy": 5.821245288848877, "epoch": 4.993425403617973, "grad_norm": 1.3515625, "learning_rate": 0.00027822044131434344, "loss": 4.9708, "mean_token_accuracy": 0.21556792557239532, "num_tokens": 111326273.0, "step": 64180 }, { "entropy": 5.822574090957642, "epoch": 4.993814432989691, "grad_norm": 1.5, "learning_rate": 0.0002781927285414545, "loss": 4.9393, "mean_token_accuracy": 0.21645500808954238, "num_tokens": 111334815.0, "step": 64185 }, { "entropy": 5.887893438339233, "epoch": 4.994203462361408, "grad_norm": 1.5234375, "learning_rate": 0.00027816501572012104, "loss": 4.9636, "mean_token_accuracy": 0.218571275472641, "num_tokens": 111343563.0, "step": 64190 }, { "entropy": 5.850993394851685, "epoch": 4.994592491733126, "grad_norm": 1.3828125, "learning_rate": 0.0002781373028507634, "loss": 4.8602, "mean_token_accuracy": 0.22337769269943236, "num_tokens": 111352310.0, "step": 64195 }, { "entropy": 5.903102207183838, "epoch": 4.994981521104844, "grad_norm": 1.40625, "learning_rate": 0.0002781095899338023, "loss": 4.9505, "mean_token_accuracy": 0.20949295461177825, "num_tokens": 111361276.0, "step": 64200 }, { "entropy": 5.879453897476196, "epoch": 4.995370550476561, "grad_norm": 1.421875, "learning_rate": 0.0002780818769696581, "loss": 4.9146, "mean_token_accuracy": 0.2148409366607666, "num_tokens": 111369870.0, "step": 64205 }, { "entropy": 5.844564437866211, "epoch": 4.995759579848278, "grad_norm": 1.390625, "learning_rate": 0.00027805416395875127, "loss": 4.9452, "mean_token_accuracy": 0.2153105244040489, "num_tokens": 111378967.0, "step": 64210 }, { "entropy": 5.879635000228882, "epoch": 4.996148609219996, "grad_norm": 1.4140625, "learning_rate": 0.0002780264509015024, "loss": 4.8624, "mean_token_accuracy": 0.2325071409344673, "num_tokens": 111387534.0, "step": 64215 }, { "entropy": 5.946760177612305, "epoch": 4.996537638591714, "grad_norm": 1.4140625, "learning_rate": 0.00027799873779833193, "loss": 4.9342, "mean_token_accuracy": 0.2219708725810051, "num_tokens": 111395802.0, "step": 64220 }, { "entropy": 5.870682859420777, "epoch": 4.996926667963431, "grad_norm": 1.34375, "learning_rate": 0.0002779710246496604, "loss": 5.0095, "mean_token_accuracy": 0.20953334420919417, "num_tokens": 111404980.0, "step": 64225 }, { "entropy": 5.846844816207886, "epoch": 4.997315697335149, "grad_norm": 1.578125, "learning_rate": 0.0002779433114559083, "loss": 4.838, "mean_token_accuracy": 0.22834526747465134, "num_tokens": 111412690.0, "step": 64230 }, { "entropy": 5.843465328216553, "epoch": 4.997704726706866, "grad_norm": 1.359375, "learning_rate": 0.00027791559821749615, "loss": 4.8472, "mean_token_accuracy": 0.22586438953876495, "num_tokens": 111420831.0, "step": 64235 }, { "entropy": 5.894962739944458, "epoch": 4.998093756078584, "grad_norm": 1.390625, "learning_rate": 0.00027788788493484447, "loss": 4.9565, "mean_token_accuracy": 0.22111471742391586, "num_tokens": 111429141.0, "step": 64240 }, { "entropy": 5.857069492340088, "epoch": 4.998482785450301, "grad_norm": 1.4140625, "learning_rate": 0.0002778601716083736, "loss": 4.8912, "mean_token_accuracy": 0.2204052224755287, "num_tokens": 111437851.0, "step": 64245 }, { "entropy": 5.938580465316773, "epoch": 4.998871814822019, "grad_norm": 1.359375, "learning_rate": 0.0002778324582385043, "loss": 4.9981, "mean_token_accuracy": 0.21551517099142076, "num_tokens": 111446208.0, "step": 64250 }, { "entropy": 5.898428010940552, "epoch": 4.999260844193737, "grad_norm": 1.4921875, "learning_rate": 0.00027780474482565687, "loss": 4.9694, "mean_token_accuracy": 0.21395378261804582, "num_tokens": 111455099.0, "step": 64255 }, { "entropy": 5.884850025177002, "epoch": 4.999649873565454, "grad_norm": 1.375, "learning_rate": 0.00027777703137025193, "loss": 4.9284, "mean_token_accuracy": 0.22067487239837646, "num_tokens": 111464383.0, "step": 64260 }, { "entropy": 5.973176903194851, "epoch": 5.0, "grad_norm": 2.8125, "learning_rate": 0.00027774931787271, "loss": 5.0698, "mean_token_accuracy": 0.21202192703882852, "num_tokens": 111471835.0, "step": 64265 }, { "entropy": 5.909226369857788, "epoch": 5.000389029371718, "grad_norm": 1.5078125, "learning_rate": 0.0002777216043334516, "loss": 4.9668, "mean_token_accuracy": 0.2119364395737648, "num_tokens": 111480304.0, "step": 64270 }, { "entropy": 5.906182289123535, "epoch": 5.000778058743435, "grad_norm": 1.421875, "learning_rate": 0.00027769389075289714, "loss": 4.9391, "mean_token_accuracy": 0.21264814585447311, "num_tokens": 111488837.0, "step": 64275 }, { "entropy": 5.874850559234619, "epoch": 5.001167088115153, "grad_norm": 1.46875, "learning_rate": 0.0002776661771314671, "loss": 4.8735, "mean_token_accuracy": 0.22183497697114946, "num_tokens": 111497055.0, "step": 64280 }, { "entropy": 5.821565437316894, "epoch": 5.00155611748687, "grad_norm": 1.3515625, "learning_rate": 0.0002776384634695821, "loss": 4.8808, "mean_token_accuracy": 0.22468568235635758, "num_tokens": 111506345.0, "step": 64285 }, { "entropy": 5.828790950775146, "epoch": 5.001945146858588, "grad_norm": 1.4765625, "learning_rate": 0.0002776107497676626, "loss": 4.8108, "mean_token_accuracy": 0.2215821549296379, "num_tokens": 111515138.0, "step": 64290 }, { "entropy": 5.863262510299682, "epoch": 5.002334176230305, "grad_norm": 1.3671875, "learning_rate": 0.0002775830360261291, "loss": 4.8698, "mean_token_accuracy": 0.2301979124546051, "num_tokens": 111524487.0, "step": 64295 }, { "entropy": 5.84428038597107, "epoch": 5.002723205602023, "grad_norm": 1.4921875, "learning_rate": 0.00027755532224540226, "loss": 4.8724, "mean_token_accuracy": 0.22167651057243348, "num_tokens": 111533455.0, "step": 64300 }, { "entropy": 5.88657579421997, "epoch": 5.003112234973741, "grad_norm": 1.5625, "learning_rate": 0.00027752760842590245, "loss": 4.9454, "mean_token_accuracy": 0.216737699508667, "num_tokens": 111541922.0, "step": 64305 }, { "entropy": 5.878822612762451, "epoch": 5.003501264345458, "grad_norm": 1.46875, "learning_rate": 0.0002774998945680502, "loss": 4.8665, "mean_token_accuracy": 0.2233734220266342, "num_tokens": 111550154.0, "step": 64310 }, { "entropy": 5.9098132133483885, "epoch": 5.003890293717176, "grad_norm": 1.5078125, "learning_rate": 0.000277472180672266, "loss": 4.8055, "mean_token_accuracy": 0.22785235047340394, "num_tokens": 111559007.0, "step": 64315 }, { "entropy": 5.855810213088989, "epoch": 5.004279323088893, "grad_norm": 1.5078125, "learning_rate": 0.00027744446673897034, "loss": 4.8585, "mean_token_accuracy": 0.22538969814777374, "num_tokens": 111567839.0, "step": 64320 }, { "entropy": 5.840738010406494, "epoch": 5.004668352460611, "grad_norm": 1.453125, "learning_rate": 0.00027741675276858374, "loss": 4.8129, "mean_token_accuracy": 0.22136402428150176, "num_tokens": 111575902.0, "step": 64325 }, { "entropy": 5.8498505592346195, "epoch": 5.005057381832328, "grad_norm": 1.296875, "learning_rate": 0.00027738903876152693, "loss": 4.8852, "mean_token_accuracy": 0.2221868798136711, "num_tokens": 111585543.0, "step": 64330 }, { "entropy": 5.949696493148804, "epoch": 5.005446411204046, "grad_norm": 1.4765625, "learning_rate": 0.0002773613247182202, "loss": 5.0054, "mean_token_accuracy": 0.20731735974550247, "num_tokens": 111594144.0, "step": 64335 }, { "entropy": 5.887598752975464, "epoch": 5.005835440575764, "grad_norm": 1.359375, "learning_rate": 0.00027733361063908405, "loss": 4.8789, "mean_token_accuracy": 0.22005427479743958, "num_tokens": 111602633.0, "step": 64340 }, { "entropy": 5.926147556304931, "epoch": 5.006224469947481, "grad_norm": 1.46875, "learning_rate": 0.0002773058965245393, "loss": 4.9701, "mean_token_accuracy": 0.2121441513299942, "num_tokens": 111610847.0, "step": 64345 }, { "entropy": 5.88891921043396, "epoch": 5.006613499319198, "grad_norm": 1.484375, "learning_rate": 0.000277278182375006, "loss": 4.8831, "mean_token_accuracy": 0.2319459468126297, "num_tokens": 111619462.0, "step": 64350 }, { "entropy": 5.845765113830566, "epoch": 5.007002528690916, "grad_norm": 1.6015625, "learning_rate": 0.0002772504681909049, "loss": 4.9722, "mean_token_accuracy": 0.2150522366166115, "num_tokens": 111627762.0, "step": 64355 }, { "entropy": 5.882256603240966, "epoch": 5.007391558062634, "grad_norm": 1.3515625, "learning_rate": 0.0002772227539726566, "loss": 4.9529, "mean_token_accuracy": 0.21489426791667937, "num_tokens": 111636983.0, "step": 64360 }, { "entropy": 5.897719192504883, "epoch": 5.007780587434351, "grad_norm": 1.4765625, "learning_rate": 0.0002771950397206816, "loss": 4.9484, "mean_token_accuracy": 0.21634673774242402, "num_tokens": 111646167.0, "step": 64365 }, { "entropy": 5.947975111007691, "epoch": 5.008169616806069, "grad_norm": 1.4140625, "learning_rate": 0.0002771673254354003, "loss": 4.997, "mean_token_accuracy": 0.21402380466461182, "num_tokens": 111655213.0, "step": 64370 }, { "entropy": 5.847512912750244, "epoch": 5.008558646177787, "grad_norm": 1.3984375, "learning_rate": 0.00027713961111723335, "loss": 4.8925, "mean_token_accuracy": 0.21850191950798034, "num_tokens": 111664477.0, "step": 64375 }, { "entropy": 5.85119595527649, "epoch": 5.008947675549504, "grad_norm": 1.6328125, "learning_rate": 0.00027711189676660116, "loss": 4.8871, "mean_token_accuracy": 0.2314981698989868, "num_tokens": 111674001.0, "step": 64380 }, { "entropy": 5.950858449935913, "epoch": 5.009336704921221, "grad_norm": 1.3671875, "learning_rate": 0.00027708418238392435, "loss": 5.0379, "mean_token_accuracy": 0.20829713791608812, "num_tokens": 111682428.0, "step": 64385 }, { "entropy": 5.925779151916504, "epoch": 5.009725734292939, "grad_norm": 1.421875, "learning_rate": 0.0002770564679696233, "loss": 4.9133, "mean_token_accuracy": 0.219101157784462, "num_tokens": 111691688.0, "step": 64390 }, { "entropy": 5.885391187667847, "epoch": 5.010114763664657, "grad_norm": 1.4765625, "learning_rate": 0.00027702875352411866, "loss": 4.871, "mean_token_accuracy": 0.22441920638084412, "num_tokens": 111699485.0, "step": 64395 }, { "entropy": 5.907472562789917, "epoch": 5.010503793036374, "grad_norm": 1.4140625, "learning_rate": 0.0002770010390478309, "loss": 4.9687, "mean_token_accuracy": 0.21735292822122573, "num_tokens": 111708293.0, "step": 64400 }, { "entropy": 5.8503913402557375, "epoch": 5.010892822408092, "grad_norm": 1.421875, "learning_rate": 0.00027697332454118057, "loss": 4.9063, "mean_token_accuracy": 0.22068884521722792, "num_tokens": 111716920.0, "step": 64405 }, { "entropy": 5.876481008529663, "epoch": 5.01128185177981, "grad_norm": 1.4296875, "learning_rate": 0.00027694561000458825, "loss": 4.9153, "mean_token_accuracy": 0.21625497490167617, "num_tokens": 111725746.0, "step": 64410 }, { "entropy": 5.839608240127563, "epoch": 5.011670881151527, "grad_norm": 1.4609375, "learning_rate": 0.0002769178954384743, "loss": 4.8385, "mean_token_accuracy": 0.22555433809757233, "num_tokens": 111734337.0, "step": 64415 }, { "entropy": 5.807862710952759, "epoch": 5.012059910523244, "grad_norm": 1.3515625, "learning_rate": 0.0002768901808432594, "loss": 4.8904, "mean_token_accuracy": 0.2221294179558754, "num_tokens": 111742842.0, "step": 64420 }, { "entropy": 5.782453155517578, "epoch": 5.012448939894962, "grad_norm": 1.7109375, "learning_rate": 0.000276862466219364, "loss": 4.8042, "mean_token_accuracy": 0.23139130622148513, "num_tokens": 111751506.0, "step": 64425 }, { "entropy": 5.83946681022644, "epoch": 5.01283796926668, "grad_norm": 1.453125, "learning_rate": 0.0002768347515672086, "loss": 4.9393, "mean_token_accuracy": 0.21661840826272966, "num_tokens": 111760110.0, "step": 64430 }, { "entropy": 5.838093996047974, "epoch": 5.013226998638397, "grad_norm": 1.4296875, "learning_rate": 0.00027680703688721383, "loss": 4.887, "mean_token_accuracy": 0.22454843521118165, "num_tokens": 111768781.0, "step": 64435 }, { "entropy": 5.864094161987305, "epoch": 5.013616028010115, "grad_norm": 1.5234375, "learning_rate": 0.00027677932217980004, "loss": 4.9428, "mean_token_accuracy": 0.22545695453882217, "num_tokens": 111776830.0, "step": 64440 }, { "entropy": 5.897670793533325, "epoch": 5.014005057381833, "grad_norm": 1.4375, "learning_rate": 0.000276751607445388, "loss": 4.9879, "mean_token_accuracy": 0.21299912929534912, "num_tokens": 111785366.0, "step": 64445 }, { "entropy": 5.877817678451538, "epoch": 5.0143940867535495, "grad_norm": 1.4765625, "learning_rate": 0.000276723892684398, "loss": 4.9121, "mean_token_accuracy": 0.2155481532216072, "num_tokens": 111793724.0, "step": 64450 }, { "entropy": 5.86826376914978, "epoch": 5.014783116125267, "grad_norm": 1.3203125, "learning_rate": 0.00027669617789725074, "loss": 4.852, "mean_token_accuracy": 0.22119883298873902, "num_tokens": 111802892.0, "step": 64455 }, { "entropy": 5.867434310913086, "epoch": 5.015172145496985, "grad_norm": 1.390625, "learning_rate": 0.0002766684630843667, "loss": 4.9212, "mean_token_accuracy": 0.2152613341808319, "num_tokens": 111811768.0, "step": 64460 }, { "entropy": 5.914344120025635, "epoch": 5.015561174868703, "grad_norm": 1.5078125, "learning_rate": 0.0002766407482461663, "loss": 4.9706, "mean_token_accuracy": 0.21625232249498366, "num_tokens": 111821344.0, "step": 64465 }, { "entropy": 5.877723646163941, "epoch": 5.01595020424042, "grad_norm": 1.5390625, "learning_rate": 0.0002766130333830702, "loss": 4.8993, "mean_token_accuracy": 0.22738804519176484, "num_tokens": 111830731.0, "step": 64470 }, { "entropy": 5.823696517944336, "epoch": 5.016339233612138, "grad_norm": 1.421875, "learning_rate": 0.00027658531849549894, "loss": 4.8332, "mean_token_accuracy": 0.22013920545578003, "num_tokens": 111838637.0, "step": 64475 }, { "entropy": 5.881544733047486, "epoch": 5.016728262983856, "grad_norm": 1.5078125, "learning_rate": 0.0002765576035838729, "loss": 4.9741, "mean_token_accuracy": 0.21595467031002044, "num_tokens": 111846646.0, "step": 64480 }, { "entropy": 5.8424018859863285, "epoch": 5.0171172923555725, "grad_norm": 1.375, "learning_rate": 0.0002765298886486128, "loss": 4.8796, "mean_token_accuracy": 0.22106529027223587, "num_tokens": 111855717.0, "step": 64485 }, { "entropy": 5.838183736801147, "epoch": 5.01750632172729, "grad_norm": 1.3828125, "learning_rate": 0.0002765021736901389, "loss": 4.922, "mean_token_accuracy": 0.21723163723945618, "num_tokens": 111865351.0, "step": 64490 }, { "entropy": 5.838608837127685, "epoch": 5.017895351099008, "grad_norm": 1.4453125, "learning_rate": 0.0002764744587088721, "loss": 4.8461, "mean_token_accuracy": 0.22504724711179733, "num_tokens": 111873246.0, "step": 64495 }, { "entropy": 5.88311767578125, "epoch": 5.018284380470726, "grad_norm": 1.4921875, "learning_rate": 0.0002764467437052327, "loss": 4.9261, "mean_token_accuracy": 0.21749533265829085, "num_tokens": 111882035.0, "step": 64500 }, { "entropy": 5.815058183670044, "epoch": 5.018673409842443, "grad_norm": 1.296875, "learning_rate": 0.00027641902867964126, "loss": 4.9014, "mean_token_accuracy": 0.22354974150657653, "num_tokens": 111890505.0, "step": 64505 }, { "entropy": 5.898570537567139, "epoch": 5.019062439214161, "grad_norm": 1.4921875, "learning_rate": 0.00027639131363251825, "loss": 4.9297, "mean_token_accuracy": 0.22015136778354644, "num_tokens": 111899662.0, "step": 64510 }, { "entropy": 5.856615257263184, "epoch": 5.019451468585879, "grad_norm": 1.5390625, "learning_rate": 0.00027636359856428436, "loss": 5.0014, "mean_token_accuracy": 0.20836184173822403, "num_tokens": 111908425.0, "step": 64515 }, { "entropy": 5.817131996154785, "epoch": 5.0198404979575955, "grad_norm": 1.4765625, "learning_rate": 0.0002763358834753599, "loss": 4.862, "mean_token_accuracy": 0.22499207705259322, "num_tokens": 111917070.0, "step": 64520 }, { "entropy": 5.902232360839844, "epoch": 5.020229527329313, "grad_norm": 1.4453125, "learning_rate": 0.00027630816836616564, "loss": 4.918, "mean_token_accuracy": 0.21824053972959517, "num_tokens": 111925747.0, "step": 64525 }, { "entropy": 5.90600619316101, "epoch": 5.020618556701031, "grad_norm": 1.53125, "learning_rate": 0.00027628045323712194, "loss": 4.9562, "mean_token_accuracy": 0.21482586860656738, "num_tokens": 111934277.0, "step": 64530 }, { "entropy": 6.003481388092041, "epoch": 5.0210075860727486, "grad_norm": 1.3203125, "learning_rate": 0.00027625273808864955, "loss": 5.016, "mean_token_accuracy": 0.2088635340332985, "num_tokens": 111942911.0, "step": 64535 }, { "entropy": 5.899829626083374, "epoch": 5.021396615444466, "grad_norm": 1.3828125, "learning_rate": 0.0002762250229211687, "loss": 4.9214, "mean_token_accuracy": 0.22460928708314895, "num_tokens": 111952000.0, "step": 64540 }, { "entropy": 5.844606876373291, "epoch": 5.021785644816184, "grad_norm": 1.4140625, "learning_rate": 0.00027619730773510015, "loss": 4.9549, "mean_token_accuracy": 0.21338469088077544, "num_tokens": 111960878.0, "step": 64545 }, { "entropy": 5.913014125823975, "epoch": 5.022174674187901, "grad_norm": 1.4921875, "learning_rate": 0.00027616959253086437, "loss": 4.9193, "mean_token_accuracy": 0.22320106774568557, "num_tokens": 111969025.0, "step": 64550 }, { "entropy": 5.911015796661377, "epoch": 5.0225637035596185, "grad_norm": 1.6328125, "learning_rate": 0.0002761418773088818, "loss": 4.8909, "mean_token_accuracy": 0.2378765180706978, "num_tokens": 111977470.0, "step": 64555 }, { "entropy": 5.925042057037354, "epoch": 5.022952732931336, "grad_norm": 1.40625, "learning_rate": 0.0002761141620695731, "loss": 4.979, "mean_token_accuracy": 0.21598169952630997, "num_tokens": 111986305.0, "step": 64560 }, { "entropy": 5.902093696594238, "epoch": 5.023341762303054, "grad_norm": 1.546875, "learning_rate": 0.00027608644681335876, "loss": 4.9455, "mean_token_accuracy": 0.2112624913454056, "num_tokens": 111994842.0, "step": 64565 }, { "entropy": 5.915882349014282, "epoch": 5.0237307916747715, "grad_norm": 1.5859375, "learning_rate": 0.00027605873154065935, "loss": 4.8894, "mean_token_accuracy": 0.22018698751926422, "num_tokens": 112003495.0, "step": 64570 }, { "entropy": 5.862339782714844, "epoch": 5.024119821046489, "grad_norm": 1.4765625, "learning_rate": 0.00027603101625189543, "loss": 4.9187, "mean_token_accuracy": 0.22215728014707564, "num_tokens": 112012235.0, "step": 64575 }, { "entropy": 5.9120502948760985, "epoch": 5.024508850418207, "grad_norm": 1.6015625, "learning_rate": 0.0002760033009474874, "loss": 4.9685, "mean_token_accuracy": 0.20994774252176285, "num_tokens": 112021002.0, "step": 64580 }, { "entropy": 5.914652347564697, "epoch": 5.024897879789924, "grad_norm": 1.421875, "learning_rate": 0.0002759755856278558, "loss": 4.8736, "mean_token_accuracy": 0.22479916214942933, "num_tokens": 112029188.0, "step": 64585 }, { "entropy": 5.851552534103393, "epoch": 5.0252869091616414, "grad_norm": 1.3984375, "learning_rate": 0.0002759478702934213, "loss": 4.8234, "mean_token_accuracy": 0.22999429404735566, "num_tokens": 112038007.0, "step": 64590 }, { "entropy": 5.857545185089111, "epoch": 5.025675938533359, "grad_norm": 1.546875, "learning_rate": 0.00027592015494460443, "loss": 4.907, "mean_token_accuracy": 0.2208712339401245, "num_tokens": 112046759.0, "step": 64595 }, { "entropy": 5.875380182266236, "epoch": 5.026064967905077, "grad_norm": 1.5625, "learning_rate": 0.00027589243958182566, "loss": 4.9395, "mean_token_accuracy": 0.2218281462788582, "num_tokens": 112054615.0, "step": 64600 }, { "entropy": 5.862544965744019, "epoch": 5.0264539972767945, "grad_norm": 1.4140625, "learning_rate": 0.00027586472420550553, "loss": 4.8564, "mean_token_accuracy": 0.2270636036992073, "num_tokens": 112063376.0, "step": 64605 }, { "entropy": 5.877909183502197, "epoch": 5.026843026648512, "grad_norm": 1.5, "learning_rate": 0.0002758370088160646, "loss": 4.9457, "mean_token_accuracy": 0.21472433507442473, "num_tokens": 112071585.0, "step": 64610 }, { "entropy": 5.849989223480224, "epoch": 5.02723205602023, "grad_norm": 1.484375, "learning_rate": 0.0002758092934139234, "loss": 4.8485, "mean_token_accuracy": 0.2321088880300522, "num_tokens": 112079453.0, "step": 64615 }, { "entropy": 5.826113891601563, "epoch": 5.027621085391947, "grad_norm": 1.328125, "learning_rate": 0.0002757815779995023, "loss": 4.8517, "mean_token_accuracy": 0.225997656583786, "num_tokens": 112088746.0, "step": 64620 }, { "entropy": 5.859411001205444, "epoch": 5.028010114763664, "grad_norm": 1.390625, "learning_rate": 0.0002757538625732222, "loss": 4.9511, "mean_token_accuracy": 0.21667447686195374, "num_tokens": 112097157.0, "step": 64625 }, { "entropy": 5.811166477203369, "epoch": 5.028399144135382, "grad_norm": 1.5625, "learning_rate": 0.0002757261471355034, "loss": 4.8363, "mean_token_accuracy": 0.22257663458585739, "num_tokens": 112105436.0, "step": 64630 }, { "entropy": 5.887614965438843, "epoch": 5.0287881735071, "grad_norm": 1.625, "learning_rate": 0.00027569843168676647, "loss": 4.8908, "mean_token_accuracy": 0.21997662782669067, "num_tokens": 112113701.0, "step": 64635 }, { "entropy": 5.848079442977905, "epoch": 5.0291772028788175, "grad_norm": 1.484375, "learning_rate": 0.0002756707162274319, "loss": 4.9296, "mean_token_accuracy": 0.22155907601118088, "num_tokens": 112122436.0, "step": 64640 }, { "entropy": 5.839847040176392, "epoch": 5.029566232250535, "grad_norm": 1.453125, "learning_rate": 0.00027564300075792026, "loss": 4.8555, "mean_token_accuracy": 0.21865054070949555, "num_tokens": 112131491.0, "step": 64645 }, { "entropy": 5.926815414428711, "epoch": 5.029955261622252, "grad_norm": 1.3984375, "learning_rate": 0.00027561528527865215, "loss": 4.9582, "mean_token_accuracy": 0.2216126799583435, "num_tokens": 112140458.0, "step": 64650 }, { "entropy": 5.886229562759399, "epoch": 5.03034429099397, "grad_norm": 1.3203125, "learning_rate": 0.0002755875697900481, "loss": 4.9441, "mean_token_accuracy": 0.2206069514155388, "num_tokens": 112149571.0, "step": 64655 }, { "entropy": 5.894085168838501, "epoch": 5.030733320365687, "grad_norm": 1.5, "learning_rate": 0.00027555985429252857, "loss": 4.9738, "mean_token_accuracy": 0.21675858199596404, "num_tokens": 112158470.0, "step": 64660 }, { "entropy": 5.866319370269776, "epoch": 5.031122349737405, "grad_norm": 1.515625, "learning_rate": 0.0002755321387865141, "loss": 4.9109, "mean_token_accuracy": 0.22225476056337357, "num_tokens": 112166395.0, "step": 64665 }, { "entropy": 5.8216753005981445, "epoch": 5.031511379109123, "grad_norm": 1.3984375, "learning_rate": 0.0002755044232724253, "loss": 4.8798, "mean_token_accuracy": 0.22428909689188004, "num_tokens": 112174990.0, "step": 64670 }, { "entropy": 5.919644021987915, "epoch": 5.0319004084808405, "grad_norm": 1.5078125, "learning_rate": 0.00027547670775068274, "loss": 4.9382, "mean_token_accuracy": 0.2129521608352661, "num_tokens": 112184117.0, "step": 64675 }, { "entropy": 6.0109185695648195, "epoch": 5.032289437852558, "grad_norm": 1.421875, "learning_rate": 0.00027544899222170684, "loss": 5.0867, "mean_token_accuracy": 0.2167431116104126, "num_tokens": 112193747.0, "step": 64680 }, { "entropy": 5.903535509109497, "epoch": 5.032678467224275, "grad_norm": 1.3828125, "learning_rate": 0.00027542127668591824, "loss": 4.9238, "mean_token_accuracy": 0.21410429626703262, "num_tokens": 112202485.0, "step": 64685 }, { "entropy": 5.807920789718628, "epoch": 5.033067496595993, "grad_norm": 1.859375, "learning_rate": 0.0002753935611437374, "loss": 4.7885, "mean_token_accuracy": 0.23694253116846084, "num_tokens": 112211844.0, "step": 64690 }, { "entropy": 5.892452335357666, "epoch": 5.03345652596771, "grad_norm": 1.5859375, "learning_rate": 0.00027536584559558494, "loss": 4.9802, "mean_token_accuracy": 0.2132840037345886, "num_tokens": 112220494.0, "step": 64695 }, { "entropy": 5.868812322616577, "epoch": 5.033845555339428, "grad_norm": 1.4765625, "learning_rate": 0.0002753381300418813, "loss": 4.8766, "mean_token_accuracy": 0.21918901950120925, "num_tokens": 112228804.0, "step": 64700 }, { "entropy": 5.942786169052124, "epoch": 5.034234584711146, "grad_norm": 1.6953125, "learning_rate": 0.0002753104144830471, "loss": 4.9276, "mean_token_accuracy": 0.2168677791953087, "num_tokens": 112237707.0, "step": 64705 }, { "entropy": 5.839637517929077, "epoch": 5.0346236140828635, "grad_norm": 1.4453125, "learning_rate": 0.00027528269891950285, "loss": 4.8672, "mean_token_accuracy": 0.21986932456493377, "num_tokens": 112245365.0, "step": 64710 }, { "entropy": 5.833718204498291, "epoch": 5.035012643454581, "grad_norm": 1.4921875, "learning_rate": 0.0002752549833516691, "loss": 4.9391, "mean_token_accuracy": 0.21476005166769027, "num_tokens": 112253710.0, "step": 64715 }, { "entropy": 5.863571691513061, "epoch": 5.035401672826298, "grad_norm": 1.5078125, "learning_rate": 0.0002752272677799664, "loss": 4.9581, "mean_token_accuracy": 0.21887447983026503, "num_tokens": 112261990.0, "step": 64720 }, { "entropy": 5.905410814285278, "epoch": 5.035790702198016, "grad_norm": 1.3828125, "learning_rate": 0.00027519955220481525, "loss": 4.929, "mean_token_accuracy": 0.22362429648637772, "num_tokens": 112271555.0, "step": 64725 }, { "entropy": 5.876361942291259, "epoch": 5.036179731569733, "grad_norm": 1.453125, "learning_rate": 0.0002751718366266362, "loss": 4.8501, "mean_token_accuracy": 0.21785062402486802, "num_tokens": 112280365.0, "step": 64730 }, { "entropy": 5.898961210250855, "epoch": 5.036568760941451, "grad_norm": 1.5078125, "learning_rate": 0.0002751441210458498, "loss": 4.9559, "mean_token_accuracy": 0.21646856814622878, "num_tokens": 112288240.0, "step": 64735 }, { "entropy": 5.96207218170166, "epoch": 5.036957790313169, "grad_norm": 1.4375, "learning_rate": 0.00027511640546287665, "loss": 5.0378, "mean_token_accuracy": 0.21324578076601028, "num_tokens": 112297769.0, "step": 64740 }, { "entropy": 5.907105493545532, "epoch": 5.0373468196848865, "grad_norm": 1.375, "learning_rate": 0.0002750886898781372, "loss": 4.9407, "mean_token_accuracy": 0.22068289667367935, "num_tokens": 112306669.0, "step": 64745 }, { "entropy": 5.827813005447387, "epoch": 5.037735849056604, "grad_norm": 1.3046875, "learning_rate": 0.000275060974292052, "loss": 4.9064, "mean_token_accuracy": 0.22098648101091384, "num_tokens": 112315377.0, "step": 64750 }, { "entropy": 5.78583254814148, "epoch": 5.038124878428321, "grad_norm": 1.328125, "learning_rate": 0.0002750332587050416, "loss": 4.8406, "mean_token_accuracy": 0.2223580524325371, "num_tokens": 112323964.0, "step": 64755 }, { "entropy": 5.888118267059326, "epoch": 5.038513907800039, "grad_norm": 1.4296875, "learning_rate": 0.0002750055431175266, "loss": 4.9142, "mean_token_accuracy": 0.2230849876999855, "num_tokens": 112331965.0, "step": 64760 }, { "entropy": 5.86181788444519, "epoch": 5.038902937171756, "grad_norm": 1.453125, "learning_rate": 0.00027497782752992743, "loss": 4.9515, "mean_token_accuracy": 0.20751924365758895, "num_tokens": 112340780.0, "step": 64765 }, { "entropy": 5.9145880222320555, "epoch": 5.039291966543474, "grad_norm": 1.5703125, "learning_rate": 0.0002749501119426647, "loss": 4.9742, "mean_token_accuracy": 0.20553751587867736, "num_tokens": 112349604.0, "step": 64770 }, { "entropy": 5.817593050003052, "epoch": 5.039680995915192, "grad_norm": 1.4296875, "learning_rate": 0.00027492239635615903, "loss": 4.7891, "mean_token_accuracy": 0.22874020785093307, "num_tokens": 112358754.0, "step": 64775 }, { "entropy": 5.977034711837769, "epoch": 5.0400700252869095, "grad_norm": 1.484375, "learning_rate": 0.0002748946807708308, "loss": 5.1043, "mean_token_accuracy": 0.20542526692152024, "num_tokens": 112367371.0, "step": 64780 }, { "entropy": 5.969960260391235, "epoch": 5.040459054658626, "grad_norm": 1.421875, "learning_rate": 0.0002748669651871006, "loss": 5.0091, "mean_token_accuracy": 0.2175255998969078, "num_tokens": 112376498.0, "step": 64785 }, { "entropy": 5.862517976760865, "epoch": 5.040848084030344, "grad_norm": 1.5390625, "learning_rate": 0.00027483924960538907, "loss": 4.8761, "mean_token_accuracy": 0.2166166126728058, "num_tokens": 112385609.0, "step": 64790 }, { "entropy": 5.868311738967895, "epoch": 5.041237113402062, "grad_norm": 1.421875, "learning_rate": 0.00027481153402611664, "loss": 4.9215, "mean_token_accuracy": 0.21647924482822417, "num_tokens": 112394571.0, "step": 64795 }, { "entropy": 5.820017385482788, "epoch": 5.041626142773779, "grad_norm": 1.4375, "learning_rate": 0.00027478381844970386, "loss": 4.856, "mean_token_accuracy": 0.2283809095621109, "num_tokens": 112404187.0, "step": 64800 }, { "entropy": 5.873910427093506, "epoch": 5.042015172145497, "grad_norm": 1.4375, "learning_rate": 0.0002747561028765713, "loss": 4.9906, "mean_token_accuracy": 0.21526931822299958, "num_tokens": 112413301.0, "step": 64805 }, { "entropy": 5.860207796096802, "epoch": 5.042404201517215, "grad_norm": 1.3671875, "learning_rate": 0.00027472838730713956, "loss": 4.891, "mean_token_accuracy": 0.22126493155956267, "num_tokens": 112422914.0, "step": 64810 }, { "entropy": 5.873942279815674, "epoch": 5.0427932308889325, "grad_norm": 1.375, "learning_rate": 0.00027470067174182905, "loss": 4.9393, "mean_token_accuracy": 0.22297078520059585, "num_tokens": 112431808.0, "step": 64815 }, { "entropy": 5.869992351531982, "epoch": 5.043182260260649, "grad_norm": 1.4765625, "learning_rate": 0.0002746729561810604, "loss": 4.8627, "mean_token_accuracy": 0.22310978323221206, "num_tokens": 112441098.0, "step": 64820 }, { "entropy": 5.976985931396484, "epoch": 5.043571289632367, "grad_norm": 1.4765625, "learning_rate": 0.00027464524062525405, "loss": 4.9748, "mean_token_accuracy": 0.21123768538236617, "num_tokens": 112449921.0, "step": 64825 }, { "entropy": 5.925273513793945, "epoch": 5.043960319004085, "grad_norm": 1.4375, "learning_rate": 0.0002746175250748306, "loss": 4.959, "mean_token_accuracy": 0.21295267045497895, "num_tokens": 112458296.0, "step": 64830 }, { "entropy": 5.89515905380249, "epoch": 5.044349348375802, "grad_norm": 1.421875, "learning_rate": 0.0002745898095302106, "loss": 4.8829, "mean_token_accuracy": 0.22082732170820235, "num_tokens": 112466374.0, "step": 64835 }, { "entropy": 5.807960510253906, "epoch": 5.04473837774752, "grad_norm": 1.453125, "learning_rate": 0.00027456209399181466, "loss": 4.8457, "mean_token_accuracy": 0.22418073564767838, "num_tokens": 112474795.0, "step": 64840 }, { "entropy": 5.889541244506836, "epoch": 5.045127407119238, "grad_norm": 1.5078125, "learning_rate": 0.00027453437846006325, "loss": 4.9033, "mean_token_accuracy": 0.2250228703022003, "num_tokens": 112483843.0, "step": 64845 }, { "entropy": 5.897929668426514, "epoch": 5.0455164364909555, "grad_norm": 1.5859375, "learning_rate": 0.00027450666293537683, "loss": 4.9403, "mean_token_accuracy": 0.2148088589310646, "num_tokens": 112493156.0, "step": 64850 }, { "entropy": 5.911912965774536, "epoch": 5.045905465862672, "grad_norm": 1.546875, "learning_rate": 0.000274478947418176, "loss": 4.9267, "mean_token_accuracy": 0.22611821442842484, "num_tokens": 112502112.0, "step": 64855 }, { "entropy": 5.872188568115234, "epoch": 5.04629449523439, "grad_norm": 1.453125, "learning_rate": 0.0002744512319088814, "loss": 4.8298, "mean_token_accuracy": 0.2223617374897003, "num_tokens": 112510565.0, "step": 64860 }, { "entropy": 5.902511978149414, "epoch": 5.046683524606108, "grad_norm": 1.3828125, "learning_rate": 0.0002744235164079135, "loss": 4.9412, "mean_token_accuracy": 0.2180855542421341, "num_tokens": 112519677.0, "step": 64865 }, { "entropy": 5.9034675598144535, "epoch": 5.047072553977825, "grad_norm": 1.4765625, "learning_rate": 0.0002743958009156928, "loss": 4.9347, "mean_token_accuracy": 0.21795149892568588, "num_tokens": 112527865.0, "step": 64870 }, { "entropy": 5.863388109207153, "epoch": 5.047461583349543, "grad_norm": 1.3671875, "learning_rate": 0.0002743680854326398, "loss": 4.92, "mean_token_accuracy": 0.21361682415008545, "num_tokens": 112536738.0, "step": 64875 }, { "entropy": 5.8773950099945065, "epoch": 5.047850612721261, "grad_norm": 1.4453125, "learning_rate": 0.0002743403699591751, "loss": 4.9665, "mean_token_accuracy": 0.21387017965316774, "num_tokens": 112545055.0, "step": 64880 }, { "entropy": 5.95924015045166, "epoch": 5.048239642092978, "grad_norm": 1.3984375, "learning_rate": 0.00027431265449571937, "loss": 4.9802, "mean_token_accuracy": 0.21599520593881608, "num_tokens": 112553986.0, "step": 64885 }, { "entropy": 5.839030647277832, "epoch": 5.048628671464695, "grad_norm": 1.4140625, "learning_rate": 0.00027428493904269285, "loss": 4.8555, "mean_token_accuracy": 0.21672775149345397, "num_tokens": 112562980.0, "step": 64890 }, { "entropy": 5.8693924903869625, "epoch": 5.049017700836413, "grad_norm": 1.421875, "learning_rate": 0.0002742572236005164, "loss": 4.9036, "mean_token_accuracy": 0.22095745354890822, "num_tokens": 112571884.0, "step": 64895 }, { "entropy": 5.802287244796753, "epoch": 5.049406730208131, "grad_norm": 1.53125, "learning_rate": 0.00027422950816961025, "loss": 4.8307, "mean_token_accuracy": 0.22675658464431764, "num_tokens": 112580120.0, "step": 64900 }, { "entropy": 5.853997039794922, "epoch": 5.049795759579848, "grad_norm": 1.4765625, "learning_rate": 0.000274201792750395, "loss": 4.9285, "mean_token_accuracy": 0.2200113609433174, "num_tokens": 112588603.0, "step": 64905 }, { "entropy": 5.893977546691895, "epoch": 5.050184788951566, "grad_norm": 1.546875, "learning_rate": 0.0002741740773432914, "loss": 4.8658, "mean_token_accuracy": 0.22451066374778747, "num_tokens": 112596528.0, "step": 64910 }, { "entropy": 5.800830221176147, "epoch": 5.050573818323284, "grad_norm": 1.453125, "learning_rate": 0.0002741463619487199, "loss": 4.764, "mean_token_accuracy": 0.23505058288574218, "num_tokens": 112606080.0, "step": 64915 }, { "entropy": 5.798304080963135, "epoch": 5.050962847695001, "grad_norm": 1.40625, "learning_rate": 0.0002741186465671011, "loss": 4.9136, "mean_token_accuracy": 0.21558415591716767, "num_tokens": 112614403.0, "step": 64920 }, { "entropy": 5.892044401168823, "epoch": 5.051351877066718, "grad_norm": 1.421875, "learning_rate": 0.0002740909311988553, "loss": 4.9663, "mean_token_accuracy": 0.21385367959737778, "num_tokens": 112622402.0, "step": 64925 }, { "entropy": 5.893374109268189, "epoch": 5.051740906438436, "grad_norm": 1.3046875, "learning_rate": 0.0002740632158444031, "loss": 4.9317, "mean_token_accuracy": 0.2216365799307823, "num_tokens": 112631556.0, "step": 64930 }, { "entropy": 5.869762325286866, "epoch": 5.052129935810154, "grad_norm": 1.5078125, "learning_rate": 0.0002740355005041652, "loss": 4.8401, "mean_token_accuracy": 0.23569984436035157, "num_tokens": 112640328.0, "step": 64935 }, { "entropy": 5.855741834640503, "epoch": 5.052518965181871, "grad_norm": 1.390625, "learning_rate": 0.0002740077851785621, "loss": 4.9107, "mean_token_accuracy": 0.21776291131973266, "num_tokens": 112648302.0, "step": 64940 }, { "entropy": 5.9218274593353275, "epoch": 5.052907994553589, "grad_norm": 1.4765625, "learning_rate": 0.00027398006986801415, "loss": 4.9674, "mean_token_accuracy": 0.21496013700962066, "num_tokens": 112657202.0, "step": 64945 }, { "entropy": 5.902160596847534, "epoch": 5.053297023925307, "grad_norm": 1.453125, "learning_rate": 0.0002739523545729421, "loss": 4.966, "mean_token_accuracy": 0.2142154946923256, "num_tokens": 112665869.0, "step": 64950 }, { "entropy": 5.917887020111084, "epoch": 5.053686053297024, "grad_norm": 1.34375, "learning_rate": 0.0002739246392937664, "loss": 4.9066, "mean_token_accuracy": 0.21729104369878768, "num_tokens": 112675141.0, "step": 64955 }, { "entropy": 5.888119125366211, "epoch": 5.054075082668741, "grad_norm": 1.390625, "learning_rate": 0.00027389692403090754, "loss": 4.9575, "mean_token_accuracy": 0.22151168137788774, "num_tokens": 112684735.0, "step": 64960 }, { "entropy": 5.793762302398681, "epoch": 5.054464112040459, "grad_norm": 1.6328125, "learning_rate": 0.00027386920878478616, "loss": 4.8656, "mean_token_accuracy": 0.22848789691925048, "num_tokens": 112693383.0, "step": 64965 }, { "entropy": 5.915420150756836, "epoch": 5.054853141412177, "grad_norm": 1.5078125, "learning_rate": 0.00027384149355582266, "loss": 4.9475, "mean_token_accuracy": 0.21750899404287338, "num_tokens": 112702211.0, "step": 64970 }, { "entropy": 5.874306869506836, "epoch": 5.055242170783894, "grad_norm": 1.4765625, "learning_rate": 0.0002738137783444377, "loss": 4.7774, "mean_token_accuracy": 0.23560174107551574, "num_tokens": 112710398.0, "step": 64975 }, { "entropy": 5.9192358493804935, "epoch": 5.055631200155612, "grad_norm": 1.40625, "learning_rate": 0.00027378606315105175, "loss": 4.9506, "mean_token_accuracy": 0.21411571949720382, "num_tokens": 112719278.0, "step": 64980 }, { "entropy": 5.817488336563111, "epoch": 5.056020229527329, "grad_norm": 1.4296875, "learning_rate": 0.0002737583479760854, "loss": 4.854, "mean_token_accuracy": 0.22727371007204056, "num_tokens": 112728164.0, "step": 64985 }, { "entropy": 5.859387588500977, "epoch": 5.056409258899047, "grad_norm": 1.4140625, "learning_rate": 0.0002737306328199591, "loss": 4.8996, "mean_token_accuracy": 0.2227487489581108, "num_tokens": 112737036.0, "step": 64990 }, { "entropy": 5.935918855667114, "epoch": 5.056798288270764, "grad_norm": 1.5625, "learning_rate": 0.00027370291768309354, "loss": 4.9122, "mean_token_accuracy": 0.21944176256656647, "num_tokens": 112745113.0, "step": 64995 }, { "entropy": 5.852061319351196, "epoch": 5.057187317642482, "grad_norm": 1.5, "learning_rate": 0.000273675202565909, "loss": 4.8286, "mean_token_accuracy": 0.22317281663417815, "num_tokens": 112753667.0, "step": 65000 }, { "entropy": 5.914431095123291, "epoch": 5.0575763470142, "grad_norm": 1.5, "learning_rate": 0.00027364748746882623, "loss": 4.9038, "mean_token_accuracy": 0.21511419713497162, "num_tokens": 112761409.0, "step": 65005 }, { "entropy": 5.854408645629883, "epoch": 5.057965376385917, "grad_norm": 1.5234375, "learning_rate": 0.00027361977239226566, "loss": 4.9079, "mean_token_accuracy": 0.21941624879837035, "num_tokens": 112770235.0, "step": 65010 }, { "entropy": 5.90045804977417, "epoch": 5.058354405757635, "grad_norm": 1.5625, "learning_rate": 0.0002735920573366478, "loss": 4.9062, "mean_token_accuracy": 0.21663012951612473, "num_tokens": 112778300.0, "step": 65015 }, { "entropy": 5.908638143539429, "epoch": 5.058743435129352, "grad_norm": 1.359375, "learning_rate": 0.0002735643423023933, "loss": 4.9235, "mean_token_accuracy": 0.21123852878808974, "num_tokens": 112787518.0, "step": 65020 }, { "entropy": 5.891512250900268, "epoch": 5.05913246450107, "grad_norm": 1.4609375, "learning_rate": 0.0002735366272899226, "loss": 4.9684, "mean_token_accuracy": 0.22273272573947905, "num_tokens": 112796100.0, "step": 65025 }, { "entropy": 5.798455858230591, "epoch": 5.059521493872787, "grad_norm": 1.4765625, "learning_rate": 0.00027350891229965623, "loss": 4.8079, "mean_token_accuracy": 0.23303077667951583, "num_tokens": 112804756.0, "step": 65030 }, { "entropy": 5.890562582015991, "epoch": 5.059910523244505, "grad_norm": 1.4609375, "learning_rate": 0.0002734811973320147, "loss": 4.9361, "mean_token_accuracy": 0.21506002992391587, "num_tokens": 112813020.0, "step": 65035 }, { "entropy": 5.884553241729736, "epoch": 5.060299552616223, "grad_norm": 1.359375, "learning_rate": 0.00027345348238741864, "loss": 4.9437, "mean_token_accuracy": 0.21912122070789336, "num_tokens": 112822364.0, "step": 65040 }, { "entropy": 5.936220264434814, "epoch": 5.06068858198794, "grad_norm": 1.5234375, "learning_rate": 0.00027342576746628854, "loss": 4.9058, "mean_token_accuracy": 0.22500730454921722, "num_tokens": 112830709.0, "step": 65045 }, { "entropy": 5.853667736053467, "epoch": 5.061077611359658, "grad_norm": 1.734375, "learning_rate": 0.0002733980525690449, "loss": 4.8307, "mean_token_accuracy": 0.21764699816703797, "num_tokens": 112839108.0, "step": 65050 }, { "entropy": 5.797406482696533, "epoch": 5.061466640731375, "grad_norm": 1.5234375, "learning_rate": 0.00027337033769610827, "loss": 4.8278, "mean_token_accuracy": 0.21902662962675096, "num_tokens": 112847521.0, "step": 65055 }, { "entropy": 5.863193988800049, "epoch": 5.061855670103093, "grad_norm": 1.4296875, "learning_rate": 0.0002733426228478991, "loss": 4.9291, "mean_token_accuracy": 0.22062177658081056, "num_tokens": 112856758.0, "step": 65060 }, { "entropy": 5.864192342758178, "epoch": 5.06224469947481, "grad_norm": 1.59375, "learning_rate": 0.0002733149080248381, "loss": 4.9361, "mean_token_accuracy": 0.22126346081495285, "num_tokens": 112864628.0, "step": 65065 }, { "entropy": 5.883143615722656, "epoch": 5.062633728846528, "grad_norm": 1.3828125, "learning_rate": 0.0002732871932273456, "loss": 4.9253, "mean_token_accuracy": 0.2171648398041725, "num_tokens": 112873407.0, "step": 65070 }, { "entropy": 5.885685777664184, "epoch": 5.063022758218246, "grad_norm": 1.53125, "learning_rate": 0.0002732594784558423, "loss": 4.9752, "mean_token_accuracy": 0.21406883746385574, "num_tokens": 112881577.0, "step": 65075 }, { "entropy": 5.839009714126587, "epoch": 5.063411787589963, "grad_norm": 1.5625, "learning_rate": 0.0002732317637107486, "loss": 4.8989, "mean_token_accuracy": 0.22209562510251998, "num_tokens": 112889985.0, "step": 65080 }, { "entropy": 5.894692611694336, "epoch": 5.063800816961681, "grad_norm": 1.5859375, "learning_rate": 0.00027320404899248507, "loss": 5.0135, "mean_token_accuracy": 0.21197282522916794, "num_tokens": 112897506.0, "step": 65085 }, { "entropy": 5.980425119400024, "epoch": 5.064189846333398, "grad_norm": 1.4453125, "learning_rate": 0.0002731763343014722, "loss": 5.052, "mean_token_accuracy": 0.20575623363256454, "num_tokens": 112906433.0, "step": 65090 }, { "entropy": 5.921547079086304, "epoch": 5.064578875705116, "grad_norm": 1.4609375, "learning_rate": 0.00027314861963813065, "loss": 4.9728, "mean_token_accuracy": 0.20803272128105163, "num_tokens": 112915006.0, "step": 65095 }, { "entropy": 5.837696361541748, "epoch": 5.064967905076833, "grad_norm": 1.4296875, "learning_rate": 0.00027312090500288065, "loss": 4.8963, "mean_token_accuracy": 0.2220611333847046, "num_tokens": 112923056.0, "step": 65100 }, { "entropy": 5.854428052902222, "epoch": 5.065356934448551, "grad_norm": 1.6328125, "learning_rate": 0.0002730931903961431, "loss": 4.9115, "mean_token_accuracy": 0.21267687380313874, "num_tokens": 112931345.0, "step": 65105 }, { "entropy": 5.862637186050415, "epoch": 5.065745963820269, "grad_norm": 1.484375, "learning_rate": 0.00027306547581833836, "loss": 4.8697, "mean_token_accuracy": 0.22649916559457778, "num_tokens": 112939983.0, "step": 65110 }, { "entropy": 5.802713346481323, "epoch": 5.066134993191986, "grad_norm": 1.46875, "learning_rate": 0.00027303776126988687, "loss": 4.7651, "mean_token_accuracy": 0.22732220143079757, "num_tokens": 112948760.0, "step": 65115 }, { "entropy": 5.828072357177734, "epoch": 5.066524022563703, "grad_norm": 1.5078125, "learning_rate": 0.00027301004675120926, "loss": 4.8875, "mean_token_accuracy": 0.21431052684783936, "num_tokens": 112957861.0, "step": 65120 }, { "entropy": 5.886091184616089, "epoch": 5.066913051935421, "grad_norm": 1.6484375, "learning_rate": 0.0002729823322627261, "loss": 4.8646, "mean_token_accuracy": 0.22917547821998596, "num_tokens": 112966027.0, "step": 65125 }, { "entropy": 5.905043125152588, "epoch": 5.0673020813071386, "grad_norm": 1.484375, "learning_rate": 0.0002729546178048577, "loss": 4.9084, "mean_token_accuracy": 0.21229495257139205, "num_tokens": 112974256.0, "step": 65130 }, { "entropy": 5.844264984130859, "epoch": 5.067691110678856, "grad_norm": 1.4453125, "learning_rate": 0.0002729269033780248, "loss": 4.893, "mean_token_accuracy": 0.2265363499522209, "num_tokens": 112982611.0, "step": 65135 }, { "entropy": 5.872763729095459, "epoch": 5.068080140050574, "grad_norm": 1.46875, "learning_rate": 0.00027289918898264784, "loss": 4.9883, "mean_token_accuracy": 0.21456132382154464, "num_tokens": 112991258.0, "step": 65140 }, { "entropy": 5.847701215744019, "epoch": 5.068469169422292, "grad_norm": 1.3828125, "learning_rate": 0.0002728714746191473, "loss": 4.9559, "mean_token_accuracy": 0.21162209808826446, "num_tokens": 113000354.0, "step": 65145 }, { "entropy": 5.854842710494995, "epoch": 5.068858198794009, "grad_norm": 1.4765625, "learning_rate": 0.00027284376028794376, "loss": 4.7918, "mean_token_accuracy": 0.22677891254425048, "num_tokens": 113008858.0, "step": 65150 }, { "entropy": 5.915000343322754, "epoch": 5.069247228165726, "grad_norm": 1.4140625, "learning_rate": 0.00027281604598945774, "loss": 4.817, "mean_token_accuracy": 0.2210051581263542, "num_tokens": 113017073.0, "step": 65155 }, { "entropy": 5.906723737716675, "epoch": 5.069636257537444, "grad_norm": 1.4921875, "learning_rate": 0.0002727883317241098, "loss": 4.8641, "mean_token_accuracy": 0.2243797540664673, "num_tokens": 113025782.0, "step": 65160 }, { "entropy": 5.868117141723633, "epoch": 5.0700252869091615, "grad_norm": 1.5625, "learning_rate": 0.00027276061749232034, "loss": 4.9356, "mean_token_accuracy": 0.21898618191480637, "num_tokens": 113034478.0, "step": 65165 }, { "entropy": 5.897947692871094, "epoch": 5.070414316280879, "grad_norm": 1.4921875, "learning_rate": 0.0002727329032945099, "loss": 4.9466, "mean_token_accuracy": 0.21958808600902557, "num_tokens": 113043474.0, "step": 65170 }, { "entropy": 5.923863315582276, "epoch": 5.070803345652597, "grad_norm": 1.4921875, "learning_rate": 0.0002727051891310991, "loss": 4.943, "mean_token_accuracy": 0.2204459384083748, "num_tokens": 113051600.0, "step": 65175 }, { "entropy": 5.833640289306641, "epoch": 5.071192375024315, "grad_norm": 1.2890625, "learning_rate": 0.0002726774750025084, "loss": 4.8337, "mean_token_accuracy": 0.22142624706029893, "num_tokens": 113061062.0, "step": 65180 }, { "entropy": 5.870120477676392, "epoch": 5.071581404396032, "grad_norm": 1.3984375, "learning_rate": 0.00027264976090915835, "loss": 4.942, "mean_token_accuracy": 0.2112548068165779, "num_tokens": 113069795.0, "step": 65185 }, { "entropy": 5.844617080688477, "epoch": 5.071970433767749, "grad_norm": 1.5, "learning_rate": 0.0002726220468514694, "loss": 4.8659, "mean_token_accuracy": 0.22756513506174086, "num_tokens": 113079037.0, "step": 65190 }, { "entropy": 5.90989499092102, "epoch": 5.072359463139467, "grad_norm": 1.484375, "learning_rate": 0.0002725943328298621, "loss": 4.9548, "mean_token_accuracy": 0.21848677694797516, "num_tokens": 113087431.0, "step": 65195 }, { "entropy": 5.787341594696045, "epoch": 5.0727484925111845, "grad_norm": 1.484375, "learning_rate": 0.000272566618844757, "loss": 4.8174, "mean_token_accuracy": 0.22504399716854095, "num_tokens": 113095985.0, "step": 65200 }, { "entropy": 5.862154579162597, "epoch": 5.073137521882902, "grad_norm": 1.4375, "learning_rate": 0.00027253890489657457, "loss": 4.9372, "mean_token_accuracy": 0.2184295192360878, "num_tokens": 113104687.0, "step": 65205 }, { "entropy": 5.7922694206237795, "epoch": 5.07352655125462, "grad_norm": 1.4765625, "learning_rate": 0.00027251119098573533, "loss": 4.8197, "mean_token_accuracy": 0.22839094698429108, "num_tokens": 113112799.0, "step": 65210 }, { "entropy": 5.951018953323365, "epoch": 5.073915580626338, "grad_norm": 1.4765625, "learning_rate": 0.00027248347711265983, "loss": 4.9993, "mean_token_accuracy": 0.21086585372686387, "num_tokens": 113121421.0, "step": 65215 }, { "entropy": 5.88949556350708, "epoch": 5.074304609998054, "grad_norm": 1.4921875, "learning_rate": 0.0002724557632777686, "loss": 4.9162, "mean_token_accuracy": 0.22497667372226715, "num_tokens": 113130708.0, "step": 65220 }, { "entropy": 5.854046821594238, "epoch": 5.074693639369772, "grad_norm": 1.3828125, "learning_rate": 0.00027242804948148197, "loss": 4.8807, "mean_token_accuracy": 0.21787459999322892, "num_tokens": 113139034.0, "step": 65225 }, { "entropy": 5.923110628128052, "epoch": 5.07508266874149, "grad_norm": 1.421875, "learning_rate": 0.0002724003357242207, "loss": 4.9471, "mean_token_accuracy": 0.2221601888537407, "num_tokens": 113148304.0, "step": 65230 }, { "entropy": 5.88196063041687, "epoch": 5.0754716981132075, "grad_norm": 1.5078125, "learning_rate": 0.0002723726220064051, "loss": 4.9091, "mean_token_accuracy": 0.2134503334760666, "num_tokens": 113156984.0, "step": 65235 }, { "entropy": 5.821055507659912, "epoch": 5.075860727484925, "grad_norm": 1.390625, "learning_rate": 0.0002723449083284559, "loss": 4.9469, "mean_token_accuracy": 0.2156686916947365, "num_tokens": 113165885.0, "step": 65240 }, { "entropy": 5.916143846511841, "epoch": 5.076249756856643, "grad_norm": 1.4453125, "learning_rate": 0.00027231719469079344, "loss": 5.0055, "mean_token_accuracy": 0.21719736456871033, "num_tokens": 113175196.0, "step": 65245 }, { "entropy": 5.900101184844971, "epoch": 5.076638786228361, "grad_norm": 1.4296875, "learning_rate": 0.00027228948109383826, "loss": 4.9373, "mean_token_accuracy": 0.2231779471039772, "num_tokens": 113183811.0, "step": 65250 }, { "entropy": 5.913023376464844, "epoch": 5.077027815600077, "grad_norm": 1.3984375, "learning_rate": 0.00027226176753801095, "loss": 4.9687, "mean_token_accuracy": 0.2208199679851532, "num_tokens": 113192846.0, "step": 65255 }, { "entropy": 5.937267732620239, "epoch": 5.077416844971795, "grad_norm": 1.5546875, "learning_rate": 0.00027223405402373194, "loss": 4.9771, "mean_token_accuracy": 0.21527650356292724, "num_tokens": 113201311.0, "step": 65260 }, { "entropy": 5.872148609161377, "epoch": 5.077805874343513, "grad_norm": 1.3828125, "learning_rate": 0.00027220634055142174, "loss": 4.8946, "mean_token_accuracy": 0.21491804718971252, "num_tokens": 113209799.0, "step": 65265 }, { "entropy": 5.902370595932007, "epoch": 5.0781949037152305, "grad_norm": 1.5078125, "learning_rate": 0.0002721786271215009, "loss": 4.9824, "mean_token_accuracy": 0.2167784631252289, "num_tokens": 113219107.0, "step": 65270 }, { "entropy": 5.914782571792602, "epoch": 5.078583933086948, "grad_norm": 1.5078125, "learning_rate": 0.0002721509137343899, "loss": 4.949, "mean_token_accuracy": 0.2099096730351448, "num_tokens": 113228395.0, "step": 65275 }, { "entropy": 5.970580005645752, "epoch": 5.078972962458666, "grad_norm": 1.4140625, "learning_rate": 0.00027212320039050924, "loss": 5.0805, "mean_token_accuracy": 0.20246295183897017, "num_tokens": 113237934.0, "step": 65280 }, { "entropy": 5.901640176773071, "epoch": 5.079361991830384, "grad_norm": 1.4765625, "learning_rate": 0.00027209548709027944, "loss": 4.9873, "mean_token_accuracy": 0.2157839596271515, "num_tokens": 113246184.0, "step": 65285 }, { "entropy": 5.868247079849243, "epoch": 5.0797510212021, "grad_norm": 1.4375, "learning_rate": 0.000272067773834121, "loss": 4.8152, "mean_token_accuracy": 0.2276090681552887, "num_tokens": 113254741.0, "step": 65290 }, { "entropy": 5.904131507873535, "epoch": 5.080140050573818, "grad_norm": 1.5625, "learning_rate": 0.0002720400606224544, "loss": 4.9575, "mean_token_accuracy": 0.2172112762928009, "num_tokens": 113262516.0, "step": 65295 }, { "entropy": 5.847368383407593, "epoch": 5.080529079945536, "grad_norm": 1.53125, "learning_rate": 0.00027201234745570014, "loss": 4.8806, "mean_token_accuracy": 0.22352254390716553, "num_tokens": 113270714.0, "step": 65300 }, { "entropy": 5.787071990966797, "epoch": 5.0809181093172535, "grad_norm": 1.484375, "learning_rate": 0.0002719846343342788, "loss": 4.8334, "mean_token_accuracy": 0.22568640410900115, "num_tokens": 113279244.0, "step": 65305 }, { "entropy": 5.828607082366943, "epoch": 5.081307138688971, "grad_norm": 1.5390625, "learning_rate": 0.0002719569212586108, "loss": 4.8901, "mean_token_accuracy": 0.2223309949040413, "num_tokens": 113287429.0, "step": 65310 }, { "entropy": 5.908442401885987, "epoch": 5.081696168060689, "grad_norm": 1.59375, "learning_rate": 0.0002719292082291167, "loss": 5.0136, "mean_token_accuracy": 0.20804882794618607, "num_tokens": 113296050.0, "step": 65315 }, { "entropy": 5.911419010162353, "epoch": 5.082085197432406, "grad_norm": 1.4296875, "learning_rate": 0.000271901495246217, "loss": 4.9612, "mean_token_accuracy": 0.21422354876995087, "num_tokens": 113304153.0, "step": 65320 }, { "entropy": 5.856732320785523, "epoch": 5.082474226804123, "grad_norm": 1.5625, "learning_rate": 0.0002718737823103322, "loss": 4.8601, "mean_token_accuracy": 0.2237371787428856, "num_tokens": 113312561.0, "step": 65325 }, { "entropy": 5.874054765701294, "epoch": 5.082863256175841, "grad_norm": 1.453125, "learning_rate": 0.00027184606942188275, "loss": 4.8578, "mean_token_accuracy": 0.22814837247133254, "num_tokens": 113321480.0, "step": 65330 }, { "entropy": 5.895652341842651, "epoch": 5.083252285547559, "grad_norm": 1.3203125, "learning_rate": 0.00027181835658128913, "loss": 4.8908, "mean_token_accuracy": 0.21708130985498428, "num_tokens": 113330510.0, "step": 65335 }, { "entropy": 5.82962737083435, "epoch": 5.0836413149192765, "grad_norm": 1.4375, "learning_rate": 0.0002717906437889719, "loss": 4.9568, "mean_token_accuracy": 0.22329147756099701, "num_tokens": 113340273.0, "step": 65340 }, { "entropy": 5.8773986339569095, "epoch": 5.084030344290994, "grad_norm": 1.59375, "learning_rate": 0.00027176293104535154, "loss": 4.8517, "mean_token_accuracy": 0.22134459763765335, "num_tokens": 113348963.0, "step": 65345 }, { "entropy": 5.814590549468994, "epoch": 5.084419373662712, "grad_norm": 1.4375, "learning_rate": 0.00027173521835084863, "loss": 4.814, "mean_token_accuracy": 0.23178064674139023, "num_tokens": 113357678.0, "step": 65350 }, { "entropy": 5.847152233123779, "epoch": 5.084808403034429, "grad_norm": 1.515625, "learning_rate": 0.0002717075057058835, "loss": 4.8191, "mean_token_accuracy": 0.22073301523923874, "num_tokens": 113366631.0, "step": 65355 }, { "entropy": 5.8026128768920895, "epoch": 5.085197432406146, "grad_norm": 1.453125, "learning_rate": 0.0002716797931108768, "loss": 4.8406, "mean_token_accuracy": 0.2252953380346298, "num_tokens": 113374591.0, "step": 65360 }, { "entropy": 5.826650381088257, "epoch": 5.085586461777864, "grad_norm": 1.5234375, "learning_rate": 0.0002716520805662489, "loss": 4.8943, "mean_token_accuracy": 0.21870972514152526, "num_tokens": 113384208.0, "step": 65365 }, { "entropy": 5.819668960571289, "epoch": 5.085975491149582, "grad_norm": 1.40625, "learning_rate": 0.00027162436807242024, "loss": 4.9401, "mean_token_accuracy": 0.21797839552164078, "num_tokens": 113393113.0, "step": 65370 }, { "entropy": 5.836445093154907, "epoch": 5.0863645205212995, "grad_norm": 1.515625, "learning_rate": 0.00027159665562981154, "loss": 4.925, "mean_token_accuracy": 0.22273023724555968, "num_tokens": 113401703.0, "step": 65375 }, { "entropy": 6.037199831008911, "epoch": 5.086753549893017, "grad_norm": 1.4921875, "learning_rate": 0.0002715689432388433, "loss": 5.0714, "mean_token_accuracy": 0.20666299015283585, "num_tokens": 113410636.0, "step": 65380 }, { "entropy": 5.912101984024048, "epoch": 5.087142579264735, "grad_norm": 1.4453125, "learning_rate": 0.0002715412308999357, "loss": 4.9516, "mean_token_accuracy": 0.2101287141442299, "num_tokens": 113420443.0, "step": 65385 }, { "entropy": 5.876407623291016, "epoch": 5.087531608636452, "grad_norm": 1.46875, "learning_rate": 0.00027151351861350953, "loss": 4.9323, "mean_token_accuracy": 0.22003291696310043, "num_tokens": 113428646.0, "step": 65390 }, { "entropy": 5.832454872131348, "epoch": 5.087920638008169, "grad_norm": 1.390625, "learning_rate": 0.0002714858063799851, "loss": 4.8625, "mean_token_accuracy": 0.21711015999317168, "num_tokens": 113438526.0, "step": 65395 }, { "entropy": 5.861706733703613, "epoch": 5.088309667379887, "grad_norm": 1.4296875, "learning_rate": 0.00027145809419978293, "loss": 4.8694, "mean_token_accuracy": 0.21587102115154266, "num_tokens": 113447081.0, "step": 65400 }, { "entropy": 5.913576269149781, "epoch": 5.088698696751605, "grad_norm": 1.4140625, "learning_rate": 0.00027143038207332363, "loss": 4.965, "mean_token_accuracy": 0.21326445639133454, "num_tokens": 113456309.0, "step": 65405 }, { "entropy": 5.911952066421509, "epoch": 5.0890877261233225, "grad_norm": 1.421875, "learning_rate": 0.00027140267000102755, "loss": 4.9429, "mean_token_accuracy": 0.2093920886516571, "num_tokens": 113464874.0, "step": 65410 }, { "entropy": 5.89169282913208, "epoch": 5.08947675549504, "grad_norm": 1.609375, "learning_rate": 0.00027137495798331524, "loss": 4.9548, "mean_token_accuracy": 0.21414714455604553, "num_tokens": 113473841.0, "step": 65415 }, { "entropy": 5.823452043533325, "epoch": 5.089865784866757, "grad_norm": 1.75, "learning_rate": 0.00027134724602060717, "loss": 4.8092, "mean_token_accuracy": 0.2303641378879547, "num_tokens": 113482594.0, "step": 65420 }, { "entropy": 5.864932918548584, "epoch": 5.090254814238475, "grad_norm": 1.4921875, "learning_rate": 0.00027131953411332384, "loss": 4.952, "mean_token_accuracy": 0.21977291256189346, "num_tokens": 113491256.0, "step": 65425 }, { "entropy": 5.844240331649781, "epoch": 5.090643843610192, "grad_norm": 1.53125, "learning_rate": 0.00027129182226188575, "loss": 4.8852, "mean_token_accuracy": 0.21609150916337966, "num_tokens": 113500221.0, "step": 65430 }, { "entropy": 5.759958982467651, "epoch": 5.09103287298191, "grad_norm": 1.546875, "learning_rate": 0.0002712641104667132, "loss": 4.7712, "mean_token_accuracy": 0.2331371396780014, "num_tokens": 113509060.0, "step": 65435 }, { "entropy": 5.924038362503052, "epoch": 5.091421902353628, "grad_norm": 1.4140625, "learning_rate": 0.000271236398728227, "loss": 4.983, "mean_token_accuracy": 0.21313105821609496, "num_tokens": 113517953.0, "step": 65440 }, { "entropy": 5.93276743888855, "epoch": 5.0918109317253455, "grad_norm": 1.421875, "learning_rate": 0.00027120868704684736, "loss": 4.9086, "mean_token_accuracy": 0.21829409897327423, "num_tokens": 113526520.0, "step": 65445 }, { "entropy": 5.887671995162964, "epoch": 5.092199961097063, "grad_norm": 1.46875, "learning_rate": 0.0002711809754229949, "loss": 4.941, "mean_token_accuracy": 0.21588577032089235, "num_tokens": 113535403.0, "step": 65450 }, { "entropy": 5.833799266815186, "epoch": 5.09258899046878, "grad_norm": 1.4609375, "learning_rate": 0.00027115326385709004, "loss": 4.8808, "mean_token_accuracy": 0.22690628170967103, "num_tokens": 113543763.0, "step": 65455 }, { "entropy": 5.911220932006836, "epoch": 5.092978019840498, "grad_norm": 1.4921875, "learning_rate": 0.0002711255523495534, "loss": 4.9951, "mean_token_accuracy": 0.2185896009206772, "num_tokens": 113551558.0, "step": 65460 }, { "entropy": 5.942658710479736, "epoch": 5.093367049212215, "grad_norm": 1.5703125, "learning_rate": 0.0002710978409008052, "loss": 4.9461, "mean_token_accuracy": 0.22096379846334457, "num_tokens": 113559603.0, "step": 65465 }, { "entropy": 5.855960273742676, "epoch": 5.093756078583933, "grad_norm": 1.4296875, "learning_rate": 0.00027107012951126607, "loss": 4.8461, "mean_token_accuracy": 0.23044936805963517, "num_tokens": 113568116.0, "step": 65470 }, { "entropy": 5.870174884796143, "epoch": 5.094145107955651, "grad_norm": 1.421875, "learning_rate": 0.00027104241818135655, "loss": 4.9895, "mean_token_accuracy": 0.2154032915830612, "num_tokens": 113576778.0, "step": 65475 }, { "entropy": 5.796998119354248, "epoch": 5.0945341373273685, "grad_norm": 1.546875, "learning_rate": 0.00027101470691149693, "loss": 4.7894, "mean_token_accuracy": 0.23330315351486205, "num_tokens": 113585453.0, "step": 65480 }, { "entropy": 5.891551399230957, "epoch": 5.094923166699086, "grad_norm": 1.515625, "learning_rate": 0.00027098699570210787, "loss": 4.8596, "mean_token_accuracy": 0.22142219990491868, "num_tokens": 113593727.0, "step": 65485 }, { "entropy": 5.888092517852783, "epoch": 5.095312196070803, "grad_norm": 1.421875, "learning_rate": 0.00027095928455360977, "loss": 4.9271, "mean_token_accuracy": 0.21614392548799516, "num_tokens": 113601584.0, "step": 65490 }, { "entropy": 5.868610811233521, "epoch": 5.095701225442521, "grad_norm": 1.546875, "learning_rate": 0.000270931573466423, "loss": 4.9535, "mean_token_accuracy": 0.21638845801353454, "num_tokens": 113610509.0, "step": 65495 }, { "entropy": 5.911000394821167, "epoch": 5.096090254814238, "grad_norm": 1.484375, "learning_rate": 0.0002709038624409681, "loss": 4.9624, "mean_token_accuracy": 0.2081785038113594, "num_tokens": 113618642.0, "step": 65500 }, { "entropy": 5.9551338195800785, "epoch": 5.096479284185956, "grad_norm": 1.4609375, "learning_rate": 0.00027087615147766567, "loss": 4.9433, "mean_token_accuracy": 0.21395208686590195, "num_tokens": 113627385.0, "step": 65505 }, { "entropy": 5.969971370697022, "epoch": 5.096868313557674, "grad_norm": 1.484375, "learning_rate": 0.000270848440576936, "loss": 4.973, "mean_token_accuracy": 0.21126056760549544, "num_tokens": 113636581.0, "step": 65510 }, { "entropy": 5.869914293289185, "epoch": 5.0972573429293915, "grad_norm": 1.4296875, "learning_rate": 0.00027082072973919974, "loss": 4.8711, "mean_token_accuracy": 0.22226247042417527, "num_tokens": 113645825.0, "step": 65515 }, { "entropy": 5.8987444877624515, "epoch": 5.097646372301108, "grad_norm": 1.4765625, "learning_rate": 0.00027079301896487716, "loss": 4.9418, "mean_token_accuracy": 0.21859501749277116, "num_tokens": 113654709.0, "step": 65520 }, { "entropy": 5.941103267669678, "epoch": 5.098035401672826, "grad_norm": 1.5390625, "learning_rate": 0.0002707653082543889, "loss": 5.0135, "mean_token_accuracy": 0.2200246348977089, "num_tokens": 113663536.0, "step": 65525 }, { "entropy": 5.842590284347534, "epoch": 5.098424431044544, "grad_norm": 1.5859375, "learning_rate": 0.0002707375976081553, "loss": 4.8631, "mean_token_accuracy": 0.21426498144865036, "num_tokens": 113671597.0, "step": 65530 }, { "entropy": 5.855186700820923, "epoch": 5.098813460416261, "grad_norm": 1.546875, "learning_rate": 0.00027070988702659687, "loss": 4.8926, "mean_token_accuracy": 0.2239503711462021, "num_tokens": 113679913.0, "step": 65535 }, { "entropy": 5.866179370880127, "epoch": 5.099202489787979, "grad_norm": 1.5390625, "learning_rate": 0.00027068217651013415, "loss": 4.899, "mean_token_accuracy": 0.21892814934253693, "num_tokens": 113688263.0, "step": 65540 }, { "entropy": 5.925367403030395, "epoch": 5.099591519159697, "grad_norm": 1.40625, "learning_rate": 0.0002706544660591875, "loss": 5.0469, "mean_token_accuracy": 0.2114056646823883, "num_tokens": 113698391.0, "step": 65545 }, { "entropy": 5.8344817638397215, "epoch": 5.0999805485314145, "grad_norm": 1.5234375, "learning_rate": 0.00027062675567417736, "loss": 4.8168, "mean_token_accuracy": 0.2248559519648552, "num_tokens": 113705949.0, "step": 65550 }, { "entropy": 5.798208236694336, "epoch": 5.100369577903131, "grad_norm": 1.3828125, "learning_rate": 0.00027059904535552424, "loss": 4.8812, "mean_token_accuracy": 0.21425600796937944, "num_tokens": 113714104.0, "step": 65555 }, { "entropy": 5.9197744846344, "epoch": 5.100758607274849, "grad_norm": 1.3359375, "learning_rate": 0.00027057133510364866, "loss": 4.9248, "mean_token_accuracy": 0.21435917317867278, "num_tokens": 113723099.0, "step": 65560 }, { "entropy": 5.908179473876953, "epoch": 5.101147636646567, "grad_norm": 1.4921875, "learning_rate": 0.0002705436249189709, "loss": 4.9008, "mean_token_accuracy": 0.21976491063833237, "num_tokens": 113731102.0, "step": 65565 }, { "entropy": 5.951141738891602, "epoch": 5.101536666018284, "grad_norm": 1.5, "learning_rate": 0.00027051591480191167, "loss": 4.9565, "mean_token_accuracy": 0.21568616181612016, "num_tokens": 113739328.0, "step": 65570 }, { "entropy": 5.850593852996826, "epoch": 5.101925695390002, "grad_norm": 1.4296875, "learning_rate": 0.0002704882047528912, "loss": 4.9345, "mean_token_accuracy": 0.21705861538648605, "num_tokens": 113748592.0, "step": 65575 }, { "entropy": 5.862431573867798, "epoch": 5.10231472476172, "grad_norm": 1.546875, "learning_rate": 0.00027046049477233013, "loss": 4.8294, "mean_token_accuracy": 0.23088606595993041, "num_tokens": 113756779.0, "step": 65580 }, { "entropy": 5.913510704040528, "epoch": 5.1027037541334375, "grad_norm": 1.4609375, "learning_rate": 0.0002704327848606488, "loss": 5.0266, "mean_token_accuracy": 0.21351926326751708, "num_tokens": 113765315.0, "step": 65585 }, { "entropy": 5.861938524246216, "epoch": 5.103092783505154, "grad_norm": 1.4453125, "learning_rate": 0.0002704050750182677, "loss": 4.9177, "mean_token_accuracy": 0.2186524122953415, "num_tokens": 113773589.0, "step": 65590 }, { "entropy": 5.7822352886199955, "epoch": 5.103481812876872, "grad_norm": 1.4453125, "learning_rate": 0.00027037736524560717, "loss": 4.8185, "mean_token_accuracy": 0.23314427584409714, "num_tokens": 113782477.0, "step": 65595 }, { "entropy": 5.829677486419678, "epoch": 5.10387084224859, "grad_norm": 1.53125, "learning_rate": 0.0002703496555430879, "loss": 4.8654, "mean_token_accuracy": 0.21592042446136475, "num_tokens": 113791092.0, "step": 65600 }, { "entropy": 5.888465738296508, "epoch": 5.104259871620307, "grad_norm": 1.4921875, "learning_rate": 0.00027032194591113015, "loss": 4.8704, "mean_token_accuracy": 0.22251616567373275, "num_tokens": 113799770.0, "step": 65605 }, { "entropy": 5.888960170745849, "epoch": 5.104648900992025, "grad_norm": 1.4140625, "learning_rate": 0.0002702942363501544, "loss": 4.9303, "mean_token_accuracy": 0.22633911520242692, "num_tokens": 113809062.0, "step": 65610 }, { "entropy": 5.846899843215942, "epoch": 5.105037930363743, "grad_norm": 1.3984375, "learning_rate": 0.00027026652686058117, "loss": 4.8545, "mean_token_accuracy": 0.2220997393131256, "num_tokens": 113817944.0, "step": 65615 }, { "entropy": 5.8574799537658695, "epoch": 5.1054269597354605, "grad_norm": 1.5078125, "learning_rate": 0.00027023881744283083, "loss": 4.9757, "mean_token_accuracy": 0.21502801775932312, "num_tokens": 113826486.0, "step": 65620 }, { "entropy": 6.026064348220825, "epoch": 5.105815989107177, "grad_norm": 1.4453125, "learning_rate": 0.0002702111080973239, "loss": 5.0719, "mean_token_accuracy": 0.2053128033876419, "num_tokens": 113834982.0, "step": 65625 }, { "entropy": 5.8985813617706295, "epoch": 5.106205018478895, "grad_norm": 1.390625, "learning_rate": 0.0002701833988244808, "loss": 4.9372, "mean_token_accuracy": 0.2196221485733986, "num_tokens": 113844521.0, "step": 65630 }, { "entropy": 5.850252342224121, "epoch": 5.106594047850613, "grad_norm": 1.3984375, "learning_rate": 0.00027015568962472175, "loss": 4.8391, "mean_token_accuracy": 0.22889325320720671, "num_tokens": 113853332.0, "step": 65635 }, { "entropy": 5.840620660781861, "epoch": 5.10698307722233, "grad_norm": 1.4609375, "learning_rate": 0.00027012798049846757, "loss": 4.9916, "mean_token_accuracy": 0.21579495817422867, "num_tokens": 113861959.0, "step": 65640 }, { "entropy": 5.970750236511231, "epoch": 5.107372106594048, "grad_norm": 1.625, "learning_rate": 0.0002701002714461385, "loss": 5.0329, "mean_token_accuracy": 0.21270469427108765, "num_tokens": 113869589.0, "step": 65645 }, { "entropy": 5.880407333374023, "epoch": 5.107761135965766, "grad_norm": 1.375, "learning_rate": 0.0002700725624681551, "loss": 4.9926, "mean_token_accuracy": 0.2121308773756027, "num_tokens": 113878610.0, "step": 65650 }, { "entropy": 5.879530954360962, "epoch": 5.108150165337483, "grad_norm": 1.40625, "learning_rate": 0.00027004485356493763, "loss": 4.8326, "mean_token_accuracy": 0.22617058902978898, "num_tokens": 113887670.0, "step": 65655 }, { "entropy": 5.906849670410156, "epoch": 5.1085391947092, "grad_norm": 1.5859375, "learning_rate": 0.00027001714473690665, "loss": 4.9547, "mean_token_accuracy": 0.21259665936231614, "num_tokens": 113896282.0, "step": 65660 }, { "entropy": 5.900206708908081, "epoch": 5.108928224080918, "grad_norm": 1.3984375, "learning_rate": 0.00026998943598448256, "loss": 4.9498, "mean_token_accuracy": 0.21903114914894103, "num_tokens": 113905144.0, "step": 65665 }, { "entropy": 5.86332516670227, "epoch": 5.109317253452636, "grad_norm": 1.4921875, "learning_rate": 0.0002699617273080858, "loss": 4.9329, "mean_token_accuracy": 0.22082848995923995, "num_tokens": 113913418.0, "step": 65670 }, { "entropy": 5.859861516952515, "epoch": 5.109706282824353, "grad_norm": 1.421875, "learning_rate": 0.0002699340187081368, "loss": 4.9709, "mean_token_accuracy": 0.21316328942775725, "num_tokens": 113923135.0, "step": 65675 }, { "entropy": 5.9240306377410885, "epoch": 5.110095312196071, "grad_norm": 1.59375, "learning_rate": 0.000269906310185056, "loss": 4.9335, "mean_token_accuracy": 0.22368897944688798, "num_tokens": 113932015.0, "step": 65680 }, { "entropy": 5.974324083328247, "epoch": 5.110484341567789, "grad_norm": 1.4296875, "learning_rate": 0.00026987860173926387, "loss": 5.0292, "mean_token_accuracy": 0.20854596197605133, "num_tokens": 113940273.0, "step": 65685 }, { "entropy": 5.938892078399658, "epoch": 5.1108733709395056, "grad_norm": 1.4609375, "learning_rate": 0.00026985089337118077, "loss": 4.9177, "mean_token_accuracy": 0.21817571818828582, "num_tokens": 113948607.0, "step": 65690 }, { "entropy": 5.858677864074707, "epoch": 5.111262400311223, "grad_norm": 1.4609375, "learning_rate": 0.00026982318508122724, "loss": 4.8823, "mean_token_accuracy": 0.22024273574352266, "num_tokens": 113956957.0, "step": 65695 }, { "entropy": 5.916488552093506, "epoch": 5.111651429682941, "grad_norm": 1.4609375, "learning_rate": 0.0002697954768698235, "loss": 5.006, "mean_token_accuracy": 0.20754637569189072, "num_tokens": 113966320.0, "step": 65700 }, { "entropy": 5.871480941772461, "epoch": 5.112040459054659, "grad_norm": 1.453125, "learning_rate": 0.00026976776873739017, "loss": 4.9054, "mean_token_accuracy": 0.2208838254213333, "num_tokens": 113974719.0, "step": 65705 }, { "entropy": 5.919399404525757, "epoch": 5.112429488426376, "grad_norm": 1.484375, "learning_rate": 0.0002697400606843477, "loss": 4.9421, "mean_token_accuracy": 0.21417030394077302, "num_tokens": 113983224.0, "step": 65710 }, { "entropy": 5.905768394470215, "epoch": 5.112818517798094, "grad_norm": 1.390625, "learning_rate": 0.00026971235271111636, "loss": 4.8871, "mean_token_accuracy": 0.21973634660243987, "num_tokens": 113992209.0, "step": 65715 }, { "entropy": 5.858517599105835, "epoch": 5.113207547169812, "grad_norm": 1.5546875, "learning_rate": 0.00026968464481811667, "loss": 4.8549, "mean_token_accuracy": 0.22360142916440964, "num_tokens": 114000896.0, "step": 65720 }, { "entropy": 5.879826021194458, "epoch": 5.1135965765415285, "grad_norm": 1.3984375, "learning_rate": 0.00026965693700576904, "loss": 4.8997, "mean_token_accuracy": 0.22303366959095, "num_tokens": 114010015.0, "step": 65725 }, { "entropy": 5.818126106262207, "epoch": 5.113985605913246, "grad_norm": 1.421875, "learning_rate": 0.00026962922927449394, "loss": 4.8123, "mean_token_accuracy": 0.22186270505189895, "num_tokens": 114018229.0, "step": 65730 }, { "entropy": 5.8122330665588375, "epoch": 5.114374635284964, "grad_norm": 1.4140625, "learning_rate": 0.0002696015216247117, "loss": 4.8603, "mean_token_accuracy": 0.22155270725488663, "num_tokens": 114027039.0, "step": 65735 }, { "entropy": 5.873907423019409, "epoch": 5.114763664656682, "grad_norm": 1.53125, "learning_rate": 0.0002695738140568427, "loss": 5.0331, "mean_token_accuracy": 0.20710396766662598, "num_tokens": 114035137.0, "step": 65740 }, { "entropy": 5.906149530410767, "epoch": 5.115152694028399, "grad_norm": 1.5078125, "learning_rate": 0.0002695461065713075, "loss": 4.9145, "mean_token_accuracy": 0.2211265593767166, "num_tokens": 114044105.0, "step": 65745 }, { "entropy": 5.868191957473755, "epoch": 5.115541723400117, "grad_norm": 1.5546875, "learning_rate": 0.00026951839916852647, "loss": 4.9171, "mean_token_accuracy": 0.22507392466068268, "num_tokens": 114052535.0, "step": 65750 }, { "entropy": 5.915162992477417, "epoch": 5.115930752771834, "grad_norm": 1.5859375, "learning_rate": 0.00026949069184892, "loss": 4.9496, "mean_token_accuracy": 0.22042029350996017, "num_tokens": 114060620.0, "step": 65755 }, { "entropy": 5.860546731948853, "epoch": 5.1163197821435515, "grad_norm": 1.4765625, "learning_rate": 0.00026946298461290845, "loss": 4.8895, "mean_token_accuracy": 0.2275201916694641, "num_tokens": 114070748.0, "step": 65760 }, { "entropy": 5.945041656494141, "epoch": 5.116708811515269, "grad_norm": 1.5, "learning_rate": 0.0002694352774609123, "loss": 4.9367, "mean_token_accuracy": 0.21616561561822892, "num_tokens": 114079525.0, "step": 65765 }, { "entropy": 5.893023347854614, "epoch": 5.117097840886987, "grad_norm": 1.4296875, "learning_rate": 0.000269407570393352, "loss": 4.8906, "mean_token_accuracy": 0.21943559497594833, "num_tokens": 114088074.0, "step": 65770 }, { "entropy": 5.946559143066406, "epoch": 5.117486870258705, "grad_norm": 1.3515625, "learning_rate": 0.000269379863410648, "loss": 4.9313, "mean_token_accuracy": 0.2176995947957039, "num_tokens": 114097203.0, "step": 65775 }, { "entropy": 5.814003896713257, "epoch": 5.117875899630422, "grad_norm": 1.5546875, "learning_rate": 0.0002693521565132205, "loss": 4.8931, "mean_token_accuracy": 0.22075533866882324, "num_tokens": 114105123.0, "step": 65780 }, { "entropy": 5.922133541107177, "epoch": 5.11826492900214, "grad_norm": 1.4609375, "learning_rate": 0.00026932444970149006, "loss": 4.9631, "mean_token_accuracy": 0.22361107915639877, "num_tokens": 114114656.0, "step": 65785 }, { "entropy": 5.908982372283935, "epoch": 5.118653958373857, "grad_norm": 1.4140625, "learning_rate": 0.0002692967429758771, "loss": 4.9195, "mean_token_accuracy": 0.22133497297763824, "num_tokens": 114122810.0, "step": 65790 }, { "entropy": 5.914796638488769, "epoch": 5.1190429877455745, "grad_norm": 1.4453125, "learning_rate": 0.00026926903633680193, "loss": 4.9345, "mean_token_accuracy": 0.22167709171772004, "num_tokens": 114131809.0, "step": 65795 }, { "entropy": 5.870538854598999, "epoch": 5.119432017117292, "grad_norm": 1.4609375, "learning_rate": 0.00026924132978468505, "loss": 4.9401, "mean_token_accuracy": 0.21987212151288987, "num_tokens": 114139534.0, "step": 65800 }, { "entropy": 5.883299255371094, "epoch": 5.11982104648901, "grad_norm": 1.4453125, "learning_rate": 0.00026921362331994684, "loss": 4.9592, "mean_token_accuracy": 0.22485719472169877, "num_tokens": 114148248.0, "step": 65805 }, { "entropy": 5.893091154098511, "epoch": 5.120210075860728, "grad_norm": 1.421875, "learning_rate": 0.00026918591694300776, "loss": 4.9438, "mean_token_accuracy": 0.22348200380802155, "num_tokens": 114157130.0, "step": 65810 }, { "entropy": 5.82591986656189, "epoch": 5.120599105232445, "grad_norm": 1.5, "learning_rate": 0.00026915821065428804, "loss": 4.8206, "mean_token_accuracy": 0.22988693416118622, "num_tokens": 114165544.0, "step": 65815 }, { "entropy": 5.949701166152954, "epoch": 5.120988134604163, "grad_norm": 1.484375, "learning_rate": 0.0002691305044542082, "loss": 5.0223, "mean_token_accuracy": 0.20471552312374114, "num_tokens": 114173829.0, "step": 65820 }, { "entropy": 5.850264930725098, "epoch": 5.12137716397588, "grad_norm": 1.421875, "learning_rate": 0.00026910279834318855, "loss": 4.8699, "mean_token_accuracy": 0.21821389645338057, "num_tokens": 114182380.0, "step": 65825 }, { "entropy": 5.9048666000366214, "epoch": 5.1217661933475975, "grad_norm": 1.40625, "learning_rate": 0.00026907509232164964, "loss": 5.001, "mean_token_accuracy": 0.20319158732891082, "num_tokens": 114191071.0, "step": 65830 }, { "entropy": 5.865254497528076, "epoch": 5.122155222719315, "grad_norm": 1.4453125, "learning_rate": 0.00026904738639001163, "loss": 4.8976, "mean_token_accuracy": 0.21703410297632217, "num_tokens": 114199476.0, "step": 65835 }, { "entropy": 5.809226369857788, "epoch": 5.122544252091033, "grad_norm": 1.3671875, "learning_rate": 0.0002690196805486952, "loss": 4.8769, "mean_token_accuracy": 0.22425133734941483, "num_tokens": 114208373.0, "step": 65840 }, { "entropy": 5.831390810012818, "epoch": 5.122933281462751, "grad_norm": 1.5234375, "learning_rate": 0.00026899197479812053, "loss": 4.947, "mean_token_accuracy": 0.21973471641540526, "num_tokens": 114216649.0, "step": 65845 }, { "entropy": 5.790037441253662, "epoch": 5.123322310834468, "grad_norm": 1.4140625, "learning_rate": 0.0002689642691387081, "loss": 4.8694, "mean_token_accuracy": 0.22262126952409744, "num_tokens": 114225431.0, "step": 65850 }, { "entropy": 5.845479679107666, "epoch": 5.123711340206185, "grad_norm": 1.578125, "learning_rate": 0.00026893656357087833, "loss": 4.8607, "mean_token_accuracy": 0.22621013671159745, "num_tokens": 114233857.0, "step": 65855 }, { "entropy": 5.849991273880005, "epoch": 5.124100369577903, "grad_norm": 1.3671875, "learning_rate": 0.0002689088580950515, "loss": 4.9209, "mean_token_accuracy": 0.21286094337701797, "num_tokens": 114242741.0, "step": 65860 }, { "entropy": 5.844541025161743, "epoch": 5.1244893989496205, "grad_norm": 1.5234375, "learning_rate": 0.000268881152711648, "loss": 4.8122, "mean_token_accuracy": 0.23468927592039107, "num_tokens": 114250666.0, "step": 65865 }, { "entropy": 5.858936834335327, "epoch": 5.124878428321338, "grad_norm": 1.4765625, "learning_rate": 0.0002688534474210884, "loss": 4.9464, "mean_token_accuracy": 0.20674145966768265, "num_tokens": 114258870.0, "step": 65870 }, { "entropy": 5.824692153930664, "epoch": 5.125267457693056, "grad_norm": 1.3203125, "learning_rate": 0.00026882574222379283, "loss": 4.8987, "mean_token_accuracy": 0.22415810823440552, "num_tokens": 114268700.0, "step": 65875 }, { "entropy": 5.9452191352844235, "epoch": 5.125656487064774, "grad_norm": 1.453125, "learning_rate": 0.00026879803712018187, "loss": 4.9931, "mean_token_accuracy": 0.2125726342201233, "num_tokens": 114277482.0, "step": 65880 }, { "entropy": 5.915705347061158, "epoch": 5.126045516436491, "grad_norm": 1.65625, "learning_rate": 0.0002687703321106758, "loss": 4.9387, "mean_token_accuracy": 0.22471041232347488, "num_tokens": 114286182.0, "step": 65885 }, { "entropy": 5.926186180114746, "epoch": 5.126434545808208, "grad_norm": 1.515625, "learning_rate": 0.0002687426271956951, "loss": 5.0472, "mean_token_accuracy": 0.2176584228873253, "num_tokens": 114295556.0, "step": 65890 }, { "entropy": 5.84512734413147, "epoch": 5.126823575179926, "grad_norm": 1.4296875, "learning_rate": 0.00026871492237566, "loss": 4.7851, "mean_token_accuracy": 0.21994955092668533, "num_tokens": 114304342.0, "step": 65895 }, { "entropy": 5.876171064376831, "epoch": 5.1272126045516435, "grad_norm": 1.5, "learning_rate": 0.00026868721765099086, "loss": 4.8394, "mean_token_accuracy": 0.23264408111572266, "num_tokens": 114312653.0, "step": 65900 }, { "entropy": 5.771732521057129, "epoch": 5.127601633923361, "grad_norm": 1.4296875, "learning_rate": 0.0002686595130221082, "loss": 4.8363, "mean_token_accuracy": 0.22190264165401458, "num_tokens": 114321081.0, "step": 65905 }, { "entropy": 5.804191541671753, "epoch": 5.127990663295079, "grad_norm": 1.46875, "learning_rate": 0.00026863180848943244, "loss": 4.919, "mean_token_accuracy": 0.21626996397972106, "num_tokens": 114330208.0, "step": 65910 }, { "entropy": 5.849740982055664, "epoch": 5.128379692666797, "grad_norm": 1.46875, "learning_rate": 0.0002686041040533838, "loss": 4.8613, "mean_token_accuracy": 0.23210158199071884, "num_tokens": 114338201.0, "step": 65915 }, { "entropy": 5.836041212081909, "epoch": 5.128768722038514, "grad_norm": 1.4140625, "learning_rate": 0.0002685763997143827, "loss": 4.8449, "mean_token_accuracy": 0.22335275262594223, "num_tokens": 114346877.0, "step": 65920 }, { "entropy": 5.829005336761474, "epoch": 5.129157751410231, "grad_norm": 1.4921875, "learning_rate": 0.00026854869547284947, "loss": 4.8758, "mean_token_accuracy": 0.22081327438354492, "num_tokens": 114355506.0, "step": 65925 }, { "entropy": 5.882661247253418, "epoch": 5.129546780781949, "grad_norm": 1.5078125, "learning_rate": 0.00026852099132920455, "loss": 4.9678, "mean_token_accuracy": 0.21788639277219773, "num_tokens": 114364372.0, "step": 65930 }, { "entropy": 5.92300271987915, "epoch": 5.1299358101536665, "grad_norm": 1.5078125, "learning_rate": 0.0002684932872838683, "loss": 4.9937, "mean_token_accuracy": 0.2142435386776924, "num_tokens": 114372568.0, "step": 65935 }, { "entropy": 5.948053359985352, "epoch": 5.130324839525384, "grad_norm": 1.3828125, "learning_rate": 0.000268465583337261, "loss": 5.0442, "mean_token_accuracy": 0.20777359753847122, "num_tokens": 114381388.0, "step": 65940 }, { "entropy": 5.943252277374268, "epoch": 5.130713868897102, "grad_norm": 1.328125, "learning_rate": 0.0002684378794898031, "loss": 4.9626, "mean_token_accuracy": 0.21952307522296904, "num_tokens": 114390209.0, "step": 65945 }, { "entropy": 5.88835563659668, "epoch": 5.13110289826882, "grad_norm": 1.4765625, "learning_rate": 0.00026841017574191496, "loss": 4.8699, "mean_token_accuracy": 0.22517536580562592, "num_tokens": 114398860.0, "step": 65950 }, { "entropy": 5.873006296157837, "epoch": 5.131491927640537, "grad_norm": 1.421875, "learning_rate": 0.0002683824720940168, "loss": 4.8983, "mean_token_accuracy": 0.21143682599067687, "num_tokens": 114407553.0, "step": 65955 }, { "entropy": 5.877561950683594, "epoch": 5.131880957012254, "grad_norm": 1.40625, "learning_rate": 0.00026835476854652926, "loss": 4.9093, "mean_token_accuracy": 0.2240485891699791, "num_tokens": 114416807.0, "step": 65960 }, { "entropy": 5.847120475769043, "epoch": 5.132269986383972, "grad_norm": 1.5, "learning_rate": 0.0002683270650998724, "loss": 4.9369, "mean_token_accuracy": 0.21624185740947724, "num_tokens": 114425250.0, "step": 65965 }, { "entropy": 5.850070858001709, "epoch": 5.1326590157556895, "grad_norm": 1.4296875, "learning_rate": 0.0002682993617544667, "loss": 4.9434, "mean_token_accuracy": 0.20776990056037903, "num_tokens": 114434530.0, "step": 65970 }, { "entropy": 5.9022375583648685, "epoch": 5.133048045127407, "grad_norm": 1.4921875, "learning_rate": 0.0002682716585107326, "loss": 4.9269, "mean_token_accuracy": 0.21379211246967317, "num_tokens": 114442964.0, "step": 65975 }, { "entropy": 5.912150812149048, "epoch": 5.133437074499125, "grad_norm": 1.34375, "learning_rate": 0.00026824395536909036, "loss": 4.9723, "mean_token_accuracy": 0.21660968661308289, "num_tokens": 114452381.0, "step": 65980 }, { "entropy": 5.813210153579712, "epoch": 5.133826103870843, "grad_norm": 1.5, "learning_rate": 0.0002682162523299603, "loss": 4.87, "mean_token_accuracy": 0.22334378957748413, "num_tokens": 114460590.0, "step": 65985 }, { "entropy": 5.921731805801391, "epoch": 5.134215133242559, "grad_norm": 1.5078125, "learning_rate": 0.00026818854939376284, "loss": 4.9427, "mean_token_accuracy": 0.21537007987499238, "num_tokens": 114469616.0, "step": 65990 }, { "entropy": 5.89310393333435, "epoch": 5.134604162614277, "grad_norm": 1.359375, "learning_rate": 0.00026816084656091835, "loss": 4.8743, "mean_token_accuracy": 0.22286620438098909, "num_tokens": 114478200.0, "step": 65995 }, { "entropy": 5.873892402648925, "epoch": 5.134993191985995, "grad_norm": 1.453125, "learning_rate": 0.00026813314383184714, "loss": 4.9185, "mean_token_accuracy": 0.22126066237688063, "num_tokens": 114486389.0, "step": 66000 }, { "epoch": 5.134993191985995, "eval_entropy": 5.563581949937102, "eval_loss": 5.036537170410156, "eval_mean_token_accuracy": 0.2218062281665949, "eval_num_tokens": 114486389.0, "eval_runtime": 21.8285, "eval_samples_per_second": 1903.842, "eval_steps_per_second": 237.992, "step": 66000 }, { "entropy": 5.872282600402832, "epoch": 5.1353822213577125, "grad_norm": 1.484375, "learning_rate": 0.00026810544120696943, "loss": 4.9514, "mean_token_accuracy": 0.2182406008243561, "num_tokens": 114495338.0, "step": 66005 }, { "entropy": 5.917290544509887, "epoch": 5.13577125072943, "grad_norm": 1.4609375, "learning_rate": 0.00026807773868670575, "loss": 4.9757, "mean_token_accuracy": 0.21585901379585265, "num_tokens": 114503744.0, "step": 66010 }, { "entropy": 5.911306953430175, "epoch": 5.136160280101148, "grad_norm": 1.3984375, "learning_rate": 0.0002680500362714764, "loss": 4.9421, "mean_token_accuracy": 0.21984894275665284, "num_tokens": 114512991.0, "step": 66015 }, { "entropy": 5.9440789222717285, "epoch": 5.136549309472866, "grad_norm": 1.6640625, "learning_rate": 0.00026802233396170164, "loss": 5.0021, "mean_token_accuracy": 0.21140967160463334, "num_tokens": 114522067.0, "step": 66020 }, { "entropy": 5.911148357391357, "epoch": 5.136938338844582, "grad_norm": 1.484375, "learning_rate": 0.0002679946317578018, "loss": 4.9636, "mean_token_accuracy": 0.22086064517498016, "num_tokens": 114530569.0, "step": 66025 }, { "entropy": 5.854669666290283, "epoch": 5.1373273682163, "grad_norm": 1.515625, "learning_rate": 0.0002679669296601973, "loss": 4.7929, "mean_token_accuracy": 0.2238999590277672, "num_tokens": 114538716.0, "step": 66030 }, { "entropy": 5.813155794143677, "epoch": 5.137716397588018, "grad_norm": 1.453125, "learning_rate": 0.00026793922766930845, "loss": 4.799, "mean_token_accuracy": 0.22434172183275222, "num_tokens": 114547572.0, "step": 66035 }, { "entropy": 5.823918247222901, "epoch": 5.1381054269597355, "grad_norm": 1.453125, "learning_rate": 0.00026791152578555563, "loss": 4.882, "mean_token_accuracy": 0.21725434064865112, "num_tokens": 114555502.0, "step": 66040 }, { "entropy": 5.836768341064453, "epoch": 5.138494456331453, "grad_norm": 1.4609375, "learning_rate": 0.00026788382400935913, "loss": 4.9542, "mean_token_accuracy": 0.21897660195827484, "num_tokens": 114564190.0, "step": 66045 }, { "entropy": 5.910693025588989, "epoch": 5.138883485703171, "grad_norm": 1.375, "learning_rate": 0.0002678561223411392, "loss": 4.9582, "mean_token_accuracy": 0.22513029128313064, "num_tokens": 114573988.0, "step": 66050 }, { "entropy": 5.872666835784912, "epoch": 5.139272515074889, "grad_norm": 1.4140625, "learning_rate": 0.0002678284207813163, "loss": 4.8198, "mean_token_accuracy": 0.22817371189594268, "num_tokens": 114583155.0, "step": 66055 }, { "entropy": 5.853002738952637, "epoch": 5.139661544446605, "grad_norm": 1.4765625, "learning_rate": 0.0002678007193303107, "loss": 4.889, "mean_token_accuracy": 0.227026005089283, "num_tokens": 114591491.0, "step": 66060 }, { "entropy": 5.823988723754883, "epoch": 5.140050573818323, "grad_norm": 1.5546875, "learning_rate": 0.0002677730179885427, "loss": 4.8872, "mean_token_accuracy": 0.2195958226919174, "num_tokens": 114600275.0, "step": 66065 }, { "entropy": 5.885872840881348, "epoch": 5.140439603190041, "grad_norm": 1.4765625, "learning_rate": 0.00026774531675643267, "loss": 4.9979, "mean_token_accuracy": 0.21493610441684724, "num_tokens": 114608999.0, "step": 66070 }, { "entropy": 5.844340896606445, "epoch": 5.1408286325617585, "grad_norm": 1.375, "learning_rate": 0.0002677176156344009, "loss": 4.7524, "mean_token_accuracy": 0.23454027771949768, "num_tokens": 114617750.0, "step": 66075 }, { "entropy": 5.875127601623535, "epoch": 5.141217661933476, "grad_norm": 1.5390625, "learning_rate": 0.0002676899146228678, "loss": 4.9197, "mean_token_accuracy": 0.2248332306742668, "num_tokens": 114626610.0, "step": 66080 }, { "entropy": 5.906566095352173, "epoch": 5.141606691305194, "grad_norm": 1.484375, "learning_rate": 0.00026766221372225354, "loss": 4.9563, "mean_token_accuracy": 0.215479576587677, "num_tokens": 114635199.0, "step": 66085 }, { "entropy": 5.884940814971924, "epoch": 5.141995720676911, "grad_norm": 1.5078125, "learning_rate": 0.0002676345129329785, "loss": 4.9157, "mean_token_accuracy": 0.21726604104042052, "num_tokens": 114644104.0, "step": 66090 }, { "entropy": 5.850084447860718, "epoch": 5.142384750048628, "grad_norm": 1.3828125, "learning_rate": 0.00026760681225546296, "loss": 4.9408, "mean_token_accuracy": 0.2195482909679413, "num_tokens": 114653562.0, "step": 66095 }, { "entropy": 5.85883731842041, "epoch": 5.142773779420346, "grad_norm": 1.4296875, "learning_rate": 0.0002675791116901273, "loss": 4.9138, "mean_token_accuracy": 0.22434998601675032, "num_tokens": 114661888.0, "step": 66100 }, { "entropy": 5.8832379341125485, "epoch": 5.143162808792064, "grad_norm": 1.4921875, "learning_rate": 0.0002675514112373918, "loss": 4.9947, "mean_token_accuracy": 0.21074043065309525, "num_tokens": 114670942.0, "step": 66105 }, { "entropy": 5.874914073944092, "epoch": 5.1435518381637815, "grad_norm": 1.3671875, "learning_rate": 0.00026752371089767686, "loss": 4.9422, "mean_token_accuracy": 0.22310996055603027, "num_tokens": 114679570.0, "step": 66110 }, { "entropy": 5.921423292160034, "epoch": 5.143940867535499, "grad_norm": 1.5234375, "learning_rate": 0.0002674960106714026, "loss": 5.0331, "mean_token_accuracy": 0.2123573899269104, "num_tokens": 114687833.0, "step": 66115 }, { "entropy": 5.862590599060058, "epoch": 5.144329896907217, "grad_norm": 1.546875, "learning_rate": 0.00026746831055898953, "loss": 4.9011, "mean_token_accuracy": 0.22230245769023896, "num_tokens": 114695534.0, "step": 66120 }, { "entropy": 5.891458988189697, "epoch": 5.144718926278934, "grad_norm": 1.359375, "learning_rate": 0.0002674406105608578, "loss": 4.8409, "mean_token_accuracy": 0.21625454127788543, "num_tokens": 114704443.0, "step": 66125 }, { "entropy": 5.828302574157715, "epoch": 5.145107955650651, "grad_norm": 1.453125, "learning_rate": 0.0002674129106774278, "loss": 4.8642, "mean_token_accuracy": 0.21996913999319076, "num_tokens": 114713103.0, "step": 66130 }, { "entropy": 5.884413623809815, "epoch": 5.145496985022369, "grad_norm": 1.546875, "learning_rate": 0.00026738521090911984, "loss": 4.914, "mean_token_accuracy": 0.21563147604465485, "num_tokens": 114721222.0, "step": 66135 }, { "entropy": 5.901731824874878, "epoch": 5.145886014394087, "grad_norm": 1.390625, "learning_rate": 0.0002673575112563541, "loss": 5.0239, "mean_token_accuracy": 0.20807105749845506, "num_tokens": 114730499.0, "step": 66140 }, { "entropy": 5.885125255584716, "epoch": 5.1462750437658045, "grad_norm": 1.453125, "learning_rate": 0.000267329811719551, "loss": 4.8932, "mean_token_accuracy": 0.22027895897626876, "num_tokens": 114739536.0, "step": 66145 }, { "entropy": 5.92445936203003, "epoch": 5.146664073137522, "grad_norm": 1.5078125, "learning_rate": 0.0002673021122991308, "loss": 4.9725, "mean_token_accuracy": 0.21122844368219376, "num_tokens": 114748062.0, "step": 66150 }, { "entropy": 5.966323804855347, "epoch": 5.14705310250924, "grad_norm": 1.578125, "learning_rate": 0.0002672744129955138, "loss": 4.9636, "mean_token_accuracy": 0.22188374102115632, "num_tokens": 114756315.0, "step": 66155 }, { "entropy": 5.84259443283081, "epoch": 5.147442131880957, "grad_norm": 1.46875, "learning_rate": 0.0002672467138091204, "loss": 4.8078, "mean_token_accuracy": 0.2332136243581772, "num_tokens": 114764714.0, "step": 66160 }, { "entropy": 5.805589199066162, "epoch": 5.147831161252674, "grad_norm": 1.5078125, "learning_rate": 0.0002672190147403705, "loss": 4.8763, "mean_token_accuracy": 0.2252497136592865, "num_tokens": 114773357.0, "step": 66165 }, { "entropy": 5.87189040184021, "epoch": 5.148220190624392, "grad_norm": 1.4765625, "learning_rate": 0.0002671913157896849, "loss": 4.9488, "mean_token_accuracy": 0.21112050116062164, "num_tokens": 114782100.0, "step": 66170 }, { "entropy": 5.950364875793457, "epoch": 5.14860921999611, "grad_norm": 1.3828125, "learning_rate": 0.00026716361695748353, "loss": 5.0507, "mean_token_accuracy": 0.20136291533708572, "num_tokens": 114790827.0, "step": 66175 }, { "entropy": 5.870655298233032, "epoch": 5.1489982493678275, "grad_norm": 1.5859375, "learning_rate": 0.0002671359182441868, "loss": 4.9289, "mean_token_accuracy": 0.22124303579330445, "num_tokens": 114799365.0, "step": 66180 }, { "entropy": 5.86721396446228, "epoch": 5.149387278739545, "grad_norm": 1.359375, "learning_rate": 0.00026710821965021507, "loss": 4.9072, "mean_token_accuracy": 0.2175467163324356, "num_tokens": 114807891.0, "step": 66185 }, { "entropy": 5.884500408172608, "epoch": 5.149776308111262, "grad_norm": 1.421875, "learning_rate": 0.0002670805211759886, "loss": 4.8817, "mean_token_accuracy": 0.22707600444555281, "num_tokens": 114816537.0, "step": 66190 }, { "entropy": 5.886652660369873, "epoch": 5.15016533748298, "grad_norm": 1.515625, "learning_rate": 0.0002670528228219275, "loss": 4.8697, "mean_token_accuracy": 0.22133893817663192, "num_tokens": 114824886.0, "step": 66195 }, { "entropy": 5.883154344558716, "epoch": 5.150554366854697, "grad_norm": 1.4609375, "learning_rate": 0.00026702512458845224, "loss": 4.875, "mean_token_accuracy": 0.22279927730560303, "num_tokens": 114833626.0, "step": 66200 }, { "entropy": 5.921316385269165, "epoch": 5.150943396226415, "grad_norm": 1.4765625, "learning_rate": 0.00026699742647598294, "loss": 4.9853, "mean_token_accuracy": 0.22070241272449492, "num_tokens": 114841678.0, "step": 66205 }, { "entropy": 5.980746746063232, "epoch": 5.151332425598133, "grad_norm": 1.5, "learning_rate": 0.00026696972848494005, "loss": 5.0855, "mean_token_accuracy": 0.20526908189058304, "num_tokens": 114850948.0, "step": 66210 }, { "entropy": 5.925118637084961, "epoch": 5.1517214549698505, "grad_norm": 1.4375, "learning_rate": 0.00026694203061574366, "loss": 4.9373, "mean_token_accuracy": 0.21908355504274368, "num_tokens": 114859643.0, "step": 66215 }, { "entropy": 5.915058422088623, "epoch": 5.152110484341568, "grad_norm": 1.3671875, "learning_rate": 0.00026691433286881415, "loss": 4.9087, "mean_token_accuracy": 0.21707459688186645, "num_tokens": 114868276.0, "step": 66220 }, { "entropy": 5.949935054779052, "epoch": 5.152499513713285, "grad_norm": 1.5078125, "learning_rate": 0.0002668866352445718, "loss": 4.915, "mean_token_accuracy": 0.22504731863737107, "num_tokens": 114876836.0, "step": 66225 }, { "entropy": 5.801215934753418, "epoch": 5.152888543085003, "grad_norm": 1.390625, "learning_rate": 0.0002668589377434368, "loss": 4.7947, "mean_token_accuracy": 0.22922674864530562, "num_tokens": 114885736.0, "step": 66230 }, { "entropy": 5.893365859985352, "epoch": 5.15327757245672, "grad_norm": 1.4921875, "learning_rate": 0.0002668312403658295, "loss": 4.8705, "mean_token_accuracy": 0.22239357382059097, "num_tokens": 114894040.0, "step": 66235 }, { "entropy": 5.842454433441162, "epoch": 5.153666601828438, "grad_norm": 1.359375, "learning_rate": 0.00026680354311217006, "loss": 4.8665, "mean_token_accuracy": 0.226260307431221, "num_tokens": 114903338.0, "step": 66240 }, { "entropy": 5.78943362236023, "epoch": 5.154055631200156, "grad_norm": 1.53125, "learning_rate": 0.00026677584598287893, "loss": 4.8022, "mean_token_accuracy": 0.2276190534234047, "num_tokens": 114912195.0, "step": 66245 }, { "entropy": 5.866451263427734, "epoch": 5.1544446605718734, "grad_norm": 1.5078125, "learning_rate": 0.00026674814897837616, "loss": 4.8649, "mean_token_accuracy": 0.2283419266343117, "num_tokens": 114920409.0, "step": 66250 }, { "entropy": 5.883718204498291, "epoch": 5.154833689943591, "grad_norm": 1.5625, "learning_rate": 0.00026672045209908215, "loss": 4.9506, "mean_token_accuracy": 0.2126406878232956, "num_tokens": 114929927.0, "step": 66255 }, { "entropy": 5.926264381408691, "epoch": 5.155222719315308, "grad_norm": 1.421875, "learning_rate": 0.00026669275534541703, "loss": 4.9597, "mean_token_accuracy": 0.22446409314870835, "num_tokens": 114938581.0, "step": 66260 }, { "entropy": 5.866660070419312, "epoch": 5.155611748687026, "grad_norm": 1.5390625, "learning_rate": 0.00026666505871780115, "loss": 4.8768, "mean_token_accuracy": 0.2292337104678154, "num_tokens": 114946905.0, "step": 66265 }, { "entropy": 5.8527459621429445, "epoch": 5.156000778058743, "grad_norm": 1.453125, "learning_rate": 0.0002666373622166548, "loss": 4.9222, "mean_token_accuracy": 0.22785453498363495, "num_tokens": 114955846.0, "step": 66270 }, { "entropy": 5.921048259735107, "epoch": 5.156389807430461, "grad_norm": 1.421875, "learning_rate": 0.00026660966584239815, "loss": 5.0243, "mean_token_accuracy": 0.20934616029262543, "num_tokens": 114965736.0, "step": 66275 }, { "entropy": 5.964421272277832, "epoch": 5.156778836802179, "grad_norm": 1.3515625, "learning_rate": 0.00026658196959545145, "loss": 5.0095, "mean_token_accuracy": 0.21834589242935182, "num_tokens": 114974026.0, "step": 66280 }, { "entropy": 5.93393874168396, "epoch": 5.157167866173896, "grad_norm": 1.3828125, "learning_rate": 0.00026655427347623494, "loss": 4.8853, "mean_token_accuracy": 0.22582802325487136, "num_tokens": 114982961.0, "step": 66285 }, { "entropy": 5.895879077911377, "epoch": 5.157556895545614, "grad_norm": 1.3984375, "learning_rate": 0.0002665265774851689, "loss": 4.9548, "mean_token_accuracy": 0.21263739913702012, "num_tokens": 114991634.0, "step": 66290 }, { "entropy": 5.893559885025025, "epoch": 5.157945924917331, "grad_norm": 1.4296875, "learning_rate": 0.00026649888162267357, "loss": 4.9161, "mean_token_accuracy": 0.2133638694882393, "num_tokens": 115000730.0, "step": 66295 }, { "entropy": 5.892694139480591, "epoch": 5.158334954289049, "grad_norm": 1.40625, "learning_rate": 0.0002664711858891691, "loss": 4.9081, "mean_token_accuracy": 0.21855069547891617, "num_tokens": 115009782.0, "step": 66300 }, { "entropy": 5.8914374828338625, "epoch": 5.158723983660766, "grad_norm": 1.421875, "learning_rate": 0.0002664434902850759, "loss": 4.8997, "mean_token_accuracy": 0.2207781195640564, "num_tokens": 115018650.0, "step": 66305 }, { "entropy": 5.858518028259278, "epoch": 5.159113013032484, "grad_norm": 1.3671875, "learning_rate": 0.00026641579481081405, "loss": 4.8212, "mean_token_accuracy": 0.23053707778453827, "num_tokens": 115026971.0, "step": 66310 }, { "entropy": 5.841846656799317, "epoch": 5.159502042404202, "grad_norm": 1.5078125, "learning_rate": 0.00026638809946680393, "loss": 4.883, "mean_token_accuracy": 0.22177408039569854, "num_tokens": 115034833.0, "step": 66315 }, { "entropy": 5.877322673797607, "epoch": 5.159891071775919, "grad_norm": 1.4765625, "learning_rate": 0.00026636040425346565, "loss": 4.9601, "mean_token_accuracy": 0.21605104207992554, "num_tokens": 115043574.0, "step": 66320 }, { "entropy": 5.8099061965942385, "epoch": 5.160280101147636, "grad_norm": 1.5078125, "learning_rate": 0.0002663327091712195, "loss": 4.767, "mean_token_accuracy": 0.2256719022989273, "num_tokens": 115051970.0, "step": 66325 }, { "entropy": 5.876535367965698, "epoch": 5.160669130519354, "grad_norm": 1.359375, "learning_rate": 0.0002663050142204856, "loss": 4.9642, "mean_token_accuracy": 0.21116408258676528, "num_tokens": 115060758.0, "step": 66330 }, { "entropy": 5.999392652511597, "epoch": 5.161058159891072, "grad_norm": 1.6640625, "learning_rate": 0.00026627731940168445, "loss": 5.0149, "mean_token_accuracy": 0.20914485305547714, "num_tokens": 115068632.0, "step": 66335 }, { "entropy": 6.010627126693725, "epoch": 5.161447189262789, "grad_norm": 1.4140625, "learning_rate": 0.00026624962471523595, "loss": 5.0311, "mean_token_accuracy": 0.2086430236697197, "num_tokens": 115077608.0, "step": 66340 }, { "entropy": 5.917259645462036, "epoch": 5.161836218634507, "grad_norm": 1.484375, "learning_rate": 0.00026622193016156054, "loss": 4.9762, "mean_token_accuracy": 0.2151756078004837, "num_tokens": 115085900.0, "step": 66345 }, { "entropy": 5.941770267486572, "epoch": 5.162225248006225, "grad_norm": 1.5390625, "learning_rate": 0.0002661942357410784, "loss": 4.9682, "mean_token_accuracy": 0.21971530318260193, "num_tokens": 115094903.0, "step": 66350 }, { "entropy": 5.878421783447266, "epoch": 5.162614277377942, "grad_norm": 1.3984375, "learning_rate": 0.0002661665414542097, "loss": 4.8427, "mean_token_accuracy": 0.2301975205540657, "num_tokens": 115103915.0, "step": 66355 }, { "entropy": 5.883051109313965, "epoch": 5.163003306749659, "grad_norm": 1.4375, "learning_rate": 0.00026613884730137454, "loss": 4.8956, "mean_token_accuracy": 0.21756810694932938, "num_tokens": 115112322.0, "step": 66360 }, { "entropy": 5.949410486221313, "epoch": 5.163392336121377, "grad_norm": 1.3671875, "learning_rate": 0.0002661111532829933, "loss": 5.0287, "mean_token_accuracy": 0.21123673766851425, "num_tokens": 115121620.0, "step": 66365 }, { "entropy": 5.911853551864624, "epoch": 5.163781365493095, "grad_norm": 1.4375, "learning_rate": 0.00026608345939948625, "loss": 4.8907, "mean_token_accuracy": 0.22496387958526612, "num_tokens": 115130116.0, "step": 66370 }, { "entropy": 5.887026071548462, "epoch": 5.164170394864812, "grad_norm": 1.5390625, "learning_rate": 0.0002660557656512734, "loss": 4.8918, "mean_token_accuracy": 0.21781501024961472, "num_tokens": 115138833.0, "step": 66375 }, { "entropy": 5.884005880355835, "epoch": 5.16455942423653, "grad_norm": 1.4375, "learning_rate": 0.00026602807203877525, "loss": 4.8286, "mean_token_accuracy": 0.22562648057937623, "num_tokens": 115147512.0, "step": 66380 }, { "entropy": 5.886314630508423, "epoch": 5.164948453608248, "grad_norm": 1.5546875, "learning_rate": 0.00026600037856241174, "loss": 4.874, "mean_token_accuracy": 0.22554809898138045, "num_tokens": 115155878.0, "step": 66385 }, { "entropy": 5.831168746948242, "epoch": 5.1653374829799645, "grad_norm": 1.4609375, "learning_rate": 0.00026597268522260317, "loss": 4.9063, "mean_token_accuracy": 0.21856729239225386, "num_tokens": 115163879.0, "step": 66390 }, { "entropy": 5.9472376823425295, "epoch": 5.165726512351682, "grad_norm": 1.5625, "learning_rate": 0.00026594499201976966, "loss": 5.0334, "mean_token_accuracy": 0.2057293325662613, "num_tokens": 115172665.0, "step": 66395 }, { "entropy": 5.89753155708313, "epoch": 5.1661155417234, "grad_norm": 1.46875, "learning_rate": 0.00026591729895433157, "loss": 4.9118, "mean_token_accuracy": 0.22132029831409455, "num_tokens": 115181449.0, "step": 66400 }, { "entropy": 5.922393655776977, "epoch": 5.166504571095118, "grad_norm": 1.375, "learning_rate": 0.00026588960602670896, "loss": 4.9135, "mean_token_accuracy": 0.21673181802034377, "num_tokens": 115190327.0, "step": 66405 }, { "entropy": 5.857445621490479, "epoch": 5.166893600466835, "grad_norm": 1.53125, "learning_rate": 0.00026586191323732213, "loss": 4.8973, "mean_token_accuracy": 0.22496640980243682, "num_tokens": 115199336.0, "step": 66410 }, { "entropy": 5.926786088943482, "epoch": 5.167282629838553, "grad_norm": 1.6328125, "learning_rate": 0.0002658342205865912, "loss": 4.9464, "mean_token_accuracy": 0.21693017482757568, "num_tokens": 115208768.0, "step": 66415 }, { "entropy": 5.8828271389007565, "epoch": 5.167671659210271, "grad_norm": 1.4375, "learning_rate": 0.0002658065280749363, "loss": 4.9333, "mean_token_accuracy": 0.21831827610731125, "num_tokens": 115217681.0, "step": 66420 }, { "entropy": 5.876974105834961, "epoch": 5.1680606885819875, "grad_norm": 1.453125, "learning_rate": 0.00026577883570277786, "loss": 4.8674, "mean_token_accuracy": 0.21840519905090333, "num_tokens": 115227090.0, "step": 66425 }, { "entropy": 5.870783710479737, "epoch": 5.168449717953705, "grad_norm": 1.46875, "learning_rate": 0.00026575114347053574, "loss": 4.9539, "mean_token_accuracy": 0.21677094250917434, "num_tokens": 115236984.0, "step": 66430 }, { "entropy": 5.932261610031128, "epoch": 5.168838747325423, "grad_norm": 1.4921875, "learning_rate": 0.0002657234513786304, "loss": 4.9161, "mean_token_accuracy": 0.2178018346428871, "num_tokens": 115245259.0, "step": 66435 }, { "entropy": 5.896965265274048, "epoch": 5.169227776697141, "grad_norm": 1.46875, "learning_rate": 0.0002656957594274819, "loss": 4.9888, "mean_token_accuracy": 0.21606735289096832, "num_tokens": 115254450.0, "step": 66440 }, { "entropy": 5.968612194061279, "epoch": 5.169616806068858, "grad_norm": 1.6328125, "learning_rate": 0.00026566806761751043, "loss": 4.9747, "mean_token_accuracy": 0.22056339234113692, "num_tokens": 115263312.0, "step": 66445 }, { "entropy": 5.918842506408692, "epoch": 5.170005835440576, "grad_norm": 1.5234375, "learning_rate": 0.0002656403759491362, "loss": 4.9364, "mean_token_accuracy": 0.21694356799125672, "num_tokens": 115271546.0, "step": 66450 }, { "entropy": 5.946949291229248, "epoch": 5.170394864812294, "grad_norm": 1.546875, "learning_rate": 0.0002656126844227794, "loss": 4.9589, "mean_token_accuracy": 0.21896385103464128, "num_tokens": 115280298.0, "step": 66455 }, { "entropy": 5.911055231094361, "epoch": 5.1707838941840105, "grad_norm": 1.46875, "learning_rate": 0.00026558499303886015, "loss": 4.9133, "mean_token_accuracy": 0.21614856719970704, "num_tokens": 115289295.0, "step": 66460 }, { "entropy": 5.905653572082519, "epoch": 5.171172923555728, "grad_norm": 1.4140625, "learning_rate": 0.00026555730179779864, "loss": 4.9474, "mean_token_accuracy": 0.2210756003856659, "num_tokens": 115298374.0, "step": 66465 }, { "entropy": 5.937005519866943, "epoch": 5.171561952927446, "grad_norm": 1.5078125, "learning_rate": 0.000265529610700015, "loss": 4.9219, "mean_token_accuracy": 0.2228921353816986, "num_tokens": 115307152.0, "step": 66470 }, { "entropy": 5.937046718597412, "epoch": 5.171950982299164, "grad_norm": 1.5234375, "learning_rate": 0.0002655019197459295, "loss": 4.9719, "mean_token_accuracy": 0.2136289045214653, "num_tokens": 115316226.0, "step": 66475 }, { "entropy": 5.9344195365905765, "epoch": 5.172340011670881, "grad_norm": 1.453125, "learning_rate": 0.00026547422893596223, "loss": 4.9655, "mean_token_accuracy": 0.20836678445339202, "num_tokens": 115324848.0, "step": 66480 }, { "entropy": 5.880370235443115, "epoch": 5.172729041042599, "grad_norm": 1.4375, "learning_rate": 0.00026544653827053336, "loss": 4.944, "mean_token_accuracy": 0.22749677151441575, "num_tokens": 115333719.0, "step": 66485 }, { "entropy": 5.929104137420654, "epoch": 5.173118070414317, "grad_norm": 1.5546875, "learning_rate": 0.0002654188477500631, "loss": 4.9364, "mean_token_accuracy": 0.21282721310853958, "num_tokens": 115341676.0, "step": 66490 }, { "entropy": 5.8462766170501705, "epoch": 5.1735070997860335, "grad_norm": 1.375, "learning_rate": 0.0002653911573749715, "loss": 4.8607, "mean_token_accuracy": 0.22088954746723174, "num_tokens": 115350487.0, "step": 66495 }, { "entropy": 5.926163864135742, "epoch": 5.173896129157751, "grad_norm": 1.578125, "learning_rate": 0.00026536346714567887, "loss": 4.9256, "mean_token_accuracy": 0.21988250315189362, "num_tokens": 115359607.0, "step": 66500 }, { "entropy": 5.883273696899414, "epoch": 5.174285158529469, "grad_norm": 1.4140625, "learning_rate": 0.00026533577706260524, "loss": 4.9241, "mean_token_accuracy": 0.21950936019420625, "num_tokens": 115368326.0, "step": 66505 }, { "entropy": 5.857379484176636, "epoch": 5.174674187901187, "grad_norm": 1.4921875, "learning_rate": 0.0002653080871261709, "loss": 4.9141, "mean_token_accuracy": 0.22179691195487977, "num_tokens": 115376693.0, "step": 66510 }, { "entropy": 5.826855802536011, "epoch": 5.175063217272904, "grad_norm": 1.578125, "learning_rate": 0.0002652803973367958, "loss": 4.8873, "mean_token_accuracy": 0.21160331666469573, "num_tokens": 115384708.0, "step": 66515 }, { "entropy": 5.903528499603271, "epoch": 5.175452246644622, "grad_norm": 1.5234375, "learning_rate": 0.00026525270769490024, "loss": 4.8495, "mean_token_accuracy": 0.22562988847494125, "num_tokens": 115393190.0, "step": 66520 }, { "entropy": 5.912107229232788, "epoch": 5.175841276016339, "grad_norm": 1.484375, "learning_rate": 0.00026522501820090433, "loss": 4.938, "mean_token_accuracy": 0.22097258269786835, "num_tokens": 115401768.0, "step": 66525 }, { "entropy": 5.824725246429443, "epoch": 5.1762303053880565, "grad_norm": 1.4921875, "learning_rate": 0.00026519732885522826, "loss": 4.8655, "mean_token_accuracy": 0.22406095266342163, "num_tokens": 115410919.0, "step": 66530 }, { "entropy": 5.847902059555054, "epoch": 5.176619334759774, "grad_norm": 1.5546875, "learning_rate": 0.00026516963965829204, "loss": 4.8849, "mean_token_accuracy": 0.2188459575176239, "num_tokens": 115419053.0, "step": 66535 }, { "entropy": 5.8656830310821535, "epoch": 5.177008364131492, "grad_norm": 1.515625, "learning_rate": 0.000265141950610516, "loss": 4.9362, "mean_token_accuracy": 0.221359221637249, "num_tokens": 115427456.0, "step": 66540 }, { "entropy": 5.921991968154908, "epoch": 5.17739739350321, "grad_norm": 1.5, "learning_rate": 0.0002651142617123201, "loss": 4.9813, "mean_token_accuracy": 0.21659674644470214, "num_tokens": 115435619.0, "step": 66545 }, { "entropy": 5.927452802658081, "epoch": 5.177786422874927, "grad_norm": 1.6171875, "learning_rate": 0.0002650865729641246, "loss": 4.98, "mean_token_accuracy": 0.22005217671394348, "num_tokens": 115443958.0, "step": 66550 }, { "entropy": 5.869166469573974, "epoch": 5.178175452246645, "grad_norm": 1.4140625, "learning_rate": 0.0002650588843663495, "loss": 4.902, "mean_token_accuracy": 0.22233424484729766, "num_tokens": 115452676.0, "step": 66555 }, { "entropy": 5.883228015899658, "epoch": 5.178564481618362, "grad_norm": 1.3515625, "learning_rate": 0.000265031195919415, "loss": 4.9011, "mean_token_accuracy": 0.21622713506221772, "num_tokens": 115461292.0, "step": 66560 }, { "entropy": 5.858842658996582, "epoch": 5.1789535109900795, "grad_norm": 1.5546875, "learning_rate": 0.00026500350762374115, "loss": 4.8482, "mean_token_accuracy": 0.2284151315689087, "num_tokens": 115469739.0, "step": 66565 }, { "entropy": 5.766324996948242, "epoch": 5.179342540361797, "grad_norm": 1.4609375, "learning_rate": 0.00026497581947974836, "loss": 4.7821, "mean_token_accuracy": 0.23931365758180617, "num_tokens": 115478569.0, "step": 66570 }, { "entropy": 5.870415735244751, "epoch": 5.179731569733515, "grad_norm": 1.578125, "learning_rate": 0.00026494813148785645, "loss": 4.8629, "mean_token_accuracy": 0.2259065717458725, "num_tokens": 115486949.0, "step": 66575 }, { "entropy": 5.856617164611817, "epoch": 5.180120599105233, "grad_norm": 1.6328125, "learning_rate": 0.00026492044364848566, "loss": 4.835, "mean_token_accuracy": 0.22525329738855362, "num_tokens": 115495007.0, "step": 66580 }, { "entropy": 5.874849081039429, "epoch": 5.18050962847695, "grad_norm": 1.5234375, "learning_rate": 0.0002648927559620561, "loss": 4.9283, "mean_token_accuracy": 0.2272611603140831, "num_tokens": 115503053.0, "step": 66585 }, { "entropy": 5.872139406204224, "epoch": 5.180898657848668, "grad_norm": 1.515625, "learning_rate": 0.0002648650684289879, "loss": 4.9033, "mean_token_accuracy": 0.2183742806315422, "num_tokens": 115511950.0, "step": 66590 }, { "entropy": 5.864149522781372, "epoch": 5.181287687220385, "grad_norm": 1.5546875, "learning_rate": 0.0002648373810497011, "loss": 4.8544, "mean_token_accuracy": 0.22028339952230452, "num_tokens": 115520272.0, "step": 66595 }, { "entropy": 5.8790405750274655, "epoch": 5.1816767165921025, "grad_norm": 1.4375, "learning_rate": 0.0002648096938246159, "loss": 4.9084, "mean_token_accuracy": 0.22629420906305314, "num_tokens": 115529000.0, "step": 66600 }, { "entropy": 5.94224967956543, "epoch": 5.18206574596382, "grad_norm": 1.5, "learning_rate": 0.0002647820067541524, "loss": 4.9737, "mean_token_accuracy": 0.21430711299180985, "num_tokens": 115537783.0, "step": 66605 }, { "entropy": 5.911783218383789, "epoch": 5.182454775335538, "grad_norm": 1.359375, "learning_rate": 0.00026475431983873066, "loss": 4.9507, "mean_token_accuracy": 0.21028370410203934, "num_tokens": 115546689.0, "step": 66610 }, { "entropy": 5.968821048736572, "epoch": 5.182843804707256, "grad_norm": 1.578125, "learning_rate": 0.0002647266330787708, "loss": 5.0078, "mean_token_accuracy": 0.21254965513944626, "num_tokens": 115554965.0, "step": 66615 }, { "entropy": 5.898732757568359, "epoch": 5.183232834078973, "grad_norm": 1.4765625, "learning_rate": 0.00026469894647469295, "loss": 4.9152, "mean_token_accuracy": 0.21675666570663452, "num_tokens": 115563402.0, "step": 66620 }, { "entropy": 5.855556392669678, "epoch": 5.183621863450691, "grad_norm": 1.34375, "learning_rate": 0.0002646712600269172, "loss": 4.8972, "mean_token_accuracy": 0.21870721131563187, "num_tokens": 115572950.0, "step": 66625 }, { "entropy": 5.860622787475586, "epoch": 5.184010892822408, "grad_norm": 1.3984375, "learning_rate": 0.0002646435737358635, "loss": 4.8428, "mean_token_accuracy": 0.22866910845041274, "num_tokens": 115581927.0, "step": 66630 }, { "entropy": 5.914406490325928, "epoch": 5.1843999221941255, "grad_norm": 1.5703125, "learning_rate": 0.0002646158876019522, "loss": 4.904, "mean_token_accuracy": 0.21869576275348662, "num_tokens": 115590334.0, "step": 66635 }, { "entropy": 5.837580966949463, "epoch": 5.184788951565843, "grad_norm": 1.3359375, "learning_rate": 0.0002645882016256033, "loss": 4.8716, "mean_token_accuracy": 0.2292750209569931, "num_tokens": 115599863.0, "step": 66640 }, { "entropy": 5.869169425964356, "epoch": 5.185177980937561, "grad_norm": 1.4375, "learning_rate": 0.0002645605158072368, "loss": 4.8868, "mean_token_accuracy": 0.2125752553343773, "num_tokens": 115608303.0, "step": 66645 }, { "entropy": 5.84347128868103, "epoch": 5.185567010309279, "grad_norm": 1.4140625, "learning_rate": 0.000264532830147273, "loss": 4.8538, "mean_token_accuracy": 0.2244350492954254, "num_tokens": 115616677.0, "step": 66650 }, { "entropy": 5.896841287612915, "epoch": 5.185956039680996, "grad_norm": 1.4921875, "learning_rate": 0.00026450514464613177, "loss": 4.9907, "mean_token_accuracy": 0.21330585777759553, "num_tokens": 115625522.0, "step": 66655 }, { "entropy": 5.900094318389892, "epoch": 5.186345069052713, "grad_norm": 1.4921875, "learning_rate": 0.0002644774593042332, "loss": 4.9137, "mean_token_accuracy": 0.21754818111658097, "num_tokens": 115633826.0, "step": 66660 }, { "entropy": 5.926422595977783, "epoch": 5.186734098424431, "grad_norm": 1.390625, "learning_rate": 0.0002644497741219975, "loss": 4.9937, "mean_token_accuracy": 0.20958569496870041, "num_tokens": 115642862.0, "step": 66665 }, { "entropy": 5.897913551330566, "epoch": 5.1871231277961485, "grad_norm": 1.4375, "learning_rate": 0.0002644220890998447, "loss": 4.953, "mean_token_accuracy": 0.2159480094909668, "num_tokens": 115651364.0, "step": 66670 }, { "entropy": 5.953419208526611, "epoch": 5.187512157167866, "grad_norm": 1.484375, "learning_rate": 0.00026439440423819483, "loss": 4.9828, "mean_token_accuracy": 0.21189212501049043, "num_tokens": 115659975.0, "step": 66675 }, { "entropy": 5.867889785766602, "epoch": 5.187901186539584, "grad_norm": 1.484375, "learning_rate": 0.000264366719537468, "loss": 4.965, "mean_token_accuracy": 0.21710327118635178, "num_tokens": 115669058.0, "step": 66680 }, { "entropy": 5.8232215404510494, "epoch": 5.188290215911302, "grad_norm": 1.3671875, "learning_rate": 0.0002643390349980843, "loss": 4.8564, "mean_token_accuracy": 0.22096076905727385, "num_tokens": 115677443.0, "step": 66685 }, { "entropy": 5.881569862365723, "epoch": 5.188679245283019, "grad_norm": 1.5859375, "learning_rate": 0.0002643113506204637, "loss": 4.8512, "mean_token_accuracy": 0.22627180367708205, "num_tokens": 115685441.0, "step": 66690 }, { "entropy": 5.914648389816284, "epoch": 5.189068274654736, "grad_norm": 1.3515625, "learning_rate": 0.0002642836664050263, "loss": 4.9527, "mean_token_accuracy": 0.2170115143060684, "num_tokens": 115695037.0, "step": 66695 }, { "entropy": 5.855237007141113, "epoch": 5.189457304026454, "grad_norm": 1.484375, "learning_rate": 0.00026425598235219235, "loss": 4.8248, "mean_token_accuracy": 0.22932253181934356, "num_tokens": 115704237.0, "step": 66700 }, { "entropy": 5.93607530593872, "epoch": 5.1898463333981715, "grad_norm": 1.5078125, "learning_rate": 0.00026422829846238174, "loss": 4.9726, "mean_token_accuracy": 0.21257587522268295, "num_tokens": 115712608.0, "step": 66705 }, { "entropy": 5.840132331848144, "epoch": 5.190235362769889, "grad_norm": 1.4296875, "learning_rate": 0.00026420061473601445, "loss": 4.8726, "mean_token_accuracy": 0.22687792927026748, "num_tokens": 115721542.0, "step": 66710 }, { "entropy": 5.844367837905883, "epoch": 5.190624392141607, "grad_norm": 1.484375, "learning_rate": 0.00026417293117351077, "loss": 4.9298, "mean_token_accuracy": 0.21926034688949586, "num_tokens": 115729982.0, "step": 66715 }, { "entropy": 5.8385780334472654, "epoch": 5.191013421513325, "grad_norm": 1.3125, "learning_rate": 0.00026414524777529055, "loss": 4.8374, "mean_token_accuracy": 0.23138161152601242, "num_tokens": 115739126.0, "step": 66720 }, { "entropy": 5.851501893997193, "epoch": 5.191402450885041, "grad_norm": 1.40625, "learning_rate": 0.0002641175645417739, "loss": 4.8825, "mean_token_accuracy": 0.21858133673667907, "num_tokens": 115747588.0, "step": 66725 }, { "entropy": 5.938333511352539, "epoch": 5.191791480256759, "grad_norm": 1.578125, "learning_rate": 0.000264089881473381, "loss": 4.9661, "mean_token_accuracy": 0.21610334813594817, "num_tokens": 115756040.0, "step": 66730 }, { "entropy": 5.903454923629761, "epoch": 5.192180509628477, "grad_norm": 1.46875, "learning_rate": 0.0002640621985705318, "loss": 4.9718, "mean_token_accuracy": 0.21261221766471863, "num_tokens": 115764888.0, "step": 66735 }, { "entropy": 5.953672075271607, "epoch": 5.1925695390001945, "grad_norm": 1.40625, "learning_rate": 0.00026403451583364616, "loss": 4.9342, "mean_token_accuracy": 0.21494019478559495, "num_tokens": 115774036.0, "step": 66740 }, { "entropy": 5.917304849624633, "epoch": 5.192958568371912, "grad_norm": 1.5, "learning_rate": 0.0002640068332631444, "loss": 4.8795, "mean_token_accuracy": 0.22461487650871276, "num_tokens": 115782341.0, "step": 66745 }, { "entropy": 5.881608963012695, "epoch": 5.19334759774363, "grad_norm": 1.296875, "learning_rate": 0.0002639791508594464, "loss": 4.9067, "mean_token_accuracy": 0.22036605030298234, "num_tokens": 115791908.0, "step": 66750 }, { "entropy": 5.9237569808959964, "epoch": 5.193736627115348, "grad_norm": 1.4453125, "learning_rate": 0.00026395146862297225, "loss": 4.9377, "mean_token_accuracy": 0.21254721134901047, "num_tokens": 115801182.0, "step": 66755 }, { "entropy": 5.892680025100708, "epoch": 5.194125656487064, "grad_norm": 1.40625, "learning_rate": 0.000263923786554142, "loss": 4.9134, "mean_token_accuracy": 0.22193896025419235, "num_tokens": 115810210.0, "step": 66760 }, { "entropy": 5.89268684387207, "epoch": 5.194514685858782, "grad_norm": 1.390625, "learning_rate": 0.0002638961046533756, "loss": 4.8888, "mean_token_accuracy": 0.21785345524549485, "num_tokens": 115818987.0, "step": 66765 }, { "entropy": 5.905697059631348, "epoch": 5.1949037152305, "grad_norm": 1.5703125, "learning_rate": 0.0002638684229210932, "loss": 4.8414, "mean_token_accuracy": 0.22455980777740478, "num_tokens": 115827164.0, "step": 66770 }, { "entropy": 5.913054800033569, "epoch": 5.1952927446022175, "grad_norm": 1.4453125, "learning_rate": 0.00026384074135771474, "loss": 5.0035, "mean_token_accuracy": 0.2152501329779625, "num_tokens": 115837601.0, "step": 66775 }, { "entropy": 5.830989599227905, "epoch": 5.195681773973935, "grad_norm": 1.40625, "learning_rate": 0.0002638130599636603, "loss": 4.8615, "mean_token_accuracy": 0.22214706838130951, "num_tokens": 115845636.0, "step": 66780 }, { "entropy": 5.888315629959107, "epoch": 5.196070803345653, "grad_norm": 1.4453125, "learning_rate": 0.00026378537873934983, "loss": 4.8773, "mean_token_accuracy": 0.21925183683633803, "num_tokens": 115854380.0, "step": 66785 }, { "entropy": 5.918946838378906, "epoch": 5.1964598327173706, "grad_norm": 1.4140625, "learning_rate": 0.00026375769768520344, "loss": 4.8899, "mean_token_accuracy": 0.22070348113775254, "num_tokens": 115863045.0, "step": 66790 }, { "entropy": 5.896366977691651, "epoch": 5.196848862089087, "grad_norm": 1.46875, "learning_rate": 0.000263730016801641, "loss": 4.9477, "mean_token_accuracy": 0.21918170601129533, "num_tokens": 115871066.0, "step": 66795 }, { "entropy": 5.845680236816406, "epoch": 5.197237891460805, "grad_norm": 1.453125, "learning_rate": 0.0002637023360890827, "loss": 4.8984, "mean_token_accuracy": 0.2230381414294243, "num_tokens": 115880401.0, "step": 66800 }, { "entropy": 5.7885599613189695, "epoch": 5.197626920832523, "grad_norm": 1.546875, "learning_rate": 0.00026367465554794843, "loss": 4.8026, "mean_token_accuracy": 0.23228487968444825, "num_tokens": 115888630.0, "step": 66805 }, { "entropy": 5.911736726760864, "epoch": 5.1980159502042405, "grad_norm": 1.4453125, "learning_rate": 0.00026364697517865834, "loss": 4.8732, "mean_token_accuracy": 0.22549426406621934, "num_tokens": 115897145.0, "step": 66810 }, { "entropy": 5.900034189224243, "epoch": 5.198404979575958, "grad_norm": 1.59375, "learning_rate": 0.0002636192949816322, "loss": 4.9098, "mean_token_accuracy": 0.22327499389648436, "num_tokens": 115905895.0, "step": 66815 }, { "entropy": 5.79327392578125, "epoch": 5.198794008947676, "grad_norm": 1.3828125, "learning_rate": 0.0002635916149572902, "loss": 4.8817, "mean_token_accuracy": 0.22235584110021592, "num_tokens": 115914977.0, "step": 66820 }, { "entropy": 5.855564928054809, "epoch": 5.1991830383193935, "grad_norm": 1.46875, "learning_rate": 0.00026356393510605224, "loss": 4.9222, "mean_token_accuracy": 0.21617656648159028, "num_tokens": 115923630.0, "step": 66825 }, { "entropy": 5.853539037704468, "epoch": 5.19957206769111, "grad_norm": 1.3359375, "learning_rate": 0.0002635362554283383, "loss": 4.8888, "mean_token_accuracy": 0.22370741069316863, "num_tokens": 115932828.0, "step": 66830 }, { "entropy": 5.947035884857177, "epoch": 5.199961097062828, "grad_norm": 1.5, "learning_rate": 0.0002635085759245686, "loss": 4.9655, "mean_token_accuracy": 0.21474708914756774, "num_tokens": 115942328.0, "step": 66835 }, { "entropy": 5.937947607040405, "epoch": 5.200350126434546, "grad_norm": 1.3984375, "learning_rate": 0.0002634808965951629, "loss": 4.9099, "mean_token_accuracy": 0.21636297255754472, "num_tokens": 115951062.0, "step": 66840 }, { "entropy": 5.854681825637817, "epoch": 5.2007391558062634, "grad_norm": 1.3828125, "learning_rate": 0.0002634532174405413, "loss": 4.8403, "mean_token_accuracy": 0.22606565654277802, "num_tokens": 115959716.0, "step": 66845 }, { "entropy": 5.820920038223266, "epoch": 5.201128185177981, "grad_norm": 1.546875, "learning_rate": 0.00026342553846112364, "loss": 4.8354, "mean_token_accuracy": 0.22617035806179048, "num_tokens": 115967623.0, "step": 66850 }, { "entropy": 5.865072631835938, "epoch": 5.201517214549699, "grad_norm": 1.5, "learning_rate": 0.0002633978596573301, "loss": 4.8741, "mean_token_accuracy": 0.2224920228123665, "num_tokens": 115976944.0, "step": 66855 }, { "entropy": 5.826416540145874, "epoch": 5.201906243921416, "grad_norm": 1.390625, "learning_rate": 0.00026337018102958056, "loss": 4.8718, "mean_token_accuracy": 0.21866938918828965, "num_tokens": 115986432.0, "step": 66860 }, { "entropy": 5.862338829040527, "epoch": 5.202295273293133, "grad_norm": 1.3203125, "learning_rate": 0.000263342502578295, "loss": 4.9543, "mean_token_accuracy": 0.2172921985387802, "num_tokens": 115995386.0, "step": 66865 }, { "entropy": 5.8694549083709715, "epoch": 5.202684302664851, "grad_norm": 1.453125, "learning_rate": 0.00026331482430389343, "loss": 4.8622, "mean_token_accuracy": 0.22362824231386186, "num_tokens": 116004048.0, "step": 66870 }, { "entropy": 5.880117607116699, "epoch": 5.203073332036569, "grad_norm": 1.4375, "learning_rate": 0.00026328714620679576, "loss": 4.9986, "mean_token_accuracy": 0.2106212168931961, "num_tokens": 116013948.0, "step": 66875 }, { "entropy": 5.914364242553711, "epoch": 5.203462361408286, "grad_norm": 1.515625, "learning_rate": 0.00026325946828742203, "loss": 4.9036, "mean_token_accuracy": 0.22134124338626862, "num_tokens": 116023017.0, "step": 66880 }, { "entropy": 5.911861562728882, "epoch": 5.203851390780004, "grad_norm": 1.6796875, "learning_rate": 0.00026323179054619215, "loss": 4.9468, "mean_token_accuracy": 0.21681919693946838, "num_tokens": 116031912.0, "step": 66885 }, { "entropy": 5.897346067428589, "epoch": 5.204240420151722, "grad_norm": 1.515625, "learning_rate": 0.0002632041129835262, "loss": 4.8757, "mean_token_accuracy": 0.22524741888046265, "num_tokens": 116040294.0, "step": 66890 }, { "entropy": 5.951008272171021, "epoch": 5.204629449523439, "grad_norm": 1.4765625, "learning_rate": 0.00026317643559984396, "loss": 4.9862, "mean_token_accuracy": 0.2123206987977028, "num_tokens": 116048222.0, "step": 66895 }, { "entropy": 5.852381324768066, "epoch": 5.205018478895156, "grad_norm": 1.4140625, "learning_rate": 0.0002631487583955655, "loss": 4.9621, "mean_token_accuracy": 0.21047160923480987, "num_tokens": 116057595.0, "step": 66900 }, { "entropy": 5.794004631042481, "epoch": 5.205407508266874, "grad_norm": 1.5, "learning_rate": 0.00026312108137111086, "loss": 4.8009, "mean_token_accuracy": 0.23198727071285247, "num_tokens": 116065229.0, "step": 66905 }, { "entropy": 5.836598348617554, "epoch": 5.205796537638592, "grad_norm": 1.5390625, "learning_rate": 0.0002630934045268998, "loss": 4.9017, "mean_token_accuracy": 0.22179910987615586, "num_tokens": 116073620.0, "step": 66910 }, { "entropy": 5.8712241649627686, "epoch": 5.206185567010309, "grad_norm": 1.609375, "learning_rate": 0.0002630657278633525, "loss": 4.9202, "mean_token_accuracy": 0.21909717619419097, "num_tokens": 116082019.0, "step": 66915 }, { "entropy": 5.870947408676147, "epoch": 5.206574596382027, "grad_norm": 1.515625, "learning_rate": 0.0002630380513808887, "loss": 4.9909, "mean_token_accuracy": 0.2148544117808342, "num_tokens": 116090628.0, "step": 66920 }, { "entropy": 5.907679414749145, "epoch": 5.206963625753745, "grad_norm": 1.4140625, "learning_rate": 0.0002630103750799284, "loss": 4.9683, "mean_token_accuracy": 0.21176630407571792, "num_tokens": 116098954.0, "step": 66925 }, { "entropy": 5.903951358795166, "epoch": 5.207352655125462, "grad_norm": 1.6015625, "learning_rate": 0.00026298269896089164, "loss": 4.9926, "mean_token_accuracy": 0.21052053570747375, "num_tokens": 116107844.0, "step": 66930 }, { "entropy": 5.889689302444458, "epoch": 5.207741684497179, "grad_norm": 1.4140625, "learning_rate": 0.00026295502302419826, "loss": 4.8913, "mean_token_accuracy": 0.2199919953942299, "num_tokens": 116117130.0, "step": 66935 }, { "entropy": 5.890400075912476, "epoch": 5.208130713868897, "grad_norm": 1.5078125, "learning_rate": 0.0002629273472702683, "loss": 4.9518, "mean_token_accuracy": 0.2140430450439453, "num_tokens": 116125760.0, "step": 66940 }, { "entropy": 5.875790405273437, "epoch": 5.208519743240615, "grad_norm": 1.484375, "learning_rate": 0.0002628996716995215, "loss": 4.8625, "mean_token_accuracy": 0.21772147715091705, "num_tokens": 116134324.0, "step": 66945 }, { "entropy": 5.875073194503784, "epoch": 5.208908772612332, "grad_norm": 1.4765625, "learning_rate": 0.000262871996312378, "loss": 4.9524, "mean_token_accuracy": 0.2169422388076782, "num_tokens": 116142570.0, "step": 66950 }, { "entropy": 5.954105949401855, "epoch": 5.20929780198405, "grad_norm": 1.453125, "learning_rate": 0.00026284432110925765, "loss": 4.9842, "mean_token_accuracy": 0.21435638517141342, "num_tokens": 116150831.0, "step": 66955 }, { "entropy": 5.932734060287475, "epoch": 5.209686831355767, "grad_norm": 1.4765625, "learning_rate": 0.00026281664609058037, "loss": 4.9773, "mean_token_accuracy": 0.20973667055368422, "num_tokens": 116159626.0, "step": 66960 }, { "entropy": 5.897079610824585, "epoch": 5.210075860727485, "grad_norm": 1.6015625, "learning_rate": 0.0002627889712567661, "loss": 4.8331, "mean_token_accuracy": 0.22387586534023285, "num_tokens": 116168780.0, "step": 66965 }, { "entropy": 5.89501919746399, "epoch": 5.210464890099202, "grad_norm": 1.5078125, "learning_rate": 0.00026276129660823475, "loss": 4.8359, "mean_token_accuracy": 0.23094754070043563, "num_tokens": 116177294.0, "step": 66970 }, { "entropy": 5.8401710987091064, "epoch": 5.21085391947092, "grad_norm": 1.421875, "learning_rate": 0.00026273362214540623, "loss": 4.8457, "mean_token_accuracy": 0.2284397602081299, "num_tokens": 116185844.0, "step": 66975 }, { "entropy": 5.840371894836426, "epoch": 5.211242948842638, "grad_norm": 1.4765625, "learning_rate": 0.0002627059478687005, "loss": 4.9606, "mean_token_accuracy": 0.21286423057317733, "num_tokens": 116194489.0, "step": 66980 }, { "entropy": 5.828110218048096, "epoch": 5.211631978214355, "grad_norm": 1.53125, "learning_rate": 0.0002626782737785374, "loss": 4.917, "mean_token_accuracy": 0.2179950162768364, "num_tokens": 116203022.0, "step": 66985 }, { "entropy": 5.84049620628357, "epoch": 5.212021007586073, "grad_norm": 1.484375, "learning_rate": 0.00026265059987533697, "loss": 4.8701, "mean_token_accuracy": 0.21906978785991668, "num_tokens": 116210838.0, "step": 66990 }, { "entropy": 5.8754777908325195, "epoch": 5.21241003695779, "grad_norm": 1.515625, "learning_rate": 0.00026262292615951893, "loss": 4.8678, "mean_token_accuracy": 0.2227970004081726, "num_tokens": 116219356.0, "step": 66995 }, { "entropy": 5.809766006469727, "epoch": 5.212799066329508, "grad_norm": 1.390625, "learning_rate": 0.0002625952526315034, "loss": 4.911, "mean_token_accuracy": 0.2198785051703453, "num_tokens": 116228355.0, "step": 67000 }, { "entropy": 5.892364406585694, "epoch": 5.213188095701225, "grad_norm": 1.5, "learning_rate": 0.0002625675792917101, "loss": 4.9021, "mean_token_accuracy": 0.21953105032444, "num_tokens": 116237070.0, "step": 67005 }, { "entropy": 5.896638584136963, "epoch": 5.213577125072943, "grad_norm": 1.421875, "learning_rate": 0.000262539906140559, "loss": 4.9457, "mean_token_accuracy": 0.22197256237268448, "num_tokens": 116245912.0, "step": 67010 }, { "entropy": 5.912347841262817, "epoch": 5.213966154444661, "grad_norm": 1.4453125, "learning_rate": 0.00026251223317847003, "loss": 4.9502, "mean_token_accuracy": 0.21724906712770461, "num_tokens": 116254315.0, "step": 67015 }, { "entropy": 5.931737995147705, "epoch": 5.214355183816378, "grad_norm": 1.4296875, "learning_rate": 0.000262484560405863, "loss": 4.9846, "mean_token_accuracy": 0.21388865262269974, "num_tokens": 116263053.0, "step": 67020 }, { "entropy": 5.906467437744141, "epoch": 5.214744213188096, "grad_norm": 1.5078125, "learning_rate": 0.00026245688782315787, "loss": 4.8903, "mean_token_accuracy": 0.21803633421659468, "num_tokens": 116271482.0, "step": 67025 }, { "entropy": 5.948765277862549, "epoch": 5.215133242559813, "grad_norm": 1.4140625, "learning_rate": 0.00026242921543077435, "loss": 4.927, "mean_token_accuracy": 0.2193041056394577, "num_tokens": 116280297.0, "step": 67030 }, { "entropy": 5.842594623565674, "epoch": 5.215522271931531, "grad_norm": 1.6484375, "learning_rate": 0.0002624015432291326, "loss": 4.8339, "mean_token_accuracy": 0.22340085804462434, "num_tokens": 116287860.0, "step": 67035 }, { "entropy": 5.8514588356018065, "epoch": 5.215911301303248, "grad_norm": 1.5859375, "learning_rate": 0.0002623738712186525, "loss": 4.8747, "mean_token_accuracy": 0.21723172068595886, "num_tokens": 116295844.0, "step": 67040 }, { "entropy": 5.872314548492431, "epoch": 5.216300330674966, "grad_norm": 1.421875, "learning_rate": 0.00026234619939975365, "loss": 4.9335, "mean_token_accuracy": 0.22092931866645812, "num_tokens": 116304746.0, "step": 67045 }, { "entropy": 5.893154239654541, "epoch": 5.216689360046684, "grad_norm": 1.6484375, "learning_rate": 0.00026231852777285606, "loss": 4.8154, "mean_token_accuracy": 0.22430939227342606, "num_tokens": 116313428.0, "step": 67050 }, { "entropy": 5.9300566673278805, "epoch": 5.217078389418401, "grad_norm": 1.5625, "learning_rate": 0.00026229085633837975, "loss": 4.9572, "mean_token_accuracy": 0.22198998928070068, "num_tokens": 116321776.0, "step": 67055 }, { "entropy": 5.915703773498535, "epoch": 5.217467418790118, "grad_norm": 1.5078125, "learning_rate": 0.0002622631850967444, "loss": 4.8759, "mean_token_accuracy": 0.2206052213907242, "num_tokens": 116330804.0, "step": 67060 }, { "entropy": 5.876027011871338, "epoch": 5.217856448161836, "grad_norm": 1.53125, "learning_rate": 0.00026223551404837, "loss": 5.0002, "mean_token_accuracy": 0.2091422438621521, "num_tokens": 116339948.0, "step": 67065 }, { "entropy": 5.891392421722412, "epoch": 5.218245477533554, "grad_norm": 1.4921875, "learning_rate": 0.00026220784319367626, "loss": 4.8976, "mean_token_accuracy": 0.21987392157316207, "num_tokens": 116348996.0, "step": 67070 }, { "entropy": 5.910856103897094, "epoch": 5.218634506905271, "grad_norm": 1.53125, "learning_rate": 0.0002621801725330832, "loss": 4.9335, "mean_token_accuracy": 0.22370724231004716, "num_tokens": 116357909.0, "step": 67075 }, { "entropy": 5.837147283554077, "epoch": 5.219023536276989, "grad_norm": 1.5625, "learning_rate": 0.0002621525020670106, "loss": 4.8702, "mean_token_accuracy": 0.21973688006401063, "num_tokens": 116367054.0, "step": 67080 }, { "entropy": 5.933539295196534, "epoch": 5.219412565648707, "grad_norm": 1.5078125, "learning_rate": 0.0002621248317958784, "loss": 5.0017, "mean_token_accuracy": 0.20808265656232833, "num_tokens": 116375597.0, "step": 67085 }, { "entropy": 5.851144790649414, "epoch": 5.219801595020424, "grad_norm": 1.4375, "learning_rate": 0.00026209716172010636, "loss": 4.8782, "mean_token_accuracy": 0.22649372816085817, "num_tokens": 116383800.0, "step": 67090 }, { "entropy": 5.852349948883057, "epoch": 5.220190624392141, "grad_norm": 1.390625, "learning_rate": 0.0002620694918401142, "loss": 4.9084, "mean_token_accuracy": 0.2199783056974411, "num_tokens": 116394190.0, "step": 67095 }, { "entropy": 5.849413204193115, "epoch": 5.220579653763859, "grad_norm": 1.421875, "learning_rate": 0.000262041822156322, "loss": 4.8144, "mean_token_accuracy": 0.22887897193431855, "num_tokens": 116402733.0, "step": 67100 }, { "entropy": 5.877736568450928, "epoch": 5.220968683135577, "grad_norm": 1.484375, "learning_rate": 0.0002620141526691496, "loss": 4.9627, "mean_token_accuracy": 0.21220042407512665, "num_tokens": 116411788.0, "step": 67105 }, { "entropy": 5.844420862197876, "epoch": 5.221357712507294, "grad_norm": 1.40625, "learning_rate": 0.00026198648337901674, "loss": 4.8094, "mean_token_accuracy": 0.23267367333173752, "num_tokens": 116420040.0, "step": 67110 }, { "entropy": 5.82170615196228, "epoch": 5.221746741879012, "grad_norm": 1.4609375, "learning_rate": 0.00026195881428634334, "loss": 4.8558, "mean_token_accuracy": 0.22638074159622193, "num_tokens": 116428181.0, "step": 67115 }, { "entropy": 5.8831531524658205, "epoch": 5.22213577125073, "grad_norm": 1.4765625, "learning_rate": 0.00026193114539154903, "loss": 4.9513, "mean_token_accuracy": 0.21132851839065553, "num_tokens": 116436911.0, "step": 67120 }, { "entropy": 5.933945751190185, "epoch": 5.222524800622447, "grad_norm": 1.40625, "learning_rate": 0.0002619034766950539, "loss": 5.0008, "mean_token_accuracy": 0.2095859929919243, "num_tokens": 116446234.0, "step": 67125 }, { "entropy": 5.917168045043946, "epoch": 5.222913829994164, "grad_norm": 1.6015625, "learning_rate": 0.0002618758081972776, "loss": 4.9301, "mean_token_accuracy": 0.2152769759297371, "num_tokens": 116454848.0, "step": 67130 }, { "entropy": 5.969388437271118, "epoch": 5.223302859365882, "grad_norm": 1.328125, "learning_rate": 0.0002618481398986401, "loss": 4.9553, "mean_token_accuracy": 0.22084282487630844, "num_tokens": 116464852.0, "step": 67135 }, { "entropy": 5.883950805664062, "epoch": 5.2236918887376, "grad_norm": 1.3515625, "learning_rate": 0.00026182047179956107, "loss": 4.8815, "mean_token_accuracy": 0.223748841881752, "num_tokens": 116473043.0, "step": 67140 }, { "entropy": 5.874982643127441, "epoch": 5.224080918109317, "grad_norm": 1.4765625, "learning_rate": 0.00026179280390046047, "loss": 4.9033, "mean_token_accuracy": 0.22069993615150452, "num_tokens": 116481245.0, "step": 67145 }, { "entropy": 5.900635242462158, "epoch": 5.224469947481035, "grad_norm": 1.4453125, "learning_rate": 0.00026176513620175795, "loss": 4.953, "mean_token_accuracy": 0.21784802228212358, "num_tokens": 116489977.0, "step": 67150 }, { "entropy": 5.832939863204956, "epoch": 5.224858976852753, "grad_norm": 1.3828125, "learning_rate": 0.0002617374687038735, "loss": 4.8706, "mean_token_accuracy": 0.22005811035633088, "num_tokens": 116499289.0, "step": 67155 }, { "entropy": 5.851674652099609, "epoch": 5.22524800622447, "grad_norm": 1.4375, "learning_rate": 0.00026170980140722677, "loss": 4.9142, "mean_token_accuracy": 0.2202461764216423, "num_tokens": 116508331.0, "step": 67160 }, { "entropy": 5.9518561363220215, "epoch": 5.225637035596187, "grad_norm": 1.5234375, "learning_rate": 0.00026168213431223777, "loss": 4.9375, "mean_token_accuracy": 0.22675934582948684, "num_tokens": 116516305.0, "step": 67165 }, { "entropy": 5.905051279067993, "epoch": 5.226026064967905, "grad_norm": 1.40625, "learning_rate": 0.00026165446741932606, "loss": 4.944, "mean_token_accuracy": 0.2239120990037918, "num_tokens": 116524642.0, "step": 67170 }, { "entropy": 5.850819635391235, "epoch": 5.226415094339623, "grad_norm": 1.53125, "learning_rate": 0.00026162680072891166, "loss": 4.8343, "mean_token_accuracy": 0.22330676168203353, "num_tokens": 116533713.0, "step": 67175 }, { "entropy": 5.872627782821655, "epoch": 5.22680412371134, "grad_norm": 1.515625, "learning_rate": 0.00026159913424141426, "loss": 4.8209, "mean_token_accuracy": 0.22323849499225618, "num_tokens": 116542350.0, "step": 67180 }, { "entropy": 5.8786962032318115, "epoch": 5.227193153083058, "grad_norm": 1.5078125, "learning_rate": 0.0002615714679572536, "loss": 4.923, "mean_token_accuracy": 0.2190012440085411, "num_tokens": 116550788.0, "step": 67185 }, { "entropy": 5.890914106369019, "epoch": 5.227582182454776, "grad_norm": 1.421875, "learning_rate": 0.00026154380187684963, "loss": 4.9323, "mean_token_accuracy": 0.21663843244314193, "num_tokens": 116559984.0, "step": 67190 }, { "entropy": 5.8632618427276615, "epoch": 5.2279712118264925, "grad_norm": 1.4375, "learning_rate": 0.000261516136000622, "loss": 4.9841, "mean_token_accuracy": 0.21169033795595169, "num_tokens": 116568738.0, "step": 67195 }, { "entropy": 5.802139520645142, "epoch": 5.22836024119821, "grad_norm": 1.4296875, "learning_rate": 0.0002614884703289906, "loss": 4.8191, "mean_token_accuracy": 0.2344991758465767, "num_tokens": 116576722.0, "step": 67200 }, { "entropy": 5.842132329940796, "epoch": 5.228749270569928, "grad_norm": 1.5234375, "learning_rate": 0.00026146080486237513, "loss": 4.933, "mean_token_accuracy": 0.22037400156259537, "num_tokens": 116585323.0, "step": 67205 }, { "entropy": 5.861917924880982, "epoch": 5.229138299941646, "grad_norm": 1.4296875, "learning_rate": 0.00026143313960119534, "loss": 4.9211, "mean_token_accuracy": 0.2211926355957985, "num_tokens": 116593215.0, "step": 67210 }, { "entropy": 5.867314624786377, "epoch": 5.229527329313363, "grad_norm": 1.4375, "learning_rate": 0.0002614054745458711, "loss": 4.9247, "mean_token_accuracy": 0.2223244935274124, "num_tokens": 116601599.0, "step": 67215 }, { "entropy": 5.897385931015014, "epoch": 5.229916358685081, "grad_norm": 1.3984375, "learning_rate": 0.00026137780969682215, "loss": 4.8859, "mean_token_accuracy": 0.2315788447856903, "num_tokens": 116610309.0, "step": 67220 }, { "entropy": 5.9587305068969725, "epoch": 5.230305388056799, "grad_norm": 1.5390625, "learning_rate": 0.0002613501450544683, "loss": 5.0265, "mean_token_accuracy": 0.213980470597744, "num_tokens": 116618555.0, "step": 67225 }, { "entropy": 5.886282539367675, "epoch": 5.2306944174285155, "grad_norm": 1.484375, "learning_rate": 0.0002613224806192291, "loss": 4.8996, "mean_token_accuracy": 0.22403783202171326, "num_tokens": 116627639.0, "step": 67230 }, { "entropy": 5.894217538833618, "epoch": 5.231083446800233, "grad_norm": 1.46875, "learning_rate": 0.0002612948163915247, "loss": 4.9222, "mean_token_accuracy": 0.2140920177102089, "num_tokens": 116637077.0, "step": 67235 }, { "entropy": 5.874657821655274, "epoch": 5.231472476171951, "grad_norm": 1.4140625, "learning_rate": 0.0002612671523717745, "loss": 4.884, "mean_token_accuracy": 0.22267655283212662, "num_tokens": 116645570.0, "step": 67240 }, { "entropy": 5.832493877410888, "epoch": 5.231861505543669, "grad_norm": 1.4921875, "learning_rate": 0.0002612394885603985, "loss": 4.8365, "mean_token_accuracy": 0.2233529731631279, "num_tokens": 116654140.0, "step": 67245 }, { "entropy": 5.831371307373047, "epoch": 5.232250534915386, "grad_norm": 1.4609375, "learning_rate": 0.0002612118249578163, "loss": 4.8756, "mean_token_accuracy": 0.22032055258750916, "num_tokens": 116662740.0, "step": 67250 }, { "entropy": 5.897946834564209, "epoch": 5.232639564287104, "grad_norm": 1.4609375, "learning_rate": 0.0002611841615644477, "loss": 4.9806, "mean_token_accuracy": 0.21394146531820296, "num_tokens": 116670813.0, "step": 67255 }, { "entropy": 5.904433727264404, "epoch": 5.233028593658822, "grad_norm": 1.3671875, "learning_rate": 0.00026115649838071253, "loss": 4.9487, "mean_token_accuracy": 0.20981094986200333, "num_tokens": 116679897.0, "step": 67260 }, { "entropy": 5.891775703430175, "epoch": 5.2334176230305385, "grad_norm": 1.46875, "learning_rate": 0.0002611288354070304, "loss": 4.9535, "mean_token_accuracy": 0.2096189945936203, "num_tokens": 116688910.0, "step": 67265 }, { "entropy": 5.944534492492676, "epoch": 5.233806652402256, "grad_norm": 1.484375, "learning_rate": 0.0002611011726438212, "loss": 4.9673, "mean_token_accuracy": 0.21259674280881882, "num_tokens": 116697114.0, "step": 67270 }, { "entropy": 5.80322847366333, "epoch": 5.234195681773974, "grad_norm": 1.5546875, "learning_rate": 0.00026107351009150453, "loss": 4.8221, "mean_token_accuracy": 0.22969842255115508, "num_tokens": 116705623.0, "step": 67275 }, { "entropy": 5.898817157745361, "epoch": 5.234584711145692, "grad_norm": 1.5546875, "learning_rate": 0.0002610458477505002, "loss": 4.8443, "mean_token_accuracy": 0.22299365252256392, "num_tokens": 116713954.0, "step": 67280 }, { "entropy": 5.884688758850098, "epoch": 5.234973740517409, "grad_norm": 1.4453125, "learning_rate": 0.0002610181856212279, "loss": 4.908, "mean_token_accuracy": 0.21802364140748978, "num_tokens": 116722378.0, "step": 67285 }, { "entropy": 5.862059593200684, "epoch": 5.235362769889127, "grad_norm": 1.390625, "learning_rate": 0.0002609905237041074, "loss": 4.935, "mean_token_accuracy": 0.22016392946243285, "num_tokens": 116731339.0, "step": 67290 }, { "entropy": 5.791627693176269, "epoch": 5.235751799260844, "grad_norm": 1.515625, "learning_rate": 0.0002609628619995582, "loss": 4.8137, "mean_token_accuracy": 0.22428351193666457, "num_tokens": 116739949.0, "step": 67295 }, { "entropy": 5.8831977367401125, "epoch": 5.2361408286325615, "grad_norm": 1.4765625, "learning_rate": 0.00026093520050800046, "loss": 4.913, "mean_token_accuracy": 0.2229623943567276, "num_tokens": 116747810.0, "step": 67300 }, { "entropy": 5.87790150642395, "epoch": 5.236529858004279, "grad_norm": 1.453125, "learning_rate": 0.0002609075392298536, "loss": 4.8343, "mean_token_accuracy": 0.21886638998985292, "num_tokens": 116756523.0, "step": 67305 }, { "entropy": 5.8684978008270265, "epoch": 5.236918887375997, "grad_norm": 1.515625, "learning_rate": 0.0002608798781655374, "loss": 4.9062, "mean_token_accuracy": 0.21671493202447892, "num_tokens": 116765328.0, "step": 67310 }, { "entropy": 5.884585237503051, "epoch": 5.237307916747715, "grad_norm": 1.5859375, "learning_rate": 0.0002608522173154716, "loss": 4.8945, "mean_token_accuracy": 0.2154143288731575, "num_tokens": 116773752.0, "step": 67315 }, { "entropy": 5.888968658447266, "epoch": 5.237696946119432, "grad_norm": 1.609375, "learning_rate": 0.0002608245566800759, "loss": 4.9347, "mean_token_accuracy": 0.2158031314611435, "num_tokens": 116782130.0, "step": 67320 }, { "entropy": 5.897051048278809, "epoch": 5.23808597549115, "grad_norm": 1.5078125, "learning_rate": 0.00026079689625976995, "loss": 4.9102, "mean_token_accuracy": 0.22446153312921524, "num_tokens": 116790965.0, "step": 67325 }, { "entropy": 5.84403920173645, "epoch": 5.238475004862867, "grad_norm": 1.484375, "learning_rate": 0.00026076923605497347, "loss": 4.8435, "mean_token_accuracy": 0.22390540689229965, "num_tokens": 116800567.0, "step": 67330 }, { "entropy": 5.921960258483887, "epoch": 5.2388640342345845, "grad_norm": 1.4453125, "learning_rate": 0.00026074157606610626, "loss": 4.917, "mean_token_accuracy": 0.2217146024107933, "num_tokens": 116809819.0, "step": 67335 }, { "entropy": 5.940748167037964, "epoch": 5.239253063606302, "grad_norm": 1.5, "learning_rate": 0.00026071391629358786, "loss": 4.9265, "mean_token_accuracy": 0.21651136577129365, "num_tokens": 116818498.0, "step": 67340 }, { "entropy": 5.884336471557617, "epoch": 5.23964209297802, "grad_norm": 1.4375, "learning_rate": 0.00026068625673783807, "loss": 4.9336, "mean_token_accuracy": 0.21122610419988633, "num_tokens": 116827013.0, "step": 67345 }, { "entropy": 5.896107769012451, "epoch": 5.240031122349738, "grad_norm": 1.46875, "learning_rate": 0.00026065859739927657, "loss": 5.0241, "mean_token_accuracy": 0.20991375297307968, "num_tokens": 116835935.0, "step": 67350 }, { "entropy": 5.864320850372314, "epoch": 5.240420151721455, "grad_norm": 1.390625, "learning_rate": 0.000260630938278323, "loss": 4.8617, "mean_token_accuracy": 0.2287273585796356, "num_tokens": 116844040.0, "step": 67355 }, { "entropy": 5.939917373657226, "epoch": 5.240809181093173, "grad_norm": 1.40625, "learning_rate": 0.00026060327937539704, "loss": 4.9615, "mean_token_accuracy": 0.21367578506469725, "num_tokens": 116852506.0, "step": 67360 }, { "entropy": 5.896703481674194, "epoch": 5.24119821046489, "grad_norm": 1.4453125, "learning_rate": 0.00026057562069091845, "loss": 4.9165, "mean_token_accuracy": 0.2179089218378067, "num_tokens": 116861528.0, "step": 67365 }, { "entropy": 5.940378904342651, "epoch": 5.2415872398366075, "grad_norm": 1.609375, "learning_rate": 0.00026054796222530684, "loss": 4.9605, "mean_token_accuracy": 0.21729314029216767, "num_tokens": 116869758.0, "step": 67370 }, { "entropy": 5.94890284538269, "epoch": 5.241976269208325, "grad_norm": 1.453125, "learning_rate": 0.0002605203039789819, "loss": 4.8976, "mean_token_accuracy": 0.22087464183568956, "num_tokens": 116878239.0, "step": 67375 }, { "entropy": 5.885954809188843, "epoch": 5.242365298580043, "grad_norm": 1.5, "learning_rate": 0.0002604926459523633, "loss": 4.9235, "mean_token_accuracy": 0.2185305029153824, "num_tokens": 116886998.0, "step": 67380 }, { "entropy": 5.797305774688721, "epoch": 5.2427543279517606, "grad_norm": 1.4921875, "learning_rate": 0.00026046498814587076, "loss": 4.8224, "mean_token_accuracy": 0.22675151079893113, "num_tokens": 116895535.0, "step": 67385 }, { "entropy": 5.923039674758911, "epoch": 5.243143357323478, "grad_norm": 1.5, "learning_rate": 0.00026043733055992386, "loss": 5.0094, "mean_token_accuracy": 0.20485444068908693, "num_tokens": 116904096.0, "step": 67390 }, { "entropy": 5.9373468399047855, "epoch": 5.243532386695195, "grad_norm": 1.421875, "learning_rate": 0.00026040967319494225, "loss": 4.9189, "mean_token_accuracy": 0.22203624099493027, "num_tokens": 116911955.0, "step": 67395 }, { "entropy": 5.83544397354126, "epoch": 5.243921416066913, "grad_norm": 1.5234375, "learning_rate": 0.00026038201605134567, "loss": 4.8605, "mean_token_accuracy": 0.22670974135398864, "num_tokens": 116921179.0, "step": 67400 }, { "entropy": 5.848672151565552, "epoch": 5.2443104454386305, "grad_norm": 1.5234375, "learning_rate": 0.00026035435912955375, "loss": 4.9174, "mean_token_accuracy": 0.21601036489009856, "num_tokens": 116929347.0, "step": 67405 }, { "entropy": 5.836112833023071, "epoch": 5.244699474810348, "grad_norm": 1.421875, "learning_rate": 0.0002603267024299861, "loss": 4.917, "mean_token_accuracy": 0.21424152404069902, "num_tokens": 116937858.0, "step": 67410 }, { "entropy": 5.929918479919434, "epoch": 5.245088504182066, "grad_norm": 1.390625, "learning_rate": 0.0002602990459530623, "loss": 4.9211, "mean_token_accuracy": 0.21778079569339753, "num_tokens": 116946645.0, "step": 67415 }, { "entropy": 5.944310426712036, "epoch": 5.2454775335537835, "grad_norm": 1.453125, "learning_rate": 0.0002602713896992022, "loss": 4.821, "mean_token_accuracy": 0.23370299041271209, "num_tokens": 116954601.0, "step": 67420 }, { "entropy": 5.956086921691894, "epoch": 5.245866562925501, "grad_norm": 1.375, "learning_rate": 0.0002602437336688252, "loss": 5.0093, "mean_token_accuracy": 0.21491467356681823, "num_tokens": 116963173.0, "step": 67425 }, { "entropy": 5.834650897979737, "epoch": 5.246255592297218, "grad_norm": 1.578125, "learning_rate": 0.0002602160778623511, "loss": 4.7381, "mean_token_accuracy": 0.2353695347905159, "num_tokens": 116971583.0, "step": 67430 }, { "entropy": 5.850420904159546, "epoch": 5.246644621668936, "grad_norm": 1.4765625, "learning_rate": 0.00026018842228019953, "loss": 4.8204, "mean_token_accuracy": 0.2281804695725441, "num_tokens": 116979746.0, "step": 67435 }, { "entropy": 5.95275912284851, "epoch": 5.2470336510406534, "grad_norm": 1.5703125, "learning_rate": 0.00026016076692279003, "loss": 5.029, "mean_token_accuracy": 0.2150035709142685, "num_tokens": 116988513.0, "step": 67440 }, { "entropy": 5.886801910400391, "epoch": 5.247422680412371, "grad_norm": 1.4140625, "learning_rate": 0.0002601331117905423, "loss": 4.8894, "mean_token_accuracy": 0.21818059235811232, "num_tokens": 116997213.0, "step": 67445 }, { "entropy": 5.948919582366943, "epoch": 5.247811709784089, "grad_norm": 1.5078125, "learning_rate": 0.00026010545688387595, "loss": 5.0532, "mean_token_accuracy": 0.2081000417470932, "num_tokens": 117005571.0, "step": 67450 }, { "entropy": 5.961368417739868, "epoch": 5.2482007391558065, "grad_norm": 1.5546875, "learning_rate": 0.00026007780220321054, "loss": 4.9768, "mean_token_accuracy": 0.2115231767296791, "num_tokens": 117014393.0, "step": 67455 }, { "entropy": 5.846679735183716, "epoch": 5.248589768527524, "grad_norm": 1.546875, "learning_rate": 0.00026005014774896574, "loss": 4.8307, "mean_token_accuracy": 0.23029744178056716, "num_tokens": 117023482.0, "step": 67460 }, { "entropy": 5.933190727233887, "epoch": 5.248978797899241, "grad_norm": 1.4921875, "learning_rate": 0.00026002249352156124, "loss": 4.9445, "mean_token_accuracy": 0.22121233493089676, "num_tokens": 117031784.0, "step": 67465 }, { "entropy": 5.918664932250977, "epoch": 5.249367827270959, "grad_norm": 1.4296875, "learning_rate": 0.0002599948395214165, "loss": 4.8906, "mean_token_accuracy": 0.2299582302570343, "num_tokens": 117040455.0, "step": 67470 }, { "entropy": 5.854545211791992, "epoch": 5.249756856642676, "grad_norm": 1.7421875, "learning_rate": 0.00025996718574895116, "loss": 4.8607, "mean_token_accuracy": 0.22336635440587999, "num_tokens": 117048452.0, "step": 67475 }, { "entropy": 5.877184629440308, "epoch": 5.250145886014394, "grad_norm": 1.4453125, "learning_rate": 0.00025993953220458487, "loss": 4.9078, "mean_token_accuracy": 0.22021687626838685, "num_tokens": 117057263.0, "step": 67480 }, { "entropy": 5.856005477905273, "epoch": 5.250534915386112, "grad_norm": 1.453125, "learning_rate": 0.0002599118788887372, "loss": 4.8828, "mean_token_accuracy": 0.21525786370038985, "num_tokens": 117066214.0, "step": 67485 }, { "entropy": 5.863619613647461, "epoch": 5.2509239447578295, "grad_norm": 1.3046875, "learning_rate": 0.00025988422580182775, "loss": 4.8919, "mean_token_accuracy": 0.2247301459312439, "num_tokens": 117075139.0, "step": 67490 }, { "entropy": 5.9252355098724365, "epoch": 5.251312974129547, "grad_norm": 1.421875, "learning_rate": 0.0002598565729442761, "loss": 4.9403, "mean_token_accuracy": 0.219345261156559, "num_tokens": 117083855.0, "step": 67495 }, { "entropy": 5.879280471801758, "epoch": 5.251702003501264, "grad_norm": 1.5078125, "learning_rate": 0.00025982892031650186, "loss": 4.9141, "mean_token_accuracy": 0.22372221648693086, "num_tokens": 117092339.0, "step": 67500 }, { "entropy": 5.834828186035156, "epoch": 5.252091032872982, "grad_norm": 1.5078125, "learning_rate": 0.0002598012679189246, "loss": 4.8959, "mean_token_accuracy": 0.21889061182737352, "num_tokens": 117100996.0, "step": 67505 }, { "entropy": 5.794737529754639, "epoch": 5.252480062244699, "grad_norm": 1.5546875, "learning_rate": 0.00025977361575196394, "loss": 4.8178, "mean_token_accuracy": 0.22175722271203996, "num_tokens": 117109124.0, "step": 67510 }, { "entropy": 5.923291158676148, "epoch": 5.252869091616417, "grad_norm": 1.5234375, "learning_rate": 0.00025974596381603943, "loss": 4.9698, "mean_token_accuracy": 0.21626615673303604, "num_tokens": 117117710.0, "step": 67515 }, { "entropy": 5.9296900749206545, "epoch": 5.253258120988135, "grad_norm": 1.5078125, "learning_rate": 0.0002597183121115707, "loss": 4.8868, "mean_token_accuracy": 0.2250870496034622, "num_tokens": 117126543.0, "step": 67520 }, { "entropy": 5.968899202346802, "epoch": 5.2536471503598525, "grad_norm": 1.5078125, "learning_rate": 0.0002596906606389771, "loss": 4.9473, "mean_token_accuracy": 0.21744668781757354, "num_tokens": 117134992.0, "step": 67525 }, { "entropy": 5.9787322044372555, "epoch": 5.254036179731569, "grad_norm": 1.3828125, "learning_rate": 0.00025966300939867843, "loss": 5.0098, "mean_token_accuracy": 0.2072967529296875, "num_tokens": 117144641.0, "step": 67530 }, { "entropy": 5.8928173065185545, "epoch": 5.254425209103287, "grad_norm": 1.4453125, "learning_rate": 0.0002596353583910942, "loss": 4.9608, "mean_token_accuracy": 0.21453773677349092, "num_tokens": 117153834.0, "step": 67535 }, { "entropy": 5.942238426208496, "epoch": 5.254814238475005, "grad_norm": 1.6015625, "learning_rate": 0.00025960770761664396, "loss": 4.911, "mean_token_accuracy": 0.21444918364286422, "num_tokens": 117162003.0, "step": 67540 }, { "entropy": 5.893832445144653, "epoch": 5.255203267846722, "grad_norm": 1.4296875, "learning_rate": 0.00025958005707574726, "loss": 4.8631, "mean_token_accuracy": 0.223610782623291, "num_tokens": 117169765.0, "step": 67545 }, { "entropy": 5.847612380981445, "epoch": 5.25559229721844, "grad_norm": 1.5078125, "learning_rate": 0.0002595524067688237, "loss": 4.9249, "mean_token_accuracy": 0.21991652399301528, "num_tokens": 117178736.0, "step": 67550 }, { "entropy": 5.8742828369140625, "epoch": 5.255981326590158, "grad_norm": 1.5546875, "learning_rate": 0.00025952475669629267, "loss": 4.9058, "mean_token_accuracy": 0.22097132503986358, "num_tokens": 117187209.0, "step": 67555 }, { "entropy": 5.857695484161377, "epoch": 5.2563703559618755, "grad_norm": 1.5234375, "learning_rate": 0.00025949710685857383, "loss": 4.8426, "mean_token_accuracy": 0.23106579631567, "num_tokens": 117195581.0, "step": 67560 }, { "entropy": 5.976848173141479, "epoch": 5.256759385333592, "grad_norm": 1.59375, "learning_rate": 0.00025946945725608675, "loss": 4.9582, "mean_token_accuracy": 0.21694038957357406, "num_tokens": 117204384.0, "step": 67565 }, { "entropy": 5.906661939620972, "epoch": 5.25714841470531, "grad_norm": 1.515625, "learning_rate": 0.0002594418078892509, "loss": 4.9727, "mean_token_accuracy": 0.21820637434720994, "num_tokens": 117213243.0, "step": 67570 }, { "entropy": 5.858357572555542, "epoch": 5.257537444077028, "grad_norm": 1.390625, "learning_rate": 0.000259414158758486, "loss": 4.8584, "mean_token_accuracy": 0.21784919798374175, "num_tokens": 117222509.0, "step": 67575 }, { "entropy": 5.93952202796936, "epoch": 5.257926473448745, "grad_norm": 1.5078125, "learning_rate": 0.00025938650986421125, "loss": 4.9631, "mean_token_accuracy": 0.2162969321012497, "num_tokens": 117231146.0, "step": 67580 }, { "entropy": 5.930944871902466, "epoch": 5.258315502820463, "grad_norm": 1.5078125, "learning_rate": 0.0002593588612068465, "loss": 4.9343, "mean_token_accuracy": 0.21613504588603974, "num_tokens": 117239798.0, "step": 67585 }, { "entropy": 5.9070967674255375, "epoch": 5.258704532192181, "grad_norm": 1.40625, "learning_rate": 0.000259331212786811, "loss": 4.9187, "mean_token_accuracy": 0.21774909347295762, "num_tokens": 117248574.0, "step": 67590 }, { "entropy": 5.876617527008056, "epoch": 5.259093561563898, "grad_norm": 1.390625, "learning_rate": 0.00025930356460452454, "loss": 4.9353, "mean_token_accuracy": 0.2210534244775772, "num_tokens": 117258213.0, "step": 67595 }, { "entropy": 5.8371346950531, "epoch": 5.259482590935615, "grad_norm": 1.4765625, "learning_rate": 0.0002592759166604064, "loss": 4.8456, "mean_token_accuracy": 0.23086679875850677, "num_tokens": 117266371.0, "step": 67600 }, { "entropy": 5.969144201278686, "epoch": 5.259871620307333, "grad_norm": 1.453125, "learning_rate": 0.00025924826895487623, "loss": 4.9923, "mean_token_accuracy": 0.2118205040693283, "num_tokens": 117274895.0, "step": 67605 }, { "entropy": 5.892315196990967, "epoch": 5.260260649679051, "grad_norm": 1.625, "learning_rate": 0.00025922062148835357, "loss": 4.9006, "mean_token_accuracy": 0.21808929443359376, "num_tokens": 117283771.0, "step": 67610 }, { "entropy": 5.8611406803131105, "epoch": 5.260649679050768, "grad_norm": 1.5546875, "learning_rate": 0.0002591929742612578, "loss": 4.9142, "mean_token_accuracy": 0.21932263821363449, "num_tokens": 117293968.0, "step": 67615 }, { "entropy": 5.938511562347412, "epoch": 5.261038708422486, "grad_norm": 1.4921875, "learning_rate": 0.0002591653272740085, "loss": 4.9059, "mean_token_accuracy": 0.22923264801502227, "num_tokens": 117302468.0, "step": 67620 }, { "entropy": 5.890681362152099, "epoch": 5.261427737794204, "grad_norm": 1.421875, "learning_rate": 0.00025913768052702514, "loss": 4.9184, "mean_token_accuracy": 0.2165292426943779, "num_tokens": 117311363.0, "step": 67625 }, { "entropy": 5.947332096099854, "epoch": 5.261816767165921, "grad_norm": 1.3359375, "learning_rate": 0.0002591100340207272, "loss": 4.9736, "mean_token_accuracy": 0.21536273658275604, "num_tokens": 117320940.0, "step": 67630 }, { "entropy": 5.8825990676879885, "epoch": 5.262205796537638, "grad_norm": 1.5859375, "learning_rate": 0.0002590823877555343, "loss": 4.8332, "mean_token_accuracy": 0.22942212224006653, "num_tokens": 117329629.0, "step": 67635 }, { "entropy": 5.833219242095947, "epoch": 5.262594825909356, "grad_norm": 1.53125, "learning_rate": 0.0002590547417318657, "loss": 4.8596, "mean_token_accuracy": 0.22257792055606843, "num_tokens": 117338713.0, "step": 67640 }, { "entropy": 5.915221166610718, "epoch": 5.262983855281074, "grad_norm": 1.5234375, "learning_rate": 0.0002590270959501411, "loss": 4.919, "mean_token_accuracy": 0.2254884198307991, "num_tokens": 117347114.0, "step": 67645 }, { "entropy": 5.863712358474731, "epoch": 5.263372884652791, "grad_norm": 1.5546875, "learning_rate": 0.00025899945041077995, "loss": 4.8679, "mean_token_accuracy": 0.22042381912469863, "num_tokens": 117354953.0, "step": 67650 }, { "entropy": 5.870214986801147, "epoch": 5.263761914024509, "grad_norm": 1.46875, "learning_rate": 0.00025897180511420164, "loss": 4.9138, "mean_token_accuracy": 0.21727113723754882, "num_tokens": 117363459.0, "step": 67655 }, { "entropy": 5.915839385986328, "epoch": 5.264150943396227, "grad_norm": 1.4765625, "learning_rate": 0.00025894416006082564, "loss": 4.9634, "mean_token_accuracy": 0.21095409244298935, "num_tokens": 117371463.0, "step": 67660 }, { "entropy": 5.914535188674927, "epoch": 5.264539972767944, "grad_norm": 1.453125, "learning_rate": 0.00025891651525107145, "loss": 5.0264, "mean_token_accuracy": 0.21387271583080292, "num_tokens": 117380386.0, "step": 67665 }, { "entropy": 5.904464387893677, "epoch": 5.264929002139661, "grad_norm": 1.5234375, "learning_rate": 0.00025888887068535853, "loss": 4.9786, "mean_token_accuracy": 0.21889828741550446, "num_tokens": 117389533.0, "step": 67670 }, { "entropy": 5.97153868675232, "epoch": 5.265318031511379, "grad_norm": 1.4921875, "learning_rate": 0.00025886122636410643, "loss": 4.9838, "mean_token_accuracy": 0.21230579167604446, "num_tokens": 117397806.0, "step": 67675 }, { "entropy": 5.871523427963257, "epoch": 5.265707060883097, "grad_norm": 1.4453125, "learning_rate": 0.00025883358228773445, "loss": 4.8717, "mean_token_accuracy": 0.2221473142504692, "num_tokens": 117407391.0, "step": 67680 }, { "entropy": 5.8514550685882565, "epoch": 5.266096090254814, "grad_norm": 1.4453125, "learning_rate": 0.0002588059384566622, "loss": 4.819, "mean_token_accuracy": 0.2305518001317978, "num_tokens": 117416228.0, "step": 67685 }, { "entropy": 5.810494089126587, "epoch": 5.266485119626532, "grad_norm": 1.4453125, "learning_rate": 0.00025877829487130894, "loss": 4.8613, "mean_token_accuracy": 0.2205313354730606, "num_tokens": 117424839.0, "step": 67690 }, { "entropy": 5.844971799850464, "epoch": 5.26687414899825, "grad_norm": 1.484375, "learning_rate": 0.0002587506515320943, "loss": 4.8799, "mean_token_accuracy": 0.22161851823329926, "num_tokens": 117433463.0, "step": 67695 }, { "entropy": 5.950062656402588, "epoch": 5.267263178369967, "grad_norm": 1.5546875, "learning_rate": 0.0002587230084394377, "loss": 5.0148, "mean_token_accuracy": 0.21276509910821914, "num_tokens": 117441785.0, "step": 67700 }, { "entropy": 5.931679344177246, "epoch": 5.267652207741684, "grad_norm": 1.4453125, "learning_rate": 0.0002586953655937585, "loss": 4.9107, "mean_token_accuracy": 0.21448352485895156, "num_tokens": 117450426.0, "step": 67705 }, { "entropy": 5.89712119102478, "epoch": 5.268041237113402, "grad_norm": 1.5234375, "learning_rate": 0.0002586677229954761, "loss": 4.9225, "mean_token_accuracy": 0.22230238169431688, "num_tokens": 117458817.0, "step": 67710 }, { "entropy": 5.904269886016846, "epoch": 5.26843026648512, "grad_norm": 1.5703125, "learning_rate": 0.0002586400806450102, "loss": 4.9466, "mean_token_accuracy": 0.21600616872310638, "num_tokens": 117467241.0, "step": 67715 }, { "entropy": 5.858381080627441, "epoch": 5.268819295856837, "grad_norm": 1.5703125, "learning_rate": 0.00025861243854277986, "loss": 4.9046, "mean_token_accuracy": 0.22042580544948578, "num_tokens": 117475859.0, "step": 67720 }, { "entropy": 5.85347352027893, "epoch": 5.269208325228555, "grad_norm": 1.59375, "learning_rate": 0.0002585847966892048, "loss": 4.9508, "mean_token_accuracy": 0.2111980438232422, "num_tokens": 117485202.0, "step": 67725 }, { "entropy": 5.915950441360474, "epoch": 5.269597354600272, "grad_norm": 1.625, "learning_rate": 0.0002585571550847042, "loss": 4.9711, "mean_token_accuracy": 0.2161031737923622, "num_tokens": 117494156.0, "step": 67730 }, { "entropy": 5.915547037124634, "epoch": 5.26998638397199, "grad_norm": 1.5546875, "learning_rate": 0.0002585295137296978, "loss": 4.9537, "mean_token_accuracy": 0.21331336945295334, "num_tokens": 117502850.0, "step": 67735 }, { "entropy": 5.970816135406494, "epoch": 5.270375413343707, "grad_norm": 1.546875, "learning_rate": 0.0002585018726246047, "loss": 4.9073, "mean_token_accuracy": 0.21634238660335542, "num_tokens": 117511400.0, "step": 67740 }, { "entropy": 5.938521528244019, "epoch": 5.270764442715425, "grad_norm": 1.640625, "learning_rate": 0.0002584742317698444, "loss": 4.9293, "mean_token_accuracy": 0.22227482497692108, "num_tokens": 117519326.0, "step": 67745 }, { "entropy": 5.862645435333252, "epoch": 5.271153472087143, "grad_norm": 1.46875, "learning_rate": 0.00025844659116583635, "loss": 4.9651, "mean_token_accuracy": 0.21507801711559296, "num_tokens": 117527945.0, "step": 67750 }, { "entropy": 5.829906415939331, "epoch": 5.27154250145886, "grad_norm": 1.53125, "learning_rate": 0.0002584189508129999, "loss": 4.9011, "mean_token_accuracy": 0.21933382451534272, "num_tokens": 117535892.0, "step": 67755 }, { "entropy": 5.982791519165039, "epoch": 5.271931530830578, "grad_norm": 1.5859375, "learning_rate": 0.0002583913107117544, "loss": 4.9414, "mean_token_accuracy": 0.22133725583553315, "num_tokens": 117544387.0, "step": 67760 }, { "entropy": 5.861956644058227, "epoch": 5.272320560202295, "grad_norm": 1.59375, "learning_rate": 0.0002583636708625195, "loss": 4.9448, "mean_token_accuracy": 0.21146388500928878, "num_tokens": 117552774.0, "step": 67765 }, { "entropy": 5.864036417007446, "epoch": 5.272709589574013, "grad_norm": 1.40625, "learning_rate": 0.0002583360312657143, "loss": 4.9286, "mean_token_accuracy": 0.21191056817770004, "num_tokens": 117561741.0, "step": 67770 }, { "entropy": 5.97829647064209, "epoch": 5.27309861894573, "grad_norm": 1.390625, "learning_rate": 0.00025830839192175835, "loss": 4.9977, "mean_token_accuracy": 0.22493544965982437, "num_tokens": 117570185.0, "step": 67775 }, { "entropy": 5.8773880958557125, "epoch": 5.273487648317448, "grad_norm": 1.5625, "learning_rate": 0.000258280752831071, "loss": 4.9735, "mean_token_accuracy": 0.2094309523701668, "num_tokens": 117578547.0, "step": 67780 }, { "entropy": 5.908707904815674, "epoch": 5.273876677689166, "grad_norm": 1.5, "learning_rate": 0.00025825311399407157, "loss": 4.9911, "mean_token_accuracy": 0.20932831317186357, "num_tokens": 117586795.0, "step": 67785 }, { "entropy": 5.903944873809815, "epoch": 5.274265707060883, "grad_norm": 1.5078125, "learning_rate": 0.0002582254754111795, "loss": 4.8632, "mean_token_accuracy": 0.22859781384468078, "num_tokens": 117595219.0, "step": 67790 }, { "entropy": 5.84618353843689, "epoch": 5.274654736432601, "grad_norm": 1.4609375, "learning_rate": 0.0002581978370828142, "loss": 4.8334, "mean_token_accuracy": 0.23000494986772538, "num_tokens": 117603947.0, "step": 67795 }, { "entropy": 5.8910047054290775, "epoch": 5.275043765804318, "grad_norm": 1.453125, "learning_rate": 0.0002581701990093949, "loss": 4.9091, "mean_token_accuracy": 0.21675776988267897, "num_tokens": 117612529.0, "step": 67800 }, { "entropy": 5.923612451553344, "epoch": 5.275432795176036, "grad_norm": 1.59375, "learning_rate": 0.0002581425611913411, "loss": 4.9891, "mean_token_accuracy": 0.21027622669935225, "num_tokens": 117620929.0, "step": 67805 }, { "entropy": 5.915188360214233, "epoch": 5.275821824547753, "grad_norm": 1.40625, "learning_rate": 0.0002581149236290721, "loss": 4.9255, "mean_token_accuracy": 0.22170062959194184, "num_tokens": 117629354.0, "step": 67810 }, { "entropy": 5.841807174682617, "epoch": 5.276210853919471, "grad_norm": 1.46875, "learning_rate": 0.0002580872863230072, "loss": 4.8185, "mean_token_accuracy": 0.22112427055835723, "num_tokens": 117637481.0, "step": 67815 }, { "entropy": 5.89835000038147, "epoch": 5.276599883291189, "grad_norm": 1.5078125, "learning_rate": 0.00025805964927356584, "loss": 4.9372, "mean_token_accuracy": 0.21275329291820527, "num_tokens": 117645661.0, "step": 67820 }, { "entropy": 5.88832950592041, "epoch": 5.276988912662906, "grad_norm": 1.34375, "learning_rate": 0.00025803201248116725, "loss": 4.9513, "mean_token_accuracy": 0.2148388609290123, "num_tokens": 117654405.0, "step": 67825 }, { "entropy": 5.900545120239258, "epoch": 5.277377942034624, "grad_norm": 1.5078125, "learning_rate": 0.00025800437594623095, "loss": 4.9121, "mean_token_accuracy": 0.214832104742527, "num_tokens": 117663585.0, "step": 67830 }, { "entropy": 5.807180690765381, "epoch": 5.277766971406341, "grad_norm": 1.578125, "learning_rate": 0.0002579767396691762, "loss": 4.8435, "mean_token_accuracy": 0.22937777489423752, "num_tokens": 117672141.0, "step": 67835 }, { "entropy": 5.91658878326416, "epoch": 5.278156000778059, "grad_norm": 1.7421875, "learning_rate": 0.00025794910365042233, "loss": 4.9633, "mean_token_accuracy": 0.21431930512189865, "num_tokens": 117680755.0, "step": 67840 }, { "entropy": 5.928325128555298, "epoch": 5.278545030149776, "grad_norm": 1.484375, "learning_rate": 0.00025792146789038875, "loss": 4.9049, "mean_token_accuracy": 0.2170793816447258, "num_tokens": 117689430.0, "step": 67845 }, { "entropy": 5.883506202697754, "epoch": 5.278934059521494, "grad_norm": 1.4765625, "learning_rate": 0.0002578938323894946, "loss": 4.8463, "mean_token_accuracy": 0.22267838716506957, "num_tokens": 117698134.0, "step": 67850 }, { "entropy": 5.789335012435913, "epoch": 5.279323088893212, "grad_norm": 1.5078125, "learning_rate": 0.00025786619714815933, "loss": 4.8555, "mean_token_accuracy": 0.22640684694051744, "num_tokens": 117707475.0, "step": 67855 }, { "entropy": 5.895144033432007, "epoch": 5.279712118264929, "grad_norm": 1.484375, "learning_rate": 0.0002578385621668023, "loss": 4.9253, "mean_token_accuracy": 0.22923634499311446, "num_tokens": 117716353.0, "step": 67860 }, { "entropy": 5.859406852722168, "epoch": 5.280101147636646, "grad_norm": 1.4609375, "learning_rate": 0.0002578109274458427, "loss": 4.8828, "mean_token_accuracy": 0.22423188537359237, "num_tokens": 117725244.0, "step": 67865 }, { "entropy": 5.926948690414429, "epoch": 5.280490177008364, "grad_norm": 1.5390625, "learning_rate": 0.00025778329298569997, "loss": 4.8703, "mean_token_accuracy": 0.22163361608982085, "num_tokens": 117733419.0, "step": 67870 }, { "entropy": 5.920617008209229, "epoch": 5.280879206380082, "grad_norm": 1.4453125, "learning_rate": 0.0002577556587867934, "loss": 5.0359, "mean_token_accuracy": 0.2092956393957138, "num_tokens": 117742256.0, "step": 67875 }, { "entropy": 5.939651346206665, "epoch": 5.281268235751799, "grad_norm": 1.4375, "learning_rate": 0.00025772802484954217, "loss": 4.9261, "mean_token_accuracy": 0.21982627660036086, "num_tokens": 117750982.0, "step": 67880 }, { "entropy": 5.858913612365723, "epoch": 5.281657265123517, "grad_norm": 1.65625, "learning_rate": 0.00025770039117436566, "loss": 4.8795, "mean_token_accuracy": 0.2208586648106575, "num_tokens": 117758629.0, "step": 67885 }, { "entropy": 5.847533226013184, "epoch": 5.282046294495235, "grad_norm": 1.46875, "learning_rate": 0.0002576727577616832, "loss": 4.9336, "mean_token_accuracy": 0.21533840745687485, "num_tokens": 117766620.0, "step": 67890 }, { "entropy": 5.824357891082764, "epoch": 5.282435323866952, "grad_norm": 1.546875, "learning_rate": 0.00025764512461191413, "loss": 4.831, "mean_token_accuracy": 0.2270228698849678, "num_tokens": 117774906.0, "step": 67895 }, { "entropy": 5.8857419967651365, "epoch": 5.282824353238669, "grad_norm": 1.453125, "learning_rate": 0.0002576174917254776, "loss": 4.9812, "mean_token_accuracy": 0.21486251652240754, "num_tokens": 117784140.0, "step": 67900 }, { "entropy": 5.875032424926758, "epoch": 5.283213382610387, "grad_norm": 1.359375, "learning_rate": 0.00025758985910279304, "loss": 4.9085, "mean_token_accuracy": 0.22593943476676942, "num_tokens": 117792927.0, "step": 67905 }, { "entropy": 5.9111357688903805, "epoch": 5.283602411982105, "grad_norm": 1.5, "learning_rate": 0.0002575622267442796, "loss": 4.8588, "mean_token_accuracy": 0.22253002673387529, "num_tokens": 117801433.0, "step": 67910 }, { "entropy": 5.964916658401489, "epoch": 5.283991441353822, "grad_norm": 1.5078125, "learning_rate": 0.0002575345946503566, "loss": 5.0575, "mean_token_accuracy": 0.21213325411081313, "num_tokens": 117810027.0, "step": 67915 }, { "entropy": 5.828066635131836, "epoch": 5.28438047072554, "grad_norm": 1.5078125, "learning_rate": 0.00025750696282144335, "loss": 4.8367, "mean_token_accuracy": 0.22768062651157378, "num_tokens": 117818244.0, "step": 67920 }, { "entropy": 5.94966835975647, "epoch": 5.284769500097258, "grad_norm": 1.4453125, "learning_rate": 0.0002574793312579592, "loss": 5.0725, "mean_token_accuracy": 0.2102821335196495, "num_tokens": 117827908.0, "step": 67925 }, { "entropy": 5.927512741088867, "epoch": 5.2851585294689745, "grad_norm": 1.375, "learning_rate": 0.00025745169996032317, "loss": 4.9983, "mean_token_accuracy": 0.20632197707891464, "num_tokens": 117836678.0, "step": 67930 }, { "entropy": 5.925325393676758, "epoch": 5.285547558840692, "grad_norm": 1.5, "learning_rate": 0.0002574240689289547, "loss": 4.9022, "mean_token_accuracy": 0.21965862065553665, "num_tokens": 117845132.0, "step": 67935 }, { "entropy": 5.925509595870972, "epoch": 5.28593658821241, "grad_norm": 1.4609375, "learning_rate": 0.00025739643816427305, "loss": 4.9588, "mean_token_accuracy": 0.2124182403087616, "num_tokens": 117854450.0, "step": 67940 }, { "entropy": 5.87840781211853, "epoch": 5.286325617584128, "grad_norm": 1.484375, "learning_rate": 0.0002573688076666974, "loss": 4.9066, "mean_token_accuracy": 0.22372539937496186, "num_tokens": 117863781.0, "step": 67945 }, { "entropy": 5.908760213851929, "epoch": 5.286714646955845, "grad_norm": 1.5390625, "learning_rate": 0.00025734117743664704, "loss": 4.8523, "mean_token_accuracy": 0.22636251002550126, "num_tokens": 117872054.0, "step": 67950 }, { "entropy": 5.850053310394287, "epoch": 5.287103676327563, "grad_norm": 1.5078125, "learning_rate": 0.0002573135474745412, "loss": 4.8353, "mean_token_accuracy": 0.22148197144269943, "num_tokens": 117880095.0, "step": 67955 }, { "entropy": 5.875826692581176, "epoch": 5.287492705699281, "grad_norm": 1.4296875, "learning_rate": 0.00025728591778079906, "loss": 4.9574, "mean_token_accuracy": 0.21551012098789216, "num_tokens": 117889105.0, "step": 67960 }, { "entropy": 5.911121225357055, "epoch": 5.2878817350709975, "grad_norm": 1.6484375, "learning_rate": 0.00025725828835584, "loss": 4.9336, "mean_token_accuracy": 0.22085015922784806, "num_tokens": 117897421.0, "step": 67965 }, { "entropy": 5.9332763671875, "epoch": 5.288270764442715, "grad_norm": 1.40625, "learning_rate": 0.00025723065920008314, "loss": 4.8559, "mean_token_accuracy": 0.2259612798690796, "num_tokens": 117906688.0, "step": 67970 }, { "entropy": 5.928823614120484, "epoch": 5.288659793814433, "grad_norm": 1.59375, "learning_rate": 0.0002572030303139477, "loss": 4.9553, "mean_token_accuracy": 0.21617251634597778, "num_tokens": 117914355.0, "step": 67975 }, { "entropy": 5.8620137691497805, "epoch": 5.2890488231861505, "grad_norm": 1.4921875, "learning_rate": 0.00025717540169785304, "loss": 4.9063, "mean_token_accuracy": 0.21718096882104873, "num_tokens": 117923358.0, "step": 67980 }, { "entropy": 5.840695238113403, "epoch": 5.289437852557868, "grad_norm": 1.4765625, "learning_rate": 0.0002571477733522183, "loss": 4.8766, "mean_token_accuracy": 0.21440148949623108, "num_tokens": 117932258.0, "step": 67985 }, { "entropy": 5.8731626033782955, "epoch": 5.289826881929586, "grad_norm": 1.53125, "learning_rate": 0.00025712014527746264, "loss": 4.874, "mean_token_accuracy": 0.22133521735668182, "num_tokens": 117941357.0, "step": 67990 }, { "entropy": 5.942467069625854, "epoch": 5.290215911301304, "grad_norm": 1.46875, "learning_rate": 0.0002570925174740053, "loss": 5.0308, "mean_token_accuracy": 0.21716598570346832, "num_tokens": 117950737.0, "step": 67995 }, { "entropy": 5.887917327880859, "epoch": 5.2906049406730205, "grad_norm": 1.4296875, "learning_rate": 0.0002570648899422655, "loss": 4.9696, "mean_token_accuracy": 0.21766560077667235, "num_tokens": 117959531.0, "step": 68000 }, { "entropy": 5.893392324447632, "epoch": 5.290993970044738, "grad_norm": 1.4375, "learning_rate": 0.0002570372626826625, "loss": 4.9807, "mean_token_accuracy": 0.21929726749658585, "num_tokens": 117967679.0, "step": 68005 }, { "entropy": 5.798775005340576, "epoch": 5.291382999416456, "grad_norm": 1.484375, "learning_rate": 0.0002570096356956155, "loss": 4.8473, "mean_token_accuracy": 0.22092106491327285, "num_tokens": 117976076.0, "step": 68010 }, { "entropy": 5.8942817687988285, "epoch": 5.2917720287881735, "grad_norm": 1.5390625, "learning_rate": 0.00025698200898154354, "loss": 4.9193, "mean_token_accuracy": 0.2162758782505989, "num_tokens": 117984629.0, "step": 68015 }, { "entropy": 5.920121765136718, "epoch": 5.292161058159891, "grad_norm": 1.40625, "learning_rate": 0.00025695438254086595, "loss": 4.9612, "mean_token_accuracy": 0.22065748572349547, "num_tokens": 117993955.0, "step": 68020 }, { "entropy": 5.8249279975891115, "epoch": 5.292550087531609, "grad_norm": 1.484375, "learning_rate": 0.0002569267563740018, "loss": 4.8436, "mean_token_accuracy": 0.22861330211162567, "num_tokens": 118002239.0, "step": 68025 }, { "entropy": 5.85436520576477, "epoch": 5.292939116903327, "grad_norm": 1.453125, "learning_rate": 0.0002568991304813704, "loss": 4.8758, "mean_token_accuracy": 0.22957465648651124, "num_tokens": 118011622.0, "step": 68030 }, { "entropy": 5.891383504867553, "epoch": 5.2933281462750434, "grad_norm": 1.4609375, "learning_rate": 0.00025687150486339094, "loss": 4.9675, "mean_token_accuracy": 0.2137890487909317, "num_tokens": 118021084.0, "step": 68035 }, { "entropy": 5.9022111892700195, "epoch": 5.293717175646761, "grad_norm": 1.4609375, "learning_rate": 0.00025684387952048247, "loss": 4.9112, "mean_token_accuracy": 0.21629287153482438, "num_tokens": 118029911.0, "step": 68040 }, { "entropy": 5.986558532714843, "epoch": 5.294106205018479, "grad_norm": 1.390625, "learning_rate": 0.00025681625445306435, "loss": 4.9466, "mean_token_accuracy": 0.21188804656267166, "num_tokens": 118037787.0, "step": 68045 }, { "entropy": 5.847724342346192, "epoch": 5.2944952343901965, "grad_norm": 1.4375, "learning_rate": 0.0002567886296615555, "loss": 4.9035, "mean_token_accuracy": 0.21422518342733382, "num_tokens": 118046753.0, "step": 68050 }, { "entropy": 5.856315183639526, "epoch": 5.294884263761914, "grad_norm": 1.5, "learning_rate": 0.00025676100514637523, "loss": 4.9159, "mean_token_accuracy": 0.22548332065343857, "num_tokens": 118055425.0, "step": 68055 }, { "entropy": 5.86829137802124, "epoch": 5.295273293133632, "grad_norm": 1.4765625, "learning_rate": 0.00025673338090794276, "loss": 4.8776, "mean_token_accuracy": 0.22401642054319382, "num_tokens": 118063857.0, "step": 68060 }, { "entropy": 5.826662063598633, "epoch": 5.295662322505349, "grad_norm": 1.5546875, "learning_rate": 0.0002567057569466771, "loss": 4.9536, "mean_token_accuracy": 0.21844796538352967, "num_tokens": 118072243.0, "step": 68065 }, { "entropy": 5.899838495254516, "epoch": 5.296051351877066, "grad_norm": 1.40625, "learning_rate": 0.00025667813326299746, "loss": 4.9622, "mean_token_accuracy": 0.21064009368419648, "num_tokens": 118081019.0, "step": 68070 }, { "entropy": 5.877289295196533, "epoch": 5.296440381248784, "grad_norm": 1.515625, "learning_rate": 0.00025665050985732295, "loss": 4.9385, "mean_token_accuracy": 0.22061519026756288, "num_tokens": 118089662.0, "step": 68075 }, { "entropy": 5.882540559768676, "epoch": 5.296829410620502, "grad_norm": 1.4453125, "learning_rate": 0.00025662288673007286, "loss": 4.8432, "mean_token_accuracy": 0.2262355461716652, "num_tokens": 118098229.0, "step": 68080 }, { "entropy": 5.84581446647644, "epoch": 5.2972184399922195, "grad_norm": 1.359375, "learning_rate": 0.00025659526388166617, "loss": 4.7805, "mean_token_accuracy": 0.23151797652244568, "num_tokens": 118107016.0, "step": 68085 }, { "entropy": 5.870253801345825, "epoch": 5.297607469363937, "grad_norm": 1.5078125, "learning_rate": 0.00025656764131252194, "loss": 4.9379, "mean_token_accuracy": 0.2163043275475502, "num_tokens": 118115090.0, "step": 68090 }, { "entropy": 5.880966472625732, "epoch": 5.297996498735655, "grad_norm": 1.4375, "learning_rate": 0.0002565400190230595, "loss": 4.9184, "mean_token_accuracy": 0.2227540761232376, "num_tokens": 118125044.0, "step": 68095 }, { "entropy": 5.865283393859864, "epoch": 5.298385528107372, "grad_norm": 1.390625, "learning_rate": 0.0002565123970136978, "loss": 4.8864, "mean_token_accuracy": 0.2226044565439224, "num_tokens": 118133609.0, "step": 68100 }, { "entropy": 5.864976501464843, "epoch": 5.298774557479089, "grad_norm": 1.5703125, "learning_rate": 0.0002564847752848562, "loss": 4.9129, "mean_token_accuracy": 0.21915333718061447, "num_tokens": 118142217.0, "step": 68105 }, { "entropy": 5.872900867462159, "epoch": 5.299163586850807, "grad_norm": 1.4765625, "learning_rate": 0.00025645715383695357, "loss": 4.9501, "mean_token_accuracy": 0.221360881626606, "num_tokens": 118150215.0, "step": 68110 }, { "entropy": 5.887674570083618, "epoch": 5.299552616222525, "grad_norm": 1.3671875, "learning_rate": 0.0002564295326704092, "loss": 4.8613, "mean_token_accuracy": 0.22114074230194092, "num_tokens": 118158909.0, "step": 68115 }, { "entropy": 5.890580415725708, "epoch": 5.2999416455942425, "grad_norm": 1.4296875, "learning_rate": 0.0002564019117856421, "loss": 4.9318, "mean_token_accuracy": 0.22198819667100905, "num_tokens": 118168445.0, "step": 68120 }, { "entropy": 5.915107250213623, "epoch": 5.30033067496596, "grad_norm": 1.34375, "learning_rate": 0.00025637429118307133, "loss": 4.9733, "mean_token_accuracy": 0.21482883542776107, "num_tokens": 118177521.0, "step": 68125 }, { "entropy": 5.895406246185303, "epoch": 5.300719704337677, "grad_norm": 1.6015625, "learning_rate": 0.0002563466708631161, "loss": 4.9697, "mean_token_accuracy": 0.21379590332508086, "num_tokens": 118185929.0, "step": 68130 }, { "entropy": 5.895614576339722, "epoch": 5.301108733709395, "grad_norm": 1.4140625, "learning_rate": 0.0002563190508261954, "loss": 4.8797, "mean_token_accuracy": 0.2244717448949814, "num_tokens": 118194758.0, "step": 68135 }, { "entropy": 5.802139854431152, "epoch": 5.301497763081112, "grad_norm": 1.4765625, "learning_rate": 0.00025629143107272837, "loss": 4.83, "mean_token_accuracy": 0.2341532438993454, "num_tokens": 118203496.0, "step": 68140 }, { "entropy": 5.873927354812622, "epoch": 5.30188679245283, "grad_norm": 1.453125, "learning_rate": 0.0002562638116031341, "loss": 4.8851, "mean_token_accuracy": 0.21559060513973236, "num_tokens": 118212348.0, "step": 68145 }, { "entropy": 5.823506212234497, "epoch": 5.302275821824548, "grad_norm": 1.4765625, "learning_rate": 0.0002562361924178317, "loss": 4.7847, "mean_token_accuracy": 0.2399173393845558, "num_tokens": 118220589.0, "step": 68150 }, { "entropy": 5.881532955169678, "epoch": 5.3026648511962655, "grad_norm": 1.53125, "learning_rate": 0.00025620857351724017, "loss": 5.0261, "mean_token_accuracy": 0.21270554959774018, "num_tokens": 118229348.0, "step": 68155 }, { "entropy": 5.905920076370239, "epoch": 5.303053880567983, "grad_norm": 1.53125, "learning_rate": 0.00025618095490177864, "loss": 4.9722, "mean_token_accuracy": 0.22141170799732207, "num_tokens": 118238097.0, "step": 68160 }, { "entropy": 5.8781332015991214, "epoch": 5.303442909939701, "grad_norm": 1.453125, "learning_rate": 0.00025615333657186615, "loss": 4.8421, "mean_token_accuracy": 0.22938079833984376, "num_tokens": 118246724.0, "step": 68165 }, { "entropy": 5.985379552841186, "epoch": 5.303831939311418, "grad_norm": 1.421875, "learning_rate": 0.0002561257185279218, "loss": 5.0332, "mean_token_accuracy": 0.2127864733338356, "num_tokens": 118255832.0, "step": 68170 }, { "entropy": 5.846642923355103, "epoch": 5.304220968683135, "grad_norm": 1.5078125, "learning_rate": 0.00025609810077036467, "loss": 4.8639, "mean_token_accuracy": 0.23114868104457856, "num_tokens": 118265848.0, "step": 68175 }, { "entropy": 5.860721445083618, "epoch": 5.304609998054853, "grad_norm": 1.453125, "learning_rate": 0.0002560704832996137, "loss": 4.8474, "mean_token_accuracy": 0.2232258141040802, "num_tokens": 118273966.0, "step": 68180 }, { "entropy": 5.939294290542603, "epoch": 5.304999027426571, "grad_norm": 1.578125, "learning_rate": 0.0002560428661160881, "loss": 5.0579, "mean_token_accuracy": 0.21015969812870025, "num_tokens": 118282796.0, "step": 68185 }, { "entropy": 5.911509418487549, "epoch": 5.3053880567982885, "grad_norm": 1.453125, "learning_rate": 0.00025601524922020676, "loss": 4.9614, "mean_token_accuracy": 0.21690237522125244, "num_tokens": 118291023.0, "step": 68190 }, { "entropy": 5.8414980411529545, "epoch": 5.305777086170006, "grad_norm": 1.359375, "learning_rate": 0.0002559876326123889, "loss": 4.911, "mean_token_accuracy": 0.2187328338623047, "num_tokens": 118299183.0, "step": 68195 }, { "entropy": 5.911609220504761, "epoch": 5.306166115541723, "grad_norm": 1.5078125, "learning_rate": 0.0002559600162930534, "loss": 4.9622, "mean_token_accuracy": 0.21019780039787292, "num_tokens": 118308001.0, "step": 68200 }, { "entropy": 5.89142165184021, "epoch": 5.306555144913441, "grad_norm": 1.6015625, "learning_rate": 0.0002559324002626193, "loss": 4.8879, "mean_token_accuracy": 0.22005068510770798, "num_tokens": 118316619.0, "step": 68205 }, { "entropy": 5.921667146682739, "epoch": 5.306944174285158, "grad_norm": 1.421875, "learning_rate": 0.0002559047845215057, "loss": 4.9656, "mean_token_accuracy": 0.20941032469272614, "num_tokens": 118325014.0, "step": 68210 }, { "entropy": 5.881661653518677, "epoch": 5.307333203656876, "grad_norm": 1.3515625, "learning_rate": 0.0002558771690701316, "loss": 4.9779, "mean_token_accuracy": 0.2178819641470909, "num_tokens": 118334987.0, "step": 68215 }, { "entropy": 5.82679591178894, "epoch": 5.307722233028594, "grad_norm": 1.515625, "learning_rate": 0.000255849553908916, "loss": 4.8483, "mean_token_accuracy": 0.22475523203611375, "num_tokens": 118343053.0, "step": 68220 }, { "entropy": 5.862268447875977, "epoch": 5.3081112624003115, "grad_norm": 1.40625, "learning_rate": 0.00025582193903827795, "loss": 4.9248, "mean_token_accuracy": 0.22428847551345826, "num_tokens": 118351217.0, "step": 68225 }, { "entropy": 5.908346509933471, "epoch": 5.308500291772029, "grad_norm": 1.484375, "learning_rate": 0.0002557943244586365, "loss": 5.0038, "mean_token_accuracy": 0.21032453924417496, "num_tokens": 118359829.0, "step": 68230 }, { "entropy": 5.93742036819458, "epoch": 5.308889321143746, "grad_norm": 1.375, "learning_rate": 0.00025576671017041053, "loss": 4.9569, "mean_token_accuracy": 0.21180319041013718, "num_tokens": 118369114.0, "step": 68235 }, { "entropy": 5.928803300857544, "epoch": 5.309278350515464, "grad_norm": 1.390625, "learning_rate": 0.0002557390961740192, "loss": 4.9478, "mean_token_accuracy": 0.21763966828584672, "num_tokens": 118377684.0, "step": 68240 }, { "entropy": 5.833543729782105, "epoch": 5.309667379887181, "grad_norm": 1.59375, "learning_rate": 0.00025571148246988137, "loss": 4.8412, "mean_token_accuracy": 0.2290648803114891, "num_tokens": 118385799.0, "step": 68245 }, { "entropy": 5.895347642898559, "epoch": 5.310056409258899, "grad_norm": 1.4609375, "learning_rate": 0.00025568386905841614, "loss": 4.9797, "mean_token_accuracy": 0.2111326426267624, "num_tokens": 118394131.0, "step": 68250 }, { "entropy": 5.84665813446045, "epoch": 5.310445438630617, "grad_norm": 1.4921875, "learning_rate": 0.0002556562559400424, "loss": 4.8971, "mean_token_accuracy": 0.21838960349559783, "num_tokens": 118403795.0, "step": 68255 }, { "entropy": 5.899920320510864, "epoch": 5.3108344680023345, "grad_norm": 1.578125, "learning_rate": 0.0002556286431151792, "loss": 4.9398, "mean_token_accuracy": 0.22230299562215805, "num_tokens": 118412818.0, "step": 68260 }, { "entropy": 5.961867809295654, "epoch": 5.311223497374051, "grad_norm": 1.3828125, "learning_rate": 0.0002556010305842456, "loss": 5.0007, "mean_token_accuracy": 0.21594969928264618, "num_tokens": 118421365.0, "step": 68265 }, { "entropy": 5.881282567977905, "epoch": 5.311612526745769, "grad_norm": 1.453125, "learning_rate": 0.0002555734183476603, "loss": 4.8733, "mean_token_accuracy": 0.21725194454193114, "num_tokens": 118429993.0, "step": 68270 }, { "entropy": 5.914928388595581, "epoch": 5.312001556117487, "grad_norm": 1.5, "learning_rate": 0.0002555458064058427, "loss": 4.9536, "mean_token_accuracy": 0.21357848942279817, "num_tokens": 118438701.0, "step": 68275 }, { "entropy": 5.875366687774658, "epoch": 5.312390585489204, "grad_norm": 1.46875, "learning_rate": 0.00025551819475921135, "loss": 4.9391, "mean_token_accuracy": 0.21513456404209136, "num_tokens": 118447358.0, "step": 68280 }, { "entropy": 5.818239212036133, "epoch": 5.312779614860922, "grad_norm": 1.4296875, "learning_rate": 0.0002554905834081854, "loss": 4.8353, "mean_token_accuracy": 0.22087589800357818, "num_tokens": 118455736.0, "step": 68285 }, { "entropy": 5.940585279464722, "epoch": 5.31316864423264, "grad_norm": 1.5859375, "learning_rate": 0.0002554629723531838, "loss": 4.983, "mean_token_accuracy": 0.21524973213672638, "num_tokens": 118464765.0, "step": 68290 }, { "entropy": 5.8969581604003904, "epoch": 5.3135576736043575, "grad_norm": 1.5, "learning_rate": 0.0002554353615946255, "loss": 4.9079, "mean_token_accuracy": 0.21740695238113403, "num_tokens": 118473181.0, "step": 68295 }, { "entropy": 5.921140384674072, "epoch": 5.313946702976074, "grad_norm": 1.46875, "learning_rate": 0.00025540775113292943, "loss": 4.959, "mean_token_accuracy": 0.22132176756858826, "num_tokens": 118481849.0, "step": 68300 }, { "entropy": 5.835493087768555, "epoch": 5.314335732347792, "grad_norm": 1.40625, "learning_rate": 0.0002553801409685146, "loss": 4.8883, "mean_token_accuracy": 0.227797931432724, "num_tokens": 118491381.0, "step": 68305 }, { "entropy": 5.894591665267944, "epoch": 5.31472476171951, "grad_norm": 1.6953125, "learning_rate": 0.00025535253110179994, "loss": 4.9169, "mean_token_accuracy": 0.21446572989225388, "num_tokens": 118500575.0, "step": 68310 }, { "entropy": 5.813097333908081, "epoch": 5.315113791091227, "grad_norm": 1.4453125, "learning_rate": 0.0002553249215332043, "loss": 4.8068, "mean_token_accuracy": 0.23089618235826492, "num_tokens": 118509037.0, "step": 68315 }, { "entropy": 5.817120027542114, "epoch": 5.315502820462945, "grad_norm": 1.40625, "learning_rate": 0.00025529731226314663, "loss": 4.8055, "mean_token_accuracy": 0.2249295011162758, "num_tokens": 118517397.0, "step": 68320 }, { "entropy": 5.882214975357056, "epoch": 5.315891849834663, "grad_norm": 1.5234375, "learning_rate": 0.0002552697032920459, "loss": 4.9846, "mean_token_accuracy": 0.21396974325180054, "num_tokens": 118525878.0, "step": 68325 }, { "entropy": 5.922155523300171, "epoch": 5.3162808792063805, "grad_norm": 1.5078125, "learning_rate": 0.00025524209462032105, "loss": 4.9402, "mean_token_accuracy": 0.22554733753204345, "num_tokens": 118533615.0, "step": 68330 }, { "entropy": 5.940156650543213, "epoch": 5.316669908578097, "grad_norm": 1.53125, "learning_rate": 0.0002552144862483909, "loss": 5.0256, "mean_token_accuracy": 0.20806398391723632, "num_tokens": 118543149.0, "step": 68335 }, { "entropy": 5.901089668273926, "epoch": 5.317058937949815, "grad_norm": 1.3984375, "learning_rate": 0.0002551868781766745, "loss": 4.9786, "mean_token_accuracy": 0.22267400175333024, "num_tokens": 118551888.0, "step": 68340 }, { "entropy": 5.906593084335327, "epoch": 5.317447967321533, "grad_norm": 1.578125, "learning_rate": 0.0002551592704055907, "loss": 4.9165, "mean_token_accuracy": 0.2153277188539505, "num_tokens": 118560426.0, "step": 68345 }, { "entropy": 5.864302253723144, "epoch": 5.31783699669325, "grad_norm": 1.4609375, "learning_rate": 0.00025513166293555836, "loss": 4.9353, "mean_token_accuracy": 0.2263246327638626, "num_tokens": 118569081.0, "step": 68350 }, { "entropy": 5.981005144119263, "epoch": 5.318226026064968, "grad_norm": 1.546875, "learning_rate": 0.00025510405576699636, "loss": 5.0335, "mean_token_accuracy": 0.2149076282978058, "num_tokens": 118577276.0, "step": 68355 }, { "entropy": 5.875511646270752, "epoch": 5.318615055436686, "grad_norm": 1.484375, "learning_rate": 0.0002550764489003237, "loss": 4.9394, "mean_token_accuracy": 0.21489230990409852, "num_tokens": 118586746.0, "step": 68360 }, { "entropy": 5.970089483261108, "epoch": 5.3190040848084035, "grad_norm": 1.625, "learning_rate": 0.0002550488423359592, "loss": 4.9866, "mean_token_accuracy": 0.21742721796035766, "num_tokens": 118594954.0, "step": 68365 }, { "entropy": 5.946256923675537, "epoch": 5.31939311418012, "grad_norm": 1.5546875, "learning_rate": 0.00025502123607432174, "loss": 4.9776, "mean_token_accuracy": 0.21895347386598588, "num_tokens": 118603282.0, "step": 68370 }, { "entropy": 5.901910877227783, "epoch": 5.319782143551838, "grad_norm": 1.4375, "learning_rate": 0.00025499363011583024, "loss": 4.8861, "mean_token_accuracy": 0.21976556181907653, "num_tokens": 118611571.0, "step": 68375 }, { "entropy": 5.887943935394287, "epoch": 5.320171172923556, "grad_norm": 1.515625, "learning_rate": 0.0002549660244609036, "loss": 4.9492, "mean_token_accuracy": 0.21880963742733, "num_tokens": 118620594.0, "step": 68380 }, { "entropy": 5.972258234024048, "epoch": 5.320560202295273, "grad_norm": 1.4140625, "learning_rate": 0.0002549384191099607, "loss": 4.999, "mean_token_accuracy": 0.21272812634706498, "num_tokens": 118629113.0, "step": 68385 }, { "entropy": 5.840529155731201, "epoch": 5.320949231666991, "grad_norm": 1.5390625, "learning_rate": 0.00025491081406342025, "loss": 4.8914, "mean_token_accuracy": 0.22505107372999192, "num_tokens": 118638111.0, "step": 68390 }, { "entropy": 5.872589826583862, "epoch": 5.321338261038709, "grad_norm": 1.6328125, "learning_rate": 0.00025488320932170127, "loss": 4.9327, "mean_token_accuracy": 0.2110362783074379, "num_tokens": 118646169.0, "step": 68395 }, { "entropy": 5.838713598251343, "epoch": 5.321727290410426, "grad_norm": 1.5546875, "learning_rate": 0.0002548556048852226, "loss": 4.8148, "mean_token_accuracy": 0.22953622788190842, "num_tokens": 118654321.0, "step": 68400 }, { "entropy": 5.885142135620117, "epoch": 5.322116319782143, "grad_norm": 1.4609375, "learning_rate": 0.00025482800075440296, "loss": 4.9568, "mean_token_accuracy": 0.21816242039203643, "num_tokens": 118663177.0, "step": 68405 }, { "entropy": 5.860215568542481, "epoch": 5.322505349153861, "grad_norm": 1.484375, "learning_rate": 0.0002548003969296614, "loss": 4.8833, "mean_token_accuracy": 0.22706662565469743, "num_tokens": 118671159.0, "step": 68410 }, { "entropy": 5.844998216629028, "epoch": 5.322894378525579, "grad_norm": 1.5078125, "learning_rate": 0.00025477279341141665, "loss": 4.9114, "mean_token_accuracy": 0.21758589893579483, "num_tokens": 118679955.0, "step": 68415 }, { "entropy": 5.847661781311035, "epoch": 5.323283407897296, "grad_norm": 1.4375, "learning_rate": 0.0002547451902000875, "loss": 4.8896, "mean_token_accuracy": 0.21909790635108947, "num_tokens": 118689222.0, "step": 68420 }, { "entropy": 5.8374275207519535, "epoch": 5.323672437269014, "grad_norm": 1.5234375, "learning_rate": 0.00025471758729609284, "loss": 4.8746, "mean_token_accuracy": 0.2160216525197029, "num_tokens": 118698177.0, "step": 68425 }, { "entropy": 5.846771669387818, "epoch": 5.324061466640732, "grad_norm": 1.4140625, "learning_rate": 0.00025468998469985155, "loss": 4.8764, "mean_token_accuracy": 0.21855004578828813, "num_tokens": 118706699.0, "step": 68430 }, { "entropy": 5.809262466430664, "epoch": 5.324450496012449, "grad_norm": 1.40625, "learning_rate": 0.0002546623824117824, "loss": 4.7656, "mean_token_accuracy": 0.2333296298980713, "num_tokens": 118715469.0, "step": 68435 }, { "entropy": 5.886678838729859, "epoch": 5.324839525384166, "grad_norm": 1.40625, "learning_rate": 0.0002546347804323043, "loss": 4.9175, "mean_token_accuracy": 0.2199527993798256, "num_tokens": 118723765.0, "step": 68440 }, { "entropy": 5.865315914154053, "epoch": 5.325228554755884, "grad_norm": 1.46875, "learning_rate": 0.0002546071787618359, "loss": 4.9346, "mean_token_accuracy": 0.2208289161324501, "num_tokens": 118733011.0, "step": 68445 }, { "entropy": 5.835000896453858, "epoch": 5.325617584127602, "grad_norm": 1.515625, "learning_rate": 0.0002545795774007962, "loss": 4.7844, "mean_token_accuracy": 0.2351594462990761, "num_tokens": 118741437.0, "step": 68450 }, { "entropy": 5.864903402328491, "epoch": 5.326006613499319, "grad_norm": 1.4609375, "learning_rate": 0.0002545519763496038, "loss": 4.8308, "mean_token_accuracy": 0.22937202751636504, "num_tokens": 118750423.0, "step": 68455 }, { "entropy": 5.905500173568726, "epoch": 5.326395642871037, "grad_norm": 1.5234375, "learning_rate": 0.00025452437560867774, "loss": 4.9578, "mean_token_accuracy": 0.21856200098991393, "num_tokens": 118759005.0, "step": 68460 }, { "entropy": 5.9192205429077145, "epoch": 5.326784672242754, "grad_norm": 1.3984375, "learning_rate": 0.0002544967751784367, "loss": 4.942, "mean_token_accuracy": 0.21852443218231202, "num_tokens": 118767273.0, "step": 68465 }, { "entropy": 5.992331314086914, "epoch": 5.327173701614472, "grad_norm": 1.4609375, "learning_rate": 0.00025446917505929937, "loss": 5.0754, "mean_token_accuracy": 0.21180498450994492, "num_tokens": 118777153.0, "step": 68470 }, { "entropy": 5.910095882415772, "epoch": 5.327562730986189, "grad_norm": 1.6484375, "learning_rate": 0.0002544415752516846, "loss": 4.9543, "mean_token_accuracy": 0.21108947694301605, "num_tokens": 118786819.0, "step": 68475 }, { "entropy": 5.851808357238769, "epoch": 5.327951760357907, "grad_norm": 1.53125, "learning_rate": 0.00025441397575601125, "loss": 4.8451, "mean_token_accuracy": 0.22210266888141633, "num_tokens": 118795444.0, "step": 68480 }, { "entropy": 5.925428152084351, "epoch": 5.328340789729625, "grad_norm": 1.4609375, "learning_rate": 0.00025438637657269805, "loss": 5.037, "mean_token_accuracy": 0.20812795013189317, "num_tokens": 118804539.0, "step": 68485 }, { "entropy": 5.834197664260865, "epoch": 5.328729819101342, "grad_norm": 1.453125, "learning_rate": 0.0002543587777021636, "loss": 4.8934, "mean_token_accuracy": 0.22053764015436172, "num_tokens": 118812799.0, "step": 68490 }, { "entropy": 5.921358346939087, "epoch": 5.32911884847306, "grad_norm": 1.6875, "learning_rate": 0.0002543311791448271, "loss": 4.9497, "mean_token_accuracy": 0.2165755197405815, "num_tokens": 118821415.0, "step": 68495 }, { "entropy": 5.926783800125122, "epoch": 5.329507877844778, "grad_norm": 1.625, "learning_rate": 0.00025430358090110705, "loss": 4.9574, "mean_token_accuracy": 0.2162941262125969, "num_tokens": 118829354.0, "step": 68500 }, { "entropy": 5.8595507621765135, "epoch": 5.329896907216495, "grad_norm": 1.4921875, "learning_rate": 0.00025427598297142213, "loss": 4.9042, "mean_token_accuracy": 0.22090301811695098, "num_tokens": 118837924.0, "step": 68505 }, { "entropy": 5.9099733352661135, "epoch": 5.330285936588212, "grad_norm": 1.4921875, "learning_rate": 0.0002542483853561912, "loss": 4.9849, "mean_token_accuracy": 0.21547487676143645, "num_tokens": 118847342.0, "step": 68510 }, { "entropy": 5.8886724472045895, "epoch": 5.33067496595993, "grad_norm": 1.4296875, "learning_rate": 0.000254220788055833, "loss": 4.8745, "mean_token_accuracy": 0.22894565910100936, "num_tokens": 118856135.0, "step": 68515 }, { "entropy": 5.9507856369018555, "epoch": 5.331063995331648, "grad_norm": 1.46875, "learning_rate": 0.0002541931910707662, "loss": 4.9176, "mean_token_accuracy": 0.21925931870937349, "num_tokens": 118864898.0, "step": 68520 }, { "entropy": 5.87237663269043, "epoch": 5.331453024703365, "grad_norm": 1.3515625, "learning_rate": 0.0002541655944014097, "loss": 4.8462, "mean_token_accuracy": 0.2275308445096016, "num_tokens": 118874276.0, "step": 68525 }, { "entropy": 5.882525968551636, "epoch": 5.331842054075083, "grad_norm": 1.4296875, "learning_rate": 0.0002541379980481821, "loss": 4.9835, "mean_token_accuracy": 0.21678184866905212, "num_tokens": 118883315.0, "step": 68530 }, { "entropy": 5.94589409828186, "epoch": 5.3322310834468, "grad_norm": 1.4921875, "learning_rate": 0.0002541104020115022, "loss": 5.0269, "mean_token_accuracy": 0.21140984296798707, "num_tokens": 118891228.0, "step": 68535 }, { "entropy": 5.88700385093689, "epoch": 5.3326201128185176, "grad_norm": 1.40625, "learning_rate": 0.00025408280629178864, "loss": 4.8951, "mean_token_accuracy": 0.22441271245479583, "num_tokens": 118899757.0, "step": 68540 }, { "entropy": 5.873735952377319, "epoch": 5.333009142190235, "grad_norm": 1.328125, "learning_rate": 0.0002540552108894603, "loss": 4.8854, "mean_token_accuracy": 0.2203931987285614, "num_tokens": 118908723.0, "step": 68545 }, { "entropy": 5.77337965965271, "epoch": 5.333398171561953, "grad_norm": 1.4453125, "learning_rate": 0.0002540276158049358, "loss": 4.7652, "mean_token_accuracy": 0.23447226881980895, "num_tokens": 118917711.0, "step": 68550 }, { "entropy": 5.821710443496704, "epoch": 5.333787200933671, "grad_norm": 1.6015625, "learning_rate": 0.00025400002103863367, "loss": 4.8572, "mean_token_accuracy": 0.22639009803533555, "num_tokens": 118925970.0, "step": 68555 }, { "entropy": 5.892201709747314, "epoch": 5.334176230305388, "grad_norm": 1.4296875, "learning_rate": 0.00025397242659097293, "loss": 4.9622, "mean_token_accuracy": 0.21569897085428238, "num_tokens": 118934747.0, "step": 68560 }, { "entropy": 5.930914402008057, "epoch": 5.334565259677106, "grad_norm": 1.53125, "learning_rate": 0.0002539448324623722, "loss": 4.9073, "mean_token_accuracy": 0.2148421123623848, "num_tokens": 118943206.0, "step": 68565 }, { "entropy": 5.965063571929932, "epoch": 5.334954289048823, "grad_norm": 1.4765625, "learning_rate": 0.00025391723865325, "loss": 4.9458, "mean_token_accuracy": 0.22332533150911332, "num_tokens": 118951751.0, "step": 68570 }, { "entropy": 5.876570701599121, "epoch": 5.3353433184205405, "grad_norm": 1.3359375, "learning_rate": 0.00025388964516402527, "loss": 4.9073, "mean_token_accuracy": 0.22254080772399903, "num_tokens": 118960297.0, "step": 68575 }, { "entropy": 5.871348237991333, "epoch": 5.335732347792258, "grad_norm": 1.484375, "learning_rate": 0.0002538620519951165, "loss": 4.9432, "mean_token_accuracy": 0.21320126652717591, "num_tokens": 118969283.0, "step": 68580 }, { "entropy": 5.824328947067261, "epoch": 5.336121377163976, "grad_norm": 1.40625, "learning_rate": 0.00025383445914694245, "loss": 4.811, "mean_token_accuracy": 0.22077952474355697, "num_tokens": 118977946.0, "step": 68585 }, { "entropy": 5.859393692016601, "epoch": 5.336510406535694, "grad_norm": 1.5, "learning_rate": 0.0002538068666199218, "loss": 4.8679, "mean_token_accuracy": 0.22745316177606584, "num_tokens": 118986303.0, "step": 68590 }, { "entropy": 5.924205732345581, "epoch": 5.336899435907411, "grad_norm": 1.484375, "learning_rate": 0.0002537792744144732, "loss": 4.9942, "mean_token_accuracy": 0.20896050184965134, "num_tokens": 118995174.0, "step": 68595 }, { "entropy": 5.887504005432129, "epoch": 5.337288465279128, "grad_norm": 1.3828125, "learning_rate": 0.0002537516825310154, "loss": 4.9943, "mean_token_accuracy": 0.21333954632282257, "num_tokens": 119004849.0, "step": 68600 }, { "entropy": 5.8827667236328125, "epoch": 5.337677494650846, "grad_norm": 1.546875, "learning_rate": 0.0002537240909699669, "loss": 4.9066, "mean_token_accuracy": 0.2223087877035141, "num_tokens": 119013423.0, "step": 68605 }, { "entropy": 5.875261735916138, "epoch": 5.3380665240225635, "grad_norm": 1.5234375, "learning_rate": 0.0002536964997317465, "loss": 4.8914, "mean_token_accuracy": 0.2201731786131859, "num_tokens": 119021422.0, "step": 68610 }, { "entropy": 5.83810715675354, "epoch": 5.338455553394281, "grad_norm": 1.4375, "learning_rate": 0.00025366890881677284, "loss": 4.8352, "mean_token_accuracy": 0.22475724220275878, "num_tokens": 119029306.0, "step": 68615 }, { "entropy": 5.934020948410034, "epoch": 5.338844582765999, "grad_norm": 1.4765625, "learning_rate": 0.0002536413182254645, "loss": 4.9609, "mean_token_accuracy": 0.2176676169037819, "num_tokens": 119037768.0, "step": 68620 }, { "entropy": 5.880868148803711, "epoch": 5.339233612137717, "grad_norm": 1.53125, "learning_rate": 0.00025361372795824015, "loss": 4.907, "mean_token_accuracy": 0.21996604800224304, "num_tokens": 119045902.0, "step": 68625 }, { "entropy": 5.858265686035156, "epoch": 5.339622641509434, "grad_norm": 1.375, "learning_rate": 0.0002535861380155185, "loss": 4.9209, "mean_token_accuracy": 0.22123787999153138, "num_tokens": 119054245.0, "step": 68630 }, { "entropy": 5.828171586990356, "epoch": 5.340011670881151, "grad_norm": 1.3671875, "learning_rate": 0.00025355854839771805, "loss": 4.8228, "mean_token_accuracy": 0.22752593755722045, "num_tokens": 119062957.0, "step": 68635 }, { "entropy": 5.898113441467285, "epoch": 5.340400700252869, "grad_norm": 1.46875, "learning_rate": 0.00025353095910525753, "loss": 4.9898, "mean_token_accuracy": 0.2094024732708931, "num_tokens": 119073209.0, "step": 68640 }, { "entropy": 5.860943031311035, "epoch": 5.3407897296245865, "grad_norm": 1.7109375, "learning_rate": 0.0002535033701385555, "loss": 4.8461, "mean_token_accuracy": 0.22649920284748076, "num_tokens": 119081493.0, "step": 68645 }, { "entropy": 5.901688575744629, "epoch": 5.341178758996304, "grad_norm": 1.390625, "learning_rate": 0.0002534757814980307, "loss": 5.0048, "mean_token_accuracy": 0.21407009959220885, "num_tokens": 119090703.0, "step": 68650 }, { "entropy": 5.957004499435425, "epoch": 5.341567788368022, "grad_norm": 1.4609375, "learning_rate": 0.00025344819318410167, "loss": 5.0021, "mean_token_accuracy": 0.21590329557657242, "num_tokens": 119099599.0, "step": 68655 }, { "entropy": 5.952355003356933, "epoch": 5.34195681773974, "grad_norm": 1.4765625, "learning_rate": 0.00025342060519718693, "loss": 4.9804, "mean_token_accuracy": 0.21975032538175582, "num_tokens": 119108329.0, "step": 68660 }, { "entropy": 5.900430727005005, "epoch": 5.342345847111457, "grad_norm": 1.5625, "learning_rate": 0.00025339301753770515, "loss": 4.933, "mean_token_accuracy": 0.2170292168855667, "num_tokens": 119117034.0, "step": 68665 }, { "entropy": 5.82502589225769, "epoch": 5.342734876483174, "grad_norm": 1.4140625, "learning_rate": 0.000253365430206075, "loss": 4.9105, "mean_token_accuracy": 0.2162778303027153, "num_tokens": 119126316.0, "step": 68670 }, { "entropy": 5.829318189620972, "epoch": 5.343123905854892, "grad_norm": 1.390625, "learning_rate": 0.0002533378432027149, "loss": 4.8528, "mean_token_accuracy": 0.22669486105442047, "num_tokens": 119134740.0, "step": 68675 }, { "entropy": 5.874153518676758, "epoch": 5.3435129352266095, "grad_norm": 1.4609375, "learning_rate": 0.0002533102565280437, "loss": 4.898, "mean_token_accuracy": 0.22926861494779588, "num_tokens": 119143841.0, "step": 68680 }, { "entropy": 5.871552324295044, "epoch": 5.343901964598327, "grad_norm": 1.53125, "learning_rate": 0.0002532826701824797, "loss": 4.9057, "mean_token_accuracy": 0.21307575851678848, "num_tokens": 119151697.0, "step": 68685 }, { "entropy": 5.952570962905884, "epoch": 5.344290993970045, "grad_norm": 1.546875, "learning_rate": 0.0002532550841664416, "loss": 5.0079, "mean_token_accuracy": 0.2164118230342865, "num_tokens": 119160705.0, "step": 68690 }, { "entropy": 5.847532033920288, "epoch": 5.344680023341763, "grad_norm": 1.5, "learning_rate": 0.0002532274984803481, "loss": 4.9046, "mean_token_accuracy": 0.21675250679254532, "num_tokens": 119168969.0, "step": 68695 }, { "entropy": 5.965555620193482, "epoch": 5.34506905271348, "grad_norm": 1.6015625, "learning_rate": 0.0002531999131246176, "loss": 4.9892, "mean_token_accuracy": 0.21198669224977493, "num_tokens": 119176948.0, "step": 68700 }, { "entropy": 5.872636938095093, "epoch": 5.345458082085197, "grad_norm": 1.4453125, "learning_rate": 0.0002531723280996687, "loss": 4.9221, "mean_token_accuracy": 0.21458568722009658, "num_tokens": 119184978.0, "step": 68705 }, { "entropy": 5.84907546043396, "epoch": 5.345847111456915, "grad_norm": 1.4921875, "learning_rate": 0.00025314474340592, "loss": 4.9497, "mean_token_accuracy": 0.2155911609530449, "num_tokens": 119193646.0, "step": 68710 }, { "entropy": 5.88135871887207, "epoch": 5.3462361408286325, "grad_norm": 1.4765625, "learning_rate": 0.00025311715904379004, "loss": 5.0064, "mean_token_accuracy": 0.21183569580316544, "num_tokens": 119202733.0, "step": 68715 }, { "entropy": 5.863332223892212, "epoch": 5.34662517020035, "grad_norm": 1.3984375, "learning_rate": 0.00025308957501369737, "loss": 4.8614, "mean_token_accuracy": 0.23205315172672272, "num_tokens": 119211312.0, "step": 68720 }, { "entropy": 5.856861639022827, "epoch": 5.347014199572068, "grad_norm": 1.4921875, "learning_rate": 0.00025306199131606055, "loss": 4.9494, "mean_token_accuracy": 0.21553645730018617, "num_tokens": 119219874.0, "step": 68725 }, { "entropy": 5.869893026351929, "epoch": 5.347403228943786, "grad_norm": 1.375, "learning_rate": 0.0002530344079512981, "loss": 4.9879, "mean_token_accuracy": 0.2119730904698372, "num_tokens": 119229589.0, "step": 68730 }, { "entropy": 5.84339656829834, "epoch": 5.347792258315502, "grad_norm": 1.5078125, "learning_rate": 0.00025300682491982853, "loss": 4.8472, "mean_token_accuracy": 0.22014718353748322, "num_tokens": 119237811.0, "step": 68735 }, { "entropy": 5.881813907623291, "epoch": 5.34818128768722, "grad_norm": 1.5234375, "learning_rate": 0.0002529792422220704, "loss": 4.91, "mean_token_accuracy": 0.22206678986549377, "num_tokens": 119245980.0, "step": 68740 }, { "entropy": 5.914845418930054, "epoch": 5.348570317058938, "grad_norm": 1.375, "learning_rate": 0.00025295165985844215, "loss": 5.012, "mean_token_accuracy": 0.21366143822669983, "num_tokens": 119255757.0, "step": 68745 }, { "entropy": 5.812852764129639, "epoch": 5.3489593464306555, "grad_norm": 1.46875, "learning_rate": 0.0002529240778293624, "loss": 4.8626, "mean_token_accuracy": 0.22038663178682327, "num_tokens": 119264446.0, "step": 68750 }, { "entropy": 5.8950036525726315, "epoch": 5.349348375802373, "grad_norm": 1.484375, "learning_rate": 0.00025289649613524954, "loss": 4.9088, "mean_token_accuracy": 0.2230082258582115, "num_tokens": 119272904.0, "step": 68755 }, { "entropy": 5.83568754196167, "epoch": 5.349737405174091, "grad_norm": 1.5078125, "learning_rate": 0.0002528689147765223, "loss": 4.8585, "mean_token_accuracy": 0.22607823461294174, "num_tokens": 119281127.0, "step": 68760 }, { "entropy": 5.877138757705689, "epoch": 5.350126434545809, "grad_norm": 1.5703125, "learning_rate": 0.00025284133375359904, "loss": 4.8968, "mean_token_accuracy": 0.21732288748025894, "num_tokens": 119289362.0, "step": 68765 }, { "entropy": 5.819321250915527, "epoch": 5.350515463917525, "grad_norm": 1.3828125, "learning_rate": 0.00025281375306689824, "loss": 4.8542, "mean_token_accuracy": 0.22518203258514405, "num_tokens": 119298551.0, "step": 68770 }, { "entropy": 5.889164018630981, "epoch": 5.350904493289243, "grad_norm": 1.453125, "learning_rate": 0.00025278617271683846, "loss": 4.8312, "mean_token_accuracy": 0.22748586982488633, "num_tokens": 119307291.0, "step": 68775 }, { "entropy": 5.916347074508667, "epoch": 5.351293522660961, "grad_norm": 1.609375, "learning_rate": 0.0002527585927038381, "loss": 4.8614, "mean_token_accuracy": 0.2251664087176323, "num_tokens": 119315811.0, "step": 68780 }, { "entropy": 5.893291473388672, "epoch": 5.3516825520326785, "grad_norm": 1.59375, "learning_rate": 0.00025273101302831575, "loss": 4.9411, "mean_token_accuracy": 0.21012038439512254, "num_tokens": 119323936.0, "step": 68785 }, { "entropy": 5.8305823802948, "epoch": 5.352071581404396, "grad_norm": 1.484375, "learning_rate": 0.00025270343369068976, "loss": 4.8835, "mean_token_accuracy": 0.21994901746511458, "num_tokens": 119332752.0, "step": 68790 }, { "entropy": 5.809795188903808, "epoch": 5.352460610776114, "grad_norm": 1.390625, "learning_rate": 0.0002526758546913787, "loss": 4.8147, "mean_token_accuracy": 0.22716590911149978, "num_tokens": 119341591.0, "step": 68795 }, { "entropy": 5.893950748443603, "epoch": 5.352849640147831, "grad_norm": 1.515625, "learning_rate": 0.0002526482760308011, "loss": 4.9966, "mean_token_accuracy": 0.21745316237211226, "num_tokens": 119351190.0, "step": 68800 }, { "entropy": 5.900557565689087, "epoch": 5.353238669519548, "grad_norm": 1.46875, "learning_rate": 0.00025262069770937525, "loss": 4.8892, "mean_token_accuracy": 0.22687359154224396, "num_tokens": 119360306.0, "step": 68805 }, { "entropy": 5.824986314773559, "epoch": 5.353627698891266, "grad_norm": 1.4609375, "learning_rate": 0.0002525931197275197, "loss": 4.8878, "mean_token_accuracy": 0.22688221037387848, "num_tokens": 119369196.0, "step": 68810 }, { "entropy": 5.880152940750122, "epoch": 5.354016728262984, "grad_norm": 1.3984375, "learning_rate": 0.00025256554208565296, "loss": 4.9939, "mean_token_accuracy": 0.2100459471344948, "num_tokens": 119377671.0, "step": 68815 }, { "entropy": 5.86359133720398, "epoch": 5.3544057576347015, "grad_norm": 1.4296875, "learning_rate": 0.00025253796478419323, "loss": 4.9209, "mean_token_accuracy": 0.2237601950764656, "num_tokens": 119386853.0, "step": 68820 }, { "entropy": 5.929996013641357, "epoch": 5.354794787006419, "grad_norm": 1.4609375, "learning_rate": 0.0002525103878235593, "loss": 4.9646, "mean_token_accuracy": 0.21045673936605452, "num_tokens": 119395894.0, "step": 68825 }, { "entropy": 5.9023144245147705, "epoch": 5.355183816378137, "grad_norm": 1.4296875, "learning_rate": 0.0002524828112041694, "loss": 4.9224, "mean_token_accuracy": 0.21858870834112168, "num_tokens": 119404035.0, "step": 68830 }, { "entropy": 5.919142389297486, "epoch": 5.355572845749854, "grad_norm": 1.546875, "learning_rate": 0.00025245523492644197, "loss": 4.9521, "mean_token_accuracy": 0.2167753279209137, "num_tokens": 119413547.0, "step": 68835 }, { "entropy": 5.932954549789429, "epoch": 5.355961875121571, "grad_norm": 1.4609375, "learning_rate": 0.0002524276589907955, "loss": 4.9737, "mean_token_accuracy": 0.2163742184638977, "num_tokens": 119422204.0, "step": 68840 }, { "entropy": 5.919292640686035, "epoch": 5.356350904493289, "grad_norm": 1.5703125, "learning_rate": 0.00025240008339764844, "loss": 4.9368, "mean_token_accuracy": 0.21403691321611404, "num_tokens": 119430858.0, "step": 68845 }, { "entropy": 5.8192863941192625, "epoch": 5.356739933865007, "grad_norm": 1.359375, "learning_rate": 0.000252372508147419, "loss": 4.8342, "mean_token_accuracy": 0.22788862884044647, "num_tokens": 119439525.0, "step": 68850 }, { "entropy": 5.934349822998047, "epoch": 5.3571289632367245, "grad_norm": 1.5, "learning_rate": 0.0002523449332405258, "loss": 4.9853, "mean_token_accuracy": 0.20827164500951767, "num_tokens": 119447131.0, "step": 68855 }, { "entropy": 5.874726390838623, "epoch": 5.357517992608442, "grad_norm": 1.3984375, "learning_rate": 0.0002523173586773872, "loss": 4.9535, "mean_token_accuracy": 0.21438563019037246, "num_tokens": 119455599.0, "step": 68860 }, { "entropy": 5.879022264480591, "epoch": 5.35790702198016, "grad_norm": 1.4765625, "learning_rate": 0.0002522897844584216, "loss": 4.9566, "mean_token_accuracy": 0.21701999604701996, "num_tokens": 119463786.0, "step": 68865 }, { "entropy": 5.908893871307373, "epoch": 5.358296051351877, "grad_norm": 1.3984375, "learning_rate": 0.00025226221058404733, "loss": 4.9604, "mean_token_accuracy": 0.22020077854394912, "num_tokens": 119472432.0, "step": 68870 }, { "entropy": 5.922171783447266, "epoch": 5.358685080723594, "grad_norm": 1.4765625, "learning_rate": 0.0002522346370546828, "loss": 4.982, "mean_token_accuracy": 0.216733418405056, "num_tokens": 119482020.0, "step": 68875 }, { "entropy": 5.880100440979004, "epoch": 5.359074110095312, "grad_norm": 1.6171875, "learning_rate": 0.0002522070638707465, "loss": 4.9545, "mean_token_accuracy": 0.21981246620416642, "num_tokens": 119490150.0, "step": 68880 }, { "entropy": 5.888078212738037, "epoch": 5.35946313946703, "grad_norm": 1.390625, "learning_rate": 0.00025217949103265665, "loss": 4.9408, "mean_token_accuracy": 0.21875652223825454, "num_tokens": 119498463.0, "step": 68885 }, { "entropy": 5.892721891403198, "epoch": 5.3598521688387475, "grad_norm": 1.46875, "learning_rate": 0.00025215191854083166, "loss": 5.027, "mean_token_accuracy": 0.2122641071677208, "num_tokens": 119507429.0, "step": 68890 }, { "entropy": 5.858903551101685, "epoch": 5.360241198210465, "grad_norm": 1.4765625, "learning_rate": 0.00025212434639568996, "loss": 4.8114, "mean_token_accuracy": 0.2265573501586914, "num_tokens": 119516666.0, "step": 68895 }, { "entropy": 5.89514741897583, "epoch": 5.360630227582183, "grad_norm": 1.40625, "learning_rate": 0.00025209677459765, "loss": 4.8884, "mean_token_accuracy": 0.2195172354578972, "num_tokens": 119525842.0, "step": 68900 }, { "entropy": 5.8139424324035645, "epoch": 5.3610192569539, "grad_norm": 1.3828125, "learning_rate": 0.0002520692031471299, "loss": 4.758, "mean_token_accuracy": 0.23216582387685775, "num_tokens": 119534225.0, "step": 68905 }, { "entropy": 5.904566049575806, "epoch": 5.361408286325617, "grad_norm": 1.671875, "learning_rate": 0.00025204163204454826, "loss": 4.935, "mean_token_accuracy": 0.21795859038829804, "num_tokens": 119542146.0, "step": 68910 }, { "entropy": 5.832619714736938, "epoch": 5.361797315697335, "grad_norm": 1.390625, "learning_rate": 0.0002520140612903233, "loss": 4.8474, "mean_token_accuracy": 0.2214763343334198, "num_tokens": 119550289.0, "step": 68915 }, { "entropy": 5.840014123916626, "epoch": 5.362186345069053, "grad_norm": 1.4453125, "learning_rate": 0.0002519864908848733, "loss": 4.8411, "mean_token_accuracy": 0.22868757843971252, "num_tokens": 119558710.0, "step": 68920 }, { "entropy": 5.854184150695801, "epoch": 5.3625753744407705, "grad_norm": 1.609375, "learning_rate": 0.00025195892082861674, "loss": 4.8872, "mean_token_accuracy": 0.2257773369550705, "num_tokens": 119567702.0, "step": 68925 }, { "entropy": 5.846275711059571, "epoch": 5.362964403812488, "grad_norm": 1.6171875, "learning_rate": 0.0002519313511219719, "loss": 4.8692, "mean_token_accuracy": 0.21893164217472078, "num_tokens": 119576197.0, "step": 68930 }, { "entropy": 5.853884601593018, "epoch": 5.363353433184205, "grad_norm": 1.3828125, "learning_rate": 0.00025190378176535703, "loss": 4.8499, "mean_token_accuracy": 0.22229641526937485, "num_tokens": 119584624.0, "step": 68935 }, { "entropy": 5.91581654548645, "epoch": 5.363742462555923, "grad_norm": 1.46875, "learning_rate": 0.0002518762127591905, "loss": 4.9591, "mean_token_accuracy": 0.21773041486740113, "num_tokens": 119593741.0, "step": 68940 }, { "entropy": 5.842016410827637, "epoch": 5.36413149192764, "grad_norm": 1.4765625, "learning_rate": 0.0002518486441038907, "loss": 4.8922, "mean_token_accuracy": 0.21947795897722244, "num_tokens": 119602288.0, "step": 68945 }, { "entropy": 5.898153352737427, "epoch": 5.364520521299358, "grad_norm": 1.4765625, "learning_rate": 0.0002518210757998758, "loss": 4.9438, "mean_token_accuracy": 0.21633385270833969, "num_tokens": 119610787.0, "step": 68950 }, { "entropy": 5.890827369689942, "epoch": 5.364909550671076, "grad_norm": 1.375, "learning_rate": 0.0002517935078475642, "loss": 4.8543, "mean_token_accuracy": 0.22389369308948517, "num_tokens": 119619175.0, "step": 68955 }, { "entropy": 5.81711163520813, "epoch": 5.3652985800427935, "grad_norm": 1.484375, "learning_rate": 0.0002517659402473742, "loss": 4.8534, "mean_token_accuracy": 0.22528464198112488, "num_tokens": 119627828.0, "step": 68960 }, { "entropy": 5.800579404830932, "epoch": 5.365687609414511, "grad_norm": 1.421875, "learning_rate": 0.0002517383729997241, "loss": 4.7721, "mean_token_accuracy": 0.23346325159072875, "num_tokens": 119635639.0, "step": 68965 }, { "entropy": 5.845604419708252, "epoch": 5.366076638786228, "grad_norm": 1.4375, "learning_rate": 0.0002517108061050321, "loss": 4.923, "mean_token_accuracy": 0.21171995401382446, "num_tokens": 119644807.0, "step": 68970 }, { "entropy": 5.866562175750732, "epoch": 5.366465668157946, "grad_norm": 1.375, "learning_rate": 0.00025168323956371657, "loss": 4.8495, "mean_token_accuracy": 0.22503067553043365, "num_tokens": 119653409.0, "step": 68975 }, { "entropy": 5.82502121925354, "epoch": 5.366854697529663, "grad_norm": 1.4765625, "learning_rate": 0.00025165567337619583, "loss": 4.8233, "mean_token_accuracy": 0.2237764850258827, "num_tokens": 119661703.0, "step": 68980 }, { "entropy": 5.994072723388672, "epoch": 5.367243726901381, "grad_norm": 1.4921875, "learning_rate": 0.000251628107542888, "loss": 5.0267, "mean_token_accuracy": 0.213287852704525, "num_tokens": 119669853.0, "step": 68985 }, { "entropy": 5.9194553852081295, "epoch": 5.367632756273099, "grad_norm": 1.7109375, "learning_rate": 0.00025160054206421143, "loss": 5.0075, "mean_token_accuracy": 0.207281956076622, "num_tokens": 119679035.0, "step": 68990 }, { "entropy": 5.8558997631073, "epoch": 5.3680217856448165, "grad_norm": 1.4765625, "learning_rate": 0.0002515729769405845, "loss": 4.9377, "mean_token_accuracy": 0.21935223042964935, "num_tokens": 119687213.0, "step": 68995 }, { "entropy": 5.877433490753174, "epoch": 5.368410815016533, "grad_norm": 1.5703125, "learning_rate": 0.0002515454121724253, "loss": 4.9352, "mean_token_accuracy": 0.21387919783592224, "num_tokens": 119695751.0, "step": 69000 }, { "epoch": 5.368410815016533, "eval_entropy": 5.566619871853635, "eval_loss": 5.029155731201172, "eval_mean_token_accuracy": 0.22246949281740694, "eval_num_tokens": 119695751.0, "eval_runtime": 22.0426, "eval_samples_per_second": 1885.349, "eval_steps_per_second": 235.68, "step": 69000 }, { "entropy": 5.877942895889282, "epoch": 5.368799844388251, "grad_norm": 1.4375, "learning_rate": 0.00025151784776015216, "loss": 4.8869, "mean_token_accuracy": 0.21971699148416518, "num_tokens": 119704242.0, "step": 69005 }, { "entropy": 5.812563419342041, "epoch": 5.369188873759969, "grad_norm": 1.5625, "learning_rate": 0.0002514902837041833, "loss": 4.7782, "mean_token_accuracy": 0.22920262962579727, "num_tokens": 119712677.0, "step": 69010 }, { "entropy": 5.849329137802124, "epoch": 5.369577903131686, "grad_norm": 1.3984375, "learning_rate": 0.00025146272000493695, "loss": 4.8705, "mean_token_accuracy": 0.2273086354136467, "num_tokens": 119721594.0, "step": 69015 }, { "entropy": 5.90934190750122, "epoch": 5.369966932503404, "grad_norm": 1.5625, "learning_rate": 0.0002514351566628313, "loss": 4.8923, "mean_token_accuracy": 0.22464912086725236, "num_tokens": 119729917.0, "step": 69020 }, { "entropy": 5.832656192779541, "epoch": 5.370355961875122, "grad_norm": 1.4921875, "learning_rate": 0.0002514075936782847, "loss": 4.875, "mean_token_accuracy": 0.22217466980218886, "num_tokens": 119737940.0, "step": 69025 }, { "entropy": 5.865193557739258, "epoch": 5.3707449912468395, "grad_norm": 1.6015625, "learning_rate": 0.0002513800310517153, "loss": 4.9694, "mean_token_accuracy": 0.21317492425441742, "num_tokens": 119746843.0, "step": 69030 }, { "entropy": 5.817890930175781, "epoch": 5.371134020618557, "grad_norm": 1.4921875, "learning_rate": 0.0002513524687835414, "loss": 4.8524, "mean_token_accuracy": 0.2206287369132042, "num_tokens": 119754697.0, "step": 69035 }, { "entropy": 5.955285739898682, "epoch": 5.371523049990274, "grad_norm": 1.5078125, "learning_rate": 0.0002513249068741811, "loss": 5.0119, "mean_token_accuracy": 0.20849117785692214, "num_tokens": 119763005.0, "step": 69040 }, { "entropy": 5.8645713329315186, "epoch": 5.371912079361992, "grad_norm": 1.4140625, "learning_rate": 0.00025129734532405265, "loss": 4.8349, "mean_token_accuracy": 0.22328405678272248, "num_tokens": 119771319.0, "step": 69045 }, { "entropy": 5.826034164428711, "epoch": 5.372301108733709, "grad_norm": 1.484375, "learning_rate": 0.00025126978413357424, "loss": 4.8743, "mean_token_accuracy": 0.21972937136888504, "num_tokens": 119780555.0, "step": 69050 }, { "entropy": 5.853900051116943, "epoch": 5.372690138105427, "grad_norm": 1.390625, "learning_rate": 0.0002512422233031641, "loss": 4.8416, "mean_token_accuracy": 0.2285275712609291, "num_tokens": 119789116.0, "step": 69055 }, { "entropy": 5.8706118106842045, "epoch": 5.373079167477145, "grad_norm": 1.5078125, "learning_rate": 0.0002512146628332404, "loss": 4.9129, "mean_token_accuracy": 0.2122945874929428, "num_tokens": 119797737.0, "step": 69060 }, { "entropy": 5.879394006729126, "epoch": 5.3734681968488625, "grad_norm": 1.609375, "learning_rate": 0.0002511871027242214, "loss": 4.8664, "mean_token_accuracy": 0.2241018831729889, "num_tokens": 119805716.0, "step": 69065 }, { "entropy": 5.896802520751953, "epoch": 5.373857226220579, "grad_norm": 1.3828125, "learning_rate": 0.0002511595429765251, "loss": 4.9505, "mean_token_accuracy": 0.2214080035686493, "num_tokens": 119815538.0, "step": 69070 }, { "entropy": 5.905560493469238, "epoch": 5.374246255592297, "grad_norm": 1.515625, "learning_rate": 0.00025113198359056986, "loss": 4.954, "mean_token_accuracy": 0.21926838159561157, "num_tokens": 119824775.0, "step": 69075 }, { "entropy": 5.912995862960815, "epoch": 5.374635284964015, "grad_norm": 1.515625, "learning_rate": 0.0002511044245667738, "loss": 4.9386, "mean_token_accuracy": 0.22192323058843613, "num_tokens": 119833454.0, "step": 69080 }, { "entropy": 5.930603647232056, "epoch": 5.375024314335732, "grad_norm": 1.5390625, "learning_rate": 0.000251076865905555, "loss": 5.0155, "mean_token_accuracy": 0.20840980112552643, "num_tokens": 119841606.0, "step": 69085 }, { "entropy": 5.911882781982422, "epoch": 5.37541334370745, "grad_norm": 1.671875, "learning_rate": 0.00025104930760733163, "loss": 5.0165, "mean_token_accuracy": 0.21499580293893814, "num_tokens": 119849618.0, "step": 69090 }, { "entropy": 5.89327187538147, "epoch": 5.375802373079168, "grad_norm": 1.4609375, "learning_rate": 0.000251021749672522, "loss": 4.8861, "mean_token_accuracy": 0.2206882655620575, "num_tokens": 119858453.0, "step": 69095 }, { "entropy": 5.973142385482788, "epoch": 5.3761914024508854, "grad_norm": 1.453125, "learning_rate": 0.00025099419210154413, "loss": 5.0334, "mean_token_accuracy": 0.21770086288452148, "num_tokens": 119867607.0, "step": 69100 }, { "entropy": 5.844433307647705, "epoch": 5.376580431822602, "grad_norm": 1.3984375, "learning_rate": 0.0002509666348948162, "loss": 4.9293, "mean_token_accuracy": 0.21360281258821487, "num_tokens": 119876498.0, "step": 69105 }, { "entropy": 5.921897268295288, "epoch": 5.37696946119432, "grad_norm": 1.5625, "learning_rate": 0.00025093907805275636, "loss": 4.9588, "mean_token_accuracy": 0.2185054525732994, "num_tokens": 119884229.0, "step": 69110 }, { "entropy": 5.900941944122314, "epoch": 5.377358490566038, "grad_norm": 1.4296875, "learning_rate": 0.00025091152157578266, "loss": 4.8912, "mean_token_accuracy": 0.21984490901231765, "num_tokens": 119893076.0, "step": 69115 }, { "entropy": 5.889987802505493, "epoch": 5.377747519937755, "grad_norm": 1.3515625, "learning_rate": 0.0002508839654643133, "loss": 4.9273, "mean_token_accuracy": 0.22053925544023514, "num_tokens": 119901847.0, "step": 69120 }, { "entropy": 5.899180316925049, "epoch": 5.378136549309473, "grad_norm": 1.453125, "learning_rate": 0.0002508564097187664, "loss": 4.9194, "mean_token_accuracy": 0.22105727046728135, "num_tokens": 119910745.0, "step": 69125 }, { "entropy": 5.873424100875854, "epoch": 5.378525578681191, "grad_norm": 1.5078125, "learning_rate": 0.00025082885433956007, "loss": 4.9396, "mean_token_accuracy": 0.22316674143075943, "num_tokens": 119920100.0, "step": 69130 }, { "entropy": 5.863775253295898, "epoch": 5.3789146080529076, "grad_norm": 1.46875, "learning_rate": 0.00025080129932711234, "loss": 4.7944, "mean_token_accuracy": 0.2347757861018181, "num_tokens": 119928792.0, "step": 69135 }, { "entropy": 5.861487150192261, "epoch": 5.379303637424625, "grad_norm": 1.4609375, "learning_rate": 0.0002507737446818414, "loss": 4.883, "mean_token_accuracy": 0.2249917671084404, "num_tokens": 119937536.0, "step": 69140 }, { "entropy": 5.909967279434204, "epoch": 5.379692666796343, "grad_norm": 1.4765625, "learning_rate": 0.0002507461904041653, "loss": 5.0112, "mean_token_accuracy": 0.20842734575271607, "num_tokens": 119946441.0, "step": 69145 }, { "entropy": 5.88842887878418, "epoch": 5.380081696168061, "grad_norm": 1.421875, "learning_rate": 0.00025071863649450216, "loss": 4.8986, "mean_token_accuracy": 0.22013828307390212, "num_tokens": 119954796.0, "step": 69150 }, { "entropy": 5.924608755111694, "epoch": 5.380470725539778, "grad_norm": 1.4609375, "learning_rate": 0.00025069108295327006, "loss": 4.9749, "mean_token_accuracy": 0.2157398819923401, "num_tokens": 119964262.0, "step": 69155 }, { "entropy": 5.900449895858765, "epoch": 5.380859754911496, "grad_norm": 1.4140625, "learning_rate": 0.00025066352978088706, "loss": 4.9013, "mean_token_accuracy": 0.2225585788488388, "num_tokens": 119973386.0, "step": 69160 }, { "entropy": 5.9590412139892575, "epoch": 5.381248784283214, "grad_norm": 1.5078125, "learning_rate": 0.0002506359769777713, "loss": 4.959, "mean_token_accuracy": 0.22015082985162734, "num_tokens": 119981816.0, "step": 69165 }, { "entropy": 5.863586521148681, "epoch": 5.3816378136549305, "grad_norm": 1.5234375, "learning_rate": 0.0002506084245443408, "loss": 4.9176, "mean_token_accuracy": 0.21485460698604583, "num_tokens": 119990352.0, "step": 69170 }, { "entropy": 5.907462167739868, "epoch": 5.382026843026648, "grad_norm": 1.46875, "learning_rate": 0.0002505808724810137, "loss": 4.9936, "mean_token_accuracy": 0.21606376767158508, "num_tokens": 119998648.0, "step": 69175 }, { "entropy": 5.829870986938476, "epoch": 5.382415872398366, "grad_norm": 1.6875, "learning_rate": 0.00025055332078820794, "loss": 4.8399, "mean_token_accuracy": 0.2289383053779602, "num_tokens": 120006395.0, "step": 69180 }, { "entropy": 5.8599165916442875, "epoch": 5.382804901770084, "grad_norm": 1.5546875, "learning_rate": 0.0002505257694663416, "loss": 4.9508, "mean_token_accuracy": 0.2160799279808998, "num_tokens": 120015425.0, "step": 69185 }, { "entropy": 5.9029261589050295, "epoch": 5.383193931141801, "grad_norm": 1.453125, "learning_rate": 0.0002504982185158328, "loss": 4.976, "mean_token_accuracy": 0.21001326888799668, "num_tokens": 120023864.0, "step": 69190 }, { "entropy": 5.93074312210083, "epoch": 5.383582960513519, "grad_norm": 1.4140625, "learning_rate": 0.0002504706679370995, "loss": 4.9827, "mean_token_accuracy": 0.212491175532341, "num_tokens": 120032569.0, "step": 69195 }, { "entropy": 5.880759620666504, "epoch": 5.383971989885237, "grad_norm": 1.4609375, "learning_rate": 0.0002504431177305598, "loss": 4.9468, "mean_token_accuracy": 0.21399974226951599, "num_tokens": 120041024.0, "step": 69200 }, { "entropy": 5.879503345489502, "epoch": 5.3843610192569535, "grad_norm": 1.3984375, "learning_rate": 0.0002504155678966317, "loss": 4.9495, "mean_token_accuracy": 0.21851942092180252, "num_tokens": 120050469.0, "step": 69205 }, { "entropy": 5.877401828765869, "epoch": 5.384750048628671, "grad_norm": 1.40625, "learning_rate": 0.0002503880184357333, "loss": 4.9592, "mean_token_accuracy": 0.2229369178414345, "num_tokens": 120058854.0, "step": 69210 }, { "entropy": 5.845195341110229, "epoch": 5.385139078000389, "grad_norm": 1.515625, "learning_rate": 0.00025036046934828244, "loss": 4.8165, "mean_token_accuracy": 0.2297510549426079, "num_tokens": 120066961.0, "step": 69215 }, { "entropy": 5.879139375686646, "epoch": 5.385528107372107, "grad_norm": 1.5625, "learning_rate": 0.00025033292063469714, "loss": 4.9134, "mean_token_accuracy": 0.21203892230987548, "num_tokens": 120075967.0, "step": 69220 }, { "entropy": 5.9994566440582275, "epoch": 5.385917136743824, "grad_norm": 1.4765625, "learning_rate": 0.00025030537229539567, "loss": 4.9947, "mean_token_accuracy": 0.21765843480825425, "num_tokens": 120084190.0, "step": 69225 }, { "entropy": 5.9163719654083256, "epoch": 5.386306166115542, "grad_norm": 1.5078125, "learning_rate": 0.0002502778243307958, "loss": 4.9893, "mean_token_accuracy": 0.20981699377298355, "num_tokens": 120092533.0, "step": 69230 }, { "entropy": 5.879611015319824, "epoch": 5.38669519548726, "grad_norm": 1.5390625, "learning_rate": 0.00025025027674131567, "loss": 4.957, "mean_token_accuracy": 0.2219676449894905, "num_tokens": 120100569.0, "step": 69235 }, { "entropy": 5.893147039413452, "epoch": 5.3870842248589765, "grad_norm": 1.5, "learning_rate": 0.00025022272952737317, "loss": 4.9501, "mean_token_accuracy": 0.21738879680633544, "num_tokens": 120109531.0, "step": 69240 }, { "entropy": 5.988116073608398, "epoch": 5.387473254230694, "grad_norm": 1.5703125, "learning_rate": 0.0002501951826893863, "loss": 5.0193, "mean_token_accuracy": 0.2205149605870247, "num_tokens": 120118419.0, "step": 69245 }, { "entropy": 5.859396934509277, "epoch": 5.387862283602412, "grad_norm": 1.5078125, "learning_rate": 0.0002501676362277731, "loss": 4.8831, "mean_token_accuracy": 0.22374484986066817, "num_tokens": 120127554.0, "step": 69250 }, { "entropy": 5.8123798847198485, "epoch": 5.38825131297413, "grad_norm": 1.4296875, "learning_rate": 0.00025014009014295136, "loss": 4.8624, "mean_token_accuracy": 0.22404297292232514, "num_tokens": 120136076.0, "step": 69255 }, { "entropy": 5.807517862319946, "epoch": 5.388640342345847, "grad_norm": 1.5, "learning_rate": 0.0002501125444353393, "loss": 4.7821, "mean_token_accuracy": 0.23198066502809525, "num_tokens": 120144295.0, "step": 69260 }, { "entropy": 5.8630022525787355, "epoch": 5.389029371717565, "grad_norm": 1.4453125, "learning_rate": 0.0002500849991053547, "loss": 4.9067, "mean_token_accuracy": 0.22258503139019012, "num_tokens": 120153190.0, "step": 69265 }, { "entropy": 5.823506641387939, "epoch": 5.389418401089282, "grad_norm": 1.359375, "learning_rate": 0.00025005745415341565, "loss": 4.8927, "mean_token_accuracy": 0.22435268014669418, "num_tokens": 120161683.0, "step": 69270 }, { "entropy": 5.877452182769775, "epoch": 5.3898074304609995, "grad_norm": 1.4609375, "learning_rate": 0.00025002990957994, "loss": 4.9563, "mean_token_accuracy": 0.2179741308093071, "num_tokens": 120170133.0, "step": 69275 }, { "entropy": 5.862102317810058, "epoch": 5.390196459832717, "grad_norm": 1.4921875, "learning_rate": 0.00025000236538534577, "loss": 4.9321, "mean_token_accuracy": 0.217137710750103, "num_tokens": 120179151.0, "step": 69280 }, { "entropy": 5.894723415374756, "epoch": 5.390585489204435, "grad_norm": 1.4921875, "learning_rate": 0.00024997482157005074, "loss": 4.9355, "mean_token_accuracy": 0.21530358195304872, "num_tokens": 120187425.0, "step": 69285 }, { "entropy": 5.861607074737549, "epoch": 5.390974518576153, "grad_norm": 1.484375, "learning_rate": 0.000249947278134473, "loss": 4.876, "mean_token_accuracy": 0.2241993859410286, "num_tokens": 120196166.0, "step": 69290 }, { "entropy": 5.866091632843018, "epoch": 5.39136354794787, "grad_norm": 1.4296875, "learning_rate": 0.0002499197350790305, "loss": 4.8485, "mean_token_accuracy": 0.22650136798620224, "num_tokens": 120204889.0, "step": 69295 }, { "entropy": 5.849116563796997, "epoch": 5.391752577319588, "grad_norm": 1.625, "learning_rate": 0.00024989219240414105, "loss": 4.834, "mean_token_accuracy": 0.2311936065554619, "num_tokens": 120212984.0, "step": 69300 }, { "entropy": 5.87714467048645, "epoch": 5.392141606691305, "grad_norm": 1.6015625, "learning_rate": 0.00024986465011022263, "loss": 5.0008, "mean_token_accuracy": 0.21252454221248626, "num_tokens": 120221147.0, "step": 69305 }, { "entropy": 5.8738504409790036, "epoch": 5.3925306360630225, "grad_norm": 1.375, "learning_rate": 0.00024983710819769325, "loss": 4.9322, "mean_token_accuracy": 0.21855110675096512, "num_tokens": 120230105.0, "step": 69310 }, { "entropy": 5.86072268486023, "epoch": 5.39291966543474, "grad_norm": 1.34375, "learning_rate": 0.0002498095666669706, "loss": 4.8472, "mean_token_accuracy": 0.22696622163057328, "num_tokens": 120239361.0, "step": 69315 }, { "entropy": 5.823500490188598, "epoch": 5.393308694806458, "grad_norm": 1.3984375, "learning_rate": 0.0002497820255184727, "loss": 4.8542, "mean_token_accuracy": 0.22716987878084183, "num_tokens": 120248154.0, "step": 69320 }, { "entropy": 5.845702695846557, "epoch": 5.393697724178176, "grad_norm": 1.609375, "learning_rate": 0.00024975448475261737, "loss": 4.8796, "mean_token_accuracy": 0.22400232255458832, "num_tokens": 120256033.0, "step": 69325 }, { "entropy": 5.857286882400513, "epoch": 5.394086753549893, "grad_norm": 1.484375, "learning_rate": 0.00024972694436982255, "loss": 4.9034, "mean_token_accuracy": 0.21649876087903977, "num_tokens": 120265269.0, "step": 69330 }, { "entropy": 5.882098913192749, "epoch": 5.39447578292161, "grad_norm": 1.3359375, "learning_rate": 0.0002496994043705062, "loss": 4.9121, "mean_token_accuracy": 0.2217616245150566, "num_tokens": 120274472.0, "step": 69335 }, { "entropy": 5.929987859725952, "epoch": 5.394864812293328, "grad_norm": 1.421875, "learning_rate": 0.0002496718647550861, "loss": 4.9248, "mean_token_accuracy": 0.22107165157794953, "num_tokens": 120283833.0, "step": 69340 }, { "entropy": 5.938629007339477, "epoch": 5.3952538416650455, "grad_norm": 1.515625, "learning_rate": 0.0002496443255239801, "loss": 4.8664, "mean_token_accuracy": 0.22974551767110823, "num_tokens": 120292340.0, "step": 69345 }, { "entropy": 5.8549083232879635, "epoch": 5.395642871036763, "grad_norm": 1.390625, "learning_rate": 0.0002496167866776061, "loss": 4.8469, "mean_token_accuracy": 0.22552416026592254, "num_tokens": 120300505.0, "step": 69350 }, { "entropy": 5.903234958648682, "epoch": 5.396031900408481, "grad_norm": 1.4375, "learning_rate": 0.00024958924821638195, "loss": 4.9602, "mean_token_accuracy": 0.22066121995449067, "num_tokens": 120308938.0, "step": 69355 }, { "entropy": 5.851533985137939, "epoch": 5.396420929780199, "grad_norm": 1.53125, "learning_rate": 0.00024956171014072555, "loss": 4.9273, "mean_token_accuracy": 0.2212996855378151, "num_tokens": 120318282.0, "step": 69360 }, { "entropy": 5.926537799835205, "epoch": 5.396809959151916, "grad_norm": 1.53125, "learning_rate": 0.00024953417245105467, "loss": 5.0374, "mean_token_accuracy": 0.2087308332324028, "num_tokens": 120327414.0, "step": 69365 }, { "entropy": 5.926514339447022, "epoch": 5.397198988523634, "grad_norm": 1.7421875, "learning_rate": 0.00024950663514778726, "loss": 4.9667, "mean_token_accuracy": 0.22006155848503112, "num_tokens": 120334794.0, "step": 69370 }, { "entropy": 5.9539604663848875, "epoch": 5.397588017895351, "grad_norm": 1.5078125, "learning_rate": 0.00024947909823134107, "loss": 4.9549, "mean_token_accuracy": 0.2159801244735718, "num_tokens": 120343405.0, "step": 69375 }, { "entropy": 5.773233413696289, "epoch": 5.3979770472670685, "grad_norm": 1.390625, "learning_rate": 0.0002494515617021339, "loss": 4.8559, "mean_token_accuracy": 0.22582780420780182, "num_tokens": 120351720.0, "step": 69380 }, { "entropy": 5.892366504669189, "epoch": 5.398366076638786, "grad_norm": 1.5078125, "learning_rate": 0.00024942402556058364, "loss": 4.9472, "mean_token_accuracy": 0.2203717902302742, "num_tokens": 120360291.0, "step": 69385 }, { "entropy": 5.923715209960937, "epoch": 5.398755106010504, "grad_norm": 1.46875, "learning_rate": 0.0002493964898071081, "loss": 5.0165, "mean_token_accuracy": 0.21336133033037186, "num_tokens": 120369089.0, "step": 69390 }, { "entropy": 5.854427766799927, "epoch": 5.399144135382222, "grad_norm": 1.3671875, "learning_rate": 0.0002493689544421251, "loss": 4.8491, "mean_token_accuracy": 0.22352437525987626, "num_tokens": 120378182.0, "step": 69395 }, { "entropy": 5.832686471939087, "epoch": 5.399533164753939, "grad_norm": 1.40625, "learning_rate": 0.00024934141946605237, "loss": 4.8753, "mean_token_accuracy": 0.21651578992605208, "num_tokens": 120386724.0, "step": 69400 }, { "entropy": 5.904237747192383, "epoch": 5.399922194125656, "grad_norm": 1.5078125, "learning_rate": 0.00024931388487930777, "loss": 4.9344, "mean_token_accuracy": 0.21638444662094117, "num_tokens": 120394889.0, "step": 69405 }, { "entropy": 5.872105503082276, "epoch": 5.400311223497374, "grad_norm": 1.5, "learning_rate": 0.000249286350682309, "loss": 4.93, "mean_token_accuracy": 0.2185324802994728, "num_tokens": 120403211.0, "step": 69410 }, { "entropy": 5.851849985122681, "epoch": 5.4007002528690915, "grad_norm": 1.4921875, "learning_rate": 0.0002492588168754741, "loss": 4.8742, "mean_token_accuracy": 0.22184375822544097, "num_tokens": 120412539.0, "step": 69415 }, { "entropy": 5.807697868347168, "epoch": 5.401089282240809, "grad_norm": 1.390625, "learning_rate": 0.00024923128345922055, "loss": 4.8246, "mean_token_accuracy": 0.2274965077638626, "num_tokens": 120421316.0, "step": 69420 }, { "entropy": 5.825650215148926, "epoch": 5.401478311612527, "grad_norm": 1.4453125, "learning_rate": 0.0002492037504339663, "loss": 4.8664, "mean_token_accuracy": 0.22584414035081862, "num_tokens": 120430146.0, "step": 69425 }, { "entropy": 5.921231985092163, "epoch": 5.401867340984245, "grad_norm": 1.5234375, "learning_rate": 0.00024917621780012905, "loss": 4.9966, "mean_token_accuracy": 0.2142064243555069, "num_tokens": 120438881.0, "step": 69430 }, { "entropy": 5.941400194168091, "epoch": 5.402256370355962, "grad_norm": 1.3984375, "learning_rate": 0.00024914868555812663, "loss": 4.9601, "mean_token_accuracy": 0.21080868244171141, "num_tokens": 120447060.0, "step": 69435 }, { "entropy": 5.85520191192627, "epoch": 5.402645399727679, "grad_norm": 1.5546875, "learning_rate": 0.0002491211537083768, "loss": 4.8987, "mean_token_accuracy": 0.22535262405872344, "num_tokens": 120455053.0, "step": 69440 }, { "entropy": 5.806003904342651, "epoch": 5.403034429099397, "grad_norm": 1.6328125, "learning_rate": 0.0002490936222512972, "loss": 4.8654, "mean_token_accuracy": 0.21925103813409805, "num_tokens": 120463161.0, "step": 69445 }, { "entropy": 5.8722187042236325, "epoch": 5.4034234584711145, "grad_norm": 1.484375, "learning_rate": 0.0002490660911873057, "loss": 4.9203, "mean_token_accuracy": 0.2107679381966591, "num_tokens": 120472242.0, "step": 69450 }, { "entropy": 5.916609477996826, "epoch": 5.403812487842832, "grad_norm": 1.53125, "learning_rate": 0.00024903856051681995, "loss": 4.9097, "mean_token_accuracy": 0.21595146507024765, "num_tokens": 120480711.0, "step": 69455 }, { "entropy": 5.9163306713104244, "epoch": 5.40420151721455, "grad_norm": 1.4296875, "learning_rate": 0.0002490110302402577, "loss": 4.9203, "mean_token_accuracy": 0.21871328800916673, "num_tokens": 120489798.0, "step": 69460 }, { "entropy": 5.868837213516235, "epoch": 5.404590546586268, "grad_norm": 1.5078125, "learning_rate": 0.0002489835003580367, "loss": 4.9493, "mean_token_accuracy": 0.20643870830535888, "num_tokens": 120498294.0, "step": 69465 }, { "entropy": 5.8625524044036865, "epoch": 5.404979575957984, "grad_norm": 1.53125, "learning_rate": 0.00024895597087057483, "loss": 4.9526, "mean_token_accuracy": 0.2208401158452034, "num_tokens": 120506711.0, "step": 69470 }, { "entropy": 5.798846864700318, "epoch": 5.405368605329702, "grad_norm": 1.4765625, "learning_rate": 0.0002489284417782895, "loss": 4.8696, "mean_token_accuracy": 0.21850617229938507, "num_tokens": 120515241.0, "step": 69475 }, { "entropy": 5.87580509185791, "epoch": 5.40575763470142, "grad_norm": 1.421875, "learning_rate": 0.0002489009130815986, "loss": 4.9111, "mean_token_accuracy": 0.22165576070547105, "num_tokens": 120524523.0, "step": 69480 }, { "entropy": 5.883918380737304, "epoch": 5.4061466640731375, "grad_norm": 1.6171875, "learning_rate": 0.0002488733847809197, "loss": 4.9271, "mean_token_accuracy": 0.22820912748575212, "num_tokens": 120533384.0, "step": 69485 }, { "entropy": 5.856443548202515, "epoch": 5.406535693444855, "grad_norm": 1.5390625, "learning_rate": 0.0002488458568766707, "loss": 4.8631, "mean_token_accuracy": 0.21724938601255417, "num_tokens": 120540965.0, "step": 69490 }, { "entropy": 5.8871289730072025, "epoch": 5.406924722816573, "grad_norm": 1.5546875, "learning_rate": 0.0002488183293692692, "loss": 4.9789, "mean_token_accuracy": 0.2185433253645897, "num_tokens": 120549905.0, "step": 69495 }, { "entropy": 5.843818235397339, "epoch": 5.407313752188291, "grad_norm": 1.578125, "learning_rate": 0.0002487908022591329, "loss": 4.8913, "mean_token_accuracy": 0.22395817041397095, "num_tokens": 120558547.0, "step": 69500 }, { "entropy": 5.865789127349854, "epoch": 5.407702781560007, "grad_norm": 1.4296875, "learning_rate": 0.00024876327554667943, "loss": 4.8903, "mean_token_accuracy": 0.2228495016694069, "num_tokens": 120567086.0, "step": 69505 }, { "entropy": 5.842902612686157, "epoch": 5.408091810931725, "grad_norm": 1.4375, "learning_rate": 0.0002487357492323265, "loss": 4.9424, "mean_token_accuracy": 0.2165142998099327, "num_tokens": 120575767.0, "step": 69510 }, { "entropy": 5.810247564315796, "epoch": 5.408480840303443, "grad_norm": 1.4921875, "learning_rate": 0.0002487082233164918, "loss": 4.8489, "mean_token_accuracy": 0.22351898550987243, "num_tokens": 120584952.0, "step": 69515 }, { "entropy": 5.896504354476929, "epoch": 5.4088698696751605, "grad_norm": 1.3515625, "learning_rate": 0.0002486806977995929, "loss": 5.0108, "mean_token_accuracy": 0.21054230630397797, "num_tokens": 120594221.0, "step": 69520 }, { "entropy": 5.849171209335327, "epoch": 5.409258899046878, "grad_norm": 1.421875, "learning_rate": 0.0002486531726820476, "loss": 4.8225, "mean_token_accuracy": 0.23185864835977554, "num_tokens": 120602533.0, "step": 69525 }, { "entropy": 5.832099199295044, "epoch": 5.409647928418596, "grad_norm": 1.546875, "learning_rate": 0.00024862564796427337, "loss": 4.844, "mean_token_accuracy": 0.22502754777669906, "num_tokens": 120611534.0, "step": 69530 }, { "entropy": 5.824452447891235, "epoch": 5.410036957790314, "grad_norm": 1.5390625, "learning_rate": 0.000248598123646688, "loss": 4.8857, "mean_token_accuracy": 0.22650086283683776, "num_tokens": 120620357.0, "step": 69535 }, { "entropy": 5.858800315856934, "epoch": 5.41042598716203, "grad_norm": 1.640625, "learning_rate": 0.0002485705997297091, "loss": 4.8813, "mean_token_accuracy": 0.22339128255844115, "num_tokens": 120628940.0, "step": 69540 }, { "entropy": 5.883877992630005, "epoch": 5.410815016533748, "grad_norm": 1.453125, "learning_rate": 0.00024854307621375427, "loss": 4.9539, "mean_token_accuracy": 0.2207343652844429, "num_tokens": 120637872.0, "step": 69545 }, { "entropy": 5.878601503372193, "epoch": 5.411204045905466, "grad_norm": 1.4921875, "learning_rate": 0.0002485155530992411, "loss": 4.9077, "mean_token_accuracy": 0.21310213655233384, "num_tokens": 120646326.0, "step": 69550 }, { "entropy": 5.948483180999756, "epoch": 5.4115930752771835, "grad_norm": 1.421875, "learning_rate": 0.0002484880303865873, "loss": 5.0011, "mean_token_accuracy": 0.21148795038461685, "num_tokens": 120654689.0, "step": 69555 }, { "entropy": 5.874451923370361, "epoch": 5.411982104648901, "grad_norm": 1.5078125, "learning_rate": 0.0002484605080762104, "loss": 4.9299, "mean_token_accuracy": 0.23045978993177413, "num_tokens": 120662656.0, "step": 69560 }, { "entropy": 5.812439966201782, "epoch": 5.412371134020619, "grad_norm": 1.4375, "learning_rate": 0.0002484329861685281, "loss": 4.8476, "mean_token_accuracy": 0.2201933056116104, "num_tokens": 120671493.0, "step": 69565 }, { "entropy": 5.839184188842774, "epoch": 5.412760163392337, "grad_norm": 1.4765625, "learning_rate": 0.00024840546466395796, "loss": 4.9324, "mean_token_accuracy": 0.21320036947727203, "num_tokens": 120680276.0, "step": 69570 }, { "entropy": 5.912174797058105, "epoch": 5.413149192764053, "grad_norm": 1.53125, "learning_rate": 0.00024837794356291756, "loss": 4.9952, "mean_token_accuracy": 0.21608465760946274, "num_tokens": 120689115.0, "step": 69575 }, { "entropy": 5.9935235500335695, "epoch": 5.413538222135771, "grad_norm": 1.5625, "learning_rate": 0.0002483504228658245, "loss": 5.0387, "mean_token_accuracy": 0.2139122426509857, "num_tokens": 120697550.0, "step": 69580 }, { "entropy": 5.9713341236114506, "epoch": 5.413927251507489, "grad_norm": 1.4375, "learning_rate": 0.0002483229025730963, "loss": 5.0789, "mean_token_accuracy": 0.20711686909198762, "num_tokens": 120706629.0, "step": 69585 }, { "entropy": 5.903969049453735, "epoch": 5.4143162808792065, "grad_norm": 1.484375, "learning_rate": 0.0002482953826851506, "loss": 4.9573, "mean_token_accuracy": 0.2100489154458046, "num_tokens": 120715538.0, "step": 69590 }, { "entropy": 5.976001787185669, "epoch": 5.414705310250924, "grad_norm": 1.5625, "learning_rate": 0.000248267863202405, "loss": 4.9594, "mean_token_accuracy": 0.21625385880470277, "num_tokens": 120723861.0, "step": 69595 }, { "entropy": 5.883838701248169, "epoch": 5.415094339622642, "grad_norm": 1.75, "learning_rate": 0.00024824034412527704, "loss": 4.903, "mean_token_accuracy": 0.22541527450084686, "num_tokens": 120732499.0, "step": 69600 }, { "entropy": 5.8660331726074215, "epoch": 5.415483368994359, "grad_norm": 1.6328125, "learning_rate": 0.0002482128254541842, "loss": 4.9287, "mean_token_accuracy": 0.21767235547304153, "num_tokens": 120741436.0, "step": 69605 }, { "entropy": 5.969306325912475, "epoch": 5.415872398366076, "grad_norm": 1.515625, "learning_rate": 0.0002481853071895442, "loss": 5.0178, "mean_token_accuracy": 0.21886663585901261, "num_tokens": 120750079.0, "step": 69610 }, { "entropy": 5.896447467803955, "epoch": 5.416261427737794, "grad_norm": 1.4296875, "learning_rate": 0.0002481577893317744, "loss": 4.901, "mean_token_accuracy": 0.21875064671039582, "num_tokens": 120757843.0, "step": 69615 }, { "entropy": 5.847191429138183, "epoch": 5.416650457109512, "grad_norm": 1.6171875, "learning_rate": 0.0002481302718812924, "loss": 4.8612, "mean_token_accuracy": 0.22933880239725113, "num_tokens": 120766308.0, "step": 69620 }, { "entropy": 5.831346893310547, "epoch": 5.4170394864812295, "grad_norm": 1.3828125, "learning_rate": 0.0002481027548385158, "loss": 4.877, "mean_token_accuracy": 0.2182373061776161, "num_tokens": 120775717.0, "step": 69625 }, { "entropy": 5.837592267990113, "epoch": 5.417428515852947, "grad_norm": 1.4765625, "learning_rate": 0.00024807523820386207, "loss": 4.8999, "mean_token_accuracy": 0.21881067305803298, "num_tokens": 120784112.0, "step": 69630 }, { "entropy": 5.91919584274292, "epoch": 5.417817545224665, "grad_norm": 1.5390625, "learning_rate": 0.0002480477219777488, "loss": 5.0216, "mean_token_accuracy": 0.217192941904068, "num_tokens": 120793812.0, "step": 69635 }, { "entropy": 5.905784225463867, "epoch": 5.418206574596382, "grad_norm": 1.5546875, "learning_rate": 0.0002480202061605933, "loss": 4.8889, "mean_token_accuracy": 0.2232805609703064, "num_tokens": 120802564.0, "step": 69640 }, { "entropy": 5.844201612472534, "epoch": 5.418595603968099, "grad_norm": 1.546875, "learning_rate": 0.0002479926907528134, "loss": 4.8781, "mean_token_accuracy": 0.2213527664542198, "num_tokens": 120811113.0, "step": 69645 }, { "entropy": 5.807879161834717, "epoch": 5.418984633339817, "grad_norm": 1.421875, "learning_rate": 0.00024796517575482633, "loss": 4.9039, "mean_token_accuracy": 0.22408051639795304, "num_tokens": 120820498.0, "step": 69650 }, { "entropy": 5.89239912033081, "epoch": 5.419373662711535, "grad_norm": 1.4375, "learning_rate": 0.0002479376611670498, "loss": 4.8753, "mean_token_accuracy": 0.2239508405327797, "num_tokens": 120829510.0, "step": 69655 }, { "entropy": 5.878476572036743, "epoch": 5.4197626920832525, "grad_norm": 1.421875, "learning_rate": 0.00024791014698990116, "loss": 4.9467, "mean_token_accuracy": 0.21319446414709092, "num_tokens": 120838314.0, "step": 69660 }, { "entropy": 5.891367673873901, "epoch": 5.42015172145497, "grad_norm": 1.5390625, "learning_rate": 0.00024788263322379783, "loss": 5.0096, "mean_token_accuracy": 0.20777628421783448, "num_tokens": 120847373.0, "step": 69665 }, { "entropy": 5.900431537628174, "epoch": 5.420540750826687, "grad_norm": 1.546875, "learning_rate": 0.00024785511986915746, "loss": 4.9301, "mean_token_accuracy": 0.22088544070720673, "num_tokens": 120856237.0, "step": 69670 }, { "entropy": 5.857255458831787, "epoch": 5.420929780198405, "grad_norm": 1.5859375, "learning_rate": 0.0002478276069263974, "loss": 4.9607, "mean_token_accuracy": 0.2104274421930313, "num_tokens": 120864865.0, "step": 69675 }, { "entropy": 5.7898133277893065, "epoch": 5.421318809570122, "grad_norm": 1.40625, "learning_rate": 0.00024780009439593514, "loss": 4.8534, "mean_token_accuracy": 0.2245606392621994, "num_tokens": 120874040.0, "step": 69680 }, { "entropy": 5.9104047298431395, "epoch": 5.42170783894184, "grad_norm": 1.4921875, "learning_rate": 0.0002477725822781881, "loss": 4.9506, "mean_token_accuracy": 0.2222105845808983, "num_tokens": 120882695.0, "step": 69685 }, { "entropy": 5.917834281921387, "epoch": 5.422096868313558, "grad_norm": 1.5078125, "learning_rate": 0.0002477450705735739, "loss": 4.9415, "mean_token_accuracy": 0.2137506902217865, "num_tokens": 120891256.0, "step": 69690 }, { "entropy": 5.905517482757569, "epoch": 5.4224858976852754, "grad_norm": 1.328125, "learning_rate": 0.00024771755928250984, "loss": 4.904, "mean_token_accuracy": 0.22329799085855484, "num_tokens": 120900122.0, "step": 69695 }, { "entropy": 5.987349128723144, "epoch": 5.422874927056993, "grad_norm": 1.4765625, "learning_rate": 0.00024769004840541337, "loss": 5.0624, "mean_token_accuracy": 0.20581938326358795, "num_tokens": 120909121.0, "step": 69700 }, { "entropy": 5.869535303115844, "epoch": 5.42326395642871, "grad_norm": 1.3984375, "learning_rate": 0.000247662537942702, "loss": 4.9175, "mean_token_accuracy": 0.21817582696676255, "num_tokens": 120918575.0, "step": 69705 }, { "entropy": 5.886776924133301, "epoch": 5.423652985800428, "grad_norm": 1.3203125, "learning_rate": 0.0002476350278947931, "loss": 4.9508, "mean_token_accuracy": 0.21841296553611755, "num_tokens": 120927874.0, "step": 69710 }, { "entropy": 5.905745553970337, "epoch": 5.424042015172145, "grad_norm": 1.3515625, "learning_rate": 0.000247607518262104, "loss": 4.9291, "mean_token_accuracy": 0.2170095130801201, "num_tokens": 120936625.0, "step": 69715 }, { "entropy": 5.896506977081299, "epoch": 5.424431044543863, "grad_norm": 1.4765625, "learning_rate": 0.0002475800090450523, "loss": 4.9668, "mean_token_accuracy": 0.21640065163373948, "num_tokens": 120945105.0, "step": 69720 }, { "entropy": 5.83589015007019, "epoch": 5.424820073915581, "grad_norm": 1.453125, "learning_rate": 0.0002475525002440553, "loss": 4.8179, "mean_token_accuracy": 0.2301688477396965, "num_tokens": 120954840.0, "step": 69725 }, { "entropy": 5.836387825012207, "epoch": 5.425209103287298, "grad_norm": 1.546875, "learning_rate": 0.00024752499185953043, "loss": 4.9013, "mean_token_accuracy": 0.22304360270500184, "num_tokens": 120963638.0, "step": 69730 }, { "entropy": 5.911069345474243, "epoch": 5.425598132659016, "grad_norm": 1.5703125, "learning_rate": 0.0002474974838918951, "loss": 4.9731, "mean_token_accuracy": 0.2195759207010269, "num_tokens": 120972621.0, "step": 69735 }, { "entropy": 5.911742496490478, "epoch": 5.425987162030733, "grad_norm": 1.4609375, "learning_rate": 0.0002474699763415667, "loss": 4.9653, "mean_token_accuracy": 0.2123311161994934, "num_tokens": 120980788.0, "step": 69740 }, { "entropy": 5.8309423446655275, "epoch": 5.426376191402451, "grad_norm": 1.5390625, "learning_rate": 0.00024744246920896243, "loss": 4.8941, "mean_token_accuracy": 0.22210921198129654, "num_tokens": 120989624.0, "step": 69745 }, { "entropy": 5.866896677017212, "epoch": 5.426765220774168, "grad_norm": 1.3984375, "learning_rate": 0.0002474149624944999, "loss": 4.955, "mean_token_accuracy": 0.2195325493812561, "num_tokens": 120998036.0, "step": 69750 }, { "entropy": 5.861516427993775, "epoch": 5.427154250145886, "grad_norm": 1.5234375, "learning_rate": 0.00024738745619859643, "loss": 4.821, "mean_token_accuracy": 0.23034973740577697, "num_tokens": 121006115.0, "step": 69755 }, { "entropy": 5.874679899215698, "epoch": 5.427543279517604, "grad_norm": 1.46875, "learning_rate": 0.00024735995032166934, "loss": 4.9498, "mean_token_accuracy": 0.21132907569408416, "num_tokens": 121015569.0, "step": 69760 }, { "entropy": 5.901677370071411, "epoch": 5.427932308889321, "grad_norm": 1.4296875, "learning_rate": 0.0002473324448641361, "loss": 4.9414, "mean_token_accuracy": 0.2151007503271103, "num_tokens": 121023891.0, "step": 69765 }, { "entropy": 5.857754230499268, "epoch": 5.428321338261039, "grad_norm": 1.53125, "learning_rate": 0.00024730493982641396, "loss": 4.8578, "mean_token_accuracy": 0.22547693848609923, "num_tokens": 121032733.0, "step": 69770 }, { "entropy": 5.868499422073365, "epoch": 5.428710367632756, "grad_norm": 1.4609375, "learning_rate": 0.0002472774352089202, "loss": 4.9159, "mean_token_accuracy": 0.2275269642472267, "num_tokens": 121041668.0, "step": 69775 }, { "entropy": 5.8739098072052, "epoch": 5.429099397004474, "grad_norm": 1.484375, "learning_rate": 0.0002472499310120723, "loss": 4.967, "mean_token_accuracy": 0.2221992313861847, "num_tokens": 121051173.0, "step": 69780 }, { "entropy": 5.836136436462402, "epoch": 5.429488426376191, "grad_norm": 1.484375, "learning_rate": 0.0002472224272362875, "loss": 4.9103, "mean_token_accuracy": 0.22239420115947722, "num_tokens": 121059576.0, "step": 69785 }, { "entropy": 5.921668004989624, "epoch": 5.429877455747909, "grad_norm": 1.609375, "learning_rate": 0.00024719492388198313, "loss": 4.9372, "mean_token_accuracy": 0.21343456208705902, "num_tokens": 121068089.0, "step": 69790 }, { "entropy": 5.8960349559783936, "epoch": 5.430266485119627, "grad_norm": 1.484375, "learning_rate": 0.0002471674209495765, "loss": 4.9211, "mean_token_accuracy": 0.2157305434346199, "num_tokens": 121077146.0, "step": 69795 }, { "entropy": 5.8640378475189205, "epoch": 5.430655514491344, "grad_norm": 1.4453125, "learning_rate": 0.00024713991843948506, "loss": 4.9882, "mean_token_accuracy": 0.2152519091963768, "num_tokens": 121085575.0, "step": 69800 }, { "entropy": 5.867755937576294, "epoch": 5.431044543863061, "grad_norm": 1.53125, "learning_rate": 0.00024711241635212597, "loss": 4.9511, "mean_token_accuracy": 0.21450530290603637, "num_tokens": 121093784.0, "step": 69805 }, { "entropy": 5.895231866836548, "epoch": 5.431433573234779, "grad_norm": 1.484375, "learning_rate": 0.00024708491468791656, "loss": 4.9303, "mean_token_accuracy": 0.21802643984556197, "num_tokens": 121102962.0, "step": 69810 }, { "entropy": 5.823903799057007, "epoch": 5.431822602606497, "grad_norm": 1.609375, "learning_rate": 0.0002470574134472741, "loss": 4.8758, "mean_token_accuracy": 0.23221516013145446, "num_tokens": 121111782.0, "step": 69815 }, { "entropy": 5.906509876251221, "epoch": 5.432211631978214, "grad_norm": 1.6640625, "learning_rate": 0.00024702991263061595, "loss": 4.8968, "mean_token_accuracy": 0.22134843617677688, "num_tokens": 121120075.0, "step": 69820 }, { "entropy": 5.868521213531494, "epoch": 5.432600661349932, "grad_norm": 1.46875, "learning_rate": 0.00024700241223835935, "loss": 4.9304, "mean_token_accuracy": 0.2157566085457802, "num_tokens": 121129106.0, "step": 69825 }, { "entropy": 5.919453859329224, "epoch": 5.43298969072165, "grad_norm": 1.4375, "learning_rate": 0.00024697491227092163, "loss": 5.0832, "mean_token_accuracy": 0.20318902730941774, "num_tokens": 121137273.0, "step": 69830 }, { "entropy": 5.94287223815918, "epoch": 5.433378720093367, "grad_norm": 1.515625, "learning_rate": 0.00024694741272872, "loss": 4.9439, "mean_token_accuracy": 0.2222316801548004, "num_tokens": 121145632.0, "step": 69835 }, { "entropy": 5.9062751770019535, "epoch": 5.433767749465084, "grad_norm": 1.3515625, "learning_rate": 0.00024691991361217166, "loss": 4.9089, "mean_token_accuracy": 0.22614223062992095, "num_tokens": 121154469.0, "step": 69840 }, { "entropy": 5.812202787399292, "epoch": 5.434156778836802, "grad_norm": 1.46875, "learning_rate": 0.00024689241492169403, "loss": 4.8112, "mean_token_accuracy": 0.22566297352313996, "num_tokens": 121162826.0, "step": 69845 }, { "entropy": 5.88845739364624, "epoch": 5.43454580820852, "grad_norm": 1.6640625, "learning_rate": 0.00024686491665770424, "loss": 5.0288, "mean_token_accuracy": 0.20887815505266188, "num_tokens": 121170562.0, "step": 69850 }, { "entropy": 5.858035135269165, "epoch": 5.434934837580237, "grad_norm": 1.578125, "learning_rate": 0.00024683741882061954, "loss": 4.947, "mean_token_accuracy": 0.21516374349594117, "num_tokens": 121179582.0, "step": 69855 }, { "entropy": 5.981293439865112, "epoch": 5.435323866951955, "grad_norm": 1.46875, "learning_rate": 0.0002468099214108572, "loss": 4.9869, "mean_token_accuracy": 0.20693484097719192, "num_tokens": 121188599.0, "step": 69860 }, { "entropy": 5.930628252029419, "epoch": 5.435712896323673, "grad_norm": 1.5703125, "learning_rate": 0.00024678242442883444, "loss": 4.8916, "mean_token_accuracy": 0.22614535093307495, "num_tokens": 121196762.0, "step": 69865 }, { "entropy": 5.885363912582397, "epoch": 5.43610192569539, "grad_norm": 1.4609375, "learning_rate": 0.00024675492787496844, "loss": 4.9276, "mean_token_accuracy": 0.2217929929494858, "num_tokens": 121205736.0, "step": 69870 }, { "entropy": 5.8096733570098875, "epoch": 5.436490955067107, "grad_norm": 1.5234375, "learning_rate": 0.00024672743174967645, "loss": 4.8185, "mean_token_accuracy": 0.22104507982730864, "num_tokens": 121214186.0, "step": 69875 }, { "entropy": 5.852441930770874, "epoch": 5.436879984438825, "grad_norm": 1.546875, "learning_rate": 0.0002466999360533757, "loss": 4.8559, "mean_token_accuracy": 0.2231011673808098, "num_tokens": 121222656.0, "step": 69880 }, { "entropy": 5.84800157546997, "epoch": 5.437269013810543, "grad_norm": 1.34375, "learning_rate": 0.0002466724407864833, "loss": 4.8699, "mean_token_accuracy": 0.2223466530442238, "num_tokens": 121231287.0, "step": 69885 }, { "entropy": 5.894041061401367, "epoch": 5.43765804318226, "grad_norm": 1.5546875, "learning_rate": 0.00024664494594941664, "loss": 4.8398, "mean_token_accuracy": 0.22935065925121306, "num_tokens": 121239783.0, "step": 69890 }, { "entropy": 5.836501169204712, "epoch": 5.438047072553978, "grad_norm": 1.5703125, "learning_rate": 0.00024661745154259273, "loss": 4.9127, "mean_token_accuracy": 0.22122283577919005, "num_tokens": 121248131.0, "step": 69895 }, { "entropy": 5.8036092758178714, "epoch": 5.438436101925696, "grad_norm": 1.515625, "learning_rate": 0.0002465899575664289, "loss": 4.9107, "mean_token_accuracy": 0.21683369427919388, "num_tokens": 121256719.0, "step": 69900 }, { "entropy": 5.825444889068604, "epoch": 5.438825131297413, "grad_norm": 1.515625, "learning_rate": 0.00024656246402134216, "loss": 4.8174, "mean_token_accuracy": 0.22483257949352264, "num_tokens": 121265199.0, "step": 69905 }, { "entropy": 5.821436738967895, "epoch": 5.43921416066913, "grad_norm": 1.5234375, "learning_rate": 0.0002465349709077498, "loss": 4.816, "mean_token_accuracy": 0.2257923513650894, "num_tokens": 121274648.0, "step": 69910 }, { "entropy": 5.886503267288208, "epoch": 5.439603190040848, "grad_norm": 1.4609375, "learning_rate": 0.0002465074782260689, "loss": 4.9749, "mean_token_accuracy": 0.21682190597057344, "num_tokens": 121284159.0, "step": 69915 }, { "entropy": 5.925439167022705, "epoch": 5.439992219412566, "grad_norm": 1.359375, "learning_rate": 0.00024647998597671674, "loss": 4.9486, "mean_token_accuracy": 0.22496234476566315, "num_tokens": 121292635.0, "step": 69920 }, { "entropy": 5.9155323028564455, "epoch": 5.440381248784283, "grad_norm": 1.484375, "learning_rate": 0.0002464524941601103, "loss": 4.8995, "mean_token_accuracy": 0.22101916819810868, "num_tokens": 121301688.0, "step": 69925 }, { "entropy": 5.870996379852295, "epoch": 5.440770278156001, "grad_norm": 1.46875, "learning_rate": 0.00024642500277666696, "loss": 4.9593, "mean_token_accuracy": 0.20758458375930786, "num_tokens": 121310234.0, "step": 69930 }, { "entropy": 5.850041055679322, "epoch": 5.441159307527719, "grad_norm": 1.5703125, "learning_rate": 0.00024639751182680363, "loss": 4.9128, "mean_token_accuracy": 0.22240880280733108, "num_tokens": 121318757.0, "step": 69935 }, { "entropy": 5.947680997848511, "epoch": 5.4415483368994355, "grad_norm": 1.4140625, "learning_rate": 0.0002463700213109376, "loss": 4.9917, "mean_token_accuracy": 0.21812837123870848, "num_tokens": 121327881.0, "step": 69940 }, { "entropy": 5.945798254013061, "epoch": 5.441937366271153, "grad_norm": 1.53125, "learning_rate": 0.00024634253122948584, "loss": 4.9955, "mean_token_accuracy": 0.20732611566781997, "num_tokens": 121336444.0, "step": 69945 }, { "entropy": 5.961141204833984, "epoch": 5.442326395642871, "grad_norm": 1.484375, "learning_rate": 0.00024631504158286556, "loss": 4.9774, "mean_token_accuracy": 0.2212778463959694, "num_tokens": 121344571.0, "step": 69950 }, { "entropy": 5.902258443832397, "epoch": 5.442715425014589, "grad_norm": 1.5, "learning_rate": 0.00024628755237149385, "loss": 4.9267, "mean_token_accuracy": 0.22164823412895202, "num_tokens": 121352806.0, "step": 69955 }, { "entropy": 5.881486988067627, "epoch": 5.443104454386306, "grad_norm": 1.4609375, "learning_rate": 0.00024626006359578797, "loss": 4.8905, "mean_token_accuracy": 0.21954032629728318, "num_tokens": 121361189.0, "step": 69960 }, { "entropy": 5.91632490158081, "epoch": 5.443493483758024, "grad_norm": 1.34375, "learning_rate": 0.00024623257525616484, "loss": 4.9816, "mean_token_accuracy": 0.21740350276231765, "num_tokens": 121369845.0, "step": 69965 }, { "entropy": 5.846297311782837, "epoch": 5.443882513129742, "grad_norm": 1.46875, "learning_rate": 0.00024620508735304146, "loss": 4.912, "mean_token_accuracy": 0.21787936687469484, "num_tokens": 121377923.0, "step": 69970 }, { "entropy": 5.8934637069702145, "epoch": 5.4442715425014585, "grad_norm": 1.4921875, "learning_rate": 0.0002461775998868352, "loss": 4.9675, "mean_token_accuracy": 0.22255182713270188, "num_tokens": 121386442.0, "step": 69975 }, { "entropy": 5.929491949081421, "epoch": 5.444660571873176, "grad_norm": 1.4453125, "learning_rate": 0.00024615011285796293, "loss": 4.9325, "mean_token_accuracy": 0.21644456386566163, "num_tokens": 121394918.0, "step": 69980 }, { "entropy": 5.939820909500122, "epoch": 5.445049601244894, "grad_norm": 1.4609375, "learning_rate": 0.00024612262626684176, "loss": 4.9678, "mean_token_accuracy": 0.2131143882870674, "num_tokens": 121403509.0, "step": 69985 }, { "entropy": 5.9830351829528805, "epoch": 5.445438630616612, "grad_norm": 1.640625, "learning_rate": 0.0002460951401138888, "loss": 4.9774, "mean_token_accuracy": 0.21672654151916504, "num_tokens": 121411673.0, "step": 69990 }, { "entropy": 5.968668651580811, "epoch": 5.445827659988329, "grad_norm": 1.546875, "learning_rate": 0.00024606765439952105, "loss": 5.0273, "mean_token_accuracy": 0.21530264914035796, "num_tokens": 121420843.0, "step": 69995 }, { "entropy": 5.8963369846344, "epoch": 5.446216689360047, "grad_norm": 1.4765625, "learning_rate": 0.0002460401691241556, "loss": 4.9666, "mean_token_accuracy": 0.21451497972011566, "num_tokens": 121429828.0, "step": 70000 }, { "entropy": 5.88644585609436, "epoch": 5.446605718731764, "grad_norm": 1.484375, "learning_rate": 0.00024601268428820947, "loss": 4.9582, "mean_token_accuracy": 0.22093952745199202, "num_tokens": 121438058.0, "step": 70005 }, { "entropy": 5.841746664047241, "epoch": 5.4469947481034815, "grad_norm": 1.4296875, "learning_rate": 0.00024598519989209983, "loss": 4.8186, "mean_token_accuracy": 0.229946006834507, "num_tokens": 121447113.0, "step": 70010 }, { "entropy": 5.924835252761841, "epoch": 5.447383777475199, "grad_norm": 1.5625, "learning_rate": 0.0002459577159362434, "loss": 4.9756, "mean_token_accuracy": 0.21294353753328324, "num_tokens": 121455217.0, "step": 70015 }, { "entropy": 5.934188175201416, "epoch": 5.447772806846917, "grad_norm": 1.578125, "learning_rate": 0.0002459302324210575, "loss": 4.8983, "mean_token_accuracy": 0.22458408921957015, "num_tokens": 121463208.0, "step": 70020 }, { "entropy": 5.92068076133728, "epoch": 5.448161836218635, "grad_norm": 1.5, "learning_rate": 0.0002459027493469591, "loss": 4.9311, "mean_token_accuracy": 0.2200424328446388, "num_tokens": 121472400.0, "step": 70025 }, { "entropy": 5.919198274612427, "epoch": 5.448550865590352, "grad_norm": 1.3671875, "learning_rate": 0.00024587526671436517, "loss": 4.9351, "mean_token_accuracy": 0.21414900571107864, "num_tokens": 121481400.0, "step": 70030 }, { "entropy": 5.888467454910279, "epoch": 5.44893989496207, "grad_norm": 1.4765625, "learning_rate": 0.00024584778452369264, "loss": 4.9542, "mean_token_accuracy": 0.21520513743162156, "num_tokens": 121490004.0, "step": 70035 }, { "entropy": 5.911335039138794, "epoch": 5.449328924333787, "grad_norm": 1.4375, "learning_rate": 0.00024582030277535866, "loss": 5.0176, "mean_token_accuracy": 0.2107431024312973, "num_tokens": 121500136.0, "step": 70040 }, { "entropy": 5.8785295486450195, "epoch": 5.4497179537055045, "grad_norm": 1.484375, "learning_rate": 0.00024579282146978016, "loss": 4.8352, "mean_token_accuracy": 0.22354887425899506, "num_tokens": 121508711.0, "step": 70045 }, { "entropy": 5.886579608917236, "epoch": 5.450106983077222, "grad_norm": 1.4921875, "learning_rate": 0.000245765340607374, "loss": 4.9089, "mean_token_accuracy": 0.21476557850837708, "num_tokens": 121516971.0, "step": 70050 }, { "entropy": 5.843554162979126, "epoch": 5.45049601244894, "grad_norm": 1.4921875, "learning_rate": 0.0002457378601885573, "loss": 4.958, "mean_token_accuracy": 0.2163891687989235, "num_tokens": 121526359.0, "step": 70055 }, { "entropy": 5.95477032661438, "epoch": 5.450885041820658, "grad_norm": 1.4765625, "learning_rate": 0.00024571038021374705, "loss": 5.0224, "mean_token_accuracy": 0.21252834796905518, "num_tokens": 121535001.0, "step": 70060 }, { "entropy": 5.885092401504517, "epoch": 5.451274071192375, "grad_norm": 1.4921875, "learning_rate": 0.00024568290068336014, "loss": 4.9255, "mean_token_accuracy": 0.2156697019934654, "num_tokens": 121543938.0, "step": 70065 }, { "entropy": 5.8728879451751705, "epoch": 5.451663100564093, "grad_norm": 1.546875, "learning_rate": 0.0002456554215978135, "loss": 4.9091, "mean_token_accuracy": 0.21648670732975006, "num_tokens": 121552009.0, "step": 70070 }, { "entropy": 5.889917659759521, "epoch": 5.45205212993581, "grad_norm": 1.421875, "learning_rate": 0.0002456279429575242, "loss": 4.947, "mean_token_accuracy": 0.22220084071159363, "num_tokens": 121560117.0, "step": 70075 }, { "entropy": 5.909624242782593, "epoch": 5.4524411593075275, "grad_norm": 1.515625, "learning_rate": 0.00024560046476290905, "loss": 5.0279, "mean_token_accuracy": 0.2108195036649704, "num_tokens": 121568796.0, "step": 70080 }, { "entropy": 5.845491886138916, "epoch": 5.452830188679245, "grad_norm": 1.3828125, "learning_rate": 0.00024557298701438504, "loss": 4.8618, "mean_token_accuracy": 0.21641364246606826, "num_tokens": 121577650.0, "step": 70085 }, { "entropy": 5.9159543991088865, "epoch": 5.453219218050963, "grad_norm": 1.5078125, "learning_rate": 0.0002455455097123691, "loss": 4.946, "mean_token_accuracy": 0.2233739748597145, "num_tokens": 121585997.0, "step": 70090 }, { "entropy": 5.869453573226929, "epoch": 5.453608247422681, "grad_norm": 1.3984375, "learning_rate": 0.0002455180328572783, "loss": 4.9526, "mean_token_accuracy": 0.20883786976337432, "num_tokens": 121594753.0, "step": 70095 }, { "entropy": 5.838490629196167, "epoch": 5.453997276794398, "grad_norm": 1.625, "learning_rate": 0.00024549055644952926, "loss": 4.8379, "mean_token_accuracy": 0.22815800309181214, "num_tokens": 121602593.0, "step": 70100 }, { "entropy": 5.931815338134766, "epoch": 5.454386306166116, "grad_norm": 1.390625, "learning_rate": 0.0002454630804895392, "loss": 5.0415, "mean_token_accuracy": 0.21055189967155458, "num_tokens": 121612073.0, "step": 70105 }, { "entropy": 5.915041971206665, "epoch": 5.454775335537833, "grad_norm": 1.5390625, "learning_rate": 0.0002454356049777248, "loss": 4.9168, "mean_token_accuracy": 0.21592997312545775, "num_tokens": 121620847.0, "step": 70110 }, { "entropy": 5.8787009716033936, "epoch": 5.4551643649095505, "grad_norm": 1.5078125, "learning_rate": 0.00024540812991450306, "loss": 4.9248, "mean_token_accuracy": 0.2222980961203575, "num_tokens": 121629440.0, "step": 70115 }, { "entropy": 5.791359186172485, "epoch": 5.455553394281268, "grad_norm": 1.375, "learning_rate": 0.00024538065530029093, "loss": 4.8319, "mean_token_accuracy": 0.22363897114992143, "num_tokens": 121637539.0, "step": 70120 }, { "entropy": 5.840430736541748, "epoch": 5.455942423652986, "grad_norm": 1.5625, "learning_rate": 0.0002453531811355051, "loss": 4.9732, "mean_token_accuracy": 0.21694067269563674, "num_tokens": 121646081.0, "step": 70125 }, { "entropy": 5.880767583847046, "epoch": 5.456331453024704, "grad_norm": 1.453125, "learning_rate": 0.00024532570742056257, "loss": 5.0025, "mean_token_accuracy": 0.21445721685886382, "num_tokens": 121655138.0, "step": 70130 }, { "entropy": 5.9068340301513675, "epoch": 5.456720482396421, "grad_norm": 1.59375, "learning_rate": 0.00024529823415588025, "loss": 4.971, "mean_token_accuracy": 0.2148249551653862, "num_tokens": 121663528.0, "step": 70135 }, { "entropy": 5.848746919631958, "epoch": 5.457109511768138, "grad_norm": 1.546875, "learning_rate": 0.0002452707613418749, "loss": 4.8283, "mean_token_accuracy": 0.23226836770772935, "num_tokens": 121671818.0, "step": 70140 }, { "entropy": 5.837978076934815, "epoch": 5.457498541139856, "grad_norm": 1.6171875, "learning_rate": 0.00024524328897896345, "loss": 4.9491, "mean_token_accuracy": 0.22009336799383164, "num_tokens": 121680803.0, "step": 70145 }, { "entropy": 5.873604011535645, "epoch": 5.4578875705115735, "grad_norm": 1.4921875, "learning_rate": 0.00024521581706756266, "loss": 4.9368, "mean_token_accuracy": 0.21695126891136168, "num_tokens": 121689917.0, "step": 70150 }, { "entropy": 5.839484977722168, "epoch": 5.458276599883291, "grad_norm": 1.484375, "learning_rate": 0.00024518834560808954, "loss": 4.9222, "mean_token_accuracy": 0.22134851515293122, "num_tokens": 121698281.0, "step": 70155 }, { "entropy": 5.9200358390808105, "epoch": 5.458665629255009, "grad_norm": 1.40625, "learning_rate": 0.00024516087460096074, "loss": 5.0057, "mean_token_accuracy": 0.21614780873060227, "num_tokens": 121707311.0, "step": 70160 }, { "entropy": 5.8499139785766605, "epoch": 5.459054658626727, "grad_norm": 1.5, "learning_rate": 0.0002451334040465933, "loss": 4.8317, "mean_token_accuracy": 0.2256646141409874, "num_tokens": 121717187.0, "step": 70165 }, { "entropy": 5.860132265090942, "epoch": 5.459443687998444, "grad_norm": 1.546875, "learning_rate": 0.00024510593394540383, "loss": 4.9191, "mean_token_accuracy": 0.20968862622976303, "num_tokens": 121725713.0, "step": 70170 }, { "entropy": 5.931229114532471, "epoch": 5.459832717370161, "grad_norm": 1.5078125, "learning_rate": 0.0002450784642978092, "loss": 4.9305, "mean_token_accuracy": 0.2226481944322586, "num_tokens": 121734089.0, "step": 70175 }, { "entropy": 5.880706071853638, "epoch": 5.460221746741879, "grad_norm": 1.4609375, "learning_rate": 0.0002450509951042263, "loss": 4.8806, "mean_token_accuracy": 0.22196077257394792, "num_tokens": 121742615.0, "step": 70180 }, { "entropy": 5.883300733566284, "epoch": 5.4606107761135965, "grad_norm": 1.3828125, "learning_rate": 0.00024502352636507184, "loss": 4.9598, "mean_token_accuracy": 0.2176334649324417, "num_tokens": 121751042.0, "step": 70185 }, { "entropy": 5.854633426666259, "epoch": 5.460999805485314, "grad_norm": 1.375, "learning_rate": 0.00024499605808076273, "loss": 4.9523, "mean_token_accuracy": 0.22110584378242493, "num_tokens": 121759716.0, "step": 70190 }, { "entropy": 5.7913196086883545, "epoch": 5.461388834857032, "grad_norm": 1.4453125, "learning_rate": 0.00024496859025171564, "loss": 4.8257, "mean_token_accuracy": 0.22525720596313475, "num_tokens": 121768151.0, "step": 70195 }, { "entropy": 5.831320667266846, "epoch": 5.46177786422875, "grad_norm": 1.484375, "learning_rate": 0.0002449411228783474, "loss": 4.8896, "mean_token_accuracy": 0.22174605429172517, "num_tokens": 121776734.0, "step": 70200 }, { "entropy": 5.871917772293091, "epoch": 5.462166893600466, "grad_norm": 1.4609375, "learning_rate": 0.00024491365596107477, "loss": 4.8781, "mean_token_accuracy": 0.22642588317394258, "num_tokens": 121784598.0, "step": 70205 }, { "entropy": 5.863680648803711, "epoch": 5.462555922972184, "grad_norm": 1.3984375, "learning_rate": 0.00024488618950031457, "loss": 4.8666, "mean_token_accuracy": 0.22186751961708068, "num_tokens": 121793953.0, "step": 70210 }, { "entropy": 5.813996982574463, "epoch": 5.462944952343902, "grad_norm": 1.5625, "learning_rate": 0.00024485872349648335, "loss": 4.8979, "mean_token_accuracy": 0.2226432040333748, "num_tokens": 121802909.0, "step": 70215 }, { "entropy": 5.879582834243775, "epoch": 5.4633339817156195, "grad_norm": 1.3203125, "learning_rate": 0.00024483125794999815, "loss": 4.9851, "mean_token_accuracy": 0.21645007729530336, "num_tokens": 121812752.0, "step": 70220 }, { "entropy": 5.918142175674438, "epoch": 5.463723011087337, "grad_norm": 1.4921875, "learning_rate": 0.0002448037928612756, "loss": 4.9235, "mean_token_accuracy": 0.21603080928325652, "num_tokens": 121821293.0, "step": 70225 }, { "entropy": 5.949479675292968, "epoch": 5.464112040459055, "grad_norm": 1.46875, "learning_rate": 0.0002447763282307324, "loss": 4.9548, "mean_token_accuracy": 0.2240629956126213, "num_tokens": 121829980.0, "step": 70230 }, { "entropy": 5.909882974624634, "epoch": 5.4645010698307726, "grad_norm": 1.375, "learning_rate": 0.0002447488640587854, "loss": 4.9638, "mean_token_accuracy": 0.2191912516951561, "num_tokens": 121838496.0, "step": 70235 }, { "entropy": 5.90141806602478, "epoch": 5.46489009920249, "grad_norm": 1.5, "learning_rate": 0.00024472140034585113, "loss": 4.9055, "mean_token_accuracy": 0.21905417740345, "num_tokens": 121846744.0, "step": 70240 }, { "entropy": 5.789193820953369, "epoch": 5.465279128574207, "grad_norm": 1.484375, "learning_rate": 0.00024469393709234647, "loss": 4.8812, "mean_token_accuracy": 0.22844281792640686, "num_tokens": 121855059.0, "step": 70245 }, { "entropy": 5.858499765396118, "epoch": 5.465668157945925, "grad_norm": 1.4453125, "learning_rate": 0.00024466647429868804, "loss": 4.8925, "mean_token_accuracy": 0.22334830462932587, "num_tokens": 121863654.0, "step": 70250 }, { "entropy": 5.833910608291626, "epoch": 5.4660571873176425, "grad_norm": 1.484375, "learning_rate": 0.0002446390119652926, "loss": 4.8624, "mean_token_accuracy": 0.22110218703746795, "num_tokens": 121872034.0, "step": 70255 }, { "entropy": 5.822856044769287, "epoch": 5.46644621668936, "grad_norm": 1.4140625, "learning_rate": 0.00024461155009257684, "loss": 4.8298, "mean_token_accuracy": 0.23349737823009492, "num_tokens": 121881173.0, "step": 70260 }, { "entropy": 5.890830707550049, "epoch": 5.466835246061078, "grad_norm": 1.53125, "learning_rate": 0.00024458408868095744, "loss": 4.9303, "mean_token_accuracy": 0.22202355712652205, "num_tokens": 121889996.0, "step": 70265 }, { "entropy": 5.93950629234314, "epoch": 5.4672242754327955, "grad_norm": 1.375, "learning_rate": 0.00024455662773085107, "loss": 5.0153, "mean_token_accuracy": 0.2144548401236534, "num_tokens": 121899032.0, "step": 70270 }, { "entropy": 5.957671451568603, "epoch": 5.467613304804512, "grad_norm": 1.4296875, "learning_rate": 0.0002445291672426744, "loss": 4.927, "mean_token_accuracy": 0.21856434643268585, "num_tokens": 121907953.0, "step": 70275 }, { "entropy": 5.89250111579895, "epoch": 5.46800233417623, "grad_norm": 1.3984375, "learning_rate": 0.00024450170721684416, "loss": 4.9286, "mean_token_accuracy": 0.21921935826539993, "num_tokens": 121916492.0, "step": 70280 }, { "entropy": 5.960846662521362, "epoch": 5.468391363547948, "grad_norm": 1.4140625, "learning_rate": 0.0002444742476537769, "loss": 4.9899, "mean_token_accuracy": 0.2174324333667755, "num_tokens": 121925762.0, "step": 70285 }, { "entropy": 5.808321475982666, "epoch": 5.4687803929196654, "grad_norm": 1.3359375, "learning_rate": 0.00024444678855388934, "loss": 4.8233, "mean_token_accuracy": 0.23028063923120498, "num_tokens": 121935085.0, "step": 70290 }, { "entropy": 5.865771484375, "epoch": 5.469169422291383, "grad_norm": 1.4140625, "learning_rate": 0.00024441932991759824, "loss": 4.9316, "mean_token_accuracy": 0.21919080764055252, "num_tokens": 121943887.0, "step": 70295 }, { "entropy": 5.879450130462646, "epoch": 5.469558451663101, "grad_norm": 1.578125, "learning_rate": 0.0002443918717453201, "loss": 4.9537, "mean_token_accuracy": 0.21358540803194045, "num_tokens": 121952211.0, "step": 70300 }, { "entropy": 5.861865091323852, "epoch": 5.4699474810348185, "grad_norm": 1.5859375, "learning_rate": 0.0002443644140374715, "loss": 4.9643, "mean_token_accuracy": 0.2119327887892723, "num_tokens": 121960413.0, "step": 70305 }, { "entropy": 5.895777654647827, "epoch": 5.470336510406535, "grad_norm": 1.484375, "learning_rate": 0.00024433695679446934, "loss": 4.8796, "mean_token_accuracy": 0.2266196131706238, "num_tokens": 121968314.0, "step": 70310 }, { "entropy": 5.8208451747894285, "epoch": 5.470725539778253, "grad_norm": 1.5078125, "learning_rate": 0.0002443095000167299, "loss": 4.8453, "mean_token_accuracy": 0.22463129013776778, "num_tokens": 121977432.0, "step": 70315 }, { "entropy": 5.85915732383728, "epoch": 5.471114569149971, "grad_norm": 1.4765625, "learning_rate": 0.00024428204370467, "loss": 4.944, "mean_token_accuracy": 0.21576273441314697, "num_tokens": 121986649.0, "step": 70320 }, { "entropy": 5.863361167907715, "epoch": 5.471503598521688, "grad_norm": 1.4453125, "learning_rate": 0.00024425458785870617, "loss": 4.9327, "mean_token_accuracy": 0.2120680943131447, "num_tokens": 121995408.0, "step": 70325 }, { "entropy": 5.867340612411499, "epoch": 5.471892627893406, "grad_norm": 1.5, "learning_rate": 0.00024422713247925507, "loss": 4.8461, "mean_token_accuracy": 0.21574461162090303, "num_tokens": 122003775.0, "step": 70330 }, { "entropy": 5.895418882369995, "epoch": 5.472281657265124, "grad_norm": 1.65625, "learning_rate": 0.0002441996775667332, "loss": 4.9058, "mean_token_accuracy": 0.22133471667766572, "num_tokens": 122011249.0, "step": 70335 }, { "entropy": 5.87779393196106, "epoch": 5.472670686636841, "grad_norm": 1.4296875, "learning_rate": 0.0002441722231215572, "loss": 4.9756, "mean_token_accuracy": 0.21311632096767424, "num_tokens": 122019895.0, "step": 70340 }, { "entropy": 5.852601814270019, "epoch": 5.473059716008558, "grad_norm": 1.609375, "learning_rate": 0.00024414476914414373, "loss": 4.966, "mean_token_accuracy": 0.21349520981311798, "num_tokens": 122028452.0, "step": 70345 }, { "entropy": 5.7951802730560305, "epoch": 5.473448745380276, "grad_norm": 1.4140625, "learning_rate": 0.00024411731563490918, "loss": 4.845, "mean_token_accuracy": 0.22670210599899293, "num_tokens": 122036648.0, "step": 70350 }, { "entropy": 5.859739303588867, "epoch": 5.473837774751994, "grad_norm": 1.5390625, "learning_rate": 0.00024408986259427025, "loss": 4.8644, "mean_token_accuracy": 0.22684519588947297, "num_tokens": 122044621.0, "step": 70355 }, { "entropy": 5.895005941390991, "epoch": 5.474226804123711, "grad_norm": 1.46875, "learning_rate": 0.00024406241002264346, "loss": 4.9798, "mean_token_accuracy": 0.21889501363039016, "num_tokens": 122053525.0, "step": 70360 }, { "entropy": 5.90136866569519, "epoch": 5.474615833495429, "grad_norm": 1.5546875, "learning_rate": 0.00024403495792044532, "loss": 4.9678, "mean_token_accuracy": 0.21378229111433028, "num_tokens": 122062247.0, "step": 70365 }, { "entropy": 5.911420202255249, "epoch": 5.475004862867147, "grad_norm": 1.5234375, "learning_rate": 0.00024400750628809247, "loss": 4.9261, "mean_token_accuracy": 0.22436732798814774, "num_tokens": 122071683.0, "step": 70370 }, { "entropy": 5.870447587966919, "epoch": 5.475393892238864, "grad_norm": 1.4609375, "learning_rate": 0.00024398005512600134, "loss": 4.8832, "mean_token_accuracy": 0.22033074498176575, "num_tokens": 122079902.0, "step": 70375 }, { "entropy": 5.835946273803711, "epoch": 5.475782921610581, "grad_norm": 1.5, "learning_rate": 0.00024395260443458856, "loss": 4.8184, "mean_token_accuracy": 0.22671363204717637, "num_tokens": 122088200.0, "step": 70380 }, { "entropy": 5.895721817016602, "epoch": 5.476171950982299, "grad_norm": 1.421875, "learning_rate": 0.00024392515421427054, "loss": 4.9635, "mean_token_accuracy": 0.22096757143735885, "num_tokens": 122096338.0, "step": 70385 }, { "entropy": 5.817822027206421, "epoch": 5.476560980354017, "grad_norm": 1.3984375, "learning_rate": 0.00024389770446546388, "loss": 4.7914, "mean_token_accuracy": 0.2322947785258293, "num_tokens": 122104811.0, "step": 70390 }, { "entropy": 5.873475551605225, "epoch": 5.476950009725734, "grad_norm": 1.4296875, "learning_rate": 0.00024387025518858503, "loss": 4.9461, "mean_token_accuracy": 0.2219479575753212, "num_tokens": 122113422.0, "step": 70395 }, { "entropy": 5.857664489746094, "epoch": 5.477339039097452, "grad_norm": 1.6171875, "learning_rate": 0.0002438428063840505, "loss": 4.9495, "mean_token_accuracy": 0.21425848007202147, "num_tokens": 122121951.0, "step": 70400 }, { "entropy": 5.810535907745361, "epoch": 5.47772806846917, "grad_norm": 1.5390625, "learning_rate": 0.00024381535805227677, "loss": 4.7773, "mean_token_accuracy": 0.23977371156215668, "num_tokens": 122130648.0, "step": 70405 }, { "entropy": 5.892986726760864, "epoch": 5.478117097840887, "grad_norm": 1.546875, "learning_rate": 0.00024378791019368036, "loss": 4.9422, "mean_token_accuracy": 0.2219313934445381, "num_tokens": 122139143.0, "step": 70410 }, { "entropy": 5.860080337524414, "epoch": 5.478506127212604, "grad_norm": 1.5546875, "learning_rate": 0.00024376046280867765, "loss": 4.9538, "mean_token_accuracy": 0.2216213583946228, "num_tokens": 122147116.0, "step": 70415 }, { "entropy": 5.883833694458008, "epoch": 5.478895156584322, "grad_norm": 1.53125, "learning_rate": 0.00024373301589768531, "loss": 4.8949, "mean_token_accuracy": 0.22029977440834045, "num_tokens": 122155336.0, "step": 70420 }, { "entropy": 5.892518424987793, "epoch": 5.47928418595604, "grad_norm": 1.4921875, "learning_rate": 0.0002437055694611197, "loss": 4.9307, "mean_token_accuracy": 0.21999952346086502, "num_tokens": 122164318.0, "step": 70425 }, { "entropy": 5.981170177459717, "epoch": 5.479673215327757, "grad_norm": 1.5703125, "learning_rate": 0.00024367812349939723, "loss": 5.0438, "mean_token_accuracy": 0.21360650956630706, "num_tokens": 122173744.0, "step": 70430 }, { "entropy": 5.9328819751739506, "epoch": 5.480062244699475, "grad_norm": 1.4296875, "learning_rate": 0.00024365067801293438, "loss": 4.9323, "mean_token_accuracy": 0.21956901699304582, "num_tokens": 122181976.0, "step": 70435 }, { "entropy": 5.865108585357666, "epoch": 5.480451274071193, "grad_norm": 1.4453125, "learning_rate": 0.00024362323300214755, "loss": 4.8431, "mean_token_accuracy": 0.22158541083335875, "num_tokens": 122190548.0, "step": 70440 }, { "entropy": 5.850777912139892, "epoch": 5.48084030344291, "grad_norm": 1.546875, "learning_rate": 0.0002435957884674533, "loss": 4.9534, "mean_token_accuracy": 0.21562442183494568, "num_tokens": 122199276.0, "step": 70445 }, { "entropy": 5.877582550048828, "epoch": 5.481229332814627, "grad_norm": 1.4765625, "learning_rate": 0.0002435683444092679, "loss": 4.9277, "mean_token_accuracy": 0.2194230630993843, "num_tokens": 122208252.0, "step": 70450 }, { "entropy": 5.8184239864349365, "epoch": 5.481618362186345, "grad_norm": 1.546875, "learning_rate": 0.0002435409008280079, "loss": 4.7988, "mean_token_accuracy": 0.2301386460661888, "num_tokens": 122217336.0, "step": 70455 }, { "entropy": 5.918790292739868, "epoch": 5.482007391558063, "grad_norm": 1.4609375, "learning_rate": 0.0002435134577240896, "loss": 4.9613, "mean_token_accuracy": 0.2185482755303383, "num_tokens": 122226158.0, "step": 70460 }, { "entropy": 5.7809507846832275, "epoch": 5.48239642092978, "grad_norm": 1.609375, "learning_rate": 0.00024348601509792956, "loss": 4.7286, "mean_token_accuracy": 0.2381079152226448, "num_tokens": 122234737.0, "step": 70465 }, { "entropy": 5.883880090713501, "epoch": 5.482785450301498, "grad_norm": 1.4921875, "learning_rate": 0.00024345857294994405, "loss": 4.9712, "mean_token_accuracy": 0.21722276359796525, "num_tokens": 122243079.0, "step": 70470 }, { "entropy": 5.904862689971924, "epoch": 5.483174479673215, "grad_norm": 1.390625, "learning_rate": 0.00024343113128054945, "loss": 4.9881, "mean_token_accuracy": 0.2185622438788414, "num_tokens": 122252467.0, "step": 70475 }, { "entropy": 5.910847234725952, "epoch": 5.483563509044933, "grad_norm": 1.3828125, "learning_rate": 0.0002434036900901621, "loss": 5.0127, "mean_token_accuracy": 0.2124548599123955, "num_tokens": 122261930.0, "step": 70480 }, { "entropy": 5.987967443466187, "epoch": 5.48395253841665, "grad_norm": 1.453125, "learning_rate": 0.00024337624937919856, "loss": 5.0594, "mean_token_accuracy": 0.20829004496335984, "num_tokens": 122270707.0, "step": 70485 }, { "entropy": 5.853066253662109, "epoch": 5.484341567788368, "grad_norm": 1.46875, "learning_rate": 0.00024334880914807512, "loss": 4.8582, "mean_token_accuracy": 0.22321339696645737, "num_tokens": 122279711.0, "step": 70490 }, { "entropy": 5.858671617507935, "epoch": 5.484730597160086, "grad_norm": 1.5546875, "learning_rate": 0.00024332136939720806, "loss": 4.9207, "mean_token_accuracy": 0.22278978377580644, "num_tokens": 122287518.0, "step": 70495 }, { "entropy": 5.819047975540161, "epoch": 5.485119626531803, "grad_norm": 1.484375, "learning_rate": 0.00024329393012701396, "loss": 4.9541, "mean_token_accuracy": 0.2194607138633728, "num_tokens": 122295816.0, "step": 70500 }, { "entropy": 5.873182916641236, "epoch": 5.485508655903521, "grad_norm": 1.671875, "learning_rate": 0.00024326649133790885, "loss": 4.8437, "mean_token_accuracy": 0.2168092757463455, "num_tokens": 122304231.0, "step": 70505 }, { "entropy": 5.851479244232178, "epoch": 5.485897685275238, "grad_norm": 1.609375, "learning_rate": 0.00024323905303030925, "loss": 4.8012, "mean_token_accuracy": 0.22867920994758606, "num_tokens": 122313051.0, "step": 70510 }, { "entropy": 5.879076051712036, "epoch": 5.486286714646956, "grad_norm": 1.5, "learning_rate": 0.00024321161520463147, "loss": 4.8027, "mean_token_accuracy": 0.23242637664079666, "num_tokens": 122321467.0, "step": 70515 }, { "entropy": 5.927892208099365, "epoch": 5.486675744018673, "grad_norm": 1.5546875, "learning_rate": 0.00024318417786129188, "loss": 4.8821, "mean_token_accuracy": 0.21385224610567094, "num_tokens": 122329761.0, "step": 70520 }, { "entropy": 5.944902658462524, "epoch": 5.487064773390391, "grad_norm": 1.4140625, "learning_rate": 0.00024315674100070672, "loss": 4.984, "mean_token_accuracy": 0.21199873089790344, "num_tokens": 122338714.0, "step": 70525 }, { "entropy": 5.87919430732727, "epoch": 5.487453802762109, "grad_norm": 1.453125, "learning_rate": 0.0002431293046232923, "loss": 4.8994, "mean_token_accuracy": 0.21970379948616028, "num_tokens": 122347378.0, "step": 70530 }, { "entropy": 5.8648277759552006, "epoch": 5.487842832133826, "grad_norm": 1.6171875, "learning_rate": 0.00024310186872946498, "loss": 4.8401, "mean_token_accuracy": 0.2287174642086029, "num_tokens": 122355092.0, "step": 70535 }, { "entropy": 5.930278635025024, "epoch": 5.488231861505543, "grad_norm": 1.4375, "learning_rate": 0.00024307443331964107, "loss": 4.9931, "mean_token_accuracy": 0.21015854477882384, "num_tokens": 122363855.0, "step": 70540 }, { "entropy": 5.899869966506958, "epoch": 5.488620890877261, "grad_norm": 1.53125, "learning_rate": 0.00024304699839423677, "loss": 4.9132, "mean_token_accuracy": 0.2202589064836502, "num_tokens": 122372298.0, "step": 70545 }, { "entropy": 5.865393733978271, "epoch": 5.489009920248979, "grad_norm": 1.5078125, "learning_rate": 0.00024301956395366838, "loss": 4.9134, "mean_token_accuracy": 0.22467932999134063, "num_tokens": 122380916.0, "step": 70550 }, { "entropy": 5.795569133758545, "epoch": 5.489398949620696, "grad_norm": 1.390625, "learning_rate": 0.00024299212999835223, "loss": 4.9414, "mean_token_accuracy": 0.21357515156269075, "num_tokens": 122389638.0, "step": 70555 }, { "entropy": 5.9335315227508545, "epoch": 5.489787978992414, "grad_norm": 1.5234375, "learning_rate": 0.00024296469652870456, "loss": 4.9819, "mean_token_accuracy": 0.21384841203689575, "num_tokens": 122397983.0, "step": 70560 }, { "entropy": 5.926889944076538, "epoch": 5.490177008364132, "grad_norm": 1.546875, "learning_rate": 0.00024293726354514166, "loss": 4.9498, "mean_token_accuracy": 0.22419352382421492, "num_tokens": 122406395.0, "step": 70565 }, { "entropy": 5.888062286376953, "epoch": 5.490566037735849, "grad_norm": 1.5703125, "learning_rate": 0.0002429098310480798, "loss": 4.9012, "mean_token_accuracy": 0.22472501546144485, "num_tokens": 122414551.0, "step": 70570 }, { "entropy": 5.898818016052246, "epoch": 5.490955067107567, "grad_norm": 1.4296875, "learning_rate": 0.00024288239903793508, "loss": 4.9295, "mean_token_accuracy": 0.2245040312409401, "num_tokens": 122422757.0, "step": 70575 }, { "entropy": 5.879982900619507, "epoch": 5.491344096479284, "grad_norm": 1.5234375, "learning_rate": 0.00024285496751512393, "loss": 4.962, "mean_token_accuracy": 0.21537859588861466, "num_tokens": 122432085.0, "step": 70580 }, { "entropy": 5.899964141845703, "epoch": 5.491733125851002, "grad_norm": 1.3203125, "learning_rate": 0.0002428275364800624, "loss": 4.8423, "mean_token_accuracy": 0.23134653270244598, "num_tokens": 122441838.0, "step": 70585 }, { "entropy": 5.877882957458496, "epoch": 5.492122155222719, "grad_norm": 1.6328125, "learning_rate": 0.00024280010593316683, "loss": 4.9312, "mean_token_accuracy": 0.2212147071957588, "num_tokens": 122450114.0, "step": 70590 }, { "entropy": 5.932202863693237, "epoch": 5.492511184594437, "grad_norm": 1.4296875, "learning_rate": 0.0002427726758748534, "loss": 4.9149, "mean_token_accuracy": 0.21399688124656677, "num_tokens": 122458806.0, "step": 70595 }, { "entropy": 5.898769569396973, "epoch": 5.492900213966155, "grad_norm": 1.484375, "learning_rate": 0.0002427452463055383, "loss": 4.9815, "mean_token_accuracy": 0.2062707394361496, "num_tokens": 122467252.0, "step": 70600 }, { "entropy": 5.946411514282227, "epoch": 5.493289243337872, "grad_norm": 1.453125, "learning_rate": 0.00024271781722563773, "loss": 4.928, "mean_token_accuracy": 0.22092086523771287, "num_tokens": 122475751.0, "step": 70605 }, { "entropy": 5.943218803405761, "epoch": 5.493678272709589, "grad_norm": 1.4453125, "learning_rate": 0.00024269038863556798, "loss": 4.9103, "mean_token_accuracy": 0.21298309713602065, "num_tokens": 122484126.0, "step": 70610 }, { "entropy": 5.883031797409058, "epoch": 5.494067302081307, "grad_norm": 1.5, "learning_rate": 0.00024266296053574506, "loss": 4.9192, "mean_token_accuracy": 0.22110921889543533, "num_tokens": 122492714.0, "step": 70615 }, { "entropy": 5.842199516296387, "epoch": 5.494456331453025, "grad_norm": 1.453125, "learning_rate": 0.0002426355329265853, "loss": 4.8268, "mean_token_accuracy": 0.22903233617544175, "num_tokens": 122501466.0, "step": 70620 }, { "entropy": 5.831239938735962, "epoch": 5.494845360824742, "grad_norm": 1.4609375, "learning_rate": 0.00024260810580850479, "loss": 4.9266, "mean_token_accuracy": 0.21231242567300795, "num_tokens": 122510098.0, "step": 70625 }, { "entropy": 5.903623867034912, "epoch": 5.49523439019646, "grad_norm": 1.59375, "learning_rate": 0.00024258067918191971, "loss": 5.0007, "mean_token_accuracy": 0.21722180694341658, "num_tokens": 122518883.0, "step": 70630 }, { "entropy": 5.971438360214234, "epoch": 5.495623419568178, "grad_norm": 1.4921875, "learning_rate": 0.0002425532530472463, "loss": 4.931, "mean_token_accuracy": 0.21792835593223572, "num_tokens": 122527408.0, "step": 70635 }, { "entropy": 5.86884388923645, "epoch": 5.496012448939895, "grad_norm": 1.5234375, "learning_rate": 0.00024252582740490053, "loss": 4.8707, "mean_token_accuracy": 0.22278157472610474, "num_tokens": 122535859.0, "step": 70640 }, { "entropy": 5.872522211074829, "epoch": 5.496401478311612, "grad_norm": 1.5234375, "learning_rate": 0.00024249840225529874, "loss": 4.9054, "mean_token_accuracy": 0.2259932279586792, "num_tokens": 122544360.0, "step": 70645 }, { "entropy": 5.853538513183594, "epoch": 5.49679050768333, "grad_norm": 1.5390625, "learning_rate": 0.0002424709775988569, "loss": 4.8426, "mean_token_accuracy": 0.2178159922361374, "num_tokens": 122552457.0, "step": 70650 }, { "entropy": 5.8580464839935305, "epoch": 5.497179537055048, "grad_norm": 1.6171875, "learning_rate": 0.00024244355343599116, "loss": 4.9204, "mean_token_accuracy": 0.21358455419540406, "num_tokens": 122560153.0, "step": 70655 }, { "entropy": 5.805581521987915, "epoch": 5.497568566426765, "grad_norm": 1.53125, "learning_rate": 0.00024241612976711786, "loss": 4.8629, "mean_token_accuracy": 0.22413382679224014, "num_tokens": 122568602.0, "step": 70660 }, { "entropy": 5.907294797897339, "epoch": 5.497957595798483, "grad_norm": 1.5625, "learning_rate": 0.00024238870659265278, "loss": 4.8996, "mean_token_accuracy": 0.22667179107666016, "num_tokens": 122576663.0, "step": 70665 }, { "entropy": 5.965759897232056, "epoch": 5.498346625170201, "grad_norm": 1.5625, "learning_rate": 0.00024236128391301215, "loss": 4.93, "mean_token_accuracy": 0.21304364800453185, "num_tokens": 122585835.0, "step": 70670 }, { "entropy": 5.979984474182129, "epoch": 5.4987356545419175, "grad_norm": 1.453125, "learning_rate": 0.00024233386172861217, "loss": 5.0512, "mean_token_accuracy": 0.21105094850063325, "num_tokens": 122595374.0, "step": 70675 }, { "entropy": 5.913734102249146, "epoch": 5.499124683913635, "grad_norm": 1.3984375, "learning_rate": 0.00024230644003986869, "loss": 5.0632, "mean_token_accuracy": 0.2016451060771942, "num_tokens": 122604836.0, "step": 70680 }, { "entropy": 5.901591014862061, "epoch": 5.499513713285353, "grad_norm": 1.4296875, "learning_rate": 0.00024227901884719806, "loss": 4.8871, "mean_token_accuracy": 0.21935382336378098, "num_tokens": 122612817.0, "step": 70685 }, { "entropy": 5.895628166198731, "epoch": 5.499902742657071, "grad_norm": 1.53125, "learning_rate": 0.00024225159815101626, "loss": 4.9484, "mean_token_accuracy": 0.2140609934926033, "num_tokens": 122621624.0, "step": 70690 }, { "entropy": 5.89120078086853, "epoch": 5.500291772028788, "grad_norm": 1.546875, "learning_rate": 0.00024222417795173929, "loss": 4.9512, "mean_token_accuracy": 0.21693207025527955, "num_tokens": 122630122.0, "step": 70695 }, { "entropy": 5.913450384140015, "epoch": 5.500680801400506, "grad_norm": 1.3671875, "learning_rate": 0.00024219675824978332, "loss": 4.9701, "mean_token_accuracy": 0.21708621978759765, "num_tokens": 122639185.0, "step": 70700 }, { "entropy": 5.899397563934326, "epoch": 5.501069830772224, "grad_norm": 1.484375, "learning_rate": 0.00024216933904556425, "loss": 4.8946, "mean_token_accuracy": 0.21679517328739167, "num_tokens": 122648285.0, "step": 70705 }, { "entropy": 5.897579145431519, "epoch": 5.501458860143941, "grad_norm": 1.375, "learning_rate": 0.00024214192033949827, "loss": 4.9101, "mean_token_accuracy": 0.2199350044131279, "num_tokens": 122657287.0, "step": 70710 }, { "entropy": 5.914361906051636, "epoch": 5.501847889515658, "grad_norm": 1.6015625, "learning_rate": 0.00024211450213200132, "loss": 4.8184, "mean_token_accuracy": 0.22597637325525283, "num_tokens": 122665666.0, "step": 70715 }, { "entropy": 5.868224382400513, "epoch": 5.502236918887376, "grad_norm": 1.4453125, "learning_rate": 0.00024208708442348943, "loss": 4.9592, "mean_token_accuracy": 0.21766099482774734, "num_tokens": 122674098.0, "step": 70720 }, { "entropy": 5.814623880386352, "epoch": 5.502625948259094, "grad_norm": 1.5546875, "learning_rate": 0.00024205966721437867, "loss": 4.8519, "mean_token_accuracy": 0.2253967821598053, "num_tokens": 122682201.0, "step": 70725 }, { "entropy": 5.794929838180542, "epoch": 5.503014977630811, "grad_norm": 1.5, "learning_rate": 0.00024203225050508503, "loss": 4.8997, "mean_token_accuracy": 0.21132864207029342, "num_tokens": 122690453.0, "step": 70730 }, { "entropy": 5.83031964302063, "epoch": 5.503404007002529, "grad_norm": 1.4765625, "learning_rate": 0.0002420048342960245, "loss": 4.9042, "mean_token_accuracy": 0.22359938323497772, "num_tokens": 122699690.0, "step": 70735 }, { "entropy": 5.886711978912354, "epoch": 5.503793036374246, "grad_norm": 1.5234375, "learning_rate": 0.00024197741858761318, "loss": 4.821, "mean_token_accuracy": 0.2310731902718544, "num_tokens": 122708090.0, "step": 70740 }, { "entropy": 5.906991577148437, "epoch": 5.5041820657459635, "grad_norm": 1.640625, "learning_rate": 0.0002419500033802669, "loss": 4.8488, "mean_token_accuracy": 0.21641291975975036, "num_tokens": 122716570.0, "step": 70745 }, { "entropy": 5.862079429626465, "epoch": 5.504571095117681, "grad_norm": 1.4296875, "learning_rate": 0.0002419225886744016, "loss": 4.8783, "mean_token_accuracy": 0.21815048903226852, "num_tokens": 122725680.0, "step": 70750 }, { "entropy": 5.938792943954468, "epoch": 5.504960124489399, "grad_norm": 1.3515625, "learning_rate": 0.00024189517447043352, "loss": 5.0127, "mean_token_accuracy": 0.20855545550584792, "num_tokens": 122734187.0, "step": 70755 }, { "entropy": 5.940947484970093, "epoch": 5.505349153861117, "grad_norm": 1.4609375, "learning_rate": 0.00024186776076877843, "loss": 5.0211, "mean_token_accuracy": 0.22191838026046753, "num_tokens": 122742465.0, "step": 70760 }, { "entropy": 5.900040912628174, "epoch": 5.505738183232834, "grad_norm": 1.4375, "learning_rate": 0.00024184034756985235, "loss": 4.9866, "mean_token_accuracy": 0.21057606786489486, "num_tokens": 122751132.0, "step": 70765 }, { "entropy": 5.91504545211792, "epoch": 5.506127212604552, "grad_norm": 1.53125, "learning_rate": 0.00024181293487407125, "loss": 4.9786, "mean_token_accuracy": 0.21571872234344483, "num_tokens": 122761015.0, "step": 70770 }, { "entropy": 5.875730371475219, "epoch": 5.50651624197627, "grad_norm": 1.3984375, "learning_rate": 0.000241785522681851, "loss": 4.9109, "mean_token_accuracy": 0.2188305139541626, "num_tokens": 122769357.0, "step": 70775 }, { "entropy": 5.871375370025635, "epoch": 5.5069052713479865, "grad_norm": 1.4609375, "learning_rate": 0.00024175811099360757, "loss": 4.8887, "mean_token_accuracy": 0.21324459016323088, "num_tokens": 122777446.0, "step": 70780 }, { "entropy": 5.812668943405152, "epoch": 5.507294300719704, "grad_norm": 1.59375, "learning_rate": 0.00024173069980975691, "loss": 4.8209, "mean_token_accuracy": 0.22518251687288285, "num_tokens": 122785650.0, "step": 70785 }, { "entropy": 5.845976972579956, "epoch": 5.507683330091422, "grad_norm": 1.4765625, "learning_rate": 0.00024170328913071493, "loss": 4.8494, "mean_token_accuracy": 0.22716088891029357, "num_tokens": 122794212.0, "step": 70790 }, { "entropy": 5.897595977783203, "epoch": 5.5080723594631396, "grad_norm": 1.4140625, "learning_rate": 0.00024167587895689753, "loss": 4.9185, "mean_token_accuracy": 0.21925583928823472, "num_tokens": 122803210.0, "step": 70795 }, { "entropy": 5.845195770263672, "epoch": 5.508461388834857, "grad_norm": 1.4921875, "learning_rate": 0.00024164846928872064, "loss": 4.8518, "mean_token_accuracy": 0.21931227445602416, "num_tokens": 122811351.0, "step": 70800 }, { "entropy": 5.908354043960571, "epoch": 5.508850418206575, "grad_norm": 1.4765625, "learning_rate": 0.00024162106012660012, "loss": 4.8722, "mean_token_accuracy": 0.22653854191303252, "num_tokens": 122819809.0, "step": 70805 }, { "entropy": 5.829726839065552, "epoch": 5.509239447578292, "grad_norm": 1.546875, "learning_rate": 0.0002415936514709519, "loss": 4.8632, "mean_token_accuracy": 0.22574039846658706, "num_tokens": 122828677.0, "step": 70810 }, { "entropy": 5.935666751861572, "epoch": 5.5096284769500095, "grad_norm": 1.3515625, "learning_rate": 0.0002415662433221918, "loss": 5.003, "mean_token_accuracy": 0.21530951857566832, "num_tokens": 122836991.0, "step": 70815 }, { "entropy": 5.8208420753479, "epoch": 5.510017506321727, "grad_norm": 1.5859375, "learning_rate": 0.00024153883568073576, "loss": 4.8385, "mean_token_accuracy": 0.21939749717712403, "num_tokens": 122845059.0, "step": 70820 }, { "entropy": 5.8439061641693115, "epoch": 5.510406535693445, "grad_norm": 1.65625, "learning_rate": 0.0002415114285469997, "loss": 4.9512, "mean_token_accuracy": 0.21516021937131882, "num_tokens": 122853590.0, "step": 70825 }, { "entropy": 5.8516028881072994, "epoch": 5.5107955650651625, "grad_norm": 1.484375, "learning_rate": 0.00024148402192139935, "loss": 4.916, "mean_token_accuracy": 0.2161286488175392, "num_tokens": 122861824.0, "step": 70830 }, { "entropy": 5.931172895431518, "epoch": 5.51118459443688, "grad_norm": 1.5, "learning_rate": 0.00024145661580435063, "loss": 4.9449, "mean_token_accuracy": 0.22111879289150238, "num_tokens": 122870583.0, "step": 70835 }, { "entropy": 5.858726453781128, "epoch": 5.511573623808598, "grad_norm": 1.5, "learning_rate": 0.00024142921019626933, "loss": 4.8475, "mean_token_accuracy": 0.22723608911037446, "num_tokens": 122878920.0, "step": 70840 }, { "entropy": 5.868453073501587, "epoch": 5.511962653180315, "grad_norm": 1.3984375, "learning_rate": 0.00024140180509757143, "loss": 4.9473, "mean_token_accuracy": 0.21629225760698317, "num_tokens": 122887686.0, "step": 70845 }, { "entropy": 5.921877241134643, "epoch": 5.5123516825520325, "grad_norm": 1.609375, "learning_rate": 0.00024137440050867265, "loss": 4.9472, "mean_token_accuracy": 0.22163681983947753, "num_tokens": 122897007.0, "step": 70850 }, { "entropy": 5.973113489151001, "epoch": 5.51274071192375, "grad_norm": 1.546875, "learning_rate": 0.00024134699642998882, "loss": 5.0276, "mean_token_accuracy": 0.207808618247509, "num_tokens": 122905710.0, "step": 70855 }, { "entropy": 5.976579189300537, "epoch": 5.513129741295468, "grad_norm": 1.46875, "learning_rate": 0.00024131959286193572, "loss": 5.006, "mean_token_accuracy": 0.2133365899324417, "num_tokens": 122915538.0, "step": 70860 }, { "entropy": 5.942613887786865, "epoch": 5.5135187706671855, "grad_norm": 1.546875, "learning_rate": 0.00024129218980492917, "loss": 4.9626, "mean_token_accuracy": 0.21609801352024077, "num_tokens": 122924027.0, "step": 70865 }, { "entropy": 5.838892126083374, "epoch": 5.513907800038903, "grad_norm": 1.421875, "learning_rate": 0.000241264787259385, "loss": 4.873, "mean_token_accuracy": 0.2217567205429077, "num_tokens": 122933406.0, "step": 70870 }, { "entropy": 5.893123579025269, "epoch": 5.51429682941062, "grad_norm": 1.484375, "learning_rate": 0.00024123738522571902, "loss": 4.9767, "mean_token_accuracy": 0.20833575427532197, "num_tokens": 122941777.0, "step": 70875 }, { "entropy": 5.911886215209961, "epoch": 5.514685858782338, "grad_norm": 1.5546875, "learning_rate": 0.0002412099837043469, "loss": 4.9598, "mean_token_accuracy": 0.2112295925617218, "num_tokens": 122950249.0, "step": 70880 }, { "entropy": 5.852481079101563, "epoch": 5.515074888154055, "grad_norm": 1.46875, "learning_rate": 0.00024118258269568456, "loss": 4.8638, "mean_token_accuracy": 0.2267287403345108, "num_tokens": 122959440.0, "step": 70885 }, { "entropy": 5.918970918655395, "epoch": 5.515463917525773, "grad_norm": 1.5390625, "learning_rate": 0.00024115518220014771, "loss": 4.9449, "mean_token_accuracy": 0.22516084611415862, "num_tokens": 122967703.0, "step": 70890 }, { "entropy": 5.913910865783691, "epoch": 5.515852946897491, "grad_norm": 1.515625, "learning_rate": 0.00024112778221815206, "loss": 4.9734, "mean_token_accuracy": 0.21686048209667205, "num_tokens": 122976058.0, "step": 70895 }, { "entropy": 5.834472608566284, "epoch": 5.5162419762692085, "grad_norm": 1.34375, "learning_rate": 0.00024110038275011343, "loss": 4.8494, "mean_token_accuracy": 0.22217390686273575, "num_tokens": 122985522.0, "step": 70900 }, { "entropy": 5.893016242980957, "epoch": 5.516631005640926, "grad_norm": 1.46875, "learning_rate": 0.00024107298379644754, "loss": 4.9399, "mean_token_accuracy": 0.21776696890592576, "num_tokens": 122994110.0, "step": 70905 }, { "entropy": 5.948649978637695, "epoch": 5.517020035012644, "grad_norm": 1.5, "learning_rate": 0.0002410455853575701, "loss": 5.0135, "mean_token_accuracy": 0.21296276450157164, "num_tokens": 123003532.0, "step": 70910 }, { "entropy": 5.915206813812256, "epoch": 5.517409064384361, "grad_norm": 1.53125, "learning_rate": 0.00024101818743389687, "loss": 4.8608, "mean_token_accuracy": 0.22741225212812424, "num_tokens": 123012054.0, "step": 70915 }, { "entropy": 5.851957511901856, "epoch": 5.517798093756078, "grad_norm": 1.4609375, "learning_rate": 0.00024099079002584355, "loss": 4.9116, "mean_token_accuracy": 0.22578116953372956, "num_tokens": 123021264.0, "step": 70920 }, { "entropy": 5.849913740158081, "epoch": 5.518187123127796, "grad_norm": 1.5625, "learning_rate": 0.00024096339313382586, "loss": 4.8927, "mean_token_accuracy": 0.2147666797041893, "num_tokens": 123029546.0, "step": 70925 }, { "entropy": 5.7046126365661625, "epoch": 5.518576152499514, "grad_norm": 1.4296875, "learning_rate": 0.00024093599675825954, "loss": 4.839, "mean_token_accuracy": 0.2178676173090935, "num_tokens": 123037959.0, "step": 70930 }, { "entropy": 5.847097969055175, "epoch": 5.5189651818712315, "grad_norm": 1.5, "learning_rate": 0.00024090860089956024, "loss": 4.9016, "mean_token_accuracy": 0.2248156487941742, "num_tokens": 123046714.0, "step": 70935 }, { "entropy": 5.851279544830322, "epoch": 5.519354211242949, "grad_norm": 1.3515625, "learning_rate": 0.0002408812055581437, "loss": 4.9204, "mean_token_accuracy": 0.22261950224637986, "num_tokens": 123055248.0, "step": 70940 }, { "entropy": 5.869126844406128, "epoch": 5.519743240614666, "grad_norm": 1.4375, "learning_rate": 0.00024085381073442536, "loss": 4.8483, "mean_token_accuracy": 0.23422433137893678, "num_tokens": 123063924.0, "step": 70945 }, { "entropy": 5.880530500411988, "epoch": 5.520132269986384, "grad_norm": 1.390625, "learning_rate": 0.00024082641642882125, "loss": 4.9552, "mean_token_accuracy": 0.21926818192005157, "num_tokens": 123072969.0, "step": 70950 }, { "entropy": 5.874475622177124, "epoch": 5.520521299358101, "grad_norm": 1.40625, "learning_rate": 0.00024079902264174686, "loss": 4.9445, "mean_token_accuracy": 0.21264958530664443, "num_tokens": 123081893.0, "step": 70955 }, { "entropy": 5.939900732040405, "epoch": 5.520910328729819, "grad_norm": 1.4921875, "learning_rate": 0.0002407716293736179, "loss": 4.9956, "mean_token_accuracy": 0.2108771562576294, "num_tokens": 123090011.0, "step": 70960 }, { "entropy": 5.756151580810547, "epoch": 5.521299358101537, "grad_norm": 2.3125, "learning_rate": 0.00024074423662484996, "loss": 4.7069, "mean_token_accuracy": 0.2429073706269264, "num_tokens": 123098451.0, "step": 70965 }, { "entropy": 5.930081939697265, "epoch": 5.5216883874732545, "grad_norm": 1.609375, "learning_rate": 0.0002407168443958587, "loss": 4.9838, "mean_token_accuracy": 0.21592566967010499, "num_tokens": 123106417.0, "step": 70970 }, { "entropy": 5.854647636413574, "epoch": 5.522077416844972, "grad_norm": 1.4609375, "learning_rate": 0.00024068945268705978, "loss": 4.88, "mean_token_accuracy": 0.22433900088071823, "num_tokens": 123115173.0, "step": 70975 }, { "entropy": 5.799871492385864, "epoch": 5.522466446216689, "grad_norm": 1.4765625, "learning_rate": 0.00024066206149886876, "loss": 4.7568, "mean_token_accuracy": 0.23893425911664962, "num_tokens": 123123579.0, "step": 70980 }, { "entropy": 5.8202595710754395, "epoch": 5.522855475588407, "grad_norm": 1.5234375, "learning_rate": 0.00024063467083170132, "loss": 4.782, "mean_token_accuracy": 0.2245902732014656, "num_tokens": 123132035.0, "step": 70985 }, { "entropy": 5.936633348464966, "epoch": 5.523244504960124, "grad_norm": 1.46875, "learning_rate": 0.0002406072806859731, "loss": 5.0514, "mean_token_accuracy": 0.21390410810708999, "num_tokens": 123140955.0, "step": 70990 }, { "entropy": 5.85298433303833, "epoch": 5.523633534331842, "grad_norm": 1.453125, "learning_rate": 0.0002405798910620996, "loss": 4.8901, "mean_token_accuracy": 0.22086906731128692, "num_tokens": 123149411.0, "step": 70995 }, { "entropy": 5.902180242538452, "epoch": 5.52402256370356, "grad_norm": 1.4375, "learning_rate": 0.0002405525019604965, "loss": 4.9229, "mean_token_accuracy": 0.22430809885263442, "num_tokens": 123157777.0, "step": 71000 }, { "entropy": 5.900916624069214, "epoch": 5.5244115930752775, "grad_norm": 1.5703125, "learning_rate": 0.00024052511338157928, "loss": 4.9151, "mean_token_accuracy": 0.2209058955311775, "num_tokens": 123166164.0, "step": 71005 }, { "entropy": 5.856133508682251, "epoch": 5.524800622446994, "grad_norm": 1.484375, "learning_rate": 0.00024049772532576364, "loss": 4.9405, "mean_token_accuracy": 0.21820068806409837, "num_tokens": 123174085.0, "step": 71010 }, { "entropy": 5.916501092910766, "epoch": 5.525189651818712, "grad_norm": 1.4375, "learning_rate": 0.00024047033779346505, "loss": 4.9532, "mean_token_accuracy": 0.21858211755752563, "num_tokens": 123183315.0, "step": 71015 }, { "entropy": 5.888610696792602, "epoch": 5.52557868119043, "grad_norm": 1.671875, "learning_rate": 0.0002404429507850992, "loss": 4.9192, "mean_token_accuracy": 0.2172047734260559, "num_tokens": 123192521.0, "step": 71020 }, { "entropy": 5.97922830581665, "epoch": 5.525967710562147, "grad_norm": 1.484375, "learning_rate": 0.0002404155643010815, "loss": 4.9761, "mean_token_accuracy": 0.21639478206634521, "num_tokens": 123201385.0, "step": 71025 }, { "entropy": 5.933700609207153, "epoch": 5.526356739933865, "grad_norm": 1.484375, "learning_rate": 0.00024038817834182762, "loss": 4.9795, "mean_token_accuracy": 0.22150099724531175, "num_tokens": 123209929.0, "step": 71030 }, { "entropy": 5.904707241058349, "epoch": 5.526745769305583, "grad_norm": 1.53125, "learning_rate": 0.00024036079290775308, "loss": 4.9453, "mean_token_accuracy": 0.22024631053209304, "num_tokens": 123217707.0, "step": 71035 }, { "entropy": 5.881718635559082, "epoch": 5.5271347986773005, "grad_norm": 1.46875, "learning_rate": 0.00024033340799927338, "loss": 4.847, "mean_token_accuracy": 0.22537967562675476, "num_tokens": 123226409.0, "step": 71040 }, { "entropy": 5.8941045761108395, "epoch": 5.527523828049017, "grad_norm": 1.5078125, "learning_rate": 0.000240306023616804, "loss": 4.9462, "mean_token_accuracy": 0.2212715521454811, "num_tokens": 123234512.0, "step": 71045 }, { "entropy": 5.86834397315979, "epoch": 5.527912857420735, "grad_norm": 1.5546875, "learning_rate": 0.00024027863976076047, "loss": 4.9294, "mean_token_accuracy": 0.21857585608959199, "num_tokens": 123243553.0, "step": 71050 }, { "entropy": 5.812940168380737, "epoch": 5.528301886792453, "grad_norm": 1.328125, "learning_rate": 0.0002402512564315583, "loss": 4.8695, "mean_token_accuracy": 0.23126472681760787, "num_tokens": 123252337.0, "step": 71055 }, { "entropy": 5.842457389831543, "epoch": 5.52869091616417, "grad_norm": 1.4921875, "learning_rate": 0.00024022387362961306, "loss": 4.9172, "mean_token_accuracy": 0.22423473596572877, "num_tokens": 123261818.0, "step": 71060 }, { "entropy": 5.91920166015625, "epoch": 5.529079945535888, "grad_norm": 1.390625, "learning_rate": 0.00024019649135534015, "loss": 4.8684, "mean_token_accuracy": 0.22065941095352173, "num_tokens": 123271109.0, "step": 71065 }, { "entropy": 5.927752733230591, "epoch": 5.529468974907606, "grad_norm": 1.4609375, "learning_rate": 0.00024016910960915512, "loss": 4.9281, "mean_token_accuracy": 0.22036345601081847, "num_tokens": 123279854.0, "step": 71070 }, { "entropy": 5.792593908309937, "epoch": 5.529858004279323, "grad_norm": 1.4375, "learning_rate": 0.00024014172839147336, "loss": 4.8499, "mean_token_accuracy": 0.22208085358142854, "num_tokens": 123288594.0, "step": 71075 }, { "entropy": 5.815707731246948, "epoch": 5.53024703365104, "grad_norm": 1.546875, "learning_rate": 0.00024011434770271033, "loss": 4.8905, "mean_token_accuracy": 0.2224251702427864, "num_tokens": 123297129.0, "step": 71080 }, { "entropy": 5.907900333404541, "epoch": 5.530636063022758, "grad_norm": 1.4921875, "learning_rate": 0.0002400869675432817, "loss": 4.9913, "mean_token_accuracy": 0.21807628870010376, "num_tokens": 123306404.0, "step": 71085 }, { "entropy": 5.908203554153443, "epoch": 5.531025092394476, "grad_norm": 1.3828125, "learning_rate": 0.00024005958791360266, "loss": 4.9069, "mean_token_accuracy": 0.2182743325829506, "num_tokens": 123315362.0, "step": 71090 }, { "entropy": 5.959443473815918, "epoch": 5.531414121766193, "grad_norm": 1.5234375, "learning_rate": 0.00024003220881408882, "loss": 4.9431, "mean_token_accuracy": 0.20926050543785096, "num_tokens": 123323661.0, "step": 71095 }, { "entropy": 5.908237075805664, "epoch": 5.531803151137911, "grad_norm": 1.515625, "learning_rate": 0.00024000483024515552, "loss": 4.9495, "mean_token_accuracy": 0.21583239436149598, "num_tokens": 123331508.0, "step": 71100 }, { "entropy": 5.8730137825012205, "epoch": 5.532192180509629, "grad_norm": 1.484375, "learning_rate": 0.00023997745220721823, "loss": 4.8844, "mean_token_accuracy": 0.22094352543354034, "num_tokens": 123340573.0, "step": 71105 }, { "entropy": 5.886836099624634, "epoch": 5.5325812098813465, "grad_norm": 1.5234375, "learning_rate": 0.00023995007470069236, "loss": 4.9681, "mean_token_accuracy": 0.21462431848049163, "num_tokens": 123348966.0, "step": 71110 }, { "entropy": 5.880202054977417, "epoch": 5.532970239253063, "grad_norm": 1.546875, "learning_rate": 0.00023992269772599335, "loss": 4.8393, "mean_token_accuracy": 0.23065102100372314, "num_tokens": 123357136.0, "step": 71115 }, { "entropy": 5.884918642044068, "epoch": 5.533359268624781, "grad_norm": 1.546875, "learning_rate": 0.00023989532128353654, "loss": 4.9844, "mean_token_accuracy": 0.21662943065166473, "num_tokens": 123366282.0, "step": 71120 }, { "entropy": 5.917414379119873, "epoch": 5.533748297996499, "grad_norm": 1.453125, "learning_rate": 0.0002398679453737374, "loss": 4.9605, "mean_token_accuracy": 0.21515192091464996, "num_tokens": 123376235.0, "step": 71125 }, { "entropy": 5.829476356506348, "epoch": 5.534137327368216, "grad_norm": 1.4375, "learning_rate": 0.00023984056999701121, "loss": 4.8859, "mean_token_accuracy": 0.21856586635112762, "num_tokens": 123385184.0, "step": 71130 }, { "entropy": 5.896203708648682, "epoch": 5.534526356739934, "grad_norm": 1.5859375, "learning_rate": 0.00023981319515377347, "loss": 4.9533, "mean_token_accuracy": 0.21635591089725495, "num_tokens": 123393507.0, "step": 71135 }, { "entropy": 5.874002981185913, "epoch": 5.534915386111652, "grad_norm": 1.5078125, "learning_rate": 0.00023978582084443939, "loss": 4.9587, "mean_token_accuracy": 0.20964184105396272, "num_tokens": 123402347.0, "step": 71140 }, { "entropy": 5.8775359153747555, "epoch": 5.535304415483369, "grad_norm": 1.4609375, "learning_rate": 0.0002397584470694244, "loss": 4.8438, "mean_token_accuracy": 0.2240394324064255, "num_tokens": 123410417.0, "step": 71145 }, { "entropy": 5.845563888549805, "epoch": 5.535693444855086, "grad_norm": 1.515625, "learning_rate": 0.000239731073829144, "loss": 4.8775, "mean_token_accuracy": 0.22936154454946517, "num_tokens": 123418851.0, "step": 71150 }, { "entropy": 5.858168363571167, "epoch": 5.536082474226804, "grad_norm": 1.546875, "learning_rate": 0.0002397037011240134, "loss": 4.8862, "mean_token_accuracy": 0.21338058412075042, "num_tokens": 123427188.0, "step": 71155 }, { "entropy": 5.827371311187744, "epoch": 5.536471503598522, "grad_norm": 1.4765625, "learning_rate": 0.00023967632895444796, "loss": 4.8169, "mean_token_accuracy": 0.2228875294327736, "num_tokens": 123435412.0, "step": 71160 }, { "entropy": 5.901863479614258, "epoch": 5.536860532970239, "grad_norm": 1.453125, "learning_rate": 0.000239648957320863, "loss": 4.9148, "mean_token_accuracy": 0.22370035499334334, "num_tokens": 123443548.0, "step": 71165 }, { "entropy": 5.823812627792359, "epoch": 5.537249562341957, "grad_norm": 1.5, "learning_rate": 0.0002396215862236738, "loss": 4.9489, "mean_token_accuracy": 0.2151074767112732, "num_tokens": 123452803.0, "step": 71170 }, { "entropy": 5.831398677825928, "epoch": 5.537638591713675, "grad_norm": 1.5625, "learning_rate": 0.00023959421566329574, "loss": 4.8128, "mean_token_accuracy": 0.22561281323432922, "num_tokens": 123461532.0, "step": 71175 }, { "entropy": 5.8820453643798825, "epoch": 5.538027621085392, "grad_norm": 1.40625, "learning_rate": 0.00023956684564014415, "loss": 4.9345, "mean_token_accuracy": 0.22349590957164764, "num_tokens": 123471282.0, "step": 71180 }, { "entropy": 5.888096809387207, "epoch": 5.538416650457109, "grad_norm": 1.515625, "learning_rate": 0.00023953947615463423, "loss": 4.9512, "mean_token_accuracy": 0.21931317150592805, "num_tokens": 123480142.0, "step": 71185 }, { "entropy": 5.808627367019653, "epoch": 5.538805679828827, "grad_norm": 1.4453125, "learning_rate": 0.0002395121072071813, "loss": 4.8685, "mean_token_accuracy": 0.2217669129371643, "num_tokens": 123488963.0, "step": 71190 }, { "entropy": 5.917604160308838, "epoch": 5.539194709200545, "grad_norm": 1.484375, "learning_rate": 0.00023948473879820072, "loss": 4.9357, "mean_token_accuracy": 0.2157071828842163, "num_tokens": 123498681.0, "step": 71195 }, { "entropy": 5.907694482803345, "epoch": 5.539583738572262, "grad_norm": 1.5234375, "learning_rate": 0.00023945737092810764, "loss": 4.9252, "mean_token_accuracy": 0.21854503750801085, "num_tokens": 123507935.0, "step": 71200 }, { "entropy": 5.85070013999939, "epoch": 5.53997276794398, "grad_norm": 1.53125, "learning_rate": 0.0002394300035973175, "loss": 4.8997, "mean_token_accuracy": 0.22331675589084626, "num_tokens": 123516674.0, "step": 71205 }, { "entropy": 5.836267280578613, "epoch": 5.540361797315697, "grad_norm": 1.3828125, "learning_rate": 0.00023940263680624535, "loss": 4.8709, "mean_token_accuracy": 0.21735917627811432, "num_tokens": 123525078.0, "step": 71210 }, { "entropy": 5.8304518699646, "epoch": 5.540750826687415, "grad_norm": 1.53125, "learning_rate": 0.00023937527055530643, "loss": 4.8696, "mean_token_accuracy": 0.22267885655164718, "num_tokens": 123533000.0, "step": 71215 }, { "entropy": 5.871550798416138, "epoch": 5.541139856059132, "grad_norm": 1.5234375, "learning_rate": 0.0002393479048449162, "loss": 4.9743, "mean_token_accuracy": 0.21853255927562715, "num_tokens": 123541410.0, "step": 71220 }, { "entropy": 5.933336162567139, "epoch": 5.54152888543085, "grad_norm": 1.4296875, "learning_rate": 0.00023932053967548971, "loss": 4.9366, "mean_token_accuracy": 0.22237518131732942, "num_tokens": 123550016.0, "step": 71225 }, { "entropy": 5.914285612106323, "epoch": 5.541917914802568, "grad_norm": 1.59375, "learning_rate": 0.00023929317504744235, "loss": 4.8213, "mean_token_accuracy": 0.23212036043405532, "num_tokens": 123557961.0, "step": 71230 }, { "entropy": 5.890051746368409, "epoch": 5.542306944174285, "grad_norm": 1.6171875, "learning_rate": 0.00023926581096118916, "loss": 4.9335, "mean_token_accuracy": 0.21679433286190034, "num_tokens": 123565541.0, "step": 71235 }, { "entropy": 5.883606243133545, "epoch": 5.542695973546003, "grad_norm": 1.5234375, "learning_rate": 0.0002392384474171454, "loss": 4.9776, "mean_token_accuracy": 0.2160152465105057, "num_tokens": 123574902.0, "step": 71240 }, { "entropy": 5.88239221572876, "epoch": 5.543085002917721, "grad_norm": 1.578125, "learning_rate": 0.00023921108441572625, "loss": 4.9283, "mean_token_accuracy": 0.22684556990861893, "num_tokens": 123583278.0, "step": 71245 }, { "entropy": 5.961444425582886, "epoch": 5.543474032289438, "grad_norm": 1.6171875, "learning_rate": 0.000239183721957347, "loss": 4.9245, "mean_token_accuracy": 0.2188818171620369, "num_tokens": 123591754.0, "step": 71250 }, { "entropy": 5.913015365600586, "epoch": 5.543863061661155, "grad_norm": 1.4296875, "learning_rate": 0.00023915636004242274, "loss": 4.9564, "mean_token_accuracy": 0.21619240194559097, "num_tokens": 123600432.0, "step": 71255 }, { "entropy": 5.889128351211548, "epoch": 5.544252091032873, "grad_norm": 1.6875, "learning_rate": 0.0002391289986713686, "loss": 4.9815, "mean_token_accuracy": 0.2184408888220787, "num_tokens": 123608832.0, "step": 71260 }, { "entropy": 5.8438990116119385, "epoch": 5.544641120404591, "grad_norm": 1.453125, "learning_rate": 0.00023910163784459986, "loss": 4.8646, "mean_token_accuracy": 0.22291169911623002, "num_tokens": 123617615.0, "step": 71265 }, { "entropy": 5.872749662399292, "epoch": 5.545030149776308, "grad_norm": 1.484375, "learning_rate": 0.0002390742775625317, "loss": 4.8914, "mean_token_accuracy": 0.22159286439418793, "num_tokens": 123625536.0, "step": 71270 }, { "entropy": 5.860332775115967, "epoch": 5.545419179148025, "grad_norm": 1.46875, "learning_rate": 0.00023904691782557908, "loss": 4.9099, "mean_token_accuracy": 0.21916413307189941, "num_tokens": 123635300.0, "step": 71275 }, { "entropy": 5.868891954421997, "epoch": 5.545808208519743, "grad_norm": 1.5546875, "learning_rate": 0.00023901955863415725, "loss": 4.9165, "mean_token_accuracy": 0.22071472704410552, "num_tokens": 123643180.0, "step": 71280 }, { "entropy": 5.796931743621826, "epoch": 5.546197237891461, "grad_norm": 1.6328125, "learning_rate": 0.00023899219998868142, "loss": 4.8621, "mean_token_accuracy": 0.22456008195877075, "num_tokens": 123651281.0, "step": 71285 }, { "entropy": 5.840266370773316, "epoch": 5.546586267263178, "grad_norm": 1.453125, "learning_rate": 0.00023896484188956664, "loss": 4.7752, "mean_token_accuracy": 0.23620522767305374, "num_tokens": 123659353.0, "step": 71290 }, { "entropy": 5.883699655532837, "epoch": 5.546975296634896, "grad_norm": 1.5546875, "learning_rate": 0.000238937484337228, "loss": 4.929, "mean_token_accuracy": 0.219449745118618, "num_tokens": 123667561.0, "step": 71295 }, { "entropy": 5.8165771484375, "epoch": 5.547364326006614, "grad_norm": 1.4453125, "learning_rate": 0.00023891012733208062, "loss": 4.8074, "mean_token_accuracy": 0.2314310625195503, "num_tokens": 123675847.0, "step": 71300 }, { "entropy": 5.911809253692627, "epoch": 5.547753355378331, "grad_norm": 1.578125, "learning_rate": 0.00023888277087453962, "loss": 4.9327, "mean_token_accuracy": 0.21171299815177919, "num_tokens": 123684055.0, "step": 71305 }, { "entropy": 5.923636817932129, "epoch": 5.548142384750049, "grad_norm": 1.578125, "learning_rate": 0.00023885541496502017, "loss": 5.0303, "mean_token_accuracy": 0.20587049424648285, "num_tokens": 123692104.0, "step": 71310 }, { "entropy": 5.8724524021148685, "epoch": 5.548531414121766, "grad_norm": 1.4453125, "learning_rate": 0.00023882805960393722, "loss": 4.9473, "mean_token_accuracy": 0.22192499041557312, "num_tokens": 123700815.0, "step": 71315 }, { "entropy": 5.969444942474365, "epoch": 5.548920443493484, "grad_norm": 1.6171875, "learning_rate": 0.0002388007047917059, "loss": 5.011, "mean_token_accuracy": 0.21902494877576828, "num_tokens": 123708931.0, "step": 71320 }, { "entropy": 5.888339471817017, "epoch": 5.549309472865201, "grad_norm": 1.4921875, "learning_rate": 0.00023877335052874122, "loss": 4.9011, "mean_token_accuracy": 0.21822427362203597, "num_tokens": 123717691.0, "step": 71325 }, { "entropy": 5.886244821548462, "epoch": 5.549698502236919, "grad_norm": 1.4921875, "learning_rate": 0.00023874599681545833, "loss": 4.9743, "mean_token_accuracy": 0.21292585283517837, "num_tokens": 123726798.0, "step": 71330 }, { "entropy": 5.84439697265625, "epoch": 5.550087531608637, "grad_norm": 1.59375, "learning_rate": 0.0002387186436522722, "loss": 4.9346, "mean_token_accuracy": 0.21453494131565093, "num_tokens": 123735806.0, "step": 71335 }, { "entropy": 5.89442138671875, "epoch": 5.550476560980354, "grad_norm": 1.5, "learning_rate": 0.0002386912910395979, "loss": 4.9468, "mean_token_accuracy": 0.21643429845571518, "num_tokens": 123744484.0, "step": 71340 }, { "entropy": 5.880376958847046, "epoch": 5.550865590352071, "grad_norm": 1.5234375, "learning_rate": 0.00023866393897785049, "loss": 4.8489, "mean_token_accuracy": 0.22609055638313294, "num_tokens": 123753431.0, "step": 71345 }, { "entropy": 5.914479827880859, "epoch": 5.551254619723789, "grad_norm": 1.453125, "learning_rate": 0.00023863658746744494, "loss": 4.9661, "mean_token_accuracy": 0.21664968878030777, "num_tokens": 123762179.0, "step": 71350 }, { "entropy": 5.913131284713745, "epoch": 5.551643649095507, "grad_norm": 1.53125, "learning_rate": 0.00023860923650879636, "loss": 4.8735, "mean_token_accuracy": 0.22453399002552032, "num_tokens": 123771205.0, "step": 71355 }, { "entropy": 5.919298267364502, "epoch": 5.552032678467224, "grad_norm": 1.421875, "learning_rate": 0.0002385818861023197, "loss": 4.8674, "mean_token_accuracy": 0.2230959415435791, "num_tokens": 123779365.0, "step": 71360 }, { "entropy": 5.865307903289795, "epoch": 5.552421707838942, "grad_norm": 1.421875, "learning_rate": 0.00023855453624842986, "loss": 4.922, "mean_token_accuracy": 0.21516790837049485, "num_tokens": 123787684.0, "step": 71365 }, { "entropy": 5.837750673294067, "epoch": 5.55281073721066, "grad_norm": 1.4921875, "learning_rate": 0.000238527186947542, "loss": 4.9106, "mean_token_accuracy": 0.22070905119180678, "num_tokens": 123797116.0, "step": 71370 }, { "entropy": 5.914835262298584, "epoch": 5.553199766582377, "grad_norm": 1.4609375, "learning_rate": 0.000238499838200071, "loss": 4.9359, "mean_token_accuracy": 0.21112614572048188, "num_tokens": 123806033.0, "step": 71375 }, { "entropy": 5.9647355556488035, "epoch": 5.553588795954094, "grad_norm": 1.3828125, "learning_rate": 0.00023847249000643185, "loss": 5.0494, "mean_token_accuracy": 0.21138681918382646, "num_tokens": 123815181.0, "step": 71380 }, { "entropy": 5.875647449493409, "epoch": 5.553977825325812, "grad_norm": 1.6328125, "learning_rate": 0.00023844514236703952, "loss": 4.9437, "mean_token_accuracy": 0.22360238581895828, "num_tokens": 123824450.0, "step": 71385 }, { "entropy": 5.86277027130127, "epoch": 5.5543668546975296, "grad_norm": 1.515625, "learning_rate": 0.000238417795282309, "loss": 4.9339, "mean_token_accuracy": 0.2161511018872261, "num_tokens": 123833159.0, "step": 71390 }, { "entropy": 5.9063958644866945, "epoch": 5.554755884069247, "grad_norm": 1.5703125, "learning_rate": 0.00023839044875265526, "loss": 4.9399, "mean_token_accuracy": 0.2193934887647629, "num_tokens": 123841305.0, "step": 71395 }, { "entropy": 5.858890533447266, "epoch": 5.555144913440965, "grad_norm": 1.5390625, "learning_rate": 0.0002383631027784931, "loss": 4.8593, "mean_token_accuracy": 0.2237251415848732, "num_tokens": 123850523.0, "step": 71400 }, { "entropy": 5.87549204826355, "epoch": 5.555533942812683, "grad_norm": 1.53125, "learning_rate": 0.00023833575736023754, "loss": 4.8923, "mean_token_accuracy": 0.2199530377984047, "num_tokens": 123859047.0, "step": 71405 }, { "entropy": 5.863650798797607, "epoch": 5.5559229721843995, "grad_norm": 1.4609375, "learning_rate": 0.00023830841249830348, "loss": 4.8484, "mean_token_accuracy": 0.22800556272268296, "num_tokens": 123867708.0, "step": 71410 }, { "entropy": 5.863533544540405, "epoch": 5.556312001556117, "grad_norm": 1.53125, "learning_rate": 0.0002382810681931059, "loss": 4.8563, "mean_token_accuracy": 0.2248632863163948, "num_tokens": 123876653.0, "step": 71415 }, { "entropy": 5.84511170387268, "epoch": 5.556701030927835, "grad_norm": 1.5390625, "learning_rate": 0.00023825372444505967, "loss": 4.8461, "mean_token_accuracy": 0.22102579176425935, "num_tokens": 123885626.0, "step": 71420 }, { "entropy": 5.861737585067749, "epoch": 5.5570900602995525, "grad_norm": 1.4921875, "learning_rate": 0.00023822638125457974, "loss": 4.9392, "mean_token_accuracy": 0.22003293633461, "num_tokens": 123894409.0, "step": 71425 }, { "entropy": 5.898362827301026, "epoch": 5.55747908967127, "grad_norm": 1.5234375, "learning_rate": 0.00023819903862208093, "loss": 4.9571, "mean_token_accuracy": 0.22036586999893187, "num_tokens": 123903174.0, "step": 71430 }, { "entropy": 5.897608661651612, "epoch": 5.557868119042988, "grad_norm": 1.6328125, "learning_rate": 0.0002381716965479781, "loss": 4.8669, "mean_token_accuracy": 0.22472616881132126, "num_tokens": 123911367.0, "step": 71435 }, { "entropy": 5.809305477142334, "epoch": 5.558257148414706, "grad_norm": 1.4375, "learning_rate": 0.00023814435503268617, "loss": 4.7945, "mean_token_accuracy": 0.23224235475063323, "num_tokens": 123919719.0, "step": 71440 }, { "entropy": 5.90183310508728, "epoch": 5.558646177786423, "grad_norm": 1.4609375, "learning_rate": 0.00023811701407661995, "loss": 5.0715, "mean_token_accuracy": 0.2156620055437088, "num_tokens": 123928109.0, "step": 71445 }, { "entropy": 5.84024133682251, "epoch": 5.55903520715814, "grad_norm": 1.515625, "learning_rate": 0.00023808967368019434, "loss": 4.8609, "mean_token_accuracy": 0.22007009834051133, "num_tokens": 123936701.0, "step": 71450 }, { "entropy": 5.874726963043213, "epoch": 5.559424236529858, "grad_norm": 1.4375, "learning_rate": 0.0002380623338438242, "loss": 4.82, "mean_token_accuracy": 0.2251657336950302, "num_tokens": 123945466.0, "step": 71455 }, { "entropy": 5.897744274139404, "epoch": 5.5598132659015755, "grad_norm": 1.5625, "learning_rate": 0.0002380349945679244, "loss": 4.8892, "mean_token_accuracy": 0.22062162756919862, "num_tokens": 123954016.0, "step": 71460 }, { "entropy": 5.842208385467529, "epoch": 5.560202295273293, "grad_norm": 1.328125, "learning_rate": 0.00023800765585290967, "loss": 4.8629, "mean_token_accuracy": 0.2231471136212349, "num_tokens": 123962608.0, "step": 71465 }, { "entropy": 5.8327594757080075, "epoch": 5.560591324645011, "grad_norm": 1.484375, "learning_rate": 0.00023798031769919488, "loss": 4.8545, "mean_token_accuracy": 0.21783513575792313, "num_tokens": 123970985.0, "step": 71470 }, { "entropy": 5.859819841384888, "epoch": 5.560980354016729, "grad_norm": 1.484375, "learning_rate": 0.0002379529801071949, "loss": 4.9287, "mean_token_accuracy": 0.22451525628566743, "num_tokens": 123978977.0, "step": 71475 }, { "entropy": 5.842158412933349, "epoch": 5.561369383388445, "grad_norm": 1.4453125, "learning_rate": 0.0002379256430773244, "loss": 4.8729, "mean_token_accuracy": 0.22186188995838166, "num_tokens": 123987497.0, "step": 71480 }, { "entropy": 5.917280435562134, "epoch": 5.561758412760163, "grad_norm": 1.5546875, "learning_rate": 0.00023789830660999822, "loss": 5.0108, "mean_token_accuracy": 0.20742530524730682, "num_tokens": 123995890.0, "step": 71485 }, { "entropy": 5.892652606964111, "epoch": 5.562147442131881, "grad_norm": 1.5, "learning_rate": 0.0002378709707056313, "loss": 4.9149, "mean_token_accuracy": 0.21924246847629547, "num_tokens": 124004108.0, "step": 71490 }, { "entropy": 5.8609894752502445, "epoch": 5.5625364715035985, "grad_norm": 1.3984375, "learning_rate": 0.00023784363536463827, "loss": 4.9073, "mean_token_accuracy": 0.22600919008255005, "num_tokens": 124012736.0, "step": 71495 }, { "entropy": 5.85231237411499, "epoch": 5.562925500875316, "grad_norm": 1.5078125, "learning_rate": 0.00023781630058743392, "loss": 4.9086, "mean_token_accuracy": 0.22204794287681578, "num_tokens": 124021315.0, "step": 71500 }, { "entropy": 5.830487871170044, "epoch": 5.563314530247034, "grad_norm": 1.5703125, "learning_rate": 0.0002377889663744331, "loss": 4.8588, "mean_token_accuracy": 0.2235457956790924, "num_tokens": 124029502.0, "step": 71505 }, { "entropy": 5.852705240249634, "epoch": 5.563703559618752, "grad_norm": 1.34375, "learning_rate": 0.0002377616327260504, "loss": 4.8464, "mean_token_accuracy": 0.2234371080994606, "num_tokens": 124039009.0, "step": 71510 }, { "entropy": 5.916640949249268, "epoch": 5.564092588990468, "grad_norm": 1.4375, "learning_rate": 0.00023773429964270065, "loss": 4.9776, "mean_token_accuracy": 0.21472072452306748, "num_tokens": 124048142.0, "step": 71515 }, { "entropy": 5.8968117237091064, "epoch": 5.564481618362186, "grad_norm": 1.5859375, "learning_rate": 0.0002377069671247986, "loss": 4.8948, "mean_token_accuracy": 0.21522412747144698, "num_tokens": 124057005.0, "step": 71520 }, { "entropy": 5.875715065002441, "epoch": 5.564870647733904, "grad_norm": 1.375, "learning_rate": 0.00023767963517275903, "loss": 4.9094, "mean_token_accuracy": 0.21324016153812408, "num_tokens": 124066234.0, "step": 71525 }, { "entropy": 5.84584321975708, "epoch": 5.5652596771056215, "grad_norm": 1.46875, "learning_rate": 0.0002376523037869965, "loss": 4.7759, "mean_token_accuracy": 0.22949904948472977, "num_tokens": 124074838.0, "step": 71530 }, { "entropy": 5.8684920310974125, "epoch": 5.565648706477339, "grad_norm": 1.5234375, "learning_rate": 0.00023762497296792585, "loss": 4.8341, "mean_token_accuracy": 0.2179991438984871, "num_tokens": 124083638.0, "step": 71535 }, { "entropy": 5.879748725891114, "epoch": 5.566037735849057, "grad_norm": 1.5, "learning_rate": 0.00023759764271596173, "loss": 4.8278, "mean_token_accuracy": 0.23106204718351364, "num_tokens": 124092056.0, "step": 71540 }, { "entropy": 5.91393723487854, "epoch": 5.566426765220774, "grad_norm": 1.4140625, "learning_rate": 0.00023757031303151888, "loss": 4.9385, "mean_token_accuracy": 0.2164360076189041, "num_tokens": 124100682.0, "step": 71545 }, { "entropy": 5.86744704246521, "epoch": 5.566815794592491, "grad_norm": 1.484375, "learning_rate": 0.00023754298391501195, "loss": 4.9672, "mean_token_accuracy": 0.21989387273788452, "num_tokens": 124109007.0, "step": 71550 }, { "entropy": 5.90716962814331, "epoch": 5.567204823964209, "grad_norm": 1.421875, "learning_rate": 0.0002375156553668556, "loss": 4.954, "mean_token_accuracy": 0.21844569742679595, "num_tokens": 124117891.0, "step": 71555 }, { "entropy": 5.872766590118408, "epoch": 5.567593853335927, "grad_norm": 1.546875, "learning_rate": 0.0002374883273874645, "loss": 4.9151, "mean_token_accuracy": 0.2165599435567856, "num_tokens": 124126016.0, "step": 71560 }, { "entropy": 5.841198110580445, "epoch": 5.5679828827076445, "grad_norm": 1.421875, "learning_rate": 0.0002374609999772534, "loss": 4.9495, "mean_token_accuracy": 0.21689030528068542, "num_tokens": 124134550.0, "step": 71565 }, { "entropy": 5.854798316955566, "epoch": 5.568371912079362, "grad_norm": 1.5078125, "learning_rate": 0.00023743367313663682, "loss": 4.9099, "mean_token_accuracy": 0.2210424557328224, "num_tokens": 124142890.0, "step": 71570 }, { "entropy": 5.929487085342407, "epoch": 5.56876094145108, "grad_norm": 1.5, "learning_rate": 0.00023740634686602945, "loss": 4.9859, "mean_token_accuracy": 0.21308027505874633, "num_tokens": 124151922.0, "step": 71575 }, { "entropy": 5.916885614395142, "epoch": 5.569149970822798, "grad_norm": 1.375, "learning_rate": 0.00023737902116584598, "loss": 4.985, "mean_token_accuracy": 0.20874694734811783, "num_tokens": 124160233.0, "step": 71580 }, { "entropy": 5.835113954544068, "epoch": 5.569539000194514, "grad_norm": 1.5234375, "learning_rate": 0.00023735169603650104, "loss": 4.8617, "mean_token_accuracy": 0.22175232768058778, "num_tokens": 124167735.0, "step": 71585 }, { "entropy": 5.880920124053955, "epoch": 5.569928029566232, "grad_norm": 1.4140625, "learning_rate": 0.00023732437147840906, "loss": 5.0041, "mean_token_accuracy": 0.21433311253786086, "num_tokens": 124176773.0, "step": 71590 }, { "entropy": 5.93673038482666, "epoch": 5.57031705893795, "grad_norm": 1.6796875, "learning_rate": 0.00023729704749198482, "loss": 4.9898, "mean_token_accuracy": 0.21146591305732726, "num_tokens": 124185573.0, "step": 71595 }, { "entropy": 5.892629766464234, "epoch": 5.5707060883096675, "grad_norm": 1.453125, "learning_rate": 0.00023726972407764286, "loss": 4.7779, "mean_token_accuracy": 0.23135612308979034, "num_tokens": 124193750.0, "step": 71600 }, { "entropy": 5.964342403411865, "epoch": 5.571095117681385, "grad_norm": 1.3359375, "learning_rate": 0.00023724240123579782, "loss": 5.0317, "mean_token_accuracy": 0.20909804552793504, "num_tokens": 124203082.0, "step": 71605 }, { "entropy": 5.873932647705078, "epoch": 5.571484147053102, "grad_norm": 1.5234375, "learning_rate": 0.00023721507896686412, "loss": 4.9531, "mean_token_accuracy": 0.22478119283914566, "num_tokens": 124211748.0, "step": 71610 }, { "entropy": 5.925532817840576, "epoch": 5.57187317642482, "grad_norm": 1.4296875, "learning_rate": 0.00023718775727125658, "loss": 4.9956, "mean_token_accuracy": 0.21337562054395676, "num_tokens": 124220626.0, "step": 71615 }, { "entropy": 5.927702569961548, "epoch": 5.572262205796537, "grad_norm": 1.4765625, "learning_rate": 0.00023716043614938965, "loss": 4.9812, "mean_token_accuracy": 0.2146678552031517, "num_tokens": 124229213.0, "step": 71620 }, { "entropy": 5.950141763687133, "epoch": 5.572651235168255, "grad_norm": 1.453125, "learning_rate": 0.00023713311560167783, "loss": 5.0296, "mean_token_accuracy": 0.2136816844344139, "num_tokens": 124238142.0, "step": 71625 }, { "entropy": 5.922205591201783, "epoch": 5.573040264539973, "grad_norm": 1.484375, "learning_rate": 0.00023710579562853573, "loss": 4.9608, "mean_token_accuracy": 0.21990497261285782, "num_tokens": 124246828.0, "step": 71630 }, { "entropy": 5.8808447360992435, "epoch": 5.5734292939116905, "grad_norm": 1.4375, "learning_rate": 0.00023707847623037783, "loss": 4.9496, "mean_token_accuracy": 0.22464536279439926, "num_tokens": 124255950.0, "step": 71635 }, { "entropy": 5.864926528930664, "epoch": 5.573818323283408, "grad_norm": 1.5859375, "learning_rate": 0.00023705115740761874, "loss": 4.8268, "mean_token_accuracy": 0.2276832193136215, "num_tokens": 124264328.0, "step": 71640 }, { "entropy": 5.898495435714722, "epoch": 5.574207352655126, "grad_norm": 1.53125, "learning_rate": 0.00023702383916067294, "loss": 4.9252, "mean_token_accuracy": 0.22460647374391557, "num_tokens": 124272392.0, "step": 71645 }, { "entropy": 5.879801893234253, "epoch": 5.574596382026843, "grad_norm": 1.6953125, "learning_rate": 0.00023699652148995488, "loss": 4.8391, "mean_token_accuracy": 0.226133069396019, "num_tokens": 124280635.0, "step": 71650 }, { "entropy": 5.82718505859375, "epoch": 5.57498541139856, "grad_norm": 1.5078125, "learning_rate": 0.00023696920439587917, "loss": 4.8832, "mean_token_accuracy": 0.2218429833650589, "num_tokens": 124289549.0, "step": 71655 }, { "entropy": 5.843733310699463, "epoch": 5.575374440770278, "grad_norm": 1.46875, "learning_rate": 0.00023694188787886023, "loss": 4.8787, "mean_token_accuracy": 0.22525503784418105, "num_tokens": 124298498.0, "step": 71660 }, { "entropy": 5.9289967060089115, "epoch": 5.575763470141996, "grad_norm": 1.515625, "learning_rate": 0.0002369145719393126, "loss": 4.9582, "mean_token_accuracy": 0.21312253922224045, "num_tokens": 124306840.0, "step": 71665 }, { "entropy": 5.880760526657104, "epoch": 5.5761524995137135, "grad_norm": 1.484375, "learning_rate": 0.0002368872565776507, "loss": 4.939, "mean_token_accuracy": 0.21875345706939697, "num_tokens": 124315600.0, "step": 71670 }, { "entropy": 5.878965425491333, "epoch": 5.576541528885431, "grad_norm": 1.53125, "learning_rate": 0.00023685994179428887, "loss": 4.9971, "mean_token_accuracy": 0.20883547514677048, "num_tokens": 124325042.0, "step": 71675 }, { "entropy": 5.938892936706543, "epoch": 5.576930558257148, "grad_norm": 1.4765625, "learning_rate": 0.00023683262758964185, "loss": 4.8869, "mean_token_accuracy": 0.22147416770458223, "num_tokens": 124333882.0, "step": 71680 }, { "entropy": 5.938407945632934, "epoch": 5.577319587628866, "grad_norm": 1.46875, "learning_rate": 0.00023680531396412397, "loss": 4.9792, "mean_token_accuracy": 0.2097380205988884, "num_tokens": 124342771.0, "step": 71685 }, { "entropy": 5.8764979362487795, "epoch": 5.577708617000583, "grad_norm": 1.484375, "learning_rate": 0.00023677800091814966, "loss": 4.8266, "mean_token_accuracy": 0.2193641409277916, "num_tokens": 124350832.0, "step": 71690 }, { "entropy": 5.835262680053711, "epoch": 5.578097646372301, "grad_norm": 1.5546875, "learning_rate": 0.0002367506884521334, "loss": 4.8517, "mean_token_accuracy": 0.21996341198682784, "num_tokens": 124359506.0, "step": 71695 }, { "entropy": 5.835062694549561, "epoch": 5.578486675744019, "grad_norm": 1.328125, "learning_rate": 0.00023672337656648951, "loss": 4.956, "mean_token_accuracy": 0.21816186755895614, "num_tokens": 124368062.0, "step": 71700 }, { "entropy": 5.883343267440796, "epoch": 5.5788757051157365, "grad_norm": 1.4296875, "learning_rate": 0.0002366960652616324, "loss": 4.919, "mean_token_accuracy": 0.21482980251312256, "num_tokens": 124376619.0, "step": 71705 }, { "entropy": 5.852959299087525, "epoch": 5.579264734487454, "grad_norm": 1.515625, "learning_rate": 0.0002366687545379766, "loss": 4.8663, "mean_token_accuracy": 0.2251165419816971, "num_tokens": 124385696.0, "step": 71710 }, { "entropy": 5.824714088439942, "epoch": 5.579653763859171, "grad_norm": 1.515625, "learning_rate": 0.00023664144439593644, "loss": 4.8486, "mean_token_accuracy": 0.22657761871814727, "num_tokens": 124393981.0, "step": 71715 }, { "entropy": 5.906927013397217, "epoch": 5.580042793230889, "grad_norm": 1.640625, "learning_rate": 0.00023661413483592626, "loss": 4.9177, "mean_token_accuracy": 0.21867086887359619, "num_tokens": 124402629.0, "step": 71720 }, { "entropy": 5.8916889190673825, "epoch": 5.580431822602606, "grad_norm": 1.453125, "learning_rate": 0.00023658682585836049, "loss": 4.9472, "mean_token_accuracy": 0.22116289138793946, "num_tokens": 124411704.0, "step": 71725 }, { "entropy": 5.91919903755188, "epoch": 5.580820851974324, "grad_norm": 1.5546875, "learning_rate": 0.00023655951746365356, "loss": 4.9785, "mean_token_accuracy": 0.21445553600788117, "num_tokens": 124420858.0, "step": 71730 }, { "entropy": 5.933084869384766, "epoch": 5.581209881346042, "grad_norm": 1.3515625, "learning_rate": 0.00023653220965221973, "loss": 4.9576, "mean_token_accuracy": 0.2231084555387497, "num_tokens": 124430164.0, "step": 71735 }, { "entropy": 5.925378227233887, "epoch": 5.5815989107177595, "grad_norm": 1.5390625, "learning_rate": 0.00023650490242447338, "loss": 4.9446, "mean_token_accuracy": 0.22054435163736344, "num_tokens": 124438818.0, "step": 71740 }, { "entropy": 5.905390691757202, "epoch": 5.581987940089476, "grad_norm": 1.546875, "learning_rate": 0.00023647759578082883, "loss": 4.9606, "mean_token_accuracy": 0.21851639598608016, "num_tokens": 124447520.0, "step": 71745 }, { "entropy": 5.86979489326477, "epoch": 5.582376969461194, "grad_norm": 1.4296875, "learning_rate": 0.00023645028972170046, "loss": 4.839, "mean_token_accuracy": 0.22222554683685303, "num_tokens": 124456340.0, "step": 71750 }, { "entropy": 5.848875665664673, "epoch": 5.582765998832912, "grad_norm": 1.5, "learning_rate": 0.00023642298424750264, "loss": 4.9317, "mean_token_accuracy": 0.2159243181347847, "num_tokens": 124464897.0, "step": 71755 }, { "entropy": 5.870050096511841, "epoch": 5.583155028204629, "grad_norm": 1.4609375, "learning_rate": 0.00023639567935864958, "loss": 4.8952, "mean_token_accuracy": 0.2175465151667595, "num_tokens": 124473912.0, "step": 71760 }, { "entropy": 5.843994522094727, "epoch": 5.583544057576347, "grad_norm": 1.5234375, "learning_rate": 0.0002363683750555557, "loss": 4.8843, "mean_token_accuracy": 0.2141558364033699, "num_tokens": 124482086.0, "step": 71765 }, { "entropy": 5.849083137512207, "epoch": 5.583933086948065, "grad_norm": 1.40625, "learning_rate": 0.0002363410713386352, "loss": 4.894, "mean_token_accuracy": 0.22688110917806625, "num_tokens": 124491134.0, "step": 71770 }, { "entropy": 5.890615606307984, "epoch": 5.5843221163197825, "grad_norm": 1.375, "learning_rate": 0.00023631376820830248, "loss": 4.9006, "mean_token_accuracy": 0.22537148147821426, "num_tokens": 124499266.0, "step": 71775 }, { "entropy": 5.918025970458984, "epoch": 5.5847111456915, "grad_norm": 1.359375, "learning_rate": 0.0002362864656649717, "loss": 4.889, "mean_token_accuracy": 0.2198265850543976, "num_tokens": 124508183.0, "step": 71780 }, { "entropy": 5.927316474914551, "epoch": 5.585100175063217, "grad_norm": 1.4609375, "learning_rate": 0.00023625916370905714, "loss": 4.9173, "mean_token_accuracy": 0.22319251596927642, "num_tokens": 124516700.0, "step": 71785 }, { "entropy": 5.916544198989868, "epoch": 5.585489204434935, "grad_norm": 1.4921875, "learning_rate": 0.00023623186234097315, "loss": 5.0042, "mean_token_accuracy": 0.21733037680387496, "num_tokens": 124525529.0, "step": 71790 }, { "entropy": 5.899367904663086, "epoch": 5.585878233806652, "grad_norm": 1.5703125, "learning_rate": 0.00023620456156113397, "loss": 4.9197, "mean_token_accuracy": 0.22569195032119752, "num_tokens": 124533770.0, "step": 71795 }, { "entropy": 5.826066303253174, "epoch": 5.58626726317837, "grad_norm": 1.3515625, "learning_rate": 0.00023617726136995377, "loss": 4.8696, "mean_token_accuracy": 0.21504239737987518, "num_tokens": 124543605.0, "step": 71800 }, { "entropy": 5.94782338142395, "epoch": 5.586656292550088, "grad_norm": 1.546875, "learning_rate": 0.00023614996176784687, "loss": 4.9852, "mean_token_accuracy": 0.2155761420726776, "num_tokens": 124552377.0, "step": 71805 }, { "entropy": 5.857422494888306, "epoch": 5.5870453219218055, "grad_norm": 1.421875, "learning_rate": 0.00023612266275522737, "loss": 4.8677, "mean_token_accuracy": 0.229761104285717, "num_tokens": 124560557.0, "step": 71810 }, { "entropy": 5.914006662368775, "epoch": 5.587434351293522, "grad_norm": 1.734375, "learning_rate": 0.00023609536433250966, "loss": 4.9569, "mean_token_accuracy": 0.22052199989557267, "num_tokens": 124568405.0, "step": 71815 }, { "entropy": 5.8679533958435055, "epoch": 5.58782338066524, "grad_norm": 1.421875, "learning_rate": 0.00023606806650010786, "loss": 4.9518, "mean_token_accuracy": 0.21538047045469283, "num_tokens": 124576658.0, "step": 71820 }, { "entropy": 5.844242525100708, "epoch": 5.588212410036958, "grad_norm": 1.4609375, "learning_rate": 0.00023604076925843622, "loss": 4.8192, "mean_token_accuracy": 0.2277559369802475, "num_tokens": 124584945.0, "step": 71825 }, { "entropy": 5.877267265319825, "epoch": 5.588601439408675, "grad_norm": 1.46875, "learning_rate": 0.00023601347260790884, "loss": 4.9243, "mean_token_accuracy": 0.21626728177070617, "num_tokens": 124593920.0, "step": 71830 }, { "entropy": 5.96894941329956, "epoch": 5.588990468780393, "grad_norm": 1.6328125, "learning_rate": 0.00023598617654894006, "loss": 4.9855, "mean_token_accuracy": 0.2106095477938652, "num_tokens": 124603076.0, "step": 71835 }, { "entropy": 5.850470876693725, "epoch": 5.589379498152111, "grad_norm": 1.3828125, "learning_rate": 0.00023595888108194385, "loss": 4.8415, "mean_token_accuracy": 0.2315011590719223, "num_tokens": 124611561.0, "step": 71840 }, { "entropy": 5.871891164779663, "epoch": 5.5897685275238285, "grad_norm": 1.421875, "learning_rate": 0.0002359315862073345, "loss": 4.97, "mean_token_accuracy": 0.20848801583051682, "num_tokens": 124619751.0, "step": 71845 }, { "entropy": 5.923875570297241, "epoch": 5.590157556895545, "grad_norm": 1.375, "learning_rate": 0.0002359042919255262, "loss": 4.9408, "mean_token_accuracy": 0.219897823035717, "num_tokens": 124628886.0, "step": 71850 }, { "entropy": 5.934640407562256, "epoch": 5.590546586267263, "grad_norm": 1.40625, "learning_rate": 0.00023587699823693304, "loss": 4.9869, "mean_token_accuracy": 0.20579180419445037, "num_tokens": 124637632.0, "step": 71855 }, { "entropy": 5.866040134429932, "epoch": 5.590935615638981, "grad_norm": 1.5625, "learning_rate": 0.00023584970514196912, "loss": 4.8525, "mean_token_accuracy": 0.2247046172618866, "num_tokens": 124646597.0, "step": 71860 }, { "entropy": 5.828413629531861, "epoch": 5.591324645010698, "grad_norm": 1.515625, "learning_rate": 0.00023582241264104864, "loss": 4.8818, "mean_token_accuracy": 0.2165502443909645, "num_tokens": 124655203.0, "step": 71865 }, { "entropy": 5.861328649520874, "epoch": 5.591713674382416, "grad_norm": 1.40625, "learning_rate": 0.00023579512073458565, "loss": 4.9027, "mean_token_accuracy": 0.21877923756837844, "num_tokens": 124663451.0, "step": 71870 }, { "entropy": 5.932674598693848, "epoch": 5.592102703754134, "grad_norm": 1.5234375, "learning_rate": 0.00023576782942299424, "loss": 4.9431, "mean_token_accuracy": 0.2149149551987648, "num_tokens": 124671593.0, "step": 71875 }, { "entropy": 5.88585467338562, "epoch": 5.592491733125851, "grad_norm": 1.515625, "learning_rate": 0.0002357405387066886, "loss": 5.0205, "mean_token_accuracy": 0.21367121934890748, "num_tokens": 124680901.0, "step": 71880 }, { "entropy": 5.852211904525757, "epoch": 5.592880762497568, "grad_norm": 1.4296875, "learning_rate": 0.0002357132485860829, "loss": 4.8388, "mean_token_accuracy": 0.2252211168408394, "num_tokens": 124689404.0, "step": 71885 }, { "entropy": 5.897069597244263, "epoch": 5.593269791869286, "grad_norm": 1.546875, "learning_rate": 0.00023568595906159107, "loss": 4.9137, "mean_token_accuracy": 0.21659686118364335, "num_tokens": 124697813.0, "step": 71890 }, { "entropy": 5.89212703704834, "epoch": 5.593658821241004, "grad_norm": 1.4765625, "learning_rate": 0.00023565867013362725, "loss": 4.9437, "mean_token_accuracy": 0.21245740801095964, "num_tokens": 124706975.0, "step": 71895 }, { "entropy": 5.9368408203125, "epoch": 5.594047850612721, "grad_norm": 1.4609375, "learning_rate": 0.00023563138180260552, "loss": 4.9144, "mean_token_accuracy": 0.21478965878486633, "num_tokens": 124715648.0, "step": 71900 }, { "entropy": 5.832048130035401, "epoch": 5.594436879984439, "grad_norm": 1.546875, "learning_rate": 0.00023560409406893986, "loss": 4.8983, "mean_token_accuracy": 0.21714415550231933, "num_tokens": 124725661.0, "step": 71905 }, { "entropy": 5.8279478549957275, "epoch": 5.594825909356157, "grad_norm": 1.4140625, "learning_rate": 0.00023557680693304435, "loss": 4.867, "mean_token_accuracy": 0.2206057369709015, "num_tokens": 124734529.0, "step": 71910 }, { "entropy": 5.904497337341309, "epoch": 5.595214938727874, "grad_norm": 1.5390625, "learning_rate": 0.00023554952039533307, "loss": 4.9746, "mean_token_accuracy": 0.21208282560110092, "num_tokens": 124743034.0, "step": 71915 }, { "entropy": 5.847658157348633, "epoch": 5.595603968099591, "grad_norm": 1.3125, "learning_rate": 0.00023552223445622006, "loss": 4.9282, "mean_token_accuracy": 0.21852352023124694, "num_tokens": 124752138.0, "step": 71920 }, { "entropy": 5.896258211135864, "epoch": 5.595992997471309, "grad_norm": 1.4453125, "learning_rate": 0.00023549494911611924, "loss": 4.954, "mean_token_accuracy": 0.21962095499038697, "num_tokens": 124760757.0, "step": 71925 }, { "entropy": 5.881213521957397, "epoch": 5.596382026843027, "grad_norm": 1.484375, "learning_rate": 0.00023546766437544477, "loss": 4.9005, "mean_token_accuracy": 0.21265427768230438, "num_tokens": 124769558.0, "step": 71930 }, { "entropy": 5.880981349945069, "epoch": 5.596771056214744, "grad_norm": 1.6328125, "learning_rate": 0.00023544038023461057, "loss": 4.8123, "mean_token_accuracy": 0.22515979260206223, "num_tokens": 124777682.0, "step": 71935 }, { "entropy": 5.842745208740235, "epoch": 5.597160085586462, "grad_norm": 1.40625, "learning_rate": 0.0002354130966940306, "loss": 4.9374, "mean_token_accuracy": 0.21385494321584703, "num_tokens": 124786624.0, "step": 71940 }, { "entropy": 5.829004716873169, "epoch": 5.597549114958179, "grad_norm": 1.5546875, "learning_rate": 0.00023538581375411876, "loss": 4.8525, "mean_token_accuracy": 0.22054546624422072, "num_tokens": 124794948.0, "step": 71945 }, { "entropy": 5.844397687911988, "epoch": 5.597938144329897, "grad_norm": 1.5078125, "learning_rate": 0.00023535853141528923, "loss": 4.9184, "mean_token_accuracy": 0.21097736954689025, "num_tokens": 124803628.0, "step": 71950 }, { "entropy": 5.877474689483643, "epoch": 5.598327173701614, "grad_norm": 1.4921875, "learning_rate": 0.00023533124967795594, "loss": 4.8929, "mean_token_accuracy": 0.2235736832022667, "num_tokens": 124812594.0, "step": 71955 }, { "entropy": 5.7657074451446535, "epoch": 5.598716203073332, "grad_norm": 1.3828125, "learning_rate": 0.00023530396854253276, "loss": 4.8764, "mean_token_accuracy": 0.2240551680326462, "num_tokens": 124821823.0, "step": 71960 }, { "entropy": 5.8217638492584225, "epoch": 5.59910523244505, "grad_norm": 1.6015625, "learning_rate": 0.00023527668800943374, "loss": 4.8441, "mean_token_accuracy": 0.2220994785428047, "num_tokens": 124830068.0, "step": 71965 }, { "entropy": 5.953456783294678, "epoch": 5.599494261816767, "grad_norm": 1.578125, "learning_rate": 0.0002352494080790727, "loss": 5.0241, "mean_token_accuracy": 0.20699155628681182, "num_tokens": 124837846.0, "step": 71970 }, { "entropy": 5.911177444458008, "epoch": 5.599883291188485, "grad_norm": 1.4609375, "learning_rate": 0.0002352221287518636, "loss": 4.9669, "mean_token_accuracy": 0.21448818147182463, "num_tokens": 124846820.0, "step": 71975 }, { "entropy": 5.824293613433838, "epoch": 5.600272320560203, "grad_norm": 1.4765625, "learning_rate": 0.00023519485002822038, "loss": 4.855, "mean_token_accuracy": 0.22541943788528443, "num_tokens": 124855785.0, "step": 71980 }, { "entropy": 5.919091129302979, "epoch": 5.6006613499319196, "grad_norm": 1.546875, "learning_rate": 0.00023516757190855705, "loss": 5.017, "mean_token_accuracy": 0.21589028388261794, "num_tokens": 124863550.0, "step": 71985 }, { "entropy": 5.910682535171508, "epoch": 5.601050379303637, "grad_norm": 1.390625, "learning_rate": 0.00023514029439328734, "loss": 4.9265, "mean_token_accuracy": 0.22280191034078597, "num_tokens": 124872546.0, "step": 71990 }, { "entropy": 5.922741317749024, "epoch": 5.601439408675355, "grad_norm": 1.5390625, "learning_rate": 0.0002351130174828252, "loss": 4.9323, "mean_token_accuracy": 0.21954950094223022, "num_tokens": 124881343.0, "step": 71995 }, { "entropy": 5.903824377059936, "epoch": 5.601828438047073, "grad_norm": 1.6796875, "learning_rate": 0.00023508574117758453, "loss": 4.9763, "mean_token_accuracy": 0.2081823006272316, "num_tokens": 124889650.0, "step": 72000 }, { "epoch": 5.601828438047073, "eval_entropy": 5.545164722703304, "eval_loss": 5.028749942779541, "eval_mean_token_accuracy": 0.22333821078638713, "eval_num_tokens": 124889650.0, "eval_runtime": 21.6767, "eval_samples_per_second": 1917.177, "eval_steps_per_second": 239.659, "step": 72000 } ], "logging_steps": 5, "max_steps": 128520, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.514688695493632e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }